{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 4.201361602801011, "eval_steps": 3000, "global_step": 54000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 7.525209426879883, "epoch": 0.00038902937171756465, "grad_norm": 1.1640625, "learning_rate": 2e-06, "loss": 7.1164, "mean_token_accuracy": 0.09126382395625114, "num_tokens": 8095.0, "step": 5 }, { "entropy": 7.524957656860352, "epoch": 0.0007780587434351293, "grad_norm": 1.046875, "learning_rate": 4.5e-06, "loss": 7.1341, "mean_token_accuracy": 0.09478832259774209, "num_tokens": 17329.0, "step": 10 }, { "entropy": 7.446990966796875, "epoch": 0.001167088115152694, "grad_norm": 1.1171875, "learning_rate": 7e-06, "loss": 6.9396, "mean_token_accuracy": 0.09858316257596016, "num_tokens": 25729.0, "step": 15 }, { "entropy": 7.479873752593994, "epoch": 0.0015561174868702586, "grad_norm": 1.1328125, "learning_rate": 9.5e-06, "loss": 7.0656, "mean_token_accuracy": 0.10022840201854706, "num_tokens": 33980.0, "step": 20 }, { "entropy": 7.4935675144195555, "epoch": 0.0019451468585878235, "grad_norm": 1.171875, "learning_rate": 1.2e-05, "loss": 6.9001, "mean_token_accuracy": 0.10436431169509888, "num_tokens": 41675.0, "step": 25 }, { "entropy": 7.4462706565856935, "epoch": 0.002334176230305388, "grad_norm": 1.0859375, "learning_rate": 1.4500000000000002e-05, "loss": 6.9849, "mean_token_accuracy": 0.09949584901332856, "num_tokens": 50277.0, "step": 30 }, { "entropy": 7.490463447570801, "epoch": 0.0027232056020229526, "grad_norm": 1.1484375, "learning_rate": 1.7000000000000003e-05, "loss": 7.0679, "mean_token_accuracy": 0.09498238340020179, "num_tokens": 58790.0, "step": 35 }, { "entropy": 7.469117593765259, "epoch": 0.0031122349737405172, "grad_norm": 1.078125, "learning_rate": 1.95e-05, "loss": 7.1151, "mean_token_accuracy": 0.09345170259475707, "num_tokens": 67247.0, "step": 40 }, { "entropy": 7.437713384628296, "epoch": 0.003501264345458082, "grad_norm": 1.1328125, "learning_rate": 2.2e-05, "loss": 6.9327, "mean_token_accuracy": 0.09667690098285675, "num_tokens": 75174.0, "step": 45 }, { "entropy": 7.389952373504639, "epoch": 0.003890293717175647, "grad_norm": 1.0625, "learning_rate": 2.4500000000000003e-05, "loss": 6.9055, "mean_token_accuracy": 0.10531265288591385, "num_tokens": 83203.0, "step": 50 }, { "entropy": 7.395076322555542, "epoch": 0.004279323088893211, "grad_norm": 0.98046875, "learning_rate": 2.7e-05, "loss": 6.9499, "mean_token_accuracy": 0.10203081965446473, "num_tokens": 91798.0, "step": 55 }, { "entropy": 7.40048041343689, "epoch": 0.004668352460610776, "grad_norm": 0.96875, "learning_rate": 2.95e-05, "loss": 6.9907, "mean_token_accuracy": 0.09655389487743378, "num_tokens": 100869.0, "step": 60 }, { "entropy": 7.454555511474609, "epoch": 0.0050573818323283405, "grad_norm": 1.03125, "learning_rate": 3.2e-05, "loss": 6.9875, "mean_token_accuracy": 0.09880984500050545, "num_tokens": 109697.0, "step": 65 }, { "entropy": 7.498321151733398, "epoch": 0.005446411204045905, "grad_norm": 1.078125, "learning_rate": 3.4500000000000005e-05, "loss": 7.1231, "mean_token_accuracy": 0.09559949561953544, "num_tokens": 118656.0, "step": 70 }, { "entropy": 7.496587228775025, "epoch": 0.00583544057576347, "grad_norm": 1.03125, "learning_rate": 3.7e-05, "loss": 7.1172, "mean_token_accuracy": 0.09125430211424827, "num_tokens": 127748.0, "step": 75 }, { "entropy": 7.504852151870727, "epoch": 0.0062244699474810344, "grad_norm": 1.1015625, "learning_rate": 3.95e-05, "loss": 7.0387, "mean_token_accuracy": 0.1014796257019043, "num_tokens": 136621.0, "step": 80 }, { "entropy": 7.48614993095398, "epoch": 0.006613499319198599, "grad_norm": 1.1171875, "learning_rate": 4.2000000000000004e-05, "loss": 6.9412, "mean_token_accuracy": 0.102222141623497, "num_tokens": 145793.0, "step": 85 }, { "entropy": 7.3585365295410154, "epoch": 0.007002528690916164, "grad_norm": 1.0078125, "learning_rate": 4.45e-05, "loss": 6.8998, "mean_token_accuracy": 0.09987122416496277, "num_tokens": 154466.0, "step": 90 }, { "entropy": 7.381277418136596, "epoch": 0.007391558062633729, "grad_norm": 1.03125, "learning_rate": 4.7000000000000004e-05, "loss": 7.0817, "mean_token_accuracy": 0.09664711579680443, "num_tokens": 163297.0, "step": 95 }, { "entropy": 7.4567954540252686, "epoch": 0.007780587434351294, "grad_norm": 1.0703125, "learning_rate": 4.9500000000000004e-05, "loss": 6.9582, "mean_token_accuracy": 0.0995919868350029, "num_tokens": 171747.0, "step": 100 }, { "entropy": 7.461597013473511, "epoch": 0.008169616806068859, "grad_norm": 1.0390625, "learning_rate": 5.2e-05, "loss": 6.9737, "mean_token_accuracy": 0.09625533521175385, "num_tokens": 180499.0, "step": 105 }, { "entropy": 7.4339855194091795, "epoch": 0.008558646177786422, "grad_norm": 1.0703125, "learning_rate": 5.45e-05, "loss": 6.9069, "mean_token_accuracy": 0.10029028877615928, "num_tokens": 189227.0, "step": 110 }, { "entropy": 7.355867671966553, "epoch": 0.008947675549503988, "grad_norm": 0.98046875, "learning_rate": 5.7e-05, "loss": 6.986, "mean_token_accuracy": 0.10084915980696678, "num_tokens": 198388.0, "step": 115 }, { "entropy": 7.4226056098937985, "epoch": 0.009336704921221552, "grad_norm": 1.015625, "learning_rate": 5.9499999999999996e-05, "loss": 6.9883, "mean_token_accuracy": 0.10193781480193138, "num_tokens": 206854.0, "step": 120 }, { "entropy": 7.44698486328125, "epoch": 0.009725734292939117, "grad_norm": 1.109375, "learning_rate": 6.2e-05, "loss": 6.9597, "mean_token_accuracy": 0.10039241313934326, "num_tokens": 215506.0, "step": 125 }, { "entropy": 7.457604932785034, "epoch": 0.010114763664656681, "grad_norm": 1.1015625, "learning_rate": 6.450000000000001e-05, "loss": 6.9474, "mean_token_accuracy": 0.09563101530075073, "num_tokens": 223717.0, "step": 130 }, { "entropy": 7.4058609962463375, "epoch": 0.010503793036374246, "grad_norm": 0.9921875, "learning_rate": 6.7e-05, "loss": 6.9154, "mean_token_accuracy": 0.10078920200467109, "num_tokens": 232480.0, "step": 135 }, { "entropy": 7.396328163146973, "epoch": 0.01089282240809181, "grad_norm": 1.125, "learning_rate": 6.950000000000001e-05, "loss": 6.9653, "mean_token_accuracy": 0.10731882452964783, "num_tokens": 241350.0, "step": 140 }, { "entropy": 7.449981260299682, "epoch": 0.011281851779809376, "grad_norm": 1.1796875, "learning_rate": 7.2e-05, "loss": 6.9697, "mean_token_accuracy": 0.10272065401077271, "num_tokens": 250610.0, "step": 145 }, { "entropy": 7.4221306324005125, "epoch": 0.01167088115152694, "grad_norm": 1.0390625, "learning_rate": 7.45e-05, "loss": 6.9118, "mean_token_accuracy": 0.10345016792416573, "num_tokens": 259672.0, "step": 150 }, { "entropy": 7.369914913177491, "epoch": 0.012059910523244505, "grad_norm": 1.140625, "learning_rate": 7.7e-05, "loss": 6.9904, "mean_token_accuracy": 0.09594599083065987, "num_tokens": 267826.0, "step": 155 }, { "entropy": 7.477785062789917, "epoch": 0.012448939894962069, "grad_norm": 1.1328125, "learning_rate": 7.950000000000001e-05, "loss": 6.995, "mean_token_accuracy": 0.09624672085046768, "num_tokens": 277324.0, "step": 160 }, { "entropy": 7.4215576171875, "epoch": 0.012837969266679634, "grad_norm": 1.171875, "learning_rate": 8.2e-05, "loss": 6.8296, "mean_token_accuracy": 0.10975822508335113, "num_tokens": 285482.0, "step": 165 }, { "entropy": 7.35403299331665, "epoch": 0.013226998638397198, "grad_norm": 1.234375, "learning_rate": 8.450000000000001e-05, "loss": 6.893, "mean_token_accuracy": 0.10332747399806977, "num_tokens": 293684.0, "step": 170 }, { "entropy": 7.344775819778443, "epoch": 0.013616028010114764, "grad_norm": 1.078125, "learning_rate": 8.7e-05, "loss": 6.8705, "mean_token_accuracy": 0.10466427579522133, "num_tokens": 302605.0, "step": 175 }, { "entropy": 7.469928503036499, "epoch": 0.014005057381832327, "grad_norm": 1.1015625, "learning_rate": 8.95e-05, "loss": 6.9479, "mean_token_accuracy": 0.10224307030439377, "num_tokens": 310849.0, "step": 180 }, { "entropy": 7.377802467346191, "epoch": 0.014394086753549893, "grad_norm": 1.1015625, "learning_rate": 9.2e-05, "loss": 6.9647, "mean_token_accuracy": 0.09813596233725548, "num_tokens": 319752.0, "step": 185 }, { "entropy": 7.5093926906585695, "epoch": 0.014783116125267459, "grad_norm": 1.296875, "learning_rate": 9.45e-05, "loss": 7.0233, "mean_token_accuracy": 0.09324661493301392, "num_tokens": 328009.0, "step": 190 }, { "entropy": 7.352363014221192, "epoch": 0.015172145496985022, "grad_norm": 1.109375, "learning_rate": 9.7e-05, "loss": 6.909, "mean_token_accuracy": 0.10263535231351853, "num_tokens": 337414.0, "step": 195 }, { "entropy": 7.411336231231689, "epoch": 0.015561174868702588, "grad_norm": 1.15625, "learning_rate": 9.95e-05, "loss": 6.9275, "mean_token_accuracy": 0.10379069447517394, "num_tokens": 345419.0, "step": 200 }, { "entropy": 7.4287652492523195, "epoch": 0.01595020424042015, "grad_norm": 1.203125, "learning_rate": 0.000102, "loss": 6.9079, "mean_token_accuracy": 0.10015243589878083, "num_tokens": 353435.0, "step": 205 }, { "entropy": 7.346658992767334, "epoch": 0.016339233612137717, "grad_norm": 1.0859375, "learning_rate": 0.00010449999999999999, "loss": 6.9221, "mean_token_accuracy": 0.1055522657930851, "num_tokens": 361840.0, "step": 210 }, { "entropy": 7.52528715133667, "epoch": 0.016728262983855283, "grad_norm": 1.1484375, "learning_rate": 0.000107, "loss": 7.0276, "mean_token_accuracy": 0.09967184960842132, "num_tokens": 370873.0, "step": 215 }, { "entropy": 7.3679437160491945, "epoch": 0.017117292355572845, "grad_norm": 1.1953125, "learning_rate": 0.0001095, "loss": 6.9343, "mean_token_accuracy": 0.09932355582714081, "num_tokens": 379558.0, "step": 220 }, { "entropy": 7.469588994979858, "epoch": 0.01750632172729041, "grad_norm": 1.234375, "learning_rate": 0.000112, "loss": 6.9429, "mean_token_accuracy": 0.10046415254473687, "num_tokens": 387870.0, "step": 225 }, { "entropy": 7.386438465118408, "epoch": 0.017895351099007976, "grad_norm": 1.2265625, "learning_rate": 0.0001145, "loss": 7.0274, "mean_token_accuracy": 0.10568641722202302, "num_tokens": 396442.0, "step": 230 }, { "entropy": 7.447541284561157, "epoch": 0.01828438047072554, "grad_norm": 1.21875, "learning_rate": 0.00011700000000000001, "loss": 6.9675, "mean_token_accuracy": 0.10170508250594139, "num_tokens": 404764.0, "step": 235 }, { "entropy": 7.413917064666748, "epoch": 0.018673409842443103, "grad_norm": 1.203125, "learning_rate": 0.00011949999999999999, "loss": 6.9034, "mean_token_accuracy": 0.10267666056752205, "num_tokens": 413355.0, "step": 240 }, { "entropy": 7.331215286254883, "epoch": 0.01906243921416067, "grad_norm": 1.1484375, "learning_rate": 0.000122, "loss": 6.8107, "mean_token_accuracy": 0.10804717987775803, "num_tokens": 421868.0, "step": 245 }, { "entropy": 7.342196226119995, "epoch": 0.019451468585878234, "grad_norm": 1.1015625, "learning_rate": 0.0001245, "loss": 6.8674, "mean_token_accuracy": 0.10438908636569977, "num_tokens": 431106.0, "step": 250 }, { "entropy": 7.457882690429687, "epoch": 0.0198404979575958, "grad_norm": 1.28125, "learning_rate": 0.000127, "loss": 7.0068, "mean_token_accuracy": 0.09497510865330697, "num_tokens": 439459.0, "step": 255 }, { "entropy": 7.371812105178833, "epoch": 0.020229527329313362, "grad_norm": 1.234375, "learning_rate": 0.0001295, "loss": 6.8334, "mean_token_accuracy": 0.10420059189200401, "num_tokens": 447943.0, "step": 260 }, { "entropy": 7.375357580184937, "epoch": 0.020618556701030927, "grad_norm": 1.2578125, "learning_rate": 0.000132, "loss": 6.9826, "mean_token_accuracy": 0.09710169360041618, "num_tokens": 456691.0, "step": 265 }, { "entropy": 7.364774465560913, "epoch": 0.021007586072748493, "grad_norm": 1.2890625, "learning_rate": 0.00013450000000000002, "loss": 6.8583, "mean_token_accuracy": 0.10362368077039719, "num_tokens": 466388.0, "step": 270 }, { "entropy": 7.392491149902344, "epoch": 0.02139661544446606, "grad_norm": 1.171875, "learning_rate": 0.00013700000000000002, "loss": 6.9669, "mean_token_accuracy": 0.10099864155054092, "num_tokens": 474544.0, "step": 275 }, { "entropy": 7.414118957519531, "epoch": 0.02178564481618362, "grad_norm": 1.171875, "learning_rate": 0.0001395, "loss": 6.9797, "mean_token_accuracy": 0.10356927365064621, "num_tokens": 483561.0, "step": 280 }, { "entropy": 7.296314764022827, "epoch": 0.022174674187901186, "grad_norm": 1.1953125, "learning_rate": 0.00014199999999999998, "loss": 6.8018, "mean_token_accuracy": 0.10049450471997261, "num_tokens": 492036.0, "step": 285 }, { "entropy": 7.479441213607788, "epoch": 0.02256370355961875, "grad_norm": 1.1875, "learning_rate": 0.0001445, "loss": 6.9413, "mean_token_accuracy": 0.10272752419114113, "num_tokens": 500978.0, "step": 290 }, { "entropy": 7.315587186813355, "epoch": 0.022952732931336317, "grad_norm": 1.1796875, "learning_rate": 0.000147, "loss": 6.9848, "mean_token_accuracy": 0.10035317316651345, "num_tokens": 509719.0, "step": 295 }, { "entropy": 7.50186858177185, "epoch": 0.02334176230305388, "grad_norm": 1.1640625, "learning_rate": 0.0001495, "loss": 6.8866, "mean_token_accuracy": 0.1016937792301178, "num_tokens": 518422.0, "step": 300 }, { "entropy": 7.289468431472779, "epoch": 0.023730791674771445, "grad_norm": 1.2734375, "learning_rate": 0.000152, "loss": 6.9335, "mean_token_accuracy": 0.09595205262303352, "num_tokens": 527172.0, "step": 305 }, { "entropy": 7.423691844940185, "epoch": 0.02411982104648901, "grad_norm": 1.171875, "learning_rate": 0.00015450000000000001, "loss": 6.8618, "mean_token_accuracy": 0.10495315194129944, "num_tokens": 536070.0, "step": 310 }, { "entropy": 7.324627017974853, "epoch": 0.024508850418206576, "grad_norm": 1.265625, "learning_rate": 0.000157, "loss": 6.8709, "mean_token_accuracy": 0.10348411202430725, "num_tokens": 544556.0, "step": 315 }, { "entropy": 7.411664628982544, "epoch": 0.024897879789924138, "grad_norm": 1.203125, "learning_rate": 0.0001595, "loss": 6.8337, "mean_token_accuracy": 0.10683412104845047, "num_tokens": 553122.0, "step": 320 }, { "entropy": 7.352542924880981, "epoch": 0.025286909161641703, "grad_norm": 1.0546875, "learning_rate": 0.000162, "loss": 6.9213, "mean_token_accuracy": 0.09781907498836517, "num_tokens": 562265.0, "step": 325 }, { "entropy": 7.3105535984039305, "epoch": 0.02567593853335927, "grad_norm": 1.1015625, "learning_rate": 0.00016450000000000001, "loss": 6.8794, "mean_token_accuracy": 0.1058124616742134, "num_tokens": 570938.0, "step": 330 }, { "entropy": 7.363333702087402, "epoch": 0.026064967905076834, "grad_norm": 1.203125, "learning_rate": 0.00016700000000000002, "loss": 6.8159, "mean_token_accuracy": 0.10493286699056625, "num_tokens": 578568.0, "step": 335 }, { "entropy": 7.4085417747497555, "epoch": 0.026453997276794396, "grad_norm": 1.3828125, "learning_rate": 0.00016950000000000003, "loss": 6.8823, "mean_token_accuracy": 0.10770140811800957, "num_tokens": 587013.0, "step": 340 }, { "entropy": 7.380347776412964, "epoch": 0.026843026648511962, "grad_norm": 1.1953125, "learning_rate": 0.00017199999999999998, "loss": 6.9395, "mean_token_accuracy": 0.10302414670586586, "num_tokens": 595354.0, "step": 345 }, { "entropy": 7.401273250579834, "epoch": 0.027232056020229527, "grad_norm": 1.1875, "learning_rate": 0.00017449999999999999, "loss": 6.9143, "mean_token_accuracy": 0.09726170152425766, "num_tokens": 603971.0, "step": 350 }, { "entropy": 7.264584875106811, "epoch": 0.027621085391947093, "grad_norm": 1.109375, "learning_rate": 0.000177, "loss": 6.8246, "mean_token_accuracy": 0.10611001029610634, "num_tokens": 612097.0, "step": 355 }, { "entropy": 7.374355459213257, "epoch": 0.028010114763664655, "grad_norm": 1.1484375, "learning_rate": 0.0001795, "loss": 6.8914, "mean_token_accuracy": 0.1076267570257187, "num_tokens": 621445.0, "step": 360 }, { "entropy": 7.367084646224976, "epoch": 0.02839914413538222, "grad_norm": 1.2109375, "learning_rate": 0.000182, "loss": 6.9642, "mean_token_accuracy": 0.10026197507977486, "num_tokens": 630041.0, "step": 365 }, { "entropy": 7.286877632141113, "epoch": 0.028788173507099786, "grad_norm": 1.234375, "learning_rate": 0.0001845, "loss": 6.793, "mean_token_accuracy": 0.10361501201987267, "num_tokens": 638317.0, "step": 370 }, { "entropy": 7.358971881866455, "epoch": 0.02917720287881735, "grad_norm": 1.2578125, "learning_rate": 0.000187, "loss": 6.9153, "mean_token_accuracy": 0.10330267027020454, "num_tokens": 647297.0, "step": 375 }, { "entropy": 7.467724800109863, "epoch": 0.029566232250534917, "grad_norm": 1.265625, "learning_rate": 0.0001895, "loss": 6.9596, "mean_token_accuracy": 0.10418846607208251, "num_tokens": 655309.0, "step": 380 }, { "entropy": 7.318552494049072, "epoch": 0.02995526162225248, "grad_norm": 1.203125, "learning_rate": 0.000192, "loss": 6.8423, "mean_token_accuracy": 0.09740504622459412, "num_tokens": 663879.0, "step": 385 }, { "entropy": 7.267914342880249, "epoch": 0.030344290993970045, "grad_norm": 1.34375, "learning_rate": 0.0001945, "loss": 6.7288, "mean_token_accuracy": 0.10926953107118606, "num_tokens": 672913.0, "step": 390 }, { "entropy": 7.249853038787842, "epoch": 0.03073332036568761, "grad_norm": 1.3203125, "learning_rate": 0.00019700000000000002, "loss": 6.8682, "mean_token_accuracy": 0.10577411428093911, "num_tokens": 682282.0, "step": 395 }, { "entropy": 7.347216081619263, "epoch": 0.031122349737405176, "grad_norm": 1.125, "learning_rate": 0.00019950000000000002, "loss": 6.8777, "mean_token_accuracy": 0.10061730667948723, "num_tokens": 691432.0, "step": 400 }, { "entropy": 7.2628637790679935, "epoch": 0.03151137910912274, "grad_norm": 1.28125, "learning_rate": 0.000202, "loss": 6.8792, "mean_token_accuracy": 0.10118450745940208, "num_tokens": 700639.0, "step": 405 }, { "entropy": 7.387156391143799, "epoch": 0.0319004084808403, "grad_norm": 1.3046875, "learning_rate": 0.00020449999999999998, "loss": 6.946, "mean_token_accuracy": 0.0988673098385334, "num_tokens": 709200.0, "step": 410 }, { "entropy": 7.180784082412719, "epoch": 0.03228943785255787, "grad_norm": 1.171875, "learning_rate": 0.000207, "loss": 6.7769, "mean_token_accuracy": 0.10579730719327926, "num_tokens": 717266.0, "step": 415 }, { "entropy": 7.3383214473724365, "epoch": 0.032678467224275434, "grad_norm": 1.1328125, "learning_rate": 0.0002095, "loss": 6.7761, "mean_token_accuracy": 0.10209827125072479, "num_tokens": 725799.0, "step": 420 }, { "entropy": 7.2920979976654055, "epoch": 0.033067496595993, "grad_norm": 1.328125, "learning_rate": 0.000212, "loss": 6.9062, "mean_token_accuracy": 0.10427533909678459, "num_tokens": 734375.0, "step": 425 }, { "entropy": 7.3845654964447025, "epoch": 0.033456525967710565, "grad_norm": 1.2109375, "learning_rate": 0.0002145, "loss": 6.9307, "mean_token_accuracy": 0.10116986557841301, "num_tokens": 743453.0, "step": 430 }, { "entropy": 7.256317663192749, "epoch": 0.033845555339428124, "grad_norm": 1.0859375, "learning_rate": 0.00021700000000000002, "loss": 6.7835, "mean_token_accuracy": 0.1099538803100586, "num_tokens": 752443.0, "step": 435 }, { "entropy": 7.239885091781616, "epoch": 0.03423458471114569, "grad_norm": 1.25, "learning_rate": 0.0002195, "loss": 6.7755, "mean_token_accuracy": 0.103090950101614, "num_tokens": 761294.0, "step": 440 }, { "entropy": 7.315788888931275, "epoch": 0.034623614082863255, "grad_norm": 1.1953125, "learning_rate": 0.000222, "loss": 6.7633, "mean_token_accuracy": 0.10775340422987938, "num_tokens": 769489.0, "step": 445 }, { "entropy": 7.27491250038147, "epoch": 0.03501264345458082, "grad_norm": 1.234375, "learning_rate": 0.0002245, "loss": 6.8251, "mean_token_accuracy": 0.1056965485215187, "num_tokens": 777836.0, "step": 450 }, { "entropy": 7.317339181900024, "epoch": 0.035401672826298386, "grad_norm": 1.25, "learning_rate": 0.00022700000000000002, "loss": 6.8512, "mean_token_accuracy": 0.09845920503139496, "num_tokens": 786543.0, "step": 455 }, { "entropy": 7.298014497756958, "epoch": 0.03579070219801595, "grad_norm": 1.2890625, "learning_rate": 0.00022950000000000002, "loss": 6.9104, "mean_token_accuracy": 0.10431987568736076, "num_tokens": 794525.0, "step": 460 }, { "entropy": 7.248893308639526, "epoch": 0.03617973156973352, "grad_norm": 1.2734375, "learning_rate": 0.00023200000000000003, "loss": 6.8222, "mean_token_accuracy": 0.1065070852637291, "num_tokens": 803537.0, "step": 465 }, { "entropy": 7.270473957061768, "epoch": 0.03656876094145108, "grad_norm": 1.15625, "learning_rate": 0.00023449999999999998, "loss": 6.7685, "mean_token_accuracy": 0.10664488673210144, "num_tokens": 811706.0, "step": 470 }, { "entropy": 7.247415494918823, "epoch": 0.03695779031316864, "grad_norm": 1.15625, "learning_rate": 0.000237, "loss": 6.8359, "mean_token_accuracy": 0.10338398665189744, "num_tokens": 820182.0, "step": 475 }, { "entropy": 7.244891786575318, "epoch": 0.03734681968488621, "grad_norm": 1.078125, "learning_rate": 0.0002395, "loss": 6.7711, "mean_token_accuracy": 0.10853901281952857, "num_tokens": 829808.0, "step": 480 }, { "entropy": 7.287813949584961, "epoch": 0.03773584905660377, "grad_norm": 1.1484375, "learning_rate": 0.000242, "loss": 6.721, "mean_token_accuracy": 0.10383491292595863, "num_tokens": 838838.0, "step": 485 }, { "entropy": 7.207957983016968, "epoch": 0.03812487842832134, "grad_norm": 1.28125, "learning_rate": 0.0002445, "loss": 6.8069, "mean_token_accuracy": 0.1081025905907154, "num_tokens": 847800.0, "step": 490 }, { "entropy": 7.361988687515259, "epoch": 0.0385139078000389, "grad_norm": 1.21875, "learning_rate": 0.000247, "loss": 6.9005, "mean_token_accuracy": 0.10296034291386605, "num_tokens": 856503.0, "step": 495 }, { "entropy": 7.193755149841309, "epoch": 0.03890293717175647, "grad_norm": 1.375, "learning_rate": 0.0002495, "loss": 6.7864, "mean_token_accuracy": 0.10174561962485314, "num_tokens": 865245.0, "step": 500 }, { "entropy": 7.283534049987793, "epoch": 0.039291966543474034, "grad_norm": 1.2109375, "learning_rate": 0.000252, "loss": 6.8082, "mean_token_accuracy": 0.10216192156076431, "num_tokens": 874485.0, "step": 505 }, { "entropy": 7.117496156692505, "epoch": 0.0396809959151916, "grad_norm": 1.3671875, "learning_rate": 0.0002545, "loss": 6.6771, "mean_token_accuracy": 0.11026940196752548, "num_tokens": 883301.0, "step": 510 }, { "entropy": 7.131668567657471, "epoch": 0.04007002528690916, "grad_norm": 1.1796875, "learning_rate": 0.000257, "loss": 6.7448, "mean_token_accuracy": 0.10374188125133514, "num_tokens": 892387.0, "step": 515 }, { "entropy": 7.24387755393982, "epoch": 0.040459054658626724, "grad_norm": 1.1015625, "learning_rate": 0.0002595, "loss": 6.732, "mean_token_accuracy": 0.11151306107640266, "num_tokens": 901522.0, "step": 520 }, { "entropy": 7.128845930099487, "epoch": 0.04084808403034429, "grad_norm": 1.1875, "learning_rate": 0.000262, "loss": 6.6974, "mean_token_accuracy": 0.10741285160183907, "num_tokens": 909848.0, "step": 525 }, { "entropy": 7.312799263000488, "epoch": 0.041237113402061855, "grad_norm": 1.1640625, "learning_rate": 0.00026450000000000003, "loss": 6.9168, "mean_token_accuracy": 0.1004093937575817, "num_tokens": 919079.0, "step": 530 }, { "entropy": 7.166108179092407, "epoch": 0.04162614277377942, "grad_norm": 1.34375, "learning_rate": 0.00026700000000000004, "loss": 6.6571, "mean_token_accuracy": 0.1108947217464447, "num_tokens": 927807.0, "step": 535 }, { "entropy": 7.130585718154907, "epoch": 0.042015172145496986, "grad_norm": 1.3046875, "learning_rate": 0.00026950000000000005, "loss": 6.7716, "mean_token_accuracy": 0.10743746683001518, "num_tokens": 936498.0, "step": 540 }, { "entropy": 7.2852715969085695, "epoch": 0.04240420151721455, "grad_norm": 1.1015625, "learning_rate": 0.00027200000000000005, "loss": 6.8486, "mean_token_accuracy": 0.1115134410560131, "num_tokens": 945436.0, "step": 545 }, { "entropy": 7.238163709640503, "epoch": 0.04279323088893212, "grad_norm": 1.1796875, "learning_rate": 0.0002745, "loss": 6.76, "mean_token_accuracy": 0.10598877593874931, "num_tokens": 953990.0, "step": 550 }, { "entropy": 7.096475458145141, "epoch": 0.04318226026064968, "grad_norm": 1.296875, "learning_rate": 0.000277, "loss": 6.6979, "mean_token_accuracy": 0.10942429900169373, "num_tokens": 962008.0, "step": 555 }, { "entropy": 7.238119173049927, "epoch": 0.04357128963236724, "grad_norm": 1.171875, "learning_rate": 0.0002795, "loss": 6.8697, "mean_token_accuracy": 0.10453333854675292, "num_tokens": 970935.0, "step": 560 }, { "entropy": 7.282825183868408, "epoch": 0.04396031900408481, "grad_norm": 1.1953125, "learning_rate": 0.00028199999999999997, "loss": 6.8089, "mean_token_accuracy": 0.09897146746516228, "num_tokens": 979492.0, "step": 565 }, { "entropy": 7.173346710205078, "epoch": 0.04434934837580237, "grad_norm": 1.234375, "learning_rate": 0.0002845, "loss": 6.725, "mean_token_accuracy": 0.1077153742313385, "num_tokens": 987866.0, "step": 570 }, { "entropy": 7.165633726119995, "epoch": 0.04473837774751994, "grad_norm": 1.0625, "learning_rate": 0.000287, "loss": 6.7609, "mean_token_accuracy": 0.11032681092619896, "num_tokens": 996760.0, "step": 575 }, { "entropy": 7.229097557067871, "epoch": 0.0451274071192375, "grad_norm": 1.234375, "learning_rate": 0.0002895, "loss": 6.6913, "mean_token_accuracy": 0.10864157006144523, "num_tokens": 1005432.0, "step": 580 }, { "entropy": 7.137337875366211, "epoch": 0.04551643649095507, "grad_norm": 1.2890625, "learning_rate": 0.000292, "loss": 6.7743, "mean_token_accuracy": 0.10533035397529603, "num_tokens": 1013729.0, "step": 585 }, { "entropy": 7.049478149414062, "epoch": 0.045905465862672634, "grad_norm": 1.1484375, "learning_rate": 0.0002945, "loss": 6.6116, "mean_token_accuracy": 0.11751440018415452, "num_tokens": 1022485.0, "step": 590 }, { "entropy": 7.1416089057922365, "epoch": 0.0462944952343902, "grad_norm": 1.328125, "learning_rate": 0.000297, "loss": 6.6885, "mean_token_accuracy": 0.10569961667060852, "num_tokens": 1030523.0, "step": 595 }, { "entropy": 7.179096317291259, "epoch": 0.04668352460610776, "grad_norm": 1.1953125, "learning_rate": 0.0002995, "loss": 6.7869, "mean_token_accuracy": 0.10787507370114327, "num_tokens": 1039268.0, "step": 600 }, { "entropy": 7.120957326889038, "epoch": 0.047072553977825324, "grad_norm": 1.15625, "learning_rate": 0.000302, "loss": 6.684, "mean_token_accuracy": 0.10937019288539887, "num_tokens": 1048590.0, "step": 605 }, { "entropy": 7.0393298149108885, "epoch": 0.04746158334954289, "grad_norm": 1.1015625, "learning_rate": 0.0003045, "loss": 6.617, "mean_token_accuracy": 0.11176003962755203, "num_tokens": 1057232.0, "step": 610 }, { "entropy": 7.098176956176758, "epoch": 0.047850612721260455, "grad_norm": 1.2734375, "learning_rate": 0.000307, "loss": 6.6998, "mean_token_accuracy": 0.1081328421831131, "num_tokens": 1066404.0, "step": 615 }, { "entropy": 7.031232643127441, "epoch": 0.04823964209297802, "grad_norm": 1.3515625, "learning_rate": 0.0003095, "loss": 6.7638, "mean_token_accuracy": 0.10122817903757095, "num_tokens": 1075093.0, "step": 620 }, { "entropy": 7.155955123901367, "epoch": 0.048628671464695586, "grad_norm": 1.1875, "learning_rate": 0.000312, "loss": 6.667, "mean_token_accuracy": 0.10735566318035125, "num_tokens": 1084454.0, "step": 625 }, { "entropy": 7.108900642395019, "epoch": 0.04901770083641315, "grad_norm": 1.234375, "learning_rate": 0.0003145, "loss": 6.5969, "mean_token_accuracy": 0.10924701541662216, "num_tokens": 1093452.0, "step": 630 }, { "entropy": 7.034401082992554, "epoch": 0.04940673020813072, "grad_norm": 1.328125, "learning_rate": 0.000317, "loss": 6.6196, "mean_token_accuracy": 0.11470122635364532, "num_tokens": 1101814.0, "step": 635 }, { "entropy": 7.051713323593139, "epoch": 0.049795759579848276, "grad_norm": 1.25, "learning_rate": 0.0003195, "loss": 6.7, "mean_token_accuracy": 0.11058250665664673, "num_tokens": 1110386.0, "step": 640 }, { "entropy": 7.14307336807251, "epoch": 0.05018478895156584, "grad_norm": 1.265625, "learning_rate": 0.000322, "loss": 6.8031, "mean_token_accuracy": 0.10201985463500023, "num_tokens": 1120141.0, "step": 645 }, { "entropy": 7.1510227680206295, "epoch": 0.05057381832328341, "grad_norm": 1.15625, "learning_rate": 0.00032450000000000003, "loss": 6.7396, "mean_token_accuracy": 0.1102594219148159, "num_tokens": 1129920.0, "step": 650 }, { "entropy": 6.983091688156128, "epoch": 0.05096284769500097, "grad_norm": 1.3046875, "learning_rate": 0.00032700000000000003, "loss": 6.6196, "mean_token_accuracy": 0.11163505613803863, "num_tokens": 1138518.0, "step": 655 }, { "entropy": 7.117662715911865, "epoch": 0.05135187706671854, "grad_norm": 1.3828125, "learning_rate": 0.00032950000000000004, "loss": 6.7209, "mean_token_accuracy": 0.10830123797059059, "num_tokens": 1147113.0, "step": 660 }, { "entropy": 7.052978134155273, "epoch": 0.0517409064384361, "grad_norm": 1.390625, "learning_rate": 0.00033200000000000005, "loss": 6.5612, "mean_token_accuracy": 0.11946347504854202, "num_tokens": 1155886.0, "step": 665 }, { "entropy": 7.017060613632202, "epoch": 0.05212993581015367, "grad_norm": 1.2265625, "learning_rate": 0.00033450000000000005, "loss": 6.725, "mean_token_accuracy": 0.10746086090803146, "num_tokens": 1164200.0, "step": 670 }, { "entropy": 7.051968240737915, "epoch": 0.052518965181871234, "grad_norm": 1.1484375, "learning_rate": 0.000337, "loss": 6.5857, "mean_token_accuracy": 0.1125464141368866, "num_tokens": 1172720.0, "step": 675 }, { "entropy": 6.996215152740478, "epoch": 0.05290799455358879, "grad_norm": 1.15625, "learning_rate": 0.0003395, "loss": 6.5468, "mean_token_accuracy": 0.1077719546854496, "num_tokens": 1181225.0, "step": 680 }, { "entropy": 7.120228815078735, "epoch": 0.05329702392530636, "grad_norm": 1.203125, "learning_rate": 0.000342, "loss": 6.7546, "mean_token_accuracy": 0.10120292380452156, "num_tokens": 1190070.0, "step": 685 }, { "entropy": 7.013375902175904, "epoch": 0.053686053297023924, "grad_norm": 1.171875, "learning_rate": 0.00034449999999999997, "loss": 6.6267, "mean_token_accuracy": 0.11402207687497139, "num_tokens": 1198995.0, "step": 690 }, { "entropy": 7.120525217056274, "epoch": 0.05407508266874149, "grad_norm": 1.1796875, "learning_rate": 0.000347, "loss": 6.6744, "mean_token_accuracy": 0.11539597958326339, "num_tokens": 1207664.0, "step": 695 }, { "entropy": 7.102228593826294, "epoch": 0.054464112040459055, "grad_norm": 1.1875, "learning_rate": 0.0003495, "loss": 6.5789, "mean_token_accuracy": 0.12240418270230294, "num_tokens": 1216232.0, "step": 700 }, { "entropy": 6.950713348388672, "epoch": 0.05485314141217662, "grad_norm": 1.2421875, "learning_rate": 0.000352, "loss": 6.6748, "mean_token_accuracy": 0.11159612014889717, "num_tokens": 1224106.0, "step": 705 }, { "entropy": 6.960762357711792, "epoch": 0.055242170783894186, "grad_norm": 1.3046875, "learning_rate": 0.0003545, "loss": 6.5619, "mean_token_accuracy": 0.11645937711000443, "num_tokens": 1232514.0, "step": 710 }, { "entropy": 7.127431774139405, "epoch": 0.05563120015561175, "grad_norm": 1.3984375, "learning_rate": 0.000357, "loss": 6.6152, "mean_token_accuracy": 0.11127564162015915, "num_tokens": 1240178.0, "step": 715 }, { "entropy": 6.829823637008667, "epoch": 0.05602022952732931, "grad_norm": 1.2265625, "learning_rate": 0.0003595, "loss": 6.5236, "mean_token_accuracy": 0.11545735970139503, "num_tokens": 1248635.0, "step": 720 }, { "entropy": 7.094886350631714, "epoch": 0.056409258899046875, "grad_norm": 1.265625, "learning_rate": 0.000362, "loss": 6.6258, "mean_token_accuracy": 0.11595786064863205, "num_tokens": 1256389.0, "step": 725 }, { "entropy": 6.9064311504364015, "epoch": 0.05679828827076444, "grad_norm": 1.2109375, "learning_rate": 0.0003645, "loss": 6.5896, "mean_token_accuracy": 0.11666487753391266, "num_tokens": 1264035.0, "step": 730 }, { "entropy": 7.034950304031372, "epoch": 0.057187317642482006, "grad_norm": 1.25, "learning_rate": 0.000367, "loss": 6.5838, "mean_token_accuracy": 0.11167205199599266, "num_tokens": 1272941.0, "step": 735 }, { "entropy": 6.862753534317017, "epoch": 0.05757634701419957, "grad_norm": 1.2109375, "learning_rate": 0.0003695, "loss": 6.5714, "mean_token_accuracy": 0.11405754834413528, "num_tokens": 1281767.0, "step": 740 }, { "entropy": 7.123349332809449, "epoch": 0.05796537638591714, "grad_norm": 1.2265625, "learning_rate": 0.000372, "loss": 6.6469, "mean_token_accuracy": 0.11400221288204193, "num_tokens": 1290049.0, "step": 745 }, { "entropy": 6.815326452255249, "epoch": 0.0583544057576347, "grad_norm": 1.1640625, "learning_rate": 0.0003745, "loss": 6.4981, "mean_token_accuracy": 0.12375147640705109, "num_tokens": 1299032.0, "step": 750 }, { "entropy": 6.98442530632019, "epoch": 0.05874343512935227, "grad_norm": 1.2421875, "learning_rate": 0.000377, "loss": 6.7388, "mean_token_accuracy": 0.10899372920393943, "num_tokens": 1308508.0, "step": 755 }, { "entropy": 7.064965343475341, "epoch": 0.059132464501069834, "grad_norm": 1.1328125, "learning_rate": 0.0003795, "loss": 6.5673, "mean_token_accuracy": 0.1138399638235569, "num_tokens": 1317044.0, "step": 760 }, { "entropy": 7.0013751029968265, "epoch": 0.05952149387278739, "grad_norm": 1.171875, "learning_rate": 0.000382, "loss": 6.5988, "mean_token_accuracy": 0.11330810338258743, "num_tokens": 1325554.0, "step": 765 }, { "entropy": 6.8747217655181885, "epoch": 0.05991052324450496, "grad_norm": 1.1328125, "learning_rate": 0.0003845, "loss": 6.4944, "mean_token_accuracy": 0.11092947795987129, "num_tokens": 1334201.0, "step": 770 }, { "entropy": 6.932094430923462, "epoch": 0.060299552616222524, "grad_norm": 1.25, "learning_rate": 0.00038700000000000003, "loss": 6.5156, "mean_token_accuracy": 0.11926758959889412, "num_tokens": 1343061.0, "step": 775 }, { "entropy": 6.882827472686768, "epoch": 0.06068858198794009, "grad_norm": 1.1484375, "learning_rate": 0.00038950000000000003, "loss": 6.4792, "mean_token_accuracy": 0.12102379724383354, "num_tokens": 1352262.0, "step": 780 }, { "entropy": 6.8652026653289795, "epoch": 0.061077611359657655, "grad_norm": 1.2578125, "learning_rate": 0.00039200000000000004, "loss": 6.5417, "mean_token_accuracy": 0.11120004132390023, "num_tokens": 1361400.0, "step": 785 }, { "entropy": 6.9827672958374025, "epoch": 0.06146664073137522, "grad_norm": 1.265625, "learning_rate": 0.00039450000000000005, "loss": 6.6545, "mean_token_accuracy": 0.1084800124168396, "num_tokens": 1369850.0, "step": 790 }, { "entropy": 6.896434259414673, "epoch": 0.061855670103092786, "grad_norm": 1.2421875, "learning_rate": 0.00039700000000000005, "loss": 6.5041, "mean_token_accuracy": 0.11742325201630592, "num_tokens": 1378342.0, "step": 795 }, { "entropy": 6.971995687484741, "epoch": 0.06224469947481035, "grad_norm": 1.28125, "learning_rate": 0.0003995, "loss": 6.5897, "mean_token_accuracy": 0.109882403165102, "num_tokens": 1386981.0, "step": 800 }, { "entropy": 6.938254642486572, "epoch": 0.06263372884652792, "grad_norm": 1.1484375, "learning_rate": 0.000402, "loss": 6.6818, "mean_token_accuracy": 0.10729405432939529, "num_tokens": 1395801.0, "step": 805 }, { "entropy": 7.06087851524353, "epoch": 0.06302275821824548, "grad_norm": 1.203125, "learning_rate": 0.0004045, "loss": 6.5776, "mean_token_accuracy": 0.11447910293936729, "num_tokens": 1403715.0, "step": 810 }, { "entropy": 6.9617109298706055, "epoch": 0.06341178758996305, "grad_norm": 1.1484375, "learning_rate": 0.00040699999999999997, "loss": 6.6583, "mean_token_accuracy": 0.11031345576047898, "num_tokens": 1413199.0, "step": 815 }, { "entropy": 6.929412412643432, "epoch": 0.0638008169616806, "grad_norm": 1.1640625, "learning_rate": 0.0004095, "loss": 6.632, "mean_token_accuracy": 0.11478308364748954, "num_tokens": 1421918.0, "step": 820 }, { "entropy": 6.956843757629395, "epoch": 0.06418984633339817, "grad_norm": 1.15625, "learning_rate": 0.000412, "loss": 6.5245, "mean_token_accuracy": 0.11161991730332374, "num_tokens": 1430625.0, "step": 825 }, { "entropy": 6.826650476455688, "epoch": 0.06457887570511574, "grad_norm": 1.1640625, "learning_rate": 0.0004145, "loss": 6.562, "mean_token_accuracy": 0.11291277259588242, "num_tokens": 1439158.0, "step": 830 }, { "entropy": 6.870626020431518, "epoch": 0.0649679050768333, "grad_norm": 1.109375, "learning_rate": 0.000417, "loss": 6.527, "mean_token_accuracy": 0.11909559741616249, "num_tokens": 1448266.0, "step": 835 }, { "entropy": 6.925184917449951, "epoch": 0.06535693444855087, "grad_norm": 1.2109375, "learning_rate": 0.0004195, "loss": 6.6033, "mean_token_accuracy": 0.11738861948251725, "num_tokens": 1457322.0, "step": 840 }, { "entropy": 7.063237190246582, "epoch": 0.06574596382026843, "grad_norm": 1.1171875, "learning_rate": 0.000422, "loss": 6.7224, "mean_token_accuracy": 0.10825124606490136, "num_tokens": 1466120.0, "step": 845 }, { "entropy": 6.864966869354248, "epoch": 0.066134993191986, "grad_norm": 1.2109375, "learning_rate": 0.0004245, "loss": 6.4761, "mean_token_accuracy": 0.11677760556340218, "num_tokens": 1474965.0, "step": 850 }, { "entropy": 6.859512901306152, "epoch": 0.06652402256370356, "grad_norm": 1.2109375, "learning_rate": 0.000427, "loss": 6.5646, "mean_token_accuracy": 0.11498897522687912, "num_tokens": 1483483.0, "step": 855 }, { "entropy": 6.937557744979858, "epoch": 0.06691305193542113, "grad_norm": 1.1328125, "learning_rate": 0.0004295, "loss": 6.5105, "mean_token_accuracy": 0.1108026348054409, "num_tokens": 1492313.0, "step": 860 }, { "entropy": 6.8773322105407715, "epoch": 0.06730208130713869, "grad_norm": 1.0859375, "learning_rate": 0.000432, "loss": 6.4427, "mean_token_accuracy": 0.11592724919319153, "num_tokens": 1501081.0, "step": 865 }, { "entropy": 6.809585762023926, "epoch": 0.06769111067885625, "grad_norm": 1.1796875, "learning_rate": 0.0004345, "loss": 6.4583, "mean_token_accuracy": 0.11120192930102349, "num_tokens": 1510169.0, "step": 870 }, { "entropy": 6.838544702529907, "epoch": 0.06808014005057382, "grad_norm": 1.21875, "learning_rate": 0.000437, "loss": 6.4244, "mean_token_accuracy": 0.11338047757744789, "num_tokens": 1519546.0, "step": 875 }, { "entropy": 6.820107889175415, "epoch": 0.06846916942229138, "grad_norm": 1.1484375, "learning_rate": 0.0004395, "loss": 6.5435, "mean_token_accuracy": 0.1123778223991394, "num_tokens": 1529104.0, "step": 880 }, { "entropy": 6.7314704895019535, "epoch": 0.06885819879400895, "grad_norm": 1.1640625, "learning_rate": 0.000442, "loss": 6.4938, "mean_token_accuracy": 0.12263969853520393, "num_tokens": 1537033.0, "step": 885 }, { "entropy": 6.9164563655853275, "epoch": 0.06924722816572651, "grad_norm": 1.25, "learning_rate": 0.0004445, "loss": 6.5018, "mean_token_accuracy": 0.11451332420110702, "num_tokens": 1545059.0, "step": 890 }, { "entropy": 6.853432083129883, "epoch": 0.06963625753744408, "grad_norm": 1.09375, "learning_rate": 0.000447, "loss": 6.5062, "mean_token_accuracy": 0.11352940872311593, "num_tokens": 1553784.0, "step": 895 }, { "entropy": 6.785615253448486, "epoch": 0.07002528690916164, "grad_norm": 1.1953125, "learning_rate": 0.00044950000000000003, "loss": 6.4413, "mean_token_accuracy": 0.11957875341176986, "num_tokens": 1562059.0, "step": 900 }, { "entropy": 6.781708908081055, "epoch": 0.0704143162808792, "grad_norm": 1.234375, "learning_rate": 0.00045200000000000004, "loss": 6.5083, "mean_token_accuracy": 0.1147128850221634, "num_tokens": 1570061.0, "step": 905 }, { "entropy": 6.792767333984375, "epoch": 0.07080334565259677, "grad_norm": 1.0859375, "learning_rate": 0.00045450000000000004, "loss": 6.4642, "mean_token_accuracy": 0.11603316441178321, "num_tokens": 1578261.0, "step": 910 }, { "entropy": 6.81901068687439, "epoch": 0.07119237502431433, "grad_norm": 1.3671875, "learning_rate": 0.00045700000000000005, "loss": 6.3991, "mean_token_accuracy": 0.11860067769885063, "num_tokens": 1586260.0, "step": 915 }, { "entropy": 6.7977457523345945, "epoch": 0.0715814043960319, "grad_norm": 1.3203125, "learning_rate": 0.00045950000000000006, "loss": 6.5922, "mean_token_accuracy": 0.11235073879361153, "num_tokens": 1595234.0, "step": 920 }, { "entropy": 6.873261642456055, "epoch": 0.07197043376774946, "grad_norm": 1.265625, "learning_rate": 0.000462, "loss": 6.4801, "mean_token_accuracy": 0.11916077733039857, "num_tokens": 1604212.0, "step": 925 }, { "entropy": 6.792505550384521, "epoch": 0.07235946313946703, "grad_norm": 1.234375, "learning_rate": 0.0004645, "loss": 6.5283, "mean_token_accuracy": 0.11446316465735436, "num_tokens": 1612925.0, "step": 930 }, { "entropy": 6.767776250839233, "epoch": 0.07274849251118459, "grad_norm": 1.2421875, "learning_rate": 0.000467, "loss": 6.4187, "mean_token_accuracy": 0.12004713863134384, "num_tokens": 1621804.0, "step": 935 }, { "entropy": 6.757959938049316, "epoch": 0.07313752188290217, "grad_norm": 1.1640625, "learning_rate": 0.0004695, "loss": 6.3969, "mean_token_accuracy": 0.11997036337852478, "num_tokens": 1630943.0, "step": 940 }, { "entropy": 6.713178873062134, "epoch": 0.07352655125461972, "grad_norm": 1.2109375, "learning_rate": 0.000472, "loss": 6.3106, "mean_token_accuracy": 0.12384014949202538, "num_tokens": 1638899.0, "step": 945 }, { "entropy": 6.813256025314331, "epoch": 0.07391558062633728, "grad_norm": 1.328125, "learning_rate": 0.0004745, "loss": 6.5183, "mean_token_accuracy": 0.11929329931735992, "num_tokens": 1647485.0, "step": 950 }, { "entropy": 6.792909765243531, "epoch": 0.07430460999805485, "grad_norm": 1.28125, "learning_rate": 0.000477, "loss": 6.485, "mean_token_accuracy": 0.11955598518252372, "num_tokens": 1656290.0, "step": 955 }, { "entropy": 6.814577341079712, "epoch": 0.07469363936977241, "grad_norm": 1.109375, "learning_rate": 0.0004795, "loss": 6.5025, "mean_token_accuracy": 0.11491848975419998, "num_tokens": 1665474.0, "step": 960 }, { "entropy": 6.6340234756469725, "epoch": 0.07508266874148999, "grad_norm": 1.2265625, "learning_rate": 0.000482, "loss": 6.3785, "mean_token_accuracy": 0.12735505029559135, "num_tokens": 1673599.0, "step": 965 }, { "entropy": 6.7855254173278805, "epoch": 0.07547169811320754, "grad_norm": 1.0234375, "learning_rate": 0.0004845, "loss": 6.3513, "mean_token_accuracy": 0.11603628024458885, "num_tokens": 1683282.0, "step": 970 }, { "entropy": 6.784381628036499, "epoch": 0.07586072748492512, "grad_norm": 1.2265625, "learning_rate": 0.000487, "loss": 6.4793, "mean_token_accuracy": 0.12123103961348533, "num_tokens": 1691094.0, "step": 975 }, { "entropy": 6.6339301586151125, "epoch": 0.07624975685664268, "grad_norm": 1.390625, "learning_rate": 0.0004895, "loss": 6.356, "mean_token_accuracy": 0.1204170361161232, "num_tokens": 1700053.0, "step": 980 }, { "entropy": 6.736316251754761, "epoch": 0.07663878622836025, "grad_norm": 1.2578125, "learning_rate": 0.000492, "loss": 6.2828, "mean_token_accuracy": 0.12172069922089576, "num_tokens": 1707732.0, "step": 985 }, { "entropy": 6.719516134262085, "epoch": 0.0770278156000778, "grad_norm": 1.25, "learning_rate": 0.0004945, "loss": 6.5251, "mean_token_accuracy": 0.11388466954231262, "num_tokens": 1716406.0, "step": 990 }, { "entropy": 6.887849283218384, "epoch": 0.07741684497179536, "grad_norm": 1.1015625, "learning_rate": 0.000497, "loss": 6.5579, "mean_token_accuracy": 0.11262270659208298, "num_tokens": 1725832.0, "step": 995 }, { "entropy": 6.818440103530884, "epoch": 0.07780587434351294, "grad_norm": 1.1953125, "learning_rate": 0.0004995, "loss": 6.4678, "mean_token_accuracy": 0.11311930790543556, "num_tokens": 1734853.0, "step": 1000 }, { "entropy": 6.694705009460449, "epoch": 0.0781949037152305, "grad_norm": 1.28125, "learning_rate": 0.0004999999989075146, "loss": 6.4807, "mean_token_accuracy": 0.12094770967960358, "num_tokens": 1744240.0, "step": 1005 }, { "entropy": 6.865083646774292, "epoch": 0.07858393308694807, "grad_norm": 1.1796875, "learning_rate": 0.0004999999944692927, "loss": 6.4969, "mean_token_accuracy": 0.11460169404745102, "num_tokens": 1753334.0, "step": 1010 }, { "entropy": 6.603975772857666, "epoch": 0.07897296245866563, "grad_norm": 1.109375, "learning_rate": 0.000499999986617054, "loss": 6.3948, "mean_token_accuracy": 0.11559040769934655, "num_tokens": 1762032.0, "step": 1015 }, { "entropy": 6.726358270645141, "epoch": 0.0793619918303832, "grad_norm": 1.1015625, "learning_rate": 0.0004999999753507986, "loss": 6.3834, "mean_token_accuracy": 0.11660856455564499, "num_tokens": 1770508.0, "step": 1020 }, { "entropy": 6.621751356124878, "epoch": 0.07975102120210076, "grad_norm": 1.09375, "learning_rate": 0.0004999999606705267, "loss": 6.2867, "mean_token_accuracy": 0.12645310387015343, "num_tokens": 1780167.0, "step": 1025 }, { "entropy": 6.760381269454956, "epoch": 0.08014005057381832, "grad_norm": 1.125, "learning_rate": 0.0004999999425762385, "loss": 6.4923, "mean_token_accuracy": 0.11203559264540672, "num_tokens": 1788809.0, "step": 1030 }, { "entropy": 6.707613611221314, "epoch": 0.08052907994553589, "grad_norm": 1.375, "learning_rate": 0.0004999999210679344, "loss": 6.4082, "mean_token_accuracy": 0.11932154521346092, "num_tokens": 1797445.0, "step": 1035 }, { "entropy": 6.708571434020996, "epoch": 0.08091810931725345, "grad_norm": 1.1875, "learning_rate": 0.0004999998961456145, "loss": 6.4093, "mean_token_accuracy": 0.11497489586472512, "num_tokens": 1806488.0, "step": 1040 }, { "entropy": 6.7836400985717775, "epoch": 0.08130713868897102, "grad_norm": 1.203125, "learning_rate": 0.0004999998678092794, "loss": 6.4865, "mean_token_accuracy": 0.12190944403409958, "num_tokens": 1815692.0, "step": 1045 }, { "entropy": 6.733627986907959, "epoch": 0.08169616806068858, "grad_norm": 1.2578125, "learning_rate": 0.0004999998360589293, "loss": 6.3935, "mean_token_accuracy": 0.12152979299426078, "num_tokens": 1824599.0, "step": 1050 }, { "entropy": 6.814380025863647, "epoch": 0.08208519743240615, "grad_norm": 1.1484375, "learning_rate": 0.000499999800894565, "loss": 6.5522, "mean_token_accuracy": 0.11713027730584144, "num_tokens": 1833411.0, "step": 1055 }, { "entropy": 6.664803600311279, "epoch": 0.08247422680412371, "grad_norm": 1.3359375, "learning_rate": 0.0004999997623161866, "loss": 6.3602, "mean_token_accuracy": 0.11816268861293792, "num_tokens": 1842177.0, "step": 1060 }, { "entropy": 6.589741563796997, "epoch": 0.08286325617584128, "grad_norm": 1.1796875, "learning_rate": 0.0004999997203237951, "loss": 6.3501, "mean_token_accuracy": 0.12157049998641015, "num_tokens": 1850176.0, "step": 1065 }, { "entropy": 6.725516271591187, "epoch": 0.08325228554755884, "grad_norm": 1.125, "learning_rate": 0.000499999674917391, "loss": 6.3956, "mean_token_accuracy": 0.12002233043313026, "num_tokens": 1859464.0, "step": 1070 }, { "entropy": 6.589758443832397, "epoch": 0.0836413149192764, "grad_norm": 1.21875, "learning_rate": 0.0004999996260969748, "loss": 6.3058, "mean_token_accuracy": 0.11860100701451301, "num_tokens": 1867733.0, "step": 1075 }, { "entropy": 6.651362705230713, "epoch": 0.08403034429099397, "grad_norm": 1.1796875, "learning_rate": 0.0004999995738625475, "loss": 6.2897, "mean_token_accuracy": 0.1241245798766613, "num_tokens": 1876010.0, "step": 1080 }, { "entropy": 6.645105648040771, "epoch": 0.08441937366271153, "grad_norm": 1.078125, "learning_rate": 0.0004999995182141099, "loss": 6.4517, "mean_token_accuracy": 0.11694926843047142, "num_tokens": 1884906.0, "step": 1085 }, { "entropy": 6.668650484085083, "epoch": 0.0848084030344291, "grad_norm": 1.1796875, "learning_rate": 0.0004999994591516626, "loss": 6.36, "mean_token_accuracy": 0.1204823799431324, "num_tokens": 1893464.0, "step": 1090 }, { "entropy": 6.652740049362182, "epoch": 0.08519743240614666, "grad_norm": 1.1015625, "learning_rate": 0.0004999993966752066, "loss": 6.4075, "mean_token_accuracy": 0.11751677766442299, "num_tokens": 1902769.0, "step": 1095 }, { "entropy": 6.724245500564575, "epoch": 0.08558646177786423, "grad_norm": 1.1015625, "learning_rate": 0.000499999330784743, "loss": 6.3414, "mean_token_accuracy": 0.11880838871002197, "num_tokens": 1911968.0, "step": 1100 }, { "entropy": 6.623199605941773, "epoch": 0.08597549114958179, "grad_norm": 1.34375, "learning_rate": 0.0004999992614802725, "loss": 6.3306, "mean_token_accuracy": 0.12165946811437607, "num_tokens": 1920063.0, "step": 1105 }, { "entropy": 6.5714949607849125, "epoch": 0.08636452052129936, "grad_norm": 1.2265625, "learning_rate": 0.0004999991887617966, "loss": 6.2931, "mean_token_accuracy": 0.12126443311572074, "num_tokens": 1929192.0, "step": 1110 }, { "entropy": 6.723468399047851, "epoch": 0.08675354989301692, "grad_norm": 1.0546875, "learning_rate": 0.0004999991126293158, "loss": 6.5039, "mean_token_accuracy": 0.11924195289611816, "num_tokens": 1939082.0, "step": 1115 }, { "entropy": 6.509707975387573, "epoch": 0.08714257926473448, "grad_norm": 1.078125, "learning_rate": 0.0004999990330828318, "loss": 6.3622, "mean_token_accuracy": 0.11828808337450028, "num_tokens": 1948313.0, "step": 1120 }, { "entropy": 6.764839315414429, "epoch": 0.08753160863645205, "grad_norm": 1.25, "learning_rate": 0.0004999989501223456, "loss": 6.3535, "mean_token_accuracy": 0.11773044615983963, "num_tokens": 1957035.0, "step": 1125 }, { "entropy": 6.571807384490967, "epoch": 0.08792063800816961, "grad_norm": 1.140625, "learning_rate": 0.0004999988637478584, "loss": 6.356, "mean_token_accuracy": 0.11375595852732659, "num_tokens": 1966041.0, "step": 1130 }, { "entropy": 6.682859468460083, "epoch": 0.08830966737988719, "grad_norm": 1.2578125, "learning_rate": 0.0004999987739593716, "loss": 6.3945, "mean_token_accuracy": 0.11131789907813072, "num_tokens": 1975019.0, "step": 1135 }, { "entropy": 6.595472717285157, "epoch": 0.08869869675160474, "grad_norm": 1.1875, "learning_rate": 0.0004999986807568865, "loss": 6.3177, "mean_token_accuracy": 0.12635206803679466, "num_tokens": 1982930.0, "step": 1140 }, { "entropy": 6.661126136779785, "epoch": 0.08908772612332232, "grad_norm": 1.171875, "learning_rate": 0.0004999985841404045, "loss": 6.4155, "mean_token_accuracy": 0.11563977152109146, "num_tokens": 1991888.0, "step": 1145 }, { "entropy": 6.647232627868652, "epoch": 0.08947675549503988, "grad_norm": 1.1953125, "learning_rate": 0.0004999984841099271, "loss": 6.2743, "mean_token_accuracy": 0.11983647644519806, "num_tokens": 2000202.0, "step": 1150 }, { "entropy": 6.5404551982879635, "epoch": 0.08986578486675743, "grad_norm": 1.09375, "learning_rate": 0.000499998380665456, "loss": 6.3057, "mean_token_accuracy": 0.12251394167542458, "num_tokens": 2009281.0, "step": 1155 }, { "entropy": 6.654289579391479, "epoch": 0.090254814238475, "grad_norm": 1.125, "learning_rate": 0.0004999982738069924, "loss": 6.3102, "mean_token_accuracy": 0.12231542989611625, "num_tokens": 2017806.0, "step": 1160 }, { "entropy": 6.654610538482666, "epoch": 0.09064384361019256, "grad_norm": 1.09375, "learning_rate": 0.0004999981635345382, "loss": 6.3964, "mean_token_accuracy": 0.11891458630561828, "num_tokens": 2027582.0, "step": 1165 }, { "entropy": 6.530627679824829, "epoch": 0.09103287298191014, "grad_norm": 1.1640625, "learning_rate": 0.0004999980498480949, "loss": 6.2699, "mean_token_accuracy": 0.12494958117604256, "num_tokens": 2035427.0, "step": 1170 }, { "entropy": 6.712484693527221, "epoch": 0.0914219023536277, "grad_norm": 1.078125, "learning_rate": 0.0004999979327476644, "loss": 6.4533, "mean_token_accuracy": 0.1177413173019886, "num_tokens": 2044603.0, "step": 1175 }, { "entropy": 6.584618806838989, "epoch": 0.09181093172534527, "grad_norm": 1.1015625, "learning_rate": 0.0004999978122332485, "loss": 6.2931, "mean_token_accuracy": 0.12760861366987228, "num_tokens": 2053272.0, "step": 1180 }, { "entropy": 6.628946113586426, "epoch": 0.09219996109706283, "grad_norm": 1.1015625, "learning_rate": 0.0004999976883048487, "loss": 6.3113, "mean_token_accuracy": 0.12247533276677132, "num_tokens": 2061677.0, "step": 1185 }, { "entropy": 6.565109968185425, "epoch": 0.0925889904687804, "grad_norm": 1.0625, "learning_rate": 0.0004999975609624673, "loss": 6.3337, "mean_token_accuracy": 0.12145892754197121, "num_tokens": 2070282.0, "step": 1190 }, { "entropy": 6.7010410785675045, "epoch": 0.09297801984049796, "grad_norm": 1.203125, "learning_rate": 0.0004999974302061059, "loss": 6.4161, "mean_token_accuracy": 0.11821920722723007, "num_tokens": 2078812.0, "step": 1195 }, { "entropy": 6.600937271118164, "epoch": 0.09336704921221552, "grad_norm": 1.1328125, "learning_rate": 0.0004999972960357666, "loss": 6.3138, "mean_token_accuracy": 0.11917631253600121, "num_tokens": 2087020.0, "step": 1200 }, { "entropy": 6.548227739334107, "epoch": 0.09375607858393309, "grad_norm": 1.1796875, "learning_rate": 0.0004999971584514516, "loss": 6.2607, "mean_token_accuracy": 0.1289692461490631, "num_tokens": 2095933.0, "step": 1205 }, { "entropy": 6.49370927810669, "epoch": 0.09414510795565065, "grad_norm": 1.109375, "learning_rate": 0.0004999970174531627, "loss": 6.2709, "mean_token_accuracy": 0.1252399981021881, "num_tokens": 2105218.0, "step": 1210 }, { "entropy": 6.519537162780762, "epoch": 0.09453413732736822, "grad_norm": 1.234375, "learning_rate": 0.0004999968730409022, "loss": 6.1868, "mean_token_accuracy": 0.12397775202989578, "num_tokens": 2113808.0, "step": 1215 }, { "entropy": 6.508232164382934, "epoch": 0.09492316669908578, "grad_norm": 1.0859375, "learning_rate": 0.0004999967252146723, "loss": 6.3589, "mean_token_accuracy": 0.11807975843548775, "num_tokens": 2123014.0, "step": 1220 }, { "entropy": 6.678585195541382, "epoch": 0.09531219607080335, "grad_norm": 1.1953125, "learning_rate": 0.0004999965739744752, "loss": 6.2823, "mean_token_accuracy": 0.12472278475761414, "num_tokens": 2131840.0, "step": 1225 }, { "entropy": 6.571667098999024, "epoch": 0.09570122544252091, "grad_norm": 1.171875, "learning_rate": 0.0004999964193203132, "loss": 6.3797, "mean_token_accuracy": 0.1198837198317051, "num_tokens": 2140467.0, "step": 1230 }, { "entropy": 6.62928991317749, "epoch": 0.09609025481423847, "grad_norm": 1.1640625, "learning_rate": 0.0004999962612521888, "loss": 6.3252, "mean_token_accuracy": 0.12536743581295012, "num_tokens": 2149282.0, "step": 1235 }, { "entropy": 6.576823568344116, "epoch": 0.09647928418595604, "grad_norm": 1.1171875, "learning_rate": 0.0004999960997701041, "loss": 6.3244, "mean_token_accuracy": 0.12110247910022735, "num_tokens": 2157781.0, "step": 1240 }, { "entropy": 6.597092962265014, "epoch": 0.0968683135576736, "grad_norm": 1.15625, "learning_rate": 0.0004999959348740618, "loss": 6.2967, "mean_token_accuracy": 0.12580249533057214, "num_tokens": 2166482.0, "step": 1245 }, { "entropy": 6.499213790893554, "epoch": 0.09725734292939117, "grad_norm": 1.109375, "learning_rate": 0.0004999957665640641, "loss": 6.3132, "mean_token_accuracy": 0.12070827260613441, "num_tokens": 2174559.0, "step": 1250 }, { "entropy": 6.5587629795074465, "epoch": 0.09764637230110873, "grad_norm": 1.109375, "learning_rate": 0.000499995594840114, "loss": 6.2106, "mean_token_accuracy": 0.12732202261686326, "num_tokens": 2182374.0, "step": 1255 }, { "entropy": 6.497962141036988, "epoch": 0.0980354016728263, "grad_norm": 1.0234375, "learning_rate": 0.0004999954197022138, "loss": 6.2986, "mean_token_accuracy": 0.1267983116209507, "num_tokens": 2191427.0, "step": 1260 }, { "entropy": 6.650804328918457, "epoch": 0.09842443104454386, "grad_norm": 1.171875, "learning_rate": 0.0004999952411503661, "loss": 6.3879, "mean_token_accuracy": 0.11929038390517235, "num_tokens": 2199698.0, "step": 1265 }, { "entropy": 6.565453624725341, "epoch": 0.09881346041626143, "grad_norm": 1.1171875, "learning_rate": 0.0004999950591845738, "loss": 6.2348, "mean_token_accuracy": 0.12733448669314384, "num_tokens": 2208519.0, "step": 1270 }, { "entropy": 6.464875268936157, "epoch": 0.09920248978797899, "grad_norm": 1.0546875, "learning_rate": 0.0004999948738048397, "loss": 6.2428, "mean_token_accuracy": 0.1302006796002388, "num_tokens": 2217453.0, "step": 1275 }, { "entropy": 6.554579877853394, "epoch": 0.09959151915969655, "grad_norm": 1.1875, "learning_rate": 0.0004999946850111663, "loss": 6.3577, "mean_token_accuracy": 0.12167153358459473, "num_tokens": 2225623.0, "step": 1280 }, { "entropy": 6.576758623123169, "epoch": 0.09998054853141412, "grad_norm": 1.1484375, "learning_rate": 0.0004999944928035569, "loss": 6.2919, "mean_token_accuracy": 0.12363119274377823, "num_tokens": 2234519.0, "step": 1285 }, { "entropy": 6.5044145584106445, "epoch": 0.10036957790313168, "grad_norm": 1.421875, "learning_rate": 0.000499994297182014, "loss": 6.3061, "mean_token_accuracy": 0.12101315706968307, "num_tokens": 2242994.0, "step": 1290 }, { "entropy": 6.651056385040283, "epoch": 0.10075860727484925, "grad_norm": 1.140625, "learning_rate": 0.0004999940981465408, "loss": 6.3138, "mean_token_accuracy": 0.12628812938928605, "num_tokens": 2251687.0, "step": 1295 }, { "entropy": 6.394090366363526, "epoch": 0.10114763664656681, "grad_norm": 1.1640625, "learning_rate": 0.0004999938956971404, "loss": 6.2409, "mean_token_accuracy": 0.12676058262586593, "num_tokens": 2260751.0, "step": 1300 }, { "entropy": 6.595192193984985, "epoch": 0.10153666601828439, "grad_norm": 1.1328125, "learning_rate": 0.0004999936898338156, "loss": 6.1791, "mean_token_accuracy": 0.13165878504514694, "num_tokens": 2269125.0, "step": 1305 }, { "entropy": 6.401913452148437, "epoch": 0.10192569539000194, "grad_norm": 1.0859375, "learning_rate": 0.0004999934805565698, "loss": 6.1097, "mean_token_accuracy": 0.12795391529798508, "num_tokens": 2277098.0, "step": 1310 }, { "entropy": 6.470233392715454, "epoch": 0.10231472476171952, "grad_norm": 1.1015625, "learning_rate": 0.000499993267865406, "loss": 6.3887, "mean_token_accuracy": 0.1236030898988247, "num_tokens": 2285953.0, "step": 1315 }, { "entropy": 6.676652717590332, "epoch": 0.10270375413343708, "grad_norm": 1.1796875, "learning_rate": 0.0004999930517603275, "loss": 6.3036, "mean_token_accuracy": 0.12659136727452278, "num_tokens": 2294487.0, "step": 1320 }, { "entropy": 6.545140743255615, "epoch": 0.10309278350515463, "grad_norm": 1.109375, "learning_rate": 0.0004999928322413374, "loss": 6.3383, "mean_token_accuracy": 0.1220410332083702, "num_tokens": 2302915.0, "step": 1325 }, { "entropy": 6.493171358108521, "epoch": 0.1034818128768722, "grad_norm": 1.1953125, "learning_rate": 0.0004999926093084394, "loss": 6.2879, "mean_token_accuracy": 0.11915498897433281, "num_tokens": 2310769.0, "step": 1330 }, { "entropy": 6.463140153884888, "epoch": 0.10387084224858976, "grad_norm": 1.265625, "learning_rate": 0.0004999923829616365, "loss": 6.1782, "mean_token_accuracy": 0.12339231967926026, "num_tokens": 2319987.0, "step": 1335 }, { "entropy": 6.515197849273681, "epoch": 0.10425987162030734, "grad_norm": 1.1328125, "learning_rate": 0.0004999921532009323, "loss": 6.2932, "mean_token_accuracy": 0.1183166541159153, "num_tokens": 2328964.0, "step": 1340 }, { "entropy": 6.563854217529297, "epoch": 0.1046489009920249, "grad_norm": 1.1875, "learning_rate": 0.0004999919200263304, "loss": 6.2556, "mean_token_accuracy": 0.11943673864006996, "num_tokens": 2337945.0, "step": 1345 }, { "entropy": 6.530140399932861, "epoch": 0.10503793036374247, "grad_norm": 1.2421875, "learning_rate": 0.0004999916834378342, "loss": 6.1306, "mean_token_accuracy": 0.12886034995317458, "num_tokens": 2345989.0, "step": 1350 }, { "entropy": 6.404300594329834, "epoch": 0.10542695973546003, "grad_norm": 1.203125, "learning_rate": 0.0004999914434354472, "loss": 6.2652, "mean_token_accuracy": 0.12330945879220963, "num_tokens": 2353752.0, "step": 1355 }, { "entropy": 6.504211378097534, "epoch": 0.10581598910717759, "grad_norm": 1.1875, "learning_rate": 0.0004999912000191733, "loss": 6.2419, "mean_token_accuracy": 0.12025356367230415, "num_tokens": 2361961.0, "step": 1360 }, { "entropy": 6.423410511016845, "epoch": 0.10620501847889516, "grad_norm": 1.140625, "learning_rate": 0.000499990953189016, "loss": 6.1589, "mean_token_accuracy": 0.12905707210302353, "num_tokens": 2370148.0, "step": 1365 }, { "entropy": 6.537519788742065, "epoch": 0.10659404785061272, "grad_norm": 1.0859375, "learning_rate": 0.0004999907029449791, "loss": 6.186, "mean_token_accuracy": 0.131666212528944, "num_tokens": 2379105.0, "step": 1370 }, { "entropy": 6.4747106552124025, "epoch": 0.10698307722233029, "grad_norm": 1.109375, "learning_rate": 0.0004999904492870663, "loss": 6.2698, "mean_token_accuracy": 0.12513106688857079, "num_tokens": 2387417.0, "step": 1375 }, { "entropy": 6.521770191192627, "epoch": 0.10737210659404785, "grad_norm": 1.1640625, "learning_rate": 0.0004999901922152816, "loss": 6.2904, "mean_token_accuracy": 0.13334674686193465, "num_tokens": 2396163.0, "step": 1380 }, { "entropy": 6.347804832458496, "epoch": 0.10776113596576542, "grad_norm": 1.140625, "learning_rate": 0.0004999899317296288, "loss": 6.1475, "mean_token_accuracy": 0.12342875301837922, "num_tokens": 2404661.0, "step": 1385 }, { "entropy": 6.447468996047974, "epoch": 0.10815016533748298, "grad_norm": 1.234375, "learning_rate": 0.0004999896678301121, "loss": 6.2422, "mean_token_accuracy": 0.12361390069127083, "num_tokens": 2413459.0, "step": 1390 }, { "entropy": 6.573637056350708, "epoch": 0.10853919470920055, "grad_norm": 1.203125, "learning_rate": 0.0004999894005167352, "loss": 6.1903, "mean_token_accuracy": 0.1322077475488186, "num_tokens": 2421401.0, "step": 1395 }, { "entropy": 6.409449672698974, "epoch": 0.10892822408091811, "grad_norm": 1.15625, "learning_rate": 0.000499989129789502, "loss": 6.2017, "mean_token_accuracy": 0.1325265347957611, "num_tokens": 2429983.0, "step": 1400 }, { "entropy": 6.544249486923218, "epoch": 0.10931725345263567, "grad_norm": 1.078125, "learning_rate": 0.0004999888556484172, "loss": 6.3394, "mean_token_accuracy": 0.1189575508236885, "num_tokens": 2439206.0, "step": 1405 }, { "entropy": 6.494714403152466, "epoch": 0.10970628282435324, "grad_norm": 1.0625, "learning_rate": 0.0004999885780934845, "loss": 6.252, "mean_token_accuracy": 0.1334316536784172, "num_tokens": 2448801.0, "step": 1410 }, { "entropy": 6.461113309860229, "epoch": 0.1100953121960708, "grad_norm": 1.234375, "learning_rate": 0.0004999882971247081, "loss": 6.2983, "mean_token_accuracy": 0.12159521356225014, "num_tokens": 2458007.0, "step": 1415 }, { "entropy": 6.482313394546509, "epoch": 0.11048434156778837, "grad_norm": 1.25, "learning_rate": 0.0004999880127420926, "loss": 6.1931, "mean_token_accuracy": 0.13716387897729873, "num_tokens": 2466574.0, "step": 1420 }, { "entropy": 6.530479192733765, "epoch": 0.11087337093950593, "grad_norm": 1.03125, "learning_rate": 0.0004999877249456421, "loss": 6.2612, "mean_token_accuracy": 0.12397516667842864, "num_tokens": 2475263.0, "step": 1425 }, { "entropy": 6.218584966659546, "epoch": 0.1112624003112235, "grad_norm": 1.1640625, "learning_rate": 0.0004999874337353609, "loss": 6.0187, "mean_token_accuracy": 0.13271408900618553, "num_tokens": 2483738.0, "step": 1430 }, { "entropy": 6.438686561584473, "epoch": 0.11165142968294106, "grad_norm": 1.1640625, "learning_rate": 0.0004999871391112535, "loss": 6.1274, "mean_token_accuracy": 0.1266042783856392, "num_tokens": 2492937.0, "step": 1435 }, { "entropy": 6.360862302780151, "epoch": 0.11204045905465862, "grad_norm": 1.1796875, "learning_rate": 0.0004999868410733244, "loss": 6.2129, "mean_token_accuracy": 0.12471674755215645, "num_tokens": 2500716.0, "step": 1440 }, { "entropy": 6.442197370529175, "epoch": 0.11242948842637619, "grad_norm": 1.1875, "learning_rate": 0.000499986539621578, "loss": 6.1963, "mean_token_accuracy": 0.1276423953473568, "num_tokens": 2509385.0, "step": 1445 }, { "entropy": 6.529846048355102, "epoch": 0.11281851779809375, "grad_norm": 1.0859375, "learning_rate": 0.0004999862347560191, "loss": 6.2579, "mean_token_accuracy": 0.12066849693655968, "num_tokens": 2518179.0, "step": 1450 }, { "entropy": 6.494664096832276, "epoch": 0.11320754716981132, "grad_norm": 1.1328125, "learning_rate": 0.0004999859264766521, "loss": 6.2111, "mean_token_accuracy": 0.12627880051732063, "num_tokens": 2526644.0, "step": 1455 }, { "entropy": 6.364485549926758, "epoch": 0.11359657654152888, "grad_norm": 1.1484375, "learning_rate": 0.0004999856147834817, "loss": 6.1292, "mean_token_accuracy": 0.1283652275800705, "num_tokens": 2534998.0, "step": 1460 }, { "entropy": 6.485772514343262, "epoch": 0.11398560591324645, "grad_norm": 1.109375, "learning_rate": 0.0004999852996765129, "loss": 6.2034, "mean_token_accuracy": 0.12745219245553016, "num_tokens": 2543562.0, "step": 1465 }, { "entropy": 6.43467493057251, "epoch": 0.11437463528496401, "grad_norm": 1.1640625, "learning_rate": 0.0004999849811557502, "loss": 6.2066, "mean_token_accuracy": 0.1214485488831997, "num_tokens": 2551688.0, "step": 1470 }, { "entropy": 6.4273097038269045, "epoch": 0.11476366465668159, "grad_norm": 1.078125, "learning_rate": 0.0004999846592211984, "loss": 6.265, "mean_token_accuracy": 0.12918860763311385, "num_tokens": 2560227.0, "step": 1475 }, { "entropy": 6.4545982837677, "epoch": 0.11515269402839914, "grad_norm": 1.0859375, "learning_rate": 0.0004999843338728626, "loss": 6.1509, "mean_token_accuracy": 0.13062360733747483, "num_tokens": 2569245.0, "step": 1480 }, { "entropy": 6.416768312454224, "epoch": 0.1155417234001167, "grad_norm": 1.203125, "learning_rate": 0.0004999840051107476, "loss": 6.1753, "mean_token_accuracy": 0.12632442712783815, "num_tokens": 2577706.0, "step": 1485 }, { "entropy": 6.441485500335693, "epoch": 0.11593075277183428, "grad_norm": 1.203125, "learning_rate": 0.0004999836729348584, "loss": 6.2026, "mean_token_accuracy": 0.1314474403858185, "num_tokens": 2586075.0, "step": 1490 }, { "entropy": 6.376056575775147, "epoch": 0.11631978214355183, "grad_norm": 1.0390625, "learning_rate": 0.0004999833373452, "loss": 6.2116, "mean_token_accuracy": 0.12364233657717705, "num_tokens": 2594965.0, "step": 1495 }, { "entropy": 6.444352674484253, "epoch": 0.1167088115152694, "grad_norm": 1.2265625, "learning_rate": 0.0004999829983417778, "loss": 6.1165, "mean_token_accuracy": 0.13220934048295022, "num_tokens": 2603355.0, "step": 1500 }, { "entropy": 6.441127586364746, "epoch": 0.11709784088698696, "grad_norm": 1.1015625, "learning_rate": 0.0004999826559245965, "loss": 6.2668, "mean_token_accuracy": 0.12569701820611953, "num_tokens": 2611697.0, "step": 1505 }, { "entropy": 6.447865724563599, "epoch": 0.11748687025870454, "grad_norm": 1.15625, "learning_rate": 0.0004999823100936615, "loss": 6.145, "mean_token_accuracy": 0.13168494999408722, "num_tokens": 2620821.0, "step": 1510 }, { "entropy": 6.413182401657105, "epoch": 0.1178758996304221, "grad_norm": 1.1796875, "learning_rate": 0.0004999819608489781, "loss": 6.139, "mean_token_accuracy": 0.12816296517848969, "num_tokens": 2628891.0, "step": 1515 }, { "entropy": 6.4053560256958, "epoch": 0.11826492900213967, "grad_norm": 1.0546875, "learning_rate": 0.0004999816081905515, "loss": 6.2701, "mean_token_accuracy": 0.12410432398319245, "num_tokens": 2638641.0, "step": 1520 }, { "entropy": 6.446357250213623, "epoch": 0.11865395837385723, "grad_norm": 1.171875, "learning_rate": 0.0004999812521183872, "loss": 6.1571, "mean_token_accuracy": 0.12258520424365997, "num_tokens": 2646898.0, "step": 1525 }, { "entropy": 6.494231557846069, "epoch": 0.11904298774557479, "grad_norm": 1.2421875, "learning_rate": 0.0004999808926324903, "loss": 6.2181, "mean_token_accuracy": 0.11994621977210045, "num_tokens": 2655404.0, "step": 1530 }, { "entropy": 6.3410632610321045, "epoch": 0.11943201711729236, "grad_norm": 1.109375, "learning_rate": 0.0004999805297328665, "loss": 6.0821, "mean_token_accuracy": 0.13641492202877997, "num_tokens": 2663851.0, "step": 1535 }, { "entropy": 6.395636558532715, "epoch": 0.11982104648900992, "grad_norm": 1.2109375, "learning_rate": 0.0004999801634195214, "loss": 6.1436, "mean_token_accuracy": 0.12901071980595588, "num_tokens": 2672231.0, "step": 1540 }, { "entropy": 6.345880556106567, "epoch": 0.12021007586072749, "grad_norm": 1.15625, "learning_rate": 0.0004999797936924603, "loss": 6.1482, "mean_token_accuracy": 0.13240571096539497, "num_tokens": 2680198.0, "step": 1545 }, { "entropy": 6.534345436096191, "epoch": 0.12059910523244505, "grad_norm": 1.0390625, "learning_rate": 0.000499979420551689, "loss": 6.18, "mean_token_accuracy": 0.12448744922876358, "num_tokens": 2689208.0, "step": 1550 }, { "entropy": 6.408984041213989, "epoch": 0.12098813460416262, "grad_norm": 1.0546875, "learning_rate": 0.000499979043997213, "loss": 6.2361, "mean_token_accuracy": 0.1251956507563591, "num_tokens": 2698116.0, "step": 1555 }, { "entropy": 6.381083917617798, "epoch": 0.12137716397588018, "grad_norm": 1.109375, "learning_rate": 0.0004999786640290381, "loss": 6.1402, "mean_token_accuracy": 0.12055975571274757, "num_tokens": 2707046.0, "step": 1560 }, { "entropy": 6.352626132965088, "epoch": 0.12176619334759774, "grad_norm": 1.1171875, "learning_rate": 0.0004999782806471701, "loss": 6.1304, "mean_token_accuracy": 0.12507664933800697, "num_tokens": 2714929.0, "step": 1565 }, { "entropy": 6.367618370056152, "epoch": 0.12215522271931531, "grad_norm": 1.1171875, "learning_rate": 0.0004999778938516147, "loss": 6.1508, "mean_token_accuracy": 0.1280180834233761, "num_tokens": 2723436.0, "step": 1570 }, { "entropy": 6.3616029739379885, "epoch": 0.12254425209103287, "grad_norm": 1.1796875, "learning_rate": 0.000499977503642378, "loss": 6.1914, "mean_token_accuracy": 0.12718005925416948, "num_tokens": 2731935.0, "step": 1575 }, { "entropy": 6.357917261123657, "epoch": 0.12293328146275044, "grad_norm": 1.109375, "learning_rate": 0.0004999771100194656, "loss": 6.03, "mean_token_accuracy": 0.13522375822067262, "num_tokens": 2740307.0, "step": 1580 }, { "entropy": 6.297295475006104, "epoch": 0.123322310834468, "grad_norm": 1.1640625, "learning_rate": 0.0004999767129828837, "loss": 6.0432, "mean_token_accuracy": 0.13734385818243028, "num_tokens": 2749077.0, "step": 1585 }, { "entropy": 6.373191833496094, "epoch": 0.12371134020618557, "grad_norm": 1.140625, "learning_rate": 0.0004999763125326383, "loss": 6.171, "mean_token_accuracy": 0.12406648844480514, "num_tokens": 2758133.0, "step": 1590 }, { "entropy": 6.403712177276612, "epoch": 0.12410036957790313, "grad_norm": 1.1796875, "learning_rate": 0.0004999759086687355, "loss": 6.0809, "mean_token_accuracy": 0.13498054668307305, "num_tokens": 2766509.0, "step": 1595 }, { "entropy": 6.323156118392944, "epoch": 0.1244893989496207, "grad_norm": 1.109375, "learning_rate": 0.0004999755013911813, "loss": 6.2524, "mean_token_accuracy": 0.12937115207314492, "num_tokens": 2775908.0, "step": 1600 }, { "entropy": 6.363321352005005, "epoch": 0.12487842832133826, "grad_norm": 1.1015625, "learning_rate": 0.000499975090699982, "loss": 6.0216, "mean_token_accuracy": 0.13876289501786232, "num_tokens": 2784803.0, "step": 1605 }, { "entropy": 6.361731815338135, "epoch": 0.12526745769305583, "grad_norm": 1.1015625, "learning_rate": 0.0004999746765951438, "loss": 6.1877, "mean_token_accuracy": 0.12857512682676314, "num_tokens": 2793897.0, "step": 1610 }, { "entropy": 6.381125402450562, "epoch": 0.1256564870647734, "grad_norm": 1.1640625, "learning_rate": 0.0004999742590766729, "loss": 6.0135, "mean_token_accuracy": 0.1335058644413948, "num_tokens": 2802652.0, "step": 1615 }, { "entropy": 6.288719320297242, "epoch": 0.12604551643649095, "grad_norm": 1.1953125, "learning_rate": 0.0004999738381445757, "loss": 6.1555, "mean_token_accuracy": 0.12538140416145324, "num_tokens": 2811527.0, "step": 1620 }, { "entropy": 6.426501035690308, "epoch": 0.1264345458082085, "grad_norm": 1.171875, "learning_rate": 0.0004999734137988586, "loss": 6.0233, "mean_token_accuracy": 0.13478974401950836, "num_tokens": 2819410.0, "step": 1625 }, { "entropy": 6.1437897205352785, "epoch": 0.1268235751799261, "grad_norm": 1.0234375, "learning_rate": 0.000499972986039528, "loss": 6.0193, "mean_token_accuracy": 0.1394945725798607, "num_tokens": 2828079.0, "step": 1630 }, { "entropy": 6.358804178237915, "epoch": 0.12721260455164365, "grad_norm": 1.0859375, "learning_rate": 0.0004999725548665904, "loss": 6.125, "mean_token_accuracy": 0.13202060833573342, "num_tokens": 2836326.0, "step": 1635 }, { "entropy": 6.331844520568848, "epoch": 0.1276016339233612, "grad_norm": 1.1015625, "learning_rate": 0.0004999721202800524, "loss": 6.1777, "mean_token_accuracy": 0.12176662310957909, "num_tokens": 2845271.0, "step": 1640 }, { "entropy": 6.287081146240235, "epoch": 0.12799066329507877, "grad_norm": 1.0703125, "learning_rate": 0.0004999716822799206, "loss": 6.0484, "mean_token_accuracy": 0.13889054954051971, "num_tokens": 2853688.0, "step": 1645 }, { "entropy": 6.34264121055603, "epoch": 0.12837969266679633, "grad_norm": 1.0234375, "learning_rate": 0.0004999712408662016, "loss": 6.1345, "mean_token_accuracy": 0.13189240470528601, "num_tokens": 2862261.0, "step": 1650 }, { "entropy": 6.361407041549683, "epoch": 0.12876872203851392, "grad_norm": 1.0625, "learning_rate": 0.0004999707960389021, "loss": 6.1623, "mean_token_accuracy": 0.12860116735100746, "num_tokens": 2871324.0, "step": 1655 }, { "entropy": 6.39573564529419, "epoch": 0.12915775141023147, "grad_norm": 1.1640625, "learning_rate": 0.0004999703477980288, "loss": 6.2068, "mean_token_accuracy": 0.12376175597310066, "num_tokens": 2880268.0, "step": 1660 }, { "entropy": 6.376931095123291, "epoch": 0.12954678078194903, "grad_norm": 1.140625, "learning_rate": 0.0004999698961435885, "loss": 6.1084, "mean_token_accuracy": 0.13345540538430214, "num_tokens": 2888510.0, "step": 1665 }, { "entropy": 6.306573915481567, "epoch": 0.1299358101536666, "grad_norm": 1.109375, "learning_rate": 0.0004999694410755882, "loss": 6.0144, "mean_token_accuracy": 0.14056088551878929, "num_tokens": 2897616.0, "step": 1670 }, { "entropy": 6.2575867652893065, "epoch": 0.13032483952538418, "grad_norm": 1.0703125, "learning_rate": 0.0004999689825940347, "loss": 6.0963, "mean_token_accuracy": 0.13638013154268264, "num_tokens": 2905703.0, "step": 1675 }, { "entropy": 6.297283267974853, "epoch": 0.13071386889710174, "grad_norm": 1.1015625, "learning_rate": 0.0004999685206989349, "loss": 5.9894, "mean_token_accuracy": 0.13844015896320344, "num_tokens": 2914881.0, "step": 1680 }, { "entropy": 6.246834802627563, "epoch": 0.1311028982688193, "grad_norm": 1.0625, "learning_rate": 0.0004999680553902959, "loss": 6.0484, "mean_token_accuracy": 0.1338697463274002, "num_tokens": 2923563.0, "step": 1685 }, { "entropy": 6.416929101943969, "epoch": 0.13149192764053685, "grad_norm": 1.0, "learning_rate": 0.0004999675866681247, "loss": 6.2635, "mean_token_accuracy": 0.12606729716062545, "num_tokens": 2932821.0, "step": 1690 }, { "entropy": 6.340527868270874, "epoch": 0.1318809570122544, "grad_norm": 1.109375, "learning_rate": 0.0004999671145324286, "loss": 6.1476, "mean_token_accuracy": 0.13183779865503312, "num_tokens": 2940926.0, "step": 1695 }, { "entropy": 6.358092355728149, "epoch": 0.132269986383972, "grad_norm": 1.046875, "learning_rate": 0.0004999666389832144, "loss": 6.0869, "mean_token_accuracy": 0.13578122183680535, "num_tokens": 2950028.0, "step": 1700 }, { "entropy": 6.280818748474121, "epoch": 0.13265901575568956, "grad_norm": 1.1796875, "learning_rate": 0.0004999661600204897, "loss": 6.1048, "mean_token_accuracy": 0.13189996257424355, "num_tokens": 2957636.0, "step": 1705 }, { "entropy": 6.183881616592407, "epoch": 0.13304804512740712, "grad_norm": 1.0625, "learning_rate": 0.0004999656776442615, "loss": 5.8677, "mean_token_accuracy": 0.13509365245699884, "num_tokens": 2966544.0, "step": 1710 }, { "entropy": 6.306702184677124, "epoch": 0.13343707449912467, "grad_norm": 0.99609375, "learning_rate": 0.0004999651918545372, "loss": 6.1133, "mean_token_accuracy": 0.1262418359518051, "num_tokens": 2976236.0, "step": 1715 }, { "entropy": 6.283322811126709, "epoch": 0.13382610387084226, "grad_norm": 1.1875, "learning_rate": 0.0004999647026513243, "loss": 6.0487, "mean_token_accuracy": 0.1375434212386608, "num_tokens": 2984261.0, "step": 1720 }, { "entropy": 6.210408878326416, "epoch": 0.13421513324255982, "grad_norm": 1.0546875, "learning_rate": 0.00049996421003463, "loss": 6.0494, "mean_token_accuracy": 0.13253966495394706, "num_tokens": 2992970.0, "step": 1725 }, { "entropy": 6.381523132324219, "epoch": 0.13460416261427738, "grad_norm": 1.2265625, "learning_rate": 0.0004999637140044619, "loss": 6.0525, "mean_token_accuracy": 0.13889826759696006, "num_tokens": 3001356.0, "step": 1730 }, { "entropy": 6.240667819976807, "epoch": 0.13499319198599494, "grad_norm": 1.1171875, "learning_rate": 0.0004999632145608275, "loss": 6.0844, "mean_token_accuracy": 0.13955168649554253, "num_tokens": 3009509.0, "step": 1735 }, { "entropy": 6.309776020050049, "epoch": 0.1353822213577125, "grad_norm": 1.0625, "learning_rate": 0.0004999627117037343, "loss": 6.0914, "mean_token_accuracy": 0.12833233550190926, "num_tokens": 3017675.0, "step": 1740 }, { "entropy": 6.2961413860321045, "epoch": 0.13577125072943008, "grad_norm": 1.2265625, "learning_rate": 0.00049996220543319, "loss": 6.0664, "mean_token_accuracy": 0.13567132800817489, "num_tokens": 3025527.0, "step": 1745 }, { "entropy": 6.275249338150024, "epoch": 0.13616028010114764, "grad_norm": 1.140625, "learning_rate": 0.0004999616957492025, "loss": 6.0121, "mean_token_accuracy": 0.1365427479147911, "num_tokens": 3034251.0, "step": 1750 }, { "entropy": 6.229633617401123, "epoch": 0.1365493094728652, "grad_norm": 1.125, "learning_rate": 0.0004999611826517793, "loss": 6.2377, "mean_token_accuracy": 0.12501248195767403, "num_tokens": 3043272.0, "step": 1755 }, { "entropy": 6.347791910171509, "epoch": 0.13693833884458276, "grad_norm": 1.125, "learning_rate": 0.0004999606661409281, "loss": 6.0884, "mean_token_accuracy": 0.1348442792892456, "num_tokens": 3051092.0, "step": 1760 }, { "entropy": 6.319974565505982, "epoch": 0.13732736821630034, "grad_norm": 1.1171875, "learning_rate": 0.0004999601462166569, "loss": 6.0594, "mean_token_accuracy": 0.1309550181031227, "num_tokens": 3060584.0, "step": 1765 }, { "entropy": 6.226590776443482, "epoch": 0.1377163975880179, "grad_norm": 1.0703125, "learning_rate": 0.0004999596228789736, "loss": 6.0635, "mean_token_accuracy": 0.13423156440258027, "num_tokens": 3069990.0, "step": 1770 }, { "entropy": 6.335338115692139, "epoch": 0.13810542695973546, "grad_norm": 1.03125, "learning_rate": 0.0004999590961278859, "loss": 6.0482, "mean_token_accuracy": 0.13068760186433792, "num_tokens": 3078837.0, "step": 1775 }, { "entropy": 6.172453451156616, "epoch": 0.13849445633145302, "grad_norm": 1.0859375, "learning_rate": 0.0004999585659634021, "loss": 6.0316, "mean_token_accuracy": 0.1395242527127266, "num_tokens": 3087557.0, "step": 1780 }, { "entropy": 6.260955667495727, "epoch": 0.13888348570317058, "grad_norm": 1.1328125, "learning_rate": 0.0004999580323855301, "loss": 6.0262, "mean_token_accuracy": 0.13657170236110688, "num_tokens": 3096524.0, "step": 1785 }, { "entropy": 6.351543807983399, "epoch": 0.13927251507488816, "grad_norm": 1.125, "learning_rate": 0.0004999574953942781, "loss": 6.1139, "mean_token_accuracy": 0.1336659722030163, "num_tokens": 3105271.0, "step": 1790 }, { "entropy": 6.237719345092773, "epoch": 0.13966154444660572, "grad_norm": 1.125, "learning_rate": 0.0004999569549896541, "loss": 5.9924, "mean_token_accuracy": 0.1303889974951744, "num_tokens": 3114479.0, "step": 1795 }, { "entropy": 6.231583595275879, "epoch": 0.14005057381832328, "grad_norm": 1.09375, "learning_rate": 0.0004999564111716665, "loss": 6.0071, "mean_token_accuracy": 0.14318212792277335, "num_tokens": 3123319.0, "step": 1800 }, { "entropy": 6.270225238800049, "epoch": 0.14043960319004084, "grad_norm": 1.0078125, "learning_rate": 0.0004999558639403232, "loss": 6.0457, "mean_token_accuracy": 0.13263603895902634, "num_tokens": 3132532.0, "step": 1805 }, { "entropy": 6.358526659011841, "epoch": 0.1408286325617584, "grad_norm": 1.125, "learning_rate": 0.0004999553132956328, "loss": 6.1067, "mean_token_accuracy": 0.13037939891219139, "num_tokens": 3140798.0, "step": 1810 }, { "entropy": 6.238439464569092, "epoch": 0.14121766193347599, "grad_norm": 1.1484375, "learning_rate": 0.0004999547592376035, "loss": 6.0901, "mean_token_accuracy": 0.13772427588701247, "num_tokens": 3149607.0, "step": 1815 }, { "entropy": 6.2145038604736325, "epoch": 0.14160669130519354, "grad_norm": 1.21875, "learning_rate": 0.0004999542017662438, "loss": 5.9226, "mean_token_accuracy": 0.14179680794477462, "num_tokens": 3157537.0, "step": 1820 }, { "entropy": 6.2342335224151615, "epoch": 0.1419957206769111, "grad_norm": 1.1796875, "learning_rate": 0.0004999536408815623, "loss": 6.0715, "mean_token_accuracy": 0.1310746893286705, "num_tokens": 3166351.0, "step": 1825 }, { "entropy": 6.177899360656738, "epoch": 0.14238475004862866, "grad_norm": 1.15625, "learning_rate": 0.0004999530765835672, "loss": 5.935, "mean_token_accuracy": 0.14044117629528047, "num_tokens": 3174690.0, "step": 1830 }, { "entropy": 6.239687252044678, "epoch": 0.14277377942034625, "grad_norm": 1.125, "learning_rate": 0.0004999525088722673, "loss": 6.0764, "mean_token_accuracy": 0.12794848904013634, "num_tokens": 3183460.0, "step": 1835 }, { "entropy": 6.237521076202393, "epoch": 0.1431628087920638, "grad_norm": 1.0390625, "learning_rate": 0.0004999519377476711, "loss": 6.0105, "mean_token_accuracy": 0.13746723383665085, "num_tokens": 3192183.0, "step": 1840 }, { "entropy": 6.266400766372681, "epoch": 0.14355183816378136, "grad_norm": 1.0546875, "learning_rate": 0.0004999513632097872, "loss": 6.0966, "mean_token_accuracy": 0.13392534032464026, "num_tokens": 3200875.0, "step": 1845 }, { "entropy": 6.223610925674438, "epoch": 0.14394086753549892, "grad_norm": 1.0390625, "learning_rate": 0.0004999507852586245, "loss": 5.9609, "mean_token_accuracy": 0.13770486116409303, "num_tokens": 3209797.0, "step": 1850 }, { "entropy": 6.276148748397827, "epoch": 0.14432989690721648, "grad_norm": 1.1640625, "learning_rate": 0.0004999502038941917, "loss": 6.0793, "mean_token_accuracy": 0.13013245537877083, "num_tokens": 3218612.0, "step": 1855 }, { "entropy": 6.2181178569793705, "epoch": 0.14471892627893407, "grad_norm": 1.140625, "learning_rate": 0.0004999496191164975, "loss": 5.9958, "mean_token_accuracy": 0.13566022291779517, "num_tokens": 3227364.0, "step": 1860 }, { "entropy": 6.176430511474609, "epoch": 0.14510795565065163, "grad_norm": 1.046875, "learning_rate": 0.000499949030925551, "loss": 6.0201, "mean_token_accuracy": 0.13599291145801545, "num_tokens": 3236448.0, "step": 1865 }, { "entropy": 6.254899358749389, "epoch": 0.14549698502236919, "grad_norm": 1.1171875, "learning_rate": 0.0004999484393213609, "loss": 5.9486, "mean_token_accuracy": 0.1352322556078434, "num_tokens": 3244957.0, "step": 1870 }, { "entropy": 6.109967184066773, "epoch": 0.14588601439408674, "grad_norm": 1.125, "learning_rate": 0.0004999478443039363, "loss": 6.0408, "mean_token_accuracy": 0.1295456551015377, "num_tokens": 3253250.0, "step": 1875 }, { "entropy": 6.2762659072875975, "epoch": 0.14627504376580433, "grad_norm": 1.15625, "learning_rate": 0.0004999472458732862, "loss": 5.943, "mean_token_accuracy": 0.14542312696576118, "num_tokens": 3261455.0, "step": 1880 }, { "entropy": 6.1596604347229, "epoch": 0.1466640731375219, "grad_norm": 1.1484375, "learning_rate": 0.0004999466440294198, "loss": 5.9906, "mean_token_accuracy": 0.13770747035741807, "num_tokens": 3270108.0, "step": 1885 }, { "entropy": 6.310276889801026, "epoch": 0.14705310250923945, "grad_norm": 1.0859375, "learning_rate": 0.000499946038772346, "loss": 6.1231, "mean_token_accuracy": 0.13440992087125778, "num_tokens": 3278425.0, "step": 1890 }, { "entropy": 6.235618352890015, "epoch": 0.147442131880957, "grad_norm": 1.0078125, "learning_rate": 0.0004999454301020741, "loss": 6.0429, "mean_token_accuracy": 0.13205524757504464, "num_tokens": 3288358.0, "step": 1895 }, { "entropy": 6.265941572189331, "epoch": 0.14783116125267456, "grad_norm": 1.1796875, "learning_rate": 0.0004999448180186133, "loss": 6.039, "mean_token_accuracy": 0.1352785974740982, "num_tokens": 3297199.0, "step": 1900 }, { "entropy": 6.18539137840271, "epoch": 0.14822019062439215, "grad_norm": 1.09375, "learning_rate": 0.000499944202521973, "loss": 6.047, "mean_token_accuracy": 0.13134037628769873, "num_tokens": 3306350.0, "step": 1905 }, { "entropy": 6.20574164390564, "epoch": 0.1486092199961097, "grad_norm": 1.1171875, "learning_rate": 0.0004999435836121624, "loss": 5.8873, "mean_token_accuracy": 0.13750338256359101, "num_tokens": 3314921.0, "step": 1910 }, { "entropy": 6.084950733184814, "epoch": 0.14899824936782727, "grad_norm": 1.140625, "learning_rate": 0.000499942961289191, "loss": 6.018, "mean_token_accuracy": 0.14249766021966934, "num_tokens": 3323324.0, "step": 1915 }, { "entropy": 6.381536149978638, "epoch": 0.14938727873954483, "grad_norm": 1.1953125, "learning_rate": 0.0004999423355530683, "loss": 6.1469, "mean_token_accuracy": 0.13054955527186393, "num_tokens": 3331614.0, "step": 1920 }, { "entropy": 6.248685646057129, "epoch": 0.1497763081112624, "grad_norm": 1.2109375, "learning_rate": 0.0004999417064038035, "loss": 5.9945, "mean_token_accuracy": 0.13594073355197905, "num_tokens": 3339573.0, "step": 1925 }, { "entropy": 6.163447618484497, "epoch": 0.15016533748297997, "grad_norm": 1.1875, "learning_rate": 0.0004999410738414065, "loss": 5.9538, "mean_token_accuracy": 0.14307861253619195, "num_tokens": 3347775.0, "step": 1930 }, { "entropy": 6.200021457672119, "epoch": 0.15055436685469753, "grad_norm": 1.125, "learning_rate": 0.0004999404378658866, "loss": 5.9128, "mean_token_accuracy": 0.1373552069067955, "num_tokens": 3356947.0, "step": 1935 }, { "entropy": 6.167617988586426, "epoch": 0.1509433962264151, "grad_norm": 1.125, "learning_rate": 0.0004999397984772536, "loss": 6.0098, "mean_token_accuracy": 0.13761954754590988, "num_tokens": 3365420.0, "step": 1940 }, { "entropy": 6.2827473163604735, "epoch": 0.15133242559813265, "grad_norm": 1.109375, "learning_rate": 0.0004999391556755172, "loss": 6.1027, "mean_token_accuracy": 0.13397282212972642, "num_tokens": 3373483.0, "step": 1945 }, { "entropy": 6.290587139129639, "epoch": 0.15172145496985023, "grad_norm": 1.0, "learning_rate": 0.0004999385094606872, "loss": 6.0892, "mean_token_accuracy": 0.12818740382790567, "num_tokens": 3382557.0, "step": 1950 }, { "entropy": 6.261412334442139, "epoch": 0.1521104843415678, "grad_norm": 1.09375, "learning_rate": 0.0004999378598327733, "loss": 6.0347, "mean_token_accuracy": 0.12742510437965393, "num_tokens": 3392079.0, "step": 1955 }, { "entropy": 6.222420072555542, "epoch": 0.15249951371328535, "grad_norm": 1.0703125, "learning_rate": 0.0004999372067917854, "loss": 6.1003, "mean_token_accuracy": 0.1310837060213089, "num_tokens": 3401070.0, "step": 1960 }, { "entropy": 6.165682315826416, "epoch": 0.1528885430850029, "grad_norm": 1.0546875, "learning_rate": 0.0004999365503377335, "loss": 5.9818, "mean_token_accuracy": 0.13428688049316406, "num_tokens": 3409921.0, "step": 1965 }, { "entropy": 6.244135046005249, "epoch": 0.1532775724567205, "grad_norm": 1.125, "learning_rate": 0.0004999358904706273, "loss": 5.9986, "mean_token_accuracy": 0.13104057684540749, "num_tokens": 3419149.0, "step": 1970 }, { "entropy": 6.156588792800903, "epoch": 0.15366660182843805, "grad_norm": 1.171875, "learning_rate": 0.0004999352271904771, "loss": 5.8891, "mean_token_accuracy": 0.14492207542061805, "num_tokens": 3427435.0, "step": 1975 }, { "entropy": 6.24048261642456, "epoch": 0.1540556312001556, "grad_norm": 1.171875, "learning_rate": 0.0004999345604972928, "loss": 6.0975, "mean_token_accuracy": 0.1309770740568638, "num_tokens": 3436377.0, "step": 1980 }, { "entropy": 6.262222719192505, "epoch": 0.15444466057187317, "grad_norm": 1.0859375, "learning_rate": 0.0004999338903910846, "loss": 5.966, "mean_token_accuracy": 0.14030917212367058, "num_tokens": 3444997.0, "step": 1985 }, { "entropy": 6.250793886184693, "epoch": 0.15483368994359073, "grad_norm": 1.1328125, "learning_rate": 0.0004999332168718626, "loss": 6.0267, "mean_token_accuracy": 0.13967675864696502, "num_tokens": 3454254.0, "step": 1990 }, { "entropy": 6.192072057723999, "epoch": 0.15522271931530832, "grad_norm": 1.1484375, "learning_rate": 0.0004999325399396371, "loss": 5.9984, "mean_token_accuracy": 0.14047476574778556, "num_tokens": 3462853.0, "step": 1995 }, { "entropy": 6.162121677398682, "epoch": 0.15561174868702587, "grad_norm": 1.109375, "learning_rate": 0.0004999318595944183, "loss": 5.951, "mean_token_accuracy": 0.1363219663500786, "num_tokens": 3471288.0, "step": 2000 }, { "entropy": 6.123317289352417, "epoch": 0.15600077805874343, "grad_norm": 1.1484375, "learning_rate": 0.0004999311758362166, "loss": 5.8464, "mean_token_accuracy": 0.13612058088183404, "num_tokens": 3479479.0, "step": 2005 }, { "entropy": 6.14522500038147, "epoch": 0.156389807430461, "grad_norm": 1.109375, "learning_rate": 0.0004999304886650422, "loss": 5.8684, "mean_token_accuracy": 0.1447673887014389, "num_tokens": 3488621.0, "step": 2010 }, { "entropy": 6.089516735076904, "epoch": 0.15677883680217858, "grad_norm": 1.125, "learning_rate": 0.0004999297980809058, "loss": 5.9238, "mean_token_accuracy": 0.1373309776186943, "num_tokens": 3497792.0, "step": 2015 }, { "entropy": 6.12142162322998, "epoch": 0.15716786617389614, "grad_norm": 1.2109375, "learning_rate": 0.0004999291040838176, "loss": 5.9522, "mean_token_accuracy": 0.13544787019491195, "num_tokens": 3506548.0, "step": 2020 }, { "entropy": 6.127046966552735, "epoch": 0.1575568955456137, "grad_norm": 1.046875, "learning_rate": 0.0004999284066737884, "loss": 5.932, "mean_token_accuracy": 0.14313506335020065, "num_tokens": 3515086.0, "step": 2025 }, { "entropy": 6.245706987380982, "epoch": 0.15794592491733125, "grad_norm": 1.1171875, "learning_rate": 0.0004999277058508285, "loss": 5.9765, "mean_token_accuracy": 0.1334720067679882, "num_tokens": 3523985.0, "step": 2030 }, { "entropy": 6.193225526809693, "epoch": 0.1583349542890488, "grad_norm": 1.1328125, "learning_rate": 0.0004999270016149486, "loss": 6.0321, "mean_token_accuracy": 0.1414737358689308, "num_tokens": 3532575.0, "step": 2035 }, { "entropy": 6.229839229583741, "epoch": 0.1587239836607664, "grad_norm": 1.09375, "learning_rate": 0.0004999262939661596, "loss": 6.0292, "mean_token_accuracy": 0.13414048179984092, "num_tokens": 3541558.0, "step": 2040 }, { "entropy": 6.1485107898712155, "epoch": 0.15911301303248396, "grad_norm": 1.0546875, "learning_rate": 0.0004999255829044721, "loss": 5.9383, "mean_token_accuracy": 0.1430905818939209, "num_tokens": 3549697.0, "step": 2045 }, { "entropy": 6.240954160690308, "epoch": 0.15950204240420152, "grad_norm": 1.0390625, "learning_rate": 0.0004999248684298968, "loss": 6.1118, "mean_token_accuracy": 0.12798432558774947, "num_tokens": 3558673.0, "step": 2050 }, { "entropy": 6.225488805770874, "epoch": 0.15989107177591907, "grad_norm": 1.1640625, "learning_rate": 0.0004999241505424447, "loss": 5.963, "mean_token_accuracy": 0.14219792932271957, "num_tokens": 3567176.0, "step": 2055 }, { "entropy": 6.276889419555664, "epoch": 0.16028010114763663, "grad_norm": 1.1328125, "learning_rate": 0.0004999234292421265, "loss": 6.0934, "mean_token_accuracy": 0.13421509712934493, "num_tokens": 3576020.0, "step": 2060 }, { "entropy": 6.121796798706055, "epoch": 0.16066913051935422, "grad_norm": 1.1953125, "learning_rate": 0.0004999227045289535, "loss": 5.9483, "mean_token_accuracy": 0.13852609768509866, "num_tokens": 3584705.0, "step": 2065 }, { "entropy": 6.239097929000854, "epoch": 0.16105815989107178, "grad_norm": 1.1640625, "learning_rate": 0.0004999219764029363, "loss": 6.1251, "mean_token_accuracy": 0.1327233374118805, "num_tokens": 3593339.0, "step": 2070 }, { "entropy": 6.17981219291687, "epoch": 0.16144718926278934, "grad_norm": 1.046875, "learning_rate": 0.0004999212448640861, "loss": 5.8296, "mean_token_accuracy": 0.14525919482111932, "num_tokens": 3601206.0, "step": 2075 }, { "entropy": 6.023618602752686, "epoch": 0.1618362186345069, "grad_norm": 1.0234375, "learning_rate": 0.0004999205099124141, "loss": 5.9556, "mean_token_accuracy": 0.1340252086520195, "num_tokens": 3610371.0, "step": 2080 }, { "entropy": 6.26896104812622, "epoch": 0.16222524800622448, "grad_norm": 1.1015625, "learning_rate": 0.0004999197715479313, "loss": 5.9675, "mean_token_accuracy": 0.13808080479502677, "num_tokens": 3618834.0, "step": 2085 }, { "entropy": 6.081180000305176, "epoch": 0.16261427737794204, "grad_norm": 1.1015625, "learning_rate": 0.0004999190297706489, "loss": 5.9999, "mean_token_accuracy": 0.13936789706349373, "num_tokens": 3627426.0, "step": 2090 }, { "entropy": 6.239403820037841, "epoch": 0.1630033067496596, "grad_norm": 1.1171875, "learning_rate": 0.0004999182845805783, "loss": 6.0013, "mean_token_accuracy": 0.13789541125297547, "num_tokens": 3636020.0, "step": 2095 }, { "entropy": 6.242777967453003, "epoch": 0.16339233612137716, "grad_norm": 1.140625, "learning_rate": 0.0004999175359777306, "loss": 5.9419, "mean_token_accuracy": 0.1419316790997982, "num_tokens": 3644419.0, "step": 2100 }, { "entropy": 6.171798038482666, "epoch": 0.16378136549309472, "grad_norm": 1.0859375, "learning_rate": 0.0004999167839621174, "loss": 6.043, "mean_token_accuracy": 0.13091627210378648, "num_tokens": 3653223.0, "step": 2105 }, { "entropy": 6.23285026550293, "epoch": 0.1641703948648123, "grad_norm": 0.9609375, "learning_rate": 0.0004999160285337501, "loss": 6.062, "mean_token_accuracy": 0.13183995485305786, "num_tokens": 3662409.0, "step": 2110 }, { "entropy": 6.214762258529663, "epoch": 0.16455942423652986, "grad_norm": 1.234375, "learning_rate": 0.0004999152696926399, "loss": 6.0226, "mean_token_accuracy": 0.13156313672661782, "num_tokens": 3670635.0, "step": 2115 }, { "entropy": 6.076648998260498, "epoch": 0.16494845360824742, "grad_norm": 1.09375, "learning_rate": 0.0004999145074387985, "loss": 5.9493, "mean_token_accuracy": 0.14351119846105576, "num_tokens": 3679303.0, "step": 2120 }, { "entropy": 6.297281312942505, "epoch": 0.16533748297996498, "grad_norm": 1.03125, "learning_rate": 0.0004999137417722374, "loss": 6.0999, "mean_token_accuracy": 0.1333278849720955, "num_tokens": 3689299.0, "step": 2125 }, { "entropy": 6.212060928344727, "epoch": 0.16572651235168256, "grad_norm": 1.03125, "learning_rate": 0.0004999129726929684, "loss": 6.0309, "mean_token_accuracy": 0.141978856921196, "num_tokens": 3697843.0, "step": 2130 }, { "entropy": 6.232631540298462, "epoch": 0.16611554172340012, "grad_norm": 1.0859375, "learning_rate": 0.0004999122002010029, "loss": 5.9595, "mean_token_accuracy": 0.13919129222631454, "num_tokens": 3705876.0, "step": 2135 }, { "entropy": 6.192243671417236, "epoch": 0.16650457109511768, "grad_norm": 1.125, "learning_rate": 0.0004999114242963527, "loss": 6.0811, "mean_token_accuracy": 0.1308549664914608, "num_tokens": 3714835.0, "step": 2140 }, { "entropy": 6.1568906784057615, "epoch": 0.16689360046683524, "grad_norm": 1.078125, "learning_rate": 0.0004999106449790298, "loss": 5.9421, "mean_token_accuracy": 0.13271426409482956, "num_tokens": 3723421.0, "step": 2145 }, { "entropy": 6.174701166152954, "epoch": 0.1672826298385528, "grad_norm": 1.015625, "learning_rate": 0.0004999098622490458, "loss": 5.9582, "mean_token_accuracy": 0.1379171997308731, "num_tokens": 3731590.0, "step": 2150 }, { "entropy": 6.0976481437683105, "epoch": 0.16767165921027039, "grad_norm": 1.078125, "learning_rate": 0.0004999090761064125, "loss": 5.8819, "mean_token_accuracy": 0.1397905245423317, "num_tokens": 3740700.0, "step": 2155 }, { "entropy": 6.141346263885498, "epoch": 0.16806068858198794, "grad_norm": 1.03125, "learning_rate": 0.000499908286551142, "loss": 5.9546, "mean_token_accuracy": 0.14155428856611252, "num_tokens": 3749516.0, "step": 2160 }, { "entropy": 6.109289598464966, "epoch": 0.1684497179537055, "grad_norm": 1.09375, "learning_rate": 0.0004999074935832463, "loss": 5.8731, "mean_token_accuracy": 0.14581690207123757, "num_tokens": 3757696.0, "step": 2165 }, { "entropy": 6.114305877685547, "epoch": 0.16883874732542306, "grad_norm": 1.0703125, "learning_rate": 0.0004999066972027373, "loss": 5.9643, "mean_token_accuracy": 0.13819186612963677, "num_tokens": 3765786.0, "step": 2170 }, { "entropy": 6.129476547241211, "epoch": 0.16922777669714065, "grad_norm": 1.1796875, "learning_rate": 0.0004999058974096271, "loss": 5.8694, "mean_token_accuracy": 0.14471860826015473, "num_tokens": 3773265.0, "step": 2175 }, { "entropy": 6.109765338897705, "epoch": 0.1696168060688582, "grad_norm": 1.0546875, "learning_rate": 0.000499905094203928, "loss": 5.9872, "mean_token_accuracy": 0.13433021679520607, "num_tokens": 3782402.0, "step": 2180 }, { "entropy": 6.180309247970581, "epoch": 0.17000583544057576, "grad_norm": 1.1484375, "learning_rate": 0.000499904287585652, "loss": 6.0514, "mean_token_accuracy": 0.1314002774655819, "num_tokens": 3791901.0, "step": 2185 }, { "entropy": 6.139549350738525, "epoch": 0.17039486481229332, "grad_norm": 1.0, "learning_rate": 0.0004999034775548113, "loss": 5.8778, "mean_token_accuracy": 0.14060187861323356, "num_tokens": 3799872.0, "step": 2190 }, { "entropy": 6.106409025192261, "epoch": 0.17078389418401088, "grad_norm": 1.1171875, "learning_rate": 0.0004999026641114185, "loss": 5.8323, "mean_token_accuracy": 0.14609502255916595, "num_tokens": 3808949.0, "step": 2195 }, { "entropy": 6.121867275238037, "epoch": 0.17117292355572847, "grad_norm": 1.1484375, "learning_rate": 0.0004999018472554857, "loss": 5.9466, "mean_token_accuracy": 0.13920955061912538, "num_tokens": 3817429.0, "step": 2200 }, { "entropy": 6.264400291442871, "epoch": 0.17156195292744603, "grad_norm": 1.03125, "learning_rate": 0.0004999010269870253, "loss": 6.2252, "mean_token_accuracy": 0.12967248037457466, "num_tokens": 3827101.0, "step": 2205 }, { "entropy": 6.248671436309815, "epoch": 0.17195098229916359, "grad_norm": 0.96484375, "learning_rate": 0.0004999002033060498, "loss": 5.9701, "mean_token_accuracy": 0.13611226081848143, "num_tokens": 3836147.0, "step": 2210 }, { "entropy": 6.070646286010742, "epoch": 0.17234001167088114, "grad_norm": 1.078125, "learning_rate": 0.0004998993762125716, "loss": 5.9555, "mean_token_accuracy": 0.1376994989812374, "num_tokens": 3845300.0, "step": 2215 }, { "entropy": 6.248652124404908, "epoch": 0.17272904104259873, "grad_norm": 1.1875, "learning_rate": 0.0004998985457066034, "loss": 5.9556, "mean_token_accuracy": 0.14077395275235177, "num_tokens": 3853620.0, "step": 2220 }, { "entropy": 6.078034114837647, "epoch": 0.1731180704143163, "grad_norm": 1.109375, "learning_rate": 0.0004998977117881576, "loss": 5.952, "mean_token_accuracy": 0.14219790250062941, "num_tokens": 3861734.0, "step": 2225 }, { "entropy": 6.147058439254761, "epoch": 0.17350709978603385, "grad_norm": 1.046875, "learning_rate": 0.0004998968744572472, "loss": 5.9706, "mean_token_accuracy": 0.13935380205512046, "num_tokens": 3870753.0, "step": 2230 }, { "entropy": 6.128642892837524, "epoch": 0.1738961291577514, "grad_norm": 1.0546875, "learning_rate": 0.0004998960337138845, "loss": 5.852, "mean_token_accuracy": 0.14278298988938332, "num_tokens": 3879382.0, "step": 2235 }, { "entropy": 6.17204442024231, "epoch": 0.17428515852946896, "grad_norm": 1.1015625, "learning_rate": 0.0004998951895580826, "loss": 6.0249, "mean_token_accuracy": 0.13453888818621634, "num_tokens": 3888417.0, "step": 2240 }, { "entropy": 6.054234218597412, "epoch": 0.17467418790118655, "grad_norm": 1.09375, "learning_rate": 0.0004998943419898542, "loss": 5.8813, "mean_token_accuracy": 0.1384780913591385, "num_tokens": 3897083.0, "step": 2245 }, { "entropy": 6.077237939834594, "epoch": 0.1750632172729041, "grad_norm": 1.078125, "learning_rate": 0.0004998934910092119, "loss": 5.8526, "mean_token_accuracy": 0.14408235251903534, "num_tokens": 3905564.0, "step": 2250 }, { "entropy": 6.146784496307373, "epoch": 0.17545224664462167, "grad_norm": 1.0546875, "learning_rate": 0.0004998926366161689, "loss": 5.9942, "mean_token_accuracy": 0.13211930319666862, "num_tokens": 3914896.0, "step": 2255 }, { "entropy": 6.1404224872589115, "epoch": 0.17584127601633923, "grad_norm": 1.0234375, "learning_rate": 0.0004998917788107383, "loss": 5.9972, "mean_token_accuracy": 0.13836849108338356, "num_tokens": 3924151.0, "step": 2260 }, { "entropy": 6.213042545318603, "epoch": 0.17623030538805678, "grad_norm": 1.0078125, "learning_rate": 0.0004998909175929326, "loss": 5.9462, "mean_token_accuracy": 0.13971734270453454, "num_tokens": 3933163.0, "step": 2265 }, { "entropy": 6.098297929763794, "epoch": 0.17661933475977437, "grad_norm": 1.1328125, "learning_rate": 0.0004998900529627653, "loss": 5.8671, "mean_token_accuracy": 0.14396204575896263, "num_tokens": 3941120.0, "step": 2270 }, { "entropy": 5.991336631774902, "epoch": 0.17700836413149193, "grad_norm": 1.078125, "learning_rate": 0.0004998891849202495, "loss": 5.7531, "mean_token_accuracy": 0.1438086897134781, "num_tokens": 3949896.0, "step": 2275 }, { "entropy": 6.120736980438233, "epoch": 0.1773973935032095, "grad_norm": 1.1015625, "learning_rate": 0.000499888313465398, "loss": 5.9127, "mean_token_accuracy": 0.13862551301717757, "num_tokens": 3958794.0, "step": 2280 }, { "entropy": 6.140617322921753, "epoch": 0.17778642287492705, "grad_norm": 1.1015625, "learning_rate": 0.0004998874385982247, "loss": 5.9773, "mean_token_accuracy": 0.14108967706561087, "num_tokens": 3967267.0, "step": 2285 }, { "entropy": 6.083899354934692, "epoch": 0.17817545224664463, "grad_norm": 1.1015625, "learning_rate": 0.0004998865603187421, "loss": 5.892, "mean_token_accuracy": 0.14135736748576164, "num_tokens": 3976536.0, "step": 2290 }, { "entropy": 6.207363796234131, "epoch": 0.1785644816183622, "grad_norm": 1.0, "learning_rate": 0.000499885678626964, "loss": 5.9564, "mean_token_accuracy": 0.13729356452822686, "num_tokens": 3986006.0, "step": 2295 }, { "entropy": 6.016284608840943, "epoch": 0.17895351099007975, "grad_norm": 1.1328125, "learning_rate": 0.0004998847935229038, "loss": 5.9038, "mean_token_accuracy": 0.1368868224322796, "num_tokens": 3994478.0, "step": 2300 }, { "entropy": 6.116120862960815, "epoch": 0.1793425403617973, "grad_norm": 1.0546875, "learning_rate": 0.0004998839050065746, "loss": 5.9516, "mean_token_accuracy": 0.1373460717499256, "num_tokens": 4003190.0, "step": 2305 }, { "entropy": 6.196177530288696, "epoch": 0.17973156973351487, "grad_norm": 0.984375, "learning_rate": 0.0004998830130779902, "loss": 5.8728, "mean_token_accuracy": 0.1443126007914543, "num_tokens": 4011886.0, "step": 2310 }, { "entropy": 5.965580034255981, "epoch": 0.18012059910523245, "grad_norm": 1.0546875, "learning_rate": 0.000499882117737164, "loss": 5.7727, "mean_token_accuracy": 0.1477213680744171, "num_tokens": 4020792.0, "step": 2315 }, { "entropy": 5.96843729019165, "epoch": 0.18050962847695, "grad_norm": 1.09375, "learning_rate": 0.0004998812189841096, "loss": 5.7491, "mean_token_accuracy": 0.14528555423021317, "num_tokens": 4029235.0, "step": 2320 }, { "entropy": 6.036883306503296, "epoch": 0.18089865784866757, "grad_norm": 1.140625, "learning_rate": 0.0004998803168188407, "loss": 5.9845, "mean_token_accuracy": 0.14515455886721612, "num_tokens": 4037341.0, "step": 2325 }, { "entropy": 6.072755193710327, "epoch": 0.18128768722038513, "grad_norm": 1.1328125, "learning_rate": 0.0004998794112413708, "loss": 5.8554, "mean_token_accuracy": 0.14166971370577813, "num_tokens": 4046324.0, "step": 2330 }, { "entropy": 6.041338300704956, "epoch": 0.18167671659210272, "grad_norm": 1.0546875, "learning_rate": 0.0004998785022517137, "loss": 5.9319, "mean_token_accuracy": 0.1387798421084881, "num_tokens": 4054579.0, "step": 2335 }, { "entropy": 6.153178119659424, "epoch": 0.18206574596382027, "grad_norm": 1.1484375, "learning_rate": 0.0004998775898498835, "loss": 5.8939, "mean_token_accuracy": 0.1421814054250717, "num_tokens": 4063087.0, "step": 2340 }, { "entropy": 6.121365165710449, "epoch": 0.18245477533553783, "grad_norm": 1.078125, "learning_rate": 0.0004998766740358936, "loss": 5.9531, "mean_token_accuracy": 0.14040177017450334, "num_tokens": 4072309.0, "step": 2345 }, { "entropy": 6.092164039611816, "epoch": 0.1828438047072554, "grad_norm": 1.0, "learning_rate": 0.0004998757548097582, "loss": 5.9948, "mean_token_accuracy": 0.13580115213990213, "num_tokens": 4081017.0, "step": 2350 }, { "entropy": 6.170856666564942, "epoch": 0.18323283407897295, "grad_norm": 1.140625, "learning_rate": 0.0004998748321714911, "loss": 6.0183, "mean_token_accuracy": 0.13338493853807448, "num_tokens": 4089799.0, "step": 2355 }, { "entropy": 6.063455200195312, "epoch": 0.18362186345069054, "grad_norm": 1.1796875, "learning_rate": 0.0004998739061211065, "loss": 5.9271, "mean_token_accuracy": 0.14566840901970862, "num_tokens": 4097948.0, "step": 2360 }, { "entropy": 6.108722352981568, "epoch": 0.1840108928224081, "grad_norm": 1.1171875, "learning_rate": 0.0004998729766586181, "loss": 5.8152, "mean_token_accuracy": 0.14332541227340698, "num_tokens": 4107050.0, "step": 2365 }, { "entropy": 6.023930311203003, "epoch": 0.18439992219412565, "grad_norm": 1.03125, "learning_rate": 0.0004998720437840403, "loss": 5.8309, "mean_token_accuracy": 0.13776944130659102, "num_tokens": 4115547.0, "step": 2370 }, { "entropy": 6.079334878921509, "epoch": 0.1847889515658432, "grad_norm": 1.1015625, "learning_rate": 0.0004998711074973871, "loss": 5.8328, "mean_token_accuracy": 0.14491757974028588, "num_tokens": 4124047.0, "step": 2375 }, { "entropy": 5.999879503250122, "epoch": 0.1851779809375608, "grad_norm": 1.0625, "learning_rate": 0.0004998701677986728, "loss": 5.8029, "mean_token_accuracy": 0.14852844551205635, "num_tokens": 4132005.0, "step": 2380 }, { "entropy": 6.126709222793579, "epoch": 0.18556701030927836, "grad_norm": 1.0859375, "learning_rate": 0.0004998692246879116, "loss": 5.9743, "mean_token_accuracy": 0.13506074547767638, "num_tokens": 4140199.0, "step": 2385 }, { "entropy": 6.115787029266357, "epoch": 0.18595603968099592, "grad_norm": 1.0390625, "learning_rate": 0.0004998682781651178, "loss": 5.9031, "mean_token_accuracy": 0.1383533462882042, "num_tokens": 4149353.0, "step": 2390 }, { "entropy": 5.986810922622681, "epoch": 0.18634506905271347, "grad_norm": 1.0234375, "learning_rate": 0.0004998673282303059, "loss": 5.8724, "mean_token_accuracy": 0.1399594560265541, "num_tokens": 4158531.0, "step": 2395 }, { "entropy": 5.963578128814698, "epoch": 0.18673409842443103, "grad_norm": 1.0078125, "learning_rate": 0.0004998663748834901, "loss": 5.6698, "mean_token_accuracy": 0.15333113372325896, "num_tokens": 4166743.0, "step": 2400 }, { "entropy": 6.126782751083374, "epoch": 0.18712312779614862, "grad_norm": 1.125, "learning_rate": 0.0004998654181246851, "loss": 6.0205, "mean_token_accuracy": 0.13510823845863343, "num_tokens": 4175416.0, "step": 2405 }, { "entropy": 6.130587100982666, "epoch": 0.18751215716786618, "grad_norm": 1.1171875, "learning_rate": 0.0004998644579539052, "loss": 5.9563, "mean_token_accuracy": 0.13990581631660462, "num_tokens": 4185324.0, "step": 2410 }, { "entropy": 6.074210596084595, "epoch": 0.18790118653958374, "grad_norm": 1.0234375, "learning_rate": 0.000499863494371165, "loss": 5.8842, "mean_token_accuracy": 0.14497815519571305, "num_tokens": 4193361.0, "step": 2415 }, { "entropy": 6.126933288574219, "epoch": 0.1882902159113013, "grad_norm": 1.0390625, "learning_rate": 0.0004998625273764793, "loss": 5.9397, "mean_token_accuracy": 0.13277981653809548, "num_tokens": 4202553.0, "step": 2420 }, { "entropy": 6.058669185638427, "epoch": 0.18867924528301888, "grad_norm": 1.1640625, "learning_rate": 0.0004998615569698626, "loss": 5.8727, "mean_token_accuracy": 0.14963430315256118, "num_tokens": 4211585.0, "step": 2425 }, { "entropy": 5.997480392456055, "epoch": 0.18906827465473644, "grad_norm": 1.0703125, "learning_rate": 0.0004998605831513296, "loss": 5.9164, "mean_token_accuracy": 0.13643818199634553, "num_tokens": 4220829.0, "step": 2430 }, { "entropy": 6.057970905303955, "epoch": 0.189457304026454, "grad_norm": 1.125, "learning_rate": 0.0004998596059208953, "loss": 5.8181, "mean_token_accuracy": 0.14352203160524368, "num_tokens": 4228658.0, "step": 2435 }, { "entropy": 6.13070707321167, "epoch": 0.18984633339817156, "grad_norm": 1.046875, "learning_rate": 0.0004998586252785743, "loss": 5.9049, "mean_token_accuracy": 0.1442067116498947, "num_tokens": 4237650.0, "step": 2440 }, { "entropy": 6.030512046813965, "epoch": 0.19023536276988912, "grad_norm": 1.0234375, "learning_rate": 0.0004998576412243816, "loss": 5.8831, "mean_token_accuracy": 0.14705661460757255, "num_tokens": 4246701.0, "step": 2445 }, { "entropy": 6.080326223373413, "epoch": 0.1906243921416067, "grad_norm": 1.125, "learning_rate": 0.0004998566537583321, "loss": 5.8482, "mean_token_accuracy": 0.14321040436625482, "num_tokens": 4254541.0, "step": 2450 }, { "entropy": 6.082454824447632, "epoch": 0.19101342151332426, "grad_norm": 1.0546875, "learning_rate": 0.0004998556628804408, "loss": 5.8831, "mean_token_accuracy": 0.14139181822538377, "num_tokens": 4263111.0, "step": 2455 }, { "entropy": 6.04579610824585, "epoch": 0.19140245088504182, "grad_norm": 1.1015625, "learning_rate": 0.0004998546685907225, "loss": 5.8954, "mean_token_accuracy": 0.14221663847565652, "num_tokens": 4272796.0, "step": 2460 }, { "entropy": 6.009330224990845, "epoch": 0.19179148025675938, "grad_norm": 1.03125, "learning_rate": 0.0004998536708891927, "loss": 5.8127, "mean_token_accuracy": 0.15046731382608414, "num_tokens": 4281361.0, "step": 2465 }, { "entropy": 6.070437002182007, "epoch": 0.19218050962847694, "grad_norm": 1.078125, "learning_rate": 0.0004998526697758663, "loss": 5.8705, "mean_token_accuracy": 0.1421242132782936, "num_tokens": 4290470.0, "step": 2470 }, { "entropy": 6.059012508392334, "epoch": 0.19256953900019452, "grad_norm": 1.09375, "learning_rate": 0.0004998516652507585, "loss": 5.9169, "mean_token_accuracy": 0.13801453858613968, "num_tokens": 4299087.0, "step": 2475 }, { "entropy": 6.017315196990967, "epoch": 0.19295856837191208, "grad_norm": 1.078125, "learning_rate": 0.0004998506573138846, "loss": 5.7824, "mean_token_accuracy": 0.15042203813791274, "num_tokens": 4307572.0, "step": 2480 }, { "entropy": 6.000125503540039, "epoch": 0.19334759774362964, "grad_norm": 1.0546875, "learning_rate": 0.0004998496459652598, "loss": 5.8715, "mean_token_accuracy": 0.14248882085084916, "num_tokens": 4316337.0, "step": 2485 }, { "entropy": 6.117257308959961, "epoch": 0.1937366271153472, "grad_norm": 1.0, "learning_rate": 0.0004998486312048995, "loss": 5.9536, "mean_token_accuracy": 0.14570799991488456, "num_tokens": 4326258.0, "step": 2490 }, { "entropy": 6.035017681121826, "epoch": 0.19412565648706478, "grad_norm": 1.046875, "learning_rate": 0.0004998476130328193, "loss": 5.7979, "mean_token_accuracy": 0.14963613897562028, "num_tokens": 4334711.0, "step": 2495 }, { "entropy": 6.051698970794678, "epoch": 0.19451468585878234, "grad_norm": 0.984375, "learning_rate": 0.0004998465914490343, "loss": 5.8939, "mean_token_accuracy": 0.14221276044845582, "num_tokens": 4343739.0, "step": 2500 }, { "entropy": 6.042819595336914, "epoch": 0.1949037152304999, "grad_norm": 0.94140625, "learning_rate": 0.00049984556645356, "loss": 5.8445, "mean_token_accuracy": 0.1475151002407074, "num_tokens": 4352905.0, "step": 2505 }, { "entropy": 6.109594774246216, "epoch": 0.19529274460221746, "grad_norm": 1.0703125, "learning_rate": 0.0004998445380464124, "loss": 5.8667, "mean_token_accuracy": 0.14822212606668472, "num_tokens": 4361333.0, "step": 2510 }, { "entropy": 5.941962146759034, "epoch": 0.19568177397393502, "grad_norm": 1.015625, "learning_rate": 0.0004998435062276066, "loss": 5.8167, "mean_token_accuracy": 0.14410733431577682, "num_tokens": 4369872.0, "step": 2515 }, { "entropy": 6.0431900978088375, "epoch": 0.1960708033456526, "grad_norm": 1.03125, "learning_rate": 0.0004998424709971586, "loss": 5.894, "mean_token_accuracy": 0.14601442515850066, "num_tokens": 4378097.0, "step": 2520 }, { "entropy": 6.025267696380615, "epoch": 0.19645983271737016, "grad_norm": 1.0390625, "learning_rate": 0.0004998414323550839, "loss": 5.8153, "mean_token_accuracy": 0.14793820455670356, "num_tokens": 4387414.0, "step": 2525 }, { "entropy": 6.09251389503479, "epoch": 0.19684886208908772, "grad_norm": 1.2421875, "learning_rate": 0.0004998403903013984, "loss": 5.9085, "mean_token_accuracy": 0.14772322848439218, "num_tokens": 4395922.0, "step": 2530 }, { "entropy": 5.9777669429779055, "epoch": 0.19723789146080528, "grad_norm": 1.0625, "learning_rate": 0.0004998393448361179, "loss": 5.8766, "mean_token_accuracy": 0.14107875004410744, "num_tokens": 4404500.0, "step": 2535 }, { "entropy": 5.933836650848389, "epoch": 0.19762692083252287, "grad_norm": 1.1328125, "learning_rate": 0.000499838295959258, "loss": 5.8752, "mean_token_accuracy": 0.14383502304553986, "num_tokens": 4413433.0, "step": 2540 }, { "entropy": 6.087890243530273, "epoch": 0.19801595020424043, "grad_norm": 1.0625, "learning_rate": 0.000499837243670835, "loss": 5.8942, "mean_token_accuracy": 0.14684352204203605, "num_tokens": 4421789.0, "step": 2545 }, { "entropy": 5.997798299789428, "epoch": 0.19840497957595798, "grad_norm": 1.0703125, "learning_rate": 0.0004998361879708646, "loss": 5.7573, "mean_token_accuracy": 0.15463868230581285, "num_tokens": 4430256.0, "step": 2550 }, { "entropy": 5.990434455871582, "epoch": 0.19879400894767554, "grad_norm": 1.0390625, "learning_rate": 0.000499835128859363, "loss": 5.8106, "mean_token_accuracy": 0.14735610634088517, "num_tokens": 4438431.0, "step": 2555 }, { "entropy": 6.06252908706665, "epoch": 0.1991830383193931, "grad_norm": 1.0625, "learning_rate": 0.0004998340663363461, "loss": 5.8695, "mean_token_accuracy": 0.1388321965932846, "num_tokens": 4447150.0, "step": 2560 }, { "entropy": 5.991088819503784, "epoch": 0.1995720676911107, "grad_norm": 1.171875, "learning_rate": 0.0004998330004018301, "loss": 5.7606, "mean_token_accuracy": 0.14833912998437881, "num_tokens": 4455181.0, "step": 2565 }, { "entropy": 5.980442047119141, "epoch": 0.19996109706282825, "grad_norm": 1.03125, "learning_rate": 0.0004998319310558312, "loss": 5.7811, "mean_token_accuracy": 0.14660090953111649, "num_tokens": 4463361.0, "step": 2570 }, { "entropy": 6.045340967178345, "epoch": 0.2003501264345458, "grad_norm": 1.1015625, "learning_rate": 0.0004998308582983657, "loss": 5.8407, "mean_token_accuracy": 0.1461796782910824, "num_tokens": 4471853.0, "step": 2575 }, { "entropy": 5.949068546295166, "epoch": 0.20073915580626336, "grad_norm": 1.109375, "learning_rate": 0.0004998297821294497, "loss": 5.774, "mean_token_accuracy": 0.1478642612695694, "num_tokens": 4480812.0, "step": 2580 }, { "entropy": 6.020922899246216, "epoch": 0.20112818517798095, "grad_norm": 1.0, "learning_rate": 0.0004998287025490995, "loss": 5.8249, "mean_token_accuracy": 0.14373451471328735, "num_tokens": 4489180.0, "step": 2585 }, { "entropy": 5.996046781539917, "epoch": 0.2015172145496985, "grad_norm": 1.0625, "learning_rate": 0.0004998276195573317, "loss": 5.8982, "mean_token_accuracy": 0.1447764255106449, "num_tokens": 4498013.0, "step": 2590 }, { "entropy": 6.1362189769744875, "epoch": 0.20190624392141607, "grad_norm": 1.0703125, "learning_rate": 0.0004998265331541627, "loss": 5.9291, "mean_token_accuracy": 0.1334374077618122, "num_tokens": 4506767.0, "step": 2595 }, { "entropy": 6.044833755493164, "epoch": 0.20229527329313363, "grad_norm": 1.0078125, "learning_rate": 0.0004998254433396088, "loss": 5.9371, "mean_token_accuracy": 0.14291547536849974, "num_tokens": 4516657.0, "step": 2600 }, { "entropy": 5.959131669998169, "epoch": 0.20268430266485118, "grad_norm": 1.1484375, "learning_rate": 0.0004998243501136867, "loss": 5.7745, "mean_token_accuracy": 0.15024542286992074, "num_tokens": 4524980.0, "step": 2605 }, { "entropy": 5.998394441604614, "epoch": 0.20307333203656877, "grad_norm": 1.0703125, "learning_rate": 0.0004998232534764129, "loss": 5.8389, "mean_token_accuracy": 0.14741490185260772, "num_tokens": 4533236.0, "step": 2610 }, { "entropy": 5.903755569458008, "epoch": 0.20346236140828633, "grad_norm": 1.1015625, "learning_rate": 0.0004998221534278041, "loss": 5.7399, "mean_token_accuracy": 0.14562903121113777, "num_tokens": 4541778.0, "step": 2615 }, { "entropy": 6.064036464691162, "epoch": 0.2038513907800039, "grad_norm": 1.03125, "learning_rate": 0.0004998210499678769, "loss": 5.8538, "mean_token_accuracy": 0.1419381931424141, "num_tokens": 4551131.0, "step": 2620 }, { "entropy": 6.035385370254517, "epoch": 0.20424042015172145, "grad_norm": 1.0390625, "learning_rate": 0.0004998199430966481, "loss": 5.8297, "mean_token_accuracy": 0.14448252841830253, "num_tokens": 4559530.0, "step": 2625 }, { "entropy": 5.848511409759522, "epoch": 0.20462944952343903, "grad_norm": 1.0859375, "learning_rate": 0.0004998188328141346, "loss": 5.7181, "mean_token_accuracy": 0.1512894958257675, "num_tokens": 4567533.0, "step": 2630 }, { "entropy": 6.118367338180542, "epoch": 0.2050184788951566, "grad_norm": 1.0390625, "learning_rate": 0.0004998177191203531, "loss": 5.8612, "mean_token_accuracy": 0.14240461885929107, "num_tokens": 4576414.0, "step": 2635 }, { "entropy": 5.999768924713135, "epoch": 0.20540750826687415, "grad_norm": 1.0859375, "learning_rate": 0.0004998166020153204, "loss": 5.7924, "mean_token_accuracy": 0.1489753618836403, "num_tokens": 4585331.0, "step": 2640 }, { "entropy": 6.012185764312744, "epoch": 0.2057965376385917, "grad_norm": 1.0859375, "learning_rate": 0.0004998154814990538, "loss": 5.8307, "mean_token_accuracy": 0.14780088663101196, "num_tokens": 4593526.0, "step": 2645 }, { "entropy": 5.972072982788086, "epoch": 0.20618556701030927, "grad_norm": 1.0859375, "learning_rate": 0.00049981435757157, "loss": 5.8305, "mean_token_accuracy": 0.1450671598315239, "num_tokens": 4602400.0, "step": 2650 }, { "entropy": 5.94981198310852, "epoch": 0.20657459638202685, "grad_norm": 1.1171875, "learning_rate": 0.0004998132302328862, "loss": 5.7735, "mean_token_accuracy": 0.14710604920983314, "num_tokens": 4611037.0, "step": 2655 }, { "entropy": 6.004731702804565, "epoch": 0.2069636257537444, "grad_norm": 1.0546875, "learning_rate": 0.0004998120994830195, "loss": 5.7756, "mean_token_accuracy": 0.14985849261283873, "num_tokens": 4619030.0, "step": 2660 }, { "entropy": 5.977835988998413, "epoch": 0.20735265512546197, "grad_norm": 0.984375, "learning_rate": 0.000499810965321987, "loss": 5.7949, "mean_token_accuracy": 0.14194909781217574, "num_tokens": 4628649.0, "step": 2665 }, { "entropy": 5.940742921829224, "epoch": 0.20774168449717953, "grad_norm": 0.99609375, "learning_rate": 0.0004998098277498059, "loss": 5.6989, "mean_token_accuracy": 0.14827831983566284, "num_tokens": 4636935.0, "step": 2670 }, { "entropy": 5.9714634895324705, "epoch": 0.2081307138688971, "grad_norm": 1.140625, "learning_rate": 0.0004998086867664934, "loss": 5.8852, "mean_token_accuracy": 0.1452195018529892, "num_tokens": 4645532.0, "step": 2675 }, { "entropy": 6.067996883392334, "epoch": 0.20851974324061467, "grad_norm": 1.03125, "learning_rate": 0.000499807542372067, "loss": 5.958, "mean_token_accuracy": 0.1363249361515045, "num_tokens": 4654433.0, "step": 2680 }, { "entropy": 6.098356103897094, "epoch": 0.20890877261233223, "grad_norm": 1.109375, "learning_rate": 0.0004998063945665439, "loss": 5.9518, "mean_token_accuracy": 0.1396227262914181, "num_tokens": 4662913.0, "step": 2685 }, { "entropy": 6.0581354141235355, "epoch": 0.2092978019840498, "grad_norm": 0.97265625, "learning_rate": 0.0004998052433499416, "loss": 5.9174, "mean_token_accuracy": 0.13971545100212096, "num_tokens": 4672270.0, "step": 2690 }, { "entropy": 6.120678234100342, "epoch": 0.20968683135576735, "grad_norm": 1.078125, "learning_rate": 0.0004998040887222776, "loss": 5.9615, "mean_token_accuracy": 0.14097035080194473, "num_tokens": 4681428.0, "step": 2695 }, { "entropy": 6.031071949005127, "epoch": 0.21007586072748494, "grad_norm": 1.0703125, "learning_rate": 0.0004998029306835693, "loss": 5.7864, "mean_token_accuracy": 0.14907388389110565, "num_tokens": 4690492.0, "step": 2700 }, { "entropy": 6.025369882583618, "epoch": 0.2104648900992025, "grad_norm": 0.9765625, "learning_rate": 0.0004998017692338344, "loss": 5.9018, "mean_token_accuracy": 0.14205559343099594, "num_tokens": 4699667.0, "step": 2705 }, { "entropy": 5.896922922134399, "epoch": 0.21085391947092005, "grad_norm": 1.1015625, "learning_rate": 0.0004998006043730905, "loss": 5.5889, "mean_token_accuracy": 0.156715589761734, "num_tokens": 4708529.0, "step": 2710 }, { "entropy": 5.875597381591797, "epoch": 0.2112429488426376, "grad_norm": 1.078125, "learning_rate": 0.0004997994361013551, "loss": 5.8478, "mean_token_accuracy": 0.1417768731713295, "num_tokens": 4717684.0, "step": 2715 }, { "entropy": 5.999152946472168, "epoch": 0.21163197821435517, "grad_norm": 0.9765625, "learning_rate": 0.0004997982644186461, "loss": 5.7645, "mean_token_accuracy": 0.15027033016085625, "num_tokens": 4727067.0, "step": 2720 }, { "entropy": 5.941830015182495, "epoch": 0.21202100758607276, "grad_norm": 1.0859375, "learning_rate": 0.0004997970893249813, "loss": 5.7409, "mean_token_accuracy": 0.15033891201019287, "num_tokens": 4735434.0, "step": 2725 }, { "entropy": 5.998355436325073, "epoch": 0.21241003695779032, "grad_norm": 1.0625, "learning_rate": 0.0004997959108203785, "loss": 5.7831, "mean_token_accuracy": 0.15076861307024955, "num_tokens": 4743843.0, "step": 2730 }, { "entropy": 6.021811771392822, "epoch": 0.21279906632950787, "grad_norm": 0.96875, "learning_rate": 0.0004997947289048554, "loss": 5.8298, "mean_token_accuracy": 0.14842365086078643, "num_tokens": 4753228.0, "step": 2735 }, { "entropy": 6.014471864700317, "epoch": 0.21318809570122543, "grad_norm": 1.1015625, "learning_rate": 0.0004997935435784302, "loss": 5.9131, "mean_token_accuracy": 0.14402995258569717, "num_tokens": 4763401.0, "step": 2740 }, { "entropy": 5.965554714202881, "epoch": 0.21357712507294302, "grad_norm": 1.09375, "learning_rate": 0.0004997923548411208, "loss": 5.7771, "mean_token_accuracy": 0.1451819881796837, "num_tokens": 4771812.0, "step": 2745 }, { "entropy": 5.930664920806885, "epoch": 0.21396615444466058, "grad_norm": 1.0703125, "learning_rate": 0.000499791162692945, "loss": 5.799, "mean_token_accuracy": 0.14840952157974244, "num_tokens": 4780616.0, "step": 2750 }, { "entropy": 5.959417247772217, "epoch": 0.21435518381637814, "grad_norm": 1.0859375, "learning_rate": 0.0004997899671339214, "loss": 5.7985, "mean_token_accuracy": 0.14958962947130203, "num_tokens": 4789886.0, "step": 2755 }, { "entropy": 5.933303451538086, "epoch": 0.2147442131880957, "grad_norm": 1.03125, "learning_rate": 0.0004997887681640675, "loss": 5.7753, "mean_token_accuracy": 0.14589939936995505, "num_tokens": 4799189.0, "step": 2760 }, { "entropy": 6.007724142074585, "epoch": 0.21513324255981325, "grad_norm": 1.09375, "learning_rate": 0.0004997875657834021, "loss": 5.821, "mean_token_accuracy": 0.15184845104813577, "num_tokens": 4807850.0, "step": 2765 }, { "entropy": 6.024917030334473, "epoch": 0.21552227193153084, "grad_norm": 1.09375, "learning_rate": 0.0004997863599919432, "loss": 5.7387, "mean_token_accuracy": 0.15238860324025155, "num_tokens": 4815742.0, "step": 2770 }, { "entropy": 5.997466993331909, "epoch": 0.2159113013032484, "grad_norm": 1.0546875, "learning_rate": 0.0004997851507897089, "loss": 5.8285, "mean_token_accuracy": 0.14630141407251357, "num_tokens": 4824761.0, "step": 2775 }, { "entropy": 6.0686828136444095, "epoch": 0.21630033067496596, "grad_norm": 1.1484375, "learning_rate": 0.0004997839381767178, "loss": 5.9577, "mean_token_accuracy": 0.1376100316643715, "num_tokens": 4832805.0, "step": 2780 }, { "entropy": 5.969825267791748, "epoch": 0.21668936004668352, "grad_norm": 1.015625, "learning_rate": 0.0004997827221529882, "loss": 5.8107, "mean_token_accuracy": 0.14742545261979104, "num_tokens": 4841938.0, "step": 2785 }, { "entropy": 5.980387020111084, "epoch": 0.2170783894184011, "grad_norm": 1.015625, "learning_rate": 0.0004997815027185386, "loss": 5.8302, "mean_token_accuracy": 0.1437895864248276, "num_tokens": 4849932.0, "step": 2790 }, { "entropy": 5.921569156646728, "epoch": 0.21746741879011866, "grad_norm": 1.0546875, "learning_rate": 0.0004997802798733874, "loss": 5.6874, "mean_token_accuracy": 0.15188782587647437, "num_tokens": 4859054.0, "step": 2795 }, { "entropy": 6.0102729320526125, "epoch": 0.21785644816183622, "grad_norm": 1.0859375, "learning_rate": 0.0004997790536175534, "loss": 5.8669, "mean_token_accuracy": 0.14981231167912484, "num_tokens": 4867415.0, "step": 2800 }, { "entropy": 6.026336431503296, "epoch": 0.21824547753355378, "grad_norm": 1.1015625, "learning_rate": 0.0004997778239510548, "loss": 5.8956, "mean_token_accuracy": 0.1462355837225914, "num_tokens": 4875965.0, "step": 2805 }, { "entropy": 5.998291397094727, "epoch": 0.21863450690527134, "grad_norm": 1.0, "learning_rate": 0.0004997765908739106, "loss": 5.7996, "mean_token_accuracy": 0.14824215620756148, "num_tokens": 4884629.0, "step": 2810 }, { "entropy": 5.994702625274658, "epoch": 0.21902353627698892, "grad_norm": 1.0703125, "learning_rate": 0.0004997753543861395, "loss": 5.8435, "mean_token_accuracy": 0.1457155279815197, "num_tokens": 4893573.0, "step": 2815 }, { "entropy": 5.932880544662476, "epoch": 0.21941256564870648, "grad_norm": 0.99609375, "learning_rate": 0.00049977411448776, "loss": 5.7718, "mean_token_accuracy": 0.1455760970711708, "num_tokens": 4902831.0, "step": 2820 }, { "entropy": 6.032305574417114, "epoch": 0.21980159502042404, "grad_norm": 1.0390625, "learning_rate": 0.0004997728711787912, "loss": 5.8263, "mean_token_accuracy": 0.14247847720980644, "num_tokens": 4911360.0, "step": 2825 }, { "entropy": 5.986047887802124, "epoch": 0.2201906243921416, "grad_norm": 1.15625, "learning_rate": 0.0004997716244592518, "loss": 5.7947, "mean_token_accuracy": 0.142076013982296, "num_tokens": 4919758.0, "step": 2830 }, { "entropy": 5.846888208389283, "epoch": 0.22057965376385918, "grad_norm": 1.0078125, "learning_rate": 0.0004997703743291607, "loss": 5.6693, "mean_token_accuracy": 0.15803906843066215, "num_tokens": 4928934.0, "step": 2835 }, { "entropy": 5.908144187927246, "epoch": 0.22096868313557674, "grad_norm": 1.0390625, "learning_rate": 0.000499769120788537, "loss": 5.7258, "mean_token_accuracy": 0.1486142821609974, "num_tokens": 4937780.0, "step": 2840 }, { "entropy": 6.082314538955688, "epoch": 0.2213577125072943, "grad_norm": 1.078125, "learning_rate": 0.0004997678638373995, "loss": 5.8261, "mean_token_accuracy": 0.1448799580335617, "num_tokens": 4946862.0, "step": 2845 }, { "entropy": 5.94984769821167, "epoch": 0.22174674187901186, "grad_norm": 1.046875, "learning_rate": 0.0004997666034757676, "loss": 5.8049, "mean_token_accuracy": 0.1516811653971672, "num_tokens": 4954883.0, "step": 2850 }, { "entropy": 5.85023832321167, "epoch": 0.22213577125072942, "grad_norm": 1.1015625, "learning_rate": 0.0004997653397036603, "loss": 5.6035, "mean_token_accuracy": 0.15844471007585526, "num_tokens": 4962840.0, "step": 2855 }, { "entropy": 5.935201215744018, "epoch": 0.222524800622447, "grad_norm": 1.078125, "learning_rate": 0.0004997640725210965, "loss": 5.8358, "mean_token_accuracy": 0.14835945665836334, "num_tokens": 4972334.0, "step": 2860 }, { "entropy": 5.970633888244629, "epoch": 0.22291382999416456, "grad_norm": 1.0546875, "learning_rate": 0.0004997628019280958, "loss": 5.8008, "mean_token_accuracy": 0.1477268561720848, "num_tokens": 4981032.0, "step": 2865 }, { "entropy": 5.974843454360962, "epoch": 0.22330285936588212, "grad_norm": 1.0390625, "learning_rate": 0.0004997615279246773, "loss": 5.8054, "mean_token_accuracy": 0.14543402120471, "num_tokens": 4990502.0, "step": 2870 }, { "entropy": 6.052269506454468, "epoch": 0.22369188873759968, "grad_norm": 1.1171875, "learning_rate": 0.0004997602505108603, "loss": 5.9916, "mean_token_accuracy": 0.13957195803523065, "num_tokens": 4999121.0, "step": 2875 }, { "entropy": 5.986846828460694, "epoch": 0.22408091810931724, "grad_norm": 1.0, "learning_rate": 0.0004997589696866644, "loss": 5.7363, "mean_token_accuracy": 0.15012581199407576, "num_tokens": 5007271.0, "step": 2880 }, { "entropy": 5.880199956893921, "epoch": 0.22446994748103483, "grad_norm": 1.15625, "learning_rate": 0.0004997576854521088, "loss": 5.7994, "mean_token_accuracy": 0.143898157030344, "num_tokens": 5015940.0, "step": 2885 }, { "entropy": 5.899425983428955, "epoch": 0.22485897685275238, "grad_norm": 0.9921875, "learning_rate": 0.000499756397807213, "loss": 5.7234, "mean_token_accuracy": 0.1511826515197754, "num_tokens": 5024294.0, "step": 2890 }, { "entropy": 5.997026634216309, "epoch": 0.22524800622446994, "grad_norm": 1.0625, "learning_rate": 0.0004997551067519966, "loss": 5.6722, "mean_token_accuracy": 0.1542857527732849, "num_tokens": 5033401.0, "step": 2895 }, { "entropy": 5.861394643783569, "epoch": 0.2256370355961875, "grad_norm": 1.0703125, "learning_rate": 0.0004997538122864792, "loss": 5.7638, "mean_token_accuracy": 0.14565517976880074, "num_tokens": 5041955.0, "step": 2900 }, { "entropy": 5.918551397323609, "epoch": 0.2260260649679051, "grad_norm": 1.03125, "learning_rate": 0.0004997525144106804, "loss": 5.8115, "mean_token_accuracy": 0.14099842831492423, "num_tokens": 5051132.0, "step": 2905 }, { "entropy": 5.935513830184936, "epoch": 0.22641509433962265, "grad_norm": 1.0078125, "learning_rate": 0.00049975121312462, "loss": 5.7359, "mean_token_accuracy": 0.15899298340082169, "num_tokens": 5059492.0, "step": 2910 }, { "entropy": 5.87189130783081, "epoch": 0.2268041237113402, "grad_norm": 1.078125, "learning_rate": 0.0004997499084283177, "loss": 5.7837, "mean_token_accuracy": 0.1493110865354538, "num_tokens": 5069015.0, "step": 2915 }, { "entropy": 5.9538294792175295, "epoch": 0.22719315308305776, "grad_norm": 1.0546875, "learning_rate": 0.0004997486003217932, "loss": 5.7948, "mean_token_accuracy": 0.14656500220298768, "num_tokens": 5077614.0, "step": 2920 }, { "entropy": 5.937190008163452, "epoch": 0.22758218245477532, "grad_norm": 1.0625, "learning_rate": 0.0004997472888050664, "loss": 5.724, "mean_token_accuracy": 0.15037651658058165, "num_tokens": 5086300.0, "step": 2925 }, { "entropy": 5.855981540679932, "epoch": 0.2279712118264929, "grad_norm": 1.0546875, "learning_rate": 0.0004997459738781573, "loss": 5.7738, "mean_token_accuracy": 0.1492456465959549, "num_tokens": 5095967.0, "step": 2930 }, { "entropy": 5.961302804946899, "epoch": 0.22836024119821047, "grad_norm": 1.03125, "learning_rate": 0.0004997446555410857, "loss": 5.7319, "mean_token_accuracy": 0.148114612698555, "num_tokens": 5104611.0, "step": 2935 }, { "entropy": 5.902946662902832, "epoch": 0.22874927056992803, "grad_norm": 0.96484375, "learning_rate": 0.0004997433337938716, "loss": 5.6867, "mean_token_accuracy": 0.15346912294626236, "num_tokens": 5113452.0, "step": 2940 }, { "entropy": 5.822092819213867, "epoch": 0.22913829994164558, "grad_norm": 1.0390625, "learning_rate": 0.0004997420086365351, "loss": 5.6718, "mean_token_accuracy": 0.15292285978794098, "num_tokens": 5121558.0, "step": 2945 }, { "entropy": 5.884310340881347, "epoch": 0.22952732931336317, "grad_norm": 1.1484375, "learning_rate": 0.0004997406800690966, "loss": 5.6482, "mean_token_accuracy": 0.16208126842975618, "num_tokens": 5129942.0, "step": 2950 }, { "entropy": 5.936553859710694, "epoch": 0.22991635868508073, "grad_norm": 1.0390625, "learning_rate": 0.0004997393480915758, "loss": 5.7766, "mean_token_accuracy": 0.1436438135802746, "num_tokens": 5139012.0, "step": 2955 }, { "entropy": 5.977424049377442, "epoch": 0.2303053880567983, "grad_norm": 1.0859375, "learning_rate": 0.0004997380127039931, "loss": 5.7831, "mean_token_accuracy": 0.14895185455679893, "num_tokens": 5148185.0, "step": 2960 }, { "entropy": 5.966456031799316, "epoch": 0.23069441742851585, "grad_norm": 0.99609375, "learning_rate": 0.0004997366739063688, "loss": 5.808, "mean_token_accuracy": 0.14403805360198021, "num_tokens": 5157086.0, "step": 2965 }, { "entropy": 6.039245176315307, "epoch": 0.2310834468002334, "grad_norm": 1.046875, "learning_rate": 0.0004997353316987231, "loss": 5.871, "mean_token_accuracy": 0.1416305460035801, "num_tokens": 5165842.0, "step": 2970 }, { "entropy": 5.9533428192138675, "epoch": 0.231472476171951, "grad_norm": 1.0234375, "learning_rate": 0.0004997339860810765, "loss": 5.8666, "mean_token_accuracy": 0.14629089161753656, "num_tokens": 5174161.0, "step": 2975 }, { "entropy": 5.932276821136474, "epoch": 0.23186150554366855, "grad_norm": 1.0546875, "learning_rate": 0.0004997326370534495, "loss": 5.8232, "mean_token_accuracy": 0.144809553027153, "num_tokens": 5183830.0, "step": 2980 }, { "entropy": 5.911020135879516, "epoch": 0.2322505349153861, "grad_norm": 1.1484375, "learning_rate": 0.0004997312846158622, "loss": 5.7319, "mean_token_accuracy": 0.14793932288885117, "num_tokens": 5192248.0, "step": 2985 }, { "entropy": 5.829217910766602, "epoch": 0.23263956428710367, "grad_norm": 1.046875, "learning_rate": 0.0004997299287683355, "loss": 5.7053, "mean_token_accuracy": 0.15378875881433487, "num_tokens": 5201212.0, "step": 2990 }, { "entropy": 5.876448011398315, "epoch": 0.23302859365882125, "grad_norm": 1.0546875, "learning_rate": 0.0004997285695108898, "loss": 5.7687, "mean_token_accuracy": 0.1468915194272995, "num_tokens": 5209338.0, "step": 2995 }, { "entropy": 6.041135358810425, "epoch": 0.2334176230305388, "grad_norm": 0.99609375, "learning_rate": 0.0004997272068435458, "loss": 5.7828, "mean_token_accuracy": 0.147082382440567, "num_tokens": 5217590.0, "step": 3000 }, { "epoch": 0.2334176230305388, "eval_entropy": 5.745479221086988, "eval_loss": 5.805346488952637, "eval_mean_token_accuracy": 0.15537624003812026, "eval_num_tokens": 5217590.0, "eval_runtime": 21.6146, "eval_samples_per_second": 1922.684, "eval_steps_per_second": 240.347, "step": 3000 }, { "entropy": 5.862835884094238, "epoch": 0.23380665240225637, "grad_norm": 0.98828125, "learning_rate": 0.000499725840766324, "loss": 5.6977, "mean_token_accuracy": 0.15283167362213135, "num_tokens": 5226383.0, "step": 3005 }, { "entropy": 5.940398120880127, "epoch": 0.23419568177397393, "grad_norm": 0.921875, "learning_rate": 0.0004997244712792453, "loss": 5.7304, "mean_token_accuracy": 0.15186440497636794, "num_tokens": 5235517.0, "step": 3010 }, { "entropy": 5.985174703598022, "epoch": 0.2345847111456915, "grad_norm": 1.0859375, "learning_rate": 0.0004997230983823305, "loss": 5.7156, "mean_token_accuracy": 0.15750928670167924, "num_tokens": 5243812.0, "step": 3015 }, { "entropy": 5.887314510345459, "epoch": 0.23497374051740907, "grad_norm": 0.9765625, "learning_rate": 0.0004997217220756003, "loss": 5.7189, "mean_token_accuracy": 0.15049459934234619, "num_tokens": 5252399.0, "step": 3020 }, { "entropy": 5.908802223205567, "epoch": 0.23536276988912663, "grad_norm": 1.015625, "learning_rate": 0.0004997203423590757, "loss": 5.7499, "mean_token_accuracy": 0.1497652493417263, "num_tokens": 5260847.0, "step": 3025 }, { "entropy": 5.948167753219605, "epoch": 0.2357517992608442, "grad_norm": 1.078125, "learning_rate": 0.0004997189592327775, "loss": 5.8329, "mean_token_accuracy": 0.1460947275161743, "num_tokens": 5268847.0, "step": 3030 }, { "entropy": 5.982191753387451, "epoch": 0.23614082863256175, "grad_norm": 1.0078125, "learning_rate": 0.0004997175726967268, "loss": 5.7558, "mean_token_accuracy": 0.14891543239355087, "num_tokens": 5277989.0, "step": 3035 }, { "entropy": 5.815080404281616, "epoch": 0.23652985800427934, "grad_norm": 1.078125, "learning_rate": 0.0004997161827509447, "loss": 5.7623, "mean_token_accuracy": 0.15036816596984864, "num_tokens": 5286272.0, "step": 3040 }, { "entropy": 5.897141027450561, "epoch": 0.2369188873759969, "grad_norm": 1.0390625, "learning_rate": 0.0004997147893954521, "loss": 5.7553, "mean_token_accuracy": 0.15387040227651597, "num_tokens": 5295281.0, "step": 3045 }, { "entropy": 5.974369812011719, "epoch": 0.23730791674771445, "grad_norm": 1.1015625, "learning_rate": 0.0004997133926302702, "loss": 5.7105, "mean_token_accuracy": 0.14991148561239243, "num_tokens": 5303905.0, "step": 3050 }, { "entropy": 5.873412418365478, "epoch": 0.237696946119432, "grad_norm": 1.078125, "learning_rate": 0.0004997119924554204, "loss": 5.687, "mean_token_accuracy": 0.1482005760073662, "num_tokens": 5313146.0, "step": 3055 }, { "entropy": 5.887405920028686, "epoch": 0.23808597549114957, "grad_norm": 0.99609375, "learning_rate": 0.0004997105888709236, "loss": 5.7235, "mean_token_accuracy": 0.15186246931552888, "num_tokens": 5320838.0, "step": 3060 }, { "entropy": 5.908910322189331, "epoch": 0.23847500486286716, "grad_norm": 1.0390625, "learning_rate": 0.0004997091818768015, "loss": 5.7509, "mean_token_accuracy": 0.1518412262201309, "num_tokens": 5329312.0, "step": 3065 }, { "entropy": 5.869619989395142, "epoch": 0.23886403423458472, "grad_norm": 1.0703125, "learning_rate": 0.000499707771473075, "loss": 5.7412, "mean_token_accuracy": 0.15202742367982863, "num_tokens": 5337747.0, "step": 3070 }, { "entropy": 5.9338490009307865, "epoch": 0.23925306360630227, "grad_norm": 1.0234375, "learning_rate": 0.0004997063576597659, "loss": 5.7333, "mean_token_accuracy": 0.15094367563724517, "num_tokens": 5346928.0, "step": 3075 }, { "entropy": 5.900696659088135, "epoch": 0.23964209297801983, "grad_norm": 1.046875, "learning_rate": 0.0004997049404368954, "loss": 5.7581, "mean_token_accuracy": 0.1485590822994709, "num_tokens": 5355827.0, "step": 3080 }, { "entropy": 5.995998096466065, "epoch": 0.2400311223497374, "grad_norm": 1.0546875, "learning_rate": 0.000499703519804485, "loss": 5.8744, "mean_token_accuracy": 0.14193669930100442, "num_tokens": 5364309.0, "step": 3085 }, { "entropy": 5.94293532371521, "epoch": 0.24042015172145498, "grad_norm": 1.0390625, "learning_rate": 0.0004997020957625564, "loss": 5.7683, "mean_token_accuracy": 0.15073340982198716, "num_tokens": 5372979.0, "step": 3090 }, { "entropy": 5.888595533370972, "epoch": 0.24080918109317254, "grad_norm": 0.96484375, "learning_rate": 0.0004997006683111312, "loss": 5.7505, "mean_token_accuracy": 0.14528402984142302, "num_tokens": 5381809.0, "step": 3095 }, { "entropy": 5.973602533340454, "epoch": 0.2411982104648901, "grad_norm": 1.0859375, "learning_rate": 0.000499699237450231, "loss": 5.7928, "mean_token_accuracy": 0.1505873367190361, "num_tokens": 5390036.0, "step": 3100 }, { "entropy": 6.0370574474334715, "epoch": 0.24158723983660765, "grad_norm": 1.015625, "learning_rate": 0.0004996978031798774, "loss": 5.8516, "mean_token_accuracy": 0.14484131932258607, "num_tokens": 5398739.0, "step": 3105 }, { "entropy": 5.894684076309204, "epoch": 0.24197626920832524, "grad_norm": 0.9921875, "learning_rate": 0.0004996963655000924, "loss": 5.7647, "mean_token_accuracy": 0.149184250831604, "num_tokens": 5407441.0, "step": 3110 }, { "entropy": 5.943358516693115, "epoch": 0.2423652985800428, "grad_norm": 1.0390625, "learning_rate": 0.0004996949244108977, "loss": 5.7116, "mean_token_accuracy": 0.14837338477373124, "num_tokens": 5416534.0, "step": 3115 }, { "entropy": 5.914983034133911, "epoch": 0.24275432795176036, "grad_norm": 1.015625, "learning_rate": 0.000499693479912315, "loss": 5.7721, "mean_token_accuracy": 0.1526084750890732, "num_tokens": 5425170.0, "step": 3120 }, { "entropy": 5.8383172988891605, "epoch": 0.24314335732347792, "grad_norm": 1.0625, "learning_rate": 0.0004996920320043666, "loss": 5.7394, "mean_token_accuracy": 0.1426021859049797, "num_tokens": 5433721.0, "step": 3125 }, { "entropy": 5.985742807388306, "epoch": 0.24353238669519547, "grad_norm": 1.0546875, "learning_rate": 0.0004996905806870742, "loss": 5.7984, "mean_token_accuracy": 0.14674716889858247, "num_tokens": 5441708.0, "step": 3130 }, { "entropy": 5.8728574275970455, "epoch": 0.24392141606691306, "grad_norm": 1.0546875, "learning_rate": 0.0004996891259604598, "loss": 5.6953, "mean_token_accuracy": 0.15019447654485701, "num_tokens": 5449942.0, "step": 3135 }, { "entropy": 5.941146516799927, "epoch": 0.24431044543863062, "grad_norm": 1.0703125, "learning_rate": 0.0004996876678245455, "loss": 5.7229, "mean_token_accuracy": 0.15215176492929458, "num_tokens": 5458004.0, "step": 3140 }, { "entropy": 5.9605811595916744, "epoch": 0.24469947481034818, "grad_norm": 1.015625, "learning_rate": 0.0004996862062793536, "loss": 5.8024, "mean_token_accuracy": 0.14993125721812248, "num_tokens": 5467071.0, "step": 3145 }, { "entropy": 5.911229848861694, "epoch": 0.24508850418206574, "grad_norm": 0.98046875, "learning_rate": 0.0004996847413249061, "loss": 5.7739, "mean_token_accuracy": 0.15182917267084123, "num_tokens": 5476221.0, "step": 3150 }, { "entropy": 5.919036197662353, "epoch": 0.24547753355378332, "grad_norm": 1.015625, "learning_rate": 0.0004996832729612252, "loss": 5.7022, "mean_token_accuracy": 0.15160031914710997, "num_tokens": 5484549.0, "step": 3155 }, { "entropy": 5.81336932182312, "epoch": 0.24586656292550088, "grad_norm": 1.09375, "learning_rate": 0.0004996818011883333, "loss": 5.7017, "mean_token_accuracy": 0.1576054573059082, "num_tokens": 5492909.0, "step": 3160 }, { "entropy": 5.887171792984009, "epoch": 0.24625559229721844, "grad_norm": 1.046875, "learning_rate": 0.0004996803260062527, "loss": 5.7394, "mean_token_accuracy": 0.15224794745445253, "num_tokens": 5501418.0, "step": 3165 }, { "entropy": 5.92157883644104, "epoch": 0.246644621668936, "grad_norm": 1.0234375, "learning_rate": 0.0004996788474150057, "loss": 5.7461, "mean_token_accuracy": 0.14818776100873948, "num_tokens": 5510609.0, "step": 3170 }, { "entropy": 5.827919673919678, "epoch": 0.24703365104065356, "grad_norm": 1.1640625, "learning_rate": 0.0004996773654146149, "loss": 5.5989, "mean_token_accuracy": 0.1590520143508911, "num_tokens": 5518349.0, "step": 3175 }, { "entropy": 5.784766435623169, "epoch": 0.24742268041237114, "grad_norm": 1.015625, "learning_rate": 0.0004996758800051026, "loss": 5.5514, "mean_token_accuracy": 0.16138913482427597, "num_tokens": 5526972.0, "step": 3180 }, { "entropy": 5.846664333343506, "epoch": 0.2478117097840887, "grad_norm": 1.0078125, "learning_rate": 0.0004996743911864916, "loss": 5.7182, "mean_token_accuracy": 0.14989619702100754, "num_tokens": 5535683.0, "step": 3185 }, { "entropy": 5.819127082824707, "epoch": 0.24820073915580626, "grad_norm": 1.0546875, "learning_rate": 0.0004996728989588041, "loss": 5.6818, "mean_token_accuracy": 0.1583881087601185, "num_tokens": 5544258.0, "step": 3190 }, { "entropy": 5.786135149002075, "epoch": 0.24858976852752382, "grad_norm": 1.0703125, "learning_rate": 0.0004996714033220632, "loss": 5.6991, "mean_token_accuracy": 0.14900739789009093, "num_tokens": 5552608.0, "step": 3195 }, { "entropy": 5.917917776107788, "epoch": 0.2489787978992414, "grad_norm": 0.94921875, "learning_rate": 0.0004996699042762911, "loss": 5.8147, "mean_token_accuracy": 0.1450411006808281, "num_tokens": 5561357.0, "step": 3200 }, { "entropy": 5.957511854171753, "epoch": 0.24936782727095896, "grad_norm": 1.0, "learning_rate": 0.0004996684018215111, "loss": 5.6472, "mean_token_accuracy": 0.16130171865224838, "num_tokens": 5569862.0, "step": 3205 }, { "entropy": 5.823313760757446, "epoch": 0.24975685664267652, "grad_norm": 1.078125, "learning_rate": 0.0004996668959577453, "loss": 5.7183, "mean_token_accuracy": 0.15448436588048936, "num_tokens": 5578485.0, "step": 3210 }, { "entropy": 5.858618497848511, "epoch": 0.2501458860143941, "grad_norm": 0.9140625, "learning_rate": 0.0004996653866850173, "loss": 5.6987, "mean_token_accuracy": 0.1483453944325447, "num_tokens": 5587713.0, "step": 3215 }, { "entropy": 5.905856943130493, "epoch": 0.25053491538611167, "grad_norm": 1.0390625, "learning_rate": 0.0004996638740033495, "loss": 5.7683, "mean_token_accuracy": 0.15061864107847214, "num_tokens": 5596541.0, "step": 3220 }, { "entropy": 5.824166011810303, "epoch": 0.2509239447578292, "grad_norm": 0.9609375, "learning_rate": 0.0004996623579127651, "loss": 5.6473, "mean_token_accuracy": 0.15734103843569755, "num_tokens": 5605573.0, "step": 3225 }, { "entropy": 5.868488788604736, "epoch": 0.2513129741295468, "grad_norm": 1.046875, "learning_rate": 0.0004996608384132868, "loss": 5.6594, "mean_token_accuracy": 0.15387704223394394, "num_tokens": 5614016.0, "step": 3230 }, { "entropy": 5.972904205322266, "epoch": 0.25170200350126437, "grad_norm": 1.015625, "learning_rate": 0.000499659315504938, "loss": 5.8798, "mean_token_accuracy": 0.1461018592119217, "num_tokens": 5622451.0, "step": 3235 }, { "entropy": 5.87816424369812, "epoch": 0.2520910328729819, "grad_norm": 1.296875, "learning_rate": 0.0004996577891877417, "loss": 5.719, "mean_token_accuracy": 0.15081416219472885, "num_tokens": 5631384.0, "step": 3240 }, { "entropy": 5.922952270507812, "epoch": 0.2524800622446995, "grad_norm": 1.015625, "learning_rate": 0.0004996562594617209, "loss": 5.6895, "mean_token_accuracy": 0.15270936638116836, "num_tokens": 5640726.0, "step": 3245 }, { "entropy": 5.879611396789551, "epoch": 0.252869091616417, "grad_norm": 1.109375, "learning_rate": 0.0004996547263268991, "loss": 5.6954, "mean_token_accuracy": 0.15027550160884856, "num_tokens": 5648948.0, "step": 3250 }, { "entropy": 5.7275628566741945, "epoch": 0.2532581209881346, "grad_norm": 1.078125, "learning_rate": 0.0004996531897832993, "loss": 5.65, "mean_token_accuracy": 0.1583116427063942, "num_tokens": 5657951.0, "step": 3255 }, { "entropy": 5.944765377044678, "epoch": 0.2536471503598522, "grad_norm": 0.97265625, "learning_rate": 0.000499651649830945, "loss": 5.7658, "mean_token_accuracy": 0.15232782810926437, "num_tokens": 5667476.0, "step": 3260 }, { "entropy": 5.905933570861817, "epoch": 0.2540361797315697, "grad_norm": 0.96875, "learning_rate": 0.0004996501064698593, "loss": 5.77, "mean_token_accuracy": 0.1492228925228119, "num_tokens": 5676627.0, "step": 3265 }, { "entropy": 5.85449366569519, "epoch": 0.2544252091032873, "grad_norm": 1.1484375, "learning_rate": 0.000499648559700066, "loss": 5.7119, "mean_token_accuracy": 0.15356220155954362, "num_tokens": 5684376.0, "step": 3270 }, { "entropy": 5.971212577819824, "epoch": 0.25481423847500484, "grad_norm": 1.0234375, "learning_rate": 0.0004996470095215884, "loss": 5.8714, "mean_token_accuracy": 0.1364065058529377, "num_tokens": 5693629.0, "step": 3275 }, { "entropy": 5.968133783340454, "epoch": 0.2552032678467224, "grad_norm": 1.1171875, "learning_rate": 0.0004996454559344498, "loss": 5.7528, "mean_token_accuracy": 0.1514081761240959, "num_tokens": 5702010.0, "step": 3280 }, { "entropy": 5.786150693893433, "epoch": 0.25559229721844, "grad_norm": 1.078125, "learning_rate": 0.0004996438989386741, "loss": 5.6462, "mean_token_accuracy": 0.15590638667345047, "num_tokens": 5710823.0, "step": 3285 }, { "entropy": 5.8355076789855955, "epoch": 0.25598132659015754, "grad_norm": 1.0546875, "learning_rate": 0.0004996423385342847, "loss": 5.7047, "mean_token_accuracy": 0.15430673509836196, "num_tokens": 5719389.0, "step": 3290 }, { "entropy": 5.8981376647949215, "epoch": 0.25637035596187513, "grad_norm": 1.09375, "learning_rate": 0.0004996407747213055, "loss": 5.7159, "mean_token_accuracy": 0.15026010125875472, "num_tokens": 5727327.0, "step": 3295 }, { "entropy": 5.861189365386963, "epoch": 0.25675938533359266, "grad_norm": 0.9921875, "learning_rate": 0.00049963920749976, "loss": 5.609, "mean_token_accuracy": 0.16035784035921097, "num_tokens": 5735886.0, "step": 3300 }, { "entropy": 5.825350904464722, "epoch": 0.25714841470531025, "grad_norm": 0.9921875, "learning_rate": 0.0004996376368696721, "loss": 5.649, "mean_token_accuracy": 0.15595559626817704, "num_tokens": 5744656.0, "step": 3305 }, { "entropy": 5.91638069152832, "epoch": 0.25753744407702783, "grad_norm": 1.0234375, "learning_rate": 0.0004996360628310656, "loss": 5.8249, "mean_token_accuracy": 0.14670005738735198, "num_tokens": 5753026.0, "step": 3310 }, { "entropy": 5.902420473098755, "epoch": 0.25792647344874536, "grad_norm": 1.078125, "learning_rate": 0.0004996344853839644, "loss": 5.7532, "mean_token_accuracy": 0.1508739858865738, "num_tokens": 5762771.0, "step": 3315 }, { "entropy": 5.813096714019776, "epoch": 0.25831550282046295, "grad_norm": 1.03125, "learning_rate": 0.0004996329045283924, "loss": 5.7379, "mean_token_accuracy": 0.1582916796207428, "num_tokens": 5771151.0, "step": 3320 }, { "entropy": 5.851997327804566, "epoch": 0.25870453219218054, "grad_norm": 1.0546875, "learning_rate": 0.0004996313202643737, "loss": 5.6458, "mean_token_accuracy": 0.15273822695016862, "num_tokens": 5780648.0, "step": 3325 }, { "entropy": 5.861184453964233, "epoch": 0.25909356156389807, "grad_norm": 0.99609375, "learning_rate": 0.0004996297325919321, "loss": 5.6307, "mean_token_accuracy": 0.15040383338928223, "num_tokens": 5789698.0, "step": 3330 }, { "entropy": 5.891029977798462, "epoch": 0.25948259093561565, "grad_norm": 1.0703125, "learning_rate": 0.0004996281415110919, "loss": 5.8184, "mean_token_accuracy": 0.14279821440577506, "num_tokens": 5799218.0, "step": 3335 }, { "entropy": 5.821232509613037, "epoch": 0.2598716203073332, "grad_norm": 0.98046875, "learning_rate": 0.0004996265470218773, "loss": 5.6975, "mean_token_accuracy": 0.15069891512393951, "num_tokens": 5808455.0, "step": 3340 }, { "entropy": 5.908162641525268, "epoch": 0.26026064967905077, "grad_norm": 1.1015625, "learning_rate": 0.0004996249491243122, "loss": 5.7226, "mean_token_accuracy": 0.14941658973693847, "num_tokens": 5816464.0, "step": 3345 }, { "entropy": 5.841771650314331, "epoch": 0.26064967905076836, "grad_norm": 1.0546875, "learning_rate": 0.0004996233478184211, "loss": 5.6819, "mean_token_accuracy": 0.15169447436928749, "num_tokens": 5825188.0, "step": 3350 }, { "entropy": 5.898590850830078, "epoch": 0.2610387084224859, "grad_norm": 1.125, "learning_rate": 0.0004996217431042282, "loss": 5.7252, "mean_token_accuracy": 0.15503444373607636, "num_tokens": 5834150.0, "step": 3355 }, { "entropy": 5.847413158416748, "epoch": 0.2614277377942035, "grad_norm": 1.0078125, "learning_rate": 0.000499620134981758, "loss": 5.5782, "mean_token_accuracy": 0.1629167377948761, "num_tokens": 5842801.0, "step": 3360 }, { "entropy": 5.793002605438232, "epoch": 0.261816767165921, "grad_norm": 1.046875, "learning_rate": 0.0004996185234510346, "loss": 5.6255, "mean_token_accuracy": 0.1601943254470825, "num_tokens": 5851547.0, "step": 3365 }, { "entropy": 5.932187223434449, "epoch": 0.2622057965376386, "grad_norm": 1.0, "learning_rate": 0.0004996169085120828, "loss": 5.7676, "mean_token_accuracy": 0.15287947207689284, "num_tokens": 5860430.0, "step": 3370 }, { "entropy": 5.81215090751648, "epoch": 0.2625948259093562, "grad_norm": 0.96875, "learning_rate": 0.0004996152901649268, "loss": 5.6576, "mean_token_accuracy": 0.15576451867818833, "num_tokens": 5869648.0, "step": 3375 }, { "entropy": 5.932130193710327, "epoch": 0.2629838552810737, "grad_norm": 1.015625, "learning_rate": 0.0004996136684095913, "loss": 5.6687, "mean_token_accuracy": 0.15645158290863037, "num_tokens": 5878606.0, "step": 3380 }, { "entropy": 5.818367958068848, "epoch": 0.2633728846527913, "grad_norm": 0.984375, "learning_rate": 0.0004996120432461009, "loss": 5.7468, "mean_token_accuracy": 0.15218595266342164, "num_tokens": 5886772.0, "step": 3385 }, { "entropy": 5.805695343017578, "epoch": 0.2637619140245088, "grad_norm": 1.015625, "learning_rate": 0.0004996104146744804, "loss": 5.6477, "mean_token_accuracy": 0.1543953076004982, "num_tokens": 5895007.0, "step": 3390 }, { "entropy": 5.982627630233765, "epoch": 0.2641509433962264, "grad_norm": 1.0234375, "learning_rate": 0.0004996087826947541, "loss": 5.775, "mean_token_accuracy": 0.14896861910820008, "num_tokens": 5904249.0, "step": 3395 }, { "entropy": 5.806077241897583, "epoch": 0.264539972767944, "grad_norm": 1.1015625, "learning_rate": 0.0004996071473069471, "loss": 5.729, "mean_token_accuracy": 0.15165796950459481, "num_tokens": 5911416.0, "step": 3400 }, { "entropy": 5.891200923919678, "epoch": 0.26492900213966153, "grad_norm": 0.9921875, "learning_rate": 0.0004996055085110842, "loss": 5.7745, "mean_token_accuracy": 0.14715634509921074, "num_tokens": 5920370.0, "step": 3405 }, { "entropy": 5.907678842544556, "epoch": 0.2653180315113791, "grad_norm": 0.99609375, "learning_rate": 0.0004996038663071902, "loss": 5.7279, "mean_token_accuracy": 0.1560338944196701, "num_tokens": 5928884.0, "step": 3410 }, { "entropy": 5.8364808559417725, "epoch": 0.26570706088309665, "grad_norm": 1.0234375, "learning_rate": 0.0004996022206952901, "loss": 5.7516, "mean_token_accuracy": 0.142772651463747, "num_tokens": 5938456.0, "step": 3415 }, { "entropy": 5.983996152877808, "epoch": 0.26609609025481423, "grad_norm": 1.0390625, "learning_rate": 0.0004996005716754086, "loss": 5.7893, "mean_token_accuracy": 0.15027910396456717, "num_tokens": 5947157.0, "step": 3420 }, { "entropy": 5.902491044998169, "epoch": 0.2664851196265318, "grad_norm": 1.0078125, "learning_rate": 0.000499598919247571, "loss": 5.6287, "mean_token_accuracy": 0.16299375891685486, "num_tokens": 5956084.0, "step": 3425 }, { "entropy": 5.794814205169677, "epoch": 0.26687414899824935, "grad_norm": 1.0234375, "learning_rate": 0.0004995972634118023, "loss": 5.6765, "mean_token_accuracy": 0.15660672038793563, "num_tokens": 5964782.0, "step": 3430 }, { "entropy": 5.972515344619751, "epoch": 0.26726317836996694, "grad_norm": 0.984375, "learning_rate": 0.0004995956041681277, "loss": 5.8994, "mean_token_accuracy": 0.14056409224867822, "num_tokens": 5974013.0, "step": 3435 }, { "entropy": 5.953153657913208, "epoch": 0.2676522077416845, "grad_norm": 0.97265625, "learning_rate": 0.0004995939415165722, "loss": 5.7584, "mean_token_accuracy": 0.14940284192562103, "num_tokens": 5983351.0, "step": 3440 }, { "entropy": 5.763549518585205, "epoch": 0.26804123711340205, "grad_norm": 1.0078125, "learning_rate": 0.0004995922754571611, "loss": 5.5958, "mean_token_accuracy": 0.16312941908836365, "num_tokens": 5992084.0, "step": 3445 }, { "entropy": 5.723555326461792, "epoch": 0.26843026648511964, "grad_norm": 0.95703125, "learning_rate": 0.0004995906059899197, "loss": 5.61, "mean_token_accuracy": 0.1542106583714485, "num_tokens": 6001043.0, "step": 3450 }, { "entropy": 5.816799783706665, "epoch": 0.26881929585683717, "grad_norm": 0.99609375, "learning_rate": 0.0004995889331148733, "loss": 5.6236, "mean_token_accuracy": 0.15134564638137818, "num_tokens": 6009620.0, "step": 3455 }, { "entropy": 5.787903308868408, "epoch": 0.26920832522855476, "grad_norm": 1.1171875, "learning_rate": 0.0004995872568320474, "loss": 5.6296, "mean_token_accuracy": 0.15400015860795974, "num_tokens": 6018278.0, "step": 3460 }, { "entropy": 5.747702503204346, "epoch": 0.26959735460027234, "grad_norm": 1.015625, "learning_rate": 0.0004995855771414673, "loss": 5.6716, "mean_token_accuracy": 0.15881235152482986, "num_tokens": 6026741.0, "step": 3465 }, { "entropy": 5.963505649566651, "epoch": 0.2699863839719899, "grad_norm": 1.015625, "learning_rate": 0.0004995838940431585, "loss": 5.6997, "mean_token_accuracy": 0.15211729407310487, "num_tokens": 6035370.0, "step": 3470 }, { "entropy": 5.8460045337677, "epoch": 0.27037541334370746, "grad_norm": 1.03125, "learning_rate": 0.0004995822075371466, "loss": 5.6696, "mean_token_accuracy": 0.15098004043102264, "num_tokens": 6044372.0, "step": 3475 }, { "entropy": 5.772753095626831, "epoch": 0.270764442715425, "grad_norm": 1.0390625, "learning_rate": 0.0004995805176234571, "loss": 5.6944, "mean_token_accuracy": 0.1576540380716324, "num_tokens": 6052940.0, "step": 3480 }, { "entropy": 5.886135625839233, "epoch": 0.2711534720871426, "grad_norm": 1.0859375, "learning_rate": 0.0004995788243021158, "loss": 5.6215, "mean_token_accuracy": 0.15520101338624953, "num_tokens": 6062048.0, "step": 3485 }, { "entropy": 5.798374605178833, "epoch": 0.27154250145886016, "grad_norm": 0.9375, "learning_rate": 0.0004995771275731483, "loss": 5.6319, "mean_token_accuracy": 0.1564753457903862, "num_tokens": 6071478.0, "step": 3490 }, { "entropy": 5.730036306381225, "epoch": 0.2719315308305777, "grad_norm": 1.03125, "learning_rate": 0.0004995754274365802, "loss": 5.5841, "mean_token_accuracy": 0.16150409132242202, "num_tokens": 6080495.0, "step": 3495 }, { "entropy": 5.864993762969971, "epoch": 0.2723205602022953, "grad_norm": 0.98046875, "learning_rate": 0.0004995737238924376, "loss": 5.7258, "mean_token_accuracy": 0.14979194104671478, "num_tokens": 6090141.0, "step": 3500 }, { "entropy": 5.888671731948852, "epoch": 0.2727095895740128, "grad_norm": 1.0078125, "learning_rate": 0.0004995720169407461, "loss": 5.7003, "mean_token_accuracy": 0.1482359305024147, "num_tokens": 6099215.0, "step": 3505 }, { "entropy": 5.928614854812622, "epoch": 0.2730986189457304, "grad_norm": 0.97265625, "learning_rate": 0.0004995703065815317, "loss": 5.781, "mean_token_accuracy": 0.1452876403927803, "num_tokens": 6108802.0, "step": 3510 }, { "entropy": 5.899406576156617, "epoch": 0.273487648317448, "grad_norm": 0.96484375, "learning_rate": 0.0004995685928148203, "loss": 5.7651, "mean_token_accuracy": 0.1519528865814209, "num_tokens": 6117486.0, "step": 3515 }, { "entropy": 5.771115303039551, "epoch": 0.2738766776891655, "grad_norm": 1.125, "learning_rate": 0.000499566875640638, "loss": 5.5847, "mean_token_accuracy": 0.16556673794984816, "num_tokens": 6125248.0, "step": 3520 }, { "entropy": 5.865322780609131, "epoch": 0.2742657070608831, "grad_norm": 0.95703125, "learning_rate": 0.0004995651550590108, "loss": 5.6499, "mean_token_accuracy": 0.1568447843194008, "num_tokens": 6134831.0, "step": 3525 }, { "entropy": 5.824641561508178, "epoch": 0.2746547364326007, "grad_norm": 0.9765625, "learning_rate": 0.0004995634310699647, "loss": 5.7241, "mean_token_accuracy": 0.15021293833851815, "num_tokens": 6143248.0, "step": 3530 }, { "entropy": 5.92924017906189, "epoch": 0.2750437658043182, "grad_norm": 1.109375, "learning_rate": 0.0004995617036735261, "loss": 5.7329, "mean_token_accuracy": 0.1525756947696209, "num_tokens": 6151768.0, "step": 3535 }, { "entropy": 5.816738557815552, "epoch": 0.2754327951760358, "grad_norm": 1.0234375, "learning_rate": 0.0004995599728697211, "loss": 5.614, "mean_token_accuracy": 0.16288287937641144, "num_tokens": 6160091.0, "step": 3540 }, { "entropy": 5.843801975250244, "epoch": 0.27582182454775334, "grad_norm": 1.015625, "learning_rate": 0.0004995582386585759, "loss": 5.7373, "mean_token_accuracy": 0.1442616179585457, "num_tokens": 6169440.0, "step": 3545 }, { "entropy": 5.833621549606323, "epoch": 0.2762108539194709, "grad_norm": 1.0625, "learning_rate": 0.0004995565010401167, "loss": 5.6777, "mean_token_accuracy": 0.15748906433582305, "num_tokens": 6177604.0, "step": 3550 }, { "entropy": 5.864107942581176, "epoch": 0.2765998832911885, "grad_norm": 1.0234375, "learning_rate": 0.0004995547600143702, "loss": 5.7003, "mean_token_accuracy": 0.14799479395151138, "num_tokens": 6186252.0, "step": 3555 }, { "entropy": 5.782134962081909, "epoch": 0.27698891266290604, "grad_norm": 1.03125, "learning_rate": 0.0004995530155813625, "loss": 5.647, "mean_token_accuracy": 0.15824104249477386, "num_tokens": 6194641.0, "step": 3560 }, { "entropy": 5.902602052688598, "epoch": 0.2773779420346236, "grad_norm": 0.9765625, "learning_rate": 0.0004995512677411203, "loss": 5.7762, "mean_token_accuracy": 0.14909671768546104, "num_tokens": 6203925.0, "step": 3565 }, { "entropy": 5.928490161895752, "epoch": 0.27776697140634116, "grad_norm": 1.1015625, "learning_rate": 0.0004995495164936698, "loss": 5.6625, "mean_token_accuracy": 0.15092431008815765, "num_tokens": 6213001.0, "step": 3570 }, { "entropy": 5.808505439758301, "epoch": 0.27815600077805874, "grad_norm": 0.91796875, "learning_rate": 0.0004995477618390381, "loss": 5.6875, "mean_token_accuracy": 0.14438140839338304, "num_tokens": 6221754.0, "step": 3575 }, { "entropy": 5.779090499877929, "epoch": 0.27854503014977633, "grad_norm": 0.9921875, "learning_rate": 0.0004995460037772513, "loss": 5.5788, "mean_token_accuracy": 0.1568375810980797, "num_tokens": 6229792.0, "step": 3580 }, { "entropy": 5.779662370681763, "epoch": 0.27893405952149386, "grad_norm": 0.9140625, "learning_rate": 0.0004995442423083365, "loss": 5.6599, "mean_token_accuracy": 0.15357850790023803, "num_tokens": 6238839.0, "step": 3585 }, { "entropy": 5.85211501121521, "epoch": 0.27932308889321145, "grad_norm": 1.0625, "learning_rate": 0.0004995424774323201, "loss": 5.5682, "mean_token_accuracy": 0.16091491729021073, "num_tokens": 6246939.0, "step": 3590 }, { "entropy": 5.865459680557251, "epoch": 0.279712118264929, "grad_norm": 0.9765625, "learning_rate": 0.000499540709149229, "loss": 5.7006, "mean_token_accuracy": 0.15096115618944167, "num_tokens": 6255858.0, "step": 3595 }, { "entropy": 5.769324588775635, "epoch": 0.28010114763664656, "grad_norm": 1.0703125, "learning_rate": 0.0004995389374590901, "loss": 5.625, "mean_token_accuracy": 0.1556652620434761, "num_tokens": 6265137.0, "step": 3600 }, { "entropy": 5.815653467178345, "epoch": 0.28049017700836415, "grad_norm": 1.0234375, "learning_rate": 0.0004995371623619301, "loss": 5.6376, "mean_token_accuracy": 0.15269655138254165, "num_tokens": 6273286.0, "step": 3605 }, { "entropy": 5.734041976928711, "epoch": 0.2808792063800817, "grad_norm": 0.97265625, "learning_rate": 0.000499535383857776, "loss": 5.6569, "mean_token_accuracy": 0.15289225429296494, "num_tokens": 6282477.0, "step": 3610 }, { "entropy": 5.840460300445557, "epoch": 0.28126823575179927, "grad_norm": 1.015625, "learning_rate": 0.000499533601946655, "loss": 5.6878, "mean_token_accuracy": 0.15312220752239228, "num_tokens": 6291756.0, "step": 3615 }, { "entropy": 5.885938024520874, "epoch": 0.2816572651235168, "grad_norm": 1.0390625, "learning_rate": 0.0004995318166285938, "loss": 5.7617, "mean_token_accuracy": 0.14861457124352456, "num_tokens": 6301093.0, "step": 3620 }, { "entropy": 5.819167995452881, "epoch": 0.2820462944952344, "grad_norm": 1.09375, "learning_rate": 0.0004995300279036199, "loss": 5.5723, "mean_token_accuracy": 0.1582958698272705, "num_tokens": 6310379.0, "step": 3625 }, { "entropy": 5.771732759475708, "epoch": 0.28243532386695197, "grad_norm": 1.0625, "learning_rate": 0.00049952823577176, "loss": 5.6152, "mean_token_accuracy": 0.15469675064086913, "num_tokens": 6318983.0, "step": 3630 }, { "entropy": 5.784991931915283, "epoch": 0.2828243532386695, "grad_norm": 1.0234375, "learning_rate": 0.0004995264402330416, "loss": 5.6046, "mean_token_accuracy": 0.15919178277254104, "num_tokens": 6327816.0, "step": 3635 }, { "entropy": 5.768844318389893, "epoch": 0.2832133826103871, "grad_norm": 1.0234375, "learning_rate": 0.0004995246412874919, "loss": 5.6904, "mean_token_accuracy": 0.15365249216556548, "num_tokens": 6336693.0, "step": 3640 }, { "entropy": 5.82958459854126, "epoch": 0.2836024119821047, "grad_norm": 1.0078125, "learning_rate": 0.000499522838935138, "loss": 5.6174, "mean_token_accuracy": 0.15765645503997802, "num_tokens": 6345456.0, "step": 3645 }, { "entropy": 5.795063829421997, "epoch": 0.2839914413538222, "grad_norm": 1.1171875, "learning_rate": 0.0004995210331760074, "loss": 5.6223, "mean_token_accuracy": 0.16065620630979538, "num_tokens": 6353584.0, "step": 3650 }, { "entropy": 5.761292266845703, "epoch": 0.2843804707255398, "grad_norm": 0.984375, "learning_rate": 0.0004995192240101275, "loss": 5.6538, "mean_token_accuracy": 0.15679923743009566, "num_tokens": 6362258.0, "step": 3655 }, { "entropy": 5.786276054382324, "epoch": 0.2847695000972573, "grad_norm": 0.96484375, "learning_rate": 0.0004995174114375258, "loss": 5.5671, "mean_token_accuracy": 0.1589123472571373, "num_tokens": 6371373.0, "step": 3660 }, { "entropy": 5.836294841766358, "epoch": 0.2851585294689749, "grad_norm": 1.0234375, "learning_rate": 0.0004995155954582297, "loss": 5.6458, "mean_token_accuracy": 0.1591172069311142, "num_tokens": 6380431.0, "step": 3665 }, { "entropy": 5.8760663032531735, "epoch": 0.2855475588406925, "grad_norm": 1.0390625, "learning_rate": 0.0004995137760722668, "loss": 5.7963, "mean_token_accuracy": 0.15557733029127122, "num_tokens": 6389305.0, "step": 3670 }, { "entropy": 5.843765306472778, "epoch": 0.28593658821241, "grad_norm": 0.98046875, "learning_rate": 0.0004995119532796646, "loss": 5.6244, "mean_token_accuracy": 0.16239040046930314, "num_tokens": 6397065.0, "step": 3675 }, { "entropy": 5.798708438873291, "epoch": 0.2863256175841276, "grad_norm": 0.96875, "learning_rate": 0.000499510127080451, "loss": 5.7606, "mean_token_accuracy": 0.14602240175008774, "num_tokens": 6407053.0, "step": 3680 }, { "entropy": 5.877055644989014, "epoch": 0.28671464695584514, "grad_norm": 1.0703125, "learning_rate": 0.0004995082974746535, "loss": 5.7204, "mean_token_accuracy": 0.15210573226213456, "num_tokens": 6415165.0, "step": 3685 }, { "entropy": 5.877712726593018, "epoch": 0.28710367632756273, "grad_norm": 0.94140625, "learning_rate": 0.0004995064644622999, "loss": 5.6941, "mean_token_accuracy": 0.1575799763202667, "num_tokens": 6423646.0, "step": 3690 }, { "entropy": 5.808514022827149, "epoch": 0.2874927056992803, "grad_norm": 1.0546875, "learning_rate": 0.0004995046280434181, "loss": 5.7094, "mean_token_accuracy": 0.15264169871807098, "num_tokens": 6432134.0, "step": 3695 }, { "entropy": 5.832041025161743, "epoch": 0.28788173507099785, "grad_norm": 1.0, "learning_rate": 0.0004995027882180358, "loss": 5.6063, "mean_token_accuracy": 0.1572796657681465, "num_tokens": 6440456.0, "step": 3700 }, { "entropy": 5.835405588150024, "epoch": 0.28827076444271543, "grad_norm": 1.0234375, "learning_rate": 0.0004995009449861812, "loss": 5.6916, "mean_token_accuracy": 0.14945697486400605, "num_tokens": 6448952.0, "step": 3705 }, { "entropy": 5.773239278793335, "epoch": 0.28865979381443296, "grad_norm": 0.96484375, "learning_rate": 0.000499499098347882, "loss": 5.5347, "mean_token_accuracy": 0.16946829110383987, "num_tokens": 6457225.0, "step": 3710 }, { "entropy": 5.796914863586426, "epoch": 0.28904882318615055, "grad_norm": 1.0, "learning_rate": 0.0004994972483031662, "loss": 5.6842, "mean_token_accuracy": 0.1543801799416542, "num_tokens": 6465450.0, "step": 3715 }, { "entropy": 5.822849369049072, "epoch": 0.28943785255786814, "grad_norm": 1.09375, "learning_rate": 0.000499495394852062, "loss": 5.7131, "mean_token_accuracy": 0.14737720638513566, "num_tokens": 6473736.0, "step": 3720 }, { "entropy": 5.834820890426636, "epoch": 0.28982688192958567, "grad_norm": 1.03125, "learning_rate": 0.0004994935379945977, "loss": 5.6667, "mean_token_accuracy": 0.15716438889503478, "num_tokens": 6482092.0, "step": 3725 }, { "entropy": 5.822330474853516, "epoch": 0.29021591130130325, "grad_norm": 1.0625, "learning_rate": 0.0004994916777308012, "loss": 5.6749, "mean_token_accuracy": 0.1561664879322052, "num_tokens": 6490704.0, "step": 3730 }, { "entropy": 5.91683177947998, "epoch": 0.29060494067302084, "grad_norm": 1.0703125, "learning_rate": 0.0004994898140607007, "loss": 5.6009, "mean_token_accuracy": 0.1599688485264778, "num_tokens": 6499634.0, "step": 3735 }, { "entropy": 5.731499719619751, "epoch": 0.29099397004473837, "grad_norm": 1.0078125, "learning_rate": 0.0004994879469843247, "loss": 5.7682, "mean_token_accuracy": 0.14854224994778634, "num_tokens": 6509261.0, "step": 3740 }, { "entropy": 5.84810438156128, "epoch": 0.29138299941645596, "grad_norm": 0.94921875, "learning_rate": 0.0004994860765017013, "loss": 5.6243, "mean_token_accuracy": 0.15548288971185684, "num_tokens": 6517542.0, "step": 3745 }, { "entropy": 5.8257911682128904, "epoch": 0.2917720287881735, "grad_norm": 1.03125, "learning_rate": 0.000499484202612859, "loss": 5.6009, "mean_token_accuracy": 0.1555945947766304, "num_tokens": 6525945.0, "step": 3750 }, { "entropy": 5.738781452178955, "epoch": 0.2921610581598911, "grad_norm": 0.97265625, "learning_rate": 0.0004994823253178264, "loss": 5.628, "mean_token_accuracy": 0.1553563207387924, "num_tokens": 6534744.0, "step": 3755 }, { "entropy": 5.771017980575562, "epoch": 0.29255008753160866, "grad_norm": 1.125, "learning_rate": 0.0004994804446166317, "loss": 5.5867, "mean_token_accuracy": 0.16410646140575408, "num_tokens": 6542640.0, "step": 3760 }, { "entropy": 5.816923141479492, "epoch": 0.2929391169033262, "grad_norm": 1.1171875, "learning_rate": 0.0004994785605093035, "loss": 5.6569, "mean_token_accuracy": 0.16179122030735016, "num_tokens": 6551292.0, "step": 3765 }, { "entropy": 5.832165241241455, "epoch": 0.2933281462750438, "grad_norm": 1.03125, "learning_rate": 0.0004994766729958705, "loss": 5.7297, "mean_token_accuracy": 0.15468698143959045, "num_tokens": 6560760.0, "step": 3770 }, { "entropy": 5.898743486404419, "epoch": 0.2937171756467613, "grad_norm": 1.0078125, "learning_rate": 0.0004994747820763612, "loss": 5.7414, "mean_token_accuracy": 0.15264707952737808, "num_tokens": 6570618.0, "step": 3775 }, { "entropy": 5.82996940612793, "epoch": 0.2941062050184789, "grad_norm": 1.0703125, "learning_rate": 0.0004994728877508046, "loss": 5.6129, "mean_token_accuracy": 0.15315211713314056, "num_tokens": 6579484.0, "step": 3780 }, { "entropy": 5.785426616668701, "epoch": 0.2944952343901965, "grad_norm": 0.98828125, "learning_rate": 0.0004994709900192289, "loss": 5.6532, "mean_token_accuracy": 0.15257718414068222, "num_tokens": 6588531.0, "step": 3785 }, { "entropy": 5.844866418838501, "epoch": 0.294884263761914, "grad_norm": 1.0078125, "learning_rate": 0.0004994690888816635, "loss": 5.7293, "mean_token_accuracy": 0.15567389279603958, "num_tokens": 6596862.0, "step": 3790 }, { "entropy": 5.764641141891479, "epoch": 0.2952732931336316, "grad_norm": 0.9609375, "learning_rate": 0.0004994671843381367, "loss": 5.6292, "mean_token_accuracy": 0.15766787976026536, "num_tokens": 6605594.0, "step": 3795 }, { "entropy": 5.838379144668579, "epoch": 0.29566232250534913, "grad_norm": 1.140625, "learning_rate": 0.0004994652763886778, "loss": 5.6635, "mean_token_accuracy": 0.16003731936216353, "num_tokens": 6613971.0, "step": 3800 }, { "entropy": 5.8031247615814205, "epoch": 0.2960513518770667, "grad_norm": 0.95703125, "learning_rate": 0.0004994633650333155, "loss": 5.7493, "mean_token_accuracy": 0.14524856358766555, "num_tokens": 6623116.0, "step": 3805 }, { "entropy": 5.873272895812988, "epoch": 0.2964403812487843, "grad_norm": 1.015625, "learning_rate": 0.0004994614502720792, "loss": 5.6158, "mean_token_accuracy": 0.16138359159231186, "num_tokens": 6631910.0, "step": 3810 }, { "entropy": 5.811766481399536, "epoch": 0.29682941062050183, "grad_norm": 0.98046875, "learning_rate": 0.0004994595321049974, "loss": 5.6467, "mean_token_accuracy": 0.16312259137630464, "num_tokens": 6640882.0, "step": 3815 }, { "entropy": 5.884197998046875, "epoch": 0.2972184399922194, "grad_norm": 0.95703125, "learning_rate": 0.0004994576105320994, "loss": 5.7315, "mean_token_accuracy": 0.1533009871840477, "num_tokens": 6649665.0, "step": 3820 }, { "entropy": 5.775503635406494, "epoch": 0.29760746936393695, "grad_norm": 0.96484375, "learning_rate": 0.0004994556855534146, "loss": 5.4815, "mean_token_accuracy": 0.1663750559091568, "num_tokens": 6658725.0, "step": 3825 }, { "entropy": 5.686539030075073, "epoch": 0.29799649873565454, "grad_norm": 1.0234375, "learning_rate": 0.0004994537571689719, "loss": 5.551, "mean_token_accuracy": 0.1626267284154892, "num_tokens": 6667403.0, "step": 3830 }, { "entropy": 5.8347007751464846, "epoch": 0.2983855281073721, "grad_norm": 0.9765625, "learning_rate": 0.0004994518253788007, "loss": 5.6452, "mean_token_accuracy": 0.15373515188694, "num_tokens": 6676673.0, "step": 3835 }, { "entropy": 5.848038959503174, "epoch": 0.29877455747908965, "grad_norm": 1.015625, "learning_rate": 0.0004994498901829304, "loss": 5.6342, "mean_token_accuracy": 0.1482851818203926, "num_tokens": 6686212.0, "step": 3840 }, { "entropy": 5.783165359497071, "epoch": 0.29916358685080724, "grad_norm": 1.03125, "learning_rate": 0.0004994479515813903, "loss": 5.6406, "mean_token_accuracy": 0.15525024384260178, "num_tokens": 6694812.0, "step": 3845 }, { "entropy": 5.783064556121826, "epoch": 0.2995526162225248, "grad_norm": 0.99609375, "learning_rate": 0.0004994460095742096, "loss": 5.6195, "mean_token_accuracy": 0.15523335412144662, "num_tokens": 6703439.0, "step": 3850 }, { "entropy": 5.826699924468994, "epoch": 0.29994164559424236, "grad_norm": 1.015625, "learning_rate": 0.000499444064161418, "loss": 5.5879, "mean_token_accuracy": 0.15931765511631965, "num_tokens": 6711465.0, "step": 3855 }, { "entropy": 5.7629138946533205, "epoch": 0.30033067496595994, "grad_norm": 0.95703125, "learning_rate": 0.000499442115343045, "loss": 5.6205, "mean_token_accuracy": 0.15265668630599977, "num_tokens": 6720526.0, "step": 3860 }, { "entropy": 5.88586049079895, "epoch": 0.3007197043376775, "grad_norm": 1.078125, "learning_rate": 0.0004994401631191202, "loss": 5.806, "mean_token_accuracy": 0.14357833117246627, "num_tokens": 6728696.0, "step": 3865 }, { "entropy": 5.805546855926513, "epoch": 0.30110873370939506, "grad_norm": 0.96875, "learning_rate": 0.0004994382074896731, "loss": 5.6646, "mean_token_accuracy": 0.1538841776549816, "num_tokens": 6737955.0, "step": 3870 }, { "entropy": 5.837248516082764, "epoch": 0.30149776308111265, "grad_norm": 1.0703125, "learning_rate": 0.0004994362484547335, "loss": 5.7355, "mean_token_accuracy": 0.14724683314561843, "num_tokens": 6746413.0, "step": 3875 }, { "entropy": 5.749407148361206, "epoch": 0.3018867924528302, "grad_norm": 1.0078125, "learning_rate": 0.0004994342860143309, "loss": 5.5684, "mean_token_accuracy": 0.16013670861721038, "num_tokens": 6754341.0, "step": 3880 }, { "entropy": 5.644632148742676, "epoch": 0.30227582182454776, "grad_norm": 0.99609375, "learning_rate": 0.0004994323201684953, "loss": 5.4565, "mean_token_accuracy": 0.1645071476697922, "num_tokens": 6762623.0, "step": 3885 }, { "entropy": 5.780033159255981, "epoch": 0.3026648511962653, "grad_norm": 0.953125, "learning_rate": 0.0004994303509172566, "loss": 5.6016, "mean_token_accuracy": 0.1589878648519516, "num_tokens": 6771270.0, "step": 3890 }, { "entropy": 5.81092095375061, "epoch": 0.3030538805679829, "grad_norm": 0.92578125, "learning_rate": 0.0004994283782606444, "loss": 5.6675, "mean_token_accuracy": 0.15384138971567154, "num_tokens": 6780292.0, "step": 3895 }, { "entropy": 5.825908756256103, "epoch": 0.30344290993970047, "grad_norm": 1.046875, "learning_rate": 0.0004994264021986888, "loss": 5.5621, "mean_token_accuracy": 0.15870441645383834, "num_tokens": 6788580.0, "step": 3900 }, { "entropy": 5.66625018119812, "epoch": 0.303831939311418, "grad_norm": 1.140625, "learning_rate": 0.0004994244227314197, "loss": 5.5613, "mean_token_accuracy": 0.1561402976512909, "num_tokens": 6796801.0, "step": 3905 }, { "entropy": 5.754960536956787, "epoch": 0.3042209686831356, "grad_norm": 0.95703125, "learning_rate": 0.0004994224398588672, "loss": 5.5446, "mean_token_accuracy": 0.16153970509767532, "num_tokens": 6805630.0, "step": 3910 }, { "entropy": 5.659200811386109, "epoch": 0.3046099980548531, "grad_norm": 0.9921875, "learning_rate": 0.0004994204535810615, "loss": 5.5523, "mean_token_accuracy": 0.16061975955963134, "num_tokens": 6814316.0, "step": 3915 }, { "entropy": 5.887920093536377, "epoch": 0.3049990274265707, "grad_norm": 1.1015625, "learning_rate": 0.0004994184638980326, "loss": 5.7088, "mean_token_accuracy": 0.15016086995601655, "num_tokens": 6823224.0, "step": 3920 }, { "entropy": 5.86029953956604, "epoch": 0.3053880567982883, "grad_norm": 0.97265625, "learning_rate": 0.0004994164708098107, "loss": 5.7397, "mean_token_accuracy": 0.14942816495895386, "num_tokens": 6832104.0, "step": 3925 }, { "entropy": 5.820219278335571, "epoch": 0.3057770861700058, "grad_norm": 0.99609375, "learning_rate": 0.000499414474316426, "loss": 5.6379, "mean_token_accuracy": 0.15939020812511445, "num_tokens": 6841208.0, "step": 3930 }, { "entropy": 5.628757429122925, "epoch": 0.3061661155417234, "grad_norm": 1.1015625, "learning_rate": 0.0004994124744179088, "loss": 5.4482, "mean_token_accuracy": 0.16597717478871346, "num_tokens": 6849622.0, "step": 3935 }, { "entropy": 5.761292362213135, "epoch": 0.306555144913441, "grad_norm": 1.015625, "learning_rate": 0.0004994104711142896, "loss": 5.6437, "mean_token_accuracy": 0.16336634159088134, "num_tokens": 6857355.0, "step": 3940 }, { "entropy": 5.810007333755493, "epoch": 0.3069441742851585, "grad_norm": 1.0546875, "learning_rate": 0.0004994084644055986, "loss": 5.6582, "mean_token_accuracy": 0.1595444455742836, "num_tokens": 6866173.0, "step": 3945 }, { "entropy": 5.7510986328125, "epoch": 0.3073332036568761, "grad_norm": 1.046875, "learning_rate": 0.0004994064542918664, "loss": 5.6718, "mean_token_accuracy": 0.1521872892975807, "num_tokens": 6874438.0, "step": 3950 }, { "entropy": 5.8026892185211185, "epoch": 0.30772223302859364, "grad_norm": 1.0078125, "learning_rate": 0.0004994044407731235, "loss": 5.66, "mean_token_accuracy": 0.1539344683289528, "num_tokens": 6882790.0, "step": 3955 }, { "entropy": 5.790673875808716, "epoch": 0.3081112624003112, "grad_norm": 0.92578125, "learning_rate": 0.0004994024238494002, "loss": 5.671, "mean_token_accuracy": 0.14898976385593415, "num_tokens": 6891375.0, "step": 3960 }, { "entropy": 5.692372560501099, "epoch": 0.3085002917720288, "grad_norm": 1.03125, "learning_rate": 0.0004994004035207274, "loss": 5.5891, "mean_token_accuracy": 0.1600603513419628, "num_tokens": 6899510.0, "step": 3965 }, { "entropy": 5.840362453460694, "epoch": 0.30888932114374634, "grad_norm": 1.1015625, "learning_rate": 0.0004993983797871356, "loss": 5.6485, "mean_token_accuracy": 0.1631278231739998, "num_tokens": 6908311.0, "step": 3970 }, { "entropy": 5.738107919692993, "epoch": 0.30927835051546393, "grad_norm": 0.984375, "learning_rate": 0.0004993963526486555, "loss": 5.5953, "mean_token_accuracy": 0.15895417034626008, "num_tokens": 6917064.0, "step": 3975 }, { "entropy": 5.74478964805603, "epoch": 0.30966737988718146, "grad_norm": 1.0234375, "learning_rate": 0.000499394322105318, "loss": 5.6, "mean_token_accuracy": 0.16004132479429245, "num_tokens": 6925705.0, "step": 3980 }, { "entropy": 5.891635417938232, "epoch": 0.31005640925889905, "grad_norm": 0.98046875, "learning_rate": 0.0004993922881571538, "loss": 5.74, "mean_token_accuracy": 0.15065352767705917, "num_tokens": 6934232.0, "step": 3985 }, { "entropy": 5.842127132415771, "epoch": 0.31044543863061663, "grad_norm": 1.0234375, "learning_rate": 0.0004993902508041939, "loss": 5.6878, "mean_token_accuracy": 0.1538147211074829, "num_tokens": 6943143.0, "step": 3990 }, { "entropy": 5.768838930130005, "epoch": 0.31083446800233416, "grad_norm": 0.98828125, "learning_rate": 0.000499388210046469, "loss": 5.5417, "mean_token_accuracy": 0.16123594641685485, "num_tokens": 6951613.0, "step": 3995 }, { "entropy": 5.795172452926636, "epoch": 0.31122349737405175, "grad_norm": 1.109375, "learning_rate": 0.0004993861658840102, "loss": 5.74, "mean_token_accuracy": 0.152002190053463, "num_tokens": 6960531.0, "step": 4000 }, { "entropy": 5.8380537033081055, "epoch": 0.3116125267457693, "grad_norm": 1.0078125, "learning_rate": 0.0004993841183168484, "loss": 5.6748, "mean_token_accuracy": 0.15421621799468993, "num_tokens": 6969211.0, "step": 4005 }, { "entropy": 5.900531911849976, "epoch": 0.31200155611748687, "grad_norm": 0.97265625, "learning_rate": 0.0004993820673450148, "loss": 5.6941, "mean_token_accuracy": 0.15220338851213455, "num_tokens": 6978414.0, "step": 4010 }, { "entropy": 5.698403549194336, "epoch": 0.31239058548920445, "grad_norm": 0.97265625, "learning_rate": 0.0004993800129685404, "loss": 5.4602, "mean_token_accuracy": 0.16010657995939254, "num_tokens": 6987350.0, "step": 4015 }, { "entropy": 5.745885181427002, "epoch": 0.312779614860922, "grad_norm": 0.94140625, "learning_rate": 0.0004993779551874565, "loss": 5.5843, "mean_token_accuracy": 0.16465893834829332, "num_tokens": 6995817.0, "step": 4020 }, { "entropy": 5.789159774780273, "epoch": 0.31316864423263957, "grad_norm": 1.0859375, "learning_rate": 0.0004993758940017943, "loss": 5.6774, "mean_token_accuracy": 0.1573045790195465, "num_tokens": 7004454.0, "step": 4025 }, { "entropy": 5.754794311523438, "epoch": 0.31355767360435716, "grad_norm": 1.0390625, "learning_rate": 0.000499373829411585, "loss": 5.5896, "mean_token_accuracy": 0.15946647599339486, "num_tokens": 7012126.0, "step": 4030 }, { "entropy": 5.767265462875367, "epoch": 0.3139467029760747, "grad_norm": 0.94921875, "learning_rate": 0.00049937176141686, "loss": 5.682, "mean_token_accuracy": 0.1577837847173214, "num_tokens": 7021232.0, "step": 4035 }, { "entropy": 5.881110000610351, "epoch": 0.3143357323477923, "grad_norm": 1.046875, "learning_rate": 0.0004993696900176506, "loss": 5.6477, "mean_token_accuracy": 0.15886460542678832, "num_tokens": 7029488.0, "step": 4040 }, { "entropy": 5.776513290405274, "epoch": 0.3147247617195098, "grad_norm": 1.0859375, "learning_rate": 0.0004993676152139883, "loss": 5.6851, "mean_token_accuracy": 0.1527479648590088, "num_tokens": 7037323.0, "step": 4045 }, { "entropy": 5.753616714477539, "epoch": 0.3151137910912274, "grad_norm": 1.0703125, "learning_rate": 0.0004993655370059046, "loss": 5.6355, "mean_token_accuracy": 0.15245578587055206, "num_tokens": 7045754.0, "step": 4050 }, { "entropy": 5.798805236816406, "epoch": 0.315502820462945, "grad_norm": 1.0546875, "learning_rate": 0.0004993634553934309, "loss": 5.5769, "mean_token_accuracy": 0.15374290943145752, "num_tokens": 7054026.0, "step": 4055 }, { "entropy": 5.756967258453369, "epoch": 0.3158918498346625, "grad_norm": 0.97265625, "learning_rate": 0.0004993613703765989, "loss": 5.6312, "mean_token_accuracy": 0.15930403470993043, "num_tokens": 7063383.0, "step": 4060 }, { "entropy": 5.731030797958374, "epoch": 0.3162808792063801, "grad_norm": 0.98828125, "learning_rate": 0.0004993592819554402, "loss": 5.5773, "mean_token_accuracy": 0.1582264557480812, "num_tokens": 7071952.0, "step": 4065 }, { "entropy": 5.855757522583008, "epoch": 0.3166699085780976, "grad_norm": 1.0703125, "learning_rate": 0.0004993571901299866, "loss": 5.6446, "mean_token_accuracy": 0.15414991676807405, "num_tokens": 7080283.0, "step": 4070 }, { "entropy": 5.688795566558838, "epoch": 0.3170589379498152, "grad_norm": 1.0078125, "learning_rate": 0.0004993550949002697, "loss": 5.569, "mean_token_accuracy": 0.15824397653341293, "num_tokens": 7088669.0, "step": 4075 }, { "entropy": 5.705701732635498, "epoch": 0.3174479673215328, "grad_norm": 1.0390625, "learning_rate": 0.0004993529962663213, "loss": 5.4657, "mean_token_accuracy": 0.16952413469552993, "num_tokens": 7097201.0, "step": 4080 }, { "entropy": 5.713267803192139, "epoch": 0.31783699669325033, "grad_norm": 1.0, "learning_rate": 0.0004993508942281732, "loss": 5.638, "mean_token_accuracy": 0.15605451464653014, "num_tokens": 7106509.0, "step": 4085 }, { "entropy": 5.763213062286377, "epoch": 0.3182260260649679, "grad_norm": 1.1015625, "learning_rate": 0.0004993487887858575, "loss": 5.5622, "mean_token_accuracy": 0.15604040771722794, "num_tokens": 7114550.0, "step": 4090 }, { "entropy": 5.821378469467163, "epoch": 0.31861505543668545, "grad_norm": 0.93359375, "learning_rate": 0.000499346679939406, "loss": 5.6685, "mean_token_accuracy": 0.15556033849716186, "num_tokens": 7122875.0, "step": 4095 }, { "entropy": 5.732659769058228, "epoch": 0.31900408480840303, "grad_norm": 1.0078125, "learning_rate": 0.0004993445676888507, "loss": 5.4924, "mean_token_accuracy": 0.15718897432088852, "num_tokens": 7132263.0, "step": 4100 }, { "entropy": 5.739199256896972, "epoch": 0.3193931141801206, "grad_norm": 0.984375, "learning_rate": 0.0004993424520342236, "loss": 5.6961, "mean_token_accuracy": 0.15194219574332238, "num_tokens": 7141448.0, "step": 4105 }, { "entropy": 5.737508296966553, "epoch": 0.31978214355183815, "grad_norm": 1.078125, "learning_rate": 0.0004993403329755569, "loss": 5.7148, "mean_token_accuracy": 0.1534551165997982, "num_tokens": 7151021.0, "step": 4110 }, { "entropy": 5.86180305480957, "epoch": 0.32017117292355574, "grad_norm": 1.0234375, "learning_rate": 0.0004993382105128828, "loss": 5.6588, "mean_token_accuracy": 0.1554321050643921, "num_tokens": 7160103.0, "step": 4115 }, { "entropy": 5.833527898788452, "epoch": 0.32056020229527327, "grad_norm": 1.078125, "learning_rate": 0.0004993360846462333, "loss": 5.6423, "mean_token_accuracy": 0.14571528136730194, "num_tokens": 7169003.0, "step": 4120 }, { "entropy": 5.811704015731811, "epoch": 0.32094923166699085, "grad_norm": 1.0390625, "learning_rate": 0.0004993339553756408, "loss": 5.6705, "mean_token_accuracy": 0.15842568203806878, "num_tokens": 7177086.0, "step": 4125 }, { "entropy": 5.772511434555054, "epoch": 0.32133826103870844, "grad_norm": 0.96484375, "learning_rate": 0.0004993318227011378, "loss": 5.5535, "mean_token_accuracy": 0.15517180562019348, "num_tokens": 7185772.0, "step": 4130 }, { "entropy": 5.821723508834839, "epoch": 0.32172729041042597, "grad_norm": 1.0390625, "learning_rate": 0.0004993296866227562, "loss": 5.6943, "mean_token_accuracy": 0.15868849605321883, "num_tokens": 7194394.0, "step": 4135 }, { "entropy": 5.725718975067139, "epoch": 0.32211631978214356, "grad_norm": 1.0390625, "learning_rate": 0.0004993275471405288, "loss": 5.5055, "mean_token_accuracy": 0.1687486931681633, "num_tokens": 7202143.0, "step": 4140 }, { "entropy": 5.703480577468872, "epoch": 0.32250534915386114, "grad_norm": 1.0703125, "learning_rate": 0.0004993254042544879, "loss": 5.6392, "mean_token_accuracy": 0.15573893785476683, "num_tokens": 7210645.0, "step": 4145 }, { "entropy": 5.810609340667725, "epoch": 0.3228943785255787, "grad_norm": 0.9765625, "learning_rate": 0.000499323257964666, "loss": 5.5839, "mean_token_accuracy": 0.1578369915485382, "num_tokens": 7218872.0, "step": 4150 }, { "entropy": 5.827525615692139, "epoch": 0.32328340789729626, "grad_norm": 0.97265625, "learning_rate": 0.0004993211082710957, "loss": 5.7357, "mean_token_accuracy": 0.15549167096614838, "num_tokens": 7226977.0, "step": 4155 }, { "entropy": 5.805359888076782, "epoch": 0.3236724372690138, "grad_norm": 1.0078125, "learning_rate": 0.0004993189551738097, "loss": 5.5939, "mean_token_accuracy": 0.1561035618185997, "num_tokens": 7235635.0, "step": 4160 }, { "entropy": 5.752389812469483, "epoch": 0.3240614666407314, "grad_norm": 1.0078125, "learning_rate": 0.0004993167986728405, "loss": 5.5851, "mean_token_accuracy": 0.1615038052201271, "num_tokens": 7244506.0, "step": 4165 }, { "entropy": 5.71797547340393, "epoch": 0.32445049601244896, "grad_norm": 0.97265625, "learning_rate": 0.000499314638768221, "loss": 5.6141, "mean_token_accuracy": 0.15862663090229034, "num_tokens": 7252883.0, "step": 4170 }, { "entropy": 5.817626667022705, "epoch": 0.3248395253841665, "grad_norm": 1.1015625, "learning_rate": 0.0004993124754599839, "loss": 5.559, "mean_token_accuracy": 0.1573678582906723, "num_tokens": 7261580.0, "step": 4175 }, { "entropy": 5.788261413574219, "epoch": 0.3252285547558841, "grad_norm": 0.9765625, "learning_rate": 0.0004993103087481619, "loss": 5.6593, "mean_token_accuracy": 0.15661897361278534, "num_tokens": 7270346.0, "step": 4180 }, { "entropy": 5.83748345375061, "epoch": 0.3256175841276016, "grad_norm": 1.0078125, "learning_rate": 0.0004993081386327881, "loss": 5.729, "mean_token_accuracy": 0.1532787561416626, "num_tokens": 7279393.0, "step": 4185 }, { "entropy": 5.756169605255127, "epoch": 0.3260066134993192, "grad_norm": 1.0859375, "learning_rate": 0.0004993059651138953, "loss": 5.5584, "mean_token_accuracy": 0.15885259956121445, "num_tokens": 7287929.0, "step": 4190 }, { "entropy": 5.778932189941406, "epoch": 0.3263956428710368, "grad_norm": 1.0, "learning_rate": 0.0004993037881915165, "loss": 5.6158, "mean_token_accuracy": 0.1615328386425972, "num_tokens": 7296336.0, "step": 4195 }, { "entropy": 5.6543677806854244, "epoch": 0.3267846722427543, "grad_norm": 1.0234375, "learning_rate": 0.0004993016078656847, "loss": 5.4912, "mean_token_accuracy": 0.15942687541246414, "num_tokens": 7304624.0, "step": 4200 }, { "entropy": 5.716690254211426, "epoch": 0.3271737016144719, "grad_norm": 0.96875, "learning_rate": 0.000499299424136433, "loss": 5.6219, "mean_token_accuracy": 0.15619123354554176, "num_tokens": 7312945.0, "step": 4205 }, { "entropy": 5.769815158843994, "epoch": 0.32756273098618943, "grad_norm": 0.95703125, "learning_rate": 0.0004992972370037946, "loss": 5.554, "mean_token_accuracy": 0.1645971119403839, "num_tokens": 7321273.0, "step": 4210 }, { "entropy": 5.797748136520386, "epoch": 0.327951760357907, "grad_norm": 0.984375, "learning_rate": 0.0004992950464678026, "loss": 5.6568, "mean_token_accuracy": 0.15764952600002288, "num_tokens": 7330446.0, "step": 4215 }, { "entropy": 5.675560712814331, "epoch": 0.3283407897296246, "grad_norm": 0.90625, "learning_rate": 0.0004992928525284903, "loss": 5.5958, "mean_token_accuracy": 0.161003540456295, "num_tokens": 7339282.0, "step": 4220 }, { "entropy": 5.764131212234497, "epoch": 0.32872981910134214, "grad_norm": 1.0625, "learning_rate": 0.000499290655185891, "loss": 5.5609, "mean_token_accuracy": 0.1540660962462425, "num_tokens": 7347848.0, "step": 4225 }, { "entropy": 5.696079444885254, "epoch": 0.3291188484730597, "grad_norm": 0.98828125, "learning_rate": 0.000499288454440038, "loss": 5.5608, "mean_token_accuracy": 0.16451414823532104, "num_tokens": 7356678.0, "step": 4230 }, { "entropy": 5.768759489059448, "epoch": 0.3295078778447773, "grad_norm": 0.984375, "learning_rate": 0.0004992862502909645, "loss": 5.6019, "mean_token_accuracy": 0.1615913599729538, "num_tokens": 7365411.0, "step": 4235 }, { "entropy": 5.6910933494567875, "epoch": 0.32989690721649484, "grad_norm": 0.99609375, "learning_rate": 0.0004992840427387043, "loss": 5.5292, "mean_token_accuracy": 0.164210769534111, "num_tokens": 7373635.0, "step": 4240 }, { "entropy": 5.741477632522583, "epoch": 0.3302859365882124, "grad_norm": 1.0546875, "learning_rate": 0.0004992818317832908, "loss": 5.6588, "mean_token_accuracy": 0.15966336578130721, "num_tokens": 7382469.0, "step": 4245 }, { "entropy": 5.802251148223877, "epoch": 0.33067496595992996, "grad_norm": 0.98828125, "learning_rate": 0.0004992796174247574, "loss": 5.6306, "mean_token_accuracy": 0.15575413405895233, "num_tokens": 7390712.0, "step": 4250 }, { "entropy": 5.818617582321167, "epoch": 0.33106399533164754, "grad_norm": 0.9921875, "learning_rate": 0.0004992773996631378, "loss": 5.5586, "mean_token_accuracy": 0.1632613092660904, "num_tokens": 7398905.0, "step": 4255 }, { "entropy": 5.753144216537476, "epoch": 0.33145302470336513, "grad_norm": 1.0703125, "learning_rate": 0.0004992751784984656, "loss": 5.6413, "mean_token_accuracy": 0.15888381749391556, "num_tokens": 7407242.0, "step": 4260 }, { "entropy": 5.742626333236695, "epoch": 0.33184205407508266, "grad_norm": 0.9921875, "learning_rate": 0.0004992729539307745, "loss": 5.6662, "mean_token_accuracy": 0.15572152584791182, "num_tokens": 7416489.0, "step": 4265 }, { "entropy": 5.865239953994751, "epoch": 0.33223108344680025, "grad_norm": 0.99609375, "learning_rate": 0.0004992707259600984, "loss": 5.657, "mean_token_accuracy": 0.1557759702205658, "num_tokens": 7424507.0, "step": 4270 }, { "entropy": 5.741849136352539, "epoch": 0.3326201128185178, "grad_norm": 0.98046875, "learning_rate": 0.0004992684945864709, "loss": 5.6318, "mean_token_accuracy": 0.1520262397825718, "num_tokens": 7433343.0, "step": 4275 }, { "entropy": 5.688818788528442, "epoch": 0.33300914219023536, "grad_norm": 1.0, "learning_rate": 0.0004992662598099261, "loss": 5.5601, "mean_token_accuracy": 0.16512439996004105, "num_tokens": 7441452.0, "step": 4280 }, { "entropy": 5.804032039642334, "epoch": 0.33339817156195295, "grad_norm": 0.98828125, "learning_rate": 0.0004992640216304975, "loss": 5.6298, "mean_token_accuracy": 0.16103580743074417, "num_tokens": 7449541.0, "step": 4285 }, { "entropy": 5.765760898590088, "epoch": 0.3337872009336705, "grad_norm": 1.0234375, "learning_rate": 0.0004992617800482196, "loss": 5.642, "mean_token_accuracy": 0.15369921773672104, "num_tokens": 7458812.0, "step": 4290 }, { "entropy": 5.7393537044525145, "epoch": 0.33417623030538807, "grad_norm": 0.953125, "learning_rate": 0.000499259535063126, "loss": 5.5783, "mean_token_accuracy": 0.15623634457588195, "num_tokens": 7467607.0, "step": 4295 }, { "entropy": 5.776077842712402, "epoch": 0.3345652596771056, "grad_norm": 1.109375, "learning_rate": 0.000499257286675251, "loss": 5.5016, "mean_token_accuracy": 0.16391390860080718, "num_tokens": 7476047.0, "step": 4300 }, { "entropy": 5.741789388656616, "epoch": 0.3349542890488232, "grad_norm": 1.0546875, "learning_rate": 0.0004992550348846285, "loss": 5.5719, "mean_token_accuracy": 0.15823668837547303, "num_tokens": 7484496.0, "step": 4305 }, { "entropy": 5.672589492797852, "epoch": 0.33534331842054077, "grad_norm": 0.98046875, "learning_rate": 0.0004992527796912928, "loss": 5.5001, "mean_token_accuracy": 0.16356348618865013, "num_tokens": 7493161.0, "step": 4310 }, { "entropy": 5.758045291900634, "epoch": 0.3357323477922583, "grad_norm": 1.015625, "learning_rate": 0.0004992505210952782, "loss": 5.6336, "mean_token_accuracy": 0.156315216422081, "num_tokens": 7502122.0, "step": 4315 }, { "entropy": 5.763626956939698, "epoch": 0.3361213771639759, "grad_norm": 1.078125, "learning_rate": 0.0004992482590966188, "loss": 5.6132, "mean_token_accuracy": 0.1597306936979294, "num_tokens": 7510369.0, "step": 4320 }, { "entropy": 5.685847663879395, "epoch": 0.3365104065356934, "grad_norm": 1.046875, "learning_rate": 0.0004992459936953489, "loss": 5.4874, "mean_token_accuracy": 0.16831238120794295, "num_tokens": 7519321.0, "step": 4325 }, { "entropy": 5.685293483734131, "epoch": 0.336899435907411, "grad_norm": 0.96484375, "learning_rate": 0.0004992437248915032, "loss": 5.5365, "mean_token_accuracy": 0.16498717069625854, "num_tokens": 7528196.0, "step": 4330 }, { "entropy": 5.687713193893432, "epoch": 0.3372884652791286, "grad_norm": 1.0625, "learning_rate": 0.0004992414526851157, "loss": 5.6024, "mean_token_accuracy": 0.15667464807629586, "num_tokens": 7536124.0, "step": 4335 }, { "entropy": 5.829200553894043, "epoch": 0.3376774946508461, "grad_norm": 1.0390625, "learning_rate": 0.0004992391770762212, "loss": 5.6934, "mean_token_accuracy": 0.1513142079114914, "num_tokens": 7544409.0, "step": 4340 }, { "entropy": 5.788577079772949, "epoch": 0.3380665240225637, "grad_norm": 0.99609375, "learning_rate": 0.000499236898064854, "loss": 5.5907, "mean_token_accuracy": 0.1621900752186775, "num_tokens": 7552803.0, "step": 4345 }, { "entropy": 5.67437744140625, "epoch": 0.3384555533942813, "grad_norm": 1.03125, "learning_rate": 0.0004992346156510488, "loss": 5.5643, "mean_token_accuracy": 0.15769924521446227, "num_tokens": 7561909.0, "step": 4350 }, { "entropy": 5.832115030288696, "epoch": 0.3388445827659988, "grad_norm": 0.96484375, "learning_rate": 0.0004992323298348403, "loss": 5.6147, "mean_token_accuracy": 0.15296869426965715, "num_tokens": 7571759.0, "step": 4355 }, { "entropy": 5.784440565109253, "epoch": 0.3392336121377164, "grad_norm": 1.015625, "learning_rate": 0.000499230040616263, "loss": 5.7427, "mean_token_accuracy": 0.1566373661160469, "num_tokens": 7580010.0, "step": 4360 }, { "entropy": 5.756098937988281, "epoch": 0.33962264150943394, "grad_norm": 0.9765625, "learning_rate": 0.0004992277479953518, "loss": 5.5451, "mean_token_accuracy": 0.15730045288801192, "num_tokens": 7587841.0, "step": 4365 }, { "entropy": 5.758036184310913, "epoch": 0.34001167088115153, "grad_norm": 1.078125, "learning_rate": 0.0004992254519721414, "loss": 5.5907, "mean_token_accuracy": 0.1559063196182251, "num_tokens": 7596187.0, "step": 4370 }, { "entropy": 5.651873350143433, "epoch": 0.3404007002528691, "grad_norm": 1.109375, "learning_rate": 0.0004992231525466666, "loss": 5.4951, "mean_token_accuracy": 0.16344073712825774, "num_tokens": 7604361.0, "step": 4375 }, { "entropy": 5.770703601837158, "epoch": 0.34078972962458665, "grad_norm": 1.0234375, "learning_rate": 0.0004992208497189624, "loss": 5.5845, "mean_token_accuracy": 0.1653784215450287, "num_tokens": 7613173.0, "step": 4380 }, { "entropy": 5.727901792526245, "epoch": 0.34117875899630423, "grad_norm": 1.0078125, "learning_rate": 0.0004992185434890637, "loss": 5.6743, "mean_token_accuracy": 0.1515727773308754, "num_tokens": 7621730.0, "step": 4385 }, { "entropy": 5.803450727462769, "epoch": 0.34156778836802176, "grad_norm": 0.95703125, "learning_rate": 0.0004992162338570055, "loss": 5.6471, "mean_token_accuracy": 0.157301127910614, "num_tokens": 7630362.0, "step": 4390 }, { "entropy": 5.774415397644043, "epoch": 0.34195681773973935, "grad_norm": 1.1328125, "learning_rate": 0.0004992139208228227, "loss": 5.5894, "mean_token_accuracy": 0.15711733400821687, "num_tokens": 7639368.0, "step": 4395 }, { "entropy": 5.756467247009278, "epoch": 0.34234584711145694, "grad_norm": 1.046875, "learning_rate": 0.0004992116043865506, "loss": 5.6205, "mean_token_accuracy": 0.15912013053894042, "num_tokens": 7648399.0, "step": 4400 }, { "entropy": 5.696918106079101, "epoch": 0.34273487648317447, "grad_norm": 0.96875, "learning_rate": 0.0004992092845482244, "loss": 5.4518, "mean_token_accuracy": 0.16868401318788528, "num_tokens": 7657298.0, "step": 4405 }, { "entropy": 5.810102844238282, "epoch": 0.34312390585489205, "grad_norm": 1.015625, "learning_rate": 0.0004992069613078791, "loss": 5.6098, "mean_token_accuracy": 0.16102852821350097, "num_tokens": 7665328.0, "step": 4410 }, { "entropy": 5.696934795379638, "epoch": 0.3435129352266096, "grad_norm": 1.03125, "learning_rate": 0.0004992046346655499, "loss": 5.5544, "mean_token_accuracy": 0.1619025468826294, "num_tokens": 7674610.0, "step": 4415 }, { "entropy": 5.747613096237183, "epoch": 0.34390196459832717, "grad_norm": 1.03125, "learning_rate": 0.0004992023046212723, "loss": 5.5785, "mean_token_accuracy": 0.15795013606548308, "num_tokens": 7682727.0, "step": 4420 }, { "entropy": 5.72398157119751, "epoch": 0.34429099397004476, "grad_norm": 1.03125, "learning_rate": 0.0004991999711750816, "loss": 5.5445, "mean_token_accuracy": 0.17041088342666627, "num_tokens": 7691547.0, "step": 4425 }, { "entropy": 5.679721450805664, "epoch": 0.3446800233417623, "grad_norm": 0.97265625, "learning_rate": 0.0004991976343270133, "loss": 5.5176, "mean_token_accuracy": 0.1569729596376419, "num_tokens": 7699987.0, "step": 4430 }, { "entropy": 5.679746198654175, "epoch": 0.3450690527134799, "grad_norm": 1.0234375, "learning_rate": 0.0004991952940771026, "loss": 5.5679, "mean_token_accuracy": 0.16395378410816192, "num_tokens": 7708397.0, "step": 4435 }, { "entropy": 5.719892168045044, "epoch": 0.34545808208519746, "grad_norm": 1.046875, "learning_rate": 0.0004991929504253852, "loss": 5.5428, "mean_token_accuracy": 0.15749787986278535, "num_tokens": 7716795.0, "step": 4440 }, { "entropy": 5.704584217071533, "epoch": 0.345847111456915, "grad_norm": 1.0625, "learning_rate": 0.0004991906033718966, "loss": 5.5675, "mean_token_accuracy": 0.1568581983447075, "num_tokens": 7725663.0, "step": 4445 }, { "entropy": 5.702336406707763, "epoch": 0.3462361408286326, "grad_norm": 1.0078125, "learning_rate": 0.0004991882529166724, "loss": 5.6945, "mean_token_accuracy": 0.15824410766363145, "num_tokens": 7735175.0, "step": 4450 }, { "entropy": 5.787890100479126, "epoch": 0.3466251702003501, "grad_norm": 0.91015625, "learning_rate": 0.0004991858990597483, "loss": 5.5482, "mean_token_accuracy": 0.16432606428861618, "num_tokens": 7744041.0, "step": 4455 }, { "entropy": 5.751737403869629, "epoch": 0.3470141995720677, "grad_norm": 1.0, "learning_rate": 0.0004991835418011601, "loss": 5.6157, "mean_token_accuracy": 0.15478222519159318, "num_tokens": 7752168.0, "step": 4460 }, { "entropy": 5.70343656539917, "epoch": 0.3474032289437853, "grad_norm": 1.0078125, "learning_rate": 0.0004991811811409434, "loss": 5.5576, "mean_token_accuracy": 0.16113696992397308, "num_tokens": 7760746.0, "step": 4465 }, { "entropy": 5.749729156494141, "epoch": 0.3477922583155028, "grad_norm": 0.95703125, "learning_rate": 0.0004991788170791341, "loss": 5.5513, "mean_token_accuracy": 0.1597917929291725, "num_tokens": 7769960.0, "step": 4470 }, { "entropy": 5.750726318359375, "epoch": 0.3481812876872204, "grad_norm": 1.0234375, "learning_rate": 0.0004991764496157682, "loss": 5.5712, "mean_token_accuracy": 0.16283269673585893, "num_tokens": 7778475.0, "step": 4475 }, { "entropy": 5.662684679031372, "epoch": 0.34857031705893793, "grad_norm": 0.9765625, "learning_rate": 0.0004991740787508814, "loss": 5.4511, "mean_token_accuracy": 0.16975423246622084, "num_tokens": 7787590.0, "step": 4480 }, { "entropy": 5.736890506744385, "epoch": 0.3489593464306555, "grad_norm": 0.97265625, "learning_rate": 0.0004991717044845097, "loss": 5.62, "mean_token_accuracy": 0.15432989001274108, "num_tokens": 7796841.0, "step": 4485 }, { "entropy": 5.816498899459839, "epoch": 0.3493483758023731, "grad_norm": 1.109375, "learning_rate": 0.0004991693268166892, "loss": 5.6291, "mean_token_accuracy": 0.15610261186957358, "num_tokens": 7804889.0, "step": 4490 }, { "entropy": 5.769539308547974, "epoch": 0.34973740517409063, "grad_norm": 1.03125, "learning_rate": 0.0004991669457474559, "loss": 5.6189, "mean_token_accuracy": 0.15933216661214827, "num_tokens": 7813185.0, "step": 4495 }, { "entropy": 5.716590642929077, "epoch": 0.3501264345458082, "grad_norm": 1.015625, "learning_rate": 0.0004991645612768461, "loss": 5.5946, "mean_token_accuracy": 0.15529540926218033, "num_tokens": 7821630.0, "step": 4500 }, { "entropy": 5.784337091445923, "epoch": 0.35051546391752575, "grad_norm": 1.0703125, "learning_rate": 0.0004991621734048958, "loss": 5.6226, "mean_token_accuracy": 0.16395158022642137, "num_tokens": 7829941.0, "step": 4505 }, { "entropy": 5.713160514831543, "epoch": 0.35090449328924334, "grad_norm": 1.0, "learning_rate": 0.0004991597821316415, "loss": 5.5748, "mean_token_accuracy": 0.16333524584770204, "num_tokens": 7838515.0, "step": 4510 }, { "entropy": 5.789814758300781, "epoch": 0.3512935226609609, "grad_norm": 1.0859375, "learning_rate": 0.0004991573874571192, "loss": 5.5708, "mean_token_accuracy": 0.1628706246614456, "num_tokens": 7846575.0, "step": 4515 }, { "entropy": 5.653206491470337, "epoch": 0.35168255203267845, "grad_norm": 1.03125, "learning_rate": 0.0004991549893813653, "loss": 5.4598, "mean_token_accuracy": 0.16667032688856126, "num_tokens": 7854970.0, "step": 4520 }, { "entropy": 5.701358604431152, "epoch": 0.35207158140439604, "grad_norm": 1.046875, "learning_rate": 0.0004991525879044162, "loss": 5.5581, "mean_token_accuracy": 0.16041914373636246, "num_tokens": 7863293.0, "step": 4525 }, { "entropy": 5.754718875885009, "epoch": 0.35246061077611357, "grad_norm": 1.1171875, "learning_rate": 0.0004991501830263084, "loss": 5.5569, "mean_token_accuracy": 0.16397467255592346, "num_tokens": 7871029.0, "step": 4530 }, { "entropy": 5.646997356414795, "epoch": 0.35284964014783116, "grad_norm": 0.9453125, "learning_rate": 0.0004991477747470783, "loss": 5.42, "mean_token_accuracy": 0.1670575261116028, "num_tokens": 7879797.0, "step": 4535 }, { "entropy": 5.8155810832977295, "epoch": 0.35323866951954874, "grad_norm": 1.0, "learning_rate": 0.0004991453630667625, "loss": 5.7321, "mean_token_accuracy": 0.15194890201091765, "num_tokens": 7888600.0, "step": 4540 }, { "entropy": 5.701278352737427, "epoch": 0.3536276988912663, "grad_norm": 1.1015625, "learning_rate": 0.0004991429479853976, "loss": 5.552, "mean_token_accuracy": 0.16275644749403, "num_tokens": 7897794.0, "step": 4545 }, { "entropy": 5.757588911056518, "epoch": 0.35401672826298386, "grad_norm": 1.03125, "learning_rate": 0.0004991405295030202, "loss": 5.5356, "mean_token_accuracy": 0.16324365884065628, "num_tokens": 7905822.0, "step": 4550 }, { "entropy": 5.6449367046356205, "epoch": 0.35440575763470145, "grad_norm": 0.9609375, "learning_rate": 0.0004991381076196671, "loss": 5.622, "mean_token_accuracy": 0.16375057995319367, "num_tokens": 7914560.0, "step": 4555 }, { "entropy": 5.6144177436828615, "epoch": 0.354794787006419, "grad_norm": 1.0234375, "learning_rate": 0.0004991356823353748, "loss": 5.4537, "mean_token_accuracy": 0.171008837223053, "num_tokens": 7924058.0, "step": 4560 }, { "entropy": 5.7179710388183596, "epoch": 0.35518381637813656, "grad_norm": 1.140625, "learning_rate": 0.0004991332536501804, "loss": 5.599, "mean_token_accuracy": 0.15646698474884033, "num_tokens": 7932979.0, "step": 4565 }, { "entropy": 5.646498298645019, "epoch": 0.3555728457498541, "grad_norm": 0.96875, "learning_rate": 0.0004991308215641205, "loss": 5.385, "mean_token_accuracy": 0.17703631222248079, "num_tokens": 7941357.0, "step": 4570 }, { "entropy": 5.65172176361084, "epoch": 0.3559618751215717, "grad_norm": 0.96875, "learning_rate": 0.0004991283860772323, "loss": 5.5607, "mean_token_accuracy": 0.1630801796913147, "num_tokens": 7949997.0, "step": 4575 }, { "entropy": 5.711667251586914, "epoch": 0.35635090449328927, "grad_norm": 0.98828125, "learning_rate": 0.0004991259471895525, "loss": 5.5028, "mean_token_accuracy": 0.16014036685228347, "num_tokens": 7958246.0, "step": 4580 }, { "entropy": 5.708824253082275, "epoch": 0.3567399338650068, "grad_norm": 0.9921875, "learning_rate": 0.0004991235049011182, "loss": 5.5885, "mean_token_accuracy": 0.1583796262741089, "num_tokens": 7967176.0, "step": 4585 }, { "entropy": 5.70987868309021, "epoch": 0.3571289632367244, "grad_norm": 1.0703125, "learning_rate": 0.0004991210592119663, "loss": 5.4486, "mean_token_accuracy": 0.16676732301712036, "num_tokens": 7974761.0, "step": 4590 }, { "entropy": 5.630984497070313, "epoch": 0.3575179926084419, "grad_norm": 1.0390625, "learning_rate": 0.0004991186101221342, "loss": 5.5267, "mean_token_accuracy": 0.16331609338521957, "num_tokens": 7983155.0, "step": 4595 }, { "entropy": 5.699593448638916, "epoch": 0.3579070219801595, "grad_norm": 0.99609375, "learning_rate": 0.000499116157631659, "loss": 5.5458, "mean_token_accuracy": 0.15738096237182617, "num_tokens": 7991276.0, "step": 4600 }, { "entropy": 5.7626330852508545, "epoch": 0.3582960513518771, "grad_norm": 1.046875, "learning_rate": 0.0004991137017405777, "loss": 5.6711, "mean_token_accuracy": 0.15599002540111542, "num_tokens": 7999488.0, "step": 4605 }, { "entropy": 5.720730113983154, "epoch": 0.3586850807235946, "grad_norm": 0.953125, "learning_rate": 0.0004991112424489277, "loss": 5.5315, "mean_token_accuracy": 0.16649463176727294, "num_tokens": 8008553.0, "step": 4610 }, { "entropy": 5.61679973602295, "epoch": 0.3590741100953122, "grad_norm": 0.88671875, "learning_rate": 0.0004991087797567462, "loss": 5.5026, "mean_token_accuracy": 0.16620901077985764, "num_tokens": 8017890.0, "step": 4615 }, { "entropy": 5.737289190292358, "epoch": 0.35946313946702974, "grad_norm": 0.94140625, "learning_rate": 0.0004991063136640709, "loss": 5.6677, "mean_token_accuracy": 0.14980827048420906, "num_tokens": 8025782.0, "step": 4620 }, { "entropy": 5.7484447956085205, "epoch": 0.3598521688387473, "grad_norm": 1.0, "learning_rate": 0.0004991038441709388, "loss": 5.5291, "mean_token_accuracy": 0.16813595592975616, "num_tokens": 8034623.0, "step": 4625 }, { "entropy": 5.672695159912109, "epoch": 0.3602411982104649, "grad_norm": 1.078125, "learning_rate": 0.0004991013712773877, "loss": 5.5368, "mean_token_accuracy": 0.16356041878461838, "num_tokens": 8043789.0, "step": 4630 }, { "entropy": 5.66884446144104, "epoch": 0.36063022758218244, "grad_norm": 0.890625, "learning_rate": 0.0004990988949834549, "loss": 5.5089, "mean_token_accuracy": 0.16036368310451507, "num_tokens": 8053456.0, "step": 4635 }, { "entropy": 5.6446342945098875, "epoch": 0.3610192569539, "grad_norm": 1.1171875, "learning_rate": 0.000499096415289178, "loss": 5.4861, "mean_token_accuracy": 0.16083667427301407, "num_tokens": 8061692.0, "step": 4640 }, { "entropy": 5.5944324970245365, "epoch": 0.3614082863256176, "grad_norm": 1.015625, "learning_rate": 0.0004990939321945948, "loss": 5.4375, "mean_token_accuracy": 0.16898863017559052, "num_tokens": 8069564.0, "step": 4645 }, { "entropy": 5.7000421524047855, "epoch": 0.36179731569733514, "grad_norm": 0.98828125, "learning_rate": 0.0004990914456997427, "loss": 5.5035, "mean_token_accuracy": 0.16119355112314224, "num_tokens": 8078490.0, "step": 4650 }, { "entropy": 5.7108453750610355, "epoch": 0.36218634506905273, "grad_norm": 0.9765625, "learning_rate": 0.0004990889558046598, "loss": 5.6043, "mean_token_accuracy": 0.158635513484478, "num_tokens": 8086858.0, "step": 4655 }, { "entropy": 5.704522180557251, "epoch": 0.36257537444077026, "grad_norm": 1.109375, "learning_rate": 0.0004990864625093836, "loss": 5.5605, "mean_token_accuracy": 0.16476080417633057, "num_tokens": 8094542.0, "step": 4660 }, { "entropy": 5.746029615402222, "epoch": 0.36296440381248785, "grad_norm": 1.046875, "learning_rate": 0.0004990839658139519, "loss": 5.5847, "mean_token_accuracy": 0.16405946165323257, "num_tokens": 8102756.0, "step": 4665 }, { "entropy": 5.765752935409546, "epoch": 0.36335343318420543, "grad_norm": 0.9609375, "learning_rate": 0.0004990814657184028, "loss": 5.615, "mean_token_accuracy": 0.16670868843793868, "num_tokens": 8111258.0, "step": 4670 }, { "entropy": 5.8236072063446045, "epoch": 0.36374246255592296, "grad_norm": 1.0546875, "learning_rate": 0.0004990789622227741, "loss": 5.7199, "mean_token_accuracy": 0.1491565763950348, "num_tokens": 8119624.0, "step": 4675 }, { "entropy": 5.668383979797364, "epoch": 0.36413149192764055, "grad_norm": 0.9453125, "learning_rate": 0.0004990764553271038, "loss": 5.5055, "mean_token_accuracy": 0.1655653491616249, "num_tokens": 8128156.0, "step": 4680 }, { "entropy": 5.650137901306152, "epoch": 0.3645205212993581, "grad_norm": 1.0625, "learning_rate": 0.0004990739450314299, "loss": 5.5584, "mean_token_accuracy": 0.15826979875564576, "num_tokens": 8136080.0, "step": 4685 }, { "entropy": 5.745880222320556, "epoch": 0.36490955067107567, "grad_norm": 0.95703125, "learning_rate": 0.0004990714313357906, "loss": 5.5416, "mean_token_accuracy": 0.1668192923069, "num_tokens": 8144742.0, "step": 4690 }, { "entropy": 5.750147914886474, "epoch": 0.36529858004279325, "grad_norm": 1.0390625, "learning_rate": 0.000499068914240224, "loss": 5.6008, "mean_token_accuracy": 0.16182359755039216, "num_tokens": 8153377.0, "step": 4695 }, { "entropy": 5.7304154396057125, "epoch": 0.3656876094145108, "grad_norm": 0.97265625, "learning_rate": 0.0004990663937447682, "loss": 5.534, "mean_token_accuracy": 0.16247955858707427, "num_tokens": 8162169.0, "step": 4700 }, { "entropy": 5.65903868675232, "epoch": 0.36607663878622837, "grad_norm": 1.0234375, "learning_rate": 0.0004990638698494615, "loss": 5.4948, "mean_token_accuracy": 0.16574820280075073, "num_tokens": 8170727.0, "step": 4705 }, { "entropy": 5.609049987792969, "epoch": 0.3664656681579459, "grad_norm": 1.03125, "learning_rate": 0.0004990613425543423, "loss": 5.4432, "mean_token_accuracy": 0.16713500916957855, "num_tokens": 8179013.0, "step": 4710 }, { "entropy": 5.595587873458863, "epoch": 0.3668546975296635, "grad_norm": 1.03125, "learning_rate": 0.0004990588118594487, "loss": 5.4148, "mean_token_accuracy": 0.16975449919700622, "num_tokens": 8187030.0, "step": 4715 }, { "entropy": 5.610220909118652, "epoch": 0.3672437269013811, "grad_norm": 1.0546875, "learning_rate": 0.0004990562777648194, "loss": 5.3988, "mean_token_accuracy": 0.16739748567342758, "num_tokens": 8195073.0, "step": 4720 }, { "entropy": 5.633205413818359, "epoch": 0.3676327562730986, "grad_norm": 1.0390625, "learning_rate": 0.0004990537402704928, "loss": 5.57, "mean_token_accuracy": 0.16305485963821412, "num_tokens": 8203626.0, "step": 4725 }, { "entropy": 5.68911452293396, "epoch": 0.3680217856448162, "grad_norm": 1.0390625, "learning_rate": 0.0004990511993765071, "loss": 5.5415, "mean_token_accuracy": 0.16565153896808624, "num_tokens": 8212750.0, "step": 4730 }, { "entropy": 5.757883167266845, "epoch": 0.3684108150165337, "grad_norm": 0.984375, "learning_rate": 0.0004990486550829011, "loss": 5.5506, "mean_token_accuracy": 0.15366293638944625, "num_tokens": 8221542.0, "step": 4735 }, { "entropy": 5.560074138641357, "epoch": 0.3687998443882513, "grad_norm": 0.98828125, "learning_rate": 0.0004990461073897134, "loss": 5.4779, "mean_token_accuracy": 0.16144995987415314, "num_tokens": 8230574.0, "step": 4740 }, { "entropy": 5.744259548187256, "epoch": 0.3691888737599689, "grad_norm": 1.0, "learning_rate": 0.0004990435562969827, "loss": 5.573, "mean_token_accuracy": 0.15981101393699645, "num_tokens": 8239400.0, "step": 4745 }, { "entropy": 5.690568304061889, "epoch": 0.3695779031316864, "grad_norm": 1.0234375, "learning_rate": 0.0004990410018047475, "loss": 5.4074, "mean_token_accuracy": 0.16521767675876617, "num_tokens": 8247537.0, "step": 4750 }, { "entropy": 5.611506748199463, "epoch": 0.369966932503404, "grad_norm": 1.015625, "learning_rate": 0.0004990384439130467, "loss": 5.5222, "mean_token_accuracy": 0.15909540504217148, "num_tokens": 8256551.0, "step": 4755 }, { "entropy": 5.7253063201904295, "epoch": 0.3703559618751216, "grad_norm": 1.046875, "learning_rate": 0.0004990358826219192, "loss": 5.5599, "mean_token_accuracy": 0.16011908501386643, "num_tokens": 8265492.0, "step": 4760 }, { "entropy": 5.712846469879151, "epoch": 0.37074499124683913, "grad_norm": 1.0234375, "learning_rate": 0.0004990333179314038, "loss": 5.4861, "mean_token_accuracy": 0.16490963697433472, "num_tokens": 8273798.0, "step": 4765 }, { "entropy": 5.616565990447998, "epoch": 0.3711340206185567, "grad_norm": 0.9921875, "learning_rate": 0.0004990307498415393, "loss": 5.4606, "mean_token_accuracy": 0.16989797204732895, "num_tokens": 8281998.0, "step": 4770 }, { "entropy": 5.683922147750854, "epoch": 0.37152304999027425, "grad_norm": 1.03125, "learning_rate": 0.0004990281783523648, "loss": 5.6, "mean_token_accuracy": 0.16016341298818587, "num_tokens": 8289833.0, "step": 4775 }, { "entropy": 5.606426763534546, "epoch": 0.37191207936199183, "grad_norm": 1.0703125, "learning_rate": 0.0004990256034639192, "loss": 5.5551, "mean_token_accuracy": 0.16734271496534348, "num_tokens": 8297562.0, "step": 4780 }, { "entropy": 5.742149448394775, "epoch": 0.3723011087337094, "grad_norm": 1.0390625, "learning_rate": 0.0004990230251762418, "loss": 5.5653, "mean_token_accuracy": 0.16116626635193826, "num_tokens": 8305262.0, "step": 4785 }, { "entropy": 5.674399423599243, "epoch": 0.37269013810542695, "grad_norm": 0.984375, "learning_rate": 0.0004990204434893713, "loss": 5.4741, "mean_token_accuracy": 0.16709145307540893, "num_tokens": 8313949.0, "step": 4790 }, { "entropy": 5.641895389556884, "epoch": 0.37307916747714454, "grad_norm": 1.0078125, "learning_rate": 0.0004990178584033474, "loss": 5.5143, "mean_token_accuracy": 0.16286983639001845, "num_tokens": 8322801.0, "step": 4795 }, { "entropy": 5.716209983825683, "epoch": 0.37346819684886207, "grad_norm": 1.0390625, "learning_rate": 0.0004990152699182089, "loss": 5.5031, "mean_token_accuracy": 0.16409722119569778, "num_tokens": 8331118.0, "step": 4800 }, { "entropy": 5.6461936950683596, "epoch": 0.37385722622057965, "grad_norm": 1.046875, "learning_rate": 0.0004990126780339953, "loss": 5.5746, "mean_token_accuracy": 0.16201503276824952, "num_tokens": 8340498.0, "step": 4805 }, { "entropy": 5.795285844802857, "epoch": 0.37424625559229724, "grad_norm": 1.03125, "learning_rate": 0.0004990100827507459, "loss": 5.6856, "mean_token_accuracy": 0.15614394545555116, "num_tokens": 8349235.0, "step": 4810 }, { "entropy": 5.668808126449585, "epoch": 0.37463528496401477, "grad_norm": 1.0625, "learning_rate": 0.0004990074840684999, "loss": 5.5826, "mean_token_accuracy": 0.16042376458644866, "num_tokens": 8358484.0, "step": 4815 }, { "entropy": 5.689554738998413, "epoch": 0.37502431433573236, "grad_norm": 1.0234375, "learning_rate": 0.0004990048819872969, "loss": 5.4939, "mean_token_accuracy": 0.1701010376214981, "num_tokens": 8366894.0, "step": 4820 }, { "entropy": 5.618418550491333, "epoch": 0.3754133437074499, "grad_norm": 0.97265625, "learning_rate": 0.0004990022765071765, "loss": 5.5087, "mean_token_accuracy": 0.15820858031511306, "num_tokens": 8375271.0, "step": 4825 }, { "entropy": 5.691072702407837, "epoch": 0.3758023730791675, "grad_norm": 0.95703125, "learning_rate": 0.000498999667628178, "loss": 5.452, "mean_token_accuracy": 0.1625892162322998, "num_tokens": 8383714.0, "step": 4830 }, { "entropy": 5.630849313735962, "epoch": 0.37619140245088506, "grad_norm": 1.0625, "learning_rate": 0.0004989970553503411, "loss": 5.552, "mean_token_accuracy": 0.15851999670267106, "num_tokens": 8392022.0, "step": 4835 }, { "entropy": 5.704822587966919, "epoch": 0.3765804318226026, "grad_norm": 0.99609375, "learning_rate": 0.0004989944396737054, "loss": 5.5144, "mean_token_accuracy": 0.1620304763317108, "num_tokens": 8401282.0, "step": 4840 }, { "entropy": 5.679300594329834, "epoch": 0.3769694611943202, "grad_norm": 1.0390625, "learning_rate": 0.0004989918205983106, "loss": 5.5913, "mean_token_accuracy": 0.16058251559734343, "num_tokens": 8411147.0, "step": 4845 }, { "entropy": 5.80027208328247, "epoch": 0.37735849056603776, "grad_norm": 1.015625, "learning_rate": 0.0004989891981241964, "loss": 5.5855, "mean_token_accuracy": 0.16146292835474013, "num_tokens": 8420434.0, "step": 4850 }, { "entropy": 5.73548994064331, "epoch": 0.3777475199377553, "grad_norm": 0.98828125, "learning_rate": 0.0004989865722514027, "loss": 5.5538, "mean_token_accuracy": 0.16584563851356507, "num_tokens": 8430022.0, "step": 4855 }, { "entropy": 5.528020763397217, "epoch": 0.3781365493094729, "grad_norm": 1.0625, "learning_rate": 0.0004989839429799692, "loss": 5.3401, "mean_token_accuracy": 0.17489640563726425, "num_tokens": 8438898.0, "step": 4860 }, { "entropy": 5.590051126480103, "epoch": 0.3785255786811904, "grad_norm": 1.078125, "learning_rate": 0.000498981310309936, "loss": 5.4349, "mean_token_accuracy": 0.17143376916646957, "num_tokens": 8446931.0, "step": 4865 }, { "entropy": 5.696088552474976, "epoch": 0.378914608052908, "grad_norm": 1.015625, "learning_rate": 0.0004989786742413428, "loss": 5.5092, "mean_token_accuracy": 0.16275201737880707, "num_tokens": 8455515.0, "step": 4870 }, { "entropy": 5.677388048171997, "epoch": 0.3793036374246256, "grad_norm": 1.03125, "learning_rate": 0.0004989760347742298, "loss": 5.5269, "mean_token_accuracy": 0.1604243353009224, "num_tokens": 8464135.0, "step": 4875 }, { "entropy": 5.745461559295654, "epoch": 0.3796926667963431, "grad_norm": 1.0234375, "learning_rate": 0.0004989733919086369, "loss": 5.6083, "mean_token_accuracy": 0.16428772658109664, "num_tokens": 8473222.0, "step": 4880 }, { "entropy": 5.6897931575775145, "epoch": 0.3800816961680607, "grad_norm": 0.9921875, "learning_rate": 0.0004989707456446043, "loss": 5.5862, "mean_token_accuracy": 0.169316303730011, "num_tokens": 8481966.0, "step": 4885 }, { "entropy": 5.693439865112305, "epoch": 0.38047072553977823, "grad_norm": 0.96484375, "learning_rate": 0.0004989680959821721, "loss": 5.5924, "mean_token_accuracy": 0.15563373863697053, "num_tokens": 8491276.0, "step": 4890 }, { "entropy": 5.698636674880982, "epoch": 0.3808597549114958, "grad_norm": 1.0234375, "learning_rate": 0.0004989654429213805, "loss": 5.5523, "mean_token_accuracy": 0.1644874855875969, "num_tokens": 8499926.0, "step": 4895 }, { "entropy": 5.647000408172607, "epoch": 0.3812487842832134, "grad_norm": 0.98046875, "learning_rate": 0.0004989627864622699, "loss": 5.4189, "mean_token_accuracy": 0.16593925654888153, "num_tokens": 8508544.0, "step": 4900 }, { "entropy": 5.704534101486206, "epoch": 0.38163781365493094, "grad_norm": 1.125, "learning_rate": 0.0004989601266048804, "loss": 5.5713, "mean_token_accuracy": 0.1553783245384693, "num_tokens": 8517326.0, "step": 4905 }, { "entropy": 5.6575311660766605, "epoch": 0.3820268430266485, "grad_norm": 1.0, "learning_rate": 0.0004989574633492525, "loss": 5.5284, "mean_token_accuracy": 0.15839311182498933, "num_tokens": 8526218.0, "step": 4910 }, { "entropy": 5.743776273727417, "epoch": 0.38241587239836605, "grad_norm": 1.03125, "learning_rate": 0.0004989547966954266, "loss": 5.5686, "mean_token_accuracy": 0.1592984326183796, "num_tokens": 8534708.0, "step": 4915 }, { "entropy": 5.61528787612915, "epoch": 0.38280490177008364, "grad_norm": 0.953125, "learning_rate": 0.000498952126643443, "loss": 5.5106, "mean_token_accuracy": 0.16692230254411697, "num_tokens": 8543302.0, "step": 4920 }, { "entropy": 5.602381849288941, "epoch": 0.3831939311418012, "grad_norm": 0.95703125, "learning_rate": 0.0004989494531933424, "loss": 5.4373, "mean_token_accuracy": 0.16146207898855208, "num_tokens": 8552586.0, "step": 4925 }, { "entropy": 5.617420196533203, "epoch": 0.38358296051351876, "grad_norm": 0.921875, "learning_rate": 0.0004989467763451652, "loss": 5.3988, "mean_token_accuracy": 0.1710638538002968, "num_tokens": 8561720.0, "step": 4930 }, { "entropy": 5.663424062728882, "epoch": 0.38397198988523634, "grad_norm": 0.9921875, "learning_rate": 0.0004989440960989523, "loss": 5.4109, "mean_token_accuracy": 0.16861876845359802, "num_tokens": 8570510.0, "step": 4935 }, { "entropy": 5.665288877487183, "epoch": 0.3843610192569539, "grad_norm": 0.9453125, "learning_rate": 0.000498941412454744, "loss": 5.538, "mean_token_accuracy": 0.16042274087667466, "num_tokens": 8579986.0, "step": 4940 }, { "entropy": 5.662878370285034, "epoch": 0.38475004862867146, "grad_norm": 0.99609375, "learning_rate": 0.0004989387254125813, "loss": 5.5009, "mean_token_accuracy": 0.1592758759856224, "num_tokens": 8588507.0, "step": 4945 }, { "entropy": 5.637141275405884, "epoch": 0.38513907800038905, "grad_norm": 1.015625, "learning_rate": 0.0004989360349725049, "loss": 5.4032, "mean_token_accuracy": 0.16547817438840867, "num_tokens": 8596651.0, "step": 4950 }, { "entropy": 5.6403545379638675, "epoch": 0.3855281073721066, "grad_norm": 1.0234375, "learning_rate": 0.0004989333411345555, "loss": 5.4617, "mean_token_accuracy": 0.1652302175760269, "num_tokens": 8605080.0, "step": 4955 }, { "entropy": 5.5624915599823, "epoch": 0.38591713674382416, "grad_norm": 1.09375, "learning_rate": 0.0004989306438987742, "loss": 5.4226, "mean_token_accuracy": 0.16806283146142958, "num_tokens": 8613017.0, "step": 4960 }, { "entropy": 5.68736834526062, "epoch": 0.38630616611554175, "grad_norm": 0.96875, "learning_rate": 0.0004989279432652018, "loss": 5.5976, "mean_token_accuracy": 0.1638832852244377, "num_tokens": 8621954.0, "step": 4965 }, { "entropy": 5.71930775642395, "epoch": 0.3866951954872593, "grad_norm": 0.98046875, "learning_rate": 0.0004989252392338791, "loss": 5.5433, "mean_token_accuracy": 0.1683834195137024, "num_tokens": 8630213.0, "step": 4970 }, { "entropy": 5.727107429504395, "epoch": 0.38708422485897687, "grad_norm": 0.9921875, "learning_rate": 0.0004989225318048475, "loss": 5.5426, "mean_token_accuracy": 0.16103035658597947, "num_tokens": 8638360.0, "step": 4975 }, { "entropy": 5.720944547653199, "epoch": 0.3874732542306944, "grad_norm": 1.0, "learning_rate": 0.0004989198209781478, "loss": 5.6003, "mean_token_accuracy": 0.16013864651322365, "num_tokens": 8647778.0, "step": 4980 }, { "entropy": 5.692323637008667, "epoch": 0.387862283602412, "grad_norm": 1.1640625, "learning_rate": 0.0004989171067538211, "loss": 5.524, "mean_token_accuracy": 0.16101902723312378, "num_tokens": 8655584.0, "step": 4985 }, { "entropy": 5.648969650268555, "epoch": 0.38825131297412957, "grad_norm": 0.9609375, "learning_rate": 0.000498914389131909, "loss": 5.5557, "mean_token_accuracy": 0.1625164344906807, "num_tokens": 8664159.0, "step": 4990 }, { "entropy": 5.676162624359131, "epoch": 0.3886403423458471, "grad_norm": 0.98046875, "learning_rate": 0.0004989116681124523, "loss": 5.4414, "mean_token_accuracy": 0.16503534018993377, "num_tokens": 8672488.0, "step": 4995 }, { "entropy": 5.730154418945313, "epoch": 0.3890293717175647, "grad_norm": 1.0234375, "learning_rate": 0.0004989089436954924, "loss": 5.5977, "mean_token_accuracy": 0.1612487852573395, "num_tokens": 8681492.0, "step": 5000 }, { "entropy": 5.601837539672852, "epoch": 0.3894184010892822, "grad_norm": 1.015625, "learning_rate": 0.0004989062158810706, "loss": 5.4851, "mean_token_accuracy": 0.16473744660615922, "num_tokens": 8690453.0, "step": 5005 }, { "entropy": 5.719622421264648, "epoch": 0.3898074304609998, "grad_norm": 0.921875, "learning_rate": 0.0004989034846692284, "loss": 5.5561, "mean_token_accuracy": 0.1666879713535309, "num_tokens": 8699349.0, "step": 5010 }, { "entropy": 5.679425525665283, "epoch": 0.3901964598327174, "grad_norm": 1.0625, "learning_rate": 0.0004989007500600073, "loss": 5.5617, "mean_token_accuracy": 0.16023534089326857, "num_tokens": 8707512.0, "step": 5015 }, { "entropy": 5.760986375808716, "epoch": 0.3905854892044349, "grad_norm": 0.984375, "learning_rate": 0.0004988980120534486, "loss": 5.5866, "mean_token_accuracy": 0.16257491409778596, "num_tokens": 8715847.0, "step": 5020 }, { "entropy": 5.6762927055358885, "epoch": 0.3909745185761525, "grad_norm": 0.96484375, "learning_rate": 0.000498895270649594, "loss": 5.4819, "mean_token_accuracy": 0.1681723803281784, "num_tokens": 8725548.0, "step": 5025 }, { "entropy": 5.57688341140747, "epoch": 0.39136354794787004, "grad_norm": 1.046875, "learning_rate": 0.000498892525848485, "loss": 5.4595, "mean_token_accuracy": 0.16113873124122619, "num_tokens": 8733935.0, "step": 5030 }, { "entropy": 5.660002040863037, "epoch": 0.3917525773195876, "grad_norm": 0.93359375, "learning_rate": 0.0004988897776501633, "loss": 5.5672, "mean_token_accuracy": 0.16277794241905214, "num_tokens": 8743110.0, "step": 5035 }, { "entropy": 5.650880193710327, "epoch": 0.3921416066913052, "grad_norm": 1.0, "learning_rate": 0.0004988870260546705, "loss": 5.377, "mean_token_accuracy": 0.16757228821516038, "num_tokens": 8751166.0, "step": 5040 }, { "entropy": 5.676319599151611, "epoch": 0.39253063606302274, "grad_norm": 0.921875, "learning_rate": 0.0004988842710620486, "loss": 5.5755, "mean_token_accuracy": 0.16439453810453414, "num_tokens": 8759929.0, "step": 5045 }, { "entropy": 5.710107803344727, "epoch": 0.39291966543474033, "grad_norm": 1.015625, "learning_rate": 0.0004988815126723391, "loss": 5.5927, "mean_token_accuracy": 0.15978324115276338, "num_tokens": 8768541.0, "step": 5050 }, { "entropy": 5.739083576202392, "epoch": 0.3933086948064579, "grad_norm": 1.109375, "learning_rate": 0.0004988787508855841, "loss": 5.4913, "mean_token_accuracy": 0.161235274374485, "num_tokens": 8776803.0, "step": 5055 }, { "entropy": 5.619376373291016, "epoch": 0.39369772417817545, "grad_norm": 1.125, "learning_rate": 0.0004988759857018253, "loss": 5.4953, "mean_token_accuracy": 0.16697628945112228, "num_tokens": 8784773.0, "step": 5060 }, { "entropy": 5.731350326538086, "epoch": 0.39408675354989303, "grad_norm": 1.0625, "learning_rate": 0.0004988732171211048, "loss": 5.5227, "mean_token_accuracy": 0.16417534202337264, "num_tokens": 8793797.0, "step": 5065 }, { "entropy": 5.592066097259521, "epoch": 0.39447578292161056, "grad_norm": 0.97265625, "learning_rate": 0.0004988704451434644, "loss": 5.4019, "mean_token_accuracy": 0.16893110424280167, "num_tokens": 8802366.0, "step": 5070 }, { "entropy": 5.660155868530273, "epoch": 0.39486481229332815, "grad_norm": 1.015625, "learning_rate": 0.0004988676697689465, "loss": 5.5391, "mean_token_accuracy": 0.16272079348564147, "num_tokens": 8810975.0, "step": 5075 }, { "entropy": 5.680756092071533, "epoch": 0.39525384166504574, "grad_norm": 1.046875, "learning_rate": 0.000498864890997593, "loss": 5.5829, "mean_token_accuracy": 0.15348358899354936, "num_tokens": 8819137.0, "step": 5080 }, { "entropy": 5.720478916168213, "epoch": 0.39564287103676327, "grad_norm": 0.99609375, "learning_rate": 0.0004988621088294461, "loss": 5.567, "mean_token_accuracy": 0.15802430659532546, "num_tokens": 8827676.0, "step": 5085 }, { "entropy": 5.639574909210205, "epoch": 0.39603190040848085, "grad_norm": 1.015625, "learning_rate": 0.000498859323264548, "loss": 5.5193, "mean_token_accuracy": 0.16178436428308487, "num_tokens": 8836005.0, "step": 5090 }, { "entropy": 5.609964084625244, "epoch": 0.3964209297801984, "grad_norm": 1.015625, "learning_rate": 0.000498856534302941, "loss": 5.4125, "mean_token_accuracy": 0.1722085103392601, "num_tokens": 8844153.0, "step": 5095 }, { "entropy": 5.700956249237061, "epoch": 0.39680995915191597, "grad_norm": 0.96484375, "learning_rate": 0.0004988537419446673, "loss": 5.517, "mean_token_accuracy": 0.16102592051029205, "num_tokens": 8852520.0, "step": 5100 }, { "entropy": 5.665908241271973, "epoch": 0.39719898852363356, "grad_norm": 1.0390625, "learning_rate": 0.0004988509461897694, "loss": 5.364, "mean_token_accuracy": 0.17337042838335037, "num_tokens": 8860609.0, "step": 5105 }, { "entropy": 5.617171764373779, "epoch": 0.3975880178953511, "grad_norm": 1.0234375, "learning_rate": 0.0004988481470382897, "loss": 5.5373, "mean_token_accuracy": 0.16442073434591292, "num_tokens": 8869185.0, "step": 5110 }, { "entropy": 5.66382327079773, "epoch": 0.3979770472670687, "grad_norm": 0.984375, "learning_rate": 0.0004988453444902708, "loss": 5.4023, "mean_token_accuracy": 0.16232824474573135, "num_tokens": 8877758.0, "step": 5115 }, { "entropy": 5.666703510284424, "epoch": 0.3983660766387862, "grad_norm": 0.94921875, "learning_rate": 0.0004988425385457549, "loss": 5.5814, "mean_token_accuracy": 0.16767374575138091, "num_tokens": 8887236.0, "step": 5120 }, { "entropy": 5.727814960479736, "epoch": 0.3987551060105038, "grad_norm": 0.984375, "learning_rate": 0.0004988397292047848, "loss": 5.5315, "mean_token_accuracy": 0.16686426103115082, "num_tokens": 8895808.0, "step": 5125 }, { "entropy": 5.680415868759155, "epoch": 0.3991441353822214, "grad_norm": 1.03125, "learning_rate": 0.0004988369164674032, "loss": 5.5185, "mean_token_accuracy": 0.16700370758771896, "num_tokens": 8904091.0, "step": 5130 }, { "entropy": 5.540524578094482, "epoch": 0.3995331647539389, "grad_norm": 1.03125, "learning_rate": 0.0004988341003336526, "loss": 5.3377, "mean_token_accuracy": 0.16943544745445252, "num_tokens": 8912046.0, "step": 5135 }, { "entropy": 5.691886138916016, "epoch": 0.3999221941256565, "grad_norm": 1.0078125, "learning_rate": 0.0004988312808035757, "loss": 5.5576, "mean_token_accuracy": 0.1542545847594738, "num_tokens": 8921060.0, "step": 5140 }, { "entropy": 5.678117561340332, "epoch": 0.400311223497374, "grad_norm": 0.96484375, "learning_rate": 0.0004988284578772155, "loss": 5.493, "mean_token_accuracy": 0.16438425034284593, "num_tokens": 8930757.0, "step": 5145 }, { "entropy": 5.776554250717163, "epoch": 0.4007002528690916, "grad_norm": 0.99609375, "learning_rate": 0.0004988256315546146, "loss": 5.6521, "mean_token_accuracy": 0.1632249116897583, "num_tokens": 8939544.0, "step": 5150 }, { "entropy": 5.60939998626709, "epoch": 0.4010892822408092, "grad_norm": 0.9765625, "learning_rate": 0.0004988228018358161, "loss": 5.4761, "mean_token_accuracy": 0.1680803343653679, "num_tokens": 8949347.0, "step": 5155 }, { "entropy": 5.6522157192230225, "epoch": 0.40147831161252673, "grad_norm": 1.0078125, "learning_rate": 0.0004988199687208628, "loss": 5.5029, "mean_token_accuracy": 0.16580344885587692, "num_tokens": 8957697.0, "step": 5160 }, { "entropy": 5.667740964889527, "epoch": 0.4018673409842443, "grad_norm": 0.99609375, "learning_rate": 0.0004988171322097977, "loss": 5.5452, "mean_token_accuracy": 0.15877031087875365, "num_tokens": 8966107.0, "step": 5165 }, { "entropy": 5.63241982460022, "epoch": 0.4022563703559619, "grad_norm": 1.0625, "learning_rate": 0.0004988142923026638, "loss": 5.4586, "mean_token_accuracy": 0.16741299033164977, "num_tokens": 8974128.0, "step": 5170 }, { "entropy": 5.608824968338013, "epoch": 0.40264539972767943, "grad_norm": 1.0, "learning_rate": 0.0004988114489995044, "loss": 5.4587, "mean_token_accuracy": 0.16279011368751525, "num_tokens": 8982564.0, "step": 5175 }, { "entropy": 5.594621706008911, "epoch": 0.403034429099397, "grad_norm": 0.953125, "learning_rate": 0.0004988086023003624, "loss": 5.4747, "mean_token_accuracy": 0.16702579110860824, "num_tokens": 8990924.0, "step": 5180 }, { "entropy": 5.7941367626190186, "epoch": 0.40342345847111455, "grad_norm": 1.015625, "learning_rate": 0.0004988057522052811, "loss": 5.5863, "mean_token_accuracy": 0.15846182107925416, "num_tokens": 8999827.0, "step": 5185 }, { "entropy": 5.667945146560669, "epoch": 0.40381248784283214, "grad_norm": 0.9921875, "learning_rate": 0.0004988028987143037, "loss": 5.4127, "mean_token_accuracy": 0.16810715943574905, "num_tokens": 9007885.0, "step": 5190 }, { "entropy": 5.655215787887573, "epoch": 0.4042015172145497, "grad_norm": 0.9609375, "learning_rate": 0.0004988000418274736, "loss": 5.5149, "mean_token_accuracy": 0.16204234063625336, "num_tokens": 9016752.0, "step": 5195 }, { "entropy": 5.696285581588745, "epoch": 0.40459054658626725, "grad_norm": 0.99609375, "learning_rate": 0.0004987971815448341, "loss": 5.5101, "mean_token_accuracy": 0.16552756428718568, "num_tokens": 9025547.0, "step": 5200 }, { "entropy": 5.683474922180176, "epoch": 0.40497957595798484, "grad_norm": 1.03125, "learning_rate": 0.0004987943178664285, "loss": 5.552, "mean_token_accuracy": 0.15770690143108368, "num_tokens": 9034711.0, "step": 5205 }, { "entropy": 5.697414779663086, "epoch": 0.40536860532970237, "grad_norm": 1.0703125, "learning_rate": 0.0004987914507923004, "loss": 5.4505, "mean_token_accuracy": 0.16524471193552018, "num_tokens": 9042565.0, "step": 5210 }, { "entropy": 5.592935276031494, "epoch": 0.40575763470141996, "grad_norm": 1.0390625, "learning_rate": 0.0004987885803224931, "loss": 5.5219, "mean_token_accuracy": 0.15521206110715866, "num_tokens": 9051590.0, "step": 5215 }, { "entropy": 5.702045011520386, "epoch": 0.40614666407313754, "grad_norm": 1.0546875, "learning_rate": 0.0004987857064570505, "loss": 5.6005, "mean_token_accuracy": 0.16120531857013704, "num_tokens": 9060415.0, "step": 5220 }, { "entropy": 5.619015216827393, "epoch": 0.4065356934448551, "grad_norm": 1.046875, "learning_rate": 0.0004987828291960158, "loss": 5.3811, "mean_token_accuracy": 0.16975099742412567, "num_tokens": 9069492.0, "step": 5225 }, { "entropy": 5.593218278884888, "epoch": 0.40692472281657266, "grad_norm": 0.98046875, "learning_rate": 0.000498779948539433, "loss": 5.443, "mean_token_accuracy": 0.16820174008607863, "num_tokens": 9078183.0, "step": 5230 }, { "entropy": 5.754888248443604, "epoch": 0.4073137521882902, "grad_norm": 1.0234375, "learning_rate": 0.0004987770644873455, "loss": 5.6682, "mean_token_accuracy": 0.15733300000429154, "num_tokens": 9086661.0, "step": 5235 }, { "entropy": 5.627206754684448, "epoch": 0.4077027815600078, "grad_norm": 0.99609375, "learning_rate": 0.0004987741770397974, "loss": 5.3865, "mean_token_accuracy": 0.16997277289628981, "num_tokens": 9095449.0, "step": 5240 }, { "entropy": 5.628784608840943, "epoch": 0.40809181093172536, "grad_norm": 1.109375, "learning_rate": 0.0004987712861968323, "loss": 5.5283, "mean_token_accuracy": 0.15532390177249908, "num_tokens": 9103347.0, "step": 5245 }, { "entropy": 5.539442920684815, "epoch": 0.4084808403034429, "grad_norm": 0.9296875, "learning_rate": 0.000498768391958494, "loss": 5.4372, "mean_token_accuracy": 0.1731258362531662, "num_tokens": 9112382.0, "step": 5250 }, { "entropy": 5.647328233718872, "epoch": 0.4088698696751605, "grad_norm": 0.96484375, "learning_rate": 0.0004987654943248266, "loss": 5.4053, "mean_token_accuracy": 0.16700365394353867, "num_tokens": 9120628.0, "step": 5255 }, { "entropy": 5.694366407394409, "epoch": 0.40925889904687807, "grad_norm": 0.9765625, "learning_rate": 0.0004987625932958739, "loss": 5.545, "mean_token_accuracy": 0.15544501841068267, "num_tokens": 9130280.0, "step": 5260 }, { "entropy": 5.819931268692017, "epoch": 0.4096479284185956, "grad_norm": 0.96484375, "learning_rate": 0.0004987596888716801, "loss": 5.6471, "mean_token_accuracy": 0.15586191713809966, "num_tokens": 9139720.0, "step": 5265 }, { "entropy": 5.632251214981079, "epoch": 0.4100369577903132, "grad_norm": 0.95703125, "learning_rate": 0.0004987567810522892, "loss": 5.5686, "mean_token_accuracy": 0.15921868681907653, "num_tokens": 9148537.0, "step": 5270 }, { "entropy": 5.702337598800659, "epoch": 0.4104259871620307, "grad_norm": 1.0703125, "learning_rate": 0.0004987538698377451, "loss": 5.6348, "mean_token_accuracy": 0.16866708248853685, "num_tokens": 9156965.0, "step": 5275 }, { "entropy": 5.637188529968261, "epoch": 0.4108150165337483, "grad_norm": 1.015625, "learning_rate": 0.0004987509552280924, "loss": 5.3663, "mean_token_accuracy": 0.17250857055187224, "num_tokens": 9164982.0, "step": 5280 }, { "entropy": 5.670972013473511, "epoch": 0.4112040459054659, "grad_norm": 1.046875, "learning_rate": 0.000498748037223375, "loss": 5.5863, "mean_token_accuracy": 0.1595808021724224, "num_tokens": 9173383.0, "step": 5285 }, { "entropy": 5.714626264572144, "epoch": 0.4115930752771834, "grad_norm": 0.9609375, "learning_rate": 0.0004987451158236372, "loss": 5.5843, "mean_token_accuracy": 0.17200423628091813, "num_tokens": 9182743.0, "step": 5290 }, { "entropy": 5.722370147705078, "epoch": 0.411982104648901, "grad_norm": 0.95703125, "learning_rate": 0.0004987421910289234, "loss": 5.4729, "mean_token_accuracy": 0.16518608927726747, "num_tokens": 9191770.0, "step": 5295 }, { "entropy": 5.507548522949219, "epoch": 0.41237113402061853, "grad_norm": 0.96484375, "learning_rate": 0.0004987392628392781, "loss": 5.4645, "mean_token_accuracy": 0.17184146940708162, "num_tokens": 9200885.0, "step": 5300 }, { "entropy": 5.75942063331604, "epoch": 0.4127601633923361, "grad_norm": 0.94140625, "learning_rate": 0.0004987363312547456, "loss": 5.5127, "mean_token_accuracy": 0.16049581915140151, "num_tokens": 9210114.0, "step": 5305 }, { "entropy": 5.726402950286865, "epoch": 0.4131491927640537, "grad_norm": 1.03125, "learning_rate": 0.0004987333962753703, "loss": 5.4866, "mean_token_accuracy": 0.16796217560768129, "num_tokens": 9218608.0, "step": 5310 }, { "entropy": 5.61348934173584, "epoch": 0.41353822213577124, "grad_norm": 0.9609375, "learning_rate": 0.0004987304579011967, "loss": 5.5281, "mean_token_accuracy": 0.16807485967874528, "num_tokens": 9227737.0, "step": 5315 }, { "entropy": 5.612955093383789, "epoch": 0.4139272515074888, "grad_norm": 1.03125, "learning_rate": 0.0004987275161322697, "loss": 5.4455, "mean_token_accuracy": 0.16860099285840988, "num_tokens": 9236589.0, "step": 5320 }, { "entropy": 5.645352697372436, "epoch": 0.41431628087920636, "grad_norm": 1.0078125, "learning_rate": 0.0004987245709686337, "loss": 5.4712, "mean_token_accuracy": 0.1744957759976387, "num_tokens": 9245313.0, "step": 5325 }, { "entropy": 5.609607744216919, "epoch": 0.41470531025092394, "grad_norm": 0.97265625, "learning_rate": 0.0004987216224103334, "loss": 5.5259, "mean_token_accuracy": 0.15794259160757065, "num_tokens": 9254001.0, "step": 5330 }, { "entropy": 5.725889730453491, "epoch": 0.41509433962264153, "grad_norm": 1.078125, "learning_rate": 0.0004987186704574136, "loss": 5.5794, "mean_token_accuracy": 0.15721883326768876, "num_tokens": 9262485.0, "step": 5335 }, { "entropy": 5.671980142593384, "epoch": 0.41548336899435906, "grad_norm": 0.9921875, "learning_rate": 0.0004987157151099189, "loss": 5.4654, "mean_token_accuracy": 0.16698906123638152, "num_tokens": 9271490.0, "step": 5340 }, { "entropy": 5.617227935791016, "epoch": 0.41587239836607665, "grad_norm": 0.99609375, "learning_rate": 0.0004987127563678945, "loss": 5.4886, "mean_token_accuracy": 0.16965751051902772, "num_tokens": 9280595.0, "step": 5345 }, { "entropy": 5.653589868545533, "epoch": 0.4162614277377942, "grad_norm": 0.9609375, "learning_rate": 0.0004987097942313852, "loss": 5.4076, "mean_token_accuracy": 0.172671402990818, "num_tokens": 9289260.0, "step": 5350 }, { "entropy": 5.703232002258301, "epoch": 0.41665045710951176, "grad_norm": 0.95703125, "learning_rate": 0.0004987068287004355, "loss": 5.5825, "mean_token_accuracy": 0.16232939064502716, "num_tokens": 9297842.0, "step": 5355 }, { "entropy": 5.719019365310669, "epoch": 0.41703948648122935, "grad_norm": 1.015625, "learning_rate": 0.0004987038597750909, "loss": 5.5775, "mean_token_accuracy": 0.16258386820554732, "num_tokens": 9306533.0, "step": 5360 }, { "entropy": 5.695370769500732, "epoch": 0.4174285158529469, "grad_norm": 0.98046875, "learning_rate": 0.0004987008874553964, "loss": 5.4541, "mean_token_accuracy": 0.16366709172725677, "num_tokens": 9314534.0, "step": 5365 }, { "entropy": 5.738441705703735, "epoch": 0.41781754522466447, "grad_norm": 1.015625, "learning_rate": 0.0004986979117413969, "loss": 5.6188, "mean_token_accuracy": 0.1668700933456421, "num_tokens": 9323179.0, "step": 5370 }, { "entropy": 5.623295402526855, "epoch": 0.41820657459638205, "grad_norm": 0.9921875, "learning_rate": 0.0004986949326331376, "loss": 5.4067, "mean_token_accuracy": 0.1757480889558792, "num_tokens": 9331265.0, "step": 5375 }, { "entropy": 5.637596559524536, "epoch": 0.4185956039680996, "grad_norm": 0.9765625, "learning_rate": 0.0004986919501306638, "loss": 5.4783, "mean_token_accuracy": 0.15887642353773118, "num_tokens": 9340856.0, "step": 5380 }, { "entropy": 5.651981019973755, "epoch": 0.41898463333981717, "grad_norm": 0.9609375, "learning_rate": 0.0004986889642340207, "loss": 5.4972, "mean_token_accuracy": 0.15731943473219873, "num_tokens": 9350728.0, "step": 5385 }, { "entropy": 5.718332433700562, "epoch": 0.4193736627115347, "grad_norm": 1.0859375, "learning_rate": 0.0004986859749432536, "loss": 5.6181, "mean_token_accuracy": 0.15903780460357667, "num_tokens": 9360109.0, "step": 5390 }, { "entropy": 5.748874664306641, "epoch": 0.4197626920832523, "grad_norm": 1.015625, "learning_rate": 0.0004986829822584078, "loss": 5.585, "mean_token_accuracy": 0.1624787151813507, "num_tokens": 9369101.0, "step": 5395 }, { "entropy": 5.699647426605225, "epoch": 0.4201517214549699, "grad_norm": 1.0625, "learning_rate": 0.0004986799861795289, "loss": 5.5483, "mean_token_accuracy": 0.16545858085155488, "num_tokens": 9377686.0, "step": 5400 }, { "entropy": 5.719456434249878, "epoch": 0.4205407508266874, "grad_norm": 1.1015625, "learning_rate": 0.0004986769867066622, "loss": 5.5296, "mean_token_accuracy": 0.16334747076034545, "num_tokens": 9386439.0, "step": 5405 }, { "entropy": 5.654419565200806, "epoch": 0.420929780198405, "grad_norm": 1.03125, "learning_rate": 0.0004986739838398532, "loss": 5.5743, "mean_token_accuracy": 0.15611925572156907, "num_tokens": 9395086.0, "step": 5410 }, { "entropy": 5.651913070678711, "epoch": 0.4213188095701225, "grad_norm": 0.94921875, "learning_rate": 0.0004986709775791475, "loss": 5.4338, "mean_token_accuracy": 0.16861581802368164, "num_tokens": 9403762.0, "step": 5415 }, { "entropy": 5.638100814819336, "epoch": 0.4217078389418401, "grad_norm": 1.046875, "learning_rate": 0.0004986679679245907, "loss": 5.4745, "mean_token_accuracy": 0.16845559030771257, "num_tokens": 9412386.0, "step": 5420 }, { "entropy": 5.654151153564453, "epoch": 0.4220968683135577, "grad_norm": 1.015625, "learning_rate": 0.0004986649548762286, "loss": 5.4395, "mean_token_accuracy": 0.1766769051551819, "num_tokens": 9420538.0, "step": 5425 }, { "entropy": 5.578556871414184, "epoch": 0.4224858976852752, "grad_norm": 1.0390625, "learning_rate": 0.0004986619384341066, "loss": 5.4181, "mean_token_accuracy": 0.16903934627771378, "num_tokens": 9429083.0, "step": 5430 }, { "entropy": 5.645332145690918, "epoch": 0.4228749270569928, "grad_norm": 0.9921875, "learning_rate": 0.0004986589185982708, "loss": 5.5277, "mean_token_accuracy": 0.16904726922512053, "num_tokens": 9436892.0, "step": 5435 }, { "entropy": 5.62878098487854, "epoch": 0.42326395642871034, "grad_norm": 0.98046875, "learning_rate": 0.0004986558953687671, "loss": 5.5471, "mean_token_accuracy": 0.1671071842312813, "num_tokens": 9445267.0, "step": 5440 }, { "entropy": 5.692759227752686, "epoch": 0.42365298580042793, "grad_norm": 0.96875, "learning_rate": 0.0004986528687456409, "loss": 5.5473, "mean_token_accuracy": 0.1619514286518097, "num_tokens": 9454292.0, "step": 5445 }, { "entropy": 5.692660617828369, "epoch": 0.4240420151721455, "grad_norm": 0.93359375, "learning_rate": 0.0004986498387289384, "loss": 5.434, "mean_token_accuracy": 0.16928142309188843, "num_tokens": 9463126.0, "step": 5450 }, { "entropy": 5.680186367034912, "epoch": 0.42443104454386305, "grad_norm": 0.94921875, "learning_rate": 0.0004986468053187058, "loss": 5.526, "mean_token_accuracy": 0.16752272248268127, "num_tokens": 9471703.0, "step": 5455 }, { "entropy": 5.583491611480713, "epoch": 0.42482007391558063, "grad_norm": 0.91796875, "learning_rate": 0.0004986437685149887, "loss": 5.4078, "mean_token_accuracy": 0.17276425659656525, "num_tokens": 9480029.0, "step": 5460 }, { "entropy": 5.669733619689941, "epoch": 0.4252091032872982, "grad_norm": 0.984375, "learning_rate": 0.0004986407283178334, "loss": 5.5275, "mean_token_accuracy": 0.1660941243171692, "num_tokens": 9488277.0, "step": 5465 }, { "entropy": 5.674656867980957, "epoch": 0.42559813265901575, "grad_norm": 1.15625, "learning_rate": 0.0004986376847272861, "loss": 5.5736, "mean_token_accuracy": 0.16575695127248763, "num_tokens": 9496096.0, "step": 5470 }, { "entropy": 5.657446384429932, "epoch": 0.42598716203073334, "grad_norm": 1.1328125, "learning_rate": 0.0004986346377433929, "loss": 5.4813, "mean_token_accuracy": 0.16967480331659318, "num_tokens": 9504653.0, "step": 5475 }, { "entropy": 5.6826355934143065, "epoch": 0.42637619140245087, "grad_norm": 0.99609375, "learning_rate": 0.0004986315873661999, "loss": 5.4467, "mean_token_accuracy": 0.16702346205711366, "num_tokens": 9513088.0, "step": 5480 }, { "entropy": 5.585157108306885, "epoch": 0.42676522077416845, "grad_norm": 1.03125, "learning_rate": 0.0004986285335957536, "loss": 5.3617, "mean_token_accuracy": 0.17300552427768706, "num_tokens": 9521714.0, "step": 5485 }, { "entropy": 5.5741489887237545, "epoch": 0.42715425014588604, "grad_norm": 0.98828125, "learning_rate": 0.0004986254764321002, "loss": 5.467, "mean_token_accuracy": 0.17281568050384521, "num_tokens": 9530629.0, "step": 5490 }, { "entropy": 5.612785673141479, "epoch": 0.42754327951760357, "grad_norm": 0.9453125, "learning_rate": 0.0004986224158752861, "loss": 5.4437, "mean_token_accuracy": 0.17414536476135253, "num_tokens": 9539293.0, "step": 5495 }, { "entropy": 5.575432538986206, "epoch": 0.42793230888932116, "grad_norm": 1.046875, "learning_rate": 0.0004986193519253578, "loss": 5.4067, "mean_token_accuracy": 0.16896552741527557, "num_tokens": 9547628.0, "step": 5500 }, { "entropy": 5.604017972946167, "epoch": 0.4283213382610387, "grad_norm": 0.9609375, "learning_rate": 0.0004986162845823618, "loss": 5.4267, "mean_token_accuracy": 0.17168065458536147, "num_tokens": 9557260.0, "step": 5505 }, { "entropy": 5.7184590816497805, "epoch": 0.4287103676327563, "grad_norm": 1.0, "learning_rate": 0.0004986132138463446, "loss": 5.4712, "mean_token_accuracy": 0.15693661868572234, "num_tokens": 9565923.0, "step": 5510 }, { "entropy": 5.600460720062256, "epoch": 0.42909939700447386, "grad_norm": 1.0703125, "learning_rate": 0.0004986101397173528, "loss": 5.4645, "mean_token_accuracy": 0.16751811951398848, "num_tokens": 9574373.0, "step": 5515 }, { "entropy": 5.683349561691284, "epoch": 0.4294884263761914, "grad_norm": 1.0078125, "learning_rate": 0.000498607062195433, "loss": 5.5504, "mean_token_accuracy": 0.1631235733628273, "num_tokens": 9583652.0, "step": 5520 }, { "entropy": 5.680144786834717, "epoch": 0.429877455747909, "grad_norm": 0.984375, "learning_rate": 0.000498603981280632, "loss": 5.5133, "mean_token_accuracy": 0.16775375306606294, "num_tokens": 9592625.0, "step": 5525 }, { "entropy": 5.579809713363647, "epoch": 0.4302664851196265, "grad_norm": 0.9609375, "learning_rate": 0.0004986008969729964, "loss": 5.4202, "mean_token_accuracy": 0.16815870851278306, "num_tokens": 9600934.0, "step": 5530 }, { "entropy": 5.538936901092529, "epoch": 0.4306555144913441, "grad_norm": 0.98046875, "learning_rate": 0.0004985978092725731, "loss": 5.4112, "mean_token_accuracy": 0.16719519346952438, "num_tokens": 9609481.0, "step": 5535 }, { "entropy": 5.59554648399353, "epoch": 0.4310445438630617, "grad_norm": 1.0078125, "learning_rate": 0.000498594718179409, "loss": 5.3769, "mean_token_accuracy": 0.17795415222644806, "num_tokens": 9618063.0, "step": 5540 }, { "entropy": 5.682264947891236, "epoch": 0.4314335732347792, "grad_norm": 1.0546875, "learning_rate": 0.0004985916236935508, "loss": 5.4672, "mean_token_accuracy": 0.16837858706712722, "num_tokens": 9626144.0, "step": 5545 }, { "entropy": 5.451812887191773, "epoch": 0.4318226026064968, "grad_norm": 0.9609375, "learning_rate": 0.0004985885258150458, "loss": 5.4215, "mean_token_accuracy": 0.167401722073555, "num_tokens": 9635328.0, "step": 5550 }, { "entropy": 5.6543515682220455, "epoch": 0.43221163197821433, "grad_norm": 0.984375, "learning_rate": 0.0004985854245439408, "loss": 5.5584, "mean_token_accuracy": 0.15709087401628494, "num_tokens": 9644529.0, "step": 5555 }, { "entropy": 5.713449096679687, "epoch": 0.4326006613499319, "grad_norm": 1.0546875, "learning_rate": 0.0004985823198802827, "loss": 5.5353, "mean_token_accuracy": 0.16077228337526323, "num_tokens": 9653763.0, "step": 5560 }, { "entropy": 5.6186117172241214, "epoch": 0.4329896907216495, "grad_norm": 1.109375, "learning_rate": 0.0004985792118241188, "loss": 5.3736, "mean_token_accuracy": 0.171256360411644, "num_tokens": 9661433.0, "step": 5565 }, { "entropy": 5.568835210800171, "epoch": 0.43337872009336703, "grad_norm": 1.0078125, "learning_rate": 0.0004985761003754961, "loss": 5.3526, "mean_token_accuracy": 0.17259980142116546, "num_tokens": 9669688.0, "step": 5570 }, { "entropy": 5.657050752639771, "epoch": 0.4337677494650846, "grad_norm": 1.0, "learning_rate": 0.0004985729855344622, "loss": 5.474, "mean_token_accuracy": 0.1650309681892395, "num_tokens": 9678403.0, "step": 5575 }, { "entropy": 5.683776950836181, "epoch": 0.4341567788368022, "grad_norm": 1.0234375, "learning_rate": 0.000498569867301064, "loss": 5.5725, "mean_token_accuracy": 0.15945140421390533, "num_tokens": 9687504.0, "step": 5580 }, { "entropy": 5.635408067703247, "epoch": 0.43454580820851973, "grad_norm": 1.0, "learning_rate": 0.0004985667456753489, "loss": 5.3825, "mean_token_accuracy": 0.17245262265205383, "num_tokens": 9695772.0, "step": 5585 }, { "entropy": 5.624304962158203, "epoch": 0.4349348375802373, "grad_norm": 0.921875, "learning_rate": 0.0004985636206573642, "loss": 5.4634, "mean_token_accuracy": 0.16656662225723268, "num_tokens": 9704150.0, "step": 5590 }, { "entropy": 5.524925708770752, "epoch": 0.43532386695195485, "grad_norm": 1.03125, "learning_rate": 0.0004985604922471575, "loss": 5.3729, "mean_token_accuracy": 0.17111615985631942, "num_tokens": 9712245.0, "step": 5595 }, { "entropy": 5.619245958328247, "epoch": 0.43571289632367244, "grad_norm": 0.93359375, "learning_rate": 0.0004985573604447761, "loss": 5.5051, "mean_token_accuracy": 0.16338210701942443, "num_tokens": 9721027.0, "step": 5600 }, { "entropy": 5.671468448638916, "epoch": 0.43610192569539, "grad_norm": 1.046875, "learning_rate": 0.0004985542252502676, "loss": 5.4159, "mean_token_accuracy": 0.1692680224776268, "num_tokens": 9728939.0, "step": 5605 }, { "entropy": 5.716129922866822, "epoch": 0.43649095506710756, "grad_norm": 0.98828125, "learning_rate": 0.0004985510866636796, "loss": 5.5658, "mean_token_accuracy": 0.16524840891361237, "num_tokens": 9737863.0, "step": 5610 }, { "entropy": 5.680402708053589, "epoch": 0.43687998443882514, "grad_norm": 0.91796875, "learning_rate": 0.0004985479446850596, "loss": 5.5584, "mean_token_accuracy": 0.1601756900548935, "num_tokens": 9747666.0, "step": 5615 }, { "entropy": 5.643349838256836, "epoch": 0.4372690138105427, "grad_norm": 1.0078125, "learning_rate": 0.0004985447993144554, "loss": 5.4342, "mean_token_accuracy": 0.1627214342355728, "num_tokens": 9756595.0, "step": 5620 }, { "entropy": 5.62148151397705, "epoch": 0.43765804318226026, "grad_norm": 1.03125, "learning_rate": 0.0004985416505519147, "loss": 5.4696, "mean_token_accuracy": 0.16752104312181473, "num_tokens": 9764747.0, "step": 5625 }, { "entropy": 5.599878311157227, "epoch": 0.43804707255397785, "grad_norm": 0.984375, "learning_rate": 0.0004985384983974853, "loss": 5.4112, "mean_token_accuracy": 0.16520307958126068, "num_tokens": 9772992.0, "step": 5630 }, { "entropy": 5.655435037612915, "epoch": 0.4384361019256954, "grad_norm": 1.0078125, "learning_rate": 0.0004985353428512148, "loss": 5.3982, "mean_token_accuracy": 0.169257228076458, "num_tokens": 9781107.0, "step": 5635 }, { "entropy": 5.58502049446106, "epoch": 0.43882513129741296, "grad_norm": 0.9140625, "learning_rate": 0.0004985321839131514, "loss": 5.4798, "mean_token_accuracy": 0.16393501609563826, "num_tokens": 9790618.0, "step": 5640 }, { "entropy": 5.657913780212402, "epoch": 0.4392141606691305, "grad_norm": 1.0234375, "learning_rate": 0.0004985290215833428, "loss": 5.4852, "mean_token_accuracy": 0.16647476851940154, "num_tokens": 9800147.0, "step": 5645 }, { "entropy": 5.7092164039611815, "epoch": 0.4396031900408481, "grad_norm": 0.94140625, "learning_rate": 0.0004985258558618372, "loss": 5.5373, "mean_token_accuracy": 0.16442038416862487, "num_tokens": 9809056.0, "step": 5650 }, { "entropy": 5.572237920761109, "epoch": 0.43999221941256567, "grad_norm": 1.09375, "learning_rate": 0.0004985226867486825, "loss": 5.4018, "mean_token_accuracy": 0.16231081634759903, "num_tokens": 9817188.0, "step": 5655 }, { "entropy": 5.643007230758667, "epoch": 0.4403812487842832, "grad_norm": 0.91796875, "learning_rate": 0.0004985195142439267, "loss": 5.5829, "mean_token_accuracy": 0.16034058555960656, "num_tokens": 9826904.0, "step": 5660 }, { "entropy": 5.700199747085572, "epoch": 0.4407702781560008, "grad_norm": 0.95703125, "learning_rate": 0.0004985163383476181, "loss": 5.5507, "mean_token_accuracy": 0.16313511431217192, "num_tokens": 9835937.0, "step": 5665 }, { "entropy": 5.65016770362854, "epoch": 0.44115930752771837, "grad_norm": 1.015625, "learning_rate": 0.0004985131590598048, "loss": 5.3874, "mean_token_accuracy": 0.17442827373743058, "num_tokens": 9843695.0, "step": 5670 }, { "entropy": 5.626602268218994, "epoch": 0.4415483368994359, "grad_norm": 0.94140625, "learning_rate": 0.0004985099763805352, "loss": 5.4665, "mean_token_accuracy": 0.16676409542560577, "num_tokens": 9852693.0, "step": 5675 }, { "entropy": 5.594214963912964, "epoch": 0.4419373662711535, "grad_norm": 0.98046875, "learning_rate": 0.0004985067903098574, "loss": 5.4733, "mean_token_accuracy": 0.1682109758257866, "num_tokens": 9860251.0, "step": 5680 }, { "entropy": 5.5587108612060545, "epoch": 0.442326395642871, "grad_norm": 1.015625, "learning_rate": 0.0004985036008478197, "loss": 5.391, "mean_token_accuracy": 0.16241925805807114, "num_tokens": 9868319.0, "step": 5685 }, { "entropy": 5.572983074188232, "epoch": 0.4427154250145886, "grad_norm": 0.90625, "learning_rate": 0.0004985004079944707, "loss": 5.4393, "mean_token_accuracy": 0.16255133897066115, "num_tokens": 9877119.0, "step": 5690 }, { "entropy": 5.727364730834961, "epoch": 0.4431044543863062, "grad_norm": 1.0234375, "learning_rate": 0.0004984972117498587, "loss": 5.5136, "mean_token_accuracy": 0.16677001416683196, "num_tokens": 9886015.0, "step": 5695 }, { "entropy": 5.618843507766724, "epoch": 0.4434934837580237, "grad_norm": 0.98046875, "learning_rate": 0.0004984940121140323, "loss": 5.4561, "mean_token_accuracy": 0.1649298220872879, "num_tokens": 9894829.0, "step": 5700 }, { "entropy": 5.781460523605347, "epoch": 0.4438825131297413, "grad_norm": 1.0703125, "learning_rate": 0.00049849080908704, "loss": 5.7107, "mean_token_accuracy": 0.15197371542453766, "num_tokens": 9904840.0, "step": 5705 }, { "entropy": 5.779392242431641, "epoch": 0.44427154250145884, "grad_norm": 0.94140625, "learning_rate": 0.0004984876026689302, "loss": 5.5529, "mean_token_accuracy": 0.1596390500664711, "num_tokens": 9913535.0, "step": 5710 }, { "entropy": 5.697728252410888, "epoch": 0.4446605718731764, "grad_norm": 0.9921875, "learning_rate": 0.000498484392859752, "loss": 5.456, "mean_token_accuracy": 0.16690233200788498, "num_tokens": 9921676.0, "step": 5715 }, { "entropy": 5.586839818954468, "epoch": 0.445049601244894, "grad_norm": 1.03125, "learning_rate": 0.0004984811796595538, "loss": 5.5227, "mean_token_accuracy": 0.1633313000202179, "num_tokens": 9930321.0, "step": 5720 }, { "entropy": 5.598290538787841, "epoch": 0.44543863061661154, "grad_norm": 0.953125, "learning_rate": 0.0004984779630683843, "loss": 5.4535, "mean_token_accuracy": 0.16856093257665633, "num_tokens": 9939324.0, "step": 5725 }, { "entropy": 5.642680406570435, "epoch": 0.44582765998832913, "grad_norm": 0.953125, "learning_rate": 0.0004984747430862924, "loss": 5.474, "mean_token_accuracy": 0.16791820228099824, "num_tokens": 9948603.0, "step": 5730 }, { "entropy": 5.5791689395904545, "epoch": 0.44621668936004666, "grad_norm": 0.94921875, "learning_rate": 0.0004984715197133271, "loss": 5.3856, "mean_token_accuracy": 0.16801765114068984, "num_tokens": 9957165.0, "step": 5735 }, { "entropy": 5.667300176620484, "epoch": 0.44660571873176425, "grad_norm": 1.0078125, "learning_rate": 0.0004984682929495371, "loss": 5.5544, "mean_token_accuracy": 0.16268503814935684, "num_tokens": 9966064.0, "step": 5740 }, { "entropy": 5.567746019363403, "epoch": 0.44699474810348183, "grad_norm": 0.93359375, "learning_rate": 0.0004984650627949715, "loss": 5.3963, "mean_token_accuracy": 0.163088820874691, "num_tokens": 9975146.0, "step": 5745 }, { "entropy": 5.624360799789429, "epoch": 0.44738377747519936, "grad_norm": 0.99609375, "learning_rate": 0.0004984618292496792, "loss": 5.4927, "mean_token_accuracy": 0.16582848578691484, "num_tokens": 9983725.0, "step": 5750 }, { "entropy": 5.682122611999512, "epoch": 0.44777280684691695, "grad_norm": 0.94140625, "learning_rate": 0.0004984585923137093, "loss": 5.5265, "mean_token_accuracy": 0.16172722578048707, "num_tokens": 9992627.0, "step": 5755 }, { "entropy": 5.592145872116089, "epoch": 0.4481618362186345, "grad_norm": 0.98828125, "learning_rate": 0.000498455351987111, "loss": 5.3514, "mean_token_accuracy": 0.17467245012521743, "num_tokens": 10000801.0, "step": 5760 }, { "entropy": 5.673874187469482, "epoch": 0.44855086559035207, "grad_norm": 1.03125, "learning_rate": 0.0004984521082699333, "loss": 5.5033, "mean_token_accuracy": 0.16748406738042831, "num_tokens": 10009421.0, "step": 5765 }, { "entropy": 5.611412572860718, "epoch": 0.44893989496206965, "grad_norm": 0.8828125, "learning_rate": 0.0004984488611622256, "loss": 5.4978, "mean_token_accuracy": 0.16486949399113654, "num_tokens": 10018527.0, "step": 5770 }, { "entropy": 5.619416761398315, "epoch": 0.4493289243337872, "grad_norm": 1.015625, "learning_rate": 0.000498445610664037, "loss": 5.4203, "mean_token_accuracy": 0.17014821916818618, "num_tokens": 10026906.0, "step": 5775 }, { "entropy": 5.60166482925415, "epoch": 0.44971795370550477, "grad_norm": 0.93359375, "learning_rate": 0.000498442356775417, "loss": 5.4081, "mean_token_accuracy": 0.17366300374269486, "num_tokens": 10035972.0, "step": 5780 }, { "entropy": 5.606394481658936, "epoch": 0.45010698307722236, "grad_norm": 1.015625, "learning_rate": 0.0004984390994964148, "loss": 5.5028, "mean_token_accuracy": 0.16163644939661026, "num_tokens": 10044544.0, "step": 5785 }, { "entropy": 5.731960916519165, "epoch": 0.4504960124489399, "grad_norm": 1.0390625, "learning_rate": 0.00049843583882708, "loss": 5.4952, "mean_token_accuracy": 0.16808821707963945, "num_tokens": 10052880.0, "step": 5790 }, { "entropy": 5.686711406707763, "epoch": 0.4508850418206575, "grad_norm": 0.89453125, "learning_rate": 0.000498432574767462, "loss": 5.5556, "mean_token_accuracy": 0.15909216105937957, "num_tokens": 10062373.0, "step": 5795 }, { "entropy": 5.576024532318115, "epoch": 0.451274071192375, "grad_norm": 1.046875, "learning_rate": 0.0004984293073176103, "loss": 5.3637, "mean_token_accuracy": 0.17339247167110444, "num_tokens": 10070473.0, "step": 5800 }, { "entropy": 5.663080501556396, "epoch": 0.4516631005640926, "grad_norm": 0.9765625, "learning_rate": 0.0004984260364775744, "loss": 5.4869, "mean_token_accuracy": 0.16736487299203873, "num_tokens": 10079857.0, "step": 5805 }, { "entropy": 5.643650674819947, "epoch": 0.4520521299358102, "grad_norm": 0.99609375, "learning_rate": 0.000498422762247404, "loss": 5.445, "mean_token_accuracy": 0.16632652133703232, "num_tokens": 10088326.0, "step": 5810 }, { "entropy": 5.631912469863892, "epoch": 0.4524411593075277, "grad_norm": 0.94921875, "learning_rate": 0.0004984194846271489, "loss": 5.3867, "mean_token_accuracy": 0.16788820028305054, "num_tokens": 10097208.0, "step": 5815 }, { "entropy": 5.653847026824951, "epoch": 0.4528301886792453, "grad_norm": 1.0, "learning_rate": 0.0004984162036168586, "loss": 5.4881, "mean_token_accuracy": 0.1633862353861332, "num_tokens": 10106057.0, "step": 5820 }, { "entropy": 5.569620895385742, "epoch": 0.4532192180509628, "grad_norm": 1.0546875, "learning_rate": 0.0004984129192165831, "loss": 5.4138, "mean_token_accuracy": 0.1673375114798546, "num_tokens": 10115384.0, "step": 5825 }, { "entropy": 5.686632299423218, "epoch": 0.4536082474226804, "grad_norm": 0.9921875, "learning_rate": 0.0004984096314263722, "loss": 5.5095, "mean_token_accuracy": 0.16176718175411225, "num_tokens": 10123958.0, "step": 5830 }, { "entropy": 5.65466160774231, "epoch": 0.453997276794398, "grad_norm": 1.0078125, "learning_rate": 0.0004984063402462757, "loss": 5.4413, "mean_token_accuracy": 0.17231336385011672, "num_tokens": 10133199.0, "step": 5835 }, { "entropy": 5.604842758178711, "epoch": 0.45438630616611553, "grad_norm": 0.97265625, "learning_rate": 0.0004984030456763435, "loss": 5.408, "mean_token_accuracy": 0.17446824312210082, "num_tokens": 10141796.0, "step": 5840 }, { "entropy": 5.606010675430298, "epoch": 0.4547753355378331, "grad_norm": 1.0703125, "learning_rate": 0.0004983997477166257, "loss": 5.424, "mean_token_accuracy": 0.1695821091532707, "num_tokens": 10149941.0, "step": 5845 }, { "entropy": 5.619622421264649, "epoch": 0.45516436490955064, "grad_norm": 0.9296875, "learning_rate": 0.0004983964463671723, "loss": 5.4935, "mean_token_accuracy": 0.1641951784491539, "num_tokens": 10158796.0, "step": 5850 }, { "entropy": 5.665774250030518, "epoch": 0.45555339428126823, "grad_norm": 1.0234375, "learning_rate": 0.0004983931416280334, "loss": 5.4422, "mean_token_accuracy": 0.17011956125497818, "num_tokens": 10167328.0, "step": 5855 }, { "entropy": 5.644601631164551, "epoch": 0.4559424236529858, "grad_norm": 0.98828125, "learning_rate": 0.0004983898334992591, "loss": 5.4961, "mean_token_accuracy": 0.16651429533958434, "num_tokens": 10175937.0, "step": 5860 }, { "entropy": 5.647733211517334, "epoch": 0.45633145302470335, "grad_norm": 1.1171875, "learning_rate": 0.0004983865219808998, "loss": 5.4556, "mean_token_accuracy": 0.1606528416275978, "num_tokens": 10184828.0, "step": 5865 }, { "entropy": 5.616971063613891, "epoch": 0.45672048239642093, "grad_norm": 0.95703125, "learning_rate": 0.0004983832070730055, "loss": 5.4497, "mean_token_accuracy": 0.16973941326141356, "num_tokens": 10193871.0, "step": 5870 }, { "entropy": 5.587744855880738, "epoch": 0.4571095117681385, "grad_norm": 1.0390625, "learning_rate": 0.0004983798887756265, "loss": 5.4516, "mean_token_accuracy": 0.16800768971443175, "num_tokens": 10202740.0, "step": 5875 }, { "entropy": 5.597984743118286, "epoch": 0.45749854113985605, "grad_norm": 0.953125, "learning_rate": 0.0004983765670888133, "loss": 5.4087, "mean_token_accuracy": 0.17071811556816102, "num_tokens": 10210903.0, "step": 5880 }, { "entropy": 5.551643514633179, "epoch": 0.45788757051157364, "grad_norm": 0.9375, "learning_rate": 0.0004983732420126163, "loss": 5.3589, "mean_token_accuracy": 0.1736896276473999, "num_tokens": 10219305.0, "step": 5885 }, { "entropy": 5.681756496429443, "epoch": 0.45827659988329117, "grad_norm": 0.9765625, "learning_rate": 0.0004983699135470858, "loss": 5.5142, "mean_token_accuracy": 0.15853092521429063, "num_tokens": 10228575.0, "step": 5890 }, { "entropy": 5.646949529647827, "epoch": 0.45866562925500876, "grad_norm": 0.9140625, "learning_rate": 0.0004983665816922723, "loss": 5.5034, "mean_token_accuracy": 0.16626327931880952, "num_tokens": 10237813.0, "step": 5895 }, { "entropy": 5.689908361434936, "epoch": 0.45905465862672634, "grad_norm": 0.9453125, "learning_rate": 0.0004983632464482267, "loss": 5.5037, "mean_token_accuracy": 0.16461766958236695, "num_tokens": 10246606.0, "step": 5900 }, { "entropy": 5.560118007659912, "epoch": 0.4594436879984439, "grad_norm": 1.109375, "learning_rate": 0.0004983599078149991, "loss": 5.4526, "mean_token_accuracy": 0.17055174559354783, "num_tokens": 10254996.0, "step": 5905 }, { "entropy": 5.599699831008911, "epoch": 0.45983271737016146, "grad_norm": 1.0859375, "learning_rate": 0.0004983565657926405, "loss": 5.4982, "mean_token_accuracy": 0.1632937014102936, "num_tokens": 10263570.0, "step": 5910 }, { "entropy": 5.5971846103668215, "epoch": 0.460221746741879, "grad_norm": 0.890625, "learning_rate": 0.0004983532203812017, "loss": 5.3542, "mean_token_accuracy": 0.1691060781478882, "num_tokens": 10272237.0, "step": 5915 }, { "entropy": 5.601367378234864, "epoch": 0.4606107761135966, "grad_norm": 1.03125, "learning_rate": 0.0004983498715807331, "loss": 5.4901, "mean_token_accuracy": 0.16562240570783615, "num_tokens": 10281215.0, "step": 5920 }, { "entropy": 5.646333360671997, "epoch": 0.46099980548531416, "grad_norm": 0.89453125, "learning_rate": 0.0004983465193912857, "loss": 5.5213, "mean_token_accuracy": 0.16282440721988678, "num_tokens": 10291054.0, "step": 5925 }, { "entropy": 5.700567531585693, "epoch": 0.4613888348570317, "grad_norm": 1.078125, "learning_rate": 0.0004983431638129104, "loss": 5.5128, "mean_token_accuracy": 0.16725291311740875, "num_tokens": 10299847.0, "step": 5930 }, { "entropy": 5.592577791213989, "epoch": 0.4617778642287493, "grad_norm": 1.0390625, "learning_rate": 0.0004983398048456581, "loss": 5.4352, "mean_token_accuracy": 0.17061688899993896, "num_tokens": 10309195.0, "step": 5935 }, { "entropy": 5.607589292526245, "epoch": 0.4621668936004668, "grad_norm": 1.0078125, "learning_rate": 0.0004983364424895796, "loss": 5.4602, "mean_token_accuracy": 0.16673509031534195, "num_tokens": 10318386.0, "step": 5940 }, { "entropy": 5.568243932723999, "epoch": 0.4625559229721844, "grad_norm": 1.03125, "learning_rate": 0.0004983330767447262, "loss": 5.3737, "mean_token_accuracy": 0.17284452468156813, "num_tokens": 10327230.0, "step": 5945 }, { "entropy": 5.588061189651489, "epoch": 0.462944952343902, "grad_norm": 0.97265625, "learning_rate": 0.0004983297076111489, "loss": 5.3662, "mean_token_accuracy": 0.17034709453582764, "num_tokens": 10335617.0, "step": 5950 }, { "entropy": 5.618640327453614, "epoch": 0.4633339817156195, "grad_norm": 0.95703125, "learning_rate": 0.0004983263350888987, "loss": 5.4454, "mean_token_accuracy": 0.1700463205575943, "num_tokens": 10344302.0, "step": 5955 }, { "entropy": 5.6334014415740965, "epoch": 0.4637230110873371, "grad_norm": 1.1328125, "learning_rate": 0.0004983229591780268, "loss": 5.4823, "mean_token_accuracy": 0.16464230567216873, "num_tokens": 10352490.0, "step": 5960 }, { "entropy": 5.602584028244019, "epoch": 0.46411204045905463, "grad_norm": 0.97265625, "learning_rate": 0.0004983195798785844, "loss": 5.4313, "mean_token_accuracy": 0.17336985617876052, "num_tokens": 10361249.0, "step": 5965 }, { "entropy": 5.642180490493774, "epoch": 0.4645010698307722, "grad_norm": 0.93359375, "learning_rate": 0.0004983161971906228, "loss": 5.5149, "mean_token_accuracy": 0.15877831131219863, "num_tokens": 10370367.0, "step": 5970 }, { "entropy": 5.640953063964844, "epoch": 0.4648900992024898, "grad_norm": 1.0390625, "learning_rate": 0.0004983128111141935, "loss": 5.4891, "mean_token_accuracy": 0.16095846146345139, "num_tokens": 10378429.0, "step": 5975 }, { "entropy": 5.6266193866729735, "epoch": 0.46527912857420733, "grad_norm": 0.97265625, "learning_rate": 0.0004983094216493475, "loss": 5.3981, "mean_token_accuracy": 0.17122958600521088, "num_tokens": 10386762.0, "step": 5980 }, { "entropy": 5.591618394851684, "epoch": 0.4656681579459249, "grad_norm": 1.0546875, "learning_rate": 0.0004983060287961367, "loss": 5.4247, "mean_token_accuracy": 0.17049588710069657, "num_tokens": 10395150.0, "step": 5985 }, { "entropy": 5.609709787368774, "epoch": 0.4660571873176425, "grad_norm": 1.03125, "learning_rate": 0.0004983026325546123, "loss": 5.4429, "mean_token_accuracy": 0.16723257601261138, "num_tokens": 10403941.0, "step": 5990 }, { "entropy": 5.741720724105835, "epoch": 0.46644621668936004, "grad_norm": 0.97265625, "learning_rate": 0.0004982992329248257, "loss": 5.5161, "mean_token_accuracy": 0.1589074283838272, "num_tokens": 10413955.0, "step": 5995 }, { "entropy": 5.628343296051026, "epoch": 0.4668352460610776, "grad_norm": 1.078125, "learning_rate": 0.0004982958299068289, "loss": 5.4341, "mean_token_accuracy": 0.170184688270092, "num_tokens": 10421676.0, "step": 6000 }, { "epoch": 0.4668352460610776, "eval_entropy": 5.3785627919510075, "eval_loss": 5.484496593475342, "eval_mean_token_accuracy": 0.1744253120305334, "eval_num_tokens": 10421676.0, "eval_runtime": 21.695, "eval_samples_per_second": 1915.553, "eval_steps_per_second": 239.456, "step": 6000 }, { "entropy": 5.577844953536987, "epoch": 0.46722427543279516, "grad_norm": 1.0859375, "learning_rate": 0.000498292423500673, "loss": 5.4119, "mean_token_accuracy": 0.16950944066047668, "num_tokens": 10430714.0, "step": 6005 }, { "entropy": 5.677253007888794, "epoch": 0.46761330480451274, "grad_norm": 1.0546875, "learning_rate": 0.0004982890137064102, "loss": 5.5177, "mean_token_accuracy": 0.16629161685705185, "num_tokens": 10439089.0, "step": 6010 }, { "entropy": 5.598039770126343, "epoch": 0.46800233417623033, "grad_norm": 1.0078125, "learning_rate": 0.000498285600524092, "loss": 5.4347, "mean_token_accuracy": 0.16724973767995835, "num_tokens": 10447455.0, "step": 6015 }, { "entropy": 5.6029579639434814, "epoch": 0.46839136354794786, "grad_norm": 0.94921875, "learning_rate": 0.0004982821839537701, "loss": 5.4412, "mean_token_accuracy": 0.16681720912456513, "num_tokens": 10455936.0, "step": 6020 }, { "entropy": 5.716484546661377, "epoch": 0.46878039291966545, "grad_norm": 0.9453125, "learning_rate": 0.0004982787639954966, "loss": 5.5677, "mean_token_accuracy": 0.16039225161075593, "num_tokens": 10465389.0, "step": 6025 }, { "entropy": 5.683687829971314, "epoch": 0.469169422291383, "grad_norm": 1.0703125, "learning_rate": 0.0004982753406493232, "loss": 5.4397, "mean_token_accuracy": 0.16332810819149018, "num_tokens": 10474709.0, "step": 6030 }, { "entropy": 5.611378955841064, "epoch": 0.46955845166310056, "grad_norm": 1.03125, "learning_rate": 0.0004982719139153018, "loss": 5.4287, "mean_token_accuracy": 0.164694944024086, "num_tokens": 10482972.0, "step": 6035 }, { "entropy": 5.633231830596924, "epoch": 0.46994748103481815, "grad_norm": 1.015625, "learning_rate": 0.0004982684837934845, "loss": 5.4667, "mean_token_accuracy": 0.17060739398002625, "num_tokens": 10490897.0, "step": 6040 }, { "entropy": 5.555526304244995, "epoch": 0.4703365104065357, "grad_norm": 1.0, "learning_rate": 0.0004982650502839234, "loss": 5.438, "mean_token_accuracy": 0.16980203986167908, "num_tokens": 10499679.0, "step": 6045 }, { "entropy": 5.647341203689575, "epoch": 0.47072553977825327, "grad_norm": 0.93359375, "learning_rate": 0.0004982616133866705, "loss": 5.4931, "mean_token_accuracy": 0.1608305349946022, "num_tokens": 10508775.0, "step": 6050 }, { "entropy": 5.588137006759643, "epoch": 0.4711145691499708, "grad_norm": 0.98046875, "learning_rate": 0.0004982581731017779, "loss": 5.3757, "mean_token_accuracy": 0.17725705802440644, "num_tokens": 10517600.0, "step": 6055 }, { "entropy": 5.495386171340942, "epoch": 0.4715035985216884, "grad_norm": 1.0625, "learning_rate": 0.0004982547294292979, "loss": 5.3489, "mean_token_accuracy": 0.1757895067334175, "num_tokens": 10525674.0, "step": 6060 }, { "entropy": 5.648678350448608, "epoch": 0.47189262789340597, "grad_norm": 1.015625, "learning_rate": 0.0004982512823692828, "loss": 5.5567, "mean_token_accuracy": 0.16257671713829042, "num_tokens": 10533819.0, "step": 6065 }, { "entropy": 5.5979917526245115, "epoch": 0.4722816572651235, "grad_norm": 0.953125, "learning_rate": 0.0004982478319217848, "loss": 5.355, "mean_token_accuracy": 0.17663849741220475, "num_tokens": 10542901.0, "step": 6070 }, { "entropy": 5.613467836380005, "epoch": 0.4726706866368411, "grad_norm": 0.94140625, "learning_rate": 0.0004982443780868562, "loss": 5.4372, "mean_token_accuracy": 0.1676538348197937, "num_tokens": 10552388.0, "step": 6075 }, { "entropy": 5.714199495315552, "epoch": 0.4730597160085587, "grad_norm": 0.98046875, "learning_rate": 0.0004982409208645496, "loss": 5.5287, "mean_token_accuracy": 0.1630443662405014, "num_tokens": 10561676.0, "step": 6080 }, { "entropy": 5.693147850036621, "epoch": 0.4734487453802762, "grad_norm": 1.0234375, "learning_rate": 0.0004982374602549173, "loss": 5.4391, "mean_token_accuracy": 0.1715491697192192, "num_tokens": 10570037.0, "step": 6085 }, { "entropy": 5.541488456726074, "epoch": 0.4738377747519938, "grad_norm": 0.9609375, "learning_rate": 0.0004982339962580119, "loss": 5.4374, "mean_token_accuracy": 0.16442103683948517, "num_tokens": 10579140.0, "step": 6090 }, { "entropy": 5.627806901931763, "epoch": 0.4742268041237113, "grad_norm": 0.98046875, "learning_rate": 0.0004982305288738859, "loss": 5.4704, "mean_token_accuracy": 0.16567013412714005, "num_tokens": 10587689.0, "step": 6095 }, { "entropy": 5.632371330261231, "epoch": 0.4746158334954289, "grad_norm": 0.9453125, "learning_rate": 0.0004982270581025919, "loss": 5.3541, "mean_token_accuracy": 0.17653048634529114, "num_tokens": 10596002.0, "step": 6100 }, { "entropy": 5.634643793106079, "epoch": 0.4750048628671465, "grad_norm": 0.9921875, "learning_rate": 0.0004982235839441826, "loss": 5.5873, "mean_token_accuracy": 0.16509227454662323, "num_tokens": 10605895.0, "step": 6105 }, { "entropy": 5.6722083568573, "epoch": 0.475393892238864, "grad_norm": 0.97265625, "learning_rate": 0.0004982201063987108, "loss": 5.5172, "mean_token_accuracy": 0.16299704164266587, "num_tokens": 10614641.0, "step": 6110 }, { "entropy": 5.633872652053833, "epoch": 0.4757829216105816, "grad_norm": 0.98828125, "learning_rate": 0.0004982166254662292, "loss": 5.478, "mean_token_accuracy": 0.16371424347162247, "num_tokens": 10624381.0, "step": 6115 }, { "entropy": 5.609515810012818, "epoch": 0.47617195098229914, "grad_norm": 1.0390625, "learning_rate": 0.0004982131411467904, "loss": 5.4582, "mean_token_accuracy": 0.16480688750743866, "num_tokens": 10632493.0, "step": 6120 }, { "entropy": 5.6248329162597654, "epoch": 0.4765609803540167, "grad_norm": 1.015625, "learning_rate": 0.0004982096534404476, "loss": 5.4637, "mean_token_accuracy": 0.1623607560992241, "num_tokens": 10641556.0, "step": 6125 }, { "entropy": 5.63107385635376, "epoch": 0.4769500097257343, "grad_norm": 1.0390625, "learning_rate": 0.0004982061623472535, "loss": 5.5276, "mean_token_accuracy": 0.16606490314006805, "num_tokens": 10649736.0, "step": 6130 }, { "entropy": 5.595766210556031, "epoch": 0.47733903909745184, "grad_norm": 1.0, "learning_rate": 0.0004982026678672612, "loss": 5.3633, "mean_token_accuracy": 0.17811473309993744, "num_tokens": 10657991.0, "step": 6135 }, { "entropy": 5.547994661331177, "epoch": 0.47772806846916943, "grad_norm": 0.953125, "learning_rate": 0.0004981991700005238, "loss": 5.4272, "mean_token_accuracy": 0.1615143284201622, "num_tokens": 10667310.0, "step": 6140 }, { "entropy": 5.750826454162597, "epoch": 0.47811709784088696, "grad_norm": 1.0625, "learning_rate": 0.000498195668747094, "loss": 5.481, "mean_token_accuracy": 0.16662129163742065, "num_tokens": 10675658.0, "step": 6145 }, { "entropy": 5.598548889160156, "epoch": 0.47850612721260455, "grad_norm": 0.98046875, "learning_rate": 0.0004981921641070254, "loss": 5.3579, "mean_token_accuracy": 0.18007877916097642, "num_tokens": 10684016.0, "step": 6150 }, { "entropy": 5.56572699546814, "epoch": 0.47889515658432213, "grad_norm": 1.1484375, "learning_rate": 0.0004981886560803708, "loss": 5.4844, "mean_token_accuracy": 0.1657741114497185, "num_tokens": 10692814.0, "step": 6155 }, { "entropy": 5.638201189041138, "epoch": 0.47928418595603967, "grad_norm": 1.0, "learning_rate": 0.0004981851446671838, "loss": 5.4919, "mean_token_accuracy": 0.1675615519285202, "num_tokens": 10701571.0, "step": 6160 }, { "entropy": 5.693787240982056, "epoch": 0.47967321532775725, "grad_norm": 1.0078125, "learning_rate": 0.0004981816298675173, "loss": 5.4574, "mean_token_accuracy": 0.16426164358854295, "num_tokens": 10710569.0, "step": 6165 }, { "entropy": 5.6412571430206295, "epoch": 0.4800622446994748, "grad_norm": 1.015625, "learning_rate": 0.0004981781116814248, "loss": 5.507, "mean_token_accuracy": 0.16384723037481308, "num_tokens": 10719277.0, "step": 6170 }, { "entropy": 5.566997861862182, "epoch": 0.48045127407119237, "grad_norm": 1.0625, "learning_rate": 0.0004981745901089596, "loss": 5.3732, "mean_token_accuracy": 0.17471746653318404, "num_tokens": 10727174.0, "step": 6175 }, { "entropy": 5.607968378067016, "epoch": 0.48084030344290996, "grad_norm": 1.0078125, "learning_rate": 0.0004981710651501753, "loss": 5.4924, "mean_token_accuracy": 0.15813975259661675, "num_tokens": 10736072.0, "step": 6180 }, { "entropy": 5.6916999340057375, "epoch": 0.4812293328146275, "grad_norm": 0.9765625, "learning_rate": 0.0004981675368051254, "loss": 5.4893, "mean_token_accuracy": 0.1682565063238144, "num_tokens": 10745375.0, "step": 6185 }, { "entropy": 5.608947372436523, "epoch": 0.4816183621863451, "grad_norm": 0.96484375, "learning_rate": 0.0004981640050738633, "loss": 5.4799, "mean_token_accuracy": 0.16967792063951492, "num_tokens": 10754049.0, "step": 6190 }, { "entropy": 5.5344085693359375, "epoch": 0.48200739155806266, "grad_norm": 0.99609375, "learning_rate": 0.0004981604699564426, "loss": 5.4194, "mean_token_accuracy": 0.16812556684017183, "num_tokens": 10763475.0, "step": 6195 }, { "entropy": 5.640892791748047, "epoch": 0.4823964209297802, "grad_norm": 0.96875, "learning_rate": 0.0004981569314529169, "loss": 5.4813, "mean_token_accuracy": 0.165237957239151, "num_tokens": 10772100.0, "step": 6200 }, { "entropy": 5.595401239395142, "epoch": 0.4827854503014978, "grad_norm": 1.0625, "learning_rate": 0.00049815338956334, "loss": 5.4348, "mean_token_accuracy": 0.17319741547107698, "num_tokens": 10780605.0, "step": 6205 }, { "entropy": 5.650853967666626, "epoch": 0.4831744796732153, "grad_norm": 1.03125, "learning_rate": 0.0004981498442877656, "loss": 5.4205, "mean_token_accuracy": 0.16854792684316636, "num_tokens": 10789235.0, "step": 6210 }, { "entropy": 5.582941627502441, "epoch": 0.4835635090449329, "grad_norm": 1.0078125, "learning_rate": 0.0004981462956262474, "loss": 5.4122, "mean_token_accuracy": 0.16524595767259598, "num_tokens": 10798078.0, "step": 6215 }, { "entropy": 5.630468082427979, "epoch": 0.4839525384166505, "grad_norm": 0.96484375, "learning_rate": 0.0004981427435788396, "loss": 5.4452, "mean_token_accuracy": 0.16115131974220276, "num_tokens": 10807667.0, "step": 6220 }, { "entropy": 5.61391863822937, "epoch": 0.484341567788368, "grad_norm": 0.9921875, "learning_rate": 0.0004981391881455957, "loss": 5.4151, "mean_token_accuracy": 0.1622346058487892, "num_tokens": 10816574.0, "step": 6225 }, { "entropy": 5.540151786804199, "epoch": 0.4847305971600856, "grad_norm": 1.015625, "learning_rate": 0.0004981356293265696, "loss": 5.4002, "mean_token_accuracy": 0.16676194220781326, "num_tokens": 10824675.0, "step": 6230 }, { "entropy": 5.546475028991699, "epoch": 0.4851196265318031, "grad_norm": 0.99609375, "learning_rate": 0.0004981320671218157, "loss": 5.3746, "mean_token_accuracy": 0.17334918528795243, "num_tokens": 10832855.0, "step": 6235 }, { "entropy": 5.492112636566162, "epoch": 0.4855086559035207, "grad_norm": 0.96484375, "learning_rate": 0.0004981285015313877, "loss": 5.2675, "mean_token_accuracy": 0.17453816682100295, "num_tokens": 10841603.0, "step": 6240 }, { "entropy": 5.668085622787475, "epoch": 0.4858976852752383, "grad_norm": 1.0234375, "learning_rate": 0.0004981249325553399, "loss": 5.6037, "mean_token_accuracy": 0.15966420173645018, "num_tokens": 10850348.0, "step": 6245 }, { "entropy": 5.669262361526489, "epoch": 0.48628671464695583, "grad_norm": 1.0625, "learning_rate": 0.0004981213601937264, "loss": 5.3446, "mean_token_accuracy": 0.17140930145978928, "num_tokens": 10858955.0, "step": 6250 }, { "entropy": 5.577931022644043, "epoch": 0.4866757440186734, "grad_norm": 1.015625, "learning_rate": 0.0004981177844466013, "loss": 5.433, "mean_token_accuracy": 0.16135810166597367, "num_tokens": 10867336.0, "step": 6255 }, { "entropy": 5.605906820297241, "epoch": 0.48706477339039095, "grad_norm": 0.9375, "learning_rate": 0.0004981142053140192, "loss": 5.5038, "mean_token_accuracy": 0.1649916335940361, "num_tokens": 10877043.0, "step": 6260 }, { "entropy": 5.691816520690918, "epoch": 0.48745380276210853, "grad_norm": 0.953125, "learning_rate": 0.0004981106227960339, "loss": 5.4718, "mean_token_accuracy": 0.16818615198135375, "num_tokens": 10885580.0, "step": 6265 }, { "entropy": 5.669391345977783, "epoch": 0.4878428321338261, "grad_norm": 0.96875, "learning_rate": 0.0004981070368927001, "loss": 5.5673, "mean_token_accuracy": 0.1592708259820938, "num_tokens": 10894289.0, "step": 6270 }, { "entropy": 5.678913211822509, "epoch": 0.48823186150554365, "grad_norm": 1.0546875, "learning_rate": 0.000498103447604072, "loss": 5.4917, "mean_token_accuracy": 0.15936827957630156, "num_tokens": 10902384.0, "step": 6275 }, { "entropy": 5.5909301280975345, "epoch": 0.48862089087726124, "grad_norm": 1.0390625, "learning_rate": 0.0004980998549302044, "loss": 5.4119, "mean_token_accuracy": 0.1734393134713173, "num_tokens": 10911160.0, "step": 6280 }, { "entropy": 5.549578762054443, "epoch": 0.4890099202489788, "grad_norm": 1.0078125, "learning_rate": 0.0004980962588711516, "loss": 5.3132, "mean_token_accuracy": 0.1811177149415016, "num_tokens": 10920066.0, "step": 6285 }, { "entropy": 5.669842386245728, "epoch": 0.48939894962069636, "grad_norm": 1.03125, "learning_rate": 0.000498092659426968, "loss": 5.4727, "mean_token_accuracy": 0.17029281407594682, "num_tokens": 10928969.0, "step": 6290 }, { "entropy": 5.650257158279419, "epoch": 0.48978797899241394, "grad_norm": 1.0625, "learning_rate": 0.0004980890565977085, "loss": 5.4997, "mean_token_accuracy": 0.1679375112056732, "num_tokens": 10936939.0, "step": 6295 }, { "entropy": 5.580673122406006, "epoch": 0.4901770083641315, "grad_norm": 1.015625, "learning_rate": 0.0004980854503834276, "loss": 5.4326, "mean_token_accuracy": 0.16703005284070968, "num_tokens": 10945929.0, "step": 6300 }, { "entropy": 5.639377117156982, "epoch": 0.49056603773584906, "grad_norm": 0.98828125, "learning_rate": 0.0004980818407841802, "loss": 5.4284, "mean_token_accuracy": 0.16749713122844695, "num_tokens": 10954849.0, "step": 6305 }, { "entropy": 5.605614042282104, "epoch": 0.49095506710756665, "grad_norm": 0.9765625, "learning_rate": 0.0004980782278000207, "loss": 5.487, "mean_token_accuracy": 0.1635652706027031, "num_tokens": 10963800.0, "step": 6310 }, { "entropy": 5.739235067367554, "epoch": 0.4913440964792842, "grad_norm": 1.0, "learning_rate": 0.0004980746114310043, "loss": 5.5526, "mean_token_accuracy": 0.1695140227675438, "num_tokens": 10972477.0, "step": 6315 }, { "entropy": 5.731948041915894, "epoch": 0.49173312585100176, "grad_norm": 0.99609375, "learning_rate": 0.0004980709916771858, "loss": 5.5535, "mean_token_accuracy": 0.16520485654473305, "num_tokens": 10981437.0, "step": 6320 }, { "entropy": 5.611998844146728, "epoch": 0.4921221552227193, "grad_norm": 1.0234375, "learning_rate": 0.0004980673685386198, "loss": 5.3635, "mean_token_accuracy": 0.1698611557483673, "num_tokens": 10989973.0, "step": 6325 }, { "entropy": 5.551653051376343, "epoch": 0.4925111845944369, "grad_norm": 0.96484375, "learning_rate": 0.0004980637420153618, "loss": 5.4164, "mean_token_accuracy": 0.16706527769565582, "num_tokens": 10998160.0, "step": 6330 }, { "entropy": 5.61000394821167, "epoch": 0.49290021396615447, "grad_norm": 0.9921875, "learning_rate": 0.0004980601121074664, "loss": 5.5573, "mean_token_accuracy": 0.16138826608657836, "num_tokens": 11007127.0, "step": 6335 }, { "entropy": 5.64782748222351, "epoch": 0.493289243337872, "grad_norm": 1.0234375, "learning_rate": 0.0004980564788149889, "loss": 5.4026, "mean_token_accuracy": 0.17181915491819383, "num_tokens": 11015518.0, "step": 6340 }, { "entropy": 5.530421400070191, "epoch": 0.4936782727095896, "grad_norm": 1.0234375, "learning_rate": 0.0004980528421379844, "loss": 5.3021, "mean_token_accuracy": 0.17954678684473038, "num_tokens": 11023739.0, "step": 6345 }, { "entropy": 5.537801313400268, "epoch": 0.4940673020813071, "grad_norm": 0.94140625, "learning_rate": 0.000498049202076508, "loss": 5.3301, "mean_token_accuracy": 0.1792101815342903, "num_tokens": 11032034.0, "step": 6350 }, { "entropy": 5.560280418395996, "epoch": 0.4944563314530247, "grad_norm": 1.0078125, "learning_rate": 0.0004980455586306149, "loss": 5.351, "mean_token_accuracy": 0.17807642817497255, "num_tokens": 11040319.0, "step": 6355 }, { "entropy": 5.51184048652649, "epoch": 0.4948453608247423, "grad_norm": 1.015625, "learning_rate": 0.0004980419118003605, "loss": 5.405, "mean_token_accuracy": 0.17092235684394835, "num_tokens": 11049459.0, "step": 6360 }, { "entropy": 5.636390972137451, "epoch": 0.4952343901964598, "grad_norm": 0.89453125, "learning_rate": 0.0004980382615858001, "loss": 5.3887, "mean_token_accuracy": 0.17487718015909196, "num_tokens": 11058402.0, "step": 6365 }, { "entropy": 5.543388795852661, "epoch": 0.4956234195681774, "grad_norm": 1.0546875, "learning_rate": 0.0004980346079869892, "loss": 5.3347, "mean_token_accuracy": 0.17785675972700118, "num_tokens": 11067430.0, "step": 6370 }, { "entropy": 5.5810332775115965, "epoch": 0.49601244893989493, "grad_norm": 1.0234375, "learning_rate": 0.000498030951003983, "loss": 5.3434, "mean_token_accuracy": 0.17015171349048613, "num_tokens": 11075594.0, "step": 6375 }, { "entropy": 5.554964780807495, "epoch": 0.4964014783116125, "grad_norm": 1.0234375, "learning_rate": 0.0004980272906368371, "loss": 5.3149, "mean_token_accuracy": 0.18544289767742156, "num_tokens": 11083509.0, "step": 6380 }, { "entropy": 5.619040679931641, "epoch": 0.4967905076833301, "grad_norm": 1.03125, "learning_rate": 0.0004980236268856071, "loss": 5.4664, "mean_token_accuracy": 0.16966208517551423, "num_tokens": 11091938.0, "step": 6385 }, { "entropy": 5.625745964050293, "epoch": 0.49717953705504764, "grad_norm": 1.046875, "learning_rate": 0.0004980199597503487, "loss": 5.4891, "mean_token_accuracy": 0.17186390310525895, "num_tokens": 11099974.0, "step": 6390 }, { "entropy": 5.479457902908325, "epoch": 0.4975685664267652, "grad_norm": 1.0234375, "learning_rate": 0.0004980162892311171, "loss": 5.1528, "mean_token_accuracy": 0.18467798829078674, "num_tokens": 11107944.0, "step": 6395 }, { "entropy": 5.493260717391967, "epoch": 0.4979575957984828, "grad_norm": 1.0390625, "learning_rate": 0.0004980126153279684, "loss": 5.4377, "mean_token_accuracy": 0.17024778127670287, "num_tokens": 11116401.0, "step": 6400 }, { "entropy": 5.610830068588257, "epoch": 0.49834662517020034, "grad_norm": 0.92578125, "learning_rate": 0.0004980089380409583, "loss": 5.4209, "mean_token_accuracy": 0.16731917411088942, "num_tokens": 11125430.0, "step": 6405 }, { "entropy": 5.677296447753906, "epoch": 0.4987356545419179, "grad_norm": 1.109375, "learning_rate": 0.0004980052573701424, "loss": 5.4804, "mean_token_accuracy": 0.16577590256929398, "num_tokens": 11133949.0, "step": 6410 }, { "entropy": 5.6370436668396, "epoch": 0.49912468391363546, "grad_norm": 0.95703125, "learning_rate": 0.0004980015733155767, "loss": 5.4026, "mean_token_accuracy": 0.1727154791355133, "num_tokens": 11141749.0, "step": 6415 }, { "entropy": 5.536406326293945, "epoch": 0.49951371328535304, "grad_norm": 1.0390625, "learning_rate": 0.0004979978858773171, "loss": 5.4072, "mean_token_accuracy": 0.17378445714712143, "num_tokens": 11150618.0, "step": 6420 }, { "entropy": 5.561201715469361, "epoch": 0.49990274265707063, "grad_norm": 1.078125, "learning_rate": 0.0004979941950554195, "loss": 5.442, "mean_token_accuracy": 0.1706807717680931, "num_tokens": 11158549.0, "step": 6425 }, { "entropy": 5.603259038925171, "epoch": 0.5002917720287882, "grad_norm": 1.015625, "learning_rate": 0.0004979905008499399, "loss": 5.3821, "mean_token_accuracy": 0.1780638188123703, "num_tokens": 11167131.0, "step": 6430 }, { "entropy": 5.574197769165039, "epoch": 0.5006808014005057, "grad_norm": 0.99609375, "learning_rate": 0.0004979868032609344, "loss": 5.4636, "mean_token_accuracy": 0.16538049653172493, "num_tokens": 11175766.0, "step": 6435 }, { "entropy": 5.556923484802246, "epoch": 0.5010698307722233, "grad_norm": 0.9375, "learning_rate": 0.0004979831022884591, "loss": 5.4209, "mean_token_accuracy": 0.1736909419298172, "num_tokens": 11184799.0, "step": 6440 }, { "entropy": 5.561595249176025, "epoch": 0.5014588601439409, "grad_norm": 0.97265625, "learning_rate": 0.0004979793979325701, "loss": 5.355, "mean_token_accuracy": 0.1692271739244461, "num_tokens": 11193083.0, "step": 6445 }, { "entropy": 5.552934646606445, "epoch": 0.5018478895156584, "grad_norm": 1.0, "learning_rate": 0.0004979756901933236, "loss": 5.3744, "mean_token_accuracy": 0.17342591136693955, "num_tokens": 11201753.0, "step": 6450 }, { "entropy": 5.6293372631073, "epoch": 0.502236918887376, "grad_norm": 1.0625, "learning_rate": 0.000497971979070776, "loss": 5.4785, "mean_token_accuracy": 0.16655509620904924, "num_tokens": 11209965.0, "step": 6455 }, { "entropy": 5.560409784317017, "epoch": 0.5026259482590936, "grad_norm": 1.015625, "learning_rate": 0.0004979682645649834, "loss": 5.3457, "mean_token_accuracy": 0.17969045042991638, "num_tokens": 11217961.0, "step": 6460 }, { "entropy": 5.599636793136597, "epoch": 0.5030149776308112, "grad_norm": 1.0546875, "learning_rate": 0.0004979645466760025, "loss": 5.4689, "mean_token_accuracy": 0.1633923187851906, "num_tokens": 11225803.0, "step": 6465 }, { "entropy": 5.566413831710816, "epoch": 0.5034040070025287, "grad_norm": 1.0, "learning_rate": 0.0004979608254038892, "loss": 5.3182, "mean_token_accuracy": 0.17296916544437407, "num_tokens": 11234584.0, "step": 6470 }, { "entropy": 5.630887222290039, "epoch": 0.5037930363742462, "grad_norm": 1.0234375, "learning_rate": 0.0004979571007487003, "loss": 5.5081, "mean_token_accuracy": 0.16745199561119078, "num_tokens": 11243340.0, "step": 6475 }, { "entropy": 5.561728143692017, "epoch": 0.5041820657459638, "grad_norm": 1.0234375, "learning_rate": 0.0004979533727104924, "loss": 5.3809, "mean_token_accuracy": 0.16325640976428984, "num_tokens": 11252383.0, "step": 6480 }, { "entropy": 5.5793760299682615, "epoch": 0.5045710951176814, "grad_norm": 1.0546875, "learning_rate": 0.000497949641289322, "loss": 5.4487, "mean_token_accuracy": 0.17158499658107756, "num_tokens": 11261419.0, "step": 6485 }, { "entropy": 5.611306476593017, "epoch": 0.504960124489399, "grad_norm": 0.94921875, "learning_rate": 0.0004979459064852456, "loss": 5.4304, "mean_token_accuracy": 0.1647673562169075, "num_tokens": 11270743.0, "step": 6490 }, { "entropy": 5.627134037017822, "epoch": 0.5053491538611166, "grad_norm": 0.99609375, "learning_rate": 0.0004979421682983197, "loss": 5.3136, "mean_token_accuracy": 0.1759612739086151, "num_tokens": 11279666.0, "step": 6495 }, { "entropy": 5.573737287521363, "epoch": 0.505738183232834, "grad_norm": 1.078125, "learning_rate": 0.0004979384267286015, "loss": 5.5182, "mean_token_accuracy": 0.1622571751475334, "num_tokens": 11288710.0, "step": 6500 }, { "entropy": 5.599735307693481, "epoch": 0.5061272126045516, "grad_norm": 0.92578125, "learning_rate": 0.0004979346817761475, "loss": 5.3916, "mean_token_accuracy": 0.16660514175891877, "num_tokens": 11297665.0, "step": 6505 }, { "entropy": 5.656636428833008, "epoch": 0.5065162419762692, "grad_norm": 0.8828125, "learning_rate": 0.0004979309334410144, "loss": 5.5432, "mean_token_accuracy": 0.16240249425172806, "num_tokens": 11306751.0, "step": 6510 }, { "entropy": 5.679762601852417, "epoch": 0.5069052713479868, "grad_norm": 0.96484375, "learning_rate": 0.0004979271817232594, "loss": 5.5316, "mean_token_accuracy": 0.16152799129486084, "num_tokens": 11315659.0, "step": 6515 }, { "entropy": 5.642023086547852, "epoch": 0.5072943007197044, "grad_norm": 1.0, "learning_rate": 0.0004979234266229391, "loss": 5.4176, "mean_token_accuracy": 0.16958683729171753, "num_tokens": 11323362.0, "step": 6520 }, { "entropy": 5.593490219116211, "epoch": 0.5076833300914219, "grad_norm": 0.953125, "learning_rate": 0.0004979196681401106, "loss": 5.4089, "mean_token_accuracy": 0.16313397288322448, "num_tokens": 11332343.0, "step": 6525 }, { "entropy": 5.574950647354126, "epoch": 0.5080723594631394, "grad_norm": 0.9921875, "learning_rate": 0.000497915906274831, "loss": 5.3597, "mean_token_accuracy": 0.168077652156353, "num_tokens": 11340816.0, "step": 6530 }, { "entropy": 5.536467599868774, "epoch": 0.508461388834857, "grad_norm": 0.98046875, "learning_rate": 0.0004979121410271574, "loss": 5.3561, "mean_token_accuracy": 0.1691671848297119, "num_tokens": 11349728.0, "step": 6535 }, { "entropy": 5.618893575668335, "epoch": 0.5088504182065746, "grad_norm": 0.95703125, "learning_rate": 0.0004979083723971468, "loss": 5.4697, "mean_token_accuracy": 0.17053793966770173, "num_tokens": 11358477.0, "step": 6540 }, { "entropy": 5.505225086212159, "epoch": 0.5092394475782922, "grad_norm": 0.92578125, "learning_rate": 0.0004979046003848564, "loss": 5.3006, "mean_token_accuracy": 0.18044095486402512, "num_tokens": 11367183.0, "step": 6545 }, { "entropy": 5.6125692367553714, "epoch": 0.5096284769500097, "grad_norm": 0.93359375, "learning_rate": 0.0004979008249903435, "loss": 5.503, "mean_token_accuracy": 0.16035372912883758, "num_tokens": 11376703.0, "step": 6550 }, { "entropy": 5.696558809280395, "epoch": 0.5100175063217273, "grad_norm": 1.0078125, "learning_rate": 0.0004978970462136655, "loss": 5.5075, "mean_token_accuracy": 0.16275662332773208, "num_tokens": 11385502.0, "step": 6555 }, { "entropy": 5.596874046325683, "epoch": 0.5104065356934449, "grad_norm": 0.98828125, "learning_rate": 0.0004978932640548794, "loss": 5.3797, "mean_token_accuracy": 0.17626383453607558, "num_tokens": 11393947.0, "step": 6560 }, { "entropy": 5.549990034103393, "epoch": 0.5107955650651624, "grad_norm": 0.9609375, "learning_rate": 0.0004978894785140429, "loss": 5.359, "mean_token_accuracy": 0.1741447404026985, "num_tokens": 11403077.0, "step": 6565 }, { "entropy": 5.54671573638916, "epoch": 0.51118459443688, "grad_norm": 0.94140625, "learning_rate": 0.0004978856895912132, "loss": 5.3539, "mean_token_accuracy": 0.16941253691911698, "num_tokens": 11411863.0, "step": 6570 }, { "entropy": 5.589130115509033, "epoch": 0.5115736238085975, "grad_norm": 0.97265625, "learning_rate": 0.0004978818972864481, "loss": 5.3252, "mean_token_accuracy": 0.17228393107652665, "num_tokens": 11420030.0, "step": 6575 }, { "entropy": 5.609898710250855, "epoch": 0.5119626531803151, "grad_norm": 0.96875, "learning_rate": 0.0004978781015998048, "loss": 5.4067, "mean_token_accuracy": 0.1678463637828827, "num_tokens": 11428534.0, "step": 6580 }, { "entropy": 5.60101547241211, "epoch": 0.5123516825520327, "grad_norm": 1.046875, "learning_rate": 0.0004978743025313413, "loss": 5.3933, "mean_token_accuracy": 0.17700950652360917, "num_tokens": 11436641.0, "step": 6585 }, { "entropy": 5.576466178894043, "epoch": 0.5127407119237503, "grad_norm": 1.015625, "learning_rate": 0.0004978705000811148, "loss": 5.3816, "mean_token_accuracy": 0.1710703641176224, "num_tokens": 11444595.0, "step": 6590 }, { "entropy": 5.515132141113281, "epoch": 0.5131297412954678, "grad_norm": 1.0078125, "learning_rate": 0.0004978666942491832, "loss": 5.2321, "mean_token_accuracy": 0.17778561860322953, "num_tokens": 11453257.0, "step": 6595 }, { "entropy": 5.554281759262085, "epoch": 0.5135187706671853, "grad_norm": 1.0546875, "learning_rate": 0.0004978628850356043, "loss": 5.3852, "mean_token_accuracy": 0.176441054046154, "num_tokens": 11461762.0, "step": 6600 }, { "entropy": 5.5585650444030765, "epoch": 0.5139078000389029, "grad_norm": 0.96484375, "learning_rate": 0.0004978590724404358, "loss": 5.3108, "mean_token_accuracy": 0.1734570249915123, "num_tokens": 11470602.0, "step": 6605 }, { "entropy": 5.601553583145142, "epoch": 0.5142968294106205, "grad_norm": 0.9765625, "learning_rate": 0.0004978552564637356, "loss": 5.4151, "mean_token_accuracy": 0.17085041254758834, "num_tokens": 11479826.0, "step": 6610 }, { "entropy": 5.612596750259399, "epoch": 0.5146858587823381, "grad_norm": 0.99609375, "learning_rate": 0.0004978514371055616, "loss": 5.4715, "mean_token_accuracy": 0.16733305305242538, "num_tokens": 11488698.0, "step": 6615 }, { "entropy": 5.656239652633667, "epoch": 0.5150748881540557, "grad_norm": 0.98828125, "learning_rate": 0.0004978476143659718, "loss": 5.4609, "mean_token_accuracy": 0.16911637485027314, "num_tokens": 11497434.0, "step": 6620 }, { "entropy": 5.589666509628296, "epoch": 0.5154639175257731, "grad_norm": 1.0390625, "learning_rate": 0.0004978437882450241, "loss": 5.4729, "mean_token_accuracy": 0.1689564824104309, "num_tokens": 11506173.0, "step": 6625 }, { "entropy": 5.610256004333496, "epoch": 0.5158529468974907, "grad_norm": 1.0546875, "learning_rate": 0.0004978399587427766, "loss": 5.37, "mean_token_accuracy": 0.17339049130678177, "num_tokens": 11514824.0, "step": 6630 }, { "entropy": 5.5988493919372555, "epoch": 0.5162419762692083, "grad_norm": 0.953125, "learning_rate": 0.0004978361258592874, "loss": 5.4411, "mean_token_accuracy": 0.16434240192174912, "num_tokens": 11523634.0, "step": 6635 }, { "entropy": 5.7136924266815186, "epoch": 0.5166310056409259, "grad_norm": 0.9921875, "learning_rate": 0.0004978322895946147, "loss": 5.5482, "mean_token_accuracy": 0.1602518543601036, "num_tokens": 11531916.0, "step": 6640 }, { "entropy": 5.627945423126221, "epoch": 0.5170200350126435, "grad_norm": 1.0546875, "learning_rate": 0.0004978284499488167, "loss": 5.3572, "mean_token_accuracy": 0.17794567048549653, "num_tokens": 11540000.0, "step": 6645 }, { "entropy": 5.65991997718811, "epoch": 0.5174090643843611, "grad_norm": 0.99609375, "learning_rate": 0.0004978246069219516, "loss": 5.4599, "mean_token_accuracy": 0.16606612950563432, "num_tokens": 11548760.0, "step": 6650 }, { "entropy": 5.552158451080322, "epoch": 0.5177980937560785, "grad_norm": 0.9765625, "learning_rate": 0.0004978207605140777, "loss": 5.2729, "mean_token_accuracy": 0.18172201216220857, "num_tokens": 11557991.0, "step": 6655 }, { "entropy": 5.5264709949493405, "epoch": 0.5181871231277961, "grad_norm": 1.0625, "learning_rate": 0.0004978169107252534, "loss": 5.3551, "mean_token_accuracy": 0.17416079044342042, "num_tokens": 11566638.0, "step": 6660 }, { "entropy": 5.463468837738037, "epoch": 0.5185761524995137, "grad_norm": 0.91015625, "learning_rate": 0.0004978130575555373, "loss": 5.2877, "mean_token_accuracy": 0.172434064745903, "num_tokens": 11575106.0, "step": 6665 }, { "entropy": 5.52631573677063, "epoch": 0.5189651818712313, "grad_norm": 0.95703125, "learning_rate": 0.0004978092010049877, "loss": 5.4307, "mean_token_accuracy": 0.16187170296907424, "num_tokens": 11583971.0, "step": 6670 }, { "entropy": 5.592170143127442, "epoch": 0.5193542112429489, "grad_norm": 0.8984375, "learning_rate": 0.000497805341073663, "loss": 5.4287, "mean_token_accuracy": 0.16719157844781876, "num_tokens": 11592936.0, "step": 6675 }, { "entropy": 5.5741321563720705, "epoch": 0.5197432406146664, "grad_norm": 0.91796875, "learning_rate": 0.0004978014777616219, "loss": 5.3186, "mean_token_accuracy": 0.17346851974725724, "num_tokens": 11602055.0, "step": 6680 }, { "entropy": 5.587209272384643, "epoch": 0.520132269986384, "grad_norm": 1.0078125, "learning_rate": 0.0004977976110689229, "loss": 5.3249, "mean_token_accuracy": 0.17513837814331054, "num_tokens": 11610211.0, "step": 6685 }, { "entropy": 5.6106689929962155, "epoch": 0.5205212993581015, "grad_norm": 0.98046875, "learning_rate": 0.000497793740995625, "loss": 5.4164, "mean_token_accuracy": 0.17533322870731355, "num_tokens": 11619096.0, "step": 6690 }, { "entropy": 5.553126525878906, "epoch": 0.5209103287298191, "grad_norm": 1.0625, "learning_rate": 0.0004977898675417866, "loss": 5.4904, "mean_token_accuracy": 0.17334972620010375, "num_tokens": 11628142.0, "step": 6695 }, { "entropy": 5.604515123367309, "epoch": 0.5212993581015367, "grad_norm": 1.015625, "learning_rate": 0.0004977859907074664, "loss": 5.3309, "mean_token_accuracy": 0.17332001328468322, "num_tokens": 11635961.0, "step": 6700 }, { "entropy": 5.631139802932739, "epoch": 0.5216883874732542, "grad_norm": 0.921875, "learning_rate": 0.0004977821104927236, "loss": 5.4471, "mean_token_accuracy": 0.17106524109840393, "num_tokens": 11644778.0, "step": 6705 }, { "entropy": 5.5897143363952635, "epoch": 0.5220774168449718, "grad_norm": 1.03125, "learning_rate": 0.0004977782268976167, "loss": 5.4503, "mean_token_accuracy": 0.16553801894187928, "num_tokens": 11654043.0, "step": 6710 }, { "entropy": 5.619131660461425, "epoch": 0.5224664462166894, "grad_norm": 0.99609375, "learning_rate": 0.0004977743399222048, "loss": 5.4173, "mean_token_accuracy": 0.16904966980218888, "num_tokens": 11662794.0, "step": 6715 }, { "entropy": 5.5617390155792235, "epoch": 0.522855475588407, "grad_norm": 0.99609375, "learning_rate": 0.0004977704495665471, "loss": 5.4154, "mean_token_accuracy": 0.17087236046791077, "num_tokens": 11670624.0, "step": 6720 }, { "entropy": 5.511119413375854, "epoch": 0.5232445049601245, "grad_norm": 0.984375, "learning_rate": 0.0004977665558307023, "loss": 5.3162, "mean_token_accuracy": 0.1732732266187668, "num_tokens": 11679366.0, "step": 6725 }, { "entropy": 5.511437940597534, "epoch": 0.523633534331842, "grad_norm": 1.03125, "learning_rate": 0.0004977626587147295, "loss": 5.2406, "mean_token_accuracy": 0.17510852217674255, "num_tokens": 11688137.0, "step": 6730 }, { "entropy": 5.526886081695556, "epoch": 0.5240225637035596, "grad_norm": 0.94921875, "learning_rate": 0.000497758758218688, "loss": 5.37, "mean_token_accuracy": 0.17012422382831574, "num_tokens": 11697236.0, "step": 6735 }, { "entropy": 5.566766166687012, "epoch": 0.5244115930752772, "grad_norm": 0.9609375, "learning_rate": 0.0004977548543426368, "loss": 5.3584, "mean_token_accuracy": 0.17462498396635057, "num_tokens": 11706513.0, "step": 6740 }, { "entropy": 5.5958418369293215, "epoch": 0.5248006224469948, "grad_norm": 0.95703125, "learning_rate": 0.0004977509470866353, "loss": 5.3359, "mean_token_accuracy": 0.17321660369634628, "num_tokens": 11715239.0, "step": 6745 }, { "entropy": 5.549604749679565, "epoch": 0.5251896518187124, "grad_norm": 1.0390625, "learning_rate": 0.0004977470364507427, "loss": 5.3611, "mean_token_accuracy": 0.18166948556900026, "num_tokens": 11724086.0, "step": 6750 }, { "entropy": 5.5228721618652346, "epoch": 0.5255786811904298, "grad_norm": 0.95703125, "learning_rate": 0.0004977431224350184, "loss": 5.3841, "mean_token_accuracy": 0.17411082684993745, "num_tokens": 11731975.0, "step": 6755 }, { "entropy": 5.518208789825439, "epoch": 0.5259677105621474, "grad_norm": 0.92578125, "learning_rate": 0.0004977392050395217, "loss": 5.3763, "mean_token_accuracy": 0.16967639476060867, "num_tokens": 11741172.0, "step": 6760 }, { "entropy": 5.539883804321289, "epoch": 0.526356739933865, "grad_norm": 0.93359375, "learning_rate": 0.0004977352842643121, "loss": 5.3353, "mean_token_accuracy": 0.1769949361681938, "num_tokens": 11750609.0, "step": 6765 }, { "entropy": 5.543426609039306, "epoch": 0.5267457693055826, "grad_norm": 0.99609375, "learning_rate": 0.000497731360109449, "loss": 5.324, "mean_token_accuracy": 0.17443307638168334, "num_tokens": 11758901.0, "step": 6770 }, { "entropy": 5.488382291793823, "epoch": 0.5271347986773002, "grad_norm": 1.0546875, "learning_rate": 0.0004977274325749922, "loss": 5.2851, "mean_token_accuracy": 0.17664580792188644, "num_tokens": 11767202.0, "step": 6775 }, { "entropy": 5.572809839248658, "epoch": 0.5275238280490177, "grad_norm": 1.0234375, "learning_rate": 0.0004977235016610011, "loss": 5.3657, "mean_token_accuracy": 0.1743328407406807, "num_tokens": 11776164.0, "step": 6780 }, { "entropy": 5.545147180557251, "epoch": 0.5279128574207352, "grad_norm": 1.046875, "learning_rate": 0.0004977195673675353, "loss": 5.341, "mean_token_accuracy": 0.17939803153276443, "num_tokens": 11784548.0, "step": 6785 }, { "entropy": 5.530298852920533, "epoch": 0.5283018867924528, "grad_norm": 1.0703125, "learning_rate": 0.0004977156296946545, "loss": 5.3917, "mean_token_accuracy": 0.17260083556175232, "num_tokens": 11793249.0, "step": 6790 }, { "entropy": 5.6396551609039305, "epoch": 0.5286909161641704, "grad_norm": 1.03125, "learning_rate": 0.0004977116886424187, "loss": 5.4462, "mean_token_accuracy": 0.16034913063049316, "num_tokens": 11801512.0, "step": 6795 }, { "entropy": 5.5579124927520756, "epoch": 0.529079945535888, "grad_norm": 1.0078125, "learning_rate": 0.0004977077442108873, "loss": 5.3305, "mean_token_accuracy": 0.17542656511068344, "num_tokens": 11810248.0, "step": 6800 }, { "entropy": 5.55517463684082, "epoch": 0.5294689749076055, "grad_norm": 0.921875, "learning_rate": 0.0004977037964001204, "loss": 5.314, "mean_token_accuracy": 0.1713288441300392, "num_tokens": 11819190.0, "step": 6805 }, { "entropy": 5.5295994758605955, "epoch": 0.5298580042793231, "grad_norm": 0.98046875, "learning_rate": 0.000497699845210178, "loss": 5.3855, "mean_token_accuracy": 0.16609974950551987, "num_tokens": 11827585.0, "step": 6810 }, { "entropy": 5.598525190353394, "epoch": 0.5302470336510406, "grad_norm": 1.1171875, "learning_rate": 0.0004976958906411197, "loss": 5.38, "mean_token_accuracy": 0.17156344652175903, "num_tokens": 11836256.0, "step": 6815 }, { "entropy": 5.640797185897827, "epoch": 0.5306360630227582, "grad_norm": 0.94140625, "learning_rate": 0.0004976919326930059, "loss": 5.4985, "mean_token_accuracy": 0.17068248689174653, "num_tokens": 11845022.0, "step": 6820 }, { "entropy": 5.598676443099976, "epoch": 0.5310250923944758, "grad_norm": 1.03125, "learning_rate": 0.0004976879713658964, "loss": 5.358, "mean_token_accuracy": 0.1735070064663887, "num_tokens": 11853289.0, "step": 6825 }, { "entropy": 5.541938924789429, "epoch": 0.5314141217661933, "grad_norm": 0.9921875, "learning_rate": 0.0004976840066598514, "loss": 5.3059, "mean_token_accuracy": 0.18151431679725646, "num_tokens": 11861589.0, "step": 6830 }, { "entropy": 5.620687627792359, "epoch": 0.5318031511379109, "grad_norm": 0.9765625, "learning_rate": 0.0004976800385749309, "loss": 5.4229, "mean_token_accuracy": 0.17156051695346833, "num_tokens": 11870313.0, "step": 6835 }, { "entropy": 5.648620891571045, "epoch": 0.5321921805096285, "grad_norm": 0.9375, "learning_rate": 0.0004976760671111954, "loss": 5.4077, "mean_token_accuracy": 0.16638242155313493, "num_tokens": 11879558.0, "step": 6840 }, { "entropy": 5.585946655273437, "epoch": 0.532581209881346, "grad_norm": 1.0234375, "learning_rate": 0.000497672092268705, "loss": 5.418, "mean_token_accuracy": 0.17313103675842284, "num_tokens": 11887951.0, "step": 6845 }, { "entropy": 5.645289087295533, "epoch": 0.5329702392530636, "grad_norm": 1.0234375, "learning_rate": 0.00049766811404752, "loss": 5.6095, "mean_token_accuracy": 0.15914858877658844, "num_tokens": 11896900.0, "step": 6850 }, { "entropy": 5.630204057693481, "epoch": 0.5333592686247812, "grad_norm": 1.0, "learning_rate": 0.0004976641324477008, "loss": 5.4502, "mean_token_accuracy": 0.1679196238517761, "num_tokens": 11905681.0, "step": 6855 }, { "entropy": 5.5766857147216795, "epoch": 0.5337482979964987, "grad_norm": 0.97265625, "learning_rate": 0.0004976601474693077, "loss": 5.3759, "mean_token_accuracy": 0.17270587086677552, "num_tokens": 11914662.0, "step": 6860 }, { "entropy": 5.526596450805664, "epoch": 0.5341373273682163, "grad_norm": 1.046875, "learning_rate": 0.0004976561591124014, "loss": 5.3782, "mean_token_accuracy": 0.1725153684616089, "num_tokens": 11923298.0, "step": 6865 }, { "entropy": 5.57788782119751, "epoch": 0.5345263567399339, "grad_norm": 0.984375, "learning_rate": 0.0004976521673770421, "loss": 5.2862, "mean_token_accuracy": 0.1714479595422745, "num_tokens": 11932206.0, "step": 6870 }, { "entropy": 5.517617845535279, "epoch": 0.5349153861116515, "grad_norm": 1.0078125, "learning_rate": 0.0004976481722632907, "loss": 5.3478, "mean_token_accuracy": 0.17630133777856827, "num_tokens": 11940786.0, "step": 6875 }, { "entropy": 5.564086103439331, "epoch": 0.535304415483369, "grad_norm": 0.94921875, "learning_rate": 0.0004976441737712076, "loss": 5.3554, "mean_token_accuracy": 0.17458420395851135, "num_tokens": 11949619.0, "step": 6880 }, { "entropy": 5.557419729232788, "epoch": 0.5356934448550865, "grad_norm": 0.984375, "learning_rate": 0.0004976401719008536, "loss": 5.3025, "mean_token_accuracy": 0.17864976227283477, "num_tokens": 11957696.0, "step": 6885 }, { "entropy": 5.523319292068481, "epoch": 0.5360824742268041, "grad_norm": 1.0390625, "learning_rate": 0.0004976361666522893, "loss": 5.3205, "mean_token_accuracy": 0.18015547543764115, "num_tokens": 11965622.0, "step": 6890 }, { "entropy": 5.502773952484131, "epoch": 0.5364715035985217, "grad_norm": 0.984375, "learning_rate": 0.0004976321580255755, "loss": 5.404, "mean_token_accuracy": 0.17072638869285583, "num_tokens": 11973969.0, "step": 6895 }, { "entropy": 5.654328346252441, "epoch": 0.5368605329702393, "grad_norm": 0.9453125, "learning_rate": 0.0004976281460207731, "loss": 5.3757, "mean_token_accuracy": 0.17207162380218505, "num_tokens": 11982469.0, "step": 6900 }, { "entropy": 5.654932689666748, "epoch": 0.5372495623419569, "grad_norm": 0.9609375, "learning_rate": 0.000497624130637943, "loss": 5.4823, "mean_token_accuracy": 0.1682865247130394, "num_tokens": 11990656.0, "step": 6905 }, { "entropy": 5.599979400634766, "epoch": 0.5376385917136743, "grad_norm": 0.98828125, "learning_rate": 0.000497620111877146, "loss": 5.4727, "mean_token_accuracy": 0.16906280666589737, "num_tokens": 11999394.0, "step": 6910 }, { "entropy": 5.641942644119263, "epoch": 0.5380276210853919, "grad_norm": 1.078125, "learning_rate": 0.0004976160897384431, "loss": 5.4404, "mean_token_accuracy": 0.17084869146347045, "num_tokens": 12007692.0, "step": 6915 }, { "entropy": 5.63287763595581, "epoch": 0.5384166504571095, "grad_norm": 1.015625, "learning_rate": 0.0004976120642218955, "loss": 5.413, "mean_token_accuracy": 0.1705508351325989, "num_tokens": 12016038.0, "step": 6920 }, { "entropy": 5.602976608276367, "epoch": 0.5388056798288271, "grad_norm": 1.0390625, "learning_rate": 0.000497608035327564, "loss": 5.5056, "mean_token_accuracy": 0.16392175406217574, "num_tokens": 12024504.0, "step": 6925 }, { "entropy": 5.540833854675293, "epoch": 0.5391947092005447, "grad_norm": 0.98046875, "learning_rate": 0.00049760400305551, "loss": 5.4129, "mean_token_accuracy": 0.17996885478496552, "num_tokens": 12032935.0, "step": 6930 }, { "entropy": 5.579827117919922, "epoch": 0.5395837385722622, "grad_norm": 0.91015625, "learning_rate": 0.0004975999674057944, "loss": 5.4449, "mean_token_accuracy": 0.16618019342422485, "num_tokens": 12041907.0, "step": 6935 }, { "entropy": 5.556284093856812, "epoch": 0.5399727679439797, "grad_norm": 0.984375, "learning_rate": 0.0004975959283784787, "loss": 5.2583, "mean_token_accuracy": 0.1829659715294838, "num_tokens": 12050528.0, "step": 6940 }, { "entropy": 5.497325849533081, "epoch": 0.5403617973156973, "grad_norm": 1.0078125, "learning_rate": 0.0004975918859736241, "loss": 5.27, "mean_token_accuracy": 0.18004730641841887, "num_tokens": 12059221.0, "step": 6945 }, { "entropy": 5.612004709243775, "epoch": 0.5407508266874149, "grad_norm": 0.9140625, "learning_rate": 0.0004975878401912919, "loss": 5.4916, "mean_token_accuracy": 0.16192035377025604, "num_tokens": 12068131.0, "step": 6950 }, { "entropy": 5.647906017303467, "epoch": 0.5411398560591325, "grad_norm": 1.0703125, "learning_rate": 0.0004975837910315436, "loss": 5.3507, "mean_token_accuracy": 0.17931652218103408, "num_tokens": 12076521.0, "step": 6955 }, { "entropy": 5.63264217376709, "epoch": 0.54152888543085, "grad_norm": 1.0234375, "learning_rate": 0.0004975797384944405, "loss": 5.5537, "mean_token_accuracy": 0.1658383660018444, "num_tokens": 12085306.0, "step": 6960 }, { "entropy": 5.5532551288604735, "epoch": 0.5419179148025676, "grad_norm": 0.9375, "learning_rate": 0.000497575682580044, "loss": 5.3263, "mean_token_accuracy": 0.17157850414514542, "num_tokens": 12094409.0, "step": 6965 }, { "entropy": 5.587439966201782, "epoch": 0.5423069441742852, "grad_norm": 0.953125, "learning_rate": 0.000497571623288416, "loss": 5.3781, "mean_token_accuracy": 0.17121410816907884, "num_tokens": 12103385.0, "step": 6970 }, { "entropy": 5.641816473007202, "epoch": 0.5426959735460027, "grad_norm": 0.98046875, "learning_rate": 0.0004975675606196177, "loss": 5.4829, "mean_token_accuracy": 0.17031232565641402, "num_tokens": 12112452.0, "step": 6975 }, { "entropy": 5.665434217453003, "epoch": 0.5430850029177203, "grad_norm": 1.0078125, "learning_rate": 0.000497563494573711, "loss": 5.4817, "mean_token_accuracy": 0.16397757828235626, "num_tokens": 12120918.0, "step": 6980 }, { "entropy": 5.581061172485351, "epoch": 0.5434740322894378, "grad_norm": 1.0625, "learning_rate": 0.0004975594251507575, "loss": 5.4618, "mean_token_accuracy": 0.1614069238305092, "num_tokens": 12129797.0, "step": 6985 }, { "entropy": 5.615111780166626, "epoch": 0.5438630616611554, "grad_norm": 1.0859375, "learning_rate": 0.000497555352350819, "loss": 5.4326, "mean_token_accuracy": 0.17036221623420716, "num_tokens": 12139245.0, "step": 6990 }, { "entropy": 5.64451584815979, "epoch": 0.544252091032873, "grad_norm": 1.046875, "learning_rate": 0.0004975512761739572, "loss": 5.5906, "mean_token_accuracy": 0.1604737401008606, "num_tokens": 12147409.0, "step": 6995 }, { "entropy": 5.657159042358399, "epoch": 0.5446411204045906, "grad_norm": 0.984375, "learning_rate": 0.000497547196620234, "loss": 5.3871, "mean_token_accuracy": 0.17300267219543458, "num_tokens": 12156121.0, "step": 7000 }, { "entropy": 5.532029724121093, "epoch": 0.5450301497763081, "grad_norm": 0.94921875, "learning_rate": 0.0004975431136897114, "loss": 5.2807, "mean_token_accuracy": 0.17725271582603455, "num_tokens": 12165307.0, "step": 7005 }, { "entropy": 5.592403888702393, "epoch": 0.5454191791480256, "grad_norm": 1.015625, "learning_rate": 0.0004975390273824512, "loss": 5.3636, "mean_token_accuracy": 0.16889277547597886, "num_tokens": 12173899.0, "step": 7010 }, { "entropy": 5.525926208496093, "epoch": 0.5458082085197432, "grad_norm": 0.9921875, "learning_rate": 0.0004975349376985155, "loss": 5.3901, "mean_token_accuracy": 0.1660206750035286, "num_tokens": 12182898.0, "step": 7015 }, { "entropy": 5.497431087493896, "epoch": 0.5461972378914608, "grad_norm": 1.0, "learning_rate": 0.0004975308446379663, "loss": 5.2557, "mean_token_accuracy": 0.17163325399160384, "num_tokens": 12191500.0, "step": 7020 }, { "entropy": 5.568679618835449, "epoch": 0.5465862672631784, "grad_norm": 1.03125, "learning_rate": 0.0004975267482008657, "loss": 5.416, "mean_token_accuracy": 0.1751037746667862, "num_tokens": 12199420.0, "step": 7025 }, { "entropy": 5.602212047576904, "epoch": 0.546975296634896, "grad_norm": 1.046875, "learning_rate": 0.000497522648387276, "loss": 5.3285, "mean_token_accuracy": 0.18170052021741867, "num_tokens": 12207676.0, "step": 7030 }, { "entropy": 5.591128396987915, "epoch": 0.5473643260066134, "grad_norm": 1.015625, "learning_rate": 0.0004975185451972592, "loss": 5.3948, "mean_token_accuracy": 0.1716712161898613, "num_tokens": 12216248.0, "step": 7035 }, { "entropy": 5.552222967147827, "epoch": 0.547753355378331, "grad_norm": 0.93359375, "learning_rate": 0.0004975144386308776, "loss": 5.412, "mean_token_accuracy": 0.16895136833190919, "num_tokens": 12224588.0, "step": 7040 }, { "entropy": 5.5841504573822025, "epoch": 0.5481423847500486, "grad_norm": 0.953125, "learning_rate": 0.0004975103286881936, "loss": 5.4297, "mean_token_accuracy": 0.1677162081003189, "num_tokens": 12234093.0, "step": 7045 }, { "entropy": 5.691504621505738, "epoch": 0.5485314141217662, "grad_norm": 1.015625, "learning_rate": 0.0004975062153692696, "loss": 5.3653, "mean_token_accuracy": 0.17879638671875, "num_tokens": 12242164.0, "step": 7050 }, { "entropy": 5.581240606307984, "epoch": 0.5489204434934838, "grad_norm": 1.046875, "learning_rate": 0.0004975020986741678, "loss": 5.4657, "mean_token_accuracy": 0.16905187219381332, "num_tokens": 12251204.0, "step": 7055 }, { "entropy": 5.596960496902466, "epoch": 0.5493094728652014, "grad_norm": 0.9609375, "learning_rate": 0.0004974979786029509, "loss": 5.3944, "mean_token_accuracy": 0.1759766384959221, "num_tokens": 12259809.0, "step": 7060 }, { "entropy": 5.588332176208496, "epoch": 0.5496985022369189, "grad_norm": 0.9765625, "learning_rate": 0.0004974938551556814, "loss": 5.3801, "mean_token_accuracy": 0.177701672911644, "num_tokens": 12268668.0, "step": 7065 }, { "entropy": 5.5599682331085205, "epoch": 0.5500875316086364, "grad_norm": 1.0390625, "learning_rate": 0.0004974897283324217, "loss": 5.3436, "mean_token_accuracy": 0.1782273069024086, "num_tokens": 12276823.0, "step": 7070 }, { "entropy": 5.469015598297119, "epoch": 0.550476560980354, "grad_norm": 0.91796875, "learning_rate": 0.0004974855981332343, "loss": 5.2767, "mean_token_accuracy": 0.17571554183959961, "num_tokens": 12285950.0, "step": 7075 }, { "entropy": 5.576544904708863, "epoch": 0.5508655903520716, "grad_norm": 1.0, "learning_rate": 0.0004974814645581823, "loss": 5.4028, "mean_token_accuracy": 0.16570572704076766, "num_tokens": 12295265.0, "step": 7080 }, { "entropy": 5.614937162399292, "epoch": 0.5512546197237892, "grad_norm": 1.0546875, "learning_rate": 0.0004974773276073282, "loss": 5.4035, "mean_token_accuracy": 0.17499323338270187, "num_tokens": 12303649.0, "step": 7085 }, { "entropy": 5.53984317779541, "epoch": 0.5516436490955067, "grad_norm": 1.109375, "learning_rate": 0.0004974731872807347, "loss": 5.4769, "mean_token_accuracy": 0.16259503364562988, "num_tokens": 12313303.0, "step": 7090 }, { "entropy": 5.617142915725708, "epoch": 0.5520326784672243, "grad_norm": 0.9296875, "learning_rate": 0.0004974690435784647, "loss": 5.4103, "mean_token_accuracy": 0.1741822436451912, "num_tokens": 12321692.0, "step": 7095 }, { "entropy": 5.472168922424316, "epoch": 0.5524217078389418, "grad_norm": 0.9375, "learning_rate": 0.0004974648965005811, "loss": 5.2183, "mean_token_accuracy": 0.17780044972896575, "num_tokens": 12329908.0, "step": 7100 }, { "entropy": 5.516451787948609, "epoch": 0.5528107372106594, "grad_norm": 0.98828125, "learning_rate": 0.0004974607460471466, "loss": 5.3905, "mean_token_accuracy": 0.1720340996980667, "num_tokens": 12339270.0, "step": 7105 }, { "entropy": 5.5568314552307125, "epoch": 0.553199766582377, "grad_norm": 1.03125, "learning_rate": 0.0004974565922182246, "loss": 5.2939, "mean_token_accuracy": 0.16998200118541718, "num_tokens": 12347586.0, "step": 7110 }, { "entropy": 5.491962099075318, "epoch": 0.5535887959540945, "grad_norm": 1.0390625, "learning_rate": 0.0004974524350138777, "loss": 5.2606, "mean_token_accuracy": 0.1712907761335373, "num_tokens": 12356291.0, "step": 7115 }, { "entropy": 5.563865232467651, "epoch": 0.5539778253258121, "grad_norm": 0.96484375, "learning_rate": 0.0004974482744341693, "loss": 5.44, "mean_token_accuracy": 0.1657626673579216, "num_tokens": 12364948.0, "step": 7120 }, { "entropy": 5.580800724029541, "epoch": 0.5543668546975297, "grad_norm": 0.95703125, "learning_rate": 0.0004974441104791624, "loss": 5.3892, "mean_token_accuracy": 0.1708601400256157, "num_tokens": 12373497.0, "step": 7125 }, { "entropy": 5.595035552978516, "epoch": 0.5547558840692473, "grad_norm": 1.0546875, "learning_rate": 0.0004974399431489201, "loss": 5.3314, "mean_token_accuracy": 0.1748373329639435, "num_tokens": 12382198.0, "step": 7130 }, { "entropy": 5.524436664581299, "epoch": 0.5551449134409648, "grad_norm": 1.0, "learning_rate": 0.0004974357724435057, "loss": 5.3254, "mean_token_accuracy": 0.17368462234735488, "num_tokens": 12391122.0, "step": 7135 }, { "entropy": 5.4512440204620365, "epoch": 0.5555339428126823, "grad_norm": 1.1328125, "learning_rate": 0.0004974315983629825, "loss": 5.2719, "mean_token_accuracy": 0.17980898171663284, "num_tokens": 12399338.0, "step": 7140 }, { "entropy": 5.539275646209717, "epoch": 0.5559229721843999, "grad_norm": 0.953125, "learning_rate": 0.0004974274209074139, "loss": 5.3702, "mean_token_accuracy": 0.1683354377746582, "num_tokens": 12408561.0, "step": 7145 }, { "entropy": 5.5871742248535154, "epoch": 0.5563120015561175, "grad_norm": 0.9609375, "learning_rate": 0.0004974232400768632, "loss": 5.2374, "mean_token_accuracy": 0.17583772391080857, "num_tokens": 12417727.0, "step": 7150 }, { "entropy": 5.533657789230347, "epoch": 0.5567010309278351, "grad_norm": 0.97265625, "learning_rate": 0.0004974190558713939, "loss": 5.2813, "mean_token_accuracy": 0.1782669872045517, "num_tokens": 12426446.0, "step": 7155 }, { "entropy": 5.528928565979004, "epoch": 0.5570900602995527, "grad_norm": 0.94921875, "learning_rate": 0.0004974148682910694, "loss": 5.3421, "mean_token_accuracy": 0.1756128489971161, "num_tokens": 12435124.0, "step": 7160 }, { "entropy": 5.574486207962036, "epoch": 0.5574790896712701, "grad_norm": 0.99609375, "learning_rate": 0.0004974106773359533, "loss": 5.4371, "mean_token_accuracy": 0.16850707232952117, "num_tokens": 12444073.0, "step": 7165 }, { "entropy": 5.633629179000854, "epoch": 0.5578681190429877, "grad_norm": 1.015625, "learning_rate": 0.0004974064830061091, "loss": 5.436, "mean_token_accuracy": 0.17465355545282363, "num_tokens": 12452419.0, "step": 7170 }, { "entropy": 5.5598479270935055, "epoch": 0.5582571484147053, "grad_norm": 0.9765625, "learning_rate": 0.0004974022853016006, "loss": 5.3676, "mean_token_accuracy": 0.17148463279008866, "num_tokens": 12461488.0, "step": 7175 }, { "entropy": 5.544917392730713, "epoch": 0.5586461777864229, "grad_norm": 1.0, "learning_rate": 0.0004973980842224913, "loss": 5.3115, "mean_token_accuracy": 0.17209033370018006, "num_tokens": 12470344.0, "step": 7180 }, { "entropy": 5.585366487503052, "epoch": 0.5590352071581405, "grad_norm": 0.98828125, "learning_rate": 0.0004973938797688452, "loss": 5.3302, "mean_token_accuracy": 0.17470196038484573, "num_tokens": 12479189.0, "step": 7185 }, { "entropy": 5.574912977218628, "epoch": 0.559424236529858, "grad_norm": 0.9765625, "learning_rate": 0.0004973896719407259, "loss": 5.3528, "mean_token_accuracy": 0.17400085926055908, "num_tokens": 12488199.0, "step": 7190 }, { "entropy": 5.488757038116455, "epoch": 0.5598132659015755, "grad_norm": 1.0078125, "learning_rate": 0.0004973854607381972, "loss": 5.2378, "mean_token_accuracy": 0.1785598635673523, "num_tokens": 12496704.0, "step": 7195 }, { "entropy": 5.448421287536621, "epoch": 0.5602022952732931, "grad_norm": 1.0234375, "learning_rate": 0.0004973812461613232, "loss": 5.2468, "mean_token_accuracy": 0.1814515098929405, "num_tokens": 12504724.0, "step": 7200 }, { "entropy": 5.538273525238037, "epoch": 0.5605913246450107, "grad_norm": 0.95703125, "learning_rate": 0.0004973770282101677, "loss": 5.4346, "mean_token_accuracy": 0.16873665004968644, "num_tokens": 12514614.0, "step": 7205 }, { "entropy": 5.659199285507202, "epoch": 0.5609803540167283, "grad_norm": 1.0546875, "learning_rate": 0.0004973728068847947, "loss": 5.4477, "mean_token_accuracy": 0.1700979381799698, "num_tokens": 12522744.0, "step": 7210 }, { "entropy": 5.567306709289551, "epoch": 0.5613693833884458, "grad_norm": 1.0546875, "learning_rate": 0.0004973685821852684, "loss": 5.3673, "mean_token_accuracy": 0.16874348223209382, "num_tokens": 12531783.0, "step": 7215 }, { "entropy": 5.574466133117676, "epoch": 0.5617584127601634, "grad_norm": 0.9375, "learning_rate": 0.0004973643541116528, "loss": 5.4153, "mean_token_accuracy": 0.16407559514045716, "num_tokens": 12541768.0, "step": 7220 }, { "entropy": 5.647474527359009, "epoch": 0.562147442131881, "grad_norm": 0.98828125, "learning_rate": 0.000497360122664012, "loss": 5.4478, "mean_token_accuracy": 0.17032507956027984, "num_tokens": 12550684.0, "step": 7225 }, { "entropy": 5.562447643280029, "epoch": 0.5625364715035985, "grad_norm": 0.921875, "learning_rate": 0.0004973558878424104, "loss": 5.3879, "mean_token_accuracy": 0.16877115964889527, "num_tokens": 12559948.0, "step": 7230 }, { "entropy": 5.541494703292846, "epoch": 0.5629255008753161, "grad_norm": 1.03125, "learning_rate": 0.0004973516496469119, "loss": 5.3257, "mean_token_accuracy": 0.18064331114292145, "num_tokens": 12568681.0, "step": 7235 }, { "entropy": 5.6327251434326175, "epoch": 0.5633145302470336, "grad_norm": 0.93359375, "learning_rate": 0.0004973474080775811, "loss": 5.45, "mean_token_accuracy": 0.16093811988830567, "num_tokens": 12577724.0, "step": 7240 }, { "entropy": 5.627685499191284, "epoch": 0.5637035596187512, "grad_norm": 1.015625, "learning_rate": 0.0004973431631344824, "loss": 5.3707, "mean_token_accuracy": 0.16951487064361573, "num_tokens": 12585994.0, "step": 7245 }, { "entropy": 5.5980414867401125, "epoch": 0.5640925889904688, "grad_norm": 0.89453125, "learning_rate": 0.00049733891481768, "loss": 5.4383, "mean_token_accuracy": 0.1648888796567917, "num_tokens": 12595525.0, "step": 7250 }, { "entropy": 5.570789098739624, "epoch": 0.5644816183621864, "grad_norm": 1.1328125, "learning_rate": 0.0004973346631272384, "loss": 5.2648, "mean_token_accuracy": 0.1851254478096962, "num_tokens": 12603645.0, "step": 7255 }, { "entropy": 5.515474510192871, "epoch": 0.5648706477339039, "grad_norm": 0.99609375, "learning_rate": 0.0004973304080632222, "loss": 5.3443, "mean_token_accuracy": 0.17358391880989074, "num_tokens": 12612165.0, "step": 7260 }, { "entropy": 5.496848011016846, "epoch": 0.5652596771056215, "grad_norm": 0.984375, "learning_rate": 0.000497326149625696, "loss": 5.2556, "mean_token_accuracy": 0.18595347553491592, "num_tokens": 12620678.0, "step": 7265 }, { "entropy": 5.622948217391968, "epoch": 0.565648706477339, "grad_norm": 0.9921875, "learning_rate": 0.0004973218878147244, "loss": 5.4589, "mean_token_accuracy": 0.17146216630935668, "num_tokens": 12628745.0, "step": 7270 }, { "entropy": 5.5886767387390135, "epoch": 0.5660377358490566, "grad_norm": 1.0546875, "learning_rate": 0.0004973176226303719, "loss": 5.4996, "mean_token_accuracy": 0.16073617041110994, "num_tokens": 12637448.0, "step": 7275 }, { "entropy": 5.586982536315918, "epoch": 0.5664267652207742, "grad_norm": 1.078125, "learning_rate": 0.0004973133540727033, "loss": 5.355, "mean_token_accuracy": 0.1728798657655716, "num_tokens": 12645804.0, "step": 7280 }, { "entropy": 5.5695812702178955, "epoch": 0.5668157945924918, "grad_norm": 1.0078125, "learning_rate": 0.0004973090821417835, "loss": 5.3134, "mean_token_accuracy": 0.17387747764587402, "num_tokens": 12654156.0, "step": 7285 }, { "entropy": 5.539006280899048, "epoch": 0.5672048239642093, "grad_norm": 0.9765625, "learning_rate": 0.0004973048068376772, "loss": 5.2845, "mean_token_accuracy": 0.1792084366083145, "num_tokens": 12662271.0, "step": 7290 }, { "entropy": 5.6432108879089355, "epoch": 0.5675938533359268, "grad_norm": 1.046875, "learning_rate": 0.0004973005281604492, "loss": 5.4654, "mean_token_accuracy": 0.16887390315532685, "num_tokens": 12671016.0, "step": 7295 }, { "entropy": 5.55637845993042, "epoch": 0.5679828827076444, "grad_norm": 1.0390625, "learning_rate": 0.0004972962461101646, "loss": 5.4055, "mean_token_accuracy": 0.17544976323843003, "num_tokens": 12679593.0, "step": 7300 }, { "entropy": 5.569255590438843, "epoch": 0.568371912079362, "grad_norm": 0.9296875, "learning_rate": 0.0004972919606868883, "loss": 5.3512, "mean_token_accuracy": 0.1819395676255226, "num_tokens": 12688715.0, "step": 7305 }, { "entropy": 5.54605622291565, "epoch": 0.5687609414510796, "grad_norm": 0.921875, "learning_rate": 0.0004972876718906852, "loss": 5.3718, "mean_token_accuracy": 0.17276016771793365, "num_tokens": 12698078.0, "step": 7310 }, { "entropy": 5.515653467178344, "epoch": 0.5691499708227972, "grad_norm": 0.9921875, "learning_rate": 0.0004972833797216206, "loss": 5.3438, "mean_token_accuracy": 0.175616854429245, "num_tokens": 12706375.0, "step": 7315 }, { "entropy": 5.6932495594024655, "epoch": 0.5695390001945146, "grad_norm": 1.0859375, "learning_rate": 0.0004972790841797595, "loss": 5.5305, "mean_token_accuracy": 0.16305019706487656, "num_tokens": 12715727.0, "step": 7320 }, { "entropy": 5.628692150115967, "epoch": 0.5699280295662322, "grad_norm": 0.9375, "learning_rate": 0.000497274785265167, "loss": 5.4236, "mean_token_accuracy": 0.1652676820755005, "num_tokens": 12725565.0, "step": 7325 }, { "entropy": 5.634153556823731, "epoch": 0.5703170589379498, "grad_norm": 1.046875, "learning_rate": 0.0004972704829779086, "loss": 5.4537, "mean_token_accuracy": 0.17304539382457734, "num_tokens": 12733498.0, "step": 7330 }, { "entropy": 5.507916975021362, "epoch": 0.5707060883096674, "grad_norm": 0.984375, "learning_rate": 0.0004972661773180492, "loss": 5.2791, "mean_token_accuracy": 0.1770097255706787, "num_tokens": 12741635.0, "step": 7335 }, { "entropy": 5.516672134399414, "epoch": 0.571095117681385, "grad_norm": 0.98046875, "learning_rate": 0.0004972618682856545, "loss": 5.2955, "mean_token_accuracy": 0.1760132133960724, "num_tokens": 12750973.0, "step": 7340 }, { "entropy": 5.548626184463501, "epoch": 0.5714841470531025, "grad_norm": 1.0546875, "learning_rate": 0.0004972575558807896, "loss": 5.3673, "mean_token_accuracy": 0.1818401336669922, "num_tokens": 12759075.0, "step": 7345 }, { "entropy": 5.6009046077728275, "epoch": 0.57187317642482, "grad_norm": 1.078125, "learning_rate": 0.0004972532401035201, "loss": 5.3446, "mean_token_accuracy": 0.17246506363153458, "num_tokens": 12767485.0, "step": 7350 }, { "entropy": 5.6010888576507565, "epoch": 0.5722622057965376, "grad_norm": 1.0546875, "learning_rate": 0.0004972489209539114, "loss": 5.3351, "mean_token_accuracy": 0.1795288950204849, "num_tokens": 12775128.0, "step": 7355 }, { "entropy": 5.461616325378418, "epoch": 0.5726512351682552, "grad_norm": 1.0546875, "learning_rate": 0.0004972445984320292, "loss": 5.2461, "mean_token_accuracy": 0.17896160930395127, "num_tokens": 12783243.0, "step": 7360 }, { "entropy": 5.58049693107605, "epoch": 0.5730402645399728, "grad_norm": 1.0546875, "learning_rate": 0.0004972402725379388, "loss": 5.4612, "mean_token_accuracy": 0.17380268424749373, "num_tokens": 12791613.0, "step": 7365 }, { "entropy": 5.623552465438843, "epoch": 0.5734292939116903, "grad_norm": 1.0234375, "learning_rate": 0.000497235943271706, "loss": 5.3949, "mean_token_accuracy": 0.17064767181873322, "num_tokens": 12799817.0, "step": 7370 }, { "entropy": 5.570609760284424, "epoch": 0.5738183232834079, "grad_norm": 0.98828125, "learning_rate": 0.0004972316106333966, "loss": 5.3949, "mean_token_accuracy": 0.17119792401790618, "num_tokens": 12808994.0, "step": 7375 }, { "entropy": 5.555026006698609, "epoch": 0.5742073526551255, "grad_norm": 1.0546875, "learning_rate": 0.0004972272746230761, "loss": 5.3673, "mean_token_accuracy": 0.16846538782119752, "num_tokens": 12817191.0, "step": 7380 }, { "entropy": 5.538722896575928, "epoch": 0.574596382026843, "grad_norm": 1.078125, "learning_rate": 0.0004972229352408104, "loss": 5.3283, "mean_token_accuracy": 0.17788893729448318, "num_tokens": 12825773.0, "step": 7385 }, { "entropy": 5.607798147201538, "epoch": 0.5749854113985606, "grad_norm": 0.98046875, "learning_rate": 0.0004972185924866655, "loss": 5.4031, "mean_token_accuracy": 0.16902348697185515, "num_tokens": 12834489.0, "step": 7390 }, { "entropy": 5.605191278457641, "epoch": 0.5753744407702781, "grad_norm": 1.0078125, "learning_rate": 0.0004972142463607071, "loss": 5.4073, "mean_token_accuracy": 0.17342112511396407, "num_tokens": 12843179.0, "step": 7395 }, { "entropy": 5.621726131439209, "epoch": 0.5757634701419957, "grad_norm": 0.92578125, "learning_rate": 0.0004972098968630012, "loss": 5.4119, "mean_token_accuracy": 0.16658886671066284, "num_tokens": 12851243.0, "step": 7400 }, { "entropy": 5.5314040184021, "epoch": 0.5761524995137133, "grad_norm": 0.94921875, "learning_rate": 0.0004972055439936137, "loss": 5.4644, "mean_token_accuracy": 0.17075924426317216, "num_tokens": 12860267.0, "step": 7405 }, { "entropy": 5.620705270767212, "epoch": 0.5765415288854309, "grad_norm": 1.03125, "learning_rate": 0.0004972011877526109, "loss": 5.4663, "mean_token_accuracy": 0.16791753768920897, "num_tokens": 12870022.0, "step": 7410 }, { "entropy": 5.625094842910767, "epoch": 0.5769305582571485, "grad_norm": 1.015625, "learning_rate": 0.0004971968281400587, "loss": 5.4183, "mean_token_accuracy": 0.1706976056098938, "num_tokens": 12879227.0, "step": 7415 }, { "entropy": 5.588114643096924, "epoch": 0.5773195876288659, "grad_norm": 1.03125, "learning_rate": 0.0004971924651560233, "loss": 5.3805, "mean_token_accuracy": 0.17181714475154877, "num_tokens": 12888180.0, "step": 7420 }, { "entropy": 5.561158514022827, "epoch": 0.5777086170005835, "grad_norm": 0.98046875, "learning_rate": 0.0004971880988005709, "loss": 5.3693, "mean_token_accuracy": 0.17101481109857558, "num_tokens": 12896767.0, "step": 7425 }, { "entropy": 5.553249740600586, "epoch": 0.5780976463723011, "grad_norm": 1.0078125, "learning_rate": 0.0004971837290737677, "loss": 5.2573, "mean_token_accuracy": 0.1826800599694252, "num_tokens": 12904766.0, "step": 7430 }, { "entropy": 5.458146619796753, "epoch": 0.5784866757440187, "grad_norm": 1.0, "learning_rate": 0.0004971793559756801, "loss": 5.3554, "mean_token_accuracy": 0.17249863743782043, "num_tokens": 12913808.0, "step": 7435 }, { "entropy": 5.474581861495972, "epoch": 0.5788757051157363, "grad_norm": 0.98046875, "learning_rate": 0.0004971749795063744, "loss": 5.3618, "mean_token_accuracy": 0.16841756850481032, "num_tokens": 12923103.0, "step": 7440 }, { "entropy": 5.5222728729248045, "epoch": 0.5792647344874537, "grad_norm": 1.0703125, "learning_rate": 0.000497170599665917, "loss": 5.3057, "mean_token_accuracy": 0.17549516260623932, "num_tokens": 12931168.0, "step": 7445 }, { "entropy": 5.52047209739685, "epoch": 0.5796537638591713, "grad_norm": 0.96875, "learning_rate": 0.0004971662164543743, "loss": 5.3732, "mean_token_accuracy": 0.1753903493285179, "num_tokens": 12939875.0, "step": 7450 }, { "entropy": 5.539617109298706, "epoch": 0.5800427932308889, "grad_norm": 0.9921875, "learning_rate": 0.0004971618298718131, "loss": 5.2872, "mean_token_accuracy": 0.17968652695417403, "num_tokens": 12947883.0, "step": 7455 }, { "entropy": 5.6593677520751955, "epoch": 0.5804318226026065, "grad_norm": 1.03125, "learning_rate": 0.0004971574399182995, "loss": 5.5427, "mean_token_accuracy": 0.16531849950551986, "num_tokens": 12956940.0, "step": 7460 }, { "entropy": 5.529565238952637, "epoch": 0.5808208519743241, "grad_norm": 1.0546875, "learning_rate": 0.0004971530465939005, "loss": 5.2745, "mean_token_accuracy": 0.176092791557312, "num_tokens": 12965003.0, "step": 7465 }, { "entropy": 5.5063401222229, "epoch": 0.5812098813460417, "grad_norm": 1.078125, "learning_rate": 0.0004971486498986825, "loss": 5.2949, "mean_token_accuracy": 0.17633689641952516, "num_tokens": 12973323.0, "step": 7470 }, { "entropy": 5.532332897186279, "epoch": 0.5815989107177592, "grad_norm": 0.9921875, "learning_rate": 0.0004971442498327124, "loss": 5.3503, "mean_token_accuracy": 0.1763529360294342, "num_tokens": 12982654.0, "step": 7475 }, { "entropy": 5.554389762878418, "epoch": 0.5819879400894767, "grad_norm": 1.015625, "learning_rate": 0.0004971398463960568, "loss": 5.3793, "mean_token_accuracy": 0.16950906962156295, "num_tokens": 12991781.0, "step": 7480 }, { "entropy": 5.609315967559814, "epoch": 0.5823769694611943, "grad_norm": 1.0390625, "learning_rate": 0.0004971354395887827, "loss": 5.4704, "mean_token_accuracy": 0.16682098954916, "num_tokens": 13000539.0, "step": 7485 }, { "entropy": 5.593524932861328, "epoch": 0.5827659988329119, "grad_norm": 0.98828125, "learning_rate": 0.0004971310294109569, "loss": 5.3308, "mean_token_accuracy": 0.17729853242635726, "num_tokens": 13008638.0, "step": 7490 }, { "entropy": 5.54377760887146, "epoch": 0.5831550282046295, "grad_norm": 0.9453125, "learning_rate": 0.0004971266158626461, "loss": 5.311, "mean_token_accuracy": 0.1797245502471924, "num_tokens": 13017217.0, "step": 7495 }, { "entropy": 5.5009050369262695, "epoch": 0.583544057576347, "grad_norm": 0.9609375, "learning_rate": 0.0004971221989439177, "loss": 5.3805, "mean_token_accuracy": 0.1698857605457306, "num_tokens": 13025278.0, "step": 7500 }, { "entropy": 5.5437568664550785, "epoch": 0.5839330869480646, "grad_norm": 1.0234375, "learning_rate": 0.0004971177786548384, "loss": 5.375, "mean_token_accuracy": 0.1708923891186714, "num_tokens": 13034484.0, "step": 7505 }, { "entropy": 5.605622100830078, "epoch": 0.5843221163197821, "grad_norm": 0.99609375, "learning_rate": 0.0004971133549954753, "loss": 5.45, "mean_token_accuracy": 0.16519997268915176, "num_tokens": 13042831.0, "step": 7510 }, { "entropy": 5.607890367507935, "epoch": 0.5847111456914997, "grad_norm": 0.98046875, "learning_rate": 0.0004971089279658954, "loss": 5.4243, "mean_token_accuracy": 0.1718083381652832, "num_tokens": 13051614.0, "step": 7515 }, { "entropy": 5.5762471675872805, "epoch": 0.5851001750632173, "grad_norm": 1.0859375, "learning_rate": 0.0004971044975661663, "loss": 5.3826, "mean_token_accuracy": 0.17437164783477782, "num_tokens": 13060179.0, "step": 7520 }, { "entropy": 5.509406042098999, "epoch": 0.5854892044349348, "grad_norm": 0.9765625, "learning_rate": 0.0004971000637963549, "loss": 5.2988, "mean_token_accuracy": 0.19026937186717988, "num_tokens": 13068328.0, "step": 7525 }, { "entropy": 5.458003282546997, "epoch": 0.5858782338066524, "grad_norm": 0.9453125, "learning_rate": 0.0004970956266565285, "loss": 5.354, "mean_token_accuracy": 0.17548120617866517, "num_tokens": 13076879.0, "step": 7530 }, { "entropy": 5.642086362838745, "epoch": 0.58626726317837, "grad_norm": 0.9609375, "learning_rate": 0.0004970911861467544, "loss": 5.3783, "mean_token_accuracy": 0.16878997385501862, "num_tokens": 13085123.0, "step": 7535 }, { "entropy": 5.50877423286438, "epoch": 0.5866562925500876, "grad_norm": 0.96875, "learning_rate": 0.0004970867422671002, "loss": 5.3647, "mean_token_accuracy": 0.1751620039343834, "num_tokens": 13093884.0, "step": 7540 }, { "entropy": 5.630490636825561, "epoch": 0.5870453219218051, "grad_norm": 0.9296875, "learning_rate": 0.000497082295017633, "loss": 5.4158, "mean_token_accuracy": 0.17094117105007173, "num_tokens": 13102581.0, "step": 7545 }, { "entropy": 5.56386513710022, "epoch": 0.5874343512935226, "grad_norm": 0.99609375, "learning_rate": 0.0004970778443984206, "loss": 5.3826, "mean_token_accuracy": 0.17182747274637222, "num_tokens": 13111307.0, "step": 7550 }, { "entropy": 5.578009700775146, "epoch": 0.5878233806652402, "grad_norm": 0.9375, "learning_rate": 0.0004970733904095303, "loss": 5.402, "mean_token_accuracy": 0.17259891629219054, "num_tokens": 13119279.0, "step": 7555 }, { "entropy": 5.637290668487549, "epoch": 0.5882124100369578, "grad_norm": 0.9921875, "learning_rate": 0.0004970689330510298, "loss": 5.4136, "mean_token_accuracy": 0.17589243799448012, "num_tokens": 13127753.0, "step": 7560 }, { "entropy": 5.596360492706299, "epoch": 0.5886014394086754, "grad_norm": 0.953125, "learning_rate": 0.0004970644723229868, "loss": 5.4595, "mean_token_accuracy": 0.1722303792834282, "num_tokens": 13136881.0, "step": 7565 }, { "entropy": 5.550789260864258, "epoch": 0.588990468780393, "grad_norm": 0.96484375, "learning_rate": 0.0004970600082254687, "loss": 5.3407, "mean_token_accuracy": 0.16740154176950456, "num_tokens": 13145291.0, "step": 7570 }, { "entropy": 5.487129545211792, "epoch": 0.5893794981521104, "grad_norm": 0.9921875, "learning_rate": 0.0004970555407585436, "loss": 5.2896, "mean_token_accuracy": 0.174217826128006, "num_tokens": 13153560.0, "step": 7575 }, { "entropy": 5.532944011688232, "epoch": 0.589768527523828, "grad_norm": 0.9453125, "learning_rate": 0.000497051069922279, "loss": 5.3334, "mean_token_accuracy": 0.17154727429151534, "num_tokens": 13162304.0, "step": 7580 }, { "entropy": 5.587238502502442, "epoch": 0.5901575568955456, "grad_norm": 0.9921875, "learning_rate": 0.0004970465957167429, "loss": 5.3571, "mean_token_accuracy": 0.180093652009964, "num_tokens": 13171404.0, "step": 7585 }, { "entropy": 5.641512298583985, "epoch": 0.5905465862672632, "grad_norm": 1.015625, "learning_rate": 0.000497042118142003, "loss": 5.4495, "mean_token_accuracy": 0.1722891092300415, "num_tokens": 13180001.0, "step": 7590 }, { "entropy": 5.58855037689209, "epoch": 0.5909356156389808, "grad_norm": 0.921875, "learning_rate": 0.0004970376371981275, "loss": 5.3877, "mean_token_accuracy": 0.1718912661075592, "num_tokens": 13189749.0, "step": 7595 }, { "entropy": 5.536149549484253, "epoch": 0.5913246450106983, "grad_norm": 1.0546875, "learning_rate": 0.0004970331528851842, "loss": 5.3693, "mean_token_accuracy": 0.17894909679889678, "num_tokens": 13199169.0, "step": 7600 }, { "entropy": 5.533176565170288, "epoch": 0.5917136743824158, "grad_norm": 1.0234375, "learning_rate": 0.0004970286652032412, "loss": 5.3155, "mean_token_accuracy": 0.17777634114027024, "num_tokens": 13207014.0, "step": 7605 }, { "entropy": 5.570296955108643, "epoch": 0.5921027037541334, "grad_norm": 1.0390625, "learning_rate": 0.0004970241741523667, "loss": 5.2644, "mean_token_accuracy": 0.18118606209754945, "num_tokens": 13215333.0, "step": 7610 }, { "entropy": 5.545152902603149, "epoch": 0.592491733125851, "grad_norm": 1.0546875, "learning_rate": 0.0004970196797326286, "loss": 5.4182, "mean_token_accuracy": 0.1663053587079048, "num_tokens": 13223740.0, "step": 7615 }, { "entropy": 5.517390346527099, "epoch": 0.5928807624975686, "grad_norm": 1.0234375, "learning_rate": 0.0004970151819440955, "loss": 5.3411, "mean_token_accuracy": 0.17706947773694992, "num_tokens": 13232065.0, "step": 7620 }, { "entropy": 5.575184059143067, "epoch": 0.5932697918692861, "grad_norm": 1.0546875, "learning_rate": 0.0004970106807868351, "loss": 5.3292, "mean_token_accuracy": 0.17993176430463792, "num_tokens": 13241171.0, "step": 7625 }, { "entropy": 5.479848480224609, "epoch": 0.5936588212410037, "grad_norm": 0.98828125, "learning_rate": 0.000497006176260916, "loss": 5.2433, "mean_token_accuracy": 0.17844447940587999, "num_tokens": 13249553.0, "step": 7630 }, { "entropy": 5.52391676902771, "epoch": 0.5940478506127213, "grad_norm": 0.94921875, "learning_rate": 0.0004970016683664068, "loss": 5.3245, "mean_token_accuracy": 0.17513321340084076, "num_tokens": 13258585.0, "step": 7635 }, { "entropy": 5.574782228469848, "epoch": 0.5944368799844388, "grad_norm": 0.921875, "learning_rate": 0.0004969971571033754, "loss": 5.3942, "mean_token_accuracy": 0.17170913964509965, "num_tokens": 13267317.0, "step": 7640 }, { "entropy": 5.553375673294068, "epoch": 0.5948259093561564, "grad_norm": 1.0078125, "learning_rate": 0.0004969926424718906, "loss": 5.2015, "mean_token_accuracy": 0.17646354734897612, "num_tokens": 13275705.0, "step": 7645 }, { "entropy": 5.493776464462281, "epoch": 0.5952149387278739, "grad_norm": 0.98828125, "learning_rate": 0.0004969881244720207, "loss": 5.3507, "mean_token_accuracy": 0.17349503338336944, "num_tokens": 13284046.0, "step": 7650 }, { "entropy": 5.521274566650391, "epoch": 0.5956039680995915, "grad_norm": 1.046875, "learning_rate": 0.0004969836031038343, "loss": 5.3245, "mean_token_accuracy": 0.1857876107096672, "num_tokens": 13292451.0, "step": 7655 }, { "entropy": 5.638164043426514, "epoch": 0.5959929974713091, "grad_norm": 0.99609375, "learning_rate": 0.0004969790783674002, "loss": 5.467, "mean_token_accuracy": 0.1726612076163292, "num_tokens": 13300788.0, "step": 7660 }, { "entropy": 5.576502895355224, "epoch": 0.5963820268430267, "grad_norm": 0.953125, "learning_rate": 0.0004969745502627868, "loss": 5.3696, "mean_token_accuracy": 0.17390913218259813, "num_tokens": 13309235.0, "step": 7665 }, { "entropy": 5.499830722808838, "epoch": 0.5967710562147442, "grad_norm": 0.92578125, "learning_rate": 0.0004969700187900629, "loss": 5.2806, "mean_token_accuracy": 0.17461724132299422, "num_tokens": 13317331.0, "step": 7670 }, { "entropy": 5.5169392108917235, "epoch": 0.5971600855864618, "grad_norm": 0.99609375, "learning_rate": 0.0004969654839492973, "loss": 5.327, "mean_token_accuracy": 0.16322662383317948, "num_tokens": 13327296.0, "step": 7675 }, { "entropy": 5.592414331436157, "epoch": 0.5975491149581793, "grad_norm": 1.0078125, "learning_rate": 0.0004969609457405588, "loss": 5.3817, "mean_token_accuracy": 0.1711716204881668, "num_tokens": 13336650.0, "step": 7680 }, { "entropy": 5.568482351303101, "epoch": 0.5979381443298969, "grad_norm": 0.96875, "learning_rate": 0.0004969564041639163, "loss": 5.343, "mean_token_accuracy": 0.1691240593791008, "num_tokens": 13345353.0, "step": 7685 }, { "entropy": 5.58502950668335, "epoch": 0.5983271737016145, "grad_norm": 0.9609375, "learning_rate": 0.0004969518592194386, "loss": 5.3567, "mean_token_accuracy": 0.1758212998509407, "num_tokens": 13354302.0, "step": 7690 }, { "entropy": 5.548376178741455, "epoch": 0.5987162030733321, "grad_norm": 1.015625, "learning_rate": 0.0004969473109071946, "loss": 5.2884, "mean_token_accuracy": 0.1804495334625244, "num_tokens": 13362950.0, "step": 7695 }, { "entropy": 5.559222888946533, "epoch": 0.5991052324450497, "grad_norm": 1.0625, "learning_rate": 0.0004969427592272535, "loss": 5.405, "mean_token_accuracy": 0.1677863508462906, "num_tokens": 13371383.0, "step": 7700 }, { "entropy": 5.593032693862915, "epoch": 0.5994942618167671, "grad_norm": 1.0078125, "learning_rate": 0.0004969382041796843, "loss": 5.3539, "mean_token_accuracy": 0.17664709836244583, "num_tokens": 13379767.0, "step": 7705 }, { "entropy": 5.562273359298706, "epoch": 0.5998832911884847, "grad_norm": 0.96875, "learning_rate": 0.000496933645764556, "loss": 5.3589, "mean_token_accuracy": 0.17092403173446655, "num_tokens": 13387970.0, "step": 7710 }, { "entropy": 5.460060167312622, "epoch": 0.6002723205602023, "grad_norm": 1.0078125, "learning_rate": 0.0004969290839819381, "loss": 5.3006, "mean_token_accuracy": 0.1819343164563179, "num_tokens": 13396605.0, "step": 7715 }, { "entropy": 5.497374153137207, "epoch": 0.6006613499319199, "grad_norm": 0.97265625, "learning_rate": 0.0004969245188318994, "loss": 5.246, "mean_token_accuracy": 0.18647234439849852, "num_tokens": 13406028.0, "step": 7720 }, { "entropy": 5.585578155517578, "epoch": 0.6010503793036375, "grad_norm": 1.0859375, "learning_rate": 0.0004969199503145093, "loss": 5.3005, "mean_token_accuracy": 0.18644406497478486, "num_tokens": 13414927.0, "step": 7725 }, { "entropy": 5.477698945999146, "epoch": 0.601439408675355, "grad_norm": 1.0390625, "learning_rate": 0.0004969153784298374, "loss": 5.2601, "mean_token_accuracy": 0.17750975340604783, "num_tokens": 13423020.0, "step": 7730 }, { "entropy": 5.451818656921387, "epoch": 0.6018284380470725, "grad_norm": 0.97265625, "learning_rate": 0.0004969108031779527, "loss": 5.2506, "mean_token_accuracy": 0.17806920558214187, "num_tokens": 13431514.0, "step": 7735 }, { "entropy": 5.570550203323364, "epoch": 0.6022174674187901, "grad_norm": 0.9921875, "learning_rate": 0.0004969062245589247, "loss": 5.4174, "mean_token_accuracy": 0.1663815602660179, "num_tokens": 13440333.0, "step": 7740 }, { "entropy": 5.5489739894866945, "epoch": 0.6026064967905077, "grad_norm": 1.015625, "learning_rate": 0.0004969016425728231, "loss": 5.3799, "mean_token_accuracy": 0.17304388135671617, "num_tokens": 13448841.0, "step": 7745 }, { "entropy": 5.573737668991089, "epoch": 0.6029955261622253, "grad_norm": 1.109375, "learning_rate": 0.0004968970572197172, "loss": 5.4424, "mean_token_accuracy": 0.1734498292207718, "num_tokens": 13457846.0, "step": 7750 }, { "entropy": 5.644472217559814, "epoch": 0.6033845555339428, "grad_norm": 1.0703125, "learning_rate": 0.0004968924684996765, "loss": 5.4259, "mean_token_accuracy": 0.16381694376468658, "num_tokens": 13466242.0, "step": 7755 }, { "entropy": 5.606421089172363, "epoch": 0.6037735849056604, "grad_norm": 1.0078125, "learning_rate": 0.000496887876412771, "loss": 5.3845, "mean_token_accuracy": 0.1697392389178276, "num_tokens": 13474639.0, "step": 7760 }, { "entropy": 5.488092279434204, "epoch": 0.6041626142773779, "grad_norm": 0.9375, "learning_rate": 0.0004968832809590701, "loss": 5.2647, "mean_token_accuracy": 0.1763392835855484, "num_tokens": 13483673.0, "step": 7765 }, { "entropy": 5.599930238723755, "epoch": 0.6045516436490955, "grad_norm": 0.9765625, "learning_rate": 0.0004968786821386435, "loss": 5.3887, "mean_token_accuracy": 0.1708754912018776, "num_tokens": 13493001.0, "step": 7770 }, { "entropy": 5.680524682998657, "epoch": 0.6049406730208131, "grad_norm": 1.1484375, "learning_rate": 0.0004968740799515611, "loss": 5.391, "mean_token_accuracy": 0.17101291418075562, "num_tokens": 13500878.0, "step": 7775 }, { "entropy": 5.598127460479736, "epoch": 0.6053297023925306, "grad_norm": 1.0234375, "learning_rate": 0.0004968694743978926, "loss": 5.4588, "mean_token_accuracy": 0.17042829543352128, "num_tokens": 13509945.0, "step": 7780 }, { "entropy": 5.521656942367554, "epoch": 0.6057187317642482, "grad_norm": 0.91796875, "learning_rate": 0.0004968648654777081, "loss": 5.375, "mean_token_accuracy": 0.17120584547519685, "num_tokens": 13520024.0, "step": 7785 }, { "entropy": 5.585179138183594, "epoch": 0.6061077611359658, "grad_norm": 0.90234375, "learning_rate": 0.0004968602531910773, "loss": 5.469, "mean_token_accuracy": 0.17220492511987687, "num_tokens": 13529136.0, "step": 7790 }, { "entropy": 5.542343616485596, "epoch": 0.6064967905076833, "grad_norm": 0.99609375, "learning_rate": 0.0004968556375380704, "loss": 5.2797, "mean_token_accuracy": 0.17611190676689148, "num_tokens": 13537001.0, "step": 7795 }, { "entropy": 5.560285663604736, "epoch": 0.6068858198794009, "grad_norm": 1.0078125, "learning_rate": 0.0004968510185187571, "loss": 5.2735, "mean_token_accuracy": 0.17917787432670593, "num_tokens": 13545520.0, "step": 7800 }, { "entropy": 5.544495534896851, "epoch": 0.6072748492511184, "grad_norm": 0.953125, "learning_rate": 0.000496846396133208, "loss": 5.3394, "mean_token_accuracy": 0.17420600056648256, "num_tokens": 13554770.0, "step": 7805 }, { "entropy": 5.626155519485474, "epoch": 0.607663878622836, "grad_norm": 1.0234375, "learning_rate": 0.0004968417703814928, "loss": 5.3846, "mean_token_accuracy": 0.16878970265388488, "num_tokens": 13562797.0, "step": 7810 }, { "entropy": 5.547210168838501, "epoch": 0.6080529079945536, "grad_norm": 1.015625, "learning_rate": 0.0004968371412636818, "loss": 5.3304, "mean_token_accuracy": 0.1746557965874672, "num_tokens": 13572017.0, "step": 7815 }, { "entropy": 5.6029235363006595, "epoch": 0.6084419373662712, "grad_norm": 1.0234375, "learning_rate": 0.0004968325087798453, "loss": 5.3441, "mean_token_accuracy": 0.18049524277448653, "num_tokens": 13580245.0, "step": 7820 }, { "entropy": 5.531136322021484, "epoch": 0.6088309667379888, "grad_norm": 1.03125, "learning_rate": 0.0004968278729300536, "loss": 5.3171, "mean_token_accuracy": 0.16607199758291244, "num_tokens": 13588719.0, "step": 7825 }, { "entropy": 5.584434127807617, "epoch": 0.6092199961097062, "grad_norm": 0.96875, "learning_rate": 0.0004968232337143769, "loss": 5.3666, "mean_token_accuracy": 0.17199817597866057, "num_tokens": 13597345.0, "step": 7830 }, { "entropy": 5.6312113285064695, "epoch": 0.6096090254814238, "grad_norm": 1.0078125, "learning_rate": 0.0004968185911328858, "loss": 5.4003, "mean_token_accuracy": 0.17051864713430404, "num_tokens": 13605468.0, "step": 7835 }, { "entropy": 5.582196235656738, "epoch": 0.6099980548531414, "grad_norm": 0.95703125, "learning_rate": 0.0004968139451856506, "loss": 5.4105, "mean_token_accuracy": 0.16867444664239883, "num_tokens": 13614085.0, "step": 7840 }, { "entropy": 5.517850732803344, "epoch": 0.610387084224859, "grad_norm": 1.0, "learning_rate": 0.0004968092958727419, "loss": 5.2498, "mean_token_accuracy": 0.18096206039190293, "num_tokens": 13622370.0, "step": 7845 }, { "entropy": 5.580560302734375, "epoch": 0.6107761135965766, "grad_norm": 1.0, "learning_rate": 0.00049680464319423, "loss": 5.3502, "mean_token_accuracy": 0.17943231463432313, "num_tokens": 13630615.0, "step": 7850 }, { "entropy": 5.575184011459351, "epoch": 0.6111651429682942, "grad_norm": 1.09375, "learning_rate": 0.0004967999871501858, "loss": 5.2722, "mean_token_accuracy": 0.18188537061214446, "num_tokens": 13638461.0, "step": 7855 }, { "entropy": 5.510336828231812, "epoch": 0.6115541723400116, "grad_norm": 0.9140625, "learning_rate": 0.0004967953277406798, "loss": 5.3973, "mean_token_accuracy": 0.17134999632835388, "num_tokens": 13647266.0, "step": 7860 }, { "entropy": 5.521545457839966, "epoch": 0.6119432017117292, "grad_norm": 0.98828125, "learning_rate": 0.0004967906649657828, "loss": 5.3638, "mean_token_accuracy": 0.1715383231639862, "num_tokens": 13655930.0, "step": 7865 }, { "entropy": 5.599652671813965, "epoch": 0.6123322310834468, "grad_norm": 0.94921875, "learning_rate": 0.0004967859988255655, "loss": 5.348, "mean_token_accuracy": 0.17368347495794295, "num_tokens": 13664427.0, "step": 7870 }, { "entropy": 5.592863941192627, "epoch": 0.6127212604551644, "grad_norm": 1.0625, "learning_rate": 0.0004967813293200985, "loss": 5.3683, "mean_token_accuracy": 0.17025499045848846, "num_tokens": 13673120.0, "step": 7875 }, { "entropy": 5.467510604858399, "epoch": 0.613110289826882, "grad_norm": 0.9375, "learning_rate": 0.0004967766564494529, "loss": 5.2085, "mean_token_accuracy": 0.18253915011882782, "num_tokens": 13681918.0, "step": 7880 }, { "entropy": 5.500329208374024, "epoch": 0.6134993191985995, "grad_norm": 0.99609375, "learning_rate": 0.0004967719802136996, "loss": 5.301, "mean_token_accuracy": 0.18101820349693298, "num_tokens": 13689904.0, "step": 7885 }, { "entropy": 5.5643226146698, "epoch": 0.613888348570317, "grad_norm": 1.1015625, "learning_rate": 0.0004967673006129094, "loss": 5.327, "mean_token_accuracy": 0.179725743830204, "num_tokens": 13697861.0, "step": 7890 }, { "entropy": 5.650169515609742, "epoch": 0.6142773779420346, "grad_norm": 1.0390625, "learning_rate": 0.0004967626176471536, "loss": 5.4887, "mean_token_accuracy": 0.176704303920269, "num_tokens": 13706058.0, "step": 7895 }, { "entropy": 5.598395586013794, "epoch": 0.6146664073137522, "grad_norm": 0.94921875, "learning_rate": 0.0004967579313165028, "loss": 5.4118, "mean_token_accuracy": 0.1683913677930832, "num_tokens": 13715081.0, "step": 7900 }, { "entropy": 5.5326012134552, "epoch": 0.6150554366854698, "grad_norm": 1.1328125, "learning_rate": 0.0004967532416210284, "loss": 5.2877, "mean_token_accuracy": 0.17803635597229003, "num_tokens": 13723311.0, "step": 7905 }, { "entropy": 5.5607462406158445, "epoch": 0.6154444660571873, "grad_norm": 1.0078125, "learning_rate": 0.0004967485485608016, "loss": 5.3136, "mean_token_accuracy": 0.17333609759807586, "num_tokens": 13731737.0, "step": 7910 }, { "entropy": 5.516550922393799, "epoch": 0.6158334954289049, "grad_norm": 0.9609375, "learning_rate": 0.0004967438521358934, "loss": 5.3713, "mean_token_accuracy": 0.1813556432723999, "num_tokens": 13740255.0, "step": 7915 }, { "entropy": 5.541819524765015, "epoch": 0.6162225248006225, "grad_norm": 1.21875, "learning_rate": 0.0004967391523463754, "loss": 5.3317, "mean_token_accuracy": 0.18250609934329987, "num_tokens": 13748656.0, "step": 7920 }, { "entropy": 5.522940683364868, "epoch": 0.61661155417234, "grad_norm": 0.95703125, "learning_rate": 0.0004967344491923185, "loss": 5.3338, "mean_token_accuracy": 0.17326279878616332, "num_tokens": 13757539.0, "step": 7925 }, { "entropy": 5.594710445404052, "epoch": 0.6170005835440576, "grad_norm": 0.95703125, "learning_rate": 0.0004967297426737943, "loss": 5.3527, "mean_token_accuracy": 0.17415117025375365, "num_tokens": 13766569.0, "step": 7930 }, { "entropy": 5.601859617233276, "epoch": 0.6173896129157751, "grad_norm": 1.015625, "learning_rate": 0.0004967250327908742, "loss": 5.3591, "mean_token_accuracy": 0.17641110718250275, "num_tokens": 13775071.0, "step": 7935 }, { "entropy": 5.537156820297241, "epoch": 0.6177786422874927, "grad_norm": 1.0390625, "learning_rate": 0.0004967203195436297, "loss": 5.356, "mean_token_accuracy": 0.17206708639860152, "num_tokens": 13783319.0, "step": 7940 }, { "entropy": 5.451058578491211, "epoch": 0.6181676716592103, "grad_norm": 0.99609375, "learning_rate": 0.0004967156029321322, "loss": 5.2875, "mean_token_accuracy": 0.17833213359117508, "num_tokens": 13792746.0, "step": 7945 }, { "entropy": 5.542263555526733, "epoch": 0.6185567010309279, "grad_norm": 1.046875, "learning_rate": 0.0004967108829564532, "loss": 5.2487, "mean_token_accuracy": 0.17959157824516297, "num_tokens": 13801632.0, "step": 7950 }, { "entropy": 5.551568174362183, "epoch": 0.6189457304026454, "grad_norm": 0.94140625, "learning_rate": 0.0004967061596166646, "loss": 5.3763, "mean_token_accuracy": 0.17596834450960158, "num_tokens": 13810527.0, "step": 7955 }, { "entropy": 5.588356781005859, "epoch": 0.6193347597743629, "grad_norm": 0.96875, "learning_rate": 0.0004967014329128378, "loss": 5.3184, "mean_token_accuracy": 0.17908930778503418, "num_tokens": 13819885.0, "step": 7960 }, { "entropy": 5.5313653469085695, "epoch": 0.6197237891460805, "grad_norm": 0.9609375, "learning_rate": 0.0004966967028450448, "loss": 5.3286, "mean_token_accuracy": 0.17857691198587416, "num_tokens": 13828509.0, "step": 7965 }, { "entropy": 5.507750177383423, "epoch": 0.6201128185177981, "grad_norm": 1.015625, "learning_rate": 0.000496691969413357, "loss": 5.3264, "mean_token_accuracy": 0.1743997499346733, "num_tokens": 13837196.0, "step": 7970 }, { "entropy": 5.61162805557251, "epoch": 0.6205018478895157, "grad_norm": 1.0234375, "learning_rate": 0.0004966872326178466, "loss": 5.3894, "mean_token_accuracy": 0.16989969164133073, "num_tokens": 13845849.0, "step": 7975 }, { "entropy": 5.54603385925293, "epoch": 0.6208908772612333, "grad_norm": 1.0234375, "learning_rate": 0.0004966824924585851, "loss": 5.2988, "mean_token_accuracy": 0.17852577865123748, "num_tokens": 13853430.0, "step": 7980 }, { "entropy": 5.56148362159729, "epoch": 0.6212799066329507, "grad_norm": 1.0390625, "learning_rate": 0.0004966777489356448, "loss": 5.4864, "mean_token_accuracy": 0.16196728646755218, "num_tokens": 13862520.0, "step": 7985 }, { "entropy": 5.646517705917359, "epoch": 0.6216689360046683, "grad_norm": 1.03125, "learning_rate": 0.0004966730020490975, "loss": 5.3964, "mean_token_accuracy": 0.17003020644187927, "num_tokens": 13871064.0, "step": 7990 }, { "entropy": 5.537185096740723, "epoch": 0.6220579653763859, "grad_norm": 0.95703125, "learning_rate": 0.000496668251799015, "loss": 5.3058, "mean_token_accuracy": 0.1683700829744339, "num_tokens": 13879952.0, "step": 7995 }, { "entropy": 5.581895732879639, "epoch": 0.6224469947481035, "grad_norm": 1.03125, "learning_rate": 0.0004966634981854699, "loss": 5.4492, "mean_token_accuracy": 0.1669245555996895, "num_tokens": 13888054.0, "step": 8000 }, { "entropy": 5.641258096694946, "epoch": 0.6228360241198211, "grad_norm": 0.96875, "learning_rate": 0.0004966587412085339, "loss": 5.4182, "mean_token_accuracy": 0.16494594961404802, "num_tokens": 13897051.0, "step": 8005 }, { "entropy": 5.5485881805419925, "epoch": 0.6232250534915386, "grad_norm": 1.015625, "learning_rate": 0.0004966539808682793, "loss": 5.3911, "mean_token_accuracy": 0.172801573574543, "num_tokens": 13906175.0, "step": 8010 }, { "entropy": 5.5216528415679935, "epoch": 0.6236140828632561, "grad_norm": 0.9453125, "learning_rate": 0.0004966492171647783, "loss": 5.3463, "mean_token_accuracy": 0.1710781693458557, "num_tokens": 13915283.0, "step": 8015 }, { "entropy": 5.58815598487854, "epoch": 0.6240031122349737, "grad_norm": 1.03125, "learning_rate": 0.0004966444500981032, "loss": 5.3701, "mean_token_accuracy": 0.17193115949630738, "num_tokens": 13924007.0, "step": 8020 }, { "entropy": 5.573034238815308, "epoch": 0.6243921416066913, "grad_norm": 0.96484375, "learning_rate": 0.0004966396796683265, "loss": 5.2944, "mean_token_accuracy": 0.17845796942710876, "num_tokens": 13932694.0, "step": 8025 }, { "entropy": 5.599836254119873, "epoch": 0.6247811709784089, "grad_norm": 1.1953125, "learning_rate": 0.0004966349058755204, "loss": 5.4134, "mean_token_accuracy": 0.16764910966157914, "num_tokens": 13941817.0, "step": 8030 }, { "entropy": 5.527499341964722, "epoch": 0.6251702003501264, "grad_norm": 0.95703125, "learning_rate": 0.0004966301287197573, "loss": 5.2461, "mean_token_accuracy": 0.18013728857040406, "num_tokens": 13950413.0, "step": 8035 }, { "entropy": 5.621425580978394, "epoch": 0.625559229721844, "grad_norm": 1.0234375, "learning_rate": 0.0004966253482011098, "loss": 5.4113, "mean_token_accuracy": 0.16751815229654313, "num_tokens": 13959415.0, "step": 8040 }, { "entropy": 5.524870491027832, "epoch": 0.6259482590935616, "grad_norm": 1.0078125, "learning_rate": 0.0004966205643196503, "loss": 5.2538, "mean_token_accuracy": 0.1807009220123291, "num_tokens": 13967889.0, "step": 8045 }, { "entropy": 5.4060698509216305, "epoch": 0.6263372884652791, "grad_norm": 0.9921875, "learning_rate": 0.0004966157770754516, "loss": 5.2531, "mean_token_accuracy": 0.17946197539567948, "num_tokens": 13976190.0, "step": 8050 }, { "entropy": 5.632767534255981, "epoch": 0.6267263178369967, "grad_norm": 0.98046875, "learning_rate": 0.000496610986468586, "loss": 5.3989, "mean_token_accuracy": 0.16913820952177047, "num_tokens": 13984940.0, "step": 8055 }, { "entropy": 5.593919563293457, "epoch": 0.6271153472087143, "grad_norm": 1.0234375, "learning_rate": 0.0004966061924991267, "loss": 5.397, "mean_token_accuracy": 0.16479443609714509, "num_tokens": 13993740.0, "step": 8060 }, { "entropy": 5.606960105895996, "epoch": 0.6275043765804318, "grad_norm": 0.9921875, "learning_rate": 0.000496601395167146, "loss": 5.4376, "mean_token_accuracy": 0.17392051517963408, "num_tokens": 14002401.0, "step": 8065 }, { "entropy": 5.593834114074707, "epoch": 0.6278934059521494, "grad_norm": 0.984375, "learning_rate": 0.0004965965944727168, "loss": 5.4004, "mean_token_accuracy": 0.17788144648075105, "num_tokens": 14011197.0, "step": 8070 }, { "entropy": 5.547999668121338, "epoch": 0.628282435323867, "grad_norm": 0.9375, "learning_rate": 0.0004965917904159121, "loss": 5.2775, "mean_token_accuracy": 0.18101787120103835, "num_tokens": 14020344.0, "step": 8075 }, { "entropy": 5.511492681503296, "epoch": 0.6286714646955845, "grad_norm": 0.98828125, "learning_rate": 0.0004965869829968046, "loss": 5.312, "mean_token_accuracy": 0.1775810346007347, "num_tokens": 14029117.0, "step": 8080 }, { "entropy": 5.48272738456726, "epoch": 0.6290604940673021, "grad_norm": 0.953125, "learning_rate": 0.0004965821722154674, "loss": 5.1935, "mean_token_accuracy": 0.1883873388171196, "num_tokens": 14038395.0, "step": 8085 }, { "entropy": 5.514497470855713, "epoch": 0.6294495234390196, "grad_norm": 0.9609375, "learning_rate": 0.0004965773580719734, "loss": 5.2903, "mean_token_accuracy": 0.17947292029857637, "num_tokens": 14046983.0, "step": 8090 }, { "entropy": 5.466129493713379, "epoch": 0.6298385528107372, "grad_norm": 1.0390625, "learning_rate": 0.0004965725405663957, "loss": 5.1915, "mean_token_accuracy": 0.19063412100076677, "num_tokens": 14056261.0, "step": 8095 }, { "entropy": 5.499783563613891, "epoch": 0.6302275821824548, "grad_norm": 0.8984375, "learning_rate": 0.0004965677196988073, "loss": 5.3647, "mean_token_accuracy": 0.17377645671367645, "num_tokens": 14065371.0, "step": 8100 }, { "entropy": 5.579390668869019, "epoch": 0.6306166115541724, "grad_norm": 0.94921875, "learning_rate": 0.0004965628954692815, "loss": 5.4184, "mean_token_accuracy": 0.17351904213428498, "num_tokens": 14074007.0, "step": 8105 }, { "entropy": 5.518921756744385, "epoch": 0.63100564092589, "grad_norm": 0.99609375, "learning_rate": 0.0004965580678778913, "loss": 5.2917, "mean_token_accuracy": 0.17797668427228927, "num_tokens": 14083259.0, "step": 8110 }, { "entropy": 5.485857963562012, "epoch": 0.6313946702976074, "grad_norm": 1.125, "learning_rate": 0.0004965532369247102, "loss": 5.2687, "mean_token_accuracy": 0.1792393684387207, "num_tokens": 14090993.0, "step": 8115 }, { "entropy": 5.593067741394043, "epoch": 0.631783699669325, "grad_norm": 1.03125, "learning_rate": 0.0004965484026098111, "loss": 5.4235, "mean_token_accuracy": 0.17357975095510483, "num_tokens": 14099722.0, "step": 8120 }, { "entropy": 5.661558294296265, "epoch": 0.6321727290410426, "grad_norm": 1.0078125, "learning_rate": 0.0004965435649332679, "loss": 5.3858, "mean_token_accuracy": 0.1726991832256317, "num_tokens": 14108483.0, "step": 8125 }, { "entropy": 5.622810411453247, "epoch": 0.6325617584127602, "grad_norm": 0.92578125, "learning_rate": 0.0004965387238951536, "loss": 5.3991, "mean_token_accuracy": 0.17369397431612016, "num_tokens": 14117187.0, "step": 8130 }, { "entropy": 5.508215427398682, "epoch": 0.6329507877844778, "grad_norm": 1.1015625, "learning_rate": 0.0004965338794955418, "loss": 5.2196, "mean_token_accuracy": 0.1799855947494507, "num_tokens": 14125424.0, "step": 8135 }, { "entropy": 5.507724905014038, "epoch": 0.6333398171561953, "grad_norm": 1.0625, "learning_rate": 0.0004965290317345061, "loss": 5.3138, "mean_token_accuracy": 0.18159506022930144, "num_tokens": 14133038.0, "step": 8140 }, { "entropy": 5.593365907669067, "epoch": 0.6337288465279128, "grad_norm": 1.03125, "learning_rate": 0.0004965241806121198, "loss": 5.4477, "mean_token_accuracy": 0.16725610494613646, "num_tokens": 14141114.0, "step": 8145 }, { "entropy": 5.55255765914917, "epoch": 0.6341178758996304, "grad_norm": 0.953125, "learning_rate": 0.0004965193261284567, "loss": 5.315, "mean_token_accuracy": 0.17620687335729598, "num_tokens": 14149681.0, "step": 8150 }, { "entropy": 5.60346827507019, "epoch": 0.634506905271348, "grad_norm": 1.0234375, "learning_rate": 0.0004965144682835904, "loss": 5.3451, "mean_token_accuracy": 0.17399860322475433, "num_tokens": 14158510.0, "step": 8155 }, { "entropy": 5.584024381637573, "epoch": 0.6348959346430656, "grad_norm": 0.98046875, "learning_rate": 0.0004965096070775946, "loss": 5.4089, "mean_token_accuracy": 0.18241353183984757, "num_tokens": 14166897.0, "step": 8160 }, { "entropy": 5.572781801223755, "epoch": 0.6352849640147831, "grad_norm": 0.99609375, "learning_rate": 0.0004965047425105431, "loss": 5.3333, "mean_token_accuracy": 0.17682040780782698, "num_tokens": 14174692.0, "step": 8165 }, { "entropy": 5.578118991851807, "epoch": 0.6356739933865007, "grad_norm": 1.0859375, "learning_rate": 0.0004964998745825097, "loss": 5.3483, "mean_token_accuracy": 0.1691601410508156, "num_tokens": 14183779.0, "step": 8170 }, { "entropy": 5.578902626037598, "epoch": 0.6360630227582182, "grad_norm": 1.015625, "learning_rate": 0.0004964950032935682, "loss": 5.3888, "mean_token_accuracy": 0.17535317987203597, "num_tokens": 14191809.0, "step": 8175 }, { "entropy": 5.520987462997437, "epoch": 0.6364520521299358, "grad_norm": 0.921875, "learning_rate": 0.0004964901286437927, "loss": 5.3436, "mean_token_accuracy": 0.1737244814634323, "num_tokens": 14200652.0, "step": 8180 }, { "entropy": 5.523354482650757, "epoch": 0.6368410815016534, "grad_norm": 0.9921875, "learning_rate": 0.0004964852506332568, "loss": 5.3386, "mean_token_accuracy": 0.17518059015274048, "num_tokens": 14209694.0, "step": 8185 }, { "entropy": 5.5737368106842045, "epoch": 0.6372301108733709, "grad_norm": 1.015625, "learning_rate": 0.000496480369262035, "loss": 5.3843, "mean_token_accuracy": 0.17430939823389052, "num_tokens": 14218040.0, "step": 8190 }, { "entropy": 5.508235311508178, "epoch": 0.6376191402450885, "grad_norm": 1.0390625, "learning_rate": 0.000496475484530201, "loss": 5.3288, "mean_token_accuracy": 0.17897281646728516, "num_tokens": 14225908.0, "step": 8195 }, { "entropy": 5.542799472808838, "epoch": 0.6380081696168061, "grad_norm": 0.99609375, "learning_rate": 0.0004964705964378292, "loss": 5.3194, "mean_token_accuracy": 0.17201312333345414, "num_tokens": 14234140.0, "step": 8200 }, { "entropy": 5.597808504104615, "epoch": 0.6383971989885237, "grad_norm": 0.9375, "learning_rate": 0.0004964657049849934, "loss": 5.3636, "mean_token_accuracy": 0.1760126233100891, "num_tokens": 14243590.0, "step": 8205 }, { "entropy": 5.587457942962646, "epoch": 0.6387862283602412, "grad_norm": 0.98046875, "learning_rate": 0.0004964608101717681, "loss": 5.3702, "mean_token_accuracy": 0.17247974127531052, "num_tokens": 14252249.0, "step": 8210 }, { "entropy": 5.4944172382354735, "epoch": 0.6391752577319587, "grad_norm": 0.98828125, "learning_rate": 0.0004964559119982275, "loss": 5.2802, "mean_token_accuracy": 0.17108798027038574, "num_tokens": 14261147.0, "step": 8215 }, { "entropy": 5.5766232967376705, "epoch": 0.6395642871036763, "grad_norm": 0.98046875, "learning_rate": 0.000496451010464446, "loss": 5.357, "mean_token_accuracy": 0.1688360944390297, "num_tokens": 14270309.0, "step": 8220 }, { "entropy": 5.505234098434448, "epoch": 0.6399533164753939, "grad_norm": 0.890625, "learning_rate": 0.0004964461055704978, "loss": 5.331, "mean_token_accuracy": 0.17241778671741487, "num_tokens": 14279379.0, "step": 8225 }, { "entropy": 5.503537702560425, "epoch": 0.6403423458471115, "grad_norm": 0.92578125, "learning_rate": 0.0004964411973164574, "loss": 5.2606, "mean_token_accuracy": 0.17556058317422868, "num_tokens": 14288136.0, "step": 8230 }, { "entropy": 5.5019049644470215, "epoch": 0.6407313752188291, "grad_norm": 0.99609375, "learning_rate": 0.0004964362857023993, "loss": 5.2139, "mean_token_accuracy": 0.17391479909420013, "num_tokens": 14296437.0, "step": 8235 }, { "entropy": 5.50696496963501, "epoch": 0.6411204045905465, "grad_norm": 1.0625, "learning_rate": 0.000496431370728398, "loss": 5.2636, "mean_token_accuracy": 0.18908848911523818, "num_tokens": 14304861.0, "step": 8240 }, { "entropy": 5.459806251525879, "epoch": 0.6415094339622641, "grad_norm": 1.0546875, "learning_rate": 0.0004964264523945281, "loss": 5.3125, "mean_token_accuracy": 0.18055261075496673, "num_tokens": 14312861.0, "step": 8245 }, { "entropy": 5.417690134048462, "epoch": 0.6418984633339817, "grad_norm": 1.015625, "learning_rate": 0.0004964215307008643, "loss": 5.1635, "mean_token_accuracy": 0.18433250933885575, "num_tokens": 14321651.0, "step": 8250 }, { "entropy": 5.563171148300171, "epoch": 0.6422874927056993, "grad_norm": 0.96484375, "learning_rate": 0.0004964166056474811, "loss": 5.3448, "mean_token_accuracy": 0.18368207514286042, "num_tokens": 14329234.0, "step": 8255 }, { "entropy": 5.545494842529297, "epoch": 0.6426765220774169, "grad_norm": 1.0078125, "learning_rate": 0.0004964116772344534, "loss": 5.4658, "mean_token_accuracy": 0.17197026759386064, "num_tokens": 14337603.0, "step": 8260 }, { "entropy": 5.551905488967895, "epoch": 0.6430655514491345, "grad_norm": 0.96875, "learning_rate": 0.0004964067454618559, "loss": 5.3426, "mean_token_accuracy": 0.17509338408708572, "num_tokens": 14346634.0, "step": 8265 }, { "entropy": 5.599965572357178, "epoch": 0.6434545808208519, "grad_norm": 0.93359375, "learning_rate": 0.0004964018103297634, "loss": 5.3686, "mean_token_accuracy": 0.16939437091350557, "num_tokens": 14355336.0, "step": 8270 }, { "entropy": 5.509151124954224, "epoch": 0.6438436101925695, "grad_norm": 0.953125, "learning_rate": 0.0004963968718382509, "loss": 5.3223, "mean_token_accuracy": 0.17773931920528413, "num_tokens": 14364434.0, "step": 8275 }, { "entropy": 5.5526612281799315, "epoch": 0.6442326395642871, "grad_norm": 1.0625, "learning_rate": 0.0004963919299873931, "loss": 5.2716, "mean_token_accuracy": 0.1842452198266983, "num_tokens": 14372454.0, "step": 8280 }, { "entropy": 5.5602387428283695, "epoch": 0.6446216689360047, "grad_norm": 1.0703125, "learning_rate": 0.0004963869847772653, "loss": 5.2976, "mean_token_accuracy": 0.17011766284704208, "num_tokens": 14381381.0, "step": 8285 }, { "entropy": 5.568785667419434, "epoch": 0.6450106983077223, "grad_norm": 0.9765625, "learning_rate": 0.0004963820362079423, "loss": 5.4149, "mean_token_accuracy": 0.1749197095632553, "num_tokens": 14390853.0, "step": 8290 }, { "entropy": 5.490575122833252, "epoch": 0.6453997276794398, "grad_norm": 1.015625, "learning_rate": 0.0004963770842794994, "loss": 5.2639, "mean_token_accuracy": 0.1747490271925926, "num_tokens": 14399897.0, "step": 8295 }, { "entropy": 5.453225803375244, "epoch": 0.6457887570511573, "grad_norm": 1.09375, "learning_rate": 0.0004963721289920115, "loss": 5.3263, "mean_token_accuracy": 0.17744121253490447, "num_tokens": 14408192.0, "step": 8300 }, { "entropy": 5.520668792724609, "epoch": 0.6461777864228749, "grad_norm": 1.0390625, "learning_rate": 0.0004963671703455538, "loss": 5.2013, "mean_token_accuracy": 0.18415756821632384, "num_tokens": 14416004.0, "step": 8305 }, { "entropy": 5.512162542343139, "epoch": 0.6465668157945925, "grad_norm": 0.9296875, "learning_rate": 0.0004963622083402018, "loss": 5.2484, "mean_token_accuracy": 0.18060196787118912, "num_tokens": 14424573.0, "step": 8310 }, { "entropy": 5.499037742614746, "epoch": 0.6469558451663101, "grad_norm": 1.0078125, "learning_rate": 0.0004963572429760305, "loss": 5.2337, "mean_token_accuracy": 0.18085485100746154, "num_tokens": 14432756.0, "step": 8315 }, { "entropy": 5.549262046813965, "epoch": 0.6473448745380276, "grad_norm": 0.953125, "learning_rate": 0.0004963522742531155, "loss": 5.3451, "mean_token_accuracy": 0.17796827256679534, "num_tokens": 14441695.0, "step": 8320 }, { "entropy": 5.558630752563476, "epoch": 0.6477339039097452, "grad_norm": 1.0390625, "learning_rate": 0.000496347302171532, "loss": 5.4259, "mean_token_accuracy": 0.16698963791131974, "num_tokens": 14451233.0, "step": 8325 }, { "entropy": 5.5909501075744625, "epoch": 0.6481229332814628, "grad_norm": 0.9921875, "learning_rate": 0.0004963423267313554, "loss": 5.3159, "mean_token_accuracy": 0.18219439536333085, "num_tokens": 14459757.0, "step": 8330 }, { "entropy": 5.5602059841156, "epoch": 0.6485119626531803, "grad_norm": 0.9609375, "learning_rate": 0.0004963373479326614, "loss": 5.3955, "mean_token_accuracy": 0.16742493957281113, "num_tokens": 14468308.0, "step": 8335 }, { "entropy": 5.5632768154144285, "epoch": 0.6489009920248979, "grad_norm": 1.0390625, "learning_rate": 0.0004963323657755255, "loss": 5.3278, "mean_token_accuracy": 0.1786695510149002, "num_tokens": 14476654.0, "step": 8340 }, { "entropy": 5.579058504104614, "epoch": 0.6492900213966154, "grad_norm": 0.96484375, "learning_rate": 0.0004963273802600231, "loss": 5.4136, "mean_token_accuracy": 0.17204165756702422, "num_tokens": 14484960.0, "step": 8345 }, { "entropy": 5.612658357620239, "epoch": 0.649679050768333, "grad_norm": 0.98046875, "learning_rate": 0.00049632239138623, "loss": 5.4224, "mean_token_accuracy": 0.16789598613977433, "num_tokens": 14493708.0, "step": 8350 }, { "entropy": 5.5998412609100345, "epoch": 0.6500680801400506, "grad_norm": 1.0078125, "learning_rate": 0.0004963173991542219, "loss": 5.3501, "mean_token_accuracy": 0.17749527394771575, "num_tokens": 14502123.0, "step": 8355 }, { "entropy": 5.550256538391113, "epoch": 0.6504571095117682, "grad_norm": 1.0, "learning_rate": 0.0004963124035640746, "loss": 5.3123, "mean_token_accuracy": 0.17911548614501954, "num_tokens": 14510782.0, "step": 8360 }, { "entropy": 5.512436199188232, "epoch": 0.6508461388834857, "grad_norm": 1.0, "learning_rate": 0.0004963074046158637, "loss": 5.2825, "mean_token_accuracy": 0.1757767990231514, "num_tokens": 14518560.0, "step": 8365 }, { "entropy": 5.531787014007568, "epoch": 0.6512351682552032, "grad_norm": 1.0078125, "learning_rate": 0.0004963024023096652, "loss": 5.3027, "mean_token_accuracy": 0.17374814599752425, "num_tokens": 14527541.0, "step": 8370 }, { "entropy": 5.5976728916168215, "epoch": 0.6516241976269208, "grad_norm": 1.0859375, "learning_rate": 0.0004962973966455551, "loss": 5.348, "mean_token_accuracy": 0.17509477883577346, "num_tokens": 14535590.0, "step": 8375 }, { "entropy": 5.476154756546021, "epoch": 0.6520132269986384, "grad_norm": 0.94921875, "learning_rate": 0.0004962923876236092, "loss": 5.253, "mean_token_accuracy": 0.17687039226293563, "num_tokens": 14544929.0, "step": 8380 }, { "entropy": 5.563878536224365, "epoch": 0.652402256370356, "grad_norm": 1.0, "learning_rate": 0.0004962873752439035, "loss": 5.404, "mean_token_accuracy": 0.16912133991718292, "num_tokens": 14553883.0, "step": 8385 }, { "entropy": 5.659245729446411, "epoch": 0.6527912857420736, "grad_norm": 1.0234375, "learning_rate": 0.0004962823595065141, "loss": 5.4195, "mean_token_accuracy": 0.17115236818790436, "num_tokens": 14563085.0, "step": 8390 }, { "entropy": 5.588116455078125, "epoch": 0.653180315113791, "grad_norm": 1.0078125, "learning_rate": 0.0004962773404115172, "loss": 5.3074, "mean_token_accuracy": 0.17936158925294876, "num_tokens": 14571444.0, "step": 8395 }, { "entropy": 5.553016090393067, "epoch": 0.6535693444855086, "grad_norm": 0.99609375, "learning_rate": 0.0004962723179589886, "loss": 5.3778, "mean_token_accuracy": 0.17593079060316086, "num_tokens": 14580039.0, "step": 8400 }, { "entropy": 5.500946712493897, "epoch": 0.6539583738572262, "grad_norm": 1.109375, "learning_rate": 0.000496267292149005, "loss": 5.2457, "mean_token_accuracy": 0.18254178613424302, "num_tokens": 14588322.0, "step": 8405 }, { "entropy": 5.523363733291626, "epoch": 0.6543474032289438, "grad_norm": 1.0078125, "learning_rate": 0.0004962622629816423, "loss": 5.1999, "mean_token_accuracy": 0.17971063405275345, "num_tokens": 14597503.0, "step": 8410 }, { "entropy": 5.52080512046814, "epoch": 0.6547364326006614, "grad_norm": 1.0078125, "learning_rate": 0.000496257230456977, "loss": 5.3495, "mean_token_accuracy": 0.17432264387607574, "num_tokens": 14605804.0, "step": 8415 }, { "entropy": 5.463500213623047, "epoch": 0.6551254619723789, "grad_norm": 1.0625, "learning_rate": 0.0004962521945750855, "loss": 5.2718, "mean_token_accuracy": 0.18290295153856279, "num_tokens": 14614064.0, "step": 8420 }, { "entropy": 5.588813638687133, "epoch": 0.6555144913440965, "grad_norm": 0.9609375, "learning_rate": 0.000496247155336044, "loss": 5.2376, "mean_token_accuracy": 0.18156853467226028, "num_tokens": 14622231.0, "step": 8425 }, { "entropy": 5.510600423812866, "epoch": 0.655903520715814, "grad_norm": 0.98046875, "learning_rate": 0.0004962421127399291, "loss": 5.3873, "mean_token_accuracy": 0.16851122230291365, "num_tokens": 14631244.0, "step": 8430 }, { "entropy": 5.503878927230835, "epoch": 0.6562925500875316, "grad_norm": 1.015625, "learning_rate": 0.0004962370667868172, "loss": 5.256, "mean_token_accuracy": 0.1792042672634125, "num_tokens": 14639575.0, "step": 8435 }, { "entropy": 5.566562652587891, "epoch": 0.6566815794592492, "grad_norm": 0.921875, "learning_rate": 0.0004962320174767851, "loss": 5.2884, "mean_token_accuracy": 0.17337799668312073, "num_tokens": 14648810.0, "step": 8440 }, { "entropy": 5.509990787506103, "epoch": 0.6570706088309667, "grad_norm": 0.984375, "learning_rate": 0.000496226964809909, "loss": 5.1666, "mean_token_accuracy": 0.18983751237392427, "num_tokens": 14657783.0, "step": 8445 }, { "entropy": 5.593655776977539, "epoch": 0.6574596382026843, "grad_norm": 0.99609375, "learning_rate": 0.000496221908786266, "loss": 5.3315, "mean_token_accuracy": 0.17472710758447646, "num_tokens": 14666872.0, "step": 8450 }, { "entropy": 5.595771074295044, "epoch": 0.6578486675744019, "grad_norm": 1.0078125, "learning_rate": 0.0004962168494059327, "loss": 5.4513, "mean_token_accuracy": 0.16527667492628098, "num_tokens": 14675762.0, "step": 8455 }, { "entropy": 5.448116970062256, "epoch": 0.6582376969461194, "grad_norm": 1.0703125, "learning_rate": 0.0004962117866689857, "loss": 5.133, "mean_token_accuracy": 0.1847481444478035, "num_tokens": 14683928.0, "step": 8460 }, { "entropy": 5.540603256225586, "epoch": 0.658626726317837, "grad_norm": 1.046875, "learning_rate": 0.000496206720575502, "loss": 5.3945, "mean_token_accuracy": 0.17297343015670777, "num_tokens": 14692411.0, "step": 8465 }, { "entropy": 5.592125988006591, "epoch": 0.6590157556895546, "grad_norm": 1.015625, "learning_rate": 0.0004962016511255584, "loss": 5.3705, "mean_token_accuracy": 0.1685567617416382, "num_tokens": 14701002.0, "step": 8470 }, { "entropy": 5.671099615097046, "epoch": 0.6594047850612721, "grad_norm": 0.94921875, "learning_rate": 0.0004961965783192318, "loss": 5.4177, "mean_token_accuracy": 0.1662750080227852, "num_tokens": 14710172.0, "step": 8475 }, { "entropy": 5.517791700363159, "epoch": 0.6597938144329897, "grad_norm": 0.92578125, "learning_rate": 0.0004961915021565992, "loss": 5.3595, "mean_token_accuracy": 0.17266275286674498, "num_tokens": 14719446.0, "step": 8480 }, { "entropy": 5.595436716079712, "epoch": 0.6601828438047073, "grad_norm": 1.0, "learning_rate": 0.0004961864226377377, "loss": 5.3738, "mean_token_accuracy": 0.17359744310379027, "num_tokens": 14728193.0, "step": 8485 }, { "entropy": 5.546868181228637, "epoch": 0.6605718731764249, "grad_norm": 0.94140625, "learning_rate": 0.0004961813397627241, "loss": 5.2599, "mean_token_accuracy": 0.17169299572706223, "num_tokens": 14736930.0, "step": 8490 }, { "entropy": 5.4918945789337155, "epoch": 0.6609609025481424, "grad_norm": 1.0546875, "learning_rate": 0.0004961762535316358, "loss": 5.2496, "mean_token_accuracy": 0.18160826116800308, "num_tokens": 14745995.0, "step": 8495 }, { "entropy": 5.4691368579864506, "epoch": 0.6613499319198599, "grad_norm": 0.97265625, "learning_rate": 0.0004961711639445499, "loss": 5.2952, "mean_token_accuracy": 0.17320575267076493, "num_tokens": 14754827.0, "step": 8500 }, { "entropy": 5.603746223449707, "epoch": 0.6617389612915775, "grad_norm": 1.0234375, "learning_rate": 0.0004961660710015435, "loss": 5.3747, "mean_token_accuracy": 0.17718212753534318, "num_tokens": 14763594.0, "step": 8505 }, { "entropy": 5.521847248077393, "epoch": 0.6621279906632951, "grad_norm": 1.0390625, "learning_rate": 0.0004961609747026943, "loss": 5.2335, "mean_token_accuracy": 0.18108374178409575, "num_tokens": 14772366.0, "step": 8510 }, { "entropy": 5.51108684539795, "epoch": 0.6625170200350127, "grad_norm": 1.0078125, "learning_rate": 0.0004961558750480791, "loss": 5.2925, "mean_token_accuracy": 0.17101393193006514, "num_tokens": 14780738.0, "step": 8515 }, { "entropy": 5.527933740615845, "epoch": 0.6629060494067303, "grad_norm": 0.9765625, "learning_rate": 0.0004961507720377756, "loss": 5.2746, "mean_token_accuracy": 0.17420910894870759, "num_tokens": 14788982.0, "step": 8520 }, { "entropy": 5.509754276275634, "epoch": 0.6632950787784477, "grad_norm": 0.9765625, "learning_rate": 0.0004961456656718611, "loss": 5.2597, "mean_token_accuracy": 0.17864897847175598, "num_tokens": 14797832.0, "step": 8525 }, { "entropy": 5.562294769287109, "epoch": 0.6636841081501653, "grad_norm": 1.0390625, "learning_rate": 0.000496140555950413, "loss": 5.3054, "mean_token_accuracy": 0.1824327751994133, "num_tokens": 14806391.0, "step": 8530 }, { "entropy": 5.596878576278686, "epoch": 0.6640731375218829, "grad_norm": 0.9921875, "learning_rate": 0.0004961354428735091, "loss": 5.3604, "mean_token_accuracy": 0.16339747458696366, "num_tokens": 14814920.0, "step": 8535 }, { "entropy": 5.483077955245972, "epoch": 0.6644621668936005, "grad_norm": 0.99609375, "learning_rate": 0.0004961303264412267, "loss": 5.2659, "mean_token_accuracy": 0.17483403384685517, "num_tokens": 14823541.0, "step": 8540 }, { "entropy": 5.485353469848633, "epoch": 0.6648511962653181, "grad_norm": 1.0078125, "learning_rate": 0.0004961252066536437, "loss": 5.2231, "mean_token_accuracy": 0.17759352028369904, "num_tokens": 14832128.0, "step": 8545 }, { "entropy": 5.594770002365112, "epoch": 0.6652402256370356, "grad_norm": 0.9375, "learning_rate": 0.0004961200835108375, "loss": 5.3926, "mean_token_accuracy": 0.1671188235282898, "num_tokens": 14841434.0, "step": 8550 }, { "entropy": 5.5455159664154055, "epoch": 0.6656292550087531, "grad_norm": 0.97265625, "learning_rate": 0.000496114957012886, "loss": 5.3133, "mean_token_accuracy": 0.18089810609817505, "num_tokens": 14850255.0, "step": 8555 }, { "entropy": 5.553866386413574, "epoch": 0.6660182843804707, "grad_norm": 1.03125, "learning_rate": 0.0004961098271598671, "loss": 5.3957, "mean_token_accuracy": 0.16937230229377748, "num_tokens": 14858924.0, "step": 8560 }, { "entropy": 5.54730191230774, "epoch": 0.6664073137521883, "grad_norm": 0.9375, "learning_rate": 0.0004961046939518585, "loss": 5.3292, "mean_token_accuracy": 0.18246510177850722, "num_tokens": 14867426.0, "step": 8565 }, { "entropy": 5.577759504318237, "epoch": 0.6667963431239059, "grad_norm": 0.96875, "learning_rate": 0.0004960995573889379, "loss": 5.292, "mean_token_accuracy": 0.1781075567007065, "num_tokens": 14876218.0, "step": 8570 }, { "entropy": 5.5795670509338375, "epoch": 0.6671853724956234, "grad_norm": 1.03125, "learning_rate": 0.0004960944174711836, "loss": 5.3377, "mean_token_accuracy": 0.17741371542215348, "num_tokens": 14883995.0, "step": 8575 }, { "entropy": 5.505077743530274, "epoch": 0.667574401867341, "grad_norm": 0.9765625, "learning_rate": 0.0004960892741986734, "loss": 5.3185, "mean_token_accuracy": 0.1728876546025276, "num_tokens": 14892659.0, "step": 8580 }, { "entropy": 5.584348344802857, "epoch": 0.6679634312390585, "grad_norm": 0.984375, "learning_rate": 0.0004960841275714853, "loss": 5.3382, "mean_token_accuracy": 0.17747102230787276, "num_tokens": 14901518.0, "step": 8585 }, { "entropy": 5.531873655319214, "epoch": 0.6683524606107761, "grad_norm": 1.109375, "learning_rate": 0.0004960789775896975, "loss": 5.3395, "mean_token_accuracy": 0.17710606306791304, "num_tokens": 14910171.0, "step": 8590 }, { "entropy": 5.5486828804016115, "epoch": 0.6687414899824937, "grad_norm": 0.96875, "learning_rate": 0.0004960738242533881, "loss": 5.308, "mean_token_accuracy": 0.1752072498202324, "num_tokens": 14918651.0, "step": 8595 }, { "entropy": 5.5240250587463375, "epoch": 0.6691305193542112, "grad_norm": 0.9609375, "learning_rate": 0.0004960686675626353, "loss": 5.3205, "mean_token_accuracy": 0.17117445319890975, "num_tokens": 14926951.0, "step": 8600 }, { "entropy": 5.619543409347534, "epoch": 0.6695195487259288, "grad_norm": 1.03125, "learning_rate": 0.0004960635075175173, "loss": 5.3976, "mean_token_accuracy": 0.17587391138076783, "num_tokens": 14935528.0, "step": 8605 }, { "entropy": 5.520017957687378, "epoch": 0.6699085780976464, "grad_norm": 0.984375, "learning_rate": 0.0004960583441181124, "loss": 5.2619, "mean_token_accuracy": 0.1809105709195137, "num_tokens": 14944117.0, "step": 8610 }, { "entropy": 5.459053230285645, "epoch": 0.670297607469364, "grad_norm": 0.97265625, "learning_rate": 0.0004960531773644992, "loss": 5.257, "mean_token_accuracy": 0.1793681263923645, "num_tokens": 14952957.0, "step": 8615 }, { "entropy": 5.569118595123291, "epoch": 0.6706866368410815, "grad_norm": 1.0390625, "learning_rate": 0.0004960480072567557, "loss": 5.3189, "mean_token_accuracy": 0.17345411628484725, "num_tokens": 14960942.0, "step": 8620 }, { "entropy": 5.63232274055481, "epoch": 0.671075666212799, "grad_norm": 1.0078125, "learning_rate": 0.0004960428337949604, "loss": 5.4004, "mean_token_accuracy": 0.1642669513821602, "num_tokens": 14970579.0, "step": 8625 }, { "entropy": 5.5049628734588625, "epoch": 0.6714646955845166, "grad_norm": 0.98828125, "learning_rate": 0.0004960376569791921, "loss": 5.2457, "mean_token_accuracy": 0.17151737213134766, "num_tokens": 14979353.0, "step": 8630 }, { "entropy": 5.567949438095093, "epoch": 0.6718537249562342, "grad_norm": 0.96875, "learning_rate": 0.0004960324768095291, "loss": 5.405, "mean_token_accuracy": 0.17750758975744246, "num_tokens": 14988435.0, "step": 8635 }, { "entropy": 5.545330810546875, "epoch": 0.6722427543279518, "grad_norm": 0.98828125, "learning_rate": 0.0004960272932860502, "loss": 5.3398, "mean_token_accuracy": 0.17330410927534104, "num_tokens": 14996834.0, "step": 8640 }, { "entropy": 5.602503395080566, "epoch": 0.6726317836996694, "grad_norm": 1.015625, "learning_rate": 0.0004960221064088338, "loss": 5.3997, "mean_token_accuracy": 0.16623642891645432, "num_tokens": 15004988.0, "step": 8645 }, { "entropy": 5.639882373809814, "epoch": 0.6730208130713868, "grad_norm": 1.015625, "learning_rate": 0.0004960169161779588, "loss": 5.3537, "mean_token_accuracy": 0.1753695547580719, "num_tokens": 15013482.0, "step": 8650 }, { "entropy": 5.50812177658081, "epoch": 0.6734098424431044, "grad_norm": 1.0234375, "learning_rate": 0.0004960117225935038, "loss": 5.247, "mean_token_accuracy": 0.1809387370944023, "num_tokens": 15021506.0, "step": 8655 }, { "entropy": 5.535484075546265, "epoch": 0.673798871814822, "grad_norm": 1.0546875, "learning_rate": 0.0004960065256555477, "loss": 5.2922, "mean_token_accuracy": 0.18493780940771104, "num_tokens": 15029880.0, "step": 8660 }, { "entropy": 5.559035062789917, "epoch": 0.6741879011865396, "grad_norm": 1.0390625, "learning_rate": 0.0004960013253641695, "loss": 5.2885, "mean_token_accuracy": 0.17430729120969773, "num_tokens": 15038080.0, "step": 8665 }, { "entropy": 5.518800449371338, "epoch": 0.6745769305582572, "grad_norm": 0.9921875, "learning_rate": 0.0004959961217194477, "loss": 5.2892, "mean_token_accuracy": 0.17517595440149308, "num_tokens": 15046779.0, "step": 8670 }, { "entropy": 5.568234300613403, "epoch": 0.6749659599299748, "grad_norm": 1.015625, "learning_rate": 0.0004959909147214615, "loss": 5.337, "mean_token_accuracy": 0.17943629771471023, "num_tokens": 15055557.0, "step": 8675 }, { "entropy": 5.48413667678833, "epoch": 0.6753549893016922, "grad_norm": 1.0390625, "learning_rate": 0.0004959857043702902, "loss": 5.2086, "mean_token_accuracy": 0.17961402237415314, "num_tokens": 15063054.0, "step": 8680 }, { "entropy": 5.502670526504517, "epoch": 0.6757440186734098, "grad_norm": 0.98828125, "learning_rate": 0.0004959804906660124, "loss": 5.2785, "mean_token_accuracy": 0.17986547499895095, "num_tokens": 15071510.0, "step": 8685 }, { "entropy": 5.542787551879883, "epoch": 0.6761330480451274, "grad_norm": 0.9296875, "learning_rate": 0.0004959752736087073, "loss": 5.3122, "mean_token_accuracy": 0.1700499027967453, "num_tokens": 15080524.0, "step": 8690 }, { "entropy": 5.607877206802368, "epoch": 0.676522077416845, "grad_norm": 1.015625, "learning_rate": 0.0004959700531984543, "loss": 5.3168, "mean_token_accuracy": 0.1740160934627056, "num_tokens": 15089689.0, "step": 8695 }, { "entropy": 5.487575197219849, "epoch": 0.6769111067885626, "grad_norm": 1.078125, "learning_rate": 0.0004959648294353324, "loss": 5.2247, "mean_token_accuracy": 0.1853421375155449, "num_tokens": 15097970.0, "step": 8700 }, { "entropy": 5.441216850280762, "epoch": 0.6773001361602801, "grad_norm": 0.9609375, "learning_rate": 0.0004959596023194208, "loss": 5.3334, "mean_token_accuracy": 0.1727800875902176, "num_tokens": 15107786.0, "step": 8705 }, { "entropy": 5.591910362243652, "epoch": 0.6776891655319977, "grad_norm": 1.0703125, "learning_rate": 0.000495954371850799, "loss": 5.3136, "mean_token_accuracy": 0.18085016310214996, "num_tokens": 15116370.0, "step": 8710 }, { "entropy": 5.594224548339843, "epoch": 0.6780781949037152, "grad_norm": 1.03125, "learning_rate": 0.0004959491380295463, "loss": 5.3268, "mean_token_accuracy": 0.18062747716903688, "num_tokens": 15124961.0, "step": 8715 }, { "entropy": 5.518509817123413, "epoch": 0.6784672242754328, "grad_norm": 1.0078125, "learning_rate": 0.0004959439008557422, "loss": 5.3468, "mean_token_accuracy": 0.17300035208463668, "num_tokens": 15134230.0, "step": 8720 }, { "entropy": 5.499504804611206, "epoch": 0.6788562536471504, "grad_norm": 0.9609375, "learning_rate": 0.000495938660329466, "loss": 5.2992, "mean_token_accuracy": 0.1677725285291672, "num_tokens": 15143585.0, "step": 8725 }, { "entropy": 5.507964181900024, "epoch": 0.6792452830188679, "grad_norm": 1.03125, "learning_rate": 0.0004959334164507973, "loss": 5.2214, "mean_token_accuracy": 0.17320179641246797, "num_tokens": 15151834.0, "step": 8730 }, { "entropy": 5.4454319953918455, "epoch": 0.6796343123905855, "grad_norm": 0.9921875, "learning_rate": 0.0004959281692198155, "loss": 5.2803, "mean_token_accuracy": 0.1738256573677063, "num_tokens": 15160630.0, "step": 8735 }, { "entropy": 5.520221948623657, "epoch": 0.6800233417623031, "grad_norm": 1.0390625, "learning_rate": 0.0004959229186366007, "loss": 5.2522, "mean_token_accuracy": 0.17985440343618392, "num_tokens": 15168999.0, "step": 8740 }, { "entropy": 5.540848445892334, "epoch": 0.6804123711340206, "grad_norm": 0.99609375, "learning_rate": 0.000495917664701232, "loss": 5.3172, "mean_token_accuracy": 0.183924201130867, "num_tokens": 15177507.0, "step": 8745 }, { "entropy": 5.557046175003052, "epoch": 0.6808014005057382, "grad_norm": 0.96484375, "learning_rate": 0.0004959124074137894, "loss": 5.351, "mean_token_accuracy": 0.17694756388664246, "num_tokens": 15186843.0, "step": 8750 }, { "entropy": 5.5509168148040775, "epoch": 0.6811904298774557, "grad_norm": 1.046875, "learning_rate": 0.0004959071467743526, "loss": 5.2478, "mean_token_accuracy": 0.17606399208307266, "num_tokens": 15195081.0, "step": 8755 }, { "entropy": 5.524669981002807, "epoch": 0.6815794592491733, "grad_norm": 1.0390625, "learning_rate": 0.0004959018827830016, "loss": 5.3351, "mean_token_accuracy": 0.17936050295829772, "num_tokens": 15203538.0, "step": 8760 }, { "entropy": 5.5752159595489506, "epoch": 0.6819684886208909, "grad_norm": 0.984375, "learning_rate": 0.000495896615439816, "loss": 5.3787, "mean_token_accuracy": 0.1792698934674263, "num_tokens": 15211845.0, "step": 8765 }, { "entropy": 5.591052055358887, "epoch": 0.6823575179926085, "grad_norm": 1.015625, "learning_rate": 0.0004958913447448759, "loss": 5.3635, "mean_token_accuracy": 0.17803119570016862, "num_tokens": 15220128.0, "step": 8770 }, { "entropy": 5.608082675933838, "epoch": 0.682746547364326, "grad_norm": 1.0390625, "learning_rate": 0.0004958860706982613, "loss": 5.3618, "mean_token_accuracy": 0.16932262927293779, "num_tokens": 15228741.0, "step": 8775 }, { "entropy": 5.598611497879029, "epoch": 0.6831355767360435, "grad_norm": 0.95703125, "learning_rate": 0.000495880793300052, "loss": 5.3462, "mean_token_accuracy": 0.17118286341428757, "num_tokens": 15237674.0, "step": 8780 }, { "entropy": 5.52156925201416, "epoch": 0.6835246061077611, "grad_norm": 1.015625, "learning_rate": 0.0004958755125503284, "loss": 5.2311, "mean_token_accuracy": 0.18240113258361818, "num_tokens": 15245727.0, "step": 8785 }, { "entropy": 5.550314807891846, "epoch": 0.6839136354794787, "grad_norm": 1.046875, "learning_rate": 0.0004958702284491703, "loss": 5.3179, "mean_token_accuracy": 0.1780737891793251, "num_tokens": 15254511.0, "step": 8790 }, { "entropy": 5.546845245361328, "epoch": 0.6843026648511963, "grad_norm": 0.95703125, "learning_rate": 0.0004958649409966581, "loss": 5.2919, "mean_token_accuracy": 0.17837184369564058, "num_tokens": 15263500.0, "step": 8795 }, { "entropy": 5.545669937133789, "epoch": 0.6846916942229139, "grad_norm": 1.0703125, "learning_rate": 0.000495859650192872, "loss": 5.3086, "mean_token_accuracy": 0.1774377703666687, "num_tokens": 15271960.0, "step": 8800 }, { "entropy": 5.6199394226074215, "epoch": 0.6850807235946313, "grad_norm": 0.9765625, "learning_rate": 0.0004958543560378922, "loss": 5.4966, "mean_token_accuracy": 0.16980356499552726, "num_tokens": 15280576.0, "step": 8805 }, { "entropy": 5.565087032318115, "epoch": 0.6854697529663489, "grad_norm": 0.984375, "learning_rate": 0.0004958490585317991, "loss": 5.3461, "mean_token_accuracy": 0.1771310806274414, "num_tokens": 15288674.0, "step": 8810 }, { "entropy": 5.511211299896241, "epoch": 0.6858587823380665, "grad_norm": 1.078125, "learning_rate": 0.000495843757674673, "loss": 5.2475, "mean_token_accuracy": 0.18000984638929368, "num_tokens": 15296881.0, "step": 8815 }, { "entropy": 5.55353012084961, "epoch": 0.6862478117097841, "grad_norm": 1.03125, "learning_rate": 0.0004958384534665945, "loss": 5.2968, "mean_token_accuracy": 0.17839326113462448, "num_tokens": 15305379.0, "step": 8820 }, { "entropy": 5.559647035598755, "epoch": 0.6866368410815017, "grad_norm": 0.99609375, "learning_rate": 0.0004958331459076438, "loss": 5.4009, "mean_token_accuracy": 0.16703998446464538, "num_tokens": 15314572.0, "step": 8825 }, { "entropy": 5.574540042877198, "epoch": 0.6870258704532192, "grad_norm": 0.96875, "learning_rate": 0.0004958278349979018, "loss": 5.3429, "mean_token_accuracy": 0.17731242924928664, "num_tokens": 15323407.0, "step": 8830 }, { "entropy": 5.544811725616455, "epoch": 0.6874148998249368, "grad_norm": 0.96484375, "learning_rate": 0.0004958225207374488, "loss": 5.2196, "mean_token_accuracy": 0.1778959110379219, "num_tokens": 15332208.0, "step": 8835 }, { "entropy": 5.5319067478179935, "epoch": 0.6878039291966543, "grad_norm": 0.9140625, "learning_rate": 0.0004958172031263655, "loss": 5.2812, "mean_token_accuracy": 0.17708641290664673, "num_tokens": 15340972.0, "step": 8840 }, { "entropy": 5.500188398361206, "epoch": 0.6881929585683719, "grad_norm": 1.0390625, "learning_rate": 0.0004958118821647326, "loss": 5.2694, "mean_token_accuracy": 0.18438747227191926, "num_tokens": 15349991.0, "step": 8845 }, { "entropy": 5.470579957962036, "epoch": 0.6885819879400895, "grad_norm": 0.9921875, "learning_rate": 0.0004958065578526308, "loss": 5.2117, "mean_token_accuracy": 0.18660242408514022, "num_tokens": 15358194.0, "step": 8850 }, { "entropy": 5.542716550827026, "epoch": 0.688971017311807, "grad_norm": 1.109375, "learning_rate": 0.000495801230190141, "loss": 5.2593, "mean_token_accuracy": 0.1774544671177864, "num_tokens": 15366954.0, "step": 8855 }, { "entropy": 5.596731233596802, "epoch": 0.6893600466835246, "grad_norm": 1.015625, "learning_rate": 0.0004957958991773441, "loss": 5.434, "mean_token_accuracy": 0.16547370553016663, "num_tokens": 15376107.0, "step": 8860 }, { "entropy": 5.5020819187164305, "epoch": 0.6897490760552422, "grad_norm": 1.0078125, "learning_rate": 0.0004957905648143206, "loss": 5.3085, "mean_token_accuracy": 0.17589894235134124, "num_tokens": 15384517.0, "step": 8865 }, { "entropy": 5.621572685241699, "epoch": 0.6901381054269597, "grad_norm": 0.984375, "learning_rate": 0.0004957852271011519, "loss": 5.4432, "mean_token_accuracy": 0.16793260276317595, "num_tokens": 15393544.0, "step": 8870 }, { "entropy": 5.5670552253723145, "epoch": 0.6905271347986773, "grad_norm": 1.0859375, "learning_rate": 0.0004957798860379187, "loss": 5.2793, "mean_token_accuracy": 0.18411802798509597, "num_tokens": 15402165.0, "step": 8875 }, { "entropy": 5.522901344299316, "epoch": 0.6909161641703949, "grad_norm": 0.953125, "learning_rate": 0.0004957745416247022, "loss": 5.3144, "mean_token_accuracy": 0.17747118771076204, "num_tokens": 15411430.0, "step": 8880 }, { "entropy": 5.521683645248413, "epoch": 0.6913051935421124, "grad_norm": 0.91015625, "learning_rate": 0.0004957691938615833, "loss": 5.2212, "mean_token_accuracy": 0.18478150218725203, "num_tokens": 15420346.0, "step": 8885 }, { "entropy": 5.412795972824097, "epoch": 0.69169422291383, "grad_norm": 1.015625, "learning_rate": 0.0004957638427486434, "loss": 5.149, "mean_token_accuracy": 0.18685436695814134, "num_tokens": 15428747.0, "step": 8890 }, { "entropy": 5.377884769439698, "epoch": 0.6920832522855476, "grad_norm": 0.99609375, "learning_rate": 0.0004957584882859636, "loss": 5.1656, "mean_token_accuracy": 0.1840224876999855, "num_tokens": 15437110.0, "step": 8895 }, { "entropy": 5.504245805740356, "epoch": 0.6924722816572652, "grad_norm": 0.95703125, "learning_rate": 0.0004957531304736251, "loss": 5.2781, "mean_token_accuracy": 0.18080461919307708, "num_tokens": 15446524.0, "step": 8900 }, { "entropy": 5.511700820922852, "epoch": 0.6928613110289827, "grad_norm": 0.9609375, "learning_rate": 0.0004957477693117091, "loss": 5.3415, "mean_token_accuracy": 0.17849988788366317, "num_tokens": 15455372.0, "step": 8905 }, { "entropy": 5.5279382228851315, "epoch": 0.6932503404007002, "grad_norm": 1.09375, "learning_rate": 0.0004957424048002971, "loss": 5.2232, "mean_token_accuracy": 0.18280621469020844, "num_tokens": 15463060.0, "step": 8910 }, { "entropy": 5.508080291748047, "epoch": 0.6936393697724178, "grad_norm": 0.984375, "learning_rate": 0.0004957370369394706, "loss": 5.3274, "mean_token_accuracy": 0.17816752791404725, "num_tokens": 15471836.0, "step": 8915 }, { "entropy": 5.565959835052491, "epoch": 0.6940283991441354, "grad_norm": 1.0546875, "learning_rate": 0.0004957316657293107, "loss": 5.3463, "mean_token_accuracy": 0.17683278918266296, "num_tokens": 15479819.0, "step": 8920 }, { "entropy": 5.505822563171387, "epoch": 0.694417428515853, "grad_norm": 1.0078125, "learning_rate": 0.0004957262911698992, "loss": 5.3252, "mean_token_accuracy": 0.179183466732502, "num_tokens": 15488562.0, "step": 8925 }, { "entropy": 5.582971382141113, "epoch": 0.6948064578875706, "grad_norm": 0.9375, "learning_rate": 0.0004957209132613175, "loss": 5.4246, "mean_token_accuracy": 0.16971031576395035, "num_tokens": 15497822.0, "step": 8930 }, { "entropy": 5.635368824005127, "epoch": 0.695195487259288, "grad_norm": 0.95703125, "learning_rate": 0.0004957155320036473, "loss": 5.3532, "mean_token_accuracy": 0.17011982649564744, "num_tokens": 15506913.0, "step": 8935 }, { "entropy": 5.5592663288116455, "epoch": 0.6955845166310056, "grad_norm": 0.9765625, "learning_rate": 0.0004957101473969702, "loss": 5.2749, "mean_token_accuracy": 0.18334557116031647, "num_tokens": 15516053.0, "step": 8940 }, { "entropy": 5.58067774772644, "epoch": 0.6959735460027232, "grad_norm": 1.015625, "learning_rate": 0.000495704759441368, "loss": 5.3418, "mean_token_accuracy": 0.17084783017635347, "num_tokens": 15524174.0, "step": 8945 }, { "entropy": 5.546346282958984, "epoch": 0.6963625753744408, "grad_norm": 1.0, "learning_rate": 0.0004956993681369221, "loss": 5.2667, "mean_token_accuracy": 0.17431297302246093, "num_tokens": 15533652.0, "step": 8950 }, { "entropy": 5.5338294506073, "epoch": 0.6967516047461584, "grad_norm": 1.0546875, "learning_rate": 0.0004956939734837148, "loss": 5.2856, "mean_token_accuracy": 0.17561358362436294, "num_tokens": 15541644.0, "step": 8955 }, { "entropy": 5.460758352279663, "epoch": 0.6971406341178759, "grad_norm": 0.9921875, "learning_rate": 0.0004956885754818277, "loss": 5.2503, "mean_token_accuracy": 0.1860172986984253, "num_tokens": 15550298.0, "step": 8960 }, { "entropy": 5.558289241790772, "epoch": 0.6975296634895934, "grad_norm": 1.0390625, "learning_rate": 0.0004956831741313427, "loss": 5.3379, "mean_token_accuracy": 0.17747644186019898, "num_tokens": 15559388.0, "step": 8965 }, { "entropy": 5.456370258331299, "epoch": 0.697918692861311, "grad_norm": 0.9765625, "learning_rate": 0.0004956777694323418, "loss": 5.1543, "mean_token_accuracy": 0.18406742215156555, "num_tokens": 15567543.0, "step": 8970 }, { "entropy": 5.4520467758178714, "epoch": 0.6983077222330286, "grad_norm": 1.078125, "learning_rate": 0.000495672361384907, "loss": 5.2753, "mean_token_accuracy": 0.18450121730566024, "num_tokens": 15575365.0, "step": 8975 }, { "entropy": 5.580052757263184, "epoch": 0.6986967516047462, "grad_norm": 0.97265625, "learning_rate": 0.0004956669499891202, "loss": 5.3321, "mean_token_accuracy": 0.17410836815834047, "num_tokens": 15584295.0, "step": 8980 }, { "entropy": 5.581956148147583, "epoch": 0.6990857809764637, "grad_norm": 1.0703125, "learning_rate": 0.0004956615352450639, "loss": 5.3022, "mean_token_accuracy": 0.18286948055028915, "num_tokens": 15592906.0, "step": 8985 }, { "entropy": 5.460730123519897, "epoch": 0.6994748103481813, "grad_norm": 0.97265625, "learning_rate": 0.0004956561171528198, "loss": 5.273, "mean_token_accuracy": 0.1732745885848999, "num_tokens": 15601938.0, "step": 8990 }, { "entropy": 5.49299988746643, "epoch": 0.6998638397198989, "grad_norm": 1.0625, "learning_rate": 0.0004956506957124704, "loss": 5.2807, "mean_token_accuracy": 0.18658637404441833, "num_tokens": 15610173.0, "step": 8995 }, { "entropy": 5.598473739624024, "epoch": 0.7002528690916164, "grad_norm": 1.109375, "learning_rate": 0.000495645270924098, "loss": 5.346, "mean_token_accuracy": 0.17390502244234085, "num_tokens": 15618896.0, "step": 9000 }, { "epoch": 0.7002528690916164, "eval_entropy": 5.348033551554822, "eval_loss": 5.3284687995910645, "eval_mean_token_accuracy": 0.18513546253593066, "eval_num_tokens": 15618896.0, "eval_runtime": 21.6374, "eval_samples_per_second": 1920.659, "eval_steps_per_second": 240.094, "step": 9000 }, { "entropy": 5.517891693115234, "epoch": 0.700641898463334, "grad_norm": 0.91796875, "learning_rate": 0.0004956398427877847, "loss": 5.2524, "mean_token_accuracy": 0.18123764991760255, "num_tokens": 15627890.0, "step": 9005 }, { "entropy": 5.47597222328186, "epoch": 0.7010309278350515, "grad_norm": 1.046875, "learning_rate": 0.000495634411303613, "loss": 5.209, "mean_token_accuracy": 0.1825994521379471, "num_tokens": 15636290.0, "step": 9010 }, { "entropy": 5.491678524017334, "epoch": 0.7014199572067691, "grad_norm": 1.03125, "learning_rate": 0.0004956289764716654, "loss": 5.2598, "mean_token_accuracy": 0.17539379447698594, "num_tokens": 15644777.0, "step": 9015 }, { "entropy": 5.513961458206177, "epoch": 0.7018089865784867, "grad_norm": 1.0625, "learning_rate": 0.0004956235382920241, "loss": 5.2825, "mean_token_accuracy": 0.17722438424825668, "num_tokens": 15653333.0, "step": 9020 }, { "entropy": 5.544711112976074, "epoch": 0.7021980159502043, "grad_norm": 1.0390625, "learning_rate": 0.0004956180967647717, "loss": 5.2834, "mean_token_accuracy": 0.17919322848320007, "num_tokens": 15662140.0, "step": 9025 }, { "entropy": 5.580780172348023, "epoch": 0.7025870453219218, "grad_norm": 1.03125, "learning_rate": 0.0004956126518899911, "loss": 5.388, "mean_token_accuracy": 0.17892482578754426, "num_tokens": 15671387.0, "step": 9030 }, { "entropy": 5.544080972671509, "epoch": 0.7029760746936393, "grad_norm": 1.0078125, "learning_rate": 0.0004956072036677644, "loss": 5.322, "mean_token_accuracy": 0.17491545230150224, "num_tokens": 15680884.0, "step": 9035 }, { "entropy": 5.570721864700317, "epoch": 0.7033651040653569, "grad_norm": 1.0234375, "learning_rate": 0.0004956017520981746, "loss": 5.2571, "mean_token_accuracy": 0.17884034812450408, "num_tokens": 15690030.0, "step": 9040 }, { "entropy": 5.538801050186157, "epoch": 0.7037541334370745, "grad_norm": 1.0390625, "learning_rate": 0.0004955962971813044, "loss": 5.3178, "mean_token_accuracy": 0.18039476722478867, "num_tokens": 15698260.0, "step": 9045 }, { "entropy": 5.47697606086731, "epoch": 0.7041431628087921, "grad_norm": 0.96875, "learning_rate": 0.0004955908389172364, "loss": 5.1871, "mean_token_accuracy": 0.18502038717269897, "num_tokens": 15706275.0, "step": 9050 }, { "entropy": 5.590987825393677, "epoch": 0.7045321921805097, "grad_norm": 1.1328125, "learning_rate": 0.0004955853773060536, "loss": 5.4136, "mean_token_accuracy": 0.17518984526395798, "num_tokens": 15715086.0, "step": 9055 }, { "entropy": 5.4845037937164305, "epoch": 0.7049212215522271, "grad_norm": 1.046875, "learning_rate": 0.0004955799123478388, "loss": 5.2109, "mean_token_accuracy": 0.18587605208158492, "num_tokens": 15723931.0, "step": 9060 }, { "entropy": 5.480537462234497, "epoch": 0.7053102509239447, "grad_norm": 1.0078125, "learning_rate": 0.0004955744440426748, "loss": 5.3819, "mean_token_accuracy": 0.17715157568454742, "num_tokens": 15732905.0, "step": 9065 }, { "entropy": 5.535316371917725, "epoch": 0.7056992802956623, "grad_norm": 1.0859375, "learning_rate": 0.0004955689723906448, "loss": 5.257, "mean_token_accuracy": 0.1767064228653908, "num_tokens": 15742355.0, "step": 9070 }, { "entropy": 5.642075634002685, "epoch": 0.7060883096673799, "grad_norm": 1.0703125, "learning_rate": 0.0004955634973918318, "loss": 5.3439, "mean_token_accuracy": 0.17580762803554534, "num_tokens": 15750924.0, "step": 9075 }, { "entropy": 5.50844292640686, "epoch": 0.7064773390390975, "grad_norm": 1.015625, "learning_rate": 0.0004955580190463186, "loss": 5.2806, "mean_token_accuracy": 0.1791955679655075, "num_tokens": 15759677.0, "step": 9080 }, { "entropy": 5.501758289337158, "epoch": 0.7068663684108151, "grad_norm": 0.95703125, "learning_rate": 0.0004955525373541886, "loss": 5.2812, "mean_token_accuracy": 0.17623534053564072, "num_tokens": 15767875.0, "step": 9085 }, { "entropy": 5.468333435058594, "epoch": 0.7072553977825325, "grad_norm": 1.015625, "learning_rate": 0.0004955470523155249, "loss": 5.2428, "mean_token_accuracy": 0.18071518391370772, "num_tokens": 15776194.0, "step": 9090 }, { "entropy": 5.520056581497192, "epoch": 0.7076444271542501, "grad_norm": 1.03125, "learning_rate": 0.0004955415639304107, "loss": 5.3154, "mean_token_accuracy": 0.18185944259166717, "num_tokens": 15784774.0, "step": 9095 }, { "entropy": 5.521764802932739, "epoch": 0.7080334565259677, "grad_norm": 0.98046875, "learning_rate": 0.0004955360721989292, "loss": 5.1992, "mean_token_accuracy": 0.1858694463968277, "num_tokens": 15793121.0, "step": 9100 }, { "entropy": 5.6644776344299315, "epoch": 0.7084224858976853, "grad_norm": 1.015625, "learning_rate": 0.0004955305771211641, "loss": 5.4315, "mean_token_accuracy": 0.17150478065013885, "num_tokens": 15801518.0, "step": 9105 }, { "entropy": 5.479685211181641, "epoch": 0.7088115152694029, "grad_norm": 1.015625, "learning_rate": 0.0004955250786971982, "loss": 5.1949, "mean_token_accuracy": 0.18663026243448258, "num_tokens": 15809602.0, "step": 9110 }, { "entropy": 5.497847843170166, "epoch": 0.7092005446411204, "grad_norm": 1.03125, "learning_rate": 0.0004955195769271154, "loss": 5.3799, "mean_token_accuracy": 0.1702029213309288, "num_tokens": 15818529.0, "step": 9115 }, { "entropy": 5.619048118591309, "epoch": 0.709589574012838, "grad_norm": 1.03125, "learning_rate": 0.0004955140718109991, "loss": 5.2423, "mean_token_accuracy": 0.1867795467376709, "num_tokens": 15827176.0, "step": 9120 }, { "entropy": 5.580541658401489, "epoch": 0.7099786033845555, "grad_norm": 0.89453125, "learning_rate": 0.0004955085633489326, "loss": 5.3276, "mean_token_accuracy": 0.17235393524169923, "num_tokens": 15837095.0, "step": 9125 }, { "entropy": 5.509768533706665, "epoch": 0.7103676327562731, "grad_norm": 1.0703125, "learning_rate": 0.0004955030515409997, "loss": 5.2971, "mean_token_accuracy": 0.17852296084165573, "num_tokens": 15845285.0, "step": 9130 }, { "entropy": 5.501449394226074, "epoch": 0.7107566621279907, "grad_norm": 0.9453125, "learning_rate": 0.0004954975363872838, "loss": 5.306, "mean_token_accuracy": 0.18520895391702652, "num_tokens": 15853468.0, "step": 9135 }, { "entropy": 5.535063076019287, "epoch": 0.7111456914997082, "grad_norm": 0.95703125, "learning_rate": 0.0004954920178878689, "loss": 5.2492, "mean_token_accuracy": 0.1859077885746956, "num_tokens": 15861699.0, "step": 9140 }, { "entropy": 5.557364654541016, "epoch": 0.7115347208714258, "grad_norm": 1.0859375, "learning_rate": 0.0004954864960428385, "loss": 5.3332, "mean_token_accuracy": 0.17330342680215835, "num_tokens": 15870401.0, "step": 9145 }, { "entropy": 5.529131269454956, "epoch": 0.7119237502431434, "grad_norm": 1.0703125, "learning_rate": 0.0004954809708522765, "loss": 5.1489, "mean_token_accuracy": 0.19361813813447953, "num_tokens": 15878214.0, "step": 9150 }, { "entropy": 5.510874557495117, "epoch": 0.712312779614861, "grad_norm": 1.1171875, "learning_rate": 0.0004954754423162667, "loss": 5.3293, "mean_token_accuracy": 0.17443989217281342, "num_tokens": 15886581.0, "step": 9155 }, { "entropy": 5.584592819213867, "epoch": 0.7127018089865785, "grad_norm": 0.87890625, "learning_rate": 0.000495469910434893, "loss": 5.428, "mean_token_accuracy": 0.17205232679843901, "num_tokens": 15895748.0, "step": 9160 }, { "entropy": 5.549006032943725, "epoch": 0.713090838358296, "grad_norm": 0.99609375, "learning_rate": 0.0004954643752082392, "loss": 5.2916, "mean_token_accuracy": 0.17630526274442673, "num_tokens": 15905030.0, "step": 9165 }, { "entropy": 5.489308786392212, "epoch": 0.7134798677300136, "grad_norm": 0.9921875, "learning_rate": 0.0004954588366363896, "loss": 5.2706, "mean_token_accuracy": 0.18086498379707336, "num_tokens": 15913430.0, "step": 9170 }, { "entropy": 5.5082498550415036, "epoch": 0.7138688971017312, "grad_norm": 0.9921875, "learning_rate": 0.0004954532947194279, "loss": 5.1751, "mean_token_accuracy": 0.1871516525745392, "num_tokens": 15921432.0, "step": 9175 }, { "entropy": 5.565517711639404, "epoch": 0.7142579264734488, "grad_norm": 1.078125, "learning_rate": 0.0004954477494574384, "loss": 5.2472, "mean_token_accuracy": 0.18114357441663742, "num_tokens": 15930159.0, "step": 9180 }, { "entropy": 5.515600490570068, "epoch": 0.7146469558451664, "grad_norm": 0.953125, "learning_rate": 0.0004954422008505052, "loss": 5.3327, "mean_token_accuracy": 0.17331963181495666, "num_tokens": 15939911.0, "step": 9185 }, { "entropy": 5.543717384338379, "epoch": 0.7150359852168838, "grad_norm": 1.015625, "learning_rate": 0.0004954366488987125, "loss": 5.2645, "mean_token_accuracy": 0.17984220385551453, "num_tokens": 15948586.0, "step": 9190 }, { "entropy": 5.394599199295044, "epoch": 0.7154250145886014, "grad_norm": 0.98828125, "learning_rate": 0.0004954310936021444, "loss": 5.1271, "mean_token_accuracy": 0.18241414427757263, "num_tokens": 15956818.0, "step": 9195 }, { "entropy": 5.484005260467529, "epoch": 0.715814043960319, "grad_norm": 0.98828125, "learning_rate": 0.0004954255349608853, "loss": 5.3395, "mean_token_accuracy": 0.1705792397260666, "num_tokens": 15966027.0, "step": 9200 }, { "entropy": 5.601967239379883, "epoch": 0.7162030733320366, "grad_norm": 0.9921875, "learning_rate": 0.0004954199729750198, "loss": 5.3803, "mean_token_accuracy": 0.17846307158470154, "num_tokens": 15975186.0, "step": 9205 }, { "entropy": 5.4993151187896725, "epoch": 0.7165921027037542, "grad_norm": 1.1015625, "learning_rate": 0.0004954144076446318, "loss": 5.2363, "mean_token_accuracy": 0.18187469094991685, "num_tokens": 15983924.0, "step": 9210 }, { "entropy": 5.5272565364837645, "epoch": 0.7169811320754716, "grad_norm": 1.046875, "learning_rate": 0.0004954088389698061, "loss": 5.2735, "mean_token_accuracy": 0.18263440281152726, "num_tokens": 15992906.0, "step": 9215 }, { "entropy": 5.528782939910888, "epoch": 0.7173701614471892, "grad_norm": 0.9609375, "learning_rate": 0.000495403266950627, "loss": 5.28, "mean_token_accuracy": 0.17572246491909027, "num_tokens": 16001378.0, "step": 9220 }, { "entropy": 5.471352815628052, "epoch": 0.7177591908189068, "grad_norm": 0.9375, "learning_rate": 0.0004953976915871792, "loss": 5.2913, "mean_token_accuracy": 0.17510679513216018, "num_tokens": 16010704.0, "step": 9225 }, { "entropy": 5.442917728424073, "epoch": 0.7181482201906244, "grad_norm": 1.0234375, "learning_rate": 0.0004953921128795472, "loss": 5.2724, "mean_token_accuracy": 0.1795994222164154, "num_tokens": 16018936.0, "step": 9230 }, { "entropy": 5.539661693572998, "epoch": 0.718537249562342, "grad_norm": 1.0546875, "learning_rate": 0.0004953865308278156, "loss": 5.1679, "mean_token_accuracy": 0.18113896995782852, "num_tokens": 16027295.0, "step": 9235 }, { "entropy": 5.495933103561401, "epoch": 0.7189262789340595, "grad_norm": 0.9453125, "learning_rate": 0.0004953809454320693, "loss": 5.1992, "mean_token_accuracy": 0.18696852326393126, "num_tokens": 16036493.0, "step": 9240 }, { "entropy": 5.485761117935181, "epoch": 0.7193153083057771, "grad_norm": 0.953125, "learning_rate": 0.0004953753566923929, "loss": 5.3179, "mean_token_accuracy": 0.18096088767051696, "num_tokens": 16045406.0, "step": 9245 }, { "entropy": 5.517353820800781, "epoch": 0.7197043376774946, "grad_norm": 1.015625, "learning_rate": 0.0004953697646088712, "loss": 5.2879, "mean_token_accuracy": 0.18006566911935806, "num_tokens": 16054126.0, "step": 9250 }, { "entropy": 5.552524995803833, "epoch": 0.7200933670492122, "grad_norm": 0.94921875, "learning_rate": 0.0004953641691815891, "loss": 5.3165, "mean_token_accuracy": 0.17277490496635436, "num_tokens": 16063921.0, "step": 9255 }, { "entropy": 5.526010513305664, "epoch": 0.7204823964209298, "grad_norm": 1.0703125, "learning_rate": 0.0004953585704106315, "loss": 5.3301, "mean_token_accuracy": 0.17713529318571092, "num_tokens": 16072160.0, "step": 9260 }, { "entropy": 5.581723594665528, "epoch": 0.7208714257926473, "grad_norm": 0.984375, "learning_rate": 0.0004953529682960832, "loss": 5.2502, "mean_token_accuracy": 0.17594301253557204, "num_tokens": 16080794.0, "step": 9265 }, { "entropy": 5.506132698059082, "epoch": 0.7212604551643649, "grad_norm": 0.99609375, "learning_rate": 0.0004953473628380295, "loss": 5.2785, "mean_token_accuracy": 0.184748113155365, "num_tokens": 16089615.0, "step": 9270 }, { "entropy": 5.484297609329223, "epoch": 0.7216494845360825, "grad_norm": 1.03125, "learning_rate": 0.0004953417540365553, "loss": 5.193, "mean_token_accuracy": 0.1813092976808548, "num_tokens": 16098363.0, "step": 9275 }, { "entropy": 5.5125306129455565, "epoch": 0.7220385139078, "grad_norm": 1.109375, "learning_rate": 0.0004953361418917455, "loss": 5.3007, "mean_token_accuracy": 0.17339064851403235, "num_tokens": 16106837.0, "step": 9280 }, { "entropy": 5.546805047988892, "epoch": 0.7224275432795176, "grad_norm": 0.98828125, "learning_rate": 0.0004953305264036856, "loss": 5.2452, "mean_token_accuracy": 0.1818434938788414, "num_tokens": 16114923.0, "step": 9285 }, { "entropy": 5.519490098953247, "epoch": 0.7228165726512352, "grad_norm": 1.0078125, "learning_rate": 0.0004953249075724607, "loss": 5.2879, "mean_token_accuracy": 0.1730841502547264, "num_tokens": 16123698.0, "step": 9290 }, { "entropy": 5.530564546585083, "epoch": 0.7232056020229527, "grad_norm": 0.96484375, "learning_rate": 0.0004953192853981559, "loss": 5.2362, "mean_token_accuracy": 0.18096031695604325, "num_tokens": 16132361.0, "step": 9295 }, { "entropy": 5.571940183639526, "epoch": 0.7235946313946703, "grad_norm": 0.9765625, "learning_rate": 0.0004953136598808566, "loss": 5.318, "mean_token_accuracy": 0.17768517434597014, "num_tokens": 16141554.0, "step": 9300 }, { "entropy": 5.534313011169433, "epoch": 0.7239836607663879, "grad_norm": 0.9375, "learning_rate": 0.0004953080310206481, "loss": 5.2268, "mean_token_accuracy": 0.18672580122947693, "num_tokens": 16150206.0, "step": 9305 }, { "entropy": 5.513549137115478, "epoch": 0.7243726901381055, "grad_norm": 1.03125, "learning_rate": 0.0004953023988176162, "loss": 5.3605, "mean_token_accuracy": 0.17243377715349198, "num_tokens": 16158995.0, "step": 9310 }, { "entropy": 5.527836322784424, "epoch": 0.724761719509823, "grad_norm": 0.98828125, "learning_rate": 0.0004952967632718458, "loss": 5.3371, "mean_token_accuracy": 0.17223463654518129, "num_tokens": 16167809.0, "step": 9315 }, { "entropy": 5.682061624526978, "epoch": 0.7251507488815405, "grad_norm": 1.140625, "learning_rate": 0.0004952911243834227, "loss": 5.4154, "mean_token_accuracy": 0.17067165076732635, "num_tokens": 16176257.0, "step": 9320 }, { "entropy": 5.580003023147583, "epoch": 0.7255397782532581, "grad_norm": 0.94140625, "learning_rate": 0.0004952854821524324, "loss": 5.3694, "mean_token_accuracy": 0.17336129695177077, "num_tokens": 16185597.0, "step": 9325 }, { "entropy": 5.5720844745635985, "epoch": 0.7259288076249757, "grad_norm": 1.0625, "learning_rate": 0.0004952798365789606, "loss": 5.3885, "mean_token_accuracy": 0.17980121374130248, "num_tokens": 16194591.0, "step": 9330 }, { "entropy": 5.642020654678345, "epoch": 0.7263178369966933, "grad_norm": 0.984375, "learning_rate": 0.0004952741876630928, "loss": 5.3581, "mean_token_accuracy": 0.1726838082075119, "num_tokens": 16203073.0, "step": 9335 }, { "entropy": 5.508799648284912, "epoch": 0.7267068663684109, "grad_norm": 1.015625, "learning_rate": 0.0004952685354049148, "loss": 5.3148, "mean_token_accuracy": 0.1748703047633171, "num_tokens": 16211208.0, "step": 9340 }, { "entropy": 5.517929315567017, "epoch": 0.7270958957401283, "grad_norm": 0.984375, "learning_rate": 0.0004952628798045124, "loss": 5.2567, "mean_token_accuracy": 0.1818465009331703, "num_tokens": 16219687.0, "step": 9345 }, { "entropy": 5.544152498245239, "epoch": 0.7274849251118459, "grad_norm": 1.09375, "learning_rate": 0.0004952572208619714, "loss": 5.3597, "mean_token_accuracy": 0.17764702141284944, "num_tokens": 16228214.0, "step": 9350 }, { "entropy": 5.554121685028076, "epoch": 0.7278739544835635, "grad_norm": 0.99609375, "learning_rate": 0.0004952515585773778, "loss": 5.4359, "mean_token_accuracy": 0.1701967477798462, "num_tokens": 16237765.0, "step": 9355 }, { "entropy": 5.538296556472778, "epoch": 0.7282629838552811, "grad_norm": 1.0390625, "learning_rate": 0.0004952458929508171, "loss": 5.2904, "mean_token_accuracy": 0.19302661269903182, "num_tokens": 16245339.0, "step": 9360 }, { "entropy": 5.464387273788452, "epoch": 0.7286520132269987, "grad_norm": 0.953125, "learning_rate": 0.0004952402239823757, "loss": 5.3103, "mean_token_accuracy": 0.17237628251314163, "num_tokens": 16253966.0, "step": 9365 }, { "entropy": 5.510268449783325, "epoch": 0.7290410425987162, "grad_norm": 1.046875, "learning_rate": 0.0004952345516721393, "loss": 5.2763, "mean_token_accuracy": 0.1785381555557251, "num_tokens": 16262859.0, "step": 9370 }, { "entropy": 5.537214374542236, "epoch": 0.7294300719704337, "grad_norm": 1.0234375, "learning_rate": 0.0004952288760201942, "loss": 5.3148, "mean_token_accuracy": 0.17263807356357574, "num_tokens": 16271646.0, "step": 9375 }, { "entropy": 5.473784780502319, "epoch": 0.7298191013421513, "grad_norm": 0.92578125, "learning_rate": 0.0004952231970266265, "loss": 5.2978, "mean_token_accuracy": 0.17269154787063598, "num_tokens": 16281058.0, "step": 9380 }, { "entropy": 5.578094482421875, "epoch": 0.7302081307138689, "grad_norm": 1.0, "learning_rate": 0.0004952175146915223, "loss": 5.2405, "mean_token_accuracy": 0.18366147577762604, "num_tokens": 16289039.0, "step": 9385 }, { "entropy": 5.416521453857422, "epoch": 0.7305971600855865, "grad_norm": 1.0078125, "learning_rate": 0.0004952118290149679, "loss": 5.1557, "mean_token_accuracy": 0.18696218729019165, "num_tokens": 16297373.0, "step": 9390 }, { "entropy": 5.479905986785889, "epoch": 0.730986189457304, "grad_norm": 0.984375, "learning_rate": 0.0004952061399970492, "loss": 5.3009, "mean_token_accuracy": 0.1710943728685379, "num_tokens": 16306066.0, "step": 9395 }, { "entropy": 5.497681331634522, "epoch": 0.7313752188290216, "grad_norm": 0.96875, "learning_rate": 0.000495200447637853, "loss": 5.3513, "mean_token_accuracy": 0.1753683343529701, "num_tokens": 16315282.0, "step": 9400 }, { "entropy": 5.662838983535766, "epoch": 0.7317642482007392, "grad_norm": 0.9609375, "learning_rate": 0.0004951947519374655, "loss": 5.4422, "mean_token_accuracy": 0.17414647340774536, "num_tokens": 16324830.0, "step": 9405 }, { "entropy": 5.588006401062012, "epoch": 0.7321532775724567, "grad_norm": 1.0625, "learning_rate": 0.0004951890528959731, "loss": 5.3107, "mean_token_accuracy": 0.17455250769853592, "num_tokens": 16332990.0, "step": 9410 }, { "entropy": 5.4766065120697025, "epoch": 0.7325423069441743, "grad_norm": 1.0234375, "learning_rate": 0.0004951833505134623, "loss": 5.2748, "mean_token_accuracy": 0.17803193330764772, "num_tokens": 16342115.0, "step": 9415 }, { "entropy": 5.509708833694458, "epoch": 0.7329313363158918, "grad_norm": 1.0859375, "learning_rate": 0.0004951776447900196, "loss": 5.2755, "mean_token_accuracy": 0.17908571660518646, "num_tokens": 16350329.0, "step": 9420 }, { "entropy": 5.532503509521485, "epoch": 0.7333203656876094, "grad_norm": 0.984375, "learning_rate": 0.0004951719357257317, "loss": 5.373, "mean_token_accuracy": 0.17663051635026933, "num_tokens": 16358890.0, "step": 9425 }, { "entropy": 5.6437225341796875, "epoch": 0.733709395059327, "grad_norm": 1.0390625, "learning_rate": 0.000495166223320685, "loss": 5.4107, "mean_token_accuracy": 0.17415309101343154, "num_tokens": 16367338.0, "step": 9430 }, { "entropy": 5.596455049514771, "epoch": 0.7340984244310446, "grad_norm": 0.953125, "learning_rate": 0.0004951605075749662, "loss": 5.3079, "mean_token_accuracy": 0.1829458549618721, "num_tokens": 16375472.0, "step": 9435 }, { "entropy": 5.554005289077759, "epoch": 0.7344874538027621, "grad_norm": 1.1015625, "learning_rate": 0.0004951547884886623, "loss": 5.3057, "mean_token_accuracy": 0.18579645752906798, "num_tokens": 16384212.0, "step": 9440 }, { "entropy": 5.48416748046875, "epoch": 0.7348764831744796, "grad_norm": 0.9765625, "learning_rate": 0.0004951490660618598, "loss": 5.19, "mean_token_accuracy": 0.18514932096004486, "num_tokens": 16393447.0, "step": 9445 }, { "entropy": 5.4839263439178465, "epoch": 0.7352655125461972, "grad_norm": 0.98828125, "learning_rate": 0.0004951433402946457, "loss": 5.1819, "mean_token_accuracy": 0.18507442027330398, "num_tokens": 16401876.0, "step": 9450 }, { "entropy": 5.484605216979981, "epoch": 0.7356545419179148, "grad_norm": 0.98828125, "learning_rate": 0.0004951376111871068, "loss": 5.3303, "mean_token_accuracy": 0.177512463927269, "num_tokens": 16411020.0, "step": 9455 }, { "entropy": 5.536780595779419, "epoch": 0.7360435712896324, "grad_norm": 0.98828125, "learning_rate": 0.0004951318787393299, "loss": 5.3493, "mean_token_accuracy": 0.17248600572347642, "num_tokens": 16420492.0, "step": 9460 }, { "entropy": 5.5437146663665775, "epoch": 0.73643260066135, "grad_norm": 1.015625, "learning_rate": 0.0004951261429514023, "loss": 5.2452, "mean_token_accuracy": 0.1856250837445259, "num_tokens": 16429277.0, "step": 9465 }, { "entropy": 5.505840682983399, "epoch": 0.7368216300330674, "grad_norm": 0.9921875, "learning_rate": 0.0004951204038234106, "loss": 5.2906, "mean_token_accuracy": 0.17820166200399398, "num_tokens": 16438008.0, "step": 9470 }, { "entropy": 5.528595781326294, "epoch": 0.737210659404785, "grad_norm": 1.0390625, "learning_rate": 0.0004951146613554424, "loss": 5.3071, "mean_token_accuracy": 0.17660343647003174, "num_tokens": 16446791.0, "step": 9475 }, { "entropy": 5.539452600479126, "epoch": 0.7375996887765026, "grad_norm": 1.0078125, "learning_rate": 0.0004951089155475843, "loss": 5.332, "mean_token_accuracy": 0.17971472591161727, "num_tokens": 16455277.0, "step": 9480 }, { "entropy": 5.511737728118897, "epoch": 0.7379887181482202, "grad_norm": 1.0234375, "learning_rate": 0.000495103166399924, "loss": 5.2436, "mean_token_accuracy": 0.18145683407783508, "num_tokens": 16463310.0, "step": 9485 }, { "entropy": 5.483649778366089, "epoch": 0.7383777475199378, "grad_norm": 1.03125, "learning_rate": 0.0004950974139125484, "loss": 5.2947, "mean_token_accuracy": 0.1768422767519951, "num_tokens": 16472421.0, "step": 9490 }, { "entropy": 5.519275951385498, "epoch": 0.7387667768916554, "grad_norm": 1.015625, "learning_rate": 0.0004950916580855448, "loss": 5.3453, "mean_token_accuracy": 0.17599325627088547, "num_tokens": 16481814.0, "step": 9495 }, { "entropy": 5.534765243530273, "epoch": 0.7391558062633728, "grad_norm": 0.94921875, "learning_rate": 0.0004950858989190007, "loss": 5.3074, "mean_token_accuracy": 0.17626449465751648, "num_tokens": 16490902.0, "step": 9500 }, { "entropy": 5.5755720138549805, "epoch": 0.7395448356350904, "grad_norm": 1.0390625, "learning_rate": 0.0004950801364130032, "loss": 5.2676, "mean_token_accuracy": 0.17784581631422042, "num_tokens": 16499418.0, "step": 9505 }, { "entropy": 5.482070207595825, "epoch": 0.739933865006808, "grad_norm": 1.0390625, "learning_rate": 0.0004950743705676401, "loss": 5.2015, "mean_token_accuracy": 0.18767574429512024, "num_tokens": 16508578.0, "step": 9510 }, { "entropy": 5.465091419219971, "epoch": 0.7403228943785256, "grad_norm": 1.046875, "learning_rate": 0.0004950686013829987, "loss": 5.2747, "mean_token_accuracy": 0.175673608481884, "num_tokens": 16517356.0, "step": 9515 }, { "entropy": 5.48217396736145, "epoch": 0.7407119237502432, "grad_norm": 1.0859375, "learning_rate": 0.0004950628288591665, "loss": 5.2725, "mean_token_accuracy": 0.17970967590808867, "num_tokens": 16525834.0, "step": 9520 }, { "entropy": 5.552579116821289, "epoch": 0.7411009531219607, "grad_norm": 0.9375, "learning_rate": 0.0004950570529962311, "loss": 5.2855, "mean_token_accuracy": 0.17572032660245895, "num_tokens": 16534513.0, "step": 9525 }, { "entropy": 5.562464046478271, "epoch": 0.7414899824936783, "grad_norm": 0.9609375, "learning_rate": 0.0004950512737942803, "loss": 5.2719, "mean_token_accuracy": 0.17901514023542403, "num_tokens": 16543326.0, "step": 9530 }, { "entropy": 5.516556215286255, "epoch": 0.7418790118653958, "grad_norm": 1.046875, "learning_rate": 0.0004950454912534015, "loss": 5.2691, "mean_token_accuracy": 0.1809944048523903, "num_tokens": 16551589.0, "step": 9535 }, { "entropy": 5.550516271591187, "epoch": 0.7422680412371134, "grad_norm": 0.9765625, "learning_rate": 0.0004950397053736827, "loss": 5.261, "mean_token_accuracy": 0.18427736014127732, "num_tokens": 16560261.0, "step": 9540 }, { "entropy": 5.560899686813355, "epoch": 0.742657070608831, "grad_norm": 1.015625, "learning_rate": 0.0004950339161552117, "loss": 5.2409, "mean_token_accuracy": 0.18399639576673507, "num_tokens": 16568645.0, "step": 9545 }, { "entropy": 5.466721153259277, "epoch": 0.7430460999805485, "grad_norm": 0.953125, "learning_rate": 0.0004950281235980761, "loss": 5.2407, "mean_token_accuracy": 0.18904574811458588, "num_tokens": 16577206.0, "step": 9550 }, { "entropy": 5.501902389526367, "epoch": 0.7434351293522661, "grad_norm": 0.984375, "learning_rate": 0.000495022327702364, "loss": 5.2494, "mean_token_accuracy": 0.18223912864923478, "num_tokens": 16585011.0, "step": 9555 }, { "entropy": 5.536686563491822, "epoch": 0.7438241587239837, "grad_norm": 0.984375, "learning_rate": 0.0004950165284681631, "loss": 5.3086, "mean_token_accuracy": 0.17903596609830857, "num_tokens": 16593574.0, "step": 9560 }, { "entropy": 5.525215578079224, "epoch": 0.7442131880957013, "grad_norm": 0.98828125, "learning_rate": 0.0004950107258955618, "loss": 5.2248, "mean_token_accuracy": 0.18495490103960038, "num_tokens": 16603023.0, "step": 9565 }, { "entropy": 5.57891092300415, "epoch": 0.7446022174674188, "grad_norm": 1.015625, "learning_rate": 0.0004950049199846479, "loss": 5.3299, "mean_token_accuracy": 0.17628548294305801, "num_tokens": 16611963.0, "step": 9570 }, { "entropy": 5.579830169677734, "epoch": 0.7449912468391363, "grad_norm": 1.0859375, "learning_rate": 0.0004949991107355095, "loss": 5.2685, "mean_token_accuracy": 0.18321491181850433, "num_tokens": 16619942.0, "step": 9575 }, { "entropy": 5.4394776821136475, "epoch": 0.7453802762108539, "grad_norm": 1.0, "learning_rate": 0.0004949932981482347, "loss": 5.159, "mean_token_accuracy": 0.19187068939208984, "num_tokens": 16628261.0, "step": 9580 }, { "entropy": 5.569550085067749, "epoch": 0.7457693055825715, "grad_norm": 1.0390625, "learning_rate": 0.0004949874822229118, "loss": 5.298, "mean_token_accuracy": 0.17895311564207078, "num_tokens": 16637290.0, "step": 9585 }, { "entropy": 5.532668781280518, "epoch": 0.7461583349542891, "grad_norm": 0.96484375, "learning_rate": 0.0004949816629596288, "loss": 5.2771, "mean_token_accuracy": 0.17896714061498642, "num_tokens": 16646147.0, "step": 9590 }, { "entropy": 5.507999229431152, "epoch": 0.7465473643260067, "grad_norm": 0.96484375, "learning_rate": 0.0004949758403584746, "loss": 5.3614, "mean_token_accuracy": 0.17433760166168213, "num_tokens": 16655299.0, "step": 9595 }, { "entropy": 5.527968025207519, "epoch": 0.7469363936977241, "grad_norm": 0.9921875, "learning_rate": 0.0004949700144195368, "loss": 5.2551, "mean_token_accuracy": 0.18272501081228257, "num_tokens": 16664091.0, "step": 9600 }, { "entropy": 5.63112359046936, "epoch": 0.7473254230694417, "grad_norm": 0.99609375, "learning_rate": 0.0004949641851429043, "loss": 5.3291, "mean_token_accuracy": 0.17361777275800705, "num_tokens": 16672665.0, "step": 9605 }, { "entropy": 5.503894329071045, "epoch": 0.7477144524411593, "grad_norm": 0.9765625, "learning_rate": 0.0004949583525286654, "loss": 5.2547, "mean_token_accuracy": 0.18190684020519257, "num_tokens": 16680735.0, "step": 9610 }, { "entropy": 5.531303215026855, "epoch": 0.7481034818128769, "grad_norm": 1.0078125, "learning_rate": 0.0004949525165769085, "loss": 5.3318, "mean_token_accuracy": 0.17678708285093309, "num_tokens": 16689560.0, "step": 9615 }, { "entropy": 5.57023777961731, "epoch": 0.7484925111845945, "grad_norm": 0.9453125, "learning_rate": 0.0004949466772877224, "loss": 5.2971, "mean_token_accuracy": 0.176286181807518, "num_tokens": 16698953.0, "step": 9620 }, { "entropy": 5.538971710205078, "epoch": 0.748881540556312, "grad_norm": 1.0546875, "learning_rate": 0.0004949408346611955, "loss": 5.3005, "mean_token_accuracy": 0.17719310224056245, "num_tokens": 16707601.0, "step": 9625 }, { "entropy": 5.486642265319825, "epoch": 0.7492705699280295, "grad_norm": 1.0078125, "learning_rate": 0.0004949349886974165, "loss": 5.3083, "mean_token_accuracy": 0.17697182446718215, "num_tokens": 16716660.0, "step": 9630 }, { "entropy": 5.526908016204834, "epoch": 0.7496595992997471, "grad_norm": 1.015625, "learning_rate": 0.0004949291393964741, "loss": 5.2309, "mean_token_accuracy": 0.18333530873060228, "num_tokens": 16725274.0, "step": 9635 }, { "entropy": 5.522509622573852, "epoch": 0.7500486286714647, "grad_norm": 1.046875, "learning_rate": 0.000494923286758457, "loss": 5.2565, "mean_token_accuracy": 0.17661647498607635, "num_tokens": 16733301.0, "step": 9640 }, { "entropy": 5.532206630706787, "epoch": 0.7504376580431823, "grad_norm": 1.03125, "learning_rate": 0.0004949174307834541, "loss": 5.2683, "mean_token_accuracy": 0.17681436985731125, "num_tokens": 16742072.0, "step": 9645 }, { "entropy": 5.56414041519165, "epoch": 0.7508266874148998, "grad_norm": 0.97265625, "learning_rate": 0.0004949115714715543, "loss": 5.2729, "mean_token_accuracy": 0.17735247313976288, "num_tokens": 16751497.0, "step": 9650 }, { "entropy": 5.500267267227173, "epoch": 0.7512157167866174, "grad_norm": 1.0, "learning_rate": 0.0004949057088228465, "loss": 5.2291, "mean_token_accuracy": 0.18457525670528413, "num_tokens": 16760518.0, "step": 9655 }, { "entropy": 5.56249966621399, "epoch": 0.751604746158335, "grad_norm": 1.03125, "learning_rate": 0.0004948998428374194, "loss": 5.3446, "mean_token_accuracy": 0.1734904959797859, "num_tokens": 16768689.0, "step": 9660 }, { "entropy": 5.511510705947876, "epoch": 0.7519937755300525, "grad_norm": 1.0859375, "learning_rate": 0.0004948939735153622, "loss": 5.1946, "mean_token_accuracy": 0.18978124409914016, "num_tokens": 16777047.0, "step": 9665 }, { "entropy": 5.4549542427062985, "epoch": 0.7523828049017701, "grad_norm": 1.0, "learning_rate": 0.0004948881008567641, "loss": 5.1669, "mean_token_accuracy": 0.18612776845693588, "num_tokens": 16785402.0, "step": 9670 }, { "entropy": 5.519801616668701, "epoch": 0.7527718342734876, "grad_norm": 0.9296875, "learning_rate": 0.0004948822248617139, "loss": 5.2656, "mean_token_accuracy": 0.180714151263237, "num_tokens": 16794687.0, "step": 9675 }, { "entropy": 5.574731159210205, "epoch": 0.7531608636452052, "grad_norm": 1.03125, "learning_rate": 0.000494876345530301, "loss": 5.3091, "mean_token_accuracy": 0.1775807648897171, "num_tokens": 16803762.0, "step": 9680 }, { "entropy": 5.489257097244263, "epoch": 0.7535498930169228, "grad_norm": 1.0390625, "learning_rate": 0.0004948704628626145, "loss": 5.3265, "mean_token_accuracy": 0.1761407047510147, "num_tokens": 16812872.0, "step": 9685 }, { "entropy": 5.597826910018921, "epoch": 0.7539389223886404, "grad_norm": 0.9765625, "learning_rate": 0.0004948645768587437, "loss": 5.364, "mean_token_accuracy": 0.17040175199508667, "num_tokens": 16821270.0, "step": 9690 }, { "entropy": 5.510218954086303, "epoch": 0.7543279517603579, "grad_norm": 0.9609375, "learning_rate": 0.0004948586875187778, "loss": 5.2691, "mean_token_accuracy": 0.18083699196577072, "num_tokens": 16829508.0, "step": 9695 }, { "entropy": 5.509693193435669, "epoch": 0.7547169811320755, "grad_norm": 0.9921875, "learning_rate": 0.0004948527948428064, "loss": 5.2561, "mean_token_accuracy": 0.17584622353315355, "num_tokens": 16838327.0, "step": 9700 }, { "entropy": 5.518677520751953, "epoch": 0.755106010503793, "grad_norm": 0.99609375, "learning_rate": 0.0004948468988309187, "loss": 5.224, "mean_token_accuracy": 0.18870116919279098, "num_tokens": 16846530.0, "step": 9705 }, { "entropy": 5.443510627746582, "epoch": 0.7554950398755106, "grad_norm": 1.0625, "learning_rate": 0.0004948409994832043, "loss": 5.1736, "mean_token_accuracy": 0.18186719715595245, "num_tokens": 16854825.0, "step": 9710 }, { "entropy": 5.521227264404297, "epoch": 0.7558840692472282, "grad_norm": 0.984375, "learning_rate": 0.0004948350967997526, "loss": 5.3152, "mean_token_accuracy": 0.16900599747896194, "num_tokens": 16864096.0, "step": 9715 }, { "entropy": 5.577143716812134, "epoch": 0.7562730986189458, "grad_norm": 0.96484375, "learning_rate": 0.0004948291907806532, "loss": 5.3638, "mean_token_accuracy": 0.17159767150878907, "num_tokens": 16873000.0, "step": 9720 }, { "entropy": 5.665972375869751, "epoch": 0.7566621279906633, "grad_norm": 1.0234375, "learning_rate": 0.0004948232814259957, "loss": 5.3633, "mean_token_accuracy": 0.17761090695858, "num_tokens": 16881374.0, "step": 9725 }, { "entropy": 5.5593935489654545, "epoch": 0.7570511573623808, "grad_norm": 1.078125, "learning_rate": 0.0004948173687358699, "loss": 5.3404, "mean_token_accuracy": 0.1750152513384819, "num_tokens": 16889192.0, "step": 9730 }, { "entropy": 5.505446147918701, "epoch": 0.7574401867340984, "grad_norm": 0.9765625, "learning_rate": 0.0004948114527103652, "loss": 5.3422, "mean_token_accuracy": 0.17301418334245683, "num_tokens": 16898538.0, "step": 9735 }, { "entropy": 5.56066255569458, "epoch": 0.757829216105816, "grad_norm": 1.078125, "learning_rate": 0.0004948055333495717, "loss": 5.3304, "mean_token_accuracy": 0.17280552983283998, "num_tokens": 16907543.0, "step": 9740 }, { "entropy": 5.539577150344849, "epoch": 0.7582182454775336, "grad_norm": 0.96875, "learning_rate": 0.0004947996106535791, "loss": 5.2429, "mean_token_accuracy": 0.186687570810318, "num_tokens": 16916140.0, "step": 9745 }, { "entropy": 5.463486766815185, "epoch": 0.7586072748492512, "grad_norm": 1.0, "learning_rate": 0.0004947936846224773, "loss": 5.2346, "mean_token_accuracy": 0.18819027841091157, "num_tokens": 16925433.0, "step": 9750 }, { "entropy": 5.466220092773438, "epoch": 0.7589963042209686, "grad_norm": 0.96484375, "learning_rate": 0.0004947877552563562, "loss": 5.2588, "mean_token_accuracy": 0.18084800094366074, "num_tokens": 16933598.0, "step": 9755 }, { "entropy": 5.576293563842773, "epoch": 0.7593853335926862, "grad_norm": 1.0390625, "learning_rate": 0.0004947818225553056, "loss": 5.3503, "mean_token_accuracy": 0.16968601644039155, "num_tokens": 16942270.0, "step": 9760 }, { "entropy": 5.529783248901367, "epoch": 0.7597743629644038, "grad_norm": 0.9765625, "learning_rate": 0.0004947758865194156, "loss": 5.2083, "mean_token_accuracy": 0.1745459794998169, "num_tokens": 16951044.0, "step": 9765 }, { "entropy": 5.592495155334473, "epoch": 0.7601633923361214, "grad_norm": 0.99609375, "learning_rate": 0.0004947699471487766, "loss": 5.3607, "mean_token_accuracy": 0.1730125442147255, "num_tokens": 16960215.0, "step": 9770 }, { "entropy": 5.6113536834716795, "epoch": 0.760552421707839, "grad_norm": 1.1640625, "learning_rate": 0.0004947640044434782, "loss": 5.4039, "mean_token_accuracy": 0.1740428924560547, "num_tokens": 16968515.0, "step": 9775 }, { "entropy": 5.5669536113739015, "epoch": 0.7609414510795565, "grad_norm": 1.0625, "learning_rate": 0.0004947580584036109, "loss": 5.3905, "mean_token_accuracy": 0.16517711132764817, "num_tokens": 16977597.0, "step": 9780 }, { "entropy": 5.51172833442688, "epoch": 0.761330480451274, "grad_norm": 1.09375, "learning_rate": 0.0004947521090292649, "loss": 5.2044, "mean_token_accuracy": 0.1818167731165886, "num_tokens": 16987376.0, "step": 9785 }, { "entropy": 5.495888328552246, "epoch": 0.7617195098229916, "grad_norm": 0.98828125, "learning_rate": 0.0004947461563205304, "loss": 5.2243, "mean_token_accuracy": 0.18184335827827453, "num_tokens": 16995976.0, "step": 9790 }, { "entropy": 5.468533658981324, "epoch": 0.7621085391947092, "grad_norm": 1.0703125, "learning_rate": 0.0004947402002774977, "loss": 5.2589, "mean_token_accuracy": 0.18480821400880815, "num_tokens": 17003819.0, "step": 9795 }, { "entropy": 5.46503529548645, "epoch": 0.7624975685664268, "grad_norm": 1.0546875, "learning_rate": 0.0004947342409002572, "loss": 5.2299, "mean_token_accuracy": 0.17814650386571884, "num_tokens": 17011632.0, "step": 9800 }, { "entropy": 5.446854114532471, "epoch": 0.7628865979381443, "grad_norm": 1.015625, "learning_rate": 0.0004947282781888994, "loss": 5.1299, "mean_token_accuracy": 0.1900835767388344, "num_tokens": 17019737.0, "step": 9805 }, { "entropy": 5.513966989517212, "epoch": 0.7632756273098619, "grad_norm": 1.0859375, "learning_rate": 0.0004947223121435147, "loss": 5.308, "mean_token_accuracy": 0.17970457971096038, "num_tokens": 17028803.0, "step": 9810 }, { "entropy": 5.522125768661499, "epoch": 0.7636646566815795, "grad_norm": 1.0, "learning_rate": 0.0004947163427641936, "loss": 5.1749, "mean_token_accuracy": 0.1819399580359459, "num_tokens": 17036847.0, "step": 9815 }, { "entropy": 5.55477819442749, "epoch": 0.764053686053297, "grad_norm": 0.9765625, "learning_rate": 0.0004947103700510268, "loss": 5.2972, "mean_token_accuracy": 0.17123585790395737, "num_tokens": 17045665.0, "step": 9820 }, { "entropy": 5.5626825332641605, "epoch": 0.7644427154250146, "grad_norm": 0.98046875, "learning_rate": 0.0004947043940041047, "loss": 5.3041, "mean_token_accuracy": 0.18419567197561265, "num_tokens": 17053842.0, "step": 9825 }, { "entropy": 5.559472942352295, "epoch": 0.7648317447967321, "grad_norm": 0.984375, "learning_rate": 0.0004946984146235183, "loss": 5.3713, "mean_token_accuracy": 0.16998113840818405, "num_tokens": 17062287.0, "step": 9830 }, { "entropy": 5.5503315925598145, "epoch": 0.7652207741684497, "grad_norm": 1.015625, "learning_rate": 0.0004946924319093579, "loss": 5.3603, "mean_token_accuracy": 0.1833072781562805, "num_tokens": 17071495.0, "step": 9835 }, { "entropy": 5.559949827194214, "epoch": 0.7656098035401673, "grad_norm": 1.0234375, "learning_rate": 0.0004946864458617148, "loss": 5.3092, "mean_token_accuracy": 0.17485345602035524, "num_tokens": 17080734.0, "step": 9840 }, { "entropy": 5.5691710948944095, "epoch": 0.7659988329118849, "grad_norm": 0.94921875, "learning_rate": 0.0004946804564806793, "loss": 5.3171, "mean_token_accuracy": 0.1762693464756012, "num_tokens": 17089683.0, "step": 9845 }, { "entropy": 5.559986209869384, "epoch": 0.7663878622836025, "grad_norm": 1.03125, "learning_rate": 0.0004946744637663427, "loss": 5.3554, "mean_token_accuracy": 0.1732053965330124, "num_tokens": 17098203.0, "step": 9850 }, { "entropy": 5.492097568511963, "epoch": 0.7667768916553199, "grad_norm": 0.97265625, "learning_rate": 0.0004946684677187956, "loss": 5.2058, "mean_token_accuracy": 0.1791884958744049, "num_tokens": 17107185.0, "step": 9855 }, { "entropy": 5.5052488327026365, "epoch": 0.7671659210270375, "grad_norm": 0.98828125, "learning_rate": 0.0004946624683381292, "loss": 5.2572, "mean_token_accuracy": 0.18280573338270187, "num_tokens": 17115168.0, "step": 9860 }, { "entropy": 5.492350673675537, "epoch": 0.7675549503987551, "grad_norm": 0.98046875, "learning_rate": 0.0004946564656244345, "loss": 5.2248, "mean_token_accuracy": 0.18061275631189347, "num_tokens": 17124037.0, "step": 9865 }, { "entropy": 5.482589673995972, "epoch": 0.7679439797704727, "grad_norm": 1.0078125, "learning_rate": 0.0004946504595778026, "loss": 5.1848, "mean_token_accuracy": 0.18470862209796907, "num_tokens": 17132238.0, "step": 9870 }, { "entropy": 5.528201293945313, "epoch": 0.7683330091421903, "grad_norm": 0.99609375, "learning_rate": 0.0004946444501983246, "loss": 5.3101, "mean_token_accuracy": 0.17529313564300536, "num_tokens": 17140405.0, "step": 9875 }, { "entropy": 5.477884340286255, "epoch": 0.7687220385139077, "grad_norm": 1.0546875, "learning_rate": 0.0004946384374860916, "loss": 5.2169, "mean_token_accuracy": 0.18497956842184066, "num_tokens": 17149207.0, "step": 9880 }, { "entropy": 5.49578537940979, "epoch": 0.7691110678856253, "grad_norm": 1.0625, "learning_rate": 0.0004946324214411949, "loss": 5.2235, "mean_token_accuracy": 0.174551323056221, "num_tokens": 17157680.0, "step": 9885 }, { "entropy": 5.53033413887024, "epoch": 0.7695000972573429, "grad_norm": 0.9921875, "learning_rate": 0.0004946264020637259, "loss": 5.2466, "mean_token_accuracy": 0.1816631004214287, "num_tokens": 17166907.0, "step": 9890 }, { "entropy": 5.474490213394165, "epoch": 0.7698891266290605, "grad_norm": 1.015625, "learning_rate": 0.0004946203793537757, "loss": 5.2829, "mean_token_accuracy": 0.18226464688777924, "num_tokens": 17176318.0, "step": 9895 }, { "entropy": 5.53701434135437, "epoch": 0.7702781560007781, "grad_norm": 1.046875, "learning_rate": 0.0004946143533114358, "loss": 5.3232, "mean_token_accuracy": 0.17004299610853196, "num_tokens": 17185380.0, "step": 9900 }, { "entropy": 5.576970863342285, "epoch": 0.7706671853724957, "grad_norm": 1.0859375, "learning_rate": 0.0004946083239367976, "loss": 5.3152, "mean_token_accuracy": 0.1714840590953827, "num_tokens": 17193177.0, "step": 9905 }, { "entropy": 5.48358302116394, "epoch": 0.7710562147442132, "grad_norm": 0.9921875, "learning_rate": 0.0004946022912299527, "loss": 5.2851, "mean_token_accuracy": 0.1743071898818016, "num_tokens": 17201071.0, "step": 9910 }, { "entropy": 5.443161869049073, "epoch": 0.7714452441159307, "grad_norm": 1.0234375, "learning_rate": 0.0004945962551909926, "loss": 5.192, "mean_token_accuracy": 0.1892089620232582, "num_tokens": 17209375.0, "step": 9915 }, { "entropy": 5.4871406078338625, "epoch": 0.7718342734876483, "grad_norm": 1.046875, "learning_rate": 0.0004945902158200089, "loss": 5.1511, "mean_token_accuracy": 0.19255804866552353, "num_tokens": 17217453.0, "step": 9920 }, { "entropy": 5.527065372467041, "epoch": 0.7722233028593659, "grad_norm": 0.97265625, "learning_rate": 0.0004945841731170931, "loss": 5.2182, "mean_token_accuracy": 0.18266509026288985, "num_tokens": 17225671.0, "step": 9925 }, { "entropy": 5.476472616195679, "epoch": 0.7726123322310835, "grad_norm": 1.0078125, "learning_rate": 0.0004945781270823369, "loss": 5.1946, "mean_token_accuracy": 0.17870524823665618, "num_tokens": 17234396.0, "step": 9930 }, { "entropy": 5.485116481781006, "epoch": 0.773001361602801, "grad_norm": 0.9765625, "learning_rate": 0.0004945720777158323, "loss": 5.2932, "mean_token_accuracy": 0.17891357988119125, "num_tokens": 17243509.0, "step": 9935 }, { "entropy": 5.5052985668182375, "epoch": 0.7733903909745186, "grad_norm": 1.0078125, "learning_rate": 0.0004945660250176708, "loss": 5.226, "mean_token_accuracy": 0.18571309596300126, "num_tokens": 17251447.0, "step": 9940 }, { "entropy": 5.486689853668213, "epoch": 0.7737794203462361, "grad_norm": 1.0390625, "learning_rate": 0.0004945599689879443, "loss": 5.2855, "mean_token_accuracy": 0.18234823644161224, "num_tokens": 17260240.0, "step": 9945 }, { "entropy": 5.504311752319336, "epoch": 0.7741684497179537, "grad_norm": 1.0859375, "learning_rate": 0.0004945539096267448, "loss": 5.2779, "mean_token_accuracy": 0.1794341191649437, "num_tokens": 17267835.0, "step": 9950 }, { "entropy": 5.490119600296021, "epoch": 0.7745574790896713, "grad_norm": 0.91015625, "learning_rate": 0.0004945478469341642, "loss": 5.2917, "mean_token_accuracy": 0.17960673123598098, "num_tokens": 17277069.0, "step": 9955 }, { "entropy": 5.503227710723877, "epoch": 0.7749465084613888, "grad_norm": 1.03125, "learning_rate": 0.0004945417809102944, "loss": 5.2738, "mean_token_accuracy": 0.17552107572555542, "num_tokens": 17285014.0, "step": 9960 }, { "entropy": 5.448036193847656, "epoch": 0.7753355378331064, "grad_norm": 1.046875, "learning_rate": 0.0004945357115552275, "loss": 5.2096, "mean_token_accuracy": 0.18504277765750884, "num_tokens": 17292649.0, "step": 9965 }, { "entropy": 5.552454805374145, "epoch": 0.775724567204824, "grad_norm": 1.0859375, "learning_rate": 0.0004945296388690557, "loss": 5.3469, "mean_token_accuracy": 0.17528970986604692, "num_tokens": 17301792.0, "step": 9970 }, { "entropy": 5.4984996795654295, "epoch": 0.7761135965765416, "grad_norm": 0.9375, "learning_rate": 0.000494523562851871, "loss": 5.1199, "mean_token_accuracy": 0.18478506952524185, "num_tokens": 17310377.0, "step": 9975 }, { "entropy": 5.524313831329346, "epoch": 0.7765026259482591, "grad_norm": 1.0078125, "learning_rate": 0.0004945174835037655, "loss": 5.3292, "mean_token_accuracy": 0.17124491631984712, "num_tokens": 17319779.0, "step": 9980 }, { "entropy": 5.626156997680664, "epoch": 0.7768916553199766, "grad_norm": 1.0859375, "learning_rate": 0.0004945114008248319, "loss": 5.4448, "mean_token_accuracy": 0.17286913990974426, "num_tokens": 17328210.0, "step": 9985 }, { "entropy": 5.479475212097168, "epoch": 0.7772806846916942, "grad_norm": 1.0390625, "learning_rate": 0.0004945053148151619, "loss": 5.205, "mean_token_accuracy": 0.18539665639400482, "num_tokens": 17336287.0, "step": 9990 }, { "entropy": 5.469457817077637, "epoch": 0.7776697140634118, "grad_norm": 1.0390625, "learning_rate": 0.0004944992254748482, "loss": 5.2719, "mean_token_accuracy": 0.1718845933675766, "num_tokens": 17344171.0, "step": 9995 }, { "entropy": 5.478817176818848, "epoch": 0.7780587434351294, "grad_norm": 1.0078125, "learning_rate": 0.0004944931328039832, "loss": 5.2475, "mean_token_accuracy": 0.18395550101995467, "num_tokens": 17352786.0, "step": 10000 }, { "entropy": 5.509289216995239, "epoch": 0.778447772806847, "grad_norm": 0.97265625, "learning_rate": 0.0004944870368026592, "loss": 5.2484, "mean_token_accuracy": 0.17987870126962663, "num_tokens": 17361824.0, "step": 10005 }, { "entropy": 5.570871305465698, "epoch": 0.7788368021785644, "grad_norm": 0.97265625, "learning_rate": 0.0004944809374709689, "loss": 5.2671, "mean_token_accuracy": 0.18045250177383423, "num_tokens": 17370249.0, "step": 10010 }, { "entropy": 5.479308462142944, "epoch": 0.779225831550282, "grad_norm": 1.0390625, "learning_rate": 0.0004944748348090045, "loss": 5.2463, "mean_token_accuracy": 0.17960281819105148, "num_tokens": 17379650.0, "step": 10015 }, { "entropy": 5.484287595748901, "epoch": 0.7796148609219996, "grad_norm": 0.9765625, "learning_rate": 0.0004944687288168589, "loss": 5.259, "mean_token_accuracy": 0.17928773015737534, "num_tokens": 17388046.0, "step": 10020 }, { "entropy": 5.526807880401611, "epoch": 0.7800038902937172, "grad_norm": 1.1015625, "learning_rate": 0.0004944626194946246, "loss": 5.2448, "mean_token_accuracy": 0.1866823747754097, "num_tokens": 17395851.0, "step": 10025 }, { "entropy": 5.525498485565185, "epoch": 0.7803929196654348, "grad_norm": 1.078125, "learning_rate": 0.0004944565068423945, "loss": 5.2945, "mean_token_accuracy": 0.17972708940505983, "num_tokens": 17404273.0, "step": 10030 }, { "entropy": 5.473722171783447, "epoch": 0.7807819490371523, "grad_norm": 1.015625, "learning_rate": 0.0004944503908602612, "loss": 5.259, "mean_token_accuracy": 0.1757344827055931, "num_tokens": 17412884.0, "step": 10035 }, { "entropy": 5.528784894943238, "epoch": 0.7811709784088698, "grad_norm": 1.0234375, "learning_rate": 0.0004944442715483174, "loss": 5.2428, "mean_token_accuracy": 0.180391126871109, "num_tokens": 17420939.0, "step": 10040 }, { "entropy": 5.51695065498352, "epoch": 0.7815600077805874, "grad_norm": 1.0859375, "learning_rate": 0.0004944381489066561, "loss": 5.2805, "mean_token_accuracy": 0.179149267077446, "num_tokens": 17429838.0, "step": 10045 }, { "entropy": 5.5202220439910885, "epoch": 0.781949037152305, "grad_norm": 0.92578125, "learning_rate": 0.0004944320229353702, "loss": 5.2475, "mean_token_accuracy": 0.17938094735145568, "num_tokens": 17439164.0, "step": 10050 }, { "entropy": 5.545313215255737, "epoch": 0.7823380665240226, "grad_norm": 1.0390625, "learning_rate": 0.0004944258936345526, "loss": 5.2428, "mean_token_accuracy": 0.1806008294224739, "num_tokens": 17447544.0, "step": 10055 }, { "entropy": 5.435806465148926, "epoch": 0.7827270958957401, "grad_norm": 1.0546875, "learning_rate": 0.0004944197610042963, "loss": 5.1144, "mean_token_accuracy": 0.18700868338346482, "num_tokens": 17456270.0, "step": 10060 }, { "entropy": 5.510924053192139, "epoch": 0.7831161252674577, "grad_norm": 1.046875, "learning_rate": 0.0004944136250446944, "loss": 5.3014, "mean_token_accuracy": 0.17599982768297195, "num_tokens": 17465241.0, "step": 10065 }, { "entropy": 5.573872995376587, "epoch": 0.7835051546391752, "grad_norm": 1.0390625, "learning_rate": 0.0004944074857558399, "loss": 5.3278, "mean_token_accuracy": 0.17019759118556976, "num_tokens": 17474460.0, "step": 10070 }, { "entropy": 5.516555547714233, "epoch": 0.7838941840108928, "grad_norm": 1.0234375, "learning_rate": 0.0004944013431378261, "loss": 5.2686, "mean_token_accuracy": 0.1809688240289688, "num_tokens": 17483256.0, "step": 10075 }, { "entropy": 5.573693418502808, "epoch": 0.7842832133826104, "grad_norm": 1.046875, "learning_rate": 0.0004943951971907461, "loss": 5.2778, "mean_token_accuracy": 0.17620657980442048, "num_tokens": 17491922.0, "step": 10080 }, { "entropy": 5.553318119049072, "epoch": 0.7846722427543279, "grad_norm": 1.015625, "learning_rate": 0.0004943890479146933, "loss": 5.2803, "mean_token_accuracy": 0.1826641380786896, "num_tokens": 17499763.0, "step": 10085 }, { "entropy": 5.531665325164795, "epoch": 0.7850612721260455, "grad_norm": 1.0, "learning_rate": 0.0004943828953097607, "loss": 5.2525, "mean_token_accuracy": 0.1804066002368927, "num_tokens": 17508682.0, "step": 10090 }, { "entropy": 5.47623872756958, "epoch": 0.7854503014977631, "grad_norm": 1.015625, "learning_rate": 0.000494376739376042, "loss": 5.2005, "mean_token_accuracy": 0.18191106915473937, "num_tokens": 17517269.0, "step": 10095 }, { "entropy": 5.4370521068572994, "epoch": 0.7858393308694807, "grad_norm": 1.0234375, "learning_rate": 0.0004943705801136304, "loss": 5.2114, "mean_token_accuracy": 0.18425271213054656, "num_tokens": 17525135.0, "step": 10100 }, { "entropy": 5.504463958740234, "epoch": 0.7862283602411982, "grad_norm": 1.078125, "learning_rate": 0.0004943644175226193, "loss": 5.2824, "mean_token_accuracy": 0.18710980862379073, "num_tokens": 17534195.0, "step": 10105 }, { "entropy": 5.504264163970947, "epoch": 0.7866173896129158, "grad_norm": 0.96484375, "learning_rate": 0.0004943582516031025, "loss": 5.1878, "mean_token_accuracy": 0.18398372381925582, "num_tokens": 17543016.0, "step": 10110 }, { "entropy": 5.543115234375, "epoch": 0.7870064189846333, "grad_norm": 1.0234375, "learning_rate": 0.0004943520823551732, "loss": 5.3101, "mean_token_accuracy": 0.18001576513051987, "num_tokens": 17551854.0, "step": 10115 }, { "entropy": 5.493507385253906, "epoch": 0.7873954483563509, "grad_norm": 1.046875, "learning_rate": 0.0004943459097789252, "loss": 5.219, "mean_token_accuracy": 0.18448521345853805, "num_tokens": 17560739.0, "step": 10120 }, { "entropy": 5.494330549240113, "epoch": 0.7877844777280685, "grad_norm": 0.94140625, "learning_rate": 0.0004943397338744523, "loss": 5.2124, "mean_token_accuracy": 0.18253387808799743, "num_tokens": 17569784.0, "step": 10125 }, { "entropy": 5.575987386703491, "epoch": 0.7881735070997861, "grad_norm": 1.0078125, "learning_rate": 0.000494333554641848, "loss": 5.3786, "mean_token_accuracy": 0.17486449778079988, "num_tokens": 17579262.0, "step": 10130 }, { "entropy": 5.480230522155762, "epoch": 0.7885625364715037, "grad_norm": 1.046875, "learning_rate": 0.000494327372081206, "loss": 5.2426, "mean_token_accuracy": 0.18137102127075194, "num_tokens": 17587984.0, "step": 10135 }, { "entropy": 5.43894624710083, "epoch": 0.7889515658432211, "grad_norm": 0.95703125, "learning_rate": 0.0004943211861926204, "loss": 5.1811, "mean_token_accuracy": 0.18788255900144576, "num_tokens": 17596598.0, "step": 10140 }, { "entropy": 5.486376094818115, "epoch": 0.7893405952149387, "grad_norm": 1.03125, "learning_rate": 0.0004943149969761848, "loss": 5.3289, "mean_token_accuracy": 0.17827004939317703, "num_tokens": 17605768.0, "step": 10145 }, { "entropy": 5.532032871246338, "epoch": 0.7897296245866563, "grad_norm": 1.0, "learning_rate": 0.0004943088044319932, "loss": 5.2446, "mean_token_accuracy": 0.17860632985830308, "num_tokens": 17614412.0, "step": 10150 }, { "entropy": 5.531218814849853, "epoch": 0.7901186539583739, "grad_norm": 0.98828125, "learning_rate": 0.0004943026085601395, "loss": 5.2603, "mean_token_accuracy": 0.1825568839907646, "num_tokens": 17622515.0, "step": 10155 }, { "entropy": 5.504086256027222, "epoch": 0.7905076833300915, "grad_norm": 0.95703125, "learning_rate": 0.0004942964093607178, "loss": 5.1894, "mean_token_accuracy": 0.17871761620044707, "num_tokens": 17631256.0, "step": 10160 }, { "entropy": 5.584036207199096, "epoch": 0.790896712701809, "grad_norm": 1.046875, "learning_rate": 0.0004942902068338222, "loss": 5.3065, "mean_token_accuracy": 0.1784570500254631, "num_tokens": 17639648.0, "step": 10165 }, { "entropy": 5.543404960632325, "epoch": 0.7912857420735265, "grad_norm": 0.9765625, "learning_rate": 0.0004942840009795466, "loss": 5.2428, "mean_token_accuracy": 0.17736659348011016, "num_tokens": 17648225.0, "step": 10170 }, { "entropy": 5.554074954986572, "epoch": 0.7916747714452441, "grad_norm": 0.9375, "learning_rate": 0.0004942777917979855, "loss": 5.2784, "mean_token_accuracy": 0.18722645938396454, "num_tokens": 17656764.0, "step": 10175 }, { "entropy": 5.545025968551636, "epoch": 0.7920638008169617, "grad_norm": 1.109375, "learning_rate": 0.0004942715792892328, "loss": 5.2694, "mean_token_accuracy": 0.17341597974300385, "num_tokens": 17665127.0, "step": 10180 }, { "entropy": 5.444001579284668, "epoch": 0.7924528301886793, "grad_norm": 1.0859375, "learning_rate": 0.000494265363453383, "loss": 5.1503, "mean_token_accuracy": 0.1862768903374672, "num_tokens": 17673297.0, "step": 10185 }, { "entropy": 5.535777425765991, "epoch": 0.7928418595603968, "grad_norm": 0.9609375, "learning_rate": 0.0004942591442905302, "loss": 5.2977, "mean_token_accuracy": 0.17705918252468109, "num_tokens": 17681816.0, "step": 10190 }, { "entropy": 5.579300880432129, "epoch": 0.7932308889321144, "grad_norm": 1.140625, "learning_rate": 0.0004942529218007689, "loss": 5.292, "mean_token_accuracy": 0.17734406590461732, "num_tokens": 17690588.0, "step": 10195 }, { "entropy": 5.49422664642334, "epoch": 0.7936199183038319, "grad_norm": 0.98828125, "learning_rate": 0.0004942466959841936, "loss": 5.2159, "mean_token_accuracy": 0.18411819785833358, "num_tokens": 17699196.0, "step": 10200 }, { "entropy": 5.582365989685059, "epoch": 0.7940089476755495, "grad_norm": 0.99609375, "learning_rate": 0.0004942404668408985, "loss": 5.329, "mean_token_accuracy": 0.17680783271789552, "num_tokens": 17708928.0, "step": 10205 }, { "entropy": 5.578712320327758, "epoch": 0.7943979770472671, "grad_norm": 1.0859375, "learning_rate": 0.0004942342343709783, "loss": 5.2141, "mean_token_accuracy": 0.1849304437637329, "num_tokens": 17717888.0, "step": 10210 }, { "entropy": 5.542761707305909, "epoch": 0.7947870064189846, "grad_norm": 1.015625, "learning_rate": 0.0004942279985745275, "loss": 5.2376, "mean_token_accuracy": 0.17852413058280944, "num_tokens": 17726022.0, "step": 10215 }, { "entropy": 5.471940612792968, "epoch": 0.7951760357907022, "grad_norm": 1.078125, "learning_rate": 0.0004942217594516409, "loss": 5.2106, "mean_token_accuracy": 0.1806783840060234, "num_tokens": 17733998.0, "step": 10220 }, { "entropy": 5.565222644805909, "epoch": 0.7955650651624198, "grad_norm": 1.0859375, "learning_rate": 0.000494215517002413, "loss": 5.2705, "mean_token_accuracy": 0.1806552991271019, "num_tokens": 17742039.0, "step": 10225 }, { "entropy": 5.456445789337158, "epoch": 0.7959540945341373, "grad_norm": 1.015625, "learning_rate": 0.0004942092712269384, "loss": 5.1511, "mean_token_accuracy": 0.18822285979986192, "num_tokens": 17751474.0, "step": 10230 }, { "entropy": 5.447206926345825, "epoch": 0.7963431239058549, "grad_norm": 1.0859375, "learning_rate": 0.0004942030221253122, "loss": 5.1903, "mean_token_accuracy": 0.18511724174022676, "num_tokens": 17759483.0, "step": 10235 }, { "entropy": 5.4836524486541744, "epoch": 0.7967321532775724, "grad_norm": 1.0234375, "learning_rate": 0.0004941967696976289, "loss": 5.2939, "mean_token_accuracy": 0.1810133069753647, "num_tokens": 17768025.0, "step": 10240 }, { "entropy": 5.4718412399292, "epoch": 0.79712118264929, "grad_norm": 0.97265625, "learning_rate": 0.0004941905139439835, "loss": 5.1531, "mean_token_accuracy": 0.18505918383598327, "num_tokens": 17776861.0, "step": 10245 }, { "entropy": 5.498747777938843, "epoch": 0.7975102120210076, "grad_norm": 1.0390625, "learning_rate": 0.0004941842548644712, "loss": 5.2538, "mean_token_accuracy": 0.17710748314857483, "num_tokens": 17786221.0, "step": 10250 }, { "entropy": 5.562926197052002, "epoch": 0.7978992413927252, "grad_norm": 1.0390625, "learning_rate": 0.0004941779924591864, "loss": 5.2603, "mean_token_accuracy": 0.176000614464283, "num_tokens": 17794619.0, "step": 10255 }, { "entropy": 5.550110387802124, "epoch": 0.7982882707644428, "grad_norm": 0.99609375, "learning_rate": 0.0004941717267282244, "loss": 5.2465, "mean_token_accuracy": 0.1823251187801361, "num_tokens": 17803288.0, "step": 10260 }, { "entropy": 5.49508695602417, "epoch": 0.7986773001361602, "grad_norm": 1.0390625, "learning_rate": 0.0004941654576716806, "loss": 5.3158, "mean_token_accuracy": 0.17538532763719558, "num_tokens": 17812648.0, "step": 10265 }, { "entropy": 5.437483882904052, "epoch": 0.7990663295078778, "grad_norm": 0.9921875, "learning_rate": 0.0004941591852896495, "loss": 5.2226, "mean_token_accuracy": 0.18099601566791534, "num_tokens": 17821955.0, "step": 10270 }, { "entropy": 5.600523805618286, "epoch": 0.7994553588795954, "grad_norm": 1.078125, "learning_rate": 0.0004941529095822268, "loss": 5.2758, "mean_token_accuracy": 0.18520946353673934, "num_tokens": 17829987.0, "step": 10275 }, { "entropy": 5.5407407760620115, "epoch": 0.799844388251313, "grad_norm": 0.98046875, "learning_rate": 0.0004941466305495074, "loss": 5.2113, "mean_token_accuracy": 0.18505819141864777, "num_tokens": 17839298.0, "step": 10280 }, { "entropy": 5.515188550949096, "epoch": 0.8002334176230306, "grad_norm": 0.98828125, "learning_rate": 0.0004941403481915867, "loss": 5.2383, "mean_token_accuracy": 0.18134244829416274, "num_tokens": 17847950.0, "step": 10285 }, { "entropy": 5.56319785118103, "epoch": 0.800622446994748, "grad_norm": 1.171875, "learning_rate": 0.0004941340625085601, "loss": 5.3589, "mean_token_accuracy": 0.1775679975748062, "num_tokens": 17857416.0, "step": 10290 }, { "entropy": 5.57610125541687, "epoch": 0.8010114763664656, "grad_norm": 1.09375, "learning_rate": 0.0004941277735005228, "loss": 5.2326, "mean_token_accuracy": 0.18524153530597687, "num_tokens": 17866516.0, "step": 10295 }, { "entropy": 5.686208772659302, "epoch": 0.8014005057381832, "grad_norm": 0.9453125, "learning_rate": 0.0004941214811675702, "loss": 5.3703, "mean_token_accuracy": 0.16846894472837448, "num_tokens": 17875823.0, "step": 10300 }, { "entropy": 5.470689868927002, "epoch": 0.8017895351099008, "grad_norm": 0.984375, "learning_rate": 0.0004941151855097982, "loss": 5.2633, "mean_token_accuracy": 0.17882104218006134, "num_tokens": 17883597.0, "step": 10305 }, { "entropy": 5.540338087081909, "epoch": 0.8021785644816184, "grad_norm": 1.109375, "learning_rate": 0.0004941088865273018, "loss": 5.2553, "mean_token_accuracy": 0.1813419446349144, "num_tokens": 17892053.0, "step": 10310 }, { "entropy": 5.536828184127808, "epoch": 0.802567593853336, "grad_norm": 1.046875, "learning_rate": 0.0004941025842201769, "loss": 5.1699, "mean_token_accuracy": 0.19302378445863724, "num_tokens": 17900187.0, "step": 10315 }, { "entropy": 5.517774963378907, "epoch": 0.8029566232250535, "grad_norm": 1.0703125, "learning_rate": 0.0004940962785885189, "loss": 5.3039, "mean_token_accuracy": 0.18093325942754745, "num_tokens": 17908608.0, "step": 10320 }, { "entropy": 5.543877649307251, "epoch": 0.803345652596771, "grad_norm": 1.078125, "learning_rate": 0.0004940899696324237, "loss": 5.2076, "mean_token_accuracy": 0.18566497266292573, "num_tokens": 17917331.0, "step": 10325 }, { "entropy": 5.5741157054901125, "epoch": 0.8037346819684886, "grad_norm": 1.078125, "learning_rate": 0.0004940836573519868, "loss": 5.3273, "mean_token_accuracy": 0.17683515399694444, "num_tokens": 17925228.0, "step": 10330 }, { "entropy": 5.518237590789795, "epoch": 0.8041237113402062, "grad_norm": 1.1171875, "learning_rate": 0.0004940773417473043, "loss": 5.2027, "mean_token_accuracy": 0.18242159634828567, "num_tokens": 17934110.0, "step": 10335 }, { "entropy": 5.486883592605591, "epoch": 0.8045127407119238, "grad_norm": 1.1328125, "learning_rate": 0.0004940710228184717, "loss": 5.2034, "mean_token_accuracy": 0.1895246163010597, "num_tokens": 17942237.0, "step": 10340 }, { "entropy": 5.416420221328735, "epoch": 0.8049017700836413, "grad_norm": 1.03125, "learning_rate": 0.000494064700565585, "loss": 5.0525, "mean_token_accuracy": 0.19514681100845338, "num_tokens": 17951288.0, "step": 10345 }, { "entropy": 5.5492504119873045, "epoch": 0.8052907994553589, "grad_norm": 0.96484375, "learning_rate": 0.0004940583749887403, "loss": 5.3174, "mean_token_accuracy": 0.17359555810689925, "num_tokens": 17960300.0, "step": 10350 }, { "entropy": 5.520219182968139, "epoch": 0.8056798288270764, "grad_norm": 1.0390625, "learning_rate": 0.0004940520460880333, "loss": 5.2277, "mean_token_accuracy": 0.18028300404548644, "num_tokens": 17968745.0, "step": 10355 }, { "entropy": 5.483771753311157, "epoch": 0.806068858198794, "grad_norm": 1.0546875, "learning_rate": 0.0004940457138635601, "loss": 5.2086, "mean_token_accuracy": 0.18572815507650375, "num_tokens": 17976614.0, "step": 10360 }, { "entropy": 5.533941411972046, "epoch": 0.8064578875705116, "grad_norm": 0.98828125, "learning_rate": 0.0004940393783154169, "loss": 5.3552, "mean_token_accuracy": 0.17572933733463286, "num_tokens": 17984769.0, "step": 10365 }, { "entropy": 5.532326030731201, "epoch": 0.8068469169422291, "grad_norm": 1.0703125, "learning_rate": 0.0004940330394436999, "loss": 5.2203, "mean_token_accuracy": 0.17818196415901183, "num_tokens": 17992885.0, "step": 10370 }, { "entropy": 5.56777925491333, "epoch": 0.8072359463139467, "grad_norm": 1.0078125, "learning_rate": 0.000494026697248505, "loss": 5.2677, "mean_token_accuracy": 0.17265438586473464, "num_tokens": 18001752.0, "step": 10375 }, { "entropy": 5.485290384292602, "epoch": 0.8076249756856643, "grad_norm": 1.0078125, "learning_rate": 0.0004940203517299287, "loss": 5.2691, "mean_token_accuracy": 0.19104140996932983, "num_tokens": 18009939.0, "step": 10380 }, { "entropy": 5.590668630599976, "epoch": 0.8080140050573819, "grad_norm": 1.0625, "learning_rate": 0.000494014002888067, "loss": 5.2305, "mean_token_accuracy": 0.1888001725077629, "num_tokens": 18017993.0, "step": 10385 }, { "entropy": 5.589704084396362, "epoch": 0.8084030344290994, "grad_norm": 0.93359375, "learning_rate": 0.0004940076507230166, "loss": 5.3308, "mean_token_accuracy": 0.17223789691925048, "num_tokens": 18027564.0, "step": 10390 }, { "entropy": 5.5470452308654785, "epoch": 0.8087920638008169, "grad_norm": 0.9765625, "learning_rate": 0.0004940012952348735, "loss": 5.3163, "mean_token_accuracy": 0.17988236248493195, "num_tokens": 18036174.0, "step": 10395 }, { "entropy": 5.518140363693237, "epoch": 0.8091810931725345, "grad_norm": 1.0625, "learning_rate": 0.0004939949364237345, "loss": 5.2344, "mean_token_accuracy": 0.1769432783126831, "num_tokens": 18044994.0, "step": 10400 }, { "entropy": 5.4939652442932125, "epoch": 0.8095701225442521, "grad_norm": 0.99609375, "learning_rate": 0.0004939885742896958, "loss": 5.2331, "mean_token_accuracy": 0.18537245988845824, "num_tokens": 18053789.0, "step": 10405 }, { "entropy": 5.545763731002808, "epoch": 0.8099591519159697, "grad_norm": 0.95703125, "learning_rate": 0.000493982208832854, "loss": 5.3397, "mean_token_accuracy": 0.17665450274944305, "num_tokens": 18063483.0, "step": 10410 }, { "entropy": 5.495622825622559, "epoch": 0.8103481812876873, "grad_norm": 0.98828125, "learning_rate": 0.0004939758400533058, "loss": 5.1592, "mean_token_accuracy": 0.18515774309635163, "num_tokens": 18071952.0, "step": 10415 }, { "entropy": 5.533158159255981, "epoch": 0.8107372106594047, "grad_norm": 1.03125, "learning_rate": 0.0004939694679511478, "loss": 5.2193, "mean_token_accuracy": 0.18083717674016953, "num_tokens": 18080323.0, "step": 10420 }, { "entropy": 5.572932338714599, "epoch": 0.8111262400311223, "grad_norm": 0.9765625, "learning_rate": 0.0004939630925264765, "loss": 5.2991, "mean_token_accuracy": 0.18084833920001983, "num_tokens": 18089458.0, "step": 10425 }, { "entropy": 5.524190855026245, "epoch": 0.8115152694028399, "grad_norm": 1.03125, "learning_rate": 0.000493956713779389, "loss": 5.2323, "mean_token_accuracy": 0.17775349467992782, "num_tokens": 18098553.0, "step": 10430 }, { "entropy": 5.5187290668487545, "epoch": 0.8119042987745575, "grad_norm": 0.97265625, "learning_rate": 0.0004939503317099817, "loss": 5.3365, "mean_token_accuracy": 0.1775119349360466, "num_tokens": 18106794.0, "step": 10435 }, { "entropy": 5.5097943305969235, "epoch": 0.8122933281462751, "grad_norm": 1.0546875, "learning_rate": 0.0004939439463183517, "loss": 5.1791, "mean_token_accuracy": 0.18734371215105056, "num_tokens": 18115509.0, "step": 10440 }, { "entropy": 5.512284135818481, "epoch": 0.8126823575179926, "grad_norm": 0.98828125, "learning_rate": 0.0004939375576045958, "loss": 5.3379, "mean_token_accuracy": 0.17140595316886903, "num_tokens": 18124548.0, "step": 10445 }, { "entropy": 5.507675457000732, "epoch": 0.8130713868897101, "grad_norm": 1.0546875, "learning_rate": 0.0004939311655688109, "loss": 5.2516, "mean_token_accuracy": 0.18302631378173828, "num_tokens": 18132295.0, "step": 10450 }, { "entropy": 5.572723627090454, "epoch": 0.8134604162614277, "grad_norm": 1.0234375, "learning_rate": 0.0004939247702110941, "loss": 5.3501, "mean_token_accuracy": 0.17978764027357103, "num_tokens": 18140731.0, "step": 10455 }, { "entropy": 5.548423194885254, "epoch": 0.8138494456331453, "grad_norm": 0.9609375, "learning_rate": 0.0004939183715315423, "loss": 5.2079, "mean_token_accuracy": 0.17964233756065368, "num_tokens": 18149834.0, "step": 10460 }, { "entropy": 5.495258569717407, "epoch": 0.8142384750048629, "grad_norm": 1.546875, "learning_rate": 0.0004939119695302526, "loss": 5.1578, "mean_token_accuracy": 0.19515212625265121, "num_tokens": 18158745.0, "step": 10465 }, { "entropy": 5.548329257965088, "epoch": 0.8146275043765804, "grad_norm": 0.984375, "learning_rate": 0.0004939055642073224, "loss": 5.3692, "mean_token_accuracy": 0.1716637134552002, "num_tokens": 18168292.0, "step": 10470 }, { "entropy": 5.56255202293396, "epoch": 0.815016533748298, "grad_norm": 1.015625, "learning_rate": 0.0004938991555628484, "loss": 5.2532, "mean_token_accuracy": 0.17926523983478546, "num_tokens": 18177592.0, "step": 10475 }, { "entropy": 5.5586060047149655, "epoch": 0.8154055631200156, "grad_norm": 0.953125, "learning_rate": 0.0004938927435969283, "loss": 5.2287, "mean_token_accuracy": 0.17944108843803405, "num_tokens": 18186845.0, "step": 10480 }, { "entropy": 5.5468464374542235, "epoch": 0.8157945924917331, "grad_norm": 0.875, "learning_rate": 0.0004938863283096592, "loss": 5.3055, "mean_token_accuracy": 0.17784848362207412, "num_tokens": 18195417.0, "step": 10485 }, { "entropy": 5.515537309646606, "epoch": 0.8161836218634507, "grad_norm": 0.9609375, "learning_rate": 0.0004938799097011384, "loss": 5.253, "mean_token_accuracy": 0.17400613576173782, "num_tokens": 18204009.0, "step": 10490 }, { "entropy": 5.473901987075806, "epoch": 0.8165726512351682, "grad_norm": 1.0546875, "learning_rate": 0.0004938734877714634, "loss": 5.2413, "mean_token_accuracy": 0.18992074877023696, "num_tokens": 18211927.0, "step": 10495 }, { "entropy": 5.45009126663208, "epoch": 0.8169616806068858, "grad_norm": 0.96484375, "learning_rate": 0.0004938670625207317, "loss": 5.1457, "mean_token_accuracy": 0.19298693537712097, "num_tokens": 18220394.0, "step": 10500 }, { "entropy": 5.552124547958374, "epoch": 0.8173507099786034, "grad_norm": 0.8359375, "learning_rate": 0.0004938606339490406, "loss": 5.2917, "mean_token_accuracy": 0.17335651069879532, "num_tokens": 18229803.0, "step": 10505 }, { "entropy": 5.518917560577393, "epoch": 0.817739739350321, "grad_norm": 1.0234375, "learning_rate": 0.0004938542020564877, "loss": 5.2279, "mean_token_accuracy": 0.17800362557172775, "num_tokens": 18238431.0, "step": 10510 }, { "entropy": 5.5230601787567135, "epoch": 0.8181287687220385, "grad_norm": 0.9140625, "learning_rate": 0.0004938477668431706, "loss": 5.2392, "mean_token_accuracy": 0.17746342867612838, "num_tokens": 18246745.0, "step": 10515 }, { "entropy": 5.480632257461548, "epoch": 0.8185177980937561, "grad_norm": 0.97265625, "learning_rate": 0.0004938413283091871, "loss": 5.2183, "mean_token_accuracy": 0.18608786910772324, "num_tokens": 18255569.0, "step": 10520 }, { "entropy": 5.469953632354736, "epoch": 0.8189068274654736, "grad_norm": 1.0703125, "learning_rate": 0.0004938348864546347, "loss": 5.1567, "mean_token_accuracy": 0.1849908411502838, "num_tokens": 18263711.0, "step": 10525 }, { "entropy": 5.583718156814575, "epoch": 0.8192958568371912, "grad_norm": 1.0078125, "learning_rate": 0.0004938284412796111, "loss": 5.3316, "mean_token_accuracy": 0.17977374792099, "num_tokens": 18272220.0, "step": 10530 }, { "entropy": 5.555262422561645, "epoch": 0.8196848862089088, "grad_norm": 1.0234375, "learning_rate": 0.0004938219927842144, "loss": 5.2566, "mean_token_accuracy": 0.1780171886086464, "num_tokens": 18281107.0, "step": 10535 }, { "entropy": 5.443024396896362, "epoch": 0.8200739155806264, "grad_norm": 1.03125, "learning_rate": 0.0004938155409685422, "loss": 5.1964, "mean_token_accuracy": 0.1803828850388527, "num_tokens": 18290196.0, "step": 10540 }, { "entropy": 5.563018894195556, "epoch": 0.820462944952344, "grad_norm": 0.9375, "learning_rate": 0.0004938090858326923, "loss": 5.3609, "mean_token_accuracy": 0.17621267437934876, "num_tokens": 18299418.0, "step": 10545 }, { "entropy": 5.4341593265533445, "epoch": 0.8208519743240614, "grad_norm": 1.0, "learning_rate": 0.000493802627376763, "loss": 5.0758, "mean_token_accuracy": 0.19273562878370284, "num_tokens": 18308171.0, "step": 10550 }, { "entropy": 5.545320129394531, "epoch": 0.821241003695779, "grad_norm": 0.96484375, "learning_rate": 0.0004937961656008518, "loss": 5.2637, "mean_token_accuracy": 0.18465346693992615, "num_tokens": 18317144.0, "step": 10555 }, { "entropy": 5.504968452453613, "epoch": 0.8216300330674966, "grad_norm": 1.109375, "learning_rate": 0.0004937897005050573, "loss": 5.3212, "mean_token_accuracy": 0.174219810962677, "num_tokens": 18326648.0, "step": 10560 }, { "entropy": 5.586262607574463, "epoch": 0.8220190624392142, "grad_norm": 0.9609375, "learning_rate": 0.0004937832320894772, "loss": 5.2856, "mean_token_accuracy": 0.1842420592904091, "num_tokens": 18335901.0, "step": 10565 }, { "entropy": 5.5241379737854, "epoch": 0.8224080918109318, "grad_norm": 1.0, "learning_rate": 0.0004937767603542098, "loss": 5.2176, "mean_token_accuracy": 0.18384616076946259, "num_tokens": 18344905.0, "step": 10570 }, { "entropy": 5.400670337677002, "epoch": 0.8227971211826492, "grad_norm": 1.09375, "learning_rate": 0.0004937702852993534, "loss": 5.1834, "mean_token_accuracy": 0.18505437076091766, "num_tokens": 18353422.0, "step": 10575 }, { "entropy": 5.623508930206299, "epoch": 0.8231861505543668, "grad_norm": 1.015625, "learning_rate": 0.000493763806925006, "loss": 5.3476, "mean_token_accuracy": 0.1682771250605583, "num_tokens": 18361632.0, "step": 10580 }, { "entropy": 5.5058276653289795, "epoch": 0.8235751799260844, "grad_norm": 1.0625, "learning_rate": 0.0004937573252312661, "loss": 5.1707, "mean_token_accuracy": 0.18854219019412993, "num_tokens": 18370142.0, "step": 10585 }, { "entropy": 5.460853004455567, "epoch": 0.823964209297802, "grad_norm": 1.0703125, "learning_rate": 0.000493750840218232, "loss": 5.2213, "mean_token_accuracy": 0.18526131808757781, "num_tokens": 18378245.0, "step": 10590 }, { "entropy": 5.455828857421875, "epoch": 0.8243532386695196, "grad_norm": 1.03125, "learning_rate": 0.0004937443518860021, "loss": 5.1674, "mean_token_accuracy": 0.19393967539072038, "num_tokens": 18386814.0, "step": 10595 }, { "entropy": 5.486950349807739, "epoch": 0.8247422680412371, "grad_norm": 1.0234375, "learning_rate": 0.0004937378602346747, "loss": 5.2098, "mean_token_accuracy": 0.18319108188152314, "num_tokens": 18396276.0, "step": 10600 }, { "entropy": 5.513377285003662, "epoch": 0.8251312974129547, "grad_norm": 0.9921875, "learning_rate": 0.0004937313652643485, "loss": 5.2074, "mean_token_accuracy": 0.18300096243619918, "num_tokens": 18404445.0, "step": 10605 }, { "entropy": 5.473362779617309, "epoch": 0.8255203267846722, "grad_norm": 0.9453125, "learning_rate": 0.000493724866975122, "loss": 5.1082, "mean_token_accuracy": 0.19147297292947768, "num_tokens": 18412870.0, "step": 10610 }, { "entropy": 5.457271242141724, "epoch": 0.8259093561563898, "grad_norm": 1.015625, "learning_rate": 0.0004937183653670937, "loss": 5.2377, "mean_token_accuracy": 0.1834545314311981, "num_tokens": 18421084.0, "step": 10615 }, { "entropy": 5.488525485992431, "epoch": 0.8262983855281074, "grad_norm": 0.9765625, "learning_rate": 0.0004937118604403623, "loss": 5.2694, "mean_token_accuracy": 0.18045677989721298, "num_tokens": 18429869.0, "step": 10620 }, { "entropy": 5.469416713714599, "epoch": 0.8266874148998249, "grad_norm": 1.03125, "learning_rate": 0.0004937053521950266, "loss": 5.1235, "mean_token_accuracy": 0.1888294294476509, "num_tokens": 18438747.0, "step": 10625 }, { "entropy": 5.575805711746216, "epoch": 0.8270764442715425, "grad_norm": 1.0078125, "learning_rate": 0.0004936988406311854, "loss": 5.3393, "mean_token_accuracy": 0.1764020264148712, "num_tokens": 18447241.0, "step": 10630 }, { "entropy": 5.566258335113526, "epoch": 0.8274654736432601, "grad_norm": 1.015625, "learning_rate": 0.0004936923257489373, "loss": 5.368, "mean_token_accuracy": 0.1733730487525463, "num_tokens": 18455757.0, "step": 10635 }, { "entropy": 5.452841806411743, "epoch": 0.8278545030149776, "grad_norm": 1.1484375, "learning_rate": 0.0004936858075483811, "loss": 5.2054, "mean_token_accuracy": 0.18939414173364638, "num_tokens": 18463863.0, "step": 10640 }, { "entropy": 5.515326309204101, "epoch": 0.8282435323866952, "grad_norm": 1.0234375, "learning_rate": 0.000493679286029616, "loss": 5.3767, "mean_token_accuracy": 0.17099584639072418, "num_tokens": 18472396.0, "step": 10645 }, { "entropy": 5.525100374221802, "epoch": 0.8286325617584127, "grad_norm": 1.0625, "learning_rate": 0.0004936727611927407, "loss": 5.2165, "mean_token_accuracy": 0.17811322212219238, "num_tokens": 18480625.0, "step": 10650 }, { "entropy": 5.562239694595337, "epoch": 0.8290215911301303, "grad_norm": 1.109375, "learning_rate": 0.0004936662330378546, "loss": 5.3006, "mean_token_accuracy": 0.17215192317962646, "num_tokens": 18489878.0, "step": 10655 }, { "entropy": 5.477266502380371, "epoch": 0.8294106205018479, "grad_norm": 1.09375, "learning_rate": 0.0004936597015650561, "loss": 5.1832, "mean_token_accuracy": 0.1818031132221222, "num_tokens": 18498873.0, "step": 10660 }, { "entropy": 5.581141328811645, "epoch": 0.8297996498735655, "grad_norm": 0.9609375, "learning_rate": 0.0004936531667744448, "loss": 5.3044, "mean_token_accuracy": 0.17189468294382096, "num_tokens": 18507716.0, "step": 10665 }, { "entropy": 5.526222467422485, "epoch": 0.8301886792452831, "grad_norm": 1.015625, "learning_rate": 0.0004936466286661197, "loss": 5.1361, "mean_token_accuracy": 0.19360337406396866, "num_tokens": 18516547.0, "step": 10670 }, { "entropy": 5.497167253494263, "epoch": 0.8305777086170005, "grad_norm": 0.98046875, "learning_rate": 0.00049364008724018, "loss": 5.3089, "mean_token_accuracy": 0.17162499725818633, "num_tokens": 18525714.0, "step": 10675 }, { "entropy": 5.53640923500061, "epoch": 0.8309667379887181, "grad_norm": 1.0, "learning_rate": 0.000493633542496725, "loss": 5.309, "mean_token_accuracy": 0.18378836363554002, "num_tokens": 18534981.0, "step": 10680 }, { "entropy": 5.555391693115235, "epoch": 0.8313557673604357, "grad_norm": 1.0078125, "learning_rate": 0.0004936269944358539, "loss": 5.2372, "mean_token_accuracy": 0.1816426083445549, "num_tokens": 18543599.0, "step": 10685 }, { "entropy": 5.531301832199096, "epoch": 0.8317447967321533, "grad_norm": 1.0703125, "learning_rate": 0.0004936204430576664, "loss": 5.2161, "mean_token_accuracy": 0.19287829101085663, "num_tokens": 18552207.0, "step": 10690 }, { "entropy": 5.5213829517364506, "epoch": 0.8321338261038709, "grad_norm": 1.078125, "learning_rate": 0.0004936138883622614, "loss": 5.2784, "mean_token_accuracy": 0.17875639349222183, "num_tokens": 18560421.0, "step": 10695 }, { "entropy": 5.5118410110473635, "epoch": 0.8325228554755884, "grad_norm": 1.0390625, "learning_rate": 0.0004936073303497387, "loss": 5.1751, "mean_token_accuracy": 0.19057928621768952, "num_tokens": 18568812.0, "step": 10700 }, { "entropy": 5.538961935043335, "epoch": 0.8329118848473059, "grad_norm": 1.03125, "learning_rate": 0.0004936007690201976, "loss": 5.1693, "mean_token_accuracy": 0.1845633402466774, "num_tokens": 18577077.0, "step": 10705 }, { "entropy": 5.534031057357788, "epoch": 0.8333009142190235, "grad_norm": 1.0234375, "learning_rate": 0.000493594204373738, "loss": 5.2855, "mean_token_accuracy": 0.1833686888217926, "num_tokens": 18585754.0, "step": 10710 }, { "entropy": 5.451153326034546, "epoch": 0.8336899435907411, "grad_norm": 1.0546875, "learning_rate": 0.0004935876364104591, "loss": 5.1586, "mean_token_accuracy": 0.18742357790470124, "num_tokens": 18594578.0, "step": 10715 }, { "entropy": 5.50913782119751, "epoch": 0.8340789729624587, "grad_norm": 1.015625, "learning_rate": 0.0004935810651304608, "loss": 5.2696, "mean_token_accuracy": 0.1779214471578598, "num_tokens": 18603810.0, "step": 10720 }, { "entropy": 5.584120893478394, "epoch": 0.8344680023341763, "grad_norm": 1.1328125, "learning_rate": 0.0004935744905338427, "loss": 5.2548, "mean_token_accuracy": 0.17679615169763566, "num_tokens": 18612870.0, "step": 10725 }, { "entropy": 5.5331045627594, "epoch": 0.8348570317058938, "grad_norm": 1.015625, "learning_rate": 0.0004935679126207046, "loss": 5.3166, "mean_token_accuracy": 0.18553537577390672, "num_tokens": 18621353.0, "step": 10730 }, { "entropy": 5.4190631866455075, "epoch": 0.8352460610776113, "grad_norm": 1.015625, "learning_rate": 0.0004935613313911463, "loss": 5.194, "mean_token_accuracy": 0.18473349660634994, "num_tokens": 18630152.0, "step": 10735 }, { "entropy": 5.521461820602417, "epoch": 0.8356350904493289, "grad_norm": 1.0546875, "learning_rate": 0.0004935547468452678, "loss": 5.2241, "mean_token_accuracy": 0.18360739797353745, "num_tokens": 18639278.0, "step": 10740 }, { "entropy": 5.555802249908448, "epoch": 0.8360241198210465, "grad_norm": 0.98828125, "learning_rate": 0.0004935481589831688, "loss": 5.2162, "mean_token_accuracy": 0.18533399254083632, "num_tokens": 18647436.0, "step": 10745 }, { "entropy": 5.601387405395508, "epoch": 0.8364131491927641, "grad_norm": 0.98828125, "learning_rate": 0.0004935415678049492, "loss": 5.2499, "mean_token_accuracy": 0.17724067270755767, "num_tokens": 18655532.0, "step": 10750 }, { "entropy": 5.537352180480957, "epoch": 0.8368021785644816, "grad_norm": 0.9921875, "learning_rate": 0.0004935349733107094, "loss": 5.2744, "mean_token_accuracy": 0.1799388647079468, "num_tokens": 18664827.0, "step": 10755 }, { "entropy": 5.4854682922363285, "epoch": 0.8371912079361992, "grad_norm": 1.015625, "learning_rate": 0.000493528375500549, "loss": 5.2086, "mean_token_accuracy": 0.18650708496570587, "num_tokens": 18673535.0, "step": 10760 }, { "entropy": 5.510537576675415, "epoch": 0.8375802373079168, "grad_norm": 1.0, "learning_rate": 0.0004935217743745685, "loss": 5.3659, "mean_token_accuracy": 0.17413615733385085, "num_tokens": 18682223.0, "step": 10765 }, { "entropy": 5.559633684158325, "epoch": 0.8379692666796343, "grad_norm": 1.0625, "learning_rate": 0.0004935151699328677, "loss": 5.2556, "mean_token_accuracy": 0.1875689744949341, "num_tokens": 18690847.0, "step": 10770 }, { "entropy": 5.5838761806488035, "epoch": 0.8383582960513519, "grad_norm": 0.98046875, "learning_rate": 0.0004935085621755471, "loss": 5.2725, "mean_token_accuracy": 0.17889762818813323, "num_tokens": 18699658.0, "step": 10775 }, { "entropy": 5.533626461029053, "epoch": 0.8387473254230694, "grad_norm": 1.0078125, "learning_rate": 0.000493501951102707, "loss": 5.2492, "mean_token_accuracy": 0.18166961520910263, "num_tokens": 18708396.0, "step": 10780 }, { "entropy": 5.496837949752807, "epoch": 0.839136354794787, "grad_norm": 0.98828125, "learning_rate": 0.0004934953367144474, "loss": 5.2408, "mean_token_accuracy": 0.17843814045190812, "num_tokens": 18717185.0, "step": 10785 }, { "entropy": 5.582412338256836, "epoch": 0.8395253841665046, "grad_norm": 0.95703125, "learning_rate": 0.0004934887190108688, "loss": 5.2123, "mean_token_accuracy": 0.18401899188756943, "num_tokens": 18725493.0, "step": 10790 }, { "entropy": 5.486806869506836, "epoch": 0.8399144135382222, "grad_norm": 1.015625, "learning_rate": 0.0004934820979920719, "loss": 5.1954, "mean_token_accuracy": 0.18325147032737732, "num_tokens": 18733843.0, "step": 10795 }, { "entropy": 5.475360250473022, "epoch": 0.8403034429099397, "grad_norm": 1.0546875, "learning_rate": 0.0004934754736581567, "loss": 5.2681, "mean_token_accuracy": 0.18146816045045852, "num_tokens": 18742226.0, "step": 10800 }, { "entropy": 5.597898674011231, "epoch": 0.8406924722816572, "grad_norm": 1.0859375, "learning_rate": 0.000493468846009224, "loss": 5.3813, "mean_token_accuracy": 0.1761290743947029, "num_tokens": 18751117.0, "step": 10805 }, { "entropy": 5.513488149642944, "epoch": 0.8410815016533748, "grad_norm": 1.109375, "learning_rate": 0.0004934622150453742, "loss": 5.2211, "mean_token_accuracy": 0.17858361303806305, "num_tokens": 18759244.0, "step": 10810 }, { "entropy": 5.502654933929444, "epoch": 0.8414705310250924, "grad_norm": 1.015625, "learning_rate": 0.000493455580766708, "loss": 5.2821, "mean_token_accuracy": 0.18030345290899277, "num_tokens": 18768107.0, "step": 10815 }, { "entropy": 5.484202480316162, "epoch": 0.84185956039681, "grad_norm": 0.953125, "learning_rate": 0.0004934489431733262, "loss": 5.1104, "mean_token_accuracy": 0.19423711597919463, "num_tokens": 18777419.0, "step": 10820 }, { "entropy": 5.521036434173584, "epoch": 0.8422485897685276, "grad_norm": 0.9609375, "learning_rate": 0.0004934423022653293, "loss": 5.2573, "mean_token_accuracy": 0.18132425993680953, "num_tokens": 18786410.0, "step": 10825 }, { "entropy": 5.501943445205688, "epoch": 0.842637619140245, "grad_norm": 1.046875, "learning_rate": 0.0004934356580428182, "loss": 5.2086, "mean_token_accuracy": 0.1836457222700119, "num_tokens": 18794409.0, "step": 10830 }, { "entropy": 5.490910148620605, "epoch": 0.8430266485119626, "grad_norm": 1.0859375, "learning_rate": 0.0004934290105058937, "loss": 5.2655, "mean_token_accuracy": 0.18286220133304595, "num_tokens": 18803561.0, "step": 10835 }, { "entropy": 5.544584703445435, "epoch": 0.8434156778836802, "grad_norm": 1.0078125, "learning_rate": 0.0004934223596546565, "loss": 5.2458, "mean_token_accuracy": 0.17819162011146544, "num_tokens": 18812096.0, "step": 10840 }, { "entropy": 5.548625659942627, "epoch": 0.8438047072553978, "grad_norm": 1.0625, "learning_rate": 0.0004934157054892077, "loss": 5.2553, "mean_token_accuracy": 0.17984436303377152, "num_tokens": 18820506.0, "step": 10845 }, { "entropy": 5.530626726150513, "epoch": 0.8441937366271154, "grad_norm": 1.015625, "learning_rate": 0.0004934090480096482, "loss": 5.2525, "mean_token_accuracy": 0.17914716750383378, "num_tokens": 18829437.0, "step": 10850 }, { "entropy": 5.618945980072022, "epoch": 0.8445827659988329, "grad_norm": 0.9765625, "learning_rate": 0.0004934023872160791, "loss": 5.3565, "mean_token_accuracy": 0.17798216491937638, "num_tokens": 18838759.0, "step": 10855 }, { "entropy": 5.516262054443359, "epoch": 0.8449717953705504, "grad_norm": 1.09375, "learning_rate": 0.0004933957231086014, "loss": 5.2577, "mean_token_accuracy": 0.18267624825239182, "num_tokens": 18847000.0, "step": 10860 }, { "entropy": 5.5687525272369385, "epoch": 0.845360824742268, "grad_norm": 1.03125, "learning_rate": 0.0004933890556873161, "loss": 5.3341, "mean_token_accuracy": 0.17565296590328217, "num_tokens": 18855370.0, "step": 10865 }, { "entropy": 5.623536205291748, "epoch": 0.8457498541139856, "grad_norm": 1.0234375, "learning_rate": 0.0004933823849523246, "loss": 5.3983, "mean_token_accuracy": 0.17589483112096788, "num_tokens": 18863825.0, "step": 10870 }, { "entropy": 5.553670740127563, "epoch": 0.8461388834857032, "grad_norm": 1.078125, "learning_rate": 0.0004933757109037279, "loss": 5.1489, "mean_token_accuracy": 0.18384287804365157, "num_tokens": 18872088.0, "step": 10875 }, { "entropy": 5.4881998062133786, "epoch": 0.8465279128574207, "grad_norm": 1.0546875, "learning_rate": 0.0004933690335416274, "loss": 5.1226, "mean_token_accuracy": 0.19425577968358992, "num_tokens": 18880472.0, "step": 10880 }, { "entropy": 5.5492349624633786, "epoch": 0.8469169422291383, "grad_norm": 0.9921875, "learning_rate": 0.0004933623528661245, "loss": 5.3546, "mean_token_accuracy": 0.18020178079605104, "num_tokens": 18889822.0, "step": 10885 }, { "entropy": 5.597208452224732, "epoch": 0.8473059716008559, "grad_norm": 1.0390625, "learning_rate": 0.0004933556688773203, "loss": 5.2687, "mean_token_accuracy": 0.17932482808828354, "num_tokens": 18897542.0, "step": 10890 }, { "entropy": 5.494821405410766, "epoch": 0.8476950009725734, "grad_norm": 1.015625, "learning_rate": 0.0004933489815753165, "loss": 5.3142, "mean_token_accuracy": 0.18156346529722214, "num_tokens": 18906330.0, "step": 10895 }, { "entropy": 5.4891034126281735, "epoch": 0.848084030344291, "grad_norm": 1.0859375, "learning_rate": 0.0004933422909602143, "loss": 5.157, "mean_token_accuracy": 0.1887126922607422, "num_tokens": 18914176.0, "step": 10900 }, { "entropy": 5.498832654953003, "epoch": 0.8484730597160085, "grad_norm": 1.0859375, "learning_rate": 0.0004933355970321155, "loss": 5.1935, "mean_token_accuracy": 0.1920697271823883, "num_tokens": 18922233.0, "step": 10905 }, { "entropy": 5.429089784622192, "epoch": 0.8488620890877261, "grad_norm": 1.0078125, "learning_rate": 0.0004933288997911215, "loss": 5.2217, "mean_token_accuracy": 0.19002021998167037, "num_tokens": 18930742.0, "step": 10910 }, { "entropy": 5.4977398872375485, "epoch": 0.8492511184594437, "grad_norm": 0.9921875, "learning_rate": 0.0004933221992373338, "loss": 5.1734, "mean_token_accuracy": 0.18518896847963334, "num_tokens": 18938879.0, "step": 10915 }, { "entropy": 5.63766450881958, "epoch": 0.8496401478311613, "grad_norm": 1.0390625, "learning_rate": 0.0004933154953708544, "loss": 5.3379, "mean_token_accuracy": 0.1669734850525856, "num_tokens": 18947753.0, "step": 10920 }, { "entropy": 5.55344524383545, "epoch": 0.8500291772028788, "grad_norm": 1.03125, "learning_rate": 0.0004933087881917848, "loss": 5.2195, "mean_token_accuracy": 0.1844613716006279, "num_tokens": 18956805.0, "step": 10925 }, { "entropy": 5.469668531417847, "epoch": 0.8504182065745964, "grad_norm": 1.0546875, "learning_rate": 0.0004933020777002268, "loss": 5.2048, "mean_token_accuracy": 0.1851271629333496, "num_tokens": 18965683.0, "step": 10930 }, { "entropy": 5.454330015182495, "epoch": 0.8508072359463139, "grad_norm": 1.0234375, "learning_rate": 0.0004932953638962823, "loss": 5.1858, "mean_token_accuracy": 0.1860030099749565, "num_tokens": 18973873.0, "step": 10935 }, { "entropy": 5.41184368133545, "epoch": 0.8511962653180315, "grad_norm": 0.98828125, "learning_rate": 0.000493288646780053, "loss": 5.1488, "mean_token_accuracy": 0.19341349899768828, "num_tokens": 18982097.0, "step": 10940 }, { "entropy": 5.487702560424805, "epoch": 0.8515852946897491, "grad_norm": 1.0, "learning_rate": 0.0004932819263516409, "loss": 5.2116, "mean_token_accuracy": 0.18670538663864136, "num_tokens": 18991019.0, "step": 10945 }, { "entropy": 5.554580593109131, "epoch": 0.8519743240614667, "grad_norm": 1.046875, "learning_rate": 0.0004932752026111481, "loss": 5.2009, "mean_token_accuracy": 0.18312293142080308, "num_tokens": 18999231.0, "step": 10950 }, { "entropy": 5.587560081481934, "epoch": 0.8523633534331843, "grad_norm": 0.96484375, "learning_rate": 0.0004932684755586765, "loss": 5.287, "mean_token_accuracy": 0.18160576224327088, "num_tokens": 19007807.0, "step": 10955 }, { "entropy": 5.480493640899658, "epoch": 0.8527523828049017, "grad_norm": 0.90625, "learning_rate": 0.0004932617451943282, "loss": 5.2473, "mean_token_accuracy": 0.18558285981416703, "num_tokens": 19017908.0, "step": 10960 }, { "entropy": 5.469510173797607, "epoch": 0.8531414121766193, "grad_norm": 1.0234375, "learning_rate": 0.0004932550115182053, "loss": 5.2601, "mean_token_accuracy": 0.17624861299991607, "num_tokens": 19026999.0, "step": 10965 }, { "entropy": 5.4247050285339355, "epoch": 0.8535304415483369, "grad_norm": 1.015625, "learning_rate": 0.00049324827453041, "loss": 5.1681, "mean_token_accuracy": 0.19363855123519896, "num_tokens": 19035738.0, "step": 10970 }, { "entropy": 5.508329296112061, "epoch": 0.8539194709200545, "grad_norm": 0.92578125, "learning_rate": 0.0004932415342310446, "loss": 5.2506, "mean_token_accuracy": 0.18268280923366548, "num_tokens": 19044530.0, "step": 10975 }, { "entropy": 5.496972179412841, "epoch": 0.8543085002917721, "grad_norm": 0.9453125, "learning_rate": 0.0004932347906202111, "loss": 5.2457, "mean_token_accuracy": 0.18446119278669357, "num_tokens": 19053306.0, "step": 10980 }, { "entropy": 5.546014213562012, "epoch": 0.8546975296634896, "grad_norm": 0.984375, "learning_rate": 0.000493228043698012, "loss": 5.249, "mean_token_accuracy": 0.18092696666717528, "num_tokens": 19062172.0, "step": 10985 }, { "entropy": 5.394056940078736, "epoch": 0.8550865590352071, "grad_norm": 0.9921875, "learning_rate": 0.0004932212934645498, "loss": 5.0301, "mean_token_accuracy": 0.19833163619041444, "num_tokens": 19070804.0, "step": 10990 }, { "entropy": 5.4976770877838135, "epoch": 0.8554755884069247, "grad_norm": 1.0625, "learning_rate": 0.0004932145399199268, "loss": 5.1809, "mean_token_accuracy": 0.1927813172340393, "num_tokens": 19079055.0, "step": 10995 }, { "entropy": 5.478790521621704, "epoch": 0.8558646177786423, "grad_norm": 1.0234375, "learning_rate": 0.0004932077830642455, "loss": 5.1709, "mean_token_accuracy": 0.18684402257204055, "num_tokens": 19087459.0, "step": 11000 }, { "entropy": 5.403890085220337, "epoch": 0.8562536471503599, "grad_norm": 0.9921875, "learning_rate": 0.0004932010228976084, "loss": 5.0704, "mean_token_accuracy": 0.19461153149604798, "num_tokens": 19096271.0, "step": 11005 }, { "entropy": 5.543984127044678, "epoch": 0.8566426765220774, "grad_norm": 1.078125, "learning_rate": 0.000493194259420118, "loss": 5.2537, "mean_token_accuracy": 0.18116909116506577, "num_tokens": 19105257.0, "step": 11010 }, { "entropy": 5.544920301437378, "epoch": 0.857031705893795, "grad_norm": 1.0859375, "learning_rate": 0.000493187492631877, "loss": 5.2105, "mean_token_accuracy": 0.18167287707328797, "num_tokens": 19113673.0, "step": 11015 }, { "entropy": 5.49640679359436, "epoch": 0.8574207352655125, "grad_norm": 1.0078125, "learning_rate": 0.0004931807225329882, "loss": 5.1895, "mean_token_accuracy": 0.19010575115680695, "num_tokens": 19121635.0, "step": 11020 }, { "entropy": 5.4921159744262695, "epoch": 0.8578097646372301, "grad_norm": 1.046875, "learning_rate": 0.0004931739491235541, "loss": 5.2359, "mean_token_accuracy": 0.18837591856718064, "num_tokens": 19130097.0, "step": 11025 }, { "entropy": 5.416061639785767, "epoch": 0.8581987940089477, "grad_norm": 0.9765625, "learning_rate": 0.0004931671724036777, "loss": 5.1326, "mean_token_accuracy": 0.18797099143266677, "num_tokens": 19138349.0, "step": 11030 }, { "entropy": 5.472230243682861, "epoch": 0.8585878233806652, "grad_norm": 0.9765625, "learning_rate": 0.0004931603923734616, "loss": 5.2444, "mean_token_accuracy": 0.1841167226433754, "num_tokens": 19146948.0, "step": 11035 }, { "entropy": 5.46871771812439, "epoch": 0.8589768527523828, "grad_norm": 1.078125, "learning_rate": 0.0004931536090330088, "loss": 5.1838, "mean_token_accuracy": 0.18804343342781066, "num_tokens": 19155372.0, "step": 11040 }, { "entropy": 5.577030754089355, "epoch": 0.8593658821241004, "grad_norm": 1.0625, "learning_rate": 0.0004931468223824222, "loss": 5.2855, "mean_token_accuracy": 0.18030109703540803, "num_tokens": 19163634.0, "step": 11045 }, { "entropy": 5.608681106567383, "epoch": 0.859754911495818, "grad_norm": 1.046875, "learning_rate": 0.0004931400324218048, "loss": 5.2925, "mean_token_accuracy": 0.18096405267715454, "num_tokens": 19171582.0, "step": 11050 }, { "entropy": 5.535055875778198, "epoch": 0.8601439408675355, "grad_norm": 0.984375, "learning_rate": 0.0004931332391512597, "loss": 5.2885, "mean_token_accuracy": 0.1742120563983917, "num_tokens": 19181136.0, "step": 11055 }, { "entropy": 5.5254779815673825, "epoch": 0.860532970239253, "grad_norm": 1.0703125, "learning_rate": 0.0004931264425708897, "loss": 5.2943, "mean_token_accuracy": 0.17675415575504302, "num_tokens": 19189389.0, "step": 11060 }, { "entropy": 5.567512035369873, "epoch": 0.8609219996109706, "grad_norm": 1.0859375, "learning_rate": 0.0004931196426807983, "loss": 5.2729, "mean_token_accuracy": 0.18563970774412156, "num_tokens": 19198315.0, "step": 11065 }, { "entropy": 5.635182809829712, "epoch": 0.8613110289826882, "grad_norm": 1.03125, "learning_rate": 0.0004931128394810884, "loss": 5.3104, "mean_token_accuracy": 0.18029538840055465, "num_tokens": 19207234.0, "step": 11070 }, { "entropy": 5.53159761428833, "epoch": 0.8617000583544058, "grad_norm": 1.0078125, "learning_rate": 0.0004931060329718634, "loss": 5.3057, "mean_token_accuracy": 0.1738320544362068, "num_tokens": 19216552.0, "step": 11075 }, { "entropy": 5.520693016052246, "epoch": 0.8620890877261234, "grad_norm": 1.046875, "learning_rate": 0.0004930992231532265, "loss": 5.2493, "mean_token_accuracy": 0.17551143020391463, "num_tokens": 19225237.0, "step": 11080 }, { "entropy": 5.4782130241394045, "epoch": 0.8624781170978408, "grad_norm": 1.03125, "learning_rate": 0.000493092410025281, "loss": 5.1561, "mean_token_accuracy": 0.19068157225847243, "num_tokens": 19233246.0, "step": 11085 }, { "entropy": 5.469943284988403, "epoch": 0.8628671464695584, "grad_norm": 0.95703125, "learning_rate": 0.0004930855935881302, "loss": 5.1949, "mean_token_accuracy": 0.18538690656423568, "num_tokens": 19241748.0, "step": 11090 }, { "entropy": 5.564651346206665, "epoch": 0.863256175841276, "grad_norm": 1.09375, "learning_rate": 0.0004930787738418777, "loss": 5.3381, "mean_token_accuracy": 0.172633595764637, "num_tokens": 19250259.0, "step": 11095 }, { "entropy": 5.6136962413787845, "epoch": 0.8636452052129936, "grad_norm": 1.0078125, "learning_rate": 0.0004930719507866269, "loss": 5.4102, "mean_token_accuracy": 0.17569374442100524, "num_tokens": 19259266.0, "step": 11100 }, { "entropy": 5.580073738098145, "epoch": 0.8640342345847112, "grad_norm": 0.98046875, "learning_rate": 0.0004930651244224814, "loss": 5.229, "mean_token_accuracy": 0.18021745830774308, "num_tokens": 19268099.0, "step": 11105 }, { "entropy": 5.487906885147095, "epoch": 0.8644232639564287, "grad_norm": 1.0390625, "learning_rate": 0.0004930582947495448, "loss": 5.1344, "mean_token_accuracy": 0.18870663344860078, "num_tokens": 19276894.0, "step": 11110 }, { "entropy": 5.420180559158325, "epoch": 0.8648122933281462, "grad_norm": 0.9765625, "learning_rate": 0.0004930514617679206, "loss": 5.2058, "mean_token_accuracy": 0.18674748092889787, "num_tokens": 19285724.0, "step": 11115 }, { "entropy": 5.471880912780762, "epoch": 0.8652013226998638, "grad_norm": 1.015625, "learning_rate": 0.0004930446254777125, "loss": 5.125, "mean_token_accuracy": 0.18871460407972335, "num_tokens": 19294468.0, "step": 11120 }, { "entropy": 5.499029684066772, "epoch": 0.8655903520715814, "grad_norm": 1.0390625, "learning_rate": 0.0004930377858790242, "loss": 5.1953, "mean_token_accuracy": 0.1875053182244301, "num_tokens": 19303575.0, "step": 11125 }, { "entropy": 5.530423164367676, "epoch": 0.865979381443299, "grad_norm": 1.0, "learning_rate": 0.0004930309429719595, "loss": 5.3379, "mean_token_accuracy": 0.1862312525510788, "num_tokens": 19312778.0, "step": 11130 }, { "entropy": 5.538342571258545, "epoch": 0.8663684108150166, "grad_norm": 1.09375, "learning_rate": 0.0004930240967566224, "loss": 5.2196, "mean_token_accuracy": 0.17841034829616548, "num_tokens": 19320725.0, "step": 11135 }, { "entropy": 5.552875089645386, "epoch": 0.8667574401867341, "grad_norm": 1.0390625, "learning_rate": 0.0004930172472331167, "loss": 5.2341, "mean_token_accuracy": 0.19112754464149476, "num_tokens": 19329842.0, "step": 11140 }, { "entropy": 5.5261133193969725, "epoch": 0.8671464695584516, "grad_norm": 1.078125, "learning_rate": 0.0004930103944015463, "loss": 5.244, "mean_token_accuracy": 0.18622598499059678, "num_tokens": 19338136.0, "step": 11145 }, { "entropy": 5.448788118362427, "epoch": 0.8675354989301692, "grad_norm": 0.96484375, "learning_rate": 0.0004930035382620149, "loss": 5.2096, "mean_token_accuracy": 0.1826661616563797, "num_tokens": 19346597.0, "step": 11150 }, { "entropy": 5.516408061981201, "epoch": 0.8679245283018868, "grad_norm": 1.0, "learning_rate": 0.000492996678814627, "loss": 5.1892, "mean_token_accuracy": 0.18546145111322404, "num_tokens": 19355595.0, "step": 11155 }, { "entropy": 5.5045843601226805, "epoch": 0.8683135576736044, "grad_norm": 1.046875, "learning_rate": 0.0004929898160594865, "loss": 5.2653, "mean_token_accuracy": 0.18801700323820114, "num_tokens": 19364133.0, "step": 11160 }, { "entropy": 5.556047534942627, "epoch": 0.8687025870453219, "grad_norm": 0.9453125, "learning_rate": 0.0004929829499966974, "loss": 5.3007, "mean_token_accuracy": 0.17647062093019486, "num_tokens": 19373628.0, "step": 11165 }, { "entropy": 5.5405693531036375, "epoch": 0.8690916164170395, "grad_norm": 1.046875, "learning_rate": 0.0004929760806263641, "loss": 5.2371, "mean_token_accuracy": 0.17979491204023362, "num_tokens": 19381901.0, "step": 11170 }, { "entropy": 5.510765600204468, "epoch": 0.8694806457887571, "grad_norm": 1.1015625, "learning_rate": 0.0004929692079485906, "loss": 5.3074, "mean_token_accuracy": 0.18250601291656493, "num_tokens": 19390390.0, "step": 11175 }, { "entropy": 5.531561708450317, "epoch": 0.8698696751604746, "grad_norm": 1.03125, "learning_rate": 0.0004929623319634814, "loss": 5.2851, "mean_token_accuracy": 0.17655566483736038, "num_tokens": 19399858.0, "step": 11180 }, { "entropy": 5.514353561401367, "epoch": 0.8702587045321922, "grad_norm": 0.95703125, "learning_rate": 0.0004929554526711407, "loss": 5.232, "mean_token_accuracy": 0.17701393514871597, "num_tokens": 19409062.0, "step": 11185 }, { "entropy": 5.478335809707642, "epoch": 0.8706477339039097, "grad_norm": 0.921875, "learning_rate": 0.0004929485700716729, "loss": 5.2144, "mean_token_accuracy": 0.1906026154756546, "num_tokens": 19417228.0, "step": 11190 }, { "entropy": 5.52282977104187, "epoch": 0.8710367632756273, "grad_norm": 1.046875, "learning_rate": 0.0004929416841651824, "loss": 5.3199, "mean_token_accuracy": 0.18114550709724425, "num_tokens": 19426086.0, "step": 11195 }, { "entropy": 5.602593040466308, "epoch": 0.8714257926473449, "grad_norm": 1.046875, "learning_rate": 0.0004929347949517739, "loss": 5.2938, "mean_token_accuracy": 0.17956936359405518, "num_tokens": 19435363.0, "step": 11200 }, { "entropy": 5.507009840011596, "epoch": 0.8718148220190625, "grad_norm": 1.0703125, "learning_rate": 0.0004929279024315516, "loss": 5.0931, "mean_token_accuracy": 0.19207787960767747, "num_tokens": 19443355.0, "step": 11205 }, { "entropy": 5.4548462390899655, "epoch": 0.87220385139078, "grad_norm": 0.93359375, "learning_rate": 0.0004929210066046204, "loss": 5.1566, "mean_token_accuracy": 0.1834787130355835, "num_tokens": 19452217.0, "step": 11210 }, { "entropy": 5.539735507965088, "epoch": 0.8725928807624975, "grad_norm": 1.1796875, "learning_rate": 0.0004929141074710847, "loss": 5.3563, "mean_token_accuracy": 0.17908131927251816, "num_tokens": 19460034.0, "step": 11215 }, { "entropy": 5.544782447814941, "epoch": 0.8729819101342151, "grad_norm": 1.125, "learning_rate": 0.0004929072050310491, "loss": 5.2712, "mean_token_accuracy": 0.18291116803884505, "num_tokens": 19468403.0, "step": 11220 }, { "entropy": 5.527947044372558, "epoch": 0.8733709395059327, "grad_norm": 1.0546875, "learning_rate": 0.0004929002992846188, "loss": 5.3097, "mean_token_accuracy": 0.18057331144809724, "num_tokens": 19477551.0, "step": 11225 }, { "entropy": 5.562255096435547, "epoch": 0.8737599688776503, "grad_norm": 1.0234375, "learning_rate": 0.0004928933902318981, "loss": 5.2159, "mean_token_accuracy": 0.18348020315170288, "num_tokens": 19486131.0, "step": 11230 }, { "entropy": 5.596061944961548, "epoch": 0.8741489982493679, "grad_norm": 0.96875, "learning_rate": 0.000492886477872992, "loss": 5.335, "mean_token_accuracy": 0.16931647509336473, "num_tokens": 19496212.0, "step": 11235 }, { "entropy": 5.5286064624786375, "epoch": 0.8745380276210853, "grad_norm": 1.0859375, "learning_rate": 0.0004928795622080054, "loss": 5.1795, "mean_token_accuracy": 0.18812340795993804, "num_tokens": 19504556.0, "step": 11240 }, { "entropy": 5.544600534439087, "epoch": 0.8749270569928029, "grad_norm": 0.97265625, "learning_rate": 0.0004928726432370434, "loss": 5.2464, "mean_token_accuracy": 0.18368972539901735, "num_tokens": 19512832.0, "step": 11245 }, { "entropy": 5.577767419815063, "epoch": 0.8753160863645205, "grad_norm": 0.9921875, "learning_rate": 0.0004928657209602107, "loss": 5.2587, "mean_token_accuracy": 0.18067981153726578, "num_tokens": 19521410.0, "step": 11250 }, { "entropy": 5.5352644443511965, "epoch": 0.8757051157362381, "grad_norm": 1.0, "learning_rate": 0.0004928587953776125, "loss": 5.2358, "mean_token_accuracy": 0.18297629058361053, "num_tokens": 19529935.0, "step": 11255 }, { "entropy": 5.455287075042724, "epoch": 0.8760941451079557, "grad_norm": 1.1015625, "learning_rate": 0.0004928518664893538, "loss": 5.1392, "mean_token_accuracy": 0.18690977841615677, "num_tokens": 19538330.0, "step": 11260 }, { "entropy": 5.469933080673218, "epoch": 0.8764831744796732, "grad_norm": 1.0234375, "learning_rate": 0.0004928449342955397, "loss": 5.1371, "mean_token_accuracy": 0.1871270716190338, "num_tokens": 19546860.0, "step": 11265 }, { "entropy": 5.524903917312622, "epoch": 0.8768722038513908, "grad_norm": 0.98046875, "learning_rate": 0.0004928379987962756, "loss": 5.2385, "mean_token_accuracy": 0.18469735085964203, "num_tokens": 19554945.0, "step": 11270 }, { "entropy": 5.5842503070831295, "epoch": 0.8772612332231083, "grad_norm": 1.015625, "learning_rate": 0.0004928310599916666, "loss": 5.2539, "mean_token_accuracy": 0.1854965254664421, "num_tokens": 19563182.0, "step": 11275 }, { "entropy": 5.477764463424682, "epoch": 0.8776502625948259, "grad_norm": 1.015625, "learning_rate": 0.0004928241178818178, "loss": 5.2408, "mean_token_accuracy": 0.18200253695249557, "num_tokens": 19571405.0, "step": 11280 }, { "entropy": 5.60707311630249, "epoch": 0.8780392919665435, "grad_norm": 0.97265625, "learning_rate": 0.0004928171724668349, "loss": 5.3013, "mean_token_accuracy": 0.1846957802772522, "num_tokens": 19580053.0, "step": 11285 }, { "entropy": 5.617381763458252, "epoch": 0.878428321338261, "grad_norm": 1.0703125, "learning_rate": 0.0004928102237468229, "loss": 5.3379, "mean_token_accuracy": 0.17617485374212266, "num_tokens": 19588457.0, "step": 11290 }, { "entropy": 5.483393144607544, "epoch": 0.8788173507099786, "grad_norm": 0.95703125, "learning_rate": 0.0004928032717218876, "loss": 5.179, "mean_token_accuracy": 0.1825598508119583, "num_tokens": 19597608.0, "step": 11295 }, { "entropy": 5.509890556335449, "epoch": 0.8792063800816962, "grad_norm": 1.0, "learning_rate": 0.0004927963163921343, "loss": 5.1901, "mean_token_accuracy": 0.18744228780269623, "num_tokens": 19605904.0, "step": 11300 }, { "entropy": 5.535820627212525, "epoch": 0.8795954094534137, "grad_norm": 1.046875, "learning_rate": 0.0004927893577576685, "loss": 5.1893, "mean_token_accuracy": 0.180858051776886, "num_tokens": 19614660.0, "step": 11305 }, { "entropy": 5.484455633163452, "epoch": 0.8799844388251313, "grad_norm": 1.078125, "learning_rate": 0.0004927823958185959, "loss": 5.1677, "mean_token_accuracy": 0.19511272758245468, "num_tokens": 19623210.0, "step": 11310 }, { "entropy": 5.539402341842651, "epoch": 0.8803734681968488, "grad_norm": 0.96875, "learning_rate": 0.000492775430575022, "loss": 5.2519, "mean_token_accuracy": 0.18173795491456984, "num_tokens": 19631747.0, "step": 11315 }, { "entropy": 5.596602296829223, "epoch": 0.8807624975685664, "grad_norm": 1.0234375, "learning_rate": 0.0004927684620270527, "loss": 5.3202, "mean_token_accuracy": 0.17155577391386032, "num_tokens": 19639902.0, "step": 11320 }, { "entropy": 5.61637659072876, "epoch": 0.881151526940284, "grad_norm": 1.0390625, "learning_rate": 0.0004927614901747935, "loss": 5.3502, "mean_token_accuracy": 0.1732579380273819, "num_tokens": 19648478.0, "step": 11325 }, { "entropy": 5.659581899642944, "epoch": 0.8815405563120016, "grad_norm": 1.0546875, "learning_rate": 0.0004927545150183503, "loss": 5.3621, "mean_token_accuracy": 0.18125927299261094, "num_tokens": 19657467.0, "step": 11330 }, { "entropy": 5.676268196105957, "epoch": 0.8819295856837192, "grad_norm": 1.109375, "learning_rate": 0.000492747536557829, "loss": 5.3406, "mean_token_accuracy": 0.1732207089662552, "num_tokens": 19665382.0, "step": 11335 }, { "entropy": 5.5101409435272215, "epoch": 0.8823186150554367, "grad_norm": 1.015625, "learning_rate": 0.0004927405547933353, "loss": 5.1323, "mean_token_accuracy": 0.18979064375162125, "num_tokens": 19674486.0, "step": 11340 }, { "entropy": 5.5536261081695555, "epoch": 0.8827076444271542, "grad_norm": 0.9375, "learning_rate": 0.0004927335697249753, "loss": 5.1488, "mean_token_accuracy": 0.1838303342461586, "num_tokens": 19683060.0, "step": 11345 }, { "entropy": 5.450905418395996, "epoch": 0.8830966737988718, "grad_norm": 0.98046875, "learning_rate": 0.0004927265813528549, "loss": 5.1358, "mean_token_accuracy": 0.19171228706836702, "num_tokens": 19691634.0, "step": 11350 }, { "entropy": 5.515726709365845, "epoch": 0.8834857031705894, "grad_norm": 1.0625, "learning_rate": 0.0004927195896770804, "loss": 5.2501, "mean_token_accuracy": 0.1771254301071167, "num_tokens": 19699975.0, "step": 11355 }, { "entropy": 5.528879022598266, "epoch": 0.883874732542307, "grad_norm": 1.078125, "learning_rate": 0.0004927125946977574, "loss": 5.1984, "mean_token_accuracy": 0.18202802091836928, "num_tokens": 19708431.0, "step": 11360 }, { "entropy": 5.504720449447632, "epoch": 0.8842637619140246, "grad_norm": 0.9375, "learning_rate": 0.0004927055964149923, "loss": 5.2143, "mean_token_accuracy": 0.17706252187490462, "num_tokens": 19717189.0, "step": 11365 }, { "entropy": 5.54294867515564, "epoch": 0.884652791285742, "grad_norm": 1.0078125, "learning_rate": 0.0004926985948288914, "loss": 5.2534, "mean_token_accuracy": 0.18483281880617142, "num_tokens": 19725855.0, "step": 11370 }, { "entropy": 5.489649105072021, "epoch": 0.8850418206574596, "grad_norm": 1.015625, "learning_rate": 0.0004926915899395608, "loss": 5.1878, "mean_token_accuracy": 0.1889399006962776, "num_tokens": 19734617.0, "step": 11375 }, { "entropy": 5.594054937362671, "epoch": 0.8854308500291772, "grad_norm": 0.9921875, "learning_rate": 0.0004926845817471068, "loss": 5.2937, "mean_token_accuracy": 0.17842385768890381, "num_tokens": 19743731.0, "step": 11380 }, { "entropy": 5.5329827785491945, "epoch": 0.8858198794008948, "grad_norm": 1.0234375, "learning_rate": 0.0004926775702516358, "loss": 5.2334, "mean_token_accuracy": 0.1834652006626129, "num_tokens": 19752336.0, "step": 11385 }, { "entropy": 5.5270891189575195, "epoch": 0.8862089087726124, "grad_norm": 1.0703125, "learning_rate": 0.0004926705554532541, "loss": 5.2634, "mean_token_accuracy": 0.17848246693611144, "num_tokens": 19761488.0, "step": 11390 }, { "entropy": 5.508946132659912, "epoch": 0.8865979381443299, "grad_norm": 0.984375, "learning_rate": 0.0004926635373520682, "loss": 5.169, "mean_token_accuracy": 0.1898031175136566, "num_tokens": 19770330.0, "step": 11395 }, { "entropy": 5.500057077407837, "epoch": 0.8869869675160474, "grad_norm": 1.015625, "learning_rate": 0.0004926565159481845, "loss": 5.2095, "mean_token_accuracy": 0.17905416637659072, "num_tokens": 19779037.0, "step": 11400 }, { "entropy": 5.533876514434814, "epoch": 0.887375996887765, "grad_norm": 1.109375, "learning_rate": 0.0004926494912417097, "loss": 5.2921, "mean_token_accuracy": 0.17764966934919357, "num_tokens": 19787661.0, "step": 11405 }, { "entropy": 5.530629205703735, "epoch": 0.8877650262594826, "grad_norm": 1.046875, "learning_rate": 0.0004926424632327503, "loss": 5.2017, "mean_token_accuracy": 0.1833707273006439, "num_tokens": 19796421.0, "step": 11410 }, { "entropy": 5.489688158035278, "epoch": 0.8881540556312002, "grad_norm": 0.93359375, "learning_rate": 0.0004926354319214129, "loss": 5.2089, "mean_token_accuracy": 0.18678514361381532, "num_tokens": 19805842.0, "step": 11415 }, { "entropy": 5.502434539794922, "epoch": 0.8885430850029177, "grad_norm": 0.99609375, "learning_rate": 0.0004926283973078041, "loss": 5.2216, "mean_token_accuracy": 0.1865896999835968, "num_tokens": 19814179.0, "step": 11420 }, { "entropy": 5.527525901794434, "epoch": 0.8889321143746353, "grad_norm": 1.0390625, "learning_rate": 0.0004926213593920309, "loss": 5.2955, "mean_token_accuracy": 0.18436793535947799, "num_tokens": 19822435.0, "step": 11425 }, { "entropy": 5.553323411941529, "epoch": 0.8893211437463528, "grad_norm": 1.0546875, "learning_rate": 0.0004926143181742, "loss": 5.1895, "mean_token_accuracy": 0.1918119966983795, "num_tokens": 19830300.0, "step": 11430 }, { "entropy": 5.493434762954712, "epoch": 0.8897101731180704, "grad_norm": 0.9765625, "learning_rate": 0.0004926072736544181, "loss": 5.3238, "mean_token_accuracy": 0.1789433017373085, "num_tokens": 19839264.0, "step": 11435 }, { "entropy": 5.5223063945770265, "epoch": 0.890099202489788, "grad_norm": 1.0078125, "learning_rate": 0.0004926002258327922, "loss": 5.2463, "mean_token_accuracy": 0.1831204652786255, "num_tokens": 19848086.0, "step": 11440 }, { "entropy": 5.563356161117554, "epoch": 0.8904882318615055, "grad_norm": 1.0390625, "learning_rate": 0.0004925931747094292, "loss": 5.2518, "mean_token_accuracy": 0.1765742927789688, "num_tokens": 19856571.0, "step": 11445 }, { "entropy": 5.542412424087525, "epoch": 0.8908772612332231, "grad_norm": 1.0546875, "learning_rate": 0.0004925861202844361, "loss": 5.25, "mean_token_accuracy": 0.17979415208101274, "num_tokens": 19865272.0, "step": 11450 }, { "entropy": 5.477621793746948, "epoch": 0.8912662906049407, "grad_norm": 0.984375, "learning_rate": 0.00049257906255792, "loss": 5.1988, "mean_token_accuracy": 0.1831981882452965, "num_tokens": 19874307.0, "step": 11455 }, { "entropy": 5.517126035690308, "epoch": 0.8916553199766583, "grad_norm": 1.015625, "learning_rate": 0.000492572001529988, "loss": 5.256, "mean_token_accuracy": 0.1820702448487282, "num_tokens": 19882851.0, "step": 11460 }, { "entropy": 5.507664060592651, "epoch": 0.8920443493483758, "grad_norm": 1.0234375, "learning_rate": 0.0004925649372007469, "loss": 5.135, "mean_token_accuracy": 0.1912246376276016, "num_tokens": 19891276.0, "step": 11465 }, { "entropy": 5.536835193634033, "epoch": 0.8924333787200933, "grad_norm": 0.97265625, "learning_rate": 0.0004925578695703045, "loss": 5.2922, "mean_token_accuracy": 0.1739618718624115, "num_tokens": 19900551.0, "step": 11470 }, { "entropy": 5.5730406761169435, "epoch": 0.8928224080918109, "grad_norm": 1.015625, "learning_rate": 0.0004925507986387676, "loss": 5.3168, "mean_token_accuracy": 0.17840175330638885, "num_tokens": 19909412.0, "step": 11475 }, { "entropy": 5.530451011657715, "epoch": 0.8932114374635285, "grad_norm": 1.0546875, "learning_rate": 0.0004925437244062436, "loss": 5.1577, "mean_token_accuracy": 0.18859421461820602, "num_tokens": 19918073.0, "step": 11480 }, { "entropy": 5.404661560058594, "epoch": 0.8936004668352461, "grad_norm": 1.03125, "learning_rate": 0.0004925366468728397, "loss": 5.1099, "mean_token_accuracy": 0.19717005342245103, "num_tokens": 19926040.0, "step": 11485 }, { "entropy": 5.4958466529846195, "epoch": 0.8939894962069637, "grad_norm": 0.99609375, "learning_rate": 0.0004925295660386635, "loss": 5.2786, "mean_token_accuracy": 0.1826965630054474, "num_tokens": 19934543.0, "step": 11490 }, { "entropy": 5.548063802719116, "epoch": 0.8943785255786811, "grad_norm": 1.03125, "learning_rate": 0.0004925224819038224, "loss": 5.203, "mean_token_accuracy": 0.1884670928120613, "num_tokens": 19943198.0, "step": 11495 }, { "entropy": 5.467909049987793, "epoch": 0.8947675549503987, "grad_norm": 1.015625, "learning_rate": 0.0004925153944684239, "loss": 5.1414, "mean_token_accuracy": 0.19160398691892624, "num_tokens": 19952319.0, "step": 11500 }, { "entropy": 5.459916496276856, "epoch": 0.8951565843221163, "grad_norm": 1.03125, "learning_rate": 0.0004925083037325754, "loss": 5.1317, "mean_token_accuracy": 0.18842522650957108, "num_tokens": 19961982.0, "step": 11505 }, { "entropy": 5.491133213043213, "epoch": 0.8955456136938339, "grad_norm": 0.9921875, "learning_rate": 0.0004925012096963847, "loss": 5.1639, "mean_token_accuracy": 0.18213666677474977, "num_tokens": 19971055.0, "step": 11510 }, { "entropy": 5.432522106170654, "epoch": 0.8959346430655515, "grad_norm": 0.9453125, "learning_rate": 0.0004924941123599593, "loss": 5.0498, "mean_token_accuracy": 0.20190086960792542, "num_tokens": 19979850.0, "step": 11515 }, { "entropy": 5.504576921463013, "epoch": 0.896323672437269, "grad_norm": 0.95703125, "learning_rate": 0.0004924870117234069, "loss": 5.2582, "mean_token_accuracy": 0.18512337654829025, "num_tokens": 19989261.0, "step": 11520 }, { "entropy": 5.439550924301147, "epoch": 0.8967127018089865, "grad_norm": 0.97265625, "learning_rate": 0.0004924799077868353, "loss": 5.1642, "mean_token_accuracy": 0.18300462663173675, "num_tokens": 19998321.0, "step": 11525 }, { "entropy": 5.474901342391968, "epoch": 0.8971017311807041, "grad_norm": 1.078125, "learning_rate": 0.0004924728005503522, "loss": 5.2507, "mean_token_accuracy": 0.17862967550754547, "num_tokens": 20007191.0, "step": 11530 }, { "entropy": 5.589016628265381, "epoch": 0.8974907605524217, "grad_norm": 1.0234375, "learning_rate": 0.0004924656900140655, "loss": 5.2772, "mean_token_accuracy": 0.180033902823925, "num_tokens": 20015805.0, "step": 11535 }, { "entropy": 5.520281791687012, "epoch": 0.8978797899241393, "grad_norm": 0.91015625, "learning_rate": 0.0004924585761780831, "loss": 5.2434, "mean_token_accuracy": 0.18596543818712236, "num_tokens": 20024861.0, "step": 11540 }, { "entropy": 5.588623142242431, "epoch": 0.8982688192958569, "grad_norm": 1.015625, "learning_rate": 0.000492451459042513, "loss": 5.2932, "mean_token_accuracy": 0.1807098090648651, "num_tokens": 20034208.0, "step": 11545 }, { "entropy": 5.518136024475098, "epoch": 0.8986578486675744, "grad_norm": 1.0390625, "learning_rate": 0.000492444338607463, "loss": 5.2545, "mean_token_accuracy": 0.18347149342298508, "num_tokens": 20042786.0, "step": 11550 }, { "entropy": 5.596791553497314, "epoch": 0.899046878039292, "grad_norm": 0.97265625, "learning_rate": 0.0004924372148730413, "loss": 5.2972, "mean_token_accuracy": 0.17991413474082946, "num_tokens": 20051697.0, "step": 11555 }, { "entropy": 5.595310878753662, "epoch": 0.8994359074110095, "grad_norm": 1.0546875, "learning_rate": 0.000492430087839356, "loss": 5.2516, "mean_token_accuracy": 0.18607234209775925, "num_tokens": 20059814.0, "step": 11560 }, { "entropy": 5.519132423400879, "epoch": 0.8998249367827271, "grad_norm": 1.0078125, "learning_rate": 0.0004924229575065152, "loss": 5.2778, "mean_token_accuracy": 0.18054091036319733, "num_tokens": 20068329.0, "step": 11565 }, { "entropy": 5.555145931243897, "epoch": 0.9002139661544447, "grad_norm": 1.0546875, "learning_rate": 0.000492415823874627, "loss": 5.2611, "mean_token_accuracy": 0.18493933528661727, "num_tokens": 20076925.0, "step": 11570 }, { "entropy": 5.5295580387115475, "epoch": 0.9006029955261622, "grad_norm": 1.0390625, "learning_rate": 0.0004924086869437998, "loss": 5.2777, "mean_token_accuracy": 0.1759166494011879, "num_tokens": 20085248.0, "step": 11575 }, { "entropy": 5.576231861114502, "epoch": 0.9009920248978798, "grad_norm": 1.0703125, "learning_rate": 0.0004924015467141417, "loss": 5.271, "mean_token_accuracy": 0.17665713131427765, "num_tokens": 20093929.0, "step": 11580 }, { "entropy": 5.5346650123596195, "epoch": 0.9013810542695974, "grad_norm": 0.96875, "learning_rate": 0.0004923944031857613, "loss": 5.3292, "mean_token_accuracy": 0.1767510414123535, "num_tokens": 20103141.0, "step": 11585 }, { "entropy": 5.506465578079224, "epoch": 0.901770083641315, "grad_norm": 1.015625, "learning_rate": 0.0004923872563587668, "loss": 5.1715, "mean_token_accuracy": 0.18823646157979965, "num_tokens": 20111938.0, "step": 11590 }, { "entropy": 5.48262128829956, "epoch": 0.9021591130130325, "grad_norm": 1.0546875, "learning_rate": 0.0004923801062332666, "loss": 5.1594, "mean_token_accuracy": 0.18876643031835555, "num_tokens": 20120795.0, "step": 11595 }, { "entropy": 5.525479698181153, "epoch": 0.90254814238475, "grad_norm": 0.94140625, "learning_rate": 0.0004923729528093694, "loss": 5.2383, "mean_token_accuracy": 0.18452170491218567, "num_tokens": 20129816.0, "step": 11600 }, { "entropy": 5.615433549880981, "epoch": 0.9029371717564676, "grad_norm": 0.9765625, "learning_rate": 0.0004923657960871836, "loss": 5.3507, "mean_token_accuracy": 0.1777173474431038, "num_tokens": 20138380.0, "step": 11605 }, { "entropy": 5.606568288803101, "epoch": 0.9033262011281852, "grad_norm": 1.0390625, "learning_rate": 0.0004923586360668178, "loss": 5.3467, "mean_token_accuracy": 0.17607924938201905, "num_tokens": 20147201.0, "step": 11610 }, { "entropy": 5.515245151519776, "epoch": 0.9037152304999028, "grad_norm": 1.078125, "learning_rate": 0.0004923514727483807, "loss": 5.1871, "mean_token_accuracy": 0.1877109706401825, "num_tokens": 20156744.0, "step": 11615 }, { "entropy": 5.564523220062256, "epoch": 0.9041042598716204, "grad_norm": 1.15625, "learning_rate": 0.000492344306131981, "loss": 5.2068, "mean_token_accuracy": 0.18731613904237748, "num_tokens": 20165081.0, "step": 11620 }, { "entropy": 5.54938006401062, "epoch": 0.9044932892433378, "grad_norm": 1.0625, "learning_rate": 0.0004923371362177272, "loss": 5.2243, "mean_token_accuracy": 0.17765559405088424, "num_tokens": 20172893.0, "step": 11625 }, { "entropy": 5.502335691452027, "epoch": 0.9048823186150554, "grad_norm": 1.0234375, "learning_rate": 0.0004923299630057284, "loss": 5.2738, "mean_token_accuracy": 0.1848529174923897, "num_tokens": 20181351.0, "step": 11630 }, { "entropy": 5.543225383758545, "epoch": 0.905271347986773, "grad_norm": 1.171875, "learning_rate": 0.0004923227864960934, "loss": 5.2881, "mean_token_accuracy": 0.17634233683347703, "num_tokens": 20189650.0, "step": 11635 }, { "entropy": 5.5660481452941895, "epoch": 0.9056603773584906, "grad_norm": 0.90625, "learning_rate": 0.000492315606688931, "loss": 5.2393, "mean_token_accuracy": 0.17835864871740342, "num_tokens": 20198184.0, "step": 11640 }, { "entropy": 5.60937819480896, "epoch": 0.9060494067302082, "grad_norm": 1.0703125, "learning_rate": 0.0004923084235843501, "loss": 5.1785, "mean_token_accuracy": 0.18451658338308335, "num_tokens": 20206357.0, "step": 11645 }, { "entropy": 5.505401706695556, "epoch": 0.9064384361019256, "grad_norm": 1.0390625, "learning_rate": 0.0004923012371824598, "loss": 5.2893, "mean_token_accuracy": 0.1852715402841568, "num_tokens": 20214384.0, "step": 11650 }, { "entropy": 5.537664794921875, "epoch": 0.9068274654736432, "grad_norm": 1.0, "learning_rate": 0.000492294047483369, "loss": 5.2372, "mean_token_accuracy": 0.18222369998693466, "num_tokens": 20224103.0, "step": 11655 }, { "entropy": 5.519847011566162, "epoch": 0.9072164948453608, "grad_norm": 0.9140625, "learning_rate": 0.0004922868544871869, "loss": 5.2792, "mean_token_accuracy": 0.1759260267019272, "num_tokens": 20233414.0, "step": 11660 }, { "entropy": 5.552676391601563, "epoch": 0.9076055242170784, "grad_norm": 1.0078125, "learning_rate": 0.0004922796581940227, "loss": 5.1592, "mean_token_accuracy": 0.19401241540908815, "num_tokens": 20240988.0, "step": 11665 }, { "entropy": 5.459396839141846, "epoch": 0.907994553588796, "grad_norm": 1.0078125, "learning_rate": 0.0004922724586039855, "loss": 5.1776, "mean_token_accuracy": 0.1845247656106949, "num_tokens": 20250066.0, "step": 11670 }, { "entropy": 5.446709442138672, "epoch": 0.9083835829605135, "grad_norm": 1.015625, "learning_rate": 0.0004922652557171846, "loss": 5.1174, "mean_token_accuracy": 0.18645433485507965, "num_tokens": 20258435.0, "step": 11675 }, { "entropy": 5.5401421070098875, "epoch": 0.9087726123322311, "grad_norm": 1.0625, "learning_rate": 0.0004922580495337292, "loss": 5.2764, "mean_token_accuracy": 0.18554395735263823, "num_tokens": 20267345.0, "step": 11680 }, { "entropy": 5.611184549331665, "epoch": 0.9091616417039486, "grad_norm": 1.03125, "learning_rate": 0.0004922508400537288, "loss": 5.2978, "mean_token_accuracy": 0.18393969237804414, "num_tokens": 20275644.0, "step": 11685 }, { "entropy": 5.559269714355469, "epoch": 0.9095506710756662, "grad_norm": 1.0078125, "learning_rate": 0.0004922436272772926, "loss": 5.2877, "mean_token_accuracy": 0.18375231623649596, "num_tokens": 20284459.0, "step": 11690 }, { "entropy": 5.514861822128296, "epoch": 0.9099397004473838, "grad_norm": 1.0546875, "learning_rate": 0.0004922364112045301, "loss": 5.1659, "mean_token_accuracy": 0.1775193616747856, "num_tokens": 20293088.0, "step": 11695 }, { "entropy": 5.442722129821777, "epoch": 0.9103287298191013, "grad_norm": 1.0390625, "learning_rate": 0.000492229191835551, "loss": 5.1967, "mean_token_accuracy": 0.19038535058498382, "num_tokens": 20301811.0, "step": 11700 }, { "entropy": 5.617792701721191, "epoch": 0.9107177591908189, "grad_norm": 1.0390625, "learning_rate": 0.0004922219691704645, "loss": 5.3392, "mean_token_accuracy": 0.1788921520113945, "num_tokens": 20310365.0, "step": 11705 }, { "entropy": 5.61149492263794, "epoch": 0.9111067885625365, "grad_norm": 1.125, "learning_rate": 0.0004922147432093805, "loss": 5.2655, "mean_token_accuracy": 0.187432724237442, "num_tokens": 20318891.0, "step": 11710 }, { "entropy": 5.493810749053955, "epoch": 0.911495817934254, "grad_norm": 0.953125, "learning_rate": 0.0004922075139524083, "loss": 5.1424, "mean_token_accuracy": 0.19115181416273117, "num_tokens": 20327313.0, "step": 11715 }, { "entropy": 5.4718855857849125, "epoch": 0.9118848473059716, "grad_norm": 1.0859375, "learning_rate": 0.000492200281399658, "loss": 5.1234, "mean_token_accuracy": 0.19223930984735488, "num_tokens": 20335511.0, "step": 11720 }, { "entropy": 5.461335134506226, "epoch": 0.9122738766776891, "grad_norm": 1.0546875, "learning_rate": 0.000492193045551239, "loss": 5.1353, "mean_token_accuracy": 0.19347153455018998, "num_tokens": 20343588.0, "step": 11725 }, { "entropy": 5.517422246932983, "epoch": 0.9126629060494067, "grad_norm": 0.95703125, "learning_rate": 0.0004921858064072612, "loss": 5.2186, "mean_token_accuracy": 0.18946306109428407, "num_tokens": 20352793.0, "step": 11730 }, { "entropy": 5.504404592514038, "epoch": 0.9130519354211243, "grad_norm": 1.0390625, "learning_rate": 0.0004921785639678347, "loss": 5.2921, "mean_token_accuracy": 0.1825656160712242, "num_tokens": 20362480.0, "step": 11735 }, { "entropy": 5.483951187133789, "epoch": 0.9134409647928419, "grad_norm": 1.0, "learning_rate": 0.000492171318233069, "loss": 5.159, "mean_token_accuracy": 0.1867786392569542, "num_tokens": 20371192.0, "step": 11740 }, { "entropy": 5.58076696395874, "epoch": 0.9138299941645595, "grad_norm": 1.015625, "learning_rate": 0.0004921640692030742, "loss": 5.2861, "mean_token_accuracy": 0.17698854207992554, "num_tokens": 20379322.0, "step": 11745 }, { "entropy": 5.568037509918213, "epoch": 0.914219023536277, "grad_norm": 0.99609375, "learning_rate": 0.0004921568168779603, "loss": 5.2478, "mean_token_accuracy": 0.1728318527340889, "num_tokens": 20387976.0, "step": 11750 }, { "entropy": 5.524559402465821, "epoch": 0.9146080529079945, "grad_norm": 0.9765625, "learning_rate": 0.0004921495612578374, "loss": 5.3089, "mean_token_accuracy": 0.17335215508937835, "num_tokens": 20397398.0, "step": 11755 }, { "entropy": 5.520415449142456, "epoch": 0.9149970822797121, "grad_norm": 1.015625, "learning_rate": 0.0004921423023428156, "loss": 5.2165, "mean_token_accuracy": 0.18413265496492387, "num_tokens": 20406503.0, "step": 11760 }, { "entropy": 5.489954280853271, "epoch": 0.9153861116514297, "grad_norm": 1.0, "learning_rate": 0.0004921350401330049, "loss": 5.1632, "mean_token_accuracy": 0.18400536775588988, "num_tokens": 20415117.0, "step": 11765 }, { "entropy": 5.4944836616516115, "epoch": 0.9157751410231473, "grad_norm": 1.015625, "learning_rate": 0.0004921277746285155, "loss": 5.2344, "mean_token_accuracy": 0.18249629586935043, "num_tokens": 20423519.0, "step": 11770 }, { "entropy": 5.529052972793579, "epoch": 0.9161641703948649, "grad_norm": 1.0, "learning_rate": 0.0004921205058294579, "loss": 5.1657, "mean_token_accuracy": 0.1901855617761612, "num_tokens": 20431831.0, "step": 11775 }, { "entropy": 5.582128667831421, "epoch": 0.9165531997665823, "grad_norm": 1.0546875, "learning_rate": 0.000492113233735942, "loss": 5.2943, "mean_token_accuracy": 0.17680168449878692, "num_tokens": 20440927.0, "step": 11780 }, { "entropy": 5.456193447113037, "epoch": 0.9169422291382999, "grad_norm": 0.9765625, "learning_rate": 0.0004921059583480785, "loss": 5.1984, "mean_token_accuracy": 0.18602384626865387, "num_tokens": 20448974.0, "step": 11785 }, { "entropy": 5.431862497329712, "epoch": 0.9173312585100175, "grad_norm": 1.09375, "learning_rate": 0.0004920986796659775, "loss": 5.0948, "mean_token_accuracy": 0.19464184790849687, "num_tokens": 20457955.0, "step": 11790 }, { "entropy": 5.474170970916748, "epoch": 0.9177202878817351, "grad_norm": 1.015625, "learning_rate": 0.0004920913976897498, "loss": 5.2151, "mean_token_accuracy": 0.18527020663022994, "num_tokens": 20465942.0, "step": 11795 }, { "entropy": 5.469747591018677, "epoch": 0.9181093172534527, "grad_norm": 0.97265625, "learning_rate": 0.0004920841124195055, "loss": 5.2742, "mean_token_accuracy": 0.18299935907125472, "num_tokens": 20474726.0, "step": 11800 }, { "entropy": 5.482394456863403, "epoch": 0.9184983466251702, "grad_norm": 1.0546875, "learning_rate": 0.0004920768238553554, "loss": 5.2048, "mean_token_accuracy": 0.18840772062540054, "num_tokens": 20483442.0, "step": 11805 }, { "entropy": 5.4660943984985355, "epoch": 0.9188873759968877, "grad_norm": 0.9453125, "learning_rate": 0.0004920695319974099, "loss": 5.1622, "mean_token_accuracy": 0.18524157404899597, "num_tokens": 20492950.0, "step": 11810 }, { "entropy": 5.52613000869751, "epoch": 0.9192764053686053, "grad_norm": 0.95703125, "learning_rate": 0.0004920622368457798, "loss": 5.2625, "mean_token_accuracy": 0.1828916147351265, "num_tokens": 20502035.0, "step": 11815 }, { "entropy": 5.559613466262817, "epoch": 0.9196654347403229, "grad_norm": 0.984375, "learning_rate": 0.0004920549384005759, "loss": 5.1424, "mean_token_accuracy": 0.1930774763226509, "num_tokens": 20510140.0, "step": 11820 }, { "entropy": 5.554401636123657, "epoch": 0.9200544641120405, "grad_norm": 0.98828125, "learning_rate": 0.0004920476366619086, "loss": 5.2543, "mean_token_accuracy": 0.18102286159992217, "num_tokens": 20519391.0, "step": 11825 }, { "entropy": 5.563594245910645, "epoch": 0.920443493483758, "grad_norm": 1.015625, "learning_rate": 0.000492040331629889, "loss": 5.2488, "mean_token_accuracy": 0.1813670039176941, "num_tokens": 20527635.0, "step": 11830 }, { "entropy": 5.533090686798095, "epoch": 0.9208325228554756, "grad_norm": 1.03125, "learning_rate": 0.0004920330233046277, "loss": 5.22, "mean_token_accuracy": 0.18335377126932145, "num_tokens": 20536455.0, "step": 11835 }, { "entropy": 5.569787979125977, "epoch": 0.9212215522271932, "grad_norm": 0.94140625, "learning_rate": 0.0004920257116862359, "loss": 5.3487, "mean_token_accuracy": 0.17282779812812804, "num_tokens": 20545887.0, "step": 11840 }, { "entropy": 5.466395568847656, "epoch": 0.9216105815989107, "grad_norm": 1.0234375, "learning_rate": 0.0004920183967748241, "loss": 5.2043, "mean_token_accuracy": 0.18463900834321975, "num_tokens": 20554415.0, "step": 11845 }, { "entropy": 5.557445907592774, "epoch": 0.9219996109706283, "grad_norm": 1.046875, "learning_rate": 0.0004920110785705037, "loss": 5.29, "mean_token_accuracy": 0.1797797366976738, "num_tokens": 20563081.0, "step": 11850 }, { "entropy": 5.459798908233642, "epoch": 0.9223886403423458, "grad_norm": 0.9921875, "learning_rate": 0.0004920037570733857, "loss": 5.1513, "mean_token_accuracy": 0.19113432615995407, "num_tokens": 20571800.0, "step": 11855 }, { "entropy": 5.530860853195191, "epoch": 0.9227776697140634, "grad_norm": 1.0625, "learning_rate": 0.0004919964322835809, "loss": 5.2803, "mean_token_accuracy": 0.1812809407711029, "num_tokens": 20580481.0, "step": 11860 }, { "entropy": 5.503029298782349, "epoch": 0.923166699085781, "grad_norm": 0.953125, "learning_rate": 0.0004919891042012006, "loss": 5.1509, "mean_token_accuracy": 0.18984051942825317, "num_tokens": 20589575.0, "step": 11865 }, { "entropy": 5.471775770187378, "epoch": 0.9235557284574986, "grad_norm": 0.9765625, "learning_rate": 0.0004919817728263562, "loss": 5.2376, "mean_token_accuracy": 0.17929063886404037, "num_tokens": 20598277.0, "step": 11870 }, { "entropy": 5.566425371170044, "epoch": 0.9239447578292161, "grad_norm": 1.0546875, "learning_rate": 0.0004919744381591586, "loss": 5.3544, "mean_token_accuracy": 0.18241810649633408, "num_tokens": 20607013.0, "step": 11875 }, { "entropy": 5.5566431999206545, "epoch": 0.9243337872009336, "grad_norm": 1.0078125, "learning_rate": 0.0004919671001997193, "loss": 5.2618, "mean_token_accuracy": 0.18047273606061937, "num_tokens": 20615605.0, "step": 11880 }, { "entropy": 5.575511026382446, "epoch": 0.9247228165726512, "grad_norm": 1.0703125, "learning_rate": 0.0004919597589481497, "loss": 5.2381, "mean_token_accuracy": 0.1792162388563156, "num_tokens": 20624275.0, "step": 11885 }, { "entropy": 5.537224864959716, "epoch": 0.9251118459443688, "grad_norm": 1.0625, "learning_rate": 0.000491952414404561, "loss": 5.2034, "mean_token_accuracy": 0.1879882827401161, "num_tokens": 20632681.0, "step": 11890 }, { "entropy": 5.592454481124878, "epoch": 0.9255008753160864, "grad_norm": 1.015625, "learning_rate": 0.0004919450665690646, "loss": 5.2474, "mean_token_accuracy": 0.1871395841240883, "num_tokens": 20641432.0, "step": 11895 }, { "entropy": 5.5538770198822025, "epoch": 0.925889904687804, "grad_norm": 1.0390625, "learning_rate": 0.0004919377154417724, "loss": 5.2459, "mean_token_accuracy": 0.1841251164674759, "num_tokens": 20650120.0, "step": 11900 }, { "entropy": 5.471891736984253, "epoch": 0.9262789340595214, "grad_norm": 1.015625, "learning_rate": 0.0004919303610227954, "loss": 5.168, "mean_token_accuracy": 0.18702660202980043, "num_tokens": 20658188.0, "step": 11905 }, { "entropy": 5.446796607971192, "epoch": 0.926667963431239, "grad_norm": 1.0546875, "learning_rate": 0.0004919230033122457, "loss": 5.1017, "mean_token_accuracy": 0.20147919654846191, "num_tokens": 20666157.0, "step": 11910 }, { "entropy": 5.516737079620361, "epoch": 0.9270569928029566, "grad_norm": 1.109375, "learning_rate": 0.0004919156423102345, "loss": 5.2954, "mean_token_accuracy": 0.18295007422566414, "num_tokens": 20674995.0, "step": 11915 }, { "entropy": 5.554612922668457, "epoch": 0.9274460221746742, "grad_norm": 1.015625, "learning_rate": 0.0004919082780168736, "loss": 5.2171, "mean_token_accuracy": 0.18180321156978607, "num_tokens": 20683786.0, "step": 11920 }, { "entropy": 5.503303718566895, "epoch": 0.9278350515463918, "grad_norm": 1.0, "learning_rate": 0.0004919009104322751, "loss": 5.2517, "mean_token_accuracy": 0.1797627955675125, "num_tokens": 20692582.0, "step": 11925 }, { "entropy": 5.52255539894104, "epoch": 0.9282240809181093, "grad_norm": 1.0859375, "learning_rate": 0.0004918935395565503, "loss": 5.3028, "mean_token_accuracy": 0.17740023881196976, "num_tokens": 20700892.0, "step": 11930 }, { "entropy": 5.48578143119812, "epoch": 0.9286131102898268, "grad_norm": 0.9765625, "learning_rate": 0.0004918861653898113, "loss": 5.1357, "mean_token_accuracy": 0.19472237974405288, "num_tokens": 20709521.0, "step": 11935 }, { "entropy": 5.4776880741119385, "epoch": 0.9290021396615444, "grad_norm": 1.0546875, "learning_rate": 0.0004918787879321701, "loss": 5.2392, "mean_token_accuracy": 0.177773879468441, "num_tokens": 20717614.0, "step": 11940 }, { "entropy": 5.515193843841553, "epoch": 0.929391169033262, "grad_norm": 0.9453125, "learning_rate": 0.0004918714071837384, "loss": 5.1702, "mean_token_accuracy": 0.18431687504053115, "num_tokens": 20726624.0, "step": 11945 }, { "entropy": 5.563686943054199, "epoch": 0.9297801984049796, "grad_norm": 1.078125, "learning_rate": 0.0004918640231446282, "loss": 5.2833, "mean_token_accuracy": 0.17793900668621063, "num_tokens": 20734738.0, "step": 11950 }, { "entropy": 5.523949241638183, "epoch": 0.9301692277766972, "grad_norm": 1.0625, "learning_rate": 0.0004918566358149517, "loss": 5.2073, "mean_token_accuracy": 0.1814127668738365, "num_tokens": 20742825.0, "step": 11955 }, { "entropy": 5.500367927551269, "epoch": 0.9305582571484147, "grad_norm": 0.91796875, "learning_rate": 0.000491849245194821, "loss": 5.177, "mean_token_accuracy": 0.1877474308013916, "num_tokens": 20752132.0, "step": 11960 }, { "entropy": 5.5748481273651125, "epoch": 0.9309472865201323, "grad_norm": 0.99609375, "learning_rate": 0.0004918418512843479, "loss": 5.2905, "mean_token_accuracy": 0.1819275513291359, "num_tokens": 20761838.0, "step": 11965 }, { "entropy": 5.524971437454224, "epoch": 0.9313363158918498, "grad_norm": 0.94140625, "learning_rate": 0.0004918344540836451, "loss": 5.2091, "mean_token_accuracy": 0.18035281002521514, "num_tokens": 20770405.0, "step": 11970 }, { "entropy": 5.658103275299072, "epoch": 0.9317253452635674, "grad_norm": 1.015625, "learning_rate": 0.0004918270535928244, "loss": 5.3817, "mean_token_accuracy": 0.17114637792110443, "num_tokens": 20780130.0, "step": 11975 }, { "entropy": 5.519717645645142, "epoch": 0.932114374635285, "grad_norm": 1.046875, "learning_rate": 0.0004918196498119984, "loss": 5.2502, "mean_token_accuracy": 0.1833609461784363, "num_tokens": 20788852.0, "step": 11980 }, { "entropy": 5.492956113815308, "epoch": 0.9325034040070025, "grad_norm": 0.97265625, "learning_rate": 0.0004918122427412793, "loss": 5.2027, "mean_token_accuracy": 0.18653904944658278, "num_tokens": 20796944.0, "step": 11985 }, { "entropy": 5.479194498062133, "epoch": 0.9328924333787201, "grad_norm": 1.0078125, "learning_rate": 0.0004918048323807795, "loss": 5.3015, "mean_token_accuracy": 0.17972572296857833, "num_tokens": 20806118.0, "step": 11990 }, { "entropy": 5.533642911911011, "epoch": 0.9332814627504377, "grad_norm": 1.0703125, "learning_rate": 0.0004917974187306114, "loss": 5.0937, "mean_token_accuracy": 0.19464485645294188, "num_tokens": 20814643.0, "step": 11995 }, { "entropy": 5.541843271255493, "epoch": 0.9336704921221552, "grad_norm": 1.0546875, "learning_rate": 0.0004917900017908875, "loss": 5.1722, "mean_token_accuracy": 0.1850559949874878, "num_tokens": 20823315.0, "step": 12000 }, { "epoch": 0.9336704921221552, "eval_entropy": 5.282939992487947, "eval_loss": 5.242969989776611, "eval_mean_token_accuracy": 0.19088318726555215, "eval_num_tokens": 20823315.0, "eval_runtime": 21.6439, "eval_samples_per_second": 1920.081, "eval_steps_per_second": 240.022, "step": 12000 }, { "entropy": 5.480089139938355, "epoch": 0.9340595214938728, "grad_norm": 1.0234375, "learning_rate": 0.0004917825815617205, "loss": 5.1847, "mean_token_accuracy": 0.18674563020467758, "num_tokens": 20832811.0, "step": 12005 }, { "entropy": 5.559292125701904, "epoch": 0.9344485508655903, "grad_norm": 1.0234375, "learning_rate": 0.0004917751580432229, "loss": 5.2417, "mean_token_accuracy": 0.18213964849710465, "num_tokens": 20841824.0, "step": 12010 }, { "entropy": 5.516628742218018, "epoch": 0.9348375802373079, "grad_norm": 1.046875, "learning_rate": 0.0004917677312355072, "loss": 5.1978, "mean_token_accuracy": 0.18753462731838227, "num_tokens": 20850220.0, "step": 12015 }, { "entropy": 5.419318056106567, "epoch": 0.9352266096090255, "grad_norm": 1.015625, "learning_rate": 0.0004917603011386863, "loss": 5.1193, "mean_token_accuracy": 0.19101559221744538, "num_tokens": 20859193.0, "step": 12020 }, { "entropy": 5.451471185684204, "epoch": 0.9356156389807431, "grad_norm": 0.953125, "learning_rate": 0.0004917528677528727, "loss": 5.1572, "mean_token_accuracy": 0.1816791906952858, "num_tokens": 20867610.0, "step": 12025 }, { "entropy": 5.526778507232666, "epoch": 0.9360046683524607, "grad_norm": 1.015625, "learning_rate": 0.0004917454310781795, "loss": 5.2667, "mean_token_accuracy": 0.17611534893512726, "num_tokens": 20876991.0, "step": 12030 }, { "entropy": 5.475227499008179, "epoch": 0.9363936977241781, "grad_norm": 1.1015625, "learning_rate": 0.0004917379911147193, "loss": 5.1234, "mean_token_accuracy": 0.18883112967014312, "num_tokens": 20885794.0, "step": 12035 }, { "entropy": 5.580940198898316, "epoch": 0.9367827270958957, "grad_norm": 1.078125, "learning_rate": 0.0004917305478626049, "loss": 5.3258, "mean_token_accuracy": 0.17909667193889617, "num_tokens": 20893487.0, "step": 12040 }, { "entropy": 5.530982589721679, "epoch": 0.9371717564676133, "grad_norm": 0.99609375, "learning_rate": 0.0004917231013219495, "loss": 5.2559, "mean_token_accuracy": 0.17775014489889146, "num_tokens": 20902587.0, "step": 12045 }, { "entropy": 5.542986869812012, "epoch": 0.9375607858393309, "grad_norm": 0.98046875, "learning_rate": 0.000491715651492866, "loss": 5.1686, "mean_token_accuracy": 0.19415658712387085, "num_tokens": 20911062.0, "step": 12050 }, { "entropy": 5.556273078918457, "epoch": 0.9379498152110485, "grad_norm": 1.0234375, "learning_rate": 0.0004917081983754675, "loss": 5.2072, "mean_token_accuracy": 0.18524604737758638, "num_tokens": 20919369.0, "step": 12055 }, { "entropy": 5.533960485458374, "epoch": 0.938338844582766, "grad_norm": 1.0078125, "learning_rate": 0.0004917007419698669, "loss": 5.2701, "mean_token_accuracy": 0.1843923345208168, "num_tokens": 20927514.0, "step": 12060 }, { "entropy": 5.615594291687012, "epoch": 0.9387278739544835, "grad_norm": 1.1328125, "learning_rate": 0.0004916932822761776, "loss": 5.317, "mean_token_accuracy": 0.1775512158870697, "num_tokens": 20935750.0, "step": 12065 }, { "entropy": 5.479429721832275, "epoch": 0.9391169033262011, "grad_norm": 1.0703125, "learning_rate": 0.0004916858192945126, "loss": 5.1998, "mean_token_accuracy": 0.18337763100862503, "num_tokens": 20944089.0, "step": 12070 }, { "entropy": 5.505683755874633, "epoch": 0.9395059326979187, "grad_norm": 0.99609375, "learning_rate": 0.0004916783530249852, "loss": 5.2901, "mean_token_accuracy": 0.1746939390897751, "num_tokens": 20952704.0, "step": 12075 }, { "entropy": 5.515748691558838, "epoch": 0.9398949620696363, "grad_norm": 0.99609375, "learning_rate": 0.0004916708834677086, "loss": 5.1689, "mean_token_accuracy": 0.183145010471344, "num_tokens": 20960741.0, "step": 12080 }, { "entropy": 5.5298699855804445, "epoch": 0.9402839914413538, "grad_norm": 1.0, "learning_rate": 0.0004916634106227962, "loss": 5.1811, "mean_token_accuracy": 0.1927749454975128, "num_tokens": 20968778.0, "step": 12085 }, { "entropy": 5.553344964981079, "epoch": 0.9406730208130714, "grad_norm": 0.96875, "learning_rate": 0.0004916559344903614, "loss": 5.325, "mean_token_accuracy": 0.17719765603542328, "num_tokens": 20977993.0, "step": 12090 }, { "entropy": 5.551492738723755, "epoch": 0.941062050184789, "grad_norm": 1.0625, "learning_rate": 0.0004916484550705176, "loss": 5.1664, "mean_token_accuracy": 0.19061814844608307, "num_tokens": 20986974.0, "step": 12095 }, { "entropy": 5.578476667404175, "epoch": 0.9414510795565065, "grad_norm": 1.03125, "learning_rate": 0.0004916409723633785, "loss": 5.297, "mean_token_accuracy": 0.18105291575193405, "num_tokens": 20995224.0, "step": 12100 }, { "entropy": 5.533691263198852, "epoch": 0.9418401089282241, "grad_norm": 1.125, "learning_rate": 0.0004916334863690573, "loss": 5.2985, "mean_token_accuracy": 0.18382703214883805, "num_tokens": 21003270.0, "step": 12105 }, { "entropy": 5.530404901504516, "epoch": 0.9422291382999416, "grad_norm": 1.0546875, "learning_rate": 0.0004916259970876678, "loss": 5.2572, "mean_token_accuracy": 0.17963644862174988, "num_tokens": 21012665.0, "step": 12110 }, { "entropy": 5.542511653900147, "epoch": 0.9426181676716592, "grad_norm": 1.109375, "learning_rate": 0.0004916185045193237, "loss": 5.2858, "mean_token_accuracy": 0.18203184604644776, "num_tokens": 21021043.0, "step": 12115 }, { "entropy": 5.5450217723846436, "epoch": 0.9430071970433768, "grad_norm": 1.1015625, "learning_rate": 0.0004916110086641384, "loss": 5.2, "mean_token_accuracy": 0.1883975610136986, "num_tokens": 21029525.0, "step": 12120 }, { "entropy": 5.505172920227051, "epoch": 0.9433962264150944, "grad_norm": 1.109375, "learning_rate": 0.0004916035095222259, "loss": 5.1813, "mean_token_accuracy": 0.1855836719274521, "num_tokens": 21037687.0, "step": 12125 }, { "entropy": 5.558738851547242, "epoch": 0.9437852557868119, "grad_norm": 1.03125, "learning_rate": 0.0004915960070936999, "loss": 5.2744, "mean_token_accuracy": 0.17998253405094147, "num_tokens": 21046095.0, "step": 12130 }, { "entropy": 5.547748470306397, "epoch": 0.9441742851585294, "grad_norm": 1.03125, "learning_rate": 0.0004915885013786742, "loss": 5.2337, "mean_token_accuracy": 0.18716817051172258, "num_tokens": 21054565.0, "step": 12135 }, { "entropy": 5.435095262527466, "epoch": 0.944563314530247, "grad_norm": 1.0625, "learning_rate": 0.0004915809923772628, "loss": 5.1426, "mean_token_accuracy": 0.192797426879406, "num_tokens": 21062942.0, "step": 12140 }, { "entropy": 5.4994841575622555, "epoch": 0.9449523439019646, "grad_norm": 1.1015625, "learning_rate": 0.0004915734800895796, "loss": 5.1945, "mean_token_accuracy": 0.18221420496702195, "num_tokens": 21070642.0, "step": 12145 }, { "entropy": 5.5255790710449215, "epoch": 0.9453413732736822, "grad_norm": 0.9765625, "learning_rate": 0.0004915659645157383, "loss": 5.1793, "mean_token_accuracy": 0.18511480540037156, "num_tokens": 21079007.0, "step": 12150 }, { "entropy": 5.527851295471192, "epoch": 0.9457304026453998, "grad_norm": 1.0, "learning_rate": 0.0004915584456558535, "loss": 5.2475, "mean_token_accuracy": 0.17964030653238297, "num_tokens": 21087672.0, "step": 12155 }, { "entropy": 5.573933744430542, "epoch": 0.9461194320171173, "grad_norm": 0.99609375, "learning_rate": 0.0004915509235100388, "loss": 5.1741, "mean_token_accuracy": 0.18992459326982497, "num_tokens": 21095954.0, "step": 12160 }, { "entropy": 5.558452939987182, "epoch": 0.9465084613888348, "grad_norm": 1.015625, "learning_rate": 0.0004915433980784086, "loss": 5.1566, "mean_token_accuracy": 0.18308529555797576, "num_tokens": 21104439.0, "step": 12165 }, { "entropy": 5.498532629013061, "epoch": 0.9468974907605524, "grad_norm": 1.0546875, "learning_rate": 0.0004915358693610769, "loss": 5.1987, "mean_token_accuracy": 0.17854150980710984, "num_tokens": 21112933.0, "step": 12170 }, { "entropy": 5.515249443054199, "epoch": 0.94728652013227, "grad_norm": 1.0625, "learning_rate": 0.0004915283373581581, "loss": 5.2019, "mean_token_accuracy": 0.18734811544418334, "num_tokens": 21122085.0, "step": 12175 }, { "entropy": 5.541512537002563, "epoch": 0.9476755495039876, "grad_norm": 1.0625, "learning_rate": 0.0004915208020697664, "loss": 5.2594, "mean_token_accuracy": 0.17806195616722106, "num_tokens": 21130994.0, "step": 12180 }, { "entropy": 5.5385706424713135, "epoch": 0.9480645788757052, "grad_norm": 1.0078125, "learning_rate": 0.0004915132634960162, "loss": 5.1704, "mean_token_accuracy": 0.1894767925143242, "num_tokens": 21139744.0, "step": 12185 }, { "entropy": 5.539738750457763, "epoch": 0.9484536082474226, "grad_norm": 1.0, "learning_rate": 0.0004915057216370218, "loss": 5.182, "mean_token_accuracy": 0.18806281238794326, "num_tokens": 21148333.0, "step": 12190 }, { "entropy": 5.4672181606292725, "epoch": 0.9488426376191402, "grad_norm": 0.9765625, "learning_rate": 0.0004914981764928977, "loss": 5.1242, "mean_token_accuracy": 0.19405995309352875, "num_tokens": 21157450.0, "step": 12195 }, { "entropy": 5.546806526184082, "epoch": 0.9492316669908578, "grad_norm": 1.015625, "learning_rate": 0.0004914906280637584, "loss": 5.2827, "mean_token_accuracy": 0.1828058898448944, "num_tokens": 21166410.0, "step": 12200 }, { "entropy": 5.530259990692139, "epoch": 0.9496206963625754, "grad_norm": 1.015625, "learning_rate": 0.0004914830763497183, "loss": 5.2245, "mean_token_accuracy": 0.19005807787179946, "num_tokens": 21175104.0, "step": 12205 }, { "entropy": 5.530684280395508, "epoch": 0.950009725734293, "grad_norm": 1.109375, "learning_rate": 0.0004914755213508922, "loss": 5.1819, "mean_token_accuracy": 0.18115302473306655, "num_tokens": 21182597.0, "step": 12210 }, { "entropy": 5.511979675292968, "epoch": 0.9503987551060105, "grad_norm": 0.953125, "learning_rate": 0.0004914679630673945, "loss": 5.2873, "mean_token_accuracy": 0.1847599446773529, "num_tokens": 21192399.0, "step": 12215 }, { "entropy": 5.486062717437744, "epoch": 0.950787784477728, "grad_norm": 1.0078125, "learning_rate": 0.0004914604014993401, "loss": 5.1452, "mean_token_accuracy": 0.18992860615253448, "num_tokens": 21201275.0, "step": 12220 }, { "entropy": 5.49447774887085, "epoch": 0.9511768138494456, "grad_norm": 1.0703125, "learning_rate": 0.0004914528366468436, "loss": 5.2391, "mean_token_accuracy": 0.1888388827443123, "num_tokens": 21210491.0, "step": 12225 }, { "entropy": 5.538168239593506, "epoch": 0.9515658432211632, "grad_norm": 0.95703125, "learning_rate": 0.0004914452685100199, "loss": 5.2384, "mean_token_accuracy": 0.186061355471611, "num_tokens": 21218899.0, "step": 12230 }, { "entropy": 5.446331977844238, "epoch": 0.9519548725928808, "grad_norm": 0.9921875, "learning_rate": 0.0004914376970889836, "loss": 5.151, "mean_token_accuracy": 0.18426788300275804, "num_tokens": 21227640.0, "step": 12235 }, { "entropy": 5.462352561950683, "epoch": 0.9523439019645983, "grad_norm": 0.984375, "learning_rate": 0.0004914301223838497, "loss": 5.1175, "mean_token_accuracy": 0.18654071688652038, "num_tokens": 21236422.0, "step": 12240 }, { "entropy": 5.531829500198365, "epoch": 0.9527329313363159, "grad_norm": 0.98828125, "learning_rate": 0.0004914225443947334, "loss": 5.3169, "mean_token_accuracy": 0.17905295342206956, "num_tokens": 21245820.0, "step": 12245 }, { "entropy": 5.588084030151367, "epoch": 0.9531219607080335, "grad_norm": 1.015625, "learning_rate": 0.0004914149631217494, "loss": 5.2294, "mean_token_accuracy": 0.18180256634950637, "num_tokens": 21255570.0, "step": 12250 }, { "entropy": 5.581680774688721, "epoch": 0.953510990079751, "grad_norm": 1.09375, "learning_rate": 0.0004914073785650127, "loss": 5.3324, "mean_token_accuracy": 0.17814234495162964, "num_tokens": 21263712.0, "step": 12255 }, { "entropy": 5.552824354171753, "epoch": 0.9539000194514686, "grad_norm": 1.0078125, "learning_rate": 0.0004913997907246385, "loss": 5.2229, "mean_token_accuracy": 0.1894031584262848, "num_tokens": 21272309.0, "step": 12260 }, { "entropy": 5.446717929840088, "epoch": 0.9542890488231861, "grad_norm": 1.03125, "learning_rate": 0.000491392199600742, "loss": 5.1709, "mean_token_accuracy": 0.18323369026184083, "num_tokens": 21281711.0, "step": 12265 }, { "entropy": 5.5066399574279785, "epoch": 0.9546780781949037, "grad_norm": 1.0625, "learning_rate": 0.0004913846051934382, "loss": 5.1314, "mean_token_accuracy": 0.1903446912765503, "num_tokens": 21289524.0, "step": 12270 }, { "entropy": 5.470922946929932, "epoch": 0.9550671075666213, "grad_norm": 1.0390625, "learning_rate": 0.0004913770075028425, "loss": 5.0724, "mean_token_accuracy": 0.19203362464904786, "num_tokens": 21298225.0, "step": 12275 }, { "entropy": 5.473766899108886, "epoch": 0.9554561369383389, "grad_norm": 1.0234375, "learning_rate": 0.0004913694065290701, "loss": 5.0732, "mean_token_accuracy": 0.1921350285410881, "num_tokens": 21306819.0, "step": 12280 }, { "entropy": 5.473769426345825, "epoch": 0.9558451663100564, "grad_norm": 1.03125, "learning_rate": 0.0004913618022722363, "loss": 5.2494, "mean_token_accuracy": 0.18232727348804473, "num_tokens": 21315517.0, "step": 12285 }, { "entropy": 5.450310945510864, "epoch": 0.9562341956817739, "grad_norm": 1.0078125, "learning_rate": 0.0004913541947324566, "loss": 5.1415, "mean_token_accuracy": 0.19170354306697845, "num_tokens": 21324144.0, "step": 12290 }, { "entropy": 5.506079959869385, "epoch": 0.9566232250534915, "grad_norm": 1.0390625, "learning_rate": 0.0004913465839098463, "loss": 5.2057, "mean_token_accuracy": 0.1841920018196106, "num_tokens": 21333329.0, "step": 12295 }, { "entropy": 5.511999988555909, "epoch": 0.9570122544252091, "grad_norm": 0.9765625, "learning_rate": 0.0004913389698045209, "loss": 5.1847, "mean_token_accuracy": 0.17890913039445877, "num_tokens": 21341955.0, "step": 12300 }, { "entropy": 5.490865659713745, "epoch": 0.9574012837969267, "grad_norm": 1.0625, "learning_rate": 0.000491331352416596, "loss": 5.1477, "mean_token_accuracy": 0.1858035773038864, "num_tokens": 21350593.0, "step": 12305 }, { "entropy": 5.527435445785523, "epoch": 0.9577903131686443, "grad_norm": 1.0625, "learning_rate": 0.0004913237317461872, "loss": 5.2316, "mean_token_accuracy": 0.1812049701809883, "num_tokens": 21359007.0, "step": 12310 }, { "entropy": 5.581458854675293, "epoch": 0.9581793425403617, "grad_norm": 1.03125, "learning_rate": 0.00049131610779341, "loss": 5.2515, "mean_token_accuracy": 0.18166308104991913, "num_tokens": 21367645.0, "step": 12315 }, { "entropy": 5.444465970993042, "epoch": 0.9585683719120793, "grad_norm": 0.9921875, "learning_rate": 0.0004913084805583803, "loss": 5.0755, "mean_token_accuracy": 0.19208742827177047, "num_tokens": 21376040.0, "step": 12320 }, { "entropy": 5.513364791870117, "epoch": 0.9589574012837969, "grad_norm": 1.046875, "learning_rate": 0.0004913008500412136, "loss": 5.2112, "mean_token_accuracy": 0.18718913793563843, "num_tokens": 21385305.0, "step": 12325 }, { "entropy": 5.444958162307739, "epoch": 0.9593464306555145, "grad_norm": 0.99609375, "learning_rate": 0.0004912932162420259, "loss": 5.0842, "mean_token_accuracy": 0.20126842856407165, "num_tokens": 21393705.0, "step": 12330 }, { "entropy": 5.522450304031372, "epoch": 0.9597354600272321, "grad_norm": 1.109375, "learning_rate": 0.0004912855791609327, "loss": 5.2264, "mean_token_accuracy": 0.18395763039588928, "num_tokens": 21401830.0, "step": 12335 }, { "entropy": 5.508466053009033, "epoch": 0.9601244893989496, "grad_norm": 1.03125, "learning_rate": 0.0004912779387980502, "loss": 5.2529, "mean_token_accuracy": 0.18129907846450805, "num_tokens": 21410398.0, "step": 12340 }, { "entropy": 5.580213928222657, "epoch": 0.9605135187706672, "grad_norm": 1.0078125, "learning_rate": 0.0004912702951534942, "loss": 5.2083, "mean_token_accuracy": 0.18933378607034684, "num_tokens": 21419082.0, "step": 12345 }, { "entropy": 5.57101731300354, "epoch": 0.9609025481423847, "grad_norm": 1.0078125, "learning_rate": 0.0004912626482273809, "loss": 5.2178, "mean_token_accuracy": 0.18181514143943786, "num_tokens": 21427992.0, "step": 12350 }, { "entropy": 5.492464876174926, "epoch": 0.9612915775141023, "grad_norm": 0.98828125, "learning_rate": 0.0004912549980198258, "loss": 5.1864, "mean_token_accuracy": 0.1828164502978325, "num_tokens": 21436933.0, "step": 12355 }, { "entropy": 5.473798036575317, "epoch": 0.9616806068858199, "grad_norm": 0.99609375, "learning_rate": 0.0004912473445309455, "loss": 5.1911, "mean_token_accuracy": 0.18906369805335999, "num_tokens": 21445640.0, "step": 12360 }, { "entropy": 5.567175483703613, "epoch": 0.9620696362575375, "grad_norm": 1.0078125, "learning_rate": 0.000491239687760856, "loss": 5.3394, "mean_token_accuracy": 0.1779853567481041, "num_tokens": 21454511.0, "step": 12365 }, { "entropy": 5.537627935409546, "epoch": 0.962458665629255, "grad_norm": 0.953125, "learning_rate": 0.0004912320277096732, "loss": 5.3451, "mean_token_accuracy": 0.17656426429748534, "num_tokens": 21463851.0, "step": 12370 }, { "entropy": 5.519644689559937, "epoch": 0.9628476950009726, "grad_norm": 1.0859375, "learning_rate": 0.0004912243643775137, "loss": 5.1324, "mean_token_accuracy": 0.19061287343502045, "num_tokens": 21471620.0, "step": 12375 }, { "entropy": 5.474944067001343, "epoch": 0.9632367243726901, "grad_norm": 1.09375, "learning_rate": 0.0004912166977644936, "loss": 5.1528, "mean_token_accuracy": 0.18514589667320253, "num_tokens": 21479944.0, "step": 12380 }, { "entropy": 5.602413988113403, "epoch": 0.9636257537444077, "grad_norm": 1.046875, "learning_rate": 0.0004912090278707293, "loss": 5.3303, "mean_token_accuracy": 0.17412468940019607, "num_tokens": 21489175.0, "step": 12385 }, { "entropy": 5.547793626785278, "epoch": 0.9640147831161253, "grad_norm": 1.0625, "learning_rate": 0.000491201354696337, "loss": 5.2407, "mean_token_accuracy": 0.18572924435138702, "num_tokens": 21498533.0, "step": 12390 }, { "entropy": 5.600402307510376, "epoch": 0.9644038124878428, "grad_norm": 1.0234375, "learning_rate": 0.0004911936782414334, "loss": 5.2944, "mean_token_accuracy": 0.17658164948225022, "num_tokens": 21506771.0, "step": 12395 }, { "entropy": 5.4185277938842775, "epoch": 0.9647928418595604, "grad_norm": 0.99609375, "learning_rate": 0.0004911859985061348, "loss": 5.1096, "mean_token_accuracy": 0.19783927649259567, "num_tokens": 21515359.0, "step": 12400 }, { "entropy": 5.507141780853272, "epoch": 0.965181871231278, "grad_norm": 1.0078125, "learning_rate": 0.0004911783154905577, "loss": 5.182, "mean_token_accuracy": 0.18420559167861938, "num_tokens": 21524313.0, "step": 12405 }, { "entropy": 5.49774956703186, "epoch": 0.9655709006029956, "grad_norm": 0.98046875, "learning_rate": 0.0004911706291948188, "loss": 5.1793, "mean_token_accuracy": 0.19277555942535402, "num_tokens": 21533211.0, "step": 12410 }, { "entropy": 5.5079692840576175, "epoch": 0.9659599299747131, "grad_norm": 0.9765625, "learning_rate": 0.0004911629396190348, "loss": 5.1409, "mean_token_accuracy": 0.18909541368484498, "num_tokens": 21541575.0, "step": 12415 }, { "entropy": 5.535463476181031, "epoch": 0.9663489593464306, "grad_norm": 1.0859375, "learning_rate": 0.0004911552467633221, "loss": 5.2354, "mean_token_accuracy": 0.18470649123191835, "num_tokens": 21549569.0, "step": 12420 }, { "entropy": 5.4978314399719235, "epoch": 0.9667379887181482, "grad_norm": 1.0703125, "learning_rate": 0.0004911475506277976, "loss": 5.1906, "mean_token_accuracy": 0.18454653769731522, "num_tokens": 21557277.0, "step": 12425 }, { "entropy": 5.506871128082276, "epoch": 0.9671270180898658, "grad_norm": 1.0390625, "learning_rate": 0.000491139851212578, "loss": 5.2021, "mean_token_accuracy": 0.18516795635223388, "num_tokens": 21566590.0, "step": 12430 }, { "entropy": 5.518911933898925, "epoch": 0.9675160474615834, "grad_norm": 0.98046875, "learning_rate": 0.0004911321485177802, "loss": 5.2708, "mean_token_accuracy": 0.1785898670554161, "num_tokens": 21575140.0, "step": 12435 }, { "entropy": 5.501185274124145, "epoch": 0.967905076833301, "grad_norm": 0.9921875, "learning_rate": 0.0004911244425435212, "loss": 5.2182, "mean_token_accuracy": 0.17693160474300385, "num_tokens": 21584647.0, "step": 12440 }, { "entropy": 5.539900302886963, "epoch": 0.9682941062050184, "grad_norm": 1.0390625, "learning_rate": 0.0004911167332899176, "loss": 5.1795, "mean_token_accuracy": 0.18031269758939744, "num_tokens": 21593609.0, "step": 12445 }, { "entropy": 5.59472336769104, "epoch": 0.968683135576736, "grad_norm": 1.171875, "learning_rate": 0.0004911090207570867, "loss": 5.3139, "mean_token_accuracy": 0.1779691070318222, "num_tokens": 21602584.0, "step": 12450 }, { "entropy": 5.4438293933868405, "epoch": 0.9690721649484536, "grad_norm": 1.0703125, "learning_rate": 0.0004911013049451453, "loss": 5.2578, "mean_token_accuracy": 0.1926572620868683, "num_tokens": 21611109.0, "step": 12455 }, { "entropy": 5.574373340606689, "epoch": 0.9694611943201712, "grad_norm": 0.99609375, "learning_rate": 0.0004910935858542106, "loss": 5.2451, "mean_token_accuracy": 0.18166916221380233, "num_tokens": 21620173.0, "step": 12460 }, { "entropy": 5.492316770553589, "epoch": 0.9698502236918888, "grad_norm": 1.03125, "learning_rate": 0.0004910858634843997, "loss": 5.1141, "mean_token_accuracy": 0.19255291521549225, "num_tokens": 21628318.0, "step": 12465 }, { "entropy": 5.544769382476806, "epoch": 0.9702392530636063, "grad_norm": 1.0078125, "learning_rate": 0.0004910781378358297, "loss": 5.3059, "mean_token_accuracy": 0.18231797069311143, "num_tokens": 21637102.0, "step": 12470 }, { "entropy": 5.524718856811523, "epoch": 0.9706282824353238, "grad_norm": 1.0703125, "learning_rate": 0.0004910704089086178, "loss": 5.1623, "mean_token_accuracy": 0.1874286025762558, "num_tokens": 21645055.0, "step": 12475 }, { "entropy": 5.551263809204102, "epoch": 0.9710173118070414, "grad_norm": 1.0078125, "learning_rate": 0.0004910626767028815, "loss": 5.2202, "mean_token_accuracy": 0.17940667122602463, "num_tokens": 21654106.0, "step": 12480 }, { "entropy": 5.50961742401123, "epoch": 0.971406341178759, "grad_norm": 0.99609375, "learning_rate": 0.0004910549412187379, "loss": 5.2241, "mean_token_accuracy": 0.18254614770412445, "num_tokens": 21663081.0, "step": 12485 }, { "entropy": 5.518645429611206, "epoch": 0.9717953705504766, "grad_norm": 1.09375, "learning_rate": 0.0004910472024563045, "loss": 5.1956, "mean_token_accuracy": 0.18565891683101654, "num_tokens": 21671033.0, "step": 12490 }, { "entropy": 5.529978513717651, "epoch": 0.9721843999221941, "grad_norm": 1.1484375, "learning_rate": 0.0004910394604156987, "loss": 5.1998, "mean_token_accuracy": 0.1902226909995079, "num_tokens": 21679167.0, "step": 12495 }, { "entropy": 5.539509296417236, "epoch": 0.9725734292939117, "grad_norm": 1.03125, "learning_rate": 0.0004910317150970379, "loss": 5.3091, "mean_token_accuracy": 0.18027957379817963, "num_tokens": 21688365.0, "step": 12500 }, { "entropy": 5.517002010345459, "epoch": 0.9729624586656292, "grad_norm": 1.0, "learning_rate": 0.0004910239665004397, "loss": 5.2053, "mean_token_accuracy": 0.18724174946546554, "num_tokens": 21697003.0, "step": 12505 }, { "entropy": 5.571697998046875, "epoch": 0.9733514880373468, "grad_norm": 1.03125, "learning_rate": 0.0004910162146260216, "loss": 5.2097, "mean_token_accuracy": 0.18543837666511537, "num_tokens": 21705947.0, "step": 12510 }, { "entropy": 5.542418718338013, "epoch": 0.9737405174090644, "grad_norm": 1.09375, "learning_rate": 0.0004910084594739013, "loss": 5.2377, "mean_token_accuracy": 0.18166089802980423, "num_tokens": 21714153.0, "step": 12515 }, { "entropy": 5.539939975738525, "epoch": 0.9741295467807819, "grad_norm": 1.046875, "learning_rate": 0.0004910007010441964, "loss": 5.3111, "mean_token_accuracy": 0.1793983668088913, "num_tokens": 21723480.0, "step": 12520 }, { "entropy": 5.597034931182861, "epoch": 0.9745185761524995, "grad_norm": 1.078125, "learning_rate": 0.0004909929393370248, "loss": 5.1829, "mean_token_accuracy": 0.18854614347219467, "num_tokens": 21731297.0, "step": 12525 }, { "entropy": 5.496393251419067, "epoch": 0.9749076055242171, "grad_norm": 0.91015625, "learning_rate": 0.0004909851743525041, "loss": 5.1812, "mean_token_accuracy": 0.18271616399288176, "num_tokens": 21740975.0, "step": 12530 }, { "entropy": 5.460677814483643, "epoch": 0.9752966348959347, "grad_norm": 1.03125, "learning_rate": 0.000490977406090752, "loss": 5.1587, "mean_token_accuracy": 0.18489089906215667, "num_tokens": 21749642.0, "step": 12535 }, { "entropy": 5.479054117202759, "epoch": 0.9756856642676522, "grad_norm": 1.1328125, "learning_rate": 0.0004909696345518867, "loss": 5.2062, "mean_token_accuracy": 0.18261976540088654, "num_tokens": 21757962.0, "step": 12540 }, { "entropy": 5.536506986618042, "epoch": 0.9760746936393697, "grad_norm": 1.0390625, "learning_rate": 0.0004909618597360258, "loss": 5.2082, "mean_token_accuracy": 0.18112513720989226, "num_tokens": 21766053.0, "step": 12545 }, { "entropy": 5.477893829345703, "epoch": 0.9764637230110873, "grad_norm": 1.109375, "learning_rate": 0.0004909540816432876, "loss": 5.1408, "mean_token_accuracy": 0.18171311318874359, "num_tokens": 21774280.0, "step": 12550 }, { "entropy": 5.474995756149292, "epoch": 0.9768527523828049, "grad_norm": 0.9609375, "learning_rate": 0.0004909463002737897, "loss": 5.1774, "mean_token_accuracy": 0.185720819234848, "num_tokens": 21782879.0, "step": 12555 }, { "entropy": 5.543355512619018, "epoch": 0.9772417817545225, "grad_norm": 1.0703125, "learning_rate": 0.0004909385156276506, "loss": 5.25, "mean_token_accuracy": 0.18294990956783294, "num_tokens": 21791294.0, "step": 12560 }, { "entropy": 5.533573865890503, "epoch": 0.9776308111262401, "grad_norm": 1.078125, "learning_rate": 0.0004909307277049881, "loss": 5.116, "mean_token_accuracy": 0.19186461865901946, "num_tokens": 21799304.0, "step": 12565 }, { "entropy": 5.553555536270141, "epoch": 0.9780198404979576, "grad_norm": 0.9609375, "learning_rate": 0.0004909229365059205, "loss": 5.2884, "mean_token_accuracy": 0.1759040892124176, "num_tokens": 21809024.0, "step": 12570 }, { "entropy": 5.5139548778533936, "epoch": 0.9784088698696751, "grad_norm": 1.125, "learning_rate": 0.0004909151420305661, "loss": 5.1041, "mean_token_accuracy": 0.19253565222024918, "num_tokens": 21817412.0, "step": 12575 }, { "entropy": 5.45721116065979, "epoch": 0.9787978992413927, "grad_norm": 1.1015625, "learning_rate": 0.000490907344279043, "loss": 5.1389, "mean_token_accuracy": 0.184374862909317, "num_tokens": 21825261.0, "step": 12580 }, { "entropy": 5.546183109283447, "epoch": 0.9791869286131103, "grad_norm": 1.015625, "learning_rate": 0.0004908995432514698, "loss": 5.2648, "mean_token_accuracy": 0.18909238427877426, "num_tokens": 21833318.0, "step": 12585 }, { "entropy": 5.53397159576416, "epoch": 0.9795759579848279, "grad_norm": 1.078125, "learning_rate": 0.0004908917389479645, "loss": 5.2256, "mean_token_accuracy": 0.1803707167506218, "num_tokens": 21841377.0, "step": 12590 }, { "entropy": 5.48668327331543, "epoch": 0.9799649873565455, "grad_norm": 0.9609375, "learning_rate": 0.0004908839313686456, "loss": 5.162, "mean_token_accuracy": 0.18408640027046203, "num_tokens": 21850183.0, "step": 12595 }, { "entropy": 5.551877880096436, "epoch": 0.980354016728263, "grad_norm": 1.0625, "learning_rate": 0.0004908761205136319, "loss": 5.244, "mean_token_accuracy": 0.19418322741985322, "num_tokens": 21858108.0, "step": 12600 }, { "entropy": 5.498581743240356, "epoch": 0.9807430460999805, "grad_norm": 1.0546875, "learning_rate": 0.0004908683063830414, "loss": 5.146, "mean_token_accuracy": 0.18696407973766327, "num_tokens": 21866330.0, "step": 12605 }, { "entropy": 5.552292680740356, "epoch": 0.9811320754716981, "grad_norm": 1.09375, "learning_rate": 0.0004908604889769932, "loss": 5.2142, "mean_token_accuracy": 0.18338896930217743, "num_tokens": 21875254.0, "step": 12610 }, { "entropy": 5.577702379226684, "epoch": 0.9815211048434157, "grad_norm": 1.0625, "learning_rate": 0.0004908526682956054, "loss": 5.2868, "mean_token_accuracy": 0.1798260122537613, "num_tokens": 21884009.0, "step": 12615 }, { "entropy": 5.529340219497681, "epoch": 0.9819101342151333, "grad_norm": 1.0546875, "learning_rate": 0.0004908448443389972, "loss": 5.1921, "mean_token_accuracy": 0.18171070367097855, "num_tokens": 21892428.0, "step": 12620 }, { "entropy": 5.535893297195434, "epoch": 0.9822991635868508, "grad_norm": 1.078125, "learning_rate": 0.0004908370171072869, "loss": 5.2357, "mean_token_accuracy": 0.1902315139770508, "num_tokens": 21901140.0, "step": 12625 }, { "entropy": 5.452203941345215, "epoch": 0.9826881929585684, "grad_norm": 1.046875, "learning_rate": 0.0004908291866005933, "loss": 5.1412, "mean_token_accuracy": 0.20030835121870041, "num_tokens": 21909072.0, "step": 12630 }, { "entropy": 5.462773942947388, "epoch": 0.9830772223302859, "grad_norm": 1.03125, "learning_rate": 0.0004908213528190355, "loss": 5.1958, "mean_token_accuracy": 0.18156480342149733, "num_tokens": 21917873.0, "step": 12635 }, { "entropy": 5.5941174030303955, "epoch": 0.9834662517020035, "grad_norm": 1.03125, "learning_rate": 0.0004908135157627321, "loss": 5.306, "mean_token_accuracy": 0.18072328269481658, "num_tokens": 21927302.0, "step": 12640 }, { "entropy": 5.558180332183838, "epoch": 0.9838552810737211, "grad_norm": 0.99609375, "learning_rate": 0.0004908056754318022, "loss": 5.2382, "mean_token_accuracy": 0.18694844245910644, "num_tokens": 21936440.0, "step": 12645 }, { "entropy": 5.492184495925903, "epoch": 0.9842443104454386, "grad_norm": 1.1015625, "learning_rate": 0.0004907978318263646, "loss": 5.1014, "mean_token_accuracy": 0.18789486587047577, "num_tokens": 21944655.0, "step": 12650 }, { "entropy": 5.602429533004761, "epoch": 0.9846333398171562, "grad_norm": 0.98828125, "learning_rate": 0.0004907899849465383, "loss": 5.3293, "mean_token_accuracy": 0.18272876590490342, "num_tokens": 21953202.0, "step": 12655 }, { "entropy": 5.571168041229248, "epoch": 0.9850223691888738, "grad_norm": 1.109375, "learning_rate": 0.0004907821347924424, "loss": 5.1944, "mean_token_accuracy": 0.1916508838534355, "num_tokens": 21961889.0, "step": 12660 }, { "entropy": 5.463804435729981, "epoch": 0.9854113985605913, "grad_norm": 1.0, "learning_rate": 0.0004907742813641963, "loss": 5.0918, "mean_token_accuracy": 0.18718110471963884, "num_tokens": 21970864.0, "step": 12665 }, { "entropy": 5.438660669326782, "epoch": 0.9858004279323089, "grad_norm": 1.0703125, "learning_rate": 0.0004907664246619187, "loss": 5.1944, "mean_token_accuracy": 0.18396665006875992, "num_tokens": 21979271.0, "step": 12670 }, { "entropy": 5.498868846893311, "epoch": 0.9861894573040264, "grad_norm": 1.0703125, "learning_rate": 0.0004907585646857293, "loss": 5.0355, "mean_token_accuracy": 0.1981876328587532, "num_tokens": 21987321.0, "step": 12675 }, { "entropy": 5.514168787002563, "epoch": 0.986578486675744, "grad_norm": 1.046875, "learning_rate": 0.0004907507014357467, "loss": 5.304, "mean_token_accuracy": 0.1799568071961403, "num_tokens": 21996094.0, "step": 12680 }, { "entropy": 5.403339195251465, "epoch": 0.9869675160474616, "grad_norm": 1.0, "learning_rate": 0.0004907428349120909, "loss": 5.1729, "mean_token_accuracy": 0.18113742917776107, "num_tokens": 22004095.0, "step": 12685 }, { "entropy": 5.56201810836792, "epoch": 0.9873565454191792, "grad_norm": 1.0390625, "learning_rate": 0.0004907349651148809, "loss": 5.274, "mean_token_accuracy": 0.17848834693431853, "num_tokens": 22013371.0, "step": 12690 }, { "entropy": 5.565800714492798, "epoch": 0.9877455747908968, "grad_norm": 1.1015625, "learning_rate": 0.0004907270920442361, "loss": 5.1347, "mean_token_accuracy": 0.18779243230819703, "num_tokens": 22022313.0, "step": 12695 }, { "entropy": 5.554080057144165, "epoch": 0.9881346041626142, "grad_norm": 0.984375, "learning_rate": 0.0004907192157002762, "loss": 5.3062, "mean_token_accuracy": 0.18272850811481475, "num_tokens": 22031690.0, "step": 12700 }, { "entropy": 5.6159892082214355, "epoch": 0.9885236335343318, "grad_norm": 1.125, "learning_rate": 0.0004907113360831204, "loss": 5.3671, "mean_token_accuracy": 0.167807137966156, "num_tokens": 22040957.0, "step": 12705 }, { "entropy": 5.543442296981811, "epoch": 0.9889126629060494, "grad_norm": 1.0390625, "learning_rate": 0.0004907034531928886, "loss": 5.1905, "mean_token_accuracy": 0.1900924786925316, "num_tokens": 22049623.0, "step": 12710 }, { "entropy": 5.480028057098389, "epoch": 0.989301692277767, "grad_norm": 1.0078125, "learning_rate": 0.0004906955670297001, "loss": 5.1839, "mean_token_accuracy": 0.18488493859767913, "num_tokens": 22058205.0, "step": 12715 }, { "entropy": 5.45796217918396, "epoch": 0.9896907216494846, "grad_norm": 0.9765625, "learning_rate": 0.0004906876775936746, "loss": 5.0671, "mean_token_accuracy": 0.18911555856466294, "num_tokens": 22067375.0, "step": 12720 }, { "entropy": 5.468409872055053, "epoch": 0.990079751021202, "grad_norm": 1.046875, "learning_rate": 0.0004906797848849321, "loss": 5.1042, "mean_token_accuracy": 0.1980249896645546, "num_tokens": 22075670.0, "step": 12725 }, { "entropy": 5.4591350078582765, "epoch": 0.9904687803929196, "grad_norm": 1.0703125, "learning_rate": 0.000490671888903592, "loss": 5.1864, "mean_token_accuracy": 0.18388955146074296, "num_tokens": 22084360.0, "step": 12730 }, { "entropy": 5.473550176620483, "epoch": 0.9908578097646372, "grad_norm": 0.9765625, "learning_rate": 0.0004906639896497744, "loss": 5.2177, "mean_token_accuracy": 0.19149741530418396, "num_tokens": 22092666.0, "step": 12735 }, { "entropy": 5.602113199234009, "epoch": 0.9912468391363548, "grad_norm": 1.046875, "learning_rate": 0.0004906560871235988, "loss": 5.3328, "mean_token_accuracy": 0.18582703471183776, "num_tokens": 22101311.0, "step": 12740 }, { "entropy": 5.544232702255249, "epoch": 0.9916358685080724, "grad_norm": 1.0703125, "learning_rate": 0.0004906481813251854, "loss": 5.1694, "mean_token_accuracy": 0.18751597106456758, "num_tokens": 22109640.0, "step": 12745 }, { "entropy": 5.463329029083252, "epoch": 0.9920248978797899, "grad_norm": 0.9609375, "learning_rate": 0.0004906402722546542, "loss": 5.1483, "mean_token_accuracy": 0.18240372687578202, "num_tokens": 22118721.0, "step": 12750 }, { "entropy": 5.4616312980651855, "epoch": 0.9924139272515075, "grad_norm": 1.015625, "learning_rate": 0.000490632359912125, "loss": 5.1538, "mean_token_accuracy": 0.18412765115499496, "num_tokens": 22126745.0, "step": 12755 }, { "entropy": 5.554501724243164, "epoch": 0.992802956623225, "grad_norm": 1.0703125, "learning_rate": 0.000490624444297718, "loss": 5.25, "mean_token_accuracy": 0.18088266104459763, "num_tokens": 22135010.0, "step": 12760 }, { "entropy": 5.521741676330566, "epoch": 0.9931919859949426, "grad_norm": 1.015625, "learning_rate": 0.0004906165254115533, "loss": 5.1745, "mean_token_accuracy": 0.18836508691310883, "num_tokens": 22144339.0, "step": 12765 }, { "entropy": 5.410540056228638, "epoch": 0.9935810153666602, "grad_norm": 0.9765625, "learning_rate": 0.000490608603253751, "loss": 5.145, "mean_token_accuracy": 0.19036857783794403, "num_tokens": 22153405.0, "step": 12770 }, { "entropy": 5.510430335998535, "epoch": 0.9939700447383778, "grad_norm": 1.046875, "learning_rate": 0.0004906006778244312, "loss": 5.2078, "mean_token_accuracy": 0.1834151715040207, "num_tokens": 22161392.0, "step": 12775 }, { "entropy": 5.5190338611602785, "epoch": 0.9943590741100953, "grad_norm": 0.9765625, "learning_rate": 0.0004905927491237145, "loss": 5.1691, "mean_token_accuracy": 0.18867688477039338, "num_tokens": 22170635.0, "step": 12780 }, { "entropy": 5.43877387046814, "epoch": 0.9947481034818129, "grad_norm": 1.0390625, "learning_rate": 0.0004905848171517208, "loss": 5.0746, "mean_token_accuracy": 0.1918277248740196, "num_tokens": 22178629.0, "step": 12785 }, { "entropy": 5.445385408401489, "epoch": 0.9951371328535304, "grad_norm": 0.9609375, "learning_rate": 0.0004905768819085706, "loss": 5.1247, "mean_token_accuracy": 0.19359603077173232, "num_tokens": 22187142.0, "step": 12790 }, { "entropy": 5.547541666030884, "epoch": 0.995526162225248, "grad_norm": 0.97265625, "learning_rate": 0.0004905689433943846, "loss": 5.2015, "mean_token_accuracy": 0.18535224497318267, "num_tokens": 22195249.0, "step": 12795 }, { "entropy": 5.539476823806763, "epoch": 0.9959151915969656, "grad_norm": 1.015625, "learning_rate": 0.0004905610016092828, "loss": 5.2454, "mean_token_accuracy": 0.1860746845602989, "num_tokens": 22203621.0, "step": 12800 }, { "entropy": 5.480684804916382, "epoch": 0.9963042209686831, "grad_norm": 1.0078125, "learning_rate": 0.0004905530565533859, "loss": 5.1679, "mean_token_accuracy": 0.1923306703567505, "num_tokens": 22212547.0, "step": 12805 }, { "entropy": 5.530616092681885, "epoch": 0.9966932503404007, "grad_norm": 0.9765625, "learning_rate": 0.0004905451082268146, "loss": 5.1895, "mean_token_accuracy": 0.1853019952774048, "num_tokens": 22221642.0, "step": 12810 }, { "entropy": 5.498618793487549, "epoch": 0.9970822797121183, "grad_norm": 0.96484375, "learning_rate": 0.0004905371566296891, "loss": 5.2049, "mean_token_accuracy": 0.1831003785133362, "num_tokens": 22230227.0, "step": 12815 }, { "entropy": 5.502156019210815, "epoch": 0.9974713090838359, "grad_norm": 1.046875, "learning_rate": 0.0004905292017621305, "loss": 5.1885, "mean_token_accuracy": 0.1919209972023964, "num_tokens": 22238973.0, "step": 12820 }, { "entropy": 5.49106068611145, "epoch": 0.9978603384555534, "grad_norm": 1.046875, "learning_rate": 0.0004905212436242593, "loss": 5.1552, "mean_token_accuracy": 0.18910551369190215, "num_tokens": 22247613.0, "step": 12825 }, { "entropy": 5.441490888595581, "epoch": 0.9982493678272709, "grad_norm": 1.078125, "learning_rate": 0.0004905132822161962, "loss": 5.2019, "mean_token_accuracy": 0.18372902572154998, "num_tokens": 22255707.0, "step": 12830 }, { "entropy": 5.450929784774781, "epoch": 0.9986383971989885, "grad_norm": 0.98828125, "learning_rate": 0.0004905053175380621, "loss": 5.0983, "mean_token_accuracy": 0.18963315188884736, "num_tokens": 22264524.0, "step": 12835 }, { "entropy": 5.548648548126221, "epoch": 0.9990274265707061, "grad_norm": 1.03125, "learning_rate": 0.0004904973495899778, "loss": 5.1864, "mean_token_accuracy": 0.1785060316324234, "num_tokens": 22272973.0, "step": 12840 }, { "entropy": 5.543302345275879, "epoch": 0.9994164559424237, "grad_norm": 0.9921875, "learning_rate": 0.0004904893783720642, "loss": 5.2327, "mean_token_accuracy": 0.18023936599493026, "num_tokens": 22281545.0, "step": 12845 }, { "entropy": 5.536446762084961, "epoch": 0.9998054853141413, "grad_norm": 0.99609375, "learning_rate": 0.0004904814038844424, "loss": 5.1943, "mean_token_accuracy": 0.19501698166131973, "num_tokens": 22289835.0, "step": 12850 }, { "entropy": 5.484429359436035, "epoch": 1.000155611748687, "grad_norm": 1.0234375, "learning_rate": 0.0004904734261272332, "loss": 5.1845, "mean_token_accuracy": 0.18051131235228646, "num_tokens": 22297794.0, "step": 12855 }, { "entropy": 5.4853888034820555, "epoch": 1.0005446411204046, "grad_norm": 1.046875, "learning_rate": 0.0004904654451005576, "loss": 5.0871, "mean_token_accuracy": 0.18427188396453859, "num_tokens": 22305637.0, "step": 12860 }, { "entropy": 5.537017726898194, "epoch": 1.0009336704921221, "grad_norm": 1.0078125, "learning_rate": 0.0004904574608045369, "loss": 5.1559, "mean_token_accuracy": 0.1835765615105629, "num_tokens": 22314796.0, "step": 12865 }, { "entropy": 5.5145855903625485, "epoch": 1.0013226998638398, "grad_norm": 0.94140625, "learning_rate": 0.0004904494732392923, "loss": 5.0863, "mean_token_accuracy": 0.18753891736268996, "num_tokens": 22324522.0, "step": 12870 }, { "entropy": 5.512365245819092, "epoch": 1.0017117292355573, "grad_norm": 0.9296875, "learning_rate": 0.0004904414824049448, "loss": 5.093, "mean_token_accuracy": 0.19362651705741882, "num_tokens": 22333404.0, "step": 12875 }, { "entropy": 5.502410793304444, "epoch": 1.0021007586072748, "grad_norm": 1.015625, "learning_rate": 0.0004904334883016156, "loss": 5.1959, "mean_token_accuracy": 0.18336400836706163, "num_tokens": 22343364.0, "step": 12880 }, { "entropy": 5.545052337646484, "epoch": 1.0024897879789925, "grad_norm": 0.9921875, "learning_rate": 0.0004904254909294261, "loss": 5.1287, "mean_token_accuracy": 0.18761567324399947, "num_tokens": 22352854.0, "step": 12885 }, { "entropy": 5.514737558364868, "epoch": 1.00287881735071, "grad_norm": 1.0078125, "learning_rate": 0.0004904174902884978, "loss": 5.0369, "mean_token_accuracy": 0.20159411132335664, "num_tokens": 22361916.0, "step": 12890 }, { "entropy": 5.459781694412231, "epoch": 1.0032678467224276, "grad_norm": 1.015625, "learning_rate": 0.0004904094863789519, "loss": 5.1197, "mean_token_accuracy": 0.18871505856513976, "num_tokens": 22370848.0, "step": 12895 }, { "entropy": 5.402750396728516, "epoch": 1.0036568760941451, "grad_norm": 1.03125, "learning_rate": 0.00049040147920091, "loss": 5.0276, "mean_token_accuracy": 0.19351037293672563, "num_tokens": 22379945.0, "step": 12900 }, { "entropy": 5.499461317062378, "epoch": 1.0040459054658626, "grad_norm": 1.0703125, "learning_rate": 0.0004903934687544933, "loss": 5.0804, "mean_token_accuracy": 0.19285042881965636, "num_tokens": 22388795.0, "step": 12905 }, { "entropy": 5.532463073730469, "epoch": 1.0044349348375803, "grad_norm": 1.078125, "learning_rate": 0.0004903854550398237, "loss": 5.1267, "mean_token_accuracy": 0.19084483981132508, "num_tokens": 22396960.0, "step": 12910 }, { "entropy": 5.517229986190796, "epoch": 1.0048239642092978, "grad_norm": 1.1875, "learning_rate": 0.0004903774380570226, "loss": 5.0089, "mean_token_accuracy": 0.19406117200851442, "num_tokens": 22404698.0, "step": 12915 }, { "entropy": 5.465856647491455, "epoch": 1.0052129935810155, "grad_norm": 1.0703125, "learning_rate": 0.0004903694178062117, "loss": 5.0527, "mean_token_accuracy": 0.18863096982240676, "num_tokens": 22413391.0, "step": 12920 }, { "entropy": 5.523094320297242, "epoch": 1.005602022952733, "grad_norm": 0.98828125, "learning_rate": 0.0004903613942875126, "loss": 5.1787, "mean_token_accuracy": 0.18833088725805283, "num_tokens": 22421357.0, "step": 12925 }, { "entropy": 5.485925912857056, "epoch": 1.0059910523244504, "grad_norm": 0.97265625, "learning_rate": 0.0004903533675010472, "loss": 5.0367, "mean_token_accuracy": 0.1913556233048439, "num_tokens": 22430286.0, "step": 12930 }, { "entropy": 5.479344415664673, "epoch": 1.006380081696168, "grad_norm": 1.015625, "learning_rate": 0.0004903453374469373, "loss": 5.1023, "mean_token_accuracy": 0.19216068238019943, "num_tokens": 22439128.0, "step": 12935 }, { "entropy": 5.46776123046875, "epoch": 1.0067691110678856, "grad_norm": 1.0234375, "learning_rate": 0.0004903373041253045, "loss": 5.0428, "mean_token_accuracy": 0.19438522905111313, "num_tokens": 22447724.0, "step": 12940 }, { "entropy": 5.439131402969361, "epoch": 1.0071581404396033, "grad_norm": 1.0, "learning_rate": 0.0004903292675362709, "loss": 5.0935, "mean_token_accuracy": 0.18843509405851364, "num_tokens": 22456792.0, "step": 12945 }, { "entropy": 5.41352424621582, "epoch": 1.0075471698113208, "grad_norm": 1.109375, "learning_rate": 0.0004903212276799584, "loss": 5.0433, "mean_token_accuracy": 0.19520067572593688, "num_tokens": 22465465.0, "step": 12950 }, { "entropy": 5.478096961975098, "epoch": 1.0079361991830382, "grad_norm": 0.953125, "learning_rate": 0.0004903131845564889, "loss": 5.0639, "mean_token_accuracy": 0.1963818371295929, "num_tokens": 22474498.0, "step": 12955 }, { "entropy": 5.418917989730835, "epoch": 1.008325228554756, "grad_norm": 1.03125, "learning_rate": 0.0004903051381659847, "loss": 5.0029, "mean_token_accuracy": 0.1935848906636238, "num_tokens": 22482926.0, "step": 12960 }, { "entropy": 5.443990802764892, "epoch": 1.0087142579264734, "grad_norm": 1.015625, "learning_rate": 0.0004902970885085677, "loss": 5.021, "mean_token_accuracy": 0.1980034291744232, "num_tokens": 22491984.0, "step": 12965 }, { "entropy": 5.481801986694336, "epoch": 1.009103287298191, "grad_norm": 1.046875, "learning_rate": 0.00049028903558436, "loss": 5.0647, "mean_token_accuracy": 0.18749107867479325, "num_tokens": 22501411.0, "step": 12970 }, { "entropy": 5.525384473800659, "epoch": 1.0094923166699086, "grad_norm": 1.0078125, "learning_rate": 0.0004902809793934838, "loss": 5.1941, "mean_token_accuracy": 0.18859152644872665, "num_tokens": 22510289.0, "step": 12975 }, { "entropy": 5.5512770652771, "epoch": 1.009881346041626, "grad_norm": 1.0859375, "learning_rate": 0.0004902729199360615, "loss": 5.1999, "mean_token_accuracy": 0.18036672472953796, "num_tokens": 22519061.0, "step": 12980 }, { "entropy": 5.555686950683594, "epoch": 1.0102703754133437, "grad_norm": 1.0703125, "learning_rate": 0.0004902648572122153, "loss": 5.1876, "mean_token_accuracy": 0.17972218245267868, "num_tokens": 22528207.0, "step": 12985 }, { "entropy": 5.569291877746582, "epoch": 1.0106594047850612, "grad_norm": 1.1171875, "learning_rate": 0.0004902567912220674, "loss": 5.1424, "mean_token_accuracy": 0.18957385569810867, "num_tokens": 22537055.0, "step": 12990 }, { "entropy": 5.438579368591308, "epoch": 1.011048434156779, "grad_norm": 1.125, "learning_rate": 0.0004902487219657404, "loss": 5.1076, "mean_token_accuracy": 0.19081057906150817, "num_tokens": 22545239.0, "step": 12995 }, { "entropy": 5.521250057220459, "epoch": 1.0114374635284964, "grad_norm": 1.03125, "learning_rate": 0.0004902406494433566, "loss": 5.2663, "mean_token_accuracy": 0.18019673079252244, "num_tokens": 22554850.0, "step": 13000 }, { "entropy": 5.523771286010742, "epoch": 1.0118264929002139, "grad_norm": 1.0234375, "learning_rate": 0.0004902325736550386, "loss": 5.0881, "mean_token_accuracy": 0.19154862612485885, "num_tokens": 22563799.0, "step": 13005 }, { "entropy": 5.535542297363281, "epoch": 1.0122155222719316, "grad_norm": 1.0546875, "learning_rate": 0.0004902244946009088, "loss": 5.2782, "mean_token_accuracy": 0.18222947120666505, "num_tokens": 22572699.0, "step": 13010 }, { "entropy": 5.605086708068848, "epoch": 1.012604551643649, "grad_norm": 1.015625, "learning_rate": 0.0004902164122810899, "loss": 5.2149, "mean_token_accuracy": 0.18257918804883957, "num_tokens": 22580916.0, "step": 13015 }, { "entropy": 5.531681299209595, "epoch": 1.0129935810153667, "grad_norm": 1.0390625, "learning_rate": 0.0004902083266957045, "loss": 5.0865, "mean_token_accuracy": 0.1971299633383751, "num_tokens": 22589525.0, "step": 13020 }, { "entropy": 5.51569972038269, "epoch": 1.0133826103870842, "grad_norm": 1.03125, "learning_rate": 0.0004902002378448753, "loss": 5.1243, "mean_token_accuracy": 0.190584497153759, "num_tokens": 22597929.0, "step": 13025 }, { "entropy": 5.513075971603394, "epoch": 1.0137716397588017, "grad_norm": 1.046875, "learning_rate": 0.000490192145728725, "loss": 5.1298, "mean_token_accuracy": 0.18855018466711043, "num_tokens": 22606500.0, "step": 13030 }, { "entropy": 5.525053405761719, "epoch": 1.0141606691305194, "grad_norm": 1.0546875, "learning_rate": 0.0004901840503473764, "loss": 5.091, "mean_token_accuracy": 0.18933348208665848, "num_tokens": 22614626.0, "step": 13035 }, { "entropy": 5.4935768127441404, "epoch": 1.0145496985022369, "grad_norm": 1.046875, "learning_rate": 0.0004901759517009522, "loss": 5.1456, "mean_token_accuracy": 0.18554136157035828, "num_tokens": 22623488.0, "step": 13040 }, { "entropy": 5.443554496765136, "epoch": 1.0149387278739546, "grad_norm": 0.984375, "learning_rate": 0.0004901678497895755, "loss": 5.0456, "mean_token_accuracy": 0.19234771877527237, "num_tokens": 22632413.0, "step": 13045 }, { "entropy": 5.578586149215698, "epoch": 1.015327757245672, "grad_norm": 0.93359375, "learning_rate": 0.0004901597446133692, "loss": 5.1996, "mean_token_accuracy": 0.1824193477630615, "num_tokens": 22640982.0, "step": 13050 }, { "entropy": 5.506102657318115, "epoch": 1.0157167866173895, "grad_norm": 0.99609375, "learning_rate": 0.0004901516361724564, "loss": 5.1522, "mean_token_accuracy": 0.18513710796833038, "num_tokens": 22649809.0, "step": 13055 }, { "entropy": 5.496037864685059, "epoch": 1.0161058159891072, "grad_norm": 1.046875, "learning_rate": 0.0004901435244669597, "loss": 5.0811, "mean_token_accuracy": 0.18855834752321243, "num_tokens": 22658292.0, "step": 13060 }, { "entropy": 5.590985822677612, "epoch": 1.0164948453608247, "grad_norm": 1.0390625, "learning_rate": 0.0004901354094970025, "loss": 5.148, "mean_token_accuracy": 0.1866802304983139, "num_tokens": 22667063.0, "step": 13065 }, { "entropy": 5.49480414390564, "epoch": 1.0168838747325424, "grad_norm": 1.0390625, "learning_rate": 0.0004901272912627081, "loss": 5.0949, "mean_token_accuracy": 0.18449749201536178, "num_tokens": 22676213.0, "step": 13070 }, { "entropy": 5.385676622390747, "epoch": 1.0172729041042599, "grad_norm": 1.0625, "learning_rate": 0.0004901191697641992, "loss": 5.0137, "mean_token_accuracy": 0.19368071109056473, "num_tokens": 22684948.0, "step": 13075 }, { "entropy": 5.507847690582276, "epoch": 1.0176619334759773, "grad_norm": 1.0, "learning_rate": 0.0004901110450015994, "loss": 5.1243, "mean_token_accuracy": 0.18831953704357146, "num_tokens": 22693218.0, "step": 13080 }, { "entropy": 5.461327838897705, "epoch": 1.018050962847695, "grad_norm": 0.9921875, "learning_rate": 0.0004901029169750319, "loss": 4.9821, "mean_token_accuracy": 0.19628521651029587, "num_tokens": 22701572.0, "step": 13085 }, { "entropy": 5.440850687026978, "epoch": 1.0184399922194125, "grad_norm": 1.0703125, "learning_rate": 0.0004900947856846201, "loss": 5.0587, "mean_token_accuracy": 0.18640552461147308, "num_tokens": 22709498.0, "step": 13090 }, { "entropy": 5.5129265785217285, "epoch": 1.0188290215911302, "grad_norm": 1.078125, "learning_rate": 0.000490086651130487, "loss": 5.092, "mean_token_accuracy": 0.1896114781498909, "num_tokens": 22717922.0, "step": 13095 }, { "entropy": 5.52075424194336, "epoch": 1.0192180509628477, "grad_norm": 1.015625, "learning_rate": 0.0004900785133127566, "loss": 5.0891, "mean_token_accuracy": 0.1967282548546791, "num_tokens": 22725933.0, "step": 13100 }, { "entropy": 5.448567485809326, "epoch": 1.0196070803345652, "grad_norm": 1.0546875, "learning_rate": 0.000490070372231552, "loss": 5.0906, "mean_token_accuracy": 0.18713201582431793, "num_tokens": 22734198.0, "step": 13105 }, { "entropy": 5.44587721824646, "epoch": 1.0199961097062828, "grad_norm": 1.0390625, "learning_rate": 0.0004900622278869968, "loss": 5.108, "mean_token_accuracy": 0.19528810679912567, "num_tokens": 22742419.0, "step": 13110 }, { "entropy": 5.518180322647095, "epoch": 1.0203851390780003, "grad_norm": 0.95703125, "learning_rate": 0.0004900540802792146, "loss": 5.0881, "mean_token_accuracy": 0.19164003282785416, "num_tokens": 22750576.0, "step": 13115 }, { "entropy": 5.540366268157959, "epoch": 1.020774168449718, "grad_norm": 1.078125, "learning_rate": 0.000490045929408329, "loss": 5.236, "mean_token_accuracy": 0.18956746757030488, "num_tokens": 22759604.0, "step": 13120 }, { "entropy": 5.465849161148071, "epoch": 1.0211631978214355, "grad_norm": 1.0234375, "learning_rate": 0.0004900377752744637, "loss": 5.0028, "mean_token_accuracy": 0.19358394145965577, "num_tokens": 22768305.0, "step": 13125 }, { "entropy": 5.566656589508057, "epoch": 1.021552227193153, "grad_norm": 1.0, "learning_rate": 0.0004900296178777426, "loss": 5.1488, "mean_token_accuracy": 0.1792185813188553, "num_tokens": 22777364.0, "step": 13130 }, { "entropy": 5.468325614929199, "epoch": 1.0219412565648707, "grad_norm": 0.97265625, "learning_rate": 0.000490021457218289, "loss": 5.0766, "mean_token_accuracy": 0.1887971803545952, "num_tokens": 22786192.0, "step": 13135 }, { "entropy": 5.555207872390747, "epoch": 1.0223302859365881, "grad_norm": 0.98828125, "learning_rate": 0.0004900132932962272, "loss": 5.1393, "mean_token_accuracy": 0.189627006649971, "num_tokens": 22794244.0, "step": 13140 }, { "entropy": 5.498910713195801, "epoch": 1.0227193153083058, "grad_norm": 1.015625, "learning_rate": 0.000490005126111681, "loss": 5.1029, "mean_token_accuracy": 0.19425552785396577, "num_tokens": 22802543.0, "step": 13145 }, { "entropy": 5.450196313858032, "epoch": 1.0231083446800233, "grad_norm": 1.0078125, "learning_rate": 0.000489996955664774, "loss": 5.1299, "mean_token_accuracy": 0.19048047959804534, "num_tokens": 22811267.0, "step": 13150 }, { "entropy": 5.4924403667449955, "epoch": 1.023497374051741, "grad_norm": 1.109375, "learning_rate": 0.0004899887819556306, "loss": 5.022, "mean_token_accuracy": 0.19491760581731796, "num_tokens": 22820196.0, "step": 13155 }, { "entropy": 5.5744696140289305, "epoch": 1.0238864034234585, "grad_norm": 1.09375, "learning_rate": 0.0004899806049843745, "loss": 5.1988, "mean_token_accuracy": 0.18628377467393875, "num_tokens": 22828498.0, "step": 13160 }, { "entropy": 5.505137157440186, "epoch": 1.024275432795176, "grad_norm": 1.0546875, "learning_rate": 0.0004899724247511299, "loss": 5.1063, "mean_token_accuracy": 0.19179437309503555, "num_tokens": 22837411.0, "step": 13165 }, { "entropy": 5.4160984516143795, "epoch": 1.0246644621668937, "grad_norm": 1.046875, "learning_rate": 0.000489964241256021, "loss": 5.052, "mean_token_accuracy": 0.1909627377986908, "num_tokens": 22846265.0, "step": 13170 }, { "entropy": 5.408366012573242, "epoch": 1.0250534915386111, "grad_norm": 1.0390625, "learning_rate": 0.0004899560544991718, "loss": 5.0162, "mean_token_accuracy": 0.1939358502626419, "num_tokens": 22854489.0, "step": 13175 }, { "entropy": 5.5294088363647464, "epoch": 1.0254425209103288, "grad_norm": 1.0703125, "learning_rate": 0.0004899478644807068, "loss": 5.1969, "mean_token_accuracy": 0.18715981245040894, "num_tokens": 22863269.0, "step": 13180 }, { "entropy": 5.526223659515381, "epoch": 1.0258315502820463, "grad_norm": 1.0234375, "learning_rate": 0.0004899396712007498, "loss": 5.161, "mean_token_accuracy": 0.1838906943798065, "num_tokens": 22872304.0, "step": 13185 }, { "entropy": 5.451348924636841, "epoch": 1.0262205796537638, "grad_norm": 1.0703125, "learning_rate": 0.0004899314746594256, "loss": 4.9747, "mean_token_accuracy": 0.194868765771389, "num_tokens": 22881409.0, "step": 13190 }, { "entropy": 5.467325162887573, "epoch": 1.0266096090254815, "grad_norm": 1.0703125, "learning_rate": 0.0004899232748568584, "loss": 5.0695, "mean_token_accuracy": 0.1907655492424965, "num_tokens": 22889560.0, "step": 13195 }, { "entropy": 5.459406137466431, "epoch": 1.026998638397199, "grad_norm": 0.97265625, "learning_rate": 0.0004899150717931724, "loss": 5.1427, "mean_token_accuracy": 0.18698426932096482, "num_tokens": 22897434.0, "step": 13200 }, { "entropy": 5.517246055603027, "epoch": 1.0273876677689167, "grad_norm": 1.1796875, "learning_rate": 0.0004899068654684924, "loss": 5.1243, "mean_token_accuracy": 0.18590619266033173, "num_tokens": 22906050.0, "step": 13205 }, { "entropy": 5.488283252716064, "epoch": 1.0277766971406341, "grad_norm": 1.0859375, "learning_rate": 0.0004898986558829428, "loss": 5.0709, "mean_token_accuracy": 0.1897732138633728, "num_tokens": 22914118.0, "step": 13210 }, { "entropy": 5.535745143890381, "epoch": 1.0281657265123516, "grad_norm": 0.984375, "learning_rate": 0.0004898904430366479, "loss": 5.101, "mean_token_accuracy": 0.18814511150121688, "num_tokens": 22922539.0, "step": 13215 }, { "entropy": 5.477347087860108, "epoch": 1.0285547558840693, "grad_norm": 0.9609375, "learning_rate": 0.0004898822269297328, "loss": 5.0841, "mean_token_accuracy": 0.1909959837794304, "num_tokens": 22932371.0, "step": 13220 }, { "entropy": 5.521555614471436, "epoch": 1.0289437852557868, "grad_norm": 1.1171875, "learning_rate": 0.0004898740075623218, "loss": 5.1301, "mean_token_accuracy": 0.19090730398893357, "num_tokens": 22940608.0, "step": 13225 }, { "entropy": 5.497974395751953, "epoch": 1.0293328146275045, "grad_norm": 1.046875, "learning_rate": 0.0004898657849345399, "loss": 5.0988, "mean_token_accuracy": 0.1841575860977173, "num_tokens": 22948905.0, "step": 13230 }, { "entropy": 5.427421760559082, "epoch": 1.029721843999222, "grad_norm": 1.09375, "learning_rate": 0.0004898575590465116, "loss": 5.0709, "mean_token_accuracy": 0.18817866295576097, "num_tokens": 22957218.0, "step": 13235 }, { "entropy": 5.51482048034668, "epoch": 1.0301108733709394, "grad_norm": 1.09375, "learning_rate": 0.0004898493298983619, "loss": 5.2182, "mean_token_accuracy": 0.18705300390720367, "num_tokens": 22965700.0, "step": 13240 }, { "entropy": 5.594729280471801, "epoch": 1.0304999027426571, "grad_norm": 1.0390625, "learning_rate": 0.0004898410974902155, "loss": 5.1678, "mean_token_accuracy": 0.1891127496957779, "num_tokens": 22973996.0, "step": 13245 }, { "entropy": 5.575342321395874, "epoch": 1.0308889321143746, "grad_norm": 1.0625, "learning_rate": 0.0004898328618221974, "loss": 5.1473, "mean_token_accuracy": 0.18111440241336824, "num_tokens": 22983142.0, "step": 13250 }, { "entropy": 5.473549318313599, "epoch": 1.0312779614860923, "grad_norm": 1.21875, "learning_rate": 0.0004898246228944327, "loss": 5.0822, "mean_token_accuracy": 0.18986749649047852, "num_tokens": 22991263.0, "step": 13255 }, { "entropy": 5.49035611152649, "epoch": 1.0316669908578098, "grad_norm": 1.09375, "learning_rate": 0.0004898163807070461, "loss": 5.1942, "mean_token_accuracy": 0.1871370941400528, "num_tokens": 23000068.0, "step": 13260 }, { "entropy": 5.50784273147583, "epoch": 1.0320560202295272, "grad_norm": 1.0546875, "learning_rate": 0.0004898081352601629, "loss": 5.0905, "mean_token_accuracy": 0.18836008459329606, "num_tokens": 23007935.0, "step": 13265 }, { "entropy": 5.504950284957886, "epoch": 1.032445049601245, "grad_norm": 1.03125, "learning_rate": 0.0004897998865539082, "loss": 5.1835, "mean_token_accuracy": 0.18044952750205995, "num_tokens": 23017462.0, "step": 13270 }, { "entropy": 5.577250671386719, "epoch": 1.0328340789729624, "grad_norm": 1.0234375, "learning_rate": 0.0004897916345884069, "loss": 5.1507, "mean_token_accuracy": 0.18628241419792174, "num_tokens": 23026681.0, "step": 13275 }, { "entropy": 5.50228705406189, "epoch": 1.0332231083446801, "grad_norm": 1.078125, "learning_rate": 0.0004897833793637847, "loss": 5.12, "mean_token_accuracy": 0.18249217569828033, "num_tokens": 23035720.0, "step": 13280 }, { "entropy": 5.512222385406494, "epoch": 1.0336121377163976, "grad_norm": 1.0703125, "learning_rate": 0.0004897751208801665, "loss": 5.1285, "mean_token_accuracy": 0.18946436941623687, "num_tokens": 23044491.0, "step": 13285 }, { "entropy": 5.495960760116577, "epoch": 1.034001167088115, "grad_norm": 1.03125, "learning_rate": 0.0004897668591376777, "loss": 5.1231, "mean_token_accuracy": 0.1897832542657852, "num_tokens": 23054034.0, "step": 13290 }, { "entropy": 5.47880973815918, "epoch": 1.0343901964598328, "grad_norm": 1.0, "learning_rate": 0.0004897585941364436, "loss": 5.1123, "mean_token_accuracy": 0.18321141451597214, "num_tokens": 23062478.0, "step": 13295 }, { "entropy": 5.511396598815918, "epoch": 1.0347792258315502, "grad_norm": 1.109375, "learning_rate": 0.0004897503258765896, "loss": 5.1121, "mean_token_accuracy": 0.18463382869958878, "num_tokens": 23070776.0, "step": 13300 }, { "entropy": 5.562142848968506, "epoch": 1.035168255203268, "grad_norm": 1.1328125, "learning_rate": 0.0004897420543582413, "loss": 5.161, "mean_token_accuracy": 0.18689948618412017, "num_tokens": 23078459.0, "step": 13305 }, { "entropy": 5.508466148376465, "epoch": 1.0355572845749854, "grad_norm": 1.0, "learning_rate": 0.000489733779581524, "loss": 5.1323, "mean_token_accuracy": 0.19086094051599503, "num_tokens": 23087113.0, "step": 13310 }, { "entropy": 5.42483081817627, "epoch": 1.035946313946703, "grad_norm": 1.0390625, "learning_rate": 0.0004897255015465635, "loss": 5.0504, "mean_token_accuracy": 0.18985413610935212, "num_tokens": 23095989.0, "step": 13315 }, { "entropy": 5.492213106155395, "epoch": 1.0363353433184206, "grad_norm": 0.96484375, "learning_rate": 0.0004897172202534853, "loss": 5.0965, "mean_token_accuracy": 0.19096270948648453, "num_tokens": 23104578.0, "step": 13320 }, { "entropy": 5.543593549728394, "epoch": 1.036724372690138, "grad_norm": 1.015625, "learning_rate": 0.000489708935702415, "loss": 5.1496, "mean_token_accuracy": 0.18330126404762268, "num_tokens": 23114390.0, "step": 13325 }, { "entropy": 5.5749626636505125, "epoch": 1.0371134020618558, "grad_norm": 1.0625, "learning_rate": 0.0004897006478934784, "loss": 5.0422, "mean_token_accuracy": 0.19687569737434388, "num_tokens": 23122411.0, "step": 13330 }, { "entropy": 5.438427829742432, "epoch": 1.0375024314335732, "grad_norm": 1.078125, "learning_rate": 0.0004896923568268011, "loss": 4.9865, "mean_token_accuracy": 0.19491734951734543, "num_tokens": 23130801.0, "step": 13335 }, { "entropy": 5.451538324356079, "epoch": 1.0378914608052907, "grad_norm": 1.0859375, "learning_rate": 0.000489684062502509, "loss": 5.0446, "mean_token_accuracy": 0.1958128184080124, "num_tokens": 23138578.0, "step": 13340 }, { "entropy": 5.486257123947143, "epoch": 1.0382804901770084, "grad_norm": 1.0625, "learning_rate": 0.0004896757649207281, "loss": 5.0991, "mean_token_accuracy": 0.19224435240030288, "num_tokens": 23147135.0, "step": 13345 }, { "entropy": 5.599968910217285, "epoch": 1.0386695195487259, "grad_norm": 1.03125, "learning_rate": 0.000489667464081584, "loss": 5.1983, "mean_token_accuracy": 0.18686371594667434, "num_tokens": 23155791.0, "step": 13350 }, { "entropy": 5.543752861022949, "epoch": 1.0390585489204436, "grad_norm": 1.0546875, "learning_rate": 0.0004896591599852029, "loss": 5.0485, "mean_token_accuracy": 0.19751727432012559, "num_tokens": 23163674.0, "step": 13355 }, { "entropy": 5.509963417053223, "epoch": 1.039447578292161, "grad_norm": 1.0234375, "learning_rate": 0.0004896508526317107, "loss": 5.1268, "mean_token_accuracy": 0.18040343523025512, "num_tokens": 23171931.0, "step": 13360 }, { "entropy": 5.512867021560669, "epoch": 1.0398366076638785, "grad_norm": 1.078125, "learning_rate": 0.0004896425420212334, "loss": 5.1162, "mean_token_accuracy": 0.18817577064037322, "num_tokens": 23180195.0, "step": 13365 }, { "entropy": 5.482057523727417, "epoch": 1.0402256370355962, "grad_norm": 0.9375, "learning_rate": 0.0004896342281538973, "loss": 5.0568, "mean_token_accuracy": 0.19255162328481673, "num_tokens": 23189486.0, "step": 13370 }, { "entropy": 5.530639791488648, "epoch": 1.0406146664073137, "grad_norm": 1.0859375, "learning_rate": 0.0004896259110298283, "loss": 5.1957, "mean_token_accuracy": 0.1830993503332138, "num_tokens": 23198055.0, "step": 13375 }, { "entropy": 5.501185274124145, "epoch": 1.0410036957790314, "grad_norm": 1.0546875, "learning_rate": 0.0004896175906491528, "loss": 5.053, "mean_token_accuracy": 0.1936107337474823, "num_tokens": 23206092.0, "step": 13380 }, { "entropy": 5.515584993362427, "epoch": 1.0413927251507489, "grad_norm": 1.0625, "learning_rate": 0.0004896092670119968, "loss": 5.1391, "mean_token_accuracy": 0.19385599642992019, "num_tokens": 23214820.0, "step": 13385 }, { "entropy": 5.428675031661987, "epoch": 1.0417817545224664, "grad_norm": 0.9921875, "learning_rate": 0.0004896009401184869, "loss": 5.0881, "mean_token_accuracy": 0.19292043000459672, "num_tokens": 23224033.0, "step": 13390 }, { "entropy": 5.441465663909912, "epoch": 1.042170783894184, "grad_norm": 1.0, "learning_rate": 0.0004895926099687493, "loss": 5.0769, "mean_token_accuracy": 0.199727463722229, "num_tokens": 23233074.0, "step": 13395 }, { "entropy": 5.438698673248291, "epoch": 1.0425598132659015, "grad_norm": 0.9921875, "learning_rate": 0.0004895842765629104, "loss": 5.062, "mean_token_accuracy": 0.18767769038677215, "num_tokens": 23241167.0, "step": 13400 }, { "entropy": 5.537971496582031, "epoch": 1.0429488426376192, "grad_norm": 1.0234375, "learning_rate": 0.0004895759399010966, "loss": 5.0581, "mean_token_accuracy": 0.1905648872256279, "num_tokens": 23249601.0, "step": 13405 }, { "entropy": 5.5149956226348875, "epoch": 1.0433378720093367, "grad_norm": 0.9609375, "learning_rate": 0.0004895675999834345, "loss": 5.1701, "mean_token_accuracy": 0.1739841431379318, "num_tokens": 23257868.0, "step": 13410 }, { "entropy": 5.525733852386475, "epoch": 1.0437269013810542, "grad_norm": 1.0234375, "learning_rate": 0.0004895592568100505, "loss": 5.1402, "mean_token_accuracy": 0.18237388283014297, "num_tokens": 23266586.0, "step": 13415 }, { "entropy": 5.552362489700317, "epoch": 1.0441159307527719, "grad_norm": 0.984375, "learning_rate": 0.0004895509103810714, "loss": 5.1253, "mean_token_accuracy": 0.1932749256491661, "num_tokens": 23275114.0, "step": 13420 }, { "entropy": 5.433881330490112, "epoch": 1.0445049601244893, "grad_norm": 1.0234375, "learning_rate": 0.0004895425606966237, "loss": 5.0176, "mean_token_accuracy": 0.19976668804883957, "num_tokens": 23283200.0, "step": 13425 }, { "entropy": 5.51881422996521, "epoch": 1.044893989496207, "grad_norm": 1.0859375, "learning_rate": 0.000489534207756834, "loss": 5.2199, "mean_token_accuracy": 0.1829703852534294, "num_tokens": 23291999.0, "step": 13430 }, { "entropy": 5.500102567672729, "epoch": 1.0452830188679245, "grad_norm": 1.0234375, "learning_rate": 0.0004895258515618293, "loss": 5.0915, "mean_token_accuracy": 0.1942835584282875, "num_tokens": 23300514.0, "step": 13435 }, { "entropy": 5.487110280990601, "epoch": 1.045672048239642, "grad_norm": 1.0859375, "learning_rate": 0.0004895174921117362, "loss": 5.041, "mean_token_accuracy": 0.19086081236600877, "num_tokens": 23309543.0, "step": 13440 }, { "entropy": 5.4643031597137455, "epoch": 1.0460610776113597, "grad_norm": 1.0078125, "learning_rate": 0.0004895091294066816, "loss": 5.1037, "mean_token_accuracy": 0.18764328360557556, "num_tokens": 23319002.0, "step": 13445 }, { "entropy": 5.551626110076905, "epoch": 1.0464501069830772, "grad_norm": 1.1484375, "learning_rate": 0.0004895007634467924, "loss": 5.1353, "mean_token_accuracy": 0.1906083717942238, "num_tokens": 23326604.0, "step": 13450 }, { "entropy": 5.4723546504974365, "epoch": 1.0468391363547949, "grad_norm": 0.98046875, "learning_rate": 0.0004894923942321955, "loss": 5.0851, "mean_token_accuracy": 0.19281035512685776, "num_tokens": 23335492.0, "step": 13455 }, { "entropy": 5.48105673789978, "epoch": 1.0472281657265123, "grad_norm": 1.171875, "learning_rate": 0.0004894840217630179, "loss": 5.08, "mean_token_accuracy": 0.19594276398420335, "num_tokens": 23343693.0, "step": 13460 }, { "entropy": 5.479967498779297, "epoch": 1.0476171950982298, "grad_norm": 1.0078125, "learning_rate": 0.0004894756460393868, "loss": 5.0626, "mean_token_accuracy": 0.19943199157714844, "num_tokens": 23352587.0, "step": 13465 }, { "entropy": 5.488040208816528, "epoch": 1.0480062244699475, "grad_norm": 1.0546875, "learning_rate": 0.000489467267061429, "loss": 5.1341, "mean_token_accuracy": 0.19164861291646956, "num_tokens": 23361293.0, "step": 13470 }, { "entropy": 5.518055248260498, "epoch": 1.048395253841665, "grad_norm": 1.078125, "learning_rate": 0.0004894588848292718, "loss": 5.1409, "mean_token_accuracy": 0.18754915446043013, "num_tokens": 23369663.0, "step": 13475 }, { "entropy": 5.464393663406372, "epoch": 1.0487842832133827, "grad_norm": 1.0078125, "learning_rate": 0.0004894504993430425, "loss": 5.0314, "mean_token_accuracy": 0.1916136249899864, "num_tokens": 23378224.0, "step": 13480 }, { "entropy": 5.542549562454224, "epoch": 1.0491733125851002, "grad_norm": 1.109375, "learning_rate": 0.000489442110602868, "loss": 5.1949, "mean_token_accuracy": 0.1862254723906517, "num_tokens": 23386693.0, "step": 13485 }, { "entropy": 5.532257223129273, "epoch": 1.0495623419568176, "grad_norm": 1.0859375, "learning_rate": 0.0004894337186088759, "loss": 5.0739, "mean_token_accuracy": 0.1931736007332802, "num_tokens": 23395226.0, "step": 13490 }, { "entropy": 5.49997992515564, "epoch": 1.0499513713285353, "grad_norm": 1.0859375, "learning_rate": 0.0004894253233611934, "loss": 5.1013, "mean_token_accuracy": 0.1848582774400711, "num_tokens": 23403779.0, "step": 13495 }, { "entropy": 5.561174488067627, "epoch": 1.0503404007002528, "grad_norm": 1.0859375, "learning_rate": 0.000489416924859948, "loss": 5.2076, "mean_token_accuracy": 0.187757471203804, "num_tokens": 23411807.0, "step": 13500 }, { "entropy": 5.462135314941406, "epoch": 1.0507294300719705, "grad_norm": 1.1875, "learning_rate": 0.000489408523105267, "loss": 5.0854, "mean_token_accuracy": 0.1892173931002617, "num_tokens": 23420323.0, "step": 13505 }, { "entropy": 5.482666015625, "epoch": 1.051118459443688, "grad_norm": 0.9921875, "learning_rate": 0.0004894001180972779, "loss": 5.0813, "mean_token_accuracy": 0.1884569674730301, "num_tokens": 23429220.0, "step": 13510 }, { "entropy": 5.518921613693237, "epoch": 1.0515074888154055, "grad_norm": 1.015625, "learning_rate": 0.0004893917098361082, "loss": 5.1014, "mean_token_accuracy": 0.19271353930234908, "num_tokens": 23438471.0, "step": 13515 }, { "entropy": 5.546924018859864, "epoch": 1.0518965181871232, "grad_norm": 1.03125, "learning_rate": 0.0004893832983218856, "loss": 5.1606, "mean_token_accuracy": 0.19221373200416564, "num_tokens": 23447504.0, "step": 13520 }, { "entropy": 5.399049139022827, "epoch": 1.0522855475588406, "grad_norm": 1.1015625, "learning_rate": 0.0004893748835547377, "loss": 4.8965, "mean_token_accuracy": 0.20001167207956314, "num_tokens": 23456065.0, "step": 13525 }, { "entropy": 5.466557168960572, "epoch": 1.0526745769305583, "grad_norm": 1.1328125, "learning_rate": 0.0004893664655347921, "loss": 5.0966, "mean_token_accuracy": 0.19424791634082794, "num_tokens": 23463826.0, "step": 13530 }, { "entropy": 5.414195871353149, "epoch": 1.0530636063022758, "grad_norm": 1.1171875, "learning_rate": 0.0004893580442621767, "loss": 5.0537, "mean_token_accuracy": 0.19596624374389648, "num_tokens": 23472092.0, "step": 13535 }, { "entropy": 5.512748575210571, "epoch": 1.0534526356739935, "grad_norm": 1.046875, "learning_rate": 0.000489349619737019, "loss": 5.1523, "mean_token_accuracy": 0.18705311119556428, "num_tokens": 23480934.0, "step": 13540 }, { "entropy": 5.54752516746521, "epoch": 1.053841665045711, "grad_norm": 1.015625, "learning_rate": 0.000489341191959447, "loss": 5.1163, "mean_token_accuracy": 0.1875155448913574, "num_tokens": 23490187.0, "step": 13545 }, { "entropy": 5.524692249298096, "epoch": 1.0542306944174284, "grad_norm": 0.96484375, "learning_rate": 0.0004893327609295887, "loss": 5.072, "mean_token_accuracy": 0.18888031095266342, "num_tokens": 23498330.0, "step": 13550 }, { "entropy": 5.435202169418335, "epoch": 1.0546197237891461, "grad_norm": 1.0625, "learning_rate": 0.0004893243266475719, "loss": 5.0027, "mean_token_accuracy": 0.19310702979564667, "num_tokens": 23506219.0, "step": 13555 }, { "entropy": 5.460510635375977, "epoch": 1.0550087531608636, "grad_norm": 1.078125, "learning_rate": 0.0004893158891135245, "loss": 5.0516, "mean_token_accuracy": 0.19052202254533768, "num_tokens": 23514585.0, "step": 13560 }, { "entropy": 5.4937903881073, "epoch": 1.055397782532581, "grad_norm": 1.03125, "learning_rate": 0.0004893074483275746, "loss": 5.0332, "mean_token_accuracy": 0.19228530824184417, "num_tokens": 23522919.0, "step": 13565 }, { "entropy": 5.534870052337647, "epoch": 1.0557868119042988, "grad_norm": 0.99609375, "learning_rate": 0.0004892990042898503, "loss": 5.2483, "mean_token_accuracy": 0.1742488443851471, "num_tokens": 23531613.0, "step": 13570 }, { "entropy": 5.532000637054443, "epoch": 1.0561758412760163, "grad_norm": 1.046875, "learning_rate": 0.0004892905570004798, "loss": 5.1847, "mean_token_accuracy": 0.1881326362490654, "num_tokens": 23539865.0, "step": 13575 }, { "entropy": 5.483029460906982, "epoch": 1.056564870647734, "grad_norm": 1.046875, "learning_rate": 0.000489282106459591, "loss": 5.0319, "mean_token_accuracy": 0.1964360937476158, "num_tokens": 23548424.0, "step": 13580 }, { "entropy": 5.539194869995117, "epoch": 1.0569539000194514, "grad_norm": 1.015625, "learning_rate": 0.0004892736526673124, "loss": 5.1012, "mean_token_accuracy": 0.19321904480457305, "num_tokens": 23557199.0, "step": 13585 }, { "entropy": 5.545026254653931, "epoch": 1.0573429293911691, "grad_norm": 1.0703125, "learning_rate": 0.0004892651956237721, "loss": 5.2287, "mean_token_accuracy": 0.1768147259950638, "num_tokens": 23565979.0, "step": 13590 }, { "entropy": 5.492410039901733, "epoch": 1.0577319587628866, "grad_norm": 1.0, "learning_rate": 0.0004892567353290986, "loss": 5.0908, "mean_token_accuracy": 0.188099268078804, "num_tokens": 23575405.0, "step": 13595 }, { "entropy": 5.574670600891113, "epoch": 1.058120988134604, "grad_norm": 1.0234375, "learning_rate": 0.0004892482717834201, "loss": 5.2361, "mean_token_accuracy": 0.17649628221988678, "num_tokens": 23584589.0, "step": 13600 }, { "entropy": 5.4940142154693605, "epoch": 1.0585100175063218, "grad_norm": 1.0390625, "learning_rate": 0.0004892398049868651, "loss": 5.0911, "mean_token_accuracy": 0.19094969481229782, "num_tokens": 23593079.0, "step": 13605 }, { "entropy": 5.533782052993774, "epoch": 1.0588990468780393, "grad_norm": 0.9609375, "learning_rate": 0.000489231334939562, "loss": 5.1627, "mean_token_accuracy": 0.18856299966573714, "num_tokens": 23602010.0, "step": 13610 }, { "entropy": 5.587103700637817, "epoch": 1.059288076249757, "grad_norm": 1.0703125, "learning_rate": 0.0004892228616416395, "loss": 5.1203, "mean_token_accuracy": 0.19295461624860763, "num_tokens": 23610707.0, "step": 13615 }, { "entropy": 5.478616523742676, "epoch": 1.0596771056214744, "grad_norm": 1.0234375, "learning_rate": 0.0004892143850932259, "loss": 5.0871, "mean_token_accuracy": 0.18580903559923173, "num_tokens": 23619579.0, "step": 13620 }, { "entropy": 5.469380617141724, "epoch": 1.060066134993192, "grad_norm": 0.98828125, "learning_rate": 0.00048920590529445, "loss": 5.0751, "mean_token_accuracy": 0.19379353821277617, "num_tokens": 23628407.0, "step": 13625 }, { "entropy": 5.457701778411865, "epoch": 1.0604551643649096, "grad_norm": 1.125, "learning_rate": 0.0004891974222454406, "loss": 5.0228, "mean_token_accuracy": 0.19369977116584777, "num_tokens": 23637094.0, "step": 13630 }, { "entropy": 5.4665855884552, "epoch": 1.060844193736627, "grad_norm": 1.1015625, "learning_rate": 0.0004891889359463261, "loss": 5.0681, "mean_token_accuracy": 0.19245618730783462, "num_tokens": 23645823.0, "step": 13635 }, { "entropy": 5.538349199295044, "epoch": 1.0612332231083448, "grad_norm": 1.0, "learning_rate": 0.0004891804463972354, "loss": 5.1888, "mean_token_accuracy": 0.1785898059606552, "num_tokens": 23655027.0, "step": 13640 }, { "entropy": 5.59522180557251, "epoch": 1.0616222524800623, "grad_norm": 1.0078125, "learning_rate": 0.0004891719535982974, "loss": 5.2452, "mean_token_accuracy": 0.17403926849365234, "num_tokens": 23663840.0, "step": 13645 }, { "entropy": 5.574581623077393, "epoch": 1.0620112818517797, "grad_norm": 1.0078125, "learning_rate": 0.0004891634575496408, "loss": 5.1908, "mean_token_accuracy": 0.1826014131307602, "num_tokens": 23672795.0, "step": 13650 }, { "entropy": 5.511906147003174, "epoch": 1.0624003112234974, "grad_norm": 1.078125, "learning_rate": 0.0004891549582513946, "loss": 5.1353, "mean_token_accuracy": 0.18759951144456863, "num_tokens": 23681833.0, "step": 13655 }, { "entropy": 5.54331784248352, "epoch": 1.062789340595215, "grad_norm": 1.0546875, "learning_rate": 0.000489146455703688, "loss": 5.0776, "mean_token_accuracy": 0.19118062108755113, "num_tokens": 23689939.0, "step": 13660 }, { "entropy": 5.476145172119141, "epoch": 1.0631783699669326, "grad_norm": 1.0625, "learning_rate": 0.0004891379499066495, "loss": 5.1421, "mean_token_accuracy": 0.18893353044986724, "num_tokens": 23698535.0, "step": 13665 }, { "entropy": 5.439593076705933, "epoch": 1.06356739933865, "grad_norm": 0.98828125, "learning_rate": 0.0004891294408604087, "loss": 5.0613, "mean_token_accuracy": 0.19376158565282822, "num_tokens": 23707749.0, "step": 13670 }, { "entropy": 5.535164928436279, "epoch": 1.0639564287103676, "grad_norm": 0.95703125, "learning_rate": 0.0004891209285650942, "loss": 5.1986, "mean_token_accuracy": 0.19232247918844222, "num_tokens": 23716503.0, "step": 13675 }, { "entropy": 5.574883699417114, "epoch": 1.0643454580820852, "grad_norm": 1.0625, "learning_rate": 0.0004891124130208355, "loss": 5.1519, "mean_token_accuracy": 0.18770842999219894, "num_tokens": 23724882.0, "step": 13680 }, { "entropy": 5.448615217208863, "epoch": 1.0647344874538027, "grad_norm": 1.1640625, "learning_rate": 0.0004891038942277618, "loss": 5.1306, "mean_token_accuracy": 0.1906077817082405, "num_tokens": 23733680.0, "step": 13685 }, { "entropy": 5.446247196197509, "epoch": 1.0651235168255204, "grad_norm": 1.09375, "learning_rate": 0.0004890953721860022, "loss": 5.0741, "mean_token_accuracy": 0.20123763084411622, "num_tokens": 23742066.0, "step": 13690 }, { "entropy": 5.491039657592774, "epoch": 1.065512546197238, "grad_norm": 1.0625, "learning_rate": 0.0004890868468956862, "loss": 5.0068, "mean_token_accuracy": 0.19681514352560042, "num_tokens": 23750558.0, "step": 13695 }, { "entropy": 5.475290107727051, "epoch": 1.0659015755689554, "grad_norm": 1.046875, "learning_rate": 0.000489078318356943, "loss": 5.0703, "mean_token_accuracy": 0.18846342861652374, "num_tokens": 23759120.0, "step": 13700 }, { "entropy": 5.438134765625, "epoch": 1.066290604940673, "grad_norm": 1.0234375, "learning_rate": 0.0004890697865699021, "loss": 5.1218, "mean_token_accuracy": 0.19037054032087325, "num_tokens": 23768301.0, "step": 13705 }, { "entropy": 5.494680500030517, "epoch": 1.0666796343123905, "grad_norm": 1.1015625, "learning_rate": 0.0004890612515346929, "loss": 5.0499, "mean_token_accuracy": 0.19665537178516387, "num_tokens": 23776155.0, "step": 13710 }, { "entropy": 5.516201829910278, "epoch": 1.0670686636841082, "grad_norm": 1.0390625, "learning_rate": 0.0004890527132514448, "loss": 5.1574, "mean_token_accuracy": 0.18454540520906448, "num_tokens": 23785363.0, "step": 13715 }, { "entropy": 5.469109964370728, "epoch": 1.0674576930558257, "grad_norm": 1.1171875, "learning_rate": 0.0004890441717202876, "loss": 5.1026, "mean_token_accuracy": 0.1941828966140747, "num_tokens": 23793817.0, "step": 13720 }, { "entropy": 5.4717858791351315, "epoch": 1.0678467224275432, "grad_norm": 1.1328125, "learning_rate": 0.0004890356269413507, "loss": 5.1558, "mean_token_accuracy": 0.1876853033900261, "num_tokens": 23802629.0, "step": 13725 }, { "entropy": 5.44251012802124, "epoch": 1.068235751799261, "grad_norm": 1.140625, "learning_rate": 0.000489027078914764, "loss": 4.9384, "mean_token_accuracy": 0.2016395539045334, "num_tokens": 23811178.0, "step": 13730 }, { "entropy": 5.531862592697143, "epoch": 1.0686247811709784, "grad_norm": 1.0390625, "learning_rate": 0.0004890185276406569, "loss": 5.1893, "mean_token_accuracy": 0.18758042603731157, "num_tokens": 23819685.0, "step": 13735 }, { "entropy": 5.390233087539673, "epoch": 1.069013810542696, "grad_norm": 1.0234375, "learning_rate": 0.0004890099731191592, "loss": 5.043, "mean_token_accuracy": 0.19038856029510498, "num_tokens": 23828733.0, "step": 13740 }, { "entropy": 5.558916902542114, "epoch": 1.0694028399144135, "grad_norm": 1.125, "learning_rate": 0.000489001415350401, "loss": 5.2148, "mean_token_accuracy": 0.1856578603386879, "num_tokens": 23837095.0, "step": 13745 }, { "entropy": 5.5654284954071045, "epoch": 1.069791869286131, "grad_norm": 0.96875, "learning_rate": 0.0004889928543345118, "loss": 5.1722, "mean_token_accuracy": 0.18539410531520845, "num_tokens": 23846637.0, "step": 13750 }, { "entropy": 5.564072561264038, "epoch": 1.0701808986578487, "grad_norm": 0.98046875, "learning_rate": 0.0004889842900716217, "loss": 5.2396, "mean_token_accuracy": 0.17768221646547316, "num_tokens": 23856042.0, "step": 13755 }, { "entropy": 5.544183683395386, "epoch": 1.0705699280295662, "grad_norm": 1.0078125, "learning_rate": 0.0004889757225618606, "loss": 5.1866, "mean_token_accuracy": 0.17853399813175203, "num_tokens": 23865367.0, "step": 13760 }, { "entropy": 5.519011688232422, "epoch": 1.0709589574012839, "grad_norm": 1.03125, "learning_rate": 0.0004889671518053584, "loss": 5.1803, "mean_token_accuracy": 0.18560691326856613, "num_tokens": 23874740.0, "step": 13765 }, { "entropy": 5.5425585269927975, "epoch": 1.0713479867730014, "grad_norm": 0.9453125, "learning_rate": 0.0004889585778022453, "loss": 5.1001, "mean_token_accuracy": 0.19475915729999543, "num_tokens": 23884229.0, "step": 13770 }, { "entropy": 5.482588624954223, "epoch": 1.0717370161447188, "grad_norm": 1.0546875, "learning_rate": 0.0004889500005526514, "loss": 5.0458, "mean_token_accuracy": 0.1958453983068466, "num_tokens": 23892149.0, "step": 13775 }, { "entropy": 5.581080436706543, "epoch": 1.0721260455164365, "grad_norm": 1.0078125, "learning_rate": 0.0004889414200567067, "loss": 5.2481, "mean_token_accuracy": 0.17761629223823547, "num_tokens": 23901802.0, "step": 13780 }, { "entropy": 5.5534196376800535, "epoch": 1.072515074888154, "grad_norm": 1.0546875, "learning_rate": 0.0004889328363145415, "loss": 5.1074, "mean_token_accuracy": 0.18817335069179536, "num_tokens": 23910268.0, "step": 13785 }, { "entropy": 5.416829442977905, "epoch": 1.0729041042598717, "grad_norm": 0.98046875, "learning_rate": 0.0004889242493262859, "loss": 4.9877, "mean_token_accuracy": 0.18885452747344972, "num_tokens": 23918351.0, "step": 13790 }, { "entropy": 5.436092805862427, "epoch": 1.0732931336315892, "grad_norm": 1.0703125, "learning_rate": 0.0004889156590920704, "loss": 5.0209, "mean_token_accuracy": 0.19416586458683013, "num_tokens": 23927367.0, "step": 13795 }, { "entropy": 5.467151880264282, "epoch": 1.0736821630033067, "grad_norm": 1.03125, "learning_rate": 0.0004889070656120253, "loss": 5.1052, "mean_token_accuracy": 0.20097128450870513, "num_tokens": 23936216.0, "step": 13800 }, { "entropy": 5.61088228225708, "epoch": 1.0740711923750244, "grad_norm": 1.0546875, "learning_rate": 0.0004888984688862809, "loss": 5.1684, "mean_token_accuracy": 0.18455246239900588, "num_tokens": 23944344.0, "step": 13805 }, { "entropy": 5.55533537864685, "epoch": 1.0744602217467418, "grad_norm": 1.09375, "learning_rate": 0.0004888898689149677, "loss": 5.2025, "mean_token_accuracy": 0.17898330241441726, "num_tokens": 23953390.0, "step": 13810 }, { "entropy": 5.578766632080078, "epoch": 1.0748492511184595, "grad_norm": 1.0, "learning_rate": 0.0004888812656982162, "loss": 5.1875, "mean_token_accuracy": 0.18974599689245225, "num_tokens": 23962230.0, "step": 13815 }, { "entropy": 5.463758563995361, "epoch": 1.075238280490177, "grad_norm": 1.0546875, "learning_rate": 0.0004888726592361569, "loss": 5.0952, "mean_token_accuracy": 0.18932809084653854, "num_tokens": 23971627.0, "step": 13820 }, { "entropy": 5.486400175094604, "epoch": 1.0756273098618945, "grad_norm": 1.0859375, "learning_rate": 0.0004888640495289204, "loss": 5.0744, "mean_token_accuracy": 0.1964050993323326, "num_tokens": 23980222.0, "step": 13825 }, { "entropy": 5.485660028457642, "epoch": 1.0760163392336122, "grad_norm": 1.015625, "learning_rate": 0.0004888554365766374, "loss": 5.1456, "mean_token_accuracy": 0.18532685786485673, "num_tokens": 23988803.0, "step": 13830 }, { "entropy": 5.5112550258636475, "epoch": 1.0764053686053296, "grad_norm": 0.98046875, "learning_rate": 0.0004888468203794385, "loss": 5.1408, "mean_token_accuracy": 0.1862546518445015, "num_tokens": 23997664.0, "step": 13835 }, { "entropy": 5.50004391670227, "epoch": 1.0767943979770473, "grad_norm": 0.99609375, "learning_rate": 0.0004888382009374545, "loss": 5.1008, "mean_token_accuracy": 0.1907826691865921, "num_tokens": 24006641.0, "step": 13840 }, { "entropy": 5.487084913253784, "epoch": 1.0771834273487648, "grad_norm": 1.1015625, "learning_rate": 0.0004888295782508161, "loss": 5.0605, "mean_token_accuracy": 0.18470959663391112, "num_tokens": 24014852.0, "step": 13845 }, { "entropy": 5.533863878250122, "epoch": 1.0775724567204823, "grad_norm": 1.015625, "learning_rate": 0.0004888209523196542, "loss": 5.1041, "mean_token_accuracy": 0.19364023208618164, "num_tokens": 24023441.0, "step": 13850 }, { "entropy": 5.567538833618164, "epoch": 1.0779614860922, "grad_norm": 1.1171875, "learning_rate": 0.0004888123231440997, "loss": 5.0922, "mean_token_accuracy": 0.1906741514801979, "num_tokens": 24032120.0, "step": 13855 }, { "entropy": 5.5329100608825685, "epoch": 1.0783505154639175, "grad_norm": 1.0625, "learning_rate": 0.0004888036907242834, "loss": 5.152, "mean_token_accuracy": 0.18845200687646865, "num_tokens": 24040264.0, "step": 13860 }, { "entropy": 5.553092384338379, "epoch": 1.0787395448356352, "grad_norm": 1.0859375, "learning_rate": 0.0004887950550603366, "loss": 5.1871, "mean_token_accuracy": 0.18683995604515075, "num_tokens": 24049194.0, "step": 13865 }, { "entropy": 5.497825002670288, "epoch": 1.0791285742073526, "grad_norm": 0.9609375, "learning_rate": 0.0004887864161523901, "loss": 5.0863, "mean_token_accuracy": 0.18699022829532624, "num_tokens": 24058004.0, "step": 13870 }, { "entropy": 5.439299774169922, "epoch": 1.0795176035790701, "grad_norm": 1.0390625, "learning_rate": 0.0004887777740005749, "loss": 5.0196, "mean_token_accuracy": 0.1908196523785591, "num_tokens": 24066871.0, "step": 13875 }, { "entropy": 5.503803873062134, "epoch": 1.0799066329507878, "grad_norm": 1.140625, "learning_rate": 0.0004887691286050224, "loss": 5.1258, "mean_token_accuracy": 0.18752629607915877, "num_tokens": 24075409.0, "step": 13880 }, { "entropy": 5.524446201324463, "epoch": 1.0802956623225053, "grad_norm": 1.1015625, "learning_rate": 0.0004887604799658635, "loss": 5.0777, "mean_token_accuracy": 0.18963271379470825, "num_tokens": 24083983.0, "step": 13885 }, { "entropy": 5.494142723083496, "epoch": 1.080684691694223, "grad_norm": 1.1171875, "learning_rate": 0.0004887518280832295, "loss": 5.1154, "mean_token_accuracy": 0.18744417577981948, "num_tokens": 24092225.0, "step": 13890 }, { "entropy": 5.4595091342926025, "epoch": 1.0810737210659405, "grad_norm": 1.0, "learning_rate": 0.0004887431729572519, "loss": 5.0251, "mean_token_accuracy": 0.19561605602502824, "num_tokens": 24100045.0, "step": 13895 }, { "entropy": 5.459766149520874, "epoch": 1.081462750437658, "grad_norm": 1.0546875, "learning_rate": 0.0004887345145880617, "loss": 5.0878, "mean_token_accuracy": 0.19650027453899382, "num_tokens": 24108540.0, "step": 13900 }, { "entropy": 5.501815271377564, "epoch": 1.0818517798093756, "grad_norm": 1.0546875, "learning_rate": 0.0004887258529757904, "loss": 5.1594, "mean_token_accuracy": 0.18723729103803635, "num_tokens": 24117819.0, "step": 13905 }, { "entropy": 5.488281345367431, "epoch": 1.082240809181093, "grad_norm": 0.98828125, "learning_rate": 0.0004887171881205696, "loss": 4.9807, "mean_token_accuracy": 0.19902892410755157, "num_tokens": 24127000.0, "step": 13910 }, { "entropy": 5.492322397232056, "epoch": 1.0826298385528108, "grad_norm": 1.0703125, "learning_rate": 0.0004887085200225306, "loss": 5.1245, "mean_token_accuracy": 0.18710183054208757, "num_tokens": 24135404.0, "step": 13915 }, { "entropy": 5.3863554954528805, "epoch": 1.0830188679245283, "grad_norm": 1.0546875, "learning_rate": 0.0004886998486818049, "loss": 4.9271, "mean_token_accuracy": 0.20174721479415894, "num_tokens": 24143944.0, "step": 13920 }, { "entropy": 5.475208854675293, "epoch": 1.083407897296246, "grad_norm": 0.9921875, "learning_rate": 0.0004886911740985242, "loss": 5.0552, "mean_token_accuracy": 0.19111869037151336, "num_tokens": 24153097.0, "step": 13925 }, { "entropy": 5.555386304855347, "epoch": 1.0837969266679635, "grad_norm": 1.0703125, "learning_rate": 0.00048868249627282, "loss": 5.1904, "mean_token_accuracy": 0.18662858307361602, "num_tokens": 24162499.0, "step": 13930 }, { "entropy": 5.468149328231812, "epoch": 1.084185956039681, "grad_norm": 1.0703125, "learning_rate": 0.000488673815204824, "loss": 5.0347, "mean_token_accuracy": 0.1956766813993454, "num_tokens": 24170543.0, "step": 13935 }, { "entropy": 5.455287599563599, "epoch": 1.0845749854113986, "grad_norm": 1.1484375, "learning_rate": 0.0004886651308946681, "loss": 5.1153, "mean_token_accuracy": 0.1848442941904068, "num_tokens": 24180871.0, "step": 13940 }, { "entropy": 5.455020904541016, "epoch": 1.084964014783116, "grad_norm": 1.109375, "learning_rate": 0.0004886564433424839, "loss": 5.0527, "mean_token_accuracy": 0.19278413504362107, "num_tokens": 24189075.0, "step": 13945 }, { "entropy": 5.538852024078369, "epoch": 1.0853530441548336, "grad_norm": 1.0546875, "learning_rate": 0.0004886477525484032, "loss": 5.1521, "mean_token_accuracy": 0.18929796814918518, "num_tokens": 24197686.0, "step": 13950 }, { "entropy": 5.425747442245483, "epoch": 1.0857420735265513, "grad_norm": 1.046875, "learning_rate": 0.0004886390585125579, "loss": 5.0233, "mean_token_accuracy": 0.19508077055215836, "num_tokens": 24207093.0, "step": 13955 }, { "entropy": 5.544287109375, "epoch": 1.0861311028982688, "grad_norm": 1.0390625, "learning_rate": 0.0004886303612350799, "loss": 5.1466, "mean_token_accuracy": 0.1864921659231186, "num_tokens": 24216447.0, "step": 13960 }, { "entropy": 5.559355688095093, "epoch": 1.0865201322699864, "grad_norm": 1.140625, "learning_rate": 0.0004886216607161013, "loss": 5.146, "mean_token_accuracy": 0.18154870718717575, "num_tokens": 24225041.0, "step": 13965 }, { "entropy": 5.528687191009522, "epoch": 1.086909161641704, "grad_norm": 1.046875, "learning_rate": 0.0004886129569557538, "loss": 5.1148, "mean_token_accuracy": 0.19048039615154266, "num_tokens": 24233686.0, "step": 13970 }, { "entropy": 5.5369960308074955, "epoch": 1.0872981910134216, "grad_norm": 1.0, "learning_rate": 0.0004886042499541699, "loss": 5.1303, "mean_token_accuracy": 0.1956827461719513, "num_tokens": 24242553.0, "step": 13975 }, { "entropy": 5.445044279098511, "epoch": 1.087687220385139, "grad_norm": 0.9765625, "learning_rate": 0.0004885955397114813, "loss": 5.0664, "mean_token_accuracy": 0.18548174649477006, "num_tokens": 24251658.0, "step": 13980 }, { "entropy": 5.514500617980957, "epoch": 1.0880762497568566, "grad_norm": 1.0625, "learning_rate": 0.0004885868262278205, "loss": 5.1326, "mean_token_accuracy": 0.1869391605257988, "num_tokens": 24260397.0, "step": 13985 }, { "entropy": 5.457713603973389, "epoch": 1.0884652791285743, "grad_norm": 1.015625, "learning_rate": 0.0004885781095033195, "loss": 5.0699, "mean_token_accuracy": 0.19264706820249558, "num_tokens": 24268789.0, "step": 13990 }, { "entropy": 5.503405618667602, "epoch": 1.0888543085002917, "grad_norm": 1.0859375, "learning_rate": 0.0004885693895381108, "loss": 5.1718, "mean_token_accuracy": 0.1821862578392029, "num_tokens": 24278050.0, "step": 13995 }, { "entropy": 5.537179756164551, "epoch": 1.0892433378720092, "grad_norm": 0.96484375, "learning_rate": 0.0004885606663323263, "loss": 5.1285, "mean_token_accuracy": 0.18595426380634308, "num_tokens": 24286477.0, "step": 14000 }, { "entropy": 5.397342205047607, "epoch": 1.089632367243727, "grad_norm": 1.046875, "learning_rate": 0.0004885519398860987, "loss": 5.0093, "mean_token_accuracy": 0.19617265909910203, "num_tokens": 24295704.0, "step": 14005 }, { "entropy": 5.412516021728516, "epoch": 1.0900213966154444, "grad_norm": 1.0390625, "learning_rate": 0.0004885432101995604, "loss": 5.0505, "mean_token_accuracy": 0.20264479219913484, "num_tokens": 24304132.0, "step": 14010 }, { "entropy": 5.5103010654449465, "epoch": 1.090410425987162, "grad_norm": 1.0078125, "learning_rate": 0.0004885344772728436, "loss": 5.1336, "mean_token_accuracy": 0.1873707190155983, "num_tokens": 24312864.0, "step": 14015 }, { "entropy": 5.509988498687744, "epoch": 1.0907994553588796, "grad_norm": 1.0078125, "learning_rate": 0.0004885257411060812, "loss": 5.058, "mean_token_accuracy": 0.19544438123703003, "num_tokens": 24321745.0, "step": 14020 }, { "entropy": 5.432704019546509, "epoch": 1.0911884847305973, "grad_norm": 1.046875, "learning_rate": 0.0004885170016994053, "loss": 5.0787, "mean_token_accuracy": 0.18926379978656768, "num_tokens": 24331061.0, "step": 14025 }, { "entropy": 5.399742603302002, "epoch": 1.0915775141023147, "grad_norm": 0.97265625, "learning_rate": 0.0004885082590529489, "loss": 5.0819, "mean_token_accuracy": 0.19124841392040254, "num_tokens": 24339935.0, "step": 14030 }, { "entropy": 5.484732437133789, "epoch": 1.0919665434740322, "grad_norm": 1.03125, "learning_rate": 0.0004884995131668445, "loss": 5.1023, "mean_token_accuracy": 0.18718356192111968, "num_tokens": 24348876.0, "step": 14035 }, { "entropy": 5.516810941696167, "epoch": 1.09235557284575, "grad_norm": 1.0390625, "learning_rate": 0.0004884907640412248, "loss": 5.1255, "mean_token_accuracy": 0.18855560272932054, "num_tokens": 24357094.0, "step": 14040 }, { "entropy": 5.460855960845947, "epoch": 1.0927446022174674, "grad_norm": 0.9921875, "learning_rate": 0.0004884820116762225, "loss": 5.0892, "mean_token_accuracy": 0.18820314556360246, "num_tokens": 24366320.0, "step": 14045 }, { "entropy": 5.4540627002716064, "epoch": 1.093133631589185, "grad_norm": 1.0234375, "learning_rate": 0.0004884732560719706, "loss": 4.9796, "mean_token_accuracy": 0.19549806416034698, "num_tokens": 24374390.0, "step": 14050 }, { "entropy": 5.485117816925049, "epoch": 1.0935226609609026, "grad_norm": 1.078125, "learning_rate": 0.0004884644972286017, "loss": 5.0904, "mean_token_accuracy": 0.1966923803091049, "num_tokens": 24382804.0, "step": 14055 }, { "entropy": 5.5244769096374515, "epoch": 1.09391169033262, "grad_norm": 1.0859375, "learning_rate": 0.0004884557351462488, "loss": 5.1073, "mean_token_accuracy": 0.18839208632707596, "num_tokens": 24391352.0, "step": 14060 }, { "entropy": 5.530089902877807, "epoch": 1.0943007197043377, "grad_norm": 1.0234375, "learning_rate": 0.0004884469698250449, "loss": 5.1479, "mean_token_accuracy": 0.1873334154486656, "num_tokens": 24400348.0, "step": 14065 }, { "entropy": 5.4310750484466555, "epoch": 1.0946897490760552, "grad_norm": 1.03125, "learning_rate": 0.000488438201265123, "loss": 4.9972, "mean_token_accuracy": 0.19850855618715285, "num_tokens": 24409628.0, "step": 14070 }, { "entropy": 5.457976007461548, "epoch": 1.095078778447773, "grad_norm": 1.1171875, "learning_rate": 0.0004884294294666161, "loss": 5.1127, "mean_token_accuracy": 0.18832556009292603, "num_tokens": 24418379.0, "step": 14075 }, { "entropy": 5.618537855148316, "epoch": 1.0954678078194904, "grad_norm": 1.046875, "learning_rate": 0.0004884206544296573, "loss": 5.2328, "mean_token_accuracy": 0.18104857355356216, "num_tokens": 24427719.0, "step": 14080 }, { "entropy": 5.554149150848389, "epoch": 1.0958568371912079, "grad_norm": 1.0625, "learning_rate": 0.0004884118761543797, "loss": 5.1785, "mean_token_accuracy": 0.18309949338436127, "num_tokens": 24435938.0, "step": 14085 }, { "entropy": 5.444269800186158, "epoch": 1.0962458665629256, "grad_norm": 1.1015625, "learning_rate": 0.0004884030946409167, "loss": 5.0715, "mean_token_accuracy": 0.19200797528028488, "num_tokens": 24444286.0, "step": 14090 }, { "entropy": 5.4541562557220455, "epoch": 1.096634895934643, "grad_norm": 1.046875, "learning_rate": 0.0004883943098894013, "loss": 5.013, "mean_token_accuracy": 0.19318921416997908, "num_tokens": 24452546.0, "step": 14095 }, { "entropy": 5.536852645874023, "epoch": 1.0970239253063607, "grad_norm": 1.0234375, "learning_rate": 0.000488385521899967, "loss": 5.1517, "mean_token_accuracy": 0.18615591377019883, "num_tokens": 24460765.0, "step": 14100 }, { "entropy": 5.482502365112305, "epoch": 1.0974129546780782, "grad_norm": 1.0625, "learning_rate": 0.000488376730672747, "loss": 5.0324, "mean_token_accuracy": 0.18781086057424545, "num_tokens": 24470018.0, "step": 14105 }, { "entropy": 5.479088973999024, "epoch": 1.0978019840497957, "grad_norm": 1.1484375, "learning_rate": 0.0004883679362078746, "loss": 4.9657, "mean_token_accuracy": 0.1902064189314842, "num_tokens": 24478882.0, "step": 14110 }, { "entropy": 5.516511392593384, "epoch": 1.0981910134215134, "grad_norm": 1.0390625, "learning_rate": 0.0004883591385054836, "loss": 5.1406, "mean_token_accuracy": 0.18539018630981446, "num_tokens": 24487801.0, "step": 14115 }, { "entropy": 5.475099992752075, "epoch": 1.0985800427932308, "grad_norm": 1.21875, "learning_rate": 0.0004883503375657072, "loss": 5.0811, "mean_token_accuracy": 0.19068054258823394, "num_tokens": 24496082.0, "step": 14120 }, { "entropy": 5.472542715072632, "epoch": 1.0989690721649485, "grad_norm": 0.99609375, "learning_rate": 0.0004883415333886789, "loss": 5.0203, "mean_token_accuracy": 0.19794781059026717, "num_tokens": 24504664.0, "step": 14125 }, { "entropy": 5.477818775177002, "epoch": 1.099358101536666, "grad_norm": 1.03125, "learning_rate": 0.0004883327259745325, "loss": 5.0564, "mean_token_accuracy": 0.19468298256397248, "num_tokens": 24512797.0, "step": 14130 }, { "entropy": 5.462477540969848, "epoch": 1.0997471309083835, "grad_norm": 1.203125, "learning_rate": 0.0004883239153234015, "loss": 5.0299, "mean_token_accuracy": 0.19463422596454621, "num_tokens": 24520941.0, "step": 14135 }, { "entropy": 5.531305122375488, "epoch": 1.1001361602801012, "grad_norm": 1.0546875, "learning_rate": 0.0004883151014354197, "loss": 5.1365, "mean_token_accuracy": 0.18656647354364395, "num_tokens": 24530087.0, "step": 14140 }, { "entropy": 5.495877981185913, "epoch": 1.1005251896518187, "grad_norm": 1.1015625, "learning_rate": 0.0004883062843107207, "loss": 5.0731, "mean_token_accuracy": 0.19383307546377182, "num_tokens": 24538593.0, "step": 14145 }, { "entropy": 5.638531827926636, "epoch": 1.1009142190235364, "grad_norm": 1.0078125, "learning_rate": 0.0004882974639494383, "loss": 5.1674, "mean_token_accuracy": 0.17734225392341613, "num_tokens": 24547158.0, "step": 14150 }, { "entropy": 5.490908098220825, "epoch": 1.1013032483952538, "grad_norm": 1.0625, "learning_rate": 0.0004882886403517065, "loss": 5.1565, "mean_token_accuracy": 0.18525038957595824, "num_tokens": 24556266.0, "step": 14155 }, { "entropy": 5.5363387107849125, "epoch": 1.1016922777669713, "grad_norm": 1.0, "learning_rate": 0.0004882798135176589, "loss": 5.2169, "mean_token_accuracy": 0.1815798193216324, "num_tokens": 24565122.0, "step": 14160 }, { "entropy": 5.4558820724487305, "epoch": 1.102081307138689, "grad_norm": 1.109375, "learning_rate": 0.00048827098344742973, "loss": 5.0343, "mean_token_accuracy": 0.2014609768986702, "num_tokens": 24573944.0, "step": 14165 }, { "entropy": 5.531532955169678, "epoch": 1.1024703365104065, "grad_norm": 1.1015625, "learning_rate": 0.0004882621501411528, "loss": 5.228, "mean_token_accuracy": 0.18726859986782074, "num_tokens": 24582233.0, "step": 14170 }, { "entropy": 5.516927194595337, "epoch": 1.1028593658821242, "grad_norm": 1.0234375, "learning_rate": 0.0004882533135989622, "loss": 5.0806, "mean_token_accuracy": 0.1901678130030632, "num_tokens": 24590855.0, "step": 14175 }, { "entropy": 5.591112041473389, "epoch": 1.1032483952538417, "grad_norm": 1.078125, "learning_rate": 0.000488244473820992, "loss": 5.1488, "mean_token_accuracy": 0.18044410049915313, "num_tokens": 24599877.0, "step": 14180 }, { "entropy": 5.470767498016357, "epoch": 1.1036374246255591, "grad_norm": 1.0703125, "learning_rate": 0.00048823563080737634, "loss": 5.0213, "mean_token_accuracy": 0.19665087163448333, "num_tokens": 24608450.0, "step": 14185 }, { "entropy": 5.439700078964234, "epoch": 1.1040264539972768, "grad_norm": 1.046875, "learning_rate": 0.0004882267845582493, "loss": 5.0893, "mean_token_accuracy": 0.19804433584213257, "num_tokens": 24618018.0, "step": 14190 }, { "entropy": 5.517613792419434, "epoch": 1.1044154833689943, "grad_norm": 1.078125, "learning_rate": 0.00048821793507374526, "loss": 5.0925, "mean_token_accuracy": 0.19080222249031067, "num_tokens": 24626388.0, "step": 14195 }, { "entropy": 5.613471364974975, "epoch": 1.104804512740712, "grad_norm": 1.0546875, "learning_rate": 0.0004882090823539984, "loss": 5.2005, "mean_token_accuracy": 0.1794778361916542, "num_tokens": 24635284.0, "step": 14200 }, { "entropy": 5.535953044891357, "epoch": 1.1051935421124295, "grad_norm": 1.09375, "learning_rate": 0.0004882002263991431, "loss": 5.0536, "mean_token_accuracy": 0.19406071603298186, "num_tokens": 24644297.0, "step": 14205 }, { "entropy": 5.390873718261719, "epoch": 1.105582571484147, "grad_norm": 1.0078125, "learning_rate": 0.00048819136720931364, "loss": 4.9235, "mean_token_accuracy": 0.19783682823181153, "num_tokens": 24652965.0, "step": 14210 }, { "entropy": 5.375162410736084, "epoch": 1.1059716008558647, "grad_norm": 1.046875, "learning_rate": 0.00048818250478464457, "loss": 4.98, "mean_token_accuracy": 0.20183780640363694, "num_tokens": 24661034.0, "step": 14215 }, { "entropy": 5.492465543746948, "epoch": 1.1063606302275821, "grad_norm": 1.046875, "learning_rate": 0.0004881736391252703, "loss": 5.0841, "mean_token_accuracy": 0.19261867702007293, "num_tokens": 24669831.0, "step": 14220 }, { "entropy": 5.5581377983093265, "epoch": 1.1067496595992998, "grad_norm": 1.078125, "learning_rate": 0.0004881647702313253, "loss": 5.1487, "mean_token_accuracy": 0.18230141401290895, "num_tokens": 24678491.0, "step": 14225 }, { "entropy": 5.506564617156982, "epoch": 1.1071386889710173, "grad_norm": 1.046875, "learning_rate": 0.00048815589810294427, "loss": 5.1014, "mean_token_accuracy": 0.19710657894611358, "num_tokens": 24687308.0, "step": 14230 }, { "entropy": 5.501833438873291, "epoch": 1.1075277183427348, "grad_norm": 1.1171875, "learning_rate": 0.00048814702274026174, "loss": 5.0336, "mean_token_accuracy": 0.19526302069425583, "num_tokens": 24696080.0, "step": 14235 }, { "entropy": 5.46281418800354, "epoch": 1.1079167477144525, "grad_norm": 1.1328125, "learning_rate": 0.0004881381441434124, "loss": 5.1375, "mean_token_accuracy": 0.18573801964521408, "num_tokens": 24704561.0, "step": 14240 }, { "entropy": 5.543645715713501, "epoch": 1.10830577708617, "grad_norm": 1.0234375, "learning_rate": 0.000488129262312531, "loss": 5.1449, "mean_token_accuracy": 0.18953218162059784, "num_tokens": 24713403.0, "step": 14245 }, { "entropy": 5.552932357788086, "epoch": 1.1086948064578876, "grad_norm": 1.0390625, "learning_rate": 0.00048812037724775217, "loss": 5.1336, "mean_token_accuracy": 0.18459319323301315, "num_tokens": 24722031.0, "step": 14250 }, { "entropy": 5.498391628265381, "epoch": 1.1090838358296051, "grad_norm": 0.9765625, "learning_rate": 0.0004881114889492109, "loss": 5.0755, "mean_token_accuracy": 0.18816042691469193, "num_tokens": 24731176.0, "step": 14255 }, { "entropy": 5.543713998794556, "epoch": 1.1094728652013226, "grad_norm": 1.0703125, "learning_rate": 0.00048810259741704197, "loss": 5.1322, "mean_token_accuracy": 0.18714335560798645, "num_tokens": 24740037.0, "step": 14260 }, { "entropy": 5.5848571300506595, "epoch": 1.1098618945730403, "grad_norm": 1.0625, "learning_rate": 0.0004880937026513803, "loss": 5.174, "mean_token_accuracy": 0.18283917158842086, "num_tokens": 24748778.0, "step": 14265 }, { "entropy": 5.5509840965271, "epoch": 1.1102509239447578, "grad_norm": 1.0390625, "learning_rate": 0.0004880848046523609, "loss": 5.02, "mean_token_accuracy": 0.19701252728700638, "num_tokens": 24757226.0, "step": 14270 }, { "entropy": 5.439191436767578, "epoch": 1.1106399533164755, "grad_norm": 1.015625, "learning_rate": 0.00048807590342011875, "loss": 5.098, "mean_token_accuracy": 0.1897670716047287, "num_tokens": 24765734.0, "step": 14275 }, { "entropy": 5.457479619979859, "epoch": 1.111028982688193, "grad_norm": 1.0546875, "learning_rate": 0.00048806699895478895, "loss": 5.0764, "mean_token_accuracy": 0.18642304837703705, "num_tokens": 24773773.0, "step": 14280 }, { "entropy": 5.490449476242065, "epoch": 1.1114180120599104, "grad_norm": 1.0234375, "learning_rate": 0.0004880580912565065, "loss": 5.0938, "mean_token_accuracy": 0.19081311970949172, "num_tokens": 24782563.0, "step": 14285 }, { "entropy": 5.55050835609436, "epoch": 1.1118070414316281, "grad_norm": 1.0703125, "learning_rate": 0.0004880491803254067, "loss": 5.1781, "mean_token_accuracy": 0.18696547746658326, "num_tokens": 24791492.0, "step": 14290 }, { "entropy": 5.46369104385376, "epoch": 1.1121960708033456, "grad_norm": 1.046875, "learning_rate": 0.0004880402661616246, "loss": 4.9968, "mean_token_accuracy": 0.1996077612042427, "num_tokens": 24800229.0, "step": 14295 }, { "entropy": 5.476163339614868, "epoch": 1.1125851001750633, "grad_norm": 1.0390625, "learning_rate": 0.0004880313487652956, "loss": 5.0705, "mean_token_accuracy": 0.18836814612150193, "num_tokens": 24809454.0, "step": 14300 }, { "entropy": 5.4627049446105955, "epoch": 1.1129741295467808, "grad_norm": 1.125, "learning_rate": 0.00048802242813655503, "loss": 5.0677, "mean_token_accuracy": 0.19220980256795883, "num_tokens": 24817956.0, "step": 14305 }, { "entropy": 5.447548580169678, "epoch": 1.1133631589184985, "grad_norm": 1.03125, "learning_rate": 0.000488013504275538, "loss": 4.984, "mean_token_accuracy": 0.19897254258394242, "num_tokens": 24826288.0, "step": 14310 }, { "entropy": 5.568285131454468, "epoch": 1.113752188290216, "grad_norm": 1.0546875, "learning_rate": 0.0004880045771823802, "loss": 5.1391, "mean_token_accuracy": 0.18945065289735794, "num_tokens": 24834720.0, "step": 14315 }, { "entropy": 5.514256381988526, "epoch": 1.1141412176619334, "grad_norm": 1.0, "learning_rate": 0.00048799564685721695, "loss": 5.1024, "mean_token_accuracy": 0.18744791746139527, "num_tokens": 24843000.0, "step": 14320 }, { "entropy": 5.506324720382691, "epoch": 1.1145302470336511, "grad_norm": 1.0703125, "learning_rate": 0.0004879867133001837, "loss": 5.0995, "mean_token_accuracy": 0.1878347784280777, "num_tokens": 24851060.0, "step": 14325 }, { "entropy": 5.393500852584839, "epoch": 1.1149192764053686, "grad_norm": 1.046875, "learning_rate": 0.0004879777765114162, "loss": 4.9946, "mean_token_accuracy": 0.19766666293144225, "num_tokens": 24859913.0, "step": 14330 }, { "entropy": 5.555182218551636, "epoch": 1.115308305777086, "grad_norm": 1.0625, "learning_rate": 0.00048796883649104996, "loss": 5.2117, "mean_token_accuracy": 0.18306808918714523, "num_tokens": 24869648.0, "step": 14335 }, { "entropy": 5.504534292221069, "epoch": 1.1156973351488038, "grad_norm": 1.046875, "learning_rate": 0.0004879598932392206, "loss": 5.1132, "mean_token_accuracy": 0.19304556846618653, "num_tokens": 24878813.0, "step": 14340 }, { "entropy": 5.533006095886231, "epoch": 1.1160863645205212, "grad_norm": 1.125, "learning_rate": 0.00048795094675606364, "loss": 5.1044, "mean_token_accuracy": 0.1877557083964348, "num_tokens": 24887714.0, "step": 14345 }, { "entropy": 5.541776943206787, "epoch": 1.116475393892239, "grad_norm": 1.015625, "learning_rate": 0.0004879419970417152, "loss": 5.0914, "mean_token_accuracy": 0.19271306246519088, "num_tokens": 24895961.0, "step": 14350 }, { "entropy": 5.512493753433228, "epoch": 1.1168644232639564, "grad_norm": 1.0234375, "learning_rate": 0.00048793304409631077, "loss": 5.1123, "mean_token_accuracy": 0.18943119943141937, "num_tokens": 24904873.0, "step": 14355 }, { "entropy": 5.453421401977539, "epoch": 1.117253452635674, "grad_norm": 1.15625, "learning_rate": 0.0004879240879199863, "loss": 5.0063, "mean_token_accuracy": 0.19844941049814224, "num_tokens": 24913486.0, "step": 14360 }, { "entropy": 5.472738027572632, "epoch": 1.1176424820073916, "grad_norm": 1.09375, "learning_rate": 0.00048791512851287786, "loss": 5.1196, "mean_token_accuracy": 0.1873530313372612, "num_tokens": 24921943.0, "step": 14365 }, { "entropy": 5.58011474609375, "epoch": 1.118031511379109, "grad_norm": 1.109375, "learning_rate": 0.00048790616587512107, "loss": 5.1749, "mean_token_accuracy": 0.18267556726932527, "num_tokens": 24930081.0, "step": 14370 }, { "entropy": 5.607824754714966, "epoch": 1.1184205407508268, "grad_norm": 1.1171875, "learning_rate": 0.0004878972000068521, "loss": 5.1051, "mean_token_accuracy": 0.18964903652668, "num_tokens": 24938985.0, "step": 14375 }, { "entropy": 5.421042537689209, "epoch": 1.1188095701225442, "grad_norm": 1.0, "learning_rate": 0.00048788823090820707, "loss": 4.9474, "mean_token_accuracy": 0.20545244663953782, "num_tokens": 24947497.0, "step": 14380 }, { "entropy": 5.540891408920288, "epoch": 1.1191985994942617, "grad_norm": 1.046875, "learning_rate": 0.00048787925857932194, "loss": 5.1752, "mean_token_accuracy": 0.1851798564195633, "num_tokens": 24956263.0, "step": 14385 }, { "entropy": 5.609076833724975, "epoch": 1.1195876288659794, "grad_norm": 1.1328125, "learning_rate": 0.00048787028302033287, "loss": 5.2537, "mean_token_accuracy": 0.17956591844558717, "num_tokens": 24965646.0, "step": 14390 }, { "entropy": 5.5726629257202145, "epoch": 1.1199766582376969, "grad_norm": 1.1171875, "learning_rate": 0.00048786130423137606, "loss": 5.127, "mean_token_accuracy": 0.1885293960571289, "num_tokens": 24973318.0, "step": 14395 }, { "entropy": 5.553167200088501, "epoch": 1.1203656876094146, "grad_norm": 1.0859375, "learning_rate": 0.0004878523222125879, "loss": 5.195, "mean_token_accuracy": 0.1870058298110962, "num_tokens": 24982600.0, "step": 14400 }, { "entropy": 5.625823259353638, "epoch": 1.120754716981132, "grad_norm": 1.1328125, "learning_rate": 0.0004878433369641044, "loss": 5.1987, "mean_token_accuracy": 0.17906621545553209, "num_tokens": 24990386.0, "step": 14405 }, { "entropy": 5.410462236404419, "epoch": 1.1211437463528497, "grad_norm": 1.0703125, "learning_rate": 0.0004878343484860621, "loss": 4.9685, "mean_token_accuracy": 0.20021493285894393, "num_tokens": 24999064.0, "step": 14410 }, { "entropy": 5.4935376167297365, "epoch": 1.1215327757245672, "grad_norm": 1.0703125, "learning_rate": 0.0004878253567785972, "loss": 5.146, "mean_token_accuracy": 0.18787796199321746, "num_tokens": 25008448.0, "step": 14415 }, { "entropy": 5.405907869338989, "epoch": 1.1219218050962847, "grad_norm": 1.09375, "learning_rate": 0.00048781636184184644, "loss": 4.97, "mean_token_accuracy": 0.20493122935295105, "num_tokens": 25016722.0, "step": 14420 }, { "entropy": 5.431467199325562, "epoch": 1.1223108344680024, "grad_norm": 0.98046875, "learning_rate": 0.000487807363675946, "loss": 5.0546, "mean_token_accuracy": 0.1951756939291954, "num_tokens": 25026263.0, "step": 14425 }, { "entropy": 5.501713275909424, "epoch": 1.1226998638397199, "grad_norm": 1.0234375, "learning_rate": 0.0004877983622810326, "loss": 5.0819, "mean_token_accuracy": 0.19477165937423707, "num_tokens": 25035202.0, "step": 14430 }, { "entropy": 5.573826932907105, "epoch": 1.1230888932114376, "grad_norm": 1.1015625, "learning_rate": 0.0004877893576572427, "loss": 5.1639, "mean_token_accuracy": 0.19016327261924743, "num_tokens": 25044309.0, "step": 14435 }, { "entropy": 5.5629565715789795, "epoch": 1.123477922583155, "grad_norm": 1.0234375, "learning_rate": 0.000487780349804713, "loss": 5.1255, "mean_token_accuracy": 0.19612445831298828, "num_tokens": 25053044.0, "step": 14440 }, { "entropy": 5.407511234283447, "epoch": 1.1238669519548725, "grad_norm": 1.015625, "learning_rate": 0.0004877713387235802, "loss": 5.0565, "mean_token_accuracy": 0.19943582862615586, "num_tokens": 25061869.0, "step": 14445 }, { "entropy": 5.57900652885437, "epoch": 1.1242559813265902, "grad_norm": 1.1796875, "learning_rate": 0.000487762324413981, "loss": 5.2342, "mean_token_accuracy": 0.1856849357485771, "num_tokens": 25070022.0, "step": 14450 }, { "entropy": 5.577738904953003, "epoch": 1.1246450106983077, "grad_norm": 1.0859375, "learning_rate": 0.00048775330687605213, "loss": 5.1332, "mean_token_accuracy": 0.18372095376253128, "num_tokens": 25078604.0, "step": 14455 }, { "entropy": 5.467156982421875, "epoch": 1.1250340400700254, "grad_norm": 1.0859375, "learning_rate": 0.0004877442861099305, "loss": 4.9894, "mean_token_accuracy": 0.19702853560447692, "num_tokens": 25087256.0, "step": 14460 }, { "entropy": 5.463933944702148, "epoch": 1.1254230694417429, "grad_norm": 1.03125, "learning_rate": 0.0004877352621157529, "loss": 5.0625, "mean_token_accuracy": 0.19219833761453628, "num_tokens": 25095593.0, "step": 14465 }, { "entropy": 5.505068063735962, "epoch": 1.1258120988134603, "grad_norm": 1.046875, "learning_rate": 0.00048772623489365635, "loss": 5.1278, "mean_token_accuracy": 0.18812383562326432, "num_tokens": 25104852.0, "step": 14470 }, { "entropy": 5.507026958465576, "epoch": 1.126201128185178, "grad_norm": 1.0234375, "learning_rate": 0.0004877172044437777, "loss": 5.1108, "mean_token_accuracy": 0.1901862159371376, "num_tokens": 25114453.0, "step": 14475 }, { "entropy": 5.511804866790771, "epoch": 1.1265901575568955, "grad_norm": 1.0390625, "learning_rate": 0.00048770817076625416, "loss": 5.1027, "mean_token_accuracy": 0.19113148152828216, "num_tokens": 25123733.0, "step": 14480 }, { "entropy": 5.470343112945557, "epoch": 1.126979186928613, "grad_norm": 1.03125, "learning_rate": 0.00048769913386122253, "loss": 5.0181, "mean_token_accuracy": 0.1964005559682846, "num_tokens": 25132572.0, "step": 14485 }, { "entropy": 5.41240382194519, "epoch": 1.1273682163003307, "grad_norm": 0.96875, "learning_rate": 0.0004876900937288202, "loss": 5.0618, "mean_token_accuracy": 0.19426379203796387, "num_tokens": 25141494.0, "step": 14490 }, { "entropy": 5.425282335281372, "epoch": 1.1277572456720482, "grad_norm": 1.109375, "learning_rate": 0.00048768105036918426, "loss": 5.0341, "mean_token_accuracy": 0.1903810054063797, "num_tokens": 25150186.0, "step": 14495 }, { "entropy": 5.518694734573364, "epoch": 1.1281462750437659, "grad_norm": 1.015625, "learning_rate": 0.00048767200378245187, "loss": 5.0872, "mean_token_accuracy": 0.19107090085744857, "num_tokens": 25159251.0, "step": 14500 }, { "entropy": 5.515418672561646, "epoch": 1.1285353044154833, "grad_norm": 1.0703125, "learning_rate": 0.00048766295396876025, "loss": 5.0925, "mean_token_accuracy": 0.19321882724761963, "num_tokens": 25167780.0, "step": 14505 }, { "entropy": 5.4570746421813965, "epoch": 1.128924333787201, "grad_norm": 1.1640625, "learning_rate": 0.00048765390092824683, "loss": 5.0199, "mean_token_accuracy": 0.19386293441057206, "num_tokens": 25175358.0, "step": 14510 }, { "entropy": 5.448283576965332, "epoch": 1.1293133631589185, "grad_norm": 0.96484375, "learning_rate": 0.000487644844661049, "loss": 5.0552, "mean_token_accuracy": 0.18960769176483155, "num_tokens": 25184247.0, "step": 14515 }, { "entropy": 5.420176458358765, "epoch": 1.129702392530636, "grad_norm": 1.0546875, "learning_rate": 0.000487635785167304, "loss": 4.9834, "mean_token_accuracy": 0.20026829987764358, "num_tokens": 25192311.0, "step": 14520 }, { "entropy": 5.416279363632202, "epoch": 1.1300914219023537, "grad_norm": 1.0703125, "learning_rate": 0.00048762672244714953, "loss": 5.038, "mean_token_accuracy": 0.1973262369632721, "num_tokens": 25200861.0, "step": 14525 }, { "entropy": 5.575963497161865, "epoch": 1.1304804512740712, "grad_norm": 1.1484375, "learning_rate": 0.0004876176565007229, "loss": 5.1781, "mean_token_accuracy": 0.18811686635017394, "num_tokens": 25208938.0, "step": 14530 }, { "entropy": 5.532007694244385, "epoch": 1.1308694806457888, "grad_norm": 1.0234375, "learning_rate": 0.00048760858732816174, "loss": 5.0715, "mean_token_accuracy": 0.19564334005117417, "num_tokens": 25216997.0, "step": 14535 }, { "entropy": 5.4492189407348635, "epoch": 1.1312585100175063, "grad_norm": 1.0703125, "learning_rate": 0.0004875995149296037, "loss": 4.9962, "mean_token_accuracy": 0.19854545146226882, "num_tokens": 25225205.0, "step": 14540 }, { "entropy": 5.442260313034057, "epoch": 1.1316475393892238, "grad_norm": 1.0234375, "learning_rate": 0.0004875904393051864, "loss": 5.046, "mean_token_accuracy": 0.19494135528802872, "num_tokens": 25233807.0, "step": 14545 }, { "entropy": 5.470048236846924, "epoch": 1.1320365687609415, "grad_norm": 1.0546875, "learning_rate": 0.0004875813604550476, "loss": 5.0817, "mean_token_accuracy": 0.18521393537521363, "num_tokens": 25241715.0, "step": 14550 }, { "entropy": 5.589618825912476, "epoch": 1.132425598132659, "grad_norm": 1.1484375, "learning_rate": 0.00048757227837932494, "loss": 5.19, "mean_token_accuracy": 0.1925830736756325, "num_tokens": 25250418.0, "step": 14555 }, { "entropy": 5.540874242782593, "epoch": 1.1328146275043767, "grad_norm": 1.0859375, "learning_rate": 0.0004875631930781563, "loss": 5.0794, "mean_token_accuracy": 0.18854292035102843, "num_tokens": 25259164.0, "step": 14560 }, { "entropy": 5.50153431892395, "epoch": 1.1332036568760941, "grad_norm": 1.0625, "learning_rate": 0.00048755410455167967, "loss": 5.1324, "mean_token_accuracy": 0.1861720472574234, "num_tokens": 25267902.0, "step": 14565 }, { "entropy": 5.461972284317016, "epoch": 1.1335926862478116, "grad_norm": 1.125, "learning_rate": 0.0004875450128000326, "loss": 5.0819, "mean_token_accuracy": 0.1853091835975647, "num_tokens": 25275991.0, "step": 14570 }, { "entropy": 5.503007268905639, "epoch": 1.1339817156195293, "grad_norm": 1.09375, "learning_rate": 0.0004875359178233534, "loss": 5.0808, "mean_token_accuracy": 0.19371482431888581, "num_tokens": 25284454.0, "step": 14575 }, { "entropy": 5.576267433166504, "epoch": 1.1343707449912468, "grad_norm": 1.09375, "learning_rate": 0.00048752681962177985, "loss": 5.1886, "mean_token_accuracy": 0.19148486107587814, "num_tokens": 25292867.0, "step": 14580 }, { "entropy": 5.513134479522705, "epoch": 1.1347597743629645, "grad_norm": 1.0078125, "learning_rate": 0.00048751771819545013, "loss": 5.0834, "mean_token_accuracy": 0.19496375769376756, "num_tokens": 25301486.0, "step": 14585 }, { "entropy": 5.481389665603638, "epoch": 1.135148803734682, "grad_norm": 0.96484375, "learning_rate": 0.00048750861354450236, "loss": 5.0479, "mean_token_accuracy": 0.19326104670763017, "num_tokens": 25310800.0, "step": 14590 }, { "entropy": 5.5152843475341795, "epoch": 1.1355378331063994, "grad_norm": 1.0546875, "learning_rate": 0.0004874995056690746, "loss": 5.1243, "mean_token_accuracy": 0.19184402972459794, "num_tokens": 25319063.0, "step": 14595 }, { "entropy": 5.580584144592285, "epoch": 1.1359268624781171, "grad_norm": 1.0390625, "learning_rate": 0.000487490394569305, "loss": 5.1683, "mean_token_accuracy": 0.18694237768650054, "num_tokens": 25327817.0, "step": 14600 }, { "entropy": 5.480030107498169, "epoch": 1.1363158918498346, "grad_norm": 1.0859375, "learning_rate": 0.0004874812802453319, "loss": 5.0181, "mean_token_accuracy": 0.1918010115623474, "num_tokens": 25335753.0, "step": 14605 }, { "entropy": 5.526291942596435, "epoch": 1.1367049212215523, "grad_norm": 1.15625, "learning_rate": 0.0004874721626972936, "loss": 5.1941, "mean_token_accuracy": 0.18220938593149186, "num_tokens": 25344514.0, "step": 14610 }, { "entropy": 5.484691476821899, "epoch": 1.1370939505932698, "grad_norm": 1.0078125, "learning_rate": 0.0004874630419253284, "loss": 5.099, "mean_token_accuracy": 0.19185065925121308, "num_tokens": 25353003.0, "step": 14615 }, { "entropy": 5.471804809570313, "epoch": 1.1374829799649873, "grad_norm": 1.0859375, "learning_rate": 0.00048745391792957474, "loss": 5.0919, "mean_token_accuracy": 0.19143712967634202, "num_tokens": 25361599.0, "step": 14620 }, { "entropy": 5.523415660858154, "epoch": 1.137872009336705, "grad_norm": 1.0234375, "learning_rate": 0.00048744479071017097, "loss": 5.1206, "mean_token_accuracy": 0.18487742096185683, "num_tokens": 25370566.0, "step": 14625 }, { "entropy": 5.556959247589111, "epoch": 1.1382610387084224, "grad_norm": 0.95703125, "learning_rate": 0.0004874356602672556, "loss": 5.1329, "mean_token_accuracy": 0.19328008145093917, "num_tokens": 25379589.0, "step": 14630 }, { "entropy": 5.519960355758667, "epoch": 1.1386500680801401, "grad_norm": 1.0234375, "learning_rate": 0.0004874265266009673, "loss": 5.0672, "mean_token_accuracy": 0.2028932437300682, "num_tokens": 25387481.0, "step": 14635 }, { "entropy": 5.49937252998352, "epoch": 1.1390390974518576, "grad_norm": 1.0859375, "learning_rate": 0.0004874173897114445, "loss": 5.1118, "mean_token_accuracy": 0.18949429392814637, "num_tokens": 25395551.0, "step": 14640 }, { "entropy": 5.538345575332642, "epoch": 1.1394281268235753, "grad_norm": 1.09375, "learning_rate": 0.00048740824959882603, "loss": 5.1464, "mean_token_accuracy": 0.18077351301908492, "num_tokens": 25404303.0, "step": 14645 }, { "entropy": 5.541308736801147, "epoch": 1.1398171561952928, "grad_norm": 1.015625, "learning_rate": 0.0004873991062632504, "loss": 5.1466, "mean_token_accuracy": 0.18042872995138168, "num_tokens": 25412749.0, "step": 14650 }, { "entropy": 5.480417728424072, "epoch": 1.1402061855670103, "grad_norm": 1.0390625, "learning_rate": 0.00048738995970485635, "loss": 5.0674, "mean_token_accuracy": 0.18805858492851257, "num_tokens": 25421075.0, "step": 14655 }, { "entropy": 5.513362169265747, "epoch": 1.140595214938728, "grad_norm": 1.1171875, "learning_rate": 0.0004873808099237827, "loss": 5.2046, "mean_token_accuracy": 0.18723845928907396, "num_tokens": 25429750.0, "step": 14660 }, { "entropy": 5.554219579696655, "epoch": 1.1409842443104454, "grad_norm": 1.109375, "learning_rate": 0.0004873716569201684, "loss": 5.0982, "mean_token_accuracy": 0.1956760048866272, "num_tokens": 25437686.0, "step": 14665 }, { "entropy": 5.484993743896484, "epoch": 1.141373273682163, "grad_norm": 1.015625, "learning_rate": 0.00048736250069415213, "loss": 5.0978, "mean_token_accuracy": 0.1941860631108284, "num_tokens": 25446050.0, "step": 14670 }, { "entropy": 5.471145534515381, "epoch": 1.1417623030538806, "grad_norm": 1.1328125, "learning_rate": 0.0004873533412458729, "loss": 5.0808, "mean_token_accuracy": 0.19685325920581817, "num_tokens": 25455134.0, "step": 14675 }, { "entropy": 5.461444234848022, "epoch": 1.142151332425598, "grad_norm": 1.0078125, "learning_rate": 0.00048734417857546986, "loss": 4.9764, "mean_token_accuracy": 0.19964392930269242, "num_tokens": 25463258.0, "step": 14680 }, { "entropy": 5.526610851287842, "epoch": 1.1425403617973158, "grad_norm": 1.09375, "learning_rate": 0.0004873350126830818, "loss": 5.0626, "mean_token_accuracy": 0.1971107766032219, "num_tokens": 25472085.0, "step": 14685 }, { "entropy": 5.536177730560302, "epoch": 1.1429293911690332, "grad_norm": 1.03125, "learning_rate": 0.0004873258435688479, "loss": 5.058, "mean_token_accuracy": 0.19580527991056443, "num_tokens": 25481233.0, "step": 14690 }, { "entropy": 5.4863299369812015, "epoch": 1.143318420540751, "grad_norm": 1.0625, "learning_rate": 0.0004873166712329073, "loss": 5.0484, "mean_token_accuracy": 0.20056751519441604, "num_tokens": 25490354.0, "step": 14695 }, { "entropy": 5.481601905822754, "epoch": 1.1437074499124684, "grad_norm": 1.1953125, "learning_rate": 0.00048730749567539914, "loss": 5.1153, "mean_token_accuracy": 0.18579058796167375, "num_tokens": 25498467.0, "step": 14700 }, { "entropy": 5.518278312683106, "epoch": 1.144096479284186, "grad_norm": 1.0703125, "learning_rate": 0.00048729831689646257, "loss": 5.1147, "mean_token_accuracy": 0.19129739850759506, "num_tokens": 25507543.0, "step": 14705 }, { "entropy": 5.479970216751099, "epoch": 1.1444855086559036, "grad_norm": 1.015625, "learning_rate": 0.00048728913489623705, "loss": 5.0066, "mean_token_accuracy": 0.19707117974758148, "num_tokens": 25516070.0, "step": 14710 }, { "entropy": 5.5181622982025145, "epoch": 1.144874538027621, "grad_norm": 1.046875, "learning_rate": 0.0004872799496748618, "loss": 5.1165, "mean_token_accuracy": 0.18833716064691544, "num_tokens": 25525216.0, "step": 14715 }, { "entropy": 5.513196897506714, "epoch": 1.1452635673993385, "grad_norm": 1.109375, "learning_rate": 0.0004872707612324761, "loss": 5.167, "mean_token_accuracy": 0.19014685451984406, "num_tokens": 25533822.0, "step": 14720 }, { "entropy": 5.562993717193604, "epoch": 1.1456525967710562, "grad_norm": 1.09375, "learning_rate": 0.0004872615695692196, "loss": 5.1689, "mean_token_accuracy": 0.18171245157718657, "num_tokens": 25541580.0, "step": 14725 }, { "entropy": 5.435118627548218, "epoch": 1.1460416261427737, "grad_norm": 1.109375, "learning_rate": 0.0004872523746852315, "loss": 4.9751, "mean_token_accuracy": 0.20090783685445784, "num_tokens": 25549860.0, "step": 14730 }, { "entropy": 5.497163343429565, "epoch": 1.1464306555144914, "grad_norm": 0.96875, "learning_rate": 0.00048724317658065146, "loss": 5.1357, "mean_token_accuracy": 0.19062530100345612, "num_tokens": 25559060.0, "step": 14735 }, { "entropy": 5.601002025604248, "epoch": 1.146819684886209, "grad_norm": 1.0703125, "learning_rate": 0.00048723397525561916, "loss": 5.1761, "mean_token_accuracy": 0.1832335740327835, "num_tokens": 25567769.0, "step": 14740 }, { "entropy": 5.552056837081909, "epoch": 1.1472087142579266, "grad_norm": 1.0, "learning_rate": 0.00048722477071027394, "loss": 5.1532, "mean_token_accuracy": 0.19468069523572923, "num_tokens": 25577443.0, "step": 14745 }, { "entropy": 5.512783336639404, "epoch": 1.147597743629644, "grad_norm": 1.0, "learning_rate": 0.00048721556294475574, "loss": 5.0751, "mean_token_accuracy": 0.20123567432165146, "num_tokens": 25586283.0, "step": 14750 }, { "entropy": 5.506499481201172, "epoch": 1.1479867730013615, "grad_norm": 1.0390625, "learning_rate": 0.00048720635195920403, "loss": 5.1613, "mean_token_accuracy": 0.19237347394227983, "num_tokens": 25594881.0, "step": 14755 }, { "entropy": 5.459519910812378, "epoch": 1.1483758023730792, "grad_norm": 1.09375, "learning_rate": 0.0004871971377537588, "loss": 5.0282, "mean_token_accuracy": 0.19574619978666305, "num_tokens": 25603738.0, "step": 14760 }, { "entropy": 5.526197004318237, "epoch": 1.1487648317447967, "grad_norm": 1.1171875, "learning_rate": 0.0004871879203285597, "loss": 5.1122, "mean_token_accuracy": 0.18958690613508225, "num_tokens": 25611780.0, "step": 14765 }, { "entropy": 5.528697538375854, "epoch": 1.1491538611165142, "grad_norm": 1.0234375, "learning_rate": 0.00048717869968374655, "loss": 5.1804, "mean_token_accuracy": 0.1882185623049736, "num_tokens": 25620489.0, "step": 14770 }, { "entropy": 5.466228294372558, "epoch": 1.1495428904882319, "grad_norm": 1.03125, "learning_rate": 0.00048716947581945954, "loss": 5.1255, "mean_token_accuracy": 0.19619790613651275, "num_tokens": 25629113.0, "step": 14775 }, { "entropy": 5.442394685745239, "epoch": 1.1499319198599494, "grad_norm": 1.0546875, "learning_rate": 0.0004871602487358383, "loss": 5.0706, "mean_token_accuracy": 0.19138748347759246, "num_tokens": 25637313.0, "step": 14780 }, { "entropy": 5.542156410217285, "epoch": 1.150320949231667, "grad_norm": 0.96484375, "learning_rate": 0.000487151018433023, "loss": 5.1699, "mean_token_accuracy": 0.1850625216960907, "num_tokens": 25646522.0, "step": 14785 }, { "entropy": 5.505914783477783, "epoch": 1.1507099786033845, "grad_norm": 1.109375, "learning_rate": 0.00048714178491115367, "loss": 5.0584, "mean_token_accuracy": 0.19813502579927444, "num_tokens": 25656058.0, "step": 14790 }, { "entropy": 5.573083209991455, "epoch": 1.1510990079751022, "grad_norm": 1.078125, "learning_rate": 0.00048713254817037046, "loss": 5.1687, "mean_token_accuracy": 0.18872501850128173, "num_tokens": 25665072.0, "step": 14795 }, { "entropy": 5.568945837020874, "epoch": 1.1514880373468197, "grad_norm": 1.0390625, "learning_rate": 0.0004871233082108135, "loss": 5.2149, "mean_token_accuracy": 0.18449426889419557, "num_tokens": 25673877.0, "step": 14800 }, { "entropy": 5.543442153930664, "epoch": 1.1518770667185372, "grad_norm": 1.0, "learning_rate": 0.0004871140650326228, "loss": 5.0699, "mean_token_accuracy": 0.1860334262251854, "num_tokens": 25683238.0, "step": 14805 }, { "entropy": 5.547911834716797, "epoch": 1.1522660960902549, "grad_norm": 1.0703125, "learning_rate": 0.0004871048186359389, "loss": 5.1583, "mean_token_accuracy": 0.18064843565225602, "num_tokens": 25692654.0, "step": 14810 }, { "entropy": 5.5750528335571286, "epoch": 1.1526551254619724, "grad_norm": 1.21875, "learning_rate": 0.000487095569020902, "loss": 5.1413, "mean_token_accuracy": 0.18689912855625151, "num_tokens": 25701681.0, "step": 14815 }, { "entropy": 5.5632843494415285, "epoch": 1.1530441548336898, "grad_norm": 1.015625, "learning_rate": 0.0004870863161876524, "loss": 5.0444, "mean_token_accuracy": 0.19466075152158738, "num_tokens": 25709848.0, "step": 14820 }, { "entropy": 5.622113943099976, "epoch": 1.1534331842054075, "grad_norm": 1.1171875, "learning_rate": 0.0004870770601363305, "loss": 5.2957, "mean_token_accuracy": 0.19040310382843018, "num_tokens": 25717993.0, "step": 14825 }, { "entropy": 5.580501461029053, "epoch": 1.153822213577125, "grad_norm": 1.0546875, "learning_rate": 0.00048706780086707675, "loss": 5.1898, "mean_token_accuracy": 0.18507048934698106, "num_tokens": 25726379.0, "step": 14830 }, { "entropy": 5.500907850265503, "epoch": 1.1542112429488427, "grad_norm": 1.0703125, "learning_rate": 0.0004870585383800317, "loss": 5.0929, "mean_token_accuracy": 0.19251780956983566, "num_tokens": 25734968.0, "step": 14835 }, { "entropy": 5.542862844467163, "epoch": 1.1546002723205602, "grad_norm": 1.0703125, "learning_rate": 0.00048704927267533585, "loss": 5.1316, "mean_token_accuracy": 0.1930421143770218, "num_tokens": 25743315.0, "step": 14840 }, { "entropy": 5.5211371898651125, "epoch": 1.1549893016922779, "grad_norm": 1.0859375, "learning_rate": 0.00048704000375312975, "loss": 5.0523, "mean_token_accuracy": 0.18838894814252855, "num_tokens": 25752396.0, "step": 14845 }, { "entropy": 5.555901765823364, "epoch": 1.1553783310639953, "grad_norm": 1.0703125, "learning_rate": 0.00048703073161355414, "loss": 5.1677, "mean_token_accuracy": 0.18928925544023514, "num_tokens": 25761142.0, "step": 14850 }, { "entropy": 5.453101110458374, "epoch": 1.1557673604357128, "grad_norm": 1.046875, "learning_rate": 0.0004870214562567497, "loss": 5.055, "mean_token_accuracy": 0.18746327310800553, "num_tokens": 25769514.0, "step": 14855 }, { "entropy": 5.4948474884033205, "epoch": 1.1561563898074305, "grad_norm": 1.03125, "learning_rate": 0.000487012177682857, "loss": 5.07, "mean_token_accuracy": 0.19213155806064605, "num_tokens": 25777408.0, "step": 14860 }, { "entropy": 5.442649030685425, "epoch": 1.156545419179148, "grad_norm": 1.1328125, "learning_rate": 0.0004870028958920171, "loss": 5.0459, "mean_token_accuracy": 0.19682677388191222, "num_tokens": 25785646.0, "step": 14865 }, { "entropy": 5.517530345916748, "epoch": 1.1569344485508655, "grad_norm": 1.09375, "learning_rate": 0.0004869936108843706, "loss": 5.1197, "mean_token_accuracy": 0.18943020403385163, "num_tokens": 25794007.0, "step": 14870 }, { "entropy": 5.525943326950073, "epoch": 1.1573234779225832, "grad_norm": 1.0703125, "learning_rate": 0.00048698432266005854, "loss": 5.0436, "mean_token_accuracy": 0.19150779247283936, "num_tokens": 25802765.0, "step": 14875 }, { "entropy": 5.556925439834595, "epoch": 1.1577125072943006, "grad_norm": 1.1015625, "learning_rate": 0.0004869750312192217, "loss": 5.1775, "mean_token_accuracy": 0.18535134494304656, "num_tokens": 25811214.0, "step": 14880 }, { "entropy": 5.5487607479095455, "epoch": 1.1581015366660183, "grad_norm": 1.0234375, "learning_rate": 0.00048696573656200123, "loss": 5.1484, "mean_token_accuracy": 0.18855631053447724, "num_tokens": 25820350.0, "step": 14885 }, { "entropy": 5.532048749923706, "epoch": 1.1584905660377358, "grad_norm": 1.15625, "learning_rate": 0.00048695643868853806, "loss": 5.09, "mean_token_accuracy": 0.1957833781838417, "num_tokens": 25828088.0, "step": 14890 }, { "entropy": 5.490212678909302, "epoch": 1.1588795954094535, "grad_norm": 1.125, "learning_rate": 0.0004869471375989733, "loss": 4.9778, "mean_token_accuracy": 0.20389322191476822, "num_tokens": 25835909.0, "step": 14895 }, { "entropy": 5.397447109222412, "epoch": 1.159268624781171, "grad_norm": 1.1484375, "learning_rate": 0.0004869378332934481, "loss": 5.0485, "mean_token_accuracy": 0.1891705274581909, "num_tokens": 25844360.0, "step": 14900 }, { "entropy": 5.560916185379028, "epoch": 1.1596576541528885, "grad_norm": 1.0546875, "learning_rate": 0.00048692852577210356, "loss": 5.1553, "mean_token_accuracy": 0.18157999217510223, "num_tokens": 25853877.0, "step": 14905 }, { "entropy": 5.536990118026734, "epoch": 1.1600466835246062, "grad_norm": 1.125, "learning_rate": 0.000486919215035081, "loss": 5.0494, "mean_token_accuracy": 0.19584202468395234, "num_tokens": 25862200.0, "step": 14910 }, { "entropy": 5.472499704360962, "epoch": 1.1604357128963236, "grad_norm": 1.0625, "learning_rate": 0.0004869099010825217, "loss": 5.0395, "mean_token_accuracy": 0.18899532407522202, "num_tokens": 25871112.0, "step": 14915 }, { "entropy": 5.516941833496094, "epoch": 1.1608247422680413, "grad_norm": 1.0625, "learning_rate": 0.00048690058391456684, "loss": 5.1853, "mean_token_accuracy": 0.18769947588443756, "num_tokens": 25880135.0, "step": 14920 }, { "entropy": 5.535517263412475, "epoch": 1.1612137716397588, "grad_norm": 1.078125, "learning_rate": 0.0004868912635313579, "loss": 5.106, "mean_token_accuracy": 0.19431759119033815, "num_tokens": 25888609.0, "step": 14925 }, { "entropy": 5.5177491188049315, "epoch": 1.1616028010114763, "grad_norm": 1.03125, "learning_rate": 0.0004868819399330364, "loss": 5.142, "mean_token_accuracy": 0.19021563678979875, "num_tokens": 25897254.0, "step": 14930 }, { "entropy": 5.483691453933716, "epoch": 1.161991830383194, "grad_norm": 1.0703125, "learning_rate": 0.0004868726131197436, "loss": 5.0594, "mean_token_accuracy": 0.19247789978981017, "num_tokens": 25905705.0, "step": 14935 }, { "entropy": 5.540175819396973, "epoch": 1.1623808597549115, "grad_norm": 1.03125, "learning_rate": 0.0004868632830916212, "loss": 5.1156, "mean_token_accuracy": 0.19325001537799835, "num_tokens": 25914066.0, "step": 14940 }, { "entropy": 5.513542413711548, "epoch": 1.1627698891266292, "grad_norm": 1.078125, "learning_rate": 0.0004868539498488106, "loss": 5.1124, "mean_token_accuracy": 0.19137189984321595, "num_tokens": 25922949.0, "step": 14945 }, { "entropy": 5.407134056091309, "epoch": 1.1631589184983466, "grad_norm": 1.109375, "learning_rate": 0.0004868446133914536, "loss": 4.9861, "mean_token_accuracy": 0.1987287536263466, "num_tokens": 25931465.0, "step": 14950 }, { "entropy": 5.533085346221924, "epoch": 1.163547947870064, "grad_norm": 1.171875, "learning_rate": 0.00048683527371969185, "loss": 5.1471, "mean_token_accuracy": 0.18351731300354004, "num_tokens": 25941014.0, "step": 14955 }, { "entropy": 5.472774839401245, "epoch": 1.1639369772417818, "grad_norm": 1.109375, "learning_rate": 0.00048682593083366685, "loss": 4.9968, "mean_token_accuracy": 0.19276792854070662, "num_tokens": 25950275.0, "step": 14960 }, { "entropy": 5.470733547210694, "epoch": 1.1643260066134993, "grad_norm": 1.0546875, "learning_rate": 0.00048681658473352055, "loss": 5.1372, "mean_token_accuracy": 0.1872216582298279, "num_tokens": 25959138.0, "step": 14965 }, { "entropy": 5.500707721710205, "epoch": 1.164715035985217, "grad_norm": 1.1015625, "learning_rate": 0.0004868072354193947, "loss": 5.0041, "mean_token_accuracy": 0.1975340574979782, "num_tokens": 25967221.0, "step": 14970 }, { "entropy": 5.506186151504517, "epoch": 1.1651040653569344, "grad_norm": 1.0625, "learning_rate": 0.0004867978828914312, "loss": 5.1274, "mean_token_accuracy": 0.19114620387554168, "num_tokens": 25976194.0, "step": 14975 }, { "entropy": 5.493287658691406, "epoch": 1.165493094728652, "grad_norm": 0.96484375, "learning_rate": 0.0004867885271497719, "loss": 5.083, "mean_token_accuracy": 0.18937154710292817, "num_tokens": 25985493.0, "step": 14980 }, { "entropy": 5.5221922397613525, "epoch": 1.1658821241003696, "grad_norm": 0.99609375, "learning_rate": 0.0004867791681945588, "loss": 5.0436, "mean_token_accuracy": 0.18729186356067656, "num_tokens": 25994213.0, "step": 14985 }, { "entropy": 5.45524115562439, "epoch": 1.166271153472087, "grad_norm": 0.9609375, "learning_rate": 0.00048676980602593395, "loss": 5.024, "mean_token_accuracy": 0.1994708850979805, "num_tokens": 26003164.0, "step": 14990 }, { "entropy": 5.527252626419068, "epoch": 1.1666601828438048, "grad_norm": 1.0546875, "learning_rate": 0.00048676044064403936, "loss": 5.132, "mean_token_accuracy": 0.18810913264751433, "num_tokens": 26012049.0, "step": 14995 }, { "entropy": 5.599764108657837, "epoch": 1.1670492122155223, "grad_norm": 1.0859375, "learning_rate": 0.0004867510720490171, "loss": 5.226, "mean_token_accuracy": 0.18236998915672303, "num_tokens": 26020466.0, "step": 15000 }, { "epoch": 1.1670492122155223, "eval_entropy": 5.329932477728923, "eval_loss": 5.186277866363525, "eval_mean_token_accuracy": 0.19646807108737735, "eval_num_tokens": 26020466.0, "eval_runtime": 21.6169, "eval_samples_per_second": 1922.481, "eval_steps_per_second": 240.322, "step": 15000 }, { "entropy": 5.480513238906861, "epoch": 1.1674382415872397, "grad_norm": 1.0078125, "learning_rate": 0.0004867417002410094, "loss": 5.0199, "mean_token_accuracy": 0.19585395306348802, "num_tokens": 26028815.0, "step": 15005 }, { "entropy": 5.5738612651824955, "epoch": 1.1678272709589574, "grad_norm": 1.125, "learning_rate": 0.00048673232522015845, "loss": 5.2178, "mean_token_accuracy": 0.1799664780497551, "num_tokens": 26037759.0, "step": 15010 }, { "entropy": 5.53020167350769, "epoch": 1.168216300330675, "grad_norm": 1.0625, "learning_rate": 0.0004867229469866064, "loss": 5.1285, "mean_token_accuracy": 0.1854809492826462, "num_tokens": 26046349.0, "step": 15015 }, { "entropy": 5.531472253799438, "epoch": 1.1686053297023926, "grad_norm": 1.0390625, "learning_rate": 0.0004867135655404956, "loss": 5.1126, "mean_token_accuracy": 0.1962718442082405, "num_tokens": 26055265.0, "step": 15020 }, { "entropy": 5.58563642501831, "epoch": 1.16899435907411, "grad_norm": 1.03125, "learning_rate": 0.00048670418088196844, "loss": 5.0949, "mean_token_accuracy": 0.19200194478034974, "num_tokens": 26064335.0, "step": 15025 }, { "entropy": 5.5082932472229, "epoch": 1.1693833884458276, "grad_norm": 0.99609375, "learning_rate": 0.0004866947930111674, "loss": 5.0345, "mean_token_accuracy": 0.1951890304684639, "num_tokens": 26073044.0, "step": 15030 }, { "entropy": 5.4710108757019045, "epoch": 1.1697724178175453, "grad_norm": 1.0546875, "learning_rate": 0.00048668540192823467, "loss": 5.0675, "mean_token_accuracy": 0.19418762624263763, "num_tokens": 26081361.0, "step": 15035 }, { "entropy": 5.491221284866333, "epoch": 1.1701614471892627, "grad_norm": 1.1640625, "learning_rate": 0.000486676007633313, "loss": 5.0636, "mean_token_accuracy": 0.18852586299180984, "num_tokens": 26089740.0, "step": 15040 }, { "entropy": 5.594570589065552, "epoch": 1.1705504765609804, "grad_norm": 1.1171875, "learning_rate": 0.0004866666101265448, "loss": 5.1506, "mean_token_accuracy": 0.1953522965312004, "num_tokens": 26098906.0, "step": 15045 }, { "entropy": 5.560007476806641, "epoch": 1.170939505932698, "grad_norm": 1.0234375, "learning_rate": 0.00048665720940807274, "loss": 5.1453, "mean_token_accuracy": 0.18652108311653137, "num_tokens": 26107978.0, "step": 15050 }, { "entropy": 5.510354328155517, "epoch": 1.1713285353044154, "grad_norm": 1.109375, "learning_rate": 0.00048664780547803935, "loss": 5.0651, "mean_token_accuracy": 0.1878395050764084, "num_tokens": 26116756.0, "step": 15055 }, { "entropy": 5.606654357910156, "epoch": 1.171717564676133, "grad_norm": 1.03125, "learning_rate": 0.0004866383983365873, "loss": 5.1393, "mean_token_accuracy": 0.18016231507062913, "num_tokens": 26125078.0, "step": 15060 }, { "entropy": 5.5886256217956545, "epoch": 1.1721065940478506, "grad_norm": 1.0625, "learning_rate": 0.00048662898798385956, "loss": 5.1743, "mean_token_accuracy": 0.18876036554574965, "num_tokens": 26134149.0, "step": 15065 }, { "entropy": 5.518652057647705, "epoch": 1.1724956234195683, "grad_norm": 1.125, "learning_rate": 0.00048661957441999875, "loss": 5.042, "mean_token_accuracy": 0.19873350411653518, "num_tokens": 26142789.0, "step": 15070 }, { "entropy": 5.52197494506836, "epoch": 1.1728846527912857, "grad_norm": 1.078125, "learning_rate": 0.00048661015764514765, "loss": 5.1999, "mean_token_accuracy": 0.18363200575113298, "num_tokens": 26151189.0, "step": 15075 }, { "entropy": 5.511305332183838, "epoch": 1.1732736821630034, "grad_norm": 1.0703125, "learning_rate": 0.00048660073765944927, "loss": 5.1067, "mean_token_accuracy": 0.19286916255950928, "num_tokens": 26159495.0, "step": 15080 }, { "entropy": 5.5373022079467775, "epoch": 1.173662711534721, "grad_norm": 1.03125, "learning_rate": 0.0004865913144630465, "loss": 5.0201, "mean_token_accuracy": 0.19567034393548965, "num_tokens": 26167804.0, "step": 15085 }, { "entropy": 5.530536937713623, "epoch": 1.1740517409064384, "grad_norm": 1.0390625, "learning_rate": 0.00048658188805608227, "loss": 5.0611, "mean_token_accuracy": 0.1894535169005394, "num_tokens": 26176240.0, "step": 15090 }, { "entropy": 5.513213062286377, "epoch": 1.174440770278156, "grad_norm": 1.09375, "learning_rate": 0.0004865724584386998, "loss": 5.0847, "mean_token_accuracy": 0.18724654912948607, "num_tokens": 26184580.0, "step": 15095 }, { "entropy": 5.507915210723877, "epoch": 1.1748297996498736, "grad_norm": 1.0625, "learning_rate": 0.0004865630256110418, "loss": 5.1248, "mean_token_accuracy": 0.18831554800271988, "num_tokens": 26193756.0, "step": 15100 }, { "entropy": 5.588959741592407, "epoch": 1.175218829021591, "grad_norm": 1.046875, "learning_rate": 0.00048655358957325174, "loss": 5.1311, "mean_token_accuracy": 0.18903931975364685, "num_tokens": 26201818.0, "step": 15105 }, { "entropy": 5.538612365722656, "epoch": 1.1756078583933087, "grad_norm": 1.0078125, "learning_rate": 0.00048654415032547277, "loss": 5.1929, "mean_token_accuracy": 0.1786503776907921, "num_tokens": 26211817.0, "step": 15110 }, { "entropy": 5.564674282073975, "epoch": 1.1759968877650262, "grad_norm": 1.1171875, "learning_rate": 0.00048653470786784794, "loss": 5.0591, "mean_token_accuracy": 0.1884900912642479, "num_tokens": 26220280.0, "step": 15115 }, { "entropy": 5.464853668212891, "epoch": 1.176385917136744, "grad_norm": 1.09375, "learning_rate": 0.0004865252622005206, "loss": 5.0229, "mean_token_accuracy": 0.2024952307343483, "num_tokens": 26228719.0, "step": 15120 }, { "entropy": 5.555811500549316, "epoch": 1.1767749465084614, "grad_norm": 0.9609375, "learning_rate": 0.00048651581332363405, "loss": 5.1183, "mean_token_accuracy": 0.18898254483938218, "num_tokens": 26237462.0, "step": 15125 }, { "entropy": 5.60301833152771, "epoch": 1.177163975880179, "grad_norm": 1.1328125, "learning_rate": 0.00048650636123733176, "loss": 5.2205, "mean_token_accuracy": 0.18810235410928727, "num_tokens": 26245747.0, "step": 15130 }, { "entropy": 5.605630397796631, "epoch": 1.1775530052518965, "grad_norm": 1.015625, "learning_rate": 0.0004864969059417571, "loss": 5.0901, "mean_token_accuracy": 0.19101844877004623, "num_tokens": 26254977.0, "step": 15135 }, { "entropy": 5.539466381072998, "epoch": 1.177942034623614, "grad_norm": 1.0859375, "learning_rate": 0.0004864874474370534, "loss": 5.2166, "mean_token_accuracy": 0.17965743094682693, "num_tokens": 26264298.0, "step": 15140 }, { "entropy": 5.534178686141968, "epoch": 1.1783310639953317, "grad_norm": 1.0625, "learning_rate": 0.00048647798572336445, "loss": 5.0364, "mean_token_accuracy": 0.1875385969877243, "num_tokens": 26273454.0, "step": 15145 }, { "entropy": 5.56210560798645, "epoch": 1.1787200933670492, "grad_norm": 1.1328125, "learning_rate": 0.00048646852080083355, "loss": 5.1038, "mean_token_accuracy": 0.19017834663391114, "num_tokens": 26282584.0, "step": 15150 }, { "entropy": 5.492873477935791, "epoch": 1.1791091227387667, "grad_norm": 1.1328125, "learning_rate": 0.0004864590526696045, "loss": 5.1248, "mean_token_accuracy": 0.1937950521707535, "num_tokens": 26291633.0, "step": 15155 }, { "entropy": 5.542541360855102, "epoch": 1.1794981521104844, "grad_norm": 1.0625, "learning_rate": 0.00048644958132982094, "loss": 5.1561, "mean_token_accuracy": 0.18743861168622972, "num_tokens": 26300808.0, "step": 15160 }, { "entropy": 5.5259881019592285, "epoch": 1.1798871814822018, "grad_norm": 1.0546875, "learning_rate": 0.00048644010678162644, "loss": 5.0809, "mean_token_accuracy": 0.19857448935508729, "num_tokens": 26308976.0, "step": 15165 }, { "entropy": 5.531348323822021, "epoch": 1.1802762108539195, "grad_norm": 1.109375, "learning_rate": 0.0004864306290251649, "loss": 5.1185, "mean_token_accuracy": 0.18965699821710585, "num_tokens": 26316980.0, "step": 15170 }, { "entropy": 5.4771130084991455, "epoch": 1.180665240225637, "grad_norm": 1.0546875, "learning_rate": 0.00048642114806058014, "loss": 5.0227, "mean_token_accuracy": 0.1983235791325569, "num_tokens": 26325723.0, "step": 15175 }, { "entropy": 5.518423128128052, "epoch": 1.1810542695973547, "grad_norm": 1.0703125, "learning_rate": 0.0004864116638880159, "loss": 5.127, "mean_token_accuracy": 0.18894772827625275, "num_tokens": 26334851.0, "step": 15180 }, { "entropy": 5.553784894943237, "epoch": 1.1814432989690722, "grad_norm": 1.03125, "learning_rate": 0.0004864021765076162, "loss": 5.1302, "mean_token_accuracy": 0.1884858042001724, "num_tokens": 26343696.0, "step": 15185 }, { "entropy": 5.594823932647705, "epoch": 1.1818323283407897, "grad_norm": 1.0625, "learning_rate": 0.00048639268591952494, "loss": 5.239, "mean_token_accuracy": 0.1865934282541275, "num_tokens": 26353054.0, "step": 15190 }, { "entropy": 5.528074264526367, "epoch": 1.1822213577125074, "grad_norm": 1.0, "learning_rate": 0.00048638319212388614, "loss": 5.0743, "mean_token_accuracy": 0.192771714925766, "num_tokens": 26361484.0, "step": 15195 }, { "entropy": 5.565556526184082, "epoch": 1.1826103870842248, "grad_norm": 1.109375, "learning_rate": 0.0004863736951208438, "loss": 5.1747, "mean_token_accuracy": 0.18311811089515687, "num_tokens": 26370402.0, "step": 15200 }, { "entropy": 5.55637674331665, "epoch": 1.1829994164559423, "grad_norm": 1.203125, "learning_rate": 0.00048636419491054217, "loss": 5.2067, "mean_token_accuracy": 0.18172068446874617, "num_tokens": 26378746.0, "step": 15205 }, { "entropy": 5.510645484924316, "epoch": 1.18338844582766, "grad_norm": 1.046875, "learning_rate": 0.0004863546914931252, "loss": 5.097, "mean_token_accuracy": 0.19174145311117172, "num_tokens": 26386984.0, "step": 15210 }, { "entropy": 5.616608428955078, "epoch": 1.1837774751993775, "grad_norm": 1.09375, "learning_rate": 0.0004863451848687373, "loss": 5.205, "mean_token_accuracy": 0.1831534117460251, "num_tokens": 26395712.0, "step": 15215 }, { "entropy": 5.515679025650025, "epoch": 1.1841665045710952, "grad_norm": 0.96484375, "learning_rate": 0.00048633567503752253, "loss": 5.1294, "mean_token_accuracy": 0.18814481496810914, "num_tokens": 26406421.0, "step": 15220 }, { "entropy": 5.577610778808594, "epoch": 1.1845555339428127, "grad_norm": 1.0078125, "learning_rate": 0.0004863261619996253, "loss": 5.1117, "mean_token_accuracy": 0.19249144345521926, "num_tokens": 26416032.0, "step": 15225 }, { "entropy": 5.528250455856323, "epoch": 1.1849445633145304, "grad_norm": 1.140625, "learning_rate": 0.0004863166457551899, "loss": 5.0464, "mean_token_accuracy": 0.1899477243423462, "num_tokens": 26423903.0, "step": 15230 }, { "entropy": 5.516366815567016, "epoch": 1.1853335926862478, "grad_norm": 1.0078125, "learning_rate": 0.0004863071263043608, "loss": 5.1416, "mean_token_accuracy": 0.18995178043842315, "num_tokens": 26432631.0, "step": 15235 }, { "entropy": 5.510300636291504, "epoch": 1.1857226220579653, "grad_norm": 1.015625, "learning_rate": 0.0004862976036472823, "loss": 5.1424, "mean_token_accuracy": 0.19017961174249648, "num_tokens": 26441529.0, "step": 15240 }, { "entropy": 5.520694589614868, "epoch": 1.186111651429683, "grad_norm": 1.09375, "learning_rate": 0.00048628807778409907, "loss": 5.0453, "mean_token_accuracy": 0.19952192306518554, "num_tokens": 26449928.0, "step": 15245 }, { "entropy": 5.533513021469116, "epoch": 1.1865006808014005, "grad_norm": 1.1640625, "learning_rate": 0.0004862785487149555, "loss": 5.0414, "mean_token_accuracy": 0.19683420807123184, "num_tokens": 26458065.0, "step": 15250 }, { "entropy": 5.505167245864868, "epoch": 1.186889710173118, "grad_norm": 1.015625, "learning_rate": 0.0004862690164399963, "loss": 5.0761, "mean_token_accuracy": 0.19265719652175903, "num_tokens": 26466690.0, "step": 15255 }, { "entropy": 5.463815498352051, "epoch": 1.1872787395448356, "grad_norm": 1.09375, "learning_rate": 0.00048625948095936593, "loss": 5.1454, "mean_token_accuracy": 0.18504058718681335, "num_tokens": 26476133.0, "step": 15260 }, { "entropy": 5.574542808532715, "epoch": 1.1876677689165531, "grad_norm": 1.09375, "learning_rate": 0.00048624994227320923, "loss": 5.0879, "mean_token_accuracy": 0.18940395712852479, "num_tokens": 26485151.0, "step": 15265 }, { "entropy": 5.565034103393555, "epoch": 1.1880567982882708, "grad_norm": 0.95703125, "learning_rate": 0.00048624040038167094, "loss": 5.1269, "mean_token_accuracy": 0.19614534974098205, "num_tokens": 26494178.0, "step": 15270 }, { "entropy": 5.540264701843261, "epoch": 1.1884458276599883, "grad_norm": 1.0546875, "learning_rate": 0.00048623085528489584, "loss": 5.1271, "mean_token_accuracy": 0.19830331206321716, "num_tokens": 26503233.0, "step": 15275 }, { "entropy": 5.495055055618286, "epoch": 1.188834857031706, "grad_norm": 0.98046875, "learning_rate": 0.00048622130698302863, "loss": 5.0015, "mean_token_accuracy": 0.2035249039530754, "num_tokens": 26512127.0, "step": 15280 }, { "entropy": 5.529823875427246, "epoch": 1.1892238864034235, "grad_norm": 1.2109375, "learning_rate": 0.00048621175547621426, "loss": 4.9801, "mean_token_accuracy": 0.20683562159538268, "num_tokens": 26520239.0, "step": 15285 }, { "entropy": 5.450815916061401, "epoch": 1.189612915775141, "grad_norm": 1.0859375, "learning_rate": 0.0004862022007645978, "loss": 5.1061, "mean_token_accuracy": 0.18749791085720063, "num_tokens": 26528946.0, "step": 15290 }, { "entropy": 5.522019290924073, "epoch": 1.1900019451468586, "grad_norm": 1.0859375, "learning_rate": 0.00048619264284832403, "loss": 5.116, "mean_token_accuracy": 0.1893162950873375, "num_tokens": 26536825.0, "step": 15295 }, { "entropy": 5.505715370178223, "epoch": 1.1903909745185761, "grad_norm": 1.0234375, "learning_rate": 0.00048618308172753804, "loss": 5.0515, "mean_token_accuracy": 0.19586011469364167, "num_tokens": 26545208.0, "step": 15300 }, { "entropy": 5.516647529602051, "epoch": 1.1907800038902936, "grad_norm": 0.9921875, "learning_rate": 0.0004861735174023849, "loss": 5.0775, "mean_token_accuracy": 0.18922337591648103, "num_tokens": 26553768.0, "step": 15305 }, { "entropy": 5.571810102462768, "epoch": 1.1911690332620113, "grad_norm": 1.09375, "learning_rate": 0.00048616394987300985, "loss": 5.1371, "mean_token_accuracy": 0.19047264456748964, "num_tokens": 26561582.0, "step": 15310 }, { "entropy": 5.475594997406006, "epoch": 1.1915580626337288, "grad_norm": 1.03125, "learning_rate": 0.0004861543791395579, "loss": 5.0583, "mean_token_accuracy": 0.19124651700258255, "num_tokens": 26570632.0, "step": 15315 }, { "entropy": 5.44294490814209, "epoch": 1.1919470920054465, "grad_norm": 1.09375, "learning_rate": 0.0004861448052021743, "loss": 5.0517, "mean_token_accuracy": 0.19586908668279648, "num_tokens": 26579507.0, "step": 15320 }, { "entropy": 5.516498851776123, "epoch": 1.192336121377164, "grad_norm": 1.0546875, "learning_rate": 0.0004861352280610044, "loss": 5.062, "mean_token_accuracy": 0.19176376163959502, "num_tokens": 26588765.0, "step": 15325 }, { "entropy": 5.565378046035766, "epoch": 1.1927251507488816, "grad_norm": 0.98828125, "learning_rate": 0.00048612564771619346, "loss": 5.1224, "mean_token_accuracy": 0.18644469529390334, "num_tokens": 26597529.0, "step": 15330 }, { "entropy": 5.487570953369141, "epoch": 1.193114180120599, "grad_norm": 1.0, "learning_rate": 0.00048611606416788686, "loss": 5.069, "mean_token_accuracy": 0.19458499997854234, "num_tokens": 26605960.0, "step": 15335 }, { "entropy": 5.471058416366577, "epoch": 1.1935032094923166, "grad_norm": 1.125, "learning_rate": 0.00048610647741622996, "loss": 4.9971, "mean_token_accuracy": 0.20210601538419723, "num_tokens": 26614435.0, "step": 15340 }, { "entropy": 5.4962750434875485, "epoch": 1.1938922388640343, "grad_norm": 1.03125, "learning_rate": 0.0004860968874613683, "loss": 5.1025, "mean_token_accuracy": 0.19188037812709807, "num_tokens": 26622873.0, "step": 15345 }, { "entropy": 5.470158529281616, "epoch": 1.1942812682357518, "grad_norm": 1.0859375, "learning_rate": 0.0004860872943034474, "loss": 5.026, "mean_token_accuracy": 0.1940719574689865, "num_tokens": 26631529.0, "step": 15350 }, { "entropy": 5.567518281936645, "epoch": 1.1946702976074695, "grad_norm": 1.125, "learning_rate": 0.0004860776979426128, "loss": 5.1403, "mean_token_accuracy": 0.18428453505039216, "num_tokens": 26639466.0, "step": 15355 }, { "entropy": 5.44932370185852, "epoch": 1.195059326979187, "grad_norm": 1.015625, "learning_rate": 0.0004860680983790101, "loss": 5.074, "mean_token_accuracy": 0.19130207151174544, "num_tokens": 26648329.0, "step": 15360 }, { "entropy": 5.492851400375367, "epoch": 1.1954483563509044, "grad_norm": 1.0, "learning_rate": 0.0004860584956127849, "loss": 5.0205, "mean_token_accuracy": 0.19275826811790467, "num_tokens": 26656899.0, "step": 15365 }, { "entropy": 5.601548337936402, "epoch": 1.195837385722622, "grad_norm": 1.140625, "learning_rate": 0.00048604888964408306, "loss": 5.2444, "mean_token_accuracy": 0.18211142122745513, "num_tokens": 26666155.0, "step": 15370 }, { "entropy": 5.494016504287719, "epoch": 1.1962264150943396, "grad_norm": 0.98828125, "learning_rate": 0.0004860392804730502, "loss": 5.0362, "mean_token_accuracy": 0.19987549036741256, "num_tokens": 26675567.0, "step": 15375 }, { "entropy": 5.487957572937011, "epoch": 1.1966154444660573, "grad_norm": 1.03125, "learning_rate": 0.00048602966809983204, "loss": 5.0687, "mean_token_accuracy": 0.19333745390176774, "num_tokens": 26684133.0, "step": 15380 }, { "entropy": 5.504514074325561, "epoch": 1.1970044738377748, "grad_norm": 1.0703125, "learning_rate": 0.0004860200525245746, "loss": 5.2034, "mean_token_accuracy": 0.1821175366640091, "num_tokens": 26692746.0, "step": 15385 }, { "entropy": 5.550463724136352, "epoch": 1.1973935032094922, "grad_norm": 1.03125, "learning_rate": 0.0004860104337474239, "loss": 5.0899, "mean_token_accuracy": 0.19578700959682466, "num_tokens": 26701887.0, "step": 15390 }, { "entropy": 5.511364984512329, "epoch": 1.19778253258121, "grad_norm": 0.9921875, "learning_rate": 0.00048600081176852555, "loss": 5.0785, "mean_token_accuracy": 0.1885529413819313, "num_tokens": 26710346.0, "step": 15395 }, { "entropy": 5.456073474884033, "epoch": 1.1981715619529274, "grad_norm": 1.1328125, "learning_rate": 0.00048599118658802575, "loss": 4.9958, "mean_token_accuracy": 0.1977296382188797, "num_tokens": 26718775.0, "step": 15400 }, { "entropy": 5.456609630584717, "epoch": 1.198560591324645, "grad_norm": 1.1875, "learning_rate": 0.0004859815582060706, "loss": 5.0628, "mean_token_accuracy": 0.19501098841428757, "num_tokens": 26726683.0, "step": 15405 }, { "entropy": 5.455552768707276, "epoch": 1.1989496206963626, "grad_norm": 1.1015625, "learning_rate": 0.0004859719266228061, "loss": 5.0672, "mean_token_accuracy": 0.19661179929971695, "num_tokens": 26735450.0, "step": 15410 }, { "entropy": 5.504584646224975, "epoch": 1.19933865006808, "grad_norm": 1.0859375, "learning_rate": 0.0004859622918383784, "loss": 5.0254, "mean_token_accuracy": 0.19497980624437333, "num_tokens": 26744006.0, "step": 15415 }, { "entropy": 5.431109952926636, "epoch": 1.1997276794397977, "grad_norm": 1.0234375, "learning_rate": 0.0004859526538529337, "loss": 4.968, "mean_token_accuracy": 0.20158248394727707, "num_tokens": 26751964.0, "step": 15420 }, { "entropy": 5.418235111236572, "epoch": 1.2001167088115152, "grad_norm": 1.0625, "learning_rate": 0.0004859430126666182, "loss": 5.0312, "mean_token_accuracy": 0.19649730771780013, "num_tokens": 26760766.0, "step": 15425 }, { "entropy": 5.436412143707275, "epoch": 1.200505738183233, "grad_norm": 1.109375, "learning_rate": 0.00048593336827957824, "loss": 5.036, "mean_token_accuracy": 0.1922243893146515, "num_tokens": 26769663.0, "step": 15430 }, { "entropy": 5.586335134506226, "epoch": 1.2008947675549504, "grad_norm": 1.1015625, "learning_rate": 0.00048592372069196024, "loss": 5.2503, "mean_token_accuracy": 0.17844171375036239, "num_tokens": 26778693.0, "step": 15435 }, { "entropy": 5.502740812301636, "epoch": 1.2012837969266679, "grad_norm": 1.140625, "learning_rate": 0.0004859140699039104, "loss": 5.0045, "mean_token_accuracy": 0.2027219533920288, "num_tokens": 26787368.0, "step": 15440 }, { "entropy": 5.4330222606658936, "epoch": 1.2016728262983856, "grad_norm": 1.1015625, "learning_rate": 0.00048590441591557526, "loss": 4.9941, "mean_token_accuracy": 0.203091761469841, "num_tokens": 26795559.0, "step": 15445 }, { "entropy": 5.401363325119019, "epoch": 1.202061855670103, "grad_norm": 1.0625, "learning_rate": 0.00048589475872710134, "loss": 4.9914, "mean_token_accuracy": 0.19810205996036528, "num_tokens": 26803657.0, "step": 15450 }, { "entropy": 5.568800449371338, "epoch": 1.2024508850418207, "grad_norm": 1.0703125, "learning_rate": 0.0004858850983386351, "loss": 5.1685, "mean_token_accuracy": 0.18582686334848403, "num_tokens": 26812214.0, "step": 15455 }, { "entropy": 5.532809734344482, "epoch": 1.2028399144135382, "grad_norm": 1.078125, "learning_rate": 0.0004858754347503231, "loss": 5.0053, "mean_token_accuracy": 0.20732153356075286, "num_tokens": 26820591.0, "step": 15460 }, { "entropy": 5.480284786224365, "epoch": 1.203228943785256, "grad_norm": 1.109375, "learning_rate": 0.00048586576796231216, "loss": 5.1104, "mean_token_accuracy": 0.1892881751060486, "num_tokens": 26829228.0, "step": 15465 }, { "entropy": 5.563753271102906, "epoch": 1.2036179731569734, "grad_norm": 1.015625, "learning_rate": 0.0004858560979747487, "loss": 5.2508, "mean_token_accuracy": 0.18030787408351898, "num_tokens": 26838083.0, "step": 15470 }, { "entropy": 5.467254209518432, "epoch": 1.2040070025286909, "grad_norm": 1.0546875, "learning_rate": 0.00048584642478777967, "loss": 4.9583, "mean_token_accuracy": 0.19409282207489015, "num_tokens": 26846796.0, "step": 15475 }, { "entropy": 5.4810339450836185, "epoch": 1.2043960319004086, "grad_norm": 1.109375, "learning_rate": 0.0004858367484015517, "loss": 5.0635, "mean_token_accuracy": 0.1933770462870598, "num_tokens": 26854874.0, "step": 15480 }, { "entropy": 5.459551620483398, "epoch": 1.204785061272126, "grad_norm": 1.0546875, "learning_rate": 0.00048582706881621166, "loss": 5.0935, "mean_token_accuracy": 0.1936516746878624, "num_tokens": 26863040.0, "step": 15485 }, { "entropy": 5.495594930648804, "epoch": 1.2051740906438435, "grad_norm": 1.125, "learning_rate": 0.0004858173860319063, "loss": 5.0831, "mean_token_accuracy": 0.18859415203332902, "num_tokens": 26872183.0, "step": 15490 }, { "entropy": 5.532269477844238, "epoch": 1.2055631200155612, "grad_norm": 1.078125, "learning_rate": 0.00048580770004878277, "loss": 5.0662, "mean_token_accuracy": 0.19159892052412034, "num_tokens": 26880480.0, "step": 15495 }, { "entropy": 5.509319686889649, "epoch": 1.2059521493872787, "grad_norm": 1.078125, "learning_rate": 0.0004857980108669879, "loss": 5.0764, "mean_token_accuracy": 0.19735469967126845, "num_tokens": 26888855.0, "step": 15500 }, { "entropy": 5.4537389278411865, "epoch": 1.2063411787589964, "grad_norm": 1.0546875, "learning_rate": 0.00048578831848666875, "loss": 5.0949, "mean_token_accuracy": 0.18964005261659622, "num_tokens": 26897692.0, "step": 15505 }, { "entropy": 5.503056430816651, "epoch": 1.2067302081307139, "grad_norm": 1.0390625, "learning_rate": 0.00048577862290797235, "loss": 5.045, "mean_token_accuracy": 0.1961729496717453, "num_tokens": 26906502.0, "step": 15510 }, { "entropy": 5.558231449127197, "epoch": 1.2071192375024316, "grad_norm": 1.0546875, "learning_rate": 0.00048576892413104586, "loss": 5.0992, "mean_token_accuracy": 0.18913668543100357, "num_tokens": 26915246.0, "step": 15515 }, { "entropy": 5.589589262008667, "epoch": 1.207508266874149, "grad_norm": 1.0390625, "learning_rate": 0.0004857592221560364, "loss": 5.1973, "mean_token_accuracy": 0.1923789769411087, "num_tokens": 26923901.0, "step": 15520 }, { "entropy": 5.532759666442871, "epoch": 1.2078972962458665, "grad_norm": 1.0390625, "learning_rate": 0.0004857495169830912, "loss": 5.2637, "mean_token_accuracy": 0.18820541352033615, "num_tokens": 26933246.0, "step": 15525 }, { "entropy": 5.491713190078736, "epoch": 1.2082863256175842, "grad_norm": 1.1171875, "learning_rate": 0.0004857398086123575, "loss": 5.104, "mean_token_accuracy": 0.19127236753702165, "num_tokens": 26941938.0, "step": 15530 }, { "entropy": 5.503941345214844, "epoch": 1.2086753549893017, "grad_norm": 1.0859375, "learning_rate": 0.0004857300970439827, "loss": 5.0773, "mean_token_accuracy": 0.19243601113557815, "num_tokens": 26949967.0, "step": 15535 }, { "entropy": 5.518694543838501, "epoch": 1.2090643843610192, "grad_norm": 1.078125, "learning_rate": 0.00048572038227811404, "loss": 5.1317, "mean_token_accuracy": 0.18654175400733947, "num_tokens": 26958743.0, "step": 15540 }, { "entropy": 5.578905725479126, "epoch": 1.2094534137327368, "grad_norm": 1.140625, "learning_rate": 0.000485710664314899, "loss": 5.1422, "mean_token_accuracy": 0.1924021914601326, "num_tokens": 26967338.0, "step": 15545 }, { "entropy": 5.46150164604187, "epoch": 1.2098424431044543, "grad_norm": 1.0390625, "learning_rate": 0.000485700943154485, "loss": 5.0057, "mean_token_accuracy": 0.1998730793595314, "num_tokens": 26976182.0, "step": 15550 }, { "entropy": 5.506616020202637, "epoch": 1.210231472476172, "grad_norm": 1.0078125, "learning_rate": 0.0004856912187970195, "loss": 5.1688, "mean_token_accuracy": 0.1887744352221489, "num_tokens": 26984275.0, "step": 15555 }, { "entropy": 5.597248268127442, "epoch": 1.2106205018478895, "grad_norm": 1.1171875, "learning_rate": 0.0004856814912426502, "loss": 5.112, "mean_token_accuracy": 0.19341277629137038, "num_tokens": 26991891.0, "step": 15560 }, { "entropy": 5.508917713165284, "epoch": 1.2110095312196072, "grad_norm": 1.0546875, "learning_rate": 0.0004856717604915245, "loss": 5.0404, "mean_token_accuracy": 0.19382100254297258, "num_tokens": 27000390.0, "step": 15565 }, { "entropy": 5.3639343738555905, "epoch": 1.2113985605913247, "grad_norm": 1.0390625, "learning_rate": 0.0004856620265437902, "loss": 5.031, "mean_token_accuracy": 0.20452607572078704, "num_tokens": 27009348.0, "step": 15570 }, { "entropy": 5.478391838073731, "epoch": 1.2117875899630421, "grad_norm": 1.1640625, "learning_rate": 0.000485652289399595, "loss": 5.1043, "mean_token_accuracy": 0.19117604345083236, "num_tokens": 27017529.0, "step": 15575 }, { "entropy": 5.57307186126709, "epoch": 1.2121766193347598, "grad_norm": 1.046875, "learning_rate": 0.00048564254905908655, "loss": 5.1043, "mean_token_accuracy": 0.1927064135670662, "num_tokens": 27026238.0, "step": 15580 }, { "entropy": 5.508968496322632, "epoch": 1.2125656487064773, "grad_norm": 0.9921875, "learning_rate": 0.00048563280552241266, "loss": 5.0178, "mean_token_accuracy": 0.19805500507354737, "num_tokens": 27034995.0, "step": 15585 }, { "entropy": 5.661742353439331, "epoch": 1.2129546780781948, "grad_norm": 1.03125, "learning_rate": 0.0004856230587897212, "loss": 5.214, "mean_token_accuracy": 0.18510347753763198, "num_tokens": 27043631.0, "step": 15590 }, { "entropy": 5.509140110015869, "epoch": 1.2133437074499125, "grad_norm": 1.046875, "learning_rate": 0.0004856133088611602, "loss": 5.0819, "mean_token_accuracy": 0.19837187528610228, "num_tokens": 27052491.0, "step": 15595 }, { "entropy": 5.502847194671631, "epoch": 1.21373273682163, "grad_norm": 0.9921875, "learning_rate": 0.0004856035557368773, "loss": 5.0828, "mean_token_accuracy": 0.19442769140005112, "num_tokens": 27061056.0, "step": 15600 }, { "entropy": 5.475577783584595, "epoch": 1.2141217661933477, "grad_norm": 1.0625, "learning_rate": 0.00048559379941702074, "loss": 5.0588, "mean_token_accuracy": 0.19867753088474274, "num_tokens": 27069562.0, "step": 15605 }, { "entropy": 5.525039768218994, "epoch": 1.2145107955650651, "grad_norm": 1.1171875, "learning_rate": 0.00048558403990173844, "loss": 5.0778, "mean_token_accuracy": 0.1984847828745842, "num_tokens": 27077814.0, "step": 15610 }, { "entropy": 5.491538763046265, "epoch": 1.2148998249367828, "grad_norm": 1.0078125, "learning_rate": 0.00048557427719117855, "loss": 4.9744, "mean_token_accuracy": 0.1976167753338814, "num_tokens": 27086515.0, "step": 15615 }, { "entropy": 5.5227254867553714, "epoch": 1.2152888543085003, "grad_norm": 0.984375, "learning_rate": 0.0004855645112854891, "loss": 5.0978, "mean_token_accuracy": 0.19671235829591752, "num_tokens": 27095759.0, "step": 15620 }, { "entropy": 5.466131353378296, "epoch": 1.2156778836802178, "grad_norm": 1.0390625, "learning_rate": 0.0004855547421848184, "loss": 5.1172, "mean_token_accuracy": 0.18708136975765227, "num_tokens": 27104921.0, "step": 15625 }, { "entropy": 5.533009767532349, "epoch": 1.2160669130519355, "grad_norm": 1.078125, "learning_rate": 0.00048554496988931456, "loss": 5.0938, "mean_token_accuracy": 0.1958862364292145, "num_tokens": 27113876.0, "step": 15630 }, { "entropy": 5.556259632110596, "epoch": 1.216455942423653, "grad_norm": 1.09375, "learning_rate": 0.00048553519439912597, "loss": 4.9871, "mean_token_accuracy": 0.1973464697599411, "num_tokens": 27121654.0, "step": 15635 }, { "entropy": 5.4390754222869875, "epoch": 1.2168449717953704, "grad_norm": 1.15625, "learning_rate": 0.0004855254157144009, "loss": 5.0281, "mean_token_accuracy": 0.2032873034477234, "num_tokens": 27130156.0, "step": 15640 }, { "entropy": 5.534083080291748, "epoch": 1.2172340011670881, "grad_norm": 1.0625, "learning_rate": 0.0004855156338352877, "loss": 5.1296, "mean_token_accuracy": 0.18470921665430068, "num_tokens": 27138646.0, "step": 15645 }, { "entropy": 5.495508289337158, "epoch": 1.2176230305388056, "grad_norm": 1.0234375, "learning_rate": 0.00048550584876193493, "loss": 5.1049, "mean_token_accuracy": 0.19813506454229354, "num_tokens": 27147282.0, "step": 15650 }, { "entropy": 5.466199111938477, "epoch": 1.2180120599105233, "grad_norm": 1.0390625, "learning_rate": 0.00048549606049449085, "loss": 5.007, "mean_token_accuracy": 0.18703172355890274, "num_tokens": 27156238.0, "step": 15655 }, { "entropy": 5.525760078430176, "epoch": 1.2184010892822408, "grad_norm": 1.171875, "learning_rate": 0.0004854862690331041, "loss": 5.116, "mean_token_accuracy": 0.19308805018663405, "num_tokens": 27164936.0, "step": 15660 }, { "entropy": 5.5103904724121096, "epoch": 1.2187901186539585, "grad_norm": 1.0625, "learning_rate": 0.00048547647437792327, "loss": 5.0815, "mean_token_accuracy": 0.19793317019939421, "num_tokens": 27173362.0, "step": 15665 }, { "entropy": 5.450714445114135, "epoch": 1.219179148025676, "grad_norm": 1.1328125, "learning_rate": 0.000485466676529097, "loss": 5.0375, "mean_token_accuracy": 0.19743679612874984, "num_tokens": 27181611.0, "step": 15670 }, { "entropy": 5.554260873794556, "epoch": 1.2195681773973934, "grad_norm": 1.03125, "learning_rate": 0.00048545687548677373, "loss": 5.0927, "mean_token_accuracy": 0.19315378963947297, "num_tokens": 27189593.0, "step": 15675 }, { "entropy": 5.494616556167602, "epoch": 1.2199572067691111, "grad_norm": 1.078125, "learning_rate": 0.0004854470712511025, "loss": 5.0066, "mean_token_accuracy": 0.19895923435688018, "num_tokens": 27198006.0, "step": 15680 }, { "entropy": 5.526042175292969, "epoch": 1.2203462361408286, "grad_norm": 1.0078125, "learning_rate": 0.00048543726382223193, "loss": 5.1122, "mean_token_accuracy": 0.19257076680660248, "num_tokens": 27206846.0, "step": 15685 }, { "entropy": 5.48376054763794, "epoch": 1.220735265512546, "grad_norm": 1.1171875, "learning_rate": 0.00048542745320031075, "loss": 5.0825, "mean_token_accuracy": 0.1935785099864006, "num_tokens": 27214838.0, "step": 15690 }, { "entropy": 5.534935998916626, "epoch": 1.2211242948842638, "grad_norm": 0.95703125, "learning_rate": 0.00048541763938548795, "loss": 5.1582, "mean_token_accuracy": 0.1871696963906288, "num_tokens": 27224161.0, "step": 15695 }, { "entropy": 5.4718225479125975, "epoch": 1.2215133242559812, "grad_norm": 1.0078125, "learning_rate": 0.00048540782237791244, "loss": 5.0045, "mean_token_accuracy": 0.19052459448575973, "num_tokens": 27233084.0, "step": 15700 }, { "entropy": 5.615234136581421, "epoch": 1.221902353627699, "grad_norm": 1.03125, "learning_rate": 0.00048539800217773293, "loss": 5.1873, "mean_token_accuracy": 0.1825664982199669, "num_tokens": 27242219.0, "step": 15705 }, { "entropy": 5.573900556564331, "epoch": 1.2222913829994164, "grad_norm": 0.99609375, "learning_rate": 0.0004853881787850988, "loss": 5.1495, "mean_token_accuracy": 0.18690368235111238, "num_tokens": 27250411.0, "step": 15710 }, { "entropy": 5.572699117660522, "epoch": 1.2226804123711341, "grad_norm": 0.98046875, "learning_rate": 0.00048537835220015886, "loss": 5.1604, "mean_token_accuracy": 0.1880160689353943, "num_tokens": 27259472.0, "step": 15715 }, { "entropy": 5.525761842727661, "epoch": 1.2230694417428516, "grad_norm": 1.0625, "learning_rate": 0.0004853685224230623, "loss": 5.0584, "mean_token_accuracy": 0.19142059087753296, "num_tokens": 27267922.0, "step": 15720 }, { "entropy": 5.504515695571899, "epoch": 1.223458471114569, "grad_norm": 1.1015625, "learning_rate": 0.00048535868945395825, "loss": 5.1346, "mean_token_accuracy": 0.19476194083690643, "num_tokens": 27277129.0, "step": 15725 }, { "entropy": 5.539493179321289, "epoch": 1.2238475004862868, "grad_norm": 1.0390625, "learning_rate": 0.00048534885329299586, "loss": 5.1341, "mean_token_accuracy": 0.1910548061132431, "num_tokens": 27285583.0, "step": 15730 }, { "entropy": 5.517236614227295, "epoch": 1.2242365298580042, "grad_norm": 1.03125, "learning_rate": 0.0004853390139403245, "loss": 5.0111, "mean_token_accuracy": 0.19887073636054992, "num_tokens": 27294292.0, "step": 15735 }, { "entropy": 5.548151731491089, "epoch": 1.224625559229722, "grad_norm": 1.0, "learning_rate": 0.00048532917139609334, "loss": 5.2115, "mean_token_accuracy": 0.18311837911605836, "num_tokens": 27302606.0, "step": 15740 }, { "entropy": 5.571416425704956, "epoch": 1.2250145886014394, "grad_norm": 1.0703125, "learning_rate": 0.0004853193256604518, "loss": 5.0719, "mean_token_accuracy": 0.19457923173904418, "num_tokens": 27311103.0, "step": 15745 }, { "entropy": 5.600906944274902, "epoch": 1.2254036179731569, "grad_norm": 1.1015625, "learning_rate": 0.00048530947673354924, "loss": 5.0849, "mean_token_accuracy": 0.19528105556964875, "num_tokens": 27319497.0, "step": 15750 }, { "entropy": 5.52592921257019, "epoch": 1.2257926473448746, "grad_norm": 1.0390625, "learning_rate": 0.0004852996246155351, "loss": 5.1223, "mean_token_accuracy": 0.190476293861866, "num_tokens": 27328367.0, "step": 15755 }, { "entropy": 5.488488674163818, "epoch": 1.226181676716592, "grad_norm": 1.0625, "learning_rate": 0.00048528976930655896, "loss": 5.0184, "mean_token_accuracy": 0.19560428112745284, "num_tokens": 27336797.0, "step": 15760 }, { "entropy": 5.443496036529541, "epoch": 1.2265707060883098, "grad_norm": 1.125, "learning_rate": 0.00048527991080677015, "loss": 4.9871, "mean_token_accuracy": 0.19532183706760406, "num_tokens": 27345052.0, "step": 15765 }, { "entropy": 5.49208664894104, "epoch": 1.2269597354600272, "grad_norm": 1.0234375, "learning_rate": 0.00048527004911631843, "loss": 5.0234, "mean_token_accuracy": 0.19890934675931932, "num_tokens": 27353062.0, "step": 15770 }, { "entropy": 5.516704082489014, "epoch": 1.2273487648317447, "grad_norm": 1.1015625, "learning_rate": 0.0004852601842353534, "loss": 5.0677, "mean_token_accuracy": 0.19440712332725524, "num_tokens": 27361471.0, "step": 15775 }, { "entropy": 5.588078212738037, "epoch": 1.2277377942034624, "grad_norm": 1.1171875, "learning_rate": 0.00048525031616402476, "loss": 5.147, "mean_token_accuracy": 0.18788925558328629, "num_tokens": 27370655.0, "step": 15780 }, { "entropy": 5.457858610153198, "epoch": 1.2281268235751799, "grad_norm": 1.078125, "learning_rate": 0.00048524044490248227, "loss": 4.9746, "mean_token_accuracy": 0.20198841094970704, "num_tokens": 27379329.0, "step": 15785 }, { "entropy": 5.508167695999146, "epoch": 1.2285158529468976, "grad_norm": 0.99609375, "learning_rate": 0.00048523057045087557, "loss": 5.1093, "mean_token_accuracy": 0.1935787484049797, "num_tokens": 27388864.0, "step": 15790 }, { "entropy": 5.571814060211182, "epoch": 1.228904882318615, "grad_norm": 1.0703125, "learning_rate": 0.00048522069280935466, "loss": 5.2163, "mean_token_accuracy": 0.17617049366235732, "num_tokens": 27397804.0, "step": 15795 }, { "entropy": 5.499347925186157, "epoch": 1.2292939116903325, "grad_norm": 1.046875, "learning_rate": 0.0004852108119780693, "loss": 5.0749, "mean_token_accuracy": 0.19162189662456514, "num_tokens": 27406578.0, "step": 15800 }, { "entropy": 5.525623083114624, "epoch": 1.2296829410620502, "grad_norm": 1.0703125, "learning_rate": 0.0004852009279571694, "loss": 5.1673, "mean_token_accuracy": 0.17955310940742492, "num_tokens": 27415207.0, "step": 15805 }, { "entropy": 5.5222162246704105, "epoch": 1.2300719704337677, "grad_norm": 1.0625, "learning_rate": 0.000485191040746805, "loss": 5.0935, "mean_token_accuracy": 0.18948321044445038, "num_tokens": 27424201.0, "step": 15810 }, { "entropy": 5.510312604904175, "epoch": 1.2304609998054854, "grad_norm": 1.078125, "learning_rate": 0.0004851811503471262, "loss": 5.0848, "mean_token_accuracy": 0.19763860404491423, "num_tokens": 27433187.0, "step": 15815 }, { "entropy": 5.472635746002197, "epoch": 1.2308500291772029, "grad_norm": 1.0703125, "learning_rate": 0.00048517125675828294, "loss": 5.0773, "mean_token_accuracy": 0.1927423283457756, "num_tokens": 27441976.0, "step": 15820 }, { "entropy": 5.508187103271484, "epoch": 1.2312390585489204, "grad_norm": 1.1328125, "learning_rate": 0.00048516135998042536, "loss": 5.0217, "mean_token_accuracy": 0.19593120217323304, "num_tokens": 27450235.0, "step": 15825 }, { "entropy": 5.586695194244385, "epoch": 1.231628087920638, "grad_norm": 1.1640625, "learning_rate": 0.0004851514600137037, "loss": 5.1988, "mean_token_accuracy": 0.18321099430322646, "num_tokens": 27458842.0, "step": 15830 }, { "entropy": 5.560409832000732, "epoch": 1.2320171172923555, "grad_norm": 1.0625, "learning_rate": 0.00048514155685826807, "loss": 5.1507, "mean_token_accuracy": 0.18796542584896087, "num_tokens": 27467383.0, "step": 15835 }, { "entropy": 5.483258676528931, "epoch": 1.2324061466640732, "grad_norm": 1.0703125, "learning_rate": 0.0004851316505142688, "loss": 5.1268, "mean_token_accuracy": 0.19038283228874206, "num_tokens": 27475811.0, "step": 15840 }, { "entropy": 5.617285680770874, "epoch": 1.2327951760357907, "grad_norm": 1.1171875, "learning_rate": 0.00048512174098185615, "loss": 5.2331, "mean_token_accuracy": 0.17855102121829985, "num_tokens": 27484032.0, "step": 15845 }, { "entropy": 5.497793436050415, "epoch": 1.2331842054075082, "grad_norm": 1.0078125, "learning_rate": 0.00048511182826118055, "loss": 4.9364, "mean_token_accuracy": 0.20420813411474228, "num_tokens": 27492330.0, "step": 15850 }, { "entropy": 5.407047176361084, "epoch": 1.2335732347792259, "grad_norm": 1.0859375, "learning_rate": 0.00048510191235239246, "loss": 5.0467, "mean_token_accuracy": 0.19207225292921065, "num_tokens": 27501042.0, "step": 15855 }, { "entropy": 5.479779291152954, "epoch": 1.2339622641509433, "grad_norm": 1.0, "learning_rate": 0.00048509199325564217, "loss": 5.0076, "mean_token_accuracy": 0.20255275219678878, "num_tokens": 27509939.0, "step": 15860 }, { "entropy": 5.561983585357666, "epoch": 1.234351293522661, "grad_norm": 1.1640625, "learning_rate": 0.0004850820709710803, "loss": 5.2136, "mean_token_accuracy": 0.18196885138750077, "num_tokens": 27518653.0, "step": 15865 }, { "entropy": 5.543953227996826, "epoch": 1.2347403228943785, "grad_norm": 1.03125, "learning_rate": 0.0004850721454988574, "loss": 5.0672, "mean_token_accuracy": 0.19479638934135438, "num_tokens": 27526856.0, "step": 15870 }, { "entropy": 5.479846334457397, "epoch": 1.235129352266096, "grad_norm": 1.0078125, "learning_rate": 0.00048506221683912405, "loss": 5.0194, "mean_token_accuracy": 0.1993668258190155, "num_tokens": 27535205.0, "step": 15875 }, { "entropy": 5.564943265914917, "epoch": 1.2355183816378137, "grad_norm": 1.046875, "learning_rate": 0.0004850522849920309, "loss": 5.1001, "mean_token_accuracy": 0.19395292401313782, "num_tokens": 27543516.0, "step": 15880 }, { "entropy": 5.5369329929351805, "epoch": 1.2359074110095312, "grad_norm": 1.0390625, "learning_rate": 0.00048504234995772863, "loss": 5.1389, "mean_token_accuracy": 0.191159488260746, "num_tokens": 27552136.0, "step": 15885 }, { "entropy": 5.493728351593018, "epoch": 1.2362964403812489, "grad_norm": 1.046875, "learning_rate": 0.0004850324117363681, "loss": 5.1096, "mean_token_accuracy": 0.20237928181886672, "num_tokens": 27560805.0, "step": 15890 }, { "entropy": 5.4804527759552, "epoch": 1.2366854697529663, "grad_norm": 1.203125, "learning_rate": 0.00048502247032809997, "loss": 5.0511, "mean_token_accuracy": 0.19546723663806914, "num_tokens": 27569643.0, "step": 15895 }, { "entropy": 5.496455383300781, "epoch": 1.237074499124684, "grad_norm": 1.03125, "learning_rate": 0.0004850125257330751, "loss": 4.9868, "mean_token_accuracy": 0.19248251765966415, "num_tokens": 27578506.0, "step": 15900 }, { "entropy": 5.483917236328125, "epoch": 1.2374635284964015, "grad_norm": 1.0234375, "learning_rate": 0.00048500257795144446, "loss": 5.0872, "mean_token_accuracy": 0.18849294781684875, "num_tokens": 27586911.0, "step": 15905 }, { "entropy": 5.527110004425049, "epoch": 1.237852557868119, "grad_norm": 1.0078125, "learning_rate": 0.000484992626983359, "loss": 5.1295, "mean_token_accuracy": 0.19112122058868408, "num_tokens": 27595112.0, "step": 15910 }, { "entropy": 5.547062063217163, "epoch": 1.2382415872398367, "grad_norm": 1.09375, "learning_rate": 0.0004849826728289696, "loss": 5.1316, "mean_token_accuracy": 0.18103449940681457, "num_tokens": 27603923.0, "step": 15915 }, { "entropy": 5.431937837600708, "epoch": 1.2386306166115542, "grad_norm": 1.0625, "learning_rate": 0.00048497271548842737, "loss": 4.9555, "mean_token_accuracy": 0.20526473671197892, "num_tokens": 27612705.0, "step": 15920 }, { "entropy": 5.499823951721192, "epoch": 1.2390196459832716, "grad_norm": 1.0, "learning_rate": 0.0004849627549618834, "loss": 5.0697, "mean_token_accuracy": 0.2005009189248085, "num_tokens": 27621858.0, "step": 15925 }, { "entropy": 5.56005630493164, "epoch": 1.2394086753549893, "grad_norm": 1.109375, "learning_rate": 0.00048495279124948886, "loss": 5.164, "mean_token_accuracy": 0.19136350154876708, "num_tokens": 27629977.0, "step": 15930 }, { "entropy": 5.5735612392425535, "epoch": 1.2397977047267068, "grad_norm": 1.1484375, "learning_rate": 0.0004849428243513948, "loss": 5.1066, "mean_token_accuracy": 0.19525932967662812, "num_tokens": 27638433.0, "step": 15935 }, { "entropy": 5.476744174957275, "epoch": 1.2401867340984245, "grad_norm": 1.140625, "learning_rate": 0.00048493285426775255, "loss": 5.0164, "mean_token_accuracy": 0.1977951258420944, "num_tokens": 27647116.0, "step": 15940 }, { "entropy": 5.483206129074096, "epoch": 1.240575763470142, "grad_norm": 1.078125, "learning_rate": 0.0004849228809987135, "loss": 5.0926, "mean_token_accuracy": 0.18809377998113633, "num_tokens": 27655598.0, "step": 15945 }, { "entropy": 5.615751791000366, "epoch": 1.2409647928418597, "grad_norm": 1.109375, "learning_rate": 0.0004849129045444288, "loss": 5.1929, "mean_token_accuracy": 0.18551104068756102, "num_tokens": 27664308.0, "step": 15950 }, { "entropy": 5.428598785400391, "epoch": 1.2413538222135772, "grad_norm": 1.046875, "learning_rate": 0.0004849029249050498, "loss": 4.9421, "mean_token_accuracy": 0.20628394633531572, "num_tokens": 27672808.0, "step": 15955 }, { "entropy": 5.530725145339966, "epoch": 1.2417428515852946, "grad_norm": 1.015625, "learning_rate": 0.00048489294208072805, "loss": 5.1726, "mean_token_accuracy": 0.1894150659441948, "num_tokens": 27681091.0, "step": 15960 }, { "entropy": 5.498185873031616, "epoch": 1.2421318809570123, "grad_norm": 1.0625, "learning_rate": 0.00048488295607161495, "loss": 5.0927, "mean_token_accuracy": 0.19711126983165742, "num_tokens": 27689582.0, "step": 15965 }, { "entropy": 5.48845911026001, "epoch": 1.2425209103287298, "grad_norm": 1.0703125, "learning_rate": 0.0004848729668778621, "loss": 5.0152, "mean_token_accuracy": 0.19736533463001252, "num_tokens": 27698509.0, "step": 15970 }, { "entropy": 5.529009819030762, "epoch": 1.2429099397004473, "grad_norm": 1.03125, "learning_rate": 0.0004848629744996211, "loss": 5.1405, "mean_token_accuracy": 0.18393658101558685, "num_tokens": 27708216.0, "step": 15975 }, { "entropy": 5.620413875579834, "epoch": 1.243298969072165, "grad_norm": 1.0546875, "learning_rate": 0.0004848529789370434, "loss": 5.1368, "mean_token_accuracy": 0.1880849227309227, "num_tokens": 27716801.0, "step": 15980 }, { "entropy": 5.511464786529541, "epoch": 1.2436879984438824, "grad_norm": 1.03125, "learning_rate": 0.0004848429801902808, "loss": 5.101, "mean_token_accuracy": 0.1927514538168907, "num_tokens": 27725186.0, "step": 15985 }, { "entropy": 5.569672346115112, "epoch": 1.2440770278156001, "grad_norm": 1.0703125, "learning_rate": 0.00048483297825948485, "loss": 5.0617, "mean_token_accuracy": 0.1894972175359726, "num_tokens": 27733386.0, "step": 15990 }, { "entropy": 5.5257643699646, "epoch": 1.2444660571873176, "grad_norm": 0.99609375, "learning_rate": 0.00048482297314480756, "loss": 5.1072, "mean_token_accuracy": 0.19045426696538925, "num_tokens": 27742253.0, "step": 15995 }, { "entropy": 5.515679454803466, "epoch": 1.2448550865590353, "grad_norm": 1.03125, "learning_rate": 0.0004848129648464006, "loss": 5.0453, "mean_token_accuracy": 0.19384751319885254, "num_tokens": 27751555.0, "step": 16000 }, { "entropy": 5.580569839477539, "epoch": 1.2452441159307528, "grad_norm": 1.1484375, "learning_rate": 0.0004848029533644159, "loss": 5.1931, "mean_token_accuracy": 0.18254962861537932, "num_tokens": 27760151.0, "step": 16005 }, { "entropy": 5.585309839248657, "epoch": 1.2456331453024703, "grad_norm": 1.03125, "learning_rate": 0.0004847929386990052, "loss": 5.1117, "mean_token_accuracy": 0.1967172309756279, "num_tokens": 27770017.0, "step": 16010 }, { "entropy": 5.512027740478516, "epoch": 1.246022174674188, "grad_norm": 1.0703125, "learning_rate": 0.00048478292085032065, "loss": 4.9894, "mean_token_accuracy": 0.19473126530647278, "num_tokens": 27777796.0, "step": 16015 }, { "entropy": 5.472527027130127, "epoch": 1.2464112040459054, "grad_norm": 1.1796875, "learning_rate": 0.0004847728998185142, "loss": 5.0939, "mean_token_accuracy": 0.1933184951543808, "num_tokens": 27785784.0, "step": 16020 }, { "entropy": 5.534942197799682, "epoch": 1.246800233417623, "grad_norm": 1.0390625, "learning_rate": 0.00048476287560373786, "loss": 5.0705, "mean_token_accuracy": 0.1919177383184433, "num_tokens": 27793911.0, "step": 16025 }, { "entropy": 5.478476095199585, "epoch": 1.2471892627893406, "grad_norm": 1.0078125, "learning_rate": 0.00048475284820614375, "loss": 5.0707, "mean_token_accuracy": 0.1964603155851364, "num_tokens": 27803125.0, "step": 16030 }, { "entropy": 5.456802082061768, "epoch": 1.247578292161058, "grad_norm": 1.0, "learning_rate": 0.00048474281762588407, "loss": 5.0502, "mean_token_accuracy": 0.19782501012086867, "num_tokens": 27812008.0, "step": 16035 }, { "entropy": 5.520873594284057, "epoch": 1.2479673215327758, "grad_norm": 0.98046875, "learning_rate": 0.0004847327838631109, "loss": 5.1809, "mean_token_accuracy": 0.18676184564828874, "num_tokens": 27820490.0, "step": 16040 }, { "entropy": 5.624232816696167, "epoch": 1.2483563509044933, "grad_norm": 1.015625, "learning_rate": 0.0004847227469179766, "loss": 5.1176, "mean_token_accuracy": 0.18958474695682526, "num_tokens": 27829513.0, "step": 16045 }, { "entropy": 5.553323459625244, "epoch": 1.248745380276211, "grad_norm": 1.1875, "learning_rate": 0.0004847127067906334, "loss": 5.048, "mean_token_accuracy": 0.19404656141996385, "num_tokens": 27837811.0, "step": 16050 }, { "entropy": 5.564975023269653, "epoch": 1.2491344096479284, "grad_norm": 1.03125, "learning_rate": 0.00048470266348123365, "loss": 5.1949, "mean_token_accuracy": 0.18364138752222062, "num_tokens": 27846449.0, "step": 16055 }, { "entropy": 5.498793649673462, "epoch": 1.249523439019646, "grad_norm": 1.1171875, "learning_rate": 0.0004846926169899298, "loss": 5.0041, "mean_token_accuracy": 0.19667019695043564, "num_tokens": 27854834.0, "step": 16060 }, { "entropy": 5.583467245101929, "epoch": 1.2499124683913636, "grad_norm": 1.1015625, "learning_rate": 0.00048468256731687426, "loss": 5.1265, "mean_token_accuracy": 0.18801729679107665, "num_tokens": 27862984.0, "step": 16065 }, { "entropy": 5.601991796493531, "epoch": 1.250301497763081, "grad_norm": 1.125, "learning_rate": 0.0004846725144622194, "loss": 5.1411, "mean_token_accuracy": 0.18727387636899948, "num_tokens": 27872198.0, "step": 16070 }, { "entropy": 5.61707501411438, "epoch": 1.2506905271347986, "grad_norm": 1.0859375, "learning_rate": 0.000484662458426118, "loss": 5.0656, "mean_token_accuracy": 0.19369644224643706, "num_tokens": 27880856.0, "step": 16075 }, { "entropy": 5.482554960250854, "epoch": 1.2510795565065163, "grad_norm": 1.0390625, "learning_rate": 0.00048465239920872247, "loss": 5.0005, "mean_token_accuracy": 0.19739518612623214, "num_tokens": 27888677.0, "step": 16080 }, { "entropy": 5.458568382263183, "epoch": 1.2514685858782337, "grad_norm": 1.125, "learning_rate": 0.00048464233681018545, "loss": 5.0607, "mean_token_accuracy": 0.19012163132429122, "num_tokens": 27896940.0, "step": 16085 }, { "entropy": 5.59727258682251, "epoch": 1.2518576152499514, "grad_norm": 0.98828125, "learning_rate": 0.0004846322712306596, "loss": 5.1463, "mean_token_accuracy": 0.19165507405996324, "num_tokens": 27905739.0, "step": 16090 }, { "entropy": 5.623395347595215, "epoch": 1.252246644621669, "grad_norm": 1.1015625, "learning_rate": 0.00048462220247029783, "loss": 5.1015, "mean_token_accuracy": 0.19633011519908905, "num_tokens": 27914029.0, "step": 16095 }, { "entropy": 5.5736137390136715, "epoch": 1.2526356739933866, "grad_norm": 1.015625, "learning_rate": 0.00048461213052925265, "loss": 5.2145, "mean_token_accuracy": 0.18266444504261017, "num_tokens": 27923287.0, "step": 16100 }, { "entropy": 5.525146436691284, "epoch": 1.253024703365104, "grad_norm": 1.0859375, "learning_rate": 0.0004846020554076771, "loss": 5.0714, "mean_token_accuracy": 0.193951378762722, "num_tokens": 27931727.0, "step": 16105 }, { "entropy": 5.4899537563323975, "epoch": 1.2534137327368216, "grad_norm": 1.1484375, "learning_rate": 0.0004845919771057239, "loss": 5.0017, "mean_token_accuracy": 0.19924748837947845, "num_tokens": 27939524.0, "step": 16110 }, { "entropy": 5.534471130371093, "epoch": 1.2538027621085392, "grad_norm": 1.109375, "learning_rate": 0.0004845818956235462, "loss": 5.0706, "mean_token_accuracy": 0.1906408905982971, "num_tokens": 27947827.0, "step": 16115 }, { "entropy": 5.476234769821167, "epoch": 1.2541917914802567, "grad_norm": 1.171875, "learning_rate": 0.00048457181096129664, "loss": 5.0902, "mean_token_accuracy": 0.1937544897198677, "num_tokens": 27956447.0, "step": 16120 }, { "entropy": 5.591322565078736, "epoch": 1.2545808208519742, "grad_norm": 1.015625, "learning_rate": 0.0004845617231191285, "loss": 5.1314, "mean_token_accuracy": 0.1952129766345024, "num_tokens": 27965570.0, "step": 16125 }, { "entropy": 5.555102443695068, "epoch": 1.254969850223692, "grad_norm": 1.0546875, "learning_rate": 0.0004845516320971948, "loss": 5.1008, "mean_token_accuracy": 0.19012947976589203, "num_tokens": 27974527.0, "step": 16130 }, { "entropy": 5.472138786315918, "epoch": 1.2553588795954094, "grad_norm": 1.0, "learning_rate": 0.0004845415378956486, "loss": 5.0357, "mean_token_accuracy": 0.19527363628149033, "num_tokens": 27983190.0, "step": 16135 }, { "entropy": 5.514357614517212, "epoch": 1.255747908967127, "grad_norm": 1.1328125, "learning_rate": 0.000484531440514643, "loss": 5.136, "mean_token_accuracy": 0.1907634750008583, "num_tokens": 27992203.0, "step": 16140 }, { "entropy": 5.53714919090271, "epoch": 1.2561369383388445, "grad_norm": 1.078125, "learning_rate": 0.00048452133995433136, "loss": 5.0846, "mean_token_accuracy": 0.1923945128917694, "num_tokens": 28001154.0, "step": 16145 }, { "entropy": 5.474125003814697, "epoch": 1.2565259677105622, "grad_norm": 1.046875, "learning_rate": 0.0004845112362148668, "loss": 4.9901, "mean_token_accuracy": 0.19518929868936538, "num_tokens": 28009841.0, "step": 16150 }, { "entropy": 5.478867483139038, "epoch": 1.2569149970822797, "grad_norm": 1.03125, "learning_rate": 0.0004845011292964028, "loss": 5.0958, "mean_token_accuracy": 0.19598757922649385, "num_tokens": 28019245.0, "step": 16155 }, { "entropy": 5.603748369216919, "epoch": 1.2573040264539972, "grad_norm": 1.0703125, "learning_rate": 0.00048449101919909265, "loss": 5.2167, "mean_token_accuracy": 0.18479156792163848, "num_tokens": 28028342.0, "step": 16160 }, { "entropy": 5.615244054794312, "epoch": 1.257693055825715, "grad_norm": 1.0625, "learning_rate": 0.00048448090592308955, "loss": 5.1491, "mean_token_accuracy": 0.19280675202608108, "num_tokens": 28037308.0, "step": 16165 }, { "entropy": 5.575028991699218, "epoch": 1.2580820851974324, "grad_norm": 1.078125, "learning_rate": 0.0004844707894685473, "loss": 5.1395, "mean_token_accuracy": 0.1912289023399353, "num_tokens": 28046214.0, "step": 16170 }, { "entropy": 5.490925598144531, "epoch": 1.2584711145691498, "grad_norm": 1.0703125, "learning_rate": 0.0004844606698356192, "loss": 4.9574, "mean_token_accuracy": 0.20222419798374175, "num_tokens": 28054722.0, "step": 16175 }, { "entropy": 5.4629120349884035, "epoch": 1.2588601439408675, "grad_norm": 1.0859375, "learning_rate": 0.0004844505470244588, "loss": 4.9631, "mean_token_accuracy": 0.19676416665315627, "num_tokens": 28062596.0, "step": 16180 }, { "entropy": 5.451151323318482, "epoch": 1.2592491733125852, "grad_norm": 1.125, "learning_rate": 0.0004844404210352197, "loss": 5.0186, "mean_token_accuracy": 0.19686448574066162, "num_tokens": 28071183.0, "step": 16185 }, { "entropy": 5.476496410369873, "epoch": 1.2596382026843027, "grad_norm": 1.1015625, "learning_rate": 0.00048443029186805554, "loss": 5.0195, "mean_token_accuracy": 0.19939035624265672, "num_tokens": 28079194.0, "step": 16190 }, { "entropy": 5.455430126190185, "epoch": 1.2600272320560202, "grad_norm": 1.0703125, "learning_rate": 0.0004844201595231201, "loss": 5.0224, "mean_token_accuracy": 0.1929969921708107, "num_tokens": 28087874.0, "step": 16195 }, { "entropy": 5.57345986366272, "epoch": 1.2604162614277379, "grad_norm": 1.1015625, "learning_rate": 0.00048441002400056706, "loss": 5.0897, "mean_token_accuracy": 0.1949974477291107, "num_tokens": 28097390.0, "step": 16200 }, { "entropy": 5.496247482299805, "epoch": 1.2608052907994554, "grad_norm": 1.2109375, "learning_rate": 0.0004843998853005502, "loss": 5.0444, "mean_token_accuracy": 0.19245197921991347, "num_tokens": 28105445.0, "step": 16205 }, { "entropy": 5.569361829757691, "epoch": 1.2611943201711728, "grad_norm": 1.0, "learning_rate": 0.0004843897434232233, "loss": 5.0386, "mean_token_accuracy": 0.19836800396442414, "num_tokens": 28113855.0, "step": 16210 }, { "entropy": 5.502789735794067, "epoch": 1.2615833495428905, "grad_norm": 1.0234375, "learning_rate": 0.00048437959836874047, "loss": 5.0246, "mean_token_accuracy": 0.19916650652885437, "num_tokens": 28123300.0, "step": 16215 }, { "entropy": 5.495354652404785, "epoch": 1.261972378914608, "grad_norm": 1.0234375, "learning_rate": 0.00048436945013725544, "loss": 4.9981, "mean_token_accuracy": 0.19865452647209167, "num_tokens": 28131829.0, "step": 16220 }, { "entropy": 5.540538501739502, "epoch": 1.2623614082863255, "grad_norm": 1.046875, "learning_rate": 0.00048435929872892226, "loss": 5.14, "mean_token_accuracy": 0.18703126013278962, "num_tokens": 28141060.0, "step": 16225 }, { "entropy": 5.57834906578064, "epoch": 1.2627504376580432, "grad_norm": 1.0703125, "learning_rate": 0.0004843491441438949, "loss": 5.1606, "mean_token_accuracy": 0.18525514155626296, "num_tokens": 28149866.0, "step": 16230 }, { "entropy": 5.525491046905517, "epoch": 1.2631394670297609, "grad_norm": 1.125, "learning_rate": 0.00048433898638232755, "loss": 5.1078, "mean_token_accuracy": 0.19130464494228364, "num_tokens": 28158593.0, "step": 16235 }, { "entropy": 5.501227760314942, "epoch": 1.2635284964014784, "grad_norm": 1.125, "learning_rate": 0.0004843288254443742, "loss": 5.0295, "mean_token_accuracy": 0.19859188944101333, "num_tokens": 28167301.0, "step": 16240 }, { "entropy": 5.506014680862426, "epoch": 1.2639175257731958, "grad_norm": 1.078125, "learning_rate": 0.0004843186613301892, "loss": 5.0836, "mean_token_accuracy": 0.1989399254322052, "num_tokens": 28176092.0, "step": 16245 }, { "entropy": 5.6047598361969, "epoch": 1.2643065551449135, "grad_norm": 1.1640625, "learning_rate": 0.0004843084940399266, "loss": 5.1609, "mean_token_accuracy": 0.19779484570026398, "num_tokens": 28184570.0, "step": 16250 }, { "entropy": 5.527634382247925, "epoch": 1.264695584516631, "grad_norm": 1.0546875, "learning_rate": 0.0004842983235737408, "loss": 5.0849, "mean_token_accuracy": 0.19859933108091354, "num_tokens": 28192874.0, "step": 16255 }, { "entropy": 5.536904668807983, "epoch": 1.2650846138883485, "grad_norm": 1.09375, "learning_rate": 0.0004842881499317861, "loss": 5.0891, "mean_token_accuracy": 0.1980382487177849, "num_tokens": 28201546.0, "step": 16260 }, { "entropy": 5.511349105834961, "epoch": 1.2654736432600662, "grad_norm": 1.015625, "learning_rate": 0.0004842779731142168, "loss": 5.0717, "mean_token_accuracy": 0.19313783198595047, "num_tokens": 28210061.0, "step": 16265 }, { "entropy": 5.490809154510498, "epoch": 1.2658626726317836, "grad_norm": 1.03125, "learning_rate": 0.00048426779312118735, "loss": 4.991, "mean_token_accuracy": 0.19474317282438278, "num_tokens": 28219334.0, "step": 16270 }, { "entropy": 5.594471502304077, "epoch": 1.2662517020035013, "grad_norm": 1.0078125, "learning_rate": 0.0004842576099528522, "loss": 5.1221, "mean_token_accuracy": 0.18670616149902344, "num_tokens": 28227963.0, "step": 16275 }, { "entropy": 5.495988035202027, "epoch": 1.2666407313752188, "grad_norm": 0.9921875, "learning_rate": 0.0004842474236093659, "loss": 5.0882, "mean_token_accuracy": 0.18825411200523376, "num_tokens": 28236648.0, "step": 16280 }, { "entropy": 5.513673925399781, "epoch": 1.2670297607469365, "grad_norm": 1.0625, "learning_rate": 0.00048423723409088306, "loss": 5.0783, "mean_token_accuracy": 0.19285647720098495, "num_tokens": 28245221.0, "step": 16285 }, { "entropy": 5.513381576538086, "epoch": 1.267418790118654, "grad_norm": 1.03125, "learning_rate": 0.0004842270413975582, "loss": 5.0914, "mean_token_accuracy": 0.18984635621309282, "num_tokens": 28254481.0, "step": 16290 }, { "entropy": 5.577774524688721, "epoch": 1.2678078194903715, "grad_norm": 0.95703125, "learning_rate": 0.000484216845529546, "loss": 5.0554, "mean_token_accuracy": 0.1929449185729027, "num_tokens": 28263844.0, "step": 16295 }, { "entropy": 5.487737131118775, "epoch": 1.2681968488620892, "grad_norm": 1.0546875, "learning_rate": 0.00048420664648700113, "loss": 5.0102, "mean_token_accuracy": 0.19215679466724395, "num_tokens": 28272500.0, "step": 16300 }, { "entropy": 5.546275234222412, "epoch": 1.2685858782338066, "grad_norm": 1.0703125, "learning_rate": 0.0004841964442700784, "loss": 5.1002, "mean_token_accuracy": 0.18495894372463226, "num_tokens": 28281553.0, "step": 16305 }, { "entropy": 5.555704879760742, "epoch": 1.2689749076055241, "grad_norm": 1.1484375, "learning_rate": 0.00048418623887893264, "loss": 5.0608, "mean_token_accuracy": 0.1980404794216156, "num_tokens": 28290078.0, "step": 16310 }, { "entropy": 5.525177526473999, "epoch": 1.2693639369772418, "grad_norm": 1.0625, "learning_rate": 0.00048417603031371867, "loss": 4.9283, "mean_token_accuracy": 0.1940799355506897, "num_tokens": 28298879.0, "step": 16315 }, { "entropy": 5.477933168411255, "epoch": 1.2697529663489593, "grad_norm": 1.03125, "learning_rate": 0.0004841658185745913, "loss": 5.0405, "mean_token_accuracy": 0.19576923549175262, "num_tokens": 28307188.0, "step": 16320 }, { "entropy": 5.465908098220825, "epoch": 1.270141995720677, "grad_norm": 1.046875, "learning_rate": 0.00048415560366170564, "loss": 4.9988, "mean_token_accuracy": 0.19847041368484497, "num_tokens": 28316012.0, "step": 16325 }, { "entropy": 5.548067474365235, "epoch": 1.2705310250923945, "grad_norm": 1.0703125, "learning_rate": 0.0004841453855752165, "loss": 5.148, "mean_token_accuracy": 0.18958010226488115, "num_tokens": 28325750.0, "step": 16330 }, { "entropy": 5.507888221740723, "epoch": 1.2709200544641122, "grad_norm": 0.98828125, "learning_rate": 0.0004841351643152791, "loss": 5.1256, "mean_token_accuracy": 0.1884363830089569, "num_tokens": 28335217.0, "step": 16335 }, { "entropy": 5.549546241760254, "epoch": 1.2713090838358296, "grad_norm": 1.15625, "learning_rate": 0.0004841249398820485, "loss": 5.0568, "mean_token_accuracy": 0.19467593878507614, "num_tokens": 28344123.0, "step": 16340 }, { "entropy": 5.563978481292724, "epoch": 1.271698113207547, "grad_norm": 1.1015625, "learning_rate": 0.0004841147122756797, "loss": 5.0693, "mean_token_accuracy": 0.1927617609500885, "num_tokens": 28353230.0, "step": 16345 }, { "entropy": 5.542701625823975, "epoch": 1.2720871425792648, "grad_norm": 1.078125, "learning_rate": 0.000484104481496328, "loss": 5.1135, "mean_token_accuracy": 0.18600604981184005, "num_tokens": 28361636.0, "step": 16350 }, { "entropy": 5.513048315048218, "epoch": 1.2724761719509823, "grad_norm": 1.109375, "learning_rate": 0.0004840942475441486, "loss": 5.0501, "mean_token_accuracy": 0.19240390956401826, "num_tokens": 28370066.0, "step": 16355 }, { "entropy": 5.533048057556153, "epoch": 1.2728652013226998, "grad_norm": 1.0625, "learning_rate": 0.0004840840104192969, "loss": 5.1274, "mean_token_accuracy": 0.18576205372810364, "num_tokens": 28379017.0, "step": 16360 }, { "entropy": 5.595581722259522, "epoch": 1.2732542306944175, "grad_norm": 1.0234375, "learning_rate": 0.000484073770121928, "loss": 5.1039, "mean_token_accuracy": 0.19364436566829682, "num_tokens": 28387939.0, "step": 16365 }, { "entropy": 5.491097784042358, "epoch": 1.273643260066135, "grad_norm": 1.0546875, "learning_rate": 0.0004840635266521975, "loss": 5.0011, "mean_token_accuracy": 0.18991073071956635, "num_tokens": 28396341.0, "step": 16370 }, { "entropy": 5.494286155700683, "epoch": 1.2740322894378526, "grad_norm": 1.1171875, "learning_rate": 0.0004840532800102607, "loss": 5.037, "mean_token_accuracy": 0.1896663337945938, "num_tokens": 28405128.0, "step": 16375 }, { "entropy": 5.509176206588745, "epoch": 1.27442131880957, "grad_norm": 1.0859375, "learning_rate": 0.00048404303019627314, "loss": 5.0159, "mean_token_accuracy": 0.19899940192699433, "num_tokens": 28412841.0, "step": 16380 }, { "entropy": 5.479979562759399, "epoch": 1.2748103481812878, "grad_norm": 1.0703125, "learning_rate": 0.00048403277721039036, "loss": 4.9641, "mean_token_accuracy": 0.20438966006040574, "num_tokens": 28421526.0, "step": 16385 }, { "entropy": 5.522908782958984, "epoch": 1.2751993775530053, "grad_norm": 1.125, "learning_rate": 0.0004840225210527679, "loss": 5.1262, "mean_token_accuracy": 0.19450225830078124, "num_tokens": 28430070.0, "step": 16390 }, { "entropy": 5.4506003856658936, "epoch": 1.2755884069247228, "grad_norm": 1.078125, "learning_rate": 0.0004840122617235613, "loss": 5.0041, "mean_token_accuracy": 0.1952502965927124, "num_tokens": 28438920.0, "step": 16395 }, { "entropy": 5.549204158782959, "epoch": 1.2759774362964404, "grad_norm": 1.03125, "learning_rate": 0.0004840019992229263, "loss": 5.047, "mean_token_accuracy": 0.1978502705693245, "num_tokens": 28447666.0, "step": 16400 }, { "entropy": 5.548838472366333, "epoch": 1.276366465668158, "grad_norm": 1.1796875, "learning_rate": 0.00048399173355101867, "loss": 5.168, "mean_token_accuracy": 0.1819358542561531, "num_tokens": 28457341.0, "step": 16405 }, { "entropy": 5.493353366851807, "epoch": 1.2767554950398754, "grad_norm": 1.1015625, "learning_rate": 0.00048398146470799417, "loss": 5.0586, "mean_token_accuracy": 0.19822872579097747, "num_tokens": 28466202.0, "step": 16410 }, { "entropy": 5.5977925777435305, "epoch": 1.277144524411593, "grad_norm": 1.0859375, "learning_rate": 0.00048397119269400846, "loss": 5.1451, "mean_token_accuracy": 0.19250507801771163, "num_tokens": 28474494.0, "step": 16415 }, { "entropy": 5.559447240829468, "epoch": 1.2775335537833106, "grad_norm": 1.0859375, "learning_rate": 0.00048396091750921766, "loss": 5.1147, "mean_token_accuracy": 0.19329029321670532, "num_tokens": 28482931.0, "step": 16420 }, { "entropy": 5.522424745559692, "epoch": 1.2779225831550283, "grad_norm": 1.109375, "learning_rate": 0.0004839506391537774, "loss": 5.0757, "mean_token_accuracy": 0.19847742170095445, "num_tokens": 28491372.0, "step": 16425 }, { "entropy": 5.457620620727539, "epoch": 1.2783116125267457, "grad_norm": 1.0703125, "learning_rate": 0.0004839403576278438, "loss": 4.9794, "mean_token_accuracy": 0.19413884729146957, "num_tokens": 28500201.0, "step": 16430 }, { "entropy": 5.463801002502441, "epoch": 1.2787006418984634, "grad_norm": 1.2109375, "learning_rate": 0.0004839300729315729, "loss": 5.01, "mean_token_accuracy": 0.19884078949689865, "num_tokens": 28508899.0, "step": 16435 }, { "entropy": 5.512293767929077, "epoch": 1.279089671270181, "grad_norm": 1.0390625, "learning_rate": 0.0004839197850651206, "loss": 5.0918, "mean_token_accuracy": 0.19096433222293854, "num_tokens": 28518280.0, "step": 16440 }, { "entropy": 5.579175138473511, "epoch": 1.2794787006418984, "grad_norm": 1.109375, "learning_rate": 0.00048390949402864317, "loss": 5.1388, "mean_token_accuracy": 0.19182759672403335, "num_tokens": 28527113.0, "step": 16445 }, { "entropy": 5.49404559135437, "epoch": 1.279867730013616, "grad_norm": 1.0, "learning_rate": 0.00048389919982229666, "loss": 5.0498, "mean_token_accuracy": 0.19921554177999495, "num_tokens": 28535253.0, "step": 16450 }, { "entropy": 5.461811923980713, "epoch": 1.2802567593853336, "grad_norm": 1.109375, "learning_rate": 0.00048388890244623723, "loss": 5.0893, "mean_token_accuracy": 0.18687255084514617, "num_tokens": 28543475.0, "step": 16455 }, { "entropy": 5.539691972732544, "epoch": 1.280645788757051, "grad_norm": 1.1484375, "learning_rate": 0.0004838786019006213, "loss": 5.1323, "mean_token_accuracy": 0.1918030336499214, "num_tokens": 28551921.0, "step": 16460 }, { "entropy": 5.530662631988525, "epoch": 1.2810348181287687, "grad_norm": 1.03125, "learning_rate": 0.00048386829818560493, "loss": 5.1105, "mean_token_accuracy": 0.19053856581449508, "num_tokens": 28560413.0, "step": 16465 }, { "entropy": 5.5761932849884035, "epoch": 1.2814238475004862, "grad_norm": 1.0625, "learning_rate": 0.00048385799130134464, "loss": 5.1231, "mean_token_accuracy": 0.19474577456712722, "num_tokens": 28568802.0, "step": 16470 }, { "entropy": 5.556376123428345, "epoch": 1.281812876872204, "grad_norm": 1.0390625, "learning_rate": 0.0004838476812479968, "loss": 5.1884, "mean_token_accuracy": 0.18509170264005662, "num_tokens": 28578164.0, "step": 16475 }, { "entropy": 5.581750917434692, "epoch": 1.2822019062439214, "grad_norm": 1.078125, "learning_rate": 0.00048383736802571774, "loss": 5.0312, "mean_token_accuracy": 0.20277969241142274, "num_tokens": 28586061.0, "step": 16480 }, { "entropy": 5.479176712036133, "epoch": 1.282590935615639, "grad_norm": 1.0546875, "learning_rate": 0.000483827051634664, "loss": 5.035, "mean_token_accuracy": 0.19689437747001648, "num_tokens": 28594185.0, "step": 16485 }, { "entropy": 5.476863527297974, "epoch": 1.2829799649873566, "grad_norm": 1.09375, "learning_rate": 0.00048381673207499224, "loss": 5.0478, "mean_token_accuracy": 0.19732416421175003, "num_tokens": 28602427.0, "step": 16490 }, { "entropy": 5.495790767669678, "epoch": 1.283368994359074, "grad_norm": 1.015625, "learning_rate": 0.0004838064093468588, "loss": 5.0108, "mean_token_accuracy": 0.1957008108496666, "num_tokens": 28611608.0, "step": 16495 }, { "entropy": 5.524753093719482, "epoch": 1.2837580237307917, "grad_norm": 1.046875, "learning_rate": 0.0004837960834504206, "loss": 5.0219, "mean_token_accuracy": 0.1981922686100006, "num_tokens": 28620142.0, "step": 16500 }, { "entropy": 5.536835670471191, "epoch": 1.2841470531025092, "grad_norm": 1.09375, "learning_rate": 0.0004837857543858341, "loss": 5.1106, "mean_token_accuracy": 0.19014882743358613, "num_tokens": 28629401.0, "step": 16505 }, { "entropy": 5.500471448898315, "epoch": 1.2845360824742267, "grad_norm": 1.1484375, "learning_rate": 0.0004837754221532561, "loss": 5.0537, "mean_token_accuracy": 0.19455788433551788, "num_tokens": 28637934.0, "step": 16510 }, { "entropy": 5.5314027786254885, "epoch": 1.2849251118459444, "grad_norm": 1.0703125, "learning_rate": 0.00048376508675284334, "loss": 5.0717, "mean_token_accuracy": 0.1924126148223877, "num_tokens": 28647145.0, "step": 16515 }, { "entropy": 5.539319038391113, "epoch": 1.2853141412176619, "grad_norm": 1.109375, "learning_rate": 0.00048375474818475274, "loss": 5.1512, "mean_token_accuracy": 0.18620239943265915, "num_tokens": 28656146.0, "step": 16520 }, { "entropy": 5.489681529998779, "epoch": 1.2857031705893796, "grad_norm": 1.078125, "learning_rate": 0.00048374440644914104, "loss": 4.9915, "mean_token_accuracy": 0.19533517807722092, "num_tokens": 28664476.0, "step": 16525 }, { "entropy": 5.551758575439453, "epoch": 1.286092199961097, "grad_norm": 1.109375, "learning_rate": 0.00048373406154616523, "loss": 5.0131, "mean_token_accuracy": 0.19887116253376008, "num_tokens": 28672188.0, "step": 16530 }, { "entropy": 5.452875995635987, "epoch": 1.2864812293328147, "grad_norm": 1.0859375, "learning_rate": 0.00048372371347598226, "loss": 5.0852, "mean_token_accuracy": 0.19254565238952637, "num_tokens": 28680758.0, "step": 16535 }, { "entropy": 5.608175754547119, "epoch": 1.2868702587045322, "grad_norm": 1.03125, "learning_rate": 0.00048371336223874923, "loss": 5.2036, "mean_token_accuracy": 0.18281575292348862, "num_tokens": 28690392.0, "step": 16540 }, { "entropy": 5.575884580612183, "epoch": 1.2872592880762497, "grad_norm": 0.99609375, "learning_rate": 0.000483703007834623, "loss": 5.0747, "mean_token_accuracy": 0.18667237162590028, "num_tokens": 28699121.0, "step": 16545 }, { "entropy": 5.587582159042358, "epoch": 1.2876483174479674, "grad_norm": 1.09375, "learning_rate": 0.0004836926502637609, "loss": 5.1923, "mean_token_accuracy": 0.1840893805027008, "num_tokens": 28707692.0, "step": 16550 }, { "entropy": 5.533880519866943, "epoch": 1.2880373468196848, "grad_norm": 1.1796875, "learning_rate": 0.00048368228952632005, "loss": 5.0855, "mean_token_accuracy": 0.19058406502008438, "num_tokens": 28716630.0, "step": 16555 }, { "entropy": 5.4851157665252686, "epoch": 1.2884263761914023, "grad_norm": 1.1171875, "learning_rate": 0.00048367192562245756, "loss": 4.9889, "mean_token_accuracy": 0.20312227457761764, "num_tokens": 28725503.0, "step": 16560 }, { "entropy": 5.527416229248047, "epoch": 1.28881540556312, "grad_norm": 1.0625, "learning_rate": 0.00048366155855233067, "loss": 5.113, "mean_token_accuracy": 0.1924382507801056, "num_tokens": 28734578.0, "step": 16565 }, { "entropy": 5.561566591262817, "epoch": 1.2892044349348377, "grad_norm": 1.1015625, "learning_rate": 0.0004836511883160968, "loss": 5.1236, "mean_token_accuracy": 0.18565168529748916, "num_tokens": 28743380.0, "step": 16570 }, { "entropy": 5.544106292724609, "epoch": 1.2895934643065552, "grad_norm": 1.0234375, "learning_rate": 0.0004836408149139133, "loss": 5.0977, "mean_token_accuracy": 0.19520083367824553, "num_tokens": 28752968.0, "step": 16575 }, { "entropy": 5.52550106048584, "epoch": 1.2899824936782727, "grad_norm": 1.0546875, "learning_rate": 0.00048363043834593743, "loss": 5.1262, "mean_token_accuracy": 0.18828008472919464, "num_tokens": 28761756.0, "step": 16580 }, { "entropy": 5.50837664604187, "epoch": 1.2903715230499904, "grad_norm": 1.0234375, "learning_rate": 0.0004836200586123268, "loss": 5.0633, "mean_token_accuracy": 0.19064787179231643, "num_tokens": 28771110.0, "step": 16585 }, { "entropy": 5.585468912124634, "epoch": 1.2907605524217078, "grad_norm": 1.0390625, "learning_rate": 0.00048360967571323875, "loss": 5.1513, "mean_token_accuracy": 0.18937406092882156, "num_tokens": 28780016.0, "step": 16590 }, { "entropy": 5.518825387954712, "epoch": 1.2911495817934253, "grad_norm": 1.1015625, "learning_rate": 0.00048359928964883094, "loss": 5.0677, "mean_token_accuracy": 0.19727834016084672, "num_tokens": 28788150.0, "step": 16595 }, { "entropy": 5.5168122291564945, "epoch": 1.291538611165143, "grad_norm": 1.140625, "learning_rate": 0.000483588900419261, "loss": 5.0407, "mean_token_accuracy": 0.19523452073335648, "num_tokens": 28796564.0, "step": 16600 }, { "entropy": 5.628450155258179, "epoch": 1.2919276405368605, "grad_norm": 1.15625, "learning_rate": 0.0004835785080246864, "loss": 5.2485, "mean_token_accuracy": 0.18033061921596527, "num_tokens": 28804987.0, "step": 16605 }, { "entropy": 5.528646564483642, "epoch": 1.292316669908578, "grad_norm": 1.140625, "learning_rate": 0.000483568112465265, "loss": 5.0612, "mean_token_accuracy": 0.19769240617752076, "num_tokens": 28813752.0, "step": 16610 }, { "entropy": 5.476093053817749, "epoch": 1.2927056992802957, "grad_norm": 1.03125, "learning_rate": 0.00048355771374115436, "loss": 4.9884, "mean_token_accuracy": 0.19663581550121306, "num_tokens": 28822464.0, "step": 16615 }, { "entropy": 5.529690217971802, "epoch": 1.2930947286520134, "grad_norm": 1.1328125, "learning_rate": 0.0004835473118525125, "loss": 5.0274, "mean_token_accuracy": 0.19529227465391158, "num_tokens": 28830997.0, "step": 16620 }, { "entropy": 5.458420324325561, "epoch": 1.2934837580237308, "grad_norm": 1.0, "learning_rate": 0.0004835369067994971, "loss": 5.0047, "mean_token_accuracy": 0.20642195045948028, "num_tokens": 28839979.0, "step": 16625 }, { "entropy": 5.523664140701294, "epoch": 1.2938727873954483, "grad_norm": 1.0625, "learning_rate": 0.000483526498582266, "loss": 5.0431, "mean_token_accuracy": 0.19351308643817902, "num_tokens": 28848394.0, "step": 16630 }, { "entropy": 5.641633462905884, "epoch": 1.294261816767166, "grad_norm": 1.15625, "learning_rate": 0.00048351608720097715, "loss": 5.3179, "mean_token_accuracy": 0.17611723095178605, "num_tokens": 28857804.0, "step": 16635 }, { "entropy": 5.518852424621582, "epoch": 1.2946508461388835, "grad_norm": 1.1015625, "learning_rate": 0.00048350567265578867, "loss": 5.0151, "mean_token_accuracy": 0.19268874377012252, "num_tokens": 28866405.0, "step": 16640 }, { "entropy": 5.559850120544434, "epoch": 1.295039875510601, "grad_norm": 1.0546875, "learning_rate": 0.0004834952549468584, "loss": 5.07, "mean_token_accuracy": 0.19891285747289658, "num_tokens": 28874751.0, "step": 16645 }, { "entropy": 5.561873722076416, "epoch": 1.2954289048823187, "grad_norm": 1.1328125, "learning_rate": 0.0004834848340743446, "loss": 5.1902, "mean_token_accuracy": 0.1860068291425705, "num_tokens": 28884013.0, "step": 16650 }, { "entropy": 5.506040287017822, "epoch": 1.2958179342540361, "grad_norm": 1.0078125, "learning_rate": 0.0004834744100384052, "loss": 5.0023, "mean_token_accuracy": 0.18987907618284225, "num_tokens": 28892175.0, "step": 16655 }, { "entropy": 5.573046445846558, "epoch": 1.2962069636257538, "grad_norm": 0.984375, "learning_rate": 0.0004834639828391984, "loss": 5.0627, "mean_token_accuracy": 0.1913484588265419, "num_tokens": 28901238.0, "step": 16660 }, { "entropy": 5.548725128173828, "epoch": 1.2965959929974713, "grad_norm": 1.03125, "learning_rate": 0.00048345355247688256, "loss": 5.0786, "mean_token_accuracy": 0.19385518580675126, "num_tokens": 28910368.0, "step": 16665 }, { "entropy": 5.583859300613403, "epoch": 1.296985022369189, "grad_norm": 1.1171875, "learning_rate": 0.0004834431189516158, "loss": 5.1473, "mean_token_accuracy": 0.18499131202697755, "num_tokens": 28918854.0, "step": 16670 }, { "entropy": 5.538079929351807, "epoch": 1.2973740517409065, "grad_norm": 1.109375, "learning_rate": 0.0004834326822635565, "loss": 5.0923, "mean_token_accuracy": 0.19338303208351135, "num_tokens": 28927103.0, "step": 16675 }, { "entropy": 5.48781909942627, "epoch": 1.297763081112624, "grad_norm": 1.09375, "learning_rate": 0.00048342224241286296, "loss": 5.0106, "mean_token_accuracy": 0.19568580090999604, "num_tokens": 28936257.0, "step": 16680 }, { "entropy": 5.62662901878357, "epoch": 1.2981521104843416, "grad_norm": 1.1328125, "learning_rate": 0.0004834117993996937, "loss": 5.1511, "mean_token_accuracy": 0.1899014875292778, "num_tokens": 28944991.0, "step": 16685 }, { "entropy": 5.572661590576172, "epoch": 1.2985411398560591, "grad_norm": 1.109375, "learning_rate": 0.0004834013532242071, "loss": 5.1188, "mean_token_accuracy": 0.18959244787693025, "num_tokens": 28953781.0, "step": 16690 }, { "entropy": 5.51700611114502, "epoch": 1.2989301692277766, "grad_norm": 1.046875, "learning_rate": 0.0004833909038865616, "loss": 5.0209, "mean_token_accuracy": 0.2020644947886467, "num_tokens": 28961916.0, "step": 16695 }, { "entropy": 5.522443389892578, "epoch": 1.2993191985994943, "grad_norm": 1.1328125, "learning_rate": 0.0004833804513869159, "loss": 5.0557, "mean_token_accuracy": 0.1906190738081932, "num_tokens": 28970223.0, "step": 16700 }, { "entropy": 5.494998359680176, "epoch": 1.2997082279712118, "grad_norm": 1.0625, "learning_rate": 0.0004833699957254284, "loss": 5.0871, "mean_token_accuracy": 0.18928292393684387, "num_tokens": 28979063.0, "step": 16705 }, { "entropy": 5.60704927444458, "epoch": 1.3000972573429295, "grad_norm": 1.1484375, "learning_rate": 0.000483359536902258, "loss": 5.192, "mean_token_accuracy": 0.1884426385164261, "num_tokens": 28987229.0, "step": 16710 }, { "entropy": 5.595890855789184, "epoch": 1.300486286714647, "grad_norm": 1.078125, "learning_rate": 0.0004833490749175632, "loss": 5.1569, "mean_token_accuracy": 0.18271224647760392, "num_tokens": 28995889.0, "step": 16715 }, { "entropy": 5.574895715713501, "epoch": 1.3008753160863646, "grad_norm": 1.09375, "learning_rate": 0.00048333860977150286, "loss": 5.1496, "mean_token_accuracy": 0.18468528836965561, "num_tokens": 29003962.0, "step": 16720 }, { "entropy": 5.493883419036865, "epoch": 1.3012643454580821, "grad_norm": 1.0625, "learning_rate": 0.00048332814146423566, "loss": 5.0251, "mean_token_accuracy": 0.19366478323936462, "num_tokens": 29012652.0, "step": 16725 }, { "entropy": 5.6350696086883545, "epoch": 1.3016533748297996, "grad_norm": 1.1875, "learning_rate": 0.0004833176699959206, "loss": 5.1603, "mean_token_accuracy": 0.18248924762010574, "num_tokens": 29022445.0, "step": 16730 }, { "entropy": 5.561426019668579, "epoch": 1.3020424042015173, "grad_norm": 1.1640625, "learning_rate": 0.00048330719536671633, "loss": 5.0677, "mean_token_accuracy": 0.18916751742362975, "num_tokens": 29030840.0, "step": 16735 }, { "entropy": 5.556227207183838, "epoch": 1.3024314335732348, "grad_norm": 1.046875, "learning_rate": 0.000483296717576782, "loss": 5.1175, "mean_token_accuracy": 0.19118670672178267, "num_tokens": 29039640.0, "step": 16740 }, { "entropy": 5.475878810882568, "epoch": 1.3028204629449522, "grad_norm": 1.09375, "learning_rate": 0.0004832862366262765, "loss": 5.0594, "mean_token_accuracy": 0.19066952168941498, "num_tokens": 29047793.0, "step": 16745 }, { "entropy": 5.518102312088013, "epoch": 1.30320949231667, "grad_norm": 1.0625, "learning_rate": 0.00048327575251535886, "loss": 5.0291, "mean_token_accuracy": 0.19459352344274522, "num_tokens": 29056880.0, "step": 16750 }, { "entropy": 5.565805053710937, "epoch": 1.3035985216883874, "grad_norm": 1.0234375, "learning_rate": 0.0004832652652441883, "loss": 5.0656, "mean_token_accuracy": 0.19566534012556075, "num_tokens": 29065093.0, "step": 16755 }, { "entropy": 5.53579683303833, "epoch": 1.303987551060105, "grad_norm": 1.046875, "learning_rate": 0.00048325477481292375, "loss": 5.113, "mean_token_accuracy": 0.187723371386528, "num_tokens": 29074389.0, "step": 16760 }, { "entropy": 5.427580213546753, "epoch": 1.3043765804318226, "grad_norm": 1.0390625, "learning_rate": 0.0004832442812217244, "loss": 4.9717, "mean_token_accuracy": 0.19776798784732819, "num_tokens": 29082789.0, "step": 16765 }, { "entropy": 5.606148815155029, "epoch": 1.3047656098035403, "grad_norm": 1.0859375, "learning_rate": 0.0004832337844707496, "loss": 5.2313, "mean_token_accuracy": 0.18495915234088897, "num_tokens": 29092831.0, "step": 16770 }, { "entropy": 5.480395364761352, "epoch": 1.3051546391752578, "grad_norm": 1.0390625, "learning_rate": 0.00048322328456015855, "loss": 4.9378, "mean_token_accuracy": 0.19954221248626708, "num_tokens": 29101067.0, "step": 16775 }, { "entropy": 5.547918605804443, "epoch": 1.3055436685469752, "grad_norm": 1.09375, "learning_rate": 0.00048321278149011053, "loss": 5.1033, "mean_token_accuracy": 0.18288245499134065, "num_tokens": 29110423.0, "step": 16780 }, { "entropy": 5.497662687301636, "epoch": 1.305932697918693, "grad_norm": 1.0859375, "learning_rate": 0.00048320227526076504, "loss": 4.9996, "mean_token_accuracy": 0.19494541585445405, "num_tokens": 29119508.0, "step": 16785 }, { "entropy": 5.508455085754394, "epoch": 1.3063217272904104, "grad_norm": 1.1640625, "learning_rate": 0.0004831917658722814, "loss": 5.0873, "mean_token_accuracy": 0.19483303278684616, "num_tokens": 29127899.0, "step": 16790 }, { "entropy": 5.561690139770508, "epoch": 1.3067107566621279, "grad_norm": 1.0546875, "learning_rate": 0.00048318125332481903, "loss": 5.1234, "mean_token_accuracy": 0.19614604711532593, "num_tokens": 29137261.0, "step": 16795 }, { "entropy": 5.552021551132202, "epoch": 1.3070997860338456, "grad_norm": 1.171875, "learning_rate": 0.00048317073761853764, "loss": 5.1662, "mean_token_accuracy": 0.18895426839590074, "num_tokens": 29145439.0, "step": 16800 }, { "entropy": 5.590690755844117, "epoch": 1.307488815405563, "grad_norm": 1.1953125, "learning_rate": 0.0004831602187535965, "loss": 5.188, "mean_token_accuracy": 0.18823832422494888, "num_tokens": 29153871.0, "step": 16805 }, { "entropy": 5.548564481735229, "epoch": 1.3078778447772808, "grad_norm": 1.0546875, "learning_rate": 0.0004831496967301554, "loss": 5.0329, "mean_token_accuracy": 0.19459623247385024, "num_tokens": 29162343.0, "step": 16810 }, { "entropy": 5.513624620437622, "epoch": 1.3082668741489982, "grad_norm": 1.0703125, "learning_rate": 0.00048313917154837386, "loss": 5.0792, "mean_token_accuracy": 0.1971427857875824, "num_tokens": 29170533.0, "step": 16815 }, { "entropy": 5.531066989898681, "epoch": 1.308655903520716, "grad_norm": 1.109375, "learning_rate": 0.0004831286432084118, "loss": 5.0967, "mean_token_accuracy": 0.19469216763973235, "num_tokens": 29179353.0, "step": 16820 }, { "entropy": 5.532274198532105, "epoch": 1.3090449328924334, "grad_norm": 0.95703125, "learning_rate": 0.0004831181117104289, "loss": 5.0523, "mean_token_accuracy": 0.1954951673746109, "num_tokens": 29188747.0, "step": 16825 }, { "entropy": 5.529788064956665, "epoch": 1.3094339622641509, "grad_norm": 1.078125, "learning_rate": 0.00048310757705458476, "loss": 5.0815, "mean_token_accuracy": 0.19113018810749055, "num_tokens": 29197302.0, "step": 16830 }, { "entropy": 5.564012956619263, "epoch": 1.3098229916358686, "grad_norm": 1.0546875, "learning_rate": 0.00048309703924103944, "loss": 5.0559, "mean_token_accuracy": 0.18854209780693054, "num_tokens": 29205667.0, "step": 16835 }, { "entropy": 5.597510290145874, "epoch": 1.310212021007586, "grad_norm": 1.1328125, "learning_rate": 0.00048308649826995283, "loss": 5.1318, "mean_token_accuracy": 0.19182043373584748, "num_tokens": 29214475.0, "step": 16840 }, { "entropy": 5.561506986618042, "epoch": 1.3106010503793035, "grad_norm": 1.0546875, "learning_rate": 0.00048307595414148475, "loss": 5.0391, "mean_token_accuracy": 0.193899904191494, "num_tokens": 29222990.0, "step": 16845 }, { "entropy": 5.545821857452393, "epoch": 1.3109900797510212, "grad_norm": 1.0, "learning_rate": 0.0004830654068557952, "loss": 5.1508, "mean_token_accuracy": 0.19152772128582002, "num_tokens": 29232351.0, "step": 16850 }, { "entropy": 5.542147207260132, "epoch": 1.3113791091227387, "grad_norm": 1.0859375, "learning_rate": 0.0004830548564130444, "loss": 5.0257, "mean_token_accuracy": 0.1932461142539978, "num_tokens": 29240418.0, "step": 16855 }, { "entropy": 5.582463264465332, "epoch": 1.3117681384944564, "grad_norm": 1.125, "learning_rate": 0.00048304430281339216, "loss": 5.1347, "mean_token_accuracy": 0.18552854508161545, "num_tokens": 29248975.0, "step": 16860 }, { "entropy": 5.5090912818908695, "epoch": 1.3121571678661739, "grad_norm": 1.0625, "learning_rate": 0.0004830337460569989, "loss": 5.0984, "mean_token_accuracy": 0.1883203610777855, "num_tokens": 29257866.0, "step": 16865 }, { "entropy": 5.474271965026856, "epoch": 1.3125461972378916, "grad_norm": 1.2578125, "learning_rate": 0.0004830231861440246, "loss": 4.8757, "mean_token_accuracy": 0.21279923170804976, "num_tokens": 29266057.0, "step": 16870 }, { "entropy": 5.5117003440856935, "epoch": 1.312935226609609, "grad_norm": 1.09375, "learning_rate": 0.0004830126230746295, "loss": 5.0607, "mean_token_accuracy": 0.18454205989837646, "num_tokens": 29274752.0, "step": 16875 }, { "entropy": 5.613013696670532, "epoch": 1.3133242559813265, "grad_norm": 1.1015625, "learning_rate": 0.00048300205684897405, "loss": 5.1306, "mean_token_accuracy": 0.19098128378391266, "num_tokens": 29282781.0, "step": 16880 }, { "entropy": 5.475628328323364, "epoch": 1.3137132853530442, "grad_norm": 1.109375, "learning_rate": 0.0004829914874672184, "loss": 5.0534, "mean_token_accuracy": 0.19169478118419647, "num_tokens": 29291196.0, "step": 16885 }, { "entropy": 5.583435916900635, "epoch": 1.3141023147247617, "grad_norm": 1.0390625, "learning_rate": 0.00048298091492952297, "loss": 5.1596, "mean_token_accuracy": 0.1891287937760353, "num_tokens": 29300168.0, "step": 16890 }, { "entropy": 5.521982192993164, "epoch": 1.3144913440964792, "grad_norm": 1.0703125, "learning_rate": 0.0004829703392360482, "loss": 4.9868, "mean_token_accuracy": 0.19752004295587539, "num_tokens": 29308468.0, "step": 16895 }, { "entropy": 5.461196708679199, "epoch": 1.3148803734681969, "grad_norm": 1.1640625, "learning_rate": 0.00048295976038695455, "loss": 5.014, "mean_token_accuracy": 0.19455623328685762, "num_tokens": 29317096.0, "step": 16900 }, { "entropy": 5.596332025527954, "epoch": 1.3152694028399143, "grad_norm": 1.109375, "learning_rate": 0.0004829491783824025, "loss": 5.1337, "mean_token_accuracy": 0.18295662105083466, "num_tokens": 29325840.0, "step": 16905 }, { "entropy": 5.521242332458496, "epoch": 1.315658432211632, "grad_norm": 1.109375, "learning_rate": 0.00048293859322255276, "loss": 5.0681, "mean_token_accuracy": 0.1902342215180397, "num_tokens": 29333874.0, "step": 16910 }, { "entropy": 5.494735956192017, "epoch": 1.3160474615833495, "grad_norm": 1.1328125, "learning_rate": 0.0004829280049075657, "loss": 5.0425, "mean_token_accuracy": 0.19313441962003708, "num_tokens": 29341937.0, "step": 16915 }, { "entropy": 5.5786505222320555, "epoch": 1.3164364909550672, "grad_norm": 1.0546875, "learning_rate": 0.00048291741343760216, "loss": 5.2717, "mean_token_accuracy": 0.1801562190055847, "num_tokens": 29350231.0, "step": 16920 }, { "entropy": 5.600649070739746, "epoch": 1.3168255203267847, "grad_norm": 1.03125, "learning_rate": 0.0004829068188128229, "loss": 5.1216, "mean_token_accuracy": 0.18767827451229097, "num_tokens": 29359036.0, "step": 16925 }, { "entropy": 5.596075630187988, "epoch": 1.3172145496985022, "grad_norm": 1.0078125, "learning_rate": 0.0004828962210333885, "loss": 5.0131, "mean_token_accuracy": 0.1926293656229973, "num_tokens": 29368063.0, "step": 16930 }, { "entropy": 5.549309301376343, "epoch": 1.3176035790702199, "grad_norm": 1.015625, "learning_rate": 0.0004828856200994598, "loss": 4.9792, "mean_token_accuracy": 0.19313064217567444, "num_tokens": 29376653.0, "step": 16935 }, { "entropy": 5.4434631824493405, "epoch": 1.3179926084419373, "grad_norm": 1.078125, "learning_rate": 0.0004828750160111978, "loss": 4.9962, "mean_token_accuracy": 0.19856809377670287, "num_tokens": 29384978.0, "step": 16940 }, { "entropy": 5.543447637557984, "epoch": 1.3183816378136548, "grad_norm": 1.0703125, "learning_rate": 0.00048286440876876325, "loss": 5.1778, "mean_token_accuracy": 0.18417336344718932, "num_tokens": 29393927.0, "step": 16945 }, { "entropy": 5.6597637176513675, "epoch": 1.3187706671853725, "grad_norm": 1.140625, "learning_rate": 0.00048285379837231714, "loss": 5.1592, "mean_token_accuracy": 0.1907750189304352, "num_tokens": 29402393.0, "step": 16950 }, { "entropy": 5.596665906906128, "epoch": 1.31915969655709, "grad_norm": 1.0859375, "learning_rate": 0.0004828431848220205, "loss": 5.0866, "mean_token_accuracy": 0.19380646497011184, "num_tokens": 29411011.0, "step": 16955 }, { "entropy": 5.568461275100708, "epoch": 1.3195487259288077, "grad_norm": 1.0859375, "learning_rate": 0.0004828325681180343, "loss": 5.1207, "mean_token_accuracy": 0.19099632948637008, "num_tokens": 29420095.0, "step": 16960 }, { "entropy": 5.497038459777832, "epoch": 1.3199377553005252, "grad_norm": 1.0234375, "learning_rate": 0.0004828219482605197, "loss": 5.1141, "mean_token_accuracy": 0.1903443455696106, "num_tokens": 29429274.0, "step": 16965 }, { "entropy": 5.571932554244995, "epoch": 1.3203267846722428, "grad_norm": 1.1015625, "learning_rate": 0.00048281132524963786, "loss": 5.0904, "mean_token_accuracy": 0.18905908316373826, "num_tokens": 29437572.0, "step": 16970 }, { "entropy": 5.575651502609253, "epoch": 1.3207158140439603, "grad_norm": 1.1015625, "learning_rate": 0.0004828006990855499, "loss": 5.0927, "mean_token_accuracy": 0.1965946525335312, "num_tokens": 29446294.0, "step": 16975 }, { "entropy": 5.53357310295105, "epoch": 1.3211048434156778, "grad_norm": 1.0703125, "learning_rate": 0.00048279006976841704, "loss": 5.0855, "mean_token_accuracy": 0.19520663619041442, "num_tokens": 29454710.0, "step": 16980 }, { "entropy": 5.566244173049927, "epoch": 1.3214938727873955, "grad_norm": 1.078125, "learning_rate": 0.0004827794372984007, "loss": 5.1002, "mean_token_accuracy": 0.19349435567855836, "num_tokens": 29463067.0, "step": 16985 }, { "entropy": 5.5838337421417235, "epoch": 1.321882902159113, "grad_norm": 1.125, "learning_rate": 0.000482768801675662, "loss": 5.0977, "mean_token_accuracy": 0.18365587443113326, "num_tokens": 29471636.0, "step": 16990 }, { "entropy": 5.564790916442871, "epoch": 1.3222719315308304, "grad_norm": 1.0859375, "learning_rate": 0.0004827581629003625, "loss": 5.1014, "mean_token_accuracy": 0.18674546778202056, "num_tokens": 29480772.0, "step": 16995 }, { "entropy": 5.511761951446533, "epoch": 1.3226609609025481, "grad_norm": 1.1171875, "learning_rate": 0.00048274752097266356, "loss": 5.0233, "mean_token_accuracy": 0.19414925277233125, "num_tokens": 29489113.0, "step": 17000 }, { "entropy": 5.58471531867981, "epoch": 1.3230499902742658, "grad_norm": 1.1875, "learning_rate": 0.0004827368758927266, "loss": 5.0872, "mean_token_accuracy": 0.18929480016231537, "num_tokens": 29497721.0, "step": 17005 }, { "entropy": 5.56621208190918, "epoch": 1.3234390196459833, "grad_norm": 1.0078125, "learning_rate": 0.0004827262276607132, "loss": 5.0733, "mean_token_accuracy": 0.19433894902467727, "num_tokens": 29506452.0, "step": 17010 }, { "entropy": 5.548946380615234, "epoch": 1.3238280490177008, "grad_norm": 1.125, "learning_rate": 0.000482715576276785, "loss": 5.0384, "mean_token_accuracy": 0.20166357308626176, "num_tokens": 29514635.0, "step": 17015 }, { "entropy": 5.54018816947937, "epoch": 1.3242170783894185, "grad_norm": 1.0625, "learning_rate": 0.0004827049217411035, "loss": 5.1002, "mean_token_accuracy": 0.19287697076797486, "num_tokens": 29523929.0, "step": 17020 }, { "entropy": 5.5417359352111815, "epoch": 1.324606107761136, "grad_norm": 1.1171875, "learning_rate": 0.00048269426405383043, "loss": 5.0474, "mean_token_accuracy": 0.19059230238199235, "num_tokens": 29533125.0, "step": 17025 }, { "entropy": 5.5793375968933105, "epoch": 1.3249951371328534, "grad_norm": 1.125, "learning_rate": 0.00048268360321512745, "loss": 5.073, "mean_token_accuracy": 0.19786023050546647, "num_tokens": 29541604.0, "step": 17030 }, { "entropy": 5.544698810577392, "epoch": 1.3253841665045711, "grad_norm": 1.0703125, "learning_rate": 0.0004826729392251564, "loss": 5.0605, "mean_token_accuracy": 0.19133825451135636, "num_tokens": 29550100.0, "step": 17035 }, { "entropy": 5.570048522949219, "epoch": 1.3257731958762886, "grad_norm": 1.0078125, "learning_rate": 0.000482662272084079, "loss": 5.1104, "mean_token_accuracy": 0.19358215034008025, "num_tokens": 29559490.0, "step": 17040 }, { "entropy": 5.615035057067871, "epoch": 1.326162225248006, "grad_norm": 1.0234375, "learning_rate": 0.0004826516017920571, "loss": 5.1205, "mean_token_accuracy": 0.18496095687150954, "num_tokens": 29568734.0, "step": 17045 }, { "entropy": 5.547100830078125, "epoch": 1.3265512546197238, "grad_norm": 1.03125, "learning_rate": 0.0004826409283492528, "loss": 5.1116, "mean_token_accuracy": 0.19156256914138795, "num_tokens": 29577339.0, "step": 17050 }, { "entropy": 5.584833860397339, "epoch": 1.3269402839914415, "grad_norm": 1.0703125, "learning_rate": 0.00048263025175582783, "loss": 5.1976, "mean_token_accuracy": 0.19031539410352707, "num_tokens": 29585561.0, "step": 17055 }, { "entropy": 5.590192222595215, "epoch": 1.327329313363159, "grad_norm": 1.015625, "learning_rate": 0.0004826195720119442, "loss": 5.149, "mean_token_accuracy": 0.18740127831697465, "num_tokens": 29594663.0, "step": 17060 }, { "entropy": 5.579362535476685, "epoch": 1.3277183427348764, "grad_norm": 1.0390625, "learning_rate": 0.0004826088891177641, "loss": 5.0997, "mean_token_accuracy": 0.1987200930714607, "num_tokens": 29603537.0, "step": 17065 }, { "entropy": 5.585401487350464, "epoch": 1.3281073721065941, "grad_norm": 1.09375, "learning_rate": 0.00048259820307344954, "loss": 5.1126, "mean_token_accuracy": 0.1905766546726227, "num_tokens": 29612234.0, "step": 17070 }, { "entropy": 5.503373813629151, "epoch": 1.3284964014783116, "grad_norm": 1.09375, "learning_rate": 0.00048258751387916267, "loss": 4.9366, "mean_token_accuracy": 0.19185809940099716, "num_tokens": 29621435.0, "step": 17075 }, { "entropy": 5.664137601852417, "epoch": 1.328885430850029, "grad_norm": 1.0234375, "learning_rate": 0.00048257682153506564, "loss": 5.2303, "mean_token_accuracy": 0.17861356735229492, "num_tokens": 29630266.0, "step": 17080 }, { "entropy": 5.458787488937378, "epoch": 1.3292744602217468, "grad_norm": 0.9921875, "learning_rate": 0.0004825661260413208, "loss": 5.0096, "mean_token_accuracy": 0.19340803176164628, "num_tokens": 29639118.0, "step": 17085 }, { "entropy": 5.521864509582519, "epoch": 1.3296634895934643, "grad_norm": 1.046875, "learning_rate": 0.00048255542739809035, "loss": 5.1025, "mean_token_accuracy": 0.20288635194301605, "num_tokens": 29647616.0, "step": 17090 }, { "entropy": 5.561450338363647, "epoch": 1.330052518965182, "grad_norm": 1.203125, "learning_rate": 0.00048254472560553665, "loss": 5.0474, "mean_token_accuracy": 0.1973179504275322, "num_tokens": 29656264.0, "step": 17095 }, { "entropy": 5.570484781265259, "epoch": 1.3304415483368994, "grad_norm": 1.1640625, "learning_rate": 0.00048253402066382207, "loss": 5.0627, "mean_token_accuracy": 0.19405226409435272, "num_tokens": 29664452.0, "step": 17100 }, { "entropy": 5.511818265914917, "epoch": 1.3308305777086171, "grad_norm": 1.140625, "learning_rate": 0.0004825233125731091, "loss": 5.0165, "mean_token_accuracy": 0.19939734488725663, "num_tokens": 29673456.0, "step": 17105 }, { "entropy": 5.57314248085022, "epoch": 1.3312196070803346, "grad_norm": 0.98828125, "learning_rate": 0.00048251260133356014, "loss": 5.1289, "mean_token_accuracy": 0.19184859246015548, "num_tokens": 29682232.0, "step": 17110 }, { "entropy": 5.54777045249939, "epoch": 1.331608636452052, "grad_norm": 1.0859375, "learning_rate": 0.00048250188694533774, "loss": 5.0595, "mean_token_accuracy": 0.19385070353746414, "num_tokens": 29690421.0, "step": 17115 }, { "entropy": 5.506200122833252, "epoch": 1.3319976658237698, "grad_norm": 1.0234375, "learning_rate": 0.0004824911694086044, "loss": 5.0296, "mean_token_accuracy": 0.1933899015188217, "num_tokens": 29698844.0, "step": 17120 }, { "entropy": 5.524581670761108, "epoch": 1.3323866951954872, "grad_norm": 1.1875, "learning_rate": 0.000482480448723523, "loss": 5.0486, "mean_token_accuracy": 0.19347066134214402, "num_tokens": 29706738.0, "step": 17125 }, { "entropy": 5.575308322906494, "epoch": 1.3327757245672047, "grad_norm": 1.09375, "learning_rate": 0.00048246972489025586, "loss": 5.1149, "mean_token_accuracy": 0.1941054105758667, "num_tokens": 29715812.0, "step": 17130 }, { "entropy": 5.470225143432617, "epoch": 1.3331647539389224, "grad_norm": 1.125, "learning_rate": 0.00048245899790896597, "loss": 5.0258, "mean_token_accuracy": 0.19654451608657836, "num_tokens": 29724488.0, "step": 17135 }, { "entropy": 5.497026968002319, "epoch": 1.33355378331064, "grad_norm": 1.0078125, "learning_rate": 0.0004824482677798159, "loss": 5.0152, "mean_token_accuracy": 0.19580332636833192, "num_tokens": 29733565.0, "step": 17140 }, { "entropy": 5.535616779327393, "epoch": 1.3339428126823576, "grad_norm": 1.0625, "learning_rate": 0.00048243753450296863, "loss": 5.0841, "mean_token_accuracy": 0.19178022295236588, "num_tokens": 29742437.0, "step": 17145 }, { "entropy": 5.516560745239258, "epoch": 1.334331842054075, "grad_norm": 1.109375, "learning_rate": 0.00048242679807858693, "loss": 5.1192, "mean_token_accuracy": 0.19362313747406007, "num_tokens": 29751636.0, "step": 17150 }, { "entropy": 5.550734949111939, "epoch": 1.3347208714257928, "grad_norm": 1.109375, "learning_rate": 0.00048241605850683365, "loss": 5.0777, "mean_token_accuracy": 0.19447147697210312, "num_tokens": 29760199.0, "step": 17155 }, { "entropy": 5.536418628692627, "epoch": 1.3351099007975102, "grad_norm": 1.078125, "learning_rate": 0.00048240531578787197, "loss": 5.0308, "mean_token_accuracy": 0.19409858137369157, "num_tokens": 29769169.0, "step": 17160 }, { "entropy": 5.489167070388794, "epoch": 1.3354989301692277, "grad_norm": 1.109375, "learning_rate": 0.0004823945699218647, "loss": 5.0407, "mean_token_accuracy": 0.1989681139588356, "num_tokens": 29777218.0, "step": 17165 }, { "entropy": 5.495042419433593, "epoch": 1.3358879595409454, "grad_norm": 1.0546875, "learning_rate": 0.0004823838209089749, "loss": 5.0668, "mean_token_accuracy": 0.19311856478452682, "num_tokens": 29786221.0, "step": 17170 }, { "entropy": 5.523098993301391, "epoch": 1.3362769889126629, "grad_norm": 1.1015625, "learning_rate": 0.00048237306874936565, "loss": 5.08, "mean_token_accuracy": 0.19691094160079955, "num_tokens": 29794659.0, "step": 17175 }, { "entropy": 5.633066940307617, "epoch": 1.3366660182843804, "grad_norm": 2.515625, "learning_rate": 0.0004823623134432001, "loss": 5.0472, "mean_token_accuracy": 0.19790503978729249, "num_tokens": 29804237.0, "step": 17180 }, { "entropy": 5.6385585308074955, "epoch": 1.337055047656098, "grad_norm": 1.1015625, "learning_rate": 0.00048235155499064166, "loss": 5.1881, "mean_token_accuracy": 0.184498929977417, "num_tokens": 29813521.0, "step": 17185 }, { "entropy": 5.594071340560913, "epoch": 1.3374440770278155, "grad_norm": 1.1171875, "learning_rate": 0.00048234079339185335, "loss": 5.237, "mean_token_accuracy": 0.18629571944475173, "num_tokens": 29822123.0, "step": 17190 }, { "entropy": 5.502989482879639, "epoch": 1.3378331063995332, "grad_norm": 1.0546875, "learning_rate": 0.00048233002864699856, "loss": 5.1601, "mean_token_accuracy": 0.18385013639926912, "num_tokens": 29830557.0, "step": 17195 }, { "entropy": 5.520954608917236, "epoch": 1.3382221357712507, "grad_norm": 1.0703125, "learning_rate": 0.0004823192607562405, "loss": 5.0667, "mean_token_accuracy": 0.194867080450058, "num_tokens": 29839566.0, "step": 17200 }, { "entropy": 5.601248121261596, "epoch": 1.3386111651429684, "grad_norm": 1.1328125, "learning_rate": 0.00048230848971974265, "loss": 5.0428, "mean_token_accuracy": 0.20042723566293716, "num_tokens": 29847808.0, "step": 17205 }, { "entropy": 5.4879958152771, "epoch": 1.3390001945146859, "grad_norm": 1.09375, "learning_rate": 0.0004822977155376684, "loss": 4.9988, "mean_token_accuracy": 0.20270709097385406, "num_tokens": 29855974.0, "step": 17210 }, { "entropy": 5.571926546096802, "epoch": 1.3393892238864034, "grad_norm": 1.0390625, "learning_rate": 0.0004822869382101814, "loss": 5.136, "mean_token_accuracy": 0.1920250728726387, "num_tokens": 29864910.0, "step": 17215 }, { "entropy": 5.625982141494751, "epoch": 1.339778253258121, "grad_norm": 1.1015625, "learning_rate": 0.0004822761577374449, "loss": 5.2151, "mean_token_accuracy": 0.19120696932077408, "num_tokens": 29873668.0, "step": 17220 }, { "entropy": 5.5760826587677, "epoch": 1.3401672826298385, "grad_norm": 1.078125, "learning_rate": 0.0004822653741196227, "loss": 5.1415, "mean_token_accuracy": 0.18591861426830292, "num_tokens": 29882099.0, "step": 17225 }, { "entropy": 5.535925483703613, "epoch": 1.340556312001556, "grad_norm": 1.125, "learning_rate": 0.0004822545873568783, "loss": 5.0379, "mean_token_accuracy": 0.19539906531572343, "num_tokens": 29891022.0, "step": 17230 }, { "entropy": 5.546085500717163, "epoch": 1.3409453413732737, "grad_norm": 1.140625, "learning_rate": 0.00048224379744937545, "loss": 5.0529, "mean_token_accuracy": 0.19310175329446794, "num_tokens": 29899270.0, "step": 17235 }, { "entropy": 5.615219831466675, "epoch": 1.3413343707449912, "grad_norm": 1.0703125, "learning_rate": 0.00048223300439727783, "loss": 5.206, "mean_token_accuracy": 0.18002142757177353, "num_tokens": 29908183.0, "step": 17240 }, { "entropy": 5.563795042037964, "epoch": 1.3417234001167089, "grad_norm": 1.140625, "learning_rate": 0.00048222220820074926, "loss": 5.1018, "mean_token_accuracy": 0.1916158065199852, "num_tokens": 29917148.0, "step": 17245 }, { "entropy": 5.512511825561523, "epoch": 1.3421124294884264, "grad_norm": 1.0546875, "learning_rate": 0.00048221140885995346, "loss": 5.0026, "mean_token_accuracy": 0.19769910722970963, "num_tokens": 29926251.0, "step": 17250 }, { "entropy": 5.530306577682495, "epoch": 1.342501458860144, "grad_norm": 1.109375, "learning_rate": 0.0004822006063750543, "loss": 5.1042, "mean_token_accuracy": 0.19200302064418792, "num_tokens": 29935000.0, "step": 17255 }, { "entropy": 5.507564449310303, "epoch": 1.3428904882318615, "grad_norm": 1.1484375, "learning_rate": 0.00048218980074621575, "loss": 4.9698, "mean_token_accuracy": 0.2049358531832695, "num_tokens": 29943046.0, "step": 17260 }, { "entropy": 5.573336172103882, "epoch": 1.343279517603579, "grad_norm": 1.09375, "learning_rate": 0.00048217899197360183, "loss": 5.0979, "mean_token_accuracy": 0.198435178399086, "num_tokens": 29952254.0, "step": 17265 }, { "entropy": 5.525434827804565, "epoch": 1.3436685469752967, "grad_norm": 1.078125, "learning_rate": 0.0004821681800573764, "loss": 5.0396, "mean_token_accuracy": 0.19268448203802108, "num_tokens": 29961458.0, "step": 17270 }, { "entropy": 5.5640153884887695, "epoch": 1.3440575763470142, "grad_norm": 1.078125, "learning_rate": 0.0004821573649977036, "loss": 5.0256, "mean_token_accuracy": 0.1973084717988968, "num_tokens": 29969865.0, "step": 17275 }, { "entropy": 5.550653266906738, "epoch": 1.3444466057187316, "grad_norm": 1.171875, "learning_rate": 0.00048214654679474753, "loss": 5.0746, "mean_token_accuracy": 0.1897326171398163, "num_tokens": 29978260.0, "step": 17280 }, { "entropy": 5.606057167053223, "epoch": 1.3448356350904493, "grad_norm": 1.046875, "learning_rate": 0.00048213572544867224, "loss": 5.1973, "mean_token_accuracy": 0.18544671088457107, "num_tokens": 29987528.0, "step": 17285 }, { "entropy": 5.518161153793335, "epoch": 1.3452246644621668, "grad_norm": 1.0546875, "learning_rate": 0.00048212490095964213, "loss": 5.0575, "mean_token_accuracy": 0.19070298969745636, "num_tokens": 29995991.0, "step": 17290 }, { "entropy": 5.534142112731933, "epoch": 1.3456136938338845, "grad_norm": 1.1484375, "learning_rate": 0.0004821140733278212, "loss": 5.0206, "mean_token_accuracy": 0.19996231347322463, "num_tokens": 30004569.0, "step": 17295 }, { "entropy": 5.529383659362793, "epoch": 1.346002723205602, "grad_norm": 1.0078125, "learning_rate": 0.0004821032425533739, "loss": 5.1041, "mean_token_accuracy": 0.18919869661331176, "num_tokens": 30014021.0, "step": 17300 }, { "entropy": 5.469987964630127, "epoch": 1.3463917525773197, "grad_norm": 1.0859375, "learning_rate": 0.0004820924086364646, "loss": 4.9352, "mean_token_accuracy": 0.20385448038578033, "num_tokens": 30021803.0, "step": 17305 }, { "entropy": 5.516771030426026, "epoch": 1.3467807819490372, "grad_norm": 1.0078125, "learning_rate": 0.00048208157157725756, "loss": 5.0925, "mean_token_accuracy": 0.19108467251062394, "num_tokens": 30030707.0, "step": 17310 }, { "entropy": 5.549346971511841, "epoch": 1.3471698113207546, "grad_norm": 1.0, "learning_rate": 0.00048207073137591726, "loss": 5.1112, "mean_token_accuracy": 0.18445343524217606, "num_tokens": 30040235.0, "step": 17315 }, { "entropy": 5.598133659362793, "epoch": 1.3475588406924723, "grad_norm": 1.1171875, "learning_rate": 0.00048205988803260824, "loss": 5.1285, "mean_token_accuracy": 0.19644527435302733, "num_tokens": 30049361.0, "step": 17320 }, { "entropy": 5.528952169418335, "epoch": 1.3479478700641898, "grad_norm": 1.09375, "learning_rate": 0.00048204904154749496, "loss": 5.1159, "mean_token_accuracy": 0.18499295711517333, "num_tokens": 30058896.0, "step": 17325 }, { "entropy": 5.568205213546753, "epoch": 1.3483368994359073, "grad_norm": 1.0390625, "learning_rate": 0.00048203819192074206, "loss": 5.1521, "mean_token_accuracy": 0.18118689507246016, "num_tokens": 30067206.0, "step": 17330 }, { "entropy": 5.555024909973144, "epoch": 1.348725928807625, "grad_norm": 1.015625, "learning_rate": 0.00048202733915251407, "loss": 5.0281, "mean_token_accuracy": 0.19470204561948776, "num_tokens": 30076286.0, "step": 17335 }, { "entropy": 5.44329800605774, "epoch": 1.3491149581793425, "grad_norm": 1.0703125, "learning_rate": 0.00048201648324297573, "loss": 4.9588, "mean_token_accuracy": 0.20081797987222672, "num_tokens": 30084681.0, "step": 17340 }, { "entropy": 5.512643909454345, "epoch": 1.3495039875510602, "grad_norm": 1.0546875, "learning_rate": 0.00048200562419229185, "loss": 5.0514, "mean_token_accuracy": 0.19549221992492677, "num_tokens": 30093293.0, "step": 17345 }, { "entropy": 5.449461841583252, "epoch": 1.3498930169227776, "grad_norm": 1.0234375, "learning_rate": 0.000481994762000627, "loss": 4.9349, "mean_token_accuracy": 0.20087518393993378, "num_tokens": 30101593.0, "step": 17350 }, { "entropy": 5.530607843399048, "epoch": 1.3502820462944953, "grad_norm": 1.0234375, "learning_rate": 0.00048198389666814616, "loss": 5.0916, "mean_token_accuracy": 0.19343987554311753, "num_tokens": 30110328.0, "step": 17355 }, { "entropy": 5.516254901885986, "epoch": 1.3506710756662128, "grad_norm": 1.109375, "learning_rate": 0.00048197302819501416, "loss": 5.0393, "mean_token_accuracy": 0.19622886925935745, "num_tokens": 30118721.0, "step": 17360 }, { "entropy": 5.477045249938965, "epoch": 1.3510601050379303, "grad_norm": 1.1171875, "learning_rate": 0.00048196215658139586, "loss": 5.0042, "mean_token_accuracy": 0.19018379598855972, "num_tokens": 30127238.0, "step": 17365 }, { "entropy": 5.526407670974732, "epoch": 1.351449134409648, "grad_norm": 1.140625, "learning_rate": 0.0004819512818274562, "loss": 5.0353, "mean_token_accuracy": 0.2038662001490593, "num_tokens": 30135049.0, "step": 17370 }, { "entropy": 5.424387216567993, "epoch": 1.3518381637813655, "grad_norm": 1.0859375, "learning_rate": 0.0004819404039333603, "loss": 5.0461, "mean_token_accuracy": 0.1919907882809639, "num_tokens": 30143991.0, "step": 17375 }, { "entropy": 5.522161674499512, "epoch": 1.352227193153083, "grad_norm": 1.0703125, "learning_rate": 0.0004819295228992731, "loss": 5.2156, "mean_token_accuracy": 0.18929981142282487, "num_tokens": 30153968.0, "step": 17380 }, { "entropy": 5.609177446365356, "epoch": 1.3526162225248006, "grad_norm": 1.0234375, "learning_rate": 0.00048191863872535984, "loss": 5.0856, "mean_token_accuracy": 0.1902516633272171, "num_tokens": 30162927.0, "step": 17385 }, { "entropy": 5.481770992279053, "epoch": 1.3530052518965183, "grad_norm": 1.0546875, "learning_rate": 0.0004819077514117855, "loss": 5.0346, "mean_token_accuracy": 0.1989766389131546, "num_tokens": 30170986.0, "step": 17390 }, { "entropy": 5.463718700408935, "epoch": 1.3533942812682358, "grad_norm": 1.0234375, "learning_rate": 0.00048189686095871545, "loss": 5.0041, "mean_token_accuracy": 0.1992361754179001, "num_tokens": 30179167.0, "step": 17395 }, { "entropy": 5.458646011352539, "epoch": 1.3537833106399533, "grad_norm": 1.0546875, "learning_rate": 0.00048188596736631475, "loss": 5.0437, "mean_token_accuracy": 0.19699607342481612, "num_tokens": 30187710.0, "step": 17400 }, { "entropy": 5.553326225280761, "epoch": 1.354172340011671, "grad_norm": 1.0703125, "learning_rate": 0.00048187507063474885, "loss": 5.1338, "mean_token_accuracy": 0.18640226572752, "num_tokens": 30196502.0, "step": 17405 }, { "entropy": 5.462544345855713, "epoch": 1.3545613693833884, "grad_norm": 1.078125, "learning_rate": 0.00048186417076418294, "loss": 4.9939, "mean_token_accuracy": 0.1955580770969391, "num_tokens": 30205070.0, "step": 17410 }, { "entropy": 5.543238115310669, "epoch": 1.354950398755106, "grad_norm": 1.125, "learning_rate": 0.00048185326775478256, "loss": 5.0393, "mean_token_accuracy": 0.18706042766571046, "num_tokens": 30213554.0, "step": 17415 }, { "entropy": 5.483227920532227, "epoch": 1.3553394281268236, "grad_norm": 1.03125, "learning_rate": 0.00048184236160671306, "loss": 4.9761, "mean_token_accuracy": 0.20332834869623184, "num_tokens": 30222687.0, "step": 17420 }, { "entropy": 5.5133203029632565, "epoch": 1.355728457498541, "grad_norm": 1.1171875, "learning_rate": 0.00048183145232013995, "loss": 5.072, "mean_token_accuracy": 0.19130380749702453, "num_tokens": 30231086.0, "step": 17425 }, { "entropy": 5.485704803466797, "epoch": 1.3561174868702586, "grad_norm": 1.046875, "learning_rate": 0.00048182053989522883, "loss": 4.9537, "mean_token_accuracy": 0.2014792174100876, "num_tokens": 30240355.0, "step": 17430 }, { "entropy": 5.569774198532104, "epoch": 1.3565065162419763, "grad_norm": 1.1171875, "learning_rate": 0.00048180962433214515, "loss": 5.15, "mean_token_accuracy": 0.19234966337680817, "num_tokens": 30249586.0, "step": 17435 }, { "entropy": 5.547904682159424, "epoch": 1.356895545613694, "grad_norm": 1.1640625, "learning_rate": 0.00048179870563105453, "loss": 5.0935, "mean_token_accuracy": 0.19593169242143632, "num_tokens": 30257666.0, "step": 17440 }, { "entropy": 5.550372171401977, "epoch": 1.3572845749854114, "grad_norm": 1.125, "learning_rate": 0.0004817877837921228, "loss": 5.229, "mean_token_accuracy": 0.19217306077480317, "num_tokens": 30266846.0, "step": 17445 }, { "entropy": 5.446268033981323, "epoch": 1.357673604357129, "grad_norm": 1.03125, "learning_rate": 0.0004817768588155155, "loss": 4.9776, "mean_token_accuracy": 0.19456330835819244, "num_tokens": 30275587.0, "step": 17450 }, { "entropy": 5.561713695526123, "epoch": 1.3580626337288466, "grad_norm": 1.1171875, "learning_rate": 0.00048176593070139865, "loss": 5.0496, "mean_token_accuracy": 0.20146099478006363, "num_tokens": 30283948.0, "step": 17455 }, { "entropy": 5.643451118469239, "epoch": 1.358451663100564, "grad_norm": 1.125, "learning_rate": 0.00048175499944993767, "loss": 5.2124, "mean_token_accuracy": 0.1894126206636429, "num_tokens": 30292302.0, "step": 17460 }, { "entropy": 5.5926961421966555, "epoch": 1.3588406924722816, "grad_norm": 1.171875, "learning_rate": 0.00048174406506129884, "loss": 5.186, "mean_token_accuracy": 0.18452011346817015, "num_tokens": 30301414.0, "step": 17465 }, { "entropy": 5.552249002456665, "epoch": 1.3592297218439993, "grad_norm": 1.0625, "learning_rate": 0.00048173312753564787, "loss": 5.0729, "mean_token_accuracy": 0.20139701813459396, "num_tokens": 30311045.0, "step": 17470 }, { "entropy": 5.586303615570069, "epoch": 1.3596187512157167, "grad_norm": 1.0703125, "learning_rate": 0.0004817221868731506, "loss": 5.005, "mean_token_accuracy": 0.1986134320497513, "num_tokens": 30318552.0, "step": 17475 }, { "entropy": 5.495107173919678, "epoch": 1.3600077805874344, "grad_norm": 1.015625, "learning_rate": 0.00048171124307397334, "loss": 5.0857, "mean_token_accuracy": 0.19810188561677933, "num_tokens": 30327583.0, "step": 17480 }, { "entropy": 5.521865129470825, "epoch": 1.360396809959152, "grad_norm": 1.1015625, "learning_rate": 0.0004817002961382819, "loss": 5.0592, "mean_token_accuracy": 0.18634839355945587, "num_tokens": 30336339.0, "step": 17485 }, { "entropy": 5.625015163421631, "epoch": 1.3607858393308696, "grad_norm": 1.0859375, "learning_rate": 0.00048168934606624255, "loss": 5.1226, "mean_token_accuracy": 0.19342471957206725, "num_tokens": 30344878.0, "step": 17490 }, { "entropy": 5.586599588394165, "epoch": 1.361174868702587, "grad_norm": 1.1015625, "learning_rate": 0.00048167839285802116, "loss": 5.0787, "mean_token_accuracy": 0.19287993162870407, "num_tokens": 30353071.0, "step": 17495 }, { "entropy": 5.5056556224822994, "epoch": 1.3615638980743046, "grad_norm": 1.1171875, "learning_rate": 0.0004816674365137843, "loss": 5.0506, "mean_token_accuracy": 0.19532282203435897, "num_tokens": 30361356.0, "step": 17500 }, { "entropy": 5.558404493331909, "epoch": 1.3619529274460223, "grad_norm": 1.1171875, "learning_rate": 0.000481656477033698, "loss": 5.097, "mean_token_accuracy": 0.18855647891759872, "num_tokens": 30370917.0, "step": 17505 }, { "entropy": 5.5510210514068605, "epoch": 1.3623419568177397, "grad_norm": 1.1015625, "learning_rate": 0.0004816455144179286, "loss": 5.1089, "mean_token_accuracy": 0.18662407100200654, "num_tokens": 30380304.0, "step": 17510 }, { "entropy": 5.591496849060059, "epoch": 1.3627309861894572, "grad_norm": 1.0859375, "learning_rate": 0.0004816345486666424, "loss": 5.0659, "mean_token_accuracy": 0.19884781241416932, "num_tokens": 30388565.0, "step": 17515 }, { "entropy": 5.555974531173706, "epoch": 1.363120015561175, "grad_norm": 1.0859375, "learning_rate": 0.0004816235797800058, "loss": 5.1952, "mean_token_accuracy": 0.1866992712020874, "num_tokens": 30397220.0, "step": 17520 }, { "entropy": 5.5632835865020756, "epoch": 1.3635090449328924, "grad_norm": 1.125, "learning_rate": 0.0004816126077581852, "loss": 5.0455, "mean_token_accuracy": 0.19152604341506957, "num_tokens": 30405235.0, "step": 17525 }, { "entropy": 5.5325346946716305, "epoch": 1.36389807430461, "grad_norm": 1.0234375, "learning_rate": 0.00048160163260134724, "loss": 5.0788, "mean_token_accuracy": 0.19554029256105424, "num_tokens": 30414218.0, "step": 17530 }, { "entropy": 5.533689832687378, "epoch": 1.3642871036763276, "grad_norm": 1.0859375, "learning_rate": 0.0004815906543096583, "loss": 5.0688, "mean_token_accuracy": 0.19225286245346068, "num_tokens": 30422665.0, "step": 17535 }, { "entropy": 5.597603893280029, "epoch": 1.3646761330480452, "grad_norm": 1.015625, "learning_rate": 0.000481579672883285, "loss": 5.0665, "mean_token_accuracy": 0.19295754432678222, "num_tokens": 30431868.0, "step": 17540 }, { "entropy": 5.563905525207519, "epoch": 1.3650651624197627, "grad_norm": 1.0625, "learning_rate": 0.00048156868832239396, "loss": 5.0984, "mean_token_accuracy": 0.19357135146856308, "num_tokens": 30440548.0, "step": 17545 }, { "entropy": 5.612820816040039, "epoch": 1.3654541917914802, "grad_norm": 1.046875, "learning_rate": 0.0004815577006271519, "loss": 5.107, "mean_token_accuracy": 0.1858273297548294, "num_tokens": 30448959.0, "step": 17550 }, { "entropy": 5.549578523635864, "epoch": 1.365843221163198, "grad_norm": 1.0625, "learning_rate": 0.00048154670979772555, "loss": 5.0067, "mean_token_accuracy": 0.1936775639653206, "num_tokens": 30457193.0, "step": 17555 }, { "entropy": 5.617673444747925, "epoch": 1.3662322505349154, "grad_norm": 1.09375, "learning_rate": 0.0004815357158342815, "loss": 5.0603, "mean_token_accuracy": 0.1928393691778183, "num_tokens": 30466253.0, "step": 17560 }, { "entropy": 5.504837369918823, "epoch": 1.3666212799066328, "grad_norm": 1.046875, "learning_rate": 0.0004815247187369868, "loss": 5.0002, "mean_token_accuracy": 0.19440145492553712, "num_tokens": 30474675.0, "step": 17565 }, { "entropy": 5.5096807956695555, "epoch": 1.3670103092783505, "grad_norm": 1.09375, "learning_rate": 0.00048151371850600814, "loss": 5.0551, "mean_token_accuracy": 0.19820924252271652, "num_tokens": 30483031.0, "step": 17570 }, { "entropy": 5.4865306377410885, "epoch": 1.367399338650068, "grad_norm": 1.125, "learning_rate": 0.00048150271514151255, "loss": 5.046, "mean_token_accuracy": 0.1996690720319748, "num_tokens": 30491331.0, "step": 17575 }, { "entropy": 5.567302465438843, "epoch": 1.3677883680217857, "grad_norm": 1.0390625, "learning_rate": 0.00048149170864366693, "loss": 5.0718, "mean_token_accuracy": 0.1895716369152069, "num_tokens": 30499649.0, "step": 17580 }, { "entropy": 5.552460193634033, "epoch": 1.3681773973935032, "grad_norm": 1.09375, "learning_rate": 0.00048148069901263836, "loss": 4.9241, "mean_token_accuracy": 0.2029973477125168, "num_tokens": 30508922.0, "step": 17585 }, { "entropy": 5.554425764083862, "epoch": 1.368566426765221, "grad_norm": 1.1171875, "learning_rate": 0.00048146968624859375, "loss": 5.0264, "mean_token_accuracy": 0.1906637132167816, "num_tokens": 30517745.0, "step": 17590 }, { "entropy": 5.561997413635254, "epoch": 1.3689554561369384, "grad_norm": 1.0625, "learning_rate": 0.0004814586703517003, "loss": 5.1725, "mean_token_accuracy": 0.18585132211446762, "num_tokens": 30526597.0, "step": 17595 }, { "entropy": 5.625634670257568, "epoch": 1.3693444855086558, "grad_norm": 1.1484375, "learning_rate": 0.0004814476513221251, "loss": 5.0456, "mean_token_accuracy": 0.19574446380138397, "num_tokens": 30533969.0, "step": 17600 }, { "entropy": 5.574929046630859, "epoch": 1.3697335148803735, "grad_norm": 1.0703125, "learning_rate": 0.00048143662916003545, "loss": 5.1378, "mean_token_accuracy": 0.1855480492115021, "num_tokens": 30543277.0, "step": 17605 }, { "entropy": 5.545592212677002, "epoch": 1.370122544252091, "grad_norm": 1.1015625, "learning_rate": 0.0004814256038655985, "loss": 5.0936, "mean_token_accuracy": 0.18789495080709456, "num_tokens": 30551889.0, "step": 17610 }, { "entropy": 5.536072397232056, "epoch": 1.3705115736238085, "grad_norm": 1.0859375, "learning_rate": 0.0004814145754389816, "loss": 5.0829, "mean_token_accuracy": 0.1913012757897377, "num_tokens": 30560926.0, "step": 17615 }, { "entropy": 5.671560144424438, "epoch": 1.3709006029955262, "grad_norm": 1.140625, "learning_rate": 0.00048140354388035204, "loss": 5.1435, "mean_token_accuracy": 0.19485405534505845, "num_tokens": 30570102.0, "step": 17620 }, { "entropy": 5.581755828857422, "epoch": 1.3712896323672437, "grad_norm": 1.109375, "learning_rate": 0.0004813925091898772, "loss": 5.0918, "mean_token_accuracy": 0.1927666500210762, "num_tokens": 30578585.0, "step": 17625 }, { "entropy": 5.535369873046875, "epoch": 1.3716786617389614, "grad_norm": 1.125, "learning_rate": 0.0004813814713677246, "loss": 5.0933, "mean_token_accuracy": 0.19336114972829818, "num_tokens": 30587594.0, "step": 17630 }, { "entropy": 5.61983699798584, "epoch": 1.3720676911106788, "grad_norm": 1.1328125, "learning_rate": 0.0004813704304140616, "loss": 5.0836, "mean_token_accuracy": 0.19494630694389342, "num_tokens": 30596234.0, "step": 17635 }, { "entropy": 5.603211545944214, "epoch": 1.3724567204823965, "grad_norm": 1.046875, "learning_rate": 0.0004813593863290559, "loss": 5.147, "mean_token_accuracy": 0.18594459146261216, "num_tokens": 30605822.0, "step": 17640 }, { "entropy": 5.510393381118774, "epoch": 1.372845749854114, "grad_norm": 1.0703125, "learning_rate": 0.0004813483391128748, "loss": 5.0514, "mean_token_accuracy": 0.1931616932153702, "num_tokens": 30614154.0, "step": 17645 }, { "entropy": 5.618100214004516, "epoch": 1.3732347792258315, "grad_norm": 1.046875, "learning_rate": 0.0004813372887656862, "loss": 5.0828, "mean_token_accuracy": 0.19179718494415282, "num_tokens": 30622393.0, "step": 17650 }, { "entropy": 5.541427564620972, "epoch": 1.3736238085975492, "grad_norm": 1.0234375, "learning_rate": 0.0004813262352876576, "loss": 5.1205, "mean_token_accuracy": 0.1910390168428421, "num_tokens": 30632173.0, "step": 17655 }, { "entropy": 5.622989797592163, "epoch": 1.3740128379692667, "grad_norm": 1.1171875, "learning_rate": 0.00048131517867895684, "loss": 5.1983, "mean_token_accuracy": 0.18173278123140335, "num_tokens": 30640313.0, "step": 17660 }, { "entropy": 5.52795934677124, "epoch": 1.3744018673409841, "grad_norm": 1.1484375, "learning_rate": 0.00048130411893975155, "loss": 5.0029, "mean_token_accuracy": 0.19580224454402922, "num_tokens": 30648651.0, "step": 17665 }, { "entropy": 5.5542741298675535, "epoch": 1.3747908967127018, "grad_norm": 0.9921875, "learning_rate": 0.0004812930560702097, "loss": 5.1006, "mean_token_accuracy": 0.19334154576063156, "num_tokens": 30657782.0, "step": 17670 }, { "entropy": 5.537366247177124, "epoch": 1.3751799260844193, "grad_norm": 1.1484375, "learning_rate": 0.00048128199007049907, "loss": 5.082, "mean_token_accuracy": 0.19355205297470093, "num_tokens": 30666493.0, "step": 17675 }, { "entropy": 5.4715488910675045, "epoch": 1.375568955456137, "grad_norm": 1.015625, "learning_rate": 0.00048127092094078756, "loss": 4.9806, "mean_token_accuracy": 0.2011770337820053, "num_tokens": 30675054.0, "step": 17680 }, { "entropy": 5.539473390579223, "epoch": 1.3759579848278545, "grad_norm": 1.1640625, "learning_rate": 0.00048125984868124317, "loss": 5.0229, "mean_token_accuracy": 0.2033835917711258, "num_tokens": 30683927.0, "step": 17685 }, { "entropy": 5.433331632614136, "epoch": 1.3763470141995722, "grad_norm": 1.1171875, "learning_rate": 0.0004812487732920338, "loss": 4.9309, "mean_token_accuracy": 0.1994416147470474, "num_tokens": 30691670.0, "step": 17690 }, { "entropy": 5.42372727394104, "epoch": 1.3767360435712896, "grad_norm": 1.0546875, "learning_rate": 0.0004812376947733277, "loss": 4.9707, "mean_token_accuracy": 0.20664069801568985, "num_tokens": 30700312.0, "step": 17695 }, { "entropy": 5.493123483657837, "epoch": 1.3771250729430071, "grad_norm": 1.125, "learning_rate": 0.00048122661312529263, "loss": 5.0086, "mean_token_accuracy": 0.19914725422859192, "num_tokens": 30708975.0, "step": 17700 }, { "entropy": 5.498325157165527, "epoch": 1.3775141023147248, "grad_norm": 1.1640625, "learning_rate": 0.0004812155283480971, "loss": 5.0425, "mean_token_accuracy": 0.19799432456493377, "num_tokens": 30718314.0, "step": 17705 }, { "entropy": 5.534456634521485, "epoch": 1.3779031316864423, "grad_norm": 1.1796875, "learning_rate": 0.0004812044404419091, "loss": 5.0825, "mean_token_accuracy": 0.1971058204770088, "num_tokens": 30726801.0, "step": 17710 }, { "entropy": 5.494944381713867, "epoch": 1.3782921610581598, "grad_norm": 1.0703125, "learning_rate": 0.000481193349406897, "loss": 4.9589, "mean_token_accuracy": 0.1977649450302124, "num_tokens": 30734884.0, "step": 17715 }, { "entropy": 5.526878356933594, "epoch": 1.3786811904298775, "grad_norm": 1.015625, "learning_rate": 0.000481182255243229, "loss": 5.0848, "mean_token_accuracy": 0.19015919119119645, "num_tokens": 30744986.0, "step": 17720 }, { "entropy": 5.493934249877929, "epoch": 1.379070219801595, "grad_norm": 1.1953125, "learning_rate": 0.00048117115795107335, "loss": 5.0596, "mean_token_accuracy": 0.19199141561985017, "num_tokens": 30753476.0, "step": 17725 }, { "entropy": 5.582900524139404, "epoch": 1.3794592491733126, "grad_norm": 1.125, "learning_rate": 0.0004811600575305987, "loss": 5.1761, "mean_token_accuracy": 0.18482642620801926, "num_tokens": 30762642.0, "step": 17730 }, { "entropy": 5.638639211654663, "epoch": 1.3798482785450301, "grad_norm": 1.078125, "learning_rate": 0.0004811489539819731, "loss": 5.1176, "mean_token_accuracy": 0.18791061788797378, "num_tokens": 30771530.0, "step": 17735 }, { "entropy": 5.541548395156861, "epoch": 1.3802373079167478, "grad_norm": 1.09375, "learning_rate": 0.00048113784730536544, "loss": 5.1319, "mean_token_accuracy": 0.1902717500925064, "num_tokens": 30780001.0, "step": 17740 }, { "entropy": 5.461692810058594, "epoch": 1.3806263372884653, "grad_norm": 1.0625, "learning_rate": 0.00048112673750094396, "loss": 5.0334, "mean_token_accuracy": 0.19873157441616057, "num_tokens": 30788696.0, "step": 17745 }, { "entropy": 5.533911943435669, "epoch": 1.3810153666601828, "grad_norm": 1.0234375, "learning_rate": 0.0004811156245688773, "loss": 5.0869, "mean_token_accuracy": 0.20027474462985992, "num_tokens": 30797457.0, "step": 17750 }, { "entropy": 5.60790982246399, "epoch": 1.3814043960319005, "grad_norm": 1.015625, "learning_rate": 0.0004811045085093342, "loss": 5.0827, "mean_token_accuracy": 0.18698413223028182, "num_tokens": 30807048.0, "step": 17755 }, { "entropy": 5.564855623245239, "epoch": 1.381793425403618, "grad_norm": 1.0234375, "learning_rate": 0.0004810933893224831, "loss": 5.111, "mean_token_accuracy": 0.18870747983455657, "num_tokens": 30815315.0, "step": 17760 }, { "entropy": 5.4863667488098145, "epoch": 1.3821824547753354, "grad_norm": 1.09375, "learning_rate": 0.00048108226700849287, "loss": 5.0378, "mean_token_accuracy": 0.1896317109465599, "num_tokens": 30823221.0, "step": 17765 }, { "entropy": 5.585046911239624, "epoch": 1.382571484147053, "grad_norm": 1.03125, "learning_rate": 0.0004810711415675323, "loss": 5.2147, "mean_token_accuracy": 0.18925052732229233, "num_tokens": 30832112.0, "step": 17770 }, { "entropy": 5.572257041931152, "epoch": 1.3829605135187706, "grad_norm": 1.0546875, "learning_rate": 0.0004810600129997702, "loss": 5.0837, "mean_token_accuracy": 0.19432716965675353, "num_tokens": 30840597.0, "step": 17775 }, { "entropy": 5.475435781478882, "epoch": 1.3833495428904883, "grad_norm": 1.15625, "learning_rate": 0.00048104888130537534, "loss": 4.8863, "mean_token_accuracy": 0.20508859008550645, "num_tokens": 30848947.0, "step": 17780 }, { "entropy": 5.474328517913818, "epoch": 1.3837385722622058, "grad_norm": 1.1484375, "learning_rate": 0.00048103774648451664, "loss": 5.1045, "mean_token_accuracy": 0.18839268535375595, "num_tokens": 30856630.0, "step": 17785 }, { "entropy": 5.543894100189209, "epoch": 1.3841276016339235, "grad_norm": 1.015625, "learning_rate": 0.00048102660853736314, "loss": 5.1405, "mean_token_accuracy": 0.19237720370292663, "num_tokens": 30866032.0, "step": 17790 }, { "entropy": 5.54761233329773, "epoch": 1.384516631005641, "grad_norm": 1.1796875, "learning_rate": 0.0004810154674640837, "loss": 5.0146, "mean_token_accuracy": 0.1978936955332756, "num_tokens": 30874104.0, "step": 17795 }, { "entropy": 5.530312204360962, "epoch": 1.3849056603773584, "grad_norm": 1.0625, "learning_rate": 0.00048100432326484744, "loss": 5.0109, "mean_token_accuracy": 0.20062733590602874, "num_tokens": 30882792.0, "step": 17800 }, { "entropy": 5.528787755966187, "epoch": 1.385294689749076, "grad_norm": 1.0703125, "learning_rate": 0.0004809931759398235, "loss": 4.9989, "mean_token_accuracy": 0.19319737404584886, "num_tokens": 30891337.0, "step": 17805 }, { "entropy": 5.498284339904785, "epoch": 1.3856837191207936, "grad_norm": 1.0, "learning_rate": 0.00048098202548918094, "loss": 5.0488, "mean_token_accuracy": 0.19908549636602402, "num_tokens": 30899589.0, "step": 17810 }, { "entropy": 5.526328420639038, "epoch": 1.386072748492511, "grad_norm": 1.03125, "learning_rate": 0.00048097087191308914, "loss": 5.0629, "mean_token_accuracy": 0.19200876653194426, "num_tokens": 30907893.0, "step": 17815 }, { "entropy": 5.602785921096801, "epoch": 1.3864617778642288, "grad_norm": 1.1015625, "learning_rate": 0.0004809597152117171, "loss": 5.1575, "mean_token_accuracy": 0.19623029828071595, "num_tokens": 30916797.0, "step": 17820 }, { "entropy": 5.596491479873658, "epoch": 1.3868508072359464, "grad_norm": 1.03125, "learning_rate": 0.0004809485553852342, "loss": 5.0415, "mean_token_accuracy": 0.20397574901580812, "num_tokens": 30925451.0, "step": 17825 }, { "entropy": 5.489393854141236, "epoch": 1.387239836607664, "grad_norm": 1.0, "learning_rate": 0.0004809373924338098, "loss": 5.0562, "mean_token_accuracy": 0.1912750318646431, "num_tokens": 30934595.0, "step": 17830 }, { "entropy": 5.523344373703003, "epoch": 1.3876288659793814, "grad_norm": 1.109375, "learning_rate": 0.00048092622635761316, "loss": 5.1774, "mean_token_accuracy": 0.1918269470334053, "num_tokens": 30943896.0, "step": 17835 }, { "entropy": 5.569326448440552, "epoch": 1.388017895351099, "grad_norm": 1.0703125, "learning_rate": 0.00048091505715681395, "loss": 4.9997, "mean_token_accuracy": 0.1962179034948349, "num_tokens": 30952255.0, "step": 17840 }, { "entropy": 5.5762794494628904, "epoch": 1.3884069247228166, "grad_norm": 1.109375, "learning_rate": 0.0004809038848315814, "loss": 5.0957, "mean_token_accuracy": 0.1932236447930336, "num_tokens": 30960972.0, "step": 17845 }, { "entropy": 5.526844501495361, "epoch": 1.388795954094534, "grad_norm": 1.015625, "learning_rate": 0.0004808927093820851, "loss": 5.1393, "mean_token_accuracy": 0.18775576502084732, "num_tokens": 30970298.0, "step": 17850 }, { "entropy": 5.588902711868286, "epoch": 1.3891849834662517, "grad_norm": 1.09375, "learning_rate": 0.0004808815308084947, "loss": 5.0601, "mean_token_accuracy": 0.19920566231012343, "num_tokens": 30979355.0, "step": 17855 }, { "entropy": 5.515516996383667, "epoch": 1.3895740128379692, "grad_norm": 1.046875, "learning_rate": 0.0004808703491109798, "loss": 5.0311, "mean_token_accuracy": 0.1991442248225212, "num_tokens": 30988085.0, "step": 17860 }, { "entropy": 5.515106105804444, "epoch": 1.3899630422096867, "grad_norm": 1.1328125, "learning_rate": 0.0004808591642897099, "loss": 5.0327, "mean_token_accuracy": 0.19885144829750062, "num_tokens": 30996039.0, "step": 17865 }, { "entropy": 5.598216819763183, "epoch": 1.3903520715814044, "grad_norm": 1.0234375, "learning_rate": 0.000480847976344855, "loss": 5.1845, "mean_token_accuracy": 0.18497688472270965, "num_tokens": 31004664.0, "step": 17870 }, { "entropy": 5.569888782501221, "epoch": 1.390741100953122, "grad_norm": 1.15625, "learning_rate": 0.00048083678527658465, "loss": 5.0649, "mean_token_accuracy": 0.1998070016503334, "num_tokens": 31012571.0, "step": 17875 }, { "entropy": 5.5344789028167725, "epoch": 1.3911301303248396, "grad_norm": 1.078125, "learning_rate": 0.0004808255910850687, "loss": 5.0775, "mean_token_accuracy": 0.19330641478300095, "num_tokens": 31020901.0, "step": 17880 }, { "entropy": 5.535305690765381, "epoch": 1.391519159696557, "grad_norm": 1.2109375, "learning_rate": 0.0004808143937704769, "loss": 5.0873, "mean_token_accuracy": 0.19874341338872908, "num_tokens": 31029707.0, "step": 17885 }, { "entropy": 5.547689962387085, "epoch": 1.3919081890682747, "grad_norm": 1.1640625, "learning_rate": 0.00048080319333297937, "loss": 5.098, "mean_token_accuracy": 0.1919684648513794, "num_tokens": 31037833.0, "step": 17890 }, { "entropy": 5.55559663772583, "epoch": 1.3922972184399922, "grad_norm": 1.109375, "learning_rate": 0.00048079198977274597, "loss": 4.9991, "mean_token_accuracy": 0.20082539319992065, "num_tokens": 31046494.0, "step": 17895 }, { "entropy": 5.661937141418457, "epoch": 1.3926862478117097, "grad_norm": 1.1328125, "learning_rate": 0.00048078078308994666, "loss": 5.1665, "mean_token_accuracy": 0.18873940855264665, "num_tokens": 31054957.0, "step": 17900 }, { "entropy": 5.580401229858398, "epoch": 1.3930752771834274, "grad_norm": 1.1171875, "learning_rate": 0.0004807695732847515, "loss": 5.0518, "mean_token_accuracy": 0.19226917177438735, "num_tokens": 31063068.0, "step": 17905 }, { "entropy": 5.517187404632568, "epoch": 1.3934643065551449, "grad_norm": 1.0546875, "learning_rate": 0.00048075836035733053, "loss": 5.0415, "mean_token_accuracy": 0.19380801171064377, "num_tokens": 31072081.0, "step": 17910 }, { "entropy": 5.495890760421753, "epoch": 1.3938533359268626, "grad_norm": 1.078125, "learning_rate": 0.000480747144307854, "loss": 4.9692, "mean_token_accuracy": 0.20393196642398834, "num_tokens": 31080541.0, "step": 17915 }, { "entropy": 5.610786390304566, "epoch": 1.39424236529858, "grad_norm": 1.0390625, "learning_rate": 0.00048073592513649203, "loss": 5.1592, "mean_token_accuracy": 0.19106002748012543, "num_tokens": 31089035.0, "step": 17920 }, { "entropy": 5.525442457199096, "epoch": 1.3946313946702977, "grad_norm": 1.09375, "learning_rate": 0.0004807247028434148, "loss": 5.1687, "mean_token_accuracy": 0.1841584175825119, "num_tokens": 31096973.0, "step": 17925 }, { "entropy": 5.5369950294494625, "epoch": 1.3950204240420152, "grad_norm": 1.109375, "learning_rate": 0.0004807134774287927, "loss": 5.1021, "mean_token_accuracy": 0.1812411680817604, "num_tokens": 31104526.0, "step": 17930 }, { "entropy": 5.545117664337158, "epoch": 1.3954094534137327, "grad_norm": 1.0625, "learning_rate": 0.00048070224889279603, "loss": 4.9379, "mean_token_accuracy": 0.20624632239341736, "num_tokens": 31112350.0, "step": 17935 }, { "entropy": 5.537527799606323, "epoch": 1.3957984827854504, "grad_norm": 1.203125, "learning_rate": 0.00048069101723559505, "loss": 5.1141, "mean_token_accuracy": 0.19230054914951325, "num_tokens": 31120333.0, "step": 17940 }, { "entropy": 5.5576249122619625, "epoch": 1.3961875121571679, "grad_norm": 1.046875, "learning_rate": 0.0004806797824573603, "loss": 5.1054, "mean_token_accuracy": 0.18273807764053346, "num_tokens": 31129652.0, "step": 17945 }, { "entropy": 5.609328937530518, "epoch": 1.3965765415288853, "grad_norm": 1.109375, "learning_rate": 0.0004806685445582624, "loss": 5.0937, "mean_token_accuracy": 0.18828899115324021, "num_tokens": 31137542.0, "step": 17950 }, { "entropy": 5.499446249008178, "epoch": 1.396965570900603, "grad_norm": 1.0859375, "learning_rate": 0.00048065730353847143, "loss": 5.0789, "mean_token_accuracy": 0.19321877509355545, "num_tokens": 31145958.0, "step": 17955 }, { "entropy": 5.533914852142334, "epoch": 1.3973546002723205, "grad_norm": 1.0859375, "learning_rate": 0.00048064605939815837, "loss": 5.0338, "mean_token_accuracy": 0.19553229957818985, "num_tokens": 31154267.0, "step": 17960 }, { "entropy": 5.610066175460815, "epoch": 1.3977436296440382, "grad_norm": 1.1015625, "learning_rate": 0.0004806348121374936, "loss": 5.1124, "mean_token_accuracy": 0.19349915236234666, "num_tokens": 31162742.0, "step": 17965 }, { "entropy": 5.627502536773681, "epoch": 1.3981326590157557, "grad_norm": 1.109375, "learning_rate": 0.0004806235617566479, "loss": 5.1014, "mean_token_accuracy": 0.19760438948869705, "num_tokens": 31171275.0, "step": 17970 }, { "entropy": 5.501846170425415, "epoch": 1.3985216883874734, "grad_norm": 1.078125, "learning_rate": 0.000480612308255792, "loss": 4.8349, "mean_token_accuracy": 0.20370279848575593, "num_tokens": 31179318.0, "step": 17975 }, { "entropy": 5.517749452590943, "epoch": 1.3989107177591908, "grad_norm": 1.1015625, "learning_rate": 0.00048060105163509647, "loss": 5.0151, "mean_token_accuracy": 0.19793801754713058, "num_tokens": 31187129.0, "step": 17980 }, { "entropy": 5.587438249588013, "epoch": 1.3992997471309083, "grad_norm": 1.078125, "learning_rate": 0.0004805897918947323, "loss": 5.2187, "mean_token_accuracy": 0.18381677865982055, "num_tokens": 31196381.0, "step": 17985 }, { "entropy": 5.609868478775025, "epoch": 1.399688776502626, "grad_norm": 1.015625, "learning_rate": 0.0004805785290348702, "loss": 5.1296, "mean_token_accuracy": 0.19322014600038528, "num_tokens": 31205659.0, "step": 17990 }, { "entropy": 5.568350410461425, "epoch": 1.4000778058743435, "grad_norm": 1.1171875, "learning_rate": 0.00048056726305568124, "loss": 5.0907, "mean_token_accuracy": 0.19047034978866578, "num_tokens": 31214996.0, "step": 17995 }, { "entropy": 5.5778991222381595, "epoch": 1.400466835246061, "grad_norm": 1.1953125, "learning_rate": 0.00048055599395733617, "loss": 5.0609, "mean_token_accuracy": 0.19392545521259308, "num_tokens": 31222964.0, "step": 18000 }, { "epoch": 1.400466835246061, "eval_entropy": 5.312170610345247, "eval_loss": 5.148044586181641, "eval_mean_token_accuracy": 0.19960618509451167, "eval_num_tokens": 31222964.0, "eval_runtime": 21.8751, "eval_samples_per_second": 1899.782, "eval_steps_per_second": 237.484, "step": 18000 }, { "entropy": 5.582950019836426, "epoch": 1.4008558646177787, "grad_norm": 1.0625, "learning_rate": 0.00048054472174000615, "loss": 5.1651, "mean_token_accuracy": 0.18657812476158142, "num_tokens": 31231653.0, "step": 18005 }, { "entropy": 5.515417098999023, "epoch": 1.4012448939894961, "grad_norm": 1.1328125, "learning_rate": 0.00048053344640386207, "loss": 5.034, "mean_token_accuracy": 0.19762684106826783, "num_tokens": 31240613.0, "step": 18010 }, { "entropy": 5.468939399719238, "epoch": 1.4016339233612138, "grad_norm": 1.1328125, "learning_rate": 0.00048052216794907505, "loss": 4.9737, "mean_token_accuracy": 0.20309566408395768, "num_tokens": 31249724.0, "step": 18015 }, { "entropy": 5.583134746551513, "epoch": 1.4020229527329313, "grad_norm": 1.0859375, "learning_rate": 0.00048051088637581624, "loss": 5.1814, "mean_token_accuracy": 0.18947405219078065, "num_tokens": 31258717.0, "step": 18020 }, { "entropy": 5.560312700271607, "epoch": 1.402411982104649, "grad_norm": 1.0234375, "learning_rate": 0.000480499601684257, "loss": 5.0283, "mean_token_accuracy": 0.20060670077800752, "num_tokens": 31267170.0, "step": 18025 }, { "entropy": 5.536152696609497, "epoch": 1.4028010114763665, "grad_norm": 1.1796875, "learning_rate": 0.0004804883138745682, "loss": 5.1047, "mean_token_accuracy": 0.19575312733650208, "num_tokens": 31277787.0, "step": 18030 }, { "entropy": 5.541717958450318, "epoch": 1.403190040848084, "grad_norm": 1.0703125, "learning_rate": 0.0004804770229469214, "loss": 5.08, "mean_token_accuracy": 0.19092841744422911, "num_tokens": 31286185.0, "step": 18035 }, { "entropy": 5.575718069076538, "epoch": 1.4035790702198017, "grad_norm": 1.09375, "learning_rate": 0.0004804657289014878, "loss": 5.0164, "mean_token_accuracy": 0.19277947545051574, "num_tokens": 31295361.0, "step": 18040 }, { "entropy": 5.595489120483398, "epoch": 1.4039680995915191, "grad_norm": 1.0625, "learning_rate": 0.00048045443173843884, "loss": 5.1203, "mean_token_accuracy": 0.19996030777692794, "num_tokens": 31304036.0, "step": 18045 }, { "entropy": 5.503108644485474, "epoch": 1.4043571289632366, "grad_norm": 1.140625, "learning_rate": 0.00048044313145794587, "loss": 5.0184, "mean_token_accuracy": 0.19740345776081086, "num_tokens": 31311919.0, "step": 18050 }, { "entropy": 5.613345956802368, "epoch": 1.4047461583349543, "grad_norm": 1.0859375, "learning_rate": 0.00048043182806018034, "loss": 5.1329, "mean_token_accuracy": 0.18831951469182967, "num_tokens": 31320805.0, "step": 18055 }, { "entropy": 5.619343900680542, "epoch": 1.4051351877066718, "grad_norm": 1.0625, "learning_rate": 0.00048042052154531384, "loss": 5.1186, "mean_token_accuracy": 0.19016654193401336, "num_tokens": 31329688.0, "step": 18060 }, { "entropy": 5.496675300598144, "epoch": 1.4055242170783895, "grad_norm": 1.0859375, "learning_rate": 0.0004804092119135179, "loss": 4.9722, "mean_token_accuracy": 0.19821435511112212, "num_tokens": 31338301.0, "step": 18065 }, { "entropy": 5.589623165130615, "epoch": 1.405913246450107, "grad_norm": 1.0625, "learning_rate": 0.0004803978991649641, "loss": 5.1722, "mean_token_accuracy": 0.18733126819133758, "num_tokens": 31347371.0, "step": 18070 }, { "entropy": 5.625062465667725, "epoch": 1.4063022758218247, "grad_norm": 1.1171875, "learning_rate": 0.00048038658329982404, "loss": 5.1186, "mean_token_accuracy": 0.19441514015197753, "num_tokens": 31355740.0, "step": 18075 }, { "entropy": 5.514441728591919, "epoch": 1.4066913051935421, "grad_norm": 1.015625, "learning_rate": 0.0004803752643182695, "loss": 4.9475, "mean_token_accuracy": 0.20132503062486648, "num_tokens": 31364718.0, "step": 18080 }, { "entropy": 5.621646308898926, "epoch": 1.4070803345652596, "grad_norm": 1.0703125, "learning_rate": 0.0004803639422204723, "loss": 5.096, "mean_token_accuracy": 0.19331311732530593, "num_tokens": 31372845.0, "step": 18085 }, { "entropy": 5.571919775009155, "epoch": 1.4074693639369773, "grad_norm": 1.0546875, "learning_rate": 0.0004803526170066041, "loss": 5.0867, "mean_token_accuracy": 0.1870800018310547, "num_tokens": 31380614.0, "step": 18090 }, { "entropy": 5.640252685546875, "epoch": 1.4078583933086948, "grad_norm": 1.1171875, "learning_rate": 0.00048034128867683674, "loss": 5.1408, "mean_token_accuracy": 0.19344274699687958, "num_tokens": 31389609.0, "step": 18095 }, { "entropy": 5.602119731903076, "epoch": 1.4082474226804123, "grad_norm": 1.09375, "learning_rate": 0.0004803299572313422, "loss": 5.1186, "mean_token_accuracy": 0.1895015873014927, "num_tokens": 31399046.0, "step": 18100 }, { "entropy": 5.527682447433472, "epoch": 1.40863645205213, "grad_norm": 1.0234375, "learning_rate": 0.0004803186226702924, "loss": 5.0352, "mean_token_accuracy": 0.19509876817464827, "num_tokens": 31407832.0, "step": 18105 }, { "entropy": 5.541810941696167, "epoch": 1.4090254814238474, "grad_norm": 1.140625, "learning_rate": 0.0004803072849938592, "loss": 5.1076, "mean_token_accuracy": 0.19043003767728806, "num_tokens": 31417097.0, "step": 18110 }, { "entropy": 5.610478687286377, "epoch": 1.4094145107955651, "grad_norm": 1.0859375, "learning_rate": 0.0004802959442022149, "loss": 5.1166, "mean_token_accuracy": 0.1896813452243805, "num_tokens": 31425448.0, "step": 18115 }, { "entropy": 5.501917791366577, "epoch": 1.4098035401672826, "grad_norm": 1.046875, "learning_rate": 0.00048028460029553126, "loss": 4.9639, "mean_token_accuracy": 0.20807625502347946, "num_tokens": 31434116.0, "step": 18120 }, { "entropy": 5.493034744262696, "epoch": 1.4101925695390003, "grad_norm": 1.1015625, "learning_rate": 0.00048027325327398065, "loss": 5.0377, "mean_token_accuracy": 0.19825750589370728, "num_tokens": 31443456.0, "step": 18125 }, { "entropy": 5.570084428787231, "epoch": 1.4105815989107178, "grad_norm": 1.15625, "learning_rate": 0.0004802619031377351, "loss": 5.0562, "mean_token_accuracy": 0.19380191266536712, "num_tokens": 31452372.0, "step": 18130 }, { "entropy": 5.652626991271973, "epoch": 1.4109706282824352, "grad_norm": 1.078125, "learning_rate": 0.00048025054988696684, "loss": 5.0711, "mean_token_accuracy": 0.1976705387234688, "num_tokens": 31460446.0, "step": 18135 }, { "entropy": 5.571567583084106, "epoch": 1.411359657654153, "grad_norm": 1.0625, "learning_rate": 0.00048023919352184827, "loss": 5.0315, "mean_token_accuracy": 0.19407279193401336, "num_tokens": 31468814.0, "step": 18140 }, { "entropy": 5.509151840209961, "epoch": 1.4117486870258704, "grad_norm": 1.0703125, "learning_rate": 0.00048022783404255156, "loss": 4.9972, "mean_token_accuracy": 0.19934773147106172, "num_tokens": 31477617.0, "step": 18145 }, { "entropy": 5.54647421836853, "epoch": 1.412137716397588, "grad_norm": 1.1171875, "learning_rate": 0.0004802164714492491, "loss": 4.996, "mean_token_accuracy": 0.2033822149038315, "num_tokens": 31485226.0, "step": 18150 }, { "entropy": 5.534914207458496, "epoch": 1.4125267457693056, "grad_norm": 1.1484375, "learning_rate": 0.00048020510574211335, "loss": 5.0245, "mean_token_accuracy": 0.19356247782707214, "num_tokens": 31493425.0, "step": 18155 }, { "entropy": 5.53318772315979, "epoch": 1.412915775141023, "grad_norm": 1.015625, "learning_rate": 0.00048019373692131674, "loss": 4.9961, "mean_token_accuracy": 0.20112947523593902, "num_tokens": 31502499.0, "step": 18160 }, { "entropy": 5.5498298645019535, "epoch": 1.4133048045127408, "grad_norm": 1.171875, "learning_rate": 0.00048018236498703176, "loss": 5.052, "mean_token_accuracy": 0.1976643443107605, "num_tokens": 31510376.0, "step": 18165 }, { "entropy": 5.611096382141113, "epoch": 1.4136938338844582, "grad_norm": 1.09375, "learning_rate": 0.00048017098993943097, "loss": 5.1933, "mean_token_accuracy": 0.18768952488899232, "num_tokens": 31519101.0, "step": 18170 }, { "entropy": 5.520099687576294, "epoch": 1.414082863256176, "grad_norm": 1.15625, "learning_rate": 0.000480159611778687, "loss": 5.0292, "mean_token_accuracy": 0.19769105464220046, "num_tokens": 31527221.0, "step": 18175 }, { "entropy": 5.502950429916382, "epoch": 1.4144718926278934, "grad_norm": 1.1171875, "learning_rate": 0.00048014823050497243, "loss": 5.0479, "mean_token_accuracy": 0.19559828639030458, "num_tokens": 31535711.0, "step": 18180 }, { "entropy": 5.601933336257934, "epoch": 1.4148609219996109, "grad_norm": 0.9921875, "learning_rate": 0.00048013684611846, "loss": 5.1913, "mean_token_accuracy": 0.18806384652853012, "num_tokens": 31545363.0, "step": 18185 }, { "entropy": 5.63174090385437, "epoch": 1.4152499513713286, "grad_norm": 1.1328125, "learning_rate": 0.00048012545861932245, "loss": 5.0529, "mean_token_accuracy": 0.1983655273914337, "num_tokens": 31553760.0, "step": 18190 }, { "entropy": 5.53178596496582, "epoch": 1.415638980743046, "grad_norm": 1.09375, "learning_rate": 0.0004801140680077325, "loss": 4.9918, "mean_token_accuracy": 0.20406392514705657, "num_tokens": 31561625.0, "step": 18195 }, { "entropy": 5.491732168197632, "epoch": 1.4160280101147635, "grad_norm": 1.09375, "learning_rate": 0.0004801026742838631, "loss": 5.0854, "mean_token_accuracy": 0.19309781044721602, "num_tokens": 31569345.0, "step": 18200 }, { "entropy": 5.5953069686889645, "epoch": 1.4164170394864812, "grad_norm": 1.0703125, "learning_rate": 0.0004800912774478871, "loss": 5.034, "mean_token_accuracy": 0.18906501084566116, "num_tokens": 31577990.0, "step": 18205 }, { "entropy": 5.556746625900269, "epoch": 1.416806068858199, "grad_norm": 1.1328125, "learning_rate": 0.0004800798774999773, "loss": 5.0008, "mean_token_accuracy": 0.1992023006081581, "num_tokens": 31586556.0, "step": 18210 }, { "entropy": 5.595542240142822, "epoch": 1.4171950982299164, "grad_norm": 1.078125, "learning_rate": 0.00048006847444030686, "loss": 5.1221, "mean_token_accuracy": 0.1956315293908119, "num_tokens": 31595697.0, "step": 18215 }, { "entropy": 5.511937618255615, "epoch": 1.4175841276016339, "grad_norm": 1.046875, "learning_rate": 0.0004800570682690487, "loss": 5.0109, "mean_token_accuracy": 0.19853083342313765, "num_tokens": 31604760.0, "step": 18220 }, { "entropy": 5.592023277282715, "epoch": 1.4179731569733516, "grad_norm": 1.0859375, "learning_rate": 0.0004800456589863759, "loss": 5.1625, "mean_token_accuracy": 0.18522751629352568, "num_tokens": 31614115.0, "step": 18225 }, { "entropy": 5.559210872650146, "epoch": 1.418362186345069, "grad_norm": 1.125, "learning_rate": 0.0004800342465924616, "loss": 5.1278, "mean_token_accuracy": 0.18666702806949614, "num_tokens": 31622492.0, "step": 18230 }, { "entropy": 5.565643310546875, "epoch": 1.4187512157167865, "grad_norm": 1.0859375, "learning_rate": 0.000480022831087479, "loss": 5.1368, "mean_token_accuracy": 0.1899562269449234, "num_tokens": 31632269.0, "step": 18235 }, { "entropy": 5.586274147033691, "epoch": 1.4191402450885042, "grad_norm": 1.0859375, "learning_rate": 0.0004800114124716012, "loss": 5.1138, "mean_token_accuracy": 0.1928720846772194, "num_tokens": 31640374.0, "step": 18240 }, { "entropy": 5.5506692886352536, "epoch": 1.4195292744602217, "grad_norm": 1.1875, "learning_rate": 0.0004799999907450015, "loss": 5.015, "mean_token_accuracy": 0.20168276131153107, "num_tokens": 31648406.0, "step": 18245 }, { "entropy": 5.53135871887207, "epoch": 1.4199183038319392, "grad_norm": 1.046875, "learning_rate": 0.0004799885659078533, "loss": 5.0137, "mean_token_accuracy": 0.19621025025844574, "num_tokens": 31656478.0, "step": 18250 }, { "entropy": 5.538170051574707, "epoch": 1.4203073332036569, "grad_norm": 1.1015625, "learning_rate": 0.0004799771379603299, "loss": 5.0187, "mean_token_accuracy": 0.19549295604228972, "num_tokens": 31665106.0, "step": 18255 }, { "entropy": 5.622061061859131, "epoch": 1.4206963625753746, "grad_norm": 1.125, "learning_rate": 0.0004799657069026046, "loss": 5.1314, "mean_token_accuracy": 0.1927192196249962, "num_tokens": 31673557.0, "step": 18260 }, { "entropy": 5.4933994770050045, "epoch": 1.421085391947092, "grad_norm": 1.0859375, "learning_rate": 0.00047995427273485097, "loss": 4.9324, "mean_token_accuracy": 0.20364110618829728, "num_tokens": 31682123.0, "step": 18265 }, { "entropy": 5.5853996753692625, "epoch": 1.4214744213188095, "grad_norm": 1.203125, "learning_rate": 0.00047994283545724247, "loss": 5.2005, "mean_token_accuracy": 0.18401966243982315, "num_tokens": 31690387.0, "step": 18270 }, { "entropy": 5.547459650039673, "epoch": 1.4218634506905272, "grad_norm": 0.98828125, "learning_rate": 0.00047993139506995273, "loss": 5.0229, "mean_token_accuracy": 0.2038185104727745, "num_tokens": 31699814.0, "step": 18275 }, { "entropy": 5.539145183563233, "epoch": 1.4222524800622447, "grad_norm": 1.125, "learning_rate": 0.0004799199515731551, "loss": 5.0002, "mean_token_accuracy": 0.20809328854084014, "num_tokens": 31708437.0, "step": 18280 }, { "entropy": 5.554030895233154, "epoch": 1.4226415094339622, "grad_norm": 1.1015625, "learning_rate": 0.00047990850496702346, "loss": 4.9764, "mean_token_accuracy": 0.20727317035198212, "num_tokens": 31716935.0, "step": 18285 }, { "entropy": 5.640668153762817, "epoch": 1.4230305388056799, "grad_norm": 1.109375, "learning_rate": 0.0004798970552517314, "loss": 5.1867, "mean_token_accuracy": 0.19197406470775605, "num_tokens": 31725997.0, "step": 18290 }, { "entropy": 5.563860511779785, "epoch": 1.4234195681773973, "grad_norm": 1.0546875, "learning_rate": 0.00047988560242745264, "loss": 5.0342, "mean_token_accuracy": 0.20197686553001404, "num_tokens": 31733651.0, "step": 18295 }, { "entropy": 5.534157609939575, "epoch": 1.423808597549115, "grad_norm": 1.125, "learning_rate": 0.000479874146494361, "loss": 5.011, "mean_token_accuracy": 0.1948947012424469, "num_tokens": 31742465.0, "step": 18300 }, { "entropy": 5.5634666919708256, "epoch": 1.4241976269208325, "grad_norm": 1.09375, "learning_rate": 0.0004798626874526302, "loss": 5.0965, "mean_token_accuracy": 0.19499410390853883, "num_tokens": 31751547.0, "step": 18305 }, { "entropy": 5.625259160995483, "epoch": 1.4245866562925502, "grad_norm": 1.109375, "learning_rate": 0.00047985122530243426, "loss": 5.1925, "mean_token_accuracy": 0.18384879976511, "num_tokens": 31761027.0, "step": 18310 }, { "entropy": 5.59905309677124, "epoch": 1.4249756856642677, "grad_norm": 1.078125, "learning_rate": 0.000479839760043947, "loss": 5.1139, "mean_token_accuracy": 0.18911658525466918, "num_tokens": 31770166.0, "step": 18315 }, { "entropy": 5.595362806320191, "epoch": 1.4253647150359852, "grad_norm": 1.0859375, "learning_rate": 0.00047982829167734245, "loss": 4.9551, "mean_token_accuracy": 0.20449754744768142, "num_tokens": 31778606.0, "step": 18320 }, { "entropy": 5.597636413574219, "epoch": 1.4257537444077029, "grad_norm": 1.0859375, "learning_rate": 0.00047981682020279456, "loss": 5.203, "mean_token_accuracy": 0.1877678692340851, "num_tokens": 31787637.0, "step": 18325 }, { "entropy": 5.523072957992554, "epoch": 1.4261427737794203, "grad_norm": 1.140625, "learning_rate": 0.0004798053456204775, "loss": 5.0082, "mean_token_accuracy": 0.2034567788243294, "num_tokens": 31796401.0, "step": 18330 }, { "entropy": 5.600176000595093, "epoch": 1.4265318031511378, "grad_norm": 0.9765625, "learning_rate": 0.0004797938679305651, "loss": 5.1418, "mean_token_accuracy": 0.18479096591472627, "num_tokens": 31805917.0, "step": 18335 }, { "entropy": 5.629215812683105, "epoch": 1.4269208325228555, "grad_norm": 1.0078125, "learning_rate": 0.00047978238713323193, "loss": 5.1389, "mean_token_accuracy": 0.1898981973528862, "num_tokens": 31814890.0, "step": 18340 }, { "entropy": 5.584290456771851, "epoch": 1.427309861894573, "grad_norm": 1.1328125, "learning_rate": 0.00047977090322865183, "loss": 4.9956, "mean_token_accuracy": 0.20403362065553665, "num_tokens": 31822469.0, "step": 18345 }, { "entropy": 5.542857217788696, "epoch": 1.4276988912662907, "grad_norm": 1.0625, "learning_rate": 0.0004797594162169993, "loss": 5.1316, "mean_token_accuracy": 0.18976081609725953, "num_tokens": 31831030.0, "step": 18350 }, { "entropy": 5.514376401901245, "epoch": 1.4280879206380082, "grad_norm": 1.109375, "learning_rate": 0.0004797479260984485, "loss": 5.0445, "mean_token_accuracy": 0.1944386288523674, "num_tokens": 31840137.0, "step": 18355 }, { "entropy": 5.483924102783203, "epoch": 1.4284769500097259, "grad_norm": 1.0546875, "learning_rate": 0.00047973643287317386, "loss": 4.9403, "mean_token_accuracy": 0.20462446808815002, "num_tokens": 31849258.0, "step": 18360 }, { "entropy": 5.509231662750244, "epoch": 1.4288659793814433, "grad_norm": 0.98828125, "learning_rate": 0.00047972493654134963, "loss": 4.9572, "mean_token_accuracy": 0.19801453799009322, "num_tokens": 31857506.0, "step": 18365 }, { "entropy": 5.5573607921600345, "epoch": 1.4292550087531608, "grad_norm": 1.0625, "learning_rate": 0.00047971343710315043, "loss": 5.0669, "mean_token_accuracy": 0.1977432921528816, "num_tokens": 31866685.0, "step": 18370 }, { "entropy": 5.622151708602905, "epoch": 1.4296440381248785, "grad_norm": 1.1953125, "learning_rate": 0.0004797019345587506, "loss": 5.1583, "mean_token_accuracy": 0.1884672611951828, "num_tokens": 31874404.0, "step": 18375 }, { "entropy": 5.604937982559204, "epoch": 1.430033067496596, "grad_norm": 1.171875, "learning_rate": 0.0004796904289083248, "loss": 5.1377, "mean_token_accuracy": 0.19341788440942764, "num_tokens": 31883075.0, "step": 18380 }, { "entropy": 5.53309006690979, "epoch": 1.4304220968683135, "grad_norm": 1.09375, "learning_rate": 0.0004796789201520474, "loss": 5.0569, "mean_token_accuracy": 0.19433412104845046, "num_tokens": 31891539.0, "step": 18385 }, { "entropy": 5.605747222900391, "epoch": 1.4308111262400312, "grad_norm": 1.125, "learning_rate": 0.00047966740829009333, "loss": 5.1013, "mean_token_accuracy": 0.19176810830831528, "num_tokens": 31900575.0, "step": 18390 }, { "entropy": 5.578491926193237, "epoch": 1.4312001556117486, "grad_norm": 1.0390625, "learning_rate": 0.000479655893322637, "loss": 5.0674, "mean_token_accuracy": 0.19177470356225967, "num_tokens": 31909256.0, "step": 18395 }, { "entropy": 5.50511212348938, "epoch": 1.4315891849834663, "grad_norm": 1.140625, "learning_rate": 0.0004796443752498532, "loss": 5.0224, "mean_token_accuracy": 0.19472933411598206, "num_tokens": 31917098.0, "step": 18400 }, { "entropy": 5.640275716781616, "epoch": 1.4319782143551838, "grad_norm": 1.2421875, "learning_rate": 0.0004796328540719169, "loss": 5.1532, "mean_token_accuracy": 0.19500262886285782, "num_tokens": 31925331.0, "step": 18405 }, { "entropy": 5.5628382682800295, "epoch": 1.4323672437269015, "grad_norm": 1.1640625, "learning_rate": 0.0004796213297890026, "loss": 5.0275, "mean_token_accuracy": 0.19528605341911315, "num_tokens": 31933769.0, "step": 18410 }, { "entropy": 5.561316108703613, "epoch": 1.432756273098619, "grad_norm": 1.140625, "learning_rate": 0.0004796098024012853, "loss": 5.1017, "mean_token_accuracy": 0.19075271785259246, "num_tokens": 31943089.0, "step": 18415 }, { "entropy": 5.584134864807129, "epoch": 1.4331453024703364, "grad_norm": 1.109375, "learning_rate": 0.00047959827190894, "loss": 5.068, "mean_token_accuracy": 0.19579847306013107, "num_tokens": 31951452.0, "step": 18420 }, { "entropy": 5.587604618072509, "epoch": 1.4335343318420541, "grad_norm": 1.0703125, "learning_rate": 0.00047958673831214157, "loss": 5.0988, "mean_token_accuracy": 0.1898283287882805, "num_tokens": 31959625.0, "step": 18425 }, { "entropy": 5.516186380386353, "epoch": 1.4339233612137716, "grad_norm": 1.078125, "learning_rate": 0.00047957520161106496, "loss": 5.0728, "mean_token_accuracy": 0.19293591529130935, "num_tokens": 31967906.0, "step": 18430 }, { "entropy": 5.51956582069397, "epoch": 1.434312390585489, "grad_norm": 1.03125, "learning_rate": 0.0004795636618058853, "loss": 5.02, "mean_token_accuracy": 0.19946686923503876, "num_tokens": 31976183.0, "step": 18435 }, { "entropy": 5.531099319458008, "epoch": 1.4347014199572068, "grad_norm": 1.0546875, "learning_rate": 0.0004795521188967777, "loss": 5.0165, "mean_token_accuracy": 0.1996547356247902, "num_tokens": 31984513.0, "step": 18440 }, { "entropy": 5.640311670303345, "epoch": 1.4350904493289243, "grad_norm": 1.03125, "learning_rate": 0.0004795405728839172, "loss": 5.1931, "mean_token_accuracy": 0.18734999746084213, "num_tokens": 31992994.0, "step": 18445 }, { "entropy": 5.610415840148926, "epoch": 1.435479478700642, "grad_norm": 0.98046875, "learning_rate": 0.0004795290237674792, "loss": 5.0732, "mean_token_accuracy": 0.1960535928606987, "num_tokens": 32002043.0, "step": 18450 }, { "entropy": 5.553276252746582, "epoch": 1.4358685080723594, "grad_norm": 1.109375, "learning_rate": 0.00047951747154763866, "loss": 4.9849, "mean_token_accuracy": 0.19223069101572038, "num_tokens": 32009901.0, "step": 18455 }, { "entropy": 5.528745794296265, "epoch": 1.4362575374440771, "grad_norm": 1.125, "learning_rate": 0.00047950591622457106, "loss": 5.0363, "mean_token_accuracy": 0.18910821676254272, "num_tokens": 32017947.0, "step": 18460 }, { "entropy": 5.560096549987793, "epoch": 1.4366465668157946, "grad_norm": 1.0703125, "learning_rate": 0.00047949435779845174, "loss": 5.0532, "mean_token_accuracy": 0.19185497909784316, "num_tokens": 32026537.0, "step": 18465 }, { "entropy": 5.553626823425293, "epoch": 1.437035596187512, "grad_norm": 1.0390625, "learning_rate": 0.00047948279626945596, "loss": 5.0109, "mean_token_accuracy": 0.19746024459600447, "num_tokens": 32034874.0, "step": 18470 }, { "entropy": 5.5487583637237545, "epoch": 1.4374246255592298, "grad_norm": 1.0546875, "learning_rate": 0.00047947123163775924, "loss": 5.1128, "mean_token_accuracy": 0.18750302344560624, "num_tokens": 32043829.0, "step": 18475 }, { "entropy": 5.594501876831055, "epoch": 1.4378136549309473, "grad_norm": 1.015625, "learning_rate": 0.000479459663903537, "loss": 5.1358, "mean_token_accuracy": 0.18752866834402085, "num_tokens": 32052883.0, "step": 18480 }, { "entropy": 5.616334915161133, "epoch": 1.4382026843026647, "grad_norm": 1.0546875, "learning_rate": 0.0004794480930669649, "loss": 5.1414, "mean_token_accuracy": 0.19976329058408737, "num_tokens": 32061421.0, "step": 18485 }, { "entropy": 5.55956335067749, "epoch": 1.4385917136743824, "grad_norm": 1.1015625, "learning_rate": 0.0004794365191282183, "loss": 5.0749, "mean_token_accuracy": 0.19674523323774337, "num_tokens": 32069957.0, "step": 18490 }, { "entropy": 5.491875648498535, "epoch": 1.4389807430461, "grad_norm": 1.0078125, "learning_rate": 0.00047942494208747297, "loss": 4.9706, "mean_token_accuracy": 0.1983792468905449, "num_tokens": 32079375.0, "step": 18495 }, { "entropy": 5.489693832397461, "epoch": 1.4393697724178176, "grad_norm": 1.0390625, "learning_rate": 0.0004794133619449045, "loss": 5.0109, "mean_token_accuracy": 0.198390331864357, "num_tokens": 32088331.0, "step": 18500 }, { "entropy": 5.544843769073486, "epoch": 1.439758801789535, "grad_norm": 1.0625, "learning_rate": 0.0004794017787006886, "loss": 4.9797, "mean_token_accuracy": 0.19472295194864273, "num_tokens": 32096897.0, "step": 18505 }, { "entropy": 5.527131462097168, "epoch": 1.4401478311612528, "grad_norm": 1.09375, "learning_rate": 0.000479390192355001, "loss": 4.9869, "mean_token_accuracy": 0.2041996106505394, "num_tokens": 32105942.0, "step": 18510 }, { "entropy": 5.634539222717285, "epoch": 1.4405368605329703, "grad_norm": 1.0546875, "learning_rate": 0.0004793786029080176, "loss": 5.1929, "mean_token_accuracy": 0.19100160002708436, "num_tokens": 32114540.0, "step": 18515 }, { "entropy": 5.534276962280273, "epoch": 1.4409258899046877, "grad_norm": 1.125, "learning_rate": 0.0004793670103599143, "loss": 5.0262, "mean_token_accuracy": 0.19326386749744415, "num_tokens": 32123214.0, "step": 18520 }, { "entropy": 5.546277475357056, "epoch": 1.4413149192764054, "grad_norm": 1.0625, "learning_rate": 0.00047935541471086677, "loss": 5.0643, "mean_token_accuracy": 0.2009383589029312, "num_tokens": 32132369.0, "step": 18525 }, { "entropy": 5.489225435256958, "epoch": 1.441703948648123, "grad_norm": 1.0390625, "learning_rate": 0.0004793438159610511, "loss": 5.0105, "mean_token_accuracy": 0.198018117249012, "num_tokens": 32141037.0, "step": 18530 }, { "entropy": 5.552044486999511, "epoch": 1.4420929780198404, "grad_norm": 1.0546875, "learning_rate": 0.00047933221411064334, "loss": 5.0394, "mean_token_accuracy": 0.19912125468254088, "num_tokens": 32149515.0, "step": 18535 }, { "entropy": 5.550060844421386, "epoch": 1.442482007391558, "grad_norm": 1.109375, "learning_rate": 0.0004793206091598194, "loss": 5.102, "mean_token_accuracy": 0.2011459708213806, "num_tokens": 32158099.0, "step": 18540 }, { "entropy": 5.565141057968139, "epoch": 1.4428710367632755, "grad_norm": 1.09375, "learning_rate": 0.0004793090011087554, "loss": 5.0341, "mean_token_accuracy": 0.20471095144748688, "num_tokens": 32167059.0, "step": 18545 }, { "entropy": 5.6353284358978275, "epoch": 1.4432600661349932, "grad_norm": 1.140625, "learning_rate": 0.00047929738995762755, "loss": 5.2215, "mean_token_accuracy": 0.1894715756177902, "num_tokens": 32175988.0, "step": 18550 }, { "entropy": 5.502754020690918, "epoch": 1.4436490955067107, "grad_norm": 1.0859375, "learning_rate": 0.000479285775706612, "loss": 4.9879, "mean_token_accuracy": 0.1983701691031456, "num_tokens": 32185362.0, "step": 18555 }, { "entropy": 5.525856828689575, "epoch": 1.4440381248784284, "grad_norm": 1.1015625, "learning_rate": 0.00047927415835588496, "loss": 5.0396, "mean_token_accuracy": 0.19606305360794068, "num_tokens": 32194599.0, "step": 18560 }, { "entropy": 5.556668949127197, "epoch": 1.444427154250146, "grad_norm": 1.0859375, "learning_rate": 0.00047926253790562265, "loss": 5.0375, "mean_token_accuracy": 0.19837613105773927, "num_tokens": 32203106.0, "step": 18565 }, { "entropy": 5.539638710021973, "epoch": 1.4448161836218634, "grad_norm": 1.078125, "learning_rate": 0.00047925091435600147, "loss": 5.1009, "mean_token_accuracy": 0.1937463864684105, "num_tokens": 32211652.0, "step": 18570 }, { "entropy": 5.617071628570557, "epoch": 1.445205212993581, "grad_norm": 1.0390625, "learning_rate": 0.00047923928770719776, "loss": 5.088, "mean_token_accuracy": 0.18917482048273088, "num_tokens": 32220435.0, "step": 18575 }, { "entropy": 5.62638578414917, "epoch": 1.4455942423652985, "grad_norm": 1.171875, "learning_rate": 0.00047922765795938797, "loss": 5.0336, "mean_token_accuracy": 0.19433677345514297, "num_tokens": 32228368.0, "step": 18580 }, { "entropy": 5.552500772476196, "epoch": 1.445983271737016, "grad_norm": 1.046875, "learning_rate": 0.0004792160251127485, "loss": 5.1116, "mean_token_accuracy": 0.19036509096622467, "num_tokens": 32237367.0, "step": 18585 }, { "entropy": 5.585110187530518, "epoch": 1.4463723011087337, "grad_norm": 1.1328125, "learning_rate": 0.00047920438916745586, "loss": 5.0976, "mean_token_accuracy": 0.19562548995018006, "num_tokens": 32245503.0, "step": 18590 }, { "entropy": 5.626276016235352, "epoch": 1.4467613304804512, "grad_norm": 1.0546875, "learning_rate": 0.0004791927501236866, "loss": 5.0893, "mean_token_accuracy": 0.19301565140485763, "num_tokens": 32254565.0, "step": 18595 }, { "entropy": 5.588373231887817, "epoch": 1.4471503598521689, "grad_norm": 1.0, "learning_rate": 0.00047918110798161754, "loss": 5.115, "mean_token_accuracy": 0.19242952466011048, "num_tokens": 32263701.0, "step": 18600 }, { "entropy": 5.488565874099732, "epoch": 1.4475393892238864, "grad_norm": 1.15625, "learning_rate": 0.00047916946274142503, "loss": 5.0754, "mean_token_accuracy": 0.19001636952161788, "num_tokens": 32272205.0, "step": 18605 }, { "entropy": 5.5834146499633786, "epoch": 1.447928418595604, "grad_norm": 1.140625, "learning_rate": 0.00047915781440328593, "loss": 5.0934, "mean_token_accuracy": 0.19526804983615875, "num_tokens": 32279918.0, "step": 18610 }, { "entropy": 5.611225938796997, "epoch": 1.4483174479673215, "grad_norm": 1.109375, "learning_rate": 0.0004791461629673769, "loss": 5.0998, "mean_token_accuracy": 0.19968288391828537, "num_tokens": 32288600.0, "step": 18615 }, { "entropy": 5.614047813415527, "epoch": 1.448706477339039, "grad_norm": 1.09375, "learning_rate": 0.0004791345084338748, "loss": 5.1959, "mean_token_accuracy": 0.19004199504852295, "num_tokens": 32298334.0, "step": 18620 }, { "entropy": 5.544297075271606, "epoch": 1.4490955067107567, "grad_norm": 1.1875, "learning_rate": 0.0004791228508029565, "loss": 4.9904, "mean_token_accuracy": 0.2011478364467621, "num_tokens": 32306785.0, "step": 18625 }, { "entropy": 5.5493433475494385, "epoch": 1.4494845360824742, "grad_norm": 1.1484375, "learning_rate": 0.00047911119007479873, "loss": 5.1528, "mean_token_accuracy": 0.19101451337337494, "num_tokens": 32315419.0, "step": 18630 }, { "entropy": 5.581198072433471, "epoch": 1.4498735654541917, "grad_norm": 1.046875, "learning_rate": 0.00047909952624957866, "loss": 4.9891, "mean_token_accuracy": 0.20209325104951859, "num_tokens": 32323655.0, "step": 18635 }, { "entropy": 5.50367488861084, "epoch": 1.4502625948259094, "grad_norm": 1.1484375, "learning_rate": 0.000479087859327473, "loss": 4.9936, "mean_token_accuracy": 0.19435309171676635, "num_tokens": 32331465.0, "step": 18640 }, { "entropy": 5.574116468429565, "epoch": 1.450651624197627, "grad_norm": 1.09375, "learning_rate": 0.000479076189308659, "loss": 5.1892, "mean_token_accuracy": 0.1887412115931511, "num_tokens": 32341211.0, "step": 18645 }, { "entropy": 5.63299036026001, "epoch": 1.4510406535693445, "grad_norm": 1.09375, "learning_rate": 0.00047906451619331364, "loss": 5.2194, "mean_token_accuracy": 0.18373893499374389, "num_tokens": 32349344.0, "step": 18650 }, { "entropy": 5.634494924545288, "epoch": 1.451429682941062, "grad_norm": 1.0234375, "learning_rate": 0.00047905283998161404, "loss": 5.0651, "mean_token_accuracy": 0.19423912614583969, "num_tokens": 32357797.0, "step": 18655 }, { "entropy": 5.489991855621338, "epoch": 1.4518187123127797, "grad_norm": 1.078125, "learning_rate": 0.00047904116067373743, "loss": 5.005, "mean_token_accuracy": 0.19429002553224564, "num_tokens": 32366131.0, "step": 18660 }, { "entropy": 5.525245141983032, "epoch": 1.4522077416844972, "grad_norm": 1.046875, "learning_rate": 0.0004790294782698609, "loss": 5.1387, "mean_token_accuracy": 0.18561048060655594, "num_tokens": 32374738.0, "step": 18665 }, { "entropy": 5.6096843719482425, "epoch": 1.4525967710562147, "grad_norm": 1.0390625, "learning_rate": 0.0004790177927701618, "loss": 5.0786, "mean_token_accuracy": 0.19506489038467406, "num_tokens": 32383638.0, "step": 18670 }, { "entropy": 5.62228045463562, "epoch": 1.4529858004279324, "grad_norm": 1.046875, "learning_rate": 0.0004790061041748174, "loss": 5.1201, "mean_token_accuracy": 0.19145291596651076, "num_tokens": 32393269.0, "step": 18675 }, { "entropy": 5.627675104141235, "epoch": 1.4533748297996498, "grad_norm": 1.1171875, "learning_rate": 0.0004789944124840051, "loss": 5.0992, "mean_token_accuracy": 0.187997068464756, "num_tokens": 32401568.0, "step": 18680 }, { "entropy": 5.503940582275391, "epoch": 1.4537638591713673, "grad_norm": 1.0546875, "learning_rate": 0.0004789827176979022, "loss": 5.011, "mean_token_accuracy": 0.19666482359170914, "num_tokens": 32409996.0, "step": 18685 }, { "entropy": 5.524633121490479, "epoch": 1.454152888543085, "grad_norm": 1.109375, "learning_rate": 0.0004789710198166864, "loss": 5.0637, "mean_token_accuracy": 0.1880654439330101, "num_tokens": 32418886.0, "step": 18690 }, { "entropy": 5.500271272659302, "epoch": 1.4545419179148027, "grad_norm": 0.953125, "learning_rate": 0.00047895931884053497, "loss": 4.8944, "mean_token_accuracy": 0.20765060782432557, "num_tokens": 32427999.0, "step": 18695 }, { "entropy": 5.615154075622558, "epoch": 1.4549309472865202, "grad_norm": 1.1171875, "learning_rate": 0.00047894761476962547, "loss": 5.188, "mean_token_accuracy": 0.18642514944076538, "num_tokens": 32437115.0, "step": 18700 }, { "entropy": 5.572081136703491, "epoch": 1.4553199766582376, "grad_norm": 1.109375, "learning_rate": 0.00047893590760413545, "loss": 5.0069, "mean_token_accuracy": 0.19455082565546036, "num_tokens": 32445668.0, "step": 18705 }, { "entropy": 5.528560590744019, "epoch": 1.4557090060299553, "grad_norm": 1.1328125, "learning_rate": 0.00047892419734424276, "loss": 5.0167, "mean_token_accuracy": 0.20066999793052673, "num_tokens": 32454022.0, "step": 18710 }, { "entropy": 5.630763721466065, "epoch": 1.4560980354016728, "grad_norm": 1.1171875, "learning_rate": 0.00047891248399012495, "loss": 5.1603, "mean_token_accuracy": 0.19045792520046234, "num_tokens": 32462997.0, "step": 18715 }, { "entropy": 5.633201646804809, "epoch": 1.4564870647733903, "grad_norm": 1.0859375, "learning_rate": 0.0004789007675419597, "loss": 5.0503, "mean_token_accuracy": 0.1997034251689911, "num_tokens": 32471184.0, "step": 18720 }, { "entropy": 5.551861333847046, "epoch": 1.456876094145108, "grad_norm": 1.0390625, "learning_rate": 0.00047888904799992486, "loss": 5.0568, "mean_token_accuracy": 0.1970541149377823, "num_tokens": 32480051.0, "step": 18725 }, { "entropy": 5.4956131935119625, "epoch": 1.4572651235168255, "grad_norm": 0.9765625, "learning_rate": 0.00047887732536419826, "loss": 5.0677, "mean_token_accuracy": 0.19423022270202636, "num_tokens": 32489269.0, "step": 18730 }, { "entropy": 5.547731590270996, "epoch": 1.4576541528885432, "grad_norm": 1.015625, "learning_rate": 0.0004788655996349577, "loss": 5.033, "mean_token_accuracy": 0.19189910888671874, "num_tokens": 32497941.0, "step": 18735 }, { "entropy": 5.59726128578186, "epoch": 1.4580431822602606, "grad_norm": 1.0390625, "learning_rate": 0.00047885387081238125, "loss": 5.0711, "mean_token_accuracy": 0.1905573159456253, "num_tokens": 32507679.0, "step": 18740 }, { "entropy": 5.572452354431152, "epoch": 1.4584322116319783, "grad_norm": 1.0546875, "learning_rate": 0.0004788421388966467, "loss": 5.0931, "mean_token_accuracy": 0.19150498062372207, "num_tokens": 32516964.0, "step": 18745 }, { "entropy": 5.555433559417724, "epoch": 1.4588212410036958, "grad_norm": 1.171875, "learning_rate": 0.00047883040388793207, "loss": 4.9453, "mean_token_accuracy": 0.20217805802822114, "num_tokens": 32525178.0, "step": 18750 }, { "entropy": 5.629390144348145, "epoch": 1.4592102703754133, "grad_norm": 1.1484375, "learning_rate": 0.00047881866578641563, "loss": 5.1077, "mean_token_accuracy": 0.19340988397598266, "num_tokens": 32533694.0, "step": 18755 }, { "entropy": 5.523817873001098, "epoch": 1.459599299747131, "grad_norm": 1.078125, "learning_rate": 0.0004788069245922753, "loss": 5.0857, "mean_token_accuracy": 0.1934250608086586, "num_tokens": 32542529.0, "step": 18760 }, { "entropy": 5.573589515686035, "epoch": 1.4599883291188485, "grad_norm": 1.125, "learning_rate": 0.0004787951803056893, "loss": 5.088, "mean_token_accuracy": 0.18822696059942245, "num_tokens": 32550987.0, "step": 18765 }, { "entropy": 5.5425773620605465, "epoch": 1.460377358490566, "grad_norm": 1.0625, "learning_rate": 0.0004787834329268358, "loss": 5.0264, "mean_token_accuracy": 0.20274723917245865, "num_tokens": 32559812.0, "step": 18770 }, { "entropy": 5.559297847747803, "epoch": 1.4607663878622836, "grad_norm": 1.109375, "learning_rate": 0.000478771682455893, "loss": 5.0633, "mean_token_accuracy": 0.19930223673582076, "num_tokens": 32568477.0, "step": 18775 }, { "entropy": 5.666076278686523, "epoch": 1.461155417234001, "grad_norm": 1.046875, "learning_rate": 0.0004787599288930393, "loss": 5.1174, "mean_token_accuracy": 0.18893970549106598, "num_tokens": 32577921.0, "step": 18780 }, { "entropy": 5.575228023529053, "epoch": 1.4615444466057188, "grad_norm": 1.0390625, "learning_rate": 0.000478748172238453, "loss": 5.0108, "mean_token_accuracy": 0.19555109292268752, "num_tokens": 32587028.0, "step": 18785 }, { "entropy": 5.523946857452392, "epoch": 1.4619334759774363, "grad_norm": 1.0625, "learning_rate": 0.0004787364124923125, "loss": 5.0584, "mean_token_accuracy": 0.19399283230304717, "num_tokens": 32596092.0, "step": 18790 }, { "entropy": 5.566801881790161, "epoch": 1.462322505349154, "grad_norm": 1.109375, "learning_rate": 0.00047872464965479625, "loss": 4.9985, "mean_token_accuracy": 0.19481611400842666, "num_tokens": 32605271.0, "step": 18795 }, { "entropy": 5.625771617889404, "epoch": 1.4627115347208715, "grad_norm": 1.125, "learning_rate": 0.0004787128837260826, "loss": 5.1734, "mean_token_accuracy": 0.19190704971551895, "num_tokens": 32614240.0, "step": 18800 }, { "entropy": 5.5675859451293945, "epoch": 1.463100564092589, "grad_norm": 1.0546875, "learning_rate": 0.0004787011147063503, "loss": 5.0982, "mean_token_accuracy": 0.19406021982431412, "num_tokens": 32623390.0, "step": 18805 }, { "entropy": 5.563939762115479, "epoch": 1.4634895934643066, "grad_norm": 1.09375, "learning_rate": 0.0004786893425957777, "loss": 5.0779, "mean_token_accuracy": 0.19618055671453477, "num_tokens": 32631649.0, "step": 18810 }, { "entropy": 5.480380058288574, "epoch": 1.463878622836024, "grad_norm": 1.046875, "learning_rate": 0.0004786775673945436, "loss": 4.995, "mean_token_accuracy": 0.20107911080121993, "num_tokens": 32640844.0, "step": 18815 }, { "entropy": 5.59027214050293, "epoch": 1.4642676522077416, "grad_norm": 1.0546875, "learning_rate": 0.00047866578910282656, "loss": 5.0551, "mean_token_accuracy": 0.19571651965379716, "num_tokens": 32649458.0, "step": 18820 }, { "entropy": 5.537847471237183, "epoch": 1.4646566815794593, "grad_norm": 1.125, "learning_rate": 0.00047865400772080535, "loss": 5.0451, "mean_token_accuracy": 0.1985006421804428, "num_tokens": 32657649.0, "step": 18825 }, { "entropy": 5.602824020385742, "epoch": 1.4650457109511767, "grad_norm": 1.1875, "learning_rate": 0.00047864222324865875, "loss": 5.1874, "mean_token_accuracy": 0.18851166665554048, "num_tokens": 32665407.0, "step": 18830 }, { "entropy": 5.571836233139038, "epoch": 1.4654347403228944, "grad_norm": 1.1328125, "learning_rate": 0.0004786304356865655, "loss": 5.0278, "mean_token_accuracy": 0.1974502131342888, "num_tokens": 32673760.0, "step": 18835 }, { "entropy": 5.581008529663086, "epoch": 1.465823769694612, "grad_norm": 1.109375, "learning_rate": 0.00047861864503470457, "loss": 5.0692, "mean_token_accuracy": 0.1879628360271454, "num_tokens": 32682118.0, "step": 18840 }, { "entropy": 5.535200357437134, "epoch": 1.4662127990663296, "grad_norm": 1.203125, "learning_rate": 0.0004786068512932547, "loss": 5.0811, "mean_token_accuracy": 0.19541595429182052, "num_tokens": 32690430.0, "step": 18845 }, { "entropy": 5.52359790802002, "epoch": 1.466601828438047, "grad_norm": 1.140625, "learning_rate": 0.000478595054462395, "loss": 4.9419, "mean_token_accuracy": 0.2031147986650467, "num_tokens": 32698776.0, "step": 18850 }, { "entropy": 5.66003565788269, "epoch": 1.4669908578097646, "grad_norm": 1.1796875, "learning_rate": 0.00047858325454230437, "loss": 5.1612, "mean_token_accuracy": 0.18816800117492677, "num_tokens": 32707299.0, "step": 18855 }, { "entropy": 5.507990217208862, "epoch": 1.4673798871814823, "grad_norm": 1.1484375, "learning_rate": 0.0004785714515331619, "loss": 4.9881, "mean_token_accuracy": 0.2052214726805687, "num_tokens": 32716041.0, "step": 18860 }, { "entropy": 5.6020430564880375, "epoch": 1.4677689165531997, "grad_norm": 1.15625, "learning_rate": 0.00047855964543514666, "loss": 5.0141, "mean_token_accuracy": 0.19592691212892532, "num_tokens": 32724182.0, "step": 18865 }, { "entropy": 5.566276550292969, "epoch": 1.4681579459249172, "grad_norm": 1.0625, "learning_rate": 0.00047854783624843786, "loss": 5.0034, "mean_token_accuracy": 0.19594035893678666, "num_tokens": 32732858.0, "step": 18870 }, { "entropy": 5.5909693241119385, "epoch": 1.468546975296635, "grad_norm": 1.125, "learning_rate": 0.00047853602397321453, "loss": 5.0972, "mean_token_accuracy": 0.1932918667793274, "num_tokens": 32741422.0, "step": 18875 }, { "entropy": 5.639022922515869, "epoch": 1.4689360046683524, "grad_norm": 1.0703125, "learning_rate": 0.00047852420860965605, "loss": 5.1877, "mean_token_accuracy": 0.18375477939844131, "num_tokens": 32750720.0, "step": 18880 }, { "entropy": 5.562513256072998, "epoch": 1.46932503404007, "grad_norm": 1.046875, "learning_rate": 0.00047851239015794166, "loss": 5.0082, "mean_token_accuracy": 0.1998475506901741, "num_tokens": 32759418.0, "step": 18885 }, { "entropy": 5.5755987644195555, "epoch": 1.4697140634117876, "grad_norm": 1.1015625, "learning_rate": 0.00047850056861825066, "loss": 5.0727, "mean_token_accuracy": 0.19650003015995027, "num_tokens": 32767604.0, "step": 18890 }, { "entropy": 5.551788806915283, "epoch": 1.4701030927835053, "grad_norm": 1.1015625, "learning_rate": 0.00047848874399076245, "loss": 5.1614, "mean_token_accuracy": 0.19154007434844972, "num_tokens": 32776535.0, "step": 18895 }, { "entropy": 5.623146390914917, "epoch": 1.4704921221552227, "grad_norm": 1.078125, "learning_rate": 0.0004784769162756563, "loss": 5.0517, "mean_token_accuracy": 0.19319026321172714, "num_tokens": 32785633.0, "step": 18900 }, { "entropy": 5.62552318572998, "epoch": 1.4708811515269402, "grad_norm": 1.125, "learning_rate": 0.000478465085473112, "loss": 5.0176, "mean_token_accuracy": 0.20355227887630462, "num_tokens": 32794281.0, "step": 18905 }, { "entropy": 5.608726692199707, "epoch": 1.471270180898658, "grad_norm": 1.171875, "learning_rate": 0.0004784532515833088, "loss": 5.196, "mean_token_accuracy": 0.18529308140277861, "num_tokens": 32802312.0, "step": 18910 }, { "entropy": 5.462705802917481, "epoch": 1.4716592102703754, "grad_norm": 1.0859375, "learning_rate": 0.00047844141460642636, "loss": 4.9772, "mean_token_accuracy": 0.20115538239479064, "num_tokens": 32810983.0, "step": 18915 }, { "entropy": 5.549010515213013, "epoch": 1.4720482396420929, "grad_norm": 1.0546875, "learning_rate": 0.00047842957454264425, "loss": 5.0076, "mean_token_accuracy": 0.1969162791967392, "num_tokens": 32820695.0, "step": 18920 }, { "entropy": 5.63861050605774, "epoch": 1.4724372690138106, "grad_norm": 1.1484375, "learning_rate": 0.00047841773139214213, "loss": 5.0818, "mean_token_accuracy": 0.19995233565568923, "num_tokens": 32828483.0, "step": 18925 }, { "entropy": 5.572253322601318, "epoch": 1.472826298385528, "grad_norm": 0.99609375, "learning_rate": 0.0004784058851550997, "loss": 5.0775, "mean_token_accuracy": 0.19355525374412536, "num_tokens": 32837827.0, "step": 18930 }, { "entropy": 5.59632134437561, "epoch": 1.4732153277572457, "grad_norm": 1.234375, "learning_rate": 0.0004783940358316967, "loss": 5.1605, "mean_token_accuracy": 0.19170475304126738, "num_tokens": 32846872.0, "step": 18935 }, { "entropy": 5.5714335441589355, "epoch": 1.4736043571289632, "grad_norm": 1.1484375, "learning_rate": 0.00047838218342211296, "loss": 4.9744, "mean_token_accuracy": 0.20586660653352737, "num_tokens": 32855418.0, "step": 18940 }, { "entropy": 5.554733562469482, "epoch": 1.473993386500681, "grad_norm": 1.0234375, "learning_rate": 0.00047837032792652837, "loss": 5.0543, "mean_token_accuracy": 0.1885649234056473, "num_tokens": 32864075.0, "step": 18945 }, { "entropy": 5.621124315261841, "epoch": 1.4743824158723984, "grad_norm": 1.1640625, "learning_rate": 0.0004783584693451226, "loss": 5.1607, "mean_token_accuracy": 0.18383949398994445, "num_tokens": 32872615.0, "step": 18950 }, { "entropy": 5.59563250541687, "epoch": 1.4747714452441159, "grad_norm": 1.0390625, "learning_rate": 0.0004783466076780759, "loss": 5.0193, "mean_token_accuracy": 0.19872697740793227, "num_tokens": 32881313.0, "step": 18955 }, { "entropy": 5.612353324890137, "epoch": 1.4751604746158336, "grad_norm": 1.234375, "learning_rate": 0.0004783347429255679, "loss": 5.097, "mean_token_accuracy": 0.1908573865890503, "num_tokens": 32889323.0, "step": 18960 }, { "entropy": 5.48879189491272, "epoch": 1.475549503987551, "grad_norm": 1.0703125, "learning_rate": 0.000478322875087779, "loss": 5.0394, "mean_token_accuracy": 0.19176848381757736, "num_tokens": 32898045.0, "step": 18965 }, { "entropy": 5.593360471725464, "epoch": 1.4759385333592685, "grad_norm": 1.1171875, "learning_rate": 0.00047831100416488906, "loss": 5.1285, "mean_token_accuracy": 0.18137247413396834, "num_tokens": 32906646.0, "step": 18970 }, { "entropy": 5.652133464813232, "epoch": 1.4763275627309862, "grad_norm": 1.109375, "learning_rate": 0.00047829913015707816, "loss": 5.1118, "mean_token_accuracy": 0.195922589302063, "num_tokens": 32915714.0, "step": 18975 }, { "entropy": 5.61593451499939, "epoch": 1.4767165921027037, "grad_norm": 1.1015625, "learning_rate": 0.00047828725306452657, "loss": 5.1693, "mean_token_accuracy": 0.18409212827682495, "num_tokens": 32924996.0, "step": 18980 }, { "entropy": 5.535516548156738, "epoch": 1.4771056214744214, "grad_norm": 1.15625, "learning_rate": 0.00047827537288741453, "loss": 4.9976, "mean_token_accuracy": 0.19476582556962968, "num_tokens": 32933550.0, "step": 18985 }, { "entropy": 5.61582088470459, "epoch": 1.4774946508461388, "grad_norm": 1.0859375, "learning_rate": 0.0004782634896259222, "loss": 5.1323, "mean_token_accuracy": 0.18661850094795226, "num_tokens": 32941800.0, "step": 18990 }, { "entropy": 5.570117616653443, "epoch": 1.4778836802178565, "grad_norm": 1.03125, "learning_rate": 0.00047825160328023, "loss": 5.1101, "mean_token_accuracy": 0.19426927268505095, "num_tokens": 32951674.0, "step": 18995 }, { "entropy": 5.543429756164551, "epoch": 1.478272709589574, "grad_norm": 1.1015625, "learning_rate": 0.0004782397138505181, "loss": 5.0336, "mean_token_accuracy": 0.19767086952924728, "num_tokens": 32959880.0, "step": 19000 }, { "entropy": 5.51564393043518, "epoch": 1.4786617389612915, "grad_norm": 1.1171875, "learning_rate": 0.00047822782133696715, "loss": 5.0217, "mean_token_accuracy": 0.19804281145334243, "num_tokens": 32968557.0, "step": 19005 }, { "entropy": 5.652625799179077, "epoch": 1.4790507683330092, "grad_norm": 1.1484375, "learning_rate": 0.0004782159257397574, "loss": 5.1289, "mean_token_accuracy": 0.1893562525510788, "num_tokens": 32977519.0, "step": 19010 }, { "entropy": 5.661211061477661, "epoch": 1.4794397977047267, "grad_norm": 1.03125, "learning_rate": 0.00047820402705906953, "loss": 5.1241, "mean_token_accuracy": 0.1940256491303444, "num_tokens": 32985917.0, "step": 19015 }, { "entropy": 5.544444990158081, "epoch": 1.4798288270764441, "grad_norm": 1.03125, "learning_rate": 0.00047819212529508394, "loss": 5.0369, "mean_token_accuracy": 0.1927164226770401, "num_tokens": 32994612.0, "step": 19020 }, { "entropy": 5.566820764541626, "epoch": 1.4802178564481618, "grad_norm": 1.0859375, "learning_rate": 0.0004781802204479812, "loss": 5.1477, "mean_token_accuracy": 0.18955909609794616, "num_tokens": 33003528.0, "step": 19025 }, { "entropy": 5.539485883712769, "epoch": 1.4806068858198795, "grad_norm": 1.046875, "learning_rate": 0.0004781683125179421, "loss": 5.0244, "mean_token_accuracy": 0.19851790368556976, "num_tokens": 33011685.0, "step": 19030 }, { "entropy": 5.598773717880249, "epoch": 1.480995915191597, "grad_norm": 1.046875, "learning_rate": 0.0004781564015051472, "loss": 5.061, "mean_token_accuracy": 0.2010917544364929, "num_tokens": 33020313.0, "step": 19035 }, { "entropy": 5.5313574314117435, "epoch": 1.4813849445633145, "grad_norm": 1.109375, "learning_rate": 0.0004781444874097772, "loss": 5.0941, "mean_token_accuracy": 0.19380384981632232, "num_tokens": 33029143.0, "step": 19040 }, { "entropy": 5.547285318374634, "epoch": 1.4817739739350322, "grad_norm": 1.109375, "learning_rate": 0.00047813257023201307, "loss": 5.0377, "mean_token_accuracy": 0.19310810416936874, "num_tokens": 33038359.0, "step": 19045 }, { "entropy": 5.500748586654663, "epoch": 1.4821630033067497, "grad_norm": 1.0859375, "learning_rate": 0.0004781206499720354, "loss": 5.0775, "mean_token_accuracy": 0.19251402467489243, "num_tokens": 33046914.0, "step": 19050 }, { "entropy": 5.663674545288086, "epoch": 1.4825520326784671, "grad_norm": 1.1796875, "learning_rate": 0.00047810872663002523, "loss": 5.1604, "mean_token_accuracy": 0.18689447939395903, "num_tokens": 33054490.0, "step": 19055 }, { "entropy": 5.633870315551758, "epoch": 1.4829410620501848, "grad_norm": 1.078125, "learning_rate": 0.00047809680020616333, "loss": 5.1964, "mean_token_accuracy": 0.19687311947345734, "num_tokens": 33064624.0, "step": 19060 }, { "entropy": 5.550516271591187, "epoch": 1.4833300914219023, "grad_norm": 1.0703125, "learning_rate": 0.00047808487070063083, "loss": 4.9402, "mean_token_accuracy": 0.19578172713518144, "num_tokens": 33072581.0, "step": 19065 }, { "entropy": 5.58398847579956, "epoch": 1.4837191207936198, "grad_norm": 1.0859375, "learning_rate": 0.0004780729381136086, "loss": 5.0904, "mean_token_accuracy": 0.18775062412023544, "num_tokens": 33081696.0, "step": 19070 }, { "entropy": 5.5863862991333, "epoch": 1.4841081501653375, "grad_norm": 1.09375, "learning_rate": 0.0004780610024452778, "loss": 5.0878, "mean_token_accuracy": 0.18797999024391174, "num_tokens": 33090470.0, "step": 19075 }, { "entropy": 5.6668144226074215, "epoch": 1.4844971795370552, "grad_norm": 1.109375, "learning_rate": 0.00047804906369581954, "loss": 5.1244, "mean_token_accuracy": 0.19658679366111756, "num_tokens": 33099006.0, "step": 19080 }, { "entropy": 5.536320066452026, "epoch": 1.4848862089087727, "grad_norm": 1.1875, "learning_rate": 0.0004780371218654148, "loss": 4.9703, "mean_token_accuracy": 0.20517763793468474, "num_tokens": 33107715.0, "step": 19085 }, { "entropy": 5.5414488315582275, "epoch": 1.4852752382804901, "grad_norm": 1.140625, "learning_rate": 0.00047802517695424496, "loss": 5.027, "mean_token_accuracy": 0.20121121555566787, "num_tokens": 33116895.0, "step": 19090 }, { "entropy": 5.557491493225098, "epoch": 1.4856642676522078, "grad_norm": 1.015625, "learning_rate": 0.0004780132289624913, "loss": 5.0685, "mean_token_accuracy": 0.19618549644947053, "num_tokens": 33125676.0, "step": 19095 }, { "entropy": 5.587356281280518, "epoch": 1.4860532970239253, "grad_norm": 1.046875, "learning_rate": 0.0004780012778903349, "loss": 5.072, "mean_token_accuracy": 0.19770988821983337, "num_tokens": 33134870.0, "step": 19100 }, { "entropy": 5.596536540985108, "epoch": 1.4864423263956428, "grad_norm": 1.0625, "learning_rate": 0.00047798932373795724, "loss": 5.1332, "mean_token_accuracy": 0.19328347742557525, "num_tokens": 33144258.0, "step": 19105 }, { "entropy": 5.585326051712036, "epoch": 1.4868313557673605, "grad_norm": 1.0546875, "learning_rate": 0.00047797736650553977, "loss": 5.0743, "mean_token_accuracy": 0.19224788397550582, "num_tokens": 33153703.0, "step": 19110 }, { "entropy": 5.605956125259399, "epoch": 1.487220385139078, "grad_norm": 1.0546875, "learning_rate": 0.00047796540619326366, "loss": 5.0884, "mean_token_accuracy": 0.18901002407073975, "num_tokens": 33163092.0, "step": 19115 }, { "entropy": 5.580852937698364, "epoch": 1.4876094145107956, "grad_norm": 1.125, "learning_rate": 0.0004779534428013107, "loss": 5.0814, "mean_token_accuracy": 0.19141940474510194, "num_tokens": 33172133.0, "step": 19120 }, { "entropy": 5.517036485671997, "epoch": 1.4879984438825131, "grad_norm": 1.078125, "learning_rate": 0.00047794147632986223, "loss": 5.0937, "mean_token_accuracy": 0.18955782055854797, "num_tokens": 33180629.0, "step": 19125 }, { "entropy": 5.549312686920166, "epoch": 1.4883874732542308, "grad_norm": 1.078125, "learning_rate": 0.0004779295067790999, "loss": 5.0214, "mean_token_accuracy": 0.19882277846336366, "num_tokens": 33189602.0, "step": 19130 }, { "entropy": 5.61234769821167, "epoch": 1.4887765026259483, "grad_norm": 1.0859375, "learning_rate": 0.0004779175341492053, "loss": 5.0702, "mean_token_accuracy": 0.1925092801451683, "num_tokens": 33198403.0, "step": 19135 }, { "entropy": 5.548788690567017, "epoch": 1.4891655319976658, "grad_norm": 1.0625, "learning_rate": 0.0004779055584403601, "loss": 5.0303, "mean_token_accuracy": 0.19645118862390518, "num_tokens": 33207131.0, "step": 19140 }, { "entropy": 5.548093605041504, "epoch": 1.4895545613693835, "grad_norm": 1.0625, "learning_rate": 0.000477893579652746, "loss": 5.0617, "mean_token_accuracy": 0.19630425721406936, "num_tokens": 33216143.0, "step": 19145 }, { "entropy": 5.552432060241699, "epoch": 1.489943590741101, "grad_norm": 1.0859375, "learning_rate": 0.00047788159778654475, "loss": 5.0553, "mean_token_accuracy": 0.20241442024707795, "num_tokens": 33224558.0, "step": 19150 }, { "entropy": 5.4855327129364015, "epoch": 1.4903326201128184, "grad_norm": 1.0859375, "learning_rate": 0.00047786961284193813, "loss": 5.0506, "mean_token_accuracy": 0.1939181610941887, "num_tokens": 33232737.0, "step": 19155 }, { "entropy": 5.598868465423584, "epoch": 1.4907216494845361, "grad_norm": 1.09375, "learning_rate": 0.0004778576248191081, "loss": 5.0535, "mean_token_accuracy": 0.19636685252189637, "num_tokens": 33240845.0, "step": 19160 }, { "entropy": 5.583921718597412, "epoch": 1.4911106788562536, "grad_norm": 1.15625, "learning_rate": 0.0004778456337182365, "loss": 4.9972, "mean_token_accuracy": 0.19798042327165605, "num_tokens": 33249101.0, "step": 19165 }, { "entropy": 5.588040018081665, "epoch": 1.4914997082279713, "grad_norm": 1.046875, "learning_rate": 0.0004778336395395052, "loss": 5.0699, "mean_token_accuracy": 0.1939498409628868, "num_tokens": 33258403.0, "step": 19170 }, { "entropy": 5.47011284828186, "epoch": 1.4918887375996888, "grad_norm": 1.2421875, "learning_rate": 0.00047782164228309636, "loss": 4.998, "mean_token_accuracy": 0.19609101563692094, "num_tokens": 33266679.0, "step": 19175 }, { "entropy": 5.528414678573609, "epoch": 1.4922777669714065, "grad_norm": 1.0859375, "learning_rate": 0.00047780964194919193, "loss": 4.9915, "mean_token_accuracy": 0.2035393849015236, "num_tokens": 33274996.0, "step": 19180 }, { "entropy": 5.678403854370117, "epoch": 1.492666796343124, "grad_norm": 1.1796875, "learning_rate": 0.00047779763853797387, "loss": 5.1253, "mean_token_accuracy": 0.19158455431461335, "num_tokens": 33282558.0, "step": 19185 }, { "entropy": 5.568390703201294, "epoch": 1.4930558257148414, "grad_norm": 1.15625, "learning_rate": 0.0004777856320496245, "loss": 5.1168, "mean_token_accuracy": 0.18217631578445434, "num_tokens": 33291233.0, "step": 19190 }, { "entropy": 5.5606378555297855, "epoch": 1.493444855086559, "grad_norm": 1.109375, "learning_rate": 0.000477773622484326, "loss": 4.9836, "mean_token_accuracy": 0.19835010766983033, "num_tokens": 33299821.0, "step": 19195 }, { "entropy": 5.57656683921814, "epoch": 1.4938338844582766, "grad_norm": 1.0703125, "learning_rate": 0.0004777616098422604, "loss": 5.0695, "mean_token_accuracy": 0.19526538699865342, "num_tokens": 33309624.0, "step": 19200 }, { "entropy": 5.60174880027771, "epoch": 1.494222913829994, "grad_norm": 1.0546875, "learning_rate": 0.00047774959412361014, "loss": 5.0647, "mean_token_accuracy": 0.19210640490055084, "num_tokens": 33318727.0, "step": 19205 }, { "entropy": 5.649438858032227, "epoch": 1.4946119432017118, "grad_norm": 1.140625, "learning_rate": 0.0004777375753285575, "loss": 5.09, "mean_token_accuracy": 0.19180068373680115, "num_tokens": 33327219.0, "step": 19210 }, { "entropy": 5.576749420166015, "epoch": 1.4950009725734292, "grad_norm": 1.015625, "learning_rate": 0.00047772555345728486, "loss": 5.0819, "mean_token_accuracy": 0.19740756303071977, "num_tokens": 33336466.0, "step": 19215 }, { "entropy": 5.653395366668701, "epoch": 1.495390001945147, "grad_norm": 1.0859375, "learning_rate": 0.0004777135285099746, "loss": 5.123, "mean_token_accuracy": 0.18821924179792404, "num_tokens": 33346040.0, "step": 19220 }, { "entropy": 5.633251619338989, "epoch": 1.4957790313168644, "grad_norm": 1.09375, "learning_rate": 0.0004777015004868092, "loss": 5.0604, "mean_token_accuracy": 0.19527262896299363, "num_tokens": 33355476.0, "step": 19225 }, { "entropy": 5.523338031768799, "epoch": 1.496168060688582, "grad_norm": 1.140625, "learning_rate": 0.0004776894693879712, "loss": 5.05, "mean_token_accuracy": 0.20084767490625383, "num_tokens": 33364455.0, "step": 19230 }, { "entropy": 5.498026990890503, "epoch": 1.4965570900602996, "grad_norm": 1.0625, "learning_rate": 0.0004776774352136431, "loss": 5.0325, "mean_token_accuracy": 0.1946844071149826, "num_tokens": 33373129.0, "step": 19235 }, { "entropy": 5.538338851928711, "epoch": 1.496946119432017, "grad_norm": 1.0625, "learning_rate": 0.00047766539796400756, "loss": 5.0679, "mean_token_accuracy": 0.19540319293737413, "num_tokens": 33382775.0, "step": 19240 }, { "entropy": 5.566079902648926, "epoch": 1.4973351488037348, "grad_norm": 1.03125, "learning_rate": 0.0004776533576392471, "loss": 5.0643, "mean_token_accuracy": 0.19488465785980225, "num_tokens": 33391370.0, "step": 19245 }, { "entropy": 5.650099802017212, "epoch": 1.4977241781754522, "grad_norm": 1.0703125, "learning_rate": 0.0004776413142395445, "loss": 5.0486, "mean_token_accuracy": 0.20248957127332687, "num_tokens": 33399832.0, "step": 19250 }, { "entropy": 5.579137086868286, "epoch": 1.4981132075471697, "grad_norm": 1.046875, "learning_rate": 0.00047762926776508244, "loss": 5.0842, "mean_token_accuracy": 0.19543857127428055, "num_tokens": 33408709.0, "step": 19255 }, { "entropy": 5.5633625984191895, "epoch": 1.4985022369188874, "grad_norm": 1.171875, "learning_rate": 0.00047761721821604387, "loss": 5.0838, "mean_token_accuracy": 0.1878870129585266, "num_tokens": 33416983.0, "step": 19260 }, { "entropy": 5.594844007492066, "epoch": 1.4988912662906049, "grad_norm": 1.09375, "learning_rate": 0.0004776051655926115, "loss": 5.0922, "mean_token_accuracy": 0.19709914773702622, "num_tokens": 33426692.0, "step": 19265 }, { "entropy": 5.628974771499633, "epoch": 1.4992802956623226, "grad_norm": 1.2265625, "learning_rate": 0.00047759310989496813, "loss": 5.0904, "mean_token_accuracy": 0.19887521415948867, "num_tokens": 33434895.0, "step": 19270 }, { "entropy": 5.540286493301392, "epoch": 1.49966932503404, "grad_norm": 1.0859375, "learning_rate": 0.0004775810511232969, "loss": 5.0012, "mean_token_accuracy": 0.19382265210151672, "num_tokens": 33443378.0, "step": 19275 }, { "entropy": 5.636977481842041, "epoch": 1.5000583544057577, "grad_norm": 1.0078125, "learning_rate": 0.00047756898927778056, "loss": 5.1195, "mean_token_accuracy": 0.19604988098144532, "num_tokens": 33452753.0, "step": 19280 }, { "entropy": 5.677890729904175, "epoch": 1.5004473837774752, "grad_norm": 1.1015625, "learning_rate": 0.00047755692435860227, "loss": 5.1074, "mean_token_accuracy": 0.18693026751279831, "num_tokens": 33461625.0, "step": 19285 }, { "entropy": 5.575669860839843, "epoch": 1.5008364131491927, "grad_norm": 1.1484375, "learning_rate": 0.000477544856365945, "loss": 5.0404, "mean_token_accuracy": 0.19978867769241332, "num_tokens": 33471228.0, "step": 19290 }, { "entropy": 5.571637105941773, "epoch": 1.5012254425209104, "grad_norm": 1.1015625, "learning_rate": 0.00047753278529999205, "loss": 5.0319, "mean_token_accuracy": 0.20052454024553298, "num_tokens": 33480137.0, "step": 19295 }, { "entropy": 5.531462240219116, "epoch": 1.5016144718926279, "grad_norm": 1.0859375, "learning_rate": 0.00047752071116092637, "loss": 5.0609, "mean_token_accuracy": 0.19850317388772964, "num_tokens": 33488860.0, "step": 19300 }, { "entropy": 5.565470170974732, "epoch": 1.5020035012643453, "grad_norm": 1.0859375, "learning_rate": 0.0004775086339489312, "loss": 5.0184, "mean_token_accuracy": 0.19380063265562059, "num_tokens": 33497625.0, "step": 19305 }, { "entropy": 5.608009958267212, "epoch": 1.502392530636063, "grad_norm": 1.109375, "learning_rate": 0.0004774965536641899, "loss": 5.1735, "mean_token_accuracy": 0.18376825302839278, "num_tokens": 33506422.0, "step": 19310 }, { "entropy": 5.503243827819825, "epoch": 1.5027815600077807, "grad_norm": 0.96484375, "learning_rate": 0.00047748447030688575, "loss": 4.9583, "mean_token_accuracy": 0.19594318866729737, "num_tokens": 33515638.0, "step": 19315 }, { "entropy": 5.559601783752441, "epoch": 1.503170589379498, "grad_norm": 1.03125, "learning_rate": 0.00047747238387720194, "loss": 4.9915, "mean_token_accuracy": 0.19424587488174438, "num_tokens": 33524287.0, "step": 19320 }, { "entropy": 5.541377067565918, "epoch": 1.5035596187512157, "grad_norm": 1.046875, "learning_rate": 0.000477460294375322, "loss": 5.0078, "mean_token_accuracy": 0.18686453402042388, "num_tokens": 33532579.0, "step": 19325 }, { "entropy": 5.496153211593628, "epoch": 1.5039486481229334, "grad_norm": 1.1484375, "learning_rate": 0.00047744820180142935, "loss": 5.0863, "mean_token_accuracy": 0.18760504871606826, "num_tokens": 33540816.0, "step": 19330 }, { "entropy": 5.469810247421265, "epoch": 1.5043376774946509, "grad_norm": 1.1171875, "learning_rate": 0.00047743610615570746, "loss": 4.9372, "mean_token_accuracy": 0.21007206439971923, "num_tokens": 33549383.0, "step": 19335 }, { "entropy": 5.484566307067871, "epoch": 1.5047267068663683, "grad_norm": 1.1171875, "learning_rate": 0.00047742400743833993, "loss": 5.0052, "mean_token_accuracy": 0.20362815260887146, "num_tokens": 33557457.0, "step": 19340 }, { "entropy": 5.611740446090698, "epoch": 1.505115736238086, "grad_norm": 1.171875, "learning_rate": 0.0004774119056495102, "loss": 5.096, "mean_token_accuracy": 0.19352636635303497, "num_tokens": 33565479.0, "step": 19345 }, { "entropy": 5.575321006774902, "epoch": 1.5055047656098035, "grad_norm": 1.1328125, "learning_rate": 0.00047739980078940206, "loss": 5.0558, "mean_token_accuracy": 0.19160349816083908, "num_tokens": 33574691.0, "step": 19350 }, { "entropy": 5.488074064254761, "epoch": 1.505893794981521, "grad_norm": 1.078125, "learning_rate": 0.00047738769285819894, "loss": 4.9148, "mean_token_accuracy": 0.20925870537757874, "num_tokens": 33582360.0, "step": 19355 }, { "entropy": 5.497641849517822, "epoch": 1.5062828243532387, "grad_norm": 1.109375, "learning_rate": 0.0004773755818560849, "loss": 5.0546, "mean_token_accuracy": 0.19655462056398393, "num_tokens": 33590977.0, "step": 19360 }, { "entropy": 5.508157730102539, "epoch": 1.5066718537249564, "grad_norm": 1.078125, "learning_rate": 0.0004773634677832434, "loss": 5.0267, "mean_token_accuracy": 0.19437309354543686, "num_tokens": 33600227.0, "step": 19365 }, { "entropy": 5.581552886962891, "epoch": 1.5070608830966739, "grad_norm": 1.09375, "learning_rate": 0.0004773513506398584, "loss": 5.0718, "mean_token_accuracy": 0.20136452168226243, "num_tokens": 33608408.0, "step": 19370 }, { "entropy": 5.603423023223877, "epoch": 1.5074499124683913, "grad_norm": 1.0625, "learning_rate": 0.0004773392304261137, "loss": 4.9966, "mean_token_accuracy": 0.19926015436649322, "num_tokens": 33616892.0, "step": 19375 }, { "entropy": 5.570847511291504, "epoch": 1.507838941840109, "grad_norm": 1.0546875, "learning_rate": 0.0004773271071421933, "loss": 5.089, "mean_token_accuracy": 0.1952979639172554, "num_tokens": 33626090.0, "step": 19380 }, { "entropy": 5.450990486145019, "epoch": 1.5082279712118265, "grad_norm": 1.1484375, "learning_rate": 0.00047731498078828105, "loss": 4.9395, "mean_token_accuracy": 0.20228897482156755, "num_tokens": 33634855.0, "step": 19385 }, { "entropy": 5.567227935791015, "epoch": 1.508617000583544, "grad_norm": 1.1875, "learning_rate": 0.000477302851364561, "loss": 5.0954, "mean_token_accuracy": 0.19055859446525575, "num_tokens": 33643425.0, "step": 19390 }, { "entropy": 5.705611944198608, "epoch": 1.5090060299552617, "grad_norm": 1.1640625, "learning_rate": 0.00047729071887121717, "loss": 5.1979, "mean_token_accuracy": 0.18351422548294066, "num_tokens": 33652926.0, "step": 19395 }, { "entropy": 5.682499408721924, "epoch": 1.5093950593269791, "grad_norm": 1.078125, "learning_rate": 0.0004772785833084337, "loss": 5.1002, "mean_token_accuracy": 0.19069569259881974, "num_tokens": 33661279.0, "step": 19400 }, { "entropy": 5.592234182357788, "epoch": 1.5097840886986966, "grad_norm": 1.1796875, "learning_rate": 0.0004772664446763946, "loss": 4.9909, "mean_token_accuracy": 0.19643322378396988, "num_tokens": 33669717.0, "step": 19405 }, { "entropy": 5.612178611755371, "epoch": 1.5101731180704143, "grad_norm": 1.1015625, "learning_rate": 0.0004772543029752842, "loss": 5.1231, "mean_token_accuracy": 0.18813358694314958, "num_tokens": 33679141.0, "step": 19410 }, { "entropy": 5.531675481796265, "epoch": 1.510562147442132, "grad_norm": 1.109375, "learning_rate": 0.00047724215820528666, "loss": 4.9443, "mean_token_accuracy": 0.19856434017419816, "num_tokens": 33686867.0, "step": 19415 }, { "entropy": 5.556469058990478, "epoch": 1.5109511768138495, "grad_norm": 1.1328125, "learning_rate": 0.0004772300103665863, "loss": 5.0251, "mean_token_accuracy": 0.20006405264139177, "num_tokens": 33695073.0, "step": 19420 }, { "entropy": 5.581746816635132, "epoch": 1.511340206185567, "grad_norm": 1.1484375, "learning_rate": 0.00047721785945936733, "loss": 5.1397, "mean_token_accuracy": 0.18900935351848602, "num_tokens": 33703212.0, "step": 19425 }, { "entropy": 5.558242321014404, "epoch": 1.5117292355572847, "grad_norm": 1.0625, "learning_rate": 0.0004772057054838143, "loss": 5.075, "mean_token_accuracy": 0.19665323346853256, "num_tokens": 33711487.0, "step": 19430 }, { "entropy": 5.595670747756958, "epoch": 1.5121182649290021, "grad_norm": 1.1015625, "learning_rate": 0.00047719354844011146, "loss": 5.1123, "mean_token_accuracy": 0.19311933368444442, "num_tokens": 33719642.0, "step": 19435 }, { "entropy": 5.539863204956054, "epoch": 1.5125072943007196, "grad_norm": 1.0625, "learning_rate": 0.0004771813883284434, "loss": 5.0322, "mean_token_accuracy": 0.19719992130994796, "num_tokens": 33728167.0, "step": 19440 }, { "entropy": 5.548494911193847, "epoch": 1.5128963236724373, "grad_norm": 1.1328125, "learning_rate": 0.00047716922514899455, "loss": 5.0697, "mean_token_accuracy": 0.2018439695239067, "num_tokens": 33736094.0, "step": 19445 }, { "entropy": 5.54045147895813, "epoch": 1.5132853530441548, "grad_norm": 1.109375, "learning_rate": 0.00047715705890194953, "loss": 4.9356, "mean_token_accuracy": 0.20860046446323394, "num_tokens": 33744416.0, "step": 19450 }, { "entropy": 5.6045270442962645, "epoch": 1.5136743824158723, "grad_norm": 1.078125, "learning_rate": 0.00047714488958749285, "loss": 5.0475, "mean_token_accuracy": 0.20662701725959778, "num_tokens": 33752873.0, "step": 19455 }, { "entropy": 5.560488319396972, "epoch": 1.51406341178759, "grad_norm": 1.0859375, "learning_rate": 0.00047713271720580924, "loss": 5.0252, "mean_token_accuracy": 0.19914312809705734, "num_tokens": 33761604.0, "step": 19460 }, { "entropy": 5.590336704254151, "epoch": 1.5144524411593077, "grad_norm": 1.25, "learning_rate": 0.0004771205417570834, "loss": 5.042, "mean_token_accuracy": 0.1962210491299629, "num_tokens": 33770562.0, "step": 19465 }, { "entropy": 5.5599888324737545, "epoch": 1.5148414705310251, "grad_norm": 1.0390625, "learning_rate": 0.00047710836324150004, "loss": 5.0066, "mean_token_accuracy": 0.2023396909236908, "num_tokens": 33779037.0, "step": 19470 }, { "entropy": 5.581213331222534, "epoch": 1.5152304999027426, "grad_norm": 1.0625, "learning_rate": 0.000477096181659244, "loss": 5.0491, "mean_token_accuracy": 0.19643453359603882, "num_tokens": 33787949.0, "step": 19475 }, { "entropy": 5.549631834030151, "epoch": 1.5156195292744603, "grad_norm": 1.0625, "learning_rate": 0.0004770839970105, "loss": 4.9926, "mean_token_accuracy": 0.20022557973861693, "num_tokens": 33796783.0, "step": 19480 }, { "entropy": 5.576792812347412, "epoch": 1.5160085586461778, "grad_norm": 1.0703125, "learning_rate": 0.00047707180929545295, "loss": 5.0536, "mean_token_accuracy": 0.19455290734767913, "num_tokens": 33804975.0, "step": 19485 }, { "entropy": 5.51560525894165, "epoch": 1.5163975880178953, "grad_norm": 1.15625, "learning_rate": 0.00047705961851428786, "loss": 5.0381, "mean_token_accuracy": 0.19528384804725646, "num_tokens": 33813355.0, "step": 19490 }, { "entropy": 5.52678689956665, "epoch": 1.516786617389613, "grad_norm": 1.125, "learning_rate": 0.00047704742466718973, "loss": 5.0107, "mean_token_accuracy": 0.2006656751036644, "num_tokens": 33821710.0, "step": 19495 }, { "entropy": 5.63120288848877, "epoch": 1.5171756467613304, "grad_norm": 1.046875, "learning_rate": 0.00047703522775434354, "loss": 5.1517, "mean_token_accuracy": 0.1917886033654213, "num_tokens": 33830674.0, "step": 19500 }, { "entropy": 5.501347255706787, "epoch": 1.517564676133048, "grad_norm": 1.0625, "learning_rate": 0.00047702302777593425, "loss": 5.0053, "mean_token_accuracy": 0.1949546992778778, "num_tokens": 33838963.0, "step": 19505 }, { "entropy": 5.613995361328125, "epoch": 1.5179537055047656, "grad_norm": 1.09375, "learning_rate": 0.00047701082473214715, "loss": 5.1393, "mean_token_accuracy": 0.19097635596990586, "num_tokens": 33847728.0, "step": 19510 }, { "entropy": 5.536901330947876, "epoch": 1.5183427348764833, "grad_norm": 1.15625, "learning_rate": 0.00047699861862316725, "loss": 5.1127, "mean_token_accuracy": 0.19712496548891068, "num_tokens": 33856170.0, "step": 19515 }, { "entropy": 5.5749694347381595, "epoch": 1.5187317642482008, "grad_norm": 0.98046875, "learning_rate": 0.0004769864094491798, "loss": 5.088, "mean_token_accuracy": 0.1986975461244583, "num_tokens": 33865531.0, "step": 19520 }, { "entropy": 5.598203325271607, "epoch": 1.5191207936199183, "grad_norm": 1.0625, "learning_rate": 0.0004769741972103702, "loss": 5.0273, "mean_token_accuracy": 0.1865027889609337, "num_tokens": 33873976.0, "step": 19525 }, { "entropy": 5.524618291854859, "epoch": 1.519509822991636, "grad_norm": 1.25, "learning_rate": 0.00047696198190692353, "loss": 4.925, "mean_token_accuracy": 0.20873354375362396, "num_tokens": 33881884.0, "step": 19530 }, { "entropy": 5.571273374557495, "epoch": 1.5198988523633534, "grad_norm": 1.046875, "learning_rate": 0.0004769497635390253, "loss": 5.1235, "mean_token_accuracy": 0.1934298187494278, "num_tokens": 33890932.0, "step": 19535 }, { "entropy": 5.576713800430298, "epoch": 1.520287881735071, "grad_norm": 1.125, "learning_rate": 0.0004769375421068608, "loss": 5.0678, "mean_token_accuracy": 0.19587604999542235, "num_tokens": 33899271.0, "step": 19540 }, { "entropy": 5.600254249572754, "epoch": 1.5206769111067886, "grad_norm": 1.015625, "learning_rate": 0.00047692531761061555, "loss": 5.0787, "mean_token_accuracy": 0.19327191412448883, "num_tokens": 33908776.0, "step": 19545 }, { "entropy": 5.57512674331665, "epoch": 1.521065940478506, "grad_norm": 1.1015625, "learning_rate": 0.000476913090050475, "loss": 4.9942, "mean_token_accuracy": 0.20409858226776123, "num_tokens": 33917424.0, "step": 19550 }, { "entropy": 5.630815076828003, "epoch": 1.5214549698502235, "grad_norm": 1.1171875, "learning_rate": 0.00047690085942662464, "loss": 5.0679, "mean_token_accuracy": 0.1964910387992859, "num_tokens": 33925948.0, "step": 19555 }, { "entropy": 5.617334794998169, "epoch": 1.5218439992219412, "grad_norm": 1.078125, "learning_rate": 0.00047688862573925015, "loss": 5.0815, "mean_token_accuracy": 0.1968156322836876, "num_tokens": 33934623.0, "step": 19560 }, { "entropy": 5.565413951873779, "epoch": 1.522233028593659, "grad_norm": 1.125, "learning_rate": 0.00047687638898853707, "loss": 5.1086, "mean_token_accuracy": 0.19457069784402847, "num_tokens": 33943871.0, "step": 19565 }, { "entropy": 5.598927736282349, "epoch": 1.5226220579653764, "grad_norm": 1.03125, "learning_rate": 0.0004768641491746711, "loss": 5.0569, "mean_token_accuracy": 0.19387215077877046, "num_tokens": 33953032.0, "step": 19570 }, { "entropy": 5.582177019119262, "epoch": 1.523011087337094, "grad_norm": 1.0703125, "learning_rate": 0.000476851906297838, "loss": 5.0934, "mean_token_accuracy": 0.19157290309667588, "num_tokens": 33961702.0, "step": 19575 }, { "entropy": 5.570657587051391, "epoch": 1.5234001167088116, "grad_norm": 0.97265625, "learning_rate": 0.00047683966035822346, "loss": 5.1232, "mean_token_accuracy": 0.19008880853652954, "num_tokens": 33970996.0, "step": 19580 }, { "entropy": 5.587142515182495, "epoch": 1.523789146080529, "grad_norm": 0.9921875, "learning_rate": 0.00047682741135601336, "loss": 5.0968, "mean_token_accuracy": 0.1952609658241272, "num_tokens": 33980445.0, "step": 19585 }, { "entropy": 5.674527263641357, "epoch": 1.5241781754522465, "grad_norm": 1.171875, "learning_rate": 0.00047681515929139356, "loss": 5.0115, "mean_token_accuracy": 0.1971033588051796, "num_tokens": 33989042.0, "step": 19590 }, { "entropy": 5.516416692733765, "epoch": 1.5245672048239642, "grad_norm": 1.03125, "learning_rate": 0.00047680290416454995, "loss": 4.9073, "mean_token_accuracy": 0.2122926101088524, "num_tokens": 33998162.0, "step": 19595 }, { "entropy": 5.554930257797241, "epoch": 1.524956234195682, "grad_norm": 1.09375, "learning_rate": 0.0004767906459756684, "loss": 5.0553, "mean_token_accuracy": 0.19877246022224426, "num_tokens": 34007480.0, "step": 19600 }, { "entropy": 5.579291105270386, "epoch": 1.5253452635673992, "grad_norm": 1.1484375, "learning_rate": 0.00047677838472493504, "loss": 5.0298, "mean_token_accuracy": 0.19898999184370042, "num_tokens": 34015605.0, "step": 19605 }, { "entropy": 5.637235116958618, "epoch": 1.5257342929391169, "grad_norm": 1.09375, "learning_rate": 0.0004767661204125358, "loss": 5.1465, "mean_token_accuracy": 0.18609951585531234, "num_tokens": 34024847.0, "step": 19610 }, { "entropy": 5.5640504360198975, "epoch": 1.5261233223108346, "grad_norm": 1.0625, "learning_rate": 0.0004767538530386569, "loss": 5.0406, "mean_token_accuracy": 0.19282972067594528, "num_tokens": 34034205.0, "step": 19615 }, { "entropy": 5.575875949859619, "epoch": 1.526512351682552, "grad_norm": 1.125, "learning_rate": 0.00047674158260348437, "loss": 4.9705, "mean_token_accuracy": 0.202081598341465, "num_tokens": 34042578.0, "step": 19620 }, { "entropy": 5.543310213088989, "epoch": 1.5269013810542695, "grad_norm": 1.015625, "learning_rate": 0.00047672930910720436, "loss": 5.048, "mean_token_accuracy": 0.19692113995552063, "num_tokens": 34051699.0, "step": 19625 }, { "entropy": 5.54716682434082, "epoch": 1.5272904104259872, "grad_norm": 1.1015625, "learning_rate": 0.00047671703255000326, "loss": 5.0373, "mean_token_accuracy": 0.19571632742881775, "num_tokens": 34060872.0, "step": 19630 }, { "entropy": 5.5866176128387455, "epoch": 1.5276794397977047, "grad_norm": 1.15625, "learning_rate": 0.0004767047529320673, "loss": 5.0783, "mean_token_accuracy": 0.1905893176794052, "num_tokens": 34069501.0, "step": 19635 }, { "entropy": 5.625924062728882, "epoch": 1.5280684691694222, "grad_norm": 1.0625, "learning_rate": 0.00047669247025358257, "loss": 5.1166, "mean_token_accuracy": 0.1918777957558632, "num_tokens": 34078573.0, "step": 19640 }, { "entropy": 5.580302143096924, "epoch": 1.5284574985411399, "grad_norm": 1.109375, "learning_rate": 0.00047668018451473584, "loss": 5.083, "mean_token_accuracy": 0.1935720220208168, "num_tokens": 34087270.0, "step": 19645 }, { "entropy": 5.557350301742554, "epoch": 1.5288465279128576, "grad_norm": 1.1328125, "learning_rate": 0.0004766678957157132, "loss": 5.1165, "mean_token_accuracy": 0.19355133026838303, "num_tokens": 34096205.0, "step": 19650 }, { "entropy": 5.565435838699341, "epoch": 1.5292355572845748, "grad_norm": 1.0234375, "learning_rate": 0.0004766556038567013, "loss": 4.9429, "mean_token_accuracy": 0.20297749787569047, "num_tokens": 34104736.0, "step": 19655 }, { "entropy": 5.586031675338745, "epoch": 1.5296245866562925, "grad_norm": 1.1484375, "learning_rate": 0.0004766433089378865, "loss": 5.0446, "mean_token_accuracy": 0.19793884456157684, "num_tokens": 34113420.0, "step": 19660 }, { "entropy": 5.641443157196045, "epoch": 1.5300136160280102, "grad_norm": 1.09375, "learning_rate": 0.00047663101095945544, "loss": 5.1454, "mean_token_accuracy": 0.18543702811002732, "num_tokens": 34121702.0, "step": 19665 }, { "entropy": 5.5983607292175295, "epoch": 1.5304026453997277, "grad_norm": 1.15625, "learning_rate": 0.00047661870992159476, "loss": 5.0375, "mean_token_accuracy": 0.19929861277341843, "num_tokens": 34129657.0, "step": 19670 }, { "entropy": 5.606952476501465, "epoch": 1.5307916747714452, "grad_norm": 1.1328125, "learning_rate": 0.00047660640582449106, "loss": 5.1643, "mean_token_accuracy": 0.1884268954396248, "num_tokens": 34138078.0, "step": 19675 }, { "entropy": 5.6222004890441895, "epoch": 1.5311807041431629, "grad_norm": 1.0625, "learning_rate": 0.00047659409866833104, "loss": 5.0577, "mean_token_accuracy": 0.19750993698835373, "num_tokens": 34146402.0, "step": 19680 }, { "entropy": 5.6603024959564205, "epoch": 1.5315697335148803, "grad_norm": 1.1171875, "learning_rate": 0.0004765817884533014, "loss": 5.1746, "mean_token_accuracy": 0.18819329142570496, "num_tokens": 34155909.0, "step": 19685 }, { "entropy": 5.539122009277344, "epoch": 1.5319587628865978, "grad_norm": 1.203125, "learning_rate": 0.000476569475179589, "loss": 5.0165, "mean_token_accuracy": 0.1952762320637703, "num_tokens": 34164598.0, "step": 19690 }, { "entropy": 5.586309289932251, "epoch": 1.5323477922583155, "grad_norm": 1.171875, "learning_rate": 0.00047655715884738074, "loss": 5.0648, "mean_token_accuracy": 0.19353954195976258, "num_tokens": 34173476.0, "step": 19695 }, { "entropy": 5.586135339736939, "epoch": 1.5327368216300332, "grad_norm": 1.078125, "learning_rate": 0.0004765448394568632, "loss": 5.0879, "mean_token_accuracy": 0.19155117720365525, "num_tokens": 34181986.0, "step": 19700 }, { "entropy": 5.570165729522705, "epoch": 1.5331258510017505, "grad_norm": 1.1171875, "learning_rate": 0.0004765325170082237, "loss": 5.0553, "mean_token_accuracy": 0.1939054697751999, "num_tokens": 34190477.0, "step": 19705 }, { "entropy": 5.521244382858276, "epoch": 1.5335148803734682, "grad_norm": 1.0390625, "learning_rate": 0.000476520191501649, "loss": 4.9894, "mean_token_accuracy": 0.1987883746623993, "num_tokens": 34198955.0, "step": 19710 }, { "entropy": 5.621894025802613, "epoch": 1.5339039097451859, "grad_norm": 1.046875, "learning_rate": 0.00047650786293732607, "loss": 5.1498, "mean_token_accuracy": 0.19010864794254304, "num_tokens": 34207744.0, "step": 19715 }, { "entropy": 5.5901213645935055, "epoch": 1.5342929391169033, "grad_norm": 1.109375, "learning_rate": 0.0004764955313154421, "loss": 5.0651, "mean_token_accuracy": 0.20105289220809935, "num_tokens": 34215935.0, "step": 19720 }, { "entropy": 5.569904851913452, "epoch": 1.5346819684886208, "grad_norm": 0.98828125, "learning_rate": 0.00047648319663618415, "loss": 5.0864, "mean_token_accuracy": 0.19040632694959642, "num_tokens": 34224990.0, "step": 19725 }, { "entropy": 5.551717710494995, "epoch": 1.5350709978603385, "grad_norm": 1.09375, "learning_rate": 0.00047647085889973936, "loss": 4.9969, "mean_token_accuracy": 0.19429349899291992, "num_tokens": 34232928.0, "step": 19730 }, { "entropy": 5.486540937423706, "epoch": 1.535460027232056, "grad_norm": 1.0859375, "learning_rate": 0.00047645851810629503, "loss": 4.9316, "mean_token_accuracy": 0.20596494972705842, "num_tokens": 34241434.0, "step": 19735 }, { "entropy": 5.4714599609375, "epoch": 1.5358490566037735, "grad_norm": 1.125, "learning_rate": 0.00047644617425603825, "loss": 5.0086, "mean_token_accuracy": 0.20327137857675553, "num_tokens": 34250067.0, "step": 19740 }, { "entropy": 5.578990030288696, "epoch": 1.5362380859754912, "grad_norm": 1.171875, "learning_rate": 0.0004764338273491565, "loss": 5.0777, "mean_token_accuracy": 0.19941775500774384, "num_tokens": 34258656.0, "step": 19745 }, { "entropy": 5.618225002288819, "epoch": 1.5366271153472089, "grad_norm": 1.0703125, "learning_rate": 0.00047642147738583695, "loss": 5.1617, "mean_token_accuracy": 0.17670540511608124, "num_tokens": 34267417.0, "step": 19750 }, { "entropy": 5.583118963241577, "epoch": 1.5370161447189261, "grad_norm": 1.21875, "learning_rate": 0.0004764091243662671, "loss": 4.9314, "mean_token_accuracy": 0.2101549431681633, "num_tokens": 34275334.0, "step": 19755 }, { "entropy": 5.571735286712647, "epoch": 1.5374051740906438, "grad_norm": 1.2265625, "learning_rate": 0.00047639676829063437, "loss": 5.0856, "mean_token_accuracy": 0.19637684226036073, "num_tokens": 34284016.0, "step": 19760 }, { "entropy": 5.476839780807495, "epoch": 1.5377942034623615, "grad_norm": 1.1484375, "learning_rate": 0.00047638440915912623, "loss": 5.0063, "mean_token_accuracy": 0.20752874612808228, "num_tokens": 34292747.0, "step": 19765 }, { "entropy": 5.5461619853973385, "epoch": 1.538183232834079, "grad_norm": 1.125, "learning_rate": 0.0004763720469719303, "loss": 4.9715, "mean_token_accuracy": 0.20054926723241806, "num_tokens": 34301764.0, "step": 19770 }, { "entropy": 5.574154281616211, "epoch": 1.5385722622057965, "grad_norm": 1.0625, "learning_rate": 0.000476359681729234, "loss": 5.0856, "mean_token_accuracy": 0.19496385157108306, "num_tokens": 34310522.0, "step": 19775 }, { "entropy": 5.621570348739624, "epoch": 1.5389612915775142, "grad_norm": 1.15625, "learning_rate": 0.000476347313431225, "loss": 5.0574, "mean_token_accuracy": 0.19983036518096925, "num_tokens": 34319342.0, "step": 19780 }, { "entropy": 5.679900026321411, "epoch": 1.5393503209492316, "grad_norm": 1.078125, "learning_rate": 0.00047633494207809096, "loss": 5.1824, "mean_token_accuracy": 0.1874551221728325, "num_tokens": 34327468.0, "step": 19785 }, { "entropy": 5.599329948425293, "epoch": 1.539739350320949, "grad_norm": 1.125, "learning_rate": 0.00047632256767001977, "loss": 5.1246, "mean_token_accuracy": 0.1980758234858513, "num_tokens": 34336484.0, "step": 19790 }, { "entropy": 5.52127103805542, "epoch": 1.5401283796926668, "grad_norm": 1.1171875, "learning_rate": 0.000476310190207199, "loss": 4.9758, "mean_token_accuracy": 0.20609841793775557, "num_tokens": 34344708.0, "step": 19795 }, { "entropy": 5.620851039886475, "epoch": 1.5405174090643845, "grad_norm": 1.1484375, "learning_rate": 0.00047629780968981653, "loss": 5.015, "mean_token_accuracy": 0.19786638170480728, "num_tokens": 34352757.0, "step": 19800 }, { "entropy": 5.56909031867981, "epoch": 1.540906438436102, "grad_norm": 1.15625, "learning_rate": 0.00047628542611806007, "loss": 4.9896, "mean_token_accuracy": 0.2009555369615555, "num_tokens": 34362070.0, "step": 19805 }, { "entropy": 5.546646022796631, "epoch": 1.5412954678078195, "grad_norm": 1.15625, "learning_rate": 0.00047627303949211773, "loss": 5.0483, "mean_token_accuracy": 0.1934695467352867, "num_tokens": 34370136.0, "step": 19810 }, { "entropy": 5.526380348205566, "epoch": 1.5416844971795371, "grad_norm": 1.1015625, "learning_rate": 0.0004762606498121774, "loss": 4.9859, "mean_token_accuracy": 0.19961032271385193, "num_tokens": 34378534.0, "step": 19815 }, { "entropy": 5.577082872390747, "epoch": 1.5420735265512546, "grad_norm": 1.1171875, "learning_rate": 0.000476248257078427, "loss": 4.9927, "mean_token_accuracy": 0.19819499999284745, "num_tokens": 34386313.0, "step": 19820 }, { "entropy": 5.560423564910889, "epoch": 1.542462555922972, "grad_norm": 1.1484375, "learning_rate": 0.0004762358612910547, "loss": 5.0487, "mean_token_accuracy": 0.2002688854932785, "num_tokens": 34394566.0, "step": 19825 }, { "entropy": 5.495844793319702, "epoch": 1.5428515852946898, "grad_norm": 1.1015625, "learning_rate": 0.0004762234624502484, "loss": 4.9427, "mean_token_accuracy": 0.19771211147308348, "num_tokens": 34403177.0, "step": 19830 }, { "entropy": 5.617887735366821, "epoch": 1.5432406146664073, "grad_norm": 0.98828125, "learning_rate": 0.00047621106055619644, "loss": 5.0778, "mean_token_accuracy": 0.19757700860500335, "num_tokens": 34411577.0, "step": 19835 }, { "entropy": 5.566444349288941, "epoch": 1.5436296440381247, "grad_norm": 1.03125, "learning_rate": 0.00047619865560908687, "loss": 5.0849, "mean_token_accuracy": 0.18772233575582503, "num_tokens": 34420649.0, "step": 19840 }, { "entropy": 5.580060195922852, "epoch": 1.5440186734098424, "grad_norm": 1.03125, "learning_rate": 0.0004761862476091079, "loss": 4.9579, "mean_token_accuracy": 0.20690312832593918, "num_tokens": 34429778.0, "step": 19845 }, { "entropy": 5.618376874923706, "epoch": 1.5444077027815601, "grad_norm": 1.1328125, "learning_rate": 0.00047617383655644785, "loss": 5.0693, "mean_token_accuracy": 0.19893452376127244, "num_tokens": 34438412.0, "step": 19850 }, { "entropy": 5.589685916900635, "epoch": 1.5447967321532776, "grad_norm": 1.1328125, "learning_rate": 0.0004761614224512951, "loss": 5.0624, "mean_token_accuracy": 0.1876097172498703, "num_tokens": 34447022.0, "step": 19855 }, { "entropy": 5.570820569992065, "epoch": 1.545185761524995, "grad_norm": 1.0625, "learning_rate": 0.0004761490052938379, "loss": 5.1037, "mean_token_accuracy": 0.1945594847202301, "num_tokens": 34455502.0, "step": 19860 }, { "entropy": 5.5356385707855225, "epoch": 1.5455747908967128, "grad_norm": 1.140625, "learning_rate": 0.0004761365850842646, "loss": 5.0424, "mean_token_accuracy": 0.19640565663576126, "num_tokens": 34463682.0, "step": 19865 }, { "entropy": 5.551126861572266, "epoch": 1.5459638202684303, "grad_norm": 1.1171875, "learning_rate": 0.0004761241618227639, "loss": 4.9704, "mean_token_accuracy": 0.20137729793787001, "num_tokens": 34471678.0, "step": 19870 }, { "entropy": 5.540171670913696, "epoch": 1.5463528496401477, "grad_norm": 1.0859375, "learning_rate": 0.00047611173550952414, "loss": 5.011, "mean_token_accuracy": 0.20024513751268386, "num_tokens": 34479830.0, "step": 19875 }, { "entropy": 5.588697147369385, "epoch": 1.5467418790118654, "grad_norm": 1.1328125, "learning_rate": 0.00047609930614473387, "loss": 5.0788, "mean_token_accuracy": 0.18857492208480836, "num_tokens": 34487445.0, "step": 19880 }, { "entropy": 5.5266866207122805, "epoch": 1.547130908383583, "grad_norm": 1.0546875, "learning_rate": 0.00047608687372858175, "loss": 4.9412, "mean_token_accuracy": 0.19886954575777055, "num_tokens": 34496306.0, "step": 19885 }, { "entropy": 5.563938951492309, "epoch": 1.5475199377553004, "grad_norm": 1.1640625, "learning_rate": 0.00047607443826125633, "loss": 5.0577, "mean_token_accuracy": 0.1975692853331566, "num_tokens": 34505067.0, "step": 19890 }, { "entropy": 5.649408483505249, "epoch": 1.547908967127018, "grad_norm": 1.140625, "learning_rate": 0.00047606199974294637, "loss": 5.1641, "mean_token_accuracy": 0.1890977218747139, "num_tokens": 34513947.0, "step": 19895 }, { "entropy": 5.705452632904053, "epoch": 1.5482979964987358, "grad_norm": 1.296875, "learning_rate": 0.0004760495581738406, "loss": 5.1647, "mean_token_accuracy": 0.18581548929214478, "num_tokens": 34523383.0, "step": 19900 }, { "entropy": 5.6094471454620365, "epoch": 1.5486870258704533, "grad_norm": 1.0859375, "learning_rate": 0.0004760371135541278, "loss": 4.9673, "mean_token_accuracy": 0.20046115666627884, "num_tokens": 34532376.0, "step": 19905 }, { "entropy": 5.64343581199646, "epoch": 1.5490760552421707, "grad_norm": 1.1171875, "learning_rate": 0.0004760246658839967, "loss": 5.1611, "mean_token_accuracy": 0.1846248045563698, "num_tokens": 34541075.0, "step": 19910 }, { "entropy": 5.530291366577148, "epoch": 1.5494650846138884, "grad_norm": 1.140625, "learning_rate": 0.0004760122151636364, "loss": 4.9567, "mean_token_accuracy": 0.20642111897468568, "num_tokens": 34550296.0, "step": 19915 }, { "entropy": 5.577436876296997, "epoch": 1.549854113985606, "grad_norm": 1.1328125, "learning_rate": 0.0004759997613932356, "loss": 5.1051, "mean_token_accuracy": 0.19338013380765914, "num_tokens": 34559185.0, "step": 19920 }, { "entropy": 5.64152045249939, "epoch": 1.5502431433573234, "grad_norm": 1.0703125, "learning_rate": 0.00047598730457298335, "loss": 5.0998, "mean_token_accuracy": 0.1935029447078705, "num_tokens": 34568018.0, "step": 19925 }, { "entropy": 5.628535556793213, "epoch": 1.550632172729041, "grad_norm": 1.15625, "learning_rate": 0.00047597484470306866, "loss": 5.0901, "mean_token_accuracy": 0.20110653936862946, "num_tokens": 34576835.0, "step": 19930 }, { "entropy": 5.615151977539062, "epoch": 1.5510212021007586, "grad_norm": 1.1171875, "learning_rate": 0.0004759623817836806, "loss": 5.055, "mean_token_accuracy": 0.19956803768873216, "num_tokens": 34585426.0, "step": 19935 }, { "entropy": 5.596803045272827, "epoch": 1.551410231472476, "grad_norm": 1.03125, "learning_rate": 0.0004759499158150082, "loss": 5.0933, "mean_token_accuracy": 0.19248394817113876, "num_tokens": 34594428.0, "step": 19940 }, { "entropy": 5.5717144966125485, "epoch": 1.5517992608441937, "grad_norm": 1.0625, "learning_rate": 0.00047593744679724076, "loss": 5.1077, "mean_token_accuracy": 0.19275014251470565, "num_tokens": 34603736.0, "step": 19945 }, { "entropy": 5.649574279785156, "epoch": 1.5521882902159114, "grad_norm": 1.1015625, "learning_rate": 0.00047592497473056733, "loss": 5.0819, "mean_token_accuracy": 0.19367011785507202, "num_tokens": 34613295.0, "step": 19950 }, { "entropy": 5.578834390640258, "epoch": 1.552577319587629, "grad_norm": 1.125, "learning_rate": 0.00047591249961517724, "loss": 5.0407, "mean_token_accuracy": 0.19365672767162323, "num_tokens": 34622955.0, "step": 19955 }, { "entropy": 5.54402346611023, "epoch": 1.5529663489593464, "grad_norm": 1.109375, "learning_rate": 0.0004759000214512598, "loss": 5.0556, "mean_token_accuracy": 0.19482565373182298, "num_tokens": 34631866.0, "step": 19960 }, { "entropy": 5.60724663734436, "epoch": 1.553355378331064, "grad_norm": 1.1484375, "learning_rate": 0.0004758875402390042, "loss": 5.1229, "mean_token_accuracy": 0.19357233494520187, "num_tokens": 34640281.0, "step": 19965 }, { "entropy": 5.625158452987671, "epoch": 1.5537444077027815, "grad_norm": 1.171875, "learning_rate": 0.00047587505597859996, "loss": 5.0973, "mean_token_accuracy": 0.18587008267641067, "num_tokens": 34649080.0, "step": 19970 }, { "entropy": 5.5720093727111815, "epoch": 1.554133437074499, "grad_norm": 1.0703125, "learning_rate": 0.00047586256867023646, "loss": 5.0441, "mean_token_accuracy": 0.19746153503656388, "num_tokens": 34657969.0, "step": 19975 }, { "entropy": 5.624380350112915, "epoch": 1.5545224664462167, "grad_norm": 1.109375, "learning_rate": 0.0004758500783141032, "loss": 5.1824, "mean_token_accuracy": 0.18634089231491088, "num_tokens": 34667187.0, "step": 19980 }, { "entropy": 5.572739744186402, "epoch": 1.5549114958179344, "grad_norm": 1.1484375, "learning_rate": 0.0004758375849103897, "loss": 5.0358, "mean_token_accuracy": 0.1949297159910202, "num_tokens": 34676292.0, "step": 19985 }, { "entropy": 5.6424867630004885, "epoch": 1.5553005251896517, "grad_norm": 1.0625, "learning_rate": 0.0004758250884592855, "loss": 5.1336, "mean_token_accuracy": 0.193354831635952, "num_tokens": 34685198.0, "step": 19990 }, { "entropy": 5.567610549926758, "epoch": 1.5556895545613694, "grad_norm": 1.0078125, "learning_rate": 0.00047581258896098024, "loss": 4.9373, "mean_token_accuracy": 0.20652461647987366, "num_tokens": 34694019.0, "step": 19995 }, { "entropy": 5.6040153980255125, "epoch": 1.556078583933087, "grad_norm": 1.078125, "learning_rate": 0.0004758000864156636, "loss": 5.0983, "mean_token_accuracy": 0.19053036868572235, "num_tokens": 34703183.0, "step": 20000 }, { "entropy": 5.587558031082153, "epoch": 1.5564676133048045, "grad_norm": 1.140625, "learning_rate": 0.00047578758082352527, "loss": 5.0581, "mean_token_accuracy": 0.1948414549231529, "num_tokens": 34711049.0, "step": 20005 }, { "entropy": 5.564852571487426, "epoch": 1.556856642676522, "grad_norm": 1.046875, "learning_rate": 0.00047577507218475487, "loss": 5.1519, "mean_token_accuracy": 0.18537836521863937, "num_tokens": 34720130.0, "step": 20010 }, { "entropy": 5.613070917129517, "epoch": 1.5572456720482397, "grad_norm": 1.046875, "learning_rate": 0.00047576256049954236, "loss": 5.1017, "mean_token_accuracy": 0.1940246507525444, "num_tokens": 34728791.0, "step": 20015 }, { "entropy": 5.4976600170135494, "epoch": 1.5576347014199572, "grad_norm": 1.125, "learning_rate": 0.0004757500457680776, "loss": 4.8846, "mean_token_accuracy": 0.20747562050819396, "num_tokens": 34737470.0, "step": 20020 }, { "entropy": 5.530554246902466, "epoch": 1.5580237307916747, "grad_norm": 1.125, "learning_rate": 0.0004757375279905504, "loss": 5.0724, "mean_token_accuracy": 0.19826463609933853, "num_tokens": 34745774.0, "step": 20025 }, { "entropy": 5.495721626281738, "epoch": 1.5584127601633924, "grad_norm": 1.09375, "learning_rate": 0.00047572500716715075, "loss": 4.9797, "mean_token_accuracy": 0.20317600220441817, "num_tokens": 34753649.0, "step": 20030 }, { "entropy": 5.588611030578614, "epoch": 1.55880178953511, "grad_norm": 1.1796875, "learning_rate": 0.00047571248329806855, "loss": 5.0509, "mean_token_accuracy": 0.19776384234428407, "num_tokens": 34761833.0, "step": 20035 }, { "entropy": 5.545885372161865, "epoch": 1.5591908189068273, "grad_norm": 1.109375, "learning_rate": 0.00047569995638349383, "loss": 5.0242, "mean_token_accuracy": 0.19281403571367264, "num_tokens": 34770969.0, "step": 20040 }, { "entropy": 5.562982225418091, "epoch": 1.559579848278545, "grad_norm": 1.0625, "learning_rate": 0.0004756874264236168, "loss": 5.0811, "mean_token_accuracy": 0.19362392276525497, "num_tokens": 34779860.0, "step": 20045 }, { "entropy": 5.57654914855957, "epoch": 1.5599688776502627, "grad_norm": 1.046875, "learning_rate": 0.00047567489341862753, "loss": 5.0001, "mean_token_accuracy": 0.20016448050737382, "num_tokens": 34788816.0, "step": 20050 }, { "entropy": 5.564038991928101, "epoch": 1.5603579070219802, "grad_norm": 1.046875, "learning_rate": 0.00047566235736871607, "loss": 5.089, "mean_token_accuracy": 0.19485850185155867, "num_tokens": 34797784.0, "step": 20055 }, { "entropy": 5.541656112670898, "epoch": 1.5607469363936977, "grad_norm": 1.109375, "learning_rate": 0.00047564981827407277, "loss": 4.9226, "mean_token_accuracy": 0.20660064667463302, "num_tokens": 34806553.0, "step": 20060 }, { "entropy": 5.546260499954224, "epoch": 1.5611359657654154, "grad_norm": 1.109375, "learning_rate": 0.00047563727613488785, "loss": 4.965, "mean_token_accuracy": 0.19812168776988984, "num_tokens": 34814854.0, "step": 20065 }, { "entropy": 5.544357967376709, "epoch": 1.5615249951371328, "grad_norm": 1.078125, "learning_rate": 0.00047562473095135154, "loss": 5.1451, "mean_token_accuracy": 0.2006456434726715, "num_tokens": 34823147.0, "step": 20070 }, { "entropy": 5.579513835906982, "epoch": 1.5619140245088503, "grad_norm": 1.125, "learning_rate": 0.0004756121827236544, "loss": 5.0409, "mean_token_accuracy": 0.20493340343236924, "num_tokens": 34831335.0, "step": 20075 }, { "entropy": 5.597454595565796, "epoch": 1.562303053880568, "grad_norm": 1.0390625, "learning_rate": 0.0004755996314519866, "loss": 5.0906, "mean_token_accuracy": 0.1906035602092743, "num_tokens": 34840118.0, "step": 20080 }, { "entropy": 5.574980115890503, "epoch": 1.5626920832522857, "grad_norm": 1.09375, "learning_rate": 0.0004755870771365387, "loss": 5.0612, "mean_token_accuracy": 0.19752161502838134, "num_tokens": 34848851.0, "step": 20085 }, { "entropy": 5.522799968719482, "epoch": 1.563081112624003, "grad_norm": 1.078125, "learning_rate": 0.00047557451977750113, "loss": 4.9735, "mean_token_accuracy": 0.2028482511639595, "num_tokens": 34857660.0, "step": 20090 }, { "entropy": 5.551755094528199, "epoch": 1.5634701419957207, "grad_norm": 1.171875, "learning_rate": 0.0004755619593750645, "loss": 5.0174, "mean_token_accuracy": 0.19698538929224013, "num_tokens": 34866828.0, "step": 20095 }, { "entropy": 5.615998220443726, "epoch": 1.5638591713674383, "grad_norm": 1.125, "learning_rate": 0.0004755493959294194, "loss": 5.1655, "mean_token_accuracy": 0.1873937025666237, "num_tokens": 34875461.0, "step": 20100 }, { "entropy": 5.4994817733764645, "epoch": 1.5642482007391558, "grad_norm": 1.1171875, "learning_rate": 0.0004755368294407564, "loss": 5.0001, "mean_token_accuracy": 0.19442041963338852, "num_tokens": 34883914.0, "step": 20105 }, { "entropy": 5.5615945816040036, "epoch": 1.5646372301108733, "grad_norm": 1.0703125, "learning_rate": 0.0004755242599092662, "loss": 5.1428, "mean_token_accuracy": 0.1918320119380951, "num_tokens": 34892191.0, "step": 20110 }, { "entropy": 5.601771068572998, "epoch": 1.565026259482591, "grad_norm": 1.2265625, "learning_rate": 0.00047551168733513956, "loss": 5.0929, "mean_token_accuracy": 0.19223154932260514, "num_tokens": 34900450.0, "step": 20115 }, { "entropy": 5.618432092666626, "epoch": 1.5654152888543085, "grad_norm": 1.1171875, "learning_rate": 0.00047549911171856717, "loss": 4.9899, "mean_token_accuracy": 0.2026672437787056, "num_tokens": 34908706.0, "step": 20120 }, { "entropy": 5.587328243255615, "epoch": 1.565804318226026, "grad_norm": 1.1171875, "learning_rate": 0.0004754865330597398, "loss": 5.0332, "mean_token_accuracy": 0.20452460199594497, "num_tokens": 34916598.0, "step": 20125 }, { "entropy": 5.535270118713379, "epoch": 1.5661933475977436, "grad_norm": 1.1171875, "learning_rate": 0.00047547395135884854, "loss": 5.0149, "mean_token_accuracy": 0.2036098748445511, "num_tokens": 34925850.0, "step": 20130 }, { "entropy": 5.596923160552978, "epoch": 1.5665823769694613, "grad_norm": 1.09375, "learning_rate": 0.0004754613666160841, "loss": 5.1249, "mean_token_accuracy": 0.19313310235738754, "num_tokens": 34934919.0, "step": 20135 }, { "entropy": 5.708040761947632, "epoch": 1.5669714063411786, "grad_norm": 1.078125, "learning_rate": 0.00047544877883163753, "loss": 5.2328, "mean_token_accuracy": 0.18442492485046386, "num_tokens": 34943875.0, "step": 20140 }, { "entropy": 5.6036357402801515, "epoch": 1.5673604357128963, "grad_norm": 1.1171875, "learning_rate": 0.00047543618800569975, "loss": 5.0287, "mean_token_accuracy": 0.19612298607826234, "num_tokens": 34952458.0, "step": 20145 }, { "entropy": 5.54296760559082, "epoch": 1.567749465084614, "grad_norm": 1.0859375, "learning_rate": 0.00047542359413846184, "loss": 5.1017, "mean_token_accuracy": 0.19416940361261367, "num_tokens": 34961550.0, "step": 20150 }, { "entropy": 5.5693747997283936, "epoch": 1.5681384944563315, "grad_norm": 1.109375, "learning_rate": 0.0004754109972301149, "loss": 5.0233, "mean_token_accuracy": 0.1919101357460022, "num_tokens": 34969561.0, "step": 20155 }, { "entropy": 5.589094924926758, "epoch": 1.568527523828049, "grad_norm": 1.046875, "learning_rate": 0.00047539839728085007, "loss": 5.0903, "mean_token_accuracy": 0.19710541218519212, "num_tokens": 34977904.0, "step": 20160 }, { "entropy": 5.561371469497681, "epoch": 1.5689165531997666, "grad_norm": 1.0703125, "learning_rate": 0.0004753857942908585, "loss": 5.1191, "mean_token_accuracy": 0.1916168987751007, "num_tokens": 34986646.0, "step": 20165 }, { "entropy": 5.615369653701782, "epoch": 1.5693055825714841, "grad_norm": 1.0703125, "learning_rate": 0.0004753731882603315, "loss": 5.1301, "mean_token_accuracy": 0.19030803442001343, "num_tokens": 34995387.0, "step": 20170 }, { "entropy": 5.635756111145019, "epoch": 1.5696946119432016, "grad_norm": 1.078125, "learning_rate": 0.00047536057918946026, "loss": 5.0599, "mean_token_accuracy": 0.20020572245121002, "num_tokens": 35004668.0, "step": 20175 }, { "entropy": 5.495725631713867, "epoch": 1.5700836413149193, "grad_norm": 1.1484375, "learning_rate": 0.0004753479670784361, "loss": 4.9242, "mean_token_accuracy": 0.20392145365476608, "num_tokens": 35012881.0, "step": 20180 }, { "entropy": 5.600967359542847, "epoch": 1.570472670686637, "grad_norm": 1.0625, "learning_rate": 0.0004753353519274505, "loss": 5.0963, "mean_token_accuracy": 0.1869028091430664, "num_tokens": 35022127.0, "step": 20185 }, { "entropy": 5.603046226501465, "epoch": 1.5708617000583545, "grad_norm": 1.109375, "learning_rate": 0.0004753227337366948, "loss": 4.9698, "mean_token_accuracy": 0.20126478374004364, "num_tokens": 35030066.0, "step": 20190 }, { "entropy": 5.520316648483276, "epoch": 1.571250729430072, "grad_norm": 1.09375, "learning_rate": 0.00047531011250636046, "loss": 4.9722, "mean_token_accuracy": 0.2085552468895912, "num_tokens": 35038560.0, "step": 20195 }, { "entropy": 5.549055910110473, "epoch": 1.5716397588017896, "grad_norm": 1.078125, "learning_rate": 0.00047529748823663896, "loss": 5.1675, "mean_token_accuracy": 0.18700699806213378, "num_tokens": 35048011.0, "step": 20200 }, { "entropy": 5.628222894668579, "epoch": 1.572028788173507, "grad_norm": 1.1640625, "learning_rate": 0.0004752848609277219, "loss": 5.1168, "mean_token_accuracy": 0.19724015444517135, "num_tokens": 35056247.0, "step": 20205 }, { "entropy": 5.613491201400757, "epoch": 1.5724178175452246, "grad_norm": 1.0625, "learning_rate": 0.00047527223057980086, "loss": 5.038, "mean_token_accuracy": 0.20072452276945113, "num_tokens": 35064885.0, "step": 20210 }, { "entropy": 5.587700843811035, "epoch": 1.5728068469169423, "grad_norm": 1.046875, "learning_rate": 0.00047525959719306736, "loss": 5.002, "mean_token_accuracy": 0.1907983183860779, "num_tokens": 35073452.0, "step": 20215 }, { "entropy": 5.5833409309387205, "epoch": 1.5731958762886598, "grad_norm": 1.125, "learning_rate": 0.0004752469607677134, "loss": 5.1394, "mean_token_accuracy": 0.19224186092615128, "num_tokens": 35082459.0, "step": 20220 }, { "entropy": 5.592738962173462, "epoch": 1.5735849056603772, "grad_norm": 1.171875, "learning_rate": 0.0004752343213039305, "loss": 5.078, "mean_token_accuracy": 0.18936824053525925, "num_tokens": 35091336.0, "step": 20225 }, { "entropy": 5.557976531982422, "epoch": 1.573973935032095, "grad_norm": 1.109375, "learning_rate": 0.0004752216788019104, "loss": 5.0365, "mean_token_accuracy": 0.20552782565355301, "num_tokens": 35099802.0, "step": 20230 }, { "entropy": 5.569195413589478, "epoch": 1.5743629644038126, "grad_norm": 1.09375, "learning_rate": 0.0004752090332618451, "loss": 5.0822, "mean_token_accuracy": 0.18886075019836426, "num_tokens": 35108520.0, "step": 20235 }, { "entropy": 5.647597932815552, "epoch": 1.57475199377553, "grad_norm": 1.0703125, "learning_rate": 0.0004751963846839263, "loss": 5.1077, "mean_token_accuracy": 0.19846379905939102, "num_tokens": 35117481.0, "step": 20240 }, { "entropy": 5.538423871994018, "epoch": 1.5751410231472476, "grad_norm": 1.0390625, "learning_rate": 0.00047518373306834605, "loss": 5.082, "mean_token_accuracy": 0.19112095832824708, "num_tokens": 35126605.0, "step": 20245 }, { "entropy": 5.545394611358643, "epoch": 1.5755300525189653, "grad_norm": 1.1015625, "learning_rate": 0.00047517107841529626, "loss": 4.9655, "mean_token_accuracy": 0.20821191519498825, "num_tokens": 35135312.0, "step": 20250 }, { "entropy": 5.586746549606323, "epoch": 1.5759190818906827, "grad_norm": 1.0625, "learning_rate": 0.000475158420724969, "loss": 5.0311, "mean_token_accuracy": 0.19927199333906173, "num_tokens": 35144759.0, "step": 20255 }, { "entropy": 5.615405607223511, "epoch": 1.5763081112624002, "grad_norm": 1.0859375, "learning_rate": 0.00047514575999755627, "loss": 5.1572, "mean_token_accuracy": 0.1921281948685646, "num_tokens": 35153701.0, "step": 20260 }, { "entropy": 5.659677457809448, "epoch": 1.576697140634118, "grad_norm": 1.1015625, "learning_rate": 0.00047513309623325024, "loss": 5.1948, "mean_token_accuracy": 0.19165855050086975, "num_tokens": 35162503.0, "step": 20265 }, { "entropy": 5.546006727218628, "epoch": 1.5770861700058354, "grad_norm": 1.03125, "learning_rate": 0.0004751204294322429, "loss": 5.0402, "mean_token_accuracy": 0.19724932610988616, "num_tokens": 35171209.0, "step": 20270 }, { "entropy": 5.539504480361939, "epoch": 1.5774751993775529, "grad_norm": 1.0390625, "learning_rate": 0.00047510775959472675, "loss": 5.047, "mean_token_accuracy": 0.19517420679330827, "num_tokens": 35179623.0, "step": 20275 }, { "entropy": 5.5645270347595215, "epoch": 1.5778642287492706, "grad_norm": 1.0390625, "learning_rate": 0.0004750950867208937, "loss": 5.0452, "mean_token_accuracy": 0.2001628488302231, "num_tokens": 35188679.0, "step": 20280 }, { "entropy": 5.58337173461914, "epoch": 1.5782532581209883, "grad_norm": 1.0859375, "learning_rate": 0.0004750824108109362, "loss": 4.9986, "mean_token_accuracy": 0.2019083932042122, "num_tokens": 35197325.0, "step": 20285 }, { "entropy": 5.65371413230896, "epoch": 1.5786422874927057, "grad_norm": 1.078125, "learning_rate": 0.0004750697318650466, "loss": 5.1511, "mean_token_accuracy": 0.1879307061433792, "num_tokens": 35206741.0, "step": 20290 }, { "entropy": 5.601103687286377, "epoch": 1.5790313168644232, "grad_norm": 1.1171875, "learning_rate": 0.0004750570498834173, "loss": 5.0707, "mean_token_accuracy": 0.1951159730553627, "num_tokens": 35215346.0, "step": 20295 }, { "entropy": 5.597061347961426, "epoch": 1.579420346236141, "grad_norm": 1.15625, "learning_rate": 0.0004750443648662407, "loss": 5.025, "mean_token_accuracy": 0.19647393971681595, "num_tokens": 35223811.0, "step": 20300 }, { "entropy": 5.61527190208435, "epoch": 1.5798093756078584, "grad_norm": 1.03125, "learning_rate": 0.00047503167681370924, "loss": 5.0952, "mean_token_accuracy": 0.19170306026935577, "num_tokens": 35232438.0, "step": 20305 }, { "entropy": 5.61771593093872, "epoch": 1.5801984049795759, "grad_norm": 1.0703125, "learning_rate": 0.0004750189857260154, "loss": 5.0588, "mean_token_accuracy": 0.18674191534519197, "num_tokens": 35242529.0, "step": 20310 }, { "entropy": 5.506786632537842, "epoch": 1.5805874343512936, "grad_norm": 1.109375, "learning_rate": 0.0004750062916033519, "loss": 4.918, "mean_token_accuracy": 0.20197486132383347, "num_tokens": 35250695.0, "step": 20315 }, { "entropy": 5.59385404586792, "epoch": 1.580976463723011, "grad_norm": 1.15625, "learning_rate": 0.0004749935944459113, "loss": 5.0216, "mean_token_accuracy": 0.20182398706674576, "num_tokens": 35259212.0, "step": 20320 }, { "entropy": 5.536934566497803, "epoch": 1.5813654930947285, "grad_norm": 1.125, "learning_rate": 0.0004749808942538862, "loss": 5.0112, "mean_token_accuracy": 0.20221805274486543, "num_tokens": 35267667.0, "step": 20325 }, { "entropy": 5.574153184890747, "epoch": 1.5817545224664462, "grad_norm": 1.1484375, "learning_rate": 0.0004749681910274693, "loss": 5.0639, "mean_token_accuracy": 0.1931714653968811, "num_tokens": 35275850.0, "step": 20330 }, { "entropy": 5.6464231491088865, "epoch": 1.582143551838164, "grad_norm": 1.03125, "learning_rate": 0.00047495548476685334, "loss": 5.0444, "mean_token_accuracy": 0.19593161940574647, "num_tokens": 35284635.0, "step": 20335 }, { "entropy": 5.661747550964355, "epoch": 1.5825325812098814, "grad_norm": 1.09375, "learning_rate": 0.00047494277547223125, "loss": 5.0523, "mean_token_accuracy": 0.20005460381507872, "num_tokens": 35292335.0, "step": 20340 }, { "entropy": 5.553486347198486, "epoch": 1.5829216105815989, "grad_norm": 1.1328125, "learning_rate": 0.00047493006314379573, "loss": 5.0504, "mean_token_accuracy": 0.19613929390907286, "num_tokens": 35300709.0, "step": 20345 }, { "entropy": 5.585879325866699, "epoch": 1.5833106399533166, "grad_norm": 1.1171875, "learning_rate": 0.00047491734778173976, "loss": 5.041, "mean_token_accuracy": 0.1955928698182106, "num_tokens": 35308956.0, "step": 20350 }, { "entropy": 5.517001390457153, "epoch": 1.583699669325034, "grad_norm": 1.0234375, "learning_rate": 0.00047490462938625617, "loss": 5.0715, "mean_token_accuracy": 0.19032184779644012, "num_tokens": 35317663.0, "step": 20355 }, { "entropy": 5.608295679092407, "epoch": 1.5840886986967515, "grad_norm": 1.0, "learning_rate": 0.00047489190795753806, "loss": 5.1284, "mean_token_accuracy": 0.18590084016323088, "num_tokens": 35327412.0, "step": 20360 }, { "entropy": 5.684958267211914, "epoch": 1.5844777280684692, "grad_norm": 1.125, "learning_rate": 0.0004748791834957784, "loss": 5.1378, "mean_token_accuracy": 0.18582871854305266, "num_tokens": 35335888.0, "step": 20365 }, { "entropy": 5.588687467575073, "epoch": 1.5848667574401867, "grad_norm": 1.59375, "learning_rate": 0.00047486645600117037, "loss": 5.0779, "mean_token_accuracy": 0.19676357060670852, "num_tokens": 35345122.0, "step": 20370 }, { "entropy": 5.575003004074096, "epoch": 1.5852557868119042, "grad_norm": 1.171875, "learning_rate": 0.0004748537254739068, "loss": 5.1318, "mean_token_accuracy": 0.19710627645254136, "num_tokens": 35353751.0, "step": 20375 }, { "entropy": 5.588816070556641, "epoch": 1.5856448161836219, "grad_norm": 1.0546875, "learning_rate": 0.0004748409919141812, "loss": 5.0636, "mean_token_accuracy": 0.1989436373114586, "num_tokens": 35363083.0, "step": 20380 }, { "entropy": 5.550486755371094, "epoch": 1.5860338455553395, "grad_norm": 1.1015625, "learning_rate": 0.0004748282553221865, "loss": 5.0189, "mean_token_accuracy": 0.20498321056365967, "num_tokens": 35371198.0, "step": 20385 }, { "entropy": 5.587578010559082, "epoch": 1.586422874927057, "grad_norm": 1.1484375, "learning_rate": 0.0004748155156981162, "loss": 5.1085, "mean_token_accuracy": 0.1975339099764824, "num_tokens": 35379633.0, "step": 20390 }, { "entropy": 5.5735999584198, "epoch": 1.5868119042987745, "grad_norm": 1.125, "learning_rate": 0.00047480277304216346, "loss": 5.0317, "mean_token_accuracy": 0.19755029529333115, "num_tokens": 35388172.0, "step": 20395 }, { "entropy": 5.573370790481567, "epoch": 1.5872009336704922, "grad_norm": 1.0078125, "learning_rate": 0.00047479002735452164, "loss": 5.0434, "mean_token_accuracy": 0.19498807191848755, "num_tokens": 35397126.0, "step": 20400 }, { "entropy": 5.577969741821289, "epoch": 1.5875899630422097, "grad_norm": 1.0859375, "learning_rate": 0.00047477727863538415, "loss": 5.0003, "mean_token_accuracy": 0.20264216661453247, "num_tokens": 35405364.0, "step": 20405 }, { "entropy": 5.516300439834595, "epoch": 1.5879789924139271, "grad_norm": 1.0859375, "learning_rate": 0.00047476452688494444, "loss": 5.0193, "mean_token_accuracy": 0.20123615562915803, "num_tokens": 35414187.0, "step": 20410 }, { "entropy": 5.562644958496094, "epoch": 1.5883680217856448, "grad_norm": 1.171875, "learning_rate": 0.000474751772103396, "loss": 5.0179, "mean_token_accuracy": 0.19707138687372208, "num_tokens": 35422694.0, "step": 20415 }, { "entropy": 5.614570999145508, "epoch": 1.5887570511573625, "grad_norm": 1.09375, "learning_rate": 0.0004747390142909323, "loss": 5.1529, "mean_token_accuracy": 0.1977115884423256, "num_tokens": 35431176.0, "step": 20420 }, { "entropy": 5.5880450248718265, "epoch": 1.5891460805290798, "grad_norm": 1.1171875, "learning_rate": 0.00047472625344774713, "loss": 5.0721, "mean_token_accuracy": 0.1885290712118149, "num_tokens": 35439938.0, "step": 20425 }, { "entropy": 5.613995933532715, "epoch": 1.5895351099007975, "grad_norm": 1.125, "learning_rate": 0.00047471348957403374, "loss": 5.0288, "mean_token_accuracy": 0.1950081244111061, "num_tokens": 35447864.0, "step": 20430 }, { "entropy": 5.639313077926635, "epoch": 1.5899241392725152, "grad_norm": 1.09375, "learning_rate": 0.0004747007226699862, "loss": 5.0553, "mean_token_accuracy": 0.19766091257333757, "num_tokens": 35456047.0, "step": 20435 }, { "entropy": 5.543118667602539, "epoch": 1.5903131686442327, "grad_norm": 1.03125, "learning_rate": 0.00047468795273579803, "loss": 4.9869, "mean_token_accuracy": 0.20360829085111617, "num_tokens": 35464510.0, "step": 20440 }, { "entropy": 5.587919235229492, "epoch": 1.5907021980159501, "grad_norm": 1.1875, "learning_rate": 0.0004746751797716629, "loss": 5.0983, "mean_token_accuracy": 0.19548317939043044, "num_tokens": 35472715.0, "step": 20445 }, { "entropy": 5.542939281463623, "epoch": 1.5910912273876678, "grad_norm": 1.046875, "learning_rate": 0.0004746624037777748, "loss": 4.9912, "mean_token_accuracy": 0.20319393426179885, "num_tokens": 35482094.0, "step": 20450 }, { "entropy": 5.587820196151734, "epoch": 1.5914802567593853, "grad_norm": 1.15625, "learning_rate": 0.00047464962475432754, "loss": 5.0395, "mean_token_accuracy": 0.1955181360244751, "num_tokens": 35489864.0, "step": 20455 }, { "entropy": 5.622628116607666, "epoch": 1.5918692861311028, "grad_norm": 1.21875, "learning_rate": 0.000474636842701515, "loss": 5.1105, "mean_token_accuracy": 0.1903654381632805, "num_tokens": 35498840.0, "step": 20460 }, { "entropy": 5.510580348968506, "epoch": 1.5922583155028205, "grad_norm": 1.171875, "learning_rate": 0.0004746240576195311, "loss": 4.9614, "mean_token_accuracy": 0.19393480718135833, "num_tokens": 35506954.0, "step": 20465 }, { "entropy": 5.57003231048584, "epoch": 1.5926473448745382, "grad_norm": 1.125, "learning_rate": 0.00047461126950856987, "loss": 5.0776, "mean_token_accuracy": 0.19808298349380493, "num_tokens": 35515796.0, "step": 20470 }, { "entropy": 5.596317863464355, "epoch": 1.5930363742462554, "grad_norm": 1.1640625, "learning_rate": 0.0004745984783688253, "loss": 5.0191, "mean_token_accuracy": 0.2005924701690674, "num_tokens": 35523713.0, "step": 20475 }, { "entropy": 5.590948486328125, "epoch": 1.5934254036179731, "grad_norm": 1.078125, "learning_rate": 0.00047458568420049153, "loss": 5.1655, "mean_token_accuracy": 0.18600842654705046, "num_tokens": 35532800.0, "step": 20480 }, { "entropy": 5.63569450378418, "epoch": 1.5938144329896908, "grad_norm": 1.2109375, "learning_rate": 0.00047457288700376274, "loss": 5.0607, "mean_token_accuracy": 0.20334388464689254, "num_tokens": 35540865.0, "step": 20485 }, { "entropy": 5.646283388137817, "epoch": 1.5942034623614083, "grad_norm": 1.140625, "learning_rate": 0.00047456008677883304, "loss": 5.1571, "mean_token_accuracy": 0.1890616625547409, "num_tokens": 35549498.0, "step": 20490 }, { "entropy": 5.604459047317505, "epoch": 1.5945924917331258, "grad_norm": 1.1328125, "learning_rate": 0.0004745472835258966, "loss": 5.0733, "mean_token_accuracy": 0.19379450380802155, "num_tokens": 35557756.0, "step": 20495 }, { "entropy": 5.653201389312744, "epoch": 1.5949815211048435, "grad_norm": 1.1171875, "learning_rate": 0.00047453447724514773, "loss": 5.1399, "mean_token_accuracy": 0.19446428567171098, "num_tokens": 35566062.0, "step": 20500 }, { "entropy": 5.575334739685059, "epoch": 1.595370550476561, "grad_norm": 1.140625, "learning_rate": 0.0004745216679367808, "loss": 4.959, "mean_token_accuracy": 0.20329582542181016, "num_tokens": 35574377.0, "step": 20505 }, { "entropy": 5.556041526794433, "epoch": 1.5957595798482784, "grad_norm": 1.15625, "learning_rate": 0.0004745088556009901, "loss": 5.0426, "mean_token_accuracy": 0.1999766081571579, "num_tokens": 35582254.0, "step": 20510 }, { "entropy": 5.584865713119507, "epoch": 1.5961486092199961, "grad_norm": 1.09375, "learning_rate": 0.0004744960402379701, "loss": 5.1078, "mean_token_accuracy": 0.1914534479379654, "num_tokens": 35590804.0, "step": 20515 }, { "entropy": 5.594689178466797, "epoch": 1.5965376385917138, "grad_norm": 1.09375, "learning_rate": 0.00047448322184791525, "loss": 5.03, "mean_token_accuracy": 0.1986386626958847, "num_tokens": 35599547.0, "step": 20520 }, { "entropy": 5.683560609817505, "epoch": 1.596926667963431, "grad_norm": 1.2109375, "learning_rate": 0.00047447040043101994, "loss": 5.1656, "mean_token_accuracy": 0.19044705033302306, "num_tokens": 35608948.0, "step": 20525 }, { "entropy": 5.731142473220825, "epoch": 1.5973156973351488, "grad_norm": 1.265625, "learning_rate": 0.00047445757598747886, "loss": 5.2302, "mean_token_accuracy": 0.187954081594944, "num_tokens": 35618243.0, "step": 20530 }, { "entropy": 5.600794792175293, "epoch": 1.5977047267068665, "grad_norm": 1.109375, "learning_rate": 0.0004744447485174864, "loss": 5.0457, "mean_token_accuracy": 0.20038587749004363, "num_tokens": 35626938.0, "step": 20535 }, { "entropy": 5.62335524559021, "epoch": 1.598093756078584, "grad_norm": 1.234375, "learning_rate": 0.00047443191802123746, "loss": 5.0877, "mean_token_accuracy": 0.2005775898694992, "num_tokens": 35635612.0, "step": 20540 }, { "entropy": 5.56707444190979, "epoch": 1.5984827854503014, "grad_norm": 1.1640625, "learning_rate": 0.00047441908449892664, "loss": 5.0798, "mean_token_accuracy": 0.19747012853622437, "num_tokens": 35644320.0, "step": 20545 }, { "entropy": 5.5490100383758545, "epoch": 1.5988718148220191, "grad_norm": 1.125, "learning_rate": 0.00047440624795074855, "loss": 5.0112, "mean_token_accuracy": 0.19907531440258025, "num_tokens": 35652606.0, "step": 20550 }, { "entropy": 5.571799039840698, "epoch": 1.5992608441937366, "grad_norm": 1.109375, "learning_rate": 0.00047439340837689804, "loss": 5.0091, "mean_token_accuracy": 0.1996219575405121, "num_tokens": 35661082.0, "step": 20555 }, { "entropy": 5.569067668914795, "epoch": 1.599649873565454, "grad_norm": 1.125, "learning_rate": 0.00047438056577756986, "loss": 5.0953, "mean_token_accuracy": 0.18963646292686462, "num_tokens": 35669926.0, "step": 20560 }, { "entropy": 5.5937152862548825, "epoch": 1.6000389029371718, "grad_norm": 1.1328125, "learning_rate": 0.00047436772015295903, "loss": 5.0824, "mean_token_accuracy": 0.19470129311084747, "num_tokens": 35678964.0, "step": 20565 }, { "entropy": 5.613815116882324, "epoch": 1.6004279323088895, "grad_norm": 1.1328125, "learning_rate": 0.00047435487150326036, "loss": 5.037, "mean_token_accuracy": 0.20288155525922774, "num_tokens": 35687943.0, "step": 20570 }, { "entropy": 5.598302841186523, "epoch": 1.6008169616806067, "grad_norm": 1.0390625, "learning_rate": 0.0004743420198286688, "loss": 5.0787, "mean_token_accuracy": 0.19018343687057496, "num_tokens": 35696684.0, "step": 20575 }, { "entropy": 5.603146028518677, "epoch": 1.6012059910523244, "grad_norm": 1.2109375, "learning_rate": 0.00047432916512937936, "loss": 5.0858, "mean_token_accuracy": 0.19305750727653503, "num_tokens": 35705038.0, "step": 20580 }, { "entropy": 5.646354675292969, "epoch": 1.6015950204240421, "grad_norm": 1.1875, "learning_rate": 0.0004743163074055871, "loss": 5.0652, "mean_token_accuracy": 0.19615095108747482, "num_tokens": 35713638.0, "step": 20585 }, { "entropy": 5.5823768138885494, "epoch": 1.6019840497957596, "grad_norm": 1.078125, "learning_rate": 0.0004743034466574871, "loss": 5.055, "mean_token_accuracy": 0.1948418140411377, "num_tokens": 35721935.0, "step": 20590 }, { "entropy": 5.600410413742066, "epoch": 1.602373079167477, "grad_norm": 1.1640625, "learning_rate": 0.0004742905828852746, "loss": 5.1156, "mean_token_accuracy": 0.1930706650018692, "num_tokens": 35731610.0, "step": 20595 }, { "entropy": 5.607321071624756, "epoch": 1.6027621085391948, "grad_norm": 1.1484375, "learning_rate": 0.0004742777160891447, "loss": 5.1045, "mean_token_accuracy": 0.19965276569128038, "num_tokens": 35740956.0, "step": 20600 }, { "entropy": 5.5529337406158445, "epoch": 1.6031511379109122, "grad_norm": 1.078125, "learning_rate": 0.0004742648462692926, "loss": 4.9558, "mean_token_accuracy": 0.20599377602338792, "num_tokens": 35749316.0, "step": 20605 }, { "entropy": 5.623693895339966, "epoch": 1.6035401672826297, "grad_norm": 1.1015625, "learning_rate": 0.00047425197342591363, "loss": 5.1459, "mean_token_accuracy": 0.19045913219451904, "num_tokens": 35758875.0, "step": 20610 }, { "entropy": 5.589928436279297, "epoch": 1.6039291966543474, "grad_norm": 1.1328125, "learning_rate": 0.0004742390975592031, "loss": 5.0984, "mean_token_accuracy": 0.19896024763584136, "num_tokens": 35767851.0, "step": 20615 }, { "entropy": 5.6603716850280765, "epoch": 1.604318226026065, "grad_norm": 1.109375, "learning_rate": 0.00047422621866935645, "loss": 5.0048, "mean_token_accuracy": 0.1973883956670761, "num_tokens": 35776393.0, "step": 20620 }, { "entropy": 5.5644951343536375, "epoch": 1.6047072553977826, "grad_norm": 1.109375, "learning_rate": 0.000474213336756569, "loss": 4.9895, "mean_token_accuracy": 0.19893414676189422, "num_tokens": 35784868.0, "step": 20625 }, { "entropy": 5.555224227905273, "epoch": 1.6050962847695, "grad_norm": 1.0859375, "learning_rate": 0.0004742004518210362, "loss": 5.0733, "mean_token_accuracy": 0.18549357652664183, "num_tokens": 35793812.0, "step": 20630 }, { "entropy": 5.607554292678833, "epoch": 1.6054853141412178, "grad_norm": 1.125, "learning_rate": 0.0004741875638629536, "loss": 5.0536, "mean_token_accuracy": 0.1918953016400337, "num_tokens": 35802206.0, "step": 20635 }, { "entropy": 5.567668771743774, "epoch": 1.6058743435129352, "grad_norm": 1.109375, "learning_rate": 0.0004741746728825168, "loss": 5.025, "mean_token_accuracy": 0.19823839366436005, "num_tokens": 35811095.0, "step": 20640 }, { "entropy": 5.675385665893555, "epoch": 1.6062633728846527, "grad_norm": 1.1484375, "learning_rate": 0.0004741617788799213, "loss": 5.1323, "mean_token_accuracy": 0.18854213058948516, "num_tokens": 35819799.0, "step": 20645 }, { "entropy": 5.577818250656128, "epoch": 1.6066524022563704, "grad_norm": 1.0859375, "learning_rate": 0.00047414888185536285, "loss": 5.0646, "mean_token_accuracy": 0.19769419878721237, "num_tokens": 35829130.0, "step": 20650 }, { "entropy": 5.565427684783936, "epoch": 1.6070414316280879, "grad_norm": 1.1484375, "learning_rate": 0.0004741359818090371, "loss": 5.0306, "mean_token_accuracy": 0.19716641008853913, "num_tokens": 35838020.0, "step": 20655 }, { "entropy": 5.5531659603118895, "epoch": 1.6074304609998054, "grad_norm": 1.1171875, "learning_rate": 0.00047412307874113976, "loss": 4.9642, "mean_token_accuracy": 0.20813483446836473, "num_tokens": 35845843.0, "step": 20660 }, { "entropy": 5.497802114486694, "epoch": 1.607819490371523, "grad_norm": 1.109375, "learning_rate": 0.0004741101726518667, "loss": 4.9835, "mean_token_accuracy": 0.2000049203634262, "num_tokens": 35854505.0, "step": 20665 }, { "entropy": 5.5592926979064945, "epoch": 1.6082085197432407, "grad_norm": 1.1953125, "learning_rate": 0.0004740972635414136, "loss": 5.0584, "mean_token_accuracy": 0.19425585865974426, "num_tokens": 35862847.0, "step": 20670 }, { "entropy": 5.567436265945434, "epoch": 1.6085975491149582, "grad_norm": 1.03125, "learning_rate": 0.0004740843514099765, "loss": 5.0141, "mean_token_accuracy": 0.19876630157232283, "num_tokens": 35871471.0, "step": 20675 }, { "entropy": 5.592900180816651, "epoch": 1.6089865784866757, "grad_norm": 1.203125, "learning_rate": 0.0004740714362577512, "loss": 5.0419, "mean_token_accuracy": 0.19263903945684432, "num_tokens": 35880266.0, "step": 20680 }, { "entropy": 5.578139972686768, "epoch": 1.6093756078583934, "grad_norm": 1.046875, "learning_rate": 0.00047405851808493364, "loss": 4.9648, "mean_token_accuracy": 0.20494530946016312, "num_tokens": 35888727.0, "step": 20685 }, { "entropy": 5.523581695556641, "epoch": 1.6097646372301109, "grad_norm": 1.0703125, "learning_rate": 0.00047404559689172006, "loss": 5.0512, "mean_token_accuracy": 0.19559099078178405, "num_tokens": 35897750.0, "step": 20690 }, { "entropy": 5.545101070404053, "epoch": 1.6101536666018283, "grad_norm": 1.109375, "learning_rate": 0.00047403267267830617, "loss": 5.009, "mean_token_accuracy": 0.20254024118185043, "num_tokens": 35906254.0, "step": 20695 }, { "entropy": 5.580029916763306, "epoch": 1.610542695973546, "grad_norm": 1.03125, "learning_rate": 0.00047401974544488844, "loss": 5.1133, "mean_token_accuracy": 0.1850684776902199, "num_tokens": 35915180.0, "step": 20700 }, { "entropy": 5.647651195526123, "epoch": 1.6109317253452635, "grad_norm": 1.0234375, "learning_rate": 0.0004740068151916628, "loss": 5.069, "mean_token_accuracy": 0.18590481877326964, "num_tokens": 35924336.0, "step": 20705 }, { "entropy": 5.611722040176391, "epoch": 1.611320754716981, "grad_norm": 1.1484375, "learning_rate": 0.0004739938819188255, "loss": 5.0816, "mean_token_accuracy": 0.1942298576235771, "num_tokens": 35933031.0, "step": 20710 }, { "entropy": 5.573425769805908, "epoch": 1.6117097840886987, "grad_norm": 1.0625, "learning_rate": 0.0004739809456265727, "loss": 4.9413, "mean_token_accuracy": 0.20563305169343948, "num_tokens": 35941794.0, "step": 20715 }, { "entropy": 5.672944831848144, "epoch": 1.6120988134604164, "grad_norm": 1.125, "learning_rate": 0.0004739680063151008, "loss": 5.157, "mean_token_accuracy": 0.19167020469903945, "num_tokens": 35949636.0, "step": 20720 }, { "entropy": 5.590260028839111, "epoch": 1.6124878428321339, "grad_norm": 1.078125, "learning_rate": 0.0004739550639846061, "loss": 5.1636, "mean_token_accuracy": 0.1918377012014389, "num_tokens": 35958842.0, "step": 20725 }, { "entropy": 5.545751762390137, "epoch": 1.6128768722038513, "grad_norm": 1.0625, "learning_rate": 0.00047394211863528496, "loss": 5.0007, "mean_token_accuracy": 0.19300727546215057, "num_tokens": 35967897.0, "step": 20730 }, { "entropy": 5.504358339309692, "epoch": 1.613265901575569, "grad_norm": 1.078125, "learning_rate": 0.0004739291702673338, "loss": 4.9073, "mean_token_accuracy": 0.206045500934124, "num_tokens": 35976309.0, "step": 20735 }, { "entropy": 5.669708681106568, "epoch": 1.6136549309472865, "grad_norm": 1.1015625, "learning_rate": 0.0004739162188809492, "loss": 5.1733, "mean_token_accuracy": 0.19061148464679717, "num_tokens": 35984401.0, "step": 20740 }, { "entropy": 5.570548677444458, "epoch": 1.614043960319004, "grad_norm": 1.1640625, "learning_rate": 0.00047390326447632747, "loss": 5.0546, "mean_token_accuracy": 0.1921870470046997, "num_tokens": 35993068.0, "step": 20745 }, { "entropy": 5.674368762969971, "epoch": 1.6144329896907217, "grad_norm": 1.171875, "learning_rate": 0.0004738903070536654, "loss": 5.1981, "mean_token_accuracy": 0.19165495336055755, "num_tokens": 36001559.0, "step": 20750 }, { "entropy": 5.641707944869995, "epoch": 1.6148220190624392, "grad_norm": 1.171875, "learning_rate": 0.0004738773466131594, "loss": 5.132, "mean_token_accuracy": 0.18952546566724776, "num_tokens": 36010675.0, "step": 20755 }, { "entropy": 5.512963676452637, "epoch": 1.6152110484341566, "grad_norm": 1.1640625, "learning_rate": 0.0004738643831550063, "loss": 4.8732, "mean_token_accuracy": 0.20856121182441711, "num_tokens": 36019498.0, "step": 20760 }, { "entropy": 5.502229499816894, "epoch": 1.6156000778058743, "grad_norm": 1.109375, "learning_rate": 0.0004738514166794026, "loss": 4.9435, "mean_token_accuracy": 0.2133476510643959, "num_tokens": 36028206.0, "step": 20765 }, { "entropy": 5.648247241973877, "epoch": 1.615989107177592, "grad_norm": 1.140625, "learning_rate": 0.00047383844718654525, "loss": 5.1428, "mean_token_accuracy": 0.19745452851057052, "num_tokens": 36037341.0, "step": 20770 }, { "entropy": 5.568948793411255, "epoch": 1.6163781365493095, "grad_norm": 1.109375, "learning_rate": 0.0004738254746766309, "loss": 5.0219, "mean_token_accuracy": 0.20243579149246216, "num_tokens": 36046596.0, "step": 20775 }, { "entropy": 5.594877243041992, "epoch": 1.616767165921027, "grad_norm": 1.171875, "learning_rate": 0.0004738124991498565, "loss": 5.0094, "mean_token_accuracy": 0.20241507589817048, "num_tokens": 36055031.0, "step": 20780 }, { "entropy": 5.642481756210327, "epoch": 1.6171561952927447, "grad_norm": 1.0703125, "learning_rate": 0.00047379952060641866, "loss": 5.1225, "mean_token_accuracy": 0.19547572135925292, "num_tokens": 36064049.0, "step": 20785 }, { "entropy": 5.670079326629638, "epoch": 1.6175452246644622, "grad_norm": 1.109375, "learning_rate": 0.00047378653904651475, "loss": 5.1228, "mean_token_accuracy": 0.18844758868217468, "num_tokens": 36072886.0, "step": 20790 }, { "entropy": 5.624984645843506, "epoch": 1.6179342540361796, "grad_norm": 1.0703125, "learning_rate": 0.00047377355447034136, "loss": 5.1213, "mean_token_accuracy": 0.19237551242113113, "num_tokens": 36082133.0, "step": 20795 }, { "entropy": 5.61851921081543, "epoch": 1.6183232834078973, "grad_norm": 1.1328125, "learning_rate": 0.0004737605668780958, "loss": 5.0241, "mean_token_accuracy": 0.2032722219824791, "num_tokens": 36090980.0, "step": 20800 }, { "entropy": 5.618232393264771, "epoch": 1.618712312779615, "grad_norm": 1.15625, "learning_rate": 0.00047374757626997494, "loss": 5.0873, "mean_token_accuracy": 0.19477030783891677, "num_tokens": 36099584.0, "step": 20805 }, { "entropy": 5.515895509719849, "epoch": 1.6191013421513323, "grad_norm": 1.2109375, "learning_rate": 0.0004737345826461759, "loss": 5.0452, "mean_token_accuracy": 0.19124222099781035, "num_tokens": 36108052.0, "step": 20810 }, { "entropy": 5.533657360076904, "epoch": 1.61949037152305, "grad_norm": 1.09375, "learning_rate": 0.0004737215860068959, "loss": 4.9255, "mean_token_accuracy": 0.20836134999990463, "num_tokens": 36116623.0, "step": 20815 }, { "entropy": 5.68348650932312, "epoch": 1.6198794008947677, "grad_norm": 1.1484375, "learning_rate": 0.00047370858635233223, "loss": 5.0579, "mean_token_accuracy": 0.19689419567584993, "num_tokens": 36124953.0, "step": 20820 }, { "entropy": 5.61453857421875, "epoch": 1.6202684302664851, "grad_norm": 1.09375, "learning_rate": 0.00047369558368268194, "loss": 5.0544, "mean_token_accuracy": 0.19750319719314574, "num_tokens": 36133500.0, "step": 20825 }, { "entropy": 5.5446038246154785, "epoch": 1.6206574596382026, "grad_norm": 1.125, "learning_rate": 0.0004736825779981424, "loss": 5.0181, "mean_token_accuracy": 0.19641697704792022, "num_tokens": 36141934.0, "step": 20830 }, { "entropy": 5.548062086105347, "epoch": 1.6210464890099203, "grad_norm": 1.09375, "learning_rate": 0.0004736695692989111, "loss": 5.0302, "mean_token_accuracy": 0.20059632062911986, "num_tokens": 36150592.0, "step": 20835 }, { "entropy": 5.568951797485352, "epoch": 1.6214355183816378, "grad_norm": 1.140625, "learning_rate": 0.0004736565575851852, "loss": 4.9124, "mean_token_accuracy": 0.20486969649791717, "num_tokens": 36159377.0, "step": 20840 }, { "entropy": 5.606961822509765, "epoch": 1.6218245477533553, "grad_norm": 1.09375, "learning_rate": 0.0004736435428571622, "loss": 5.0073, "mean_token_accuracy": 0.19758457839488983, "num_tokens": 36168159.0, "step": 20845 }, { "entropy": 5.5138555526733395, "epoch": 1.622213577125073, "grad_norm": 1.140625, "learning_rate": 0.0004736305251150397, "loss": 4.9787, "mean_token_accuracy": 0.1956377387046814, "num_tokens": 36176108.0, "step": 20850 }, { "entropy": 5.568483829498291, "epoch": 1.6226026064967907, "grad_norm": 1.1875, "learning_rate": 0.0004736175043590151, "loss": 5.147, "mean_token_accuracy": 0.18922929465770721, "num_tokens": 36184930.0, "step": 20855 }, { "entropy": 5.6446083068847654, "epoch": 1.622991635868508, "grad_norm": 1.1328125, "learning_rate": 0.000473604480589286, "loss": 5.0711, "mean_token_accuracy": 0.2014298617839813, "num_tokens": 36193308.0, "step": 20860 }, { "entropy": 5.607396984100342, "epoch": 1.6233806652402256, "grad_norm": 1.109375, "learning_rate": 0.00047359145380605007, "loss": 5.0289, "mean_token_accuracy": 0.20194722712039948, "num_tokens": 36202016.0, "step": 20865 }, { "entropy": 5.578496789932251, "epoch": 1.6237696946119433, "grad_norm": 1.1328125, "learning_rate": 0.0004735784240095049, "loss": 5.0138, "mean_token_accuracy": 0.2005320280790329, "num_tokens": 36210757.0, "step": 20870 }, { "entropy": 5.497570371627807, "epoch": 1.6241587239836608, "grad_norm": 1.0859375, "learning_rate": 0.00047356539119984813, "loss": 4.9675, "mean_token_accuracy": 0.19917488992214202, "num_tokens": 36219052.0, "step": 20875 }, { "entropy": 5.5122312068939205, "epoch": 1.6245477533553783, "grad_norm": 1.0390625, "learning_rate": 0.0004735523553772777, "loss": 4.9445, "mean_token_accuracy": 0.20557545274496078, "num_tokens": 36227890.0, "step": 20880 }, { "entropy": 5.566528034210205, "epoch": 1.624936782727096, "grad_norm": 1.0546875, "learning_rate": 0.0004735393165419912, "loss": 5.0712, "mean_token_accuracy": 0.19480637460947037, "num_tokens": 36236725.0, "step": 20885 }, { "entropy": 5.662525033950805, "epoch": 1.6253258120988134, "grad_norm": 1.109375, "learning_rate": 0.00047352627469418666, "loss": 5.0729, "mean_token_accuracy": 0.19530121386051177, "num_tokens": 36246220.0, "step": 20890 }, { "entropy": 5.652894163131714, "epoch": 1.625714841470531, "grad_norm": 1.1171875, "learning_rate": 0.0004735132298340619, "loss": 5.0985, "mean_token_accuracy": 0.1922683000564575, "num_tokens": 36254662.0, "step": 20895 }, { "entropy": 5.582242965698242, "epoch": 1.6261038708422486, "grad_norm": 1.25, "learning_rate": 0.0004735001819618148, "loss": 5.0613, "mean_token_accuracy": 0.1983216032385826, "num_tokens": 36262446.0, "step": 20900 }, { "entropy": 5.628539085388184, "epoch": 1.6264929002139663, "grad_norm": 1.03125, "learning_rate": 0.0004734871310776434, "loss": 5.0804, "mean_token_accuracy": 0.19218989759683608, "num_tokens": 36271284.0, "step": 20905 }, { "entropy": 5.567162752151489, "epoch": 1.6268819295856836, "grad_norm": 1.1953125, "learning_rate": 0.0004734740771817457, "loss": 4.9419, "mean_token_accuracy": 0.20347117781639099, "num_tokens": 36279180.0, "step": 20910 }, { "entropy": 5.565018939971924, "epoch": 1.6272709589574013, "grad_norm": 1.1015625, "learning_rate": 0.0004734610202743198, "loss": 5.0685, "mean_token_accuracy": 0.19876676499843599, "num_tokens": 36287714.0, "step": 20915 }, { "entropy": 5.606711483001709, "epoch": 1.627659988329119, "grad_norm": 1.1796875, "learning_rate": 0.0004734479603555638, "loss": 5.0768, "mean_token_accuracy": 0.19608195424079894, "num_tokens": 36297120.0, "step": 20920 }, { "entropy": 5.621117687225341, "epoch": 1.6280490177008364, "grad_norm": 1.1484375, "learning_rate": 0.00047343489742567593, "loss": 5.0593, "mean_token_accuracy": 0.19949355572462082, "num_tokens": 36305232.0, "step": 20925 }, { "entropy": 5.629474210739136, "epoch": 1.628438047072554, "grad_norm": 1.1484375, "learning_rate": 0.00047342183148485424, "loss": 5.1176, "mean_token_accuracy": 0.19753312021493913, "num_tokens": 36313587.0, "step": 20930 }, { "entropy": 5.574131202697754, "epoch": 1.6288270764442716, "grad_norm": 1.140625, "learning_rate": 0.00047340876253329706, "loss": 5.0492, "mean_token_accuracy": 0.2049025297164917, "num_tokens": 36322054.0, "step": 20935 }, { "entropy": 5.625904369354248, "epoch": 1.629216105815989, "grad_norm": 1.109375, "learning_rate": 0.00047339569057120275, "loss": 4.9939, "mean_token_accuracy": 0.20371662825345993, "num_tokens": 36330226.0, "step": 20940 }, { "entropy": 5.545360517501831, "epoch": 1.6296051351877066, "grad_norm": 1.1953125, "learning_rate": 0.00047338261559876966, "loss": 5.0401, "mean_token_accuracy": 0.1950408399105072, "num_tokens": 36338436.0, "step": 20945 }, { "entropy": 5.5326591491699215, "epoch": 1.6299941645594243, "grad_norm": 1.1484375, "learning_rate": 0.00047336953761619604, "loss": 5.0299, "mean_token_accuracy": 0.1966001182794571, "num_tokens": 36347204.0, "step": 20950 }, { "entropy": 5.592041397094727, "epoch": 1.630383193931142, "grad_norm": 1.1875, "learning_rate": 0.00047335645662368046, "loss": 5.0276, "mean_token_accuracy": 0.19911374002695084, "num_tokens": 36356225.0, "step": 20955 }, { "entropy": 5.593321990966797, "epoch": 1.6307722233028592, "grad_norm": 1.078125, "learning_rate": 0.0004733433726214214, "loss": 5.0708, "mean_token_accuracy": 0.19361161589622497, "num_tokens": 36364526.0, "step": 20960 }, { "entropy": 5.6142740726470945, "epoch": 1.631161252674577, "grad_norm": 1.09375, "learning_rate": 0.00047333028560961733, "loss": 5.1564, "mean_token_accuracy": 0.1921488329768181, "num_tokens": 36373162.0, "step": 20965 }, { "entropy": 5.659332227706909, "epoch": 1.6315502820462946, "grad_norm": 1.15625, "learning_rate": 0.00047331719558846687, "loss": 5.0659, "mean_token_accuracy": 0.19120197147130966, "num_tokens": 36381545.0, "step": 20970 }, { "entropy": 5.600464344024658, "epoch": 1.631939311418012, "grad_norm": 1.109375, "learning_rate": 0.00047330410255816863, "loss": 5.008, "mean_token_accuracy": 0.20248008370399476, "num_tokens": 36390267.0, "step": 20975 }, { "entropy": 5.585038423538208, "epoch": 1.6323283407897295, "grad_norm": 1.1015625, "learning_rate": 0.00047329100651892123, "loss": 5.0454, "mean_token_accuracy": 0.20128584355115892, "num_tokens": 36398910.0, "step": 20980 }, { "entropy": 5.595075416564941, "epoch": 1.6327173701614472, "grad_norm": 1.0703125, "learning_rate": 0.0004732779074709234, "loss": 5.0204, "mean_token_accuracy": 0.20079665780067443, "num_tokens": 36407382.0, "step": 20985 }, { "entropy": 5.566320180892944, "epoch": 1.6331063995331647, "grad_norm": 1.3125, "learning_rate": 0.000473264805414374, "loss": 5.0193, "mean_token_accuracy": 0.20246626287698746, "num_tokens": 36415734.0, "step": 20990 }, { "entropy": 5.620746612548828, "epoch": 1.6334954289048822, "grad_norm": 1.125, "learning_rate": 0.00047325170034947167, "loss": 5.11, "mean_token_accuracy": 0.18969775587320328, "num_tokens": 36424537.0, "step": 20995 }, { "entropy": 5.582606315612793, "epoch": 1.6338844582766, "grad_norm": 1.140625, "learning_rate": 0.00047323859227641537, "loss": 4.9827, "mean_token_accuracy": 0.20257348120212554, "num_tokens": 36433276.0, "step": 21000 }, { "epoch": 1.6338844582766, "eval_entropy": 5.405130986368805, "eval_loss": 5.117014408111572, "eval_mean_token_accuracy": 0.2029533945848669, "eval_num_tokens": 36433276.0, "eval_runtime": 21.6926, "eval_samples_per_second": 1915.767, "eval_steps_per_second": 239.482, "step": 21000 }, { "entropy": 5.627707242965698, "epoch": 1.6342734876483176, "grad_norm": 1.1796875, "learning_rate": 0.00047322548119540397, "loss": 5.0557, "mean_token_accuracy": 0.19769406020641328, "num_tokens": 36442154.0, "step": 21005 }, { "entropy": 5.53789176940918, "epoch": 1.634662517020035, "grad_norm": 1.1015625, "learning_rate": 0.00047321236710663636, "loss": 4.9147, "mean_token_accuracy": 0.20455050021409987, "num_tokens": 36450625.0, "step": 21010 }, { "entropy": 5.602278995513916, "epoch": 1.6350515463917525, "grad_norm": 1.0078125, "learning_rate": 0.00047319925001031165, "loss": 5.0433, "mean_token_accuracy": 0.19608840942382813, "num_tokens": 36460082.0, "step": 21015 }, { "entropy": 5.63373761177063, "epoch": 1.6354405757634702, "grad_norm": 1.09375, "learning_rate": 0.0004731861299066287, "loss": 5.0955, "mean_token_accuracy": 0.19169610142707824, "num_tokens": 36469372.0, "step": 21020 }, { "entropy": 5.5780932903289795, "epoch": 1.6358296051351877, "grad_norm": 1.0859375, "learning_rate": 0.0004731730067957867, "loss": 4.9008, "mean_token_accuracy": 0.20467886179685593, "num_tokens": 36478190.0, "step": 21025 }, { "entropy": 5.556621313095093, "epoch": 1.6362186345069052, "grad_norm": 1.109375, "learning_rate": 0.00047315988067798476, "loss": 5.0187, "mean_token_accuracy": 0.20280733704566956, "num_tokens": 36486245.0, "step": 21030 }, { "entropy": 5.537379503250122, "epoch": 1.6366076638786229, "grad_norm": 1.078125, "learning_rate": 0.000473146751553422, "loss": 5.0794, "mean_token_accuracy": 0.19576458036899566, "num_tokens": 36495858.0, "step": 21035 }, { "entropy": 5.639727354049683, "epoch": 1.6369966932503404, "grad_norm": 1.1953125, "learning_rate": 0.0004731336194222978, "loss": 5.0654, "mean_token_accuracy": 0.1962142676115036, "num_tokens": 36504564.0, "step": 21040 }, { "entropy": 5.5351001739501955, "epoch": 1.6373857226220578, "grad_norm": 1.125, "learning_rate": 0.00047312048428481114, "loss": 4.9746, "mean_token_accuracy": 0.2032212048768997, "num_tokens": 36512758.0, "step": 21045 }, { "entropy": 5.524808692932129, "epoch": 1.6377747519937755, "grad_norm": 1.1484375, "learning_rate": 0.00047310734614116153, "loss": 4.9282, "mean_token_accuracy": 0.20079012215137482, "num_tokens": 36521429.0, "step": 21050 }, { "entropy": 5.590664005279541, "epoch": 1.6381637813654932, "grad_norm": 1.09375, "learning_rate": 0.0004730942049915483, "loss": 5.0228, "mean_token_accuracy": 0.20215374380350112, "num_tokens": 36530161.0, "step": 21055 }, { "entropy": 5.635999727249145, "epoch": 1.6385528107372107, "grad_norm": 1.0703125, "learning_rate": 0.0004730810608361707, "loss": 5.028, "mean_token_accuracy": 0.19804578870534897, "num_tokens": 36538184.0, "step": 21060 }, { "entropy": 5.5724804401397705, "epoch": 1.6389418401089282, "grad_norm": 1.0625, "learning_rate": 0.00047306791367522833, "loss": 5.0013, "mean_token_accuracy": 0.20384600907564163, "num_tokens": 36547418.0, "step": 21065 }, { "entropy": 5.672629165649414, "epoch": 1.6393308694806459, "grad_norm": 1.09375, "learning_rate": 0.0004730547635089206, "loss": 5.1967, "mean_token_accuracy": 0.1875606134533882, "num_tokens": 36556542.0, "step": 21070 }, { "entropy": 5.609497356414795, "epoch": 1.6397198988523634, "grad_norm": 1.03125, "learning_rate": 0.00047304161033744714, "loss": 4.9791, "mean_token_accuracy": 0.2008548304438591, "num_tokens": 36565903.0, "step": 21075 }, { "entropy": 5.552347040176391, "epoch": 1.6401089282240808, "grad_norm": 1.1640625, "learning_rate": 0.0004730284541610075, "loss": 5.024, "mean_token_accuracy": 0.19755199998617173, "num_tokens": 36574010.0, "step": 21080 }, { "entropy": 5.538785409927368, "epoch": 1.6404979575957985, "grad_norm": 1.1328125, "learning_rate": 0.0004730152949798012, "loss": 5.0369, "mean_token_accuracy": 0.20524271279573442, "num_tokens": 36582142.0, "step": 21085 }, { "entropy": 5.553340053558349, "epoch": 1.640886986967516, "grad_norm": 1.046875, "learning_rate": 0.00047300213279402787, "loss": 5.0481, "mean_token_accuracy": 0.19588459581136702, "num_tokens": 36590676.0, "step": 21090 }, { "entropy": 5.5742284774780275, "epoch": 1.6412760163392335, "grad_norm": 1.1953125, "learning_rate": 0.00047298896760388745, "loss": 4.943, "mean_token_accuracy": 0.21234913915395737, "num_tokens": 36599489.0, "step": 21095 }, { "entropy": 5.623790884017945, "epoch": 1.6416650457109512, "grad_norm": 1.109375, "learning_rate": 0.0004729757994095796, "loss": 5.0114, "mean_token_accuracy": 0.19561414122581483, "num_tokens": 36608231.0, "step": 21100 }, { "entropy": 5.536325931549072, "epoch": 1.6420540750826689, "grad_norm": 1.109375, "learning_rate": 0.00047296262821130405, "loss": 5.0762, "mean_token_accuracy": 0.19584111571311952, "num_tokens": 36617335.0, "step": 21105 }, { "entropy": 5.62404956817627, "epoch": 1.6424431044543863, "grad_norm": 1.0625, "learning_rate": 0.00047294945400926065, "loss": 5.0698, "mean_token_accuracy": 0.1958995580673218, "num_tokens": 36626249.0, "step": 21110 }, { "entropy": 5.642087984085083, "epoch": 1.6428321338261038, "grad_norm": 1.171875, "learning_rate": 0.0004729362768036494, "loss": 5.129, "mean_token_accuracy": 0.19584924280643462, "num_tokens": 36634602.0, "step": 21115 }, { "entropy": 5.611550283432007, "epoch": 1.6432211631978215, "grad_norm": 1.1328125, "learning_rate": 0.00047292309659467024, "loss": 5.0804, "mean_token_accuracy": 0.1956130102276802, "num_tokens": 36643091.0, "step": 21120 }, { "entropy": 5.665580224990845, "epoch": 1.643610192569539, "grad_norm": 1.0625, "learning_rate": 0.0004729099133825231, "loss": 5.0925, "mean_token_accuracy": 0.1975028023123741, "num_tokens": 36652530.0, "step": 21125 }, { "entropy": 5.648771858215332, "epoch": 1.6439992219412565, "grad_norm": 1.1484375, "learning_rate": 0.000472896727167408, "loss": 5.0967, "mean_token_accuracy": 0.18698727637529372, "num_tokens": 36660858.0, "step": 21130 }, { "entropy": 5.678765344619751, "epoch": 1.6443882513129742, "grad_norm": 1.25, "learning_rate": 0.00047288353794952505, "loss": 5.1752, "mean_token_accuracy": 0.18366521149873732, "num_tokens": 36670211.0, "step": 21135 }, { "entropy": 5.584189510345459, "epoch": 1.6447772806846916, "grad_norm": 1.015625, "learning_rate": 0.0004728703457290744, "loss": 5.0878, "mean_token_accuracy": 0.19174043387174605, "num_tokens": 36679604.0, "step": 21140 }, { "entropy": 5.652974367141724, "epoch": 1.6451663100564091, "grad_norm": 1.125, "learning_rate": 0.0004728571505062562, "loss": 5.1545, "mean_token_accuracy": 0.18882785886526107, "num_tokens": 36687908.0, "step": 21145 }, { "entropy": 5.560069131851196, "epoch": 1.6455553394281268, "grad_norm": 1.1171875, "learning_rate": 0.0004728439522812707, "loss": 4.9512, "mean_token_accuracy": 0.20313460528850555, "num_tokens": 36696675.0, "step": 21150 }, { "entropy": 5.595976114273071, "epoch": 1.6459443687998445, "grad_norm": 1.0703125, "learning_rate": 0.00047283075105431806, "loss": 5.06, "mean_token_accuracy": 0.19661768078804015, "num_tokens": 36705594.0, "step": 21155 }, { "entropy": 5.675845670700073, "epoch": 1.646333398171562, "grad_norm": 1.1640625, "learning_rate": 0.0004728175468255987, "loss": 5.0861, "mean_token_accuracy": 0.1960594192147255, "num_tokens": 36714008.0, "step": 21160 }, { "entropy": 5.5679113388061525, "epoch": 1.6467224275432795, "grad_norm": 1.171875, "learning_rate": 0.00047280433959531287, "loss": 4.9311, "mean_token_accuracy": 0.2077319324016571, "num_tokens": 36723093.0, "step": 21165 }, { "entropy": 5.574484539031983, "epoch": 1.6471114569149972, "grad_norm": 1.1015625, "learning_rate": 0.000472791129363661, "loss": 4.9477, "mean_token_accuracy": 0.20026464611291886, "num_tokens": 36732119.0, "step": 21170 }, { "entropy": 5.543735122680664, "epoch": 1.6475004862867146, "grad_norm": 1.046875, "learning_rate": 0.0004727779161308436, "loss": 5.039, "mean_token_accuracy": 0.19190786331892012, "num_tokens": 36740593.0, "step": 21175 }, { "entropy": 5.642477369308471, "epoch": 1.6478895156584321, "grad_norm": 1.1328125, "learning_rate": 0.0004727646998970612, "loss": 5.1841, "mean_token_accuracy": 0.19007358253002166, "num_tokens": 36749083.0, "step": 21180 }, { "entropy": 5.631742525100708, "epoch": 1.6482785450301498, "grad_norm": 1.1015625, "learning_rate": 0.00047275148066251417, "loss": 5.0208, "mean_token_accuracy": 0.19673260748386384, "num_tokens": 36757469.0, "step": 21185 }, { "entropy": 5.677160549163818, "epoch": 1.6486675744018673, "grad_norm": 1.21875, "learning_rate": 0.0004727382584274032, "loss": 5.1552, "mean_token_accuracy": 0.1893853485584259, "num_tokens": 36766197.0, "step": 21190 }, { "entropy": 5.5634783744812015, "epoch": 1.6490566037735848, "grad_norm": 1.15625, "learning_rate": 0.00047272503319192887, "loss": 5.0187, "mean_token_accuracy": 0.20408065170049666, "num_tokens": 36774172.0, "step": 21195 }, { "entropy": 5.597947883605957, "epoch": 1.6494456331453025, "grad_norm": 1.0625, "learning_rate": 0.0004727118049562919, "loss": 5.0606, "mean_token_accuracy": 0.19201454818248748, "num_tokens": 36783549.0, "step": 21200 }, { "entropy": 5.703398036956787, "epoch": 1.6498346625170202, "grad_norm": 1.140625, "learning_rate": 0.000472698573720693, "loss": 5.1186, "mean_token_accuracy": 0.1939348980784416, "num_tokens": 36791755.0, "step": 21205 }, { "entropy": 5.63737006187439, "epoch": 1.6502236918887376, "grad_norm": 1.0546875, "learning_rate": 0.0004726853394853329, "loss": 5.1574, "mean_token_accuracy": 0.1854114279150963, "num_tokens": 36801253.0, "step": 21210 }, { "entropy": 5.5436540126800535, "epoch": 1.650612721260455, "grad_norm": 1.0625, "learning_rate": 0.00047267210225041234, "loss": 5.0178, "mean_token_accuracy": 0.19687352776527406, "num_tokens": 36810497.0, "step": 21215 }, { "entropy": 5.574085474014282, "epoch": 1.6510017506321728, "grad_norm": 1.28125, "learning_rate": 0.00047265886201613234, "loss": 4.9834, "mean_token_accuracy": 0.20710826069116592, "num_tokens": 36819823.0, "step": 21220 }, { "entropy": 5.596588230133056, "epoch": 1.6513907800038903, "grad_norm": 1.125, "learning_rate": 0.00047264561878269365, "loss": 4.987, "mean_token_accuracy": 0.19913100600242614, "num_tokens": 36828935.0, "step": 21225 }, { "entropy": 5.5554952144622805, "epoch": 1.6517798093756078, "grad_norm": 1.0703125, "learning_rate": 0.0004726323725502973, "loss": 4.9338, "mean_token_accuracy": 0.20245628654956818, "num_tokens": 36837906.0, "step": 21230 }, { "entropy": 5.575576972961426, "epoch": 1.6521688387473255, "grad_norm": 1.078125, "learning_rate": 0.0004726191233191443, "loss": 5.0295, "mean_token_accuracy": 0.20287332087755203, "num_tokens": 36846041.0, "step": 21235 }, { "entropy": 5.641946601867676, "epoch": 1.6525578681190431, "grad_norm": 1.078125, "learning_rate": 0.0004726058710894357, "loss": 5.1129, "mean_token_accuracy": 0.1935931608080864, "num_tokens": 36854493.0, "step": 21240 }, { "entropy": 5.544401693344116, "epoch": 1.6529468974907604, "grad_norm": 1.203125, "learning_rate": 0.0004725926158613724, "loss": 4.9619, "mean_token_accuracy": 0.2011410489678383, "num_tokens": 36863042.0, "step": 21245 }, { "entropy": 5.603020143508911, "epoch": 1.653335926862478, "grad_norm": 1.0, "learning_rate": 0.0004725793576351557, "loss": 5.0819, "mean_token_accuracy": 0.19579267501831055, "num_tokens": 36872513.0, "step": 21250 }, { "entropy": 5.632798719406128, "epoch": 1.6537249562341958, "grad_norm": 1.125, "learning_rate": 0.0004725660964109867, "loss": 5.076, "mean_token_accuracy": 0.19769784361124038, "num_tokens": 36881149.0, "step": 21255 }, { "entropy": 5.638370323181152, "epoch": 1.6541139856059133, "grad_norm": 1.0234375, "learning_rate": 0.00047255283218906673, "loss": 5.0723, "mean_token_accuracy": 0.20098303705453874, "num_tokens": 36889372.0, "step": 21260 }, { "entropy": 5.574144601821899, "epoch": 1.6545030149776307, "grad_norm": 1.140625, "learning_rate": 0.000472539564969597, "loss": 5.0306, "mean_token_accuracy": 0.19470499455928802, "num_tokens": 36897727.0, "step": 21265 }, { "entropy": 5.57804274559021, "epoch": 1.6548920443493484, "grad_norm": 1.125, "learning_rate": 0.00047252629475277863, "loss": 5.0239, "mean_token_accuracy": 0.20100114196538926, "num_tokens": 36906288.0, "step": 21270 }, { "entropy": 5.595533752441407, "epoch": 1.655281073721066, "grad_norm": 1.21875, "learning_rate": 0.0004725130215388132, "loss": 5.0902, "mean_token_accuracy": 0.1924890473484993, "num_tokens": 36915614.0, "step": 21275 }, { "entropy": 5.6116269588470455, "epoch": 1.6556701030927834, "grad_norm": 1.03125, "learning_rate": 0.0004724997453279021, "loss": 4.9832, "mean_token_accuracy": 0.20186122208833696, "num_tokens": 36923631.0, "step": 21280 }, { "entropy": 5.669332361221313, "epoch": 1.656059132464501, "grad_norm": 1.171875, "learning_rate": 0.0004724864661202467, "loss": 5.1202, "mean_token_accuracy": 0.1949249342083931, "num_tokens": 36932296.0, "step": 21285 }, { "entropy": 5.509629917144776, "epoch": 1.6564481618362188, "grad_norm": 1.125, "learning_rate": 0.00047247318391604846, "loss": 4.9314, "mean_token_accuracy": 0.20822669416666031, "num_tokens": 36940785.0, "step": 21290 }, { "entropy": 5.5945371150970455, "epoch": 1.656837191207936, "grad_norm": 1.09375, "learning_rate": 0.00047245989871550897, "loss": 5.0491, "mean_token_accuracy": 0.20413535982370376, "num_tokens": 36948797.0, "step": 21295 }, { "entropy": 5.662470149993896, "epoch": 1.6572262205796537, "grad_norm": 1.109375, "learning_rate": 0.0004724466105188299, "loss": 5.1359, "mean_token_accuracy": 0.19571333676576613, "num_tokens": 36957808.0, "step": 21300 }, { "entropy": 5.601862001419067, "epoch": 1.6576152499513714, "grad_norm": 1.09375, "learning_rate": 0.00047243331932621263, "loss": 5.0396, "mean_token_accuracy": 0.20420629680156707, "num_tokens": 36966260.0, "step": 21305 }, { "entropy": 5.612208986282349, "epoch": 1.658004279323089, "grad_norm": 1.0703125, "learning_rate": 0.0004724200251378591, "loss": 5.0986, "mean_token_accuracy": 0.18811919838190078, "num_tokens": 36975436.0, "step": 21310 }, { "entropy": 5.692429780960083, "epoch": 1.6583933086948064, "grad_norm": 1.125, "learning_rate": 0.0004724067279539709, "loss": 5.1738, "mean_token_accuracy": 0.189607834815979, "num_tokens": 36983485.0, "step": 21315 }, { "entropy": 5.7205735206604, "epoch": 1.658782338066524, "grad_norm": 1.078125, "learning_rate": 0.00047239342777474975, "loss": 5.1763, "mean_token_accuracy": 0.18661074042320253, "num_tokens": 36992632.0, "step": 21320 }, { "entropy": 5.659430122375488, "epoch": 1.6591713674382416, "grad_norm": 1.0703125, "learning_rate": 0.00047238012460039765, "loss": 4.9841, "mean_token_accuracy": 0.20501357614994048, "num_tokens": 37000694.0, "step": 21325 }, { "entropy": 5.5736369609832765, "epoch": 1.659560396809959, "grad_norm": 1.0859375, "learning_rate": 0.0004723668184311162, "loss": 5.0533, "mean_token_accuracy": 0.19406954944133759, "num_tokens": 37009514.0, "step": 21330 }, { "entropy": 5.6709424495697025, "epoch": 1.6599494261816767, "grad_norm": 1.0625, "learning_rate": 0.0004723535092671074, "loss": 5.1713, "mean_token_accuracy": 0.19450464695692063, "num_tokens": 37019434.0, "step": 21335 }, { "entropy": 5.592543506622315, "epoch": 1.6603384555533944, "grad_norm": 1.0546875, "learning_rate": 0.00047234019710857335, "loss": 4.9945, "mean_token_accuracy": 0.19535061866044998, "num_tokens": 37028673.0, "step": 21340 }, { "entropy": 5.561697292327881, "epoch": 1.6607274849251117, "grad_norm": 1.125, "learning_rate": 0.0004723268819557158, "loss": 5.0175, "mean_token_accuracy": 0.19505877196788787, "num_tokens": 37038204.0, "step": 21345 }, { "entropy": 5.524170446395874, "epoch": 1.6611165142968294, "grad_norm": 1.1328125, "learning_rate": 0.00047231356380873687, "loss": 4.9483, "mean_token_accuracy": 0.20221082419157027, "num_tokens": 37047301.0, "step": 21350 }, { "entropy": 5.610209512710571, "epoch": 1.661505543668547, "grad_norm": 1.2265625, "learning_rate": 0.0004723002426678388, "loss": 5.0498, "mean_token_accuracy": 0.19861287474632264, "num_tokens": 37054892.0, "step": 21355 }, { "entropy": 5.582382535934448, "epoch": 1.6618945730402646, "grad_norm": 1.21875, "learning_rate": 0.0004722869185332235, "loss": 4.9488, "mean_token_accuracy": 0.19958563894033432, "num_tokens": 37063139.0, "step": 21360 }, { "entropy": 5.607288265228272, "epoch": 1.662283602411982, "grad_norm": 1.0625, "learning_rate": 0.00047227359140509324, "loss": 5.1069, "mean_token_accuracy": 0.19341133385896683, "num_tokens": 37072019.0, "step": 21365 }, { "entropy": 5.6238524436950685, "epoch": 1.6626726317836997, "grad_norm": 1.09375, "learning_rate": 0.0004722602612836501, "loss": 5.1971, "mean_token_accuracy": 0.19112467765808105, "num_tokens": 37081209.0, "step": 21370 }, { "entropy": 5.557598304748535, "epoch": 1.6630616611554172, "grad_norm": 1.078125, "learning_rate": 0.00047224692816909665, "loss": 4.9481, "mean_token_accuracy": 0.2041161462664604, "num_tokens": 37089464.0, "step": 21375 }, { "entropy": 5.5455522537231445, "epoch": 1.6634506905271347, "grad_norm": 1.1875, "learning_rate": 0.0004722335920616349, "loss": 4.9557, "mean_token_accuracy": 0.20441379696130751, "num_tokens": 37098224.0, "step": 21380 }, { "entropy": 5.535178327560425, "epoch": 1.6638397198988524, "grad_norm": 1.140625, "learning_rate": 0.00047222025296146745, "loss": 5.0952, "mean_token_accuracy": 0.1996006742119789, "num_tokens": 37107039.0, "step": 21385 }, { "entropy": 5.641671276092529, "epoch": 1.66422874927057, "grad_norm": 1.0703125, "learning_rate": 0.00047220691086879643, "loss": 5.089, "mean_token_accuracy": 0.1938251957297325, "num_tokens": 37116029.0, "step": 21390 }, { "entropy": 5.550416946411133, "epoch": 1.6646177786422873, "grad_norm": 1.1484375, "learning_rate": 0.0004721935657838245, "loss": 4.9138, "mean_token_accuracy": 0.20950607657432557, "num_tokens": 37124553.0, "step": 21395 }, { "entropy": 5.604712677001953, "epoch": 1.665006808014005, "grad_norm": 1.1015625, "learning_rate": 0.000472180217706754, "loss": 5.0828, "mean_token_accuracy": 0.1980056032538414, "num_tokens": 37132670.0, "step": 21400 }, { "entropy": 5.605715131759643, "epoch": 1.6653958373857227, "grad_norm": 1.078125, "learning_rate": 0.0004721668666377876, "loss": 5.1569, "mean_token_accuracy": 0.1951506182551384, "num_tokens": 37141534.0, "step": 21405 }, { "entropy": 5.596762323379517, "epoch": 1.6657848667574402, "grad_norm": 1.0, "learning_rate": 0.00047215351257712783, "loss": 5.085, "mean_token_accuracy": 0.19341191947460173, "num_tokens": 37150895.0, "step": 21410 }, { "entropy": 5.595761299133301, "epoch": 1.6661738961291577, "grad_norm": 1.140625, "learning_rate": 0.00047214015552497735, "loss": 5.0114, "mean_token_accuracy": 0.20285391956567764, "num_tokens": 37159244.0, "step": 21415 }, { "entropy": 5.552701234817505, "epoch": 1.6665629255008754, "grad_norm": 1.078125, "learning_rate": 0.00047212679548153867, "loss": 5.0841, "mean_token_accuracy": 0.20224006175994874, "num_tokens": 37167762.0, "step": 21420 }, { "entropy": 5.5150810241699215, "epoch": 1.6669519548725928, "grad_norm": 1.0625, "learning_rate": 0.00047211343244701475, "loss": 5.0096, "mean_token_accuracy": 0.19749639481306075, "num_tokens": 37176470.0, "step": 21425 }, { "entropy": 5.623316097259521, "epoch": 1.6673409842443103, "grad_norm": 1.25, "learning_rate": 0.0004721000664216081, "loss": 5.1348, "mean_token_accuracy": 0.19396791160106658, "num_tokens": 37185923.0, "step": 21430 }, { "entropy": 5.578217077255249, "epoch": 1.667730013616028, "grad_norm": 1.046875, "learning_rate": 0.0004720866974055219, "loss": 5.1038, "mean_token_accuracy": 0.1922146499156952, "num_tokens": 37195400.0, "step": 21435 }, { "entropy": 5.6607969284057615, "epoch": 1.6681190429877457, "grad_norm": 1.1015625, "learning_rate": 0.0004720733253989585, "loss": 5.1558, "mean_token_accuracy": 0.1904288187623024, "num_tokens": 37203862.0, "step": 21440 }, { "entropy": 5.548402452468872, "epoch": 1.6685080723594632, "grad_norm": 1.03125, "learning_rate": 0.00047205995040212114, "loss": 4.9343, "mean_token_accuracy": 0.2041526511311531, "num_tokens": 37212518.0, "step": 21445 }, { "entropy": 5.660844564437866, "epoch": 1.6688971017311807, "grad_norm": 1.140625, "learning_rate": 0.0004720465724152127, "loss": 5.1566, "mean_token_accuracy": 0.18602682650089264, "num_tokens": 37221342.0, "step": 21450 }, { "entropy": 5.586700105667115, "epoch": 1.6692861311028984, "grad_norm": 1.109375, "learning_rate": 0.00047203319143843613, "loss": 5.0587, "mean_token_accuracy": 0.19490232169628144, "num_tokens": 37230477.0, "step": 21455 }, { "entropy": 5.606761121749878, "epoch": 1.6696751604746158, "grad_norm": 1.1328125, "learning_rate": 0.0004720198074719946, "loss": 5.0459, "mean_token_accuracy": 0.20876651257276535, "num_tokens": 37238590.0, "step": 21460 }, { "entropy": 5.6021161556243895, "epoch": 1.6700641898463333, "grad_norm": 1.125, "learning_rate": 0.00047200642051609094, "loss": 5.0492, "mean_token_accuracy": 0.19705477654933928, "num_tokens": 37248065.0, "step": 21465 }, { "entropy": 5.607812690734863, "epoch": 1.670453219218051, "grad_norm": 1.1640625, "learning_rate": 0.0004719930305709285, "loss": 5.0545, "mean_token_accuracy": 0.19922156482934952, "num_tokens": 37256467.0, "step": 21470 }, { "entropy": 5.602549266815186, "epoch": 1.6708422485897685, "grad_norm": 1.1875, "learning_rate": 0.00047197963763671033, "loss": 5.068, "mean_token_accuracy": 0.1964782029390335, "num_tokens": 37264255.0, "step": 21475 }, { "entropy": 5.556284713745117, "epoch": 1.671231277961486, "grad_norm": 1.1171875, "learning_rate": 0.0004719662417136397, "loss": 4.9662, "mean_token_accuracy": 0.20098155587911606, "num_tokens": 37272671.0, "step": 21480 }, { "entropy": 5.583687973022461, "epoch": 1.6716203073332037, "grad_norm": 1.1484375, "learning_rate": 0.00047195284280191987, "loss": 5.0759, "mean_token_accuracy": 0.20118902623653412, "num_tokens": 37281895.0, "step": 21485 }, { "entropy": 5.517930221557617, "epoch": 1.6720093367049214, "grad_norm": 1.0390625, "learning_rate": 0.0004719394409017541, "loss": 4.9908, "mean_token_accuracy": 0.20646511465311052, "num_tokens": 37290098.0, "step": 21490 }, { "entropy": 5.603145360946655, "epoch": 1.6723983660766388, "grad_norm": 1.09375, "learning_rate": 0.00047192603601334585, "loss": 5.0136, "mean_token_accuracy": 0.19935539066791536, "num_tokens": 37299494.0, "step": 21495 }, { "entropy": 5.668177747726441, "epoch": 1.6727873954483563, "grad_norm": 1.140625, "learning_rate": 0.00047191262813689835, "loss": 5.0753, "mean_token_accuracy": 0.19340511560440063, "num_tokens": 37308366.0, "step": 21500 }, { "entropy": 5.5969678401947025, "epoch": 1.673176424820074, "grad_norm": 1.078125, "learning_rate": 0.0004718992172726152, "loss": 5.0651, "mean_token_accuracy": 0.19560451805591583, "num_tokens": 37316774.0, "step": 21505 }, { "entropy": 5.615719127655029, "epoch": 1.6735654541917915, "grad_norm": 1.203125, "learning_rate": 0.00047188580342069983, "loss": 5.0911, "mean_token_accuracy": 0.19052953869104386, "num_tokens": 37325388.0, "step": 21510 }, { "entropy": 5.64659571647644, "epoch": 1.673954483563509, "grad_norm": 1.15625, "learning_rate": 0.0004718723865813557, "loss": 5.0907, "mean_token_accuracy": 0.1931856632232666, "num_tokens": 37333476.0, "step": 21515 }, { "entropy": 5.6524269580841064, "epoch": 1.6743435129352267, "grad_norm": 1.1171875, "learning_rate": 0.0004718589667547865, "loss": 5.1408, "mean_token_accuracy": 0.19416848570108414, "num_tokens": 37342556.0, "step": 21520 }, { "entropy": 5.619352102279663, "epoch": 1.6747325423069441, "grad_norm": 1.1875, "learning_rate": 0.0004718455439411958, "loss": 5.0462, "mean_token_accuracy": 0.19767039865255356, "num_tokens": 37351082.0, "step": 21525 }, { "entropy": 5.646317958831787, "epoch": 1.6751215716786616, "grad_norm": 1.171875, "learning_rate": 0.0004718321181407873, "loss": 5.0278, "mean_token_accuracy": 0.19684505462646484, "num_tokens": 37359083.0, "step": 21530 }, { "entropy": 5.525096797943116, "epoch": 1.6755106010503793, "grad_norm": 1.1171875, "learning_rate": 0.0004718186893537647, "loss": 5.0379, "mean_token_accuracy": 0.1977344959974289, "num_tokens": 37367982.0, "step": 21535 }, { "entropy": 5.646663999557495, "epoch": 1.675899630422097, "grad_norm": 1.109375, "learning_rate": 0.0004718052575803318, "loss": 5.107, "mean_token_accuracy": 0.19302003532648088, "num_tokens": 37376932.0, "step": 21540 }, { "entropy": 5.652730989456177, "epoch": 1.6762886597938145, "grad_norm": 1.2109375, "learning_rate": 0.0004717918228206923, "loss": 5.1119, "mean_token_accuracy": 0.1921851858496666, "num_tokens": 37386248.0, "step": 21545 }, { "entropy": 5.662451219558716, "epoch": 1.676677689165532, "grad_norm": 1.140625, "learning_rate": 0.0004717783850750501, "loss": 5.0352, "mean_token_accuracy": 0.19392092972993852, "num_tokens": 37395412.0, "step": 21550 }, { "entropy": 5.600053167343139, "epoch": 1.6770667185372496, "grad_norm": 1.0625, "learning_rate": 0.0004717649443436091, "loss": 4.9984, "mean_token_accuracy": 0.2026136338710785, "num_tokens": 37404332.0, "step": 21555 }, { "entropy": 5.628665447235107, "epoch": 1.6774557479089671, "grad_norm": 1.1015625, "learning_rate": 0.00047175150062657336, "loss": 5.1198, "mean_token_accuracy": 0.19707286208868027, "num_tokens": 37413365.0, "step": 21560 }, { "entropy": 5.617720651626587, "epoch": 1.6778447772806846, "grad_norm": 1.0234375, "learning_rate": 0.00047173805392414664, "loss": 4.9796, "mean_token_accuracy": 0.20141357630491258, "num_tokens": 37422164.0, "step": 21565 }, { "entropy": 5.629726314544678, "epoch": 1.6782338066524023, "grad_norm": 1.125, "learning_rate": 0.0004717246042365332, "loss": 5.0657, "mean_token_accuracy": 0.19509731829166413, "num_tokens": 37431092.0, "step": 21570 }, { "entropy": 5.625465679168701, "epoch": 1.6786228360241198, "grad_norm": 1.0546875, "learning_rate": 0.00047171115156393695, "loss": 5.1511, "mean_token_accuracy": 0.1877985417842865, "num_tokens": 37440832.0, "step": 21575 }, { "entropy": 5.599740314483642, "epoch": 1.6790118653958372, "grad_norm": 1.1640625, "learning_rate": 0.00047169769590656207, "loss": 5.0801, "mean_token_accuracy": 0.19075132459402083, "num_tokens": 37449317.0, "step": 21580 }, { "entropy": 5.671441841125488, "epoch": 1.679400894767555, "grad_norm": 1.1953125, "learning_rate": 0.00047168423726461273, "loss": 5.1116, "mean_token_accuracy": 0.18842989951372147, "num_tokens": 37457820.0, "step": 21585 }, { "entropy": 5.584477472305298, "epoch": 1.6797899241392726, "grad_norm": 1.109375, "learning_rate": 0.0004716707756382931, "loss": 4.9562, "mean_token_accuracy": 0.2102904811501503, "num_tokens": 37466378.0, "step": 21590 }, { "entropy": 5.629812431335449, "epoch": 1.6801789535109901, "grad_norm": 1.171875, "learning_rate": 0.00047165731102780757, "loss": 5.0846, "mean_token_accuracy": 0.18678393661975862, "num_tokens": 37475114.0, "step": 21595 }, { "entropy": 5.612844181060791, "epoch": 1.6805679828827076, "grad_norm": 1.0546875, "learning_rate": 0.00047164384343336037, "loss": 5.1194, "mean_token_accuracy": 0.183768430352211, "num_tokens": 37483898.0, "step": 21600 }, { "entropy": 5.656857013702393, "epoch": 1.6809570122544253, "grad_norm": 1.0703125, "learning_rate": 0.00047163037285515583, "loss": 5.1077, "mean_token_accuracy": 0.19742812663316728, "num_tokens": 37492420.0, "step": 21605 }, { "entropy": 5.6216456413269045, "epoch": 1.6813460416261428, "grad_norm": 1.0390625, "learning_rate": 0.0004716168992933982, "loss": 5.0024, "mean_token_accuracy": 0.20491353720426558, "num_tokens": 37501090.0, "step": 21610 }, { "entropy": 5.625682592391968, "epoch": 1.6817350709978602, "grad_norm": 1.109375, "learning_rate": 0.00047160342274829234, "loss": 5.1401, "mean_token_accuracy": 0.19010068625211715, "num_tokens": 37510465.0, "step": 21615 }, { "entropy": 5.5935358047485355, "epoch": 1.682124100369578, "grad_norm": 1.15625, "learning_rate": 0.00047158994322004223, "loss": 5.0391, "mean_token_accuracy": 0.20038553327322006, "num_tokens": 37519155.0, "step": 21620 }, { "entropy": 5.608833265304566, "epoch": 1.6825131297412956, "grad_norm": 1.1796875, "learning_rate": 0.0004715764607088527, "loss": 5.039, "mean_token_accuracy": 0.19925615340471267, "num_tokens": 37527134.0, "step": 21625 }, { "entropy": 5.610093307495117, "epoch": 1.6829021591130129, "grad_norm": 1.1015625, "learning_rate": 0.0004715629752149283, "loss": 5.0606, "mean_token_accuracy": 0.19677335172891616, "num_tokens": 37536087.0, "step": 21630 }, { "entropy": 5.609236526489258, "epoch": 1.6832911884847306, "grad_norm": 1.1640625, "learning_rate": 0.00047154948673847356, "loss": 5.0014, "mean_token_accuracy": 0.19995570033788682, "num_tokens": 37543896.0, "step": 21635 }, { "entropy": 5.582584857940674, "epoch": 1.6836802178564483, "grad_norm": 1.171875, "learning_rate": 0.0004715359952796933, "loss": 5.0588, "mean_token_accuracy": 0.20039613991975785, "num_tokens": 37552571.0, "step": 21640 }, { "entropy": 5.6328558921813965, "epoch": 1.6840692472281658, "grad_norm": 1.1875, "learning_rate": 0.00047152250083879203, "loss": 5.0981, "mean_token_accuracy": 0.18757977038621904, "num_tokens": 37560823.0, "step": 21645 }, { "entropy": 5.588835859298706, "epoch": 1.6844582765998832, "grad_norm": 1.2578125, "learning_rate": 0.00047150900341597464, "loss": 4.9981, "mean_token_accuracy": 0.19352417141199113, "num_tokens": 37568312.0, "step": 21650 }, { "entropy": 5.576103925704956, "epoch": 1.684847305971601, "grad_norm": 1.109375, "learning_rate": 0.0004714955030114459, "loss": 5.0446, "mean_token_accuracy": 0.20106790959835052, "num_tokens": 37577008.0, "step": 21655 }, { "entropy": 5.597704315185547, "epoch": 1.6852363353433184, "grad_norm": 1.1015625, "learning_rate": 0.00047148199962541065, "loss": 5.0636, "mean_token_accuracy": 0.19182838052511214, "num_tokens": 37586252.0, "step": 21660 }, { "entropy": 5.637983179092407, "epoch": 1.6856253647150359, "grad_norm": 1.1484375, "learning_rate": 0.0004714684932580738, "loss": 5.0514, "mean_token_accuracy": 0.19950115382671357, "num_tokens": 37594699.0, "step": 21665 }, { "entropy": 5.59361252784729, "epoch": 1.6860143940867536, "grad_norm": 1.046875, "learning_rate": 0.0004714549839096403, "loss": 5.0309, "mean_token_accuracy": 0.19860166907310486, "num_tokens": 37603891.0, "step": 21670 }, { "entropy": 5.576402091979981, "epoch": 1.6864034234584713, "grad_norm": 1.0546875, "learning_rate": 0.00047144147158031507, "loss": 5.0395, "mean_token_accuracy": 0.19898758828639984, "num_tokens": 37612809.0, "step": 21675 }, { "entropy": 5.606590747833252, "epoch": 1.6867924528301885, "grad_norm": 1.125, "learning_rate": 0.0004714279562703032, "loss": 5.0015, "mean_token_accuracy": 0.19787965565919877, "num_tokens": 37621787.0, "step": 21680 }, { "entropy": 5.577509355545044, "epoch": 1.6871814822019062, "grad_norm": 1.171875, "learning_rate": 0.0004714144379798098, "loss": 4.973, "mean_token_accuracy": 0.20881732702255248, "num_tokens": 37629796.0, "step": 21685 }, { "entropy": 5.63043065071106, "epoch": 1.687570511573624, "grad_norm": 1.09375, "learning_rate": 0.00047140091670903986, "loss": 5.0018, "mean_token_accuracy": 0.2027361199259758, "num_tokens": 37638467.0, "step": 21690 }, { "entropy": 5.586255121231079, "epoch": 1.6879595409453414, "grad_norm": 1.0703125, "learning_rate": 0.00047138739245819857, "loss": 5.0546, "mean_token_accuracy": 0.20552275329828262, "num_tokens": 37647159.0, "step": 21695 }, { "entropy": 5.633293485641479, "epoch": 1.6883485703170589, "grad_norm": 1.1015625, "learning_rate": 0.00047137386522749124, "loss": 5.0557, "mean_token_accuracy": 0.19023656696081162, "num_tokens": 37655986.0, "step": 21700 }, { "entropy": 5.588557481765747, "epoch": 1.6887375996887766, "grad_norm": 1.1796875, "learning_rate": 0.0004713603350171231, "loss": 4.9581, "mean_token_accuracy": 0.20672757774591446, "num_tokens": 37663932.0, "step": 21705 }, { "entropy": 5.661288118362426, "epoch": 1.689126629060494, "grad_norm": 1.125, "learning_rate": 0.00047134680182729926, "loss": 5.0989, "mean_token_accuracy": 0.19409008771181108, "num_tokens": 37672142.0, "step": 21710 }, { "entropy": 5.620462894439697, "epoch": 1.6895156584322115, "grad_norm": 1.125, "learning_rate": 0.0004713332656582254, "loss": 4.9908, "mean_token_accuracy": 0.20023662596940994, "num_tokens": 37680569.0, "step": 21715 }, { "entropy": 5.586681222915649, "epoch": 1.6899046878039292, "grad_norm": 1.171875, "learning_rate": 0.0004713197265101066, "loss": 5.0709, "mean_token_accuracy": 0.19210963547229767, "num_tokens": 37688852.0, "step": 21720 }, { "entropy": 5.644071817398071, "epoch": 1.690293717175647, "grad_norm": 1.21875, "learning_rate": 0.00047130618438314856, "loss": 5.0577, "mean_token_accuracy": 0.19895697385072708, "num_tokens": 37696900.0, "step": 21725 }, { "entropy": 5.651037693023682, "epoch": 1.6906827465473642, "grad_norm": 1.15625, "learning_rate": 0.0004712926392775565, "loss": 5.1852, "mean_token_accuracy": 0.19570981413125993, "num_tokens": 37706292.0, "step": 21730 }, { "entropy": 5.554470252990723, "epoch": 1.6910717759190819, "grad_norm": 1.25, "learning_rate": 0.0004712790911935362, "loss": 5.0026, "mean_token_accuracy": 0.20260119587182998, "num_tokens": 37715025.0, "step": 21735 }, { "entropy": 5.629698133468628, "epoch": 1.6914608052907996, "grad_norm": 1.09375, "learning_rate": 0.000471265540131293, "loss": 5.1207, "mean_token_accuracy": 0.19631825238466263, "num_tokens": 37724124.0, "step": 21740 }, { "entropy": 5.640809392929077, "epoch": 1.691849834662517, "grad_norm": 1.171875, "learning_rate": 0.00047125198609103267, "loss": 5.088, "mean_token_accuracy": 0.191292704641819, "num_tokens": 37732689.0, "step": 21745 }, { "entropy": 5.627795314788818, "epoch": 1.6922388640342345, "grad_norm": 1.1015625, "learning_rate": 0.0004712384290729607, "loss": 5.0311, "mean_token_accuracy": 0.1955161303281784, "num_tokens": 37741206.0, "step": 21750 }, { "entropy": 5.606991147994995, "epoch": 1.6926278934059522, "grad_norm": 1.15625, "learning_rate": 0.000471224869077283, "loss": 5.0479, "mean_token_accuracy": 0.19832633584737777, "num_tokens": 37749549.0, "step": 21755 }, { "entropy": 5.520385789871216, "epoch": 1.6930169227776697, "grad_norm": 1.140625, "learning_rate": 0.00047121130610420527, "loss": 4.8566, "mean_token_accuracy": 0.20679234266281127, "num_tokens": 37758332.0, "step": 21760 }, { "entropy": 5.575597715377808, "epoch": 1.6934059521493872, "grad_norm": 1.0703125, "learning_rate": 0.00047119774015393323, "loss": 5.0554, "mean_token_accuracy": 0.19150752574205399, "num_tokens": 37767368.0, "step": 21765 }, { "entropy": 5.599534797668457, "epoch": 1.6937949815211049, "grad_norm": 1.109375, "learning_rate": 0.00047118417122667285, "loss": 5.0231, "mean_token_accuracy": 0.20130162537097931, "num_tokens": 37776426.0, "step": 21770 }, { "entropy": 5.731898450851441, "epoch": 1.6941840108928226, "grad_norm": 1.15625, "learning_rate": 0.0004711705993226298, "loss": 5.1735, "mean_token_accuracy": 0.18922399133443832, "num_tokens": 37784464.0, "step": 21775 }, { "entropy": 5.580948543548584, "epoch": 1.6945730402645398, "grad_norm": 1.140625, "learning_rate": 0.0004711570244420102, "loss": 5.0101, "mean_token_accuracy": 0.19242167323827744, "num_tokens": 37794307.0, "step": 21780 }, { "entropy": 5.645243167877197, "epoch": 1.6949620696362575, "grad_norm": 1.1328125, "learning_rate": 0.0004711434465850199, "loss": 5.0874, "mean_token_accuracy": 0.1858052358031273, "num_tokens": 37803151.0, "step": 21785 }, { "entropy": 5.610836124420166, "epoch": 1.6953510990079752, "grad_norm": 1.125, "learning_rate": 0.0004711298657518651, "loss": 5.0665, "mean_token_accuracy": 0.19485594779253007, "num_tokens": 37812433.0, "step": 21790 }, { "entropy": 5.601185035705567, "epoch": 1.6957401283796927, "grad_norm": 1.1484375, "learning_rate": 0.0004711162819427518, "loss": 5.012, "mean_token_accuracy": 0.19587904065847397, "num_tokens": 37820627.0, "step": 21795 }, { "entropy": 5.63452525138855, "epoch": 1.6961291577514102, "grad_norm": 1.1015625, "learning_rate": 0.000471102695157886, "loss": 5.0586, "mean_token_accuracy": 0.19656783938407899, "num_tokens": 37829015.0, "step": 21800 }, { "entropy": 5.656379652023316, "epoch": 1.6965181871231279, "grad_norm": 1.1484375, "learning_rate": 0.0004710891053974739, "loss": 5.1384, "mean_token_accuracy": 0.19162594974040986, "num_tokens": 37837097.0, "step": 21805 }, { "entropy": 5.622197198867798, "epoch": 1.6969072164948453, "grad_norm": 1.109375, "learning_rate": 0.0004710755126617217, "loss": 5.0775, "mean_token_accuracy": 0.19314517825841904, "num_tokens": 37845414.0, "step": 21810 }, { "entropy": 5.688105773925781, "epoch": 1.6972962458665628, "grad_norm": 1.0625, "learning_rate": 0.0004710619169508358, "loss": 5.0701, "mean_token_accuracy": 0.19673532247543335, "num_tokens": 37855006.0, "step": 21815 }, { "entropy": 5.749412631988525, "epoch": 1.6976852752382805, "grad_norm": 1.15625, "learning_rate": 0.0004710483182650223, "loss": 5.2084, "mean_token_accuracy": 0.18665971904993056, "num_tokens": 37863611.0, "step": 21820 }, { "entropy": 5.621445608139038, "epoch": 1.6980743046099982, "grad_norm": 1.203125, "learning_rate": 0.00047103471660448767, "loss": 5.1004, "mean_token_accuracy": 0.19965129494667053, "num_tokens": 37871935.0, "step": 21825 }, { "entropy": 5.557186937332153, "epoch": 1.6984633339817157, "grad_norm": 1.0390625, "learning_rate": 0.00047102111196943813, "loss": 5.0323, "mean_token_accuracy": 0.194974485039711, "num_tokens": 37880760.0, "step": 21830 }, { "entropy": 5.649439525604248, "epoch": 1.6988523633534331, "grad_norm": 1.2421875, "learning_rate": 0.00047100750436008035, "loss": 4.9923, "mean_token_accuracy": 0.2024221181869507, "num_tokens": 37889457.0, "step": 21835 }, { "entropy": 5.652561330795288, "epoch": 1.6992413927251508, "grad_norm": 1.15625, "learning_rate": 0.00047099389377662054, "loss": 5.0343, "mean_token_accuracy": 0.2022455871105194, "num_tokens": 37897805.0, "step": 21840 }, { "entropy": 5.601611089706421, "epoch": 1.6996304220968683, "grad_norm": 1.1640625, "learning_rate": 0.0004709802802192654, "loss": 5.1041, "mean_token_accuracy": 0.192533677816391, "num_tokens": 37906292.0, "step": 21845 }, { "entropy": 5.5491368770599365, "epoch": 1.7000194514685858, "grad_norm": 1.1953125, "learning_rate": 0.00047096666368822153, "loss": 5.031, "mean_token_accuracy": 0.19448921978473663, "num_tokens": 37914513.0, "step": 21850 }, { "entropy": 5.644253540039062, "epoch": 1.7004084808403035, "grad_norm": 1.140625, "learning_rate": 0.00047095304418369536, "loss": 5.0208, "mean_token_accuracy": 0.19831829965114595, "num_tokens": 37923097.0, "step": 21855 }, { "entropy": 5.632509231567383, "epoch": 1.700797510212021, "grad_norm": 1.171875, "learning_rate": 0.0004709394217058936, "loss": 5.0727, "mean_token_accuracy": 0.19902566224336624, "num_tokens": 37931617.0, "step": 21860 }, { "entropy": 5.650298452377319, "epoch": 1.7011865395837384, "grad_norm": 1.1875, "learning_rate": 0.0004709257962550231, "loss": 5.0415, "mean_token_accuracy": 0.1968570277094841, "num_tokens": 37939777.0, "step": 21865 }, { "entropy": 5.611708927154541, "epoch": 1.7015755689554561, "grad_norm": 1.0546875, "learning_rate": 0.00047091216783129035, "loss": 5.0458, "mean_token_accuracy": 0.2001648247241974, "num_tokens": 37949375.0, "step": 21870 }, { "entropy": 5.601207876205445, "epoch": 1.7019645983271738, "grad_norm": 0.97265625, "learning_rate": 0.0004708985364349024, "loss": 5.0085, "mean_token_accuracy": 0.20188260376453399, "num_tokens": 37958724.0, "step": 21875 }, { "entropy": 5.612050628662109, "epoch": 1.7023536276988913, "grad_norm": 1.0859375, "learning_rate": 0.00047088490206606586, "loss": 5.0096, "mean_token_accuracy": 0.20139708369970322, "num_tokens": 37967646.0, "step": 21880 }, { "entropy": 5.627737236022949, "epoch": 1.7027426570706088, "grad_norm": 1.1171875, "learning_rate": 0.00047087126472498785, "loss": 5.0967, "mean_token_accuracy": 0.1950717195868492, "num_tokens": 37976058.0, "step": 21885 }, { "entropy": 5.567477512359619, "epoch": 1.7031316864423265, "grad_norm": 1.1640625, "learning_rate": 0.000470857624411875, "loss": 4.9937, "mean_token_accuracy": 0.20249312669038771, "num_tokens": 37984895.0, "step": 21890 }, { "entropy": 5.568163919448852, "epoch": 1.703520715814044, "grad_norm": 1.1484375, "learning_rate": 0.00047084398112693456, "loss": 4.9804, "mean_token_accuracy": 0.20086124539375305, "num_tokens": 37993514.0, "step": 21895 }, { "entropy": 5.587209987640381, "epoch": 1.7039097451857614, "grad_norm": 1.0546875, "learning_rate": 0.0004708303348703734, "loss": 5.0276, "mean_token_accuracy": 0.1998554363846779, "num_tokens": 38002274.0, "step": 21900 }, { "entropy": 5.613046789169312, "epoch": 1.7042987745574791, "grad_norm": 1.1171875, "learning_rate": 0.0004708166856423986, "loss": 4.9613, "mean_token_accuracy": 0.19482831209897994, "num_tokens": 38010336.0, "step": 21905 }, { "entropy": 5.622057580947876, "epoch": 1.7046878039291966, "grad_norm": 1.0390625, "learning_rate": 0.00047080303344321727, "loss": 5.0133, "mean_token_accuracy": 0.2015889897942543, "num_tokens": 38019166.0, "step": 21910 }, { "entropy": 5.537200164794922, "epoch": 1.705076833300914, "grad_norm": 1.1171875, "learning_rate": 0.00047078937827303653, "loss": 5.0579, "mean_token_accuracy": 0.2001550853252411, "num_tokens": 38027634.0, "step": 21915 }, { "entropy": 5.553782224655151, "epoch": 1.7054658626726318, "grad_norm": 1.09375, "learning_rate": 0.0004707757201320636, "loss": 5.0467, "mean_token_accuracy": 0.19480942338705062, "num_tokens": 38036611.0, "step": 21920 }, { "entropy": 5.5321451187133786, "epoch": 1.7058548920443495, "grad_norm": 1.15625, "learning_rate": 0.00047076205902050577, "loss": 4.9781, "mean_token_accuracy": 0.20527924299240113, "num_tokens": 38045815.0, "step": 21925 }, { "entropy": 5.649434232711792, "epoch": 1.706243921416067, "grad_norm": 1.09375, "learning_rate": 0.00047074839493857024, "loss": 5.1324, "mean_token_accuracy": 0.18496497124433517, "num_tokens": 38054973.0, "step": 21930 }, { "entropy": 5.608946752548218, "epoch": 1.7066329507877844, "grad_norm": 1.0546875, "learning_rate": 0.0004707347278864644, "loss": 4.9925, "mean_token_accuracy": 0.2084254115819931, "num_tokens": 38064084.0, "step": 21935 }, { "entropy": 5.576431608200073, "epoch": 1.7070219801595021, "grad_norm": 1.1328125, "learning_rate": 0.00047072105786439563, "loss": 5.0204, "mean_token_accuracy": 0.1993615835905075, "num_tokens": 38073838.0, "step": 21940 }, { "entropy": 5.651712369918823, "epoch": 1.7074110095312196, "grad_norm": 1.171875, "learning_rate": 0.00047070738487257137, "loss": 5.136, "mean_token_accuracy": 0.18846120089292526, "num_tokens": 38082531.0, "step": 21945 }, { "entropy": 5.6739662170410154, "epoch": 1.707800038902937, "grad_norm": 1.1484375, "learning_rate": 0.00047069370891119895, "loss": 5.1237, "mean_token_accuracy": 0.1916724696755409, "num_tokens": 38091499.0, "step": 21950 }, { "entropy": 5.618093395233155, "epoch": 1.7081890682746548, "grad_norm": 1.109375, "learning_rate": 0.000470680029980486, "loss": 4.9586, "mean_token_accuracy": 0.21191776990890504, "num_tokens": 38099488.0, "step": 21955 }, { "entropy": 5.636016321182251, "epoch": 1.7085780976463723, "grad_norm": 1.1484375, "learning_rate": 0.00047066634808064006, "loss": 5.088, "mean_token_accuracy": 0.19315854758024215, "num_tokens": 38107535.0, "step": 21960 }, { "entropy": 5.636117792129516, "epoch": 1.7089671270180897, "grad_norm": 1.15625, "learning_rate": 0.00047065266321186873, "loss": 5.0385, "mean_token_accuracy": 0.20253082364797592, "num_tokens": 38116457.0, "step": 21965 }, { "entropy": 5.6422703742980955, "epoch": 1.7093561563898074, "grad_norm": 1.1015625, "learning_rate": 0.0004706389753743797, "loss": 4.9747, "mean_token_accuracy": 0.20003546476364137, "num_tokens": 38124571.0, "step": 21970 }, { "entropy": 5.573584985733032, "epoch": 1.7097451857615251, "grad_norm": 1.0859375, "learning_rate": 0.0004706252845683805, "loss": 5.002, "mean_token_accuracy": 0.19627837091684341, "num_tokens": 38132789.0, "step": 21975 }, { "entropy": 5.499757862091064, "epoch": 1.7101342151332426, "grad_norm": 1.1640625, "learning_rate": 0.00047061159079407903, "loss": 4.912, "mean_token_accuracy": 0.1993772193789482, "num_tokens": 38141413.0, "step": 21980 }, { "entropy": 5.574840497970581, "epoch": 1.71052324450496, "grad_norm": 1.078125, "learning_rate": 0.000470597894051683, "loss": 4.955, "mean_token_accuracy": 0.19755455255508422, "num_tokens": 38149869.0, "step": 21985 }, { "entropy": 5.56954779624939, "epoch": 1.7109122738766778, "grad_norm": 1.2109375, "learning_rate": 0.0004705841943414003, "loss": 4.8906, "mean_token_accuracy": 0.21355447620153428, "num_tokens": 38157356.0, "step": 21990 }, { "entropy": 5.592711734771728, "epoch": 1.7113013032483952, "grad_norm": 1.1328125, "learning_rate": 0.00047057049166343876, "loss": 5.0362, "mean_token_accuracy": 0.20169810354709625, "num_tokens": 38166125.0, "step": 21995 }, { "entropy": 5.5900205135345455, "epoch": 1.7116903326201127, "grad_norm": 1.2421875, "learning_rate": 0.00047055678601800623, "loss": 5.0081, "mean_token_accuracy": 0.2000053882598877, "num_tokens": 38174171.0, "step": 22000 }, { "entropy": 5.644533157348633, "epoch": 1.7120793619918304, "grad_norm": 1.171875, "learning_rate": 0.00047054307740531076, "loss": 5.1285, "mean_token_accuracy": 0.1909903660416603, "num_tokens": 38182755.0, "step": 22005 }, { "entropy": 5.609760999679565, "epoch": 1.712468391363548, "grad_norm": 1.03125, "learning_rate": 0.00047052936582556035, "loss": 5.0212, "mean_token_accuracy": 0.20128351002931594, "num_tokens": 38191289.0, "step": 22010 }, { "entropy": 5.626429748535156, "epoch": 1.7128574207352654, "grad_norm": 1.140625, "learning_rate": 0.00047051565127896307, "loss": 5.1671, "mean_token_accuracy": 0.19011717289686203, "num_tokens": 38200624.0, "step": 22015 }, { "entropy": 5.64558687210083, "epoch": 1.713246450106983, "grad_norm": 1.203125, "learning_rate": 0.00047050193376572686, "loss": 4.9764, "mean_token_accuracy": 0.20088403820991516, "num_tokens": 38209272.0, "step": 22020 }, { "entropy": 5.688591146469117, "epoch": 1.7136354794787008, "grad_norm": 1.0, "learning_rate": 0.00047048821328606, "loss": 5.1546, "mean_token_accuracy": 0.18999486565589904, "num_tokens": 38218851.0, "step": 22025 }, { "entropy": 5.619030475616455, "epoch": 1.7140245088504182, "grad_norm": 1.1171875, "learning_rate": 0.0004704744898401708, "loss": 5.031, "mean_token_accuracy": 0.19988053739070893, "num_tokens": 38227367.0, "step": 22030 }, { "entropy": 5.618204641342163, "epoch": 1.7144135382221357, "grad_norm": 1.25, "learning_rate": 0.0004704607634282672, "loss": 5.046, "mean_token_accuracy": 0.20185351371765137, "num_tokens": 38235721.0, "step": 22035 }, { "entropy": 5.668382883071899, "epoch": 1.7148025675938534, "grad_norm": 1.046875, "learning_rate": 0.00047044703405055765, "loss": 5.0989, "mean_token_accuracy": 0.19078947901725768, "num_tokens": 38244686.0, "step": 22040 }, { "entropy": 5.646992349624634, "epoch": 1.7151915969655709, "grad_norm": 1.203125, "learning_rate": 0.00047043330170725046, "loss": 5.123, "mean_token_accuracy": 0.19176636040210723, "num_tokens": 38253609.0, "step": 22045 }, { "entropy": 5.604864406585693, "epoch": 1.7155806263372884, "grad_norm": 1.046875, "learning_rate": 0.00047041956639855406, "loss": 5.0341, "mean_token_accuracy": 0.19882475435733796, "num_tokens": 38261746.0, "step": 22050 }, { "entropy": 5.583838939666748, "epoch": 1.715969655709006, "grad_norm": 1.0625, "learning_rate": 0.0004704058281246766, "loss": 5.0376, "mean_token_accuracy": 0.19881610125303267, "num_tokens": 38270573.0, "step": 22055 }, { "entropy": 5.599984455108642, "epoch": 1.7163586850807238, "grad_norm": 1.2265625, "learning_rate": 0.0004703920868858268, "loss": 5.0584, "mean_token_accuracy": 0.19605821818113328, "num_tokens": 38279031.0, "step": 22060 }, { "entropy": 5.664320755004883, "epoch": 1.716747714452441, "grad_norm": 1.1484375, "learning_rate": 0.00047037834268221315, "loss": 5.0896, "mean_token_accuracy": 0.1917247384786606, "num_tokens": 38287060.0, "step": 22065 }, { "entropy": 5.659240674972534, "epoch": 1.7171367438241587, "grad_norm": 1.1796875, "learning_rate": 0.0004703645955140441, "loss": 5.0487, "mean_token_accuracy": 0.20109158009290695, "num_tokens": 38295192.0, "step": 22070 }, { "entropy": 5.574900531768799, "epoch": 1.7175257731958764, "grad_norm": 1.140625, "learning_rate": 0.00047035084538152815, "loss": 4.9947, "mean_token_accuracy": 0.20156506299972535, "num_tokens": 38303932.0, "step": 22075 }, { "entropy": 5.658350467681885, "epoch": 1.7179148025675939, "grad_norm": 1.0546875, "learning_rate": 0.0004703370922848742, "loss": 5.1274, "mean_token_accuracy": 0.18749662190675737, "num_tokens": 38312906.0, "step": 22080 }, { "entropy": 5.628390264511109, "epoch": 1.7183038319393114, "grad_norm": 1.2890625, "learning_rate": 0.00047032333622429074, "loss": 5.1117, "mean_token_accuracy": 0.19163792431354523, "num_tokens": 38322359.0, "step": 22085 }, { "entropy": 5.697182369232178, "epoch": 1.718692861311029, "grad_norm": 1.1640625, "learning_rate": 0.00047030957719998656, "loss": 5.1359, "mean_token_accuracy": 0.18942702263593675, "num_tokens": 38331880.0, "step": 22090 }, { "entropy": 5.647880697250367, "epoch": 1.7190818906827465, "grad_norm": 1.15625, "learning_rate": 0.0004702958152121704, "loss": 5.2024, "mean_token_accuracy": 0.1890093207359314, "num_tokens": 38340763.0, "step": 22095 }, { "entropy": 5.638798379898072, "epoch": 1.719470920054464, "grad_norm": 1.046875, "learning_rate": 0.0004702820502610511, "loss": 5.0299, "mean_token_accuracy": 0.19104350954294205, "num_tokens": 38349427.0, "step": 22100 }, { "entropy": 5.61019377708435, "epoch": 1.7198599494261817, "grad_norm": 1.125, "learning_rate": 0.0004702682823468375, "loss": 5.0082, "mean_token_accuracy": 0.20286105275154115, "num_tokens": 38358025.0, "step": 22105 }, { "entropy": 5.635022163391113, "epoch": 1.7202489787978994, "grad_norm": 1.0703125, "learning_rate": 0.00047025451146973844, "loss": 5.0061, "mean_token_accuracy": 0.19591220766305922, "num_tokens": 38366923.0, "step": 22110 }, { "entropy": 5.62484393119812, "epoch": 1.7206380081696167, "grad_norm": 1.140625, "learning_rate": 0.00047024073762996305, "loss": 5.0686, "mean_token_accuracy": 0.20488647222518921, "num_tokens": 38375397.0, "step": 22115 }, { "entropy": 5.601342010498047, "epoch": 1.7210270375413343, "grad_norm": 1.0390625, "learning_rate": 0.0004702269608277202, "loss": 4.9972, "mean_token_accuracy": 0.2031652256846428, "num_tokens": 38384279.0, "step": 22120 }, { "entropy": 5.624995231628418, "epoch": 1.721416066913052, "grad_norm": 1.15625, "learning_rate": 0.0004702131810632189, "loss": 5.0364, "mean_token_accuracy": 0.19768262207508086, "num_tokens": 38392087.0, "step": 22125 }, { "entropy": 5.585998106002807, "epoch": 1.7218050962847695, "grad_norm": 1.171875, "learning_rate": 0.00047019939833666837, "loss": 5.1445, "mean_token_accuracy": 0.18876546621322632, "num_tokens": 38400616.0, "step": 22130 }, { "entropy": 5.640737009048462, "epoch": 1.722194125656487, "grad_norm": 1.2421875, "learning_rate": 0.0004701856126482776, "loss": 5.031, "mean_token_accuracy": 0.19541898369789124, "num_tokens": 38408975.0, "step": 22135 }, { "entropy": 5.6687417984008786, "epoch": 1.7225831550282047, "grad_norm": 1.171875, "learning_rate": 0.0004701718239982559, "loss": 5.1429, "mean_token_accuracy": 0.20021412372589112, "num_tokens": 38417161.0, "step": 22140 }, { "entropy": 5.65213360786438, "epoch": 1.7229721843999222, "grad_norm": 1.21875, "learning_rate": 0.00047015803238681234, "loss": 5.119, "mean_token_accuracy": 0.19333733320236207, "num_tokens": 38425078.0, "step": 22145 }, { "entropy": 5.599633359909058, "epoch": 1.7233612137716396, "grad_norm": 1.078125, "learning_rate": 0.0004701442378141563, "loss": 5.003, "mean_token_accuracy": 0.1980367660522461, "num_tokens": 38433347.0, "step": 22150 }, { "entropy": 5.689887237548828, "epoch": 1.7237502431433573, "grad_norm": 1.0703125, "learning_rate": 0.000470130440280497, "loss": 5.0984, "mean_token_accuracy": 0.19043573439121247, "num_tokens": 38442373.0, "step": 22155 }, { "entropy": 5.672642230987549, "epoch": 1.724139272515075, "grad_norm": 1.015625, "learning_rate": 0.0004701166397860439, "loss": 5.1625, "mean_token_accuracy": 0.18912122249603272, "num_tokens": 38452325.0, "step": 22160 }, { "entropy": 5.676292991638183, "epoch": 1.7245283018867923, "grad_norm": 1.140625, "learning_rate": 0.0004701028363310064, "loss": 5.1545, "mean_token_accuracy": 0.19105582386255265, "num_tokens": 38462317.0, "step": 22165 }, { "entropy": 5.604901885986328, "epoch": 1.72491733125851, "grad_norm": 1.09375, "learning_rate": 0.00047008902991559385, "loss": 4.9886, "mean_token_accuracy": 0.19714796990156175, "num_tokens": 38471149.0, "step": 22170 }, { "entropy": 5.710884666442871, "epoch": 1.7253063606302277, "grad_norm": 1.0, "learning_rate": 0.0004700752205400158, "loss": 5.0955, "mean_token_accuracy": 0.19442637115716935, "num_tokens": 38480427.0, "step": 22175 }, { "entropy": 5.554259967803955, "epoch": 1.7256953900019452, "grad_norm": 1.0625, "learning_rate": 0.00047006140820448174, "loss": 5.0109, "mean_token_accuracy": 0.199029740691185, "num_tokens": 38489283.0, "step": 22180 }, { "entropy": 5.5770008087158205, "epoch": 1.7260844193736626, "grad_norm": 1.1171875, "learning_rate": 0.00047004759290920136, "loss": 5.0557, "mean_token_accuracy": 0.1980983167886734, "num_tokens": 38497557.0, "step": 22185 }, { "entropy": 5.600299930572509, "epoch": 1.7264734487453803, "grad_norm": 1.1875, "learning_rate": 0.0004700337746543841, "loss": 5.0617, "mean_token_accuracy": 0.202307765185833, "num_tokens": 38506589.0, "step": 22190 }, { "entropy": 5.647100448608398, "epoch": 1.7268624781170978, "grad_norm": 1.0625, "learning_rate": 0.0004700199534402398, "loss": 5.066, "mean_token_accuracy": 0.19849121272563935, "num_tokens": 38515016.0, "step": 22195 }, { "entropy": 5.688411664962769, "epoch": 1.7272515074888153, "grad_norm": 1.1328125, "learning_rate": 0.0004700061292669781, "loss": 5.1113, "mean_token_accuracy": 0.19487768411636353, "num_tokens": 38523792.0, "step": 22200 }, { "entropy": 5.506297302246094, "epoch": 1.727640536860533, "grad_norm": 1.125, "learning_rate": 0.0004699923021348088, "loss": 4.9439, "mean_token_accuracy": 0.20067713260650635, "num_tokens": 38532007.0, "step": 22205 }, { "entropy": 5.542131328582764, "epoch": 1.7280295662322507, "grad_norm": 1.1171875, "learning_rate": 0.00046997847204394166, "loss": 5.0429, "mean_token_accuracy": 0.19859578907489778, "num_tokens": 38541044.0, "step": 22210 }, { "entropy": 5.639937543869019, "epoch": 1.728418595603968, "grad_norm": 1.1484375, "learning_rate": 0.00046996463899458653, "loss": 4.9821, "mean_token_accuracy": 0.2084065482020378, "num_tokens": 38549365.0, "step": 22215 }, { "entropy": 5.623882102966308, "epoch": 1.7288076249756856, "grad_norm": 1.15625, "learning_rate": 0.0004699508029869533, "loss": 5.007, "mean_token_accuracy": 0.20547301918268204, "num_tokens": 38558289.0, "step": 22220 }, { "entropy": 5.644685745239258, "epoch": 1.7291966543474033, "grad_norm": 1.140625, "learning_rate": 0.00046993696402125205, "loss": 5.106, "mean_token_accuracy": 0.1901729568839073, "num_tokens": 38568422.0, "step": 22225 }, { "entropy": 5.618670701980591, "epoch": 1.7295856837191208, "grad_norm": 1.140625, "learning_rate": 0.0004699231220976925, "loss": 5.0418, "mean_token_accuracy": 0.195781908929348, "num_tokens": 38577009.0, "step": 22230 }, { "entropy": 5.5794073104858395, "epoch": 1.7299747130908383, "grad_norm": 1.15625, "learning_rate": 0.0004699092772164849, "loss": 4.9155, "mean_token_accuracy": 0.20664279162883759, "num_tokens": 38584920.0, "step": 22235 }, { "entropy": 5.46686635017395, "epoch": 1.730363742462556, "grad_norm": 1.125, "learning_rate": 0.0004698954293778392, "loss": 4.9919, "mean_token_accuracy": 0.2058437719941139, "num_tokens": 38593533.0, "step": 22240 }, { "entropy": 5.503834247589111, "epoch": 1.7307527718342735, "grad_norm": 1.2578125, "learning_rate": 0.00046988157858196555, "loss": 4.9945, "mean_token_accuracy": 0.20209934562444687, "num_tokens": 38602300.0, "step": 22245 }, { "entropy": 5.63166241645813, "epoch": 1.731141801205991, "grad_norm": 1.046875, "learning_rate": 0.00046986772482907426, "loss": 5.0692, "mean_token_accuracy": 0.2003465324640274, "num_tokens": 38610729.0, "step": 22250 }, { "entropy": 5.615326929092407, "epoch": 1.7315308305777086, "grad_norm": 1.203125, "learning_rate": 0.0004698538681193754, "loss": 4.9532, "mean_token_accuracy": 0.20383911728858947, "num_tokens": 38618192.0, "step": 22255 }, { "entropy": 5.592626667022705, "epoch": 1.7319198599494263, "grad_norm": 1.1171875, "learning_rate": 0.00046984000845307907, "loss": 5.0387, "mean_token_accuracy": 0.20241115838289261, "num_tokens": 38627030.0, "step": 22260 }, { "entropy": 5.613210582733155, "epoch": 1.7323088893211438, "grad_norm": 1.1640625, "learning_rate": 0.00046982614583039584, "loss": 5.1101, "mean_token_accuracy": 0.19282882660627365, "num_tokens": 38635761.0, "step": 22265 }, { "entropy": 5.59949631690979, "epoch": 1.7326979186928613, "grad_norm": 1.234375, "learning_rate": 0.0004698122802515359, "loss": 5.0242, "mean_token_accuracy": 0.20301603823900222, "num_tokens": 38643952.0, "step": 22270 }, { "entropy": 5.5842907428741455, "epoch": 1.733086948064579, "grad_norm": 1.0625, "learning_rate": 0.0004697984117167097, "loss": 5.0179, "mean_token_accuracy": 0.20825313925743102, "num_tokens": 38651888.0, "step": 22275 }, { "entropy": 5.6038501262664795, "epoch": 1.7334759774362964, "grad_norm": 1.078125, "learning_rate": 0.00046978454022612767, "loss": 5.1298, "mean_token_accuracy": 0.1899837389588356, "num_tokens": 38660466.0, "step": 22280 }, { "entropy": 5.667847728729248, "epoch": 1.733865006808014, "grad_norm": 1.15625, "learning_rate": 0.00046977066578000025, "loss": 5.0579, "mean_token_accuracy": 0.19077258259058, "num_tokens": 38668429.0, "step": 22285 }, { "entropy": 5.609749889373779, "epoch": 1.7342540361797316, "grad_norm": 1.1171875, "learning_rate": 0.00046975678837853806, "loss": 5.094, "mean_token_accuracy": 0.19886521697044374, "num_tokens": 38676391.0, "step": 22290 }, { "entropy": 5.659933376312256, "epoch": 1.734643065551449, "grad_norm": 1.1875, "learning_rate": 0.00046974290802195156, "loss": 5.1185, "mean_token_accuracy": 0.19562934041023256, "num_tokens": 38684662.0, "step": 22295 }, { "entropy": 5.62083625793457, "epoch": 1.7350320949231666, "grad_norm": 1.1953125, "learning_rate": 0.0004697290247104513, "loss": 5.0286, "mean_token_accuracy": 0.19954266399145126, "num_tokens": 38693497.0, "step": 22300 }, { "entropy": 5.56356406211853, "epoch": 1.7354211242948843, "grad_norm": 1.1171875, "learning_rate": 0.00046971513844424814, "loss": 4.9531, "mean_token_accuracy": 0.19957490265369415, "num_tokens": 38701898.0, "step": 22305 }, { "entropy": 5.643318223953247, "epoch": 1.735810153666602, "grad_norm": 1.0859375, "learning_rate": 0.00046970124922355265, "loss": 5.0555, "mean_token_accuracy": 0.18825971335172653, "num_tokens": 38710910.0, "step": 22310 }, { "entropy": 5.694197130203247, "epoch": 1.7361991830383194, "grad_norm": 1.078125, "learning_rate": 0.0004696873570485756, "loss": 5.0827, "mean_token_accuracy": 0.19576985538005828, "num_tokens": 38719612.0, "step": 22315 }, { "entropy": 5.528113794326782, "epoch": 1.736588212410037, "grad_norm": 1.2734375, "learning_rate": 0.0004696734619195278, "loss": 5.0907, "mean_token_accuracy": 0.19007565826177597, "num_tokens": 38728332.0, "step": 22320 }, { "entropy": 5.574601173400879, "epoch": 1.7369772417817546, "grad_norm": 1.171875, "learning_rate": 0.00046965956383662, "loss": 5.0859, "mean_token_accuracy": 0.19510444402694702, "num_tokens": 38736830.0, "step": 22325 }, { "entropy": 5.604850769042969, "epoch": 1.737366271153472, "grad_norm": 1.140625, "learning_rate": 0.0004696456628000632, "loss": 5.0362, "mean_token_accuracy": 0.2006410077214241, "num_tokens": 38745972.0, "step": 22330 }, { "entropy": 5.559756088256836, "epoch": 1.7377553005251896, "grad_norm": 1.046875, "learning_rate": 0.00046963175881006825, "loss": 4.9498, "mean_token_accuracy": 0.19907765388488768, "num_tokens": 38754287.0, "step": 22335 }, { "entropy": 5.546706104278565, "epoch": 1.7381443298969073, "grad_norm": 1.1171875, "learning_rate": 0.0004696178518668462, "loss": 5.0418, "mean_token_accuracy": 0.19988638758659363, "num_tokens": 38763212.0, "step": 22340 }, { "entropy": 5.546993970870972, "epoch": 1.7385333592686247, "grad_norm": 1.078125, "learning_rate": 0.00046960394197060804, "loss": 4.8936, "mean_token_accuracy": 0.2084486588835716, "num_tokens": 38771668.0, "step": 22345 }, { "entropy": 5.648617267608643, "epoch": 1.7389223886403422, "grad_norm": 1.125, "learning_rate": 0.00046959002912156473, "loss": 5.0988, "mean_token_accuracy": 0.19357325583696366, "num_tokens": 38781184.0, "step": 22350 }, { "entropy": 5.6344352722167965, "epoch": 1.73931141801206, "grad_norm": 1.1484375, "learning_rate": 0.0004695761133199275, "loss": 4.917, "mean_token_accuracy": 0.2104213982820511, "num_tokens": 38789622.0, "step": 22355 }, { "entropy": 5.596429920196533, "epoch": 1.7397004473837776, "grad_norm": 1.0625, "learning_rate": 0.0004695621945659074, "loss": 5.0441, "mean_token_accuracy": 0.20274812281131743, "num_tokens": 38798250.0, "step": 22360 }, { "entropy": 5.616594743728638, "epoch": 1.740089476755495, "grad_norm": 1.1328125, "learning_rate": 0.0004695482728597157, "loss": 5.0445, "mean_token_accuracy": 0.20269137024879455, "num_tokens": 38807724.0, "step": 22365 }, { "entropy": 5.61951642036438, "epoch": 1.7404785061272126, "grad_norm": 1.1875, "learning_rate": 0.00046953434820156363, "loss": 5.0777, "mean_token_accuracy": 0.1992771342396736, "num_tokens": 38816017.0, "step": 22370 }, { "entropy": 5.608001375198365, "epoch": 1.7408675354989303, "grad_norm": 1.1328125, "learning_rate": 0.0004695204205916624, "loss": 5.0015, "mean_token_accuracy": 0.20552227795124053, "num_tokens": 38824976.0, "step": 22375 }, { "entropy": 5.5165809154510494, "epoch": 1.7412565648706477, "grad_norm": 1.109375, "learning_rate": 0.0004695064900302235, "loss": 5.0055, "mean_token_accuracy": 0.20170149803161622, "num_tokens": 38834358.0, "step": 22380 }, { "entropy": 5.6012310028076175, "epoch": 1.7416455942423652, "grad_norm": 1.1015625, "learning_rate": 0.0004694925565174581, "loss": 5.0792, "mean_token_accuracy": 0.19200721830129625, "num_tokens": 38842801.0, "step": 22385 }, { "entropy": 5.645043992996216, "epoch": 1.742034623614083, "grad_norm": 1.078125, "learning_rate": 0.00046947862005357777, "loss": 5.1012, "mean_token_accuracy": 0.19482589811086654, "num_tokens": 38851335.0, "step": 22390 }, { "entropy": 5.660744142532349, "epoch": 1.7424236529858004, "grad_norm": 1.1953125, "learning_rate": 0.0004694646806387939, "loss": 5.0826, "mean_token_accuracy": 0.1954297289252281, "num_tokens": 38860074.0, "step": 22395 }, { "entropy": 5.637555456161499, "epoch": 1.7428126823575179, "grad_norm": 1.125, "learning_rate": 0.0004694507382733181, "loss": 5.0259, "mean_token_accuracy": 0.2021038070321083, "num_tokens": 38868319.0, "step": 22400 }, { "entropy": 5.588654565811157, "epoch": 1.7432017117292355, "grad_norm": 1.0703125, "learning_rate": 0.0004694367929573618, "loss": 5.0803, "mean_token_accuracy": 0.1999653846025467, "num_tokens": 38876971.0, "step": 22405 }, { "entropy": 5.630432987213135, "epoch": 1.7435907411009532, "grad_norm": 1.0703125, "learning_rate": 0.0004694228446911367, "loss": 5.1878, "mean_token_accuracy": 0.18869855552911757, "num_tokens": 38886032.0, "step": 22410 }, { "entropy": 5.645307350158691, "epoch": 1.7439797704726707, "grad_norm": 1.1484375, "learning_rate": 0.0004694088934748542, "loss": 5.0671, "mean_token_accuracy": 0.19467164278030397, "num_tokens": 38894505.0, "step": 22415 }, { "entropy": 5.537402534484864, "epoch": 1.7443687998443882, "grad_norm": 1.0703125, "learning_rate": 0.0004693949393087263, "loss": 4.95, "mean_token_accuracy": 0.20585042834281922, "num_tokens": 38903450.0, "step": 22420 }, { "entropy": 5.590451955795288, "epoch": 1.744757829216106, "grad_norm": 1.1875, "learning_rate": 0.0004693809821929647, "loss": 5.0233, "mean_token_accuracy": 0.20420485585927964, "num_tokens": 38911326.0, "step": 22425 }, { "entropy": 5.591879177093506, "epoch": 1.7451468585878234, "grad_norm": 1.1875, "learning_rate": 0.000469367022127781, "loss": 5.0018, "mean_token_accuracy": 0.20439279526472093, "num_tokens": 38920035.0, "step": 22430 }, { "entropy": 5.670028781890869, "epoch": 1.7455358879595408, "grad_norm": 1.1015625, "learning_rate": 0.00046935305911338703, "loss": 5.0512, "mean_token_accuracy": 0.20086601823568345, "num_tokens": 38928542.0, "step": 22435 }, { "entropy": 5.643867158889771, "epoch": 1.7459249173312585, "grad_norm": 1.2734375, "learning_rate": 0.0004693390931499948, "loss": 5.0275, "mean_token_accuracy": 0.2061782792210579, "num_tokens": 38937486.0, "step": 22440 }, { "entropy": 5.568481349945069, "epoch": 1.7463139467029762, "grad_norm": 1.1171875, "learning_rate": 0.0004693251242378162, "loss": 5.0027, "mean_token_accuracy": 0.19874008148908615, "num_tokens": 38946171.0, "step": 22445 }, { "entropy": 5.569016170501709, "epoch": 1.7467029760746935, "grad_norm": 1.125, "learning_rate": 0.00046931115237706304, "loss": 4.9827, "mean_token_accuracy": 0.205603688955307, "num_tokens": 38954214.0, "step": 22450 }, { "entropy": 5.667104768753052, "epoch": 1.7470920054464112, "grad_norm": 1.1875, "learning_rate": 0.0004692971775679475, "loss": 5.1099, "mean_token_accuracy": 0.1946333110332489, "num_tokens": 38962102.0, "step": 22455 }, { "entropy": 5.6093361377716064, "epoch": 1.7474810348181289, "grad_norm": 1.15625, "learning_rate": 0.00046928319981068154, "loss": 4.9991, "mean_token_accuracy": 0.20610856562852858, "num_tokens": 38970472.0, "step": 22460 }, { "entropy": 5.593619251251221, "epoch": 1.7478700641898464, "grad_norm": 1.03125, "learning_rate": 0.0004692692191054773, "loss": 5.007, "mean_token_accuracy": 0.198609159886837, "num_tokens": 38979151.0, "step": 22465 }, { "entropy": 5.6189124584198, "epoch": 1.7482590935615638, "grad_norm": 1.1796875, "learning_rate": 0.0004692552354525468, "loss": 5.0227, "mean_token_accuracy": 0.2050039827823639, "num_tokens": 38987044.0, "step": 22470 }, { "entropy": 5.639458656311035, "epoch": 1.7486481229332815, "grad_norm": 1.125, "learning_rate": 0.0004692412488521023, "loss": 5.1109, "mean_token_accuracy": 0.19575731605291366, "num_tokens": 38995882.0, "step": 22475 }, { "entropy": 5.634156799316406, "epoch": 1.749037152304999, "grad_norm": 1.1484375, "learning_rate": 0.000469227259304356, "loss": 5.0885, "mean_token_accuracy": 0.1943669930100441, "num_tokens": 39004456.0, "step": 22480 }, { "entropy": 5.655064964294434, "epoch": 1.7494261816767165, "grad_norm": 1.234375, "learning_rate": 0.00046921326680952023, "loss": 5.0838, "mean_token_accuracy": 0.19592771977186202, "num_tokens": 39013363.0, "step": 22485 }, { "entropy": 5.629821681976319, "epoch": 1.7498152110484342, "grad_norm": 1.1640625, "learning_rate": 0.0004691992713678072, "loss": 5.0222, "mean_token_accuracy": 0.19379271268844606, "num_tokens": 39022116.0, "step": 22490 }, { "entropy": 5.646989727020264, "epoch": 1.7502042404201519, "grad_norm": 1.1171875, "learning_rate": 0.0004691852729794293, "loss": 5.0681, "mean_token_accuracy": 0.19597260504961014, "num_tokens": 39030737.0, "step": 22495 }, { "entropy": 5.540401983261108, "epoch": 1.7505932697918691, "grad_norm": 1.078125, "learning_rate": 0.0004691712716445991, "loss": 5.0043, "mean_token_accuracy": 0.2041274443268776, "num_tokens": 39039511.0, "step": 22500 }, { "entropy": 5.579356002807617, "epoch": 1.7509822991635868, "grad_norm": 1.046875, "learning_rate": 0.0004691572673635288, "loss": 4.9906, "mean_token_accuracy": 0.20141568630933762, "num_tokens": 39048745.0, "step": 22505 }, { "entropy": 5.60628981590271, "epoch": 1.7513713285353045, "grad_norm": 1.125, "learning_rate": 0.000469143260136431, "loss": 5.0471, "mean_token_accuracy": 0.19634879231452942, "num_tokens": 39057311.0, "step": 22510 }, { "entropy": 5.653366231918335, "epoch": 1.751760357907022, "grad_norm": 1.21875, "learning_rate": 0.0004691292499635183, "loss": 5.0523, "mean_token_accuracy": 0.1989838108420372, "num_tokens": 39065630.0, "step": 22515 }, { "entropy": 5.596651029586792, "epoch": 1.7521493872787395, "grad_norm": 1.21875, "learning_rate": 0.0004691152368450032, "loss": 5.0306, "mean_token_accuracy": 0.19707998633384705, "num_tokens": 39074284.0, "step": 22520 }, { "entropy": 5.5885388374328615, "epoch": 1.7525384166504572, "grad_norm": 1.1640625, "learning_rate": 0.00046910122078109835, "loss": 5.0698, "mean_token_accuracy": 0.20055524557828902, "num_tokens": 39083284.0, "step": 22525 }, { "entropy": 5.619153833389282, "epoch": 1.7529274460221747, "grad_norm": 1.171875, "learning_rate": 0.0004690872017720163, "loss": 5.0133, "mean_token_accuracy": 0.1996849834918976, "num_tokens": 39091106.0, "step": 22530 }, { "entropy": 5.57690019607544, "epoch": 1.7533164753938921, "grad_norm": 1.109375, "learning_rate": 0.00046907317981797006, "loss": 4.9756, "mean_token_accuracy": 0.2090426951646805, "num_tokens": 39100499.0, "step": 22535 }, { "entropy": 5.5911579608917235, "epoch": 1.7537055047656098, "grad_norm": 1.234375, "learning_rate": 0.00046905915491917213, "loss": 5.0821, "mean_token_accuracy": 0.20066258311271667, "num_tokens": 39108895.0, "step": 22540 }, { "entropy": 5.495044898986817, "epoch": 1.7540945341373275, "grad_norm": 1.171875, "learning_rate": 0.0004690451270758354, "loss": 4.9048, "mean_token_accuracy": 0.2153760552406311, "num_tokens": 39117053.0, "step": 22545 }, { "entropy": 5.568610048294067, "epoch": 1.7544835635090448, "grad_norm": 1.1484375, "learning_rate": 0.00046903109628817276, "loss": 5.0534, "mean_token_accuracy": 0.20147743821144104, "num_tokens": 39125750.0, "step": 22550 }, { "entropy": 5.5849977970123295, "epoch": 1.7548725928807625, "grad_norm": 1.1171875, "learning_rate": 0.00046901706255639703, "loss": 4.9462, "mean_token_accuracy": 0.20114147067070007, "num_tokens": 39134105.0, "step": 22555 }, { "entropy": 5.678500318527222, "epoch": 1.7552616222524802, "grad_norm": 1.1171875, "learning_rate": 0.0004690030258807212, "loss": 5.1723, "mean_token_accuracy": 0.1943366050720215, "num_tokens": 39143543.0, "step": 22560 }, { "entropy": 5.632915782928467, "epoch": 1.7556506516241976, "grad_norm": 1.09375, "learning_rate": 0.00046898898626135827, "loss": 5.0823, "mean_token_accuracy": 0.19686102569103242, "num_tokens": 39152826.0, "step": 22565 }, { "entropy": 5.644354963302613, "epoch": 1.7560396809959151, "grad_norm": 1.1328125, "learning_rate": 0.0004689749436985211, "loss": 5.0163, "mean_token_accuracy": 0.19635111838579178, "num_tokens": 39160999.0, "step": 22570 }, { "entropy": 5.596626615524292, "epoch": 1.7564287103676328, "grad_norm": 1.1328125, "learning_rate": 0.00046896089819242304, "loss": 5.0374, "mean_token_accuracy": 0.1989995300769806, "num_tokens": 39169134.0, "step": 22575 }, { "entropy": 5.5564216613769535, "epoch": 1.7568177397393503, "grad_norm": 1.1875, "learning_rate": 0.0004689468497432771, "loss": 4.9663, "mean_token_accuracy": 0.20608423054218292, "num_tokens": 39177545.0, "step": 22580 }, { "entropy": 5.526233911514282, "epoch": 1.7572067691110678, "grad_norm": 1.0859375, "learning_rate": 0.0004689327983512963, "loss": 4.963, "mean_token_accuracy": 0.20416284203529358, "num_tokens": 39185671.0, "step": 22585 }, { "entropy": 5.623147439956665, "epoch": 1.7575957984827855, "grad_norm": 1.15625, "learning_rate": 0.00046891874401669404, "loss": 5.0691, "mean_token_accuracy": 0.19441256523132325, "num_tokens": 39194420.0, "step": 22590 }, { "entropy": 5.5846587181091305, "epoch": 1.7579848278545032, "grad_norm": 1.1640625, "learning_rate": 0.0004689046867396834, "loss": 5.0355, "mean_token_accuracy": 0.20097713321447372, "num_tokens": 39203295.0, "step": 22595 }, { "entropy": 5.57073450088501, "epoch": 1.7583738572262204, "grad_norm": 1.15625, "learning_rate": 0.0004688906265204779, "loss": 5.0039, "mean_token_accuracy": 0.20170579850673676, "num_tokens": 39211838.0, "step": 22600 }, { "entropy": 5.5970799922943115, "epoch": 1.7587628865979381, "grad_norm": 1.1953125, "learning_rate": 0.0004688765633592907, "loss": 4.9557, "mean_token_accuracy": 0.19745771437883378, "num_tokens": 39219842.0, "step": 22605 }, { "entropy": 5.598355388641357, "epoch": 1.7591519159696558, "grad_norm": 1.2578125, "learning_rate": 0.0004688624972563352, "loss": 5.0399, "mean_token_accuracy": 0.2036769151687622, "num_tokens": 39228167.0, "step": 22610 }, { "entropy": 5.599769020080567, "epoch": 1.7595409453413733, "grad_norm": 1.171875, "learning_rate": 0.0004688484282118249, "loss": 5.0695, "mean_token_accuracy": 0.19434430301189423, "num_tokens": 39236546.0, "step": 22615 }, { "entropy": 5.628187561035157, "epoch": 1.7599299747130908, "grad_norm": 1.15625, "learning_rate": 0.0004688343562259732, "loss": 5.0266, "mean_token_accuracy": 0.21023571342229844, "num_tokens": 39244212.0, "step": 22620 }, { "entropy": 5.57353982925415, "epoch": 1.7603190040848085, "grad_norm": 1.0625, "learning_rate": 0.0004688202812989937, "loss": 4.9773, "mean_token_accuracy": 0.20005138516426085, "num_tokens": 39252892.0, "step": 22625 }, { "entropy": 5.518619537353516, "epoch": 1.760708033456526, "grad_norm": 1.0703125, "learning_rate": 0.0004688062034311, "loss": 4.9865, "mean_token_accuracy": 0.20543958991765976, "num_tokens": 39262261.0, "step": 22630 }, { "entropy": 5.663486766815185, "epoch": 1.7610970628282434, "grad_norm": 1.1796875, "learning_rate": 0.00046879212262250546, "loss": 4.9926, "mean_token_accuracy": 0.20394974201917648, "num_tokens": 39270790.0, "step": 22635 }, { "entropy": 5.575260305404663, "epoch": 1.761486092199961, "grad_norm": 1.046875, "learning_rate": 0.00046877803887342406, "loss": 5.0225, "mean_token_accuracy": 0.1949983537197113, "num_tokens": 39278825.0, "step": 22640 }, { "entropy": 5.576007223129272, "epoch": 1.7618751215716788, "grad_norm": 1.109375, "learning_rate": 0.0004687639521840693, "loss": 5.0474, "mean_token_accuracy": 0.1980804458260536, "num_tokens": 39288343.0, "step": 22645 }, { "entropy": 5.659196376800537, "epoch": 1.7622641509433963, "grad_norm": 1.1484375, "learning_rate": 0.00046874986255465495, "loss": 5.0967, "mean_token_accuracy": 0.1918367937207222, "num_tokens": 39296562.0, "step": 22650 }, { "entropy": 5.634815788269043, "epoch": 1.7626531803151138, "grad_norm": 1.109375, "learning_rate": 0.00046873576998539485, "loss": 5.0294, "mean_token_accuracy": 0.20166292786598206, "num_tokens": 39305433.0, "step": 22655 }, { "entropy": 5.5899412631988525, "epoch": 1.7630422096868315, "grad_norm": 1.2109375, "learning_rate": 0.0004687216744765028, "loss": 5.0789, "mean_token_accuracy": 0.19518734514713287, "num_tokens": 39313244.0, "step": 22660 }, { "entropy": 5.612711429595947, "epoch": 1.763431239058549, "grad_norm": 1.1015625, "learning_rate": 0.0004687075760281927, "loss": 5.1086, "mean_token_accuracy": 0.19625287652015685, "num_tokens": 39321933.0, "step": 22665 }, { "entropy": 5.649619102478027, "epoch": 1.7638202684302664, "grad_norm": 1.09375, "learning_rate": 0.0004686934746406784, "loss": 5.0933, "mean_token_accuracy": 0.19609906375408173, "num_tokens": 39331194.0, "step": 22670 }, { "entropy": 5.6349564552307125, "epoch": 1.764209297801984, "grad_norm": 1.140625, "learning_rate": 0.00046867937031417397, "loss": 5.0216, "mean_token_accuracy": 0.19185345470905305, "num_tokens": 39339762.0, "step": 22675 }, { "entropy": 5.62233533859253, "epoch": 1.7645983271737016, "grad_norm": 1.125, "learning_rate": 0.0004686652630488933, "loss": 5.0837, "mean_token_accuracy": 0.19635004699230194, "num_tokens": 39349020.0, "step": 22680 }, { "entropy": 5.647264099121093, "epoch": 1.764987356545419, "grad_norm": 1.0625, "learning_rate": 0.00046865115284505063, "loss": 5.1985, "mean_token_accuracy": 0.19042479991912842, "num_tokens": 39357889.0, "step": 22685 }, { "entropy": 5.623248291015625, "epoch": 1.7653763859171367, "grad_norm": 1.1328125, "learning_rate": 0.00046863703970285986, "loss": 5.0425, "mean_token_accuracy": 0.20385863333940507, "num_tokens": 39366120.0, "step": 22690 }, { "entropy": 5.573195838928223, "epoch": 1.7657654152888544, "grad_norm": 1.1875, "learning_rate": 0.0004686229236225352, "loss": 4.9005, "mean_token_accuracy": 0.20845931768417358, "num_tokens": 39374056.0, "step": 22695 }, { "entropy": 5.6141985893249515, "epoch": 1.766154444660572, "grad_norm": 1.2421875, "learning_rate": 0.0004686088046042909, "loss": 5.0953, "mean_token_accuracy": 0.20028726011514664, "num_tokens": 39383170.0, "step": 22700 }, { "entropy": 5.642220067977905, "epoch": 1.7665434740322894, "grad_norm": 1.0859375, "learning_rate": 0.00046859468264834114, "loss": 5.052, "mean_token_accuracy": 0.1978157326579094, "num_tokens": 39391599.0, "step": 22705 }, { "entropy": 5.667730617523193, "epoch": 1.766932503404007, "grad_norm": 1.0703125, "learning_rate": 0.00046858055775490017, "loss": 5.1157, "mean_token_accuracy": 0.1912381947040558, "num_tokens": 39400217.0, "step": 22710 }, { "entropy": 5.634783124923706, "epoch": 1.7673215327757246, "grad_norm": 1.140625, "learning_rate": 0.0004685664299241825, "loss": 5.0773, "mean_token_accuracy": 0.19763258397579192, "num_tokens": 39408943.0, "step": 22715 }, { "entropy": 5.600749731063843, "epoch": 1.767710562147442, "grad_norm": 1.15625, "learning_rate": 0.0004685522991564022, "loss": 5.0504, "mean_token_accuracy": 0.19625486582517623, "num_tokens": 39417361.0, "step": 22720 }, { "entropy": 5.458284902572632, "epoch": 1.7680995915191597, "grad_norm": 1.0859375, "learning_rate": 0.0004685381654517738, "loss": 4.8243, "mean_token_accuracy": 0.20876730978488922, "num_tokens": 39425896.0, "step": 22725 }, { "entropy": 5.565588808059692, "epoch": 1.7684886208908772, "grad_norm": 1.109375, "learning_rate": 0.0004685240288105119, "loss": 5.0454, "mean_token_accuracy": 0.200260753929615, "num_tokens": 39434719.0, "step": 22730 }, { "entropy": 5.666944313049316, "epoch": 1.7688776502625947, "grad_norm": 1.078125, "learning_rate": 0.00046850988923283085, "loss": 4.9965, "mean_token_accuracy": 0.1937894657254219, "num_tokens": 39443731.0, "step": 22735 }, { "entropy": 5.678437948226929, "epoch": 1.7692666796343124, "grad_norm": 1.1640625, "learning_rate": 0.00046849574671894523, "loss": 5.1309, "mean_token_accuracy": 0.19329984486103058, "num_tokens": 39452430.0, "step": 22740 }, { "entropy": 5.625412464141846, "epoch": 1.76965570900603, "grad_norm": 1.171875, "learning_rate": 0.00046848160126906956, "loss": 4.9652, "mean_token_accuracy": 0.2029428616166115, "num_tokens": 39460560.0, "step": 22745 }, { "entropy": 5.627378797531128, "epoch": 1.7700447383777476, "grad_norm": 1.171875, "learning_rate": 0.0004684674528834186, "loss": 5.0744, "mean_token_accuracy": 0.191386079788208, "num_tokens": 39469575.0, "step": 22750 }, { "entropy": 5.6196142673492435, "epoch": 1.770433767749465, "grad_norm": 1.0546875, "learning_rate": 0.00046845330156220703, "loss": 5.021, "mean_token_accuracy": 0.19839163720607758, "num_tokens": 39478297.0, "step": 22755 }, { "entropy": 5.645691633224487, "epoch": 1.7708227971211827, "grad_norm": 1.1484375, "learning_rate": 0.0004684391473056495, "loss": 5.0761, "mean_token_accuracy": 0.1898277521133423, "num_tokens": 39486947.0, "step": 22760 }, { "entropy": 5.60515456199646, "epoch": 1.7712118264929002, "grad_norm": 1.109375, "learning_rate": 0.00046842499011396076, "loss": 5.0657, "mean_token_accuracy": 0.19864821285009385, "num_tokens": 39495649.0, "step": 22765 }, { "entropy": 5.594310903549195, "epoch": 1.7716008558646177, "grad_norm": 1.1484375, "learning_rate": 0.00046841082998735575, "loss": 5.0462, "mean_token_accuracy": 0.19947129040956496, "num_tokens": 39504733.0, "step": 22770 }, { "entropy": 5.540005302429199, "epoch": 1.7719898852363354, "grad_norm": 1.203125, "learning_rate": 0.00046839666692604916, "loss": 5.0624, "mean_token_accuracy": 0.2006792962551117, "num_tokens": 39513007.0, "step": 22775 }, { "entropy": 5.633224582672119, "epoch": 1.7723789146080529, "grad_norm": 1.1171875, "learning_rate": 0.000468382500930256, "loss": 5.1201, "mean_token_accuracy": 0.2007109686732292, "num_tokens": 39521734.0, "step": 22780 }, { "entropy": 5.701960563659668, "epoch": 1.7727679439797703, "grad_norm": 1.109375, "learning_rate": 0.00046836833200019116, "loss": 5.0764, "mean_token_accuracy": 0.19472802728414534, "num_tokens": 39530525.0, "step": 22785 }, { "entropy": 5.6697639465332035, "epoch": 1.773156973351488, "grad_norm": 1.0390625, "learning_rate": 0.0004683541601360697, "loss": 5.0366, "mean_token_accuracy": 0.20655926167964936, "num_tokens": 39538938.0, "step": 22790 }, { "entropy": 5.530665302276612, "epoch": 1.7735460027232057, "grad_norm": 1.125, "learning_rate": 0.00046833998533810653, "loss": 4.9161, "mean_token_accuracy": 0.212406724691391, "num_tokens": 39547342.0, "step": 22795 }, { "entropy": 5.540967893600464, "epoch": 1.7739350320949232, "grad_norm": 1.2421875, "learning_rate": 0.0004683258076065169, "loss": 5.0079, "mean_token_accuracy": 0.1990111768245697, "num_tokens": 39555107.0, "step": 22800 }, { "entropy": 5.657979345321655, "epoch": 1.7743240614666407, "grad_norm": 1.1015625, "learning_rate": 0.00046831162694151586, "loss": 5.0456, "mean_token_accuracy": 0.19519894272089006, "num_tokens": 39563226.0, "step": 22805 }, { "entropy": 5.668812370300293, "epoch": 1.7747130908383584, "grad_norm": 1.1875, "learning_rate": 0.00046829744334331855, "loss": 5.0914, "mean_token_accuracy": 0.19292182326316834, "num_tokens": 39571689.0, "step": 22810 }, { "entropy": 5.595006513595581, "epoch": 1.7751021202100759, "grad_norm": 1.109375, "learning_rate": 0.00046828325681214013, "loss": 4.9946, "mean_token_accuracy": 0.2010815978050232, "num_tokens": 39579985.0, "step": 22815 }, { "entropy": 5.6521299362182615, "epoch": 1.7754911495817933, "grad_norm": 1.1640625, "learning_rate": 0.000468269067348196, "loss": 5.0817, "mean_token_accuracy": 0.1918988734483719, "num_tokens": 39587892.0, "step": 22820 }, { "entropy": 5.605572319030761, "epoch": 1.775880178953511, "grad_norm": 1.1328125, "learning_rate": 0.0004682548749517014, "loss": 5.1276, "mean_token_accuracy": 0.19191844761371613, "num_tokens": 39597516.0, "step": 22825 }, { "entropy": 5.6693127155303955, "epoch": 1.7762692083252287, "grad_norm": 1.2109375, "learning_rate": 0.00046824067962287163, "loss": 5.0541, "mean_token_accuracy": 0.19577430039644242, "num_tokens": 39605860.0, "step": 22830 }, { "entropy": 5.651174640655517, "epoch": 1.776658237696946, "grad_norm": 1.109375, "learning_rate": 0.0004682264813619221, "loss": 5.0953, "mean_token_accuracy": 0.1933155834674835, "num_tokens": 39614915.0, "step": 22835 }, { "entropy": 5.671973800659179, "epoch": 1.7770472670686637, "grad_norm": 1.1875, "learning_rate": 0.00046821228016906836, "loss": 5.08, "mean_token_accuracy": 0.19473095536231994, "num_tokens": 39623588.0, "step": 22840 }, { "entropy": 5.642302560806274, "epoch": 1.7774362964403814, "grad_norm": 1.1328125, "learning_rate": 0.0004681980760445257, "loss": 5.1145, "mean_token_accuracy": 0.19429944306612015, "num_tokens": 39632351.0, "step": 22845 }, { "entropy": 5.585865449905396, "epoch": 1.7778253258120988, "grad_norm": 1.1015625, "learning_rate": 0.0004681838689885098, "loss": 5.0398, "mean_token_accuracy": 0.1958810046315193, "num_tokens": 39641053.0, "step": 22850 }, { "entropy": 5.5364038944244385, "epoch": 1.7782143551838163, "grad_norm": 1.1171875, "learning_rate": 0.0004681696590012362, "loss": 4.9106, "mean_token_accuracy": 0.20308592915534973, "num_tokens": 39649838.0, "step": 22855 }, { "entropy": 5.576603555679322, "epoch": 1.778603384555534, "grad_norm": 1.03125, "learning_rate": 0.00046815544608292043, "loss": 4.967, "mean_token_accuracy": 0.20008801072835922, "num_tokens": 39658886.0, "step": 22860 }, { "entropy": 5.691499137878418, "epoch": 1.7789924139272515, "grad_norm": 1.2265625, "learning_rate": 0.0004681412302337782, "loss": 5.0557, "mean_token_accuracy": 0.20158895701169968, "num_tokens": 39667279.0, "step": 22865 }, { "entropy": 5.624933862686158, "epoch": 1.779381443298969, "grad_norm": 1.0625, "learning_rate": 0.0004681270114540252, "loss": 5.0134, "mean_token_accuracy": 0.19467032551765442, "num_tokens": 39676213.0, "step": 22870 }, { "entropy": 5.601568651199341, "epoch": 1.7797704726706867, "grad_norm": 1.0546875, "learning_rate": 0.0004681127897438772, "loss": 5.0294, "mean_token_accuracy": 0.20394955724477767, "num_tokens": 39685859.0, "step": 22875 }, { "entropy": 5.55711145401001, "epoch": 1.7801595020424044, "grad_norm": 1.125, "learning_rate": 0.00046809856510355007, "loss": 4.9826, "mean_token_accuracy": 0.19908798933029176, "num_tokens": 39695240.0, "step": 22880 }, { "entropy": 5.596227693557739, "epoch": 1.7805485314141216, "grad_norm": 1.1484375, "learning_rate": 0.0004680843375332595, "loss": 5.0131, "mean_token_accuracy": 0.20044682323932647, "num_tokens": 39704441.0, "step": 22885 }, { "entropy": 5.653948593139648, "epoch": 1.7809375607858393, "grad_norm": 1.09375, "learning_rate": 0.00046807010703322143, "loss": 5.0979, "mean_token_accuracy": 0.1952974244952202, "num_tokens": 39714074.0, "step": 22890 }, { "entropy": 5.6840585231781, "epoch": 1.781326590157557, "grad_norm": 1.1328125, "learning_rate": 0.0004680558736036518, "loss": 5.0964, "mean_token_accuracy": 0.18880397081375122, "num_tokens": 39722527.0, "step": 22895 }, { "entropy": 5.6040940284729, "epoch": 1.7817156195292745, "grad_norm": 1.1015625, "learning_rate": 0.0004680416372447666, "loss": 5.0639, "mean_token_accuracy": 0.1970113381743431, "num_tokens": 39730983.0, "step": 22900 }, { "entropy": 5.651010656356812, "epoch": 1.782104648900992, "grad_norm": 1.0, "learning_rate": 0.00046802739795678177, "loss": 5.125, "mean_token_accuracy": 0.1908239856362343, "num_tokens": 39741114.0, "step": 22905 }, { "entropy": 5.6625007629394535, "epoch": 1.7824936782727097, "grad_norm": 1.1015625, "learning_rate": 0.00046801315573991346, "loss": 5.0464, "mean_token_accuracy": 0.1930222764611244, "num_tokens": 39749281.0, "step": 22910 }, { "entropy": 5.6285501480102536, "epoch": 1.7828827076444271, "grad_norm": 1.046875, "learning_rate": 0.00046799891059437764, "loss": 4.8985, "mean_token_accuracy": 0.20783315747976303, "num_tokens": 39758136.0, "step": 22915 }, { "entropy": 5.6235088348388675, "epoch": 1.7832717370161446, "grad_norm": 1.03125, "learning_rate": 0.00046798466252039056, "loss": 5.1021, "mean_token_accuracy": 0.19807808399200438, "num_tokens": 39767104.0, "step": 22920 }, { "entropy": 5.623497056961059, "epoch": 1.7836607663878623, "grad_norm": 1.0625, "learning_rate": 0.00046797041151816845, "loss": 5.0435, "mean_token_accuracy": 0.19845814257860184, "num_tokens": 39775979.0, "step": 22925 }, { "entropy": 5.570397901535034, "epoch": 1.78404979575958, "grad_norm": 1.1796875, "learning_rate": 0.00046795615758792747, "loss": 4.9175, "mean_token_accuracy": 0.20559652149677277, "num_tokens": 39783740.0, "step": 22930 }, { "entropy": 5.58191146850586, "epoch": 1.7844388251312973, "grad_norm": 1.1015625, "learning_rate": 0.0004679419007298839, "loss": 5.0732, "mean_token_accuracy": 0.2063249483704567, "num_tokens": 39791836.0, "step": 22935 }, { "entropy": 5.6120329856872555, "epoch": 1.784827854503015, "grad_norm": 1.1484375, "learning_rate": 0.0004679276409442541, "loss": 4.9523, "mean_token_accuracy": 0.20041560679674147, "num_tokens": 39800694.0, "step": 22940 }, { "entropy": 5.6254487991333, "epoch": 1.7852168838747327, "grad_norm": 1.0859375, "learning_rate": 0.0004679133782312544, "loss": 5.096, "mean_token_accuracy": 0.1929268628358841, "num_tokens": 39809108.0, "step": 22945 }, { "entropy": 5.626142835617065, "epoch": 1.7856059132464501, "grad_norm": 1.2890625, "learning_rate": 0.0004678991125911013, "loss": 5.012, "mean_token_accuracy": 0.20093010514974594, "num_tokens": 39817608.0, "step": 22950 }, { "entropy": 5.6143653869628904, "epoch": 1.7859949426181676, "grad_norm": 1.0703125, "learning_rate": 0.0004678848440240111, "loss": 4.9932, "mean_token_accuracy": 0.20379202663898469, "num_tokens": 39826596.0, "step": 22955 }, { "entropy": 5.62457160949707, "epoch": 1.7863839719898853, "grad_norm": 1.1328125, "learning_rate": 0.0004678705725302005, "loss": 5.0036, "mean_token_accuracy": 0.20261845588684083, "num_tokens": 39834440.0, "step": 22960 }, { "entropy": 5.577974796295166, "epoch": 1.7867730013616028, "grad_norm": 1.1953125, "learning_rate": 0.0004678562981098859, "loss": 5.0394, "mean_token_accuracy": 0.19581038802862166, "num_tokens": 39842617.0, "step": 22965 }, { "entropy": 5.541540145874023, "epoch": 1.7871620307333203, "grad_norm": 1.078125, "learning_rate": 0.00046784202076328394, "loss": 4.9236, "mean_token_accuracy": 0.21402034610509874, "num_tokens": 39850688.0, "step": 22970 }, { "entropy": 5.639107084274292, "epoch": 1.787551060105038, "grad_norm": 1.125, "learning_rate": 0.00046782774049061124, "loss": 5.0285, "mean_token_accuracy": 0.20203219205141068, "num_tokens": 39859347.0, "step": 22975 }, { "entropy": 5.626650094985962, "epoch": 1.7879400894767556, "grad_norm": 1.21875, "learning_rate": 0.0004678134572920845, "loss": 5.0486, "mean_token_accuracy": 0.20277910977602004, "num_tokens": 39867090.0, "step": 22980 }, { "entropy": 5.600873327255249, "epoch": 1.788329118848473, "grad_norm": 1.21875, "learning_rate": 0.0004677991711679204, "loss": 4.9768, "mean_token_accuracy": 0.19873910248279572, "num_tokens": 39875653.0, "step": 22985 }, { "entropy": 5.579012441635132, "epoch": 1.7887181482201906, "grad_norm": 1.109375, "learning_rate": 0.00046778488211833585, "loss": 5.0785, "mean_token_accuracy": 0.1868377149105072, "num_tokens": 39884781.0, "step": 22990 }, { "entropy": 5.616987895965576, "epoch": 1.7891071775919083, "grad_norm": 1.2109375, "learning_rate": 0.0004677705901435475, "loss": 4.989, "mean_token_accuracy": 0.19915149807929994, "num_tokens": 39892619.0, "step": 22995 }, { "entropy": 5.60458779335022, "epoch": 1.7894962069636258, "grad_norm": 1.09375, "learning_rate": 0.0004677562952437723, "loss": 5.0388, "mean_token_accuracy": 0.19942351877689363, "num_tokens": 39901518.0, "step": 23000 }, { "entropy": 5.564075231552124, "epoch": 1.7898852363353432, "grad_norm": 1.140625, "learning_rate": 0.00046774199741922705, "loss": 5.009, "mean_token_accuracy": 0.20657718181610107, "num_tokens": 39909550.0, "step": 23005 }, { "entropy": 5.630869197845459, "epoch": 1.790274265707061, "grad_norm": 1.1171875, "learning_rate": 0.00046772769667012884, "loss": 5.0543, "mean_token_accuracy": 0.20022443532943726, "num_tokens": 39918177.0, "step": 23010 }, { "entropy": 5.565740537643433, "epoch": 1.7906632950787784, "grad_norm": 1.046875, "learning_rate": 0.0004677133929966946, "loss": 5.0278, "mean_token_accuracy": 0.19652449935674668, "num_tokens": 39926812.0, "step": 23015 }, { "entropy": 5.601274728775024, "epoch": 1.791052324450496, "grad_norm": 1.09375, "learning_rate": 0.00046769908639914134, "loss": 5.0504, "mean_token_accuracy": 0.19611463248729705, "num_tokens": 39934506.0, "step": 23020 }, { "entropy": 5.571135139465332, "epoch": 1.7914413538222136, "grad_norm": 1.15625, "learning_rate": 0.0004676847768776861, "loss": 5.0352, "mean_token_accuracy": 0.19622556120157242, "num_tokens": 39943252.0, "step": 23025 }, { "entropy": 5.601371479034424, "epoch": 1.7918303831939313, "grad_norm": 1.21875, "learning_rate": 0.0004676704644325462, "loss": 5.0533, "mean_token_accuracy": 0.19173599183559417, "num_tokens": 39952585.0, "step": 23030 }, { "entropy": 5.6437798023223875, "epoch": 1.7922194125656488, "grad_norm": 1.0390625, "learning_rate": 0.0004676561490639385, "loss": 5.028, "mean_token_accuracy": 0.20318491458892823, "num_tokens": 39961805.0, "step": 23035 }, { "entropy": 5.6433521747589115, "epoch": 1.7926084419373662, "grad_norm": 1.1875, "learning_rate": 0.0004676418307720805, "loss": 5.0475, "mean_token_accuracy": 0.19934434145689012, "num_tokens": 39970045.0, "step": 23040 }, { "entropy": 5.624087524414063, "epoch": 1.792997471309084, "grad_norm": 1.046875, "learning_rate": 0.0004676275095571892, "loss": 5.0028, "mean_token_accuracy": 0.19637718051671982, "num_tokens": 39979073.0, "step": 23045 }, { "entropy": 5.619755697250366, "epoch": 1.7933865006808014, "grad_norm": 1.078125, "learning_rate": 0.00046761318541948215, "loss": 5.0172, "mean_token_accuracy": 0.20024209916591645, "num_tokens": 39987936.0, "step": 23050 }, { "entropy": 5.570788288116455, "epoch": 1.7937755300525189, "grad_norm": 1.125, "learning_rate": 0.0004675988583591766, "loss": 5.0654, "mean_token_accuracy": 0.19561139345169068, "num_tokens": 39996547.0, "step": 23055 }, { "entropy": 5.650335264205933, "epoch": 1.7941645594242366, "grad_norm": 1.09375, "learning_rate": 0.00046758452837648997, "loss": 5.1175, "mean_token_accuracy": 0.18572988510131835, "num_tokens": 40005717.0, "step": 23060 }, { "entropy": 5.597995281219482, "epoch": 1.794553588795954, "grad_norm": 1.15625, "learning_rate": 0.0004675701954716395, "loss": 4.9347, "mean_token_accuracy": 0.2008672684431076, "num_tokens": 40014799.0, "step": 23065 }, { "entropy": 5.626538038253784, "epoch": 1.7949426181676715, "grad_norm": 1.0625, "learning_rate": 0.00046755585964484286, "loss": 5.0153, "mean_token_accuracy": 0.19307070970535278, "num_tokens": 40023899.0, "step": 23070 }, { "entropy": 5.593886375427246, "epoch": 1.7953316475393892, "grad_norm": 1.15625, "learning_rate": 0.0004675415208963177, "loss": 4.9996, "mean_token_accuracy": 0.19987461268901824, "num_tokens": 40032629.0, "step": 23075 }, { "entropy": 5.628398513793945, "epoch": 1.795720676911107, "grad_norm": 1.1484375, "learning_rate": 0.00046752717922628125, "loss": 5.0624, "mean_token_accuracy": 0.19932323545217515, "num_tokens": 40040575.0, "step": 23080 }, { "entropy": 5.617185640335083, "epoch": 1.7961097062828244, "grad_norm": 1.140625, "learning_rate": 0.0004675128346349514, "loss": 5.0757, "mean_token_accuracy": 0.1911105051636696, "num_tokens": 40049221.0, "step": 23085 }, { "entropy": 5.672586965560913, "epoch": 1.7964987356545419, "grad_norm": 1.109375, "learning_rate": 0.00046749848712254554, "loss": 5.0807, "mean_token_accuracy": 0.19315687716007232, "num_tokens": 40057737.0, "step": 23090 }, { "entropy": 5.60546727180481, "epoch": 1.7968877650262596, "grad_norm": 1.203125, "learning_rate": 0.00046748413668928164, "loss": 5.0153, "mean_token_accuracy": 0.20643457323312758, "num_tokens": 40066447.0, "step": 23095 }, { "entropy": 5.6184974193573, "epoch": 1.797276794397977, "grad_norm": 1.1328125, "learning_rate": 0.0004674697833353774, "loss": 5.0581, "mean_token_accuracy": 0.20104024261236192, "num_tokens": 40075825.0, "step": 23100 }, { "entropy": 5.641783428192139, "epoch": 1.7976658237696945, "grad_norm": 1.203125, "learning_rate": 0.00046745542706105045, "loss": 5.073, "mean_token_accuracy": 0.19856761544942855, "num_tokens": 40084342.0, "step": 23105 }, { "entropy": 5.69756326675415, "epoch": 1.7980548531414122, "grad_norm": 1.171875, "learning_rate": 0.00046744106786651875, "loss": 5.102, "mean_token_accuracy": 0.18726109713315964, "num_tokens": 40092650.0, "step": 23110 }, { "entropy": 5.59030327796936, "epoch": 1.7984438825131297, "grad_norm": 1.15625, "learning_rate": 0.0004674267057520001, "loss": 5.018, "mean_token_accuracy": 0.19619987905025482, "num_tokens": 40100738.0, "step": 23115 }, { "entropy": 5.527540636062622, "epoch": 1.7988329118848472, "grad_norm": 1.0859375, "learning_rate": 0.0004674123407177125, "loss": 4.9351, "mean_token_accuracy": 0.2041892796754837, "num_tokens": 40109213.0, "step": 23120 }, { "entropy": 5.556996297836304, "epoch": 1.7992219412565649, "grad_norm": 1.15625, "learning_rate": 0.00046739797276387394, "loss": 4.8714, "mean_token_accuracy": 0.21329150646924971, "num_tokens": 40117622.0, "step": 23125 }, { "entropy": 5.587526845932007, "epoch": 1.7996109706282826, "grad_norm": 1.0546875, "learning_rate": 0.00046738360189070235, "loss": 5.031, "mean_token_accuracy": 0.20028579980134964, "num_tokens": 40126347.0, "step": 23130 }, { "entropy": 5.7301088809967045, "epoch": 1.8, "grad_norm": 1.125, "learning_rate": 0.0004673692280984157, "loss": 5.1259, "mean_token_accuracy": 0.1872912347316742, "num_tokens": 40134245.0, "step": 23135 }, { "entropy": 5.662972831726075, "epoch": 1.8003890293717175, "grad_norm": 1.15625, "learning_rate": 0.0004673548513872324, "loss": 4.9784, "mean_token_accuracy": 0.1960213527083397, "num_tokens": 40142304.0, "step": 23140 }, { "entropy": 5.554538774490356, "epoch": 1.8007780587434352, "grad_norm": 1.203125, "learning_rate": 0.00046734047175737026, "loss": 4.9927, "mean_token_accuracy": 0.19602001309394837, "num_tokens": 40150999.0, "step": 23145 }, { "entropy": 5.609148168563843, "epoch": 1.8011670881151527, "grad_norm": 1.1953125, "learning_rate": 0.00046732608920904754, "loss": 5.0238, "mean_token_accuracy": 0.19934711903333663, "num_tokens": 40158659.0, "step": 23150 }, { "entropy": 5.575501251220703, "epoch": 1.8015561174868702, "grad_norm": 1.1953125, "learning_rate": 0.0004673117037424827, "loss": 4.9383, "mean_token_accuracy": 0.20738030970096588, "num_tokens": 40167343.0, "step": 23155 }, { "entropy": 5.598129558563232, "epoch": 1.8019451468585879, "grad_norm": 1.0859375, "learning_rate": 0.00046729731535789375, "loss": 5.0073, "mean_token_accuracy": 0.20140311419963836, "num_tokens": 40176433.0, "step": 23160 }, { "entropy": 5.6786088943481445, "epoch": 1.8023341762303053, "grad_norm": 1.359375, "learning_rate": 0.00046728292405549913, "loss": 5.0753, "mean_token_accuracy": 0.19956363886594772, "num_tokens": 40185826.0, "step": 23165 }, { "entropy": 5.600169563293457, "epoch": 1.8027232056020228, "grad_norm": 1.125, "learning_rate": 0.0004672685298355172, "loss": 5.0954, "mean_token_accuracy": 0.2009261816740036, "num_tokens": 40194359.0, "step": 23170 }, { "entropy": 5.531659936904907, "epoch": 1.8031122349737405, "grad_norm": 1.1171875, "learning_rate": 0.0004672541326981664, "loss": 4.9027, "mean_token_accuracy": 0.2041623115539551, "num_tokens": 40202812.0, "step": 23175 }, { "entropy": 5.590099477767945, "epoch": 1.8035012643454582, "grad_norm": 1.109375, "learning_rate": 0.000467239732643665, "loss": 5.0456, "mean_token_accuracy": 0.198092919588089, "num_tokens": 40212344.0, "step": 23180 }, { "entropy": 5.6235534191131595, "epoch": 1.8038902937171757, "grad_norm": 1.15625, "learning_rate": 0.00046722532967223183, "loss": 5.1116, "mean_token_accuracy": 0.19631081819534302, "num_tokens": 40220974.0, "step": 23185 }, { "entropy": 5.629443359375, "epoch": 1.8042793230888932, "grad_norm": 1.1875, "learning_rate": 0.0004672109237840851, "loss": 5.0647, "mean_token_accuracy": 0.19112922251224518, "num_tokens": 40229616.0, "step": 23190 }, { "entropy": 5.616862344741821, "epoch": 1.8046683524606109, "grad_norm": 1.1015625, "learning_rate": 0.00046719651497944355, "loss": 5.0682, "mean_token_accuracy": 0.1924363523721695, "num_tokens": 40238505.0, "step": 23195 }, { "entropy": 5.717259311676026, "epoch": 1.8050573818323283, "grad_norm": 1.09375, "learning_rate": 0.0004671821032585259, "loss": 5.1815, "mean_token_accuracy": 0.1908905938267708, "num_tokens": 40246716.0, "step": 23200 }, { "entropy": 5.67170672416687, "epoch": 1.8054464112040458, "grad_norm": 1.1796875, "learning_rate": 0.0004671676886215506, "loss": 5.1406, "mean_token_accuracy": 0.1839780330657959, "num_tokens": 40256146.0, "step": 23205 }, { "entropy": 5.681102180480957, "epoch": 1.8058354405757635, "grad_norm": 1.125, "learning_rate": 0.0004671532710687365, "loss": 5.0636, "mean_token_accuracy": 0.20706765502691268, "num_tokens": 40265304.0, "step": 23210 }, { "entropy": 5.571102857589722, "epoch": 1.806224469947481, "grad_norm": 1.0390625, "learning_rate": 0.0004671388506003024, "loss": 4.9026, "mean_token_accuracy": 0.19976315647363663, "num_tokens": 40274055.0, "step": 23215 }, { "entropy": 5.598319578170776, "epoch": 1.8066134993191985, "grad_norm": 1.140625, "learning_rate": 0.0004671244272164671, "loss": 4.9921, "mean_token_accuracy": 0.19909203201532363, "num_tokens": 40283184.0, "step": 23220 }, { "entropy": 5.713182210922241, "epoch": 1.8070025286909162, "grad_norm": 1.0703125, "learning_rate": 0.00046711000091744935, "loss": 5.0993, "mean_token_accuracy": 0.19425711929798126, "num_tokens": 40292604.0, "step": 23225 }, { "entropy": 5.545990896224976, "epoch": 1.8073915580626339, "grad_norm": 1.0703125, "learning_rate": 0.0004670955717034681, "loss": 4.8142, "mean_token_accuracy": 0.21764519810676575, "num_tokens": 40301096.0, "step": 23230 }, { "entropy": 5.660467147827148, "epoch": 1.8077805874343513, "grad_norm": 1.15625, "learning_rate": 0.00046708113957474233, "loss": 5.2078, "mean_token_accuracy": 0.1873690366744995, "num_tokens": 40309976.0, "step": 23235 }, { "entropy": 5.710231971740723, "epoch": 1.8081696168060688, "grad_norm": 1.1796875, "learning_rate": 0.000467066704531491, "loss": 5.1685, "mean_token_accuracy": 0.19552729278802872, "num_tokens": 40318594.0, "step": 23240 }, { "entropy": 5.6297860622406, "epoch": 1.8085586461777865, "grad_norm": 1.1640625, "learning_rate": 0.0004670522665739332, "loss": 5.0191, "mean_token_accuracy": 0.2049823597073555, "num_tokens": 40326480.0, "step": 23245 }, { "entropy": 5.595271062850952, "epoch": 1.808947675549504, "grad_norm": 1.140625, "learning_rate": 0.0004670378257022878, "loss": 5.1176, "mean_token_accuracy": 0.20003019869327546, "num_tokens": 40334646.0, "step": 23250 }, { "entropy": 5.6118732452392575, "epoch": 1.8093367049212215, "grad_norm": 1.1484375, "learning_rate": 0.00046702338191677414, "loss": 5.0488, "mean_token_accuracy": 0.19690470844507219, "num_tokens": 40344007.0, "step": 23255 }, { "entropy": 5.659751939773559, "epoch": 1.8097257342929391, "grad_norm": 1.1328125, "learning_rate": 0.0004670089352176113, "loss": 5.0906, "mean_token_accuracy": 0.18893725275993348, "num_tokens": 40352075.0, "step": 23260 }, { "entropy": 5.600746059417725, "epoch": 1.8101147636646568, "grad_norm": 1.0859375, "learning_rate": 0.00046699448560501847, "loss": 5.0221, "mean_token_accuracy": 0.1967361882328987, "num_tokens": 40360725.0, "step": 23265 }, { "entropy": 5.597019672393799, "epoch": 1.810503793036374, "grad_norm": 1.171875, "learning_rate": 0.0004669800330792149, "loss": 5.0313, "mean_token_accuracy": 0.1980992630124092, "num_tokens": 40369022.0, "step": 23270 }, { "entropy": 5.610194826126099, "epoch": 1.8108928224080918, "grad_norm": 1.1875, "learning_rate": 0.00046696557764041994, "loss": 5.0165, "mean_token_accuracy": 0.2007458433508873, "num_tokens": 40377624.0, "step": 23275 }, { "entropy": 5.6123740673065186, "epoch": 1.8112818517798095, "grad_norm": 1.1640625, "learning_rate": 0.0004669511192888528, "loss": 5.065, "mean_token_accuracy": 0.19698356240987777, "num_tokens": 40385678.0, "step": 23280 }, { "entropy": 5.57147364616394, "epoch": 1.811670881151527, "grad_norm": 1.0703125, "learning_rate": 0.00046693665802473294, "loss": 5.0696, "mean_token_accuracy": 0.19622524678707123, "num_tokens": 40394565.0, "step": 23285 }, { "entropy": 5.6646629810333256, "epoch": 1.8120599105232444, "grad_norm": 1.1953125, "learning_rate": 0.00046692219384827986, "loss": 5.0825, "mean_token_accuracy": 0.1975480943918228, "num_tokens": 40402910.0, "step": 23290 }, { "entropy": 5.624217700958252, "epoch": 1.8124489398949621, "grad_norm": 1.1328125, "learning_rate": 0.0004669077267597129, "loss": 4.9534, "mean_token_accuracy": 0.20336903780698776, "num_tokens": 40411352.0, "step": 23295 }, { "entropy": 5.623194599151612, "epoch": 1.8128379692666796, "grad_norm": 1.1484375, "learning_rate": 0.00046689325675925174, "loss": 5.0712, "mean_token_accuracy": 0.19974220544099808, "num_tokens": 40419925.0, "step": 23300 }, { "entropy": 5.591967153549194, "epoch": 1.813226998638397, "grad_norm": 1.140625, "learning_rate": 0.00046687878384711574, "loss": 5.0307, "mean_token_accuracy": 0.1969700962305069, "num_tokens": 40428948.0, "step": 23305 }, { "entropy": 5.624563360214234, "epoch": 1.8136160280101148, "grad_norm": 1.125, "learning_rate": 0.00046686430802352476, "loss": 5.058, "mean_token_accuracy": 0.19498247504234315, "num_tokens": 40437625.0, "step": 23310 }, { "entropy": 5.605804920196533, "epoch": 1.8140050573818325, "grad_norm": 1.1875, "learning_rate": 0.0004668498292886982, "loss": 4.9963, "mean_token_accuracy": 0.2003286972641945, "num_tokens": 40446435.0, "step": 23315 }, { "entropy": 5.682114934921264, "epoch": 1.8143940867535497, "grad_norm": 1.109375, "learning_rate": 0.00046683534764285577, "loss": 5.0701, "mean_token_accuracy": 0.1951671540737152, "num_tokens": 40455368.0, "step": 23320 }, { "entropy": 5.638456201553344, "epoch": 1.8147831161252674, "grad_norm": 1.1171875, "learning_rate": 0.00046682086308621725, "loss": 5.0401, "mean_token_accuracy": 0.19758439511060716, "num_tokens": 40464461.0, "step": 23325 }, { "entropy": 5.688071966171265, "epoch": 1.8151721454969851, "grad_norm": 1.140625, "learning_rate": 0.0004668063756190026, "loss": 5.1408, "mean_token_accuracy": 0.1864347815513611, "num_tokens": 40473143.0, "step": 23330 }, { "entropy": 5.615222930908203, "epoch": 1.8155611748687026, "grad_norm": 1.125, "learning_rate": 0.00046679188524143136, "loss": 5.0172, "mean_token_accuracy": 0.2060600459575653, "num_tokens": 40481592.0, "step": 23335 }, { "entropy": 5.539088010787964, "epoch": 1.81595020424042, "grad_norm": 1.09375, "learning_rate": 0.0004667773919537235, "loss": 4.9111, "mean_token_accuracy": 0.20797560065984727, "num_tokens": 40489445.0, "step": 23340 }, { "entropy": 5.5624427318573, "epoch": 1.8163392336121378, "grad_norm": 1.109375, "learning_rate": 0.00046676289575609914, "loss": 4.9783, "mean_token_accuracy": 0.20346004962921144, "num_tokens": 40498279.0, "step": 23345 }, { "entropy": 5.632542896270752, "epoch": 1.8167282629838553, "grad_norm": 1.078125, "learning_rate": 0.00046674839664877796, "loss": 4.9492, "mean_token_accuracy": 0.20584661215543748, "num_tokens": 40507051.0, "step": 23350 }, { "entropy": 5.569098901748657, "epoch": 1.8171172923555727, "grad_norm": 1.171875, "learning_rate": 0.0004667338946319801, "loss": 4.9279, "mean_token_accuracy": 0.20824647098779678, "num_tokens": 40515213.0, "step": 23355 }, { "entropy": 5.587221574783325, "epoch": 1.8175063217272904, "grad_norm": 1.109375, "learning_rate": 0.0004667193897059255, "loss": 5.0829, "mean_token_accuracy": 0.19480980932712555, "num_tokens": 40523859.0, "step": 23360 }, { "entropy": 5.654905891418457, "epoch": 1.8178953510990081, "grad_norm": 1.15625, "learning_rate": 0.00046670488187083436, "loss": 5.1464, "mean_token_accuracy": 0.1929512217640877, "num_tokens": 40533236.0, "step": 23365 }, { "entropy": 5.614179372787476, "epoch": 1.8182843804707254, "grad_norm": 1.1640625, "learning_rate": 0.0004666903711269267, "loss": 4.969, "mean_token_accuracy": 0.20213767588138581, "num_tokens": 40541670.0, "step": 23370 }, { "entropy": 5.59372992515564, "epoch": 1.818673409842443, "grad_norm": 1.09375, "learning_rate": 0.0004666758574744228, "loss": 5.0702, "mean_token_accuracy": 0.19704059064388274, "num_tokens": 40551411.0, "step": 23375 }, { "entropy": 5.632431697845459, "epoch": 1.8190624392141608, "grad_norm": 1.1484375, "learning_rate": 0.0004666613409135429, "loss": 5.041, "mean_token_accuracy": 0.19759082645177842, "num_tokens": 40560351.0, "step": 23380 }, { "entropy": 5.590240383148194, "epoch": 1.8194514685858783, "grad_norm": 1.15625, "learning_rate": 0.0004666468214445072, "loss": 4.9728, "mean_token_accuracy": 0.20556407123804094, "num_tokens": 40569363.0, "step": 23385 }, { "entropy": 5.611284637451172, "epoch": 1.8198404979575957, "grad_norm": 1.1953125, "learning_rate": 0.00046663229906753595, "loss": 5.045, "mean_token_accuracy": 0.19331530183553697, "num_tokens": 40577425.0, "step": 23390 }, { "entropy": 5.601829957962036, "epoch": 1.8202295273293134, "grad_norm": 1.0859375, "learning_rate": 0.00046661777378284965, "loss": 5.0516, "mean_token_accuracy": 0.1947967976331711, "num_tokens": 40585718.0, "step": 23395 }, { "entropy": 5.6978847026824955, "epoch": 1.820618556701031, "grad_norm": 1.1796875, "learning_rate": 0.0004666032455906685, "loss": 5.135, "mean_token_accuracy": 0.19453078210353852, "num_tokens": 40594886.0, "step": 23400 }, { "entropy": 5.719239187240601, "epoch": 1.8210075860727484, "grad_norm": 1.1171875, "learning_rate": 0.00046658871449121325, "loss": 5.1439, "mean_token_accuracy": 0.18777624368667603, "num_tokens": 40603737.0, "step": 23405 }, { "entropy": 5.617008018493652, "epoch": 1.821396615444466, "grad_norm": 1.15625, "learning_rate": 0.0004665741804847041, "loss": 5.025, "mean_token_accuracy": 0.19073092192411423, "num_tokens": 40612473.0, "step": 23410 }, { "entropy": 5.57135796546936, "epoch": 1.8217856448161838, "grad_norm": 1.1328125, "learning_rate": 0.00046655964357136164, "loss": 5.003, "mean_token_accuracy": 0.2022671103477478, "num_tokens": 40620517.0, "step": 23415 }, { "entropy": 5.633507823944091, "epoch": 1.822174674187901, "grad_norm": 1.1796875, "learning_rate": 0.00046654510375140657, "loss": 5.0708, "mean_token_accuracy": 0.18939561843872071, "num_tokens": 40629530.0, "step": 23420 }, { "entropy": 5.608733320236206, "epoch": 1.8225637035596187, "grad_norm": 1.125, "learning_rate": 0.0004665305610250594, "loss": 4.9809, "mean_token_accuracy": 0.20885164588689803, "num_tokens": 40638616.0, "step": 23425 }, { "entropy": 5.659526729583741, "epoch": 1.8229527329313364, "grad_norm": 1.2109375, "learning_rate": 0.0004665160153925408, "loss": 5.0509, "mean_token_accuracy": 0.190180766582489, "num_tokens": 40646945.0, "step": 23430 }, { "entropy": 5.599174308776855, "epoch": 1.823341762303054, "grad_norm": 1.1796875, "learning_rate": 0.00046650146685407154, "loss": 5.0283, "mean_token_accuracy": 0.1996596410870552, "num_tokens": 40654845.0, "step": 23435 }, { "entropy": 5.498543453216553, "epoch": 1.8237307916747714, "grad_norm": 1.0859375, "learning_rate": 0.00046648691540987226, "loss": 4.909, "mean_token_accuracy": 0.21617285609245301, "num_tokens": 40663776.0, "step": 23440 }, { "entropy": 5.592143964767456, "epoch": 1.824119821046489, "grad_norm": 1.1953125, "learning_rate": 0.00046647236106016387, "loss": 4.9545, "mean_token_accuracy": 0.20687427669763564, "num_tokens": 40672071.0, "step": 23445 }, { "entropy": 5.628521060943603, "epoch": 1.8245088504182065, "grad_norm": 1.0703125, "learning_rate": 0.0004664578038051672, "loss": 5.1358, "mean_token_accuracy": 0.19257258474826813, "num_tokens": 40681264.0, "step": 23450 }, { "entropy": 5.595798397064209, "epoch": 1.824897879789924, "grad_norm": 1.171875, "learning_rate": 0.000466443243645103, "loss": 5.0295, "mean_token_accuracy": 0.19786957353353501, "num_tokens": 40690091.0, "step": 23455 }, { "entropy": 5.690511178970337, "epoch": 1.8252869091616417, "grad_norm": 1.171875, "learning_rate": 0.0004664286805801923, "loss": 5.1255, "mean_token_accuracy": 0.19579583257436753, "num_tokens": 40699623.0, "step": 23460 }, { "entropy": 5.601533699035644, "epoch": 1.8256759385333594, "grad_norm": 1.0546875, "learning_rate": 0.0004664141146106562, "loss": 4.9882, "mean_token_accuracy": 0.20337842255830765, "num_tokens": 40708288.0, "step": 23465 }, { "entropy": 5.6654785633087155, "epoch": 1.8260649679050769, "grad_norm": 1.125, "learning_rate": 0.00046639954573671547, "loss": 5.0929, "mean_token_accuracy": 0.19652458429336547, "num_tokens": 40716357.0, "step": 23470 }, { "entropy": 5.669815921783448, "epoch": 1.8264539972767944, "grad_norm": 1.1953125, "learning_rate": 0.00046638497395859127, "loss": 5.1027, "mean_token_accuracy": 0.19600706845521926, "num_tokens": 40724775.0, "step": 23475 }, { "entropy": 5.572087049484253, "epoch": 1.826843026648512, "grad_norm": 1.09375, "learning_rate": 0.0004663703992765047, "loss": 5.0502, "mean_token_accuracy": 0.20123700499534608, "num_tokens": 40733642.0, "step": 23480 }, { "entropy": 5.577604198455811, "epoch": 1.8272320560202295, "grad_norm": 1.234375, "learning_rate": 0.00046635582169067693, "loss": 4.9995, "mean_token_accuracy": 0.20559964329004288, "num_tokens": 40742201.0, "step": 23485 }, { "entropy": 5.544379329681396, "epoch": 1.827621085391947, "grad_norm": 1.1640625, "learning_rate": 0.00046634124120132915, "loss": 4.9733, "mean_token_accuracy": 0.2035066455602646, "num_tokens": 40750379.0, "step": 23490 }, { "entropy": 5.604676151275635, "epoch": 1.8280101147636647, "grad_norm": 1.0859375, "learning_rate": 0.0004663266578086826, "loss": 5.0749, "mean_token_accuracy": 0.18913512527942658, "num_tokens": 40759232.0, "step": 23495 }, { "entropy": 5.61720232963562, "epoch": 1.8283991441353822, "grad_norm": 1.109375, "learning_rate": 0.0004663120715129585, "loss": 5.0346, "mean_token_accuracy": 0.19719498455524445, "num_tokens": 40768247.0, "step": 23500 }, { "entropy": 5.6857171058654785, "epoch": 1.8287881735070997, "grad_norm": 1.125, "learning_rate": 0.0004662974823143783, "loss": 5.1075, "mean_token_accuracy": 0.19672910273075103, "num_tokens": 40777085.0, "step": 23505 }, { "entropy": 5.665562534332276, "epoch": 1.8291772028788174, "grad_norm": 1.1640625, "learning_rate": 0.0004662828902131632, "loss": 5.1122, "mean_token_accuracy": 0.19160445183515548, "num_tokens": 40785466.0, "step": 23510 }, { "entropy": 5.619267845153809, "epoch": 1.829566232250535, "grad_norm": 1.15625, "learning_rate": 0.0004662682952095348, "loss": 5.0255, "mean_token_accuracy": 0.2001644879579544, "num_tokens": 40794165.0, "step": 23515 }, { "entropy": 5.597879457473755, "epoch": 1.8299552616222525, "grad_norm": 1.140625, "learning_rate": 0.00046625369730371436, "loss": 5.0152, "mean_token_accuracy": 0.19749637544155121, "num_tokens": 40802497.0, "step": 23520 }, { "entropy": 5.584168481826782, "epoch": 1.83034429099397, "grad_norm": 1.15625, "learning_rate": 0.0004662390964959235, "loss": 4.9853, "mean_token_accuracy": 0.20172184109687805, "num_tokens": 40811022.0, "step": 23525 }, { "entropy": 5.650629186630249, "epoch": 1.8307333203656877, "grad_norm": 1.09375, "learning_rate": 0.00046622449278638375, "loss": 5.069, "mean_token_accuracy": 0.19481384754180908, "num_tokens": 40820430.0, "step": 23530 }, { "entropy": 5.612881469726562, "epoch": 1.8311223497374052, "grad_norm": 1.1171875, "learning_rate": 0.0004662098861753167, "loss": 5.0687, "mean_token_accuracy": 0.20068925619125366, "num_tokens": 40829245.0, "step": 23535 }, { "entropy": 5.538964319229126, "epoch": 1.8315113791091227, "grad_norm": 1.0859375, "learning_rate": 0.00046619527666294394, "loss": 5.004, "mean_token_accuracy": 0.2021559000015259, "num_tokens": 40838576.0, "step": 23540 }, { "entropy": 5.680930233001709, "epoch": 1.8319004084808403, "grad_norm": 1.078125, "learning_rate": 0.0004661806642494872, "loss": 5.1, "mean_token_accuracy": 0.1906559258699417, "num_tokens": 40847097.0, "step": 23545 }, { "entropy": 5.638874912261963, "epoch": 1.8322894378525578, "grad_norm": 1.21875, "learning_rate": 0.0004661660489351681, "loss": 4.9911, "mean_token_accuracy": 0.20773073881864548, "num_tokens": 40855135.0, "step": 23550 }, { "entropy": 5.650017118453979, "epoch": 1.8326784672242753, "grad_norm": 1.1484375, "learning_rate": 0.0004661514307202086, "loss": 5.1046, "mean_token_accuracy": 0.19601837694644927, "num_tokens": 40864218.0, "step": 23555 }, { "entropy": 5.664402914047241, "epoch": 1.833067496595993, "grad_norm": 1.09375, "learning_rate": 0.00046613680960483036, "loss": 5.0459, "mean_token_accuracy": 0.19746768325567246, "num_tokens": 40873147.0, "step": 23560 }, { "entropy": 5.660321569442749, "epoch": 1.8334565259677107, "grad_norm": 1.0546875, "learning_rate": 0.0004661221855892552, "loss": 5.1145, "mean_token_accuracy": 0.19513753056526184, "num_tokens": 40881340.0, "step": 23565 }, { "entropy": 5.59055118560791, "epoch": 1.8338455553394282, "grad_norm": 1.15625, "learning_rate": 0.00046610755867370506, "loss": 4.9803, "mean_token_accuracy": 0.198401640355587, "num_tokens": 40889246.0, "step": 23570 }, { "entropy": 5.596943998336792, "epoch": 1.8342345847111456, "grad_norm": 1.15625, "learning_rate": 0.000466092928858402, "loss": 5.0281, "mean_token_accuracy": 0.20470170974731444, "num_tokens": 40898285.0, "step": 23575 }, { "entropy": 5.573590469360352, "epoch": 1.8346236140828633, "grad_norm": 1.1953125, "learning_rate": 0.00046607829614356787, "loss": 5.0796, "mean_token_accuracy": 0.1968280479311943, "num_tokens": 40907012.0, "step": 23580 }, { "entropy": 5.6128397464752195, "epoch": 1.8350126434545808, "grad_norm": 1.0703125, "learning_rate": 0.0004660636605294247, "loss": 4.9726, "mean_token_accuracy": 0.1991742730140686, "num_tokens": 40915857.0, "step": 23585 }, { "entropy": 5.675103950500488, "epoch": 1.8354016728262983, "grad_norm": 1.0390625, "learning_rate": 0.0004660490220161946, "loss": 4.9931, "mean_token_accuracy": 0.19883376657962798, "num_tokens": 40924364.0, "step": 23590 }, { "entropy": 5.521678352355957, "epoch": 1.835790702198016, "grad_norm": 1.109375, "learning_rate": 0.00046603438060409966, "loss": 5.0053, "mean_token_accuracy": 0.19827326238155366, "num_tokens": 40934092.0, "step": 23595 }, { "entropy": 5.541199493408203, "epoch": 1.8361797315697335, "grad_norm": 1.1875, "learning_rate": 0.000466019736293362, "loss": 4.8987, "mean_token_accuracy": 0.20568527579307555, "num_tokens": 40942066.0, "step": 23600 }, { "entropy": 5.613321447372437, "epoch": 1.836568760941451, "grad_norm": 1.1484375, "learning_rate": 0.00046600508908420396, "loss": 5.037, "mean_token_accuracy": 0.2000073418021202, "num_tokens": 40951445.0, "step": 23605 }, { "entropy": 5.577350664138794, "epoch": 1.8369577903131686, "grad_norm": 1.109375, "learning_rate": 0.00046599043897684766, "loss": 5.0229, "mean_token_accuracy": 0.20444778352975845, "num_tokens": 40960111.0, "step": 23610 }, { "entropy": 5.6367274761199955, "epoch": 1.8373468196848863, "grad_norm": 1.2265625, "learning_rate": 0.0004659757859715155, "loss": 4.9784, "mean_token_accuracy": 0.20697728991508485, "num_tokens": 40968036.0, "step": 23615 }, { "entropy": 5.557705974578857, "epoch": 1.8377358490566038, "grad_norm": 1.1171875, "learning_rate": 0.00046596113006842975, "loss": 5.0134, "mean_token_accuracy": 0.20100812315940858, "num_tokens": 40977032.0, "step": 23620 }, { "entropy": 5.592973756790161, "epoch": 1.8381248784283213, "grad_norm": 1.1328125, "learning_rate": 0.0004659464712678128, "loss": 5.0129, "mean_token_accuracy": 0.19765660017728806, "num_tokens": 40985523.0, "step": 23625 }, { "entropy": 5.609164762496948, "epoch": 1.838513907800039, "grad_norm": 1.171875, "learning_rate": 0.0004659318095698871, "loss": 4.9086, "mean_token_accuracy": 0.20890259742736816, "num_tokens": 40993617.0, "step": 23630 }, { "entropy": 5.556909418106079, "epoch": 1.8389029371717565, "grad_norm": 1.1484375, "learning_rate": 0.000465917144974875, "loss": 4.9792, "mean_token_accuracy": 0.2017780676484108, "num_tokens": 41002424.0, "step": 23635 }, { "entropy": 5.644184112548828, "epoch": 1.839291966543474, "grad_norm": 1.15625, "learning_rate": 0.0004659024774829992, "loss": 5.1008, "mean_token_accuracy": 0.19163004904985428, "num_tokens": 41011150.0, "step": 23640 }, { "entropy": 5.646226453781128, "epoch": 1.8396809959151916, "grad_norm": 1.1015625, "learning_rate": 0.000465887807094482, "loss": 5.001, "mean_token_accuracy": 0.20469943583011627, "num_tokens": 41020112.0, "step": 23645 }, { "entropy": 5.662209177017212, "epoch": 1.8400700252869093, "grad_norm": 1.0546875, "learning_rate": 0.00046587313380954635, "loss": 5.0569, "mean_token_accuracy": 0.19730052798986436, "num_tokens": 41029470.0, "step": 23650 }, { "entropy": 5.633938360214233, "epoch": 1.8404590546586266, "grad_norm": 1.0546875, "learning_rate": 0.00046585845762841453, "loss": 5.0614, "mean_token_accuracy": 0.19285302460193635, "num_tokens": 41038622.0, "step": 23655 }, { "entropy": 5.706746292114258, "epoch": 1.8408480840303443, "grad_norm": 1.1328125, "learning_rate": 0.0004658437785513095, "loss": 5.1785, "mean_token_accuracy": 0.19255516082048416, "num_tokens": 41047573.0, "step": 23660 }, { "entropy": 5.638515186309815, "epoch": 1.841237113402062, "grad_norm": 1.1875, "learning_rate": 0.0004658290965784539, "loss": 4.9779, "mean_token_accuracy": 0.207144895195961, "num_tokens": 41057084.0, "step": 23665 }, { "entropy": 5.5433149337768555, "epoch": 1.8416261427737795, "grad_norm": 1.1171875, "learning_rate": 0.0004658144117100704, "loss": 4.9462, "mean_token_accuracy": 0.20101052075624465, "num_tokens": 41065297.0, "step": 23670 }, { "entropy": 5.600091791152954, "epoch": 1.842015172145497, "grad_norm": 1.265625, "learning_rate": 0.00046579972394638204, "loss": 5.0152, "mean_token_accuracy": 0.20281038284301758, "num_tokens": 41073748.0, "step": 23675 }, { "entropy": 5.617030143737793, "epoch": 1.8424042015172146, "grad_norm": 1.09375, "learning_rate": 0.00046578503328761146, "loss": 4.9612, "mean_token_accuracy": 0.20471563786268235, "num_tokens": 41082304.0, "step": 23680 }, { "entropy": 5.637938022613525, "epoch": 1.842793230888932, "grad_norm": 1.0859375, "learning_rate": 0.00046577033973398173, "loss": 5.114, "mean_token_accuracy": 0.19639993011951445, "num_tokens": 41091130.0, "step": 23685 }, { "entropy": 5.612504243850708, "epoch": 1.8431822602606496, "grad_norm": 1.0859375, "learning_rate": 0.0004657556432857157, "loss": 5.0437, "mean_token_accuracy": 0.20102738589048386, "num_tokens": 41100413.0, "step": 23690 }, { "entropy": 5.497707986831665, "epoch": 1.8435712896323673, "grad_norm": 1.1328125, "learning_rate": 0.0004657409439430364, "loss": 4.8831, "mean_token_accuracy": 0.2152306005358696, "num_tokens": 41108582.0, "step": 23695 }, { "entropy": 5.526933193206787, "epoch": 1.843960319004085, "grad_norm": 1.2578125, "learning_rate": 0.0004657262417061669, "loss": 4.9736, "mean_token_accuracy": 0.20298181772232055, "num_tokens": 41117067.0, "step": 23700 }, { "entropy": 5.5527692317962645, "epoch": 1.8443493483758022, "grad_norm": 1.125, "learning_rate": 0.0004657115365753302, "loss": 4.9913, "mean_token_accuracy": 0.19769353419542313, "num_tokens": 41125559.0, "step": 23705 }, { "entropy": 5.585807800292969, "epoch": 1.84473837774752, "grad_norm": 1.1171875, "learning_rate": 0.00046569682855074953, "loss": 5.0281, "mean_token_accuracy": 0.19702197015285491, "num_tokens": 41134503.0, "step": 23710 }, { "entropy": 5.690577983856201, "epoch": 1.8451274071192376, "grad_norm": 1.1015625, "learning_rate": 0.00046568211763264796, "loss": 5.1291, "mean_token_accuracy": 0.18634032905101777, "num_tokens": 41143903.0, "step": 23715 }, { "entropy": 5.576463842391968, "epoch": 1.845516436490955, "grad_norm": 1.09375, "learning_rate": 0.0004656674038212488, "loss": 5.0424, "mean_token_accuracy": 0.19719989895820617, "num_tokens": 41153082.0, "step": 23720 }, { "entropy": 5.639426279067993, "epoch": 1.8459054658626726, "grad_norm": 1.1015625, "learning_rate": 0.00046565268711677525, "loss": 5.0082, "mean_token_accuracy": 0.20398676246404648, "num_tokens": 41161749.0, "step": 23725 }, { "entropy": 5.613051700592041, "epoch": 1.8462944952343903, "grad_norm": 1.1953125, "learning_rate": 0.00046563796751945065, "loss": 5.0293, "mean_token_accuracy": 0.19961839020252228, "num_tokens": 41170969.0, "step": 23730 }, { "entropy": 5.528833723068237, "epoch": 1.8466835246061077, "grad_norm": 1.15625, "learning_rate": 0.00046562324502949834, "loss": 4.9199, "mean_token_accuracy": 0.2109770029783249, "num_tokens": 41179512.0, "step": 23735 }, { "entropy": 5.5634407043457035, "epoch": 1.8470725539778252, "grad_norm": 1.09375, "learning_rate": 0.0004656085196471416, "loss": 4.9504, "mean_token_accuracy": 0.2059561088681221, "num_tokens": 41188109.0, "step": 23740 }, { "entropy": 5.580890893936157, "epoch": 1.847461583349543, "grad_norm": 1.1015625, "learning_rate": 0.00046559379137260404, "loss": 5.0616, "mean_token_accuracy": 0.18921927511692047, "num_tokens": 41196708.0, "step": 23745 }, { "entropy": 5.711459016799926, "epoch": 1.8478506127212606, "grad_norm": 1.1875, "learning_rate": 0.000465579060206109, "loss": 5.1814, "mean_token_accuracy": 0.19331362396478652, "num_tokens": 41205013.0, "step": 23750 }, { "entropy": 5.594593191146851, "epoch": 1.8482396420929779, "grad_norm": 1.1171875, "learning_rate": 0.00046556432614788015, "loss": 4.9032, "mean_token_accuracy": 0.20435863584280015, "num_tokens": 41213701.0, "step": 23755 }, { "entropy": 5.525057411193847, "epoch": 1.8486286714646956, "grad_norm": 1.125, "learning_rate": 0.0004655495891981409, "loss": 4.9481, "mean_token_accuracy": 0.20610039830207824, "num_tokens": 41222450.0, "step": 23760 }, { "entropy": 5.626527881622314, "epoch": 1.8490177008364133, "grad_norm": 1.140625, "learning_rate": 0.000465534849357115, "loss": 5.057, "mean_token_accuracy": 0.19498929977416993, "num_tokens": 41230259.0, "step": 23765 }, { "entropy": 5.6070667743682865, "epoch": 1.8494067302081307, "grad_norm": 1.1015625, "learning_rate": 0.00046552010662502595, "loss": 4.9937, "mean_token_accuracy": 0.20377992689609528, "num_tokens": 41238863.0, "step": 23770 }, { "entropy": 5.552564287185669, "epoch": 1.8497957595798482, "grad_norm": 1.125, "learning_rate": 0.0004655053610020976, "loss": 5.0289, "mean_token_accuracy": 0.1973477840423584, "num_tokens": 41247260.0, "step": 23775 }, { "entropy": 5.551203346252441, "epoch": 1.850184788951566, "grad_norm": 1.203125, "learning_rate": 0.0004654906124885535, "loss": 4.9374, "mean_token_accuracy": 0.20702647268772126, "num_tokens": 41255475.0, "step": 23780 }, { "entropy": 5.510921144485474, "epoch": 1.8505738183232834, "grad_norm": 1.1875, "learning_rate": 0.0004654758610846176, "loss": 4.841, "mean_token_accuracy": 0.21240711361169815, "num_tokens": 41263858.0, "step": 23785 }, { "entropy": 5.606937837600708, "epoch": 1.8509628476950009, "grad_norm": 1.375, "learning_rate": 0.0004654611067905137, "loss": 5.0465, "mean_token_accuracy": 0.1956373393535614, "num_tokens": 41272527.0, "step": 23790 }, { "entropy": 5.607389163970947, "epoch": 1.8513518770667186, "grad_norm": 1.1171875, "learning_rate": 0.00046544634960646563, "loss": 5.0253, "mean_token_accuracy": 0.20440048426389695, "num_tokens": 41280647.0, "step": 23795 }, { "entropy": 5.655500268936157, "epoch": 1.8517409064384363, "grad_norm": 1.1640625, "learning_rate": 0.0004654315895326974, "loss": 5.0464, "mean_token_accuracy": 0.2087082952260971, "num_tokens": 41289462.0, "step": 23800 }, { "entropy": 5.645501804351807, "epoch": 1.8521299358101535, "grad_norm": 1.3203125, "learning_rate": 0.0004654168265694328, "loss": 4.984, "mean_token_accuracy": 0.20313032269477843, "num_tokens": 41297178.0, "step": 23805 }, { "entropy": 5.609679508209228, "epoch": 1.8525189651818712, "grad_norm": 1.125, "learning_rate": 0.000465402060716896, "loss": 4.9715, "mean_token_accuracy": 0.20343809723854064, "num_tokens": 41305405.0, "step": 23810 }, { "entropy": 5.596731519699096, "epoch": 1.852907994553589, "grad_norm": 1.09375, "learning_rate": 0.000465387291975311, "loss": 4.9882, "mean_token_accuracy": 0.2026408240199089, "num_tokens": 41313330.0, "step": 23815 }, { "entropy": 5.602958345413208, "epoch": 1.8532970239253064, "grad_norm": 1.1484375, "learning_rate": 0.00046537252034490185, "loss": 5.0231, "mean_token_accuracy": 0.2044585257768631, "num_tokens": 41321245.0, "step": 23820 }, { "entropy": 5.653200912475586, "epoch": 1.8536860532970239, "grad_norm": 1.1171875, "learning_rate": 0.00046535774582589275, "loss": 5.0713, "mean_token_accuracy": 0.19422231912612914, "num_tokens": 41330013.0, "step": 23825 }, { "entropy": 5.645751476287842, "epoch": 1.8540750826687415, "grad_norm": 1.109375, "learning_rate": 0.00046534296841850776, "loss": 5.0479, "mean_token_accuracy": 0.20379102528095244, "num_tokens": 41338134.0, "step": 23830 }, { "entropy": 5.583053636550903, "epoch": 1.854464112040459, "grad_norm": 1.1640625, "learning_rate": 0.00046532818812297124, "loss": 4.9455, "mean_token_accuracy": 0.2008335217833519, "num_tokens": 41346693.0, "step": 23835 }, { "entropy": 5.639433717727661, "epoch": 1.8548531414121765, "grad_norm": 1.1953125, "learning_rate": 0.0004653134049395074, "loss": 5.1132, "mean_token_accuracy": 0.1923425614833832, "num_tokens": 41354987.0, "step": 23840 }, { "entropy": 5.579510450363159, "epoch": 1.8552421707838942, "grad_norm": 1.109375, "learning_rate": 0.0004652986188683406, "loss": 5.0746, "mean_token_accuracy": 0.19607969373464584, "num_tokens": 41363703.0, "step": 23845 }, { "entropy": 5.630948209762574, "epoch": 1.855631200155612, "grad_norm": 1.2578125, "learning_rate": 0.00046528382990969504, "loss": 5.0261, "mean_token_accuracy": 0.20213030129671097, "num_tokens": 41371983.0, "step": 23850 }, { "entropy": 5.667448663711548, "epoch": 1.8560202295273294, "grad_norm": 1.1171875, "learning_rate": 0.0004652690380637953, "loss": 5.0774, "mean_token_accuracy": 0.1942388191819191, "num_tokens": 41380215.0, "step": 23855 }, { "entropy": 5.62203574180603, "epoch": 1.8564092588990468, "grad_norm": 1.125, "learning_rate": 0.0004652542433308657, "loss": 4.9787, "mean_token_accuracy": 0.1998612180352211, "num_tokens": 41388927.0, "step": 23860 }, { "entropy": 5.644534015655518, "epoch": 1.8567982882707645, "grad_norm": 1.109375, "learning_rate": 0.0004652394457111309, "loss": 5.0721, "mean_token_accuracy": 0.19139869511127472, "num_tokens": 41397823.0, "step": 23865 }, { "entropy": 5.635408020019531, "epoch": 1.857187317642482, "grad_norm": 1.1328125, "learning_rate": 0.00046522464520481517, "loss": 5.0428, "mean_token_accuracy": 0.19995913207530974, "num_tokens": 41406322.0, "step": 23870 }, { "entropy": 5.597030878067017, "epoch": 1.8575763470141995, "grad_norm": 1.1171875, "learning_rate": 0.00046520984181214333, "loss": 5.0172, "mean_token_accuracy": 0.20322841852903367, "num_tokens": 41415118.0, "step": 23875 }, { "entropy": 5.609958171844482, "epoch": 1.8579653763859172, "grad_norm": 1.140625, "learning_rate": 0.0004651950355333398, "loss": 5.0643, "mean_token_accuracy": 0.19706815779209136, "num_tokens": 41424139.0, "step": 23880 }, { "entropy": 5.639770221710205, "epoch": 1.8583544057576347, "grad_norm": 1.265625, "learning_rate": 0.0004651802263686294, "loss": 5.1032, "mean_token_accuracy": 0.19055611193180083, "num_tokens": 41432017.0, "step": 23885 }, { "entropy": 5.628977823257446, "epoch": 1.8587434351293521, "grad_norm": 1.1171875, "learning_rate": 0.0004651654143182367, "loss": 5.0126, "mean_token_accuracy": 0.1975362405180931, "num_tokens": 41440279.0, "step": 23890 }, { "entropy": 5.559097719192505, "epoch": 1.8591324645010698, "grad_norm": 1.0703125, "learning_rate": 0.0004651505993823866, "loss": 4.9406, "mean_token_accuracy": 0.2059318482875824, "num_tokens": 41449325.0, "step": 23895 }, { "entropy": 5.589949893951416, "epoch": 1.8595214938727875, "grad_norm": 1.046875, "learning_rate": 0.00046513578156130383, "loss": 4.9479, "mean_token_accuracy": 0.20117999762296676, "num_tokens": 41457898.0, "step": 23900 }, { "entropy": 5.557275390625, "epoch": 1.859910523244505, "grad_norm": 1.171875, "learning_rate": 0.0004651209608552131, "loss": 4.9635, "mean_token_accuracy": 0.2102162942290306, "num_tokens": 41466410.0, "step": 23905 }, { "entropy": 5.682901382446289, "epoch": 1.8602995526162225, "grad_norm": 1.125, "learning_rate": 0.00046510613726433945, "loss": 5.0501, "mean_token_accuracy": 0.20324728339910508, "num_tokens": 41475061.0, "step": 23910 }, { "entropy": 5.5722167015075685, "epoch": 1.8606885819879402, "grad_norm": 1.1484375, "learning_rate": 0.0004650913107889078, "loss": 5.0433, "mean_token_accuracy": 0.1988496884703636, "num_tokens": 41483569.0, "step": 23915 }, { "entropy": 5.603317785263061, "epoch": 1.8610776113596577, "grad_norm": 1.21875, "learning_rate": 0.000465076481429143, "loss": 5.0431, "mean_token_accuracy": 0.19795628935098647, "num_tokens": 41492113.0, "step": 23920 }, { "entropy": 5.60336742401123, "epoch": 1.8614666407313751, "grad_norm": 1.1484375, "learning_rate": 0.0004650616491852701, "loss": 5.1265, "mean_token_accuracy": 0.18859759867191314, "num_tokens": 41500722.0, "step": 23925 }, { "entropy": 5.569981479644776, "epoch": 1.8618556701030928, "grad_norm": 1.109375, "learning_rate": 0.00046504681405751426, "loss": 4.9597, "mean_token_accuracy": 0.20999364256858827, "num_tokens": 41509272.0, "step": 23930 }, { "entropy": 5.6530016422271725, "epoch": 1.8622446994748103, "grad_norm": 1.21875, "learning_rate": 0.00046503197604610047, "loss": 5.1118, "mean_token_accuracy": 0.1950590968132019, "num_tokens": 41517379.0, "step": 23935 }, { "entropy": 5.559623956680298, "epoch": 1.8626337288465278, "grad_norm": 1.140625, "learning_rate": 0.00046501713515125393, "loss": 4.9855, "mean_token_accuracy": 0.20323935747146607, "num_tokens": 41525737.0, "step": 23940 }, { "entropy": 5.598915386199951, "epoch": 1.8630227582182455, "grad_norm": 1.1171875, "learning_rate": 0.0004650022913731998, "loss": 5.0273, "mean_token_accuracy": 0.20258174538612367, "num_tokens": 41535016.0, "step": 23945 }, { "entropy": 5.639909076690674, "epoch": 1.8634117875899632, "grad_norm": 1.125, "learning_rate": 0.00046498744471216335, "loss": 5.1092, "mean_token_accuracy": 0.19987462162971498, "num_tokens": 41544253.0, "step": 23950 }, { "entropy": 5.650768709182739, "epoch": 1.8638008169616807, "grad_norm": 1.25, "learning_rate": 0.00046497259516836974, "loss": 5.0795, "mean_token_accuracy": 0.19495786726474762, "num_tokens": 41551907.0, "step": 23955 }, { "entropy": 5.6831879138946535, "epoch": 1.8641898463333981, "grad_norm": 1.1640625, "learning_rate": 0.00046495774274204446, "loss": 5.0736, "mean_token_accuracy": 0.1996731162071228, "num_tokens": 41560675.0, "step": 23960 }, { "entropy": 5.649888515472412, "epoch": 1.8645788757051158, "grad_norm": 1.125, "learning_rate": 0.0004649428874334127, "loss": 5.0891, "mean_token_accuracy": 0.18739516884088517, "num_tokens": 41570256.0, "step": 23965 }, { "entropy": 5.659155368804932, "epoch": 1.8649679050768333, "grad_norm": 1.1484375, "learning_rate": 0.0004649280292427, "loss": 5.0419, "mean_token_accuracy": 0.1985534131526947, "num_tokens": 41578990.0, "step": 23970 }, { "entropy": 5.628348875045776, "epoch": 1.8653569344485508, "grad_norm": 1.1484375, "learning_rate": 0.0004649131681701318, "loss": 5.0545, "mean_token_accuracy": 0.1971456527709961, "num_tokens": 41587896.0, "step": 23975 }, { "entropy": 5.633418941497803, "epoch": 1.8657459638202685, "grad_norm": 1.1484375, "learning_rate": 0.00046489830421593347, "loss": 5.0391, "mean_token_accuracy": 0.19933949112892152, "num_tokens": 41596160.0, "step": 23980 }, { "entropy": 5.663552618026733, "epoch": 1.866134993191986, "grad_norm": 1.1328125, "learning_rate": 0.0004648834373803307, "loss": 5.0322, "mean_token_accuracy": 0.19667882919311525, "num_tokens": 41605025.0, "step": 23985 }, { "entropy": 5.655325412750244, "epoch": 1.8665240225637034, "grad_norm": 1.1953125, "learning_rate": 0.00046486856766354893, "loss": 5.007, "mean_token_accuracy": 0.2006419226527214, "num_tokens": 41612768.0, "step": 23990 }, { "entropy": 5.602658319473266, "epoch": 1.8669130519354211, "grad_norm": 1.1328125, "learning_rate": 0.00046485369506581387, "loss": 5.0637, "mean_token_accuracy": 0.1946185365319252, "num_tokens": 41620892.0, "step": 23995 }, { "entropy": 5.6384461402893065, "epoch": 1.8673020813071388, "grad_norm": 1.21875, "learning_rate": 0.00046483881958735124, "loss": 5.1216, "mean_token_accuracy": 0.19335292875766755, "num_tokens": 41629708.0, "step": 24000 }, { "epoch": 1.8673020813071388, "eval_entropy": 5.450063251645894, "eval_loss": 5.096011161804199, "eval_mean_token_accuracy": 0.20535799106574035, "eval_num_tokens": 41629708.0, "eval_runtime": 21.6127, "eval_samples_per_second": 1922.852, "eval_steps_per_second": 240.368, "step": 24000 }, { "entropy": 5.718201351165772, "epoch": 1.8676911106788563, "grad_norm": 1.1953125, "learning_rate": 0.00046482394122838663, "loss": 4.9343, "mean_token_accuracy": 0.2058359757065773, "num_tokens": 41637966.0, "step": 24005 }, { "entropy": 5.58032636642456, "epoch": 1.8680801400505738, "grad_norm": 1.125, "learning_rate": 0.00046480905998914587, "loss": 5.0145, "mean_token_accuracy": 0.195012728869915, "num_tokens": 41646726.0, "step": 24010 }, { "entropy": 5.567848014831543, "epoch": 1.8684691694222915, "grad_norm": 1.09375, "learning_rate": 0.0004647941758698547, "loss": 5.0022, "mean_token_accuracy": 0.19516789317131042, "num_tokens": 41655450.0, "step": 24015 }, { "entropy": 5.684551334381103, "epoch": 1.868858198794009, "grad_norm": 1.1171875, "learning_rate": 0.000464779288870739, "loss": 5.1127, "mean_token_accuracy": 0.20143478214740754, "num_tokens": 41664295.0, "step": 24020 }, { "entropy": 5.55719575881958, "epoch": 1.8692472281657264, "grad_norm": 1.1875, "learning_rate": 0.00046476439899202464, "loss": 4.8503, "mean_token_accuracy": 0.20914267748594284, "num_tokens": 41672025.0, "step": 24025 }, { "entropy": 5.579408264160156, "epoch": 1.8696362575374441, "grad_norm": 1.1953125, "learning_rate": 0.00046474950623393756, "loss": 5.0781, "mean_token_accuracy": 0.19324567615985871, "num_tokens": 41680360.0, "step": 24030 }, { "entropy": 5.618434429168701, "epoch": 1.8700252869091616, "grad_norm": 1.09375, "learning_rate": 0.0004647346105967038, "loss": 5.0178, "mean_token_accuracy": 0.1979985013604164, "num_tokens": 41689865.0, "step": 24035 }, { "entropy": 5.701025676727295, "epoch": 1.870414316280879, "grad_norm": 1.1015625, "learning_rate": 0.0004647197120805493, "loss": 5.1769, "mean_token_accuracy": 0.18876123279333115, "num_tokens": 41698583.0, "step": 24040 }, { "entropy": 5.663210344314575, "epoch": 1.8708033456525968, "grad_norm": 1.1484375, "learning_rate": 0.00046470481068570013, "loss": 5.2115, "mean_token_accuracy": 0.18477444350719452, "num_tokens": 41708107.0, "step": 24045 }, { "entropy": 5.691216897964478, "epoch": 1.8711923750243145, "grad_norm": 1.1015625, "learning_rate": 0.0004646899064123824, "loss": 5.1133, "mean_token_accuracy": 0.19049527645111083, "num_tokens": 41716446.0, "step": 24050 }, { "entropy": 5.63882999420166, "epoch": 1.871581404396032, "grad_norm": 1.0078125, "learning_rate": 0.0004646749992608223, "loss": 5.0411, "mean_token_accuracy": 0.19635709524154663, "num_tokens": 41726142.0, "step": 24055 }, { "entropy": 5.628851699829101, "epoch": 1.8719704337677494, "grad_norm": 1.078125, "learning_rate": 0.0004646600892312459, "loss": 5.0175, "mean_token_accuracy": 0.20388362258672715, "num_tokens": 41734488.0, "step": 24060 }, { "entropy": 5.612673950195313, "epoch": 1.872359463139467, "grad_norm": 1.0546875, "learning_rate": 0.0004646451763238796, "loss": 5.0325, "mean_token_accuracy": 0.19480410367250442, "num_tokens": 41743164.0, "step": 24065 }, { "entropy": 5.637152481079101, "epoch": 1.8727484925111846, "grad_norm": 1.25, "learning_rate": 0.0004646302605389496, "loss": 5.0786, "mean_token_accuracy": 0.1956809341907501, "num_tokens": 41751994.0, "step": 24070 }, { "entropy": 5.717360496520996, "epoch": 1.873137521882902, "grad_norm": 1.0703125, "learning_rate": 0.0004646153418766822, "loss": 5.147, "mean_token_accuracy": 0.19496413320302963, "num_tokens": 41761801.0, "step": 24075 }, { "entropy": 5.747088193893433, "epoch": 1.8735265512546198, "grad_norm": 1.0546875, "learning_rate": 0.00046460042033730377, "loss": 5.1359, "mean_token_accuracy": 0.1968308076262474, "num_tokens": 41770771.0, "step": 24080 }, { "entropy": 5.616690397262573, "epoch": 1.8739155806263375, "grad_norm": 1.0390625, "learning_rate": 0.0004645854959210408, "loss": 5.0754, "mean_token_accuracy": 0.19805457293987275, "num_tokens": 41779813.0, "step": 24085 }, { "entropy": 5.623816061019897, "epoch": 1.8743046099980547, "grad_norm": 1.0546875, "learning_rate": 0.00046457056862811956, "loss": 5.105, "mean_token_accuracy": 0.20130105316638947, "num_tokens": 41790076.0, "step": 24090 }, { "entropy": 5.644506025314331, "epoch": 1.8746936393697724, "grad_norm": 1.1796875, "learning_rate": 0.0004645556384587668, "loss": 4.9928, "mean_token_accuracy": 0.20746978670358657, "num_tokens": 41799448.0, "step": 24095 }, { "entropy": 5.682711982727051, "epoch": 1.87508266874149, "grad_norm": 1.1328125, "learning_rate": 0.0004645407054132089, "loss": 5.1004, "mean_token_accuracy": 0.1938318431377411, "num_tokens": 41808117.0, "step": 24100 }, { "entropy": 5.6036358833312985, "epoch": 1.8754716981132076, "grad_norm": 1.0625, "learning_rate": 0.0004645257694916725, "loss": 4.9746, "mean_token_accuracy": 0.20916454046964644, "num_tokens": 41816176.0, "step": 24105 }, { "entropy": 5.602057361602784, "epoch": 1.875860727484925, "grad_norm": 1.171875, "learning_rate": 0.0004645108306943842, "loss": 5.0666, "mean_token_accuracy": 0.195235238969326, "num_tokens": 41825093.0, "step": 24110 }, { "entropy": 5.6813640117645265, "epoch": 1.8762497568566427, "grad_norm": 1.09375, "learning_rate": 0.0004644958890215707, "loss": 5.1438, "mean_token_accuracy": 0.1871057331562042, "num_tokens": 41834524.0, "step": 24115 }, { "entropy": 5.566799592971802, "epoch": 1.8766387862283602, "grad_norm": 1.25, "learning_rate": 0.0004644809444734586, "loss": 4.954, "mean_token_accuracy": 0.2046997606754303, "num_tokens": 41843188.0, "step": 24120 }, { "entropy": 5.60067400932312, "epoch": 1.8770278156000777, "grad_norm": 1.1015625, "learning_rate": 0.00046446599705027487, "loss": 5.0506, "mean_token_accuracy": 0.19989901334047316, "num_tokens": 41852296.0, "step": 24125 }, { "entropy": 5.657697916030884, "epoch": 1.8774168449717954, "grad_norm": 1.046875, "learning_rate": 0.00046445104675224607, "loss": 5.1045, "mean_token_accuracy": 0.19328932762145995, "num_tokens": 41861641.0, "step": 24130 }, { "entropy": 5.603545379638672, "epoch": 1.877805874343513, "grad_norm": 1.1015625, "learning_rate": 0.0004644360935795993, "loss": 5.0108, "mean_token_accuracy": 0.19552182853221894, "num_tokens": 41870463.0, "step": 24135 }, { "entropy": 5.632983160018921, "epoch": 1.8781949037152303, "grad_norm": 1.1171875, "learning_rate": 0.00046442113753256126, "loss": 5.0978, "mean_token_accuracy": 0.19663724154233933, "num_tokens": 41878739.0, "step": 24140 }, { "entropy": 5.648243618011475, "epoch": 1.878583933086948, "grad_norm": 1.1015625, "learning_rate": 0.00046440617861135905, "loss": 5.0743, "mean_token_accuracy": 0.19633927792310715, "num_tokens": 41887211.0, "step": 24145 }, { "entropy": 5.690827798843384, "epoch": 1.8789729624586657, "grad_norm": 1.1640625, "learning_rate": 0.0004643912168162194, "loss": 4.9762, "mean_token_accuracy": 0.2097786545753479, "num_tokens": 41895742.0, "step": 24150 }, { "entropy": 5.633557462692261, "epoch": 1.8793619918303832, "grad_norm": 1.09375, "learning_rate": 0.0004643762521473696, "loss": 5.0452, "mean_token_accuracy": 0.19837049543857574, "num_tokens": 41904866.0, "step": 24155 }, { "entropy": 5.667444229125977, "epoch": 1.8797510212021007, "grad_norm": 1.1328125, "learning_rate": 0.0004643612846050366, "loss": 5.1435, "mean_token_accuracy": 0.1922629028558731, "num_tokens": 41914237.0, "step": 24160 }, { "entropy": 5.588048124313355, "epoch": 1.8801400505738184, "grad_norm": 1.109375, "learning_rate": 0.00046434631418944744, "loss": 5.0111, "mean_token_accuracy": 0.199163556098938, "num_tokens": 41923070.0, "step": 24165 }, { "entropy": 5.622416353225708, "epoch": 1.8805290799455359, "grad_norm": 1.078125, "learning_rate": 0.0004643313409008294, "loss": 5.0183, "mean_token_accuracy": 0.19868772178888322, "num_tokens": 41932076.0, "step": 24170 }, { "entropy": 5.6362957000732425, "epoch": 1.8809181093172533, "grad_norm": 1.203125, "learning_rate": 0.00046431636473940956, "loss": 5.0802, "mean_token_accuracy": 0.1921983167529106, "num_tokens": 41941169.0, "step": 24175 }, { "entropy": 5.581415891647339, "epoch": 1.881307138688971, "grad_norm": 1.1015625, "learning_rate": 0.0004643013857054152, "loss": 4.9486, "mean_token_accuracy": 0.20275850594043732, "num_tokens": 41949499.0, "step": 24180 }, { "entropy": 5.6621486186981205, "epoch": 1.8816961680606887, "grad_norm": 1.1796875, "learning_rate": 0.00046428640379907367, "loss": 5.1269, "mean_token_accuracy": 0.1937190607190132, "num_tokens": 41957274.0, "step": 24185 }, { "entropy": 5.641084766387939, "epoch": 1.882085197432406, "grad_norm": 1.203125, "learning_rate": 0.00046427141902061225, "loss": 4.9763, "mean_token_accuracy": 0.1981686994433403, "num_tokens": 41965996.0, "step": 24190 }, { "entropy": 5.618721866607666, "epoch": 1.8824742268041237, "grad_norm": 1.0625, "learning_rate": 0.0004642564313702582, "loss": 5.0201, "mean_token_accuracy": 0.2017039641737938, "num_tokens": 41974652.0, "step": 24195 }, { "entropy": 5.645183849334717, "epoch": 1.8828632561758414, "grad_norm": 1.1796875, "learning_rate": 0.00046424144084823916, "loss": 5.0434, "mean_token_accuracy": 0.19532835036516188, "num_tokens": 41982699.0, "step": 24200 }, { "entropy": 5.638058757781982, "epoch": 1.8832522855475589, "grad_norm": 1.09375, "learning_rate": 0.0004642264474547824, "loss": 4.9867, "mean_token_accuracy": 0.20171062350273133, "num_tokens": 41991441.0, "step": 24205 }, { "entropy": 5.559622144699096, "epoch": 1.8836413149192763, "grad_norm": 1.140625, "learning_rate": 0.00046421145119011556, "loss": 4.9819, "mean_token_accuracy": 0.2049802675843239, "num_tokens": 42000683.0, "step": 24210 }, { "entropy": 5.631829404830933, "epoch": 1.884030344290994, "grad_norm": 1.109375, "learning_rate": 0.000464196452054466, "loss": 5.0675, "mean_token_accuracy": 0.20496142506599427, "num_tokens": 42009895.0, "step": 24215 }, { "entropy": 5.60044846534729, "epoch": 1.8844193736627115, "grad_norm": 1.125, "learning_rate": 0.0004641814500480615, "loss": 4.9403, "mean_token_accuracy": 0.20429756492376328, "num_tokens": 42018086.0, "step": 24220 }, { "entropy": 5.647305536270141, "epoch": 1.884808403034429, "grad_norm": 1.1640625, "learning_rate": 0.0004641664451711296, "loss": 5.0901, "mean_token_accuracy": 0.19267804473638533, "num_tokens": 42026959.0, "step": 24225 }, { "entropy": 5.563831186294555, "epoch": 1.8851974324061467, "grad_norm": 1.109375, "learning_rate": 0.00046415143742389793, "loss": 5.0265, "mean_token_accuracy": 0.20145693570375442, "num_tokens": 42035641.0, "step": 24230 }, { "entropy": 5.563266372680664, "epoch": 1.8855864617778644, "grad_norm": 1.125, "learning_rate": 0.0004641364268065943, "loss": 5.002, "mean_token_accuracy": 0.20542702078819275, "num_tokens": 42044565.0, "step": 24235 }, { "entropy": 5.670195770263672, "epoch": 1.8859754911495816, "grad_norm": 1.1953125, "learning_rate": 0.00046412141331944644, "loss": 5.0711, "mean_token_accuracy": 0.19172867983579636, "num_tokens": 42053088.0, "step": 24240 }, { "entropy": 5.626831817626953, "epoch": 1.8863645205212993, "grad_norm": 1.15625, "learning_rate": 0.00046410639696268206, "loss": 5.0503, "mean_token_accuracy": 0.1973019227385521, "num_tokens": 42061880.0, "step": 24245 }, { "entropy": 5.562259483337402, "epoch": 1.886753549893017, "grad_norm": 1.09375, "learning_rate": 0.0004640913777365292, "loss": 5.016, "mean_token_accuracy": 0.1989309936761856, "num_tokens": 42070767.0, "step": 24250 }, { "entropy": 5.594948196411133, "epoch": 1.8871425792647345, "grad_norm": 1.1015625, "learning_rate": 0.00046407635564121565, "loss": 4.9968, "mean_token_accuracy": 0.201524019241333, "num_tokens": 42080037.0, "step": 24255 }, { "entropy": 5.651088857650757, "epoch": 1.887531608636452, "grad_norm": 1.140625, "learning_rate": 0.00046406133067696936, "loss": 5.0022, "mean_token_accuracy": 0.20116045325994492, "num_tokens": 42088372.0, "step": 24260 }, { "entropy": 5.622855520248413, "epoch": 1.8879206380081697, "grad_norm": 1.1328125, "learning_rate": 0.0004640463028440182, "loss": 4.9789, "mean_token_accuracy": 0.2038220778107643, "num_tokens": 42096550.0, "step": 24265 }, { "entropy": 5.638905572891235, "epoch": 1.8883096673798871, "grad_norm": 1.1484375, "learning_rate": 0.0004640312721425904, "loss": 5.0242, "mean_token_accuracy": 0.20113109946250915, "num_tokens": 42105660.0, "step": 24270 }, { "entropy": 5.637365341186523, "epoch": 1.8886986967516046, "grad_norm": 1.1640625, "learning_rate": 0.0004640162385729139, "loss": 4.9888, "mean_token_accuracy": 0.20799051374197006, "num_tokens": 42114586.0, "step": 24275 }, { "entropy": 5.6243208885192875, "epoch": 1.8890877261233223, "grad_norm": 1.046875, "learning_rate": 0.0004640012021352168, "loss": 5.026, "mean_token_accuracy": 0.2021332263946533, "num_tokens": 42123104.0, "step": 24280 }, { "entropy": 5.700138807296753, "epoch": 1.88947675549504, "grad_norm": 1.1328125, "learning_rate": 0.0004639861628297273, "loss": 5.1412, "mean_token_accuracy": 0.19271664321422577, "num_tokens": 42132127.0, "step": 24285 }, { "entropy": 5.6688543319702145, "epoch": 1.8898657848667575, "grad_norm": 1.046875, "learning_rate": 0.00046397112065667354, "loss": 5.0916, "mean_token_accuracy": 0.19224951714277266, "num_tokens": 42141586.0, "step": 24290 }, { "entropy": 5.647853422164917, "epoch": 1.890254814238475, "grad_norm": 1.0859375, "learning_rate": 0.00046395607561628387, "loss": 5.0519, "mean_token_accuracy": 0.199610236287117, "num_tokens": 42151003.0, "step": 24295 }, { "entropy": 5.670290756225586, "epoch": 1.8906438436101927, "grad_norm": 1.234375, "learning_rate": 0.00046394102770878643, "loss": 5.063, "mean_token_accuracy": 0.20486216843128205, "num_tokens": 42159291.0, "step": 24300 }, { "entropy": 5.695429134368896, "epoch": 1.8910328729819101, "grad_norm": 1.1015625, "learning_rate": 0.00046392597693440974, "loss": 5.1269, "mean_token_accuracy": 0.18805170208215713, "num_tokens": 42167925.0, "step": 24305 }, { "entropy": 5.662264156341553, "epoch": 1.8914219023536276, "grad_norm": 1.09375, "learning_rate": 0.0004639109232933819, "loss": 5.0286, "mean_token_accuracy": 0.20066900551319122, "num_tokens": 42175866.0, "step": 24310 }, { "entropy": 5.6115350246429445, "epoch": 1.8918109317253453, "grad_norm": 1.0234375, "learning_rate": 0.0004638958667859316, "loss": 5.0103, "mean_token_accuracy": 0.2083840161561966, "num_tokens": 42184233.0, "step": 24315 }, { "entropy": 5.577487754821777, "epoch": 1.8921999610970628, "grad_norm": 1.0703125, "learning_rate": 0.0004638808074122872, "loss": 5.0782, "mean_token_accuracy": 0.2004465639591217, "num_tokens": 42192972.0, "step": 24320 }, { "entropy": 5.577836751937866, "epoch": 1.8925889904687803, "grad_norm": 1.15625, "learning_rate": 0.0004638657451726771, "loss": 4.9799, "mean_token_accuracy": 0.2070781797170639, "num_tokens": 42201380.0, "step": 24325 }, { "entropy": 5.6128246784210205, "epoch": 1.892978019840498, "grad_norm": 1.1328125, "learning_rate": 0.00046385068006732995, "loss": 5.0617, "mean_token_accuracy": 0.20002838522195815, "num_tokens": 42209276.0, "step": 24330 }, { "entropy": 5.721774005889893, "epoch": 1.8933670492122157, "grad_norm": 1.1015625, "learning_rate": 0.00046383561209647437, "loss": 5.172, "mean_token_accuracy": 0.19126823395490647, "num_tokens": 42218682.0, "step": 24335 }, { "entropy": 5.793478965759277, "epoch": 1.8937560785839331, "grad_norm": 1.1875, "learning_rate": 0.00046382054126033884, "loss": 5.2165, "mean_token_accuracy": 0.18135129064321517, "num_tokens": 42226692.0, "step": 24340 }, { "entropy": 5.7200113296508786, "epoch": 1.8941451079556506, "grad_norm": 1.1171875, "learning_rate": 0.0004638054675591523, "loss": 5.1607, "mean_token_accuracy": 0.18304943591356276, "num_tokens": 42235582.0, "step": 24345 }, { "entropy": 5.7111156463623045, "epoch": 1.8945341373273683, "grad_norm": 1.21875, "learning_rate": 0.0004637903909931432, "loss": 5.0015, "mean_token_accuracy": 0.20279635041952132, "num_tokens": 42244354.0, "step": 24350 }, { "entropy": 5.638956594467163, "epoch": 1.8949231666990858, "grad_norm": 1.203125, "learning_rate": 0.0004637753115625404, "loss": 4.9468, "mean_token_accuracy": 0.20747943818569184, "num_tokens": 42253062.0, "step": 24355 }, { "entropy": 5.6195777416229244, "epoch": 1.8953121960708033, "grad_norm": 1.1796875, "learning_rate": 0.0004637602292675726, "loss": 5.0863, "mean_token_accuracy": 0.19325755089521407, "num_tokens": 42262380.0, "step": 24360 }, { "entropy": 5.631731605529785, "epoch": 1.895701225442521, "grad_norm": 1.109375, "learning_rate": 0.0004637451441084689, "loss": 4.9858, "mean_token_accuracy": 0.2025330126285553, "num_tokens": 42270262.0, "step": 24365 }, { "entropy": 5.69953727722168, "epoch": 1.8960902548142384, "grad_norm": 1.09375, "learning_rate": 0.0004637300560854581, "loss": 5.08, "mean_token_accuracy": 0.20240751653909683, "num_tokens": 42278935.0, "step": 24370 }, { "entropy": 5.639438343048096, "epoch": 1.896479284185956, "grad_norm": 1.1796875, "learning_rate": 0.000463714965198769, "loss": 4.9911, "mean_token_accuracy": 0.19981719404459, "num_tokens": 42287354.0, "step": 24375 }, { "entropy": 5.642515182495117, "epoch": 1.8968683135576736, "grad_norm": 1.171875, "learning_rate": 0.0004636998714486307, "loss": 4.9906, "mean_token_accuracy": 0.20433096587657928, "num_tokens": 42296475.0, "step": 24380 }, { "entropy": 5.684169864654541, "epoch": 1.8972573429293913, "grad_norm": 1.1875, "learning_rate": 0.00046368477483527224, "loss": 5.1189, "mean_token_accuracy": 0.1893514111638069, "num_tokens": 42305306.0, "step": 24385 }, { "entropy": 5.597846508026123, "epoch": 1.8976463723011088, "grad_norm": 0.984375, "learning_rate": 0.0004636696753589226, "loss": 5.0608, "mean_token_accuracy": 0.19485608786344527, "num_tokens": 42314827.0, "step": 24390 }, { "entropy": 5.558150768280029, "epoch": 1.8980354016728263, "grad_norm": 1.15625, "learning_rate": 0.0004636545730198109, "loss": 4.9608, "mean_token_accuracy": 0.2087647795677185, "num_tokens": 42323396.0, "step": 24395 }, { "entropy": 5.675079345703125, "epoch": 1.898424431044544, "grad_norm": 1.078125, "learning_rate": 0.00046363946781816643, "loss": 5.039, "mean_token_accuracy": 0.19996761828660964, "num_tokens": 42331402.0, "step": 24400 }, { "entropy": 5.546563720703125, "epoch": 1.8988134604162614, "grad_norm": 1.1875, "learning_rate": 0.00046362435975421816, "loss": 4.9768, "mean_token_accuracy": 0.2084794521331787, "num_tokens": 42339458.0, "step": 24405 }, { "entropy": 5.669170188903808, "epoch": 1.899202489787979, "grad_norm": 1.1953125, "learning_rate": 0.00046360924882819554, "loss": 5.0688, "mean_token_accuracy": 0.19857478588819505, "num_tokens": 42346713.0, "step": 24410 }, { "entropy": 5.610304689407348, "epoch": 1.8995915191596966, "grad_norm": 1.109375, "learning_rate": 0.0004635941350403277, "loss": 4.9468, "mean_token_accuracy": 0.19908298850059508, "num_tokens": 42355429.0, "step": 24415 }, { "entropy": 5.558404922485352, "epoch": 1.899980548531414, "grad_norm": 1.09375, "learning_rate": 0.0004635790183908442, "loss": 5.015, "mean_token_accuracy": 0.20179400593042374, "num_tokens": 42364228.0, "step": 24420 }, { "entropy": 5.592688179016113, "epoch": 1.9003695779031315, "grad_norm": 1.0859375, "learning_rate": 0.00046356389887997415, "loss": 4.9073, "mean_token_accuracy": 0.20490742921829225, "num_tokens": 42372837.0, "step": 24425 }, { "entropy": 5.586138725280762, "epoch": 1.9007586072748492, "grad_norm": 1.171875, "learning_rate": 0.00046354877650794707, "loss": 4.9323, "mean_token_accuracy": 0.2144758954644203, "num_tokens": 42381792.0, "step": 24430 }, { "entropy": 5.633318948745727, "epoch": 1.901147636646567, "grad_norm": 1.109375, "learning_rate": 0.00046353365127499235, "loss": 5.073, "mean_token_accuracy": 0.1952102467417717, "num_tokens": 42390650.0, "step": 24435 }, { "entropy": 5.636834144592285, "epoch": 1.9015366660182844, "grad_norm": 1.125, "learning_rate": 0.0004635185231813396, "loss": 5.0227, "mean_token_accuracy": 0.2053901046514511, "num_tokens": 42399253.0, "step": 24440 }, { "entropy": 5.7118267059326175, "epoch": 1.901925695390002, "grad_norm": 1.171875, "learning_rate": 0.0004635033922272183, "loss": 5.235, "mean_token_accuracy": 0.1860508531332016, "num_tokens": 42407916.0, "step": 24445 }, { "entropy": 5.556915235519409, "epoch": 1.9023147247617196, "grad_norm": 1.140625, "learning_rate": 0.00046348825841285813, "loss": 4.936, "mean_token_accuracy": 0.20892727226018906, "num_tokens": 42416151.0, "step": 24450 }, { "entropy": 5.669441366195679, "epoch": 1.902703754133437, "grad_norm": 1.0625, "learning_rate": 0.0004634731217384886, "loss": 5.1588, "mean_token_accuracy": 0.1879504844546318, "num_tokens": 42424845.0, "step": 24455 }, { "entropy": 5.740513610839844, "epoch": 1.9030927835051545, "grad_norm": 1.15625, "learning_rate": 0.0004634579822043394, "loss": 5.0416, "mean_token_accuracy": 0.19471157044172288, "num_tokens": 42434022.0, "step": 24460 }, { "entropy": 5.713101863861084, "epoch": 1.9034818128768722, "grad_norm": 1.109375, "learning_rate": 0.00046344283981064035, "loss": 5.0899, "mean_token_accuracy": 0.19578209072351455, "num_tokens": 42443614.0, "step": 24465 }, { "entropy": 5.582330942153931, "epoch": 1.90387084224859, "grad_norm": 1.0625, "learning_rate": 0.00046342769455762114, "loss": 4.9268, "mean_token_accuracy": 0.20568129569292068, "num_tokens": 42452389.0, "step": 24470 }, { "entropy": 5.591967153549194, "epoch": 1.9042598716203072, "grad_norm": 1.265625, "learning_rate": 0.0004634125464455116, "loss": 5.0325, "mean_token_accuracy": 0.1921161249279976, "num_tokens": 42460796.0, "step": 24475 }, { "entropy": 5.651403284072876, "epoch": 1.9046489009920249, "grad_norm": 1.0703125, "learning_rate": 0.00046339739547454146, "loss": 5.1118, "mean_token_accuracy": 0.193360336124897, "num_tokens": 42470108.0, "step": 24480 }, { "entropy": 5.640319585800171, "epoch": 1.9050379303637426, "grad_norm": 1.1484375, "learning_rate": 0.00046338224164494074, "loss": 5.0637, "mean_token_accuracy": 0.18907781690359116, "num_tokens": 42478361.0, "step": 24485 }, { "entropy": 5.695958948135376, "epoch": 1.90542695973546, "grad_norm": 1.1875, "learning_rate": 0.00046336708495693933, "loss": 5.1266, "mean_token_accuracy": 0.19107698798179626, "num_tokens": 42486254.0, "step": 24490 }, { "entropy": 5.596610450744629, "epoch": 1.9058159891071775, "grad_norm": 1.1640625, "learning_rate": 0.00046335192541076725, "loss": 4.9756, "mean_token_accuracy": 0.20824598222970964, "num_tokens": 42495379.0, "step": 24495 }, { "entropy": 5.603166198730468, "epoch": 1.9062050184788952, "grad_norm": 1.140625, "learning_rate": 0.0004633367630066545, "loss": 5.034, "mean_token_accuracy": 0.19659366756677626, "num_tokens": 42503777.0, "step": 24500 }, { "entropy": 5.6704000473022464, "epoch": 1.9065940478506127, "grad_norm": 1.1953125, "learning_rate": 0.00046332159774483116, "loss": 5.102, "mean_token_accuracy": 0.19450739920139312, "num_tokens": 42512557.0, "step": 24505 }, { "entropy": 5.652904033660889, "epoch": 1.9069830772223302, "grad_norm": 1.15625, "learning_rate": 0.0004633064296255273, "loss": 5.0268, "mean_token_accuracy": 0.19977071285247802, "num_tokens": 42521245.0, "step": 24510 }, { "entropy": 5.650855493545532, "epoch": 1.9073721065940479, "grad_norm": 1.1171875, "learning_rate": 0.00046329125864897307, "loss": 4.9815, "mean_token_accuracy": 0.20128444880247115, "num_tokens": 42529726.0, "step": 24515 }, { "entropy": 5.5898766040802, "epoch": 1.9077611359657656, "grad_norm": 1.171875, "learning_rate": 0.0004632760848153987, "loss": 5.0169, "mean_token_accuracy": 0.20079877078533173, "num_tokens": 42538376.0, "step": 24520 }, { "entropy": 5.650997161865234, "epoch": 1.9081501653374828, "grad_norm": 1.0546875, "learning_rate": 0.0004632609081250345, "loss": 5.05, "mean_token_accuracy": 0.19425979256629944, "num_tokens": 42546977.0, "step": 24525 }, { "entropy": 5.684284734725952, "epoch": 1.9085391947092005, "grad_norm": 1.2109375, "learning_rate": 0.00046324572857811054, "loss": 5.0439, "mean_token_accuracy": 0.19376701414585112, "num_tokens": 42555531.0, "step": 24530 }, { "entropy": 5.647818899154663, "epoch": 1.9089282240809182, "grad_norm": 1.1015625, "learning_rate": 0.0004632305461748573, "loss": 5.0653, "mean_token_accuracy": 0.19656217694282532, "num_tokens": 42564803.0, "step": 24535 }, { "entropy": 5.637510299682617, "epoch": 1.9093172534526357, "grad_norm": 1.1484375, "learning_rate": 0.00046321536091550517, "loss": 5.0894, "mean_token_accuracy": 0.1919235810637474, "num_tokens": 42573560.0, "step": 24540 }, { "entropy": 5.6792449951171875, "epoch": 1.9097062828243532, "grad_norm": 1.125, "learning_rate": 0.0004632001728002845, "loss": 5.0608, "mean_token_accuracy": 0.19323238581418992, "num_tokens": 42582177.0, "step": 24545 }, { "entropy": 5.657521963119507, "epoch": 1.9100953121960709, "grad_norm": 1.1640625, "learning_rate": 0.0004631849818294257, "loss": 5.0596, "mean_token_accuracy": 0.19563550353050232, "num_tokens": 42590874.0, "step": 24550 }, { "entropy": 5.59767713546753, "epoch": 1.9104843415677883, "grad_norm": 1.0546875, "learning_rate": 0.00046316978800315934, "loss": 4.9588, "mean_token_accuracy": 0.203984859585762, "num_tokens": 42599644.0, "step": 24555 }, { "entropy": 5.622258281707763, "epoch": 1.9108733709395058, "grad_norm": 1.1640625, "learning_rate": 0.000463154591321716, "loss": 5.0442, "mean_token_accuracy": 0.19949903190135956, "num_tokens": 42609207.0, "step": 24560 }, { "entropy": 5.68349609375, "epoch": 1.9112624003112235, "grad_norm": 1.09375, "learning_rate": 0.00046313939178532624, "loss": 5.1368, "mean_token_accuracy": 0.19085085690021514, "num_tokens": 42618669.0, "step": 24565 }, { "entropy": 5.669654130935669, "epoch": 1.9116514296829412, "grad_norm": 1.0625, "learning_rate": 0.0004631241893942206, "loss": 5.0423, "mean_token_accuracy": 0.1951256200671196, "num_tokens": 42628433.0, "step": 24570 }, { "entropy": 5.633660411834716, "epoch": 1.9120404590546585, "grad_norm": 1.1171875, "learning_rate": 0.00046310898414862983, "loss": 5.0013, "mean_token_accuracy": 0.20004089176654816, "num_tokens": 42636839.0, "step": 24575 }, { "entropy": 5.59145073890686, "epoch": 1.9124294884263762, "grad_norm": 1.109375, "learning_rate": 0.0004630937760487847, "loss": 5.0149, "mean_token_accuracy": 0.19636907875537873, "num_tokens": 42645328.0, "step": 24580 }, { "entropy": 5.64037823677063, "epoch": 1.9128185177980939, "grad_norm": 1.1953125, "learning_rate": 0.0004630785650949158, "loss": 5.1351, "mean_token_accuracy": 0.19012271612882614, "num_tokens": 42653883.0, "step": 24585 }, { "entropy": 5.648755025863648, "epoch": 1.9132075471698113, "grad_norm": 1.15625, "learning_rate": 0.0004630633512872541, "loss": 5.0653, "mean_token_accuracy": 0.1954011470079422, "num_tokens": 42662364.0, "step": 24590 }, { "entropy": 5.61629843711853, "epoch": 1.9135965765415288, "grad_norm": 1.1171875, "learning_rate": 0.00046304813462603035, "loss": 4.9255, "mean_token_accuracy": 0.20628367662429808, "num_tokens": 42670424.0, "step": 24595 }, { "entropy": 5.575474786758423, "epoch": 1.9139856059132465, "grad_norm": 1.0859375, "learning_rate": 0.0004630329151114754, "loss": 4.9689, "mean_token_accuracy": 0.20611010789871215, "num_tokens": 42679494.0, "step": 24600 }, { "entropy": 5.738251543045044, "epoch": 1.914374635284964, "grad_norm": 1.8359375, "learning_rate": 0.00046301769274382034, "loss": 5.0744, "mean_token_accuracy": 0.20497060418128968, "num_tokens": 42688042.0, "step": 24605 }, { "entropy": 5.692231035232544, "epoch": 1.9147636646566815, "grad_norm": 1.1796875, "learning_rate": 0.0004630024675232961, "loss": 5.1659, "mean_token_accuracy": 0.1929287686944008, "num_tokens": 42696859.0, "step": 24610 }, { "entropy": 5.646741819381714, "epoch": 1.9151526940283992, "grad_norm": 1.1015625, "learning_rate": 0.00046298723945013354, "loss": 5.0622, "mean_token_accuracy": 0.1929302081465721, "num_tokens": 42705291.0, "step": 24615 }, { "entropy": 5.624470329284668, "epoch": 1.9155417234001169, "grad_norm": 1.09375, "learning_rate": 0.0004629720085245639, "loss": 5.0688, "mean_token_accuracy": 0.19549999982118607, "num_tokens": 42713777.0, "step": 24620 }, { "entropy": 5.628227186203003, "epoch": 1.9159307527718341, "grad_norm": 1.1484375, "learning_rate": 0.0004629567747468182, "loss": 5.1155, "mean_token_accuracy": 0.19767093509435654, "num_tokens": 42722373.0, "step": 24625 }, { "entropy": 5.668879127502441, "epoch": 1.9163197821435518, "grad_norm": 1.15625, "learning_rate": 0.0004629415381171276, "loss": 4.9857, "mean_token_accuracy": 0.20418670028448105, "num_tokens": 42730791.0, "step": 24630 }, { "entropy": 5.643102359771729, "epoch": 1.9167088115152695, "grad_norm": 1.1015625, "learning_rate": 0.00046292629863572325, "loss": 5.0604, "mean_token_accuracy": 0.19796037822961807, "num_tokens": 42739448.0, "step": 24635 }, { "entropy": 5.671561145782471, "epoch": 1.917097840886987, "grad_norm": 1.0703125, "learning_rate": 0.0004629110563028365, "loss": 5.0715, "mean_token_accuracy": 0.1990448862314224, "num_tokens": 42748757.0, "step": 24640 }, { "entropy": 5.6473040103912355, "epoch": 1.9174868702587045, "grad_norm": 1.0703125, "learning_rate": 0.0004628958111186985, "loss": 4.9904, "mean_token_accuracy": 0.2013029158115387, "num_tokens": 42757166.0, "step": 24645 }, { "entropy": 5.6669761657714846, "epoch": 1.9178758996304222, "grad_norm": 1.171875, "learning_rate": 0.0004628805630835407, "loss": 5.0018, "mean_token_accuracy": 0.19748904705047607, "num_tokens": 42765671.0, "step": 24650 }, { "entropy": 5.6571794033050535, "epoch": 1.9182649290021396, "grad_norm": 1.1015625, "learning_rate": 0.0004628653121975944, "loss": 5.0485, "mean_token_accuracy": 0.20230790823698044, "num_tokens": 42774499.0, "step": 24655 }, { "entropy": 5.6204598903656, "epoch": 1.918653958373857, "grad_norm": 1.109375, "learning_rate": 0.000462850058461091, "loss": 5.013, "mean_token_accuracy": 0.199822998046875, "num_tokens": 42783237.0, "step": 24660 }, { "entropy": 5.618857765197754, "epoch": 1.9190429877455748, "grad_norm": 1.21875, "learning_rate": 0.0004628348018742619, "loss": 4.9904, "mean_token_accuracy": 0.19929829686880113, "num_tokens": 42791217.0, "step": 24665 }, { "entropy": 5.5690484046936035, "epoch": 1.9194320171172925, "grad_norm": 1.1328125, "learning_rate": 0.0004628195424373387, "loss": 4.9934, "mean_token_accuracy": 0.20553092062473297, "num_tokens": 42799885.0, "step": 24670 }, { "entropy": 5.611097812652588, "epoch": 1.91982104648901, "grad_norm": 1.109375, "learning_rate": 0.00046280428015055286, "loss": 5.0203, "mean_token_accuracy": 0.19519444108009337, "num_tokens": 42809141.0, "step": 24675 }, { "entropy": 5.659239959716797, "epoch": 1.9202100758607274, "grad_norm": 1.0859375, "learning_rate": 0.00046278901501413606, "loss": 5.0758, "mean_token_accuracy": 0.19527681171894073, "num_tokens": 42817809.0, "step": 24680 }, { "entropy": 5.6279134273529055, "epoch": 1.9205991052324451, "grad_norm": 1.171875, "learning_rate": 0.00046277374702831983, "loss": 4.9852, "mean_token_accuracy": 0.194502030313015, "num_tokens": 42826813.0, "step": 24685 }, { "entropy": 5.64844446182251, "epoch": 1.9209881346041626, "grad_norm": 1.15625, "learning_rate": 0.00046275847619333576, "loss": 5.0267, "mean_token_accuracy": 0.19996881932020188, "num_tokens": 42835325.0, "step": 24690 }, { "entropy": 5.667098617553711, "epoch": 1.92137716397588, "grad_norm": 1.078125, "learning_rate": 0.00046274320250941576, "loss": 5.1208, "mean_token_accuracy": 0.20056177377700807, "num_tokens": 42843975.0, "step": 24695 }, { "entropy": 5.587963390350342, "epoch": 1.9217661933475978, "grad_norm": 1.140625, "learning_rate": 0.00046272792597679146, "loss": 4.9087, "mean_token_accuracy": 0.20481467992067337, "num_tokens": 42852146.0, "step": 24700 }, { "entropy": 5.611129522323608, "epoch": 1.9221552227193153, "grad_norm": 1.078125, "learning_rate": 0.00046271264659569474, "loss": 5.0491, "mean_token_accuracy": 0.1977107122540474, "num_tokens": 42860958.0, "step": 24705 }, { "entropy": 5.627826690673828, "epoch": 1.9225442520910327, "grad_norm": 1.1484375, "learning_rate": 0.0004626973643663573, "loss": 4.9505, "mean_token_accuracy": 0.21011203676462173, "num_tokens": 42869281.0, "step": 24710 }, { "entropy": 5.601044130325318, "epoch": 1.9229332814627504, "grad_norm": 1.1171875, "learning_rate": 0.0004626820792890112, "loss": 5.0528, "mean_token_accuracy": 0.2021949991583824, "num_tokens": 42878359.0, "step": 24715 }, { "entropy": 5.627505588531494, "epoch": 1.9233223108344681, "grad_norm": 1.2109375, "learning_rate": 0.0004626667913638882, "loss": 4.8639, "mean_token_accuracy": 0.21647423058748244, "num_tokens": 42886156.0, "step": 24720 }, { "entropy": 5.555444288253784, "epoch": 1.9237113402061856, "grad_norm": 1.1640625, "learning_rate": 0.0004626515005912203, "loss": 4.9071, "mean_token_accuracy": 0.20720550268888474, "num_tokens": 42894970.0, "step": 24725 }, { "entropy": 5.635870313644409, "epoch": 1.924100369577903, "grad_norm": 1.21875, "learning_rate": 0.0004626362069712397, "loss": 5.0569, "mean_token_accuracy": 0.20155273228883744, "num_tokens": 42903319.0, "step": 24730 }, { "entropy": 5.562239742279052, "epoch": 1.9244893989496208, "grad_norm": 1.171875, "learning_rate": 0.0004626209105041782, "loss": 5.0544, "mean_token_accuracy": 0.1946461617946625, "num_tokens": 42911912.0, "step": 24735 }, { "entropy": 5.652438735961914, "epoch": 1.9248784283213383, "grad_norm": 1.140625, "learning_rate": 0.000462605611190268, "loss": 4.9961, "mean_token_accuracy": 0.20458244085311889, "num_tokens": 42920329.0, "step": 24740 }, { "entropy": 5.636255693435669, "epoch": 1.9252674576930557, "grad_norm": 1.203125, "learning_rate": 0.00046259030902974133, "loss": 5.0233, "mean_token_accuracy": 0.19625500291585923, "num_tokens": 42928422.0, "step": 24745 }, { "entropy": 5.662633800506592, "epoch": 1.9256564870647734, "grad_norm": 1.1796875, "learning_rate": 0.0004625750040228302, "loss": 5.0016, "mean_token_accuracy": 0.20099778920412065, "num_tokens": 42937016.0, "step": 24750 }, { "entropy": 5.5781598567962645, "epoch": 1.926045516436491, "grad_norm": 1.1796875, "learning_rate": 0.00046255969616976704, "loss": 4.988, "mean_token_accuracy": 0.20309622436761857, "num_tokens": 42945209.0, "step": 24755 }, { "entropy": 5.621670198440552, "epoch": 1.9264345458082084, "grad_norm": 1.171875, "learning_rate": 0.000462544385470784, "loss": 5.0289, "mean_token_accuracy": 0.19761764854192734, "num_tokens": 42953798.0, "step": 24760 }, { "entropy": 5.634574890136719, "epoch": 1.926823575179926, "grad_norm": 1.1953125, "learning_rate": 0.0004625290719261134, "loss": 5.0175, "mean_token_accuracy": 0.19715730845928192, "num_tokens": 42961780.0, "step": 24765 }, { "entropy": 5.653252029418946, "epoch": 1.9272126045516438, "grad_norm": 1.21875, "learning_rate": 0.0004625137555359876, "loss": 5.0575, "mean_token_accuracy": 0.19824046939611434, "num_tokens": 42970087.0, "step": 24770 }, { "entropy": 5.638645601272583, "epoch": 1.9276016339233613, "grad_norm": 1.1328125, "learning_rate": 0.00046249843630063905, "loss": 5.0844, "mean_token_accuracy": 0.19670095294713974, "num_tokens": 42978732.0, "step": 24775 }, { "entropy": 5.638114547729492, "epoch": 1.9279906632950787, "grad_norm": 1.171875, "learning_rate": 0.0004624831142203001, "loss": 5.0823, "mean_token_accuracy": 0.19773340225219727, "num_tokens": 42986899.0, "step": 24780 }, { "entropy": 5.67489013671875, "epoch": 1.9283796926667964, "grad_norm": 1.1796875, "learning_rate": 0.00046246778929520346, "loss": 5.0162, "mean_token_accuracy": 0.2002897411584854, "num_tokens": 42995047.0, "step": 24785 }, { "entropy": 5.6587080478668215, "epoch": 1.928768722038514, "grad_norm": 1.140625, "learning_rate": 0.0004624524615255814, "loss": 5.0784, "mean_token_accuracy": 0.19814524352550505, "num_tokens": 43004377.0, "step": 24790 }, { "entropy": 5.650488042831421, "epoch": 1.9291577514102314, "grad_norm": 1.046875, "learning_rate": 0.00046243713091166655, "loss": 5.0794, "mean_token_accuracy": 0.19734552651643752, "num_tokens": 43013610.0, "step": 24795 }, { "entropy": 5.626767778396607, "epoch": 1.929546780781949, "grad_norm": 1.171875, "learning_rate": 0.0004624217974536916, "loss": 5.0461, "mean_token_accuracy": 0.19997764825820924, "num_tokens": 43022512.0, "step": 24800 }, { "entropy": 5.5781653881072994, "epoch": 1.9299358101536666, "grad_norm": 1.25, "learning_rate": 0.00046240646115188925, "loss": 4.9357, "mean_token_accuracy": 0.2067263126373291, "num_tokens": 43030588.0, "step": 24805 }, { "entropy": 5.710317325592041, "epoch": 1.930324839525384, "grad_norm": 1.15625, "learning_rate": 0.0004623911220064921, "loss": 5.0771, "mean_token_accuracy": 0.19707318842411042, "num_tokens": 43038717.0, "step": 24810 }, { "entropy": 5.632159233093262, "epoch": 1.9307138688971017, "grad_norm": 1.140625, "learning_rate": 0.00046237578001773297, "loss": 4.927, "mean_token_accuracy": 0.2116360440850258, "num_tokens": 43046736.0, "step": 24815 }, { "entropy": 5.586571884155274, "epoch": 1.9311028982688194, "grad_norm": 1.1328125, "learning_rate": 0.00046236043518584454, "loss": 4.8845, "mean_token_accuracy": 0.21447549611330033, "num_tokens": 43054773.0, "step": 24820 }, { "entropy": 5.6439896583557125, "epoch": 1.931491927640537, "grad_norm": 1.1875, "learning_rate": 0.0004623450875110597, "loss": 5.0323, "mean_token_accuracy": 0.1969242975115776, "num_tokens": 43062983.0, "step": 24825 }, { "entropy": 5.592229509353638, "epoch": 1.9318809570122544, "grad_norm": 1.1328125, "learning_rate": 0.00046232973699361147, "loss": 4.9807, "mean_token_accuracy": 0.20195406675338745, "num_tokens": 43071161.0, "step": 24830 }, { "entropy": 5.706205606460571, "epoch": 1.932269986383972, "grad_norm": 1.15625, "learning_rate": 0.0004623143836337326, "loss": 5.1792, "mean_token_accuracy": 0.1883398950099945, "num_tokens": 43080514.0, "step": 24835 }, { "entropy": 5.621080446243286, "epoch": 1.9326590157556895, "grad_norm": 1.09375, "learning_rate": 0.00046229902743165607, "loss": 4.9401, "mean_token_accuracy": 0.20712461322546005, "num_tokens": 43089177.0, "step": 24840 }, { "entropy": 5.648411464691162, "epoch": 1.933048045127407, "grad_norm": 1.0859375, "learning_rate": 0.0004622836683876149, "loss": 5.0942, "mean_token_accuracy": 0.19778121560811995, "num_tokens": 43097722.0, "step": 24845 }, { "entropy": 5.6128315925598145, "epoch": 1.9334370744991247, "grad_norm": 1.21875, "learning_rate": 0.0004622683065018422, "loss": 4.9647, "mean_token_accuracy": 0.2096147432923317, "num_tokens": 43106203.0, "step": 24850 }, { "entropy": 5.632354593276977, "epoch": 1.9338261038708422, "grad_norm": 1.140625, "learning_rate": 0.00046225294177457105, "loss": 5.0557, "mean_token_accuracy": 0.20138708800077437, "num_tokens": 43114607.0, "step": 24855 }, { "entropy": 5.734981298446655, "epoch": 1.9342151332425597, "grad_norm": 1.125, "learning_rate": 0.00046223757420603445, "loss": 5.1668, "mean_token_accuracy": 0.19181038141250611, "num_tokens": 43123179.0, "step": 24860 }, { "entropy": 5.672776556015014, "epoch": 1.9346041626142774, "grad_norm": 1.1953125, "learning_rate": 0.0004622222037964658, "loss": 5.0251, "mean_token_accuracy": 0.20019506365060807, "num_tokens": 43130883.0, "step": 24865 }, { "entropy": 5.525336503982544, "epoch": 1.934993191985995, "grad_norm": 1.0703125, "learning_rate": 0.00046220683054609815, "loss": 4.7649, "mean_token_accuracy": 0.22547600716352462, "num_tokens": 43139812.0, "step": 24870 }, { "entropy": 5.652823781967163, "epoch": 1.9353822213577125, "grad_norm": 1.1796875, "learning_rate": 0.00046219145445516483, "loss": 5.0887, "mean_token_accuracy": 0.19501292407512666, "num_tokens": 43148756.0, "step": 24875 }, { "entropy": 5.63412036895752, "epoch": 1.93577125072943, "grad_norm": 1.1171875, "learning_rate": 0.00046217607552389905, "loss": 5.0709, "mean_token_accuracy": 0.18875840604305266, "num_tokens": 43158131.0, "step": 24880 }, { "entropy": 5.605382108688355, "epoch": 1.9361602801011477, "grad_norm": 1.15625, "learning_rate": 0.00046216069375253435, "loss": 4.873, "mean_token_accuracy": 0.2065504014492035, "num_tokens": 43166400.0, "step": 24885 }, { "entropy": 5.660232257843018, "epoch": 1.9365493094728652, "grad_norm": 1.21875, "learning_rate": 0.000462145309141304, "loss": 4.989, "mean_token_accuracy": 0.20609867423772812, "num_tokens": 43175265.0, "step": 24890 }, { "entropy": 5.564515924453735, "epoch": 1.9369383388445827, "grad_norm": 1.1640625, "learning_rate": 0.0004621299216904414, "loss": 5.0439, "mean_token_accuracy": 0.19139577448368073, "num_tokens": 43183735.0, "step": 24895 }, { "entropy": 5.67817120552063, "epoch": 1.9373273682163004, "grad_norm": 1.1953125, "learning_rate": 0.00046211453140018006, "loss": 5.1294, "mean_token_accuracy": 0.1958629757165909, "num_tokens": 43192217.0, "step": 24900 }, { "entropy": 5.688234329223633, "epoch": 1.937716397588018, "grad_norm": 1.1640625, "learning_rate": 0.0004620991382707537, "loss": 5.0717, "mean_token_accuracy": 0.19365502446889876, "num_tokens": 43200241.0, "step": 24905 }, { "entropy": 5.6493556022644045, "epoch": 1.9381054269597353, "grad_norm": 1.1640625, "learning_rate": 0.00046208374230239556, "loss": 5.0394, "mean_token_accuracy": 0.19809513539075851, "num_tokens": 43209111.0, "step": 24910 }, { "entropy": 5.6868737697601315, "epoch": 1.938494456331453, "grad_norm": 1.046875, "learning_rate": 0.0004620683434953394, "loss": 5.1073, "mean_token_accuracy": 0.19366176873445512, "num_tokens": 43219091.0, "step": 24915 }, { "entropy": 5.637218332290649, "epoch": 1.9388834857031707, "grad_norm": 1.140625, "learning_rate": 0.00046205294184981896, "loss": 4.9778, "mean_token_accuracy": 0.20255449116230012, "num_tokens": 43227140.0, "step": 24920 }, { "entropy": 5.627275657653809, "epoch": 1.9392725150748882, "grad_norm": 1.09375, "learning_rate": 0.00046203753736606787, "loss": 5.1109, "mean_token_accuracy": 0.19363884180784224, "num_tokens": 43236356.0, "step": 24925 }, { "entropy": 5.580070877075196, "epoch": 1.9396615444466057, "grad_norm": 1.0625, "learning_rate": 0.0004620221300443197, "loss": 4.984, "mean_token_accuracy": 0.2093065395951271, "num_tokens": 43245083.0, "step": 24930 }, { "entropy": 5.687488460540772, "epoch": 1.9400505738183234, "grad_norm": 1.1953125, "learning_rate": 0.0004620067198848086, "loss": 5.0595, "mean_token_accuracy": 0.19701683670282363, "num_tokens": 43253042.0, "step": 24935 }, { "entropy": 5.611247444152832, "epoch": 1.9404396031900408, "grad_norm": 1.2421875, "learning_rate": 0.00046199130688776805, "loss": 5.0627, "mean_token_accuracy": 0.1973496124148369, "num_tokens": 43261783.0, "step": 24940 }, { "entropy": 5.680356025695801, "epoch": 1.9408286325617583, "grad_norm": 1.078125, "learning_rate": 0.00046197589105343204, "loss": 5.0118, "mean_token_accuracy": 0.20233181715011597, "num_tokens": 43270286.0, "step": 24945 }, { "entropy": 5.64131441116333, "epoch": 1.941217661933476, "grad_norm": 1.140625, "learning_rate": 0.0004619604723820345, "loss": 5.0781, "mean_token_accuracy": 0.19886183440685273, "num_tokens": 43278402.0, "step": 24950 }, { "entropy": 5.6017358779907225, "epoch": 1.9416066913051937, "grad_norm": 1.125, "learning_rate": 0.0004619450508738094, "loss": 5.0541, "mean_token_accuracy": 0.20523120164871217, "num_tokens": 43286791.0, "step": 24955 }, { "entropy": 5.653477048873901, "epoch": 1.941995720676911, "grad_norm": 1.2265625, "learning_rate": 0.00046192962652899056, "loss": 5.0535, "mean_token_accuracy": 0.1949478343129158, "num_tokens": 43295317.0, "step": 24960 }, { "entropy": 5.706910753250122, "epoch": 1.9423847500486286, "grad_norm": 1.1015625, "learning_rate": 0.00046191419934781236, "loss": 5.088, "mean_token_accuracy": 0.19810578972101212, "num_tokens": 43303545.0, "step": 24965 }, { "entropy": 5.66283597946167, "epoch": 1.9427737794203463, "grad_norm": 1.125, "learning_rate": 0.0004618987693305086, "loss": 5.107, "mean_token_accuracy": 0.19297386407852174, "num_tokens": 43311964.0, "step": 24970 }, { "entropy": 5.652525424957275, "epoch": 1.9431628087920638, "grad_norm": 1.2265625, "learning_rate": 0.0004618833364773135, "loss": 5.0558, "mean_token_accuracy": 0.19773730486631394, "num_tokens": 43320137.0, "step": 24975 }, { "entropy": 5.708747005462646, "epoch": 1.9435518381637813, "grad_norm": 1.2421875, "learning_rate": 0.00046186790078846127, "loss": 5.1124, "mean_token_accuracy": 0.19616594165563583, "num_tokens": 43328894.0, "step": 24980 }, { "entropy": 5.660366582870483, "epoch": 1.943940867535499, "grad_norm": 1.1015625, "learning_rate": 0.00046185246226418603, "loss": 5.0075, "mean_token_accuracy": 0.20192858278751374, "num_tokens": 43337269.0, "step": 24985 }, { "entropy": 5.637195062637329, "epoch": 1.9443298969072165, "grad_norm": 1.1875, "learning_rate": 0.00046183702090472206, "loss": 5.0617, "mean_token_accuracy": 0.20269419848918915, "num_tokens": 43345838.0, "step": 24990 }, { "entropy": 5.677445650100708, "epoch": 1.944718926278934, "grad_norm": 1.1171875, "learning_rate": 0.0004618215767103037, "loss": 5.1038, "mean_token_accuracy": 0.2020740658044815, "num_tokens": 43354395.0, "step": 24995 }, { "entropy": 5.663475608825683, "epoch": 1.9451079556506516, "grad_norm": 1.109375, "learning_rate": 0.0004618061296811653, "loss": 5.0072, "mean_token_accuracy": 0.20149689465761184, "num_tokens": 43363320.0, "step": 25000 }, { "entropy": 5.694008302688599, "epoch": 1.9454969850223693, "grad_norm": 1.09375, "learning_rate": 0.00046179067981754124, "loss": 5.0414, "mean_token_accuracy": 0.19401245415210724, "num_tokens": 43371528.0, "step": 25005 }, { "entropy": 5.666829681396484, "epoch": 1.9458860143940866, "grad_norm": 1.1796875, "learning_rate": 0.00046177522711966584, "loss": 5.0259, "mean_token_accuracy": 0.19954568296670913, "num_tokens": 43380177.0, "step": 25010 }, { "entropy": 5.5405370712280275, "epoch": 1.9462750437658043, "grad_norm": 1.2890625, "learning_rate": 0.00046175977158777377, "loss": 4.9059, "mean_token_accuracy": 0.21434044390916823, "num_tokens": 43387992.0, "step": 25015 }, { "entropy": 5.6540384769439695, "epoch": 1.946664073137522, "grad_norm": 1.1484375, "learning_rate": 0.0004617443132220993, "loss": 5.116, "mean_token_accuracy": 0.19350085109472276, "num_tokens": 43397620.0, "step": 25020 }, { "entropy": 5.630449199676514, "epoch": 1.9470531025092395, "grad_norm": 1.0859375, "learning_rate": 0.00046172885202287717, "loss": 4.926, "mean_token_accuracy": 0.21059797704219818, "num_tokens": 43407023.0, "step": 25025 }, { "entropy": 5.646168184280396, "epoch": 1.947442131880957, "grad_norm": 1.140625, "learning_rate": 0.00046171338799034194, "loss": 5.0061, "mean_token_accuracy": 0.1939883843064308, "num_tokens": 43415713.0, "step": 25030 }, { "entropy": 5.5894999504089355, "epoch": 1.9478311612526746, "grad_norm": 1.1171875, "learning_rate": 0.0004616979211247282, "loss": 5.0074, "mean_token_accuracy": 0.20587586164474486, "num_tokens": 43424383.0, "step": 25035 }, { "entropy": 5.615155410766602, "epoch": 1.9482201906243921, "grad_norm": 1.1640625, "learning_rate": 0.00046168245142627065, "loss": 5.0296, "mean_token_accuracy": 0.1998652473092079, "num_tokens": 43433090.0, "step": 25040 }, { "entropy": 5.605239725112915, "epoch": 1.9486092199961096, "grad_norm": 1.078125, "learning_rate": 0.0004616669788952041, "loss": 4.9908, "mean_token_accuracy": 0.1998765856027603, "num_tokens": 43442091.0, "step": 25045 }, { "entropy": 5.680023908615112, "epoch": 1.9489982493678273, "grad_norm": 1.2109375, "learning_rate": 0.00046165150353176315, "loss": 5.0243, "mean_token_accuracy": 0.20520639419555664, "num_tokens": 43450392.0, "step": 25050 }, { "entropy": 5.623055267333984, "epoch": 1.949387278739545, "grad_norm": 1.171875, "learning_rate": 0.0004616360253361828, "loss": 4.9677, "mean_token_accuracy": 0.2027704194188118, "num_tokens": 43459252.0, "step": 25055 }, { "entropy": 5.634825944900513, "epoch": 1.9497763081112622, "grad_norm": 1.1484375, "learning_rate": 0.00046162054430869777, "loss": 5.1467, "mean_token_accuracy": 0.1893460378050804, "num_tokens": 43467580.0, "step": 25060 }, { "entropy": 5.767076587677002, "epoch": 1.95016533748298, "grad_norm": 1.078125, "learning_rate": 0.000461605060449543, "loss": 5.1374, "mean_token_accuracy": 0.19065081477165222, "num_tokens": 43476879.0, "step": 25065 }, { "entropy": 5.719349193572998, "epoch": 1.9505543668546976, "grad_norm": 1.1328125, "learning_rate": 0.00046158957375895353, "loss": 5.0182, "mean_token_accuracy": 0.19732088595628738, "num_tokens": 43485881.0, "step": 25070 }, { "entropy": 5.610859107971192, "epoch": 1.950943396226415, "grad_norm": 1.140625, "learning_rate": 0.0004615740842371643, "loss": 4.9909, "mean_token_accuracy": 0.20582298934459686, "num_tokens": 43494598.0, "step": 25075 }, { "entropy": 5.633235263824463, "epoch": 1.9513324255981326, "grad_norm": 1.1171875, "learning_rate": 0.00046155859188441023, "loss": 5.0568, "mean_token_accuracy": 0.19475134909152986, "num_tokens": 43504638.0, "step": 25080 }, { "entropy": 5.73782696723938, "epoch": 1.9517214549698503, "grad_norm": 1.15625, "learning_rate": 0.0004615430967009265, "loss": 5.1148, "mean_token_accuracy": 0.19254491478204727, "num_tokens": 43512950.0, "step": 25085 }, { "entropy": 5.673038721084595, "epoch": 1.9521104843415678, "grad_norm": 1.109375, "learning_rate": 0.00046152759868694815, "loss": 5.1009, "mean_token_accuracy": 0.19723287522792815, "num_tokens": 43521383.0, "step": 25090 }, { "entropy": 5.5802469730377195, "epoch": 1.9524995137132852, "grad_norm": 1.0234375, "learning_rate": 0.0004615120978427104, "loss": 4.9089, "mean_token_accuracy": 0.20892249047756195, "num_tokens": 43529442.0, "step": 25095 }, { "entropy": 5.652156734466553, "epoch": 1.952888543085003, "grad_norm": 1.2421875, "learning_rate": 0.0004614965941684485, "loss": 5.0725, "mean_token_accuracy": 0.20027706325054168, "num_tokens": 43536938.0, "step": 25100 }, { "entropy": 5.621422386169433, "epoch": 1.9532775724567206, "grad_norm": 1.171875, "learning_rate": 0.0004614810876643975, "loss": 5.0515, "mean_token_accuracy": 0.19964662939310074, "num_tokens": 43545337.0, "step": 25105 }, { "entropy": 5.587710046768189, "epoch": 1.953666601828438, "grad_norm": 1.109375, "learning_rate": 0.00046146557833079286, "loss": 4.9328, "mean_token_accuracy": 0.20701862126588821, "num_tokens": 43553699.0, "step": 25110 }, { "entropy": 5.681480073928833, "epoch": 1.9540556312001556, "grad_norm": 1.2578125, "learning_rate": 0.0004614500661678698, "loss": 5.1475, "mean_token_accuracy": 0.1899921789765358, "num_tokens": 43562545.0, "step": 25115 }, { "entropy": 5.704886484146118, "epoch": 1.9544446605718733, "grad_norm": 1.1484375, "learning_rate": 0.0004614345511758639, "loss": 5.0872, "mean_token_accuracy": 0.20034031569957733, "num_tokens": 43571392.0, "step": 25120 }, { "entropy": 5.632265186309814, "epoch": 1.9548336899435907, "grad_norm": 1.1171875, "learning_rate": 0.00046141903335501034, "loss": 5.0253, "mean_token_accuracy": 0.19738117158412932, "num_tokens": 43579864.0, "step": 25125 }, { "entropy": 5.702379512786865, "epoch": 1.9552227193153082, "grad_norm": 1.203125, "learning_rate": 0.0004614035127055447, "loss": 5.1847, "mean_token_accuracy": 0.19249871522188186, "num_tokens": 43588546.0, "step": 25130 }, { "entropy": 5.6150120258331295, "epoch": 1.955611748687026, "grad_norm": 1.1796875, "learning_rate": 0.0004613879892277024, "loss": 4.9542, "mean_token_accuracy": 0.20899663120508194, "num_tokens": 43596582.0, "step": 25135 }, { "entropy": 5.617685699462891, "epoch": 1.9560007780587434, "grad_norm": 1.171875, "learning_rate": 0.000461372462921719, "loss": 5.1026, "mean_token_accuracy": 0.1958711937069893, "num_tokens": 43605727.0, "step": 25140 }, { "entropy": 5.66851773262024, "epoch": 1.9563898074304609, "grad_norm": 1.15625, "learning_rate": 0.0004613569337878302, "loss": 5.0632, "mean_token_accuracy": 0.19283104240894317, "num_tokens": 43614889.0, "step": 25145 }, { "entropy": 5.6127845287323, "epoch": 1.9567788368021786, "grad_norm": 1.1640625, "learning_rate": 0.0004613414018262715, "loss": 5.0063, "mean_token_accuracy": 0.20395666509866714, "num_tokens": 43624059.0, "step": 25150 }, { "entropy": 5.763114070892334, "epoch": 1.9571678661738963, "grad_norm": 1.1328125, "learning_rate": 0.0004613258670372786, "loss": 5.1664, "mean_token_accuracy": 0.19663935601711274, "num_tokens": 43633824.0, "step": 25155 }, { "entropy": 5.637830018997192, "epoch": 1.9575568955456137, "grad_norm": 1.09375, "learning_rate": 0.0004613103294210873, "loss": 4.9617, "mean_token_accuracy": 0.20805972665548325, "num_tokens": 43642010.0, "step": 25160 }, { "entropy": 5.731659078598023, "epoch": 1.9579459249173312, "grad_norm": 1.1484375, "learning_rate": 0.00046129478897793323, "loss": 5.1871, "mean_token_accuracy": 0.18737765848636628, "num_tokens": 43650828.0, "step": 25165 }, { "entropy": 5.73522720336914, "epoch": 1.958334954289049, "grad_norm": 1.1640625, "learning_rate": 0.00046127924570805236, "loss": 5.0677, "mean_token_accuracy": 0.19942291378974913, "num_tokens": 43659310.0, "step": 25170 }, { "entropy": 5.605695343017578, "epoch": 1.9587239836607664, "grad_norm": 1.109375, "learning_rate": 0.0004612636996116803, "loss": 4.9857, "mean_token_accuracy": 0.20076439827680587, "num_tokens": 43668238.0, "step": 25175 }, { "entropy": 5.586364030838013, "epoch": 1.9591130130324839, "grad_norm": 1.1171875, "learning_rate": 0.0004612481506890532, "loss": 4.931, "mean_token_accuracy": 0.21340907514095306, "num_tokens": 43675748.0, "step": 25180 }, { "entropy": 5.619478225708008, "epoch": 1.9595020424042016, "grad_norm": 1.109375, "learning_rate": 0.00046123259894040677, "loss": 5.1006, "mean_token_accuracy": 0.18909216225147246, "num_tokens": 43685750.0, "step": 25185 }, { "entropy": 5.6242107391357425, "epoch": 1.959891071775919, "grad_norm": 1.1796875, "learning_rate": 0.000461217044365977, "loss": 5.0273, "mean_token_accuracy": 0.1981663763523102, "num_tokens": 43694941.0, "step": 25190 }, { "entropy": 5.711131381988525, "epoch": 1.9602801011476365, "grad_norm": 1.1015625, "learning_rate": 0.0004612014869660002, "loss": 5.1104, "mean_token_accuracy": 0.19737430810928344, "num_tokens": 43703500.0, "step": 25195 }, { "entropy": 5.73074107170105, "epoch": 1.9606691305193542, "grad_norm": 1.1875, "learning_rate": 0.00046118592674071197, "loss": 5.17, "mean_token_accuracy": 0.19748992323875428, "num_tokens": 43712235.0, "step": 25200 }, { "entropy": 5.737745046615601, "epoch": 1.961058159891072, "grad_norm": 1.1796875, "learning_rate": 0.0004611703636903488, "loss": 5.1624, "mean_token_accuracy": 0.19198310524225234, "num_tokens": 43721047.0, "step": 25205 }, { "entropy": 5.679602766036988, "epoch": 1.9614471892627894, "grad_norm": 1.140625, "learning_rate": 0.0004611547978151466, "loss": 5.0919, "mean_token_accuracy": 0.19974581003189087, "num_tokens": 43729635.0, "step": 25210 }, { "entropy": 5.65899806022644, "epoch": 1.9618362186345069, "grad_norm": 1.171875, "learning_rate": 0.00046113922911534167, "loss": 5.0279, "mean_token_accuracy": 0.19842036068439484, "num_tokens": 43737748.0, "step": 25215 }, { "entropy": 5.707031536102295, "epoch": 1.9622252480062246, "grad_norm": 1.21875, "learning_rate": 0.0004611236575911702, "loss": 5.0034, "mean_token_accuracy": 0.20649076551198958, "num_tokens": 43745999.0, "step": 25220 }, { "entropy": 5.587418270111084, "epoch": 1.962614277377942, "grad_norm": 1.171875, "learning_rate": 0.00046110808324286844, "loss": 4.8702, "mean_token_accuracy": 0.21340948939323426, "num_tokens": 43754029.0, "step": 25225 }, { "entropy": 5.6300952434539795, "epoch": 1.9630033067496595, "grad_norm": 1.171875, "learning_rate": 0.00046109250607067275, "loss": 5.0069, "mean_token_accuracy": 0.2039915904402733, "num_tokens": 43762289.0, "step": 25230 }, { "entropy": 5.659026384353638, "epoch": 1.9633923361213772, "grad_norm": 1.1875, "learning_rate": 0.0004610769260748196, "loss": 5.1075, "mean_token_accuracy": 0.19112219661474228, "num_tokens": 43771479.0, "step": 25235 }, { "entropy": 5.536900281906128, "epoch": 1.9637813654930947, "grad_norm": 1.1484375, "learning_rate": 0.0004610613432555451, "loss": 4.9376, "mean_token_accuracy": 0.20577784031629562, "num_tokens": 43779889.0, "step": 25240 }, { "entropy": 5.66662974357605, "epoch": 1.9641703948648122, "grad_norm": 1.1875, "learning_rate": 0.00046104575761308597, "loss": 4.9932, "mean_token_accuracy": 0.21194309890270233, "num_tokens": 43788394.0, "step": 25245 }, { "entropy": 5.6847496509552, "epoch": 1.9645594242365298, "grad_norm": 1.1875, "learning_rate": 0.0004610301691476786, "loss": 5.0589, "mean_token_accuracy": 0.1910705268383026, "num_tokens": 43797188.0, "step": 25250 }, { "entropy": 5.726570081710816, "epoch": 1.9649484536082475, "grad_norm": 1.140625, "learning_rate": 0.0004610145778595594, "loss": 5.1185, "mean_token_accuracy": 0.1970916822552681, "num_tokens": 43806174.0, "step": 25255 }, { "entropy": 5.60731143951416, "epoch": 1.965337482979965, "grad_norm": 1.1328125, "learning_rate": 0.0004609989837489651, "loss": 4.9731, "mean_token_accuracy": 0.2124431014060974, "num_tokens": 43814704.0, "step": 25260 }, { "entropy": 5.550804615020752, "epoch": 1.9657265123516825, "grad_norm": 1.1328125, "learning_rate": 0.00046098338681613234, "loss": 4.9227, "mean_token_accuracy": 0.20020733922719955, "num_tokens": 43823122.0, "step": 25265 }, { "entropy": 5.631639003753662, "epoch": 1.9661155417234002, "grad_norm": 1.1796875, "learning_rate": 0.0004609677870612976, "loss": 4.9954, "mean_token_accuracy": 0.21023277938365936, "num_tokens": 43832281.0, "step": 25270 }, { "entropy": 5.641079330444336, "epoch": 1.9665045710951177, "grad_norm": 1.1328125, "learning_rate": 0.0004609521844846978, "loss": 4.9848, "mean_token_accuracy": 0.20147421956062317, "num_tokens": 43840351.0, "step": 25275 }, { "entropy": 5.682806444168091, "epoch": 1.9668936004668351, "grad_norm": 1.1171875, "learning_rate": 0.0004609365790865695, "loss": 5.113, "mean_token_accuracy": 0.19182565659284592, "num_tokens": 43849469.0, "step": 25280 }, { "entropy": 5.696728515625, "epoch": 1.9672826298385528, "grad_norm": 1.1484375, "learning_rate": 0.00046092097086714956, "loss": 5.0223, "mean_token_accuracy": 0.19974860399961472, "num_tokens": 43858013.0, "step": 25285 }, { "entropy": 5.662891435623169, "epoch": 1.9676716592102705, "grad_norm": 1.1484375, "learning_rate": 0.00046090535982667486, "loss": 4.9946, "mean_token_accuracy": 0.2044377714395523, "num_tokens": 43867056.0, "step": 25290 }, { "entropy": 5.619607210159302, "epoch": 1.9680606885819878, "grad_norm": 1.15625, "learning_rate": 0.00046088974596538216, "loss": 4.9909, "mean_token_accuracy": 0.2038848340511322, "num_tokens": 43875160.0, "step": 25295 }, { "entropy": 5.558274364471435, "epoch": 1.9684497179537055, "grad_norm": 1.15625, "learning_rate": 0.0004608741292835085, "loss": 4.9933, "mean_token_accuracy": 0.20653787404298782, "num_tokens": 43884243.0, "step": 25300 }, { "entropy": 5.604363059997558, "epoch": 1.9688387473254232, "grad_norm": 1.0859375, "learning_rate": 0.0004608585097812907, "loss": 5.0173, "mean_token_accuracy": 0.19961607158184053, "num_tokens": 43893378.0, "step": 25305 }, { "entropy": 5.615960693359375, "epoch": 1.9692277766971407, "grad_norm": 1.015625, "learning_rate": 0.0004608428874589659, "loss": 4.9576, "mean_token_accuracy": 0.2052847057580948, "num_tokens": 43902095.0, "step": 25310 }, { "entropy": 5.680431365966797, "epoch": 1.9696168060688581, "grad_norm": 1.203125, "learning_rate": 0.0004608272623167711, "loss": 5.0553, "mean_token_accuracy": 0.19897454380989074, "num_tokens": 43911452.0, "step": 25315 }, { "entropy": 5.599043369293213, "epoch": 1.9700058354405758, "grad_norm": 1.203125, "learning_rate": 0.00046081163435494335, "loss": 4.9419, "mean_token_accuracy": 0.20402944087982178, "num_tokens": 43920208.0, "step": 25320 }, { "entropy": 5.6559473991394045, "epoch": 1.9703948648122933, "grad_norm": 1.140625, "learning_rate": 0.0004607960035737198, "loss": 5.1011, "mean_token_accuracy": 0.1990422412753105, "num_tokens": 43929069.0, "step": 25325 }, { "entropy": 5.735771656036377, "epoch": 1.9707838941840108, "grad_norm": 1.1953125, "learning_rate": 0.0004607803699733376, "loss": 5.0755, "mean_token_accuracy": 0.19198578000068664, "num_tokens": 43937444.0, "step": 25330 }, { "entropy": 5.712236547470093, "epoch": 1.9711729235557285, "grad_norm": 1.125, "learning_rate": 0.000460764733554034, "loss": 5.11, "mean_token_accuracy": 0.19250813126564026, "num_tokens": 43946744.0, "step": 25335 }, { "entropy": 5.702378606796264, "epoch": 1.9715619529274462, "grad_norm": 1.25, "learning_rate": 0.00046074909431604623, "loss": 5.0882, "mean_token_accuracy": 0.18863240778446197, "num_tokens": 43954810.0, "step": 25340 }, { "entropy": 5.682041645050049, "epoch": 1.9719509822991634, "grad_norm": 1.140625, "learning_rate": 0.0004607334522596116, "loss": 5.0505, "mean_token_accuracy": 0.20446985810995102, "num_tokens": 43963366.0, "step": 25345 }, { "entropy": 5.636849784851075, "epoch": 1.9723400116708811, "grad_norm": 1.109375, "learning_rate": 0.0004607178073849675, "loss": 4.9988, "mean_token_accuracy": 0.19967873096466066, "num_tokens": 43972170.0, "step": 25350 }, { "entropy": 5.638350629806519, "epoch": 1.9727290410425988, "grad_norm": 1.0703125, "learning_rate": 0.0004607021596923512, "loss": 5.0992, "mean_token_accuracy": 0.1934046357870102, "num_tokens": 43980743.0, "step": 25355 }, { "entropy": 5.6676109790802, "epoch": 1.9731180704143163, "grad_norm": 1.0546875, "learning_rate": 0.0004606865091820003, "loss": 4.998, "mean_token_accuracy": 0.1990864247083664, "num_tokens": 43990332.0, "step": 25360 }, { "entropy": 5.639616012573242, "epoch": 1.9735070997860338, "grad_norm": 1.0546875, "learning_rate": 0.0004606708558541521, "loss": 5.0428, "mean_token_accuracy": 0.19978637546300887, "num_tokens": 43999058.0, "step": 25365 }, { "entropy": 5.666986322402954, "epoch": 1.9738961291577515, "grad_norm": 1.109375, "learning_rate": 0.0004606551997090442, "loss": 5.0352, "mean_token_accuracy": 0.20471272617578506, "num_tokens": 44008310.0, "step": 25370 }, { "entropy": 5.647110462188721, "epoch": 1.974285158529469, "grad_norm": 1.1875, "learning_rate": 0.0004606395407469141, "loss": 5.0025, "mean_token_accuracy": 0.20494289547204972, "num_tokens": 44016818.0, "step": 25375 }, { "entropy": 5.71036376953125, "epoch": 1.9746741879011864, "grad_norm": 1.1171875, "learning_rate": 0.0004606238789679995, "loss": 5.1219, "mean_token_accuracy": 0.1914032891392708, "num_tokens": 44024755.0, "step": 25380 }, { "entropy": 5.692535448074341, "epoch": 1.9750632172729041, "grad_norm": 1.078125, "learning_rate": 0.0004606082143725381, "loss": 5.0754, "mean_token_accuracy": 0.1972908392548561, "num_tokens": 44033416.0, "step": 25385 }, { "entropy": 5.630068254470825, "epoch": 1.9754522466446218, "grad_norm": 1.15625, "learning_rate": 0.0004605925469607673, "loss": 5.0527, "mean_token_accuracy": 0.20800873041152954, "num_tokens": 44041487.0, "step": 25390 }, { "entropy": 5.657685422897339, "epoch": 1.975841276016339, "grad_norm": 1.15625, "learning_rate": 0.00046057687673292506, "loss": 5.0649, "mean_token_accuracy": 0.20380718559026717, "num_tokens": 44050766.0, "step": 25395 }, { "entropy": 5.7061137676239015, "epoch": 1.9762303053880568, "grad_norm": 1.140625, "learning_rate": 0.00046056120368924907, "loss": 5.1533, "mean_token_accuracy": 0.20188030302524568, "num_tokens": 44060173.0, "step": 25400 }, { "entropy": 5.6374327659606935, "epoch": 1.9766193347597745, "grad_norm": 1.1484375, "learning_rate": 0.0004605455278299772, "loss": 4.9494, "mean_token_accuracy": 0.20633335411548615, "num_tokens": 44068472.0, "step": 25405 }, { "entropy": 5.6337072372436525, "epoch": 1.977008364131492, "grad_norm": 1.2578125, "learning_rate": 0.0004605298491553472, "loss": 5.0409, "mean_token_accuracy": 0.20279279053211213, "num_tokens": 44077209.0, "step": 25410 }, { "entropy": 5.685975742340088, "epoch": 1.9773973935032094, "grad_norm": 1.0625, "learning_rate": 0.0004605141676655971, "loss": 5.1627, "mean_token_accuracy": 0.19298152327537538, "num_tokens": 44086525.0, "step": 25415 }, { "entropy": 5.639989805221558, "epoch": 1.9777864228749271, "grad_norm": 1.1171875, "learning_rate": 0.00046049848336096485, "loss": 5.0491, "mean_token_accuracy": 0.20134729146957397, "num_tokens": 44095101.0, "step": 25420 }, { "entropy": 5.635927963256836, "epoch": 1.9781754522466446, "grad_norm": 1.1875, "learning_rate": 0.0004604827962416883, "loss": 4.9826, "mean_token_accuracy": 0.2069521501660347, "num_tokens": 44103469.0, "step": 25425 }, { "entropy": 5.586925363540649, "epoch": 1.978564481618362, "grad_norm": 1.0625, "learning_rate": 0.0004604671063080055, "loss": 4.9399, "mean_token_accuracy": 0.2012014403939247, "num_tokens": 44112161.0, "step": 25430 }, { "entropy": 5.7014970779418945, "epoch": 1.9789535109900798, "grad_norm": 1.1328125, "learning_rate": 0.0004604514135601546, "loss": 5.0488, "mean_token_accuracy": 0.20267467200756073, "num_tokens": 44120452.0, "step": 25435 }, { "entropy": 5.726767730712891, "epoch": 1.9793425403617975, "grad_norm": 1.15625, "learning_rate": 0.0004604357179983736, "loss": 5.102, "mean_token_accuracy": 0.19106168150901795, "num_tokens": 44129581.0, "step": 25440 }, { "entropy": 5.704273748397827, "epoch": 1.9797315697335147, "grad_norm": 1.140625, "learning_rate": 0.0004604200196229009, "loss": 5.0478, "mean_token_accuracy": 0.2002254068851471, "num_tokens": 44138086.0, "step": 25445 }, { "entropy": 5.6224195003509525, "epoch": 1.9801205991052324, "grad_norm": 1.15625, "learning_rate": 0.0004604043184339744, "loss": 5.0167, "mean_token_accuracy": 0.2082246258854866, "num_tokens": 44146549.0, "step": 25450 }, { "entropy": 5.729413843154907, "epoch": 1.9805096284769501, "grad_norm": 1.15625, "learning_rate": 0.0004603886144318325, "loss": 5.0717, "mean_token_accuracy": 0.19452007710933686, "num_tokens": 44156142.0, "step": 25455 }, { "entropy": 5.672995901107788, "epoch": 1.9808986578486676, "grad_norm": 1.1328125, "learning_rate": 0.00046037290761671346, "loss": 5.0516, "mean_token_accuracy": 0.19872729778289794, "num_tokens": 44165023.0, "step": 25460 }, { "entropy": 5.630957889556885, "epoch": 1.981287687220385, "grad_norm": 1.1953125, "learning_rate": 0.0004603571979888556, "loss": 5.0327, "mean_token_accuracy": 0.19420906901359558, "num_tokens": 44174034.0, "step": 25465 }, { "entropy": 5.653580379486084, "epoch": 1.9816767165921028, "grad_norm": 1.1484375, "learning_rate": 0.0004603414855484973, "loss": 5.1096, "mean_token_accuracy": 0.18888244032859802, "num_tokens": 44183072.0, "step": 25470 }, { "entropy": 5.645628929138184, "epoch": 1.9820657459638202, "grad_norm": 1.0234375, "learning_rate": 0.000460325770295877, "loss": 5.0599, "mean_token_accuracy": 0.1925435930490494, "num_tokens": 44192181.0, "step": 25475 }, { "entropy": 5.657412719726563, "epoch": 1.9824547753355377, "grad_norm": 1.09375, "learning_rate": 0.00046031005223123297, "loss": 4.9821, "mean_token_accuracy": 0.20651986449956894, "num_tokens": 44200967.0, "step": 25480 }, { "entropy": 5.652716588973999, "epoch": 1.9828438047072554, "grad_norm": 1.09375, "learning_rate": 0.000460294331354804, "loss": 5.048, "mean_token_accuracy": 0.19914910346269607, "num_tokens": 44209432.0, "step": 25485 }, { "entropy": 5.6037359714508055, "epoch": 1.983232834078973, "grad_norm": 1.125, "learning_rate": 0.0004602786076668283, "loss": 5.0206, "mean_token_accuracy": 0.2004614368081093, "num_tokens": 44218503.0, "step": 25490 }, { "entropy": 5.602372407913208, "epoch": 1.9836218634506906, "grad_norm": 1.09375, "learning_rate": 0.00046026288116754477, "loss": 4.9713, "mean_token_accuracy": 0.20817015767097474, "num_tokens": 44227164.0, "step": 25495 }, { "entropy": 5.629094123840332, "epoch": 1.984010892822408, "grad_norm": 1.1953125, "learning_rate": 0.0004602471518571919, "loss": 5.0395, "mean_token_accuracy": 0.20031502544879914, "num_tokens": 44235950.0, "step": 25500 }, { "entropy": 5.6339497566223145, "epoch": 1.9843999221941258, "grad_norm": 1.140625, "learning_rate": 0.0004602314197360083, "loss": 4.9939, "mean_token_accuracy": 0.2064699187874794, "num_tokens": 44244098.0, "step": 25505 }, { "entropy": 5.651449298858642, "epoch": 1.9847889515658432, "grad_norm": 1.1796875, "learning_rate": 0.0004602156848042328, "loss": 5.0788, "mean_token_accuracy": 0.19422102719545364, "num_tokens": 44252798.0, "step": 25510 }, { "entropy": 5.662745714187622, "epoch": 1.9851779809375607, "grad_norm": 1.140625, "learning_rate": 0.000460199947062104, "loss": 5.0859, "mean_token_accuracy": 0.2003183811903, "num_tokens": 44261662.0, "step": 25515 }, { "entropy": 5.732520580291748, "epoch": 1.9855670103092784, "grad_norm": 1.1484375, "learning_rate": 0.00046018420650986074, "loss": 5.115, "mean_token_accuracy": 0.19591234475374222, "num_tokens": 44270480.0, "step": 25520 }, { "entropy": 5.699027061462402, "epoch": 1.9859560396809959, "grad_norm": 1.2109375, "learning_rate": 0.000460168463147742, "loss": 5.0393, "mean_token_accuracy": 0.19897289127111434, "num_tokens": 44278673.0, "step": 25525 }, { "entropy": 5.54760332107544, "epoch": 1.9863450690527134, "grad_norm": 1.1484375, "learning_rate": 0.0004601527169759865, "loss": 4.9214, "mean_token_accuracy": 0.2061988204717636, "num_tokens": 44287465.0, "step": 25530 }, { "entropy": 5.65514907836914, "epoch": 1.986734098424431, "grad_norm": 1.1953125, "learning_rate": 0.0004601369679948333, "loss": 5.1196, "mean_token_accuracy": 0.19466570466756822, "num_tokens": 44296204.0, "step": 25535 }, { "entropy": 5.760001707077026, "epoch": 1.9871231277961487, "grad_norm": 1.125, "learning_rate": 0.00046012121620452127, "loss": 5.0897, "mean_token_accuracy": 0.19401615858078003, "num_tokens": 44305338.0, "step": 25540 }, { "entropy": 5.656718444824219, "epoch": 1.9875121571678662, "grad_norm": 1.296875, "learning_rate": 0.0004601054616052893, "loss": 4.9651, "mean_token_accuracy": 0.20443056970834733, "num_tokens": 44312960.0, "step": 25545 }, { "entropy": 5.613424015045166, "epoch": 1.9879011865395837, "grad_norm": 1.171875, "learning_rate": 0.00046008970419737674, "loss": 4.9891, "mean_token_accuracy": 0.20345779806375502, "num_tokens": 44321367.0, "step": 25550 }, { "entropy": 5.609660673141479, "epoch": 1.9882902159113014, "grad_norm": 1.0859375, "learning_rate": 0.0004600739439810225, "loss": 5.0643, "mean_token_accuracy": 0.19806535691022872, "num_tokens": 44330294.0, "step": 25555 }, { "entropy": 5.7234132289886475, "epoch": 1.9886792452830189, "grad_norm": 1.1875, "learning_rate": 0.00046005818095646564, "loss": 5.0718, "mean_token_accuracy": 0.19891916811466218, "num_tokens": 44338639.0, "step": 25560 }, { "entropy": 5.598255681991577, "epoch": 1.9890682746547363, "grad_norm": 1.1171875, "learning_rate": 0.00046004241512394544, "loss": 4.9541, "mean_token_accuracy": 0.2052053228020668, "num_tokens": 44346911.0, "step": 25565 }, { "entropy": 5.617299938201905, "epoch": 1.989457304026454, "grad_norm": 1.0546875, "learning_rate": 0.0004600266464837012, "loss": 5.0506, "mean_token_accuracy": 0.19765550196170806, "num_tokens": 44355580.0, "step": 25570 }, { "entropy": 5.686030912399292, "epoch": 1.9898463333981715, "grad_norm": 1.3359375, "learning_rate": 0.0004600108750359721, "loss": 5.0643, "mean_token_accuracy": 0.19487664252519607, "num_tokens": 44363465.0, "step": 25575 }, { "entropy": 5.655925655364991, "epoch": 1.990235362769889, "grad_norm": 1.1953125, "learning_rate": 0.00045999510078099736, "loss": 5.0211, "mean_token_accuracy": 0.2082530975341797, "num_tokens": 44372797.0, "step": 25580 }, { "entropy": 5.625739240646363, "epoch": 1.9906243921416067, "grad_norm": 1.1171875, "learning_rate": 0.00045997932371901645, "loss": 5.0187, "mean_token_accuracy": 0.20046750009059905, "num_tokens": 44381537.0, "step": 25585 }, { "entropy": 5.644833326339722, "epoch": 1.9910134215133244, "grad_norm": 1.15625, "learning_rate": 0.0004599635438502687, "loss": 5.0301, "mean_token_accuracy": 0.2057890623807907, "num_tokens": 44390170.0, "step": 25590 }, { "entropy": 5.683741331100464, "epoch": 1.9914024508850419, "grad_norm": 1.0859375, "learning_rate": 0.00045994776117499363, "loss": 5.0973, "mean_token_accuracy": 0.19716639220714569, "num_tokens": 44398545.0, "step": 25595 }, { "entropy": 5.632124328613282, "epoch": 1.9917914802567593, "grad_norm": 1.0234375, "learning_rate": 0.00045993197569343063, "loss": 5.0684, "mean_token_accuracy": 0.19563747942447662, "num_tokens": 44407587.0, "step": 25600 }, { "entropy": 5.62706561088562, "epoch": 1.992180509628477, "grad_norm": 1.125, "learning_rate": 0.00045991618740581926, "loss": 4.9676, "mean_token_accuracy": 0.19935185015201567, "num_tokens": 44416005.0, "step": 25605 }, { "entropy": 5.631896305084228, "epoch": 1.9925695390001945, "grad_norm": 1.0546875, "learning_rate": 0.0004599003963123991, "loss": 4.9612, "mean_token_accuracy": 0.21010004878044128, "num_tokens": 44425450.0, "step": 25610 }, { "entropy": 5.6599362850189205, "epoch": 1.992958568371912, "grad_norm": 1.0859375, "learning_rate": 0.00045988460241340966, "loss": 5.0253, "mean_token_accuracy": 0.20364561527967454, "num_tokens": 44434657.0, "step": 25615 }, { "entropy": 5.719054508209228, "epoch": 1.9933475977436297, "grad_norm": 1.140625, "learning_rate": 0.00045986880570909075, "loss": 5.0529, "mean_token_accuracy": 0.19193698465824127, "num_tokens": 44443160.0, "step": 25620 }, { "entropy": 5.666118001937866, "epoch": 1.9937366271153472, "grad_norm": 1.125, "learning_rate": 0.00045985300619968186, "loss": 5.0011, "mean_token_accuracy": 0.199748657643795, "num_tokens": 44452097.0, "step": 25625 }, { "entropy": 5.666866111755371, "epoch": 1.9941256564870646, "grad_norm": 1.1796875, "learning_rate": 0.00045983720388542286, "loss": 4.9846, "mean_token_accuracy": 0.1963702529668808, "num_tokens": 44459674.0, "step": 25630 }, { "entropy": 5.581597757339478, "epoch": 1.9945146858587823, "grad_norm": 1.171875, "learning_rate": 0.0004598213987665535, "loss": 5.0612, "mean_token_accuracy": 0.20218264758586885, "num_tokens": 44468315.0, "step": 25635 }, { "entropy": 5.719101905822754, "epoch": 1.9949037152305, "grad_norm": 1.1171875, "learning_rate": 0.00045980559084331354, "loss": 5.083, "mean_token_accuracy": 0.20088498145341874, "num_tokens": 44477436.0, "step": 25640 }, { "entropy": 5.755144643783569, "epoch": 1.9952927446022175, "grad_norm": 1.3203125, "learning_rate": 0.000459789780115943, "loss": 5.0776, "mean_token_accuracy": 0.1977915421128273, "num_tokens": 44485518.0, "step": 25645 }, { "entropy": 5.636468172073364, "epoch": 1.995681773973935, "grad_norm": 1.2109375, "learning_rate": 0.00045977396658468156, "loss": 4.9797, "mean_token_accuracy": 0.20411745458841324, "num_tokens": 44493734.0, "step": 25650 }, { "entropy": 5.5848222255706785, "epoch": 1.9960708033456527, "grad_norm": 1.1796875, "learning_rate": 0.0004597581502497693, "loss": 5.0259, "mean_token_accuracy": 0.201182921230793, "num_tokens": 44502615.0, "step": 25655 }, { "entropy": 5.686169385910034, "epoch": 1.9964598327173702, "grad_norm": 1.15625, "learning_rate": 0.0004597423311114462, "loss": 5.1105, "mean_token_accuracy": 0.1950767904520035, "num_tokens": 44511792.0, "step": 25660 }, { "entropy": 5.71376748085022, "epoch": 1.9968488620890876, "grad_norm": 1.0546875, "learning_rate": 0.0004597265091699522, "loss": 5.0685, "mean_token_accuracy": 0.19277761727571488, "num_tokens": 44520627.0, "step": 25665 }, { "entropy": 5.658960914611816, "epoch": 1.9972378914608053, "grad_norm": 1.1640625, "learning_rate": 0.0004597106844255276, "loss": 4.9997, "mean_token_accuracy": 0.2015107274055481, "num_tokens": 44528844.0, "step": 25670 }, { "entropy": 5.643560886383057, "epoch": 1.9976269208325228, "grad_norm": 1.21875, "learning_rate": 0.00045969485687841227, "loss": 5.1174, "mean_token_accuracy": 0.19863655865192414, "num_tokens": 44537602.0, "step": 25675 }, { "entropy": 5.687294769287109, "epoch": 1.9980159502042403, "grad_norm": 1.2578125, "learning_rate": 0.00045967902652884645, "loss": 5.0731, "mean_token_accuracy": 0.1932297334074974, "num_tokens": 44546261.0, "step": 25680 }, { "entropy": 5.605426597595215, "epoch": 1.998404979575958, "grad_norm": 1.2578125, "learning_rate": 0.0004596631933770704, "loss": 4.9882, "mean_token_accuracy": 0.19567940980196, "num_tokens": 44554291.0, "step": 25685 }, { "entropy": 5.619125270843506, "epoch": 1.9987940089476757, "grad_norm": 1.234375, "learning_rate": 0.00045964735742332427, "loss": 5.0474, "mean_token_accuracy": 0.20387207567691804, "num_tokens": 44562355.0, "step": 25690 }, { "entropy": 5.643335247039795, "epoch": 1.9991830383193931, "grad_norm": 1.171875, "learning_rate": 0.0004596315186678484, "loss": 4.9793, "mean_token_accuracy": 0.20320312380790712, "num_tokens": 44570517.0, "step": 25695 }, { "entropy": 5.608913946151733, "epoch": 1.9995720676911106, "grad_norm": 1.1796875, "learning_rate": 0.00045961567711088307, "loss": 4.9487, "mean_token_accuracy": 0.1979389399290085, "num_tokens": 44578871.0, "step": 25700 }, { "entropy": 5.622611093521118, "epoch": 1.9999610970628283, "grad_norm": 1.1015625, "learning_rate": 0.00045959983275266873, "loss": 5.0379, "mean_token_accuracy": 0.20116008669137955, "num_tokens": 44588081.0, "step": 25705 }, { "entropy": 5.72585063510471, "epoch": 2.000311223497374, "grad_norm": 1.140625, "learning_rate": 0.00045958398559344573, "loss": 5.1097, "mean_token_accuracy": 0.19543851912021637, "num_tokens": 44596153.0, "step": 25710 }, { "entropy": 5.642543792724609, "epoch": 2.0007002528690916, "grad_norm": 1.1015625, "learning_rate": 0.00045956813563345454, "loss": 4.9213, "mean_token_accuracy": 0.19952204525470735, "num_tokens": 44604760.0, "step": 25715 }, { "entropy": 5.605785512924195, "epoch": 2.0010892822408093, "grad_norm": 1.109375, "learning_rate": 0.0004595522828729357, "loss": 4.874, "mean_token_accuracy": 0.21425773203372955, "num_tokens": 44613251.0, "step": 25720 }, { "entropy": 5.587241315841675, "epoch": 2.0014783116125265, "grad_norm": 1.078125, "learning_rate": 0.0004595364273121296, "loss": 4.9655, "mean_token_accuracy": 0.21148568540811538, "num_tokens": 44621914.0, "step": 25725 }, { "entropy": 5.478362989425659, "epoch": 2.0018673409842442, "grad_norm": 1.2421875, "learning_rate": 0.0004595205689512771, "loss": 4.8577, "mean_token_accuracy": 0.21500149965286255, "num_tokens": 44630096.0, "step": 25730 }, { "entropy": 5.577916193008423, "epoch": 2.002256370355962, "grad_norm": 1.125, "learning_rate": 0.00045950470779061855, "loss": 4.9606, "mean_token_accuracy": 0.20788221955299377, "num_tokens": 44638175.0, "step": 25735 }, { "entropy": 5.695146942138672, "epoch": 2.0026453997276796, "grad_norm": 1.09375, "learning_rate": 0.00045948884383039475, "loss": 4.9698, "mean_token_accuracy": 0.19769396036863326, "num_tokens": 44646970.0, "step": 25740 }, { "entropy": 5.695391225814819, "epoch": 2.003034429099397, "grad_norm": 1.1484375, "learning_rate": 0.00045947297707084637, "loss": 5.0682, "mean_token_accuracy": 0.19125363677740098, "num_tokens": 44655789.0, "step": 25745 }, { "entropy": 5.583566379547119, "epoch": 2.0034234584711146, "grad_norm": 1.1640625, "learning_rate": 0.0004594571075122142, "loss": 4.8889, "mean_token_accuracy": 0.21753136366605758, "num_tokens": 44664190.0, "step": 25750 }, { "entropy": 5.5739781856536865, "epoch": 2.0038124878428323, "grad_norm": 1.109375, "learning_rate": 0.00045944123515473905, "loss": 4.9311, "mean_token_accuracy": 0.2065117299556732, "num_tokens": 44673295.0, "step": 25755 }, { "entropy": 5.673371601104736, "epoch": 2.0042015172145495, "grad_norm": 1.15625, "learning_rate": 0.00045942535999866175, "loss": 5.0421, "mean_token_accuracy": 0.19991535991430281, "num_tokens": 44681890.0, "step": 25760 }, { "entropy": 5.7185687065124515, "epoch": 2.0045905465862672, "grad_norm": 1.1328125, "learning_rate": 0.0004594094820442231, "loss": 5.0389, "mean_token_accuracy": 0.195014151930809, "num_tokens": 44690915.0, "step": 25765 }, { "entropy": 5.672593259811402, "epoch": 2.004979575957985, "grad_norm": 1.1875, "learning_rate": 0.000459393601291664, "loss": 5.0035, "mean_token_accuracy": 0.19759364277124405, "num_tokens": 44700075.0, "step": 25770 }, { "entropy": 5.566190099716186, "epoch": 2.005368605329702, "grad_norm": 1.0703125, "learning_rate": 0.00045937771774122563, "loss": 4.7745, "mean_token_accuracy": 0.2151113912463188, "num_tokens": 44708732.0, "step": 25775 }, { "entropy": 5.639623737335205, "epoch": 2.00575763470142, "grad_norm": 1.1015625, "learning_rate": 0.0004593618313931488, "loss": 4.9203, "mean_token_accuracy": 0.20703496932983398, "num_tokens": 44717019.0, "step": 25780 }, { "entropy": 5.621206569671631, "epoch": 2.0061466640731376, "grad_norm": 1.1484375, "learning_rate": 0.00045934594224767463, "loss": 4.9593, "mean_token_accuracy": 0.21048246324062347, "num_tokens": 44725359.0, "step": 25785 }, { "entropy": 5.652847003936768, "epoch": 2.0065356934448553, "grad_norm": 1.078125, "learning_rate": 0.00045933005030504424, "loss": 4.9666, "mean_token_accuracy": 0.2031517431139946, "num_tokens": 44733913.0, "step": 25790 }, { "entropy": 5.702175331115723, "epoch": 2.0069247228165725, "grad_norm": 1.1875, "learning_rate": 0.00045931415556549863, "loss": 5.098, "mean_token_accuracy": 0.18929074555635453, "num_tokens": 44743019.0, "step": 25795 }, { "entropy": 5.651552820205689, "epoch": 2.0073137521882902, "grad_norm": 1.15625, "learning_rate": 0.0004592982580292792, "loss": 5.0067, "mean_token_accuracy": 0.20181486159563064, "num_tokens": 44753140.0, "step": 25800 }, { "entropy": 5.6634704113006595, "epoch": 2.007702781560008, "grad_norm": 1.15625, "learning_rate": 0.00045928235769662697, "loss": 4.9592, "mean_token_accuracy": 0.2023950085043907, "num_tokens": 44761470.0, "step": 25805 }, { "entropy": 5.543693399429321, "epoch": 2.008091810931725, "grad_norm": 1.09375, "learning_rate": 0.00045926645456778327, "loss": 4.8805, "mean_token_accuracy": 0.20613450855016707, "num_tokens": 44770570.0, "step": 25810 }, { "entropy": 5.6971423625946045, "epoch": 2.008480840303443, "grad_norm": 1.1484375, "learning_rate": 0.00045925054864298946, "loss": 4.9505, "mean_token_accuracy": 0.20295303612947463, "num_tokens": 44779551.0, "step": 25815 }, { "entropy": 5.6314764499664305, "epoch": 2.0088698696751606, "grad_norm": 1.1640625, "learning_rate": 0.00045923463992248684, "loss": 4.9712, "mean_token_accuracy": 0.2107204392552376, "num_tokens": 44787633.0, "step": 25820 }, { "entropy": 5.61586594581604, "epoch": 2.009258899046878, "grad_norm": 1.21875, "learning_rate": 0.00045921872840651675, "loss": 4.9917, "mean_token_accuracy": 0.2026021495461464, "num_tokens": 44796030.0, "step": 25825 }, { "entropy": 5.704476308822632, "epoch": 2.0096479284185955, "grad_norm": 1.1875, "learning_rate": 0.00045920281409532064, "loss": 5.0323, "mean_token_accuracy": 0.2044459268450737, "num_tokens": 44805055.0, "step": 25830 }, { "entropy": 5.618524980545044, "epoch": 2.010036957790313, "grad_norm": 1.140625, "learning_rate": 0.0004591868969891401, "loss": 4.8996, "mean_token_accuracy": 0.20620386600494384, "num_tokens": 44813767.0, "step": 25835 }, { "entropy": 5.709070348739624, "epoch": 2.010425987162031, "grad_norm": 1.203125, "learning_rate": 0.0004591709770882165, "loss": 5.0384, "mean_token_accuracy": 0.20000856518745422, "num_tokens": 44821955.0, "step": 25840 }, { "entropy": 5.663044786453247, "epoch": 2.010815016533748, "grad_norm": 1.1875, "learning_rate": 0.0004591550543927915, "loss": 5.0007, "mean_token_accuracy": 0.1986226961016655, "num_tokens": 44830565.0, "step": 25845 }, { "entropy": 5.6405003547668455, "epoch": 2.011204045905466, "grad_norm": 1.203125, "learning_rate": 0.0004591391289031067, "loss": 4.9075, "mean_token_accuracy": 0.20725811272859573, "num_tokens": 44839224.0, "step": 25850 }, { "entropy": 5.584761381149292, "epoch": 2.0115930752771836, "grad_norm": 1.234375, "learning_rate": 0.0004591232006194036, "loss": 4.8496, "mean_token_accuracy": 0.21076080203056335, "num_tokens": 44847756.0, "step": 25855 }, { "entropy": 5.674216842651367, "epoch": 2.011982104648901, "grad_norm": 1.21875, "learning_rate": 0.00045910726954192404, "loss": 5.0252, "mean_token_accuracy": 0.20785722732543946, "num_tokens": 44855739.0, "step": 25860 }, { "entropy": 5.633013105392456, "epoch": 2.0123711340206185, "grad_norm": 1.1875, "learning_rate": 0.0004590913356709097, "loss": 5.0047, "mean_token_accuracy": 0.19442038536071776, "num_tokens": 44864402.0, "step": 25865 }, { "entropy": 5.64874005317688, "epoch": 2.012760163392336, "grad_norm": 1.171875, "learning_rate": 0.00045907539900660237, "loss": 5.0122, "mean_token_accuracy": 0.20675100684165953, "num_tokens": 44873369.0, "step": 25870 }, { "entropy": 5.65152645111084, "epoch": 2.013149192764054, "grad_norm": 1.0703125, "learning_rate": 0.0004590594595492438, "loss": 5.0361, "mean_token_accuracy": 0.19535612761974336, "num_tokens": 44882464.0, "step": 25875 }, { "entropy": 5.606862878799438, "epoch": 2.013538222135771, "grad_norm": 1.1640625, "learning_rate": 0.00045904351729907593, "loss": 5.0153, "mean_token_accuracy": 0.19690980911254882, "num_tokens": 44891729.0, "step": 25880 }, { "entropy": 5.677865791320801, "epoch": 2.013927251507489, "grad_norm": 1.1015625, "learning_rate": 0.00045902757225634066, "loss": 4.9874, "mean_token_accuracy": 0.19804483652114868, "num_tokens": 44901752.0, "step": 25885 }, { "entropy": 5.662511348724365, "epoch": 2.0143162808792066, "grad_norm": 1.09375, "learning_rate": 0.0004590116244212799, "loss": 4.968, "mean_token_accuracy": 0.2064654305577278, "num_tokens": 44909899.0, "step": 25890 }, { "entropy": 5.6693190574646, "epoch": 2.014705310250924, "grad_norm": 1.2109375, "learning_rate": 0.0004589956737941355, "loss": 4.9886, "mean_token_accuracy": 0.20200416445732117, "num_tokens": 44918472.0, "step": 25895 }, { "entropy": 5.617540884017944, "epoch": 2.0150943396226415, "grad_norm": 1.171875, "learning_rate": 0.0004589797203751497, "loss": 4.8797, "mean_token_accuracy": 0.21640770882368088, "num_tokens": 44926799.0, "step": 25900 }, { "entropy": 5.561606216430664, "epoch": 2.015483368994359, "grad_norm": 1.125, "learning_rate": 0.0004589637641645645, "loss": 4.9042, "mean_token_accuracy": 0.20885215252637862, "num_tokens": 44935867.0, "step": 25905 }, { "entropy": 5.649150037765503, "epoch": 2.0158723983660765, "grad_norm": 1.1796875, "learning_rate": 0.00045894780516262193, "loss": 4.9802, "mean_token_accuracy": 0.20153287649154664, "num_tokens": 44944705.0, "step": 25910 }, { "entropy": 5.549926662445069, "epoch": 2.016261427737794, "grad_norm": 1.171875, "learning_rate": 0.0004589318433695642, "loss": 4.8413, "mean_token_accuracy": 0.20815970450639726, "num_tokens": 44954301.0, "step": 25915 }, { "entropy": 5.654222679138184, "epoch": 2.016650457109512, "grad_norm": 1.1015625, "learning_rate": 0.0004589158787856336, "loss": 4.9145, "mean_token_accuracy": 0.20069146901369095, "num_tokens": 44963005.0, "step": 25920 }, { "entropy": 5.614452791213989, "epoch": 2.0170394864812295, "grad_norm": 1.1796875, "learning_rate": 0.0004588999114110721, "loss": 4.9436, "mean_token_accuracy": 0.20514952391386032, "num_tokens": 44970935.0, "step": 25925 }, { "entropy": 5.63707799911499, "epoch": 2.017428515852947, "grad_norm": 1.1015625, "learning_rate": 0.0004588839412461223, "loss": 4.9652, "mean_token_accuracy": 0.206849105656147, "num_tokens": 44979915.0, "step": 25930 }, { "entropy": 5.697152900695801, "epoch": 2.0178175452246645, "grad_norm": 1.0859375, "learning_rate": 0.0004588679682910264, "loss": 4.9949, "mean_token_accuracy": 0.20026347935199737, "num_tokens": 44988934.0, "step": 25935 }, { "entropy": 5.765903949737549, "epoch": 2.018206574596382, "grad_norm": 1.1796875, "learning_rate": 0.0004588519925460266, "loss": 5.0368, "mean_token_accuracy": 0.19709775894880294, "num_tokens": 44997578.0, "step": 25940 }, { "entropy": 5.67187614440918, "epoch": 2.0185956039680995, "grad_norm": 1.140625, "learning_rate": 0.0004588360140113655, "loss": 4.9858, "mean_token_accuracy": 0.203135147690773, "num_tokens": 45005806.0, "step": 25945 }, { "entropy": 5.613053798675537, "epoch": 2.018984633339817, "grad_norm": 1.1328125, "learning_rate": 0.0004588200326872855, "loss": 4.9665, "mean_token_accuracy": 0.2007648766040802, "num_tokens": 45013948.0, "step": 25950 }, { "entropy": 5.621857595443726, "epoch": 2.019373662711535, "grad_norm": 1.1328125, "learning_rate": 0.0004588040485740291, "loss": 4.9604, "mean_token_accuracy": 0.20629850625991822, "num_tokens": 45022636.0, "step": 25955 }, { "entropy": 5.740918159484863, "epoch": 2.019762692083252, "grad_norm": 1.1484375, "learning_rate": 0.0004587880616718387, "loss": 5.0645, "mean_token_accuracy": 0.198312246799469, "num_tokens": 45031194.0, "step": 25960 }, { "entropy": 5.715039920806885, "epoch": 2.02015172145497, "grad_norm": 1.1484375, "learning_rate": 0.0004587720719809572, "loss": 5.031, "mean_token_accuracy": 0.19981286972761153, "num_tokens": 45039436.0, "step": 25965 }, { "entropy": 5.6155623435974125, "epoch": 2.0205407508266875, "grad_norm": 1.1875, "learning_rate": 0.0004587560795016269, "loss": 4.942, "mean_token_accuracy": 0.20703673213720322, "num_tokens": 45048173.0, "step": 25970 }, { "entropy": 5.651319169998169, "epoch": 2.020929780198405, "grad_norm": 1.09375, "learning_rate": 0.0004587400842340905, "loss": 5.0757, "mean_token_accuracy": 0.1947438731789589, "num_tokens": 45057896.0, "step": 25975 }, { "entropy": 5.694773483276367, "epoch": 2.0213188095701224, "grad_norm": 1.1015625, "learning_rate": 0.00045872408617859083, "loss": 4.9938, "mean_token_accuracy": 0.1969839558005333, "num_tokens": 45066451.0, "step": 25980 }, { "entropy": 5.579500818252564, "epoch": 2.02170783894184, "grad_norm": 1.1328125, "learning_rate": 0.00045870808533537066, "loss": 4.8747, "mean_token_accuracy": 0.2129790037870407, "num_tokens": 45075143.0, "step": 25985 }, { "entropy": 5.656186580657959, "epoch": 2.022096868313558, "grad_norm": 1.1875, "learning_rate": 0.00045869208170467256, "loss": 4.9912, "mean_token_accuracy": 0.20378889441490172, "num_tokens": 45083370.0, "step": 25990 }, { "entropy": 5.615133237838745, "epoch": 2.022485897685275, "grad_norm": 1.1640625, "learning_rate": 0.0004586760752867396, "loss": 4.9454, "mean_token_accuracy": 0.19824449270963668, "num_tokens": 45091765.0, "step": 25995 }, { "entropy": 5.640663194656372, "epoch": 2.022874927056993, "grad_norm": 1.203125, "learning_rate": 0.00045866006608181456, "loss": 4.933, "mean_token_accuracy": 0.20219577103853226, "num_tokens": 45100206.0, "step": 26000 }, { "entropy": 5.62293496131897, "epoch": 2.0232639564287105, "grad_norm": 1.203125, "learning_rate": 0.0004586440540901403, "loss": 4.9255, "mean_token_accuracy": 0.20373485535383223, "num_tokens": 45108308.0, "step": 26005 }, { "entropy": 5.65470781326294, "epoch": 2.0236529858004277, "grad_norm": 1.203125, "learning_rate": 0.00045862803931195976, "loss": 5.0051, "mean_token_accuracy": 0.2048501655459404, "num_tokens": 45116473.0, "step": 26010 }, { "entropy": 5.6013110160827635, "epoch": 2.0240420151721454, "grad_norm": 1.125, "learning_rate": 0.0004586120217475161, "loss": 5.0012, "mean_token_accuracy": 0.20514819175004959, "num_tokens": 45125913.0, "step": 26015 }, { "entropy": 5.589880514144897, "epoch": 2.024431044543863, "grad_norm": 1.203125, "learning_rate": 0.0004585960013970522, "loss": 4.9206, "mean_token_accuracy": 0.2001563772559166, "num_tokens": 45134406.0, "step": 26020 }, { "entropy": 5.626565456390381, "epoch": 2.024820073915581, "grad_norm": 1.15625, "learning_rate": 0.0004585799782608112, "loss": 4.9667, "mean_token_accuracy": 0.19275892823934554, "num_tokens": 45142736.0, "step": 26025 }, { "entropy": 5.677940940856933, "epoch": 2.025209103287298, "grad_norm": 1.1015625, "learning_rate": 0.00045856395233903624, "loss": 4.9955, "mean_token_accuracy": 0.20455732494592666, "num_tokens": 45151148.0, "step": 26030 }, { "entropy": 5.605459690093994, "epoch": 2.025598132659016, "grad_norm": 1.0859375, "learning_rate": 0.0004585479236319705, "loss": 4.8812, "mean_token_accuracy": 0.21378347724676133, "num_tokens": 45160091.0, "step": 26035 }, { "entropy": 5.635395479202271, "epoch": 2.0259871620307335, "grad_norm": 1.140625, "learning_rate": 0.00045853189213985714, "loss": 4.9811, "mean_token_accuracy": 0.19963323175907136, "num_tokens": 45168796.0, "step": 26040 }, { "entropy": 5.6266838073730465, "epoch": 2.0263761914024507, "grad_norm": 1.25, "learning_rate": 0.00045851585786293943, "loss": 4.915, "mean_token_accuracy": 0.21161991953849793, "num_tokens": 45176891.0, "step": 26045 }, { "entropy": 5.657046794891357, "epoch": 2.0267652207741684, "grad_norm": 1.2265625, "learning_rate": 0.00045849982080146067, "loss": 4.9926, "mean_token_accuracy": 0.20271711945533752, "num_tokens": 45184768.0, "step": 26050 }, { "entropy": 5.672244834899902, "epoch": 2.027154250145886, "grad_norm": 1.25, "learning_rate": 0.0004584837809556642, "loss": 5.0416, "mean_token_accuracy": 0.1994086906313896, "num_tokens": 45193554.0, "step": 26055 }, { "entropy": 5.613182163238525, "epoch": 2.0275432795176034, "grad_norm": 1.0625, "learning_rate": 0.00045846773832579346, "loss": 5.0112, "mean_token_accuracy": 0.2021721363067627, "num_tokens": 45202517.0, "step": 26060 }, { "entropy": 5.628203630447388, "epoch": 2.027932308889321, "grad_norm": 1.1171875, "learning_rate": 0.00045845169291209176, "loss": 4.9419, "mean_token_accuracy": 0.20004532784223555, "num_tokens": 45211260.0, "step": 26065 }, { "entropy": 5.631072854995727, "epoch": 2.0283213382610388, "grad_norm": 1.21875, "learning_rate": 0.00045843564471480263, "loss": 5.0027, "mean_token_accuracy": 0.19507287442684174, "num_tokens": 45219828.0, "step": 26070 }, { "entropy": 5.73089370727539, "epoch": 2.0287103676327565, "grad_norm": 1.09375, "learning_rate": 0.0004584195937341695, "loss": 5.0141, "mean_token_accuracy": 0.2025468409061432, "num_tokens": 45228977.0, "step": 26075 }, { "entropy": 5.661155939102173, "epoch": 2.0290993970044737, "grad_norm": 1.1640625, "learning_rate": 0.00045840353997043606, "loss": 4.9578, "mean_token_accuracy": 0.20565544962882995, "num_tokens": 45237191.0, "step": 26080 }, { "entropy": 5.603924369812011, "epoch": 2.0294884263761914, "grad_norm": 1.2265625, "learning_rate": 0.0004583874834238458, "loss": 4.8825, "mean_token_accuracy": 0.21830393522977828, "num_tokens": 45245201.0, "step": 26085 }, { "entropy": 5.6957464694976805, "epoch": 2.029877455747909, "grad_norm": 1.265625, "learning_rate": 0.0004583714240946423, "loss": 5.0469, "mean_token_accuracy": 0.19688422977924347, "num_tokens": 45253795.0, "step": 26090 }, { "entropy": 5.733347988128662, "epoch": 2.0302664851196264, "grad_norm": 1.203125, "learning_rate": 0.00045835536198306936, "loss": 5.1167, "mean_token_accuracy": 0.19206128120422364, "num_tokens": 45263403.0, "step": 26095 }, { "entropy": 5.663520622253418, "epoch": 2.030655514491344, "grad_norm": 1.2265625, "learning_rate": 0.00045833929708937067, "loss": 4.9228, "mean_token_accuracy": 0.2078743800520897, "num_tokens": 45272085.0, "step": 26100 }, { "entropy": 5.6448887348175045, "epoch": 2.0310445438630618, "grad_norm": 1.078125, "learning_rate": 0.0004583232294137899, "loss": 4.9451, "mean_token_accuracy": 0.20618160367012023, "num_tokens": 45281004.0, "step": 26105 }, { "entropy": 5.616835069656372, "epoch": 2.031433573234779, "grad_norm": 1.1015625, "learning_rate": 0.0004583071589565709, "loss": 4.9049, "mean_token_accuracy": 0.20600546449422835, "num_tokens": 45289950.0, "step": 26110 }, { "entropy": 5.626284885406494, "epoch": 2.0318226026064967, "grad_norm": 1.21875, "learning_rate": 0.0004582910857179576, "loss": 5.0154, "mean_token_accuracy": 0.1953207314014435, "num_tokens": 45298155.0, "step": 26115 }, { "entropy": 5.638932180404663, "epoch": 2.0322116319782144, "grad_norm": 1.1171875, "learning_rate": 0.0004582750096981938, "loss": 5.0397, "mean_token_accuracy": 0.2004152089357376, "num_tokens": 45306879.0, "step": 26120 }, { "entropy": 5.64530463218689, "epoch": 2.032600661349932, "grad_norm": 1.09375, "learning_rate": 0.0004582589308975234, "loss": 5.0509, "mean_token_accuracy": 0.19907115548849105, "num_tokens": 45315403.0, "step": 26125 }, { "entropy": 5.660851240158081, "epoch": 2.0329896907216494, "grad_norm": 1.1484375, "learning_rate": 0.00045824284931619044, "loss": 4.9079, "mean_token_accuracy": 0.2072210893034935, "num_tokens": 45324351.0, "step": 26130 }, { "entropy": 5.669393396377563, "epoch": 2.033378720093367, "grad_norm": 1.25, "learning_rate": 0.00045822676495443893, "loss": 4.9866, "mean_token_accuracy": 0.20593211203813552, "num_tokens": 45332513.0, "step": 26135 }, { "entropy": 5.666029167175293, "epoch": 2.0337677494650848, "grad_norm": 1.125, "learning_rate": 0.00045821067781251284, "loss": 5.0329, "mean_token_accuracy": 0.19569605886936187, "num_tokens": 45341002.0, "step": 26140 }, { "entropy": 5.737324810028076, "epoch": 2.034156778836802, "grad_norm": 1.203125, "learning_rate": 0.00045819458789065633, "loss": 5.0403, "mean_token_accuracy": 0.20251680612564088, "num_tokens": 45349650.0, "step": 26145 }, { "entropy": 5.7106376647949215, "epoch": 2.0345458082085197, "grad_norm": 1.1328125, "learning_rate": 0.0004581784951891135, "loss": 5.1256, "mean_token_accuracy": 0.18723339438438416, "num_tokens": 45359189.0, "step": 26150 }, { "entropy": 5.617944002151489, "epoch": 2.0349348375802374, "grad_norm": 1.203125, "learning_rate": 0.0004581623997081286, "loss": 4.8958, "mean_token_accuracy": 0.20973194390535355, "num_tokens": 45367274.0, "step": 26155 }, { "entropy": 5.5978209495544435, "epoch": 2.0353238669519547, "grad_norm": 1.2109375, "learning_rate": 0.0004581463014479459, "loss": 4.9731, "mean_token_accuracy": 0.21194944828748702, "num_tokens": 45375424.0, "step": 26160 }, { "entropy": 5.679871273040772, "epoch": 2.0357128963236724, "grad_norm": 1.1796875, "learning_rate": 0.0004581302004088095, "loss": 4.9805, "mean_token_accuracy": 0.20293499380350113, "num_tokens": 45384333.0, "step": 26165 }, { "entropy": 5.675925064086914, "epoch": 2.03610192569539, "grad_norm": 1.171875, "learning_rate": 0.0004581140965909638, "loss": 5.0857, "mean_token_accuracy": 0.19482042789459228, "num_tokens": 45393309.0, "step": 26170 }, { "entropy": 5.707494258880615, "epoch": 2.0364909550671078, "grad_norm": 1.2265625, "learning_rate": 0.0004580979899946531, "loss": 5.0506, "mean_token_accuracy": 0.19359809905290604, "num_tokens": 45401590.0, "step": 26175 }, { "entropy": 5.6762889385223385, "epoch": 2.036879984438825, "grad_norm": 1.265625, "learning_rate": 0.0004580818806201219, "loss": 4.9522, "mean_token_accuracy": 0.20625071227550507, "num_tokens": 45409458.0, "step": 26180 }, { "entropy": 5.660930585861206, "epoch": 2.0372690138105427, "grad_norm": 1.1640625, "learning_rate": 0.00045806576846761453, "loss": 4.9349, "mean_token_accuracy": 0.20550963580608367, "num_tokens": 45417777.0, "step": 26185 }, { "entropy": 5.68731918334961, "epoch": 2.0376580431822604, "grad_norm": 1.1484375, "learning_rate": 0.00045804965353737556, "loss": 5.0254, "mean_token_accuracy": 0.20049353688955307, "num_tokens": 45425489.0, "step": 26190 }, { "entropy": 5.6256708145141605, "epoch": 2.0380470725539777, "grad_norm": 1.1953125, "learning_rate": 0.0004580335358296494, "loss": 4.9442, "mean_token_accuracy": 0.20921171754598616, "num_tokens": 45433770.0, "step": 26195 }, { "entropy": 5.662933349609375, "epoch": 2.0384361019256954, "grad_norm": 1.2109375, "learning_rate": 0.00045801741534468065, "loss": 5.01, "mean_token_accuracy": 0.20295729339122773, "num_tokens": 45442607.0, "step": 26200 }, { "entropy": 5.623762941360473, "epoch": 2.038825131297413, "grad_norm": 1.1484375, "learning_rate": 0.0004580012920827139, "loss": 4.9577, "mean_token_accuracy": 0.20063821971416473, "num_tokens": 45451671.0, "step": 26205 }, { "entropy": 5.688590145111084, "epoch": 2.0392141606691303, "grad_norm": 1.171875, "learning_rate": 0.0004579851660439939, "loss": 5.0089, "mean_token_accuracy": 0.2043735533952713, "num_tokens": 45459861.0, "step": 26210 }, { "entropy": 5.631917953491211, "epoch": 2.039603190040848, "grad_norm": 1.1328125, "learning_rate": 0.00045796903722876523, "loss": 4.8798, "mean_token_accuracy": 0.20732878595590593, "num_tokens": 45468623.0, "step": 26215 }, { "entropy": 5.636249017715454, "epoch": 2.0399922194125657, "grad_norm": 1.21875, "learning_rate": 0.0004579529056372726, "loss": 4.8887, "mean_token_accuracy": 0.20418757796287537, "num_tokens": 45476763.0, "step": 26220 }, { "entropy": 5.589209413528442, "epoch": 2.0403812487842834, "grad_norm": 1.203125, "learning_rate": 0.0004579367712697609, "loss": 4.9199, "mean_token_accuracy": 0.20561570823192596, "num_tokens": 45485069.0, "step": 26225 }, { "entropy": 5.596808195114136, "epoch": 2.0407702781560006, "grad_norm": 1.0546875, "learning_rate": 0.00045792063412647475, "loss": 5.0672, "mean_token_accuracy": 0.19455607682466508, "num_tokens": 45494236.0, "step": 26230 }, { "entropy": 5.598013544082642, "epoch": 2.0411593075277183, "grad_norm": 1.1328125, "learning_rate": 0.00045790449420765925, "loss": 4.9433, "mean_token_accuracy": 0.19579299539327621, "num_tokens": 45503257.0, "step": 26235 }, { "entropy": 5.707050371170044, "epoch": 2.041548336899436, "grad_norm": 1.1484375, "learning_rate": 0.00045788835151355914, "loss": 4.9804, "mean_token_accuracy": 0.20272008329629898, "num_tokens": 45511544.0, "step": 26240 }, { "entropy": 5.648370885848999, "epoch": 2.0419373662711533, "grad_norm": 1.15625, "learning_rate": 0.00045787220604441933, "loss": 4.9595, "mean_token_accuracy": 0.20692694634199144, "num_tokens": 45519951.0, "step": 26245 }, { "entropy": 5.687781810760498, "epoch": 2.042326395642871, "grad_norm": 1.171875, "learning_rate": 0.00045785605780048497, "loss": 5.0091, "mean_token_accuracy": 0.2006458669900894, "num_tokens": 45527978.0, "step": 26250 }, { "entropy": 5.704783916473389, "epoch": 2.0427154250145887, "grad_norm": 1.1171875, "learning_rate": 0.00045783990678200086, "loss": 5.0136, "mean_token_accuracy": 0.20382149815559386, "num_tokens": 45537103.0, "step": 26255 }, { "entropy": 5.636329793930054, "epoch": 2.043104454386306, "grad_norm": 1.21875, "learning_rate": 0.00045782375298921227, "loss": 4.9374, "mean_token_accuracy": 0.20410780161619185, "num_tokens": 45545136.0, "step": 26260 }, { "entropy": 5.742430400848389, "epoch": 2.0434934837580236, "grad_norm": 1.171875, "learning_rate": 0.0004578075964223642, "loss": 5.0674, "mean_token_accuracy": 0.19547653049230576, "num_tokens": 45553709.0, "step": 26265 }, { "entropy": 5.607412719726563, "epoch": 2.0438825131297413, "grad_norm": 1.1328125, "learning_rate": 0.0004577914370817018, "loss": 4.976, "mean_token_accuracy": 0.20543633699417113, "num_tokens": 45562947.0, "step": 26270 }, { "entropy": 5.649082136154175, "epoch": 2.044271542501459, "grad_norm": 1.125, "learning_rate": 0.00045777527496747034, "loss": 4.9544, "mean_token_accuracy": 0.20177736282348632, "num_tokens": 45571319.0, "step": 26275 }, { "entropy": 5.666260814666748, "epoch": 2.0446605718731763, "grad_norm": 1.1328125, "learning_rate": 0.00045775911007991493, "loss": 5.0644, "mean_token_accuracy": 0.19765353202819824, "num_tokens": 45580071.0, "step": 26280 }, { "entropy": 5.596252346038819, "epoch": 2.045049601244894, "grad_norm": 1.125, "learning_rate": 0.00045774294241928093, "loss": 4.8939, "mean_token_accuracy": 0.212611822783947, "num_tokens": 45587998.0, "step": 26285 }, { "entropy": 5.652537536621094, "epoch": 2.0454386306166117, "grad_norm": 1.171875, "learning_rate": 0.0004577267719858137, "loss": 4.9908, "mean_token_accuracy": 0.20703012943267823, "num_tokens": 45597109.0, "step": 26290 }, { "entropy": 5.690421867370605, "epoch": 2.045827659988329, "grad_norm": 1.1875, "learning_rate": 0.00045771059877975853, "loss": 4.9909, "mean_token_accuracy": 0.2051444470882416, "num_tokens": 45605699.0, "step": 26295 }, { "entropy": 5.764148616790772, "epoch": 2.0462166893600466, "grad_norm": 1.171875, "learning_rate": 0.0004576944228013608, "loss": 5.1015, "mean_token_accuracy": 0.19725040793418885, "num_tokens": 45613634.0, "step": 26300 }, { "entropy": 5.669092893600464, "epoch": 2.0466057187317643, "grad_norm": 1.1484375, "learning_rate": 0.000457678244050866, "loss": 4.8736, "mean_token_accuracy": 0.21267784237861634, "num_tokens": 45621814.0, "step": 26305 }, { "entropy": 5.7149818420410154, "epoch": 2.046994748103482, "grad_norm": 1.2734375, "learning_rate": 0.0004576620625285196, "loss": 5.0892, "mean_token_accuracy": 0.1907832071185112, "num_tokens": 45629386.0, "step": 26310 }, { "entropy": 5.562484836578369, "epoch": 2.0473837774751993, "grad_norm": 1.3515625, "learning_rate": 0.00045764587823456717, "loss": 4.885, "mean_token_accuracy": 0.21325999796390532, "num_tokens": 45637565.0, "step": 26315 }, { "entropy": 5.624837064743042, "epoch": 2.047772806846917, "grad_norm": 1.109375, "learning_rate": 0.00045762969116925424, "loss": 4.9737, "mean_token_accuracy": 0.2058470994234085, "num_tokens": 45646876.0, "step": 26320 }, { "entropy": 5.622229862213135, "epoch": 2.0481618362186347, "grad_norm": 1.1015625, "learning_rate": 0.00045761350133282643, "loss": 4.8492, "mean_token_accuracy": 0.20866480767726897, "num_tokens": 45655445.0, "step": 26325 }, { "entropy": 5.622999858856201, "epoch": 2.048550865590352, "grad_norm": 1.2109375, "learning_rate": 0.00045759730872552937, "loss": 4.98, "mean_token_accuracy": 0.20213340371847152, "num_tokens": 45663908.0, "step": 26330 }, { "entropy": 5.690868520736695, "epoch": 2.0489398949620696, "grad_norm": 1.203125, "learning_rate": 0.0004575811133476088, "loss": 5.0058, "mean_token_accuracy": 0.20490839034318925, "num_tokens": 45672842.0, "step": 26335 }, { "entropy": 5.662501239776612, "epoch": 2.0493289243337873, "grad_norm": 1.078125, "learning_rate": 0.00045756491519931047, "loss": 4.9647, "mean_token_accuracy": 0.20413194596767426, "num_tokens": 45680988.0, "step": 26340 }, { "entropy": 5.652567148208618, "epoch": 2.0497179537055046, "grad_norm": 1.0703125, "learning_rate": 0.0004575487142808801, "loss": 4.9848, "mean_token_accuracy": 0.20304464995861055, "num_tokens": 45690165.0, "step": 26345 }, { "entropy": 5.656586694717407, "epoch": 2.0501069830772223, "grad_norm": 1.1953125, "learning_rate": 0.0004575325105925636, "loss": 5.0024, "mean_token_accuracy": 0.1991700991988182, "num_tokens": 45698721.0, "step": 26350 }, { "entropy": 5.66164984703064, "epoch": 2.05049601244894, "grad_norm": 1.2109375, "learning_rate": 0.00045751630413460665, "loss": 5.001, "mean_token_accuracy": 0.20246308594942092, "num_tokens": 45707374.0, "step": 26355 }, { "entropy": 5.624229574203492, "epoch": 2.0508850418206577, "grad_norm": 1.1953125, "learning_rate": 0.0004575000949072554, "loss": 4.8708, "mean_token_accuracy": 0.21557633578777313, "num_tokens": 45715756.0, "step": 26360 }, { "entropy": 5.5776143074035645, "epoch": 2.051274071192375, "grad_norm": 1.2890625, "learning_rate": 0.0004574838829107557, "loss": 4.9633, "mean_token_accuracy": 0.21050285547971725, "num_tokens": 45724173.0, "step": 26365 }, { "entropy": 5.672862195968628, "epoch": 2.0516631005640926, "grad_norm": 1.171875, "learning_rate": 0.0004574676681453535, "loss": 4.9879, "mean_token_accuracy": 0.2052372455596924, "num_tokens": 45732330.0, "step": 26370 }, { "entropy": 5.659654140472412, "epoch": 2.0520521299358103, "grad_norm": 1.2421875, "learning_rate": 0.00045745145061129485, "loss": 4.9893, "mean_token_accuracy": 0.20125849545001984, "num_tokens": 45741489.0, "step": 26375 }, { "entropy": 5.583428525924683, "epoch": 2.0524411593075276, "grad_norm": 1.125, "learning_rate": 0.00045743523030882584, "loss": 4.8858, "mean_token_accuracy": 0.21238418221473693, "num_tokens": 45750816.0, "step": 26380 }, { "entropy": 5.712013864517212, "epoch": 2.0528301886792453, "grad_norm": 1.2109375, "learning_rate": 0.0004574190072381926, "loss": 5.0681, "mean_token_accuracy": 0.20266639590263366, "num_tokens": 45759393.0, "step": 26385 }, { "entropy": 5.69349479675293, "epoch": 2.053219218050963, "grad_norm": 1.2421875, "learning_rate": 0.0004574027813996413, "loss": 4.9523, "mean_token_accuracy": 0.20194405764341355, "num_tokens": 45767749.0, "step": 26390 }, { "entropy": 5.670433282852173, "epoch": 2.05360824742268, "grad_norm": 1.1875, "learning_rate": 0.0004573865527934181, "loss": 5.0238, "mean_token_accuracy": 0.19618016630411148, "num_tokens": 45776455.0, "step": 26395 }, { "entropy": 5.656734943389893, "epoch": 2.053997276794398, "grad_norm": 1.1796875, "learning_rate": 0.0004573703214197692, "loss": 4.9373, "mean_token_accuracy": 0.2041775569319725, "num_tokens": 45784869.0, "step": 26400 }, { "entropy": 5.618497610092163, "epoch": 2.0543863061661156, "grad_norm": 1.1875, "learning_rate": 0.00045735408727894095, "loss": 4.9782, "mean_token_accuracy": 0.21251247376203536, "num_tokens": 45793956.0, "step": 26405 }, { "entropy": 5.653133916854858, "epoch": 2.0547753355378333, "grad_norm": 1.125, "learning_rate": 0.00045733785037117977, "loss": 4.949, "mean_token_accuracy": 0.20117094218730927, "num_tokens": 45801918.0, "step": 26410 }, { "entropy": 5.6586816787719725, "epoch": 2.0551643649095506, "grad_norm": 1.09375, "learning_rate": 0.0004573216106967319, "loss": 4.9531, "mean_token_accuracy": 0.20225839763879777, "num_tokens": 45810026.0, "step": 26415 }, { "entropy": 5.606768798828125, "epoch": 2.0555533942812683, "grad_norm": 1.2109375, "learning_rate": 0.00045730536825584365, "loss": 4.8909, "mean_token_accuracy": 0.20938216149806976, "num_tokens": 45818101.0, "step": 26420 }, { "entropy": 5.646903705596924, "epoch": 2.055942423652986, "grad_norm": 1.2578125, "learning_rate": 0.00045728912304876176, "loss": 4.9783, "mean_token_accuracy": 0.2059596970677376, "num_tokens": 45826467.0, "step": 26425 }, { "entropy": 5.666257905960083, "epoch": 2.056331453024703, "grad_norm": 1.2265625, "learning_rate": 0.0004572728750757326, "loss": 4.938, "mean_token_accuracy": 0.20431553274393083, "num_tokens": 45835329.0, "step": 26430 }, { "entropy": 5.688526439666748, "epoch": 2.056720482396421, "grad_norm": 1.1953125, "learning_rate": 0.0004572566243370025, "loss": 5.0206, "mean_token_accuracy": 0.2039225995540619, "num_tokens": 45844449.0, "step": 26435 }, { "entropy": 5.6172881603240965, "epoch": 2.0571095117681386, "grad_norm": 1.1953125, "learning_rate": 0.0004572403708328183, "loss": 4.9663, "mean_token_accuracy": 0.20276009887456894, "num_tokens": 45854042.0, "step": 26440 }, { "entropy": 5.645816946029663, "epoch": 2.057498541139856, "grad_norm": 1.1484375, "learning_rate": 0.0004572241145634266, "loss": 4.9635, "mean_token_accuracy": 0.20827164947986604, "num_tokens": 45863164.0, "step": 26445 }, { "entropy": 5.710950946807861, "epoch": 2.0578875705115736, "grad_norm": 1.109375, "learning_rate": 0.000457207855529074, "loss": 5.013, "mean_token_accuracy": 0.2060302808880806, "num_tokens": 45872054.0, "step": 26450 }, { "entropy": 5.660875129699707, "epoch": 2.0582765998832913, "grad_norm": 1.1484375, "learning_rate": 0.00045719159373000713, "loss": 4.9586, "mean_token_accuracy": 0.20731045305728912, "num_tokens": 45880887.0, "step": 26455 }, { "entropy": 5.719365072250366, "epoch": 2.058665629255009, "grad_norm": 1.1328125, "learning_rate": 0.0004571753291664729, "loss": 5.0955, "mean_token_accuracy": 0.19487258344888686, "num_tokens": 45890078.0, "step": 26460 }, { "entropy": 5.65162501335144, "epoch": 2.059054658626726, "grad_norm": 1.0546875, "learning_rate": 0.0004571590618387179, "loss": 5.0275, "mean_token_accuracy": 0.20476052165031433, "num_tokens": 45899803.0, "step": 26465 }, { "entropy": 5.75777792930603, "epoch": 2.059443687998444, "grad_norm": 1.21875, "learning_rate": 0.0004571427917469892, "loss": 4.984, "mean_token_accuracy": 0.2005542501807213, "num_tokens": 45908851.0, "step": 26470 }, { "entropy": 5.64849534034729, "epoch": 2.0598327173701616, "grad_norm": 1.171875, "learning_rate": 0.00045712651889153345, "loss": 4.9534, "mean_token_accuracy": 0.2069414883852005, "num_tokens": 45917891.0, "step": 26475 }, { "entropy": 5.648615980148316, "epoch": 2.060221746741879, "grad_norm": 1.203125, "learning_rate": 0.00045711024327259764, "loss": 4.9462, "mean_token_accuracy": 0.20161084085702896, "num_tokens": 45926185.0, "step": 26480 }, { "entropy": 5.681741523742676, "epoch": 2.0606107761135966, "grad_norm": 1.15625, "learning_rate": 0.00045709396489042884, "loss": 5.0653, "mean_token_accuracy": 0.20231678932905198, "num_tokens": 45935064.0, "step": 26485 }, { "entropy": 5.648718595504761, "epoch": 2.0609998054853143, "grad_norm": 1.2109375, "learning_rate": 0.00045707768374527385, "loss": 4.97, "mean_token_accuracy": 0.19825223535299302, "num_tokens": 45943216.0, "step": 26490 }, { "entropy": 5.643566513061524, "epoch": 2.0613888348570315, "grad_norm": 1.15625, "learning_rate": 0.0004570613998373799, "loss": 5.0604, "mean_token_accuracy": 0.19873616546392442, "num_tokens": 45952178.0, "step": 26495 }, { "entropy": 5.746701574325561, "epoch": 2.061777864228749, "grad_norm": 1.2421875, "learning_rate": 0.00045704511316699395, "loss": 5.0768, "mean_token_accuracy": 0.19397502839565278, "num_tokens": 45960962.0, "step": 26500 }, { "entropy": 5.645895051956177, "epoch": 2.062166893600467, "grad_norm": 1.1640625, "learning_rate": 0.00045702882373436317, "loss": 4.8157, "mean_token_accuracy": 0.2148612543940544, "num_tokens": 45969527.0, "step": 26505 }, { "entropy": 5.625256681442261, "epoch": 2.0625559229721846, "grad_norm": 1.09375, "learning_rate": 0.0004570125315397347, "loss": 4.9519, "mean_token_accuracy": 0.20686355829238892, "num_tokens": 45978258.0, "step": 26510 }, { "entropy": 5.5195780277252195, "epoch": 2.062944952343902, "grad_norm": 1.09375, "learning_rate": 0.0004569962365833558, "loss": 4.9229, "mean_token_accuracy": 0.20666848719120026, "num_tokens": 45986647.0, "step": 26515 }, { "entropy": 5.617861747741699, "epoch": 2.0633339817156195, "grad_norm": 1.15625, "learning_rate": 0.00045697993886547374, "loss": 4.9282, "mean_token_accuracy": 0.2142658442258835, "num_tokens": 45995458.0, "step": 26520 }, { "entropy": 5.787079620361328, "epoch": 2.0637230110873372, "grad_norm": 1.2265625, "learning_rate": 0.00045696363838633566, "loss": 5.0517, "mean_token_accuracy": 0.20113522112369536, "num_tokens": 46004293.0, "step": 26525 }, { "entropy": 5.695462799072265, "epoch": 2.0641120404590545, "grad_norm": 1.1015625, "learning_rate": 0.00045694733514618904, "loss": 4.9756, "mean_token_accuracy": 0.18936846554279327, "num_tokens": 46013752.0, "step": 26530 }, { "entropy": 5.661285829544068, "epoch": 2.064501069830772, "grad_norm": 1.1875, "learning_rate": 0.0004569310291452812, "loss": 5.0282, "mean_token_accuracy": 0.19684509485960006, "num_tokens": 46021935.0, "step": 26535 }, { "entropy": 5.5593581199646, "epoch": 2.06489009920249, "grad_norm": 1.1796875, "learning_rate": 0.0004569147203838595, "loss": 4.9105, "mean_token_accuracy": 0.20908818393945694, "num_tokens": 46030567.0, "step": 26540 }, { "entropy": 5.659525918960571, "epoch": 2.065279128574207, "grad_norm": 1.1875, "learning_rate": 0.00045689840886217157, "loss": 5.0601, "mean_token_accuracy": 0.1943831980228424, "num_tokens": 46038764.0, "step": 26545 }, { "entropy": 5.558755731582641, "epoch": 2.065668157945925, "grad_norm": 1.0625, "learning_rate": 0.00045688209458046475, "loss": 4.8288, "mean_token_accuracy": 0.2169098824262619, "num_tokens": 46047393.0, "step": 26550 }, { "entropy": 5.609033727645874, "epoch": 2.0660571873176425, "grad_norm": 1.15625, "learning_rate": 0.00045686577753898663, "loss": 4.9406, "mean_token_accuracy": 0.19630075991153717, "num_tokens": 46055748.0, "step": 26555 }, { "entropy": 5.653997993469238, "epoch": 2.0664462166893602, "grad_norm": 1.1953125, "learning_rate": 0.00045684945773798483, "loss": 4.935, "mean_token_accuracy": 0.19913011491298677, "num_tokens": 46063888.0, "step": 26560 }, { "entropy": 5.590912342071533, "epoch": 2.0668352460610775, "grad_norm": 1.046875, "learning_rate": 0.000456833135177707, "loss": 4.9329, "mean_token_accuracy": 0.21329182833433152, "num_tokens": 46073031.0, "step": 26565 }, { "entropy": 5.673927068710327, "epoch": 2.067224275432795, "grad_norm": 1.2265625, "learning_rate": 0.0004568168098584007, "loss": 4.9959, "mean_token_accuracy": 0.20027156472206115, "num_tokens": 46081204.0, "step": 26570 }, { "entropy": 5.718275451660157, "epoch": 2.067613304804513, "grad_norm": 1.25, "learning_rate": 0.0004568004817803137, "loss": 4.9776, "mean_token_accuracy": 0.2067365065217018, "num_tokens": 46089842.0, "step": 26575 }, { "entropy": 5.640465545654297, "epoch": 2.06800233417623, "grad_norm": 1.1640625, "learning_rate": 0.0004567841509436937, "loss": 4.9792, "mean_token_accuracy": 0.20422585159540177, "num_tokens": 46098400.0, "step": 26580 }, { "entropy": 5.639405632019043, "epoch": 2.068391363547948, "grad_norm": 1.1484375, "learning_rate": 0.0004567678173487887, "loss": 5.0332, "mean_token_accuracy": 0.19268562346696855, "num_tokens": 46106948.0, "step": 26585 }, { "entropy": 5.6877217292785645, "epoch": 2.0687803929196655, "grad_norm": 1.1796875, "learning_rate": 0.0004567514809958462, "loss": 4.9438, "mean_token_accuracy": 0.21212051808834076, "num_tokens": 46115361.0, "step": 26590 }, { "entropy": 5.643324470520019, "epoch": 2.069169422291383, "grad_norm": 1.203125, "learning_rate": 0.0004567351418851144, "loss": 4.9487, "mean_token_accuracy": 0.20449814051389695, "num_tokens": 46123658.0, "step": 26595 }, { "entropy": 5.729163932800293, "epoch": 2.0695584516631005, "grad_norm": 1.2109375, "learning_rate": 0.00045671880001684113, "loss": 5.0133, "mean_token_accuracy": 0.20009053349494935, "num_tokens": 46132511.0, "step": 26600 }, { "entropy": 5.6936863422393795, "epoch": 2.069947481034818, "grad_norm": 1.234375, "learning_rate": 0.00045670245539127413, "loss": 5.026, "mean_token_accuracy": 0.19615375697612764, "num_tokens": 46141337.0, "step": 26605 }, { "entropy": 5.669069099426269, "epoch": 2.070336510406536, "grad_norm": 1.234375, "learning_rate": 0.00045668610800866173, "loss": 5.0222, "mean_token_accuracy": 0.1943552851676941, "num_tokens": 46149161.0, "step": 26610 }, { "entropy": 5.720277738571167, "epoch": 2.070725539778253, "grad_norm": 1.21875, "learning_rate": 0.00045666975786925177, "loss": 5.0677, "mean_token_accuracy": 0.18856536448001862, "num_tokens": 46157497.0, "step": 26615 }, { "entropy": 5.637203359603882, "epoch": 2.071114569149971, "grad_norm": 1.2265625, "learning_rate": 0.0004566534049732923, "loss": 4.9389, "mean_token_accuracy": 0.2021651342511177, "num_tokens": 46165989.0, "step": 26620 }, { "entropy": 5.68719744682312, "epoch": 2.0715035985216885, "grad_norm": 1.125, "learning_rate": 0.00045663704932103166, "loss": 4.9411, "mean_token_accuracy": 0.2085090160369873, "num_tokens": 46174847.0, "step": 26625 }, { "entropy": 5.671194791793823, "epoch": 2.071892627893406, "grad_norm": 1.1796875, "learning_rate": 0.00045662069091271785, "loss": 4.9449, "mean_token_accuracy": 0.21075585931539537, "num_tokens": 46183680.0, "step": 26630 }, { "entropy": 5.652211475372314, "epoch": 2.0722816572651235, "grad_norm": 1.1875, "learning_rate": 0.00045660432974859924, "loss": 4.9661, "mean_token_accuracy": 0.20365982353687287, "num_tokens": 46192878.0, "step": 26635 }, { "entropy": 5.716404724121094, "epoch": 2.072670686636841, "grad_norm": 1.2421875, "learning_rate": 0.00045658796582892383, "loss": 5.0324, "mean_token_accuracy": 0.20075542777776717, "num_tokens": 46200891.0, "step": 26640 }, { "entropy": 5.587366437911987, "epoch": 2.073059716008559, "grad_norm": 1.15625, "learning_rate": 0.00045657159915394013, "loss": 4.9264, "mean_token_accuracy": 0.21180707961320877, "num_tokens": 46210138.0, "step": 26645 }, { "entropy": 5.661054086685181, "epoch": 2.073448745380276, "grad_norm": 1.21875, "learning_rate": 0.0004565552297238964, "loss": 4.9462, "mean_token_accuracy": 0.20340473651885987, "num_tokens": 46218729.0, "step": 26650 }, { "entropy": 5.6201142311096195, "epoch": 2.073837774751994, "grad_norm": 1.2265625, "learning_rate": 0.000456538857539041, "loss": 4.9614, "mean_token_accuracy": 0.203870290517807, "num_tokens": 46228462.0, "step": 26655 }, { "entropy": 5.651906824111938, "epoch": 2.0742268041237115, "grad_norm": 1.1796875, "learning_rate": 0.00045652248259962254, "loss": 4.9549, "mean_token_accuracy": 0.21458050906658171, "num_tokens": 46237417.0, "step": 26660 }, { "entropy": 5.65370397567749, "epoch": 2.0746158334954288, "grad_norm": 1.2578125, "learning_rate": 0.0004565061049058892, "loss": 4.9991, "mean_token_accuracy": 0.20061408132314681, "num_tokens": 46246344.0, "step": 26665 }, { "entropy": 5.6483715057373045, "epoch": 2.0750048628671465, "grad_norm": 1.171875, "learning_rate": 0.00045648972445808963, "loss": 5.0363, "mean_token_accuracy": 0.1995440751314163, "num_tokens": 46255286.0, "step": 26670 }, { "entropy": 5.678119802474976, "epoch": 2.075393892238864, "grad_norm": 1.21875, "learning_rate": 0.00045647334125647235, "loss": 4.988, "mean_token_accuracy": 0.20874561816453935, "num_tokens": 46264737.0, "step": 26675 }, { "entropy": 5.6340649127960205, "epoch": 2.0757829216105814, "grad_norm": 1.171875, "learning_rate": 0.000456456955301286, "loss": 4.923, "mean_token_accuracy": 0.21151693016290665, "num_tokens": 46273159.0, "step": 26680 }, { "entropy": 5.714944124221802, "epoch": 2.076171950982299, "grad_norm": 1.2265625, "learning_rate": 0.0004564405665927791, "loss": 5.0068, "mean_token_accuracy": 0.19804280549287795, "num_tokens": 46281559.0, "step": 26685 }, { "entropy": 5.595415830612183, "epoch": 2.076560980354017, "grad_norm": 1.203125, "learning_rate": 0.00045642417513120043, "loss": 4.927, "mean_token_accuracy": 0.21023503541946412, "num_tokens": 46289941.0, "step": 26690 }, { "entropy": 5.5971824645996096, "epoch": 2.076950009725734, "grad_norm": 1.1171875, "learning_rate": 0.00045640778091679876, "loss": 4.9332, "mean_token_accuracy": 0.20425918996334075, "num_tokens": 46298711.0, "step": 26695 }, { "entropy": 5.645776844024658, "epoch": 2.0773390390974518, "grad_norm": 1.1796875, "learning_rate": 0.0004563913839498226, "loss": 4.8927, "mean_token_accuracy": 0.20895956456661224, "num_tokens": 46306956.0, "step": 26700 }, { "entropy": 5.668462228775025, "epoch": 2.0777280684691695, "grad_norm": 1.21875, "learning_rate": 0.000456374984230521, "loss": 4.9307, "mean_token_accuracy": 0.20502977073192596, "num_tokens": 46315165.0, "step": 26705 }, { "entropy": 5.6294426918029785, "epoch": 2.078117097840887, "grad_norm": 1.21875, "learning_rate": 0.0004563585817591427, "loss": 4.8513, "mean_token_accuracy": 0.2163623094558716, "num_tokens": 46323347.0, "step": 26710 }, { "entropy": 5.674502277374268, "epoch": 2.0785061272126044, "grad_norm": 1.2578125, "learning_rate": 0.0004563421765359365, "loss": 4.9747, "mean_token_accuracy": 0.20732665210962295, "num_tokens": 46331302.0, "step": 26715 }, { "entropy": 5.680012559890747, "epoch": 2.078895156584322, "grad_norm": 1.2578125, "learning_rate": 0.00045632576856115156, "loss": 4.9804, "mean_token_accuracy": 0.20184946209192275, "num_tokens": 46339050.0, "step": 26720 }, { "entropy": 5.650476026535034, "epoch": 2.07928418595604, "grad_norm": 1.140625, "learning_rate": 0.00045630935783503657, "loss": 4.9797, "mean_token_accuracy": 0.20592773258686065, "num_tokens": 46347350.0, "step": 26725 }, { "entropy": 5.737448215484619, "epoch": 2.079673215327757, "grad_norm": 1.2265625, "learning_rate": 0.0004562929443578407, "loss": 5.0375, "mean_token_accuracy": 0.1939023971557617, "num_tokens": 46356951.0, "step": 26730 }, { "entropy": 5.75385365486145, "epoch": 2.0800622446994748, "grad_norm": 1.203125, "learning_rate": 0.0004562765281298129, "loss": 5.0674, "mean_token_accuracy": 0.20107507556676865, "num_tokens": 46367056.0, "step": 26735 }, { "entropy": 5.653292179107666, "epoch": 2.0804512740711925, "grad_norm": 1.1875, "learning_rate": 0.0004562601091512024, "loss": 4.9669, "mean_token_accuracy": 0.2043079361319542, "num_tokens": 46375668.0, "step": 26740 }, { "entropy": 5.604710435867309, "epoch": 2.08084030344291, "grad_norm": 1.1171875, "learning_rate": 0.0004562436874222582, "loss": 4.972, "mean_token_accuracy": 0.20443274080753326, "num_tokens": 46384460.0, "step": 26745 }, { "entropy": 5.5338198184967045, "epoch": 2.0812293328146274, "grad_norm": 1.09375, "learning_rate": 0.00045622726294322955, "loss": 4.7999, "mean_token_accuracy": 0.21945008933544158, "num_tokens": 46393349.0, "step": 26750 }, { "entropy": 5.6636065483093265, "epoch": 2.081618362186345, "grad_norm": 1.09375, "learning_rate": 0.00045621083571436563, "loss": 4.9622, "mean_token_accuracy": 0.2101454332470894, "num_tokens": 46403081.0, "step": 26755 }, { "entropy": 5.601922798156738, "epoch": 2.082007391558063, "grad_norm": 1.1171875, "learning_rate": 0.0004561944057359157, "loss": 4.8634, "mean_token_accuracy": 0.21406262665987014, "num_tokens": 46412219.0, "step": 26760 }, { "entropy": 5.643035411834717, "epoch": 2.08239642092978, "grad_norm": 1.1875, "learning_rate": 0.0004561779730081291, "loss": 5.0224, "mean_token_accuracy": 0.20104556530714035, "num_tokens": 46420811.0, "step": 26765 }, { "entropy": 5.574863147735596, "epoch": 2.0827854503014978, "grad_norm": 1.1171875, "learning_rate": 0.0004561615375312551, "loss": 4.9206, "mean_token_accuracy": 0.2040698394179344, "num_tokens": 46429431.0, "step": 26770 }, { "entropy": 5.638615989685059, "epoch": 2.0831744796732155, "grad_norm": 1.171875, "learning_rate": 0.00045614509930554304, "loss": 4.9914, "mean_token_accuracy": 0.1977307081222534, "num_tokens": 46438344.0, "step": 26775 }, { "entropy": 5.698194313049316, "epoch": 2.0835635090449327, "grad_norm": 1.15625, "learning_rate": 0.00045612865833124253, "loss": 5.0317, "mean_token_accuracy": 0.19812045097351075, "num_tokens": 46446960.0, "step": 26780 }, { "entropy": 5.660238456726074, "epoch": 2.0839525384166504, "grad_norm": 1.1640625, "learning_rate": 0.0004561122146086029, "loss": 4.9446, "mean_token_accuracy": 0.20396910458803177, "num_tokens": 46454862.0, "step": 26785 }, { "entropy": 5.693372297286987, "epoch": 2.084341567788368, "grad_norm": 1.296875, "learning_rate": 0.0004560957681378737, "loss": 5.0484, "mean_token_accuracy": 0.2020389348268509, "num_tokens": 46463208.0, "step": 26790 }, { "entropy": 5.697417068481445, "epoch": 2.084730597160086, "grad_norm": 1.203125, "learning_rate": 0.00045607931891930445, "loss": 5.0764, "mean_token_accuracy": 0.19468996971845626, "num_tokens": 46472253.0, "step": 26795 }, { "entropy": 5.758688640594483, "epoch": 2.085119626531803, "grad_norm": 1.125, "learning_rate": 0.0004560628669531447, "loss": 5.0521, "mean_token_accuracy": 0.1988179638981819, "num_tokens": 46482133.0, "step": 26800 }, { "entropy": 5.658542346954346, "epoch": 2.0855086559035207, "grad_norm": 1.1640625, "learning_rate": 0.00045604641223964416, "loss": 5.0149, "mean_token_accuracy": 0.20309824049472808, "num_tokens": 46491566.0, "step": 26805 }, { "entropy": 5.64645791053772, "epoch": 2.0858976852752384, "grad_norm": 1.140625, "learning_rate": 0.00045602995477905247, "loss": 5.0548, "mean_token_accuracy": 0.1894417092204094, "num_tokens": 46501283.0, "step": 26810 }, { "entropy": 5.722765684127808, "epoch": 2.0862867146469557, "grad_norm": 1.109375, "learning_rate": 0.0004560134945716194, "loss": 4.9795, "mean_token_accuracy": 0.20557035356760026, "num_tokens": 46510384.0, "step": 26815 }, { "entropy": 5.74820384979248, "epoch": 2.0866757440186734, "grad_norm": 1.1875, "learning_rate": 0.00045599703161759464, "loss": 4.9679, "mean_token_accuracy": 0.2048784077167511, "num_tokens": 46519202.0, "step": 26820 }, { "entropy": 5.637906932830811, "epoch": 2.087064773390391, "grad_norm": 1.1875, "learning_rate": 0.00045598056591722805, "loss": 4.9296, "mean_token_accuracy": 0.21224693208932877, "num_tokens": 46528030.0, "step": 26825 }, { "entropy": 5.636475610733032, "epoch": 2.0874538027621083, "grad_norm": 1.203125, "learning_rate": 0.00045596409747076936, "loss": 5.029, "mean_token_accuracy": 0.2052094370126724, "num_tokens": 46537222.0, "step": 26830 }, { "entropy": 5.683247995376587, "epoch": 2.087842832133826, "grad_norm": 1.234375, "learning_rate": 0.0004559476262784686, "loss": 4.9657, "mean_token_accuracy": 0.20550545752048494, "num_tokens": 46546486.0, "step": 26835 }, { "entropy": 5.701554250717163, "epoch": 2.0882318615055437, "grad_norm": 1.1484375, "learning_rate": 0.0004559311523405755, "loss": 4.9905, "mean_token_accuracy": 0.20799928158521652, "num_tokens": 46554518.0, "step": 26840 }, { "entropy": 5.655041837692261, "epoch": 2.0886208908772614, "grad_norm": 1.1640625, "learning_rate": 0.0004559146756573402, "loss": 4.9785, "mean_token_accuracy": 0.20625345259904862, "num_tokens": 46563183.0, "step": 26845 }, { "entropy": 5.6474872589111325, "epoch": 2.0890099202489787, "grad_norm": 1.203125, "learning_rate": 0.00045589819622901274, "loss": 4.8814, "mean_token_accuracy": 0.2107277899980545, "num_tokens": 46571514.0, "step": 26850 }, { "entropy": 5.653233623504638, "epoch": 2.0893989496206964, "grad_norm": 1.1484375, "learning_rate": 0.000455881714055843, "loss": 4.9831, "mean_token_accuracy": 0.2043130189180374, "num_tokens": 46580827.0, "step": 26855 }, { "entropy": 5.659988021850586, "epoch": 2.089787978992414, "grad_norm": 1.0234375, "learning_rate": 0.00045586522913808114, "loss": 5.0518, "mean_token_accuracy": 0.19235794991254807, "num_tokens": 46591254.0, "step": 26860 }, { "entropy": 5.668125867843628, "epoch": 2.0901770083641313, "grad_norm": 1.171875, "learning_rate": 0.0004558487414759773, "loss": 4.9299, "mean_token_accuracy": 0.207416769862175, "num_tokens": 46599576.0, "step": 26865 }, { "entropy": 5.672613525390625, "epoch": 2.090566037735849, "grad_norm": 1.15625, "learning_rate": 0.00045583225106978175, "loss": 4.9968, "mean_token_accuracy": 0.20092121064662932, "num_tokens": 46607607.0, "step": 26870 }, { "entropy": 5.5522102355957035, "epoch": 2.0909550671075667, "grad_norm": 1.1328125, "learning_rate": 0.0004558157579197446, "loss": 4.9243, "mean_token_accuracy": 0.20762602388858795, "num_tokens": 46616446.0, "step": 26875 }, { "entropy": 5.60401930809021, "epoch": 2.091344096479284, "grad_norm": 1.1484375, "learning_rate": 0.00045579926202611603, "loss": 4.9212, "mean_token_accuracy": 0.2051151692867279, "num_tokens": 46624875.0, "step": 26880 }, { "entropy": 5.615758037567138, "epoch": 2.0917331258510017, "grad_norm": 1.140625, "learning_rate": 0.0004557827633891465, "loss": 4.9003, "mean_token_accuracy": 0.20952813029289247, "num_tokens": 46633354.0, "step": 26885 }, { "entropy": 5.693089723587036, "epoch": 2.0921221552227194, "grad_norm": 1.3828125, "learning_rate": 0.0004557662620090863, "loss": 4.961, "mean_token_accuracy": 0.2088773861527443, "num_tokens": 46642034.0, "step": 26890 }, { "entropy": 5.634365129470825, "epoch": 2.092511184594437, "grad_norm": 1.203125, "learning_rate": 0.00045574975788618564, "loss": 4.9727, "mean_token_accuracy": 0.2071936011314392, "num_tokens": 46650675.0, "step": 26895 }, { "entropy": 5.630176162719726, "epoch": 2.0929002139661543, "grad_norm": 1.171875, "learning_rate": 0.0004557332510206953, "loss": 4.8923, "mean_token_accuracy": 0.2086065426468849, "num_tokens": 46658834.0, "step": 26900 }, { "entropy": 5.605818462371826, "epoch": 2.093289243337872, "grad_norm": 1.1640625, "learning_rate": 0.0004557167414128654, "loss": 4.8709, "mean_token_accuracy": 0.2129761591553688, "num_tokens": 46667386.0, "step": 26905 }, { "entropy": 5.608803653717041, "epoch": 2.0936782727095897, "grad_norm": 1.1796875, "learning_rate": 0.0004557002290629467, "loss": 4.8706, "mean_token_accuracy": 0.21713883131742479, "num_tokens": 46675492.0, "step": 26910 }, { "entropy": 5.592059326171875, "epoch": 2.094067302081307, "grad_norm": 1.171875, "learning_rate": 0.00045568371397118954, "loss": 4.9642, "mean_token_accuracy": 0.20575750470161439, "num_tokens": 46684079.0, "step": 26915 }, { "entropy": 5.604903221130371, "epoch": 2.0944563314530247, "grad_norm": 1.15625, "learning_rate": 0.0004556671961378446, "loss": 4.9984, "mean_token_accuracy": 0.20107370167970656, "num_tokens": 46693059.0, "step": 26920 }, { "entropy": 5.679714012145996, "epoch": 2.0948453608247424, "grad_norm": 1.140625, "learning_rate": 0.00045565067556316264, "loss": 4.9262, "mean_token_accuracy": 0.20789339393377304, "num_tokens": 46701639.0, "step": 26925 }, { "entropy": 5.669080400466919, "epoch": 2.0952343901964596, "grad_norm": 1.09375, "learning_rate": 0.0004556341522473941, "loss": 4.9888, "mean_token_accuracy": 0.20707928091287614, "num_tokens": 46710870.0, "step": 26930 }, { "entropy": 5.687580537796021, "epoch": 2.0956234195681773, "grad_norm": 1.1796875, "learning_rate": 0.0004556176261907899, "loss": 5.0095, "mean_token_accuracy": 0.20127218961715698, "num_tokens": 46719236.0, "step": 26935 }, { "entropy": 5.613267612457276, "epoch": 2.096012448939895, "grad_norm": 1.1796875, "learning_rate": 0.0004556010973936006, "loss": 4.9698, "mean_token_accuracy": 0.2067894771695137, "num_tokens": 46727595.0, "step": 26940 }, { "entropy": 5.624761152267456, "epoch": 2.0964014783116127, "grad_norm": 1.1796875, "learning_rate": 0.0004555845658560772, "loss": 4.9609, "mean_token_accuracy": 0.20776853412389756, "num_tokens": 46735874.0, "step": 26945 }, { "entropy": 5.590955829620361, "epoch": 2.09679050768333, "grad_norm": 1.3125, "learning_rate": 0.00045556803157847036, "loss": 4.9834, "mean_token_accuracy": 0.20776810944080354, "num_tokens": 46744738.0, "step": 26950 }, { "entropy": 5.650467109680176, "epoch": 2.0971795370550477, "grad_norm": 1.171875, "learning_rate": 0.00045555149456103113, "loss": 4.9584, "mean_token_accuracy": 0.2028719365596771, "num_tokens": 46753252.0, "step": 26955 }, { "entropy": 5.6390056133270265, "epoch": 2.0975685664267654, "grad_norm": 1.2109375, "learning_rate": 0.0004555349548040102, "loss": 4.9001, "mean_token_accuracy": 0.21272372007369994, "num_tokens": 46761234.0, "step": 26960 }, { "entropy": 5.6585047245025635, "epoch": 2.0979575957984826, "grad_norm": 1.1484375, "learning_rate": 0.0004555184123076589, "loss": 5.0425, "mean_token_accuracy": 0.1896699845790863, "num_tokens": 46770087.0, "step": 26965 }, { "entropy": 5.56899938583374, "epoch": 2.0983466251702003, "grad_norm": 1.140625, "learning_rate": 0.00045550186707222785, "loss": 4.9039, "mean_token_accuracy": 0.20946605056524276, "num_tokens": 46778985.0, "step": 26970 }, { "entropy": 5.660170221328736, "epoch": 2.098735654541918, "grad_norm": 1.203125, "learning_rate": 0.0004554853190979683, "loss": 4.9796, "mean_token_accuracy": 0.20042819231748582, "num_tokens": 46787402.0, "step": 26975 }, { "entropy": 5.657966232299804, "epoch": 2.0991246839136353, "grad_norm": 1.234375, "learning_rate": 0.00045546876838513134, "loss": 5.0052, "mean_token_accuracy": 0.20034054517745972, "num_tokens": 46796254.0, "step": 26980 }, { "entropy": 5.621960258483886, "epoch": 2.099513713285353, "grad_norm": 1.1328125, "learning_rate": 0.00045545221493396805, "loss": 4.9549, "mean_token_accuracy": 0.20396398901939392, "num_tokens": 46804979.0, "step": 26985 }, { "entropy": 5.576362419128418, "epoch": 2.0999027426570707, "grad_norm": 1.1484375, "learning_rate": 0.00045543565874472963, "loss": 4.8941, "mean_token_accuracy": 0.20886219888925553, "num_tokens": 46813718.0, "step": 26990 }, { "entropy": 5.642062664031982, "epoch": 2.1002917720287884, "grad_norm": 1.21875, "learning_rate": 0.00045541909981766725, "loss": 4.9907, "mean_token_accuracy": 0.1973240628838539, "num_tokens": 46822265.0, "step": 26995 }, { "entropy": 5.631021118164062, "epoch": 2.1006808014005056, "grad_norm": 1.1171875, "learning_rate": 0.0004554025381530322, "loss": 4.9463, "mean_token_accuracy": 0.20807376652956008, "num_tokens": 46831292.0, "step": 27000 }, { "epoch": 2.1006808014005056, "eval_entropy": 5.3641257390709765, "eval_loss": 5.081192970275879, "eval_mean_token_accuracy": 0.20784418285753545, "eval_num_tokens": 46831292.0, "eval_runtime": 21.6379, "eval_samples_per_second": 1920.61, "eval_steps_per_second": 240.088, "step": 27000 }, { "entropy": 5.563542890548706, "epoch": 2.1010698307722233, "grad_norm": 1.046875, "learning_rate": 0.0004553859737510758, "loss": 4.9402, "mean_token_accuracy": 0.20892764627933502, "num_tokens": 46840029.0, "step": 27005 }, { "entropy": 5.602303075790405, "epoch": 2.101458860143941, "grad_norm": 1.1171875, "learning_rate": 0.0004553694066120493, "loss": 4.8787, "mean_token_accuracy": 0.21417092084884642, "num_tokens": 46848475.0, "step": 27010 }, { "entropy": 5.693900537490845, "epoch": 2.1018478895156583, "grad_norm": 1.1015625, "learning_rate": 0.00045535283673620426, "loss": 5.0085, "mean_token_accuracy": 0.2023899957537651, "num_tokens": 46857124.0, "step": 27015 }, { "entropy": 5.7399571418762205, "epoch": 2.102236918887376, "grad_norm": 1.2578125, "learning_rate": 0.00045533626412379194, "loss": 5.0668, "mean_token_accuracy": 0.19951678812503815, "num_tokens": 46865809.0, "step": 27020 }, { "entropy": 5.671175813674926, "epoch": 2.1026259482590937, "grad_norm": 1.2265625, "learning_rate": 0.0004553196887750638, "loss": 5.0009, "mean_token_accuracy": 0.20045589059591293, "num_tokens": 46874845.0, "step": 27025 }, { "entropy": 5.614249038696289, "epoch": 2.103014977630811, "grad_norm": 1.203125, "learning_rate": 0.0004553031106902714, "loss": 4.9335, "mean_token_accuracy": 0.20636997520923614, "num_tokens": 46883740.0, "step": 27030 }, { "entropy": 5.6016473293304445, "epoch": 2.1034040070025286, "grad_norm": 1.15625, "learning_rate": 0.00045528652986966627, "loss": 4.9259, "mean_token_accuracy": 0.2106273889541626, "num_tokens": 46891936.0, "step": 27035 }, { "entropy": 5.5653074264526365, "epoch": 2.1037930363742463, "grad_norm": 1.109375, "learning_rate": 0.00045526994631350006, "loss": 4.9298, "mean_token_accuracy": 0.20003296434879303, "num_tokens": 46900918.0, "step": 27040 }, { "entropy": 5.6614164352417, "epoch": 2.104182065745964, "grad_norm": 1.109375, "learning_rate": 0.0004552533600220243, "loss": 5.0028, "mean_token_accuracy": 0.20473578423261643, "num_tokens": 46910785.0, "step": 27045 }, { "entropy": 5.7040932178497314, "epoch": 2.1045710951176813, "grad_norm": 1.2265625, "learning_rate": 0.00045523677099549073, "loss": 5.0173, "mean_token_accuracy": 0.20693925619125367, "num_tokens": 46919191.0, "step": 27050 }, { "entropy": 5.606227779388428, "epoch": 2.104960124489399, "grad_norm": 1.0546875, "learning_rate": 0.000455220179234151, "loss": 4.9376, "mean_token_accuracy": 0.1986640214920044, "num_tokens": 46927574.0, "step": 27055 }, { "entropy": 5.593212366104126, "epoch": 2.1053491538611167, "grad_norm": 1.2109375, "learning_rate": 0.0004552035847382569, "loss": 4.9181, "mean_token_accuracy": 0.20893942713737487, "num_tokens": 46935694.0, "step": 27060 }, { "entropy": 5.669870185852051, "epoch": 2.105738183232834, "grad_norm": 1.265625, "learning_rate": 0.00045518698750806024, "loss": 5.0359, "mean_token_accuracy": 0.19965364336967467, "num_tokens": 46943929.0, "step": 27065 }, { "entropy": 5.585590648651123, "epoch": 2.1061272126045516, "grad_norm": 1.1328125, "learning_rate": 0.00045517038754381287, "loss": 4.8503, "mean_token_accuracy": 0.21308740675449372, "num_tokens": 46952130.0, "step": 27070 }, { "entropy": 5.622035169601441, "epoch": 2.1065162419762693, "grad_norm": 1.1484375, "learning_rate": 0.0004551537848457666, "loss": 5.0024, "mean_token_accuracy": 0.20514059364795684, "num_tokens": 46961010.0, "step": 27075 }, { "entropy": 5.65416579246521, "epoch": 2.106905271347987, "grad_norm": 1.09375, "learning_rate": 0.0004551371794141734, "loss": 4.98, "mean_token_accuracy": 0.20750903189182282, "num_tokens": 46969789.0, "step": 27080 }, { "entropy": 5.690608644485474, "epoch": 2.1072943007197042, "grad_norm": 1.1328125, "learning_rate": 0.0004551205712492852, "loss": 5.0217, "mean_token_accuracy": 0.20226107835769652, "num_tokens": 46977436.0, "step": 27085 }, { "entropy": 5.641244173049927, "epoch": 2.107683330091422, "grad_norm": 1.1796875, "learning_rate": 0.0004551039603513541, "loss": 4.9778, "mean_token_accuracy": 0.20383305549621583, "num_tokens": 46986065.0, "step": 27090 }, { "entropy": 5.607875633239746, "epoch": 2.1080723594631396, "grad_norm": 1.125, "learning_rate": 0.00045508734672063204, "loss": 4.9933, "mean_token_accuracy": 0.19743527770042418, "num_tokens": 46994355.0, "step": 27095 }, { "entropy": 5.598174953460694, "epoch": 2.108461388834857, "grad_norm": 1.109375, "learning_rate": 0.0004550707303573711, "loss": 4.9328, "mean_token_accuracy": 0.20801200419664384, "num_tokens": 47003028.0, "step": 27100 }, { "entropy": 5.679186677932739, "epoch": 2.1088504182065746, "grad_norm": 1.0546875, "learning_rate": 0.00045505411126182347, "loss": 5.0675, "mean_token_accuracy": 0.1974827006459236, "num_tokens": 47012351.0, "step": 27105 }, { "entropy": 5.714065265655518, "epoch": 2.1092394475782923, "grad_norm": 1.171875, "learning_rate": 0.0004550374894342412, "loss": 5.0119, "mean_token_accuracy": 0.21116914600133896, "num_tokens": 47020600.0, "step": 27110 }, { "entropy": 5.6268799781799315, "epoch": 2.1096284769500095, "grad_norm": 1.1484375, "learning_rate": 0.0004550208648748767, "loss": 4.9613, "mean_token_accuracy": 0.20659760385751724, "num_tokens": 47029276.0, "step": 27115 }, { "entropy": 5.598564147949219, "epoch": 2.1100175063217272, "grad_norm": 1.0859375, "learning_rate": 0.000455004237583982, "loss": 4.9258, "mean_token_accuracy": 0.21210245341062545, "num_tokens": 47037894.0, "step": 27120 }, { "entropy": 5.6157678127288815, "epoch": 2.110406535693445, "grad_norm": 1.1484375, "learning_rate": 0.0004549876075618096, "loss": 4.9097, "mean_token_accuracy": 0.21055041551589965, "num_tokens": 47046602.0, "step": 27125 }, { "entropy": 5.643511533737183, "epoch": 2.110795565065162, "grad_norm": 1.21875, "learning_rate": 0.0004549709748086117, "loss": 5.0491, "mean_token_accuracy": 0.1972138836979866, "num_tokens": 47056091.0, "step": 27130 }, { "entropy": 5.684809398651123, "epoch": 2.11118459443688, "grad_norm": 1.2578125, "learning_rate": 0.00045495433932464063, "loss": 4.9989, "mean_token_accuracy": 0.20104096382856368, "num_tokens": 47065420.0, "step": 27135 }, { "entropy": 5.673998165130615, "epoch": 2.1115736238085976, "grad_norm": 1.2265625, "learning_rate": 0.000454937701110149, "loss": 4.9443, "mean_token_accuracy": 0.20519423335790635, "num_tokens": 47074247.0, "step": 27140 }, { "entropy": 5.722423076629639, "epoch": 2.1119626531803153, "grad_norm": 1.203125, "learning_rate": 0.00045492106016538917, "loss": 5.0833, "mean_token_accuracy": 0.19585226029157637, "num_tokens": 47083589.0, "step": 27145 }, { "entropy": 5.647662830352783, "epoch": 2.1123516825520325, "grad_norm": 1.2421875, "learning_rate": 0.00045490441649061354, "loss": 4.9272, "mean_token_accuracy": 0.20664165914058685, "num_tokens": 47091861.0, "step": 27150 }, { "entropy": 5.740076637268066, "epoch": 2.1127407119237502, "grad_norm": 1.1875, "learning_rate": 0.0004548877700860747, "loss": 5.1317, "mean_token_accuracy": 0.19574118852615358, "num_tokens": 47101436.0, "step": 27155 }, { "entropy": 5.660910987854004, "epoch": 2.113129741295468, "grad_norm": 1.2265625, "learning_rate": 0.00045487112095202544, "loss": 4.9854, "mean_token_accuracy": 0.20576485693454744, "num_tokens": 47110390.0, "step": 27160 }, { "entropy": 5.713831281661987, "epoch": 2.113518770667185, "grad_norm": 1.234375, "learning_rate": 0.0004548544690887181, "loss": 5.1322, "mean_token_accuracy": 0.19433755725622176, "num_tokens": 47119001.0, "step": 27165 }, { "entropy": 5.612178182601928, "epoch": 2.113907800038903, "grad_norm": 1.2265625, "learning_rate": 0.0004548378144964054, "loss": 4.9697, "mean_token_accuracy": 0.20530997216701508, "num_tokens": 47127067.0, "step": 27170 }, { "entropy": 5.706681203842163, "epoch": 2.1142968294106206, "grad_norm": 1.1328125, "learning_rate": 0.00045482115717534024, "loss": 5.1289, "mean_token_accuracy": 0.19517124444246292, "num_tokens": 47136747.0, "step": 27175 }, { "entropy": 5.64862813949585, "epoch": 2.1146858587823383, "grad_norm": 1.1328125, "learning_rate": 0.0004548044971257752, "loss": 4.931, "mean_token_accuracy": 0.21079221963882447, "num_tokens": 47145783.0, "step": 27180 }, { "entropy": 5.662263965606689, "epoch": 2.1150748881540555, "grad_norm": 1.2265625, "learning_rate": 0.00045478783434796307, "loss": 4.9514, "mean_token_accuracy": 0.20635451674461364, "num_tokens": 47154344.0, "step": 27185 }, { "entropy": 5.617177820205688, "epoch": 2.1154639175257732, "grad_norm": 1.1328125, "learning_rate": 0.00045477116884215675, "loss": 5.0101, "mean_token_accuracy": 0.20029531866312028, "num_tokens": 47163733.0, "step": 27190 }, { "entropy": 5.628353881835937, "epoch": 2.115852946897491, "grad_norm": 1.140625, "learning_rate": 0.000454754500608609, "loss": 4.9902, "mean_token_accuracy": 0.1998388037085533, "num_tokens": 47172341.0, "step": 27195 }, { "entropy": 5.476606607437134, "epoch": 2.116241976269208, "grad_norm": 1.0703125, "learning_rate": 0.0004547378296475729, "loss": 4.7883, "mean_token_accuracy": 0.22819015085697175, "num_tokens": 47181118.0, "step": 27200 }, { "entropy": 5.626533079147339, "epoch": 2.116631005640926, "grad_norm": 1.09375, "learning_rate": 0.00045472115595930124, "loss": 5.0502, "mean_token_accuracy": 0.20511362105607986, "num_tokens": 47190348.0, "step": 27205 }, { "entropy": 5.673224544525146, "epoch": 2.1170200350126436, "grad_norm": 1.109375, "learning_rate": 0.00045470447954404716, "loss": 5.0769, "mean_token_accuracy": 0.19351949095726012, "num_tokens": 47199812.0, "step": 27210 }, { "entropy": 5.663194179534912, "epoch": 2.117409064384361, "grad_norm": 1.1640625, "learning_rate": 0.00045468780040206364, "loss": 4.9923, "mean_token_accuracy": 0.20491045117378234, "num_tokens": 47208547.0, "step": 27215 }, { "entropy": 5.6621301651000975, "epoch": 2.1177980937560785, "grad_norm": 1.125, "learning_rate": 0.0004546711185336037, "loss": 4.9113, "mean_token_accuracy": 0.20972665697336196, "num_tokens": 47216980.0, "step": 27220 }, { "entropy": 5.679471206665039, "epoch": 2.1181871231277962, "grad_norm": 1.1484375, "learning_rate": 0.00045465443393892047, "loss": 5.0091, "mean_token_accuracy": 0.20038662403821944, "num_tokens": 47225701.0, "step": 27225 }, { "entropy": 5.661901044845581, "epoch": 2.118576152499514, "grad_norm": 1.1328125, "learning_rate": 0.0004546377466182673, "loss": 5.0174, "mean_token_accuracy": 0.20257530510425567, "num_tokens": 47234760.0, "step": 27230 }, { "entropy": 5.725389766693115, "epoch": 2.118965181871231, "grad_norm": 1.1484375, "learning_rate": 0.0004546210565718972, "loss": 5.0341, "mean_token_accuracy": 0.20036063492298126, "num_tokens": 47243392.0, "step": 27235 }, { "entropy": 5.659800577163696, "epoch": 2.119354211242949, "grad_norm": 1.2734375, "learning_rate": 0.00045460436380006337, "loss": 4.9674, "mean_token_accuracy": 0.2063915804028511, "num_tokens": 47251297.0, "step": 27240 }, { "entropy": 5.572218751907348, "epoch": 2.1197432406146666, "grad_norm": 1.25, "learning_rate": 0.0004545876683030192, "loss": 4.8833, "mean_token_accuracy": 0.2053698018193245, "num_tokens": 47259859.0, "step": 27245 }, { "entropy": 5.688512992858887, "epoch": 2.120132269986384, "grad_norm": 1.15625, "learning_rate": 0.0004545709700810181, "loss": 5.028, "mean_token_accuracy": 0.20024223625659943, "num_tokens": 47268653.0, "step": 27250 }, { "entropy": 5.679240417480469, "epoch": 2.1205212993581015, "grad_norm": 1.1484375, "learning_rate": 0.0004545542691343133, "loss": 4.9478, "mean_token_accuracy": 0.19937656819820404, "num_tokens": 47277254.0, "step": 27255 }, { "entropy": 5.644027519226074, "epoch": 2.120910328729819, "grad_norm": 1.203125, "learning_rate": 0.0004545375654631582, "loss": 5.0402, "mean_token_accuracy": 0.19777652025222778, "num_tokens": 47285885.0, "step": 27260 }, { "entropy": 5.598689603805542, "epoch": 2.1212993581015365, "grad_norm": 1.1484375, "learning_rate": 0.00045452085906780645, "loss": 4.9546, "mean_token_accuracy": 0.2013024777173996, "num_tokens": 47294025.0, "step": 27265 }, { "entropy": 5.601646471023559, "epoch": 2.121688387473254, "grad_norm": 1.1484375, "learning_rate": 0.00045450414994851123, "loss": 4.9095, "mean_token_accuracy": 0.20689614862203598, "num_tokens": 47303531.0, "step": 27270 }, { "entropy": 5.707169437408448, "epoch": 2.122077416844972, "grad_norm": 1.203125, "learning_rate": 0.00045448743810552636, "loss": 5.0589, "mean_token_accuracy": 0.1968978837132454, "num_tokens": 47311753.0, "step": 27275 }, { "entropy": 5.593207883834839, "epoch": 2.1224664462166896, "grad_norm": 1.1328125, "learning_rate": 0.00045447072353910537, "loss": 4.9425, "mean_token_accuracy": 0.2035182610154152, "num_tokens": 47320736.0, "step": 27280 }, { "entropy": 5.68157467842102, "epoch": 2.122855475588407, "grad_norm": 1.1015625, "learning_rate": 0.0004544540062495016, "loss": 4.9831, "mean_token_accuracy": 0.20291750580072404, "num_tokens": 47329498.0, "step": 27285 }, { "entropy": 5.689104986190796, "epoch": 2.1232445049601245, "grad_norm": 1.171875, "learning_rate": 0.00045443728623696905, "loss": 5.0106, "mean_token_accuracy": 0.20344837307929992, "num_tokens": 47338375.0, "step": 27290 }, { "entropy": 5.593250274658203, "epoch": 2.123633534331842, "grad_norm": 1.109375, "learning_rate": 0.00045442056350176123, "loss": 4.9799, "mean_token_accuracy": 0.20140205919742585, "num_tokens": 47346608.0, "step": 27295 }, { "entropy": 5.676001310348511, "epoch": 2.1240225637035595, "grad_norm": 1.296875, "learning_rate": 0.000454403838044132, "loss": 5.0335, "mean_token_accuracy": 0.20317400246858597, "num_tokens": 47355375.0, "step": 27300 }, { "entropy": 5.6658539295196535, "epoch": 2.124411593075277, "grad_norm": 1.2109375, "learning_rate": 0.000454387109864335, "loss": 4.9762, "mean_token_accuracy": 0.2062320217490196, "num_tokens": 47363138.0, "step": 27305 }, { "entropy": 5.694979667663574, "epoch": 2.124800622446995, "grad_norm": 1.359375, "learning_rate": 0.00045437037896262425, "loss": 5.0495, "mean_token_accuracy": 0.19063601046800613, "num_tokens": 47371431.0, "step": 27310 }, { "entropy": 5.611158800125122, "epoch": 2.125189651818712, "grad_norm": 1.1875, "learning_rate": 0.0004543536453392534, "loss": 4.9643, "mean_token_accuracy": 0.20748103111982347, "num_tokens": 47379739.0, "step": 27315 }, { "entropy": 5.644260597229004, "epoch": 2.12557868119043, "grad_norm": 1.1328125, "learning_rate": 0.00045433690899447643, "loss": 4.9984, "mean_token_accuracy": 0.20254726558923722, "num_tokens": 47389240.0, "step": 27320 }, { "entropy": 5.66878023147583, "epoch": 2.1259677105621475, "grad_norm": 1.1640625, "learning_rate": 0.00045432016992854734, "loss": 4.8844, "mean_token_accuracy": 0.2123904660344124, "num_tokens": 47397666.0, "step": 27325 }, { "entropy": 5.653374862670899, "epoch": 2.126356739933865, "grad_norm": 1.125, "learning_rate": 0.0004543034281417201, "loss": 5.0325, "mean_token_accuracy": 0.199564591050148, "num_tokens": 47407419.0, "step": 27330 }, { "entropy": 5.612128448486328, "epoch": 2.1267457693055825, "grad_norm": 1.09375, "learning_rate": 0.0004542866836342488, "loss": 5.0064, "mean_token_accuracy": 0.2030037075281143, "num_tokens": 47416750.0, "step": 27335 }, { "entropy": 5.672733163833618, "epoch": 2.1271347986773, "grad_norm": 1.1640625, "learning_rate": 0.0004542699364063873, "loss": 4.965, "mean_token_accuracy": 0.20803673863410949, "num_tokens": 47425833.0, "step": 27340 }, { "entropy": 5.634221696853638, "epoch": 2.127523828049018, "grad_norm": 1.234375, "learning_rate": 0.0004542531864583899, "loss": 4.9103, "mean_token_accuracy": 0.20640700906515122, "num_tokens": 47434470.0, "step": 27345 }, { "entropy": 5.663233995437622, "epoch": 2.127912857420735, "grad_norm": 1.234375, "learning_rate": 0.0004542364337905108, "loss": 4.9808, "mean_token_accuracy": 0.20466700494289397, "num_tokens": 47442904.0, "step": 27350 }, { "entropy": 5.659377527236939, "epoch": 2.128301886792453, "grad_norm": 1.1875, "learning_rate": 0.00045421967840300403, "loss": 5.0248, "mean_token_accuracy": 0.2030541330575943, "num_tokens": 47452373.0, "step": 27355 }, { "entropy": 5.629278516769409, "epoch": 2.1286909161641705, "grad_norm": 1.2890625, "learning_rate": 0.0004542029202961239, "loss": 4.8545, "mean_token_accuracy": 0.2118447095155716, "num_tokens": 47460504.0, "step": 27360 }, { "entropy": 5.612955760955811, "epoch": 2.1290799455358878, "grad_norm": 1.1640625, "learning_rate": 0.00045418615947012464, "loss": 4.9697, "mean_token_accuracy": 0.20206628888845443, "num_tokens": 47469526.0, "step": 27365 }, { "entropy": 5.5686359882354735, "epoch": 2.1294689749076054, "grad_norm": 1.234375, "learning_rate": 0.0004541693959252607, "loss": 4.9249, "mean_token_accuracy": 0.20559095293283464, "num_tokens": 47478241.0, "step": 27370 }, { "entropy": 5.609032154083252, "epoch": 2.129858004279323, "grad_norm": 1.1953125, "learning_rate": 0.00045415262966178635, "loss": 4.9432, "mean_token_accuracy": 0.21505898386240005, "num_tokens": 47486956.0, "step": 27375 }, { "entropy": 5.617249870300293, "epoch": 2.130247033651041, "grad_norm": 1.171875, "learning_rate": 0.0004541358606799559, "loss": 4.8732, "mean_token_accuracy": 0.21700578927993774, "num_tokens": 47494817.0, "step": 27380 }, { "entropy": 5.596308708190918, "epoch": 2.130636063022758, "grad_norm": 1.21875, "learning_rate": 0.000454119088980024, "loss": 4.9796, "mean_token_accuracy": 0.19713669866323472, "num_tokens": 47504124.0, "step": 27385 }, { "entropy": 5.667692518234253, "epoch": 2.131025092394476, "grad_norm": 1.2734375, "learning_rate": 0.0004541023145622449, "loss": 4.9467, "mean_token_accuracy": 0.20680411607027055, "num_tokens": 47513160.0, "step": 27390 }, { "entropy": 5.626252222061157, "epoch": 2.1314141217661935, "grad_norm": 1.1484375, "learning_rate": 0.00045408553742687336, "loss": 4.8849, "mean_token_accuracy": 0.20988605320453643, "num_tokens": 47521298.0, "step": 27395 }, { "entropy": 5.570216417312622, "epoch": 2.1318031511379107, "grad_norm": 1.15625, "learning_rate": 0.0004540687575741638, "loss": 4.8934, "mean_token_accuracy": 0.20682184249162675, "num_tokens": 47529516.0, "step": 27400 }, { "entropy": 5.597129869461059, "epoch": 2.1321921805096284, "grad_norm": 1.2109375, "learning_rate": 0.00045405197500437077, "loss": 4.9463, "mean_token_accuracy": 0.2018884763121605, "num_tokens": 47538311.0, "step": 27405 }, { "entropy": 5.729092979431153, "epoch": 2.132581209881346, "grad_norm": 1.125, "learning_rate": 0.00045403518971774915, "loss": 5.0546, "mean_token_accuracy": 0.19918266236782073, "num_tokens": 47547186.0, "step": 27410 }, { "entropy": 5.636409330368042, "epoch": 2.132970239253064, "grad_norm": 1.1015625, "learning_rate": 0.00045401840171455343, "loss": 4.8809, "mean_token_accuracy": 0.2120130479335785, "num_tokens": 47556173.0, "step": 27415 }, { "entropy": 5.6338848114013675, "epoch": 2.133359268624781, "grad_norm": 1.1328125, "learning_rate": 0.0004540016109950384, "loss": 4.9085, "mean_token_accuracy": 0.20945651680231095, "num_tokens": 47564595.0, "step": 27420 }, { "entropy": 5.586865663528442, "epoch": 2.133748297996499, "grad_norm": 1.1875, "learning_rate": 0.0004539848175594589, "loss": 4.9221, "mean_token_accuracy": 0.20369429439306258, "num_tokens": 47573559.0, "step": 27425 }, { "entropy": 5.629490375518799, "epoch": 2.1341373273682165, "grad_norm": 1.1875, "learning_rate": 0.0004539680214080695, "loss": 4.8649, "mean_token_accuracy": 0.2113366976380348, "num_tokens": 47582178.0, "step": 27430 }, { "entropy": 5.589909934997559, "epoch": 2.1345263567399337, "grad_norm": 1.140625, "learning_rate": 0.00045395122254112536, "loss": 4.8249, "mean_token_accuracy": 0.21771973222494126, "num_tokens": 47590738.0, "step": 27435 }, { "entropy": 5.716506385803223, "epoch": 2.1349153861116514, "grad_norm": 1.2578125, "learning_rate": 0.0004539344209588812, "loss": 5.0756, "mean_token_accuracy": 0.19295873790979384, "num_tokens": 47599339.0, "step": 27440 }, { "entropy": 5.599170541763305, "epoch": 2.135304415483369, "grad_norm": 1.125, "learning_rate": 0.00045391761666159204, "loss": 4.9334, "mean_token_accuracy": 0.20121181458234788, "num_tokens": 47608250.0, "step": 27445 }, { "entropy": 5.705484056472779, "epoch": 2.1356934448550864, "grad_norm": 1.203125, "learning_rate": 0.00045390080964951294, "loss": 4.9749, "mean_token_accuracy": 0.20401859283447266, "num_tokens": 47616823.0, "step": 27450 }, { "entropy": 5.695999336242676, "epoch": 2.136082474226804, "grad_norm": 1.1484375, "learning_rate": 0.00045388399992289864, "loss": 5.0091, "mean_token_accuracy": 0.20187665969133378, "num_tokens": 47627002.0, "step": 27455 }, { "entropy": 5.758505201339721, "epoch": 2.136471503598522, "grad_norm": 1.28125, "learning_rate": 0.00045386718748200436, "loss": 5.0738, "mean_token_accuracy": 0.19698621928691865, "num_tokens": 47635588.0, "step": 27460 }, { "entropy": 5.720224857330322, "epoch": 2.136860532970239, "grad_norm": 1.140625, "learning_rate": 0.00045385037232708534, "loss": 5.0421, "mean_token_accuracy": 0.2048656940460205, "num_tokens": 47645089.0, "step": 27465 }, { "entropy": 5.7178315162658695, "epoch": 2.1372495623419567, "grad_norm": 1.2109375, "learning_rate": 0.0004538335544583964, "loss": 5.0155, "mean_token_accuracy": 0.1998465895652771, "num_tokens": 47654088.0, "step": 27470 }, { "entropy": 5.683925628662109, "epoch": 2.1376385917136744, "grad_norm": 1.2890625, "learning_rate": 0.00045381673387619306, "loss": 5.0552, "mean_token_accuracy": 0.19350093156099318, "num_tokens": 47662367.0, "step": 27475 }, { "entropy": 5.6562745571136475, "epoch": 2.138027621085392, "grad_norm": 1.1484375, "learning_rate": 0.00045379991058073035, "loss": 4.9825, "mean_token_accuracy": 0.19147418737411498, "num_tokens": 47670197.0, "step": 27480 }, { "entropy": 5.653225994110107, "epoch": 2.1384166504571094, "grad_norm": 1.1796875, "learning_rate": 0.0004537830845722636, "loss": 5.0353, "mean_token_accuracy": 0.20156540274620055, "num_tokens": 47678396.0, "step": 27485 }, { "entropy": 5.575530529022217, "epoch": 2.138805679828827, "grad_norm": 1.171875, "learning_rate": 0.0004537662558510481, "loss": 4.9078, "mean_token_accuracy": 0.20798664391040803, "num_tokens": 47686671.0, "step": 27490 }, { "entropy": 5.696052169799804, "epoch": 2.1391947092005448, "grad_norm": 1.25, "learning_rate": 0.00045374942441733925, "loss": 5.0046, "mean_token_accuracy": 0.19308063983917237, "num_tokens": 47694923.0, "step": 27495 }, { "entropy": 5.633045721054077, "epoch": 2.139583738572262, "grad_norm": 1.2265625, "learning_rate": 0.0004537325902713923, "loss": 4.9515, "mean_token_accuracy": 0.20526830852031708, "num_tokens": 47702944.0, "step": 27500 }, { "entropy": 5.673082447052002, "epoch": 2.1399727679439797, "grad_norm": 1.1953125, "learning_rate": 0.0004537157534134629, "loss": 4.989, "mean_token_accuracy": 0.21049681901931763, "num_tokens": 47711075.0, "step": 27505 }, { "entropy": 5.632130575180054, "epoch": 2.1403617973156974, "grad_norm": 1.1640625, "learning_rate": 0.00045369891384380623, "loss": 4.896, "mean_token_accuracy": 0.2077875852584839, "num_tokens": 47719338.0, "step": 27510 }, { "entropy": 5.65991530418396, "epoch": 2.140750826687415, "grad_norm": 1.15625, "learning_rate": 0.0004536820715626781, "loss": 5.0087, "mean_token_accuracy": 0.200086772441864, "num_tokens": 47728035.0, "step": 27515 }, { "entropy": 5.689695930480957, "epoch": 2.1411398560591324, "grad_norm": 1.2734375, "learning_rate": 0.00045366522657033385, "loss": 4.9749, "mean_token_accuracy": 0.19818976372480393, "num_tokens": 47736438.0, "step": 27520 }, { "entropy": 5.650205850601196, "epoch": 2.14152888543085, "grad_norm": 1.125, "learning_rate": 0.00045364837886702924, "loss": 4.9611, "mean_token_accuracy": 0.20654866099357605, "num_tokens": 47744661.0, "step": 27525 }, { "entropy": 5.630291509628296, "epoch": 2.1419179148025678, "grad_norm": 1.2578125, "learning_rate": 0.0004536315284530198, "loss": 4.8874, "mean_token_accuracy": 0.20481287837028503, "num_tokens": 47752550.0, "step": 27530 }, { "entropy": 5.655815458297729, "epoch": 2.142306944174285, "grad_norm": 1.1875, "learning_rate": 0.0004536146753285612, "loss": 4.9613, "mean_token_accuracy": 0.21124410778284072, "num_tokens": 47761116.0, "step": 27535 }, { "entropy": 5.701789379119873, "epoch": 2.1426959735460027, "grad_norm": 1.2109375, "learning_rate": 0.0004535978194939093, "loss": 5.036, "mean_token_accuracy": 0.20187917202711106, "num_tokens": 47769804.0, "step": 27540 }, { "entropy": 5.646617317199707, "epoch": 2.1430850029177204, "grad_norm": 1.21875, "learning_rate": 0.00045358096094931966, "loss": 4.9244, "mean_token_accuracy": 0.20569027960300446, "num_tokens": 47777684.0, "step": 27545 }, { "entropy": 5.633816576004028, "epoch": 2.1434740322894377, "grad_norm": 1.125, "learning_rate": 0.0004535640996950482, "loss": 4.9115, "mean_token_accuracy": 0.20654455721378326, "num_tokens": 47786443.0, "step": 27550 }, { "entropy": 5.651158332824707, "epoch": 2.1438630616611554, "grad_norm": 1.203125, "learning_rate": 0.0004535472357313507, "loss": 5.0641, "mean_token_accuracy": 0.20049289911985396, "num_tokens": 47795408.0, "step": 27555 }, { "entropy": 5.646310472488404, "epoch": 2.144252091032873, "grad_norm": 1.1875, "learning_rate": 0.00045353036905848316, "loss": 4.9148, "mean_token_accuracy": 0.20429360568523408, "num_tokens": 47804108.0, "step": 27560 }, { "entropy": 5.658524799346924, "epoch": 2.1446411204045903, "grad_norm": 1.1796875, "learning_rate": 0.0004535134996767014, "loss": 4.9704, "mean_token_accuracy": 0.20506027489900588, "num_tokens": 47811972.0, "step": 27565 }, { "entropy": 5.6522551536560055, "epoch": 2.145030149776308, "grad_norm": 1.171875, "learning_rate": 0.0004534966275862614, "loss": 5.0368, "mean_token_accuracy": 0.1930425062775612, "num_tokens": 47820615.0, "step": 27570 }, { "entropy": 5.703643894195556, "epoch": 2.1454191791480257, "grad_norm": 1.171875, "learning_rate": 0.0004534797527874192, "loss": 5.0405, "mean_token_accuracy": 0.1995130032300949, "num_tokens": 47828773.0, "step": 27575 }, { "entropy": 5.676533937454224, "epoch": 2.1458082085197434, "grad_norm": 1.203125, "learning_rate": 0.00045346287528043083, "loss": 4.9539, "mean_token_accuracy": 0.20176876038312913, "num_tokens": 47837197.0, "step": 27580 }, { "entropy": 5.654812002182007, "epoch": 2.1461972378914607, "grad_norm": 1.1171875, "learning_rate": 0.00045344599506555244, "loss": 5.0933, "mean_token_accuracy": 0.19387331306934358, "num_tokens": 47846127.0, "step": 27585 }, { "entropy": 5.64934401512146, "epoch": 2.1465862672631784, "grad_norm": 1.140625, "learning_rate": 0.00045342911214304, "loss": 4.9577, "mean_token_accuracy": 0.20911150127649308, "num_tokens": 47854832.0, "step": 27590 }, { "entropy": 5.674082708358765, "epoch": 2.146975296634896, "grad_norm": 1.234375, "learning_rate": 0.0004534122265131498, "loss": 5.0062, "mean_token_accuracy": 0.2103806108236313, "num_tokens": 47862621.0, "step": 27595 }, { "entropy": 5.6576426982879635, "epoch": 2.1473643260066133, "grad_norm": 1.1640625, "learning_rate": 0.00045339533817613807, "loss": 5.0064, "mean_token_accuracy": 0.19669340848922728, "num_tokens": 47871406.0, "step": 27600 }, { "entropy": 5.5781982421875, "epoch": 2.147753355378331, "grad_norm": 1.140625, "learning_rate": 0.00045337844713226106, "loss": 4.907, "mean_token_accuracy": 0.210152767598629, "num_tokens": 47880361.0, "step": 27605 }, { "entropy": 5.671243715286255, "epoch": 2.1481423847500487, "grad_norm": 1.140625, "learning_rate": 0.00045336155338177497, "loss": 5.0203, "mean_token_accuracy": 0.19649623334407806, "num_tokens": 47889632.0, "step": 27610 }, { "entropy": 5.66088171005249, "epoch": 2.1485314141217664, "grad_norm": 1.25, "learning_rate": 0.0004533446569249362, "loss": 4.9176, "mean_token_accuracy": 0.20721192210912703, "num_tokens": 47898612.0, "step": 27615 }, { "entropy": 5.631893634796143, "epoch": 2.1489204434934837, "grad_norm": 1.171875, "learning_rate": 0.00045332775776200116, "loss": 4.9812, "mean_token_accuracy": 0.20306030958890914, "num_tokens": 47906628.0, "step": 27620 }, { "entropy": 5.5753062725067135, "epoch": 2.1493094728652014, "grad_norm": 1.109375, "learning_rate": 0.00045331085589322626, "loss": 5.01, "mean_token_accuracy": 0.20899773091077806, "num_tokens": 47915831.0, "step": 27625 }, { "entropy": 5.69690580368042, "epoch": 2.149698502236919, "grad_norm": 1.109375, "learning_rate": 0.0004532939513188679, "loss": 4.9925, "mean_token_accuracy": 0.20914481282234193, "num_tokens": 47924289.0, "step": 27630 }, { "entropy": 5.715921401977539, "epoch": 2.1500875316086363, "grad_norm": 1.265625, "learning_rate": 0.0004532770440391826, "loss": 5.0935, "mean_token_accuracy": 0.19258612841367723, "num_tokens": 47932438.0, "step": 27635 }, { "entropy": 5.67550220489502, "epoch": 2.150476560980354, "grad_norm": 1.1953125, "learning_rate": 0.0004532601340544269, "loss": 4.9567, "mean_token_accuracy": 0.2027256667613983, "num_tokens": 47940634.0, "step": 27640 }, { "entropy": 5.644866895675659, "epoch": 2.1508655903520717, "grad_norm": 1.1875, "learning_rate": 0.0004532432213648574, "loss": 5.0084, "mean_token_accuracy": 0.20710646212100983, "num_tokens": 47949871.0, "step": 27645 }, { "entropy": 5.660800313949585, "epoch": 2.151254619723789, "grad_norm": 1.203125, "learning_rate": 0.00045322630597073067, "loss": 4.9429, "mean_token_accuracy": 0.2099866583943367, "num_tokens": 47957847.0, "step": 27650 }, { "entropy": 5.6414475440979, "epoch": 2.1516436490955066, "grad_norm": 1.265625, "learning_rate": 0.00045320938787230355, "loss": 4.9935, "mean_token_accuracy": 0.20328616201877595, "num_tokens": 47965978.0, "step": 27655 }, { "entropy": 5.727775955200196, "epoch": 2.1520326784672243, "grad_norm": 1.234375, "learning_rate": 0.00045319246706983257, "loss": 5.1119, "mean_token_accuracy": 0.19348921924829482, "num_tokens": 47975407.0, "step": 27660 }, { "entropy": 5.6676106452941895, "epoch": 2.152421707838942, "grad_norm": 1.1484375, "learning_rate": 0.00045317554356357446, "loss": 4.9221, "mean_token_accuracy": 0.2104606434702873, "num_tokens": 47983652.0, "step": 27665 }, { "entropy": 5.713425350189209, "epoch": 2.1528107372106593, "grad_norm": 1.1484375, "learning_rate": 0.00045315861735378615, "loss": 4.9863, "mean_token_accuracy": 0.20111948400735855, "num_tokens": 47992750.0, "step": 27670 }, { "entropy": 5.590875673294067, "epoch": 2.153199766582377, "grad_norm": 1.296875, "learning_rate": 0.00045314168844072435, "loss": 4.921, "mean_token_accuracy": 0.2006265103816986, "num_tokens": 48000930.0, "step": 27675 }, { "entropy": 5.608292055130005, "epoch": 2.1535887959540947, "grad_norm": 1.171875, "learning_rate": 0.00045312475682464604, "loss": 4.991, "mean_token_accuracy": 0.19586590081453323, "num_tokens": 48009285.0, "step": 27680 }, { "entropy": 5.683314037322998, "epoch": 2.153977825325812, "grad_norm": 1.09375, "learning_rate": 0.00045310782250580794, "loss": 5.0393, "mean_token_accuracy": 0.19970891773700714, "num_tokens": 48017806.0, "step": 27685 }, { "entropy": 5.612570333480835, "epoch": 2.1543668546975296, "grad_norm": 1.171875, "learning_rate": 0.0004530908854844672, "loss": 5.023, "mean_token_accuracy": 0.19991553127765654, "num_tokens": 48026930.0, "step": 27690 }, { "entropy": 5.699177408218384, "epoch": 2.1547558840692473, "grad_norm": 1.15625, "learning_rate": 0.00045307394576088076, "loss": 5.0875, "mean_token_accuracy": 0.1981504365801811, "num_tokens": 48036039.0, "step": 27695 }, { "entropy": 5.658634662628174, "epoch": 2.1551449134409646, "grad_norm": 1.0625, "learning_rate": 0.0004530570033353056, "loss": 4.8981, "mean_token_accuracy": 0.21239372789859773, "num_tokens": 48045278.0, "step": 27700 }, { "entropy": 5.691684770584106, "epoch": 2.1555339428126823, "grad_norm": 1.1953125, "learning_rate": 0.00045304005820799874, "loss": 5.0087, "mean_token_accuracy": 0.19861601889133454, "num_tokens": 48054448.0, "step": 27705 }, { "entropy": 5.736129951477051, "epoch": 2.1559229721844, "grad_norm": 1.2578125, "learning_rate": 0.0004530231103792175, "loss": 5.0422, "mean_token_accuracy": 0.19797017872333528, "num_tokens": 48062672.0, "step": 27710 }, { "entropy": 5.667554330825806, "epoch": 2.1563120015561177, "grad_norm": 1.171875, "learning_rate": 0.0004530061598492188, "loss": 4.9238, "mean_token_accuracy": 0.20531753450632095, "num_tokens": 48072140.0, "step": 27715 }, { "entropy": 5.684198427200317, "epoch": 2.156701030927835, "grad_norm": 1.171875, "learning_rate": 0.00045298920661826004, "loss": 5.1025, "mean_token_accuracy": 0.19199084490537643, "num_tokens": 48080394.0, "step": 27720 }, { "entropy": 5.656687879562378, "epoch": 2.1570900602995526, "grad_norm": 1.1484375, "learning_rate": 0.0004529722506865984, "loss": 4.9886, "mean_token_accuracy": 0.20469136238098146, "num_tokens": 48088947.0, "step": 27725 }, { "entropy": 5.625289678573608, "epoch": 2.1574790896712703, "grad_norm": 1.1484375, "learning_rate": 0.000452955292054491, "loss": 4.9338, "mean_token_accuracy": 0.2020794615149498, "num_tokens": 48097156.0, "step": 27730 }, { "entropy": 5.661363172531128, "epoch": 2.1578681190429876, "grad_norm": 1.1796875, "learning_rate": 0.00045293833072219535, "loss": 4.9293, "mean_token_accuracy": 0.2133820876479149, "num_tokens": 48105692.0, "step": 27735 }, { "entropy": 5.647554206848144, "epoch": 2.1582571484147053, "grad_norm": 1.2109375, "learning_rate": 0.00045292136668996876, "loss": 4.9563, "mean_token_accuracy": 0.2052426293492317, "num_tokens": 48114967.0, "step": 27740 }, { "entropy": 5.620248031616211, "epoch": 2.158646177786423, "grad_norm": 1.1953125, "learning_rate": 0.0004529043999580686, "loss": 4.9622, "mean_token_accuracy": 0.20110946148633957, "num_tokens": 48123933.0, "step": 27745 }, { "entropy": 5.649925184249878, "epoch": 2.1590352071581402, "grad_norm": 1.1640625, "learning_rate": 0.00045288743052675234, "loss": 4.9392, "mean_token_accuracy": 0.20673357397317887, "num_tokens": 48131998.0, "step": 27750 }, { "entropy": 5.610033082962036, "epoch": 2.159424236529858, "grad_norm": 1.1953125, "learning_rate": 0.00045287045839627744, "loss": 4.9239, "mean_token_accuracy": 0.2138431191444397, "num_tokens": 48140111.0, "step": 27755 }, { "entropy": 5.682635974884033, "epoch": 2.1598132659015756, "grad_norm": 1.2109375, "learning_rate": 0.00045285348356690155, "loss": 4.9931, "mean_token_accuracy": 0.20862528830766677, "num_tokens": 48148826.0, "step": 27760 }, { "entropy": 5.690378856658936, "epoch": 2.1602022952732933, "grad_norm": 1.1875, "learning_rate": 0.000452836506038882, "loss": 4.988, "mean_token_accuracy": 0.20288793742656708, "num_tokens": 48157242.0, "step": 27765 }, { "entropy": 5.691629791259766, "epoch": 2.1605913246450106, "grad_norm": 1.1328125, "learning_rate": 0.00045281952581247654, "loss": 5.0966, "mean_token_accuracy": 0.1921230748295784, "num_tokens": 48166571.0, "step": 27770 }, { "entropy": 5.655092191696167, "epoch": 2.1609803540167283, "grad_norm": 1.21875, "learning_rate": 0.00045280254288794286, "loss": 4.9779, "mean_token_accuracy": 0.2088788628578186, "num_tokens": 48175280.0, "step": 27775 }, { "entropy": 5.726744365692139, "epoch": 2.161369383388446, "grad_norm": 1.1953125, "learning_rate": 0.00045278555726553855, "loss": 5.0123, "mean_token_accuracy": 0.20570303052663802, "num_tokens": 48184931.0, "step": 27780 }, { "entropy": 5.623542213439942, "epoch": 2.1617584127601632, "grad_norm": 1.15625, "learning_rate": 0.00045276856894552143, "loss": 4.9181, "mean_token_accuracy": 0.2071295812726021, "num_tokens": 48192945.0, "step": 27785 }, { "entropy": 5.647003173828125, "epoch": 2.162147442131881, "grad_norm": 1.203125, "learning_rate": 0.0004527515779281492, "loss": 5.0412, "mean_token_accuracy": 0.1989564150571823, "num_tokens": 48201963.0, "step": 27790 }, { "entropy": 5.669915628433228, "epoch": 2.1625364715035986, "grad_norm": 1.1015625, "learning_rate": 0.00045273458421367976, "loss": 5.0221, "mean_token_accuracy": 0.20322293490171434, "num_tokens": 48211178.0, "step": 27795 }, { "entropy": 5.653805446624756, "epoch": 2.162925500875316, "grad_norm": 1.2421875, "learning_rate": 0.0004527175878023708, "loss": 4.8806, "mean_token_accuracy": 0.20905300378799438, "num_tokens": 48219294.0, "step": 27800 }, { "entropy": 5.583649158477783, "epoch": 2.1633145302470336, "grad_norm": 1.25, "learning_rate": 0.0004527005886944803, "loss": 4.9613, "mean_token_accuracy": 0.20502104461193085, "num_tokens": 48227782.0, "step": 27805 }, { "entropy": 5.710514307022095, "epoch": 2.1637035596187513, "grad_norm": 1.1875, "learning_rate": 0.00045268358689026626, "loss": 4.9857, "mean_token_accuracy": 0.2009514257311821, "num_tokens": 48236850.0, "step": 27810 }, { "entropy": 5.714732074737549, "epoch": 2.164092588990469, "grad_norm": 1.1875, "learning_rate": 0.0004526665823899866, "loss": 5.0575, "mean_token_accuracy": 0.19550139158964158, "num_tokens": 48246095.0, "step": 27815 }, { "entropy": 5.706124973297119, "epoch": 2.164481618362186, "grad_norm": 1.109375, "learning_rate": 0.00045264957519389936, "loss": 4.9813, "mean_token_accuracy": 0.20310505330562592, "num_tokens": 48254943.0, "step": 27820 }, { "entropy": 5.64618411064148, "epoch": 2.164870647733904, "grad_norm": 1.1953125, "learning_rate": 0.00045263256530226253, "loss": 4.9197, "mean_token_accuracy": 0.20926386564970018, "num_tokens": 48263954.0, "step": 27825 }, { "entropy": 5.63828821182251, "epoch": 2.1652596771056216, "grad_norm": 1.234375, "learning_rate": 0.0004526155527153343, "loss": 5.004, "mean_token_accuracy": 0.19985282868146897, "num_tokens": 48272708.0, "step": 27830 }, { "entropy": 5.688527774810791, "epoch": 2.165648706477339, "grad_norm": 1.140625, "learning_rate": 0.0004525985374333727, "loss": 5.0257, "mean_token_accuracy": 0.19767493307590484, "num_tokens": 48280782.0, "step": 27835 }, { "entropy": 5.647058200836182, "epoch": 2.1660377358490566, "grad_norm": 1.1796875, "learning_rate": 0.000452581519456636, "loss": 4.8811, "mean_token_accuracy": 0.20724992454051971, "num_tokens": 48289105.0, "step": 27840 }, { "entropy": 5.627402687072754, "epoch": 2.1664267652207743, "grad_norm": 1.21875, "learning_rate": 0.00045256449878538243, "loss": 4.9863, "mean_token_accuracy": 0.21054009944200516, "num_tokens": 48297552.0, "step": 27845 }, { "entropy": 5.611087274551392, "epoch": 2.166815794592492, "grad_norm": 1.078125, "learning_rate": 0.00045254747541987017, "loss": 4.9467, "mean_token_accuracy": 0.20150849968194962, "num_tokens": 48307541.0, "step": 27850 }, { "entropy": 5.674048662185669, "epoch": 2.167204823964209, "grad_norm": 1.234375, "learning_rate": 0.0004525304493603576, "loss": 4.9688, "mean_token_accuracy": 0.20409788340330123, "num_tokens": 48316078.0, "step": 27855 }, { "entropy": 5.713591766357422, "epoch": 2.167593853335927, "grad_norm": 1.2421875, "learning_rate": 0.00045251342060710295, "loss": 5.009, "mean_token_accuracy": 0.19859078526496887, "num_tokens": 48324221.0, "step": 27860 }, { "entropy": 5.696206188201904, "epoch": 2.1679828827076446, "grad_norm": 1.2578125, "learning_rate": 0.0004524963891603647, "loss": 5.1108, "mean_token_accuracy": 0.19749852418899536, "num_tokens": 48333047.0, "step": 27865 }, { "entropy": 5.6759766101837155, "epoch": 2.168371912079362, "grad_norm": 1.109375, "learning_rate": 0.00045247935502040136, "loss": 5.0708, "mean_token_accuracy": 0.19920202493667602, "num_tokens": 48342255.0, "step": 27870 }, { "entropy": 5.618723011016845, "epoch": 2.1687609414510796, "grad_norm": 1.1796875, "learning_rate": 0.0004524623181874712, "loss": 5.0557, "mean_token_accuracy": 0.19398942738771438, "num_tokens": 48350877.0, "step": 27875 }, { "entropy": 5.783633375167847, "epoch": 2.1691499708227973, "grad_norm": 1.1015625, "learning_rate": 0.0004524452786618329, "loss": 5.1645, "mean_token_accuracy": 0.18612064570188522, "num_tokens": 48360537.0, "step": 27880 }, { "entropy": 5.729353332519532, "epoch": 2.1695390001945145, "grad_norm": 1.125, "learning_rate": 0.00045242823644374484, "loss": 5.0791, "mean_token_accuracy": 0.19590765237808228, "num_tokens": 48370518.0, "step": 27885 }, { "entropy": 5.625602579116821, "epoch": 2.169928029566232, "grad_norm": 1.140625, "learning_rate": 0.0004524111915334658, "loss": 4.8892, "mean_token_accuracy": 0.21108509451150895, "num_tokens": 48379379.0, "step": 27890 }, { "entropy": 5.598262882232666, "epoch": 2.17031705893795, "grad_norm": 1.1796875, "learning_rate": 0.00045239414393125424, "loss": 4.8791, "mean_token_accuracy": 0.21001088470220566, "num_tokens": 48388090.0, "step": 27895 }, { "entropy": 5.7206761837005615, "epoch": 2.170706088309667, "grad_norm": 1.1875, "learning_rate": 0.0004523770936373689, "loss": 5.0122, "mean_token_accuracy": 0.19712401032447815, "num_tokens": 48396527.0, "step": 27900 }, { "entropy": 5.654482316970825, "epoch": 2.171095117681385, "grad_norm": 1.2890625, "learning_rate": 0.0004523600406520685, "loss": 4.964, "mean_token_accuracy": 0.20513064712285994, "num_tokens": 48404632.0, "step": 27905 }, { "entropy": 5.59807333946228, "epoch": 2.1714841470531026, "grad_norm": 1.1796875, "learning_rate": 0.0004523429849756118, "loss": 4.9081, "mean_token_accuracy": 0.21635473221540452, "num_tokens": 48413573.0, "step": 27910 }, { "entropy": 5.755726099014282, "epoch": 2.1718731764248203, "grad_norm": 1.21875, "learning_rate": 0.0004523259266082576, "loss": 5.0747, "mean_token_accuracy": 0.19595257192850113, "num_tokens": 48421252.0, "step": 27915 }, { "entropy": 5.744519281387329, "epoch": 2.1722622057965375, "grad_norm": 1.171875, "learning_rate": 0.00045230886555026455, "loss": 5.0159, "mean_token_accuracy": 0.20101021230220795, "num_tokens": 48430322.0, "step": 27920 }, { "entropy": 5.711835289001465, "epoch": 2.172651235168255, "grad_norm": 1.171875, "learning_rate": 0.00045229180180189176, "loss": 4.9509, "mean_token_accuracy": 0.2091400980949402, "num_tokens": 48439570.0, "step": 27925 }, { "entropy": 5.642715787887573, "epoch": 2.173040264539973, "grad_norm": 1.1640625, "learning_rate": 0.00045227473536339817, "loss": 4.993, "mean_token_accuracy": 0.19702711552381516, "num_tokens": 48447803.0, "step": 27930 }, { "entropy": 5.721986293792725, "epoch": 2.17342929391169, "grad_norm": 1.234375, "learning_rate": 0.0004522576662350425, "loss": 5.0487, "mean_token_accuracy": 0.20052043497562408, "num_tokens": 48456694.0, "step": 27935 }, { "entropy": 5.6974287033081055, "epoch": 2.173818323283408, "grad_norm": 1.296875, "learning_rate": 0.000452240594417084, "loss": 5.0374, "mean_token_accuracy": 0.19820090234279633, "num_tokens": 48465321.0, "step": 27940 }, { "entropy": 5.695763349533081, "epoch": 2.1742073526551255, "grad_norm": 1.1796875, "learning_rate": 0.0004522235199097815, "loss": 5.0274, "mean_token_accuracy": 0.20444536656141282, "num_tokens": 48474299.0, "step": 27945 }, { "entropy": 5.604239463806152, "epoch": 2.1745963820268432, "grad_norm": 1.1015625, "learning_rate": 0.0004522064427133942, "loss": 4.9008, "mean_token_accuracy": 0.20743561089038848, "num_tokens": 48483427.0, "step": 27950 }, { "entropy": 5.656124639511108, "epoch": 2.1749854113985605, "grad_norm": 1.140625, "learning_rate": 0.00045218936282818116, "loss": 4.9045, "mean_token_accuracy": 0.21148220896720887, "num_tokens": 48492610.0, "step": 27955 }, { "entropy": 5.6886107444763185, "epoch": 2.175374440770278, "grad_norm": 1.078125, "learning_rate": 0.0004521722802544016, "loss": 5.0982, "mean_token_accuracy": 0.20516704618930817, "num_tokens": 48502531.0, "step": 27960 }, { "entropy": 5.730348014831543, "epoch": 2.175763470141996, "grad_norm": 1.171875, "learning_rate": 0.00045215519499231465, "loss": 4.9859, "mean_token_accuracy": 0.21010151356458664, "num_tokens": 48511167.0, "step": 27965 }, { "entropy": 5.737476110458374, "epoch": 2.176152499513713, "grad_norm": 1.140625, "learning_rate": 0.00045213810704217963, "loss": 5.0653, "mean_token_accuracy": 0.201059091091156, "num_tokens": 48520355.0, "step": 27970 }, { "entropy": 5.667757558822632, "epoch": 2.176541528885431, "grad_norm": 1.1015625, "learning_rate": 0.0004521210164042557, "loss": 5.0295, "mean_token_accuracy": 0.20340888649225236, "num_tokens": 48529269.0, "step": 27975 }, { "entropy": 5.667514944076538, "epoch": 2.1769305582571485, "grad_norm": 1.2421875, "learning_rate": 0.0004521039230788024, "loss": 4.9386, "mean_token_accuracy": 0.20185478776693344, "num_tokens": 48537764.0, "step": 27980 }, { "entropy": 5.617656803131103, "epoch": 2.177319587628866, "grad_norm": 1.15625, "learning_rate": 0.0004520868270660789, "loss": 4.9864, "mean_token_accuracy": 0.2009761691093445, "num_tokens": 48547168.0, "step": 27985 }, { "entropy": 5.586920690536499, "epoch": 2.1777086170005835, "grad_norm": 1.2265625, "learning_rate": 0.0004520697283663446, "loss": 4.9322, "mean_token_accuracy": 0.20467934757471085, "num_tokens": 48555809.0, "step": 27990 }, { "entropy": 5.728637981414795, "epoch": 2.178097646372301, "grad_norm": 1.1953125, "learning_rate": 0.00045205262697985897, "loss": 5.0034, "mean_token_accuracy": 0.20082412511110306, "num_tokens": 48564754.0, "step": 27995 }, { "entropy": 5.61286768913269, "epoch": 2.1784866757440184, "grad_norm": 1.171875, "learning_rate": 0.0004520355229068816, "loss": 4.9427, "mean_token_accuracy": 0.2020853728055954, "num_tokens": 48573732.0, "step": 28000 }, { "entropy": 5.645873069763184, "epoch": 2.178875705115736, "grad_norm": 1.1640625, "learning_rate": 0.00045201841614767203, "loss": 4.9016, "mean_token_accuracy": 0.2088460922241211, "num_tokens": 48581676.0, "step": 28005 }, { "entropy": 5.644542503356933, "epoch": 2.179264734487454, "grad_norm": 1.1015625, "learning_rate": 0.00045200130670248974, "loss": 4.9815, "mean_token_accuracy": 0.20380741804838182, "num_tokens": 48590310.0, "step": 28010 }, { "entropy": 5.616602993011474, "epoch": 2.1796537638591715, "grad_norm": 1.1796875, "learning_rate": 0.00045198419457159424, "loss": 4.9675, "mean_token_accuracy": 0.20878223925828934, "num_tokens": 48599306.0, "step": 28015 }, { "entropy": 5.758962488174438, "epoch": 2.180042793230889, "grad_norm": 1.171875, "learning_rate": 0.0004519670797552453, "loss": 5.0964, "mean_token_accuracy": 0.19321614801883696, "num_tokens": 48608264.0, "step": 28020 }, { "entropy": 5.686411809921265, "epoch": 2.1804318226026065, "grad_norm": 1.1796875, "learning_rate": 0.00045194996225370266, "loss": 4.9969, "mean_token_accuracy": 0.20227177292108536, "num_tokens": 48617102.0, "step": 28025 }, { "entropy": 5.704957151412964, "epoch": 2.180820851974324, "grad_norm": 1.2109375, "learning_rate": 0.00045193284206722595, "loss": 5.0608, "mean_token_accuracy": 0.1965824618935585, "num_tokens": 48626207.0, "step": 28030 }, { "entropy": 5.701901483535766, "epoch": 2.1812098813460414, "grad_norm": 1.203125, "learning_rate": 0.0004519157191960749, "loss": 4.9064, "mean_token_accuracy": 0.20779781192541122, "num_tokens": 48634322.0, "step": 28035 }, { "entropy": 5.655140924453735, "epoch": 2.181598910717759, "grad_norm": 1.2734375, "learning_rate": 0.0004518985936405096, "loss": 4.9296, "mean_token_accuracy": 0.2129133865237236, "num_tokens": 48642026.0, "step": 28040 }, { "entropy": 5.604156494140625, "epoch": 2.181987940089477, "grad_norm": 1.296875, "learning_rate": 0.0004518814654007896, "loss": 4.8603, "mean_token_accuracy": 0.21010874956846237, "num_tokens": 48650114.0, "step": 28045 }, { "entropy": 5.710632848739624, "epoch": 2.1823769694611945, "grad_norm": 1.1171875, "learning_rate": 0.00045186433447717486, "loss": 5.0161, "mean_token_accuracy": 0.19763064086437226, "num_tokens": 48660185.0, "step": 28050 }, { "entropy": 5.771686601638794, "epoch": 2.182765998832912, "grad_norm": 1.2421875, "learning_rate": 0.00045184720086992536, "loss": 5.0405, "mean_token_accuracy": 0.20178876519203187, "num_tokens": 48668603.0, "step": 28055 }, { "entropy": 5.678874206542969, "epoch": 2.1831550282046295, "grad_norm": 1.1796875, "learning_rate": 0.00045183006457930107, "loss": 5.0292, "mean_token_accuracy": 0.20033368319272996, "num_tokens": 48676962.0, "step": 28060 }, { "entropy": 5.628885269165039, "epoch": 2.183544057576347, "grad_norm": 1.2109375, "learning_rate": 0.0004518129256055621, "loss": 5.0132, "mean_token_accuracy": 0.20246051102876664, "num_tokens": 48685823.0, "step": 28065 }, { "entropy": 5.635874271392822, "epoch": 2.1839330869480644, "grad_norm": 1.203125, "learning_rate": 0.0004517957839489683, "loss": 4.9031, "mean_token_accuracy": 0.2114838480949402, "num_tokens": 48695116.0, "step": 28070 }, { "entropy": 5.6583075523376465, "epoch": 2.184322116319782, "grad_norm": 1.28125, "learning_rate": 0.00045177863960977986, "loss": 4.9906, "mean_token_accuracy": 0.20515986233949662, "num_tokens": 48702725.0, "step": 28075 }, { "entropy": 5.646442604064942, "epoch": 2.1847111456915, "grad_norm": 1.234375, "learning_rate": 0.000451761492588257, "loss": 4.9804, "mean_token_accuracy": 0.20874161273241043, "num_tokens": 48711104.0, "step": 28080 }, { "entropy": 5.643924140930176, "epoch": 2.185100175063217, "grad_norm": 1.171875, "learning_rate": 0.00045174434288465986, "loss": 4.9456, "mean_token_accuracy": 0.20356836915016174, "num_tokens": 48720177.0, "step": 28085 }, { "entropy": 5.637335014343262, "epoch": 2.1854892044349348, "grad_norm": 1.1015625, "learning_rate": 0.0004517271904992486, "loss": 4.914, "mean_token_accuracy": 0.2019437074661255, "num_tokens": 48728729.0, "step": 28090 }, { "entropy": 5.604791212081909, "epoch": 2.1858782338066525, "grad_norm": 1.21875, "learning_rate": 0.0004517100354322835, "loss": 4.921, "mean_token_accuracy": 0.20652667582035064, "num_tokens": 48736876.0, "step": 28095 }, { "entropy": 5.597848558425904, "epoch": 2.18626726317837, "grad_norm": 1.171875, "learning_rate": 0.00045169287768402497, "loss": 4.8894, "mean_token_accuracy": 0.2074008986353874, "num_tokens": 48745957.0, "step": 28100 }, { "entropy": 5.758030843734741, "epoch": 2.1866562925500874, "grad_norm": 1.21875, "learning_rate": 0.0004516757172547331, "loss": 5.072, "mean_token_accuracy": 0.2027464136481285, "num_tokens": 48754488.0, "step": 28105 }, { "entropy": 5.694663000106812, "epoch": 2.187045321921805, "grad_norm": 1.3125, "learning_rate": 0.0004516585541446685, "loss": 4.9611, "mean_token_accuracy": 0.20835905969142915, "num_tokens": 48762797.0, "step": 28110 }, { "entropy": 5.615630722045898, "epoch": 2.187434351293523, "grad_norm": 1.1640625, "learning_rate": 0.00045164138835409153, "loss": 4.9812, "mean_token_accuracy": 0.20089175254106523, "num_tokens": 48771639.0, "step": 28115 }, { "entropy": 5.620218133926391, "epoch": 2.18782338066524, "grad_norm": 1.1640625, "learning_rate": 0.00045162421988326266, "loss": 5.0038, "mean_token_accuracy": 0.2061363071203232, "num_tokens": 48779978.0, "step": 28120 }, { "entropy": 5.6583723545074465, "epoch": 2.1882124100369578, "grad_norm": 1.2109375, "learning_rate": 0.0004516070487324424, "loss": 5.0254, "mean_token_accuracy": 0.19537580907344818, "num_tokens": 48788202.0, "step": 28125 }, { "entropy": 5.671447467803955, "epoch": 2.1886014394086755, "grad_norm": 1.2578125, "learning_rate": 0.00045158987490189124, "loss": 4.9934, "mean_token_accuracy": 0.20292647778987885, "num_tokens": 48796533.0, "step": 28130 }, { "entropy": 5.707227754592895, "epoch": 2.1889904687803927, "grad_norm": 1.234375, "learning_rate": 0.0004515726983918697, "loss": 5.0355, "mean_token_accuracy": 0.19360646605491638, "num_tokens": 48805627.0, "step": 28135 }, { "entropy": 5.708659362792969, "epoch": 2.1893794981521104, "grad_norm": 1.1640625, "learning_rate": 0.00045155551920263864, "loss": 5.0095, "mean_token_accuracy": 0.19943524301052093, "num_tokens": 48814132.0, "step": 28140 }, { "entropy": 5.687586164474487, "epoch": 2.189768527523828, "grad_norm": 1.15625, "learning_rate": 0.00045153833733445857, "loss": 4.9519, "mean_token_accuracy": 0.19946594685316085, "num_tokens": 48823210.0, "step": 28145 }, { "entropy": 5.632446908950806, "epoch": 2.190157556895546, "grad_norm": 1.1875, "learning_rate": 0.0004515211527875903, "loss": 4.993, "mean_token_accuracy": 0.199487541615963, "num_tokens": 48831835.0, "step": 28150 }, { "entropy": 5.700533485412597, "epoch": 2.190546586267263, "grad_norm": 1.2265625, "learning_rate": 0.0004515039655622943, "loss": 5.0372, "mean_token_accuracy": 0.19762021899223328, "num_tokens": 48840917.0, "step": 28155 }, { "entropy": 5.712247514724732, "epoch": 2.1909356156389808, "grad_norm": 1.1640625, "learning_rate": 0.00045148677565883167, "loss": 4.9805, "mean_token_accuracy": 0.19651026129722596, "num_tokens": 48849328.0, "step": 28160 }, { "entropy": 5.623453140258789, "epoch": 2.1913246450106985, "grad_norm": 1.203125, "learning_rate": 0.0004514695830774631, "loss": 4.9807, "mean_token_accuracy": 0.20177057534456252, "num_tokens": 48858511.0, "step": 28165 }, { "entropy": 5.670665264129639, "epoch": 2.1917136743824157, "grad_norm": 1.171875, "learning_rate": 0.00045145238781844953, "loss": 5.0094, "mean_token_accuracy": 0.21279835551977158, "num_tokens": 48867152.0, "step": 28170 }, { "entropy": 5.672148513793945, "epoch": 2.1921027037541334, "grad_norm": 1.21875, "learning_rate": 0.00045143518988205184, "loss": 4.931, "mean_token_accuracy": 0.20247344225645064, "num_tokens": 48875233.0, "step": 28175 }, { "entropy": 5.609235620498657, "epoch": 2.192491733125851, "grad_norm": 1.078125, "learning_rate": 0.00045141798926853094, "loss": 4.9716, "mean_token_accuracy": 0.20335454642772674, "num_tokens": 48884569.0, "step": 28180 }, { "entropy": 5.67695426940918, "epoch": 2.1928807624975684, "grad_norm": 1.1640625, "learning_rate": 0.0004514007859781478, "loss": 5.0491, "mean_token_accuracy": 0.19761917889118194, "num_tokens": 48894402.0, "step": 28185 }, { "entropy": 5.777286052703857, "epoch": 2.193269791869286, "grad_norm": 1.21875, "learning_rate": 0.0004513835800111635, "loss": 4.9756, "mean_token_accuracy": 0.20979095995426178, "num_tokens": 48902105.0, "step": 28190 }, { "entropy": 5.707430505752564, "epoch": 2.1936588212410038, "grad_norm": 1.2421875, "learning_rate": 0.0004513663713678392, "loss": 5.0735, "mean_token_accuracy": 0.19573944211006164, "num_tokens": 48911650.0, "step": 28195 }, { "entropy": 5.666353416442871, "epoch": 2.1940478506127215, "grad_norm": 1.140625, "learning_rate": 0.00045134916004843596, "loss": 4.953, "mean_token_accuracy": 0.20378708094358444, "num_tokens": 48920035.0, "step": 28200 }, { "entropy": 5.638401842117309, "epoch": 2.1944368799844387, "grad_norm": 1.1640625, "learning_rate": 0.0004513319460532148, "loss": 4.9439, "mean_token_accuracy": 0.2112703174352646, "num_tokens": 48928460.0, "step": 28205 }, { "entropy": 5.724021577835083, "epoch": 2.1948259093561564, "grad_norm": 1.28125, "learning_rate": 0.00045131472938243707, "loss": 4.953, "mean_token_accuracy": 0.20579020082950591, "num_tokens": 48937606.0, "step": 28210 }, { "entropy": 5.635399198532104, "epoch": 2.195214938727874, "grad_norm": 1.15625, "learning_rate": 0.0004512975100363639, "loss": 4.9019, "mean_token_accuracy": 0.20688744634389877, "num_tokens": 48945782.0, "step": 28215 }, { "entropy": 5.6891838073730465, "epoch": 2.1956039680995914, "grad_norm": 1.3046875, "learning_rate": 0.00045128028801525675, "loss": 5.0428, "mean_token_accuracy": 0.20485429912805558, "num_tokens": 48954243.0, "step": 28220 }, { "entropy": 5.691351127624512, "epoch": 2.195992997471309, "grad_norm": 1.234375, "learning_rate": 0.00045126306331937674, "loss": 4.9751, "mean_token_accuracy": 0.2101079598069191, "num_tokens": 48962578.0, "step": 28225 }, { "entropy": 5.643783092498779, "epoch": 2.1963820268430267, "grad_norm": 1.2890625, "learning_rate": 0.0004512458359489853, "loss": 4.9704, "mean_token_accuracy": 0.21187245845794678, "num_tokens": 48971237.0, "step": 28230 }, { "entropy": 5.628126001358032, "epoch": 2.196771056214744, "grad_norm": 1.21875, "learning_rate": 0.0004512286059043437, "loss": 4.9031, "mean_token_accuracy": 0.210605750977993, "num_tokens": 48979954.0, "step": 28235 }, { "entropy": 5.697447872161865, "epoch": 2.1971600855864617, "grad_norm": 1.1171875, "learning_rate": 0.00045121137318571364, "loss": 5.0595, "mean_token_accuracy": 0.19897862821817397, "num_tokens": 48989174.0, "step": 28240 }, { "entropy": 5.7041428565979, "epoch": 2.1975491149581794, "grad_norm": 1.1484375, "learning_rate": 0.00045119413779335645, "loss": 5.0139, "mean_token_accuracy": 0.19774785488843918, "num_tokens": 48998341.0, "step": 28245 }, { "entropy": 5.65669436454773, "epoch": 2.197938144329897, "grad_norm": 1.21875, "learning_rate": 0.0004511768997275336, "loss": 4.9262, "mean_token_accuracy": 0.20715087056159973, "num_tokens": 49007024.0, "step": 28250 }, { "entropy": 5.630609941482544, "epoch": 2.1983271737016143, "grad_norm": 1.1015625, "learning_rate": 0.0004511596589885068, "loss": 5.016, "mean_token_accuracy": 0.19853328168392181, "num_tokens": 49015632.0, "step": 28255 }, { "entropy": 5.665176010131836, "epoch": 2.198716203073332, "grad_norm": 1.1953125, "learning_rate": 0.0004511424155765375, "loss": 4.9771, "mean_token_accuracy": 0.208683517575264, "num_tokens": 49024056.0, "step": 28260 }, { "entropy": 5.636139917373657, "epoch": 2.1991052324450497, "grad_norm": 1.28125, "learning_rate": 0.00045112516949188735, "loss": 4.9506, "mean_token_accuracy": 0.20466095954179764, "num_tokens": 49033095.0, "step": 28265 }, { "entropy": 5.631662511825562, "epoch": 2.199494261816767, "grad_norm": 1.109375, "learning_rate": 0.0004511079207348182, "loss": 4.9537, "mean_token_accuracy": 0.20741107761859895, "num_tokens": 49041632.0, "step": 28270 }, { "entropy": 5.721871328353882, "epoch": 2.1998832911884847, "grad_norm": 1.2890625, "learning_rate": 0.0004510906693055916, "loss": 5.0404, "mean_token_accuracy": 0.20054018795490264, "num_tokens": 49050336.0, "step": 28275 }, { "entropy": 5.657211494445801, "epoch": 2.2002723205602024, "grad_norm": 1.15625, "learning_rate": 0.0004510734152044694, "loss": 4.9595, "mean_token_accuracy": 0.20463591665029526, "num_tokens": 49058567.0, "step": 28280 }, { "entropy": 5.632481050491333, "epoch": 2.20066134993192, "grad_norm": 1.25, "learning_rate": 0.00045105615843171336, "loss": 4.8288, "mean_token_accuracy": 0.2178201526403427, "num_tokens": 49067003.0, "step": 28285 }, { "entropy": 5.696306610107422, "epoch": 2.2010503793036373, "grad_norm": 1.1171875, "learning_rate": 0.00045103889898758534, "loss": 5.0027, "mean_token_accuracy": 0.20007749646902084, "num_tokens": 49074965.0, "step": 28290 }, { "entropy": 5.674391222000122, "epoch": 2.201439408675355, "grad_norm": 1.1328125, "learning_rate": 0.0004510216368723472, "loss": 4.9733, "mean_token_accuracy": 0.20655144602060319, "num_tokens": 49085106.0, "step": 28295 }, { "entropy": 5.698556756973266, "epoch": 2.2018284380470727, "grad_norm": 1.25, "learning_rate": 0.00045100437208626086, "loss": 5.0225, "mean_token_accuracy": 0.19863714277744293, "num_tokens": 49093125.0, "step": 28300 }, { "entropy": 5.62238245010376, "epoch": 2.20221746741879, "grad_norm": 1.21875, "learning_rate": 0.00045098710462958844, "loss": 4.9128, "mean_token_accuracy": 0.20494911074638367, "num_tokens": 49101956.0, "step": 28305 }, { "entropy": 5.649601316452026, "epoch": 2.2026064967905077, "grad_norm": 1.1640625, "learning_rate": 0.00045096983450259166, "loss": 5.0123, "mean_token_accuracy": 0.2017364278435707, "num_tokens": 49110942.0, "step": 28310 }, { "entropy": 5.697043943405151, "epoch": 2.2029955261622254, "grad_norm": 1.296875, "learning_rate": 0.00045095256170553285, "loss": 5.0541, "mean_token_accuracy": 0.192991304397583, "num_tokens": 49119181.0, "step": 28315 }, { "entropy": 5.661623001098633, "epoch": 2.2033845555339426, "grad_norm": 1.2265625, "learning_rate": 0.00045093528623867384, "loss": 4.9359, "mean_token_accuracy": 0.2118605375289917, "num_tokens": 49127451.0, "step": 28320 }, { "entropy": 5.6645018577575685, "epoch": 2.2037735849056603, "grad_norm": 1.1953125, "learning_rate": 0.00045091800810227706, "loss": 5.005, "mean_token_accuracy": 0.19891992211341858, "num_tokens": 49135550.0, "step": 28325 }, { "entropy": 5.545376014709473, "epoch": 2.204162614277378, "grad_norm": 1.1640625, "learning_rate": 0.0004509007272966044, "loss": 4.8511, "mean_token_accuracy": 0.2087271749973297, "num_tokens": 49144551.0, "step": 28330 }, { "entropy": 5.665251970291138, "epoch": 2.2045516436490953, "grad_norm": 1.1953125, "learning_rate": 0.0004508834438219182, "loss": 4.9645, "mean_token_accuracy": 0.20616658478975297, "num_tokens": 49153079.0, "step": 28335 }, { "entropy": 5.650091123580933, "epoch": 2.204940673020813, "grad_norm": 1.234375, "learning_rate": 0.0004508661576784807, "loss": 5.0041, "mean_token_accuracy": 0.2022011786699295, "num_tokens": 49161253.0, "step": 28340 }, { "entropy": 5.631394147872925, "epoch": 2.2053297023925307, "grad_norm": 1.265625, "learning_rate": 0.0004508488688665541, "loss": 4.956, "mean_token_accuracy": 0.20551064163446425, "num_tokens": 49170192.0, "step": 28345 }, { "entropy": 5.706804037094116, "epoch": 2.2057187317642484, "grad_norm": 1.1171875, "learning_rate": 0.0004508315773864009, "loss": 5.0006, "mean_token_accuracy": 0.20074109733104706, "num_tokens": 49179512.0, "step": 28350 }, { "entropy": 5.6432294845581055, "epoch": 2.2061077611359656, "grad_norm": 1.0859375, "learning_rate": 0.00045081428323828337, "loss": 4.8953, "mean_token_accuracy": 0.21295961886644363, "num_tokens": 49188431.0, "step": 28355 }, { "entropy": 5.622379446029663, "epoch": 2.2064967905076833, "grad_norm": 1.265625, "learning_rate": 0.0004507969864224639, "loss": 4.9324, "mean_token_accuracy": 0.20041512399911882, "num_tokens": 49196852.0, "step": 28360 }, { "entropy": 5.623957109451294, "epoch": 2.206885819879401, "grad_norm": 1.1953125, "learning_rate": 0.000450779686939205, "loss": 4.9956, "mean_token_accuracy": 0.20355820208787917, "num_tokens": 49206007.0, "step": 28365 }, { "entropy": 5.652745914459229, "epoch": 2.2072748492511183, "grad_norm": 1.203125, "learning_rate": 0.00045076238478876916, "loss": 4.9375, "mean_token_accuracy": 0.20596878081560135, "num_tokens": 49214016.0, "step": 28370 }, { "entropy": 5.625620794296265, "epoch": 2.207663878622836, "grad_norm": 1.15625, "learning_rate": 0.0004507450799714188, "loss": 4.9322, "mean_token_accuracy": 0.2117526650428772, "num_tokens": 49222558.0, "step": 28375 }, { "entropy": 5.666169834136963, "epoch": 2.2080529079945537, "grad_norm": 1.2265625, "learning_rate": 0.00045072777248741664, "loss": 4.979, "mean_token_accuracy": 0.19530730694532394, "num_tokens": 49230983.0, "step": 28380 }, { "entropy": 5.702482604980469, "epoch": 2.2084419373662714, "grad_norm": 1.2734375, "learning_rate": 0.0004507104623370252, "loss": 5.0372, "mean_token_accuracy": 0.19541515558958053, "num_tokens": 49239429.0, "step": 28385 }, { "entropy": 5.697812414169311, "epoch": 2.2088309667379886, "grad_norm": 1.2265625, "learning_rate": 0.0004506931495205072, "loss": 4.982, "mean_token_accuracy": 0.1949959874153137, "num_tokens": 49247316.0, "step": 28390 }, { "entropy": 5.65994291305542, "epoch": 2.2092199961097063, "grad_norm": 1.125, "learning_rate": 0.0004506758340381253, "loss": 4.9353, "mean_token_accuracy": 0.20685170441865922, "num_tokens": 49256293.0, "step": 28395 }, { "entropy": 5.716498994827271, "epoch": 2.209609025481424, "grad_norm": 1.1796875, "learning_rate": 0.0004506585158901422, "loss": 5.0487, "mean_token_accuracy": 0.20569711029529572, "num_tokens": 49264735.0, "step": 28400 }, { "entropy": 5.706690645217895, "epoch": 2.2099980548531413, "grad_norm": 1.2421875, "learning_rate": 0.0004506411950768207, "loss": 5.1276, "mean_token_accuracy": 0.1926649197936058, "num_tokens": 49273370.0, "step": 28405 }, { "entropy": 5.705180501937866, "epoch": 2.210387084224859, "grad_norm": 1.109375, "learning_rate": 0.00045062387159842363, "loss": 5.059, "mean_token_accuracy": 0.19836583286523818, "num_tokens": 49282850.0, "step": 28410 }, { "entropy": 5.682175874710083, "epoch": 2.2107761135965767, "grad_norm": 1.2109375, "learning_rate": 0.00045060654545521386, "loss": 4.9753, "mean_token_accuracy": 0.2064842626452446, "num_tokens": 49290546.0, "step": 28415 }, { "entropy": 5.681158113479614, "epoch": 2.211165142968294, "grad_norm": 1.1875, "learning_rate": 0.00045058921664745436, "loss": 4.9953, "mean_token_accuracy": 0.20106430500745773, "num_tokens": 49298648.0, "step": 28420 }, { "entropy": 5.6924412727355955, "epoch": 2.2115541723400116, "grad_norm": 1.140625, "learning_rate": 0.00045057188517540783, "loss": 5.0013, "mean_token_accuracy": 0.2041957527399063, "num_tokens": 49307134.0, "step": 28425 }, { "entropy": 5.672388744354248, "epoch": 2.2119432017117293, "grad_norm": 1.203125, "learning_rate": 0.0004505545510393374, "loss": 4.9718, "mean_token_accuracy": 0.19362101554870606, "num_tokens": 49315617.0, "step": 28430 }, { "entropy": 5.674836111068726, "epoch": 2.2123322310834466, "grad_norm": 1.1953125, "learning_rate": 0.00045053721423950617, "loss": 5.0091, "mean_token_accuracy": 0.20349411219358443, "num_tokens": 49324435.0, "step": 28435 }, { "entropy": 5.613963079452515, "epoch": 2.2127212604551643, "grad_norm": 1.0546875, "learning_rate": 0.0004505198747761771, "loss": 4.9317, "mean_token_accuracy": 0.20559772998094558, "num_tokens": 49333758.0, "step": 28440 }, { "entropy": 5.616326808929443, "epoch": 2.213110289826882, "grad_norm": 1.1875, "learning_rate": 0.0004505025326496132, "loss": 4.8574, "mean_token_accuracy": 0.21337371021509172, "num_tokens": 49342643.0, "step": 28445 }, { "entropy": 5.651486730575561, "epoch": 2.2134993191985997, "grad_norm": 1.109375, "learning_rate": 0.00045048518786007784, "loss": 4.9542, "mean_token_accuracy": 0.2111501842737198, "num_tokens": 49351009.0, "step": 28450 }, { "entropy": 5.660593700408936, "epoch": 2.213888348570317, "grad_norm": 1.125, "learning_rate": 0.00045046784040783395, "loss": 5.0032, "mean_token_accuracy": 0.1990935519337654, "num_tokens": 49359415.0, "step": 28455 }, { "entropy": 5.695051431655884, "epoch": 2.2142773779420346, "grad_norm": 1.2890625, "learning_rate": 0.000450450490293145, "loss": 5.0894, "mean_token_accuracy": 0.19200983196496962, "num_tokens": 49367898.0, "step": 28460 }, { "entropy": 5.707502937316894, "epoch": 2.2146664073137523, "grad_norm": 1.15625, "learning_rate": 0.000450433137516274, "loss": 4.958, "mean_token_accuracy": 0.204363152384758, "num_tokens": 49376651.0, "step": 28465 }, { "entropy": 5.630324935913086, "epoch": 2.2150554366854696, "grad_norm": 1.21875, "learning_rate": 0.0004504157820774844, "loss": 4.9228, "mean_token_accuracy": 0.21321503520011903, "num_tokens": 49385259.0, "step": 28470 }, { "entropy": 5.652928590774536, "epoch": 2.2154444660571873, "grad_norm": 1.1484375, "learning_rate": 0.0004503984239770396, "loss": 4.9318, "mean_token_accuracy": 0.20816560685634614, "num_tokens": 49393868.0, "step": 28475 }, { "entropy": 5.6997980117797855, "epoch": 2.215833495428905, "grad_norm": 1.234375, "learning_rate": 0.0004503810632152028, "loss": 5.0033, "mean_token_accuracy": 0.20661852061748504, "num_tokens": 49402062.0, "step": 28480 }, { "entropy": 5.755029726028442, "epoch": 2.2162225248006227, "grad_norm": 1.2109375, "learning_rate": 0.0004503636997922375, "loss": 5.0949, "mean_token_accuracy": 0.1948819413781166, "num_tokens": 49411231.0, "step": 28485 }, { "entropy": 5.733885002136231, "epoch": 2.21661155417234, "grad_norm": 1.2265625, "learning_rate": 0.0004503463337084072, "loss": 5.0528, "mean_token_accuracy": 0.19924768060445786, "num_tokens": 49419410.0, "step": 28490 }, { "entropy": 5.665694093704223, "epoch": 2.2170005835440576, "grad_norm": 1.1484375, "learning_rate": 0.0004503289649639754, "loss": 4.9237, "mean_token_accuracy": 0.20624686777591705, "num_tokens": 49427365.0, "step": 28495 }, { "entropy": 5.660738849639893, "epoch": 2.2173896129157753, "grad_norm": 1.1796875, "learning_rate": 0.0004503115935592056, "loss": 4.9665, "mean_token_accuracy": 0.198374043405056, "num_tokens": 49436395.0, "step": 28500 }, { "entropy": 5.750874710083008, "epoch": 2.2177786422874926, "grad_norm": 1.1796875, "learning_rate": 0.0004502942194943614, "loss": 5.0251, "mean_token_accuracy": 0.20424560606479644, "num_tokens": 49446021.0, "step": 28505 }, { "entropy": 5.7677969455719, "epoch": 2.2181676716592102, "grad_norm": 1.21875, "learning_rate": 0.00045027684276970645, "loss": 5.0913, "mean_token_accuracy": 0.194797845184803, "num_tokens": 49454306.0, "step": 28510 }, { "entropy": 5.694695854187012, "epoch": 2.218556701030928, "grad_norm": 1.109375, "learning_rate": 0.00045025946338550434, "loss": 5.0201, "mean_token_accuracy": 0.1983622908592224, "num_tokens": 49462735.0, "step": 28515 }, { "entropy": 5.688482618331909, "epoch": 2.218945730402645, "grad_norm": 1.125, "learning_rate": 0.0004502420813420189, "loss": 5.0469, "mean_token_accuracy": 0.20095740407705306, "num_tokens": 49471156.0, "step": 28520 }, { "entropy": 5.731932020187378, "epoch": 2.219334759774363, "grad_norm": 1.109375, "learning_rate": 0.0004502246966395137, "loss": 5.0629, "mean_token_accuracy": 0.2015834182500839, "num_tokens": 49479505.0, "step": 28525 }, { "entropy": 5.771178150177002, "epoch": 2.2197237891460806, "grad_norm": 1.125, "learning_rate": 0.00045020730927825274, "loss": 5.05, "mean_token_accuracy": 0.19700267016887665, "num_tokens": 49487879.0, "step": 28530 }, { "entropy": 5.678888654708862, "epoch": 2.2201128185177983, "grad_norm": 1.140625, "learning_rate": 0.0004501899192584997, "loss": 4.8996, "mean_token_accuracy": 0.2155568242073059, "num_tokens": 49496321.0, "step": 28535 }, { "entropy": 5.761304187774658, "epoch": 2.2205018478895155, "grad_norm": 1.21875, "learning_rate": 0.0004501725265805185, "loss": 5.2057, "mean_token_accuracy": 0.19428282380104064, "num_tokens": 49504955.0, "step": 28540 }, { "entropy": 5.662376785278321, "epoch": 2.2208908772612332, "grad_norm": 1.125, "learning_rate": 0.00045015513124457303, "loss": 4.9267, "mean_token_accuracy": 0.20249511003494264, "num_tokens": 49513678.0, "step": 28545 }, { "entropy": 5.657446336746216, "epoch": 2.221279906632951, "grad_norm": 1.1953125, "learning_rate": 0.0004501377332509272, "loss": 4.968, "mean_token_accuracy": 0.20362241864204406, "num_tokens": 49522315.0, "step": 28550 }, { "entropy": 5.668161249160766, "epoch": 2.221668936004668, "grad_norm": 1.1328125, "learning_rate": 0.00045012033259984494, "loss": 5.0236, "mean_token_accuracy": 0.19838583171367646, "num_tokens": 49531077.0, "step": 28555 }, { "entropy": 5.661968231201172, "epoch": 2.222057965376386, "grad_norm": 1.3203125, "learning_rate": 0.0004501029292915905, "loss": 5.0292, "mean_token_accuracy": 0.19962324500083922, "num_tokens": 49540327.0, "step": 28560 }, { "entropy": 5.669524335861206, "epoch": 2.2224469947481036, "grad_norm": 1.1875, "learning_rate": 0.00045008552332642774, "loss": 5.0075, "mean_token_accuracy": 0.20265630185604094, "num_tokens": 49549440.0, "step": 28565 }, { "entropy": 5.6944952487945555, "epoch": 2.222836024119821, "grad_norm": 1.3125, "learning_rate": 0.00045006811470462083, "loss": 4.9915, "mean_token_accuracy": 0.2077173262834549, "num_tokens": 49558066.0, "step": 28570 }, { "entropy": 5.699270963668823, "epoch": 2.2232250534915385, "grad_norm": 1.1640625, "learning_rate": 0.000450050703426434, "loss": 4.9688, "mean_token_accuracy": 0.20818862468004226, "num_tokens": 49566970.0, "step": 28575 }, { "entropy": 5.560291290283203, "epoch": 2.2236140828632562, "grad_norm": 1.1875, "learning_rate": 0.0004500332894921313, "loss": 4.8674, "mean_token_accuracy": 0.21454499065876007, "num_tokens": 49575524.0, "step": 28580 }, { "entropy": 5.705838060379028, "epoch": 2.224003112234974, "grad_norm": 1.1796875, "learning_rate": 0.0004500158729019771, "loss": 5.1436, "mean_token_accuracy": 0.19139543175697327, "num_tokens": 49584040.0, "step": 28585 }, { "entropy": 5.7106382846832275, "epoch": 2.224392141606691, "grad_norm": 1.2109375, "learning_rate": 0.0004499984536562355, "loss": 5.0456, "mean_token_accuracy": 0.1959618076682091, "num_tokens": 49592991.0, "step": 28590 }, { "entropy": 5.678031492233276, "epoch": 2.224781170978409, "grad_norm": 1.1796875, "learning_rate": 0.000449981031755171, "loss": 5.0213, "mean_token_accuracy": 0.2034960940480232, "num_tokens": 49601958.0, "step": 28595 }, { "entropy": 5.640343570709229, "epoch": 2.2251702003501266, "grad_norm": 1.2890625, "learning_rate": 0.00044996360719904777, "loss": 4.9363, "mean_token_accuracy": 0.20091040879487992, "num_tokens": 49610624.0, "step": 28600 }, { "entropy": 5.647492361068726, "epoch": 2.225559229721844, "grad_norm": 1.171875, "learning_rate": 0.0004499461799881303, "loss": 4.9782, "mean_token_accuracy": 0.21136863082647322, "num_tokens": 49619308.0, "step": 28605 }, { "entropy": 5.6430410861969, "epoch": 2.2259482590935615, "grad_norm": 1.265625, "learning_rate": 0.0004499287501226831, "loss": 4.957, "mean_token_accuracy": 0.20026226043701173, "num_tokens": 49627842.0, "step": 28610 }, { "entropy": 5.694025707244873, "epoch": 2.2263372884652792, "grad_norm": 1.2109375, "learning_rate": 0.00044991131760297045, "loss": 5.0543, "mean_token_accuracy": 0.19778717011213304, "num_tokens": 49636712.0, "step": 28615 }, { "entropy": 5.73361382484436, "epoch": 2.226726317836997, "grad_norm": 1.21875, "learning_rate": 0.00044989388242925693, "loss": 5.0335, "mean_token_accuracy": 0.20549493581056594, "num_tokens": 49645324.0, "step": 28620 }, { "entropy": 5.680033397674561, "epoch": 2.227115347208714, "grad_norm": 1.296875, "learning_rate": 0.0004498764446018073, "loss": 5.0147, "mean_token_accuracy": 0.2017555430531502, "num_tokens": 49654203.0, "step": 28625 }, { "entropy": 5.743928480148315, "epoch": 2.227504376580432, "grad_norm": 1.09375, "learning_rate": 0.0004498590041208857, "loss": 5.0422, "mean_token_accuracy": 0.19331875294446946, "num_tokens": 49663197.0, "step": 28630 }, { "entropy": 5.620531845092773, "epoch": 2.2278934059521496, "grad_norm": 1.125, "learning_rate": 0.0004498415609867572, "loss": 4.9436, "mean_token_accuracy": 0.20344389826059342, "num_tokens": 49671993.0, "step": 28635 }, { "entropy": 5.576728820800781, "epoch": 2.228282435323867, "grad_norm": 1.1953125, "learning_rate": 0.00044982411519968625, "loss": 4.8482, "mean_token_accuracy": 0.20729222297668456, "num_tokens": 49680403.0, "step": 28640 }, { "entropy": 5.607668685913086, "epoch": 2.2286714646955845, "grad_norm": 1.125, "learning_rate": 0.0004498066667599377, "loss": 4.867, "mean_token_accuracy": 0.21490182876586914, "num_tokens": 49688667.0, "step": 28645 }, { "entropy": 5.641664028167725, "epoch": 2.2290604940673022, "grad_norm": 1.140625, "learning_rate": 0.00044978921566777604, "loss": 5.0068, "mean_token_accuracy": 0.1992063358426094, "num_tokens": 49696753.0, "step": 28650 }, { "entropy": 5.680857706069946, "epoch": 2.2294495234390195, "grad_norm": 1.265625, "learning_rate": 0.0004497717619234664, "loss": 4.9573, "mean_token_accuracy": 0.20671802014112473, "num_tokens": 49705222.0, "step": 28655 }, { "entropy": 5.678987836837768, "epoch": 2.229838552810737, "grad_norm": 1.1796875, "learning_rate": 0.00044975430552727337, "loss": 4.9799, "mean_token_accuracy": 0.20289224237203599, "num_tokens": 49714133.0, "step": 28660 }, { "entropy": 5.618532037734985, "epoch": 2.230227582182455, "grad_norm": 1.15625, "learning_rate": 0.0004497368464794619, "loss": 4.9093, "mean_token_accuracy": 0.21116359233856202, "num_tokens": 49722743.0, "step": 28665 }, { "entropy": 5.611352014541626, "epoch": 2.230616611554172, "grad_norm": 1.1875, "learning_rate": 0.00044971938478029693, "loss": 4.8871, "mean_token_accuracy": 0.21569850146770478, "num_tokens": 49731721.0, "step": 28670 }, { "entropy": 5.622652006149292, "epoch": 2.23100564092589, "grad_norm": 1.1328125, "learning_rate": 0.00044970192043004343, "loss": 4.8932, "mean_token_accuracy": 0.20360766500234603, "num_tokens": 49740373.0, "step": 28675 }, { "entropy": 5.60328688621521, "epoch": 2.2313946702976075, "grad_norm": 1.296875, "learning_rate": 0.0004496844534289663, "loss": 4.9801, "mean_token_accuracy": 0.20997078567743302, "num_tokens": 49748544.0, "step": 28680 }, { "entropy": 5.769106864929199, "epoch": 2.231783699669325, "grad_norm": 1.1953125, "learning_rate": 0.00044966698377733064, "loss": 5.0551, "mean_token_accuracy": 0.19749262183904648, "num_tokens": 49757738.0, "step": 28685 }, { "entropy": 5.643612098693848, "epoch": 2.2321727290410425, "grad_norm": 1.1953125, "learning_rate": 0.0004496495114754015, "loss": 4.8955, "mean_token_accuracy": 0.20715417414903642, "num_tokens": 49766203.0, "step": 28690 }, { "entropy": 5.631129407882691, "epoch": 2.23256175841276, "grad_norm": 1.1640625, "learning_rate": 0.00044963203652344404, "loss": 4.9605, "mean_token_accuracy": 0.20184274166822433, "num_tokens": 49774951.0, "step": 28695 }, { "entropy": 5.579481315612793, "epoch": 2.232950787784478, "grad_norm": 1.109375, "learning_rate": 0.0004496145589217234, "loss": 4.9545, "mean_token_accuracy": 0.20362749248743056, "num_tokens": 49783250.0, "step": 28700 }, { "entropy": 5.621295642852783, "epoch": 2.233339817156195, "grad_norm": 1.1015625, "learning_rate": 0.00044959707867050467, "loss": 4.9008, "mean_token_accuracy": 0.20851612091064453, "num_tokens": 49792832.0, "step": 28705 }, { "entropy": 5.653230142593384, "epoch": 2.233728846527913, "grad_norm": 1.265625, "learning_rate": 0.0004495795957700532, "loss": 4.9291, "mean_token_accuracy": 0.20723828077316284, "num_tokens": 49800745.0, "step": 28710 }, { "entropy": 5.602529716491699, "epoch": 2.2341178758996305, "grad_norm": 1.1328125, "learning_rate": 0.00044956211022063424, "loss": 4.8698, "mean_token_accuracy": 0.2131836771965027, "num_tokens": 49809458.0, "step": 28715 }, { "entropy": 5.71400818824768, "epoch": 2.234506905271348, "grad_norm": 1.375, "learning_rate": 0.00044954462202251316, "loss": 4.9711, "mean_token_accuracy": 0.20459958910942078, "num_tokens": 49818122.0, "step": 28720 }, { "entropy": 5.628059911727905, "epoch": 2.2348959346430655, "grad_norm": 1.21875, "learning_rate": 0.00044952713117595516, "loss": 4.9093, "mean_token_accuracy": 0.2028353899717331, "num_tokens": 49826451.0, "step": 28725 }, { "entropy": 5.75443286895752, "epoch": 2.235284964014783, "grad_norm": 1.25, "learning_rate": 0.00044950963768122576, "loss": 5.0056, "mean_token_accuracy": 0.20085218399763108, "num_tokens": 49835463.0, "step": 28730 }, { "entropy": 5.681185913085938, "epoch": 2.235673993386501, "grad_norm": 1.2265625, "learning_rate": 0.0004494921415385905, "loss": 4.9432, "mean_token_accuracy": 0.20913594365119934, "num_tokens": 49843896.0, "step": 28735 }, { "entropy": 5.6923002243042, "epoch": 2.236063022758218, "grad_norm": 1.140625, "learning_rate": 0.00044947464274831464, "loss": 4.9855, "mean_token_accuracy": 0.19811567515134812, "num_tokens": 49852380.0, "step": 28740 }, { "entropy": 5.756666994094848, "epoch": 2.236452052129936, "grad_norm": 1.171875, "learning_rate": 0.0004494571413106637, "loss": 4.9367, "mean_token_accuracy": 0.2060974806547165, "num_tokens": 49861290.0, "step": 28745 }, { "entropy": 5.743583917617798, "epoch": 2.2368410815016535, "grad_norm": 1.2890625, "learning_rate": 0.00044943963722590344, "loss": 4.9928, "mean_token_accuracy": 0.20245958119630814, "num_tokens": 49869295.0, "step": 28750 }, { "entropy": 5.6461358070373535, "epoch": 2.2372301108733708, "grad_norm": 1.2578125, "learning_rate": 0.00044942213049429917, "loss": 5.0672, "mean_token_accuracy": 0.20274552702903748, "num_tokens": 49877771.0, "step": 28755 }, { "entropy": 5.681533575057983, "epoch": 2.2376191402450885, "grad_norm": 1.1875, "learning_rate": 0.00044940462111611685, "loss": 5.0351, "mean_token_accuracy": 0.20197467505931854, "num_tokens": 49886531.0, "step": 28760 }, { "entropy": 5.717924642562866, "epoch": 2.238008169616806, "grad_norm": 1.25, "learning_rate": 0.00044938710909162195, "loss": 5.0543, "mean_token_accuracy": 0.20527520179748535, "num_tokens": 49895323.0, "step": 28765 }, { "entropy": 5.741388177871704, "epoch": 2.2383971989885234, "grad_norm": 1.171875, "learning_rate": 0.0004493695944210802, "loss": 5.0055, "mean_token_accuracy": 0.2004312053322792, "num_tokens": 49903918.0, "step": 28770 }, { "entropy": 5.666144943237304, "epoch": 2.238786228360241, "grad_norm": 1.1875, "learning_rate": 0.0004493520771047574, "loss": 4.9414, "mean_token_accuracy": 0.2048543930053711, "num_tokens": 49912754.0, "step": 28775 }, { "entropy": 5.67534818649292, "epoch": 2.239175257731959, "grad_norm": 1.1171875, "learning_rate": 0.00044933455714291944, "loss": 5.0453, "mean_token_accuracy": 0.2035510793328285, "num_tokens": 49922188.0, "step": 28780 }, { "entropy": 5.71228346824646, "epoch": 2.2395642871036765, "grad_norm": 1.3125, "learning_rate": 0.00044931703453583195, "loss": 5.0213, "mean_token_accuracy": 0.20022136121988296, "num_tokens": 49930718.0, "step": 28785 }, { "entropy": 5.702928066253662, "epoch": 2.2399533164753938, "grad_norm": 1.171875, "learning_rate": 0.00044929950928376095, "loss": 5.0413, "mean_token_accuracy": 0.20507185459136962, "num_tokens": 49939095.0, "step": 28790 }, { "entropy": 5.686867761611938, "epoch": 2.2403423458471114, "grad_norm": 1.3203125, "learning_rate": 0.0004492819813869723, "loss": 4.9825, "mean_token_accuracy": 0.21070529669523239, "num_tokens": 49946996.0, "step": 28795 }, { "entropy": 5.717284917831421, "epoch": 2.240731375218829, "grad_norm": 1.140625, "learning_rate": 0.00044926445084573206, "loss": 5.0256, "mean_token_accuracy": 0.20748060196638107, "num_tokens": 49956262.0, "step": 28800 }, { "entropy": 5.674253034591675, "epoch": 2.2411204045905464, "grad_norm": 1.21875, "learning_rate": 0.000449246917660306, "loss": 4.9572, "mean_token_accuracy": 0.20764269530773163, "num_tokens": 49964581.0, "step": 28805 }, { "entropy": 5.541695642471313, "epoch": 2.241509433962264, "grad_norm": 1.2109375, "learning_rate": 0.0004492293818309604, "loss": 4.8645, "mean_token_accuracy": 0.21046651899814606, "num_tokens": 49972876.0, "step": 28810 }, { "entropy": 5.676420974731445, "epoch": 2.241898463333982, "grad_norm": 1.1953125, "learning_rate": 0.0004492118433579613, "loss": 4.976, "mean_token_accuracy": 0.20666498243808745, "num_tokens": 49981605.0, "step": 28815 }, { "entropy": 5.758188533782959, "epoch": 2.2422874927056995, "grad_norm": 1.3984375, "learning_rate": 0.00044919430224157463, "loss": 5.1034, "mean_token_accuracy": 0.19789862334728242, "num_tokens": 49990576.0, "step": 28820 }, { "entropy": 5.685143518447876, "epoch": 2.2426765220774167, "grad_norm": 1.234375, "learning_rate": 0.00044917675848206684, "loss": 4.944, "mean_token_accuracy": 0.2055775612592697, "num_tokens": 49999350.0, "step": 28825 }, { "entropy": 5.632293605804444, "epoch": 2.2430655514491344, "grad_norm": 1.109375, "learning_rate": 0.00044915921207970387, "loss": 4.9449, "mean_token_accuracy": 0.20642259120941162, "num_tokens": 50008202.0, "step": 28830 }, { "entropy": 5.642661905288696, "epoch": 2.243454580820852, "grad_norm": 1.1328125, "learning_rate": 0.00044914166303475206, "loss": 4.8673, "mean_token_accuracy": 0.20773967504501342, "num_tokens": 50016600.0, "step": 28835 }, { "entropy": 5.659676456451416, "epoch": 2.2438436101925694, "grad_norm": 1.1640625, "learning_rate": 0.00044912411134747764, "loss": 4.9132, "mean_token_accuracy": 0.20694416463375093, "num_tokens": 50025029.0, "step": 28840 }, { "entropy": 5.5995463848114015, "epoch": 2.244232639564287, "grad_norm": 1.2109375, "learning_rate": 0.00044910655701814705, "loss": 4.9177, "mean_token_accuracy": 0.20474697649478912, "num_tokens": 50033692.0, "step": 28845 }, { "entropy": 5.675409889221191, "epoch": 2.244621668936005, "grad_norm": 1.234375, "learning_rate": 0.0004490890000470266, "loss": 5.0133, "mean_token_accuracy": 0.20009475350379943, "num_tokens": 50042572.0, "step": 28850 }, { "entropy": 5.759887075424194, "epoch": 2.245010698307722, "grad_norm": 1.2109375, "learning_rate": 0.00044907144043438265, "loss": 5.0584, "mean_token_accuracy": 0.19761327654123306, "num_tokens": 50050823.0, "step": 28855 }, { "entropy": 5.697376012802124, "epoch": 2.2453997276794397, "grad_norm": 1.2578125, "learning_rate": 0.0004490538781804816, "loss": 4.9295, "mean_token_accuracy": 0.20915098637342452, "num_tokens": 50058596.0, "step": 28860 }, { "entropy": 5.642661809921265, "epoch": 2.2457887570511574, "grad_norm": 1.1875, "learning_rate": 0.00044903631328559, "loss": 4.8923, "mean_token_accuracy": 0.21531443148851395, "num_tokens": 50067482.0, "step": 28865 }, { "entropy": 5.678960943222046, "epoch": 2.246177786422875, "grad_norm": 1.2890625, "learning_rate": 0.00044901874574997444, "loss": 5.0268, "mean_token_accuracy": 0.2070894092321396, "num_tokens": 50075581.0, "step": 28870 }, { "entropy": 5.671623420715332, "epoch": 2.2465668157945924, "grad_norm": 1.21875, "learning_rate": 0.00044900117557390137, "loss": 4.9135, "mean_token_accuracy": 0.20600969791412355, "num_tokens": 50083906.0, "step": 28875 }, { "entropy": 5.694965744018555, "epoch": 2.24695584516631, "grad_norm": 1.3125, "learning_rate": 0.00044898360275763733, "loss": 5.0162, "mean_token_accuracy": 0.2022222951054573, "num_tokens": 50091494.0, "step": 28880 }, { "entropy": 5.690550422668457, "epoch": 2.247344874538028, "grad_norm": 1.2421875, "learning_rate": 0.00044896602730144905, "loss": 5.0629, "mean_token_accuracy": 0.2077265903353691, "num_tokens": 50100576.0, "step": 28885 }, { "entropy": 5.7438586235046385, "epoch": 2.247733903909745, "grad_norm": 1.1796875, "learning_rate": 0.00044894844920560323, "loss": 5.1246, "mean_token_accuracy": 0.19104130268096925, "num_tokens": 50109832.0, "step": 28890 }, { "entropy": 5.701132917404175, "epoch": 2.2481229332814627, "grad_norm": 1.1328125, "learning_rate": 0.0004489308684703666, "loss": 5.0936, "mean_token_accuracy": 0.19215504378080367, "num_tokens": 50120038.0, "step": 28895 }, { "entropy": 5.709657955169678, "epoch": 2.2485119626531804, "grad_norm": 1.1171875, "learning_rate": 0.0004489132850960059, "loss": 5.0153, "mean_token_accuracy": 0.20093377381563188, "num_tokens": 50128580.0, "step": 28900 }, { "entropy": 5.698613214492798, "epoch": 2.2489009920248977, "grad_norm": 1.15625, "learning_rate": 0.0004488956990827878, "loss": 5.0757, "mean_token_accuracy": 0.19791360944509506, "num_tokens": 50137540.0, "step": 28905 }, { "entropy": 5.700235843658447, "epoch": 2.2492900213966154, "grad_norm": 1.203125, "learning_rate": 0.0004488781104309793, "loss": 5.0357, "mean_token_accuracy": 0.20053176283836366, "num_tokens": 50146292.0, "step": 28910 }, { "entropy": 5.669429540634155, "epoch": 2.249679050768333, "grad_norm": 1.203125, "learning_rate": 0.00044886051914084726, "loss": 4.9093, "mean_token_accuracy": 0.2105779990553856, "num_tokens": 50154893.0, "step": 28915 }, { "entropy": 5.718633365631104, "epoch": 2.2500680801400508, "grad_norm": 1.2109375, "learning_rate": 0.00044884292521265846, "loss": 5.0204, "mean_token_accuracy": 0.19848669022321702, "num_tokens": 50163707.0, "step": 28920 }, { "entropy": 5.692962408065796, "epoch": 2.250457109511768, "grad_norm": 1.125, "learning_rate": 0.0004488253286466801, "loss": 4.9629, "mean_token_accuracy": 0.20391949713230134, "num_tokens": 50172062.0, "step": 28925 }, { "entropy": 5.690717458724976, "epoch": 2.2508461388834857, "grad_norm": 1.1875, "learning_rate": 0.00044880772944317905, "loss": 4.9556, "mean_token_accuracy": 0.20632888823747636, "num_tokens": 50180362.0, "step": 28930 }, { "entropy": 5.6908118724823, "epoch": 2.2512351682552034, "grad_norm": 1.2421875, "learning_rate": 0.00044879012760242224, "loss": 4.9965, "mean_token_accuracy": 0.20556005239486694, "num_tokens": 50189038.0, "step": 28935 }, { "entropy": 5.711616945266724, "epoch": 2.2516241976269207, "grad_norm": 1.21875, "learning_rate": 0.00044877252312467694, "loss": 4.9534, "mean_token_accuracy": 0.19651295840740204, "num_tokens": 50198288.0, "step": 28940 }, { "entropy": 5.621335363388061, "epoch": 2.2520132269986384, "grad_norm": 1.21875, "learning_rate": 0.0004487549160102101, "loss": 4.9406, "mean_token_accuracy": 0.20929258763790132, "num_tokens": 50207442.0, "step": 28945 }, { "entropy": 5.703446006774902, "epoch": 2.252402256370356, "grad_norm": 1.171875, "learning_rate": 0.00044873730625928914, "loss": 5.0656, "mean_token_accuracy": 0.1977154091000557, "num_tokens": 50216794.0, "step": 28950 }, { "entropy": 5.747040510177612, "epoch": 2.2527912857420738, "grad_norm": 1.2734375, "learning_rate": 0.00044871969387218094, "loss": 4.9378, "mean_token_accuracy": 0.20394810140132905, "num_tokens": 50224764.0, "step": 28955 }, { "entropy": 5.703225564956665, "epoch": 2.253180315113791, "grad_norm": 1.1953125, "learning_rate": 0.000448702078849153, "loss": 5.0433, "mean_token_accuracy": 0.1958728089928627, "num_tokens": 50233256.0, "step": 28960 }, { "entropy": 5.689411449432373, "epoch": 2.2535693444855087, "grad_norm": 1.046875, "learning_rate": 0.00044868446119047234, "loss": 4.9596, "mean_token_accuracy": 0.20529997050762178, "num_tokens": 50242862.0, "step": 28965 }, { "entropy": 5.6831409454345705, "epoch": 2.253958373857226, "grad_norm": 1.234375, "learning_rate": 0.0004486668408964065, "loss": 4.9616, "mean_token_accuracy": 0.2007655382156372, "num_tokens": 50252048.0, "step": 28970 }, { "entropy": 5.723523044586182, "epoch": 2.2543474032289437, "grad_norm": 1.15625, "learning_rate": 0.0004486492179672228, "loss": 5.059, "mean_token_accuracy": 0.2026532158255577, "num_tokens": 50260545.0, "step": 28975 }, { "entropy": 5.688583087921143, "epoch": 2.2547364326006614, "grad_norm": 1.2421875, "learning_rate": 0.00044863159240318863, "loss": 4.9155, "mean_token_accuracy": 0.20499011874198914, "num_tokens": 50268714.0, "step": 28980 }, { "entropy": 5.655296182632446, "epoch": 2.255125461972379, "grad_norm": 1.1484375, "learning_rate": 0.0004486139642045714, "loss": 4.9017, "mean_token_accuracy": 0.20790935456752777, "num_tokens": 50276876.0, "step": 28985 }, { "entropy": 5.6959864616394045, "epoch": 2.2555144913440963, "grad_norm": 1.1484375, "learning_rate": 0.0004485963333716385, "loss": 5.0555, "mean_token_accuracy": 0.196952223777771, "num_tokens": 50285924.0, "step": 28990 }, { "entropy": 5.713644647598267, "epoch": 2.255903520715814, "grad_norm": 1.1328125, "learning_rate": 0.0004485786999046576, "loss": 5.0136, "mean_token_accuracy": 0.1964259698987007, "num_tokens": 50295358.0, "step": 28995 }, { "entropy": 5.723752117156982, "epoch": 2.2562925500875317, "grad_norm": 1.3046875, "learning_rate": 0.00044856106380389624, "loss": 5.0306, "mean_token_accuracy": 0.19933811873197554, "num_tokens": 50303572.0, "step": 29000 }, { "entropy": 5.705112552642822, "epoch": 2.256681579459249, "grad_norm": 1.28125, "learning_rate": 0.000448543425069622, "loss": 4.9377, "mean_token_accuracy": 0.20971720069646835, "num_tokens": 50312533.0, "step": 29005 }, { "entropy": 5.69415807723999, "epoch": 2.2570706088309667, "grad_norm": 1.2578125, "learning_rate": 0.0004485257837021025, "loss": 4.9471, "mean_token_accuracy": 0.20324748754501343, "num_tokens": 50321049.0, "step": 29010 }, { "entropy": 5.61723108291626, "epoch": 2.2574596382026844, "grad_norm": 1.2421875, "learning_rate": 0.00044850813970160534, "loss": 4.91, "mean_token_accuracy": 0.21009943634271622, "num_tokens": 50329308.0, "step": 29015 }, { "entropy": 5.664193058013916, "epoch": 2.257848667574402, "grad_norm": 1.296875, "learning_rate": 0.0004484904930683984, "loss": 4.9357, "mean_token_accuracy": 0.21238835752010346, "num_tokens": 50337311.0, "step": 29020 }, { "entropy": 5.611314678192139, "epoch": 2.2582376969461193, "grad_norm": 1.1328125, "learning_rate": 0.0004484728438027494, "loss": 4.9639, "mean_token_accuracy": 0.20699684768915178, "num_tokens": 50346557.0, "step": 29025 }, { "entropy": 5.615992403030395, "epoch": 2.258626726317837, "grad_norm": 1.2890625, "learning_rate": 0.0004484551919049261, "loss": 4.9407, "mean_token_accuracy": 0.21015520244836808, "num_tokens": 50354982.0, "step": 29030 }, { "entropy": 5.653058671951294, "epoch": 2.2590157556895547, "grad_norm": 1.234375, "learning_rate": 0.00044843753737519625, "loss": 4.9601, "mean_token_accuracy": 0.2015739232301712, "num_tokens": 50363414.0, "step": 29035 }, { "entropy": 5.683380365371704, "epoch": 2.259404785061272, "grad_norm": 1.171875, "learning_rate": 0.0004484198802138279, "loss": 4.9176, "mean_token_accuracy": 0.20292025059461594, "num_tokens": 50371803.0, "step": 29040 }, { "entropy": 5.698860454559326, "epoch": 2.2597938144329897, "grad_norm": 1.1953125, "learning_rate": 0.0004484022204210889, "loss": 5.0176, "mean_token_accuracy": 0.2057631641626358, "num_tokens": 50380125.0, "step": 29045 }, { "entropy": 5.595080709457397, "epoch": 2.2601828438047074, "grad_norm": 1.140625, "learning_rate": 0.00044838455799724717, "loss": 4.8862, "mean_token_accuracy": 0.2025167539715767, "num_tokens": 50388916.0, "step": 29050 }, { "entropy": 5.696647024154663, "epoch": 2.260571873176425, "grad_norm": 1.390625, "learning_rate": 0.00044836689294257075, "loss": 5.056, "mean_token_accuracy": 0.2012597844004631, "num_tokens": 50397353.0, "step": 29055 }, { "entropy": 5.650641870498657, "epoch": 2.2609609025481423, "grad_norm": 1.2578125, "learning_rate": 0.0004483492252573276, "loss": 4.9458, "mean_token_accuracy": 0.21408360451459885, "num_tokens": 50405176.0, "step": 29060 }, { "entropy": 5.5972044467926025, "epoch": 2.26134993191986, "grad_norm": 1.1875, "learning_rate": 0.000448331554941786, "loss": 4.9759, "mean_token_accuracy": 0.20123471319675446, "num_tokens": 50413845.0, "step": 29065 }, { "entropy": 5.660688066482544, "epoch": 2.2617389612915777, "grad_norm": 1.2578125, "learning_rate": 0.00044831388199621385, "loss": 5.039, "mean_token_accuracy": 0.20346451103687285, "num_tokens": 50422343.0, "step": 29070 }, { "entropy": 5.628743362426758, "epoch": 2.262127990663295, "grad_norm": 1.1328125, "learning_rate": 0.00044829620642087946, "loss": 4.9257, "mean_token_accuracy": 0.21001740097999572, "num_tokens": 50430438.0, "step": 29075 }, { "entropy": 5.661933374404907, "epoch": 2.2625170200350126, "grad_norm": 1.203125, "learning_rate": 0.0004482785282160509, "loss": 4.965, "mean_token_accuracy": 0.20248445123434067, "num_tokens": 50438865.0, "step": 29080 }, { "entropy": 5.7014772415161135, "epoch": 2.2629060494067303, "grad_norm": 1.0859375, "learning_rate": 0.00044826084738199657, "loss": 5.0404, "mean_token_accuracy": 0.20033365190029145, "num_tokens": 50447784.0, "step": 29085 }, { "entropy": 5.751681232452393, "epoch": 2.2632950787784476, "grad_norm": 1.203125, "learning_rate": 0.00044824316391898464, "loss": 5.0131, "mean_token_accuracy": 0.2003472089767456, "num_tokens": 50457266.0, "step": 29090 }, { "entropy": 5.778943395614624, "epoch": 2.2636841081501653, "grad_norm": 1.2265625, "learning_rate": 0.00044822547782728334, "loss": 5.16, "mean_token_accuracy": 0.1949354112148285, "num_tokens": 50466171.0, "step": 29095 }, { "entropy": 5.722167539596557, "epoch": 2.264073137521883, "grad_norm": 1.171875, "learning_rate": 0.0004482077891071612, "loss": 4.9576, "mean_token_accuracy": 0.2073575347661972, "num_tokens": 50474127.0, "step": 29100 }, { "entropy": 5.6157190799713135, "epoch": 2.2644621668936002, "grad_norm": 1.15625, "learning_rate": 0.00044819009775888655, "loss": 4.905, "mean_token_accuracy": 0.20258973985910417, "num_tokens": 50482724.0, "step": 29105 }, { "entropy": 5.761140298843384, "epoch": 2.264851196265318, "grad_norm": 1.171875, "learning_rate": 0.00044817240378272784, "loss": 5.1043, "mean_token_accuracy": 0.19116682559251785, "num_tokens": 50491412.0, "step": 29110 }, { "entropy": 5.772146701812744, "epoch": 2.2652402256370356, "grad_norm": 1.3125, "learning_rate": 0.00044815470717895345, "loss": 5.1159, "mean_token_accuracy": 0.1988602861762047, "num_tokens": 50499843.0, "step": 29115 }, { "entropy": 5.707363510131836, "epoch": 2.2656292550087533, "grad_norm": 1.15625, "learning_rate": 0.0004481370079478321, "loss": 5.0203, "mean_token_accuracy": 0.20273398905992507, "num_tokens": 50509501.0, "step": 29120 }, { "entropy": 5.724542808532715, "epoch": 2.2660182843804706, "grad_norm": 1.25, "learning_rate": 0.0004481193060896322, "loss": 5.017, "mean_token_accuracy": 0.20943168550729752, "num_tokens": 50518438.0, "step": 29125 }, { "entropy": 5.729372119903564, "epoch": 2.2664073137521883, "grad_norm": 1.0859375, "learning_rate": 0.0004481016016046223, "loss": 4.9897, "mean_token_accuracy": 0.2022513672709465, "num_tokens": 50527516.0, "step": 29130 }, { "entropy": 5.65195140838623, "epoch": 2.266796343123906, "grad_norm": 1.1015625, "learning_rate": 0.0004480838944930712, "loss": 4.9557, "mean_token_accuracy": 0.20242133140563964, "num_tokens": 50536179.0, "step": 29135 }, { "entropy": 5.714081048965454, "epoch": 2.2671853724956232, "grad_norm": 1.2421875, "learning_rate": 0.0004480661847552474, "loss": 4.9995, "mean_token_accuracy": 0.20489007234573364, "num_tokens": 50545231.0, "step": 29140 }, { "entropy": 5.691465139389038, "epoch": 2.267574401867341, "grad_norm": 1.2265625, "learning_rate": 0.0004480484723914198, "loss": 5.0067, "mean_token_accuracy": 0.20415897965431212, "num_tokens": 50553873.0, "step": 29145 }, { "entropy": 5.6659111976623535, "epoch": 2.2679634312390586, "grad_norm": 1.140625, "learning_rate": 0.0004480307574018571, "loss": 5.017, "mean_token_accuracy": 0.2021056279540062, "num_tokens": 50563733.0, "step": 29150 }, { "entropy": 5.6646809577941895, "epoch": 2.2683524606107763, "grad_norm": 1.125, "learning_rate": 0.000448013039786828, "loss": 4.9573, "mean_token_accuracy": 0.20604974180459976, "num_tokens": 50573187.0, "step": 29155 }, { "entropy": 5.677774810791016, "epoch": 2.2687414899824936, "grad_norm": 1.1015625, "learning_rate": 0.00044799531954660133, "loss": 4.9459, "mean_token_accuracy": 0.21089249700307847, "num_tokens": 50581580.0, "step": 29160 }, { "entropy": 5.701811647415161, "epoch": 2.2691305193542113, "grad_norm": 1.3046875, "learning_rate": 0.0004479775966814461, "loss": 4.9549, "mean_token_accuracy": 0.20914404839277267, "num_tokens": 50589471.0, "step": 29165 }, { "entropy": 5.6880518913269045, "epoch": 2.269519548725929, "grad_norm": 1.3046875, "learning_rate": 0.00044795987119163115, "loss": 5.0008, "mean_token_accuracy": 0.20518171936273574, "num_tokens": 50597923.0, "step": 29170 }, { "entropy": 5.758745956420898, "epoch": 2.2699085780976462, "grad_norm": 1.1796875, "learning_rate": 0.0004479421430774255, "loss": 5.0876, "mean_token_accuracy": 0.1932474434375763, "num_tokens": 50606981.0, "step": 29175 }, { "entropy": 5.7204195022583, "epoch": 2.270297607469364, "grad_norm": 1.1484375, "learning_rate": 0.0004479244123390981, "loss": 4.998, "mean_token_accuracy": 0.2002711370587349, "num_tokens": 50615680.0, "step": 29180 }, { "entropy": 5.715487241744995, "epoch": 2.2706866368410816, "grad_norm": 1.15625, "learning_rate": 0.00044790667897691796, "loss": 4.9707, "mean_token_accuracy": 0.20839148610830308, "num_tokens": 50624053.0, "step": 29185 }, { "entropy": 5.695052719116211, "epoch": 2.271075666212799, "grad_norm": 1.125, "learning_rate": 0.00044788894299115415, "loss": 5.0044, "mean_token_accuracy": 0.20742223262786866, "num_tokens": 50632671.0, "step": 29190 }, { "entropy": 5.689529228210449, "epoch": 2.2714646955845166, "grad_norm": 1.234375, "learning_rate": 0.0004478712043820758, "loss": 4.9754, "mean_token_accuracy": 0.2106986552476883, "num_tokens": 50641734.0, "step": 29195 }, { "entropy": 5.639039802551269, "epoch": 2.2718537249562343, "grad_norm": 1.2421875, "learning_rate": 0.0004478534631499521, "loss": 4.9214, "mean_token_accuracy": 0.21241225600242614, "num_tokens": 50650711.0, "step": 29200 }, { "entropy": 5.719288158416748, "epoch": 2.2722427543279515, "grad_norm": 1.171875, "learning_rate": 0.00044783571929505223, "loss": 5.0103, "mean_token_accuracy": 0.19551050215959548, "num_tokens": 50659814.0, "step": 29205 }, { "entropy": 5.685306358337402, "epoch": 2.2726317836996692, "grad_norm": 1.28125, "learning_rate": 0.0004478179728176454, "loss": 4.9534, "mean_token_accuracy": 0.21500717252492904, "num_tokens": 50668340.0, "step": 29210 }, { "entropy": 5.669045734405517, "epoch": 2.273020813071387, "grad_norm": 1.0859375, "learning_rate": 0.0004478002237180009, "loss": 4.933, "mean_token_accuracy": 0.2073628008365631, "num_tokens": 50676847.0, "step": 29215 }, { "entropy": 5.564577245712281, "epoch": 2.2734098424431046, "grad_norm": 1.2421875, "learning_rate": 0.000447782471996388, "loss": 4.9577, "mean_token_accuracy": 0.20473956018686296, "num_tokens": 50685074.0, "step": 29220 }, { "entropy": 5.66311240196228, "epoch": 2.273798871814822, "grad_norm": 1.203125, "learning_rate": 0.0004477647176530762, "loss": 5.0213, "mean_token_accuracy": 0.2006106421351433, "num_tokens": 50693386.0, "step": 29225 }, { "entropy": 5.707943391799927, "epoch": 2.2741879011865396, "grad_norm": 1.375, "learning_rate": 0.0004477469606883347, "loss": 4.9678, "mean_token_accuracy": 0.20750852972269057, "num_tokens": 50701966.0, "step": 29230 }, { "entropy": 5.643072843551636, "epoch": 2.2745769305582573, "grad_norm": 1.1875, "learning_rate": 0.0004477292011024331, "loss": 4.939, "mean_token_accuracy": 0.2073850691318512, "num_tokens": 50710630.0, "step": 29235 }, { "entropy": 5.621211338043213, "epoch": 2.2749659599299745, "grad_norm": 1.296875, "learning_rate": 0.00044771143889564075, "loss": 4.9214, "mean_token_accuracy": 0.2068008616566658, "num_tokens": 50719415.0, "step": 29240 }, { "entropy": 5.647504901885986, "epoch": 2.275354989301692, "grad_norm": 1.1953125, "learning_rate": 0.00044769367406822727, "loss": 4.9108, "mean_token_accuracy": 0.21411840319633485, "num_tokens": 50728064.0, "step": 29245 }, { "entropy": 5.638675117492676, "epoch": 2.27574401867341, "grad_norm": 1.109375, "learning_rate": 0.0004476759066204621, "loss": 4.9709, "mean_token_accuracy": 0.20221103429794313, "num_tokens": 50736978.0, "step": 29250 }, { "entropy": 5.710743045806884, "epoch": 2.2761330480451276, "grad_norm": 1.2421875, "learning_rate": 0.0004476581365526149, "loss": 4.9512, "mean_token_accuracy": 0.2010404258966446, "num_tokens": 50745368.0, "step": 29255 }, { "entropy": 5.670554542541504, "epoch": 2.276522077416845, "grad_norm": 1.140625, "learning_rate": 0.0004476403638649553, "loss": 4.9322, "mean_token_accuracy": 0.2121422693133354, "num_tokens": 50753765.0, "step": 29260 }, { "entropy": 5.719062042236328, "epoch": 2.2769111067885626, "grad_norm": 1.25, "learning_rate": 0.00044762258855775294, "loss": 5.0229, "mean_token_accuracy": 0.1960684284567833, "num_tokens": 50762165.0, "step": 29265 }, { "entropy": 5.686937475204468, "epoch": 2.2773001361602803, "grad_norm": 1.1484375, "learning_rate": 0.00044760481063127754, "loss": 5.0485, "mean_token_accuracy": 0.19887642115354537, "num_tokens": 50771837.0, "step": 29270 }, { "entropy": 5.723100090026856, "epoch": 2.2776891655319975, "grad_norm": 1.1328125, "learning_rate": 0.000447587030085799, "loss": 5.0186, "mean_token_accuracy": 0.1958613157272339, "num_tokens": 50781518.0, "step": 29275 }, { "entropy": 5.729070615768433, "epoch": 2.278078194903715, "grad_norm": 1.2265625, "learning_rate": 0.00044756924692158684, "loss": 4.972, "mean_token_accuracy": 0.2055283546447754, "num_tokens": 50790708.0, "step": 29280 }, { "entropy": 5.716708421707153, "epoch": 2.278467224275433, "grad_norm": 1.1953125, "learning_rate": 0.0004475514611389111, "loss": 5.0187, "mean_token_accuracy": 0.19547039419412612, "num_tokens": 50798783.0, "step": 29285 }, { "entropy": 5.648603773117065, "epoch": 2.2788562536471506, "grad_norm": 1.2890625, "learning_rate": 0.0004475336727380415, "loss": 4.9099, "mean_token_accuracy": 0.20721255093812943, "num_tokens": 50807033.0, "step": 29290 }, { "entropy": 5.6140296459198, "epoch": 2.279245283018868, "grad_norm": 1.234375, "learning_rate": 0.0004475158817192481, "loss": 4.8639, "mean_token_accuracy": 0.20810760855674743, "num_tokens": 50815548.0, "step": 29295 }, { "entropy": 5.667062616348266, "epoch": 2.2796343123905856, "grad_norm": 1.2578125, "learning_rate": 0.00044749808808280077, "loss": 5.0256, "mean_token_accuracy": 0.20056438595056533, "num_tokens": 50824268.0, "step": 29300 }, { "entropy": 5.636796379089356, "epoch": 2.280023341762303, "grad_norm": 1.1328125, "learning_rate": 0.00044748029182896956, "loss": 4.8804, "mean_token_accuracy": 0.21269731521606444, "num_tokens": 50833136.0, "step": 29305 }, { "entropy": 5.717582511901855, "epoch": 2.2804123711340205, "grad_norm": 1.15625, "learning_rate": 0.0004474624929580243, "loss": 5.0666, "mean_token_accuracy": 0.20039977133274078, "num_tokens": 50841911.0, "step": 29310 }, { "entropy": 5.763882446289062, "epoch": 2.280801400505738, "grad_norm": 1.2578125, "learning_rate": 0.0004474446914702354, "loss": 5.1607, "mean_token_accuracy": 0.19453497231006622, "num_tokens": 50850402.0, "step": 29315 }, { "entropy": 5.743761396408081, "epoch": 2.281190429877456, "grad_norm": 1.2109375, "learning_rate": 0.0004474268873658727, "loss": 5.0077, "mean_token_accuracy": 0.20701247155666352, "num_tokens": 50858473.0, "step": 29320 }, { "entropy": 5.682760095596313, "epoch": 2.281579459249173, "grad_norm": 1.2109375, "learning_rate": 0.0004474090806452064, "loss": 4.8655, "mean_token_accuracy": 0.21088151037693023, "num_tokens": 50866798.0, "step": 29325 }, { "entropy": 5.611558628082276, "epoch": 2.281968488620891, "grad_norm": 1.109375, "learning_rate": 0.00044739127130850675, "loss": 4.9399, "mean_token_accuracy": 0.20795606076717377, "num_tokens": 50875279.0, "step": 29330 }, { "entropy": 5.587212800979614, "epoch": 2.2823575179926086, "grad_norm": 1.078125, "learning_rate": 0.00044737345935604397, "loss": 4.8526, "mean_token_accuracy": 0.21364329755306244, "num_tokens": 50884021.0, "step": 29335 }, { "entropy": 5.641113758087158, "epoch": 2.282746547364326, "grad_norm": 1.2421875, "learning_rate": 0.0004473556447880883, "loss": 4.931, "mean_token_accuracy": 0.20787459015846252, "num_tokens": 50891722.0, "step": 29340 }, { "entropy": 5.652460145950317, "epoch": 2.2831355767360435, "grad_norm": 1.25, "learning_rate": 0.00044733782760490997, "loss": 4.9992, "mean_token_accuracy": 0.20746834576129913, "num_tokens": 50900985.0, "step": 29345 }, { "entropy": 5.7493476390838625, "epoch": 2.283524606107761, "grad_norm": 1.21875, "learning_rate": 0.0004473200078067795, "loss": 5.0538, "mean_token_accuracy": 0.19229193925857543, "num_tokens": 50909750.0, "step": 29350 }, { "entropy": 5.70711579322815, "epoch": 2.283913635479479, "grad_norm": 1.1875, "learning_rate": 0.00044730218539396717, "loss": 5.0358, "mean_token_accuracy": 0.19634565711021423, "num_tokens": 50918563.0, "step": 29355 }, { "entropy": 5.705563402175903, "epoch": 2.284302664851196, "grad_norm": 1.140625, "learning_rate": 0.0004472843603667434, "loss": 5.0611, "mean_token_accuracy": 0.19420569241046906, "num_tokens": 50927503.0, "step": 29360 }, { "entropy": 5.6836799621582035, "epoch": 2.284691694222914, "grad_norm": 1.2890625, "learning_rate": 0.00044726653272537866, "loss": 4.9111, "mean_token_accuracy": 0.20580336302518845, "num_tokens": 50936198.0, "step": 29365 }, { "entropy": 5.640719699859619, "epoch": 2.2850807235946315, "grad_norm": 1.15625, "learning_rate": 0.0004472487024701435, "loss": 4.9601, "mean_token_accuracy": 0.20001407861709594, "num_tokens": 50945589.0, "step": 29370 }, { "entropy": 5.6910412311553955, "epoch": 2.285469752966349, "grad_norm": 1.265625, "learning_rate": 0.0004472308696013085, "loss": 4.9428, "mean_token_accuracy": 0.20660582333803176, "num_tokens": 50953524.0, "step": 29375 }, { "entropy": 5.660364103317261, "epoch": 2.2858587823380665, "grad_norm": 1.2578125, "learning_rate": 0.0004472130341191441, "loss": 4.9974, "mean_token_accuracy": 0.19695830941200257, "num_tokens": 50962127.0, "step": 29380 }, { "entropy": 5.674199438095092, "epoch": 2.286247811709784, "grad_norm": 1.1484375, "learning_rate": 0.0004471951960239211, "loss": 4.9906, "mean_token_accuracy": 0.20924903452396393, "num_tokens": 50970662.0, "step": 29385 }, { "entropy": 5.62126989364624, "epoch": 2.286636841081502, "grad_norm": 1.3046875, "learning_rate": 0.00044717735531591, "loss": 4.907, "mean_token_accuracy": 0.21659059226512908, "num_tokens": 50979182.0, "step": 29390 }, { "entropy": 5.645257663726807, "epoch": 2.287025870453219, "grad_norm": 1.3046875, "learning_rate": 0.00044715951199538156, "loss": 5.0522, "mean_token_accuracy": 0.2010616198182106, "num_tokens": 50987285.0, "step": 29395 }, { "entropy": 5.728281259536743, "epoch": 2.287414899824937, "grad_norm": 1.140625, "learning_rate": 0.00044714166606260657, "loss": 4.9988, "mean_token_accuracy": 0.2040303722023964, "num_tokens": 50995988.0, "step": 29400 }, { "entropy": 5.695654726028442, "epoch": 2.2878039291966545, "grad_norm": 1.2578125, "learning_rate": 0.0004471238175178559, "loss": 4.9128, "mean_token_accuracy": 0.20964858531951905, "num_tokens": 51003963.0, "step": 29405 }, { "entropy": 5.6442742347717285, "epoch": 2.288192958568372, "grad_norm": 1.21875, "learning_rate": 0.0004471059663614002, "loss": 4.944, "mean_token_accuracy": 0.20699535459280013, "num_tokens": 51012429.0, "step": 29410 }, { "entropy": 5.698700380325318, "epoch": 2.2885819879400895, "grad_norm": 1.203125, "learning_rate": 0.0004470881125935103, "loss": 4.9934, "mean_token_accuracy": 0.20297883152961732, "num_tokens": 51021321.0, "step": 29415 }, { "entropy": 5.659265613555908, "epoch": 2.288971017311807, "grad_norm": 1.2578125, "learning_rate": 0.00044707025621445735, "loss": 4.9091, "mean_token_accuracy": 0.20679204016923905, "num_tokens": 51029713.0, "step": 29420 }, { "entropy": 5.62908673286438, "epoch": 2.2893600466835244, "grad_norm": 1.1953125, "learning_rate": 0.00044705239722451194, "loss": 4.991, "mean_token_accuracy": 0.19886668920516967, "num_tokens": 51038832.0, "step": 29425 }, { "entropy": 5.676464176177978, "epoch": 2.289749076055242, "grad_norm": 1.1875, "learning_rate": 0.00044703453562394544, "loss": 4.9101, "mean_token_accuracy": 0.2095553994178772, "num_tokens": 51046786.0, "step": 29430 }, { "entropy": 5.668743515014649, "epoch": 2.29013810542696, "grad_norm": 1.28125, "learning_rate": 0.0004470166714130286, "loss": 4.9867, "mean_token_accuracy": 0.20124735981225966, "num_tokens": 51054855.0, "step": 29435 }, { "entropy": 5.704729461669922, "epoch": 2.290527134798677, "grad_norm": 1.203125, "learning_rate": 0.00044699880459203264, "loss": 5.1051, "mean_token_accuracy": 0.19765823036432267, "num_tokens": 51063098.0, "step": 29440 }, { "entropy": 5.609183692932129, "epoch": 2.290916164170395, "grad_norm": 1.21875, "learning_rate": 0.00044698093516122844, "loss": 4.8632, "mean_token_accuracy": 0.2103952094912529, "num_tokens": 51071140.0, "step": 29445 }, { "entropy": 5.685305738449097, "epoch": 2.2913051935421125, "grad_norm": 1.28125, "learning_rate": 0.0004469630631208874, "loss": 4.9981, "mean_token_accuracy": 0.20605371594429017, "num_tokens": 51079698.0, "step": 29450 }, { "entropy": 5.6857048034667965, "epoch": 2.29169422291383, "grad_norm": 1.296875, "learning_rate": 0.0004469451884712805, "loss": 5.0064, "mean_token_accuracy": 0.19912643283605574, "num_tokens": 51088900.0, "step": 29455 }, { "entropy": 5.6442934513092045, "epoch": 2.2920832522855474, "grad_norm": 1.25, "learning_rate": 0.0004469273112126791, "loss": 4.915, "mean_token_accuracy": 0.20659647285938262, "num_tokens": 51098289.0, "step": 29460 }, { "entropy": 5.713879346847534, "epoch": 2.292472281657265, "grad_norm": 1.1875, "learning_rate": 0.00044690943134535445, "loss": 4.9491, "mean_token_accuracy": 0.20632078051567077, "num_tokens": 51106795.0, "step": 29465 }, { "entropy": 5.664603757858276, "epoch": 2.292861311028983, "grad_norm": 1.2109375, "learning_rate": 0.0004468915488695777, "loss": 4.9553, "mean_token_accuracy": 0.21067133396863938, "num_tokens": 51115329.0, "step": 29470 }, { "entropy": 5.584689950942993, "epoch": 2.2932503404007, "grad_norm": 1.1640625, "learning_rate": 0.00044687366378562036, "loss": 4.9467, "mean_token_accuracy": 0.2085829943418503, "num_tokens": 51124215.0, "step": 29475 }, { "entropy": 5.67822494506836, "epoch": 2.293639369772418, "grad_norm": 1.203125, "learning_rate": 0.00044685577609375373, "loss": 5.0121, "mean_token_accuracy": 0.2010206863284111, "num_tokens": 51132528.0, "step": 29480 }, { "entropy": 5.7057780742645265, "epoch": 2.2940283991441355, "grad_norm": 1.2109375, "learning_rate": 0.0004468378857942492, "loss": 5.0592, "mean_token_accuracy": 0.19950395971536636, "num_tokens": 51140726.0, "step": 29485 }, { "entropy": 5.668741273880005, "epoch": 2.294417428515853, "grad_norm": 1.109375, "learning_rate": 0.00044681999288737826, "loss": 4.9613, "mean_token_accuracy": 0.20710641890764236, "num_tokens": 51149312.0, "step": 29490 }, { "entropy": 5.738743925094605, "epoch": 2.2948064578875704, "grad_norm": 1.25, "learning_rate": 0.00044680209737341244, "loss": 5.0698, "mean_token_accuracy": 0.20054165571928023, "num_tokens": 51157464.0, "step": 29495 }, { "entropy": 5.596065807342529, "epoch": 2.295195487259288, "grad_norm": 1.125, "learning_rate": 0.0004467841992526233, "loss": 4.8965, "mean_token_accuracy": 0.21182748377323152, "num_tokens": 51166331.0, "step": 29500 }, { "entropy": 5.709439992904663, "epoch": 2.295584516631006, "grad_norm": 1.3046875, "learning_rate": 0.00044676629852528226, "loss": 4.9855, "mean_token_accuracy": 0.20559597611427308, "num_tokens": 51174404.0, "step": 29505 }, { "entropy": 5.590991497039795, "epoch": 2.295973546002723, "grad_norm": 1.328125, "learning_rate": 0.00044674839519166104, "loss": 4.8118, "mean_token_accuracy": 0.21411324441432952, "num_tokens": 51182650.0, "step": 29510 }, { "entropy": 5.658941078186035, "epoch": 2.2963625753744408, "grad_norm": 1.15625, "learning_rate": 0.00044673048925203136, "loss": 4.9925, "mean_token_accuracy": 0.20682897418737411, "num_tokens": 51192107.0, "step": 29515 }, { "entropy": 5.633910274505615, "epoch": 2.2967516047461585, "grad_norm": 1.203125, "learning_rate": 0.00044671258070666476, "loss": 4.9424, "mean_token_accuracy": 0.2035682499408722, "num_tokens": 51200506.0, "step": 29520 }, { "entropy": 5.643165206909179, "epoch": 2.2971406341178757, "grad_norm": 1.078125, "learning_rate": 0.0004466946695558331, "loss": 4.9017, "mean_token_accuracy": 0.2080647975206375, "num_tokens": 51209442.0, "step": 29525 }, { "entropy": 5.640188360214234, "epoch": 2.2975296634895934, "grad_norm": 1.234375, "learning_rate": 0.00044667675579980817, "loss": 4.9538, "mean_token_accuracy": 0.20829664766788483, "num_tokens": 51217520.0, "step": 29530 }, { "entropy": 5.714216804504394, "epoch": 2.297918692861311, "grad_norm": 1.1953125, "learning_rate": 0.0004466588394388616, "loss": 5.0673, "mean_token_accuracy": 0.1982514351606369, "num_tokens": 51226228.0, "step": 29535 }, { "entropy": 5.722377729415894, "epoch": 2.2983077222330284, "grad_norm": 1.1015625, "learning_rate": 0.0004466409204732654, "loss": 5.0366, "mean_token_accuracy": 0.19937701374292374, "num_tokens": 51235271.0, "step": 29540 }, { "entropy": 5.6800010204315186, "epoch": 2.298696751604746, "grad_norm": 1.1875, "learning_rate": 0.00044662299890329144, "loss": 4.9347, "mean_token_accuracy": 0.20930553376674652, "num_tokens": 51243927.0, "step": 29545 }, { "entropy": 5.716444587707519, "epoch": 2.2990857809764638, "grad_norm": 1.5859375, "learning_rate": 0.0004466050747292116, "loss": 4.9911, "mean_token_accuracy": 0.20874708592891694, "num_tokens": 51253097.0, "step": 29550 }, { "entropy": 5.700059080123902, "epoch": 2.2994748103481815, "grad_norm": 1.203125, "learning_rate": 0.000446587147951298, "loss": 4.974, "mean_token_accuracy": 0.21077580153942108, "num_tokens": 51261275.0, "step": 29555 }, { "entropy": 5.7232996940612795, "epoch": 2.2998638397198987, "grad_norm": 1.171875, "learning_rate": 0.0004465692185698224, "loss": 5.0456, "mean_token_accuracy": 0.2015722408890724, "num_tokens": 51269698.0, "step": 29560 }, { "entropy": 5.677764368057251, "epoch": 2.3002528690916164, "grad_norm": 1.234375, "learning_rate": 0.00044655128658505717, "loss": 4.8997, "mean_token_accuracy": 0.21314503848552704, "num_tokens": 51277850.0, "step": 29565 }, { "entropy": 5.675246667861939, "epoch": 2.300641898463334, "grad_norm": 1.1640625, "learning_rate": 0.0004465333519972741, "loss": 4.9362, "mean_token_accuracy": 0.20378548055887222, "num_tokens": 51285919.0, "step": 29570 }, { "entropy": 5.627280569076538, "epoch": 2.3010309278350514, "grad_norm": 1.1640625, "learning_rate": 0.0004465154148067454, "loss": 4.994, "mean_token_accuracy": 0.20773849934339522, "num_tokens": 51294403.0, "step": 29575 }, { "entropy": 5.72062120437622, "epoch": 2.301419957206769, "grad_norm": 1.171875, "learning_rate": 0.00044649747501374336, "loss": 5.0218, "mean_token_accuracy": 0.200177863240242, "num_tokens": 51302820.0, "step": 29580 }, { "entropy": 5.6623540878295895, "epoch": 2.3018089865784868, "grad_norm": 1.234375, "learning_rate": 0.0004464795326185401, "loss": 4.9726, "mean_token_accuracy": 0.20101991593837737, "num_tokens": 51311385.0, "step": 29585 }, { "entropy": 5.693921947479248, "epoch": 2.3021980159502045, "grad_norm": 1.265625, "learning_rate": 0.0004464615876214078, "loss": 4.9971, "mean_token_accuracy": 0.20579622983932494, "num_tokens": 51320928.0, "step": 29590 }, { "entropy": 5.6376463890075685, "epoch": 2.3025870453219217, "grad_norm": 1.2109375, "learning_rate": 0.0004464436400226188, "loss": 4.9056, "mean_token_accuracy": 0.21090296059846877, "num_tokens": 51329384.0, "step": 29595 }, { "entropy": 5.637345504760742, "epoch": 2.3029760746936394, "grad_norm": 1.1953125, "learning_rate": 0.0004464256898224455, "loss": 4.9662, "mean_token_accuracy": 0.19605169892311097, "num_tokens": 51337765.0, "step": 29600 }, { "entropy": 5.707266044616699, "epoch": 2.303365104065357, "grad_norm": 1.3125, "learning_rate": 0.0004464077370211602, "loss": 4.9746, "mean_token_accuracy": 0.20091103613376618, "num_tokens": 51345947.0, "step": 29605 }, { "entropy": 5.634314107894897, "epoch": 2.3037541334370744, "grad_norm": 1.1953125, "learning_rate": 0.00044638978161903533, "loss": 4.8994, "mean_token_accuracy": 0.2069440320134163, "num_tokens": 51354742.0, "step": 29610 }, { "entropy": 5.604127836227417, "epoch": 2.304143162808792, "grad_norm": 1.1796875, "learning_rate": 0.0004463718236163433, "loss": 4.9174, "mean_token_accuracy": 0.21095461398363113, "num_tokens": 51364208.0, "step": 29615 }, { "entropy": 5.711941051483154, "epoch": 2.3045321921805098, "grad_norm": 1.1953125, "learning_rate": 0.00044635386301335666, "loss": 5.0678, "mean_token_accuracy": 0.1951071172952652, "num_tokens": 51373081.0, "step": 29620 }, { "entropy": 5.6589590549469, "epoch": 2.304921221552227, "grad_norm": 1.25, "learning_rate": 0.0004463358998103478, "loss": 4.9948, "mean_token_accuracy": 0.20808856934309006, "num_tokens": 51382561.0, "step": 29625 }, { "entropy": 5.747188234329224, "epoch": 2.3053102509239447, "grad_norm": 1.234375, "learning_rate": 0.0004463179340075894, "loss": 5.0333, "mean_token_accuracy": 0.19882845431566237, "num_tokens": 51391671.0, "step": 29630 }, { "entropy": 5.6738136291503904, "epoch": 2.3056992802956624, "grad_norm": 1.203125, "learning_rate": 0.0004462999656053541, "loss": 4.9265, "mean_token_accuracy": 0.21113624125719072, "num_tokens": 51400727.0, "step": 29635 }, { "entropy": 5.7056365489959715, "epoch": 2.3060883096673797, "grad_norm": 1.234375, "learning_rate": 0.00044628199460391445, "loss": 5.0285, "mean_token_accuracy": 0.20389365404844284, "num_tokens": 51409943.0, "step": 29640 }, { "entropy": 5.7019366264343265, "epoch": 2.3064773390390974, "grad_norm": 1.2109375, "learning_rate": 0.00044626402100354307, "loss": 5.0841, "mean_token_accuracy": 0.19714421927928924, "num_tokens": 51418511.0, "step": 29645 }, { "entropy": 5.627450942993164, "epoch": 2.306866368410815, "grad_norm": 1.1953125, "learning_rate": 0.0004462460448045129, "loss": 4.9377, "mean_token_accuracy": 0.2087765797972679, "num_tokens": 51426304.0, "step": 29650 }, { "entropy": 5.728614950180054, "epoch": 2.3072553977825327, "grad_norm": 1.15625, "learning_rate": 0.00044622806600709645, "loss": 5.0315, "mean_token_accuracy": 0.2027894675731659, "num_tokens": 51434779.0, "step": 29655 }, { "entropy": 5.702666711807251, "epoch": 2.30764442715425, "grad_norm": 1.0859375, "learning_rate": 0.0004462100846115667, "loss": 4.9893, "mean_token_accuracy": 0.20998079478740692, "num_tokens": 51444275.0, "step": 29660 }, { "entropy": 5.693739891052246, "epoch": 2.3080334565259677, "grad_norm": 1.140625, "learning_rate": 0.0004461921006181964, "loss": 5.0146, "mean_token_accuracy": 0.1941279098391533, "num_tokens": 51453149.0, "step": 29665 }, { "entropy": 5.640100193023682, "epoch": 2.3084224858976854, "grad_norm": 1.1953125, "learning_rate": 0.0004461741140272584, "loss": 4.9899, "mean_token_accuracy": 0.21241578310728074, "num_tokens": 51462302.0, "step": 29670 }, { "entropy": 5.7431440353393555, "epoch": 2.3088115152694026, "grad_norm": 1.1953125, "learning_rate": 0.0004461561248390257, "loss": 5.0469, "mean_token_accuracy": 0.1939299449324608, "num_tokens": 51471186.0, "step": 29675 }, { "entropy": 5.708998441696167, "epoch": 2.3092005446411203, "grad_norm": 1.171875, "learning_rate": 0.0004461381330537713, "loss": 5.014, "mean_token_accuracy": 0.2039850041270256, "num_tokens": 51479868.0, "step": 29680 }, { "entropy": 5.627441549301148, "epoch": 2.309589574012838, "grad_norm": 1.1484375, "learning_rate": 0.000446120138671768, "loss": 4.8863, "mean_token_accuracy": 0.21468706727027892, "num_tokens": 51489118.0, "step": 29685 }, { "entropy": 5.646005630493164, "epoch": 2.3099786033845557, "grad_norm": 1.1875, "learning_rate": 0.00044610214169328913, "loss": 4.9576, "mean_token_accuracy": 0.2100711077451706, "num_tokens": 51497933.0, "step": 29690 }, { "entropy": 5.728327989578247, "epoch": 2.310367632756273, "grad_norm": 1.1953125, "learning_rate": 0.0004460841421186075, "loss": 5.0086, "mean_token_accuracy": 0.20364754050970077, "num_tokens": 51507046.0, "step": 29695 }, { "entropy": 5.7412364959716795, "epoch": 2.3107566621279907, "grad_norm": 1.2734375, "learning_rate": 0.0004460661399479963, "loss": 5.0004, "mean_token_accuracy": 0.20241497009992598, "num_tokens": 51516558.0, "step": 29700 }, { "entropy": 5.60744161605835, "epoch": 2.3111456914997084, "grad_norm": 1.265625, "learning_rate": 0.00044604813518172876, "loss": 4.8855, "mean_token_accuracy": 0.21453197449445724, "num_tokens": 51524411.0, "step": 29705 }, { "entropy": 5.6554053783416744, "epoch": 2.3115347208714256, "grad_norm": 1.1953125, "learning_rate": 0.00044603012782007796, "loss": 4.9955, "mean_token_accuracy": 0.19071310013532639, "num_tokens": 51533121.0, "step": 29710 }, { "entropy": 5.727372789382935, "epoch": 2.3119237502431433, "grad_norm": 1.140625, "learning_rate": 0.0004460121178633172, "loss": 5.0026, "mean_token_accuracy": 0.20584928691387178, "num_tokens": 51541417.0, "step": 29715 }, { "entropy": 5.705511426925659, "epoch": 2.312312779614861, "grad_norm": 1.1640625, "learning_rate": 0.00044599410531171986, "loss": 4.9503, "mean_token_accuracy": 0.21235573142766953, "num_tokens": 51549444.0, "step": 29720 }, { "entropy": 5.6956254005432125, "epoch": 2.3127018089865787, "grad_norm": 1.2734375, "learning_rate": 0.000445976090165559, "loss": 5.0691, "mean_token_accuracy": 0.20455804616212844, "num_tokens": 51558090.0, "step": 29725 }, { "entropy": 5.715270185470581, "epoch": 2.313090838358296, "grad_norm": 1.2109375, "learning_rate": 0.0004459580724251082, "loss": 5.0617, "mean_token_accuracy": 0.19622394144535066, "num_tokens": 51566794.0, "step": 29730 }, { "entropy": 5.645463991165161, "epoch": 2.3134798677300137, "grad_norm": 1.1953125, "learning_rate": 0.00044594005209064064, "loss": 4.9327, "mean_token_accuracy": 0.2100861683487892, "num_tokens": 51575411.0, "step": 29735 }, { "entropy": 5.666761827468872, "epoch": 2.313868897101731, "grad_norm": 1.171875, "learning_rate": 0.00044592202916243003, "loss": 4.9934, "mean_token_accuracy": 0.20125658363103865, "num_tokens": 51584438.0, "step": 29740 }, { "entropy": 5.690891122817993, "epoch": 2.3142579264734486, "grad_norm": 1.2109375, "learning_rate": 0.0004459040036407495, "loss": 4.9806, "mean_token_accuracy": 0.20659251064062117, "num_tokens": 51593517.0, "step": 29745 }, { "entropy": 5.721340179443359, "epoch": 2.3146469558451663, "grad_norm": 1.1796875, "learning_rate": 0.0004458859755258729, "loss": 5.0227, "mean_token_accuracy": 0.19948753118515014, "num_tokens": 51602312.0, "step": 29750 }, { "entropy": 5.646225357055664, "epoch": 2.315035985216884, "grad_norm": 1.1484375, "learning_rate": 0.00044586794481807357, "loss": 4.9145, "mean_token_accuracy": 0.2131629019975662, "num_tokens": 51611021.0, "step": 29755 }, { "entropy": 5.670703744888305, "epoch": 2.3154250145886013, "grad_norm": 1.09375, "learning_rate": 0.00044584991151762506, "loss": 5.0087, "mean_token_accuracy": 0.19905434399843216, "num_tokens": 51620322.0, "step": 29760 }, { "entropy": 5.679303359985352, "epoch": 2.315814043960319, "grad_norm": 1.203125, "learning_rate": 0.0004458318756248011, "loss": 4.955, "mean_token_accuracy": 0.20841413289308547, "num_tokens": 51628626.0, "step": 29765 }, { "entropy": 5.6438233852386475, "epoch": 2.3162030733320367, "grad_norm": 1.125, "learning_rate": 0.00044581383713987547, "loss": 4.9371, "mean_token_accuracy": 0.206404709815979, "num_tokens": 51637868.0, "step": 29770 }, { "entropy": 5.677783060073852, "epoch": 2.316592102703754, "grad_norm": 1.21875, "learning_rate": 0.0004457957960631216, "loss": 4.9401, "mean_token_accuracy": 0.19979055523872374, "num_tokens": 51645756.0, "step": 29775 }, { "entropy": 5.686946439743042, "epoch": 2.3169811320754716, "grad_norm": 1.2421875, "learning_rate": 0.0004457777523948134, "loss": 5.0308, "mean_token_accuracy": 0.19773966670036316, "num_tokens": 51654959.0, "step": 29780 }, { "entropy": 5.730661153793335, "epoch": 2.3173701614471893, "grad_norm": 1.28125, "learning_rate": 0.0004457597061352247, "loss": 5.0177, "mean_token_accuracy": 0.20315161645412444, "num_tokens": 51663208.0, "step": 29785 }, { "entropy": 5.67718915939331, "epoch": 2.317759190818907, "grad_norm": 1.1484375, "learning_rate": 0.0004457416572846291, "loss": 5.0327, "mean_token_accuracy": 0.19555943310260773, "num_tokens": 51671627.0, "step": 29790 }, { "entropy": 5.580002927780152, "epoch": 2.3181482201906243, "grad_norm": 1.171875, "learning_rate": 0.0004457236058433008, "loss": 4.9059, "mean_token_accuracy": 0.21396319717168807, "num_tokens": 51680870.0, "step": 29795 }, { "entropy": 5.725226163864136, "epoch": 2.318537249562342, "grad_norm": 1.2265625, "learning_rate": 0.00044570555181151333, "loss": 5.067, "mean_token_accuracy": 0.2020721137523651, "num_tokens": 51690566.0, "step": 29800 }, { "entropy": 5.738865995407105, "epoch": 2.3189262789340597, "grad_norm": 1.265625, "learning_rate": 0.000445687495189541, "loss": 5.0568, "mean_token_accuracy": 0.202095665037632, "num_tokens": 51698792.0, "step": 29805 }, { "entropy": 5.702034139633179, "epoch": 2.319315308305777, "grad_norm": 1.25, "learning_rate": 0.00044566943597765745, "loss": 4.9999, "mean_token_accuracy": 0.20268235504627227, "num_tokens": 51707821.0, "step": 29810 }, { "entropy": 5.614001607894897, "epoch": 2.3197043376774946, "grad_norm": 1.2578125, "learning_rate": 0.00044565137417613694, "loss": 4.9398, "mean_token_accuracy": 0.21043990701436996, "num_tokens": 51716802.0, "step": 29815 }, { "entropy": 5.631481027603149, "epoch": 2.3200933670492123, "grad_norm": 1.1484375, "learning_rate": 0.0004456333097852534, "loss": 4.9733, "mean_token_accuracy": 0.20525504648685455, "num_tokens": 51725644.0, "step": 29820 }, { "entropy": 5.767790460586548, "epoch": 2.32048239642093, "grad_norm": 1.2421875, "learning_rate": 0.00044561524280528104, "loss": 5.0689, "mean_token_accuracy": 0.2001355528831482, "num_tokens": 51734072.0, "step": 29825 }, { "entropy": 5.753585004806519, "epoch": 2.3208714257926473, "grad_norm": 1.2109375, "learning_rate": 0.00044559717323649383, "loss": 5.0298, "mean_token_accuracy": 0.20246124118566514, "num_tokens": 51743112.0, "step": 29830 }, { "entropy": 5.688465690612793, "epoch": 2.321260455164365, "grad_norm": 1.234375, "learning_rate": 0.0004455791010791662, "loss": 5.0023, "mean_token_accuracy": 0.19709151089191437, "num_tokens": 51752535.0, "step": 29835 }, { "entropy": 5.650733852386475, "epoch": 2.3216494845360827, "grad_norm": 1.2265625, "learning_rate": 0.0004455610263335721, "loss": 4.964, "mean_token_accuracy": 0.20490653365850447, "num_tokens": 51760595.0, "step": 29840 }, { "entropy": 5.693766164779663, "epoch": 2.3220385139078, "grad_norm": 1.234375, "learning_rate": 0.0004455429489999859, "loss": 5.0311, "mean_token_accuracy": 0.20339571237564086, "num_tokens": 51769156.0, "step": 29845 }, { "entropy": 5.712511682510376, "epoch": 2.3224275432795176, "grad_norm": 1.203125, "learning_rate": 0.00044552486907868194, "loss": 4.9604, "mean_token_accuracy": 0.19889048784971236, "num_tokens": 51778091.0, "step": 29850 }, { "entropy": 5.71105432510376, "epoch": 2.3228165726512353, "grad_norm": 1.15625, "learning_rate": 0.00044550678656993454, "loss": 4.9927, "mean_token_accuracy": 0.20504614412784578, "num_tokens": 51787207.0, "step": 29855 }, { "entropy": 5.602202320098877, "epoch": 2.3232056020229526, "grad_norm": 1.1328125, "learning_rate": 0.000445488701474018, "loss": 4.8766, "mean_token_accuracy": 0.2146499425172806, "num_tokens": 51796158.0, "step": 29860 }, { "entropy": 5.60244927406311, "epoch": 2.3235946313946703, "grad_norm": 1.15625, "learning_rate": 0.0004454706137912067, "loss": 4.8624, "mean_token_accuracy": 0.2160656124353409, "num_tokens": 51803762.0, "step": 29865 }, { "entropy": 5.689759826660156, "epoch": 2.323983660766388, "grad_norm": 1.25, "learning_rate": 0.0004454525235217753, "loss": 4.9991, "mean_token_accuracy": 0.2027082324028015, "num_tokens": 51812610.0, "step": 29870 }, { "entropy": 5.619351625442505, "epoch": 2.324372690138105, "grad_norm": 1.1640625, "learning_rate": 0.00044543443066599807, "loss": 4.9966, "mean_token_accuracy": 0.1987100973725319, "num_tokens": 51821398.0, "step": 29875 }, { "entropy": 5.6689369678497314, "epoch": 2.324761719509823, "grad_norm": 1.203125, "learning_rate": 0.0004454163352241498, "loss": 4.9649, "mean_token_accuracy": 0.20030777305364608, "num_tokens": 51829945.0, "step": 29880 }, { "entropy": 5.6818708896636965, "epoch": 2.3251507488815406, "grad_norm": 1.265625, "learning_rate": 0.00044539823719650463, "loss": 4.986, "mean_token_accuracy": 0.20501626282930374, "num_tokens": 51838816.0, "step": 29885 }, { "entropy": 5.655139017105102, "epoch": 2.3255397782532583, "grad_norm": 1.2421875, "learning_rate": 0.0004453801365833376, "loss": 5.0068, "mean_token_accuracy": 0.20584442913532258, "num_tokens": 51847775.0, "step": 29890 }, { "entropy": 5.703698062896729, "epoch": 2.3259288076249756, "grad_norm": 1.2421875, "learning_rate": 0.00044536203338492317, "loss": 4.9649, "mean_token_accuracy": 0.2018238216638565, "num_tokens": 51856934.0, "step": 29895 }, { "entropy": 5.753639268875122, "epoch": 2.3263178369966933, "grad_norm": 1.125, "learning_rate": 0.00044534392760153596, "loss": 5.0242, "mean_token_accuracy": 0.19219578355550765, "num_tokens": 51865393.0, "step": 29900 }, { "entropy": 5.6787642478942875, "epoch": 2.326706866368411, "grad_norm": 1.1875, "learning_rate": 0.0004453258192334508, "loss": 4.9426, "mean_token_accuracy": 0.21065413653850557, "num_tokens": 51873783.0, "step": 29905 }, { "entropy": 5.6314377784729, "epoch": 2.327095895740128, "grad_norm": 1.1953125, "learning_rate": 0.0004453077082809425, "loss": 5.0517, "mean_token_accuracy": 0.19531965702772142, "num_tokens": 51882934.0, "step": 29910 }, { "entropy": 5.662451362609863, "epoch": 2.327484925111846, "grad_norm": 1.265625, "learning_rate": 0.00044528959474428575, "loss": 4.9603, "mean_token_accuracy": 0.206140872836113, "num_tokens": 51891217.0, "step": 29915 }, { "entropy": 5.762398147583008, "epoch": 2.3278739544835636, "grad_norm": 1.1484375, "learning_rate": 0.0004452714786237555, "loss": 5.0287, "mean_token_accuracy": 0.20356839448213576, "num_tokens": 51900550.0, "step": 29920 }, { "entropy": 5.6939483165740965, "epoch": 2.3282629838552813, "grad_norm": 1.234375, "learning_rate": 0.0004452533599196265, "loss": 5.0013, "mean_token_accuracy": 0.20040316134691238, "num_tokens": 51908436.0, "step": 29925 }, { "entropy": 5.698268461227417, "epoch": 2.3286520132269986, "grad_norm": 1.1796875, "learning_rate": 0.00044523523863217374, "loss": 5.0186, "mean_token_accuracy": 0.2082355096936226, "num_tokens": 51917687.0, "step": 29930 }, { "entropy": 5.663577032089234, "epoch": 2.3290410425987162, "grad_norm": 1.1875, "learning_rate": 0.0004452171147616723, "loss": 5.0328, "mean_token_accuracy": 0.19966304153203965, "num_tokens": 51927011.0, "step": 29935 }, { "entropy": 5.753925609588623, "epoch": 2.329430071970434, "grad_norm": 1.2265625, "learning_rate": 0.000445198988308397, "loss": 5.0462, "mean_token_accuracy": 0.19823441207408904, "num_tokens": 51936255.0, "step": 29940 }, { "entropy": 5.706807947158813, "epoch": 2.329819101342151, "grad_norm": 1.265625, "learning_rate": 0.00044518085927262293, "loss": 5.0129, "mean_token_accuracy": 0.20164269655942918, "num_tokens": 51944919.0, "step": 29945 }, { "entropy": 5.735382747650147, "epoch": 2.330208130713869, "grad_norm": 1.265625, "learning_rate": 0.0004451627276546252, "loss": 5.0579, "mean_token_accuracy": 0.1996244266629219, "num_tokens": 51952963.0, "step": 29950 }, { "entropy": 5.669949293136597, "epoch": 2.3305971600855866, "grad_norm": 1.171875, "learning_rate": 0.000445144593454679, "loss": 4.9336, "mean_token_accuracy": 0.21079327762126923, "num_tokens": 51961493.0, "step": 29955 }, { "entropy": 5.625239658355713, "epoch": 2.330986189457304, "grad_norm": 1.1953125, "learning_rate": 0.0004451264566730593, "loss": 5.0391, "mean_token_accuracy": 0.20124550610780717, "num_tokens": 51969911.0, "step": 29960 }, { "entropy": 5.6693767547607425, "epoch": 2.3313752188290215, "grad_norm": 1.2890625, "learning_rate": 0.00044510831731004146, "loss": 4.9425, "mean_token_accuracy": 0.20504836291074752, "num_tokens": 51978936.0, "step": 29965 }, { "entropy": 5.775884056091309, "epoch": 2.3317642482007392, "grad_norm": 1.203125, "learning_rate": 0.0004450901753659007, "loss": 5.0021, "mean_token_accuracy": 0.19900544732809067, "num_tokens": 51987373.0, "step": 29970 }, { "entropy": 5.739943885803223, "epoch": 2.3321532775724565, "grad_norm": 1.1640625, "learning_rate": 0.00044507203084091215, "loss": 5.034, "mean_token_accuracy": 0.19644529819488527, "num_tokens": 51995948.0, "step": 29975 }, { "entropy": 5.711586046218872, "epoch": 2.332542306944174, "grad_norm": 1.1875, "learning_rate": 0.0004450538837353513, "loss": 5.0033, "mean_token_accuracy": 0.20221030414104463, "num_tokens": 52004623.0, "step": 29980 }, { "entropy": 5.705402565002442, "epoch": 2.332931336315892, "grad_norm": 1.203125, "learning_rate": 0.00044503573404949343, "loss": 4.9812, "mean_token_accuracy": 0.20991357564926147, "num_tokens": 52012971.0, "step": 29985 }, { "entropy": 5.7202362537384035, "epoch": 2.3333203656876096, "grad_norm": 1.234375, "learning_rate": 0.0004450175817836139, "loss": 5.0439, "mean_token_accuracy": 0.19709892570972443, "num_tokens": 52021462.0, "step": 29990 }, { "entropy": 5.672994327545166, "epoch": 2.333709395059327, "grad_norm": 1.171875, "learning_rate": 0.00044499942693798823, "loss": 4.9326, "mean_token_accuracy": 0.20077921450138092, "num_tokens": 52030494.0, "step": 29995 }, { "entropy": 5.668137693405152, "epoch": 2.3340984244310445, "grad_norm": 1.2421875, "learning_rate": 0.0004449812695128918, "loss": 4.9387, "mean_token_accuracy": 0.20577506572008133, "num_tokens": 52039120.0, "step": 30000 }, { "epoch": 2.3340984244310445, "eval_entropy": 5.41895298687051, "eval_loss": 5.074906349182129, "eval_mean_token_accuracy": 0.2090465203042324, "eval_num_tokens": 52039120.0, "eval_runtime": 21.6013, "eval_samples_per_second": 1923.867, "eval_steps_per_second": 240.495, "step": 30000 }, { "entropy": 5.756390953063965, "epoch": 2.3344874538027622, "grad_norm": 1.2109375, "learning_rate": 0.00044496310950860015, "loss": 5.0758, "mean_token_accuracy": 0.1918635591864586, "num_tokens": 52047248.0, "step": 30005 }, { "entropy": 5.699402666091919, "epoch": 2.3348764831744795, "grad_norm": 1.203125, "learning_rate": 0.00044494494692538886, "loss": 4.9938, "mean_token_accuracy": 0.20157698094844817, "num_tokens": 52056359.0, "step": 30010 }, { "entropy": 5.695566558837891, "epoch": 2.335265512546197, "grad_norm": 1.1171875, "learning_rate": 0.00044492678176353347, "loss": 4.9827, "mean_token_accuracy": 0.2057071641087532, "num_tokens": 52065042.0, "step": 30015 }, { "entropy": 5.591879987716675, "epoch": 2.335654541917915, "grad_norm": 1.1875, "learning_rate": 0.00044490861402330967, "loss": 4.8492, "mean_token_accuracy": 0.21518089324235917, "num_tokens": 52073830.0, "step": 30020 }, { "entropy": 5.557460117340088, "epoch": 2.3360435712896326, "grad_norm": 1.2890625, "learning_rate": 0.0004448904437049931, "loss": 4.8521, "mean_token_accuracy": 0.20706599950790405, "num_tokens": 52082605.0, "step": 30025 }, { "entropy": 5.690365123748779, "epoch": 2.33643260066135, "grad_norm": 1.2265625, "learning_rate": 0.0004448722708088594, "loss": 5.1335, "mean_token_accuracy": 0.19213165044784547, "num_tokens": 52091997.0, "step": 30030 }, { "entropy": 5.694588756561279, "epoch": 2.3368216300330675, "grad_norm": 1.140625, "learning_rate": 0.0004448540953351844, "loss": 4.985, "mean_token_accuracy": 0.2051445260643959, "num_tokens": 52100690.0, "step": 30035 }, { "entropy": 5.7059427261352536, "epoch": 2.3372106594047852, "grad_norm": 1.2109375, "learning_rate": 0.0004448359172842439, "loss": 5.0287, "mean_token_accuracy": 0.2092236950993538, "num_tokens": 52109310.0, "step": 30040 }, { "entropy": 5.749555063247681, "epoch": 2.3375996887765025, "grad_norm": 1.1875, "learning_rate": 0.00044481773665631355, "loss": 5.0248, "mean_token_accuracy": 0.20769928842782975, "num_tokens": 52118662.0, "step": 30045 }, { "entropy": 5.619302129745483, "epoch": 2.33798871814822, "grad_norm": 1.2578125, "learning_rate": 0.0004447995534516695, "loss": 4.9216, "mean_token_accuracy": 0.21294282227754593, "num_tokens": 52127098.0, "step": 30050 }, { "entropy": 5.667756509780884, "epoch": 2.338377747519938, "grad_norm": 1.2265625, "learning_rate": 0.00044478136767058733, "loss": 5.0355, "mean_token_accuracy": 0.1946118727326393, "num_tokens": 52135539.0, "step": 30055 }, { "entropy": 5.765546607971191, "epoch": 2.338766776891655, "grad_norm": 1.125, "learning_rate": 0.0004447631793133432, "loss": 5.0095, "mean_token_accuracy": 0.1997895434498787, "num_tokens": 52144169.0, "step": 30060 }, { "entropy": 5.701320791244507, "epoch": 2.339155806263373, "grad_norm": 1.1796875, "learning_rate": 0.0004447449883802131, "loss": 5.0297, "mean_token_accuracy": 0.19656172394752502, "num_tokens": 52152679.0, "step": 30065 }, { "entropy": 5.6169651508331295, "epoch": 2.3395448356350905, "grad_norm": 1.1640625, "learning_rate": 0.00044472679487147295, "loss": 4.9638, "mean_token_accuracy": 0.20867678076028823, "num_tokens": 52161407.0, "step": 30070 }, { "entropy": 5.765756988525391, "epoch": 2.339933865006808, "grad_norm": 1.09375, "learning_rate": 0.00044470859878739877, "loss": 5.0255, "mean_token_accuracy": 0.19675746858119963, "num_tokens": 52170285.0, "step": 30075 }, { "entropy": 5.695612525939941, "epoch": 2.3403228943785255, "grad_norm": 1.2109375, "learning_rate": 0.00044469040012826676, "loss": 4.8756, "mean_token_accuracy": 0.2150782525539398, "num_tokens": 52178813.0, "step": 30080 }, { "entropy": 5.655029726028443, "epoch": 2.340711923750243, "grad_norm": 1.2109375, "learning_rate": 0.00044467219889435304, "loss": 4.8863, "mean_token_accuracy": 0.21019948720932008, "num_tokens": 52187205.0, "step": 30085 }, { "entropy": 5.686718320846557, "epoch": 2.341100953121961, "grad_norm": 1.21875, "learning_rate": 0.0004446539950859337, "loss": 5.0029, "mean_token_accuracy": 0.20463740229606628, "num_tokens": 52195318.0, "step": 30090 }, { "entropy": 5.683124971389771, "epoch": 2.341489982493678, "grad_norm": 1.125, "learning_rate": 0.00044463578870328506, "loss": 4.9493, "mean_token_accuracy": 0.20540110617876053, "num_tokens": 52204093.0, "step": 30095 }, { "entropy": 5.677870893478394, "epoch": 2.341879011865396, "grad_norm": 1.171875, "learning_rate": 0.0004446175797466834, "loss": 5.0155, "mean_token_accuracy": 0.20928280502557756, "num_tokens": 52212319.0, "step": 30100 }, { "entropy": 5.666666269302368, "epoch": 2.3422680412371135, "grad_norm": 1.2109375, "learning_rate": 0.00044459936821640485, "loss": 4.9812, "mean_token_accuracy": 0.206748266518116, "num_tokens": 52221878.0, "step": 30105 }, { "entropy": 5.630061149597168, "epoch": 2.3426570706088308, "grad_norm": 1.1953125, "learning_rate": 0.0004445811541127258, "loss": 4.8913, "mean_token_accuracy": 0.2090928614139557, "num_tokens": 52230952.0, "step": 30110 }, { "entropy": 5.677377223968506, "epoch": 2.3430460999805485, "grad_norm": 1.171875, "learning_rate": 0.00044456293743592274, "loss": 5.0034, "mean_token_accuracy": 0.20629876255989074, "num_tokens": 52239461.0, "step": 30115 }, { "entropy": 5.681976413726806, "epoch": 2.343435129352266, "grad_norm": 1.25, "learning_rate": 0.00044454471818627196, "loss": 4.9738, "mean_token_accuracy": 0.2058381587266922, "num_tokens": 52248478.0, "step": 30120 }, { "entropy": 5.692383432388306, "epoch": 2.343824158723984, "grad_norm": 1.1796875, "learning_rate": 0.00044452649636404995, "loss": 5.0284, "mean_token_accuracy": 0.20623916685581206, "num_tokens": 52256901.0, "step": 30125 }, { "entropy": 5.681644010543823, "epoch": 2.344213188095701, "grad_norm": 1.109375, "learning_rate": 0.0004445082719695332, "loss": 4.9748, "mean_token_accuracy": 0.20438240468502045, "num_tokens": 52265249.0, "step": 30130 }, { "entropy": 5.7179042339324955, "epoch": 2.344602217467419, "grad_norm": 1.09375, "learning_rate": 0.00044449004500299815, "loss": 5.012, "mean_token_accuracy": 0.20286389589309692, "num_tokens": 52274777.0, "step": 30135 }, { "entropy": 5.701413488388061, "epoch": 2.3449912468391365, "grad_norm": 1.21875, "learning_rate": 0.00044447181546472146, "loss": 5.0342, "mean_token_accuracy": 0.20075200498104095, "num_tokens": 52283392.0, "step": 30140 }, { "entropy": 5.591401195526123, "epoch": 2.3453802762108538, "grad_norm": 1.25, "learning_rate": 0.00044445358335497975, "loss": 4.9412, "mean_token_accuracy": 0.20404113680124283, "num_tokens": 52291875.0, "step": 30145 }, { "entropy": 5.637882852554322, "epoch": 2.3457693055825715, "grad_norm": 1.1953125, "learning_rate": 0.0004444353486740496, "loss": 5.0544, "mean_token_accuracy": 0.20506736785173416, "num_tokens": 52300194.0, "step": 30150 }, { "entropy": 5.720972061157227, "epoch": 2.346158334954289, "grad_norm": 1.2265625, "learning_rate": 0.0004444171114222078, "loss": 5.0157, "mean_token_accuracy": 0.20202679932117462, "num_tokens": 52309147.0, "step": 30155 }, { "entropy": 5.759420776367188, "epoch": 2.346547364326007, "grad_norm": 1.2265625, "learning_rate": 0.00044439887159973096, "loss": 5.0832, "mean_token_accuracy": 0.19962742030620576, "num_tokens": 52317502.0, "step": 30160 }, { "entropy": 5.667055892944336, "epoch": 2.346936393697724, "grad_norm": 1.203125, "learning_rate": 0.0004443806292068958, "loss": 4.8958, "mean_token_accuracy": 0.21261359751224518, "num_tokens": 52325539.0, "step": 30165 }, { "entropy": 5.732901763916016, "epoch": 2.347325423069442, "grad_norm": 1.234375, "learning_rate": 0.0004443623842439792, "loss": 4.9702, "mean_token_accuracy": 0.20531243681907654, "num_tokens": 52333676.0, "step": 30170 }, { "entropy": 5.691039943695069, "epoch": 2.347714452441159, "grad_norm": 1.1328125, "learning_rate": 0.000444344136711258, "loss": 4.932, "mean_token_accuracy": 0.2115081399679184, "num_tokens": 52342706.0, "step": 30175 }, { "entropy": 5.669292259216308, "epoch": 2.3481034818128768, "grad_norm": 1.15625, "learning_rate": 0.00044432588660900905, "loss": 4.9991, "mean_token_accuracy": 0.20427653342485427, "num_tokens": 52351409.0, "step": 30180 }, { "entropy": 5.652422332763672, "epoch": 2.3484925111845945, "grad_norm": 1.1953125, "learning_rate": 0.0004443076339375093, "loss": 4.9548, "mean_token_accuracy": 0.20763816088438034, "num_tokens": 52359781.0, "step": 30185 }, { "entropy": 5.679540586471558, "epoch": 2.348881540556312, "grad_norm": 1.1640625, "learning_rate": 0.00044428937869703575, "loss": 4.9682, "mean_token_accuracy": 0.20130108892917634, "num_tokens": 52368236.0, "step": 30190 }, { "entropy": 5.681802654266358, "epoch": 2.3492705699280294, "grad_norm": 1.2265625, "learning_rate": 0.00044427112088786525, "loss": 5.0226, "mean_token_accuracy": 0.20479027330875396, "num_tokens": 52376449.0, "step": 30195 }, { "entropy": 5.663373374938965, "epoch": 2.349659599299747, "grad_norm": 1.234375, "learning_rate": 0.0004442528605102749, "loss": 4.9392, "mean_token_accuracy": 0.20507037937641143, "num_tokens": 52384844.0, "step": 30200 }, { "entropy": 5.76090178489685, "epoch": 2.350048628671465, "grad_norm": 1.25, "learning_rate": 0.0004442345975645418, "loss": 5.0908, "mean_token_accuracy": 0.20092223435640336, "num_tokens": 52393810.0, "step": 30205 }, { "entropy": 5.719379138946533, "epoch": 2.350437658043182, "grad_norm": 1.234375, "learning_rate": 0.0004442163320509431, "loss": 4.9826, "mean_token_accuracy": 0.2040162205696106, "num_tokens": 52402081.0, "step": 30210 }, { "entropy": 5.64429612159729, "epoch": 2.3508266874148998, "grad_norm": 1.46875, "learning_rate": 0.0004441980639697558, "loss": 4.9441, "mean_token_accuracy": 0.20043689459562303, "num_tokens": 52411671.0, "step": 30215 }, { "entropy": 5.641269779205322, "epoch": 2.3512157167866174, "grad_norm": 1.1484375, "learning_rate": 0.0004441797933212573, "loss": 4.9961, "mean_token_accuracy": 0.2092510774731636, "num_tokens": 52420255.0, "step": 30220 }, { "entropy": 5.777602910995483, "epoch": 2.351604746158335, "grad_norm": 1.140625, "learning_rate": 0.0004441615201057247, "loss": 5.1322, "mean_token_accuracy": 0.18759176582098008, "num_tokens": 52429682.0, "step": 30225 }, { "entropy": 5.72752571105957, "epoch": 2.3519937755300524, "grad_norm": 1.15625, "learning_rate": 0.0004441432443234352, "loss": 4.9676, "mean_token_accuracy": 0.20459991991519927, "num_tokens": 52438719.0, "step": 30230 }, { "entropy": 5.626835632324219, "epoch": 2.35238280490177, "grad_norm": 1.109375, "learning_rate": 0.00044412496597466626, "loss": 4.881, "mean_token_accuracy": 0.21234894394874573, "num_tokens": 52447543.0, "step": 30235 }, { "entropy": 5.6819983959198, "epoch": 2.352771834273488, "grad_norm": 1.2109375, "learning_rate": 0.0004441066850596951, "loss": 4.9396, "mean_token_accuracy": 0.2070762485265732, "num_tokens": 52456606.0, "step": 30240 }, { "entropy": 5.740559530258179, "epoch": 2.353160863645205, "grad_norm": 1.15625, "learning_rate": 0.0004440884015787992, "loss": 5.024, "mean_token_accuracy": 0.20372215211391448, "num_tokens": 52465222.0, "step": 30245 }, { "entropy": 5.703493261337281, "epoch": 2.3535498930169227, "grad_norm": 1.234375, "learning_rate": 0.0004440701155322558, "loss": 5.0272, "mean_token_accuracy": 0.20359271466732026, "num_tokens": 52473955.0, "step": 30250 }, { "entropy": 5.661719179153442, "epoch": 2.3539389223886404, "grad_norm": 1.109375, "learning_rate": 0.0004440518269203427, "loss": 5.036, "mean_token_accuracy": 0.20181477814912796, "num_tokens": 52483786.0, "step": 30255 }, { "entropy": 5.766013193130493, "epoch": 2.354327951760358, "grad_norm": 1.21875, "learning_rate": 0.00044403353574333715, "loss": 5.0147, "mean_token_accuracy": 0.19932805597782136, "num_tokens": 52492292.0, "step": 30260 }, { "entropy": 5.696380615234375, "epoch": 2.3547169811320754, "grad_norm": 1.2890625, "learning_rate": 0.00044401524200151667, "loss": 5.0129, "mean_token_accuracy": 0.19577472358942033, "num_tokens": 52501267.0, "step": 30265 }, { "entropy": 5.7648883819580075, "epoch": 2.355106010503793, "grad_norm": 1.328125, "learning_rate": 0.00044399694569515895, "loss": 5.0472, "mean_token_accuracy": 0.2023172840476036, "num_tokens": 52509515.0, "step": 30270 }, { "entropy": 5.725790119171142, "epoch": 2.355495039875511, "grad_norm": 1.3203125, "learning_rate": 0.00044397864682454156, "loss": 5.0208, "mean_token_accuracy": 0.20382563173770904, "num_tokens": 52517757.0, "step": 30275 }, { "entropy": 5.743499660491944, "epoch": 2.355884069247228, "grad_norm": 1.1796875, "learning_rate": 0.0004439603453899421, "loss": 5.0633, "mean_token_accuracy": 0.20233923494815825, "num_tokens": 52525996.0, "step": 30280 }, { "entropy": 5.656480836868286, "epoch": 2.3562730986189457, "grad_norm": 1.140625, "learning_rate": 0.0004439420413916384, "loss": 4.9392, "mean_token_accuracy": 0.2088121294975281, "num_tokens": 52534457.0, "step": 30285 }, { "entropy": 5.6807575702667235, "epoch": 2.3566621279906634, "grad_norm": 1.2421875, "learning_rate": 0.00044392373482990817, "loss": 5.0815, "mean_token_accuracy": 0.19545285999774933, "num_tokens": 52543754.0, "step": 30290 }, { "entropy": 5.769536638259888, "epoch": 2.3570511573623807, "grad_norm": 1.1640625, "learning_rate": 0.0004439054257050291, "loss": 5.0167, "mean_token_accuracy": 0.19681438952684402, "num_tokens": 52552857.0, "step": 30295 }, { "entropy": 5.773643875122071, "epoch": 2.3574401867340984, "grad_norm": 1.2421875, "learning_rate": 0.0004438871140172789, "loss": 5.102, "mean_token_accuracy": 0.19424832612276077, "num_tokens": 52562760.0, "step": 30300 }, { "entropy": 5.6380218982696535, "epoch": 2.357829216105816, "grad_norm": 1.2109375, "learning_rate": 0.0004438687997669357, "loss": 4.9319, "mean_token_accuracy": 0.21262157708406448, "num_tokens": 52571111.0, "step": 30305 }, { "entropy": 5.661274576187134, "epoch": 2.3582182454775333, "grad_norm": 1.1875, "learning_rate": 0.00044385048295427724, "loss": 4.8975, "mean_token_accuracy": 0.2141343042254448, "num_tokens": 52579541.0, "step": 30310 }, { "entropy": 5.685671663284301, "epoch": 2.358607274849251, "grad_norm": 1.1953125, "learning_rate": 0.0004438321635795814, "loss": 5.0093, "mean_token_accuracy": 0.2101629674434662, "num_tokens": 52588253.0, "step": 30315 }, { "entropy": 5.654183101654053, "epoch": 2.3589963042209687, "grad_norm": 1.1171875, "learning_rate": 0.0004438138416431262, "loss": 4.9783, "mean_token_accuracy": 0.19496234208345414, "num_tokens": 52597922.0, "step": 30320 }, { "entropy": 5.744909191131592, "epoch": 2.3593853335926864, "grad_norm": 1.15625, "learning_rate": 0.00044379551714518966, "loss": 4.9025, "mean_token_accuracy": 0.21026039272546768, "num_tokens": 52606167.0, "step": 30325 }, { "entropy": 5.728329849243164, "epoch": 2.3597743629644037, "grad_norm": 1.3671875, "learning_rate": 0.00044377719008604984, "loss": 5.1001, "mean_token_accuracy": 0.2005586192011833, "num_tokens": 52614534.0, "step": 30330 }, { "entropy": 5.685024452209473, "epoch": 2.3601633923361214, "grad_norm": 1.234375, "learning_rate": 0.0004437588604659848, "loss": 5.0034, "mean_token_accuracy": 0.20085735470056534, "num_tokens": 52623225.0, "step": 30335 }, { "entropy": 5.753933954238891, "epoch": 2.360552421707839, "grad_norm": 1.1484375, "learning_rate": 0.0004437405282852726, "loss": 5.0321, "mean_token_accuracy": 0.20288884341716767, "num_tokens": 52632025.0, "step": 30340 }, { "entropy": 5.6517080783844, "epoch": 2.3609414510795563, "grad_norm": 1.1484375, "learning_rate": 0.00044372219354419154, "loss": 4.8577, "mean_token_accuracy": 0.2226580947637558, "num_tokens": 52640731.0, "step": 30345 }, { "entropy": 5.660420370101929, "epoch": 2.361330480451274, "grad_norm": 1.2421875, "learning_rate": 0.0004437038562430197, "loss": 4.9637, "mean_token_accuracy": 0.2090034916996956, "num_tokens": 52648831.0, "step": 30350 }, { "entropy": 5.690812349319458, "epoch": 2.3617195098229917, "grad_norm": 1.28125, "learning_rate": 0.00044368551638203536, "loss": 5.0268, "mean_token_accuracy": 0.19853800535202026, "num_tokens": 52657699.0, "step": 30355 }, { "entropy": 5.668798494338989, "epoch": 2.3621085391947094, "grad_norm": 1.140625, "learning_rate": 0.0004436671739615168, "loss": 4.9075, "mean_token_accuracy": 0.21215776950120926, "num_tokens": 52666418.0, "step": 30360 }, { "entropy": 5.669584274291992, "epoch": 2.3624975685664267, "grad_norm": 1.125, "learning_rate": 0.00044364882898174235, "loss": 5.0057, "mean_token_accuracy": 0.19585254192352294, "num_tokens": 52675014.0, "step": 30365 }, { "entropy": 5.726952266693115, "epoch": 2.3628865979381444, "grad_norm": 1.171875, "learning_rate": 0.0004436304814429903, "loss": 5.0052, "mean_token_accuracy": 0.2001657471060753, "num_tokens": 52683691.0, "step": 30370 }, { "entropy": 5.717898845672607, "epoch": 2.363275627309862, "grad_norm": 1.265625, "learning_rate": 0.0004436121313455391, "loss": 4.9566, "mean_token_accuracy": 0.20128027200698853, "num_tokens": 52692317.0, "step": 30375 }, { "entropy": 5.6434385776519775, "epoch": 2.3636646566815793, "grad_norm": 1.203125, "learning_rate": 0.0004435937786896673, "loss": 4.9979, "mean_token_accuracy": 0.19994384199380874, "num_tokens": 52701523.0, "step": 30380 }, { "entropy": 5.757628726959228, "epoch": 2.364053686053297, "grad_norm": 1.125, "learning_rate": 0.00044357542347565323, "loss": 5.0815, "mean_token_accuracy": 0.19754766821861267, "num_tokens": 52710436.0, "step": 30385 }, { "entropy": 5.773435640335083, "epoch": 2.3644427154250147, "grad_norm": 1.1953125, "learning_rate": 0.0004435570657037753, "loss": 5.0304, "mean_token_accuracy": 0.20407793372869493, "num_tokens": 52719186.0, "step": 30390 }, { "entropy": 5.670457220077514, "epoch": 2.364831744796732, "grad_norm": 1.1640625, "learning_rate": 0.0004435387053743123, "loss": 4.9967, "mean_token_accuracy": 0.20254630148410796, "num_tokens": 52728185.0, "step": 30395 }, { "entropy": 5.684291696548462, "epoch": 2.3652207741684497, "grad_norm": 1.21875, "learning_rate": 0.00044352034248754265, "loss": 5.0475, "mean_token_accuracy": 0.2042958214879036, "num_tokens": 52737938.0, "step": 30400 }, { "entropy": 5.716808795928955, "epoch": 2.3656098035401674, "grad_norm": 1.1953125, "learning_rate": 0.000443501977043745, "loss": 4.9357, "mean_token_accuracy": 0.20845961272716523, "num_tokens": 52747005.0, "step": 30405 }, { "entropy": 5.627818632125854, "epoch": 2.3659988329118846, "grad_norm": 1.25, "learning_rate": 0.0004434836090431981, "loss": 4.9277, "mean_token_accuracy": 0.2059844732284546, "num_tokens": 52756251.0, "step": 30410 }, { "entropy": 5.66896390914917, "epoch": 2.3663878622836023, "grad_norm": 1.1953125, "learning_rate": 0.0004434652384861806, "loss": 4.9575, "mean_token_accuracy": 0.20052410513162613, "num_tokens": 52764443.0, "step": 30415 }, { "entropy": 5.603477668762207, "epoch": 2.36677689165532, "grad_norm": 1.2734375, "learning_rate": 0.0004434468653729712, "loss": 4.8562, "mean_token_accuracy": 0.2156881645321846, "num_tokens": 52772824.0, "step": 30420 }, { "entropy": 5.654028797149659, "epoch": 2.3671659210270377, "grad_norm": 1.109375, "learning_rate": 0.00044342848970384876, "loss": 4.9924, "mean_token_accuracy": 0.20205406844615936, "num_tokens": 52782743.0, "step": 30425 }, { "entropy": 5.773429489135742, "epoch": 2.367554950398755, "grad_norm": 1.1953125, "learning_rate": 0.00044341011147909206, "loss": 5.1326, "mean_token_accuracy": 0.19493189603090286, "num_tokens": 52791564.0, "step": 30430 }, { "entropy": 5.698007202148437, "epoch": 2.3679439797704727, "grad_norm": 1.1484375, "learning_rate": 0.00044339173069897996, "loss": 4.939, "mean_token_accuracy": 0.21228592097759247, "num_tokens": 52800229.0, "step": 30435 }, { "entropy": 5.683042097091675, "epoch": 2.3683330091421904, "grad_norm": 1.203125, "learning_rate": 0.00044337334736379143, "loss": 4.9431, "mean_token_accuracy": 0.20857136845588684, "num_tokens": 52808342.0, "step": 30440 }, { "entropy": 5.644865989685059, "epoch": 2.3687220385139076, "grad_norm": 1.1796875, "learning_rate": 0.0004433549614738053, "loss": 5.0151, "mean_token_accuracy": 0.2041012167930603, "num_tokens": 52817462.0, "step": 30445 }, { "entropy": 5.63150634765625, "epoch": 2.3691110678856253, "grad_norm": 1.171875, "learning_rate": 0.00044333657302930056, "loss": 4.9023, "mean_token_accuracy": 0.2134816214442253, "num_tokens": 52825567.0, "step": 30450 }, { "entropy": 5.718771171569824, "epoch": 2.369500097257343, "grad_norm": 1.1484375, "learning_rate": 0.0004433181820305564, "loss": 4.9556, "mean_token_accuracy": 0.20427843183279037, "num_tokens": 52835771.0, "step": 30455 }, { "entropy": 5.625226163864136, "epoch": 2.3698891266290607, "grad_norm": 1.25, "learning_rate": 0.00044329978847785156, "loss": 4.9772, "mean_token_accuracy": 0.20451897084712983, "num_tokens": 52844344.0, "step": 30460 }, { "entropy": 5.67111611366272, "epoch": 2.370278156000778, "grad_norm": 1.1875, "learning_rate": 0.0004432813923714654, "loss": 4.9991, "mean_token_accuracy": 0.20368379205465317, "num_tokens": 52852918.0, "step": 30465 }, { "entropy": 5.654850196838379, "epoch": 2.3706671853724957, "grad_norm": 1.203125, "learning_rate": 0.00044326299371167695, "loss": 5.0345, "mean_token_accuracy": 0.20116255432367325, "num_tokens": 52862142.0, "step": 30470 }, { "entropy": 5.710794878005982, "epoch": 2.3710562147442134, "grad_norm": 1.2578125, "learning_rate": 0.00044324459249876536, "loss": 5.0475, "mean_token_accuracy": 0.19911070317029952, "num_tokens": 52870595.0, "step": 30475 }, { "entropy": 5.7255051612854, "epoch": 2.3714452441159306, "grad_norm": 1.265625, "learning_rate": 0.0004432261887330099, "loss": 5.0945, "mean_token_accuracy": 0.1968397781252861, "num_tokens": 52879995.0, "step": 30480 }, { "entropy": 5.687220621109009, "epoch": 2.3718342734876483, "grad_norm": 1.140625, "learning_rate": 0.0004432077824146898, "loss": 4.9266, "mean_token_accuracy": 0.2142840638756752, "num_tokens": 52888341.0, "step": 30485 }, { "entropy": 5.631745386123657, "epoch": 2.372223302859366, "grad_norm": 1.234375, "learning_rate": 0.0004431893735440843, "loss": 4.8815, "mean_token_accuracy": 0.21295864433050155, "num_tokens": 52896617.0, "step": 30490 }, { "entropy": 5.638586330413818, "epoch": 2.3726123322310833, "grad_norm": 1.1328125, "learning_rate": 0.0004431709621214727, "loss": 4.9273, "mean_token_accuracy": 0.2066103383898735, "num_tokens": 52905071.0, "step": 30495 }, { "entropy": 5.684696292877197, "epoch": 2.373001361602801, "grad_norm": 1.28125, "learning_rate": 0.00044315254814713455, "loss": 4.9215, "mean_token_accuracy": 0.21379323154687882, "num_tokens": 52913756.0, "step": 30500 }, { "entropy": 5.662220621109009, "epoch": 2.3733903909745186, "grad_norm": 1.1953125, "learning_rate": 0.00044313413162134894, "loss": 4.8838, "mean_token_accuracy": 0.22408915609121322, "num_tokens": 52922895.0, "step": 30505 }, { "entropy": 5.729219913482666, "epoch": 2.373779420346236, "grad_norm": 1.203125, "learning_rate": 0.0004431157125443958, "loss": 5.0347, "mean_token_accuracy": 0.20343793481588363, "num_tokens": 52931467.0, "step": 30510 }, { "entropy": 5.705686902999878, "epoch": 2.3741684497179536, "grad_norm": 1.1796875, "learning_rate": 0.000443097290916554, "loss": 5.0886, "mean_token_accuracy": 0.19740461856126784, "num_tokens": 52941122.0, "step": 30515 }, { "entropy": 5.710976457595825, "epoch": 2.3745574790896713, "grad_norm": 1.1796875, "learning_rate": 0.0004430788667381035, "loss": 5.0568, "mean_token_accuracy": 0.20256884694099425, "num_tokens": 52949881.0, "step": 30520 }, { "entropy": 5.676215553283692, "epoch": 2.374946508461389, "grad_norm": 1.1875, "learning_rate": 0.00044306044000932374, "loss": 4.9142, "mean_token_accuracy": 0.20369542986154557, "num_tokens": 52957836.0, "step": 30525 }, { "entropy": 5.6556000232696535, "epoch": 2.3753355378331062, "grad_norm": 1.3046875, "learning_rate": 0.0004430420107304943, "loss": 4.9624, "mean_token_accuracy": 0.20732636153697967, "num_tokens": 52965948.0, "step": 30530 }, { "entropy": 5.67168927192688, "epoch": 2.375724567204824, "grad_norm": 1.203125, "learning_rate": 0.00044302357890189475, "loss": 4.9493, "mean_token_accuracy": 0.20956917703151703, "num_tokens": 52974561.0, "step": 30535 }, { "entropy": 5.6453142166137695, "epoch": 2.3761135965765416, "grad_norm": 1.15625, "learning_rate": 0.0004430051445238049, "loss": 4.904, "mean_token_accuracy": 0.21059925705194474, "num_tokens": 52982918.0, "step": 30540 }, { "entropy": 5.724641895294189, "epoch": 2.376502625948259, "grad_norm": 1.28125, "learning_rate": 0.00044298670759650426, "loss": 5.0552, "mean_token_accuracy": 0.2003593251109123, "num_tokens": 52992119.0, "step": 30545 }, { "entropy": 5.593901491165161, "epoch": 2.3768916553199766, "grad_norm": 1.171875, "learning_rate": 0.0004429682681202728, "loss": 4.8734, "mean_token_accuracy": 0.21071865409612656, "num_tokens": 53000427.0, "step": 30550 }, { "entropy": 5.655601119995117, "epoch": 2.3772806846916943, "grad_norm": 1.125, "learning_rate": 0.00044294982609539027, "loss": 5.0343, "mean_token_accuracy": 0.196571047604084, "num_tokens": 53009615.0, "step": 30555 }, { "entropy": 5.7189350605010985, "epoch": 2.377669714063412, "grad_norm": 1.2734375, "learning_rate": 0.0004429313815221363, "loss": 4.9599, "mean_token_accuracy": 0.2067163899540901, "num_tokens": 53018357.0, "step": 30560 }, { "entropy": 5.6706687927246096, "epoch": 2.3780587434351292, "grad_norm": 1.234375, "learning_rate": 0.00044291293440079107, "loss": 4.963, "mean_token_accuracy": 0.19889951199293138, "num_tokens": 53027209.0, "step": 30565 }, { "entropy": 5.613498020172119, "epoch": 2.378447772806847, "grad_norm": 1.1953125, "learning_rate": 0.0004428944847316342, "loss": 4.9448, "mean_token_accuracy": 0.20613247156143188, "num_tokens": 53035621.0, "step": 30570 }, { "entropy": 5.734143686294556, "epoch": 2.3788368021785646, "grad_norm": 1.140625, "learning_rate": 0.0004428760325149458, "loss": 4.9896, "mean_token_accuracy": 0.20248246490955352, "num_tokens": 53044249.0, "step": 30575 }, { "entropy": 5.752537822723388, "epoch": 2.379225831550282, "grad_norm": 1.265625, "learning_rate": 0.00044285757775100584, "loss": 5.024, "mean_token_accuracy": 0.19997637569904328, "num_tokens": 53052977.0, "step": 30580 }, { "entropy": 5.70290846824646, "epoch": 2.3796148609219996, "grad_norm": 1.1875, "learning_rate": 0.00044283912044009436, "loss": 5.0084, "mean_token_accuracy": 0.20686363726854323, "num_tokens": 53061071.0, "step": 30585 }, { "entropy": 5.736420917510986, "epoch": 2.3800038902937173, "grad_norm": 1.203125, "learning_rate": 0.00044282066058249123, "loss": 5.0255, "mean_token_accuracy": 0.2075781211256981, "num_tokens": 53069237.0, "step": 30590 }, { "entropy": 5.75457534790039, "epoch": 2.380392919665435, "grad_norm": 1.171875, "learning_rate": 0.0004428021981784768, "loss": 5.0252, "mean_token_accuracy": 0.20186113715171813, "num_tokens": 53077991.0, "step": 30595 }, { "entropy": 5.652333450317383, "epoch": 2.3807819490371522, "grad_norm": 1.265625, "learning_rate": 0.00044278373322833106, "loss": 4.9437, "mean_token_accuracy": 0.204185152053833, "num_tokens": 53086263.0, "step": 30600 }, { "entropy": 5.6620134830474855, "epoch": 2.38117097840887, "grad_norm": 1.2109375, "learning_rate": 0.00044276526573233416, "loss": 4.9959, "mean_token_accuracy": 0.20557394474744797, "num_tokens": 53095048.0, "step": 30605 }, { "entropy": 5.759904766082764, "epoch": 2.381560007780587, "grad_norm": 1.1328125, "learning_rate": 0.0004427467956907664, "loss": 5.0402, "mean_token_accuracy": 0.20300538837909698, "num_tokens": 53103199.0, "step": 30610 }, { "entropy": 5.756172132492066, "epoch": 2.381949037152305, "grad_norm": 1.203125, "learning_rate": 0.00044272832310390814, "loss": 5.0431, "mean_token_accuracy": 0.20287467390298844, "num_tokens": 53111677.0, "step": 30615 }, { "entropy": 5.700761604309082, "epoch": 2.3823380665240226, "grad_norm": 1.1953125, "learning_rate": 0.0004427098479720394, "loss": 4.9879, "mean_token_accuracy": 0.20212076008319854, "num_tokens": 53120136.0, "step": 30620 }, { "entropy": 5.724934720993042, "epoch": 2.3827270958957403, "grad_norm": 1.1953125, "learning_rate": 0.00044269137029544073, "loss": 5.011, "mean_token_accuracy": 0.2034182459115982, "num_tokens": 53128847.0, "step": 30625 }, { "entropy": 5.751246452331543, "epoch": 2.3831161252674575, "grad_norm": 1.171875, "learning_rate": 0.0004426728900743924, "loss": 5.081, "mean_token_accuracy": 0.1969975709915161, "num_tokens": 53137307.0, "step": 30630 }, { "entropy": 5.725738096237182, "epoch": 2.3835051546391752, "grad_norm": 1.3125, "learning_rate": 0.00044265440730917484, "loss": 4.9536, "mean_token_accuracy": 0.20402128696441652, "num_tokens": 53145854.0, "step": 30635 }, { "entropy": 5.634464883804322, "epoch": 2.383894184010893, "grad_norm": 1.0703125, "learning_rate": 0.00044263592200006845, "loss": 5.0385, "mean_token_accuracy": 0.1954070582985878, "num_tokens": 53154779.0, "step": 30640 }, { "entropy": 5.695809650421142, "epoch": 2.38428321338261, "grad_norm": 1.1484375, "learning_rate": 0.00044261743414735383, "loss": 4.9927, "mean_token_accuracy": 0.19879571497440338, "num_tokens": 53163344.0, "step": 30645 }, { "entropy": 5.678693389892578, "epoch": 2.384672242754328, "grad_norm": 1.1328125, "learning_rate": 0.0004425989437513114, "loss": 4.8969, "mean_token_accuracy": 0.20668395161628722, "num_tokens": 53171989.0, "step": 30650 }, { "entropy": 5.69646954536438, "epoch": 2.3850612721260456, "grad_norm": 1.3359375, "learning_rate": 0.0004425804508122218, "loss": 5.0292, "mean_token_accuracy": 0.19541930556297302, "num_tokens": 53180612.0, "step": 30655 }, { "entropy": 5.63905816078186, "epoch": 2.3854503014977633, "grad_norm": 1.1640625, "learning_rate": 0.00044256195533036566, "loss": 4.9452, "mean_token_accuracy": 0.2062142536044121, "num_tokens": 53188741.0, "step": 30660 }, { "entropy": 5.648979330062867, "epoch": 2.3858393308694805, "grad_norm": 1.375, "learning_rate": 0.00044254345730602345, "loss": 4.9356, "mean_token_accuracy": 0.2145551934838295, "num_tokens": 53196857.0, "step": 30665 }, { "entropy": 5.637879800796509, "epoch": 2.386228360241198, "grad_norm": 1.21875, "learning_rate": 0.0004425249567394759, "loss": 5.0237, "mean_token_accuracy": 0.203089240193367, "num_tokens": 53205264.0, "step": 30670 }, { "entropy": 5.721059799194336, "epoch": 2.386617389612916, "grad_norm": 1.1796875, "learning_rate": 0.00044250645363100386, "loss": 4.9539, "mean_token_accuracy": 0.20965611487627028, "num_tokens": 53213459.0, "step": 30675 }, { "entropy": 5.757253932952881, "epoch": 2.387006418984633, "grad_norm": 1.2265625, "learning_rate": 0.00044248794798088805, "loss": 5.0324, "mean_token_accuracy": 0.19477767944335939, "num_tokens": 53221740.0, "step": 30680 }, { "entropy": 5.698051261901855, "epoch": 2.387395448356351, "grad_norm": 1.140625, "learning_rate": 0.0004424694397894091, "loss": 5.0113, "mean_token_accuracy": 0.20314499437808992, "num_tokens": 53230177.0, "step": 30685 }, { "entropy": 5.710635566711426, "epoch": 2.3877844777280686, "grad_norm": 1.21875, "learning_rate": 0.00044245092905684794, "loss": 4.9596, "mean_token_accuracy": 0.20446899831295012, "num_tokens": 53238238.0, "step": 30690 }, { "entropy": 5.7517438411712645, "epoch": 2.3881735070997863, "grad_norm": 1.21875, "learning_rate": 0.00044243241578348553, "loss": 4.9836, "mean_token_accuracy": 0.2107920080423355, "num_tokens": 53246519.0, "step": 30695 }, { "entropy": 5.6914550304412845, "epoch": 2.3885625364715035, "grad_norm": 1.1328125, "learning_rate": 0.0004424138999696027, "loss": 5.0587, "mean_token_accuracy": 0.19402490705251693, "num_tokens": 53255522.0, "step": 30700 }, { "entropy": 5.578604221343994, "epoch": 2.388951565843221, "grad_norm": 1.140625, "learning_rate": 0.0004423953816154804, "loss": 4.9248, "mean_token_accuracy": 0.21183202564716339, "num_tokens": 53264414.0, "step": 30705 }, { "entropy": 5.696620941162109, "epoch": 2.389340595214939, "grad_norm": 1.2734375, "learning_rate": 0.00044237686072139967, "loss": 5.0249, "mean_token_accuracy": 0.1983565703034401, "num_tokens": 53273403.0, "step": 30710 }, { "entropy": 5.780992746353149, "epoch": 2.389729624586656, "grad_norm": 1.328125, "learning_rate": 0.0004423583372876414, "loss": 5.0597, "mean_token_accuracy": 0.19677747040987015, "num_tokens": 53282361.0, "step": 30715 }, { "entropy": 5.689467191696167, "epoch": 2.390118653958374, "grad_norm": 1.15625, "learning_rate": 0.00044233981131448677, "loss": 4.9525, "mean_token_accuracy": 0.2032041221857071, "num_tokens": 53290890.0, "step": 30720 }, { "entropy": 5.575040292739868, "epoch": 2.3905076833300916, "grad_norm": 1.2265625, "learning_rate": 0.00044232128280221683, "loss": 4.9074, "mean_token_accuracy": 0.20948665887117385, "num_tokens": 53299781.0, "step": 30725 }, { "entropy": 5.664773607254029, "epoch": 2.390896712701809, "grad_norm": 1.234375, "learning_rate": 0.0004423027517511128, "loss": 5.0017, "mean_token_accuracy": 0.2053510621190071, "num_tokens": 53308568.0, "step": 30730 }, { "entropy": 5.7647679328918455, "epoch": 2.3912857420735265, "grad_norm": 1.1796875, "learning_rate": 0.00044228421816145573, "loss": 5.0542, "mean_token_accuracy": 0.20518970042467116, "num_tokens": 53317310.0, "step": 30735 }, { "entropy": 5.695624303817749, "epoch": 2.391674771445244, "grad_norm": 1.21875, "learning_rate": 0.00044226568203352694, "loss": 4.9547, "mean_token_accuracy": 0.20644297301769257, "num_tokens": 53326022.0, "step": 30740 }, { "entropy": 5.708564519882202, "epoch": 2.3920638008169615, "grad_norm": 1.1875, "learning_rate": 0.00044224714336760766, "loss": 4.9816, "mean_token_accuracy": 0.20821329206228256, "num_tokens": 53334090.0, "step": 30745 }, { "entropy": 5.65565128326416, "epoch": 2.392452830188679, "grad_norm": 1.1875, "learning_rate": 0.0004422286021639792, "loss": 4.9263, "mean_token_accuracy": 0.1995488479733467, "num_tokens": 53342682.0, "step": 30750 }, { "entropy": 5.721138334274292, "epoch": 2.392841859560397, "grad_norm": 1.2734375, "learning_rate": 0.0004422100584229228, "loss": 5.0339, "mean_token_accuracy": 0.20215784013271332, "num_tokens": 53350652.0, "step": 30755 }, { "entropy": 5.651772356033325, "epoch": 2.3932308889321146, "grad_norm": 1.2265625, "learning_rate": 0.00044219151214472, "loss": 4.9709, "mean_token_accuracy": 0.20197778046131135, "num_tokens": 53359339.0, "step": 30760 }, { "entropy": 5.658220100402832, "epoch": 2.393619918303832, "grad_norm": 1.2265625, "learning_rate": 0.0004421729633296521, "loss": 4.9796, "mean_token_accuracy": 0.2065460965037346, "num_tokens": 53367617.0, "step": 30765 }, { "entropy": 5.734013462066651, "epoch": 2.3940089476755495, "grad_norm": 1.171875, "learning_rate": 0.00044215441197800054, "loss": 5.1023, "mean_token_accuracy": 0.1940691277384758, "num_tokens": 53376725.0, "step": 30770 }, { "entropy": 5.751636219024658, "epoch": 2.394397977047267, "grad_norm": 1.25, "learning_rate": 0.00044213585809004685, "loss": 5.0129, "mean_token_accuracy": 0.21057351529598237, "num_tokens": 53384670.0, "step": 30775 }, { "entropy": 5.681389856338501, "epoch": 2.3947870064189845, "grad_norm": 1.125, "learning_rate": 0.0004421173016660725, "loss": 4.9677, "mean_token_accuracy": 0.21023979932069778, "num_tokens": 53392944.0, "step": 30780 }, { "entropy": 5.662369060516357, "epoch": 2.395176035790702, "grad_norm": 1.2421875, "learning_rate": 0.0004420987427063592, "loss": 5.0468, "mean_token_accuracy": 0.19683678448200226, "num_tokens": 53401301.0, "step": 30785 }, { "entropy": 5.748455238342285, "epoch": 2.39556506516242, "grad_norm": 1.2109375, "learning_rate": 0.00044208018121118833, "loss": 5.0417, "mean_token_accuracy": 0.20050605684518813, "num_tokens": 53409490.0, "step": 30790 }, { "entropy": 5.790576076507568, "epoch": 2.3959540945341375, "grad_norm": 1.2109375, "learning_rate": 0.00044206161718084164, "loss": 5.1179, "mean_token_accuracy": 0.19407260417938232, "num_tokens": 53418595.0, "step": 30795 }, { "entropy": 5.662709712982178, "epoch": 2.396343123905855, "grad_norm": 1.1953125, "learning_rate": 0.0004420430506156009, "loss": 4.938, "mean_token_accuracy": 0.21221698671579362, "num_tokens": 53427217.0, "step": 30800 }, { "entropy": 5.6160377025604244, "epoch": 2.3967321532775725, "grad_norm": 1.390625, "learning_rate": 0.00044202448151574764, "loss": 4.93, "mean_token_accuracy": 0.20781086534261703, "num_tokens": 53435875.0, "step": 30805 }, { "entropy": 5.70268611907959, "epoch": 2.39712118264929, "grad_norm": 1.140625, "learning_rate": 0.0004420059098815638, "loss": 5.0065, "mean_token_accuracy": 0.20398485362529756, "num_tokens": 53445466.0, "step": 30810 }, { "entropy": 5.651205110549927, "epoch": 2.3975102120210074, "grad_norm": 1.2265625, "learning_rate": 0.0004419873357133311, "loss": 4.8872, "mean_token_accuracy": 0.20782319605350494, "num_tokens": 53453813.0, "step": 30815 }, { "entropy": 5.681567239761352, "epoch": 2.397899241392725, "grad_norm": 1.1328125, "learning_rate": 0.0004419687590113313, "loss": 5.0031, "mean_token_accuracy": 0.20219684392213821, "num_tokens": 53462819.0, "step": 30820 }, { "entropy": 5.695095586776733, "epoch": 2.398288270764443, "grad_norm": 1.1484375, "learning_rate": 0.00044195017977584637, "loss": 4.9909, "mean_token_accuracy": 0.20607708543539047, "num_tokens": 53471297.0, "step": 30825 }, { "entropy": 5.704332637786865, "epoch": 2.39867730013616, "grad_norm": 1.21875, "learning_rate": 0.00044193159800715823, "loss": 5.0107, "mean_token_accuracy": 0.20337587594985962, "num_tokens": 53479473.0, "step": 30830 }, { "entropy": 5.670589208602905, "epoch": 2.399066329507878, "grad_norm": 1.1875, "learning_rate": 0.00044191301370554874, "loss": 5.01, "mean_token_accuracy": 0.2067077040672302, "num_tokens": 53488542.0, "step": 30835 }, { "entropy": 5.694934749603272, "epoch": 2.3994553588795955, "grad_norm": 1.1328125, "learning_rate": 0.00044189442687129994, "loss": 4.9455, "mean_token_accuracy": 0.2095772758126259, "num_tokens": 53497586.0, "step": 30840 }, { "entropy": 5.770704221725464, "epoch": 2.3998443882513127, "grad_norm": 1.3203125, "learning_rate": 0.0004418758375046939, "loss": 5.0119, "mean_token_accuracy": 0.20666083097457885, "num_tokens": 53506368.0, "step": 30845 }, { "entropy": 5.701147747039795, "epoch": 2.4002334176230304, "grad_norm": 1.125, "learning_rate": 0.00044185724560601267, "loss": 4.9857, "mean_token_accuracy": 0.20361461043357848, "num_tokens": 53515735.0, "step": 30850 }, { "entropy": 5.703646326065064, "epoch": 2.400622446994748, "grad_norm": 1.1875, "learning_rate": 0.0004418386511755382, "loss": 5.0446, "mean_token_accuracy": 0.195041660964489, "num_tokens": 53523780.0, "step": 30855 }, { "entropy": 5.688442373275757, "epoch": 2.401011476366466, "grad_norm": 1.1640625, "learning_rate": 0.0004418200542135528, "loss": 4.9661, "mean_token_accuracy": 0.20622289776802064, "num_tokens": 53532633.0, "step": 30860 }, { "entropy": 5.744816732406616, "epoch": 2.401400505738183, "grad_norm": 1.265625, "learning_rate": 0.0004418014547203386, "loss": 5.0608, "mean_token_accuracy": 0.21114032715559006, "num_tokens": 53540767.0, "step": 30865 }, { "entropy": 5.676985883712769, "epoch": 2.401789535109901, "grad_norm": 1.25, "learning_rate": 0.0004417828526961778, "loss": 5.0401, "mean_token_accuracy": 0.19978581070899964, "num_tokens": 53548925.0, "step": 30870 }, { "entropy": 5.630704736709594, "epoch": 2.4021785644816185, "grad_norm": 1.1875, "learning_rate": 0.00044176424814135266, "loss": 4.8273, "mean_token_accuracy": 0.21956527084112168, "num_tokens": 53557086.0, "step": 30875 }, { "entropy": 5.75473461151123, "epoch": 2.4025675938533357, "grad_norm": 1.3203125, "learning_rate": 0.0004417456410561455, "loss": 5.0766, "mean_token_accuracy": 0.19258911460638045, "num_tokens": 53565898.0, "step": 30880 }, { "entropy": 5.68265471458435, "epoch": 2.4029566232250534, "grad_norm": 1.109375, "learning_rate": 0.0004417270314408387, "loss": 5.0437, "mean_token_accuracy": 0.19438746720552444, "num_tokens": 53574695.0, "step": 30885 }, { "entropy": 5.763014554977417, "epoch": 2.403345652596771, "grad_norm": 1.171875, "learning_rate": 0.00044170841929571454, "loss": 5.0536, "mean_token_accuracy": 0.19470465779304505, "num_tokens": 53583854.0, "step": 30890 }, { "entropy": 5.717465591430664, "epoch": 2.403734681968489, "grad_norm": 1.171875, "learning_rate": 0.00044168980462105543, "loss": 4.9863, "mean_token_accuracy": 0.21036227345466613, "num_tokens": 53593008.0, "step": 30895 }, { "entropy": 5.703988742828369, "epoch": 2.404123711340206, "grad_norm": 1.140625, "learning_rate": 0.0004416711874171439, "loss": 4.9455, "mean_token_accuracy": 0.20257894098758697, "num_tokens": 53601548.0, "step": 30900 }, { "entropy": 5.7636518478393555, "epoch": 2.404512740711924, "grad_norm": 1.3828125, "learning_rate": 0.0004416525676842624, "loss": 5.1132, "mean_token_accuracy": 0.1973164215683937, "num_tokens": 53609807.0, "step": 30905 }, { "entropy": 5.6702734470367435, "epoch": 2.4049017700836415, "grad_norm": 1.234375, "learning_rate": 0.0004416339454226933, "loss": 4.9145, "mean_token_accuracy": 0.21142808794975282, "num_tokens": 53618879.0, "step": 30910 }, { "entropy": 5.684861707687378, "epoch": 2.4052907994553587, "grad_norm": 1.140625, "learning_rate": 0.0004416153206327194, "loss": 4.9427, "mean_token_accuracy": 0.2081697478890419, "num_tokens": 53627318.0, "step": 30915 }, { "entropy": 5.6798521995544435, "epoch": 2.4056798288270764, "grad_norm": 1.203125, "learning_rate": 0.00044159669331462326, "loss": 4.9716, "mean_token_accuracy": 0.20409707874059677, "num_tokens": 53635872.0, "step": 30920 }, { "entropy": 5.716140174865723, "epoch": 2.406068858198794, "grad_norm": 1.1328125, "learning_rate": 0.00044157806346868737, "loss": 4.9529, "mean_token_accuracy": 0.2034446746110916, "num_tokens": 53644434.0, "step": 30925 }, { "entropy": 5.685462856292725, "epoch": 2.406457887570512, "grad_norm": 1.2421875, "learning_rate": 0.00044155943109519454, "loss": 4.9393, "mean_token_accuracy": 0.20487113296985626, "num_tokens": 53652721.0, "step": 30930 }, { "entropy": 5.743895721435547, "epoch": 2.406846916942229, "grad_norm": 1.3125, "learning_rate": 0.0004415407961944274, "loss": 4.989, "mean_token_accuracy": 0.20412514954805375, "num_tokens": 53660831.0, "step": 30935 }, { "entropy": 5.769741344451904, "epoch": 2.4072359463139468, "grad_norm": 1.2109375, "learning_rate": 0.00044152215876666883, "loss": 4.9699, "mean_token_accuracy": 0.211480775475502, "num_tokens": 53669335.0, "step": 30940 }, { "entropy": 5.734765481948853, "epoch": 2.407624975685664, "grad_norm": 1.21875, "learning_rate": 0.0004415035188122016, "loss": 5.0008, "mean_token_accuracy": 0.20377446115016937, "num_tokens": 53678004.0, "step": 30945 }, { "entropy": 5.695643281936645, "epoch": 2.4080140050573817, "grad_norm": 1.0546875, "learning_rate": 0.00044148487633130837, "loss": 4.9842, "mean_token_accuracy": 0.19808896631002426, "num_tokens": 53687300.0, "step": 30950 }, { "entropy": 5.6803446292877195, "epoch": 2.4084030344290994, "grad_norm": 1.2421875, "learning_rate": 0.00044146623132427213, "loss": 4.9273, "mean_token_accuracy": 0.20669049322605132, "num_tokens": 53695692.0, "step": 30955 }, { "entropy": 5.7316525936126705, "epoch": 2.408792063800817, "grad_norm": 1.2265625, "learning_rate": 0.00044144758379137584, "loss": 5.0562, "mean_token_accuracy": 0.20348678827285765, "num_tokens": 53704164.0, "step": 30960 }, { "entropy": 5.623951435089111, "epoch": 2.4091810931725344, "grad_norm": 1.2109375, "learning_rate": 0.00044142893373290236, "loss": 4.9329, "mean_token_accuracy": 0.2048473358154297, "num_tokens": 53712681.0, "step": 30965 }, { "entropy": 5.673066473007202, "epoch": 2.409570122544252, "grad_norm": 1.203125, "learning_rate": 0.0004414102811491348, "loss": 4.9065, "mean_token_accuracy": 0.20533172488212587, "num_tokens": 53721208.0, "step": 30970 }, { "entropy": 5.711548900604248, "epoch": 2.4099591519159698, "grad_norm": 1.25, "learning_rate": 0.00044139162604035597, "loss": 5.0018, "mean_token_accuracy": 0.20201724916696548, "num_tokens": 53729590.0, "step": 30975 }, { "entropy": 5.692458152770996, "epoch": 2.410348181287687, "grad_norm": 1.265625, "learning_rate": 0.00044137296840684917, "loss": 5.0266, "mean_token_accuracy": 0.19410679936408998, "num_tokens": 53737886.0, "step": 30980 }, { "entropy": 5.728073215484619, "epoch": 2.4107372106594047, "grad_norm": 1.140625, "learning_rate": 0.0004413543082488973, "loss": 5.023, "mean_token_accuracy": 0.2050301432609558, "num_tokens": 53746397.0, "step": 30985 }, { "entropy": 5.680665016174316, "epoch": 2.4111262400311224, "grad_norm": 1.171875, "learning_rate": 0.0004413356455667836, "loss": 4.9704, "mean_token_accuracy": 0.203125062584877, "num_tokens": 53755319.0, "step": 30990 }, { "entropy": 5.577775669097901, "epoch": 2.41151526940284, "grad_norm": 1.1953125, "learning_rate": 0.0004413169803607913, "loss": 4.9612, "mean_token_accuracy": 0.20633016526699066, "num_tokens": 53763655.0, "step": 30995 }, { "entropy": 5.7216489791870115, "epoch": 2.4119042987745574, "grad_norm": 1.1640625, "learning_rate": 0.00044129831263120344, "loss": 4.9819, "mean_token_accuracy": 0.2037344753742218, "num_tokens": 53772922.0, "step": 31000 }, { "entropy": 5.746966409683227, "epoch": 2.412293328146275, "grad_norm": 1.2734375, "learning_rate": 0.0004412796423783034, "loss": 4.9569, "mean_token_accuracy": 0.19733022302389144, "num_tokens": 53781328.0, "step": 31005 }, { "entropy": 5.668871164321899, "epoch": 2.4126823575179928, "grad_norm": 1.15625, "learning_rate": 0.0004412609696023745, "loss": 4.9546, "mean_token_accuracy": 0.20548033714294434, "num_tokens": 53791025.0, "step": 31010 }, { "entropy": 5.69786810874939, "epoch": 2.41307138688971, "grad_norm": 1.2265625, "learning_rate": 0.0004412422943037, "loss": 5.0117, "mean_token_accuracy": 0.2048239976167679, "num_tokens": 53799423.0, "step": 31015 }, { "entropy": 5.700504875183105, "epoch": 2.4134604162614277, "grad_norm": 1.1796875, "learning_rate": 0.00044122361648256327, "loss": 5.0255, "mean_token_accuracy": 0.20283907800912857, "num_tokens": 53808001.0, "step": 31020 }, { "entropy": 5.678734350204468, "epoch": 2.4138494456331454, "grad_norm": 1.1484375, "learning_rate": 0.00044120493613924766, "loss": 4.9304, "mean_token_accuracy": 0.2072340652346611, "num_tokens": 53816354.0, "step": 31025 }, { "entropy": 5.658646965026856, "epoch": 2.414238475004863, "grad_norm": 1.1796875, "learning_rate": 0.00044118625327403677, "loss": 4.9266, "mean_token_accuracy": 0.21264790147542953, "num_tokens": 53825430.0, "step": 31030 }, { "entropy": 5.747230529785156, "epoch": 2.4146275043765804, "grad_norm": 1.2265625, "learning_rate": 0.000441167567887214, "loss": 5.0092, "mean_token_accuracy": 0.20939322859048842, "num_tokens": 53833420.0, "step": 31035 }, { "entropy": 5.706561422348022, "epoch": 2.415016533748298, "grad_norm": 1.2734375, "learning_rate": 0.0004411488799790629, "loss": 5.0646, "mean_token_accuracy": 0.1945636749267578, "num_tokens": 53841771.0, "step": 31040 }, { "entropy": 5.737779664993286, "epoch": 2.4154055631200158, "grad_norm": 1.2109375, "learning_rate": 0.00044113018954986693, "loss": 4.9733, "mean_token_accuracy": 0.20677031129598616, "num_tokens": 53850485.0, "step": 31045 }, { "entropy": 5.801591157913208, "epoch": 2.415794592491733, "grad_norm": 1.28125, "learning_rate": 0.0004411114965999098, "loss": 5.0933, "mean_token_accuracy": 0.192753866314888, "num_tokens": 53859491.0, "step": 31050 }, { "entropy": 5.6396173477172855, "epoch": 2.4161836218634507, "grad_norm": 1.15625, "learning_rate": 0.000441092801129475, "loss": 4.9484, "mean_token_accuracy": 0.2137480542063713, "num_tokens": 53868838.0, "step": 31055 }, { "entropy": 5.762688112258911, "epoch": 2.4165726512351684, "grad_norm": 1.2265625, "learning_rate": 0.00044107410313884643, "loss": 5.0676, "mean_token_accuracy": 0.2018780678510666, "num_tokens": 53877689.0, "step": 31060 }, { "entropy": 5.614333820343018, "epoch": 2.4169616806068857, "grad_norm": 1.2265625, "learning_rate": 0.00044105540262830763, "loss": 4.8207, "mean_token_accuracy": 0.2156371533870697, "num_tokens": 53885769.0, "step": 31065 }, { "entropy": 5.580350112915039, "epoch": 2.4173507099786034, "grad_norm": 1.2109375, "learning_rate": 0.0004410366995981424, "loss": 4.8694, "mean_token_accuracy": 0.2116177037358284, "num_tokens": 53894745.0, "step": 31070 }, { "entropy": 5.665690517425537, "epoch": 2.417739739350321, "grad_norm": 1.140625, "learning_rate": 0.00044101799404863457, "loss": 5.0012, "mean_token_accuracy": 0.20353320091962815, "num_tokens": 53903888.0, "step": 31075 }, { "entropy": 5.72026252746582, "epoch": 2.4181287687220383, "grad_norm": 1.2265625, "learning_rate": 0.0004409992859800679, "loss": 4.9798, "mean_token_accuracy": 0.2053653746843338, "num_tokens": 53912422.0, "step": 31080 }, { "entropy": 5.673090934753418, "epoch": 2.418517798093756, "grad_norm": 1.125, "learning_rate": 0.0004409805753927263, "loss": 4.9825, "mean_token_accuracy": 0.20426786839962005, "num_tokens": 53921181.0, "step": 31085 }, { "entropy": 5.727359390258789, "epoch": 2.4189068274654737, "grad_norm": 1.21875, "learning_rate": 0.0004409618622868936, "loss": 5.0898, "mean_token_accuracy": 0.19906202405691148, "num_tokens": 53929777.0, "step": 31090 }, { "entropy": 5.736010980606079, "epoch": 2.4192958568371914, "grad_norm": 1.1796875, "learning_rate": 0.00044094314666285385, "loss": 5.0098, "mean_token_accuracy": 0.19432570785284042, "num_tokens": 53938678.0, "step": 31095 }, { "entropy": 5.727069950103759, "epoch": 2.4196848862089086, "grad_norm": 1.28125, "learning_rate": 0.00044092442852089095, "loss": 4.9409, "mean_token_accuracy": 0.20983136147260667, "num_tokens": 53946158.0, "step": 31100 }, { "entropy": 5.697996997833252, "epoch": 2.4200739155806263, "grad_norm": 1.2421875, "learning_rate": 0.0004409057078612889, "loss": 5.0029, "mean_token_accuracy": 0.20602383464574814, "num_tokens": 53954875.0, "step": 31105 }, { "entropy": 5.683337640762329, "epoch": 2.420462944952344, "grad_norm": 1.234375, "learning_rate": 0.00044088698468433194, "loss": 5.0093, "mean_token_accuracy": 0.19817259460687636, "num_tokens": 53963355.0, "step": 31110 }, { "entropy": 5.692636919021607, "epoch": 2.4208519743240613, "grad_norm": 1.1640625, "learning_rate": 0.00044086825899030383, "loss": 5.0186, "mean_token_accuracy": 0.20474299639463425, "num_tokens": 53971861.0, "step": 31115 }, { "entropy": 5.717766904830933, "epoch": 2.421241003695779, "grad_norm": 1.140625, "learning_rate": 0.000440849530779489, "loss": 4.9796, "mean_token_accuracy": 0.1988164484500885, "num_tokens": 53980415.0, "step": 31120 }, { "entropy": 5.747138118743896, "epoch": 2.4216300330674967, "grad_norm": 1.1796875, "learning_rate": 0.0004408308000521715, "loss": 4.9814, "mean_token_accuracy": 0.20024537295103073, "num_tokens": 53989107.0, "step": 31125 }, { "entropy": 5.705617237091064, "epoch": 2.4220190624392144, "grad_norm": 1.171875, "learning_rate": 0.00044081206680863556, "loss": 4.9508, "mean_token_accuracy": 0.20536145567893982, "num_tokens": 53997938.0, "step": 31130 }, { "entropy": 5.673064422607422, "epoch": 2.4224080918109316, "grad_norm": 1.234375, "learning_rate": 0.00044079333104916554, "loss": 4.9425, "mean_token_accuracy": 0.21115432530641556, "num_tokens": 54006221.0, "step": 31135 }, { "entropy": 5.674414396286011, "epoch": 2.4227971211826493, "grad_norm": 1.28125, "learning_rate": 0.0004407745927740454, "loss": 5.0172, "mean_token_accuracy": 0.20794041454792023, "num_tokens": 54014579.0, "step": 31140 }, { "entropy": 5.706538343429566, "epoch": 2.423186150554367, "grad_norm": 1.203125, "learning_rate": 0.0004407558519835598, "loss": 4.9674, "mean_token_accuracy": 0.2022554561495781, "num_tokens": 54024119.0, "step": 31145 }, { "entropy": 5.785856008529663, "epoch": 2.4235751799260843, "grad_norm": 1.28125, "learning_rate": 0.00044073710867799295, "loss": 5.0482, "mean_token_accuracy": 0.20036611407995225, "num_tokens": 54032548.0, "step": 31150 }, { "entropy": 5.720654582977295, "epoch": 2.423964209297802, "grad_norm": 1.2109375, "learning_rate": 0.0004407183628576293, "loss": 4.9726, "mean_token_accuracy": 0.2126454532146454, "num_tokens": 54041210.0, "step": 31155 }, { "entropy": 5.708438491821289, "epoch": 2.4243532386695197, "grad_norm": 1.1875, "learning_rate": 0.0004406996145227532, "loss": 4.9678, "mean_token_accuracy": 0.20815297812223435, "num_tokens": 54050056.0, "step": 31160 }, { "entropy": 5.715914106369018, "epoch": 2.424742268041237, "grad_norm": 1.1015625, "learning_rate": 0.0004406808636736492, "loss": 4.9443, "mean_token_accuracy": 0.2030140995979309, "num_tokens": 54058752.0, "step": 31165 }, { "entropy": 5.6588850021362305, "epoch": 2.4251312974129546, "grad_norm": 1.21875, "learning_rate": 0.00044066211031060183, "loss": 4.9179, "mean_token_accuracy": 0.20939377397298814, "num_tokens": 54067496.0, "step": 31170 }, { "entropy": 5.605231618881225, "epoch": 2.4255203267846723, "grad_norm": 1.21875, "learning_rate": 0.0004406433544338956, "loss": 4.9301, "mean_token_accuracy": 0.20289628207683563, "num_tokens": 54075832.0, "step": 31175 }, { "entropy": 5.794409704208374, "epoch": 2.4259093561563896, "grad_norm": 1.2578125, "learning_rate": 0.0004406245960438151, "loss": 5.0866, "mean_token_accuracy": 0.19720596671104432, "num_tokens": 54084642.0, "step": 31180 }, { "entropy": 5.677262926101685, "epoch": 2.4262983855281073, "grad_norm": 1.3515625, "learning_rate": 0.000440605835140645, "loss": 4.9188, "mean_token_accuracy": 0.21021524220705032, "num_tokens": 54092759.0, "step": 31185 }, { "entropy": 5.7381611347198485, "epoch": 2.426687414899825, "grad_norm": 1.296875, "learning_rate": 0.0004405870717246699, "loss": 5.0376, "mean_token_accuracy": 0.20333133041858673, "num_tokens": 54101413.0, "step": 31190 }, { "entropy": 5.7462726593017575, "epoch": 2.4270764442715427, "grad_norm": 1.1484375, "learning_rate": 0.00044056830579617464, "loss": 5.0346, "mean_token_accuracy": 0.20094078183174133, "num_tokens": 54110237.0, "step": 31195 }, { "entropy": 5.74951753616333, "epoch": 2.42746547364326, "grad_norm": 1.203125, "learning_rate": 0.00044054953735544376, "loss": 5.0959, "mean_token_accuracy": 0.20277126878499985, "num_tokens": 54119103.0, "step": 31200 }, { "entropy": 5.698044347763061, "epoch": 2.4278545030149776, "grad_norm": 1.2578125, "learning_rate": 0.0004405307664027622, "loss": 4.997, "mean_token_accuracy": 0.20261053442955018, "num_tokens": 54127696.0, "step": 31205 }, { "entropy": 5.666213130950927, "epoch": 2.4282435323866953, "grad_norm": 1.3125, "learning_rate": 0.0004405119929384147, "loss": 4.8906, "mean_token_accuracy": 0.21185125410556793, "num_tokens": 54135607.0, "step": 31210 }, { "entropy": 5.711946296691894, "epoch": 2.4286325617584126, "grad_norm": 1.203125, "learning_rate": 0.0004404932169626862, "loss": 4.9892, "mean_token_accuracy": 0.20509780943393707, "num_tokens": 54144147.0, "step": 31215 }, { "entropy": 5.687720108032226, "epoch": 2.4290215911301303, "grad_norm": 1.1953125, "learning_rate": 0.0004404744384758615, "loss": 4.9535, "mean_token_accuracy": 0.20695552825927735, "num_tokens": 54152010.0, "step": 31220 }, { "entropy": 5.663530063629151, "epoch": 2.429410620501848, "grad_norm": 1.2265625, "learning_rate": 0.0004404556574782256, "loss": 5.0591, "mean_token_accuracy": 0.21067042797803878, "num_tokens": 54160923.0, "step": 31225 }, { "entropy": 5.6626269817352295, "epoch": 2.4297996498735657, "grad_norm": 1.1171875, "learning_rate": 0.00044043687397006336, "loss": 4.9865, "mean_token_accuracy": 0.20515680313110352, "num_tokens": 54169688.0, "step": 31230 }, { "entropy": 5.71123104095459, "epoch": 2.430188679245283, "grad_norm": 1.1015625, "learning_rate": 0.00044041808795166, "loss": 4.9813, "mean_token_accuracy": 0.2045915275812149, "num_tokens": 54178423.0, "step": 31235 }, { "entropy": 5.7308817386627195, "epoch": 2.4305777086170006, "grad_norm": 1.25, "learning_rate": 0.0004403992994233004, "loss": 5.0081, "mean_token_accuracy": 0.2062464326620102, "num_tokens": 54186939.0, "step": 31240 }, { "entropy": 5.723186206817627, "epoch": 2.4309667379887183, "grad_norm": 1.203125, "learning_rate": 0.00044038050838526974, "loss": 5.0182, "mean_token_accuracy": 0.20303118079900742, "num_tokens": 54195758.0, "step": 31245 }, { "entropy": 5.674756622314453, "epoch": 2.4313557673604356, "grad_norm": 1.1328125, "learning_rate": 0.000440361714837853, "loss": 4.88, "mean_token_accuracy": 0.2125411182641983, "num_tokens": 54205139.0, "step": 31250 }, { "entropy": 5.665359783172607, "epoch": 2.4317447967321533, "grad_norm": 1.21875, "learning_rate": 0.0004403429187813355, "loss": 4.9289, "mean_token_accuracy": 0.20551924258470536, "num_tokens": 54213346.0, "step": 31255 }, { "entropy": 5.66544508934021, "epoch": 2.432133826103871, "grad_norm": 1.265625, "learning_rate": 0.0004403241202160024, "loss": 4.8828, "mean_token_accuracy": 0.21067420542240142, "num_tokens": 54221796.0, "step": 31260 }, { "entropy": 5.736772060394287, "epoch": 2.432522855475588, "grad_norm": 1.1875, "learning_rate": 0.0004403053191421388, "loss": 5.1022, "mean_token_accuracy": 0.19049570560455323, "num_tokens": 54230166.0, "step": 31265 }, { "entropy": 5.646552228927613, "epoch": 2.432911884847306, "grad_norm": 1.15625, "learning_rate": 0.0004402865155600302, "loss": 4.9431, "mean_token_accuracy": 0.20646189153194427, "num_tokens": 54238986.0, "step": 31270 }, { "entropy": 5.721885251998901, "epoch": 2.4333009142190236, "grad_norm": 1.1875, "learning_rate": 0.00044026770946996183, "loss": 4.9554, "mean_token_accuracy": 0.2053394705057144, "num_tokens": 54248178.0, "step": 31275 }, { "entropy": 5.650380992889405, "epoch": 2.433689943590741, "grad_norm": 1.2421875, "learning_rate": 0.00044024890087221896, "loss": 4.9559, "mean_token_accuracy": 0.2039957493543625, "num_tokens": 54256320.0, "step": 31280 }, { "entropy": 5.650027465820313, "epoch": 2.4340789729624586, "grad_norm": 1.265625, "learning_rate": 0.00044023008976708705, "loss": 4.9333, "mean_token_accuracy": 0.21278028935194016, "num_tokens": 54264209.0, "step": 31285 }, { "entropy": 5.611765956878662, "epoch": 2.4344680023341763, "grad_norm": 1.3671875, "learning_rate": 0.0004402112761548515, "loss": 4.8695, "mean_token_accuracy": 0.21546996682882308, "num_tokens": 54271943.0, "step": 31290 }, { "entropy": 5.6741210460662845, "epoch": 2.434857031705894, "grad_norm": 1.1796875, "learning_rate": 0.00044019246003579776, "loss": 5.0063, "mean_token_accuracy": 0.20066030621528624, "num_tokens": 54280524.0, "step": 31295 }, { "entropy": 5.703638982772827, "epoch": 2.435246061077611, "grad_norm": 1.2578125, "learning_rate": 0.0004401736414102115, "loss": 4.9864, "mean_token_accuracy": 0.20291682034730912, "num_tokens": 54289479.0, "step": 31300 }, { "entropy": 5.745681571960449, "epoch": 2.435635090449329, "grad_norm": 1.3125, "learning_rate": 0.000440154820278378, "loss": 4.9769, "mean_token_accuracy": 0.20642392337322235, "num_tokens": 54297502.0, "step": 31305 }, { "entropy": 5.760735654830933, "epoch": 2.4360241198210466, "grad_norm": 1.234375, "learning_rate": 0.0004401359966405831, "loss": 5.0243, "mean_token_accuracy": 0.19810228496789933, "num_tokens": 54305691.0, "step": 31310 }, { "entropy": 5.794631910324097, "epoch": 2.436413149192764, "grad_norm": 1.125, "learning_rate": 0.00044011717049711216, "loss": 5.0507, "mean_token_accuracy": 0.19196943938732147, "num_tokens": 54315582.0, "step": 31315 }, { "entropy": 5.736785459518432, "epoch": 2.4368021785644816, "grad_norm": 1.234375, "learning_rate": 0.00044009834184825103, "loss": 4.9832, "mean_token_accuracy": 0.20290514677762986, "num_tokens": 54324102.0, "step": 31320 }, { "entropy": 5.7546344757080075, "epoch": 2.4371912079361993, "grad_norm": 1.2265625, "learning_rate": 0.0004400795106942853, "loss": 5.033, "mean_token_accuracy": 0.19869280457496644, "num_tokens": 54332618.0, "step": 31325 }, { "entropy": 5.748958683013916, "epoch": 2.437580237307917, "grad_norm": 1.2578125, "learning_rate": 0.00044006067703550083, "loss": 5.0108, "mean_token_accuracy": 0.20234129279851915, "num_tokens": 54341236.0, "step": 31330 }, { "entropy": 5.629346466064453, "epoch": 2.437969266679634, "grad_norm": 1.15625, "learning_rate": 0.0004400418408721833, "loss": 4.9091, "mean_token_accuracy": 0.20774390697479247, "num_tokens": 54349817.0, "step": 31335 }, { "entropy": 5.732312536239624, "epoch": 2.438358296051352, "grad_norm": 1.234375, "learning_rate": 0.00044002300220461843, "loss": 5.023, "mean_token_accuracy": 0.2031279042363167, "num_tokens": 54358767.0, "step": 31340 }, { "entropy": 5.651879358291626, "epoch": 2.4387473254230696, "grad_norm": 1.265625, "learning_rate": 0.0004400041610330922, "loss": 4.8836, "mean_token_accuracy": 0.21391941010951995, "num_tokens": 54367208.0, "step": 31345 }, { "entropy": 5.692077779769898, "epoch": 2.439136354794787, "grad_norm": 1.2578125, "learning_rate": 0.0004399853173578905, "loss": 5.0013, "mean_token_accuracy": 0.20820398330688478, "num_tokens": 54376234.0, "step": 31350 }, { "entropy": 5.714228916168213, "epoch": 2.4395253841665046, "grad_norm": 1.1953125, "learning_rate": 0.00043996647117929916, "loss": 5.0254, "mean_token_accuracy": 0.2058816522359848, "num_tokens": 54384828.0, "step": 31355 }, { "entropy": 5.75376443862915, "epoch": 2.4399144135382222, "grad_norm": 1.234375, "learning_rate": 0.0004399476224976043, "loss": 5.0312, "mean_token_accuracy": 0.20482400059700012, "num_tokens": 54394068.0, "step": 31360 }, { "entropy": 5.684261131286621, "epoch": 2.44030344290994, "grad_norm": 1.1640625, "learning_rate": 0.00043992877131309165, "loss": 4.9633, "mean_token_accuracy": 0.20901695787906646, "num_tokens": 54403667.0, "step": 31365 }, { "entropy": 5.648886585235596, "epoch": 2.440692472281657, "grad_norm": 1.2421875, "learning_rate": 0.0004399099176260475, "loss": 4.9052, "mean_token_accuracy": 0.21707408577203752, "num_tokens": 54411614.0, "step": 31370 }, { "entropy": 5.61477255821228, "epoch": 2.441081501653375, "grad_norm": 1.2734375, "learning_rate": 0.0004398910614367579, "loss": 4.9082, "mean_token_accuracy": 0.21142828613519668, "num_tokens": 54420084.0, "step": 31375 }, { "entropy": 5.6593084812164305, "epoch": 2.441470531025092, "grad_norm": 1.171875, "learning_rate": 0.00043987220274550876, "loss": 5.0199, "mean_token_accuracy": 0.2022504985332489, "num_tokens": 54429100.0, "step": 31380 }, { "entropy": 5.77789044380188, "epoch": 2.44185956039681, "grad_norm": 1.2734375, "learning_rate": 0.00043985334155258643, "loss": 5.0691, "mean_token_accuracy": 0.20035118311643602, "num_tokens": 54437900.0, "step": 31385 }, { "entropy": 5.751274824142456, "epoch": 2.4422485897685275, "grad_norm": 1.1640625, "learning_rate": 0.000439834477858277, "loss": 4.9681, "mean_token_accuracy": 0.20909156799316406, "num_tokens": 54445840.0, "step": 31390 }, { "entropy": 5.689387464523316, "epoch": 2.4426376191402452, "grad_norm": 1.1796875, "learning_rate": 0.00043981561166286676, "loss": 5.0227, "mean_token_accuracy": 0.20090366154909134, "num_tokens": 54454116.0, "step": 31395 }, { "entropy": 5.679704332351685, "epoch": 2.4430266485119625, "grad_norm": 1.1484375, "learning_rate": 0.000439796742966642, "loss": 4.9663, "mean_token_accuracy": 0.20444866120815278, "num_tokens": 54462787.0, "step": 31400 }, { "entropy": 5.699283313751221, "epoch": 2.44341567788368, "grad_norm": 1.234375, "learning_rate": 0.00043977787176988884, "loss": 5.0311, "mean_token_accuracy": 0.20581417679786682, "num_tokens": 54472706.0, "step": 31405 }, { "entropy": 5.724381303787231, "epoch": 2.443804707255398, "grad_norm": 1.171875, "learning_rate": 0.0004397589980728938, "loss": 4.9937, "mean_token_accuracy": 0.20131707638502122, "num_tokens": 54482016.0, "step": 31410 }, { "entropy": 5.6771626472473145, "epoch": 2.444193736627115, "grad_norm": 1.25, "learning_rate": 0.00043974012187594324, "loss": 4.9137, "mean_token_accuracy": 0.21263297498226166, "num_tokens": 54489943.0, "step": 31415 }, { "entropy": 5.7114335060119625, "epoch": 2.444582765998833, "grad_norm": 1.171875, "learning_rate": 0.0004397212431793235, "loss": 5.0459, "mean_token_accuracy": 0.20039672404527664, "num_tokens": 54498251.0, "step": 31420 }, { "entropy": 5.639827823638916, "epoch": 2.4449717953705505, "grad_norm": 1.2890625, "learning_rate": 0.00043970236198332107, "loss": 4.9009, "mean_token_accuracy": 0.21018229871988298, "num_tokens": 54506862.0, "step": 31425 }, { "entropy": 5.665523099899292, "epoch": 2.4453608247422682, "grad_norm": 1.1796875, "learning_rate": 0.00043968347828822246, "loss": 4.8874, "mean_token_accuracy": 0.21457584649324418, "num_tokens": 54515207.0, "step": 31430 }, { "entropy": 5.711954975128174, "epoch": 2.4457498541139855, "grad_norm": 1.1875, "learning_rate": 0.0004396645920943142, "loss": 5.0497, "mean_token_accuracy": 0.2047162711620331, "num_tokens": 54523643.0, "step": 31435 }, { "entropy": 5.632853698730469, "epoch": 2.446138883485703, "grad_norm": 1.2421875, "learning_rate": 0.0004396457034018828, "loss": 4.858, "mean_token_accuracy": 0.22478509694337845, "num_tokens": 54532805.0, "step": 31440 }, { "entropy": 5.75053129196167, "epoch": 2.446527912857421, "grad_norm": 1.234375, "learning_rate": 0.000439626812211215, "loss": 5.0294, "mean_token_accuracy": 0.20142092555761337, "num_tokens": 54541525.0, "step": 31445 }, { "entropy": 5.690386438369751, "epoch": 2.446916942229138, "grad_norm": 1.2421875, "learning_rate": 0.00043960791852259735, "loss": 5.0652, "mean_token_accuracy": 0.19743050783872604, "num_tokens": 54550034.0, "step": 31450 }, { "entropy": 5.730579805374146, "epoch": 2.447305971600856, "grad_norm": 1.1796875, "learning_rate": 0.0004395890223363165, "loss": 4.9645, "mean_token_accuracy": 0.20347832143306732, "num_tokens": 54559498.0, "step": 31455 }, { "entropy": 5.740029335021973, "epoch": 2.4476950009725735, "grad_norm": 1.375, "learning_rate": 0.00043957012365265915, "loss": 5.0117, "mean_token_accuracy": 0.20365163385868074, "num_tokens": 54568397.0, "step": 31460 }, { "entropy": 5.692304468154907, "epoch": 2.4480840303442912, "grad_norm": 1.28125, "learning_rate": 0.00043955122247191214, "loss": 5.0741, "mean_token_accuracy": 0.1929635927081108, "num_tokens": 54576735.0, "step": 31465 }, { "entropy": 5.731384801864624, "epoch": 2.4484730597160085, "grad_norm": 1.1796875, "learning_rate": 0.0004395323187943623, "loss": 5.0634, "mean_token_accuracy": 0.20125912725925446, "num_tokens": 54586265.0, "step": 31470 }, { "entropy": 5.7365899085998535, "epoch": 2.448862089087726, "grad_norm": 1.1640625, "learning_rate": 0.0004395134126202964, "loss": 4.9988, "mean_token_accuracy": 0.20966554433107376, "num_tokens": 54595307.0, "step": 31475 }, { "entropy": 5.731628131866455, "epoch": 2.449251118459444, "grad_norm": 1.1484375, "learning_rate": 0.0004394945039500012, "loss": 5.0093, "mean_token_accuracy": 0.20281700044870377, "num_tokens": 54603886.0, "step": 31480 }, { "entropy": 5.735364723205566, "epoch": 2.449640147831161, "grad_norm": 1.296875, "learning_rate": 0.00043947559278376385, "loss": 5.0384, "mean_token_accuracy": 0.20174692273139955, "num_tokens": 54613165.0, "step": 31485 }, { "entropy": 5.762103033065796, "epoch": 2.450029177202879, "grad_norm": 1.265625, "learning_rate": 0.00043945667912187117, "loss": 4.9464, "mean_token_accuracy": 0.20732494592666625, "num_tokens": 54622226.0, "step": 31490 }, { "entropy": 5.637320470809937, "epoch": 2.4504182065745965, "grad_norm": 1.2734375, "learning_rate": 0.0004394377629646101, "loss": 4.9574, "mean_token_accuracy": 0.20458245724439622, "num_tokens": 54631389.0, "step": 31495 }, { "entropy": 5.670266389846802, "epoch": 2.4508072359463138, "grad_norm": 1.1875, "learning_rate": 0.00043941884431226763, "loss": 4.9695, "mean_token_accuracy": 0.20602148175239562, "num_tokens": 54640033.0, "step": 31500 }, { "entropy": 5.707459020614624, "epoch": 2.4511962653180315, "grad_norm": 1.171875, "learning_rate": 0.000439399923165131, "loss": 4.9109, "mean_token_accuracy": 0.2038598358631134, "num_tokens": 54648828.0, "step": 31505 }, { "entropy": 5.650222206115723, "epoch": 2.451585294689749, "grad_norm": 1.21875, "learning_rate": 0.0004393809995234872, "loss": 4.9844, "mean_token_accuracy": 0.20300206840038298, "num_tokens": 54657132.0, "step": 31510 }, { "entropy": 5.725305700302124, "epoch": 2.4519743240614664, "grad_norm": 1.1328125, "learning_rate": 0.0004393620733876233, "loss": 4.9599, "mean_token_accuracy": 0.203688907623291, "num_tokens": 54666261.0, "step": 31515 }, { "entropy": 5.678594636917114, "epoch": 2.452363353433184, "grad_norm": 1.1328125, "learning_rate": 0.0004393431447578267, "loss": 4.9468, "mean_token_accuracy": 0.2058344826102257, "num_tokens": 54675200.0, "step": 31520 }, { "entropy": 5.6477149486541744, "epoch": 2.452752382804902, "grad_norm": 1.234375, "learning_rate": 0.00043932421363438427, "loss": 4.9327, "mean_token_accuracy": 0.20911493003368378, "num_tokens": 54683659.0, "step": 31525 }, { "entropy": 5.587221240997314, "epoch": 2.4531414121766195, "grad_norm": 1.125, "learning_rate": 0.0004393052800175835, "loss": 4.8779, "mean_token_accuracy": 0.21271039098501204, "num_tokens": 54691903.0, "step": 31530 }, { "entropy": 5.617666578292846, "epoch": 2.4535304415483368, "grad_norm": 1.1953125, "learning_rate": 0.00043928634390771166, "loss": 4.9117, "mean_token_accuracy": 0.20719670802354812, "num_tokens": 54700512.0, "step": 31535 }, { "entropy": 5.688706541061402, "epoch": 2.4539194709200545, "grad_norm": 1.2578125, "learning_rate": 0.00043926740530505603, "loss": 4.9613, "mean_token_accuracy": 0.21013252437114716, "num_tokens": 54709144.0, "step": 31540 }, { "entropy": 5.683513212203979, "epoch": 2.454308500291772, "grad_norm": 1.2890625, "learning_rate": 0.000439248464209904, "loss": 4.997, "mean_token_accuracy": 0.20946514904499053, "num_tokens": 54717733.0, "step": 31545 }, { "entropy": 5.664798641204834, "epoch": 2.4546975296634894, "grad_norm": 1.2421875, "learning_rate": 0.000439229520622543, "loss": 4.9436, "mean_token_accuracy": 0.2109210044145584, "num_tokens": 54726120.0, "step": 31550 }, { "entropy": 5.652388286590576, "epoch": 2.455086559035207, "grad_norm": 1.1171875, "learning_rate": 0.0004392105745432603, "loss": 4.9571, "mean_token_accuracy": 0.21128099411725998, "num_tokens": 54735639.0, "step": 31555 }, { "entropy": 5.69576063156128, "epoch": 2.455475588406925, "grad_norm": 1.1875, "learning_rate": 0.0004391916259723436, "loss": 4.9265, "mean_token_accuracy": 0.2031738966703415, "num_tokens": 54743928.0, "step": 31560 }, { "entropy": 5.703947114944458, "epoch": 2.4558646177786425, "grad_norm": 1.2734375, "learning_rate": 0.00043917267491008023, "loss": 4.9923, "mean_token_accuracy": 0.2054302990436554, "num_tokens": 54752409.0, "step": 31565 }, { "entropy": 5.6905662536621096, "epoch": 2.4562536471503598, "grad_norm": 1.21875, "learning_rate": 0.0004391537213567579, "loss": 5.0113, "mean_token_accuracy": 0.20446170419454573, "num_tokens": 54761018.0, "step": 31570 }, { "entropy": 5.66536021232605, "epoch": 2.4566426765220775, "grad_norm": 1.1953125, "learning_rate": 0.0004391347653126641, "loss": 4.9599, "mean_token_accuracy": 0.20546625107526778, "num_tokens": 54769479.0, "step": 31575 }, { "entropy": 5.613924598693847, "epoch": 2.457031705893795, "grad_norm": 1.1484375, "learning_rate": 0.00043911580677808646, "loss": 4.8933, "mean_token_accuracy": 0.2074800491333008, "num_tokens": 54778310.0, "step": 31580 }, { "entropy": 5.709959077835083, "epoch": 2.4574207352655124, "grad_norm": 1.1875, "learning_rate": 0.00043909684575331264, "loss": 4.9429, "mean_token_accuracy": 0.2099877953529358, "num_tokens": 54788237.0, "step": 31585 }, { "entropy": 5.69619836807251, "epoch": 2.45780976463723, "grad_norm": 1.28125, "learning_rate": 0.0004390778822386304, "loss": 4.988, "mean_token_accuracy": 0.20728553384542464, "num_tokens": 54796746.0, "step": 31590 }, { "entropy": 5.624191331863403, "epoch": 2.458198794008948, "grad_norm": 1.203125, "learning_rate": 0.00043905891623432754, "loss": 4.9483, "mean_token_accuracy": 0.20108024030923843, "num_tokens": 54805572.0, "step": 31595 }, { "entropy": 5.6454840183258055, "epoch": 2.458587823380665, "grad_norm": 1.1328125, "learning_rate": 0.00043903994774069165, "loss": 4.9062, "mean_token_accuracy": 0.20793068259954453, "num_tokens": 54814631.0, "step": 31600 }, { "entropy": 5.735376262664795, "epoch": 2.4589768527523828, "grad_norm": 1.2421875, "learning_rate": 0.0004390209767580107, "loss": 4.9494, "mean_token_accuracy": 0.206843364238739, "num_tokens": 54822753.0, "step": 31605 }, { "entropy": 5.682389783859253, "epoch": 2.4593658821241005, "grad_norm": 1.28125, "learning_rate": 0.0004390020032865725, "loss": 4.9653, "mean_token_accuracy": 0.20498978942632676, "num_tokens": 54830969.0, "step": 31610 }, { "entropy": 5.66211085319519, "epoch": 2.4597549114958177, "grad_norm": 1.1484375, "learning_rate": 0.0004389830273266649, "loss": 4.9905, "mean_token_accuracy": 0.20893552601337434, "num_tokens": 54840295.0, "step": 31615 }, { "entropy": 5.813375329971313, "epoch": 2.4601439408675354, "grad_norm": 1.3515625, "learning_rate": 0.00043896404887857596, "loss": 5.0944, "mean_token_accuracy": 0.1955312341451645, "num_tokens": 54848583.0, "step": 31620 }, { "entropy": 5.7253814220428465, "epoch": 2.460532970239253, "grad_norm": 1.15625, "learning_rate": 0.0004389450679425935, "loss": 4.9045, "mean_token_accuracy": 0.20905786901712417, "num_tokens": 54857450.0, "step": 31625 }, { "entropy": 5.71419677734375, "epoch": 2.460921999610971, "grad_norm": 1.1953125, "learning_rate": 0.0004389260845190055, "loss": 5.0076, "mean_token_accuracy": 0.20245034843683243, "num_tokens": 54865928.0, "step": 31630 }, { "entropy": 5.732040786743164, "epoch": 2.461311028982688, "grad_norm": 1.1953125, "learning_rate": 0.00043890709860810014, "loss": 5.0369, "mean_token_accuracy": 0.2001290112733841, "num_tokens": 54874983.0, "step": 31635 }, { "entropy": 5.7053591251373295, "epoch": 2.4617000583544058, "grad_norm": 1.1171875, "learning_rate": 0.00043888811021016545, "loss": 4.9753, "mean_token_accuracy": 0.20675558596849442, "num_tokens": 54883488.0, "step": 31640 }, { "entropy": 5.644139623641967, "epoch": 2.4620890877261234, "grad_norm": 1.1328125, "learning_rate": 0.00043886911932548953, "loss": 4.9615, "mean_token_accuracy": 0.20332875102758408, "num_tokens": 54892865.0, "step": 31645 }, { "entropy": 5.722333812713623, "epoch": 2.4624781170978407, "grad_norm": 1.234375, "learning_rate": 0.0004388501259543605, "loss": 5.0411, "mean_token_accuracy": 0.19722485542297363, "num_tokens": 54901714.0, "step": 31650 }, { "entropy": 5.642154121398926, "epoch": 2.4628671464695584, "grad_norm": 1.21875, "learning_rate": 0.0004388311300970667, "loss": 5.0285, "mean_token_accuracy": 0.20113491863012314, "num_tokens": 54910912.0, "step": 31655 }, { "entropy": 5.737851905822754, "epoch": 2.463256175841276, "grad_norm": 1.2265625, "learning_rate": 0.0004388121317538962, "loss": 5.0631, "mean_token_accuracy": 0.19260653853416443, "num_tokens": 54919613.0, "step": 31660 }, { "entropy": 5.698726844787598, "epoch": 2.463645205212994, "grad_norm": 1.1640625, "learning_rate": 0.0004387931309251374, "loss": 4.9648, "mean_token_accuracy": 0.20688717812299728, "num_tokens": 54928794.0, "step": 31665 }, { "entropy": 5.645522689819336, "epoch": 2.464034234584711, "grad_norm": 1.203125, "learning_rate": 0.0004387741276110785, "loss": 4.9133, "mean_token_accuracy": 0.2099432110786438, "num_tokens": 54937826.0, "step": 31670 }, { "entropy": 5.728659343719483, "epoch": 2.4644232639564287, "grad_norm": 1.234375, "learning_rate": 0.00043875512181200784, "loss": 4.9977, "mean_token_accuracy": 0.20193404257297515, "num_tokens": 54946541.0, "step": 31675 }, { "entropy": 5.719264268875122, "epoch": 2.4648122933281464, "grad_norm": 1.203125, "learning_rate": 0.0004387361135282139, "loss": 5.0157, "mean_token_accuracy": 0.20475911796092988, "num_tokens": 54954540.0, "step": 31680 }, { "entropy": 5.646700096130371, "epoch": 2.4652013226998637, "grad_norm": 1.2265625, "learning_rate": 0.00043871710275998507, "loss": 4.961, "mean_token_accuracy": 0.20695525407791138, "num_tokens": 54962784.0, "step": 31685 }, { "entropy": 5.660250282287597, "epoch": 2.4655903520715814, "grad_norm": 1.21875, "learning_rate": 0.0004386980895076097, "loss": 4.9034, "mean_token_accuracy": 0.21332934200763704, "num_tokens": 54971572.0, "step": 31690 }, { "entropy": 5.689511394500732, "epoch": 2.465979381443299, "grad_norm": 1.3125, "learning_rate": 0.00043867907377137646, "loss": 4.9364, "mean_token_accuracy": 0.21234478652477265, "num_tokens": 54980161.0, "step": 31695 }, { "entropy": 5.720282649993896, "epoch": 2.4663684108150163, "grad_norm": 1.2578125, "learning_rate": 0.00043866005555157376, "loss": 4.9943, "mean_token_accuracy": 0.20497419238090514, "num_tokens": 54988219.0, "step": 31700 }, { "entropy": 5.709698009490967, "epoch": 2.466757440186734, "grad_norm": 1.2421875, "learning_rate": 0.0004386410348484903, "loss": 4.8989, "mean_token_accuracy": 0.20923684537410736, "num_tokens": 54996550.0, "step": 31705 }, { "entropy": 5.721031665802002, "epoch": 2.4671464695584517, "grad_norm": 1.2265625, "learning_rate": 0.0004386220116624145, "loss": 5.0626, "mean_token_accuracy": 0.20127718895673752, "num_tokens": 55005269.0, "step": 31710 }, { "entropy": 5.673962163925171, "epoch": 2.467535498930169, "grad_norm": 1.265625, "learning_rate": 0.00043860298599363506, "loss": 4.8684, "mean_token_accuracy": 0.22235942333936692, "num_tokens": 55014264.0, "step": 31715 }, { "entropy": 5.668878746032715, "epoch": 2.4679245283018867, "grad_norm": 1.1796875, "learning_rate": 0.0004385839578424408, "loss": 4.9448, "mean_token_accuracy": 0.20220266729593278, "num_tokens": 55023597.0, "step": 31720 }, { "entropy": 5.70275468826294, "epoch": 2.4683135576736044, "grad_norm": 1.2890625, "learning_rate": 0.00043856492720912037, "loss": 4.9712, "mean_token_accuracy": 0.20719346553087234, "num_tokens": 55032860.0, "step": 31725 }, { "entropy": 5.734061861038208, "epoch": 2.468702587045322, "grad_norm": 1.2421875, "learning_rate": 0.0004385458940939624, "loss": 4.9576, "mean_token_accuracy": 0.2078079327940941, "num_tokens": 55041275.0, "step": 31730 }, { "entropy": 5.729184579849243, "epoch": 2.4690916164170393, "grad_norm": 1.1640625, "learning_rate": 0.0004385268584972559, "loss": 5.0285, "mean_token_accuracy": 0.203933285176754, "num_tokens": 55050871.0, "step": 31735 }, { "entropy": 5.687581729888916, "epoch": 2.469480645788757, "grad_norm": 1.1171875, "learning_rate": 0.0004385078204192896, "loss": 4.9731, "mean_token_accuracy": 0.20011350512504578, "num_tokens": 55060353.0, "step": 31740 }, { "entropy": 5.669858407974243, "epoch": 2.4698696751604747, "grad_norm": 1.1796875, "learning_rate": 0.0004384887798603523, "loss": 4.9711, "mean_token_accuracy": 0.20244651287794113, "num_tokens": 55069002.0, "step": 31745 }, { "entropy": 5.697154712677002, "epoch": 2.470258704532192, "grad_norm": 1.2578125, "learning_rate": 0.000438469736820733, "loss": 5.0337, "mean_token_accuracy": 0.19622162878513336, "num_tokens": 55078369.0, "step": 31750 }, { "entropy": 5.78787202835083, "epoch": 2.4706477339039097, "grad_norm": 1.1796875, "learning_rate": 0.00043845069130072067, "loss": 5.0975, "mean_token_accuracy": 0.18942145258188248, "num_tokens": 55087597.0, "step": 31755 }, { "entropy": 5.690673398971557, "epoch": 2.4710367632756274, "grad_norm": 1.265625, "learning_rate": 0.0004384316433006043, "loss": 4.9292, "mean_token_accuracy": 0.2094486579298973, "num_tokens": 55095906.0, "step": 31760 }, { "entropy": 5.637564563751221, "epoch": 2.471425792647345, "grad_norm": 1.2421875, "learning_rate": 0.00043841259282067276, "loss": 4.9307, "mean_token_accuracy": 0.2119113102555275, "num_tokens": 55104401.0, "step": 31765 }, { "entropy": 5.634366798400879, "epoch": 2.4718148220190623, "grad_norm": 1.1484375, "learning_rate": 0.00043839353986121533, "loss": 5.0124, "mean_token_accuracy": 0.20028680860996245, "num_tokens": 55113075.0, "step": 31770 }, { "entropy": 5.66239070892334, "epoch": 2.47220385139078, "grad_norm": 1.203125, "learning_rate": 0.0004383744844225209, "loss": 4.8987, "mean_token_accuracy": 0.20698277056217193, "num_tokens": 55122173.0, "step": 31775 }, { "entropy": 5.719072723388672, "epoch": 2.4725928807624977, "grad_norm": 1.25, "learning_rate": 0.00043835542650487875, "loss": 5.018, "mean_token_accuracy": 0.20189317911863328, "num_tokens": 55130356.0, "step": 31780 }, { "entropy": 5.649662065505981, "epoch": 2.472981910134215, "grad_norm": 1.1484375, "learning_rate": 0.0004383363661085781, "loss": 4.9753, "mean_token_accuracy": 0.20491543412208557, "num_tokens": 55138985.0, "step": 31785 }, { "entropy": 5.664580583572388, "epoch": 2.4733709395059327, "grad_norm": 1.1953125, "learning_rate": 0.0004383173032339079, "loss": 4.9932, "mean_token_accuracy": 0.20841305404901506, "num_tokens": 55148053.0, "step": 31790 }, { "entropy": 5.778921318054199, "epoch": 2.4737599688776504, "grad_norm": 1.203125, "learning_rate": 0.0004382982378811577, "loss": 5.0786, "mean_token_accuracy": 0.19835829734802246, "num_tokens": 55156815.0, "step": 31795 }, { "entropy": 5.662289094924927, "epoch": 2.474148998249368, "grad_norm": 1.1484375, "learning_rate": 0.0004382791700506166, "loss": 4.8434, "mean_token_accuracy": 0.21570997983217238, "num_tokens": 55165007.0, "step": 31800 }, { "entropy": 5.7026862621307375, "epoch": 2.4745380276210853, "grad_norm": 1.2109375, "learning_rate": 0.000438260099742574, "loss": 4.9808, "mean_token_accuracy": 0.20337547957897187, "num_tokens": 55173784.0, "step": 31805 }, { "entropy": 5.695233249664307, "epoch": 2.474927056992803, "grad_norm": 1.203125, "learning_rate": 0.0004382410269573192, "loss": 4.98, "mean_token_accuracy": 0.20539948493242263, "num_tokens": 55182436.0, "step": 31810 }, { "entropy": 5.741106128692627, "epoch": 2.4753160863645203, "grad_norm": 1.296875, "learning_rate": 0.00043822195169514167, "loss": 5.0112, "mean_token_accuracy": 0.2066890463232994, "num_tokens": 55190083.0, "step": 31815 }, { "entropy": 5.68487138748169, "epoch": 2.475705115736238, "grad_norm": 1.125, "learning_rate": 0.00043820287395633086, "loss": 5.0686, "mean_token_accuracy": 0.19969495236873627, "num_tokens": 55200154.0, "step": 31820 }, { "entropy": 5.7439404964447025, "epoch": 2.4760941451079557, "grad_norm": 1.0859375, "learning_rate": 0.0004381837937411761, "loss": 4.9938, "mean_token_accuracy": 0.20256001949310304, "num_tokens": 55209672.0, "step": 31825 }, { "entropy": 5.787710332870484, "epoch": 2.4764831744796734, "grad_norm": 1.21875, "learning_rate": 0.00043816471104996706, "loss": 5.0643, "mean_token_accuracy": 0.20131044387817382, "num_tokens": 55218362.0, "step": 31830 }, { "entropy": 5.71512188911438, "epoch": 2.4768722038513906, "grad_norm": 1.1640625, "learning_rate": 0.0004381456258829933, "loss": 4.9012, "mean_token_accuracy": 0.21655296832323073, "num_tokens": 55226834.0, "step": 31835 }, { "entropy": 5.636905717849731, "epoch": 2.4772612332231083, "grad_norm": 1.2578125, "learning_rate": 0.00043812653824054426, "loss": 5.0244, "mean_token_accuracy": 0.198170006275177, "num_tokens": 55236325.0, "step": 31840 }, { "entropy": 5.721864175796509, "epoch": 2.477650262594826, "grad_norm": 1.171875, "learning_rate": 0.0004381074481229097, "loss": 4.9566, "mean_token_accuracy": 0.20541564822196962, "num_tokens": 55245007.0, "step": 31845 }, { "entropy": 5.701096105575561, "epoch": 2.4780392919665433, "grad_norm": 1.171875, "learning_rate": 0.0004380883555303791, "loss": 4.9111, "mean_token_accuracy": 0.2115028217434883, "num_tokens": 55253967.0, "step": 31850 }, { "entropy": 5.718160390853882, "epoch": 2.478428321338261, "grad_norm": 1.3046875, "learning_rate": 0.0004380692604632424, "loss": 4.9812, "mean_token_accuracy": 0.2087363362312317, "num_tokens": 55262226.0, "step": 31855 }, { "entropy": 5.754696989059449, "epoch": 2.4788173507099787, "grad_norm": 1.140625, "learning_rate": 0.00043805016292178923, "loss": 5.0579, "mean_token_accuracy": 0.20530355274677276, "num_tokens": 55271523.0, "step": 31860 }, { "entropy": 5.693493318557739, "epoch": 2.4792063800816964, "grad_norm": 1.2421875, "learning_rate": 0.0004380310629063094, "loss": 4.9782, "mean_token_accuracy": 0.20599453300237655, "num_tokens": 55280604.0, "step": 31865 }, { "entropy": 5.639458799362183, "epoch": 2.4795954094534136, "grad_norm": 1.234375, "learning_rate": 0.0004380119604170925, "loss": 4.9391, "mean_token_accuracy": 0.2093282625079155, "num_tokens": 55289521.0, "step": 31870 }, { "entropy": 5.68984899520874, "epoch": 2.4799844388251313, "grad_norm": 1.203125, "learning_rate": 0.00043799285545442876, "loss": 4.9523, "mean_token_accuracy": 0.20594089925289155, "num_tokens": 55298211.0, "step": 31875 }, { "entropy": 5.65233473777771, "epoch": 2.480373468196849, "grad_norm": 1.1953125, "learning_rate": 0.0004379737480186078, "loss": 4.8805, "mean_token_accuracy": 0.20971971452236177, "num_tokens": 55306984.0, "step": 31880 }, { "entropy": 5.717571687698364, "epoch": 2.4807624975685663, "grad_norm": 1.2109375, "learning_rate": 0.00043795463810991956, "loss": 5.0181, "mean_token_accuracy": 0.19665150940418244, "num_tokens": 55316266.0, "step": 31885 }, { "entropy": 5.680613231658936, "epoch": 2.481151526940284, "grad_norm": 1.21875, "learning_rate": 0.0004379355257286541, "loss": 4.8831, "mean_token_accuracy": 0.21040845960378646, "num_tokens": 55324698.0, "step": 31890 }, { "entropy": 5.715203428268433, "epoch": 2.4815405563120017, "grad_norm": 1.2109375, "learning_rate": 0.00043791641087510136, "loss": 4.924, "mean_token_accuracy": 0.2130701720714569, "num_tokens": 55333033.0, "step": 31895 }, { "entropy": 5.7189977169036865, "epoch": 2.4819295856837194, "grad_norm": 1.21875, "learning_rate": 0.0004378972935495514, "loss": 5.0501, "mean_token_accuracy": 0.20443421006202697, "num_tokens": 55341110.0, "step": 31900 }, { "entropy": 5.694588994979858, "epoch": 2.4823186150554366, "grad_norm": 1.0859375, "learning_rate": 0.0004378781737522943, "loss": 4.9521, "mean_token_accuracy": 0.2057247519493103, "num_tokens": 55350156.0, "step": 31905 }, { "entropy": 5.7142040729522705, "epoch": 2.4827076444271543, "grad_norm": 1.1640625, "learning_rate": 0.00043785905148362007, "loss": 5.0103, "mean_token_accuracy": 0.2046424090862274, "num_tokens": 55358737.0, "step": 31910 }, { "entropy": 5.70101523399353, "epoch": 2.483096673798872, "grad_norm": 1.234375, "learning_rate": 0.00043783992674381903, "loss": 4.9115, "mean_token_accuracy": 0.21445125490427017, "num_tokens": 55366872.0, "step": 31915 }, { "entropy": 5.630595636367798, "epoch": 2.4834857031705893, "grad_norm": 1.15625, "learning_rate": 0.00043782079953318126, "loss": 4.9187, "mean_token_accuracy": 0.2079645276069641, "num_tokens": 55375675.0, "step": 31920 }, { "entropy": 5.716038751602173, "epoch": 2.483874732542307, "grad_norm": 1.3828125, "learning_rate": 0.0004378016698519971, "loss": 4.9342, "mean_token_accuracy": 0.2135305270552635, "num_tokens": 55382750.0, "step": 31925 }, { "entropy": 5.670153522491455, "epoch": 2.4842637619140246, "grad_norm": 1.28125, "learning_rate": 0.00043778253770055666, "loss": 4.9953, "mean_token_accuracy": 0.20455844700336456, "num_tokens": 55390852.0, "step": 31930 }, { "entropy": 5.665175294876098, "epoch": 2.484652791285742, "grad_norm": 1.21875, "learning_rate": 0.00043776340307915033, "loss": 4.9821, "mean_token_accuracy": 0.2067757025361061, "num_tokens": 55398789.0, "step": 31935 }, { "entropy": 5.688554954528809, "epoch": 2.4850418206574596, "grad_norm": 1.21875, "learning_rate": 0.0004377442659880684, "loss": 5.0162, "mean_token_accuracy": 0.19990355223417283, "num_tokens": 55408100.0, "step": 31940 }, { "entropy": 5.703671979904175, "epoch": 2.4854308500291773, "grad_norm": 1.171875, "learning_rate": 0.0004377251264276013, "loss": 4.9391, "mean_token_accuracy": 0.2164512977004051, "num_tokens": 55416718.0, "step": 31945 }, { "entropy": 5.7496038436889645, "epoch": 2.4858198794008945, "grad_norm": 1.21875, "learning_rate": 0.00043770598439803936, "loss": 5.0344, "mean_token_accuracy": 0.20583639293909073, "num_tokens": 55426149.0, "step": 31950 }, { "entropy": 5.705909538269043, "epoch": 2.4862089087726122, "grad_norm": 1.2265625, "learning_rate": 0.00043768683989967304, "loss": 4.9313, "mean_token_accuracy": 0.20502627342939378, "num_tokens": 55434379.0, "step": 31955 }, { "entropy": 5.690313863754272, "epoch": 2.48659793814433, "grad_norm": 1.25, "learning_rate": 0.00043766769293279294, "loss": 5.0144, "mean_token_accuracy": 0.19925765097141265, "num_tokens": 55442880.0, "step": 31960 }, { "entropy": 5.737645292282105, "epoch": 2.4869869675160476, "grad_norm": 1.375, "learning_rate": 0.00043764854349768957, "loss": 4.9824, "mean_token_accuracy": 0.2014351323246956, "num_tokens": 55452090.0, "step": 31965 }, { "entropy": 5.719658660888672, "epoch": 2.487375996887765, "grad_norm": 1.2421875, "learning_rate": 0.00043762939159465333, "loss": 5.0119, "mean_token_accuracy": 0.20578682869672776, "num_tokens": 55460271.0, "step": 31970 }, { "entropy": 5.648108005523682, "epoch": 2.4877650262594826, "grad_norm": 1.1953125, "learning_rate": 0.00043761023722397495, "loss": 4.863, "mean_token_accuracy": 0.2136958882212639, "num_tokens": 55468414.0, "step": 31975 }, { "entropy": 5.7232590675354, "epoch": 2.4881540556312003, "grad_norm": 1.171875, "learning_rate": 0.000437591080385945, "loss": 4.988, "mean_token_accuracy": 0.20705727934837342, "num_tokens": 55477658.0, "step": 31980 }, { "entropy": 5.698103284835815, "epoch": 2.4885430850029175, "grad_norm": 1.1953125, "learning_rate": 0.0004375719210808543, "loss": 4.9005, "mean_token_accuracy": 0.20672006011009217, "num_tokens": 55486536.0, "step": 31985 }, { "entropy": 5.687389755249024, "epoch": 2.4889321143746352, "grad_norm": 1.1796875, "learning_rate": 0.0004375527593089934, "loss": 4.9713, "mean_token_accuracy": 0.20389309674501419, "num_tokens": 55494995.0, "step": 31990 }, { "entropy": 5.707334518432617, "epoch": 2.489321143746353, "grad_norm": 1.21875, "learning_rate": 0.0004375335950706531, "loss": 4.9961, "mean_token_accuracy": 0.19581665694713593, "num_tokens": 55503392.0, "step": 31995 }, { "entropy": 5.671941518783569, "epoch": 2.4897101731180706, "grad_norm": 1.2421875, "learning_rate": 0.0004375144283661242, "loss": 4.9566, "mean_token_accuracy": 0.21021038740873338, "num_tokens": 55512211.0, "step": 32000 }, { "entropy": 5.645341444015503, "epoch": 2.490099202489788, "grad_norm": 1.125, "learning_rate": 0.0004374952591956975, "loss": 4.9253, "mean_token_accuracy": 0.21264472603797913, "num_tokens": 55520412.0, "step": 32005 }, { "entropy": 5.623662519454956, "epoch": 2.4904882318615056, "grad_norm": 1.1953125, "learning_rate": 0.00043747608755966396, "loss": 4.9265, "mean_token_accuracy": 0.20822539180517197, "num_tokens": 55529964.0, "step": 32010 }, { "entropy": 5.646495199203491, "epoch": 2.4908772612332233, "grad_norm": 1.171875, "learning_rate": 0.0004374569134583143, "loss": 4.9415, "mean_token_accuracy": 0.20723474472761155, "num_tokens": 55539111.0, "step": 32015 }, { "entropy": 5.669415855407715, "epoch": 2.4912662906049405, "grad_norm": 1.265625, "learning_rate": 0.0004374377368919396, "loss": 4.8958, "mean_token_accuracy": 0.2165445789694786, "num_tokens": 55547520.0, "step": 32020 }, { "entropy": 5.7277061462402346, "epoch": 2.4916553199766582, "grad_norm": 1.125, "learning_rate": 0.00043741855786083085, "loss": 5.005, "mean_token_accuracy": 0.20632379800081252, "num_tokens": 55557111.0, "step": 32025 }, { "entropy": 5.694525480270386, "epoch": 2.492044349348376, "grad_norm": 1.25, "learning_rate": 0.00043739937636527894, "loss": 4.9931, "mean_token_accuracy": 0.2034325882792473, "num_tokens": 55565383.0, "step": 32030 }, { "entropy": 5.734092426300049, "epoch": 2.492433378720093, "grad_norm": 1.234375, "learning_rate": 0.00043738019240557494, "loss": 4.9768, "mean_token_accuracy": 0.1990645334124565, "num_tokens": 55573668.0, "step": 32035 }, { "entropy": 5.730034303665161, "epoch": 2.492822408091811, "grad_norm": 1.1640625, "learning_rate": 0.00043736100598201, "loss": 4.9997, "mean_token_accuracy": 0.20446885228157044, "num_tokens": 55582716.0, "step": 32040 }, { "entropy": 5.622835731506347, "epoch": 2.4932114374635286, "grad_norm": 1.2265625, "learning_rate": 0.0004373418170948752, "loss": 4.9288, "mean_token_accuracy": 0.20589867532253264, "num_tokens": 55591472.0, "step": 32045 }, { "entropy": 5.72931752204895, "epoch": 2.493600466835246, "grad_norm": 1.203125, "learning_rate": 0.0004373226257444617, "loss": 4.9877, "mean_token_accuracy": 0.20828135311603546, "num_tokens": 55600022.0, "step": 32050 }, { "entropy": 5.780712652206421, "epoch": 2.4939894962069635, "grad_norm": 1.1953125, "learning_rate": 0.0004373034319310608, "loss": 5.0003, "mean_token_accuracy": 0.2065057411789894, "num_tokens": 55608854.0, "step": 32055 }, { "entropy": 5.611334419250488, "epoch": 2.4943785255786812, "grad_norm": 1.2421875, "learning_rate": 0.00043728423565496367, "loss": 4.9644, "mean_token_accuracy": 0.20855435729026794, "num_tokens": 55618246.0, "step": 32060 }, { "entropy": 5.768293857574463, "epoch": 2.494767554950399, "grad_norm": 1.3125, "learning_rate": 0.0004372650369164615, "loss": 5.0176, "mean_token_accuracy": 0.19946637004613876, "num_tokens": 55626706.0, "step": 32065 }, { "entropy": 5.70167350769043, "epoch": 2.495156584322116, "grad_norm": 1.265625, "learning_rate": 0.00043724583571584565, "loss": 4.9519, "mean_token_accuracy": 0.2066572055220604, "num_tokens": 55634810.0, "step": 32070 }, { "entropy": 5.723990964889526, "epoch": 2.495545613693834, "grad_norm": 1.21875, "learning_rate": 0.00043722663205340753, "loss": 5.0425, "mean_token_accuracy": 0.20333101451396943, "num_tokens": 55643801.0, "step": 32075 }, { "entropy": 5.674001741409302, "epoch": 2.4959346430655516, "grad_norm": 1.2421875, "learning_rate": 0.0004372074259294384, "loss": 4.9847, "mean_token_accuracy": 0.21265868544578553, "num_tokens": 55652236.0, "step": 32080 }, { "entropy": 5.680555105209351, "epoch": 2.496323672437269, "grad_norm": 1.2109375, "learning_rate": 0.0004371882173442299, "loss": 5.0247, "mean_token_accuracy": 0.20211978852748871, "num_tokens": 55660996.0, "step": 32085 }, { "entropy": 5.682969236373902, "epoch": 2.4967127018089865, "grad_norm": 1.171875, "learning_rate": 0.00043716900629807323, "loss": 5.0169, "mean_token_accuracy": 0.19793476909399033, "num_tokens": 55669766.0, "step": 32090 }, { "entropy": 5.689290237426758, "epoch": 2.497101731180704, "grad_norm": 1.1484375, "learning_rate": 0.00043714979279126006, "loss": 5.0216, "mean_token_accuracy": 0.20677298307418823, "num_tokens": 55679179.0, "step": 32095 }, { "entropy": 5.731968641281128, "epoch": 2.497490760552422, "grad_norm": 1.2265625, "learning_rate": 0.0004371305768240818, "loss": 4.9691, "mean_token_accuracy": 0.20334432125091553, "num_tokens": 55687554.0, "step": 32100 }, { "entropy": 5.6402841091156, "epoch": 2.497879789924139, "grad_norm": 1.1796875, "learning_rate": 0.0004371113583968302, "loss": 4.8641, "mean_token_accuracy": 0.21255872547626495, "num_tokens": 55695537.0, "step": 32105 }, { "entropy": 5.723702383041382, "epoch": 2.498268819295857, "grad_norm": 1.21875, "learning_rate": 0.0004370921375097967, "loss": 5.0531, "mean_token_accuracy": 0.20164308100938796, "num_tokens": 55703432.0, "step": 32110 }, { "entropy": 5.708382701873779, "epoch": 2.4986578486675746, "grad_norm": 1.2734375, "learning_rate": 0.00043707291416327307, "loss": 5.0174, "mean_token_accuracy": 0.21109808534383773, "num_tokens": 55712169.0, "step": 32115 }, { "entropy": 5.759221458435059, "epoch": 2.499046878039292, "grad_norm": 1.1875, "learning_rate": 0.0004370536883575509, "loss": 5.0344, "mean_token_accuracy": 0.1987149730324745, "num_tokens": 55720471.0, "step": 32120 }, { "entropy": 5.643730020523071, "epoch": 2.4994359074110095, "grad_norm": 1.2109375, "learning_rate": 0.0004370344600929219, "loss": 4.921, "mean_token_accuracy": 0.20534755438566207, "num_tokens": 55729188.0, "step": 32125 }, { "entropy": 5.691451740264893, "epoch": 2.499824936782727, "grad_norm": 1.2734375, "learning_rate": 0.0004370152293696779, "loss": 4.9594, "mean_token_accuracy": 0.20640091896057128, "num_tokens": 55738313.0, "step": 32130 }, { "entropy": 5.678961706161499, "epoch": 2.500213966154445, "grad_norm": 1.2734375, "learning_rate": 0.0004369959961881107, "loss": 4.9424, "mean_token_accuracy": 0.20312956869602203, "num_tokens": 55746849.0, "step": 32135 }, { "entropy": 5.681916904449463, "epoch": 2.500602995526162, "grad_norm": 1.234375, "learning_rate": 0.000436976760548512, "loss": 5.0033, "mean_token_accuracy": 0.20458417534828185, "num_tokens": 55755151.0, "step": 32140 }, { "entropy": 5.625197172164917, "epoch": 2.50099202489788, "grad_norm": 1.15625, "learning_rate": 0.00043695752245117393, "loss": 4.8881, "mean_token_accuracy": 0.21371252387762069, "num_tokens": 55763716.0, "step": 32145 }, { "entropy": 5.67463641166687, "epoch": 2.501381054269597, "grad_norm": 1.140625, "learning_rate": 0.0004369382818963882, "loss": 5.0048, "mean_token_accuracy": 0.20310600847005844, "num_tokens": 55772424.0, "step": 32150 }, { "entropy": 5.743211174011231, "epoch": 2.501770083641315, "grad_norm": 1.203125, "learning_rate": 0.0004369190388844467, "loss": 5.0774, "mean_token_accuracy": 0.202515809237957, "num_tokens": 55780084.0, "step": 32155 }, { "entropy": 5.657242774963379, "epoch": 2.5021591130130325, "grad_norm": 1.125, "learning_rate": 0.00043689979341564154, "loss": 4.926, "mean_token_accuracy": 0.2064460799098015, "num_tokens": 55788717.0, "step": 32160 }, { "entropy": 5.688762187957764, "epoch": 2.50254814238475, "grad_norm": 1.25, "learning_rate": 0.0004368805454902648, "loss": 4.9326, "mean_token_accuracy": 0.20461040884256362, "num_tokens": 55797166.0, "step": 32165 }, { "entropy": 5.763108777999878, "epoch": 2.5029371717564675, "grad_norm": 1.1875, "learning_rate": 0.00043686129510860826, "loss": 5.038, "mean_token_accuracy": 0.20395291447639466, "num_tokens": 55805702.0, "step": 32170 }, { "entropy": 5.672120141983032, "epoch": 2.503326201128185, "grad_norm": 1.21875, "learning_rate": 0.00043684204227096435, "loss": 4.9399, "mean_token_accuracy": 0.20846977680921555, "num_tokens": 55814938.0, "step": 32175 }, { "entropy": 5.675026226043701, "epoch": 2.503715230499903, "grad_norm": 1.203125, "learning_rate": 0.000436822786977625, "loss": 4.9727, "mean_token_accuracy": 0.20579477548599243, "num_tokens": 55823527.0, "step": 32180 }, { "entropy": 5.756680870056153, "epoch": 2.50410425987162, "grad_norm": 1.2578125, "learning_rate": 0.00043680352922888244, "loss": 5.0232, "mean_token_accuracy": 0.20665583461523057, "num_tokens": 55831924.0, "step": 32185 }, { "entropy": 5.688602781295776, "epoch": 2.504493289243338, "grad_norm": 1.21875, "learning_rate": 0.0004367842690250288, "loss": 4.9226, "mean_token_accuracy": 0.21271364986896515, "num_tokens": 55840799.0, "step": 32190 }, { "entropy": 5.626323795318603, "epoch": 2.5048823186150555, "grad_norm": 1.265625, "learning_rate": 0.0004367650063663565, "loss": 4.8735, "mean_token_accuracy": 0.21797142326831817, "num_tokens": 55848950.0, "step": 32195 }, { "entropy": 5.625584125518799, "epoch": 2.505271347986773, "grad_norm": 1.3125, "learning_rate": 0.0004367457412531576, "loss": 4.9506, "mean_token_accuracy": 0.21152906864881516, "num_tokens": 55857140.0, "step": 32200 }, { "entropy": 5.626463460922241, "epoch": 2.5056603773584905, "grad_norm": 1.1796875, "learning_rate": 0.0004367264736857245, "loss": 4.9567, "mean_token_accuracy": 0.20515696555376053, "num_tokens": 55865790.0, "step": 32205 }, { "entropy": 5.65329875946045, "epoch": 2.506049406730208, "grad_norm": 1.3046875, "learning_rate": 0.0004367072036643497, "loss": 4.8944, "mean_token_accuracy": 0.2074345976114273, "num_tokens": 55873598.0, "step": 32210 }, { "entropy": 5.702706432342529, "epoch": 2.506438436101926, "grad_norm": 1.1953125, "learning_rate": 0.00043668793118932536, "loss": 5.0378, "mean_token_accuracy": 0.2022973597049713, "num_tokens": 55882172.0, "step": 32215 }, { "entropy": 5.660653352737427, "epoch": 2.506827465473643, "grad_norm": 1.1953125, "learning_rate": 0.00043666865626094405, "loss": 4.908, "mean_token_accuracy": 0.20769427716732025, "num_tokens": 55890701.0, "step": 32220 }, { "entropy": 5.746435499191284, "epoch": 2.507216494845361, "grad_norm": 1.140625, "learning_rate": 0.00043664937887949825, "loss": 5.0492, "mean_token_accuracy": 0.1935226559638977, "num_tokens": 55899470.0, "step": 32225 }, { "entropy": 5.702598237991333, "epoch": 2.5076055242170785, "grad_norm": 1.3515625, "learning_rate": 0.0004366300990452803, "loss": 4.9507, "mean_token_accuracy": 0.2057075947523117, "num_tokens": 55907442.0, "step": 32230 }, { "entropy": 5.701928567886353, "epoch": 2.507994553588796, "grad_norm": 1.21875, "learning_rate": 0.00043661081675858295, "loss": 4.9789, "mean_token_accuracy": 0.20000474750995637, "num_tokens": 55915761.0, "step": 32235 }, { "entropy": 5.602290868759155, "epoch": 2.5083835829605134, "grad_norm": 1.3203125, "learning_rate": 0.00043659153201969865, "loss": 4.9656, "mean_token_accuracy": 0.20686676651239394, "num_tokens": 55924101.0, "step": 32240 }, { "entropy": 5.715670394897461, "epoch": 2.508772612332231, "grad_norm": 1.171875, "learning_rate": 0.0004365722448289201, "loss": 5.0867, "mean_token_accuracy": 0.19813872426748275, "num_tokens": 55933472.0, "step": 32245 }, { "entropy": 5.701338481903076, "epoch": 2.5091616417039484, "grad_norm": 1.1953125, "learning_rate": 0.0004365529551865399, "loss": 4.957, "mean_token_accuracy": 0.20066294223070144, "num_tokens": 55941962.0, "step": 32250 }, { "entropy": 5.6952441215515135, "epoch": 2.509550671075666, "grad_norm": 1.140625, "learning_rate": 0.00043653366309285066, "loss": 4.9579, "mean_token_accuracy": 0.2064356103539467, "num_tokens": 55951392.0, "step": 32255 }, { "entropy": 5.7033944606781, "epoch": 2.509939700447384, "grad_norm": 1.21875, "learning_rate": 0.0004365143685481452, "loss": 4.9349, "mean_token_accuracy": 0.21046387106180192, "num_tokens": 55959995.0, "step": 32260 }, { "entropy": 5.677881145477295, "epoch": 2.5103287298191015, "grad_norm": 1.25, "learning_rate": 0.0004364950715527164, "loss": 4.9244, "mean_token_accuracy": 0.2007057175040245, "num_tokens": 55967960.0, "step": 32265 }, { "entropy": 5.702776765823364, "epoch": 2.5107177591908187, "grad_norm": 1.203125, "learning_rate": 0.0004364757721068568, "loss": 4.9842, "mean_token_accuracy": 0.20668164640665054, "num_tokens": 55976620.0, "step": 32270 }, { "entropy": 5.63978762626648, "epoch": 2.5111067885625364, "grad_norm": 1.1875, "learning_rate": 0.00043645647021085945, "loss": 4.9357, "mean_token_accuracy": 0.2100381225347519, "num_tokens": 55985478.0, "step": 32275 }, { "entropy": 5.65053358078003, "epoch": 2.511495817934254, "grad_norm": 1.109375, "learning_rate": 0.00043643716586501706, "loss": 4.9386, "mean_token_accuracy": 0.20724314898252488, "num_tokens": 55994123.0, "step": 32280 }, { "entropy": 5.717314291000366, "epoch": 2.5118848473059714, "grad_norm": 1.2109375, "learning_rate": 0.00043641785906962276, "loss": 5.0134, "mean_token_accuracy": 0.20360230952501296, "num_tokens": 56003088.0, "step": 32285 }, { "entropy": 5.644305801391601, "epoch": 2.512273876677689, "grad_norm": 1.1328125, "learning_rate": 0.0004363985498249693, "loss": 4.9176, "mean_token_accuracy": 0.21126353442668916, "num_tokens": 56011349.0, "step": 32290 }, { "entropy": 5.622927474975586, "epoch": 2.512662906049407, "grad_norm": 1.2421875, "learning_rate": 0.00043637923813134974, "loss": 4.8814, "mean_token_accuracy": 0.2122231110930443, "num_tokens": 56020225.0, "step": 32295 }, { "entropy": 5.757718753814697, "epoch": 2.5130519354211245, "grad_norm": 1.3671875, "learning_rate": 0.00043635992398905713, "loss": 5.0106, "mean_token_accuracy": 0.21051690727472305, "num_tokens": 56028729.0, "step": 32300 }, { "entropy": 5.686721563339233, "epoch": 2.5134409647928417, "grad_norm": 1.1953125, "learning_rate": 0.0004363406073983844, "loss": 4.9599, "mean_token_accuracy": 0.20484041422605515, "num_tokens": 56037173.0, "step": 32305 }, { "entropy": 5.68464674949646, "epoch": 2.5138299941645594, "grad_norm": 1.09375, "learning_rate": 0.00043632128835962485, "loss": 5.0217, "mean_token_accuracy": 0.20162839591503143, "num_tokens": 56046013.0, "step": 32310 }, { "entropy": 5.7296977043151855, "epoch": 2.514219023536277, "grad_norm": 1.2578125, "learning_rate": 0.00043630196687307156, "loss": 5.0499, "mean_token_accuracy": 0.2007109194993973, "num_tokens": 56054942.0, "step": 32315 }, { "entropy": 5.773643922805786, "epoch": 2.5146080529079944, "grad_norm": 1.1328125, "learning_rate": 0.0004362826429390176, "loss": 5.0729, "mean_token_accuracy": 0.19170949161052703, "num_tokens": 56064033.0, "step": 32320 }, { "entropy": 5.7252696514129635, "epoch": 2.514997082279712, "grad_norm": 1.203125, "learning_rate": 0.00043626331655775624, "loss": 5.0014, "mean_token_accuracy": 0.210832941532135, "num_tokens": 56072534.0, "step": 32325 }, { "entropy": 5.670800065994262, "epoch": 2.51538611165143, "grad_norm": 1.2265625, "learning_rate": 0.00043624398772958075, "loss": 4.9096, "mean_token_accuracy": 0.21046853363513945, "num_tokens": 56081742.0, "step": 32330 }, { "entropy": 5.686340093612671, "epoch": 2.5157751410231475, "grad_norm": 1.2265625, "learning_rate": 0.0004362246564547844, "loss": 4.893, "mean_token_accuracy": 0.21005569100379945, "num_tokens": 56090659.0, "step": 32335 }, { "entropy": 5.665811920166016, "epoch": 2.5161641703948647, "grad_norm": 1.21875, "learning_rate": 0.00043620532273366044, "loss": 4.9678, "mean_token_accuracy": 0.20178682804107667, "num_tokens": 56099795.0, "step": 32340 }, { "entropy": 5.642307710647583, "epoch": 2.5165531997665824, "grad_norm": 1.3046875, "learning_rate": 0.0004361859865665024, "loss": 4.9865, "mean_token_accuracy": 0.20613325536251068, "num_tokens": 56107265.0, "step": 32345 }, { "entropy": 5.674318265914917, "epoch": 2.5169422291382997, "grad_norm": 1.171875, "learning_rate": 0.00043616664795360346, "loss": 4.9154, "mean_token_accuracy": 0.21458476930856704, "num_tokens": 56116434.0, "step": 32350 }, { "entropy": 5.714648342132568, "epoch": 2.5173312585100174, "grad_norm": 1.2578125, "learning_rate": 0.00043614730689525716, "loss": 5.0559, "mean_token_accuracy": 0.19878822118043898, "num_tokens": 56125356.0, "step": 32355 }, { "entropy": 5.7865228176116945, "epoch": 2.517720287881735, "grad_norm": 1.2421875, "learning_rate": 0.00043612796339175707, "loss": 5.088, "mean_token_accuracy": 0.2002721071243286, "num_tokens": 56133732.0, "step": 32360 }, { "entropy": 5.766636753082276, "epoch": 2.5181093172534528, "grad_norm": 1.3203125, "learning_rate": 0.00043610861744339653, "loss": 4.9549, "mean_token_accuracy": 0.212131005525589, "num_tokens": 56142037.0, "step": 32365 }, { "entropy": 5.72740364074707, "epoch": 2.5184983466251705, "grad_norm": 1.203125, "learning_rate": 0.0004360892690504692, "loss": 4.9859, "mean_token_accuracy": 0.20439280569553375, "num_tokens": 56151064.0, "step": 32370 }, { "entropy": 5.678330039978027, "epoch": 2.5188873759968877, "grad_norm": 1.1640625, "learning_rate": 0.0004360699182132685, "loss": 4.9539, "mean_token_accuracy": 0.20619552731513976, "num_tokens": 56159617.0, "step": 32375 }, { "entropy": 5.716180372238159, "epoch": 2.5192764053686054, "grad_norm": 1.234375, "learning_rate": 0.00043605056493208825, "loss": 4.9582, "mean_token_accuracy": 0.20762283504009246, "num_tokens": 56168941.0, "step": 32380 }, { "entropy": 5.711140823364258, "epoch": 2.5196654347403227, "grad_norm": 1.203125, "learning_rate": 0.000436031209207222, "loss": 4.9388, "mean_token_accuracy": 0.20835517197847367, "num_tokens": 56177321.0, "step": 32385 }, { "entropy": 5.691501808166504, "epoch": 2.5200544641120404, "grad_norm": 1.125, "learning_rate": 0.00043601185103896346, "loss": 5.0164, "mean_token_accuracy": 0.197288815677166, "num_tokens": 56185775.0, "step": 32390 }, { "entropy": 5.66971344947815, "epoch": 2.520443493483758, "grad_norm": 1.1640625, "learning_rate": 0.00043599249042760636, "loss": 5.0141, "mean_token_accuracy": 0.20495854169130326, "num_tokens": 56194949.0, "step": 32395 }, { "entropy": 5.713114881515503, "epoch": 2.5208325228554758, "grad_norm": 1.2890625, "learning_rate": 0.00043597312737344446, "loss": 4.9304, "mean_token_accuracy": 0.20252005457878114, "num_tokens": 56203314.0, "step": 32400 }, { "entropy": 5.655827808380127, "epoch": 2.521221552227193, "grad_norm": 1.2109375, "learning_rate": 0.00043595376187677157, "loss": 4.9808, "mean_token_accuracy": 0.2033636376261711, "num_tokens": 56211857.0, "step": 32405 }, { "entropy": 5.672402334213257, "epoch": 2.5216105815989107, "grad_norm": 1.1796875, "learning_rate": 0.00043593439393788147, "loss": 4.9647, "mean_token_accuracy": 0.2112138345837593, "num_tokens": 56220331.0, "step": 32410 }, { "entropy": 5.716690874099731, "epoch": 2.5219996109706284, "grad_norm": 1.25, "learning_rate": 0.0004359150235570682, "loss": 4.9694, "mean_token_accuracy": 0.20442885756492615, "num_tokens": 56228623.0, "step": 32415 }, { "entropy": 5.652269601821899, "epoch": 2.5223886403423457, "grad_norm": 1.3046875, "learning_rate": 0.0004358956507346255, "loss": 4.8813, "mean_token_accuracy": 0.21138719469308853, "num_tokens": 56237028.0, "step": 32420 }, { "entropy": 5.63721022605896, "epoch": 2.5227776697140634, "grad_norm": 1.265625, "learning_rate": 0.0004358762754708474, "loss": 4.9184, "mean_token_accuracy": 0.2093317613005638, "num_tokens": 56244955.0, "step": 32425 }, { "entropy": 5.643361330032349, "epoch": 2.523166699085781, "grad_norm": 1.234375, "learning_rate": 0.00043585689776602795, "loss": 4.9504, "mean_token_accuracy": 0.2042069599032402, "num_tokens": 56254020.0, "step": 32430 }, { "entropy": 5.666556453704834, "epoch": 2.5235557284574988, "grad_norm": 1.1875, "learning_rate": 0.00043583751762046104, "loss": 5.0024, "mean_token_accuracy": 0.20492732673883438, "num_tokens": 56262829.0, "step": 32435 }, { "entropy": 5.747067832946778, "epoch": 2.523944757829216, "grad_norm": 1.234375, "learning_rate": 0.0004358181350344408, "loss": 4.9786, "mean_token_accuracy": 0.20852915495634078, "num_tokens": 56271289.0, "step": 32440 }, { "entropy": 5.662958765029908, "epoch": 2.5243337872009337, "grad_norm": 1.265625, "learning_rate": 0.0004357987500082613, "loss": 4.9149, "mean_token_accuracy": 0.21260993033647538, "num_tokens": 56279701.0, "step": 32445 }, { "entropy": 5.6893940448760985, "epoch": 2.524722816572651, "grad_norm": 1.1875, "learning_rate": 0.00043577936254221675, "loss": 4.9329, "mean_token_accuracy": 0.21275499165058137, "num_tokens": 56288373.0, "step": 32450 }, { "entropy": 5.681892156600952, "epoch": 2.5251118459443687, "grad_norm": 1.1328125, "learning_rate": 0.0004357599726366013, "loss": 4.9629, "mean_token_accuracy": 0.2050608828663826, "num_tokens": 56297853.0, "step": 32455 }, { "entropy": 5.781163501739502, "epoch": 2.5255008753160864, "grad_norm": 1.3046875, "learning_rate": 0.0004357405802917091, "loss": 5.1129, "mean_token_accuracy": 0.19237100929021836, "num_tokens": 56306456.0, "step": 32460 }, { "entropy": 5.720829343795776, "epoch": 2.525889904687804, "grad_norm": 1.234375, "learning_rate": 0.0004357211855078345, "loss": 4.8728, "mean_token_accuracy": 0.21260956823825836, "num_tokens": 56314420.0, "step": 32465 }, { "entropy": 5.713835763931274, "epoch": 2.5262789340595218, "grad_norm": 1.2421875, "learning_rate": 0.00043570178828527157, "loss": 5.0244, "mean_token_accuracy": 0.200699882209301, "num_tokens": 56324011.0, "step": 32470 }, { "entropy": 5.653299808502197, "epoch": 2.526667963431239, "grad_norm": 1.2734375, "learning_rate": 0.0004356823886243149, "loss": 4.9225, "mean_token_accuracy": 0.21269055604934692, "num_tokens": 56332830.0, "step": 32475 }, { "entropy": 5.719474983215332, "epoch": 2.5270569928029567, "grad_norm": 1.3046875, "learning_rate": 0.00043566298652525875, "loss": 4.9675, "mean_token_accuracy": 0.20942385941743852, "num_tokens": 56341486.0, "step": 32480 }, { "entropy": 5.707043886184692, "epoch": 2.527446022174674, "grad_norm": 1.171875, "learning_rate": 0.00043564358198839746, "loss": 4.9986, "mean_token_accuracy": 0.20818624943494796, "num_tokens": 56349382.0, "step": 32485 }, { "entropy": 5.684169435501099, "epoch": 2.5278350515463917, "grad_norm": 1.203125, "learning_rate": 0.0004356241750140256, "loss": 5.0163, "mean_token_accuracy": 0.20484001338481903, "num_tokens": 56358335.0, "step": 32490 }, { "entropy": 5.7533947944641115, "epoch": 2.5282240809181094, "grad_norm": 1.3515625, "learning_rate": 0.00043560476560243743, "loss": 5.0359, "mean_token_accuracy": 0.207084022462368, "num_tokens": 56366777.0, "step": 32495 }, { "entropy": 5.772856378555298, "epoch": 2.528613110289827, "grad_norm": 1.25, "learning_rate": 0.0004355853537539276, "loss": 5.0442, "mean_token_accuracy": 0.20176659375429154, "num_tokens": 56375175.0, "step": 32500 }, { "entropy": 5.692911863327026, "epoch": 2.5290021396615443, "grad_norm": 1.2109375, "learning_rate": 0.0004355659394687906, "loss": 4.953, "mean_token_accuracy": 0.20362811535596848, "num_tokens": 56384442.0, "step": 32505 }, { "entropy": 5.7312903881073, "epoch": 2.529391169033262, "grad_norm": 1.25, "learning_rate": 0.0004355465227473211, "loss": 5.0246, "mean_token_accuracy": 0.1973666161298752, "num_tokens": 56392420.0, "step": 32510 }, { "entropy": 5.702166891098022, "epoch": 2.5297801984049797, "grad_norm": 1.1484375, "learning_rate": 0.0004355271035898136, "loss": 5.0425, "mean_token_accuracy": 0.20208789259195328, "num_tokens": 56400633.0, "step": 32515 }, { "entropy": 5.687926483154297, "epoch": 2.530169227776697, "grad_norm": 1.2421875, "learning_rate": 0.0004355076819965628, "loss": 4.9473, "mean_token_accuracy": 0.2072964757680893, "num_tokens": 56409606.0, "step": 32520 }, { "entropy": 5.720037364959717, "epoch": 2.5305582571484146, "grad_norm": 1.1328125, "learning_rate": 0.00043548825796786353, "loss": 5.0143, "mean_token_accuracy": 0.2104010283946991, "num_tokens": 56417724.0, "step": 32525 }, { "entropy": 5.685654211044311, "epoch": 2.5309472865201323, "grad_norm": 1.1640625, "learning_rate": 0.00043546883150401023, "loss": 4.977, "mean_token_accuracy": 0.19938676655292512, "num_tokens": 56426632.0, "step": 32530 }, { "entropy": 5.654092121124267, "epoch": 2.53133631589185, "grad_norm": 1.15625, "learning_rate": 0.00043544940260529787, "loss": 4.8914, "mean_token_accuracy": 0.20860636234283447, "num_tokens": 56435266.0, "step": 32535 }, { "entropy": 5.732477426528931, "epoch": 2.5317253452635673, "grad_norm": 1.171875, "learning_rate": 0.0004354299712720213, "loss": 5.0198, "mean_token_accuracy": 0.20452337414026261, "num_tokens": 56443335.0, "step": 32540 }, { "entropy": 5.697994661331177, "epoch": 2.532114374635285, "grad_norm": 1.28125, "learning_rate": 0.0004354105375044752, "loss": 4.975, "mean_token_accuracy": 0.20491466224193572, "num_tokens": 56452657.0, "step": 32545 }, { "entropy": 5.75987753868103, "epoch": 2.5325034040070027, "grad_norm": 1.2421875, "learning_rate": 0.00043539110130295445, "loss": 5.0476, "mean_token_accuracy": 0.19844842553138733, "num_tokens": 56461925.0, "step": 32550 }, { "entropy": 5.742925691604614, "epoch": 2.53289243337872, "grad_norm": 1.234375, "learning_rate": 0.00043537166266775405, "loss": 4.9551, "mean_token_accuracy": 0.21063372045755385, "num_tokens": 56470356.0, "step": 32555 }, { "entropy": 5.664897441864014, "epoch": 2.5332814627504376, "grad_norm": 1.2734375, "learning_rate": 0.000435352221599169, "loss": 5.0393, "mean_token_accuracy": 0.20574050545692443, "num_tokens": 56478754.0, "step": 32560 }, { "entropy": 5.651407527923584, "epoch": 2.5336704921221553, "grad_norm": 1.1796875, "learning_rate": 0.0004353327780974941, "loss": 4.9765, "mean_token_accuracy": 0.21022948771715164, "num_tokens": 56487089.0, "step": 32565 }, { "entropy": 5.747541189193726, "epoch": 2.534059521493873, "grad_norm": 1.1796875, "learning_rate": 0.0004353133321630246, "loss": 4.993, "mean_token_accuracy": 0.20047308951616288, "num_tokens": 56496416.0, "step": 32570 }, { "entropy": 5.689629745483399, "epoch": 2.5344485508655903, "grad_norm": 1.21875, "learning_rate": 0.0004352938837960554, "loss": 4.9691, "mean_token_accuracy": 0.2062140703201294, "num_tokens": 56505675.0, "step": 32575 }, { "entropy": 5.72014856338501, "epoch": 2.534837580237308, "grad_norm": 1.2265625, "learning_rate": 0.00043527443299688166, "loss": 4.9856, "mean_token_accuracy": 0.20607443004846573, "num_tokens": 56514855.0, "step": 32580 }, { "entropy": 5.79931607246399, "epoch": 2.5352266096090252, "grad_norm": 1.171875, "learning_rate": 0.00043525497976579843, "loss": 5.0716, "mean_token_accuracy": 0.1997635468840599, "num_tokens": 56524073.0, "step": 32585 }, { "entropy": 5.749551773071289, "epoch": 2.535615638980743, "grad_norm": 1.1171875, "learning_rate": 0.000435235524103101, "loss": 4.997, "mean_token_accuracy": 0.205545075237751, "num_tokens": 56534127.0, "step": 32590 }, { "entropy": 5.832773208618164, "epoch": 2.5360046683524606, "grad_norm": 1.265625, "learning_rate": 0.0004352160660090846, "loss": 5.0867, "mean_token_accuracy": 0.19695114344358444, "num_tokens": 56543219.0, "step": 32595 }, { "entropy": 5.756842136383057, "epoch": 2.5363936977241783, "grad_norm": 1.25, "learning_rate": 0.0004351966054840443, "loss": 5.041, "mean_token_accuracy": 0.2079777702689171, "num_tokens": 56552146.0, "step": 32600 }, { "entropy": 5.753754997253418, "epoch": 2.5367827270958956, "grad_norm": 1.375, "learning_rate": 0.00043517714252827556, "loss": 5.0966, "mean_token_accuracy": 0.19559707790613173, "num_tokens": 56561780.0, "step": 32605 }, { "entropy": 5.661686420440674, "epoch": 2.5371717564676133, "grad_norm": 1.2265625, "learning_rate": 0.0004351576771420737, "loss": 4.9239, "mean_token_accuracy": 0.21274486631155015, "num_tokens": 56569864.0, "step": 32610 }, { "entropy": 5.770101594924927, "epoch": 2.537560785839331, "grad_norm": 1.1875, "learning_rate": 0.0004351382093257339, "loss": 5.095, "mean_token_accuracy": 0.1918701246380806, "num_tokens": 56578506.0, "step": 32615 }, { "entropy": 5.745925807952881, "epoch": 2.5379498152110482, "grad_norm": 1.1875, "learning_rate": 0.0004351187390795517, "loss": 4.9945, "mean_token_accuracy": 0.21041468828916549, "num_tokens": 56587264.0, "step": 32620 }, { "entropy": 5.724934434890747, "epoch": 2.538338844582766, "grad_norm": 1.2421875, "learning_rate": 0.00043509926640382244, "loss": 4.8896, "mean_token_accuracy": 0.21463720500469208, "num_tokens": 56595779.0, "step": 32625 }, { "entropy": 5.609466552734375, "epoch": 2.5387278739544836, "grad_norm": 1.2890625, "learning_rate": 0.0004350797912988417, "loss": 4.9357, "mean_token_accuracy": 0.2078867331147194, "num_tokens": 56604251.0, "step": 32630 }, { "entropy": 5.637156248092651, "epoch": 2.5391169033262013, "grad_norm": 1.2578125, "learning_rate": 0.0004350603137649049, "loss": 4.9519, "mean_token_accuracy": 0.1993897721171379, "num_tokens": 56612527.0, "step": 32635 }, { "entropy": 5.735514831542969, "epoch": 2.5395059326979186, "grad_norm": 1.21875, "learning_rate": 0.0004350408338023075, "loss": 4.9637, "mean_token_accuracy": 0.2033057764172554, "num_tokens": 56621139.0, "step": 32640 }, { "entropy": 5.706165075302124, "epoch": 2.5398949620696363, "grad_norm": 1.15625, "learning_rate": 0.0004350213514113453, "loss": 4.9427, "mean_token_accuracy": 0.20647711604833602, "num_tokens": 56629757.0, "step": 32645 }, { "entropy": 5.634636402130127, "epoch": 2.540283991441354, "grad_norm": 1.2421875, "learning_rate": 0.00043500186659231377, "loss": 4.8778, "mean_token_accuracy": 0.21466563791036605, "num_tokens": 56638518.0, "step": 32650 }, { "entropy": 5.67065544128418, "epoch": 2.5406730208130712, "grad_norm": 1.2265625, "learning_rate": 0.0004349823793455086, "loss": 4.9707, "mean_token_accuracy": 0.19557361006736756, "num_tokens": 56647542.0, "step": 32655 }, { "entropy": 5.731881761550904, "epoch": 2.541062050184789, "grad_norm": 1.265625, "learning_rate": 0.00043496288967122547, "loss": 4.9575, "mean_token_accuracy": 0.20484811216592788, "num_tokens": 56655771.0, "step": 32660 }, { "entropy": 5.654489898681641, "epoch": 2.5414510795565066, "grad_norm": 1.2734375, "learning_rate": 0.00043494339756976007, "loss": 4.907, "mean_token_accuracy": 0.2120533749461174, "num_tokens": 56663895.0, "step": 32665 }, { "entropy": 5.640347480773926, "epoch": 2.5418401089282243, "grad_norm": 1.1640625, "learning_rate": 0.0004349239030414082, "loss": 4.989, "mean_token_accuracy": 0.19992637783288955, "num_tokens": 56672557.0, "step": 32670 }, { "entropy": 5.681819200515747, "epoch": 2.5422291382999416, "grad_norm": 1.2109375, "learning_rate": 0.00043490440608646557, "loss": 5.0568, "mean_token_accuracy": 0.2023283913731575, "num_tokens": 56681095.0, "step": 32675 }, { "entropy": 5.743478631973266, "epoch": 2.5426181676716593, "grad_norm": 1.21875, "learning_rate": 0.00043488490670522817, "loss": 5.0487, "mean_token_accuracy": 0.20551540702581406, "num_tokens": 56689347.0, "step": 32680 }, { "entropy": 5.6818742752075195, "epoch": 2.5430071970433765, "grad_norm": 1.15625, "learning_rate": 0.0004348654048979918, "loss": 4.9239, "mean_token_accuracy": 0.2105672091245651, "num_tokens": 56698348.0, "step": 32685 }, { "entropy": 5.742013692855835, "epoch": 2.543396226415094, "grad_norm": 1.1484375, "learning_rate": 0.0004348459006650523, "loss": 5.0319, "mean_token_accuracy": 0.2050494596362114, "num_tokens": 56707215.0, "step": 32690 }, { "entropy": 5.734966850280761, "epoch": 2.543785255786812, "grad_norm": 1.2421875, "learning_rate": 0.00043482639400670576, "loss": 5.0435, "mean_token_accuracy": 0.20058435946702957, "num_tokens": 56716190.0, "step": 32695 }, { "entropy": 5.675022745132447, "epoch": 2.5441742851585296, "grad_norm": 1.21875, "learning_rate": 0.000434806884923248, "loss": 4.9179, "mean_token_accuracy": 0.2125401332974434, "num_tokens": 56724494.0, "step": 32700 }, { "entropy": 5.689189100265503, "epoch": 2.5445633145302473, "grad_norm": 1.203125, "learning_rate": 0.0004347873734149752, "loss": 4.9253, "mean_token_accuracy": 0.20846274942159654, "num_tokens": 56732648.0, "step": 32705 }, { "entropy": 5.833060455322266, "epoch": 2.5449523439019646, "grad_norm": 1.1328125, "learning_rate": 0.00043476785948218325, "loss": 5.148, "mean_token_accuracy": 0.19917895793914794, "num_tokens": 56742270.0, "step": 32710 }, { "entropy": 5.747015714645386, "epoch": 2.5453413732736823, "grad_norm": 1.171875, "learning_rate": 0.00043474834312516835, "loss": 4.9676, "mean_token_accuracy": 0.20397334694862365, "num_tokens": 56750982.0, "step": 32715 }, { "entropy": 5.66340389251709, "epoch": 2.5457304026453995, "grad_norm": 1.2578125, "learning_rate": 0.0004347288243442266, "loss": 4.9125, "mean_token_accuracy": 0.20953238904476165, "num_tokens": 56759443.0, "step": 32720 }, { "entropy": 5.743810987472534, "epoch": 2.546119432017117, "grad_norm": 1.203125, "learning_rate": 0.0004347093031396543, "loss": 4.9959, "mean_token_accuracy": 0.20277517437934875, "num_tokens": 56768704.0, "step": 32725 }, { "entropy": 5.743033838272095, "epoch": 2.546508461388835, "grad_norm": 1.4296875, "learning_rate": 0.0004346897795117474, "loss": 5.0096, "mean_token_accuracy": 0.20840426832437514, "num_tokens": 56777274.0, "step": 32730 }, { "entropy": 5.744246006011963, "epoch": 2.5468974907605526, "grad_norm": 1.234375, "learning_rate": 0.0004346702534608023, "loss": 4.9852, "mean_token_accuracy": 0.20123767703771592, "num_tokens": 56786184.0, "step": 32735 }, { "entropy": 5.683019065856934, "epoch": 2.54728652013227, "grad_norm": 1.21875, "learning_rate": 0.0004346507249871153, "loss": 5.0067, "mean_token_accuracy": 0.20231589674949646, "num_tokens": 56795156.0, "step": 32740 }, { "entropy": 5.769675970077515, "epoch": 2.5476755495039876, "grad_norm": 1.1953125, "learning_rate": 0.0004346311940909826, "loss": 5.0253, "mean_token_accuracy": 0.20264360010623933, "num_tokens": 56803829.0, "step": 32745 }, { "entropy": 5.731981086730957, "epoch": 2.5480645788757053, "grad_norm": 1.171875, "learning_rate": 0.00043461166077270056, "loss": 4.9677, "mean_token_accuracy": 0.21354265064001082, "num_tokens": 56813191.0, "step": 32750 }, { "entropy": 5.759401178359985, "epoch": 2.5484536082474225, "grad_norm": 1.21875, "learning_rate": 0.00043459212503256566, "loss": 5.0261, "mean_token_accuracy": 0.20097543746232988, "num_tokens": 56822338.0, "step": 32755 }, { "entropy": 5.723289155960083, "epoch": 2.54884263761914, "grad_norm": 1.140625, "learning_rate": 0.0004345725868708743, "loss": 4.9722, "mean_token_accuracy": 0.20849536657333373, "num_tokens": 56830873.0, "step": 32760 }, { "entropy": 5.72843370437622, "epoch": 2.549231666990858, "grad_norm": 1.1328125, "learning_rate": 0.00043455304628792294, "loss": 4.9449, "mean_token_accuracy": 0.2043985441327095, "num_tokens": 56839462.0, "step": 32765 }, { "entropy": 5.762696552276611, "epoch": 2.5496206963625756, "grad_norm": 1.2734375, "learning_rate": 0.000434533503284008, "loss": 5.0113, "mean_token_accuracy": 0.2026275485754013, "num_tokens": 56847713.0, "step": 32770 }, { "entropy": 5.752037239074707, "epoch": 2.550009725734293, "grad_norm": 1.265625, "learning_rate": 0.0004345139578594261, "loss": 4.9291, "mean_token_accuracy": 0.21120268404483794, "num_tokens": 56856507.0, "step": 32775 }, { "entropy": 5.763977956771851, "epoch": 2.5503987551060106, "grad_norm": 1.1796875, "learning_rate": 0.0004344944100144738, "loss": 5.0261, "mean_token_accuracy": 0.2045073002576828, "num_tokens": 56864772.0, "step": 32780 }, { "entropy": 5.747343301773071, "epoch": 2.550787784477728, "grad_norm": 1.234375, "learning_rate": 0.00043447485974944765, "loss": 5.0118, "mean_token_accuracy": 0.1981327250599861, "num_tokens": 56872886.0, "step": 32785 }, { "entropy": 5.709926509857178, "epoch": 2.5511768138494455, "grad_norm": 1.2265625, "learning_rate": 0.00043445530706464437, "loss": 4.9865, "mean_token_accuracy": 0.2038103386759758, "num_tokens": 56882079.0, "step": 32790 }, { "entropy": 5.678872203826904, "epoch": 2.551565843221163, "grad_norm": 1.21875, "learning_rate": 0.0004344357519603606, "loss": 4.9256, "mean_token_accuracy": 0.21085868775844574, "num_tokens": 56890237.0, "step": 32795 }, { "entropy": 5.746160221099854, "epoch": 2.551954872592881, "grad_norm": 1.171875, "learning_rate": 0.0004344161944368931, "loss": 5.0297, "mean_token_accuracy": 0.19819879829883574, "num_tokens": 56898703.0, "step": 32800 }, { "entropy": 5.782669639587402, "epoch": 2.5523439019645986, "grad_norm": 1.2890625, "learning_rate": 0.0004343966344945385, "loss": 5.0963, "mean_token_accuracy": 0.19939059317111968, "num_tokens": 56907954.0, "step": 32805 }, { "entropy": 5.630080318450927, "epoch": 2.552732931336316, "grad_norm": 1.265625, "learning_rate": 0.00043437707213359375, "loss": 4.8606, "mean_token_accuracy": 0.21302750259637832, "num_tokens": 56916316.0, "step": 32810 }, { "entropy": 5.648952293395996, "epoch": 2.5531219607080335, "grad_norm": 1.28125, "learning_rate": 0.00043435750735435554, "loss": 4.9344, "mean_token_accuracy": 0.2141449570655823, "num_tokens": 56924386.0, "step": 32815 }, { "entropy": 5.750272226333618, "epoch": 2.553510990079751, "grad_norm": 1.1953125, "learning_rate": 0.00043433794015712085, "loss": 4.9927, "mean_token_accuracy": 0.2134346604347229, "num_tokens": 56932782.0, "step": 32820 }, { "entropy": 5.744696807861328, "epoch": 2.5539000194514685, "grad_norm": 1.2421875, "learning_rate": 0.0004343183705421865, "loss": 4.9312, "mean_token_accuracy": 0.2053668573498726, "num_tokens": 56941030.0, "step": 32825 }, { "entropy": 5.839809894561768, "epoch": 2.554289048823186, "grad_norm": 1.2734375, "learning_rate": 0.0004342987985098495, "loss": 5.1767, "mean_token_accuracy": 0.19185733795166016, "num_tokens": 56949525.0, "step": 32830 }, { "entropy": 5.64550256729126, "epoch": 2.554678078194904, "grad_norm": 1.2265625, "learning_rate": 0.00043427922406040676, "loss": 4.9324, "mean_token_accuracy": 0.2062081903219223, "num_tokens": 56958317.0, "step": 32835 }, { "entropy": 5.69843316078186, "epoch": 2.555067107566621, "grad_norm": 1.25, "learning_rate": 0.00043425964719415525, "loss": 4.9947, "mean_token_accuracy": 0.2063819944858551, "num_tokens": 56966848.0, "step": 32840 }, { "entropy": 5.760273456573486, "epoch": 2.555456136938339, "grad_norm": 1.265625, "learning_rate": 0.00043424006791139213, "loss": 5.0448, "mean_token_accuracy": 0.1983099490404129, "num_tokens": 56975448.0, "step": 32845 }, { "entropy": 5.766364669799804, "epoch": 2.5558451663100565, "grad_norm": 1.2421875, "learning_rate": 0.00043422048621241443, "loss": 5.0634, "mean_token_accuracy": 0.20120457410812378, "num_tokens": 56983800.0, "step": 32850 }, { "entropy": 5.758888626098633, "epoch": 2.556234195681774, "grad_norm": 1.171875, "learning_rate": 0.00043420090209751933, "loss": 4.9844, "mean_token_accuracy": 0.21171823590993882, "num_tokens": 56992505.0, "step": 32855 }, { "entropy": 5.691100978851319, "epoch": 2.5566232250534915, "grad_norm": 1.3125, "learning_rate": 0.0004341813155670039, "loss": 4.9009, "mean_token_accuracy": 0.21443814188241958, "num_tokens": 57000471.0, "step": 32860 }, { "entropy": 5.78898549079895, "epoch": 2.557012254425209, "grad_norm": 1.2578125, "learning_rate": 0.0004341617266211654, "loss": 4.9701, "mean_token_accuracy": 0.20404594540596008, "num_tokens": 57008708.0, "step": 32865 }, { "entropy": 5.7921617984771725, "epoch": 2.557401283796927, "grad_norm": 1.1796875, "learning_rate": 0.000434142135260301, "loss": 5.0844, "mean_token_accuracy": 0.1976342558860779, "num_tokens": 57017395.0, "step": 32870 }, { "entropy": 5.788590669631958, "epoch": 2.557790313168644, "grad_norm": 1.25, "learning_rate": 0.000434122541484708, "loss": 4.9493, "mean_token_accuracy": 0.19973426163196564, "num_tokens": 57025535.0, "step": 32875 }, { "entropy": 5.7216543674469, "epoch": 2.558179342540362, "grad_norm": 1.1953125, "learning_rate": 0.0004341029452946837, "loss": 4.9252, "mean_token_accuracy": 0.20863054990768432, "num_tokens": 57034029.0, "step": 32880 }, { "entropy": 5.719476652145386, "epoch": 2.558568371912079, "grad_norm": 1.1953125, "learning_rate": 0.0004340833466905254, "loss": 5.0708, "mean_token_accuracy": 0.19987746328115463, "num_tokens": 57042779.0, "step": 32885 }, { "entropy": 5.751765966415405, "epoch": 2.558957401283797, "grad_norm": 1.1796875, "learning_rate": 0.00043406374567253055, "loss": 5.0127, "mean_token_accuracy": 0.20267540961503983, "num_tokens": 57052506.0, "step": 32890 }, { "entropy": 5.764599990844727, "epoch": 2.5593464306555145, "grad_norm": 1.21875, "learning_rate": 0.0004340441422409965, "loss": 5.054, "mean_token_accuracy": 0.19932885766029357, "num_tokens": 57061307.0, "step": 32895 }, { "entropy": 5.739732551574707, "epoch": 2.559735460027232, "grad_norm": 1.21875, "learning_rate": 0.0004340245363962209, "loss": 5.0728, "mean_token_accuracy": 0.19756257981061937, "num_tokens": 57069991.0, "step": 32900 }, { "entropy": 5.711991453170777, "epoch": 2.56012448939895, "grad_norm": 1.234375, "learning_rate": 0.00043400492813850083, "loss": 4.9657, "mean_token_accuracy": 0.20493126213550567, "num_tokens": 57077768.0, "step": 32905 }, { "entropy": 5.703821182250977, "epoch": 2.560513518770667, "grad_norm": 1.25, "learning_rate": 0.00043398531746813426, "loss": 4.9527, "mean_token_accuracy": 0.20260990560054778, "num_tokens": 57086666.0, "step": 32910 }, { "entropy": 5.681469058990478, "epoch": 2.560902548142385, "grad_norm": 1.21875, "learning_rate": 0.00043396570438541845, "loss": 4.9613, "mean_token_accuracy": 0.2075706258416176, "num_tokens": 57095352.0, "step": 32915 }, { "entropy": 5.630874538421631, "epoch": 2.561291577514102, "grad_norm": 1.2890625, "learning_rate": 0.0004339460888906512, "loss": 4.9496, "mean_token_accuracy": 0.2109759196639061, "num_tokens": 57104535.0, "step": 32920 }, { "entropy": 5.757719612121582, "epoch": 2.5616806068858198, "grad_norm": 1.234375, "learning_rate": 0.0004339264709841299, "loss": 4.9685, "mean_token_accuracy": 0.20532671809196473, "num_tokens": 57112523.0, "step": 32925 }, { "entropy": 5.636892080307007, "epoch": 2.5620696362575375, "grad_norm": 1.1875, "learning_rate": 0.00043390685066615244, "loss": 4.8829, "mean_token_accuracy": 0.20538311898708345, "num_tokens": 57120921.0, "step": 32930 }, { "entropy": 5.705670690536499, "epoch": 2.562458665629255, "grad_norm": 1.234375, "learning_rate": 0.0004338872279370164, "loss": 5.0331, "mean_token_accuracy": 0.20296749472618103, "num_tokens": 57128398.0, "step": 32935 }, { "entropy": 5.7392230987548825, "epoch": 2.5628476950009724, "grad_norm": 1.1875, "learning_rate": 0.0004338676027970196, "loss": 5.0066, "mean_token_accuracy": 0.20430795699357987, "num_tokens": 57136888.0, "step": 32940 }, { "entropy": 5.708044719696045, "epoch": 2.56323672437269, "grad_norm": 1.1640625, "learning_rate": 0.00043384797524645977, "loss": 4.9635, "mean_token_accuracy": 0.2067028671503067, "num_tokens": 57144795.0, "step": 32945 }, { "entropy": 5.76344108581543, "epoch": 2.563625753744408, "grad_norm": 1.2578125, "learning_rate": 0.0004338283452856348, "loss": 5.102, "mean_token_accuracy": 0.20271386653184892, "num_tokens": 57153073.0, "step": 32950 }, { "entropy": 5.770097970962524, "epoch": 2.564014783116125, "grad_norm": 1.234375, "learning_rate": 0.0004338087129148425, "loss": 5.0636, "mean_token_accuracy": 0.20102135092020035, "num_tokens": 57161536.0, "step": 32955 }, { "entropy": 5.739584922790527, "epoch": 2.5644038124878428, "grad_norm": 1.3515625, "learning_rate": 0.00043378907813438066, "loss": 5.0427, "mean_token_accuracy": 0.19870738238096236, "num_tokens": 57170065.0, "step": 32960 }, { "entropy": 5.648278617858887, "epoch": 2.5647928418595605, "grad_norm": 1.3203125, "learning_rate": 0.00043376944094454734, "loss": 4.8858, "mean_token_accuracy": 0.21631564050912858, "num_tokens": 57179063.0, "step": 32965 }, { "entropy": 5.624661111831665, "epoch": 2.565181871231278, "grad_norm": 1.234375, "learning_rate": 0.00043374980134564044, "loss": 4.8242, "mean_token_accuracy": 0.22710851430892945, "num_tokens": 57187803.0, "step": 32970 }, { "entropy": 5.755528974533081, "epoch": 2.5655709006029954, "grad_norm": 1.1875, "learning_rate": 0.00043373015933795804, "loss": 5.0763, "mean_token_accuracy": 0.1952992022037506, "num_tokens": 57196428.0, "step": 32975 }, { "entropy": 5.73827862739563, "epoch": 2.565959929974713, "grad_norm": 1.1640625, "learning_rate": 0.0004337105149217981, "loss": 5.0181, "mean_token_accuracy": 0.2071666583418846, "num_tokens": 57205541.0, "step": 32980 }, { "entropy": 5.6742795467376705, "epoch": 2.566348959346431, "grad_norm": 1.1484375, "learning_rate": 0.00043369086809745875, "loss": 4.9613, "mean_token_accuracy": 0.2087692379951477, "num_tokens": 57214436.0, "step": 32985 }, { "entropy": 5.700528526306153, "epoch": 2.566737988718148, "grad_norm": 1.2265625, "learning_rate": 0.00043367121886523795, "loss": 4.9965, "mean_token_accuracy": 0.20478546768426895, "num_tokens": 57222359.0, "step": 32990 }, { "entropy": 5.665486240386963, "epoch": 2.5671270180898658, "grad_norm": 1.2265625, "learning_rate": 0.000433651567225434, "loss": 4.9043, "mean_token_accuracy": 0.2015649989247322, "num_tokens": 57230226.0, "step": 32995 }, { "entropy": 5.69070086479187, "epoch": 2.5675160474615835, "grad_norm": 1.2109375, "learning_rate": 0.0004336319131783451, "loss": 5.0357, "mean_token_accuracy": 0.2023887574672699, "num_tokens": 57239585.0, "step": 33000 }, { "epoch": 2.5675160474615835, "eval_entropy": 5.43900870652699, "eval_loss": 5.0684380531311035, "eval_mean_token_accuracy": 0.21090499936559087, "eval_num_tokens": 57239585.0, "eval_runtime": 21.6226, "eval_samples_per_second": 1921.974, "eval_steps_per_second": 240.258, "step": 33000 }, { "entropy": 5.684931373596191, "epoch": 2.567905076833301, "grad_norm": 1.21875, "learning_rate": 0.00043361225672426933, "loss": 5.0099, "mean_token_accuracy": 0.20806504040956497, "num_tokens": 57248108.0, "step": 33005 }, { "entropy": 5.739784479141235, "epoch": 2.5682941062050184, "grad_norm": 1.3515625, "learning_rate": 0.0004335925978635051, "loss": 4.9616, "mean_token_accuracy": 0.20147510021924972, "num_tokens": 57257758.0, "step": 33010 }, { "entropy": 5.768184804916382, "epoch": 2.568683135576736, "grad_norm": 1.203125, "learning_rate": 0.00043357293659635057, "loss": 5.0359, "mean_token_accuracy": 0.20049208402633667, "num_tokens": 57267180.0, "step": 33015 }, { "entropy": 5.715865278244019, "epoch": 2.5690721649484534, "grad_norm": 1.265625, "learning_rate": 0.0004335532729231041, "loss": 4.9613, "mean_token_accuracy": 0.20974528193473815, "num_tokens": 57275756.0, "step": 33020 }, { "entropy": 5.736023902893066, "epoch": 2.569461194320171, "grad_norm": 1.34375, "learning_rate": 0.00043353360684406415, "loss": 4.9875, "mean_token_accuracy": 0.20403016954660416, "num_tokens": 57284593.0, "step": 33025 }, { "entropy": 5.731328964233398, "epoch": 2.5698502236918888, "grad_norm": 1.25, "learning_rate": 0.000433513938359529, "loss": 5.0379, "mean_token_accuracy": 0.1984589070081711, "num_tokens": 57293304.0, "step": 33030 }, { "entropy": 5.691557884216309, "epoch": 2.5702392530636065, "grad_norm": 1.109375, "learning_rate": 0.0004334942674697971, "loss": 4.9809, "mean_token_accuracy": 0.20778930485248565, "num_tokens": 57302057.0, "step": 33035 }, { "entropy": 5.723137331008911, "epoch": 2.5706282824353237, "grad_norm": 1.2265625, "learning_rate": 0.00043347459417516696, "loss": 5.0136, "mean_token_accuracy": 0.20180075317621232, "num_tokens": 57310576.0, "step": 33040 }, { "entropy": 5.753122758865357, "epoch": 2.5710173118070414, "grad_norm": 1.3203125, "learning_rate": 0.0004334549184759371, "loss": 4.9718, "mean_token_accuracy": 0.20943214148283004, "num_tokens": 57319103.0, "step": 33045 }, { "entropy": 5.791648101806641, "epoch": 2.571406341178759, "grad_norm": 1.2109375, "learning_rate": 0.0004334352403724062, "loss": 5.0656, "mean_token_accuracy": 0.19812626242637635, "num_tokens": 57329075.0, "step": 33050 }, { "entropy": 5.794554996490478, "epoch": 2.5717953705504764, "grad_norm": 1.234375, "learning_rate": 0.00043341555986487254, "loss": 4.9393, "mean_token_accuracy": 0.20929297655820847, "num_tokens": 57337986.0, "step": 33055 }, { "entropy": 5.724161434173584, "epoch": 2.572184399922194, "grad_norm": 1.2421875, "learning_rate": 0.0004333958769536349, "loss": 5.069, "mean_token_accuracy": 0.19719740599393845, "num_tokens": 57346440.0, "step": 33060 }, { "entropy": 5.728434658050537, "epoch": 2.5725734292939118, "grad_norm": 1.203125, "learning_rate": 0.0004333761916389921, "loss": 5.0519, "mean_token_accuracy": 0.19512680917978287, "num_tokens": 57354791.0, "step": 33065 }, { "entropy": 5.697811794281006, "epoch": 2.5729624586656294, "grad_norm": 1.2578125, "learning_rate": 0.0004333565039212425, "loss": 4.9747, "mean_token_accuracy": 0.20298539102077484, "num_tokens": 57363200.0, "step": 33070 }, { "entropy": 5.704525423049927, "epoch": 2.5733514880373467, "grad_norm": 1.28125, "learning_rate": 0.0004333368138006851, "loss": 4.9494, "mean_token_accuracy": 0.2069337323307991, "num_tokens": 57371830.0, "step": 33075 }, { "entropy": 5.793922567367554, "epoch": 2.5737405174090644, "grad_norm": 1.21875, "learning_rate": 0.0004333171212776185, "loss": 5.072, "mean_token_accuracy": 0.19606577455997468, "num_tokens": 57380123.0, "step": 33080 }, { "entropy": 5.781823778152466, "epoch": 2.574129546780782, "grad_norm": 1.1484375, "learning_rate": 0.0004332974263523416, "loss": 5.0899, "mean_token_accuracy": 0.20397804975509642, "num_tokens": 57389093.0, "step": 33085 }, { "entropy": 5.5709809303283695, "epoch": 2.5745185761524993, "grad_norm": 1.1484375, "learning_rate": 0.00043327772902515327, "loss": 4.8008, "mean_token_accuracy": 0.22168489843606948, "num_tokens": 57397165.0, "step": 33090 }, { "entropy": 5.678659534454345, "epoch": 2.574907605524217, "grad_norm": 1.234375, "learning_rate": 0.0004332580292963523, "loss": 5.0479, "mean_token_accuracy": 0.19922156929969786, "num_tokens": 57406308.0, "step": 33095 }, { "entropy": 5.699652004241943, "epoch": 2.5752966348959347, "grad_norm": 1.1953125, "learning_rate": 0.0004332383271662376, "loss": 4.8985, "mean_token_accuracy": 0.20602771639823914, "num_tokens": 57414964.0, "step": 33100 }, { "entropy": 5.612923288345337, "epoch": 2.5756856642676524, "grad_norm": 1.3125, "learning_rate": 0.00043321862263510816, "loss": 4.8259, "mean_token_accuracy": 0.2258496403694153, "num_tokens": 57422684.0, "step": 33105 }, { "entropy": 5.633065032958984, "epoch": 2.5760746936393697, "grad_norm": 1.109375, "learning_rate": 0.0004331989157032629, "loss": 4.9527, "mean_token_accuracy": 0.19819397628307342, "num_tokens": 57431784.0, "step": 33110 }, { "entropy": 5.715724754333496, "epoch": 2.5764637230110874, "grad_norm": 1.2109375, "learning_rate": 0.00043317920637100097, "loss": 5.0297, "mean_token_accuracy": 0.19900820404291153, "num_tokens": 57440467.0, "step": 33115 }, { "entropy": 5.716431617736816, "epoch": 2.5768527523828046, "grad_norm": 1.2578125, "learning_rate": 0.0004331594946386213, "loss": 4.9365, "mean_token_accuracy": 0.20783784240484238, "num_tokens": 57449263.0, "step": 33120 }, { "entropy": 5.721834945678711, "epoch": 2.5772417817545223, "grad_norm": 1.25, "learning_rate": 0.00043313978050642303, "loss": 4.9353, "mean_token_accuracy": 0.21603565216064452, "num_tokens": 57457662.0, "step": 33125 }, { "entropy": 5.6706311225891115, "epoch": 2.57763081112624, "grad_norm": 1.1640625, "learning_rate": 0.0004331200639747053, "loss": 4.9321, "mean_token_accuracy": 0.20855581164360046, "num_tokens": 57466049.0, "step": 33130 }, { "entropy": 5.694969177246094, "epoch": 2.5780198404979577, "grad_norm": 1.2578125, "learning_rate": 0.0004331003450437674, "loss": 5.0358, "mean_token_accuracy": 0.20407139211893083, "num_tokens": 57474923.0, "step": 33135 }, { "entropy": 5.661200332641601, "epoch": 2.5784088698696754, "grad_norm": 1.25, "learning_rate": 0.0004330806237139083, "loss": 4.909, "mean_token_accuracy": 0.20593316555023194, "num_tokens": 57483292.0, "step": 33140 }, { "entropy": 5.64919958114624, "epoch": 2.5787978992413927, "grad_norm": 1.125, "learning_rate": 0.0004330608999854273, "loss": 4.9616, "mean_token_accuracy": 0.20870082080364227, "num_tokens": 57491894.0, "step": 33145 }, { "entropy": 5.672474908828735, "epoch": 2.5791869286131104, "grad_norm": 1.2578125, "learning_rate": 0.0004330411738586238, "loss": 4.9944, "mean_token_accuracy": 0.19929780215024948, "num_tokens": 57500999.0, "step": 33150 }, { "entropy": 5.790695571899414, "epoch": 2.5795759579848276, "grad_norm": 1.21875, "learning_rate": 0.000433021445333797, "loss": 5.081, "mean_token_accuracy": 0.19570744037628174, "num_tokens": 57508964.0, "step": 33155 }, { "entropy": 5.763886260986328, "epoch": 2.5799649873565453, "grad_norm": 1.3125, "learning_rate": 0.00043300171441124633, "loss": 5.0677, "mean_token_accuracy": 0.196874937415123, "num_tokens": 57517605.0, "step": 33160 }, { "entropy": 5.79387412071228, "epoch": 2.580354016728263, "grad_norm": 1.203125, "learning_rate": 0.0004329819810912711, "loss": 5.1542, "mean_token_accuracy": 0.19844631254673004, "num_tokens": 57527043.0, "step": 33165 }, { "entropy": 5.754243421554565, "epoch": 2.5807430460999807, "grad_norm": 1.1796875, "learning_rate": 0.00043296224537417075, "loss": 4.9794, "mean_token_accuracy": 0.21181239038705826, "num_tokens": 57535768.0, "step": 33170 }, { "entropy": 5.750576496124268, "epoch": 2.581132075471698, "grad_norm": 1.2109375, "learning_rate": 0.00043294250726024473, "loss": 5.0024, "mean_token_accuracy": 0.2018101081252098, "num_tokens": 57544060.0, "step": 33175 }, { "entropy": 5.666111278533935, "epoch": 2.5815211048434157, "grad_norm": 1.125, "learning_rate": 0.0004329227667497926, "loss": 4.8851, "mean_token_accuracy": 0.21166471093893052, "num_tokens": 57553139.0, "step": 33180 }, { "entropy": 5.677319288253784, "epoch": 2.5819101342151334, "grad_norm": 1.1953125, "learning_rate": 0.00043290302384311373, "loss": 4.9083, "mean_token_accuracy": 0.20191139131784439, "num_tokens": 57561388.0, "step": 33185 }, { "entropy": 5.664115762710571, "epoch": 2.5822991635868506, "grad_norm": 1.296875, "learning_rate": 0.00043288327854050794, "loss": 4.9545, "mean_token_accuracy": 0.20033176094293595, "num_tokens": 57570431.0, "step": 33190 }, { "entropy": 5.6983301639556885, "epoch": 2.5826881929585683, "grad_norm": 1.234375, "learning_rate": 0.00043286353084227467, "loss": 4.9769, "mean_token_accuracy": 0.20059967190027236, "num_tokens": 57579047.0, "step": 33195 }, { "entropy": 5.776878070831299, "epoch": 2.583077222330286, "grad_norm": 1.125, "learning_rate": 0.00043284378074871354, "loss": 5.0057, "mean_token_accuracy": 0.2047780394554138, "num_tokens": 57587878.0, "step": 33200 }, { "entropy": 5.754064273834229, "epoch": 2.5834662517020037, "grad_norm": 1.234375, "learning_rate": 0.0004328240282601243, "loss": 4.9916, "mean_token_accuracy": 0.21588091403245926, "num_tokens": 57596823.0, "step": 33205 }, { "entropy": 5.709573793411255, "epoch": 2.583855281073721, "grad_norm": 1.1640625, "learning_rate": 0.0004328042733768066, "loss": 5.1007, "mean_token_accuracy": 0.19312286972999573, "num_tokens": 57605983.0, "step": 33210 }, { "entropy": 5.721517276763916, "epoch": 2.5842443104454387, "grad_norm": 1.2421875, "learning_rate": 0.00043278451609906027, "loss": 4.9679, "mean_token_accuracy": 0.2042319655418396, "num_tokens": 57613987.0, "step": 33215 }, { "entropy": 5.7510233402252195, "epoch": 2.584633339817156, "grad_norm": 1.3515625, "learning_rate": 0.00043276475642718503, "loss": 4.993, "mean_token_accuracy": 0.20864909291267394, "num_tokens": 57622409.0, "step": 33220 }, { "entropy": 5.727937698364258, "epoch": 2.5850223691888736, "grad_norm": 1.2421875, "learning_rate": 0.0004327449943614808, "loss": 4.9725, "mean_token_accuracy": 0.2066057249903679, "num_tokens": 57630664.0, "step": 33225 }, { "entropy": 5.708162021636963, "epoch": 2.5854113985605913, "grad_norm": 1.2265625, "learning_rate": 0.00043272522990224727, "loss": 5.0185, "mean_token_accuracy": 0.19864611327648163, "num_tokens": 57639745.0, "step": 33230 }, { "entropy": 5.650463676452636, "epoch": 2.585800427932309, "grad_norm": 1.21875, "learning_rate": 0.0004327054630497844, "loss": 4.956, "mean_token_accuracy": 0.21384609788656234, "num_tokens": 57648628.0, "step": 33235 }, { "entropy": 5.7227623462677, "epoch": 2.5861894573040267, "grad_norm": 1.3046875, "learning_rate": 0.00043268569380439223, "loss": 4.9142, "mean_token_accuracy": 0.21794895380735396, "num_tokens": 57656322.0, "step": 33240 }, { "entropy": 5.693028450012207, "epoch": 2.586578486675744, "grad_norm": 1.234375, "learning_rate": 0.0004326659221663705, "loss": 4.9821, "mean_token_accuracy": 0.2076390266418457, "num_tokens": 57664807.0, "step": 33245 }, { "entropy": 5.634009647369385, "epoch": 2.5869675160474617, "grad_norm": 1.3203125, "learning_rate": 0.0004326461481360194, "loss": 4.9864, "mean_token_accuracy": 0.21034280508756636, "num_tokens": 57673216.0, "step": 33250 }, { "entropy": 5.696922159194946, "epoch": 2.587356545419179, "grad_norm": 1.2578125, "learning_rate": 0.00043262637171363906, "loss": 5.0346, "mean_token_accuracy": 0.19999148249626159, "num_tokens": 57681615.0, "step": 33255 }, { "entropy": 5.844824171066284, "epoch": 2.5877455747908966, "grad_norm": 1.25, "learning_rate": 0.00043260659289952926, "loss": 5.0795, "mean_token_accuracy": 0.2046985298395157, "num_tokens": 57690951.0, "step": 33260 }, { "entropy": 5.733655500411987, "epoch": 2.5881346041626143, "grad_norm": 1.3046875, "learning_rate": 0.00043258681169399034, "loss": 4.9948, "mean_token_accuracy": 0.20305444896221161, "num_tokens": 57699723.0, "step": 33265 }, { "entropy": 5.678305959701538, "epoch": 2.588523633534332, "grad_norm": 1.234375, "learning_rate": 0.00043256702809732234, "loss": 4.959, "mean_token_accuracy": 0.20519075393676758, "num_tokens": 57708380.0, "step": 33270 }, { "entropy": 5.719234228134155, "epoch": 2.5889126629060493, "grad_norm": 1.25, "learning_rate": 0.0004325472421098255, "loss": 5.0169, "mean_token_accuracy": 0.20562304854393004, "num_tokens": 57717183.0, "step": 33275 }, { "entropy": 5.707729625701904, "epoch": 2.589301692277767, "grad_norm": 1.1015625, "learning_rate": 0.00043252745373180006, "loss": 4.944, "mean_token_accuracy": 0.20426129400730134, "num_tokens": 57726369.0, "step": 33280 }, { "entropy": 5.731347560882568, "epoch": 2.5896907216494847, "grad_norm": 1.1953125, "learning_rate": 0.0004325076629635462, "loss": 4.9371, "mean_token_accuracy": 0.21273998767137528, "num_tokens": 57734863.0, "step": 33285 }, { "entropy": 5.691863536834717, "epoch": 2.590079751021202, "grad_norm": 1.2109375, "learning_rate": 0.00043248786980536424, "loss": 4.9675, "mean_token_accuracy": 0.21052051335573196, "num_tokens": 57743478.0, "step": 33290 }, { "entropy": 5.688389444351197, "epoch": 2.5904687803929196, "grad_norm": 1.1953125, "learning_rate": 0.0004324680742575545, "loss": 5.0461, "mean_token_accuracy": 0.2060870423913002, "num_tokens": 57752300.0, "step": 33295 }, { "entropy": 5.724020290374756, "epoch": 2.5908578097646373, "grad_norm": 1.1953125, "learning_rate": 0.00043244827632041744, "loss": 4.9975, "mean_token_accuracy": 0.20121217221021653, "num_tokens": 57760377.0, "step": 33300 }, { "entropy": 5.831526470184326, "epoch": 2.591246839136355, "grad_norm": 1.28125, "learning_rate": 0.0004324284759942534, "loss": 5.1567, "mean_token_accuracy": 0.19412157386541368, "num_tokens": 57768665.0, "step": 33305 }, { "entropy": 5.66921763420105, "epoch": 2.5916358685080723, "grad_norm": 1.1953125, "learning_rate": 0.0004324086732793627, "loss": 4.9817, "mean_token_accuracy": 0.20535184890031816, "num_tokens": 57777387.0, "step": 33310 }, { "entropy": 5.792150783538818, "epoch": 2.59202489787979, "grad_norm": 1.234375, "learning_rate": 0.00043238886817604605, "loss": 5.0801, "mean_token_accuracy": 0.1993957057595253, "num_tokens": 57785406.0, "step": 33315 }, { "entropy": 5.714837980270386, "epoch": 2.5924139272515077, "grad_norm": 1.2109375, "learning_rate": 0.0004323690606846039, "loss": 4.9792, "mean_token_accuracy": 0.2038136124610901, "num_tokens": 57794412.0, "step": 33320 }, { "entropy": 5.7092526912689205, "epoch": 2.592802956623225, "grad_norm": 1.1875, "learning_rate": 0.00043234925080533657, "loss": 4.915, "mean_token_accuracy": 0.20791952013969422, "num_tokens": 57803310.0, "step": 33325 }, { "entropy": 5.684376621246338, "epoch": 2.5931919859949426, "grad_norm": 1.2109375, "learning_rate": 0.0004323294385385448, "loss": 4.9773, "mean_token_accuracy": 0.20236010253429412, "num_tokens": 57812968.0, "step": 33330 }, { "entropy": 5.7541858673095705, "epoch": 2.5935810153666603, "grad_norm": 1.1640625, "learning_rate": 0.0004323096238845293, "loss": 5.1206, "mean_token_accuracy": 0.19801990538835526, "num_tokens": 57821230.0, "step": 33335 }, { "entropy": 5.788043975830078, "epoch": 2.593970044738378, "grad_norm": 1.328125, "learning_rate": 0.0004322898068435906, "loss": 5.0716, "mean_token_accuracy": 0.20127969831228257, "num_tokens": 57829643.0, "step": 33340 }, { "entropy": 5.729770851135254, "epoch": 2.5943590741100953, "grad_norm": 1.2890625, "learning_rate": 0.0004322699874160294, "loss": 4.9448, "mean_token_accuracy": 0.20881610810756684, "num_tokens": 57837994.0, "step": 33345 }, { "entropy": 5.740435791015625, "epoch": 2.594748103481813, "grad_norm": 1.1796875, "learning_rate": 0.00043225016560214654, "loss": 5.0418, "mean_token_accuracy": 0.2018784001469612, "num_tokens": 57846764.0, "step": 33350 }, { "entropy": 5.740151023864746, "epoch": 2.59513713285353, "grad_norm": 1.2265625, "learning_rate": 0.00043223034140224266, "loss": 4.9591, "mean_token_accuracy": 0.21086679100990297, "num_tokens": 57854887.0, "step": 33355 }, { "entropy": 5.738204383850098, "epoch": 2.595526162225248, "grad_norm": 1.2734375, "learning_rate": 0.0004322105148166187, "loss": 4.9573, "mean_token_accuracy": 0.2091521590948105, "num_tokens": 57863639.0, "step": 33360 }, { "entropy": 5.678333711624146, "epoch": 2.5959151915969656, "grad_norm": 1.21875, "learning_rate": 0.00043219068584557526, "loss": 4.9082, "mean_token_accuracy": 0.20345688611268997, "num_tokens": 57872037.0, "step": 33365 }, { "entropy": 5.7404725551605225, "epoch": 2.5963042209686833, "grad_norm": 1.21875, "learning_rate": 0.0004321708544894134, "loss": 5.011, "mean_token_accuracy": 0.2039540559053421, "num_tokens": 57880809.0, "step": 33370 }, { "entropy": 5.7901349544525145, "epoch": 2.5966932503404005, "grad_norm": 1.3203125, "learning_rate": 0.00043215102074843403, "loss": 5.086, "mean_token_accuracy": 0.20554639250040055, "num_tokens": 57889184.0, "step": 33375 }, { "entropy": 5.701214408874511, "epoch": 2.5970822797121182, "grad_norm": 1.21875, "learning_rate": 0.00043213118462293796, "loss": 4.9343, "mean_token_accuracy": 0.20482814759016038, "num_tokens": 57897695.0, "step": 33380 }, { "entropy": 5.763069009780883, "epoch": 2.597471309083836, "grad_norm": 1.21875, "learning_rate": 0.0004321113461132264, "loss": 5.0166, "mean_token_accuracy": 0.20304323881864547, "num_tokens": 57906280.0, "step": 33385 }, { "entropy": 5.7454883575439455, "epoch": 2.597860338455553, "grad_norm": 1.3515625, "learning_rate": 0.00043209150521960016, "loss": 5.0125, "mean_token_accuracy": 0.2021709069609642, "num_tokens": 57915112.0, "step": 33390 }, { "entropy": 5.737593698501587, "epoch": 2.598249367827271, "grad_norm": 1.2421875, "learning_rate": 0.00043207166194236037, "loss": 5.0224, "mean_token_accuracy": 0.19812178313732148, "num_tokens": 57924210.0, "step": 33395 }, { "entropy": 5.743430137634277, "epoch": 2.5986383971989886, "grad_norm": 1.1953125, "learning_rate": 0.0004320518162818082, "loss": 4.9448, "mean_token_accuracy": 0.2093503311276436, "num_tokens": 57933030.0, "step": 33400 }, { "entropy": 5.69033727645874, "epoch": 2.5990274265707063, "grad_norm": 1.15625, "learning_rate": 0.0004320319682382445, "loss": 4.8991, "mean_token_accuracy": 0.20641917139291763, "num_tokens": 57941490.0, "step": 33405 }, { "entropy": 5.663098430633545, "epoch": 2.5994164559424235, "grad_norm": 1.203125, "learning_rate": 0.00043201211781197075, "loss": 4.9755, "mean_token_accuracy": 0.2046479269862175, "num_tokens": 57950666.0, "step": 33410 }, { "entropy": 5.689292144775391, "epoch": 2.5998054853141412, "grad_norm": 1.15625, "learning_rate": 0.00043199226500328805, "loss": 5.0514, "mean_token_accuracy": 0.1978308767080307, "num_tokens": 57959740.0, "step": 33415 }, { "entropy": 5.743615531921387, "epoch": 2.600194514685859, "grad_norm": 1.1640625, "learning_rate": 0.0004319724098124975, "loss": 4.9886, "mean_token_accuracy": 0.20380737334489823, "num_tokens": 57968391.0, "step": 33420 }, { "entropy": 5.719541120529175, "epoch": 2.600583544057576, "grad_norm": 1.328125, "learning_rate": 0.00043195255223990055, "loss": 5.0207, "mean_token_accuracy": 0.20588731318712233, "num_tokens": 57976873.0, "step": 33425 }, { "entropy": 5.73463397026062, "epoch": 2.600972573429294, "grad_norm": 1.34375, "learning_rate": 0.0004319326922857984, "loss": 4.9966, "mean_token_accuracy": 0.20265626758337021, "num_tokens": 57985085.0, "step": 33430 }, { "entropy": 5.7723555088043215, "epoch": 2.6013616028010116, "grad_norm": 1.171875, "learning_rate": 0.0004319128299504925, "loss": 4.9785, "mean_token_accuracy": 0.20327332615852356, "num_tokens": 57993686.0, "step": 33435 }, { "entropy": 5.73761568069458, "epoch": 2.6017506321727293, "grad_norm": 1.3515625, "learning_rate": 0.00043189296523428407, "loss": 5.0961, "mean_token_accuracy": 0.19439849853515626, "num_tokens": 58001877.0, "step": 33440 }, { "entropy": 5.705368709564209, "epoch": 2.6021396615444465, "grad_norm": 1.15625, "learning_rate": 0.00043187309813747464, "loss": 4.9833, "mean_token_accuracy": 0.20662049502134322, "num_tokens": 58010688.0, "step": 33445 }, { "entropy": 5.785810852050782, "epoch": 2.6025286909161642, "grad_norm": 1.1875, "learning_rate": 0.00043185322866036565, "loss": 4.9284, "mean_token_accuracy": 0.2084208384156227, "num_tokens": 58019470.0, "step": 33450 }, { "entropy": 5.823499011993408, "epoch": 2.6029177202878815, "grad_norm": 1.1640625, "learning_rate": 0.00043183335680325866, "loss": 5.0473, "mean_token_accuracy": 0.1936328664422035, "num_tokens": 58028297.0, "step": 33455 }, { "entropy": 5.698975324630737, "epoch": 2.603306749659599, "grad_norm": 1.25, "learning_rate": 0.00043181348256645497, "loss": 5.0928, "mean_token_accuracy": 0.19330018311738967, "num_tokens": 58036815.0, "step": 33460 }, { "entropy": 5.787916612625122, "epoch": 2.603695779031317, "grad_norm": 1.3203125, "learning_rate": 0.00043179360595025637, "loss": 5.0704, "mean_token_accuracy": 0.20070381313562394, "num_tokens": 58045682.0, "step": 33465 }, { "entropy": 5.761455297470093, "epoch": 2.6040848084030346, "grad_norm": 1.21875, "learning_rate": 0.0004317737269549643, "loss": 5.0431, "mean_token_accuracy": 0.19674960970878602, "num_tokens": 58054530.0, "step": 33470 }, { "entropy": 5.757936286926269, "epoch": 2.604473837774752, "grad_norm": 1.1796875, "learning_rate": 0.0004317538455808805, "loss": 5.0489, "mean_token_accuracy": 0.2012824833393097, "num_tokens": 58063360.0, "step": 33475 }, { "entropy": 5.724410104751587, "epoch": 2.6048628671464695, "grad_norm": 1.171875, "learning_rate": 0.0004317339618283065, "loss": 5.0312, "mean_token_accuracy": 0.20958748161792756, "num_tokens": 58071198.0, "step": 33480 }, { "entropy": 5.749226140975952, "epoch": 2.6052518965181872, "grad_norm": 1.2890625, "learning_rate": 0.0004317140756975442, "loss": 5.0838, "mean_token_accuracy": 0.1989460989832878, "num_tokens": 58080138.0, "step": 33485 }, { "entropy": 5.679052400588989, "epoch": 2.6056409258899045, "grad_norm": 1.1640625, "learning_rate": 0.0004316941871888951, "loss": 4.9435, "mean_token_accuracy": 0.21023864895105362, "num_tokens": 58088768.0, "step": 33490 }, { "entropy": 5.667108535766602, "epoch": 2.606029955261622, "grad_norm": 1.109375, "learning_rate": 0.00043167429630266134, "loss": 4.9892, "mean_token_accuracy": 0.20636235624551774, "num_tokens": 58098309.0, "step": 33495 }, { "entropy": 5.705713415145874, "epoch": 2.60641898463334, "grad_norm": 1.2265625, "learning_rate": 0.0004316544030391444, "loss": 5.02, "mean_token_accuracy": 0.2056478440761566, "num_tokens": 58106987.0, "step": 33500 }, { "entropy": 5.714624261856079, "epoch": 2.6068080140050576, "grad_norm": 1.2421875, "learning_rate": 0.0004316345073986461, "loss": 4.9744, "mean_token_accuracy": 0.20592887848615646, "num_tokens": 58115065.0, "step": 33505 }, { "entropy": 5.718953323364258, "epoch": 2.607197043376775, "grad_norm": 1.25, "learning_rate": 0.0004316146093814686, "loss": 5.063, "mean_token_accuracy": 0.20148181319236755, "num_tokens": 58123995.0, "step": 33510 }, { "entropy": 5.668556356430054, "epoch": 2.6075860727484925, "grad_norm": 1.25, "learning_rate": 0.0004315947089879137, "loss": 4.8949, "mean_token_accuracy": 0.21482236683368683, "num_tokens": 58132080.0, "step": 33515 }, { "entropy": 5.735019588470459, "epoch": 2.60797510212021, "grad_norm": 1.2890625, "learning_rate": 0.00043157480621828327, "loss": 5.0187, "mean_token_accuracy": 0.20754980444908142, "num_tokens": 58140199.0, "step": 33520 }, { "entropy": 5.609984874725342, "epoch": 2.6083641314919275, "grad_norm": 1.171875, "learning_rate": 0.00043155490107287935, "loss": 4.8887, "mean_token_accuracy": 0.21996110379695893, "num_tokens": 58148852.0, "step": 33525 }, { "entropy": 5.690659236907959, "epoch": 2.608753160863645, "grad_norm": 1.2734375, "learning_rate": 0.0004315349935520041, "loss": 5.0473, "mean_token_accuracy": 0.20650433152914047, "num_tokens": 58157290.0, "step": 33530 }, { "entropy": 5.752303838729858, "epoch": 2.609142190235363, "grad_norm": 1.1875, "learning_rate": 0.0004315150836559594, "loss": 5.0008, "mean_token_accuracy": 0.20093835145235062, "num_tokens": 58166086.0, "step": 33535 }, { "entropy": 5.726868104934693, "epoch": 2.6095312196070806, "grad_norm": 1.171875, "learning_rate": 0.0004314951713850474, "loss": 4.9643, "mean_token_accuracy": 0.20508555620908736, "num_tokens": 58174865.0, "step": 33540 }, { "entropy": 5.703400373458862, "epoch": 2.609920248978798, "grad_norm": 1.1796875, "learning_rate": 0.00043147525673957026, "loss": 4.9912, "mean_token_accuracy": 0.21267081350088118, "num_tokens": 58182313.0, "step": 33545 }, { "entropy": 5.766158485412598, "epoch": 2.6103092783505155, "grad_norm": 1.171875, "learning_rate": 0.00043145533971983025, "loss": 5.0089, "mean_token_accuracy": 0.19622587859630586, "num_tokens": 58190758.0, "step": 33550 }, { "entropy": 5.747448492050171, "epoch": 2.6106983077222328, "grad_norm": 1.15625, "learning_rate": 0.00043143542032612935, "loss": 5.0169, "mean_token_accuracy": 0.19866789728403092, "num_tokens": 58199308.0, "step": 33555 }, { "entropy": 5.70890851020813, "epoch": 2.6110873370939505, "grad_norm": 1.2578125, "learning_rate": 0.0004314154985587701, "loss": 4.9533, "mean_token_accuracy": 0.2023671105504036, "num_tokens": 58206995.0, "step": 33560 }, { "entropy": 5.679575061798095, "epoch": 2.611476366465668, "grad_norm": 1.2890625, "learning_rate": 0.00043139557441805457, "loss": 4.9675, "mean_token_accuracy": 0.20791420936584473, "num_tokens": 58215186.0, "step": 33565 }, { "entropy": 5.770928955078125, "epoch": 2.611865395837386, "grad_norm": 1.1640625, "learning_rate": 0.00043137564790428503, "loss": 4.9887, "mean_token_accuracy": 0.20241085588932037, "num_tokens": 58224347.0, "step": 33570 }, { "entropy": 5.684113073348999, "epoch": 2.6122544252091036, "grad_norm": 1.28125, "learning_rate": 0.00043135571901776397, "loss": 4.9007, "mean_token_accuracy": 0.21021339893341065, "num_tokens": 58232477.0, "step": 33575 }, { "entropy": 5.650889539718628, "epoch": 2.612643454580821, "grad_norm": 1.1875, "learning_rate": 0.0004313357877587937, "loss": 4.9318, "mean_token_accuracy": 0.2144528478384018, "num_tokens": 58241186.0, "step": 33580 }, { "entropy": 5.68687071800232, "epoch": 2.6130324839525385, "grad_norm": 1.25, "learning_rate": 0.0004313158541276768, "loss": 5.0027, "mean_token_accuracy": 0.2086435228586197, "num_tokens": 58249140.0, "step": 33585 }, { "entropy": 5.715143203735352, "epoch": 2.6134215133242558, "grad_norm": 1.25, "learning_rate": 0.0004312959181247156, "loss": 4.9795, "mean_token_accuracy": 0.20139807164669038, "num_tokens": 58258313.0, "step": 33590 }, { "entropy": 5.756496715545654, "epoch": 2.6138105426959735, "grad_norm": 1.2109375, "learning_rate": 0.0004312759797502126, "loss": 4.9639, "mean_token_accuracy": 0.2069405734539032, "num_tokens": 58267013.0, "step": 33595 }, { "entropy": 5.731114292144776, "epoch": 2.614199572067691, "grad_norm": 1.1953125, "learning_rate": 0.00043125603900447026, "loss": 5.0491, "mean_token_accuracy": 0.19736940711736678, "num_tokens": 58275844.0, "step": 33600 }, { "entropy": 5.713581323623657, "epoch": 2.614588601439409, "grad_norm": 1.296875, "learning_rate": 0.0004312360958877913, "loss": 5.0248, "mean_token_accuracy": 0.19725545942783357, "num_tokens": 58284416.0, "step": 33605 }, { "entropy": 5.744731092453003, "epoch": 2.614977630811126, "grad_norm": 1.2421875, "learning_rate": 0.0004312161504004782, "loss": 4.9849, "mean_token_accuracy": 0.2039705693721771, "num_tokens": 58293564.0, "step": 33610 }, { "entropy": 5.6936098575592045, "epoch": 2.615366660182844, "grad_norm": 1.3046875, "learning_rate": 0.00043119620254283375, "loss": 4.9637, "mean_token_accuracy": 0.19899171739816665, "num_tokens": 58302230.0, "step": 33615 }, { "entropy": 5.757852172851562, "epoch": 2.6157556895545615, "grad_norm": 1.28125, "learning_rate": 0.00043117625231516054, "loss": 5.0022, "mean_token_accuracy": 0.2000056102871895, "num_tokens": 58309540.0, "step": 33620 }, { "entropy": 5.658221197128296, "epoch": 2.6161447189262788, "grad_norm": 1.21875, "learning_rate": 0.0004311562997177612, "loss": 4.91, "mean_token_accuracy": 0.21495340317487716, "num_tokens": 58317885.0, "step": 33625 }, { "entropy": 5.736551237106323, "epoch": 2.6165337482979965, "grad_norm": 1.2578125, "learning_rate": 0.0004311363447509386, "loss": 5.006, "mean_token_accuracy": 0.19455249905586242, "num_tokens": 58326133.0, "step": 33630 }, { "entropy": 5.7313765525817875, "epoch": 2.616922777669714, "grad_norm": 1.3125, "learning_rate": 0.0004311163874149955, "loss": 5.0015, "mean_token_accuracy": 0.2056909143924713, "num_tokens": 58335085.0, "step": 33635 }, { "entropy": 5.767771863937378, "epoch": 2.617311807041432, "grad_norm": 1.2890625, "learning_rate": 0.00043109642771023464, "loss": 5.0253, "mean_token_accuracy": 0.20573799312114716, "num_tokens": 58344222.0, "step": 33640 }, { "entropy": 5.677298259735108, "epoch": 2.617700836413149, "grad_norm": 1.171875, "learning_rate": 0.0004310764656369591, "loss": 4.914, "mean_token_accuracy": 0.20675677359104155, "num_tokens": 58353256.0, "step": 33645 }, { "entropy": 5.787171173095703, "epoch": 2.618089865784867, "grad_norm": 1.375, "learning_rate": 0.0004310565011954715, "loss": 5.0138, "mean_token_accuracy": 0.20824930518865586, "num_tokens": 58361197.0, "step": 33650 }, { "entropy": 5.785514783859253, "epoch": 2.618478895156584, "grad_norm": 1.21875, "learning_rate": 0.0004310365343860748, "loss": 5.0573, "mean_token_accuracy": 0.2076263725757599, "num_tokens": 58370653.0, "step": 33655 }, { "entropy": 5.725497531890869, "epoch": 2.6188679245283017, "grad_norm": 1.2421875, "learning_rate": 0.00043101656520907225, "loss": 5.0458, "mean_token_accuracy": 0.20471138656139373, "num_tokens": 58379804.0, "step": 33660 }, { "entropy": 5.6993828296661375, "epoch": 2.6192569539000194, "grad_norm": 1.234375, "learning_rate": 0.0004309965936647665, "loss": 4.9585, "mean_token_accuracy": 0.2082282781600952, "num_tokens": 58388443.0, "step": 33665 }, { "entropy": 5.765039348602295, "epoch": 2.619645983271737, "grad_norm": 1.25, "learning_rate": 0.0004309766197534608, "loss": 5.1094, "mean_token_accuracy": 0.20284894704818726, "num_tokens": 58397165.0, "step": 33670 }, { "entropy": 5.748328590393067, "epoch": 2.620035012643455, "grad_norm": 1.1796875, "learning_rate": 0.00043095664347545816, "loss": 4.9997, "mean_token_accuracy": 0.20354822129011155, "num_tokens": 58405679.0, "step": 33675 }, { "entropy": 5.706437730789185, "epoch": 2.620424042015172, "grad_norm": 1.1875, "learning_rate": 0.0004309366648310616, "loss": 4.9036, "mean_token_accuracy": 0.21346404403448105, "num_tokens": 58414998.0, "step": 33680 }, { "entropy": 5.757890129089356, "epoch": 2.62081307138689, "grad_norm": 1.359375, "learning_rate": 0.00043091668382057443, "loss": 4.9583, "mean_token_accuracy": 0.20988742560148238, "num_tokens": 58423535.0, "step": 33685 }, { "entropy": 5.702936458587646, "epoch": 2.621202100758607, "grad_norm": 1.140625, "learning_rate": 0.00043089670044429973, "loss": 4.9216, "mean_token_accuracy": 0.20611889213323592, "num_tokens": 58432379.0, "step": 33690 }, { "entropy": 5.688969659805298, "epoch": 2.6215911301303247, "grad_norm": 1.28125, "learning_rate": 0.00043087671470254076, "loss": 5.0245, "mean_token_accuracy": 0.2014407992362976, "num_tokens": 58441013.0, "step": 33695 }, { "entropy": 5.72940034866333, "epoch": 2.6219801595020424, "grad_norm": 1.171875, "learning_rate": 0.00043085672659560077, "loss": 5.0376, "mean_token_accuracy": 0.20618428587913512, "num_tokens": 58450353.0, "step": 33700 }, { "entropy": 5.756976366043091, "epoch": 2.62236918887376, "grad_norm": 1.28125, "learning_rate": 0.00043083673612378295, "loss": 4.9324, "mean_token_accuracy": 0.2045755937695503, "num_tokens": 58458833.0, "step": 33705 }, { "entropy": 5.725690507888794, "epoch": 2.6227582182454774, "grad_norm": 1.25, "learning_rate": 0.00043081674328739066, "loss": 5.0452, "mean_token_accuracy": 0.1958729937672615, "num_tokens": 58468325.0, "step": 33710 }, { "entropy": 5.705432415008545, "epoch": 2.623147247617195, "grad_norm": 1.3359375, "learning_rate": 0.00043079674808672744, "loss": 4.9476, "mean_token_accuracy": 0.20557056367397308, "num_tokens": 58476333.0, "step": 33715 }, { "entropy": 5.676010990142823, "epoch": 2.623536276988913, "grad_norm": 1.203125, "learning_rate": 0.0004307767505220964, "loss": 4.9941, "mean_token_accuracy": 0.20795658975839615, "num_tokens": 58484435.0, "step": 33720 }, { "entropy": 5.701318168640137, "epoch": 2.62392530636063, "grad_norm": 1.1875, "learning_rate": 0.0004307567505938012, "loss": 5.078, "mean_token_accuracy": 0.19563888758420944, "num_tokens": 58493709.0, "step": 33725 }, { "entropy": 5.734446430206299, "epoch": 2.6243143357323477, "grad_norm": 1.2109375, "learning_rate": 0.0004307367483021452, "loss": 4.9742, "mean_token_accuracy": 0.2055053398013115, "num_tokens": 58502522.0, "step": 33730 }, { "entropy": 5.7357015132904055, "epoch": 2.6247033651040654, "grad_norm": 1.1953125, "learning_rate": 0.000430716743647432, "loss": 5.0007, "mean_token_accuracy": 0.2010473608970642, "num_tokens": 58511459.0, "step": 33735 }, { "entropy": 5.743743515014648, "epoch": 2.625092394475783, "grad_norm": 1.2421875, "learning_rate": 0.000430696736629965, "loss": 5.0365, "mean_token_accuracy": 0.2028670996427536, "num_tokens": 58520197.0, "step": 33740 }, { "entropy": 5.747347688674926, "epoch": 2.6254814238475004, "grad_norm": 1.1953125, "learning_rate": 0.0004306767272500478, "loss": 5.0403, "mean_token_accuracy": 0.20088831186294556, "num_tokens": 58528587.0, "step": 33745 }, { "entropy": 5.762656211853027, "epoch": 2.625870453219218, "grad_norm": 1.1484375, "learning_rate": 0.00043065671550798415, "loss": 4.946, "mean_token_accuracy": 0.20864690393209456, "num_tokens": 58537348.0, "step": 33750 }, { "entropy": 5.676995182037354, "epoch": 2.626259482590936, "grad_norm": 1.2734375, "learning_rate": 0.00043063670140407753, "loss": 4.8965, "mean_token_accuracy": 0.2126185640692711, "num_tokens": 58545637.0, "step": 33755 }, { "entropy": 5.708369731903076, "epoch": 2.626648511962653, "grad_norm": 1.171875, "learning_rate": 0.0004306166849386317, "loss": 4.9861, "mean_token_accuracy": 0.20189249366521836, "num_tokens": 58554575.0, "step": 33760 }, { "entropy": 5.663330030441284, "epoch": 2.6270375413343707, "grad_norm": 1.171875, "learning_rate": 0.00043059666611195037, "loss": 4.8404, "mean_token_accuracy": 0.2157057538628578, "num_tokens": 58563150.0, "step": 33765 }, { "entropy": 5.631756258010864, "epoch": 2.6274265707060884, "grad_norm": 1.25, "learning_rate": 0.0004305766449243372, "loss": 4.9874, "mean_token_accuracy": 0.19912049770355225, "num_tokens": 58571790.0, "step": 33770 }, { "entropy": 5.6742407321929935, "epoch": 2.627815600077806, "grad_norm": 1.203125, "learning_rate": 0.0004305566213760962, "loss": 4.9279, "mean_token_accuracy": 0.2079211413860321, "num_tokens": 58581094.0, "step": 33775 }, { "entropy": 5.766603088378906, "epoch": 2.6282046294495234, "grad_norm": 1.25, "learning_rate": 0.00043053659546753094, "loss": 4.9924, "mean_token_accuracy": 0.2020955726504326, "num_tokens": 58590836.0, "step": 33780 }, { "entropy": 5.743691110610962, "epoch": 2.628593658821241, "grad_norm": 1.2578125, "learning_rate": 0.0004305165671989455, "loss": 4.968, "mean_token_accuracy": 0.20695775598287583, "num_tokens": 58599315.0, "step": 33785 }, { "entropy": 5.69129524230957, "epoch": 2.6289826881929583, "grad_norm": 1.2109375, "learning_rate": 0.0004304965365706437, "loss": 4.9623, "mean_token_accuracy": 0.20807217955589294, "num_tokens": 58607663.0, "step": 33790 }, { "entropy": 5.659766054153442, "epoch": 2.629371717564676, "grad_norm": 1.2421875, "learning_rate": 0.0004304765035829294, "loss": 4.9682, "mean_token_accuracy": 0.20406726002693176, "num_tokens": 58616513.0, "step": 33795 }, { "entropy": 5.7979512214660645, "epoch": 2.6297607469363937, "grad_norm": 1.3203125, "learning_rate": 0.00043045646823610664, "loss": 5.0792, "mean_token_accuracy": 0.19672893285751342, "num_tokens": 58625483.0, "step": 33800 }, { "entropy": 5.758320951461792, "epoch": 2.6301497763081114, "grad_norm": 1.234375, "learning_rate": 0.00043043643053047935, "loss": 4.9992, "mean_token_accuracy": 0.20030266791582108, "num_tokens": 58633880.0, "step": 33805 }, { "entropy": 5.7598127841949465, "epoch": 2.6305388056798287, "grad_norm": 1.140625, "learning_rate": 0.0004304163904663517, "loss": 4.9703, "mean_token_accuracy": 0.2052551954984665, "num_tokens": 58642940.0, "step": 33810 }, { "entropy": 5.675958871841431, "epoch": 2.6309278350515464, "grad_norm": 1.234375, "learning_rate": 0.00043039634804402767, "loss": 4.9179, "mean_token_accuracy": 0.21282550692558289, "num_tokens": 58651736.0, "step": 33815 }, { "entropy": 5.77490086555481, "epoch": 2.631316864423264, "grad_norm": 1.1875, "learning_rate": 0.0004303763032638114, "loss": 4.9674, "mean_token_accuracy": 0.20979854613542556, "num_tokens": 58660494.0, "step": 33820 }, { "entropy": 5.708243894577026, "epoch": 2.6317058937949813, "grad_norm": 1.2421875, "learning_rate": 0.0004303562561260071, "loss": 4.957, "mean_token_accuracy": 0.20201363116502763, "num_tokens": 58669150.0, "step": 33825 }, { "entropy": 5.695405340194702, "epoch": 2.632094923166699, "grad_norm": 1.3359375, "learning_rate": 0.00043033620663091883, "loss": 4.9171, "mean_token_accuracy": 0.2146230012178421, "num_tokens": 58677806.0, "step": 33830 }, { "entropy": 5.645682048797608, "epoch": 2.6324839525384167, "grad_norm": 1.2109375, "learning_rate": 0.0004303161547788509, "loss": 4.9319, "mean_token_accuracy": 0.20759192556142808, "num_tokens": 58686406.0, "step": 33835 }, { "entropy": 5.766831111907959, "epoch": 2.6328729819101344, "grad_norm": 1.28125, "learning_rate": 0.0004302961005701074, "loss": 5.0335, "mean_token_accuracy": 0.2072589874267578, "num_tokens": 58696074.0, "step": 33840 }, { "entropy": 5.753781652450561, "epoch": 2.6332620112818517, "grad_norm": 1.1953125, "learning_rate": 0.00043027604400499295, "loss": 5.0076, "mean_token_accuracy": 0.2042693868279457, "num_tokens": 58704860.0, "step": 33845 }, { "entropy": 5.780615568161011, "epoch": 2.6336510406535694, "grad_norm": 1.2109375, "learning_rate": 0.00043025598508381155, "loss": 4.9964, "mean_token_accuracy": 0.2076350748538971, "num_tokens": 58713455.0, "step": 33850 }, { "entropy": 5.635193157196045, "epoch": 2.634040070025287, "grad_norm": 1.2109375, "learning_rate": 0.0004302359238068677, "loss": 4.8957, "mean_token_accuracy": 0.21216132640838622, "num_tokens": 58722382.0, "step": 33855 }, { "entropy": 5.700171279907226, "epoch": 2.6344290993970043, "grad_norm": 1.234375, "learning_rate": 0.00043021586017446585, "loss": 4.9364, "mean_token_accuracy": 0.20986511260271073, "num_tokens": 58730816.0, "step": 33860 }, { "entropy": 5.694893789291382, "epoch": 2.634818128768722, "grad_norm": 1.203125, "learning_rate": 0.00043019579418691027, "loss": 4.9525, "mean_token_accuracy": 0.2071901798248291, "num_tokens": 58740143.0, "step": 33865 }, { "entropy": 5.6604550838470455, "epoch": 2.6352071581404397, "grad_norm": 1.1875, "learning_rate": 0.0004301757258445056, "loss": 4.8916, "mean_token_accuracy": 0.21241319179534912, "num_tokens": 58748347.0, "step": 33870 }, { "entropy": 5.685748338699341, "epoch": 2.6355961875121574, "grad_norm": 1.1953125, "learning_rate": 0.0004301556551475563, "loss": 4.934, "mean_token_accuracy": 0.2026606872677803, "num_tokens": 58756274.0, "step": 33875 }, { "entropy": 5.7159558773040775, "epoch": 2.6359852168838747, "grad_norm": 1.3046875, "learning_rate": 0.0004301355820963669, "loss": 4.9491, "mean_token_accuracy": 0.20865881592035293, "num_tokens": 58764564.0, "step": 33880 }, { "entropy": 5.616364240646362, "epoch": 2.6363742462555924, "grad_norm": 1.2734375, "learning_rate": 0.0004301155066912419, "loss": 4.9985, "mean_token_accuracy": 0.20215834379196168, "num_tokens": 58772914.0, "step": 33885 }, { "entropy": 5.735758876800537, "epoch": 2.6367632756273096, "grad_norm": 1.3046875, "learning_rate": 0.000430095428932486, "loss": 4.9892, "mean_token_accuracy": 0.2009509176015854, "num_tokens": 58781572.0, "step": 33890 }, { "entropy": 5.714352750778199, "epoch": 2.6371523049990273, "grad_norm": 1.25, "learning_rate": 0.00043007534882040385, "loss": 4.9748, "mean_token_accuracy": 0.2122022971510887, "num_tokens": 58789259.0, "step": 33895 }, { "entropy": 5.728598928451538, "epoch": 2.637541334370745, "grad_norm": 1.2265625, "learning_rate": 0.0004300552663553001, "loss": 5.0031, "mean_token_accuracy": 0.21192315518856047, "num_tokens": 58797984.0, "step": 33900 }, { "entropy": 5.708534669876099, "epoch": 2.6379303637424627, "grad_norm": 1.2421875, "learning_rate": 0.0004300351815374795, "loss": 4.8955, "mean_token_accuracy": 0.21921718269586563, "num_tokens": 58806474.0, "step": 33905 }, { "entropy": 5.7149604797363285, "epoch": 2.63831939311418, "grad_norm": 1.1640625, "learning_rate": 0.0004300150943672467, "loss": 5.0495, "mean_token_accuracy": 0.1966916114091873, "num_tokens": 58816223.0, "step": 33910 }, { "entropy": 5.717144727706909, "epoch": 2.6387084224858977, "grad_norm": 1.2578125, "learning_rate": 0.0004299950048449067, "loss": 4.977, "mean_token_accuracy": 0.20155893117189408, "num_tokens": 58824950.0, "step": 33915 }, { "entropy": 5.719282817840576, "epoch": 2.6390974518576154, "grad_norm": 1.3515625, "learning_rate": 0.0004299749129707641, "loss": 4.9701, "mean_token_accuracy": 0.2095505714416504, "num_tokens": 58833201.0, "step": 33920 }, { "entropy": 5.697381448745728, "epoch": 2.6394864812293326, "grad_norm": 1.3046875, "learning_rate": 0.0004299548187451239, "loss": 4.9281, "mean_token_accuracy": 0.2130783051252365, "num_tokens": 58841621.0, "step": 33925 }, { "entropy": 5.689957237243652, "epoch": 2.6398755106010503, "grad_norm": 1.328125, "learning_rate": 0.00042993472216829097, "loss": 4.9296, "mean_token_accuracy": 0.20688596218824387, "num_tokens": 58849831.0, "step": 33930 }, { "entropy": 5.702787733078003, "epoch": 2.640264539972768, "grad_norm": 1.28125, "learning_rate": 0.00042991462324057025, "loss": 4.9971, "mean_token_accuracy": 0.20984395444393159, "num_tokens": 58858530.0, "step": 33935 }, { "entropy": 5.709631776809692, "epoch": 2.6406535693444857, "grad_norm": 1.21875, "learning_rate": 0.0004298945219622667, "loss": 5.0835, "mean_token_accuracy": 0.19501225501298905, "num_tokens": 58868127.0, "step": 33940 }, { "entropy": 5.737430191040039, "epoch": 2.641042598716203, "grad_norm": 1.265625, "learning_rate": 0.00042987441833368525, "loss": 4.9488, "mean_token_accuracy": 0.20488327592611313, "num_tokens": 58876959.0, "step": 33945 }, { "entropy": 5.734649133682251, "epoch": 2.6414316280879206, "grad_norm": 1.203125, "learning_rate": 0.00042985431235513104, "loss": 4.9667, "mean_token_accuracy": 0.20695212930440904, "num_tokens": 58885534.0, "step": 33950 }, { "entropy": 5.753660249710083, "epoch": 2.6418206574596383, "grad_norm": 1.21875, "learning_rate": 0.00042983420402690917, "loss": 5.0007, "mean_token_accuracy": 0.20341471582651138, "num_tokens": 58894600.0, "step": 33955 }, { "entropy": 5.729355049133301, "epoch": 2.6422096868313556, "grad_norm": 1.2578125, "learning_rate": 0.00042981409334932457, "loss": 4.9994, "mean_token_accuracy": 0.20628041476011277, "num_tokens": 58903243.0, "step": 33960 }, { "entropy": 5.7268775463104244, "epoch": 2.6425987162030733, "grad_norm": 1.3046875, "learning_rate": 0.0004297939803226826, "loss": 5.0417, "mean_token_accuracy": 0.20355791300535203, "num_tokens": 58911058.0, "step": 33965 }, { "entropy": 5.703839588165283, "epoch": 2.642987745574791, "grad_norm": 1.203125, "learning_rate": 0.0004297738649472884, "loss": 5.0025, "mean_token_accuracy": 0.20655551701784133, "num_tokens": 58919698.0, "step": 33970 }, { "entropy": 5.808947038650513, "epoch": 2.6433767749465087, "grad_norm": 1.3359375, "learning_rate": 0.00042975374722344713, "loss": 5.132, "mean_token_accuracy": 0.19427954852581025, "num_tokens": 58929276.0, "step": 33975 }, { "entropy": 5.825388336181641, "epoch": 2.643765804318226, "grad_norm": 1.2265625, "learning_rate": 0.00042973362715146397, "loss": 5.093, "mean_token_accuracy": 0.20078352987766265, "num_tokens": 58938148.0, "step": 33980 }, { "entropy": 5.740652751922608, "epoch": 2.6441548336899436, "grad_norm": 1.21875, "learning_rate": 0.0004297135047316444, "loss": 4.9374, "mean_token_accuracy": 0.20368710458278655, "num_tokens": 58946406.0, "step": 33985 }, { "entropy": 5.7587583541870115, "epoch": 2.644543863061661, "grad_norm": 1.2109375, "learning_rate": 0.0004296933799642936, "loss": 5.0571, "mean_token_accuracy": 0.1940241351723671, "num_tokens": 58954914.0, "step": 33990 }, { "entropy": 5.7367347240447994, "epoch": 2.6449328924333786, "grad_norm": 1.2578125, "learning_rate": 0.000429673252849717, "loss": 4.9623, "mean_token_accuracy": 0.20854104906320572, "num_tokens": 58963236.0, "step": 33995 }, { "entropy": 5.738904047012329, "epoch": 2.6453219218050963, "grad_norm": 1.2421875, "learning_rate": 0.00042965312338822005, "loss": 5.0091, "mean_token_accuracy": 0.2078354313969612, "num_tokens": 58972141.0, "step": 34000 }, { "entropy": 5.733154249191284, "epoch": 2.645710951176814, "grad_norm": 1.09375, "learning_rate": 0.000429632991580108, "loss": 5.0327, "mean_token_accuracy": 0.20212261229753495, "num_tokens": 58982348.0, "step": 34005 }, { "entropy": 5.785204553604126, "epoch": 2.6460999805485317, "grad_norm": 1.2734375, "learning_rate": 0.0004296128574256864, "loss": 4.9908, "mean_token_accuracy": 0.20475524365901948, "num_tokens": 58990858.0, "step": 34010 }, { "entropy": 5.640594053268432, "epoch": 2.646489009920249, "grad_norm": 1.140625, "learning_rate": 0.00042959272092526086, "loss": 4.8734, "mean_token_accuracy": 0.21500559896230698, "num_tokens": 58999841.0, "step": 34015 }, { "entropy": 5.661121273040772, "epoch": 2.6468780392919666, "grad_norm": 1.28125, "learning_rate": 0.00042957258207913687, "loss": 4.9089, "mean_token_accuracy": 0.21018601953983307, "num_tokens": 59008538.0, "step": 34020 }, { "entropy": 5.657835483551025, "epoch": 2.647267068663684, "grad_norm": 1.3125, "learning_rate": 0.00042955244088761985, "loss": 4.9015, "mean_token_accuracy": 0.20411291867494583, "num_tokens": 59016656.0, "step": 34025 }, { "entropy": 5.76277437210083, "epoch": 2.6476560980354016, "grad_norm": 1.15625, "learning_rate": 0.0004295322973510156, "loss": 4.9917, "mean_token_accuracy": 0.20831846296787263, "num_tokens": 59025682.0, "step": 34030 }, { "entropy": 5.742766618728638, "epoch": 2.6480451274071193, "grad_norm": 1.3046875, "learning_rate": 0.0004295121514696297, "loss": 5.0385, "mean_token_accuracy": 0.20273284912109374, "num_tokens": 59033448.0, "step": 34035 }, { "entropy": 5.717304706573486, "epoch": 2.648434156778837, "grad_norm": 1.2734375, "learning_rate": 0.00042949200324376784, "loss": 4.9384, "mean_token_accuracy": 0.2076994627714157, "num_tokens": 59042220.0, "step": 34040 }, { "entropy": 5.717313146591186, "epoch": 2.6488231861505542, "grad_norm": 1.2109375, "learning_rate": 0.0004294718526737357, "loss": 5.0269, "mean_token_accuracy": 0.20611345916986465, "num_tokens": 59050337.0, "step": 34045 }, { "entropy": 5.685806322097778, "epoch": 2.649212215522272, "grad_norm": 1.21875, "learning_rate": 0.0004294516997598391, "loss": 4.9957, "mean_token_accuracy": 0.20122347623109818, "num_tokens": 59059186.0, "step": 34050 }, { "entropy": 5.748624420166015, "epoch": 2.6496012448939896, "grad_norm": 1.1875, "learning_rate": 0.0004294315445023838, "loss": 5.032, "mean_token_accuracy": 0.19803582280874252, "num_tokens": 59068714.0, "step": 34055 }, { "entropy": 5.835361003875732, "epoch": 2.649990274265707, "grad_norm": 1.2421875, "learning_rate": 0.00042941138690167556, "loss": 5.1266, "mean_token_accuracy": 0.19106610715389252, "num_tokens": 59077015.0, "step": 34060 }, { "entropy": 5.725949668884278, "epoch": 2.6503793036374246, "grad_norm": 1.2109375, "learning_rate": 0.0004293912269580204, "loss": 4.9954, "mean_token_accuracy": 0.20111947357654572, "num_tokens": 59085766.0, "step": 34065 }, { "entropy": 5.783292007446289, "epoch": 2.6507683330091423, "grad_norm": 1.21875, "learning_rate": 0.000429371064671724, "loss": 5.0394, "mean_token_accuracy": 0.1935569688677788, "num_tokens": 59094390.0, "step": 34070 }, { "entropy": 5.782695055007935, "epoch": 2.65115736238086, "grad_norm": 1.234375, "learning_rate": 0.00042935090004309247, "loss": 4.9987, "mean_token_accuracy": 0.20870082080364227, "num_tokens": 59102310.0, "step": 34075 }, { "entropy": 5.75565767288208, "epoch": 2.6515463917525772, "grad_norm": 1.2578125, "learning_rate": 0.00042933073307243165, "loss": 4.9557, "mean_token_accuracy": 0.2076115384697914, "num_tokens": 59111385.0, "step": 34080 }, { "entropy": 5.772593832015991, "epoch": 2.651935421124295, "grad_norm": 1.21875, "learning_rate": 0.00042931056376004767, "loss": 5.0346, "mean_token_accuracy": 0.2098518654704094, "num_tokens": 59120152.0, "step": 34085 }, { "entropy": 5.695884466171265, "epoch": 2.652324450496012, "grad_norm": 1.21875, "learning_rate": 0.0004292903921062465, "loss": 4.857, "mean_token_accuracy": 0.2212001234292984, "num_tokens": 59128782.0, "step": 34090 }, { "entropy": 5.747650480270385, "epoch": 2.65271347986773, "grad_norm": 1.265625, "learning_rate": 0.00042927021811133416, "loss": 4.9868, "mean_token_accuracy": 0.2058954194188118, "num_tokens": 59136946.0, "step": 34095 }, { "entropy": 5.716735553741455, "epoch": 2.6531025092394476, "grad_norm": 1.3984375, "learning_rate": 0.0004292500417756167, "loss": 4.9373, "mean_token_accuracy": 0.21390515863895415, "num_tokens": 59145845.0, "step": 34100 }, { "entropy": 5.819818115234375, "epoch": 2.6534915386111653, "grad_norm": 1.34375, "learning_rate": 0.00042922986309940054, "loss": 5.0592, "mean_token_accuracy": 0.198617422580719, "num_tokens": 59154607.0, "step": 34105 }, { "entropy": 5.710095071792603, "epoch": 2.653880567982883, "grad_norm": 1.2109375, "learning_rate": 0.00042920968208299165, "loss": 4.9745, "mean_token_accuracy": 0.20727044492959976, "num_tokens": 59164160.0, "step": 34110 }, { "entropy": 5.767349720001221, "epoch": 2.6542695973546, "grad_norm": 1.2421875, "learning_rate": 0.0004291894987266963, "loss": 4.9719, "mean_token_accuracy": 0.20818634927272797, "num_tokens": 59171976.0, "step": 34115 }, { "entropy": 5.725160789489746, "epoch": 2.654658626726318, "grad_norm": 1.234375, "learning_rate": 0.00042916931303082064, "loss": 4.9851, "mean_token_accuracy": 0.20318965911865233, "num_tokens": 59181168.0, "step": 34120 }, { "entropy": 5.792341613769532, "epoch": 2.655047656098035, "grad_norm": 1.15625, "learning_rate": 0.00042914912499567113, "loss": 5.1291, "mean_token_accuracy": 0.19893434047698974, "num_tokens": 59190047.0, "step": 34125 }, { "entropy": 5.742468690872192, "epoch": 2.655436685469753, "grad_norm": 1.171875, "learning_rate": 0.00042912893462155395, "loss": 5.0088, "mean_token_accuracy": 0.20314448028802873, "num_tokens": 59199065.0, "step": 34130 }, { "entropy": 5.629284954071045, "epoch": 2.6558257148414706, "grad_norm": 1.1953125, "learning_rate": 0.00042910874190877545, "loss": 4.8835, "mean_token_accuracy": 0.21435246616601944, "num_tokens": 59207827.0, "step": 34135 }, { "entropy": 5.763343429565429, "epoch": 2.6562147442131883, "grad_norm": 1.28125, "learning_rate": 0.0004290885468576422, "loss": 5.0895, "mean_token_accuracy": 0.19765060991048813, "num_tokens": 59216429.0, "step": 34140 }, { "entropy": 5.711890172958374, "epoch": 2.6566037735849055, "grad_norm": 1.21875, "learning_rate": 0.0004290683494684604, "loss": 4.9543, "mean_token_accuracy": 0.19945846498012543, "num_tokens": 59224447.0, "step": 34145 }, { "entropy": 5.821471261978149, "epoch": 2.656992802956623, "grad_norm": 1.25, "learning_rate": 0.0004290481497415367, "loss": 5.0392, "mean_token_accuracy": 0.19565333276987076, "num_tokens": 59233124.0, "step": 34150 }, { "entropy": 5.678230714797974, "epoch": 2.657381832328341, "grad_norm": 1.2109375, "learning_rate": 0.0004290279476771775, "loss": 4.9274, "mean_token_accuracy": 0.20692438930273055, "num_tokens": 59241450.0, "step": 34155 }, { "entropy": 5.668998050689697, "epoch": 2.657770861700058, "grad_norm": 1.1953125, "learning_rate": 0.0004290077432756894, "loss": 5.1039, "mean_token_accuracy": 0.19458281993865967, "num_tokens": 59250797.0, "step": 34160 }, { "entropy": 5.6810455322265625, "epoch": 2.658159891071776, "grad_norm": 1.2421875, "learning_rate": 0.0004289875365373788, "loss": 4.894, "mean_token_accuracy": 0.20704687386751175, "num_tokens": 59258854.0, "step": 34165 }, { "entropy": 5.767479085922242, "epoch": 2.6585489204434936, "grad_norm": 1.2890625, "learning_rate": 0.00042896732746255256, "loss": 4.991, "mean_token_accuracy": 0.20295252948999404, "num_tokens": 59267797.0, "step": 34170 }, { "entropy": 5.758969783782959, "epoch": 2.6589379498152113, "grad_norm": 1.1953125, "learning_rate": 0.00042894711605151714, "loss": 4.886, "mean_token_accuracy": 0.2068000093102455, "num_tokens": 59276370.0, "step": 34175 }, { "entropy": 5.707103824615478, "epoch": 2.6593269791869285, "grad_norm": 1.1796875, "learning_rate": 0.00042892690230457924, "loss": 4.9643, "mean_token_accuracy": 0.2099256247282028, "num_tokens": 59285641.0, "step": 34180 }, { "entropy": 5.698118877410889, "epoch": 2.659716008558646, "grad_norm": 1.25, "learning_rate": 0.00042890668622204566, "loss": 4.9649, "mean_token_accuracy": 0.20662615299224854, "num_tokens": 59293816.0, "step": 34185 }, { "entropy": 5.735641813278198, "epoch": 2.660105037930364, "grad_norm": 1.2265625, "learning_rate": 0.000428886467804223, "loss": 4.8918, "mean_token_accuracy": 0.2101651355624199, "num_tokens": 59301854.0, "step": 34190 }, { "entropy": 5.654384994506836, "epoch": 2.660494067302081, "grad_norm": 1.21875, "learning_rate": 0.00042886624705141825, "loss": 4.9381, "mean_token_accuracy": 0.2088841438293457, "num_tokens": 59310798.0, "step": 34195 }, { "entropy": 5.747995471954345, "epoch": 2.660883096673799, "grad_norm": 1.3359375, "learning_rate": 0.00042884602396393796, "loss": 4.9822, "mean_token_accuracy": 0.2033724844455719, "num_tokens": 59319085.0, "step": 34200 }, { "entropy": 5.730429840087891, "epoch": 2.6612721260455166, "grad_norm": 1.21875, "learning_rate": 0.0004288257985420892, "loss": 5.0373, "mean_token_accuracy": 0.19943266957998276, "num_tokens": 59327805.0, "step": 34205 }, { "entropy": 5.801323270797729, "epoch": 2.6616611554172342, "grad_norm": 1.1640625, "learning_rate": 0.0004288055707861788, "loss": 4.9515, "mean_token_accuracy": 0.20899437963962555, "num_tokens": 59336520.0, "step": 34210 }, { "entropy": 5.701657295227051, "epoch": 2.6620501847889515, "grad_norm": 1.1875, "learning_rate": 0.00042878534069651364, "loss": 5.0261, "mean_token_accuracy": 0.20322056859731674, "num_tokens": 59345827.0, "step": 34215 }, { "entropy": 5.717303705215454, "epoch": 2.662439214160669, "grad_norm": 1.3203125, "learning_rate": 0.0004287651082734007, "loss": 5.0176, "mean_token_accuracy": 0.20432397723197937, "num_tokens": 59355024.0, "step": 34220 }, { "entropy": 5.686828374862671, "epoch": 2.6628282435323865, "grad_norm": 1.171875, "learning_rate": 0.000428744873517147, "loss": 4.9155, "mean_token_accuracy": 0.20741923600435258, "num_tokens": 59364461.0, "step": 34225 }, { "entropy": 5.7531617164611815, "epoch": 2.663217272904104, "grad_norm": 1.2890625, "learning_rate": 0.0004287246364280596, "loss": 5.0723, "mean_token_accuracy": 0.19795573949813844, "num_tokens": 59372807.0, "step": 34230 }, { "entropy": 5.762028980255127, "epoch": 2.663606302275822, "grad_norm": 1.203125, "learning_rate": 0.0004287043970064455, "loss": 5.0205, "mean_token_accuracy": 0.20617072135210038, "num_tokens": 59381824.0, "step": 34235 }, { "entropy": 5.69127402305603, "epoch": 2.6639953316475395, "grad_norm": 1.1171875, "learning_rate": 0.0004286841552526118, "loss": 4.923, "mean_token_accuracy": 0.209151428937912, "num_tokens": 59391174.0, "step": 34240 }, { "entropy": 5.71837043762207, "epoch": 2.664384361019257, "grad_norm": 1.0859375, "learning_rate": 0.00042866391116686567, "loss": 4.9975, "mean_token_accuracy": 0.2034860923886299, "num_tokens": 59399927.0, "step": 34245 }, { "entropy": 5.770400857925415, "epoch": 2.6647733903909745, "grad_norm": 1.2890625, "learning_rate": 0.0004286436647495142, "loss": 5.0068, "mean_token_accuracy": 0.20757554471492767, "num_tokens": 59408016.0, "step": 34250 }, { "entropy": 5.685305213928222, "epoch": 2.665162419762692, "grad_norm": 1.2734375, "learning_rate": 0.00042862341600086477, "loss": 5.0437, "mean_token_accuracy": 0.19929721653461457, "num_tokens": 59416702.0, "step": 34255 }, { "entropy": 5.7255926609039305, "epoch": 2.6655514491344094, "grad_norm": 1.1875, "learning_rate": 0.00042860316492122447, "loss": 4.9456, "mean_token_accuracy": 0.2064446359872818, "num_tokens": 59424766.0, "step": 34260 }, { "entropy": 5.7361283779144285, "epoch": 2.665940478506127, "grad_norm": 1.2265625, "learning_rate": 0.0004285829115109006, "loss": 5.0203, "mean_token_accuracy": 0.21132290065288545, "num_tokens": 59433691.0, "step": 34265 }, { "entropy": 5.757352447509765, "epoch": 2.666329507877845, "grad_norm": 1.1796875, "learning_rate": 0.0004285626557702005, "loss": 5.0306, "mean_token_accuracy": 0.2087290421128273, "num_tokens": 59442495.0, "step": 34270 }, { "entropy": 5.707713651657104, "epoch": 2.6667185372495625, "grad_norm": 1.296875, "learning_rate": 0.0004285423976994316, "loss": 4.933, "mean_token_accuracy": 0.2107838973402977, "num_tokens": 59451038.0, "step": 34275 }, { "entropy": 5.665437650680542, "epoch": 2.66710756662128, "grad_norm": 1.25, "learning_rate": 0.00042852213729890117, "loss": 4.968, "mean_token_accuracy": 0.20551634281873704, "num_tokens": 59459119.0, "step": 34280 }, { "entropy": 5.726583051681518, "epoch": 2.6674965959929975, "grad_norm": 1.1796875, "learning_rate": 0.0004285018745689166, "loss": 4.9674, "mean_token_accuracy": 0.2063528925180435, "num_tokens": 59467725.0, "step": 34285 }, { "entropy": 5.739373779296875, "epoch": 2.667885625364715, "grad_norm": 1.25, "learning_rate": 0.0004284816095097855, "loss": 4.9654, "mean_token_accuracy": 0.2044174075126648, "num_tokens": 59476231.0, "step": 34290 }, { "entropy": 5.677328777313233, "epoch": 2.6682746547364324, "grad_norm": 1.2109375, "learning_rate": 0.0004284613421218152, "loss": 4.9802, "mean_token_accuracy": 0.2009228378534317, "num_tokens": 59484898.0, "step": 34295 }, { "entropy": 5.653985023498535, "epoch": 2.66866368410815, "grad_norm": 1.1796875, "learning_rate": 0.00042844107240531324, "loss": 4.915, "mean_token_accuracy": 0.20856723338365554, "num_tokens": 59493546.0, "step": 34300 }, { "entropy": 5.705152559280395, "epoch": 2.669052713479868, "grad_norm": 1.1640625, "learning_rate": 0.0004284208003605873, "loss": 4.9995, "mean_token_accuracy": 0.20154643058776855, "num_tokens": 59502729.0, "step": 34305 }, { "entropy": 5.744889831542968, "epoch": 2.6694417428515855, "grad_norm": 1.1484375, "learning_rate": 0.000428400525987945, "loss": 5.0178, "mean_token_accuracy": 0.200043947994709, "num_tokens": 59512069.0, "step": 34310 }, { "entropy": 5.761573600769043, "epoch": 2.669830772223303, "grad_norm": 1.2421875, "learning_rate": 0.00042838024928769375, "loss": 5.0032, "mean_token_accuracy": 0.20944525450468063, "num_tokens": 59520639.0, "step": 34315 }, { "entropy": 5.699855756759644, "epoch": 2.6702198015950205, "grad_norm": 1.25, "learning_rate": 0.00042835997026014145, "loss": 4.9178, "mean_token_accuracy": 0.21157431602478027, "num_tokens": 59528549.0, "step": 34320 }, { "entropy": 5.669570398330689, "epoch": 2.6706088309667377, "grad_norm": 1.2421875, "learning_rate": 0.0004283396889055957, "loss": 4.9472, "mean_token_accuracy": 0.21069752424955368, "num_tokens": 59537345.0, "step": 34325 }, { "entropy": 5.682067823410034, "epoch": 2.6709978603384554, "grad_norm": 1.1953125, "learning_rate": 0.0004283194052243641, "loss": 5.0326, "mean_token_accuracy": 0.20377924889326096, "num_tokens": 59546866.0, "step": 34330 }, { "entropy": 5.741629505157471, "epoch": 2.671386889710173, "grad_norm": 1.234375, "learning_rate": 0.00042829911921675456, "loss": 4.9909, "mean_token_accuracy": 0.20551317930221558, "num_tokens": 59555363.0, "step": 34335 }, { "entropy": 5.621817636489868, "epoch": 2.671775919081891, "grad_norm": 1.15625, "learning_rate": 0.000428278830883075, "loss": 4.8845, "mean_token_accuracy": 0.2096783697605133, "num_tokens": 59564417.0, "step": 34340 }, { "entropy": 5.792441320419312, "epoch": 2.6721649484536085, "grad_norm": 1.2734375, "learning_rate": 0.00042825854022363307, "loss": 4.982, "mean_token_accuracy": 0.20300291776657103, "num_tokens": 59572948.0, "step": 34345 }, { "entropy": 5.685194063186645, "epoch": 2.6725539778253258, "grad_norm": 1.1796875, "learning_rate": 0.00042823824723873676, "loss": 4.9222, "mean_token_accuracy": 0.21051915138959884, "num_tokens": 59581764.0, "step": 34350 }, { "entropy": 5.667823457717896, "epoch": 2.6729430071970435, "grad_norm": 1.1796875, "learning_rate": 0.00042821795192869407, "loss": 4.9596, "mean_token_accuracy": 0.2097972586750984, "num_tokens": 59590281.0, "step": 34355 }, { "entropy": 5.758218812942505, "epoch": 2.6733320365687607, "grad_norm": 1.3125, "learning_rate": 0.0004281976542938127, "loss": 5.1153, "mean_token_accuracy": 0.1992028012871742, "num_tokens": 59598497.0, "step": 34360 }, { "entropy": 5.68798942565918, "epoch": 2.6737210659404784, "grad_norm": 1.234375, "learning_rate": 0.00042817735433440076, "loss": 4.9587, "mean_token_accuracy": 0.20788857638835906, "num_tokens": 59606901.0, "step": 34365 }, { "entropy": 5.815806818008423, "epoch": 2.674110095312196, "grad_norm": 1.171875, "learning_rate": 0.0004281570520507663, "loss": 5.0901, "mean_token_accuracy": 0.20193422585725784, "num_tokens": 59616045.0, "step": 34370 }, { "entropy": 5.7553153991699215, "epoch": 2.674499124683914, "grad_norm": 1.1484375, "learning_rate": 0.00042813674744321737, "loss": 5.026, "mean_token_accuracy": 0.20758099853992462, "num_tokens": 59624840.0, "step": 34375 }, { "entropy": 5.753082227706909, "epoch": 2.674888154055631, "grad_norm": 1.296875, "learning_rate": 0.000428116440512062, "loss": 5.0049, "mean_token_accuracy": 0.19952386617660522, "num_tokens": 59632887.0, "step": 34380 }, { "entropy": 5.705219841003418, "epoch": 2.6752771834273488, "grad_norm": 1.265625, "learning_rate": 0.0004280961312576084, "loss": 4.9403, "mean_token_accuracy": 0.20924383252859116, "num_tokens": 59641671.0, "step": 34385 }, { "entropy": 5.622870063781738, "epoch": 2.6756662127990665, "grad_norm": 1.1640625, "learning_rate": 0.0004280758196801646, "loss": 4.8907, "mean_token_accuracy": 0.21281724721193312, "num_tokens": 59649406.0, "step": 34390 }, { "entropy": 5.756357669830322, "epoch": 2.6760552421707837, "grad_norm": 1.1328125, "learning_rate": 0.00042805550578003894, "loss": 5.0665, "mean_token_accuracy": 0.20436886698007584, "num_tokens": 59658114.0, "step": 34395 }, { "entropy": 5.734271383285522, "epoch": 2.6764442715425014, "grad_norm": 1.25, "learning_rate": 0.0004280351895575396, "loss": 5.0003, "mean_token_accuracy": 0.20280102789402008, "num_tokens": 59667174.0, "step": 34400 }, { "entropy": 5.707965660095215, "epoch": 2.676833300914219, "grad_norm": 1.21875, "learning_rate": 0.0004280148710129748, "loss": 4.9934, "mean_token_accuracy": 0.20516633093357087, "num_tokens": 59675740.0, "step": 34405 }, { "entropy": 5.77105565071106, "epoch": 2.677222330285937, "grad_norm": 1.3359375, "learning_rate": 0.00042799455014665296, "loss": 5.0953, "mean_token_accuracy": 0.1974347338080406, "num_tokens": 59684550.0, "step": 34410 }, { "entropy": 5.807509040832519, "epoch": 2.677611359657654, "grad_norm": 1.25, "learning_rate": 0.00042797422695888226, "loss": 5.0565, "mean_token_accuracy": 0.2002914533019066, "num_tokens": 59692810.0, "step": 34415 }, { "entropy": 5.706459951400757, "epoch": 2.6780003890293718, "grad_norm": 1.1796875, "learning_rate": 0.0004279539014499712, "loss": 4.9586, "mean_token_accuracy": 0.2028562068939209, "num_tokens": 59701742.0, "step": 34420 }, { "entropy": 5.706363391876221, "epoch": 2.678389418401089, "grad_norm": 1.28125, "learning_rate": 0.0004279335736202281, "loss": 5.0149, "mean_token_accuracy": 0.20255455374717712, "num_tokens": 59710440.0, "step": 34425 }, { "entropy": 5.817629718780518, "epoch": 2.6787784477728067, "grad_norm": 1.171875, "learning_rate": 0.0004279132434699615, "loss": 5.0631, "mean_token_accuracy": 0.2000695139169693, "num_tokens": 59720430.0, "step": 34430 }, { "entropy": 5.703197193145752, "epoch": 2.6791674771445244, "grad_norm": 1.2265625, "learning_rate": 0.0004278929109994798, "loss": 4.9407, "mean_token_accuracy": 0.2040956899523735, "num_tokens": 59730249.0, "step": 34435 }, { "entropy": 5.685248470306396, "epoch": 2.679556506516242, "grad_norm": 1.25, "learning_rate": 0.00042787257620909144, "loss": 4.9007, "mean_token_accuracy": 0.2071670338511467, "num_tokens": 59738815.0, "step": 34440 }, { "entropy": 5.642336463928222, "epoch": 2.67994553588796, "grad_norm": 1.2890625, "learning_rate": 0.00042785223909910515, "loss": 4.8777, "mean_token_accuracy": 0.20694874823093415, "num_tokens": 59747092.0, "step": 34445 }, { "entropy": 5.721462631225586, "epoch": 2.680334565259677, "grad_norm": 1.203125, "learning_rate": 0.0004278318996698294, "loss": 5.0435, "mean_token_accuracy": 0.20601654797792435, "num_tokens": 59756832.0, "step": 34450 }, { "entropy": 5.856013917922974, "epoch": 2.6807235946313948, "grad_norm": 1.2890625, "learning_rate": 0.0004278115579215728, "loss": 5.0553, "mean_token_accuracy": 0.20056673884391785, "num_tokens": 59766052.0, "step": 34455 }, { "entropy": 5.746983671188355, "epoch": 2.681112624003112, "grad_norm": 1.2890625, "learning_rate": 0.0004277912138546441, "loss": 4.9708, "mean_token_accuracy": 0.21023318618535997, "num_tokens": 59774369.0, "step": 34460 }, { "entropy": 5.66866364479065, "epoch": 2.6815016533748297, "grad_norm": 1.1484375, "learning_rate": 0.0004277708674693519, "loss": 4.9301, "mean_token_accuracy": 0.20767375826835632, "num_tokens": 59782509.0, "step": 34465 }, { "entropy": 5.62712779045105, "epoch": 2.6818906827465474, "grad_norm": 1.25, "learning_rate": 0.00042775051876600483, "loss": 4.875, "mean_token_accuracy": 0.21391932368278505, "num_tokens": 59790808.0, "step": 34470 }, { "entropy": 5.700487565994263, "epoch": 2.682279712118265, "grad_norm": 1.203125, "learning_rate": 0.0004277301677449119, "loss": 4.8776, "mean_token_accuracy": 0.20615995973348616, "num_tokens": 59799260.0, "step": 34475 }, { "entropy": 5.701141738891602, "epoch": 2.6826687414899824, "grad_norm": 1.34375, "learning_rate": 0.0004277098144063818, "loss": 5.0153, "mean_token_accuracy": 0.20255304127931595, "num_tokens": 59807350.0, "step": 34480 }, { "entropy": 5.676778936386109, "epoch": 2.6830577708617, "grad_norm": 1.15625, "learning_rate": 0.00042768945875072326, "loss": 5.0345, "mean_token_accuracy": 0.19561164379119872, "num_tokens": 59816071.0, "step": 34485 }, { "entropy": 5.782888460159302, "epoch": 2.6834468002334178, "grad_norm": 1.3046875, "learning_rate": 0.0004276691007782451, "loss": 4.9959, "mean_token_accuracy": 0.20465882122516632, "num_tokens": 59825332.0, "step": 34490 }, { "entropy": 5.768308162689209, "epoch": 2.683835829605135, "grad_norm": 1.1484375, "learning_rate": 0.0004276487404892565, "loss": 4.9874, "mean_token_accuracy": 0.20081970393657683, "num_tokens": 59834082.0, "step": 34495 }, { "entropy": 5.759471702575683, "epoch": 2.6842248589768527, "grad_norm": 1.2421875, "learning_rate": 0.00042762837788406615, "loss": 5.0187, "mean_token_accuracy": 0.19923206716775893, "num_tokens": 59842633.0, "step": 34500 }, { "entropy": 5.7559812545776365, "epoch": 2.6846138883485704, "grad_norm": 1.3125, "learning_rate": 0.0004276080129629831, "loss": 4.9906, "mean_token_accuracy": 0.19696338325738907, "num_tokens": 59850517.0, "step": 34505 }, { "entropy": 5.774619197845459, "epoch": 2.685002917720288, "grad_norm": 1.2734375, "learning_rate": 0.00042758764572631644, "loss": 5.0733, "mean_token_accuracy": 0.20361544489860534, "num_tokens": 59859112.0, "step": 34510 }, { "entropy": 5.720070695877075, "epoch": 2.6853919470920053, "grad_norm": 1.2265625, "learning_rate": 0.00042756727617437504, "loss": 4.8985, "mean_token_accuracy": 0.21457205563783646, "num_tokens": 59868413.0, "step": 34515 }, { "entropy": 5.782192087173462, "epoch": 2.685780976463723, "grad_norm": 1.2890625, "learning_rate": 0.00042754690430746805, "loss": 5.0949, "mean_token_accuracy": 0.19886511713266372, "num_tokens": 59877300.0, "step": 34520 }, { "entropy": 5.692990922927857, "epoch": 2.6861700058354403, "grad_norm": 1.21875, "learning_rate": 0.0004275265301259046, "loss": 5.02, "mean_token_accuracy": 0.2044863820075989, "num_tokens": 59885440.0, "step": 34525 }, { "entropy": 5.840363788604736, "epoch": 2.686559035207158, "grad_norm": 1.21875, "learning_rate": 0.00042750615362999395, "loss": 5.0839, "mean_token_accuracy": 0.197516630589962, "num_tokens": 59893954.0, "step": 34530 }, { "entropy": 5.734859371185303, "epoch": 2.6869480645788757, "grad_norm": 1.2578125, "learning_rate": 0.00042748577482004495, "loss": 5.0112, "mean_token_accuracy": 0.21043031364679338, "num_tokens": 59902336.0, "step": 34535 }, { "entropy": 5.689530372619629, "epoch": 2.6873370939505934, "grad_norm": 1.1640625, "learning_rate": 0.00042746539369636715, "loss": 4.8873, "mean_token_accuracy": 0.21367642432451248, "num_tokens": 59911134.0, "step": 34540 }, { "entropy": 5.635930395126342, "epoch": 2.687726123322311, "grad_norm": 1.265625, "learning_rate": 0.00042744501025926966, "loss": 4.889, "mean_token_accuracy": 0.2101759597659111, "num_tokens": 59920450.0, "step": 34545 }, { "entropy": 5.76396746635437, "epoch": 2.6881151526940283, "grad_norm": 1.25, "learning_rate": 0.0004274246245090618, "loss": 4.9418, "mean_token_accuracy": 0.21073322594165803, "num_tokens": 59928919.0, "step": 34550 }, { "entropy": 5.72912368774414, "epoch": 2.688504182065746, "grad_norm": 1.1484375, "learning_rate": 0.0004274042364460529, "loss": 4.9545, "mean_token_accuracy": 0.21054078936576842, "num_tokens": 59937973.0, "step": 34555 }, { "entropy": 5.693518018722534, "epoch": 2.6888932114374633, "grad_norm": 1.2421875, "learning_rate": 0.00042738384607055214, "loss": 5.0033, "mean_token_accuracy": 0.2026141256093979, "num_tokens": 59946177.0, "step": 34560 }, { "entropy": 5.677424383163452, "epoch": 2.689282240809181, "grad_norm": 1.2734375, "learning_rate": 0.00042736345338286917, "loss": 4.9717, "mean_token_accuracy": 0.2059548392891884, "num_tokens": 59955351.0, "step": 34565 }, { "entropy": 5.810290861129761, "epoch": 2.6896712701808987, "grad_norm": 1.2578125, "learning_rate": 0.0004273430583833133, "loss": 5.0546, "mean_token_accuracy": 0.19982922077178955, "num_tokens": 59963839.0, "step": 34570 }, { "entropy": 5.777476835250854, "epoch": 2.6900602995526164, "grad_norm": 1.28125, "learning_rate": 0.000427322661072194, "loss": 5.0126, "mean_token_accuracy": 0.19607831090688704, "num_tokens": 59971779.0, "step": 34575 }, { "entropy": 5.72911958694458, "epoch": 2.6904493289243336, "grad_norm": 1.1640625, "learning_rate": 0.0004273022614498208, "loss": 4.9413, "mean_token_accuracy": 0.2144157811999321, "num_tokens": 59980932.0, "step": 34580 }, { "entropy": 5.692115640640258, "epoch": 2.6908383582960513, "grad_norm": 1.2265625, "learning_rate": 0.0004272818595165031, "loss": 4.9468, "mean_token_accuracy": 0.2088965117931366, "num_tokens": 59990281.0, "step": 34585 }, { "entropy": 5.657464170455933, "epoch": 2.691227387667769, "grad_norm": 1.203125, "learning_rate": 0.0004272614552725506, "loss": 4.8957, "mean_token_accuracy": 0.2165690392255783, "num_tokens": 59998642.0, "step": 34590 }, { "entropy": 5.748263263702393, "epoch": 2.6916164170394863, "grad_norm": 1.2734375, "learning_rate": 0.00042724104871827293, "loss": 5.0416, "mean_token_accuracy": 0.20031506568193436, "num_tokens": 60006998.0, "step": 34595 }, { "entropy": 5.692966938018799, "epoch": 2.692005446411204, "grad_norm": 1.2578125, "learning_rate": 0.0004272206398539795, "loss": 4.9268, "mean_token_accuracy": 0.21310198456048965, "num_tokens": 60015279.0, "step": 34600 }, { "entropy": 5.7123922348022464, "epoch": 2.6923944757829217, "grad_norm": 1.2265625, "learning_rate": 0.00042720022867998026, "loss": 4.9973, "mean_token_accuracy": 0.2108032524585724, "num_tokens": 60024648.0, "step": 34605 }, { "entropy": 5.766274690628052, "epoch": 2.6927835051546394, "grad_norm": 1.1796875, "learning_rate": 0.0004271798151965848, "loss": 5.0739, "mean_token_accuracy": 0.19784532487392426, "num_tokens": 60033821.0, "step": 34610 }, { "entropy": 5.711894464492798, "epoch": 2.6931725345263566, "grad_norm": 1.34375, "learning_rate": 0.0004271593994041029, "loss": 4.9666, "mean_token_accuracy": 0.20597291141748428, "num_tokens": 60041745.0, "step": 34615 }, { "entropy": 5.721702718734742, "epoch": 2.6935615638980743, "grad_norm": 1.1640625, "learning_rate": 0.0004271389813028443, "loss": 5.0145, "mean_token_accuracy": 0.2035991907119751, "num_tokens": 60051659.0, "step": 34620 }, { "entropy": 5.809305334091187, "epoch": 2.693950593269792, "grad_norm": 1.25, "learning_rate": 0.0004271185608931187, "loss": 5.0707, "mean_token_accuracy": 0.19894105345010757, "num_tokens": 60060498.0, "step": 34625 }, { "entropy": 5.725055074691772, "epoch": 2.6943396226415093, "grad_norm": 1.2890625, "learning_rate": 0.00042709813817523617, "loss": 4.9585, "mean_token_accuracy": 0.20647538900375367, "num_tokens": 60068678.0, "step": 34630 }, { "entropy": 5.695586681365967, "epoch": 2.694728652013227, "grad_norm": 1.3046875, "learning_rate": 0.00042707771314950645, "loss": 4.9189, "mean_token_accuracy": 0.20867100059986116, "num_tokens": 60077889.0, "step": 34635 }, { "entropy": 5.733066034317017, "epoch": 2.6951176813849447, "grad_norm": 1.25, "learning_rate": 0.00042705728581623944, "loss": 4.9613, "mean_token_accuracy": 0.2031735897064209, "num_tokens": 60085989.0, "step": 34640 }, { "entropy": 5.732077980041504, "epoch": 2.6955067107566624, "grad_norm": 1.203125, "learning_rate": 0.0004270368561757452, "loss": 4.9596, "mean_token_accuracy": 0.21152431815862655, "num_tokens": 60095012.0, "step": 34645 }, { "entropy": 5.766296005249023, "epoch": 2.6958957401283796, "grad_norm": 1.234375, "learning_rate": 0.0004270164242283336, "loss": 4.9966, "mean_token_accuracy": 0.19968489706516265, "num_tokens": 60103894.0, "step": 34650 }, { "entropy": 5.659416389465332, "epoch": 2.6962847695000973, "grad_norm": 1.1484375, "learning_rate": 0.0004269959899743148, "loss": 4.9115, "mean_token_accuracy": 0.21211848855018617, "num_tokens": 60112456.0, "step": 34655 }, { "entropy": 5.730069589614868, "epoch": 2.6966737988718146, "grad_norm": 1.3203125, "learning_rate": 0.0004269755534139987, "loss": 4.9741, "mean_token_accuracy": 0.21056637167930603, "num_tokens": 60120378.0, "step": 34660 }, { "entropy": 5.76883544921875, "epoch": 2.6970628282435323, "grad_norm": 1.3125, "learning_rate": 0.00042695511454769557, "loss": 5.0386, "mean_token_accuracy": 0.20382359027862548, "num_tokens": 60128091.0, "step": 34665 }, { "entropy": 5.729851579666137, "epoch": 2.69745185761525, "grad_norm": 1.2734375, "learning_rate": 0.00042693467337571534, "loss": 5.0353, "mean_token_accuracy": 0.21102262884378434, "num_tokens": 60136298.0, "step": 34670 }, { "entropy": 5.751916790008545, "epoch": 2.6978408869869677, "grad_norm": 1.171875, "learning_rate": 0.0004269142298983684, "loss": 4.9719, "mean_token_accuracy": 0.21005962789058685, "num_tokens": 60145556.0, "step": 34675 }, { "entropy": 5.738935852050782, "epoch": 2.698229916358685, "grad_norm": 1.2265625, "learning_rate": 0.00042689378411596467, "loss": 4.9683, "mean_token_accuracy": 0.20772922784090042, "num_tokens": 60154301.0, "step": 34680 }, { "entropy": 5.638726139068604, "epoch": 2.6986189457304026, "grad_norm": 1.1796875, "learning_rate": 0.0004268733360288146, "loss": 4.8963, "mean_token_accuracy": 0.21988784223794938, "num_tokens": 60162646.0, "step": 34685 }, { "entropy": 5.715686941146851, "epoch": 2.6990079751021203, "grad_norm": 1.2734375, "learning_rate": 0.00042685288563722835, "loss": 4.975, "mean_token_accuracy": 0.20081396996974946, "num_tokens": 60170749.0, "step": 34690 }, { "entropy": 5.690022993087768, "epoch": 2.6993970044738376, "grad_norm": 1.2734375, "learning_rate": 0.0004268324329415163, "loss": 4.895, "mean_token_accuracy": 0.20920142978429795, "num_tokens": 60178798.0, "step": 34695 }, { "entropy": 5.720432758331299, "epoch": 2.6997860338455553, "grad_norm": 1.3203125, "learning_rate": 0.0004268119779419887, "loss": 4.9332, "mean_token_accuracy": 0.20723330974578857, "num_tokens": 60186974.0, "step": 34700 }, { "entropy": 5.724871253967285, "epoch": 2.700175063217273, "grad_norm": 1.171875, "learning_rate": 0.00042679152063895603, "loss": 4.918, "mean_token_accuracy": 0.21032529175281525, "num_tokens": 60195271.0, "step": 34705 }, { "entropy": 5.708724737167358, "epoch": 2.7005640925889907, "grad_norm": 1.1796875, "learning_rate": 0.00042677106103272867, "loss": 4.938, "mean_token_accuracy": 0.21364624053239822, "num_tokens": 60204476.0, "step": 34710 }, { "entropy": 5.764652967453003, "epoch": 2.700953121960708, "grad_norm": 1.203125, "learning_rate": 0.000426750599123617, "loss": 5.0303, "mean_token_accuracy": 0.20743575990200042, "num_tokens": 60213285.0, "step": 34715 }, { "entropy": 5.714259624481201, "epoch": 2.7013421513324256, "grad_norm": 1.1796875, "learning_rate": 0.00042673013491193145, "loss": 4.959, "mean_token_accuracy": 0.21202171891927718, "num_tokens": 60222321.0, "step": 34720 }, { "entropy": 5.71475658416748, "epoch": 2.7017311807041433, "grad_norm": 1.2578125, "learning_rate": 0.00042670966839798263, "loss": 4.954, "mean_token_accuracy": 0.21943913847208024, "num_tokens": 60230759.0, "step": 34725 }, { "entropy": 5.752508115768433, "epoch": 2.7021202100758606, "grad_norm": 1.2578125, "learning_rate": 0.0004266891995820811, "loss": 4.9569, "mean_token_accuracy": 0.20701811015605925, "num_tokens": 60238570.0, "step": 34730 }, { "entropy": 5.689750099182129, "epoch": 2.7025092394475783, "grad_norm": 1.25, "learning_rate": 0.00042666872846453734, "loss": 5.0124, "mean_token_accuracy": 0.20708002150058746, "num_tokens": 60247445.0, "step": 34735 }, { "entropy": 5.71483678817749, "epoch": 2.702898268819296, "grad_norm": 1.40625, "learning_rate": 0.00042664825504566206, "loss": 4.9743, "mean_token_accuracy": 0.20466889142990113, "num_tokens": 60256358.0, "step": 34740 }, { "entropy": 5.710266351699829, "epoch": 2.7032872981910137, "grad_norm": 1.296875, "learning_rate": 0.000426627779325766, "loss": 4.9807, "mean_token_accuracy": 0.2108331874012947, "num_tokens": 60264347.0, "step": 34745 }, { "entropy": 5.682127952575684, "epoch": 2.703676327562731, "grad_norm": 1.171875, "learning_rate": 0.0004266073013051595, "loss": 4.9296, "mean_token_accuracy": 0.20495521873235703, "num_tokens": 60273858.0, "step": 34750 }, { "entropy": 5.729088830947876, "epoch": 2.7040653569344486, "grad_norm": 1.234375, "learning_rate": 0.0004265868209841537, "loss": 4.9102, "mean_token_accuracy": 0.21208834350109101, "num_tokens": 60282089.0, "step": 34755 }, { "entropy": 5.7395209789276125, "epoch": 2.704454386306166, "grad_norm": 1.2109375, "learning_rate": 0.0004265663383630591, "loss": 5.0135, "mean_token_accuracy": 0.20160863548517227, "num_tokens": 60291253.0, "step": 34760 }, { "entropy": 5.8134417057037355, "epoch": 2.7048434156778836, "grad_norm": 1.15625, "learning_rate": 0.00042654585344218657, "loss": 5.0007, "mean_token_accuracy": 0.2040922984480858, "num_tokens": 60300584.0, "step": 34765 }, { "entropy": 5.784536933898925, "epoch": 2.7052324450496013, "grad_norm": 1.2578125, "learning_rate": 0.0004265253662218469, "loss": 4.9775, "mean_token_accuracy": 0.20957054793834687, "num_tokens": 60308822.0, "step": 34770 }, { "entropy": 5.750934314727783, "epoch": 2.705621474421319, "grad_norm": 1.265625, "learning_rate": 0.00042650487670235093, "loss": 5.0255, "mean_token_accuracy": 0.20726120173931123, "num_tokens": 60317466.0, "step": 34775 }, { "entropy": 5.742150974273682, "epoch": 2.7060105037930366, "grad_norm": 1.3125, "learning_rate": 0.0004264843848840097, "loss": 5.0329, "mean_token_accuracy": 0.20072442591190337, "num_tokens": 60325307.0, "step": 34780 }, { "entropy": 5.7946398735046385, "epoch": 2.706399533164754, "grad_norm": 1.1953125, "learning_rate": 0.000426463890767134, "loss": 5.0923, "mean_token_accuracy": 0.19247280210256576, "num_tokens": 60334300.0, "step": 34785 }, { "entropy": 5.765507173538208, "epoch": 2.7067885625364716, "grad_norm": 1.3203125, "learning_rate": 0.0004264433943520349, "loss": 5.0022, "mean_token_accuracy": 0.1996670052409172, "num_tokens": 60343481.0, "step": 34790 }, { "entropy": 5.712976503372192, "epoch": 2.707177591908189, "grad_norm": 1.1328125, "learning_rate": 0.00042642289563902326, "loss": 4.969, "mean_token_accuracy": 0.2033510372042656, "num_tokens": 60353134.0, "step": 34795 }, { "entropy": 5.692203330993652, "epoch": 2.7075666212799065, "grad_norm": 1.203125, "learning_rate": 0.00042640239462841023, "loss": 4.9311, "mean_token_accuracy": 0.2189630463719368, "num_tokens": 60362389.0, "step": 34800 }, { "entropy": 5.6714616298675535, "epoch": 2.7079556506516242, "grad_norm": 1.3359375, "learning_rate": 0.00042638189132050675, "loss": 4.903, "mean_token_accuracy": 0.20914671272039415, "num_tokens": 60370963.0, "step": 34805 }, { "entropy": 5.682628631591797, "epoch": 2.708344680023342, "grad_norm": 1.2890625, "learning_rate": 0.00042636138571562415, "loss": 5.0499, "mean_token_accuracy": 0.1973483607172966, "num_tokens": 60379534.0, "step": 34810 }, { "entropy": 5.742335939407349, "epoch": 2.708733709395059, "grad_norm": 1.109375, "learning_rate": 0.00042634087781407337, "loss": 5.0105, "mean_token_accuracy": 0.20322399884462355, "num_tokens": 60389234.0, "step": 34815 }, { "entropy": 5.763094329833985, "epoch": 2.709122738766777, "grad_norm": 1.140625, "learning_rate": 0.00042632036761616564, "loss": 4.9565, "mean_token_accuracy": 0.20478915870189668, "num_tokens": 60398571.0, "step": 34820 }, { "entropy": 5.773325872421265, "epoch": 2.7095117681384946, "grad_norm": 1.21875, "learning_rate": 0.00042629985512221224, "loss": 5.0574, "mean_token_accuracy": 0.20083595663309098, "num_tokens": 60407356.0, "step": 34825 }, { "entropy": 5.770509243011475, "epoch": 2.709900797510212, "grad_norm": 1.265625, "learning_rate": 0.0004262793403325243, "loss": 5.0805, "mean_token_accuracy": 0.20352385193109512, "num_tokens": 60415617.0, "step": 34830 }, { "entropy": 5.775991821289063, "epoch": 2.7102898268819295, "grad_norm": 1.21875, "learning_rate": 0.00042625882324741316, "loss": 5.0342, "mean_token_accuracy": 0.20488301515579224, "num_tokens": 60424453.0, "step": 34835 }, { "entropy": 5.77035870552063, "epoch": 2.7106788562536472, "grad_norm": 1.21875, "learning_rate": 0.0004262383038671902, "loss": 4.9287, "mean_token_accuracy": 0.21327052265405655, "num_tokens": 60433358.0, "step": 34840 }, { "entropy": 5.661027908325195, "epoch": 2.711067885625365, "grad_norm": 1.2421875, "learning_rate": 0.0004262177821921666, "loss": 4.979, "mean_token_accuracy": 0.20491316318511962, "num_tokens": 60441793.0, "step": 34845 }, { "entropy": 5.699153327941895, "epoch": 2.711456914997082, "grad_norm": 1.3046875, "learning_rate": 0.00042619725822265394, "loss": 4.9858, "mean_token_accuracy": 0.21169234365224837, "num_tokens": 60449981.0, "step": 34850 }, { "entropy": 5.725878715515137, "epoch": 2.7118459443688, "grad_norm": 1.1640625, "learning_rate": 0.00042617673195896345, "loss": 5.0446, "mean_token_accuracy": 0.2013273596763611, "num_tokens": 60459050.0, "step": 34855 }, { "entropy": 5.644851160049439, "epoch": 2.712234973740517, "grad_norm": 1.3203125, "learning_rate": 0.00042615620340140674, "loss": 4.8785, "mean_token_accuracy": 0.2168274626135826, "num_tokens": 60467300.0, "step": 34860 }, { "entropy": 5.667937564849853, "epoch": 2.712624003112235, "grad_norm": 1.2578125, "learning_rate": 0.00042613567255029525, "loss": 4.9721, "mean_token_accuracy": 0.20395568758249283, "num_tokens": 60475969.0, "step": 34865 }, { "entropy": 5.670084047317505, "epoch": 2.7130130324839525, "grad_norm": 1.2265625, "learning_rate": 0.00042611513940594037, "loss": 4.9859, "mean_token_accuracy": 0.20368527323007585, "num_tokens": 60484886.0, "step": 34870 }, { "entropy": 5.755404949188232, "epoch": 2.7134020618556702, "grad_norm": 1.203125, "learning_rate": 0.0004260946039686539, "loss": 5.0313, "mean_token_accuracy": 0.20542648136615754, "num_tokens": 60494172.0, "step": 34875 }, { "entropy": 5.749806642532349, "epoch": 2.713791091227388, "grad_norm": 1.2578125, "learning_rate": 0.00042607406623874726, "loss": 5.0298, "mean_token_accuracy": 0.20271970331668854, "num_tokens": 60501722.0, "step": 34880 }, { "entropy": 5.689139461517334, "epoch": 2.714180120599105, "grad_norm": 1.3125, "learning_rate": 0.0004260535262165322, "loss": 4.8959, "mean_token_accuracy": 0.21555050015449523, "num_tokens": 60510613.0, "step": 34885 }, { "entropy": 5.727802515029907, "epoch": 2.714569149970823, "grad_norm": 1.1640625, "learning_rate": 0.00042603298390232015, "loss": 5.0455, "mean_token_accuracy": 0.20479456782341005, "num_tokens": 60519868.0, "step": 34890 }, { "entropy": 5.797341966629029, "epoch": 2.71495817934254, "grad_norm": 1.1953125, "learning_rate": 0.00042601243929642305, "loss": 5.0019, "mean_token_accuracy": 0.2002681940793991, "num_tokens": 60528832.0, "step": 34895 }, { "entropy": 5.747339677810669, "epoch": 2.715347208714258, "grad_norm": 1.2734375, "learning_rate": 0.00042599189239915253, "loss": 4.9556, "mean_token_accuracy": 0.2038455232977867, "num_tokens": 60537870.0, "step": 34900 }, { "entropy": 5.737611961364746, "epoch": 2.7157362380859755, "grad_norm": 1.2421875, "learning_rate": 0.0004259713432108204, "loss": 4.9707, "mean_token_accuracy": 0.20180934071540832, "num_tokens": 60546157.0, "step": 34905 }, { "entropy": 5.65564661026001, "epoch": 2.7161252674576932, "grad_norm": 1.34375, "learning_rate": 0.0004259507917317384, "loss": 4.9648, "mean_token_accuracy": 0.20778005868196486, "num_tokens": 60554411.0, "step": 34910 }, { "entropy": 5.7488648891448975, "epoch": 2.7165142968294105, "grad_norm": 1.2421875, "learning_rate": 0.00042593023796221843, "loss": 5.0102, "mean_token_accuracy": 0.2090827077627182, "num_tokens": 60562748.0, "step": 34915 }, { "entropy": 5.7126532077789305, "epoch": 2.716903326201128, "grad_norm": 1.1875, "learning_rate": 0.0004259096819025723, "loss": 4.9927, "mean_token_accuracy": 0.20814819484949112, "num_tokens": 60572004.0, "step": 34920 }, { "entropy": 5.782754421234131, "epoch": 2.717292355572846, "grad_norm": 1.375, "learning_rate": 0.00042588912355311196, "loss": 5.0164, "mean_token_accuracy": 0.20423269718885423, "num_tokens": 60580596.0, "step": 34925 }, { "entropy": 5.682749176025391, "epoch": 2.717681384944563, "grad_norm": 1.34375, "learning_rate": 0.00042586856291414925, "loss": 4.9912, "mean_token_accuracy": 0.20614904463291167, "num_tokens": 60588734.0, "step": 34930 }, { "entropy": 5.733005571365356, "epoch": 2.718070414316281, "grad_norm": 1.234375, "learning_rate": 0.00042584799998599633, "loss": 4.9802, "mean_token_accuracy": 0.20903565734624863, "num_tokens": 60597302.0, "step": 34935 }, { "entropy": 5.774004220962524, "epoch": 2.7184594436879985, "grad_norm": 1.1796875, "learning_rate": 0.0004258274347689651, "loss": 5.023, "mean_token_accuracy": 0.20568388551473618, "num_tokens": 60606928.0, "step": 34940 }, { "entropy": 5.7615009307861325, "epoch": 2.718848473059716, "grad_norm": 1.2421875, "learning_rate": 0.00042580686726336766, "loss": 4.9983, "mean_token_accuracy": 0.20735178142786026, "num_tokens": 60615970.0, "step": 34945 }, { "entropy": 5.679314994812012, "epoch": 2.7192375024314335, "grad_norm": 1.1796875, "learning_rate": 0.00042578629746951597, "loss": 5.0271, "mean_token_accuracy": 0.2010158434510231, "num_tokens": 60625453.0, "step": 34950 }, { "entropy": 5.7563207149505615, "epoch": 2.719626531803151, "grad_norm": 1.2578125, "learning_rate": 0.0004257657253877222, "loss": 4.9946, "mean_token_accuracy": 0.20465788543224334, "num_tokens": 60634622.0, "step": 34955 }, { "entropy": 5.743898582458496, "epoch": 2.720015561174869, "grad_norm": 1.2109375, "learning_rate": 0.00042574515101829856, "loss": 4.9753, "mean_token_accuracy": 0.20625389218330384, "num_tokens": 60643463.0, "step": 34960 }, { "entropy": 5.722774267196655, "epoch": 2.720404590546586, "grad_norm": 1.2890625, "learning_rate": 0.00042572457436155717, "loss": 4.9792, "mean_token_accuracy": 0.20772645473480225, "num_tokens": 60652192.0, "step": 34965 }, { "entropy": 5.801822805404663, "epoch": 2.720793619918304, "grad_norm": 1.28125, "learning_rate": 0.00042570399541781023, "loss": 5.0684, "mean_token_accuracy": 0.20162671357393264, "num_tokens": 60661071.0, "step": 34970 }, { "entropy": 5.844265604019165, "epoch": 2.7211826492900215, "grad_norm": 1.3359375, "learning_rate": 0.00042568341418737016, "loss": 5.1301, "mean_token_accuracy": 0.19163855761289597, "num_tokens": 60670165.0, "step": 34975 }, { "entropy": 5.7369482040405275, "epoch": 2.721571678661739, "grad_norm": 1.203125, "learning_rate": 0.000425662830670549, "loss": 4.9387, "mean_token_accuracy": 0.21139754354953766, "num_tokens": 60678260.0, "step": 34980 }, { "entropy": 5.710980939865112, "epoch": 2.7219607080334565, "grad_norm": 1.1484375, "learning_rate": 0.00042564224486765925, "loss": 4.9361, "mean_token_accuracy": 0.20876182615756989, "num_tokens": 60686919.0, "step": 34985 }, { "entropy": 5.648633337020874, "epoch": 2.722349737405174, "grad_norm": 1.15625, "learning_rate": 0.0004256216567790131, "loss": 4.9175, "mean_token_accuracy": 0.21413609385490417, "num_tokens": 60695549.0, "step": 34990 }, { "entropy": 5.676197719573975, "epoch": 2.7227387667768914, "grad_norm": 1.265625, "learning_rate": 0.0004256010664049232, "loss": 4.935, "mean_token_accuracy": 0.20499771386384963, "num_tokens": 60704258.0, "step": 34995 }, { "entropy": 5.7418817520141605, "epoch": 2.723127796148609, "grad_norm": 1.2578125, "learning_rate": 0.0004255804737457017, "loss": 4.9987, "mean_token_accuracy": 0.20395641177892684, "num_tokens": 60712860.0, "step": 35000 }, { "entropy": 5.758773565292358, "epoch": 2.723516825520327, "grad_norm": 1.1484375, "learning_rate": 0.00042555987880166127, "loss": 4.9588, "mean_token_accuracy": 0.21026446521282197, "num_tokens": 60721861.0, "step": 35005 }, { "entropy": 5.74115514755249, "epoch": 2.7239058548920445, "grad_norm": 1.2421875, "learning_rate": 0.0004255392815731142, "loss": 4.9763, "mean_token_accuracy": 0.21015562862157822, "num_tokens": 60730760.0, "step": 35010 }, { "entropy": 5.722838449478149, "epoch": 2.7242948842637618, "grad_norm": 1.3046875, "learning_rate": 0.00042551868206037324, "loss": 5.0249, "mean_token_accuracy": 0.20266616046428682, "num_tokens": 60739192.0, "step": 35015 }, { "entropy": 5.692070960998535, "epoch": 2.7246839136354795, "grad_norm": 1.1796875, "learning_rate": 0.00042549808026375084, "loss": 4.9618, "mean_token_accuracy": 0.2035704180598259, "num_tokens": 60748009.0, "step": 35020 }, { "entropy": 5.759868144989014, "epoch": 2.725072943007197, "grad_norm": 1.2734375, "learning_rate": 0.00042547747618355966, "loss": 4.9883, "mean_token_accuracy": 0.2068682610988617, "num_tokens": 60756663.0, "step": 35025 }, { "entropy": 5.797516345977783, "epoch": 2.7254619723789144, "grad_norm": 1.1171875, "learning_rate": 0.0004254568698201122, "loss": 5.1447, "mean_token_accuracy": 0.19653619080781937, "num_tokens": 60765055.0, "step": 35030 }, { "entropy": 5.7462303161621096, "epoch": 2.725851001750632, "grad_norm": 1.2265625, "learning_rate": 0.00042543626117372133, "loss": 5.0309, "mean_token_accuracy": 0.19972134679555892, "num_tokens": 60773745.0, "step": 35035 }, { "entropy": 5.75904107093811, "epoch": 2.72624003112235, "grad_norm": 1.34375, "learning_rate": 0.00042541565024469945, "loss": 5.0406, "mean_token_accuracy": 0.20440130829811096, "num_tokens": 60782244.0, "step": 35040 }, { "entropy": 5.6577009677886965, "epoch": 2.7266290604940675, "grad_norm": 1.140625, "learning_rate": 0.00042539503703335963, "loss": 4.8573, "mean_token_accuracy": 0.21157162189483641, "num_tokens": 60791156.0, "step": 35045 }, { "entropy": 5.672375917434692, "epoch": 2.7270180898657848, "grad_norm": 1.1640625, "learning_rate": 0.00042537442154001455, "loss": 4.8835, "mean_token_accuracy": 0.19968964904546738, "num_tokens": 60799498.0, "step": 35050 }, { "entropy": 5.702756881713867, "epoch": 2.7274071192375025, "grad_norm": 1.15625, "learning_rate": 0.00042535380376497684, "loss": 5.1033, "mean_token_accuracy": 0.19560906887054444, "num_tokens": 60807991.0, "step": 35055 }, { "entropy": 5.790675115585327, "epoch": 2.72779614860922, "grad_norm": 1.234375, "learning_rate": 0.0004253331837085595, "loss": 4.972, "mean_token_accuracy": 0.20064919888973237, "num_tokens": 60815674.0, "step": 35060 }, { "entropy": 5.697532701492309, "epoch": 2.7281851779809374, "grad_norm": 1.3828125, "learning_rate": 0.00042531256137107545, "loss": 4.9192, "mean_token_accuracy": 0.20600660592317582, "num_tokens": 60823490.0, "step": 35065 }, { "entropy": 5.690334749221802, "epoch": 2.728574207352655, "grad_norm": 1.203125, "learning_rate": 0.0004252919367528375, "loss": 5.0118, "mean_token_accuracy": 0.20716657787561416, "num_tokens": 60832437.0, "step": 35070 }, { "entropy": 5.729960680007935, "epoch": 2.728963236724373, "grad_norm": 1.2109375, "learning_rate": 0.00042527130985415857, "loss": 5.0156, "mean_token_accuracy": 0.20654461532831192, "num_tokens": 60841450.0, "step": 35075 }, { "entropy": 5.747552537918091, "epoch": 2.7293522660960905, "grad_norm": 1.3359375, "learning_rate": 0.0004252506806753517, "loss": 4.9277, "mean_token_accuracy": 0.21279024183750153, "num_tokens": 60849848.0, "step": 35080 }, { "entropy": 5.624545621871948, "epoch": 2.7297412954678077, "grad_norm": 1.125, "learning_rate": 0.00042523004921673, "loss": 4.8812, "mean_token_accuracy": 0.20721808522939683, "num_tokens": 60858912.0, "step": 35085 }, { "entropy": 5.679261541366577, "epoch": 2.7301303248395254, "grad_norm": 1.1796875, "learning_rate": 0.0004252094154786063, "loss": 4.9422, "mean_token_accuracy": 0.2047719970345497, "num_tokens": 60867204.0, "step": 35090 }, { "entropy": 5.714808320999145, "epoch": 2.7305193542112427, "grad_norm": 1.25, "learning_rate": 0.0004251887794612939, "loss": 5.0144, "mean_token_accuracy": 0.2024834394454956, "num_tokens": 60875921.0, "step": 35095 }, { "entropy": 5.710973739624023, "epoch": 2.7309083835829604, "grad_norm": 1.2734375, "learning_rate": 0.0004251681411651057, "loss": 4.9379, "mean_token_accuracy": 0.20646683126688004, "num_tokens": 60884639.0, "step": 35100 }, { "entropy": 5.728282928466797, "epoch": 2.731297412954678, "grad_norm": 1.265625, "learning_rate": 0.00042514750059035504, "loss": 5.0836, "mean_token_accuracy": 0.20743926465511323, "num_tokens": 60893517.0, "step": 35105 }, { "entropy": 5.61572494506836, "epoch": 2.731686442326396, "grad_norm": 1.25, "learning_rate": 0.0004251268577373551, "loss": 4.9625, "mean_token_accuracy": 0.2080738663673401, "num_tokens": 60902515.0, "step": 35110 }, { "entropy": 5.716381311416626, "epoch": 2.732075471698113, "grad_norm": 1.109375, "learning_rate": 0.000425106212606419, "loss": 4.9964, "mean_token_accuracy": 0.20756131708621978, "num_tokens": 60911453.0, "step": 35115 }, { "entropy": 5.768595266342163, "epoch": 2.7324645010698307, "grad_norm": 1.203125, "learning_rate": 0.00042508556519786004, "loss": 4.9886, "mean_token_accuracy": 0.2080845132470131, "num_tokens": 60920549.0, "step": 35120 }, { "entropy": 5.8022185325622555, "epoch": 2.7328535304415484, "grad_norm": 1.1796875, "learning_rate": 0.0004250649155119915, "loss": 4.9988, "mean_token_accuracy": 0.20314513891935349, "num_tokens": 60929271.0, "step": 35125 }, { "entropy": 5.7172082424163815, "epoch": 2.7332425598132657, "grad_norm": 1.34375, "learning_rate": 0.00042504426354912666, "loss": 4.9772, "mean_token_accuracy": 0.20211530476808548, "num_tokens": 60938228.0, "step": 35130 }, { "entropy": 5.749750137329102, "epoch": 2.7336315891849834, "grad_norm": 1.2890625, "learning_rate": 0.00042502360930957904, "loss": 5.0192, "mean_token_accuracy": 0.2062491297721863, "num_tokens": 60945777.0, "step": 35135 }, { "entropy": 5.678374862670898, "epoch": 2.734020618556701, "grad_norm": 1.1953125, "learning_rate": 0.00042500295279366196, "loss": 5.0219, "mean_token_accuracy": 0.19972978085279464, "num_tokens": 60954500.0, "step": 35140 }, { "entropy": 5.725942516326905, "epoch": 2.734409647928419, "grad_norm": 1.265625, "learning_rate": 0.00042498229400168874, "loss": 4.9896, "mean_token_accuracy": 0.20593413412570954, "num_tokens": 60962918.0, "step": 35145 }, { "entropy": 5.717634010314941, "epoch": 2.734798677300136, "grad_norm": 1.2265625, "learning_rate": 0.000424961632933973, "loss": 4.9495, "mean_token_accuracy": 0.20702729970216752, "num_tokens": 60971544.0, "step": 35150 }, { "entropy": 5.7147623062133786, "epoch": 2.7351877066718537, "grad_norm": 1.25, "learning_rate": 0.0004249409695908281, "loss": 4.9619, "mean_token_accuracy": 0.2048939049243927, "num_tokens": 60979637.0, "step": 35155 }, { "entropy": 5.632407808303833, "epoch": 2.7355767360435714, "grad_norm": 1.2421875, "learning_rate": 0.0004249203039725677, "loss": 4.988, "mean_token_accuracy": 0.19883233159780503, "num_tokens": 60988417.0, "step": 35160 }, { "entropy": 5.75879316329956, "epoch": 2.7359657654152887, "grad_norm": 1.1796875, "learning_rate": 0.00042489963607950527, "loss": 5.0173, "mean_token_accuracy": 0.2081515982747078, "num_tokens": 60997282.0, "step": 35165 }, { "entropy": 5.784154844284058, "epoch": 2.7363547947870064, "grad_norm": 1.203125, "learning_rate": 0.00042487896591195454, "loss": 4.9882, "mean_token_accuracy": 0.19716388434171678, "num_tokens": 61006191.0, "step": 35170 }, { "entropy": 5.720005798339844, "epoch": 2.736743824158724, "grad_norm": 1.1875, "learning_rate": 0.00042485829347022893, "loss": 4.949, "mean_token_accuracy": 0.20953111201524735, "num_tokens": 61014780.0, "step": 35175 }, { "entropy": 5.721444845199585, "epoch": 2.737132853530442, "grad_norm": 1.296875, "learning_rate": 0.00042483761875464226, "loss": 5.0105, "mean_token_accuracy": 0.2042986810207367, "num_tokens": 61024328.0, "step": 35180 }, { "entropy": 5.739587783813477, "epoch": 2.737521882902159, "grad_norm": 1.21875, "learning_rate": 0.00042481694176550825, "loss": 4.9761, "mean_token_accuracy": 0.20755932629108428, "num_tokens": 61032716.0, "step": 35185 }, { "entropy": 5.804307365417481, "epoch": 2.7379109122738767, "grad_norm": 1.2890625, "learning_rate": 0.00042479626250314066, "loss": 5.0118, "mean_token_accuracy": 0.2009000226855278, "num_tokens": 61041495.0, "step": 35190 }, { "entropy": 5.681365728378296, "epoch": 2.738299941645594, "grad_norm": 1.21875, "learning_rate": 0.00042477558096785316, "loss": 4.9902, "mean_token_accuracy": 0.206034380197525, "num_tokens": 61050275.0, "step": 35195 }, { "entropy": 5.694631290435791, "epoch": 2.7386889710173117, "grad_norm": 1.2578125, "learning_rate": 0.00042475489715995956, "loss": 4.8787, "mean_token_accuracy": 0.21547242999076843, "num_tokens": 61058774.0, "step": 35200 }, { "entropy": 5.741375303268432, "epoch": 2.7390780003890294, "grad_norm": 1.3203125, "learning_rate": 0.00042473421107977385, "loss": 4.9447, "mean_token_accuracy": 0.21205634027719497, "num_tokens": 61067475.0, "step": 35205 }, { "entropy": 5.679340267181397, "epoch": 2.739467029760747, "grad_norm": 1.2265625, "learning_rate": 0.00042471352272760974, "loss": 4.9171, "mean_token_accuracy": 0.20893747210502625, "num_tokens": 61075943.0, "step": 35210 }, { "entropy": 5.715814304351807, "epoch": 2.7398560591324648, "grad_norm": 1.2421875, "learning_rate": 0.0004246928321037813, "loss": 5.0127, "mean_token_accuracy": 0.20125334709882736, "num_tokens": 61084460.0, "step": 35215 }, { "entropy": 5.761684131622315, "epoch": 2.740245088504182, "grad_norm": 1.2578125, "learning_rate": 0.0004246721392086023, "loss": 5.0543, "mean_token_accuracy": 0.2023329257965088, "num_tokens": 61093423.0, "step": 35220 }, { "entropy": 5.7499066352844235, "epoch": 2.7406341178758997, "grad_norm": 1.1875, "learning_rate": 0.00042465144404238686, "loss": 5.0188, "mean_token_accuracy": 0.198531873524189, "num_tokens": 61102953.0, "step": 35225 }, { "entropy": 5.738586902618408, "epoch": 2.741023147247617, "grad_norm": 1.265625, "learning_rate": 0.00042463074660544897, "loss": 4.8962, "mean_token_accuracy": 0.21726390421390535, "num_tokens": 61112114.0, "step": 35230 }, { "entropy": 5.778886461257935, "epoch": 2.7414121766193347, "grad_norm": 1.21875, "learning_rate": 0.0004246100468981026, "loss": 4.9913, "mean_token_accuracy": 0.20870457589626312, "num_tokens": 61120603.0, "step": 35235 }, { "entropy": 5.713328695297241, "epoch": 2.7418012059910524, "grad_norm": 1.34375, "learning_rate": 0.000424589344920662, "loss": 4.9643, "mean_token_accuracy": 0.20687409043312072, "num_tokens": 61129238.0, "step": 35240 }, { "entropy": 5.689496755599976, "epoch": 2.74219023536277, "grad_norm": 1.25, "learning_rate": 0.0004245686406734411, "loss": 4.8838, "mean_token_accuracy": 0.21678417623043061, "num_tokens": 61138082.0, "step": 35245 }, { "entropy": 5.764864349365235, "epoch": 2.7425792647344873, "grad_norm": 1.2109375, "learning_rate": 0.0004245479341567541, "loss": 4.9924, "mean_token_accuracy": 0.20476257801055908, "num_tokens": 61146779.0, "step": 35250 }, { "entropy": 5.656249952316284, "epoch": 2.742968294106205, "grad_norm": 1.1875, "learning_rate": 0.0004245272253709154, "loss": 4.8891, "mean_token_accuracy": 0.21843012124300004, "num_tokens": 61155492.0, "step": 35255 }, { "entropy": 5.671950340270996, "epoch": 2.7433573234779227, "grad_norm": 1.2578125, "learning_rate": 0.0004245065143162389, "loss": 4.8698, "mean_token_accuracy": 0.21517737209796906, "num_tokens": 61164235.0, "step": 35260 }, { "entropy": 5.659399509429932, "epoch": 2.74374635284964, "grad_norm": 1.2421875, "learning_rate": 0.00042448580099303904, "loss": 4.9549, "mean_token_accuracy": 0.21115728169679643, "num_tokens": 61172203.0, "step": 35265 }, { "entropy": 5.741674709320068, "epoch": 2.7441353822213577, "grad_norm": 1.203125, "learning_rate": 0.00042446508540163017, "loss": 4.9561, "mean_token_accuracy": 0.20827120095491408, "num_tokens": 61180827.0, "step": 35270 }, { "entropy": 5.76503357887268, "epoch": 2.7445244115930754, "grad_norm": 1.1796875, "learning_rate": 0.0004244443675423264, "loss": 4.9796, "mean_token_accuracy": 0.20961184054613113, "num_tokens": 61189899.0, "step": 35275 }, { "entropy": 5.7590841293334964, "epoch": 2.744913440964793, "grad_norm": 1.2890625, "learning_rate": 0.00042442364741544227, "loss": 5.0165, "mean_token_accuracy": 0.19625904858112336, "num_tokens": 61197981.0, "step": 35280 }, { "entropy": 5.78573842048645, "epoch": 2.7453024703365103, "grad_norm": 1.1953125, "learning_rate": 0.00042440292502129214, "loss": 5.0192, "mean_token_accuracy": 0.20160378217697145, "num_tokens": 61206085.0, "step": 35285 }, { "entropy": 5.673935127258301, "epoch": 2.745691499708228, "grad_norm": 1.171875, "learning_rate": 0.0004243822003601904, "loss": 4.9653, "mean_token_accuracy": 0.20391846299171448, "num_tokens": 61215124.0, "step": 35290 }, { "entropy": 5.764383554458618, "epoch": 2.7460805290799453, "grad_norm": 1.25, "learning_rate": 0.0004243614734324515, "loss": 5.1213, "mean_token_accuracy": 0.19462869465351104, "num_tokens": 61223926.0, "step": 35295 }, { "entropy": 5.710386085510254, "epoch": 2.746469558451663, "grad_norm": 1.2265625, "learning_rate": 0.0004243407442383901, "loss": 4.9654, "mean_token_accuracy": 0.20494016408920288, "num_tokens": 61232526.0, "step": 35300 }, { "entropy": 5.65537838935852, "epoch": 2.7468585878233807, "grad_norm": 1.1640625, "learning_rate": 0.00042432001277832045, "loss": 4.8834, "mean_token_accuracy": 0.22174466401338577, "num_tokens": 61241591.0, "step": 35305 }, { "entropy": 5.711521291732788, "epoch": 2.7472476171950984, "grad_norm": 1.1875, "learning_rate": 0.0004242992790525573, "loss": 4.9699, "mean_token_accuracy": 0.205513858795166, "num_tokens": 61250851.0, "step": 35310 }, { "entropy": 5.692958164215088, "epoch": 2.747636646566816, "grad_norm": 1.1953125, "learning_rate": 0.0004242785430614154, "loss": 4.8887, "mean_token_accuracy": 0.20979338884353638, "num_tokens": 61259600.0, "step": 35315 }, { "entropy": 5.671510124206543, "epoch": 2.7480256759385333, "grad_norm": 1.265625, "learning_rate": 0.00042425780480520906, "loss": 4.9982, "mean_token_accuracy": 0.19968567341566085, "num_tokens": 61268458.0, "step": 35320 }, { "entropy": 5.661386394500733, "epoch": 2.748414705310251, "grad_norm": 1.203125, "learning_rate": 0.00042423706428425305, "loss": 4.965, "mean_token_accuracy": 0.20418812781572343, "num_tokens": 61276974.0, "step": 35325 }, { "entropy": 5.775617504119873, "epoch": 2.7488037346819683, "grad_norm": 1.2578125, "learning_rate": 0.0004242163214988622, "loss": 5.0633, "mean_token_accuracy": 0.2059368908405304, "num_tokens": 61285165.0, "step": 35330 }, { "entropy": 5.704249525070191, "epoch": 2.749192764053686, "grad_norm": 1.2578125, "learning_rate": 0.0004241955764493512, "loss": 4.9935, "mean_token_accuracy": 0.21537001579999923, "num_tokens": 61294061.0, "step": 35335 }, { "entropy": 5.684638738632202, "epoch": 2.7495817934254037, "grad_norm": 1.25, "learning_rate": 0.00042417482913603477, "loss": 4.9134, "mean_token_accuracy": 0.21080784350633622, "num_tokens": 61302435.0, "step": 35340 }, { "entropy": 5.6453070640563965, "epoch": 2.7499708227971214, "grad_norm": 1.28125, "learning_rate": 0.00042415407955922774, "loss": 4.9874, "mean_token_accuracy": 0.2149513378739357, "num_tokens": 61310462.0, "step": 35345 }, { "entropy": 5.787486982345581, "epoch": 2.7503598521688386, "grad_norm": 1.296875, "learning_rate": 0.00042413332771924496, "loss": 5.1056, "mean_token_accuracy": 0.18907395601272584, "num_tokens": 61319490.0, "step": 35350 }, { "entropy": 5.822984409332276, "epoch": 2.7507488815405563, "grad_norm": 1.25, "learning_rate": 0.0004241125736164013, "loss": 4.9997, "mean_token_accuracy": 0.20436962693929672, "num_tokens": 61328070.0, "step": 35355 }, { "entropy": 5.713099575042724, "epoch": 2.751137910912274, "grad_norm": 1.2578125, "learning_rate": 0.0004240918172510117, "loss": 4.8693, "mean_token_accuracy": 0.21309889256954193, "num_tokens": 61336319.0, "step": 35360 }, { "entropy": 5.654052972793579, "epoch": 2.7515269402839913, "grad_norm": 1.1640625, "learning_rate": 0.000424071058623391, "loss": 5.0301, "mean_token_accuracy": 0.20218182802200318, "num_tokens": 61345564.0, "step": 35365 }, { "entropy": 5.724514675140381, "epoch": 2.751915969655709, "grad_norm": 1.1953125, "learning_rate": 0.0004240502977338543, "loss": 5.0107, "mean_token_accuracy": 0.20565710812807084, "num_tokens": 61354823.0, "step": 35370 }, { "entropy": 5.7761430740356445, "epoch": 2.7523049990274266, "grad_norm": 1.234375, "learning_rate": 0.0004240295345827166, "loss": 5.0312, "mean_token_accuracy": 0.19899088889360428, "num_tokens": 61363441.0, "step": 35375 }, { "entropy": 5.68457612991333, "epoch": 2.7526940283991443, "grad_norm": 1.2421875, "learning_rate": 0.0004240087691702929, "loss": 4.9376, "mean_token_accuracy": 0.20248133987188338, "num_tokens": 61371795.0, "step": 35380 }, { "entropy": 5.688742733001709, "epoch": 2.7530830577708616, "grad_norm": 1.28125, "learning_rate": 0.0004239880014968983, "loss": 4.954, "mean_token_accuracy": 0.20867965072393418, "num_tokens": 61379698.0, "step": 35385 }, { "entropy": 5.668840122222901, "epoch": 2.7534720871425793, "grad_norm": 1.296875, "learning_rate": 0.00042396723156284786, "loss": 4.9315, "mean_token_accuracy": 0.2136329382658005, "num_tokens": 61388693.0, "step": 35390 }, { "entropy": 5.7607416152954105, "epoch": 2.753861116514297, "grad_norm": 1.109375, "learning_rate": 0.0004239464593684568, "loss": 5.0163, "mean_token_accuracy": 0.20764347910881042, "num_tokens": 61397995.0, "step": 35395 }, { "entropy": 5.838287734985352, "epoch": 2.7542501458860142, "grad_norm": 1.3125, "learning_rate": 0.00042392568491404043, "loss": 5.0464, "mean_token_accuracy": 0.20305951237678527, "num_tokens": 61405567.0, "step": 35400 }, { "entropy": 5.668026542663574, "epoch": 2.754639175257732, "grad_norm": 1.234375, "learning_rate": 0.00042390490819991367, "loss": 4.9434, "mean_token_accuracy": 0.2126843273639679, "num_tokens": 61413458.0, "step": 35405 }, { "entropy": 5.652588796615601, "epoch": 2.7550282046294496, "grad_norm": 1.3046875, "learning_rate": 0.000423884129226392, "loss": 4.9554, "mean_token_accuracy": 0.21449678838253022, "num_tokens": 61422026.0, "step": 35410 }, { "entropy": 5.774680185317993, "epoch": 2.7554172340011673, "grad_norm": 1.1953125, "learning_rate": 0.0004238633479937906, "loss": 4.9988, "mean_token_accuracy": 0.20634678453207017, "num_tokens": 61430843.0, "step": 35415 }, { "entropy": 5.711435174942016, "epoch": 2.7558062633728846, "grad_norm": 1.34375, "learning_rate": 0.0004238425645024249, "loss": 4.8933, "mean_token_accuracy": 0.21254915446043016, "num_tokens": 61438340.0, "step": 35420 }, { "entropy": 5.678671360015869, "epoch": 2.7561952927446023, "grad_norm": 1.1875, "learning_rate": 0.0004238217787526102, "loss": 4.9454, "mean_token_accuracy": 0.21168069839477538, "num_tokens": 61447302.0, "step": 35425 }, { "entropy": 5.604566764831543, "epoch": 2.7565843221163195, "grad_norm": 1.28125, "learning_rate": 0.0004238009907446618, "loss": 4.8962, "mean_token_accuracy": 0.2138634666800499, "num_tokens": 61456688.0, "step": 35430 }, { "entropy": 5.796348762512207, "epoch": 2.7569733514880372, "grad_norm": 1.1640625, "learning_rate": 0.00042378020047889527, "loss": 4.9998, "mean_token_accuracy": 0.19529547840356826, "num_tokens": 61465718.0, "step": 35435 }, { "entropy": 5.8392005443573, "epoch": 2.757362380859755, "grad_norm": 1.28125, "learning_rate": 0.00042375940795562594, "loss": 5.1025, "mean_token_accuracy": 0.1994846597313881, "num_tokens": 61474113.0, "step": 35440 }, { "entropy": 5.699188232421875, "epoch": 2.7577514102314726, "grad_norm": 1.265625, "learning_rate": 0.00042373861317516944, "loss": 4.9292, "mean_token_accuracy": 0.20614719539880752, "num_tokens": 61482876.0, "step": 35445 }, { "entropy": 5.716951704025268, "epoch": 2.75814043960319, "grad_norm": 1.1953125, "learning_rate": 0.0004237178161378412, "loss": 4.8993, "mean_token_accuracy": 0.21096001714468002, "num_tokens": 61491229.0, "step": 35450 }, { "entropy": 5.672863960266113, "epoch": 2.7585294689749076, "grad_norm": 1.2421875, "learning_rate": 0.0004236970168439568, "loss": 4.9305, "mean_token_accuracy": 0.20822617113590242, "num_tokens": 61499935.0, "step": 35455 }, { "entropy": 5.743860530853271, "epoch": 2.7589184983466253, "grad_norm": 1.1953125, "learning_rate": 0.00042367621529383186, "loss": 4.9962, "mean_token_accuracy": 0.20665925592184067, "num_tokens": 61508249.0, "step": 35460 }, { "entropy": 5.7302141189575195, "epoch": 2.7593075277183425, "grad_norm": 1.2734375, "learning_rate": 0.00042365541148778205, "loss": 4.8973, "mean_token_accuracy": 0.21436030566692352, "num_tokens": 61516530.0, "step": 35465 }, { "entropy": 5.761998081207276, "epoch": 2.7596965570900602, "grad_norm": 1.2265625, "learning_rate": 0.00042363460542612285, "loss": 5.0548, "mean_token_accuracy": 0.2046906128525734, "num_tokens": 61524998.0, "step": 35470 }, { "entropy": 5.5578755855560305, "epoch": 2.760085586461778, "grad_norm": 1.28125, "learning_rate": 0.0004236137971091702, "loss": 4.8419, "mean_token_accuracy": 0.21874584406614303, "num_tokens": 61533661.0, "step": 35475 }, { "entropy": 5.716756057739258, "epoch": 2.7604746158334956, "grad_norm": 1.140625, "learning_rate": 0.00042359298653723963, "loss": 4.9378, "mean_token_accuracy": 0.2100011885166168, "num_tokens": 61542387.0, "step": 35480 }, { "entropy": 5.728057384490967, "epoch": 2.760863645205213, "grad_norm": 1.2421875, "learning_rate": 0.0004235721737106471, "loss": 4.9165, "mean_token_accuracy": 0.2147480070590973, "num_tokens": 61550626.0, "step": 35485 }, { "entropy": 5.748850154876709, "epoch": 2.7612526745769306, "grad_norm": 1.2109375, "learning_rate": 0.0004235513586297082, "loss": 5.0571, "mean_token_accuracy": 0.20736964493989946, "num_tokens": 61559170.0, "step": 35490 }, { "entropy": 5.730298471450806, "epoch": 2.7616417039486483, "grad_norm": 1.2734375, "learning_rate": 0.00042353054129473894, "loss": 5.0666, "mean_token_accuracy": 0.20463462471961974, "num_tokens": 61567484.0, "step": 35495 }, { "entropy": 5.724525785446167, "epoch": 2.7620307333203655, "grad_norm": 1.2890625, "learning_rate": 0.0004235097217060552, "loss": 4.8968, "mean_token_accuracy": 0.21626555770635605, "num_tokens": 61575542.0, "step": 35500 }, { "entropy": 5.726213359832764, "epoch": 2.7624197626920832, "grad_norm": 1.1875, "learning_rate": 0.0004234888998639727, "loss": 5.0144, "mean_token_accuracy": 0.20482368916273117, "num_tokens": 61584273.0, "step": 35505 }, { "entropy": 5.69763674736023, "epoch": 2.762808792063801, "grad_norm": 1.203125, "learning_rate": 0.0004234680757688076, "loss": 4.9651, "mean_token_accuracy": 0.20871717780828475, "num_tokens": 61593514.0, "step": 35510 }, { "entropy": 5.765937328338623, "epoch": 2.7631978214355186, "grad_norm": 1.328125, "learning_rate": 0.00042344724942087564, "loss": 5.0132, "mean_token_accuracy": 0.20720825493335723, "num_tokens": 61601146.0, "step": 35515 }, { "entropy": 5.787722492218018, "epoch": 2.763586850807236, "grad_norm": 1.2109375, "learning_rate": 0.000423426420820493, "loss": 5.0454, "mean_token_accuracy": 0.20546194016933442, "num_tokens": 61609521.0, "step": 35520 }, { "entropy": 5.747818183898926, "epoch": 2.7639758801789536, "grad_norm": 1.1171875, "learning_rate": 0.00042340558996797564, "loss": 5.0469, "mean_token_accuracy": 0.19596879482269286, "num_tokens": 61618382.0, "step": 35525 }, { "entropy": 5.69859094619751, "epoch": 2.764364909550671, "grad_norm": 1.1328125, "learning_rate": 0.00042338475686363964, "loss": 4.9179, "mean_token_accuracy": 0.21246862560510635, "num_tokens": 61627098.0, "step": 35530 }, { "entropy": 5.691691732406616, "epoch": 2.7647539389223885, "grad_norm": 1.1484375, "learning_rate": 0.0004233639215078012, "loss": 4.9755, "mean_token_accuracy": 0.20579489767551423, "num_tokens": 61635747.0, "step": 35535 }, { "entropy": 5.736142683029175, "epoch": 2.765142968294106, "grad_norm": 1.21875, "learning_rate": 0.00042334308390077637, "loss": 4.9812, "mean_token_accuracy": 0.20444947332143784, "num_tokens": 61645151.0, "step": 35540 }, { "entropy": 5.731903171539306, "epoch": 2.765531997665824, "grad_norm": 1.296875, "learning_rate": 0.0004233222440428814, "loss": 4.9961, "mean_token_accuracy": 0.20621875822544097, "num_tokens": 61653216.0, "step": 35545 }, { "entropy": 5.728073787689209, "epoch": 2.765921027037541, "grad_norm": 1.28125, "learning_rate": 0.0004233014019344324, "loss": 5.0057, "mean_token_accuracy": 0.21074142158031464, "num_tokens": 61661583.0, "step": 35550 }, { "entropy": 5.682139921188354, "epoch": 2.766310056409259, "grad_norm": 1.2890625, "learning_rate": 0.0004232805575757457, "loss": 4.9651, "mean_token_accuracy": 0.2113039568066597, "num_tokens": 61670465.0, "step": 35555 }, { "entropy": 5.776941156387329, "epoch": 2.7666990857809766, "grad_norm": 1.1953125, "learning_rate": 0.0004232597109671375, "loss": 4.9678, "mean_token_accuracy": 0.20866963565349578, "num_tokens": 61678670.0, "step": 35560 }, { "entropy": 5.801460218429566, "epoch": 2.767088115152694, "grad_norm": 1.1875, "learning_rate": 0.0004232388621089242, "loss": 5.0216, "mean_token_accuracy": 0.20309523940086366, "num_tokens": 61687860.0, "step": 35565 }, { "entropy": 5.7578857421875, "epoch": 2.7674771445244115, "grad_norm": 1.2890625, "learning_rate": 0.00042321801100142216, "loss": 5.014, "mean_token_accuracy": 0.20707615464925766, "num_tokens": 61696395.0, "step": 35570 }, { "entropy": 5.7718335628509525, "epoch": 2.767866173896129, "grad_norm": 1.1953125, "learning_rate": 0.00042319715764494765, "loss": 5.071, "mean_token_accuracy": 0.20020860135555268, "num_tokens": 61705029.0, "step": 35575 }, { "entropy": 5.715994548797608, "epoch": 2.768255203267847, "grad_norm": 1.3046875, "learning_rate": 0.00042317630203981714, "loss": 4.971, "mean_token_accuracy": 0.21091626584529877, "num_tokens": 61713160.0, "step": 35580 }, { "entropy": 5.679671907424927, "epoch": 2.768644232639564, "grad_norm": 1.203125, "learning_rate": 0.00042315544418634714, "loss": 4.9297, "mean_token_accuracy": 0.21752113252878189, "num_tokens": 61722094.0, "step": 35585 }, { "entropy": 5.784791898727417, "epoch": 2.769033262011282, "grad_norm": 1.234375, "learning_rate": 0.00042313458408485414, "loss": 5.0677, "mean_token_accuracy": 0.20154833644628525, "num_tokens": 61730771.0, "step": 35590 }, { "entropy": 5.747176790237427, "epoch": 2.7694222913829996, "grad_norm": 1.3984375, "learning_rate": 0.00042311372173565456, "loss": 4.989, "mean_token_accuracy": 0.20984751582145691, "num_tokens": 61740059.0, "step": 35595 }, { "entropy": 5.754414987564087, "epoch": 2.769811320754717, "grad_norm": 1.265625, "learning_rate": 0.000423092857139065, "loss": 4.9559, "mean_token_accuracy": 0.2074986845254898, "num_tokens": 61748466.0, "step": 35600 }, { "entropy": 5.689583110809326, "epoch": 2.7702003501264345, "grad_norm": 1.2890625, "learning_rate": 0.000423071990295402, "loss": 4.9096, "mean_token_accuracy": 0.20971000343561172, "num_tokens": 61756862.0, "step": 35605 }, { "entropy": 5.70499620437622, "epoch": 2.770589379498152, "grad_norm": 1.203125, "learning_rate": 0.0004230511212049822, "loss": 4.9407, "mean_token_accuracy": 0.2144535928964615, "num_tokens": 61765867.0, "step": 35610 }, { "entropy": 5.717462348937988, "epoch": 2.77097840886987, "grad_norm": 1.2734375, "learning_rate": 0.0004230302498681224, "loss": 4.9714, "mean_token_accuracy": 0.207415209710598, "num_tokens": 61774297.0, "step": 35615 }, { "entropy": 5.635718250274659, "epoch": 2.771367438241587, "grad_norm": 1.3046875, "learning_rate": 0.0004230093762851392, "loss": 4.919, "mean_token_accuracy": 0.21558650732040405, "num_tokens": 61782841.0, "step": 35620 }, { "entropy": 5.710459184646607, "epoch": 2.771756467613305, "grad_norm": 1.1328125, "learning_rate": 0.0004229885004563491, "loss": 5.0844, "mean_token_accuracy": 0.20496832728385925, "num_tokens": 61791719.0, "step": 35625 }, { "entropy": 5.76880259513855, "epoch": 2.772145496985022, "grad_norm": 1.2109375, "learning_rate": 0.0004229676223820692, "loss": 4.9999, "mean_token_accuracy": 0.20088474005460738, "num_tokens": 61800267.0, "step": 35630 }, { "entropy": 5.725728940963745, "epoch": 2.77253452635674, "grad_norm": 1.25, "learning_rate": 0.00042294674206261616, "loss": 4.9938, "mean_token_accuracy": 0.21175414472818374, "num_tokens": 61808482.0, "step": 35635 }, { "entropy": 5.605467987060547, "epoch": 2.7729235557284575, "grad_norm": 1.3125, "learning_rate": 0.0004229258594983067, "loss": 4.865, "mean_token_accuracy": 0.21704075634479522, "num_tokens": 61816950.0, "step": 35640 }, { "entropy": 5.693981027603149, "epoch": 2.773312585100175, "grad_norm": 1.1796875, "learning_rate": 0.0004229049746894578, "loss": 4.9992, "mean_token_accuracy": 0.20436158478260041, "num_tokens": 61826011.0, "step": 35645 }, { "entropy": 5.79670295715332, "epoch": 2.773701614471893, "grad_norm": 1.2265625, "learning_rate": 0.0004228840876363864, "loss": 5.0185, "mean_token_accuracy": 0.2005144774913788, "num_tokens": 61834705.0, "step": 35650 }, { "entropy": 5.807361745834351, "epoch": 2.77409064384361, "grad_norm": 1.1796875, "learning_rate": 0.0004228631983394093, "loss": 4.9686, "mean_token_accuracy": 0.20350106656551362, "num_tokens": 61844166.0, "step": 35655 }, { "entropy": 5.764471817016601, "epoch": 2.774479673215328, "grad_norm": 1.2265625, "learning_rate": 0.0004228423067988434, "loss": 4.9995, "mean_token_accuracy": 0.20616950690746308, "num_tokens": 61852141.0, "step": 35660 }, { "entropy": 5.6767514705657955, "epoch": 2.774868702587045, "grad_norm": 1.1875, "learning_rate": 0.00042282141301500597, "loss": 4.9766, "mean_token_accuracy": 0.2052194744348526, "num_tokens": 61861566.0, "step": 35665 }, { "entropy": 5.743621110916138, "epoch": 2.775257731958763, "grad_norm": 1.2265625, "learning_rate": 0.0004228005169882138, "loss": 4.9635, "mean_token_accuracy": 0.21062112748622894, "num_tokens": 61869878.0, "step": 35670 }, { "entropy": 5.729417181015014, "epoch": 2.7756467613304805, "grad_norm": 1.171875, "learning_rate": 0.00042277961871878413, "loss": 5.0125, "mean_token_accuracy": 0.19697435051202775, "num_tokens": 61879220.0, "step": 35675 }, { "entropy": 5.729498672485351, "epoch": 2.776035790702198, "grad_norm": 1.265625, "learning_rate": 0.0004227587182070338, "loss": 4.9459, "mean_token_accuracy": 0.2123440384864807, "num_tokens": 61887534.0, "step": 35680 }, { "entropy": 5.751494836807251, "epoch": 2.7764248200739154, "grad_norm": 1.203125, "learning_rate": 0.0004227378154532802, "loss": 5.1251, "mean_token_accuracy": 0.1931547060608864, "num_tokens": 61896420.0, "step": 35685 }, { "entropy": 5.786533069610596, "epoch": 2.776813849445633, "grad_norm": 1.28125, "learning_rate": 0.0004227169104578404, "loss": 5.0573, "mean_token_accuracy": 0.20237926095724107, "num_tokens": 61905024.0, "step": 35690 }, { "entropy": 5.688725709915161, "epoch": 2.777202878817351, "grad_norm": 1.1875, "learning_rate": 0.00042269600322103164, "loss": 4.9395, "mean_token_accuracy": 0.2092704638838768, "num_tokens": 61913272.0, "step": 35695 }, { "entropy": 5.758876085281372, "epoch": 2.777591908189068, "grad_norm": 1.15625, "learning_rate": 0.000422675093743171, "loss": 4.9532, "mean_token_accuracy": 0.21124547123908996, "num_tokens": 61922142.0, "step": 35700 }, { "entropy": 5.731832456588745, "epoch": 2.777980937560786, "grad_norm": 1.34375, "learning_rate": 0.00042265418202457603, "loss": 4.9561, "mean_token_accuracy": 0.20655294358730317, "num_tokens": 61930140.0, "step": 35705 }, { "entropy": 5.699623250961304, "epoch": 2.7783699669325035, "grad_norm": 1.2734375, "learning_rate": 0.0004226332680655637, "loss": 5.0363, "mean_token_accuracy": 0.2044811099767685, "num_tokens": 61938993.0, "step": 35710 }, { "entropy": 5.702589416503907, "epoch": 2.778758996304221, "grad_norm": 1.2109375, "learning_rate": 0.0004226123518664516, "loss": 5.0322, "mean_token_accuracy": 0.20114316046237946, "num_tokens": 61948063.0, "step": 35715 }, { "entropy": 5.726426839828491, "epoch": 2.7791480256759384, "grad_norm": 1.140625, "learning_rate": 0.0004225914334275569, "loss": 4.9707, "mean_token_accuracy": 0.20447732508182526, "num_tokens": 61956610.0, "step": 35720 }, { "entropy": 5.656471395492554, "epoch": 2.779537055047656, "grad_norm": 1.3359375, "learning_rate": 0.0004225705127491972, "loss": 4.8303, "mean_token_accuracy": 0.2105638489127159, "num_tokens": 61965359.0, "step": 35725 }, { "entropy": 5.6755798816680905, "epoch": 2.7799260844193734, "grad_norm": 1.2734375, "learning_rate": 0.0004225495898316899, "loss": 4.9769, "mean_token_accuracy": 0.20803818702697754, "num_tokens": 61973523.0, "step": 35730 }, { "entropy": 5.664690446853638, "epoch": 2.780315113791091, "grad_norm": 1.2109375, "learning_rate": 0.00042252866467535233, "loss": 4.9107, "mean_token_accuracy": 0.21918634474277496, "num_tokens": 61981988.0, "step": 35735 }, { "entropy": 5.7416825771331785, "epoch": 2.780704143162809, "grad_norm": 1.265625, "learning_rate": 0.00042250773728050214, "loss": 4.9859, "mean_token_accuracy": 0.2072063833475113, "num_tokens": 61991400.0, "step": 35740 }, { "entropy": 5.732226467132568, "epoch": 2.7810931725345265, "grad_norm": 1.4140625, "learning_rate": 0.0004224868076474568, "loss": 5.0376, "mean_token_accuracy": 0.20403465628623962, "num_tokens": 61999287.0, "step": 35745 }, { "entropy": 5.737184047698975, "epoch": 2.781482201906244, "grad_norm": 1.1640625, "learning_rate": 0.00042246587577653394, "loss": 5.0079, "mean_token_accuracy": 0.20004563331604003, "num_tokens": 62008578.0, "step": 35750 }, { "entropy": 5.762383079528808, "epoch": 2.7818712312779614, "grad_norm": 1.234375, "learning_rate": 0.0004224449416680511, "loss": 4.9188, "mean_token_accuracy": 0.21204438656568528, "num_tokens": 62017222.0, "step": 35755 }, { "entropy": 5.6545568943023685, "epoch": 2.782260260649679, "grad_norm": 1.1484375, "learning_rate": 0.00042242400532232593, "loss": 4.8942, "mean_token_accuracy": 0.2153510108590126, "num_tokens": 62026224.0, "step": 35760 }, { "entropy": 5.722779846191406, "epoch": 2.7826492900213964, "grad_norm": 1.3046875, "learning_rate": 0.00042240306673967614, "loss": 5.1468, "mean_token_accuracy": 0.1946604311466217, "num_tokens": 62036201.0, "step": 35765 }, { "entropy": 5.700301885604858, "epoch": 2.783038319393114, "grad_norm": 1.25, "learning_rate": 0.00042238212592041945, "loss": 4.8953, "mean_token_accuracy": 0.21464095413684844, "num_tokens": 62044780.0, "step": 35770 }, { "entropy": 5.724325132369995, "epoch": 2.7834273487648318, "grad_norm": 1.234375, "learning_rate": 0.00042236118286487364, "loss": 4.9447, "mean_token_accuracy": 0.2090492367744446, "num_tokens": 62052720.0, "step": 35775 }, { "entropy": 5.755154943466186, "epoch": 2.7838163781365495, "grad_norm": 1.28125, "learning_rate": 0.00042234023757335633, "loss": 4.977, "mean_token_accuracy": 0.2005479946732521, "num_tokens": 62061797.0, "step": 35780 }, { "entropy": 5.677411842346191, "epoch": 2.7842054075082667, "grad_norm": 1.203125, "learning_rate": 0.00042231929004618547, "loss": 4.9087, "mean_token_accuracy": 0.20815431773662568, "num_tokens": 62070543.0, "step": 35785 }, { "entropy": 5.783239793777466, "epoch": 2.7845944368799844, "grad_norm": 1.3359375, "learning_rate": 0.0004222983402836789, "loss": 5.0744, "mean_token_accuracy": 0.20100017189979552, "num_tokens": 62079531.0, "step": 35790 }, { "entropy": 5.670602130889892, "epoch": 2.784983466251702, "grad_norm": 1.2109375, "learning_rate": 0.00042227738828615435, "loss": 4.9336, "mean_token_accuracy": 0.21268488019704818, "num_tokens": 62088429.0, "step": 35795 }, { "entropy": 5.666669273376465, "epoch": 2.7853724956234194, "grad_norm": 1.3046875, "learning_rate": 0.00042225643405392993, "loss": 4.9117, "mean_token_accuracy": 0.2135239690542221, "num_tokens": 62096926.0, "step": 35800 }, { "entropy": 5.713236093521118, "epoch": 2.785761524995137, "grad_norm": 1.2421875, "learning_rate": 0.00042223547758732356, "loss": 5.0963, "mean_token_accuracy": 0.19224175363779067, "num_tokens": 62106673.0, "step": 35805 }, { "entropy": 5.7355176448822025, "epoch": 2.7861505543668548, "grad_norm": 1.2265625, "learning_rate": 0.00042221451888665307, "loss": 4.9535, "mean_token_accuracy": 0.20638221949338914, "num_tokens": 62115091.0, "step": 35810 }, { "entropy": 5.777129030227661, "epoch": 2.7865395837385725, "grad_norm": 1.28125, "learning_rate": 0.00042219355795223657, "loss": 5.0127, "mean_token_accuracy": 0.20928142070770264, "num_tokens": 62124062.0, "step": 35815 }, { "entropy": 5.712743711471558, "epoch": 2.7869286131102897, "grad_norm": 1.1640625, "learning_rate": 0.00042217259478439216, "loss": 4.9485, "mean_token_accuracy": 0.2054712265729904, "num_tokens": 62133141.0, "step": 35820 }, { "entropy": 5.7225096225738525, "epoch": 2.7873176424820074, "grad_norm": 1.171875, "learning_rate": 0.0004221516293834379, "loss": 4.9795, "mean_token_accuracy": 0.20988262593746185, "num_tokens": 62142056.0, "step": 35825 }, { "entropy": 5.7886804103851315, "epoch": 2.787706671853725, "grad_norm": 1.25, "learning_rate": 0.00042213066174969177, "loss": 4.9763, "mean_token_accuracy": 0.20902201533317566, "num_tokens": 62150064.0, "step": 35830 }, { "entropy": 5.654596853256225, "epoch": 2.7880957012254424, "grad_norm": 1.203125, "learning_rate": 0.00042210969188347217, "loss": 4.9226, "mean_token_accuracy": 0.2064743623137474, "num_tokens": 62159300.0, "step": 35835 }, { "entropy": 5.676939010620117, "epoch": 2.78848473059716, "grad_norm": 1.1875, "learning_rate": 0.0004220887197850971, "loss": 4.908, "mean_token_accuracy": 0.20804603546857833, "num_tokens": 62167774.0, "step": 35840 }, { "entropy": 5.72053370475769, "epoch": 2.7888737599688778, "grad_norm": 1.2890625, "learning_rate": 0.00042206774545488476, "loss": 4.9521, "mean_token_accuracy": 0.21035508215427398, "num_tokens": 62176301.0, "step": 35845 }, { "entropy": 5.695972871780396, "epoch": 2.7892627893405955, "grad_norm": 1.203125, "learning_rate": 0.0004220467688931535, "loss": 4.9611, "mean_token_accuracy": 0.20609065741300583, "num_tokens": 62184804.0, "step": 35850 }, { "entropy": 5.723193025588989, "epoch": 2.7896518187123127, "grad_norm": 1.15625, "learning_rate": 0.0004220257901002216, "loss": 4.9381, "mean_token_accuracy": 0.2059024229645729, "num_tokens": 62193864.0, "step": 35855 }, { "entropy": 5.738138914108276, "epoch": 2.7900408480840304, "grad_norm": 1.171875, "learning_rate": 0.0004220048090764073, "loss": 4.9541, "mean_token_accuracy": 0.20982842296361923, "num_tokens": 62202906.0, "step": 35860 }, { "entropy": 5.643850421905517, "epoch": 2.7904298774557477, "grad_norm": 1.203125, "learning_rate": 0.00042198382582202905, "loss": 4.8251, "mean_token_accuracy": 0.21832956671714782, "num_tokens": 62211292.0, "step": 35865 }, { "entropy": 5.723884105682373, "epoch": 2.7908189068274654, "grad_norm": 1.1875, "learning_rate": 0.0004219628403374052, "loss": 5.0777, "mean_token_accuracy": 0.19903614372015, "num_tokens": 62220830.0, "step": 35870 }, { "entropy": 5.723293828964233, "epoch": 2.791207936199183, "grad_norm": 1.390625, "learning_rate": 0.0004219418526228541, "loss": 4.9675, "mean_token_accuracy": 0.20655577480793, "num_tokens": 62228659.0, "step": 35875 }, { "entropy": 5.785588216781616, "epoch": 2.7915969655709008, "grad_norm": 1.2109375, "learning_rate": 0.0004219208626786943, "loss": 5.0739, "mean_token_accuracy": 0.19653570652008057, "num_tokens": 62238098.0, "step": 35880 }, { "entropy": 5.791038656234742, "epoch": 2.791985994942618, "grad_norm": 1.078125, "learning_rate": 0.0004218998705052443, "loss": 5.0778, "mean_token_accuracy": 0.19325403422117232, "num_tokens": 62247523.0, "step": 35885 }, { "entropy": 5.714004325866699, "epoch": 2.7923750243143357, "grad_norm": 1.28125, "learning_rate": 0.00042187887610282255, "loss": 4.9779, "mean_token_accuracy": 0.20410213023424148, "num_tokens": 62255601.0, "step": 35890 }, { "entropy": 5.713437223434449, "epoch": 2.7927640536860534, "grad_norm": 1.3046875, "learning_rate": 0.0004218578794717476, "loss": 4.9925, "mean_token_accuracy": 0.20130904912948608, "num_tokens": 62263650.0, "step": 35895 }, { "entropy": 5.688485908508301, "epoch": 2.7931530830577707, "grad_norm": 1.1796875, "learning_rate": 0.00042183688061233813, "loss": 5.0119, "mean_token_accuracy": 0.20159826725721358, "num_tokens": 62272474.0, "step": 35900 }, { "entropy": 5.696197605133056, "epoch": 2.7935421124294884, "grad_norm": 1.15625, "learning_rate": 0.00042181587952491267, "loss": 4.8638, "mean_token_accuracy": 0.2138804689049721, "num_tokens": 62281364.0, "step": 35905 }, { "entropy": 5.770055150985717, "epoch": 2.793931141801206, "grad_norm": 1.25, "learning_rate": 0.00042179487620978997, "loss": 4.9555, "mean_token_accuracy": 0.20882576256990432, "num_tokens": 62289025.0, "step": 35910 }, { "entropy": 5.708221912384033, "epoch": 2.7943201711729238, "grad_norm": 1.328125, "learning_rate": 0.0004217738706672886, "loss": 4.9597, "mean_token_accuracy": 0.2140483558177948, "num_tokens": 62298063.0, "step": 35915 }, { "entropy": 5.7094550132751465, "epoch": 2.794709200544641, "grad_norm": 1.25, "learning_rate": 0.00042175286289772746, "loss": 4.9489, "mean_token_accuracy": 0.20907099694013595, "num_tokens": 62306806.0, "step": 35920 }, { "entropy": 5.673598670959473, "epoch": 2.7950982299163587, "grad_norm": 1.234375, "learning_rate": 0.0004217318529014251, "loss": 4.9588, "mean_token_accuracy": 0.2066102683544159, "num_tokens": 62315119.0, "step": 35925 }, { "entropy": 5.715698146820069, "epoch": 2.7954872592880764, "grad_norm": 1.296875, "learning_rate": 0.0004217108406787005, "loss": 5.0483, "mean_token_accuracy": 0.2048294097185135, "num_tokens": 62323615.0, "step": 35930 }, { "entropy": 5.701470899581909, "epoch": 2.7958762886597937, "grad_norm": 1.265625, "learning_rate": 0.0004216898262298724, "loss": 4.9773, "mean_token_accuracy": 0.21100025177001952, "num_tokens": 62332313.0, "step": 35935 }, { "entropy": 5.602532863616943, "epoch": 2.7962653180315113, "grad_norm": 1.15625, "learning_rate": 0.0004216688095552596, "loss": 4.8351, "mean_token_accuracy": 0.2128693237900734, "num_tokens": 62341060.0, "step": 35940 }, { "entropy": 5.744132661819458, "epoch": 2.796654347403229, "grad_norm": 1.2265625, "learning_rate": 0.0004216477906551811, "loss": 5.0509, "mean_token_accuracy": 0.20427141934633256, "num_tokens": 62349616.0, "step": 35945 }, { "entropy": 5.734337663650512, "epoch": 2.7970433767749467, "grad_norm": 1.171875, "learning_rate": 0.00042162676952995585, "loss": 4.984, "mean_token_accuracy": 0.20733607709407806, "num_tokens": 62358083.0, "step": 35950 }, { "entropy": 5.76299033164978, "epoch": 2.797432406146664, "grad_norm": 1.3515625, "learning_rate": 0.00042160574617990267, "loss": 4.9816, "mean_token_accuracy": 0.201108980178833, "num_tokens": 62366494.0, "step": 35955 }, { "entropy": 5.71102089881897, "epoch": 2.7978214355183817, "grad_norm": 1.2890625, "learning_rate": 0.00042158472060534066, "loss": 4.9798, "mean_token_accuracy": 0.19888844341039658, "num_tokens": 62375590.0, "step": 35960 }, { "entropy": 5.739901876449585, "epoch": 2.798210464890099, "grad_norm": 1.234375, "learning_rate": 0.00042156369280658886, "loss": 5.1284, "mean_token_accuracy": 0.2015313059091568, "num_tokens": 62384186.0, "step": 35965 }, { "entropy": 5.737296772003174, "epoch": 2.7985994942618166, "grad_norm": 1.25, "learning_rate": 0.0004215426627839662, "loss": 4.9527, "mean_token_accuracy": 0.2118218719959259, "num_tokens": 62392789.0, "step": 35970 }, { "entropy": 5.725661897659302, "epoch": 2.7989885236335343, "grad_norm": 1.2265625, "learning_rate": 0.00042152163053779196, "loss": 4.9518, "mean_token_accuracy": 0.20763008147478104, "num_tokens": 62401808.0, "step": 35975 }, { "entropy": 5.760135984420776, "epoch": 2.799377553005252, "grad_norm": 1.2578125, "learning_rate": 0.0004215005960683852, "loss": 5.0288, "mean_token_accuracy": 0.2015422135591507, "num_tokens": 62410700.0, "step": 35980 }, { "entropy": 5.7438356399536135, "epoch": 2.7997665823769697, "grad_norm": 1.2421875, "learning_rate": 0.0004214795593760651, "loss": 4.9302, "mean_token_accuracy": 0.21606953144073487, "num_tokens": 62419337.0, "step": 35985 }, { "entropy": 5.7146021842956545, "epoch": 2.800155611748687, "grad_norm": 1.2421875, "learning_rate": 0.0004214585204611508, "loss": 5.0469, "mean_token_accuracy": 0.20306914746761323, "num_tokens": 62427189.0, "step": 35990 }, { "entropy": 5.7274556159973145, "epoch": 2.8005446411204047, "grad_norm": 1.25, "learning_rate": 0.00042143747932396153, "loss": 5.0825, "mean_token_accuracy": 0.20226467847824098, "num_tokens": 62436531.0, "step": 35995 }, { "entropy": 5.791763877868652, "epoch": 2.800933670492122, "grad_norm": 1.3203125, "learning_rate": 0.0004214164359648166, "loss": 5.0364, "mean_token_accuracy": 0.2041122481226921, "num_tokens": 62445250.0, "step": 36000 }, { "epoch": 2.800933670492122, "eval_entropy": 5.521992066780802, "eval_loss": 5.061923027038574, "eval_mean_token_accuracy": 0.21229355062310573, "eval_num_tokens": 62445250.0, "eval_runtime": 21.8067, "eval_samples_per_second": 1905.748, "eval_steps_per_second": 238.23, "step": 36000 }, { "entropy": 5.74374623298645, "epoch": 2.8013226998638396, "grad_norm": 1.1875, "learning_rate": 0.00042139539038403535, "loss": 4.9465, "mean_token_accuracy": 0.20540413111448289, "num_tokens": 62454221.0, "step": 36005 }, { "entropy": 5.687235546112061, "epoch": 2.8017117292355573, "grad_norm": 1.2265625, "learning_rate": 0.000421374342581937, "loss": 4.8591, "mean_token_accuracy": 0.21948812007904053, "num_tokens": 62463237.0, "step": 36010 }, { "entropy": 5.712296819686889, "epoch": 2.802100758607275, "grad_norm": 1.234375, "learning_rate": 0.00042135329255884105, "loss": 4.9899, "mean_token_accuracy": 0.209525902569294, "num_tokens": 62472227.0, "step": 36015 }, { "entropy": 5.674832010269165, "epoch": 2.8024897879789923, "grad_norm": 1.2109375, "learning_rate": 0.0004213322403150668, "loss": 4.9151, "mean_token_accuracy": 0.2074356809258461, "num_tokens": 62480225.0, "step": 36020 }, { "entropy": 5.730641222000122, "epoch": 2.80287881735071, "grad_norm": 1.2109375, "learning_rate": 0.0004213111858509337, "loss": 5.0042, "mean_token_accuracy": 0.20099011808633804, "num_tokens": 62487858.0, "step": 36025 }, { "entropy": 5.772992277145386, "epoch": 2.8032678467224277, "grad_norm": 1.2421875, "learning_rate": 0.0004212901291667612, "loss": 5.1184, "mean_token_accuracy": 0.19732538014650344, "num_tokens": 62496004.0, "step": 36030 }, { "entropy": 5.7107585906982425, "epoch": 2.803656876094145, "grad_norm": 1.28125, "learning_rate": 0.00042126907026286887, "loss": 5.0245, "mean_token_accuracy": 0.20093761682510375, "num_tokens": 62504011.0, "step": 36035 }, { "entropy": 5.755428218841553, "epoch": 2.8040459054658626, "grad_norm": 1.28125, "learning_rate": 0.00042124800913957624, "loss": 5.0277, "mean_token_accuracy": 0.20276066809892654, "num_tokens": 62512143.0, "step": 36040 }, { "entropy": 5.782026529312134, "epoch": 2.8044349348375803, "grad_norm": 1.28125, "learning_rate": 0.0004212269457972028, "loss": 4.9886, "mean_token_accuracy": 0.20597289353609086, "num_tokens": 62520374.0, "step": 36045 }, { "entropy": 5.8486243724823, "epoch": 2.804823964209298, "grad_norm": 1.265625, "learning_rate": 0.0004212058802360682, "loss": 5.0752, "mean_token_accuracy": 0.20093314796686174, "num_tokens": 62529345.0, "step": 36050 }, { "entropy": 5.67600383758545, "epoch": 2.8052129935810153, "grad_norm": 1.1796875, "learning_rate": 0.0004211848124564922, "loss": 4.9369, "mean_token_accuracy": 0.20657453536987305, "num_tokens": 62538622.0, "step": 36055 }, { "entropy": 5.706914854049683, "epoch": 2.805602022952733, "grad_norm": 1.1875, "learning_rate": 0.0004211637424587942, "loss": 4.9142, "mean_token_accuracy": 0.21009661257266998, "num_tokens": 62547071.0, "step": 36060 }, { "entropy": 5.784306764602661, "epoch": 2.8059910523244502, "grad_norm": 1.328125, "learning_rate": 0.0004211426702432941, "loss": 5.0106, "mean_token_accuracy": 0.20098695605993272, "num_tokens": 62556321.0, "step": 36065 }, { "entropy": 5.7757265090942385, "epoch": 2.806380081696168, "grad_norm": 1.2890625, "learning_rate": 0.0004211215958103116, "loss": 5.1289, "mean_token_accuracy": 0.1990181401371956, "num_tokens": 62565549.0, "step": 36070 }, { "entropy": 5.6743536472320555, "epoch": 2.8067691110678856, "grad_norm": 1.15625, "learning_rate": 0.00042110051916016645, "loss": 4.9176, "mean_token_accuracy": 0.21638558357954024, "num_tokens": 62573753.0, "step": 36075 }, { "entropy": 5.752158546447754, "epoch": 2.8071581404396033, "grad_norm": 1.140625, "learning_rate": 0.0004210794402931785, "loss": 5.0271, "mean_token_accuracy": 0.1992250457406044, "num_tokens": 62583919.0, "step": 36080 }, { "entropy": 5.717932510375976, "epoch": 2.807547169811321, "grad_norm": 1.2265625, "learning_rate": 0.0004210583592096675, "loss": 4.9486, "mean_token_accuracy": 0.2057707965373993, "num_tokens": 62592136.0, "step": 36085 }, { "entropy": 5.729203748703003, "epoch": 2.8079361991830383, "grad_norm": 1.234375, "learning_rate": 0.0004210372759099534, "loss": 4.9255, "mean_token_accuracy": 0.21144865900278093, "num_tokens": 62600742.0, "step": 36090 }, { "entropy": 5.722780370712281, "epoch": 2.808325228554756, "grad_norm": 1.375, "learning_rate": 0.000421016190394356, "loss": 4.9243, "mean_token_accuracy": 0.20902693420648574, "num_tokens": 62608239.0, "step": 36095 }, { "entropy": 5.703789377212525, "epoch": 2.8087142579264732, "grad_norm": 1.234375, "learning_rate": 0.00042099510266319545, "loss": 4.9827, "mean_token_accuracy": 0.20636464953422545, "num_tokens": 62617445.0, "step": 36100 }, { "entropy": 5.681116437911987, "epoch": 2.809103287298191, "grad_norm": 1.2578125, "learning_rate": 0.0004209740127167915, "loss": 4.9491, "mean_token_accuracy": 0.20447221994400025, "num_tokens": 62625578.0, "step": 36105 }, { "entropy": 5.704840230941772, "epoch": 2.8094923166699086, "grad_norm": 1.1796875, "learning_rate": 0.0004209529205554643, "loss": 4.9545, "mean_token_accuracy": 0.20742653161287308, "num_tokens": 62635028.0, "step": 36110 }, { "entropy": 5.78695330619812, "epoch": 2.8098813460416263, "grad_norm": 1.234375, "learning_rate": 0.0004209318261795339, "loss": 4.9713, "mean_token_accuracy": 0.2122960090637207, "num_tokens": 62643739.0, "step": 36115 }, { "entropy": 5.781113815307617, "epoch": 2.8102703754133436, "grad_norm": 1.1640625, "learning_rate": 0.0004209107295893202, "loss": 5.0897, "mean_token_accuracy": 0.20430038571357728, "num_tokens": 62652769.0, "step": 36120 }, { "entropy": 5.6443939208984375, "epoch": 2.8106594047850613, "grad_norm": 1.25, "learning_rate": 0.00042088963078514344, "loss": 4.9812, "mean_token_accuracy": 0.20860136449337005, "num_tokens": 62661412.0, "step": 36125 }, { "entropy": 5.673102807998657, "epoch": 2.811048434156779, "grad_norm": 1.21875, "learning_rate": 0.0004208685297673238, "loss": 4.9993, "mean_token_accuracy": 0.20807537734508513, "num_tokens": 62670048.0, "step": 36130 }, { "entropy": 5.778148746490478, "epoch": 2.811437463528496, "grad_norm": 1.234375, "learning_rate": 0.0004208474265361813, "loss": 4.9737, "mean_token_accuracy": 0.21420757472515106, "num_tokens": 62678901.0, "step": 36135 }, { "entropy": 5.718347215652466, "epoch": 2.811826492900214, "grad_norm": 1.234375, "learning_rate": 0.00042082632109203627, "loss": 4.8826, "mean_token_accuracy": 0.21543171405792236, "num_tokens": 62687124.0, "step": 36140 }, { "entropy": 5.74475736618042, "epoch": 2.8122155222719316, "grad_norm": 1.2265625, "learning_rate": 0.000420805213435209, "loss": 5.0225, "mean_token_accuracy": 0.20292607098817825, "num_tokens": 62696029.0, "step": 36145 }, { "entropy": 5.689277410507202, "epoch": 2.8126045516436493, "grad_norm": 1.28125, "learning_rate": 0.0004207841035660196, "loss": 4.8964, "mean_token_accuracy": 0.21123036742210388, "num_tokens": 62704181.0, "step": 36150 }, { "entropy": 5.704431390762329, "epoch": 2.8129935810153666, "grad_norm": 1.1875, "learning_rate": 0.0004207629914847885, "loss": 4.9973, "mean_token_accuracy": 0.20564758777618408, "num_tokens": 62713440.0, "step": 36155 }, { "entropy": 5.731080865859985, "epoch": 2.8133826103870843, "grad_norm": 1.203125, "learning_rate": 0.000420741877191836, "loss": 4.9645, "mean_token_accuracy": 0.20460633039474488, "num_tokens": 62723024.0, "step": 36160 }, { "entropy": 5.7041768550872805, "epoch": 2.8137716397588015, "grad_norm": 1.21875, "learning_rate": 0.0004207207606874825, "loss": 4.9731, "mean_token_accuracy": 0.19940380603075028, "num_tokens": 62731441.0, "step": 36165 }, { "entropy": 5.752106189727783, "epoch": 2.814160669130519, "grad_norm": 1.3046875, "learning_rate": 0.0004206996419720484, "loss": 5.0518, "mean_token_accuracy": 0.2064610928297043, "num_tokens": 62740073.0, "step": 36170 }, { "entropy": 5.692143869400025, "epoch": 2.814549698502237, "grad_norm": 1.1953125, "learning_rate": 0.0004206785210458541, "loss": 4.8713, "mean_token_accuracy": 0.21827849596738816, "num_tokens": 62749192.0, "step": 36175 }, { "entropy": 5.751067733764648, "epoch": 2.8149387278739546, "grad_norm": 1.3125, "learning_rate": 0.0004206573979092202, "loss": 4.9699, "mean_token_accuracy": 0.2129410982131958, "num_tokens": 62757408.0, "step": 36180 }, { "entropy": 5.729806756973266, "epoch": 2.8153277572456723, "grad_norm": 1.1875, "learning_rate": 0.00042063627256246706, "loss": 4.9967, "mean_token_accuracy": 0.2051386132836342, "num_tokens": 62767475.0, "step": 36185 }, { "entropy": 5.65711932182312, "epoch": 2.8157167866173896, "grad_norm": 1.2578125, "learning_rate": 0.0004206151450059153, "loss": 4.864, "mean_token_accuracy": 0.2150001659989357, "num_tokens": 62775802.0, "step": 36190 }, { "entropy": 5.660032939910889, "epoch": 2.8161058159891073, "grad_norm": 1.21875, "learning_rate": 0.00042059401523988546, "loss": 4.9266, "mean_token_accuracy": 0.2032864809036255, "num_tokens": 62784718.0, "step": 36195 }, { "entropy": 5.697596597671509, "epoch": 2.8164948453608245, "grad_norm": 1.2734375, "learning_rate": 0.0004205728832646982, "loss": 5.041, "mean_token_accuracy": 0.20196015685796737, "num_tokens": 62793692.0, "step": 36200 }, { "entropy": 5.745329666137695, "epoch": 2.816883874732542, "grad_norm": 1.234375, "learning_rate": 0.00042055174908067414, "loss": 5.0083, "mean_token_accuracy": 0.20293538123369217, "num_tokens": 62802583.0, "step": 36205 }, { "entropy": 5.771064901351929, "epoch": 2.81727290410426, "grad_norm": 1.2109375, "learning_rate": 0.00042053061268813397, "loss": 4.9678, "mean_token_accuracy": 0.2044811800122261, "num_tokens": 62812374.0, "step": 36210 }, { "entropy": 5.745669221878051, "epoch": 2.8176619334759776, "grad_norm": 1.203125, "learning_rate": 0.00042050947408739836, "loss": 5.0304, "mean_token_accuracy": 0.20424077659845352, "num_tokens": 62821796.0, "step": 36215 }, { "entropy": 5.737193822860718, "epoch": 2.818050962847695, "grad_norm": 1.1953125, "learning_rate": 0.0004204883332787881, "loss": 4.9763, "mean_token_accuracy": 0.20433587580919266, "num_tokens": 62831349.0, "step": 36220 }, { "entropy": 5.766156959533691, "epoch": 2.8184399922194125, "grad_norm": 1.234375, "learning_rate": 0.00042046719026262396, "loss": 4.9515, "mean_token_accuracy": 0.21046096682548524, "num_tokens": 62838842.0, "step": 36225 }, { "entropy": 5.717726421356201, "epoch": 2.8188290215911302, "grad_norm": 1.2421875, "learning_rate": 0.00042044604503922674, "loss": 4.9341, "mean_token_accuracy": 0.21015832871198653, "num_tokens": 62847067.0, "step": 36230 }, { "entropy": 5.660501146316529, "epoch": 2.8192180509628475, "grad_norm": 1.234375, "learning_rate": 0.0004204248976089173, "loss": 4.824, "mean_token_accuracy": 0.21203492283821107, "num_tokens": 62855374.0, "step": 36235 }, { "entropy": 5.715280342102051, "epoch": 2.819607080334565, "grad_norm": 1.2578125, "learning_rate": 0.0004204037479720165, "loss": 4.9362, "mean_token_accuracy": 0.2068893313407898, "num_tokens": 62863141.0, "step": 36240 }, { "entropy": 5.741623401641846, "epoch": 2.819996109706283, "grad_norm": 1.203125, "learning_rate": 0.00042038259612884514, "loss": 5.0416, "mean_token_accuracy": 0.21452688574790954, "num_tokens": 62872080.0, "step": 36245 }, { "entropy": 5.7374520778656, "epoch": 2.8203851390780006, "grad_norm": 1.2421875, "learning_rate": 0.00042036144207972445, "loss": 5.0163, "mean_token_accuracy": 0.20642514228820802, "num_tokens": 62880492.0, "step": 36250 }, { "entropy": 5.7295825481414795, "epoch": 2.820774168449718, "grad_norm": 1.2734375, "learning_rate": 0.0004203402858249752, "loss": 4.9379, "mean_token_accuracy": 0.20821719616651535, "num_tokens": 62888961.0, "step": 36255 }, { "entropy": 5.741214036941528, "epoch": 2.8211631978214355, "grad_norm": 1.2734375, "learning_rate": 0.0004203191273649184, "loss": 4.9908, "mean_token_accuracy": 0.20823993384838105, "num_tokens": 62897224.0, "step": 36260 }, { "entropy": 5.719851016998291, "epoch": 2.8215522271931532, "grad_norm": 1.3203125, "learning_rate": 0.00042029796669987513, "loss": 4.9722, "mean_token_accuracy": 0.20635226964950562, "num_tokens": 62905873.0, "step": 36265 }, { "entropy": 5.729577350616455, "epoch": 2.8219412565648705, "grad_norm": 1.203125, "learning_rate": 0.0004202768038301665, "loss": 4.9946, "mean_token_accuracy": 0.20879645198583602, "num_tokens": 62914438.0, "step": 36270 }, { "entropy": 5.808247089385986, "epoch": 2.822330285936588, "grad_norm": 1.25, "learning_rate": 0.00042025563875611367, "loss": 5.0267, "mean_token_accuracy": 0.20323077142238616, "num_tokens": 62923310.0, "step": 36275 }, { "entropy": 5.761216688156128, "epoch": 2.822719315308306, "grad_norm": 1.25, "learning_rate": 0.0004202344714780376, "loss": 5.0528, "mean_token_accuracy": 0.200759257376194, "num_tokens": 62932031.0, "step": 36280 }, { "entropy": 5.726449060440063, "epoch": 2.8231083446800236, "grad_norm": 1.3984375, "learning_rate": 0.00042021330199625966, "loss": 4.9748, "mean_token_accuracy": 0.20601734519004822, "num_tokens": 62939695.0, "step": 36285 }, { "entropy": 5.73023157119751, "epoch": 2.823497374051741, "grad_norm": 1.2265625, "learning_rate": 0.00042019213031110105, "loss": 4.9506, "mean_token_accuracy": 0.20686538964509965, "num_tokens": 62948251.0, "step": 36290 }, { "entropy": 5.768589639663697, "epoch": 2.8238864034234585, "grad_norm": 1.3046875, "learning_rate": 0.0004201709564228829, "loss": 4.9853, "mean_token_accuracy": 0.20405015647411345, "num_tokens": 62956881.0, "step": 36295 }, { "entropy": 5.894714736938477, "epoch": 2.824275432795176, "grad_norm": 1.171875, "learning_rate": 0.00042014978033192655, "loss": 5.1446, "mean_token_accuracy": 0.19357382506132126, "num_tokens": 62966241.0, "step": 36300 }, { "entropy": 5.705806255340576, "epoch": 2.8246644621668935, "grad_norm": 1.1953125, "learning_rate": 0.00042012860203855337, "loss": 4.8586, "mean_token_accuracy": 0.21099022328853606, "num_tokens": 62974826.0, "step": 36305 }, { "entropy": 5.796669244766235, "epoch": 2.825053491538611, "grad_norm": 1.1875, "learning_rate": 0.00042010742154308453, "loss": 5.06, "mean_token_accuracy": 0.20144854933023454, "num_tokens": 62983800.0, "step": 36310 }, { "entropy": 5.785959005355835, "epoch": 2.825442520910329, "grad_norm": 1.28125, "learning_rate": 0.00042008623884584167, "loss": 5.0403, "mean_token_accuracy": 0.20495795905590058, "num_tokens": 62993219.0, "step": 36315 }, { "entropy": 5.805485820770263, "epoch": 2.825831550282046, "grad_norm": 1.1953125, "learning_rate": 0.00042006505394714597, "loss": 5.031, "mean_token_accuracy": 0.20829733908176423, "num_tokens": 63002455.0, "step": 36320 }, { "entropy": 5.799446105957031, "epoch": 2.826220579653764, "grad_norm": 1.265625, "learning_rate": 0.00042004386684731896, "loss": 5.0896, "mean_token_accuracy": 0.19929184913635253, "num_tokens": 63012200.0, "step": 36325 }, { "entropy": 5.737817335128784, "epoch": 2.8266096090254815, "grad_norm": 1.21875, "learning_rate": 0.00042002267754668216, "loss": 5.0072, "mean_token_accuracy": 0.21096180826425553, "num_tokens": 63021870.0, "step": 36330 }, { "entropy": 5.744982147216797, "epoch": 2.826998638397199, "grad_norm": 1.2578125, "learning_rate": 0.000420001486045557, "loss": 4.987, "mean_token_accuracy": 0.20623918175697326, "num_tokens": 63030941.0, "step": 36335 }, { "entropy": 5.777685737609863, "epoch": 2.8273876677689165, "grad_norm": 1.21875, "learning_rate": 0.0004199802923442652, "loss": 5.0357, "mean_token_accuracy": 0.2033184587955475, "num_tokens": 63039264.0, "step": 36340 }, { "entropy": 5.778162002563477, "epoch": 2.827776697140634, "grad_norm": 1.2109375, "learning_rate": 0.0004199590964431282, "loss": 5.03, "mean_token_accuracy": 0.20240077674388884, "num_tokens": 63048723.0, "step": 36345 }, { "entropy": 5.741283559799195, "epoch": 2.828165726512352, "grad_norm": 1.171875, "learning_rate": 0.0004199378983424676, "loss": 4.9631, "mean_token_accuracy": 0.20695237666368485, "num_tokens": 63058147.0, "step": 36350 }, { "entropy": 5.754438495635986, "epoch": 2.828554755884069, "grad_norm": 1.265625, "learning_rate": 0.00041991669804260505, "loss": 4.9499, "mean_token_accuracy": 0.20795259475708008, "num_tokens": 63066614.0, "step": 36355 }, { "entropy": 5.725859260559082, "epoch": 2.828943785255787, "grad_norm": 1.2109375, "learning_rate": 0.0004198954955438623, "loss": 4.9343, "mean_token_accuracy": 0.2070520117878914, "num_tokens": 63075174.0, "step": 36360 }, { "entropy": 5.732804870605468, "epoch": 2.8293328146275045, "grad_norm": 1.390625, "learning_rate": 0.000419874290846561, "loss": 4.9658, "mean_token_accuracy": 0.2092955768108368, "num_tokens": 63083375.0, "step": 36365 }, { "entropy": 5.751957750320434, "epoch": 2.8297218439992218, "grad_norm": 1.3515625, "learning_rate": 0.00041985308395102303, "loss": 5.0324, "mean_token_accuracy": 0.21359002143144606, "num_tokens": 63091669.0, "step": 36370 }, { "entropy": 5.7187926292419435, "epoch": 2.8301108733709395, "grad_norm": 1.1484375, "learning_rate": 0.00041983187485756997, "loss": 5.0073, "mean_token_accuracy": 0.20743082463741302, "num_tokens": 63100597.0, "step": 36375 }, { "entropy": 5.798039674758911, "epoch": 2.830499902742657, "grad_norm": 1.265625, "learning_rate": 0.00041981066356652373, "loss": 5.0966, "mean_token_accuracy": 0.201707424223423, "num_tokens": 63109445.0, "step": 36380 }, { "entropy": 5.745220708847046, "epoch": 2.830888932114375, "grad_norm": 1.2578125, "learning_rate": 0.00041978945007820626, "loss": 5.0, "mean_token_accuracy": 0.19945124238729478, "num_tokens": 63118485.0, "step": 36385 }, { "entropy": 5.7526617527008055, "epoch": 2.831277961486092, "grad_norm": 1.1953125, "learning_rate": 0.00041976823439293925, "loss": 4.9927, "mean_token_accuracy": 0.21238688230514527, "num_tokens": 63127366.0, "step": 36390 }, { "entropy": 5.705571985244751, "epoch": 2.83166699085781, "grad_norm": 1.2421875, "learning_rate": 0.0004197470165110447, "loss": 5.0238, "mean_token_accuracy": 0.2043001651763916, "num_tokens": 63136192.0, "step": 36395 }, { "entropy": 5.829097175598145, "epoch": 2.832056020229527, "grad_norm": 1.3046875, "learning_rate": 0.0004197257964328446, "loss": 5.0887, "mean_token_accuracy": 0.20008574426174164, "num_tokens": 63144250.0, "step": 36400 }, { "entropy": 5.759100532531738, "epoch": 2.8324450496012448, "grad_norm": 1.3359375, "learning_rate": 0.0004197045741586609, "loss": 4.9865, "mean_token_accuracy": 0.20765897631645203, "num_tokens": 63152685.0, "step": 36405 }, { "entropy": 5.737129592895508, "epoch": 2.8328340789729625, "grad_norm": 1.234375, "learning_rate": 0.0004196833496888156, "loss": 4.9054, "mean_token_accuracy": 0.21561789959669114, "num_tokens": 63161853.0, "step": 36410 }, { "entropy": 5.681781339645386, "epoch": 2.83322310834468, "grad_norm": 1.2578125, "learning_rate": 0.0004196621230236308, "loss": 4.9307, "mean_token_accuracy": 0.20817392319440842, "num_tokens": 63170626.0, "step": 36415 }, { "entropy": 5.692428636550903, "epoch": 2.833612137716398, "grad_norm": 1.21875, "learning_rate": 0.00041964089416342845, "loss": 4.9846, "mean_token_accuracy": 0.20222779512405395, "num_tokens": 63180183.0, "step": 36420 }, { "entropy": 5.7966831684112545, "epoch": 2.834001167088115, "grad_norm": 1.2265625, "learning_rate": 0.0004196196631085308, "loss": 5.0254, "mean_token_accuracy": 0.2004784643650055, "num_tokens": 63188993.0, "step": 36425 }, { "entropy": 5.765597105026245, "epoch": 2.834390196459833, "grad_norm": 1.3203125, "learning_rate": 0.00041959842985925987, "loss": 5.0254, "mean_token_accuracy": 0.20242451578378678, "num_tokens": 63197592.0, "step": 36430 }, { "entropy": 5.729658222198486, "epoch": 2.83477922583155, "grad_norm": 1.1953125, "learning_rate": 0.000419577194415938, "loss": 5.0112, "mean_token_accuracy": 0.2066555604338646, "num_tokens": 63206216.0, "step": 36435 }, { "entropy": 5.701217555999756, "epoch": 2.8351682552032678, "grad_norm": 1.2578125, "learning_rate": 0.00041955595677888735, "loss": 4.9461, "mean_token_accuracy": 0.20527935326099395, "num_tokens": 63214633.0, "step": 36440 }, { "entropy": 5.740877437591553, "epoch": 2.8355572845749855, "grad_norm": 1.234375, "learning_rate": 0.0004195347169484301, "loss": 4.9683, "mean_token_accuracy": 0.2083987608551979, "num_tokens": 63223666.0, "step": 36445 }, { "entropy": 5.701014375686645, "epoch": 2.835946313946703, "grad_norm": 1.28125, "learning_rate": 0.0004195134749248886, "loss": 4.8724, "mean_token_accuracy": 0.21172016859054565, "num_tokens": 63232192.0, "step": 36450 }, { "entropy": 5.667537212371826, "epoch": 2.8363353433184204, "grad_norm": 1.2421875, "learning_rate": 0.0004194922307085851, "loss": 4.9489, "mean_token_accuracy": 0.20453715324401855, "num_tokens": 63241235.0, "step": 36455 }, { "entropy": 5.830875730514526, "epoch": 2.836724372690138, "grad_norm": 1.28125, "learning_rate": 0.0004194709842998419, "loss": 5.0588, "mean_token_accuracy": 0.19992266744375228, "num_tokens": 63249742.0, "step": 36460 }, { "entropy": 5.7685693264007565, "epoch": 2.837113402061856, "grad_norm": 1.2421875, "learning_rate": 0.00041944973569898157, "loss": 4.9649, "mean_token_accuracy": 0.20309102088212966, "num_tokens": 63258004.0, "step": 36465 }, { "entropy": 5.814654064178467, "epoch": 2.837502431433573, "grad_norm": 1.28125, "learning_rate": 0.0004194284849063265, "loss": 5.0361, "mean_token_accuracy": 0.20655646473169326, "num_tokens": 63266478.0, "step": 36470 }, { "entropy": 5.7320513248443605, "epoch": 2.8378914608052908, "grad_norm": 1.1875, "learning_rate": 0.0004194072319221989, "loss": 4.9843, "mean_token_accuracy": 0.20414682775735854, "num_tokens": 63274868.0, "step": 36475 }, { "entropy": 5.760357856750488, "epoch": 2.8382804901770085, "grad_norm": 1.28125, "learning_rate": 0.0004193859767469214, "loss": 5.0851, "mean_token_accuracy": 0.19333003014326094, "num_tokens": 63284207.0, "step": 36480 }, { "entropy": 5.773577785491943, "epoch": 2.838669519548726, "grad_norm": 1.25, "learning_rate": 0.00041936471938081667, "loss": 5.0317, "mean_token_accuracy": 0.20122294425964354, "num_tokens": 63292477.0, "step": 36485 }, { "entropy": 5.730554533004761, "epoch": 2.8390585489204434, "grad_norm": 1.234375, "learning_rate": 0.00041934345982420695, "loss": 4.9973, "mean_token_accuracy": 0.20423365533351898, "num_tokens": 63301457.0, "step": 36490 }, { "entropy": 5.780957746505737, "epoch": 2.839447578292161, "grad_norm": 1.2890625, "learning_rate": 0.000419322198077415, "loss": 5.0447, "mean_token_accuracy": 0.2010386824607849, "num_tokens": 63309967.0, "step": 36495 }, { "entropy": 5.757409858703613, "epoch": 2.8398366076638784, "grad_norm": 1.2265625, "learning_rate": 0.00041930093414076344, "loss": 4.885, "mean_token_accuracy": 0.21532222926616668, "num_tokens": 63319329.0, "step": 36500 }, { "entropy": 5.696694326400757, "epoch": 2.840225637035596, "grad_norm": 1.21875, "learning_rate": 0.00041927966801457486, "loss": 4.9806, "mean_token_accuracy": 0.20757045596837997, "num_tokens": 63328600.0, "step": 36505 }, { "entropy": 5.769849681854248, "epoch": 2.8406146664073137, "grad_norm": 1.1796875, "learning_rate": 0.000419258399699172, "loss": 5.015, "mean_token_accuracy": 0.2077459916472435, "num_tokens": 63337297.0, "step": 36510 }, { "entropy": 5.723636722564697, "epoch": 2.8410036957790314, "grad_norm": 1.265625, "learning_rate": 0.0004192371291948775, "loss": 4.953, "mean_token_accuracy": 0.20977141857147216, "num_tokens": 63346634.0, "step": 36515 }, { "entropy": 5.793321657180786, "epoch": 2.841392725150749, "grad_norm": 1.28125, "learning_rate": 0.00041921585650201413, "loss": 5.0415, "mean_token_accuracy": 0.19915039986371993, "num_tokens": 63354870.0, "step": 36520 }, { "entropy": 5.700439214706421, "epoch": 2.8417817545224664, "grad_norm": 1.2265625, "learning_rate": 0.0004191945816209047, "loss": 5.0366, "mean_token_accuracy": 0.1993948519229889, "num_tokens": 63363571.0, "step": 36525 }, { "entropy": 5.7421660900115965, "epoch": 2.842170783894184, "grad_norm": 1.2578125, "learning_rate": 0.00041917330455187195, "loss": 4.9438, "mean_token_accuracy": 0.20932697653770446, "num_tokens": 63371716.0, "step": 36530 }, { "entropy": 5.7056714534759525, "epoch": 2.8425598132659013, "grad_norm": 1.2109375, "learning_rate": 0.00041915202529523894, "loss": 5.0498, "mean_token_accuracy": 0.2059592455625534, "num_tokens": 63381399.0, "step": 36535 }, { "entropy": 5.744644212722778, "epoch": 2.842948842637619, "grad_norm": 1.234375, "learning_rate": 0.0004191307438513283, "loss": 5.0332, "mean_token_accuracy": 0.2056727409362793, "num_tokens": 63390548.0, "step": 36540 }, { "entropy": 5.747834491729736, "epoch": 2.8433378720093367, "grad_norm": 1.2734375, "learning_rate": 0.000419109460220463, "loss": 4.9868, "mean_token_accuracy": 0.20138587057590485, "num_tokens": 63400219.0, "step": 36545 }, { "entropy": 5.724843311309814, "epoch": 2.8437269013810544, "grad_norm": 1.2734375, "learning_rate": 0.00041908817440296605, "loss": 4.9011, "mean_token_accuracy": 0.21415580809116364, "num_tokens": 63409131.0, "step": 36550 }, { "entropy": 5.742444610595703, "epoch": 2.8441159307527717, "grad_norm": 1.140625, "learning_rate": 0.00041906688639916035, "loss": 5.1196, "mean_token_accuracy": 0.19964003562927246, "num_tokens": 63418830.0, "step": 36555 }, { "entropy": 5.745057678222656, "epoch": 2.8445049601244894, "grad_norm": 1.2734375, "learning_rate": 0.0004190455962093689, "loss": 4.9446, "mean_token_accuracy": 0.202034692466259, "num_tokens": 63427467.0, "step": 36560 }, { "entropy": 5.7698148727417, "epoch": 2.844893989496207, "grad_norm": 1.328125, "learning_rate": 0.00041902430383391494, "loss": 4.9732, "mean_token_accuracy": 0.2050752356648445, "num_tokens": 63436957.0, "step": 36565 }, { "entropy": 5.710691738128662, "epoch": 2.8452830188679243, "grad_norm": 1.34375, "learning_rate": 0.0004190030092731214, "loss": 5.0507, "mean_token_accuracy": 0.20406912714242936, "num_tokens": 63446010.0, "step": 36570 }, { "entropy": 5.682071161270142, "epoch": 2.845672048239642, "grad_norm": 1.3046875, "learning_rate": 0.0004189817125273113, "loss": 4.9418, "mean_token_accuracy": 0.20841620117425919, "num_tokens": 63454666.0, "step": 36575 }, { "entropy": 5.706725835800171, "epoch": 2.8460610776113597, "grad_norm": 1.2890625, "learning_rate": 0.00041896041359680797, "loss": 4.9511, "mean_token_accuracy": 0.21427938789129258, "num_tokens": 63463076.0, "step": 36580 }, { "entropy": 5.775416421890259, "epoch": 2.8464501069830774, "grad_norm": 1.2265625, "learning_rate": 0.00041893911248193437, "loss": 4.9643, "mean_token_accuracy": 0.20085921436548232, "num_tokens": 63471547.0, "step": 36585 }, { "entropy": 5.765313529968262, "epoch": 2.8468391363547947, "grad_norm": 1.359375, "learning_rate": 0.000418917809183014, "loss": 5.0142, "mean_token_accuracy": 0.19974337816238402, "num_tokens": 63479710.0, "step": 36590 }, { "entropy": 5.706290769577026, "epoch": 2.8472281657265124, "grad_norm": 1.15625, "learning_rate": 0.00041889650370036986, "loss": 4.9365, "mean_token_accuracy": 0.21266779452562332, "num_tokens": 63488639.0, "step": 36595 }, { "entropy": 5.8160182476043705, "epoch": 2.84761719509823, "grad_norm": 1.28125, "learning_rate": 0.0004188751960343253, "loss": 5.068, "mean_token_accuracy": 0.1924944654107094, "num_tokens": 63496956.0, "step": 36600 }, { "entropy": 5.803012561798096, "epoch": 2.8480062244699473, "grad_norm": 1.2421875, "learning_rate": 0.0004188538861852037, "loss": 4.966, "mean_token_accuracy": 0.2106793224811554, "num_tokens": 63505538.0, "step": 36605 }, { "entropy": 5.652116823196411, "epoch": 2.848395253841665, "grad_norm": 1.234375, "learning_rate": 0.0004188325741533283, "loss": 4.8681, "mean_token_accuracy": 0.21104782372713088, "num_tokens": 63513664.0, "step": 36610 }, { "entropy": 5.648019170761108, "epoch": 2.8487842832133827, "grad_norm": 1.3125, "learning_rate": 0.0004188112599390225, "loss": 4.8627, "mean_token_accuracy": 0.22312912493944168, "num_tokens": 63521910.0, "step": 36615 }, { "entropy": 5.693212413787842, "epoch": 2.8491733125851004, "grad_norm": 1.3359375, "learning_rate": 0.0004187899435426098, "loss": 4.8996, "mean_token_accuracy": 0.21173861622810364, "num_tokens": 63530272.0, "step": 36620 }, { "entropy": 5.739686012268066, "epoch": 2.8495623419568177, "grad_norm": 1.265625, "learning_rate": 0.00041876862496441347, "loss": 5.0495, "mean_token_accuracy": 0.20512640327215195, "num_tokens": 63538652.0, "step": 36625 }, { "entropy": 5.740523004531861, "epoch": 2.8499513713285354, "grad_norm": 1.2109375, "learning_rate": 0.00041874730420475716, "loss": 4.9628, "mean_token_accuracy": 0.20903600752353668, "num_tokens": 63547016.0, "step": 36630 }, { "entropy": 5.706957387924194, "epoch": 2.8503404007002526, "grad_norm": 1.203125, "learning_rate": 0.00041872598126396434, "loss": 4.9491, "mean_token_accuracy": 0.2098409041762352, "num_tokens": 63555561.0, "step": 36635 }, { "entropy": 5.71599931716919, "epoch": 2.8507294300719703, "grad_norm": 1.3125, "learning_rate": 0.00041870465614235843, "loss": 5.007, "mean_token_accuracy": 0.20348623394966125, "num_tokens": 63563510.0, "step": 36640 }, { "entropy": 5.720728778839112, "epoch": 2.851118459443688, "grad_norm": 1.1796875, "learning_rate": 0.00041868332884026317, "loss": 4.9772, "mean_token_accuracy": 0.21116032153367997, "num_tokens": 63572495.0, "step": 36645 }, { "entropy": 5.804223871231079, "epoch": 2.8515074888154057, "grad_norm": 1.234375, "learning_rate": 0.0004186619993580021, "loss": 5.0203, "mean_token_accuracy": 0.20296602249145507, "num_tokens": 63581525.0, "step": 36650 }, { "entropy": 5.743007755279541, "epoch": 2.851896518187123, "grad_norm": 1.2109375, "learning_rate": 0.00041864066769589875, "loss": 4.9381, "mean_token_accuracy": 0.20523785501718522, "num_tokens": 63590136.0, "step": 36655 }, { "entropy": 5.786662530899048, "epoch": 2.8522855475588407, "grad_norm": 1.2890625, "learning_rate": 0.00041861933385427697, "loss": 5.068, "mean_token_accuracy": 0.20748042911291123, "num_tokens": 63599353.0, "step": 36660 }, { "entropy": 5.736513280868531, "epoch": 2.8526745769305584, "grad_norm": 1.3203125, "learning_rate": 0.0004185979978334604, "loss": 4.9004, "mean_token_accuracy": 0.21530398577451706, "num_tokens": 63607586.0, "step": 36665 }, { "entropy": 5.7069755554199215, "epoch": 2.8530636063022756, "grad_norm": 1.2421875, "learning_rate": 0.0004185766596337727, "loss": 4.9285, "mean_token_accuracy": 0.20601217150688172, "num_tokens": 63616444.0, "step": 36670 }, { "entropy": 5.686276531219482, "epoch": 2.8534526356739933, "grad_norm": 1.1796875, "learning_rate": 0.00041855531925553773, "loss": 5.0255, "mean_token_accuracy": 0.20389581769704818, "num_tokens": 63625591.0, "step": 36675 }, { "entropy": 5.861992311477661, "epoch": 2.853841665045711, "grad_norm": 1.25, "learning_rate": 0.0004185339766990794, "loss": 5.1167, "mean_token_accuracy": 0.19541873335838317, "num_tokens": 63633681.0, "step": 36680 }, { "entropy": 5.790127992630005, "epoch": 2.8542306944174287, "grad_norm": 1.2265625, "learning_rate": 0.0004185126319647213, "loss": 5.0001, "mean_token_accuracy": 0.20626704692840575, "num_tokens": 63642298.0, "step": 36685 }, { "entropy": 5.793831443786621, "epoch": 2.854619723789146, "grad_norm": 1.3359375, "learning_rate": 0.0004184912850527875, "loss": 5.0878, "mean_token_accuracy": 0.19966365098953248, "num_tokens": 63650969.0, "step": 36690 }, { "entropy": 5.719993782043457, "epoch": 2.8550087531608637, "grad_norm": 1.2421875, "learning_rate": 0.0004184699359636018, "loss": 4.9342, "mean_token_accuracy": 0.21597090661525725, "num_tokens": 63659477.0, "step": 36695 }, { "entropy": 5.779005670547486, "epoch": 2.8553977825325814, "grad_norm": 1.15625, "learning_rate": 0.0004184485846974882, "loss": 5.0078, "mean_token_accuracy": 0.203122079372406, "num_tokens": 63668575.0, "step": 36700 }, { "entropy": 5.782387399673462, "epoch": 2.8557868119042986, "grad_norm": 1.296875, "learning_rate": 0.0004184272312547706, "loss": 5.0499, "mean_token_accuracy": 0.20547460317611693, "num_tokens": 63677818.0, "step": 36705 }, { "entropy": 5.75487904548645, "epoch": 2.8561758412760163, "grad_norm": 1.3046875, "learning_rate": 0.00041840587563577315, "loss": 4.8891, "mean_token_accuracy": 0.21137450486421586, "num_tokens": 63686360.0, "step": 36710 }, { "entropy": 5.6884184837341305, "epoch": 2.856564870647734, "grad_norm": 1.1875, "learning_rate": 0.0004183845178408197, "loss": 5.0509, "mean_token_accuracy": 0.19633886069059373, "num_tokens": 63695602.0, "step": 36715 }, { "entropy": 5.715084600448608, "epoch": 2.8569539000194517, "grad_norm": 1.1796875, "learning_rate": 0.00041836315787023456, "loss": 4.996, "mean_token_accuracy": 0.2097986340522766, "num_tokens": 63704225.0, "step": 36720 }, { "entropy": 5.7590516090393065, "epoch": 2.857342929391169, "grad_norm": 1.234375, "learning_rate": 0.00041834179572434153, "loss": 4.9452, "mean_token_accuracy": 0.20490377843379975, "num_tokens": 63712814.0, "step": 36725 }, { "entropy": 5.760446166992187, "epoch": 2.8577319587628867, "grad_norm": 1.28125, "learning_rate": 0.00041832043140346495, "loss": 4.9465, "mean_token_accuracy": 0.2113465115427971, "num_tokens": 63721808.0, "step": 36730 }, { "entropy": 5.711167192459106, "epoch": 2.858120988134604, "grad_norm": 1.2734375, "learning_rate": 0.0004182990649079289, "loss": 5.0116, "mean_token_accuracy": 0.2102164313197136, "num_tokens": 63730226.0, "step": 36735 }, { "entropy": 5.696228122711181, "epoch": 2.8585100175063216, "grad_norm": 1.328125, "learning_rate": 0.0004182776962380577, "loss": 4.9321, "mean_token_accuracy": 0.21242089718580245, "num_tokens": 63738400.0, "step": 36740 }, { "entropy": 5.682753419876098, "epoch": 2.8588990468780393, "grad_norm": 1.2578125, "learning_rate": 0.00041825632539417546, "loss": 4.9307, "mean_token_accuracy": 0.21262372881174088, "num_tokens": 63746385.0, "step": 36745 }, { "entropy": 5.742053890228272, "epoch": 2.859288076249757, "grad_norm": 1.2109375, "learning_rate": 0.0004182349523766065, "loss": 5.0668, "mean_token_accuracy": 0.1984177738428116, "num_tokens": 63755354.0, "step": 36750 }, { "entropy": 5.818698215484619, "epoch": 2.8596771056214743, "grad_norm": 1.234375, "learning_rate": 0.00041821357718567514, "loss": 5.0755, "mean_token_accuracy": 0.20186235755681992, "num_tokens": 63764262.0, "step": 36755 }, { "entropy": 5.715244007110596, "epoch": 2.860066134993192, "grad_norm": 1.25, "learning_rate": 0.0004181921998217057, "loss": 4.9343, "mean_token_accuracy": 0.208535298705101, "num_tokens": 63772770.0, "step": 36760 }, { "entropy": 5.715142250061035, "epoch": 2.8604551643649097, "grad_norm": 1.171875, "learning_rate": 0.0004181708202850225, "loss": 4.984, "mean_token_accuracy": 0.20963749438524246, "num_tokens": 63781353.0, "step": 36765 }, { "entropy": 5.813919591903686, "epoch": 2.860844193736627, "grad_norm": 1.3515625, "learning_rate": 0.00041814943857595, "loss": 5.085, "mean_token_accuracy": 0.20416194200515747, "num_tokens": 63789262.0, "step": 36770 }, { "entropy": 5.824253797531128, "epoch": 2.8612332231083446, "grad_norm": 1.28125, "learning_rate": 0.0004181280546948127, "loss": 5.1277, "mean_token_accuracy": 0.20019491761922836, "num_tokens": 63797792.0, "step": 36775 }, { "entropy": 5.769798660278321, "epoch": 2.8616222524800623, "grad_norm": 1.3359375, "learning_rate": 0.0004181066686419349, "loss": 4.9073, "mean_token_accuracy": 0.2121092140674591, "num_tokens": 63805362.0, "step": 36780 }, { "entropy": 5.727778768539428, "epoch": 2.86201128185178, "grad_norm": 1.2890625, "learning_rate": 0.00041808528041764115, "loss": 4.9935, "mean_token_accuracy": 0.2121608301997185, "num_tokens": 63813942.0, "step": 36785 }, { "entropy": 5.624318790435791, "epoch": 2.8624003112234973, "grad_norm": 1.1640625, "learning_rate": 0.0004180638900222561, "loss": 4.8929, "mean_token_accuracy": 0.22012353986501693, "num_tokens": 63823077.0, "step": 36790 }, { "entropy": 5.671777296066284, "epoch": 2.862789340595215, "grad_norm": 1.2890625, "learning_rate": 0.0004180424974561042, "loss": 4.8822, "mean_token_accuracy": 0.21379270851612092, "num_tokens": 63831048.0, "step": 36795 }, { "entropy": 5.764239549636841, "epoch": 2.8631783699669326, "grad_norm": 1.3046875, "learning_rate": 0.00041802110271951, "loss": 5.034, "mean_token_accuracy": 0.1986211508512497, "num_tokens": 63839449.0, "step": 36800 }, { "entropy": 5.712632083892823, "epoch": 2.86356739933865, "grad_norm": 1.359375, "learning_rate": 0.0004179997058127983, "loss": 4.9834, "mean_token_accuracy": 0.20677031129598616, "num_tokens": 63847945.0, "step": 36805 }, { "entropy": 5.728215503692627, "epoch": 2.8639564287103676, "grad_norm": 1.171875, "learning_rate": 0.0004179783067362936, "loss": 4.9157, "mean_token_accuracy": 0.21541233956813813, "num_tokens": 63857334.0, "step": 36810 }, { "entropy": 5.761149930953979, "epoch": 2.8643454580820853, "grad_norm": 1.1796875, "learning_rate": 0.0004179569054903207, "loss": 5.0318, "mean_token_accuracy": 0.1967565804719925, "num_tokens": 63866272.0, "step": 36815 }, { "entropy": 5.715076732635498, "epoch": 2.864734487453803, "grad_norm": 1.296875, "learning_rate": 0.00041793550207520436, "loss": 4.9494, "mean_token_accuracy": 0.2125127911567688, "num_tokens": 63874798.0, "step": 36820 }, { "entropy": 5.728378343582153, "epoch": 2.8651235168255202, "grad_norm": 1.2734375, "learning_rate": 0.0004179140964912692, "loss": 4.9414, "mean_token_accuracy": 0.21069611757993698, "num_tokens": 63883106.0, "step": 36825 }, { "entropy": 5.753516626358032, "epoch": 2.865512546197238, "grad_norm": 1.328125, "learning_rate": 0.0004178926887388401, "loss": 4.9562, "mean_token_accuracy": 0.20920439660549164, "num_tokens": 63892172.0, "step": 36830 }, { "entropy": 5.789816093444824, "epoch": 2.865901575568955, "grad_norm": 1.3203125, "learning_rate": 0.00041787127881824193, "loss": 5.0826, "mean_token_accuracy": 0.201185941696167, "num_tokens": 63900436.0, "step": 36835 }, { "entropy": 5.794670438766479, "epoch": 2.866290604940673, "grad_norm": 1.28125, "learning_rate": 0.00041784986672979945, "loss": 5.0643, "mean_token_accuracy": 0.20263662487268447, "num_tokens": 63908937.0, "step": 36840 }, { "entropy": 5.750724458694458, "epoch": 2.8666796343123906, "grad_norm": 1.2421875, "learning_rate": 0.00041782845247383767, "loss": 5.014, "mean_token_accuracy": 0.20849798917770385, "num_tokens": 63916350.0, "step": 36845 }, { "entropy": 5.737976932525635, "epoch": 2.8670686636841083, "grad_norm": 1.21875, "learning_rate": 0.00041780703605068145, "loss": 4.9796, "mean_token_accuracy": 0.20029941350221633, "num_tokens": 63925227.0, "step": 36850 }, { "entropy": 5.750754690170288, "epoch": 2.867457693055826, "grad_norm": 1.2109375, "learning_rate": 0.0004177856174606558, "loss": 4.9851, "mean_token_accuracy": 0.20591768622398376, "num_tokens": 63934075.0, "step": 36855 }, { "entropy": 5.71710205078125, "epoch": 2.8678467224275432, "grad_norm": 1.3203125, "learning_rate": 0.0004177641967040856, "loss": 5.0339, "mean_token_accuracy": 0.2025721102952957, "num_tokens": 63942554.0, "step": 36860 }, { "entropy": 5.717908239364624, "epoch": 2.868235751799261, "grad_norm": 1.2109375, "learning_rate": 0.00041774277378129595, "loss": 4.9225, "mean_token_accuracy": 0.20606297701597215, "num_tokens": 63951850.0, "step": 36865 }, { "entropy": 5.824843263626098, "epoch": 2.868624781170978, "grad_norm": 1.2109375, "learning_rate": 0.00041772134869261186, "loss": 4.9634, "mean_token_accuracy": 0.20621060132980346, "num_tokens": 63960709.0, "step": 36870 }, { "entropy": 5.7367767810821535, "epoch": 2.869013810542696, "grad_norm": 1.2265625, "learning_rate": 0.0004176999214383585, "loss": 4.9504, "mean_token_accuracy": 0.21050390154123305, "num_tokens": 63969859.0, "step": 36875 }, { "entropy": 5.749949312210083, "epoch": 2.8694028399144136, "grad_norm": 1.2734375, "learning_rate": 0.00041767849201886103, "loss": 4.9638, "mean_token_accuracy": 0.20755112171173096, "num_tokens": 63977524.0, "step": 36880 }, { "entropy": 5.6453851699829105, "epoch": 2.8697918692861313, "grad_norm": 1.25, "learning_rate": 0.0004176570604344445, "loss": 4.8598, "mean_token_accuracy": 0.2136784926056862, "num_tokens": 63985938.0, "step": 36885 }, { "entropy": 5.6559913635253904, "epoch": 2.8701808986578485, "grad_norm": 1.203125, "learning_rate": 0.00041763562668543415, "loss": 4.9996, "mean_token_accuracy": 0.2073701351881027, "num_tokens": 63993864.0, "step": 36890 }, { "entropy": 5.7677528858184814, "epoch": 2.8705699280295662, "grad_norm": 1.1953125, "learning_rate": 0.0004176141907721552, "loss": 5.0314, "mean_token_accuracy": 0.20221633166074754, "num_tokens": 64003479.0, "step": 36895 }, { "entropy": 5.786417007446289, "epoch": 2.870958957401284, "grad_norm": 1.2265625, "learning_rate": 0.0004175927526949329, "loss": 4.9879, "mean_token_accuracy": 0.20982837080955505, "num_tokens": 64012492.0, "step": 36900 }, { "entropy": 5.80591082572937, "epoch": 2.871347986773001, "grad_norm": 1.28125, "learning_rate": 0.0004175713124540925, "loss": 5.0913, "mean_token_accuracy": 0.19265477657318114, "num_tokens": 64021756.0, "step": 36905 }, { "entropy": 5.7894978523254395, "epoch": 2.871737016144719, "grad_norm": 1.2109375, "learning_rate": 0.00041754987004995935, "loss": 5.042, "mean_token_accuracy": 0.20524475127458572, "num_tokens": 64030351.0, "step": 36910 }, { "entropy": 5.719178342819214, "epoch": 2.8721260455164366, "grad_norm": 1.3203125, "learning_rate": 0.00041752842548285887, "loss": 4.9134, "mean_token_accuracy": 0.20441850423812866, "num_tokens": 64039523.0, "step": 36915 }, { "entropy": 5.655311203002929, "epoch": 2.8725150748881543, "grad_norm": 1.2734375, "learning_rate": 0.0004175069787531163, "loss": 4.8982, "mean_token_accuracy": 0.21504761576652526, "num_tokens": 64048264.0, "step": 36920 }, { "entropy": 5.730323791503906, "epoch": 2.8729041042598715, "grad_norm": 1.1796875, "learning_rate": 0.00041748552986105726, "loss": 5.0493, "mean_token_accuracy": 0.19754164665937424, "num_tokens": 64057013.0, "step": 36925 }, { "entropy": 5.720691251754761, "epoch": 2.8732931336315892, "grad_norm": 1.2109375, "learning_rate": 0.000417464078807007, "loss": 4.9128, "mean_token_accuracy": 0.20944285690784453, "num_tokens": 64065962.0, "step": 36930 }, { "entropy": 5.713558959960937, "epoch": 2.8736821630033065, "grad_norm": 1.2734375, "learning_rate": 0.0004174426255912912, "loss": 4.9854, "mean_token_accuracy": 0.20967153012752532, "num_tokens": 64074493.0, "step": 36935 }, { "entropy": 5.77790937423706, "epoch": 2.874071192375024, "grad_norm": 1.296875, "learning_rate": 0.0004174211702142352, "loss": 5.0864, "mean_token_accuracy": 0.19944488406181335, "num_tokens": 64083351.0, "step": 36940 }, { "entropy": 5.813467597961425, "epoch": 2.874460221746742, "grad_norm": 1.2890625, "learning_rate": 0.00041739971267616466, "loss": 4.9494, "mean_token_accuracy": 0.207864385843277, "num_tokens": 64091775.0, "step": 36945 }, { "entropy": 5.690114450454712, "epoch": 2.8748492511184596, "grad_norm": 1.171875, "learning_rate": 0.0004173782529774051, "loss": 4.9879, "mean_token_accuracy": 0.21463306844234467, "num_tokens": 64100684.0, "step": 36950 }, { "entropy": 5.682414627075195, "epoch": 2.8752382804901773, "grad_norm": 1.296875, "learning_rate": 0.00041735679111828223, "loss": 4.9683, "mean_token_accuracy": 0.2050965204834938, "num_tokens": 64109102.0, "step": 36955 }, { "entropy": 5.703182125091553, "epoch": 2.8756273098618945, "grad_norm": 1.234375, "learning_rate": 0.00041733532709912157, "loss": 4.9438, "mean_token_accuracy": 0.21107327342033386, "num_tokens": 64118341.0, "step": 36960 }, { "entropy": 5.676951599121094, "epoch": 2.876016339233612, "grad_norm": 1.2421875, "learning_rate": 0.00041731386092024893, "loss": 4.8632, "mean_token_accuracy": 0.21473649591207505, "num_tokens": 64126647.0, "step": 36965 }, { "entropy": 5.627804613113403, "epoch": 2.8764053686053295, "grad_norm": 1.21875, "learning_rate": 0.00041729239258198996, "loss": 4.7958, "mean_token_accuracy": 0.21405840665102005, "num_tokens": 64135534.0, "step": 36970 }, { "entropy": 5.719253826141357, "epoch": 2.876794397977047, "grad_norm": 1.3515625, "learning_rate": 0.00041727092208467036, "loss": 5.0161, "mean_token_accuracy": 0.2036663383245468, "num_tokens": 64144108.0, "step": 36975 }, { "entropy": 5.684485530853271, "epoch": 2.877183427348765, "grad_norm": 1.234375, "learning_rate": 0.00041724944942861603, "loss": 4.8315, "mean_token_accuracy": 0.2183200791478157, "num_tokens": 64152599.0, "step": 36980 }, { "entropy": 5.700377464294434, "epoch": 2.8775724567204826, "grad_norm": 1.3125, "learning_rate": 0.00041722797461415267, "loss": 4.9782, "mean_token_accuracy": 0.2023568108677864, "num_tokens": 64161733.0, "step": 36985 }, { "entropy": 5.694726371765137, "epoch": 2.8779614860922, "grad_norm": 1.2109375, "learning_rate": 0.0004172064976416062, "loss": 4.9283, "mean_token_accuracy": 0.20620177835226058, "num_tokens": 64171045.0, "step": 36990 }, { "entropy": 5.757773590087891, "epoch": 2.8783505154639175, "grad_norm": 1.21875, "learning_rate": 0.0004171850185113024, "loss": 4.9188, "mean_token_accuracy": 0.2145707368850708, "num_tokens": 64179725.0, "step": 36995 }, { "entropy": 5.6805822372436525, "epoch": 2.878739544835635, "grad_norm": 1.2578125, "learning_rate": 0.00041716353722356735, "loss": 4.9958, "mean_token_accuracy": 0.20562998801469803, "num_tokens": 64188799.0, "step": 37000 }, { "entropy": 5.751687908172608, "epoch": 2.8791285742073525, "grad_norm": 1.234375, "learning_rate": 0.0004171420537787269, "loss": 5.03, "mean_token_accuracy": 0.20501236170530318, "num_tokens": 64197809.0, "step": 37005 }, { "entropy": 5.753409957885742, "epoch": 2.87951760357907, "grad_norm": 1.265625, "learning_rate": 0.00041712056817710697, "loss": 5.0433, "mean_token_accuracy": 0.1948085531592369, "num_tokens": 64207113.0, "step": 37010 }, { "entropy": 5.799399089813233, "epoch": 2.879906632950788, "grad_norm": 1.234375, "learning_rate": 0.0004170990804190337, "loss": 4.9952, "mean_token_accuracy": 0.20732173025608064, "num_tokens": 64216846.0, "step": 37015 }, { "entropy": 5.739119672775269, "epoch": 2.8802956623225056, "grad_norm": 1.3125, "learning_rate": 0.00041707759050483304, "loss": 4.9415, "mean_token_accuracy": 0.21036392748355864, "num_tokens": 64225348.0, "step": 37020 }, { "entropy": 5.714927673339844, "epoch": 2.880684691694223, "grad_norm": 1.2890625, "learning_rate": 0.000417056098434831, "loss": 4.9794, "mean_token_accuracy": 0.20905080437660217, "num_tokens": 64234065.0, "step": 37025 }, { "entropy": 5.755978631973266, "epoch": 2.8810737210659405, "grad_norm": 1.3046875, "learning_rate": 0.0004170346042093538, "loss": 4.9755, "mean_token_accuracy": 0.20757560580968856, "num_tokens": 64242484.0, "step": 37030 }, { "entropy": 5.673245191574097, "epoch": 2.881462750437658, "grad_norm": 1.2421875, "learning_rate": 0.0004170131078287276, "loss": 4.8498, "mean_token_accuracy": 0.21558499485254287, "num_tokens": 64251056.0, "step": 37035 }, { "entropy": 5.768542861938476, "epoch": 2.8818517798093755, "grad_norm": 1.2890625, "learning_rate": 0.0004169916092932785, "loss": 4.9458, "mean_token_accuracy": 0.20585631281137468, "num_tokens": 64258961.0, "step": 37040 }, { "entropy": 5.68632173538208, "epoch": 2.882240809181093, "grad_norm": 1.15625, "learning_rate": 0.0004169701086033327, "loss": 4.9069, "mean_token_accuracy": 0.2106291189789772, "num_tokens": 64268133.0, "step": 37045 }, { "entropy": 5.733559513092041, "epoch": 2.882629838552811, "grad_norm": 1.28125, "learning_rate": 0.00041694860575921654, "loss": 5.0132, "mean_token_accuracy": 0.20442234128713607, "num_tokens": 64276487.0, "step": 37050 }, { "entropy": 5.724691534042359, "epoch": 2.8830188679245285, "grad_norm": 1.2109375, "learning_rate": 0.00041692710076125615, "loss": 4.9164, "mean_token_accuracy": 0.21217021048069, "num_tokens": 64284983.0, "step": 37055 }, { "entropy": 5.740058517456054, "epoch": 2.883407897296246, "grad_norm": 1.234375, "learning_rate": 0.000416905593609778, "loss": 4.9917, "mean_token_accuracy": 0.2071874186396599, "num_tokens": 64293875.0, "step": 37060 }, { "entropy": 5.76955943107605, "epoch": 2.8837969266679635, "grad_norm": 1.296875, "learning_rate": 0.00041688408430510827, "loss": 4.9627, "mean_token_accuracy": 0.21479981541633605, "num_tokens": 64302628.0, "step": 37065 }, { "entropy": 5.777098655700684, "epoch": 2.8841859560396808, "grad_norm": 1.234375, "learning_rate": 0.0004168625728475734, "loss": 5.0319, "mean_token_accuracy": 0.2062173530459404, "num_tokens": 64311024.0, "step": 37070 }, { "entropy": 5.713102674484253, "epoch": 2.8845749854113985, "grad_norm": 1.328125, "learning_rate": 0.00041684105923749977, "loss": 4.9856, "mean_token_accuracy": 0.20848477631807327, "num_tokens": 64318836.0, "step": 37075 }, { "entropy": 5.718553972244263, "epoch": 2.884964014783116, "grad_norm": 1.2421875, "learning_rate": 0.0004168195434752139, "loss": 5.0349, "mean_token_accuracy": 0.20841324031352998, "num_tokens": 64326983.0, "step": 37080 }, { "entropy": 5.778519964218139, "epoch": 2.885353044154834, "grad_norm": 1.28125, "learning_rate": 0.00041679802556104207, "loss": 4.9997, "mean_token_accuracy": 0.21274953633546828, "num_tokens": 64335304.0, "step": 37085 }, { "entropy": 5.772140741348267, "epoch": 2.885742073526551, "grad_norm": 1.2890625, "learning_rate": 0.00041677650549531097, "loss": 4.8778, "mean_token_accuracy": 0.21269719898700715, "num_tokens": 64343515.0, "step": 37090 }, { "entropy": 5.710613822937011, "epoch": 2.886131102898269, "grad_norm": 1.3125, "learning_rate": 0.00041675498327834706, "loss": 4.985, "mean_token_accuracy": 0.2001028209924698, "num_tokens": 64351936.0, "step": 37095 }, { "entropy": 5.768446063995361, "epoch": 2.8865201322699865, "grad_norm": 1.140625, "learning_rate": 0.00041673345891047686, "loss": 5.0407, "mean_token_accuracy": 0.20580901503562926, "num_tokens": 64360332.0, "step": 37100 }, { "entropy": 5.784063625335693, "epoch": 2.8869091616417037, "grad_norm": 1.234375, "learning_rate": 0.0004167119323920271, "loss": 4.9831, "mean_token_accuracy": 0.20793989300727844, "num_tokens": 64369615.0, "step": 37105 }, { "entropy": 5.731975269317627, "epoch": 2.8872981910134214, "grad_norm": 1.3203125, "learning_rate": 0.0004166904037233243, "loss": 4.9055, "mean_token_accuracy": 0.21250725984573365, "num_tokens": 64378355.0, "step": 37110 }, { "entropy": 5.691574621200561, "epoch": 2.887687220385139, "grad_norm": 1.2578125, "learning_rate": 0.00041666887290469506, "loss": 4.8846, "mean_token_accuracy": 0.20999398976564407, "num_tokens": 64386120.0, "step": 37115 }, { "entropy": 5.679897832870483, "epoch": 2.888076249756857, "grad_norm": 1.1484375, "learning_rate": 0.0004166473399364663, "loss": 4.9607, "mean_token_accuracy": 0.20770198702812195, "num_tokens": 64395153.0, "step": 37120 }, { "entropy": 5.800861024856568, "epoch": 2.888465279128574, "grad_norm": 1.140625, "learning_rate": 0.00041662580481896446, "loss": 4.9956, "mean_token_accuracy": 0.20650604367256165, "num_tokens": 64404266.0, "step": 37125 }, { "entropy": 5.755217361450195, "epoch": 2.888854308500292, "grad_norm": 1.234375, "learning_rate": 0.0004166042675525165, "loss": 4.9627, "mean_token_accuracy": 0.20714509785175322, "num_tokens": 64412999.0, "step": 37130 }, { "entropy": 5.747656440734863, "epoch": 2.8892433378720095, "grad_norm": 1.34375, "learning_rate": 0.00041658272813744924, "loss": 4.9714, "mean_token_accuracy": 0.20637919902801513, "num_tokens": 64421561.0, "step": 37135 }, { "entropy": 5.745613956451416, "epoch": 2.8896323672437267, "grad_norm": 1.21875, "learning_rate": 0.0004165611865740894, "loss": 5.021, "mean_token_accuracy": 0.20760425180196762, "num_tokens": 64430254.0, "step": 37140 }, { "entropy": 5.730626440048217, "epoch": 2.8900213966154444, "grad_norm": 1.2578125, "learning_rate": 0.0004165396428627638, "loss": 4.9313, "mean_token_accuracy": 0.21572021394968033, "num_tokens": 64438452.0, "step": 37145 }, { "entropy": 5.833238315582276, "epoch": 2.890410425987162, "grad_norm": 1.2578125, "learning_rate": 0.00041651809700379947, "loss": 5.0844, "mean_token_accuracy": 0.20503049492835998, "num_tokens": 64447442.0, "step": 37150 }, { "entropy": 5.77146053314209, "epoch": 2.89079945535888, "grad_norm": 1.21875, "learning_rate": 0.00041649654899752326, "loss": 5.0631, "mean_token_accuracy": 0.1974495381116867, "num_tokens": 64456179.0, "step": 37155 }, { "entropy": 5.880424737930298, "epoch": 2.891188484730597, "grad_norm": 1.2734375, "learning_rate": 0.0004164749988442621, "loss": 5.1, "mean_token_accuracy": 0.20229363739490508, "num_tokens": 64464498.0, "step": 37160 }, { "entropy": 5.782013082504273, "epoch": 2.891577514102315, "grad_norm": 1.3125, "learning_rate": 0.000416453446544343, "loss": 4.9511, "mean_token_accuracy": 0.19708722084760666, "num_tokens": 64473047.0, "step": 37165 }, { "entropy": 5.673948907852173, "epoch": 2.891966543474032, "grad_norm": 1.3203125, "learning_rate": 0.0004164318920980931, "loss": 4.8679, "mean_token_accuracy": 0.22353076040744782, "num_tokens": 64482338.0, "step": 37170 }, { "entropy": 5.69389762878418, "epoch": 2.8923555728457497, "grad_norm": 1.2421875, "learning_rate": 0.0004164103355058393, "loss": 4.8692, "mean_token_accuracy": 0.21218517571687698, "num_tokens": 64490611.0, "step": 37175 }, { "entropy": 5.706923723220825, "epoch": 2.8927446022174674, "grad_norm": 1.296875, "learning_rate": 0.0004163887767679087, "loss": 4.9302, "mean_token_accuracy": 0.21075771003961563, "num_tokens": 64499180.0, "step": 37180 }, { "entropy": 5.7763646125793455, "epoch": 2.893133631589185, "grad_norm": 1.1953125, "learning_rate": 0.0004163672158846285, "loss": 5.0103, "mean_token_accuracy": 0.1972503185272217, "num_tokens": 64508664.0, "step": 37185 }, { "entropy": 5.869504117965699, "epoch": 2.8935226609609024, "grad_norm": 1.359375, "learning_rate": 0.00041634565285632573, "loss": 5.122, "mean_token_accuracy": 0.19295490831136702, "num_tokens": 64518059.0, "step": 37190 }, { "entropy": 5.821773529052734, "epoch": 2.89391169033262, "grad_norm": 1.2578125, "learning_rate": 0.00041632408768332776, "loss": 5.0816, "mean_token_accuracy": 0.19682445228099824, "num_tokens": 64526616.0, "step": 37195 }, { "entropy": 5.8352601528167725, "epoch": 2.8943007197043378, "grad_norm": 1.3203125, "learning_rate": 0.00041630252036596165, "loss": 5.0607, "mean_token_accuracy": 0.20160528719425203, "num_tokens": 64535008.0, "step": 37200 }, { "entropy": 5.736281538009644, "epoch": 2.894689749076055, "grad_norm": 1.21875, "learning_rate": 0.0004162809509045547, "loss": 4.8884, "mean_token_accuracy": 0.20767545849084854, "num_tokens": 64543741.0, "step": 37205 }, { "entropy": 5.668125057220459, "epoch": 2.8950787784477727, "grad_norm": 1.1875, "learning_rate": 0.00041625937929943424, "loss": 4.8322, "mean_token_accuracy": 0.2080962762236595, "num_tokens": 64552409.0, "step": 37210 }, { "entropy": 5.7549787044525145, "epoch": 2.8954678078194904, "grad_norm": 1.2578125, "learning_rate": 0.00041623780555092747, "loss": 5.0684, "mean_token_accuracy": 0.2017362281680107, "num_tokens": 64561308.0, "step": 37215 }, { "entropy": 5.74076018333435, "epoch": 2.895856837191208, "grad_norm": 1.3046875, "learning_rate": 0.0004162162296593618, "loss": 4.9253, "mean_token_accuracy": 0.2154846668243408, "num_tokens": 64569671.0, "step": 37220 }, { "entropy": 5.811910676956177, "epoch": 2.8962458665629254, "grad_norm": 1.2265625, "learning_rate": 0.00041619465162506466, "loss": 5.0475, "mean_token_accuracy": 0.19977937638759613, "num_tokens": 64578186.0, "step": 37225 }, { "entropy": 5.729033470153809, "epoch": 2.896634895934643, "grad_norm": 1.2578125, "learning_rate": 0.0004161730714483633, "loss": 4.9557, "mean_token_accuracy": 0.21078511476516723, "num_tokens": 64586703.0, "step": 37230 }, { "entropy": 5.674582147598267, "epoch": 2.8970239253063608, "grad_norm": 1.28125, "learning_rate": 0.0004161514891295854, "loss": 4.9794, "mean_token_accuracy": 0.20410351008176802, "num_tokens": 64595119.0, "step": 37235 }, { "entropy": 5.760584735870362, "epoch": 2.897412954678078, "grad_norm": 1.1875, "learning_rate": 0.00041612990466905825, "loss": 5.0252, "mean_token_accuracy": 0.20483770668506623, "num_tokens": 64604312.0, "step": 37240 }, { "entropy": 5.774098300933838, "epoch": 2.8978019840497957, "grad_norm": 1.21875, "learning_rate": 0.00041610831806710954, "loss": 4.9715, "mean_token_accuracy": 0.21247092336416246, "num_tokens": 64613088.0, "step": 37245 }, { "entropy": 5.8421515941619875, "epoch": 2.8981910134215134, "grad_norm": 1.25, "learning_rate": 0.00041608672932406666, "loss": 5.1143, "mean_token_accuracy": 0.19977415055036546, "num_tokens": 64621659.0, "step": 37250 }, { "entropy": 5.7280261516571045, "epoch": 2.898580042793231, "grad_norm": 1.28125, "learning_rate": 0.00041606513844025716, "loss": 4.9407, "mean_token_accuracy": 0.21143391132354736, "num_tokens": 64630436.0, "step": 37255 }, { "entropy": 5.6956438541412355, "epoch": 2.8989690721649484, "grad_norm": 1.2265625, "learning_rate": 0.0004160435454160087, "loss": 4.9766, "mean_token_accuracy": 0.21149381399154663, "num_tokens": 64639836.0, "step": 37260 }, { "entropy": 5.7614827156066895, "epoch": 2.899358101536666, "grad_norm": 1.203125, "learning_rate": 0.000416021950251649, "loss": 4.9733, "mean_token_accuracy": 0.1958405390381813, "num_tokens": 64648941.0, "step": 37265 }, { "entropy": 5.737900495529175, "epoch": 2.8997471309083833, "grad_norm": 1.328125, "learning_rate": 0.0004160003529475057, "loss": 5.022, "mean_token_accuracy": 0.20078711658716203, "num_tokens": 64657632.0, "step": 37270 }, { "entropy": 5.749803733825684, "epoch": 2.900136160280101, "grad_norm": 1.25, "learning_rate": 0.0004159787535039064, "loss": 5.0149, "mean_token_accuracy": 0.20387831926345826, "num_tokens": 64665733.0, "step": 37275 }, { "entropy": 5.627625226974487, "epoch": 2.9005251896518187, "grad_norm": 1.28125, "learning_rate": 0.0004159571519211789, "loss": 4.891, "mean_token_accuracy": 0.2194912925362587, "num_tokens": 64673873.0, "step": 37280 }, { "entropy": 5.724135971069336, "epoch": 2.9009142190235364, "grad_norm": 1.3203125, "learning_rate": 0.000415935548199651, "loss": 5.0016, "mean_token_accuracy": 0.20421743988990784, "num_tokens": 64682282.0, "step": 37285 }, { "entropy": 5.739316606521607, "epoch": 2.901303248395254, "grad_norm": 1.3046875, "learning_rate": 0.0004159139423396504, "loss": 4.9394, "mean_token_accuracy": 0.21273994743824004, "num_tokens": 64690179.0, "step": 37290 }, { "entropy": 5.77836651802063, "epoch": 2.9016922777669714, "grad_norm": 1.3515625, "learning_rate": 0.0004158923343415051, "loss": 5.0564, "mean_token_accuracy": 0.20638013035058975, "num_tokens": 64698935.0, "step": 37295 }, { "entropy": 5.686085033416748, "epoch": 2.902081307138689, "grad_norm": 1.15625, "learning_rate": 0.0004158707242055429, "loss": 4.9105, "mean_token_accuracy": 0.20780656188726426, "num_tokens": 64708328.0, "step": 37300 }, { "entropy": 5.81953616142273, "epoch": 2.9024703365104063, "grad_norm": 1.3203125, "learning_rate": 0.00041584911193209167, "loss": 5.0425, "mean_token_accuracy": 0.20175063759088516, "num_tokens": 64717003.0, "step": 37305 }, { "entropy": 5.776060581207275, "epoch": 2.902859365882124, "grad_norm": 1.2109375, "learning_rate": 0.0004158274975214794, "loss": 4.9517, "mean_token_accuracy": 0.20912167876958848, "num_tokens": 64725951.0, "step": 37310 }, { "entropy": 5.7651773452758786, "epoch": 2.9032483952538417, "grad_norm": 1.2890625, "learning_rate": 0.00041580588097403384, "loss": 4.9776, "mean_token_accuracy": 0.20477678626775742, "num_tokens": 64733949.0, "step": 37315 }, { "entropy": 5.746300506591797, "epoch": 2.9036374246255594, "grad_norm": 1.2109375, "learning_rate": 0.00041578426229008325, "loss": 5.0333, "mean_token_accuracy": 0.2076850190758705, "num_tokens": 64742729.0, "step": 37320 }, { "entropy": 5.73888931274414, "epoch": 2.9040264539972767, "grad_norm": 1.2578125, "learning_rate": 0.00041576264146995557, "loss": 4.9713, "mean_token_accuracy": 0.20534730851650237, "num_tokens": 64751655.0, "step": 37325 }, { "entropy": 5.771604204177857, "epoch": 2.9044154833689944, "grad_norm": 1.265625, "learning_rate": 0.00041574101851397883, "loss": 4.9638, "mean_token_accuracy": 0.21404469460248948, "num_tokens": 64760019.0, "step": 37330 }, { "entropy": 5.762272357940674, "epoch": 2.904804512740712, "grad_norm": 1.3671875, "learning_rate": 0.0004157193934224811, "loss": 5.0152, "mean_token_accuracy": 0.20986078679561615, "num_tokens": 64768528.0, "step": 37335 }, { "entropy": 5.755432176589966, "epoch": 2.9051935421124293, "grad_norm": 1.296875, "learning_rate": 0.0004156977661957906, "loss": 5.007, "mean_token_accuracy": 0.2018607437610626, "num_tokens": 64776903.0, "step": 37340 }, { "entropy": 5.789122295379639, "epoch": 2.905582571484147, "grad_norm": 1.234375, "learning_rate": 0.0004156761368342355, "loss": 5.1067, "mean_token_accuracy": 0.19494329988956452, "num_tokens": 64785361.0, "step": 37345 }, { "entropy": 5.8015913486480715, "epoch": 2.9059716008558647, "grad_norm": 1.234375, "learning_rate": 0.00041565450533814384, "loss": 5.0316, "mean_token_accuracy": 0.20434350073337554, "num_tokens": 64793720.0, "step": 37350 }, { "entropy": 5.7376831531524655, "epoch": 2.9063606302275824, "grad_norm": 1.1640625, "learning_rate": 0.00041563287170784396, "loss": 4.9121, "mean_token_accuracy": 0.2160615637898445, "num_tokens": 64802049.0, "step": 37355 }, { "entropy": 5.759674072265625, "epoch": 2.9067496595992997, "grad_norm": 1.1953125, "learning_rate": 0.0004156112359436641, "loss": 4.9684, "mean_token_accuracy": 0.20235340893268586, "num_tokens": 64810754.0, "step": 37360 }, { "entropy": 5.794281625747681, "epoch": 2.9071386889710173, "grad_norm": 1.296875, "learning_rate": 0.00041558959804593255, "loss": 5.0466, "mean_token_accuracy": 0.19940511137247086, "num_tokens": 64819466.0, "step": 37365 }, { "entropy": 5.757207202911377, "epoch": 2.9075277183427346, "grad_norm": 1.421875, "learning_rate": 0.00041556795801497766, "loss": 5.0226, "mean_token_accuracy": 0.20215655416250228, "num_tokens": 64828135.0, "step": 37370 }, { "entropy": 5.799509429931641, "epoch": 2.9079167477144523, "grad_norm": 1.2890625, "learning_rate": 0.0004155463158511277, "loss": 5.0645, "mean_token_accuracy": 0.200879330933094, "num_tokens": 64836542.0, "step": 37375 }, { "entropy": 5.749717473983765, "epoch": 2.90830577708617, "grad_norm": 1.203125, "learning_rate": 0.00041552467155471105, "loss": 4.9159, "mean_token_accuracy": 0.2121904119849205, "num_tokens": 64844470.0, "step": 37380 }, { "entropy": 5.747092056274414, "epoch": 2.9086948064578877, "grad_norm": 1.3046875, "learning_rate": 0.0004155030251260563, "loss": 4.978, "mean_token_accuracy": 0.20274199694395065, "num_tokens": 64854011.0, "step": 37385 }, { "entropy": 5.813292837142944, "epoch": 2.9090838358296054, "grad_norm": 1.25, "learning_rate": 0.00041548137656549167, "loss": 5.0185, "mean_token_accuracy": 0.20655735731124877, "num_tokens": 64862349.0, "step": 37390 }, { "entropy": 5.787539672851563, "epoch": 2.9094728652013226, "grad_norm": 1.3671875, "learning_rate": 0.0004154597258733457, "loss": 4.9793, "mean_token_accuracy": 0.2061278387904167, "num_tokens": 64870634.0, "step": 37395 }, { "entropy": 5.8099664688110355, "epoch": 2.9098618945730403, "grad_norm": 1.21875, "learning_rate": 0.0004154380730499472, "loss": 5.0338, "mean_token_accuracy": 0.19961479157209397, "num_tokens": 64879870.0, "step": 37400 }, { "entropy": 5.721247720718384, "epoch": 2.9102509239447576, "grad_norm": 1.203125, "learning_rate": 0.00041541641809562425, "loss": 4.9265, "mean_token_accuracy": 0.21343268007040023, "num_tokens": 64888650.0, "step": 37405 }, { "entropy": 5.752349472045898, "epoch": 2.9106399533164753, "grad_norm": 1.265625, "learning_rate": 0.0004153947610107057, "loss": 4.9422, "mean_token_accuracy": 0.2128688022494316, "num_tokens": 64896788.0, "step": 37410 }, { "entropy": 5.7610372543334964, "epoch": 2.911028982688193, "grad_norm": 1.1875, "learning_rate": 0.00041537310179552017, "loss": 4.8908, "mean_token_accuracy": 0.2165133386850357, "num_tokens": 64905134.0, "step": 37415 }, { "entropy": 5.776584672927856, "epoch": 2.9114180120599107, "grad_norm": 1.421875, "learning_rate": 0.0004153514404503962, "loss": 5.0336, "mean_token_accuracy": 0.2003389298915863, "num_tokens": 64913662.0, "step": 37420 }, { "entropy": 5.741572427749634, "epoch": 2.911807041431628, "grad_norm": 1.265625, "learning_rate": 0.0004153297769756625, "loss": 4.9524, "mean_token_accuracy": 0.20891817510128022, "num_tokens": 64922159.0, "step": 37425 }, { "entropy": 5.72127513885498, "epoch": 2.9121960708033456, "grad_norm": 1.25, "learning_rate": 0.0004153081113716478, "loss": 4.9232, "mean_token_accuracy": 0.21563003361225128, "num_tokens": 64930672.0, "step": 37430 }, { "entropy": 5.702734708786011, "epoch": 2.9125851001750633, "grad_norm": 1.25, "learning_rate": 0.00041528644363868087, "loss": 4.9741, "mean_token_accuracy": 0.20280589759349824, "num_tokens": 64940424.0, "step": 37435 }, { "entropy": 5.810871934890747, "epoch": 2.9129741295467806, "grad_norm": 1.2109375, "learning_rate": 0.0004152647737770904, "loss": 5.1033, "mean_token_accuracy": 0.19508132040500642, "num_tokens": 64949510.0, "step": 37440 }, { "entropy": 5.701740837097168, "epoch": 2.9133631589184983, "grad_norm": 1.296875, "learning_rate": 0.0004152431017872053, "loss": 4.9348, "mean_token_accuracy": 0.2149527668952942, "num_tokens": 64958240.0, "step": 37445 }, { "entropy": 5.705958032608033, "epoch": 2.913752188290216, "grad_norm": 1.15625, "learning_rate": 0.00041522142766935426, "loss": 4.9224, "mean_token_accuracy": 0.20987751185894013, "num_tokens": 64967071.0, "step": 37450 }, { "entropy": 5.627030849456787, "epoch": 2.9141412176619337, "grad_norm": 1.375, "learning_rate": 0.00041519975142386627, "loss": 4.9525, "mean_token_accuracy": 0.21440489143133162, "num_tokens": 64974949.0, "step": 37455 }, { "entropy": 5.800826740264893, "epoch": 2.914530247033651, "grad_norm": 1.125, "learning_rate": 0.0004151780730510702, "loss": 5.0098, "mean_token_accuracy": 0.19664003551006318, "num_tokens": 64983510.0, "step": 37460 }, { "entropy": 5.887826919555664, "epoch": 2.9149192764053686, "grad_norm": 1.1875, "learning_rate": 0.00041515639255129504, "loss": 5.1147, "mean_token_accuracy": 0.20312183499336242, "num_tokens": 64993055.0, "step": 37465 }, { "entropy": 5.778463315963745, "epoch": 2.9153083057770863, "grad_norm": 1.125, "learning_rate": 0.0004151347099248697, "loss": 4.9705, "mean_token_accuracy": 0.2078256279230118, "num_tokens": 65002406.0, "step": 37470 }, { "entropy": 5.713620615005493, "epoch": 2.9156973351488036, "grad_norm": 1.2578125, "learning_rate": 0.0004151130251721231, "loss": 5.0744, "mean_token_accuracy": 0.19653598815202714, "num_tokens": 65011949.0, "step": 37475 }, { "entropy": 5.870202207565308, "epoch": 2.9160863645205213, "grad_norm": 1.2734375, "learning_rate": 0.00041509133829338454, "loss": 5.1096, "mean_token_accuracy": 0.19865050613880159, "num_tokens": 65020215.0, "step": 37480 }, { "entropy": 5.7406596660614015, "epoch": 2.916475393892239, "grad_norm": 1.265625, "learning_rate": 0.0004150696492889827, "loss": 4.9441, "mean_token_accuracy": 0.21415287405252456, "num_tokens": 65028423.0, "step": 37485 }, { "entropy": 5.660110139846802, "epoch": 2.9168644232639567, "grad_norm": 1.2578125, "learning_rate": 0.00041504795815924697, "loss": 4.9216, "mean_token_accuracy": 0.20843488872051238, "num_tokens": 65037804.0, "step": 37490 }, { "entropy": 5.709914112091065, "epoch": 2.917253452635674, "grad_norm": 1.3046875, "learning_rate": 0.00041502626490450635, "loss": 4.9084, "mean_token_accuracy": 0.21141354590654374, "num_tokens": 65046389.0, "step": 37495 }, { "entropy": 5.701830768585205, "epoch": 2.9176424820073916, "grad_norm": 1.21875, "learning_rate": 0.0004150045695250901, "loss": 4.9544, "mean_token_accuracy": 0.20781700909137726, "num_tokens": 65055499.0, "step": 37500 }, { "entropy": 5.67921290397644, "epoch": 2.918031511379109, "grad_norm": 1.375, "learning_rate": 0.0004149828720213272, "loss": 4.9166, "mean_token_accuracy": 0.21458982825279235, "num_tokens": 65063170.0, "step": 37505 }, { "entropy": 5.734742259979248, "epoch": 2.9184205407508266, "grad_norm": 1.234375, "learning_rate": 0.0004149611723935472, "loss": 5.0149, "mean_token_accuracy": 0.2095315635204315, "num_tokens": 65071046.0, "step": 37510 }, { "entropy": 5.6707275390625, "epoch": 2.9188095701225443, "grad_norm": 1.21875, "learning_rate": 0.0004149394706420791, "loss": 4.9864, "mean_token_accuracy": 0.20769216269254684, "num_tokens": 65079135.0, "step": 37515 }, { "entropy": 5.7502891540527346, "epoch": 2.919198599494262, "grad_norm": 1.1328125, "learning_rate": 0.00041491776676725223, "loss": 5.0029, "mean_token_accuracy": 0.2007015347480774, "num_tokens": 65087861.0, "step": 37520 }, { "entropy": 5.736173295974732, "epoch": 2.9195876288659792, "grad_norm": 1.1875, "learning_rate": 0.0004148960607693961, "loss": 4.9341, "mean_token_accuracy": 0.20452440530061722, "num_tokens": 65096561.0, "step": 37525 }, { "entropy": 5.773323202133179, "epoch": 2.919976658237697, "grad_norm": 1.4296875, "learning_rate": 0.00041487435264883974, "loss": 4.9824, "mean_token_accuracy": 0.21151029020547868, "num_tokens": 65105383.0, "step": 37530 }, { "entropy": 5.752702093124389, "epoch": 2.9203656876094146, "grad_norm": 1.28125, "learning_rate": 0.0004148526424059128, "loss": 4.9467, "mean_token_accuracy": 0.2047349363565445, "num_tokens": 65113551.0, "step": 37535 }, { "entropy": 5.651388835906983, "epoch": 2.920754716981132, "grad_norm": 1.2578125, "learning_rate": 0.0004148309300409446, "loss": 4.8962, "mean_token_accuracy": 0.2181252583861351, "num_tokens": 65121599.0, "step": 37540 }, { "entropy": 5.738255310058594, "epoch": 2.9211437463528496, "grad_norm": 1.2578125, "learning_rate": 0.0004148092155542646, "loss": 5.0522, "mean_token_accuracy": 0.20048130303621292, "num_tokens": 65130881.0, "step": 37545 }, { "entropy": 5.691414546966553, "epoch": 2.9215327757245673, "grad_norm": 1.234375, "learning_rate": 0.0004147874989462023, "loss": 5.0097, "mean_token_accuracy": 0.20857989639043809, "num_tokens": 65139233.0, "step": 37550 }, { "entropy": 5.695426654815674, "epoch": 2.921921805096285, "grad_norm": 1.2109375, "learning_rate": 0.0004147657802170871, "loss": 4.944, "mean_token_accuracy": 0.20147374868392945, "num_tokens": 65147738.0, "step": 37555 }, { "entropy": 5.752313232421875, "epoch": 2.922310834468002, "grad_norm": 1.3046875, "learning_rate": 0.00041474405936724873, "loss": 4.9504, "mean_token_accuracy": 0.2050420418381691, "num_tokens": 65156413.0, "step": 37560 }, { "entropy": 5.7818676948547365, "epoch": 2.92269986383972, "grad_norm": 1.3203125, "learning_rate": 0.0004147223363970166, "loss": 4.9799, "mean_token_accuracy": 0.20868291854858398, "num_tokens": 65164614.0, "step": 37565 }, { "entropy": 5.751430511474609, "epoch": 2.9230888932114376, "grad_norm": 1.359375, "learning_rate": 0.0004147006113067205, "loss": 5.0163, "mean_token_accuracy": 0.19809481203556062, "num_tokens": 65173159.0, "step": 37570 }, { "entropy": 5.687871980667114, "epoch": 2.923477922583155, "grad_norm": 1.1875, "learning_rate": 0.0004146788840966901, "loss": 4.9699, "mean_token_accuracy": 0.2053818941116333, "num_tokens": 65181999.0, "step": 37575 }, { "entropy": 5.794328403472901, "epoch": 2.9238669519548726, "grad_norm": 1.1640625, "learning_rate": 0.0004146571547672548, "loss": 5.1403, "mean_token_accuracy": 0.18849178552627563, "num_tokens": 65191291.0, "step": 37580 }, { "entropy": 5.769292783737183, "epoch": 2.9242559813265903, "grad_norm": 1.2890625, "learning_rate": 0.00041463542331874443, "loss": 4.9002, "mean_token_accuracy": 0.21497397273778915, "num_tokens": 65198891.0, "step": 37585 }, { "entropy": 5.745851755142212, "epoch": 2.924645010698308, "grad_norm": 1.2890625, "learning_rate": 0.00041461368975148876, "loss": 4.9795, "mean_token_accuracy": 0.21348620355129241, "num_tokens": 65208206.0, "step": 37590 }, { "entropy": 5.688185024261474, "epoch": 2.925034040070025, "grad_norm": 1.3046875, "learning_rate": 0.00041459195406581763, "loss": 4.9444, "mean_token_accuracy": 0.20499975532293319, "num_tokens": 65216384.0, "step": 37595 }, { "entropy": 5.699749755859375, "epoch": 2.925423069441743, "grad_norm": 1.3125, "learning_rate": 0.0004145702162620608, "loss": 4.9144, "mean_token_accuracy": 0.20589146614074708, "num_tokens": 65224612.0, "step": 37600 }, { "entropy": 5.796917343139649, "epoch": 2.92581209881346, "grad_norm": 1.265625, "learning_rate": 0.00041454847634054805, "loss": 4.9772, "mean_token_accuracy": 0.21281952261924744, "num_tokens": 65233389.0, "step": 37605 }, { "entropy": 5.796150875091553, "epoch": 2.926201128185178, "grad_norm": 1.28125, "learning_rate": 0.00041452673430160923, "loss": 5.028, "mean_token_accuracy": 0.20918525457382203, "num_tokens": 65242432.0, "step": 37610 }, { "entropy": 5.699021339416504, "epoch": 2.9265901575568956, "grad_norm": 1.2265625, "learning_rate": 0.0004145049901455744, "loss": 4.8738, "mean_token_accuracy": 0.20679446756839753, "num_tokens": 65250161.0, "step": 37615 }, { "entropy": 5.713855314254761, "epoch": 2.9269791869286133, "grad_norm": 1.203125, "learning_rate": 0.00041448324387277337, "loss": 5.0168, "mean_token_accuracy": 0.2069329485297203, "num_tokens": 65258660.0, "step": 37620 }, { "entropy": 5.796969985961914, "epoch": 2.927368216300331, "grad_norm": 1.25, "learning_rate": 0.00041446149548353606, "loss": 4.9874, "mean_token_accuracy": 0.20225211679935456, "num_tokens": 65267297.0, "step": 37625 }, { "entropy": 5.8069665908813475, "epoch": 2.927757245672048, "grad_norm": 1.140625, "learning_rate": 0.0004144397449781926, "loss": 5.048, "mean_token_accuracy": 0.20270067155361177, "num_tokens": 65276064.0, "step": 37630 }, { "entropy": 5.788924312591552, "epoch": 2.928146275043766, "grad_norm": 1.15625, "learning_rate": 0.0004144179923570729, "loss": 5.0082, "mean_token_accuracy": 0.2075548753142357, "num_tokens": 65284624.0, "step": 37635 }, { "entropy": 5.727807664871216, "epoch": 2.928535304415483, "grad_norm": 1.265625, "learning_rate": 0.0004143962376205071, "loss": 4.9575, "mean_token_accuracy": 0.20864027738571167, "num_tokens": 65293318.0, "step": 37640 }, { "entropy": 5.8197629928588865, "epoch": 2.928924333787201, "grad_norm": 1.3515625, "learning_rate": 0.00041437448076882526, "loss": 5.0692, "mean_token_accuracy": 0.2047643706202507, "num_tokens": 65301379.0, "step": 37645 }, { "entropy": 5.813063764572144, "epoch": 2.9293133631589185, "grad_norm": 1.3828125, "learning_rate": 0.00041435272180235757, "loss": 5.0607, "mean_token_accuracy": 0.203058685362339, "num_tokens": 65309722.0, "step": 37650 }, { "entropy": 5.745377016067505, "epoch": 2.9297023925306362, "grad_norm": 1.2578125, "learning_rate": 0.000414330960721434, "loss": 4.9705, "mean_token_accuracy": 0.20898045599460602, "num_tokens": 65318616.0, "step": 37655 }, { "entropy": 5.75239520072937, "epoch": 2.9300914219023535, "grad_norm": 1.28125, "learning_rate": 0.00041430919752638497, "loss": 4.9666, "mean_token_accuracy": 0.20529853850603103, "num_tokens": 65327046.0, "step": 37660 }, { "entropy": 5.725339365005493, "epoch": 2.930480451274071, "grad_norm": 1.2578125, "learning_rate": 0.0004142874322175406, "loss": 4.9786, "mean_token_accuracy": 0.2050676852464676, "num_tokens": 65335032.0, "step": 37665 }, { "entropy": 5.747194528579712, "epoch": 2.930869480645789, "grad_norm": 1.21875, "learning_rate": 0.00041426566479523116, "loss": 5.022, "mean_token_accuracy": 0.20196359604597092, "num_tokens": 65343573.0, "step": 37670 }, { "entropy": 5.718199586868286, "epoch": 2.931258510017506, "grad_norm": 1.234375, "learning_rate": 0.00041424389525978683, "loss": 4.8814, "mean_token_accuracy": 0.21422452479600906, "num_tokens": 65352660.0, "step": 37675 }, { "entropy": 5.814592504501343, "epoch": 2.931647539389224, "grad_norm": 1.2421875, "learning_rate": 0.0004142221236115381, "loss": 5.0027, "mean_token_accuracy": 0.20035820156335832, "num_tokens": 65362938.0, "step": 37680 }, { "entropy": 5.75742130279541, "epoch": 2.9320365687609415, "grad_norm": 1.234375, "learning_rate": 0.0004142003498508152, "loss": 4.9199, "mean_token_accuracy": 0.2104510173201561, "num_tokens": 65372000.0, "step": 37685 }, { "entropy": 5.709902715682984, "epoch": 2.9324255981326592, "grad_norm": 1.3203125, "learning_rate": 0.0004141785739779486, "loss": 4.9641, "mean_token_accuracy": 0.20964822471141814, "num_tokens": 65379389.0, "step": 37690 }, { "entropy": 5.734862470626831, "epoch": 2.9328146275043765, "grad_norm": 1.25, "learning_rate": 0.00041415679599326853, "loss": 4.9664, "mean_token_accuracy": 0.20195451378822327, "num_tokens": 65388335.0, "step": 37695 }, { "entropy": 5.8019438743591305, "epoch": 2.933203656876094, "grad_norm": 1.4296875, "learning_rate": 0.00041413501589710567, "loss": 5.067, "mean_token_accuracy": 0.20307424664497375, "num_tokens": 65397280.0, "step": 37700 }, { "entropy": 5.83956356048584, "epoch": 2.9335926862478114, "grad_norm": 1.2734375, "learning_rate": 0.0004141132336897904, "loss": 5.1063, "mean_token_accuracy": 0.20013536810874938, "num_tokens": 65406600.0, "step": 37705 }, { "entropy": 5.771357011795044, "epoch": 2.933981715619529, "grad_norm": 1.203125, "learning_rate": 0.0004140914493716533, "loss": 4.9566, "mean_token_accuracy": 0.20643048286437987, "num_tokens": 65415642.0, "step": 37710 }, { "entropy": 5.784037017822266, "epoch": 2.934370744991247, "grad_norm": 1.2734375, "learning_rate": 0.0004140696629430248, "loss": 4.9622, "mean_token_accuracy": 0.20757574886083602, "num_tokens": 65423977.0, "step": 37715 }, { "entropy": 5.696164751052857, "epoch": 2.9347597743629645, "grad_norm": 1.28125, "learning_rate": 0.00041404787440423534, "loss": 4.9784, "mean_token_accuracy": 0.21088082790374757, "num_tokens": 65432567.0, "step": 37720 }, { "entropy": 5.744975566864014, "epoch": 2.9351488037346822, "grad_norm": 1.328125, "learning_rate": 0.00041402608375561595, "loss": 5.001, "mean_token_accuracy": 0.203597030043602, "num_tokens": 65441341.0, "step": 37725 }, { "entropy": 5.711670970916748, "epoch": 2.9355378331063995, "grad_norm": 1.21875, "learning_rate": 0.00041400429099749687, "loss": 4.9009, "mean_token_accuracy": 0.2196897640824318, "num_tokens": 65449612.0, "step": 37730 }, { "entropy": 5.727819156646729, "epoch": 2.935926862478117, "grad_norm": 1.296875, "learning_rate": 0.000413982496130209, "loss": 4.9743, "mean_token_accuracy": 0.20201717615127562, "num_tokens": 65457216.0, "step": 37735 }, { "entropy": 5.664936590194702, "epoch": 2.9363158918498344, "grad_norm": 1.234375, "learning_rate": 0.00041396069915408294, "loss": 4.9162, "mean_token_accuracy": 0.20421230494976045, "num_tokens": 65465420.0, "step": 37740 }, { "entropy": 5.8038373470306395, "epoch": 2.936704921221552, "grad_norm": 1.234375, "learning_rate": 0.00041393890006944945, "loss": 5.0049, "mean_token_accuracy": 0.2011886790394783, "num_tokens": 65474608.0, "step": 37745 }, { "entropy": 5.792764616012573, "epoch": 2.93709395059327, "grad_norm": 1.1640625, "learning_rate": 0.0004139170988766393, "loss": 4.9298, "mean_token_accuracy": 0.20781737118959426, "num_tokens": 65483204.0, "step": 37750 }, { "entropy": 5.713615798950196, "epoch": 2.9374829799649875, "grad_norm": 1.359375, "learning_rate": 0.0004138952955759833, "loss": 4.9126, "mean_token_accuracy": 0.21264531314373017, "num_tokens": 65491472.0, "step": 37755 }, { "entropy": 5.804582500457764, "epoch": 2.937872009336705, "grad_norm": 1.1875, "learning_rate": 0.00041387349016781225, "loss": 5.0104, "mean_token_accuracy": 0.20268561244010924, "num_tokens": 65500018.0, "step": 37760 }, { "entropy": 5.783713054656983, "epoch": 2.9382610387084225, "grad_norm": 1.2265625, "learning_rate": 0.000413851682652457, "loss": 5.0595, "mean_token_accuracy": 0.2064467713236809, "num_tokens": 65508845.0, "step": 37765 }, { "entropy": 5.765109825134277, "epoch": 2.93865006808014, "grad_norm": 1.1875, "learning_rate": 0.0004138298730302485, "loss": 4.9715, "mean_token_accuracy": 0.21520241796970369, "num_tokens": 65517696.0, "step": 37770 }, { "entropy": 5.707575368881225, "epoch": 2.9390390974518574, "grad_norm": 1.1484375, "learning_rate": 0.0004138080613015176, "loss": 4.941, "mean_token_accuracy": 0.21059974581003188, "num_tokens": 65526563.0, "step": 37775 }, { "entropy": 5.774668645858765, "epoch": 2.939428126823575, "grad_norm": 1.234375, "learning_rate": 0.00041378624746659536, "loss": 5.0121, "mean_token_accuracy": 0.19954154044389724, "num_tokens": 65535719.0, "step": 37780 }, { "entropy": 5.782282304763794, "epoch": 2.939817156195293, "grad_norm": 1.28125, "learning_rate": 0.00041376443152581265, "loss": 5.0566, "mean_token_accuracy": 0.19683657586574554, "num_tokens": 65543823.0, "step": 37785 }, { "entropy": 5.730276012420655, "epoch": 2.9402061855670105, "grad_norm": 1.34375, "learning_rate": 0.00041374261347950064, "loss": 4.9401, "mean_token_accuracy": 0.2140075996518135, "num_tokens": 65551923.0, "step": 37790 }, { "entropy": 5.762484407424926, "epoch": 2.9405952149387278, "grad_norm": 1.34375, "learning_rate": 0.0004137207933279903, "loss": 4.9509, "mean_token_accuracy": 0.20958236157894133, "num_tokens": 65560552.0, "step": 37795 }, { "entropy": 5.7562376976013185, "epoch": 2.9409842443104455, "grad_norm": 1.1640625, "learning_rate": 0.00041369897107161266, "loss": 4.9816, "mean_token_accuracy": 0.20719575881958008, "num_tokens": 65568897.0, "step": 37800 }, { "entropy": 5.740273904800415, "epoch": 2.941373273682163, "grad_norm": 1.1640625, "learning_rate": 0.00041367714671069897, "loss": 5.0076, "mean_token_accuracy": 0.200942961871624, "num_tokens": 65577611.0, "step": 37805 }, { "entropy": 5.773490238189697, "epoch": 2.9417623030538804, "grad_norm": 1.328125, "learning_rate": 0.00041365532024558024, "loss": 4.9713, "mean_token_accuracy": 0.2030098706483841, "num_tokens": 65586284.0, "step": 37810 }, { "entropy": 5.795898342132569, "epoch": 2.942151332425598, "grad_norm": 1.2421875, "learning_rate": 0.0004136334916765877, "loss": 5.0145, "mean_token_accuracy": 0.20898668318986893, "num_tokens": 65595065.0, "step": 37815 }, { "entropy": 5.809255838394165, "epoch": 2.942540361797316, "grad_norm": 1.234375, "learning_rate": 0.00041361166100405264, "loss": 5.0399, "mean_token_accuracy": 0.2080740213394165, "num_tokens": 65604478.0, "step": 37820 }, { "entropy": 5.745774650573731, "epoch": 2.9429293911690335, "grad_norm": 1.28125, "learning_rate": 0.0004135898282283062, "loss": 5.0202, "mean_token_accuracy": 0.2019073024392128, "num_tokens": 65613473.0, "step": 37825 }, { "entropy": 5.739771842956543, "epoch": 2.9433184205407508, "grad_norm": 1.234375, "learning_rate": 0.0004135679933496797, "loss": 4.9564, "mean_token_accuracy": 0.2036217302083969, "num_tokens": 65622498.0, "step": 37830 }, { "entropy": 5.75765290260315, "epoch": 2.9437074499124685, "grad_norm": 1.2421875, "learning_rate": 0.0004135461563685045, "loss": 5.0483, "mean_token_accuracy": 0.2016582891345024, "num_tokens": 65630939.0, "step": 37835 }, { "entropy": 5.777035903930664, "epoch": 2.9440964792841857, "grad_norm": 1.25, "learning_rate": 0.00041352431728511194, "loss": 4.9746, "mean_token_accuracy": 0.2026813507080078, "num_tokens": 65639667.0, "step": 37840 }, { "entropy": 5.845441627502441, "epoch": 2.9444855086559034, "grad_norm": 1.234375, "learning_rate": 0.0004135024760998333, "loss": 4.9905, "mean_token_accuracy": 0.21049226075410843, "num_tokens": 65648413.0, "step": 37845 }, { "entropy": 5.813674831390381, "epoch": 2.944874538027621, "grad_norm": 1.1796875, "learning_rate": 0.00041348063281299995, "loss": 5.0696, "mean_token_accuracy": 0.20323795676231385, "num_tokens": 65657486.0, "step": 37850 }, { "entropy": 5.737605142593384, "epoch": 2.945263567399339, "grad_norm": 1.2734375, "learning_rate": 0.00041345878742494346, "loss": 4.9375, "mean_token_accuracy": 0.20814092606306075, "num_tokens": 65666328.0, "step": 37855 }, { "entropy": 5.764212226867675, "epoch": 2.945652596771056, "grad_norm": 1.328125, "learning_rate": 0.00041343693993599535, "loss": 4.9739, "mean_token_accuracy": 0.20032371282577516, "num_tokens": 65674107.0, "step": 37860 }, { "entropy": 5.715426301956176, "epoch": 2.9460416261427738, "grad_norm": 1.2265625, "learning_rate": 0.0004134150903464869, "loss": 4.9015, "mean_token_accuracy": 0.21155603975057602, "num_tokens": 65682534.0, "step": 37865 }, { "entropy": 5.811847352981568, "epoch": 2.9464306555144915, "grad_norm": 1.359375, "learning_rate": 0.0004133932386567498, "loss": 5.1074, "mean_token_accuracy": 0.19556065797805786, "num_tokens": 65690781.0, "step": 37870 }, { "entropy": 5.790788316726685, "epoch": 2.9468196848862087, "grad_norm": 1.3359375, "learning_rate": 0.0004133713848671156, "loss": 4.9411, "mean_token_accuracy": 0.207320699095726, "num_tokens": 65698668.0, "step": 37875 }, { "entropy": 5.798008012771606, "epoch": 2.9472087142579264, "grad_norm": 1.28125, "learning_rate": 0.0004133495289779159, "loss": 4.9507, "mean_token_accuracy": 0.2105231836438179, "num_tokens": 65706568.0, "step": 37880 }, { "entropy": 5.734035682678223, "epoch": 2.947597743629644, "grad_norm": 1.3671875, "learning_rate": 0.0004133276709894823, "loss": 4.9768, "mean_token_accuracy": 0.2027322009205818, "num_tokens": 65714652.0, "step": 37885 }, { "entropy": 5.70875391960144, "epoch": 2.947986773001362, "grad_norm": 1.2734375, "learning_rate": 0.0004133058109021464, "loss": 4.9629, "mean_token_accuracy": 0.21521057039499283, "num_tokens": 65723296.0, "step": 37890 }, { "entropy": 5.799539422988891, "epoch": 2.948375802373079, "grad_norm": 1.234375, "learning_rate": 0.00041328394871624003, "loss": 5.0514, "mean_token_accuracy": 0.20028723776340485, "num_tokens": 65732257.0, "step": 37895 }, { "entropy": 5.802027893066406, "epoch": 2.9487648317447968, "grad_norm": 1.2421875, "learning_rate": 0.0004132620844320948, "loss": 4.9421, "mean_token_accuracy": 0.20836520791053773, "num_tokens": 65740152.0, "step": 37900 }, { "entropy": 5.757240056991577, "epoch": 2.9491538611165145, "grad_norm": 1.3828125, "learning_rate": 0.0004132402180500425, "loss": 4.9771, "mean_token_accuracy": 0.20177962481975556, "num_tokens": 65748927.0, "step": 37905 }, { "entropy": 5.77411847114563, "epoch": 2.9495428904882317, "grad_norm": 1.2578125, "learning_rate": 0.0004132183495704149, "loss": 4.9945, "mean_token_accuracy": 0.20324135571718216, "num_tokens": 65756949.0, "step": 37910 }, { "entropy": 5.8519364356994625, "epoch": 2.9499319198599494, "grad_norm": 1.3671875, "learning_rate": 0.0004131964789935439, "loss": 5.0992, "mean_token_accuracy": 0.20127261877059938, "num_tokens": 65765076.0, "step": 37915 }, { "entropy": 5.7423358917236325, "epoch": 2.950320949231667, "grad_norm": 1.3125, "learning_rate": 0.0004131746063197612, "loss": 4.9742, "mean_token_accuracy": 0.21165919154882432, "num_tokens": 65773581.0, "step": 37920 }, { "entropy": 5.840869951248169, "epoch": 2.950709978603385, "grad_norm": 1.21875, "learning_rate": 0.0004131527315493989, "loss": 5.1126, "mean_token_accuracy": 0.20293343663215638, "num_tokens": 65782312.0, "step": 37925 }, { "entropy": 5.703601360321045, "epoch": 2.951099007975102, "grad_norm": 1.21875, "learning_rate": 0.00041313085468278873, "loss": 4.9747, "mean_token_accuracy": 0.21119162440299988, "num_tokens": 65790601.0, "step": 37930 }, { "entropy": 5.754172992706299, "epoch": 2.9514880373468197, "grad_norm": 1.1953125, "learning_rate": 0.0004131089757202627, "loss": 5.0028, "mean_token_accuracy": 0.2014593169093132, "num_tokens": 65799393.0, "step": 37935 }, { "entropy": 5.7897388458251955, "epoch": 2.951877066718537, "grad_norm": 1.09375, "learning_rate": 0.00041308709466215276, "loss": 4.9852, "mean_token_accuracy": 0.20614820569753647, "num_tokens": 65808871.0, "step": 37940 }, { "entropy": 5.663176012039185, "epoch": 2.9522660960902547, "grad_norm": 1.3046875, "learning_rate": 0.000413065211508791, "loss": 4.8404, "mean_token_accuracy": 0.21699223816394805, "num_tokens": 65817075.0, "step": 37945 }, { "entropy": 5.748859071731568, "epoch": 2.9526551254619724, "grad_norm": 1.3671875, "learning_rate": 0.00041304332626050937, "loss": 4.8981, "mean_token_accuracy": 0.2123044103384018, "num_tokens": 65825081.0, "step": 37950 }, { "entropy": 5.752034330368042, "epoch": 2.95304415483369, "grad_norm": 1.28125, "learning_rate": 0.00041302143891764, "loss": 5.0041, "mean_token_accuracy": 0.20449774712324142, "num_tokens": 65833183.0, "step": 37955 }, { "entropy": 5.75448842048645, "epoch": 2.9534331842054073, "grad_norm": 1.21875, "learning_rate": 0.000412999549480515, "loss": 4.9067, "mean_token_accuracy": 0.20443785935640335, "num_tokens": 65841514.0, "step": 37960 }, { "entropy": 5.821069955825806, "epoch": 2.953822213577125, "grad_norm": 1.203125, "learning_rate": 0.0004129776579494665, "loss": 5.033, "mean_token_accuracy": 0.21047563701868058, "num_tokens": 65850433.0, "step": 37965 }, { "entropy": 5.836130905151367, "epoch": 2.9542112429488427, "grad_norm": 1.3125, "learning_rate": 0.0004129557643248265, "loss": 5.0017, "mean_token_accuracy": 0.20428505837917327, "num_tokens": 65859807.0, "step": 37970 }, { "entropy": 5.7947516441345215, "epoch": 2.95460027232056, "grad_norm": 1.203125, "learning_rate": 0.0004129338686069276, "loss": 4.9543, "mean_token_accuracy": 0.2140651285648346, "num_tokens": 65867901.0, "step": 37975 }, { "entropy": 5.767702960968018, "epoch": 2.9549893016922777, "grad_norm": 1.3203125, "learning_rate": 0.0004129119707961016, "loss": 5.0143, "mean_token_accuracy": 0.2063332185149193, "num_tokens": 65876660.0, "step": 37980 }, { "entropy": 5.8354236602783205, "epoch": 2.9553783310639954, "grad_norm": 1.2578125, "learning_rate": 0.000412890070892681, "loss": 5.0416, "mean_token_accuracy": 0.20342431217432022, "num_tokens": 65885258.0, "step": 37985 }, { "entropy": 5.820292282104492, "epoch": 2.955767360435713, "grad_norm": 1.2578125, "learning_rate": 0.000412868168896998, "loss": 5.067, "mean_token_accuracy": 0.19649702459573745, "num_tokens": 65894260.0, "step": 37990 }, { "entropy": 5.842988014221191, "epoch": 2.9561563898074303, "grad_norm": 1.234375, "learning_rate": 0.0004128462648093851, "loss": 5.0314, "mean_token_accuracy": 0.20259332060813903, "num_tokens": 65903000.0, "step": 37995 }, { "entropy": 5.793108367919922, "epoch": 2.956545419179148, "grad_norm": 1.25, "learning_rate": 0.0004128243586301745, "loss": 5.0155, "mean_token_accuracy": 0.208563394844532, "num_tokens": 65911550.0, "step": 38000 }, { "entropy": 5.790144300460815, "epoch": 2.9569344485508657, "grad_norm": 1.2421875, "learning_rate": 0.0004128024503596986, "loss": 4.9601, "mean_token_accuracy": 0.20818923711776732, "num_tokens": 65920091.0, "step": 38005 }, { "entropy": 5.744040155410767, "epoch": 2.957323477922583, "grad_norm": 1.21875, "learning_rate": 0.00041278053999828986, "loss": 4.9603, "mean_token_accuracy": 0.20650898665189743, "num_tokens": 65929313.0, "step": 38010 }, { "entropy": 5.778512954711914, "epoch": 2.9577125072943007, "grad_norm": 1.1875, "learning_rate": 0.0004127586275462806, "loss": 5.0428, "mean_token_accuracy": 0.19751455187797545, "num_tokens": 65938407.0, "step": 38015 }, { "entropy": 5.823088788986206, "epoch": 2.9581015366660184, "grad_norm": 1.2421875, "learning_rate": 0.00041273671300400363, "loss": 4.9666, "mean_token_accuracy": 0.20733772963285446, "num_tokens": 65946644.0, "step": 38020 }, { "entropy": 5.815338134765625, "epoch": 2.958490566037736, "grad_norm": 1.234375, "learning_rate": 0.00041271479637179116, "loss": 5.0499, "mean_token_accuracy": 0.2022552102804184, "num_tokens": 65955695.0, "step": 38025 }, { "entropy": 5.825669527053833, "epoch": 2.9588795954094533, "grad_norm": 1.3046875, "learning_rate": 0.0004126928776499759, "loss": 5.0779, "mean_token_accuracy": 0.1966489464044571, "num_tokens": 65964326.0, "step": 38030 }, { "entropy": 5.748335266113282, "epoch": 2.959268624781171, "grad_norm": 1.28125, "learning_rate": 0.0004126709568388903, "loss": 4.9107, "mean_token_accuracy": 0.21048006415367126, "num_tokens": 65972986.0, "step": 38035 }, { "entropy": 5.717255640029907, "epoch": 2.9596576541528883, "grad_norm": 1.2421875, "learning_rate": 0.0004126490339388672, "loss": 4.9537, "mean_token_accuracy": 0.21171042770147325, "num_tokens": 65980829.0, "step": 38040 }, { "entropy": 5.750496673583984, "epoch": 2.960046683524606, "grad_norm": 1.328125, "learning_rate": 0.000412627108950239, "loss": 4.9108, "mean_token_accuracy": 0.20921209305524827, "num_tokens": 65989412.0, "step": 38045 }, { "entropy": 5.718353700637818, "epoch": 2.9604357128963237, "grad_norm": 1.28125, "learning_rate": 0.0004126051818733385, "loss": 4.9845, "mean_token_accuracy": 0.21077287197113037, "num_tokens": 65998887.0, "step": 38050 }, { "entropy": 5.785447263717652, "epoch": 2.9608247422680414, "grad_norm": 1.25, "learning_rate": 0.0004125832527084984, "loss": 5.0186, "mean_token_accuracy": 0.21281858533620834, "num_tokens": 66007266.0, "step": 38055 }, { "entropy": 5.738476133346557, "epoch": 2.961213771639759, "grad_norm": 1.2265625, "learning_rate": 0.00041256132145605143, "loss": 4.954, "mean_token_accuracy": 0.21314208209514618, "num_tokens": 66015968.0, "step": 38060 }, { "entropy": 5.8020501136779785, "epoch": 2.9616028010114763, "grad_norm": 1.1875, "learning_rate": 0.0004125393881163304, "loss": 5.0366, "mean_token_accuracy": 0.20188339054584503, "num_tokens": 66025128.0, "step": 38065 }, { "entropy": 5.80204176902771, "epoch": 2.961991830383194, "grad_norm": 1.1875, "learning_rate": 0.00041251745268966797, "loss": 4.9443, "mean_token_accuracy": 0.2092763140797615, "num_tokens": 66033730.0, "step": 38070 }, { "entropy": 5.697058057785034, "epoch": 2.9623808597549113, "grad_norm": 1.2265625, "learning_rate": 0.0004124955151763971, "loss": 4.908, "mean_token_accuracy": 0.21526926904916763, "num_tokens": 66042711.0, "step": 38075 }, { "entropy": 5.7945469379425045, "epoch": 2.962769889126629, "grad_norm": 1.21875, "learning_rate": 0.0004124735755768506, "loss": 4.9732, "mean_token_accuracy": 0.2099738225340843, "num_tokens": 66051107.0, "step": 38080 }, { "entropy": 5.733452367782593, "epoch": 2.9631589184983467, "grad_norm": 1.1953125, "learning_rate": 0.0004124516338913615, "loss": 4.9776, "mean_token_accuracy": 0.21330223083496094, "num_tokens": 66059532.0, "step": 38085 }, { "entropy": 5.754212522506714, "epoch": 2.9635479478700644, "grad_norm": 1.328125, "learning_rate": 0.0004124296901202626, "loss": 4.9911, "mean_token_accuracy": 0.20257763266563417, "num_tokens": 66068034.0, "step": 38090 }, { "entropy": 5.804622030258178, "epoch": 2.9639369772417816, "grad_norm": 1.328125, "learning_rate": 0.00041240774426388685, "loss": 5.042, "mean_token_accuracy": 0.20204201340675354, "num_tokens": 66077403.0, "step": 38095 }, { "entropy": 5.824810552597046, "epoch": 2.9643260066134993, "grad_norm": 1.2734375, "learning_rate": 0.0004123857963225673, "loss": 5.0187, "mean_token_accuracy": 0.196921706199646, "num_tokens": 66085930.0, "step": 38100 }, { "entropy": 5.810792779922485, "epoch": 2.964715035985217, "grad_norm": 1.3359375, "learning_rate": 0.000412363846296637, "loss": 4.9631, "mean_token_accuracy": 0.20944179445505143, "num_tokens": 66094671.0, "step": 38105 }, { "entropy": 5.794607830047608, "epoch": 2.9651040653569343, "grad_norm": 1.2578125, "learning_rate": 0.000412341894186429, "loss": 5.0552, "mean_token_accuracy": 0.20883675515651703, "num_tokens": 66103250.0, "step": 38110 }, { "entropy": 5.747863101959228, "epoch": 2.965493094728652, "grad_norm": 1.265625, "learning_rate": 0.0004123199399922763, "loss": 5.005, "mean_token_accuracy": 0.20496079921722413, "num_tokens": 66111073.0, "step": 38115 }, { "entropy": 5.746030664443969, "epoch": 2.9658821241003697, "grad_norm": 1.1953125, "learning_rate": 0.00041229798371451203, "loss": 4.9654, "mean_token_accuracy": 0.20019131153821945, "num_tokens": 66119514.0, "step": 38120 }, { "entropy": 5.7799567699432375, "epoch": 2.9662711534720874, "grad_norm": 1.25, "learning_rate": 0.0004122760253534695, "loss": 4.9508, "mean_token_accuracy": 0.20773747563362122, "num_tokens": 66128804.0, "step": 38125 }, { "entropy": 5.75271520614624, "epoch": 2.9666601828438046, "grad_norm": 1.3046875, "learning_rate": 0.0004122540649094817, "loss": 4.9935, "mean_token_accuracy": 0.21451499462127685, "num_tokens": 66137683.0, "step": 38130 }, { "entropy": 5.7933567523956295, "epoch": 2.9670492122155223, "grad_norm": 1.234375, "learning_rate": 0.00041223210238288196, "loss": 5.0457, "mean_token_accuracy": 0.202863672375679, "num_tokens": 66147135.0, "step": 38135 }, { "entropy": 5.800182867050171, "epoch": 2.9674382415872396, "grad_norm": 1.2734375, "learning_rate": 0.0004122101377740035, "loss": 4.9397, "mean_token_accuracy": 0.20729777812957764, "num_tokens": 66155534.0, "step": 38140 }, { "entropy": 5.782564783096314, "epoch": 2.9678272709589573, "grad_norm": 1.3046875, "learning_rate": 0.0004121881710831796, "loss": 4.9303, "mean_token_accuracy": 0.20787032842636108, "num_tokens": 66164413.0, "step": 38145 }, { "entropy": 5.7507884979248045, "epoch": 2.968216300330675, "grad_norm": 1.390625, "learning_rate": 0.0004121662023107435, "loss": 4.9956, "mean_token_accuracy": 0.20695457905530928, "num_tokens": 66173469.0, "step": 38150 }, { "entropy": 5.7189641952514645, "epoch": 2.9686053297023927, "grad_norm": 1.25, "learning_rate": 0.0004121442314570286, "loss": 4.9412, "mean_token_accuracy": 0.2019356369972229, "num_tokens": 66182183.0, "step": 38155 }, { "entropy": 5.7773669242858885, "epoch": 2.9689943590741104, "grad_norm": 1.2890625, "learning_rate": 0.00041212225852236834, "loss": 4.9562, "mean_token_accuracy": 0.20812522768974304, "num_tokens": 66190647.0, "step": 38160 }, { "entropy": 5.670827865600586, "epoch": 2.9693833884458276, "grad_norm": 1.234375, "learning_rate": 0.0004121002835070961, "loss": 4.8494, "mean_token_accuracy": 0.21058697998523712, "num_tokens": 66198536.0, "step": 38165 }, { "entropy": 5.815021514892578, "epoch": 2.9697724178175453, "grad_norm": 1.2578125, "learning_rate": 0.0004120783064115452, "loss": 5.1383, "mean_token_accuracy": 0.19959525465965272, "num_tokens": 66207772.0, "step": 38170 }, { "entropy": 5.794196224212646, "epoch": 2.9701614471892626, "grad_norm": 1.2265625, "learning_rate": 0.0004120563272360492, "loss": 5.0449, "mean_token_accuracy": 0.1993275210261345, "num_tokens": 66216862.0, "step": 38175 }, { "entropy": 5.8045793056488035, "epoch": 2.9705504765609803, "grad_norm": 1.25, "learning_rate": 0.0004120343459809416, "loss": 5.0025, "mean_token_accuracy": 0.210247902572155, "num_tokens": 66225817.0, "step": 38180 }, { "entropy": 5.81646499633789, "epoch": 2.970939505932698, "grad_norm": 1.25, "learning_rate": 0.0004120123626465559, "loss": 5.0348, "mean_token_accuracy": 0.20089541077613832, "num_tokens": 66234894.0, "step": 38185 }, { "entropy": 5.759159946441651, "epoch": 2.9713285353044157, "grad_norm": 1.2109375, "learning_rate": 0.00041199037723322566, "loss": 4.9324, "mean_token_accuracy": 0.21202120929956436, "num_tokens": 66243800.0, "step": 38190 }, { "entropy": 5.757540845870972, "epoch": 2.971717564676133, "grad_norm": 1.21875, "learning_rate": 0.00041196838974128446, "loss": 4.9205, "mean_token_accuracy": 0.21001481413841247, "num_tokens": 66253192.0, "step": 38195 }, { "entropy": 5.719257450103759, "epoch": 2.9721065940478506, "grad_norm": 1.21875, "learning_rate": 0.000411946400171066, "loss": 4.9448, "mean_token_accuracy": 0.20950360000133514, "num_tokens": 66261775.0, "step": 38200 }, { "entropy": 5.722047424316406, "epoch": 2.9724956234195683, "grad_norm": 1.1484375, "learning_rate": 0.00041192440852290385, "loss": 4.9795, "mean_token_accuracy": 0.206636843085289, "num_tokens": 66271069.0, "step": 38205 }, { "entropy": 5.856357717514038, "epoch": 2.9728846527912856, "grad_norm": 1.2890625, "learning_rate": 0.0004119024147971318, "loss": 5.1124, "mean_token_accuracy": 0.19803936630487443, "num_tokens": 66280021.0, "step": 38210 }, { "entropy": 5.784947681427002, "epoch": 2.9732736821630033, "grad_norm": 1.1640625, "learning_rate": 0.00041188041899408345, "loss": 4.9576, "mean_token_accuracy": 0.20830326825380324, "num_tokens": 66288782.0, "step": 38215 }, { "entropy": 5.783417463302612, "epoch": 2.973662711534721, "grad_norm": 1.3359375, "learning_rate": 0.0004118584211140926, "loss": 5.0172, "mean_token_accuracy": 0.2013116016983986, "num_tokens": 66297716.0, "step": 38220 }, { "entropy": 5.854040813446045, "epoch": 2.9740517409064386, "grad_norm": 1.3203125, "learning_rate": 0.00041183642115749316, "loss": 5.0278, "mean_token_accuracy": 0.2019554704427719, "num_tokens": 66305977.0, "step": 38225 }, { "entropy": 5.789250326156616, "epoch": 2.974440770278156, "grad_norm": 1.359375, "learning_rate": 0.00041181441912461873, "loss": 5.0598, "mean_token_accuracy": 0.2084977388381958, "num_tokens": 66314344.0, "step": 38230 }, { "entropy": 5.683394289016723, "epoch": 2.9748297996498736, "grad_norm": 1.3203125, "learning_rate": 0.0004117924150158032, "loss": 4.9605, "mean_token_accuracy": 0.20595215409994125, "num_tokens": 66322776.0, "step": 38235 }, { "entropy": 5.760108709335327, "epoch": 2.9752188290215913, "grad_norm": 1.2734375, "learning_rate": 0.00041177040883138064, "loss": 5.0421, "mean_token_accuracy": 0.2109207406640053, "num_tokens": 66331161.0, "step": 38240 }, { "entropy": 5.77467827796936, "epoch": 2.9756078583933085, "grad_norm": 1.2890625, "learning_rate": 0.00041174840057168474, "loss": 5.0025, "mean_token_accuracy": 0.2074162557721138, "num_tokens": 66339579.0, "step": 38245 }, { "entropy": 5.6571373462677, "epoch": 2.9759968877650262, "grad_norm": 1.265625, "learning_rate": 0.0004117263902370495, "loss": 4.8847, "mean_token_accuracy": 0.2114987388253212, "num_tokens": 66348716.0, "step": 38250 }, { "entropy": 5.763072967529297, "epoch": 2.976385917136744, "grad_norm": 1.3671875, "learning_rate": 0.00041170437782780896, "loss": 4.9745, "mean_token_accuracy": 0.20292848646640776, "num_tokens": 66357546.0, "step": 38255 }, { "entropy": 5.733668279647827, "epoch": 2.9767749465084616, "grad_norm": 1.3203125, "learning_rate": 0.000411682363344297, "loss": 4.8751, "mean_token_accuracy": 0.21760851442813872, "num_tokens": 66366024.0, "step": 38260 }, { "entropy": 5.76446681022644, "epoch": 2.977163975880179, "grad_norm": 1.2265625, "learning_rate": 0.00041166034678684777, "loss": 4.9505, "mean_token_accuracy": 0.2088910922408104, "num_tokens": 66374413.0, "step": 38265 }, { "entropy": 5.777624082565308, "epoch": 2.9775530052518966, "grad_norm": 1.2578125, "learning_rate": 0.0004116383281557953, "loss": 5.0233, "mean_token_accuracy": 0.20129968076944352, "num_tokens": 66383131.0, "step": 38270 }, { "entropy": 5.754647254943848, "epoch": 2.977942034623614, "grad_norm": 1.1875, "learning_rate": 0.00041161630745147374, "loss": 5.0707, "mean_token_accuracy": 0.1927156403660774, "num_tokens": 66392227.0, "step": 38275 }, { "entropy": 5.776295709609985, "epoch": 2.9783310639953315, "grad_norm": 1.125, "learning_rate": 0.0004115942846742171, "loss": 4.9975, "mean_token_accuracy": 0.20661955922842026, "num_tokens": 66401384.0, "step": 38280 }, { "entropy": 5.800531673431396, "epoch": 2.9787200933670492, "grad_norm": 1.3515625, "learning_rate": 0.0004115722598243596, "loss": 4.9754, "mean_token_accuracy": 0.2126871019601822, "num_tokens": 66409936.0, "step": 38285 }, { "entropy": 5.730363607406616, "epoch": 2.979109122738767, "grad_norm": 1.3125, "learning_rate": 0.00041155023290223537, "loss": 4.9094, "mean_token_accuracy": 0.21175468266010283, "num_tokens": 66418444.0, "step": 38290 }, { "entropy": 5.711074256896973, "epoch": 2.979498152110484, "grad_norm": 1.2578125, "learning_rate": 0.0004115282039081788, "loss": 4.9815, "mean_token_accuracy": 0.20600952208042145, "num_tokens": 66427211.0, "step": 38295 }, { "entropy": 5.7257240295410154, "epoch": 2.979887181482202, "grad_norm": 1.1953125, "learning_rate": 0.00041150617284252405, "loss": 4.9436, "mean_token_accuracy": 0.21139319390058517, "num_tokens": 66435767.0, "step": 38300 }, { "entropy": 5.84239354133606, "epoch": 2.9802762108539196, "grad_norm": 1.328125, "learning_rate": 0.0004114841397056053, "loss": 5.0086, "mean_token_accuracy": 0.2023792862892151, "num_tokens": 66443647.0, "step": 38305 }, { "entropy": 5.783974885940552, "epoch": 2.980665240225637, "grad_norm": 1.265625, "learning_rate": 0.00041146210449775704, "loss": 4.9342, "mean_token_accuracy": 0.21310968101024627, "num_tokens": 66452011.0, "step": 38310 }, { "entropy": 5.81120080947876, "epoch": 2.9810542695973545, "grad_norm": 1.2265625, "learning_rate": 0.0004114400672193136, "loss": 5.0505, "mean_token_accuracy": 0.2005038782954216, "num_tokens": 66460151.0, "step": 38315 }, { "entropy": 5.79468412399292, "epoch": 2.9814432989690722, "grad_norm": 1.28125, "learning_rate": 0.00041141802787060923, "loss": 5.0042, "mean_token_accuracy": 0.20895808190107346, "num_tokens": 66468409.0, "step": 38320 }, { "entropy": 5.761372184753418, "epoch": 2.98183232834079, "grad_norm": 1.3046875, "learning_rate": 0.0004113959864519784, "loss": 5.0743, "mean_token_accuracy": 0.19645504802465438, "num_tokens": 66477765.0, "step": 38325 }, { "entropy": 5.807449150085449, "epoch": 2.982221357712507, "grad_norm": 1.1953125, "learning_rate": 0.0004113739429637556, "loss": 5.087, "mean_token_accuracy": 0.1987780898809433, "num_tokens": 66486726.0, "step": 38330 }, { "entropy": 5.821677875518799, "epoch": 2.982610387084225, "grad_norm": 1.3046875, "learning_rate": 0.0004113518974062753, "loss": 5.061, "mean_token_accuracy": 0.1955601304769516, "num_tokens": 66495994.0, "step": 38335 }, { "entropy": 5.871594190597534, "epoch": 2.9829994164559426, "grad_norm": 1.2734375, "learning_rate": 0.000411329849779872, "loss": 5.0327, "mean_token_accuracy": 0.20282428562641144, "num_tokens": 66504515.0, "step": 38340 }, { "entropy": 5.762828254699707, "epoch": 2.98338844582766, "grad_norm": 1.2109375, "learning_rate": 0.00041130780008488015, "loss": 4.9327, "mean_token_accuracy": 0.20805036127567292, "num_tokens": 66513637.0, "step": 38345 }, { "entropy": 5.716990995407104, "epoch": 2.9837774751993775, "grad_norm": 1.3125, "learning_rate": 0.0004112857483216344, "loss": 4.9033, "mean_token_accuracy": 0.2104104280471802, "num_tokens": 66521453.0, "step": 38350 }, { "entropy": 5.620786333084107, "epoch": 2.9841665045710952, "grad_norm": 1.3125, "learning_rate": 0.00041126369449046935, "loss": 4.7888, "mean_token_accuracy": 0.22374191880226135, "num_tokens": 66530888.0, "step": 38355 }, { "entropy": 5.791386699676513, "epoch": 2.984555533942813, "grad_norm": 1.4453125, "learning_rate": 0.00041124163859171967, "loss": 5.0577, "mean_token_accuracy": 0.20152964890003205, "num_tokens": 66538758.0, "step": 38360 }, { "entropy": 5.833694362640381, "epoch": 2.98494456331453, "grad_norm": 1.2734375, "learning_rate": 0.0004112195806257199, "loss": 5.0439, "mean_token_accuracy": 0.20039345175027848, "num_tokens": 66546981.0, "step": 38365 }, { "entropy": 5.759631967544555, "epoch": 2.985333592686248, "grad_norm": 1.2890625, "learning_rate": 0.0004111975205928049, "loss": 4.9915, "mean_token_accuracy": 0.20579470545053483, "num_tokens": 66555375.0, "step": 38370 }, { "entropy": 5.746236419677734, "epoch": 2.985722622057965, "grad_norm": 1.25, "learning_rate": 0.00041117545849330924, "loss": 4.9571, "mean_token_accuracy": 0.20782577693462373, "num_tokens": 66564581.0, "step": 38375 }, { "entropy": 5.744187641143799, "epoch": 2.986111651429683, "grad_norm": 1.3359375, "learning_rate": 0.00041115339432756776, "loss": 5.0142, "mean_token_accuracy": 0.20628410279750825, "num_tokens": 66573876.0, "step": 38380 }, { "entropy": 5.7703478813171385, "epoch": 2.9865006808014005, "grad_norm": 1.2734375, "learning_rate": 0.0004111313280959152, "loss": 5.0114, "mean_token_accuracy": 0.21364978849887847, "num_tokens": 66582039.0, "step": 38385 }, { "entropy": 5.726438856124878, "epoch": 2.986889710173118, "grad_norm": 1.296875, "learning_rate": 0.00041110925979868647, "loss": 4.8826, "mean_token_accuracy": 0.21685124039649964, "num_tokens": 66590188.0, "step": 38390 }, { "entropy": 5.728073978424073, "epoch": 2.9872787395448355, "grad_norm": 1.234375, "learning_rate": 0.0004110871894362163, "loss": 4.972, "mean_token_accuracy": 0.21085588335990907, "num_tokens": 66598889.0, "step": 38395 }, { "entropy": 5.72450623512268, "epoch": 2.987667768916553, "grad_norm": 1.203125, "learning_rate": 0.00041106511700883975, "loss": 4.9826, "mean_token_accuracy": 0.21205798536539078, "num_tokens": 66606909.0, "step": 38400 }, { "entropy": 5.74254846572876, "epoch": 2.988056798288271, "grad_norm": 1.34375, "learning_rate": 0.00041104304251689147, "loss": 4.9997, "mean_token_accuracy": 0.20466688126325608, "num_tokens": 66615644.0, "step": 38405 }, { "entropy": 5.84015121459961, "epoch": 2.988445827659988, "grad_norm": 1.2421875, "learning_rate": 0.00041102096596070666, "loss": 5.1059, "mean_token_accuracy": 0.20578974336385727, "num_tokens": 66624466.0, "step": 38410 }, { "entropy": 5.835698175430298, "epoch": 2.988834857031706, "grad_norm": 1.1875, "learning_rate": 0.00041099888734062013, "loss": 5.1272, "mean_token_accuracy": 0.20483746826648713, "num_tokens": 66633907.0, "step": 38415 }, { "entropy": 5.743748712539673, "epoch": 2.9892238864034235, "grad_norm": 1.28125, "learning_rate": 0.000410976806656967, "loss": 5.0749, "mean_token_accuracy": 0.20762413889169692, "num_tokens": 66643652.0, "step": 38420 }, { "entropy": 5.794351959228516, "epoch": 2.989612915775141, "grad_norm": 1.2265625, "learning_rate": 0.0004109547239100822, "loss": 5.0267, "mean_token_accuracy": 0.20123479515314102, "num_tokens": 66652440.0, "step": 38425 }, { "entropy": 5.809306287765503, "epoch": 2.9900019451468585, "grad_norm": 1.2578125, "learning_rate": 0.0004109326391003009, "loss": 4.9607, "mean_token_accuracy": 0.2058293879032135, "num_tokens": 66661660.0, "step": 38430 }, { "entropy": 5.822632360458374, "epoch": 2.990390974518576, "grad_norm": 1.34375, "learning_rate": 0.00041091055222795814, "loss": 4.9726, "mean_token_accuracy": 0.2092275559902191, "num_tokens": 66670289.0, "step": 38435 }, { "entropy": 5.760470914840698, "epoch": 2.990780003890294, "grad_norm": 1.21875, "learning_rate": 0.0004108884632933891, "loss": 5.0075, "mean_token_accuracy": 0.21319308280944824, "num_tokens": 66679777.0, "step": 38440 }, { "entropy": 5.835213756561279, "epoch": 2.991169033262011, "grad_norm": 1.2890625, "learning_rate": 0.00041086637229692893, "loss": 5.0221, "mean_token_accuracy": 0.19763391762971877, "num_tokens": 66689264.0, "step": 38445 }, { "entropy": 5.778744506835937, "epoch": 2.991558062633729, "grad_norm": 1.2265625, "learning_rate": 0.00041084427923891275, "loss": 5.0504, "mean_token_accuracy": 0.20481861531734466, "num_tokens": 66697632.0, "step": 38450 }, { "entropy": 5.762053632736206, "epoch": 2.9919470920054465, "grad_norm": 1.203125, "learning_rate": 0.00041082218411967586, "loss": 4.9963, "mean_token_accuracy": 0.20798996984958648, "num_tokens": 66706312.0, "step": 38455 }, { "entropy": 5.820829916000366, "epoch": 2.992336121377164, "grad_norm": 1.2265625, "learning_rate": 0.00041080008693955355, "loss": 4.9487, "mean_token_accuracy": 0.21131463199853898, "num_tokens": 66714322.0, "step": 38460 }, { "entropy": 5.736933946609497, "epoch": 2.9927251507488815, "grad_norm": 1.1953125, "learning_rate": 0.0004107779876988811, "loss": 4.9612, "mean_token_accuracy": 0.2026991441845894, "num_tokens": 66723039.0, "step": 38465 }, { "entropy": 5.754279327392578, "epoch": 2.993114180120599, "grad_norm": 1.296875, "learning_rate": 0.00041075588639799375, "loss": 4.9563, "mean_token_accuracy": 0.2108522281050682, "num_tokens": 66731414.0, "step": 38470 }, { "entropy": 5.77333664894104, "epoch": 2.9935032094923164, "grad_norm": 1.203125, "learning_rate": 0.0004107337830372269, "loss": 4.9735, "mean_token_accuracy": 0.20695882439613342, "num_tokens": 66740664.0, "step": 38475 }, { "entropy": 5.759804534912109, "epoch": 2.993892238864034, "grad_norm": 1.2890625, "learning_rate": 0.000410711677616916, "loss": 4.9231, "mean_token_accuracy": 0.20573816895484925, "num_tokens": 66749073.0, "step": 38480 }, { "entropy": 5.708303642272949, "epoch": 2.994281268235752, "grad_norm": 1.2109375, "learning_rate": 0.0004106895701373963, "loss": 4.969, "mean_token_accuracy": 0.20719285011291505, "num_tokens": 66757734.0, "step": 38485 }, { "entropy": 5.744921445846558, "epoch": 2.9946702976074695, "grad_norm": 1.1796875, "learning_rate": 0.00041066746059900336, "loss": 4.9584, "mean_token_accuracy": 0.20011261850595474, "num_tokens": 66766699.0, "step": 38490 }, { "entropy": 5.784058952331543, "epoch": 2.995059326979187, "grad_norm": 1.234375, "learning_rate": 0.0004106453490020727, "loss": 5.0817, "mean_token_accuracy": 0.19769216775894166, "num_tokens": 66775398.0, "step": 38495 }, { "entropy": 5.699320459365845, "epoch": 2.9954483563509045, "grad_norm": 1.390625, "learning_rate": 0.00041062323534693973, "loss": 4.8877, "mean_token_accuracy": 0.22022564709186554, "num_tokens": 66783157.0, "step": 38500 }, { "entropy": 5.6907126903533936, "epoch": 2.995837385722622, "grad_norm": 1.390625, "learning_rate": 0.00041060111963394004, "loss": 4.9927, "mean_token_accuracy": 0.20499366670846939, "num_tokens": 66791293.0, "step": 38505 }, { "entropy": 5.692810916900635, "epoch": 2.9962264150943394, "grad_norm": 1.2265625, "learning_rate": 0.00041057900186340917, "loss": 4.8886, "mean_token_accuracy": 0.2153443768620491, "num_tokens": 66800212.0, "step": 38510 }, { "entropy": 5.858265590667725, "epoch": 2.996615444466057, "grad_norm": 1.2578125, "learning_rate": 0.00041055688203568274, "loss": 5.0596, "mean_token_accuracy": 0.20139247179031372, "num_tokens": 66808050.0, "step": 38515 }, { "entropy": 5.81222014427185, "epoch": 2.997004473837775, "grad_norm": 1.34375, "learning_rate": 0.0004105347601510964, "loss": 4.9851, "mean_token_accuracy": 0.21677785515785217, "num_tokens": 66816481.0, "step": 38520 }, { "entropy": 5.742810010910034, "epoch": 2.9973935032094925, "grad_norm": 1.28125, "learning_rate": 0.0004105126362099859, "loss": 4.9731, "mean_token_accuracy": 0.20696795582771302, "num_tokens": 66825294.0, "step": 38525 }, { "entropy": 5.722585010528564, "epoch": 2.9977825325812097, "grad_norm": 1.2890625, "learning_rate": 0.0004104905102126867, "loss": 4.9403, "mean_token_accuracy": 0.20764204263687133, "num_tokens": 66833818.0, "step": 38530 }, { "entropy": 5.784575128555298, "epoch": 2.9981715619529274, "grad_norm": 1.2578125, "learning_rate": 0.0004104683821595347, "loss": 5.0534, "mean_token_accuracy": 0.20033379793167114, "num_tokens": 66842604.0, "step": 38535 }, { "entropy": 5.8417411804199215, "epoch": 2.998560591324645, "grad_norm": 1.140625, "learning_rate": 0.00041044625205086566, "loss": 5.0943, "mean_token_accuracy": 0.2046305149793625, "num_tokens": 66850974.0, "step": 38540 }, { "entropy": 5.764355850219727, "epoch": 2.9989496206963624, "grad_norm": 1.171875, "learning_rate": 0.00041042411988701535, "loss": 4.9415, "mean_token_accuracy": 0.21385689973831176, "num_tokens": 66859671.0, "step": 38545 }, { "entropy": 5.764007520675659, "epoch": 2.99933865006808, "grad_norm": 1.203125, "learning_rate": 0.00041040198566831944, "loss": 5.0233, "mean_token_accuracy": 0.20756902247667314, "num_tokens": 66868864.0, "step": 38550 }, { "entropy": 5.722573471069336, "epoch": 2.999727679439798, "grad_norm": 1.171875, "learning_rate": 0.0004103798493951141, "loss": 4.9851, "mean_token_accuracy": 0.20578919351100922, "num_tokens": 66877547.0, "step": 38555 }, { "entropy": 5.762145572238499, "epoch": 3.0000778058743434, "grad_norm": 1.21875, "learning_rate": 0.00041035771106773483, "loss": 4.8887, "mean_token_accuracy": 0.21158915758132935, "num_tokens": 66884854.0, "step": 38560 }, { "entropy": 5.808285331726074, "epoch": 3.000466835246061, "grad_norm": 1.2421875, "learning_rate": 0.0004103355706865179, "loss": 4.954, "mean_token_accuracy": 0.20199542939662934, "num_tokens": 66893963.0, "step": 38565 }, { "entropy": 5.718252563476563, "epoch": 3.0008558646177788, "grad_norm": 1.171875, "learning_rate": 0.000410313428251799, "loss": 4.9063, "mean_token_accuracy": 0.20907366424798965, "num_tokens": 66902788.0, "step": 38570 }, { "entropy": 5.764219570159912, "epoch": 3.001244893989496, "grad_norm": 1.359375, "learning_rate": 0.00041029128376391424, "loss": 4.9702, "mean_token_accuracy": 0.20876077115535735, "num_tokens": 66912294.0, "step": 38575 }, { "entropy": 5.730239725112915, "epoch": 3.0016339233612137, "grad_norm": 1.234375, "learning_rate": 0.00041026913722319954, "loss": 4.8592, "mean_token_accuracy": 0.21620642244815827, "num_tokens": 66920080.0, "step": 38580 }, { "entropy": 5.71075291633606, "epoch": 3.0020229527329314, "grad_norm": 1.28125, "learning_rate": 0.000410246988629991, "loss": 4.8862, "mean_token_accuracy": 0.2130830317735672, "num_tokens": 66928404.0, "step": 38585 }, { "entropy": 5.800596284866333, "epoch": 3.002411982104649, "grad_norm": 1.203125, "learning_rate": 0.00041022483798462466, "loss": 4.9787, "mean_token_accuracy": 0.207669398188591, "num_tokens": 66938040.0, "step": 38590 }, { "entropy": 5.812737655639649, "epoch": 3.0028010114763664, "grad_norm": 1.25, "learning_rate": 0.0004102026852874367, "loss": 4.9623, "mean_token_accuracy": 0.21315058320760727, "num_tokens": 66946605.0, "step": 38595 }, { "entropy": 5.795399332046509, "epoch": 3.003190040848084, "grad_norm": 1.203125, "learning_rate": 0.00041018053053876316, "loss": 5.0014, "mean_token_accuracy": 0.21266485154628753, "num_tokens": 66955276.0, "step": 38600 }, { "entropy": 5.799468755722046, "epoch": 3.0035790702198017, "grad_norm": 1.3203125, "learning_rate": 0.0004101583737389402, "loss": 4.945, "mean_token_accuracy": 0.20795195996761323, "num_tokens": 66963950.0, "step": 38605 }, { "entropy": 5.78787784576416, "epoch": 3.003968099591519, "grad_norm": 1.2265625, "learning_rate": 0.00041013621488830406, "loss": 4.9201, "mean_token_accuracy": 0.21345579028129577, "num_tokens": 66972101.0, "step": 38610 }, { "entropy": 5.692935562133789, "epoch": 3.0043571289632367, "grad_norm": 1.28125, "learning_rate": 0.00041011405398719096, "loss": 4.869, "mean_token_accuracy": 0.20965124070644378, "num_tokens": 66981251.0, "step": 38615 }, { "entropy": 5.784436416625977, "epoch": 3.0047461583349544, "grad_norm": 1.2109375, "learning_rate": 0.00041009189103593716, "loss": 4.9839, "mean_token_accuracy": 0.20589314997196198, "num_tokens": 66990292.0, "step": 38620 }, { "entropy": 5.80731954574585, "epoch": 3.0051351877066717, "grad_norm": 1.2734375, "learning_rate": 0.0004100697260348789, "loss": 4.9939, "mean_token_accuracy": 0.20313736647367478, "num_tokens": 66999699.0, "step": 38625 }, { "entropy": 5.757210636138916, "epoch": 3.0055242170783893, "grad_norm": 1.1953125, "learning_rate": 0.00041004755898435254, "loss": 4.9191, "mean_token_accuracy": 0.2099007099866867, "num_tokens": 67008272.0, "step": 38630 }, { "entropy": 5.712529182434082, "epoch": 3.005913246450107, "grad_norm": 1.25, "learning_rate": 0.0004100253898846945, "loss": 4.9359, "mean_token_accuracy": 0.20812551081180572, "num_tokens": 67016865.0, "step": 38635 }, { "entropy": 5.7256546974182125, "epoch": 3.0063022758218247, "grad_norm": 1.3125, "learning_rate": 0.000410003218736241, "loss": 4.9485, "mean_token_accuracy": 0.2168524369597435, "num_tokens": 67025791.0, "step": 38640 }, { "entropy": 5.671497631072998, "epoch": 3.006691305193542, "grad_norm": 1.109375, "learning_rate": 0.00040998104553932856, "loss": 4.8369, "mean_token_accuracy": 0.21812544167041778, "num_tokens": 67034872.0, "step": 38645 }, { "entropy": 5.671766757965088, "epoch": 3.0070803345652597, "grad_norm": 1.328125, "learning_rate": 0.0004099588702942936, "loss": 4.9151, "mean_token_accuracy": 0.21004776060581207, "num_tokens": 67043350.0, "step": 38650 }, { "entropy": 5.758774280548096, "epoch": 3.0074693639369774, "grad_norm": 1.28125, "learning_rate": 0.00040993669300147257, "loss": 5.0025, "mean_token_accuracy": 0.20693732053041458, "num_tokens": 67051593.0, "step": 38655 }, { "entropy": 5.781776332855225, "epoch": 3.0078583933086946, "grad_norm": 1.2578125, "learning_rate": 0.00040991451366120205, "loss": 5.0074, "mean_token_accuracy": 0.20980682969093323, "num_tokens": 67060024.0, "step": 38660 }, { "entropy": 5.820903682708741, "epoch": 3.0082474226804123, "grad_norm": 1.3125, "learning_rate": 0.0004098923322738185, "loss": 5.0426, "mean_token_accuracy": 0.20587575286626816, "num_tokens": 67069136.0, "step": 38665 }, { "entropy": 5.641188621520996, "epoch": 3.00863645205213, "grad_norm": 1.2109375, "learning_rate": 0.00040987014883965843, "loss": 4.8015, "mean_token_accuracy": 0.2210340365767479, "num_tokens": 67078209.0, "step": 38670 }, { "entropy": 5.67455530166626, "epoch": 3.0090254814238473, "grad_norm": 1.1484375, "learning_rate": 0.00040984796335905867, "loss": 4.9033, "mean_token_accuracy": 0.20917559564113616, "num_tokens": 67087676.0, "step": 38675 }, { "entropy": 5.7298033237457275, "epoch": 3.009414510795565, "grad_norm": 1.2265625, "learning_rate": 0.0004098257758323556, "loss": 4.988, "mean_token_accuracy": 0.2036285951733589, "num_tokens": 67096730.0, "step": 38680 }, { "entropy": 5.861312389373779, "epoch": 3.0098035401672827, "grad_norm": 1.375, "learning_rate": 0.0004098035862598859, "loss": 5.0597, "mean_token_accuracy": 0.1969207465648651, "num_tokens": 67106017.0, "step": 38685 }, { "entropy": 5.757545518875122, "epoch": 3.0101925695390004, "grad_norm": 1.2734375, "learning_rate": 0.0004097813946419865, "loss": 4.8376, "mean_token_accuracy": 0.2157994106411934, "num_tokens": 67114708.0, "step": 38690 }, { "entropy": 5.763043165206909, "epoch": 3.0105815989107176, "grad_norm": 1.15625, "learning_rate": 0.0004097592009789939, "loss": 4.973, "mean_token_accuracy": 0.20510833710432053, "num_tokens": 67124257.0, "step": 38695 }, { "entropy": 5.798128461837768, "epoch": 3.0109706282824353, "grad_norm": 1.140625, "learning_rate": 0.00040973700527124494, "loss": 4.9792, "mean_token_accuracy": 0.20881288051605223, "num_tokens": 67133066.0, "step": 38700 }, { "entropy": 5.814629364013672, "epoch": 3.011359657654153, "grad_norm": 1.4296875, "learning_rate": 0.00040971480751907633, "loss": 4.9542, "mean_token_accuracy": 0.21084709763526915, "num_tokens": 67141906.0, "step": 38705 }, { "entropy": 5.752321672439575, "epoch": 3.0117486870258703, "grad_norm": 1.40625, "learning_rate": 0.00040969260772282494, "loss": 4.9344, "mean_token_accuracy": 0.20503573566675187, "num_tokens": 67150533.0, "step": 38710 }, { "entropy": 5.711064100265503, "epoch": 3.012137716397588, "grad_norm": 1.2578125, "learning_rate": 0.0004096704058828277, "loss": 4.9564, "mean_token_accuracy": 0.21043304204940796, "num_tokens": 67159130.0, "step": 38715 }, { "entropy": 5.753705644607544, "epoch": 3.0125267457693057, "grad_norm": 1.28125, "learning_rate": 0.00040964820199942135, "loss": 4.8756, "mean_token_accuracy": 0.21766874492168425, "num_tokens": 67168075.0, "step": 38720 }, { "entropy": 5.778563070297241, "epoch": 3.012915775141023, "grad_norm": 1.3359375, "learning_rate": 0.0004096259960729428, "loss": 4.9432, "mean_token_accuracy": 0.21595874577760696, "num_tokens": 67176972.0, "step": 38725 }, { "entropy": 5.8028816223144535, "epoch": 3.0133048045127406, "grad_norm": 1.21875, "learning_rate": 0.00040960378810372906, "loss": 5.0205, "mean_token_accuracy": 0.20380289256572723, "num_tokens": 67185091.0, "step": 38730 }, { "entropy": 5.751721715927124, "epoch": 3.0136938338844583, "grad_norm": 1.4453125, "learning_rate": 0.0004095815780921171, "loss": 4.9367, "mean_token_accuracy": 0.21168459802865983, "num_tokens": 67193345.0, "step": 38735 }, { "entropy": 5.686600828170777, "epoch": 3.014082863256176, "grad_norm": 1.2734375, "learning_rate": 0.0004095593660384439, "loss": 4.8644, "mean_token_accuracy": 0.2162984639406204, "num_tokens": 67201893.0, "step": 38740 }, { "entropy": 5.7837724685668945, "epoch": 3.0144718926278933, "grad_norm": 1.3125, "learning_rate": 0.0004095371519430465, "loss": 5.0271, "mean_token_accuracy": 0.20838951021432878, "num_tokens": 67211112.0, "step": 38745 }, { "entropy": 5.719252490997315, "epoch": 3.014860921999611, "grad_norm": 1.2421875, "learning_rate": 0.00040951493580626195, "loss": 4.8515, "mean_token_accuracy": 0.21159825921058656, "num_tokens": 67220078.0, "step": 38750 }, { "entropy": 5.7548593044281, "epoch": 3.0152499513713287, "grad_norm": 1.2734375, "learning_rate": 0.0004094927176284273, "loss": 4.9889, "mean_token_accuracy": 0.20892954617738724, "num_tokens": 67228883.0, "step": 38755 }, { "entropy": 5.816107892990113, "epoch": 3.015638980743046, "grad_norm": 1.3359375, "learning_rate": 0.00040947049740987977, "loss": 5.0555, "mean_token_accuracy": 0.19993629902601243, "num_tokens": 67237377.0, "step": 38760 }, { "entropy": 5.757194185256958, "epoch": 3.0160280101147636, "grad_norm": 1.203125, "learning_rate": 0.0004094482751509565, "loss": 4.9025, "mean_token_accuracy": 0.21238193213939666, "num_tokens": 67245488.0, "step": 38765 }, { "entropy": 5.705473804473877, "epoch": 3.0164170394864813, "grad_norm": 1.25, "learning_rate": 0.0004094260508519947, "loss": 4.8972, "mean_token_accuracy": 0.21449481546878815, "num_tokens": 67253791.0, "step": 38770 }, { "entropy": 5.677233028411865, "epoch": 3.0168060688581986, "grad_norm": 1.34375, "learning_rate": 0.00040940382451333144, "loss": 4.8532, "mean_token_accuracy": 0.21350279003381728, "num_tokens": 67262373.0, "step": 38775 }, { "entropy": 5.704997158050537, "epoch": 3.0171950982299163, "grad_norm": 1.484375, "learning_rate": 0.00040938159613530405, "loss": 4.8992, "mean_token_accuracy": 0.2165850430727005, "num_tokens": 67270946.0, "step": 38780 }, { "entropy": 5.759824943542481, "epoch": 3.017584127601634, "grad_norm": 1.2265625, "learning_rate": 0.0004093593657182499, "loss": 4.9942, "mean_token_accuracy": 0.21320284008979798, "num_tokens": 67280150.0, "step": 38785 }, { "entropy": 5.870448923110962, "epoch": 3.0179731569733517, "grad_norm": 1.2890625, "learning_rate": 0.0004093371332625062, "loss": 4.9538, "mean_token_accuracy": 0.20515215247869492, "num_tokens": 67288109.0, "step": 38790 }, { "entropy": 5.758680629730224, "epoch": 3.018362186345069, "grad_norm": 1.265625, "learning_rate": 0.0004093148987684103, "loss": 4.8917, "mean_token_accuracy": 0.21057824790477753, "num_tokens": 67296538.0, "step": 38795 }, { "entropy": 5.724568176269531, "epoch": 3.0187512157167866, "grad_norm": 1.296875, "learning_rate": 0.00040929266223629966, "loss": 4.9029, "mean_token_accuracy": 0.20950037837028504, "num_tokens": 67306088.0, "step": 38800 }, { "entropy": 5.727525329589843, "epoch": 3.0191402450885043, "grad_norm": 1.3046875, "learning_rate": 0.00040927042366651164, "loss": 4.9106, "mean_token_accuracy": 0.21591730266809464, "num_tokens": 67315101.0, "step": 38805 }, { "entropy": 5.734199810028076, "epoch": 3.0195292744602216, "grad_norm": 1.203125, "learning_rate": 0.00040924818305938354, "loss": 4.8418, "mean_token_accuracy": 0.21671714037656784, "num_tokens": 67323309.0, "step": 38810 }, { "entropy": 5.7696778774261475, "epoch": 3.0199183038319393, "grad_norm": 1.328125, "learning_rate": 0.00040922594041525303, "loss": 4.9778, "mean_token_accuracy": 0.2063523769378662, "num_tokens": 67331893.0, "step": 38815 }, { "entropy": 5.675411987304687, "epoch": 3.020307333203657, "grad_norm": 1.296875, "learning_rate": 0.0004092036957344574, "loss": 4.8464, "mean_token_accuracy": 0.2192461907863617, "num_tokens": 67339804.0, "step": 38820 }, { "entropy": 5.706038284301758, "epoch": 3.0206963625753747, "grad_norm": 1.2734375, "learning_rate": 0.00040918144901733443, "loss": 4.8962, "mean_token_accuracy": 0.21433351039886475, "num_tokens": 67348306.0, "step": 38825 }, { "entropy": 5.797505617141724, "epoch": 3.021085391947092, "grad_norm": 1.1484375, "learning_rate": 0.0004091592002642215, "loss": 4.9591, "mean_token_accuracy": 0.20707217156887053, "num_tokens": 67356601.0, "step": 38830 }, { "entropy": 5.680241632461548, "epoch": 3.0214744213188096, "grad_norm": 1.2578125, "learning_rate": 0.0004091369494754562, "loss": 4.9243, "mean_token_accuracy": 0.2151537910103798, "num_tokens": 67364990.0, "step": 38835 }, { "entropy": 5.756751680374146, "epoch": 3.0218634506905273, "grad_norm": 1.2734375, "learning_rate": 0.0004091146966513763, "loss": 4.9986, "mean_token_accuracy": 0.20754473358392717, "num_tokens": 67373165.0, "step": 38840 }, { "entropy": 5.819173049926758, "epoch": 3.0222524800622446, "grad_norm": 1.3984375, "learning_rate": 0.00040909244179231926, "loss": 4.978, "mean_token_accuracy": 0.20491139888763427, "num_tokens": 67381627.0, "step": 38845 }, { "entropy": 5.713067579269409, "epoch": 3.0226415094339623, "grad_norm": 1.25, "learning_rate": 0.0004090701848986229, "loss": 4.8473, "mean_token_accuracy": 0.2141152560710907, "num_tokens": 67389928.0, "step": 38850 }, { "entropy": 5.720639371871949, "epoch": 3.02303053880568, "grad_norm": 1.1640625, "learning_rate": 0.0004090479259706247, "loss": 4.8953, "mean_token_accuracy": 0.21080233305692672, "num_tokens": 67398377.0, "step": 38855 }, { "entropy": 5.694143438339234, "epoch": 3.023419568177397, "grad_norm": 1.28125, "learning_rate": 0.0004090256650086628, "loss": 4.7979, "mean_token_accuracy": 0.22337986826896666, "num_tokens": 67406490.0, "step": 38860 }, { "entropy": 5.704613876342774, "epoch": 3.023808597549115, "grad_norm": 1.234375, "learning_rate": 0.00040900340201307475, "loss": 4.9241, "mean_token_accuracy": 0.21316968351602555, "num_tokens": 67415178.0, "step": 38865 }, { "entropy": 5.697558498382568, "epoch": 3.0241976269208326, "grad_norm": 1.234375, "learning_rate": 0.00040898113698419823, "loss": 4.9389, "mean_token_accuracy": 0.21122253686189651, "num_tokens": 67423770.0, "step": 38870 }, { "entropy": 5.789065504074097, "epoch": 3.0245866562925503, "grad_norm": 1.375, "learning_rate": 0.0004089588699223713, "loss": 5.0153, "mean_token_accuracy": 0.20439563691616058, "num_tokens": 67432771.0, "step": 38875 }, { "entropy": 5.7719885349273685, "epoch": 3.0249756856642676, "grad_norm": 1.25, "learning_rate": 0.00040893660082793167, "loss": 4.9439, "mean_token_accuracy": 0.2084171488881111, "num_tokens": 67441697.0, "step": 38880 }, { "entropy": 5.747178840637207, "epoch": 3.0253647150359853, "grad_norm": 1.203125, "learning_rate": 0.00040891432970121736, "loss": 5.026, "mean_token_accuracy": 0.20125536620616913, "num_tokens": 67450950.0, "step": 38885 }, { "entropy": 5.680766248703003, "epoch": 3.025753744407703, "grad_norm": 1.1640625, "learning_rate": 0.00040889205654256615, "loss": 4.8623, "mean_token_accuracy": 0.21422557532787323, "num_tokens": 67459863.0, "step": 38890 }, { "entropy": 5.816888761520386, "epoch": 3.02614277377942, "grad_norm": 1.2890625, "learning_rate": 0.00040886978135231625, "loss": 4.9468, "mean_token_accuracy": 0.21535432040691377, "num_tokens": 67468829.0, "step": 38895 }, { "entropy": 5.764848852157593, "epoch": 3.026531803151138, "grad_norm": 1.203125, "learning_rate": 0.00040884750413080535, "loss": 4.8746, "mean_token_accuracy": 0.21731577813625336, "num_tokens": 67477979.0, "step": 38900 }, { "entropy": 5.754302358627319, "epoch": 3.0269208325228556, "grad_norm": 1.2578125, "learning_rate": 0.00040882522487837176, "loss": 4.973, "mean_token_accuracy": 0.20899264067411422, "num_tokens": 67486929.0, "step": 38905 }, { "entropy": 5.701807308197021, "epoch": 3.027309861894573, "grad_norm": 1.1796875, "learning_rate": 0.00040880294359535327, "loss": 4.8707, "mean_token_accuracy": 0.21345162093639375, "num_tokens": 67495434.0, "step": 38910 }, { "entropy": 5.769709682464599, "epoch": 3.0276988912662905, "grad_norm": 1.359375, "learning_rate": 0.00040878066028208804, "loss": 4.9303, "mean_token_accuracy": 0.2037979170680046, "num_tokens": 67504437.0, "step": 38915 }, { "entropy": 5.7156391620635985, "epoch": 3.0280879206380082, "grad_norm": 1.2265625, "learning_rate": 0.00040875837493891434, "loss": 4.9403, "mean_token_accuracy": 0.21649870574474334, "num_tokens": 67512899.0, "step": 38920 }, { "entropy": 5.795283365249634, "epoch": 3.028476950009726, "grad_norm": 1.2578125, "learning_rate": 0.0004087360875661701, "loss": 5.0061, "mean_token_accuracy": 0.20303813070058824, "num_tokens": 67521602.0, "step": 38925 }, { "entropy": 5.832841300964356, "epoch": 3.028865979381443, "grad_norm": 1.3671875, "learning_rate": 0.00040871379816419376, "loss": 4.9501, "mean_token_accuracy": 0.21223787367343902, "num_tokens": 67530808.0, "step": 38930 }, { "entropy": 5.8532799243927, "epoch": 3.029255008753161, "grad_norm": 1.2578125, "learning_rate": 0.0004086915067333232, "loss": 4.9173, "mean_token_accuracy": 0.2053750067949295, "num_tokens": 67539216.0, "step": 38935 }, { "entropy": 5.7293946743011475, "epoch": 3.0296440381248786, "grad_norm": 1.203125, "learning_rate": 0.0004086692132738968, "loss": 4.9125, "mean_token_accuracy": 0.20584671050310135, "num_tokens": 67547202.0, "step": 38940 }, { "entropy": 5.7816925048828125, "epoch": 3.030033067496596, "grad_norm": 1.171875, "learning_rate": 0.000408646917786253, "loss": 5.0765, "mean_token_accuracy": 0.20472581833600997, "num_tokens": 67556427.0, "step": 38945 }, { "entropy": 5.820905494689941, "epoch": 3.0304220968683135, "grad_norm": 1.2734375, "learning_rate": 0.0004086246202707298, "loss": 4.9951, "mean_token_accuracy": 0.2067941978573799, "num_tokens": 67564945.0, "step": 38950 }, { "entropy": 5.805917835235595, "epoch": 3.0308111262400312, "grad_norm": 1.328125, "learning_rate": 0.00040860232072766577, "loss": 5.0693, "mean_token_accuracy": 0.2103107154369354, "num_tokens": 67574336.0, "step": 38955 }, { "entropy": 5.805002927780151, "epoch": 3.0312001556117485, "grad_norm": 1.265625, "learning_rate": 0.0004085800191573991, "loss": 4.9828, "mean_token_accuracy": 0.21324396133422852, "num_tokens": 67583628.0, "step": 38960 }, { "entropy": 5.801850271224976, "epoch": 3.031589184983466, "grad_norm": 1.3671875, "learning_rate": 0.0004085577155602683, "loss": 4.9373, "mean_token_accuracy": 0.2125069722533226, "num_tokens": 67592462.0, "step": 38965 }, { "entropy": 5.814343500137329, "epoch": 3.031978214355184, "grad_norm": 1.2578125, "learning_rate": 0.00040853540993661175, "loss": 4.9192, "mean_token_accuracy": 0.21867397129535676, "num_tokens": 67601377.0, "step": 38970 }, { "entropy": 5.702176713943482, "epoch": 3.0323672437269016, "grad_norm": 1.328125, "learning_rate": 0.00040851310228676787, "loss": 4.8304, "mean_token_accuracy": 0.22074999213218688, "num_tokens": 67610253.0, "step": 38975 }, { "entropy": 5.700788164138794, "epoch": 3.032756273098619, "grad_norm": 1.3046875, "learning_rate": 0.0004084907926110752, "loss": 4.973, "mean_token_accuracy": 0.20724004060029982, "num_tokens": 67618092.0, "step": 38980 }, { "entropy": 5.691736793518066, "epoch": 3.0331453024703365, "grad_norm": 1.2578125, "learning_rate": 0.0004084684809098722, "loss": 4.8996, "mean_token_accuracy": 0.21685690879821778, "num_tokens": 67626547.0, "step": 38985 }, { "entropy": 5.850264835357666, "epoch": 3.0335343318420542, "grad_norm": 1.2578125, "learning_rate": 0.00040844616718349743, "loss": 5.0148, "mean_token_accuracy": 0.20512064397335053, "num_tokens": 67635891.0, "step": 38990 }, { "entropy": 5.775792455673217, "epoch": 3.0339233612137715, "grad_norm": 1.2734375, "learning_rate": 0.00040842385143228946, "loss": 4.8952, "mean_token_accuracy": 0.21121348738670348, "num_tokens": 67645030.0, "step": 38995 }, { "entropy": 5.749570369720459, "epoch": 3.034312390585489, "grad_norm": 1.3125, "learning_rate": 0.00040840153365658693, "loss": 4.9629, "mean_token_accuracy": 0.21255113184452057, "num_tokens": 67652941.0, "step": 39000 }, { "epoch": 3.034312390585489, "eval_entropy": 5.442474607094994, "eval_loss": 5.057469844818115, "eval_mean_token_accuracy": 0.2139656333322704, "eval_num_tokens": 67652941.0, "eval_runtime": 21.7371, "eval_samples_per_second": 1911.843, "eval_steps_per_second": 238.992, "step": 39000 }, { "entropy": 5.735845470428467, "epoch": 3.034701419957207, "grad_norm": 1.296875, "learning_rate": 0.00040837921385672855, "loss": 4.9074, "mean_token_accuracy": 0.21235668510198594, "num_tokens": 67661600.0, "step": 39005 }, { "entropy": 5.780466985702515, "epoch": 3.035090449328924, "grad_norm": 1.296875, "learning_rate": 0.00040835689203305275, "loss": 5.0023, "mean_token_accuracy": 0.20036429464817046, "num_tokens": 67670317.0, "step": 39010 }, { "entropy": 5.75860595703125, "epoch": 3.035479478700642, "grad_norm": 1.265625, "learning_rate": 0.00040833456818589845, "loss": 4.9179, "mean_token_accuracy": 0.2137957200407982, "num_tokens": 67679065.0, "step": 39015 }, { "entropy": 5.772908544540405, "epoch": 3.0358685080723595, "grad_norm": 1.3203125, "learning_rate": 0.00040831224231560424, "loss": 4.9039, "mean_token_accuracy": 0.22035691887140274, "num_tokens": 67687724.0, "step": 39020 }, { "entropy": 5.725490379333496, "epoch": 3.0362575374440772, "grad_norm": 1.2734375, "learning_rate": 0.000408289914422509, "loss": 4.8992, "mean_token_accuracy": 0.21317849755287172, "num_tokens": 67695846.0, "step": 39025 }, { "entropy": 5.746441316604614, "epoch": 3.0366465668157945, "grad_norm": 1.3359375, "learning_rate": 0.0004082675845069515, "loss": 4.9201, "mean_token_accuracy": 0.2176216796040535, "num_tokens": 67704675.0, "step": 39030 }, { "entropy": 5.7516608238220215, "epoch": 3.037035596187512, "grad_norm": 1.2421875, "learning_rate": 0.0004082452525692704, "loss": 4.907, "mean_token_accuracy": 0.21289172619581223, "num_tokens": 67713836.0, "step": 39035 }, { "entropy": 5.741590738296509, "epoch": 3.03742462555923, "grad_norm": 1.34375, "learning_rate": 0.00040822291860980484, "loss": 4.9188, "mean_token_accuracy": 0.21583994179964067, "num_tokens": 67722920.0, "step": 39040 }, { "entropy": 5.755661249160767, "epoch": 3.037813654930947, "grad_norm": 1.234375, "learning_rate": 0.00040820058262889343, "loss": 5.0052, "mean_token_accuracy": 0.2053699180483818, "num_tokens": 67732285.0, "step": 39045 }, { "entropy": 5.819837522506714, "epoch": 3.038202684302665, "grad_norm": 1.390625, "learning_rate": 0.00040817824462687516, "loss": 4.9198, "mean_token_accuracy": 0.2106494575738907, "num_tokens": 67739836.0, "step": 39050 }, { "entropy": 5.723085165023804, "epoch": 3.0385917136743825, "grad_norm": 1.3984375, "learning_rate": 0.00040815590460408906, "loss": 4.9093, "mean_token_accuracy": 0.2160683512687683, "num_tokens": 67748833.0, "step": 39055 }, { "entropy": 5.647990798950195, "epoch": 3.0389807430460998, "grad_norm": 1.328125, "learning_rate": 0.00040813356256087395, "loss": 4.8232, "mean_token_accuracy": 0.22433469593524932, "num_tokens": 67756778.0, "step": 39060 }, { "entropy": 5.751636171340943, "epoch": 3.0393697724178175, "grad_norm": 1.25, "learning_rate": 0.0004081112184975691, "loss": 4.9222, "mean_token_accuracy": 0.20899992138147355, "num_tokens": 67765691.0, "step": 39065 }, { "entropy": 5.720434856414795, "epoch": 3.039758801789535, "grad_norm": 1.296875, "learning_rate": 0.0004080888724145132, "loss": 4.8494, "mean_token_accuracy": 0.21742848604917525, "num_tokens": 67774685.0, "step": 39070 }, { "entropy": 5.785598278045654, "epoch": 3.040147831161253, "grad_norm": 1.3125, "learning_rate": 0.0004080665243120456, "loss": 5.0012, "mean_token_accuracy": 0.210468128323555, "num_tokens": 67783928.0, "step": 39075 }, { "entropy": 5.7283947467803955, "epoch": 3.04053686053297, "grad_norm": 1.2734375, "learning_rate": 0.0004080441741905053, "loss": 4.9185, "mean_token_accuracy": 0.21072896122932433, "num_tokens": 67792793.0, "step": 39080 }, { "entropy": 5.747997140884399, "epoch": 3.040925889904688, "grad_norm": 1.34375, "learning_rate": 0.0004080218220502314, "loss": 4.9401, "mean_token_accuracy": 0.21176382154226303, "num_tokens": 67801648.0, "step": 39085 }, { "entropy": 5.83849949836731, "epoch": 3.0413149192764055, "grad_norm": 1.21875, "learning_rate": 0.00040799946789156304, "loss": 5.065, "mean_token_accuracy": 0.19318635016679764, "num_tokens": 67810390.0, "step": 39090 }, { "entropy": 5.805060195922851, "epoch": 3.0417039486481228, "grad_norm": 1.2109375, "learning_rate": 0.00040797711171483954, "loss": 4.9065, "mean_token_accuracy": 0.21680895388126373, "num_tokens": 67819091.0, "step": 39095 }, { "entropy": 5.76675934791565, "epoch": 3.0420929780198405, "grad_norm": 1.234375, "learning_rate": 0.0004079547535203999, "loss": 4.943, "mean_token_accuracy": 0.21061045974493026, "num_tokens": 67827901.0, "step": 39100 }, { "entropy": 5.7719869136810305, "epoch": 3.042482007391558, "grad_norm": 1.3125, "learning_rate": 0.0004079323933085836, "loss": 4.927, "mean_token_accuracy": 0.20810978412628173, "num_tokens": 67836221.0, "step": 39105 }, { "entropy": 5.796148490905762, "epoch": 3.0428710367632754, "grad_norm": 1.1796875, "learning_rate": 0.00040791003107972976, "loss": 4.995, "mean_token_accuracy": 0.21089850515127181, "num_tokens": 67845565.0, "step": 39110 }, { "entropy": 5.800044584274292, "epoch": 3.043260066134993, "grad_norm": 1.3828125, "learning_rate": 0.0004078876668341778, "loss": 5.03, "mean_token_accuracy": 0.2088341698050499, "num_tokens": 67854433.0, "step": 39115 }, { "entropy": 5.779748392105103, "epoch": 3.043649095506711, "grad_norm": 1.3046875, "learning_rate": 0.0004078653005722669, "loss": 4.9225, "mean_token_accuracy": 0.212124602496624, "num_tokens": 67862511.0, "step": 39120 }, { "entropy": 5.763424444198608, "epoch": 3.0440381248784285, "grad_norm": 1.2421875, "learning_rate": 0.0004078429322943366, "loss": 4.9429, "mean_token_accuracy": 0.20973699390888215, "num_tokens": 67871145.0, "step": 39125 }, { "entropy": 5.677280330657959, "epoch": 3.0444271542501458, "grad_norm": 1.234375, "learning_rate": 0.00040782056200072627, "loss": 4.8606, "mean_token_accuracy": 0.22182271778583526, "num_tokens": 67879377.0, "step": 39130 }, { "entropy": 5.697037124633789, "epoch": 3.0448161836218635, "grad_norm": 1.2265625, "learning_rate": 0.00040779818969177527, "loss": 4.8645, "mean_token_accuracy": 0.22303430289030074, "num_tokens": 67888073.0, "step": 39135 }, { "entropy": 5.829001474380493, "epoch": 3.045205212993581, "grad_norm": 1.3203125, "learning_rate": 0.00040777581536782315, "loss": 4.9838, "mean_token_accuracy": 0.2071211740374565, "num_tokens": 67896426.0, "step": 39140 }, { "entropy": 5.775055408477783, "epoch": 3.0455942423652984, "grad_norm": 1.21875, "learning_rate": 0.0004077534390292093, "loss": 4.8965, "mean_token_accuracy": 0.2145564779639244, "num_tokens": 67904744.0, "step": 39145 }, { "entropy": 5.728872919082642, "epoch": 3.045983271737016, "grad_norm": 1.3515625, "learning_rate": 0.00040773106067627335, "loss": 4.8823, "mean_token_accuracy": 0.21223721653223038, "num_tokens": 67912893.0, "step": 39150 }, { "entropy": 5.704162645339966, "epoch": 3.046372301108734, "grad_norm": 1.34375, "learning_rate": 0.00040770868030935486, "loss": 4.9314, "mean_token_accuracy": 0.2061892032623291, "num_tokens": 67921150.0, "step": 39155 }, { "entropy": 5.756246852874756, "epoch": 3.046761330480451, "grad_norm": 1.265625, "learning_rate": 0.00040768629792879344, "loss": 4.9429, "mean_token_accuracy": 0.20348263382911683, "num_tokens": 67929686.0, "step": 39160 }, { "entropy": 5.811627197265625, "epoch": 3.0471503598521688, "grad_norm": 1.375, "learning_rate": 0.0004076639135349284, "loss": 5.0101, "mean_token_accuracy": 0.20185322612524031, "num_tokens": 67937523.0, "step": 39165 }, { "entropy": 5.767341375350952, "epoch": 3.0475393892238865, "grad_norm": 1.3359375, "learning_rate": 0.00040764152712809983, "loss": 4.9022, "mean_token_accuracy": 0.20981812179088594, "num_tokens": 67945368.0, "step": 39170 }, { "entropy": 5.850699329376221, "epoch": 3.047928418595604, "grad_norm": 1.3515625, "learning_rate": 0.0004076191387086472, "loss": 5.0026, "mean_token_accuracy": 0.21112878769636154, "num_tokens": 67953769.0, "step": 39175 }, { "entropy": 5.80847954750061, "epoch": 3.0483174479673214, "grad_norm": 1.2890625, "learning_rate": 0.00040759674827691014, "loss": 4.9516, "mean_token_accuracy": 0.20584646314382554, "num_tokens": 67962131.0, "step": 39180 }, { "entropy": 5.685809469223022, "epoch": 3.048706477339039, "grad_norm": 1.2734375, "learning_rate": 0.0004075743558332285, "loss": 4.9253, "mean_token_accuracy": 0.20824985802173615, "num_tokens": 67971344.0, "step": 39185 }, { "entropy": 5.735369539260864, "epoch": 3.049095506710757, "grad_norm": 1.28125, "learning_rate": 0.000407551961377942, "loss": 4.8992, "mean_token_accuracy": 0.21225423067808152, "num_tokens": 67979553.0, "step": 39190 }, { "entropy": 5.763709497451782, "epoch": 3.049484536082474, "grad_norm": 1.1640625, "learning_rate": 0.0004075295649113905, "loss": 5.0075, "mean_token_accuracy": 0.20647564083337783, "num_tokens": 67989821.0, "step": 39195 }, { "entropy": 5.856831455230713, "epoch": 3.0498735654541917, "grad_norm": 1.1875, "learning_rate": 0.00040750716643391384, "loss": 5.032, "mean_token_accuracy": 0.20667271316051483, "num_tokens": 67998727.0, "step": 39200 }, { "entropy": 5.769467878341675, "epoch": 3.0502625948259094, "grad_norm": 1.265625, "learning_rate": 0.0004074847659458518, "loss": 4.8699, "mean_token_accuracy": 0.20642235577106477, "num_tokens": 68007158.0, "step": 39205 }, { "entropy": 5.693119764328003, "epoch": 3.050651624197627, "grad_norm": 1.390625, "learning_rate": 0.00040746236344754423, "loss": 4.8212, "mean_token_accuracy": 0.21991924792528153, "num_tokens": 68015196.0, "step": 39210 }, { "entropy": 5.70523157119751, "epoch": 3.0510406535693444, "grad_norm": 1.2421875, "learning_rate": 0.0004074399589393312, "loss": 4.9118, "mean_token_accuracy": 0.20795989632606507, "num_tokens": 68023983.0, "step": 39215 }, { "entropy": 5.745736885070801, "epoch": 3.051429682941062, "grad_norm": 1.2734375, "learning_rate": 0.0004074175524215526, "loss": 4.9354, "mean_token_accuracy": 0.2103111445903778, "num_tokens": 68032347.0, "step": 39220 }, { "entropy": 5.7021918296813965, "epoch": 3.05181871231278, "grad_norm": 1.28125, "learning_rate": 0.0004073951438945484, "loss": 4.9164, "mean_token_accuracy": 0.21291134804487227, "num_tokens": 68041463.0, "step": 39225 }, { "entropy": 5.822821092605591, "epoch": 3.052207741684497, "grad_norm": 1.1640625, "learning_rate": 0.00040737273335865866, "loss": 5.0387, "mean_token_accuracy": 0.2032796785235405, "num_tokens": 68050647.0, "step": 39230 }, { "entropy": 5.739605188369751, "epoch": 3.0525967710562147, "grad_norm": 1.28125, "learning_rate": 0.00040735032081422334, "loss": 4.8459, "mean_token_accuracy": 0.2222399339079857, "num_tokens": 68059488.0, "step": 39235 }, { "entropy": 5.724209833145141, "epoch": 3.0529858004279324, "grad_norm": 1.3125, "learning_rate": 0.00040732790626158257, "loss": 4.8958, "mean_token_accuracy": 0.21424876451492308, "num_tokens": 68068451.0, "step": 39240 }, { "entropy": 5.802888536453247, "epoch": 3.0533748297996497, "grad_norm": 1.3125, "learning_rate": 0.00040730548970107646, "loss": 4.9245, "mean_token_accuracy": 0.20660915225744247, "num_tokens": 68077556.0, "step": 39245 }, { "entropy": 5.710441541671753, "epoch": 3.0537638591713674, "grad_norm": 1.3046875, "learning_rate": 0.0004072830711330451, "loss": 4.8718, "mean_token_accuracy": 0.2087201341986656, "num_tokens": 68086677.0, "step": 39250 }, { "entropy": 5.737341976165771, "epoch": 3.054152888543085, "grad_norm": 1.2578125, "learning_rate": 0.0004072606505578287, "loss": 4.875, "mean_token_accuracy": 0.20944977700710296, "num_tokens": 68094968.0, "step": 39255 }, { "entropy": 5.751121187210083, "epoch": 3.054541917914803, "grad_norm": 1.2890625, "learning_rate": 0.00040723822797576737, "loss": 4.9135, "mean_token_accuracy": 0.2124434530735016, "num_tokens": 68103563.0, "step": 39260 }, { "entropy": 5.743716478347778, "epoch": 3.05493094728652, "grad_norm": 1.2734375, "learning_rate": 0.0004072158033872015, "loss": 4.9657, "mean_token_accuracy": 0.20626651644706726, "num_tokens": 68111571.0, "step": 39265 }, { "entropy": 5.825986528396607, "epoch": 3.0553199766582377, "grad_norm": 1.296875, "learning_rate": 0.0004071933767924713, "loss": 5.1286, "mean_token_accuracy": 0.19529585540294647, "num_tokens": 68119955.0, "step": 39270 }, { "entropy": 5.777480173110962, "epoch": 3.0557090060299554, "grad_norm": 1.328125, "learning_rate": 0.00040717094819191685, "loss": 4.9119, "mean_token_accuracy": 0.21350304931402206, "num_tokens": 68127989.0, "step": 39275 }, { "entropy": 5.70322961807251, "epoch": 3.0560980354016727, "grad_norm": 1.3671875, "learning_rate": 0.00040714851758587875, "loss": 4.7921, "mean_token_accuracy": 0.21863822191953658, "num_tokens": 68136291.0, "step": 39280 }, { "entropy": 5.792049598693848, "epoch": 3.0564870647733904, "grad_norm": 1.234375, "learning_rate": 0.00040712608497469715, "loss": 5.0999, "mean_token_accuracy": 0.20536918044090272, "num_tokens": 68145671.0, "step": 39285 }, { "entropy": 5.748602628707886, "epoch": 3.056876094145108, "grad_norm": 1.375, "learning_rate": 0.0004071036503587126, "loss": 4.8252, "mean_token_accuracy": 0.21815600693225862, "num_tokens": 68154183.0, "step": 39290 }, { "entropy": 5.800015592575074, "epoch": 3.0572651235168253, "grad_norm": 1.453125, "learning_rate": 0.0004070812137382654, "loss": 4.9981, "mean_token_accuracy": 0.2029261603951454, "num_tokens": 68163537.0, "step": 39295 }, { "entropy": 5.729830884933472, "epoch": 3.057654152888543, "grad_norm": 1.3046875, "learning_rate": 0.000407058775113696, "loss": 4.9062, "mean_token_accuracy": 0.21348942518234254, "num_tokens": 68172052.0, "step": 39300 }, { "entropy": 5.762973737716675, "epoch": 3.0580431822602607, "grad_norm": 1.2734375, "learning_rate": 0.0004070363344853449, "loss": 4.9378, "mean_token_accuracy": 0.20955398827791213, "num_tokens": 68180807.0, "step": 39305 }, { "entropy": 5.773127937316895, "epoch": 3.0584322116319784, "grad_norm": 1.3203125, "learning_rate": 0.00040701389185355256, "loss": 4.965, "mean_token_accuracy": 0.20820777118206024, "num_tokens": 68189772.0, "step": 39310 }, { "entropy": 5.888034772872925, "epoch": 3.0588212410036957, "grad_norm": 1.25, "learning_rate": 0.0004069914472186595, "loss": 5.0687, "mean_token_accuracy": 0.20437269210815429, "num_tokens": 68197816.0, "step": 39315 }, { "entropy": 5.7264265537261965, "epoch": 3.0592102703754134, "grad_norm": 1.3203125, "learning_rate": 0.0004069690005810063, "loss": 4.8577, "mean_token_accuracy": 0.22186724692583085, "num_tokens": 68206799.0, "step": 39320 }, { "entropy": 5.88867564201355, "epoch": 3.059599299747131, "grad_norm": 1.2734375, "learning_rate": 0.00040694655194093365, "loss": 5.1158, "mean_token_accuracy": 0.2003360316157341, "num_tokens": 68217107.0, "step": 39325 }, { "entropy": 5.770432758331299, "epoch": 3.0599883291188483, "grad_norm": 1.3203125, "learning_rate": 0.00040692410129878205, "loss": 4.9714, "mean_token_accuracy": 0.21006010323762894, "num_tokens": 68225587.0, "step": 39330 }, { "entropy": 5.822595405578613, "epoch": 3.060377358490566, "grad_norm": 1.3046875, "learning_rate": 0.0004069016486548922, "loss": 5.0018, "mean_token_accuracy": 0.20695305317640306, "num_tokens": 68234090.0, "step": 39335 }, { "entropy": 5.719898080825805, "epoch": 3.0607663878622837, "grad_norm": 1.1796875, "learning_rate": 0.0004068791940096048, "loss": 4.9014, "mean_token_accuracy": 0.21185405999422074, "num_tokens": 68242904.0, "step": 39340 }, { "entropy": 5.777796888351441, "epoch": 3.061155417234001, "grad_norm": 1.2265625, "learning_rate": 0.00040685673736326044, "loss": 5.0086, "mean_token_accuracy": 0.2086978182196617, "num_tokens": 68251232.0, "step": 39345 }, { "entropy": 5.874317073822022, "epoch": 3.0615444466057187, "grad_norm": 1.21875, "learning_rate": 0.0004068342787162001, "loss": 5.004, "mean_token_accuracy": 0.20563454180955887, "num_tokens": 68259658.0, "step": 39350 }, { "entropy": 5.764116621017456, "epoch": 3.0619334759774364, "grad_norm": 1.2265625, "learning_rate": 0.00040681181806876435, "loss": 4.9107, "mean_token_accuracy": 0.2110834464430809, "num_tokens": 68268421.0, "step": 39355 }, { "entropy": 5.775446939468384, "epoch": 3.062322505349154, "grad_norm": 1.3828125, "learning_rate": 0.000406789355421294, "loss": 5.0172, "mean_token_accuracy": 0.2024467632174492, "num_tokens": 68277564.0, "step": 39360 }, { "entropy": 5.794450283050537, "epoch": 3.0627115347208713, "grad_norm": 1.265625, "learning_rate": 0.0004067668907741301, "loss": 4.9947, "mean_token_accuracy": 0.20200214087963103, "num_tokens": 68286305.0, "step": 39365 }, { "entropy": 5.8027863025665285, "epoch": 3.063100564092589, "grad_norm": 1.34375, "learning_rate": 0.0004067444241276132, "loss": 4.9518, "mean_token_accuracy": 0.21113452762365342, "num_tokens": 68294536.0, "step": 39370 }, { "entropy": 5.768355226516723, "epoch": 3.0634895934643067, "grad_norm": 1.3671875, "learning_rate": 0.00040672195548208443, "loss": 4.9028, "mean_token_accuracy": 0.2183467075228691, "num_tokens": 68302995.0, "step": 39375 }, { "entropy": 5.69796347618103, "epoch": 3.063878622836024, "grad_norm": 1.28125, "learning_rate": 0.0004066994848378846, "loss": 4.8945, "mean_token_accuracy": 0.21914955526590346, "num_tokens": 68311643.0, "step": 39380 }, { "entropy": 5.710896730422974, "epoch": 3.0642676522077417, "grad_norm": 1.3359375, "learning_rate": 0.00040667701219535473, "loss": 4.8645, "mean_token_accuracy": 0.21974815130233766, "num_tokens": 68319317.0, "step": 39385 }, { "entropy": 5.707892751693725, "epoch": 3.0646566815794594, "grad_norm": 1.2421875, "learning_rate": 0.0004066545375548358, "loss": 4.8786, "mean_token_accuracy": 0.21046008169651031, "num_tokens": 68328116.0, "step": 39390 }, { "entropy": 5.751673364639283, "epoch": 3.0650457109511766, "grad_norm": 1.3125, "learning_rate": 0.0004066320609166689, "loss": 5.0013, "mean_token_accuracy": 0.20692073702812194, "num_tokens": 68336953.0, "step": 39395 }, { "entropy": 5.741875648498535, "epoch": 3.0654347403228943, "grad_norm": 1.265625, "learning_rate": 0.0004066095822811949, "loss": 4.9631, "mean_token_accuracy": 0.20299272686243058, "num_tokens": 68346152.0, "step": 39400 }, { "entropy": 5.854517126083374, "epoch": 3.065823769694612, "grad_norm": 1.421875, "learning_rate": 0.000406587101648755, "loss": 5.0006, "mean_token_accuracy": 0.20682163387537003, "num_tokens": 68354785.0, "step": 39405 }, { "entropy": 5.829094266891479, "epoch": 3.0662127990663297, "grad_norm": 1.3671875, "learning_rate": 0.0004065646190196902, "loss": 4.9223, "mean_token_accuracy": 0.21770121157169342, "num_tokens": 68363323.0, "step": 39410 }, { "entropy": 5.771778774261475, "epoch": 3.066601828438047, "grad_norm": 1.2890625, "learning_rate": 0.0004065421343943417, "loss": 4.9377, "mean_token_accuracy": 0.20771860480308532, "num_tokens": 68371461.0, "step": 39415 }, { "entropy": 5.780918931961059, "epoch": 3.0669908578097647, "grad_norm": 1.3203125, "learning_rate": 0.00040651964777305074, "loss": 4.97, "mean_token_accuracy": 0.20568937063217163, "num_tokens": 68380356.0, "step": 39420 }, { "entropy": 5.799150514602661, "epoch": 3.0673798871814824, "grad_norm": 1.234375, "learning_rate": 0.0004064971591561585, "loss": 4.9787, "mean_token_accuracy": 0.20905766189098357, "num_tokens": 68389029.0, "step": 39425 }, { "entropy": 5.691110754013062, "epoch": 3.0677689165531996, "grad_norm": 1.2734375, "learning_rate": 0.00040647466854400606, "loss": 4.8327, "mean_token_accuracy": 0.22220267951488495, "num_tokens": 68397481.0, "step": 39430 }, { "entropy": 5.729614496231079, "epoch": 3.0681579459249173, "grad_norm": 1.484375, "learning_rate": 0.0004064521759369349, "loss": 4.9033, "mean_token_accuracy": 0.21523151993751527, "num_tokens": 68405459.0, "step": 39435 }, { "entropy": 5.6570147514343265, "epoch": 3.068546975296635, "grad_norm": 1.2578125, "learning_rate": 0.00040642968133528613, "loss": 4.8756, "mean_token_accuracy": 0.21072223037481308, "num_tokens": 68413840.0, "step": 39440 }, { "entropy": 5.7683299541473385, "epoch": 3.0689360046683523, "grad_norm": 1.46875, "learning_rate": 0.0004064071847394012, "loss": 5.0197, "mean_token_accuracy": 0.20627551674842834, "num_tokens": 68422608.0, "step": 39445 }, { "entropy": 5.7620076656341555, "epoch": 3.06932503404007, "grad_norm": 1.21875, "learning_rate": 0.0004063846861496213, "loss": 4.9214, "mean_token_accuracy": 0.209918749332428, "num_tokens": 68431484.0, "step": 39450 }, { "entropy": 5.772479438781739, "epoch": 3.0697140634117877, "grad_norm": 1.328125, "learning_rate": 0.000406362185566288, "loss": 4.9502, "mean_token_accuracy": 0.20687131136655806, "num_tokens": 68440031.0, "step": 39455 }, { "entropy": 5.7145530700683596, "epoch": 3.0701030927835053, "grad_norm": 1.25, "learning_rate": 0.0004063396829897426, "loss": 5.005, "mean_token_accuracy": 0.20510341376066207, "num_tokens": 68449207.0, "step": 39460 }, { "entropy": 5.813490295410157, "epoch": 3.0704921221552226, "grad_norm": 1.2734375, "learning_rate": 0.0004063171784203265, "loss": 4.9187, "mean_token_accuracy": 0.21120114028453826, "num_tokens": 68457985.0, "step": 39465 }, { "entropy": 5.809205961227417, "epoch": 3.0708811515269403, "grad_norm": 1.2734375, "learning_rate": 0.0004062946718583813, "loss": 4.9857, "mean_token_accuracy": 0.20294529497623442, "num_tokens": 68466364.0, "step": 39470 }, { "entropy": 5.861525774002075, "epoch": 3.071270180898658, "grad_norm": 1.1875, "learning_rate": 0.00040627216330424844, "loss": 5.0024, "mean_token_accuracy": 0.20743025690317154, "num_tokens": 68475250.0, "step": 39475 }, { "entropy": 5.780448484420776, "epoch": 3.0716592102703753, "grad_norm": 1.1953125, "learning_rate": 0.0004062496527582694, "loss": 5.0026, "mean_token_accuracy": 0.20366270691156388, "num_tokens": 68483696.0, "step": 39480 }, { "entropy": 5.7658203601837155, "epoch": 3.072048239642093, "grad_norm": 1.390625, "learning_rate": 0.0004062271402207858, "loss": 4.9485, "mean_token_accuracy": 0.20290126353502275, "num_tokens": 68491988.0, "step": 39485 }, { "entropy": 5.83371000289917, "epoch": 3.0724372690138106, "grad_norm": 1.296875, "learning_rate": 0.0004062046256921391, "loss": 5.026, "mean_token_accuracy": 0.2035382032394409, "num_tokens": 68500477.0, "step": 39490 }, { "entropy": 5.747632074356079, "epoch": 3.072826298385528, "grad_norm": 1.296875, "learning_rate": 0.00040618210917267117, "loss": 4.9052, "mean_token_accuracy": 0.21475630402565002, "num_tokens": 68509363.0, "step": 39495 }, { "entropy": 5.695448350906372, "epoch": 3.0732153277572456, "grad_norm": 1.2890625, "learning_rate": 0.00040615959066272355, "loss": 4.9221, "mean_token_accuracy": 0.209575554728508, "num_tokens": 68518485.0, "step": 39500 }, { "entropy": 5.717804050445556, "epoch": 3.0736043571289633, "grad_norm": 1.359375, "learning_rate": 0.0004061370701626379, "loss": 4.7831, "mean_token_accuracy": 0.2183302477002144, "num_tokens": 68526913.0, "step": 39505 }, { "entropy": 5.764670372009277, "epoch": 3.073993386500681, "grad_norm": 1.2109375, "learning_rate": 0.0004061145476727559, "loss": 4.9315, "mean_token_accuracy": 0.217166905105114, "num_tokens": 68535594.0, "step": 39510 }, { "entropy": 5.752925014495849, "epoch": 3.0743824158723982, "grad_norm": 1.21875, "learning_rate": 0.0004060920231934193, "loss": 4.9296, "mean_token_accuracy": 0.21192675828933716, "num_tokens": 68544380.0, "step": 39515 }, { "entropy": 5.761070966720581, "epoch": 3.074771445244116, "grad_norm": 1.3984375, "learning_rate": 0.0004060694967249699, "loss": 4.9039, "mean_token_accuracy": 0.21581844687461854, "num_tokens": 68552535.0, "step": 39520 }, { "entropy": 5.814458656311035, "epoch": 3.0751604746158336, "grad_norm": 1.2734375, "learning_rate": 0.0004060469682677496, "loss": 5.0861, "mean_token_accuracy": 0.20778799504041673, "num_tokens": 68561920.0, "step": 39525 }, { "entropy": 5.73474817276001, "epoch": 3.075549503987551, "grad_norm": 1.2265625, "learning_rate": 0.00040602443782210003, "loss": 4.8992, "mean_token_accuracy": 0.21437060832977295, "num_tokens": 68571053.0, "step": 39530 }, { "entropy": 5.801544904708862, "epoch": 3.0759385333592686, "grad_norm": 1.296875, "learning_rate": 0.0004060019053883632, "loss": 4.9611, "mean_token_accuracy": 0.2142942577600479, "num_tokens": 68579716.0, "step": 39535 }, { "entropy": 5.750380802154541, "epoch": 3.0763275627309863, "grad_norm": 1.2734375, "learning_rate": 0.000405979370966881, "loss": 4.8986, "mean_token_accuracy": 0.21526418179273604, "num_tokens": 68587982.0, "step": 39540 }, { "entropy": 5.729456281661987, "epoch": 3.0767165921027035, "grad_norm": 1.4296875, "learning_rate": 0.0004059568345579953, "loss": 4.9617, "mean_token_accuracy": 0.20620424151420594, "num_tokens": 68596483.0, "step": 39545 }, { "entropy": 5.807944917678833, "epoch": 3.0771056214744212, "grad_norm": 1.125, "learning_rate": 0.00040593429616204806, "loss": 5.0016, "mean_token_accuracy": 0.20783647447824477, "num_tokens": 68605841.0, "step": 39550 }, { "entropy": 5.777756071090698, "epoch": 3.077494650846139, "grad_norm": 1.2890625, "learning_rate": 0.00040591175577938125, "loss": 4.9836, "mean_token_accuracy": 0.21050036698579788, "num_tokens": 68613912.0, "step": 39555 }, { "entropy": 5.790876245498657, "epoch": 3.0778836802178566, "grad_norm": 1.2734375, "learning_rate": 0.00040588921341033697, "loss": 4.9397, "mean_token_accuracy": 0.21396390348672867, "num_tokens": 68623383.0, "step": 39560 }, { "entropy": 5.844242334365845, "epoch": 3.078272709589574, "grad_norm": 1.2734375, "learning_rate": 0.0004058666690552572, "loss": 4.9944, "mean_token_accuracy": 0.20487958043813706, "num_tokens": 68632099.0, "step": 39565 }, { "entropy": 5.802956008911133, "epoch": 3.0786617389612916, "grad_norm": 1.296875, "learning_rate": 0.00040584412271448407, "loss": 4.9616, "mean_token_accuracy": 0.20975232273340225, "num_tokens": 68640966.0, "step": 39570 }, { "entropy": 5.744576025009155, "epoch": 3.0790507683330093, "grad_norm": 1.2109375, "learning_rate": 0.0004058215743883595, "loss": 4.9578, "mean_token_accuracy": 0.20771755576133727, "num_tokens": 68649608.0, "step": 39575 }, { "entropy": 5.738312530517578, "epoch": 3.0794397977047265, "grad_norm": 1.2109375, "learning_rate": 0.0004057990240772259, "loss": 4.9087, "mean_token_accuracy": 0.22433536648750305, "num_tokens": 68659478.0, "step": 39580 }, { "entropy": 5.825293111801147, "epoch": 3.0798288270764442, "grad_norm": 1.234375, "learning_rate": 0.00040577647178142523, "loss": 5.0061, "mean_token_accuracy": 0.2046568587422371, "num_tokens": 68668401.0, "step": 39585 }, { "entropy": 5.760885715484619, "epoch": 3.080217856448162, "grad_norm": 1.2265625, "learning_rate": 0.0004057539175012998, "loss": 4.8756, "mean_token_accuracy": 0.2100380390882492, "num_tokens": 68676928.0, "step": 39590 }, { "entropy": 5.732700395584106, "epoch": 3.080606885819879, "grad_norm": 1.2578125, "learning_rate": 0.00040573136123719174, "loss": 5.0001, "mean_token_accuracy": 0.20796010494232178, "num_tokens": 68685834.0, "step": 39595 }, { "entropy": 5.735461330413818, "epoch": 3.080995915191597, "grad_norm": 1.3125, "learning_rate": 0.00040570880298944334, "loss": 4.9026, "mean_token_accuracy": 0.22002338021993637, "num_tokens": 68694576.0, "step": 39600 }, { "entropy": 5.756113052368164, "epoch": 3.0813849445633146, "grad_norm": 1.3046875, "learning_rate": 0.0004056862427583969, "loss": 4.8999, "mean_token_accuracy": 0.22082904875278472, "num_tokens": 68703660.0, "step": 39605 }, { "entropy": 5.730007743835449, "epoch": 3.0817739739350323, "grad_norm": 1.25, "learning_rate": 0.0004056636805443948, "loss": 4.989, "mean_token_accuracy": 0.20483615696430207, "num_tokens": 68713263.0, "step": 39610 }, { "entropy": 5.749804496765137, "epoch": 3.0821630033067495, "grad_norm": 1.2890625, "learning_rate": 0.00040564111634777927, "loss": 4.9213, "mean_token_accuracy": 0.20682182908058167, "num_tokens": 68721856.0, "step": 39615 }, { "entropy": 5.80146279335022, "epoch": 3.0825520326784672, "grad_norm": 1.3984375, "learning_rate": 0.00040561855016889276, "loss": 4.9584, "mean_token_accuracy": 0.21185200065374374, "num_tokens": 68729887.0, "step": 39620 }, { "entropy": 5.7741540431976315, "epoch": 3.082941062050185, "grad_norm": 1.296875, "learning_rate": 0.00040559598200807763, "loss": 4.965, "mean_token_accuracy": 0.2116746261715889, "num_tokens": 68739154.0, "step": 39625 }, { "entropy": 5.784882259368897, "epoch": 3.083330091421902, "grad_norm": 1.203125, "learning_rate": 0.0004055734118656764, "loss": 4.9977, "mean_token_accuracy": 0.2023272693157196, "num_tokens": 68748493.0, "step": 39630 }, { "entropy": 5.7853355884552, "epoch": 3.08371912079362, "grad_norm": 1.171875, "learning_rate": 0.0004055508397420314, "loss": 4.9937, "mean_token_accuracy": 0.20792225152254104, "num_tokens": 68757479.0, "step": 39635 }, { "entropy": 5.740694284439087, "epoch": 3.0841081501653376, "grad_norm": 1.2734375, "learning_rate": 0.00040552826563748526, "loss": 4.9507, "mean_token_accuracy": 0.20878757536411285, "num_tokens": 68766438.0, "step": 39640 }, { "entropy": 5.801688241958618, "epoch": 3.0844971795370553, "grad_norm": 1.2890625, "learning_rate": 0.0004055056895523804, "loss": 5.0734, "mean_token_accuracy": 0.20563314557075502, "num_tokens": 68774436.0, "step": 39645 }, { "entropy": 5.785852861404419, "epoch": 3.0848862089087725, "grad_norm": 1.25, "learning_rate": 0.00040548311148705943, "loss": 4.9301, "mean_token_accuracy": 0.21385789513587952, "num_tokens": 68783576.0, "step": 39650 }, { "entropy": 5.768561935424804, "epoch": 3.08527523828049, "grad_norm": 1.2734375, "learning_rate": 0.0004054605314418649, "loss": 4.9106, "mean_token_accuracy": 0.20813797861337663, "num_tokens": 68792793.0, "step": 39655 }, { "entropy": 5.715650939941407, "epoch": 3.085664267652208, "grad_norm": 1.3359375, "learning_rate": 0.00040543794941713944, "loss": 4.9063, "mean_token_accuracy": 0.21397144645452498, "num_tokens": 68801506.0, "step": 39660 }, { "entropy": 5.771109914779663, "epoch": 3.086053297023925, "grad_norm": 1.234375, "learning_rate": 0.0004054153654132258, "loss": 4.9907, "mean_token_accuracy": 0.19881606251001357, "num_tokens": 68810999.0, "step": 39665 }, { "entropy": 5.782782554626465, "epoch": 3.086442326395643, "grad_norm": 1.3515625, "learning_rate": 0.0004053927794304665, "loss": 4.9496, "mean_token_accuracy": 0.21344169080257416, "num_tokens": 68819688.0, "step": 39670 }, { "entropy": 5.760910701751709, "epoch": 3.0868313557673606, "grad_norm": 1.3515625, "learning_rate": 0.0004053701914692043, "loss": 4.9759, "mean_token_accuracy": 0.20160588324069978, "num_tokens": 68828079.0, "step": 39675 }, { "entropy": 5.702848482131958, "epoch": 3.087220385139078, "grad_norm": 1.2109375, "learning_rate": 0.000405347601529782, "loss": 4.8611, "mean_token_accuracy": 0.2177494525909424, "num_tokens": 68836948.0, "step": 39680 }, { "entropy": 5.736922025680542, "epoch": 3.0876094145107955, "grad_norm": 1.328125, "learning_rate": 0.0004053250096125423, "loss": 4.9447, "mean_token_accuracy": 0.21500092893838882, "num_tokens": 68845023.0, "step": 39685 }, { "entropy": 5.729676198959351, "epoch": 3.087998443882513, "grad_norm": 1.296875, "learning_rate": 0.0004053024157178281, "loss": 4.9866, "mean_token_accuracy": 0.20946807861328126, "num_tokens": 68853496.0, "step": 39690 }, { "entropy": 5.80336480140686, "epoch": 3.088387473254231, "grad_norm": 1.34375, "learning_rate": 0.000405279819845982, "loss": 4.9981, "mean_token_accuracy": 0.20667556375265123, "num_tokens": 68861593.0, "step": 39695 }, { "entropy": 5.704226398468018, "epoch": 3.088776502625948, "grad_norm": 1.1640625, "learning_rate": 0.00040525722199734706, "loss": 4.8746, "mean_token_accuracy": 0.22178182601928711, "num_tokens": 68870477.0, "step": 39700 }, { "entropy": 5.761691856384277, "epoch": 3.089165531997666, "grad_norm": 1.375, "learning_rate": 0.0004052346221722661, "loss": 4.9941, "mean_token_accuracy": 0.2066350519657135, "num_tokens": 68878353.0, "step": 39705 }, { "entropy": 5.78854603767395, "epoch": 3.0895545613693836, "grad_norm": 1.34375, "learning_rate": 0.00040521202037108205, "loss": 4.9351, "mean_token_accuracy": 0.20923902988433837, "num_tokens": 68886479.0, "step": 39710 }, { "entropy": 5.713001680374146, "epoch": 3.089943590741101, "grad_norm": 1.1875, "learning_rate": 0.0004051894165941378, "loss": 4.9411, "mean_token_accuracy": 0.2072615623474121, "num_tokens": 68895538.0, "step": 39715 }, { "entropy": 5.694549322128296, "epoch": 3.0903326201128185, "grad_norm": 1.3125, "learning_rate": 0.00040516681084177636, "loss": 4.8907, "mean_token_accuracy": 0.21584295034408568, "num_tokens": 68903893.0, "step": 39720 }, { "entropy": 5.769667053222657, "epoch": 3.090721649484536, "grad_norm": 1.25, "learning_rate": 0.00040514420311434085, "loss": 4.9431, "mean_token_accuracy": 0.20905692726373673, "num_tokens": 68913008.0, "step": 39725 }, { "entropy": 5.680475473403931, "epoch": 3.0911106788562535, "grad_norm": 1.1875, "learning_rate": 0.00040512159341217415, "loss": 4.8747, "mean_token_accuracy": 0.20501249730587007, "num_tokens": 68921405.0, "step": 39730 }, { "entropy": 5.770274305343628, "epoch": 3.091499708227971, "grad_norm": 1.2578125, "learning_rate": 0.00040509898173561934, "loss": 5.0247, "mean_token_accuracy": 0.20507372319698333, "num_tokens": 68930205.0, "step": 39735 }, { "entropy": 5.741654729843139, "epoch": 3.091888737599689, "grad_norm": 1.203125, "learning_rate": 0.0004050763680850196, "loss": 4.8609, "mean_token_accuracy": 0.21534728556871413, "num_tokens": 68938069.0, "step": 39740 }, { "entropy": 5.751278638839722, "epoch": 3.0922777669714065, "grad_norm": 1.2265625, "learning_rate": 0.0004050537524607179, "loss": 4.9352, "mean_token_accuracy": 0.20652651339769362, "num_tokens": 68947229.0, "step": 39745 }, { "entropy": 5.689235591888428, "epoch": 3.092666796343124, "grad_norm": 1.40625, "learning_rate": 0.00040503113486305766, "loss": 4.8943, "mean_token_accuracy": 0.21205852627754213, "num_tokens": 68955773.0, "step": 39750 }, { "entropy": 5.69499397277832, "epoch": 3.0930558257148415, "grad_norm": 1.296875, "learning_rate": 0.00040500851529238184, "loss": 4.9191, "mean_token_accuracy": 0.20899588614702225, "num_tokens": 68964894.0, "step": 39755 }, { "entropy": 5.8441990375518795, "epoch": 3.093444855086559, "grad_norm": 1.3203125, "learning_rate": 0.0004049858937490337, "loss": 5.0542, "mean_token_accuracy": 0.20240325331687928, "num_tokens": 68973965.0, "step": 39760 }, { "entropy": 5.781261873245239, "epoch": 3.0938338844582765, "grad_norm": 1.3671875, "learning_rate": 0.0004049632702333566, "loss": 4.8786, "mean_token_accuracy": 0.21817111372947692, "num_tokens": 68982166.0, "step": 39765 }, { "entropy": 5.716243934631348, "epoch": 3.094222913829994, "grad_norm": 1.328125, "learning_rate": 0.00040494064474569375, "loss": 4.9147, "mean_token_accuracy": 0.21290144473314285, "num_tokens": 68990941.0, "step": 39770 }, { "entropy": 5.712864208221435, "epoch": 3.094611943201712, "grad_norm": 1.296875, "learning_rate": 0.00040491801728638835, "loss": 4.951, "mean_token_accuracy": 0.21585851162672043, "num_tokens": 68999243.0, "step": 39775 }, { "entropy": 5.825770854949951, "epoch": 3.095000972573429, "grad_norm": 1.375, "learning_rate": 0.00040489538785578385, "loss": 4.8893, "mean_token_accuracy": 0.21904394775629044, "num_tokens": 69007547.0, "step": 39780 }, { "entropy": 5.72192964553833, "epoch": 3.095390001945147, "grad_norm": 1.25, "learning_rate": 0.00040487275645422356, "loss": 4.8591, "mean_token_accuracy": 0.21525996774435044, "num_tokens": 69017216.0, "step": 39785 }, { "entropy": 5.728184556961059, "epoch": 3.0957790313168645, "grad_norm": 1.2890625, "learning_rate": 0.000404850123082051, "loss": 4.8913, "mean_token_accuracy": 0.21975920498371124, "num_tokens": 69025482.0, "step": 39790 }, { "entropy": 5.775111103057862, "epoch": 3.096168060688582, "grad_norm": 1.25, "learning_rate": 0.0004048274877396094, "loss": 5.0044, "mean_token_accuracy": 0.20503448843955993, "num_tokens": 69034027.0, "step": 39795 }, { "entropy": 5.7825761318206785, "epoch": 3.0965570900602994, "grad_norm": 1.2421875, "learning_rate": 0.0004048048504272424, "loss": 4.9826, "mean_token_accuracy": 0.203778937458992, "num_tokens": 69042609.0, "step": 39800 }, { "entropy": 5.814303207397461, "epoch": 3.096946119432017, "grad_norm": 1.2734375, "learning_rate": 0.0004047822111452933, "loss": 4.9734, "mean_token_accuracy": 0.21156004965305328, "num_tokens": 69051277.0, "step": 39805 }, { "entropy": 5.799367237091064, "epoch": 3.097335148803735, "grad_norm": 1.2265625, "learning_rate": 0.00040475956989410584, "loss": 4.9105, "mean_token_accuracy": 0.21618585139513016, "num_tokens": 69059424.0, "step": 39810 }, { "entropy": 5.817862939834595, "epoch": 3.097724178175452, "grad_norm": 1.3046875, "learning_rate": 0.0004047369266740233, "loss": 5.0694, "mean_token_accuracy": 0.20799240469932556, "num_tokens": 69068198.0, "step": 39815 }, { "entropy": 5.808486557006836, "epoch": 3.09811320754717, "grad_norm": 1.234375, "learning_rate": 0.00040471428148538944, "loss": 5.0294, "mean_token_accuracy": 0.2039201244711876, "num_tokens": 69077477.0, "step": 39820 }, { "entropy": 5.7450212955474855, "epoch": 3.0985022369188875, "grad_norm": 1.2109375, "learning_rate": 0.0004046916343285479, "loss": 4.9188, "mean_token_accuracy": 0.21374547630548477, "num_tokens": 69086452.0, "step": 39825 }, { "entropy": 5.771339035034179, "epoch": 3.0988912662906047, "grad_norm": 1.3515625, "learning_rate": 0.00040466898520384213, "loss": 5.0065, "mean_token_accuracy": 0.2080787479877472, "num_tokens": 69095191.0, "step": 39830 }, { "entropy": 5.810830402374267, "epoch": 3.0992802956623224, "grad_norm": 1.2578125, "learning_rate": 0.000404646334111616, "loss": 5.0036, "mean_token_accuracy": 0.20813304781913758, "num_tokens": 69104079.0, "step": 39835 }, { "entropy": 5.71195650100708, "epoch": 3.09966932503404, "grad_norm": 1.359375, "learning_rate": 0.0004046236810522131, "loss": 4.9505, "mean_token_accuracy": 0.20611533224582673, "num_tokens": 69113593.0, "step": 39840 }, { "entropy": 5.7583191871643065, "epoch": 3.100058354405758, "grad_norm": 1.2890625, "learning_rate": 0.0004046010260259771, "loss": 4.9689, "mean_token_accuracy": 0.2065710812807083, "num_tokens": 69122610.0, "step": 39845 }, { "entropy": 5.82433066368103, "epoch": 3.100447383777475, "grad_norm": 1.3203125, "learning_rate": 0.00040457836903325177, "loss": 4.9985, "mean_token_accuracy": 0.20595284700393676, "num_tokens": 69130755.0, "step": 39850 }, { "entropy": 5.858370065689087, "epoch": 3.100836413149193, "grad_norm": 1.3125, "learning_rate": 0.00040455571007438104, "loss": 4.9532, "mean_token_accuracy": 0.210130575299263, "num_tokens": 69139008.0, "step": 39855 }, { "entropy": 5.768953895568847, "epoch": 3.1012254425209105, "grad_norm": 1.2265625, "learning_rate": 0.0004045330491497085, "loss": 4.9664, "mean_token_accuracy": 0.21412692666053773, "num_tokens": 69148117.0, "step": 39860 }, { "entropy": 5.743231248855591, "epoch": 3.1016144718926277, "grad_norm": 1.25, "learning_rate": 0.00040451038625957827, "loss": 4.9809, "mean_token_accuracy": 0.20515353679656984, "num_tokens": 69156072.0, "step": 39865 }, { "entropy": 5.702025890350342, "epoch": 3.1020035012643454, "grad_norm": 1.234375, "learning_rate": 0.0004044877214043339, "loss": 4.8446, "mean_token_accuracy": 0.21344499289989471, "num_tokens": 69165026.0, "step": 39870 }, { "entropy": 5.788899993896484, "epoch": 3.102392530636063, "grad_norm": 1.1875, "learning_rate": 0.0004044650545843196, "loss": 4.9961, "mean_token_accuracy": 0.2073343053460121, "num_tokens": 69174283.0, "step": 39875 }, { "entropy": 5.7661449909210205, "epoch": 3.1027815600077804, "grad_norm": 1.25, "learning_rate": 0.000404442385799879, "loss": 5.0441, "mean_token_accuracy": 0.20139690935611726, "num_tokens": 69183335.0, "step": 39880 }, { "entropy": 5.878287744522095, "epoch": 3.103170589379498, "grad_norm": 1.2890625, "learning_rate": 0.0004044197150513564, "loss": 5.0489, "mean_token_accuracy": 0.19943862408399582, "num_tokens": 69192272.0, "step": 39885 }, { "entropy": 5.799424266815185, "epoch": 3.1035596187512158, "grad_norm": 1.3203125, "learning_rate": 0.0004043970423390955, "loss": 4.9849, "mean_token_accuracy": 0.207162544131279, "num_tokens": 69201274.0, "step": 39890 }, { "entropy": 5.815706443786621, "epoch": 3.1039486481229335, "grad_norm": 1.25, "learning_rate": 0.0004043743676634405, "loss": 5.0075, "mean_token_accuracy": 0.20643890351057054, "num_tokens": 69210112.0, "step": 39895 }, { "entropy": 5.858203983306884, "epoch": 3.1043376774946507, "grad_norm": 1.3359375, "learning_rate": 0.0004043516910247353, "loss": 4.9648, "mean_token_accuracy": 0.21568633615970612, "num_tokens": 69218822.0, "step": 39900 }, { "entropy": 5.779646205902099, "epoch": 3.1047267068663684, "grad_norm": 1.25, "learning_rate": 0.0004043290124233242, "loss": 4.9709, "mean_token_accuracy": 0.20721060931682586, "num_tokens": 69227683.0, "step": 39905 }, { "entropy": 5.743604469299316, "epoch": 3.105115736238086, "grad_norm": 1.234375, "learning_rate": 0.0004043063318595511, "loss": 4.9222, "mean_token_accuracy": 0.2093137800693512, "num_tokens": 69236338.0, "step": 39910 }, { "entropy": 5.779919576644898, "epoch": 3.1055047656098034, "grad_norm": 1.3671875, "learning_rate": 0.0004042836493337603, "loss": 4.9892, "mean_token_accuracy": 0.21024879813194275, "num_tokens": 69245094.0, "step": 39915 }, { "entropy": 5.774736309051514, "epoch": 3.105893794981521, "grad_norm": 1.21875, "learning_rate": 0.0004042609648462959, "loss": 4.9029, "mean_token_accuracy": 0.21136984825134278, "num_tokens": 69253791.0, "step": 39920 }, { "entropy": 5.802262449264527, "epoch": 3.1062828243532388, "grad_norm": 1.2421875, "learning_rate": 0.000404238278397502, "loss": 4.9782, "mean_token_accuracy": 0.21265844851732255, "num_tokens": 69262410.0, "step": 39925 }, { "entropy": 5.699108409881592, "epoch": 3.106671853724956, "grad_norm": 1.3046875, "learning_rate": 0.00040421558998772293, "loss": 4.9806, "mean_token_accuracy": 0.2075909599661827, "num_tokens": 69270840.0, "step": 39930 }, { "entropy": 5.709097146987915, "epoch": 3.1070608830966737, "grad_norm": 1.3359375, "learning_rate": 0.000404192899617303, "loss": 4.8394, "mean_token_accuracy": 0.21568297147750853, "num_tokens": 69279385.0, "step": 39935 }, { "entropy": 5.67586669921875, "epoch": 3.1074499124683914, "grad_norm": 1.2734375, "learning_rate": 0.0004041702072865864, "loss": 4.8528, "mean_token_accuracy": 0.21757415533065796, "num_tokens": 69287927.0, "step": 39940 }, { "entropy": 5.787411069869995, "epoch": 3.107838941840109, "grad_norm": 1.203125, "learning_rate": 0.0004041475129959176, "loss": 4.923, "mean_token_accuracy": 0.21662795841693877, "num_tokens": 69297282.0, "step": 39945 }, { "entropy": 5.841622400283813, "epoch": 3.1082279712118264, "grad_norm": 1.28125, "learning_rate": 0.0004041248167456408, "loss": 4.9963, "mean_token_accuracy": 0.21485945731401443, "num_tokens": 69305290.0, "step": 39950 }, { "entropy": 5.753969287872314, "epoch": 3.108617000583544, "grad_norm": 1.25, "learning_rate": 0.0004041021185361004, "loss": 4.887, "mean_token_accuracy": 0.2164387285709381, "num_tokens": 69313971.0, "step": 39955 }, { "entropy": 5.760105228424072, "epoch": 3.1090060299552618, "grad_norm": 1.34375, "learning_rate": 0.0004040794183676409, "loss": 4.9451, "mean_token_accuracy": 0.20944763123989105, "num_tokens": 69322117.0, "step": 39960 }, { "entropy": 5.75281982421875, "epoch": 3.109395059326979, "grad_norm": 1.2890625, "learning_rate": 0.0004040567162406066, "loss": 4.9435, "mean_token_accuracy": 0.2046406701207161, "num_tokens": 69330910.0, "step": 39965 }, { "entropy": 5.828715181350708, "epoch": 3.1097840886986967, "grad_norm": 1.203125, "learning_rate": 0.0004040340121553421, "loss": 4.9832, "mean_token_accuracy": 0.20471545308828354, "num_tokens": 69339917.0, "step": 39970 }, { "entropy": 5.818585062026978, "epoch": 3.1101731180704144, "grad_norm": 1.3515625, "learning_rate": 0.0004040113061121918, "loss": 4.952, "mean_token_accuracy": 0.20726996660232544, "num_tokens": 69348881.0, "step": 39975 }, { "entropy": 5.803955984115601, "epoch": 3.110562147442132, "grad_norm": 1.2265625, "learning_rate": 0.00040398859811150036, "loss": 4.9916, "mean_token_accuracy": 0.20344234257936478, "num_tokens": 69358451.0, "step": 39980 }, { "entropy": 5.77140998840332, "epoch": 3.1109511768138494, "grad_norm": 1.21875, "learning_rate": 0.0004039658881536122, "loss": 4.9456, "mean_token_accuracy": 0.20811627954244613, "num_tokens": 69367899.0, "step": 39985 }, { "entropy": 5.743594646453857, "epoch": 3.111340206185567, "grad_norm": 1.296875, "learning_rate": 0.0004039431762388719, "loss": 4.9652, "mean_token_accuracy": 0.2082249864935875, "num_tokens": 69377862.0, "step": 39990 }, { "entropy": 5.762833786010742, "epoch": 3.1117292355572848, "grad_norm": 1.2578125, "learning_rate": 0.0004039204623676242, "loss": 4.9398, "mean_token_accuracy": 0.21837136000394822, "num_tokens": 69386246.0, "step": 39995 }, { "entropy": 5.758879470825195, "epoch": 3.112118264929002, "grad_norm": 1.359375, "learning_rate": 0.00040389774654021367, "loss": 4.8683, "mean_token_accuracy": 0.22726037502288818, "num_tokens": 69394616.0, "step": 40000 }, { "entropy": 5.71997103691101, "epoch": 3.1125072943007197, "grad_norm": 1.421875, "learning_rate": 0.000403875028756985, "loss": 4.8787, "mean_token_accuracy": 0.21345785707235337, "num_tokens": 69403081.0, "step": 40005 }, { "entropy": 5.731486511230469, "epoch": 3.1128963236724374, "grad_norm": 1.3671875, "learning_rate": 0.0004038523090182829, "loss": 5.0015, "mean_token_accuracy": 0.20684774518013, "num_tokens": 69411819.0, "step": 40010 }, { "entropy": 5.756910181045532, "epoch": 3.1132853530441547, "grad_norm": 1.2890625, "learning_rate": 0.000403829587324452, "loss": 4.9029, "mean_token_accuracy": 0.21279119551181794, "num_tokens": 69419836.0, "step": 40015 }, { "entropy": 5.772934341430664, "epoch": 3.1136743824158724, "grad_norm": 1.2421875, "learning_rate": 0.0004038068636758373, "loss": 4.9409, "mean_token_accuracy": 0.20776625573635102, "num_tokens": 69428524.0, "step": 40020 }, { "entropy": 5.740126466751098, "epoch": 3.11406341178759, "grad_norm": 1.2109375, "learning_rate": 0.0004037841380727834, "loss": 4.9203, "mean_token_accuracy": 0.2105985701084137, "num_tokens": 69436855.0, "step": 40025 }, { "entropy": 5.755681467056275, "epoch": 3.1144524411593073, "grad_norm": 1.3046875, "learning_rate": 0.0004037614105156352, "loss": 4.999, "mean_token_accuracy": 0.2126820743083954, "num_tokens": 69446039.0, "step": 40030 }, { "entropy": 5.7827142715454105, "epoch": 3.114841470531025, "grad_norm": 1.2734375, "learning_rate": 0.0004037386810047376, "loss": 4.9748, "mean_token_accuracy": 0.20763330310583114, "num_tokens": 69454709.0, "step": 40035 }, { "entropy": 5.812428903579712, "epoch": 3.1152304999027427, "grad_norm": 1.3203125, "learning_rate": 0.0004037159495404354, "loss": 4.9488, "mean_token_accuracy": 0.21357353031635284, "num_tokens": 69463983.0, "step": 40040 }, { "entropy": 5.7292510032653805, "epoch": 3.1156195292744604, "grad_norm": 1.296875, "learning_rate": 0.00040369321612307343, "loss": 4.9031, "mean_token_accuracy": 0.20938994288444518, "num_tokens": 69472073.0, "step": 40045 }, { "entropy": 5.7184178829193115, "epoch": 3.1160085586461777, "grad_norm": 1.265625, "learning_rate": 0.00040367048075299684, "loss": 4.9294, "mean_token_accuracy": 0.20204880684614182, "num_tokens": 69480119.0, "step": 40050 }, { "entropy": 5.785224199295044, "epoch": 3.1163975880178953, "grad_norm": 1.3046875, "learning_rate": 0.0004036477434305505, "loss": 4.9855, "mean_token_accuracy": 0.20456364303827285, "num_tokens": 69488517.0, "step": 40055 }, { "entropy": 5.864180088043213, "epoch": 3.116786617389613, "grad_norm": 1.25, "learning_rate": 0.0004036250041560794, "loss": 5.0332, "mean_token_accuracy": 0.210914346575737, "num_tokens": 69496774.0, "step": 40060 }, { "entropy": 5.834379196166992, "epoch": 3.1171756467613303, "grad_norm": 1.2734375, "learning_rate": 0.0004036022629299286, "loss": 5.0205, "mean_token_accuracy": 0.2118321865797043, "num_tokens": 69506015.0, "step": 40065 }, { "entropy": 5.770601844787597, "epoch": 3.117564676133048, "grad_norm": 1.3125, "learning_rate": 0.0004035795197524431, "loss": 4.9738, "mean_token_accuracy": 0.20370077341794968, "num_tokens": 69514392.0, "step": 40070 }, { "entropy": 5.717465591430664, "epoch": 3.1179537055047657, "grad_norm": 1.1875, "learning_rate": 0.0004035567746239681, "loss": 4.8611, "mean_token_accuracy": 0.2185482546687126, "num_tokens": 69523186.0, "step": 40075 }, { "entropy": 5.729820394515992, "epoch": 3.1183427348764834, "grad_norm": 1.28125, "learning_rate": 0.00040353402754484866, "loss": 5.0047, "mean_token_accuracy": 0.19992622137069702, "num_tokens": 69532128.0, "step": 40080 }, { "entropy": 5.761035346984864, "epoch": 3.1187317642482006, "grad_norm": 1.296875, "learning_rate": 0.0004035112785154299, "loss": 4.9264, "mean_token_accuracy": 0.20833849161863327, "num_tokens": 69539846.0, "step": 40085 }, { "entropy": 5.706315517425537, "epoch": 3.1191207936199183, "grad_norm": 1.296875, "learning_rate": 0.00040348852753605707, "loss": 4.8641, "mean_token_accuracy": 0.2099887475371361, "num_tokens": 69548238.0, "step": 40090 }, { "entropy": 5.8265711784362795, "epoch": 3.119509822991636, "grad_norm": 1.203125, "learning_rate": 0.00040346577460707535, "loss": 5.0269, "mean_token_accuracy": 0.20415636897087097, "num_tokens": 69557574.0, "step": 40095 }, { "entropy": 5.774888134002685, "epoch": 3.1198988523633533, "grad_norm": 1.2265625, "learning_rate": 0.00040344301972882997, "loss": 4.8979, "mean_token_accuracy": 0.20915472358465195, "num_tokens": 69565711.0, "step": 40100 }, { "entropy": 5.7147173404693605, "epoch": 3.120287881735071, "grad_norm": 1.3359375, "learning_rate": 0.0004034202629016662, "loss": 4.8809, "mean_token_accuracy": 0.21070350110530853, "num_tokens": 69574589.0, "step": 40105 }, { "entropy": 5.745706796646118, "epoch": 3.1206769111067887, "grad_norm": 1.3515625, "learning_rate": 0.00040339750412592937, "loss": 4.9163, "mean_token_accuracy": 0.2146773710846901, "num_tokens": 69583229.0, "step": 40110 }, { "entropy": 5.818534803390503, "epoch": 3.121065940478506, "grad_norm": 1.1953125, "learning_rate": 0.0004033747434019647, "loss": 4.9924, "mean_token_accuracy": 0.20834937542676926, "num_tokens": 69591727.0, "step": 40115 }, { "entropy": 5.764911794662476, "epoch": 3.1214549698502236, "grad_norm": 1.234375, "learning_rate": 0.00040335198073011765, "loss": 4.884, "mean_token_accuracy": 0.21268773525953294, "num_tokens": 69600192.0, "step": 40120 }, { "entropy": 5.747584199905395, "epoch": 3.1218439992219413, "grad_norm": 1.4140625, "learning_rate": 0.0004033292161107336, "loss": 4.9131, "mean_token_accuracy": 0.21493248641490936, "num_tokens": 69608373.0, "step": 40125 }, { "entropy": 5.7337297916412355, "epoch": 3.122233028593659, "grad_norm": 1.296875, "learning_rate": 0.00040330644954415795, "loss": 4.9374, "mean_token_accuracy": 0.20643920153379441, "num_tokens": 69616140.0, "step": 40130 }, { "entropy": 5.742472076416016, "epoch": 3.1226220579653763, "grad_norm": 1.203125, "learning_rate": 0.0004032836810307362, "loss": 4.9312, "mean_token_accuracy": 0.21549496352672576, "num_tokens": 69624453.0, "step": 40135 }, { "entropy": 5.781766366958618, "epoch": 3.123011087337094, "grad_norm": 1.359375, "learning_rate": 0.0004032609105708137, "loss": 4.9681, "mean_token_accuracy": 0.20875189155340196, "num_tokens": 69633483.0, "step": 40140 }, { "entropy": 5.80789041519165, "epoch": 3.1234001167088117, "grad_norm": 1.359375, "learning_rate": 0.00040323813816473604, "loss": 4.9076, "mean_token_accuracy": 0.21368985027074813, "num_tokens": 69641934.0, "step": 40145 }, { "entropy": 5.70408616065979, "epoch": 3.123789146080529, "grad_norm": 1.2734375, "learning_rate": 0.0004032153638128488, "loss": 4.9016, "mean_token_accuracy": 0.21057101637125014, "num_tokens": 69650694.0, "step": 40150 }, { "entropy": 5.7084331035614015, "epoch": 3.1241781754522466, "grad_norm": 1.15625, "learning_rate": 0.00040319258751549743, "loss": 4.8961, "mean_token_accuracy": 0.21165857017040252, "num_tokens": 69660138.0, "step": 40155 }, { "entropy": 5.827298402786255, "epoch": 3.1245672048239643, "grad_norm": 1.3515625, "learning_rate": 0.00040316980927302765, "loss": 4.9642, "mean_token_accuracy": 0.2076214462518692, "num_tokens": 69668238.0, "step": 40160 }, { "entropy": 5.793161773681641, "epoch": 3.1249562341956816, "grad_norm": 1.2890625, "learning_rate": 0.00040314702908578496, "loss": 4.9855, "mean_token_accuracy": 0.20037219375371934, "num_tokens": 69677228.0, "step": 40165 }, { "entropy": 5.739211463928223, "epoch": 3.1253452635673993, "grad_norm": 1.375, "learning_rate": 0.0004031242469541151, "loss": 4.9002, "mean_token_accuracy": 0.2160044714808464, "num_tokens": 69686337.0, "step": 40170 }, { "entropy": 5.784818840026856, "epoch": 3.125734292939117, "grad_norm": 1.328125, "learning_rate": 0.00040310146287836373, "loss": 4.9565, "mean_token_accuracy": 0.21070991903543473, "num_tokens": 69695368.0, "step": 40175 }, { "entropy": 5.727860832214356, "epoch": 3.1261233223108347, "grad_norm": 1.3046875, "learning_rate": 0.00040307867685887653, "loss": 4.9407, "mean_token_accuracy": 0.2119588315486908, "num_tokens": 69703811.0, "step": 40180 }, { "entropy": 5.719701719284058, "epoch": 3.126512351682552, "grad_norm": 1.3125, "learning_rate": 0.00040305588889599927, "loss": 4.7907, "mean_token_accuracy": 0.2240880087018013, "num_tokens": 69712619.0, "step": 40185 }, { "entropy": 5.776517009735107, "epoch": 3.1269013810542696, "grad_norm": 1.265625, "learning_rate": 0.0004030330989900777, "loss": 5.0145, "mean_token_accuracy": 0.20552337765693665, "num_tokens": 69720945.0, "step": 40190 }, { "entropy": 5.80275182723999, "epoch": 3.1272904104259873, "grad_norm": 1.3125, "learning_rate": 0.00040301030714145764, "loss": 4.9651, "mean_token_accuracy": 0.20956362634897233, "num_tokens": 69729827.0, "step": 40195 }, { "entropy": 5.762563753128052, "epoch": 3.1276794397977046, "grad_norm": 1.296875, "learning_rate": 0.000402987513350485, "loss": 4.9453, "mean_token_accuracy": 0.208761465549469, "num_tokens": 69738719.0, "step": 40200 }, { "entropy": 5.788491487503052, "epoch": 3.1280684691694223, "grad_norm": 1.1484375, "learning_rate": 0.0004029647176175055, "loss": 4.9438, "mean_token_accuracy": 0.20913354754447938, "num_tokens": 69747379.0, "step": 40205 }, { "entropy": 5.695906305313111, "epoch": 3.12845749854114, "grad_norm": 1.265625, "learning_rate": 0.00040294191994286513, "loss": 4.8462, "mean_token_accuracy": 0.2192736178636551, "num_tokens": 69755926.0, "step": 40210 }, { "entropy": 5.807142639160157, "epoch": 3.1288465279128572, "grad_norm": 1.296875, "learning_rate": 0.00040291912032690963, "loss": 4.9715, "mean_token_accuracy": 0.20440924614667894, "num_tokens": 69763851.0, "step": 40215 }, { "entropy": 5.7412341117858885, "epoch": 3.129235557284575, "grad_norm": 1.265625, "learning_rate": 0.0004028963187699852, "loss": 4.9061, "mean_token_accuracy": 0.21757467985153198, "num_tokens": 69771332.0, "step": 40220 }, { "entropy": 5.723199081420899, "epoch": 3.1296245866562926, "grad_norm": 1.390625, "learning_rate": 0.0004028735152724377, "loss": 4.9039, "mean_token_accuracy": 0.2127419590950012, "num_tokens": 69779878.0, "step": 40225 }, { "entropy": 5.764788961410522, "epoch": 3.1300136160280103, "grad_norm": 1.25, "learning_rate": 0.00040285070983461313, "loss": 5.0115, "mean_token_accuracy": 0.20641480386257172, "num_tokens": 69788564.0, "step": 40230 }, { "entropy": 5.748546504974366, "epoch": 3.1304026453997276, "grad_norm": 1.2578125, "learning_rate": 0.00040282790245685753, "loss": 4.9815, "mean_token_accuracy": 0.20966606587171555, "num_tokens": 69797512.0, "step": 40235 }, { "entropy": 5.778366374969482, "epoch": 3.1307916747714453, "grad_norm": 1.328125, "learning_rate": 0.000402805093139517, "loss": 4.9323, "mean_token_accuracy": 0.21966800689697266, "num_tokens": 69806103.0, "step": 40240 }, { "entropy": 5.768709373474121, "epoch": 3.131180704143163, "grad_norm": 1.359375, "learning_rate": 0.0004027822818829375, "loss": 4.9617, "mean_token_accuracy": 0.20645710378885268, "num_tokens": 69814881.0, "step": 40245 }, { "entropy": 5.78711428642273, "epoch": 3.13156973351488, "grad_norm": 1.328125, "learning_rate": 0.0004027594686874653, "loss": 4.9619, "mean_token_accuracy": 0.20815130770206453, "num_tokens": 69823507.0, "step": 40250 }, { "entropy": 5.71212477684021, "epoch": 3.131958762886598, "grad_norm": 1.3359375, "learning_rate": 0.00040273665355344655, "loss": 4.9072, "mean_token_accuracy": 0.20611684918403625, "num_tokens": 69832960.0, "step": 40255 }, { "entropy": 5.783475160598755, "epoch": 3.1323477922583156, "grad_norm": 1.3515625, "learning_rate": 0.0004027138364812274, "loss": 4.9678, "mean_token_accuracy": 0.20752111375331878, "num_tokens": 69841216.0, "step": 40260 }, { "entropy": 5.793345642089844, "epoch": 3.132736821630033, "grad_norm": 1.3359375, "learning_rate": 0.0004026910174711541, "loss": 5.0424, "mean_token_accuracy": 0.19960632026195527, "num_tokens": 69849847.0, "step": 40265 }, { "entropy": 5.7972229480743405, "epoch": 3.1331258510017506, "grad_norm": 1.2578125, "learning_rate": 0.00040266819652357266, "loss": 5.0644, "mean_token_accuracy": 0.2015209123492241, "num_tokens": 69859616.0, "step": 40270 }, { "entropy": 5.809613370895386, "epoch": 3.1335148803734683, "grad_norm": 1.203125, "learning_rate": 0.00040264537363882976, "loss": 4.9863, "mean_token_accuracy": 0.2072151258587837, "num_tokens": 69869203.0, "step": 40275 }, { "entropy": 5.774465894699096, "epoch": 3.133903909745186, "grad_norm": 1.4140625, "learning_rate": 0.00040262254881727135, "loss": 4.8825, "mean_token_accuracy": 0.2096211537718773, "num_tokens": 69877127.0, "step": 40280 }, { "entropy": 5.8232190132141115, "epoch": 3.134292939116903, "grad_norm": 1.2421875, "learning_rate": 0.00040259972205924395, "loss": 5.0974, "mean_token_accuracy": 0.2029370293021202, "num_tokens": 69885676.0, "step": 40285 }, { "entropy": 5.809529733657837, "epoch": 3.134681968488621, "grad_norm": 1.21875, "learning_rate": 0.00040257689336509385, "loss": 4.9875, "mean_token_accuracy": 0.2061689391732216, "num_tokens": 69894818.0, "step": 40290 }, { "entropy": 5.800390958786011, "epoch": 3.1350709978603386, "grad_norm": 1.40625, "learning_rate": 0.0004025540627351675, "loss": 4.9396, "mean_token_accuracy": 0.21616474837064742, "num_tokens": 69902786.0, "step": 40295 }, { "entropy": 5.7915675163269045, "epoch": 3.135460027232056, "grad_norm": 1.296875, "learning_rate": 0.0004025312301698112, "loss": 4.9433, "mean_token_accuracy": 0.2142033040523529, "num_tokens": 69911343.0, "step": 40300 }, { "entropy": 5.772700691223145, "epoch": 3.1358490566037736, "grad_norm": 1.328125, "learning_rate": 0.0004025083956693715, "loss": 4.9793, "mean_token_accuracy": 0.20689168125391005, "num_tokens": 69920234.0, "step": 40305 }, { "entropy": 5.840386867523193, "epoch": 3.1362380859754913, "grad_norm": 1.3828125, "learning_rate": 0.0004024855592341948, "loss": 4.9746, "mean_token_accuracy": 0.20451634675264357, "num_tokens": 69928680.0, "step": 40310 }, { "entropy": 5.800275611877441, "epoch": 3.136627115347209, "grad_norm": 1.359375, "learning_rate": 0.0004024627208646277, "loss": 4.939, "mean_token_accuracy": 0.2186925917863846, "num_tokens": 69937020.0, "step": 40315 }, { "entropy": 5.780449962615966, "epoch": 3.137016144718926, "grad_norm": 1.3125, "learning_rate": 0.00040243988056101667, "loss": 4.9384, "mean_token_accuracy": 0.2118329092860222, "num_tokens": 69946402.0, "step": 40320 }, { "entropy": 5.804786300659179, "epoch": 3.137405174090644, "grad_norm": 1.3828125, "learning_rate": 0.0004024170383237083, "loss": 4.9575, "mean_token_accuracy": 0.21640669405460358, "num_tokens": 69954386.0, "step": 40325 }, { "entropy": 5.708887052536011, "epoch": 3.1377942034623616, "grad_norm": 1.28125, "learning_rate": 0.0004023941941530492, "loss": 4.805, "mean_token_accuracy": 0.22247124761343, "num_tokens": 69962825.0, "step": 40330 }, { "entropy": 5.799943828582764, "epoch": 3.138183232834079, "grad_norm": 1.2890625, "learning_rate": 0.000402371348049386, "loss": 4.9917, "mean_token_accuracy": 0.21713106334209442, "num_tokens": 69971726.0, "step": 40335 }, { "entropy": 5.805524635314941, "epoch": 3.1385722622057965, "grad_norm": 1.34375, "learning_rate": 0.0004023485000130653, "loss": 4.9588, "mean_token_accuracy": 0.21000262796878816, "num_tokens": 69979891.0, "step": 40340 }, { "entropy": 5.797172880172729, "epoch": 3.1389612915775142, "grad_norm": 1.359375, "learning_rate": 0.00040232565004443373, "loss": 4.8995, "mean_token_accuracy": 0.21236534863710405, "num_tokens": 69988052.0, "step": 40345 }, { "entropy": 5.772657251358032, "epoch": 3.1393503209492315, "grad_norm": 1.328125, "learning_rate": 0.0004023027981438382, "loss": 4.9191, "mean_token_accuracy": 0.20967763364315034, "num_tokens": 69996221.0, "step": 40350 }, { "entropy": 5.758850812911987, "epoch": 3.139739350320949, "grad_norm": 1.265625, "learning_rate": 0.00040227994431162517, "loss": 4.9819, "mean_token_accuracy": 0.2084525480866432, "num_tokens": 70004928.0, "step": 40355 }, { "entropy": 5.725823783874512, "epoch": 3.140128379692667, "grad_norm": 1.203125, "learning_rate": 0.00040225708854814174, "loss": 4.951, "mean_token_accuracy": 0.20476307719945908, "num_tokens": 70013525.0, "step": 40360 }, { "entropy": 5.855274105072022, "epoch": 3.140517409064384, "grad_norm": 1.234375, "learning_rate": 0.0004022342308537345, "loss": 4.9968, "mean_token_accuracy": 0.2048245370388031, "num_tokens": 70021845.0, "step": 40365 }, { "entropy": 5.822385311126709, "epoch": 3.140906438436102, "grad_norm": 1.296875, "learning_rate": 0.0004022113712287503, "loss": 4.9545, "mean_token_accuracy": 0.20571640729904175, "num_tokens": 70030370.0, "step": 40370 }, { "entropy": 5.753666543960572, "epoch": 3.1412954678078195, "grad_norm": 1.2578125, "learning_rate": 0.000402188509673536, "loss": 4.9699, "mean_token_accuracy": 0.20837608426809312, "num_tokens": 70038555.0, "step": 40375 }, { "entropy": 5.800904607772827, "epoch": 3.1416844971795372, "grad_norm": 1.2421875, "learning_rate": 0.00040216564618843854, "loss": 4.9472, "mean_token_accuracy": 0.21226516515016555, "num_tokens": 70047416.0, "step": 40380 }, { "entropy": 5.713302707672119, "epoch": 3.1420735265512545, "grad_norm": 1.375, "learning_rate": 0.0004021427807738048, "loss": 4.9711, "mean_token_accuracy": 0.20872324109077453, "num_tokens": 70056058.0, "step": 40385 }, { "entropy": 5.7992321968078615, "epoch": 3.142462555922972, "grad_norm": 1.3984375, "learning_rate": 0.0004021199134299817, "loss": 4.9485, "mean_token_accuracy": 0.21376678347587585, "num_tokens": 70064020.0, "step": 40390 }, { "entropy": 5.7119194030761715, "epoch": 3.14285158529469, "grad_norm": 1.21875, "learning_rate": 0.00040209704415731623, "loss": 4.922, "mean_token_accuracy": 0.2093120351433754, "num_tokens": 70072675.0, "step": 40395 }, { "entropy": 5.800027322769165, "epoch": 3.143240614666407, "grad_norm": 1.3359375, "learning_rate": 0.00040207417295615546, "loss": 4.8997, "mean_token_accuracy": 0.21878969222307204, "num_tokens": 70081061.0, "step": 40400 }, { "entropy": 5.825996780395508, "epoch": 3.143629644038125, "grad_norm": 1.2734375, "learning_rate": 0.00040205129982684635, "loss": 4.9064, "mean_token_accuracy": 0.2088153064250946, "num_tokens": 70089837.0, "step": 40405 }, { "entropy": 5.735142040252685, "epoch": 3.1440186734098425, "grad_norm": 1.25, "learning_rate": 0.00040202842476973606, "loss": 4.9428, "mean_token_accuracy": 0.20859071761369705, "num_tokens": 70099638.0, "step": 40410 }, { "entropy": 5.783826208114624, "epoch": 3.1444077027815602, "grad_norm": 1.28125, "learning_rate": 0.00040200554778517154, "loss": 4.9841, "mean_token_accuracy": 0.2076577991247177, "num_tokens": 70108156.0, "step": 40415 }, { "entropy": 5.82903265953064, "epoch": 3.1447967321532775, "grad_norm": 1.3046875, "learning_rate": 0.00040198266887349994, "loss": 4.9933, "mean_token_accuracy": 0.21201052367687226, "num_tokens": 70116627.0, "step": 40420 }, { "entropy": 5.8483398914337155, "epoch": 3.145185761524995, "grad_norm": 1.328125, "learning_rate": 0.00040195978803506853, "loss": 5.018, "mean_token_accuracy": 0.19994427263736725, "num_tokens": 70124796.0, "step": 40425 }, { "entropy": 5.801357126235962, "epoch": 3.145574790896713, "grad_norm": 1.234375, "learning_rate": 0.00040193690527022443, "loss": 4.9857, "mean_token_accuracy": 0.21305125653743745, "num_tokens": 70134047.0, "step": 40430 }, { "entropy": 5.7096950054168705, "epoch": 3.14596382026843, "grad_norm": 1.3359375, "learning_rate": 0.00040191402057931474, "loss": 4.8684, "mean_token_accuracy": 0.21318823397159575, "num_tokens": 70142706.0, "step": 40435 }, { "entropy": 5.832435083389282, "epoch": 3.146352849640148, "grad_norm": 1.21875, "learning_rate": 0.0004018911339626869, "loss": 4.9832, "mean_token_accuracy": 0.20831513702869414, "num_tokens": 70151775.0, "step": 40440 }, { "entropy": 5.807785558700561, "epoch": 3.1467418790118655, "grad_norm": 1.2265625, "learning_rate": 0.000401868245420688, "loss": 4.9249, "mean_token_accuracy": 0.21113147288560868, "num_tokens": 70160208.0, "step": 40445 }, { "entropy": 5.77264404296875, "epoch": 3.147130908383583, "grad_norm": 1.3359375, "learning_rate": 0.00040184535495366543, "loss": 4.989, "mean_token_accuracy": 0.21360815167427064, "num_tokens": 70168881.0, "step": 40450 }, { "entropy": 5.816143274307251, "epoch": 3.1475199377553005, "grad_norm": 1.3515625, "learning_rate": 0.0004018224625619664, "loss": 4.9311, "mean_token_accuracy": 0.21645697504281997, "num_tokens": 70176862.0, "step": 40455 }, { "entropy": 5.79076886177063, "epoch": 3.147908967127018, "grad_norm": 1.296875, "learning_rate": 0.00040179956824593847, "loss": 4.8695, "mean_token_accuracy": 0.2162155419588089, "num_tokens": 70185199.0, "step": 40460 }, { "entropy": 5.735165977478028, "epoch": 3.1482979964987354, "grad_norm": 1.25, "learning_rate": 0.00040177667200592894, "loss": 4.9067, "mean_token_accuracy": 0.2139909416437149, "num_tokens": 70193323.0, "step": 40465 }, { "entropy": 5.807195091247559, "epoch": 3.148687025870453, "grad_norm": 1.2109375, "learning_rate": 0.0004017537738422852, "loss": 4.9259, "mean_token_accuracy": 0.20806028842926025, "num_tokens": 70202082.0, "step": 40470 }, { "entropy": 5.783674907684326, "epoch": 3.149076055242171, "grad_norm": 1.2890625, "learning_rate": 0.00040173087375535457, "loss": 4.9956, "mean_token_accuracy": 0.21037215292453765, "num_tokens": 70211504.0, "step": 40475 }, { "entropy": 5.8820127010345455, "epoch": 3.1494650846138885, "grad_norm": 1.4296875, "learning_rate": 0.00040170797174548476, "loss": 5.0488, "mean_token_accuracy": 0.19981947392225266, "num_tokens": 70219717.0, "step": 40480 }, { "entropy": 5.796587991714477, "epoch": 3.1498541139856058, "grad_norm": 1.2109375, "learning_rate": 0.00040168506781302303, "loss": 4.9959, "mean_token_accuracy": 0.21511065512895583, "num_tokens": 70228877.0, "step": 40485 }, { "entropy": 5.741739320755005, "epoch": 3.1502431433573235, "grad_norm": 1.2890625, "learning_rate": 0.0004016621619583171, "loss": 4.8975, "mean_token_accuracy": 0.21400002390146255, "num_tokens": 70237538.0, "step": 40490 }, { "entropy": 5.741085338592529, "epoch": 3.150632172729041, "grad_norm": 1.375, "learning_rate": 0.00040163925418171454, "loss": 4.927, "mean_token_accuracy": 0.2104877158999443, "num_tokens": 70245977.0, "step": 40495 }, { "entropy": 5.721928215026855, "epoch": 3.1510212021007584, "grad_norm": 1.234375, "learning_rate": 0.0004016163444835628, "loss": 4.9406, "mean_token_accuracy": 0.20665406286716462, "num_tokens": 70255262.0, "step": 40500 }, { "entropy": 5.733925437927246, "epoch": 3.151410231472476, "grad_norm": 1.234375, "learning_rate": 0.0004015934328642096, "loss": 4.801, "mean_token_accuracy": 0.2246836617588997, "num_tokens": 70263999.0, "step": 40505 }, { "entropy": 5.79132661819458, "epoch": 3.151799260844194, "grad_norm": 1.2421875, "learning_rate": 0.00040157051932400244, "loss": 4.9322, "mean_token_accuracy": 0.20691009163856505, "num_tokens": 70272228.0, "step": 40510 }, { "entropy": 5.752480316162109, "epoch": 3.1521882902159115, "grad_norm": 1.1953125, "learning_rate": 0.0004015476038632892, "loss": 4.9635, "mean_token_accuracy": 0.20848760902881622, "num_tokens": 70281818.0, "step": 40515 }, { "entropy": 5.770262098312378, "epoch": 3.1525773195876288, "grad_norm": 1.3125, "learning_rate": 0.0004015246864824175, "loss": 4.9955, "mean_token_accuracy": 0.2033643290400505, "num_tokens": 70290298.0, "step": 40520 }, { "entropy": 5.766208171844482, "epoch": 3.1529663489593465, "grad_norm": 1.3671875, "learning_rate": 0.00040150176718173504, "loss": 4.8753, "mean_token_accuracy": 0.21927398592233657, "num_tokens": 70299166.0, "step": 40525 }, { "entropy": 5.777509498596191, "epoch": 3.153355378331064, "grad_norm": 1.2890625, "learning_rate": 0.0004014788459615896, "loss": 4.8983, "mean_token_accuracy": 0.21155697107315063, "num_tokens": 70308110.0, "step": 40530 }, { "entropy": 5.755088138580322, "epoch": 3.1537444077027814, "grad_norm": 1.21875, "learning_rate": 0.0004014559228223291, "loss": 4.8356, "mean_token_accuracy": 0.21958639174699784, "num_tokens": 70317270.0, "step": 40535 }, { "entropy": 5.8350931167602536, "epoch": 3.154133437074499, "grad_norm": 1.265625, "learning_rate": 0.00040143299776430115, "loss": 5.0148, "mean_token_accuracy": 0.2037108689546585, "num_tokens": 70326078.0, "step": 40540 }, { "entropy": 5.758147525787353, "epoch": 3.154522466446217, "grad_norm": 1.3125, "learning_rate": 0.0004014100707878536, "loss": 4.9386, "mean_token_accuracy": 0.2183254450559616, "num_tokens": 70334388.0, "step": 40545 }, { "entropy": 5.793973207473755, "epoch": 3.154911495817934, "grad_norm": 1.328125, "learning_rate": 0.00040138714189333455, "loss": 4.9462, "mean_token_accuracy": 0.21137861013412476, "num_tokens": 70342844.0, "step": 40550 }, { "entropy": 5.841645193099976, "epoch": 3.1553005251896518, "grad_norm": 1.3203125, "learning_rate": 0.00040136421108109176, "loss": 5.0615, "mean_token_accuracy": 0.20228242725133896, "num_tokens": 70351331.0, "step": 40555 }, { "entropy": 5.784849977493286, "epoch": 3.1556895545613695, "grad_norm": 1.2734375, "learning_rate": 0.0004013412783514732, "loss": 4.9855, "mean_token_accuracy": 0.2051815703511238, "num_tokens": 70359573.0, "step": 40560 }, { "entropy": 5.813953828811646, "epoch": 3.156078583933087, "grad_norm": 1.421875, "learning_rate": 0.0004013183437048268, "loss": 4.9288, "mean_token_accuracy": 0.2200290560722351, "num_tokens": 70367586.0, "step": 40565 }, { "entropy": 5.7882664680480955, "epoch": 3.1564676133048044, "grad_norm": 1.28125, "learning_rate": 0.00040129540714150066, "loss": 4.8716, "mean_token_accuracy": 0.2207568883895874, "num_tokens": 70376399.0, "step": 40570 }, { "entropy": 5.773684358596801, "epoch": 3.156856642676522, "grad_norm": 1.1796875, "learning_rate": 0.0004012724686618427, "loss": 4.9885, "mean_token_accuracy": 0.2058894231915474, "num_tokens": 70385221.0, "step": 40575 }, { "entropy": 5.799622344970703, "epoch": 3.15724567204824, "grad_norm": 1.234375, "learning_rate": 0.000401249528266201, "loss": 5.0015, "mean_token_accuracy": 0.20201784670352935, "num_tokens": 70393844.0, "step": 40580 }, { "entropy": 5.789383268356323, "epoch": 3.157634701419957, "grad_norm": 1.3671875, "learning_rate": 0.00040122658595492366, "loss": 4.8791, "mean_token_accuracy": 0.2104182556271553, "num_tokens": 70402417.0, "step": 40585 }, { "entropy": 5.812401199340821, "epoch": 3.1580237307916748, "grad_norm": 1.28125, "learning_rate": 0.0004012036417283588, "loss": 4.8935, "mean_token_accuracy": 0.22092067450284958, "num_tokens": 70410932.0, "step": 40590 }, { "entropy": 5.723434495925903, "epoch": 3.1584127601633925, "grad_norm": 1.234375, "learning_rate": 0.00040118069558685456, "loss": 4.8973, "mean_token_accuracy": 0.21449708044528962, "num_tokens": 70419528.0, "step": 40595 }, { "entropy": 5.722709369659424, "epoch": 3.1588017895351097, "grad_norm": 1.375, "learning_rate": 0.00040115774753075905, "loss": 4.9814, "mean_token_accuracy": 0.20817819237709045, "num_tokens": 70428220.0, "step": 40600 }, { "entropy": 5.678956127166748, "epoch": 3.1591908189068274, "grad_norm": 1.3203125, "learning_rate": 0.0004011347975604206, "loss": 4.8472, "mean_token_accuracy": 0.2154455840587616, "num_tokens": 70436155.0, "step": 40605 }, { "entropy": 5.780241680145264, "epoch": 3.159579848278545, "grad_norm": 1.2890625, "learning_rate": 0.0004011118456761873, "loss": 4.9892, "mean_token_accuracy": 0.21611931473016738, "num_tokens": 70445618.0, "step": 40610 }, { "entropy": 5.772500514984131, "epoch": 3.159968877650263, "grad_norm": 1.2109375, "learning_rate": 0.0004010888918784075, "loss": 4.8988, "mean_token_accuracy": 0.21512389332056045, "num_tokens": 70454681.0, "step": 40615 }, { "entropy": 5.71812071800232, "epoch": 3.16035790702198, "grad_norm": 1.328125, "learning_rate": 0.0004010659361674294, "loss": 4.8745, "mean_token_accuracy": 0.2171442687511444, "num_tokens": 70463408.0, "step": 40620 }, { "entropy": 5.794805717468262, "epoch": 3.1607469363936977, "grad_norm": 1.3515625, "learning_rate": 0.00040104297854360145, "loss": 5.0155, "mean_token_accuracy": 0.20643580406904222, "num_tokens": 70472010.0, "step": 40625 }, { "entropy": 5.770219516754151, "epoch": 3.1611359657654154, "grad_norm": 1.3125, "learning_rate": 0.0004010200190072719, "loss": 4.9565, "mean_token_accuracy": 0.20682399421930314, "num_tokens": 70480869.0, "step": 40630 }, { "entropy": 5.774526977539063, "epoch": 3.1615249951371327, "grad_norm": 1.203125, "learning_rate": 0.0004009970575587891, "loss": 4.9487, "mean_token_accuracy": 0.20908634811639787, "num_tokens": 70489651.0, "step": 40635 }, { "entropy": 5.743451976776123, "epoch": 3.1619140245088504, "grad_norm": 1.3203125, "learning_rate": 0.0004009740941985016, "loss": 4.9166, "mean_token_accuracy": 0.20639913976192475, "num_tokens": 70498332.0, "step": 40640 }, { "entropy": 5.812713241577148, "epoch": 3.162303053880568, "grad_norm": 1.359375, "learning_rate": 0.0004009511289267576, "loss": 5.057, "mean_token_accuracy": 0.1950007990002632, "num_tokens": 70507504.0, "step": 40645 }, { "entropy": 5.837427425384521, "epoch": 3.1626920832522853, "grad_norm": 1.265625, "learning_rate": 0.0004009281617439058, "loss": 4.991, "mean_token_accuracy": 0.20800370424985887, "num_tokens": 70516560.0, "step": 40650 }, { "entropy": 5.791640281677246, "epoch": 3.163081112624003, "grad_norm": 1.296875, "learning_rate": 0.0004009051926502945, "loss": 4.9372, "mean_token_accuracy": 0.21466469317674636, "num_tokens": 70524387.0, "step": 40655 }, { "entropy": 5.751120901107788, "epoch": 3.1634701419957207, "grad_norm": 1.3203125, "learning_rate": 0.00040088222164627233, "loss": 4.984, "mean_token_accuracy": 0.21908407658338547, "num_tokens": 70533393.0, "step": 40660 }, { "entropy": 5.731262159347534, "epoch": 3.1638591713674384, "grad_norm": 1.265625, "learning_rate": 0.00040085924873218783, "loss": 4.8886, "mean_token_accuracy": 0.2167889416217804, "num_tokens": 70542353.0, "step": 40665 }, { "entropy": 5.74254093170166, "epoch": 3.1642482007391557, "grad_norm": 1.2890625, "learning_rate": 0.0004008362739083895, "loss": 4.9108, "mean_token_accuracy": 0.20613089054822922, "num_tokens": 70550543.0, "step": 40670 }, { "entropy": 5.788683080673218, "epoch": 3.1646372301108734, "grad_norm": 1.2734375, "learning_rate": 0.000400813297175226, "loss": 4.9191, "mean_token_accuracy": 0.20985841602087021, "num_tokens": 70558671.0, "step": 40675 }, { "entropy": 5.686343431472778, "epoch": 3.165026259482591, "grad_norm": 1.3359375, "learning_rate": 0.000400790318533046, "loss": 4.8425, "mean_token_accuracy": 0.22043225467205046, "num_tokens": 70566938.0, "step": 40680 }, { "entropy": 5.819155263900757, "epoch": 3.1654152888543083, "grad_norm": 1.28125, "learning_rate": 0.00040076733798219817, "loss": 5.0235, "mean_token_accuracy": 0.20707891881465912, "num_tokens": 70575281.0, "step": 40685 }, { "entropy": 5.725153255462646, "epoch": 3.165804318226026, "grad_norm": 1.328125, "learning_rate": 0.0004007443555230312, "loss": 4.9188, "mean_token_accuracy": 0.20900021344423295, "num_tokens": 70584543.0, "step": 40690 }, { "entropy": 5.792263746261597, "epoch": 3.1661933475977437, "grad_norm": 1.25, "learning_rate": 0.00040072137115589366, "loss": 4.9783, "mean_token_accuracy": 0.20867249816656114, "num_tokens": 70594385.0, "step": 40695 }, { "entropy": 5.7770153999328615, "epoch": 3.166582376969461, "grad_norm": 1.359375, "learning_rate": 0.0004006983848811345, "loss": 4.9393, "mean_token_accuracy": 0.2072891801595688, "num_tokens": 70602842.0, "step": 40700 }, { "entropy": 5.807711505889893, "epoch": 3.1669714063411787, "grad_norm": 1.2890625, "learning_rate": 0.00040067539669910235, "loss": 4.9766, "mean_token_accuracy": 0.20777564644813537, "num_tokens": 70611845.0, "step": 40705 }, { "entropy": 5.823179817199707, "epoch": 3.1673604357128964, "grad_norm": 1.2109375, "learning_rate": 0.0004006524066101461, "loss": 5.0117, "mean_token_accuracy": 0.2061358168721199, "num_tokens": 70621351.0, "step": 40710 }, { "entropy": 5.787201547622681, "epoch": 3.167749465084614, "grad_norm": 1.3828125, "learning_rate": 0.0004006294146146146, "loss": 4.9875, "mean_token_accuracy": 0.20568498373031616, "num_tokens": 70629765.0, "step": 40715 }, { "entropy": 5.8655524253845215, "epoch": 3.1681384944563313, "grad_norm": 1.3125, "learning_rate": 0.0004006064207128567, "loss": 5.0271, "mean_token_accuracy": 0.20539396107196808, "num_tokens": 70637812.0, "step": 40720 }, { "entropy": 5.836438798904419, "epoch": 3.168527523828049, "grad_norm": 1.2421875, "learning_rate": 0.00040058342490522134, "loss": 4.9673, "mean_token_accuracy": 0.20747561901807784, "num_tokens": 70647268.0, "step": 40725 }, { "entropy": 5.692821598052978, "epoch": 3.1689165531997667, "grad_norm": 1.25, "learning_rate": 0.0004005604271920573, "loss": 4.8071, "mean_token_accuracy": 0.21917926967144014, "num_tokens": 70655911.0, "step": 40730 }, { "entropy": 5.709390163421631, "epoch": 3.169305582571484, "grad_norm": 1.203125, "learning_rate": 0.00040053742757371365, "loss": 4.8972, "mean_token_accuracy": 0.21807666569948198, "num_tokens": 70664323.0, "step": 40735 }, { "entropy": 5.715005731582641, "epoch": 3.1696946119432017, "grad_norm": 1.21875, "learning_rate": 0.0004005144260505394, "loss": 4.8949, "mean_token_accuracy": 0.2173560753464699, "num_tokens": 70673081.0, "step": 40740 }, { "entropy": 5.748438692092895, "epoch": 3.1700836413149194, "grad_norm": 1.2890625, "learning_rate": 0.0004004914226228834, "loss": 4.9496, "mean_token_accuracy": 0.2194436028599739, "num_tokens": 70681668.0, "step": 40745 }, { "entropy": 5.773196077346801, "epoch": 3.170472670686637, "grad_norm": 1.265625, "learning_rate": 0.0004004684172910949, "loss": 4.9182, "mean_token_accuracy": 0.21373067051172256, "num_tokens": 70689875.0, "step": 40750 }, { "entropy": 5.773880577087402, "epoch": 3.1708617000583543, "grad_norm": 1.25, "learning_rate": 0.0004004454100555229, "loss": 5.0277, "mean_token_accuracy": 0.2059987425804138, "num_tokens": 70699634.0, "step": 40755 }, { "entropy": 5.859926509857178, "epoch": 3.171250729430072, "grad_norm": 1.2109375, "learning_rate": 0.00040042240091651645, "loss": 5.0347, "mean_token_accuracy": 0.20634437054395677, "num_tokens": 70708951.0, "step": 40760 }, { "entropy": 5.802799463272095, "epoch": 3.1716397588017897, "grad_norm": 1.265625, "learning_rate": 0.00040039938987442464, "loss": 4.9238, "mean_token_accuracy": 0.21934788823127746, "num_tokens": 70717317.0, "step": 40765 }, { "entropy": 5.84746527671814, "epoch": 3.172028788173507, "grad_norm": 1.3515625, "learning_rate": 0.00040037637692959667, "loss": 5.0323, "mean_token_accuracy": 0.20049494802951812, "num_tokens": 70725867.0, "step": 40770 }, { "entropy": 5.688529062271118, "epoch": 3.1724178175452247, "grad_norm": 1.2890625, "learning_rate": 0.00040035336208238176, "loss": 4.8977, "mean_token_accuracy": 0.22131142467260362, "num_tokens": 70734774.0, "step": 40775 }, { "entropy": 5.778683042526245, "epoch": 3.1728068469169424, "grad_norm": 1.375, "learning_rate": 0.00040033034533312913, "loss": 4.9828, "mean_token_accuracy": 0.20913566201925277, "num_tokens": 70743420.0, "step": 40780 }, { "entropy": 5.830522775650024, "epoch": 3.1731958762886596, "grad_norm": 1.3359375, "learning_rate": 0.000400307326682188, "loss": 4.9832, "mean_token_accuracy": 0.20679778903722762, "num_tokens": 70751979.0, "step": 40785 }, { "entropy": 5.793338489532471, "epoch": 3.1735849056603773, "grad_norm": 1.3359375, "learning_rate": 0.00040028430612990755, "loss": 4.9348, "mean_token_accuracy": 0.20807016938924788, "num_tokens": 70760652.0, "step": 40790 }, { "entropy": 5.768425559997558, "epoch": 3.173973935032095, "grad_norm": 1.3515625, "learning_rate": 0.00040026128367663726, "loss": 4.9915, "mean_token_accuracy": 0.2101103812456131, "num_tokens": 70768997.0, "step": 40795 }, { "entropy": 5.7678444385528564, "epoch": 3.1743629644038123, "grad_norm": 1.2734375, "learning_rate": 0.00040023825932272635, "loss": 4.99, "mean_token_accuracy": 0.20541135519742965, "num_tokens": 70777875.0, "step": 40800 }, { "entropy": 5.7762950420379635, "epoch": 3.17475199377553, "grad_norm": 1.1953125, "learning_rate": 0.00040021523306852416, "loss": 4.9041, "mean_token_accuracy": 0.21517597883939743, "num_tokens": 70786592.0, "step": 40805 }, { "entropy": 5.7852434635162355, "epoch": 3.1751410231472477, "grad_norm": 1.296875, "learning_rate": 0.00040019220491438007, "loss": 5.0323, "mean_token_accuracy": 0.2082880347967148, "num_tokens": 70795689.0, "step": 40810 }, { "entropy": 5.769847869873047, "epoch": 3.1755300525189654, "grad_norm": 1.1640625, "learning_rate": 0.0004001691748606436, "loss": 5.0394, "mean_token_accuracy": 0.204358272254467, "num_tokens": 70805078.0, "step": 40815 }, { "entropy": 5.792499303817749, "epoch": 3.1759190818906826, "grad_norm": 1.296875, "learning_rate": 0.0004001461429076641, "loss": 4.8881, "mean_token_accuracy": 0.21457483768463134, "num_tokens": 70813820.0, "step": 40820 }, { "entropy": 5.815903663635254, "epoch": 3.1763081112624003, "grad_norm": 1.234375, "learning_rate": 0.0004001231090557912, "loss": 4.9628, "mean_token_accuracy": 0.20129186511039734, "num_tokens": 70821930.0, "step": 40825 }, { "entropy": 5.753695058822632, "epoch": 3.176697140634118, "grad_norm": 1.203125, "learning_rate": 0.00040010007330537405, "loss": 4.9203, "mean_token_accuracy": 0.21070550233125687, "num_tokens": 70830158.0, "step": 40830 }, { "entropy": 5.852497005462647, "epoch": 3.1770861700058353, "grad_norm": 1.28125, "learning_rate": 0.00040007703565676263, "loss": 5.0355, "mean_token_accuracy": 0.19935194551944732, "num_tokens": 70838774.0, "step": 40835 }, { "entropy": 5.780479097366333, "epoch": 3.177475199377553, "grad_norm": 1.25, "learning_rate": 0.00040005399611030615, "loss": 4.9948, "mean_token_accuracy": 0.20991539359092712, "num_tokens": 70848027.0, "step": 40840 }, { "entropy": 5.85541844367981, "epoch": 3.1778642287492707, "grad_norm": 1.3515625, "learning_rate": 0.0004000309546663543, "loss": 4.987, "mean_token_accuracy": 0.20354868173599244, "num_tokens": 70856629.0, "step": 40845 }, { "entropy": 5.759940958023071, "epoch": 3.1782532581209884, "grad_norm": 1.2734375, "learning_rate": 0.00040000791132525676, "loss": 4.9279, "mean_token_accuracy": 0.21444132924079895, "num_tokens": 70865248.0, "step": 40850 }, { "entropy": 5.777200746536255, "epoch": 3.1786422874927056, "grad_norm": 1.2578125, "learning_rate": 0.00039998486608736305, "loss": 4.8807, "mean_token_accuracy": 0.20888142436742782, "num_tokens": 70874351.0, "step": 40855 }, { "entropy": 5.763645792007447, "epoch": 3.1790313168644233, "grad_norm": 1.4453125, "learning_rate": 0.0003999618189530231, "loss": 4.8433, "mean_token_accuracy": 0.21360225081443787, "num_tokens": 70882478.0, "step": 40860 }, { "entropy": 5.840612459182739, "epoch": 3.179420346236141, "grad_norm": 1.390625, "learning_rate": 0.0003999387699225863, "loss": 4.9965, "mean_token_accuracy": 0.20979055017232895, "num_tokens": 70890461.0, "step": 40865 }, { "entropy": 5.810763931274414, "epoch": 3.1798093756078583, "grad_norm": 1.28125, "learning_rate": 0.0003999157189964026, "loss": 4.9698, "mean_token_accuracy": 0.20901703238487243, "num_tokens": 70898909.0, "step": 40870 }, { "entropy": 5.7385618686676025, "epoch": 3.180198404979576, "grad_norm": 1.328125, "learning_rate": 0.0003998926661748217, "loss": 4.9052, "mean_token_accuracy": 0.21367259472608566, "num_tokens": 70907497.0, "step": 40875 }, { "entropy": 5.826274871826172, "epoch": 3.1805874343512937, "grad_norm": 1.2421875, "learning_rate": 0.0003998696114581933, "loss": 5.0025, "mean_token_accuracy": 0.21002920269966124, "num_tokens": 70916018.0, "step": 40880 }, { "entropy": 5.883435344696045, "epoch": 3.180976463723011, "grad_norm": 1.2109375, "learning_rate": 0.0003998465548468674, "loss": 4.9748, "mean_token_accuracy": 0.2061353161931038, "num_tokens": 70924876.0, "step": 40885 }, { "entropy": 5.790326642990112, "epoch": 3.1813654930947286, "grad_norm": 1.359375, "learning_rate": 0.0003998234963411936, "loss": 4.8956, "mean_token_accuracy": 0.21679909378290177, "num_tokens": 70933113.0, "step": 40890 }, { "entropy": 5.760002279281617, "epoch": 3.1817545224664463, "grad_norm": 1.28125, "learning_rate": 0.0003998004359415221, "loss": 4.9557, "mean_token_accuracy": 0.21218284368515014, "num_tokens": 70941916.0, "step": 40895 }, { "entropy": 5.823373222351075, "epoch": 3.1821435518381636, "grad_norm": 1.2421875, "learning_rate": 0.00039977737364820247, "loss": 4.9892, "mean_token_accuracy": 0.20527541339397432, "num_tokens": 70950110.0, "step": 40900 }, { "entropy": 5.836617803573608, "epoch": 3.1825325812098813, "grad_norm": 1.3125, "learning_rate": 0.00039975430946158493, "loss": 5.0475, "mean_token_accuracy": 0.20525375753641129, "num_tokens": 70958801.0, "step": 40905 }, { "entropy": 5.820892667770385, "epoch": 3.182921610581599, "grad_norm": 1.3046875, "learning_rate": 0.0003997312433820192, "loss": 4.9519, "mean_token_accuracy": 0.21298375725746155, "num_tokens": 70967552.0, "step": 40910 }, { "entropy": 5.8364410400390625, "epoch": 3.1833106399533166, "grad_norm": 1.3046875, "learning_rate": 0.00039970817540985545, "loss": 5.078, "mean_token_accuracy": 0.21025261133909226, "num_tokens": 70975924.0, "step": 40915 }, { "entropy": 5.7783308029174805, "epoch": 3.183699669325034, "grad_norm": 1.28125, "learning_rate": 0.0003996851055454436, "loss": 4.9331, "mean_token_accuracy": 0.21393109261989593, "num_tokens": 70984954.0, "step": 40920 }, { "entropy": 5.8697281837463375, "epoch": 3.1840886986967516, "grad_norm": 1.2265625, "learning_rate": 0.0003996620337891337, "loss": 5.0665, "mean_token_accuracy": 0.19972198456525803, "num_tokens": 70994773.0, "step": 40925 }, { "entropy": 5.893344783782959, "epoch": 3.1844777280684693, "grad_norm": 1.2734375, "learning_rate": 0.000399638960141276, "loss": 5.026, "mean_token_accuracy": 0.20458025336265565, "num_tokens": 71003173.0, "step": 40930 }, { "entropy": 5.820051479339599, "epoch": 3.1848667574401865, "grad_norm": 1.328125, "learning_rate": 0.00039961588460222033, "loss": 4.8989, "mean_token_accuracy": 0.21498272567987442, "num_tokens": 71011729.0, "step": 40935 }, { "entropy": 5.80499300956726, "epoch": 3.1852557868119042, "grad_norm": 1.34375, "learning_rate": 0.000399592807172317, "loss": 5.0193, "mean_token_accuracy": 0.20046033710241318, "num_tokens": 71019876.0, "step": 40940 }, { "entropy": 5.766841459274292, "epoch": 3.185644816183622, "grad_norm": 1.2578125, "learning_rate": 0.00039956972785191606, "loss": 4.9386, "mean_token_accuracy": 0.21043684482574462, "num_tokens": 71028787.0, "step": 40945 }, { "entropy": 5.776029300689697, "epoch": 3.1860338455553396, "grad_norm": 1.3828125, "learning_rate": 0.00039954664664136787, "loss": 4.8971, "mean_token_accuracy": 0.21436677724123002, "num_tokens": 71037173.0, "step": 40950 }, { "entropy": 5.8334661483764645, "epoch": 3.186422874927057, "grad_norm": 1.375, "learning_rate": 0.0003995235635410225, "loss": 4.9487, "mean_token_accuracy": 0.21320437639951706, "num_tokens": 71045486.0, "step": 40955 }, { "entropy": 5.822629976272583, "epoch": 3.1868119042987746, "grad_norm": 1.34375, "learning_rate": 0.0003995004785512302, "loss": 4.9571, "mean_token_accuracy": 0.21075236201286315, "num_tokens": 71053970.0, "step": 40960 }, { "entropy": 5.743032789230346, "epoch": 3.1872009336704923, "grad_norm": 1.3046875, "learning_rate": 0.0003994773916723414, "loss": 4.8956, "mean_token_accuracy": 0.21320100873708725, "num_tokens": 71062381.0, "step": 40965 }, { "entropy": 5.763370609283447, "epoch": 3.1875899630422095, "grad_norm": 1.296875, "learning_rate": 0.0003994543029047063, "loss": 4.8383, "mean_token_accuracy": 0.21775246858596803, "num_tokens": 71069974.0, "step": 40970 }, { "entropy": 5.815304470062256, "epoch": 3.1879789924139272, "grad_norm": 1.3046875, "learning_rate": 0.0003994312122486752, "loss": 4.9964, "mean_token_accuracy": 0.2036883756518364, "num_tokens": 71078985.0, "step": 40975 }, { "entropy": 5.737640523910523, "epoch": 3.188368021785645, "grad_norm": 1.3046875, "learning_rate": 0.0003994081197045985, "loss": 4.9857, "mean_token_accuracy": 0.21071036159992218, "num_tokens": 71087458.0, "step": 40980 }, { "entropy": 5.848167657852173, "epoch": 3.188757051157362, "grad_norm": 1.25, "learning_rate": 0.0003993850252728267, "loss": 5.0248, "mean_token_accuracy": 0.20122021734714507, "num_tokens": 71096558.0, "step": 40985 }, { "entropy": 5.810963726043701, "epoch": 3.18914608052908, "grad_norm": 1.140625, "learning_rate": 0.00039936192895371006, "loss": 4.9844, "mean_token_accuracy": 0.2121475249528885, "num_tokens": 71105507.0, "step": 40990 }, { "entropy": 5.732975912094116, "epoch": 3.1895351099007976, "grad_norm": 1.28125, "learning_rate": 0.000399338830747599, "loss": 4.9288, "mean_token_accuracy": 0.21279667168855668, "num_tokens": 71114237.0, "step": 40995 }, { "entropy": 5.827094602584839, "epoch": 3.1899241392725153, "grad_norm": 1.2109375, "learning_rate": 0.0003993157306548442, "loss": 4.9907, "mean_token_accuracy": 0.208419306576252, "num_tokens": 71123315.0, "step": 41000 }, { "entropy": 5.790973806381226, "epoch": 3.1903131686442325, "grad_norm": 1.359375, "learning_rate": 0.00039929262867579603, "loss": 4.9551, "mean_token_accuracy": 0.21871559768915178, "num_tokens": 71132081.0, "step": 41005 }, { "entropy": 5.815216207504273, "epoch": 3.1907021980159502, "grad_norm": 1.3203125, "learning_rate": 0.00039926952481080495, "loss": 4.9239, "mean_token_accuracy": 0.21571586281061172, "num_tokens": 71140558.0, "step": 41010 }, { "entropy": 5.832334089279175, "epoch": 3.191091227387668, "grad_norm": 1.296875, "learning_rate": 0.00039924641906022176, "loss": 4.9764, "mean_token_accuracy": 0.20667891800403596, "num_tokens": 71149474.0, "step": 41015 }, { "entropy": 5.804848957061767, "epoch": 3.191480256759385, "grad_norm": 1.2578125, "learning_rate": 0.0003992233114243969, "loss": 4.9879, "mean_token_accuracy": 0.20953941941261292, "num_tokens": 71158096.0, "step": 41020 }, { "entropy": 5.777243804931641, "epoch": 3.191869286131103, "grad_norm": 1.3359375, "learning_rate": 0.000399200201903681, "loss": 4.9487, "mean_token_accuracy": 0.20824999809265138, "num_tokens": 71166626.0, "step": 41025 }, { "entropy": 5.815109300613403, "epoch": 3.1922583155028206, "grad_norm": 1.296875, "learning_rate": 0.0003991770904984247, "loss": 5.033, "mean_token_accuracy": 0.20975559204816818, "num_tokens": 71175390.0, "step": 41030 }, { "entropy": 5.786020708084107, "epoch": 3.192647344874538, "grad_norm": 1.328125, "learning_rate": 0.0003991539772089787, "loss": 4.9807, "mean_token_accuracy": 0.21164054572582244, "num_tokens": 71183851.0, "step": 41035 }, { "entropy": 5.812212228775024, "epoch": 3.1930363742462555, "grad_norm": 1.40625, "learning_rate": 0.00039913086203569373, "loss": 4.9876, "mean_token_accuracy": 0.2102329760789871, "num_tokens": 71192592.0, "step": 41040 }, { "entropy": 5.794735383987427, "epoch": 3.1934254036179732, "grad_norm": 1.265625, "learning_rate": 0.00039910774497892046, "loss": 5.0092, "mean_token_accuracy": 0.2125091791152954, "num_tokens": 71201139.0, "step": 41045 }, { "entropy": 5.705812311172485, "epoch": 3.193814432989691, "grad_norm": 1.3046875, "learning_rate": 0.00039908462603900977, "loss": 4.8631, "mean_token_accuracy": 0.21580545753240585, "num_tokens": 71209400.0, "step": 41050 }, { "entropy": 5.763752889633179, "epoch": 3.194203462361408, "grad_norm": 1.2890625, "learning_rate": 0.0003990615052163123, "loss": 4.9331, "mean_token_accuracy": 0.21448178142309188, "num_tokens": 71218041.0, "step": 41055 }, { "entropy": 5.848646783828736, "epoch": 3.194592491733126, "grad_norm": 1.3828125, "learning_rate": 0.000399038382511179, "loss": 4.9711, "mean_token_accuracy": 0.2088299423456192, "num_tokens": 71227323.0, "step": 41060 }, { "entropy": 5.820135641098022, "epoch": 3.1949815211048436, "grad_norm": 1.296875, "learning_rate": 0.0003990152579239607, "loss": 4.983, "mean_token_accuracy": 0.2146556481719017, "num_tokens": 71235410.0, "step": 41065 }, { "entropy": 5.763842010498047, "epoch": 3.195370550476561, "grad_norm": 1.296875, "learning_rate": 0.00039899213145500815, "loss": 4.9267, "mean_token_accuracy": 0.2066001385450363, "num_tokens": 71243577.0, "step": 41070 }, { "entropy": 5.845644235610962, "epoch": 3.1957595798482785, "grad_norm": 1.3359375, "learning_rate": 0.00039896900310467244, "loss": 5.1507, "mean_token_accuracy": 0.19888720214366912, "num_tokens": 71252857.0, "step": 41075 }, { "entropy": 5.779543876647949, "epoch": 3.196148609219996, "grad_norm": 1.2734375, "learning_rate": 0.00039894587287330434, "loss": 5.023, "mean_token_accuracy": 0.2005111262202263, "num_tokens": 71261841.0, "step": 41080 }, { "entropy": 5.81712384223938, "epoch": 3.1965376385917135, "grad_norm": 1.3125, "learning_rate": 0.00039892274076125503, "loss": 4.9649, "mean_token_accuracy": 0.2070955216884613, "num_tokens": 71270057.0, "step": 41085 }, { "entropy": 5.815750408172607, "epoch": 3.196926667963431, "grad_norm": 1.203125, "learning_rate": 0.0003988996067688753, "loss": 4.9585, "mean_token_accuracy": 0.20847470313310623, "num_tokens": 71279488.0, "step": 41090 }, { "entropy": 5.861780166625977, "epoch": 3.197315697335149, "grad_norm": 1.296875, "learning_rate": 0.0003988764708965163, "loss": 5.08, "mean_token_accuracy": 0.20276579558849334, "num_tokens": 71288565.0, "step": 41095 }, { "entropy": 5.742644643783569, "epoch": 3.1977047267068666, "grad_norm": 1.2578125, "learning_rate": 0.000398853333144529, "loss": 4.9088, "mean_token_accuracy": 0.218939970433712, "num_tokens": 71296773.0, "step": 41100 }, { "entropy": 5.8476869583129885, "epoch": 3.198093756078584, "grad_norm": 1.234375, "learning_rate": 0.00039883019351326447, "loss": 4.9866, "mean_token_accuracy": 0.21312536299228668, "num_tokens": 71305665.0, "step": 41105 }, { "entropy": 5.731314468383789, "epoch": 3.1984827854503015, "grad_norm": 1.2890625, "learning_rate": 0.00039880705200307377, "loss": 4.8699, "mean_token_accuracy": 0.21464939564466476, "num_tokens": 71314410.0, "step": 41110 }, { "entropy": 5.833076000213623, "epoch": 3.198871814822019, "grad_norm": 1.34375, "learning_rate": 0.0003987839086143083, "loss": 5.0168, "mean_token_accuracy": 0.20431918799877166, "num_tokens": 71324362.0, "step": 41115 }, { "entropy": 5.812890338897705, "epoch": 3.1992608441937365, "grad_norm": 1.34375, "learning_rate": 0.00039876076334731885, "loss": 5.0039, "mean_token_accuracy": 0.2051171690225601, "num_tokens": 71333244.0, "step": 41120 }, { "entropy": 5.749879980087281, "epoch": 3.199649873565454, "grad_norm": 1.3203125, "learning_rate": 0.000398737616202457, "loss": 4.9132, "mean_token_accuracy": 0.20923542380332946, "num_tokens": 71342191.0, "step": 41125 }, { "entropy": 5.821195459365844, "epoch": 3.200038902937172, "grad_norm": 1.21875, "learning_rate": 0.00039871446718007364, "loss": 5.0329, "mean_token_accuracy": 0.1971859499812126, "num_tokens": 71350955.0, "step": 41130 }, { "entropy": 5.829972457885742, "epoch": 3.200427932308889, "grad_norm": 1.328125, "learning_rate": 0.0003986913162805201, "loss": 4.9832, "mean_token_accuracy": 0.20888735204935074, "num_tokens": 71359930.0, "step": 41135 }, { "entropy": 5.803570127487182, "epoch": 3.200816961680607, "grad_norm": 1.375, "learning_rate": 0.00039866816350414786, "loss": 4.9265, "mean_token_accuracy": 0.2140226036310196, "num_tokens": 71368695.0, "step": 41140 }, { "entropy": 5.774636745452881, "epoch": 3.2012059910523245, "grad_norm": 1.3671875, "learning_rate": 0.000398645008851308, "loss": 4.9225, "mean_token_accuracy": 0.2125234693288803, "num_tokens": 71377360.0, "step": 41145 }, { "entropy": 5.762164974212647, "epoch": 3.201595020424042, "grad_norm": 1.2265625, "learning_rate": 0.00039862185232235196, "loss": 4.9853, "mean_token_accuracy": 0.20514889806509018, "num_tokens": 71386393.0, "step": 41150 }, { "entropy": 5.728836250305176, "epoch": 3.2019840497957595, "grad_norm": 1.2421875, "learning_rate": 0.0003985986939176311, "loss": 4.9049, "mean_token_accuracy": 0.21435294598340987, "num_tokens": 71394909.0, "step": 41155 }, { "entropy": 5.77539472579956, "epoch": 3.202373079167477, "grad_norm": 1.3671875, "learning_rate": 0.00039857553363749674, "loss": 4.992, "mean_token_accuracy": 0.20787446349859237, "num_tokens": 71403375.0, "step": 41160 }, { "entropy": 5.762857294082641, "epoch": 3.202762108539195, "grad_norm": 1.2578125, "learning_rate": 0.00039855237148230026, "loss": 4.9374, "mean_token_accuracy": 0.20537519156932832, "num_tokens": 71412114.0, "step": 41165 }, { "entropy": 5.8108195781707765, "epoch": 3.203151137910912, "grad_norm": 1.265625, "learning_rate": 0.00039852920745239343, "loss": 4.9769, "mean_token_accuracy": 0.204270076751709, "num_tokens": 71420795.0, "step": 41170 }, { "entropy": 5.7305943965911865, "epoch": 3.20354016728263, "grad_norm": 1.25, "learning_rate": 0.00039850604154812727, "loss": 4.8929, "mean_token_accuracy": 0.21624702960252762, "num_tokens": 71429035.0, "step": 41175 }, { "entropy": 5.710943651199341, "epoch": 3.2039291966543475, "grad_norm": 1.359375, "learning_rate": 0.0003984828737698536, "loss": 4.8761, "mean_token_accuracy": 0.21416430175304413, "num_tokens": 71437322.0, "step": 41180 }, { "entropy": 5.781828212738037, "epoch": 3.204318226026065, "grad_norm": 1.3203125, "learning_rate": 0.00039845970411792384, "loss": 4.9743, "mean_token_accuracy": 0.21283867359161376, "num_tokens": 71445713.0, "step": 41185 }, { "entropy": 5.837869167327881, "epoch": 3.2047072553977825, "grad_norm": 1.359375, "learning_rate": 0.0003984365325926896, "loss": 4.9575, "mean_token_accuracy": 0.2108112558722496, "num_tokens": 71453913.0, "step": 41190 }, { "entropy": 5.896095418930054, "epoch": 3.2050962847695, "grad_norm": 1.2421875, "learning_rate": 0.00039841335919450245, "loss": 4.9696, "mean_token_accuracy": 0.21020638942718506, "num_tokens": 71462036.0, "step": 41195 }, { "entropy": 5.803089809417725, "epoch": 3.205485314141218, "grad_norm": 1.3125, "learning_rate": 0.00039839018392371397, "loss": 4.9497, "mean_token_accuracy": 0.21054963618516923, "num_tokens": 71470760.0, "step": 41200 }, { "entropy": 5.779816627502441, "epoch": 3.205874343512935, "grad_norm": 1.359375, "learning_rate": 0.0003983670067806759, "loss": 5.0048, "mean_token_accuracy": 0.20543093979358673, "num_tokens": 71479612.0, "step": 41205 }, { "entropy": 5.826887750625611, "epoch": 3.206263372884653, "grad_norm": 1.328125, "learning_rate": 0.0003983438277657398, "loss": 4.9664, "mean_token_accuracy": 0.21244781017303466, "num_tokens": 71487868.0, "step": 41210 }, { "entropy": 5.7810498714447025, "epoch": 3.2066524022563705, "grad_norm": 1.2265625, "learning_rate": 0.0003983206468792575, "loss": 4.9327, "mean_token_accuracy": 0.21376482993364335, "num_tokens": 71496296.0, "step": 41215 }, { "entropy": 5.6851146697998045, "epoch": 3.2070414316280877, "grad_norm": 1.2578125, "learning_rate": 0.0003982974641215806, "loss": 4.9143, "mean_token_accuracy": 0.21694558709859849, "num_tokens": 71505076.0, "step": 41220 }, { "entropy": 5.736476945877075, "epoch": 3.2074304609998054, "grad_norm": 1.296875, "learning_rate": 0.000398274279493061, "loss": 4.8725, "mean_token_accuracy": 0.22086389511823654, "num_tokens": 71513585.0, "step": 41225 }, { "entropy": 5.897016429901123, "epoch": 3.207819490371523, "grad_norm": 1.375, "learning_rate": 0.00039825109299405036, "loss": 5.0107, "mean_token_accuracy": 0.20713995397090912, "num_tokens": 71521519.0, "step": 41230 }, { "entropy": 5.731545877456665, "epoch": 3.2082085197432404, "grad_norm": 1.3671875, "learning_rate": 0.0003982279046249006, "loss": 4.8905, "mean_token_accuracy": 0.21627333611249924, "num_tokens": 71529910.0, "step": 41235 }, { "entropy": 5.709821653366089, "epoch": 3.208597549114958, "grad_norm": 1.2109375, "learning_rate": 0.00039820471438596346, "loss": 4.9121, "mean_token_accuracy": 0.21597984731197356, "num_tokens": 71538716.0, "step": 41240 }, { "entropy": 5.814889669418335, "epoch": 3.208986578486676, "grad_norm": 1.2265625, "learning_rate": 0.00039818152227759097, "loss": 5.0589, "mean_token_accuracy": 0.20450475811958313, "num_tokens": 71548737.0, "step": 41245 }, { "entropy": 5.9124016761779785, "epoch": 3.2093756078583935, "grad_norm": 1.328125, "learning_rate": 0.0003981583283001349, "loss": 4.9558, "mean_token_accuracy": 0.21591074168682098, "num_tokens": 71557356.0, "step": 41250 }, { "entropy": 5.807810688018799, "epoch": 3.2097646372301107, "grad_norm": 1.2890625, "learning_rate": 0.0003981351324539472, "loss": 4.992, "mean_token_accuracy": 0.21419467478990556, "num_tokens": 71566858.0, "step": 41255 }, { "entropy": 5.724623394012451, "epoch": 3.2101536666018284, "grad_norm": 1.375, "learning_rate": 0.0003981119347393799, "loss": 4.8986, "mean_token_accuracy": 0.21371881812810897, "num_tokens": 71575060.0, "step": 41260 }, { "entropy": 5.814882135391235, "epoch": 3.210542695973546, "grad_norm": 1.2421875, "learning_rate": 0.00039808873515678495, "loss": 4.9582, "mean_token_accuracy": 0.21271524727344512, "num_tokens": 71583987.0, "step": 41265 }, { "entropy": 5.750287485122681, "epoch": 3.2109317253452634, "grad_norm": 1.1875, "learning_rate": 0.0003980655337065144, "loss": 5.0533, "mean_token_accuracy": 0.19600334167480468, "num_tokens": 71593433.0, "step": 41270 }, { "entropy": 5.8865642070770265, "epoch": 3.211320754716981, "grad_norm": 1.328125, "learning_rate": 0.0003980423303889201, "loss": 4.9623, "mean_token_accuracy": 0.2092838779091835, "num_tokens": 71601795.0, "step": 41275 }, { "entropy": 5.792623615264892, "epoch": 3.211709784088699, "grad_norm": 1.3046875, "learning_rate": 0.00039801912520435437, "loss": 4.8695, "mean_token_accuracy": 0.2173760026693344, "num_tokens": 71611566.0, "step": 41280 }, { "entropy": 5.7792792320251465, "epoch": 3.2120988134604165, "grad_norm": 1.296875, "learning_rate": 0.0003979959181531692, "loss": 4.8876, "mean_token_accuracy": 0.21434685885906218, "num_tokens": 71620157.0, "step": 41285 }, { "entropy": 5.841890048980713, "epoch": 3.2124878428321337, "grad_norm": 1.328125, "learning_rate": 0.00039797270923571683, "loss": 5.0316, "mean_token_accuracy": 0.20187993049621583, "num_tokens": 71629342.0, "step": 41290 }, { "entropy": 5.793034076690674, "epoch": 3.2128768722038514, "grad_norm": 1.2265625, "learning_rate": 0.00039794949845234925, "loss": 4.9081, "mean_token_accuracy": 0.20983316451311113, "num_tokens": 71638118.0, "step": 41295 }, { "entropy": 5.7549927711486815, "epoch": 3.213265901575569, "grad_norm": 1.2109375, "learning_rate": 0.00039792628580341874, "loss": 4.9267, "mean_token_accuracy": 0.21711427122354507, "num_tokens": 71647261.0, "step": 41300 }, { "entropy": 5.734453916549683, "epoch": 3.2136549309472864, "grad_norm": 1.3984375, "learning_rate": 0.00039790307128927745, "loss": 5.0005, "mean_token_accuracy": 0.20885442942380905, "num_tokens": 71655513.0, "step": 41305 }, { "entropy": 5.7949072360992435, "epoch": 3.214043960319004, "grad_norm": 1.34375, "learning_rate": 0.00039787985491027773, "loss": 5.0019, "mean_token_accuracy": 0.20987371504306793, "num_tokens": 71663696.0, "step": 41310 }, { "entropy": 5.771819591522217, "epoch": 3.2144329896907218, "grad_norm": 1.2265625, "learning_rate": 0.00039785663666677175, "loss": 4.9855, "mean_token_accuracy": 0.20360035598278045, "num_tokens": 71672860.0, "step": 41315 }, { "entropy": 5.730074501037597, "epoch": 3.214822019062439, "grad_norm": 1.28125, "learning_rate": 0.00039783341655911185, "loss": 4.9481, "mean_token_accuracy": 0.2074803039431572, "num_tokens": 71681343.0, "step": 41320 }, { "entropy": 5.7540699481964115, "epoch": 3.2152110484341567, "grad_norm": 1.2890625, "learning_rate": 0.0003978101945876504, "loss": 4.9376, "mean_token_accuracy": 0.21067578047513963, "num_tokens": 71689769.0, "step": 41325 }, { "entropy": 5.799365568161011, "epoch": 3.2156000778058744, "grad_norm": 1.3828125, "learning_rate": 0.00039778697075273977, "loss": 4.9609, "mean_token_accuracy": 0.22042760699987413, "num_tokens": 71697782.0, "step": 41330 }, { "entropy": 5.8292491912841795, "epoch": 3.2159891071775917, "grad_norm": 1.4375, "learning_rate": 0.00039776374505473224, "loss": 4.9814, "mean_token_accuracy": 0.20663077831268312, "num_tokens": 71706050.0, "step": 41335 }, { "entropy": 5.6943220615386965, "epoch": 3.2163781365493094, "grad_norm": 1.4296875, "learning_rate": 0.0003977405174939803, "loss": 4.8483, "mean_token_accuracy": 0.2162970259785652, "num_tokens": 71714623.0, "step": 41340 }, { "entropy": 5.750756168365479, "epoch": 3.216767165921027, "grad_norm": 1.34375, "learning_rate": 0.00039771728807083635, "loss": 4.9216, "mean_token_accuracy": 0.21626928299665452, "num_tokens": 71723450.0, "step": 41345 }, { "entropy": 5.801574230194092, "epoch": 3.2171561952927448, "grad_norm": 1.234375, "learning_rate": 0.00039769405678565287, "loss": 4.9522, "mean_token_accuracy": 0.21103242337703704, "num_tokens": 71731986.0, "step": 41350 }, { "entropy": 5.805771970748902, "epoch": 3.217545224664462, "grad_norm": 1.2421875, "learning_rate": 0.00039767082363878237, "loss": 5.0495, "mean_token_accuracy": 0.1962603434920311, "num_tokens": 71740650.0, "step": 41355 }, { "entropy": 5.818052053451538, "epoch": 3.2179342540361797, "grad_norm": 1.3515625, "learning_rate": 0.0003976475886305774, "loss": 4.9756, "mean_token_accuracy": 0.2009451672434807, "num_tokens": 71749358.0, "step": 41360 }, { "entropy": 5.765381813049316, "epoch": 3.2183232834078974, "grad_norm": 1.3046875, "learning_rate": 0.0003976243517613904, "loss": 4.9221, "mean_token_accuracy": 0.21118604242801667, "num_tokens": 71757862.0, "step": 41365 }, { "entropy": 5.7795158386230465, "epoch": 3.2187123127796147, "grad_norm": 1.2265625, "learning_rate": 0.00039760111303157415, "loss": 5.0178, "mean_token_accuracy": 0.20447888225317, "num_tokens": 71766321.0, "step": 41370 }, { "entropy": 5.742062187194824, "epoch": 3.2191013421513324, "grad_norm": 1.2109375, "learning_rate": 0.000397577872441481, "loss": 4.9624, "mean_token_accuracy": 0.21108703017234803, "num_tokens": 71775726.0, "step": 41375 }, { "entropy": 5.802356719970703, "epoch": 3.21949037152305, "grad_norm": 1.25, "learning_rate": 0.0003975546299914639, "loss": 5.0424, "mean_token_accuracy": 0.20768837183713912, "num_tokens": 71785227.0, "step": 41380 }, { "entropy": 5.81892409324646, "epoch": 3.2198794008947678, "grad_norm": 1.2109375, "learning_rate": 0.0003975313856818753, "loss": 4.9841, "mean_token_accuracy": 0.20980816930532456, "num_tokens": 71794226.0, "step": 41385 }, { "entropy": 5.841844701766968, "epoch": 3.220268430266485, "grad_norm": 1.34375, "learning_rate": 0.0003975081395130679, "loss": 4.9657, "mean_token_accuracy": 0.21014760434627533, "num_tokens": 71802758.0, "step": 41390 }, { "entropy": 5.827206802368164, "epoch": 3.2206574596382027, "grad_norm": 1.3359375, "learning_rate": 0.0003974848914853946, "loss": 4.9897, "mean_token_accuracy": 0.20900826305150985, "num_tokens": 71811156.0, "step": 41395 }, { "entropy": 5.676757001876831, "epoch": 3.2210464890099204, "grad_norm": 1.2890625, "learning_rate": 0.00039746164159920795, "loss": 4.7895, "mean_token_accuracy": 0.22193263620138168, "num_tokens": 71819243.0, "step": 41400 }, { "entropy": 5.751319551467896, "epoch": 3.2214355183816377, "grad_norm": 1.2578125, "learning_rate": 0.00039743838985486075, "loss": 4.9856, "mean_token_accuracy": 0.19774357080459595, "num_tokens": 71827551.0, "step": 41405 }, { "entropy": 5.759838676452636, "epoch": 3.2218245477533554, "grad_norm": 1.34375, "learning_rate": 0.0003974151362527059, "loss": 4.9829, "mean_token_accuracy": 0.2103677898645401, "num_tokens": 71835548.0, "step": 41410 }, { "entropy": 5.843257761001587, "epoch": 3.222213577125073, "grad_norm": 1.296875, "learning_rate": 0.00039739188079309626, "loss": 4.9865, "mean_token_accuracy": 0.20894116461277007, "num_tokens": 71844117.0, "step": 41415 }, { "entropy": 5.8290431022644045, "epoch": 3.2226026064967903, "grad_norm": 1.21875, "learning_rate": 0.0003973686234763846, "loss": 4.9746, "mean_token_accuracy": 0.2045376107096672, "num_tokens": 71852665.0, "step": 41420 }, { "entropy": 5.719097518920899, "epoch": 3.222991635868508, "grad_norm": 1.2578125, "learning_rate": 0.0003973453643029239, "loss": 4.9741, "mean_token_accuracy": 0.2034338429570198, "num_tokens": 71861162.0, "step": 41425 }, { "entropy": 5.8148833274841305, "epoch": 3.2233806652402257, "grad_norm": 1.328125, "learning_rate": 0.0003973221032730669, "loss": 4.9827, "mean_token_accuracy": 0.2080690309405327, "num_tokens": 71870764.0, "step": 41430 }, { "entropy": 5.818063831329345, "epoch": 3.2237696946119434, "grad_norm": 1.265625, "learning_rate": 0.0003972988403871668, "loss": 4.944, "mean_token_accuracy": 0.2111282765865326, "num_tokens": 71879291.0, "step": 41435 }, { "entropy": 5.783003234863282, "epoch": 3.2241587239836607, "grad_norm": 1.359375, "learning_rate": 0.0003972755756455764, "loss": 5.0111, "mean_token_accuracy": 0.20480467081069947, "num_tokens": 71888070.0, "step": 41440 }, { "entropy": 5.793606090545654, "epoch": 3.2245477533553784, "grad_norm": 1.265625, "learning_rate": 0.0003972523090486487, "loss": 5.0523, "mean_token_accuracy": 0.20677953511476516, "num_tokens": 71896314.0, "step": 41445 }, { "entropy": 5.722285318374634, "epoch": 3.224936782727096, "grad_norm": 1.1875, "learning_rate": 0.0003972290405967369, "loss": 4.7859, "mean_token_accuracy": 0.2239881381392479, "num_tokens": 71905786.0, "step": 41450 }, { "entropy": 5.797301578521728, "epoch": 3.2253258120988133, "grad_norm": 1.3203125, "learning_rate": 0.0003972057702901939, "loss": 4.9527, "mean_token_accuracy": 0.21013478189706802, "num_tokens": 71914329.0, "step": 41455 }, { "entropy": 5.822436332702637, "epoch": 3.225714841470531, "grad_norm": 1.359375, "learning_rate": 0.0003971824981293729, "loss": 5.0229, "mean_token_accuracy": 0.20823402106761932, "num_tokens": 71923615.0, "step": 41460 }, { "entropy": 5.844260406494141, "epoch": 3.2261038708422487, "grad_norm": 1.4140625, "learning_rate": 0.0003971592241146269, "loss": 4.9394, "mean_token_accuracy": 0.21366044133901596, "num_tokens": 71931666.0, "step": 41465 }, { "entropy": 5.869075584411621, "epoch": 3.226492900213966, "grad_norm": 1.3515625, "learning_rate": 0.0003971359482463092, "loss": 5.0289, "mean_token_accuracy": 0.21008275151252748, "num_tokens": 71940770.0, "step": 41470 }, { "entropy": 5.725079584121704, "epoch": 3.2268819295856837, "grad_norm": 1.2734375, "learning_rate": 0.0003971126705247727, "loss": 4.8927, "mean_token_accuracy": 0.21237511336803436, "num_tokens": 71949626.0, "step": 41475 }, { "entropy": 5.733116674423218, "epoch": 3.2272709589574013, "grad_norm": 1.2890625, "learning_rate": 0.0003970893909503709, "loss": 4.9358, "mean_token_accuracy": 0.21297745257616044, "num_tokens": 71958055.0, "step": 41480 }, { "entropy": 5.74902491569519, "epoch": 3.227659988329119, "grad_norm": 1.390625, "learning_rate": 0.000397066109523457, "loss": 4.8431, "mean_token_accuracy": 0.22200302928686141, "num_tokens": 71966353.0, "step": 41485 }, { "entropy": 5.826768493652343, "epoch": 3.2280490177008363, "grad_norm": 1.296875, "learning_rate": 0.0003970428262443842, "loss": 5.0307, "mean_token_accuracy": 0.20308351665735244, "num_tokens": 71975479.0, "step": 41490 }, { "entropy": 5.737387180328369, "epoch": 3.228438047072554, "grad_norm": 1.3046875, "learning_rate": 0.00039701954111350565, "loss": 4.8925, "mean_token_accuracy": 0.21236908286809922, "num_tokens": 71983859.0, "step": 41495 }, { "entropy": 5.653514194488525, "epoch": 3.2288270764442717, "grad_norm": 1.25, "learning_rate": 0.0003969962541311748, "loss": 4.805, "mean_token_accuracy": 0.22129588276147844, "num_tokens": 71992804.0, "step": 41500 }, { "entropy": 5.855139446258545, "epoch": 3.229216105815989, "grad_norm": 1.3203125, "learning_rate": 0.00039697296529774494, "loss": 5.0789, "mean_token_accuracy": 0.20342481583356858, "num_tokens": 72000942.0, "step": 41505 }, { "entropy": 5.782069206237793, "epoch": 3.2296051351877066, "grad_norm": 1.3984375, "learning_rate": 0.00039694967461356944, "loss": 4.9272, "mean_token_accuracy": 0.21103191673755645, "num_tokens": 72009275.0, "step": 41510 }, { "entropy": 5.785755968093872, "epoch": 3.2299941645594243, "grad_norm": 1.2109375, "learning_rate": 0.00039692638207900177, "loss": 4.9757, "mean_token_accuracy": 0.20712558478116988, "num_tokens": 72018441.0, "step": 41515 }, { "entropy": 5.840254116058349, "epoch": 3.2303831939311416, "grad_norm": 1.28125, "learning_rate": 0.0003969030876943954, "loss": 4.9446, "mean_token_accuracy": 0.21219918578863145, "num_tokens": 72026657.0, "step": 41520 }, { "entropy": 5.723805570602417, "epoch": 3.2307722233028593, "grad_norm": 1.3671875, "learning_rate": 0.00039687979146010367, "loss": 4.8498, "mean_token_accuracy": 0.2204389214515686, "num_tokens": 72034893.0, "step": 41525 }, { "entropy": 5.8056337356567385, "epoch": 3.231161252674577, "grad_norm": 1.203125, "learning_rate": 0.00039685649337648, "loss": 5.031, "mean_token_accuracy": 0.212462317943573, "num_tokens": 72044880.0, "step": 41530 }, { "entropy": 5.829704999923706, "epoch": 3.2315502820462947, "grad_norm": 1.2265625, "learning_rate": 0.00039683319344387813, "loss": 4.9466, "mean_token_accuracy": 0.20931049138307573, "num_tokens": 72053407.0, "step": 41535 }, { "entropy": 5.79567232131958, "epoch": 3.231939311418012, "grad_norm": 1.3046875, "learning_rate": 0.00039680989166265135, "loss": 4.9404, "mean_token_accuracy": 0.2144464522600174, "num_tokens": 72062042.0, "step": 41540 }, { "entropy": 5.766578292846679, "epoch": 3.2323283407897296, "grad_norm": 1.2890625, "learning_rate": 0.00039678658803315336, "loss": 4.9649, "mean_token_accuracy": 0.20944201499223708, "num_tokens": 72070120.0, "step": 41545 }, { "entropy": 5.78457932472229, "epoch": 3.2327173701614473, "grad_norm": 1.3671875, "learning_rate": 0.00039676328255573777, "loss": 4.9559, "mean_token_accuracy": 0.2068862020969391, "num_tokens": 72079271.0, "step": 41550 }, { "entropy": 5.815927124023437, "epoch": 3.2331063995331646, "grad_norm": 1.3203125, "learning_rate": 0.00039673997523075825, "loss": 4.9952, "mean_token_accuracy": 0.20821307450532914, "num_tokens": 72088103.0, "step": 41555 }, { "entropy": 5.878151369094849, "epoch": 3.2334954289048823, "grad_norm": 1.28125, "learning_rate": 0.00039671666605856825, "loss": 5.0399, "mean_token_accuracy": 0.20799705982208253, "num_tokens": 72097244.0, "step": 41560 }, { "entropy": 5.832695865631104, "epoch": 3.2338844582766, "grad_norm": 1.40625, "learning_rate": 0.00039669335503952165, "loss": 5.0091, "mean_token_accuracy": 0.20618646293878556, "num_tokens": 72105778.0, "step": 41565 }, { "entropy": 5.8211798667907715, "epoch": 3.2342734876483172, "grad_norm": 1.3515625, "learning_rate": 0.00039667004217397206, "loss": 4.986, "mean_token_accuracy": 0.21454848051071168, "num_tokens": 72113750.0, "step": 41570 }, { "entropy": 5.727704381942749, "epoch": 3.234662517020035, "grad_norm": 1.3359375, "learning_rate": 0.00039664672746227326, "loss": 4.9308, "mean_token_accuracy": 0.20959278494119643, "num_tokens": 72122181.0, "step": 41575 }, { "entropy": 5.855431365966797, "epoch": 3.2350515463917526, "grad_norm": 1.2734375, "learning_rate": 0.0003966234109047789, "loss": 4.9837, "mean_token_accuracy": 0.2050798088312149, "num_tokens": 72131364.0, "step": 41580 }, { "entropy": 5.8295940399169925, "epoch": 3.2354405757634703, "grad_norm": 1.34375, "learning_rate": 0.000396600092501843, "loss": 4.9996, "mean_token_accuracy": 0.20579760074615477, "num_tokens": 72139580.0, "step": 41585 }, { "entropy": 5.760929203033447, "epoch": 3.2358296051351876, "grad_norm": 1.1953125, "learning_rate": 0.00039657677225381915, "loss": 4.9284, "mean_token_accuracy": 0.2145735129714012, "num_tokens": 72148414.0, "step": 41590 }, { "entropy": 5.710457277297974, "epoch": 3.2362186345069053, "grad_norm": 1.3203125, "learning_rate": 0.0003965534501610613, "loss": 4.8253, "mean_token_accuracy": 0.2194552704691887, "num_tokens": 72156612.0, "step": 41595 }, { "entropy": 5.791452074050904, "epoch": 3.236607663878623, "grad_norm": 1.2890625, "learning_rate": 0.0003965301262239234, "loss": 4.9986, "mean_token_accuracy": 0.2085573345422745, "num_tokens": 72164711.0, "step": 41600 }, { "entropy": 5.8321630477905275, "epoch": 3.2369966932503402, "grad_norm": 1.15625, "learning_rate": 0.0003965068004427591, "loss": 5.0816, "mean_token_accuracy": 0.19817592650651933, "num_tokens": 72172991.0, "step": 41605 }, { "entropy": 5.818800449371338, "epoch": 3.237385722622058, "grad_norm": 1.3046875, "learning_rate": 0.0003964834728179226, "loss": 4.984, "mean_token_accuracy": 0.20730161517858506, "num_tokens": 72181464.0, "step": 41610 }, { "entropy": 5.852931070327759, "epoch": 3.2377747519937756, "grad_norm": 1.3046875, "learning_rate": 0.00039646014334976783, "loss": 4.951, "mean_token_accuracy": 0.21607230305671693, "num_tokens": 72189984.0, "step": 41615 }, { "entropy": 5.7047404766082765, "epoch": 3.2381637813654933, "grad_norm": 1.3515625, "learning_rate": 0.00039643681203864863, "loss": 4.8305, "mean_token_accuracy": 0.21785926818847656, "num_tokens": 72197845.0, "step": 41620 }, { "entropy": 5.750436735153198, "epoch": 3.2385528107372106, "grad_norm": 1.2578125, "learning_rate": 0.00039641347888491905, "loss": 4.9755, "mean_token_accuracy": 0.20528089106082917, "num_tokens": 72206307.0, "step": 41625 }, { "entropy": 5.775866079330444, "epoch": 3.2389418401089283, "grad_norm": 1.2578125, "learning_rate": 0.00039639014388893337, "loss": 4.9972, "mean_token_accuracy": 0.20009784251451493, "num_tokens": 72214540.0, "step": 41630 }, { "entropy": 5.810846614837646, "epoch": 3.239330869480646, "grad_norm": 1.234375, "learning_rate": 0.0003963668070510453, "loss": 4.9962, "mean_token_accuracy": 0.21429523229598998, "num_tokens": 72223287.0, "step": 41635 }, { "entropy": 5.74618501663208, "epoch": 3.2397198988523632, "grad_norm": 1.3125, "learning_rate": 0.0003963434683716091, "loss": 4.9374, "mean_token_accuracy": 0.21321831047534942, "num_tokens": 72232314.0, "step": 41640 }, { "entropy": 5.8425031185150145, "epoch": 3.240108928224081, "grad_norm": 1.1953125, "learning_rate": 0.0003963201278509789, "loss": 5.0563, "mean_token_accuracy": 0.19770679175853728, "num_tokens": 72241424.0, "step": 41645 }, { "entropy": 5.779427194595337, "epoch": 3.2404979575957986, "grad_norm": 1.2734375, "learning_rate": 0.0003962967854895089, "loss": 4.898, "mean_token_accuracy": 0.2108321815729141, "num_tokens": 72249329.0, "step": 41650 }, { "entropy": 5.798082637786865, "epoch": 3.240886986967516, "grad_norm": 1.21875, "learning_rate": 0.0003962734412875533, "loss": 5.0303, "mean_token_accuracy": 0.2065392926335335, "num_tokens": 72258484.0, "step": 41655 }, { "entropy": 5.789620018005371, "epoch": 3.2412760163392336, "grad_norm": 1.3515625, "learning_rate": 0.0003962500952454662, "loss": 4.9689, "mean_token_accuracy": 0.214793299138546, "num_tokens": 72267280.0, "step": 41660 }, { "entropy": 5.7971861362457275, "epoch": 3.2416650457109513, "grad_norm": 1.3046875, "learning_rate": 0.00039622674736360195, "loss": 4.9954, "mean_token_accuracy": 0.21018750220537186, "num_tokens": 72275399.0, "step": 41665 }, { "entropy": 5.74265604019165, "epoch": 3.2420540750826685, "grad_norm": 1.3359375, "learning_rate": 0.00039620339764231467, "loss": 4.9255, "mean_token_accuracy": 0.21792393624782563, "num_tokens": 72285202.0, "step": 41670 }, { "entropy": 5.715479373931885, "epoch": 3.242443104454386, "grad_norm": 1.2421875, "learning_rate": 0.00039618004608195877, "loss": 4.8649, "mean_token_accuracy": 0.21841892302036287, "num_tokens": 72293713.0, "step": 41675 }, { "entropy": 5.761279487609864, "epoch": 3.242832133826104, "grad_norm": 1.265625, "learning_rate": 0.00039615669268288863, "loss": 4.9, "mean_token_accuracy": 0.21435742527246476, "num_tokens": 72302591.0, "step": 41680 }, { "entropy": 5.823850679397583, "epoch": 3.2432211631978216, "grad_norm": 1.2109375, "learning_rate": 0.00039613333744545836, "loss": 4.9272, "mean_token_accuracy": 0.21788993030786513, "num_tokens": 72310981.0, "step": 41685 }, { "entropy": 5.72359676361084, "epoch": 3.243610192569539, "grad_norm": 1.265625, "learning_rate": 0.0003961099803700226, "loss": 4.8701, "mean_token_accuracy": 0.21976497620344163, "num_tokens": 72319797.0, "step": 41690 }, { "entropy": 5.783141946792602, "epoch": 3.2439992219412566, "grad_norm": 1.2890625, "learning_rate": 0.0003960866214569357, "loss": 4.9777, "mean_token_accuracy": 0.21036725640296935, "num_tokens": 72329122.0, "step": 41695 }, { "entropy": 5.798482227325439, "epoch": 3.2443882513129743, "grad_norm": 1.3046875, "learning_rate": 0.00039606326070655204, "loss": 4.9537, "mean_token_accuracy": 0.21277401745319366, "num_tokens": 72337601.0, "step": 41700 }, { "entropy": 5.889290904998779, "epoch": 3.2447772806846915, "grad_norm": 1.296875, "learning_rate": 0.00039603989811922596, "loss": 5.0443, "mean_token_accuracy": 0.20718279033899306, "num_tokens": 72346484.0, "step": 41705 }, { "entropy": 5.798949956893921, "epoch": 3.245166310056409, "grad_norm": 1.3203125, "learning_rate": 0.0003960165336953122, "loss": 4.9169, "mean_token_accuracy": 0.20901252329349518, "num_tokens": 72354989.0, "step": 41710 }, { "entropy": 5.808381128311157, "epoch": 3.245555339428127, "grad_norm": 1.25, "learning_rate": 0.0003959931674351651, "loss": 4.9798, "mean_token_accuracy": 0.2047300323843956, "num_tokens": 72363216.0, "step": 41715 }, { "entropy": 5.759175539016724, "epoch": 3.2459443687998446, "grad_norm": 1.265625, "learning_rate": 0.0003959697993391393, "loss": 4.8589, "mean_token_accuracy": 0.21934399604797364, "num_tokens": 72371994.0, "step": 41720 }, { "entropy": 5.683091449737549, "epoch": 3.246333398171562, "grad_norm": 1.234375, "learning_rate": 0.00039594642940758934, "loss": 4.8398, "mean_token_accuracy": 0.2218673586845398, "num_tokens": 72381467.0, "step": 41725 }, { "entropy": 5.7172607421875, "epoch": 3.2467224275432796, "grad_norm": 1.265625, "learning_rate": 0.00039592305764086984, "loss": 4.8235, "mean_token_accuracy": 0.22267574816942215, "num_tokens": 72390087.0, "step": 41730 }, { "entropy": 5.774016427993774, "epoch": 3.2471114569149973, "grad_norm": 1.234375, "learning_rate": 0.00039589968403933533, "loss": 4.9111, "mean_token_accuracy": 0.20736433565616608, "num_tokens": 72399525.0, "step": 41735 }, { "entropy": 5.704704236984253, "epoch": 3.2475004862867145, "grad_norm": 1.3125, "learning_rate": 0.0003958763086033406, "loss": 4.908, "mean_token_accuracy": 0.21896491944789886, "num_tokens": 72407487.0, "step": 41740 }, { "entropy": 5.671743965148925, "epoch": 3.247889515658432, "grad_norm": 1.2578125, "learning_rate": 0.0003958529313332403, "loss": 4.8837, "mean_token_accuracy": 0.21114650517702102, "num_tokens": 72416118.0, "step": 41745 }, { "entropy": 5.769161033630371, "epoch": 3.24827854503015, "grad_norm": 1.2890625, "learning_rate": 0.0003958295522293891, "loss": 4.8787, "mean_token_accuracy": 0.22026962488889695, "num_tokens": 72424946.0, "step": 41750 }, { "entropy": 5.777609157562256, "epoch": 3.248667574401867, "grad_norm": 1.25, "learning_rate": 0.0003958061712921417, "loss": 4.9211, "mean_token_accuracy": 0.21041887402534484, "num_tokens": 72435588.0, "step": 41755 }, { "entropy": 5.697843980789185, "epoch": 3.249056603773585, "grad_norm": 1.296875, "learning_rate": 0.000395782788521853, "loss": 4.8922, "mean_token_accuracy": 0.21389644742012023, "num_tokens": 72443728.0, "step": 41760 }, { "entropy": 5.716356325149536, "epoch": 3.2494456331453025, "grad_norm": 1.3984375, "learning_rate": 0.0003957594039188778, "loss": 4.8802, "mean_token_accuracy": 0.21758583188056946, "num_tokens": 72452163.0, "step": 41765 }, { "entropy": 5.799693393707275, "epoch": 3.24983466251702, "grad_norm": 1.2265625, "learning_rate": 0.0003957360174835708, "loss": 5.0412, "mean_token_accuracy": 0.20398625284433364, "num_tokens": 72461369.0, "step": 41770 }, { "entropy": 5.74647798538208, "epoch": 3.2502236918887375, "grad_norm": 1.3828125, "learning_rate": 0.0003957126292162868, "loss": 4.8411, "mean_token_accuracy": 0.21744868159294128, "num_tokens": 72470370.0, "step": 41775 }, { "entropy": 5.747397994995117, "epoch": 3.250612721260455, "grad_norm": 1.359375, "learning_rate": 0.0003956892391173809, "loss": 4.8547, "mean_token_accuracy": 0.20932621657848358, "num_tokens": 72478440.0, "step": 41780 }, { "entropy": 5.798026037216187, "epoch": 3.251001750632173, "grad_norm": 1.328125, "learning_rate": 0.00039566584718720793, "loss": 5.0825, "mean_token_accuracy": 0.20292821228504182, "num_tokens": 72487556.0, "step": 41785 }, { "entropy": 5.707079029083252, "epoch": 3.25139078000389, "grad_norm": 1.3359375, "learning_rate": 0.0003956424534261227, "loss": 4.9483, "mean_token_accuracy": 0.20929314941167831, "num_tokens": 72495546.0, "step": 41790 }, { "entropy": 5.76409068107605, "epoch": 3.251779809375608, "grad_norm": 1.3203125, "learning_rate": 0.00039561905783448025, "loss": 4.9673, "mean_token_accuracy": 0.20749992430210112, "num_tokens": 72504479.0, "step": 41795 }, { "entropy": 5.807782602310181, "epoch": 3.2521688387473255, "grad_norm": 1.4453125, "learning_rate": 0.00039559566041263565, "loss": 4.9708, "mean_token_accuracy": 0.2114240750670433, "num_tokens": 72512758.0, "step": 41800 }, { "entropy": 5.779458999633789, "epoch": 3.252557868119043, "grad_norm": 1.2890625, "learning_rate": 0.0003955722611609438, "loss": 4.9114, "mean_token_accuracy": 0.207473823428154, "num_tokens": 72520920.0, "step": 41805 }, { "entropy": 5.767011976242065, "epoch": 3.2529468974907605, "grad_norm": 1.328125, "learning_rate": 0.00039554886007975976, "loss": 4.9273, "mean_token_accuracy": 0.21348298639059066, "num_tokens": 72529485.0, "step": 41810 }, { "entropy": 5.7399204730987545, "epoch": 3.253335926862478, "grad_norm": 1.3125, "learning_rate": 0.00039552545716943873, "loss": 4.8796, "mean_token_accuracy": 0.2134126052260399, "num_tokens": 72538267.0, "step": 41815 }, { "entropy": 5.715592241287231, "epoch": 3.253724956234196, "grad_norm": 1.3359375, "learning_rate": 0.0003955020524303358, "loss": 4.8703, "mean_token_accuracy": 0.21440054923295976, "num_tokens": 72546806.0, "step": 41820 }, { "entropy": 5.770246410369873, "epoch": 3.254113985605913, "grad_norm": 1.265625, "learning_rate": 0.00039547864586280583, "loss": 4.9713, "mean_token_accuracy": 0.20851197987794876, "num_tokens": 72554988.0, "step": 41825 }, { "entropy": 5.753931760787964, "epoch": 3.254503014977631, "grad_norm": 1.3203125, "learning_rate": 0.0003954552374672042, "loss": 4.9403, "mean_token_accuracy": 0.20996388792991638, "num_tokens": 72562760.0, "step": 41830 }, { "entropy": 5.679438304901123, "epoch": 3.2548920443493485, "grad_norm": 1.2421875, "learning_rate": 0.0003954318272438862, "loss": 4.918, "mean_token_accuracy": 0.2070965737104416, "num_tokens": 72571908.0, "step": 41835 }, { "entropy": 5.845978021621704, "epoch": 3.255281073721066, "grad_norm": 1.390625, "learning_rate": 0.0003954084151932067, "loss": 4.9822, "mean_token_accuracy": 0.21093352437019347, "num_tokens": 72579840.0, "step": 41840 }, { "entropy": 5.766995048522949, "epoch": 3.2556701030927835, "grad_norm": 1.2734375, "learning_rate": 0.0003953850013155214, "loss": 4.8822, "mean_token_accuracy": 0.21175771653652192, "num_tokens": 72588313.0, "step": 41845 }, { "entropy": 5.778904724121094, "epoch": 3.256059132464501, "grad_norm": 1.4296875, "learning_rate": 0.0003953615856111852, "loss": 4.9747, "mean_token_accuracy": 0.20653759241104125, "num_tokens": 72597634.0, "step": 41850 }, { "entropy": 5.735958385467529, "epoch": 3.256448161836219, "grad_norm": 1.265625, "learning_rate": 0.00039533816808055345, "loss": 4.9294, "mean_token_accuracy": 0.21388962864875793, "num_tokens": 72606092.0, "step": 41855 }, { "entropy": 5.772032880783081, "epoch": 3.256837191207936, "grad_norm": 1.3125, "learning_rate": 0.00039531474872398165, "loss": 4.9979, "mean_token_accuracy": 0.2090501144528389, "num_tokens": 72614753.0, "step": 41860 }, { "entropy": 5.796943473815918, "epoch": 3.257226220579654, "grad_norm": 1.296875, "learning_rate": 0.000395291327541825, "loss": 5.0038, "mean_token_accuracy": 0.2036066770553589, "num_tokens": 72624412.0, "step": 41865 }, { "entropy": 5.79862961769104, "epoch": 3.257615249951371, "grad_norm": 1.2890625, "learning_rate": 0.00039526790453443887, "loss": 4.9355, "mean_token_accuracy": 0.20512652397155762, "num_tokens": 72633680.0, "step": 41870 }, { "entropy": 5.728872776031494, "epoch": 3.258004279323089, "grad_norm": 1.3203125, "learning_rate": 0.00039524447970217875, "loss": 4.9221, "mean_token_accuracy": 0.2095431089401245, "num_tokens": 72642077.0, "step": 41875 }, { "entropy": 5.821186065673828, "epoch": 3.2583933086948065, "grad_norm": 1.34375, "learning_rate": 0.00039522105304540007, "loss": 5.0243, "mean_token_accuracy": 0.2097441703081131, "num_tokens": 72650400.0, "step": 41880 }, { "entropy": 5.805597591400146, "epoch": 3.258782338066524, "grad_norm": 1.265625, "learning_rate": 0.0003951976245644582, "loss": 4.9972, "mean_token_accuracy": 0.20696849524974822, "num_tokens": 72659164.0, "step": 41885 }, { "entropy": 5.797318840026856, "epoch": 3.2591713674382414, "grad_norm": 1.265625, "learning_rate": 0.0003951741942597087, "loss": 4.9804, "mean_token_accuracy": 0.21260118633508682, "num_tokens": 72667771.0, "step": 41890 }, { "entropy": 5.803349018096924, "epoch": 3.259560396809959, "grad_norm": 1.2421875, "learning_rate": 0.00039515076213150714, "loss": 4.9871, "mean_token_accuracy": 0.20673348158597946, "num_tokens": 72677547.0, "step": 41895 }, { "entropy": 5.787631225585938, "epoch": 3.259949426181677, "grad_norm": 1.2890625, "learning_rate": 0.00039512732818020903, "loss": 4.9188, "mean_token_accuracy": 0.20683618932962416, "num_tokens": 72686239.0, "step": 41900 }, { "entropy": 5.841095352172852, "epoch": 3.260338455553394, "grad_norm": 1.4609375, "learning_rate": 0.0003951038924061698, "loss": 5.0379, "mean_token_accuracy": 0.20141848176717758, "num_tokens": 72694645.0, "step": 41905 }, { "entropy": 5.885295438766479, "epoch": 3.2607274849251118, "grad_norm": 1.265625, "learning_rate": 0.00039508045480974517, "loss": 5.0358, "mean_token_accuracy": 0.20548331439495088, "num_tokens": 72703166.0, "step": 41910 }, { "entropy": 5.771586656570435, "epoch": 3.2611165142968295, "grad_norm": 1.265625, "learning_rate": 0.00039505701539129087, "loss": 4.8972, "mean_token_accuracy": 0.21422043740749358, "num_tokens": 72711986.0, "step": 41915 }, { "entropy": 5.751997995376587, "epoch": 3.261505543668547, "grad_norm": 1.4765625, "learning_rate": 0.00039503357415116236, "loss": 4.9224, "mean_token_accuracy": 0.21310362517833709, "num_tokens": 72720410.0, "step": 41920 }, { "entropy": 5.847428703308106, "epoch": 3.2618945730402644, "grad_norm": 1.265625, "learning_rate": 0.00039501013108971547, "loss": 4.9981, "mean_token_accuracy": 0.20331039130687714, "num_tokens": 72729287.0, "step": 41925 }, { "entropy": 5.871307802200318, "epoch": 3.262283602411982, "grad_norm": 1.3359375, "learning_rate": 0.0003949866862073059, "loss": 5.0146, "mean_token_accuracy": 0.200458325445652, "num_tokens": 72737183.0, "step": 41930 }, { "entropy": 5.755697584152221, "epoch": 3.2626726317837, "grad_norm": 1.46875, "learning_rate": 0.00039496323950428925, "loss": 4.9697, "mean_token_accuracy": 0.20957639515399934, "num_tokens": 72745357.0, "step": 41935 }, { "entropy": 5.74701418876648, "epoch": 3.263061661155417, "grad_norm": 1.3828125, "learning_rate": 0.0003949397909810213, "loss": 4.9117, "mean_token_accuracy": 0.20978012979030608, "num_tokens": 72753762.0, "step": 41940 }, { "entropy": 5.774263334274292, "epoch": 3.2634506905271348, "grad_norm": 1.375, "learning_rate": 0.00039491634063785813, "loss": 4.8677, "mean_token_accuracy": 0.21743618547916413, "num_tokens": 72762259.0, "step": 41945 }, { "entropy": 5.7682489395141605, "epoch": 3.2638397198988525, "grad_norm": 1.2890625, "learning_rate": 0.00039489288847515525, "loss": 4.953, "mean_token_accuracy": 0.21236226707696915, "num_tokens": 72770831.0, "step": 41950 }, { "entropy": 5.753204774856568, "epoch": 3.26422874927057, "grad_norm": 1.2265625, "learning_rate": 0.0003948694344932687, "loss": 4.92, "mean_token_accuracy": 0.21169506907463073, "num_tokens": 72779337.0, "step": 41955 }, { "entropy": 5.729788780212402, "epoch": 3.2646177786422874, "grad_norm": 1.3984375, "learning_rate": 0.0003948459786925542, "loss": 4.8605, "mean_token_accuracy": 0.21805996149778367, "num_tokens": 72788144.0, "step": 41960 }, { "entropy": 5.772341346740722, "epoch": 3.265006808014005, "grad_norm": 1.4375, "learning_rate": 0.0003948225210733677, "loss": 4.9733, "mean_token_accuracy": 0.20488758832216264, "num_tokens": 72796371.0, "step": 41965 }, { "entropy": 5.753141069412232, "epoch": 3.265395837385723, "grad_norm": 1.3125, "learning_rate": 0.0003947990616360652, "loss": 4.8722, "mean_token_accuracy": 0.21605935096740722, "num_tokens": 72804778.0, "step": 41970 }, { "entropy": 5.805202341079712, "epoch": 3.26578486675744, "grad_norm": 1.4453125, "learning_rate": 0.0003947756003810026, "loss": 4.9964, "mean_token_accuracy": 0.21081893444061278, "num_tokens": 72813507.0, "step": 41975 }, { "entropy": 5.802801561355591, "epoch": 3.2661738961291578, "grad_norm": 1.2265625, "learning_rate": 0.0003947521373085359, "loss": 4.969, "mean_token_accuracy": 0.21260876059532166, "num_tokens": 72822772.0, "step": 41980 }, { "entropy": 5.829446840286255, "epoch": 3.2665629255008755, "grad_norm": 1.2890625, "learning_rate": 0.0003947286724190212, "loss": 5.0183, "mean_token_accuracy": 0.20503782629966735, "num_tokens": 72831573.0, "step": 41985 }, { "entropy": 5.8287725925445555, "epoch": 3.2669519548725927, "grad_norm": 1.2734375, "learning_rate": 0.00039470520571281443, "loss": 4.9435, "mean_token_accuracy": 0.21646904647350312, "num_tokens": 72840461.0, "step": 41990 }, { "entropy": 5.779353141784668, "epoch": 3.2673409842443104, "grad_norm": 1.3125, "learning_rate": 0.00039468173719027163, "loss": 4.9624, "mean_token_accuracy": 0.21344774216413498, "num_tokens": 72848834.0, "step": 41995 }, { "entropy": 5.830813312530518, "epoch": 3.267730013616028, "grad_norm": 1.40625, "learning_rate": 0.0003946582668517491, "loss": 4.9684, "mean_token_accuracy": 0.20072566121816635, "num_tokens": 72857679.0, "step": 42000 }, { "epoch": 3.267730013616028, "eval_entropy": 5.5260473615739985, "eval_loss": 5.057919979095459, "eval_mean_token_accuracy": 0.21425015702054864, "eval_num_tokens": 72857679.0, "eval_runtime": 21.6463, "eval_samples_per_second": 1919.869, "eval_steps_per_second": 239.995, "step": 42000 }, { "entropy": 5.8353666305542, "epoch": 3.2681190429877454, "grad_norm": 1.296875, "learning_rate": 0.0003946347946976026, "loss": 5.0601, "mean_token_accuracy": 0.20797564834356308, "num_tokens": 72866664.0, "step": 42005 }, { "entropy": 5.767755174636841, "epoch": 3.268508072359463, "grad_norm": 1.2578125, "learning_rate": 0.0003946113207281887, "loss": 4.9524, "mean_token_accuracy": 0.2151929333806038, "num_tokens": 72875520.0, "step": 42010 }, { "entropy": 5.7643791198730465, "epoch": 3.2688971017311808, "grad_norm": 1.34375, "learning_rate": 0.00039458784494386337, "loss": 4.9027, "mean_token_accuracy": 0.21366244405508042, "num_tokens": 72884251.0, "step": 42015 }, { "entropy": 5.862772417068482, "epoch": 3.2692861311028985, "grad_norm": 1.2109375, "learning_rate": 0.00039456436734498275, "loss": 5.0139, "mean_token_accuracy": 0.2043629080057144, "num_tokens": 72893317.0, "step": 42020 }, { "entropy": 5.8049407482147215, "epoch": 3.2696751604746157, "grad_norm": 1.3125, "learning_rate": 0.00039454088793190316, "loss": 4.9428, "mean_token_accuracy": 0.20935947448015213, "num_tokens": 72902118.0, "step": 42025 }, { "entropy": 5.7715034008026125, "epoch": 3.2700641898463334, "grad_norm": 1.234375, "learning_rate": 0.00039451740670498094, "loss": 4.9871, "mean_token_accuracy": 0.21034318655729295, "num_tokens": 72911165.0, "step": 42030 }, { "entropy": 5.839892244338989, "epoch": 3.270453219218051, "grad_norm": 1.25, "learning_rate": 0.0003944939236645723, "loss": 5.0767, "mean_token_accuracy": 0.1951673373579979, "num_tokens": 72920348.0, "step": 42035 }, { "entropy": 5.827449226379395, "epoch": 3.2708422485897684, "grad_norm": 1.3046875, "learning_rate": 0.0003944704388110335, "loss": 4.9274, "mean_token_accuracy": 0.20893989205360414, "num_tokens": 72929568.0, "step": 42040 }, { "entropy": 5.794518375396729, "epoch": 3.271231277961486, "grad_norm": 1.4375, "learning_rate": 0.000394446952144721, "loss": 4.9623, "mean_token_accuracy": 0.21372252106666564, "num_tokens": 72937972.0, "step": 42045 }, { "entropy": 5.7527495384216305, "epoch": 3.2716203073332037, "grad_norm": 1.296875, "learning_rate": 0.0003944234636659911, "loss": 4.9452, "mean_token_accuracy": 0.21406518518924714, "num_tokens": 72946186.0, "step": 42050 }, { "entropy": 5.710104274749756, "epoch": 3.2720093367049214, "grad_norm": 1.296875, "learning_rate": 0.0003943999733752003, "loss": 4.888, "mean_token_accuracy": 0.2141503095626831, "num_tokens": 72954521.0, "step": 42055 }, { "entropy": 5.797924470901489, "epoch": 3.2723983660766387, "grad_norm": 1.3125, "learning_rate": 0.0003943764812727048, "loss": 4.9045, "mean_token_accuracy": 0.214504274725914, "num_tokens": 72962420.0, "step": 42060 }, { "entropy": 5.800952196121216, "epoch": 3.2727873954483564, "grad_norm": 1.3359375, "learning_rate": 0.00039435298735886133, "loss": 4.9101, "mean_token_accuracy": 0.2138211652636528, "num_tokens": 72970528.0, "step": 42065 }, { "entropy": 5.736666488647461, "epoch": 3.273176424820074, "grad_norm": 1.25, "learning_rate": 0.0003943294916340261, "loss": 4.9243, "mean_token_accuracy": 0.2162165269255638, "num_tokens": 72979618.0, "step": 42070 }, { "entropy": 5.7181555271148685, "epoch": 3.2735654541917913, "grad_norm": 1.3203125, "learning_rate": 0.0003943059940985559, "loss": 4.8623, "mean_token_accuracy": 0.22072324454784392, "num_tokens": 72988133.0, "step": 42075 }, { "entropy": 5.789815378189087, "epoch": 3.273954483563509, "grad_norm": 1.3359375, "learning_rate": 0.00039428249475280706, "loss": 4.9098, "mean_token_accuracy": 0.21963633745908737, "num_tokens": 72996872.0, "step": 42080 }, { "entropy": 5.771847486495972, "epoch": 3.2743435129352267, "grad_norm": 1.40625, "learning_rate": 0.0003942589935971363, "loss": 4.9469, "mean_token_accuracy": 0.22160242050886153, "num_tokens": 73005494.0, "step": 42085 }, { "entropy": 5.84940390586853, "epoch": 3.274732542306944, "grad_norm": 1.3671875, "learning_rate": 0.0003942354906319001, "loss": 5.0134, "mean_token_accuracy": 0.2070903569459915, "num_tokens": 73013729.0, "step": 42090 }, { "entropy": 5.784751605987549, "epoch": 3.2751215716786617, "grad_norm": 1.2578125, "learning_rate": 0.0003942119858574551, "loss": 4.9499, "mean_token_accuracy": 0.2138244852423668, "num_tokens": 73022337.0, "step": 42095 }, { "entropy": 5.7774981498718265, "epoch": 3.2755106010503794, "grad_norm": 1.234375, "learning_rate": 0.000394188479274158, "loss": 4.9863, "mean_token_accuracy": 0.21042919754981995, "num_tokens": 73031758.0, "step": 42100 }, { "entropy": 5.8162487030029295, "epoch": 3.2758996304220966, "grad_norm": 1.375, "learning_rate": 0.00039416497088236535, "loss": 4.9376, "mean_token_accuracy": 0.20826828628778457, "num_tokens": 73040046.0, "step": 42105 }, { "entropy": 5.735775279998779, "epoch": 3.2762886597938143, "grad_norm": 1.2890625, "learning_rate": 0.000394141460682434, "loss": 4.878, "mean_token_accuracy": 0.21333095133304597, "num_tokens": 73048930.0, "step": 42110 }, { "entropy": 5.765983295440674, "epoch": 3.276677689165532, "grad_norm": 1.296875, "learning_rate": 0.0003941179486747206, "loss": 4.9386, "mean_token_accuracy": 0.21936486959457396, "num_tokens": 73056952.0, "step": 42115 }, { "entropy": 5.739984655380249, "epoch": 3.2770667185372497, "grad_norm": 1.3203125, "learning_rate": 0.0003940944348595819, "loss": 4.9717, "mean_token_accuracy": 0.205256912112236, "num_tokens": 73066289.0, "step": 42120 }, { "entropy": 5.7718315601348875, "epoch": 3.277455747908967, "grad_norm": 1.2890625, "learning_rate": 0.00039407091923737475, "loss": 4.9237, "mean_token_accuracy": 0.2172948732972145, "num_tokens": 73074484.0, "step": 42125 }, { "entropy": 5.769897031784057, "epoch": 3.2778447772806847, "grad_norm": 1.3125, "learning_rate": 0.00039404740180845594, "loss": 4.9642, "mean_token_accuracy": 0.2020992323756218, "num_tokens": 73082781.0, "step": 42130 }, { "entropy": 5.842834854125977, "epoch": 3.2782338066524024, "grad_norm": 1.2578125, "learning_rate": 0.00039402388257318236, "loss": 4.9572, "mean_token_accuracy": 0.21116927564144133, "num_tokens": 73091180.0, "step": 42135 }, { "entropy": 5.7624400615692135, "epoch": 3.2786228360241196, "grad_norm": 1.3671875, "learning_rate": 0.0003940003615319106, "loss": 4.9127, "mean_token_accuracy": 0.2146841213107109, "num_tokens": 73100328.0, "step": 42140 }, { "entropy": 5.815159273147583, "epoch": 3.2790118653958373, "grad_norm": 1.375, "learning_rate": 0.00039397683868499784, "loss": 4.9187, "mean_token_accuracy": 0.22074707299470903, "num_tokens": 73108912.0, "step": 42145 }, { "entropy": 5.832073163986206, "epoch": 3.279400894767555, "grad_norm": 1.296875, "learning_rate": 0.000393953314032801, "loss": 4.9992, "mean_token_accuracy": 0.20668767988681794, "num_tokens": 73118136.0, "step": 42150 }, { "entropy": 5.715669822692871, "epoch": 3.2797899241392727, "grad_norm": 1.2578125, "learning_rate": 0.0003939297875756769, "loss": 4.9326, "mean_token_accuracy": 0.21216078251600265, "num_tokens": 73126958.0, "step": 42155 }, { "entropy": 5.822102689743042, "epoch": 3.28017895351099, "grad_norm": 1.1328125, "learning_rate": 0.0003939062593139825, "loss": 4.9345, "mean_token_accuracy": 0.20107005387544633, "num_tokens": 73135456.0, "step": 42160 }, { "entropy": 5.77185173034668, "epoch": 3.2805679828827077, "grad_norm": 1.296875, "learning_rate": 0.000393882729248075, "loss": 4.8847, "mean_token_accuracy": 0.21663930416107177, "num_tokens": 73143190.0, "step": 42165 }, { "entropy": 5.727248191833496, "epoch": 3.2809570122544254, "grad_norm": 1.3203125, "learning_rate": 0.00039385919737831127, "loss": 4.9218, "mean_token_accuracy": 0.2165819823741913, "num_tokens": 73152275.0, "step": 42170 }, { "entropy": 5.74052062034607, "epoch": 3.2813460416261426, "grad_norm": 1.265625, "learning_rate": 0.00039383566370504837, "loss": 4.9333, "mean_token_accuracy": 0.21155402958393096, "num_tokens": 73160687.0, "step": 42175 }, { "entropy": 5.765167284011841, "epoch": 3.2817350709978603, "grad_norm": 1.3203125, "learning_rate": 0.0003938121282286434, "loss": 5.0661, "mean_token_accuracy": 0.1958122506737709, "num_tokens": 73168843.0, "step": 42180 }, { "entropy": 5.833106470108032, "epoch": 3.282124100369578, "grad_norm": 1.4375, "learning_rate": 0.00039378859094945366, "loss": 4.9571, "mean_token_accuracy": 0.2064648151397705, "num_tokens": 73177121.0, "step": 42185 }, { "entropy": 5.843419218063355, "epoch": 3.2825131297412953, "grad_norm": 1.3515625, "learning_rate": 0.0003937650518678359, "loss": 4.9611, "mean_token_accuracy": 0.20941423624753952, "num_tokens": 73184952.0, "step": 42190 }, { "entropy": 5.7465287208557125, "epoch": 3.282902159113013, "grad_norm": 1.28125, "learning_rate": 0.0003937415109841476, "loss": 4.9421, "mean_token_accuracy": 0.21175391376018524, "num_tokens": 73193509.0, "step": 42195 }, { "entropy": 5.741303586959839, "epoch": 3.2832911884847307, "grad_norm": 1.40625, "learning_rate": 0.0003937179682987459, "loss": 4.8666, "mean_token_accuracy": 0.21290434002876282, "num_tokens": 73201083.0, "step": 42200 }, { "entropy": 5.740461683273315, "epoch": 3.283680217856448, "grad_norm": 1.265625, "learning_rate": 0.00039369442381198793, "loss": 4.8888, "mean_token_accuracy": 0.21365808099508285, "num_tokens": 73209852.0, "step": 42205 }, { "entropy": 5.7271558284759525, "epoch": 3.2840692472281656, "grad_norm": 1.3046875, "learning_rate": 0.000393670877524231, "loss": 4.9111, "mean_token_accuracy": 0.21823494434356688, "num_tokens": 73218338.0, "step": 42210 }, { "entropy": 5.66881685256958, "epoch": 3.2844582765998833, "grad_norm": 1.4375, "learning_rate": 0.0003936473294358325, "loss": 4.8173, "mean_token_accuracy": 0.2260278657078743, "num_tokens": 73226820.0, "step": 42215 }, { "entropy": 5.817070150375367, "epoch": 3.284847305971601, "grad_norm": 1.296875, "learning_rate": 0.0003936237795471495, "loss": 4.9675, "mean_token_accuracy": 0.20792263746261597, "num_tokens": 73235019.0, "step": 42220 }, { "entropy": 5.714281225204468, "epoch": 3.2852363353433183, "grad_norm": 1.2734375, "learning_rate": 0.00039360022785853957, "loss": 4.9478, "mean_token_accuracy": 0.20894336849451065, "num_tokens": 73243994.0, "step": 42225 }, { "entropy": 5.797858762741089, "epoch": 3.285625364715036, "grad_norm": 1.296875, "learning_rate": 0.0003935766743703599, "loss": 4.9464, "mean_token_accuracy": 0.2104901060461998, "num_tokens": 73252259.0, "step": 42230 }, { "entropy": 5.828192901611328, "epoch": 3.2860143940867537, "grad_norm": 1.3125, "learning_rate": 0.00039355311908296787, "loss": 5.0013, "mean_token_accuracy": 0.20169143825769426, "num_tokens": 73261559.0, "step": 42235 }, { "entropy": 5.752818059921265, "epoch": 3.286403423458471, "grad_norm": 1.328125, "learning_rate": 0.000393529561996721, "loss": 4.9144, "mean_token_accuracy": 0.21922177523374559, "num_tokens": 73269534.0, "step": 42240 }, { "entropy": 5.738799428939819, "epoch": 3.2867924528301886, "grad_norm": 1.3125, "learning_rate": 0.00039350600311197667, "loss": 4.9036, "mean_token_accuracy": 0.2109024465084076, "num_tokens": 73277992.0, "step": 42245 }, { "entropy": 5.841897869110108, "epoch": 3.2871814822019063, "grad_norm": 1.421875, "learning_rate": 0.00039348244242909234, "loss": 4.9708, "mean_token_accuracy": 0.21453722268342973, "num_tokens": 73286551.0, "step": 42250 }, { "entropy": 5.831005811691284, "epoch": 3.287570511573624, "grad_norm": 1.3515625, "learning_rate": 0.00039345887994842566, "loss": 4.9464, "mean_token_accuracy": 0.21026972979307174, "num_tokens": 73294945.0, "step": 42255 }, { "entropy": 5.884213829040528, "epoch": 3.2879595409453413, "grad_norm": 1.3046875, "learning_rate": 0.0003934353156703339, "loss": 5.0274, "mean_token_accuracy": 0.2066524013876915, "num_tokens": 73303657.0, "step": 42260 }, { "entropy": 5.777671766281128, "epoch": 3.288348570317059, "grad_norm": 1.28125, "learning_rate": 0.0003934117495951748, "loss": 5.0061, "mean_token_accuracy": 0.20674631446599961, "num_tokens": 73312435.0, "step": 42265 }, { "entropy": 5.8068907260894775, "epoch": 3.2887375996887767, "grad_norm": 1.328125, "learning_rate": 0.0003933881817233058, "loss": 4.9729, "mean_token_accuracy": 0.2162238374352455, "num_tokens": 73321268.0, "step": 42270 }, { "entropy": 5.800904273986816, "epoch": 3.289126629060494, "grad_norm": 1.3515625, "learning_rate": 0.00039336461205508456, "loss": 4.9439, "mean_token_accuracy": 0.21462571918964385, "num_tokens": 73329608.0, "step": 42275 }, { "entropy": 5.778906154632568, "epoch": 3.2895156584322116, "grad_norm": 1.2734375, "learning_rate": 0.0003933410405908689, "loss": 4.8902, "mean_token_accuracy": 0.21517149358987808, "num_tokens": 73338270.0, "step": 42280 }, { "entropy": 5.7535277843475345, "epoch": 3.2899046878039293, "grad_norm": 1.234375, "learning_rate": 0.00039331746733101613, "loss": 4.9233, "mean_token_accuracy": 0.21606485098600386, "num_tokens": 73346906.0, "step": 42285 }, { "entropy": 5.748022127151489, "epoch": 3.290293717175647, "grad_norm": 1.3046875, "learning_rate": 0.00039329389227588416, "loss": 4.9799, "mean_token_accuracy": 0.21234003007411956, "num_tokens": 73355323.0, "step": 42290 }, { "entropy": 5.742446041107177, "epoch": 3.2906827465473643, "grad_norm": 1.3125, "learning_rate": 0.00039327031542583067, "loss": 4.9718, "mean_token_accuracy": 0.20116834640502929, "num_tokens": 73364072.0, "step": 42295 }, { "entropy": 5.782241868972778, "epoch": 3.291071775919082, "grad_norm": 1.25, "learning_rate": 0.00039324673678121344, "loss": 5.0242, "mean_token_accuracy": 0.2096337154507637, "num_tokens": 73372593.0, "step": 42300 }, { "entropy": 5.834931135177612, "epoch": 3.291460805290799, "grad_norm": 1.4140625, "learning_rate": 0.0003932231563423901, "loss": 5.0732, "mean_token_accuracy": 0.20136449486017227, "num_tokens": 73381411.0, "step": 42305 }, { "entropy": 5.7392901420593265, "epoch": 3.291849834662517, "grad_norm": 1.328125, "learning_rate": 0.0003931995741097186, "loss": 4.8963, "mean_token_accuracy": 0.20929544866085054, "num_tokens": 73389867.0, "step": 42310 }, { "entropy": 5.758313608169556, "epoch": 3.2922388640342346, "grad_norm": 1.25, "learning_rate": 0.00039317599008355665, "loss": 4.9328, "mean_token_accuracy": 0.20993476510047912, "num_tokens": 73398298.0, "step": 42315 }, { "entropy": 5.695717287063599, "epoch": 3.2926278934059523, "grad_norm": 1.296875, "learning_rate": 0.0003931524042642622, "loss": 4.8842, "mean_token_accuracy": 0.21592040061950685, "num_tokens": 73406566.0, "step": 42320 }, { "entropy": 5.701685810089112, "epoch": 3.2930169227776696, "grad_norm": 1.28125, "learning_rate": 0.0003931288166521931, "loss": 4.8751, "mean_token_accuracy": 0.21133394539356232, "num_tokens": 73415390.0, "step": 42325 }, { "entropy": 5.8186342239379885, "epoch": 3.2934059521493873, "grad_norm": 1.2265625, "learning_rate": 0.00039310522724770713, "loss": 4.9887, "mean_token_accuracy": 0.20933892577886581, "num_tokens": 73424400.0, "step": 42330 }, { "entropy": 5.829278659820557, "epoch": 3.293794981521105, "grad_norm": 1.3984375, "learning_rate": 0.00039308163605116235, "loss": 5.0412, "mean_token_accuracy": 0.21118811517953873, "num_tokens": 73433359.0, "step": 42335 }, { "entropy": 5.724311971664429, "epoch": 3.294184010892822, "grad_norm": 1.265625, "learning_rate": 0.0003930580430629167, "loss": 4.8605, "mean_token_accuracy": 0.21526950001716613, "num_tokens": 73442353.0, "step": 42340 }, { "entropy": 5.80981478691101, "epoch": 3.29457304026454, "grad_norm": 1.3125, "learning_rate": 0.0003930344482833281, "loss": 4.9162, "mean_token_accuracy": 0.2191297322511673, "num_tokens": 73451122.0, "step": 42345 }, { "entropy": 5.741959571838379, "epoch": 3.2949620696362576, "grad_norm": 1.265625, "learning_rate": 0.00039301085171275475, "loss": 4.9762, "mean_token_accuracy": 0.2037878453731537, "num_tokens": 73459733.0, "step": 42350 }, { "entropy": 5.756991624832153, "epoch": 3.2953510990079753, "grad_norm": 1.2265625, "learning_rate": 0.0003929872533515545, "loss": 4.8961, "mean_token_accuracy": 0.21638020426034926, "num_tokens": 73468454.0, "step": 42355 }, { "entropy": 5.838932085037231, "epoch": 3.2957401283796925, "grad_norm": 1.2734375, "learning_rate": 0.00039296365320008546, "loss": 4.9973, "mean_token_accuracy": 0.20626482367515564, "num_tokens": 73477541.0, "step": 42360 }, { "entropy": 5.786115932464599, "epoch": 3.2961291577514102, "grad_norm": 1.3515625, "learning_rate": 0.00039294005125870576, "loss": 5.0058, "mean_token_accuracy": 0.2011064127087593, "num_tokens": 73485625.0, "step": 42365 }, { "entropy": 5.735745620727539, "epoch": 3.296518187123128, "grad_norm": 1.21875, "learning_rate": 0.00039291644752777346, "loss": 4.9592, "mean_token_accuracy": 0.21063903272151946, "num_tokens": 73494157.0, "step": 42370 }, { "entropy": 5.7321961402893065, "epoch": 3.296907216494845, "grad_norm": 1.3515625, "learning_rate": 0.00039289284200764676, "loss": 4.9553, "mean_token_accuracy": 0.21541667878627777, "num_tokens": 73503322.0, "step": 42375 }, { "entropy": 5.784214305877685, "epoch": 3.297296245866563, "grad_norm": 1.2734375, "learning_rate": 0.0003928692346986839, "loss": 5.022, "mean_token_accuracy": 0.2029736667871475, "num_tokens": 73513009.0, "step": 42380 }, { "entropy": 5.816185569763183, "epoch": 3.2976852752382806, "grad_norm": 1.375, "learning_rate": 0.00039284562560124297, "loss": 4.9372, "mean_token_accuracy": 0.20955168306827546, "num_tokens": 73520911.0, "step": 42385 }, { "entropy": 5.7610023498535154, "epoch": 3.2980743046099983, "grad_norm": 1.34375, "learning_rate": 0.0003928220147156822, "loss": 4.9252, "mean_token_accuracy": 0.21787703037261963, "num_tokens": 73529810.0, "step": 42390 }, { "entropy": 5.820196199417114, "epoch": 3.2984633339817155, "grad_norm": 1.21875, "learning_rate": 0.00039279840204235994, "loss": 5.0576, "mean_token_accuracy": 0.20580350905656813, "num_tokens": 73539305.0, "step": 42395 }, { "entropy": 5.820378017425537, "epoch": 3.2988523633534332, "grad_norm": 1.3359375, "learning_rate": 0.00039277478758163443, "loss": 4.9835, "mean_token_accuracy": 0.20588480234146117, "num_tokens": 73548073.0, "step": 42400 }, { "entropy": 5.7882054328918455, "epoch": 3.299241392725151, "grad_norm": 1.28125, "learning_rate": 0.000392751171333864, "loss": 4.9579, "mean_token_accuracy": 0.20933324545621873, "num_tokens": 73556825.0, "step": 42405 }, { "entropy": 5.749024868011475, "epoch": 3.299630422096868, "grad_norm": 1.3125, "learning_rate": 0.00039272755329940683, "loss": 4.9456, "mean_token_accuracy": 0.2125742554664612, "num_tokens": 73565966.0, "step": 42410 }, { "entropy": 5.773288011550903, "epoch": 3.300019451468586, "grad_norm": 1.4453125, "learning_rate": 0.00039270393347862155, "loss": 4.9851, "mean_token_accuracy": 0.21827813535928725, "num_tokens": 73574653.0, "step": 42415 }, { "entropy": 5.859968805313111, "epoch": 3.3004084808403036, "grad_norm": 1.3515625, "learning_rate": 0.00039268031187186635, "loss": 4.9544, "mean_token_accuracy": 0.21422431915998458, "num_tokens": 73583608.0, "step": 42420 }, { "entropy": 5.713300895690918, "epoch": 3.300797510212021, "grad_norm": 1.34375, "learning_rate": 0.00039265668847949977, "loss": 4.8921, "mean_token_accuracy": 0.21883197873830795, "num_tokens": 73592431.0, "step": 42425 }, { "entropy": 5.766004753112793, "epoch": 3.3011865395837385, "grad_norm": 1.2421875, "learning_rate": 0.0003926330633018802, "loss": 4.9583, "mean_token_accuracy": 0.20688221454620362, "num_tokens": 73600842.0, "step": 42430 }, { "entropy": 5.8409912109375, "epoch": 3.3015755689554562, "grad_norm": 1.296875, "learning_rate": 0.00039260943633936615, "loss": 4.9438, "mean_token_accuracy": 0.21181000620126725, "num_tokens": 73609725.0, "step": 42435 }, { "entropy": 5.699888610839844, "epoch": 3.3019645983271735, "grad_norm": 1.2421875, "learning_rate": 0.00039258580759231603, "loss": 4.8241, "mean_token_accuracy": 0.22093468606472016, "num_tokens": 73619429.0, "step": 42440 }, { "entropy": 5.772678089141846, "epoch": 3.302353627698891, "grad_norm": 1.3046875, "learning_rate": 0.0003925621770610885, "loss": 4.9884, "mean_token_accuracy": 0.20284869521856308, "num_tokens": 73628370.0, "step": 42445 }, { "entropy": 5.784737634658813, "epoch": 3.302742657070609, "grad_norm": 1.375, "learning_rate": 0.000392538544746042, "loss": 4.9438, "mean_token_accuracy": 0.21115392148494722, "num_tokens": 73637500.0, "step": 42450 }, { "entropy": 5.7652268409729, "epoch": 3.3031316864423266, "grad_norm": 1.3046875, "learning_rate": 0.00039251491064753525, "loss": 4.937, "mean_token_accuracy": 0.20731833279132844, "num_tokens": 73646597.0, "step": 42455 }, { "entropy": 5.767674255371094, "epoch": 3.303520715814044, "grad_norm": 1.375, "learning_rate": 0.0003924912747659267, "loss": 4.8543, "mean_token_accuracy": 0.21410742551088333, "num_tokens": 73654611.0, "step": 42460 }, { "entropy": 5.758406114578247, "epoch": 3.3039097451857615, "grad_norm": 1.2421875, "learning_rate": 0.00039246763710157513, "loss": 4.9909, "mean_token_accuracy": 0.2072486698627472, "num_tokens": 73663011.0, "step": 42465 }, { "entropy": 5.7371903419494625, "epoch": 3.3042987745574792, "grad_norm": 1.46875, "learning_rate": 0.0003924439976548391, "loss": 4.9466, "mean_token_accuracy": 0.21162840723991394, "num_tokens": 73670920.0, "step": 42470 }, { "entropy": 5.759010076522827, "epoch": 3.3046878039291965, "grad_norm": 1.296875, "learning_rate": 0.00039242035642607733, "loss": 4.9061, "mean_token_accuracy": 0.21816686987876893, "num_tokens": 73680124.0, "step": 42475 }, { "entropy": 5.780799102783203, "epoch": 3.305076833300914, "grad_norm": 1.2890625, "learning_rate": 0.0003923967134156486, "loss": 4.9278, "mean_token_accuracy": 0.21073389053344727, "num_tokens": 73688573.0, "step": 42480 }, { "entropy": 5.775097036361695, "epoch": 3.305465862672632, "grad_norm": 1.3125, "learning_rate": 0.0003923730686239115, "loss": 4.9714, "mean_token_accuracy": 0.21341782957315444, "num_tokens": 73697617.0, "step": 42485 }, { "entropy": 5.764447832107544, "epoch": 3.3058548920443496, "grad_norm": 1.1796875, "learning_rate": 0.0003923494220512249, "loss": 4.8842, "mean_token_accuracy": 0.2119905561208725, "num_tokens": 73706284.0, "step": 42490 }, { "entropy": 5.761100101470947, "epoch": 3.306243921416067, "grad_norm": 1.3671875, "learning_rate": 0.0003923257736979476, "loss": 4.8982, "mean_token_accuracy": 0.21609483063220977, "num_tokens": 73714820.0, "step": 42495 }, { "entropy": 5.711197805404663, "epoch": 3.3066329507877845, "grad_norm": 1.3203125, "learning_rate": 0.00039230212356443855, "loss": 4.9275, "mean_token_accuracy": 0.20759422928094864, "num_tokens": 73723292.0, "step": 42500 }, { "entropy": 5.796087217330933, "epoch": 3.307021980159502, "grad_norm": 1.2265625, "learning_rate": 0.00039227847165105635, "loss": 4.9701, "mean_token_accuracy": 0.20813422799110412, "num_tokens": 73732063.0, "step": 42505 }, { "entropy": 5.813875722885132, "epoch": 3.3074110095312195, "grad_norm": 1.234375, "learning_rate": 0.00039225481795816016, "loss": 4.9883, "mean_token_accuracy": 0.21321143805980683, "num_tokens": 73741072.0, "step": 42510 }, { "entropy": 5.744546890258789, "epoch": 3.307800038902937, "grad_norm": 1.2265625, "learning_rate": 0.0003922311624861086, "loss": 4.9122, "mean_token_accuracy": 0.21919479072093964, "num_tokens": 73749612.0, "step": 42515 }, { "entropy": 5.75765380859375, "epoch": 3.308189068274655, "grad_norm": 1.2890625, "learning_rate": 0.0003922075052352608, "loss": 4.9351, "mean_token_accuracy": 0.21773139238357545, "num_tokens": 73757829.0, "step": 42520 }, { "entropy": 5.771203899383545, "epoch": 3.308578097646372, "grad_norm": 1.375, "learning_rate": 0.0003921838462059756, "loss": 4.9295, "mean_token_accuracy": 0.20988146364688873, "num_tokens": 73766760.0, "step": 42525 }, { "entropy": 5.821274518966675, "epoch": 3.30896712701809, "grad_norm": 1.4375, "learning_rate": 0.00039216018539861217, "loss": 5.0728, "mean_token_accuracy": 0.20465299636125564, "num_tokens": 73775851.0, "step": 42530 }, { "entropy": 5.756387186050415, "epoch": 3.3093561563898075, "grad_norm": 1.4453125, "learning_rate": 0.0003921365228135293, "loss": 4.861, "mean_token_accuracy": 0.21798497140407563, "num_tokens": 73784090.0, "step": 42535 }, { "entropy": 5.764560270309448, "epoch": 3.3097451857615248, "grad_norm": 1.2890625, "learning_rate": 0.00039211285845108617, "loss": 4.9432, "mean_token_accuracy": 0.21390602141618728, "num_tokens": 73792709.0, "step": 42540 }, { "entropy": 5.8294023990631105, "epoch": 3.3101342151332425, "grad_norm": 1.2890625, "learning_rate": 0.0003920891923116418, "loss": 4.9738, "mean_token_accuracy": 0.21261801123619078, "num_tokens": 73801017.0, "step": 42545 }, { "entropy": 5.771236371994019, "epoch": 3.31052324450496, "grad_norm": 1.296875, "learning_rate": 0.00039206552439555544, "loss": 4.908, "mean_token_accuracy": 0.2133936643600464, "num_tokens": 73809701.0, "step": 42550 }, { "entropy": 5.8370280265808105, "epoch": 3.310912273876678, "grad_norm": 1.3046875, "learning_rate": 0.0003920418547031859, "loss": 5.0357, "mean_token_accuracy": 0.20860536098480226, "num_tokens": 73817935.0, "step": 42555 }, { "entropy": 5.712747097015381, "epoch": 3.311301303248395, "grad_norm": 1.203125, "learning_rate": 0.0003920181832348926, "loss": 4.8423, "mean_token_accuracy": 0.21787121444940566, "num_tokens": 73827212.0, "step": 42560 }, { "entropy": 5.799317741394043, "epoch": 3.311690332620113, "grad_norm": 1.453125, "learning_rate": 0.0003919945099910346, "loss": 5.0145, "mean_token_accuracy": 0.20580929666757583, "num_tokens": 73835114.0, "step": 42565 }, { "entropy": 5.766094589233399, "epoch": 3.3120793619918305, "grad_norm": 1.25, "learning_rate": 0.00039197083497197107, "loss": 4.9631, "mean_token_accuracy": 0.20789227187633513, "num_tokens": 73844137.0, "step": 42570 }, { "entropy": 5.736127662658691, "epoch": 3.3124683913635478, "grad_norm": 1.2734375, "learning_rate": 0.0003919471581780613, "loss": 4.9197, "mean_token_accuracy": 0.21949973851442336, "num_tokens": 73852949.0, "step": 42575 }, { "entropy": 5.73894567489624, "epoch": 3.3128574207352655, "grad_norm": 1.3125, "learning_rate": 0.0003919234796096646, "loss": 4.8586, "mean_token_accuracy": 0.21444689482450485, "num_tokens": 73860980.0, "step": 42580 }, { "entropy": 5.842160224914551, "epoch": 3.313246450106983, "grad_norm": 1.21875, "learning_rate": 0.0003918997992671402, "loss": 4.9859, "mean_token_accuracy": 0.20463809818029405, "num_tokens": 73869895.0, "step": 42585 }, { "entropy": 5.767362928390503, "epoch": 3.313635479478701, "grad_norm": 1.2265625, "learning_rate": 0.0003918761171508475, "loss": 4.8703, "mean_token_accuracy": 0.21930616050958635, "num_tokens": 73879297.0, "step": 42590 }, { "entropy": 5.7733128547668455, "epoch": 3.314024508850418, "grad_norm": 1.3828125, "learning_rate": 0.0003918524332611456, "loss": 4.9392, "mean_token_accuracy": 0.21133694648742676, "num_tokens": 73887317.0, "step": 42595 }, { "entropy": 5.768320369720459, "epoch": 3.314413538222136, "grad_norm": 1.2265625, "learning_rate": 0.0003918287475983941, "loss": 4.9054, "mean_token_accuracy": 0.20762852877378463, "num_tokens": 73896744.0, "step": 42600 }, { "entropy": 5.8144340991973875, "epoch": 3.3148025675938535, "grad_norm": 1.359375, "learning_rate": 0.00039180506016295226, "loss": 4.9647, "mean_token_accuracy": 0.20984750539064406, "num_tokens": 73905084.0, "step": 42605 }, { "entropy": 5.84724497795105, "epoch": 3.3151915969655708, "grad_norm": 1.2578125, "learning_rate": 0.00039178137095517956, "loss": 5.0085, "mean_token_accuracy": 0.20709204077720642, "num_tokens": 73914342.0, "step": 42610 }, { "entropy": 5.749449634552002, "epoch": 3.3155806263372885, "grad_norm": 1.25, "learning_rate": 0.0003917576799754354, "loss": 4.9477, "mean_token_accuracy": 0.21362036615610122, "num_tokens": 73923241.0, "step": 42615 }, { "entropy": 5.809291172027588, "epoch": 3.315969655709006, "grad_norm": 1.296875, "learning_rate": 0.0003917339872240793, "loss": 4.9556, "mean_token_accuracy": 0.20611730217933655, "num_tokens": 73932142.0, "step": 42620 }, { "entropy": 5.780808734893799, "epoch": 3.3163586850807234, "grad_norm": 1.2421875, "learning_rate": 0.0003917102927014708, "loss": 4.8901, "mean_token_accuracy": 0.2145555406808853, "num_tokens": 73941163.0, "step": 42625 }, { "entropy": 5.7517133235931395, "epoch": 3.316747714452441, "grad_norm": 1.3359375, "learning_rate": 0.0003916865964079694, "loss": 4.9096, "mean_token_accuracy": 0.2155908912420273, "num_tokens": 73949766.0, "step": 42630 }, { "entropy": 5.838804054260254, "epoch": 3.317136743824159, "grad_norm": 1.2734375, "learning_rate": 0.0003916628983439345, "loss": 4.9674, "mean_token_accuracy": 0.20595600455999374, "num_tokens": 73958387.0, "step": 42635 }, { "entropy": 5.722817468643188, "epoch": 3.317525773195876, "grad_norm": 1.375, "learning_rate": 0.00039163919850972585, "loss": 4.9244, "mean_token_accuracy": 0.21109292954206466, "num_tokens": 73967068.0, "step": 42640 }, { "entropy": 5.792174673080444, "epoch": 3.3179148025675937, "grad_norm": 1.2109375, "learning_rate": 0.0003916154969057031, "loss": 4.9765, "mean_token_accuracy": 0.2074389412999153, "num_tokens": 73976325.0, "step": 42645 }, { "entropy": 5.816832733154297, "epoch": 3.3183038319393114, "grad_norm": 1.25, "learning_rate": 0.00039159179353222566, "loss": 4.8944, "mean_token_accuracy": 0.21269210278987885, "num_tokens": 73985403.0, "step": 42650 }, { "entropy": 5.898944616317749, "epoch": 3.318692861311029, "grad_norm": 1.328125, "learning_rate": 0.00039156808838965336, "loss": 5.0202, "mean_token_accuracy": 0.20283635407686235, "num_tokens": 73993832.0, "step": 42655 }, { "entropy": 5.803520536422729, "epoch": 3.3190818906827464, "grad_norm": 1.3125, "learning_rate": 0.00039154438147834595, "loss": 4.9523, "mean_token_accuracy": 0.21100257188081742, "num_tokens": 74002374.0, "step": 42660 }, { "entropy": 5.757262420654297, "epoch": 3.319470920054464, "grad_norm": 1.2109375, "learning_rate": 0.00039152067279866294, "loss": 4.9224, "mean_token_accuracy": 0.2071975961327553, "num_tokens": 74011655.0, "step": 42665 }, { "entropy": 5.765992164611816, "epoch": 3.319859949426182, "grad_norm": 1.3359375, "learning_rate": 0.0003914969623509643, "loss": 4.9446, "mean_token_accuracy": 0.21051279902458192, "num_tokens": 74020760.0, "step": 42670 }, { "entropy": 5.782722043991089, "epoch": 3.320248978797899, "grad_norm": 1.3828125, "learning_rate": 0.0003914732501356096, "loss": 4.9379, "mean_token_accuracy": 0.21258765757083892, "num_tokens": 74029315.0, "step": 42675 }, { "entropy": 5.8021931648254395, "epoch": 3.3206380081696167, "grad_norm": 1.375, "learning_rate": 0.00039144953615295877, "loss": 4.9425, "mean_token_accuracy": 0.21687727719545363, "num_tokens": 74038675.0, "step": 42680 }, { "entropy": 5.818754434585571, "epoch": 3.3210270375413344, "grad_norm": 1.2734375, "learning_rate": 0.00039142582040337147, "loss": 4.9352, "mean_token_accuracy": 0.21728897839784622, "num_tokens": 74046836.0, "step": 42685 }, { "entropy": 5.767501926422119, "epoch": 3.321416066913052, "grad_norm": 1.234375, "learning_rate": 0.0003914021028872077, "loss": 4.929, "mean_token_accuracy": 0.20903177112340926, "num_tokens": 74055903.0, "step": 42690 }, { "entropy": 5.786469173431397, "epoch": 3.3218050962847694, "grad_norm": 1.328125, "learning_rate": 0.0003913783836048274, "loss": 4.9303, "mean_token_accuracy": 0.20950284004211425, "num_tokens": 74064770.0, "step": 42695 }, { "entropy": 5.811122179031372, "epoch": 3.322194125656487, "grad_norm": 1.3515625, "learning_rate": 0.0003913546625565902, "loss": 5.0481, "mean_token_accuracy": 0.20661044120788574, "num_tokens": 74072879.0, "step": 42700 }, { "entropy": 5.801263618469238, "epoch": 3.322583155028205, "grad_norm": 1.234375, "learning_rate": 0.00039133093974285635, "loss": 4.9509, "mean_token_accuracy": 0.21210830807685851, "num_tokens": 74081696.0, "step": 42705 }, { "entropy": 5.812486219406128, "epoch": 3.322972184399922, "grad_norm": 1.2265625, "learning_rate": 0.00039130721516398556, "loss": 4.9693, "mean_token_accuracy": 0.2126379758119583, "num_tokens": 74090336.0, "step": 42710 }, { "entropy": 5.8792320728302006, "epoch": 3.3233612137716397, "grad_norm": 1.5234375, "learning_rate": 0.0003912834888203379, "loss": 5.0807, "mean_token_accuracy": 0.19799060076475145, "num_tokens": 74098720.0, "step": 42715 }, { "entropy": 5.7995209217071535, "epoch": 3.3237502431433574, "grad_norm": 1.2890625, "learning_rate": 0.0003912597607122734, "loss": 4.979, "mean_token_accuracy": 0.2082134574651718, "num_tokens": 74107441.0, "step": 42720 }, { "entropy": 5.760131692886352, "epoch": 3.324139272515075, "grad_norm": 1.21875, "learning_rate": 0.00039123603084015204, "loss": 4.9779, "mean_token_accuracy": 0.20732182115316392, "num_tokens": 74116200.0, "step": 42725 }, { "entropy": 5.734910535812378, "epoch": 3.3245283018867924, "grad_norm": 1.359375, "learning_rate": 0.00039121229920433394, "loss": 4.9361, "mean_token_accuracy": 0.2087520569562912, "num_tokens": 74124886.0, "step": 42730 }, { "entropy": 5.824739408493042, "epoch": 3.32491733125851, "grad_norm": 1.34375, "learning_rate": 0.0003911885658051792, "loss": 4.9825, "mean_token_accuracy": 0.20940256267786025, "num_tokens": 74133204.0, "step": 42735 }, { "entropy": 5.808013916015625, "epoch": 3.3253063606302278, "grad_norm": 1.4296875, "learning_rate": 0.00039116483064304794, "loss": 4.9431, "mean_token_accuracy": 0.2112531527876854, "num_tokens": 74141813.0, "step": 42740 }, { "entropy": 5.758756065368653, "epoch": 3.325695390001945, "grad_norm": 1.296875, "learning_rate": 0.0003911410937183002, "loss": 4.9755, "mean_token_accuracy": 0.21135897785425187, "num_tokens": 74150170.0, "step": 42745 }, { "entropy": 5.7641912460327145, "epoch": 3.3260844193736627, "grad_norm": 1.3203125, "learning_rate": 0.00039111735503129626, "loss": 4.9342, "mean_token_accuracy": 0.20665356516838074, "num_tokens": 74158935.0, "step": 42750 }, { "entropy": 5.803321409225464, "epoch": 3.3264734487453804, "grad_norm": 1.2890625, "learning_rate": 0.0003910936145823962, "loss": 4.9625, "mean_token_accuracy": 0.20725848227739335, "num_tokens": 74167467.0, "step": 42755 }, { "entropy": 5.731102228164673, "epoch": 3.3268624781170977, "grad_norm": 1.390625, "learning_rate": 0.0003910698723719604, "loss": 4.8462, "mean_token_accuracy": 0.21945157796144485, "num_tokens": 74175513.0, "step": 42760 }, { "entropy": 5.779912328720092, "epoch": 3.3272515074888154, "grad_norm": 1.3671875, "learning_rate": 0.00039104612840034904, "loss": 4.9859, "mean_token_accuracy": 0.2124263733625412, "num_tokens": 74183617.0, "step": 42765 }, { "entropy": 5.860568332672119, "epoch": 3.327640536860533, "grad_norm": 1.2734375, "learning_rate": 0.00039102238266792234, "loss": 4.9905, "mean_token_accuracy": 0.20744079649448394, "num_tokens": 74191662.0, "step": 42770 }, { "entropy": 5.771619749069214, "epoch": 3.3280295662322503, "grad_norm": 1.3046875, "learning_rate": 0.00039099863517504064, "loss": 4.8969, "mean_token_accuracy": 0.22293958961963653, "num_tokens": 74199610.0, "step": 42775 }, { "entropy": 5.678391361236573, "epoch": 3.328418595603968, "grad_norm": 1.328125, "learning_rate": 0.0003909748859220644, "loss": 4.9503, "mean_token_accuracy": 0.20896433293819427, "num_tokens": 74207579.0, "step": 42780 }, { "entropy": 5.790496063232422, "epoch": 3.3288076249756857, "grad_norm": 1.4609375, "learning_rate": 0.00039095113490935377, "loss": 4.9708, "mean_token_accuracy": 0.20381855070590973, "num_tokens": 74215428.0, "step": 42785 }, { "entropy": 5.846376705169678, "epoch": 3.3291966543474034, "grad_norm": 1.328125, "learning_rate": 0.0003909273821372692, "loss": 5.0026, "mean_token_accuracy": 0.20869169235229493, "num_tokens": 74223694.0, "step": 42790 }, { "entropy": 5.797155570983887, "epoch": 3.3295856837191207, "grad_norm": 1.25, "learning_rate": 0.00039090362760617114, "loss": 5.0199, "mean_token_accuracy": 0.21325786113739015, "num_tokens": 74232791.0, "step": 42795 }, { "entropy": 5.797246742248535, "epoch": 3.3299747130908384, "grad_norm": 1.3671875, "learning_rate": 0.00039087987131642, "loss": 5.0002, "mean_token_accuracy": 0.20986486673355104, "num_tokens": 74241581.0, "step": 42800 }, { "entropy": 5.759954738616943, "epoch": 3.330363742462556, "grad_norm": 1.2421875, "learning_rate": 0.0003908561132683762, "loss": 4.9159, "mean_token_accuracy": 0.21176733523607255, "num_tokens": 74250868.0, "step": 42805 }, { "entropy": 5.819264316558838, "epoch": 3.3307527718342733, "grad_norm": 1.2578125, "learning_rate": 0.00039083235346240044, "loss": 4.9423, "mean_token_accuracy": 0.20971329212188722, "num_tokens": 74259992.0, "step": 42810 }, { "entropy": 5.781708097457885, "epoch": 3.331141801205991, "grad_norm": 1.296875, "learning_rate": 0.000390808591898853, "loss": 5.055, "mean_token_accuracy": 0.20430304259061813, "num_tokens": 74267900.0, "step": 42815 }, { "entropy": 5.810873985290527, "epoch": 3.3315308305777087, "grad_norm": 1.265625, "learning_rate": 0.0003907848285780945, "loss": 4.9087, "mean_token_accuracy": 0.212044920027256, "num_tokens": 74276448.0, "step": 42820 }, { "entropy": 5.790491390228271, "epoch": 3.3319198599494264, "grad_norm": 1.453125, "learning_rate": 0.00039076106350048557, "loss": 4.9577, "mean_token_accuracy": 0.21161139607429505, "num_tokens": 74284878.0, "step": 42825 }, { "entropy": 5.750010538101196, "epoch": 3.3323088893211437, "grad_norm": 1.28125, "learning_rate": 0.0003907372966663867, "loss": 4.9021, "mean_token_accuracy": 0.20803841352462768, "num_tokens": 74293647.0, "step": 42830 }, { "entropy": 5.763204050064087, "epoch": 3.3326979186928614, "grad_norm": 1.3046875, "learning_rate": 0.0003907135280761585, "loss": 4.9984, "mean_token_accuracy": 0.21068514436483382, "num_tokens": 74302122.0, "step": 42835 }, { "entropy": 5.84357476234436, "epoch": 3.333086948064579, "grad_norm": 1.28125, "learning_rate": 0.0003906897577301618, "loss": 4.9998, "mean_token_accuracy": 0.20316179394721984, "num_tokens": 74311729.0, "step": 42840 }, { "entropy": 5.793515634536743, "epoch": 3.3334759774362963, "grad_norm": 1.3125, "learning_rate": 0.0003906659856287571, "loss": 4.9301, "mean_token_accuracy": 0.21114364117383957, "num_tokens": 74320694.0, "step": 42845 }, { "entropy": 5.722558069229126, "epoch": 3.333865006808014, "grad_norm": 1.28125, "learning_rate": 0.00039064221177230517, "loss": 4.8346, "mean_token_accuracy": 0.22507788687944413, "num_tokens": 74328810.0, "step": 42850 }, { "entropy": 5.668527364730835, "epoch": 3.3342540361797317, "grad_norm": 1.3203125, "learning_rate": 0.00039061843616116683, "loss": 4.9098, "mean_token_accuracy": 0.20968265384435653, "num_tokens": 74337005.0, "step": 42855 }, { "entropy": 5.733434724807739, "epoch": 3.334643065551449, "grad_norm": 1.234375, "learning_rate": 0.00039059465879570264, "loss": 4.9655, "mean_token_accuracy": 0.21467326879501342, "num_tokens": 74346353.0, "step": 42860 }, { "entropy": 5.825611257553101, "epoch": 3.3350320949231667, "grad_norm": 1.40625, "learning_rate": 0.0003905708796762736, "loss": 5.1058, "mean_token_accuracy": 0.19955874979496002, "num_tokens": 74355698.0, "step": 42865 }, { "entropy": 5.864613962173462, "epoch": 3.3354211242948844, "grad_norm": 1.171875, "learning_rate": 0.0003905470988032403, "loss": 5.0464, "mean_token_accuracy": 0.21503295004367828, "num_tokens": 74365503.0, "step": 42870 }, { "entropy": 5.800537252426148, "epoch": 3.3358101536666016, "grad_norm": 1.203125, "learning_rate": 0.0003905233161769637, "loss": 4.9893, "mean_token_accuracy": 0.2073715940117836, "num_tokens": 74374788.0, "step": 42875 }, { "entropy": 5.743855381011963, "epoch": 3.3361991830383193, "grad_norm": 1.3125, "learning_rate": 0.0003904995317978048, "loss": 4.8197, "mean_token_accuracy": 0.2264487400650978, "num_tokens": 74384026.0, "step": 42880 }, { "entropy": 5.8730226993560795, "epoch": 3.336588212410037, "grad_norm": 1.234375, "learning_rate": 0.00039047574566612416, "loss": 5.0204, "mean_token_accuracy": 0.20406871140003205, "num_tokens": 74392454.0, "step": 42885 }, { "entropy": 5.744813299179077, "epoch": 3.3369772417817547, "grad_norm": 1.4375, "learning_rate": 0.00039045195778228295, "loss": 4.9232, "mean_token_accuracy": 0.2153767928481102, "num_tokens": 74401301.0, "step": 42890 }, { "entropy": 5.675120449066162, "epoch": 3.337366271153472, "grad_norm": 1.265625, "learning_rate": 0.0003904281681466421, "loss": 4.9217, "mean_token_accuracy": 0.21283155530691147, "num_tokens": 74409883.0, "step": 42895 }, { "entropy": 5.745875120162964, "epoch": 3.3377553005251897, "grad_norm": 1.21875, "learning_rate": 0.0003904043767595624, "loss": 5.0001, "mean_token_accuracy": 0.20251893401145935, "num_tokens": 74418999.0, "step": 42900 }, { "entropy": 5.76752233505249, "epoch": 3.3381443298969073, "grad_norm": 1.2890625, "learning_rate": 0.00039038058362140507, "loss": 4.8938, "mean_token_accuracy": 0.21440766602754593, "num_tokens": 74427078.0, "step": 42905 }, { "entropy": 5.834284257888794, "epoch": 3.3385333592686246, "grad_norm": 1.375, "learning_rate": 0.00039035678873253096, "loss": 4.9643, "mean_token_accuracy": 0.20375782400369644, "num_tokens": 74435537.0, "step": 42910 }, { "entropy": 5.774777793884278, "epoch": 3.3389223886403423, "grad_norm": 1.28125, "learning_rate": 0.0003903329920933012, "loss": 4.9041, "mean_token_accuracy": 0.22146506756544113, "num_tokens": 74444941.0, "step": 42915 }, { "entropy": 5.692820119857788, "epoch": 3.33931141801206, "grad_norm": 1.1953125, "learning_rate": 0.0003903091937040769, "loss": 4.8868, "mean_token_accuracy": 0.20673888623714448, "num_tokens": 74453772.0, "step": 42920 }, { "entropy": 5.813821458816529, "epoch": 3.3397004473837777, "grad_norm": 1.3046875, "learning_rate": 0.0003902853935652191, "loss": 4.9001, "mean_token_accuracy": 0.21100309640169143, "num_tokens": 74462548.0, "step": 42925 }, { "entropy": 5.7999794483184814, "epoch": 3.340089476755495, "grad_norm": 1.28125, "learning_rate": 0.0003902615916770889, "loss": 4.9901, "mean_token_accuracy": 0.21480599343776702, "num_tokens": 74471532.0, "step": 42930 }, { "entropy": 5.649653339385987, "epoch": 3.3404785061272126, "grad_norm": 1.2421875, "learning_rate": 0.00039023778804004753, "loss": 4.8354, "mean_token_accuracy": 0.2219695508480072, "num_tokens": 74480754.0, "step": 42935 }, { "entropy": 5.756298828125, "epoch": 3.3408675354989303, "grad_norm": 1.203125, "learning_rate": 0.00039021398265445616, "loss": 4.9699, "mean_token_accuracy": 0.20851259380578996, "num_tokens": 74489597.0, "step": 42940 }, { "entropy": 5.876714372634888, "epoch": 3.3412565648706476, "grad_norm": 1.328125, "learning_rate": 0.000390190175520676, "loss": 5.1177, "mean_token_accuracy": 0.20155534148216248, "num_tokens": 74498871.0, "step": 42945 }, { "entropy": 5.789704036712647, "epoch": 3.3416455942423653, "grad_norm": 1.359375, "learning_rate": 0.0003901663666390683, "loss": 4.9481, "mean_token_accuracy": 0.20575788468122483, "num_tokens": 74507613.0, "step": 42950 }, { "entropy": 5.784131813049316, "epoch": 3.342034623614083, "grad_norm": 1.3359375, "learning_rate": 0.0003901425560099943, "loss": 4.9844, "mean_token_accuracy": 0.20634441673755646, "num_tokens": 74516072.0, "step": 42955 }, { "entropy": 5.733268594741821, "epoch": 3.3424236529858002, "grad_norm": 1.2421875, "learning_rate": 0.00039011874363381523, "loss": 4.8686, "mean_token_accuracy": 0.21919978708028792, "num_tokens": 74524947.0, "step": 42960 }, { "entropy": 5.779603672027588, "epoch": 3.342812682357518, "grad_norm": 1.328125, "learning_rate": 0.00039009492951089236, "loss": 5.0033, "mean_token_accuracy": 0.21451531499624252, "num_tokens": 74533654.0, "step": 42965 }, { "entropy": 5.791532373428344, "epoch": 3.3432017117292356, "grad_norm": 1.3515625, "learning_rate": 0.0003900711136415873, "loss": 4.9534, "mean_token_accuracy": 0.21446724534034728, "num_tokens": 74541850.0, "step": 42970 }, { "entropy": 5.785563898086548, "epoch": 3.343590741100953, "grad_norm": 1.2265625, "learning_rate": 0.0003900472960262611, "loss": 4.9909, "mean_token_accuracy": 0.20152529329061508, "num_tokens": 74550037.0, "step": 42975 }, { "entropy": 5.819525957107544, "epoch": 3.3439797704726706, "grad_norm": 1.34375, "learning_rate": 0.00039002347666527537, "loss": 5.0333, "mean_token_accuracy": 0.2095480516552925, "num_tokens": 74558680.0, "step": 42980 }, { "entropy": 5.755797576904297, "epoch": 3.3443687998443883, "grad_norm": 1.3671875, "learning_rate": 0.00038999965555899145, "loss": 4.8551, "mean_token_accuracy": 0.22010956704616547, "num_tokens": 74566696.0, "step": 42985 }, { "entropy": 5.7432232856750485, "epoch": 3.344757829216106, "grad_norm": 1.359375, "learning_rate": 0.0003899758327077709, "loss": 4.9411, "mean_token_accuracy": 0.2119350552558899, "num_tokens": 74575621.0, "step": 42990 }, { "entropy": 5.8120544910430905, "epoch": 3.3451468585878232, "grad_norm": 1.375, "learning_rate": 0.00038995200811197496, "loss": 5.05, "mean_token_accuracy": 0.2162696287035942, "num_tokens": 74583587.0, "step": 42995 }, { "entropy": 5.818381881713867, "epoch": 3.345535887959541, "grad_norm": 1.328125, "learning_rate": 0.00038992818177196526, "loss": 5.0144, "mean_token_accuracy": 0.2063915491104126, "num_tokens": 74591530.0, "step": 43000 }, { "entropy": 5.783024740219116, "epoch": 3.3459249173312586, "grad_norm": 1.4140625, "learning_rate": 0.0003899043536881034, "loss": 4.997, "mean_token_accuracy": 0.2004434883594513, "num_tokens": 74599502.0, "step": 43005 }, { "entropy": 5.7703173637390135, "epoch": 3.346313946702976, "grad_norm": 1.2421875, "learning_rate": 0.00038988052386075084, "loss": 4.9413, "mean_token_accuracy": 0.2138761579990387, "num_tokens": 74608800.0, "step": 43010 }, { "entropy": 5.763329315185547, "epoch": 3.3467029760746936, "grad_norm": 1.3203125, "learning_rate": 0.00038985669229026917, "loss": 4.9246, "mean_token_accuracy": 0.20762028992176057, "num_tokens": 74616801.0, "step": 43015 }, { "entropy": 5.758233880996704, "epoch": 3.3470920054464113, "grad_norm": 1.21875, "learning_rate": 0.00038983285897702005, "loss": 4.9113, "mean_token_accuracy": 0.2188883125782013, "num_tokens": 74625605.0, "step": 43020 }, { "entropy": 5.737649297714233, "epoch": 3.347481034818129, "grad_norm": 1.3125, "learning_rate": 0.00038980902392136496, "loss": 4.9191, "mean_token_accuracy": 0.21125998347997665, "num_tokens": 74634149.0, "step": 43025 }, { "entropy": 5.755175590515137, "epoch": 3.3478700641898462, "grad_norm": 1.328125, "learning_rate": 0.0003897851871236657, "loss": 4.9503, "mean_token_accuracy": 0.2171035423874855, "num_tokens": 74642408.0, "step": 43030 }, { "entropy": 5.801304149627685, "epoch": 3.348259093561564, "grad_norm": 1.28125, "learning_rate": 0.00038976134858428397, "loss": 4.9792, "mean_token_accuracy": 0.20745316594839097, "num_tokens": 74651003.0, "step": 43035 }, { "entropy": 5.86096339225769, "epoch": 3.3486481229332816, "grad_norm": 1.359375, "learning_rate": 0.00038973750830358144, "loss": 5.0026, "mean_token_accuracy": 0.20981018990278244, "num_tokens": 74659282.0, "step": 43040 }, { "entropy": 5.770449542999268, "epoch": 3.349037152304999, "grad_norm": 1.3046875, "learning_rate": 0.00038971366628191986, "loss": 4.8962, "mean_token_accuracy": 0.21378239393234252, "num_tokens": 74667739.0, "step": 43045 }, { "entropy": 5.790917301177979, "epoch": 3.3494261816767166, "grad_norm": 1.3515625, "learning_rate": 0.000389689822519661, "loss": 4.973, "mean_token_accuracy": 0.21166356652975082, "num_tokens": 74675937.0, "step": 43050 }, { "entropy": 5.727511882781982, "epoch": 3.3498152110484343, "grad_norm": 1.3359375, "learning_rate": 0.00038966597701716653, "loss": 4.8658, "mean_token_accuracy": 0.22560873329639436, "num_tokens": 74684529.0, "step": 43055 }, { "entropy": 5.763490486145019, "epoch": 3.350204240420152, "grad_norm": 1.46875, "learning_rate": 0.0003896421297747985, "loss": 4.9347, "mean_token_accuracy": 0.21724818050861358, "num_tokens": 74692814.0, "step": 43060 }, { "entropy": 5.845662593841553, "epoch": 3.350593269791869, "grad_norm": 1.2578125, "learning_rate": 0.0003896182807929185, "loss": 4.9896, "mean_token_accuracy": 0.20554414987564087, "num_tokens": 74701477.0, "step": 43065 }, { "entropy": 5.728369951248169, "epoch": 3.350982299163587, "grad_norm": 1.296875, "learning_rate": 0.0003895944300718885, "loss": 4.9375, "mean_token_accuracy": 0.21450088620185853, "num_tokens": 74710158.0, "step": 43070 }, { "entropy": 5.779960346221924, "epoch": 3.351371328535304, "grad_norm": 1.3359375, "learning_rate": 0.00038957057761207053, "loss": 4.9717, "mean_token_accuracy": 0.20648698955774308, "num_tokens": 74718269.0, "step": 43075 }, { "entropy": 5.77038984298706, "epoch": 3.351760357907022, "grad_norm": 1.2109375, "learning_rate": 0.00038954672341382635, "loss": 4.9556, "mean_token_accuracy": 0.21049312353134156, "num_tokens": 74726636.0, "step": 43080 }, { "entropy": 5.750342559814453, "epoch": 3.3521493872787396, "grad_norm": 1.3515625, "learning_rate": 0.000389522867477518, "loss": 4.915, "mean_token_accuracy": 0.21651479452848435, "num_tokens": 74735618.0, "step": 43085 }, { "entropy": 5.801842260360718, "epoch": 3.3525384166504573, "grad_norm": 1.265625, "learning_rate": 0.0003894990098035074, "loss": 5.0567, "mean_token_accuracy": 0.2034510776400566, "num_tokens": 74745161.0, "step": 43090 }, { "entropy": 5.823096895217896, "epoch": 3.3529274460221745, "grad_norm": 1.28125, "learning_rate": 0.0003894751503921566, "loss": 4.9621, "mean_token_accuracy": 0.21009562760591508, "num_tokens": 74753501.0, "step": 43095 }, { "entropy": 5.8418408870697025, "epoch": 3.353316475393892, "grad_norm": 1.3125, "learning_rate": 0.0003894512892438275, "loss": 5.0036, "mean_token_accuracy": 0.20536451339721679, "num_tokens": 74761797.0, "step": 43100 }, { "entropy": 5.821186542510986, "epoch": 3.35370550476561, "grad_norm": 1.375, "learning_rate": 0.00038942742635888236, "loss": 5.0274, "mean_token_accuracy": 0.20364721417427062, "num_tokens": 74771334.0, "step": 43105 }, { "entropy": 5.760883235931397, "epoch": 3.354094534137327, "grad_norm": 1.265625, "learning_rate": 0.00038940356173768303, "loss": 4.9369, "mean_token_accuracy": 0.2149835631251335, "num_tokens": 74780018.0, "step": 43110 }, { "entropy": 5.782932901382447, "epoch": 3.354483563509045, "grad_norm": 1.34375, "learning_rate": 0.0003893796953805919, "loss": 4.904, "mean_token_accuracy": 0.21601056754589082, "num_tokens": 74788509.0, "step": 43115 }, { "entropy": 5.824497222900391, "epoch": 3.3548725928807626, "grad_norm": 1.234375, "learning_rate": 0.00038935582728797085, "loss": 5.0919, "mean_token_accuracy": 0.20633993297815323, "num_tokens": 74797348.0, "step": 43120 }, { "entropy": 5.830901718139648, "epoch": 3.3552616222524803, "grad_norm": 1.2890625, "learning_rate": 0.00038933195746018213, "loss": 4.9463, "mean_token_accuracy": 0.2094537138938904, "num_tokens": 74805815.0, "step": 43125 }, { "entropy": 5.832296085357666, "epoch": 3.3556506516241975, "grad_norm": 1.265625, "learning_rate": 0.00038930808589758797, "loss": 5.0096, "mean_token_accuracy": 0.20740671306848527, "num_tokens": 74814577.0, "step": 43130 }, { "entropy": 5.760416841506958, "epoch": 3.356039680995915, "grad_norm": 1.359375, "learning_rate": 0.0003892842126005506, "loss": 4.8622, "mean_token_accuracy": 0.21914515793323516, "num_tokens": 74822488.0, "step": 43135 }, { "entropy": 5.771849250793457, "epoch": 3.356428710367633, "grad_norm": 1.4765625, "learning_rate": 0.0003892603375694321, "loss": 4.9736, "mean_token_accuracy": 0.2103273630142212, "num_tokens": 74831888.0, "step": 43140 }, { "entropy": 5.788729000091553, "epoch": 3.35681773973935, "grad_norm": 1.265625, "learning_rate": 0.00038923646080459484, "loss": 4.9825, "mean_token_accuracy": 0.2182341232895851, "num_tokens": 74840883.0, "step": 43145 }, { "entropy": 5.763821220397949, "epoch": 3.357206769111068, "grad_norm": 1.3359375, "learning_rate": 0.00038921258230640123, "loss": 4.8342, "mean_token_accuracy": 0.21729151904582977, "num_tokens": 74848517.0, "step": 43150 }, { "entropy": 5.750207233428955, "epoch": 3.3575957984827856, "grad_norm": 1.2890625, "learning_rate": 0.00038918870207521334, "loss": 4.9369, "mean_token_accuracy": 0.2129349082708359, "num_tokens": 74857189.0, "step": 43155 }, { "entropy": 5.772071743011475, "epoch": 3.3579848278545033, "grad_norm": 1.234375, "learning_rate": 0.00038916482011139373, "loss": 5.0405, "mean_token_accuracy": 0.20938149094581604, "num_tokens": 74866192.0, "step": 43160 }, { "entropy": 5.818610286712646, "epoch": 3.3583738572262205, "grad_norm": 1.25, "learning_rate": 0.0003891409364153047, "loss": 4.9267, "mean_token_accuracy": 0.21063854545354843, "num_tokens": 74875062.0, "step": 43165 }, { "entropy": 5.823616361618042, "epoch": 3.358762886597938, "grad_norm": 1.3203125, "learning_rate": 0.0003891170509873086, "loss": 4.9802, "mean_token_accuracy": 0.20705112367868422, "num_tokens": 74884471.0, "step": 43170 }, { "entropy": 5.758697271347046, "epoch": 3.359151915969656, "grad_norm": 1.2890625, "learning_rate": 0.00038909316382776784, "loss": 4.9427, "mean_token_accuracy": 0.2093734174966812, "num_tokens": 74892945.0, "step": 43175 }, { "entropy": 5.807942008972168, "epoch": 3.359540945341373, "grad_norm": 1.2890625, "learning_rate": 0.0003890692749370449, "loss": 4.96, "mean_token_accuracy": 0.20276796519756318, "num_tokens": 74901944.0, "step": 43180 }, { "entropy": 5.725415420532227, "epoch": 3.359929974713091, "grad_norm": 1.28125, "learning_rate": 0.00038904538431550235, "loss": 4.9593, "mean_token_accuracy": 0.21131177395582199, "num_tokens": 74910387.0, "step": 43185 }, { "entropy": 5.790362739562989, "epoch": 3.3603190040848085, "grad_norm": 1.484375, "learning_rate": 0.0003890214919635026, "loss": 4.9639, "mean_token_accuracy": 0.2082177773118019, "num_tokens": 74918570.0, "step": 43190 }, { "entropy": 5.730365514755249, "epoch": 3.360708033456526, "grad_norm": 1.2734375, "learning_rate": 0.0003889975978814082, "loss": 4.8422, "mean_token_accuracy": 0.21390852183103562, "num_tokens": 74927009.0, "step": 43195 }, { "entropy": 5.792756462097168, "epoch": 3.3610970628282435, "grad_norm": 1.28125, "learning_rate": 0.0003889737020695817, "loss": 4.9831, "mean_token_accuracy": 0.20990824401378633, "num_tokens": 74935131.0, "step": 43200 }, { "entropy": 5.767672729492188, "epoch": 3.361486092199961, "grad_norm": 1.234375, "learning_rate": 0.00038894980452838573, "loss": 4.9627, "mean_token_accuracy": 0.20933175832033157, "num_tokens": 74944711.0, "step": 43205 }, { "entropy": 5.865634250640869, "epoch": 3.3618751215716784, "grad_norm": 1.2578125, "learning_rate": 0.0003889259052581828, "loss": 5.0288, "mean_token_accuracy": 0.2050655797123909, "num_tokens": 74953721.0, "step": 43210 }, { "entropy": 5.743481683731079, "epoch": 3.362264150943396, "grad_norm": 1.2890625, "learning_rate": 0.00038890200425933545, "loss": 4.934, "mean_token_accuracy": 0.2103974163532257, "num_tokens": 74962250.0, "step": 43215 }, { "entropy": 5.806326389312744, "epoch": 3.362653180315114, "grad_norm": 1.2890625, "learning_rate": 0.0003888781015322067, "loss": 4.9738, "mean_token_accuracy": 0.21461058259010315, "num_tokens": 74971279.0, "step": 43220 }, { "entropy": 5.744761943817139, "epoch": 3.3630422096868315, "grad_norm": 1.3203125, "learning_rate": 0.00038885419707715885, "loss": 4.9911, "mean_token_accuracy": 0.20862937718629837, "num_tokens": 74980167.0, "step": 43225 }, { "entropy": 5.826805973052979, "epoch": 3.363431239058549, "grad_norm": 1.2578125, "learning_rate": 0.00038883029089455487, "loss": 5.0424, "mean_token_accuracy": 0.20455125868320465, "num_tokens": 74989014.0, "step": 43230 }, { "entropy": 5.785187911987305, "epoch": 3.3638202684302665, "grad_norm": 1.28125, "learning_rate": 0.0003888063829847574, "loss": 4.8912, "mean_token_accuracy": 0.21311526298522948, "num_tokens": 74997395.0, "step": 43235 }, { "entropy": 5.727230405807495, "epoch": 3.364209297801984, "grad_norm": 1.40625, "learning_rate": 0.0003887824733481292, "loss": 4.9178, "mean_token_accuracy": 0.21226956695318222, "num_tokens": 75005962.0, "step": 43240 }, { "entropy": 5.715755224227905, "epoch": 3.3645983271737014, "grad_norm": 1.3125, "learning_rate": 0.00038875856198503306, "loss": 4.8689, "mean_token_accuracy": 0.21459917426109315, "num_tokens": 75014201.0, "step": 43245 }, { "entropy": 5.851762866973877, "epoch": 3.364987356545419, "grad_norm": 1.3828125, "learning_rate": 0.00038873464889583177, "loss": 4.982, "mean_token_accuracy": 0.20322782695293426, "num_tokens": 75022702.0, "step": 43250 }, { "entropy": 5.784656095504761, "epoch": 3.365376385917137, "grad_norm": 1.2734375, "learning_rate": 0.00038871073408088826, "loss": 4.93, "mean_token_accuracy": 0.21556055992841722, "num_tokens": 75031488.0, "step": 43255 }, { "entropy": 5.899462795257568, "epoch": 3.3657654152888545, "grad_norm": 1.328125, "learning_rate": 0.0003886868175405653, "loss": 5.0768, "mean_token_accuracy": 0.20054258704185485, "num_tokens": 75039511.0, "step": 43260 }, { "entropy": 5.79049916267395, "epoch": 3.366154444660572, "grad_norm": 1.2734375, "learning_rate": 0.0003886628992752259, "loss": 4.9814, "mean_token_accuracy": 0.20652321726083755, "num_tokens": 75048989.0, "step": 43265 }, { "entropy": 5.844235801696778, "epoch": 3.3665434740322895, "grad_norm": 1.3046875, "learning_rate": 0.0003886389792852329, "loss": 5.0707, "mean_token_accuracy": 0.20484538078308107, "num_tokens": 75057924.0, "step": 43270 }, { "entropy": 5.7511406421661375, "epoch": 3.366932503404007, "grad_norm": 1.21875, "learning_rate": 0.00038861505757094923, "loss": 4.8833, "mean_token_accuracy": 0.21559829711914064, "num_tokens": 75066743.0, "step": 43275 }, { "entropy": 5.7625185489654545, "epoch": 3.3673215327757244, "grad_norm": 1.3046875, "learning_rate": 0.0003885911341327379, "loss": 4.9934, "mean_token_accuracy": 0.20667923986911774, "num_tokens": 75075784.0, "step": 43280 }, { "entropy": 5.778633880615234, "epoch": 3.367710562147442, "grad_norm": 1.25, "learning_rate": 0.000388567208970962, "loss": 4.9822, "mean_token_accuracy": 0.2111075922846794, "num_tokens": 75084031.0, "step": 43285 }, { "entropy": 5.731312465667725, "epoch": 3.36809959151916, "grad_norm": 1.2578125, "learning_rate": 0.0003885432820859844, "loss": 4.9658, "mean_token_accuracy": 0.20824066251516343, "num_tokens": 75093029.0, "step": 43290 }, { "entropy": 5.733354997634888, "epoch": 3.368488620890877, "grad_norm": 1.3125, "learning_rate": 0.00038851935347816827, "loss": 4.8507, "mean_token_accuracy": 0.2213832050561905, "num_tokens": 75101620.0, "step": 43295 }, { "entropy": 5.775839948654175, "epoch": 3.368877650262595, "grad_norm": 1.359375, "learning_rate": 0.0003884954231478764, "loss": 4.9285, "mean_token_accuracy": 0.21120688021183015, "num_tokens": 75110179.0, "step": 43300 }, { "entropy": 5.803338289260864, "epoch": 3.3692666796343125, "grad_norm": 1.3828125, "learning_rate": 0.0003884714910954724, "loss": 4.9964, "mean_token_accuracy": 0.20896172672510147, "num_tokens": 75119254.0, "step": 43305 }, { "entropy": 5.797785043716431, "epoch": 3.3696557090060297, "grad_norm": 1.2421875, "learning_rate": 0.000388447557321319, "loss": 4.9204, "mean_token_accuracy": 0.20892525613307952, "num_tokens": 75127630.0, "step": 43310 }, { "entropy": 5.8184808731079105, "epoch": 3.3700447383777474, "grad_norm": 1.28125, "learning_rate": 0.0003884236218257795, "loss": 4.8767, "mean_token_accuracy": 0.22241439670324326, "num_tokens": 75136866.0, "step": 43315 }, { "entropy": 5.798237276077271, "epoch": 3.370433767749465, "grad_norm": 1.25, "learning_rate": 0.0003883996846092171, "loss": 4.9138, "mean_token_accuracy": 0.2230654314160347, "num_tokens": 75145570.0, "step": 43320 }, { "entropy": 5.76980357170105, "epoch": 3.370822797121183, "grad_norm": 1.2578125, "learning_rate": 0.000388375745671995, "loss": 5.0099, "mean_token_accuracy": 0.2079619824886322, "num_tokens": 75154994.0, "step": 43325 }, { "entropy": 5.809775257110596, "epoch": 3.3712118264929, "grad_norm": 1.3359375, "learning_rate": 0.00038835180501447646, "loss": 4.9011, "mean_token_accuracy": 0.21593290865421294, "num_tokens": 75163018.0, "step": 43330 }, { "entropy": 5.706907415390015, "epoch": 3.3716008558646178, "grad_norm": 1.1875, "learning_rate": 0.0003883278626370245, "loss": 4.8919, "mean_token_accuracy": 0.2078929826617241, "num_tokens": 75172234.0, "step": 43335 }, { "entropy": 5.778110694885254, "epoch": 3.3719898852363355, "grad_norm": 1.3359375, "learning_rate": 0.00038830391854000285, "loss": 5.0037, "mean_token_accuracy": 0.21109262108802795, "num_tokens": 75180816.0, "step": 43340 }, { "entropy": 5.821059274673462, "epoch": 3.3723789146080527, "grad_norm": 1.34375, "learning_rate": 0.00038827997272377447, "loss": 4.9884, "mean_token_accuracy": 0.2106846645474434, "num_tokens": 75189676.0, "step": 43345 }, { "entropy": 5.844998455047607, "epoch": 3.3727679439797704, "grad_norm": 1.4453125, "learning_rate": 0.00038825602518870276, "loss": 4.9592, "mean_token_accuracy": 0.21111146956682206, "num_tokens": 75198729.0, "step": 43350 }, { "entropy": 5.7949731826782225, "epoch": 3.373156973351488, "grad_norm": 1.25, "learning_rate": 0.0003882320759351512, "loss": 4.9223, "mean_token_accuracy": 0.21457268446683883, "num_tokens": 75207414.0, "step": 43355 }, { "entropy": 5.7587981700897215, "epoch": 3.373546002723206, "grad_norm": 1.328125, "learning_rate": 0.00038820812496348305, "loss": 4.8679, "mean_token_accuracy": 0.21899354159832002, "num_tokens": 75215454.0, "step": 43360 }, { "entropy": 5.737974166870117, "epoch": 3.373935032094923, "grad_norm": 1.328125, "learning_rate": 0.00038818417227406185, "loss": 4.97, "mean_token_accuracy": 0.2137850344181061, "num_tokens": 75223445.0, "step": 43365 }, { "entropy": 5.808734893798828, "epoch": 3.3743240614666408, "grad_norm": 1.3515625, "learning_rate": 0.00038816021786725096, "loss": 4.9649, "mean_token_accuracy": 0.20733529776334764, "num_tokens": 75232120.0, "step": 43370 }, { "entropy": 5.839643716812134, "epoch": 3.3747130908383585, "grad_norm": 1.296875, "learning_rate": 0.00038813626174341386, "loss": 4.9242, "mean_token_accuracy": 0.2095628261566162, "num_tokens": 75240666.0, "step": 43375 }, { "entropy": 5.841870260238648, "epoch": 3.3751021202100757, "grad_norm": 1.4453125, "learning_rate": 0.0003881123039029141, "loss": 4.9553, "mean_token_accuracy": 0.20313241332769394, "num_tokens": 75249523.0, "step": 43380 }, { "entropy": 5.788790464401245, "epoch": 3.3754911495817934, "grad_norm": 1.2890625, "learning_rate": 0.0003880883443461152, "loss": 5.0051, "mean_token_accuracy": 0.20674877017736434, "num_tokens": 75258720.0, "step": 43385 }, { "entropy": 5.7810853004455565, "epoch": 3.375880178953511, "grad_norm": 1.328125, "learning_rate": 0.0003880643830733806, "loss": 5.0234, "mean_token_accuracy": 0.20385649651288987, "num_tokens": 75267424.0, "step": 43390 }, { "entropy": 5.8205342292785645, "epoch": 3.3762692083252284, "grad_norm": 1.21875, "learning_rate": 0.00038804042008507396, "loss": 4.9758, "mean_token_accuracy": 0.20444848537445068, "num_tokens": 75276475.0, "step": 43395 }, { "entropy": 5.7915651321411135, "epoch": 3.376658237696946, "grad_norm": 1.21875, "learning_rate": 0.00038801645538155883, "loss": 4.942, "mean_token_accuracy": 0.21109515726566314, "num_tokens": 75284648.0, "step": 43400 }, { "entropy": 5.834018993377685, "epoch": 3.3770472670686638, "grad_norm": 1.3671875, "learning_rate": 0.00038799248896319896, "loss": 4.9897, "mean_token_accuracy": 0.21057327538728715, "num_tokens": 75293708.0, "step": 43405 }, { "entropy": 5.7618643283844, "epoch": 3.377436296440381, "grad_norm": 1.3203125, "learning_rate": 0.00038796852083035794, "loss": 4.9447, "mean_token_accuracy": 0.20826997756958007, "num_tokens": 75302484.0, "step": 43410 }, { "entropy": 5.837515449523925, "epoch": 3.3778253258120987, "grad_norm": 1.28125, "learning_rate": 0.0003879445509833993, "loss": 4.9135, "mean_token_accuracy": 0.2163292482495308, "num_tokens": 75311112.0, "step": 43415 }, { "entropy": 5.851595020294189, "epoch": 3.3782143551838164, "grad_norm": 1.4453125, "learning_rate": 0.000387920579422687, "loss": 5.0099, "mean_token_accuracy": 0.2049412652850151, "num_tokens": 75319126.0, "step": 43420 }, { "entropy": 5.759269714355469, "epoch": 3.378603384555534, "grad_norm": 1.3828125, "learning_rate": 0.0003878966061485845, "loss": 4.9535, "mean_token_accuracy": 0.2090959683060646, "num_tokens": 75328296.0, "step": 43425 }, { "entropy": 5.768650960922241, "epoch": 3.3789924139272514, "grad_norm": 1.2578125, "learning_rate": 0.00038787263116145577, "loss": 4.9003, "mean_token_accuracy": 0.21191086173057555, "num_tokens": 75337036.0, "step": 43430 }, { "entropy": 5.78874192237854, "epoch": 3.379381443298969, "grad_norm": 1.328125, "learning_rate": 0.00038784865446166454, "loss": 4.9974, "mean_token_accuracy": 0.2142962172627449, "num_tokens": 75345691.0, "step": 43435 }, { "entropy": 5.775471496582031, "epoch": 3.3797704726706868, "grad_norm": 1.4375, "learning_rate": 0.00038782467604957455, "loss": 4.9414, "mean_token_accuracy": 0.210006046295166, "num_tokens": 75354469.0, "step": 43440 }, { "entropy": 5.786118125915527, "epoch": 3.380159502042404, "grad_norm": 1.25, "learning_rate": 0.00038780069592554977, "loss": 4.9477, "mean_token_accuracy": 0.21715904027223587, "num_tokens": 75363369.0, "step": 43445 }, { "entropy": 5.747549438476563, "epoch": 3.3805485314141217, "grad_norm": 1.28125, "learning_rate": 0.0003877767140899539, "loss": 4.9126, "mean_token_accuracy": 0.22205742299556733, "num_tokens": 75371882.0, "step": 43450 }, { "entropy": 5.751268768310547, "epoch": 3.3809375607858394, "grad_norm": 1.3359375, "learning_rate": 0.00038775273054315087, "loss": 4.938, "mean_token_accuracy": 0.20949953496456147, "num_tokens": 75379801.0, "step": 43455 }, { "entropy": 5.796765661239624, "epoch": 3.381326590157557, "grad_norm": 1.4140625, "learning_rate": 0.0003877287452855046, "loss": 4.9874, "mean_token_accuracy": 0.20961207896471024, "num_tokens": 75389588.0, "step": 43460 }, { "entropy": 5.823791790008545, "epoch": 3.3817156195292744, "grad_norm": 1.375, "learning_rate": 0.00038770475831737905, "loss": 4.9762, "mean_token_accuracy": 0.20835765749216079, "num_tokens": 75398055.0, "step": 43465 }, { "entropy": 5.827379560470581, "epoch": 3.382104648900992, "grad_norm": 1.2109375, "learning_rate": 0.00038768076963913823, "loss": 4.9889, "mean_token_accuracy": 0.20756225287914276, "num_tokens": 75406742.0, "step": 43470 }, { "entropy": 5.739964437484741, "epoch": 3.3824936782727097, "grad_norm": 1.3125, "learning_rate": 0.00038765677925114614, "loss": 4.8719, "mean_token_accuracy": 0.21926022619009017, "num_tokens": 75415447.0, "step": 43475 }, { "entropy": 5.773547124862671, "epoch": 3.382882707644427, "grad_norm": 1.2265625, "learning_rate": 0.0003876327871537667, "loss": 5.0019, "mean_token_accuracy": 0.20247192680835724, "num_tokens": 75424688.0, "step": 43480 }, { "entropy": 5.861326265335083, "epoch": 3.3832717370161447, "grad_norm": 1.265625, "learning_rate": 0.00038760879334736394, "loss": 4.9841, "mean_token_accuracy": 0.21324150413274764, "num_tokens": 75433334.0, "step": 43485 }, { "entropy": 5.871294116973877, "epoch": 3.3836607663878624, "grad_norm": 1.3125, "learning_rate": 0.00038758479783230197, "loss": 5.0384, "mean_token_accuracy": 0.20098302960395814, "num_tokens": 75442597.0, "step": 43490 }, { "entropy": 5.749220323562622, "epoch": 3.38404979575958, "grad_norm": 1.3984375, "learning_rate": 0.0003875608006089449, "loss": 4.9534, "mean_token_accuracy": 0.2127517968416214, "num_tokens": 75450547.0, "step": 43495 }, { "entropy": 5.848473787307739, "epoch": 3.3844388251312973, "grad_norm": 1.6328125, "learning_rate": 0.0003875368016776569, "loss": 5.0499, "mean_token_accuracy": 0.1989774838089943, "num_tokens": 75460254.0, "step": 43500 }, { "entropy": 5.845471525192261, "epoch": 3.384827854503015, "grad_norm": 1.3125, "learning_rate": 0.000387512801038802, "loss": 4.9927, "mean_token_accuracy": 0.20266612768173217, "num_tokens": 75469070.0, "step": 43505 }, { "entropy": 5.863874912261963, "epoch": 3.3852168838747323, "grad_norm": 1.3671875, "learning_rate": 0.0003874887986927444, "loss": 4.9818, "mean_token_accuracy": 0.20581310838460923, "num_tokens": 75477610.0, "step": 43510 }, { "entropy": 5.741687154769897, "epoch": 3.38560591324645, "grad_norm": 1.328125, "learning_rate": 0.0003874647946398484, "loss": 4.9482, "mean_token_accuracy": 0.21049513220787047, "num_tokens": 75486395.0, "step": 43515 }, { "entropy": 5.833615350723266, "epoch": 3.3859949426181677, "grad_norm": 1.390625, "learning_rate": 0.0003874407888804781, "loss": 5.0729, "mean_token_accuracy": 0.20406996905803682, "num_tokens": 75495987.0, "step": 43520 }, { "entropy": 5.784252738952636, "epoch": 3.3863839719898854, "grad_norm": 1.3828125, "learning_rate": 0.00038741678141499783, "loss": 4.9477, "mean_token_accuracy": 0.20978790521621704, "num_tokens": 75504407.0, "step": 43525 }, { "entropy": 5.850847339630127, "epoch": 3.3867730013616026, "grad_norm": 1.34375, "learning_rate": 0.0003873927722437718, "loss": 5.0197, "mean_token_accuracy": 0.20513660758733748, "num_tokens": 75512953.0, "step": 43530 }, { "entropy": 5.805237579345703, "epoch": 3.3871620307333203, "grad_norm": 1.2265625, "learning_rate": 0.0003873687613671643, "loss": 4.9942, "mean_token_accuracy": 0.20460595637559892, "num_tokens": 75521349.0, "step": 43535 }, { "entropy": 5.818048810958862, "epoch": 3.387551060105038, "grad_norm": 1.3984375, "learning_rate": 0.0003873447487855398, "loss": 5.0161, "mean_token_accuracy": 0.20158461928367616, "num_tokens": 75530178.0, "step": 43540 }, { "entropy": 5.796486711502075, "epoch": 3.3879400894767553, "grad_norm": 1.2421875, "learning_rate": 0.00038732073449926244, "loss": 4.8689, "mean_token_accuracy": 0.21547707468271254, "num_tokens": 75539033.0, "step": 43545 }, { "entropy": 5.721410417556763, "epoch": 3.388329118848473, "grad_norm": 1.4140625, "learning_rate": 0.0003872967185086968, "loss": 4.8048, "mean_token_accuracy": 0.2199964001774788, "num_tokens": 75547198.0, "step": 43550 }, { "entropy": 5.710056734085083, "epoch": 3.3887181482201907, "grad_norm": 1.25, "learning_rate": 0.0003872727008142072, "loss": 4.8872, "mean_token_accuracy": 0.2171419680118561, "num_tokens": 75555493.0, "step": 43555 }, { "entropy": 5.763467168807983, "epoch": 3.3891071775919084, "grad_norm": 1.2890625, "learning_rate": 0.00038724868141615807, "loss": 4.9594, "mean_token_accuracy": 0.2080468565225601, "num_tokens": 75565109.0, "step": 43560 }, { "entropy": 5.825116062164307, "epoch": 3.3894962069636256, "grad_norm": 1.4140625, "learning_rate": 0.0003872246603149138, "loss": 4.93, "mean_token_accuracy": 0.21020519286394118, "num_tokens": 75574156.0, "step": 43565 }, { "entropy": 5.764010715484619, "epoch": 3.3898852363353433, "grad_norm": 1.2265625, "learning_rate": 0.0003872006375108389, "loss": 4.9485, "mean_token_accuracy": 0.222689089179039, "num_tokens": 75583160.0, "step": 43570 }, { "entropy": 5.763653898239136, "epoch": 3.390274265707061, "grad_norm": 1.328125, "learning_rate": 0.000387176613004298, "loss": 4.9231, "mean_token_accuracy": 0.2055806502699852, "num_tokens": 75592545.0, "step": 43575 }, { "entropy": 5.79085636138916, "epoch": 3.3906632950787783, "grad_norm": 1.34375, "learning_rate": 0.0003871525867956555, "loss": 4.989, "mean_token_accuracy": 0.20623201429843901, "num_tokens": 75600999.0, "step": 43580 }, { "entropy": 5.761689233779907, "epoch": 3.391052324450496, "grad_norm": 1.359375, "learning_rate": 0.00038712855888527604, "loss": 4.9989, "mean_token_accuracy": 0.20291374921798705, "num_tokens": 75609807.0, "step": 43585 }, { "entropy": 5.734800815582275, "epoch": 3.3914413538222137, "grad_norm": 1.2734375, "learning_rate": 0.00038710452927352414, "loss": 4.9112, "mean_token_accuracy": 0.22097197920084, "num_tokens": 75618209.0, "step": 43590 }, { "entropy": 5.7810101985931395, "epoch": 3.3918303831939314, "grad_norm": 1.3359375, "learning_rate": 0.0003870804979607645, "loss": 4.9585, "mean_token_accuracy": 0.21448079347610474, "num_tokens": 75626547.0, "step": 43595 }, { "entropy": 5.830105352401733, "epoch": 3.3922194125656486, "grad_norm": 1.34375, "learning_rate": 0.00038705646494736163, "loss": 5.001, "mean_token_accuracy": 0.21341557949781417, "num_tokens": 75634064.0, "step": 43600 }, { "entropy": 5.737157678604126, "epoch": 3.3926084419373663, "grad_norm": 1.328125, "learning_rate": 0.0003870324302336802, "loss": 4.9119, "mean_token_accuracy": 0.21616011410951613, "num_tokens": 75642745.0, "step": 43605 }, { "entropy": 5.827617931365967, "epoch": 3.392997471309084, "grad_norm": 1.3359375, "learning_rate": 0.0003870083938200851, "loss": 5.0236, "mean_token_accuracy": 0.20308878123760224, "num_tokens": 75651581.0, "step": 43610 }, { "entropy": 5.78119912147522, "epoch": 3.3933865006808013, "grad_norm": 1.296875, "learning_rate": 0.00038698435570694084, "loss": 4.9645, "mean_token_accuracy": 0.2073827862739563, "num_tokens": 75661031.0, "step": 43615 }, { "entropy": 5.776669216156006, "epoch": 3.393775530052519, "grad_norm": 1.2890625, "learning_rate": 0.0003869603158946122, "loss": 4.9004, "mean_token_accuracy": 0.21482960879802704, "num_tokens": 75669150.0, "step": 43620 }, { "entropy": 5.827881288528443, "epoch": 3.3941645594242367, "grad_norm": 1.3203125, "learning_rate": 0.000386936274383464, "loss": 4.9477, "mean_token_accuracy": 0.21155451238155365, "num_tokens": 75677194.0, "step": 43625 }, { "entropy": 5.70807294845581, "epoch": 3.394553588795954, "grad_norm": 1.265625, "learning_rate": 0.000386912231173861, "loss": 4.882, "mean_token_accuracy": 0.2096993640065193, "num_tokens": 75685640.0, "step": 43630 }, { "entropy": 5.832828664779663, "epoch": 3.3949426181676716, "grad_norm": 1.3671875, "learning_rate": 0.000386888186266168, "loss": 5.006, "mean_token_accuracy": 0.2034759357571602, "num_tokens": 75693743.0, "step": 43635 }, { "entropy": 5.8012168407440186, "epoch": 3.3953316475393893, "grad_norm": 1.5078125, "learning_rate": 0.0003868641396607499, "loss": 4.8788, "mean_token_accuracy": 0.21663547903299332, "num_tokens": 75701951.0, "step": 43640 }, { "entropy": 5.801953411102295, "epoch": 3.3957206769111066, "grad_norm": 1.2890625, "learning_rate": 0.0003868400913579715, "loss": 4.982, "mean_token_accuracy": 0.2079638049006462, "num_tokens": 75711038.0, "step": 43645 }, { "entropy": 5.839403533935547, "epoch": 3.3961097062828243, "grad_norm": 1.3671875, "learning_rate": 0.00038681604135819774, "loss": 5.0111, "mean_token_accuracy": 0.19712608605623244, "num_tokens": 75719649.0, "step": 43650 }, { "entropy": 5.821929454803467, "epoch": 3.396498735654542, "grad_norm": 1.4765625, "learning_rate": 0.00038679198966179353, "loss": 4.9597, "mean_token_accuracy": 0.2065848872065544, "num_tokens": 75727880.0, "step": 43655 }, { "entropy": 5.83123140335083, "epoch": 3.3968877650262597, "grad_norm": 1.40625, "learning_rate": 0.00038676793626912375, "loss": 5.016, "mean_token_accuracy": 0.20519653111696243, "num_tokens": 75736885.0, "step": 43660 }, { "entropy": 5.825986909866333, "epoch": 3.397276794397977, "grad_norm": 1.34375, "learning_rate": 0.00038674388118055354, "loss": 4.9888, "mean_token_accuracy": 0.21101514399051666, "num_tokens": 75745922.0, "step": 43665 }, { "entropy": 5.761450576782226, "epoch": 3.3976658237696946, "grad_norm": 1.296875, "learning_rate": 0.0003867198243964477, "loss": 4.8629, "mean_token_accuracy": 0.21826183050870895, "num_tokens": 75754526.0, "step": 43670 }, { "entropy": 5.786790370941162, "epoch": 3.3980548531414123, "grad_norm": 1.4140625, "learning_rate": 0.0003866957659171714, "loss": 5.0155, "mean_token_accuracy": 0.20762264281511306, "num_tokens": 75763154.0, "step": 43675 }, { "entropy": 5.780497264862061, "epoch": 3.3984438825131296, "grad_norm": 1.2734375, "learning_rate": 0.0003866717057430896, "loss": 4.9798, "mean_token_accuracy": 0.21170317828655244, "num_tokens": 75772201.0, "step": 43680 }, { "entropy": 5.8262224197387695, "epoch": 3.3988329118848473, "grad_norm": 1.3515625, "learning_rate": 0.0003866476438745675, "loss": 4.9693, "mean_token_accuracy": 0.2121198832988739, "num_tokens": 75780351.0, "step": 43685 }, { "entropy": 5.725822639465332, "epoch": 3.399221941256565, "grad_norm": 1.2890625, "learning_rate": 0.00038662358031197, "loss": 4.8324, "mean_token_accuracy": 0.22014181315898895, "num_tokens": 75788942.0, "step": 43690 }, { "entropy": 5.7966102123260494, "epoch": 3.3996109706282827, "grad_norm": 1.484375, "learning_rate": 0.0003865995150556624, "loss": 5.0648, "mean_token_accuracy": 0.20413148403167725, "num_tokens": 75797362.0, "step": 43695 }, { "entropy": 5.786702346801758, "epoch": 3.4, "grad_norm": 1.3984375, "learning_rate": 0.00038657544810600966, "loss": 4.9299, "mean_token_accuracy": 0.20798394680023194, "num_tokens": 75805839.0, "step": 43700 }, { "entropy": 5.716349077224732, "epoch": 3.4003890293717176, "grad_norm": 1.328125, "learning_rate": 0.0003865513794633773, "loss": 4.8521, "mean_token_accuracy": 0.21348560303449632, "num_tokens": 75814544.0, "step": 43705 }, { "entropy": 5.764339113235474, "epoch": 3.4007780587434353, "grad_norm": 1.28125, "learning_rate": 0.0003865273091281301, "loss": 4.8606, "mean_token_accuracy": 0.21903713345527648, "num_tokens": 75822906.0, "step": 43710 }, { "entropy": 5.803141021728516, "epoch": 3.4011670881151526, "grad_norm": 1.3125, "learning_rate": 0.0003865032371006336, "loss": 4.9513, "mean_token_accuracy": 0.2086280554533005, "num_tokens": 75832115.0, "step": 43715 }, { "entropy": 5.756074905395508, "epoch": 3.4015561174868703, "grad_norm": 1.203125, "learning_rate": 0.000386479163381253, "loss": 4.8397, "mean_token_accuracy": 0.22159745693206787, "num_tokens": 75840920.0, "step": 43720 }, { "entropy": 5.767171859741211, "epoch": 3.401945146858588, "grad_norm": 1.296875, "learning_rate": 0.00038645508797035345, "loss": 4.9535, "mean_token_accuracy": 0.21021946668624877, "num_tokens": 75849654.0, "step": 43725 }, { "entropy": 5.773303556442261, "epoch": 3.402334176230305, "grad_norm": 1.3671875, "learning_rate": 0.00038643101086830036, "loss": 4.9464, "mean_token_accuracy": 0.2064506009221077, "num_tokens": 75857864.0, "step": 43730 }, { "entropy": 5.769557237625122, "epoch": 3.402723205602023, "grad_norm": 1.3203125, "learning_rate": 0.000386406932075459, "loss": 4.8955, "mean_token_accuracy": 0.2219952180981636, "num_tokens": 75866426.0, "step": 43735 }, { "entropy": 5.819576978683472, "epoch": 3.4031122349737406, "grad_norm": 1.3515625, "learning_rate": 0.0003863828515921948, "loss": 4.9889, "mean_token_accuracy": 0.21485319286584853, "num_tokens": 75875261.0, "step": 43740 }, { "entropy": 5.78130087852478, "epoch": 3.403501264345458, "grad_norm": 1.3125, "learning_rate": 0.0003863587694188732, "loss": 4.8872, "mean_token_accuracy": 0.22216374278068543, "num_tokens": 75883675.0, "step": 43745 }, { "entropy": 5.753207063674926, "epoch": 3.4038902937171756, "grad_norm": 1.234375, "learning_rate": 0.00038633468555585943, "loss": 4.9087, "mean_token_accuracy": 0.20475647747516632, "num_tokens": 75892209.0, "step": 43750 }, { "entropy": 5.812177038192749, "epoch": 3.4042793230888932, "grad_norm": 1.3125, "learning_rate": 0.0003863106000035191, "loss": 4.9767, "mean_token_accuracy": 0.20803519934415818, "num_tokens": 75899870.0, "step": 43755 }, { "entropy": 5.739748430252075, "epoch": 3.404668352460611, "grad_norm": 1.2890625, "learning_rate": 0.0003862865127622175, "loss": 4.9402, "mean_token_accuracy": 0.21361034512519836, "num_tokens": 75908616.0, "step": 43760 }, { "entropy": 5.751354026794433, "epoch": 3.405057381832328, "grad_norm": 1.3203125, "learning_rate": 0.0003862624238323201, "loss": 4.9563, "mean_token_accuracy": 0.21149254590272903, "num_tokens": 75917065.0, "step": 43765 }, { "entropy": 5.7265008926391605, "epoch": 3.405446411204046, "grad_norm": 1.2265625, "learning_rate": 0.0003862383332141927, "loss": 4.8728, "mean_token_accuracy": 0.22068437784910203, "num_tokens": 75925691.0, "step": 43770 }, { "entropy": 5.829797220230103, "epoch": 3.4058354405757636, "grad_norm": 1.3671875, "learning_rate": 0.0003862142409082006, "loss": 4.9768, "mean_token_accuracy": 0.21315586119890212, "num_tokens": 75934285.0, "step": 43775 }, { "entropy": 5.8812929630279545, "epoch": 3.406224469947481, "grad_norm": 1.25, "learning_rate": 0.0003861901469147093, "loss": 5.0549, "mean_token_accuracy": 0.20989812910556793, "num_tokens": 75942861.0, "step": 43780 }, { "entropy": 5.80853967666626, "epoch": 3.4066134993191985, "grad_norm": 1.3515625, "learning_rate": 0.00038616605123408464, "loss": 4.9757, "mean_token_accuracy": 0.2149495527148247, "num_tokens": 75952172.0, "step": 43785 }, { "entropy": 5.745920467376709, "epoch": 3.4070025286909162, "grad_norm": 1.3671875, "learning_rate": 0.00038614195386669207, "loss": 4.9694, "mean_token_accuracy": 0.21322059333324433, "num_tokens": 75960973.0, "step": 43790 }, { "entropy": 5.7290082454681395, "epoch": 3.407391558062634, "grad_norm": 1.328125, "learning_rate": 0.0003861178548128972, "loss": 4.8509, "mean_token_accuracy": 0.21753384470939635, "num_tokens": 75969220.0, "step": 43795 }, { "entropy": 5.843980550765991, "epoch": 3.407780587434351, "grad_norm": 1.265625, "learning_rate": 0.00038609375407306566, "loss": 4.9958, "mean_token_accuracy": 0.20544705986976625, "num_tokens": 75977345.0, "step": 43800 }, { "entropy": 5.766258478164673, "epoch": 3.408169616806069, "grad_norm": 1.3203125, "learning_rate": 0.00038606965164756334, "loss": 4.951, "mean_token_accuracy": 0.2062996506690979, "num_tokens": 75986500.0, "step": 43805 }, { "entropy": 5.72158989906311, "epoch": 3.4085586461777866, "grad_norm": 1.234375, "learning_rate": 0.00038604554753675585, "loss": 4.9344, "mean_token_accuracy": 0.21277607828378678, "num_tokens": 75995164.0, "step": 43810 }, { "entropy": 5.802707195281982, "epoch": 3.408947675549504, "grad_norm": 1.2890625, "learning_rate": 0.0003860214417410089, "loss": 5.0211, "mean_token_accuracy": 0.20807000547647475, "num_tokens": 76003927.0, "step": 43815 }, { "entropy": 5.821442127227783, "epoch": 3.4093367049212215, "grad_norm": 1.296875, "learning_rate": 0.00038599733426068826, "loss": 5.002, "mean_token_accuracy": 0.2036360204219818, "num_tokens": 76012703.0, "step": 43820 }, { "entropy": 5.868867063522339, "epoch": 3.4097257342929392, "grad_norm": 1.3125, "learning_rate": 0.00038597322509615977, "loss": 4.9687, "mean_token_accuracy": 0.1966812551021576, "num_tokens": 76021218.0, "step": 43825 }, { "entropy": 5.816557836532593, "epoch": 3.4101147636646565, "grad_norm": 1.2265625, "learning_rate": 0.00038594911424778925, "loss": 4.9952, "mean_token_accuracy": 0.20812575072050093, "num_tokens": 76030430.0, "step": 43830 }, { "entropy": 5.812969112396241, "epoch": 3.410503793036374, "grad_norm": 1.2734375, "learning_rate": 0.00038592500171594245, "loss": 5.0213, "mean_token_accuracy": 0.2095976859331131, "num_tokens": 76039201.0, "step": 43835 }, { "entropy": 5.746695709228516, "epoch": 3.410892822408092, "grad_norm": 1.3203125, "learning_rate": 0.00038590088750098536, "loss": 4.9803, "mean_token_accuracy": 0.21339681297540664, "num_tokens": 76048250.0, "step": 43840 }, { "entropy": 5.831688404083252, "epoch": 3.411281851779809, "grad_norm": 1.3046875, "learning_rate": 0.00038587677160328377, "loss": 4.9939, "mean_token_accuracy": 0.20225514322519303, "num_tokens": 76057056.0, "step": 43845 }, { "entropy": 5.7922039985656735, "epoch": 3.411670881151527, "grad_norm": 1.3203125, "learning_rate": 0.0003858526540232037, "loss": 4.9211, "mean_token_accuracy": 0.21309183835983275, "num_tokens": 76065602.0, "step": 43850 }, { "entropy": 5.79266586303711, "epoch": 3.4120599105232445, "grad_norm": 1.3125, "learning_rate": 0.00038582853476111094, "loss": 5.0665, "mean_token_accuracy": 0.20730853825807571, "num_tokens": 76073818.0, "step": 43855 }, { "entropy": 5.7982590675354, "epoch": 3.4124489398949622, "grad_norm": 1.2890625, "learning_rate": 0.0003858044138173717, "loss": 5.0214, "mean_token_accuracy": 0.2015455335378647, "num_tokens": 76082343.0, "step": 43860 }, { "entropy": 5.749724388122559, "epoch": 3.4128379692666795, "grad_norm": 1.359375, "learning_rate": 0.00038578029119235176, "loss": 4.9284, "mean_token_accuracy": 0.2094266876578331, "num_tokens": 76090478.0, "step": 43865 }, { "entropy": 5.748945951461792, "epoch": 3.413226998638397, "grad_norm": 1.28125, "learning_rate": 0.00038575616688641724, "loss": 4.9203, "mean_token_accuracy": 0.21210661828517913, "num_tokens": 76098901.0, "step": 43870 }, { "entropy": 5.744221925735474, "epoch": 3.413616028010115, "grad_norm": 1.3125, "learning_rate": 0.0003857320408999342, "loss": 4.9099, "mean_token_accuracy": 0.21828337460756303, "num_tokens": 76107281.0, "step": 43875 }, { "entropy": 5.783969306945801, "epoch": 3.414005057381832, "grad_norm": 1.609375, "learning_rate": 0.0003857079132332687, "loss": 4.9504, "mean_token_accuracy": 0.2098324030637741, "num_tokens": 76116277.0, "step": 43880 }, { "entropy": 5.795396375656128, "epoch": 3.41439408675355, "grad_norm": 1.34375, "learning_rate": 0.00038568378388678675, "loss": 5.0115, "mean_token_accuracy": 0.20548285841941832, "num_tokens": 76125412.0, "step": 43885 }, { "entropy": 5.781489849090576, "epoch": 3.4147831161252675, "grad_norm": 1.2890625, "learning_rate": 0.0003856596528608546, "loss": 4.923, "mean_token_accuracy": 0.21447836458683014, "num_tokens": 76134259.0, "step": 43890 }, { "entropy": 5.7388817310333256, "epoch": 3.4151721454969852, "grad_norm": 1.2265625, "learning_rate": 0.0003856355201558384, "loss": 4.8489, "mean_token_accuracy": 0.2250308096408844, "num_tokens": 76142557.0, "step": 43895 }, { "entropy": 5.800015211105347, "epoch": 3.4155611748687025, "grad_norm": 1.4921875, "learning_rate": 0.00038561138577210426, "loss": 5.002, "mean_token_accuracy": 0.21193613559007646, "num_tokens": 76150495.0, "step": 43900 }, { "entropy": 5.766559505462647, "epoch": 3.41595020424042, "grad_norm": 1.328125, "learning_rate": 0.00038558724971001835, "loss": 4.8797, "mean_token_accuracy": 0.21250353157520294, "num_tokens": 76158729.0, "step": 43905 }, { "entropy": 5.789643287658691, "epoch": 3.416339233612138, "grad_norm": 1.390625, "learning_rate": 0.000385563111969947, "loss": 4.9869, "mean_token_accuracy": 0.1995753362774849, "num_tokens": 76167917.0, "step": 43910 }, { "entropy": 5.774965715408325, "epoch": 3.416728262983855, "grad_norm": 1.2890625, "learning_rate": 0.00038553897255225633, "loss": 4.8747, "mean_token_accuracy": 0.21822956055402756, "num_tokens": 76176645.0, "step": 43915 }, { "entropy": 5.712930583953858, "epoch": 3.417117292355573, "grad_norm": 1.234375, "learning_rate": 0.00038551483145731277, "loss": 4.988, "mean_token_accuracy": 0.21092554032802582, "num_tokens": 76185344.0, "step": 43920 }, { "entropy": 5.750555086135864, "epoch": 3.4175063217272905, "grad_norm": 1.3359375, "learning_rate": 0.0003854906886854825, "loss": 4.9536, "mean_token_accuracy": 0.2063623771071434, "num_tokens": 76193303.0, "step": 43925 }, { "entropy": 5.8342877388000485, "epoch": 3.417895351099008, "grad_norm": 1.2578125, "learning_rate": 0.00038546654423713187, "loss": 5.015, "mean_token_accuracy": 0.20569702386856079, "num_tokens": 76202872.0, "step": 43930 }, { "entropy": 5.844340467453003, "epoch": 3.4182843804707255, "grad_norm": 1.2109375, "learning_rate": 0.0003854423981126273, "loss": 5.0188, "mean_token_accuracy": 0.2092747062444687, "num_tokens": 76212763.0, "step": 43935 }, { "entropy": 5.8055277347564695, "epoch": 3.418673409842443, "grad_norm": 1.3515625, "learning_rate": 0.0003854182503123351, "loss": 5.029, "mean_token_accuracy": 0.20784478038549423, "num_tokens": 76221336.0, "step": 43940 }, { "entropy": 5.789269304275512, "epoch": 3.4190624392141604, "grad_norm": 1.28125, "learning_rate": 0.00038539410083662166, "loss": 4.9298, "mean_token_accuracy": 0.2163824513554573, "num_tokens": 76229658.0, "step": 43945 }, { "entropy": 5.8347663402557375, "epoch": 3.419451468585878, "grad_norm": 1.2109375, "learning_rate": 0.00038536994968585355, "loss": 5.101, "mean_token_accuracy": 0.19941579252481462, "num_tokens": 76238745.0, "step": 43950 }, { "entropy": 5.8032595157623295, "epoch": 3.419840497957596, "grad_norm": 1.2890625, "learning_rate": 0.00038534579686039705, "loss": 4.9783, "mean_token_accuracy": 0.20748527348041534, "num_tokens": 76247463.0, "step": 43955 }, { "entropy": 5.807310771942139, "epoch": 3.4202295273293135, "grad_norm": 1.3828125, "learning_rate": 0.00038532164236061874, "loss": 4.9631, "mean_token_accuracy": 0.2093251883983612, "num_tokens": 76256050.0, "step": 43960 }, { "entropy": 5.834384298324585, "epoch": 3.4206185567010308, "grad_norm": 1.40625, "learning_rate": 0.000385297486186885, "loss": 4.95, "mean_token_accuracy": 0.20943230092525483, "num_tokens": 76264229.0, "step": 43965 }, { "entropy": 5.692021322250366, "epoch": 3.4210075860727485, "grad_norm": 1.296875, "learning_rate": 0.0003852733283395626, "loss": 4.92, "mean_token_accuracy": 0.2084141731262207, "num_tokens": 76273273.0, "step": 43970 }, { "entropy": 5.714404296875, "epoch": 3.421396615444466, "grad_norm": 1.2578125, "learning_rate": 0.000385249168819018, "loss": 4.8332, "mean_token_accuracy": 0.22084093540906907, "num_tokens": 76281887.0, "step": 43975 }, { "entropy": 5.744937753677368, "epoch": 3.4217856448161834, "grad_norm": 1.2265625, "learning_rate": 0.0003852250076256177, "loss": 4.8437, "mean_token_accuracy": 0.21834234595298768, "num_tokens": 76290317.0, "step": 43980 }, { "entropy": 5.7433525085449215, "epoch": 3.422174674187901, "grad_norm": 1.3046875, "learning_rate": 0.0003852008447597283, "loss": 4.9076, "mean_token_accuracy": 0.21471502184867858, "num_tokens": 76299016.0, "step": 43985 }, { "entropy": 5.7265513896942135, "epoch": 3.422563703559619, "grad_norm": 1.3125, "learning_rate": 0.00038517668022171656, "loss": 4.9482, "mean_token_accuracy": 0.21056398302316665, "num_tokens": 76307723.0, "step": 43990 }, { "entropy": 5.778873538970947, "epoch": 3.4229527329313365, "grad_norm": 1.375, "learning_rate": 0.0003851525140119489, "loss": 5.0537, "mean_token_accuracy": 0.20601907521486282, "num_tokens": 76316615.0, "step": 43995 }, { "entropy": 5.839988422393799, "epoch": 3.4233417623030538, "grad_norm": 1.2578125, "learning_rate": 0.00038512834613079226, "loss": 4.9915, "mean_token_accuracy": 0.21047311127185822, "num_tokens": 76325920.0, "step": 44000 }, { "entropy": 5.8255555629730225, "epoch": 3.4237307916747715, "grad_norm": 1.1953125, "learning_rate": 0.0003851041765786133, "loss": 5.0204, "mean_token_accuracy": 0.204771788418293, "num_tokens": 76334223.0, "step": 44005 }, { "entropy": 5.75848650932312, "epoch": 3.424119821046489, "grad_norm": 1.3984375, "learning_rate": 0.00038508000535577864, "loss": 4.9229, "mean_token_accuracy": 0.21102509498596192, "num_tokens": 76342741.0, "step": 44010 }, { "entropy": 5.788370561599732, "epoch": 3.4245088504182064, "grad_norm": 1.4375, "learning_rate": 0.0003850558324626552, "loss": 5.0071, "mean_token_accuracy": 0.21053939163684846, "num_tokens": 76351494.0, "step": 44015 }, { "entropy": 5.823196268081665, "epoch": 3.424897879789924, "grad_norm": 1.265625, "learning_rate": 0.0003850316578996096, "loss": 4.9909, "mean_token_accuracy": 0.2059172585606575, "num_tokens": 76361005.0, "step": 44020 }, { "entropy": 5.8524970531463625, "epoch": 3.425286909161642, "grad_norm": 1.375, "learning_rate": 0.0003850074816670087, "loss": 5.0293, "mean_token_accuracy": 0.2125491425395012, "num_tokens": 76369552.0, "step": 44025 }, { "entropy": 5.802464294433594, "epoch": 3.4256759385333595, "grad_norm": 1.3125, "learning_rate": 0.00038498330376521945, "loss": 5.0606, "mean_token_accuracy": 0.20654003024101258, "num_tokens": 76378248.0, "step": 44030 }, { "entropy": 5.737561178207398, "epoch": 3.4260649679050768, "grad_norm": 1.3046875, "learning_rate": 0.0003849591241946085, "loss": 4.8721, "mean_token_accuracy": 0.22352910190820693, "num_tokens": 76386022.0, "step": 44035 }, { "entropy": 5.752587890625, "epoch": 3.4264539972767944, "grad_norm": 1.4453125, "learning_rate": 0.000384934942955543, "loss": 4.9051, "mean_token_accuracy": 0.22088397443294525, "num_tokens": 76394278.0, "step": 44040 }, { "entropy": 5.784507322311401, "epoch": 3.426843026648512, "grad_norm": 1.390625, "learning_rate": 0.00038491076004838965, "loss": 4.9579, "mean_token_accuracy": 0.21491142511367797, "num_tokens": 76402450.0, "step": 44045 }, { "entropy": 5.687937450408936, "epoch": 3.4272320560202294, "grad_norm": 1.390625, "learning_rate": 0.00038488657547351544, "loss": 4.8713, "mean_token_accuracy": 0.22455673515796662, "num_tokens": 76410384.0, "step": 44050 }, { "entropy": 5.7441819190979, "epoch": 3.427621085391947, "grad_norm": 1.234375, "learning_rate": 0.0003848623892312874, "loss": 4.9482, "mean_token_accuracy": 0.20907140225172044, "num_tokens": 76418739.0, "step": 44055 }, { "entropy": 5.785765361785889, "epoch": 3.428010114763665, "grad_norm": 1.3046875, "learning_rate": 0.0003848382013220725, "loss": 4.9548, "mean_token_accuracy": 0.21709596663713454, "num_tokens": 76427704.0, "step": 44060 }, { "entropy": 5.804520606994629, "epoch": 3.428399144135382, "grad_norm": 1.3671875, "learning_rate": 0.0003848140117462376, "loss": 4.8978, "mean_token_accuracy": 0.2204034835100174, "num_tokens": 76436247.0, "step": 44065 }, { "entropy": 5.723497629165649, "epoch": 3.4287881735070997, "grad_norm": 1.2578125, "learning_rate": 0.0003847898205041499, "loss": 4.9848, "mean_token_accuracy": 0.2098783791065216, "num_tokens": 76445218.0, "step": 44070 }, { "entropy": 5.77737135887146, "epoch": 3.4291772028788174, "grad_norm": 1.3515625, "learning_rate": 0.00038476562759617644, "loss": 4.9011, "mean_token_accuracy": 0.2082947850227356, "num_tokens": 76454042.0, "step": 44075 }, { "entropy": 5.830284166336059, "epoch": 3.4295662322505347, "grad_norm": 1.3203125, "learning_rate": 0.00038474143302268425, "loss": 4.968, "mean_token_accuracy": 0.2085097998380661, "num_tokens": 76462659.0, "step": 44080 }, { "entropy": 5.758375597000122, "epoch": 3.4299552616222524, "grad_norm": 1.375, "learning_rate": 0.0003847172367840406, "loss": 4.9847, "mean_token_accuracy": 0.21870899945497513, "num_tokens": 76471268.0, "step": 44085 }, { "entropy": 5.82744460105896, "epoch": 3.43034429099397, "grad_norm": 1.2265625, "learning_rate": 0.0003846930388806124, "loss": 5.033, "mean_token_accuracy": 0.20767125487327576, "num_tokens": 76479914.0, "step": 44090 }, { "entropy": 5.871347141265869, "epoch": 3.430733320365688, "grad_norm": 1.3515625, "learning_rate": 0.00038466883931276703, "loss": 5.0427, "mean_token_accuracy": 0.19660957902669907, "num_tokens": 76488330.0, "step": 44095 }, { "entropy": 5.772185230255127, "epoch": 3.431122349737405, "grad_norm": 1.203125, "learning_rate": 0.00038464463808087146, "loss": 4.9493, "mean_token_accuracy": 0.20830949544906616, "num_tokens": 76496827.0, "step": 44100 }, { "entropy": 5.692153692245483, "epoch": 3.4315113791091227, "grad_norm": 1.2890625, "learning_rate": 0.0003846204351852931, "loss": 4.8963, "mean_token_accuracy": 0.21501616686582564, "num_tokens": 76505220.0, "step": 44105 }, { "entropy": 5.694797849655151, "epoch": 3.4319004084808404, "grad_norm": 1.28125, "learning_rate": 0.00038459623062639907, "loss": 4.8326, "mean_token_accuracy": 0.2207329124212265, "num_tokens": 76513823.0, "step": 44110 }, { "entropy": 5.830938100814819, "epoch": 3.4322894378525577, "grad_norm": 1.328125, "learning_rate": 0.00038457202440455673, "loss": 4.9979, "mean_token_accuracy": 0.20771976113319396, "num_tokens": 76522648.0, "step": 44115 }, { "entropy": 5.7965515613555905, "epoch": 3.4326784672242754, "grad_norm": 1.3203125, "learning_rate": 0.0003845478165201333, "loss": 4.9444, "mean_token_accuracy": 0.20961254090070724, "num_tokens": 76530288.0, "step": 44120 }, { "entropy": 5.704843902587891, "epoch": 3.433067496595993, "grad_norm": 1.2734375, "learning_rate": 0.00038452360697349615, "loss": 4.858, "mean_token_accuracy": 0.2140381708741188, "num_tokens": 76538428.0, "step": 44125 }, { "entropy": 5.7840029239654545, "epoch": 3.433456525967711, "grad_norm": 1.2421875, "learning_rate": 0.0003844993957650125, "loss": 4.9243, "mean_token_accuracy": 0.2121437296271324, "num_tokens": 76547396.0, "step": 44130 }, { "entropy": 5.785348510742187, "epoch": 3.433845555339428, "grad_norm": 1.2578125, "learning_rate": 0.0003844751828950499, "loss": 4.9629, "mean_token_accuracy": 0.21084827184677124, "num_tokens": 76556163.0, "step": 44135 }, { "entropy": 5.783642053604126, "epoch": 3.4342345847111457, "grad_norm": 1.4140625, "learning_rate": 0.00038445096836397564, "loss": 4.9938, "mean_token_accuracy": 0.2064040184020996, "num_tokens": 76564717.0, "step": 44140 }, { "entropy": 5.748208999633789, "epoch": 3.4346236140828634, "grad_norm": 1.34375, "learning_rate": 0.00038442675217215713, "loss": 4.8942, "mean_token_accuracy": 0.20814917087554932, "num_tokens": 76573049.0, "step": 44145 }, { "entropy": 5.789922428131104, "epoch": 3.4350126434545807, "grad_norm": 1.2890625, "learning_rate": 0.00038440253431996175, "loss": 4.9407, "mean_token_accuracy": 0.21442763656377792, "num_tokens": 76581897.0, "step": 44150 }, { "entropy": 5.809688425064087, "epoch": 3.4354016728262984, "grad_norm": 1.3671875, "learning_rate": 0.00038437831480775717, "loss": 4.9754, "mean_token_accuracy": 0.2100139304995537, "num_tokens": 76590443.0, "step": 44155 }, { "entropy": 5.696751403808594, "epoch": 3.435790702198016, "grad_norm": 1.328125, "learning_rate": 0.00038435409363591066, "loss": 4.8409, "mean_token_accuracy": 0.22010709196329117, "num_tokens": 76598979.0, "step": 44160 }, { "entropy": 5.73521237373352, "epoch": 3.4361797315697333, "grad_norm": 1.296875, "learning_rate": 0.00038432987080478986, "loss": 4.9947, "mean_token_accuracy": 0.21086450219154357, "num_tokens": 76607658.0, "step": 44165 }, { "entropy": 5.856771183013916, "epoch": 3.436568760941451, "grad_norm": 1.3359375, "learning_rate": 0.0003843056463147623, "loss": 5.0459, "mean_token_accuracy": 0.2003759488463402, "num_tokens": 76615952.0, "step": 44170 }, { "entropy": 5.753183460235595, "epoch": 3.4369577903131687, "grad_norm": 1.328125, "learning_rate": 0.00038428142016619555, "loss": 4.9062, "mean_token_accuracy": 0.2146125465631485, "num_tokens": 76624016.0, "step": 44175 }, { "entropy": 5.810269927978515, "epoch": 3.437346819684886, "grad_norm": 1.34375, "learning_rate": 0.0003842571923594572, "loss": 5.0052, "mean_token_accuracy": 0.2099122777581215, "num_tokens": 76633394.0, "step": 44180 }, { "entropy": 5.766016340255737, "epoch": 3.4377358490566037, "grad_norm": 1.4296875, "learning_rate": 0.00038423296289491477, "loss": 4.8769, "mean_token_accuracy": 0.22212452590465545, "num_tokens": 76641518.0, "step": 44185 }, { "entropy": 5.791521835327148, "epoch": 3.4381248784283214, "grad_norm": 1.3671875, "learning_rate": 0.00038420873177293606, "loss": 4.9917, "mean_token_accuracy": 0.2126702457666397, "num_tokens": 76649823.0, "step": 44190 }, { "entropy": 5.755248022079468, "epoch": 3.438513907800039, "grad_norm": 1.1953125, "learning_rate": 0.0003841844989938886, "loss": 5.0385, "mean_token_accuracy": 0.19985083788633345, "num_tokens": 76659704.0, "step": 44195 }, { "entropy": 5.8163001537323, "epoch": 3.4389029371717563, "grad_norm": 1.2734375, "learning_rate": 0.0003841602645581402, "loss": 4.9589, "mean_token_accuracy": 0.2098808228969574, "num_tokens": 76668205.0, "step": 44200 }, { "entropy": 5.840017795562744, "epoch": 3.439291966543474, "grad_norm": 1.34375, "learning_rate": 0.00038413602846605854, "loss": 5.0594, "mean_token_accuracy": 0.20544315576553346, "num_tokens": 76677163.0, "step": 44205 }, { "entropy": 5.7699202537536625, "epoch": 3.4396809959151917, "grad_norm": 1.2734375, "learning_rate": 0.0003841117907180114, "loss": 4.9534, "mean_token_accuracy": 0.20855973958969115, "num_tokens": 76685437.0, "step": 44210 }, { "entropy": 5.870796203613281, "epoch": 3.440070025286909, "grad_norm": 1.296875, "learning_rate": 0.00038408755131436647, "loss": 5.0621, "mean_token_accuracy": 0.206068018078804, "num_tokens": 76693648.0, "step": 44215 }, { "entropy": 5.761912631988525, "epoch": 3.4404590546586267, "grad_norm": 1.3359375, "learning_rate": 0.00038406331025549157, "loss": 4.8693, "mean_token_accuracy": 0.22016509622335434, "num_tokens": 76701790.0, "step": 44220 }, { "entropy": 5.843840074539185, "epoch": 3.4408480840303444, "grad_norm": 1.265625, "learning_rate": 0.0003840390675417545, "loss": 5.0803, "mean_token_accuracy": 0.20236795097589494, "num_tokens": 76710696.0, "step": 44225 }, { "entropy": 5.808930397033691, "epoch": 3.441237113402062, "grad_norm": 1.359375, "learning_rate": 0.0003840148231735231, "loss": 5.0257, "mean_token_accuracy": 0.20654899179935454, "num_tokens": 76718731.0, "step": 44230 }, { "entropy": 5.808993339538574, "epoch": 3.4416261427737793, "grad_norm": 1.2890625, "learning_rate": 0.00038399057715116536, "loss": 5.0851, "mean_token_accuracy": 0.19546631425619126, "num_tokens": 76727678.0, "step": 44235 }, { "entropy": 5.781171894073486, "epoch": 3.442015172145497, "grad_norm": 1.28125, "learning_rate": 0.00038396632947504904, "loss": 4.8993, "mean_token_accuracy": 0.21497766226530074, "num_tokens": 76736605.0, "step": 44240 }, { "entropy": 5.848866510391235, "epoch": 3.4424042015172147, "grad_norm": 1.3203125, "learning_rate": 0.0003839420801455422, "loss": 5.0608, "mean_token_accuracy": 0.20422202050685884, "num_tokens": 76746050.0, "step": 44245 }, { "entropy": 5.795500326156616, "epoch": 3.442793230888932, "grad_norm": 1.328125, "learning_rate": 0.0003839178291630126, "loss": 4.9527, "mean_token_accuracy": 0.2166171282529831, "num_tokens": 76754825.0, "step": 44250 }, { "entropy": 5.742900323867798, "epoch": 3.4431822602606497, "grad_norm": 1.2421875, "learning_rate": 0.00038389357652782836, "loss": 4.9294, "mean_token_accuracy": 0.2160813719034195, "num_tokens": 76763761.0, "step": 44255 }, { "entropy": 5.7515270709991455, "epoch": 3.4435712896323674, "grad_norm": 1.3125, "learning_rate": 0.00038386932224035734, "loss": 4.9504, "mean_token_accuracy": 0.2135989025235176, "num_tokens": 76772187.0, "step": 44260 }, { "entropy": 5.761444997787476, "epoch": 3.443960319004085, "grad_norm": 1.3671875, "learning_rate": 0.00038384506630096765, "loss": 4.8808, "mean_token_accuracy": 0.21282340437173844, "num_tokens": 76780722.0, "step": 44265 }, { "entropy": 5.77443208694458, "epoch": 3.4443493483758023, "grad_norm": 1.2109375, "learning_rate": 0.0003838208087100274, "loss": 4.9691, "mean_token_accuracy": 0.20836713165044785, "num_tokens": 76789752.0, "step": 44270 }, { "entropy": 5.8362298011779785, "epoch": 3.44473837774752, "grad_norm": 1.3359375, "learning_rate": 0.0003837965494679045, "loss": 4.9466, "mean_token_accuracy": 0.21775970458984376, "num_tokens": 76798052.0, "step": 44275 }, { "entropy": 5.729884052276612, "epoch": 3.4451274071192373, "grad_norm": 1.25, "learning_rate": 0.0003837722885749672, "loss": 4.8774, "mean_token_accuracy": 0.21868863850831985, "num_tokens": 76806543.0, "step": 44280 }, { "entropy": 5.745700883865356, "epoch": 3.445516436490955, "grad_norm": 1.2421875, "learning_rate": 0.0003837480260315835, "loss": 4.9713, "mean_token_accuracy": 0.20835821628570556, "num_tokens": 76815316.0, "step": 44285 }, { "entropy": 5.731871604919434, "epoch": 3.4459054658626727, "grad_norm": 1.2578125, "learning_rate": 0.00038372376183812165, "loss": 4.8127, "mean_token_accuracy": 0.21467111259698868, "num_tokens": 76823826.0, "step": 44290 }, { "entropy": 5.813102579116821, "epoch": 3.4462944952343904, "grad_norm": 1.4140625, "learning_rate": 0.0003836994959949497, "loss": 4.9902, "mean_token_accuracy": 0.20856809467077256, "num_tokens": 76832225.0, "step": 44295 }, { "entropy": 5.825140476226807, "epoch": 3.4466835246061076, "grad_norm": 1.3359375, "learning_rate": 0.00038367522850243593, "loss": 5.0251, "mean_token_accuracy": 0.20899790674448013, "num_tokens": 76839732.0, "step": 44300 }, { "entropy": 5.715642595291138, "epoch": 3.4470725539778253, "grad_norm": 1.359375, "learning_rate": 0.00038365095936094857, "loss": 4.8849, "mean_token_accuracy": 0.2156329870223999, "num_tokens": 76848041.0, "step": 44305 }, { "entropy": 5.855488681793213, "epoch": 3.447461583349543, "grad_norm": 1.3359375, "learning_rate": 0.0003836266885708558, "loss": 4.951, "mean_token_accuracy": 0.2134892925620079, "num_tokens": 76856869.0, "step": 44310 }, { "entropy": 5.875944757461548, "epoch": 3.4478506127212603, "grad_norm": 1.375, "learning_rate": 0.00038360241613252593, "loss": 5.0225, "mean_token_accuracy": 0.20710305869579315, "num_tokens": 76865309.0, "step": 44315 }, { "entropy": 5.76464147567749, "epoch": 3.448239642092978, "grad_norm": 1.421875, "learning_rate": 0.0003835781420463273, "loss": 4.9503, "mean_token_accuracy": 0.21409763842821122, "num_tokens": 76873300.0, "step": 44320 }, { "entropy": 5.781737613677978, "epoch": 3.4486286714646956, "grad_norm": 1.2734375, "learning_rate": 0.0003835538663126282, "loss": 4.9375, "mean_token_accuracy": 0.2119670182466507, "num_tokens": 76881662.0, "step": 44325 }, { "entropy": 5.7965234279632565, "epoch": 3.4490177008364133, "grad_norm": 1.3203125, "learning_rate": 0.0003835295889317969, "loss": 4.9308, "mean_token_accuracy": 0.20932854562997819, "num_tokens": 76890537.0, "step": 44330 }, { "entropy": 5.756190204620362, "epoch": 3.4494067302081306, "grad_norm": 1.3359375, "learning_rate": 0.00038350530990420177, "loss": 4.9453, "mean_token_accuracy": 0.21346208900213243, "num_tokens": 76898976.0, "step": 44335 }, { "entropy": 5.762785768508911, "epoch": 3.4497957595798483, "grad_norm": 1.34375, "learning_rate": 0.0003834810292302114, "loss": 4.9441, "mean_token_accuracy": 0.21517224162817, "num_tokens": 76907094.0, "step": 44340 }, { "entropy": 5.772498655319214, "epoch": 3.450184788951566, "grad_norm": 1.375, "learning_rate": 0.000383456746910194, "loss": 4.9816, "mean_token_accuracy": 0.21495093703269957, "num_tokens": 76916324.0, "step": 44345 }, { "entropy": 5.718747138977051, "epoch": 3.4505738183232832, "grad_norm": 1.3046875, "learning_rate": 0.0003834324629445182, "loss": 4.8941, "mean_token_accuracy": 0.21944002360105513, "num_tokens": 76925165.0, "step": 44350 }, { "entropy": 5.78367166519165, "epoch": 3.450962847695001, "grad_norm": 1.34375, "learning_rate": 0.0003834081773335522, "loss": 4.9469, "mean_token_accuracy": 0.21511250138282775, "num_tokens": 76933317.0, "step": 44355 }, { "entropy": 5.845502138137817, "epoch": 3.4513518770667186, "grad_norm": 1.3203125, "learning_rate": 0.00038338389007766473, "loss": 4.9616, "mean_token_accuracy": 0.20848940163850785, "num_tokens": 76942353.0, "step": 44360 }, { "entropy": 5.784889602661133, "epoch": 3.4517409064384363, "grad_norm": 1.265625, "learning_rate": 0.0003833596011772242, "loss": 4.9251, "mean_token_accuracy": 0.21752917915582656, "num_tokens": 76950844.0, "step": 44365 }, { "entropy": 5.753984975814819, "epoch": 3.4521299358101536, "grad_norm": 1.296875, "learning_rate": 0.0003833353106325993, "loss": 4.9568, "mean_token_accuracy": 0.21408999115228652, "num_tokens": 76959159.0, "step": 44370 }, { "entropy": 5.718219900131226, "epoch": 3.4525189651818713, "grad_norm": 1.359375, "learning_rate": 0.0003833110184441584, "loss": 4.9262, "mean_token_accuracy": 0.20569174289703368, "num_tokens": 76967287.0, "step": 44375 }, { "entropy": 5.8316397190094, "epoch": 3.452907994553589, "grad_norm": 1.40625, "learning_rate": 0.00038328672461227024, "loss": 4.9726, "mean_token_accuracy": 0.20841531008481978, "num_tokens": 76975984.0, "step": 44380 }, { "entropy": 5.821996021270752, "epoch": 3.4532970239253062, "grad_norm": 1.3125, "learning_rate": 0.0003832624291373034, "loss": 4.9971, "mean_token_accuracy": 0.20335110723972322, "num_tokens": 76985045.0, "step": 44385 }, { "entropy": 5.860459804534912, "epoch": 3.453686053297024, "grad_norm": 1.421875, "learning_rate": 0.00038323813201962645, "loss": 4.9768, "mean_token_accuracy": 0.20676260739564895, "num_tokens": 76993221.0, "step": 44390 }, { "entropy": 5.841753387451172, "epoch": 3.4540750826687416, "grad_norm": 1.2109375, "learning_rate": 0.00038321383325960816, "loss": 5.0102, "mean_token_accuracy": 0.206307552754879, "num_tokens": 77002053.0, "step": 44395 }, { "entropy": 5.781507968902588, "epoch": 3.454464112040459, "grad_norm": 1.296875, "learning_rate": 0.0003831895328576172, "loss": 4.9097, "mean_token_accuracy": 0.20982154160737992, "num_tokens": 77011113.0, "step": 44400 }, { "entropy": 5.805799341201782, "epoch": 3.4548531414121766, "grad_norm": 1.3515625, "learning_rate": 0.0003831652308140223, "loss": 4.9559, "mean_token_accuracy": 0.2075250640511513, "num_tokens": 77019975.0, "step": 44405 }, { "entropy": 5.73679928779602, "epoch": 3.4552421707838943, "grad_norm": 1.3359375, "learning_rate": 0.0003831409271291921, "loss": 4.8918, "mean_token_accuracy": 0.2171888381242752, "num_tokens": 77027854.0, "step": 44410 }, { "entropy": 5.655864238739014, "epoch": 3.4556312001556115, "grad_norm": 1.265625, "learning_rate": 0.00038311662180349554, "loss": 4.852, "mean_token_accuracy": 0.2261257603764534, "num_tokens": 77036342.0, "step": 44415 }, { "entropy": 5.749039554595948, "epoch": 3.4560202295273292, "grad_norm": 1.2734375, "learning_rate": 0.00038309231483730133, "loss": 4.8482, "mean_token_accuracy": 0.2154403120279312, "num_tokens": 77044403.0, "step": 44420 }, { "entropy": 5.85949444770813, "epoch": 3.456409258899047, "grad_norm": 1.359375, "learning_rate": 0.0003830680062309782, "loss": 4.9759, "mean_token_accuracy": 0.21519460827112197, "num_tokens": 77053096.0, "step": 44425 }, { "entropy": 5.777082204818726, "epoch": 3.4567982882707646, "grad_norm": 1.3046875, "learning_rate": 0.00038304369598489516, "loss": 4.929, "mean_token_accuracy": 0.21326002925634385, "num_tokens": 77061902.0, "step": 44430 }, { "entropy": 5.858755779266358, "epoch": 3.457187317642482, "grad_norm": 1.3671875, "learning_rate": 0.000383019384099421, "loss": 4.9614, "mean_token_accuracy": 0.21333204060792924, "num_tokens": 77070414.0, "step": 44435 }, { "entropy": 5.822905158996582, "epoch": 3.4575763470141996, "grad_norm": 1.3125, "learning_rate": 0.0003829950705749246, "loss": 5.028, "mean_token_accuracy": 0.21057271659374238, "num_tokens": 77078799.0, "step": 44440 }, { "entropy": 5.880588579177856, "epoch": 3.4579653763859173, "grad_norm": 1.3515625, "learning_rate": 0.00038297075541177496, "loss": 5.0188, "mean_token_accuracy": 0.21089441180229188, "num_tokens": 77088143.0, "step": 44445 }, { "entropy": 5.788824987411499, "epoch": 3.4583544057576345, "grad_norm": 1.1953125, "learning_rate": 0.00038294643861034087, "loss": 4.9667, "mean_token_accuracy": 0.2053212806582451, "num_tokens": 77097566.0, "step": 44450 }, { "entropy": 5.754004096984863, "epoch": 3.4587434351293522, "grad_norm": 1.21875, "learning_rate": 0.0003829221201709914, "loss": 4.8815, "mean_token_accuracy": 0.21796386390924455, "num_tokens": 77105846.0, "step": 44455 }, { "entropy": 5.741268157958984, "epoch": 3.45913246450107, "grad_norm": 1.375, "learning_rate": 0.0003828978000940955, "loss": 4.9124, "mean_token_accuracy": 0.21548955738544465, "num_tokens": 77114661.0, "step": 44460 }, { "entropy": 5.7948850154876705, "epoch": 3.4595214938727876, "grad_norm": 1.3046875, "learning_rate": 0.0003828734783800223, "loss": 4.9263, "mean_token_accuracy": 0.21169889569282532, "num_tokens": 77122918.0, "step": 44465 }, { "entropy": 5.839110040664673, "epoch": 3.459910523244505, "grad_norm": 1.2109375, "learning_rate": 0.0003828491550291408, "loss": 4.9639, "mean_token_accuracy": 0.21114620715379714, "num_tokens": 77132480.0, "step": 44470 }, { "entropy": 5.79347038269043, "epoch": 3.4602995526162226, "grad_norm": 1.3515625, "learning_rate": 0.0003828248300418199, "loss": 4.9718, "mean_token_accuracy": 0.20891524702310563, "num_tokens": 77141277.0, "step": 44475 }, { "entropy": 5.838682079315186, "epoch": 3.4606885819879403, "grad_norm": 1.40625, "learning_rate": 0.00038280050341842894, "loss": 5.0282, "mean_token_accuracy": 0.20837949961423874, "num_tokens": 77149818.0, "step": 44480 }, { "entropy": 5.814154195785522, "epoch": 3.4610776113596575, "grad_norm": 1.3515625, "learning_rate": 0.0003827761751593369, "loss": 4.9546, "mean_token_accuracy": 0.21026721149682998, "num_tokens": 77158368.0, "step": 44485 }, { "entropy": 5.806629276275634, "epoch": 3.461466640731375, "grad_norm": 1.28125, "learning_rate": 0.0003827518452649129, "loss": 5.0298, "mean_token_accuracy": 0.20732826739549637, "num_tokens": 77167538.0, "step": 44490 }, { "entropy": 5.8472614765167235, "epoch": 3.461855670103093, "grad_norm": 1.28125, "learning_rate": 0.0003827275137355261, "loss": 4.9368, "mean_token_accuracy": 0.2146393209695816, "num_tokens": 77175920.0, "step": 44495 }, { "entropy": 5.8900493621826175, "epoch": 3.46224469947481, "grad_norm": 1.3046875, "learning_rate": 0.0003827031805715458, "loss": 5.0922, "mean_token_accuracy": 0.20170568227767943, "num_tokens": 77184297.0, "step": 44500 }, { "entropy": 5.74807186126709, "epoch": 3.462633728846528, "grad_norm": 1.1875, "learning_rate": 0.00038267884577334124, "loss": 4.9252, "mean_token_accuracy": 0.20820471942424773, "num_tokens": 77192651.0, "step": 44505 }, { "entropy": 5.715284538269043, "epoch": 3.4630227582182456, "grad_norm": 1.3828125, "learning_rate": 0.0003826545093412815, "loss": 4.8397, "mean_token_accuracy": 0.21941955983638764, "num_tokens": 77200997.0, "step": 44510 }, { "entropy": 5.80733289718628, "epoch": 3.463411787589963, "grad_norm": 1.3125, "learning_rate": 0.00038263017127573596, "loss": 4.9341, "mean_token_accuracy": 0.20611511617898942, "num_tokens": 77209080.0, "step": 44515 }, { "entropy": 5.7942129611969, "epoch": 3.4638008169616805, "grad_norm": 1.2890625, "learning_rate": 0.0003826058315770739, "loss": 4.9398, "mean_token_accuracy": 0.20421600639820098, "num_tokens": 77219167.0, "step": 44520 }, { "entropy": 5.70666012763977, "epoch": 3.464189846333398, "grad_norm": 1.2734375, "learning_rate": 0.00038258149024566465, "loss": 4.9012, "mean_token_accuracy": 0.21595054119825363, "num_tokens": 77228099.0, "step": 44525 }, { "entropy": 5.808063220977783, "epoch": 3.464578875705116, "grad_norm": 1.2734375, "learning_rate": 0.0003825571472818774, "loss": 4.9855, "mean_token_accuracy": 0.20789218246936797, "num_tokens": 77237384.0, "step": 44530 }, { "entropy": 5.800053977966309, "epoch": 3.464967905076833, "grad_norm": 1.390625, "learning_rate": 0.0003825328026860817, "loss": 4.8422, "mean_token_accuracy": 0.2194742053747177, "num_tokens": 77245443.0, "step": 44535 }, { "entropy": 5.7520363330841064, "epoch": 3.465356934448551, "grad_norm": 1.34375, "learning_rate": 0.00038250845645864686, "loss": 4.8464, "mean_token_accuracy": 0.2228843241930008, "num_tokens": 77253193.0, "step": 44540 }, { "entropy": 5.7968268394470215, "epoch": 3.4657459638202686, "grad_norm": 1.21875, "learning_rate": 0.0003824841085999423, "loss": 4.9942, "mean_token_accuracy": 0.2035333290696144, "num_tokens": 77263358.0, "step": 44545 }, { "entropy": 5.767202520370484, "epoch": 3.466134993191986, "grad_norm": 1.3828125, "learning_rate": 0.0003824597591103375, "loss": 5.0129, "mean_token_accuracy": 0.20730361938476563, "num_tokens": 77271996.0, "step": 44550 }, { "entropy": 5.793279409408569, "epoch": 3.4665240225637035, "grad_norm": 1.28125, "learning_rate": 0.00038243540799020193, "loss": 4.8532, "mean_token_accuracy": 0.2227787122130394, "num_tokens": 77280795.0, "step": 44555 }, { "entropy": 5.8167726516723635, "epoch": 3.466913051935421, "grad_norm": 1.28125, "learning_rate": 0.00038241105523990497, "loss": 4.9436, "mean_token_accuracy": 0.2103607550263405, "num_tokens": 77289191.0, "step": 44560 }, { "entropy": 5.8177080154418945, "epoch": 3.467302081307139, "grad_norm": 1.2890625, "learning_rate": 0.0003823867008598163, "loss": 5.0075, "mean_token_accuracy": 0.20145169496536255, "num_tokens": 77298022.0, "step": 44565 }, { "entropy": 5.813710737228393, "epoch": 3.467691110678856, "grad_norm": 1.265625, "learning_rate": 0.00038236234485030524, "loss": 4.9898, "mean_token_accuracy": 0.20197797417640687, "num_tokens": 77307145.0, "step": 44570 }, { "entropy": 5.805388498306274, "epoch": 3.468080140050574, "grad_norm": 1.3046875, "learning_rate": 0.00038233798721174156, "loss": 4.9655, "mean_token_accuracy": 0.21489919424057008, "num_tokens": 77316694.0, "step": 44575 }, { "entropy": 5.816874885559082, "epoch": 3.4684691694222916, "grad_norm": 1.390625, "learning_rate": 0.0003823136279444948, "loss": 5.0381, "mean_token_accuracy": 0.20996715277433395, "num_tokens": 77325072.0, "step": 44580 }, { "entropy": 5.796294450759888, "epoch": 3.468858198794009, "grad_norm": 1.296875, "learning_rate": 0.0003822892670489345, "loss": 4.9921, "mean_token_accuracy": 0.20967018455266953, "num_tokens": 77333823.0, "step": 44585 }, { "entropy": 5.805847930908203, "epoch": 3.4692472281657265, "grad_norm": 1.25, "learning_rate": 0.00038226490452543036, "loss": 4.9877, "mean_token_accuracy": 0.20329885929822922, "num_tokens": 77342753.0, "step": 44590 }, { "entropy": 5.771465158462524, "epoch": 3.469636257537444, "grad_norm": 1.265625, "learning_rate": 0.000382240540374352, "loss": 4.9176, "mean_token_accuracy": 0.21257294565439225, "num_tokens": 77351345.0, "step": 44595 }, { "entropy": 5.854795169830322, "epoch": 3.4700252869091615, "grad_norm": 1.3984375, "learning_rate": 0.0003822161745960691, "loss": 5.0356, "mean_token_accuracy": 0.20235168933868408, "num_tokens": 77360144.0, "step": 44600 }, { "entropy": 5.861609935760498, "epoch": 3.470414316280879, "grad_norm": 1.359375, "learning_rate": 0.0003821918071909515, "loss": 5.0335, "mean_token_accuracy": 0.20650643706321717, "num_tokens": 77368821.0, "step": 44605 }, { "entropy": 5.82278299331665, "epoch": 3.470803345652597, "grad_norm": 1.234375, "learning_rate": 0.0003821674381593687, "loss": 4.977, "mean_token_accuracy": 0.21232992708683013, "num_tokens": 77377904.0, "step": 44610 }, { "entropy": 5.860562992095947, "epoch": 3.471192375024314, "grad_norm": 1.25, "learning_rate": 0.0003821430675016907, "loss": 5.0717, "mean_token_accuracy": 0.19763730168342591, "num_tokens": 77387335.0, "step": 44615 }, { "entropy": 5.800619268417359, "epoch": 3.471581404396032, "grad_norm": 1.328125, "learning_rate": 0.00038211869521828716, "loss": 5.0179, "mean_token_accuracy": 0.2063949555158615, "num_tokens": 77396783.0, "step": 44620 }, { "entropy": 5.912663745880127, "epoch": 3.4719704337677495, "grad_norm": 1.28125, "learning_rate": 0.000382094321309528, "loss": 5.1192, "mean_token_accuracy": 0.20105423033237457, "num_tokens": 77406035.0, "step": 44625 }, { "entropy": 5.8274338722229, "epoch": 3.472359463139467, "grad_norm": 1.34375, "learning_rate": 0.0003820699457757829, "loss": 4.9465, "mean_token_accuracy": 0.21495642215013505, "num_tokens": 77415064.0, "step": 44630 }, { "entropy": 5.837008857727051, "epoch": 3.4727484925111844, "grad_norm": 1.25, "learning_rate": 0.0003820455686174218, "loss": 4.9169, "mean_token_accuracy": 0.21378007978200914, "num_tokens": 77423001.0, "step": 44635 }, { "entropy": 5.837916898727417, "epoch": 3.473137521882902, "grad_norm": 1.4296875, "learning_rate": 0.00038202118983481456, "loss": 5.031, "mean_token_accuracy": 0.20314125418663026, "num_tokens": 77431520.0, "step": 44640 }, { "entropy": 5.781664276123047, "epoch": 3.47352655125462, "grad_norm": 1.2578125, "learning_rate": 0.0003819968094283311, "loss": 5.0209, "mean_token_accuracy": 0.1998060703277588, "num_tokens": 77439476.0, "step": 44645 }, { "entropy": 5.914581823348999, "epoch": 3.473915580626337, "grad_norm": 1.2421875, "learning_rate": 0.0003819724273983414, "loss": 5.0202, "mean_token_accuracy": 0.20588335245847703, "num_tokens": 77448466.0, "step": 44650 }, { "entropy": 5.769346141815186, "epoch": 3.474304609998055, "grad_norm": 1.21875, "learning_rate": 0.00038194804374521536, "loss": 4.9329, "mean_token_accuracy": 0.21756333410739898, "num_tokens": 77457858.0, "step": 44655 }, { "entropy": 5.789416122436523, "epoch": 3.4746936393697725, "grad_norm": 1.234375, "learning_rate": 0.0003819236584693229, "loss": 4.9435, "mean_token_accuracy": 0.20962125808000565, "num_tokens": 77467308.0, "step": 44660 }, { "entropy": 5.7204173564910885, "epoch": 3.47508266874149, "grad_norm": 1.3046875, "learning_rate": 0.00038189927157103427, "loss": 4.9228, "mean_token_accuracy": 0.21048675030469893, "num_tokens": 77476227.0, "step": 44665 }, { "entropy": 5.779400634765625, "epoch": 3.4754716981132074, "grad_norm": 1.3515625, "learning_rate": 0.0003818748830507192, "loss": 4.9125, "mean_token_accuracy": 0.21065834164619446, "num_tokens": 77484915.0, "step": 44670 }, { "entropy": 5.8536866188049315, "epoch": 3.475860727484925, "grad_norm": 1.3125, "learning_rate": 0.000381850492908748, "loss": 4.9748, "mean_token_accuracy": 0.20996961295604705, "num_tokens": 77493638.0, "step": 44675 }, { "entropy": 5.8254923820495605, "epoch": 3.476249756856643, "grad_norm": 1.21875, "learning_rate": 0.00038182610114549057, "loss": 4.9692, "mean_token_accuracy": 0.21025509387254715, "num_tokens": 77502834.0, "step": 44680 }, { "entropy": 5.823250865936279, "epoch": 3.47663878622836, "grad_norm": 1.2421875, "learning_rate": 0.00038180170776131714, "loss": 4.9531, "mean_token_accuracy": 0.2062072768807411, "num_tokens": 77511193.0, "step": 44685 }, { "entropy": 5.733512020111084, "epoch": 3.477027815600078, "grad_norm": 1.296875, "learning_rate": 0.0003817773127565977, "loss": 4.8411, "mean_token_accuracy": 0.220217701792717, "num_tokens": 77519839.0, "step": 44690 }, { "entropy": 5.788184022903442, "epoch": 3.4774168449717955, "grad_norm": 1.34375, "learning_rate": 0.00038175291613170247, "loss": 4.9782, "mean_token_accuracy": 0.20957084894180297, "num_tokens": 77528581.0, "step": 44695 }, { "entropy": 5.8498858451843265, "epoch": 3.477805874343513, "grad_norm": 1.421875, "learning_rate": 0.00038172851788700174, "loss": 5.0263, "mean_token_accuracy": 0.20941164791584016, "num_tokens": 77536426.0, "step": 44700 }, { "entropy": 5.803383541107178, "epoch": 3.4781949037152304, "grad_norm": 1.296875, "learning_rate": 0.0003817041180228657, "loss": 4.9536, "mean_token_accuracy": 0.2099262982606888, "num_tokens": 77544785.0, "step": 44705 }, { "entropy": 5.791391277313233, "epoch": 3.478583933086948, "grad_norm": 1.21875, "learning_rate": 0.0003816797165396643, "loss": 4.9702, "mean_token_accuracy": 0.21082494407892227, "num_tokens": 77554731.0, "step": 44710 }, { "entropy": 5.773568153381348, "epoch": 3.4789729624586654, "grad_norm": 1.296875, "learning_rate": 0.00038165531343776815, "loss": 4.8386, "mean_token_accuracy": 0.21456651836633683, "num_tokens": 77562953.0, "step": 44715 }, { "entropy": 5.810403537750244, "epoch": 3.479361991830383, "grad_norm": 1.40625, "learning_rate": 0.0003816309087175474, "loss": 4.9533, "mean_token_accuracy": 0.21115428060293198, "num_tokens": 77571740.0, "step": 44720 }, { "entropy": 5.82951340675354, "epoch": 3.479751021202101, "grad_norm": 1.21875, "learning_rate": 0.00038160650237937225, "loss": 5.0074, "mean_token_accuracy": 0.20887813717126846, "num_tokens": 77580160.0, "step": 44725 }, { "entropy": 5.817427492141723, "epoch": 3.4801400505738185, "grad_norm": 1.390625, "learning_rate": 0.0003815820944236131, "loss": 4.9425, "mean_token_accuracy": 0.21788967698812484, "num_tokens": 77588562.0, "step": 44730 }, { "entropy": 5.770003986358643, "epoch": 3.4805290799455357, "grad_norm": 1.3359375, "learning_rate": 0.00038155768485064037, "loss": 4.8743, "mean_token_accuracy": 0.21837611347436905, "num_tokens": 77596865.0, "step": 44735 }, { "entropy": 5.824219417572022, "epoch": 3.4809181093172534, "grad_norm": 1.3046875, "learning_rate": 0.00038153327366082434, "loss": 5.0182, "mean_token_accuracy": 0.20571184009313584, "num_tokens": 77604976.0, "step": 44740 }, { "entropy": 5.86462812423706, "epoch": 3.481307138688971, "grad_norm": 1.3046875, "learning_rate": 0.00038150886085453546, "loss": 5.0263, "mean_token_accuracy": 0.2066691592335701, "num_tokens": 77614216.0, "step": 44745 }, { "entropy": 5.842089748382568, "epoch": 3.4816961680606884, "grad_norm": 1.296875, "learning_rate": 0.00038148444643214415, "loss": 4.9695, "mean_token_accuracy": 0.21304642111063005, "num_tokens": 77622294.0, "step": 44750 }, { "entropy": 5.862953996658325, "epoch": 3.482085197432406, "grad_norm": 1.3671875, "learning_rate": 0.0003814600303940208, "loss": 4.9927, "mean_token_accuracy": 0.2075642704963684, "num_tokens": 77630231.0, "step": 44755 }, { "entropy": 5.758721971511841, "epoch": 3.4824742268041238, "grad_norm": 1.2265625, "learning_rate": 0.000381435612740536, "loss": 4.8837, "mean_token_accuracy": 0.21443735361099242, "num_tokens": 77638841.0, "step": 44760 }, { "entropy": 5.769045114517212, "epoch": 3.4828632561758415, "grad_norm": 1.3203125, "learning_rate": 0.00038141119347206016, "loss": 4.977, "mean_token_accuracy": 0.21095486581325532, "num_tokens": 77647487.0, "step": 44765 }, { "entropy": 5.8630390644073485, "epoch": 3.4832522855475587, "grad_norm": 1.2734375, "learning_rate": 0.00038138677258896383, "loss": 4.9655, "mean_token_accuracy": 0.21170348227024077, "num_tokens": 77655882.0, "step": 44770 }, { "entropy": 5.739036560058594, "epoch": 3.4836413149192764, "grad_norm": 1.234375, "learning_rate": 0.0003813623500916176, "loss": 4.8692, "mean_token_accuracy": 0.21340648233890533, "num_tokens": 77664919.0, "step": 44775 }, { "entropy": 5.770642280578613, "epoch": 3.484030344290994, "grad_norm": 1.2421875, "learning_rate": 0.00038133792598039196, "loss": 4.9438, "mean_token_accuracy": 0.21559915393590928, "num_tokens": 77673848.0, "step": 44780 }, { "entropy": 5.7986985206604, "epoch": 3.4844193736627114, "grad_norm": 1.4453125, "learning_rate": 0.0003813135002556575, "loss": 4.9642, "mean_token_accuracy": 0.21223575323820115, "num_tokens": 77682352.0, "step": 44785 }, { "entropy": 5.855628919601441, "epoch": 3.484808403034429, "grad_norm": 1.375, "learning_rate": 0.00038128907291778497, "loss": 4.9773, "mean_token_accuracy": 0.20815586149692536, "num_tokens": 77690347.0, "step": 44790 }, { "entropy": 5.753635740280151, "epoch": 3.4851974324061468, "grad_norm": 1.2578125, "learning_rate": 0.00038126464396714494, "loss": 4.8972, "mean_token_accuracy": 0.21757330745458603, "num_tokens": 77699172.0, "step": 44795 }, { "entropy": 5.838264131546021, "epoch": 3.4855864617778645, "grad_norm": 1.359375, "learning_rate": 0.00038124021340410795, "loss": 4.9879, "mean_token_accuracy": 0.2061096966266632, "num_tokens": 77707790.0, "step": 44800 }, { "entropy": 5.79971923828125, "epoch": 3.4859754911495817, "grad_norm": 1.3046875, "learning_rate": 0.00038121578122904496, "loss": 4.9318, "mean_token_accuracy": 0.21389762461185455, "num_tokens": 77716602.0, "step": 44805 }, { "entropy": 5.754730129241944, "epoch": 3.4863645205212994, "grad_norm": 1.3046875, "learning_rate": 0.0003811913474423265, "loss": 4.824, "mean_token_accuracy": 0.22857178300619124, "num_tokens": 77725999.0, "step": 44810 }, { "entropy": 5.810058736801148, "epoch": 3.486753549893017, "grad_norm": 1.2890625, "learning_rate": 0.0003811669120443234, "loss": 4.9945, "mean_token_accuracy": 0.19957429319620132, "num_tokens": 77733829.0, "step": 44815 }, { "entropy": 5.8048561096191404, "epoch": 3.4871425792647344, "grad_norm": 1.453125, "learning_rate": 0.0003811424750354063, "loss": 4.9412, "mean_token_accuracy": 0.2123507335782051, "num_tokens": 77742481.0, "step": 44820 }, { "entropy": 5.739206171035766, "epoch": 3.487531608636452, "grad_norm": 1.265625, "learning_rate": 0.0003811180364159462, "loss": 4.8324, "mean_token_accuracy": 0.22049909979104995, "num_tokens": 77751368.0, "step": 44825 }, { "entropy": 5.755626249313354, "epoch": 3.4879206380081698, "grad_norm": 1.4140625, "learning_rate": 0.00038109359618631374, "loss": 4.8962, "mean_token_accuracy": 0.21955081075429916, "num_tokens": 77759134.0, "step": 44830 }, { "entropy": 5.763351345062256, "epoch": 3.488309667379887, "grad_norm": 1.3046875, "learning_rate": 0.00038106915434687983, "loss": 4.8909, "mean_token_accuracy": 0.2073393613100052, "num_tokens": 77767337.0, "step": 44835 }, { "entropy": 5.735735034942627, "epoch": 3.4886986967516047, "grad_norm": 1.2890625, "learning_rate": 0.0003810447108980153, "loss": 4.8868, "mean_token_accuracy": 0.21393206864595413, "num_tokens": 77776296.0, "step": 44840 }, { "entropy": 5.799203157424927, "epoch": 3.4890877261233224, "grad_norm": 1.2265625, "learning_rate": 0.0003810202658400911, "loss": 5.0347, "mean_token_accuracy": 0.20167160779237747, "num_tokens": 77785252.0, "step": 44845 }, { "entropy": 5.851494789123535, "epoch": 3.4894767554950397, "grad_norm": 1.3046875, "learning_rate": 0.0003809958191734781, "loss": 5.0254, "mean_token_accuracy": 0.20541426837444304, "num_tokens": 77793971.0, "step": 44850 }, { "entropy": 5.791594648361206, "epoch": 3.4898657848667574, "grad_norm": 1.265625, "learning_rate": 0.00038097137089854725, "loss": 4.912, "mean_token_accuracy": 0.2147134929895401, "num_tokens": 77803060.0, "step": 44855 }, { "entropy": 5.728413200378418, "epoch": 3.490254814238475, "grad_norm": 1.2734375, "learning_rate": 0.00038094692101566955, "loss": 4.9046, "mean_token_accuracy": 0.2196303591132164, "num_tokens": 77811046.0, "step": 44860 }, { "entropy": 5.746742153167725, "epoch": 3.4906438436101928, "grad_norm": 1.3046875, "learning_rate": 0.0003809224695252159, "loss": 4.9286, "mean_token_accuracy": 0.215444315969944, "num_tokens": 77819725.0, "step": 44865 }, { "entropy": 5.866979885101318, "epoch": 3.49103287298191, "grad_norm": 1.3515625, "learning_rate": 0.00038089801642755746, "loss": 5.0154, "mean_token_accuracy": 0.2086722135543823, "num_tokens": 77828306.0, "step": 44870 }, { "entropy": 5.79501748085022, "epoch": 3.4914219023536277, "grad_norm": 1.3515625, "learning_rate": 0.00038087356172306514, "loss": 4.9599, "mean_token_accuracy": 0.21721816807985306, "num_tokens": 77836273.0, "step": 44875 }, { "entropy": 5.823392152786255, "epoch": 3.4918109317253454, "grad_norm": 1.203125, "learning_rate": 0.00038084910541211, "loss": 5.0039, "mean_token_accuracy": 0.20695147216320037, "num_tokens": 77846032.0, "step": 44880 }, { "entropy": 5.872608709335327, "epoch": 3.4921999610970627, "grad_norm": 1.2734375, "learning_rate": 0.00038082464749506314, "loss": 5.1041, "mean_token_accuracy": 0.19859897792339326, "num_tokens": 77854943.0, "step": 44885 }, { "entropy": 5.790788745880127, "epoch": 3.4925889904687804, "grad_norm": 1.2734375, "learning_rate": 0.00038080018797229576, "loss": 4.9777, "mean_token_accuracy": 0.2158143550157547, "num_tokens": 77864058.0, "step": 44890 }, { "entropy": 5.789365005493164, "epoch": 3.492978019840498, "grad_norm": 1.328125, "learning_rate": 0.0003807757268441789, "loss": 4.9169, "mean_token_accuracy": 0.20835068821907043, "num_tokens": 77872661.0, "step": 44895 }, { "entropy": 5.878627777099609, "epoch": 3.4933670492122157, "grad_norm": 1.265625, "learning_rate": 0.00038075126411108367, "loss": 4.9913, "mean_token_accuracy": 0.20923679322004318, "num_tokens": 77882141.0, "step": 44900 }, { "entropy": 5.843453216552734, "epoch": 3.493756078583933, "grad_norm": 1.2890625, "learning_rate": 0.00038072679977338143, "loss": 5.0083, "mean_token_accuracy": 0.2131723329424858, "num_tokens": 77891131.0, "step": 44905 }, { "entropy": 5.756050395965576, "epoch": 3.4941451079556507, "grad_norm": 1.4296875, "learning_rate": 0.00038070233383144324, "loss": 4.9181, "mean_token_accuracy": 0.20836942046880721, "num_tokens": 77899444.0, "step": 44910 }, { "entropy": 5.7945140361785885, "epoch": 3.4945341373273684, "grad_norm": 1.296875, "learning_rate": 0.0003806778662856404, "loss": 4.9751, "mean_token_accuracy": 0.21042566150426864, "num_tokens": 77907909.0, "step": 44915 }, { "entropy": 5.811746740341187, "epoch": 3.4949231666990856, "grad_norm": 1.359375, "learning_rate": 0.0003806533971363441, "loss": 4.9078, "mean_token_accuracy": 0.21991004347801207, "num_tokens": 77915559.0, "step": 44920 }, { "entropy": 5.793075037002564, "epoch": 3.4953121960708033, "grad_norm": 1.46875, "learning_rate": 0.0003806289263839257, "loss": 4.8694, "mean_token_accuracy": 0.22224064022302628, "num_tokens": 77924692.0, "step": 44925 }, { "entropy": 5.8115317821502686, "epoch": 3.495701225442521, "grad_norm": 1.1796875, "learning_rate": 0.0003806044540287564, "loss": 4.9864, "mean_token_accuracy": 0.2113666757941246, "num_tokens": 77933306.0, "step": 44930 }, { "entropy": 5.767465019226075, "epoch": 3.4960902548142383, "grad_norm": 1.421875, "learning_rate": 0.00038057998007120776, "loss": 4.9036, "mean_token_accuracy": 0.21141599118709564, "num_tokens": 77941537.0, "step": 44935 }, { "entropy": 5.829384613037109, "epoch": 3.496479284185956, "grad_norm": 1.25, "learning_rate": 0.00038055550451165086, "loss": 5.0193, "mean_token_accuracy": 0.20719606727361678, "num_tokens": 77950706.0, "step": 44940 }, { "entropy": 5.962255525588989, "epoch": 3.4968683135576737, "grad_norm": 1.2265625, "learning_rate": 0.0003805310273504572, "loss": 5.066, "mean_token_accuracy": 0.2000580132007599, "num_tokens": 77959711.0, "step": 44945 }, { "entropy": 5.91013355255127, "epoch": 3.497257342929391, "grad_norm": 1.3046875, "learning_rate": 0.0003805065485879982, "loss": 5.0674, "mean_token_accuracy": 0.2047545090317726, "num_tokens": 77968534.0, "step": 44950 }, { "entropy": 5.792784643173218, "epoch": 3.4976463723011086, "grad_norm": 1.3828125, "learning_rate": 0.00038048206822464514, "loss": 4.9773, "mean_token_accuracy": 0.20988401174545288, "num_tokens": 77976752.0, "step": 44955 }, { "entropy": 5.811288595199585, "epoch": 3.4980354016728263, "grad_norm": 1.3671875, "learning_rate": 0.00038045758626076965, "loss": 5.0094, "mean_token_accuracy": 0.21053359657526016, "num_tokens": 77985310.0, "step": 44960 }, { "entropy": 5.888704061508179, "epoch": 3.498424431044544, "grad_norm": 1.3203125, "learning_rate": 0.0003804331026967432, "loss": 4.9374, "mean_token_accuracy": 0.22279536575078965, "num_tokens": 77994096.0, "step": 44965 }, { "entropy": 5.861061048507691, "epoch": 3.4988134604162613, "grad_norm": 1.2265625, "learning_rate": 0.0003804086175329372, "loss": 4.9469, "mean_token_accuracy": 0.20960406512022017, "num_tokens": 78003341.0, "step": 44970 }, { "entropy": 5.875845813751221, "epoch": 3.499202489787979, "grad_norm": 1.2890625, "learning_rate": 0.0003803841307697232, "loss": 5.0268, "mean_token_accuracy": 0.20410457551479338, "num_tokens": 78012102.0, "step": 44975 }, { "entropy": 5.820131731033325, "epoch": 3.4995915191596967, "grad_norm": 1.328125, "learning_rate": 0.00038035964240747274, "loss": 4.9512, "mean_token_accuracy": 0.2150886818766594, "num_tokens": 78020338.0, "step": 44980 }, { "entropy": 5.812745475769043, "epoch": 3.499980548531414, "grad_norm": 1.3828125, "learning_rate": 0.0003803351524465574, "loss": 5.0032, "mean_token_accuracy": 0.20472732931375504, "num_tokens": 78027762.0, "step": 44985 }, { "entropy": 5.858342027664184, "epoch": 3.5003695779031316, "grad_norm": 1.265625, "learning_rate": 0.00038031066088734883, "loss": 5.0551, "mean_token_accuracy": 0.20780006647109986, "num_tokens": 78037186.0, "step": 44990 }, { "entropy": 5.806086826324463, "epoch": 3.5007586072748493, "grad_norm": 1.2421875, "learning_rate": 0.0003802861677302185, "loss": 4.9738, "mean_token_accuracy": 0.2129598394036293, "num_tokens": 78046214.0, "step": 44995 }, { "entropy": 5.829289388656616, "epoch": 3.501147636646567, "grad_norm": 1.28125, "learning_rate": 0.00038026167297553826, "loss": 4.9549, "mean_token_accuracy": 0.21185954064130783, "num_tokens": 78054411.0, "step": 45000 }, { "epoch": 3.501147636646567, "eval_entropy": 5.506963761984097, "eval_loss": 5.056805610656738, "eval_mean_token_accuracy": 0.21605572932551295, "eval_num_tokens": 78054411.0, "eval_runtime": 21.7208, "eval_samples_per_second": 1913.284, "eval_steps_per_second": 239.172, "step": 45000 }, { "entropy": 5.813321352005005, "epoch": 3.5015366660182843, "grad_norm": 1.2734375, "learning_rate": 0.00038023717662367956, "loss": 4.9961, "mean_token_accuracy": 0.20510170310735704, "num_tokens": 78063346.0, "step": 45005 }, { "entropy": 5.793259906768799, "epoch": 3.501925695390002, "grad_norm": 1.265625, "learning_rate": 0.0003802126786750143, "loss": 4.9242, "mean_token_accuracy": 0.21300642639398576, "num_tokens": 78072018.0, "step": 45010 }, { "entropy": 5.8180849075317385, "epoch": 3.5023147247617192, "grad_norm": 1.28125, "learning_rate": 0.00038018817912991413, "loss": 5.0169, "mean_token_accuracy": 0.20749365985393525, "num_tokens": 78080161.0, "step": 45015 }, { "entropy": 5.837274169921875, "epoch": 3.502703754133437, "grad_norm": 1.3984375, "learning_rate": 0.00038016367798875074, "loss": 4.939, "mean_token_accuracy": 0.21171320378780364, "num_tokens": 78089543.0, "step": 45020 }, { "entropy": 5.840974617004394, "epoch": 3.5030927835051546, "grad_norm": 1.2109375, "learning_rate": 0.0003801391752518959, "loss": 5.0095, "mean_token_accuracy": 0.21064650863409043, "num_tokens": 78098221.0, "step": 45025 }, { "entropy": 5.784175395965576, "epoch": 3.5034818128768723, "grad_norm": 1.40625, "learning_rate": 0.00038011467091972134, "loss": 4.908, "mean_token_accuracy": 0.21289650797843934, "num_tokens": 78106775.0, "step": 45030 }, { "entropy": 5.822022199630737, "epoch": 3.50387084224859, "grad_norm": 1.3359375, "learning_rate": 0.0003800901649925991, "loss": 4.9638, "mean_token_accuracy": 0.21507880091667175, "num_tokens": 78115096.0, "step": 45035 }, { "entropy": 5.803892993927002, "epoch": 3.5042598716203073, "grad_norm": 1.2578125, "learning_rate": 0.00038006565747090076, "loss": 4.8915, "mean_token_accuracy": 0.21365419328212737, "num_tokens": 78123739.0, "step": 45040 }, { "entropy": 5.874557065963745, "epoch": 3.504648900992025, "grad_norm": 1.3203125, "learning_rate": 0.00038004114835499833, "loss": 5.0049, "mean_token_accuracy": 0.21010622829198838, "num_tokens": 78132765.0, "step": 45045 }, { "entropy": 5.842669677734375, "epoch": 3.5050379303637422, "grad_norm": 1.3828125, "learning_rate": 0.00038001663764526374, "loss": 4.9615, "mean_token_accuracy": 0.20232535153627396, "num_tokens": 78141152.0, "step": 45050 }, { "entropy": 5.876247072219849, "epoch": 3.50542695973546, "grad_norm": 1.2890625, "learning_rate": 0.00037999212534206876, "loss": 5.0044, "mean_token_accuracy": 0.20881702452898027, "num_tokens": 78150396.0, "step": 45055 }, { "entropy": 5.760600852966308, "epoch": 3.5058159891071776, "grad_norm": 1.3203125, "learning_rate": 0.0003799676114457853, "loss": 4.9017, "mean_token_accuracy": 0.21219079643487931, "num_tokens": 78158678.0, "step": 45060 }, { "entropy": 5.847808504104615, "epoch": 3.5062050184788953, "grad_norm": 1.28125, "learning_rate": 0.00037994309595678553, "loss": 5.0583, "mean_token_accuracy": 0.20376445204019547, "num_tokens": 78166140.0, "step": 45065 }, { "entropy": 5.87225079536438, "epoch": 3.5065940478506126, "grad_norm": 1.4609375, "learning_rate": 0.0003799185788754413, "loss": 5.0531, "mean_token_accuracy": 0.20961882025003434, "num_tokens": 78174321.0, "step": 45070 }, { "entropy": 5.85811939239502, "epoch": 3.5069830772223303, "grad_norm": 1.4296875, "learning_rate": 0.0003798940602021247, "loss": 4.9962, "mean_token_accuracy": 0.2071768209338188, "num_tokens": 78183437.0, "step": 45075 }, { "entropy": 5.817267894744873, "epoch": 3.507372106594048, "grad_norm": 1.3828125, "learning_rate": 0.0003798695399372076, "loss": 4.9161, "mean_token_accuracy": 0.21512413769960403, "num_tokens": 78191619.0, "step": 45080 }, { "entropy": 5.743234443664551, "epoch": 3.507761135965765, "grad_norm": 1.25, "learning_rate": 0.0003798450180810621, "loss": 4.8938, "mean_token_accuracy": 0.21629833579063415, "num_tokens": 78200178.0, "step": 45085 }, { "entropy": 5.757799482345581, "epoch": 3.508150165337483, "grad_norm": 1.4453125, "learning_rate": 0.00037982049463406044, "loss": 4.935, "mean_token_accuracy": 0.21537938416004182, "num_tokens": 78209036.0, "step": 45090 }, { "entropy": 5.81472430229187, "epoch": 3.5085391947092006, "grad_norm": 1.2890625, "learning_rate": 0.0003797959695965745, "loss": 4.9922, "mean_token_accuracy": 0.20536351054906846, "num_tokens": 78218668.0, "step": 45095 }, { "entropy": 5.859426784515381, "epoch": 3.5089282240809183, "grad_norm": 1.375, "learning_rate": 0.00037977144296897665, "loss": 4.9175, "mean_token_accuracy": 0.21129161715507508, "num_tokens": 78226590.0, "step": 45100 }, { "entropy": 5.826872682571411, "epoch": 3.5093172534526356, "grad_norm": 1.28125, "learning_rate": 0.0003797469147516388, "loss": 4.9925, "mean_token_accuracy": 0.2070878878235817, "num_tokens": 78235714.0, "step": 45105 }, { "entropy": 5.75032114982605, "epoch": 3.5097062828243533, "grad_norm": 1.28125, "learning_rate": 0.00037972238494493333, "loss": 4.8737, "mean_token_accuracy": 0.21817990392446518, "num_tokens": 78244428.0, "step": 45110 }, { "entropy": 5.645319223403931, "epoch": 3.510095312196071, "grad_norm": 1.25, "learning_rate": 0.0003796978535492323, "loss": 4.7811, "mean_token_accuracy": 0.22959374785423278, "num_tokens": 78253594.0, "step": 45115 }, { "entropy": 5.760876798629761, "epoch": 3.510484341567788, "grad_norm": 1.34375, "learning_rate": 0.000379673320564908, "loss": 4.9262, "mean_token_accuracy": 0.20910530686378478, "num_tokens": 78262483.0, "step": 45120 }, { "entropy": 5.853269815444946, "epoch": 3.510873370939506, "grad_norm": 1.265625, "learning_rate": 0.00037964878599233264, "loss": 5.0116, "mean_token_accuracy": 0.202649088203907, "num_tokens": 78271659.0, "step": 45125 }, { "entropy": 5.782860803604126, "epoch": 3.5112624003112236, "grad_norm": 1.2734375, "learning_rate": 0.00037962424983187856, "loss": 4.9147, "mean_token_accuracy": 0.21599110662937165, "num_tokens": 78280211.0, "step": 45130 }, { "entropy": 5.748004484176636, "epoch": 3.5116514296829413, "grad_norm": 1.4453125, "learning_rate": 0.000379599712083918, "loss": 4.8953, "mean_token_accuracy": 0.2166224390268326, "num_tokens": 78288834.0, "step": 45135 }, { "entropy": 5.760526037216186, "epoch": 3.5120404590546586, "grad_norm": 1.40625, "learning_rate": 0.0003795751727488233, "loss": 4.8433, "mean_token_accuracy": 0.21424808353185654, "num_tokens": 78298058.0, "step": 45140 }, { "entropy": 5.84750714302063, "epoch": 3.5124294884263763, "grad_norm": 1.1640625, "learning_rate": 0.00037955063182696676, "loss": 4.9407, "mean_token_accuracy": 0.21515571177005768, "num_tokens": 78307074.0, "step": 45145 }, { "entropy": 5.780036115646363, "epoch": 3.5128185177980935, "grad_norm": 1.265625, "learning_rate": 0.00037952608931872086, "loss": 4.9523, "mean_token_accuracy": 0.21380218416452407, "num_tokens": 78315760.0, "step": 45150 }, { "entropy": 5.807078838348389, "epoch": 3.513207547169811, "grad_norm": 1.390625, "learning_rate": 0.00037950154522445784, "loss": 4.9166, "mean_token_accuracy": 0.21372097581624985, "num_tokens": 78323273.0, "step": 45155 }, { "entropy": 5.896497297286987, "epoch": 3.513596576541529, "grad_norm": 1.375, "learning_rate": 0.0003794769995445502, "loss": 5.0278, "mean_token_accuracy": 0.20753000378608705, "num_tokens": 78332561.0, "step": 45160 }, { "entropy": 5.883106231689453, "epoch": 3.5139856059132466, "grad_norm": 1.2890625, "learning_rate": 0.0003794524522793705, "loss": 4.997, "mean_token_accuracy": 0.21208302825689315, "num_tokens": 78340988.0, "step": 45165 }, { "entropy": 5.735545492172241, "epoch": 3.514374635284964, "grad_norm": 1.328125, "learning_rate": 0.00037942790342929106, "loss": 4.8347, "mean_token_accuracy": 0.2209579184651375, "num_tokens": 78348910.0, "step": 45170 }, { "entropy": 5.822321033477783, "epoch": 3.5147636646566816, "grad_norm": 1.40625, "learning_rate": 0.00037940335299468437, "loss": 4.9638, "mean_token_accuracy": 0.20489564836025237, "num_tokens": 78357354.0, "step": 45175 }, { "entropy": 5.82618818283081, "epoch": 3.5151526940283992, "grad_norm": 1.3203125, "learning_rate": 0.00037937880097592294, "loss": 5.0546, "mean_token_accuracy": 0.19918642640113832, "num_tokens": 78366974.0, "step": 45180 }, { "entropy": 5.829914188385009, "epoch": 3.5155417234001165, "grad_norm": 1.3125, "learning_rate": 0.00037935424737337936, "loss": 4.9412, "mean_token_accuracy": 0.2084791049361229, "num_tokens": 78375384.0, "step": 45185 }, { "entropy": 5.762835311889648, "epoch": 3.515930752771834, "grad_norm": 1.3046875, "learning_rate": 0.00037932969218742616, "loss": 4.8904, "mean_token_accuracy": 0.21634900867938994, "num_tokens": 78383450.0, "step": 45190 }, { "entropy": 5.730808591842651, "epoch": 3.516319782143552, "grad_norm": 1.3828125, "learning_rate": 0.00037930513541843593, "loss": 4.788, "mean_token_accuracy": 0.23119618445634843, "num_tokens": 78392676.0, "step": 45195 }, { "entropy": 5.802438688278198, "epoch": 3.5167088115152696, "grad_norm": 1.3046875, "learning_rate": 0.00037928057706678136, "loss": 4.965, "mean_token_accuracy": 0.20052557289600373, "num_tokens": 78401193.0, "step": 45200 }, { "entropy": 5.824980735778809, "epoch": 3.517097840886987, "grad_norm": 1.3125, "learning_rate": 0.00037925601713283504, "loss": 4.9198, "mean_token_accuracy": 0.21526775360107422, "num_tokens": 78409399.0, "step": 45205 }, { "entropy": 5.800518941879273, "epoch": 3.5174868702587045, "grad_norm": 1.3203125, "learning_rate": 0.0003792314556169695, "loss": 4.9266, "mean_token_accuracy": 0.21333644688129424, "num_tokens": 78417973.0, "step": 45210 }, { "entropy": 5.760382032394409, "epoch": 3.5178758996304222, "grad_norm": 1.265625, "learning_rate": 0.0003792068925195576, "loss": 5.0053, "mean_token_accuracy": 0.2081844612956047, "num_tokens": 78426638.0, "step": 45215 }, { "entropy": 5.817866039276123, "epoch": 3.5182649290021395, "grad_norm": 1.453125, "learning_rate": 0.0003791823278409719, "loss": 4.9901, "mean_token_accuracy": 0.20355746001005173, "num_tokens": 78434394.0, "step": 45220 }, { "entropy": 5.790622711181641, "epoch": 3.518653958373857, "grad_norm": 1.2734375, "learning_rate": 0.00037915776158158515, "loss": 4.943, "mean_token_accuracy": 0.20978427082300186, "num_tokens": 78443204.0, "step": 45225 }, { "entropy": 5.814149522781372, "epoch": 3.519042987745575, "grad_norm": 1.3828125, "learning_rate": 0.0003791331937417703, "loss": 4.9188, "mean_token_accuracy": 0.21450867801904677, "num_tokens": 78451612.0, "step": 45230 }, { "entropy": 5.8086967945098875, "epoch": 3.5194320171172926, "grad_norm": 1.3515625, "learning_rate": 0.00037910862432189986, "loss": 4.9953, "mean_token_accuracy": 0.20457030534744264, "num_tokens": 78459456.0, "step": 45235 }, { "entropy": 5.793901586532593, "epoch": 3.51982104648901, "grad_norm": 1.3671875, "learning_rate": 0.0003790840533223467, "loss": 4.9519, "mean_token_accuracy": 0.20999650210142135, "num_tokens": 78468587.0, "step": 45240 }, { "entropy": 5.862044763565064, "epoch": 3.5202100758607275, "grad_norm": 1.3125, "learning_rate": 0.00037905948074348387, "loss": 4.9334, "mean_token_accuracy": 0.20903226137161254, "num_tokens": 78476229.0, "step": 45245 }, { "entropy": 5.86932258605957, "epoch": 3.520599105232445, "grad_norm": 1.25, "learning_rate": 0.000379034906585684, "loss": 5.067, "mean_token_accuracy": 0.1992817610502243, "num_tokens": 78484996.0, "step": 45250 }, { "entropy": 5.871080684661865, "epoch": 3.5209881346041625, "grad_norm": 1.359375, "learning_rate": 0.00037901033084932, "loss": 5.073, "mean_token_accuracy": 0.2013338327407837, "num_tokens": 78493597.0, "step": 45255 }, { "entropy": 5.855810594558716, "epoch": 3.52137716397588, "grad_norm": 1.3203125, "learning_rate": 0.0003789857535347648, "loss": 4.9287, "mean_token_accuracy": 0.21102392822504043, "num_tokens": 78502269.0, "step": 45260 }, { "entropy": 5.813720941543579, "epoch": 3.521766193347598, "grad_norm": 1.34375, "learning_rate": 0.0003789611746423912, "loss": 4.9234, "mean_token_accuracy": 0.2144293576478958, "num_tokens": 78510676.0, "step": 45265 }, { "entropy": 5.73393063545227, "epoch": 3.5221552227193156, "grad_norm": 1.3203125, "learning_rate": 0.00037893659417257233, "loss": 4.9234, "mean_token_accuracy": 0.21111984103918074, "num_tokens": 78518879.0, "step": 45270 }, { "entropy": 5.771286201477051, "epoch": 3.522544252091033, "grad_norm": 1.1953125, "learning_rate": 0.00037891201212568107, "loss": 4.9746, "mean_token_accuracy": 0.21582725942134856, "num_tokens": 78527704.0, "step": 45275 }, { "entropy": 5.855817651748657, "epoch": 3.5229332814627505, "grad_norm": 1.421875, "learning_rate": 0.00037888742850209037, "loss": 4.944, "mean_token_accuracy": 0.20759392529726028, "num_tokens": 78534893.0, "step": 45280 }, { "entropy": 5.782792568206787, "epoch": 3.523322310834468, "grad_norm": 1.2265625, "learning_rate": 0.0003788628433021733, "loss": 4.9483, "mean_token_accuracy": 0.20575661659240724, "num_tokens": 78543269.0, "step": 45285 }, { "entropy": 5.782317733764648, "epoch": 3.5237113402061855, "grad_norm": 1.3671875, "learning_rate": 0.000378838256526303, "loss": 4.9071, "mean_token_accuracy": 0.21620275676250458, "num_tokens": 78551508.0, "step": 45290 }, { "entropy": 5.779688930511474, "epoch": 3.524100369577903, "grad_norm": 1.3046875, "learning_rate": 0.0003788136681748523, "loss": 4.9184, "mean_token_accuracy": 0.21713436841964723, "num_tokens": 78560466.0, "step": 45295 }, { "entropy": 5.886016988754273, "epoch": 3.524489398949621, "grad_norm": 1.3984375, "learning_rate": 0.0003787890782481945, "loss": 4.9903, "mean_token_accuracy": 0.20435259044170379, "num_tokens": 78569174.0, "step": 45300 }, { "entropy": 5.831105518341064, "epoch": 3.524878428321338, "grad_norm": 1.3203125, "learning_rate": 0.0003787644867467026, "loss": 5.0366, "mean_token_accuracy": 0.20041045993566514, "num_tokens": 78577955.0, "step": 45305 }, { "entropy": 5.803250455856324, "epoch": 3.525267457693056, "grad_norm": 1.3515625, "learning_rate": 0.00037873989367074977, "loss": 4.8553, "mean_token_accuracy": 0.2185870364308357, "num_tokens": 78586570.0, "step": 45310 }, { "entropy": 5.825661325454712, "epoch": 3.5256564870647735, "grad_norm": 1.328125, "learning_rate": 0.00037871529902070924, "loss": 4.941, "mean_token_accuracy": 0.21008640825748442, "num_tokens": 78594714.0, "step": 45315 }, { "entropy": 5.836709213256836, "epoch": 3.526045516436491, "grad_norm": 1.28125, "learning_rate": 0.00037869070279695404, "loss": 5.0765, "mean_token_accuracy": 0.20417039692401887, "num_tokens": 78604010.0, "step": 45320 }, { "entropy": 5.800618696212768, "epoch": 3.5264345458082085, "grad_norm": 1.4375, "learning_rate": 0.00037866610499985755, "loss": 4.8908, "mean_token_accuracy": 0.22231896817684174, "num_tokens": 78611948.0, "step": 45325 }, { "entropy": 5.816164207458496, "epoch": 3.526823575179926, "grad_norm": 1.2421875, "learning_rate": 0.0003786415056297929, "loss": 4.9659, "mean_token_accuracy": 0.20789026468992233, "num_tokens": 78621047.0, "step": 45330 }, { "entropy": 5.77265477180481, "epoch": 3.527212604551644, "grad_norm": 1.265625, "learning_rate": 0.0003786169046871333, "loss": 4.9866, "mean_token_accuracy": 0.20680720061063768, "num_tokens": 78629739.0, "step": 45335 }, { "entropy": 5.7793221950531, "epoch": 3.527601633923361, "grad_norm": 1.328125, "learning_rate": 0.0003785923021722521, "loss": 4.8981, "mean_token_accuracy": 0.2111008107662201, "num_tokens": 78638527.0, "step": 45340 }, { "entropy": 5.825672245025634, "epoch": 3.527990663295079, "grad_norm": 1.3203125, "learning_rate": 0.00037856769808552267, "loss": 5.025, "mean_token_accuracy": 0.20180676877498627, "num_tokens": 78648141.0, "step": 45345 }, { "entropy": 5.801985502243042, "epoch": 3.528379692666796, "grad_norm": 1.2890625, "learning_rate": 0.0003785430924273182, "loss": 4.9789, "mean_token_accuracy": 0.21205473691225052, "num_tokens": 78657164.0, "step": 45350 }, { "entropy": 5.79061713218689, "epoch": 3.5287687220385138, "grad_norm": 1.2890625, "learning_rate": 0.00037851848519801214, "loss": 4.8641, "mean_token_accuracy": 0.21025518774986268, "num_tokens": 78665267.0, "step": 45355 }, { "entropy": 5.755394172668457, "epoch": 3.5291577514102315, "grad_norm": 1.375, "learning_rate": 0.0003784938763979778, "loss": 4.9735, "mean_token_accuracy": 0.21441158056259155, "num_tokens": 78673423.0, "step": 45360 }, { "entropy": 5.817419958114624, "epoch": 3.529546780781949, "grad_norm": 1.25, "learning_rate": 0.0003784692660275886, "loss": 4.9802, "mean_token_accuracy": 0.2032128944993019, "num_tokens": 78682593.0, "step": 45365 }, { "entropy": 5.78404393196106, "epoch": 3.529935810153667, "grad_norm": 1.296875, "learning_rate": 0.0003784446540872181, "loss": 4.9393, "mean_token_accuracy": 0.20600709170103074, "num_tokens": 78690885.0, "step": 45370 }, { "entropy": 5.8400311946868895, "epoch": 3.530324839525384, "grad_norm": 1.2421875, "learning_rate": 0.00037842004057723957, "loss": 4.9943, "mean_token_accuracy": 0.20629359185695648, "num_tokens": 78699970.0, "step": 45375 }, { "entropy": 5.847697496414185, "epoch": 3.530713868897102, "grad_norm": 1.28125, "learning_rate": 0.0003783954254980265, "loss": 4.9501, "mean_token_accuracy": 0.2169342517852783, "num_tokens": 78709002.0, "step": 45380 }, { "entropy": 5.775740242004394, "epoch": 3.531102898268819, "grad_norm": 1.3203125, "learning_rate": 0.0003783708088499524, "loss": 4.9327, "mean_token_accuracy": 0.21920690834522247, "num_tokens": 78718062.0, "step": 45385 }, { "entropy": 5.745716190338134, "epoch": 3.5314919276405368, "grad_norm": 1.3671875, "learning_rate": 0.00037834619063339085, "loss": 4.8939, "mean_token_accuracy": 0.21457216739654542, "num_tokens": 78726558.0, "step": 45390 }, { "entropy": 5.793801927566529, "epoch": 3.5318809570122545, "grad_norm": 1.3359375, "learning_rate": 0.0003783215708487153, "loss": 4.9007, "mean_token_accuracy": 0.21774953454732895, "num_tokens": 78734939.0, "step": 45395 }, { "entropy": 5.853519916534424, "epoch": 3.532269986383972, "grad_norm": 1.28125, "learning_rate": 0.0003782969494962994, "loss": 5.0054, "mean_token_accuracy": 0.2107601910829544, "num_tokens": 78744418.0, "step": 45400 }, { "entropy": 5.7989812850952145, "epoch": 3.5326590157556894, "grad_norm": 1.3203125, "learning_rate": 0.0003782723265765167, "loss": 4.9727, "mean_token_accuracy": 0.20644504725933074, "num_tokens": 78753021.0, "step": 45405 }, { "entropy": 5.769595289230347, "epoch": 3.533048045127407, "grad_norm": 1.265625, "learning_rate": 0.00037824770208974085, "loss": 4.8391, "mean_token_accuracy": 0.2132203087210655, "num_tokens": 78761107.0, "step": 45410 }, { "entropy": 5.7268853187561035, "epoch": 3.533437074499125, "grad_norm": 1.2890625, "learning_rate": 0.0003782230760363454, "loss": 4.9179, "mean_token_accuracy": 0.2123666971921921, "num_tokens": 78770143.0, "step": 45415 }, { "entropy": 5.784217739105225, "epoch": 3.533826103870842, "grad_norm": 1.4140625, "learning_rate": 0.00037819844841670416, "loss": 4.9088, "mean_token_accuracy": 0.20768339335918426, "num_tokens": 78778458.0, "step": 45420 }, { "entropy": 5.804666757583618, "epoch": 3.5342151332425598, "grad_norm": 1.34375, "learning_rate": 0.0003781738192311906, "loss": 5.0088, "mean_token_accuracy": 0.2151852533221245, "num_tokens": 78787510.0, "step": 45425 }, { "entropy": 5.850858068466186, "epoch": 3.5346041626142775, "grad_norm": 1.375, "learning_rate": 0.00037814918848017855, "loss": 5.0469, "mean_token_accuracy": 0.20158490538597107, "num_tokens": 78796331.0, "step": 45430 }, { "entropy": 5.830416870117188, "epoch": 3.534993191985995, "grad_norm": 1.3359375, "learning_rate": 0.0003781245561640418, "loss": 5.0514, "mean_token_accuracy": 0.20728355050086975, "num_tokens": 78805606.0, "step": 45435 }, { "entropy": 5.892860794067383, "epoch": 3.5353822213577124, "grad_norm": 1.3046875, "learning_rate": 0.0003780999222831541, "loss": 4.9763, "mean_token_accuracy": 0.20694072991609574, "num_tokens": 78814435.0, "step": 45440 }, { "entropy": 5.905220890045166, "epoch": 3.53577125072943, "grad_norm": 1.421875, "learning_rate": 0.0003780752868378892, "loss": 5.0546, "mean_token_accuracy": 0.21346767991781235, "num_tokens": 78822361.0, "step": 45445 }, { "entropy": 5.798485803604126, "epoch": 3.536160280101148, "grad_norm": 1.2421875, "learning_rate": 0.00037805064982862076, "loss": 4.9776, "mean_token_accuracy": 0.20915819555521012, "num_tokens": 78831000.0, "step": 45450 }, { "entropy": 5.861365222930909, "epoch": 3.536549309472865, "grad_norm": 1.15625, "learning_rate": 0.0003780260112557228, "loss": 5.0242, "mean_token_accuracy": 0.20004044026136397, "num_tokens": 78840386.0, "step": 45455 }, { "entropy": 5.826126194000244, "epoch": 3.5369383388445828, "grad_norm": 1.609375, "learning_rate": 0.00037800137111956904, "loss": 5.0101, "mean_token_accuracy": 0.20590718686580659, "num_tokens": 78849399.0, "step": 45460 }, { "entropy": 5.832609510421753, "epoch": 3.5373273682163004, "grad_norm": 1.3671875, "learning_rate": 0.00037797672942053344, "loss": 4.9002, "mean_token_accuracy": 0.211916247010231, "num_tokens": 78857116.0, "step": 45465 }, { "entropy": 5.841524934768676, "epoch": 3.537716397588018, "grad_norm": 1.40625, "learning_rate": 0.00037795208615898997, "loss": 5.0182, "mean_token_accuracy": 0.20713664144277572, "num_tokens": 78865733.0, "step": 45470 }, { "entropy": 5.791316556930542, "epoch": 3.5381054269597354, "grad_norm": 1.3515625, "learning_rate": 0.0003779274413353124, "loss": 4.9838, "mean_token_accuracy": 0.20468091070652009, "num_tokens": 78873870.0, "step": 45475 }, { "entropy": 5.823578786849976, "epoch": 3.538494456331453, "grad_norm": 1.2578125, "learning_rate": 0.00037790279494987475, "loss": 5.0018, "mean_token_accuracy": 0.2108188033103943, "num_tokens": 78883314.0, "step": 45480 }, { "entropy": 5.813000440597534, "epoch": 3.5388834857031704, "grad_norm": 1.1875, "learning_rate": 0.00037787814700305096, "loss": 4.9169, "mean_token_accuracy": 0.2141449362039566, "num_tokens": 78892161.0, "step": 45485 }, { "entropy": 5.763432407379151, "epoch": 3.539272515074888, "grad_norm": 1.265625, "learning_rate": 0.000377853497495215, "loss": 4.8486, "mean_token_accuracy": 0.22069081664085388, "num_tokens": 78900432.0, "step": 45490 }, { "entropy": 5.80365309715271, "epoch": 3.5396615444466057, "grad_norm": 1.2265625, "learning_rate": 0.00037782884642674085, "loss": 4.9275, "mean_token_accuracy": 0.21013251841068267, "num_tokens": 78910091.0, "step": 45495 }, { "entropy": 5.822058057785034, "epoch": 3.5400505738183234, "grad_norm": 1.359375, "learning_rate": 0.0003778041937980028, "loss": 4.9992, "mean_token_accuracy": 0.20520620346069335, "num_tokens": 78918863.0, "step": 45500 }, { "entropy": 5.782979488372803, "epoch": 3.5404396031900407, "grad_norm": 1.3203125, "learning_rate": 0.00037777953960937467, "loss": 4.9503, "mean_token_accuracy": 0.208700729906559, "num_tokens": 78927380.0, "step": 45505 }, { "entropy": 5.830315589904785, "epoch": 3.5408286325617584, "grad_norm": 1.296875, "learning_rate": 0.00037775488386123057, "loss": 4.9061, "mean_token_accuracy": 0.21744582653045655, "num_tokens": 78935847.0, "step": 45510 }, { "entropy": 5.833281946182251, "epoch": 3.541217661933476, "grad_norm": 1.4140625, "learning_rate": 0.00037773022655394466, "loss": 4.9961, "mean_token_accuracy": 0.21164417862892151, "num_tokens": 78943941.0, "step": 45515 }, { "entropy": 5.8266314506530765, "epoch": 3.5416066913051933, "grad_norm": 1.3828125, "learning_rate": 0.00037770556768789115, "loss": 5.0101, "mean_token_accuracy": 0.20548932254314423, "num_tokens": 78952966.0, "step": 45520 }, { "entropy": 5.708487701416016, "epoch": 3.541995720676911, "grad_norm": 1.453125, "learning_rate": 0.00037768090726344414, "loss": 4.8484, "mean_token_accuracy": 0.2200747698545456, "num_tokens": 78961502.0, "step": 45525 }, { "entropy": 5.811375141143799, "epoch": 3.5423847500486287, "grad_norm": 1.3671875, "learning_rate": 0.0003776562452809777, "loss": 4.9506, "mean_token_accuracy": 0.2104323014616966, "num_tokens": 78969995.0, "step": 45530 }, { "entropy": 5.89182939529419, "epoch": 3.5427737794203464, "grad_norm": 1.296875, "learning_rate": 0.00037763158174086616, "loss": 5.1087, "mean_token_accuracy": 0.19918400198221206, "num_tokens": 78978385.0, "step": 45535 }, { "entropy": 5.845244407653809, "epoch": 3.5431628087920637, "grad_norm": 1.2421875, "learning_rate": 0.00037760691664348367, "loss": 4.9025, "mean_token_accuracy": 0.21115608215332032, "num_tokens": 78986985.0, "step": 45540 }, { "entropy": 5.763188171386719, "epoch": 3.5435518381637814, "grad_norm": 1.28125, "learning_rate": 0.0003775822499892046, "loss": 4.9047, "mean_token_accuracy": 0.2115631327033043, "num_tokens": 78995466.0, "step": 45545 }, { "entropy": 5.78605375289917, "epoch": 3.543940867535499, "grad_norm": 1.3984375, "learning_rate": 0.0003775575817784032, "loss": 5.0017, "mean_token_accuracy": 0.20879299938678741, "num_tokens": 79003809.0, "step": 45550 }, { "entropy": 5.784150409698486, "epoch": 3.5443298969072163, "grad_norm": 1.3359375, "learning_rate": 0.00037753291201145375, "loss": 4.9286, "mean_token_accuracy": 0.21100800037384032, "num_tokens": 79011876.0, "step": 45555 }, { "entropy": 5.799603080749511, "epoch": 3.544718926278934, "grad_norm": 1.2734375, "learning_rate": 0.0003775082406887305, "loss": 4.9119, "mean_token_accuracy": 0.21266697347164154, "num_tokens": 79021379.0, "step": 45560 }, { "entropy": 5.853301048278809, "epoch": 3.5451079556506517, "grad_norm": 1.40625, "learning_rate": 0.00037748356781060785, "loss": 5.0635, "mean_token_accuracy": 0.20574453920125962, "num_tokens": 79031006.0, "step": 45565 }, { "entropy": 5.838681411743164, "epoch": 3.5454969850223694, "grad_norm": 1.359375, "learning_rate": 0.0003774588933774602, "loss": 5.0045, "mean_token_accuracy": 0.21116629391908645, "num_tokens": 79039676.0, "step": 45570 }, { "entropy": 5.804794025421143, "epoch": 3.5458860143940867, "grad_norm": 1.359375, "learning_rate": 0.0003774342173896619, "loss": 4.9324, "mean_token_accuracy": 0.2116515800356865, "num_tokens": 79048111.0, "step": 45575 }, { "entropy": 5.817240476608276, "epoch": 3.5462750437658044, "grad_norm": 1.2890625, "learning_rate": 0.00037740953984758736, "loss": 5.0238, "mean_token_accuracy": 0.2059001162648201, "num_tokens": 79057447.0, "step": 45580 }, { "entropy": 5.788116788864135, "epoch": 3.5466640731375216, "grad_norm": 1.3203125, "learning_rate": 0.0003773848607516111, "loss": 4.9832, "mean_token_accuracy": 0.2159174606204033, "num_tokens": 79066120.0, "step": 45585 }, { "entropy": 5.8395671367645265, "epoch": 3.5470531025092393, "grad_norm": 1.34375, "learning_rate": 0.0003773601801021075, "loss": 4.9176, "mean_token_accuracy": 0.21410602927207947, "num_tokens": 79074732.0, "step": 45590 }, { "entropy": 5.796017646789551, "epoch": 3.547442131880957, "grad_norm": 1.2265625, "learning_rate": 0.0003773354978994512, "loss": 5.0047, "mean_token_accuracy": 0.2049333706498146, "num_tokens": 79084914.0, "step": 45595 }, { "entropy": 5.738105583190918, "epoch": 3.5478311612526747, "grad_norm": 1.3203125, "learning_rate": 0.00037731081414401653, "loss": 4.9019, "mean_token_accuracy": 0.2194870412349701, "num_tokens": 79093467.0, "step": 45600 }, { "entropy": 5.790896415710449, "epoch": 3.548220190624392, "grad_norm": 1.296875, "learning_rate": 0.00037728612883617806, "loss": 4.9729, "mean_token_accuracy": 0.20668717622756957, "num_tokens": 79102710.0, "step": 45605 }, { "entropy": 5.84487133026123, "epoch": 3.5486092199961097, "grad_norm": 1.390625, "learning_rate": 0.0003772614419763104, "loss": 5.0598, "mean_token_accuracy": 0.20658017247915267, "num_tokens": 79111130.0, "step": 45610 }, { "entropy": 5.799659872055054, "epoch": 3.5489982493678274, "grad_norm": 1.2734375, "learning_rate": 0.0003772367535647882, "loss": 4.8949, "mean_token_accuracy": 0.213723886013031, "num_tokens": 79119775.0, "step": 45615 }, { "entropy": 5.771841049194336, "epoch": 3.5493872787395446, "grad_norm": 1.359375, "learning_rate": 0.00037721206360198596, "loss": 4.889, "mean_token_accuracy": 0.2210264250636101, "num_tokens": 79128543.0, "step": 45620 }, { "entropy": 5.737437772750854, "epoch": 3.5497763081112623, "grad_norm": 1.3046875, "learning_rate": 0.0003771873720882783, "loss": 4.956, "mean_token_accuracy": 0.21400993764400483, "num_tokens": 79136372.0, "step": 45625 }, { "entropy": 5.788264656066895, "epoch": 3.55016533748298, "grad_norm": 1.3515625, "learning_rate": 0.00037716267902403996, "loss": 4.9774, "mean_token_accuracy": 0.21334954500198364, "num_tokens": 79144638.0, "step": 45630 }, { "entropy": 5.855875158309937, "epoch": 3.5505543668546977, "grad_norm": 1.4296875, "learning_rate": 0.0003771379844096456, "loss": 5.0665, "mean_token_accuracy": 0.20090455412864686, "num_tokens": 79152626.0, "step": 45635 }, { "entropy": 5.907175159454345, "epoch": 3.550943396226415, "grad_norm": 1.40625, "learning_rate": 0.0003771132882454698, "loss": 5.0147, "mean_token_accuracy": 0.20848543494939803, "num_tokens": 79161127.0, "step": 45640 }, { "entropy": 5.750036334991455, "epoch": 3.5513324255981327, "grad_norm": 1.4375, "learning_rate": 0.0003770885905318874, "loss": 4.8957, "mean_token_accuracy": 0.2257724091410637, "num_tokens": 79169453.0, "step": 45645 }, { "entropy": 5.8462060451507565, "epoch": 3.5517214549698504, "grad_norm": 1.328125, "learning_rate": 0.0003770638912692732, "loss": 4.9649, "mean_token_accuracy": 0.20671792477369308, "num_tokens": 79177591.0, "step": 45650 }, { "entropy": 5.870442628860474, "epoch": 3.5521104843415676, "grad_norm": 1.2890625, "learning_rate": 0.0003770391904580019, "loss": 4.9959, "mean_token_accuracy": 0.20799550861120225, "num_tokens": 79185987.0, "step": 45655 }, { "entropy": 5.8748842716217045, "epoch": 3.5524995137132853, "grad_norm": 1.328125, "learning_rate": 0.0003770144880984482, "loss": 5.082, "mean_token_accuracy": 0.20195890665054322, "num_tokens": 79194005.0, "step": 45660 }, { "entropy": 5.730224323272705, "epoch": 3.552888543085003, "grad_norm": 1.2265625, "learning_rate": 0.00037698978419098704, "loss": 4.8369, "mean_token_accuracy": 0.22671942114830018, "num_tokens": 79202314.0, "step": 45665 }, { "entropy": 5.875687217712402, "epoch": 3.5532775724567207, "grad_norm": 1.2734375, "learning_rate": 0.00037696507873599336, "loss": 5.0436, "mean_token_accuracy": 0.20112827569246292, "num_tokens": 79211213.0, "step": 45670 }, { "entropy": 5.751328754425049, "epoch": 3.553666601828438, "grad_norm": 1.3359375, "learning_rate": 0.00037694037173384177, "loss": 4.8401, "mean_token_accuracy": 0.2243558019399643, "num_tokens": 79219489.0, "step": 45675 }, { "entropy": 5.771969842910766, "epoch": 3.5540556312001557, "grad_norm": 1.2578125, "learning_rate": 0.0003769156631849074, "loss": 4.9327, "mean_token_accuracy": 0.21885934472084045, "num_tokens": 79228846.0, "step": 45680 }, { "entropy": 5.806939649581909, "epoch": 3.554444660571873, "grad_norm": 1.3828125, "learning_rate": 0.000376890953089565, "loss": 4.9771, "mean_token_accuracy": 0.2097019910812378, "num_tokens": 79236924.0, "step": 45685 }, { "entropy": 5.816749334335327, "epoch": 3.5548336899435906, "grad_norm": 1.3046875, "learning_rate": 0.0003768662414481895, "loss": 5.0178, "mean_token_accuracy": 0.20901619642972946, "num_tokens": 79244649.0, "step": 45690 }, { "entropy": 5.843409538269043, "epoch": 3.5552227193153083, "grad_norm": 1.4765625, "learning_rate": 0.00037684152826115595, "loss": 5.027, "mean_token_accuracy": 0.20894724875688553, "num_tokens": 79252972.0, "step": 45695 }, { "entropy": 5.790639066696167, "epoch": 3.555611748687026, "grad_norm": 1.2890625, "learning_rate": 0.0003768168135288394, "loss": 4.9513, "mean_token_accuracy": 0.20734113752841948, "num_tokens": 79261497.0, "step": 45700 }, { "entropy": 5.787721776962281, "epoch": 3.5560007780587437, "grad_norm": 1.328125, "learning_rate": 0.0003767920972516147, "loss": 4.9836, "mean_token_accuracy": 0.20976236313581467, "num_tokens": 79270297.0, "step": 45705 }, { "entropy": 5.861518144607544, "epoch": 3.556389807430461, "grad_norm": 1.3984375, "learning_rate": 0.00037676737942985697, "loss": 5.0046, "mean_token_accuracy": 0.20882606655359268, "num_tokens": 79278635.0, "step": 45710 }, { "entropy": 5.878735589981079, "epoch": 3.5567788368021787, "grad_norm": 1.3828125, "learning_rate": 0.00037674266006394123, "loss": 5.0112, "mean_token_accuracy": 0.2046027272939682, "num_tokens": 79287816.0, "step": 45715 }, { "entropy": 5.75970778465271, "epoch": 3.557167866173896, "grad_norm": 1.3125, "learning_rate": 0.00037671793915424254, "loss": 4.8983, "mean_token_accuracy": 0.21205201297998427, "num_tokens": 79296837.0, "step": 45720 }, { "entropy": 5.921825981140136, "epoch": 3.5575568955456136, "grad_norm": 1.2578125, "learning_rate": 0.000376693216701136, "loss": 5.0727, "mean_token_accuracy": 0.20024030059576034, "num_tokens": 79306442.0, "step": 45725 }, { "entropy": 5.974536752700805, "epoch": 3.5579459249173313, "grad_norm": 1.3203125, "learning_rate": 0.0003766684927049968, "loss": 5.101, "mean_token_accuracy": 0.20315322577953338, "num_tokens": 79316483.0, "step": 45730 }, { "entropy": 5.788800668716431, "epoch": 3.558334954289049, "grad_norm": 1.34375, "learning_rate": 0.0003766437671662, "loss": 4.8098, "mean_token_accuracy": 0.2224116340279579, "num_tokens": 79324858.0, "step": 45735 }, { "entropy": 5.794866228103638, "epoch": 3.5587239836607663, "grad_norm": 1.3203125, "learning_rate": 0.0003766190400851209, "loss": 5.006, "mean_token_accuracy": 0.20657079219818114, "num_tokens": 79333744.0, "step": 45740 }, { "entropy": 5.8316141128540036, "epoch": 3.559113013032484, "grad_norm": 1.2421875, "learning_rate": 0.0003765943114621345, "loss": 4.9248, "mean_token_accuracy": 0.2116079792380333, "num_tokens": 79342589.0, "step": 45745 }, { "entropy": 5.755400562286377, "epoch": 3.5595020424042016, "grad_norm": 1.359375, "learning_rate": 0.00037656958129761626, "loss": 4.8931, "mean_token_accuracy": 0.21814570426940919, "num_tokens": 79350869.0, "step": 45750 }, { "entropy": 5.783532571792603, "epoch": 3.559891071775919, "grad_norm": 1.34375, "learning_rate": 0.00037654484959194126, "loss": 4.9516, "mean_token_accuracy": 0.21263615638017655, "num_tokens": 79359407.0, "step": 45755 }, { "entropy": 5.841552352905273, "epoch": 3.5602801011476366, "grad_norm": 1.359375, "learning_rate": 0.00037652011634548466, "loss": 4.9856, "mean_token_accuracy": 0.2135540783405304, "num_tokens": 79367564.0, "step": 45760 }, { "entropy": 5.764188241958618, "epoch": 3.5606691305193543, "grad_norm": 1.3359375, "learning_rate": 0.000376495381558622, "loss": 4.8826, "mean_token_accuracy": 0.21830277293920516, "num_tokens": 79376300.0, "step": 45765 }, { "entropy": 5.857189273834228, "epoch": 3.561058159891072, "grad_norm": 1.3515625, "learning_rate": 0.0003764706452317284, "loss": 5.0304, "mean_token_accuracy": 0.20654138177633286, "num_tokens": 79385484.0, "step": 45770 }, { "entropy": 5.822109317779541, "epoch": 3.5614471892627892, "grad_norm": 1.3828125, "learning_rate": 0.00037644590736517935, "loss": 4.9514, "mean_token_accuracy": 0.21074367463588714, "num_tokens": 79393971.0, "step": 45775 }, { "entropy": 5.880957555770874, "epoch": 3.561836218634507, "grad_norm": 1.3828125, "learning_rate": 0.0003764211679593501, "loss": 5.0977, "mean_token_accuracy": 0.20631877481937408, "num_tokens": 79402315.0, "step": 45780 }, { "entropy": 5.835041189193726, "epoch": 3.562225248006224, "grad_norm": 1.3984375, "learning_rate": 0.00037639642701461603, "loss": 4.9392, "mean_token_accuracy": 0.21083763092756272, "num_tokens": 79411071.0, "step": 45785 }, { "entropy": 5.777821397781372, "epoch": 3.562614277377942, "grad_norm": 1.390625, "learning_rate": 0.0003763716845313526, "loss": 4.9145, "mean_token_accuracy": 0.21527123749256133, "num_tokens": 79418896.0, "step": 45790 }, { "entropy": 5.814695549011231, "epoch": 3.5630033067496596, "grad_norm": 1.3828125, "learning_rate": 0.0003763469405099352, "loss": 4.9506, "mean_token_accuracy": 0.20826036632061004, "num_tokens": 79427223.0, "step": 45795 }, { "entropy": 5.8677574634552006, "epoch": 3.5633923361213773, "grad_norm": 1.453125, "learning_rate": 0.0003763221949507392, "loss": 4.9671, "mean_token_accuracy": 0.2066577658057213, "num_tokens": 79435895.0, "step": 45800 }, { "entropy": 5.878408670425415, "epoch": 3.563781365493095, "grad_norm": 1.3515625, "learning_rate": 0.00037629744785414027, "loss": 5.0323, "mean_token_accuracy": 0.20185740441083908, "num_tokens": 79443957.0, "step": 45805 }, { "entropy": 5.897330093383789, "epoch": 3.5641703948648122, "grad_norm": 1.265625, "learning_rate": 0.00037627269922051377, "loss": 4.9735, "mean_token_accuracy": 0.21219557672739028, "num_tokens": 79452134.0, "step": 45810 }, { "entropy": 5.769147491455078, "epoch": 3.56455942423653, "grad_norm": 1.3828125, "learning_rate": 0.00037624794905023523, "loss": 4.9667, "mean_token_accuracy": 0.20739717781543732, "num_tokens": 79460087.0, "step": 45815 }, { "entropy": 5.832948875427246, "epoch": 3.564948453608247, "grad_norm": 1.3125, "learning_rate": 0.0003762231973436802, "loss": 4.9964, "mean_token_accuracy": 0.20041875094175338, "num_tokens": 79469869.0, "step": 45820 }, { "entropy": 5.830523347854614, "epoch": 3.565337482979965, "grad_norm": 1.3046875, "learning_rate": 0.0003761984441012243, "loss": 4.9893, "mean_token_accuracy": 0.21188482344150544, "num_tokens": 79478559.0, "step": 45825 }, { "entropy": 5.817302989959717, "epoch": 3.5657265123516826, "grad_norm": 1.265625, "learning_rate": 0.0003761736893232431, "loss": 4.8924, "mean_token_accuracy": 0.21851737052202225, "num_tokens": 79486945.0, "step": 45830 }, { "entropy": 5.7599317073822025, "epoch": 3.5661155417234003, "grad_norm": 1.3359375, "learning_rate": 0.00037614893301011223, "loss": 4.8669, "mean_token_accuracy": 0.22144827395677566, "num_tokens": 79496526.0, "step": 45835 }, { "entropy": 5.776782131195068, "epoch": 3.5665045710951175, "grad_norm": 1.2734375, "learning_rate": 0.0003761241751622072, "loss": 5.0022, "mean_token_accuracy": 0.2019118458032608, "num_tokens": 79505503.0, "step": 45840 }, { "entropy": 5.797314023971557, "epoch": 3.5668936004668352, "grad_norm": 1.25, "learning_rate": 0.0003760994157799038, "loss": 5.0524, "mean_token_accuracy": 0.200222010910511, "num_tokens": 79514561.0, "step": 45845 }, { "entropy": 5.795496845245362, "epoch": 3.567282629838553, "grad_norm": 1.3046875, "learning_rate": 0.0003760746548635777, "loss": 4.9615, "mean_token_accuracy": 0.21370150595903398, "num_tokens": 79522973.0, "step": 45850 }, { "entropy": 5.821690320968628, "epoch": 3.56767165921027, "grad_norm": 1.2109375, "learning_rate": 0.0003760498924136046, "loss": 4.9045, "mean_token_accuracy": 0.21621183753013612, "num_tokens": 79532130.0, "step": 45855 }, { "entropy": 5.84192304611206, "epoch": 3.568060688581988, "grad_norm": 1.3359375, "learning_rate": 0.00037602512843036025, "loss": 4.9937, "mean_token_accuracy": 0.20305964201688767, "num_tokens": 79540581.0, "step": 45860 }, { "entropy": 5.769860315322876, "epoch": 3.5684497179537056, "grad_norm": 1.3828125, "learning_rate": 0.0003760003629142203, "loss": 4.8678, "mean_token_accuracy": 0.2217419296503067, "num_tokens": 79548674.0, "step": 45865 }, { "entropy": 5.776714944839478, "epoch": 3.5688387473254233, "grad_norm": 1.265625, "learning_rate": 0.00037597559586556063, "loss": 4.9175, "mean_token_accuracy": 0.21231061965227127, "num_tokens": 79558300.0, "step": 45870 }, { "entropy": 5.782433271408081, "epoch": 3.5692277766971405, "grad_norm": 1.2578125, "learning_rate": 0.000375950827284757, "loss": 4.9419, "mean_token_accuracy": 0.20863323658704758, "num_tokens": 79566687.0, "step": 45875 }, { "entropy": 5.85628981590271, "epoch": 3.5696168060688582, "grad_norm": 1.3359375, "learning_rate": 0.00037592605717218523, "loss": 5.0137, "mean_token_accuracy": 0.20874384939670562, "num_tokens": 79575204.0, "step": 45880 }, { "entropy": 5.8355378150939945, "epoch": 3.570005835440576, "grad_norm": 1.3125, "learning_rate": 0.00037590128552822123, "loss": 4.9332, "mean_token_accuracy": 0.2159321829676628, "num_tokens": 79583102.0, "step": 45885 }, { "entropy": 5.801847648620606, "epoch": 3.570394864812293, "grad_norm": 1.3515625, "learning_rate": 0.0003758765123532407, "loss": 4.9546, "mean_token_accuracy": 0.2035079523921013, "num_tokens": 79591933.0, "step": 45890 }, { "entropy": 5.8468505859375, "epoch": 3.570783894184011, "grad_norm": 1.3671875, "learning_rate": 0.0003758517376476198, "loss": 4.9769, "mean_token_accuracy": 0.20467118322849273, "num_tokens": 79600588.0, "step": 45895 }, { "entropy": 5.8075930118560795, "epoch": 3.5711729235557286, "grad_norm": 1.328125, "learning_rate": 0.00037582696141173435, "loss": 4.9176, "mean_token_accuracy": 0.2164935812354088, "num_tokens": 79609252.0, "step": 45900 }, { "entropy": 5.801520490646363, "epoch": 3.5715619529274463, "grad_norm": 1.2421875, "learning_rate": 0.00037580218364596015, "loss": 4.9282, "mean_token_accuracy": 0.22053564190864564, "num_tokens": 79617191.0, "step": 45905 }, { "entropy": 5.791358947753906, "epoch": 3.5719509822991635, "grad_norm": 1.3515625, "learning_rate": 0.00037577740435067327, "loss": 5.0404, "mean_token_accuracy": 0.2013176277279854, "num_tokens": 79626174.0, "step": 45910 }, { "entropy": 5.8120581150054935, "epoch": 3.572340011670881, "grad_norm": 1.328125, "learning_rate": 0.00037575262352624965, "loss": 4.9635, "mean_token_accuracy": 0.21481109261512757, "num_tokens": 79634760.0, "step": 45915 }, { "entropy": 5.78380651473999, "epoch": 3.5727290410425985, "grad_norm": 1.40625, "learning_rate": 0.00037572784117306535, "loss": 4.8461, "mean_token_accuracy": 0.22952760607004166, "num_tokens": 79643335.0, "step": 45920 }, { "entropy": 5.867970895767212, "epoch": 3.573118070414316, "grad_norm": 1.359375, "learning_rate": 0.0003757030572914963, "loss": 5.0528, "mean_token_accuracy": 0.20880814045667648, "num_tokens": 79651695.0, "step": 45925 }, { "entropy": 5.817747449874878, "epoch": 3.573507099786034, "grad_norm": 1.3359375, "learning_rate": 0.0003756782718819188, "loss": 4.9684, "mean_token_accuracy": 0.21489560157060622, "num_tokens": 79659674.0, "step": 45930 }, { "entropy": 5.792196035385132, "epoch": 3.5738961291577516, "grad_norm": 1.25, "learning_rate": 0.00037565348494470873, "loss": 4.9031, "mean_token_accuracy": 0.21575790047645568, "num_tokens": 79668592.0, "step": 45935 }, { "entropy": 5.755132102966309, "epoch": 3.574285158529469, "grad_norm": 1.25, "learning_rate": 0.0003756286964802422, "loss": 4.8613, "mean_token_accuracy": 0.21860517263412477, "num_tokens": 79677828.0, "step": 45940 }, { "entropy": 5.847037410736084, "epoch": 3.5746741879011865, "grad_norm": 1.3359375, "learning_rate": 0.0003756039064888954, "loss": 5.0209, "mean_token_accuracy": 0.21168335676193237, "num_tokens": 79686660.0, "step": 45945 }, { "entropy": 5.79526720046997, "epoch": 3.575063217272904, "grad_norm": 1.296875, "learning_rate": 0.0003755791149710444, "loss": 5.0472, "mean_token_accuracy": 0.2017928585410118, "num_tokens": 79695263.0, "step": 45950 }, { "entropy": 5.809184217453003, "epoch": 3.5754522466446215, "grad_norm": 1.359375, "learning_rate": 0.00037555432192706547, "loss": 4.9417, "mean_token_accuracy": 0.2108468934893608, "num_tokens": 79703602.0, "step": 45955 }, { "entropy": 5.8300927639007565, "epoch": 3.575841276016339, "grad_norm": 1.390625, "learning_rate": 0.00037552952735733466, "loss": 4.9836, "mean_token_accuracy": 0.21829370260238648, "num_tokens": 79711783.0, "step": 45960 }, { "entropy": 5.848870134353637, "epoch": 3.576230305388057, "grad_norm": 1.328125, "learning_rate": 0.0003755047312622283, "loss": 5.0503, "mean_token_accuracy": 0.2001035362482071, "num_tokens": 79721461.0, "step": 45965 }, { "entropy": 5.7984107494354244, "epoch": 3.5766193347597746, "grad_norm": 1.3828125, "learning_rate": 0.00037547993364212267, "loss": 4.9089, "mean_token_accuracy": 0.21043780148029329, "num_tokens": 79729230.0, "step": 45970 }, { "entropy": 5.81268630027771, "epoch": 3.577008364131492, "grad_norm": 1.3203125, "learning_rate": 0.000375455134497394, "loss": 4.9853, "mean_token_accuracy": 0.20937354862689972, "num_tokens": 79738165.0, "step": 45975 }, { "entropy": 5.806296491622925, "epoch": 3.5773973935032095, "grad_norm": 1.296875, "learning_rate": 0.0003754303338284186, "loss": 4.873, "mean_token_accuracy": 0.21749370396137238, "num_tokens": 79746857.0, "step": 45980 }, { "entropy": 5.93383936882019, "epoch": 3.577786422874927, "grad_norm": 1.3984375, "learning_rate": 0.00037540553163557263, "loss": 5.0329, "mean_token_accuracy": 0.2093258872628212, "num_tokens": 79755172.0, "step": 45985 }, { "entropy": 5.730869197845459, "epoch": 3.5781754522466445, "grad_norm": 1.28125, "learning_rate": 0.00037538072791923257, "loss": 4.8735, "mean_token_accuracy": 0.21616389453411103, "num_tokens": 79763542.0, "step": 45990 }, { "entropy": 5.7690948963165285, "epoch": 3.578564481618362, "grad_norm": 1.359375, "learning_rate": 0.00037535592267977467, "loss": 4.9418, "mean_token_accuracy": 0.21199156790971757, "num_tokens": 79771805.0, "step": 45995 }, { "entropy": 5.838302993774414, "epoch": 3.57895351099008, "grad_norm": 1.3203125, "learning_rate": 0.0003753311159175754, "loss": 4.9952, "mean_token_accuracy": 0.21438377052545549, "num_tokens": 79780645.0, "step": 46000 }, { "entropy": 5.754995584487915, "epoch": 3.5793425403617976, "grad_norm": 1.2578125, "learning_rate": 0.00037530630763301113, "loss": 4.8679, "mean_token_accuracy": 0.22566500455141067, "num_tokens": 79789218.0, "step": 46005 }, { "entropy": 5.834118843078613, "epoch": 3.579731569733515, "grad_norm": 1.2890625, "learning_rate": 0.0003752814978264584, "loss": 5.0135, "mean_token_accuracy": 0.20235100537538528, "num_tokens": 79798214.0, "step": 46010 }, { "entropy": 5.834825754165649, "epoch": 3.5801205991052325, "grad_norm": 1.265625, "learning_rate": 0.0003752566864982934, "loss": 4.921, "mean_token_accuracy": 0.2062920331954956, "num_tokens": 79806698.0, "step": 46015 }, { "entropy": 5.807423686981201, "epoch": 3.5805096284769498, "grad_norm": 1.2734375, "learning_rate": 0.00037523187364889293, "loss": 4.9782, "mean_token_accuracy": 0.20407067388296127, "num_tokens": 79814956.0, "step": 46020 }, { "entropy": 5.783746528625488, "epoch": 3.5808986578486675, "grad_norm": 1.34375, "learning_rate": 0.0003752070592786332, "loss": 4.9217, "mean_token_accuracy": 0.21372544169425964, "num_tokens": 79823955.0, "step": 46025 }, { "entropy": 5.780959844589233, "epoch": 3.581287687220385, "grad_norm": 1.40625, "learning_rate": 0.00037518224338789084, "loss": 4.836, "mean_token_accuracy": 0.21007320582866668, "num_tokens": 79832383.0, "step": 46030 }, { "entropy": 5.805595779418946, "epoch": 3.581676716592103, "grad_norm": 1.3046875, "learning_rate": 0.0003751574259770424, "loss": 4.9558, "mean_token_accuracy": 0.20447180569171905, "num_tokens": 79841778.0, "step": 46035 }, { "entropy": 5.750589370727539, "epoch": 3.58206574596382, "grad_norm": 1.234375, "learning_rate": 0.0003751326070464645, "loss": 4.867, "mean_token_accuracy": 0.2172168269753456, "num_tokens": 79851024.0, "step": 46040 }, { "entropy": 5.8313250064849855, "epoch": 3.582454775335538, "grad_norm": 1.421875, "learning_rate": 0.0003751077865965337, "loss": 4.9757, "mean_token_accuracy": 0.2106667071580887, "num_tokens": 79859987.0, "step": 46045 }, { "entropy": 5.779419946670532, "epoch": 3.5828438047072555, "grad_norm": 1.28125, "learning_rate": 0.00037508296462762647, "loss": 4.8792, "mean_token_accuracy": 0.21935367286205293, "num_tokens": 79868389.0, "step": 46050 }, { "entropy": 5.823296928405762, "epoch": 3.5832328340789728, "grad_norm": 1.28125, "learning_rate": 0.00037505814114011956, "loss": 5.0436, "mean_token_accuracy": 0.20300888866186143, "num_tokens": 79877784.0, "step": 46055 }, { "entropy": 5.847481632232666, "epoch": 3.5836218634506904, "grad_norm": 1.3984375, "learning_rate": 0.00037503331613438965, "loss": 4.967, "mean_token_accuracy": 0.21580814123153685, "num_tokens": 79886118.0, "step": 46060 }, { "entropy": 5.827394676208496, "epoch": 3.584010892822408, "grad_norm": 1.3828125, "learning_rate": 0.00037500848961081334, "loss": 4.9188, "mean_token_accuracy": 0.21960929781198502, "num_tokens": 79894753.0, "step": 46065 }, { "entropy": 5.766821384429932, "epoch": 3.584399922194126, "grad_norm": 1.4296875, "learning_rate": 0.00037498366156976746, "loss": 4.9097, "mean_token_accuracy": 0.21462747752666472, "num_tokens": 79903285.0, "step": 46070 }, { "entropy": 5.841796207427978, "epoch": 3.584788951565843, "grad_norm": 1.328125, "learning_rate": 0.00037495883201162854, "loss": 4.9313, "mean_token_accuracy": 0.21317213475704194, "num_tokens": 79912076.0, "step": 46075 }, { "entropy": 5.796639347076416, "epoch": 3.585177980937561, "grad_norm": 1.3046875, "learning_rate": 0.0003749340009367736, "loss": 4.9287, "mean_token_accuracy": 0.2109483703970909, "num_tokens": 79920942.0, "step": 46080 }, { "entropy": 5.812687492370605, "epoch": 3.5855670103092785, "grad_norm": 1.25, "learning_rate": 0.00037490916834557916, "loss": 5.0671, "mean_token_accuracy": 0.20442180037498475, "num_tokens": 79929818.0, "step": 46085 }, { "entropy": 5.821621751785278, "epoch": 3.5859560396809957, "grad_norm": 1.3125, "learning_rate": 0.0003748843342384221, "loss": 4.9742, "mean_token_accuracy": 0.21197703629732131, "num_tokens": 79939001.0, "step": 46090 }, { "entropy": 5.898798179626465, "epoch": 3.5863450690527134, "grad_norm": 1.4296875, "learning_rate": 0.00037485949861567925, "loss": 5.0311, "mean_token_accuracy": 0.2061600998044014, "num_tokens": 79947311.0, "step": 46095 }, { "entropy": 5.796378755569458, "epoch": 3.586734098424431, "grad_norm": 1.328125, "learning_rate": 0.0003748346614777275, "loss": 4.9246, "mean_token_accuracy": 0.21311047077178955, "num_tokens": 79955266.0, "step": 46100 }, { "entropy": 5.799361085891723, "epoch": 3.587123127796149, "grad_norm": 1.6015625, "learning_rate": 0.0003748098228249437, "loss": 4.9974, "mean_token_accuracy": 0.20716936886310577, "num_tokens": 79962465.0, "step": 46105 }, { "entropy": 5.7580687522888185, "epoch": 3.587512157167866, "grad_norm": 1.3984375, "learning_rate": 0.00037478498265770463, "loss": 4.9134, "mean_token_accuracy": 0.22119341492652894, "num_tokens": 79971040.0, "step": 46110 }, { "entropy": 5.788208103179931, "epoch": 3.587901186539584, "grad_norm": 1.359375, "learning_rate": 0.0003747601409763872, "loss": 4.9597, "mean_token_accuracy": 0.21178487241268157, "num_tokens": 79979454.0, "step": 46115 }, { "entropy": 5.773600339889526, "epoch": 3.588290215911301, "grad_norm": 1.28125, "learning_rate": 0.00037473529778136853, "loss": 4.9052, "mean_token_accuracy": 0.2140735074877739, "num_tokens": 79988240.0, "step": 46120 }, { "entropy": 5.831853628158569, "epoch": 3.5886792452830187, "grad_norm": 1.328125, "learning_rate": 0.00037471045307302544, "loss": 5.0528, "mean_token_accuracy": 0.21356875896453859, "num_tokens": 79997753.0, "step": 46125 }, { "entropy": 5.807552528381348, "epoch": 3.5890682746547364, "grad_norm": 1.25, "learning_rate": 0.00037468560685173497, "loss": 4.9506, "mean_token_accuracy": 0.2097383752465248, "num_tokens": 80007274.0, "step": 46130 }, { "entropy": 5.839351797103882, "epoch": 3.589457304026454, "grad_norm": 1.390625, "learning_rate": 0.000374660759117874, "loss": 4.9461, "mean_token_accuracy": 0.21137878745794297, "num_tokens": 80015796.0, "step": 46135 }, { "entropy": 5.773214960098267, "epoch": 3.589846333398172, "grad_norm": 1.34375, "learning_rate": 0.00037463590987181966, "loss": 4.9115, "mean_token_accuracy": 0.20926809012889863, "num_tokens": 80024049.0, "step": 46140 }, { "entropy": 5.685464668273926, "epoch": 3.590235362769889, "grad_norm": 1.3203125, "learning_rate": 0.00037461105911394904, "loss": 4.797, "mean_token_accuracy": 0.22817701250314712, "num_tokens": 80032284.0, "step": 46145 }, { "entropy": 5.7586949348449705, "epoch": 3.590624392141607, "grad_norm": 1.3515625, "learning_rate": 0.00037458620684463907, "loss": 4.9363, "mean_token_accuracy": 0.21099608540534973, "num_tokens": 80040154.0, "step": 46150 }, { "entropy": 5.878221416473389, "epoch": 3.591013421513324, "grad_norm": 1.265625, "learning_rate": 0.00037456135306426693, "loss": 5.007, "mean_token_accuracy": 0.21890163868665696, "num_tokens": 80048156.0, "step": 46155 }, { "entropy": 5.744373083114624, "epoch": 3.5914024508850417, "grad_norm": 1.2421875, "learning_rate": 0.0003745364977732097, "loss": 4.907, "mean_token_accuracy": 0.21786221265792846, "num_tokens": 80057467.0, "step": 46160 }, { "entropy": 5.767145156860352, "epoch": 3.5917914802567594, "grad_norm": 1.390625, "learning_rate": 0.0003745116409718446, "loss": 4.9814, "mean_token_accuracy": 0.21006892770528793, "num_tokens": 80066864.0, "step": 46165 }, { "entropy": 5.868279075622558, "epoch": 3.592180509628477, "grad_norm": 1.2734375, "learning_rate": 0.0003744867826605488, "loss": 5.0074, "mean_token_accuracy": 0.20821731686592101, "num_tokens": 80076940.0, "step": 46170 }, { "entropy": 5.83074803352356, "epoch": 3.5925695390001944, "grad_norm": 1.2890625, "learning_rate": 0.0003744619228396993, "loss": 4.923, "mean_token_accuracy": 0.22322225272655488, "num_tokens": 80085994.0, "step": 46175 }, { "entropy": 5.7740882396697994, "epoch": 3.592958568371912, "grad_norm": 1.453125, "learning_rate": 0.0003744370615096734, "loss": 4.8981, "mean_token_accuracy": 0.21851158887147903, "num_tokens": 80093721.0, "step": 46180 }, { "entropy": 5.721835708618164, "epoch": 3.5933475977436298, "grad_norm": 1.3984375, "learning_rate": 0.0003744121986708485, "loss": 4.9055, "mean_token_accuracy": 0.21360829919576646, "num_tokens": 80101833.0, "step": 46185 }, { "entropy": 5.777675914764404, "epoch": 3.593736627115347, "grad_norm": 1.2578125, "learning_rate": 0.00037438733432360163, "loss": 4.9237, "mean_token_accuracy": 0.22264047414064408, "num_tokens": 80110337.0, "step": 46190 }, { "entropy": 5.784383821487427, "epoch": 3.5941256564870647, "grad_norm": 1.4453125, "learning_rate": 0.0003743624684683102, "loss": 4.9109, "mean_token_accuracy": 0.2153599113225937, "num_tokens": 80118218.0, "step": 46195 }, { "entropy": 5.796963262557983, "epoch": 3.5945146858587824, "grad_norm": 1.265625, "learning_rate": 0.0003743376011053514, "loss": 4.9746, "mean_token_accuracy": 0.2069922924041748, "num_tokens": 80126409.0, "step": 46200 }, { "entropy": 5.787580442428589, "epoch": 3.5949037152305, "grad_norm": 1.3203125, "learning_rate": 0.00037431273223510265, "loss": 4.9346, "mean_token_accuracy": 0.21726664304733276, "num_tokens": 80134415.0, "step": 46205 }, { "entropy": 5.837283182144165, "epoch": 3.5952927446022174, "grad_norm": 1.3671875, "learning_rate": 0.0003742878618579413, "loss": 4.9716, "mean_token_accuracy": 0.2183663859963417, "num_tokens": 80142504.0, "step": 46210 }, { "entropy": 5.777931356430054, "epoch": 3.595681773973935, "grad_norm": 1.40625, "learning_rate": 0.0003742629899742446, "loss": 4.9902, "mean_token_accuracy": 0.20834216177463533, "num_tokens": 80151892.0, "step": 46215 }, { "entropy": 5.813216876983643, "epoch": 3.5960708033456523, "grad_norm": 1.2890625, "learning_rate": 0.00037423811658439014, "loss": 4.9544, "mean_token_accuracy": 0.20990791022777558, "num_tokens": 80160194.0, "step": 46220 }, { "entropy": 5.842740535736084, "epoch": 3.59645983271737, "grad_norm": 1.3046875, "learning_rate": 0.00037421324168875503, "loss": 4.9846, "mean_token_accuracy": 0.21198739260435104, "num_tokens": 80168397.0, "step": 46225 }, { "entropy": 5.744569492340088, "epoch": 3.5968488620890877, "grad_norm": 1.3046875, "learning_rate": 0.000374188365287717, "loss": 4.9386, "mean_token_accuracy": 0.21192863583564758, "num_tokens": 80177142.0, "step": 46230 }, { "entropy": 5.805349254608155, "epoch": 3.5972378914608054, "grad_norm": 1.2578125, "learning_rate": 0.0003741634873816534, "loss": 4.9948, "mean_token_accuracy": 0.20455799400806426, "num_tokens": 80186221.0, "step": 46235 }, { "entropy": 5.834863519668579, "epoch": 3.597626920832523, "grad_norm": 1.390625, "learning_rate": 0.00037413860797094175, "loss": 5.0173, "mean_token_accuracy": 0.2015296548604965, "num_tokens": 80194334.0, "step": 46240 }, { "entropy": 5.835600996017456, "epoch": 3.5980159502042404, "grad_norm": 1.3125, "learning_rate": 0.00037411372705595947, "loss": 5.008, "mean_token_accuracy": 0.2055267870426178, "num_tokens": 80202986.0, "step": 46245 }, { "entropy": 5.871081161499023, "epoch": 3.598404979575958, "grad_norm": 1.3671875, "learning_rate": 0.0003740888446370842, "loss": 4.9905, "mean_token_accuracy": 0.21096014976501465, "num_tokens": 80211392.0, "step": 46250 }, { "entropy": 5.825295162200928, "epoch": 3.5987940089476753, "grad_norm": 1.34375, "learning_rate": 0.0003740639607146933, "loss": 5.0106, "mean_token_accuracy": 0.1976752057671547, "num_tokens": 80219572.0, "step": 46255 }, { "entropy": 5.867576837539673, "epoch": 3.599183038319393, "grad_norm": 1.375, "learning_rate": 0.00037403907528916455, "loss": 5.0263, "mean_token_accuracy": 0.20848813503980637, "num_tokens": 80227847.0, "step": 46260 }, { "entropy": 5.8063170433044435, "epoch": 3.5995720676911107, "grad_norm": 1.2421875, "learning_rate": 0.0003740141883608755, "loss": 5.0319, "mean_token_accuracy": 0.20491524785757065, "num_tokens": 80237610.0, "step": 46265 }, { "entropy": 5.799551630020142, "epoch": 3.5999610970628284, "grad_norm": 1.34375, "learning_rate": 0.0003739892999302037, "loss": 4.9088, "mean_token_accuracy": 0.21762848198413848, "num_tokens": 80245948.0, "step": 46270 }, { "entropy": 5.826488447189331, "epoch": 3.6003501264345457, "grad_norm": 1.34375, "learning_rate": 0.0003739644099975269, "loss": 5.0166, "mean_token_accuracy": 0.21117476373910904, "num_tokens": 80254457.0, "step": 46275 }, { "entropy": 5.817165327072144, "epoch": 3.6007391558062634, "grad_norm": 1.1875, "learning_rate": 0.00037393951856322263, "loss": 5.0176, "mean_token_accuracy": 0.2054389998316765, "num_tokens": 80264204.0, "step": 46280 }, { "entropy": 5.911039590835571, "epoch": 3.601128185177981, "grad_norm": 1.453125, "learning_rate": 0.0003739146256276686, "loss": 4.9947, "mean_token_accuracy": 0.21341054737567902, "num_tokens": 80272188.0, "step": 46285 }, { "entropy": 5.829954147338867, "epoch": 3.6015172145496983, "grad_norm": 1.21875, "learning_rate": 0.00037388973119124267, "loss": 4.9929, "mean_token_accuracy": 0.20715164840221406, "num_tokens": 80282009.0, "step": 46290 }, { "entropy": 5.802238464355469, "epoch": 3.601906243921416, "grad_norm": 1.3203125, "learning_rate": 0.0003738648352543224, "loss": 4.941, "mean_token_accuracy": 0.2142090082168579, "num_tokens": 80290268.0, "step": 46295 }, { "entropy": 5.795634078979492, "epoch": 3.6022952732931337, "grad_norm": 1.2421875, "learning_rate": 0.0003738399378172856, "loss": 4.9485, "mean_token_accuracy": 0.21083041429519653, "num_tokens": 80298919.0, "step": 46300 }, { "entropy": 5.865022754669189, "epoch": 3.6026843026648514, "grad_norm": 1.3046875, "learning_rate": 0.0003738150388805101, "loss": 4.9949, "mean_token_accuracy": 0.20796934962272645, "num_tokens": 80308117.0, "step": 46305 }, { "entropy": 5.798456859588623, "epoch": 3.6030733320365687, "grad_norm": 1.3671875, "learning_rate": 0.00037379013844437373, "loss": 4.9865, "mean_token_accuracy": 0.20827632993459702, "num_tokens": 80316840.0, "step": 46310 }, { "entropy": 5.773712587356568, "epoch": 3.6034623614082864, "grad_norm": 1.2890625, "learning_rate": 0.00037376523650925415, "loss": 4.8939, "mean_token_accuracy": 0.21725159585475923, "num_tokens": 80326044.0, "step": 46315 }, { "entropy": 5.85093936920166, "epoch": 3.603851390780004, "grad_norm": 1.5, "learning_rate": 0.0003737403330755293, "loss": 4.9431, "mean_token_accuracy": 0.2114242672920227, "num_tokens": 80334297.0, "step": 46320 }, { "entropy": 5.800226354598999, "epoch": 3.6042404201517213, "grad_norm": 1.3359375, "learning_rate": 0.0003737154281435771, "loss": 4.948, "mean_token_accuracy": 0.21550434976816177, "num_tokens": 80342522.0, "step": 46325 }, { "entropy": 5.851885747909546, "epoch": 3.604629449523439, "grad_norm": 1.2265625, "learning_rate": 0.00037369052171377535, "loss": 5.0198, "mean_token_accuracy": 0.20680880695581436, "num_tokens": 80351055.0, "step": 46330 }, { "entropy": 5.824049043655395, "epoch": 3.6050184788951567, "grad_norm": 1.34375, "learning_rate": 0.0003736656137865021, "loss": 4.9667, "mean_token_accuracy": 0.20577257722616196, "num_tokens": 80359627.0, "step": 46335 }, { "entropy": 5.834085464477539, "epoch": 3.6054075082668744, "grad_norm": 1.34375, "learning_rate": 0.00037364070436213514, "loss": 5.0417, "mean_token_accuracy": 0.20790010392665864, "num_tokens": 80368080.0, "step": 46340 }, { "entropy": 5.796619272232055, "epoch": 3.6057965376385916, "grad_norm": 1.3203125, "learning_rate": 0.0003736157934410525, "loss": 4.8881, "mean_token_accuracy": 0.21667036414146423, "num_tokens": 80376814.0, "step": 46345 }, { "entropy": 5.799203395843506, "epoch": 3.6061855670103093, "grad_norm": 1.3125, "learning_rate": 0.0003735908810236322, "loss": 4.9622, "mean_token_accuracy": 0.21499963998794555, "num_tokens": 80385364.0, "step": 46350 }, { "entropy": 5.858001613616944, "epoch": 3.6065745963820266, "grad_norm": 1.3828125, "learning_rate": 0.00037356596711025214, "loss": 4.942, "mean_token_accuracy": 0.22060759514570236, "num_tokens": 80393674.0, "step": 46355 }, { "entropy": 5.807489824295044, "epoch": 3.6069636257537443, "grad_norm": 1.328125, "learning_rate": 0.0003735410517012905, "loss": 4.9806, "mean_token_accuracy": 0.2114357218146324, "num_tokens": 80401981.0, "step": 46360 }, { "entropy": 5.815373516082763, "epoch": 3.607352655125462, "grad_norm": 1.2578125, "learning_rate": 0.0003735161347971252, "loss": 4.9669, "mean_token_accuracy": 0.2088131159543991, "num_tokens": 80410550.0, "step": 46365 }, { "entropy": 5.803451061248779, "epoch": 3.6077416844971797, "grad_norm": 1.2578125, "learning_rate": 0.0003734912163981344, "loss": 4.971, "mean_token_accuracy": 0.2117318630218506, "num_tokens": 80420310.0, "step": 46370 }, { "entropy": 5.751307582855224, "epoch": 3.608130713868897, "grad_norm": 1.390625, "learning_rate": 0.00037346629650469605, "loss": 4.9394, "mean_token_accuracy": 0.2171507865190506, "num_tokens": 80429167.0, "step": 46375 }, { "entropy": 5.761356496810913, "epoch": 3.6085197432406146, "grad_norm": 1.2734375, "learning_rate": 0.00037344137511718847, "loss": 4.8662, "mean_token_accuracy": 0.22101566940546036, "num_tokens": 80438162.0, "step": 46380 }, { "entropy": 5.79572114944458, "epoch": 3.6089087726123323, "grad_norm": 1.1640625, "learning_rate": 0.00037341645223598965, "loss": 5.0009, "mean_token_accuracy": 0.21836839765310287, "num_tokens": 80446989.0, "step": 46385 }, { "entropy": 5.850635433197022, "epoch": 3.6092978019840496, "grad_norm": 1.2890625, "learning_rate": 0.00037339152786147777, "loss": 5.0277, "mean_token_accuracy": 0.20172591656446456, "num_tokens": 80455696.0, "step": 46390 }, { "entropy": 5.877448177337646, "epoch": 3.6096868313557673, "grad_norm": 1.2734375, "learning_rate": 0.00037336660199403115, "loss": 5.078, "mean_token_accuracy": 0.20039277672767639, "num_tokens": 80465029.0, "step": 46395 }, { "entropy": 5.8939135551452635, "epoch": 3.610075860727485, "grad_norm": 1.3828125, "learning_rate": 0.0003733416746340279, "loss": 5.0112, "mean_token_accuracy": 0.20822895169258118, "num_tokens": 80472834.0, "step": 46400 }, { "entropy": 5.868376970291138, "epoch": 3.6104648900992027, "grad_norm": 1.28125, "learning_rate": 0.0003733167457818463, "loss": 4.9255, "mean_token_accuracy": 0.20927902460098266, "num_tokens": 80481689.0, "step": 46405 }, { "entropy": 5.805348539352417, "epoch": 3.61085391947092, "grad_norm": 1.5703125, "learning_rate": 0.0003732918154378645, "loss": 5.0352, "mean_token_accuracy": 0.20934872925281525, "num_tokens": 80489277.0, "step": 46410 }, { "entropy": 5.739417505264282, "epoch": 3.6112429488426376, "grad_norm": 1.34375, "learning_rate": 0.00037326688360246087, "loss": 4.9442, "mean_token_accuracy": 0.21779768764972687, "num_tokens": 80497567.0, "step": 46415 }, { "entropy": 5.853750371932984, "epoch": 3.6116319782143553, "grad_norm": 1.28125, "learning_rate": 0.0003732419502760137, "loss": 5.0575, "mean_token_accuracy": 0.20202081948518752, "num_tokens": 80506554.0, "step": 46420 }, { "entropy": 5.824303770065308, "epoch": 3.6120210075860726, "grad_norm": 1.390625, "learning_rate": 0.00037321701545890126, "loss": 4.9469, "mean_token_accuracy": 0.21327949613332747, "num_tokens": 80515648.0, "step": 46425 }, { "entropy": 5.817840099334717, "epoch": 3.6124100369577903, "grad_norm": 1.328125, "learning_rate": 0.0003731920791515019, "loss": 5.0002, "mean_token_accuracy": 0.21152896881103517, "num_tokens": 80524368.0, "step": 46430 }, { "entropy": 5.785492324829102, "epoch": 3.612799066329508, "grad_norm": 1.265625, "learning_rate": 0.0003731671413541942, "loss": 4.9137, "mean_token_accuracy": 0.20973817706108094, "num_tokens": 80533575.0, "step": 46435 }, { "entropy": 5.829719829559326, "epoch": 3.6131880957012257, "grad_norm": 1.375, "learning_rate": 0.00037314220206735626, "loss": 4.9167, "mean_token_accuracy": 0.2157852530479431, "num_tokens": 80542053.0, "step": 46440 }, { "entropy": 5.907398462295532, "epoch": 3.613577125072943, "grad_norm": 1.3046875, "learning_rate": 0.00037311726129136665, "loss": 5.0113, "mean_token_accuracy": 0.2099807843565941, "num_tokens": 80551903.0, "step": 46445 }, { "entropy": 5.789115142822266, "epoch": 3.6139661544446606, "grad_norm": 1.5859375, "learning_rate": 0.0003730923190266038, "loss": 4.995, "mean_token_accuracy": 0.20070070773363113, "num_tokens": 80559260.0, "step": 46450 }, { "entropy": 5.822090816497803, "epoch": 3.614355183816378, "grad_norm": 1.3125, "learning_rate": 0.000373067375273446, "loss": 5.009, "mean_token_accuracy": 0.21024216264486312, "num_tokens": 80568689.0, "step": 46455 }, { "entropy": 5.889535999298095, "epoch": 3.6147442131880956, "grad_norm": 1.3125, "learning_rate": 0.00037304243003227197, "loss": 4.9969, "mean_token_accuracy": 0.20356289595365523, "num_tokens": 80577073.0, "step": 46460 }, { "entropy": 5.75064263343811, "epoch": 3.6151332425598133, "grad_norm": 1.2421875, "learning_rate": 0.0003730174833034601, "loss": 4.8698, "mean_token_accuracy": 0.20909941345453262, "num_tokens": 80586595.0, "step": 46465 }, { "entropy": 5.7805322170257565, "epoch": 3.615522271931531, "grad_norm": 1.359375, "learning_rate": 0.00037299253508738894, "loss": 4.9343, "mean_token_accuracy": 0.21191421747207642, "num_tokens": 80595074.0, "step": 46470 }, { "entropy": 5.797471904754639, "epoch": 3.6159113013032487, "grad_norm": 1.4453125, "learning_rate": 0.00037296758538443703, "loss": 4.9843, "mean_token_accuracy": 0.20821471512317657, "num_tokens": 80603801.0, "step": 46475 }, { "entropy": 5.8747326850891115, "epoch": 3.616300330674966, "grad_norm": 1.28125, "learning_rate": 0.00037294263419498295, "loss": 5.0358, "mean_token_accuracy": 0.21293993592262267, "num_tokens": 80612993.0, "step": 46480 }, { "entropy": 5.807843399047852, "epoch": 3.6166893600466836, "grad_norm": 1.328125, "learning_rate": 0.0003729176815194053, "loss": 4.8943, "mean_token_accuracy": 0.21636506766080857, "num_tokens": 80621712.0, "step": 46485 }, { "entropy": 5.817419528961182, "epoch": 3.617078389418401, "grad_norm": 1.3046875, "learning_rate": 0.00037289272735808267, "loss": 4.9475, "mean_token_accuracy": 0.20836172997951508, "num_tokens": 80630657.0, "step": 46490 }, { "entropy": 5.802043008804321, "epoch": 3.6174674187901186, "grad_norm": 1.390625, "learning_rate": 0.0003728677717113936, "loss": 4.9871, "mean_token_accuracy": 0.20789008289575578, "num_tokens": 80638967.0, "step": 46495 }, { "entropy": 5.796524572372436, "epoch": 3.6178564481618363, "grad_norm": 1.3671875, "learning_rate": 0.00037284281457971707, "loss": 4.908, "mean_token_accuracy": 0.21127754598855972, "num_tokens": 80647791.0, "step": 46500 }, { "entropy": 5.800495433807373, "epoch": 3.618245477533554, "grad_norm": 1.3515625, "learning_rate": 0.0003728178559634315, "loss": 4.9017, "mean_token_accuracy": 0.21351045817136766, "num_tokens": 80656162.0, "step": 46505 }, { "entropy": 5.803506708145141, "epoch": 3.618634506905271, "grad_norm": 1.1640625, "learning_rate": 0.0003727928958629156, "loss": 4.9655, "mean_token_accuracy": 0.21070808470249175, "num_tokens": 80665203.0, "step": 46510 }, { "entropy": 5.803560066223144, "epoch": 3.619023536276989, "grad_norm": 1.2734375, "learning_rate": 0.00037276793427854817, "loss": 4.9674, "mean_token_accuracy": 0.2119758576154709, "num_tokens": 80673748.0, "step": 46515 }, { "entropy": 5.724172830581665, "epoch": 3.6194125656487066, "grad_norm": 1.25, "learning_rate": 0.00037274297121070796, "loss": 4.8885, "mean_token_accuracy": 0.21589030027389527, "num_tokens": 80682166.0, "step": 46520 }, { "entropy": 5.819769430160522, "epoch": 3.619801595020424, "grad_norm": 1.4140625, "learning_rate": 0.0003727180066597737, "loss": 4.9304, "mean_token_accuracy": 0.21635802686214448, "num_tokens": 80689972.0, "step": 46525 }, { "entropy": 5.789985418319702, "epoch": 3.6201906243921416, "grad_norm": 1.421875, "learning_rate": 0.0003726930406261243, "loss": 4.9447, "mean_token_accuracy": 0.21050937622785568, "num_tokens": 80698193.0, "step": 46530 }, { "entropy": 5.856343507766724, "epoch": 3.6205796537638593, "grad_norm": 1.1796875, "learning_rate": 0.0003726680731101385, "loss": 5.0146, "mean_token_accuracy": 0.20265797525644302, "num_tokens": 80707464.0, "step": 46535 }, { "entropy": 5.849766540527344, "epoch": 3.620968683135577, "grad_norm": 1.3671875, "learning_rate": 0.0003726431041121951, "loss": 4.916, "mean_token_accuracy": 0.21612605601549148, "num_tokens": 80715185.0, "step": 46540 }, { "entropy": 5.8201511859893795, "epoch": 3.621357712507294, "grad_norm": 1.3984375, "learning_rate": 0.000372618133632673, "loss": 4.9524, "mean_token_accuracy": 0.20866552442312242, "num_tokens": 80723499.0, "step": 46545 }, { "entropy": 5.833727598190308, "epoch": 3.621746741879012, "grad_norm": 1.296875, "learning_rate": 0.0003725931616719511, "loss": 4.925, "mean_token_accuracy": 0.21464037150144577, "num_tokens": 80732539.0, "step": 46550 }, { "entropy": 5.901302671432495, "epoch": 3.622135771250729, "grad_norm": 1.3203125, "learning_rate": 0.0003725681882304084, "loss": 5.0165, "mean_token_accuracy": 0.2026000887155533, "num_tokens": 80742332.0, "step": 46555 }, { "entropy": 5.810824680328369, "epoch": 3.622524800622447, "grad_norm": 1.40625, "learning_rate": 0.0003725432133084237, "loss": 4.8976, "mean_token_accuracy": 0.22287297546863555, "num_tokens": 80750553.0, "step": 46560 }, { "entropy": 5.840832614898682, "epoch": 3.6229138299941646, "grad_norm": 1.34375, "learning_rate": 0.0003725182369063759, "loss": 4.9558, "mean_token_accuracy": 0.2105289950966835, "num_tokens": 80758721.0, "step": 46565 }, { "entropy": 5.772528457641601, "epoch": 3.6233028593658823, "grad_norm": 1.2890625, "learning_rate": 0.0003724932590246441, "loss": 4.9656, "mean_token_accuracy": 0.21393235325813292, "num_tokens": 80768242.0, "step": 46570 }, { "entropy": 5.757945537567139, "epoch": 3.6236918887376, "grad_norm": 1.3203125, "learning_rate": 0.0003724682796636073, "loss": 4.8697, "mean_token_accuracy": 0.21552812308073044, "num_tokens": 80776494.0, "step": 46575 }, { "entropy": 5.8064111232757565, "epoch": 3.624080918109317, "grad_norm": 1.3359375, "learning_rate": 0.0003724432988236445, "loss": 4.8924, "mean_token_accuracy": 0.21549661457538605, "num_tokens": 80785198.0, "step": 46580 }, { "entropy": 5.863719654083252, "epoch": 3.624469947481035, "grad_norm": 1.2734375, "learning_rate": 0.0003724183165051347, "loss": 5.0082, "mean_token_accuracy": 0.21088185012340546, "num_tokens": 80794126.0, "step": 46585 }, { "entropy": 5.790993642807007, "epoch": 3.624858976852752, "grad_norm": 1.359375, "learning_rate": 0.00037239333270845714, "loss": 4.8627, "mean_token_accuracy": 0.21950643658638, "num_tokens": 80802199.0, "step": 46590 }, { "entropy": 5.763846063613892, "epoch": 3.62524800622447, "grad_norm": 1.3515625, "learning_rate": 0.0003723683474339907, "loss": 4.9084, "mean_token_accuracy": 0.22020368576049804, "num_tokens": 80810537.0, "step": 46595 }, { "entropy": 5.749160671234131, "epoch": 3.6256370355961876, "grad_norm": 1.421875, "learning_rate": 0.0003723433606821145, "loss": 4.9421, "mean_token_accuracy": 0.21394397765398027, "num_tokens": 80818661.0, "step": 46600 }, { "entropy": 5.7506492137908936, "epoch": 3.6260260649679052, "grad_norm": 1.2890625, "learning_rate": 0.00037231837245320777, "loss": 4.8481, "mean_token_accuracy": 0.2248615175485611, "num_tokens": 80827883.0, "step": 46605 }, { "entropy": 5.846414470672608, "epoch": 3.6264150943396225, "grad_norm": 1.421875, "learning_rate": 0.00037229338274764965, "loss": 4.9885, "mean_token_accuracy": 0.21068548858165742, "num_tokens": 80836692.0, "step": 46610 }, { "entropy": 5.8768562316894535, "epoch": 3.62680412371134, "grad_norm": 1.296875, "learning_rate": 0.0003722683915658193, "loss": 4.9782, "mean_token_accuracy": 0.21444524973630905, "num_tokens": 80845342.0, "step": 46615 }, { "entropy": 5.763777351379394, "epoch": 3.627193153083058, "grad_norm": 1.3125, "learning_rate": 0.00037224339890809587, "loss": 4.8484, "mean_token_accuracy": 0.21998632997274398, "num_tokens": 80854393.0, "step": 46620 }, { "entropy": 5.81789002418518, "epoch": 3.627582182454775, "grad_norm": 1.453125, "learning_rate": 0.0003722184047748587, "loss": 4.9006, "mean_token_accuracy": 0.2196972906589508, "num_tokens": 80862712.0, "step": 46625 }, { "entropy": 5.823266124725341, "epoch": 3.627971211826493, "grad_norm": 1.2421875, "learning_rate": 0.00037219340916648703, "loss": 5.003, "mean_token_accuracy": 0.20563409030437468, "num_tokens": 80872455.0, "step": 46630 }, { "entropy": 5.8235132694244385, "epoch": 3.6283602411982105, "grad_norm": 1.2578125, "learning_rate": 0.00037216841208336, "loss": 4.9315, "mean_token_accuracy": 0.2150523245334625, "num_tokens": 80881305.0, "step": 46635 }, { "entropy": 5.82282247543335, "epoch": 3.6287492705699282, "grad_norm": 1.484375, "learning_rate": 0.00037214341352585697, "loss": 4.9528, "mean_token_accuracy": 0.21229819506406783, "num_tokens": 80890242.0, "step": 46640 }, { "entropy": 5.833400583267212, "epoch": 3.6291382999416455, "grad_norm": 1.3671875, "learning_rate": 0.0003721184134943573, "loss": 5.041, "mean_token_accuracy": 0.20865330547094346, "num_tokens": 80899707.0, "step": 46645 }, { "entropy": 5.772737121582031, "epoch": 3.629527329313363, "grad_norm": 1.234375, "learning_rate": 0.00037209341198924024, "loss": 4.924, "mean_token_accuracy": 0.2163231685757637, "num_tokens": 80908543.0, "step": 46650 }, { "entropy": 5.813386392593384, "epoch": 3.6299163586850804, "grad_norm": 1.2890625, "learning_rate": 0.0003720684090108852, "loss": 5.0276, "mean_token_accuracy": 0.20545201748609543, "num_tokens": 80916916.0, "step": 46655 }, { "entropy": 5.861525201797486, "epoch": 3.630305388056798, "grad_norm": 1.2734375, "learning_rate": 0.0003720434045596716, "loss": 5.0716, "mean_token_accuracy": 0.1964467614889145, "num_tokens": 80925782.0, "step": 46660 }, { "entropy": 5.795410680770874, "epoch": 3.630694417428516, "grad_norm": 1.328125, "learning_rate": 0.0003720183986359788, "loss": 4.868, "mean_token_accuracy": 0.22127754241228104, "num_tokens": 80933902.0, "step": 46665 }, { "entropy": 5.795500993728638, "epoch": 3.6310834468002335, "grad_norm": 1.3515625, "learning_rate": 0.0003719933912401862, "loss": 5.0006, "mean_token_accuracy": 0.20408552438020705, "num_tokens": 80941993.0, "step": 46670 }, { "entropy": 5.755295515060425, "epoch": 3.6314724761719512, "grad_norm": 1.3828125, "learning_rate": 0.0003719683823726732, "loss": 4.8723, "mean_token_accuracy": 0.21965465545654297, "num_tokens": 80950038.0, "step": 46675 }, { "entropy": 5.818025541305542, "epoch": 3.6318615055436685, "grad_norm": 1.34375, "learning_rate": 0.00037194337203381945, "loss": 4.989, "mean_token_accuracy": 0.2064434841275215, "num_tokens": 80958684.0, "step": 46680 }, { "entropy": 5.816812372207641, "epoch": 3.632250534915386, "grad_norm": 1.15625, "learning_rate": 0.00037191836022400427, "loss": 4.9626, "mean_token_accuracy": 0.20740386247634887, "num_tokens": 80967302.0, "step": 46685 }, { "entropy": 5.804745292663574, "epoch": 3.6326395642871034, "grad_norm": 1.328125, "learning_rate": 0.00037189334694360724, "loss": 4.9643, "mean_token_accuracy": 0.2148457035422325, "num_tokens": 80975691.0, "step": 46690 }, { "entropy": 5.756566286087036, "epoch": 3.633028593658821, "grad_norm": 1.3671875, "learning_rate": 0.0003718683321930079, "loss": 4.9404, "mean_token_accuracy": 0.2111236110329628, "num_tokens": 80984282.0, "step": 46695 }, { "entropy": 5.8830485343933105, "epoch": 3.633417623030539, "grad_norm": 1.28125, "learning_rate": 0.0003718433159725857, "loss": 4.9796, "mean_token_accuracy": 0.2137926697731018, "num_tokens": 80992991.0, "step": 46700 }, { "entropy": 5.846312713623047, "epoch": 3.6338066524022565, "grad_norm": 1.3671875, "learning_rate": 0.0003718182982827205, "loss": 4.9758, "mean_token_accuracy": 0.20729643553495408, "num_tokens": 81001263.0, "step": 46705 }, { "entropy": 5.725493955612182, "epoch": 3.634195681773974, "grad_norm": 1.3984375, "learning_rate": 0.00037179327912379166, "loss": 4.9305, "mean_token_accuracy": 0.21606611907482148, "num_tokens": 81010680.0, "step": 46710 }, { "entropy": 5.760056114196777, "epoch": 3.6345847111456915, "grad_norm": 1.265625, "learning_rate": 0.00037176825849617886, "loss": 4.8993, "mean_token_accuracy": 0.21432507187128066, "num_tokens": 81019359.0, "step": 46715 }, { "entropy": 5.8788745403289795, "epoch": 3.634973740517409, "grad_norm": 1.3046875, "learning_rate": 0.00037174323640026173, "loss": 5.0655, "mean_token_accuracy": 0.20568467825651168, "num_tokens": 81028808.0, "step": 46720 }, { "entropy": 5.841791296005249, "epoch": 3.6353627698891264, "grad_norm": 1.375, "learning_rate": 0.00037171821283642003, "loss": 4.9554, "mean_token_accuracy": 0.2070627436041832, "num_tokens": 81037778.0, "step": 46725 }, { "entropy": 5.859305810928345, "epoch": 3.635751799260844, "grad_norm": 1.34375, "learning_rate": 0.0003716931878050334, "loss": 4.9789, "mean_token_accuracy": 0.20930605083703996, "num_tokens": 81047657.0, "step": 46730 }, { "entropy": 5.780514574050903, "epoch": 3.636140828632562, "grad_norm": 1.359375, "learning_rate": 0.00037166816130648143, "loss": 4.8703, "mean_token_accuracy": 0.219192536175251, "num_tokens": 81056585.0, "step": 46735 }, { "entropy": 5.819532680511474, "epoch": 3.6365298580042795, "grad_norm": 1.34375, "learning_rate": 0.00037164313334114407, "loss": 5.0006, "mean_token_accuracy": 0.20779954195022582, "num_tokens": 81064463.0, "step": 46740 }, { "entropy": 5.789015388488769, "epoch": 3.636918887375997, "grad_norm": 1.3203125, "learning_rate": 0.000371618103909401, "loss": 5.0259, "mean_token_accuracy": 0.216275155544281, "num_tokens": 81073210.0, "step": 46745 }, { "entropy": 5.874293279647827, "epoch": 3.6373079167477145, "grad_norm": 1.390625, "learning_rate": 0.000371593073011632, "loss": 5.0603, "mean_token_accuracy": 0.21092771738767624, "num_tokens": 81081991.0, "step": 46750 }, { "entropy": 5.881285810470581, "epoch": 3.637696946119432, "grad_norm": 1.28125, "learning_rate": 0.00037156804064821674, "loss": 5.0233, "mean_token_accuracy": 0.2053128808736801, "num_tokens": 81090592.0, "step": 46755 }, { "entropy": 5.831904125213623, "epoch": 3.6380859754911494, "grad_norm": 1.265625, "learning_rate": 0.00037154300681953523, "loss": 4.9803, "mean_token_accuracy": 0.20708314329385757, "num_tokens": 81099278.0, "step": 46760 }, { "entropy": 5.834961414337158, "epoch": 3.638475004862867, "grad_norm": 1.3671875, "learning_rate": 0.0003715179715259673, "loss": 4.9399, "mean_token_accuracy": 0.2138035073876381, "num_tokens": 81108106.0, "step": 46765 }, { "entropy": 5.8275816440582275, "epoch": 3.638864034234585, "grad_norm": 1.28125, "learning_rate": 0.00037149293476789277, "loss": 4.8872, "mean_token_accuracy": 0.21286243200302124, "num_tokens": 81116679.0, "step": 46770 }, { "entropy": 5.8674964427948, "epoch": 3.6392530636063025, "grad_norm": 1.3203125, "learning_rate": 0.0003714678965456915, "loss": 4.9923, "mean_token_accuracy": 0.2081873133778572, "num_tokens": 81125308.0, "step": 46775 }, { "entropy": 5.859664630889893, "epoch": 3.6396420929780198, "grad_norm": 1.2890625, "learning_rate": 0.00037144285685974346, "loss": 5.0361, "mean_token_accuracy": 0.21042260080575942, "num_tokens": 81134092.0, "step": 46780 }, { "entropy": 5.8759765625, "epoch": 3.6400311223497375, "grad_norm": 1.40625, "learning_rate": 0.00037141781571042854, "loss": 4.9776, "mean_token_accuracy": 0.20714008659124375, "num_tokens": 81142413.0, "step": 46785 }, { "entropy": 5.817232275009156, "epoch": 3.6404201517214547, "grad_norm": 1.3046875, "learning_rate": 0.00037139277309812676, "loss": 4.978, "mean_token_accuracy": 0.20909200310707093, "num_tokens": 81150952.0, "step": 46790 }, { "entropy": 5.849147844314575, "epoch": 3.6408091810931724, "grad_norm": 1.3359375, "learning_rate": 0.0003713677290232181, "loss": 5.0501, "mean_token_accuracy": 0.20562629252672196, "num_tokens": 81161118.0, "step": 46795 }, { "entropy": 5.853687572479248, "epoch": 3.64119821046489, "grad_norm": 1.1875, "learning_rate": 0.00037134268348608255, "loss": 4.9525, "mean_token_accuracy": 0.20606496930122375, "num_tokens": 81169682.0, "step": 46800 }, { "entropy": 5.890073823928833, "epoch": 3.641587239836608, "grad_norm": 1.4453125, "learning_rate": 0.00037131763648710003, "loss": 4.9515, "mean_token_accuracy": 0.2079431712627411, "num_tokens": 81177892.0, "step": 46805 }, { "entropy": 5.805603551864624, "epoch": 3.641976269208325, "grad_norm": 1.3671875, "learning_rate": 0.00037129258802665076, "loss": 4.9847, "mean_token_accuracy": 0.20778605490922927, "num_tokens": 81186612.0, "step": 46810 }, { "entropy": 5.761269235610962, "epoch": 3.6423652985800428, "grad_norm": 1.34375, "learning_rate": 0.0003712675381051147, "loss": 4.9351, "mean_token_accuracy": 0.2093772456049919, "num_tokens": 81195518.0, "step": 46815 }, { "entropy": 5.9208207607269285, "epoch": 3.6427543279517605, "grad_norm": 1.2734375, "learning_rate": 0.000371242486722872, "loss": 5.0904, "mean_token_accuracy": 0.20341528654098512, "num_tokens": 81205105.0, "step": 46820 }, { "entropy": 5.89553656578064, "epoch": 3.6431433573234777, "grad_norm": 1.4453125, "learning_rate": 0.0003712174338803027, "loss": 4.9964, "mean_token_accuracy": 0.20113538354635238, "num_tokens": 81213629.0, "step": 46825 }, { "entropy": 5.826036787033081, "epoch": 3.6435323866951954, "grad_norm": 1.265625, "learning_rate": 0.000371192379577787, "loss": 4.9343, "mean_token_accuracy": 0.2120796963572502, "num_tokens": 81222387.0, "step": 46830 }, { "entropy": 5.688348007202149, "epoch": 3.643921416066913, "grad_norm": 1.3203125, "learning_rate": 0.0003711673238157051, "loss": 4.8508, "mean_token_accuracy": 0.22278325706720353, "num_tokens": 81231280.0, "step": 46835 }, { "entropy": 5.885958671569824, "epoch": 3.644310445438631, "grad_norm": 1.296875, "learning_rate": 0.00037114226659443704, "loss": 5.0046, "mean_token_accuracy": 0.20508218854665755, "num_tokens": 81239681.0, "step": 46840 }, { "entropy": 5.8098838329315186, "epoch": 3.644699474810348, "grad_norm": 1.484375, "learning_rate": 0.0003711172079143632, "loss": 5.0095, "mean_token_accuracy": 0.20313764959573746, "num_tokens": 81247909.0, "step": 46845 }, { "entropy": 5.78845739364624, "epoch": 3.6450885041820658, "grad_norm": 1.3046875, "learning_rate": 0.0003710921477758637, "loss": 4.9584, "mean_token_accuracy": 0.20404239743947983, "num_tokens": 81256507.0, "step": 46850 }, { "entropy": 5.873905324935913, "epoch": 3.6454775335537835, "grad_norm": 1.3203125, "learning_rate": 0.0003710670861793187, "loss": 5.1064, "mean_token_accuracy": 0.19829417318105697, "num_tokens": 81265301.0, "step": 46855 }, { "entropy": 5.831180620193481, "epoch": 3.6458665629255007, "grad_norm": 1.3984375, "learning_rate": 0.0003710420231251087, "loss": 4.9111, "mean_token_accuracy": 0.2166355296969414, "num_tokens": 81273968.0, "step": 46860 }, { "entropy": 5.824178028106689, "epoch": 3.6462555922972184, "grad_norm": 1.3359375, "learning_rate": 0.00037101695861361384, "loss": 4.9735, "mean_token_accuracy": 0.20441364645957946, "num_tokens": 81283511.0, "step": 46865 }, { "entropy": 5.8123797416687015, "epoch": 3.646644621668936, "grad_norm": 1.390625, "learning_rate": 0.00037099189264521446, "loss": 4.9627, "mean_token_accuracy": 0.2131512865424156, "num_tokens": 81292399.0, "step": 46870 }, { "entropy": 5.805195426940918, "epoch": 3.647033651040654, "grad_norm": 1.34375, "learning_rate": 0.0003709668252202909, "loss": 4.9935, "mean_token_accuracy": 0.2073059633374214, "num_tokens": 81300670.0, "step": 46875 }, { "entropy": 5.811530828475952, "epoch": 3.647422680412371, "grad_norm": 1.2578125, "learning_rate": 0.0003709417563392235, "loss": 4.9098, "mean_token_accuracy": 0.21723368912935256, "num_tokens": 81309419.0, "step": 46880 }, { "entropy": 5.843935155868531, "epoch": 3.6478117097840888, "grad_norm": 1.34375, "learning_rate": 0.0003709166860023926, "loss": 4.949, "mean_token_accuracy": 0.21793752014636994, "num_tokens": 81318349.0, "step": 46885 }, { "entropy": 5.825171709060669, "epoch": 3.648200739155806, "grad_norm": 1.2890625, "learning_rate": 0.00037089161421017874, "loss": 4.9849, "mean_token_accuracy": 0.2123220756649971, "num_tokens": 81326715.0, "step": 46890 }, { "entropy": 5.758674573898316, "epoch": 3.6485897685275237, "grad_norm": 1.2890625, "learning_rate": 0.00037086654096296217, "loss": 4.8753, "mean_token_accuracy": 0.2228206381201744, "num_tokens": 81335113.0, "step": 46895 }, { "entropy": 5.875659322738647, "epoch": 3.6489787978992414, "grad_norm": 1.328125, "learning_rate": 0.0003708414662611235, "loss": 5.0604, "mean_token_accuracy": 0.20381829589605333, "num_tokens": 81343928.0, "step": 46900 }, { "entropy": 5.792323350906372, "epoch": 3.649367827270959, "grad_norm": 1.375, "learning_rate": 0.0003708163901050432, "loss": 4.9102, "mean_token_accuracy": 0.2148539677262306, "num_tokens": 81352244.0, "step": 46905 }, { "entropy": 5.838660764694214, "epoch": 3.649756856642677, "grad_norm": 1.328125, "learning_rate": 0.00037079131249510155, "loss": 4.9697, "mean_token_accuracy": 0.2188696339726448, "num_tokens": 81361769.0, "step": 46910 }, { "entropy": 5.808640670776367, "epoch": 3.650145886014394, "grad_norm": 1.265625, "learning_rate": 0.0003707662334316793, "loss": 4.9357, "mean_token_accuracy": 0.21560855209827423, "num_tokens": 81369936.0, "step": 46915 }, { "entropy": 5.801117563247681, "epoch": 3.6505349153861117, "grad_norm": 1.234375, "learning_rate": 0.0003707411529151568, "loss": 4.9634, "mean_token_accuracy": 0.215226049721241, "num_tokens": 81379846.0, "step": 46920 }, { "entropy": 5.821448850631714, "epoch": 3.650923944757829, "grad_norm": 1.2890625, "learning_rate": 0.0003707160709459147, "loss": 4.9173, "mean_token_accuracy": 0.21039929240942, "num_tokens": 81388123.0, "step": 46925 }, { "entropy": 5.851422357559204, "epoch": 3.6513129741295467, "grad_norm": 1.3046875, "learning_rate": 0.0003706909875243336, "loss": 5.0399, "mean_token_accuracy": 0.2057182341814041, "num_tokens": 81397000.0, "step": 46930 }, { "entropy": 5.794372081756592, "epoch": 3.6517020035012644, "grad_norm": 1.2578125, "learning_rate": 0.000370665902650794, "loss": 5.0167, "mean_token_accuracy": 0.20640835613012315, "num_tokens": 81406218.0, "step": 46935 }, { "entropy": 5.816958475112915, "epoch": 3.652091032872982, "grad_norm": 1.328125, "learning_rate": 0.00037064081632567675, "loss": 4.8981, "mean_token_accuracy": 0.21442000865936278, "num_tokens": 81414934.0, "step": 46940 }, { "entropy": 5.774311113357544, "epoch": 3.6524800622446993, "grad_norm": 1.5390625, "learning_rate": 0.00037061572854936225, "loss": 4.8713, "mean_token_accuracy": 0.21803686767816544, "num_tokens": 81423345.0, "step": 46945 }, { "entropy": 5.8007166385650635, "epoch": 3.652869091616417, "grad_norm": 1.28125, "learning_rate": 0.0003705906393222313, "loss": 4.9182, "mean_token_accuracy": 0.21351613402366637, "num_tokens": 81431858.0, "step": 46950 }, { "entropy": 5.858050584793091, "epoch": 3.6532581209881347, "grad_norm": 1.3125, "learning_rate": 0.0003705655486446645, "loss": 5.0366, "mean_token_accuracy": 0.20146039724349976, "num_tokens": 81440538.0, "step": 46955 }, { "entropy": 5.902192687988281, "epoch": 3.653647150359852, "grad_norm": 1.3671875, "learning_rate": 0.0003705404565170426, "loss": 5.0168, "mean_token_accuracy": 0.211723592877388, "num_tokens": 81449187.0, "step": 46960 }, { "entropy": 5.80115385055542, "epoch": 3.6540361797315697, "grad_norm": 1.265625, "learning_rate": 0.0003705153629397463, "loss": 4.8442, "mean_token_accuracy": 0.21835906207561492, "num_tokens": 81456708.0, "step": 46965 }, { "entropy": 5.805408954620361, "epoch": 3.6544252091032874, "grad_norm": 1.4609375, "learning_rate": 0.00037049026791315646, "loss": 4.9994, "mean_token_accuracy": 0.20592961609363555, "num_tokens": 81464933.0, "step": 46970 }, { "entropy": 5.764092922210693, "epoch": 3.654814238475005, "grad_norm": 1.3515625, "learning_rate": 0.0003704651714376538, "loss": 5.0262, "mean_token_accuracy": 0.20510525852441788, "num_tokens": 81473846.0, "step": 46975 }, { "entropy": 5.8059159278869625, "epoch": 3.6552032678467223, "grad_norm": 1.3359375, "learning_rate": 0.0003704400735136191, "loss": 4.8696, "mean_token_accuracy": 0.21873140037059785, "num_tokens": 81481928.0, "step": 46980 }, { "entropy": 5.893004274368286, "epoch": 3.65559229721844, "grad_norm": 1.3671875, "learning_rate": 0.0003704149741414332, "loss": 5.0805, "mean_token_accuracy": 0.19880757629871368, "num_tokens": 81490913.0, "step": 46985 }, { "entropy": 5.8749024868011475, "epoch": 3.6559813265901573, "grad_norm": 1.328125, "learning_rate": 0.0003703898733214769, "loss": 5.0508, "mean_token_accuracy": 0.20902542918920516, "num_tokens": 81499779.0, "step": 46990 }, { "entropy": 5.732605695724487, "epoch": 3.656370355961875, "grad_norm": 1.3125, "learning_rate": 0.0003703647710541311, "loss": 4.9338, "mean_token_accuracy": 0.21206137388944626, "num_tokens": 81507707.0, "step": 46995 }, { "entropy": 5.76782488822937, "epoch": 3.6567593853335927, "grad_norm": 1.25, "learning_rate": 0.0003703396673397768, "loss": 4.9517, "mean_token_accuracy": 0.21163619607686995, "num_tokens": 81516418.0, "step": 47000 }, { "entropy": 5.818586540222168, "epoch": 3.6571484147053104, "grad_norm": 1.359375, "learning_rate": 0.0003703145621787947, "loss": 4.9305, "mean_token_accuracy": 0.20813508629798888, "num_tokens": 81525218.0, "step": 47005 }, { "entropy": 5.748411369323731, "epoch": 3.657537444077028, "grad_norm": 1.375, "learning_rate": 0.00037028945557156587, "loss": 4.8569, "mean_token_accuracy": 0.22006888389587403, "num_tokens": 81533739.0, "step": 47010 }, { "entropy": 5.7363732814788815, "epoch": 3.6579264734487453, "grad_norm": 1.2890625, "learning_rate": 0.00037026434751847117, "loss": 4.9047, "mean_token_accuracy": 0.21972505301237105, "num_tokens": 81541967.0, "step": 47015 }, { "entropy": 5.81269006729126, "epoch": 3.658315502820463, "grad_norm": 1.3125, "learning_rate": 0.00037023923801989163, "loss": 4.9654, "mean_token_accuracy": 0.20722466558218003, "num_tokens": 81549892.0, "step": 47020 }, { "entropy": 5.782472562789917, "epoch": 3.6587045321921803, "grad_norm": 1.34375, "learning_rate": 0.0003702141270762083, "loss": 4.9245, "mean_token_accuracy": 0.2093484491109848, "num_tokens": 81558441.0, "step": 47025 }, { "entropy": 5.825891637802124, "epoch": 3.659093561563898, "grad_norm": 1.4765625, "learning_rate": 0.00037018901468780207, "loss": 5.0479, "mean_token_accuracy": 0.20791179537773133, "num_tokens": 81566753.0, "step": 47030 }, { "entropy": 5.8790144443511965, "epoch": 3.6594825909356157, "grad_norm": 1.2734375, "learning_rate": 0.0003701639008550541, "loss": 5.0791, "mean_token_accuracy": 0.2068282723426819, "num_tokens": 81575038.0, "step": 47035 }, { "entropy": 5.803509712219238, "epoch": 3.6598716203073334, "grad_norm": 1.40625, "learning_rate": 0.0003701387855783454, "loss": 4.9465, "mean_token_accuracy": 0.20965567827224732, "num_tokens": 81584016.0, "step": 47040 }, { "entropy": 5.893966245651245, "epoch": 3.6602606496790506, "grad_norm": 1.484375, "learning_rate": 0.000370113668858057, "loss": 4.9758, "mean_token_accuracy": 0.2098271980881691, "num_tokens": 81592757.0, "step": 47045 }, { "entropy": 5.8126819133758545, "epoch": 3.6606496790507683, "grad_norm": 1.359375, "learning_rate": 0.0003700885506945701, "loss": 4.9529, "mean_token_accuracy": 0.21439823508262634, "num_tokens": 81601225.0, "step": 47050 }, { "entropy": 5.79023585319519, "epoch": 3.661038708422486, "grad_norm": 1.28125, "learning_rate": 0.0003700634310882658, "loss": 5.0478, "mean_token_accuracy": 0.1938581332564354, "num_tokens": 81610043.0, "step": 47055 }, { "entropy": 5.819880199432373, "epoch": 3.6614277377942033, "grad_norm": 1.4609375, "learning_rate": 0.00037003831003952525, "loss": 4.9622, "mean_token_accuracy": 0.2178829789161682, "num_tokens": 81618540.0, "step": 47060 }, { "entropy": 5.8108163356781, "epoch": 3.661816767165921, "grad_norm": 1.3203125, "learning_rate": 0.00037001318754872957, "loss": 4.911, "mean_token_accuracy": 0.22179618626832961, "num_tokens": 81626682.0, "step": 47065 }, { "entropy": 5.750548934936523, "epoch": 3.6622057965376387, "grad_norm": 1.3359375, "learning_rate": 0.00036998806361626, "loss": 4.9648, "mean_token_accuracy": 0.2143717586994171, "num_tokens": 81635917.0, "step": 47070 }, { "entropy": 5.74328384399414, "epoch": 3.6625948259093564, "grad_norm": 1.421875, "learning_rate": 0.0003699629382424979, "loss": 4.9083, "mean_token_accuracy": 0.21440012007951736, "num_tokens": 81644306.0, "step": 47075 }, { "entropy": 5.811463689804077, "epoch": 3.6629838552810736, "grad_norm": 1.296875, "learning_rate": 0.00036993781142782416, "loss": 4.9996, "mean_token_accuracy": 0.20556284338235856, "num_tokens": 81653207.0, "step": 47080 }, { "entropy": 5.861973476409912, "epoch": 3.6633728846527913, "grad_norm": 1.375, "learning_rate": 0.00036991268317262033, "loss": 4.9779, "mean_token_accuracy": 0.20943484157323838, "num_tokens": 81661126.0, "step": 47085 }, { "entropy": 5.735807085037232, "epoch": 3.663761914024509, "grad_norm": 1.25, "learning_rate": 0.00036988755347726766, "loss": 4.9257, "mean_token_accuracy": 0.2191702276468277, "num_tokens": 81670721.0, "step": 47090 }, { "entropy": 5.774377155303955, "epoch": 3.6641509433962263, "grad_norm": 1.3125, "learning_rate": 0.00036986242234214736, "loss": 5.043, "mean_token_accuracy": 0.20058402121067048, "num_tokens": 81680281.0, "step": 47095 }, { "entropy": 5.822811889648437, "epoch": 3.664539972767944, "grad_norm": 1.234375, "learning_rate": 0.00036983728976764074, "loss": 4.9287, "mean_token_accuracy": 0.21278013437986373, "num_tokens": 81688727.0, "step": 47100 }, { "entropy": 5.75852599143982, "epoch": 3.6649290021396617, "grad_norm": 1.296875, "learning_rate": 0.00036981215575412923, "loss": 4.927, "mean_token_accuracy": 0.2163841336965561, "num_tokens": 81697903.0, "step": 47105 }, { "entropy": 5.778700542449951, "epoch": 3.6653180315113794, "grad_norm": 1.3125, "learning_rate": 0.0003697870203019942, "loss": 4.9511, "mean_token_accuracy": 0.20830605626106263, "num_tokens": 81705712.0, "step": 47110 }, { "entropy": 5.825113248825073, "epoch": 3.6657070608830966, "grad_norm": 1.265625, "learning_rate": 0.00036976188341161694, "loss": 4.996, "mean_token_accuracy": 0.209597909450531, "num_tokens": 81714787.0, "step": 47115 }, { "entropy": 5.7993861675262455, "epoch": 3.6660960902548143, "grad_norm": 1.3203125, "learning_rate": 0.0003697367450833789, "loss": 4.9379, "mean_token_accuracy": 0.20970459133386612, "num_tokens": 81723891.0, "step": 47120 }, { "entropy": 5.778061628341675, "epoch": 3.6664851196265316, "grad_norm": 1.359375, "learning_rate": 0.00036971160531766155, "loss": 4.883, "mean_token_accuracy": 0.21609626412391664, "num_tokens": 81733054.0, "step": 47125 }, { "entropy": 5.827311706542969, "epoch": 3.6668741489982493, "grad_norm": 1.3203125, "learning_rate": 0.0003696864641148465, "loss": 4.9289, "mean_token_accuracy": 0.21961547285318375, "num_tokens": 81742065.0, "step": 47130 }, { "entropy": 5.809996700286865, "epoch": 3.667263178369967, "grad_norm": 1.28125, "learning_rate": 0.00036966132147531487, "loss": 4.9219, "mean_token_accuracy": 0.2187623292207718, "num_tokens": 81751011.0, "step": 47135 }, { "entropy": 5.869502449035645, "epoch": 3.6676522077416847, "grad_norm": 1.4296875, "learning_rate": 0.00036963617739944844, "loss": 5.0188, "mean_token_accuracy": 0.2142251878976822, "num_tokens": 81759864.0, "step": 47140 }, { "entropy": 5.846101856231689, "epoch": 3.668041237113402, "grad_norm": 1.3046875, "learning_rate": 0.00036961103188762866, "loss": 4.988, "mean_token_accuracy": 0.20328790992498397, "num_tokens": 81769420.0, "step": 47145 }, { "entropy": 5.771042203903198, "epoch": 3.6684302664851196, "grad_norm": 1.4140625, "learning_rate": 0.00036958588494023705, "loss": 4.8985, "mean_token_accuracy": 0.2125188395380974, "num_tokens": 81777544.0, "step": 47150 }, { "entropy": 5.79100604057312, "epoch": 3.6688192958568373, "grad_norm": 1.2421875, "learning_rate": 0.0003695607365576551, "loss": 4.8893, "mean_token_accuracy": 0.21941000521183013, "num_tokens": 81785418.0, "step": 47155 }, { "entropy": 5.777273225784302, "epoch": 3.6692083252285546, "grad_norm": 1.1875, "learning_rate": 0.0003695355867402646, "loss": 4.9798, "mean_token_accuracy": 0.2145521745085716, "num_tokens": 81794584.0, "step": 47160 }, { "entropy": 5.79203052520752, "epoch": 3.6695973546002723, "grad_norm": 1.2578125, "learning_rate": 0.000369510435488447, "loss": 4.9167, "mean_token_accuracy": 0.21620291471481323, "num_tokens": 81802950.0, "step": 47165 }, { "entropy": 5.8003040790557865, "epoch": 3.66998638397199, "grad_norm": 1.265625, "learning_rate": 0.000369485282802584, "loss": 4.8874, "mean_token_accuracy": 0.21468549966812134, "num_tokens": 81812092.0, "step": 47170 }, { "entropy": 5.879659652709961, "epoch": 3.6703754133437076, "grad_norm": 1.2421875, "learning_rate": 0.00036946012868305716, "loss": 5.0215, "mean_token_accuracy": 0.2095838561654091, "num_tokens": 81821437.0, "step": 47175 }, { "entropy": 5.857674503326416, "epoch": 3.670764442715425, "grad_norm": 1.296875, "learning_rate": 0.0003694349731302483, "loss": 5.0222, "mean_token_accuracy": 0.20948944091796876, "num_tokens": 81830207.0, "step": 47180 }, { "entropy": 5.93882999420166, "epoch": 3.6711534720871426, "grad_norm": 1.375, "learning_rate": 0.0003694098161445389, "loss": 5.076, "mean_token_accuracy": 0.20346675664186478, "num_tokens": 81838664.0, "step": 47185 }, { "entropy": 5.787529468536377, "epoch": 3.6715425014588603, "grad_norm": 1.2890625, "learning_rate": 0.0003693846577263109, "loss": 4.9405, "mean_token_accuracy": 0.21316011548042296, "num_tokens": 81846606.0, "step": 47190 }, { "entropy": 5.817359876632691, "epoch": 3.6719315308305776, "grad_norm": 1.1796875, "learning_rate": 0.0003693594978759459, "loss": 5.0562, "mean_token_accuracy": 0.2066830113530159, "num_tokens": 81855925.0, "step": 47195 }, { "entropy": 5.846300792694092, "epoch": 3.6723205602022952, "grad_norm": 1.34375, "learning_rate": 0.00036933433659382575, "loss": 4.8973, "mean_token_accuracy": 0.21605715304613113, "num_tokens": 81864113.0, "step": 47200 }, { "entropy": 5.852595329284668, "epoch": 3.672709589574013, "grad_norm": 1.296875, "learning_rate": 0.0003693091738803322, "loss": 4.9786, "mean_token_accuracy": 0.20274495780467988, "num_tokens": 81873325.0, "step": 47205 }, { "entropy": 5.815014028549195, "epoch": 3.6730986189457306, "grad_norm": 1.234375, "learning_rate": 0.000369284009735847, "loss": 4.976, "mean_token_accuracy": 0.21856483519077302, "num_tokens": 81881835.0, "step": 47210 }, { "entropy": 5.897923564910888, "epoch": 3.673487648317448, "grad_norm": 1.390625, "learning_rate": 0.0003692588441607521, "loss": 5.0828, "mean_token_accuracy": 0.19634007513523102, "num_tokens": 81890402.0, "step": 47215 }, { "entropy": 5.876897239685059, "epoch": 3.6738766776891656, "grad_norm": 1.375, "learning_rate": 0.00036923367715542923, "loss": 4.9884, "mean_token_accuracy": 0.20642372816801072, "num_tokens": 81898742.0, "step": 47220 }, { "entropy": 5.845253038406372, "epoch": 3.674265707060883, "grad_norm": 1.375, "learning_rate": 0.00036920850872026025, "loss": 4.9253, "mean_token_accuracy": 0.216123129427433, "num_tokens": 81906845.0, "step": 47225 }, { "entropy": 5.761330032348633, "epoch": 3.6746547364326005, "grad_norm": 1.28125, "learning_rate": 0.0003691833388556272, "loss": 4.795, "mean_token_accuracy": 0.20942675173282624, "num_tokens": 81914825.0, "step": 47230 }, { "entropy": 5.837191724777222, "epoch": 3.6750437658043182, "grad_norm": 1.25, "learning_rate": 0.0003691581675619118, "loss": 4.9375, "mean_token_accuracy": 0.21030589193105698, "num_tokens": 81923626.0, "step": 47235 }, { "entropy": 5.803437089920044, "epoch": 3.675432795176036, "grad_norm": 1.296875, "learning_rate": 0.0003691329948394961, "loss": 4.9846, "mean_token_accuracy": 0.19939511269330978, "num_tokens": 81932515.0, "step": 47240 }, { "entropy": 5.877541780471802, "epoch": 3.675821824547753, "grad_norm": 1.328125, "learning_rate": 0.00036910782068876204, "loss": 4.9444, "mean_token_accuracy": 0.21235860288143157, "num_tokens": 81941797.0, "step": 47245 }, { "entropy": 5.837917137145996, "epoch": 3.676210853919471, "grad_norm": 1.2734375, "learning_rate": 0.00036908264511009155, "loss": 4.9591, "mean_token_accuracy": 0.21161564141511918, "num_tokens": 81949917.0, "step": 47250 }, { "entropy": 5.825458812713623, "epoch": 3.6765998832911886, "grad_norm": 1.28125, "learning_rate": 0.0003690574681038667, "loss": 4.9931, "mean_token_accuracy": 0.2070118546485901, "num_tokens": 81958901.0, "step": 47255 }, { "entropy": 5.841312217712402, "epoch": 3.676988912662906, "grad_norm": 1.2578125, "learning_rate": 0.00036903228967046946, "loss": 4.9825, "mean_token_accuracy": 0.20538247525691986, "num_tokens": 81967491.0, "step": 47260 }, { "entropy": 5.7919618606567385, "epoch": 3.6773779420346235, "grad_norm": 1.34375, "learning_rate": 0.0003690071098102819, "loss": 4.8627, "mean_token_accuracy": 0.21612421423196793, "num_tokens": 81976046.0, "step": 47265 }, { "entropy": 5.82978138923645, "epoch": 3.6777669714063412, "grad_norm": 1.28125, "learning_rate": 0.0003689819285236861, "loss": 5.0006, "mean_token_accuracy": 0.20794908404350282, "num_tokens": 81984573.0, "step": 47270 }, { "entropy": 5.783574867248535, "epoch": 3.678156000778059, "grad_norm": 1.2421875, "learning_rate": 0.00036895674581106415, "loss": 4.9298, "mean_token_accuracy": 0.20727989226579666, "num_tokens": 81993992.0, "step": 47275 }, { "entropy": 5.867757272720337, "epoch": 3.678545030149776, "grad_norm": 1.390625, "learning_rate": 0.00036893156167279803, "loss": 4.9409, "mean_token_accuracy": 0.2104694738984108, "num_tokens": 82002715.0, "step": 47280 }, { "entropy": 5.818426465988159, "epoch": 3.678934059521494, "grad_norm": 1.3359375, "learning_rate": 0.0003689063761092701, "loss": 4.9721, "mean_token_accuracy": 0.21080536395311356, "num_tokens": 82011692.0, "step": 47285 }, { "entropy": 5.748201513290406, "epoch": 3.6793230888932116, "grad_norm": 1.203125, "learning_rate": 0.00036888118912086225, "loss": 4.9187, "mean_token_accuracy": 0.2146085098385811, "num_tokens": 82021082.0, "step": 47290 }, { "entropy": 5.755142641067505, "epoch": 3.679712118264929, "grad_norm": 1.421875, "learning_rate": 0.0003688560007079569, "loss": 4.9013, "mean_token_accuracy": 0.21710772067308426, "num_tokens": 82029834.0, "step": 47295 }, { "entropy": 5.836669921875, "epoch": 3.6801011476366465, "grad_norm": 1.328125, "learning_rate": 0.000368830810870936, "loss": 4.9383, "mean_token_accuracy": 0.21833043098449706, "num_tokens": 82038486.0, "step": 47300 }, { "entropy": 5.867723608016968, "epoch": 3.6804901770083642, "grad_norm": 1.3203125, "learning_rate": 0.000368805619610182, "loss": 4.9911, "mean_token_accuracy": 0.2085198238492012, "num_tokens": 82047034.0, "step": 47305 }, { "entropy": 5.791879320144654, "epoch": 3.680879206380082, "grad_norm": 1.2734375, "learning_rate": 0.00036878042692607693, "loss": 4.9132, "mean_token_accuracy": 0.22166649550199508, "num_tokens": 82056243.0, "step": 47310 }, { "entropy": 5.8419393539428714, "epoch": 3.681268235751799, "grad_norm": 1.3828125, "learning_rate": 0.00036875523281900324, "loss": 4.9761, "mean_token_accuracy": 0.21947041898965836, "num_tokens": 82064345.0, "step": 47315 }, { "entropy": 5.743846321105957, "epoch": 3.681657265123517, "grad_norm": 1.4609375, "learning_rate": 0.0003687300372893431, "loss": 4.8433, "mean_token_accuracy": 0.2184553399682045, "num_tokens": 82071755.0, "step": 47320 }, { "entropy": 5.748517847061157, "epoch": 3.682046294495234, "grad_norm": 1.3046875, "learning_rate": 0.00036870484033747883, "loss": 4.9408, "mean_token_accuracy": 0.21122310012578965, "num_tokens": 82080435.0, "step": 47325 }, { "entropy": 5.810262966156006, "epoch": 3.682435323866952, "grad_norm": 1.3203125, "learning_rate": 0.00036867964196379274, "loss": 5.0318, "mean_token_accuracy": 0.21184184402227402, "num_tokens": 82089092.0, "step": 47330 }, { "entropy": 5.776096153259277, "epoch": 3.6828243532386695, "grad_norm": 1.3671875, "learning_rate": 0.0003686544421686672, "loss": 4.9172, "mean_token_accuracy": 0.21689102202653884, "num_tokens": 82097431.0, "step": 47335 }, { "entropy": 5.839640522003174, "epoch": 3.683213382610387, "grad_norm": 1.390625, "learning_rate": 0.00036862924095248457, "loss": 4.9985, "mean_token_accuracy": 0.2131030723452568, "num_tokens": 82106785.0, "step": 47340 }, { "entropy": 5.796633100509643, "epoch": 3.683602411982105, "grad_norm": 1.3984375, "learning_rate": 0.00036860403831562717, "loss": 5.0248, "mean_token_accuracy": 0.20295716673135758, "num_tokens": 82115742.0, "step": 47345 }, { "entropy": 5.835797739028931, "epoch": 3.683991441353822, "grad_norm": 1.328125, "learning_rate": 0.0003685788342584775, "loss": 4.96, "mean_token_accuracy": 0.21152215152978898, "num_tokens": 82124316.0, "step": 47350 }, { "entropy": 5.824048709869385, "epoch": 3.68438047072554, "grad_norm": 1.390625, "learning_rate": 0.000368553628781418, "loss": 4.9099, "mean_token_accuracy": 0.2150337278842926, "num_tokens": 82133057.0, "step": 47355 }, { "entropy": 5.791301107406616, "epoch": 3.684769500097257, "grad_norm": 1.3828125, "learning_rate": 0.0003685284218848311, "loss": 4.9809, "mean_token_accuracy": 0.21696521937847138, "num_tokens": 82141680.0, "step": 47360 }, { "entropy": 5.736022090911865, "epoch": 3.685158529468975, "grad_norm": 1.4375, "learning_rate": 0.00036850321356909926, "loss": 4.9315, "mean_token_accuracy": 0.21652592718601227, "num_tokens": 82150336.0, "step": 47365 }, { "entropy": 5.909892940521241, "epoch": 3.6855475588406925, "grad_norm": 1.3671875, "learning_rate": 0.00036847800383460493, "loss": 5.0036, "mean_token_accuracy": 0.20878201276063918, "num_tokens": 82158651.0, "step": 47370 }, { "entropy": 5.828945589065552, "epoch": 3.68593658821241, "grad_norm": 1.296875, "learning_rate": 0.00036845279268173076, "loss": 4.9384, "mean_token_accuracy": 0.21469952166080475, "num_tokens": 82167364.0, "step": 47375 }, { "entropy": 5.845725107192993, "epoch": 3.6863256175841275, "grad_norm": 1.25, "learning_rate": 0.00036842758011085914, "loss": 5.02, "mean_token_accuracy": 0.20711719393730163, "num_tokens": 82176841.0, "step": 47380 }, { "entropy": 5.887591361999512, "epoch": 3.686714646955845, "grad_norm": 1.3125, "learning_rate": 0.0003684023661223727, "loss": 4.9943, "mean_token_accuracy": 0.2107377827167511, "num_tokens": 82185541.0, "step": 47385 }, { "entropy": 5.795643997192383, "epoch": 3.687103676327563, "grad_norm": 1.28125, "learning_rate": 0.00036837715071665403, "loss": 4.9993, "mean_token_accuracy": 0.2073211520910263, "num_tokens": 82194406.0, "step": 47390 }, { "entropy": 5.801859188079834, "epoch": 3.68749270569928, "grad_norm": 1.3125, "learning_rate": 0.0003683519338940857, "loss": 4.9383, "mean_token_accuracy": 0.2162027105689049, "num_tokens": 82203372.0, "step": 47395 }, { "entropy": 5.893499565124512, "epoch": 3.687881735070998, "grad_norm": 1.4453125, "learning_rate": 0.00036832671565505045, "loss": 5.0408, "mean_token_accuracy": 0.2113508999347687, "num_tokens": 82211467.0, "step": 47400 }, { "entropy": 5.848351716995239, "epoch": 3.6882707644427155, "grad_norm": 1.28125, "learning_rate": 0.0003683014959999307, "loss": 5.0108, "mean_token_accuracy": 0.2081564709544182, "num_tokens": 82220317.0, "step": 47405 }, { "entropy": 5.832211828231811, "epoch": 3.688659793814433, "grad_norm": 1.421875, "learning_rate": 0.0003682762749291094, "loss": 4.9219, "mean_token_accuracy": 0.20881418734788895, "num_tokens": 82228474.0, "step": 47410 }, { "entropy": 5.798228025436401, "epoch": 3.6890488231861505, "grad_norm": 1.2890625, "learning_rate": 0.000368251052442969, "loss": 4.9348, "mean_token_accuracy": 0.2113061860203743, "num_tokens": 82237463.0, "step": 47415 }, { "entropy": 5.820923900604248, "epoch": 3.689437852557868, "grad_norm": 1.25, "learning_rate": 0.00036822582854189234, "loss": 5.0145, "mean_token_accuracy": 0.20762990564107894, "num_tokens": 82245909.0, "step": 47420 }, { "entropy": 5.854363489151001, "epoch": 3.6898268819295854, "grad_norm": 1.28125, "learning_rate": 0.000368200603226262, "loss": 4.9409, "mean_token_accuracy": 0.2173209235072136, "num_tokens": 82254497.0, "step": 47425 }, { "entropy": 5.8590576171875, "epoch": 3.690215911301303, "grad_norm": 1.5, "learning_rate": 0.000368175376496461, "loss": 5.0698, "mean_token_accuracy": 0.19842159301042556, "num_tokens": 82262250.0, "step": 47430 }, { "entropy": 5.81525936126709, "epoch": 3.690604940673021, "grad_norm": 1.390625, "learning_rate": 0.0003681501483528719, "loss": 5.0509, "mean_token_accuracy": 0.21095226854085922, "num_tokens": 82271645.0, "step": 47435 }, { "entropy": 5.814493989944458, "epoch": 3.6909939700447385, "grad_norm": 1.3203125, "learning_rate": 0.0003681249187958776, "loss": 4.8831, "mean_token_accuracy": 0.21730687320232392, "num_tokens": 82280244.0, "step": 47440 }, { "entropy": 5.861919736862182, "epoch": 3.691382999416456, "grad_norm": 1.4375, "learning_rate": 0.00036809968782586087, "loss": 4.9769, "mean_token_accuracy": 0.20990655273199083, "num_tokens": 82288777.0, "step": 47445 }, { "entropy": 5.842426347732544, "epoch": 3.6917720287881735, "grad_norm": 1.21875, "learning_rate": 0.0003680744554432045, "loss": 5.0165, "mean_token_accuracy": 0.20245245546102525, "num_tokens": 82297651.0, "step": 47450 }, { "entropy": 5.8399467945098875, "epoch": 3.692161058159891, "grad_norm": 1.5, "learning_rate": 0.00036804922164829153, "loss": 5.0262, "mean_token_accuracy": 0.20133808702230455, "num_tokens": 82306142.0, "step": 47455 }, { "entropy": 5.863906288146973, "epoch": 3.6925500875316084, "grad_norm": 1.40625, "learning_rate": 0.0003680239864415046, "loss": 5.0445, "mean_token_accuracy": 0.2050076901912689, "num_tokens": 82314812.0, "step": 47460 }, { "entropy": 5.795029735565185, "epoch": 3.692939116903326, "grad_norm": 1.421875, "learning_rate": 0.0003679987498232268, "loss": 4.8856, "mean_token_accuracy": 0.21800476759672166, "num_tokens": 82323776.0, "step": 47465 }, { "entropy": 5.843558645248413, "epoch": 3.693328146275044, "grad_norm": 1.421875, "learning_rate": 0.000367973511793841, "loss": 4.8815, "mean_token_accuracy": 0.22503561824560164, "num_tokens": 82331846.0, "step": 47470 }, { "entropy": 5.773589372634888, "epoch": 3.6937171756467615, "grad_norm": 1.3125, "learning_rate": 0.00036794827235373006, "loss": 5.0089, "mean_token_accuracy": 0.20450536757707596, "num_tokens": 82340609.0, "step": 47475 }, { "entropy": 5.812676668167114, "epoch": 3.6941062050184788, "grad_norm": 1.4375, "learning_rate": 0.0003679230315032772, "loss": 4.9541, "mean_token_accuracy": 0.21250367611646653, "num_tokens": 82350023.0, "step": 47480 }, { "entropy": 5.835667467117309, "epoch": 3.6944952343901964, "grad_norm": 1.3515625, "learning_rate": 0.0003678977892428651, "loss": 4.9617, "mean_token_accuracy": 0.2133311539888382, "num_tokens": 82358570.0, "step": 47485 }, { "entropy": 5.823937654495239, "epoch": 3.694884263761914, "grad_norm": 1.25, "learning_rate": 0.0003678725455728769, "loss": 4.9397, "mean_token_accuracy": 0.20940123200416566, "num_tokens": 82366747.0, "step": 47490 }, { "entropy": 5.880998516082764, "epoch": 3.6952732931336314, "grad_norm": 1.28125, "learning_rate": 0.00036784730049369577, "loss": 5.087, "mean_token_accuracy": 0.1979859620332718, "num_tokens": 82376553.0, "step": 47495 }, { "entropy": 5.739828443527221, "epoch": 3.695662322505349, "grad_norm": 1.4375, "learning_rate": 0.0003678220540057045, "loss": 4.8833, "mean_token_accuracy": 0.21710320860147475, "num_tokens": 82384859.0, "step": 47500 }, { "entropy": 5.7777512550354, "epoch": 3.696051351877067, "grad_norm": 1.53125, "learning_rate": 0.00036779680610928635, "loss": 4.9365, "mean_token_accuracy": 0.2128010794520378, "num_tokens": 82392636.0, "step": 47505 }, { "entropy": 5.821181869506836, "epoch": 3.6964403812487845, "grad_norm": 1.359375, "learning_rate": 0.0003677715568048244, "loss": 4.9785, "mean_token_accuracy": 0.21425893306732177, "num_tokens": 82401833.0, "step": 47510 }, { "entropy": 5.671100330352783, "epoch": 3.6968294106205017, "grad_norm": 1.3203125, "learning_rate": 0.00036774630609270165, "loss": 4.7831, "mean_token_accuracy": 0.22373622804880142, "num_tokens": 82410081.0, "step": 47515 }, { "entropy": 5.864590358734131, "epoch": 3.6972184399922194, "grad_norm": 1.328125, "learning_rate": 0.00036772105397330147, "loss": 5.043, "mean_token_accuracy": 0.20575221180915831, "num_tokens": 82418652.0, "step": 47520 }, { "entropy": 5.7873705387115475, "epoch": 3.697607469363937, "grad_norm": 1.375, "learning_rate": 0.0003676958004470067, "loss": 4.9339, "mean_token_accuracy": 0.21328648030757905, "num_tokens": 82426776.0, "step": 47525 }, { "entropy": 5.680224370956421, "epoch": 3.6979964987356544, "grad_norm": 1.3828125, "learning_rate": 0.0003676705455142009, "loss": 4.833, "mean_token_accuracy": 0.221922804415226, "num_tokens": 82435624.0, "step": 47530 }, { "entropy": 5.807655143737793, "epoch": 3.698385528107372, "grad_norm": 1.3515625, "learning_rate": 0.0003676452891752669, "loss": 5.025, "mean_token_accuracy": 0.204884672164917, "num_tokens": 82444224.0, "step": 47535 }, { "entropy": 5.881196308135986, "epoch": 3.69877455747909, "grad_norm": 1.390625, "learning_rate": 0.0003676200314305882, "loss": 5.0603, "mean_token_accuracy": 0.20033486634492875, "num_tokens": 82452527.0, "step": 47540 }, { "entropy": 5.868856430053711, "epoch": 3.6991635868508075, "grad_norm": 1.3984375, "learning_rate": 0.0003675947722805479, "loss": 4.9212, "mean_token_accuracy": 0.21808420717716218, "num_tokens": 82460180.0, "step": 47545 }, { "entropy": 5.858821630477905, "epoch": 3.6995526162225247, "grad_norm": 1.328125, "learning_rate": 0.0003675695117255293, "loss": 4.9552, "mean_token_accuracy": 0.21489195227622987, "num_tokens": 82468725.0, "step": 47550 }, { "entropy": 5.850635385513305, "epoch": 3.6999416455942424, "grad_norm": 1.3203125, "learning_rate": 0.0003675442497659157, "loss": 4.975, "mean_token_accuracy": 0.2038572132587433, "num_tokens": 82477070.0, "step": 47555 }, { "entropy": 5.76100001335144, "epoch": 3.7003306749659597, "grad_norm": 1.3359375, "learning_rate": 0.0003675189864020905, "loss": 4.9183, "mean_token_accuracy": 0.21540171802043914, "num_tokens": 82485960.0, "step": 47560 }, { "entropy": 5.718763637542724, "epoch": 3.7007197043376774, "grad_norm": 1.296875, "learning_rate": 0.0003674937216344368, "loss": 4.8324, "mean_token_accuracy": 0.21913995295763017, "num_tokens": 82494498.0, "step": 47565 }, { "entropy": 5.833649063110352, "epoch": 3.701108733709395, "grad_norm": 1.3046875, "learning_rate": 0.0003674684554633382, "loss": 4.9578, "mean_token_accuracy": 0.2092430830001831, "num_tokens": 82504505.0, "step": 47570 }, { "entropy": 5.788207530975342, "epoch": 3.701497763081113, "grad_norm": 1.3671875, "learning_rate": 0.0003674431878891779, "loss": 4.9597, "mean_token_accuracy": 0.21054859310388566, "num_tokens": 82513747.0, "step": 47575 }, { "entropy": 5.839835500717163, "epoch": 3.70188679245283, "grad_norm": 1.3046875, "learning_rate": 0.0003674179189123393, "loss": 4.8953, "mean_token_accuracy": 0.21243950575590134, "num_tokens": 82522621.0, "step": 47580 }, { "entropy": 5.764621114730835, "epoch": 3.7022758218245477, "grad_norm": 1.34375, "learning_rate": 0.00036739264853320606, "loss": 4.8746, "mean_token_accuracy": 0.2142791673541069, "num_tokens": 82530286.0, "step": 47585 }, { "entropy": 5.789975690841675, "epoch": 3.7026648511962654, "grad_norm": 1.3046875, "learning_rate": 0.00036736737675216127, "loss": 4.909, "mean_token_accuracy": 0.21456380784511567, "num_tokens": 82539288.0, "step": 47590 }, { "entropy": 5.8874876499176025, "epoch": 3.7030538805679827, "grad_norm": 1.3359375, "learning_rate": 0.0003673421035695887, "loss": 5.0069, "mean_token_accuracy": 0.20436098128557206, "num_tokens": 82547271.0, "step": 47595 }, { "entropy": 5.829735803604126, "epoch": 3.7034429099397004, "grad_norm": 1.40625, "learning_rate": 0.0003673168289858716, "loss": 5.0337, "mean_token_accuracy": 0.20345888882875443, "num_tokens": 82555997.0, "step": 47600 }, { "entropy": 5.7939537525177, "epoch": 3.703831939311418, "grad_norm": 1.2578125, "learning_rate": 0.0003672915530013936, "loss": 4.9439, "mean_token_accuracy": 0.21485138386487962, "num_tokens": 82565181.0, "step": 47605 }, { "entropy": 5.813367509841919, "epoch": 3.7042209686831358, "grad_norm": 1.3359375, "learning_rate": 0.00036726627561653815, "loss": 4.9836, "mean_token_accuracy": 0.21035061329603194, "num_tokens": 82573691.0, "step": 47610 }, { "entropy": 5.888906478881836, "epoch": 3.704609998054853, "grad_norm": 1.3515625, "learning_rate": 0.0003672409968316888, "loss": 5.0428, "mean_token_accuracy": 0.20377600193023682, "num_tokens": 82582562.0, "step": 47615 }, { "entropy": 5.8650078773498535, "epoch": 3.7049990274265707, "grad_norm": 1.3125, "learning_rate": 0.00036721571664722914, "loss": 5.0174, "mean_token_accuracy": 0.20801028311252595, "num_tokens": 82591051.0, "step": 47620 }, { "entropy": 5.85176453590393, "epoch": 3.7053880567982884, "grad_norm": 1.3203125, "learning_rate": 0.0003671904350635428, "loss": 4.9813, "mean_token_accuracy": 0.20853642821311952, "num_tokens": 82599385.0, "step": 47625 }, { "entropy": 5.852070283889771, "epoch": 3.7057770861700057, "grad_norm": 1.265625, "learning_rate": 0.00036716515208101334, "loss": 4.9409, "mean_token_accuracy": 0.21120110154151917, "num_tokens": 82607688.0, "step": 47630 }, { "entropy": 5.8451776027679445, "epoch": 3.7061661155417234, "grad_norm": 1.3828125, "learning_rate": 0.0003671398677000244, "loss": 4.983, "mean_token_accuracy": 0.20749571472406386, "num_tokens": 82615471.0, "step": 47635 }, { "entropy": 5.768795394897461, "epoch": 3.706555144913441, "grad_norm": 1.296875, "learning_rate": 0.0003671145819209596, "loss": 4.9034, "mean_token_accuracy": 0.21379236429929732, "num_tokens": 82624243.0, "step": 47640 }, { "entropy": 5.842304277420044, "epoch": 3.7069441742851588, "grad_norm": 1.3828125, "learning_rate": 0.0003670892947442026, "loss": 4.9423, "mean_token_accuracy": 0.21375629156827927, "num_tokens": 82632821.0, "step": 47645 }, { "entropy": 5.916658210754394, "epoch": 3.707333203656876, "grad_norm": 1.34375, "learning_rate": 0.0003670640061701371, "loss": 5.1673, "mean_token_accuracy": 0.200528284907341, "num_tokens": 82641225.0, "step": 47650 }, { "entropy": 5.889539337158203, "epoch": 3.7077222330285937, "grad_norm": 1.375, "learning_rate": 0.0003670387161991469, "loss": 5.024, "mean_token_accuracy": 0.21150896400213243, "num_tokens": 82649885.0, "step": 47655 }, { "entropy": 5.791624975204468, "epoch": 3.708111262400311, "grad_norm": 1.3125, "learning_rate": 0.0003670134248316157, "loss": 4.8662, "mean_token_accuracy": 0.22337315380573272, "num_tokens": 82658589.0, "step": 47660 }, { "entropy": 5.83379430770874, "epoch": 3.7085002917720287, "grad_norm": 1.296875, "learning_rate": 0.00036698813206792724, "loss": 5.0327, "mean_token_accuracy": 0.20933409184217452, "num_tokens": 82666676.0, "step": 47665 }, { "entropy": 5.763479614257813, "epoch": 3.7088893211437464, "grad_norm": 1.359375, "learning_rate": 0.00036696283790846524, "loss": 4.9075, "mean_token_accuracy": 0.21322163492441176, "num_tokens": 82675007.0, "step": 47670 }, { "entropy": 5.835676097869873, "epoch": 3.709278350515464, "grad_norm": 1.421875, "learning_rate": 0.00036693754235361364, "loss": 4.9727, "mean_token_accuracy": 0.20636060684919358, "num_tokens": 82684060.0, "step": 47675 }, { "entropy": 5.8082849979400635, "epoch": 3.7096673798871818, "grad_norm": 1.359375, "learning_rate": 0.0003669122454037561, "loss": 5.0238, "mean_token_accuracy": 0.21177144944667817, "num_tokens": 82693280.0, "step": 47680 }, { "entropy": 5.7743916511535645, "epoch": 3.710056409258899, "grad_norm": 1.421875, "learning_rate": 0.0003668869470592765, "loss": 4.8829, "mean_token_accuracy": 0.22135381549596786, "num_tokens": 82701176.0, "step": 47685 }, { "entropy": 5.821279668807984, "epoch": 3.7104454386306167, "grad_norm": 1.4375, "learning_rate": 0.00036686164732055876, "loss": 4.894, "mean_token_accuracy": 0.21524425894021987, "num_tokens": 82709410.0, "step": 47690 }, { "entropy": 5.797423362731934, "epoch": 3.710834468002334, "grad_norm": 1.28125, "learning_rate": 0.00036683634618798675, "loss": 4.9297, "mean_token_accuracy": 0.21016923934221268, "num_tokens": 82718535.0, "step": 47695 }, { "entropy": 5.850801658630371, "epoch": 3.7112234973740517, "grad_norm": 1.59375, "learning_rate": 0.0003668110436619443, "loss": 4.9889, "mean_token_accuracy": 0.21441307663917542, "num_tokens": 82727524.0, "step": 47700 }, { "entropy": 5.848289680480957, "epoch": 3.7116125267457694, "grad_norm": 1.3203125, "learning_rate": 0.00036678573974281546, "loss": 5.0373, "mean_token_accuracy": 0.20833807438611984, "num_tokens": 82735605.0, "step": 47705 }, { "entropy": 5.826483631134034, "epoch": 3.712001556117487, "grad_norm": 1.3125, "learning_rate": 0.0003667604344309841, "loss": 5.0119, "mean_token_accuracy": 0.2057904601097107, "num_tokens": 82745046.0, "step": 47710 }, { "entropy": 5.932688617706299, "epoch": 3.7123905854892043, "grad_norm": 1.2890625, "learning_rate": 0.00036673512772683424, "loss": 5.0118, "mean_token_accuracy": 0.20291443467140197, "num_tokens": 82753961.0, "step": 47715 }, { "entropy": 5.842805957794189, "epoch": 3.712779614860922, "grad_norm": 1.328125, "learning_rate": 0.0003667098196307498, "loss": 4.9468, "mean_token_accuracy": 0.21748872399330138, "num_tokens": 82762684.0, "step": 47720 }, { "entropy": 5.908396196365357, "epoch": 3.7131686442326397, "grad_norm": 1.3203125, "learning_rate": 0.00036668451014311475, "loss": 5.0241, "mean_token_accuracy": 0.2114571064710617, "num_tokens": 82770958.0, "step": 47725 }, { "entropy": 5.876068878173828, "epoch": 3.713557673604357, "grad_norm": 1.359375, "learning_rate": 0.00036665919926431325, "loss": 4.9465, "mean_token_accuracy": 0.2175833687186241, "num_tokens": 82779891.0, "step": 47730 }, { "entropy": 5.857554483413696, "epoch": 3.7139467029760747, "grad_norm": 1.359375, "learning_rate": 0.0003666338869947293, "loss": 4.957, "mean_token_accuracy": 0.20923633128404617, "num_tokens": 82788835.0, "step": 47735 }, { "entropy": 5.8611359119415285, "epoch": 3.7143357323477924, "grad_norm": 1.28125, "learning_rate": 0.0003666085733347469, "loss": 4.9771, "mean_token_accuracy": 0.2010548770427704, "num_tokens": 82797119.0, "step": 47740 }, { "entropy": 5.849747610092163, "epoch": 3.71472476171951, "grad_norm": 1.3046875, "learning_rate": 0.00036658325828475033, "loss": 4.8879, "mean_token_accuracy": 0.21529025286436082, "num_tokens": 82805210.0, "step": 47745 }, { "entropy": 5.8476005554199215, "epoch": 3.7151137910912273, "grad_norm": 1.265625, "learning_rate": 0.0003665579418451235, "loss": 4.9067, "mean_token_accuracy": 0.2129380598664284, "num_tokens": 82813916.0, "step": 47750 }, { "entropy": 5.851085901260376, "epoch": 3.715502820462945, "grad_norm": 1.2890625, "learning_rate": 0.0003665326240162506, "loss": 4.9871, "mean_token_accuracy": 0.21260829120874405, "num_tokens": 82822938.0, "step": 47755 }, { "entropy": 5.8830342292785645, "epoch": 3.7158918498346623, "grad_norm": 1.359375, "learning_rate": 0.00036650730479851593, "loss": 5.0426, "mean_token_accuracy": 0.2054884225130081, "num_tokens": 82831473.0, "step": 47760 }, { "entropy": 5.835927677154541, "epoch": 3.71628087920638, "grad_norm": 1.3515625, "learning_rate": 0.00036648198419230344, "loss": 5.0353, "mean_token_accuracy": 0.20694439113140106, "num_tokens": 82840233.0, "step": 47765 }, { "entropy": 5.839893913269043, "epoch": 3.7166699085780976, "grad_norm": 1.328125, "learning_rate": 0.00036645666219799753, "loss": 4.9654, "mean_token_accuracy": 0.21587978303432465, "num_tokens": 82848982.0, "step": 47770 }, { "entropy": 5.887689113616943, "epoch": 3.7170589379498153, "grad_norm": 1.3046875, "learning_rate": 0.0003664313388159823, "loss": 5.0005, "mean_token_accuracy": 0.207645982503891, "num_tokens": 82858029.0, "step": 47775 }, { "entropy": 5.892330694198608, "epoch": 3.717447967321533, "grad_norm": 1.3203125, "learning_rate": 0.000366406014046642, "loss": 5.0049, "mean_token_accuracy": 0.20889380872249602, "num_tokens": 82866138.0, "step": 47780 }, { "entropy": 5.896459674835205, "epoch": 3.7178369966932503, "grad_norm": 1.2890625, "learning_rate": 0.000366380687890361, "loss": 5.0843, "mean_token_accuracy": 0.2031337395310402, "num_tokens": 82875330.0, "step": 47785 }, { "entropy": 5.866710186004639, "epoch": 3.718226026064968, "grad_norm": 1.296875, "learning_rate": 0.0003663553603475235, "loss": 5.0099, "mean_token_accuracy": 0.20451129823923112, "num_tokens": 82884456.0, "step": 47790 }, { "entropy": 5.815174388885498, "epoch": 3.7186150554366852, "grad_norm": 1.3203125, "learning_rate": 0.00036633003141851373, "loss": 4.9386, "mean_token_accuracy": 0.218316949903965, "num_tokens": 82893148.0, "step": 47795 }, { "entropy": 5.805714273452759, "epoch": 3.719004084808403, "grad_norm": 1.453125, "learning_rate": 0.0003663047011037162, "loss": 4.9616, "mean_token_accuracy": 0.21580162644386292, "num_tokens": 82901065.0, "step": 47800 }, { "entropy": 5.746801662445068, "epoch": 3.7193931141801206, "grad_norm": 1.28125, "learning_rate": 0.0003662793694035151, "loss": 4.9372, "mean_token_accuracy": 0.21199303567409516, "num_tokens": 82910162.0, "step": 47805 }, { "entropy": 5.879882287979126, "epoch": 3.7197821435518383, "grad_norm": 1.3984375, "learning_rate": 0.0003662540363182949, "loss": 5.0146, "mean_token_accuracy": 0.21324236541986466, "num_tokens": 82918393.0, "step": 47810 }, { "entropy": 5.79303617477417, "epoch": 3.7201711729235556, "grad_norm": 1.3203125, "learning_rate": 0.0003662287018484398, "loss": 4.9164, "mean_token_accuracy": 0.22063090801239013, "num_tokens": 82927607.0, "step": 47815 }, { "entropy": 5.855635404586792, "epoch": 3.7205602022952733, "grad_norm": 1.375, "learning_rate": 0.0003662033659943345, "loss": 5.0115, "mean_token_accuracy": 0.208395417034626, "num_tokens": 82936743.0, "step": 47820 }, { "entropy": 5.858403635025025, "epoch": 3.720949231666991, "grad_norm": 1.3359375, "learning_rate": 0.00036617802875636333, "loss": 5.0292, "mean_token_accuracy": 0.21766191124916076, "num_tokens": 82946027.0, "step": 47825 }, { "entropy": 5.844405317306519, "epoch": 3.7213382610387082, "grad_norm": 1.3984375, "learning_rate": 0.0003661526901349106, "loss": 4.9202, "mean_token_accuracy": 0.21264751702547074, "num_tokens": 82954442.0, "step": 47830 }, { "entropy": 5.784116554260254, "epoch": 3.721727290410426, "grad_norm": 1.4296875, "learning_rate": 0.00036612735013036085, "loss": 4.8884, "mean_token_accuracy": 0.2192142501473427, "num_tokens": 82962518.0, "step": 47835 }, { "entropy": 5.847973203659057, "epoch": 3.7221163197821436, "grad_norm": 1.2578125, "learning_rate": 0.0003661020087430987, "loss": 5.0622, "mean_token_accuracy": 0.20298035442829132, "num_tokens": 82971544.0, "step": 47840 }, { "entropy": 5.831002283096313, "epoch": 3.7225053491538613, "grad_norm": 1.359375, "learning_rate": 0.0003660766659735086, "loss": 4.9128, "mean_token_accuracy": 0.21436350047588348, "num_tokens": 82980771.0, "step": 47845 }, { "entropy": 5.857136058807373, "epoch": 3.7228943785255786, "grad_norm": 1.3359375, "learning_rate": 0.0003660513218219749, "loss": 4.9681, "mean_token_accuracy": 0.21015906780958177, "num_tokens": 82989525.0, "step": 47850 }, { "entropy": 5.797034072875976, "epoch": 3.7232834078972963, "grad_norm": 1.34375, "learning_rate": 0.0003660259762888824, "loss": 4.9755, "mean_token_accuracy": 0.20870914906263352, "num_tokens": 82998135.0, "step": 47855 }, { "entropy": 5.854148960113525, "epoch": 3.7236724372690135, "grad_norm": 1.375, "learning_rate": 0.0003660006293746156, "loss": 5.0299, "mean_token_accuracy": 0.20015900135040282, "num_tokens": 83007068.0, "step": 47860 }, { "entropy": 5.8469315528869625, "epoch": 3.7240614666407312, "grad_norm": 1.296875, "learning_rate": 0.00036597528107955914, "loss": 5.0138, "mean_token_accuracy": 0.20445869266986846, "num_tokens": 83015819.0, "step": 47865 }, { "entropy": 5.9325378894805905, "epoch": 3.724450496012449, "grad_norm": 1.4453125, "learning_rate": 0.00036594993140409753, "loss": 5.0448, "mean_token_accuracy": 0.20404834300279617, "num_tokens": 83025096.0, "step": 47870 }, { "entropy": 5.831042957305908, "epoch": 3.7248395253841666, "grad_norm": 1.3125, "learning_rate": 0.0003659245803486155, "loss": 4.8496, "mean_token_accuracy": 0.22245285660028458, "num_tokens": 83033181.0, "step": 47875 }, { "entropy": 5.806903648376465, "epoch": 3.7252285547558843, "grad_norm": 1.3359375, "learning_rate": 0.0003658992279134977, "loss": 4.9691, "mean_token_accuracy": 0.21411782503128052, "num_tokens": 83042315.0, "step": 47880 }, { "entropy": 5.801592206954956, "epoch": 3.7256175841276016, "grad_norm": 1.25, "learning_rate": 0.0003658738740991287, "loss": 4.9744, "mean_token_accuracy": 0.20745842158794403, "num_tokens": 83051565.0, "step": 47885 }, { "entropy": 5.8347029209136965, "epoch": 3.7260066134993193, "grad_norm": 1.40625, "learning_rate": 0.00036584851890589335, "loss": 4.9749, "mean_token_accuracy": 0.2052846908569336, "num_tokens": 83059889.0, "step": 47890 }, { "entropy": 5.799263143539429, "epoch": 3.7263956428710365, "grad_norm": 1.328125, "learning_rate": 0.00036582316233417636, "loss": 4.9582, "mean_token_accuracy": 0.21492184996604918, "num_tokens": 83068764.0, "step": 47895 }, { "entropy": 5.794838190078735, "epoch": 3.7267846722427542, "grad_norm": 1.3515625, "learning_rate": 0.00036579780438436246, "loss": 4.9017, "mean_token_accuracy": 0.2118419125676155, "num_tokens": 83077605.0, "step": 47900 }, { "entropy": 5.781516695022583, "epoch": 3.727173701614472, "grad_norm": 1.3125, "learning_rate": 0.0003657724450568363, "loss": 4.8984, "mean_token_accuracy": 0.21300924569368362, "num_tokens": 83086080.0, "step": 47905 }, { "entropy": 5.748764419555664, "epoch": 3.7275627309861896, "grad_norm": 1.4921875, "learning_rate": 0.0003657470843519829, "loss": 4.8846, "mean_token_accuracy": 0.22157881706953048, "num_tokens": 83094070.0, "step": 47910 }, { "entropy": 5.75463080406189, "epoch": 3.727951760357907, "grad_norm": 1.3046875, "learning_rate": 0.0003657217222701868, "loss": 4.8714, "mean_token_accuracy": 0.22007499039173126, "num_tokens": 83102213.0, "step": 47915 }, { "entropy": 5.7820816993713375, "epoch": 3.7283407897296246, "grad_norm": 1.390625, "learning_rate": 0.000365696358811833, "loss": 4.9229, "mean_token_accuracy": 0.21323958784341812, "num_tokens": 83110525.0, "step": 47920 }, { "entropy": 5.778080129623413, "epoch": 3.7287298191013423, "grad_norm": 1.3046875, "learning_rate": 0.00036567099397730635, "loss": 4.9536, "mean_token_accuracy": 0.2084585353732109, "num_tokens": 83119206.0, "step": 47925 }, { "entropy": 5.813888835906982, "epoch": 3.7291188484730595, "grad_norm": 1.3125, "learning_rate": 0.0003656456277669917, "loss": 5.043, "mean_token_accuracy": 0.20288424491882323, "num_tokens": 83127713.0, "step": 47930 }, { "entropy": 5.8654398918151855, "epoch": 3.729507877844777, "grad_norm": 1.3359375, "learning_rate": 0.00036562026018127386, "loss": 4.9968, "mean_token_accuracy": 0.20974283367395402, "num_tokens": 83135785.0, "step": 47935 }, { "entropy": 5.81505126953125, "epoch": 3.729896907216495, "grad_norm": 1.2734375, "learning_rate": 0.00036559489122053786, "loss": 4.9139, "mean_token_accuracy": 0.21023508459329604, "num_tokens": 83144623.0, "step": 47940 }, { "entropy": 5.837250900268555, "epoch": 3.7302859365882126, "grad_norm": 1.3984375, "learning_rate": 0.0003655695208851686, "loss": 4.9647, "mean_token_accuracy": 0.20996852368116378, "num_tokens": 83153189.0, "step": 47945 }, { "entropy": 5.824997901916504, "epoch": 3.73067496595993, "grad_norm": 1.234375, "learning_rate": 0.00036554414917555096, "loss": 4.9549, "mean_token_accuracy": 0.21945875585079194, "num_tokens": 83161821.0, "step": 47950 }, { "entropy": 5.8398394107818605, "epoch": 3.7310639953316476, "grad_norm": 1.328125, "learning_rate": 0.00036551877609207, "loss": 4.9687, "mean_token_accuracy": 0.21727556437253953, "num_tokens": 83170527.0, "step": 47955 }, { "entropy": 5.83180980682373, "epoch": 3.7314530247033653, "grad_norm": 1.3203125, "learning_rate": 0.0003654934016351107, "loss": 4.8796, "mean_token_accuracy": 0.21975559294223784, "num_tokens": 83178983.0, "step": 47960 }, { "entropy": 5.823171234130859, "epoch": 3.7318420540750825, "grad_norm": 1.3515625, "learning_rate": 0.00036546802580505805, "loss": 4.9215, "mean_token_accuracy": 0.21582618802785875, "num_tokens": 83188177.0, "step": 47965 }, { "entropy": 5.769633436203003, "epoch": 3.7322310834468, "grad_norm": 1.25, "learning_rate": 0.0003654426486022971, "loss": 4.9391, "mean_token_accuracy": 0.20697318017482758, "num_tokens": 83197090.0, "step": 47970 }, { "entropy": 5.831873607635498, "epoch": 3.732620112818518, "grad_norm": 1.4765625, "learning_rate": 0.0003654172700272129, "loss": 5.037, "mean_token_accuracy": 0.20947504192590713, "num_tokens": 83205347.0, "step": 47975 }, { "entropy": 5.830914163589478, "epoch": 3.7330091421902356, "grad_norm": 1.375, "learning_rate": 0.0003653918900801905, "loss": 4.9277, "mean_token_accuracy": 0.22152494192123412, "num_tokens": 83213378.0, "step": 47980 }, { "entropy": 5.897208738327026, "epoch": 3.733398171561953, "grad_norm": 1.25, "learning_rate": 0.00036536650876161514, "loss": 5.0081, "mean_token_accuracy": 0.20952723175287247, "num_tokens": 83221898.0, "step": 47985 }, { "entropy": 5.798211860656738, "epoch": 3.7337872009336706, "grad_norm": 1.4140625, "learning_rate": 0.0003653411260718718, "loss": 4.9185, "mean_token_accuracy": 0.2106486201286316, "num_tokens": 83231176.0, "step": 47990 }, { "entropy": 5.864276695251465, "epoch": 3.734176230305388, "grad_norm": 1.2578125, "learning_rate": 0.0003653157420113457, "loss": 5.0663, "mean_token_accuracy": 0.20788965821266175, "num_tokens": 83239777.0, "step": 47995 }, { "entropy": 5.856411933898926, "epoch": 3.7345652596771055, "grad_norm": 1.3125, "learning_rate": 0.0003652903565804219, "loss": 4.9704, "mean_token_accuracy": 0.21014214009046556, "num_tokens": 83248941.0, "step": 48000 }, { "epoch": 3.7345652596771055, "eval_entropy": 5.543886543031606, "eval_loss": 5.055032253265381, "eval_mean_token_accuracy": 0.21667727012262536, "eval_num_tokens": 83248941.0, "eval_runtime": 21.6507, "eval_samples_per_second": 1919.475, "eval_steps_per_second": 239.946, "step": 48000 }, { "entropy": 5.8174034595489506, "epoch": 3.734954289048823, "grad_norm": 1.484375, "learning_rate": 0.00036526496977948574, "loss": 4.9676, "mean_token_accuracy": 0.20802545845508574, "num_tokens": 83257324.0, "step": 48005 }, { "entropy": 5.804398250579834, "epoch": 3.735343318420541, "grad_norm": 1.3828125, "learning_rate": 0.00036523958160892227, "loss": 4.9747, "mean_token_accuracy": 0.2168972074985504, "num_tokens": 83265655.0, "step": 48010 }, { "entropy": 5.83896541595459, "epoch": 3.735732347792258, "grad_norm": 1.265625, "learning_rate": 0.00036521419206911684, "loss": 4.9702, "mean_token_accuracy": 0.20799157917499542, "num_tokens": 83274743.0, "step": 48015 }, { "entropy": 5.844559288024902, "epoch": 3.736121377163976, "grad_norm": 1.3359375, "learning_rate": 0.0003651888011604545, "loss": 5.0303, "mean_token_accuracy": 0.20898610800504686, "num_tokens": 83284344.0, "step": 48020 }, { "entropy": 5.757234954833985, "epoch": 3.7365104065356936, "grad_norm": 1.234375, "learning_rate": 0.00036516340888332076, "loss": 4.8888, "mean_token_accuracy": 0.22526951581239701, "num_tokens": 83292855.0, "step": 48025 }, { "entropy": 5.802846050262451, "epoch": 3.736899435907411, "grad_norm": 1.3359375, "learning_rate": 0.00036513801523810075, "loss": 4.9626, "mean_token_accuracy": 0.2020442768931389, "num_tokens": 83301624.0, "step": 48030 }, { "entropy": 5.90347375869751, "epoch": 3.7372884652791285, "grad_norm": 1.234375, "learning_rate": 0.0003651126202251799, "loss": 5.0126, "mean_token_accuracy": 0.2046452909708023, "num_tokens": 83311052.0, "step": 48035 }, { "entropy": 5.895176076889038, "epoch": 3.737677494650846, "grad_norm": 1.375, "learning_rate": 0.0003650872238449434, "loss": 4.9456, "mean_token_accuracy": 0.21769033670425414, "num_tokens": 83319382.0, "step": 48040 }, { "entropy": 5.892287540435791, "epoch": 3.738066524022564, "grad_norm": 1.5859375, "learning_rate": 0.0003650618260977767, "loss": 5.0114, "mean_token_accuracy": 0.21363969147205353, "num_tokens": 83327548.0, "step": 48045 }, { "entropy": 5.752510499954224, "epoch": 3.738455553394281, "grad_norm": 1.34375, "learning_rate": 0.0003650364269840651, "loss": 4.9067, "mean_token_accuracy": 0.21524756997823716, "num_tokens": 83336463.0, "step": 48050 }, { "entropy": 5.832553863525391, "epoch": 3.738844582765999, "grad_norm": 1.40625, "learning_rate": 0.0003650110265041941, "loss": 4.923, "mean_token_accuracy": 0.22074692994356154, "num_tokens": 83344404.0, "step": 48055 }, { "entropy": 5.807904148101807, "epoch": 3.7392336121377165, "grad_norm": 1.3828125, "learning_rate": 0.00036498562465854897, "loss": 4.8552, "mean_token_accuracy": 0.21352154910564422, "num_tokens": 83352016.0, "step": 48060 }, { "entropy": 5.804587173461914, "epoch": 3.739622641509434, "grad_norm": 1.359375, "learning_rate": 0.0003649602214475152, "loss": 4.9263, "mean_token_accuracy": 0.20912038832902907, "num_tokens": 83360424.0, "step": 48065 }, { "entropy": 5.85298719406128, "epoch": 3.7400116708811515, "grad_norm": 1.359375, "learning_rate": 0.00036493481687147836, "loss": 4.9098, "mean_token_accuracy": 0.20781703740358354, "num_tokens": 83369413.0, "step": 48070 }, { "entropy": 5.792028617858887, "epoch": 3.740400700252869, "grad_norm": 1.328125, "learning_rate": 0.0003649094109308237, "loss": 4.9555, "mean_token_accuracy": 0.2041991412639618, "num_tokens": 83378493.0, "step": 48075 }, { "entropy": 5.790865755081176, "epoch": 3.740789729624587, "grad_norm": 1.4296875, "learning_rate": 0.00036488400362593695, "loss": 4.9724, "mean_token_accuracy": 0.20572518706321716, "num_tokens": 83386668.0, "step": 48080 }, { "entropy": 5.782430124282837, "epoch": 3.741178758996304, "grad_norm": 1.34375, "learning_rate": 0.00036485859495720337, "loss": 4.9624, "mean_token_accuracy": 0.21456206142902373, "num_tokens": 83395961.0, "step": 48085 }, { "entropy": 5.787828397750855, "epoch": 3.741567788368022, "grad_norm": 1.3828125, "learning_rate": 0.00036483318492500875, "loss": 4.9781, "mean_token_accuracy": 0.20678293853998184, "num_tokens": 83405346.0, "step": 48090 }, { "entropy": 5.901810026168823, "epoch": 3.741956817739739, "grad_norm": 1.4296875, "learning_rate": 0.00036480777352973856, "loss": 5.0192, "mean_token_accuracy": 0.2106003627181053, "num_tokens": 83413798.0, "step": 48095 }, { "entropy": 5.986916637420654, "epoch": 3.742345847111457, "grad_norm": 1.5078125, "learning_rate": 0.00036478236077177825, "loss": 5.0684, "mean_token_accuracy": 0.20726805329322814, "num_tokens": 83421961.0, "step": 48100 }, { "entropy": 5.853948402404785, "epoch": 3.7427348764831745, "grad_norm": 1.296875, "learning_rate": 0.00036475694665151357, "loss": 5.0818, "mean_token_accuracy": 0.20387787967920304, "num_tokens": 83430615.0, "step": 48105 }, { "entropy": 5.806417226791382, "epoch": 3.743123905854892, "grad_norm": 1.328125, "learning_rate": 0.00036473153116933007, "loss": 4.9898, "mean_token_accuracy": 0.2114982411265373, "num_tokens": 83439142.0, "step": 48110 }, { "entropy": 5.812489080429077, "epoch": 3.74351293522661, "grad_norm": 1.3671875, "learning_rate": 0.00036470611432561334, "loss": 4.888, "mean_token_accuracy": 0.22099938243627548, "num_tokens": 83447421.0, "step": 48115 }, { "entropy": 5.83894681930542, "epoch": 3.743901964598327, "grad_norm": 1.2890625, "learning_rate": 0.0003646806961207492, "loss": 4.9886, "mean_token_accuracy": 0.213106469810009, "num_tokens": 83456090.0, "step": 48120 }, { "entropy": 5.870834732055664, "epoch": 3.744290993970045, "grad_norm": 1.2734375, "learning_rate": 0.00036465527655512323, "loss": 4.9492, "mean_token_accuracy": 0.21907396912574767, "num_tokens": 83464527.0, "step": 48125 }, { "entropy": 5.8055723190307615, "epoch": 3.744680023341762, "grad_norm": 1.375, "learning_rate": 0.0003646298556291211, "loss": 4.9201, "mean_token_accuracy": 0.21956278383731842, "num_tokens": 83472648.0, "step": 48130 }, { "entropy": 5.791831207275391, "epoch": 3.74506905271348, "grad_norm": 1.2421875, "learning_rate": 0.00036460443334312867, "loss": 4.8961, "mean_token_accuracy": 0.21279336661100387, "num_tokens": 83481598.0, "step": 48135 }, { "entropy": 5.830446577072143, "epoch": 3.7454580820851975, "grad_norm": 1.3046875, "learning_rate": 0.0003645790096975315, "loss": 4.9514, "mean_token_accuracy": 0.2128597989678383, "num_tokens": 83490153.0, "step": 48140 }, { "entropy": 5.796997213363648, "epoch": 3.745847111456915, "grad_norm": 1.34375, "learning_rate": 0.00036455358469271546, "loss": 4.9523, "mean_token_accuracy": 0.21892473995685577, "num_tokens": 83499617.0, "step": 48145 }, { "entropy": 5.813403367996216, "epoch": 3.7462361408286324, "grad_norm": 1.296875, "learning_rate": 0.00036452815832906625, "loss": 4.9669, "mean_token_accuracy": 0.20673932433128356, "num_tokens": 83507793.0, "step": 48150 }, { "entropy": 5.818785572052002, "epoch": 3.74662517020035, "grad_norm": 1.421875, "learning_rate": 0.00036450273060696984, "loss": 4.9057, "mean_token_accuracy": 0.2150774195790291, "num_tokens": 83516490.0, "step": 48155 }, { "entropy": 5.785912561416626, "epoch": 3.747014199572068, "grad_norm": 1.3046875, "learning_rate": 0.0003644773015268118, "loss": 4.9828, "mean_token_accuracy": 0.21327378898859023, "num_tokens": 83524812.0, "step": 48160 }, { "entropy": 5.816422653198242, "epoch": 3.747403228943785, "grad_norm": 1.4296875, "learning_rate": 0.00036445187108897825, "loss": 4.9782, "mean_token_accuracy": 0.20942145735025405, "num_tokens": 83533242.0, "step": 48165 }, { "entropy": 5.787385416030884, "epoch": 3.747792258315503, "grad_norm": 1.375, "learning_rate": 0.0003644264392938549, "loss": 4.9046, "mean_token_accuracy": 0.22132279276847838, "num_tokens": 83541233.0, "step": 48170 }, { "entropy": 5.89837875366211, "epoch": 3.7481812876872205, "grad_norm": 1.53125, "learning_rate": 0.00036440100614182775, "loss": 5.0852, "mean_token_accuracy": 0.20848577469587326, "num_tokens": 83549561.0, "step": 48175 }, { "entropy": 5.863666915893555, "epoch": 3.748570317058938, "grad_norm": 1.40625, "learning_rate": 0.00036437557163328255, "loss": 5.009, "mean_token_accuracy": 0.20367168337106706, "num_tokens": 83558384.0, "step": 48180 }, { "entropy": 5.812606334686279, "epoch": 3.7489593464306554, "grad_norm": 1.25, "learning_rate": 0.0003643501357686053, "loss": 5.0141, "mean_token_accuracy": 0.20891905426979065, "num_tokens": 83567573.0, "step": 48185 }, { "entropy": 5.847899341583252, "epoch": 3.749348375802373, "grad_norm": 1.359375, "learning_rate": 0.00036432469854818194, "loss": 4.9835, "mean_token_accuracy": 0.21417021304368972, "num_tokens": 83576632.0, "step": 48190 }, { "entropy": 5.881405162811279, "epoch": 3.7497374051740904, "grad_norm": 1.3984375, "learning_rate": 0.0003642992599723985, "loss": 5.0386, "mean_token_accuracy": 0.20103729665279388, "num_tokens": 83585995.0, "step": 48195 }, { "entropy": 5.814607048034668, "epoch": 3.750126434545808, "grad_norm": 1.3984375, "learning_rate": 0.0003642738200416409, "loss": 4.9242, "mean_token_accuracy": 0.2114114597439766, "num_tokens": 83594985.0, "step": 48200 }, { "entropy": 5.809732246398926, "epoch": 3.7505154639175258, "grad_norm": 1.3984375, "learning_rate": 0.00036424837875629517, "loss": 4.9435, "mean_token_accuracy": 0.21006915718317032, "num_tokens": 83603179.0, "step": 48205 }, { "entropy": 5.914043855667114, "epoch": 3.7509044932892435, "grad_norm": 1.5234375, "learning_rate": 0.00036422293611674736, "loss": 5.0474, "mean_token_accuracy": 0.20467953085899354, "num_tokens": 83612890.0, "step": 48210 }, { "entropy": 5.898329639434815, "epoch": 3.751293522660961, "grad_norm": 1.2578125, "learning_rate": 0.00036419749212338346, "loss": 5.0954, "mean_token_accuracy": 0.20308901965618134, "num_tokens": 83623249.0, "step": 48215 }, { "entropy": 5.825810861587525, "epoch": 3.7516825520326784, "grad_norm": 1.3203125, "learning_rate": 0.0003641720467765897, "loss": 4.9533, "mean_token_accuracy": 0.2139798402786255, "num_tokens": 83632899.0, "step": 48220 }, { "entropy": 5.842149496078491, "epoch": 3.752071581404396, "grad_norm": 1.4296875, "learning_rate": 0.000364146600076752, "loss": 5.0163, "mean_token_accuracy": 0.20921468436717988, "num_tokens": 83641773.0, "step": 48225 }, { "entropy": 5.885406541824341, "epoch": 3.7524606107761134, "grad_norm": 1.2734375, "learning_rate": 0.0003641211520242565, "loss": 5.0007, "mean_token_accuracy": 0.2141861394047737, "num_tokens": 83649740.0, "step": 48230 }, { "entropy": 5.867773246765137, "epoch": 3.752849640147831, "grad_norm": 1.3828125, "learning_rate": 0.00036409570261948943, "loss": 4.9844, "mean_token_accuracy": 0.20786199867725372, "num_tokens": 83658764.0, "step": 48235 }, { "entropy": 5.76152548789978, "epoch": 3.7532386695195488, "grad_norm": 1.2890625, "learning_rate": 0.0003640702518628369, "loss": 4.9204, "mean_token_accuracy": 0.20732513517141343, "num_tokens": 83667350.0, "step": 48240 }, { "entropy": 5.802492094039917, "epoch": 3.7536276988912665, "grad_norm": 1.3359375, "learning_rate": 0.000364044799754685, "loss": 4.9507, "mean_token_accuracy": 0.20744658261537552, "num_tokens": 83676012.0, "step": 48245 }, { "entropy": 5.8645459651947025, "epoch": 3.7540167282629837, "grad_norm": 1.375, "learning_rate": 0.00036401934629542, "loss": 4.9912, "mean_token_accuracy": 0.21085594445466996, "num_tokens": 83684606.0, "step": 48250 }, { "entropy": 5.854912948608399, "epoch": 3.7544057576347014, "grad_norm": 1.390625, "learning_rate": 0.00036399389148542813, "loss": 5.012, "mean_token_accuracy": 0.2087712362408638, "num_tokens": 83692735.0, "step": 48255 }, { "entropy": 5.7967664241790775, "epoch": 3.754794787006419, "grad_norm": 1.328125, "learning_rate": 0.00036396843532509563, "loss": 4.8953, "mean_token_accuracy": 0.21689757704734802, "num_tokens": 83701487.0, "step": 48260 }, { "entropy": 5.777952671051025, "epoch": 3.7551838163781364, "grad_norm": 1.3828125, "learning_rate": 0.0003639429778148087, "loss": 4.986, "mean_token_accuracy": 0.21261889785528182, "num_tokens": 83709660.0, "step": 48265 }, { "entropy": 5.8783848762512205, "epoch": 3.755572845749854, "grad_norm": 1.3515625, "learning_rate": 0.0003639175189549536, "loss": 5.0303, "mean_token_accuracy": 0.2098706007003784, "num_tokens": 83719267.0, "step": 48270 }, { "entropy": 5.885482978820801, "epoch": 3.7559618751215718, "grad_norm": 1.4375, "learning_rate": 0.00036389205874591676, "loss": 5.0135, "mean_token_accuracy": 0.21413885056972504, "num_tokens": 83727479.0, "step": 48275 }, { "entropy": 5.834273767471314, "epoch": 3.7563509044932895, "grad_norm": 1.40625, "learning_rate": 0.00036386659718808437, "loss": 4.8597, "mean_token_accuracy": 0.21189190596342086, "num_tokens": 83735447.0, "step": 48280 }, { "entropy": 5.891317415237427, "epoch": 3.7567399338650067, "grad_norm": 1.3046875, "learning_rate": 0.00036384113428184286, "loss": 5.0176, "mean_token_accuracy": 0.21189987659454346, "num_tokens": 83744147.0, "step": 48285 }, { "entropy": 5.819622325897217, "epoch": 3.7571289632367244, "grad_norm": 1.375, "learning_rate": 0.0003638156700275784, "loss": 4.9961, "mean_token_accuracy": 0.2060718223452568, "num_tokens": 83752898.0, "step": 48290 }, { "entropy": 5.786340951919556, "epoch": 3.757517992608442, "grad_norm": 1.2265625, "learning_rate": 0.0003637902044256777, "loss": 4.9343, "mean_token_accuracy": 0.2126374363899231, "num_tokens": 83762378.0, "step": 48295 }, { "entropy": 5.799106740951538, "epoch": 3.7579070219801594, "grad_norm": 1.34375, "learning_rate": 0.0003637647374765269, "loss": 4.9437, "mean_token_accuracy": 0.21591161638498307, "num_tokens": 83770938.0, "step": 48300 }, { "entropy": 5.828741979598999, "epoch": 3.758296051351877, "grad_norm": 1.3515625, "learning_rate": 0.00036373926918051243, "loss": 4.9628, "mean_token_accuracy": 0.21620312780141832, "num_tokens": 83778676.0, "step": 48305 }, { "entropy": 5.8436661720275875, "epoch": 3.7586850807235948, "grad_norm": 1.40625, "learning_rate": 0.00036371379953802085, "loss": 4.9625, "mean_token_accuracy": 0.21631417274475098, "num_tokens": 83787764.0, "step": 48310 }, { "entropy": 5.840836429595948, "epoch": 3.7590741100953124, "grad_norm": 1.34375, "learning_rate": 0.00036368832854943856, "loss": 4.9855, "mean_token_accuracy": 0.20809491276741027, "num_tokens": 83795913.0, "step": 48315 }, { "entropy": 5.783054065704346, "epoch": 3.7594631394670297, "grad_norm": 1.3984375, "learning_rate": 0.00036366285621515206, "loss": 4.8056, "mean_token_accuracy": 0.21976333856582642, "num_tokens": 83805537.0, "step": 48320 }, { "entropy": 5.87347183227539, "epoch": 3.7598521688387474, "grad_norm": 1.34375, "learning_rate": 0.0003636373825355478, "loss": 4.9902, "mean_token_accuracy": 0.2108971431851387, "num_tokens": 83813411.0, "step": 48325 }, { "entropy": 5.818050575256348, "epoch": 3.7602411982104647, "grad_norm": 1.3515625, "learning_rate": 0.0003636119075110124, "loss": 5.0403, "mean_token_accuracy": 0.2088887944817543, "num_tokens": 83822110.0, "step": 48330 }, { "entropy": 5.839650344848633, "epoch": 3.7606302275821823, "grad_norm": 1.421875, "learning_rate": 0.0003635864311419323, "loss": 4.8932, "mean_token_accuracy": 0.2152543246746063, "num_tokens": 83830302.0, "step": 48335 }, { "entropy": 5.799525785446167, "epoch": 3.7610192569539, "grad_norm": 1.2578125, "learning_rate": 0.00036356095342869414, "loss": 4.8708, "mean_token_accuracy": 0.20947591513395308, "num_tokens": 83838595.0, "step": 48340 }, { "entropy": 5.834225225448608, "epoch": 3.7614082863256177, "grad_norm": 1.3359375, "learning_rate": 0.0003635354743716844, "loss": 4.9841, "mean_token_accuracy": 0.2055809110403061, "num_tokens": 83847036.0, "step": 48345 }, { "entropy": 5.824079275131226, "epoch": 3.761797315697335, "grad_norm": 1.34375, "learning_rate": 0.0003635099939712898, "loss": 4.963, "mean_token_accuracy": 0.20966092944145204, "num_tokens": 83855256.0, "step": 48350 }, { "entropy": 5.814299392700195, "epoch": 3.7621863450690527, "grad_norm": 1.3671875, "learning_rate": 0.00036348451222789694, "loss": 4.9302, "mean_token_accuracy": 0.21936452388763428, "num_tokens": 83864019.0, "step": 48355 }, { "entropy": 5.894895601272583, "epoch": 3.7625753744407704, "grad_norm": 1.3359375, "learning_rate": 0.00036345902914189246, "loss": 4.9765, "mean_token_accuracy": 0.21442191153764725, "num_tokens": 83873263.0, "step": 48360 }, { "entropy": 5.906649971008301, "epoch": 3.7629644038124876, "grad_norm": 1.3046875, "learning_rate": 0.000363433544713663, "loss": 5.0562, "mean_token_accuracy": 0.19790294766426086, "num_tokens": 83882226.0, "step": 48365 }, { "entropy": 5.85514121055603, "epoch": 3.7633534331842053, "grad_norm": 1.2421875, "learning_rate": 0.00036340805894359524, "loss": 4.8961, "mean_token_accuracy": 0.21866092532873155, "num_tokens": 83891140.0, "step": 48370 }, { "entropy": 5.810212898254394, "epoch": 3.763742462555923, "grad_norm": 1.359375, "learning_rate": 0.00036338257183207587, "loss": 4.9405, "mean_token_accuracy": 0.21859833747148513, "num_tokens": 83899183.0, "step": 48375 }, { "entropy": 5.821168422698975, "epoch": 3.7641314919276407, "grad_norm": 1.40625, "learning_rate": 0.00036335708337949165, "loss": 4.9436, "mean_token_accuracy": 0.21809978634119034, "num_tokens": 83907631.0, "step": 48380 }, { "entropy": 5.776226043701172, "epoch": 3.764520521299358, "grad_norm": 1.3359375, "learning_rate": 0.0003633315935862293, "loss": 4.8951, "mean_token_accuracy": 0.2195098429918289, "num_tokens": 83916201.0, "step": 48385 }, { "entropy": 5.798369884490967, "epoch": 3.7649095506710757, "grad_norm": 1.3671875, "learning_rate": 0.0003633061024526757, "loss": 4.9029, "mean_token_accuracy": 0.22767681926488875, "num_tokens": 83924566.0, "step": 48390 }, { "entropy": 5.818333101272583, "epoch": 3.7652985800427934, "grad_norm": 1.3359375, "learning_rate": 0.0003632806099792175, "loss": 4.9677, "mean_token_accuracy": 0.21128559708595276, "num_tokens": 83932766.0, "step": 48395 }, { "entropy": 5.772078895568848, "epoch": 3.7656876094145106, "grad_norm": 1.3203125, "learning_rate": 0.00036325511616624155, "loss": 4.8655, "mean_token_accuracy": 0.21537777930498123, "num_tokens": 83941068.0, "step": 48400 }, { "entropy": 5.838287115097046, "epoch": 3.7660766387862283, "grad_norm": 1.3125, "learning_rate": 0.0003632296210141348, "loss": 5.0418, "mean_token_accuracy": 0.2090058833360672, "num_tokens": 83950711.0, "step": 48405 }, { "entropy": 5.806191062927246, "epoch": 3.766465668157946, "grad_norm": 1.25, "learning_rate": 0.00036320412452328383, "loss": 4.9622, "mean_token_accuracy": 0.20874584168195726, "num_tokens": 83959712.0, "step": 48410 }, { "entropy": 5.787022066116333, "epoch": 3.7668546975296637, "grad_norm": 1.21875, "learning_rate": 0.0003631786266940757, "loss": 4.8882, "mean_token_accuracy": 0.22274709045886992, "num_tokens": 83968868.0, "step": 48415 }, { "entropy": 5.800261449813843, "epoch": 3.767243726901381, "grad_norm": 1.3671875, "learning_rate": 0.00036315312752689726, "loss": 4.8776, "mean_token_accuracy": 0.2169709771871567, "num_tokens": 83977620.0, "step": 48420 }, { "entropy": 5.844810581207275, "epoch": 3.7676327562730987, "grad_norm": 1.3828125, "learning_rate": 0.0003631276270221354, "loss": 4.9196, "mean_token_accuracy": 0.21665709912776948, "num_tokens": 83987057.0, "step": 48425 }, { "entropy": 5.8476512908935545, "epoch": 3.768021785644816, "grad_norm": 1.3671875, "learning_rate": 0.00036310212518017717, "loss": 4.9266, "mean_token_accuracy": 0.21090919822454451, "num_tokens": 83995851.0, "step": 48430 }, { "entropy": 5.807602882385254, "epoch": 3.7684108150165336, "grad_norm": 1.2890625, "learning_rate": 0.00036307662200140935, "loss": 4.9493, "mean_token_accuracy": 0.21116403192281724, "num_tokens": 84005276.0, "step": 48435 }, { "entropy": 5.854857397079468, "epoch": 3.7687998443882513, "grad_norm": 1.3046875, "learning_rate": 0.0003630511174862189, "loss": 5.0358, "mean_token_accuracy": 0.2053712233901024, "num_tokens": 84014259.0, "step": 48440 }, { "entropy": 5.831443119049072, "epoch": 3.769188873759969, "grad_norm": 1.34375, "learning_rate": 0.0003630256116349931, "loss": 4.986, "mean_token_accuracy": 0.21359857320785522, "num_tokens": 84023518.0, "step": 48445 }, { "entropy": 5.826215982437134, "epoch": 3.7695779031316863, "grad_norm": 1.3984375, "learning_rate": 0.0003630001044481186, "loss": 5.0728, "mean_token_accuracy": 0.20668771266937255, "num_tokens": 84032274.0, "step": 48450 }, { "entropy": 5.927637815475464, "epoch": 3.769966932503404, "grad_norm": 1.3359375, "learning_rate": 0.00036297459592598256, "loss": 5.0223, "mean_token_accuracy": 0.19547592848539352, "num_tokens": 84041334.0, "step": 48455 }, { "entropy": 5.802650117874146, "epoch": 3.7703559618751217, "grad_norm": 1.2734375, "learning_rate": 0.0003629490860689721, "loss": 4.9427, "mean_token_accuracy": 0.21322452425956726, "num_tokens": 84050443.0, "step": 48460 }, { "entropy": 5.762660312652588, "epoch": 3.770744991246839, "grad_norm": 1.34375, "learning_rate": 0.00036292357487747426, "loss": 4.9295, "mean_token_accuracy": 0.21096597611904144, "num_tokens": 84059130.0, "step": 48465 }, { "entropy": 5.78875150680542, "epoch": 3.7711340206185566, "grad_norm": 1.3828125, "learning_rate": 0.00036289806235187606, "loss": 4.889, "mean_token_accuracy": 0.2280278369784355, "num_tokens": 84068514.0, "step": 48470 }, { "entropy": 5.830624055862427, "epoch": 3.7715230499902743, "grad_norm": 1.3046875, "learning_rate": 0.0003628725484925647, "loss": 4.8599, "mean_token_accuracy": 0.21828019320964814, "num_tokens": 84076551.0, "step": 48475 }, { "entropy": 5.884550428390503, "epoch": 3.771912079361992, "grad_norm": 1.28125, "learning_rate": 0.00036284703329992734, "loss": 5.1021, "mean_token_accuracy": 0.19626906961202623, "num_tokens": 84086332.0, "step": 48480 }, { "entropy": 5.789857673645019, "epoch": 3.7723011087337093, "grad_norm": 1.46875, "learning_rate": 0.000362821516774351, "loss": 4.8735, "mean_token_accuracy": 0.22334207892417907, "num_tokens": 84094538.0, "step": 48485 }, { "entropy": 5.880123138427734, "epoch": 3.772690138105427, "grad_norm": 1.3515625, "learning_rate": 0.00036279599891622297, "loss": 4.955, "mean_token_accuracy": 0.21800560206174852, "num_tokens": 84104034.0, "step": 48490 }, { "entropy": 5.84079155921936, "epoch": 3.7730791674771447, "grad_norm": 1.4453125, "learning_rate": 0.00036277047972593036, "loss": 5.0083, "mean_token_accuracy": 0.20800113677978516, "num_tokens": 84112893.0, "step": 48495 }, { "entropy": 5.830702209472657, "epoch": 3.773468196848862, "grad_norm": 1.5078125, "learning_rate": 0.0003627449592038604, "loss": 4.9696, "mean_token_accuracy": 0.21530287116765975, "num_tokens": 84120805.0, "step": 48500 }, { "entropy": 5.852986526489258, "epoch": 3.7738572262205796, "grad_norm": 1.3359375, "learning_rate": 0.0003627194373504004, "loss": 4.9996, "mean_token_accuracy": 0.21532006561756134, "num_tokens": 84129355.0, "step": 48505 }, { "entropy": 5.7573154926300045, "epoch": 3.7742462555922973, "grad_norm": 1.375, "learning_rate": 0.00036269391416593753, "loss": 4.9166, "mean_token_accuracy": 0.21799196600914, "num_tokens": 84137302.0, "step": 48510 }, { "entropy": 5.8390590190887455, "epoch": 3.774635284964015, "grad_norm": 1.3203125, "learning_rate": 0.0003626683896508591, "loss": 5.0471, "mean_token_accuracy": 0.2056077778339386, "num_tokens": 84146164.0, "step": 48515 }, { "entropy": 5.79770336151123, "epoch": 3.7750243143357323, "grad_norm": 1.34375, "learning_rate": 0.0003626428638055524, "loss": 4.8721, "mean_token_accuracy": 0.2191590905189514, "num_tokens": 84154495.0, "step": 48520 }, { "entropy": 5.945783424377441, "epoch": 3.77541334370745, "grad_norm": 1.34375, "learning_rate": 0.00036261733663040473, "loss": 5.0461, "mean_token_accuracy": 0.2034660518169403, "num_tokens": 84163239.0, "step": 48525 }, { "entropy": 5.7983520984649655, "epoch": 3.775802373079167, "grad_norm": 1.3515625, "learning_rate": 0.00036259180812580347, "loss": 4.9309, "mean_token_accuracy": 0.21362552642822266, "num_tokens": 84171934.0, "step": 48530 }, { "entropy": 5.799714660644531, "epoch": 3.776191402450885, "grad_norm": 1.3125, "learning_rate": 0.00036256627829213585, "loss": 4.9679, "mean_token_accuracy": 0.20914807319641113, "num_tokens": 84180149.0, "step": 48535 }, { "entropy": 5.898070907592773, "epoch": 3.7765804318226026, "grad_norm": 1.3046875, "learning_rate": 0.00036254074712978947, "loss": 4.9452, "mean_token_accuracy": 0.21543501913547516, "num_tokens": 84188290.0, "step": 48540 }, { "entropy": 5.833294486999511, "epoch": 3.7769694611943203, "grad_norm": 1.2578125, "learning_rate": 0.00036251521463915144, "loss": 4.9551, "mean_token_accuracy": 0.20852415710687638, "num_tokens": 84196906.0, "step": 48545 }, { "entropy": 5.711188459396363, "epoch": 3.777358490566038, "grad_norm": 1.2890625, "learning_rate": 0.0003624896808206093, "loss": 4.8933, "mean_token_accuracy": 0.21267799735069276, "num_tokens": 84205416.0, "step": 48550 }, { "entropy": 5.888648796081543, "epoch": 3.7777475199377553, "grad_norm": 1.2734375, "learning_rate": 0.0003624641456745507, "loss": 5.1176, "mean_token_accuracy": 0.19581707566976547, "num_tokens": 84214279.0, "step": 48555 }, { "entropy": 5.919201612472534, "epoch": 3.778136549309473, "grad_norm": 1.3046875, "learning_rate": 0.00036243860920136283, "loss": 5.0185, "mean_token_accuracy": 0.20857841074466704, "num_tokens": 84222976.0, "step": 48560 }, { "entropy": 5.802114820480346, "epoch": 3.77852557868119, "grad_norm": 1.375, "learning_rate": 0.00036241307140143323, "loss": 4.9401, "mean_token_accuracy": 0.21161042004823685, "num_tokens": 84231315.0, "step": 48565 }, { "entropy": 5.791419267654419, "epoch": 3.778914608052908, "grad_norm": 1.3984375, "learning_rate": 0.00036238753227514934, "loss": 4.9495, "mean_token_accuracy": 0.21337804198265076, "num_tokens": 84239691.0, "step": 48570 }, { "entropy": 5.923977899551391, "epoch": 3.7793036374246256, "grad_norm": 1.4765625, "learning_rate": 0.00036236199182289883, "loss": 5.0443, "mean_token_accuracy": 0.2123708188533783, "num_tokens": 84247542.0, "step": 48575 }, { "entropy": 5.887360954284668, "epoch": 3.7796926667963433, "grad_norm": 1.3203125, "learning_rate": 0.000362336450045069, "loss": 5.1214, "mean_token_accuracy": 0.19930208325386048, "num_tokens": 84255843.0, "step": 48580 }, { "entropy": 5.801093196868896, "epoch": 3.7800816961680606, "grad_norm": 1.359375, "learning_rate": 0.00036231090694204763, "loss": 4.8982, "mean_token_accuracy": 0.21969557255506517, "num_tokens": 84264404.0, "step": 48585 }, { "entropy": 5.837015438079834, "epoch": 3.7804707255397783, "grad_norm": 1.328125, "learning_rate": 0.00036228536251422226, "loss": 4.9563, "mean_token_accuracy": 0.21417828351259233, "num_tokens": 84273596.0, "step": 48590 }, { "entropy": 5.799454021453857, "epoch": 3.780859754911496, "grad_norm": 1.390625, "learning_rate": 0.00036225981676198045, "loss": 4.8999, "mean_token_accuracy": 0.20973284542560577, "num_tokens": 84283138.0, "step": 48595 }, { "entropy": 5.779083347320556, "epoch": 3.781248784283213, "grad_norm": 1.28125, "learning_rate": 0.0003622342696857098, "loss": 4.871, "mean_token_accuracy": 0.22217762023210524, "num_tokens": 84291539.0, "step": 48600 }, { "entropy": 5.793572521209716, "epoch": 3.781637813654931, "grad_norm": 1.359375, "learning_rate": 0.0003622087212857979, "loss": 4.9261, "mean_token_accuracy": 0.21698725819587708, "num_tokens": 84299896.0, "step": 48605 }, { "entropy": 5.828293037414551, "epoch": 3.7820268430266486, "grad_norm": 1.375, "learning_rate": 0.0003621831715626325, "loss": 4.9686, "mean_token_accuracy": 0.2150304511189461, "num_tokens": 84308195.0, "step": 48610 }, { "entropy": 5.823771047592163, "epoch": 3.7824158723983663, "grad_norm": 1.2734375, "learning_rate": 0.00036215762051660115, "loss": 5.0023, "mean_token_accuracy": 0.20769840478897095, "num_tokens": 84316636.0, "step": 48615 }, { "entropy": 5.810335636138916, "epoch": 3.7828049017700835, "grad_norm": 1.296875, "learning_rate": 0.00036213206814809175, "loss": 4.945, "mean_token_accuracy": 0.21336653381586074, "num_tokens": 84325634.0, "step": 48620 }, { "entropy": 5.783508253097534, "epoch": 3.7831939311418012, "grad_norm": 1.25, "learning_rate": 0.0003621065144574919, "loss": 4.9139, "mean_token_accuracy": 0.21672100573778152, "num_tokens": 84334477.0, "step": 48625 }, { "entropy": 5.839821720123291, "epoch": 3.7835829605135185, "grad_norm": 1.34375, "learning_rate": 0.0003620809594451893, "loss": 5.0361, "mean_token_accuracy": 0.20775548070669175, "num_tokens": 84342738.0, "step": 48630 }, { "entropy": 5.882298803329467, "epoch": 3.783971989885236, "grad_norm": 1.3359375, "learning_rate": 0.0003620554031115718, "loss": 4.9916, "mean_token_accuracy": 0.2078528329730034, "num_tokens": 84351305.0, "step": 48635 }, { "entropy": 5.881942176818848, "epoch": 3.784361019256954, "grad_norm": 1.3515625, "learning_rate": 0.0003620298454570271, "loss": 4.9673, "mean_token_accuracy": 0.20643657743930816, "num_tokens": 84360500.0, "step": 48640 }, { "entropy": 5.83150634765625, "epoch": 3.7847500486286716, "grad_norm": 1.265625, "learning_rate": 0.0003620042864819429, "loss": 4.9752, "mean_token_accuracy": 0.20348582714796065, "num_tokens": 84369160.0, "step": 48645 }, { "entropy": 5.887395000457763, "epoch": 3.7851390780003893, "grad_norm": 1.3828125, "learning_rate": 0.0003619787261867072, "loss": 5.0527, "mean_token_accuracy": 0.20308317691087724, "num_tokens": 84377784.0, "step": 48650 }, { "entropy": 5.830001449584961, "epoch": 3.7855281073721065, "grad_norm": 1.296875, "learning_rate": 0.0003619531645717078, "loss": 4.9788, "mean_token_accuracy": 0.2100433126091957, "num_tokens": 84386502.0, "step": 48655 }, { "entropy": 5.843504142761231, "epoch": 3.7859171367438242, "grad_norm": 1.3359375, "learning_rate": 0.0003619276016373325, "loss": 5.0157, "mean_token_accuracy": 0.21280370205640792, "num_tokens": 84396100.0, "step": 48660 }, { "entropy": 5.85489935874939, "epoch": 3.7863061661155415, "grad_norm": 1.3359375, "learning_rate": 0.0003619020373839693, "loss": 4.9917, "mean_token_accuracy": 0.20506673008203508, "num_tokens": 84404917.0, "step": 48665 }, { "entropy": 5.834933137893676, "epoch": 3.786695195487259, "grad_norm": 1.359375, "learning_rate": 0.0003618764718120059, "loss": 4.9503, "mean_token_accuracy": 0.21615130305290223, "num_tokens": 84413510.0, "step": 48670 }, { "entropy": 5.83324556350708, "epoch": 3.787084224858977, "grad_norm": 1.3828125, "learning_rate": 0.0003618509049218304, "loss": 4.9997, "mean_token_accuracy": 0.20576532036066056, "num_tokens": 84421689.0, "step": 48675 }, { "entropy": 5.854380893707275, "epoch": 3.7874732542306946, "grad_norm": 1.3828125, "learning_rate": 0.00036182533671383056, "loss": 4.9759, "mean_token_accuracy": 0.20757880359888076, "num_tokens": 84430362.0, "step": 48680 }, { "entropy": 5.76218695640564, "epoch": 3.787862283602412, "grad_norm": 1.3984375, "learning_rate": 0.0003617997671883944, "loss": 4.8881, "mean_token_accuracy": 0.21865827292203904, "num_tokens": 84438066.0, "step": 48685 }, { "entropy": 5.7609316349029545, "epoch": 3.7882513129741295, "grad_norm": 1.2734375, "learning_rate": 0.00036177419634591, "loss": 4.8714, "mean_token_accuracy": 0.22291107773780822, "num_tokens": 84446995.0, "step": 48690 }, { "entropy": 5.779483032226563, "epoch": 3.7886403423458472, "grad_norm": 1.265625, "learning_rate": 0.0003617486241867654, "loss": 4.9925, "mean_token_accuracy": 0.2110195755958557, "num_tokens": 84455879.0, "step": 48695 }, { "entropy": 5.8409946918487545, "epoch": 3.7890293717175645, "grad_norm": 1.2890625, "learning_rate": 0.0003617230507113483, "loss": 4.8569, "mean_token_accuracy": 0.22014521956443786, "num_tokens": 84464006.0, "step": 48700 }, { "entropy": 5.838992500305176, "epoch": 3.789418401089282, "grad_norm": 1.296875, "learning_rate": 0.00036169747592004704, "loss": 4.9614, "mean_token_accuracy": 0.20618660897016525, "num_tokens": 84472116.0, "step": 48705 }, { "entropy": 5.79349718093872, "epoch": 3.789807430461, "grad_norm": 1.28125, "learning_rate": 0.00036167189981324956, "loss": 5.0253, "mean_token_accuracy": 0.20356460958719252, "num_tokens": 84481303.0, "step": 48710 }, { "entropy": 5.8566381454467775, "epoch": 3.7901964598327176, "grad_norm": 1.2890625, "learning_rate": 0.000361646322391344, "loss": 4.8985, "mean_token_accuracy": 0.21523540318012238, "num_tokens": 84490920.0, "step": 48715 }, { "entropy": 5.783842134475708, "epoch": 3.790585489204435, "grad_norm": 1.390625, "learning_rate": 0.0003616207436547183, "loss": 4.9077, "mean_token_accuracy": 0.21721881181001662, "num_tokens": 84498904.0, "step": 48720 }, { "entropy": 5.8566141605377195, "epoch": 3.7909745185761525, "grad_norm": 1.390625, "learning_rate": 0.00036159516360376084, "loss": 5.0662, "mean_token_accuracy": 0.2059092715382576, "num_tokens": 84507718.0, "step": 48725 }, { "entropy": 5.805056428909301, "epoch": 3.7913635479478702, "grad_norm": 1.2421875, "learning_rate": 0.00036156958223885945, "loss": 4.974, "mean_token_accuracy": 0.21123512387275695, "num_tokens": 84516859.0, "step": 48730 }, { "entropy": 5.926212024688721, "epoch": 3.7917525773195875, "grad_norm": 1.3125, "learning_rate": 0.0003615439995604025, "loss": 5.0448, "mean_token_accuracy": 0.2085440382361412, "num_tokens": 84526554.0, "step": 48735 }, { "entropy": 5.8490149974823, "epoch": 3.792141606691305, "grad_norm": 1.34375, "learning_rate": 0.0003615184155687781, "loss": 4.9305, "mean_token_accuracy": 0.21230135411024093, "num_tokens": 84535884.0, "step": 48740 }, { "entropy": 5.812066650390625, "epoch": 3.792530636063023, "grad_norm": 1.3359375, "learning_rate": 0.00036149283026437444, "loss": 4.8924, "mean_token_accuracy": 0.21878253817558288, "num_tokens": 84544022.0, "step": 48745 }, { "entropy": 5.833692121505737, "epoch": 3.7929196654347406, "grad_norm": 1.265625, "learning_rate": 0.00036146724364757984, "loss": 5.0514, "mean_token_accuracy": 0.1971220627427101, "num_tokens": 84553408.0, "step": 48750 }, { "entropy": 5.8201329708099365, "epoch": 3.793308694806458, "grad_norm": 1.2421875, "learning_rate": 0.00036144165571878233, "loss": 4.9588, "mean_token_accuracy": 0.2040382981300354, "num_tokens": 84562794.0, "step": 48755 }, { "entropy": 5.784755373001099, "epoch": 3.7936977241781755, "grad_norm": 1.390625, "learning_rate": 0.0003614160664783703, "loss": 4.8454, "mean_token_accuracy": 0.22831971496343612, "num_tokens": 84571064.0, "step": 48760 }, { "entropy": 5.8548407554626465, "epoch": 3.7940867535498928, "grad_norm": 1.40625, "learning_rate": 0.000361390475926732, "loss": 4.942, "mean_token_accuracy": 0.21852607429027557, "num_tokens": 84579343.0, "step": 48765 }, { "entropy": 5.827999925613403, "epoch": 3.7944757829216105, "grad_norm": 1.3203125, "learning_rate": 0.0003613648840642558, "loss": 5.0497, "mean_token_accuracy": 0.20469321310520172, "num_tokens": 84587726.0, "step": 48770 }, { "entropy": 5.789610862731934, "epoch": 3.794864812293328, "grad_norm": 1.3125, "learning_rate": 0.0003613392908913299, "loss": 4.9346, "mean_token_accuracy": 0.20626401752233506, "num_tokens": 84596293.0, "step": 48775 }, { "entropy": 5.8335583209991455, "epoch": 3.795253841665046, "grad_norm": 1.40625, "learning_rate": 0.0003613136964083427, "loss": 4.9837, "mean_token_accuracy": 0.20884871184825898, "num_tokens": 84605102.0, "step": 48780 }, { "entropy": 5.918741989135742, "epoch": 3.795642871036763, "grad_norm": 1.34375, "learning_rate": 0.0003612881006156826, "loss": 5.0166, "mean_token_accuracy": 0.20377491116523744, "num_tokens": 84613696.0, "step": 48785 }, { "entropy": 5.899913167953491, "epoch": 3.796031900408481, "grad_norm": 1.3515625, "learning_rate": 0.00036126250351373786, "loss": 4.9932, "mean_token_accuracy": 0.2116442784667015, "num_tokens": 84622439.0, "step": 48790 }, { "entropy": 5.840698194503784, "epoch": 3.7964209297801985, "grad_norm": 1.3125, "learning_rate": 0.00036123690510289684, "loss": 4.9782, "mean_token_accuracy": 0.20821156352758408, "num_tokens": 84631167.0, "step": 48795 }, { "entropy": 5.861980199813843, "epoch": 3.7968099591519158, "grad_norm": 1.4453125, "learning_rate": 0.0003612113053835482, "loss": 5.0409, "mean_token_accuracy": 0.20492637306451797, "num_tokens": 84640130.0, "step": 48800 }, { "entropy": 5.93357834815979, "epoch": 3.7971989885236335, "grad_norm": 1.3359375, "learning_rate": 0.0003611857043560801, "loss": 5.0966, "mean_token_accuracy": 0.20355633944272994, "num_tokens": 84648719.0, "step": 48805 }, { "entropy": 5.872951555252075, "epoch": 3.797588017895351, "grad_norm": 1.4609375, "learning_rate": 0.0003611601020208812, "loss": 4.9626, "mean_token_accuracy": 0.2101375177502632, "num_tokens": 84656891.0, "step": 48810 }, { "entropy": 5.878057622909546, "epoch": 3.797977047267069, "grad_norm": 1.40625, "learning_rate": 0.0003611344983783398, "loss": 4.9772, "mean_token_accuracy": 0.2122435003519058, "num_tokens": 84665678.0, "step": 48815 }, { "entropy": 5.846224212646485, "epoch": 3.798366076638786, "grad_norm": 1.359375, "learning_rate": 0.0003611088934288445, "loss": 4.9182, "mean_token_accuracy": 0.21757938712835312, "num_tokens": 84674112.0, "step": 48820 }, { "entropy": 5.822405242919922, "epoch": 3.798755106010504, "grad_norm": 1.3125, "learning_rate": 0.00036108328717278387, "loss": 4.9854, "mean_token_accuracy": 0.2094452992081642, "num_tokens": 84682294.0, "step": 48825 }, { "entropy": 5.773156976699829, "epoch": 3.7991441353822215, "grad_norm": 1.4921875, "learning_rate": 0.00036105767961054636, "loss": 4.9076, "mean_token_accuracy": 0.21801881343126298, "num_tokens": 84690399.0, "step": 48830 }, { "entropy": 5.826015043258667, "epoch": 3.7995331647539388, "grad_norm": 1.4921875, "learning_rate": 0.0003610320707425205, "loss": 4.9627, "mean_token_accuracy": 0.210828098654747, "num_tokens": 84698451.0, "step": 48835 }, { "entropy": 5.887451076507569, "epoch": 3.7999221941256565, "grad_norm": 1.2890625, "learning_rate": 0.000361006460569095, "loss": 4.9594, "mean_token_accuracy": 0.21318381875753403, "num_tokens": 84707808.0, "step": 48840 }, { "entropy": 5.89284987449646, "epoch": 3.800311223497374, "grad_norm": 1.3125, "learning_rate": 0.00036098084909065814, "loss": 5.0051, "mean_token_accuracy": 0.2100688636302948, "num_tokens": 84716915.0, "step": 48845 }, { "entropy": 5.793128967285156, "epoch": 3.800700252869092, "grad_norm": 1.3984375, "learning_rate": 0.0003609552363075989, "loss": 4.9192, "mean_token_accuracy": 0.21636297553777695, "num_tokens": 84724691.0, "step": 48850 }, { "entropy": 5.813654088973999, "epoch": 3.801089282240809, "grad_norm": 1.4296875, "learning_rate": 0.00036092962222030573, "loss": 4.9448, "mean_token_accuracy": 0.2112610772252083, "num_tokens": 84733680.0, "step": 48855 }, { "entropy": 5.8252075672149655, "epoch": 3.801478311612527, "grad_norm": 1.28125, "learning_rate": 0.0003609040068291673, "loss": 4.934, "mean_token_accuracy": 0.21581392884254455, "num_tokens": 84742722.0, "step": 48860 }, { "entropy": 5.7841743469238285, "epoch": 3.801867340984244, "grad_norm": 1.2734375, "learning_rate": 0.0003608783901345724, "loss": 4.9211, "mean_token_accuracy": 0.21458810269832612, "num_tokens": 84751320.0, "step": 48865 }, { "entropy": 5.7897566795349125, "epoch": 3.8022563703559618, "grad_norm": 1.265625, "learning_rate": 0.00036085277213690947, "loss": 4.9583, "mean_token_accuracy": 0.21601708382368087, "num_tokens": 84759905.0, "step": 48870 }, { "entropy": 5.838065099716187, "epoch": 3.8026453997276795, "grad_norm": 1.2265625, "learning_rate": 0.0003608271528365675, "loss": 5.0385, "mean_token_accuracy": 0.2021871864795685, "num_tokens": 84768821.0, "step": 48875 }, { "entropy": 5.841078281402588, "epoch": 3.803034429099397, "grad_norm": 1.4140625, "learning_rate": 0.000360801532233935, "loss": 4.9101, "mean_token_accuracy": 0.214129738509655, "num_tokens": 84776809.0, "step": 48880 }, { "entropy": 5.758487319946289, "epoch": 3.8034234584711144, "grad_norm": 1.3515625, "learning_rate": 0.0003607759103294008, "loss": 4.9327, "mean_token_accuracy": 0.21285419762134553, "num_tokens": 84785043.0, "step": 48885 }, { "entropy": 5.771352481842041, "epoch": 3.803812487842832, "grad_norm": 1.3046875, "learning_rate": 0.0003607502871233538, "loss": 4.9188, "mean_token_accuracy": 0.21468260139226913, "num_tokens": 84793369.0, "step": 48890 }, { "entropy": 5.734653806686401, "epoch": 3.80420151721455, "grad_norm": 1.46875, "learning_rate": 0.0003607246626161826, "loss": 4.8643, "mean_token_accuracy": 0.21801047921180725, "num_tokens": 84801792.0, "step": 48895 }, { "entropy": 5.801765108108521, "epoch": 3.804590546586267, "grad_norm": 1.3515625, "learning_rate": 0.000360699036808276, "loss": 4.9464, "mean_token_accuracy": 0.20978812128305435, "num_tokens": 84810381.0, "step": 48900 }, { "entropy": 5.846736812591553, "epoch": 3.8049795759579847, "grad_norm": 1.296875, "learning_rate": 0.0003606734097000231, "loss": 4.8856, "mean_token_accuracy": 0.2180555745959282, "num_tokens": 84818979.0, "step": 48905 }, { "entropy": 5.766612529754639, "epoch": 3.8053686053297024, "grad_norm": 1.296875, "learning_rate": 0.0003606477812918125, "loss": 4.8987, "mean_token_accuracy": 0.2203069493174553, "num_tokens": 84827844.0, "step": 48910 }, { "entropy": 5.776808881759644, "epoch": 3.80575763470142, "grad_norm": 1.421875, "learning_rate": 0.0003606221515840331, "loss": 4.947, "mean_token_accuracy": 0.21326467096805574, "num_tokens": 84836336.0, "step": 48915 }, { "entropy": 5.819552850723267, "epoch": 3.8061466640731374, "grad_norm": 1.4140625, "learning_rate": 0.00036059652057707394, "loss": 4.9624, "mean_token_accuracy": 0.21656699925661088, "num_tokens": 84844340.0, "step": 48920 }, { "entropy": 5.819410371780395, "epoch": 3.806535693444855, "grad_norm": 1.2734375, "learning_rate": 0.0003605708882713237, "loss": 4.9105, "mean_token_accuracy": 0.21685645580291749, "num_tokens": 84853201.0, "step": 48925 }, { "entropy": 5.7838763236999515, "epoch": 3.806924722816573, "grad_norm": 1.40625, "learning_rate": 0.00036054525466717145, "loss": 5.0118, "mean_token_accuracy": 0.21140268743038176, "num_tokens": 84861764.0, "step": 48930 }, { "entropy": 5.744043397903442, "epoch": 3.80731375218829, "grad_norm": 1.1796875, "learning_rate": 0.0003605196197650062, "loss": 4.9118, "mean_token_accuracy": 0.21193576604127884, "num_tokens": 84870536.0, "step": 48935 }, { "entropy": 5.945646190643311, "epoch": 3.8077027815600077, "grad_norm": 1.359375, "learning_rate": 0.0003604939835652167, "loss": 5.0735, "mean_token_accuracy": 0.19973887950181962, "num_tokens": 84879258.0, "step": 48940 }, { "entropy": 5.7939708709716795, "epoch": 3.8080918109317254, "grad_norm": 1.3359375, "learning_rate": 0.00036046834606819224, "loss": 4.8557, "mean_token_accuracy": 0.22349457293748856, "num_tokens": 84888212.0, "step": 48945 }, { "entropy": 5.851326847076416, "epoch": 3.808480840303443, "grad_norm": 1.3125, "learning_rate": 0.0003604427072743216, "loss": 4.9854, "mean_token_accuracy": 0.21409573554992675, "num_tokens": 84896877.0, "step": 48950 }, { "entropy": 5.83500485420227, "epoch": 3.8088698696751604, "grad_norm": 1.3828125, "learning_rate": 0.00036041706718399386, "loss": 4.9864, "mean_token_accuracy": 0.21045442521572114, "num_tokens": 84905594.0, "step": 48955 }, { "entropy": 5.807290697097779, "epoch": 3.809258899046878, "grad_norm": 1.3984375, "learning_rate": 0.000360391425797598, "loss": 4.9412, "mean_token_accuracy": 0.21446073800325394, "num_tokens": 84914658.0, "step": 48960 }, { "entropy": 5.922214651107788, "epoch": 3.8096479284185953, "grad_norm": 1.4453125, "learning_rate": 0.0003603657831155233, "loss": 5.055, "mean_token_accuracy": 0.20582695454359054, "num_tokens": 84924053.0, "step": 48965 }, { "entropy": 5.775275802612304, "epoch": 3.810036957790313, "grad_norm": 1.4453125, "learning_rate": 0.0003603401391381587, "loss": 4.8809, "mean_token_accuracy": 0.21884724199771882, "num_tokens": 84932445.0, "step": 48970 }, { "entropy": 5.770928955078125, "epoch": 3.8104259871620307, "grad_norm": 1.3046875, "learning_rate": 0.00036031449386589326, "loss": 4.9324, "mean_token_accuracy": 0.21593151539564132, "num_tokens": 84940889.0, "step": 48975 }, { "entropy": 5.806207323074341, "epoch": 3.8108150165337484, "grad_norm": 1.34375, "learning_rate": 0.0003602888472991162, "loss": 5.0058, "mean_token_accuracy": 0.20284946113824845, "num_tokens": 84949314.0, "step": 48980 }, { "entropy": 5.820714378356934, "epoch": 3.811204045905466, "grad_norm": 1.3203125, "learning_rate": 0.00036026319943821664, "loss": 4.9551, "mean_token_accuracy": 0.21633493304252624, "num_tokens": 84958313.0, "step": 48985 }, { "entropy": 5.862692260742188, "epoch": 3.8115930752771834, "grad_norm": 1.328125, "learning_rate": 0.0003602375502835837, "loss": 5.0002, "mean_token_accuracy": 0.20898137837648392, "num_tokens": 84967367.0, "step": 48990 }, { "entropy": 5.910060071945191, "epoch": 3.811982104648901, "grad_norm": 1.390625, "learning_rate": 0.00036021189983560667, "loss": 5.0699, "mean_token_accuracy": 0.20836044400930404, "num_tokens": 84975890.0, "step": 48995 }, { "entropy": 5.893674278259278, "epoch": 3.8123711340206183, "grad_norm": 1.2421875, "learning_rate": 0.00036018624809467466, "loss": 4.9914, "mean_token_accuracy": 0.20706280320882797, "num_tokens": 84985089.0, "step": 49000 }, { "entropy": 5.829015827178955, "epoch": 3.812760163392336, "grad_norm": 1.3515625, "learning_rate": 0.00036016059506117687, "loss": 4.9775, "mean_token_accuracy": 0.21024179011583327, "num_tokens": 84993825.0, "step": 49005 }, { "entropy": 5.9160871505737305, "epoch": 3.8131491927640537, "grad_norm": 1.328125, "learning_rate": 0.0003601349407355027, "loss": 5.0505, "mean_token_accuracy": 0.20740169733762742, "num_tokens": 85003301.0, "step": 49010 }, { "entropy": 5.905595064163208, "epoch": 3.8135382221357714, "grad_norm": 1.3515625, "learning_rate": 0.0003601092851180412, "loss": 5.0521, "mean_token_accuracy": 0.19992605894804, "num_tokens": 85012082.0, "step": 49015 }, { "entropy": 5.917457962036133, "epoch": 3.8139272515074887, "grad_norm": 1.3359375, "learning_rate": 0.00036008362820918186, "loss": 4.9853, "mean_token_accuracy": 0.21145561933517457, "num_tokens": 85021299.0, "step": 49020 }, { "entropy": 5.825619840621949, "epoch": 3.8143162808792064, "grad_norm": 1.3359375, "learning_rate": 0.0003600579700093138, "loss": 4.9561, "mean_token_accuracy": 0.21273563653230668, "num_tokens": 85030418.0, "step": 49025 }, { "entropy": 5.851525497436524, "epoch": 3.814705310250924, "grad_norm": 1.375, "learning_rate": 0.00036003231051882646, "loss": 4.9635, "mean_token_accuracy": 0.21241436302661895, "num_tokens": 85038780.0, "step": 49030 }, { "entropy": 5.897209787368775, "epoch": 3.8150943396226413, "grad_norm": 1.3671875, "learning_rate": 0.00036000664973810914, "loss": 5.0458, "mean_token_accuracy": 0.21098894029855728, "num_tokens": 85048456.0, "step": 49035 }, { "entropy": 5.847082328796387, "epoch": 3.815483368994359, "grad_norm": 1.296875, "learning_rate": 0.0003599809876675513, "loss": 4.9491, "mean_token_accuracy": 0.21175657212734222, "num_tokens": 85057058.0, "step": 49040 }, { "entropy": 5.872491550445557, "epoch": 3.8158723983660767, "grad_norm": 1.296875, "learning_rate": 0.00035995532430754205, "loss": 4.9534, "mean_token_accuracy": 0.2124190866947174, "num_tokens": 85066156.0, "step": 49045 }, { "entropy": 5.933010292053223, "epoch": 3.8162614277377944, "grad_norm": 1.4609375, "learning_rate": 0.0003599296596584711, "loss": 5.014, "mean_token_accuracy": 0.21091632246971131, "num_tokens": 85075412.0, "step": 49050 }, { "entropy": 5.907699108123779, "epoch": 3.8166504571095117, "grad_norm": 1.265625, "learning_rate": 0.0003599039937207278, "loss": 5.0509, "mean_token_accuracy": 0.20497860312461852, "num_tokens": 85085140.0, "step": 49055 }, { "entropy": 5.817267370223999, "epoch": 3.8170394864812294, "grad_norm": 1.3515625, "learning_rate": 0.0003598783264947015, "loss": 4.9384, "mean_token_accuracy": 0.21629407554864882, "num_tokens": 85093707.0, "step": 49060 }, { "entropy": 5.7762383937835695, "epoch": 3.8174285158529466, "grad_norm": 1.3515625, "learning_rate": 0.00035985265798078165, "loss": 4.8585, "mean_token_accuracy": 0.21627053767442703, "num_tokens": 85102060.0, "step": 49065 }, { "entropy": 5.798580503463745, "epoch": 3.8178175452246643, "grad_norm": 1.3359375, "learning_rate": 0.00035982698817935783, "loss": 4.8912, "mean_token_accuracy": 0.2179502561688423, "num_tokens": 85110603.0, "step": 49070 }, { "entropy": 5.89895920753479, "epoch": 3.818206574596382, "grad_norm": 1.3828125, "learning_rate": 0.0003598013170908194, "loss": 4.9714, "mean_token_accuracy": 0.21402051895856858, "num_tokens": 85118371.0, "step": 49075 }, { "entropy": 5.874801683425903, "epoch": 3.8185956039680997, "grad_norm": 1.375, "learning_rate": 0.0003597756447155559, "loss": 4.9844, "mean_token_accuracy": 0.20828340500593184, "num_tokens": 85127498.0, "step": 49080 }, { "entropy": 5.8881415843963625, "epoch": 3.8189846333398174, "grad_norm": 1.4140625, "learning_rate": 0.00035974997105395705, "loss": 5.0263, "mean_token_accuracy": 0.20638489574193955, "num_tokens": 85136321.0, "step": 49085 }, { "entropy": 5.860600757598877, "epoch": 3.8193736627115347, "grad_norm": 1.296875, "learning_rate": 0.00035972429610641224, "loss": 4.9942, "mean_token_accuracy": 0.20527956783771514, "num_tokens": 85144509.0, "step": 49090 }, { "entropy": 5.933435010910034, "epoch": 3.8197626920832524, "grad_norm": 1.234375, "learning_rate": 0.00035969861987331114, "loss": 5.0329, "mean_token_accuracy": 0.210202956199646, "num_tokens": 85153151.0, "step": 49095 }, { "entropy": 5.833591175079346, "epoch": 3.8201517214549696, "grad_norm": 1.3828125, "learning_rate": 0.0003596729423550433, "loss": 4.9866, "mean_token_accuracy": 0.20770467668771744, "num_tokens": 85161481.0, "step": 49100 }, { "entropy": 5.867092561721802, "epoch": 3.8205407508266873, "grad_norm": 1.3203125, "learning_rate": 0.0003596472635519983, "loss": 4.9564, "mean_token_accuracy": 0.2152809128165245, "num_tokens": 85170540.0, "step": 49105 }, { "entropy": 5.861092233657837, "epoch": 3.820929780198405, "grad_norm": 1.3125, "learning_rate": 0.0003596215834645657, "loss": 5.0082, "mean_token_accuracy": 0.21379568427801132, "num_tokens": 85179559.0, "step": 49110 }, { "entropy": 5.87436957359314, "epoch": 3.8213188095701227, "grad_norm": 1.4609375, "learning_rate": 0.00035959590209313537, "loss": 4.895, "mean_token_accuracy": 0.21818482875823975, "num_tokens": 85187877.0, "step": 49115 }, { "entropy": 5.917864608764648, "epoch": 3.82170783894184, "grad_norm": 1.3828125, "learning_rate": 0.0003595702194380968, "loss": 4.9579, "mean_token_accuracy": 0.21328954249620438, "num_tokens": 85196909.0, "step": 49120 }, { "entropy": 5.756791019439698, "epoch": 3.8220968683135577, "grad_norm": 1.2890625, "learning_rate": 0.00035954453549983984, "loss": 4.8617, "mean_token_accuracy": 0.21659204065799714, "num_tokens": 85205647.0, "step": 49125 }, { "entropy": 5.840299797058106, "epoch": 3.8224858976852754, "grad_norm": 1.4453125, "learning_rate": 0.00035951885027875406, "loss": 4.9893, "mean_token_accuracy": 0.2022796481847763, "num_tokens": 85214533.0, "step": 49130 }, { "entropy": 5.88367919921875, "epoch": 3.8228749270569926, "grad_norm": 1.2734375, "learning_rate": 0.00035949316377522934, "loss": 5.0608, "mean_token_accuracy": 0.19772978276014327, "num_tokens": 85222658.0, "step": 49135 }, { "entropy": 5.919039726257324, "epoch": 3.8232639564287103, "grad_norm": 1.234375, "learning_rate": 0.0003594674759896553, "loss": 5.0434, "mean_token_accuracy": 0.20760378688573838, "num_tokens": 85231547.0, "step": 49140 }, { "entropy": 5.827676820755005, "epoch": 3.823652985800428, "grad_norm": 1.2890625, "learning_rate": 0.0003594417869224217, "loss": 4.9801, "mean_token_accuracy": 0.2080204501748085, "num_tokens": 85240494.0, "step": 49145 }, { "entropy": 5.818362903594971, "epoch": 3.8240420151721457, "grad_norm": 1.3203125, "learning_rate": 0.00035941609657391845, "loss": 4.8763, "mean_token_accuracy": 0.2202179476618767, "num_tokens": 85248887.0, "step": 49150 }, { "entropy": 5.913600015640259, "epoch": 3.824431044543863, "grad_norm": 1.4375, "learning_rate": 0.0003593904049445353, "loss": 5.023, "mean_token_accuracy": 0.2049435257911682, "num_tokens": 85257472.0, "step": 49155 }, { "entropy": 5.7878501415252686, "epoch": 3.8248200739155807, "grad_norm": 1.3203125, "learning_rate": 0.00035936471203466206, "loss": 4.9227, "mean_token_accuracy": 0.21116316616535186, "num_tokens": 85265809.0, "step": 49160 }, { "entropy": 5.823646450042725, "epoch": 3.8252091032872984, "grad_norm": 1.359375, "learning_rate": 0.0003593390178446886, "loss": 5.0381, "mean_token_accuracy": 0.2065015584230423, "num_tokens": 85273933.0, "step": 49165 }, { "entropy": 5.88758339881897, "epoch": 3.8255981326590156, "grad_norm": 1.421875, "learning_rate": 0.0003593133223750047, "loss": 5.0161, "mean_token_accuracy": 0.20738818794488906, "num_tokens": 85281916.0, "step": 49170 }, { "entropy": 5.888295221328735, "epoch": 3.8259871620307333, "grad_norm": 1.296875, "learning_rate": 0.0003592876256260004, "loss": 4.9596, "mean_token_accuracy": 0.20917081385850905, "num_tokens": 85291613.0, "step": 49175 }, { "entropy": 5.892066431045532, "epoch": 3.826376191402451, "grad_norm": 1.3125, "learning_rate": 0.0003592619275980656, "loss": 5.0506, "mean_token_accuracy": 0.19545816034078597, "num_tokens": 85300027.0, "step": 49180 }, { "entropy": 5.9067565441131595, "epoch": 3.8267652207741687, "grad_norm": 1.296875, "learning_rate": 0.00035923622829159014, "loss": 4.9963, "mean_token_accuracy": 0.2055863246321678, "num_tokens": 85309251.0, "step": 49185 }, { "entropy": 5.802900266647339, "epoch": 3.827154250145886, "grad_norm": 1.40625, "learning_rate": 0.0003592105277069639, "loss": 4.8904, "mean_token_accuracy": 0.21664747595787048, "num_tokens": 85316849.0, "step": 49190 }, { "entropy": 5.845590829849243, "epoch": 3.8275432795176036, "grad_norm": 1.359375, "learning_rate": 0.000359184825844577, "loss": 4.988, "mean_token_accuracy": 0.2100598230957985, "num_tokens": 85325673.0, "step": 49195 }, { "entropy": 5.840467071533203, "epoch": 3.827932308889321, "grad_norm": 1.328125, "learning_rate": 0.00035915912270481935, "loss": 4.9556, "mean_token_accuracy": 0.2144727438688278, "num_tokens": 85334485.0, "step": 49200 }, { "entropy": 5.805123519897461, "epoch": 3.8283213382610386, "grad_norm": 1.3203125, "learning_rate": 0.000359133418288081, "loss": 4.965, "mean_token_accuracy": 0.2171440452337265, "num_tokens": 85342459.0, "step": 49205 }, { "entropy": 5.907907724380493, "epoch": 3.8287103676327563, "grad_norm": 1.328125, "learning_rate": 0.00035910771259475187, "loss": 4.9782, "mean_token_accuracy": 0.20903581976890565, "num_tokens": 85351163.0, "step": 49210 }, { "entropy": 5.916124248504639, "epoch": 3.829099397004474, "grad_norm": 1.453125, "learning_rate": 0.0003590820056252222, "loss": 5.0259, "mean_token_accuracy": 0.20486657470464706, "num_tokens": 85359378.0, "step": 49215 }, { "entropy": 5.893926620483398, "epoch": 3.8294884263761912, "grad_norm": 1.2890625, "learning_rate": 0.0003590562973798818, "loss": 5.0569, "mean_token_accuracy": 0.207001930475235, "num_tokens": 85368113.0, "step": 49220 }, { "entropy": 5.85130205154419, "epoch": 3.829877455747909, "grad_norm": 1.359375, "learning_rate": 0.0003590305878591209, "loss": 4.9822, "mean_token_accuracy": 0.20776110887527466, "num_tokens": 85376757.0, "step": 49225 }, { "entropy": 5.916703796386718, "epoch": 3.8302664851196266, "grad_norm": 1.3203125, "learning_rate": 0.00035900487706332963, "loss": 5.1081, "mean_token_accuracy": 0.2025681123137474, "num_tokens": 85385382.0, "step": 49230 }, { "entropy": 5.8517083644866945, "epoch": 3.830655514491344, "grad_norm": 1.3125, "learning_rate": 0.000358979164992898, "loss": 4.8955, "mean_token_accuracy": 0.2228225514292717, "num_tokens": 85393947.0, "step": 49235 }, { "entropy": 5.828955411911011, "epoch": 3.8310445438630616, "grad_norm": 1.359375, "learning_rate": 0.00035895345164821624, "loss": 4.8867, "mean_token_accuracy": 0.21589026004076003, "num_tokens": 85402083.0, "step": 49240 }, { "entropy": 5.807473993301391, "epoch": 3.8314335732347793, "grad_norm": 1.359375, "learning_rate": 0.0003589277370296745, "loss": 4.9941, "mean_token_accuracy": 0.21332136690616607, "num_tokens": 85410589.0, "step": 49245 }, { "entropy": 5.8852574825286865, "epoch": 3.831822602606497, "grad_norm": 1.3203125, "learning_rate": 0.00035890202113766283, "loss": 5.0111, "mean_token_accuracy": 0.21006011515855788, "num_tokens": 85419413.0, "step": 49250 }, { "entropy": 5.921030282974243, "epoch": 3.8322116319782142, "grad_norm": 1.3046875, "learning_rate": 0.00035887630397257167, "loss": 5.036, "mean_token_accuracy": 0.20615812987089158, "num_tokens": 85428539.0, "step": 49255 }, { "entropy": 5.825006198883057, "epoch": 3.832600661349932, "grad_norm": 1.5234375, "learning_rate": 0.000358850585534791, "loss": 4.9701, "mean_token_accuracy": 0.21779797226190567, "num_tokens": 85437260.0, "step": 49260 }, { "entropy": 5.8461182594299315, "epoch": 3.8329896907216496, "grad_norm": 1.3515625, "learning_rate": 0.00035882486582471124, "loss": 5.0003, "mean_token_accuracy": 0.21387769132852555, "num_tokens": 85446026.0, "step": 49265 }, { "entropy": 5.87969012260437, "epoch": 3.833378720093367, "grad_norm": 1.2890625, "learning_rate": 0.0003587991448427225, "loss": 5.033, "mean_token_accuracy": 0.20429582744836808, "num_tokens": 85455024.0, "step": 49270 }, { "entropy": 5.8051728248596195, "epoch": 3.8337677494650846, "grad_norm": 1.25, "learning_rate": 0.00035877342258921514, "loss": 4.8945, "mean_token_accuracy": 0.21967740952968598, "num_tokens": 85464089.0, "step": 49275 }, { "entropy": 5.883025312423706, "epoch": 3.8341567788368023, "grad_norm": 1.4453125, "learning_rate": 0.00035874769906457936, "loss": 5.0275, "mean_token_accuracy": 0.20495638102293015, "num_tokens": 85471909.0, "step": 49280 }, { "entropy": 5.770825958251953, "epoch": 3.83454580820852, "grad_norm": 1.3984375, "learning_rate": 0.00035872197426920567, "loss": 4.8437, "mean_token_accuracy": 0.2271902084350586, "num_tokens": 85480291.0, "step": 49285 }, { "entropy": 5.798993968963623, "epoch": 3.8349348375802372, "grad_norm": 1.4609375, "learning_rate": 0.0003586962482034842, "loss": 4.8507, "mean_token_accuracy": 0.22654800564050676, "num_tokens": 85489155.0, "step": 49290 }, { "entropy": 5.747691059112549, "epoch": 3.835323866951955, "grad_norm": 1.3984375, "learning_rate": 0.00035867052086780544, "loss": 4.8745, "mean_token_accuracy": 0.22441990971565245, "num_tokens": 85497610.0, "step": 49295 }, { "entropy": 5.734203720092774, "epoch": 3.835712896323672, "grad_norm": 1.3984375, "learning_rate": 0.0003586447922625596, "loss": 4.8858, "mean_token_accuracy": 0.22256708443164824, "num_tokens": 85506037.0, "step": 49300 }, { "entropy": 5.851556396484375, "epoch": 3.83610192569539, "grad_norm": 1.3046875, "learning_rate": 0.00035861906238813726, "loss": 5.0274, "mean_token_accuracy": 0.20781202465295792, "num_tokens": 85515154.0, "step": 49305 }, { "entropy": 5.878886651992798, "epoch": 3.8364909550671076, "grad_norm": 1.1875, "learning_rate": 0.00035859333124492866, "loss": 4.9686, "mean_token_accuracy": 0.2116763934493065, "num_tokens": 85524090.0, "step": 49310 }, { "entropy": 5.90453143119812, "epoch": 3.8368799844388253, "grad_norm": 1.34375, "learning_rate": 0.0003585675988333244, "loss": 5.022, "mean_token_accuracy": 0.2104464665055275, "num_tokens": 85532946.0, "step": 49315 }, { "entropy": 5.845489072799682, "epoch": 3.837269013810543, "grad_norm": 1.25, "learning_rate": 0.0003585418651537147, "loss": 4.9318, "mean_token_accuracy": 0.2103389874100685, "num_tokens": 85542720.0, "step": 49320 }, { "entropy": 5.834271430969238, "epoch": 3.8376580431822602, "grad_norm": 1.3359375, "learning_rate": 0.00035851613020649036, "loss": 4.9524, "mean_token_accuracy": 0.21707930713891982, "num_tokens": 85551710.0, "step": 49325 }, { "entropy": 5.887194204330444, "epoch": 3.838047072553978, "grad_norm": 1.2890625, "learning_rate": 0.00035849039399204157, "loss": 4.9949, "mean_token_accuracy": 0.21328243762254714, "num_tokens": 85560270.0, "step": 49330 }, { "entropy": 5.847870111465454, "epoch": 3.838436101925695, "grad_norm": 1.53125, "learning_rate": 0.00035846465651075897, "loss": 4.9413, "mean_token_accuracy": 0.21142313480377198, "num_tokens": 85568166.0, "step": 49335 }, { "entropy": 5.837140512466431, "epoch": 3.838825131297413, "grad_norm": 1.3515625, "learning_rate": 0.00035843891776303304, "loss": 4.9822, "mean_token_accuracy": 0.2091651052236557, "num_tokens": 85576183.0, "step": 49340 }, { "entropy": 5.796944999694825, "epoch": 3.8392141606691306, "grad_norm": 1.375, "learning_rate": 0.0003584131777492543, "loss": 4.9001, "mean_token_accuracy": 0.21316527128219603, "num_tokens": 85584789.0, "step": 49345 }, { "entropy": 5.882592582702637, "epoch": 3.8396031900408483, "grad_norm": 1.3203125, "learning_rate": 0.0003583874364698134, "loss": 5.0452, "mean_token_accuracy": 0.21010844856500627, "num_tokens": 85593094.0, "step": 49350 }, { "entropy": 5.9353807926177975, "epoch": 3.8399922194125655, "grad_norm": 1.3984375, "learning_rate": 0.0003583616939251009, "loss": 5.1049, "mean_token_accuracy": 0.19689738154411315, "num_tokens": 85601673.0, "step": 49355 }, { "entropy": 5.885538721084595, "epoch": 3.840381248784283, "grad_norm": 1.375, "learning_rate": 0.0003583359501155073, "loss": 5.0327, "mean_token_accuracy": 0.21105698496103287, "num_tokens": 85609622.0, "step": 49360 }, { "entropy": 5.845378065109253, "epoch": 3.840770278156001, "grad_norm": 1.3671875, "learning_rate": 0.0003583102050414234, "loss": 5.0165, "mean_token_accuracy": 0.20531330704689027, "num_tokens": 85619131.0, "step": 49365 }, { "entropy": 5.82465090751648, "epoch": 3.841159307527718, "grad_norm": 1.375, "learning_rate": 0.00035828445870323967, "loss": 4.9139, "mean_token_accuracy": 0.21009569019079208, "num_tokens": 85626802.0, "step": 49370 }, { "entropy": 5.820287036895752, "epoch": 3.841548336899436, "grad_norm": 1.3359375, "learning_rate": 0.0003582587111013469, "loss": 4.9135, "mean_token_accuracy": 0.2143876925110817, "num_tokens": 85635927.0, "step": 49375 }, { "entropy": 5.812913942337036, "epoch": 3.8419373662711536, "grad_norm": 1.359375, "learning_rate": 0.0003582329622361356, "loss": 4.9153, "mean_token_accuracy": 0.21288319081068038, "num_tokens": 85644152.0, "step": 49380 }, { "entropy": 5.853749418258667, "epoch": 3.8423263956428713, "grad_norm": 1.3359375, "learning_rate": 0.0003582072121079966, "loss": 4.991, "mean_token_accuracy": 0.21028214693069458, "num_tokens": 85652436.0, "step": 49385 }, { "entropy": 5.821596002578735, "epoch": 3.8427154250145885, "grad_norm": 1.2890625, "learning_rate": 0.00035818146071732064, "loss": 5.0012, "mean_token_accuracy": 0.20857261419296264, "num_tokens": 85661836.0, "step": 49390 }, { "entropy": 5.773049306869507, "epoch": 3.843104454386306, "grad_norm": 1.2890625, "learning_rate": 0.00035815570806449845, "loss": 4.9576, "mean_token_accuracy": 0.20613589584827424, "num_tokens": 85671079.0, "step": 49395 }, { "entropy": 5.851197242736816, "epoch": 3.8434934837580235, "grad_norm": 1.2265625, "learning_rate": 0.00035812995414992075, "loss": 4.9608, "mean_token_accuracy": 0.2170921728014946, "num_tokens": 85680226.0, "step": 49400 }, { "entropy": 5.874868249893188, "epoch": 3.843882513129741, "grad_norm": 1.375, "learning_rate": 0.00035810419897397823, "loss": 4.9194, "mean_token_accuracy": 0.21455154269933702, "num_tokens": 85688161.0, "step": 49405 }, { "entropy": 5.805533409118652, "epoch": 3.844271542501459, "grad_norm": 1.3671875, "learning_rate": 0.0003580784425370618, "loss": 4.8991, "mean_token_accuracy": 0.21929310411214828, "num_tokens": 85697065.0, "step": 49410 }, { "entropy": 5.853161430358886, "epoch": 3.8446605718731766, "grad_norm": 1.3515625, "learning_rate": 0.0003580526848395622, "loss": 4.985, "mean_token_accuracy": 0.21301500350236893, "num_tokens": 85705863.0, "step": 49415 }, { "entropy": 5.866111516952515, "epoch": 3.8450496012448943, "grad_norm": 1.3828125, "learning_rate": 0.00035802692588187036, "loss": 4.998, "mean_token_accuracy": 0.20855469405651092, "num_tokens": 85714475.0, "step": 49420 }, { "entropy": 5.845017385482788, "epoch": 3.8454386306166115, "grad_norm": 1.3046875, "learning_rate": 0.000358001165664377, "loss": 4.9762, "mean_token_accuracy": 0.21311355233192444, "num_tokens": 85723217.0, "step": 49425 }, { "entropy": 5.855923748016357, "epoch": 3.845827659988329, "grad_norm": 1.3359375, "learning_rate": 0.0003579754041874731, "loss": 4.9578, "mean_token_accuracy": 0.21329641938209534, "num_tokens": 85731324.0, "step": 49430 }, { "entropy": 5.845185995101929, "epoch": 3.8462166893600465, "grad_norm": 1.3984375, "learning_rate": 0.0003579496414515495, "loss": 4.9712, "mean_token_accuracy": 0.21006331443786622, "num_tokens": 85739407.0, "step": 49435 }, { "entropy": 5.8717104434967045, "epoch": 3.846605718731764, "grad_norm": 1.390625, "learning_rate": 0.00035792387745699715, "loss": 4.9051, "mean_token_accuracy": 0.2248445302248001, "num_tokens": 85747749.0, "step": 49440 }, { "entropy": 5.900114440917969, "epoch": 3.846994748103482, "grad_norm": 1.4921875, "learning_rate": 0.0003578981122042069, "loss": 5.0121, "mean_token_accuracy": 0.20402198582887648, "num_tokens": 85756008.0, "step": 49445 }, { "entropy": 5.796587181091309, "epoch": 3.8473837774751996, "grad_norm": 1.3046875, "learning_rate": 0.0003578723456935698, "loss": 5.0077, "mean_token_accuracy": 0.21403095722198487, "num_tokens": 85764796.0, "step": 49450 }, { "entropy": 5.909938859939575, "epoch": 3.847772806846917, "grad_norm": 1.4140625, "learning_rate": 0.0003578465779254768, "loss": 4.9609, "mean_token_accuracy": 0.21425935328006745, "num_tokens": 85773160.0, "step": 49455 }, { "entropy": 5.867559957504272, "epoch": 3.8481618362186345, "grad_norm": 1.359375, "learning_rate": 0.00035782080890031876, "loss": 4.9463, "mean_token_accuracy": 0.206123748421669, "num_tokens": 85781625.0, "step": 49460 }, { "entropy": 5.834516477584839, "epoch": 3.848550865590352, "grad_norm": 1.3671875, "learning_rate": 0.00035779503861848677, "loss": 4.9448, "mean_token_accuracy": 0.21223124265670776, "num_tokens": 85790173.0, "step": 49465 }, { "entropy": 5.813063383102417, "epoch": 3.8489398949620695, "grad_norm": 1.2578125, "learning_rate": 0.0003577692670803719, "loss": 4.9281, "mean_token_accuracy": 0.21334470808506012, "num_tokens": 85799965.0, "step": 49470 }, { "entropy": 5.876016426086426, "epoch": 3.849328924333787, "grad_norm": 1.4375, "learning_rate": 0.0003577434942863651, "loss": 5.0166, "mean_token_accuracy": 0.2067531317472458, "num_tokens": 85809293.0, "step": 49475 }, { "entropy": 5.89487361907959, "epoch": 3.849717953705505, "grad_norm": 1.3671875, "learning_rate": 0.0003577177202368575, "loss": 5.039, "mean_token_accuracy": 0.2109519749879837, "num_tokens": 85818321.0, "step": 49480 }, { "entropy": 5.882986164093017, "epoch": 3.8501069830772225, "grad_norm": 1.28125, "learning_rate": 0.00035769194493224014, "loss": 4.9302, "mean_token_accuracy": 0.21716566383838654, "num_tokens": 85826709.0, "step": 49485 }, { "entropy": 5.850671863555908, "epoch": 3.85049601244894, "grad_norm": 1.34375, "learning_rate": 0.00035766616837290413, "loss": 5.0389, "mean_token_accuracy": 0.20640288293361664, "num_tokens": 85835630.0, "step": 49490 }, { "entropy": 5.772657871246338, "epoch": 3.8508850418206575, "grad_norm": 1.25, "learning_rate": 0.0003576403905592406, "loss": 4.8989, "mean_token_accuracy": 0.21315510272979737, "num_tokens": 85845133.0, "step": 49495 }, { "entropy": 5.872016668319702, "epoch": 3.8512740711923747, "grad_norm": 1.265625, "learning_rate": 0.00035761461149164066, "loss": 4.9961, "mean_token_accuracy": 0.2105998381972313, "num_tokens": 85854589.0, "step": 49500 }, { "entropy": 5.847325658798217, "epoch": 3.8516631005640924, "grad_norm": 1.2578125, "learning_rate": 0.00035758883117049543, "loss": 4.9157, "mean_token_accuracy": 0.21893593072891235, "num_tokens": 85863037.0, "step": 49505 }, { "entropy": 5.716777801513672, "epoch": 3.85205212993581, "grad_norm": 1.4921875, "learning_rate": 0.0003575630495961962, "loss": 4.8166, "mean_token_accuracy": 0.22027808278799058, "num_tokens": 85871450.0, "step": 49510 }, { "entropy": 5.814776659011841, "epoch": 3.852441159307528, "grad_norm": 1.4765625, "learning_rate": 0.00035753726676913413, "loss": 5.0007, "mean_token_accuracy": 0.20746694207191468, "num_tokens": 85879962.0, "step": 49515 }, { "entropy": 5.866975212097168, "epoch": 3.8528301886792455, "grad_norm": 1.3515625, "learning_rate": 0.00035751148268970046, "loss": 5.0582, "mean_token_accuracy": 0.20599327087402344, "num_tokens": 85888236.0, "step": 49520 }, { "entropy": 5.83804988861084, "epoch": 3.853219218050963, "grad_norm": 1.328125, "learning_rate": 0.0003574856973582863, "loss": 4.9251, "mean_token_accuracy": 0.21196081191301347, "num_tokens": 85897168.0, "step": 49525 }, { "entropy": 5.785567331314087, "epoch": 3.8536082474226805, "grad_norm": 1.3125, "learning_rate": 0.00035745991077528296, "loss": 4.8457, "mean_token_accuracy": 0.22218296229839324, "num_tokens": 85905156.0, "step": 49530 }, { "entropy": 5.754974603652954, "epoch": 3.8539972767943977, "grad_norm": 1.4140625, "learning_rate": 0.00035743412294108175, "loss": 4.8959, "mean_token_accuracy": 0.2120915248990059, "num_tokens": 85913050.0, "step": 49535 }, { "entropy": 5.6764157772064205, "epoch": 3.8543863061661154, "grad_norm": 1.265625, "learning_rate": 0.0003574083338560739, "loss": 4.7932, "mean_token_accuracy": 0.2219378799200058, "num_tokens": 85921983.0, "step": 49540 }, { "entropy": 5.814680719375611, "epoch": 3.854775335537833, "grad_norm": 1.375, "learning_rate": 0.00035738254352065074, "loss": 4.8637, "mean_token_accuracy": 0.22019639611244202, "num_tokens": 85930730.0, "step": 49545 }, { "entropy": 5.848218250274658, "epoch": 3.855164364909551, "grad_norm": 1.2578125, "learning_rate": 0.00035735675193520364, "loss": 5.0207, "mean_token_accuracy": 0.2052363082766533, "num_tokens": 85939372.0, "step": 49550 }, { "entropy": 5.848648929595948, "epoch": 3.855553394281268, "grad_norm": 1.3359375, "learning_rate": 0.0003573309591001239, "loss": 4.9608, "mean_token_accuracy": 0.2119243934750557, "num_tokens": 85947701.0, "step": 49555 }, { "entropy": 5.824662780761718, "epoch": 3.855942423652986, "grad_norm": 1.40625, "learning_rate": 0.000357305165015803, "loss": 4.9608, "mean_token_accuracy": 0.21759367883205413, "num_tokens": 85955314.0, "step": 49560 }, { "entropy": 5.873783016204834, "epoch": 3.8563314530247035, "grad_norm": 1.2578125, "learning_rate": 0.00035727936968263206, "loss": 4.981, "mean_token_accuracy": 0.2101707249879837, "num_tokens": 85964236.0, "step": 49565 }, { "entropy": 5.829063558578492, "epoch": 3.8567204823964207, "grad_norm": 1.3671875, "learning_rate": 0.0003572535731010028, "loss": 4.8813, "mean_token_accuracy": 0.22086403220891954, "num_tokens": 85972287.0, "step": 49570 }, { "entropy": 5.7882232666015625, "epoch": 3.8571095117681384, "grad_norm": 1.3359375, "learning_rate": 0.0003572277752713063, "loss": 4.9211, "mean_token_accuracy": 0.2215912476181984, "num_tokens": 85980661.0, "step": 49575 }, { "entropy": 5.818631505966186, "epoch": 3.857498541139856, "grad_norm": 1.3046875, "learning_rate": 0.0003572019761939343, "loss": 4.969, "mean_token_accuracy": 0.21680211126804352, "num_tokens": 85989397.0, "step": 49580 }, { "entropy": 5.83306770324707, "epoch": 3.857887570511574, "grad_norm": 1.390625, "learning_rate": 0.00035717617586927814, "loss": 4.9484, "mean_token_accuracy": 0.2108405664563179, "num_tokens": 85997842.0, "step": 49585 }, { "entropy": 5.835994291305542, "epoch": 3.858276599883291, "grad_norm": 1.265625, "learning_rate": 0.00035715037429772935, "loss": 4.9801, "mean_token_accuracy": 0.2104534775018692, "num_tokens": 86006878.0, "step": 49590 }, { "entropy": 5.874611043930054, "epoch": 3.8586656292550088, "grad_norm": 1.3125, "learning_rate": 0.0003571245714796793, "loss": 4.9979, "mean_token_accuracy": 0.2130954623222351, "num_tokens": 86015443.0, "step": 49595 }, { "entropy": 5.866987657546997, "epoch": 3.8590546586267265, "grad_norm": 1.421875, "learning_rate": 0.0003570987674155197, "loss": 5.0344, "mean_token_accuracy": 0.20718978047370912, "num_tokens": 86024588.0, "step": 49600 }, { "entropy": 5.8786571502685545, "epoch": 3.8594436879984437, "grad_norm": 1.5, "learning_rate": 0.0003570729621056419, "loss": 4.9962, "mean_token_accuracy": 0.2096959948539734, "num_tokens": 86033175.0, "step": 49605 }, { "entropy": 5.83553261756897, "epoch": 3.8598327173701614, "grad_norm": 1.3984375, "learning_rate": 0.00035704715555043753, "loss": 4.9057, "mean_token_accuracy": 0.21363828629255294, "num_tokens": 86041422.0, "step": 49610 }, { "entropy": 5.896242618560791, "epoch": 3.860221746741879, "grad_norm": 1.3046875, "learning_rate": 0.00035702134775029813, "loss": 5.1251, "mean_token_accuracy": 0.19890947937965392, "num_tokens": 86050186.0, "step": 49615 }, { "entropy": 5.917394781112671, "epoch": 3.860610776113597, "grad_norm": 1.3984375, "learning_rate": 0.0003569955387056154, "loss": 5.03, "mean_token_accuracy": 0.21127172857522963, "num_tokens": 86057809.0, "step": 49620 }, { "entropy": 5.831995630264283, "epoch": 3.860999805485314, "grad_norm": 1.34375, "learning_rate": 0.00035696972841678094, "loss": 4.9944, "mean_token_accuracy": 0.2075558140873909, "num_tokens": 86066127.0, "step": 49625 }, { "entropy": 5.809444236755371, "epoch": 3.8613888348570318, "grad_norm": 1.390625, "learning_rate": 0.0003569439168841862, "loss": 4.9613, "mean_token_accuracy": 0.20967845767736434, "num_tokens": 86075013.0, "step": 49630 }, { "entropy": 5.851637077331543, "epoch": 3.861777864228749, "grad_norm": 1.3515625, "learning_rate": 0.00035691810410822303, "loss": 4.9583, "mean_token_accuracy": 0.20778247863054275, "num_tokens": 86083140.0, "step": 49635 }, { "entropy": 5.8562499523162845, "epoch": 3.8621668936004667, "grad_norm": 1.40625, "learning_rate": 0.00035689229008928304, "loss": 4.8782, "mean_token_accuracy": 0.2236500561237335, "num_tokens": 86091882.0, "step": 49640 }, { "entropy": 5.842278242111206, "epoch": 3.8625559229721844, "grad_norm": 1.359375, "learning_rate": 0.00035686647482775774, "loss": 4.9674, "mean_token_accuracy": 0.22172569930553437, "num_tokens": 86100588.0, "step": 49645 }, { "entropy": 5.827404880523682, "epoch": 3.862944952343902, "grad_norm": 1.3828125, "learning_rate": 0.00035684065832403903, "loss": 4.9839, "mean_token_accuracy": 0.21075067967176436, "num_tokens": 86108859.0, "step": 49650 }, { "entropy": 5.7916303157806395, "epoch": 3.8633339817156194, "grad_norm": 1.3359375, "learning_rate": 0.0003568148405785187, "loss": 4.9506, "mean_token_accuracy": 0.20919316858053208, "num_tokens": 86117978.0, "step": 49655 }, { "entropy": 5.897777843475342, "epoch": 3.863723011087337, "grad_norm": 1.28125, "learning_rate": 0.0003567890215915883, "loss": 5.0004, "mean_token_accuracy": 0.20985494405031205, "num_tokens": 86127265.0, "step": 49660 }, { "entropy": 5.887689447402954, "epoch": 3.8641120404590548, "grad_norm": 1.2890625, "learning_rate": 0.00035676320136363975, "loss": 4.9824, "mean_token_accuracy": 0.20806350111961364, "num_tokens": 86136064.0, "step": 49665 }, { "entropy": 5.944741153717041, "epoch": 3.864501069830772, "grad_norm": 1.359375, "learning_rate": 0.0003567373798950647, "loss": 5.0225, "mean_token_accuracy": 0.20631909370422363, "num_tokens": 86144550.0, "step": 49670 }, { "entropy": 5.875761318206787, "epoch": 3.8648900992024897, "grad_norm": 1.3046875, "learning_rate": 0.00035671155718625504, "loss": 5.0523, "mean_token_accuracy": 0.19798603057861328, "num_tokens": 86153776.0, "step": 49675 }, { "entropy": 5.868198013305664, "epoch": 3.8652791285742074, "grad_norm": 1.4296875, "learning_rate": 0.0003566857332376025, "loss": 4.982, "mean_token_accuracy": 0.21627409160137176, "num_tokens": 86162903.0, "step": 49680 }, { "entropy": 5.913523101806641, "epoch": 3.865668157945925, "grad_norm": 1.4921875, "learning_rate": 0.00035665990804949904, "loss": 5.0431, "mean_token_accuracy": 0.2049479752779007, "num_tokens": 86171521.0, "step": 49685 }, { "entropy": 5.853685140609741, "epoch": 3.8660571873176424, "grad_norm": 1.40625, "learning_rate": 0.0003566340816223364, "loss": 4.9708, "mean_token_accuracy": 0.21256413757801057, "num_tokens": 86180057.0, "step": 49690 }, { "entropy": 5.932194328308105, "epoch": 3.86644621668936, "grad_norm": 1.4375, "learning_rate": 0.0003566082539565066, "loss": 5.0027, "mean_token_accuracy": 0.20449973195791243, "num_tokens": 86188497.0, "step": 49695 }, { "entropy": 5.80847430229187, "epoch": 3.8668352460610778, "grad_norm": 1.3046875, "learning_rate": 0.0003565824250524013, "loss": 4.9032, "mean_token_accuracy": 0.21777616143226625, "num_tokens": 86197454.0, "step": 49700 }, { "entropy": 5.8477356910705565, "epoch": 3.867224275432795, "grad_norm": 1.234375, "learning_rate": 0.00035655659491041266, "loss": 4.9845, "mean_token_accuracy": 0.20870523303747177, "num_tokens": 86206680.0, "step": 49705 }, { "entropy": 5.8437676429748535, "epoch": 3.8676133048045127, "grad_norm": 1.40625, "learning_rate": 0.0003565307635309325, "loss": 4.9295, "mean_token_accuracy": 0.228124263882637, "num_tokens": 86215214.0, "step": 49710 }, { "entropy": 5.873446989059448, "epoch": 3.8680023341762304, "grad_norm": 1.34375, "learning_rate": 0.0003565049309143527, "loss": 4.9831, "mean_token_accuracy": 0.21623197495937346, "num_tokens": 86223506.0, "step": 49715 }, { "entropy": 5.868535995483398, "epoch": 3.868391363547948, "grad_norm": 1.3671875, "learning_rate": 0.00035647909706106533, "loss": 4.9476, "mean_token_accuracy": 0.211313596367836, "num_tokens": 86231875.0, "step": 49720 }, { "entropy": 5.900340461730957, "epoch": 3.8687803929196654, "grad_norm": 1.265625, "learning_rate": 0.0003564532619714624, "loss": 4.9466, "mean_token_accuracy": 0.21425380557775497, "num_tokens": 86240920.0, "step": 49725 }, { "entropy": 5.917439651489258, "epoch": 3.869169422291383, "grad_norm": 1.359375, "learning_rate": 0.0003564274256459358, "loss": 5.1218, "mean_token_accuracy": 0.19971494674682616, "num_tokens": 86248815.0, "step": 49730 }, { "entropy": 5.869728660583496, "epoch": 3.8695584516631003, "grad_norm": 1.34375, "learning_rate": 0.0003564015880848777, "loss": 4.9719, "mean_token_accuracy": 0.21394447833299637, "num_tokens": 86257251.0, "step": 49735 }, { "entropy": 5.925034093856811, "epoch": 3.869947481034818, "grad_norm": 1.3203125, "learning_rate": 0.00035637574928867996, "loss": 5.0474, "mean_token_accuracy": 0.20965682864189147, "num_tokens": 86266349.0, "step": 49740 }, { "entropy": 5.870296907424927, "epoch": 3.8703365104065357, "grad_norm": 1.4140625, "learning_rate": 0.00035634990925773475, "loss": 4.9874, "mean_token_accuracy": 0.21120751649141312, "num_tokens": 86274417.0, "step": 49745 }, { "entropy": 5.875138235092163, "epoch": 3.8707255397782534, "grad_norm": 1.3359375, "learning_rate": 0.0003563240679924342, "loss": 4.998, "mean_token_accuracy": 0.2147296905517578, "num_tokens": 86283637.0, "step": 49750 }, { "entropy": 5.828436040878296, "epoch": 3.871114569149971, "grad_norm": 1.3828125, "learning_rate": 0.0003562982254931704, "loss": 4.9461, "mean_token_accuracy": 0.2140674740076065, "num_tokens": 86292544.0, "step": 49755 }, { "entropy": 5.826992082595825, "epoch": 3.8715035985216883, "grad_norm": 1.2734375, "learning_rate": 0.0003562723817603354, "loss": 4.9496, "mean_token_accuracy": 0.20973531305789947, "num_tokens": 86301654.0, "step": 49760 }, { "entropy": 5.84372730255127, "epoch": 3.871892627893406, "grad_norm": 1.3515625, "learning_rate": 0.00035624653679432135, "loss": 4.9554, "mean_token_accuracy": 0.2119797870516777, "num_tokens": 86310158.0, "step": 49765 }, { "entropy": 5.837982940673828, "epoch": 3.8722816572651233, "grad_norm": 1.3671875, "learning_rate": 0.00035622069059552036, "loss": 4.967, "mean_token_accuracy": 0.2189866214990616, "num_tokens": 86318233.0, "step": 49770 }, { "entropy": 5.836762285232544, "epoch": 3.872670686636841, "grad_norm": 1.3125, "learning_rate": 0.0003561948431643247, "loss": 5.0067, "mean_token_accuracy": 0.21423083245754243, "num_tokens": 86327538.0, "step": 49775 }, { "entropy": 5.878383684158325, "epoch": 3.8730597160085587, "grad_norm": 1.3671875, "learning_rate": 0.00035616899450112655, "loss": 4.9969, "mean_token_accuracy": 0.21460117697715758, "num_tokens": 86336351.0, "step": 49780 }, { "entropy": 5.8987424850463865, "epoch": 3.8734487453802764, "grad_norm": 1.4140625, "learning_rate": 0.00035614314460631814, "loss": 4.9664, "mean_token_accuracy": 0.2071215406060219, "num_tokens": 86344591.0, "step": 49785 }, { "entropy": 5.808792161941528, "epoch": 3.8738377747519936, "grad_norm": 1.328125, "learning_rate": 0.0003561172934802917, "loss": 4.9607, "mean_token_accuracy": 0.21175519227981568, "num_tokens": 86354155.0, "step": 49790 }, { "entropy": 5.778832578659058, "epoch": 3.8742268041237113, "grad_norm": 1.328125, "learning_rate": 0.0003560914411234393, "loss": 4.9571, "mean_token_accuracy": 0.2139982506632805, "num_tokens": 86363510.0, "step": 49795 }, { "entropy": 5.838975238800049, "epoch": 3.874615833495429, "grad_norm": 1.296875, "learning_rate": 0.0003560655875361535, "loss": 4.8999, "mean_token_accuracy": 0.220942884683609, "num_tokens": 86372226.0, "step": 49800 }, { "entropy": 5.835089159011841, "epoch": 3.8750048628671463, "grad_norm": 1.46875, "learning_rate": 0.0003560397327188263, "loss": 4.9903, "mean_token_accuracy": 0.20588200837373732, "num_tokens": 86380286.0, "step": 49805 }, { "entropy": 5.829324960708618, "epoch": 3.875393892238864, "grad_norm": 1.328125, "learning_rate": 0.0003560138766718502, "loss": 4.9977, "mean_token_accuracy": 0.20936161875724793, "num_tokens": 86388566.0, "step": 49810 }, { "entropy": 5.839868640899658, "epoch": 3.8757829216105817, "grad_norm": 1.3671875, "learning_rate": 0.00035598801939561755, "loss": 4.9055, "mean_token_accuracy": 0.21409762054681777, "num_tokens": 86397151.0, "step": 49815 }, { "entropy": 5.831902074813843, "epoch": 3.8761719509822994, "grad_norm": 1.359375, "learning_rate": 0.00035596216089052045, "loss": 5.0257, "mean_token_accuracy": 0.20414844304323196, "num_tokens": 86405530.0, "step": 49820 }, { "entropy": 5.842260789871216, "epoch": 3.8765609803540166, "grad_norm": 1.3828125, "learning_rate": 0.00035593630115695154, "loss": 4.8769, "mean_token_accuracy": 0.21232519745826722, "num_tokens": 86414292.0, "step": 49825 }, { "entropy": 5.889469718933105, "epoch": 3.8769500097257343, "grad_norm": 1.3515625, "learning_rate": 0.0003559104401953031, "loss": 4.9583, "mean_token_accuracy": 0.21665336638689042, "num_tokens": 86422656.0, "step": 49830 }, { "entropy": 5.897082090377808, "epoch": 3.8773390390974516, "grad_norm": 1.3984375, "learning_rate": 0.00035588457800596747, "loss": 5.0304, "mean_token_accuracy": 0.20268504768610002, "num_tokens": 86430783.0, "step": 49835 }, { "entropy": 5.8216417789459225, "epoch": 3.8777280684691693, "grad_norm": 1.328125, "learning_rate": 0.0003558587145893371, "loss": 4.8824, "mean_token_accuracy": 0.21869845390319825, "num_tokens": 86439137.0, "step": 49840 }, { "entropy": 5.813443183898926, "epoch": 3.878117097840887, "grad_norm": 1.3984375, "learning_rate": 0.0003558328499458044, "loss": 4.943, "mean_token_accuracy": 0.22007922530174256, "num_tokens": 86447225.0, "step": 49845 }, { "entropy": 5.822642087936401, "epoch": 3.8785061272126047, "grad_norm": 1.265625, "learning_rate": 0.0003558069840757619, "loss": 4.9835, "mean_token_accuracy": 0.21218572109937667, "num_tokens": 86456095.0, "step": 49850 }, { "entropy": 5.869301748275757, "epoch": 3.8788951565843224, "grad_norm": 1.2890625, "learning_rate": 0.000355781116979602, "loss": 5.0272, "mean_token_accuracy": 0.20190872997045517, "num_tokens": 86464993.0, "step": 49855 }, { "entropy": 5.804941320419312, "epoch": 3.8792841859560396, "grad_norm": 1.328125, "learning_rate": 0.0003557552486577173, "loss": 4.8847, "mean_token_accuracy": 0.21743492037057877, "num_tokens": 86474269.0, "step": 49860 }, { "entropy": 5.925400590896606, "epoch": 3.8796732153277573, "grad_norm": 1.625, "learning_rate": 0.0003557293791105002, "loss": 5.046, "mean_token_accuracy": 0.2098710209131241, "num_tokens": 86482523.0, "step": 49865 }, { "entropy": 5.8285236835479735, "epoch": 3.8800622446994746, "grad_norm": 1.375, "learning_rate": 0.00035570350833834334, "loss": 4.9339, "mean_token_accuracy": 0.22382018864154815, "num_tokens": 86491091.0, "step": 49870 }, { "entropy": 5.952488279342651, "epoch": 3.8804512740711923, "grad_norm": 1.28125, "learning_rate": 0.00035567763634163904, "loss": 5.1035, "mean_token_accuracy": 0.2040044754743576, "num_tokens": 86500069.0, "step": 49875 }, { "entropy": 5.924094724655151, "epoch": 3.88084030344291, "grad_norm": 1.3125, "learning_rate": 0.0003556517631207802, "loss": 5.0484, "mean_token_accuracy": 0.21766934245824815, "num_tokens": 86508499.0, "step": 49880 }, { "entropy": 5.878247976303101, "epoch": 3.8812293328146277, "grad_norm": 1.2421875, "learning_rate": 0.00035562588867615907, "loss": 5.0127, "mean_token_accuracy": 0.2127756804227829, "num_tokens": 86517036.0, "step": 49885 }, { "entropy": 5.871567630767823, "epoch": 3.881618362186345, "grad_norm": 1.390625, "learning_rate": 0.00035560001300816846, "loss": 5.0128, "mean_token_accuracy": 0.21189086139202118, "num_tokens": 86525764.0, "step": 49890 }, { "entropy": 5.8339001655578615, "epoch": 3.8820073915580626, "grad_norm": 1.3515625, "learning_rate": 0.00035557413611720095, "loss": 4.9243, "mean_token_accuracy": 0.22130693048238753, "num_tokens": 86534858.0, "step": 49895 }, { "entropy": 5.794454574584961, "epoch": 3.8823964209297803, "grad_norm": 1.4140625, "learning_rate": 0.00035554825800364917, "loss": 4.8947, "mean_token_accuracy": 0.22283020615577698, "num_tokens": 86543509.0, "step": 49900 }, { "entropy": 5.843497228622437, "epoch": 3.8827854503014976, "grad_norm": 1.34375, "learning_rate": 0.0003555223786679058, "loss": 4.944, "mean_token_accuracy": 0.2182733729481697, "num_tokens": 86552278.0, "step": 49905 }, { "entropy": 5.828822374343872, "epoch": 3.8831744796732153, "grad_norm": 1.2265625, "learning_rate": 0.00035549649811036346, "loss": 4.9503, "mean_token_accuracy": 0.2153953120112419, "num_tokens": 86560684.0, "step": 49910 }, { "entropy": 5.935526704788208, "epoch": 3.883563509044933, "grad_norm": 1.4609375, "learning_rate": 0.00035547061633141487, "loss": 5.0272, "mean_token_accuracy": 0.20616153180599212, "num_tokens": 86569015.0, "step": 49915 }, { "entropy": 5.829907608032227, "epoch": 3.8839525384166507, "grad_norm": 1.3125, "learning_rate": 0.00035544473333145275, "loss": 4.9762, "mean_token_accuracy": 0.20851483047008515, "num_tokens": 86578544.0, "step": 49920 }, { "entropy": 5.773847007751465, "epoch": 3.884341567788368, "grad_norm": 1.3515625, "learning_rate": 0.0003554188491108699, "loss": 4.9173, "mean_token_accuracy": 0.20361634194850922, "num_tokens": 86587176.0, "step": 49925 }, { "entropy": 5.832643127441406, "epoch": 3.8847305971600856, "grad_norm": 1.3671875, "learning_rate": 0.000355392963670059, "loss": 4.9552, "mean_token_accuracy": 0.21025250405073165, "num_tokens": 86595472.0, "step": 49930 }, { "entropy": 5.891104984283447, "epoch": 3.8851196265318033, "grad_norm": 1.390625, "learning_rate": 0.0003553670770094129, "loss": 4.9663, "mean_token_accuracy": 0.2070546939969063, "num_tokens": 86603958.0, "step": 49935 }, { "entropy": 5.9209850311279295, "epoch": 3.8855086559035206, "grad_norm": 1.359375, "learning_rate": 0.00035534118912932425, "loss": 5.0716, "mean_token_accuracy": 0.2054263100028038, "num_tokens": 86613128.0, "step": 49940 }, { "entropy": 5.915005540847778, "epoch": 3.8858976852752383, "grad_norm": 1.21875, "learning_rate": 0.00035531530003018584, "loss": 4.9665, "mean_token_accuracy": 0.21320274770259856, "num_tokens": 86621790.0, "step": 49945 }, { "entropy": 5.83930549621582, "epoch": 3.886286714646956, "grad_norm": 1.2890625, "learning_rate": 0.0003552894097123907, "loss": 4.9817, "mean_token_accuracy": 0.21239552199840545, "num_tokens": 86630774.0, "step": 49950 }, { "entropy": 5.82966947555542, "epoch": 3.8866757440186737, "grad_norm": 1.4453125, "learning_rate": 0.00035526351817633157, "loss": 4.9804, "mean_token_accuracy": 0.21022045314311982, "num_tokens": 86639372.0, "step": 49955 }, { "entropy": 5.798735427856445, "epoch": 3.887064773390391, "grad_norm": 1.3359375, "learning_rate": 0.0003552376254224013, "loss": 4.9252, "mean_token_accuracy": 0.21679818779230117, "num_tokens": 86648114.0, "step": 49960 }, { "entropy": 5.873887443542481, "epoch": 3.8874538027621086, "grad_norm": 1.3203125, "learning_rate": 0.0003552117314509928, "loss": 5.0122, "mean_token_accuracy": 0.2085929125547409, "num_tokens": 86656823.0, "step": 49965 }, { "entropy": 5.826308917999268, "epoch": 3.887842832133826, "grad_norm": 1.328125, "learning_rate": 0.0003551858362624989, "loss": 4.9027, "mean_token_accuracy": 0.21762755066156386, "num_tokens": 86664899.0, "step": 49970 }, { "entropy": 5.851254224777222, "epoch": 3.8882318615055436, "grad_norm": 1.3046875, "learning_rate": 0.0003551599398573125, "loss": 4.9205, "mean_token_accuracy": 0.21568373292684556, "num_tokens": 86673520.0, "step": 49975 }, { "entropy": 5.767315244674682, "epoch": 3.8886208908772613, "grad_norm": 1.3359375, "learning_rate": 0.00035513404223582666, "loss": 4.92, "mean_token_accuracy": 0.21437762081623077, "num_tokens": 86682068.0, "step": 49980 }, { "entropy": 5.779818058013916, "epoch": 3.889009920248979, "grad_norm": 1.3359375, "learning_rate": 0.00035510814339843427, "loss": 4.953, "mean_token_accuracy": 0.20602433532476425, "num_tokens": 86690569.0, "step": 49985 }, { "entropy": 5.877245616912842, "epoch": 3.889398949620696, "grad_norm": 1.28125, "learning_rate": 0.00035508224334552835, "loss": 4.9682, "mean_token_accuracy": 0.21567173153162003, "num_tokens": 86699243.0, "step": 49990 }, { "entropy": 5.812640857696533, "epoch": 3.889787978992414, "grad_norm": 1.3046875, "learning_rate": 0.0003550563420775018, "loss": 4.8819, "mean_token_accuracy": 0.21601734310388565, "num_tokens": 86707920.0, "step": 49995 }, { "entropy": 5.818077278137207, "epoch": 3.8901770083641316, "grad_norm": 1.2109375, "learning_rate": 0.00035503043959474775, "loss": 4.923, "mean_token_accuracy": 0.21806200593709946, "num_tokens": 86716793.0, "step": 50000 }, { "entropy": 5.863390684127808, "epoch": 3.890566037735849, "grad_norm": 1.3125, "learning_rate": 0.00035500453589765906, "loss": 4.9904, "mean_token_accuracy": 0.21213760375976562, "num_tokens": 86725594.0, "step": 50005 }, { "entropy": 5.789165830612182, "epoch": 3.8909550671075666, "grad_norm": 1.25, "learning_rate": 0.00035497863098662893, "loss": 4.8835, "mean_token_accuracy": 0.21979040801525115, "num_tokens": 86734637.0, "step": 50010 }, { "entropy": 5.86313829421997, "epoch": 3.8913440964792843, "grad_norm": 1.46875, "learning_rate": 0.00035495272486205033, "loss": 4.9277, "mean_token_accuracy": 0.20946334898471833, "num_tokens": 86743159.0, "step": 50015 }, { "entropy": 5.845760345458984, "epoch": 3.891733125851002, "grad_norm": 1.3125, "learning_rate": 0.0003549268175243165, "loss": 4.9265, "mean_token_accuracy": 0.21514173746109008, "num_tokens": 86751345.0, "step": 50020 }, { "entropy": 5.8597108840942385, "epoch": 3.892122155222719, "grad_norm": 1.2578125, "learning_rate": 0.0003549009089738204, "loss": 5.0215, "mean_token_accuracy": 0.21445119380950928, "num_tokens": 86760692.0, "step": 50025 }, { "entropy": 5.876352977752686, "epoch": 3.892511184594437, "grad_norm": 1.2578125, "learning_rate": 0.0003548749992109551, "loss": 4.961, "mean_token_accuracy": 0.20922595709562303, "num_tokens": 86769560.0, "step": 50030 }, { "entropy": 5.906796216964722, "epoch": 3.8929002139661546, "grad_norm": 1.328125, "learning_rate": 0.0003548490882361139, "loss": 5.0423, "mean_token_accuracy": 0.20420522689819337, "num_tokens": 86778223.0, "step": 50035 }, { "entropy": 5.836277198791504, "epoch": 3.893289243337872, "grad_norm": 1.3046875, "learning_rate": 0.0003548231760496898, "loss": 4.8959, "mean_token_accuracy": 0.21871152371168137, "num_tokens": 86786976.0, "step": 50040 }, { "entropy": 5.87360725402832, "epoch": 3.8936782727095895, "grad_norm": 1.3203125, "learning_rate": 0.00035479726265207604, "loss": 5.0393, "mean_token_accuracy": 0.2019069656729698, "num_tokens": 86795528.0, "step": 50045 }, { "entropy": 5.87231035232544, "epoch": 3.8940673020813072, "grad_norm": 1.296875, "learning_rate": 0.0003547713480436659, "loss": 5.0259, "mean_token_accuracy": 0.20087573081254959, "num_tokens": 86804160.0, "step": 50050 }, { "entropy": 5.910418844223022, "epoch": 3.894456331453025, "grad_norm": 1.34375, "learning_rate": 0.00035474543222485254, "loss": 4.9976, "mean_token_accuracy": 0.2109828621149063, "num_tokens": 86812224.0, "step": 50055 }, { "entropy": 5.808905172348022, "epoch": 3.894845360824742, "grad_norm": 1.328125, "learning_rate": 0.00035471951519602926, "loss": 4.9279, "mean_token_accuracy": 0.21593780666589737, "num_tokens": 86821649.0, "step": 50060 }, { "entropy": 5.876021480560302, "epoch": 3.89523439019646, "grad_norm": 1.359375, "learning_rate": 0.00035469359695758905, "loss": 4.9613, "mean_token_accuracy": 0.2113896742463112, "num_tokens": 86830642.0, "step": 50065 }, { "entropy": 5.8563361167907715, "epoch": 3.895623419568177, "grad_norm": 1.3359375, "learning_rate": 0.0003546676775099254, "loss": 4.8851, "mean_token_accuracy": 0.2218416541814804, "num_tokens": 86839306.0, "step": 50070 }, { "entropy": 5.8172002792358395, "epoch": 3.896012448939895, "grad_norm": 1.2890625, "learning_rate": 0.0003546417568534315, "loss": 4.8936, "mean_token_accuracy": 0.21020075380802156, "num_tokens": 86847389.0, "step": 50075 }, { "entropy": 5.7681801319122314, "epoch": 3.8964014783116125, "grad_norm": 1.25, "learning_rate": 0.00035461583498850083, "loss": 4.9254, "mean_token_accuracy": 0.2135251581668854, "num_tokens": 86857160.0, "step": 50080 }, { "entropy": 5.902309370040894, "epoch": 3.8967905076833302, "grad_norm": 1.4921875, "learning_rate": 0.0003545899119155265, "loss": 5.0731, "mean_token_accuracy": 0.20391930490732194, "num_tokens": 86865236.0, "step": 50085 }, { "entropy": 5.9298242092132565, "epoch": 3.8971795370550475, "grad_norm": 1.3359375, "learning_rate": 0.00035456398763490193, "loss": 5.0303, "mean_token_accuracy": 0.20639098882675172, "num_tokens": 86873623.0, "step": 50090 }, { "entropy": 5.777463912963867, "epoch": 3.897568566426765, "grad_norm": 1.328125, "learning_rate": 0.0003545380621470205, "loss": 4.8653, "mean_token_accuracy": 0.22463429123163223, "num_tokens": 86883075.0, "step": 50095 }, { "entropy": 5.875482082366943, "epoch": 3.897957595798483, "grad_norm": 1.296875, "learning_rate": 0.0003545121354522756, "loss": 5.0244, "mean_token_accuracy": 0.206963911652565, "num_tokens": 86892247.0, "step": 50100 }, { "entropy": 5.882975625991821, "epoch": 3.8983466251702, "grad_norm": 1.484375, "learning_rate": 0.00035448620755106064, "loss": 4.9708, "mean_token_accuracy": 0.21492934077978135, "num_tokens": 86901795.0, "step": 50105 }, { "entropy": 5.852834558486938, "epoch": 3.898735654541918, "grad_norm": 1.390625, "learning_rate": 0.0003544602784437689, "loss": 4.9405, "mean_token_accuracy": 0.2094128116965294, "num_tokens": 86910720.0, "step": 50110 }, { "entropy": 5.793052768707275, "epoch": 3.8991246839136355, "grad_norm": 1.28125, "learning_rate": 0.00035443434813079393, "loss": 4.9514, "mean_token_accuracy": 0.2135704815387726, "num_tokens": 86919350.0, "step": 50115 }, { "entropy": 5.850922107696533, "epoch": 3.8995137132853532, "grad_norm": 1.390625, "learning_rate": 0.0003544084166125292, "loss": 5.0005, "mean_token_accuracy": 0.21069665551185607, "num_tokens": 86927612.0, "step": 50120 }, { "entropy": 5.876154851913452, "epoch": 3.8999027426570705, "grad_norm": 1.3515625, "learning_rate": 0.0003543824838893682, "loss": 4.973, "mean_token_accuracy": 0.2129857510328293, "num_tokens": 86936416.0, "step": 50125 }, { "entropy": 5.8490198135375975, "epoch": 3.900291772028788, "grad_norm": 1.375, "learning_rate": 0.00035435654996170417, "loss": 5.0103, "mean_token_accuracy": 0.2095410257577896, "num_tokens": 86945764.0, "step": 50130 }, { "entropy": 5.839610052108765, "epoch": 3.900680801400506, "grad_norm": 1.34375, "learning_rate": 0.000354330614829931, "loss": 4.9678, "mean_token_accuracy": 0.214727221429348, "num_tokens": 86953952.0, "step": 50135 }, { "entropy": 5.871619701385498, "epoch": 3.901069830772223, "grad_norm": 1.3046875, "learning_rate": 0.0003543046784944419, "loss": 4.9305, "mean_token_accuracy": 0.2147872969508171, "num_tokens": 86962295.0, "step": 50140 }, { "entropy": 5.941391706466675, "epoch": 3.901458860143941, "grad_norm": 1.5859375, "learning_rate": 0.00035427874095563054, "loss": 5.0604, "mean_token_accuracy": 0.21206576526165008, "num_tokens": 86970361.0, "step": 50145 }, { "entropy": 5.849875164031983, "epoch": 3.9018478895156585, "grad_norm": 1.390625, "learning_rate": 0.0003542528022138905, "loss": 4.8842, "mean_token_accuracy": 0.21526036858558656, "num_tokens": 86979131.0, "step": 50150 }, { "entropy": 5.783134651184082, "epoch": 3.9022369188873762, "grad_norm": 1.2578125, "learning_rate": 0.0003542268622696153, "loss": 4.9186, "mean_token_accuracy": 0.21404487043619155, "num_tokens": 86988088.0, "step": 50155 }, { "entropy": 5.930145645141602, "epoch": 3.9026259482590935, "grad_norm": 1.3984375, "learning_rate": 0.0003542009211231986, "loss": 5.0659, "mean_token_accuracy": 0.20101008415222169, "num_tokens": 86996792.0, "step": 50160 }, { "entropy": 5.88328537940979, "epoch": 3.903014977630811, "grad_norm": 1.296875, "learning_rate": 0.00035417497877503396, "loss": 5.0134, "mean_token_accuracy": 0.2113966315984726, "num_tokens": 87005547.0, "step": 50165 }, { "entropy": 5.936040639877319, "epoch": 3.9034040070025284, "grad_norm": 1.265625, "learning_rate": 0.00035414903522551505, "loss": 5.1352, "mean_token_accuracy": 0.19963545352220535, "num_tokens": 87014923.0, "step": 50170 }, { "entropy": 5.876059913635254, "epoch": 3.903793036374246, "grad_norm": 1.265625, "learning_rate": 0.00035412309047503553, "loss": 4.999, "mean_token_accuracy": 0.21234779953956603, "num_tokens": 87023842.0, "step": 50175 }, { "entropy": 5.9407970905303955, "epoch": 3.904182065745964, "grad_norm": 1.3046875, "learning_rate": 0.000354097144523989, "loss": 4.9853, "mean_token_accuracy": 0.2112179219722748, "num_tokens": 87032251.0, "step": 50180 }, { "entropy": 5.867289876937866, "epoch": 3.9045710951176815, "grad_norm": 1.3828125, "learning_rate": 0.0003540711973727693, "loss": 5.0458, "mean_token_accuracy": 0.2060077667236328, "num_tokens": 87041052.0, "step": 50185 }, { "entropy": 5.8436095237731935, "epoch": 3.904960124489399, "grad_norm": 1.359375, "learning_rate": 0.0003540452490217699, "loss": 4.9997, "mean_token_accuracy": 0.21346331089735032, "num_tokens": 87049908.0, "step": 50190 }, { "entropy": 5.83856315612793, "epoch": 3.9053491538611165, "grad_norm": 1.2265625, "learning_rate": 0.0003540192994713847, "loss": 4.9671, "mean_token_accuracy": 0.20316095352172853, "num_tokens": 87059458.0, "step": 50195 }, { "entropy": 5.946631002426147, "epoch": 3.905738183232834, "grad_norm": 1.4140625, "learning_rate": 0.00035399334872200747, "loss": 5.0414, "mean_token_accuracy": 0.2008753776550293, "num_tokens": 87067856.0, "step": 50200 }, { "entropy": 5.911816930770874, "epoch": 3.9061272126045514, "grad_norm": 1.46875, "learning_rate": 0.0003539673967740318, "loss": 5.0517, "mean_token_accuracy": 0.20883753150701523, "num_tokens": 87076427.0, "step": 50205 }, { "entropy": 5.849739122390747, "epoch": 3.906516241976269, "grad_norm": 1.359375, "learning_rate": 0.0003539414436278516, "loss": 4.9825, "mean_token_accuracy": 0.20858688056468963, "num_tokens": 87084576.0, "step": 50210 }, { "entropy": 5.887836360931397, "epoch": 3.906905271347987, "grad_norm": 1.3671875, "learning_rate": 0.00035391548928386077, "loss": 5.0346, "mean_token_accuracy": 0.21006654649972917, "num_tokens": 87092788.0, "step": 50215 }, { "entropy": 5.802178525924683, "epoch": 3.9072943007197045, "grad_norm": 1.3828125, "learning_rate": 0.0003538895337424529, "loss": 4.8446, "mean_token_accuracy": 0.21940358281135558, "num_tokens": 87101780.0, "step": 50220 }, { "entropy": 5.92707200050354, "epoch": 3.9076833300914218, "grad_norm": 1.4140625, "learning_rate": 0.00035386357700402187, "loss": 5.0509, "mean_token_accuracy": 0.20719743072986602, "num_tokens": 87111234.0, "step": 50225 }, { "entropy": 5.805256319046021, "epoch": 3.9080723594631395, "grad_norm": 1.328125, "learning_rate": 0.0003538376190689616, "loss": 4.8777, "mean_token_accuracy": 0.22420763969421387, "num_tokens": 87119488.0, "step": 50230 }, { "entropy": 5.8973119258880615, "epoch": 3.908461388834857, "grad_norm": 1.375, "learning_rate": 0.0003538116599376661, "loss": 5.0848, "mean_token_accuracy": 0.20532718002796174, "num_tokens": 87129479.0, "step": 50235 }, { "entropy": 5.890357112884521, "epoch": 3.9088504182065744, "grad_norm": 1.5703125, "learning_rate": 0.00035378569961052887, "loss": 4.9316, "mean_token_accuracy": 0.2097485840320587, "num_tokens": 87137711.0, "step": 50240 }, { "entropy": 5.881834173202515, "epoch": 3.909239447578292, "grad_norm": 1.3359375, "learning_rate": 0.00035375973808794416, "loss": 4.9293, "mean_token_accuracy": 0.2145976573228836, "num_tokens": 87145858.0, "step": 50245 }, { "entropy": 5.796741008758545, "epoch": 3.90962847695001, "grad_norm": 1.25, "learning_rate": 0.0003537337753703058, "loss": 4.9208, "mean_token_accuracy": 0.21515700668096543, "num_tokens": 87154200.0, "step": 50250 }, { "entropy": 5.852941560745239, "epoch": 3.9100175063217275, "grad_norm": 1.25, "learning_rate": 0.0003537078114580077, "loss": 5.0378, "mean_token_accuracy": 0.20790210515260696, "num_tokens": 87163329.0, "step": 50255 }, { "entropy": 5.872106122970581, "epoch": 3.9104065356934448, "grad_norm": 1.421875, "learning_rate": 0.0003536818463514438, "loss": 4.9907, "mean_token_accuracy": 0.211335127055645, "num_tokens": 87172459.0, "step": 50260 }, { "entropy": 5.841586780548096, "epoch": 3.9107955650651625, "grad_norm": 1.359375, "learning_rate": 0.00035365588005100817, "loss": 4.9992, "mean_token_accuracy": 0.2095364511013031, "num_tokens": 87181155.0, "step": 50265 }, { "entropy": 5.848500394821167, "epoch": 3.9111845944368797, "grad_norm": 1.390625, "learning_rate": 0.0003536299125570947, "loss": 4.968, "mean_token_accuracy": 0.21252476423978806, "num_tokens": 87190191.0, "step": 50270 }, { "entropy": 5.909672689437866, "epoch": 3.9115736238085974, "grad_norm": 1.4453125, "learning_rate": 0.0003536039438700975, "loss": 4.9919, "mean_token_accuracy": 0.21535238921642302, "num_tokens": 87199023.0, "step": 50275 }, { "entropy": 5.866110563278198, "epoch": 3.911962653180315, "grad_norm": 1.4453125, "learning_rate": 0.00035357797399041056, "loss": 5.0532, "mean_token_accuracy": 0.2045396462082863, "num_tokens": 87207694.0, "step": 50280 }, { "entropy": 5.89245343208313, "epoch": 3.912351682552033, "grad_norm": 1.2578125, "learning_rate": 0.0003535520029184279, "loss": 4.972, "mean_token_accuracy": 0.21160369366407394, "num_tokens": 87216019.0, "step": 50285 }, { "entropy": 5.89026894569397, "epoch": 3.9127407119237505, "grad_norm": 1.421875, "learning_rate": 0.0003535260306545437, "loss": 4.9634, "mean_token_accuracy": 0.2104164570569992, "num_tokens": 87224737.0, "step": 50290 }, { "entropy": 5.912589120864868, "epoch": 3.9131297412954678, "grad_norm": 1.3359375, "learning_rate": 0.00035350005719915196, "loss": 5.0076, "mean_token_accuracy": 0.21278140395879747, "num_tokens": 87233797.0, "step": 50295 }, { "entropy": 5.833993577957154, "epoch": 3.9135187706671855, "grad_norm": 1.34375, "learning_rate": 0.00035347408255264674, "loss": 4.8725, "mean_token_accuracy": 0.21449319422245025, "num_tokens": 87242767.0, "step": 50300 }, { "entropy": 5.843844270706176, "epoch": 3.9139078000389027, "grad_norm": 1.328125, "learning_rate": 0.0003534481067154223, "loss": 4.9243, "mean_token_accuracy": 0.22101622074842453, "num_tokens": 87251684.0, "step": 50305 }, { "entropy": 5.901364374160766, "epoch": 3.9142968294106204, "grad_norm": 1.3671875, "learning_rate": 0.0003534221296878726, "loss": 5.0331, "mean_token_accuracy": 0.20860935598611832, "num_tokens": 87260730.0, "step": 50310 }, { "entropy": 5.86990180015564, "epoch": 3.914685858782338, "grad_norm": 1.265625, "learning_rate": 0.00035339615147039196, "loss": 4.9889, "mean_token_accuracy": 0.20421410202980042, "num_tokens": 87270241.0, "step": 50315 }, { "entropy": 5.811804580688476, "epoch": 3.915074888154056, "grad_norm": 1.3359375, "learning_rate": 0.00035337017206337444, "loss": 4.9228, "mean_token_accuracy": 0.21969697922468184, "num_tokens": 87279463.0, "step": 50320 }, { "entropy": 5.857248544692993, "epoch": 3.915463917525773, "grad_norm": 1.328125, "learning_rate": 0.0003533441914672144, "loss": 4.9574, "mean_token_accuracy": 0.20766083896160126, "num_tokens": 87287887.0, "step": 50325 }, { "entropy": 5.901853561401367, "epoch": 3.9158529468974907, "grad_norm": 1.3203125, "learning_rate": 0.00035331820968230595, "loss": 4.996, "mean_token_accuracy": 0.20700593590736388, "num_tokens": 87296832.0, "step": 50330 }, { "entropy": 5.965098476409912, "epoch": 3.9162419762692084, "grad_norm": 1.3671875, "learning_rate": 0.00035329222670904325, "loss": 5.0787, "mean_token_accuracy": 0.20138408094644547, "num_tokens": 87304867.0, "step": 50335 }, { "entropy": 5.87544732093811, "epoch": 3.9166310056409257, "grad_norm": 1.28125, "learning_rate": 0.0003532662425478206, "loss": 5.0044, "mean_token_accuracy": 0.21483961939811708, "num_tokens": 87313541.0, "step": 50340 }, { "entropy": 5.8386493682861325, "epoch": 3.9170200350126434, "grad_norm": 1.25, "learning_rate": 0.00035324025719903236, "loss": 5.0405, "mean_token_accuracy": 0.2089060828089714, "num_tokens": 87322462.0, "step": 50345 }, { "entropy": 5.8310740947723385, "epoch": 3.917409064384361, "grad_norm": 1.34375, "learning_rate": 0.00035321427066307276, "loss": 4.9724, "mean_token_accuracy": 0.21075519621372224, "num_tokens": 87331519.0, "step": 50350 }, { "entropy": 5.919080686569214, "epoch": 3.917798093756079, "grad_norm": 1.3515625, "learning_rate": 0.0003531882829403361, "loss": 5.0315, "mean_token_accuracy": 0.2050456017255783, "num_tokens": 87340380.0, "step": 50355 }, { "entropy": 5.871724462509155, "epoch": 3.918187123127796, "grad_norm": 1.3984375, "learning_rate": 0.00035316229403121666, "loss": 4.958, "mean_token_accuracy": 0.20818275809288025, "num_tokens": 87348022.0, "step": 50360 }, { "entropy": 5.7936211109161375, "epoch": 3.9185761524995137, "grad_norm": 1.3984375, "learning_rate": 0.0003531363039361088, "loss": 4.8866, "mean_token_accuracy": 0.2188831865787506, "num_tokens": 87357080.0, "step": 50365 }, { "entropy": 5.804518604278565, "epoch": 3.9189651818712314, "grad_norm": 1.359375, "learning_rate": 0.00035311031265540695, "loss": 4.9594, "mean_token_accuracy": 0.2102443292737007, "num_tokens": 87365576.0, "step": 50370 }, { "entropy": 5.893703413009644, "epoch": 3.9193542112429487, "grad_norm": 1.375, "learning_rate": 0.00035308432018950537, "loss": 5.0613, "mean_token_accuracy": 0.20983504354953766, "num_tokens": 87375149.0, "step": 50375 }, { "entropy": 5.834807538986206, "epoch": 3.9197432406146664, "grad_norm": 1.34375, "learning_rate": 0.00035305832653879856, "loss": 4.9374, "mean_token_accuracy": 0.2161742329597473, "num_tokens": 87384299.0, "step": 50380 }, { "entropy": 5.840975332260132, "epoch": 3.920132269986384, "grad_norm": 1.3203125, "learning_rate": 0.00035303233170368083, "loss": 4.9532, "mean_token_accuracy": 0.2151444748044014, "num_tokens": 87392836.0, "step": 50385 }, { "entropy": 5.900544214248657, "epoch": 3.920521299358102, "grad_norm": 1.3125, "learning_rate": 0.00035300633568454673, "loss": 5.0158, "mean_token_accuracy": 0.2102026179432869, "num_tokens": 87401798.0, "step": 50390 }, { "entropy": 5.802858448028564, "epoch": 3.920910328729819, "grad_norm": 1.3125, "learning_rate": 0.00035298033848179064, "loss": 4.8881, "mean_token_accuracy": 0.22498739510774612, "num_tokens": 87410487.0, "step": 50395 }, { "entropy": 5.924791526794434, "epoch": 3.9212993581015367, "grad_norm": 1.3203125, "learning_rate": 0.000352954340095807, "loss": 5.1515, "mean_token_accuracy": 0.19814356714487075, "num_tokens": 87419664.0, "step": 50400 }, { "entropy": 5.924291801452637, "epoch": 3.921688387473254, "grad_norm": 1.359375, "learning_rate": 0.00035292834052699036, "loss": 5.0175, "mean_token_accuracy": 0.20812980979681014, "num_tokens": 87428073.0, "step": 50405 }, { "entropy": 5.928595304489136, "epoch": 3.9220774168449717, "grad_norm": 1.4296875, "learning_rate": 0.0003529023397757351, "loss": 5.0083, "mean_token_accuracy": 0.20945201069116592, "num_tokens": 87436250.0, "step": 50410 }, { "entropy": 5.824740314483643, "epoch": 3.9224664462166894, "grad_norm": 1.3984375, "learning_rate": 0.00035287633784243595, "loss": 4.9043, "mean_token_accuracy": 0.21152209043502807, "num_tokens": 87445131.0, "step": 50415 }, { "entropy": 5.813178586959839, "epoch": 3.922855475588407, "grad_norm": 1.3125, "learning_rate": 0.00035285033472748725, "loss": 4.9647, "mean_token_accuracy": 0.21347084641456604, "num_tokens": 87454428.0, "step": 50420 }, { "entropy": 5.937636423110962, "epoch": 3.9232445049601243, "grad_norm": 1.453125, "learning_rate": 0.0003528243304312837, "loss": 5.0525, "mean_token_accuracy": 0.20275560915470123, "num_tokens": 87462956.0, "step": 50425 }, { "entropy": 5.88403639793396, "epoch": 3.923633534331842, "grad_norm": 1.375, "learning_rate": 0.0003527983249542197, "loss": 5.0092, "mean_token_accuracy": 0.20586445927619934, "num_tokens": 87471437.0, "step": 50430 }, { "entropy": 5.785153532028199, "epoch": 3.9240225637035597, "grad_norm": 1.34375, "learning_rate": 0.00035277231829669006, "loss": 4.8708, "mean_token_accuracy": 0.21702760308980942, "num_tokens": 87480327.0, "step": 50435 }, { "entropy": 5.78876838684082, "epoch": 3.924411593075277, "grad_norm": 1.3515625, "learning_rate": 0.0003527463104590892, "loss": 4.8993, "mean_token_accuracy": 0.21759721785783767, "num_tokens": 87489365.0, "step": 50440 }, { "entropy": 5.871600341796875, "epoch": 3.9248006224469947, "grad_norm": 1.2578125, "learning_rate": 0.0003527203014418119, "loss": 5.0448, "mean_token_accuracy": 0.21017459630966187, "num_tokens": 87499267.0, "step": 50445 }, { "entropy": 5.868191194534302, "epoch": 3.9251896518187124, "grad_norm": 1.359375, "learning_rate": 0.0003526942912452526, "loss": 4.9474, "mean_token_accuracy": 0.21022556275129317, "num_tokens": 87508713.0, "step": 50450 }, { "entropy": 5.91130256652832, "epoch": 3.92557868119043, "grad_norm": 1.265625, "learning_rate": 0.0003526682798698062, "loss": 5.0235, "mean_token_accuracy": 0.20666676461696626, "num_tokens": 87517783.0, "step": 50455 }, { "entropy": 5.870366954803467, "epoch": 3.9259677105621473, "grad_norm": 1.453125, "learning_rate": 0.0003526422673158673, "loss": 4.9625, "mean_token_accuracy": 0.20975561290979386, "num_tokens": 87525592.0, "step": 50460 }, { "entropy": 5.7399965763092045, "epoch": 3.926356739933865, "grad_norm": 1.2890625, "learning_rate": 0.0003526162535838305, "loss": 4.922, "mean_token_accuracy": 0.2129724517464638, "num_tokens": 87534540.0, "step": 50465 }, { "entropy": 5.895988273620605, "epoch": 3.9267457693055827, "grad_norm": 1.3828125, "learning_rate": 0.00035259023867409065, "loss": 5.0398, "mean_token_accuracy": 0.2045349434018135, "num_tokens": 87543540.0, "step": 50470 }, { "entropy": 5.9267716884613035, "epoch": 3.9271347986773, "grad_norm": 1.34375, "learning_rate": 0.0003525642225870423, "loss": 5.0186, "mean_token_accuracy": 0.21303965151309967, "num_tokens": 87552913.0, "step": 50475 }, { "entropy": 5.913860225677491, "epoch": 3.9275238280490177, "grad_norm": 1.4375, "learning_rate": 0.00035253820532308043, "loss": 5.0461, "mean_token_accuracy": 0.2112818643450737, "num_tokens": 87561548.0, "step": 50480 }, { "entropy": 5.876704120635987, "epoch": 3.9279128574207354, "grad_norm": 1.328125, "learning_rate": 0.0003525121868825997, "loss": 5.0232, "mean_token_accuracy": 0.20292626023292543, "num_tokens": 87569877.0, "step": 50485 }, { "entropy": 5.866918277740479, "epoch": 3.928301886792453, "grad_norm": 1.359375, "learning_rate": 0.0003524861672659949, "loss": 4.9535, "mean_token_accuracy": 0.2160590782761574, "num_tokens": 87578125.0, "step": 50490 }, { "entropy": 5.889223575592041, "epoch": 3.9286909161641703, "grad_norm": 1.3984375, "learning_rate": 0.0003524601464736609, "loss": 5.0839, "mean_token_accuracy": 0.19580717086791993, "num_tokens": 87586637.0, "step": 50495 }, { "entropy": 5.928692722320557, "epoch": 3.929079945535888, "grad_norm": 1.375, "learning_rate": 0.0003524341245059924, "loss": 5.0554, "mean_token_accuracy": 0.19777609407901764, "num_tokens": 87595674.0, "step": 50500 }, { "entropy": 5.96267147064209, "epoch": 3.9294689749076053, "grad_norm": 1.328125, "learning_rate": 0.0003524081013633843, "loss": 5.1113, "mean_token_accuracy": 0.20792175233364105, "num_tokens": 87605404.0, "step": 50505 }, { "entropy": 5.857615184783936, "epoch": 3.929858004279323, "grad_norm": 1.34375, "learning_rate": 0.00035238207704623147, "loss": 4.9089, "mean_token_accuracy": 0.2145421549677849, "num_tokens": 87613511.0, "step": 50510 }, { "entropy": 5.8103495121002195, "epoch": 3.9302470336510407, "grad_norm": 1.2421875, "learning_rate": 0.00035235605155492885, "loss": 4.9618, "mean_token_accuracy": 0.2131579637527466, "num_tokens": 87622554.0, "step": 50515 }, { "entropy": 5.793174076080322, "epoch": 3.9306360630227584, "grad_norm": 1.484375, "learning_rate": 0.00035233002488987123, "loss": 4.8453, "mean_token_accuracy": 0.22218438237905502, "num_tokens": 87630628.0, "step": 50520 }, { "entropy": 5.921883010864258, "epoch": 3.9310250923944756, "grad_norm": 1.328125, "learning_rate": 0.00035230399705145365, "loss": 5.0233, "mean_token_accuracy": 0.21127914041280746, "num_tokens": 87639292.0, "step": 50525 }, { "entropy": 5.913641786575317, "epoch": 3.9314141217661933, "grad_norm": 1.3671875, "learning_rate": 0.0003522779680400709, "loss": 5.0359, "mean_token_accuracy": 0.2063665047287941, "num_tokens": 87646949.0, "step": 50530 }, { "entropy": 5.860807943344116, "epoch": 3.931803151137911, "grad_norm": 1.2734375, "learning_rate": 0.00035225193785611795, "loss": 4.9971, "mean_token_accuracy": 0.20908776074647903, "num_tokens": 87656247.0, "step": 50535 }, { "entropy": 5.824738025665283, "epoch": 3.9321921805096283, "grad_norm": 1.3125, "learning_rate": 0.0003522259064999898, "loss": 5.0714, "mean_token_accuracy": 0.19820056706666947, "num_tokens": 87665297.0, "step": 50540 }, { "entropy": 5.824731349945068, "epoch": 3.932581209881346, "grad_norm": 1.3828125, "learning_rate": 0.00035219987397208137, "loss": 4.9829, "mean_token_accuracy": 0.21287549734115602, "num_tokens": 87674055.0, "step": 50545 }, { "entropy": 5.826696872711182, "epoch": 3.9329702392530637, "grad_norm": 1.4609375, "learning_rate": 0.0003521738402727878, "loss": 4.956, "mean_token_accuracy": 0.2139629140496254, "num_tokens": 87682717.0, "step": 50550 }, { "entropy": 5.885508966445923, "epoch": 3.9333592686247814, "grad_norm": 1.3125, "learning_rate": 0.0003521478054025041, "loss": 5.0745, "mean_token_accuracy": 0.204256109893322, "num_tokens": 87691683.0, "step": 50555 }, { "entropy": 5.852180433273316, "epoch": 3.9337482979964986, "grad_norm": 1.375, "learning_rate": 0.00035212176936162524, "loss": 4.9343, "mean_token_accuracy": 0.20974052399396897, "num_tokens": 87699953.0, "step": 50560 }, { "entropy": 5.838870573043823, "epoch": 3.9341373273682163, "grad_norm": 1.3125, "learning_rate": 0.0003520957321505462, "loss": 4.9811, "mean_token_accuracy": 0.20811239778995513, "num_tokens": 87708278.0, "step": 50565 }, { "entropy": 5.876230382919312, "epoch": 3.934526356739934, "grad_norm": 1.2265625, "learning_rate": 0.00035206969376966226, "loss": 5.0185, "mean_token_accuracy": 0.2027189165353775, "num_tokens": 87717737.0, "step": 50570 }, { "entropy": 5.961373662948608, "epoch": 3.9349153861116513, "grad_norm": 1.3359375, "learning_rate": 0.00035204365421936826, "loss": 5.0028, "mean_token_accuracy": 0.211273692548275, "num_tokens": 87726907.0, "step": 50575 }, { "entropy": 5.884273052215576, "epoch": 3.935304415483369, "grad_norm": 1.34375, "learning_rate": 0.0003520176135000594, "loss": 4.9687, "mean_token_accuracy": 0.21061645746231078, "num_tokens": 87735433.0, "step": 50580 }, { "entropy": 5.815057563781738, "epoch": 3.9356934448550867, "grad_norm": 1.4140625, "learning_rate": 0.0003519915716121309, "loss": 4.9421, "mean_token_accuracy": 0.211259064078331, "num_tokens": 87744021.0, "step": 50585 }, { "entropy": 5.821248149871826, "epoch": 3.9360824742268044, "grad_norm": 1.375, "learning_rate": 0.0003519655285559779, "loss": 5.0164, "mean_token_accuracy": 0.2014863058924675, "num_tokens": 87752525.0, "step": 50590 }, { "entropy": 5.88969087600708, "epoch": 3.9364715035985216, "grad_norm": 1.34375, "learning_rate": 0.00035193948433199547, "loss": 4.9888, "mean_token_accuracy": 0.211393903195858, "num_tokens": 87760806.0, "step": 50595 }, { "entropy": 5.870843172073364, "epoch": 3.9368605329702393, "grad_norm": 1.4609375, "learning_rate": 0.00035191343894057885, "loss": 4.9641, "mean_token_accuracy": 0.21354002952575685, "num_tokens": 87769091.0, "step": 50600 }, { "entropy": 5.861725664138794, "epoch": 3.9372495623419566, "grad_norm": 1.375, "learning_rate": 0.00035188739238212316, "loss": 5.0584, "mean_token_accuracy": 0.201443649828434, "num_tokens": 87778096.0, "step": 50605 }, { "entropy": 5.810902690887451, "epoch": 3.9376385917136743, "grad_norm": 1.234375, "learning_rate": 0.0003518613446570237, "loss": 4.9825, "mean_token_accuracy": 0.21858949363231658, "num_tokens": 87787439.0, "step": 50610 }, { "entropy": 5.954205703735352, "epoch": 3.938027621085392, "grad_norm": 1.3359375, "learning_rate": 0.00035183529576567567, "loss": 5.0119, "mean_token_accuracy": 0.21400980651378632, "num_tokens": 87796592.0, "step": 50615 }, { "entropy": 5.7889909744262695, "epoch": 3.9384166504571096, "grad_norm": 1.3203125, "learning_rate": 0.0003518092457084743, "loss": 4.8883, "mean_token_accuracy": 0.22494269907474518, "num_tokens": 87805283.0, "step": 50620 }, { "entropy": 5.813586091995239, "epoch": 3.9388056798288273, "grad_norm": 1.3125, "learning_rate": 0.0003517831944858149, "loss": 5.0274, "mean_token_accuracy": 0.20861661434173584, "num_tokens": 87813474.0, "step": 50625 }, { "entropy": 5.8645072937011715, "epoch": 3.9391947092005446, "grad_norm": 1.4765625, "learning_rate": 0.00035175714209809275, "loss": 5.0486, "mean_token_accuracy": 0.2153325855731964, "num_tokens": 87822826.0, "step": 50630 }, { "entropy": 5.928106737136841, "epoch": 3.9395837385722623, "grad_norm": 1.390625, "learning_rate": 0.0003517310885457032, "loss": 4.9599, "mean_token_accuracy": 0.21362568140029908, "num_tokens": 87831582.0, "step": 50635 }, { "entropy": 5.832395267486572, "epoch": 3.9399727679439795, "grad_norm": 1.625, "learning_rate": 0.0003517050338290414, "loss": 4.9059, "mean_token_accuracy": 0.2193234384059906, "num_tokens": 87839527.0, "step": 50640 }, { "entropy": 5.827008533477783, "epoch": 3.9403617973156972, "grad_norm": 1.3359375, "learning_rate": 0.00035167897794850285, "loss": 4.9267, "mean_token_accuracy": 0.21483297646045685, "num_tokens": 87847973.0, "step": 50645 }, { "entropy": 5.894081974029541, "epoch": 3.940750826687415, "grad_norm": 1.3515625, "learning_rate": 0.00035165292090448287, "loss": 5.0164, "mean_token_accuracy": 0.20929262191057205, "num_tokens": 87857802.0, "step": 50650 }, { "entropy": 5.772129249572754, "epoch": 3.9411398560591326, "grad_norm": 1.3359375, "learning_rate": 0.00035162686269737676, "loss": 4.8684, "mean_token_accuracy": 0.21744166910648347, "num_tokens": 87865771.0, "step": 50655 }, { "entropy": 5.792073917388916, "epoch": 3.94152888543085, "grad_norm": 1.4140625, "learning_rate": 0.00035160080332758006, "loss": 4.9086, "mean_token_accuracy": 0.21519968658685684, "num_tokens": 87874434.0, "step": 50660 }, { "entropy": 5.783642864227295, "epoch": 3.9419179148025676, "grad_norm": 1.328125, "learning_rate": 0.000351574742795488, "loss": 4.8354, "mean_token_accuracy": 0.21929167211055756, "num_tokens": 87882509.0, "step": 50665 }, { "entropy": 5.867333555221558, "epoch": 3.9423069441742853, "grad_norm": 1.3828125, "learning_rate": 0.0003515486811014962, "loss": 5.0435, "mean_token_accuracy": 0.20307313203811644, "num_tokens": 87891440.0, "step": 50670 }, { "entropy": 5.768648958206176, "epoch": 3.9426959735460025, "grad_norm": 1.3984375, "learning_rate": 0.0003515226182459999, "loss": 4.8379, "mean_token_accuracy": 0.2177691102027893, "num_tokens": 87900275.0, "step": 50675 }, { "entropy": 5.869170999526977, "epoch": 3.9430850029177202, "grad_norm": 1.3671875, "learning_rate": 0.00035149655422939477, "loss": 4.9879, "mean_token_accuracy": 0.21217387467622756, "num_tokens": 87908473.0, "step": 50680 }, { "entropy": 5.788185739517212, "epoch": 3.943474032289438, "grad_norm": 1.296875, "learning_rate": 0.0003514704890520761, "loss": 4.8347, "mean_token_accuracy": 0.23047144263982772, "num_tokens": 87917927.0, "step": 50685 }, { "entropy": 5.831167936325073, "epoch": 3.9438630616611556, "grad_norm": 1.21875, "learning_rate": 0.0003514444227144395, "loss": 4.9646, "mean_token_accuracy": 0.21041671931743622, "num_tokens": 87926982.0, "step": 50690 }, { "entropy": 5.890619516372681, "epoch": 3.944252091032873, "grad_norm": 1.40625, "learning_rate": 0.0003514183552168804, "loss": 4.9529, "mean_token_accuracy": 0.2126726523041725, "num_tokens": 87935539.0, "step": 50695 }, { "entropy": 5.897333240509033, "epoch": 3.9446411204045906, "grad_norm": 1.3828125, "learning_rate": 0.00035139228655979457, "loss": 4.9927, "mean_token_accuracy": 0.20962452441453933, "num_tokens": 87943285.0, "step": 50700 }, { "entropy": 5.854384231567383, "epoch": 3.945030149776308, "grad_norm": 1.375, "learning_rate": 0.00035136621674357717, "loss": 5.0241, "mean_token_accuracy": 0.20948306620121002, "num_tokens": 87952634.0, "step": 50705 }, { "entropy": 5.85410099029541, "epoch": 3.9454191791480255, "grad_norm": 1.3359375, "learning_rate": 0.0003513401457686242, "loss": 4.9279, "mean_token_accuracy": 0.20802465081214905, "num_tokens": 87960453.0, "step": 50710 }, { "entropy": 5.885688304901123, "epoch": 3.9458082085197432, "grad_norm": 1.375, "learning_rate": 0.00035131407363533083, "loss": 4.9942, "mean_token_accuracy": 0.2042764499783516, "num_tokens": 87969696.0, "step": 50715 }, { "entropy": 5.845657157897949, "epoch": 3.946197237891461, "grad_norm": 1.421875, "learning_rate": 0.0003512880003440929, "loss": 4.9602, "mean_token_accuracy": 0.20698674768209457, "num_tokens": 87978747.0, "step": 50720 }, { "entropy": 5.825539445877075, "epoch": 3.9465862672631786, "grad_norm": 1.375, "learning_rate": 0.0003512619258953061, "loss": 4.9727, "mean_token_accuracy": 0.20948212146759032, "num_tokens": 87987043.0, "step": 50725 }, { "entropy": 5.827656555175781, "epoch": 3.946975296634896, "grad_norm": 1.34375, "learning_rate": 0.0003512358502893658, "loss": 4.9639, "mean_token_accuracy": 0.20808629244565963, "num_tokens": 87996390.0, "step": 50730 }, { "entropy": 5.940815687179565, "epoch": 3.9473643260066136, "grad_norm": 1.3515625, "learning_rate": 0.000351209773526668, "loss": 5.0636, "mean_token_accuracy": 0.19967617839574814, "num_tokens": 88004341.0, "step": 50735 }, { "entropy": 5.792080402374268, "epoch": 3.947753355378331, "grad_norm": 1.40625, "learning_rate": 0.000351183695607608, "loss": 4.9155, "mean_token_accuracy": 0.21302787810564042, "num_tokens": 88013087.0, "step": 50740 }, { "entropy": 5.796984386444092, "epoch": 3.9481423847500485, "grad_norm": 1.28125, "learning_rate": 0.00035115761653258177, "loss": 4.9472, "mean_token_accuracy": 0.21211278140544892, "num_tokens": 88021631.0, "step": 50745 }, { "entropy": 5.818651533126831, "epoch": 3.9485314141217662, "grad_norm": 1.2734375, "learning_rate": 0.00035113153630198494, "loss": 5.0121, "mean_token_accuracy": 0.19934735000133513, "num_tokens": 88030201.0, "step": 50750 }, { "entropy": 5.789007186889648, "epoch": 3.948920443493484, "grad_norm": 1.3125, "learning_rate": 0.0003511054549162132, "loss": 4.8491, "mean_token_accuracy": 0.21734676212072374, "num_tokens": 88038332.0, "step": 50755 }, { "entropy": 5.858986043930054, "epoch": 3.949309472865201, "grad_norm": 1.4921875, "learning_rate": 0.00035107937237566233, "loss": 4.9734, "mean_token_accuracy": 0.21757589429616928, "num_tokens": 88046606.0, "step": 50760 }, { "entropy": 5.841245317459107, "epoch": 3.949698502236919, "grad_norm": 1.4453125, "learning_rate": 0.0003510532886807281, "loss": 4.8944, "mean_token_accuracy": 0.21623147130012513, "num_tokens": 88054783.0, "step": 50765 }, { "entropy": 5.835672426223755, "epoch": 3.9500875316086366, "grad_norm": 1.484375, "learning_rate": 0.0003510272038318062, "loss": 4.9252, "mean_token_accuracy": 0.2179815277457237, "num_tokens": 88062649.0, "step": 50770 }, { "entropy": 5.751447916030884, "epoch": 3.950476560980354, "grad_norm": 1.2734375, "learning_rate": 0.0003510011178292925, "loss": 4.9538, "mean_token_accuracy": 0.21520095616579055, "num_tokens": 88071597.0, "step": 50775 }, { "entropy": 5.832294988632202, "epoch": 3.9508655903520715, "grad_norm": 1.1640625, "learning_rate": 0.0003509750306735828, "loss": 4.9405, "mean_token_accuracy": 0.21642884016036987, "num_tokens": 88081229.0, "step": 50780 }, { "entropy": 5.85630521774292, "epoch": 3.951254619723789, "grad_norm": 1.3515625, "learning_rate": 0.000350948942365073, "loss": 4.9519, "mean_token_accuracy": 0.21749256998300553, "num_tokens": 88089509.0, "step": 50785 }, { "entropy": 5.924078512191772, "epoch": 3.951643649095507, "grad_norm": 1.3515625, "learning_rate": 0.00035092285290415885, "loss": 5.0298, "mean_token_accuracy": 0.20952986925840378, "num_tokens": 88098420.0, "step": 50790 }, { "entropy": 5.878281831741333, "epoch": 3.952032678467224, "grad_norm": 1.5, "learning_rate": 0.0003508967622912362, "loss": 4.9769, "mean_token_accuracy": 0.21439062654972077, "num_tokens": 88106956.0, "step": 50795 }, { "entropy": 5.8301959991455075, "epoch": 3.952421707838942, "grad_norm": 1.3203125, "learning_rate": 0.00035087067052670115, "loss": 4.9487, "mean_token_accuracy": 0.2178071215748787, "num_tokens": 88116021.0, "step": 50800 }, { "entropy": 5.825522756576538, "epoch": 3.9528107372106596, "grad_norm": 1.4375, "learning_rate": 0.00035084457761094925, "loss": 4.8319, "mean_token_accuracy": 0.21721335649490356, "num_tokens": 88124496.0, "step": 50805 }, { "entropy": 5.8228880882263185, "epoch": 3.953199766582377, "grad_norm": 1.4375, "learning_rate": 0.0003508184835443766, "loss": 4.9284, "mean_token_accuracy": 0.21467677354812623, "num_tokens": 88132468.0, "step": 50810 }, { "entropy": 5.87910304069519, "epoch": 3.9535887959540945, "grad_norm": 1.28125, "learning_rate": 0.00035079238832737926, "loss": 5.0981, "mean_token_accuracy": 0.203167125582695, "num_tokens": 88142028.0, "step": 50815 }, { "entropy": 5.844890880584717, "epoch": 3.953977825325812, "grad_norm": 1.3359375, "learning_rate": 0.000350766291960353, "loss": 4.9284, "mean_token_accuracy": 0.21522141098976136, "num_tokens": 88150309.0, "step": 50820 }, { "entropy": 5.837665653228759, "epoch": 3.95436685469753, "grad_norm": 1.3671875, "learning_rate": 0.0003507401944436939, "loss": 4.9446, "mean_token_accuracy": 0.21166631877422332, "num_tokens": 88159271.0, "step": 50825 }, { "entropy": 5.8747838020324705, "epoch": 3.954755884069247, "grad_norm": 1.3125, "learning_rate": 0.0003507140957777979, "loss": 5.0566, "mean_token_accuracy": 0.20727382004261016, "num_tokens": 88168320.0, "step": 50830 }, { "entropy": 5.882933330535889, "epoch": 3.955144913440965, "grad_norm": 1.3203125, "learning_rate": 0.00035068799596306096, "loss": 5.0208, "mean_token_accuracy": 0.2099367767572403, "num_tokens": 88177078.0, "step": 50835 }, { "entropy": 5.878162622451782, "epoch": 3.955533942812682, "grad_norm": 1.6953125, "learning_rate": 0.0003506618949998791, "loss": 5.0179, "mean_token_accuracy": 0.206915982067585, "num_tokens": 88184843.0, "step": 50840 }, { "entropy": 5.902147197723389, "epoch": 3.9559229721844, "grad_norm": 1.5234375, "learning_rate": 0.00035063579288864853, "loss": 5.0296, "mean_token_accuracy": 0.20631437599658967, "num_tokens": 88193623.0, "step": 50845 }, { "entropy": 5.760248422622681, "epoch": 3.9563120015561175, "grad_norm": 1.3359375, "learning_rate": 0.0003506096896297651, "loss": 4.911, "mean_token_accuracy": 0.21278675347566606, "num_tokens": 88202097.0, "step": 50850 }, { "entropy": 5.817772960662841, "epoch": 3.956701030927835, "grad_norm": 1.4765625, "learning_rate": 0.00035058358522362505, "loss": 5.0065, "mean_token_accuracy": 0.2050605908036232, "num_tokens": 88210537.0, "step": 50855 }, { "entropy": 5.815549516677857, "epoch": 3.9570900602995525, "grad_norm": 1.328125, "learning_rate": 0.00035055747967062433, "loss": 4.9281, "mean_token_accuracy": 0.22054334878921508, "num_tokens": 88219427.0, "step": 50860 }, { "entropy": 5.812912178039551, "epoch": 3.95747908967127, "grad_norm": 1.28125, "learning_rate": 0.0003505313729711592, "loss": 4.8695, "mean_token_accuracy": 0.2189117729663849, "num_tokens": 88227886.0, "step": 50865 }, { "entropy": 5.791278886795044, "epoch": 3.957868119042988, "grad_norm": 1.28125, "learning_rate": 0.00035050526512562564, "loss": 4.8961, "mean_token_accuracy": 0.21788581013679503, "num_tokens": 88236783.0, "step": 50870 }, { "entropy": 5.855245113372803, "epoch": 3.958257148414705, "grad_norm": 1.328125, "learning_rate": 0.0003504791561344199, "loss": 4.9786, "mean_token_accuracy": 0.2022316798567772, "num_tokens": 88245576.0, "step": 50875 }, { "entropy": 5.8648027896881105, "epoch": 3.958646177786423, "grad_norm": 1.3515625, "learning_rate": 0.00035045304599793807, "loss": 4.9708, "mean_token_accuracy": 0.2078162685036659, "num_tokens": 88253675.0, "step": 50880 }, { "entropy": 5.756155920028687, "epoch": 3.9590352071581405, "grad_norm": 1.40625, "learning_rate": 0.00035042693471657637, "loss": 4.8117, "mean_token_accuracy": 0.22392453849315644, "num_tokens": 88261870.0, "step": 50885 }, { "entropy": 5.814689350128174, "epoch": 3.959424236529858, "grad_norm": 1.390625, "learning_rate": 0.00035040082229073096, "loss": 4.934, "mean_token_accuracy": 0.2201839417219162, "num_tokens": 88270204.0, "step": 50890 }, { "entropy": 5.897554683685303, "epoch": 3.9598132659015755, "grad_norm": 1.5, "learning_rate": 0.0003503747087207981, "loss": 5.0209, "mean_token_accuracy": 0.20472370684146882, "num_tokens": 88278722.0, "step": 50895 }, { "entropy": 5.874971771240235, "epoch": 3.960202295273293, "grad_norm": 1.3671875, "learning_rate": 0.00035034859400717407, "loss": 4.9894, "mean_token_accuracy": 0.21105214208364487, "num_tokens": 88288110.0, "step": 50900 }, { "entropy": 5.865882921218872, "epoch": 3.960591324645011, "grad_norm": 1.2578125, "learning_rate": 0.00035032247815025504, "loss": 4.9871, "mean_token_accuracy": 0.20382022261619567, "num_tokens": 88297469.0, "step": 50905 }, { "entropy": 5.847653770446778, "epoch": 3.960980354016728, "grad_norm": 1.2890625, "learning_rate": 0.00035029636115043724, "loss": 4.9825, "mean_token_accuracy": 0.20675011724233627, "num_tokens": 88306588.0, "step": 50910 }, { "entropy": 5.847644901275634, "epoch": 3.961369383388446, "grad_norm": 1.390625, "learning_rate": 0.00035027024300811707, "loss": 5.0007, "mean_token_accuracy": 0.2083238422870636, "num_tokens": 88316275.0, "step": 50915 }, { "entropy": 5.866868782043457, "epoch": 3.9617584127601635, "grad_norm": 1.2578125, "learning_rate": 0.0003502441237236907, "loss": 5.0005, "mean_token_accuracy": 0.20122731924057008, "num_tokens": 88325314.0, "step": 50920 }, { "entropy": 5.843760442733765, "epoch": 3.962147442131881, "grad_norm": 1.296875, "learning_rate": 0.0003502180032975545, "loss": 4.9753, "mean_token_accuracy": 0.2144814908504486, "num_tokens": 88335252.0, "step": 50925 }, { "entropy": 5.788162040710449, "epoch": 3.9625364715035984, "grad_norm": 1.25, "learning_rate": 0.0003501918817301049, "loss": 4.909, "mean_token_accuracy": 0.21845915913581848, "num_tokens": 88343467.0, "step": 50930 }, { "entropy": 5.858666038513183, "epoch": 3.962925500875316, "grad_norm": 1.4296875, "learning_rate": 0.00035016575902173814, "loss": 5.0104, "mean_token_accuracy": 0.21343592256307603, "num_tokens": 88351432.0, "step": 50935 }, { "entropy": 5.852324676513672, "epoch": 3.9633145302470334, "grad_norm": 1.3515625, "learning_rate": 0.00035013963517285064, "loss": 4.99, "mean_token_accuracy": 0.20369647890329362, "num_tokens": 88360665.0, "step": 50940 }, { "entropy": 5.831197738647461, "epoch": 3.963703559618751, "grad_norm": 1.4140625, "learning_rate": 0.00035011351018383874, "loss": 4.8985, "mean_token_accuracy": 0.2105987012386322, "num_tokens": 88368980.0, "step": 50945 }, { "entropy": 5.810477828979492, "epoch": 3.964092588990469, "grad_norm": 1.2734375, "learning_rate": 0.0003500873840550989, "loss": 4.8956, "mean_token_accuracy": 0.22014543712139129, "num_tokens": 88377888.0, "step": 50950 }, { "entropy": 5.748191022872925, "epoch": 3.9644816183621865, "grad_norm": 1.296875, "learning_rate": 0.00035006125678702755, "loss": 4.8386, "mean_token_accuracy": 0.21559850126504898, "num_tokens": 88385845.0, "step": 50955 }, { "entropy": 5.834790897369385, "epoch": 3.964870647733904, "grad_norm": 1.2890625, "learning_rate": 0.00035003512838002103, "loss": 4.9387, "mean_token_accuracy": 0.21664831787347794, "num_tokens": 88394608.0, "step": 50960 }, { "entropy": 5.856100940704346, "epoch": 3.9652596771056214, "grad_norm": 1.328125, "learning_rate": 0.0003500089988344759, "loss": 4.8971, "mean_token_accuracy": 0.22465579509735106, "num_tokens": 88402857.0, "step": 50965 }, { "entropy": 5.815582036972046, "epoch": 3.965648706477339, "grad_norm": 1.328125, "learning_rate": 0.00034998286815078855, "loss": 4.988, "mean_token_accuracy": 0.2053799033164978, "num_tokens": 88410977.0, "step": 50970 }, { "entropy": 5.917778062820434, "epoch": 3.9660377358490564, "grad_norm": 1.25, "learning_rate": 0.00034995673632935557, "loss": 5.0943, "mean_token_accuracy": 0.20248873084783553, "num_tokens": 88420409.0, "step": 50975 }, { "entropy": 5.8145605564117435, "epoch": 3.966426765220774, "grad_norm": 1.390625, "learning_rate": 0.0003499306033705735, "loss": 4.9129, "mean_token_accuracy": 0.21528047025203706, "num_tokens": 88429389.0, "step": 50980 }, { "entropy": 5.8885416984558105, "epoch": 3.966815794592492, "grad_norm": 1.4375, "learning_rate": 0.00034990446927483877, "loss": 4.985, "mean_token_accuracy": 0.20442728102207183, "num_tokens": 88437758.0, "step": 50985 }, { "entropy": 5.818476057052612, "epoch": 3.9672048239642095, "grad_norm": 1.4453125, "learning_rate": 0.0003498783340425479, "loss": 4.8867, "mean_token_accuracy": 0.222855406999588, "num_tokens": 88446205.0, "step": 50990 }, { "entropy": 5.849405670166016, "epoch": 3.9675938533359267, "grad_norm": 1.40625, "learning_rate": 0.00034985219767409747, "loss": 4.9283, "mean_token_accuracy": 0.20863141417503356, "num_tokens": 88453808.0, "step": 50995 }, { "entropy": 5.790596055984497, "epoch": 3.9679828827076444, "grad_norm": 1.2890625, "learning_rate": 0.00034982606016988407, "loss": 4.941, "mean_token_accuracy": 0.21277925372123718, "num_tokens": 88462559.0, "step": 51000 }, { "epoch": 3.9679828827076444, "eval_entropy": 5.481908812261294, "eval_loss": 5.049886703491211, "eval_mean_token_accuracy": 0.21725181771282742, "eval_num_tokens": 88462559.0, "eval_runtime": 21.636, "eval_samples_per_second": 1920.776, "eval_steps_per_second": 240.109, "step": 51000 }, { "entropy": 5.805147266387939, "epoch": 3.968371912079362, "grad_norm": 1.3125, "learning_rate": 0.00034979992153030424, "loss": 4.952, "mean_token_accuracy": 0.21326204538345336, "num_tokens": 88471633.0, "step": 51005 }, { "entropy": 5.80193076133728, "epoch": 3.9687609414510794, "grad_norm": 1.265625, "learning_rate": 0.0003497737817557548, "loss": 4.9942, "mean_token_accuracy": 0.2073617547750473, "num_tokens": 88481362.0, "step": 51010 }, { "entropy": 5.786733818054199, "epoch": 3.969149970822797, "grad_norm": 1.3671875, "learning_rate": 0.00034974764084663213, "loss": 4.8604, "mean_token_accuracy": 0.22046487927436828, "num_tokens": 88489742.0, "step": 51015 }, { "entropy": 5.780914974212647, "epoch": 3.9695390001945148, "grad_norm": 1.34375, "learning_rate": 0.00034972149880333316, "loss": 4.9214, "mean_token_accuracy": 0.21747265756130219, "num_tokens": 88499049.0, "step": 51020 }, { "entropy": 5.797907161712646, "epoch": 3.9699280295662325, "grad_norm": 1.2734375, "learning_rate": 0.0003496953556262542, "loss": 4.9207, "mean_token_accuracy": 0.22121554166078566, "num_tokens": 88507810.0, "step": 51025 }, { "entropy": 5.866558933258057, "epoch": 3.9703170589379497, "grad_norm": 1.4375, "learning_rate": 0.00034966921131579216, "loss": 4.9024, "mean_token_accuracy": 0.21280392855405808, "num_tokens": 88515807.0, "step": 51030 }, { "entropy": 5.857926511764527, "epoch": 3.9707060883096674, "grad_norm": 1.265625, "learning_rate": 0.00034964306587234367, "loss": 4.9865, "mean_token_accuracy": 0.2149058014154434, "num_tokens": 88524493.0, "step": 51035 }, { "entropy": 5.863979291915894, "epoch": 3.9710951176813847, "grad_norm": 1.3046875, "learning_rate": 0.00034961691929630544, "loss": 5.0138, "mean_token_accuracy": 0.203472737967968, "num_tokens": 88533241.0, "step": 51040 }, { "entropy": 5.906973552703858, "epoch": 3.9714841470531024, "grad_norm": 1.3203125, "learning_rate": 0.0003495907715880743, "loss": 5.0685, "mean_token_accuracy": 0.20858274102211, "num_tokens": 88542889.0, "step": 51045 }, { "entropy": 5.865688514709473, "epoch": 3.97187317642482, "grad_norm": 1.296875, "learning_rate": 0.0003495646227480469, "loss": 4.9225, "mean_token_accuracy": 0.21070917695760727, "num_tokens": 88551894.0, "step": 51050 }, { "entropy": 5.8790003776550295, "epoch": 3.9722622057965378, "grad_norm": 1.3359375, "learning_rate": 0.00034953847277662, "loss": 5.0064, "mean_token_accuracy": 0.2154258593916893, "num_tokens": 88560518.0, "step": 51055 }, { "entropy": 5.8374861717224125, "epoch": 3.9726512351682555, "grad_norm": 1.390625, "learning_rate": 0.00034951232167419044, "loss": 5.0175, "mean_token_accuracy": 0.20523895919322968, "num_tokens": 88569270.0, "step": 51060 }, { "entropy": 5.818270015716553, "epoch": 3.9730402645399727, "grad_norm": 1.234375, "learning_rate": 0.00034948616944115504, "loss": 4.9143, "mean_token_accuracy": 0.2171700805425644, "num_tokens": 88579208.0, "step": 51065 }, { "entropy": 5.825394344329834, "epoch": 3.9734292939116904, "grad_norm": 1.3515625, "learning_rate": 0.0003494600160779105, "loss": 4.8779, "mean_token_accuracy": 0.21353593915700914, "num_tokens": 88587654.0, "step": 51070 }, { "entropy": 5.856493330001831, "epoch": 3.9738183232834077, "grad_norm": 1.328125, "learning_rate": 0.0003494338615848537, "loss": 4.9914, "mean_token_accuracy": 0.2152942642569542, "num_tokens": 88596049.0, "step": 51075 }, { "entropy": 5.822994375228882, "epoch": 3.9742073526551254, "grad_norm": 1.3515625, "learning_rate": 0.0003494077059623816, "loss": 4.9388, "mean_token_accuracy": 0.21309101730585098, "num_tokens": 88604939.0, "step": 51080 }, { "entropy": 5.81911268234253, "epoch": 3.974596382026843, "grad_norm": 1.3671875, "learning_rate": 0.00034938154921089097, "loss": 4.942, "mean_token_accuracy": 0.21278108060359954, "num_tokens": 88613191.0, "step": 51085 }, { "entropy": 5.836597013473511, "epoch": 3.9749854113985608, "grad_norm": 1.453125, "learning_rate": 0.0003493553913307788, "loss": 5.0285, "mean_token_accuracy": 0.2098720818758011, "num_tokens": 88621520.0, "step": 51090 }, { "entropy": 5.785463285446167, "epoch": 3.975374440770278, "grad_norm": 1.3671875, "learning_rate": 0.00034932923232244183, "loss": 4.9517, "mean_token_accuracy": 0.21616108119487762, "num_tokens": 88630216.0, "step": 51095 }, { "entropy": 5.889971685409546, "epoch": 3.9757634701419957, "grad_norm": 1.515625, "learning_rate": 0.00034930307218627706, "loss": 4.9918, "mean_token_accuracy": 0.20578220933675767, "num_tokens": 88638677.0, "step": 51100 }, { "entropy": 5.847526216506958, "epoch": 3.9761524995137134, "grad_norm": 1.3046875, "learning_rate": 0.0003492769109226815, "loss": 4.9791, "mean_token_accuracy": 0.20436631441116332, "num_tokens": 88646955.0, "step": 51105 }, { "entropy": 5.7458109855651855, "epoch": 3.9765415288854307, "grad_norm": 1.4140625, "learning_rate": 0.00034925074853205194, "loss": 4.8132, "mean_token_accuracy": 0.23176636695861816, "num_tokens": 88655120.0, "step": 51110 }, { "entropy": 5.82669768333435, "epoch": 3.9769305582571484, "grad_norm": 1.421875, "learning_rate": 0.00034922458501478556, "loss": 5.0279, "mean_token_accuracy": 0.2065514087677002, "num_tokens": 88663942.0, "step": 51115 }, { "entropy": 5.893249893188477, "epoch": 3.977319587628866, "grad_norm": 1.34375, "learning_rate": 0.0003491984203712792, "loss": 5.0021, "mean_token_accuracy": 0.21058520972728728, "num_tokens": 88672490.0, "step": 51120 }, { "entropy": 5.905580329895019, "epoch": 3.9777086170005838, "grad_norm": 1.390625, "learning_rate": 0.0003491722546019299, "loss": 5.0419, "mean_token_accuracy": 0.21081459075212478, "num_tokens": 88681091.0, "step": 51125 }, { "entropy": 5.745002794265747, "epoch": 3.978097646372301, "grad_norm": 1.3203125, "learning_rate": 0.0003491460877071347, "loss": 4.9526, "mean_token_accuracy": 0.2128197133541107, "num_tokens": 88690473.0, "step": 51130 }, { "entropy": 5.938740205764771, "epoch": 3.9784866757440187, "grad_norm": 1.3125, "learning_rate": 0.0003491199196872906, "loss": 5.1023, "mean_token_accuracy": 0.19558726549148558, "num_tokens": 88699036.0, "step": 51135 }, { "entropy": 5.9147162437438965, "epoch": 3.978875705115736, "grad_norm": 1.375, "learning_rate": 0.0003490937505427947, "loss": 5.0201, "mean_token_accuracy": 0.20945558845996856, "num_tokens": 88707893.0, "step": 51140 }, { "entropy": 5.868381929397583, "epoch": 3.9792647344874537, "grad_norm": 1.3671875, "learning_rate": 0.0003490675802740441, "loss": 4.9049, "mean_token_accuracy": 0.22280049920082093, "num_tokens": 88716743.0, "step": 51145 }, { "entropy": 5.812364721298218, "epoch": 3.9796537638591714, "grad_norm": 1.3984375, "learning_rate": 0.0003490414088814359, "loss": 5.017, "mean_token_accuracy": 0.2142008900642395, "num_tokens": 88724970.0, "step": 51150 }, { "entropy": 5.7855757713317875, "epoch": 3.980042793230889, "grad_norm": 1.2734375, "learning_rate": 0.0003490152363653671, "loss": 4.8457, "mean_token_accuracy": 0.21835513263940812, "num_tokens": 88733207.0, "step": 51155 }, { "entropy": 5.899906778335572, "epoch": 3.9804318226026068, "grad_norm": 1.3828125, "learning_rate": 0.0003489890627262349, "loss": 5.0353, "mean_token_accuracy": 0.20342293828725816, "num_tokens": 88741907.0, "step": 51160 }, { "entropy": 5.9124143600463865, "epoch": 3.980820851974324, "grad_norm": 1.390625, "learning_rate": 0.00034896288796443654, "loss": 4.9455, "mean_token_accuracy": 0.2069492220878601, "num_tokens": 88751080.0, "step": 51165 }, { "entropy": 5.843166923522949, "epoch": 3.9812098813460417, "grad_norm": 1.4609375, "learning_rate": 0.00034893671208036895, "loss": 4.9717, "mean_token_accuracy": 0.21292355209589003, "num_tokens": 88759387.0, "step": 51170 }, { "entropy": 5.851798963546753, "epoch": 3.981598910717759, "grad_norm": 1.4765625, "learning_rate": 0.00034891053507442944, "loss": 4.9721, "mean_token_accuracy": 0.20933883935213088, "num_tokens": 88768785.0, "step": 51175 }, { "entropy": 5.889985227584839, "epoch": 3.9819879400894767, "grad_norm": 1.4453125, "learning_rate": 0.0003488843569470153, "loss": 4.9886, "mean_token_accuracy": 0.20907130539417268, "num_tokens": 88777835.0, "step": 51180 }, { "entropy": 5.875407314300537, "epoch": 3.9823769694611943, "grad_norm": 1.359375, "learning_rate": 0.00034885817769852355, "loss": 4.9817, "mean_token_accuracy": 0.21081463992595673, "num_tokens": 88786447.0, "step": 51185 }, { "entropy": 5.881147861480713, "epoch": 3.982765998832912, "grad_norm": 1.3359375, "learning_rate": 0.00034883199732935156, "loss": 4.9436, "mean_token_accuracy": 0.21625804603099824, "num_tokens": 88795235.0, "step": 51190 }, { "entropy": 5.854333162307739, "epoch": 3.9831550282046293, "grad_norm": 1.3359375, "learning_rate": 0.00034880581583989655, "loss": 4.9344, "mean_token_accuracy": 0.20753955990076065, "num_tokens": 88803975.0, "step": 51195 }, { "entropy": 5.889410161972046, "epoch": 3.983544057576347, "grad_norm": 1.2734375, "learning_rate": 0.0003487796332305557, "loss": 5.0173, "mean_token_accuracy": 0.20917056053876876, "num_tokens": 88813332.0, "step": 51200 }, { "entropy": 5.879159355163575, "epoch": 3.9839330869480647, "grad_norm": 1.34375, "learning_rate": 0.00034875344950172635, "loss": 5.0577, "mean_token_accuracy": 0.20137396901845933, "num_tokens": 88822230.0, "step": 51205 }, { "entropy": 5.829727029800415, "epoch": 3.984322116319782, "grad_norm": 1.375, "learning_rate": 0.0003487272646538058, "loss": 4.9168, "mean_token_accuracy": 0.21682926565408706, "num_tokens": 88830790.0, "step": 51210 }, { "entropy": 5.942008447647095, "epoch": 3.9847111456914996, "grad_norm": 1.5, "learning_rate": 0.00034870107868719135, "loss": 5.0725, "mean_token_accuracy": 0.19908286333084108, "num_tokens": 88839191.0, "step": 51215 }, { "entropy": 5.81860384941101, "epoch": 3.9851001750632173, "grad_norm": 1.296875, "learning_rate": 0.0003486748916022804, "loss": 4.8958, "mean_token_accuracy": 0.2168948844075203, "num_tokens": 88848066.0, "step": 51220 }, { "entropy": 5.810130643844604, "epoch": 3.985489204434935, "grad_norm": 1.375, "learning_rate": 0.0003486487033994702, "loss": 4.9677, "mean_token_accuracy": 0.21055708080530167, "num_tokens": 88856323.0, "step": 51225 }, { "entropy": 5.851130533218384, "epoch": 3.9858782338066523, "grad_norm": 1.40625, "learning_rate": 0.00034862251407915813, "loss": 4.9794, "mean_token_accuracy": 0.21095626801252365, "num_tokens": 88865294.0, "step": 51230 }, { "entropy": 5.8856994152069095, "epoch": 3.98626726317837, "grad_norm": 1.3125, "learning_rate": 0.00034859632364174167, "loss": 5.0146, "mean_token_accuracy": 0.21039385497570037, "num_tokens": 88873572.0, "step": 51235 }, { "entropy": 5.902298355102539, "epoch": 3.9866562925500877, "grad_norm": 1.390625, "learning_rate": 0.000348570132087618, "loss": 4.9794, "mean_token_accuracy": 0.21031357049942018, "num_tokens": 88881861.0, "step": 51240 }, { "entropy": 5.83655948638916, "epoch": 3.987045321921805, "grad_norm": 1.2109375, "learning_rate": 0.0003485439394171847, "loss": 5.0443, "mean_token_accuracy": 0.21974911987781526, "num_tokens": 88891805.0, "step": 51245 }, { "entropy": 5.878900766372681, "epoch": 3.9874343512935226, "grad_norm": 1.375, "learning_rate": 0.00034851774563083925, "loss": 5.0178, "mean_token_accuracy": 0.206996950507164, "num_tokens": 88899913.0, "step": 51250 }, { "entropy": 5.874707412719727, "epoch": 3.9878233806652403, "grad_norm": 1.34375, "learning_rate": 0.0003484915507289791, "loss": 4.9602, "mean_token_accuracy": 0.21664831936359405, "num_tokens": 88908684.0, "step": 51255 }, { "entropy": 5.921722412109375, "epoch": 3.988212410036958, "grad_norm": 1.3671875, "learning_rate": 0.00034846535471200153, "loss": 5.0294, "mean_token_accuracy": 0.210518516600132, "num_tokens": 88917514.0, "step": 51260 }, { "entropy": 5.771425247192383, "epoch": 3.9886014394086753, "grad_norm": 1.3359375, "learning_rate": 0.0003484391575803041, "loss": 4.9751, "mean_token_accuracy": 0.21810366213321686, "num_tokens": 88926065.0, "step": 51265 }, { "entropy": 5.826253843307495, "epoch": 3.988990468780393, "grad_norm": 1.2421875, "learning_rate": 0.0003484129593342844, "loss": 4.9209, "mean_token_accuracy": 0.21119217723608016, "num_tokens": 88934389.0, "step": 51270 }, { "entropy": 5.915725612640381, "epoch": 3.9893794981521102, "grad_norm": 1.3828125, "learning_rate": 0.00034838675997433987, "loss": 4.9599, "mean_token_accuracy": 0.20645467638969422, "num_tokens": 88943691.0, "step": 51275 }, { "entropy": 5.927887439727783, "epoch": 3.989768527523828, "grad_norm": 1.375, "learning_rate": 0.0003483605595008681, "loss": 5.054, "mean_token_accuracy": 0.20580361634492875, "num_tokens": 88952318.0, "step": 51280 }, { "entropy": 5.843033361434936, "epoch": 3.9901575568955456, "grad_norm": 1.359375, "learning_rate": 0.00034833435791426653, "loss": 4.8804, "mean_token_accuracy": 0.21898591220378877, "num_tokens": 88960689.0, "step": 51285 }, { "entropy": 5.789417505264282, "epoch": 3.9905465862672633, "grad_norm": 1.3203125, "learning_rate": 0.00034830815521493295, "loss": 4.8893, "mean_token_accuracy": 0.22009625285863876, "num_tokens": 88969533.0, "step": 51290 }, { "entropy": 5.8711480617523195, "epoch": 3.9909356156389806, "grad_norm": 1.3828125, "learning_rate": 0.0003482819514032647, "loss": 4.9617, "mean_token_accuracy": 0.20814579129219055, "num_tokens": 88978512.0, "step": 51295 }, { "entropy": 5.885678720474243, "epoch": 3.9913246450106983, "grad_norm": 1.375, "learning_rate": 0.00034825574647965945, "loss": 4.981, "mean_token_accuracy": 0.20806572437286378, "num_tokens": 88987120.0, "step": 51300 }, { "entropy": 5.873592042922974, "epoch": 3.991713674382416, "grad_norm": 1.3046875, "learning_rate": 0.00034822954044451485, "loss": 4.9999, "mean_token_accuracy": 0.2090362161397934, "num_tokens": 88996271.0, "step": 51305 }, { "entropy": 5.873507690429688, "epoch": 3.9921027037541332, "grad_norm": 1.359375, "learning_rate": 0.0003482033332982286, "loss": 4.9694, "mean_token_accuracy": 0.20435363054275513, "num_tokens": 89004538.0, "step": 51310 }, { "entropy": 5.886812973022461, "epoch": 3.992491733125851, "grad_norm": 1.3359375, "learning_rate": 0.0003481771250411982, "loss": 5.0066, "mean_token_accuracy": 0.21398760378360748, "num_tokens": 89013662.0, "step": 51315 }, { "entropy": 5.857099390029907, "epoch": 3.9928807624975686, "grad_norm": 1.3515625, "learning_rate": 0.0003481509156738214, "loss": 4.9395, "mean_token_accuracy": 0.21480198055505753, "num_tokens": 89022451.0, "step": 51320 }, { "entropy": 5.821994638442993, "epoch": 3.9932697918692863, "grad_norm": 1.3203125, "learning_rate": 0.00034812470519649593, "loss": 4.9425, "mean_token_accuracy": 0.20807889252901077, "num_tokens": 89030968.0, "step": 51325 }, { "entropy": 5.852965497970581, "epoch": 3.9936588212410036, "grad_norm": 1.296875, "learning_rate": 0.0003480984936096194, "loss": 4.9655, "mean_token_accuracy": 0.21269639432430268, "num_tokens": 89039614.0, "step": 51330 }, { "entropy": 5.830614900588989, "epoch": 3.9940478506127213, "grad_norm": 1.3828125, "learning_rate": 0.00034807228091358964, "loss": 4.9212, "mean_token_accuracy": 0.2144429162144661, "num_tokens": 89048245.0, "step": 51335 }, { "entropy": 5.798250150680542, "epoch": 3.994436879984439, "grad_norm": 1.3515625, "learning_rate": 0.0003480460671088043, "loss": 4.9096, "mean_token_accuracy": 0.20878808349370956, "num_tokens": 89057486.0, "step": 51340 }, { "entropy": 5.870675945281983, "epoch": 3.9948259093561562, "grad_norm": 1.4375, "learning_rate": 0.00034801985219566124, "loss": 4.9828, "mean_token_accuracy": 0.21076326072216034, "num_tokens": 89065833.0, "step": 51345 }, { "entropy": 5.807243156433105, "epoch": 3.995214938727874, "grad_norm": 1.328125, "learning_rate": 0.000347993636174558, "loss": 4.9879, "mean_token_accuracy": 0.21149246841669084, "num_tokens": 89074562.0, "step": 51350 }, { "entropy": 5.8848389148712155, "epoch": 3.9956039680995916, "grad_norm": 1.40625, "learning_rate": 0.00034796741904589263, "loss": 5.0681, "mean_token_accuracy": 0.2093788892030716, "num_tokens": 89083013.0, "step": 51355 }, { "entropy": 5.889097404479981, "epoch": 3.9959929974713093, "grad_norm": 1.3515625, "learning_rate": 0.00034794120081006275, "loss": 4.9559, "mean_token_accuracy": 0.2122424453496933, "num_tokens": 89090926.0, "step": 51360 }, { "entropy": 5.895497894287109, "epoch": 3.9963820268430266, "grad_norm": 1.421875, "learning_rate": 0.0003479149814674663, "loss": 4.9536, "mean_token_accuracy": 0.21503602415323259, "num_tokens": 89099251.0, "step": 51365 }, { "entropy": 5.793537569046021, "epoch": 3.9967710562147443, "grad_norm": 1.3125, "learning_rate": 0.000347888761018501, "loss": 4.9873, "mean_token_accuracy": 0.20885937809944152, "num_tokens": 89108227.0, "step": 51370 }, { "entropy": 5.832405614852905, "epoch": 3.9971600855864615, "grad_norm": 1.3828125, "learning_rate": 0.0003478625394635648, "loss": 4.954, "mean_token_accuracy": 0.21119687408208848, "num_tokens": 89116434.0, "step": 51375 }, { "entropy": 5.8649993419647215, "epoch": 3.997549114958179, "grad_norm": 1.390625, "learning_rate": 0.00034783631680305554, "loss": 4.9363, "mean_token_accuracy": 0.21274131238460542, "num_tokens": 89124855.0, "step": 51380 }, { "entropy": 5.8474983215332035, "epoch": 3.997938144329897, "grad_norm": 1.2890625, "learning_rate": 0.0003478100930373711, "loss": 4.9259, "mean_token_accuracy": 0.21812352240085603, "num_tokens": 89133476.0, "step": 51385 }, { "entropy": 5.794953107833862, "epoch": 3.9983271737016146, "grad_norm": 1.46875, "learning_rate": 0.0003477838681669094, "loss": 4.9301, "mean_token_accuracy": 0.21258549988269806, "num_tokens": 89142306.0, "step": 51390 }, { "entropy": 5.808091068267823, "epoch": 3.9987162030733323, "grad_norm": 1.40625, "learning_rate": 0.0003477576421920682, "loss": 4.9318, "mean_token_accuracy": 0.2148516833782196, "num_tokens": 89151101.0, "step": 51395 }, { "entropy": 5.871802282333374, "epoch": 3.9991052324450496, "grad_norm": 1.3046875, "learning_rate": 0.0003477314151132458, "loss": 4.9488, "mean_token_accuracy": 0.21525301337242125, "num_tokens": 89159311.0, "step": 51400 }, { "entropy": 5.8826089859008786, "epoch": 3.9994942618167673, "grad_norm": 1.375, "learning_rate": 0.00034770518693083986, "loss": 4.9755, "mean_token_accuracy": 0.2160160630941391, "num_tokens": 89167130.0, "step": 51405 }, { "entropy": 5.878591108322143, "epoch": 3.9998832911884845, "grad_norm": 1.28125, "learning_rate": 0.00034767895764524845, "loss": 5.0374, "mean_token_accuracy": 0.20312586575746536, "num_tokens": 89175732.0, "step": 51410 }, { "entropy": 5.887243482801649, "epoch": 4.000233417623031, "grad_norm": 1.4375, "learning_rate": 0.00034765272725686947, "loss": 4.966, "mean_token_accuracy": 0.21463285220993888, "num_tokens": 89182536.0, "step": 51415 }, { "entropy": 5.847770500183105, "epoch": 4.000622446994748, "grad_norm": 1.40625, "learning_rate": 0.00034762649576610105, "loss": 4.9144, "mean_token_accuracy": 0.20992750078439712, "num_tokens": 89191431.0, "step": 51420 }, { "entropy": 5.82253475189209, "epoch": 4.0010114763664655, "grad_norm": 1.375, "learning_rate": 0.00034760026317334113, "loss": 4.9274, "mean_token_accuracy": 0.21194372475147247, "num_tokens": 89200365.0, "step": 51425 }, { "entropy": 5.8528557300567625, "epoch": 4.001400505738183, "grad_norm": 1.375, "learning_rate": 0.0003475740294789878, "loss": 4.9747, "mean_token_accuracy": 0.21010030657052994, "num_tokens": 89208968.0, "step": 51430 }, { "entropy": 5.920001745223999, "epoch": 4.001789535109901, "grad_norm": 1.5546875, "learning_rate": 0.000347547794683439, "loss": 5.0569, "mean_token_accuracy": 0.2095174714922905, "num_tokens": 89217543.0, "step": 51435 }, { "entropy": 5.8109735488891605, "epoch": 4.002178564481619, "grad_norm": 1.3671875, "learning_rate": 0.0003475215587870929, "loss": 4.8692, "mean_token_accuracy": 0.22096231430768967, "num_tokens": 89225847.0, "step": 51440 }, { "entropy": 5.918213987350464, "epoch": 4.002567593853336, "grad_norm": 1.28125, "learning_rate": 0.0003474953217903477, "loss": 5.0434, "mean_token_accuracy": 0.20063689053058625, "num_tokens": 89235010.0, "step": 51445 }, { "entropy": 5.94193925857544, "epoch": 4.002956623225053, "grad_norm": 1.40625, "learning_rate": 0.0003474690836936013, "loss": 4.9798, "mean_token_accuracy": 0.21669410169124603, "num_tokens": 89243827.0, "step": 51450 }, { "entropy": 5.908694267272949, "epoch": 4.003345652596771, "grad_norm": 1.28125, "learning_rate": 0.0003474428444972519, "loss": 5.0451, "mean_token_accuracy": 0.20975689738988876, "num_tokens": 89252574.0, "step": 51455 }, { "entropy": 5.838890600204468, "epoch": 4.0037346819684885, "grad_norm": 1.4765625, "learning_rate": 0.0003474166042016977, "loss": 4.9557, "mean_token_accuracy": 0.21729073375463487, "num_tokens": 89260827.0, "step": 51460 }, { "entropy": 5.871178770065308, "epoch": 4.004123711340206, "grad_norm": 1.375, "learning_rate": 0.00034739036280733674, "loss": 4.9934, "mean_token_accuracy": 0.21165695637464524, "num_tokens": 89269635.0, "step": 51465 }, { "entropy": 5.910505914688111, "epoch": 4.004512740711924, "grad_norm": 1.359375, "learning_rate": 0.00034736412031456714, "loss": 5.0468, "mean_token_accuracy": 0.21114324331283568, "num_tokens": 89278490.0, "step": 51470 }, { "entropy": 5.937170362472534, "epoch": 4.004901770083642, "grad_norm": 1.5078125, "learning_rate": 0.00034733787672378734, "loss": 4.984, "mean_token_accuracy": 0.21607834249734878, "num_tokens": 89287337.0, "step": 51475 }, { "entropy": 5.841301965713501, "epoch": 4.005290799455359, "grad_norm": 1.40625, "learning_rate": 0.0003473116320353953, "loss": 4.919, "mean_token_accuracy": 0.213398315012455, "num_tokens": 89295703.0, "step": 51480 }, { "entropy": 5.91580228805542, "epoch": 4.005679828827076, "grad_norm": 1.328125, "learning_rate": 0.0003472853862497895, "loss": 5.0054, "mean_token_accuracy": 0.21069230139255524, "num_tokens": 89304470.0, "step": 51485 }, { "entropy": 5.720736885070801, "epoch": 4.006068858198794, "grad_norm": 1.328125, "learning_rate": 0.0003472591393673679, "loss": 4.7695, "mean_token_accuracy": 0.2294747680425644, "num_tokens": 89313344.0, "step": 51490 }, { "entropy": 5.793164920806885, "epoch": 4.0064578875705115, "grad_norm": 1.390625, "learning_rate": 0.00034723289138852885, "loss": 4.8648, "mean_token_accuracy": 0.22012102752923965, "num_tokens": 89322112.0, "step": 51495 }, { "entropy": 5.8356749534606935, "epoch": 4.006846916942229, "grad_norm": 1.40625, "learning_rate": 0.0003472066423136707, "loss": 4.9101, "mean_token_accuracy": 0.2195070877671242, "num_tokens": 89331972.0, "step": 51500 }, { "entropy": 5.899766731262207, "epoch": 4.007235946313947, "grad_norm": 1.359375, "learning_rate": 0.0003471803921431917, "loss": 4.8813, "mean_token_accuracy": 0.22574669122695923, "num_tokens": 89340343.0, "step": 51505 }, { "entropy": 5.825743770599365, "epoch": 4.007624975685665, "grad_norm": 1.3671875, "learning_rate": 0.00034715414087749003, "loss": 4.994, "mean_token_accuracy": 0.21207704097032548, "num_tokens": 89349063.0, "step": 51510 }, { "entropy": 5.819300031661987, "epoch": 4.008014005057382, "grad_norm": 1.3046875, "learning_rate": 0.0003471278885169642, "loss": 4.9093, "mean_token_accuracy": 0.2208851844072342, "num_tokens": 89357648.0, "step": 51515 }, { "entropy": 5.895505380630493, "epoch": 4.008403034429099, "grad_norm": 1.3671875, "learning_rate": 0.00034710163506201247, "loss": 5.0451, "mean_token_accuracy": 0.20482246428728104, "num_tokens": 89366168.0, "step": 51520 }, { "entropy": 5.782926845550537, "epoch": 4.008792063800817, "grad_norm": 1.390625, "learning_rate": 0.00034707538051303316, "loss": 4.8446, "mean_token_accuracy": 0.21345599740743637, "num_tokens": 89374314.0, "step": 51525 }, { "entropy": 5.827961158752442, "epoch": 4.0091810931725345, "grad_norm": 1.40625, "learning_rate": 0.0003470491248704247, "loss": 4.972, "mean_token_accuracy": 0.2147280603647232, "num_tokens": 89383377.0, "step": 51530 }, { "entropy": 5.874631357192993, "epoch": 4.009570122544252, "grad_norm": 1.359375, "learning_rate": 0.00034702286813458543, "loss": 4.9524, "mean_token_accuracy": 0.21077161878347397, "num_tokens": 89392456.0, "step": 51535 }, { "entropy": 5.893610954284668, "epoch": 4.00995915191597, "grad_norm": 1.484375, "learning_rate": 0.00034699661030591374, "loss": 5.0621, "mean_token_accuracy": 0.2039644494652748, "num_tokens": 89401398.0, "step": 51540 }, { "entropy": 5.8979573249816895, "epoch": 4.0103481812876876, "grad_norm": 1.375, "learning_rate": 0.0003469703513848081, "loss": 4.9892, "mean_token_accuracy": 0.2142876386642456, "num_tokens": 89411138.0, "step": 51545 }, { "entropy": 5.829272270202637, "epoch": 4.010737210659404, "grad_norm": 1.40625, "learning_rate": 0.000346944091371667, "loss": 4.8803, "mean_token_accuracy": 0.21958157122135163, "num_tokens": 89420121.0, "step": 51550 }, { "entropy": 5.939239358901977, "epoch": 4.011126240031122, "grad_norm": 1.328125, "learning_rate": 0.0003469178302668888, "loss": 4.9827, "mean_token_accuracy": 0.19973281472921373, "num_tokens": 89429381.0, "step": 51555 }, { "entropy": 5.843513345718383, "epoch": 4.01151526940284, "grad_norm": 1.3125, "learning_rate": 0.0003468915680708719, "loss": 4.9543, "mean_token_accuracy": 0.22007095217704772, "num_tokens": 89438658.0, "step": 51560 }, { "entropy": 5.825055980682373, "epoch": 4.0119042987745575, "grad_norm": 1.34375, "learning_rate": 0.000346865304784015, "loss": 4.9286, "mean_token_accuracy": 0.2138259932398796, "num_tokens": 89447336.0, "step": 51565 }, { "entropy": 5.842803239822388, "epoch": 4.012293328146275, "grad_norm": 1.3125, "learning_rate": 0.0003468390404067164, "loss": 4.8487, "mean_token_accuracy": 0.21418669074773788, "num_tokens": 89456006.0, "step": 51570 }, { "entropy": 5.884385204315185, "epoch": 4.012682357517993, "grad_norm": 1.25, "learning_rate": 0.0003468127749393747, "loss": 4.9873, "mean_token_accuracy": 0.2110860377550125, "num_tokens": 89465238.0, "step": 51575 }, { "entropy": 5.883871746063233, "epoch": 4.0130713868897105, "grad_norm": 1.2890625, "learning_rate": 0.0003467865083823885, "loss": 5.0173, "mean_token_accuracy": 0.21200748085975646, "num_tokens": 89474969.0, "step": 51580 }, { "entropy": 5.89361081123352, "epoch": 4.013460416261427, "grad_norm": 1.265625, "learning_rate": 0.0003467602407361563, "loss": 4.9274, "mean_token_accuracy": 0.20734572857618333, "num_tokens": 89483678.0, "step": 51585 }, { "entropy": 5.8581483364105225, "epoch": 4.013849445633145, "grad_norm": 1.359375, "learning_rate": 0.00034673397200107663, "loss": 4.9033, "mean_token_accuracy": 0.21750182062387466, "num_tokens": 89492640.0, "step": 51590 }, { "entropy": 5.850538110733032, "epoch": 4.014238475004863, "grad_norm": 1.4140625, "learning_rate": 0.0003467077021775481, "loss": 4.8803, "mean_token_accuracy": 0.22348518967628478, "num_tokens": 89500771.0, "step": 51595 }, { "entropy": 5.8790710926055905, "epoch": 4.0146275043765804, "grad_norm": 1.4296875, "learning_rate": 0.00034668143126596933, "loss": 4.9868, "mean_token_accuracy": 0.21111732125282287, "num_tokens": 89509182.0, "step": 51600 }, { "entropy": 5.826691102981568, "epoch": 4.015016533748298, "grad_norm": 1.4453125, "learning_rate": 0.00034665515926673903, "loss": 4.8829, "mean_token_accuracy": 0.21729082316160203, "num_tokens": 89517747.0, "step": 51605 }, { "entropy": 5.8871863842010494, "epoch": 4.015405563120016, "grad_norm": 1.265625, "learning_rate": 0.0003466288861802556, "loss": 5.0454, "mean_token_accuracy": 0.2020317181944847, "num_tokens": 89527386.0, "step": 51610 }, { "entropy": 5.909409666061402, "epoch": 4.0157945924917335, "grad_norm": 1.359375, "learning_rate": 0.0003466026120069179, "loss": 4.9056, "mean_token_accuracy": 0.21647431552410126, "num_tokens": 89537116.0, "step": 51615 }, { "entropy": 5.8617151260375975, "epoch": 4.01618362186345, "grad_norm": 1.390625, "learning_rate": 0.0003465763367471245, "loss": 4.9577, "mean_token_accuracy": 0.21557818800210954, "num_tokens": 89545725.0, "step": 51620 }, { "entropy": 5.84841480255127, "epoch": 4.016572651235168, "grad_norm": 1.4140625, "learning_rate": 0.00034655006040127415, "loss": 4.9013, "mean_token_accuracy": 0.21655377894639968, "num_tokens": 89554055.0, "step": 51625 }, { "entropy": 5.820179891586304, "epoch": 4.016961680606886, "grad_norm": 1.3828125, "learning_rate": 0.0003465237829697655, "loss": 4.9327, "mean_token_accuracy": 0.2164019450545311, "num_tokens": 89563438.0, "step": 51630 }, { "entropy": 5.840360116958618, "epoch": 4.017350709978603, "grad_norm": 1.421875, "learning_rate": 0.00034649750445299725, "loss": 4.9604, "mean_token_accuracy": 0.21359585225582123, "num_tokens": 89571847.0, "step": 51635 }, { "entropy": 5.8995825290679935, "epoch": 4.017739739350321, "grad_norm": 1.4375, "learning_rate": 0.0003464712248513682, "loss": 5.0534, "mean_token_accuracy": 0.20851898938417435, "num_tokens": 89581295.0, "step": 51640 }, { "entropy": 5.825034141540527, "epoch": 4.018128768722039, "grad_norm": 1.3125, "learning_rate": 0.0003464449441652771, "loss": 4.8607, "mean_token_accuracy": 0.2183113157749176, "num_tokens": 89590029.0, "step": 51645 }, { "entropy": 5.838750600814819, "epoch": 4.018517798093756, "grad_norm": 1.4609375, "learning_rate": 0.0003464186623951227, "loss": 4.9124, "mean_token_accuracy": 0.2093912646174431, "num_tokens": 89598508.0, "step": 51650 }, { "entropy": 5.923469829559326, "epoch": 4.018906827465473, "grad_norm": 1.4296875, "learning_rate": 0.0003463923795413037, "loss": 5.0266, "mean_token_accuracy": 0.21365304589271544, "num_tokens": 89607199.0, "step": 51655 }, { "entropy": 5.821251487731933, "epoch": 4.019295856837191, "grad_norm": 1.3515625, "learning_rate": 0.00034636609560421906, "loss": 4.9347, "mean_token_accuracy": 0.2170972153544426, "num_tokens": 89616048.0, "step": 51660 }, { "entropy": 5.790434265136719, "epoch": 4.019684886208909, "grad_norm": 1.4921875, "learning_rate": 0.00034633981058426744, "loss": 4.9035, "mean_token_accuracy": 0.21911892145872117, "num_tokens": 89624652.0, "step": 51665 }, { "entropy": 5.840940237045288, "epoch": 4.020073915580626, "grad_norm": 1.3671875, "learning_rate": 0.0003463135244818477, "loss": 4.9025, "mean_token_accuracy": 0.21684335619211198, "num_tokens": 89633132.0, "step": 51670 }, { "entropy": 5.7724823474884035, "epoch": 4.020462944952344, "grad_norm": 1.390625, "learning_rate": 0.0003462872372973588, "loss": 4.8898, "mean_token_accuracy": 0.21326747089624404, "num_tokens": 89641590.0, "step": 51675 }, { "entropy": 5.869701910018921, "epoch": 4.020851974324062, "grad_norm": 1.3984375, "learning_rate": 0.0003462609490311996, "loss": 5.0153, "mean_token_accuracy": 0.20337623804807664, "num_tokens": 89650269.0, "step": 51680 }, { "entropy": 5.829849576950073, "epoch": 4.021241003695779, "grad_norm": 1.4453125, "learning_rate": 0.0003462346596837689, "loss": 4.916, "mean_token_accuracy": 0.21733044683933259, "num_tokens": 89658493.0, "step": 51685 }, { "entropy": 5.854977035522461, "epoch": 4.021630033067496, "grad_norm": 1.5234375, "learning_rate": 0.0003462083692554655, "loss": 4.8495, "mean_token_accuracy": 0.2134554609656334, "num_tokens": 89667128.0, "step": 51690 }, { "entropy": 5.842618942260742, "epoch": 4.022019062439214, "grad_norm": 1.359375, "learning_rate": 0.00034618207774668854, "loss": 4.9735, "mean_token_accuracy": 0.21308404356241226, "num_tokens": 89675728.0, "step": 51695 }, { "entropy": 5.806252431869507, "epoch": 4.022408091810932, "grad_norm": 1.359375, "learning_rate": 0.00034615578515783687, "loss": 4.9303, "mean_token_accuracy": 0.2158755838871002, "num_tokens": 89683392.0, "step": 51700 }, { "entropy": 5.8664929389953615, "epoch": 4.022797121182649, "grad_norm": 1.3046875, "learning_rate": 0.00034612949148930935, "loss": 4.9401, "mean_token_accuracy": 0.21281522661447524, "num_tokens": 89691541.0, "step": 51705 }, { "entropy": 5.851822471618652, "epoch": 4.023186150554367, "grad_norm": 1.3828125, "learning_rate": 0.000346103196741505, "loss": 4.8704, "mean_token_accuracy": 0.22271666973829268, "num_tokens": 89700445.0, "step": 51710 }, { "entropy": 5.831646203994751, "epoch": 4.023575179926085, "grad_norm": 1.5859375, "learning_rate": 0.00034607690091482284, "loss": 4.9208, "mean_token_accuracy": 0.2136103704571724, "num_tokens": 89708902.0, "step": 51715 }, { "entropy": 5.780469989776611, "epoch": 4.023964209297802, "grad_norm": 1.390625, "learning_rate": 0.0003460506040096619, "loss": 4.8231, "mean_token_accuracy": 0.21364619135856627, "num_tokens": 89716804.0, "step": 51720 }, { "entropy": 5.843337440490723, "epoch": 4.024353238669519, "grad_norm": 1.390625, "learning_rate": 0.0003460243060264211, "loss": 4.9184, "mean_token_accuracy": 0.21933688521385192, "num_tokens": 89726046.0, "step": 51725 }, { "entropy": 5.784404754638672, "epoch": 4.024742268041237, "grad_norm": 1.2890625, "learning_rate": 0.00034599800696549944, "loss": 4.8752, "mean_token_accuracy": 0.21664309799671172, "num_tokens": 89735106.0, "step": 51730 }, { "entropy": 5.838611793518067, "epoch": 4.025131297412955, "grad_norm": 1.390625, "learning_rate": 0.000345971706827296, "loss": 4.9272, "mean_token_accuracy": 0.20954085886478424, "num_tokens": 89744456.0, "step": 51735 }, { "entropy": 5.8587206363677975, "epoch": 4.025520326784672, "grad_norm": 1.53125, "learning_rate": 0.00034594540561221, "loss": 4.9673, "mean_token_accuracy": 0.21325650811195374, "num_tokens": 89753179.0, "step": 51740 }, { "entropy": 5.819930648803711, "epoch": 4.02590935615639, "grad_norm": 1.3046875, "learning_rate": 0.00034591910332064027, "loss": 4.9315, "mean_token_accuracy": 0.2214486390352249, "num_tokens": 89762063.0, "step": 51745 }, { "entropy": 5.8859058856964115, "epoch": 4.026298385528108, "grad_norm": 1.375, "learning_rate": 0.0003458927999529861, "loss": 4.9988, "mean_token_accuracy": 0.20841454565525055, "num_tokens": 89770501.0, "step": 51750 }, { "entropy": 5.88410587310791, "epoch": 4.026687414899825, "grad_norm": 1.3515625, "learning_rate": 0.00034586649550964656, "loss": 4.9404, "mean_token_accuracy": 0.21529189944267274, "num_tokens": 89778921.0, "step": 51755 }, { "entropy": 5.891788339614868, "epoch": 4.027076444271542, "grad_norm": 1.40625, "learning_rate": 0.00034584018999102073, "loss": 4.9691, "mean_token_accuracy": 0.20673412531614305, "num_tokens": 89786663.0, "step": 51760 }, { "entropy": 5.881133604049682, "epoch": 4.02746547364326, "grad_norm": 1.3203125, "learning_rate": 0.00034581388339750775, "loss": 4.9578, "mean_token_accuracy": 0.2101680487394333, "num_tokens": 89795614.0, "step": 51765 }, { "entropy": 5.7927717685699465, "epoch": 4.027854503014978, "grad_norm": 1.3828125, "learning_rate": 0.0003457875757295067, "loss": 4.8229, "mean_token_accuracy": 0.22256098538637162, "num_tokens": 89804145.0, "step": 51770 }, { "entropy": 5.87747015953064, "epoch": 4.028243532386695, "grad_norm": 1.4453125, "learning_rate": 0.00034576126698741697, "loss": 4.9044, "mean_token_accuracy": 0.21733541786670685, "num_tokens": 89812229.0, "step": 51775 }, { "entropy": 5.840543794631958, "epoch": 4.028632561758413, "grad_norm": 1.4609375, "learning_rate": 0.0003457349571716376, "loss": 4.9439, "mean_token_accuracy": 0.2158215880393982, "num_tokens": 89820665.0, "step": 51780 }, { "entropy": 5.817200756072998, "epoch": 4.02902159113013, "grad_norm": 1.359375, "learning_rate": 0.00034570864628256795, "loss": 4.8576, "mean_token_accuracy": 0.21980795115232468, "num_tokens": 89829219.0, "step": 51785 }, { "entropy": 5.822385025024414, "epoch": 4.029410620501848, "grad_norm": 1.390625, "learning_rate": 0.00034568233432060705, "loss": 4.8433, "mean_token_accuracy": 0.22065728902816772, "num_tokens": 89837059.0, "step": 51790 }, { "entropy": 5.830938291549683, "epoch": 4.029799649873565, "grad_norm": 1.4609375, "learning_rate": 0.0003456560212861543, "loss": 4.9514, "mean_token_accuracy": 0.2134246677160263, "num_tokens": 89845431.0, "step": 51795 }, { "entropy": 5.965207815170288, "epoch": 4.030188679245283, "grad_norm": 1.4375, "learning_rate": 0.0003456297071796087, "loss": 5.0857, "mean_token_accuracy": 0.20940040200948715, "num_tokens": 89854602.0, "step": 51800 }, { "entropy": 5.809377193450928, "epoch": 4.030577708617001, "grad_norm": 1.375, "learning_rate": 0.00034560339200136983, "loss": 4.8028, "mean_token_accuracy": 0.22280970215797424, "num_tokens": 89863156.0, "step": 51805 }, { "entropy": 5.85821943283081, "epoch": 4.030966737988718, "grad_norm": 1.4375, "learning_rate": 0.00034557707575183684, "loss": 4.9222, "mean_token_accuracy": 0.2119775965809822, "num_tokens": 89872484.0, "step": 51810 }, { "entropy": 5.940649604797363, "epoch": 4.031355767360436, "grad_norm": 1.375, "learning_rate": 0.00034555075843140917, "loss": 4.9597, "mean_token_accuracy": 0.21367390155792237, "num_tokens": 89880955.0, "step": 51815 }, { "entropy": 5.896453523635865, "epoch": 4.031744796732153, "grad_norm": 1.4453125, "learning_rate": 0.00034552444004048587, "loss": 4.9476, "mean_token_accuracy": 0.2168971434235573, "num_tokens": 89889025.0, "step": 51820 }, { "entropy": 5.83285551071167, "epoch": 4.032133826103871, "grad_norm": 1.4921875, "learning_rate": 0.00034549812057946657, "loss": 4.9125, "mean_token_accuracy": 0.21348831355571746, "num_tokens": 89897319.0, "step": 51825 }, { "entropy": 5.776823091506958, "epoch": 4.032522855475588, "grad_norm": 1.328125, "learning_rate": 0.0003454718000487505, "loss": 4.8737, "mean_token_accuracy": 0.2248667821288109, "num_tokens": 89905821.0, "step": 51830 }, { "entropy": 5.917414569854737, "epoch": 4.032911884847306, "grad_norm": 1.5, "learning_rate": 0.0003454454784487369, "loss": 4.9487, "mean_token_accuracy": 0.21242906153202057, "num_tokens": 89913982.0, "step": 51835 }, { "entropy": 5.906381750106812, "epoch": 4.033300914219024, "grad_norm": 1.3671875, "learning_rate": 0.0003454191557798254, "loss": 4.9484, "mean_token_accuracy": 0.21335796564817427, "num_tokens": 89923237.0, "step": 51840 }, { "entropy": 5.853638601303101, "epoch": 4.033689943590741, "grad_norm": 1.3046875, "learning_rate": 0.00034539283204241525, "loss": 4.9812, "mean_token_accuracy": 0.21192273050546645, "num_tokens": 89932836.0, "step": 51845 }, { "entropy": 5.828078174591065, "epoch": 4.034078972962459, "grad_norm": 1.390625, "learning_rate": 0.00034536650723690596, "loss": 4.8826, "mean_token_accuracy": 0.22084299325942994, "num_tokens": 89941585.0, "step": 51850 }, { "entropy": 5.7453244686126705, "epoch": 4.034468002334176, "grad_norm": 1.34375, "learning_rate": 0.00034534018136369687, "loss": 4.8465, "mean_token_accuracy": 0.21906370669603348, "num_tokens": 89950561.0, "step": 51855 }, { "entropy": 5.805835294723511, "epoch": 4.034857031705894, "grad_norm": 1.3203125, "learning_rate": 0.0003453138544231875, "loss": 4.908, "mean_token_accuracy": 0.2156316429376602, "num_tokens": 89959471.0, "step": 51860 }, { "entropy": 5.8475088596344, "epoch": 4.035246061077611, "grad_norm": 1.46875, "learning_rate": 0.0003452875264157774, "loss": 4.9278, "mean_token_accuracy": 0.21297028362751008, "num_tokens": 89967394.0, "step": 51865 }, { "entropy": 5.831227111816406, "epoch": 4.035635090449329, "grad_norm": 1.46875, "learning_rate": 0.00034526119734186586, "loss": 4.9218, "mean_token_accuracy": 0.21782768815755843, "num_tokens": 89975074.0, "step": 51870 }, { "entropy": 5.863160467147827, "epoch": 4.036024119821047, "grad_norm": 1.40625, "learning_rate": 0.00034523486720185246, "loss": 4.9048, "mean_token_accuracy": 0.21590020507574081, "num_tokens": 89983353.0, "step": 51875 }, { "entropy": 5.882989978790283, "epoch": 4.036413149192764, "grad_norm": 1.46875, "learning_rate": 0.00034520853599613675, "loss": 4.9702, "mean_token_accuracy": 0.21613977700471879, "num_tokens": 89991982.0, "step": 51880 }, { "entropy": 5.783292245864868, "epoch": 4.036802178564481, "grad_norm": 1.4140625, "learning_rate": 0.00034518220372511835, "loss": 4.8609, "mean_token_accuracy": 0.21966894418001176, "num_tokens": 90000804.0, "step": 51885 }, { "entropy": 5.853563737869263, "epoch": 4.037191207936199, "grad_norm": 1.328125, "learning_rate": 0.0003451558703891967, "loss": 4.959, "mean_token_accuracy": 0.21911513805389404, "num_tokens": 90009500.0, "step": 51890 }, { "entropy": 5.931933641433716, "epoch": 4.037580237307917, "grad_norm": 1.3984375, "learning_rate": 0.0003451295359887713, "loss": 4.9323, "mean_token_accuracy": 0.21373807936906813, "num_tokens": 90017753.0, "step": 51895 }, { "entropy": 5.760224485397339, "epoch": 4.037969266679634, "grad_norm": 1.3046875, "learning_rate": 0.0003451032005242418, "loss": 4.7883, "mean_token_accuracy": 0.22399672865867615, "num_tokens": 90027475.0, "step": 51900 }, { "entropy": 5.823863077163696, "epoch": 4.038358296051352, "grad_norm": 1.421875, "learning_rate": 0.00034507686399600786, "loss": 4.9666, "mean_token_accuracy": 0.21332767605781555, "num_tokens": 90035510.0, "step": 51905 }, { "entropy": 5.843187046051026, "epoch": 4.03874732542307, "grad_norm": 1.34375, "learning_rate": 0.00034505052640446907, "loss": 4.9225, "mean_token_accuracy": 0.2128884345293045, "num_tokens": 90043858.0, "step": 51910 }, { "entropy": 5.88541316986084, "epoch": 4.039136354794787, "grad_norm": 1.4296875, "learning_rate": 0.000345024187750025, "loss": 5.0361, "mean_token_accuracy": 0.21439738124608992, "num_tokens": 90052361.0, "step": 51915 }, { "entropy": 5.850347900390625, "epoch": 4.039525384166504, "grad_norm": 1.3984375, "learning_rate": 0.00034499784803307534, "loss": 4.9204, "mean_token_accuracy": 0.21587879806756974, "num_tokens": 90060856.0, "step": 51920 }, { "entropy": 5.912502241134644, "epoch": 4.039914413538222, "grad_norm": 1.390625, "learning_rate": 0.0003449715072540198, "loss": 4.9526, "mean_token_accuracy": 0.21202347576618194, "num_tokens": 90069452.0, "step": 51925 }, { "entropy": 5.799990797042847, "epoch": 4.04030344290994, "grad_norm": 1.3515625, "learning_rate": 0.00034494516541325795, "loss": 4.8999, "mean_token_accuracy": 0.21839715242385865, "num_tokens": 90078077.0, "step": 51930 }, { "entropy": 5.852776336669922, "epoch": 4.040692472281657, "grad_norm": 1.34375, "learning_rate": 0.0003449188225111895, "loss": 4.9594, "mean_token_accuracy": 0.2091571494936943, "num_tokens": 90087492.0, "step": 51935 }, { "entropy": 5.846455240249634, "epoch": 4.041081501653375, "grad_norm": 1.453125, "learning_rate": 0.00034489247854821426, "loss": 4.9206, "mean_token_accuracy": 0.21906210035085677, "num_tokens": 90095988.0, "step": 51940 }, { "entropy": 5.857277679443359, "epoch": 4.041470531025093, "grad_norm": 1.2421875, "learning_rate": 0.00034486613352473195, "loss": 4.9622, "mean_token_accuracy": 0.22436111718416213, "num_tokens": 90105135.0, "step": 51945 }, { "entropy": 5.855792617797851, "epoch": 4.04185956039681, "grad_norm": 1.46875, "learning_rate": 0.00034483978744114224, "loss": 4.9147, "mean_token_accuracy": 0.20848339051008224, "num_tokens": 90113800.0, "step": 51950 }, { "entropy": 5.918955278396607, "epoch": 4.042248589768527, "grad_norm": 1.3828125, "learning_rate": 0.0003448134402978449, "loss": 4.9945, "mean_token_accuracy": 0.21253035962581635, "num_tokens": 90121828.0, "step": 51955 }, { "entropy": 5.890660190582276, "epoch": 4.042637619140245, "grad_norm": 1.421875, "learning_rate": 0.00034478709209523974, "loss": 4.9535, "mean_token_accuracy": 0.22003810107707977, "num_tokens": 90129688.0, "step": 51960 }, { "entropy": 5.869661092758179, "epoch": 4.043026648511963, "grad_norm": 1.40625, "learning_rate": 0.0003447607428337265, "loss": 4.932, "mean_token_accuracy": 0.21317084282636642, "num_tokens": 90138282.0, "step": 51965 }, { "entropy": 5.8843940734863285, "epoch": 4.04341567788368, "grad_norm": 1.2734375, "learning_rate": 0.00034473439251370505, "loss": 4.9928, "mean_token_accuracy": 0.21330933421850204, "num_tokens": 90147356.0, "step": 51970 }, { "entropy": 5.892014789581299, "epoch": 4.043804707255398, "grad_norm": 1.3984375, "learning_rate": 0.0003447080411355752, "loss": 5.0069, "mean_token_accuracy": 0.20546454340219497, "num_tokens": 90156135.0, "step": 51975 }, { "entropy": 5.860663318634034, "epoch": 4.044193736627116, "grad_norm": 1.3203125, "learning_rate": 0.00034468168869973673, "loss": 4.9595, "mean_token_accuracy": 0.20745618790388107, "num_tokens": 90164691.0, "step": 51980 }, { "entropy": 5.865296077728272, "epoch": 4.0445827659988325, "grad_norm": 1.46875, "learning_rate": 0.00034465533520658967, "loss": 4.9237, "mean_token_accuracy": 0.21387062966823578, "num_tokens": 90173258.0, "step": 51985 }, { "entropy": 5.853560733795166, "epoch": 4.04497179537055, "grad_norm": 1.2890625, "learning_rate": 0.00034462898065653366, "loss": 4.9409, "mean_token_accuracy": 0.21798854023218156, "num_tokens": 90182228.0, "step": 51990 }, { "entropy": 5.858456611633301, "epoch": 4.045360824742268, "grad_norm": 1.296875, "learning_rate": 0.0003446026250499687, "loss": 4.9034, "mean_token_accuracy": 0.2145964190363884, "num_tokens": 90191046.0, "step": 51995 }, { "entropy": 5.895284032821655, "epoch": 4.045749854113986, "grad_norm": 1.3828125, "learning_rate": 0.0003445762683872946, "loss": 4.8952, "mean_token_accuracy": 0.21606423407793046, "num_tokens": 90200201.0, "step": 52000 }, { "entropy": 5.897708225250244, "epoch": 4.046138883485703, "grad_norm": 1.3984375, "learning_rate": 0.0003445499106689115, "loss": 4.9831, "mean_token_accuracy": 0.21295739710330963, "num_tokens": 90209817.0, "step": 52005 }, { "entropy": 5.869578075408936, "epoch": 4.046527912857421, "grad_norm": 1.375, "learning_rate": 0.00034452355189521915, "loss": 4.9788, "mean_token_accuracy": 0.21448916345834732, "num_tokens": 90219560.0, "step": 52010 }, { "entropy": 5.9251245021820065, "epoch": 4.046916942229139, "grad_norm": 1.375, "learning_rate": 0.0003444971920666176, "loss": 4.9819, "mean_token_accuracy": 0.20694324523210525, "num_tokens": 90228549.0, "step": 52015 }, { "entropy": 5.851255273818969, "epoch": 4.0473059716008555, "grad_norm": 1.359375, "learning_rate": 0.0003444708311835068, "loss": 4.9273, "mean_token_accuracy": 0.2131507635116577, "num_tokens": 90237415.0, "step": 52020 }, { "entropy": 5.768934535980224, "epoch": 4.047695000972573, "grad_norm": 1.4453125, "learning_rate": 0.00034444446924628664, "loss": 4.8237, "mean_token_accuracy": 0.22151803523302077, "num_tokens": 90246546.0, "step": 52025 }, { "entropy": 5.8288074970245365, "epoch": 4.048084030344291, "grad_norm": 1.4609375, "learning_rate": 0.00034441810625535725, "loss": 5.0028, "mean_token_accuracy": 0.20632456094026566, "num_tokens": 90254657.0, "step": 52030 }, { "entropy": 5.80646014213562, "epoch": 4.048473059716009, "grad_norm": 1.453125, "learning_rate": 0.0003443917422111185, "loss": 4.8739, "mean_token_accuracy": 0.22058339565992355, "num_tokens": 90263760.0, "step": 52035 }, { "entropy": 5.840088510513306, "epoch": 4.048862089087726, "grad_norm": 1.359375, "learning_rate": 0.00034436537711397054, "loss": 4.8741, "mean_token_accuracy": 0.2253042533993721, "num_tokens": 90272483.0, "step": 52040 }, { "entropy": 5.775532579421997, "epoch": 4.049251118459444, "grad_norm": 1.4296875, "learning_rate": 0.0003443390109643134, "loss": 4.8346, "mean_token_accuracy": 0.21967874169349672, "num_tokens": 90280789.0, "step": 52045 }, { "entropy": 5.755535221099853, "epoch": 4.049640147831162, "grad_norm": 1.40625, "learning_rate": 0.0003443126437625472, "loss": 4.9342, "mean_token_accuracy": 0.21534928679466248, "num_tokens": 90289511.0, "step": 52050 }, { "entropy": 5.779669237136841, "epoch": 4.0500291772028785, "grad_norm": 1.296875, "learning_rate": 0.0003442862755090719, "loss": 4.9566, "mean_token_accuracy": 0.21513470113277436, "num_tokens": 90298716.0, "step": 52055 }, { "entropy": 5.860728740692139, "epoch": 4.050418206574596, "grad_norm": 1.3515625, "learning_rate": 0.00034425990620428763, "loss": 4.8897, "mean_token_accuracy": 0.22499209642410278, "num_tokens": 90307072.0, "step": 52060 }, { "entropy": 5.888653087615967, "epoch": 4.050807235946314, "grad_norm": 1.3828125, "learning_rate": 0.0003442335358485946, "loss": 4.9431, "mean_token_accuracy": 0.2191193073987961, "num_tokens": 90315388.0, "step": 52065 }, { "entropy": 5.86230058670044, "epoch": 4.051196265318032, "grad_norm": 1.2734375, "learning_rate": 0.0003442071644423928, "loss": 4.9585, "mean_token_accuracy": 0.21365384757518768, "num_tokens": 90323858.0, "step": 52070 }, { "entropy": 5.839594841003418, "epoch": 4.051585294689749, "grad_norm": 1.4140625, "learning_rate": 0.0003441807919860824, "loss": 4.9762, "mean_token_accuracy": 0.21400662660598754, "num_tokens": 90332425.0, "step": 52075 }, { "entropy": 5.888506841659546, "epoch": 4.051974324061467, "grad_norm": 1.375, "learning_rate": 0.00034415441848006364, "loss": 4.9801, "mean_token_accuracy": 0.21351763606071472, "num_tokens": 90340982.0, "step": 52080 }, { "entropy": 5.85154767036438, "epoch": 4.052363353433184, "grad_norm": 1.4140625, "learning_rate": 0.00034412804392473665, "loss": 4.8851, "mean_token_accuracy": 0.21373774707317353, "num_tokens": 90348876.0, "step": 52085 }, { "entropy": 5.813586473464966, "epoch": 4.0527523828049015, "grad_norm": 1.3046875, "learning_rate": 0.0003441016683205016, "loss": 4.8459, "mean_token_accuracy": 0.22597628980875015, "num_tokens": 90357531.0, "step": 52090 }, { "entropy": 5.906377840042114, "epoch": 4.053141412176619, "grad_norm": 1.390625, "learning_rate": 0.00034407529166775874, "loss": 5.0292, "mean_token_accuracy": 0.21090985536575318, "num_tokens": 90365542.0, "step": 52095 }, { "entropy": 5.867205953598022, "epoch": 4.053530441548337, "grad_norm": 1.3046875, "learning_rate": 0.0003440489139669083, "loss": 4.9546, "mean_token_accuracy": 0.21042577922344208, "num_tokens": 90374295.0, "step": 52100 }, { "entropy": 5.876213121414184, "epoch": 4.053919470920055, "grad_norm": 1.34375, "learning_rate": 0.00034402253521835036, "loss": 4.9465, "mean_token_accuracy": 0.21033870428800583, "num_tokens": 90382605.0, "step": 52105 }, { "entropy": 5.8448444366455075, "epoch": 4.054308500291772, "grad_norm": 1.3203125, "learning_rate": 0.0003439961554224855, "loss": 4.9128, "mean_token_accuracy": 0.20235624760389329, "num_tokens": 90391220.0, "step": 52110 }, { "entropy": 5.819440221786499, "epoch": 4.05469752966349, "grad_norm": 1.3125, "learning_rate": 0.0003439697745797137, "loss": 4.884, "mean_token_accuracy": 0.21345803439617156, "num_tokens": 90398986.0, "step": 52115 }, { "entropy": 5.836901044845581, "epoch": 4.055086559035207, "grad_norm": 1.265625, "learning_rate": 0.00034394339269043533, "loss": 4.9257, "mean_token_accuracy": 0.21374853402376176, "num_tokens": 90407671.0, "step": 52120 }, { "entropy": 5.90243182182312, "epoch": 4.0554755884069245, "grad_norm": 1.3828125, "learning_rate": 0.0003439170097550507, "loss": 4.9736, "mean_token_accuracy": 0.20809470266103744, "num_tokens": 90416184.0, "step": 52125 }, { "entropy": 5.890810012817383, "epoch": 4.055864617778642, "grad_norm": 1.4296875, "learning_rate": 0.0003438906257739602, "loss": 4.9129, "mean_token_accuracy": 0.21829990446567535, "num_tokens": 90424992.0, "step": 52130 }, { "entropy": 5.821826219558716, "epoch": 4.05625364715036, "grad_norm": 1.296875, "learning_rate": 0.0003438642407475641, "loss": 4.9091, "mean_token_accuracy": 0.21580708920955657, "num_tokens": 90433802.0, "step": 52135 }, { "entropy": 5.83425669670105, "epoch": 4.0566426765220776, "grad_norm": 1.375, "learning_rate": 0.0003438378546762627, "loss": 4.9824, "mean_token_accuracy": 0.21052108854055404, "num_tokens": 90441831.0, "step": 52140 }, { "entropy": 5.901113796234131, "epoch": 4.057031705893795, "grad_norm": 1.4375, "learning_rate": 0.0003438114675604565, "loss": 4.9272, "mean_token_accuracy": 0.21226226836442946, "num_tokens": 90450327.0, "step": 52145 }, { "entropy": 5.861714696884155, "epoch": 4.057420735265513, "grad_norm": 1.34375, "learning_rate": 0.0003437850794005457, "loss": 4.9069, "mean_token_accuracy": 0.21159172505140306, "num_tokens": 90459012.0, "step": 52150 }, { "entropy": 5.85460467338562, "epoch": 4.05780976463723, "grad_norm": 1.40625, "learning_rate": 0.0003437586901969309, "loss": 4.8992, "mean_token_accuracy": 0.2147402986884117, "num_tokens": 90467296.0, "step": 52155 }, { "entropy": 5.8318705558776855, "epoch": 4.0581987940089475, "grad_norm": 1.390625, "learning_rate": 0.0003437322999500124, "loss": 4.9433, "mean_token_accuracy": 0.206244358420372, "num_tokens": 90475953.0, "step": 52160 }, { "entropy": 5.8441853523254395, "epoch": 4.058587823380665, "grad_norm": 1.359375, "learning_rate": 0.00034370590866019063, "loss": 4.9437, "mean_token_accuracy": 0.21404767483472825, "num_tokens": 90483562.0, "step": 52165 }, { "entropy": 5.823260831832886, "epoch": 4.058976852752383, "grad_norm": 1.4140625, "learning_rate": 0.000343679516327866, "loss": 4.9592, "mean_token_accuracy": 0.2148243561387062, "num_tokens": 90491479.0, "step": 52170 }, { "entropy": 5.849781179428101, "epoch": 4.0593658821241005, "grad_norm": 1.28125, "learning_rate": 0.0003436531229534391, "loss": 4.9107, "mean_token_accuracy": 0.21868434995412828, "num_tokens": 90499674.0, "step": 52175 }, { "entropy": 5.82879114151001, "epoch": 4.059754911495818, "grad_norm": 1.3515625, "learning_rate": 0.0003436267285373103, "loss": 4.8462, "mean_token_accuracy": 0.22372164577245712, "num_tokens": 90508453.0, "step": 52180 }, { "entropy": 5.811535739898682, "epoch": 4.060143940867536, "grad_norm": 1.34375, "learning_rate": 0.00034360033307988014, "loss": 4.8743, "mean_token_accuracy": 0.21884083449840547, "num_tokens": 90516698.0, "step": 52185 }, { "entropy": 5.789293956756592, "epoch": 4.060532970239253, "grad_norm": 1.3671875, "learning_rate": 0.00034357393658154914, "loss": 4.92, "mean_token_accuracy": 0.2142861306667328, "num_tokens": 90525260.0, "step": 52190 }, { "entropy": 5.872311687469482, "epoch": 4.0609219996109704, "grad_norm": 1.5078125, "learning_rate": 0.0003435475390427178, "loss": 4.965, "mean_token_accuracy": 0.22295551598072053, "num_tokens": 90534468.0, "step": 52195 }, { "entropy": 5.801918840408325, "epoch": 4.061311028982688, "grad_norm": 1.4375, "learning_rate": 0.00034352114046378655, "loss": 4.8618, "mean_token_accuracy": 0.22209228873252868, "num_tokens": 90543559.0, "step": 52200 }, { "entropy": 5.911927890777588, "epoch": 4.061700058354406, "grad_norm": 1.40625, "learning_rate": 0.00034349474084515607, "loss": 5.0209, "mean_token_accuracy": 0.2069212630391121, "num_tokens": 90552161.0, "step": 52205 }, { "entropy": 5.869879674911499, "epoch": 4.0620890877261235, "grad_norm": 1.453125, "learning_rate": 0.00034346834018722706, "loss": 4.972, "mean_token_accuracy": 0.20930591076612473, "num_tokens": 90560175.0, "step": 52210 }, { "entropy": 5.844588136672973, "epoch": 4.062478117097841, "grad_norm": 1.328125, "learning_rate": 0.00034344193849039997, "loss": 4.9381, "mean_token_accuracy": 0.21019415259361268, "num_tokens": 90569791.0, "step": 52215 }, { "entropy": 5.8131959438323975, "epoch": 4.062867146469558, "grad_norm": 1.3984375, "learning_rate": 0.0003434155357550753, "loss": 4.8911, "mean_token_accuracy": 0.21822884678840637, "num_tokens": 90578407.0, "step": 52220 }, { "entropy": 5.833792638778687, "epoch": 4.063256175841276, "grad_norm": 1.328125, "learning_rate": 0.00034338913198165373, "loss": 4.9123, "mean_token_accuracy": 0.21374789476394654, "num_tokens": 90586705.0, "step": 52225 }, { "entropy": 5.8449780464172365, "epoch": 4.063645205212993, "grad_norm": 1.328125, "learning_rate": 0.000343362727170536, "loss": 4.8998, "mean_token_accuracy": 0.2107926443219185, "num_tokens": 90595766.0, "step": 52230 }, { "entropy": 5.876784181594848, "epoch": 4.064034234584711, "grad_norm": 1.40625, "learning_rate": 0.0003433363213221227, "loss": 4.9524, "mean_token_accuracy": 0.21414394676685333, "num_tokens": 90604550.0, "step": 52235 }, { "entropy": 5.924585294723511, "epoch": 4.064423263956429, "grad_norm": 1.4140625, "learning_rate": 0.00034330991443681444, "loss": 5.0266, "mean_token_accuracy": 0.20682194083929062, "num_tokens": 90613070.0, "step": 52240 }, { "entropy": 5.894184112548828, "epoch": 4.0648122933281465, "grad_norm": 1.34375, "learning_rate": 0.000343283506515012, "loss": 4.9701, "mean_token_accuracy": 0.21024854630231857, "num_tokens": 90623073.0, "step": 52245 }, { "entropy": 5.863582181930542, "epoch": 4.065201322699864, "grad_norm": 1.3671875, "learning_rate": 0.00034325709755711606, "loss": 4.954, "mean_token_accuracy": 0.20817249715328218, "num_tokens": 90631944.0, "step": 52250 }, { "entropy": 5.767777061462402, "epoch": 4.065590352071581, "grad_norm": 1.2578125, "learning_rate": 0.00034323068756352725, "loss": 4.8203, "mean_token_accuracy": 0.22122708708047867, "num_tokens": 90641007.0, "step": 52255 }, { "entropy": 5.856745338439941, "epoch": 4.065979381443299, "grad_norm": 1.3046875, "learning_rate": 0.0003432042765346464, "loss": 5.0379, "mean_token_accuracy": 0.19881364852190017, "num_tokens": 90649628.0, "step": 52260 }, { "entropy": 5.835829734802246, "epoch": 4.066368410815016, "grad_norm": 1.46875, "learning_rate": 0.0003431778644708742, "loss": 4.9191, "mean_token_accuracy": 0.2136614978313446, "num_tokens": 90658301.0, "step": 52265 }, { "entropy": 5.827006483078003, "epoch": 4.066757440186734, "grad_norm": 1.3671875, "learning_rate": 0.0003431514513726114, "loss": 4.9274, "mean_token_accuracy": 0.21502908766269685, "num_tokens": 90667080.0, "step": 52270 }, { "entropy": 5.818724536895752, "epoch": 4.067146469558452, "grad_norm": 1.421875, "learning_rate": 0.0003431250372402588, "loss": 4.9452, "mean_token_accuracy": 0.21803885251283645, "num_tokens": 90675658.0, "step": 52275 }, { "entropy": 5.769232368469238, "epoch": 4.0675354989301695, "grad_norm": 1.34375, "learning_rate": 0.00034309862207421724, "loss": 4.8789, "mean_token_accuracy": 0.22234613001346587, "num_tokens": 90684345.0, "step": 52280 }, { "entropy": 5.830105400085449, "epoch": 4.067924528301887, "grad_norm": 1.5703125, "learning_rate": 0.00034307220587488743, "loss": 4.9258, "mean_token_accuracy": 0.21428630352020264, "num_tokens": 90693342.0, "step": 52285 }, { "entropy": 5.868681573867798, "epoch": 4.068313557673604, "grad_norm": 1.375, "learning_rate": 0.00034304578864267026, "loss": 4.8492, "mean_token_accuracy": 0.21751593351364135, "num_tokens": 90701948.0, "step": 52290 }, { "entropy": 5.85706934928894, "epoch": 4.068702587045322, "grad_norm": 1.4765625, "learning_rate": 0.00034301937037796654, "loss": 4.8825, "mean_token_accuracy": 0.22207211405038835, "num_tokens": 90710273.0, "step": 52295 }, { "entropy": 5.772548627853394, "epoch": 4.069091616417039, "grad_norm": 1.328125, "learning_rate": 0.00034299295108117716, "loss": 4.8918, "mean_token_accuracy": 0.21499619036912918, "num_tokens": 90718993.0, "step": 52300 }, { "entropy": 5.86618127822876, "epoch": 4.069480645788757, "grad_norm": 1.46875, "learning_rate": 0.00034296653075270296, "loss": 4.9269, "mean_token_accuracy": 0.21169252395629884, "num_tokens": 90727655.0, "step": 52305 }, { "entropy": 5.829366683959961, "epoch": 4.069869675160475, "grad_norm": 1.4296875, "learning_rate": 0.00034294010939294486, "loss": 4.9064, "mean_token_accuracy": 0.21823523044586182, "num_tokens": 90735512.0, "step": 52310 }, { "entropy": 5.779846668243408, "epoch": 4.0702587045321925, "grad_norm": 1.46875, "learning_rate": 0.00034291368700230376, "loss": 4.8617, "mean_token_accuracy": 0.22050042003393172, "num_tokens": 90743858.0, "step": 52315 }, { "entropy": 5.896734428405762, "epoch": 4.070647733903909, "grad_norm": 1.4453125, "learning_rate": 0.0003428872635811804, "loss": 4.9903, "mean_token_accuracy": 0.20875463187694548, "num_tokens": 90752194.0, "step": 52320 }, { "entropy": 5.828960180282593, "epoch": 4.071036763275627, "grad_norm": 1.3671875, "learning_rate": 0.000342860839129976, "loss": 4.9457, "mean_token_accuracy": 0.2087746948003769, "num_tokens": 90761213.0, "step": 52325 }, { "entropy": 5.805143547058106, "epoch": 4.071425792647345, "grad_norm": 1.4609375, "learning_rate": 0.0003428344136490914, "loss": 4.885, "mean_token_accuracy": 0.21960264593362808, "num_tokens": 90770634.0, "step": 52330 }, { "entropy": 5.824162244796753, "epoch": 4.071814822019062, "grad_norm": 1.3515625, "learning_rate": 0.00034280798713892744, "loss": 4.9234, "mean_token_accuracy": 0.2132073611021042, "num_tokens": 90779861.0, "step": 52335 }, { "entropy": 5.782905721664429, "epoch": 4.07220385139078, "grad_norm": 1.421875, "learning_rate": 0.0003427815595998853, "loss": 4.8351, "mean_token_accuracy": 0.22049396634101867, "num_tokens": 90788773.0, "step": 52340 }, { "entropy": 5.8967540740966795, "epoch": 4.072592880762498, "grad_norm": 1.3203125, "learning_rate": 0.0003427551310323658, "loss": 5.001, "mean_token_accuracy": 0.21088361442089082, "num_tokens": 90797372.0, "step": 52345 }, { "entropy": 5.882810306549072, "epoch": 4.0729819101342155, "grad_norm": 1.421875, "learning_rate": 0.00034272870143677015, "loss": 4.9447, "mean_token_accuracy": 0.2110857680439949, "num_tokens": 90806065.0, "step": 52350 }, { "entropy": 5.884455299377441, "epoch": 4.073370939505932, "grad_norm": 1.3828125, "learning_rate": 0.00034270227081349913, "loss": 4.9714, "mean_token_accuracy": 0.22162407785654067, "num_tokens": 90815531.0, "step": 52355 }, { "entropy": 5.932768106460571, "epoch": 4.07375996887765, "grad_norm": 1.3828125, "learning_rate": 0.000342675839162954, "loss": 5.1083, "mean_token_accuracy": 0.2044634371995926, "num_tokens": 90823416.0, "step": 52360 }, { "entropy": 5.891361474990845, "epoch": 4.074148998249368, "grad_norm": 1.28125, "learning_rate": 0.00034264940648553565, "loss": 4.9785, "mean_token_accuracy": 0.21013073772192, "num_tokens": 90832441.0, "step": 52365 }, { "entropy": 5.765255928039551, "epoch": 4.074538027621085, "grad_norm": 1.359375, "learning_rate": 0.0003426229727816453, "loss": 4.8005, "mean_token_accuracy": 0.22277094721794127, "num_tokens": 90840453.0, "step": 52370 }, { "entropy": 5.894511604309082, "epoch": 4.074927056992803, "grad_norm": 1.375, "learning_rate": 0.0003425965380516839, "loss": 4.9515, "mean_token_accuracy": 0.21615902334451675, "num_tokens": 90848802.0, "step": 52375 }, { "entropy": 5.82495493888855, "epoch": 4.075316086364521, "grad_norm": 1.3125, "learning_rate": 0.0003425701022960527, "loss": 5.064, "mean_token_accuracy": 0.20363830775022507, "num_tokens": 90856950.0, "step": 52380 }, { "entropy": 5.8563202857971195, "epoch": 4.0757051157362385, "grad_norm": 1.3828125, "learning_rate": 0.00034254366551515276, "loss": 4.9475, "mean_token_accuracy": 0.21141229718923568, "num_tokens": 90866100.0, "step": 52385 }, { "entropy": 5.895182132720947, "epoch": 4.076094145107955, "grad_norm": 1.3515625, "learning_rate": 0.0003425172277093852, "loss": 4.9856, "mean_token_accuracy": 0.20651899576187133, "num_tokens": 90875323.0, "step": 52390 }, { "entropy": 5.86093955039978, "epoch": 4.076483174479673, "grad_norm": 1.2109375, "learning_rate": 0.000342490788879151, "loss": 4.9354, "mean_token_accuracy": 0.21676058322191238, "num_tokens": 90884287.0, "step": 52395 }, { "entropy": 5.871138334274292, "epoch": 4.076872203851391, "grad_norm": 1.328125, "learning_rate": 0.00034246434902485156, "loss": 4.946, "mean_token_accuracy": 0.214415742456913, "num_tokens": 90893311.0, "step": 52400 }, { "entropy": 5.846327543258667, "epoch": 4.077261233223108, "grad_norm": 1.375, "learning_rate": 0.00034243790814688816, "loss": 4.9202, "mean_token_accuracy": 0.21802729815244676, "num_tokens": 90901977.0, "step": 52405 }, { "entropy": 5.777938556671143, "epoch": 4.077650262594826, "grad_norm": 1.3203125, "learning_rate": 0.00034241146624566175, "loss": 4.9193, "mean_token_accuracy": 0.21226158738136292, "num_tokens": 90910739.0, "step": 52410 }, { "entropy": 5.916143894195557, "epoch": 4.078039291966544, "grad_norm": 1.328125, "learning_rate": 0.0003423850233215737, "loss": 5.0702, "mean_token_accuracy": 0.2045850709080696, "num_tokens": 90920329.0, "step": 52415 }, { "entropy": 5.76606068611145, "epoch": 4.078428321338261, "grad_norm": 1.359375, "learning_rate": 0.0003423585793750251, "loss": 4.834, "mean_token_accuracy": 0.21839949041604995, "num_tokens": 90928697.0, "step": 52420 }, { "entropy": 5.912839126586914, "epoch": 4.078817350709978, "grad_norm": 1.4140625, "learning_rate": 0.00034233213440641724, "loss": 4.9767, "mean_token_accuracy": 0.21406540125608445, "num_tokens": 90937483.0, "step": 52425 }, { "entropy": 5.82939043045044, "epoch": 4.079206380081696, "grad_norm": 1.3984375, "learning_rate": 0.00034230568841615145, "loss": 4.987, "mean_token_accuracy": 0.21033277809619905, "num_tokens": 90946467.0, "step": 52430 }, { "entropy": 5.856981897354126, "epoch": 4.079595409453414, "grad_norm": 1.4375, "learning_rate": 0.000342279241404629, "loss": 4.9241, "mean_token_accuracy": 0.21807148009538652, "num_tokens": 90954498.0, "step": 52435 }, { "entropy": 5.920662498474121, "epoch": 4.079984438825131, "grad_norm": 1.4765625, "learning_rate": 0.00034225279337225106, "loss": 5.033, "mean_token_accuracy": 0.20051831901073455, "num_tokens": 90962683.0, "step": 52440 }, { "entropy": 5.793571901321411, "epoch": 4.080373468196849, "grad_norm": 1.4609375, "learning_rate": 0.0003422263443194191, "loss": 4.8403, "mean_token_accuracy": 0.2267541155219078, "num_tokens": 90971083.0, "step": 52445 }, { "entropy": 5.767280530929566, "epoch": 4.080762497568567, "grad_norm": 1.3671875, "learning_rate": 0.0003421998942465344, "loss": 4.958, "mean_token_accuracy": 0.21750257313251495, "num_tokens": 90980369.0, "step": 52450 }, { "entropy": 5.717054128646851, "epoch": 4.081151526940284, "grad_norm": 1.453125, "learning_rate": 0.00034217344315399823, "loss": 4.8588, "mean_token_accuracy": 0.2229512095451355, "num_tokens": 90988833.0, "step": 52455 }, { "entropy": 5.880059289932251, "epoch": 4.081540556312001, "grad_norm": 1.4140625, "learning_rate": 0.000342146991042212, "loss": 5.0017, "mean_token_accuracy": 0.21066730767488479, "num_tokens": 90997281.0, "step": 52460 }, { "entropy": 5.920555496215821, "epoch": 4.081929585683719, "grad_norm": 1.328125, "learning_rate": 0.00034212053791157695, "loss": 5.0384, "mean_token_accuracy": 0.21125265657901765, "num_tokens": 91006471.0, "step": 52465 }, { "entropy": 5.929049873352051, "epoch": 4.082318615055437, "grad_norm": 1.40625, "learning_rate": 0.00034209408376249464, "loss": 4.9421, "mean_token_accuracy": 0.21584263443946838, "num_tokens": 91016090.0, "step": 52470 }, { "entropy": 5.7869236946105955, "epoch": 4.082707644427154, "grad_norm": 1.28125, "learning_rate": 0.0003420676285953664, "loss": 4.8664, "mean_token_accuracy": 0.21722640842199326, "num_tokens": 91025778.0, "step": 52475 }, { "entropy": 5.861277723312378, "epoch": 4.083096673798872, "grad_norm": 1.40625, "learning_rate": 0.0003420411724105937, "loss": 4.9803, "mean_token_accuracy": 0.20966071635484695, "num_tokens": 91033401.0, "step": 52480 }, { "entropy": 5.779371118545532, "epoch": 4.08348570317059, "grad_norm": 1.375, "learning_rate": 0.00034201471520857793, "loss": 4.8778, "mean_token_accuracy": 0.22433358132839204, "num_tokens": 91042792.0, "step": 52485 }, { "entropy": 5.924641084671021, "epoch": 4.083874732542307, "grad_norm": 1.453125, "learning_rate": 0.0003419882569897204, "loss": 5.0173, "mean_token_accuracy": 0.20789125114679335, "num_tokens": 91052060.0, "step": 52490 }, { "entropy": 5.831123161315918, "epoch": 4.084263761914024, "grad_norm": 1.4140625, "learning_rate": 0.00034196179775442274, "loss": 4.9222, "mean_token_accuracy": 0.21725019365549086, "num_tokens": 91060676.0, "step": 52495 }, { "entropy": 5.857064962387085, "epoch": 4.084652791285742, "grad_norm": 1.375, "learning_rate": 0.0003419353375030864, "loss": 4.9545, "mean_token_accuracy": 0.20735692083835602, "num_tokens": 91068986.0, "step": 52500 }, { "entropy": 5.868146228790283, "epoch": 4.08504182065746, "grad_norm": 1.4375, "learning_rate": 0.0003419088762361128, "loss": 4.9231, "mean_token_accuracy": 0.2125728040933609, "num_tokens": 91077045.0, "step": 52505 }, { "entropy": 5.824806594848633, "epoch": 4.085430850029177, "grad_norm": 1.3828125, "learning_rate": 0.0003418824139539035, "loss": 4.9942, "mean_token_accuracy": 0.20770253539085387, "num_tokens": 91085352.0, "step": 52510 }, { "entropy": 5.827580451965332, "epoch": 4.085819879400895, "grad_norm": 1.3671875, "learning_rate": 0.0003418559506568601, "loss": 4.9313, "mean_token_accuracy": 0.20833448320627213, "num_tokens": 91094369.0, "step": 52515 }, { "entropy": 5.897342681884766, "epoch": 4.086208908772612, "grad_norm": 1.5, "learning_rate": 0.00034182948634538403, "loss": 4.9636, "mean_token_accuracy": 0.21680909842252732, "num_tokens": 91102452.0, "step": 52520 }, { "entropy": 5.917086887359619, "epoch": 4.08659793814433, "grad_norm": 1.3125, "learning_rate": 0.0003418030210198769, "loss": 5.0036, "mean_token_accuracy": 0.21453001946210862, "num_tokens": 91111202.0, "step": 52525 }, { "entropy": 5.878217935562134, "epoch": 4.086986967516047, "grad_norm": 1.40625, "learning_rate": 0.00034177655468074027, "loss": 4.9642, "mean_token_accuracy": 0.22155923992395402, "num_tokens": 91119245.0, "step": 52530 }, { "entropy": 5.851306962966919, "epoch": 4.087375996887765, "grad_norm": 1.390625, "learning_rate": 0.0003417500873283756, "loss": 4.9828, "mean_token_accuracy": 0.20846396833658218, "num_tokens": 91128504.0, "step": 52535 }, { "entropy": 5.829020071029663, "epoch": 4.087765026259483, "grad_norm": 1.34375, "learning_rate": 0.0003417236189631846, "loss": 4.9304, "mean_token_accuracy": 0.22114059031009675, "num_tokens": 91137484.0, "step": 52540 }, { "entropy": 5.8912434577941895, "epoch": 4.0881540556312, "grad_norm": 1.3671875, "learning_rate": 0.000341697149585569, "loss": 4.9429, "mean_token_accuracy": 0.2111577421426773, "num_tokens": 91146318.0, "step": 52545 }, { "entropy": 5.905329895019531, "epoch": 4.088543085002918, "grad_norm": 1.3671875, "learning_rate": 0.0003416706791959302, "loss": 5.0124, "mean_token_accuracy": 0.20629059970378877, "num_tokens": 91153813.0, "step": 52550 }, { "entropy": 5.847673988342285, "epoch": 4.088932114374635, "grad_norm": 1.4765625, "learning_rate": 0.00034164420779467003, "loss": 4.9607, "mean_token_accuracy": 0.21402584463357927, "num_tokens": 91162975.0, "step": 52555 }, { "entropy": 5.75583930015564, "epoch": 4.089321143746353, "grad_norm": 1.3828125, "learning_rate": 0.0003416177353821901, "loss": 4.7861, "mean_token_accuracy": 0.22659515142440795, "num_tokens": 91171489.0, "step": 52560 }, { "entropy": 5.760290050506592, "epoch": 4.08971017311807, "grad_norm": 1.4296875, "learning_rate": 0.000341591261958892, "loss": 4.9116, "mean_token_accuracy": 0.2143949180841446, "num_tokens": 91180199.0, "step": 52565 }, { "entropy": 5.9369720935821535, "epoch": 4.090099202489788, "grad_norm": 1.390625, "learning_rate": 0.00034156478752517754, "loss": 5.0202, "mean_token_accuracy": 0.20173140615224838, "num_tokens": 91189525.0, "step": 52570 }, { "entropy": 5.9339934349060055, "epoch": 4.090488231861506, "grad_norm": 1.359375, "learning_rate": 0.00034153831208144837, "loss": 5.0324, "mean_token_accuracy": 0.20847492069005966, "num_tokens": 91198324.0, "step": 52575 }, { "entropy": 5.841619634628296, "epoch": 4.090877261233223, "grad_norm": 1.375, "learning_rate": 0.0003415118356281062, "loss": 4.8469, "mean_token_accuracy": 0.22267810851335526, "num_tokens": 91206988.0, "step": 52580 }, { "entropy": 5.7907661437988285, "epoch": 4.091266290604941, "grad_norm": 1.3125, "learning_rate": 0.0003414853581655528, "loss": 4.9063, "mean_token_accuracy": 0.22394948303699494, "num_tokens": 91215646.0, "step": 52585 }, { "entropy": 5.874812269210816, "epoch": 4.091655319976658, "grad_norm": 1.3046875, "learning_rate": 0.00034145887969419, "loss": 5.0404, "mean_token_accuracy": 0.20914815217256547, "num_tokens": 91224816.0, "step": 52590 }, { "entropy": 5.930892896652222, "epoch": 4.092044349348376, "grad_norm": 1.375, "learning_rate": 0.00034143240021441935, "loss": 5.0062, "mean_token_accuracy": 0.21181035935878753, "num_tokens": 91232962.0, "step": 52595 }, { "entropy": 5.913395357131958, "epoch": 4.092433378720093, "grad_norm": 1.3125, "learning_rate": 0.0003414059197266428, "loss": 4.9092, "mean_token_accuracy": 0.2155891627073288, "num_tokens": 91242508.0, "step": 52600 }, { "entropy": 5.873959589004516, "epoch": 4.092822408091811, "grad_norm": 1.3515625, "learning_rate": 0.00034137943823126215, "loss": 4.9298, "mean_token_accuracy": 0.20887825936079024, "num_tokens": 91250632.0, "step": 52605 }, { "entropy": 5.8338555812835695, "epoch": 4.093211437463529, "grad_norm": 1.5703125, "learning_rate": 0.0003413529557286792, "loss": 4.9671, "mean_token_accuracy": 0.21004934459924698, "num_tokens": 91259835.0, "step": 52610 }, { "entropy": 5.855559492111206, "epoch": 4.093600466835246, "grad_norm": 1.4296875, "learning_rate": 0.0003413264722192957, "loss": 4.8675, "mean_token_accuracy": 0.21733371317386627, "num_tokens": 91267999.0, "step": 52615 }, { "entropy": 5.863331747055054, "epoch": 4.093989496206964, "grad_norm": 1.359375, "learning_rate": 0.0003412999877035136, "loss": 4.8975, "mean_token_accuracy": 0.21641184538602828, "num_tokens": 91276695.0, "step": 52620 }, { "entropy": 5.809433174133301, "epoch": 4.094378525578681, "grad_norm": 1.359375, "learning_rate": 0.00034127350218173463, "loss": 4.9231, "mean_token_accuracy": 0.2079949140548706, "num_tokens": 91285474.0, "step": 52625 }, { "entropy": 5.854436206817627, "epoch": 4.094767554950399, "grad_norm": 1.4140625, "learning_rate": 0.00034124701565436076, "loss": 4.9789, "mean_token_accuracy": 0.2139347091317177, "num_tokens": 91293333.0, "step": 52630 }, { "entropy": 5.867753219604492, "epoch": 4.095156584322116, "grad_norm": 1.359375, "learning_rate": 0.000341220528121794, "loss": 4.9646, "mean_token_accuracy": 0.2152941808104515, "num_tokens": 91301881.0, "step": 52635 }, { "entropy": 5.819398403167725, "epoch": 4.095545613693834, "grad_norm": 1.4296875, "learning_rate": 0.000341194039584436, "loss": 4.9017, "mean_token_accuracy": 0.2213946059346199, "num_tokens": 91309922.0, "step": 52640 }, { "entropy": 5.838505458831787, "epoch": 4.095934643065552, "grad_norm": 1.46875, "learning_rate": 0.0003411675500426888, "loss": 4.9736, "mean_token_accuracy": 0.20896702855825425, "num_tokens": 91317844.0, "step": 52645 }, { "entropy": 5.90140061378479, "epoch": 4.096323672437269, "grad_norm": 1.2421875, "learning_rate": 0.00034114105949695445, "loss": 5.0283, "mean_token_accuracy": 0.21057997792959213, "num_tokens": 91326754.0, "step": 52650 }, { "entropy": 5.910677528381347, "epoch": 4.096712701808986, "grad_norm": 1.390625, "learning_rate": 0.0003411145679476347, "loss": 5.0087, "mean_token_accuracy": 0.21865397244691848, "num_tokens": 91335885.0, "step": 52655 }, { "entropy": 5.857691812515259, "epoch": 4.097101731180704, "grad_norm": 1.3828125, "learning_rate": 0.0003410880753951317, "loss": 4.9573, "mean_token_accuracy": 0.20829005986452104, "num_tokens": 91345120.0, "step": 52660 }, { "entropy": 5.873570728302002, "epoch": 4.097490760552422, "grad_norm": 1.359375, "learning_rate": 0.0003410615818398473, "loss": 4.9718, "mean_token_accuracy": 0.2103298783302307, "num_tokens": 91353854.0, "step": 52665 }, { "entropy": 5.8338079929351805, "epoch": 4.097879789924139, "grad_norm": 1.28125, "learning_rate": 0.0003410350872821835, "loss": 4.9124, "mean_token_accuracy": 0.2144770622253418, "num_tokens": 91362787.0, "step": 52670 }, { "entropy": 5.814592266082764, "epoch": 4.098268819295857, "grad_norm": 1.296875, "learning_rate": 0.00034100859172254245, "loss": 4.9022, "mean_token_accuracy": 0.22521244287490844, "num_tokens": 91372332.0, "step": 52675 }, { "entropy": 5.836311149597168, "epoch": 4.098657848667575, "grad_norm": 1.3203125, "learning_rate": 0.00034098209516132607, "loss": 4.8415, "mean_token_accuracy": 0.2176863968372345, "num_tokens": 91380760.0, "step": 52680 }, { "entropy": 5.917812728881836, "epoch": 4.099046878039292, "grad_norm": 1.4140625, "learning_rate": 0.0003409555975989363, "loss": 5.0503, "mean_token_accuracy": 0.20411122292280198, "num_tokens": 91390139.0, "step": 52685 }, { "entropy": 5.82920651435852, "epoch": 4.099435907411009, "grad_norm": 1.3671875, "learning_rate": 0.00034092909903577547, "loss": 4.9514, "mean_token_accuracy": 0.2102859288454056, "num_tokens": 91398460.0, "step": 52690 }, { "entropy": 5.909773492813111, "epoch": 4.099824936782727, "grad_norm": 1.34375, "learning_rate": 0.0003409025994722454, "loss": 4.991, "mean_token_accuracy": 0.21644651591777803, "num_tokens": 91407689.0, "step": 52695 }, { "entropy": 5.918085670471191, "epoch": 4.100213966154445, "grad_norm": 1.3984375, "learning_rate": 0.0003408760989087482, "loss": 5.0066, "mean_token_accuracy": 0.21419980376958847, "num_tokens": 91416559.0, "step": 52700 }, { "entropy": 5.826399517059326, "epoch": 4.100602995526162, "grad_norm": 1.25, "learning_rate": 0.00034084959734568616, "loss": 4.8574, "mean_token_accuracy": 0.21817767173051833, "num_tokens": 91425785.0, "step": 52705 }, { "entropy": 5.906371355056763, "epoch": 4.10099202489788, "grad_norm": 1.3125, "learning_rate": 0.00034082309478346127, "loss": 4.9659, "mean_token_accuracy": 0.2124147966504097, "num_tokens": 91433710.0, "step": 52710 }, { "entropy": 5.796204853057861, "epoch": 4.101381054269598, "grad_norm": 1.375, "learning_rate": 0.00034079659122247574, "loss": 4.8902, "mean_token_accuracy": 0.22575807571411133, "num_tokens": 91441943.0, "step": 52715 }, { "entropy": 5.904202222824097, "epoch": 4.101770083641315, "grad_norm": 1.328125, "learning_rate": 0.0003407700866631317, "loss": 4.993, "mean_token_accuracy": 0.21409016251564025, "num_tokens": 91450928.0, "step": 52720 }, { "entropy": 5.846932125091553, "epoch": 4.102159113013032, "grad_norm": 1.390625, "learning_rate": 0.0003407435811058312, "loss": 4.952, "mean_token_accuracy": 0.2134036213159561, "num_tokens": 91458893.0, "step": 52725 }, { "entropy": 5.880188465118408, "epoch": 4.10254814238475, "grad_norm": 1.46875, "learning_rate": 0.0003407170745509764, "loss": 4.9911, "mean_token_accuracy": 0.21699097901582717, "num_tokens": 91467545.0, "step": 52730 }, { "entropy": 5.946050500869751, "epoch": 4.1029371717564675, "grad_norm": 1.3984375, "learning_rate": 0.00034069056699896974, "loss": 5.0502, "mean_token_accuracy": 0.19980774223804473, "num_tokens": 91476288.0, "step": 52735 }, { "entropy": 5.928786277770996, "epoch": 4.103326201128185, "grad_norm": 1.3046875, "learning_rate": 0.0003406640584502132, "loss": 4.9943, "mean_token_accuracy": 0.20375832170248032, "num_tokens": 91484302.0, "step": 52740 }, { "entropy": 5.911462688446045, "epoch": 4.103715230499903, "grad_norm": 1.3515625, "learning_rate": 0.0003406375489051091, "loss": 4.9791, "mean_token_accuracy": 0.20640601813793183, "num_tokens": 91492084.0, "step": 52745 }, { "entropy": 5.793265390396118, "epoch": 4.104104259871621, "grad_norm": 1.4609375, "learning_rate": 0.0003406110383640597, "loss": 4.886, "mean_token_accuracy": 0.2159737005829811, "num_tokens": 91500512.0, "step": 52750 }, { "entropy": 5.772547054290771, "epoch": 4.1044932892433375, "grad_norm": 1.453125, "learning_rate": 0.00034058452682746734, "loss": 4.8507, "mean_token_accuracy": 0.22585063129663469, "num_tokens": 91508720.0, "step": 52755 }, { "entropy": 5.848243618011475, "epoch": 4.104882318615055, "grad_norm": 1.4375, "learning_rate": 0.000340558014295734, "loss": 4.9654, "mean_token_accuracy": 0.21314473152160646, "num_tokens": 91517372.0, "step": 52760 }, { "entropy": 5.787487316131592, "epoch": 4.105271347986773, "grad_norm": 1.5390625, "learning_rate": 0.00034053150076926214, "loss": 4.7995, "mean_token_accuracy": 0.22355881631374358, "num_tokens": 91525047.0, "step": 52765 }, { "entropy": 5.871389627456665, "epoch": 4.1056603773584905, "grad_norm": 1.34375, "learning_rate": 0.0003405049862484541, "loss": 4.962, "mean_token_accuracy": 0.20976555347442627, "num_tokens": 91533819.0, "step": 52770 }, { "entropy": 5.815493488311768, "epoch": 4.106049406730208, "grad_norm": 1.375, "learning_rate": 0.0003404784707337122, "loss": 5.0256, "mean_token_accuracy": 0.20959548354148866, "num_tokens": 91542846.0, "step": 52775 }, { "entropy": 5.899016237258911, "epoch": 4.106438436101926, "grad_norm": 1.4140625, "learning_rate": 0.00034045195422543865, "loss": 5.013, "mean_token_accuracy": 0.21236781775951385, "num_tokens": 91552402.0, "step": 52780 }, { "entropy": 5.826403856277466, "epoch": 4.106827465473644, "grad_norm": 1.5625, "learning_rate": 0.00034042543672403594, "loss": 4.9097, "mean_token_accuracy": 0.21818291544914245, "num_tokens": 91560490.0, "step": 52785 }, { "entropy": 5.876515579223633, "epoch": 4.10721649484536, "grad_norm": 1.2890625, "learning_rate": 0.00034039891822990634, "loss": 4.9124, "mean_token_accuracy": 0.2127267152070999, "num_tokens": 91569221.0, "step": 52790 }, { "entropy": 5.781956577301026, "epoch": 4.107605524217078, "grad_norm": 1.3359375, "learning_rate": 0.0003403723987434523, "loss": 4.8558, "mean_token_accuracy": 0.2170153796672821, "num_tokens": 91577546.0, "step": 52795 }, { "entropy": 5.8799309730529785, "epoch": 4.107994553588796, "grad_norm": 1.3515625, "learning_rate": 0.00034034587826507604, "loss": 4.957, "mean_token_accuracy": 0.21345576643943787, "num_tokens": 91586273.0, "step": 52800 }, { "entropy": 5.934528732299805, "epoch": 4.1083835829605135, "grad_norm": 1.34375, "learning_rate": 0.00034031935679518016, "loss": 5.0102, "mean_token_accuracy": 0.20462725311517715, "num_tokens": 91595478.0, "step": 52805 }, { "entropy": 5.882138919830322, "epoch": 4.108772612332231, "grad_norm": 1.3984375, "learning_rate": 0.000340292834334167, "loss": 5.0017, "mean_token_accuracy": 0.20269837826490403, "num_tokens": 91604983.0, "step": 52810 }, { "entropy": 5.866387844085693, "epoch": 4.109161641703949, "grad_norm": 1.3515625, "learning_rate": 0.000340266310882439, "loss": 4.9252, "mean_token_accuracy": 0.21797225922346114, "num_tokens": 91613404.0, "step": 52815 }, { "entropy": 5.875041437149048, "epoch": 4.109550671075667, "grad_norm": 1.40625, "learning_rate": 0.00034023978644039864, "loss": 5.0108, "mean_token_accuracy": 0.2089337006211281, "num_tokens": 91622511.0, "step": 52820 }, { "entropy": 5.922738361358642, "epoch": 4.109939700447383, "grad_norm": 1.4765625, "learning_rate": 0.0003402132610084483, "loss": 4.9804, "mean_token_accuracy": 0.20600569248199463, "num_tokens": 91630722.0, "step": 52825 }, { "entropy": 5.901969861984253, "epoch": 4.110328729819101, "grad_norm": 1.5234375, "learning_rate": 0.00034018673458699055, "loss": 4.9762, "mean_token_accuracy": 0.20888508409261702, "num_tokens": 91638747.0, "step": 52830 }, { "entropy": 5.835864877700805, "epoch": 4.110717759190819, "grad_norm": 1.2109375, "learning_rate": 0.0003401602071764279, "loss": 4.9184, "mean_token_accuracy": 0.2137049749493599, "num_tokens": 91646990.0, "step": 52835 }, { "entropy": 5.8525396347045895, "epoch": 4.1111067885625365, "grad_norm": 1.3671875, "learning_rate": 0.00034013367877716284, "loss": 4.9665, "mean_token_accuracy": 0.2151567354798317, "num_tokens": 91655205.0, "step": 52840 }, { "entropy": 5.79149055480957, "epoch": 4.111495817934254, "grad_norm": 1.390625, "learning_rate": 0.0003401071493895977, "loss": 4.8276, "mean_token_accuracy": 0.21517889201641083, "num_tokens": 91663869.0, "step": 52845 }, { "entropy": 5.850012350082397, "epoch": 4.111884847305972, "grad_norm": 1.3828125, "learning_rate": 0.0003400806190141354, "loss": 4.9039, "mean_token_accuracy": 0.21828116476535797, "num_tokens": 91672048.0, "step": 52850 }, { "entropy": 5.8351476192474365, "epoch": 4.112273876677689, "grad_norm": 1.296875, "learning_rate": 0.00034005408765117815, "loss": 4.9369, "mean_token_accuracy": 0.2165334030985832, "num_tokens": 91680669.0, "step": 52855 }, { "entropy": 5.891557788848877, "epoch": 4.112662906049406, "grad_norm": 1.3359375, "learning_rate": 0.00034002755530112877, "loss": 4.946, "mean_token_accuracy": 0.2198157235980034, "num_tokens": 91690060.0, "step": 52860 }, { "entropy": 5.879323863983155, "epoch": 4.113051935421124, "grad_norm": 1.4296875, "learning_rate": 0.0003400010219643897, "loss": 4.8604, "mean_token_accuracy": 0.22972338199615477, "num_tokens": 91698108.0, "step": 52865 }, { "entropy": 5.865536069869995, "epoch": 4.113440964792842, "grad_norm": 1.4375, "learning_rate": 0.0003399744876413636, "loss": 4.9297, "mean_token_accuracy": 0.2121211752295494, "num_tokens": 91707003.0, "step": 52870 }, { "entropy": 5.844236660003662, "epoch": 4.1138299941645595, "grad_norm": 1.375, "learning_rate": 0.000339947952332453, "loss": 4.9391, "mean_token_accuracy": 0.20432619750499725, "num_tokens": 91715539.0, "step": 52875 }, { "entropy": 5.860155534744263, "epoch": 4.114219023536277, "grad_norm": 1.3359375, "learning_rate": 0.00033992141603806064, "loss": 4.9563, "mean_token_accuracy": 0.20549587458372115, "num_tokens": 91724410.0, "step": 52880 }, { "entropy": 5.881458044052124, "epoch": 4.114608052907995, "grad_norm": 1.40625, "learning_rate": 0.00033989487875858915, "loss": 4.9566, "mean_token_accuracy": 0.21639238595962523, "num_tokens": 91732744.0, "step": 52885 }, { "entropy": 5.84858717918396, "epoch": 4.114997082279712, "grad_norm": 1.328125, "learning_rate": 0.00033986834049444113, "loss": 4.8817, "mean_token_accuracy": 0.223141548037529, "num_tokens": 91741406.0, "step": 52890 }, { "entropy": 5.829653072357178, "epoch": 4.115386111651429, "grad_norm": 1.4453125, "learning_rate": 0.00033984180124601936, "loss": 4.9339, "mean_token_accuracy": 0.21424741744995118, "num_tokens": 91749998.0, "step": 52895 }, { "entropy": 5.842125129699707, "epoch": 4.115775141023147, "grad_norm": 1.40625, "learning_rate": 0.00033981526101372635, "loss": 4.9321, "mean_token_accuracy": 0.21268791258335112, "num_tokens": 91758175.0, "step": 52900 }, { "entropy": 5.807630300521851, "epoch": 4.116164170394865, "grad_norm": 1.328125, "learning_rate": 0.000339788719797965, "loss": 4.8682, "mean_token_accuracy": 0.21643185168504714, "num_tokens": 91766606.0, "step": 52905 }, { "entropy": 5.847779655456543, "epoch": 4.1165531997665825, "grad_norm": 1.4296875, "learning_rate": 0.0003397621775991379, "loss": 4.8644, "mean_token_accuracy": 0.22366725653409958, "num_tokens": 91775446.0, "step": 52910 }, { "entropy": 5.828525972366333, "epoch": 4.1169422291383, "grad_norm": 1.453125, "learning_rate": 0.0003397356344176479, "loss": 4.877, "mean_token_accuracy": 0.22211505621671676, "num_tokens": 91783954.0, "step": 52915 }, { "entropy": 5.746333169937134, "epoch": 4.117331258510018, "grad_norm": 1.3515625, "learning_rate": 0.0003397090902538976, "loss": 4.8428, "mean_token_accuracy": 0.22320794612169265, "num_tokens": 91793169.0, "step": 52920 }, { "entropy": 5.854411983489991, "epoch": 4.117720287881735, "grad_norm": 1.4453125, "learning_rate": 0.00033968254510828995, "loss": 5.0161, "mean_token_accuracy": 0.20559983551502228, "num_tokens": 91802011.0, "step": 52925 }, { "entropy": 5.833854675292969, "epoch": 4.118109317253452, "grad_norm": 1.359375, "learning_rate": 0.0003396559989812275, "loss": 4.9569, "mean_token_accuracy": 0.21528590321540833, "num_tokens": 91811120.0, "step": 52930 }, { "entropy": 5.9350114345550535, "epoch": 4.11849834662517, "grad_norm": 1.34375, "learning_rate": 0.0003396294518731133, "loss": 5.0393, "mean_token_accuracy": 0.20853887796401976, "num_tokens": 91819837.0, "step": 52935 }, { "entropy": 5.841325092315674, "epoch": 4.118887375996888, "grad_norm": 1.4375, "learning_rate": 0.00033960290378435, "loss": 4.8845, "mean_token_accuracy": 0.22018444836139678, "num_tokens": 91828955.0, "step": 52940 }, { "entropy": 5.766008758544922, "epoch": 4.1192764053686055, "grad_norm": 1.3203125, "learning_rate": 0.00033957635471534045, "loss": 4.8622, "mean_token_accuracy": 0.21532549560070038, "num_tokens": 91837508.0, "step": 52945 }, { "entropy": 5.788532304763794, "epoch": 4.119665434740323, "grad_norm": 1.3828125, "learning_rate": 0.0003395498046664875, "loss": 4.9127, "mean_token_accuracy": 0.21965364515781402, "num_tokens": 91847030.0, "step": 52950 }, { "entropy": 5.860955476760864, "epoch": 4.120054464112041, "grad_norm": 1.390625, "learning_rate": 0.000339523253638194, "loss": 4.8972, "mean_token_accuracy": 0.21377653181552886, "num_tokens": 91855823.0, "step": 52955 }, { "entropy": 5.904580116271973, "epoch": 4.120443493483758, "grad_norm": 1.5, "learning_rate": 0.0003394967016308629, "loss": 4.972, "mean_token_accuracy": 0.20904920846223832, "num_tokens": 91864741.0, "step": 52960 }, { "entropy": 5.844407176971435, "epoch": 4.120832522855475, "grad_norm": 1.296875, "learning_rate": 0.0003394701486448968, "loss": 4.9179, "mean_token_accuracy": 0.21471254527568817, "num_tokens": 91872780.0, "step": 52965 }, { "entropy": 5.876423263549805, "epoch": 4.121221552227193, "grad_norm": 1.421875, "learning_rate": 0.00033944359468069903, "loss": 4.9443, "mean_token_accuracy": 0.2167111650109291, "num_tokens": 91881394.0, "step": 52970 }, { "entropy": 5.790338087081909, "epoch": 4.121610581598911, "grad_norm": 1.4765625, "learning_rate": 0.00033941703973867216, "loss": 4.9199, "mean_token_accuracy": 0.21331800222396852, "num_tokens": 91889758.0, "step": 52975 }, { "entropy": 5.839564943313599, "epoch": 4.1219996109706285, "grad_norm": 1.3984375, "learning_rate": 0.00033939048381921935, "loss": 4.8733, "mean_token_accuracy": 0.22047268748283386, "num_tokens": 91897799.0, "step": 52980 }, { "entropy": 5.884940433502197, "epoch": 4.122388640342346, "grad_norm": 1.4453125, "learning_rate": 0.0003393639269227434, "loss": 4.9235, "mean_token_accuracy": 0.21794833540916442, "num_tokens": 91907016.0, "step": 52985 }, { "entropy": 5.746425676345825, "epoch": 4.122777669714063, "grad_norm": 1.3125, "learning_rate": 0.0003393373690496473, "loss": 4.8233, "mean_token_accuracy": 0.22085193693637847, "num_tokens": 91914934.0, "step": 52990 }, { "entropy": 5.854532718658447, "epoch": 4.123166699085781, "grad_norm": 1.390625, "learning_rate": 0.000339310810200334, "loss": 4.9909, "mean_token_accuracy": 0.21250202059745787, "num_tokens": 91923640.0, "step": 52995 }, { "entropy": 5.897401952743531, "epoch": 4.123555728457498, "grad_norm": 1.4609375, "learning_rate": 0.00033928425037520643, "loss": 4.9834, "mean_token_accuracy": 0.2100432813167572, "num_tokens": 91931768.0, "step": 53000 }, { "entropy": 5.900255823135376, "epoch": 4.123944757829216, "grad_norm": 1.3359375, "learning_rate": 0.0003392576895746678, "loss": 4.9531, "mean_token_accuracy": 0.20949549227952957, "num_tokens": 91940681.0, "step": 53005 }, { "entropy": 5.974673509597778, "epoch": 4.124333787200934, "grad_norm": 1.4375, "learning_rate": 0.0003392311277991209, "loss": 5.0719, "mean_token_accuracy": 0.20953430831432343, "num_tokens": 91948578.0, "step": 53010 }, { "entropy": 5.84502763748169, "epoch": 4.1247228165726515, "grad_norm": 1.53125, "learning_rate": 0.00033920456504896895, "loss": 4.8744, "mean_token_accuracy": 0.22200523614883422, "num_tokens": 91956706.0, "step": 53015 }, { "entropy": 5.8244775295257565, "epoch": 4.125111845944369, "grad_norm": 1.3125, "learning_rate": 0.00033917800132461493, "loss": 4.8705, "mean_token_accuracy": 0.21858885288238525, "num_tokens": 91966071.0, "step": 53020 }, { "entropy": 5.873194551467895, "epoch": 4.125500875316086, "grad_norm": 1.390625, "learning_rate": 0.0003391514366264619, "loss": 4.9349, "mean_token_accuracy": 0.21836080849170686, "num_tokens": 91973713.0, "step": 53025 }, { "entropy": 5.800859069824218, "epoch": 4.125889904687804, "grad_norm": 1.3984375, "learning_rate": 0.0003391248709549129, "loss": 4.9138, "mean_token_accuracy": 0.21103875041007997, "num_tokens": 91982945.0, "step": 53030 }, { "entropy": 5.887965679168701, "epoch": 4.126278934059521, "grad_norm": 1.3046875, "learning_rate": 0.0003390983043103711, "loss": 5.0309, "mean_token_accuracy": 0.21164130419492722, "num_tokens": 91991943.0, "step": 53035 }, { "entropy": 5.855825757980346, "epoch": 4.126667963431239, "grad_norm": 1.546875, "learning_rate": 0.0003390717366932395, "loss": 4.9806, "mean_token_accuracy": 0.2066645398736, "num_tokens": 92000480.0, "step": 53040 }, { "entropy": 5.8825630187988285, "epoch": 4.127056992802957, "grad_norm": 1.3046875, "learning_rate": 0.0003390451681039212, "loss": 5.0154, "mean_token_accuracy": 0.20639684200286865, "num_tokens": 92009922.0, "step": 53045 }, { "entropy": 5.867696237564087, "epoch": 4.1274460221746745, "grad_norm": 1.4375, "learning_rate": 0.00033901859854281954, "loss": 4.8464, "mean_token_accuracy": 0.22536449879407883, "num_tokens": 92017978.0, "step": 53050 }, { "entropy": 5.828244304656982, "epoch": 4.127835051546391, "grad_norm": 1.3828125, "learning_rate": 0.0003389920280103375, "loss": 4.9278, "mean_token_accuracy": 0.21634016633033754, "num_tokens": 92026649.0, "step": 53055 }, { "entropy": 5.767933988571167, "epoch": 4.128224080918109, "grad_norm": 1.2734375, "learning_rate": 0.00033896545650687824, "loss": 4.8877, "mean_token_accuracy": 0.22428463101387025, "num_tokens": 92035393.0, "step": 53060 }, { "entropy": 5.88194465637207, "epoch": 4.128613110289827, "grad_norm": 1.3984375, "learning_rate": 0.0003389388840328451, "loss": 4.9354, "mean_token_accuracy": 0.205056332051754, "num_tokens": 92043644.0, "step": 53065 }, { "entropy": 5.894940519332886, "epoch": 4.129002139661544, "grad_norm": 1.3984375, "learning_rate": 0.0003389123105886411, "loss": 4.9784, "mean_token_accuracy": 0.2123462975025177, "num_tokens": 92052469.0, "step": 53070 }, { "entropy": 5.833784198760986, "epoch": 4.129391169033262, "grad_norm": 1.359375, "learning_rate": 0.0003388857361746695, "loss": 4.8757, "mean_token_accuracy": 0.21777843981981276, "num_tokens": 92060887.0, "step": 53075 }, { "entropy": 5.80484676361084, "epoch": 4.12978019840498, "grad_norm": 1.375, "learning_rate": 0.00033885916079133354, "loss": 4.8736, "mean_token_accuracy": 0.22536709606647493, "num_tokens": 92069344.0, "step": 53080 }, { "entropy": 5.821788549423218, "epoch": 4.1301692277766975, "grad_norm": 1.4296875, "learning_rate": 0.00033883258443903646, "loss": 4.8584, "mean_token_accuracy": 0.2158849149942398, "num_tokens": 92078634.0, "step": 53085 }, { "entropy": 5.778023958206177, "epoch": 4.130558257148414, "grad_norm": 1.390625, "learning_rate": 0.00033880600711818157, "loss": 4.8035, "mean_token_accuracy": 0.2215561345219612, "num_tokens": 92086790.0, "step": 53090 }, { "entropy": 5.884761238098145, "epoch": 4.130947286520132, "grad_norm": 1.390625, "learning_rate": 0.00033877942882917203, "loss": 4.9451, "mean_token_accuracy": 0.2127469912171364, "num_tokens": 92094944.0, "step": 53095 }, { "entropy": 5.837387466430664, "epoch": 4.13133631589185, "grad_norm": 1.640625, "learning_rate": 0.00033875284957241117, "loss": 4.9585, "mean_token_accuracy": 0.2118021622300148, "num_tokens": 92102845.0, "step": 53100 }, { "entropy": 5.826216316223144, "epoch": 4.131725345263567, "grad_norm": 1.3671875, "learning_rate": 0.0003387262693483023, "loss": 4.9248, "mean_token_accuracy": 0.21900792568922042, "num_tokens": 92110895.0, "step": 53105 }, { "entropy": 5.811012887954712, "epoch": 4.132114374635285, "grad_norm": 1.4296875, "learning_rate": 0.00033869968815724866, "loss": 4.9318, "mean_token_accuracy": 0.21921093612909318, "num_tokens": 92119400.0, "step": 53110 }, { "entropy": 5.9278590202331545, "epoch": 4.132503404007003, "grad_norm": 1.28125, "learning_rate": 0.0003386731059996537, "loss": 5.0486, "mean_token_accuracy": 0.21171013712882997, "num_tokens": 92129014.0, "step": 53115 }, { "entropy": 5.9406050682067875, "epoch": 4.1328924333787205, "grad_norm": 1.46875, "learning_rate": 0.00033864652287592074, "loss": 5.0457, "mean_token_accuracy": 0.2095251649618149, "num_tokens": 92137659.0, "step": 53120 }, { "entropy": 5.8262111186981205, "epoch": 4.133281462750437, "grad_norm": 1.3828125, "learning_rate": 0.00033861993878645305, "loss": 4.9344, "mean_token_accuracy": 0.2172350823879242, "num_tokens": 92146467.0, "step": 53125 }, { "entropy": 5.913755178451538, "epoch": 4.133670492122155, "grad_norm": 1.4140625, "learning_rate": 0.000338593353731654, "loss": 4.9034, "mean_token_accuracy": 0.22177675515413284, "num_tokens": 92155180.0, "step": 53130 }, { "entropy": 5.866555404663086, "epoch": 4.134059521493873, "grad_norm": 1.484375, "learning_rate": 0.0003385667677119271, "loss": 4.9649, "mean_token_accuracy": 0.21789206713438034, "num_tokens": 92163531.0, "step": 53135 }, { "entropy": 5.8510137557983395, "epoch": 4.13444855086559, "grad_norm": 1.3984375, "learning_rate": 0.00033854018072767574, "loss": 4.9627, "mean_token_accuracy": 0.20930178016424178, "num_tokens": 92172148.0, "step": 53140 }, { "entropy": 5.8419300556182865, "epoch": 4.134837580237308, "grad_norm": 1.6015625, "learning_rate": 0.00033851359277930316, "loss": 4.8908, "mean_token_accuracy": 0.22010625898838043, "num_tokens": 92180666.0, "step": 53145 }, { "entropy": 5.790993976593017, "epoch": 4.135226609609026, "grad_norm": 1.359375, "learning_rate": 0.0003384870038672129, "loss": 4.8548, "mean_token_accuracy": 0.22050834447145462, "num_tokens": 92189894.0, "step": 53150 }, { "entropy": 5.895494604110718, "epoch": 4.1356156389807435, "grad_norm": 1.40625, "learning_rate": 0.0003384604139918085, "loss": 4.9409, "mean_token_accuracy": 0.21133417934179305, "num_tokens": 92199029.0, "step": 53155 }, { "entropy": 5.835072422027588, "epoch": 4.13600466835246, "grad_norm": 1.3359375, "learning_rate": 0.00033843382315349325, "loss": 4.8859, "mean_token_accuracy": 0.2167965888977051, "num_tokens": 92207388.0, "step": 53160 }, { "entropy": 5.839929103851318, "epoch": 4.136393697724178, "grad_norm": 1.390625, "learning_rate": 0.00033840723135267073, "loss": 4.9082, "mean_token_accuracy": 0.2179109573364258, "num_tokens": 92216194.0, "step": 53165 }, { "entropy": 5.859672117233276, "epoch": 4.136782727095896, "grad_norm": 1.3828125, "learning_rate": 0.00033838063858974434, "loss": 4.9105, "mean_token_accuracy": 0.21114156544208526, "num_tokens": 92224322.0, "step": 53170 }, { "entropy": 5.833002710342408, "epoch": 4.137171756467613, "grad_norm": 1.3203125, "learning_rate": 0.0003383540448651177, "loss": 4.8994, "mean_token_accuracy": 0.21879950016736985, "num_tokens": 92232635.0, "step": 53175 }, { "entropy": 5.826730823516845, "epoch": 4.137560785839331, "grad_norm": 1.46875, "learning_rate": 0.00033832745017919424, "loss": 4.9277, "mean_token_accuracy": 0.21817967742681504, "num_tokens": 92240609.0, "step": 53180 }, { "entropy": 5.804049873352051, "epoch": 4.137949815211049, "grad_norm": 1.34375, "learning_rate": 0.00033830085453237757, "loss": 4.8402, "mean_token_accuracy": 0.22203780561685563, "num_tokens": 92248699.0, "step": 53185 }, { "entropy": 5.891659593582153, "epoch": 4.138338844582766, "grad_norm": 1.3125, "learning_rate": 0.0003382742579250712, "loss": 4.9911, "mean_token_accuracy": 0.2098892256617546, "num_tokens": 92256882.0, "step": 53190 }, { "entropy": 5.786753702163696, "epoch": 4.138727873954483, "grad_norm": 1.40625, "learning_rate": 0.0003382476603576785, "loss": 4.87, "mean_token_accuracy": 0.2149938479065895, "num_tokens": 92264729.0, "step": 53195 }, { "entropy": 5.871018981933593, "epoch": 4.139116903326201, "grad_norm": 1.4921875, "learning_rate": 0.0003382210618306034, "loss": 5.0836, "mean_token_accuracy": 0.20276203453540803, "num_tokens": 92273924.0, "step": 53200 }, { "entropy": 5.86042160987854, "epoch": 4.139505932697919, "grad_norm": 1.4375, "learning_rate": 0.0003381944623442492, "loss": 4.8805, "mean_token_accuracy": 0.21828910261392592, "num_tokens": 92282116.0, "step": 53205 }, { "entropy": 5.853392601013184, "epoch": 4.139894962069636, "grad_norm": 1.421875, "learning_rate": 0.0003381678618990197, "loss": 4.875, "mean_token_accuracy": 0.22329535186290742, "num_tokens": 92290478.0, "step": 53210 }, { "entropy": 5.819847869873047, "epoch": 4.140283991441354, "grad_norm": 1.46875, "learning_rate": 0.0003381412604953185, "loss": 4.8936, "mean_token_accuracy": 0.21964560598134994, "num_tokens": 92298524.0, "step": 53215 }, { "entropy": 5.805432319641113, "epoch": 4.140673020813072, "grad_norm": 1.4375, "learning_rate": 0.0003381146581335491, "loss": 4.8651, "mean_token_accuracy": 0.2262190818786621, "num_tokens": 92306532.0, "step": 53220 }, { "entropy": 5.952477979660034, "epoch": 4.141062050184789, "grad_norm": 1.359375, "learning_rate": 0.0003380880548141152, "loss": 5.0752, "mean_token_accuracy": 0.19946933537721634, "num_tokens": 92316194.0, "step": 53225 }, { "entropy": 5.84053373336792, "epoch": 4.141451079556506, "grad_norm": 1.3828125, "learning_rate": 0.00033806145053742043, "loss": 4.867, "mean_token_accuracy": 0.21889895796775818, "num_tokens": 92324233.0, "step": 53230 }, { "entropy": 5.842712879180908, "epoch": 4.141840108928224, "grad_norm": 1.296875, "learning_rate": 0.0003380348453038686, "loss": 4.993, "mean_token_accuracy": 0.21180498898029326, "num_tokens": 92333823.0, "step": 53235 }, { "entropy": 5.9309494972229, "epoch": 4.142229138299942, "grad_norm": 1.34375, "learning_rate": 0.0003380082391138633, "loss": 4.9906, "mean_token_accuracy": 0.2149355798959732, "num_tokens": 92342584.0, "step": 53240 }, { "entropy": 5.85927677154541, "epoch": 4.142618167671659, "grad_norm": 1.5390625, "learning_rate": 0.0003379816319678083, "loss": 4.9247, "mean_token_accuracy": 0.21764622181653975, "num_tokens": 92350111.0, "step": 53245 }, { "entropy": 5.823706817626953, "epoch": 4.143007197043377, "grad_norm": 1.34375, "learning_rate": 0.0003379550238661072, "loss": 4.9951, "mean_token_accuracy": 0.2151918441057205, "num_tokens": 92358731.0, "step": 53250 }, { "entropy": 5.812483167648315, "epoch": 4.143396226415095, "grad_norm": 1.453125, "learning_rate": 0.00033792841480916394, "loss": 4.8715, "mean_token_accuracy": 0.22323404103517533, "num_tokens": 92367426.0, "step": 53255 }, { "entropy": 5.876962375640869, "epoch": 4.143785255786812, "grad_norm": 1.3984375, "learning_rate": 0.00033790180479738205, "loss": 4.9306, "mean_token_accuracy": 0.21188554167747498, "num_tokens": 92376937.0, "step": 53260 }, { "entropy": 5.913941717147827, "epoch": 4.144174285158529, "grad_norm": 1.4375, "learning_rate": 0.0003378751938311654, "loss": 4.9523, "mean_token_accuracy": 0.20788147002458573, "num_tokens": 92385562.0, "step": 53265 }, { "entropy": 5.8662793159484865, "epoch": 4.144563314530247, "grad_norm": 1.453125, "learning_rate": 0.0003378485819109177, "loss": 4.8901, "mean_token_accuracy": 0.22487152367830276, "num_tokens": 92393774.0, "step": 53270 }, { "entropy": 5.826793813705445, "epoch": 4.144952343901965, "grad_norm": 1.484375, "learning_rate": 0.00033782196903704286, "loss": 4.9301, "mean_token_accuracy": 0.2163689061999321, "num_tokens": 92402711.0, "step": 53275 }, { "entropy": 5.9066548347473145, "epoch": 4.145341373273682, "grad_norm": 1.359375, "learning_rate": 0.0003377953552099447, "loss": 4.9737, "mean_token_accuracy": 0.2125816211104393, "num_tokens": 92411071.0, "step": 53280 }, { "entropy": 5.904547929763794, "epoch": 4.1457304026454, "grad_norm": 1.2890625, "learning_rate": 0.0003377687404300269, "loss": 4.9604, "mean_token_accuracy": 0.2163440465927124, "num_tokens": 92420842.0, "step": 53285 }, { "entropy": 5.946911764144898, "epoch": 4.146119432017118, "grad_norm": 1.4765625, "learning_rate": 0.0003377421246976934, "loss": 5.0948, "mean_token_accuracy": 0.19948468953371049, "num_tokens": 92430157.0, "step": 53290 }, { "entropy": 5.850155305862427, "epoch": 4.1465084613888346, "grad_norm": 1.421875, "learning_rate": 0.00033771550801334806, "loss": 4.8909, "mean_token_accuracy": 0.21373942047357558, "num_tokens": 92439171.0, "step": 53295 }, { "entropy": 5.816440200805664, "epoch": 4.146897490760552, "grad_norm": 1.359375, "learning_rate": 0.00033768889037739464, "loss": 4.8804, "mean_token_accuracy": 0.2189700961112976, "num_tokens": 92447906.0, "step": 53300 }, { "entropy": 5.818242931365967, "epoch": 4.14728652013227, "grad_norm": 1.328125, "learning_rate": 0.00033766227179023704, "loss": 4.9594, "mean_token_accuracy": 0.20232763588428498, "num_tokens": 92456676.0, "step": 53305 }, { "entropy": 5.814732074737549, "epoch": 4.147675549503988, "grad_norm": 1.3671875, "learning_rate": 0.00033763565225227934, "loss": 4.8869, "mean_token_accuracy": 0.2192394033074379, "num_tokens": 92465388.0, "step": 53310 }, { "entropy": 5.915883493423462, "epoch": 4.148064578875705, "grad_norm": 1.3125, "learning_rate": 0.0003376090317639252, "loss": 4.9906, "mean_token_accuracy": 0.2115987181663513, "num_tokens": 92473347.0, "step": 53315 }, { "entropy": 5.8359416961669925, "epoch": 4.148453608247423, "grad_norm": 1.296875, "learning_rate": 0.00033758241032557875, "loss": 4.9534, "mean_token_accuracy": 0.2157831996679306, "num_tokens": 92482375.0, "step": 53320 }, { "entropy": 5.801951122283936, "epoch": 4.14884263761914, "grad_norm": 1.28125, "learning_rate": 0.00033755578793764375, "loss": 4.9292, "mean_token_accuracy": 0.21365418136119843, "num_tokens": 92490680.0, "step": 53325 }, { "entropy": 5.827856922149659, "epoch": 4.1492316669908575, "grad_norm": 1.3671875, "learning_rate": 0.0003375291646005243, "loss": 4.9239, "mean_token_accuracy": 0.21413583159446717, "num_tokens": 92499627.0, "step": 53330 }, { "entropy": 5.846714973449707, "epoch": 4.149620696362575, "grad_norm": 1.4375, "learning_rate": 0.00033750254031462425, "loss": 4.902, "mean_token_accuracy": 0.21148012280464173, "num_tokens": 92507895.0, "step": 53335 }, { "entropy": 5.832781505584717, "epoch": 4.150009725734293, "grad_norm": 1.421875, "learning_rate": 0.00033747591508034765, "loss": 4.9365, "mean_token_accuracy": 0.2092685431241989, "num_tokens": 92516569.0, "step": 53340 }, { "entropy": 5.7922014713287355, "epoch": 4.150398755106011, "grad_norm": 1.3828125, "learning_rate": 0.0003374492888980985, "loss": 4.9274, "mean_token_accuracy": 0.21497697234153748, "num_tokens": 92525389.0, "step": 53345 }, { "entropy": 5.832038545608521, "epoch": 4.150787784477728, "grad_norm": 1.40625, "learning_rate": 0.00033742266176828073, "loss": 4.9164, "mean_token_accuracy": 0.21459011286497115, "num_tokens": 92533734.0, "step": 53350 }, { "entropy": 5.8762963771820065, "epoch": 4.151176813849446, "grad_norm": 1.5, "learning_rate": 0.00033739603369129846, "loss": 4.8717, "mean_token_accuracy": 0.22083102613687516, "num_tokens": 92541525.0, "step": 53355 }, { "entropy": 5.897107744216919, "epoch": 4.151565843221163, "grad_norm": 1.5234375, "learning_rate": 0.00033736940466755566, "loss": 4.9818, "mean_token_accuracy": 0.21518632918596267, "num_tokens": 92550344.0, "step": 53360 }, { "entropy": 5.784378099441528, "epoch": 4.1519548725928805, "grad_norm": 1.3984375, "learning_rate": 0.00033734277469745644, "loss": 4.8826, "mean_token_accuracy": 0.2251887023448944, "num_tokens": 92559661.0, "step": 53365 }, { "entropy": 5.8874907970428465, "epoch": 4.152343901964598, "grad_norm": 1.3515625, "learning_rate": 0.0003373161437814049, "loss": 4.9639, "mean_token_accuracy": 0.21577203869819642, "num_tokens": 92567810.0, "step": 53370 }, { "entropy": 5.917026233673096, "epoch": 4.152732931336316, "grad_norm": 1.40625, "learning_rate": 0.00033728951191980505, "loss": 5.0142, "mean_token_accuracy": 0.21050578951835633, "num_tokens": 92576051.0, "step": 53375 }, { "entropy": 5.9034582614898685, "epoch": 4.153121960708034, "grad_norm": 1.421875, "learning_rate": 0.00033726287911306095, "loss": 5.0849, "mean_token_accuracy": 0.2041698545217514, "num_tokens": 92584990.0, "step": 53380 }, { "entropy": 5.934722280502319, "epoch": 4.153510990079751, "grad_norm": 1.5390625, "learning_rate": 0.0003372362453615768, "loss": 5.0126, "mean_token_accuracy": 0.2075205460190773, "num_tokens": 92593598.0, "step": 53385 }, { "entropy": 5.942368602752685, "epoch": 4.153900019451468, "grad_norm": 1.3359375, "learning_rate": 0.0003372096106657566, "loss": 4.9876, "mean_token_accuracy": 0.20660072416067124, "num_tokens": 92602757.0, "step": 53390 }, { "entropy": 5.836791896820069, "epoch": 4.154289048823186, "grad_norm": 1.40625, "learning_rate": 0.00033718297502600465, "loss": 4.917, "mean_token_accuracy": 0.215854711830616, "num_tokens": 92611316.0, "step": 53395 }, { "entropy": 5.826577186584473, "epoch": 4.1546780781949035, "grad_norm": 1.5625, "learning_rate": 0.00033715633844272504, "loss": 4.8959, "mean_token_accuracy": 0.22382358014583587, "num_tokens": 92619467.0, "step": 53400 }, { "entropy": 5.880061101913452, "epoch": 4.155067107566621, "grad_norm": 1.3046875, "learning_rate": 0.00033712970091632187, "loss": 4.9357, "mean_token_accuracy": 0.21405623257160186, "num_tokens": 92627858.0, "step": 53405 }, { "entropy": 5.857385063171387, "epoch": 4.155456136938339, "grad_norm": 1.3125, "learning_rate": 0.00033710306244719954, "loss": 4.8772, "mean_token_accuracy": 0.21804386824369432, "num_tokens": 92636553.0, "step": 53410 }, { "entropy": 5.847773599624634, "epoch": 4.155845166310057, "grad_norm": 1.34375, "learning_rate": 0.0003370764230357619, "loss": 4.9362, "mean_token_accuracy": 0.21873412430286407, "num_tokens": 92645100.0, "step": 53415 }, { "entropy": 5.798804140090942, "epoch": 4.156234195681774, "grad_norm": 1.3984375, "learning_rate": 0.0003370497826824134, "loss": 4.8116, "mean_token_accuracy": 0.22145802676677703, "num_tokens": 92653885.0, "step": 53420 }, { "entropy": 5.847759532928467, "epoch": 4.156623225053491, "grad_norm": 1.375, "learning_rate": 0.0003370231413875582, "loss": 4.9254, "mean_token_accuracy": 0.21409497261047364, "num_tokens": 92662534.0, "step": 53425 }, { "entropy": 5.837363052368164, "epoch": 4.157012254425209, "grad_norm": 1.4375, "learning_rate": 0.00033699649915160053, "loss": 4.8669, "mean_token_accuracy": 0.223679718375206, "num_tokens": 92670616.0, "step": 53430 }, { "entropy": 5.784241390228272, "epoch": 4.1574012837969265, "grad_norm": 1.3515625, "learning_rate": 0.00033696985597494474, "loss": 4.8807, "mean_token_accuracy": 0.2127043828368187, "num_tokens": 92678403.0, "step": 53435 }, { "entropy": 5.796213626861572, "epoch": 4.157790313168644, "grad_norm": 1.390625, "learning_rate": 0.000336943211857995, "loss": 4.9046, "mean_token_accuracy": 0.21345544904470443, "num_tokens": 92688122.0, "step": 53440 }, { "entropy": 5.898247575759887, "epoch": 4.158179342540362, "grad_norm": 1.4453125, "learning_rate": 0.0003369165668011556, "loss": 4.9432, "mean_token_accuracy": 0.2200532779097557, "num_tokens": 92696909.0, "step": 53445 }, { "entropy": 5.85617995262146, "epoch": 4.15856837191208, "grad_norm": 1.4140625, "learning_rate": 0.0003368899208048308, "loss": 4.9141, "mean_token_accuracy": 0.21919213086366654, "num_tokens": 92705773.0, "step": 53450 }, { "entropy": 5.884050083160401, "epoch": 4.158957401283797, "grad_norm": 1.40625, "learning_rate": 0.00033686327386942504, "loss": 5.0386, "mean_token_accuracy": 0.21601689904928206, "num_tokens": 92713746.0, "step": 53455 }, { "entropy": 5.855536937713623, "epoch": 4.159346430655514, "grad_norm": 1.53125, "learning_rate": 0.0003368366259953425, "loss": 4.9481, "mean_token_accuracy": 0.21110254526138306, "num_tokens": 92722144.0, "step": 53460 }, { "entropy": 5.8079780578613285, "epoch": 4.159735460027232, "grad_norm": 1.3671875, "learning_rate": 0.00033680997718298756, "loss": 4.8576, "mean_token_accuracy": 0.22461155503988267, "num_tokens": 92730472.0, "step": 53465 }, { "entropy": 5.853402185440063, "epoch": 4.1601244893989495, "grad_norm": 1.4921875, "learning_rate": 0.00033678332743276466, "loss": 4.9831, "mean_token_accuracy": 0.21651618629693986, "num_tokens": 92738722.0, "step": 53470 }, { "entropy": 5.782355690002442, "epoch": 4.160513518770667, "grad_norm": 1.3671875, "learning_rate": 0.0003367566767450781, "loss": 4.9206, "mean_token_accuracy": 0.21634328812360765, "num_tokens": 92748115.0, "step": 53475 }, { "entropy": 5.819504022598267, "epoch": 4.160902548142385, "grad_norm": 1.421875, "learning_rate": 0.00033673002512033223, "loss": 4.8356, "mean_token_accuracy": 0.21518488973379135, "num_tokens": 92756346.0, "step": 53480 }, { "entropy": 5.850860357284546, "epoch": 4.161291577514103, "grad_norm": 1.3515625, "learning_rate": 0.0003367033725589315, "loss": 5.0079, "mean_token_accuracy": 0.21038465052843094, "num_tokens": 92764779.0, "step": 53485 }, { "entropy": 5.8459748268127445, "epoch": 4.16168060688582, "grad_norm": 1.34375, "learning_rate": 0.0003366767190612804, "loss": 4.901, "mean_token_accuracy": 0.21782611906528473, "num_tokens": 92773011.0, "step": 53490 }, { "entropy": 5.79081506729126, "epoch": 4.162069636257537, "grad_norm": 1.28125, "learning_rate": 0.0003366500646277831, "loss": 4.9296, "mean_token_accuracy": 0.21269845366477966, "num_tokens": 92781928.0, "step": 53495 }, { "entropy": 5.781731176376343, "epoch": 4.162458665629255, "grad_norm": 1.3125, "learning_rate": 0.0003366234092588443, "loss": 4.8423, "mean_token_accuracy": 0.2249748721718788, "num_tokens": 92790481.0, "step": 53500 }, { "entropy": 5.912751770019531, "epoch": 4.1628476950009725, "grad_norm": 1.5078125, "learning_rate": 0.00033659675295486826, "loss": 4.9903, "mean_token_accuracy": 0.20901331305503845, "num_tokens": 92799528.0, "step": 53505 }, { "entropy": 5.905495357513428, "epoch": 4.16323672437269, "grad_norm": 1.359375, "learning_rate": 0.00033657009571625964, "loss": 4.9913, "mean_token_accuracy": 0.21431529372930527, "num_tokens": 92807964.0, "step": 53510 }, { "entropy": 5.829051399230957, "epoch": 4.163625753744408, "grad_norm": 1.328125, "learning_rate": 0.0003365434375434227, "loss": 4.9532, "mean_token_accuracy": 0.2147320181131363, "num_tokens": 92817010.0, "step": 53515 }, { "entropy": 5.839204740524292, "epoch": 4.164014783116126, "grad_norm": 1.3203125, "learning_rate": 0.00033651677843676213, "loss": 4.8629, "mean_token_accuracy": 0.22275324612855912, "num_tokens": 92826080.0, "step": 53520 }, { "entropy": 5.818877172470093, "epoch": 4.164403812487842, "grad_norm": 1.4140625, "learning_rate": 0.0003364901183966824, "loss": 4.8924, "mean_token_accuracy": 0.21701116114854813, "num_tokens": 92834837.0, "step": 53525 }, { "entropy": 5.897758674621582, "epoch": 4.16479284185956, "grad_norm": 1.3828125, "learning_rate": 0.0003364634574235879, "loss": 5.0169, "mean_token_accuracy": 0.20208196341991425, "num_tokens": 92843618.0, "step": 53530 }, { "entropy": 5.925196981430053, "epoch": 4.165181871231278, "grad_norm": 1.4375, "learning_rate": 0.00033643679551788325, "loss": 5.0068, "mean_token_accuracy": 0.20696311444044113, "num_tokens": 92851762.0, "step": 53535 }, { "entropy": 5.938673114776611, "epoch": 4.1655709006029955, "grad_norm": 1.3828125, "learning_rate": 0.00033641013267997317, "loss": 5.054, "mean_token_accuracy": 0.21008666306734086, "num_tokens": 92861266.0, "step": 53540 }, { "entropy": 5.858678197860717, "epoch": 4.165959929974713, "grad_norm": 1.5, "learning_rate": 0.00033638346891026196, "loss": 4.8398, "mean_token_accuracy": 0.22490471750497817, "num_tokens": 92869519.0, "step": 53545 }, { "entropy": 5.887332439422607, "epoch": 4.166348959346431, "grad_norm": 1.34375, "learning_rate": 0.00033635680420915424, "loss": 4.9645, "mean_token_accuracy": 0.2081356465816498, "num_tokens": 92878363.0, "step": 53550 }, { "entropy": 5.854238510131836, "epoch": 4.166737988718149, "grad_norm": 1.3359375, "learning_rate": 0.0003363301385770548, "loss": 4.9912, "mean_token_accuracy": 0.21996823996305465, "num_tokens": 92887319.0, "step": 53555 }, { "entropy": 5.883952903747558, "epoch": 4.167127018089865, "grad_norm": 1.4375, "learning_rate": 0.00033630347201436806, "loss": 4.883, "mean_token_accuracy": 0.21945677399635316, "num_tokens": 92896066.0, "step": 53560 }, { "entropy": 5.84497103691101, "epoch": 4.167516047461583, "grad_norm": 1.4609375, "learning_rate": 0.00033627680452149873, "loss": 4.9182, "mean_token_accuracy": 0.22454105615615844, "num_tokens": 92904203.0, "step": 53565 }, { "entropy": 5.934111070632935, "epoch": 4.167905076833301, "grad_norm": 1.4765625, "learning_rate": 0.0003362501360988514, "loss": 4.9826, "mean_token_accuracy": 0.20952188223600388, "num_tokens": 92913349.0, "step": 53570 }, { "entropy": 5.856664848327637, "epoch": 4.1682941062050185, "grad_norm": 1.390625, "learning_rate": 0.0003362234667468308, "loss": 4.908, "mean_token_accuracy": 0.2154055804014206, "num_tokens": 92922250.0, "step": 53575 }, { "entropy": 5.868622732162476, "epoch": 4.168683135576736, "grad_norm": 1.3828125, "learning_rate": 0.0003361967964658415, "loss": 4.8995, "mean_token_accuracy": 0.2128589555621147, "num_tokens": 92930310.0, "step": 53580 }, { "entropy": 5.861986589431763, "epoch": 4.169072164948454, "grad_norm": 1.4765625, "learning_rate": 0.0003361701252562882, "loss": 4.9768, "mean_token_accuracy": 0.21449420154094695, "num_tokens": 92938483.0, "step": 53585 }, { "entropy": 5.868460607528687, "epoch": 4.169461194320172, "grad_norm": 1.3828125, "learning_rate": 0.00033614345311857566, "loss": 4.9895, "mean_token_accuracy": 0.2031269282102585, "num_tokens": 92948121.0, "step": 53590 }, { "entropy": 5.812416696548462, "epoch": 4.169850223691888, "grad_norm": 1.328125, "learning_rate": 0.0003361167800531085, "loss": 4.9011, "mean_token_accuracy": 0.21966077536344528, "num_tokens": 92956714.0, "step": 53595 }, { "entropy": 5.859279537200928, "epoch": 4.170239253063606, "grad_norm": 1.453125, "learning_rate": 0.0003360901060602915, "loss": 4.9941, "mean_token_accuracy": 0.20730192661285402, "num_tokens": 92965494.0, "step": 53600 }, { "entropy": 5.830222845077515, "epoch": 4.170628282435324, "grad_norm": 1.3125, "learning_rate": 0.00033606343114052936, "loss": 4.937, "mean_token_accuracy": 0.21286696344614028, "num_tokens": 92974909.0, "step": 53605 }, { "entropy": 5.83825306892395, "epoch": 4.1710173118070415, "grad_norm": 1.4375, "learning_rate": 0.00033603675529422685, "loss": 4.9557, "mean_token_accuracy": 0.21633207947015762, "num_tokens": 92983969.0, "step": 53610 }, { "entropy": 5.856630420684814, "epoch": 4.171406341178759, "grad_norm": 1.2890625, "learning_rate": 0.0003360100785217887, "loss": 4.9087, "mean_token_accuracy": 0.21719139516353608, "num_tokens": 92992461.0, "step": 53615 }, { "entropy": 5.9226888656616214, "epoch": 4.171795370550477, "grad_norm": 1.390625, "learning_rate": 0.0003359834008236198, "loss": 5.0043, "mean_token_accuracy": 0.2025631323456764, "num_tokens": 93000821.0, "step": 53620 }, { "entropy": 5.942490577697754, "epoch": 4.172184399922194, "grad_norm": 1.359375, "learning_rate": 0.0003359567222001248, "loss": 4.9528, "mean_token_accuracy": 0.21925433725118637, "num_tokens": 93009092.0, "step": 53625 }, { "entropy": 5.837031650543213, "epoch": 4.172573429293911, "grad_norm": 1.3984375, "learning_rate": 0.0003359300426517085, "loss": 4.8763, "mean_token_accuracy": 0.21281177997589112, "num_tokens": 93017435.0, "step": 53630 }, { "entropy": 5.782397747039795, "epoch": 4.172962458665629, "grad_norm": 1.328125, "learning_rate": 0.0003359033621787759, "loss": 4.8414, "mean_token_accuracy": 0.2217545121908188, "num_tokens": 93026209.0, "step": 53635 }, { "entropy": 5.861507987976074, "epoch": 4.173351488037347, "grad_norm": 1.390625, "learning_rate": 0.0003358766807817317, "loss": 5.0584, "mean_token_accuracy": 0.20757674127817155, "num_tokens": 93035512.0, "step": 53640 }, { "entropy": 5.873003005981445, "epoch": 4.1737405174090645, "grad_norm": 1.2890625, "learning_rate": 0.0003358499984609807, "loss": 4.9622, "mean_token_accuracy": 0.20992738306522368, "num_tokens": 93043837.0, "step": 53645 }, { "entropy": 5.890572214126587, "epoch": 4.174129546780782, "grad_norm": 1.3828125, "learning_rate": 0.0003358233152169278, "loss": 4.9629, "mean_token_accuracy": 0.2029842585325241, "num_tokens": 93053253.0, "step": 53650 }, { "entropy": 5.887755441665649, "epoch": 4.1745185761525, "grad_norm": 1.421875, "learning_rate": 0.00033579663104997803, "loss": 4.9446, "mean_token_accuracy": 0.2136894077062607, "num_tokens": 93061400.0, "step": 53655 }, { "entropy": 5.852122259140015, "epoch": 4.174907605524217, "grad_norm": 1.5, "learning_rate": 0.00033576994596053606, "loss": 4.8811, "mean_token_accuracy": 0.21876149624586105, "num_tokens": 93070421.0, "step": 53660 }, { "entropy": 5.843473815917969, "epoch": 4.175296634895934, "grad_norm": 1.2734375, "learning_rate": 0.0003357432599490069, "loss": 4.9823, "mean_token_accuracy": 0.21699924618005753, "num_tokens": 93079629.0, "step": 53665 }, { "entropy": 5.8099383354187015, "epoch": 4.175685664267652, "grad_norm": 1.421875, "learning_rate": 0.00033571657301579547, "loss": 4.8655, "mean_token_accuracy": 0.21808386892080306, "num_tokens": 93087778.0, "step": 53670 }, { "entropy": 5.771580362319947, "epoch": 4.17607469363937, "grad_norm": 1.265625, "learning_rate": 0.0003356898851613067, "loss": 4.8457, "mean_token_accuracy": 0.21645559519529342, "num_tokens": 93096450.0, "step": 53675 }, { "entropy": 5.804183006286621, "epoch": 4.1764637230110875, "grad_norm": 1.4140625, "learning_rate": 0.0003356631963859455, "loss": 4.9485, "mean_token_accuracy": 0.2178372785449028, "num_tokens": 93105225.0, "step": 53680 }, { "entropy": 5.895728635787964, "epoch": 4.176852752382805, "grad_norm": 1.4375, "learning_rate": 0.0003356365066901168, "loss": 5.0171, "mean_token_accuracy": 0.2160433143377304, "num_tokens": 93114386.0, "step": 53685 }, { "entropy": 5.9312591552734375, "epoch": 4.177241781754523, "grad_norm": 1.421875, "learning_rate": 0.00033560981607422567, "loss": 5.0213, "mean_token_accuracy": 0.2146541804075241, "num_tokens": 93122900.0, "step": 53690 }, { "entropy": 5.848360967636109, "epoch": 4.17763081112624, "grad_norm": 1.4375, "learning_rate": 0.00033558312453867703, "loss": 4.9262, "mean_token_accuracy": 0.2098372310400009, "num_tokens": 93131542.0, "step": 53695 }, { "entropy": 5.883009958267212, "epoch": 4.178019840497957, "grad_norm": 1.2734375, "learning_rate": 0.00033555643208387593, "loss": 4.9181, "mean_token_accuracy": 0.2172490119934082, "num_tokens": 93140128.0, "step": 53700 }, { "entropy": 5.818071508407593, "epoch": 4.178408869869675, "grad_norm": 1.3828125, "learning_rate": 0.00033552973871022737, "loss": 4.9429, "mean_token_accuracy": 0.2104995533823967, "num_tokens": 93147966.0, "step": 53705 }, { "entropy": 5.8953711032867435, "epoch": 4.178797899241393, "grad_norm": 1.4296875, "learning_rate": 0.00033550304441813634, "loss": 5.0601, "mean_token_accuracy": 0.20991169661283493, "num_tokens": 93156915.0, "step": 53710 }, { "entropy": 5.853378629684448, "epoch": 4.1791869286131105, "grad_norm": 1.2578125, "learning_rate": 0.0003354763492080079, "loss": 4.9157, "mean_token_accuracy": 0.21613207906484605, "num_tokens": 93165844.0, "step": 53715 }, { "entropy": 5.86073865890503, "epoch": 4.179575957984828, "grad_norm": 1.4453125, "learning_rate": 0.0003354496530802472, "loss": 4.9384, "mean_token_accuracy": 0.21306157857179642, "num_tokens": 93174653.0, "step": 53720 }, { "entropy": 5.885018062591553, "epoch": 4.179964987356545, "grad_norm": 1.3671875, "learning_rate": 0.0003354229560352592, "loss": 4.9497, "mean_token_accuracy": 0.21458093374967574, "num_tokens": 93183407.0, "step": 53725 }, { "entropy": 5.933719205856323, "epoch": 4.180354016728263, "grad_norm": 1.453125, "learning_rate": 0.0003353962580734489, "loss": 5.0091, "mean_token_accuracy": 0.21706014424562453, "num_tokens": 93192103.0, "step": 53730 }, { "entropy": 5.804218339920044, "epoch": 4.18074304609998, "grad_norm": 1.3984375, "learning_rate": 0.00033536955919522167, "loss": 4.8638, "mean_token_accuracy": 0.22085406482219697, "num_tokens": 93200018.0, "step": 53735 }, { "entropy": 5.870971393585205, "epoch": 4.181132075471698, "grad_norm": 1.5390625, "learning_rate": 0.0003353428594009824, "loss": 4.9314, "mean_token_accuracy": 0.21587760299444197, "num_tokens": 93207927.0, "step": 53740 }, { "entropy": 5.828528594970703, "epoch": 4.181521104843416, "grad_norm": 1.3046875, "learning_rate": 0.00033531615869113624, "loss": 4.933, "mean_token_accuracy": 0.2133790910243988, "num_tokens": 93217027.0, "step": 53745 }, { "entropy": 5.880009746551513, "epoch": 4.1819101342151335, "grad_norm": 1.265625, "learning_rate": 0.00033528945706608844, "loss": 4.9719, "mean_token_accuracy": 0.21093399822711945, "num_tokens": 93225415.0, "step": 53750 }, { "entropy": 5.907471418380737, "epoch": 4.182299163586851, "grad_norm": 1.4765625, "learning_rate": 0.00033526275452624407, "loss": 4.9587, "mean_token_accuracy": 0.20193565338850022, "num_tokens": 93234054.0, "step": 53755 }, { "entropy": 5.833608102798462, "epoch": 4.182688192958568, "grad_norm": 1.3671875, "learning_rate": 0.00033523605107200826, "loss": 4.9389, "mean_token_accuracy": 0.20663510262966156, "num_tokens": 93242135.0, "step": 53760 }, { "entropy": 5.798992252349853, "epoch": 4.183077222330286, "grad_norm": 1.453125, "learning_rate": 0.00033520934670378634, "loss": 4.8337, "mean_token_accuracy": 0.2205727532505989, "num_tokens": 93249946.0, "step": 53765 }, { "entropy": 5.90042200088501, "epoch": 4.183466251702003, "grad_norm": 1.3359375, "learning_rate": 0.00033518264142198335, "loss": 5.055, "mean_token_accuracy": 0.20439103692770005, "num_tokens": 93258692.0, "step": 53770 }, { "entropy": 5.860237407684326, "epoch": 4.183855281073721, "grad_norm": 1.4609375, "learning_rate": 0.0003351559352270047, "loss": 4.9392, "mean_token_accuracy": 0.216738823056221, "num_tokens": 93267882.0, "step": 53775 }, { "entropy": 5.90893874168396, "epoch": 4.184244310445439, "grad_norm": 1.359375, "learning_rate": 0.00033512922811925535, "loss": 5.0608, "mean_token_accuracy": 0.2088662400841713, "num_tokens": 93276922.0, "step": 53780 }, { "entropy": 5.883574485778809, "epoch": 4.1846333398171565, "grad_norm": 1.3125, "learning_rate": 0.0003351025200991406, "loss": 4.9884, "mean_token_accuracy": 0.20508197247982024, "num_tokens": 93285918.0, "step": 53785 }, { "entropy": 5.915193367004394, "epoch": 4.185022369188874, "grad_norm": 1.375, "learning_rate": 0.0003350758111670659, "loss": 4.8851, "mean_token_accuracy": 0.22445281893014907, "num_tokens": 93294116.0, "step": 53790 }, { "entropy": 5.76639838218689, "epoch": 4.185411398560591, "grad_norm": 2.015625, "learning_rate": 0.0003350491013234364, "loss": 4.7547, "mean_token_accuracy": 0.2297177791595459, "num_tokens": 93303108.0, "step": 53795 }, { "entropy": 5.790398693084716, "epoch": 4.185800427932309, "grad_norm": 1.2890625, "learning_rate": 0.0003350223905686573, "loss": 4.8949, "mean_token_accuracy": 0.2144441768527031, "num_tokens": 93311774.0, "step": 53800 }, { "entropy": 5.918059635162353, "epoch": 4.186189457304026, "grad_norm": 1.4375, "learning_rate": 0.000334995678903134, "loss": 4.9752, "mean_token_accuracy": 0.21836767494678497, "num_tokens": 93320312.0, "step": 53805 }, { "entropy": 5.882407712936401, "epoch": 4.186578486675744, "grad_norm": 1.3828125, "learning_rate": 0.0003349689663272718, "loss": 4.8875, "mean_token_accuracy": 0.21544857770204545, "num_tokens": 93328963.0, "step": 53810 }, { "entropy": 5.91259799003601, "epoch": 4.186967516047462, "grad_norm": 1.5234375, "learning_rate": 0.0003349422528414759, "loss": 4.9875, "mean_token_accuracy": 0.20872790813446046, "num_tokens": 93337323.0, "step": 53815 }, { "entropy": 5.77450008392334, "epoch": 4.1873565454191795, "grad_norm": 1.4453125, "learning_rate": 0.0003349155384461517, "loss": 4.9211, "mean_token_accuracy": 0.21002318263053893, "num_tokens": 93345571.0, "step": 53820 }, { "entropy": 5.89337191581726, "epoch": 4.187745574790897, "grad_norm": 1.4609375, "learning_rate": 0.00033488882314170463, "loss": 4.9736, "mean_token_accuracy": 0.2135390669107437, "num_tokens": 93355297.0, "step": 53825 }, { "entropy": 5.864468288421631, "epoch": 4.188134604162614, "grad_norm": 1.2890625, "learning_rate": 0.00033486210692854, "loss": 4.8457, "mean_token_accuracy": 0.2249230846762657, "num_tokens": 93363885.0, "step": 53830 }, { "entropy": 5.872619485855102, "epoch": 4.188523633534332, "grad_norm": 1.4609375, "learning_rate": 0.0003348353898070631, "loss": 4.9686, "mean_token_accuracy": 0.2067239835858345, "num_tokens": 93372231.0, "step": 53835 }, { "entropy": 5.799728870391846, "epoch": 4.188912662906049, "grad_norm": 1.3203125, "learning_rate": 0.0003348086717776795, "loss": 4.8547, "mean_token_accuracy": 0.22463424503803253, "num_tokens": 93381391.0, "step": 53840 }, { "entropy": 5.887049818038941, "epoch": 4.189301692277767, "grad_norm": 1.53125, "learning_rate": 0.00033478195284079447, "loss": 4.9665, "mean_token_accuracy": 0.21537117063999175, "num_tokens": 93390916.0, "step": 53845 }, { "entropy": 5.894867849349976, "epoch": 4.189690721649485, "grad_norm": 1.46875, "learning_rate": 0.0003347552329968134, "loss": 4.9757, "mean_token_accuracy": 0.21252622455358505, "num_tokens": 93399318.0, "step": 53850 }, { "entropy": 5.884332799911499, "epoch": 4.1900797510212024, "grad_norm": 1.375, "learning_rate": 0.0003347285122461419, "loss": 5.0313, "mean_token_accuracy": 0.20530605763196946, "num_tokens": 93408319.0, "step": 53855 }, { "entropy": 5.791520643234253, "epoch": 4.190468780392919, "grad_norm": 1.453125, "learning_rate": 0.0003347017905891852, "loss": 4.8854, "mean_token_accuracy": 0.22101341784000397, "num_tokens": 93416765.0, "step": 53860 }, { "entropy": 5.876375722885132, "epoch": 4.190857809764637, "grad_norm": 1.3046875, "learning_rate": 0.0003346750680263488, "loss": 4.9272, "mean_token_accuracy": 0.2135073110461235, "num_tokens": 93425256.0, "step": 53865 }, { "entropy": 5.884037494659424, "epoch": 4.191246839136355, "grad_norm": 1.515625, "learning_rate": 0.0003346483445580384, "loss": 4.9491, "mean_token_accuracy": 0.21467678844928742, "num_tokens": 93433513.0, "step": 53870 }, { "entropy": 5.931248664855957, "epoch": 4.191635868508072, "grad_norm": 1.5078125, "learning_rate": 0.00033462162018465917, "loss": 5.0479, "mean_token_accuracy": 0.20211127549409866, "num_tokens": 93441978.0, "step": 53875 }, { "entropy": 5.832602167129517, "epoch": 4.19202489787979, "grad_norm": 1.3125, "learning_rate": 0.00033459489490661676, "loss": 4.8862, "mean_token_accuracy": 0.22016041427850724, "num_tokens": 93450943.0, "step": 53880 }, { "entropy": 5.868156957626343, "epoch": 4.192413927251508, "grad_norm": 1.3828125, "learning_rate": 0.00033456816872431673, "loss": 4.9991, "mean_token_accuracy": 0.2109297677874565, "num_tokens": 93459408.0, "step": 53885 }, { "entropy": 5.8729808807373045, "epoch": 4.192802956623225, "grad_norm": 1.4296875, "learning_rate": 0.0003345414416381645, "loss": 4.9832, "mean_token_accuracy": 0.21852566301822662, "num_tokens": 93466959.0, "step": 53890 }, { "entropy": 5.890698766708374, "epoch": 4.193191985994942, "grad_norm": 1.3984375, "learning_rate": 0.00033451471364856565, "loss": 4.9811, "mean_token_accuracy": 0.20915732830762862, "num_tokens": 93475584.0, "step": 53895 }, { "entropy": 5.83325457572937, "epoch": 4.19358101536666, "grad_norm": 1.5078125, "learning_rate": 0.00033448798475592585, "loss": 5.0356, "mean_token_accuracy": 0.21296471506357192, "num_tokens": 93484081.0, "step": 53900 }, { "entropy": 5.858297395706177, "epoch": 4.193970044738378, "grad_norm": 1.4375, "learning_rate": 0.0003344612549606505, "loss": 4.9504, "mean_token_accuracy": 0.21630411446094513, "num_tokens": 93492499.0, "step": 53905 }, { "entropy": 5.8106237888336185, "epoch": 4.194359074110095, "grad_norm": 1.5, "learning_rate": 0.0003344345242631453, "loss": 4.8801, "mean_token_accuracy": 0.224136383831501, "num_tokens": 93500676.0, "step": 53910 }, { "entropy": 5.858386278152466, "epoch": 4.194748103481813, "grad_norm": 1.3125, "learning_rate": 0.0003344077926638157, "loss": 4.9707, "mean_token_accuracy": 0.2078514277935028, "num_tokens": 93509486.0, "step": 53915 }, { "entropy": 5.8230186939239506, "epoch": 4.195137132853531, "grad_norm": 1.359375, "learning_rate": 0.00033438106016306753, "loss": 4.8471, "mean_token_accuracy": 0.21608118265867232, "num_tokens": 93517864.0, "step": 53920 }, { "entropy": 5.857396745681763, "epoch": 4.195526162225248, "grad_norm": 1.4453125, "learning_rate": 0.0003343543267613062, "loss": 4.9496, "mean_token_accuracy": 0.2074006214737892, "num_tokens": 93526452.0, "step": 53925 }, { "entropy": 5.891114997863769, "epoch": 4.195915191596965, "grad_norm": 1.328125, "learning_rate": 0.0003343275924589374, "loss": 4.9427, "mean_token_accuracy": 0.21449647545814515, "num_tokens": 93535114.0, "step": 53930 }, { "entropy": 5.81209921836853, "epoch": 4.196304220968683, "grad_norm": 1.3984375, "learning_rate": 0.00033430085725636685, "loss": 4.9422, "mean_token_accuracy": 0.20982563942670823, "num_tokens": 93543844.0, "step": 53935 }, { "entropy": 5.820385265350342, "epoch": 4.196693250340401, "grad_norm": 1.328125, "learning_rate": 0.0003342741211540002, "loss": 4.8887, "mean_token_accuracy": 0.21554345786571502, "num_tokens": 93552439.0, "step": 53940 }, { "entropy": 5.855175256729126, "epoch": 4.197082279712118, "grad_norm": 1.3046875, "learning_rate": 0.0003342473841522431, "loss": 5.0117, "mean_token_accuracy": 0.20972239077091218, "num_tokens": 93561655.0, "step": 53945 }, { "entropy": 5.84648027420044, "epoch": 4.197471309083836, "grad_norm": 1.5, "learning_rate": 0.00033422064625150124, "loss": 4.9562, "mean_token_accuracy": 0.21483898162841797, "num_tokens": 93570070.0, "step": 53950 }, { "entropy": 5.842799139022827, "epoch": 4.197860338455554, "grad_norm": 1.3046875, "learning_rate": 0.0003341939074521804, "loss": 4.9071, "mean_token_accuracy": 0.22382012754678726, "num_tokens": 93579052.0, "step": 53955 }, { "entropy": 5.878332328796387, "epoch": 4.1982493678272705, "grad_norm": 1.3515625, "learning_rate": 0.0003341671677546861, "loss": 4.914, "mean_token_accuracy": 0.21355250477790833, "num_tokens": 93588873.0, "step": 53960 }, { "entropy": 5.829908037185669, "epoch": 4.198638397198988, "grad_norm": 1.3828125, "learning_rate": 0.00033414042715942423, "loss": 4.9246, "mean_token_accuracy": 0.2268762543797493, "num_tokens": 93597132.0, "step": 53965 }, { "entropy": 5.900945234298706, "epoch": 4.199027426570706, "grad_norm": 1.34375, "learning_rate": 0.0003341136856668005, "loss": 4.9106, "mean_token_accuracy": 0.21444661766290665, "num_tokens": 93604881.0, "step": 53970 }, { "entropy": 5.868680572509765, "epoch": 4.199416455942424, "grad_norm": 1.3515625, "learning_rate": 0.0003340869432772207, "loss": 4.9512, "mean_token_accuracy": 0.20895967334508897, "num_tokens": 93612935.0, "step": 53975 }, { "entropy": 5.8518177509307865, "epoch": 4.199805485314141, "grad_norm": 1.3828125, "learning_rate": 0.00033406019999109065, "loss": 4.959, "mean_token_accuracy": 0.216126948595047, "num_tokens": 93621551.0, "step": 53980 }, { "entropy": 5.841985416412354, "epoch": 4.200194514685859, "grad_norm": 1.3828125, "learning_rate": 0.00033403345580881606, "loss": 4.9475, "mean_token_accuracy": 0.21071730107069014, "num_tokens": 93630275.0, "step": 53985 }, { "entropy": 5.852180910110474, "epoch": 4.200583544057577, "grad_norm": 1.4765625, "learning_rate": 0.00033400671073080274, "loss": 4.9601, "mean_token_accuracy": 0.20803540498018264, "num_tokens": 93639823.0, "step": 53990 }, { "entropy": 5.886046457290649, "epoch": 4.2009725734292935, "grad_norm": 1.4765625, "learning_rate": 0.0003339799647574564, "loss": 4.9372, "mean_token_accuracy": 0.21094537675380706, "num_tokens": 93647779.0, "step": 53995 }, { "entropy": 5.838726663589478, "epoch": 4.201361602801011, "grad_norm": 1.40625, "learning_rate": 0.0003339532178891831, "loss": 4.9474, "mean_token_accuracy": 0.21109525710344315, "num_tokens": 93656282.0, "step": 54000 }, { "epoch": 4.201361602801011, "eval_entropy": 5.531355975612755, "eval_loss": 5.053053379058838, "eval_mean_token_accuracy": 0.21835646246119803, "eval_num_tokens": 93656282.0, "eval_runtime": 21.8368, "eval_samples_per_second": 1903.115, "eval_steps_per_second": 237.901, "step": 54000 } ], "logging_steps": 5, "max_steps": 128520, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.885548311073792e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }