{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.2986954565901936, "eval_steps": 3000, "global_step": 33000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 8.173395156860352, "epoch": 0.00049982506122857, "grad_norm": 1.2265625, "learning_rate": 2e-06, "loss": 7.9212, "mean_token_accuracy": 0.09272176176309585, "num_tokens": 8821.0, "step": 5 }, { "entropy": 8.15390853881836, "epoch": 0.00099965012245714, "grad_norm": 1.1953125, "learning_rate": 4.5e-06, "loss": 7.8813, "mean_token_accuracy": 0.0939578540623188, "num_tokens": 18288.0, "step": 10 }, { "entropy": 8.147719764709473, "epoch": 0.00149947518368571, "grad_norm": 0.96875, "learning_rate": 7e-06, "loss": 8.0013, "mean_token_accuracy": 0.08617180287837982, "num_tokens": 28664.0, "step": 15 }, { "entropy": 8.167346668243407, "epoch": 0.00199930024491428, "grad_norm": 2.0, "learning_rate": 9.5e-06, "loss": 7.9255, "mean_token_accuracy": 0.0916962169110775, "num_tokens": 37807.0, "step": 20 }, { "entropy": 8.143739604949952, "epoch": 0.00249912530614285, "grad_norm": 0.9765625, "learning_rate": 1.2e-05, "loss": 8.0114, "mean_token_accuracy": 0.08655632585287094, "num_tokens": 48086.0, "step": 25 }, { "entropy": 8.162391948699952, "epoch": 0.00299895036737142, "grad_norm": 1.125, "learning_rate": 1.4500000000000002e-05, "loss": 7.9097, "mean_token_accuracy": 0.09338272213935853, "num_tokens": 57427.0, "step": 30 }, { "entropy": 8.124217319488526, "epoch": 0.00349877542859999, "grad_norm": 1.078125, "learning_rate": 1.7000000000000003e-05, "loss": 7.8375, "mean_token_accuracy": 0.09512318149209023, "num_tokens": 66662.0, "step": 35 }, { "entropy": 8.138414859771729, "epoch": 0.00399860048982856, "grad_norm": 0.94140625, "learning_rate": 1.95e-05, "loss": 7.9693, "mean_token_accuracy": 0.08915233314037323, "num_tokens": 77388.0, "step": 40 }, { "entropy": 8.167016983032227, "epoch": 0.00449842555105713, "grad_norm": 1.1875, "learning_rate": 2.2e-05, "loss": 7.8205, "mean_token_accuracy": 0.09171208068728447, "num_tokens": 86093.0, "step": 45 }, { "entropy": 8.184170150756836, "epoch": 0.0049982506122857, "grad_norm": 1.078125, "learning_rate": 2.4500000000000003e-05, "loss": 7.9262, "mean_token_accuracy": 0.09001774936914445, "num_tokens": 96097.0, "step": 50 }, { "entropy": 8.148734855651856, "epoch": 0.00549807567351427, "grad_norm": 0.953125, "learning_rate": 2.7e-05, "loss": 7.9451, "mean_token_accuracy": 0.08841896653175355, "num_tokens": 106328.0, "step": 55 }, { "entropy": 8.164736080169678, "epoch": 0.00599790073474284, "grad_norm": 1.09375, "learning_rate": 2.95e-05, "loss": 7.8896, "mean_token_accuracy": 0.09127758592367172, "num_tokens": 114822.0, "step": 60 }, { "entropy": 8.159956741333009, "epoch": 0.00649772579597141, "grad_norm": 1.1640625, "learning_rate": 3.2e-05, "loss": 7.9015, "mean_token_accuracy": 0.0870350182056427, "num_tokens": 124984.0, "step": 65 }, { "entropy": 8.099590635299682, "epoch": 0.00699755085719998, "grad_norm": 1.0625, "learning_rate": 3.4500000000000005e-05, "loss": 7.8877, "mean_token_accuracy": 0.09039942994713783, "num_tokens": 134054.0, "step": 70 }, { "entropy": 8.094889259338379, "epoch": 0.00749737591842855, "grad_norm": 1.078125, "learning_rate": 3.7e-05, "loss": 7.8934, "mean_token_accuracy": 0.09580017626285553, "num_tokens": 144561.0, "step": 75 }, { "entropy": 8.143476486206055, "epoch": 0.00799720097965712, "grad_norm": 1.0703125, "learning_rate": 3.95e-05, "loss": 7.9329, "mean_token_accuracy": 0.08533147275447846, "num_tokens": 153701.0, "step": 80 }, { "entropy": 8.166958999633788, "epoch": 0.00849702604088569, "grad_norm": 1.15625, "learning_rate": 4.2000000000000004e-05, "loss": 7.8542, "mean_token_accuracy": 0.09379108399152755, "num_tokens": 164291.0, "step": 85 }, { "entropy": 8.122808074951172, "epoch": 0.00899685110211426, "grad_norm": 1.1328125, "learning_rate": 4.45e-05, "loss": 7.86, "mean_token_accuracy": 0.09373755380511284, "num_tokens": 174136.0, "step": 90 }, { "entropy": 8.091786527633667, "epoch": 0.00949667616334283, "grad_norm": 0.98046875, "learning_rate": 4.7000000000000004e-05, "loss": 7.9022, "mean_token_accuracy": 0.09065977856516838, "num_tokens": 184368.0, "step": 95 }, { "entropy": 8.127646446228027, "epoch": 0.0099965012245714, "grad_norm": 0.99609375, "learning_rate": 4.9500000000000004e-05, "loss": 7.9161, "mean_token_accuracy": 0.08597206845879554, "num_tokens": 194659.0, "step": 100 }, { "entropy": 8.213620471954346, "epoch": 0.01049632628579997, "grad_norm": 0.96875, "learning_rate": 5.2e-05, "loss": 7.9287, "mean_token_accuracy": 0.09312979727983475, "num_tokens": 204875.0, "step": 105 }, { "entropy": 8.149574470520019, "epoch": 0.01099615134702854, "grad_norm": 1.46875, "learning_rate": 5.45e-05, "loss": 7.9428, "mean_token_accuracy": 0.09381906017661094, "num_tokens": 217033.0, "step": 110 }, { "entropy": 8.211454486846923, "epoch": 0.01149597640825711, "grad_norm": 1.1015625, "learning_rate": 5.7e-05, "loss": 7.8896, "mean_token_accuracy": 0.09600678682327271, "num_tokens": 225946.0, "step": 115 }, { "entropy": 8.188517951965332, "epoch": 0.01199580146948568, "grad_norm": 1.0703125, "learning_rate": 5.9499999999999996e-05, "loss": 7.871, "mean_token_accuracy": 0.09085513278841972, "num_tokens": 235413.0, "step": 120 }, { "entropy": 8.094170618057252, "epoch": 0.01249562653071425, "grad_norm": 0.90625, "learning_rate": 6.2e-05, "loss": 7.9383, "mean_token_accuracy": 0.08237705007195473, "num_tokens": 247913.0, "step": 125 }, { "entropy": 8.203950881958008, "epoch": 0.01299545159194282, "grad_norm": 1.09375, "learning_rate": 6.450000000000001e-05, "loss": 7.9114, "mean_token_accuracy": 0.09513814747333527, "num_tokens": 258486.0, "step": 130 }, { "entropy": 8.173905754089356, "epoch": 0.01349527665317139, "grad_norm": 1.0078125, "learning_rate": 6.7e-05, "loss": 7.8574, "mean_token_accuracy": 0.08711725249886512, "num_tokens": 268027.0, "step": 135 }, { "entropy": 8.097312259674073, "epoch": 0.01399510171439996, "grad_norm": 1.1015625, "learning_rate": 6.950000000000001e-05, "loss": 7.8699, "mean_token_accuracy": 0.09045619666576385, "num_tokens": 277470.0, "step": 140 }, { "entropy": 8.162187767028808, "epoch": 0.01449492677562853, "grad_norm": 1.03125, "learning_rate": 7.2e-05, "loss": 7.8441, "mean_token_accuracy": 0.08916656076908111, "num_tokens": 286891.0, "step": 145 }, { "entropy": 8.138840484619141, "epoch": 0.0149947518368571, "grad_norm": 1.1875, "learning_rate": 7.45e-05, "loss": 7.8221, "mean_token_accuracy": 0.09832631349563599, "num_tokens": 295636.0, "step": 150 }, { "entropy": 8.100650215148926, "epoch": 0.01549457689808567, "grad_norm": 0.98828125, "learning_rate": 7.7e-05, "loss": 7.807, "mean_token_accuracy": 0.09535080567002296, "num_tokens": 306542.0, "step": 155 }, { "entropy": 8.136592578887939, "epoch": 0.01599440195931424, "grad_norm": 1.0546875, "learning_rate": 7.950000000000001e-05, "loss": 7.8128, "mean_token_accuracy": 0.09563795924186706, "num_tokens": 315956.0, "step": 160 }, { "entropy": 8.075897836685181, "epoch": 0.01649422702054281, "grad_norm": 1.03125, "learning_rate": 8.2e-05, "loss": 7.7835, "mean_token_accuracy": 0.09556139633059502, "num_tokens": 325500.0, "step": 165 }, { "entropy": 8.13330774307251, "epoch": 0.01699405208177138, "grad_norm": 1.140625, "learning_rate": 8.450000000000001e-05, "loss": 7.8728, "mean_token_accuracy": 0.09840985015034676, "num_tokens": 335194.0, "step": 170 }, { "entropy": 8.178883743286132, "epoch": 0.01749387714299995, "grad_norm": 1.1328125, "learning_rate": 8.7e-05, "loss": 7.8081, "mean_token_accuracy": 0.09958252236247063, "num_tokens": 344717.0, "step": 175 }, { "entropy": 8.01774287223816, "epoch": 0.01799370220422852, "grad_norm": 1.0703125, "learning_rate": 8.95e-05, "loss": 7.7695, "mean_token_accuracy": 0.09593843147158623, "num_tokens": 354476.0, "step": 180 }, { "entropy": 8.1070050239563, "epoch": 0.01849352726545709, "grad_norm": 1.21875, "learning_rate": 9.2e-05, "loss": 7.837, "mean_token_accuracy": 0.09266547411680222, "num_tokens": 363939.0, "step": 185 }, { "entropy": 8.165003967285156, "epoch": 0.01899335232668566, "grad_norm": 1.2109375, "learning_rate": 9.45e-05, "loss": 7.8697, "mean_token_accuracy": 0.08987938240170479, "num_tokens": 373187.0, "step": 190 }, { "entropy": 8.064292907714844, "epoch": 0.01949317738791423, "grad_norm": 1.0078125, "learning_rate": 9.7e-05, "loss": 7.8155, "mean_token_accuracy": 0.09654008895158768, "num_tokens": 382999.0, "step": 195 }, { "entropy": 8.19270725250244, "epoch": 0.0199930024491428, "grad_norm": 1.0546875, "learning_rate": 9.95e-05, "loss": 7.8707, "mean_token_accuracy": 0.09406451731920243, "num_tokens": 392639.0, "step": 200 }, { "entropy": 8.113720321655274, "epoch": 0.02049282751037137, "grad_norm": 1.1796875, "learning_rate": 0.000102, "loss": 7.8688, "mean_token_accuracy": 0.0874548889696598, "num_tokens": 403089.0, "step": 205 }, { "entropy": 8.125567817687989, "epoch": 0.02099265257159994, "grad_norm": 1.0859375, "learning_rate": 0.00010449999999999999, "loss": 7.8475, "mean_token_accuracy": 0.08455977067351342, "num_tokens": 412321.0, "step": 210 }, { "entropy": 8.179554748535157, "epoch": 0.02149247763282851, "grad_norm": 1.1953125, "learning_rate": 0.000107, "loss": 7.8661, "mean_token_accuracy": 0.08831506222486496, "num_tokens": 421599.0, "step": 215 }, { "entropy": 8.149456882476807, "epoch": 0.02199230269405708, "grad_norm": 1.0625, "learning_rate": 0.0001095, "loss": 7.8491, "mean_token_accuracy": 0.08751258924603462, "num_tokens": 432012.0, "step": 220 }, { "entropy": 8.103495025634766, "epoch": 0.02249212775528565, "grad_norm": 1.2109375, "learning_rate": 0.000112, "loss": 7.8785, "mean_token_accuracy": 0.08636855706572533, "num_tokens": 441989.0, "step": 225 }, { "entropy": 8.124602317810059, "epoch": 0.02299195281651422, "grad_norm": 1.078125, "learning_rate": 0.0001145, "loss": 7.8288, "mean_token_accuracy": 0.09801522344350815, "num_tokens": 451532.0, "step": 230 }, { "entropy": 8.118602657318116, "epoch": 0.02349177787774279, "grad_norm": 1.2421875, "learning_rate": 0.00011700000000000001, "loss": 7.8538, "mean_token_accuracy": 0.09045086875557899, "num_tokens": 461815.0, "step": 235 }, { "entropy": 8.224643325805664, "epoch": 0.02399160293897136, "grad_norm": 1.328125, "learning_rate": 0.00011949999999999999, "loss": 7.9141, "mean_token_accuracy": 0.08622012361884117, "num_tokens": 470860.0, "step": 240 }, { "entropy": 8.085096645355225, "epoch": 0.02449142800019993, "grad_norm": 1.109375, "learning_rate": 0.000122, "loss": 7.8658, "mean_token_accuracy": 0.08970579206943512, "num_tokens": 480649.0, "step": 245 }, { "entropy": 8.196398639678955, "epoch": 0.0249912530614285, "grad_norm": 1.328125, "learning_rate": 0.0001245, "loss": 7.791, "mean_token_accuracy": 0.09182884991168976, "num_tokens": 489969.0, "step": 250 }, { "entropy": 7.999597597122192, "epoch": 0.02549107812265707, "grad_norm": 1.0390625, "learning_rate": 0.000127, "loss": 7.8234, "mean_token_accuracy": 0.09344998225569726, "num_tokens": 500000.0, "step": 255 }, { "entropy": 8.161861276626587, "epoch": 0.02599090318388564, "grad_norm": 1.1796875, "learning_rate": 0.0001295, "loss": 7.7993, "mean_token_accuracy": 0.09596751630306244, "num_tokens": 510013.0, "step": 260 }, { "entropy": 8.045274543762208, "epoch": 0.026490728245114212, "grad_norm": 1.15625, "learning_rate": 0.000132, "loss": 7.8612, "mean_token_accuracy": 0.09452076926827431, "num_tokens": 519698.0, "step": 265 }, { "entropy": 8.16001009941101, "epoch": 0.02699055330634278, "grad_norm": 1.09375, "learning_rate": 0.00013450000000000002, "loss": 7.8053, "mean_token_accuracy": 0.09544829428195953, "num_tokens": 531631.0, "step": 270 }, { "entropy": 8.094933128356933, "epoch": 0.02749037836757135, "grad_norm": 1.2109375, "learning_rate": 0.00013700000000000002, "loss": 7.8554, "mean_token_accuracy": 0.09051231518387795, "num_tokens": 542204.0, "step": 275 }, { "entropy": 8.072505760192872, "epoch": 0.02799020342879992, "grad_norm": 1.125, "learning_rate": 0.0001395, "loss": 7.7632, "mean_token_accuracy": 0.09450774788856506, "num_tokens": 552269.0, "step": 280 }, { "entropy": 8.006140613555909, "epoch": 0.02849002849002849, "grad_norm": 1.1015625, "learning_rate": 0.00014199999999999998, "loss": 7.7554, "mean_token_accuracy": 0.09378736913204193, "num_tokens": 561907.0, "step": 285 }, { "entropy": 8.243315029144288, "epoch": 0.02898985355125706, "grad_norm": 1.3515625, "learning_rate": 0.0001445, "loss": 7.8846, "mean_token_accuracy": 0.08584100976586342, "num_tokens": 571283.0, "step": 290 }, { "entropy": 7.974696350097656, "epoch": 0.02948967861248563, "grad_norm": 1.203125, "learning_rate": 0.000147, "loss": 7.7631, "mean_token_accuracy": 0.09530414417386054, "num_tokens": 579896.0, "step": 295 }, { "entropy": 8.0429096698761, "epoch": 0.0299895036737142, "grad_norm": 1.21875, "learning_rate": 0.0001495, "loss": 7.7369, "mean_token_accuracy": 0.09685113728046417, "num_tokens": 588856.0, "step": 300 }, { "entropy": 8.04590039253235, "epoch": 0.03048932873494277, "grad_norm": 1.2109375, "learning_rate": 0.000152, "loss": 7.7846, "mean_token_accuracy": 0.09521858915686607, "num_tokens": 598910.0, "step": 305 }, { "entropy": 8.120123100280761, "epoch": 0.03098915379617134, "grad_norm": 1.28125, "learning_rate": 0.00015450000000000001, "loss": 7.8292, "mean_token_accuracy": 0.09306757375597954, "num_tokens": 609248.0, "step": 310 }, { "entropy": 8.05753664970398, "epoch": 0.03148897885739991, "grad_norm": 1.125, "learning_rate": 0.000157, "loss": 7.8521, "mean_token_accuracy": 0.09199029803276063, "num_tokens": 619352.0, "step": 315 }, { "entropy": 8.209227561950684, "epoch": 0.03198880391862848, "grad_norm": 1.2265625, "learning_rate": 0.0001595, "loss": 7.824, "mean_token_accuracy": 0.08493875190615655, "num_tokens": 628300.0, "step": 320 }, { "entropy": 8.080143022537232, "epoch": 0.03248862897985705, "grad_norm": 1.0625, "learning_rate": 0.000162, "loss": 7.803, "mean_token_accuracy": 0.09538680538535119, "num_tokens": 637969.0, "step": 325 }, { "entropy": 8.04603624343872, "epoch": 0.03298845404108562, "grad_norm": 1.015625, "learning_rate": 0.00016450000000000001, "loss": 7.7472, "mean_token_accuracy": 0.09739784002304078, "num_tokens": 647518.0, "step": 330 }, { "entropy": 8.218221759796142, "epoch": 0.03348827910231419, "grad_norm": 2.40625, "learning_rate": 0.00016700000000000002, "loss": 7.8654, "mean_token_accuracy": 0.08986226171255111, "num_tokens": 658292.0, "step": 335 }, { "entropy": 8.023103809356689, "epoch": 0.03398810416354276, "grad_norm": 1.2265625, "learning_rate": 0.00016950000000000003, "loss": 7.7836, "mean_token_accuracy": 0.09298105165362358, "num_tokens": 667872.0, "step": 340 }, { "entropy": 8.046844100952148, "epoch": 0.03448792922477133, "grad_norm": 1.1640625, "learning_rate": 0.00017199999999999998, "loss": 7.6883, "mean_token_accuracy": 0.0971065603196621, "num_tokens": 676976.0, "step": 345 }, { "entropy": 8.024046325683594, "epoch": 0.0349877542859999, "grad_norm": 1.75, "learning_rate": 0.00017449999999999999, "loss": 7.7503, "mean_token_accuracy": 0.09279201328754424, "num_tokens": 686149.0, "step": 350 }, { "entropy": 8.001934909820557, "epoch": 0.03548757934722847, "grad_norm": 1.25, "learning_rate": 0.000177, "loss": 7.6529, "mean_token_accuracy": 0.10482841432094574, "num_tokens": 696439.0, "step": 355 }, { "entropy": 7.9410679817199705, "epoch": 0.03598740440845704, "grad_norm": 1.2734375, "learning_rate": 0.0001795, "loss": 7.6498, "mean_token_accuracy": 0.10238936245441436, "num_tokens": 705902.0, "step": 360 }, { "entropy": 8.022974014282227, "epoch": 0.03648722946968561, "grad_norm": 1.1875, "learning_rate": 0.000182, "loss": 7.8524, "mean_token_accuracy": 0.09500225633382797, "num_tokens": 715973.0, "step": 365 }, { "entropy": 8.071463918685913, "epoch": 0.03698705453091418, "grad_norm": 1.171875, "learning_rate": 0.0001845, "loss": 7.7332, "mean_token_accuracy": 0.09426685646176339, "num_tokens": 725463.0, "step": 370 }, { "entropy": 8.053776121139526, "epoch": 0.03748687959214275, "grad_norm": 1.296875, "learning_rate": 0.000187, "loss": 7.7399, "mean_token_accuracy": 0.09462474286556244, "num_tokens": 734941.0, "step": 375 }, { "entropy": 8.029221868515014, "epoch": 0.03798670465337132, "grad_norm": 1.1796875, "learning_rate": 0.0001895, "loss": 7.777, "mean_token_accuracy": 0.09015404880046844, "num_tokens": 744302.0, "step": 380 }, { "entropy": 7.99616174697876, "epoch": 0.03848652971459989, "grad_norm": 1.203125, "learning_rate": 0.000192, "loss": 7.7275, "mean_token_accuracy": 0.10049449354410171, "num_tokens": 754341.0, "step": 385 }, { "entropy": 8.145702171325684, "epoch": 0.03898635477582846, "grad_norm": 1.359375, "learning_rate": 0.0001945, "loss": 7.852, "mean_token_accuracy": 0.08332133702933789, "num_tokens": 764087.0, "step": 390 }, { "entropy": 7.944943904876709, "epoch": 0.03948617983705703, "grad_norm": 1.2109375, "learning_rate": 0.00019700000000000002, "loss": 7.7887, "mean_token_accuracy": 0.08848774060606956, "num_tokens": 773728.0, "step": 395 }, { "entropy": 8.168435096740723, "epoch": 0.0399860048982856, "grad_norm": 1.03125, "learning_rate": 0.00019950000000000002, "loss": 7.822, "mean_token_accuracy": 0.08284367993474007, "num_tokens": 784839.0, "step": 400 }, { "entropy": 7.93064603805542, "epoch": 0.04048582995951417, "grad_norm": 1.2890625, "learning_rate": 0.000202, "loss": 7.7929, "mean_token_accuracy": 0.09478651136159896, "num_tokens": 794514.0, "step": 405 }, { "entropy": 8.11144437789917, "epoch": 0.04098565502074274, "grad_norm": 1.109375, "learning_rate": 0.00020449999999999998, "loss": 7.7581, "mean_token_accuracy": 0.09314420819282532, "num_tokens": 805254.0, "step": 410 }, { "entropy": 7.990531015396118, "epoch": 0.04148548008197131, "grad_norm": 1.1640625, "learning_rate": 0.000207, "loss": 7.6794, "mean_token_accuracy": 0.10085502117872239, "num_tokens": 814135.0, "step": 415 }, { "entropy": 7.9582349300384525, "epoch": 0.04198530514319988, "grad_norm": 1.15625, "learning_rate": 0.0002095, "loss": 7.7453, "mean_token_accuracy": 0.0957567848265171, "num_tokens": 823531.0, "step": 420 }, { "entropy": 7.954767322540283, "epoch": 0.04248513020442845, "grad_norm": 1.234375, "learning_rate": 0.000212, "loss": 7.6464, "mean_token_accuracy": 0.10113119706511497, "num_tokens": 832833.0, "step": 425 }, { "entropy": 7.997408628463745, "epoch": 0.04298495526565702, "grad_norm": 1.2421875, "learning_rate": 0.0002145, "loss": 7.6441, "mean_token_accuracy": 0.09947716444730759, "num_tokens": 841541.0, "step": 430 }, { "entropy": 7.836303043365478, "epoch": 0.04348478032688559, "grad_norm": 1.25, "learning_rate": 0.00021700000000000002, "loss": 7.6644, "mean_token_accuracy": 0.09943394884467124, "num_tokens": 850689.0, "step": 435 }, { "entropy": 7.932573461532593, "epoch": 0.04398460538811416, "grad_norm": 1.03125, "learning_rate": 0.0002195, "loss": 7.624, "mean_token_accuracy": 0.10144704058766366, "num_tokens": 860573.0, "step": 440 }, { "entropy": 8.005117082595826, "epoch": 0.04448443044934273, "grad_norm": 1.25, "learning_rate": 0.000222, "loss": 7.7274, "mean_token_accuracy": 0.090135994926095, "num_tokens": 869784.0, "step": 445 }, { "entropy": 8.012764692306519, "epoch": 0.0449842555105713, "grad_norm": 1.1328125, "learning_rate": 0.0002245, "loss": 7.6871, "mean_token_accuracy": 0.09482940882444382, "num_tokens": 878716.0, "step": 450 }, { "entropy": 7.914750099182129, "epoch": 0.04548408057179987, "grad_norm": 1.171875, "learning_rate": 0.00022700000000000002, "loss": 7.7939, "mean_token_accuracy": 0.09040690958499908, "num_tokens": 888334.0, "step": 455 }, { "entropy": 8.02715539932251, "epoch": 0.04598390563302844, "grad_norm": 1.3359375, "learning_rate": 0.00022950000000000002, "loss": 7.684, "mean_token_accuracy": 0.09270390123128891, "num_tokens": 897701.0, "step": 460 }, { "entropy": 7.970236349105835, "epoch": 0.04648373069425701, "grad_norm": 1.2109375, "learning_rate": 0.00023200000000000003, "loss": 7.6925, "mean_token_accuracy": 0.09443332329392433, "num_tokens": 907278.0, "step": 465 }, { "entropy": 7.925041341781617, "epoch": 0.04698355575548558, "grad_norm": 1.1875, "learning_rate": 0.00023449999999999998, "loss": 7.7006, "mean_token_accuracy": 0.09271714985370635, "num_tokens": 916194.0, "step": 470 }, { "entropy": 7.967321968078613, "epoch": 0.04748338081671415, "grad_norm": 1.2421875, "learning_rate": 0.000237, "loss": 7.7231, "mean_token_accuracy": 0.09261031746864319, "num_tokens": 926743.0, "step": 475 }, { "entropy": 8.015508699417115, "epoch": 0.04798320587794272, "grad_norm": 1.171875, "learning_rate": 0.0002395, "loss": 7.7504, "mean_token_accuracy": 0.08958175107836723, "num_tokens": 936059.0, "step": 480 }, { "entropy": 7.923208951950073, "epoch": 0.04848303093917129, "grad_norm": 1.265625, "learning_rate": 0.000242, "loss": 7.6733, "mean_token_accuracy": 0.09590794965624809, "num_tokens": 945990.0, "step": 485 }, { "entropy": 8.079939603805542, "epoch": 0.04898285600039986, "grad_norm": 1.375, "learning_rate": 0.0002445, "loss": 7.7223, "mean_token_accuracy": 0.10266662836074829, "num_tokens": 956626.0, "step": 490 }, { "entropy": 7.87365756034851, "epoch": 0.04948268106162843, "grad_norm": 1.1640625, "learning_rate": 0.000247, "loss": 7.7187, "mean_token_accuracy": 0.09226388484239578, "num_tokens": 966200.0, "step": 495 }, { "entropy": 7.9425849437713625, "epoch": 0.049982506122857, "grad_norm": 1.140625, "learning_rate": 0.0002495, "loss": 7.662, "mean_token_accuracy": 0.09558572769165039, "num_tokens": 975651.0, "step": 500 }, { "entropy": 7.913667392730713, "epoch": 0.05048233118408557, "grad_norm": 1.2109375, "learning_rate": 0.000252, "loss": 7.6696, "mean_token_accuracy": 0.0961525209248066, "num_tokens": 985264.0, "step": 505 }, { "entropy": 7.940064716339111, "epoch": 0.05098215624531414, "grad_norm": 1.2265625, "learning_rate": 0.0002545, "loss": 7.65, "mean_token_accuracy": 0.09761169999837875, "num_tokens": 996723.0, "step": 510 }, { "entropy": 7.919295358657837, "epoch": 0.05148198130654271, "grad_norm": 1.1953125, "learning_rate": 0.000257, "loss": 7.6735, "mean_token_accuracy": 0.09729609489440919, "num_tokens": 1006098.0, "step": 515 }, { "entropy": 8.019027423858642, "epoch": 0.05198180636777128, "grad_norm": 1.1484375, "learning_rate": 0.0002595, "loss": 7.719, "mean_token_accuracy": 0.09270480126142502, "num_tokens": 1016595.0, "step": 520 }, { "entropy": 7.7847301959991455, "epoch": 0.05248163142899985, "grad_norm": 1.265625, "learning_rate": 0.000262, "loss": 7.5765, "mean_token_accuracy": 0.10053420215845107, "num_tokens": 1026281.0, "step": 525 }, { "entropy": 7.8970424175262455, "epoch": 0.052981456490228424, "grad_norm": 0.98828125, "learning_rate": 0.00026450000000000003, "loss": 7.6903, "mean_token_accuracy": 0.10703469291329384, "num_tokens": 1036697.0, "step": 530 }, { "entropy": 7.789024686813354, "epoch": 0.05348128155145699, "grad_norm": 1.1640625, "learning_rate": 0.00026700000000000004, "loss": 7.6547, "mean_token_accuracy": 0.09684248864650727, "num_tokens": 1047433.0, "step": 535 }, { "entropy": 7.969110536575317, "epoch": 0.05398110661268556, "grad_norm": 1.109375, "learning_rate": 0.00026950000000000005, "loss": 7.6915, "mean_token_accuracy": 0.09020176380872727, "num_tokens": 1056774.0, "step": 540 }, { "entropy": 7.943284511566162, "epoch": 0.05448093167391413, "grad_norm": 1.109375, "learning_rate": 0.00027200000000000005, "loss": 7.5707, "mean_token_accuracy": 0.10046748295426369, "num_tokens": 1068056.0, "step": 545 }, { "entropy": 7.795782899856567, "epoch": 0.0549807567351427, "grad_norm": 1.2109375, "learning_rate": 0.0002745, "loss": 7.6036, "mean_token_accuracy": 0.10044094324111938, "num_tokens": 1077698.0, "step": 550 }, { "entropy": 7.8286316871643065, "epoch": 0.05548058179637127, "grad_norm": 1.3828125, "learning_rate": 0.000277, "loss": 7.5719, "mean_token_accuracy": 0.09958620220422745, "num_tokens": 1086485.0, "step": 555 }, { "entropy": 7.919136619567871, "epoch": 0.05598040685759984, "grad_norm": 1.21875, "learning_rate": 0.0002795, "loss": 7.6477, "mean_token_accuracy": 0.0894574172794819, "num_tokens": 1097329.0, "step": 560 }, { "entropy": 7.742609977722168, "epoch": 0.05648023191882841, "grad_norm": 1.0078125, "learning_rate": 0.00028199999999999997, "loss": 7.6188, "mean_token_accuracy": 0.09743130803108216, "num_tokens": 1107990.0, "step": 565 }, { "entropy": 7.8571289539337155, "epoch": 0.05698005698005698, "grad_norm": 1.2578125, "learning_rate": 0.0002845, "loss": 7.5419, "mean_token_accuracy": 0.10700362995266914, "num_tokens": 1117798.0, "step": 570 }, { "entropy": 7.760644626617432, "epoch": 0.05747988204128555, "grad_norm": 1.109375, "learning_rate": 0.000287, "loss": 7.6946, "mean_token_accuracy": 0.09315006881952285, "num_tokens": 1126976.0, "step": 575 }, { "entropy": 7.9075384616851805, "epoch": 0.05797970710251412, "grad_norm": 1.2890625, "learning_rate": 0.0002895, "loss": 7.6043, "mean_token_accuracy": 0.10048359259963036, "num_tokens": 1136410.0, "step": 580 }, { "entropy": 7.852177858352661, "epoch": 0.05847953216374269, "grad_norm": 1.2265625, "learning_rate": 0.000292, "loss": 7.6589, "mean_token_accuracy": 0.09688285812735557, "num_tokens": 1147162.0, "step": 585 }, { "entropy": 7.778061771392823, "epoch": 0.05897935722497126, "grad_norm": 1.2265625, "learning_rate": 0.0002945, "loss": 7.5948, "mean_token_accuracy": 0.09637040942907334, "num_tokens": 1157578.0, "step": 590 }, { "entropy": 7.852608489990234, "epoch": 0.05947918228619983, "grad_norm": 1.265625, "learning_rate": 0.000297, "loss": 7.5039, "mean_token_accuracy": 0.10554338097572327, "num_tokens": 1166914.0, "step": 595 }, { "entropy": 7.852068567276001, "epoch": 0.0599790073474284, "grad_norm": 1.265625, "learning_rate": 0.0002995, "loss": 7.6895, "mean_token_accuracy": 0.08630285412073135, "num_tokens": 1176740.0, "step": 600 }, { "entropy": 7.816021823883057, "epoch": 0.06047883240865697, "grad_norm": 1.3828125, "learning_rate": 0.000302, "loss": 7.5753, "mean_token_accuracy": 0.09594688341021537, "num_tokens": 1185497.0, "step": 605 }, { "entropy": 7.933215665817261, "epoch": 0.06097865746988554, "grad_norm": 1.1953125, "learning_rate": 0.0003045, "loss": 7.6755, "mean_token_accuracy": 0.09170238226652146, "num_tokens": 1197390.0, "step": 610 }, { "entropy": 7.677834701538086, "epoch": 0.06147848253111411, "grad_norm": 1.0625, "learning_rate": 0.000307, "loss": 7.5827, "mean_token_accuracy": 0.09688961803913117, "num_tokens": 1208293.0, "step": 615 }, { "entropy": 7.839175367355347, "epoch": 0.06197830759234268, "grad_norm": 1.3046875, "learning_rate": 0.0003095, "loss": 7.5679, "mean_token_accuracy": 0.09913268983364106, "num_tokens": 1217860.0, "step": 620 }, { "entropy": 7.758148860931397, "epoch": 0.06247813265357125, "grad_norm": 1.25, "learning_rate": 0.000312, "loss": 7.5767, "mean_token_accuracy": 0.09510255008935928, "num_tokens": 1227259.0, "step": 625 }, { "entropy": 7.715111303329468, "epoch": 0.06297795771479982, "grad_norm": 1.359375, "learning_rate": 0.0003145, "loss": 7.466, "mean_token_accuracy": 0.10256180614233017, "num_tokens": 1236775.0, "step": 630 }, { "entropy": 7.763536643981934, "epoch": 0.06347778277602839, "grad_norm": 1.2421875, "learning_rate": 0.000317, "loss": 7.6092, "mean_token_accuracy": 0.09816056564450264, "num_tokens": 1246307.0, "step": 635 }, { "entropy": 7.900314426422119, "epoch": 0.06397760783725696, "grad_norm": 1.3359375, "learning_rate": 0.0003195, "loss": 7.5545, "mean_token_accuracy": 0.09914906919002534, "num_tokens": 1255197.0, "step": 640 }, { "entropy": 7.679573202133179, "epoch": 0.06447743289848552, "grad_norm": 1.1328125, "learning_rate": 0.000322, "loss": 7.5638, "mean_token_accuracy": 0.10264531224966049, "num_tokens": 1265056.0, "step": 645 }, { "entropy": 7.778749275207519, "epoch": 0.0649772579597141, "grad_norm": 1.1171875, "learning_rate": 0.00032450000000000003, "loss": 7.5018, "mean_token_accuracy": 0.09979739040136337, "num_tokens": 1274718.0, "step": 650 }, { "entropy": 7.823064184188842, "epoch": 0.06547708302094267, "grad_norm": 1.3046875, "learning_rate": 0.00032700000000000003, "loss": 7.6216, "mean_token_accuracy": 0.09702884927392005, "num_tokens": 1284364.0, "step": 655 }, { "entropy": 7.74606237411499, "epoch": 0.06597690808217124, "grad_norm": 1.265625, "learning_rate": 0.00032950000000000004, "loss": 7.5995, "mean_token_accuracy": 0.09949352443218232, "num_tokens": 1294186.0, "step": 660 }, { "entropy": 7.743727207183838, "epoch": 0.06647673314339982, "grad_norm": 1.2265625, "learning_rate": 0.00033200000000000005, "loss": 7.5094, "mean_token_accuracy": 0.10350405499339103, "num_tokens": 1303393.0, "step": 665 }, { "entropy": 7.670324659347534, "epoch": 0.06697655820462838, "grad_norm": 1.6171875, "learning_rate": 0.00033450000000000005, "loss": 7.5125, "mean_token_accuracy": 0.09411343447864055, "num_tokens": 1312819.0, "step": 670 }, { "entropy": 7.773294258117676, "epoch": 0.06747638326585695, "grad_norm": 1.1328125, "learning_rate": 0.000337, "loss": 7.5869, "mean_token_accuracy": 0.09254579842090607, "num_tokens": 1323001.0, "step": 675 }, { "entropy": 7.692234659194947, "epoch": 0.06797620832708552, "grad_norm": 1.2421875, "learning_rate": 0.0003395, "loss": 7.5356, "mean_token_accuracy": 0.09674872979521751, "num_tokens": 1333260.0, "step": 680 }, { "entropy": 7.714693260192871, "epoch": 0.0684760333883141, "grad_norm": 1.171875, "learning_rate": 0.000342, "loss": 7.5253, "mean_token_accuracy": 0.1035267636179924, "num_tokens": 1342696.0, "step": 685 }, { "entropy": 7.71041955947876, "epoch": 0.06897585844954265, "grad_norm": 1.171875, "learning_rate": 0.00034449999999999997, "loss": 7.5005, "mean_token_accuracy": 0.1020401656627655, "num_tokens": 1353104.0, "step": 690 }, { "entropy": 7.7471325397491455, "epoch": 0.06947568351077123, "grad_norm": 1.1796875, "learning_rate": 0.000347, "loss": 7.5799, "mean_token_accuracy": 0.09462966471910476, "num_tokens": 1362871.0, "step": 695 }, { "entropy": 7.774437189102173, "epoch": 0.0699755085719998, "grad_norm": 1.046875, "learning_rate": 0.0003495, "loss": 7.5494, "mean_token_accuracy": 0.09824139177799225, "num_tokens": 1373622.0, "step": 700 }, { "entropy": 7.5870044231414795, "epoch": 0.07047533363322837, "grad_norm": 1.2265625, "learning_rate": 0.000352, "loss": 7.4243, "mean_token_accuracy": 0.10344729945063591, "num_tokens": 1382707.0, "step": 705 }, { "entropy": 7.7422362804412845, "epoch": 0.07097515869445695, "grad_norm": 1.2734375, "learning_rate": 0.0003545, "loss": 7.5181, "mean_token_accuracy": 0.09872173815965653, "num_tokens": 1392048.0, "step": 710 }, { "entropy": 7.511621618270874, "epoch": 0.0714749837556855, "grad_norm": 1.2421875, "learning_rate": 0.000357, "loss": 7.3933, "mean_token_accuracy": 0.10354112610220909, "num_tokens": 1401387.0, "step": 715 }, { "entropy": 7.69247579574585, "epoch": 0.07197480881691408, "grad_norm": 1.0078125, "learning_rate": 0.0003595, "loss": 7.4989, "mean_token_accuracy": 0.09920497015118598, "num_tokens": 1411404.0, "step": 720 }, { "entropy": 7.644815969467163, "epoch": 0.07247463387814265, "grad_norm": 1.1328125, "learning_rate": 0.000362, "loss": 7.5194, "mean_token_accuracy": 0.09978774040937424, "num_tokens": 1420292.0, "step": 725 }, { "entropy": 7.674730587005615, "epoch": 0.07297445893937123, "grad_norm": 1.0390625, "learning_rate": 0.0003645, "loss": 7.4475, "mean_token_accuracy": 0.10385879799723625, "num_tokens": 1429990.0, "step": 730 }, { "entropy": 7.65957236289978, "epoch": 0.07347428400059978, "grad_norm": 1.234375, "learning_rate": 0.000367, "loss": 7.4864, "mean_token_accuracy": 0.09656506404280663, "num_tokens": 1440148.0, "step": 735 }, { "entropy": 7.612310075759888, "epoch": 0.07397410906182836, "grad_norm": 1.375, "learning_rate": 0.0003695, "loss": 7.4143, "mean_token_accuracy": 0.09919942021369935, "num_tokens": 1450015.0, "step": 740 }, { "entropy": 7.595290803909302, "epoch": 0.07447393412305693, "grad_norm": 1.1875, "learning_rate": 0.000372, "loss": 7.4663, "mean_token_accuracy": 0.09626267701387406, "num_tokens": 1459582.0, "step": 745 }, { "entropy": 7.677187204360962, "epoch": 0.0749737591842855, "grad_norm": 1.125, "learning_rate": 0.0003745, "loss": 7.5235, "mean_token_accuracy": 0.09861956685781478, "num_tokens": 1468151.0, "step": 750 }, { "entropy": 7.5536364078521725, "epoch": 0.07547358424551406, "grad_norm": 1.0625, "learning_rate": 0.000377, "loss": 7.4131, "mean_token_accuracy": 0.10350600630044937, "num_tokens": 1479099.0, "step": 755 }, { "entropy": 7.644258260726929, "epoch": 0.07597340930674264, "grad_norm": 1.125, "learning_rate": 0.0003795, "loss": 7.5166, "mean_token_accuracy": 0.10102088227868081, "num_tokens": 1488060.0, "step": 760 }, { "entropy": 7.6076555252075195, "epoch": 0.07647323436797121, "grad_norm": 1.0234375, "learning_rate": 0.000382, "loss": 7.5237, "mean_token_accuracy": 0.09237042292952538, "num_tokens": 1498230.0, "step": 765 }, { "entropy": 7.625078392028809, "epoch": 0.07697305942919978, "grad_norm": 1.1484375, "learning_rate": 0.0003845, "loss": 7.4769, "mean_token_accuracy": 0.10016548410058021, "num_tokens": 1507962.0, "step": 770 }, { "entropy": 7.708804130554199, "epoch": 0.07747288449042836, "grad_norm": 1.1875, "learning_rate": 0.00038700000000000003, "loss": 7.5617, "mean_token_accuracy": 0.09648449942469597, "num_tokens": 1518607.0, "step": 775 }, { "entropy": 7.697318172454834, "epoch": 0.07797270955165692, "grad_norm": 1.203125, "learning_rate": 0.00038950000000000003, "loss": 7.4201, "mean_token_accuracy": 0.09753957316279412, "num_tokens": 1527166.0, "step": 780 }, { "entropy": 7.599863815307617, "epoch": 0.07847253461288549, "grad_norm": 1.1796875, "learning_rate": 0.00039200000000000004, "loss": 7.5271, "mean_token_accuracy": 0.09614471271634102, "num_tokens": 1536683.0, "step": 785 }, { "entropy": 7.574948406219482, "epoch": 0.07897235967411406, "grad_norm": 1.0546875, "learning_rate": 0.00039450000000000005, "loss": 7.4201, "mean_token_accuracy": 0.09909558668732643, "num_tokens": 1546243.0, "step": 790 }, { "entropy": 7.641019535064697, "epoch": 0.07947218473534264, "grad_norm": 1.1875, "learning_rate": 0.00039700000000000005, "loss": 7.435, "mean_token_accuracy": 0.09994245618581772, "num_tokens": 1555916.0, "step": 795 }, { "entropy": 7.438870811462403, "epoch": 0.0799720097965712, "grad_norm": 1.015625, "learning_rate": 0.0003995, "loss": 7.369, "mean_token_accuracy": 0.10524533912539483, "num_tokens": 1566617.0, "step": 800 }, { "entropy": 7.572072315216064, "epoch": 0.08047183485779977, "grad_norm": 1.1796875, "learning_rate": 0.000402, "loss": 7.4247, "mean_token_accuracy": 0.09702792316675186, "num_tokens": 1575413.0, "step": 805 }, { "entropy": 7.568275737762451, "epoch": 0.08097165991902834, "grad_norm": 1.3671875, "learning_rate": 0.0004045, "loss": 7.4234, "mean_token_accuracy": 0.09980287402868271, "num_tokens": 1586863.0, "step": 810 }, { "entropy": 7.546803331375122, "epoch": 0.08147148498025691, "grad_norm": 1.109375, "learning_rate": 0.00040699999999999997, "loss": 7.5189, "mean_token_accuracy": 0.10001372396945954, "num_tokens": 1597685.0, "step": 815 }, { "entropy": 7.595981025695801, "epoch": 0.08197131004148547, "grad_norm": 1.1640625, "learning_rate": 0.0004095, "loss": 7.3956, "mean_token_accuracy": 0.10019611120223999, "num_tokens": 1607103.0, "step": 820 }, { "entropy": 7.573238372802734, "epoch": 0.08247113510271405, "grad_norm": 1.078125, "learning_rate": 0.000412, "loss": 7.4421, "mean_token_accuracy": 0.10041169673204423, "num_tokens": 1617919.0, "step": 825 }, { "entropy": 7.571632623672485, "epoch": 0.08297096016394262, "grad_norm": 0.98828125, "learning_rate": 0.0004145, "loss": 7.4844, "mean_token_accuracy": 0.09938613995909691, "num_tokens": 1627293.0, "step": 830 }, { "entropy": 7.595695161819458, "epoch": 0.08347078522517119, "grad_norm": 1.0078125, "learning_rate": 0.000417, "loss": 7.5219, "mean_token_accuracy": 0.0978666827082634, "num_tokens": 1638440.0, "step": 835 }, { "entropy": 7.5352317810058596, "epoch": 0.08397061028639977, "grad_norm": 0.99609375, "learning_rate": 0.0004195, "loss": 7.4249, "mean_token_accuracy": 0.10109311267733574, "num_tokens": 1648148.0, "step": 840 }, { "entropy": 7.512708568572998, "epoch": 0.08447043534762833, "grad_norm": 1.21875, "learning_rate": 0.000422, "loss": 7.4451, "mean_token_accuracy": 0.10042148157954216, "num_tokens": 1658334.0, "step": 845 }, { "entropy": 7.617625761032104, "epoch": 0.0849702604088569, "grad_norm": 1.328125, "learning_rate": 0.0004245, "loss": 7.4846, "mean_token_accuracy": 0.09633303582668304, "num_tokens": 1667963.0, "step": 850 }, { "entropy": 7.4715556621551515, "epoch": 0.08547008547008547, "grad_norm": 1.1328125, "learning_rate": 0.000427, "loss": 7.3979, "mean_token_accuracy": 0.10262207016348839, "num_tokens": 1677270.0, "step": 855 }, { "entropy": 7.523194360733032, "epoch": 0.08596991053131404, "grad_norm": 1.0625, "learning_rate": 0.0004295, "loss": 7.3859, "mean_token_accuracy": 0.10481420755386353, "num_tokens": 1686770.0, "step": 860 }, { "entropy": 7.529279613494873, "epoch": 0.0864697355925426, "grad_norm": 1.03125, "learning_rate": 0.000432, "loss": 7.4609, "mean_token_accuracy": 0.09573153108358383, "num_tokens": 1697507.0, "step": 865 }, { "entropy": 7.387008571624756, "epoch": 0.08696956065377118, "grad_norm": 1.0859375, "learning_rate": 0.0004345, "loss": 7.3945, "mean_token_accuracy": 0.10062696561217307, "num_tokens": 1708253.0, "step": 870 }, { "entropy": 7.612355899810791, "epoch": 0.08746938571499975, "grad_norm": 1.1328125, "learning_rate": 0.000437, "loss": 7.4601, "mean_token_accuracy": 0.09850295558571816, "num_tokens": 1717827.0, "step": 875 }, { "entropy": 7.336903047561646, "epoch": 0.08796921077622832, "grad_norm": 1.1484375, "learning_rate": 0.0004395, "loss": 7.2649, "mean_token_accuracy": 0.11100565418601036, "num_tokens": 1726678.0, "step": 880 }, { "entropy": 7.556534910202027, "epoch": 0.0884690358374569, "grad_norm": 1.015625, "learning_rate": 0.000442, "loss": 7.3976, "mean_token_accuracy": 0.09947276636958122, "num_tokens": 1737518.0, "step": 885 }, { "entropy": 7.438637018203735, "epoch": 0.08896886089868546, "grad_norm": 1.265625, "learning_rate": 0.0004445, "loss": 7.2915, "mean_token_accuracy": 0.10892865434288979, "num_tokens": 1746338.0, "step": 890 }, { "entropy": 7.425498580932617, "epoch": 0.08946868595991403, "grad_norm": 1.0546875, "learning_rate": 0.000447, "loss": 7.3736, "mean_token_accuracy": 0.10575593486428261, "num_tokens": 1756538.0, "step": 895 }, { "entropy": 7.557357740402222, "epoch": 0.0899685110211426, "grad_norm": 1.03125, "learning_rate": 0.00044950000000000003, "loss": 7.4052, "mean_token_accuracy": 0.10165804401040077, "num_tokens": 1766722.0, "step": 900 }, { "entropy": 7.337777996063233, "epoch": 0.09046833608237118, "grad_norm": 1.09375, "learning_rate": 0.00045200000000000004, "loss": 7.3223, "mean_token_accuracy": 0.10339211374521255, "num_tokens": 1777039.0, "step": 905 }, { "entropy": 7.548654174804687, "epoch": 0.09096816114359974, "grad_norm": 0.91796875, "learning_rate": 0.00045450000000000004, "loss": 7.4393, "mean_token_accuracy": 0.09877310320734978, "num_tokens": 1787621.0, "step": 910 }, { "entropy": 7.429612350463867, "epoch": 0.09146798620482831, "grad_norm": 1.28125, "learning_rate": 0.00045700000000000005, "loss": 7.4313, "mean_token_accuracy": 0.10118876844644546, "num_tokens": 1798345.0, "step": 915 }, { "entropy": 7.510519886016846, "epoch": 0.09196781126605688, "grad_norm": 1.0625, "learning_rate": 0.00045950000000000006, "loss": 7.4015, "mean_token_accuracy": 0.10110852941870689, "num_tokens": 1807994.0, "step": 920 }, { "entropy": 7.367496538162231, "epoch": 0.09246763632728545, "grad_norm": 1.140625, "learning_rate": 0.000462, "loss": 7.3139, "mean_token_accuracy": 0.09367315769195557, "num_tokens": 1817965.0, "step": 925 }, { "entropy": 7.464560461044312, "epoch": 0.09296746138851401, "grad_norm": 1.171875, "learning_rate": 0.0004645, "loss": 7.3635, "mean_token_accuracy": 0.10010309666395187, "num_tokens": 1827094.0, "step": 930 }, { "entropy": 7.467557430267334, "epoch": 0.09346728644974259, "grad_norm": 1.125, "learning_rate": 0.000467, "loss": 7.3466, "mean_token_accuracy": 0.10039986148476601, "num_tokens": 1837754.0, "step": 935 }, { "entropy": 7.335368013381958, "epoch": 0.09396711151097116, "grad_norm": 1.0703125, "learning_rate": 0.0004695, "loss": 7.3533, "mean_token_accuracy": 0.10200253203511238, "num_tokens": 1847500.0, "step": 940 }, { "entropy": 7.444225072860718, "epoch": 0.09446693657219973, "grad_norm": 1.0546875, "learning_rate": 0.000472, "loss": 7.4125, "mean_token_accuracy": 0.0964927189052105, "num_tokens": 1857663.0, "step": 945 }, { "entropy": 7.509044599533081, "epoch": 0.0949667616334283, "grad_norm": 1.09375, "learning_rate": 0.0004745, "loss": 7.4629, "mean_token_accuracy": 0.09966767057776452, "num_tokens": 1867752.0, "step": 950 }, { "entropy": 7.410632658004761, "epoch": 0.09546658669465687, "grad_norm": 1.09375, "learning_rate": 0.000477, "loss": 7.3962, "mean_token_accuracy": 0.09652933329343796, "num_tokens": 1877479.0, "step": 955 }, { "entropy": 7.43900876045227, "epoch": 0.09596641175588544, "grad_norm": 1.0234375, "learning_rate": 0.0004795, "loss": 7.4226, "mean_token_accuracy": 0.09707022532820701, "num_tokens": 1887944.0, "step": 960 }, { "entropy": 7.46921329498291, "epoch": 0.09646623681711401, "grad_norm": 1.1796875, "learning_rate": 0.000482, "loss": 7.3202, "mean_token_accuracy": 0.1051582269370556, "num_tokens": 1896991.0, "step": 965 }, { "entropy": 7.35594482421875, "epoch": 0.09696606187834259, "grad_norm": 1.921875, "learning_rate": 0.0004845, "loss": 7.3518, "mean_token_accuracy": 0.10959891974925995, "num_tokens": 1907216.0, "step": 970 }, { "entropy": 7.475865411758423, "epoch": 0.09746588693957114, "grad_norm": 1.2109375, "learning_rate": 0.000487, "loss": 7.3681, "mean_token_accuracy": 0.09844867512583733, "num_tokens": 1917206.0, "step": 975 }, { "entropy": 7.342016315460205, "epoch": 0.09796571200079972, "grad_norm": 1.0078125, "learning_rate": 0.0004895, "loss": 7.4607, "mean_token_accuracy": 0.09241715744137764, "num_tokens": 1929669.0, "step": 980 }, { "entropy": 7.476624441146851, "epoch": 0.09846553706202829, "grad_norm": 1.0859375, "learning_rate": 0.000492, "loss": 7.3029, "mean_token_accuracy": 0.10470175147056579, "num_tokens": 1939881.0, "step": 985 }, { "entropy": 7.328264808654785, "epoch": 0.09896536212325686, "grad_norm": 1.234375, "learning_rate": 0.0004945, "loss": 7.346, "mean_token_accuracy": 0.10308508202433586, "num_tokens": 1949423.0, "step": 990 }, { "entropy": 7.44049825668335, "epoch": 0.09946518718448542, "grad_norm": 1.0546875, "learning_rate": 0.000497, "loss": 7.3721, "mean_token_accuracy": 0.10048017129302025, "num_tokens": 1959214.0, "step": 995 }, { "entropy": 7.437930011749268, "epoch": 0.099965012245714, "grad_norm": 1.1171875, "learning_rate": 0.0004995, "loss": 7.3243, "mean_token_accuracy": 0.09923652932047844, "num_tokens": 1968963.0, "step": 1000 }, { "entropy": 7.347122669219971, "epoch": 0.10046483730694257, "grad_norm": 1.0859375, "learning_rate": 0.0004999999981884985, "loss": 7.3358, "mean_token_accuracy": 0.10006266087293625, "num_tokens": 1979551.0, "step": 1005 }, { "entropy": 7.342271709442139, "epoch": 0.10096466236817114, "grad_norm": 1.34375, "learning_rate": 0.0004999999908292739, "loss": 7.2707, "mean_token_accuracy": 0.10789052844047546, "num_tokens": 1988432.0, "step": 1010 }, { "entropy": 7.405298137664795, "epoch": 0.10146448742939972, "grad_norm": 1.1796875, "learning_rate": 0.0004999999778091072, "loss": 7.3429, "mean_token_accuracy": 0.10290407985448838, "num_tokens": 1997509.0, "step": 1015 }, { "entropy": 7.448093605041504, "epoch": 0.10196431249062828, "grad_norm": 1.140625, "learning_rate": 0.0004999999591279991, "loss": 7.5284, "mean_token_accuracy": 0.09559334665536881, "num_tokens": 2007406.0, "step": 1020 }, { "entropy": 7.455267906188965, "epoch": 0.10246413755185685, "grad_norm": 1.125, "learning_rate": 0.00049999993478595, "loss": 7.3217, "mean_token_accuracy": 0.09977051839232445, "num_tokens": 2016760.0, "step": 1025 }, { "entropy": 7.275325965881348, "epoch": 0.10296396261308542, "grad_norm": 1.0625, "learning_rate": 0.0004999999047829604, "loss": 7.3609, "mean_token_accuracy": 0.10224623009562492, "num_tokens": 2027776.0, "step": 1030 }, { "entropy": 7.378179454803467, "epoch": 0.103463787674314, "grad_norm": 1.078125, "learning_rate": 0.000499999869119031, "loss": 7.3113, "mean_token_accuracy": 0.10338322818279266, "num_tokens": 2036955.0, "step": 1035 }, { "entropy": 7.345253419876099, "epoch": 0.10396361273554255, "grad_norm": 1.15625, "learning_rate": 0.0004999998277941629, "loss": 7.2195, "mean_token_accuracy": 0.10754978880286217, "num_tokens": 2046118.0, "step": 1040 }, { "entropy": 7.256439685821533, "epoch": 0.10446343779677113, "grad_norm": 1.171875, "learning_rate": 0.0004999997808083569, "loss": 7.282, "mean_token_accuracy": 0.10003011375665664, "num_tokens": 2056266.0, "step": 1045 }, { "entropy": 7.421114683151245, "epoch": 0.1049632628579997, "grad_norm": 0.96484375, "learning_rate": 0.0004999997281616144, "loss": 7.3354, "mean_token_accuracy": 0.10521339923143387, "num_tokens": 2067416.0, "step": 1050 }, { "entropy": 7.324567222595215, "epoch": 0.10546308791922827, "grad_norm": 1.0390625, "learning_rate": 0.0004999996698539366, "loss": 7.33, "mean_token_accuracy": 0.10143450647592545, "num_tokens": 2076926.0, "step": 1055 }, { "entropy": 7.306933975219726, "epoch": 0.10596291298045685, "grad_norm": 1.03125, "learning_rate": 0.000499999605885325, "loss": 7.3169, "mean_token_accuracy": 0.10499019995331764, "num_tokens": 2088017.0, "step": 1060 }, { "entropy": 7.321994495391846, "epoch": 0.1064627380416854, "grad_norm": 1.203125, "learning_rate": 0.0004999995362557813, "loss": 7.3576, "mean_token_accuracy": 0.10440385192632676, "num_tokens": 2097249.0, "step": 1065 }, { "entropy": 7.292541551589966, "epoch": 0.10696256310291398, "grad_norm": 1.1953125, "learning_rate": 0.000499999460965307, "loss": 7.3116, "mean_token_accuracy": 0.09968645870685577, "num_tokens": 2105778.0, "step": 1070 }, { "entropy": 7.35160641670227, "epoch": 0.10746238816414255, "grad_norm": 1.0625, "learning_rate": 0.0004999993800139043, "loss": 7.3278, "mean_token_accuracy": 0.10377108082175254, "num_tokens": 2114710.0, "step": 1075 }, { "entropy": 7.34290714263916, "epoch": 0.10796221322537113, "grad_norm": 1.0546875, "learning_rate": 0.0004999992934015752, "loss": 7.2596, "mean_token_accuracy": 0.10727637037634849, "num_tokens": 2124002.0, "step": 1080 }, { "entropy": 7.377143383026123, "epoch": 0.10846203828659969, "grad_norm": 1.1484375, "learning_rate": 0.0004999992011283215, "loss": 7.3426, "mean_token_accuracy": 0.103351741284132, "num_tokens": 2134592.0, "step": 1085 }, { "entropy": 7.273125696182251, "epoch": 0.10896186334782826, "grad_norm": 1.125, "learning_rate": 0.0004999991031941459, "loss": 7.1919, "mean_token_accuracy": 0.1127089373767376, "num_tokens": 2143641.0, "step": 1090 }, { "entropy": 7.344776439666748, "epoch": 0.10946168840905683, "grad_norm": 1.3359375, "learning_rate": 0.0004999989995990509, "loss": 7.2986, "mean_token_accuracy": 0.10175277665257454, "num_tokens": 2154738.0, "step": 1095 }, { "entropy": 7.166865539550781, "epoch": 0.1099615134702854, "grad_norm": 1.09375, "learning_rate": 0.0004999988903430389, "loss": 7.2791, "mean_token_accuracy": 0.10936013385653495, "num_tokens": 2164365.0, "step": 1100 }, { "entropy": 7.3008204936981205, "epoch": 0.11046133853151396, "grad_norm": 1.15625, "learning_rate": 0.0004999987754261126, "loss": 7.1491, "mean_token_accuracy": 0.1082618147134781, "num_tokens": 2173185.0, "step": 1105 }, { "entropy": 7.216965007781982, "epoch": 0.11096116359274254, "grad_norm": 1.15625, "learning_rate": 0.0004999986548482751, "loss": 7.2612, "mean_token_accuracy": 0.10522031784057617, "num_tokens": 2184717.0, "step": 1110 }, { "entropy": 7.27905764579773, "epoch": 0.11146098865397111, "grad_norm": 1.046875, "learning_rate": 0.0004999985286095293, "loss": 7.2279, "mean_token_accuracy": 0.10826601237058639, "num_tokens": 2193681.0, "step": 1115 }, { "entropy": 7.277110385894775, "epoch": 0.11196081371519968, "grad_norm": 0.93359375, "learning_rate": 0.0004999983967098785, "loss": 7.2467, "mean_token_accuracy": 0.10190426334738731, "num_tokens": 2203366.0, "step": 1120 }, { "entropy": 7.271683073043823, "epoch": 0.11246063877642826, "grad_norm": 0.97265625, "learning_rate": 0.0004999982591493258, "loss": 7.2459, "mean_token_accuracy": 0.10593178719282151, "num_tokens": 2213982.0, "step": 1125 }, { "entropy": 7.318293666839599, "epoch": 0.11296046383765682, "grad_norm": 1.0078125, "learning_rate": 0.0004999981159278749, "loss": 7.3031, "mean_token_accuracy": 0.10162633955478668, "num_tokens": 2222897.0, "step": 1130 }, { "entropy": 7.238396883010864, "epoch": 0.11346028889888539, "grad_norm": 1.046875, "learning_rate": 0.0004999979670455292, "loss": 7.2558, "mean_token_accuracy": 0.11027894765138627, "num_tokens": 2232472.0, "step": 1135 }, { "entropy": 7.249378728866577, "epoch": 0.11396011396011396, "grad_norm": 1.7734375, "learning_rate": 0.0004999978125022926, "loss": 7.294, "mean_token_accuracy": 0.1087009809911251, "num_tokens": 2242666.0, "step": 1140 }, { "entropy": 7.319674825668335, "epoch": 0.11445993902134254, "grad_norm": 1.125, "learning_rate": 0.000499997652298169, "loss": 7.3479, "mean_token_accuracy": 0.09625119417905807, "num_tokens": 2254586.0, "step": 1145 }, { "entropy": 7.281134080886841, "epoch": 0.1149597640825711, "grad_norm": 1.125, "learning_rate": 0.0004999974864331624, "loss": 7.202, "mean_token_accuracy": 0.11020608842372895, "num_tokens": 2264619.0, "step": 1150 }, { "entropy": 7.388929986953736, "epoch": 0.11545958914379967, "grad_norm": 1.09375, "learning_rate": 0.0004999973149072768, "loss": 7.2859, "mean_token_accuracy": 0.09894285909831524, "num_tokens": 2274114.0, "step": 1155 }, { "entropy": 7.06968936920166, "epoch": 0.11595941420502824, "grad_norm": 1.03125, "learning_rate": 0.0004999971377205167, "loss": 7.1888, "mean_token_accuracy": 0.11129210293292999, "num_tokens": 2283887.0, "step": 1160 }, { "entropy": 7.307636737823486, "epoch": 0.11645923926625681, "grad_norm": 1.171875, "learning_rate": 0.0004999969548728864, "loss": 7.2059, "mean_token_accuracy": 0.11073495373129845, "num_tokens": 2293090.0, "step": 1165 }, { "entropy": 7.2551915645599365, "epoch": 0.11695906432748537, "grad_norm": 1.0703125, "learning_rate": 0.0004999967663643908, "loss": 7.3175, "mean_token_accuracy": 0.10531776547431945, "num_tokens": 2302828.0, "step": 1170 }, { "entropy": 7.2968638896942135, "epoch": 0.11745888938871395, "grad_norm": 1.0703125, "learning_rate": 0.0004999965721950345, "loss": 7.1898, "mean_token_accuracy": 0.10970171466469765, "num_tokens": 2311415.0, "step": 1175 }, { "entropy": 7.247892379760742, "epoch": 0.11795871444994252, "grad_norm": 1.0546875, "learning_rate": 0.0004999963723648222, "loss": 7.2905, "mean_token_accuracy": 0.1028762400150299, "num_tokens": 2321512.0, "step": 1180 }, { "entropy": 7.223724460601806, "epoch": 0.1184585395111711, "grad_norm": 1.046875, "learning_rate": 0.000499996166873759, "loss": 7.1816, "mean_token_accuracy": 0.10487090200185775, "num_tokens": 2331398.0, "step": 1185 }, { "entropy": 7.114894962310791, "epoch": 0.11895836457239967, "grad_norm": 1.0078125, "learning_rate": 0.0004999959557218502, "loss": 7.1949, "mean_token_accuracy": 0.10667292214930058, "num_tokens": 2341751.0, "step": 1190 }, { "entropy": 7.293861246109008, "epoch": 0.11945818963362823, "grad_norm": 1.1015625, "learning_rate": 0.0004999957389091012, "loss": 7.1852, "mean_token_accuracy": 0.10581460520625115, "num_tokens": 2352538.0, "step": 1195 }, { "entropy": 7.263128328323364, "epoch": 0.1199580146948568, "grad_norm": 1.015625, "learning_rate": 0.0004999955164355171, "loss": 7.2807, "mean_token_accuracy": 0.101702369004488, "num_tokens": 2362433.0, "step": 1200 }, { "entropy": 7.23228964805603, "epoch": 0.12045783975608537, "grad_norm": 1.1328125, "learning_rate": 0.0004999952883011038, "loss": 7.2357, "mean_token_accuracy": 0.10086923241615295, "num_tokens": 2372431.0, "step": 1205 }, { "entropy": 7.155064105987549, "epoch": 0.12095766481731395, "grad_norm": 1.046875, "learning_rate": 0.000499995054505867, "loss": 7.261, "mean_token_accuracy": 0.11123752519488335, "num_tokens": 2382483.0, "step": 1210 }, { "entropy": 7.333055305480957, "epoch": 0.1214574898785425, "grad_norm": 1.078125, "learning_rate": 0.0004999948150498124, "loss": 7.2314, "mean_token_accuracy": 0.09728648811578751, "num_tokens": 2392835.0, "step": 1215 }, { "entropy": 7.157829141616821, "epoch": 0.12195731493977108, "grad_norm": 1.1875, "learning_rate": 0.0004999945699329462, "loss": 7.2069, "mean_token_accuracy": 0.10083935856819153, "num_tokens": 2402305.0, "step": 1220 }, { "entropy": 7.154402446746826, "epoch": 0.12245714000099965, "grad_norm": 1.0859375, "learning_rate": 0.0004999943191552745, "loss": 7.1366, "mean_token_accuracy": 0.1104811742901802, "num_tokens": 2412093.0, "step": 1225 }, { "entropy": 7.197684717178345, "epoch": 0.12295696506222822, "grad_norm": 1.0625, "learning_rate": 0.0004999940627168037, "loss": 7.1138, "mean_token_accuracy": 0.11224015802145004, "num_tokens": 2421349.0, "step": 1230 }, { "entropy": 7.113976287841797, "epoch": 0.12345679012345678, "grad_norm": 1.125, "learning_rate": 0.00049999380061754, "loss": 7.0816, "mean_token_accuracy": 0.12027929723262787, "num_tokens": 2430672.0, "step": 1235 }, { "entropy": 7.171084785461426, "epoch": 0.12395661518468536, "grad_norm": 1.15625, "learning_rate": 0.0004999935328574903, "loss": 7.1672, "mean_token_accuracy": 0.10523176565766335, "num_tokens": 2439355.0, "step": 1240 }, { "entropy": 7.167644071578979, "epoch": 0.12445644024591393, "grad_norm": 1.03125, "learning_rate": 0.0004999932594366613, "loss": 7.1629, "mean_token_accuracy": 0.11419163346290588, "num_tokens": 2448860.0, "step": 1245 }, { "entropy": 7.165760946273804, "epoch": 0.1249562653071425, "grad_norm": 1.1015625, "learning_rate": 0.0004999929803550597, "loss": 7.2068, "mean_token_accuracy": 0.1069261223077774, "num_tokens": 2458276.0, "step": 1250 }, { "entropy": 7.17039475440979, "epoch": 0.12545609036837108, "grad_norm": 1.1484375, "learning_rate": 0.0004999926956126927, "loss": 7.1266, "mean_token_accuracy": 0.11022537723183631, "num_tokens": 2467791.0, "step": 1255 }, { "entropy": 7.146854448318481, "epoch": 0.12595591542959964, "grad_norm": 1.046875, "learning_rate": 0.0004999924052095672, "loss": 7.2725, "mean_token_accuracy": 0.10534469336271286, "num_tokens": 2477549.0, "step": 1260 }, { "entropy": 7.200028324127198, "epoch": 0.12645574049082822, "grad_norm": 1.0234375, "learning_rate": 0.0004999921091456907, "loss": 7.1641, "mean_token_accuracy": 0.10597576200962067, "num_tokens": 2487549.0, "step": 1265 }, { "entropy": 7.233373498916626, "epoch": 0.12695556555205678, "grad_norm": 1.0546875, "learning_rate": 0.0004999918074210707, "loss": 7.1615, "mean_token_accuracy": 0.11181024834513664, "num_tokens": 2496799.0, "step": 1270 }, { "entropy": 7.232607460021972, "epoch": 0.12745539061328534, "grad_norm": 1.078125, "learning_rate": 0.0004999915000357147, "loss": 7.2669, "mean_token_accuracy": 0.10368774533271789, "num_tokens": 2505795.0, "step": 1275 }, { "entropy": 7.204328823089599, "epoch": 0.12795521567451393, "grad_norm": 1.2265625, "learning_rate": 0.0004999911869896305, "loss": 7.0697, "mean_token_accuracy": 0.10817176178097725, "num_tokens": 2515289.0, "step": 1280 }, { "entropy": 7.2058745384216305, "epoch": 0.1284550407357425, "grad_norm": 1.0234375, "learning_rate": 0.0004999908682828258, "loss": 7.2686, "mean_token_accuracy": 0.09726808145642281, "num_tokens": 2524563.0, "step": 1285 }, { "entropy": 7.179253101348877, "epoch": 0.12895486579697105, "grad_norm": 1.1796875, "learning_rate": 0.0004999905439153089, "loss": 7.1331, "mean_token_accuracy": 0.11065928637981415, "num_tokens": 2534057.0, "step": 1290 }, { "entropy": 7.125552940368652, "epoch": 0.12945469085819963, "grad_norm": 1.0234375, "learning_rate": 0.0004999902138870878, "loss": 7.1287, "mean_token_accuracy": 0.11491556018590927, "num_tokens": 2544646.0, "step": 1295 }, { "entropy": 7.201935863494873, "epoch": 0.1299545159194282, "grad_norm": 1.046875, "learning_rate": 0.0004999898781981707, "loss": 7.1982, "mean_token_accuracy": 0.1065469078719616, "num_tokens": 2553843.0, "step": 1300 }, { "entropy": 7.158224201202392, "epoch": 0.13045434098065678, "grad_norm": 1.0390625, "learning_rate": 0.0004999895368485662, "loss": 7.2568, "mean_token_accuracy": 0.10226461961865425, "num_tokens": 2564061.0, "step": 1305 }, { "entropy": 7.151171636581421, "epoch": 0.13095416604188534, "grad_norm": 1.0078125, "learning_rate": 0.000499989189838283, "loss": 7.1242, "mean_token_accuracy": 0.10985731407999992, "num_tokens": 2574758.0, "step": 1310 }, { "entropy": 7.168261194229126, "epoch": 0.1314539911031139, "grad_norm": 0.953125, "learning_rate": 0.0004999888371673295, "loss": 7.1635, "mean_token_accuracy": 0.10855096057057381, "num_tokens": 2585213.0, "step": 1315 }, { "entropy": 7.2063212394714355, "epoch": 0.13195381616434249, "grad_norm": 0.96875, "learning_rate": 0.0004999884788357147, "loss": 7.2354, "mean_token_accuracy": 0.10834863558411598, "num_tokens": 2595511.0, "step": 1320 }, { "entropy": 7.141773223876953, "epoch": 0.13245364122557104, "grad_norm": 1.0859375, "learning_rate": 0.0004999881148434478, "loss": 7.1519, "mean_token_accuracy": 0.10698395371437072, "num_tokens": 2605930.0, "step": 1325 }, { "entropy": 7.183522272109985, "epoch": 0.13295346628679963, "grad_norm": 1.125, "learning_rate": 0.0004999877451905378, "loss": 7.0084, "mean_token_accuracy": 0.12175094336271286, "num_tokens": 2614224.0, "step": 1330 }, { "entropy": 7.179550838470459, "epoch": 0.1334532913480282, "grad_norm": 1.109375, "learning_rate": 0.0004999873698769941, "loss": 7.2662, "mean_token_accuracy": 0.1017696812748909, "num_tokens": 2624879.0, "step": 1335 }, { "entropy": 7.120278787612915, "epoch": 0.13395311640925675, "grad_norm": 1.046875, "learning_rate": 0.000499986988902826, "loss": 7.117, "mean_token_accuracy": 0.10926841422915459, "num_tokens": 2633836.0, "step": 1340 }, { "entropy": 7.138001871109009, "epoch": 0.13445294147048534, "grad_norm": 1.0, "learning_rate": 0.0004999866022680431, "loss": 7.1771, "mean_token_accuracy": 0.10937484353780746, "num_tokens": 2643754.0, "step": 1345 }, { "entropy": 7.255338096618653, "epoch": 0.1349527665317139, "grad_norm": 1.0625, "learning_rate": 0.0004999862099726552, "loss": 7.2411, "mean_token_accuracy": 0.10106356516480446, "num_tokens": 2652708.0, "step": 1350 }, { "entropy": 7.085612630844116, "epoch": 0.13545259159294248, "grad_norm": 0.9375, "learning_rate": 0.0004999858120166721, "loss": 7.1799, "mean_token_accuracy": 0.10279356613755226, "num_tokens": 2662353.0, "step": 1355 }, { "entropy": 7.2352677345275875, "epoch": 0.13595241665417104, "grad_norm": 1.1015625, "learning_rate": 0.0004999854084001039, "loss": 7.092, "mean_token_accuracy": 0.1117504045367241, "num_tokens": 2672376.0, "step": 1360 }, { "entropy": 7.125872230529785, "epoch": 0.1364522417153996, "grad_norm": 0.9765625, "learning_rate": 0.0004999849991229608, "loss": 7.1979, "mean_token_accuracy": 0.10238617360591888, "num_tokens": 2682115.0, "step": 1365 }, { "entropy": 7.1724754810333256, "epoch": 0.1369520667766282, "grad_norm": 1.03125, "learning_rate": 0.000499984584185253, "loss": 7.1836, "mean_token_accuracy": 0.10678994581103325, "num_tokens": 2692429.0, "step": 1370 }, { "entropy": 7.102124166488648, "epoch": 0.13745189183785675, "grad_norm": 1.0, "learning_rate": 0.0004999841635869909, "loss": 7.1257, "mean_token_accuracy": 0.10722747519612312, "num_tokens": 2701373.0, "step": 1375 }, { "entropy": 7.279002380371094, "epoch": 0.1379517168990853, "grad_norm": 1.3046875, "learning_rate": 0.0004999837373281852, "loss": 7.3167, "mean_token_accuracy": 0.10132398679852486, "num_tokens": 2710717.0, "step": 1380 }, { "entropy": 7.091415548324585, "epoch": 0.1384515419603139, "grad_norm": 1.0390625, "learning_rate": 0.0004999833054088465, "loss": 7.1606, "mean_token_accuracy": 0.10936282426118851, "num_tokens": 2720936.0, "step": 1385 }, { "entropy": 7.2388688087463375, "epoch": 0.13895136702154245, "grad_norm": 1.125, "learning_rate": 0.0004999828678289858, "loss": 7.0993, "mean_token_accuracy": 0.11418369710445404, "num_tokens": 2730504.0, "step": 1390 }, { "entropy": 7.0881829261779785, "epoch": 0.13945119208277104, "grad_norm": 1.1640625, "learning_rate": 0.000499982424588614, "loss": 7.1144, "mean_token_accuracy": 0.11084567457437515, "num_tokens": 2739069.0, "step": 1395 }, { "entropy": 7.147162532806396, "epoch": 0.1399510171439996, "grad_norm": 1.140625, "learning_rate": 0.0004999819756877422, "loss": 7.1945, "mean_token_accuracy": 0.10329353213310241, "num_tokens": 2748941.0, "step": 1400 }, { "entropy": 7.18705563545227, "epoch": 0.14045084220522816, "grad_norm": 1.0390625, "learning_rate": 0.0004999815211263819, "loss": 7.1507, "mean_token_accuracy": 0.10858112126588822, "num_tokens": 2758915.0, "step": 1405 }, { "entropy": 7.191486263275147, "epoch": 0.14095066726645675, "grad_norm": 1.046875, "learning_rate": 0.0004999810609045444, "loss": 7.1754, "mean_token_accuracy": 0.10965260490775108, "num_tokens": 2768972.0, "step": 1410 }, { "entropy": 7.156418704986573, "epoch": 0.1414504923276853, "grad_norm": 1.0703125, "learning_rate": 0.0004999805950222412, "loss": 7.0278, "mean_token_accuracy": 0.10822951421141624, "num_tokens": 2777989.0, "step": 1415 }, { "entropy": 7.091416835784912, "epoch": 0.1419503173889139, "grad_norm": 1.1015625, "learning_rate": 0.0004999801234794843, "loss": 7.1096, "mean_token_accuracy": 0.11228812485933304, "num_tokens": 2788227.0, "step": 1420 }, { "entropy": 7.147107839584351, "epoch": 0.14245014245014245, "grad_norm": 1.1015625, "learning_rate": 0.0004999796462762853, "loss": 7.1112, "mean_token_accuracy": 0.11311104521155357, "num_tokens": 2797729.0, "step": 1425 }, { "entropy": 7.119664812088013, "epoch": 0.142949967511371, "grad_norm": 1.0234375, "learning_rate": 0.0004999791634126562, "loss": 7.1126, "mean_token_accuracy": 0.11075319051742553, "num_tokens": 2807215.0, "step": 1430 }, { "entropy": 7.124571132659912, "epoch": 0.1434497925725996, "grad_norm": 1.2890625, "learning_rate": 0.0004999786748886094, "loss": 7.0246, "mean_token_accuracy": 0.11238908171653747, "num_tokens": 2816945.0, "step": 1435 }, { "entropy": 7.017452239990234, "epoch": 0.14394961763382816, "grad_norm": 1.0546875, "learning_rate": 0.0004999781807041569, "loss": 7.1146, "mean_token_accuracy": 0.10776891112327576, "num_tokens": 2827072.0, "step": 1440 }, { "entropy": 7.165062618255615, "epoch": 0.14444944269505672, "grad_norm": 1.03125, "learning_rate": 0.0004999776808593113, "loss": 7.0482, "mean_token_accuracy": 0.11216341257095337, "num_tokens": 2837928.0, "step": 1445 }, { "entropy": 7.001790475845337, "epoch": 0.1449492677562853, "grad_norm": 1.0859375, "learning_rate": 0.0004999771753540852, "loss": 7.0846, "mean_token_accuracy": 0.11152777597308158, "num_tokens": 2847861.0, "step": 1450 }, { "entropy": 7.149148035049438, "epoch": 0.14544909281751386, "grad_norm": 1.0859375, "learning_rate": 0.0004999766641884912, "loss": 7.0848, "mean_token_accuracy": 0.11256931573152543, "num_tokens": 2857885.0, "step": 1455 }, { "entropy": 7.160283946990967, "epoch": 0.14594891787874245, "grad_norm": 0.984375, "learning_rate": 0.0004999761473625422, "loss": 7.0932, "mean_token_accuracy": 0.10660878345370292, "num_tokens": 2867004.0, "step": 1460 }, { "entropy": 7.065319442749024, "epoch": 0.146448742939971, "grad_norm": 1.0625, "learning_rate": 0.0004999756248762513, "loss": 6.9736, "mean_token_accuracy": 0.11344703435897827, "num_tokens": 2876285.0, "step": 1465 }, { "entropy": 7.079582357406617, "epoch": 0.14694856800119957, "grad_norm": 0.890625, "learning_rate": 0.0004999750967296315, "loss": 7.112, "mean_token_accuracy": 0.10987017676234245, "num_tokens": 2886967.0, "step": 1470 }, { "entropy": 7.077367973327637, "epoch": 0.14744839306242816, "grad_norm": 0.9921875, "learning_rate": 0.0004999745629226962, "loss": 7.0936, "mean_token_accuracy": 0.10697494596242904, "num_tokens": 2897137.0, "step": 1475 }, { "entropy": 7.038984680175782, "epoch": 0.14794821812365672, "grad_norm": 0.95703125, "learning_rate": 0.0004999740234554589, "loss": 7.0472, "mean_token_accuracy": 0.12016323506832123, "num_tokens": 2907658.0, "step": 1480 }, { "entropy": 7.136841917037964, "epoch": 0.1484480431848853, "grad_norm": 1.1015625, "learning_rate": 0.0004999734783279327, "loss": 7.0572, "mean_token_accuracy": 0.11264566704630852, "num_tokens": 2917801.0, "step": 1485 }, { "entropy": 7.058710241317749, "epoch": 0.14894786824611386, "grad_norm": 1.109375, "learning_rate": 0.000499972927540132, "loss": 7.1593, "mean_token_accuracy": 0.1104632668197155, "num_tokens": 2927188.0, "step": 1490 }, { "entropy": 7.148079061508179, "epoch": 0.14944769330734242, "grad_norm": 1.015625, "learning_rate": 0.0004999723710920703, "loss": 7.0421, "mean_token_accuracy": 0.10991474613547325, "num_tokens": 2936781.0, "step": 1495 }, { "entropy": 6.985206222534179, "epoch": 0.149947518368571, "grad_norm": 1.0546875, "learning_rate": 0.0004999718089837616, "loss": 7.0034, "mean_token_accuracy": 0.11071012616157531, "num_tokens": 2946426.0, "step": 1500 }, { "entropy": 6.977966022491455, "epoch": 0.15044734342979957, "grad_norm": 1.03125, "learning_rate": 0.00049997124121522, "loss": 7.0591, "mean_token_accuracy": 0.11089984625577927, "num_tokens": 2956246.0, "step": 1505 }, { "entropy": 7.119696187973022, "epoch": 0.15094716849102813, "grad_norm": 1.0390625, "learning_rate": 0.0004999706677864599, "loss": 7.0301, "mean_token_accuracy": 0.11129701286554336, "num_tokens": 2965930.0, "step": 1510 }, { "entropy": 7.027358150482177, "epoch": 0.15144699355225671, "grad_norm": 0.953125, "learning_rate": 0.0004999700886974958, "loss": 6.9594, "mean_token_accuracy": 0.11398379057645798, "num_tokens": 2975975.0, "step": 1515 }, { "entropy": 7.029348134994507, "epoch": 0.15194681861348527, "grad_norm": 1.015625, "learning_rate": 0.000499969503948342, "loss": 6.9922, "mean_token_accuracy": 0.11278997659683228, "num_tokens": 2985343.0, "step": 1520 }, { "entropy": 6.995435190200806, "epoch": 0.15244664367471386, "grad_norm": 0.98828125, "learning_rate": 0.0004999689135390134, "loss": 7.0206, "mean_token_accuracy": 0.11354669854044915, "num_tokens": 2994420.0, "step": 1525 }, { "entropy": 7.102861928939819, "epoch": 0.15294646873594242, "grad_norm": 1.09375, "learning_rate": 0.0004999683174695249, "loss": 7.1314, "mean_token_accuracy": 0.11147044822573662, "num_tokens": 3004447.0, "step": 1530 }, { "entropy": 7.11038761138916, "epoch": 0.15344629379717098, "grad_norm": 0.9140625, "learning_rate": 0.0004999677157398914, "loss": 7.0136, "mean_token_accuracy": 0.11158140152692794, "num_tokens": 3014596.0, "step": 1535 }, { "entropy": 7.001529932022095, "epoch": 0.15394611885839957, "grad_norm": 0.94921875, "learning_rate": 0.0004999671083501281, "loss": 6.9424, "mean_token_accuracy": 0.11554695665836334, "num_tokens": 3024528.0, "step": 1540 }, { "entropy": 7.043489742279053, "epoch": 0.15444594391962813, "grad_norm": 0.9453125, "learning_rate": 0.0004999664953002502, "loss": 7.0757, "mean_token_accuracy": 0.1089545451104641, "num_tokens": 3035233.0, "step": 1545 }, { "entropy": 7.057877731323242, "epoch": 0.1549457689808567, "grad_norm": 1.046875, "learning_rate": 0.000499965876590273, "loss": 7.0639, "mean_token_accuracy": 0.11354411020874977, "num_tokens": 3045890.0, "step": 1550 }, { "entropy": 7.006091165542602, "epoch": 0.15544559404208527, "grad_norm": 1.0234375, "learning_rate": 0.0004999652522202125, "loss": 6.9704, "mean_token_accuracy": 0.11927012428641319, "num_tokens": 3056640.0, "step": 1555 }, { "entropy": 6.988191604614258, "epoch": 0.15594541910331383, "grad_norm": 0.95703125, "learning_rate": 0.0004999646221900839, "loss": 6.9995, "mean_token_accuracy": 0.11643217280507087, "num_tokens": 3066938.0, "step": 1560 }, { "entropy": 7.100666046142578, "epoch": 0.15644524416454242, "grad_norm": 0.9375, "learning_rate": 0.0004999639864999034, "loss": 7.1224, "mean_token_accuracy": 0.11021771505475045, "num_tokens": 3076791.0, "step": 1565 }, { "entropy": 7.040261554718017, "epoch": 0.15694506922577098, "grad_norm": 1.0703125, "learning_rate": 0.000499963345149687, "loss": 6.9766, "mean_token_accuracy": 0.1124839298427105, "num_tokens": 3087532.0, "step": 1570 }, { "entropy": 7.011826610565185, "epoch": 0.15744489428699954, "grad_norm": 0.94921875, "learning_rate": 0.0004999626981394506, "loss": 7.1019, "mean_token_accuracy": 0.11321934536099434, "num_tokens": 3097465.0, "step": 1575 }, { "entropy": 7.116326904296875, "epoch": 0.15794471934822812, "grad_norm": 1.0625, "learning_rate": 0.0004999620454692106, "loss": 7.0088, "mean_token_accuracy": 0.11308922916650772, "num_tokens": 3107162.0, "step": 1580 }, { "entropy": 7.002964687347412, "epoch": 0.15844454440945668, "grad_norm": 0.984375, "learning_rate": 0.0004999613871389836, "loss": 6.9932, "mean_token_accuracy": 0.11376159563660622, "num_tokens": 3117154.0, "step": 1585 }, { "entropy": 7.0667582035064695, "epoch": 0.15894436947068527, "grad_norm": 0.98828125, "learning_rate": 0.0004999607231487858, "loss": 7.0118, "mean_token_accuracy": 0.11034693121910095, "num_tokens": 3127635.0, "step": 1590 }, { "entropy": 7.099604892730713, "epoch": 0.15944419453191383, "grad_norm": 0.984375, "learning_rate": 0.000499960053498634, "loss": 7.0542, "mean_token_accuracy": 0.10722034946084022, "num_tokens": 3137806.0, "step": 1595 }, { "entropy": 6.99808521270752, "epoch": 0.1599440195931424, "grad_norm": 1.015625, "learning_rate": 0.0004999593781885454, "loss": 7.0869, "mean_token_accuracy": 0.10542495176196098, "num_tokens": 3147704.0, "step": 1600 }, { "entropy": 7.039315319061279, "epoch": 0.16044384465437098, "grad_norm": 0.921875, "learning_rate": 0.0004999586972185366, "loss": 7.0516, "mean_token_accuracy": 0.10607154071331024, "num_tokens": 3158486.0, "step": 1605 }, { "entropy": 7.045173120498657, "epoch": 0.16094366971559954, "grad_norm": 1.0078125, "learning_rate": 0.0004999580105886248, "loss": 7.0479, "mean_token_accuracy": 0.11122439876198768, "num_tokens": 3168518.0, "step": 1610 }, { "entropy": 7.000042533874511, "epoch": 0.16144349477682812, "grad_norm": 1.0625, "learning_rate": 0.0004999573182988275, "loss": 6.9298, "mean_token_accuracy": 0.11688626557588577, "num_tokens": 3177502.0, "step": 1615 }, { "entropy": 7.017080640792846, "epoch": 0.16194331983805668, "grad_norm": 1.046875, "learning_rate": 0.0004999566203491619, "loss": 6.9921, "mean_token_accuracy": 0.11503020003437996, "num_tokens": 3187408.0, "step": 1620 }, { "entropy": 7.0513831615448, "epoch": 0.16244314489928524, "grad_norm": 1.0, "learning_rate": 0.0004999559167396455, "loss": 7.0567, "mean_token_accuracy": 0.11678390353918075, "num_tokens": 3196812.0, "step": 1625 }, { "entropy": 6.902290725708008, "epoch": 0.16294296996051383, "grad_norm": 0.96875, "learning_rate": 0.0004999552074702963, "loss": 6.9108, "mean_token_accuracy": 0.11789578422904015, "num_tokens": 3206159.0, "step": 1630 }, { "entropy": 7.007291650772094, "epoch": 0.1634427950217424, "grad_norm": 0.9140625, "learning_rate": 0.0004999544925411318, "loss": 6.8954, "mean_token_accuracy": 0.12061700448393822, "num_tokens": 3217329.0, "step": 1635 }, { "entropy": 6.951911449432373, "epoch": 0.16394262008297095, "grad_norm": 0.92578125, "learning_rate": 0.0004999537719521703, "loss": 7.0219, "mean_token_accuracy": 0.11060998439788819, "num_tokens": 3227558.0, "step": 1640 }, { "entropy": 7.113637161254883, "epoch": 0.16444244514419953, "grad_norm": 1.109375, "learning_rate": 0.0004999530457034297, "loss": 7.1038, "mean_token_accuracy": 0.10778464749455452, "num_tokens": 3237719.0, "step": 1645 }, { "entropy": 7.020438766479492, "epoch": 0.1649422702054281, "grad_norm": 1.046875, "learning_rate": 0.0004999523137949283, "loss": 7.0316, "mean_token_accuracy": 0.11263542622327805, "num_tokens": 3246483.0, "step": 1650 }, { "entropy": 6.933847713470459, "epoch": 0.16544209526665668, "grad_norm": 0.9921875, "learning_rate": 0.0004999515762266846, "loss": 6.9301, "mean_token_accuracy": 0.1197948582470417, "num_tokens": 3256955.0, "step": 1655 }, { "entropy": 7.0298436164855955, "epoch": 0.16594192032788524, "grad_norm": 1.0546875, "learning_rate": 0.0004999508329987173, "loss": 6.998, "mean_token_accuracy": 0.11044911220669747, "num_tokens": 3266799.0, "step": 1660 }, { "entropy": 6.953704118728638, "epoch": 0.1664417453891138, "grad_norm": 1.0859375, "learning_rate": 0.0004999500841110447, "loss": 6.9928, "mean_token_accuracy": 0.11013735309243203, "num_tokens": 3276595.0, "step": 1665 }, { "entropy": 7.008637952804565, "epoch": 0.16694157045034239, "grad_norm": 1.0234375, "learning_rate": 0.000499949329563686, "loss": 6.9401, "mean_token_accuracy": 0.11440528258681297, "num_tokens": 3286047.0, "step": 1670 }, { "entropy": 7.053787803649902, "epoch": 0.16744139551157095, "grad_norm": 1.046875, "learning_rate": 0.00049994856935666, "loss": 7.0196, "mean_token_accuracy": 0.11221319362521172, "num_tokens": 3295364.0, "step": 1675 }, { "entropy": 6.936156606674194, "epoch": 0.16794122057279953, "grad_norm": 1.0234375, "learning_rate": 0.000499947803489986, "loss": 6.9291, "mean_token_accuracy": 0.12198807075619697, "num_tokens": 3305319.0, "step": 1680 }, { "entropy": 6.941357517242432, "epoch": 0.1684410456340281, "grad_norm": 1.0546875, "learning_rate": 0.0004999470319636829, "loss": 6.9625, "mean_token_accuracy": 0.11831458657979965, "num_tokens": 3315349.0, "step": 1685 }, { "entropy": 7.03402681350708, "epoch": 0.16894087069525665, "grad_norm": 1.171875, "learning_rate": 0.0004999462547777705, "loss": 7.0281, "mean_token_accuracy": 0.10700425431132317, "num_tokens": 3325603.0, "step": 1690 }, { "entropy": 6.9488404273986815, "epoch": 0.16944069575648524, "grad_norm": 1.0546875, "learning_rate": 0.0004999454719322682, "loss": 6.9345, "mean_token_accuracy": 0.11474086120724677, "num_tokens": 3334693.0, "step": 1695 }, { "entropy": 7.03020396232605, "epoch": 0.1699405208177138, "grad_norm": 1.03125, "learning_rate": 0.0004999446834271958, "loss": 6.9321, "mean_token_accuracy": 0.1120713397860527, "num_tokens": 3345259.0, "step": 1700 }, { "entropy": 6.898108196258545, "epoch": 0.17044034587894236, "grad_norm": 1.09375, "learning_rate": 0.0004999438892625728, "loss": 6.9402, "mean_token_accuracy": 0.11133012548089027, "num_tokens": 3354072.0, "step": 1705 }, { "entropy": 7.105929708480835, "epoch": 0.17094017094017094, "grad_norm": 1.078125, "learning_rate": 0.0004999430894384198, "loss": 6.9114, "mean_token_accuracy": 0.11355426013469697, "num_tokens": 3364881.0, "step": 1710 }, { "entropy": 6.9483030319213865, "epoch": 0.1714399960013995, "grad_norm": 1.0546875, "learning_rate": 0.0004999422839547564, "loss": 6.9086, "mean_token_accuracy": 0.11701997593045235, "num_tokens": 3374030.0, "step": 1715 }, { "entropy": 6.9252705574035645, "epoch": 0.1719398210626281, "grad_norm": 1.0, "learning_rate": 0.0004999414728116029, "loss": 6.8956, "mean_token_accuracy": 0.11267698481678963, "num_tokens": 3384009.0, "step": 1720 }, { "entropy": 7.041887044906616, "epoch": 0.17243964612385665, "grad_norm": 1.0390625, "learning_rate": 0.0004999406560089798, "loss": 7.0475, "mean_token_accuracy": 0.10910101756453514, "num_tokens": 3393660.0, "step": 1725 }, { "entropy": 7.037035226821899, "epoch": 0.1729394711850852, "grad_norm": 1.0078125, "learning_rate": 0.0004999398335469078, "loss": 7.0708, "mean_token_accuracy": 0.11321713551878929, "num_tokens": 3404364.0, "step": 1730 }, { "entropy": 6.9971565246582035, "epoch": 0.1734392962463138, "grad_norm": 1.046875, "learning_rate": 0.0004999390054254074, "loss": 6.9521, "mean_token_accuracy": 0.1106104426085949, "num_tokens": 3412990.0, "step": 1735 }, { "entropy": 6.852579402923584, "epoch": 0.17393912130754235, "grad_norm": 1.2421875, "learning_rate": 0.0004999381716444996, "loss": 6.9329, "mean_token_accuracy": 0.11495454907417298, "num_tokens": 3422339.0, "step": 1740 }, { "entropy": 6.959084606170654, "epoch": 0.17443894636877094, "grad_norm": 0.93359375, "learning_rate": 0.0004999373322042052, "loss": 6.9043, "mean_token_accuracy": 0.11547202616930008, "num_tokens": 3433093.0, "step": 1745 }, { "entropy": 7.003214359283447, "epoch": 0.1749387714299995, "grad_norm": 1.0, "learning_rate": 0.0004999364871045455, "loss": 6.9932, "mean_token_accuracy": 0.11007570326328278, "num_tokens": 3443464.0, "step": 1750 }, { "entropy": 6.978196811676026, "epoch": 0.17543859649122806, "grad_norm": 0.9453125, "learning_rate": 0.0004999356363455415, "loss": 6.9345, "mean_token_accuracy": 0.11543623134493827, "num_tokens": 3453380.0, "step": 1755 }, { "entropy": 6.9858551025390625, "epoch": 0.17593842155245665, "grad_norm": 1.0390625, "learning_rate": 0.000499934779927215, "loss": 6.9758, "mean_token_accuracy": 0.11607812270522118, "num_tokens": 3463583.0, "step": 1760 }, { "entropy": 6.9328991889953615, "epoch": 0.1764382466136852, "grad_norm": 0.96484375, "learning_rate": 0.0004999339178495872, "loss": 6.8913, "mean_token_accuracy": 0.122561364620924, "num_tokens": 3473640.0, "step": 1765 }, { "entropy": 6.92822413444519, "epoch": 0.1769380716749138, "grad_norm": 1.0859375, "learning_rate": 0.0004999330501126798, "loss": 6.9503, "mean_token_accuracy": 0.1169328160583973, "num_tokens": 3483827.0, "step": 1770 }, { "entropy": 6.91102409362793, "epoch": 0.17743789673614235, "grad_norm": 1.03125, "learning_rate": 0.0004999321767165148, "loss": 6.9004, "mean_token_accuracy": 0.12227763310074806, "num_tokens": 3493763.0, "step": 1775 }, { "entropy": 7.019092321395874, "epoch": 0.1779377217973709, "grad_norm": 1.125, "learning_rate": 0.0004999312976611142, "loss": 7.0148, "mean_token_accuracy": 0.11686293035745621, "num_tokens": 3503119.0, "step": 1780 }, { "entropy": 7.024073219299316, "epoch": 0.1784375468585995, "grad_norm": 1.0234375, "learning_rate": 0.0004999304129465, "loss": 6.9535, "mean_token_accuracy": 0.11344824209809304, "num_tokens": 3513235.0, "step": 1785 }, { "entropy": 7.011400938034058, "epoch": 0.17893737191982806, "grad_norm": 0.97265625, "learning_rate": 0.0004999295225726945, "loss": 7.0523, "mean_token_accuracy": 0.10902164354920388, "num_tokens": 3523633.0, "step": 1790 }, { "entropy": 6.947716617584229, "epoch": 0.17943719698105662, "grad_norm": 1.0234375, "learning_rate": 0.00049992862653972, "loss": 6.8941, "mean_token_accuracy": 0.11354788541793823, "num_tokens": 3532888.0, "step": 1795 }, { "entropy": 6.984013509750366, "epoch": 0.1799370220422852, "grad_norm": 1.1640625, "learning_rate": 0.0004999277248475992, "loss": 6.9221, "mean_token_accuracy": 0.11461929455399514, "num_tokens": 3541942.0, "step": 1800 }, { "entropy": 6.907126140594483, "epoch": 0.18043684710351376, "grad_norm": 1.0390625, "learning_rate": 0.0004999268174963547, "loss": 6.8983, "mean_token_accuracy": 0.11499835699796676, "num_tokens": 3551544.0, "step": 1805 }, { "entropy": 6.945745325088501, "epoch": 0.18093667216474235, "grad_norm": 1.1015625, "learning_rate": 0.0004999259044860093, "loss": 6.8902, "mean_token_accuracy": 0.11644125431776046, "num_tokens": 3561024.0, "step": 1810 }, { "entropy": 6.9447986602783205, "epoch": 0.1814364972259709, "grad_norm": 1.0546875, "learning_rate": 0.0004999249858165861, "loss": 6.8811, "mean_token_accuracy": 0.1235733337700367, "num_tokens": 3570962.0, "step": 1815 }, { "entropy": 6.819528198242187, "epoch": 0.18193632228719947, "grad_norm": 0.96875, "learning_rate": 0.0004999240614881082, "loss": 6.8763, "mean_token_accuracy": 0.1207821324467659, "num_tokens": 3580669.0, "step": 1820 }, { "entropy": 7.0006632804870605, "epoch": 0.18243614734842806, "grad_norm": 0.9921875, "learning_rate": 0.0004999231315005987, "loss": 6.8879, "mean_token_accuracy": 0.11845619827508927, "num_tokens": 3590627.0, "step": 1825 }, { "entropy": 6.9256019115448, "epoch": 0.18293597240965662, "grad_norm": 0.96484375, "learning_rate": 0.0004999221958540811, "loss": 6.9646, "mean_token_accuracy": 0.10778707936406136, "num_tokens": 3599872.0, "step": 1830 }, { "entropy": 6.9726580619812015, "epoch": 0.1834357974708852, "grad_norm": 0.97265625, "learning_rate": 0.0004999212545485789, "loss": 6.9475, "mean_token_accuracy": 0.11592329442501068, "num_tokens": 3609809.0, "step": 1835 }, { "entropy": 7.054142475128174, "epoch": 0.18393562253211376, "grad_norm": 0.99609375, "learning_rate": 0.0004999203075841159, "loss": 6.9647, "mean_token_accuracy": 0.11736813709139823, "num_tokens": 3619385.0, "step": 1840 }, { "entropy": 6.828405857086182, "epoch": 0.18443544759334232, "grad_norm": 0.9453125, "learning_rate": 0.0004999193549607157, "loss": 6.8006, "mean_token_accuracy": 0.12424161806702613, "num_tokens": 3628867.0, "step": 1845 }, { "entropy": 6.887426710128784, "epoch": 0.1849352726545709, "grad_norm": 1.1015625, "learning_rate": 0.0004999183966784026, "loss": 6.8011, "mean_token_accuracy": 0.13002747148275376, "num_tokens": 3637528.0, "step": 1850 }, { "entropy": 6.9064164638519285, "epoch": 0.18543509771579947, "grad_norm": 0.94921875, "learning_rate": 0.0004999174327372004, "loss": 6.943, "mean_token_accuracy": 0.11500856131315232, "num_tokens": 3648011.0, "step": 1855 }, { "entropy": 6.918382453918457, "epoch": 0.18593492277702803, "grad_norm": 0.94140625, "learning_rate": 0.0004999164631371335, "loss": 6.9275, "mean_token_accuracy": 0.11812992170453071, "num_tokens": 3657648.0, "step": 1860 }, { "entropy": 7.01478066444397, "epoch": 0.18643474783825661, "grad_norm": 1.0234375, "learning_rate": 0.0004999154878782262, "loss": 6.9333, "mean_token_accuracy": 0.11356185749173164, "num_tokens": 3666965.0, "step": 1865 }, { "entropy": 6.965643262863159, "epoch": 0.18693457289948517, "grad_norm": 1.1015625, "learning_rate": 0.000499914506960503, "loss": 6.9537, "mean_token_accuracy": 0.10866264775395393, "num_tokens": 3676609.0, "step": 1870 }, { "entropy": 6.886865043640137, "epoch": 0.18743439796071376, "grad_norm": 1.03125, "learning_rate": 0.0004999135203839889, "loss": 6.8298, "mean_token_accuracy": 0.1227896973490715, "num_tokens": 3685884.0, "step": 1875 }, { "entropy": 6.844762706756592, "epoch": 0.18793422302194232, "grad_norm": 1.109375, "learning_rate": 0.0004999125281487084, "loss": 6.9795, "mean_token_accuracy": 0.114560666680336, "num_tokens": 3695436.0, "step": 1880 }, { "entropy": 6.946454906463623, "epoch": 0.18843404808317088, "grad_norm": 1.0859375, "learning_rate": 0.0004999115302546866, "loss": 6.7854, "mean_token_accuracy": 0.12357550859451294, "num_tokens": 3704806.0, "step": 1885 }, { "entropy": 6.897518253326416, "epoch": 0.18893387314439947, "grad_norm": 1.375, "learning_rate": 0.0004999105267019486, "loss": 6.8642, "mean_token_accuracy": 0.1193320944905281, "num_tokens": 3713927.0, "step": 1890 }, { "entropy": 6.967895030975342, "epoch": 0.18943369820562803, "grad_norm": 1.3046875, "learning_rate": 0.0004999095174905195, "loss": 6.9635, "mean_token_accuracy": 0.11119818165898324, "num_tokens": 3723685.0, "step": 1895 }, { "entropy": 6.898874568939209, "epoch": 0.1899335232668566, "grad_norm": 1.0234375, "learning_rate": 0.0004999085026204249, "loss": 6.9147, "mean_token_accuracy": 0.11309322565793992, "num_tokens": 3733918.0, "step": 1900 }, { "entropy": 6.957060718536377, "epoch": 0.19043334832808517, "grad_norm": 0.9375, "learning_rate": 0.0004999074820916903, "loss": 6.8693, "mean_token_accuracy": 0.11191848888993264, "num_tokens": 3744466.0, "step": 1905 }, { "entropy": 6.869232225418091, "epoch": 0.19093317338931373, "grad_norm": 1.0546875, "learning_rate": 0.0004999064559043412, "loss": 6.827, "mean_token_accuracy": 0.11591498851776123, "num_tokens": 3754082.0, "step": 1910 }, { "entropy": 6.862514638900757, "epoch": 0.19143299845054232, "grad_norm": 1.125, "learning_rate": 0.0004999054240584037, "loss": 6.8541, "mean_token_accuracy": 0.12327471598982812, "num_tokens": 3763111.0, "step": 1915 }, { "entropy": 6.996739625930786, "epoch": 0.19193282351177088, "grad_norm": 1.15625, "learning_rate": 0.0004999043865539035, "loss": 6.8973, "mean_token_accuracy": 0.11046274900436401, "num_tokens": 3772555.0, "step": 1920 }, { "entropy": 6.9612620830535885, "epoch": 0.19243264857299944, "grad_norm": 1.0703125, "learning_rate": 0.0004999033433908667, "loss": 6.9552, "mean_token_accuracy": 0.11249120384454728, "num_tokens": 3783073.0, "step": 1925 }, { "entropy": 6.834769010543823, "epoch": 0.19293247363422802, "grad_norm": 1.046875, "learning_rate": 0.0004999022945693198, "loss": 6.8807, "mean_token_accuracy": 0.11839989647269249, "num_tokens": 3792277.0, "step": 1930 }, { "entropy": 6.931283950805664, "epoch": 0.19343229869545658, "grad_norm": 1.109375, "learning_rate": 0.000499901240089289, "loss": 6.8551, "mean_token_accuracy": 0.11572782248258591, "num_tokens": 3801098.0, "step": 1935 }, { "entropy": 6.933052253723145, "epoch": 0.19393212375668517, "grad_norm": 1.0703125, "learning_rate": 0.0004999001799508009, "loss": 6.8941, "mean_token_accuracy": 0.1140223778784275, "num_tokens": 3810614.0, "step": 1940 }, { "entropy": 6.9448882102966305, "epoch": 0.19443194881791373, "grad_norm": 1.046875, "learning_rate": 0.0004998991141538821, "loss": 6.8723, "mean_token_accuracy": 0.11779175996780396, "num_tokens": 3818989.0, "step": 1945 }, { "entropy": 6.793414831161499, "epoch": 0.1949317738791423, "grad_norm": 1.0390625, "learning_rate": 0.0004998980426985596, "loss": 6.9092, "mean_token_accuracy": 0.1152567982673645, "num_tokens": 3829319.0, "step": 1950 }, { "entropy": 6.958078002929687, "epoch": 0.19543159894037088, "grad_norm": 0.92578125, "learning_rate": 0.00049989696558486, "loss": 6.9356, "mean_token_accuracy": 0.1145101934671402, "num_tokens": 3839545.0, "step": 1955 }, { "entropy": 6.871245193481445, "epoch": 0.19593142400159944, "grad_norm": 1.171875, "learning_rate": 0.0004998958828128108, "loss": 6.8735, "mean_token_accuracy": 0.1180442787706852, "num_tokens": 3849029.0, "step": 1960 }, { "entropy": 6.933473062515259, "epoch": 0.19643124906282802, "grad_norm": 1.0859375, "learning_rate": 0.0004998947943824389, "loss": 6.9198, "mean_token_accuracy": 0.11709642335772515, "num_tokens": 3859463.0, "step": 1965 }, { "entropy": 7.0088598251342775, "epoch": 0.19693107412405658, "grad_norm": 1.109375, "learning_rate": 0.0004998937002937719, "loss": 6.9588, "mean_token_accuracy": 0.11571476459503174, "num_tokens": 3869695.0, "step": 1970 }, { "entropy": 6.87238917350769, "epoch": 0.19743089918528514, "grad_norm": 0.9609375, "learning_rate": 0.0004998926005468373, "loss": 6.9183, "mean_token_accuracy": 0.11517301499843598, "num_tokens": 3879608.0, "step": 1975 }, { "entropy": 6.92598967552185, "epoch": 0.19793072424651373, "grad_norm": 1.0546875, "learning_rate": 0.0004998914951416627, "loss": 6.8308, "mean_token_accuracy": 0.11759625598788262, "num_tokens": 3888709.0, "step": 1980 }, { "entropy": 6.7358252048492435, "epoch": 0.1984305493077423, "grad_norm": 0.98828125, "learning_rate": 0.000499890384078276, "loss": 6.7746, "mean_token_accuracy": 0.12024817541241646, "num_tokens": 3898392.0, "step": 1985 }, { "entropy": 6.905943870544434, "epoch": 0.19893037436897085, "grad_norm": 0.9921875, "learning_rate": 0.0004998892673567051, "loss": 6.9924, "mean_token_accuracy": 0.10537268072366715, "num_tokens": 3909508.0, "step": 1990 }, { "entropy": 6.925677967071533, "epoch": 0.19943019943019943, "grad_norm": 1.3203125, "learning_rate": 0.0004998881449769781, "loss": 6.8298, "mean_token_accuracy": 0.11959851756691933, "num_tokens": 3918155.0, "step": 1995 }, { "entropy": 6.9149247169494625, "epoch": 0.199930024491428, "grad_norm": 1.046875, "learning_rate": 0.0004998870169391232, "loss": 6.8808, "mean_token_accuracy": 0.11446636393666268, "num_tokens": 3928478.0, "step": 2000 }, { "entropy": 6.903803873062134, "epoch": 0.20042984955265658, "grad_norm": 1.015625, "learning_rate": 0.000499885883243169, "loss": 6.9271, "mean_token_accuracy": 0.12026000469923019, "num_tokens": 3938126.0, "step": 2005 }, { "entropy": 6.782207250595093, "epoch": 0.20092967461388514, "grad_norm": 1.078125, "learning_rate": 0.0004998847438891437, "loss": 6.7315, "mean_token_accuracy": 0.11714796498417854, "num_tokens": 3948176.0, "step": 2010 }, { "entropy": 6.901465272903442, "epoch": 0.2014294996751137, "grad_norm": 0.984375, "learning_rate": 0.0004998835988770761, "loss": 6.8789, "mean_token_accuracy": 0.1191024824976921, "num_tokens": 3958983.0, "step": 2015 }, { "entropy": 6.933460426330567, "epoch": 0.20192932473634229, "grad_norm": 1.015625, "learning_rate": 0.000499882448206995, "loss": 6.8457, "mean_token_accuracy": 0.12024828121066093, "num_tokens": 3968766.0, "step": 2020 }, { "entropy": 6.861673736572266, "epoch": 0.20242914979757085, "grad_norm": 1.0859375, "learning_rate": 0.0004998812918789293, "loss": 6.8413, "mean_token_accuracy": 0.11853379607200623, "num_tokens": 3979487.0, "step": 2025 }, { "entropy": 6.832311201095581, "epoch": 0.20292897485879943, "grad_norm": 0.98046875, "learning_rate": 0.0004998801298929084, "loss": 6.8225, "mean_token_accuracy": 0.11745660156011581, "num_tokens": 3988450.0, "step": 2030 }, { "entropy": 6.882190370559693, "epoch": 0.203428799920028, "grad_norm": 1.1640625, "learning_rate": 0.0004998789622489611, "loss": 6.825, "mean_token_accuracy": 0.11936729922890663, "num_tokens": 3997492.0, "step": 2035 }, { "entropy": 6.902972221374512, "epoch": 0.20392862498125655, "grad_norm": 1.03125, "learning_rate": 0.0004998777889471171, "loss": 6.8323, "mean_token_accuracy": 0.12065311595797538, "num_tokens": 4007298.0, "step": 2040 }, { "entropy": 6.8405660629272464, "epoch": 0.20442845004248514, "grad_norm": 1.0703125, "learning_rate": 0.0004998766099874056, "loss": 6.8628, "mean_token_accuracy": 0.1189582072198391, "num_tokens": 4017727.0, "step": 2045 }, { "entropy": 6.887753915786743, "epoch": 0.2049282751037137, "grad_norm": 1.1015625, "learning_rate": 0.0004998754253698566, "loss": 6.8607, "mean_token_accuracy": 0.11793215274810791, "num_tokens": 4027618.0, "step": 2050 }, { "entropy": 6.814794063568115, "epoch": 0.20542810016494226, "grad_norm": 0.95703125, "learning_rate": 0.0004998742350944998, "loss": 6.8848, "mean_token_accuracy": 0.11500374749302864, "num_tokens": 4038831.0, "step": 2055 }, { "entropy": 6.859647417068482, "epoch": 0.20592792522617084, "grad_norm": 0.95703125, "learning_rate": 0.0004998730391613651, "loss": 6.8482, "mean_token_accuracy": 0.11991979852318764, "num_tokens": 4048736.0, "step": 2060 }, { "entropy": 6.81789493560791, "epoch": 0.2064277502873994, "grad_norm": 1.109375, "learning_rate": 0.0004998718375704825, "loss": 6.7655, "mean_token_accuracy": 0.11906948909163476, "num_tokens": 4057633.0, "step": 2065 }, { "entropy": 6.886240243911743, "epoch": 0.206927575348628, "grad_norm": 1.09375, "learning_rate": 0.0004998706303218825, "loss": 6.8785, "mean_token_accuracy": 0.1240123063325882, "num_tokens": 4067883.0, "step": 2070 }, { "entropy": 6.954527091979981, "epoch": 0.20742740040985655, "grad_norm": 1.0625, "learning_rate": 0.0004998694174155952, "loss": 6.7437, "mean_token_accuracy": 0.12506394237279891, "num_tokens": 4078147.0, "step": 2075 }, { "entropy": 6.741695070266724, "epoch": 0.2079272254710851, "grad_norm": 1.0234375, "learning_rate": 0.0004998681988516512, "loss": 6.7181, "mean_token_accuracy": 0.12472501173615455, "num_tokens": 4087130.0, "step": 2080 }, { "entropy": 6.781894207000732, "epoch": 0.2084270505323137, "grad_norm": 1.09375, "learning_rate": 0.0004998669746300811, "loss": 6.851, "mean_token_accuracy": 0.12515389323234558, "num_tokens": 4096840.0, "step": 2085 }, { "entropy": 7.006636762619019, "epoch": 0.20892687559354226, "grad_norm": 1.0546875, "learning_rate": 0.0004998657447509159, "loss": 6.8735, "mean_token_accuracy": 0.11554861664772034, "num_tokens": 4105842.0, "step": 2090 }, { "entropy": 6.778407716751099, "epoch": 0.20942670065477084, "grad_norm": 0.98828125, "learning_rate": 0.0004998645092141864, "loss": 6.7627, "mean_token_accuracy": 0.12160579934716224, "num_tokens": 4114865.0, "step": 2095 }, { "entropy": 6.914173173904419, "epoch": 0.2099265257159994, "grad_norm": 1.15625, "learning_rate": 0.0004998632680199238, "loss": 6.8991, "mean_token_accuracy": 0.11216249763965606, "num_tokens": 4124954.0, "step": 2100 }, { "entropy": 6.829844617843628, "epoch": 0.21042635077722796, "grad_norm": 1.015625, "learning_rate": 0.0004998620211681591, "loss": 6.7727, "mean_token_accuracy": 0.12200651988387108, "num_tokens": 4134091.0, "step": 2105 }, { "entropy": 6.9233245849609375, "epoch": 0.21092617583845655, "grad_norm": 1.03125, "learning_rate": 0.0004998607686589239, "loss": 6.8436, "mean_token_accuracy": 0.11750573813915252, "num_tokens": 4143566.0, "step": 2110 }, { "entropy": 6.829675722122192, "epoch": 0.2114260008996851, "grad_norm": 0.9140625, "learning_rate": 0.0004998595104922496, "loss": 6.8147, "mean_token_accuracy": 0.1171520471572876, "num_tokens": 4153053.0, "step": 2115 }, { "entropy": 6.852267074584961, "epoch": 0.2119258259609137, "grad_norm": 0.97265625, "learning_rate": 0.0004998582466681678, "loss": 6.7949, "mean_token_accuracy": 0.12671943306922911, "num_tokens": 4162925.0, "step": 2120 }, { "entropy": 6.735289525985718, "epoch": 0.21242565102214225, "grad_norm": 1.0078125, "learning_rate": 0.0004998569771867105, "loss": 6.7167, "mean_token_accuracy": 0.12583983838558196, "num_tokens": 4172077.0, "step": 2125 }, { "entropy": 6.815008449554443, "epoch": 0.2129254760833708, "grad_norm": 1.0546875, "learning_rate": 0.0004998557020479095, "loss": 6.807, "mean_token_accuracy": 0.1230967991054058, "num_tokens": 4182134.0, "step": 2130 }, { "entropy": 6.904581451416016, "epoch": 0.2134253011445994, "grad_norm": 0.96875, "learning_rate": 0.0004998544212517968, "loss": 6.8459, "mean_token_accuracy": 0.11531514376401901, "num_tokens": 4191963.0, "step": 2135 }, { "entropy": 6.808885908126831, "epoch": 0.21392512620582796, "grad_norm": 1.0390625, "learning_rate": 0.0004998531347984047, "loss": 6.7897, "mean_token_accuracy": 0.12169457077980042, "num_tokens": 4202180.0, "step": 2140 }, { "entropy": 6.8748163223266605, "epoch": 0.21442495126705652, "grad_norm": 1.1328125, "learning_rate": 0.0004998518426877656, "loss": 6.8107, "mean_token_accuracy": 0.12011150643229485, "num_tokens": 4211874.0, "step": 2145 }, { "entropy": 6.78511381149292, "epoch": 0.2149247763282851, "grad_norm": 1.03125, "learning_rate": 0.0004998505449199122, "loss": 6.7715, "mean_token_accuracy": 0.11865760311484337, "num_tokens": 4221610.0, "step": 2150 }, { "entropy": 6.713295936584473, "epoch": 0.21542460138951366, "grad_norm": 1.3125, "learning_rate": 0.0004998492414948768, "loss": 6.7396, "mean_token_accuracy": 0.12928089648485183, "num_tokens": 4230610.0, "step": 2155 }, { "entropy": 6.8231436252594, "epoch": 0.21592442645074225, "grad_norm": 0.86328125, "learning_rate": 0.0004998479324126924, "loss": 6.8422, "mean_token_accuracy": 0.11402832642197609, "num_tokens": 4241389.0, "step": 2160 }, { "entropy": 6.889860057830811, "epoch": 0.2164242515119708, "grad_norm": 1.0859375, "learning_rate": 0.0004998466176733918, "loss": 6.7815, "mean_token_accuracy": 0.12243804410099983, "num_tokens": 4250617.0, "step": 2165 }, { "entropy": 6.73257622718811, "epoch": 0.21692407657319937, "grad_norm": 1.03125, "learning_rate": 0.0004998452972770082, "loss": 6.7796, "mean_token_accuracy": 0.12635771334171295, "num_tokens": 4260000.0, "step": 2170 }, { "entropy": 6.793949365615845, "epoch": 0.21742390163442796, "grad_norm": 1.0546875, "learning_rate": 0.0004998439712235747, "loss": 6.7069, "mean_token_accuracy": 0.12508605569601058, "num_tokens": 4269751.0, "step": 2175 }, { "entropy": 6.805910682678222, "epoch": 0.21792372669565652, "grad_norm": 1.125, "learning_rate": 0.0004998426395131248, "loss": 6.7758, "mean_token_accuracy": 0.11987375542521476, "num_tokens": 4279210.0, "step": 2180 }, { "entropy": 6.804451131820679, "epoch": 0.2184235517568851, "grad_norm": 1.1171875, "learning_rate": 0.0004998413021456919, "loss": 6.7386, "mean_token_accuracy": 0.12299165651202201, "num_tokens": 4288573.0, "step": 2185 }, { "entropy": 6.781830787658691, "epoch": 0.21892337681811366, "grad_norm": 1.0, "learning_rate": 0.0004998399591213098, "loss": 6.7641, "mean_token_accuracy": 0.11898610666394234, "num_tokens": 4298438.0, "step": 2190 }, { "entropy": 6.778064155578614, "epoch": 0.21942320187934222, "grad_norm": 1.015625, "learning_rate": 0.0004998386104400122, "loss": 6.6757, "mean_token_accuracy": 0.13105980008840562, "num_tokens": 4307174.0, "step": 2195 }, { "entropy": 6.902370309829712, "epoch": 0.2199230269405708, "grad_norm": 1.0234375, "learning_rate": 0.0004998372561018329, "loss": 6.8756, "mean_token_accuracy": 0.11589000076055526, "num_tokens": 4317220.0, "step": 2200 }, { "entropy": 6.813035392761231, "epoch": 0.22042285200179937, "grad_norm": 1.0703125, "learning_rate": 0.0004998358961068062, "loss": 6.7789, "mean_token_accuracy": 0.1260307364165783, "num_tokens": 4326496.0, "step": 2205 }, { "entropy": 6.771057558059693, "epoch": 0.22092267706302793, "grad_norm": 1.0625, "learning_rate": 0.0004998345304549661, "loss": 6.7837, "mean_token_accuracy": 0.12462224960327148, "num_tokens": 4335705.0, "step": 2210 }, { "entropy": 6.854783344268799, "epoch": 0.22142250212425652, "grad_norm": 1.09375, "learning_rate": 0.0004998331591463471, "loss": 6.816, "mean_token_accuracy": 0.12542387172579766, "num_tokens": 4344711.0, "step": 2215 }, { "entropy": 6.836872529983521, "epoch": 0.22192232718548507, "grad_norm": 1.09375, "learning_rate": 0.0004998317821809837, "loss": 6.823, "mean_token_accuracy": 0.12106759324669839, "num_tokens": 4355448.0, "step": 2220 }, { "entropy": 6.691077804565429, "epoch": 0.22242215224671366, "grad_norm": 1.078125, "learning_rate": 0.0004998303995589104, "loss": 6.6938, "mean_token_accuracy": 0.12454739660024643, "num_tokens": 4365104.0, "step": 2225 }, { "entropy": 6.707037878036499, "epoch": 0.22292197730794222, "grad_norm": 1.15625, "learning_rate": 0.0004998290112801623, "loss": 6.6715, "mean_token_accuracy": 0.12494275271892548, "num_tokens": 4375219.0, "step": 2230 }, { "entropy": 6.891085195541382, "epoch": 0.22342180236917078, "grad_norm": 1.0546875, "learning_rate": 0.000499827617344774, "loss": 6.8096, "mean_token_accuracy": 0.1162020929157734, "num_tokens": 4385294.0, "step": 2235 }, { "entropy": 6.842881155014038, "epoch": 0.22392162743039937, "grad_norm": 1.0, "learning_rate": 0.0004998262177527807, "loss": 6.7727, "mean_token_accuracy": 0.11394542381167412, "num_tokens": 4394305.0, "step": 2240 }, { "entropy": 6.6954185485839846, "epoch": 0.22442145249162793, "grad_norm": 1.0546875, "learning_rate": 0.0004998248125042177, "loss": 6.6253, "mean_token_accuracy": 0.1304540902376175, "num_tokens": 4403732.0, "step": 2245 }, { "entropy": 6.796254825592041, "epoch": 0.2249212775528565, "grad_norm": 1.0, "learning_rate": 0.0004998234015991202, "loss": 6.8615, "mean_token_accuracy": 0.11681714579463005, "num_tokens": 4413730.0, "step": 2250 }, { "entropy": 6.899509286880493, "epoch": 0.22542110261408507, "grad_norm": 1.0546875, "learning_rate": 0.0004998219850375238, "loss": 6.859, "mean_token_accuracy": 0.11603142693638802, "num_tokens": 4423051.0, "step": 2255 }, { "entropy": 6.866402816772461, "epoch": 0.22592092767531363, "grad_norm": 0.9375, "learning_rate": 0.0004998205628194641, "loss": 6.8641, "mean_token_accuracy": 0.12003328129649163, "num_tokens": 4433363.0, "step": 2260 }, { "entropy": 6.876128149032593, "epoch": 0.22642075273654222, "grad_norm": 0.8984375, "learning_rate": 0.0004998191349449768, "loss": 6.8133, "mean_token_accuracy": 0.11659364998340607, "num_tokens": 4442984.0, "step": 2265 }, { "entropy": 6.778914976119995, "epoch": 0.22692057779777078, "grad_norm": 1.0703125, "learning_rate": 0.0004998177014140981, "loss": 6.7622, "mean_token_accuracy": 0.11801078915596008, "num_tokens": 4452364.0, "step": 2270 }, { "entropy": 6.881569671630859, "epoch": 0.22742040285899934, "grad_norm": 1.0703125, "learning_rate": 0.0004998162622268637, "loss": 6.7927, "mean_token_accuracy": 0.11506244912743568, "num_tokens": 4461904.0, "step": 2275 }, { "entropy": 6.80613260269165, "epoch": 0.22792022792022792, "grad_norm": 1.0703125, "learning_rate": 0.0004998148173833101, "loss": 6.7406, "mean_token_accuracy": 0.11940495148301125, "num_tokens": 4470633.0, "step": 2280 }, { "entropy": 6.768052959442139, "epoch": 0.22842005298145648, "grad_norm": 1.0859375, "learning_rate": 0.0004998133668834735, "loss": 6.7526, "mean_token_accuracy": 0.1232437625527382, "num_tokens": 4480673.0, "step": 2285 }, { "entropy": 6.768804597854614, "epoch": 0.22891987804268507, "grad_norm": 1.2734375, "learning_rate": 0.0004998119107273905, "loss": 6.743, "mean_token_accuracy": 0.11722776517271996, "num_tokens": 4489923.0, "step": 2290 }, { "entropy": 6.719747304916382, "epoch": 0.22941970310391363, "grad_norm": 1.0, "learning_rate": 0.0004998104489150975, "loss": 6.7136, "mean_token_accuracy": 0.12137444093823432, "num_tokens": 4501007.0, "step": 2295 }, { "entropy": 6.784075307846069, "epoch": 0.2299195281651422, "grad_norm": 1.1875, "learning_rate": 0.0004998089814466318, "loss": 6.7367, "mean_token_accuracy": 0.11942115277051926, "num_tokens": 4510460.0, "step": 2300 }, { "entropy": 6.869019842147827, "epoch": 0.23041935322637078, "grad_norm": 0.9453125, "learning_rate": 0.0004998075083220295, "loss": 6.8036, "mean_token_accuracy": 0.12088342234492302, "num_tokens": 4521026.0, "step": 2305 }, { "entropy": 6.728188514709473, "epoch": 0.23091917828759934, "grad_norm": 1.0625, "learning_rate": 0.0004998060295413286, "loss": 6.7208, "mean_token_accuracy": 0.12475512400269509, "num_tokens": 4530818.0, "step": 2310 }, { "entropy": 6.693582963943482, "epoch": 0.23141900334882792, "grad_norm": 1.0546875, "learning_rate": 0.0004998045451045656, "loss": 6.6643, "mean_token_accuracy": 0.13362600281834602, "num_tokens": 4539512.0, "step": 2315 }, { "entropy": 6.876028394699096, "epoch": 0.23191882841005648, "grad_norm": 1.0234375, "learning_rate": 0.0004998030550117782, "loss": 6.8587, "mean_token_accuracy": 0.11190490797162056, "num_tokens": 4549030.0, "step": 2320 }, { "entropy": 6.743910264968872, "epoch": 0.23241865347128504, "grad_norm": 1.03125, "learning_rate": 0.0004998015592630037, "loss": 6.698, "mean_token_accuracy": 0.1262820728123188, "num_tokens": 4559347.0, "step": 2325 }, { "entropy": 6.810586643218994, "epoch": 0.23291847853251363, "grad_norm": 1.53125, "learning_rate": 0.0004998000578582798, "loss": 6.752, "mean_token_accuracy": 0.11423259377479553, "num_tokens": 4568721.0, "step": 2330 }, { "entropy": 6.790478038787842, "epoch": 0.2334183035937422, "grad_norm": 1.09375, "learning_rate": 0.0004997985507976443, "loss": 6.7539, "mean_token_accuracy": 0.1210959531366825, "num_tokens": 4578265.0, "step": 2335 }, { "entropy": 6.713445091247559, "epoch": 0.23391812865497075, "grad_norm": 1.1171875, "learning_rate": 0.0004997970380811351, "loss": 6.718, "mean_token_accuracy": 0.1265711396932602, "num_tokens": 4588694.0, "step": 2340 }, { "entropy": 6.8143064975738525, "epoch": 0.23441795371619933, "grad_norm": 1.1328125, "learning_rate": 0.0004997955197087904, "loss": 6.7238, "mean_token_accuracy": 0.1284726820886135, "num_tokens": 4597754.0, "step": 2345 }, { "entropy": 6.756000995635986, "epoch": 0.2349177787774279, "grad_norm": 1.125, "learning_rate": 0.0004997939956806481, "loss": 6.7397, "mean_token_accuracy": 0.12147602438926697, "num_tokens": 4606874.0, "step": 2350 }, { "entropy": 6.706974267959595, "epoch": 0.23541760383865648, "grad_norm": 1.0859375, "learning_rate": 0.0004997924659967467, "loss": 6.623, "mean_token_accuracy": 0.12457457929849625, "num_tokens": 4615588.0, "step": 2355 }, { "entropy": 6.68896107673645, "epoch": 0.23591742889988504, "grad_norm": 1.046875, "learning_rate": 0.0004997909306571248, "loss": 6.7797, "mean_token_accuracy": 0.12551534697413444, "num_tokens": 4625919.0, "step": 2360 }, { "entropy": 6.834859418869018, "epoch": 0.2364172539611136, "grad_norm": 1.0234375, "learning_rate": 0.0004997893896618209, "loss": 6.726, "mean_token_accuracy": 0.11857106536626816, "num_tokens": 4635539.0, "step": 2365 }, { "entropy": 6.732093048095703, "epoch": 0.2369170790223422, "grad_norm": 0.9375, "learning_rate": 0.0004997878430108738, "loss": 6.7191, "mean_token_accuracy": 0.12062986120581627, "num_tokens": 4645833.0, "step": 2370 }, { "entropy": 6.7105419635772705, "epoch": 0.23741690408357075, "grad_norm": 1.296875, "learning_rate": 0.0004997862907043224, "loss": 6.8265, "mean_token_accuracy": 0.1232969455420971, "num_tokens": 4655166.0, "step": 2375 }, { "entropy": 6.9115959167480465, "epoch": 0.23791672914479933, "grad_norm": 1.0234375, "learning_rate": 0.0004997847327422059, "loss": 6.7108, "mean_token_accuracy": 0.12596101090312004, "num_tokens": 4664884.0, "step": 2380 }, { "entropy": 6.6541790008544925, "epoch": 0.2384165542060279, "grad_norm": 1.078125, "learning_rate": 0.0004997831691245632, "loss": 6.7907, "mean_token_accuracy": 0.12016936019062996, "num_tokens": 4675172.0, "step": 2385 }, { "entropy": 6.848490476608276, "epoch": 0.23891637926725645, "grad_norm": 1.1015625, "learning_rate": 0.0004997815998514337, "loss": 6.7032, "mean_token_accuracy": 0.12810124084353447, "num_tokens": 4684588.0, "step": 2390 }, { "entropy": 6.729746675491333, "epoch": 0.23941620432848504, "grad_norm": 1.0078125, "learning_rate": 0.0004997800249228572, "loss": 6.816, "mean_token_accuracy": 0.12293470725417137, "num_tokens": 4694434.0, "step": 2395 }, { "entropy": 6.746816682815552, "epoch": 0.2399160293897136, "grad_norm": 1.015625, "learning_rate": 0.0004997784443388732, "loss": 6.7548, "mean_token_accuracy": 0.12327200025320054, "num_tokens": 4705080.0, "step": 2400 }, { "entropy": 6.883273792266846, "epoch": 0.24041585445094216, "grad_norm": 1.40625, "learning_rate": 0.0004997768580995212, "loss": 6.8304, "mean_token_accuracy": 0.12185543552041053, "num_tokens": 4714466.0, "step": 2405 }, { "entropy": 6.736199378967285, "epoch": 0.24091567951217074, "grad_norm": 1.09375, "learning_rate": 0.0004997752662048413, "loss": 6.7419, "mean_token_accuracy": 0.12363232001662254, "num_tokens": 4724047.0, "step": 2410 }, { "entropy": 6.775224685668945, "epoch": 0.2414155045733993, "grad_norm": 1.0546875, "learning_rate": 0.0004997736686548736, "loss": 6.7772, "mean_token_accuracy": 0.11827057525515557, "num_tokens": 4733153.0, "step": 2415 }, { "entropy": 6.771958589553833, "epoch": 0.2419153296346279, "grad_norm": 0.94140625, "learning_rate": 0.0004997720654496582, "loss": 6.6351, "mean_token_accuracy": 0.1304004967212677, "num_tokens": 4743239.0, "step": 2420 }, { "entropy": 6.749918031692505, "epoch": 0.24241515469585645, "grad_norm": 1.015625, "learning_rate": 0.0004997704565892355, "loss": 6.6749, "mean_token_accuracy": 0.12188196331262588, "num_tokens": 4753128.0, "step": 2425 }, { "entropy": 6.858197546005249, "epoch": 0.242914979757085, "grad_norm": 1.2421875, "learning_rate": 0.0004997688420736459, "loss": 6.9063, "mean_token_accuracy": 0.10862480849027634, "num_tokens": 4764056.0, "step": 2430 }, { "entropy": 6.790316009521485, "epoch": 0.2434148048183136, "grad_norm": 1.0546875, "learning_rate": 0.0004997672219029301, "loss": 6.7419, "mean_token_accuracy": 0.12110049352049827, "num_tokens": 4773354.0, "step": 2435 }, { "entropy": 6.717658138275146, "epoch": 0.24391462987954216, "grad_norm": 1.015625, "learning_rate": 0.0004997655960771288, "loss": 6.6883, "mean_token_accuracy": 0.1205076090991497, "num_tokens": 4783367.0, "step": 2440 }, { "entropy": 6.718193531036377, "epoch": 0.24441445494077074, "grad_norm": 1.6953125, "learning_rate": 0.000499763964596283, "loss": 6.5672, "mean_token_accuracy": 0.13306122049689292, "num_tokens": 4793028.0, "step": 2445 }, { "entropy": 6.765444898605347, "epoch": 0.2449142800019993, "grad_norm": 1.015625, "learning_rate": 0.0004997623274604336, "loss": 6.7561, "mean_token_accuracy": 0.11872197464108467, "num_tokens": 4804032.0, "step": 2450 }, { "entropy": 6.793762731552124, "epoch": 0.24541410506322786, "grad_norm": 0.99609375, "learning_rate": 0.000499760684669622, "loss": 6.7854, "mean_token_accuracy": 0.12456026300787926, "num_tokens": 4813294.0, "step": 2455 }, { "entropy": 6.7408191680908205, "epoch": 0.24591393012445645, "grad_norm": 0.96875, "learning_rate": 0.0004997590362238894, "loss": 6.6902, "mean_token_accuracy": 0.11964407935738564, "num_tokens": 4823461.0, "step": 2460 }, { "entropy": 6.703203010559082, "epoch": 0.246413755185685, "grad_norm": 1.015625, "learning_rate": 0.0004997573821232772, "loss": 6.7469, "mean_token_accuracy": 0.1259793259203434, "num_tokens": 4832464.0, "step": 2465 }, { "entropy": 6.755440807342529, "epoch": 0.24691358024691357, "grad_norm": 0.9765625, "learning_rate": 0.0004997557223678272, "loss": 6.7035, "mean_token_accuracy": 0.11913309246301651, "num_tokens": 4842697.0, "step": 2470 }, { "entropy": 6.782284879684449, "epoch": 0.24741340530814215, "grad_norm": 1.0234375, "learning_rate": 0.0004997540569575809, "loss": 6.7543, "mean_token_accuracy": 0.12437557801604271, "num_tokens": 4853129.0, "step": 2475 }, { "entropy": 6.83038649559021, "epoch": 0.2479132303693707, "grad_norm": 1.046875, "learning_rate": 0.0004997523858925805, "loss": 6.7974, "mean_token_accuracy": 0.11816194653511047, "num_tokens": 4864048.0, "step": 2480 }, { "entropy": 6.671797800064087, "epoch": 0.2484130554305993, "grad_norm": 1.078125, "learning_rate": 0.0004997507091728678, "loss": 6.7311, "mean_token_accuracy": 0.12627621069550515, "num_tokens": 4874368.0, "step": 2485 }, { "entropy": 6.8561256408691404, "epoch": 0.24891288049182786, "grad_norm": 1.0234375, "learning_rate": 0.0004997490267984853, "loss": 6.7148, "mean_token_accuracy": 0.12414158284664153, "num_tokens": 4884813.0, "step": 2490 }, { "entropy": 6.699068689346314, "epoch": 0.24941270555305642, "grad_norm": 1.0625, "learning_rate": 0.0004997473387694749, "loss": 6.7832, "mean_token_accuracy": 0.118557108938694, "num_tokens": 4895594.0, "step": 2495 }, { "entropy": 6.756707620620728, "epoch": 0.249912530614285, "grad_norm": 0.97265625, "learning_rate": 0.0004997456450858793, "loss": 6.6781, "mean_token_accuracy": 0.12389897853136063, "num_tokens": 4904922.0, "step": 2500 }, { "entropy": 6.794224119186401, "epoch": 0.25041235567551356, "grad_norm": 1.0625, "learning_rate": 0.0004997439457477412, "loss": 6.6721, "mean_token_accuracy": 0.12629162073135375, "num_tokens": 4915009.0, "step": 2505 }, { "entropy": 6.742335557937622, "epoch": 0.25091218073674215, "grad_norm": 1.1015625, "learning_rate": 0.0004997422407551032, "loss": 6.818, "mean_token_accuracy": 0.117496757209301, "num_tokens": 4924916.0, "step": 2510 }, { "entropy": 6.740524244308472, "epoch": 0.2514120057979707, "grad_norm": 1.0390625, "learning_rate": 0.0004997405301080082, "loss": 6.7218, "mean_token_accuracy": 0.12168776243925095, "num_tokens": 4935127.0, "step": 2515 }, { "entropy": 6.776787757873535, "epoch": 0.25191183085919927, "grad_norm": 1.1875, "learning_rate": 0.0004997388138064994, "loss": 6.7088, "mean_token_accuracy": 0.12240934222936631, "num_tokens": 4944749.0, "step": 2520 }, { "entropy": 6.69001955986023, "epoch": 0.25241165592042786, "grad_norm": 1.0625, "learning_rate": 0.0004997370918506198, "loss": 6.568, "mean_token_accuracy": 0.1336754024028778, "num_tokens": 4953868.0, "step": 2525 }, { "entropy": 6.680736446380616, "epoch": 0.25291148098165644, "grad_norm": 1.03125, "learning_rate": 0.0004997353642404129, "loss": 6.6791, "mean_token_accuracy": 0.12432244718074799, "num_tokens": 4963282.0, "step": 2530 }, { "entropy": 6.6588935375213625, "epoch": 0.253411306042885, "grad_norm": 1.0546875, "learning_rate": 0.0004997336309759219, "loss": 6.531, "mean_token_accuracy": 0.13633738234639167, "num_tokens": 4973099.0, "step": 2535 }, { "entropy": 6.730578756332397, "epoch": 0.25391113110411356, "grad_norm": 1.109375, "learning_rate": 0.0004997318920571907, "loss": 6.6989, "mean_token_accuracy": 0.11887490078806877, "num_tokens": 4983771.0, "step": 2540 }, { "entropy": 6.627429342269897, "epoch": 0.25441095616534215, "grad_norm": 1.109375, "learning_rate": 0.000499730147484263, "loss": 6.5654, "mean_token_accuracy": 0.12911427095532418, "num_tokens": 4993648.0, "step": 2545 }, { "entropy": 6.69837760925293, "epoch": 0.2549107812265707, "grad_norm": 1.0703125, "learning_rate": 0.0004997283972571824, "loss": 6.7168, "mean_token_accuracy": 0.12526629120111465, "num_tokens": 5002821.0, "step": 2550 }, { "entropy": 6.832654714584351, "epoch": 0.25541060628779927, "grad_norm": 1.0859375, "learning_rate": 0.0004997266413759934, "loss": 6.7327, "mean_token_accuracy": 0.12186189666390419, "num_tokens": 5012655.0, "step": 2555 }, { "entropy": 6.656014776229858, "epoch": 0.25591043134902786, "grad_norm": 0.94921875, "learning_rate": 0.0004997248798407397, "loss": 6.7004, "mean_token_accuracy": 0.12474093288183212, "num_tokens": 5023649.0, "step": 2560 }, { "entropy": 6.723897504806518, "epoch": 0.2564102564102564, "grad_norm": 1.15625, "learning_rate": 0.0004997231126514659, "loss": 6.6708, "mean_token_accuracy": 0.13028084263205528, "num_tokens": 5031945.0, "step": 2565 }, { "entropy": 6.767000675201416, "epoch": 0.256910081471485, "grad_norm": 1.734375, "learning_rate": 0.0004997213398082165, "loss": 6.6893, "mean_token_accuracy": 0.12177317440509797, "num_tokens": 5042036.0, "step": 2570 }, { "entropy": 6.682856845855713, "epoch": 0.25740990653271356, "grad_norm": 1.0, "learning_rate": 0.000499719561311036, "loss": 6.7122, "mean_token_accuracy": 0.1242594949901104, "num_tokens": 5050986.0, "step": 2575 }, { "entropy": 6.787206935882568, "epoch": 0.2579097315939421, "grad_norm": 1.0234375, "learning_rate": 0.0004997177771599691, "loss": 6.7099, "mean_token_accuracy": 0.1260345883667469, "num_tokens": 5061408.0, "step": 2580 }, { "entropy": 6.657704401016235, "epoch": 0.2584095566551707, "grad_norm": 1.0859375, "learning_rate": 0.0004997159873550607, "loss": 6.6111, "mean_token_accuracy": 0.125968037545681, "num_tokens": 5071646.0, "step": 2585 }, { "entropy": 6.647315835952758, "epoch": 0.25890938171639927, "grad_norm": 0.875, "learning_rate": 0.0004997141918963561, "loss": 6.7173, "mean_token_accuracy": 0.12666191905736923, "num_tokens": 5083185.0, "step": 2590 }, { "entropy": 6.773238277435302, "epoch": 0.25940920677762785, "grad_norm": 1.09375, "learning_rate": 0.0004997123907839001, "loss": 6.6628, "mean_token_accuracy": 0.1251784197986126, "num_tokens": 5092993.0, "step": 2595 }, { "entropy": 6.78870210647583, "epoch": 0.2599090318388564, "grad_norm": 1.046875, "learning_rate": 0.0004997105840177381, "loss": 6.7272, "mean_token_accuracy": 0.12102791294455528, "num_tokens": 5102709.0, "step": 2600 }, { "entropy": 6.701229047775269, "epoch": 0.260408856900085, "grad_norm": 1.203125, "learning_rate": 0.0004997087715979157, "loss": 6.6704, "mean_token_accuracy": 0.11898972243070602, "num_tokens": 5112858.0, "step": 2605 }, { "entropy": 6.76274938583374, "epoch": 0.26090868196131356, "grad_norm": 1.1015625, "learning_rate": 0.0004997069535244785, "loss": 6.5925, "mean_token_accuracy": 0.13014568462967874, "num_tokens": 5123573.0, "step": 2610 }, { "entropy": 6.64758710861206, "epoch": 0.2614085070225421, "grad_norm": 1.0546875, "learning_rate": 0.0004997051297974722, "loss": 6.7694, "mean_token_accuracy": 0.12116136848926544, "num_tokens": 5132908.0, "step": 2615 }, { "entropy": 6.752505588531494, "epoch": 0.2619083320837707, "grad_norm": 0.97265625, "learning_rate": 0.0004997033004169425, "loss": 6.6314, "mean_token_accuracy": 0.13227704614400865, "num_tokens": 5142331.0, "step": 2620 }, { "entropy": 6.808556032180786, "epoch": 0.26240815714499927, "grad_norm": 1.0078125, "learning_rate": 0.0004997014653829357, "loss": 6.7369, "mean_token_accuracy": 0.12015433385968208, "num_tokens": 5152517.0, "step": 2625 }, { "entropy": 6.724541759490966, "epoch": 0.2629079822062278, "grad_norm": 0.98046875, "learning_rate": 0.0004996996246954977, "loss": 6.6678, "mean_token_accuracy": 0.12828353345394133, "num_tokens": 5162418.0, "step": 2630 }, { "entropy": 6.698705959320068, "epoch": 0.2634078072674564, "grad_norm": 1.078125, "learning_rate": 0.0004996977783546752, "loss": 6.69, "mean_token_accuracy": 0.1206023059785366, "num_tokens": 5171948.0, "step": 2635 }, { "entropy": 6.750772285461426, "epoch": 0.26390763232868497, "grad_norm": 1.109375, "learning_rate": 0.0004996959263605143, "loss": 6.6106, "mean_token_accuracy": 0.1264311730861664, "num_tokens": 5180963.0, "step": 2640 }, { "entropy": 6.683148622512817, "epoch": 0.2644074573899135, "grad_norm": 1.0546875, "learning_rate": 0.0004996940687130617, "loss": 6.7276, "mean_token_accuracy": 0.12301484346389771, "num_tokens": 5192305.0, "step": 2645 }, { "entropy": 6.740709686279297, "epoch": 0.2649072824511421, "grad_norm": 1.015625, "learning_rate": 0.0004996922054123641, "loss": 6.6007, "mean_token_accuracy": 0.1260277345776558, "num_tokens": 5201503.0, "step": 2650 }, { "entropy": 6.702259254455567, "epoch": 0.2654071075123707, "grad_norm": 1.15625, "learning_rate": 0.0004996903364584685, "loss": 6.5746, "mean_token_accuracy": 0.1269563689827919, "num_tokens": 5210206.0, "step": 2655 }, { "entropy": 6.542616653442383, "epoch": 0.26590693257359926, "grad_norm": 0.96875, "learning_rate": 0.0004996884618514219, "loss": 6.596, "mean_token_accuracy": 0.13134641647338868, "num_tokens": 5220256.0, "step": 2660 }, { "entropy": 6.699193620681763, "epoch": 0.2664067576348278, "grad_norm": 1.1640625, "learning_rate": 0.0004996865815912713, "loss": 6.6338, "mean_token_accuracy": 0.13359641507267953, "num_tokens": 5229128.0, "step": 2665 }, { "entropy": 6.726186513900757, "epoch": 0.2669065826960564, "grad_norm": 1.078125, "learning_rate": 0.0004996846956780642, "loss": 6.5722, "mean_token_accuracy": 0.12618556693196298, "num_tokens": 5239468.0, "step": 2670 }, { "entropy": 6.633094072341919, "epoch": 0.26740640775728497, "grad_norm": 1.0546875, "learning_rate": 0.000499682804111848, "loss": 6.6844, "mean_token_accuracy": 0.12155252695083618, "num_tokens": 5247957.0, "step": 2675 }, { "entropy": 6.73829493522644, "epoch": 0.2679062328185135, "grad_norm": 0.96484375, "learning_rate": 0.0004996809068926702, "loss": 6.6877, "mean_token_accuracy": 0.12203190922737121, "num_tokens": 5257960.0, "step": 2680 }, { "entropy": 6.618297576904297, "epoch": 0.2684060578797421, "grad_norm": 1.03125, "learning_rate": 0.0004996790040205786, "loss": 6.538, "mean_token_accuracy": 0.1295544274151325, "num_tokens": 5266696.0, "step": 2685 }, { "entropy": 6.642504405975342, "epoch": 0.2689058829409707, "grad_norm": 1.1171875, "learning_rate": 0.0004996770954956211, "loss": 6.52, "mean_token_accuracy": 0.1335084095597267, "num_tokens": 5275619.0, "step": 2690 }, { "entropy": 6.690548467636108, "epoch": 0.2694057080021992, "grad_norm": 1.03125, "learning_rate": 0.0004996751813178456, "loss": 6.6938, "mean_token_accuracy": 0.12373248711228371, "num_tokens": 5284884.0, "step": 2695 }, { "entropy": 6.612657642364502, "epoch": 0.2699055330634278, "grad_norm": 1.0625, "learning_rate": 0.0004996732614873005, "loss": 6.5796, "mean_token_accuracy": 0.13691650182008744, "num_tokens": 5293909.0, "step": 2700 }, { "entropy": 6.598701143264771, "epoch": 0.2704053581246564, "grad_norm": 1.078125, "learning_rate": 0.0004996713360040339, "loss": 6.6494, "mean_token_accuracy": 0.12244352400302887, "num_tokens": 5303142.0, "step": 2705 }, { "entropy": 6.737385845184326, "epoch": 0.27090518318588497, "grad_norm": 1.1171875, "learning_rate": 0.0004996694048680942, "loss": 6.595, "mean_token_accuracy": 0.12717368975281715, "num_tokens": 5313055.0, "step": 2710 }, { "entropy": 6.666927337646484, "epoch": 0.2714050082471135, "grad_norm": 0.98046875, "learning_rate": 0.0004996674680795302, "loss": 6.709, "mean_token_accuracy": 0.11881735101342202, "num_tokens": 5323773.0, "step": 2715 }, { "entropy": 6.573076391220093, "epoch": 0.2719048333083421, "grad_norm": 0.94921875, "learning_rate": 0.0004996655256383905, "loss": 6.487, "mean_token_accuracy": 0.14107831716537475, "num_tokens": 5334613.0, "step": 2720 }, { "entropy": 6.6817444324493405, "epoch": 0.2724046583695707, "grad_norm": 1.0078125, "learning_rate": 0.000499663577544724, "loss": 6.5659, "mean_token_accuracy": 0.13264155611395836, "num_tokens": 5344151.0, "step": 2725 }, { "entropy": 6.620177268981934, "epoch": 0.2729044834307992, "grad_norm": 1.078125, "learning_rate": 0.0004996616237985796, "loss": 6.549, "mean_token_accuracy": 0.1309521608054638, "num_tokens": 5352425.0, "step": 2730 }, { "entropy": 6.676284456253052, "epoch": 0.2734043084920278, "grad_norm": 1.0078125, "learning_rate": 0.0004996596644000066, "loss": 6.7542, "mean_token_accuracy": 0.12151754051446914, "num_tokens": 5361811.0, "step": 2735 }, { "entropy": 6.73824896812439, "epoch": 0.2739041335532564, "grad_norm": 1.015625, "learning_rate": 0.0004996576993490543, "loss": 6.6959, "mean_token_accuracy": 0.1195530690252781, "num_tokens": 5371463.0, "step": 2740 }, { "entropy": 6.662166357040405, "epoch": 0.2744039586144849, "grad_norm": 1.0390625, "learning_rate": 0.0004996557286457721, "loss": 6.5441, "mean_token_accuracy": 0.1362849183380604, "num_tokens": 5381464.0, "step": 2745 }, { "entropy": 6.587826251983643, "epoch": 0.2749037836757135, "grad_norm": 1.1328125, "learning_rate": 0.0004996537522902096, "loss": 6.634, "mean_token_accuracy": 0.12591350078582764, "num_tokens": 5391012.0, "step": 2750 }, { "entropy": 6.7804382801055905, "epoch": 0.2754036087369421, "grad_norm": 1.0234375, "learning_rate": 0.0004996517702824163, "loss": 6.7322, "mean_token_accuracy": 0.12323454171419143, "num_tokens": 5401198.0, "step": 2755 }, { "entropy": 6.769994783401489, "epoch": 0.2759034337981706, "grad_norm": 0.97265625, "learning_rate": 0.0004996497826224425, "loss": 6.6698, "mean_token_accuracy": 0.12419450357556343, "num_tokens": 5410592.0, "step": 2760 }, { "entropy": 6.562923526763916, "epoch": 0.2764032588593992, "grad_norm": 1.0859375, "learning_rate": 0.0004996477893103379, "loss": 6.6448, "mean_token_accuracy": 0.12875826954841613, "num_tokens": 5420878.0, "step": 2765 }, { "entropy": 6.72771463394165, "epoch": 0.2769030839206278, "grad_norm": 1.0859375, "learning_rate": 0.0004996457903461527, "loss": 6.643, "mean_token_accuracy": 0.12691074088215828, "num_tokens": 5431199.0, "step": 2770 }, { "entropy": 6.6997754096984865, "epoch": 0.2774029089818564, "grad_norm": 0.9765625, "learning_rate": 0.0004996437857299373, "loss": 6.5783, "mean_token_accuracy": 0.12888110503554345, "num_tokens": 5441661.0, "step": 2775 }, { "entropy": 6.5640599727630615, "epoch": 0.2779027340430849, "grad_norm": 1.015625, "learning_rate": 0.000499641775461742, "loss": 6.579, "mean_token_accuracy": 0.12949036434292793, "num_tokens": 5451863.0, "step": 2780 }, { "entropy": 6.697029161453247, "epoch": 0.2784025591043135, "grad_norm": 1.0546875, "learning_rate": 0.0004996397595416173, "loss": 6.6365, "mean_token_accuracy": 0.12379389107227326, "num_tokens": 5461600.0, "step": 2785 }, { "entropy": 6.774936103820801, "epoch": 0.2789023841655421, "grad_norm": 1.03125, "learning_rate": 0.0004996377379696143, "loss": 6.6492, "mean_token_accuracy": 0.12262091562151908, "num_tokens": 5470097.0, "step": 2790 }, { "entropy": 6.73469181060791, "epoch": 0.2794022092267706, "grad_norm": 1.046875, "learning_rate": 0.0004996357107457834, "loss": 6.814, "mean_token_accuracy": 0.11655468791723252, "num_tokens": 5480906.0, "step": 2795 }, { "entropy": 6.808956336975098, "epoch": 0.2799020342879992, "grad_norm": 1.140625, "learning_rate": 0.000499633677870176, "loss": 6.6844, "mean_token_accuracy": 0.12597069665789604, "num_tokens": 5489732.0, "step": 2800 }, { "entropy": 6.528180980682373, "epoch": 0.2804018593492278, "grad_norm": 0.96484375, "learning_rate": 0.0004996316393428429, "loss": 6.4803, "mean_token_accuracy": 0.13605385273694992, "num_tokens": 5498422.0, "step": 2805 }, { "entropy": 6.613443279266358, "epoch": 0.2809016844104563, "grad_norm": 0.9921875, "learning_rate": 0.0004996295951638357, "loss": 6.6409, "mean_token_accuracy": 0.12768530771136283, "num_tokens": 5507958.0, "step": 2810 }, { "entropy": 6.775778770446777, "epoch": 0.2814015094716849, "grad_norm": 1.09375, "learning_rate": 0.0004996275453332057, "loss": 6.6654, "mean_token_accuracy": 0.1298332244157791, "num_tokens": 5516752.0, "step": 2815 }, { "entropy": 6.648133945465088, "epoch": 0.2819013345329135, "grad_norm": 1.0703125, "learning_rate": 0.0004996254898510043, "loss": 6.6731, "mean_token_accuracy": 0.12450689151883125, "num_tokens": 5527211.0, "step": 2820 }, { "entropy": 6.654214859008789, "epoch": 0.282401159594142, "grad_norm": 1.078125, "learning_rate": 0.0004996234287172835, "loss": 6.5656, "mean_token_accuracy": 0.12709278836846352, "num_tokens": 5536925.0, "step": 2825 }, { "entropy": 6.69185094833374, "epoch": 0.2829009846553706, "grad_norm": 0.984375, "learning_rate": 0.000499621361932095, "loss": 6.7517, "mean_token_accuracy": 0.12027538269758224, "num_tokens": 5546800.0, "step": 2830 }, { "entropy": 6.633594799041748, "epoch": 0.2834008097165992, "grad_norm": 1.21875, "learning_rate": 0.0004996192894954909, "loss": 6.5781, "mean_token_accuracy": 0.12837735265493394, "num_tokens": 5557266.0, "step": 2835 }, { "entropy": 6.729125261306763, "epoch": 0.2839006347778278, "grad_norm": 1.078125, "learning_rate": 0.0004996172114075232, "loss": 6.5663, "mean_token_accuracy": 0.12667735964059829, "num_tokens": 5566169.0, "step": 2840 }, { "entropy": 6.662754964828491, "epoch": 0.2844004598390563, "grad_norm": 1.0859375, "learning_rate": 0.0004996151276682443, "loss": 6.6598, "mean_token_accuracy": 0.12701473608613015, "num_tokens": 5575566.0, "step": 2845 }, { "entropy": 6.615578985214233, "epoch": 0.2849002849002849, "grad_norm": 1.0546875, "learning_rate": 0.0004996130382777065, "loss": 6.546, "mean_token_accuracy": 0.13053665533661843, "num_tokens": 5584804.0, "step": 2850 }, { "entropy": 6.638299226760864, "epoch": 0.2854001099615135, "grad_norm": 1.0859375, "learning_rate": 0.0004996109432359625, "loss": 6.6009, "mean_token_accuracy": 0.1265592433512211, "num_tokens": 5594361.0, "step": 2855 }, { "entropy": 6.683030986785889, "epoch": 0.285899935022742, "grad_norm": 2.0625, "learning_rate": 0.0004996088425430651, "loss": 6.6219, "mean_token_accuracy": 0.12339444905519485, "num_tokens": 5605682.0, "step": 2860 }, { "entropy": 6.641170263290405, "epoch": 0.2863997600839706, "grad_norm": 1.046875, "learning_rate": 0.0004996067361990669, "loss": 6.6897, "mean_token_accuracy": 0.12035760283470154, "num_tokens": 5617251.0, "step": 2865 }, { "entropy": 6.7068572521209715, "epoch": 0.2868995851451992, "grad_norm": 0.96484375, "learning_rate": 0.0004996046242040209, "loss": 6.5628, "mean_token_accuracy": 0.12945612370967866, "num_tokens": 5627140.0, "step": 2870 }, { "entropy": 6.550381660461426, "epoch": 0.28739941020642773, "grad_norm": 1.1015625, "learning_rate": 0.0004996025065579805, "loss": 6.485, "mean_token_accuracy": 0.13200978338718414, "num_tokens": 5635486.0, "step": 2875 }, { "entropy": 6.645271348953247, "epoch": 0.2878992352676563, "grad_norm": 1.015625, "learning_rate": 0.0004996003832609988, "loss": 6.675, "mean_token_accuracy": 0.1206593632698059, "num_tokens": 5645621.0, "step": 2880 }, { "entropy": 6.811749696731567, "epoch": 0.2883990603288849, "grad_norm": 1.0625, "learning_rate": 0.0004995982543131292, "loss": 6.7572, "mean_token_accuracy": 0.11400788351893425, "num_tokens": 5655626.0, "step": 2885 }, { "entropy": 6.684689092636108, "epoch": 0.28889888539011344, "grad_norm": 1.015625, "learning_rate": 0.0004995961197144254, "loss": 6.6776, "mean_token_accuracy": 0.12474105134606361, "num_tokens": 5664547.0, "step": 2890 }, { "entropy": 6.67263617515564, "epoch": 0.289398710451342, "grad_norm": 1.046875, "learning_rate": 0.000499593979464941, "loss": 6.6308, "mean_token_accuracy": 0.12696049585938454, "num_tokens": 5674861.0, "step": 2895 }, { "entropy": 6.643967628479004, "epoch": 0.2898985355125706, "grad_norm": 0.984375, "learning_rate": 0.0004995918335647298, "loss": 6.5706, "mean_token_accuracy": 0.1286863476037979, "num_tokens": 5684143.0, "step": 2900 }, { "entropy": 6.593589925765992, "epoch": 0.2903983605737992, "grad_norm": 1.0390625, "learning_rate": 0.0004995896820138459, "loss": 6.5715, "mean_token_accuracy": 0.12647168189287186, "num_tokens": 5693837.0, "step": 2905 }, { "entropy": 6.714412641525269, "epoch": 0.29089818563502773, "grad_norm": 1.046875, "learning_rate": 0.0004995875248123434, "loss": 6.6512, "mean_token_accuracy": 0.11919039636850357, "num_tokens": 5704827.0, "step": 2910 }, { "entropy": 6.721566820144654, "epoch": 0.2913980106962563, "grad_norm": 1.0703125, "learning_rate": 0.0004995853619602766, "loss": 6.6848, "mean_token_accuracy": 0.12311125099658966, "num_tokens": 5714419.0, "step": 2915 }, { "entropy": 6.657805967330932, "epoch": 0.2918978357574849, "grad_norm": 0.9140625, "learning_rate": 0.0004995831934576998, "loss": 6.6042, "mean_token_accuracy": 0.12744421064853667, "num_tokens": 5724983.0, "step": 2920 }, { "entropy": 6.611767673492432, "epoch": 0.29239766081871343, "grad_norm": 0.99609375, "learning_rate": 0.0004995810193046677, "loss": 6.5242, "mean_token_accuracy": 0.13742104694247245, "num_tokens": 5734471.0, "step": 2925 }, { "entropy": 6.707096099853516, "epoch": 0.292897485879942, "grad_norm": 1.046875, "learning_rate": 0.000499578839501235, "loss": 6.6545, "mean_token_accuracy": 0.12848085910081863, "num_tokens": 5744801.0, "step": 2930 }, { "entropy": 6.626270914077759, "epoch": 0.2933973109411706, "grad_norm": 1.078125, "learning_rate": 0.0004995766540474564, "loss": 6.6228, "mean_token_accuracy": 0.12304180413484574, "num_tokens": 5754267.0, "step": 2935 }, { "entropy": 6.61904239654541, "epoch": 0.29389713600239914, "grad_norm": 0.921875, "learning_rate": 0.000499574462943387, "loss": 6.5306, "mean_token_accuracy": 0.13505666479468345, "num_tokens": 5764466.0, "step": 2940 }, { "entropy": 6.673902082443237, "epoch": 0.2943969610636277, "grad_norm": 0.92578125, "learning_rate": 0.000499572266189082, "loss": 6.6548, "mean_token_accuracy": 0.12099963128566742, "num_tokens": 5775158.0, "step": 2945 }, { "entropy": 6.636359071731567, "epoch": 0.2948967861248563, "grad_norm": 1.15625, "learning_rate": 0.0004995700637845964, "loss": 6.4623, "mean_token_accuracy": 0.13724422752857207, "num_tokens": 5783320.0, "step": 2950 }, { "entropy": 6.554117107391358, "epoch": 0.29539661118608485, "grad_norm": 0.9609375, "learning_rate": 0.0004995678557299859, "loss": 6.6023, "mean_token_accuracy": 0.1300165981054306, "num_tokens": 5792980.0, "step": 2955 }, { "entropy": 6.71733250617981, "epoch": 0.29589643624731343, "grad_norm": 1.0078125, "learning_rate": 0.0004995656420253058, "loss": 6.6511, "mean_token_accuracy": 0.12479741126298904, "num_tokens": 5802338.0, "step": 2960 }, { "entropy": 6.630457496643066, "epoch": 0.296396261308542, "grad_norm": 1.140625, "learning_rate": 0.000499563422670612, "loss": 6.554, "mean_token_accuracy": 0.12994145452976227, "num_tokens": 5811388.0, "step": 2965 }, { "entropy": 6.584511566162109, "epoch": 0.2968960863697706, "grad_norm": 1.015625, "learning_rate": 0.0004995611976659604, "loss": 6.5898, "mean_token_accuracy": 0.127712956815958, "num_tokens": 5821108.0, "step": 2970 }, { "entropy": 6.6266556739807125, "epoch": 0.29739591143099914, "grad_norm": 1.0703125, "learning_rate": 0.0004995589670114067, "loss": 6.6609, "mean_token_accuracy": 0.11711250171065331, "num_tokens": 5831389.0, "step": 2975 }, { "entropy": 6.604189395904541, "epoch": 0.2978957364922277, "grad_norm": 0.98046875, "learning_rate": 0.0004995567307070072, "loss": 6.4889, "mean_token_accuracy": 0.13330937549471855, "num_tokens": 5840392.0, "step": 2980 }, { "entropy": 6.632587146759033, "epoch": 0.2983955615534563, "grad_norm": 1.0078125, "learning_rate": 0.0004995544887528182, "loss": 6.5082, "mean_token_accuracy": 0.13582244664430618, "num_tokens": 5850032.0, "step": 2985 }, { "entropy": 6.613868570327758, "epoch": 0.29889538661468484, "grad_norm": 1.09375, "learning_rate": 0.0004995522411488959, "loss": 6.574, "mean_token_accuracy": 0.12751223295927047, "num_tokens": 5859204.0, "step": 2990 }, { "entropy": 6.610184240341186, "epoch": 0.29939521167591343, "grad_norm": 1.1015625, "learning_rate": 0.0004995499878952971, "loss": 6.588, "mean_token_accuracy": 0.13020774498581886, "num_tokens": 5868582.0, "step": 2995 }, { "entropy": 6.630722141265869, "epoch": 0.299895036737142, "grad_norm": 0.9921875, "learning_rate": 0.0004995477289920784, "loss": 6.5448, "mean_token_accuracy": 0.12928271293640137, "num_tokens": 5879601.0, "step": 3000 }, { "epoch": 0.299895036737142, "eval_entropy": 6.478444874947049, "eval_loss": 6.631077289581299, "eval_mean_token_accuracy": 0.13178826568691893, "eval_num_tokens": 5879601.0, "eval_runtime": 23.8125, "eval_samples_per_second": 1303.725, "eval_steps_per_second": 162.981, "step": 3000 }, { "entropy": 6.6075661182403564, "epoch": 0.30039486179837055, "grad_norm": 0.953125, "learning_rate": 0.0004995454644392967, "loss": 6.587, "mean_token_accuracy": 0.12043059319257736, "num_tokens": 5890255.0, "step": 3005 }, { "entropy": 6.612881708145141, "epoch": 0.30089468685959914, "grad_norm": 1.09375, "learning_rate": 0.0004995431942370087, "loss": 6.6179, "mean_token_accuracy": 0.13473038971424103, "num_tokens": 5899965.0, "step": 3010 }, { "entropy": 6.637569236755371, "epoch": 0.3013945119208277, "grad_norm": 1.0859375, "learning_rate": 0.0004995409183852718, "loss": 6.5262, "mean_token_accuracy": 0.13055912107229234, "num_tokens": 5910082.0, "step": 3015 }, { "entropy": 6.558588743209839, "epoch": 0.30189433698205626, "grad_norm": 1.125, "learning_rate": 0.0004995386368841432, "loss": 6.6306, "mean_token_accuracy": 0.12224628701806069, "num_tokens": 5920267.0, "step": 3020 }, { "entropy": 6.679111623764038, "epoch": 0.30239416204328484, "grad_norm": 1.125, "learning_rate": 0.0004995363497336802, "loss": 6.609, "mean_token_accuracy": 0.130937509983778, "num_tokens": 5929275.0, "step": 3025 }, { "entropy": 6.681234884262085, "epoch": 0.30289398710451343, "grad_norm": 1.046875, "learning_rate": 0.0004995340569339405, "loss": 6.6373, "mean_token_accuracy": 0.12426983788609505, "num_tokens": 5939305.0, "step": 3030 }, { "entropy": 6.697987699508667, "epoch": 0.303393812165742, "grad_norm": 1.8515625, "learning_rate": 0.0004995317584849817, "loss": 6.7081, "mean_token_accuracy": 0.11630848348140717, "num_tokens": 5950816.0, "step": 3035 }, { "entropy": 6.536932706832886, "epoch": 0.30389363722697055, "grad_norm": 1.0, "learning_rate": 0.0004995294543868615, "loss": 6.4835, "mean_token_accuracy": 0.13960207998752594, "num_tokens": 5959824.0, "step": 3040 }, { "entropy": 6.647433090209961, "epoch": 0.30439346228819913, "grad_norm": 1.0703125, "learning_rate": 0.0004995271446396382, "loss": 6.5884, "mean_token_accuracy": 0.13330790847539903, "num_tokens": 5968752.0, "step": 3045 }, { "entropy": 6.600769710540772, "epoch": 0.3048932873494277, "grad_norm": 1.046875, "learning_rate": 0.0004995248292433697, "loss": 6.5454, "mean_token_accuracy": 0.12558241337537765, "num_tokens": 5979085.0, "step": 3050 }, { "entropy": 6.625737810134888, "epoch": 0.30539311241065625, "grad_norm": 0.91015625, "learning_rate": 0.0004995225081981142, "loss": 6.5855, "mean_token_accuracy": 0.12906341180205344, "num_tokens": 5990378.0, "step": 3055 }, { "entropy": 6.598832750320435, "epoch": 0.30589293747188484, "grad_norm": 1.046875, "learning_rate": 0.0004995201815039301, "loss": 6.4633, "mean_token_accuracy": 0.13708525747060776, "num_tokens": 5999524.0, "step": 3060 }, { "entropy": 6.562254190444946, "epoch": 0.3063927625331134, "grad_norm": 1.078125, "learning_rate": 0.0004995178491608762, "loss": 6.5898, "mean_token_accuracy": 0.12790925949811935, "num_tokens": 6009928.0, "step": 3065 }, { "entropy": 6.536128902435303, "epoch": 0.30689258759434196, "grad_norm": 1.015625, "learning_rate": 0.0004995155111690107, "loss": 6.4702, "mean_token_accuracy": 0.13199358731508254, "num_tokens": 6019683.0, "step": 3070 }, { "entropy": 6.708814334869385, "epoch": 0.30739241265557055, "grad_norm": 1.1015625, "learning_rate": 0.000499513167528393, "loss": 6.5986, "mean_token_accuracy": 0.12633300423622132, "num_tokens": 6030506.0, "step": 3075 }, { "entropy": 6.63917818069458, "epoch": 0.30789223771679913, "grad_norm": 1.1640625, "learning_rate": 0.0004995108182390815, "loss": 6.5794, "mean_token_accuracy": 0.13186729699373245, "num_tokens": 6039720.0, "step": 3080 }, { "entropy": 6.478183078765869, "epoch": 0.30839206277802766, "grad_norm": 1.03125, "learning_rate": 0.0004995084633011359, "loss": 6.4306, "mean_token_accuracy": 0.13840741142630578, "num_tokens": 6049336.0, "step": 3085 }, { "entropy": 6.526669502258301, "epoch": 0.30889188783925625, "grad_norm": 1.0703125, "learning_rate": 0.000499506102714615, "loss": 6.4328, "mean_token_accuracy": 0.12964970394968986, "num_tokens": 6059420.0, "step": 3090 }, { "entropy": 6.593797445297241, "epoch": 0.30939171290048484, "grad_norm": 1.109375, "learning_rate": 0.0004995037364795782, "loss": 6.5344, "mean_token_accuracy": 0.13578092977404593, "num_tokens": 6069035.0, "step": 3095 }, { "entropy": 6.580455732345581, "epoch": 0.3098915379617134, "grad_norm": 1.03125, "learning_rate": 0.0004995013645960853, "loss": 6.533, "mean_token_accuracy": 0.12749103531241418, "num_tokens": 6077863.0, "step": 3100 }, { "entropy": 6.60352201461792, "epoch": 0.31039136302294196, "grad_norm": 1.03125, "learning_rate": 0.0004994989870641958, "loss": 6.5743, "mean_token_accuracy": 0.1299404464662075, "num_tokens": 6088929.0, "step": 3105 }, { "entropy": 6.558046865463257, "epoch": 0.31089118808417054, "grad_norm": 1.0625, "learning_rate": 0.0004994966038839695, "loss": 6.5045, "mean_token_accuracy": 0.13678478747606276, "num_tokens": 6098673.0, "step": 3110 }, { "entropy": 6.573744106292724, "epoch": 0.31139101314539913, "grad_norm": 1.296875, "learning_rate": 0.0004994942150554666, "loss": 6.4069, "mean_token_accuracy": 0.1336665131151676, "num_tokens": 6107289.0, "step": 3115 }, { "entropy": 6.537808895111084, "epoch": 0.31189083820662766, "grad_norm": 0.95703125, "learning_rate": 0.0004994918205787468, "loss": 6.4508, "mean_token_accuracy": 0.13489218950271606, "num_tokens": 6117811.0, "step": 3120 }, { "entropy": 6.578155469894409, "epoch": 0.31239066326785625, "grad_norm": 1.0078125, "learning_rate": 0.0004994894204538706, "loss": 6.5531, "mean_token_accuracy": 0.12874066233634948, "num_tokens": 6127740.0, "step": 3125 }, { "entropy": 6.6143735408782955, "epoch": 0.31289048832908484, "grad_norm": 1.0078125, "learning_rate": 0.0004994870146808984, "loss": 6.5534, "mean_token_accuracy": 0.12975090965628625, "num_tokens": 6137253.0, "step": 3130 }, { "entropy": 6.611574411392212, "epoch": 0.31339031339031337, "grad_norm": 1.0859375, "learning_rate": 0.0004994846032598906, "loss": 6.5853, "mean_token_accuracy": 0.12906740829348565, "num_tokens": 6147420.0, "step": 3135 }, { "entropy": 6.590312719345093, "epoch": 0.31389013845154196, "grad_norm": 1.0, "learning_rate": 0.0004994821861909082, "loss": 6.5257, "mean_token_accuracy": 0.13443489223718644, "num_tokens": 6156436.0, "step": 3140 }, { "entropy": 6.477894592285156, "epoch": 0.31438996351277054, "grad_norm": 1.078125, "learning_rate": 0.0004994797634740114, "loss": 6.4677, "mean_token_accuracy": 0.12823034226894378, "num_tokens": 6165526.0, "step": 3145 }, { "entropy": 6.686942195892334, "epoch": 0.3148897885739991, "grad_norm": 1.125, "learning_rate": 0.0004994773351092618, "loss": 6.6826, "mean_token_accuracy": 0.12269697338342667, "num_tokens": 6176093.0, "step": 3150 }, { "entropy": 6.632466173171997, "epoch": 0.31538961363522766, "grad_norm": 1.109375, "learning_rate": 0.00049947490109672, "loss": 6.4976, "mean_token_accuracy": 0.13914723843336105, "num_tokens": 6185373.0, "step": 3155 }, { "entropy": 6.567219924926758, "epoch": 0.31588943869645625, "grad_norm": 1.078125, "learning_rate": 0.0004994724614364476, "loss": 6.6106, "mean_token_accuracy": 0.12375282943248749, "num_tokens": 6196252.0, "step": 3160 }, { "entropy": 6.682858514785766, "epoch": 0.31638926375768484, "grad_norm": 1.1953125, "learning_rate": 0.0004994700161285058, "loss": 6.5178, "mean_token_accuracy": 0.13397348448634147, "num_tokens": 6206463.0, "step": 3165 }, { "entropy": 6.575518178939819, "epoch": 0.31688908881891337, "grad_norm": 1.046875, "learning_rate": 0.000499467565172956, "loss": 6.5176, "mean_token_accuracy": 0.13587507605552673, "num_tokens": 6216676.0, "step": 3170 }, { "entropy": 6.581781101226807, "epoch": 0.31738891388014195, "grad_norm": 0.9375, "learning_rate": 0.0004994651085698602, "loss": 6.5516, "mean_token_accuracy": 0.12568040937185287, "num_tokens": 6227261.0, "step": 3175 }, { "entropy": 6.595517110824585, "epoch": 0.31788873894137054, "grad_norm": 1.1015625, "learning_rate": 0.00049946264631928, "loss": 6.484, "mean_token_accuracy": 0.12769982665777208, "num_tokens": 6237468.0, "step": 3180 }, { "entropy": 6.529371881484986, "epoch": 0.3183885640025991, "grad_norm": 1.0703125, "learning_rate": 0.0004994601784212774, "loss": 6.4489, "mean_token_accuracy": 0.13162523061037062, "num_tokens": 6247164.0, "step": 3185 }, { "entropy": 6.519611978530884, "epoch": 0.31888838906382766, "grad_norm": 0.95703125, "learning_rate": 0.0004994577048759144, "loss": 6.54, "mean_token_accuracy": 0.13035092502832413, "num_tokens": 6257635.0, "step": 3190 }, { "entropy": 6.698423528671265, "epoch": 0.31938821412505625, "grad_norm": 1.03125, "learning_rate": 0.0004994552256832533, "loss": 6.6056, "mean_token_accuracy": 0.13065118864178657, "num_tokens": 6266823.0, "step": 3195 }, { "entropy": 6.6359423160552975, "epoch": 0.3198880391862848, "grad_norm": 1.203125, "learning_rate": 0.0004994527408433566, "loss": 6.5154, "mean_token_accuracy": 0.13732208013534547, "num_tokens": 6276527.0, "step": 3200 }, { "entropy": 6.59774079322815, "epoch": 0.32038786424751337, "grad_norm": 1.1328125, "learning_rate": 0.0004994502503562865, "loss": 6.5771, "mean_token_accuracy": 0.12412868291139603, "num_tokens": 6286499.0, "step": 3205 }, { "entropy": 6.558255195617676, "epoch": 0.32088768930874195, "grad_norm": 1.0546875, "learning_rate": 0.000499447754222106, "loss": 6.5125, "mean_token_accuracy": 0.13360145688056946, "num_tokens": 6296550.0, "step": 3210 }, { "entropy": 6.580250597000122, "epoch": 0.3213875143699705, "grad_norm": 1.0, "learning_rate": 0.0004994452524408777, "loss": 6.5635, "mean_token_accuracy": 0.12742604464292526, "num_tokens": 6306951.0, "step": 3215 }, { "entropy": 6.687309217453003, "epoch": 0.32188733943119907, "grad_norm": 1.2421875, "learning_rate": 0.0004994427450126646, "loss": 6.5762, "mean_token_accuracy": 0.1241823248565197, "num_tokens": 6316026.0, "step": 3220 }, { "entropy": 6.490858936309815, "epoch": 0.32238716449242766, "grad_norm": 1.234375, "learning_rate": 0.0004994402319375298, "loss": 6.52, "mean_token_accuracy": 0.13340955302119256, "num_tokens": 6325064.0, "step": 3225 }, { "entropy": 6.593712186813354, "epoch": 0.32288698955365625, "grad_norm": 1.1640625, "learning_rate": 0.0004994377132155366, "loss": 6.5463, "mean_token_accuracy": 0.1296512231230736, "num_tokens": 6334443.0, "step": 3230 }, { "entropy": 6.64386625289917, "epoch": 0.3233868146148848, "grad_norm": 1.0625, "learning_rate": 0.0004994351888467482, "loss": 6.5646, "mean_token_accuracy": 0.12805707305669783, "num_tokens": 6346103.0, "step": 3235 }, { "entropy": 6.5068731784820555, "epoch": 0.32388663967611336, "grad_norm": 1.0234375, "learning_rate": 0.0004994326588312282, "loss": 6.5322, "mean_token_accuracy": 0.13017322793602942, "num_tokens": 6356576.0, "step": 3240 }, { "entropy": 6.642087459564209, "epoch": 0.32438646473734195, "grad_norm": 1.0390625, "learning_rate": 0.0004994301231690403, "loss": 6.5327, "mean_token_accuracy": 0.13048202469944953, "num_tokens": 6364796.0, "step": 3245 }, { "entropy": 6.612889957427979, "epoch": 0.3248862897985705, "grad_norm": 0.98046875, "learning_rate": 0.0004994275818602482, "loss": 6.6128, "mean_token_accuracy": 0.12709691599011422, "num_tokens": 6374951.0, "step": 3250 }, { "entropy": 6.540645408630371, "epoch": 0.32538611485979907, "grad_norm": 1.0546875, "learning_rate": 0.0004994250349049159, "loss": 6.5089, "mean_token_accuracy": 0.1306569382548332, "num_tokens": 6384230.0, "step": 3255 }, { "entropy": 6.621853971481324, "epoch": 0.32588593992102766, "grad_norm": 1.015625, "learning_rate": 0.0004994224823031075, "loss": 6.492, "mean_token_accuracy": 0.13094476982951164, "num_tokens": 6394070.0, "step": 3260 }, { "entropy": 6.502137517929077, "epoch": 0.3263857649822562, "grad_norm": 1.1015625, "learning_rate": 0.0004994199240548873, "loss": 6.4865, "mean_token_accuracy": 0.13274573534727097, "num_tokens": 6403968.0, "step": 3265 }, { "entropy": 6.6335138320922855, "epoch": 0.3268855900434848, "grad_norm": 1.1015625, "learning_rate": 0.0004994173601603194, "loss": 6.5944, "mean_token_accuracy": 0.13025195598602296, "num_tokens": 6413254.0, "step": 3270 }, { "entropy": 6.542357492446899, "epoch": 0.32738541510471336, "grad_norm": 1.140625, "learning_rate": 0.0004994147906194684, "loss": 6.4343, "mean_token_accuracy": 0.1355332300066948, "num_tokens": 6421266.0, "step": 3275 }, { "entropy": 6.574606847763062, "epoch": 0.3278852401659419, "grad_norm": 1.1484375, "learning_rate": 0.0004994122154323992, "loss": 6.5638, "mean_token_accuracy": 0.12714037150144578, "num_tokens": 6429596.0, "step": 3280 }, { "entropy": 6.678783321380616, "epoch": 0.3283850652271705, "grad_norm": 1.0546875, "learning_rate": 0.0004994096345991763, "loss": 6.5592, "mean_token_accuracy": 0.12805289700627326, "num_tokens": 6440825.0, "step": 3285 }, { "entropy": 6.474652099609375, "epoch": 0.32888489028839907, "grad_norm": 1.078125, "learning_rate": 0.0004994070481198649, "loss": 6.5034, "mean_token_accuracy": 0.13392820730805396, "num_tokens": 6450576.0, "step": 3290 }, { "entropy": 6.600502347946167, "epoch": 0.32938471534962765, "grad_norm": 1.078125, "learning_rate": 0.0004994044559945296, "loss": 6.5202, "mean_token_accuracy": 0.13730576187372207, "num_tokens": 6459673.0, "step": 3295 }, { "entropy": 6.560824251174926, "epoch": 0.3298845404108562, "grad_norm": 0.98828125, "learning_rate": 0.0004994018582232361, "loss": 6.5073, "mean_token_accuracy": 0.1271762117743492, "num_tokens": 6469353.0, "step": 3300 }, { "entropy": 6.5393877029418945, "epoch": 0.3303843654720848, "grad_norm": 1.09375, "learning_rate": 0.0004993992548060497, "loss": 6.5087, "mean_token_accuracy": 0.13126223683357238, "num_tokens": 6479610.0, "step": 3305 }, { "entropy": 6.524065208435059, "epoch": 0.33088419053331336, "grad_norm": 1.015625, "learning_rate": 0.0004993966457430357, "loss": 6.5624, "mean_token_accuracy": 0.13205365911126138, "num_tokens": 6488866.0, "step": 3310 }, { "entropy": 6.609571266174316, "epoch": 0.3313840155945419, "grad_norm": 1.046875, "learning_rate": 0.0004993940310342598, "loss": 6.434, "mean_token_accuracy": 0.1394350454211235, "num_tokens": 6498396.0, "step": 3315 }, { "entropy": 6.480389213562011, "epoch": 0.3318838406557705, "grad_norm": 1.0625, "learning_rate": 0.0004993914106797879, "loss": 6.4496, "mean_token_accuracy": 0.1399465799331665, "num_tokens": 6508347.0, "step": 3320 }, { "entropy": 6.6146210670471195, "epoch": 0.33238366571699907, "grad_norm": 1.0234375, "learning_rate": 0.0004993887846796858, "loss": 6.5599, "mean_token_accuracy": 0.12741111367940902, "num_tokens": 6518369.0, "step": 3325 }, { "entropy": 6.507545328140258, "epoch": 0.3328834907782276, "grad_norm": 1.03125, "learning_rate": 0.0004993861530340196, "loss": 6.5303, "mean_token_accuracy": 0.13504743203520775, "num_tokens": 6527477.0, "step": 3330 }, { "entropy": 6.551281929016113, "epoch": 0.3333833158394562, "grad_norm": 1.0703125, "learning_rate": 0.0004993835157428555, "loss": 6.4473, "mean_token_accuracy": 0.1366249904036522, "num_tokens": 6536271.0, "step": 3335 }, { "entropy": 6.595297527313233, "epoch": 0.33388314090068477, "grad_norm": 1.046875, "learning_rate": 0.0004993808728062599, "loss": 6.5704, "mean_token_accuracy": 0.13260070234537125, "num_tokens": 6546295.0, "step": 3340 }, { "entropy": 6.5805864334106445, "epoch": 0.3343829659619133, "grad_norm": 0.96875, "learning_rate": 0.0004993782242242994, "loss": 6.4849, "mean_token_accuracy": 0.1375689074397087, "num_tokens": 6557338.0, "step": 3345 }, { "entropy": 6.52690167427063, "epoch": 0.3348827910231419, "grad_norm": 1.0390625, "learning_rate": 0.0004993755699970404, "loss": 6.496, "mean_token_accuracy": 0.13343513533473014, "num_tokens": 6567916.0, "step": 3350 }, { "entropy": 6.577276420593262, "epoch": 0.3353826160843705, "grad_norm": 1.046875, "learning_rate": 0.0004993729101245498, "loss": 6.6029, "mean_token_accuracy": 0.1312417969107628, "num_tokens": 6577821.0, "step": 3355 }, { "entropy": 6.616403436660766, "epoch": 0.33588244114559906, "grad_norm": 1.0234375, "learning_rate": 0.0004993702446068945, "loss": 6.4814, "mean_token_accuracy": 0.1339896112680435, "num_tokens": 6587674.0, "step": 3360 }, { "entropy": 6.524472713470459, "epoch": 0.3363822662068276, "grad_norm": 1.046875, "learning_rate": 0.0004993675734441416, "loss": 6.5612, "mean_token_accuracy": 0.1359415054321289, "num_tokens": 6597292.0, "step": 3365 }, { "entropy": 6.487587928771973, "epoch": 0.3368820912680562, "grad_norm": 1.046875, "learning_rate": 0.0004993648966363583, "loss": 6.4885, "mean_token_accuracy": 0.13474380001425743, "num_tokens": 6608698.0, "step": 3370 }, { "entropy": 6.596515083312989, "epoch": 0.33738191632928477, "grad_norm": 1.09375, "learning_rate": 0.000499362214183612, "loss": 6.485, "mean_token_accuracy": 0.12874717712402345, "num_tokens": 6617914.0, "step": 3375 }, { "entropy": 6.492099285125732, "epoch": 0.3378817413905133, "grad_norm": 1.0078125, "learning_rate": 0.00049935952608597, "loss": 6.4483, "mean_token_accuracy": 0.1352960519492626, "num_tokens": 6627457.0, "step": 3380 }, { "entropy": 6.613459873199463, "epoch": 0.3383815664517419, "grad_norm": 1.125, "learning_rate": 0.0004993568323435002, "loss": 6.4821, "mean_token_accuracy": 0.1378979541361332, "num_tokens": 6636511.0, "step": 3385 }, { "entropy": 6.553523159027099, "epoch": 0.3388813915129705, "grad_norm": 1.0078125, "learning_rate": 0.0004993541329562702, "loss": 6.4776, "mean_token_accuracy": 0.1300669088959694, "num_tokens": 6647028.0, "step": 3390 }, { "entropy": 6.525398588180542, "epoch": 0.339381216574199, "grad_norm": 1.078125, "learning_rate": 0.0004993514279243477, "loss": 6.5301, "mean_token_accuracy": 0.13475566282868384, "num_tokens": 6656407.0, "step": 3395 }, { "entropy": 6.531813669204712, "epoch": 0.3398810416354276, "grad_norm": 1.1640625, "learning_rate": 0.0004993487172478012, "loss": 6.4775, "mean_token_accuracy": 0.13646075278520584, "num_tokens": 6665554.0, "step": 3400 }, { "entropy": 6.620145225524903, "epoch": 0.3403808666966562, "grad_norm": 0.98046875, "learning_rate": 0.0004993460009266988, "loss": 6.5394, "mean_token_accuracy": 0.12786303758621215, "num_tokens": 6675730.0, "step": 3405 }, { "entropy": 6.488579177856446, "epoch": 0.3408806917578847, "grad_norm": 1.0390625, "learning_rate": 0.0004993432789611086, "loss": 6.4328, "mean_token_accuracy": 0.1401745080947876, "num_tokens": 6685871.0, "step": 3410 }, { "entropy": 6.628891897201538, "epoch": 0.3413805168191133, "grad_norm": 0.98828125, "learning_rate": 0.0004993405513510992, "loss": 6.6577, "mean_token_accuracy": 0.12042568475008011, "num_tokens": 6697503.0, "step": 3415 }, { "entropy": 6.622269010543823, "epoch": 0.3418803418803419, "grad_norm": 1.1171875, "learning_rate": 0.0004993378180967394, "loss": 6.46, "mean_token_accuracy": 0.13375439420342444, "num_tokens": 6708022.0, "step": 3420 }, { "entropy": 6.51132116317749, "epoch": 0.3423801669415705, "grad_norm": 0.984375, "learning_rate": 0.0004993350791980978, "loss": 6.5365, "mean_token_accuracy": 0.13535891547799112, "num_tokens": 6717510.0, "step": 3425 }, { "entropy": 6.572848892211914, "epoch": 0.342879992002799, "grad_norm": 1.2578125, "learning_rate": 0.0004993323346552433, "loss": 6.5434, "mean_token_accuracy": 0.13333892300724984, "num_tokens": 6726538.0, "step": 3430 }, { "entropy": 6.582985877990723, "epoch": 0.3433798170640276, "grad_norm": 1.0546875, "learning_rate": 0.0004993295844682449, "loss": 6.4511, "mean_token_accuracy": 0.13790654987096787, "num_tokens": 6736750.0, "step": 3435 }, { "entropy": 6.535582828521728, "epoch": 0.3438796421252562, "grad_norm": 1.015625, "learning_rate": 0.000499326828637172, "loss": 6.5043, "mean_token_accuracy": 0.12834450080990792, "num_tokens": 6746366.0, "step": 3440 }, { "entropy": 6.51208758354187, "epoch": 0.3443794671864847, "grad_norm": 1.0859375, "learning_rate": 0.0004993240671620938, "loss": 6.52, "mean_token_accuracy": 0.12855228558182716, "num_tokens": 6755887.0, "step": 3445 }, { "entropy": 6.592728948593139, "epoch": 0.3448792922477133, "grad_norm": 1.1328125, "learning_rate": 0.0004993213000430797, "loss": 6.5489, "mean_token_accuracy": 0.13966599181294442, "num_tokens": 6764434.0, "step": 3450 }, { "entropy": 6.631072187423706, "epoch": 0.3453791173089419, "grad_norm": 1.109375, "learning_rate": 0.0004993185272801995, "loss": 6.5996, "mean_token_accuracy": 0.12416719496250153, "num_tokens": 6774237.0, "step": 3455 }, { "entropy": 6.655964422225952, "epoch": 0.3458789423701704, "grad_norm": 1.046875, "learning_rate": 0.0004993157488735228, "loss": 6.468, "mean_token_accuracy": 0.13427117168903352, "num_tokens": 6784537.0, "step": 3460 }, { "entropy": 6.486367416381836, "epoch": 0.346378767431399, "grad_norm": 1.1484375, "learning_rate": 0.0004993129648231197, "loss": 6.4571, "mean_token_accuracy": 0.1391492322087288, "num_tokens": 6794223.0, "step": 3465 }, { "entropy": 6.490914535522461, "epoch": 0.3468785924926276, "grad_norm": 1.078125, "learning_rate": 0.00049931017512906, "loss": 6.5119, "mean_token_accuracy": 0.12897660657763482, "num_tokens": 6803680.0, "step": 3470 }, { "entropy": 6.654724025726319, "epoch": 0.3473784175538562, "grad_norm": 1.125, "learning_rate": 0.0004993073797914141, "loss": 6.4942, "mean_token_accuracy": 0.12987780347466468, "num_tokens": 6812853.0, "step": 3475 }, { "entropy": 6.480592870712281, "epoch": 0.3478782426150847, "grad_norm": 1.046875, "learning_rate": 0.0004993045788102522, "loss": 6.5732, "mean_token_accuracy": 0.12895409166812896, "num_tokens": 6822104.0, "step": 3480 }, { "entropy": 6.586609172821045, "epoch": 0.3483780676763133, "grad_norm": 1.0625, "learning_rate": 0.0004993017721856449, "loss": 6.5376, "mean_token_accuracy": 0.12887432128190995, "num_tokens": 6832683.0, "step": 3485 }, { "entropy": 6.636422252655029, "epoch": 0.3488778927375419, "grad_norm": 0.93359375, "learning_rate": 0.0004992989599176626, "loss": 6.5054, "mean_token_accuracy": 0.12848403304815292, "num_tokens": 6843191.0, "step": 3490 }, { "entropy": 6.525516223907471, "epoch": 0.3493777177987704, "grad_norm": 1.1328125, "learning_rate": 0.0004992961420063763, "loss": 6.5041, "mean_token_accuracy": 0.1352040521800518, "num_tokens": 6852205.0, "step": 3495 }, { "entropy": 6.4578968524932865, "epoch": 0.349877542859999, "grad_norm": 1.1015625, "learning_rate": 0.0004992933184518567, "loss": 6.4386, "mean_token_accuracy": 0.13598101660609246, "num_tokens": 6863052.0, "step": 3500 }, { "entropy": 6.557692575454712, "epoch": 0.3503773679212276, "grad_norm": 1.1328125, "learning_rate": 0.0004992904892541749, "loss": 6.5006, "mean_token_accuracy": 0.1390739470720291, "num_tokens": 6872717.0, "step": 3505 }, { "entropy": 6.481651687622071, "epoch": 0.3508771929824561, "grad_norm": 1.1328125, "learning_rate": 0.0004992876544134022, "loss": 6.4079, "mean_token_accuracy": 0.1390100099146366, "num_tokens": 6881351.0, "step": 3510 }, { "entropy": 6.561838531494141, "epoch": 0.3513770180436847, "grad_norm": 1.125, "learning_rate": 0.0004992848139296098, "loss": 6.468, "mean_token_accuracy": 0.13341921865940093, "num_tokens": 6891353.0, "step": 3515 }, { "entropy": 6.578236865997314, "epoch": 0.3518768431049133, "grad_norm": 1.0546875, "learning_rate": 0.0004992819678028692, "loss": 6.5466, "mean_token_accuracy": 0.12448048442602158, "num_tokens": 6902352.0, "step": 3520 }, { "entropy": 6.596884632110596, "epoch": 0.3523766681661418, "grad_norm": 0.98828125, "learning_rate": 0.000499279116033252, "loss": 6.5389, "mean_token_accuracy": 0.12417580634355545, "num_tokens": 6911950.0, "step": 3525 }, { "entropy": 6.52663893699646, "epoch": 0.3528764932273704, "grad_norm": 1.0234375, "learning_rate": 0.0004992762586208299, "loss": 6.4504, "mean_token_accuracy": 0.13816978707909583, "num_tokens": 6921949.0, "step": 3530 }, { "entropy": 6.525535011291504, "epoch": 0.353376318288599, "grad_norm": 1.0703125, "learning_rate": 0.0004992733955656749, "loss": 6.4712, "mean_token_accuracy": 0.13278446346521378, "num_tokens": 6932561.0, "step": 3535 }, { "entropy": 6.498945331573486, "epoch": 0.3538761433498276, "grad_norm": 1.171875, "learning_rate": 0.0004992705268678589, "loss": 6.4724, "mean_token_accuracy": 0.1376880429685116, "num_tokens": 6941663.0, "step": 3540 }, { "entropy": 6.5523069381713865, "epoch": 0.3543759684110561, "grad_norm": 0.984375, "learning_rate": 0.0004992676525274542, "loss": 6.4837, "mean_token_accuracy": 0.12919382229447365, "num_tokens": 6952373.0, "step": 3545 }, { "entropy": 6.507160234451294, "epoch": 0.3548757934722847, "grad_norm": 1.109375, "learning_rate": 0.0004992647725445331, "loss": 6.4961, "mean_token_accuracy": 0.13755922242999077, "num_tokens": 6961337.0, "step": 3550 }, { "entropy": 6.488829517364502, "epoch": 0.3553756185335133, "grad_norm": 1.046875, "learning_rate": 0.000499261886919168, "loss": 6.4398, "mean_token_accuracy": 0.14278729483485222, "num_tokens": 6971649.0, "step": 3555 }, { "entropy": 6.5226733684539795, "epoch": 0.3558754435947418, "grad_norm": 1.015625, "learning_rate": 0.0004992589956514316, "loss": 6.4722, "mean_token_accuracy": 0.13939098119735718, "num_tokens": 6982261.0, "step": 3560 }, { "entropy": 6.550300359725952, "epoch": 0.3563752686559704, "grad_norm": 1.125, "learning_rate": 0.0004992560987413965, "loss": 6.4454, "mean_token_accuracy": 0.13285200521349907, "num_tokens": 6991324.0, "step": 3565 }, { "entropy": 6.43190975189209, "epoch": 0.356875093717199, "grad_norm": 1.140625, "learning_rate": 0.0004992531961891356, "loss": 6.4296, "mean_token_accuracy": 0.13729097843170165, "num_tokens": 7001396.0, "step": 3570 }, { "entropy": 6.545795249938965, "epoch": 0.35737491877842753, "grad_norm": 1.0703125, "learning_rate": 0.0004992502879947222, "loss": 6.4363, "mean_token_accuracy": 0.1328266330063343, "num_tokens": 7010354.0, "step": 3575 }, { "entropy": 6.578396415710449, "epoch": 0.3578747438396561, "grad_norm": 1.0234375, "learning_rate": 0.0004992473741582291, "loss": 6.5387, "mean_token_accuracy": 0.13147649839520453, "num_tokens": 7019835.0, "step": 3580 }, { "entropy": 6.489585638046265, "epoch": 0.3583745689008847, "grad_norm": 1.078125, "learning_rate": 0.0004992444546797298, "loss": 6.4135, "mean_token_accuracy": 0.136285550147295, "num_tokens": 7030515.0, "step": 3585 }, { "entropy": 6.441481447219848, "epoch": 0.35887439396211324, "grad_norm": 0.98828125, "learning_rate": 0.0004992415295592977, "loss": 6.4773, "mean_token_accuracy": 0.1365040898323059, "num_tokens": 7041248.0, "step": 3590 }, { "entropy": 6.587574148178101, "epoch": 0.3593742190233418, "grad_norm": 1.3359375, "learning_rate": 0.0004992385987970064, "loss": 6.5043, "mean_token_accuracy": 0.12980234399437904, "num_tokens": 7050578.0, "step": 3595 }, { "entropy": 6.600696229934693, "epoch": 0.3598740440845704, "grad_norm": 1.0546875, "learning_rate": 0.0004992356623929297, "loss": 6.4912, "mean_token_accuracy": 0.13227495476603507, "num_tokens": 7060270.0, "step": 3600 }, { "entropy": 6.554751539230347, "epoch": 0.360373869145799, "grad_norm": 1.0390625, "learning_rate": 0.0004992327203471414, "loss": 6.5518, "mean_token_accuracy": 0.12837831005454065, "num_tokens": 7070259.0, "step": 3605 }, { "entropy": 6.471230411529541, "epoch": 0.36087369420702753, "grad_norm": 1.1796875, "learning_rate": 0.0004992297726597156, "loss": 6.4446, "mean_token_accuracy": 0.13782778307795523, "num_tokens": 7078784.0, "step": 3610 }, { "entropy": 6.57683367729187, "epoch": 0.3613735192682561, "grad_norm": 1.1015625, "learning_rate": 0.0004992268193307264, "loss": 6.5054, "mean_token_accuracy": 0.12678046450018882, "num_tokens": 7088632.0, "step": 3615 }, { "entropy": 6.5138507843017575, "epoch": 0.3618733443294847, "grad_norm": 1.1484375, "learning_rate": 0.0004992238603602481, "loss": 6.4903, "mean_token_accuracy": 0.1330701433122158, "num_tokens": 7097703.0, "step": 3620 }, { "entropy": 6.4704427242279055, "epoch": 0.36237316939071323, "grad_norm": 1.109375, "learning_rate": 0.0004992208957483552, "loss": 6.4171, "mean_token_accuracy": 0.1354508228600025, "num_tokens": 7107183.0, "step": 3625 }, { "entropy": 6.619330167770386, "epoch": 0.3628729944519418, "grad_norm": 1.203125, "learning_rate": 0.0004992179254951223, "loss": 6.5165, "mean_token_accuracy": 0.12851681262254716, "num_tokens": 7118220.0, "step": 3630 }, { "entropy": 6.5486711978912355, "epoch": 0.3633728195131704, "grad_norm": 1.015625, "learning_rate": 0.000499214949600624, "loss": 6.46, "mean_token_accuracy": 0.13207071423530578, "num_tokens": 7128322.0, "step": 3635 }, { "entropy": 6.380391597747803, "epoch": 0.36387264457439894, "grad_norm": 0.98828125, "learning_rate": 0.0004992119680649355, "loss": 6.472, "mean_token_accuracy": 0.13622428625822067, "num_tokens": 7137284.0, "step": 3640 }, { "entropy": 6.485237312316895, "epoch": 0.3643724696356275, "grad_norm": 1.078125, "learning_rate": 0.0004992089808881313, "loss": 6.4123, "mean_token_accuracy": 0.1392784297466278, "num_tokens": 7146598.0, "step": 3645 }, { "entropy": 6.69722695350647, "epoch": 0.3648722946968561, "grad_norm": 1.09375, "learning_rate": 0.0004992059880702869, "loss": 6.5599, "mean_token_accuracy": 0.13605788052082063, "num_tokens": 7156816.0, "step": 3650 }, { "entropy": 6.540158987045288, "epoch": 0.36537211975808465, "grad_norm": 1.1796875, "learning_rate": 0.0004992029896114775, "loss": 6.4996, "mean_token_accuracy": 0.12887731418013573, "num_tokens": 7166855.0, "step": 3655 }, { "entropy": 6.412228345870972, "epoch": 0.36587194481931323, "grad_norm": 1.03125, "learning_rate": 0.0004991999855117787, "loss": 6.3789, "mean_token_accuracy": 0.1410156346857548, "num_tokens": 7176477.0, "step": 3660 }, { "entropy": 6.535949945449829, "epoch": 0.3663717698805418, "grad_norm": 1.265625, "learning_rate": 0.0004991969757712659, "loss": 6.4268, "mean_token_accuracy": 0.13362221270799637, "num_tokens": 7186173.0, "step": 3665 }, { "entropy": 6.410127258300781, "epoch": 0.3668715949417704, "grad_norm": 1.03125, "learning_rate": 0.0004991939603900149, "loss": 6.3617, "mean_token_accuracy": 0.13872723802924156, "num_tokens": 7195403.0, "step": 3670 }, { "entropy": 6.516451835632324, "epoch": 0.36737142000299894, "grad_norm": 1.109375, "learning_rate": 0.0004991909393681015, "loss": 6.4833, "mean_token_accuracy": 0.13445534855127333, "num_tokens": 7204179.0, "step": 3675 }, { "entropy": 6.471215152740479, "epoch": 0.3678712450642275, "grad_norm": 1.109375, "learning_rate": 0.0004991879127056017, "loss": 6.4264, "mean_token_accuracy": 0.13383713141083717, "num_tokens": 7214159.0, "step": 3680 }, { "entropy": 6.462945604324341, "epoch": 0.3683710701254561, "grad_norm": 0.97265625, "learning_rate": 0.0004991848804025918, "loss": 6.3955, "mean_token_accuracy": 0.14022568762302398, "num_tokens": 7224410.0, "step": 3685 }, { "entropy": 6.456934833526612, "epoch": 0.36887089518668464, "grad_norm": 0.98828125, "learning_rate": 0.000499181842459148, "loss": 6.4565, "mean_token_accuracy": 0.14114324226975442, "num_tokens": 7233740.0, "step": 3690 }, { "entropy": 6.5373962879180905, "epoch": 0.36937072024791323, "grad_norm": 1.1015625, "learning_rate": 0.0004991787988753467, "loss": 6.4082, "mean_token_accuracy": 0.13846576884388923, "num_tokens": 7242834.0, "step": 3695 }, { "entropy": 6.4727240085601805, "epoch": 0.3698705453091418, "grad_norm": 1.078125, "learning_rate": 0.0004991757496512645, "loss": 6.3856, "mean_token_accuracy": 0.1420457072556019, "num_tokens": 7252098.0, "step": 3700 }, { "entropy": 6.597651672363281, "epoch": 0.37037037037037035, "grad_norm": 1.046875, "learning_rate": 0.0004991726947869782, "loss": 6.5514, "mean_token_accuracy": 0.1257934272289276, "num_tokens": 7261396.0, "step": 3705 }, { "entropy": 6.529380989074707, "epoch": 0.37087019543159894, "grad_norm": 1.0859375, "learning_rate": 0.0004991696342825645, "loss": 6.4953, "mean_token_accuracy": 0.127850254625082, "num_tokens": 7271138.0, "step": 3710 }, { "entropy": 6.470937824249267, "epoch": 0.3713700204928275, "grad_norm": 1.140625, "learning_rate": 0.0004991665681381005, "loss": 6.4192, "mean_token_accuracy": 0.13879003301262854, "num_tokens": 7280164.0, "step": 3715 }, { "entropy": 6.558149003982544, "epoch": 0.37186984555405606, "grad_norm": 1.078125, "learning_rate": 0.0004991634963536633, "loss": 6.4776, "mean_token_accuracy": 0.13312826305627823, "num_tokens": 7288830.0, "step": 3720 }, { "entropy": 6.520046949386597, "epoch": 0.37236967061528464, "grad_norm": 1.203125, "learning_rate": 0.0004991604189293303, "loss": 6.5057, "mean_token_accuracy": 0.13286127969622613, "num_tokens": 7298955.0, "step": 3725 }, { "entropy": 6.541933012008667, "epoch": 0.37286949567651323, "grad_norm": 1.109375, "learning_rate": 0.0004991573358651787, "loss": 6.4104, "mean_token_accuracy": 0.13342548981308938, "num_tokens": 7309829.0, "step": 3730 }, { "entropy": 6.539558410644531, "epoch": 0.3733693207377418, "grad_norm": 1.0390625, "learning_rate": 0.0004991542471612864, "loss": 6.5025, "mean_token_accuracy": 0.1323994792997837, "num_tokens": 7319654.0, "step": 3735 }, { "entropy": 6.572074699401855, "epoch": 0.37386914579897035, "grad_norm": 1.0390625, "learning_rate": 0.0004991511528177307, "loss": 6.4759, "mean_token_accuracy": 0.13173828050494193, "num_tokens": 7330415.0, "step": 3740 }, { "entropy": 6.542703151702881, "epoch": 0.37436897086019894, "grad_norm": 1.1953125, "learning_rate": 0.0004991480528345898, "loss": 6.4861, "mean_token_accuracy": 0.13387491255998613, "num_tokens": 7339511.0, "step": 3745 }, { "entropy": 6.603790760040283, "epoch": 0.3748687959214275, "grad_norm": 1.1328125, "learning_rate": 0.0004991449472119416, "loss": 6.4908, "mean_token_accuracy": 0.12859921902418137, "num_tokens": 7348488.0, "step": 3750 }, { "entropy": 6.414752101898193, "epoch": 0.37536862098265605, "grad_norm": 1.046875, "learning_rate": 0.0004991418359498642, "loss": 6.4357, "mean_token_accuracy": 0.13227830901741983, "num_tokens": 7357804.0, "step": 3755 }, { "entropy": 6.497383403778076, "epoch": 0.37586844604388464, "grad_norm": 1.078125, "learning_rate": 0.0004991387190484358, "loss": 6.4864, "mean_token_accuracy": 0.13240752145648002, "num_tokens": 7367644.0, "step": 3760 }, { "entropy": 6.56132402420044, "epoch": 0.37636827110511323, "grad_norm": 1.1875, "learning_rate": 0.000499135596507735, "loss": 6.3185, "mean_token_accuracy": 0.13788421526551248, "num_tokens": 7377357.0, "step": 3765 }, { "entropy": 6.511699247360229, "epoch": 0.37686809616634176, "grad_norm": 1.140625, "learning_rate": 0.0004991324683278402, "loss": 6.531, "mean_token_accuracy": 0.12990649566054344, "num_tokens": 7387306.0, "step": 3770 }, { "entropy": 6.502481603622437, "epoch": 0.37736792122757035, "grad_norm": 1.0390625, "learning_rate": 0.0004991293345088301, "loss": 6.4699, "mean_token_accuracy": 0.1305549792945385, "num_tokens": 7397472.0, "step": 3775 }, { "entropy": 6.5302571773529055, "epoch": 0.37786774628879893, "grad_norm": 1.0234375, "learning_rate": 0.0004991261950507837, "loss": 6.488, "mean_token_accuracy": 0.135041344165802, "num_tokens": 7408786.0, "step": 3780 }, { "entropy": 6.5253747463226315, "epoch": 0.37836757135002747, "grad_norm": 1.0546875, "learning_rate": 0.00049912304995378, "loss": 6.4688, "mean_token_accuracy": 0.12599104791879653, "num_tokens": 7417857.0, "step": 3785 }, { "entropy": 6.481985187530517, "epoch": 0.37886739641125605, "grad_norm": 1.1484375, "learning_rate": 0.0004991198992178979, "loss": 6.4521, "mean_token_accuracy": 0.1293245181441307, "num_tokens": 7427007.0, "step": 3790 }, { "entropy": 6.493896198272705, "epoch": 0.37936722147248464, "grad_norm": 1.0390625, "learning_rate": 0.0004991167428432168, "loss": 6.3763, "mean_token_accuracy": 0.13669300004839896, "num_tokens": 7437090.0, "step": 3795 }, { "entropy": 6.466151142120362, "epoch": 0.3798670465337132, "grad_norm": 1.109375, "learning_rate": 0.0004991135808298162, "loss": 6.4084, "mean_token_accuracy": 0.1375203974545002, "num_tokens": 7446249.0, "step": 3800 }, { "entropy": 6.564642429351807, "epoch": 0.38036687159494176, "grad_norm": 1.25, "learning_rate": 0.0004991104131777755, "loss": 6.447, "mean_token_accuracy": 0.13011155053973197, "num_tokens": 7455838.0, "step": 3805 }, { "entropy": 6.494140672683716, "epoch": 0.38086669665617034, "grad_norm": 1.0625, "learning_rate": 0.0004991072398871746, "loss": 6.498, "mean_token_accuracy": 0.12991281002759933, "num_tokens": 7466057.0, "step": 3810 }, { "entropy": 6.531226396560669, "epoch": 0.38136652171739893, "grad_norm": 1.0234375, "learning_rate": 0.0004991040609580932, "loss": 6.4806, "mean_token_accuracy": 0.1331527642905712, "num_tokens": 7475174.0, "step": 3815 }, { "entropy": 6.542899227142334, "epoch": 0.38186634677862746, "grad_norm": 1.09375, "learning_rate": 0.0004991008763906112, "loss": 6.4009, "mean_token_accuracy": 0.1381096974015236, "num_tokens": 7484635.0, "step": 3820 }, { "entropy": 6.417492961883545, "epoch": 0.38236617183985605, "grad_norm": 0.9609375, "learning_rate": 0.0004990976861848087, "loss": 6.4668, "mean_token_accuracy": 0.12807572260499, "num_tokens": 7496428.0, "step": 3825 }, { "entropy": 6.520355558395385, "epoch": 0.38286599690108464, "grad_norm": 1.1953125, "learning_rate": 0.0004990944903407663, "loss": 6.4983, "mean_token_accuracy": 0.13231004774570465, "num_tokens": 7506581.0, "step": 3830 }, { "entropy": 6.527870559692383, "epoch": 0.38336582196231317, "grad_norm": 1.0859375, "learning_rate": 0.0004990912888585641, "loss": 6.361, "mean_token_accuracy": 0.13924233615398407, "num_tokens": 7515809.0, "step": 3835 }, { "entropy": 6.356991004943848, "epoch": 0.38386564702354176, "grad_norm": 1.0625, "learning_rate": 0.0004990880817382828, "loss": 6.3978, "mean_token_accuracy": 0.13598079830408097, "num_tokens": 7525800.0, "step": 3840 }, { "entropy": 6.503269243240356, "epoch": 0.38436547208477034, "grad_norm": 1.0, "learning_rate": 0.000499084868980003, "loss": 6.5018, "mean_token_accuracy": 0.13475804030895233, "num_tokens": 7536903.0, "step": 3845 }, { "entropy": 6.553870105743409, "epoch": 0.3848652971459989, "grad_norm": 1.0546875, "learning_rate": 0.0004990816505838054, "loss": 6.4857, "mean_token_accuracy": 0.13236310184001923, "num_tokens": 7546004.0, "step": 3850 }, { "entropy": 6.550846672058105, "epoch": 0.38536512220722746, "grad_norm": 1.1171875, "learning_rate": 0.0004990784265497713, "loss": 6.59, "mean_token_accuracy": 0.129102224111557, "num_tokens": 7555971.0, "step": 3855 }, { "entropy": 6.625053215026855, "epoch": 0.38586494726845605, "grad_norm": 1.109375, "learning_rate": 0.0004990751968779817, "loss": 6.4849, "mean_token_accuracy": 0.13418882042169572, "num_tokens": 7564569.0, "step": 3860 }, { "entropy": 6.4894555568695065, "epoch": 0.38636477232968464, "grad_norm": 1.125, "learning_rate": 0.0004990719615685176, "loss": 6.4665, "mean_token_accuracy": 0.13154759109020234, "num_tokens": 7574134.0, "step": 3865 }, { "entropy": 6.52254810333252, "epoch": 0.38686459739091317, "grad_norm": 1.140625, "learning_rate": 0.0004990687206214608, "loss": 6.344, "mean_token_accuracy": 0.13741969615221022, "num_tokens": 7583631.0, "step": 3870 }, { "entropy": 6.379374217987061, "epoch": 0.38736442245214175, "grad_norm": 1.078125, "learning_rate": 0.0004990654740368925, "loss": 6.3054, "mean_token_accuracy": 0.14057383686304092, "num_tokens": 7593281.0, "step": 3875 }, { "entropy": 6.375336456298828, "epoch": 0.38786424751337034, "grad_norm": 1.0390625, "learning_rate": 0.0004990622218148947, "loss": 6.4609, "mean_token_accuracy": 0.13463458716869353, "num_tokens": 7603735.0, "step": 3880 }, { "entropy": 6.54819622039795, "epoch": 0.3883640725745989, "grad_norm": 1.1796875, "learning_rate": 0.0004990589639555489, "loss": 6.4262, "mean_token_accuracy": 0.13453493192791938, "num_tokens": 7613126.0, "step": 3885 }, { "entropy": 6.562527799606324, "epoch": 0.38886389763582746, "grad_norm": 1.0234375, "learning_rate": 0.0004990557004589373, "loss": 6.4532, "mean_token_accuracy": 0.13126180320978165, "num_tokens": 7623191.0, "step": 3890 }, { "entropy": 6.5247735500335695, "epoch": 0.38936372269705605, "grad_norm": 1.171875, "learning_rate": 0.0004990524313251419, "loss": 6.4315, "mean_token_accuracy": 0.13880911991000175, "num_tokens": 7634118.0, "step": 3895 }, { "entropy": 6.420445775985717, "epoch": 0.3898635477582846, "grad_norm": 1.0859375, "learning_rate": 0.0004990491565542449, "loss": 6.3196, "mean_token_accuracy": 0.14285002946853637, "num_tokens": 7643228.0, "step": 3900 }, { "entropy": 6.43741888999939, "epoch": 0.39036337281951317, "grad_norm": 1.1015625, "learning_rate": 0.0004990458761463289, "loss": 6.4192, "mean_token_accuracy": 0.13168829903006554, "num_tokens": 7652578.0, "step": 3905 }, { "entropy": 6.491273593902588, "epoch": 0.39086319788074175, "grad_norm": 1.1328125, "learning_rate": 0.0004990425901014763, "loss": 6.388, "mean_token_accuracy": 0.13412820547819138, "num_tokens": 7661617.0, "step": 3910 }, { "entropy": 6.399303293228149, "epoch": 0.3913630229419703, "grad_norm": 0.96875, "learning_rate": 0.0004990392984197697, "loss": 6.3904, "mean_token_accuracy": 0.14149613678455353, "num_tokens": 7670864.0, "step": 3915 }, { "entropy": 6.4511185646057125, "epoch": 0.39186284800319887, "grad_norm": 1.0625, "learning_rate": 0.0004990360011012921, "loss": 6.4521, "mean_token_accuracy": 0.12870443016290664, "num_tokens": 7681528.0, "step": 3920 }, { "entropy": 6.505901193618774, "epoch": 0.39236267306442746, "grad_norm": 1.078125, "learning_rate": 0.0004990326981461264, "loss": 6.3813, "mean_token_accuracy": 0.13232036978006362, "num_tokens": 7690398.0, "step": 3925 }, { "entropy": 6.40734224319458, "epoch": 0.39286249812565605, "grad_norm": 1.125, "learning_rate": 0.0004990293895543555, "loss": 6.4135, "mean_token_accuracy": 0.14027423188090324, "num_tokens": 7699843.0, "step": 3930 }, { "entropy": 6.431153154373169, "epoch": 0.3933623231868846, "grad_norm": 1.0859375, "learning_rate": 0.000499026075326063, "loss": 6.449, "mean_token_accuracy": 0.13698539435863494, "num_tokens": 7710181.0, "step": 3935 }, { "entropy": 6.489415884017944, "epoch": 0.39386214824811316, "grad_norm": 1.0859375, "learning_rate": 0.000499022755461332, "loss": 6.3745, "mean_token_accuracy": 0.1336131788790226, "num_tokens": 7719148.0, "step": 3940 }, { "entropy": 6.326394557952881, "epoch": 0.39436197330934175, "grad_norm": 1.078125, "learning_rate": 0.000499019429960246, "loss": 6.2553, "mean_token_accuracy": 0.14362635761499404, "num_tokens": 7728551.0, "step": 3945 }, { "entropy": 6.501528358459472, "epoch": 0.3948617983705703, "grad_norm": 1.0703125, "learning_rate": 0.0004990160988228888, "loss": 6.4779, "mean_token_accuracy": 0.13136930465698243, "num_tokens": 7739083.0, "step": 3950 }, { "entropy": 6.5596575260162355, "epoch": 0.39536162343179887, "grad_norm": 1.1015625, "learning_rate": 0.0004990127620493444, "loss": 6.4612, "mean_token_accuracy": 0.1364016979932785, "num_tokens": 7749684.0, "step": 3955 }, { "entropy": 6.395131587982178, "epoch": 0.39586144849302746, "grad_norm": 1.1328125, "learning_rate": 0.0004990094196396964, "loss": 6.3313, "mean_token_accuracy": 0.13728146478533745, "num_tokens": 7759281.0, "step": 3960 }, { "entropy": 6.47342586517334, "epoch": 0.396361273554256, "grad_norm": 1.1015625, "learning_rate": 0.000499006071594029, "loss": 6.4174, "mean_token_accuracy": 0.1372039444744587, "num_tokens": 7768612.0, "step": 3965 }, { "entropy": 6.423118972778321, "epoch": 0.3968610986154846, "grad_norm": 1.140625, "learning_rate": 0.0004990027179124266, "loss": 6.3373, "mean_token_accuracy": 0.13924752101302146, "num_tokens": 7778333.0, "step": 3970 }, { "entropy": 6.506185293197632, "epoch": 0.39736092367671316, "grad_norm": 1.0390625, "learning_rate": 0.0004989993585949733, "loss": 6.4849, "mean_token_accuracy": 0.12784129306674002, "num_tokens": 7787547.0, "step": 3975 }, { "entropy": 6.436396360397339, "epoch": 0.3978607487379417, "grad_norm": 1.171875, "learning_rate": 0.0004989959936417541, "loss": 6.4325, "mean_token_accuracy": 0.13556910753250123, "num_tokens": 7798407.0, "step": 3980 }, { "entropy": 6.452073287963867, "epoch": 0.3983605737991703, "grad_norm": 0.99609375, "learning_rate": 0.000498992623052853, "loss": 6.3615, "mean_token_accuracy": 0.14274941980838776, "num_tokens": 7807879.0, "step": 3985 }, { "entropy": 6.414194822311401, "epoch": 0.39886039886039887, "grad_norm": 1.1015625, "learning_rate": 0.0004989892468283553, "loss": 6.3245, "mean_token_accuracy": 0.13929423540830613, "num_tokens": 7817210.0, "step": 3990 }, { "entropy": 6.5941883563995365, "epoch": 0.39936022392162746, "grad_norm": 1.421875, "learning_rate": 0.0004989858649683457, "loss": 6.5686, "mean_token_accuracy": 0.12396848574280739, "num_tokens": 7827845.0, "step": 3995 }, { "entropy": 6.6080930709838865, "epoch": 0.399860048982856, "grad_norm": 1.1171875, "learning_rate": 0.0004989824774729094, "loss": 6.4333, "mean_token_accuracy": 0.1379890486598015, "num_tokens": 7836994.0, "step": 4000 }, { "entropy": 6.467769432067871, "epoch": 0.4003598740440846, "grad_norm": 1.140625, "learning_rate": 0.0004989790843421317, "loss": 6.4582, "mean_token_accuracy": 0.13288121446967124, "num_tokens": 7846733.0, "step": 4005 }, { "entropy": 6.450557899475098, "epoch": 0.40085969910531316, "grad_norm": 1.34375, "learning_rate": 0.0004989756855760979, "loss": 6.3774, "mean_token_accuracy": 0.14024601578712464, "num_tokens": 7856393.0, "step": 4010 }, { "entropy": 6.504327917098999, "epoch": 0.4013595241665417, "grad_norm": 1.0546875, "learning_rate": 0.0004989722811748934, "loss": 6.4681, "mean_token_accuracy": 0.13493888974189758, "num_tokens": 7866394.0, "step": 4015 }, { "entropy": 6.530735111236572, "epoch": 0.4018593492277703, "grad_norm": 1.046875, "learning_rate": 0.0004989688711386039, "loss": 6.4742, "mean_token_accuracy": 0.1269529640674591, "num_tokens": 7877084.0, "step": 4020 }, { "entropy": 6.575013875961304, "epoch": 0.40235917428899887, "grad_norm": 1.09375, "learning_rate": 0.0004989654554673152, "loss": 6.4765, "mean_token_accuracy": 0.13267083317041398, "num_tokens": 7887289.0, "step": 4025 }, { "entropy": 6.367003679275513, "epoch": 0.4028589993502274, "grad_norm": 0.98046875, "learning_rate": 0.0004989620341611133, "loss": 6.4269, "mean_token_accuracy": 0.13722112998366356, "num_tokens": 7897315.0, "step": 4030 }, { "entropy": 6.603945541381836, "epoch": 0.403358824411456, "grad_norm": 1.109375, "learning_rate": 0.0004989586072200843, "loss": 6.5344, "mean_token_accuracy": 0.12967253774404525, "num_tokens": 7905913.0, "step": 4035 }, { "entropy": 6.444837760925293, "epoch": 0.40385864947268457, "grad_norm": 1.0546875, "learning_rate": 0.0004989551746443143, "loss": 6.3368, "mean_token_accuracy": 0.14095348194241525, "num_tokens": 7914879.0, "step": 4040 }, { "entropy": 6.448266172409058, "epoch": 0.4043584745339131, "grad_norm": 1.125, "learning_rate": 0.0004989517364338899, "loss": 6.4821, "mean_token_accuracy": 0.13294394686818123, "num_tokens": 7925163.0, "step": 4045 }, { "entropy": 6.587580680847168, "epoch": 0.4048582995951417, "grad_norm": 1.1015625, "learning_rate": 0.0004989482925888974, "loss": 6.3872, "mean_token_accuracy": 0.13814545199275016, "num_tokens": 7934380.0, "step": 4050 }, { "entropy": 6.46042218208313, "epoch": 0.4053581246563703, "grad_norm": 1.1171875, "learning_rate": 0.0004989448431094233, "loss": 6.4474, "mean_token_accuracy": 0.1337108075618744, "num_tokens": 7944600.0, "step": 4055 }, { "entropy": 6.349003171920776, "epoch": 0.40585794971759886, "grad_norm": 1.0390625, "learning_rate": 0.0004989413879955548, "loss": 6.354, "mean_token_accuracy": 0.14133601263165474, "num_tokens": 7953545.0, "step": 4060 }, { "entropy": 6.475251865386963, "epoch": 0.4063577747788274, "grad_norm": 1.078125, "learning_rate": 0.0004989379272473785, "loss": 6.4245, "mean_token_accuracy": 0.1339748039841652, "num_tokens": 7962931.0, "step": 4065 }, { "entropy": 6.523327445983886, "epoch": 0.406857599840056, "grad_norm": 1.75, "learning_rate": 0.0004989344608649815, "loss": 6.411, "mean_token_accuracy": 0.13698220029473304, "num_tokens": 7973090.0, "step": 4070 }, { "entropy": 6.526764011383056, "epoch": 0.40735742490128457, "grad_norm": 1.0703125, "learning_rate": 0.0004989309888484511, "loss": 6.5142, "mean_token_accuracy": 0.12804269716143607, "num_tokens": 7982208.0, "step": 4075 }, { "entropy": 6.441964769363404, "epoch": 0.4078572499625131, "grad_norm": 1.1328125, "learning_rate": 0.0004989275111978748, "loss": 6.4852, "mean_token_accuracy": 0.13562206402420998, "num_tokens": 7993389.0, "step": 4080 }, { "entropy": 6.4270039081573485, "epoch": 0.4083570750237417, "grad_norm": 1.0078125, "learning_rate": 0.0004989240279133398, "loss": 6.3425, "mean_token_accuracy": 0.14047398939728736, "num_tokens": 8002749.0, "step": 4085 }, { "entropy": 6.494481229782105, "epoch": 0.4088569000849703, "grad_norm": 0.98828125, "learning_rate": 0.0004989205389949339, "loss": 6.3405, "mean_token_accuracy": 0.1379816897213459, "num_tokens": 8011552.0, "step": 4090 }, { "entropy": 6.340465354919433, "epoch": 0.4093567251461988, "grad_norm": 1.140625, "learning_rate": 0.0004989170444427448, "loss": 6.3727, "mean_token_accuracy": 0.13385937213897706, "num_tokens": 8020622.0, "step": 4095 }, { "entropy": 6.392237949371338, "epoch": 0.4098565502074274, "grad_norm": 1.1015625, "learning_rate": 0.0004989135442568606, "loss": 6.3105, "mean_token_accuracy": 0.14349081069231034, "num_tokens": 8030356.0, "step": 4100 }, { "entropy": 6.448809289932251, "epoch": 0.410356375268656, "grad_norm": 1.078125, "learning_rate": 0.0004989100384373693, "loss": 6.4328, "mean_token_accuracy": 0.13252698332071305, "num_tokens": 8039903.0, "step": 4105 }, { "entropy": 6.488882303237915, "epoch": 0.4108562003298845, "grad_norm": 1.0859375, "learning_rate": 0.0004989065269843588, "loss": 6.3604, "mean_token_accuracy": 0.13210076540708543, "num_tokens": 8050488.0, "step": 4110 }, { "entropy": 6.481236839294434, "epoch": 0.4113560253911131, "grad_norm": 1.0859375, "learning_rate": 0.000498903009897918, "loss": 6.3962, "mean_token_accuracy": 0.1381304681301117, "num_tokens": 8060179.0, "step": 4115 }, { "entropy": 6.47611403465271, "epoch": 0.4118558504523417, "grad_norm": 1.03125, "learning_rate": 0.0004988994871781349, "loss": 6.4489, "mean_token_accuracy": 0.13481701165437698, "num_tokens": 8070915.0, "step": 4120 }, { "entropy": 6.412845230102539, "epoch": 0.4123556755135703, "grad_norm": 1.171875, "learning_rate": 0.0004988959588250983, "loss": 6.3724, "mean_token_accuracy": 0.14198843836784364, "num_tokens": 8080203.0, "step": 4125 }, { "entropy": 6.493917083740234, "epoch": 0.4128555005747988, "grad_norm": 1.0546875, "learning_rate": 0.000498892424838897, "loss": 6.3816, "mean_token_accuracy": 0.1400151565670967, "num_tokens": 8090552.0, "step": 4130 }, { "entropy": 6.468116998672485, "epoch": 0.4133553256360274, "grad_norm": 1.1796875, "learning_rate": 0.0004988888852196199, "loss": 6.3498, "mean_token_accuracy": 0.14506910964846612, "num_tokens": 8099947.0, "step": 4135 }, { "entropy": 6.4164337635040285, "epoch": 0.413855150697256, "grad_norm": 1.015625, "learning_rate": 0.0004988853399673562, "loss": 6.4473, "mean_token_accuracy": 0.1339076429605484, "num_tokens": 8110502.0, "step": 4140 }, { "entropy": 6.4882711410522464, "epoch": 0.4143549757584845, "grad_norm": 1.1640625, "learning_rate": 0.0004988817890821948, "loss": 6.4656, "mean_token_accuracy": 0.1324286200106144, "num_tokens": 8118762.0, "step": 4145 }, { "entropy": 6.462985801696777, "epoch": 0.4148548008197131, "grad_norm": 1.0390625, "learning_rate": 0.0004988782325642252, "loss": 6.3717, "mean_token_accuracy": 0.13247129172086716, "num_tokens": 8129072.0, "step": 4150 }, { "entropy": 6.441734266281128, "epoch": 0.4153546258809417, "grad_norm": 1.125, "learning_rate": 0.000498874670413537, "loss": 6.4098, "mean_token_accuracy": 0.1296373963356018, "num_tokens": 8138504.0, "step": 4155 }, { "entropy": 6.5720216751098635, "epoch": 0.4158544509421702, "grad_norm": 1.015625, "learning_rate": 0.0004988711026302197, "loss": 6.4741, "mean_token_accuracy": 0.1308560349047184, "num_tokens": 8148534.0, "step": 4160 }, { "entropy": 6.507727098464966, "epoch": 0.4163542760033988, "grad_norm": 1.0859375, "learning_rate": 0.0004988675292143629, "loss": 6.5272, "mean_token_accuracy": 0.1274973638355732, "num_tokens": 8160272.0, "step": 4165 }, { "entropy": 6.497180700302124, "epoch": 0.4168541010646274, "grad_norm": 1.109375, "learning_rate": 0.0004988639501660568, "loss": 6.3836, "mean_token_accuracy": 0.13714147731661797, "num_tokens": 8170053.0, "step": 4170 }, { "entropy": 6.519702005386352, "epoch": 0.4173539261258559, "grad_norm": 1.15625, "learning_rate": 0.0004988603654853913, "loss": 6.4107, "mean_token_accuracy": 0.13379530236124992, "num_tokens": 8179425.0, "step": 4175 }, { "entropy": 6.424587154388428, "epoch": 0.4178537511870845, "grad_norm": 1.0078125, "learning_rate": 0.0004988567751724565, "loss": 6.4366, "mean_token_accuracy": 0.1306513100862503, "num_tokens": 8189846.0, "step": 4180 }, { "entropy": 6.542534732818604, "epoch": 0.4183535762483131, "grad_norm": 1.09375, "learning_rate": 0.000498853179227343, "loss": 6.4442, "mean_token_accuracy": 0.13438463732600212, "num_tokens": 8198596.0, "step": 4185 }, { "entropy": 6.52326774597168, "epoch": 0.4188534013095417, "grad_norm": 1.171875, "learning_rate": 0.000498849577650141, "loss": 6.3668, "mean_token_accuracy": 0.1381375603377819, "num_tokens": 8206849.0, "step": 4190 }, { "entropy": 6.399906778335572, "epoch": 0.4193532263707702, "grad_norm": 1.078125, "learning_rate": 0.0004988459704409413, "loss": 6.3791, "mean_token_accuracy": 0.1348581276834011, "num_tokens": 8216260.0, "step": 4195 }, { "entropy": 6.498875951766967, "epoch": 0.4198530514319988, "grad_norm": 1.1484375, "learning_rate": 0.0004988423575998345, "loss": 6.4093, "mean_token_accuracy": 0.13606366738677025, "num_tokens": 8224650.0, "step": 4200 }, { "entropy": 6.329025411605835, "epoch": 0.4203528764932274, "grad_norm": 1.796875, "learning_rate": 0.0004988387391269117, "loss": 6.2693, "mean_token_accuracy": 0.1433685302734375, "num_tokens": 8235276.0, "step": 4205 }, { "entropy": 6.479813098907471, "epoch": 0.4208527015544559, "grad_norm": 1.1171875, "learning_rate": 0.0004988351150222638, "loss": 6.3397, "mean_token_accuracy": 0.13741505444049834, "num_tokens": 8244687.0, "step": 4210 }, { "entropy": 6.44670729637146, "epoch": 0.4213525266156845, "grad_norm": 1.0390625, "learning_rate": 0.0004988314852859819, "loss": 6.4632, "mean_token_accuracy": 0.1346420370042324, "num_tokens": 8255091.0, "step": 4215 }, { "entropy": 6.318567132949829, "epoch": 0.4218523516769131, "grad_norm": 2.34375, "learning_rate": 0.0004988278499181575, "loss": 6.3028, "mean_token_accuracy": 0.14652785509824753, "num_tokens": 8265172.0, "step": 4220 }, { "entropy": 6.4701916694641115, "epoch": 0.4223521767381416, "grad_norm": 1.1796875, "learning_rate": 0.000498824208918882, "loss": 6.3747, "mean_token_accuracy": 0.13661768659949303, "num_tokens": 8275625.0, "step": 4225 }, { "entropy": 6.400294065475464, "epoch": 0.4228520017993702, "grad_norm": 1.1796875, "learning_rate": 0.000498820562288247, "loss": 6.3664, "mean_token_accuracy": 0.1326092280447483, "num_tokens": 8284343.0, "step": 4230 }, { "entropy": 6.50111985206604, "epoch": 0.4233518268605988, "grad_norm": 1.078125, "learning_rate": 0.0004988169100263442, "loss": 6.4325, "mean_token_accuracy": 0.13281701132655144, "num_tokens": 8293430.0, "step": 4235 }, { "entropy": 6.451905584335327, "epoch": 0.4238516519218274, "grad_norm": 1.015625, "learning_rate": 0.0004988132521332656, "loss": 6.4059, "mean_token_accuracy": 0.13518600389361382, "num_tokens": 8302925.0, "step": 4240 }, { "entropy": 6.439618444442749, "epoch": 0.4243514769830559, "grad_norm": 1.171875, "learning_rate": 0.0004988095886091031, "loss": 6.3684, "mean_token_accuracy": 0.1392774134874344, "num_tokens": 8312134.0, "step": 4245 }, { "entropy": 6.476375436782837, "epoch": 0.4248513020442845, "grad_norm": 1.1015625, "learning_rate": 0.0004988059194539489, "loss": 6.3667, "mean_token_accuracy": 0.13766386359930038, "num_tokens": 8320942.0, "step": 4250 }, { "entropy": 6.4668882369995115, "epoch": 0.4253511271055131, "grad_norm": 1.015625, "learning_rate": 0.0004988022446678954, "loss": 6.387, "mean_token_accuracy": 0.1343892551958561, "num_tokens": 8331898.0, "step": 4255 }, { "entropy": 6.407869291305542, "epoch": 0.4258509521667416, "grad_norm": 1.1640625, "learning_rate": 0.0004987985642510352, "loss": 6.3796, "mean_token_accuracy": 0.14184328019618989, "num_tokens": 8341728.0, "step": 4260 }, { "entropy": 6.463212251663208, "epoch": 0.4263507772279702, "grad_norm": 1.0234375, "learning_rate": 0.0004987948782034605, "loss": 6.3204, "mean_token_accuracy": 0.1412410818040371, "num_tokens": 8351611.0, "step": 4265 }, { "entropy": 6.433274126052856, "epoch": 0.4268506022891988, "grad_norm": 1.140625, "learning_rate": 0.0004987911865252644, "loss": 6.3506, "mean_token_accuracy": 0.14228583350777627, "num_tokens": 8360528.0, "step": 4270 }, { "entropy": 6.42871208190918, "epoch": 0.42735042735042733, "grad_norm": 1.109375, "learning_rate": 0.0004987874892165395, "loss": 6.4159, "mean_token_accuracy": 0.13375010266900061, "num_tokens": 8369898.0, "step": 4275 }, { "entropy": 6.469485330581665, "epoch": 0.4278502524116559, "grad_norm": 1.046875, "learning_rate": 0.000498783786277379, "loss": 6.3535, "mean_token_accuracy": 0.14114384949207306, "num_tokens": 8379928.0, "step": 4280 }, { "entropy": 6.448226451873779, "epoch": 0.4283500774728845, "grad_norm": 1.1484375, "learning_rate": 0.0004987800777078759, "loss": 6.3864, "mean_token_accuracy": 0.14110791832208633, "num_tokens": 8389208.0, "step": 4285 }, { "entropy": 6.395701837539673, "epoch": 0.42884990253411304, "grad_norm": 1.140625, "learning_rate": 0.0004987763635081238, "loss": 6.3813, "mean_token_accuracy": 0.13884787857532502, "num_tokens": 8398364.0, "step": 4290 }, { "entropy": 6.441565322875976, "epoch": 0.4293497275953416, "grad_norm": 1.0234375, "learning_rate": 0.000498772643678216, "loss": 6.3931, "mean_token_accuracy": 0.13277500122785568, "num_tokens": 8408756.0, "step": 4295 }, { "entropy": 6.462358808517456, "epoch": 0.4298495526565702, "grad_norm": 1.1875, "learning_rate": 0.0004987689182182459, "loss": 6.3572, "mean_token_accuracy": 0.140143720805645, "num_tokens": 8418318.0, "step": 4300 }, { "entropy": 6.39695634841919, "epoch": 0.4303493777177988, "grad_norm": 1.203125, "learning_rate": 0.0004987651871283075, "loss": 6.3876, "mean_token_accuracy": 0.13188599050045013, "num_tokens": 8427709.0, "step": 4305 }, { "entropy": 6.482594633102417, "epoch": 0.43084920277902733, "grad_norm": 1.109375, "learning_rate": 0.0004987614504084946, "loss": 6.3968, "mean_token_accuracy": 0.1333758682012558, "num_tokens": 8437848.0, "step": 4310 }, { "entropy": 6.467829704284668, "epoch": 0.4313490278402559, "grad_norm": 1.046875, "learning_rate": 0.0004987577080589012, "loss": 6.3444, "mean_token_accuracy": 0.13813810050487518, "num_tokens": 8447466.0, "step": 4315 }, { "entropy": 6.3970293521881105, "epoch": 0.4318488529014845, "grad_norm": 1.1484375, "learning_rate": 0.0004987539600796213, "loss": 6.3599, "mean_token_accuracy": 0.14601844921708107, "num_tokens": 8456651.0, "step": 4320 }, { "entropy": 6.502226257324219, "epoch": 0.43234867796271303, "grad_norm": 1.0859375, "learning_rate": 0.0004987502064707494, "loss": 6.3991, "mean_token_accuracy": 0.1384994775056839, "num_tokens": 8466421.0, "step": 4325 }, { "entropy": 6.430251932144165, "epoch": 0.4328485030239416, "grad_norm": 1.046875, "learning_rate": 0.0004987464472323799, "loss": 6.3389, "mean_token_accuracy": 0.13588759750127793, "num_tokens": 8476419.0, "step": 4330 }, { "entropy": 6.482425165176392, "epoch": 0.4333483280851702, "grad_norm": 1.0546875, "learning_rate": 0.0004987426823646074, "loss": 6.3669, "mean_token_accuracy": 0.13521523028612137, "num_tokens": 8486652.0, "step": 4335 }, { "entropy": 6.367968988418579, "epoch": 0.43384815314639874, "grad_norm": 1.1484375, "learning_rate": 0.0004987389118675266, "loss": 6.3183, "mean_token_accuracy": 0.13830461949110032, "num_tokens": 8495965.0, "step": 4340 }, { "entropy": 6.472572660446167, "epoch": 0.4343479782076273, "grad_norm": 1.1015625, "learning_rate": 0.0004987351357412322, "loss": 6.4053, "mean_token_accuracy": 0.1303241431713104, "num_tokens": 8506018.0, "step": 4345 }, { "entropy": 6.418121719360352, "epoch": 0.4348478032688559, "grad_norm": 1.1875, "learning_rate": 0.0004987313539858196, "loss": 6.3871, "mean_token_accuracy": 0.1389095142483711, "num_tokens": 8516178.0, "step": 4350 }, { "entropy": 6.485131502151489, "epoch": 0.43534762833008445, "grad_norm": 1.140625, "learning_rate": 0.0004987275666013836, "loss": 6.4256, "mean_token_accuracy": 0.1329130657017231, "num_tokens": 8525548.0, "step": 4355 }, { "entropy": 6.4853137016296385, "epoch": 0.43584745339131303, "grad_norm": 1.1171875, "learning_rate": 0.0004987237735880195, "loss": 6.4869, "mean_token_accuracy": 0.12986717298626899, "num_tokens": 8535941.0, "step": 4360 }, { "entropy": 6.376958274841309, "epoch": 0.4363472784525416, "grad_norm": 1.125, "learning_rate": 0.0004987199749458229, "loss": 6.2931, "mean_token_accuracy": 0.14049483463168144, "num_tokens": 8545381.0, "step": 4365 }, { "entropy": 6.483648872375488, "epoch": 0.4368471035137702, "grad_norm": 1.140625, "learning_rate": 0.0004987161706748893, "loss": 6.3855, "mean_token_accuracy": 0.13644311875104903, "num_tokens": 8555827.0, "step": 4370 }, { "entropy": 6.426487731933594, "epoch": 0.43734692857499874, "grad_norm": 1.1015625, "learning_rate": 0.0004987123607753144, "loss": 6.2699, "mean_token_accuracy": 0.14769768416881562, "num_tokens": 8565508.0, "step": 4375 }, { "entropy": 6.483022212982178, "epoch": 0.4378467536362273, "grad_norm": 1.09375, "learning_rate": 0.000498708545247194, "loss": 6.4767, "mean_token_accuracy": 0.12742696925997735, "num_tokens": 8576273.0, "step": 4380 }, { "entropy": 6.482770538330078, "epoch": 0.4383465786974559, "grad_norm": 1.125, "learning_rate": 0.0004987047240906243, "loss": 6.4335, "mean_token_accuracy": 0.13154776245355607, "num_tokens": 8585488.0, "step": 4385 }, { "entropy": 6.455898332595825, "epoch": 0.43884640375868444, "grad_norm": 1.0234375, "learning_rate": 0.0004987008973057012, "loss": 6.4639, "mean_token_accuracy": 0.13179367780685425, "num_tokens": 8595299.0, "step": 4390 }, { "entropy": 6.455296516418457, "epoch": 0.43934622881991303, "grad_norm": 1.0625, "learning_rate": 0.0004986970648925211, "loss": 6.3398, "mean_token_accuracy": 0.13784969225525856, "num_tokens": 8604910.0, "step": 4395 }, { "entropy": 6.431913709640503, "epoch": 0.4398460538811416, "grad_norm": 1.1484375, "learning_rate": 0.0004986932268511804, "loss": 6.3595, "mean_token_accuracy": 0.1392812706530094, "num_tokens": 8614966.0, "step": 4400 }, { "entropy": 6.377312231063843, "epoch": 0.44034587894237015, "grad_norm": 1.7109375, "learning_rate": 0.0004986893831817758, "loss": 6.395, "mean_token_accuracy": 0.13974217027425767, "num_tokens": 8624539.0, "step": 4405 }, { "entropy": 6.411195421218872, "epoch": 0.44084570400359874, "grad_norm": 1.0703125, "learning_rate": 0.0004986855338844038, "loss": 6.2375, "mean_token_accuracy": 0.14474914520978927, "num_tokens": 8633775.0, "step": 4410 }, { "entropy": 6.424028539657593, "epoch": 0.4413455290648273, "grad_norm": 1.1171875, "learning_rate": 0.0004986816789591613, "loss": 6.4002, "mean_token_accuracy": 0.13322965949773788, "num_tokens": 8643798.0, "step": 4415 }, { "entropy": 6.314562368392944, "epoch": 0.44184535412605586, "grad_norm": 1.1875, "learning_rate": 0.0004986778184061453, "loss": 6.3162, "mean_token_accuracy": 0.13995987102389335, "num_tokens": 8653695.0, "step": 4420 }, { "entropy": 6.44688138961792, "epoch": 0.44234517918728444, "grad_norm": 1.0703125, "learning_rate": 0.0004986739522254529, "loss": 6.3351, "mean_token_accuracy": 0.13648810386657714, "num_tokens": 8663521.0, "step": 4425 }, { "entropy": 6.519506978988647, "epoch": 0.44284500424851303, "grad_norm": 1.0390625, "learning_rate": 0.0004986700804171816, "loss": 6.4708, "mean_token_accuracy": 0.13224498629570008, "num_tokens": 8673108.0, "step": 4430 }, { "entropy": 6.444082593917846, "epoch": 0.4433448293097416, "grad_norm": 1.1328125, "learning_rate": 0.0004986662029814285, "loss": 6.3291, "mean_token_accuracy": 0.13684166669845582, "num_tokens": 8682917.0, "step": 4435 }, { "entropy": 6.498892307281494, "epoch": 0.44384465437097015, "grad_norm": 1.109375, "learning_rate": 0.0004986623199182913, "loss": 6.428, "mean_token_accuracy": 0.1265405111014843, "num_tokens": 8692436.0, "step": 4440 }, { "entropy": 6.3918274402618405, "epoch": 0.44434447943219874, "grad_norm": 0.96875, "learning_rate": 0.0004986584312278678, "loss": 6.3374, "mean_token_accuracy": 0.14236319363117217, "num_tokens": 8702627.0, "step": 4445 }, { "entropy": 6.422056865692139, "epoch": 0.4448443044934273, "grad_norm": 1.1484375, "learning_rate": 0.0004986545369102556, "loss": 6.3541, "mean_token_accuracy": 0.13138117119669915, "num_tokens": 8711697.0, "step": 4450 }, { "entropy": 6.482198238372803, "epoch": 0.44534412955465585, "grad_norm": 1.140625, "learning_rate": 0.0004986506369655528, "loss": 6.3701, "mean_token_accuracy": 0.13062169700860976, "num_tokens": 8721449.0, "step": 4455 }, { "entropy": 6.404720163345337, "epoch": 0.44584395461588444, "grad_norm": 1.078125, "learning_rate": 0.0004986467313938575, "loss": 6.3618, "mean_token_accuracy": 0.13613314256072045, "num_tokens": 8731829.0, "step": 4460 }, { "entropy": 6.3724242687225345, "epoch": 0.44634377967711303, "grad_norm": 1.015625, "learning_rate": 0.000498642820195268, "loss": 6.1694, "mean_token_accuracy": 0.1527157574892044, "num_tokens": 8741768.0, "step": 4465 }, { "entropy": 6.441873168945312, "epoch": 0.44684360473834156, "grad_norm": 1.140625, "learning_rate": 0.0004986389033698827, "loss": 6.4681, "mean_token_accuracy": 0.1314198724925518, "num_tokens": 8751473.0, "step": 4470 }, { "entropy": 6.505035877227783, "epoch": 0.44734342979957015, "grad_norm": 1.125, "learning_rate": 0.0004986349809178002, "loss": 6.3855, "mean_token_accuracy": 0.13281653970479965, "num_tokens": 8761229.0, "step": 4475 }, { "entropy": 6.354346704483032, "epoch": 0.44784325486079873, "grad_norm": 1.0859375, "learning_rate": 0.0004986310528391192, "loss": 6.337, "mean_token_accuracy": 0.1419730991125107, "num_tokens": 8770670.0, "step": 4480 }, { "entropy": 6.450547313690185, "epoch": 0.44834307992202727, "grad_norm": 1.109375, "learning_rate": 0.0004986271191339383, "loss": 6.3589, "mean_token_accuracy": 0.13514169678092003, "num_tokens": 8780816.0, "step": 4485 }, { "entropy": 6.522676181793213, "epoch": 0.44884290498325585, "grad_norm": 1.0390625, "learning_rate": 0.0004986231798023566, "loss": 6.4335, "mean_token_accuracy": 0.1313347890973091, "num_tokens": 8790304.0, "step": 4490 }, { "entropy": 6.396866035461426, "epoch": 0.44934273004448444, "grad_norm": 1.1875, "learning_rate": 0.0004986192348444734, "loss": 6.3802, "mean_token_accuracy": 0.1358383111655712, "num_tokens": 8799188.0, "step": 4495 }, { "entropy": 6.488626098632812, "epoch": 0.449842555105713, "grad_norm": 1.1015625, "learning_rate": 0.0004986152842603877, "loss": 6.4195, "mean_token_accuracy": 0.13813868388533593, "num_tokens": 8810194.0, "step": 4500 }, { "entropy": 6.526076459884644, "epoch": 0.45034238016694156, "grad_norm": 0.96875, "learning_rate": 0.0004986113280501989, "loss": 6.4292, "mean_token_accuracy": 0.13713254481554032, "num_tokens": 8820394.0, "step": 4505 }, { "entropy": 6.421188497543335, "epoch": 0.45084220522817015, "grad_norm": 0.9765625, "learning_rate": 0.0004986073662140068, "loss": 6.3812, "mean_token_accuracy": 0.14109829887747766, "num_tokens": 8831308.0, "step": 4510 }, { "entropy": 6.408560180664063, "epoch": 0.45134203028939873, "grad_norm": 1.109375, "learning_rate": 0.0004986033987519109, "loss": 6.316, "mean_token_accuracy": 0.1428537130355835, "num_tokens": 8841461.0, "step": 4515 }, { "entropy": 6.43904824256897, "epoch": 0.45184185535062726, "grad_norm": 1.0390625, "learning_rate": 0.0004985994256640108, "loss": 6.3336, "mean_token_accuracy": 0.13536809235811234, "num_tokens": 8850356.0, "step": 4520 }, { "entropy": 6.454597043991089, "epoch": 0.45234168041185585, "grad_norm": 1.03125, "learning_rate": 0.0004985954469504069, "loss": 6.4304, "mean_token_accuracy": 0.13004560098052026, "num_tokens": 8859863.0, "step": 4525 }, { "entropy": 6.4495768547058105, "epoch": 0.45284150547308444, "grad_norm": 1.140625, "learning_rate": 0.0004985914626111991, "loss": 6.3042, "mean_token_accuracy": 0.1360592320561409, "num_tokens": 8869887.0, "step": 4530 }, { "entropy": 6.442905139923096, "epoch": 0.45334133053431297, "grad_norm": 1.09375, "learning_rate": 0.0004985874726464875, "loss": 6.467, "mean_token_accuracy": 0.13518969491124153, "num_tokens": 8879950.0, "step": 4535 }, { "entropy": 6.440595245361328, "epoch": 0.45384115559554156, "grad_norm": 1.015625, "learning_rate": 0.0004985834770563727, "loss": 6.23, "mean_token_accuracy": 0.14607514441013336, "num_tokens": 8888304.0, "step": 4540 }, { "entropy": 6.382362365722656, "epoch": 0.45434098065677014, "grad_norm": 0.96875, "learning_rate": 0.0004985794758409552, "loss": 6.2371, "mean_token_accuracy": 0.1514820337295532, "num_tokens": 8898642.0, "step": 4545 }, { "entropy": 6.375413465499878, "epoch": 0.4548408057179987, "grad_norm": 1.015625, "learning_rate": 0.0004985754690003354, "loss": 6.463, "mean_token_accuracy": 0.12876035273075104, "num_tokens": 8909202.0, "step": 4550 }, { "entropy": 6.362637329101562, "epoch": 0.45534063077922726, "grad_norm": 1.09375, "learning_rate": 0.0004985714565346145, "loss": 6.2731, "mean_token_accuracy": 0.14898935705423355, "num_tokens": 8918844.0, "step": 4555 }, { "entropy": 6.50612359046936, "epoch": 0.45584045584045585, "grad_norm": 1.1015625, "learning_rate": 0.0004985674384438933, "loss": 6.3859, "mean_token_accuracy": 0.13208258599042894, "num_tokens": 8928706.0, "step": 4560 }, { "entropy": 6.495807266235351, "epoch": 0.45634028090168444, "grad_norm": 1.0859375, "learning_rate": 0.0004985634147282729, "loss": 6.3235, "mean_token_accuracy": 0.1419259324669838, "num_tokens": 8939293.0, "step": 4565 }, { "entropy": 6.330229187011719, "epoch": 0.45684010596291297, "grad_norm": 1.1171875, "learning_rate": 0.0004985593853878544, "loss": 6.3021, "mean_token_accuracy": 0.13806715086102486, "num_tokens": 8947922.0, "step": 4570 }, { "entropy": 6.336430025100708, "epoch": 0.45733993102414155, "grad_norm": 1.0390625, "learning_rate": 0.0004985553504227394, "loss": 6.3088, "mean_token_accuracy": 0.14462661296129226, "num_tokens": 8957745.0, "step": 4575 }, { "entropy": 6.517952728271484, "epoch": 0.45783975608537014, "grad_norm": 1.125, "learning_rate": 0.0004985513098330293, "loss": 6.4451, "mean_token_accuracy": 0.13025145679712297, "num_tokens": 8968331.0, "step": 4580 }, { "entropy": 6.442313957214355, "epoch": 0.4583395811465987, "grad_norm": 1.109375, "learning_rate": 0.0004985472636188257, "loss": 6.2953, "mean_token_accuracy": 0.1470504179596901, "num_tokens": 8977752.0, "step": 4585 }, { "entropy": 6.348786783218384, "epoch": 0.45883940620782726, "grad_norm": 1.1875, "learning_rate": 0.0004985432117802305, "loss": 6.3284, "mean_token_accuracy": 0.13521047681570053, "num_tokens": 8986701.0, "step": 4590 }, { "entropy": 6.356202936172485, "epoch": 0.45933923126905585, "grad_norm": 1.125, "learning_rate": 0.0004985391543173456, "loss": 6.3793, "mean_token_accuracy": 0.13613076582551004, "num_tokens": 8996192.0, "step": 4595 }, { "entropy": 6.5046874523162845, "epoch": 0.4598390563302844, "grad_norm": 1.0625, "learning_rate": 0.000498535091230273, "loss": 6.3453, "mean_token_accuracy": 0.13811999410390854, "num_tokens": 9007059.0, "step": 4600 }, { "entropy": 6.36495680809021, "epoch": 0.46033888139151297, "grad_norm": 1.1328125, "learning_rate": 0.0004985310225191152, "loss": 6.2861, "mean_token_accuracy": 0.13991933912038804, "num_tokens": 9016923.0, "step": 4605 }, { "entropy": 6.417649173736573, "epoch": 0.46083870645274155, "grad_norm": 1.1640625, "learning_rate": 0.0004985269481839744, "loss": 6.4057, "mean_token_accuracy": 0.13580618500709535, "num_tokens": 9026034.0, "step": 4610 }, { "entropy": 6.55390625, "epoch": 0.4613385315139701, "grad_norm": 1.09375, "learning_rate": 0.0004985228682249529, "loss": 6.414, "mean_token_accuracy": 0.13191715031862258, "num_tokens": 9036773.0, "step": 4615 }, { "entropy": 6.437671566009522, "epoch": 0.46183835657519867, "grad_norm": 1.0078125, "learning_rate": 0.0004985187826421538, "loss": 6.3699, "mean_token_accuracy": 0.13903029933571814, "num_tokens": 9047825.0, "step": 4620 }, { "entropy": 6.451393985748291, "epoch": 0.46233818163642726, "grad_norm": 1.125, "learning_rate": 0.0004985146914356795, "loss": 6.4405, "mean_token_accuracy": 0.13519158437848092, "num_tokens": 9056295.0, "step": 4625 }, { "entropy": 6.442917108535767, "epoch": 0.46283800669765585, "grad_norm": 1.078125, "learning_rate": 0.000498510594605633, "loss": 6.3904, "mean_token_accuracy": 0.13657915964722633, "num_tokens": 9067245.0, "step": 4630 }, { "entropy": 6.431668329238891, "epoch": 0.4633378317588844, "grad_norm": 0.98828125, "learning_rate": 0.0004985064921521177, "loss": 6.3562, "mean_token_accuracy": 0.13739126324653625, "num_tokens": 9077528.0, "step": 4635 }, { "entropy": 6.414422988891602, "epoch": 0.46383765682011296, "grad_norm": 1.265625, "learning_rate": 0.0004985023840752364, "loss": 6.2794, "mean_token_accuracy": 0.14148288667201997, "num_tokens": 9086015.0, "step": 4640 }, { "entropy": 6.46856803894043, "epoch": 0.46433748188134155, "grad_norm": 1.1953125, "learning_rate": 0.0004984982703750926, "loss": 6.3562, "mean_token_accuracy": 0.13547587618231774, "num_tokens": 9095963.0, "step": 4645 }, { "entropy": 6.324900102615357, "epoch": 0.4648373069425701, "grad_norm": 1.2578125, "learning_rate": 0.0004984941510517899, "loss": 6.1896, "mean_token_accuracy": 0.14242352768778802, "num_tokens": 9105819.0, "step": 4650 }, { "entropy": 6.324583625793457, "epoch": 0.46533713200379867, "grad_norm": 1.21875, "learning_rate": 0.0004984900261054319, "loss": 6.2002, "mean_token_accuracy": 0.14522180408239366, "num_tokens": 9114574.0, "step": 4655 }, { "entropy": 6.430502605438233, "epoch": 0.46583695706502726, "grad_norm": 1.28125, "learning_rate": 0.0004984858955361224, "loss": 6.4139, "mean_token_accuracy": 0.13110233321785927, "num_tokens": 9125490.0, "step": 4660 }, { "entropy": 6.514950084686279, "epoch": 0.4663367821262558, "grad_norm": 1.15625, "learning_rate": 0.0004984817593439651, "loss": 6.3685, "mean_token_accuracy": 0.13579460829496384, "num_tokens": 9134886.0, "step": 4665 }, { "entropy": 6.368170738220215, "epoch": 0.4668366071874844, "grad_norm": 1.078125, "learning_rate": 0.0004984776175290643, "loss": 6.3113, "mean_token_accuracy": 0.14255902469158171, "num_tokens": 9143598.0, "step": 4670 }, { "entropy": 6.34682936668396, "epoch": 0.46733643224871296, "grad_norm": 1.171875, "learning_rate": 0.0004984734700915242, "loss": 6.3983, "mean_token_accuracy": 0.12681760415434837, "num_tokens": 9153051.0, "step": 4675 }, { "entropy": 6.5240332126617435, "epoch": 0.4678362573099415, "grad_norm": 1.1015625, "learning_rate": 0.000498469317031449, "loss": 6.3257, "mean_token_accuracy": 0.1389312207698822, "num_tokens": 9162472.0, "step": 4680 }, { "entropy": 6.4434144496917725, "epoch": 0.4683360823711701, "grad_norm": 1.140625, "learning_rate": 0.0004984651583489434, "loss": 6.3844, "mean_token_accuracy": 0.13914884254336357, "num_tokens": 9171453.0, "step": 4685 }, { "entropy": 6.390880918502807, "epoch": 0.46883590743239867, "grad_norm": 1.0234375, "learning_rate": 0.0004984609940441119, "loss": 6.2935, "mean_token_accuracy": 0.14254987463355065, "num_tokens": 9181104.0, "step": 4690 }, { "entropy": 6.423695039749146, "epoch": 0.46933573249362726, "grad_norm": 1.140625, "learning_rate": 0.0004984568241170593, "loss": 6.3876, "mean_token_accuracy": 0.14116302505135536, "num_tokens": 9190403.0, "step": 4695 }, { "entropy": 6.336381912231445, "epoch": 0.4698355575548558, "grad_norm": 1.125, "learning_rate": 0.0004984526485678905, "loss": 6.2576, "mean_token_accuracy": 0.1406373657286167, "num_tokens": 9199132.0, "step": 4700 }, { "entropy": 6.456232309341431, "epoch": 0.4703353826160844, "grad_norm": 1.1484375, "learning_rate": 0.0004984484673967105, "loss": 6.4177, "mean_token_accuracy": 0.12666289135813713, "num_tokens": 9208274.0, "step": 4705 }, { "entropy": 6.388136005401611, "epoch": 0.47083520767731296, "grad_norm": 1.046875, "learning_rate": 0.0004984442806036246, "loss": 6.3933, "mean_token_accuracy": 0.14819189608097078, "num_tokens": 9218513.0, "step": 4710 }, { "entropy": 6.43345046043396, "epoch": 0.4713350327385415, "grad_norm": 1.109375, "learning_rate": 0.0004984400881887381, "loss": 6.3889, "mean_token_accuracy": 0.1344588428735733, "num_tokens": 9229197.0, "step": 4715 }, { "entropy": 6.464925956726074, "epoch": 0.4718348577997701, "grad_norm": 1.078125, "learning_rate": 0.0004984358901521565, "loss": 6.2591, "mean_token_accuracy": 0.1347227245569229, "num_tokens": 9239465.0, "step": 4720 }, { "entropy": 6.422285795211792, "epoch": 0.47233468286099867, "grad_norm": 1.046875, "learning_rate": 0.0004984316864939853, "loss": 6.3694, "mean_token_accuracy": 0.14140414595603942, "num_tokens": 9250112.0, "step": 4725 }, { "entropy": 6.404574966430664, "epoch": 0.4728345079222272, "grad_norm": 1.109375, "learning_rate": 0.0004984274772143304, "loss": 6.3721, "mean_token_accuracy": 0.13907759562134742, "num_tokens": 9259406.0, "step": 4730 }, { "entropy": 6.434519910812378, "epoch": 0.4733343329834558, "grad_norm": 1.09375, "learning_rate": 0.0004984232623132977, "loss": 6.3006, "mean_token_accuracy": 0.13723840266466142, "num_tokens": 9269462.0, "step": 4735 }, { "entropy": 6.399371576309204, "epoch": 0.4738341580446844, "grad_norm": 1.1875, "learning_rate": 0.0004984190417909932, "loss": 6.3621, "mean_token_accuracy": 0.1323429524898529, "num_tokens": 9280291.0, "step": 4740 }, { "entropy": 6.464402103424073, "epoch": 0.4743339831059129, "grad_norm": 1.1640625, "learning_rate": 0.0004984148156475231, "loss": 6.3276, "mean_token_accuracy": 0.13442974165081978, "num_tokens": 9289680.0, "step": 4745 }, { "entropy": 6.40746283531189, "epoch": 0.4748338081671415, "grad_norm": 1.046875, "learning_rate": 0.0004984105838829937, "loss": 6.3354, "mean_token_accuracy": 0.13612587079405786, "num_tokens": 9301043.0, "step": 4750 }, { "entropy": 6.197843790054321, "epoch": 0.4753336332283701, "grad_norm": 1.1953125, "learning_rate": 0.0004984063464975116, "loss": 6.3959, "mean_token_accuracy": 0.13443394303321837, "num_tokens": 9311851.0, "step": 4755 }, { "entropy": 6.521279525756836, "epoch": 0.47583345828959867, "grad_norm": 1.125, "learning_rate": 0.0004984021034911833, "loss": 6.3155, "mean_token_accuracy": 0.1389845132827759, "num_tokens": 9320886.0, "step": 4760 }, { "entropy": 6.436952018737793, "epoch": 0.4763332833508272, "grad_norm": 1.1796875, "learning_rate": 0.0004983978548641154, "loss": 6.3972, "mean_token_accuracy": 0.13653154224157332, "num_tokens": 9330518.0, "step": 4765 }, { "entropy": 6.341850900650025, "epoch": 0.4768331084120558, "grad_norm": 1.1171875, "learning_rate": 0.0004983936006164151, "loss": 6.2379, "mean_token_accuracy": 0.13599972128868104, "num_tokens": 9339703.0, "step": 4770 }, { "entropy": 6.547325086593628, "epoch": 0.47733293347328437, "grad_norm": 1.0625, "learning_rate": 0.0004983893407481892, "loss": 6.4733, "mean_token_accuracy": 0.127138202637434, "num_tokens": 9349931.0, "step": 4775 }, { "entropy": 6.424779891967773, "epoch": 0.4778327585345129, "grad_norm": 1.109375, "learning_rate": 0.0004983850752595451, "loss": 6.3293, "mean_token_accuracy": 0.1422683008015156, "num_tokens": 9358984.0, "step": 4780 }, { "entropy": 6.4349016666412355, "epoch": 0.4783325835957415, "grad_norm": 1.0703125, "learning_rate": 0.0004983808041505898, "loss": 6.2833, "mean_token_accuracy": 0.13742662444710732, "num_tokens": 9368081.0, "step": 4785 }, { "entropy": 6.458392238616943, "epoch": 0.4788324086569701, "grad_norm": 1.0859375, "learning_rate": 0.0004983765274214311, "loss": 6.4138, "mean_token_accuracy": 0.13497077152132989, "num_tokens": 9377346.0, "step": 4790 }, { "entropy": 6.343363904953003, "epoch": 0.4793322337181986, "grad_norm": 1.03125, "learning_rate": 0.0004983722450721764, "loss": 6.3641, "mean_token_accuracy": 0.13735883086919784, "num_tokens": 9387493.0, "step": 4795 }, { "entropy": 6.4110101699829105, "epoch": 0.4798320587794272, "grad_norm": 1.140625, "learning_rate": 0.0004983679571029336, "loss": 6.3267, "mean_token_accuracy": 0.13297692984342574, "num_tokens": 9397154.0, "step": 4800 }, { "entropy": 6.446910238265991, "epoch": 0.4803318838406558, "grad_norm": 1.0390625, "learning_rate": 0.0004983636635138103, "loss": 6.4467, "mean_token_accuracy": 0.13256388455629348, "num_tokens": 9406705.0, "step": 4805 }, { "entropy": 6.409035348892212, "epoch": 0.4808317089018843, "grad_norm": 1.0390625, "learning_rate": 0.0004983593643049148, "loss": 6.2945, "mean_token_accuracy": 0.14054804518818856, "num_tokens": 9416850.0, "step": 4810 }, { "entropy": 6.302218580245972, "epoch": 0.4813315339631129, "grad_norm": 1.2265625, "learning_rate": 0.0004983550594763552, "loss": 6.2822, "mean_token_accuracy": 0.13723476678133012, "num_tokens": 9425841.0, "step": 4815 }, { "entropy": 6.312332344055176, "epoch": 0.4818313590243415, "grad_norm": 1.1875, "learning_rate": 0.0004983507490282397, "loss": 6.2176, "mean_token_accuracy": 0.14703118205070495, "num_tokens": 9436748.0, "step": 4820 }, { "entropy": 6.436319065093994, "epoch": 0.4823311840855701, "grad_norm": 1.1328125, "learning_rate": 0.0004983464329606768, "loss": 6.3686, "mean_token_accuracy": 0.13694579228758813, "num_tokens": 9446043.0, "step": 4825 }, { "entropy": 6.404607200622559, "epoch": 0.4828310091467986, "grad_norm": 1.21875, "learning_rate": 0.0004983421112737752, "loss": 6.382, "mean_token_accuracy": 0.1413051627576351, "num_tokens": 9455480.0, "step": 4830 }, { "entropy": 6.4302928924560545, "epoch": 0.4833308342080272, "grad_norm": 1.1171875, "learning_rate": 0.0004983377839676435, "loss": 6.3611, "mean_token_accuracy": 0.13676040768623351, "num_tokens": 9464412.0, "step": 4835 }, { "entropy": 6.424809360504151, "epoch": 0.4838306592692558, "grad_norm": 1.0234375, "learning_rate": 0.0004983334510423906, "loss": 6.3192, "mean_token_accuracy": 0.13830352947115898, "num_tokens": 9475639.0, "step": 4840 }, { "entropy": 6.427857351303101, "epoch": 0.4843304843304843, "grad_norm": 1.1015625, "learning_rate": 0.0004983291124981257, "loss": 6.2785, "mean_token_accuracy": 0.14063755720853804, "num_tokens": 9484721.0, "step": 4845 }, { "entropy": 6.299161052703857, "epoch": 0.4848303093917129, "grad_norm": 1.1640625, "learning_rate": 0.0004983247683349576, "loss": 6.2247, "mean_token_accuracy": 0.1456839345395565, "num_tokens": 9494594.0, "step": 4850 }, { "entropy": 6.298327255249023, "epoch": 0.4853301344529415, "grad_norm": 1.1015625, "learning_rate": 0.0004983204185529959, "loss": 6.2658, "mean_token_accuracy": 0.14413323402404785, "num_tokens": 9503707.0, "step": 4855 }, { "entropy": 6.3907839298248295, "epoch": 0.48582995951417, "grad_norm": 1.25, "learning_rate": 0.0004983160631523499, "loss": 6.2272, "mean_token_accuracy": 0.14055933132767678, "num_tokens": 9512473.0, "step": 4860 }, { "entropy": 6.3712372303009035, "epoch": 0.4863297845753986, "grad_norm": 1.0390625, "learning_rate": 0.0004983117021331293, "loss": 6.3608, "mean_token_accuracy": 0.1389065131545067, "num_tokens": 9523253.0, "step": 4865 }, { "entropy": 6.4325599193573, "epoch": 0.4868296096366272, "grad_norm": 1.203125, "learning_rate": 0.0004983073354954436, "loss": 6.3142, "mean_token_accuracy": 0.1434569962322712, "num_tokens": 9531938.0, "step": 4870 }, { "entropy": 6.467983675003052, "epoch": 0.4873294346978557, "grad_norm": 1.09375, "learning_rate": 0.0004983029632394029, "loss": 6.3447, "mean_token_accuracy": 0.13684508129954337, "num_tokens": 9541542.0, "step": 4875 }, { "entropy": 6.302601099014282, "epoch": 0.4878292597590843, "grad_norm": 1.0390625, "learning_rate": 0.000498298585365117, "loss": 6.2624, "mean_token_accuracy": 0.142653389275074, "num_tokens": 9551521.0, "step": 4880 }, { "entropy": 6.383222913742065, "epoch": 0.4883290848203129, "grad_norm": 1.2109375, "learning_rate": 0.0004982942018726963, "loss": 6.389, "mean_token_accuracy": 0.14110652059316636, "num_tokens": 9561605.0, "step": 4885 }, { "entropy": 6.425156974792481, "epoch": 0.4888289098815415, "grad_norm": 1.140625, "learning_rate": 0.0004982898127622508, "loss": 6.3004, "mean_token_accuracy": 0.1347697749733925, "num_tokens": 9571591.0, "step": 4890 }, { "entropy": 6.312005710601807, "epoch": 0.48932873494277, "grad_norm": 1.2265625, "learning_rate": 0.0004982854180338911, "loss": 6.32, "mean_token_accuracy": 0.14240961745381356, "num_tokens": 9580994.0, "step": 4895 }, { "entropy": 6.423856019973755, "epoch": 0.4898285600039986, "grad_norm": 1.140625, "learning_rate": 0.0004982810176877279, "loss": 6.3051, "mean_token_accuracy": 0.13638504296541215, "num_tokens": 9589268.0, "step": 4900 }, { "entropy": 6.419354677200317, "epoch": 0.4903283850652272, "grad_norm": 1.078125, "learning_rate": 0.0004982766117238716, "loss": 6.3594, "mean_token_accuracy": 0.13577214404940605, "num_tokens": 9599461.0, "step": 4905 }, { "entropy": 6.396965980529785, "epoch": 0.4908282101264557, "grad_norm": 1.2265625, "learning_rate": 0.0004982722001424331, "loss": 6.3303, "mean_token_accuracy": 0.13797401115298272, "num_tokens": 9609629.0, "step": 4910 }, { "entropy": 6.341986274719238, "epoch": 0.4913280351876843, "grad_norm": 1.1171875, "learning_rate": 0.0004982677829435236, "loss": 6.2512, "mean_token_accuracy": 0.14354280680418013, "num_tokens": 9619618.0, "step": 4915 }, { "entropy": 6.379724216461182, "epoch": 0.4918278602489129, "grad_norm": 1.15625, "learning_rate": 0.0004982633601272543, "loss": 6.3056, "mean_token_accuracy": 0.13943262919783592, "num_tokens": 9629042.0, "step": 4920 }, { "entropy": 6.377507877349854, "epoch": 0.4923276853101414, "grad_norm": 1.0859375, "learning_rate": 0.0004982589316937361, "loss": 6.2897, "mean_token_accuracy": 0.14414727091789245, "num_tokens": 9638596.0, "step": 4925 }, { "entropy": 6.442139720916748, "epoch": 0.49282751037137, "grad_norm": 1.0703125, "learning_rate": 0.0004982544976430808, "loss": 6.3673, "mean_token_accuracy": 0.13445642665028573, "num_tokens": 9648505.0, "step": 4930 }, { "entropy": 6.35016016960144, "epoch": 0.4933273354325986, "grad_norm": 1.1875, "learning_rate": 0.0004982500579753995, "loss": 6.3477, "mean_token_accuracy": 0.13654106482863426, "num_tokens": 9658113.0, "step": 4935 }, { "entropy": 6.391938734054565, "epoch": 0.49382716049382713, "grad_norm": 1.1640625, "learning_rate": 0.0004982456126908044, "loss": 6.3747, "mean_token_accuracy": 0.13850862681865692, "num_tokens": 9668075.0, "step": 4940 }, { "entropy": 6.513855361938477, "epoch": 0.4943269855550557, "grad_norm": 1.046875, "learning_rate": 0.0004982411617894071, "loss": 6.3345, "mean_token_accuracy": 0.13620950132608414, "num_tokens": 9678139.0, "step": 4945 }, { "entropy": 6.363553190231324, "epoch": 0.4948268106162843, "grad_norm": 1.140625, "learning_rate": 0.0004982367052713196, "loss": 6.3503, "mean_token_accuracy": 0.13079959377646447, "num_tokens": 9687328.0, "step": 4950 }, { "entropy": 6.346356582641602, "epoch": 0.4953266356775129, "grad_norm": 1.03125, "learning_rate": 0.0004982322431366541, "loss": 6.3152, "mean_token_accuracy": 0.14156793877482415, "num_tokens": 9697536.0, "step": 4955 }, { "entropy": 6.391560411453247, "epoch": 0.4958264607387414, "grad_norm": 1.1796875, "learning_rate": 0.0004982277753855227, "loss": 6.3571, "mean_token_accuracy": 0.14056526571512223, "num_tokens": 9706804.0, "step": 4960 }, { "entropy": 6.377194356918335, "epoch": 0.49632628579997, "grad_norm": 1.109375, "learning_rate": 0.000498223302018038, "loss": 6.2653, "mean_token_accuracy": 0.1481527231633663, "num_tokens": 9716868.0, "step": 4965 }, { "entropy": 6.3460808277130125, "epoch": 0.4968261108611986, "grad_norm": 1.234375, "learning_rate": 0.0004982188230343124, "loss": 6.3554, "mean_token_accuracy": 0.14097662195563315, "num_tokens": 9728790.0, "step": 4970 }, { "entropy": 6.420025062561035, "epoch": 0.49732593592242713, "grad_norm": 1.1640625, "learning_rate": 0.0004982143384344587, "loss": 6.3704, "mean_token_accuracy": 0.1372966133058071, "num_tokens": 9739118.0, "step": 4975 }, { "entropy": 6.413408088684082, "epoch": 0.4978257609836557, "grad_norm": 1.0859375, "learning_rate": 0.0004982098482185897, "loss": 6.3296, "mean_token_accuracy": 0.1391241133213043, "num_tokens": 9749347.0, "step": 4980 }, { "entropy": 6.454338884353637, "epoch": 0.4983255860448843, "grad_norm": 1.1484375, "learning_rate": 0.0004982053523868182, "loss": 6.3706, "mean_token_accuracy": 0.1381652422249317, "num_tokens": 9759432.0, "step": 4985 }, { "entropy": 6.348123407363891, "epoch": 0.49882541110611284, "grad_norm": 1.1171875, "learning_rate": 0.0004982008509392576, "loss": 6.2999, "mean_token_accuracy": 0.1378486856818199, "num_tokens": 9768666.0, "step": 4990 }, { "entropy": 6.2872474670410154, "epoch": 0.4993252361673414, "grad_norm": 1.25, "learning_rate": 0.000498196343876021, "loss": 6.2387, "mean_token_accuracy": 0.14893582016229628, "num_tokens": 9778699.0, "step": 4995 }, { "entropy": 6.3792359828948975, "epoch": 0.49982506122857, "grad_norm": 1.125, "learning_rate": 0.0004981918311972219, "loss": 6.2744, "mean_token_accuracy": 0.13931502103805543, "num_tokens": 9788156.0, "step": 5000 }, { "entropy": 6.346083259582519, "epoch": 0.5003248862897985, "grad_norm": 1.15625, "learning_rate": 0.0004981873129029737, "loss": 6.2337, "mean_token_accuracy": 0.15014591813087463, "num_tokens": 9797293.0, "step": 5005 }, { "entropy": 6.321063566207886, "epoch": 0.5008247113510271, "grad_norm": 1.0703125, "learning_rate": 0.00049818278899339, "loss": 6.2396, "mean_token_accuracy": 0.1417209066450596, "num_tokens": 9806962.0, "step": 5010 }, { "entropy": 6.397770595550537, "epoch": 0.5013245364122557, "grad_norm": 1.2578125, "learning_rate": 0.000498178259468585, "loss": 6.3936, "mean_token_accuracy": 0.13865589052438737, "num_tokens": 9816689.0, "step": 5015 }, { "entropy": 6.406004858016968, "epoch": 0.5018243614734843, "grad_norm": 1.140625, "learning_rate": 0.0004981737243286722, "loss": 6.2308, "mean_token_accuracy": 0.1416420593857765, "num_tokens": 9826321.0, "step": 5020 }, { "entropy": 6.444920635223388, "epoch": 0.5023241865347129, "grad_norm": 1.15625, "learning_rate": 0.0004981691835737661, "loss": 6.3901, "mean_token_accuracy": 0.13233431354165076, "num_tokens": 9836054.0, "step": 5025 }, { "entropy": 6.445040464401245, "epoch": 0.5028240115959414, "grad_norm": 1.1484375, "learning_rate": 0.0004981646372039807, "loss": 6.3698, "mean_token_accuracy": 0.137714883685112, "num_tokens": 9846516.0, "step": 5030 }, { "entropy": 6.378769016265869, "epoch": 0.50332383665717, "grad_norm": 1.0859375, "learning_rate": 0.0004981600852194305, "loss": 6.1809, "mean_token_accuracy": 0.14500134512782098, "num_tokens": 9856599.0, "step": 5035 }, { "entropy": 6.373896980285645, "epoch": 0.5038236617183985, "grad_norm": 1.09375, "learning_rate": 0.00049815552762023, "loss": 6.3034, "mean_token_accuracy": 0.1417168639600277, "num_tokens": 9866922.0, "step": 5040 }, { "entropy": 6.321751499176026, "epoch": 0.5043234867796271, "grad_norm": 1.25, "learning_rate": 0.0004981509644064937, "loss": 6.2818, "mean_token_accuracy": 0.13754203915596008, "num_tokens": 9876174.0, "step": 5045 }, { "entropy": 6.289154052734375, "epoch": 0.5048233118408557, "grad_norm": 1.0859375, "learning_rate": 0.0004981463955783367, "loss": 6.2314, "mean_token_accuracy": 0.14614471644163132, "num_tokens": 9886208.0, "step": 5050 }, { "entropy": 6.375028371810913, "epoch": 0.5053231369020843, "grad_norm": 1.1484375, "learning_rate": 0.0004981418211358736, "loss": 6.2785, "mean_token_accuracy": 0.13845686763525009, "num_tokens": 9896522.0, "step": 5055 }, { "entropy": 6.387468147277832, "epoch": 0.5058229619633129, "grad_norm": 1.2109375, "learning_rate": 0.0004981372410792199, "loss": 6.2841, "mean_token_accuracy": 0.1429004319012165, "num_tokens": 9905753.0, "step": 5060 }, { "entropy": 6.395010375976563, "epoch": 0.5063227870245414, "grad_norm": 1.1875, "learning_rate": 0.0004981326554084906, "loss": 6.3935, "mean_token_accuracy": 0.14241379648447036, "num_tokens": 9916566.0, "step": 5065 }, { "entropy": 6.370335245132447, "epoch": 0.50682261208577, "grad_norm": 1.1484375, "learning_rate": 0.0004981280641238011, "loss": 6.3669, "mean_token_accuracy": 0.13439635932445526, "num_tokens": 9926126.0, "step": 5070 }, { "entropy": 6.426411056518555, "epoch": 0.5073224371469985, "grad_norm": 1.1328125, "learning_rate": 0.0004981234672252669, "loss": 6.3579, "mean_token_accuracy": 0.13243716582655907, "num_tokens": 9937666.0, "step": 5075 }, { "entropy": 6.4846014976501465, "epoch": 0.5078222622082271, "grad_norm": 1.21875, "learning_rate": 0.0004981188647130037, "loss": 6.4061, "mean_token_accuracy": 0.1410438321530819, "num_tokens": 9947107.0, "step": 5080 }, { "entropy": 6.404412460327149, "epoch": 0.5083220872694557, "grad_norm": 1.1171875, "learning_rate": 0.0004981142565871272, "loss": 6.2555, "mean_token_accuracy": 0.1399041622877121, "num_tokens": 9956484.0, "step": 5085 }, { "entropy": 6.238588333129883, "epoch": 0.5088219123306843, "grad_norm": 1.125, "learning_rate": 0.0004981096428477535, "loss": 6.289, "mean_token_accuracy": 0.1420084461569786, "num_tokens": 9966731.0, "step": 5090 }, { "entropy": 6.405433654785156, "epoch": 0.5093217373919128, "grad_norm": 1.1875, "learning_rate": 0.0004981050234949986, "loss": 6.2835, "mean_token_accuracy": 0.14363766014575957, "num_tokens": 9976491.0, "step": 5095 }, { "entropy": 6.3993744373321535, "epoch": 0.5098215624531414, "grad_norm": 1.2734375, "learning_rate": 0.0004981003985289786, "loss": 6.2361, "mean_token_accuracy": 0.14966873228549957, "num_tokens": 9985248.0, "step": 5100 }, { "entropy": 6.291393041610718, "epoch": 0.51032138751437, "grad_norm": 1.0859375, "learning_rate": 0.0004980957679498101, "loss": 6.3129, "mean_token_accuracy": 0.14490401297807692, "num_tokens": 9995578.0, "step": 5105 }, { "entropy": 6.4709821224212645, "epoch": 0.5108212125755985, "grad_norm": 1.046875, "learning_rate": 0.0004980911317576095, "loss": 6.4086, "mean_token_accuracy": 0.13916842490434647, "num_tokens": 10006078.0, "step": 5110 }, { "entropy": 6.440082788467407, "epoch": 0.5113210376368271, "grad_norm": 1.21875, "learning_rate": 0.0004980864899524933, "loss": 6.3618, "mean_token_accuracy": 0.1328499473631382, "num_tokens": 10015943.0, "step": 5115 }, { "entropy": 6.379803800582886, "epoch": 0.5118208626980557, "grad_norm": 1.171875, "learning_rate": 0.0004980818425345786, "loss": 6.3521, "mean_token_accuracy": 0.13664940968155861, "num_tokens": 10025738.0, "step": 5120 }, { "entropy": 6.454934024810791, "epoch": 0.5123206877592843, "grad_norm": 1.1875, "learning_rate": 0.000498077189503982, "loss": 6.3268, "mean_token_accuracy": 0.13216581642627717, "num_tokens": 10035032.0, "step": 5125 }, { "entropy": 6.3814489364624025, "epoch": 0.5128205128205128, "grad_norm": 1.09375, "learning_rate": 0.0004980725308608208, "loss": 6.2893, "mean_token_accuracy": 0.1422179237008095, "num_tokens": 10044201.0, "step": 5130 }, { "entropy": 6.341943168640137, "epoch": 0.5133203378817414, "grad_norm": 1.15625, "learning_rate": 0.0004980678666052121, "loss": 6.3285, "mean_token_accuracy": 0.14286698028445244, "num_tokens": 10054163.0, "step": 5135 }, { "entropy": 6.394853734970093, "epoch": 0.51382016294297, "grad_norm": 1.015625, "learning_rate": 0.0004980631967372733, "loss": 6.3161, "mean_token_accuracy": 0.14063534066081046, "num_tokens": 10065225.0, "step": 5140 }, { "entropy": 6.406400394439697, "epoch": 0.5143199880041985, "grad_norm": 1.296875, "learning_rate": 0.0004980585212571218, "loss": 6.3019, "mean_token_accuracy": 0.138229887932539, "num_tokens": 10074776.0, "step": 5145 }, { "entropy": 6.405063343048096, "epoch": 0.5148198130654271, "grad_norm": 1.0625, "learning_rate": 0.0004980538401648753, "loss": 6.4621, "mean_token_accuracy": 0.1354549139738083, "num_tokens": 10085917.0, "step": 5150 }, { "entropy": 6.422722244262696, "epoch": 0.5153196381266557, "grad_norm": 1.140625, "learning_rate": 0.0004980491534606517, "loss": 6.2556, "mean_token_accuracy": 0.14383360594511033, "num_tokens": 10094727.0, "step": 5155 }, { "entropy": 6.299395751953125, "epoch": 0.5158194631878842, "grad_norm": 1.015625, "learning_rate": 0.0004980444611445686, "loss": 6.2354, "mean_token_accuracy": 0.14570630937814713, "num_tokens": 10104839.0, "step": 5160 }, { "entropy": 6.321631288528442, "epoch": 0.5163192882491128, "grad_norm": 1.1015625, "learning_rate": 0.0004980397632167444, "loss": 6.2416, "mean_token_accuracy": 0.14232385382056237, "num_tokens": 10114501.0, "step": 5165 }, { "entropy": 6.415744876861572, "epoch": 0.5168191133103414, "grad_norm": 1.1171875, "learning_rate": 0.0004980350596772971, "loss": 6.3369, "mean_token_accuracy": 0.13884129449725152, "num_tokens": 10124597.0, "step": 5170 }, { "entropy": 6.245902395248413, "epoch": 0.51731893837157, "grad_norm": 2.0, "learning_rate": 0.0004980303505263451, "loss": 6.1978, "mean_token_accuracy": 0.1433788277208805, "num_tokens": 10135695.0, "step": 5175 }, { "entropy": 6.245345258712769, "epoch": 0.5178187634327985, "grad_norm": 1.1328125, "learning_rate": 0.0004980256357640069, "loss": 6.2906, "mean_token_accuracy": 0.14047933667898177, "num_tokens": 10146107.0, "step": 5180 }, { "entropy": 6.433437156677246, "epoch": 0.5183185884940271, "grad_norm": 1.1484375, "learning_rate": 0.0004980209153904011, "loss": 6.3634, "mean_token_accuracy": 0.14122015684843064, "num_tokens": 10155983.0, "step": 5185 }, { "entropy": 6.432741355895996, "epoch": 0.5188184135552557, "grad_norm": 1.1171875, "learning_rate": 0.0004980161894056464, "loss": 6.3152, "mean_token_accuracy": 0.13615113273262977, "num_tokens": 10166183.0, "step": 5190 }, { "entropy": 6.400639295578003, "epoch": 0.5193182386164842, "grad_norm": 1.2265625, "learning_rate": 0.0004980114578098618, "loss": 6.2125, "mean_token_accuracy": 0.14031895250082016, "num_tokens": 10175524.0, "step": 5195 }, { "entropy": 6.353472280502319, "epoch": 0.5198180636777128, "grad_norm": 1.0390625, "learning_rate": 0.0004980067206031663, "loss": 6.3585, "mean_token_accuracy": 0.13098444491624833, "num_tokens": 10186235.0, "step": 5200 }, { "entropy": 6.461900520324707, "epoch": 0.5203178887389414, "grad_norm": 1.0859375, "learning_rate": 0.0004980019777856791, "loss": 6.3487, "mean_token_accuracy": 0.1372937597334385, "num_tokens": 10196166.0, "step": 5205 }, { "entropy": 6.439592266082764, "epoch": 0.52081771380017, "grad_norm": 1.0625, "learning_rate": 0.0004979972293575195, "loss": 6.2917, "mean_token_accuracy": 0.1391717955470085, "num_tokens": 10205691.0, "step": 5210 }, { "entropy": 6.373390150070191, "epoch": 0.5213175388613985, "grad_norm": 1.046875, "learning_rate": 0.0004979924753188069, "loss": 6.2379, "mean_token_accuracy": 0.1419716775417328, "num_tokens": 10216224.0, "step": 5215 }, { "entropy": 6.31008358001709, "epoch": 0.5218173639226271, "grad_norm": 1.03125, "learning_rate": 0.0004979877156696612, "loss": 6.3075, "mean_token_accuracy": 0.142496807128191, "num_tokens": 10226468.0, "step": 5220 }, { "entropy": 6.5411852359771725, "epoch": 0.5223171889838556, "grad_norm": 1.0546875, "learning_rate": 0.0004979829504102018, "loss": 6.3187, "mean_token_accuracy": 0.137630794942379, "num_tokens": 10235932.0, "step": 5225 }, { "entropy": 6.442687034606934, "epoch": 0.5228170140450842, "grad_norm": 0.98828125, "learning_rate": 0.0004979781795405488, "loss": 6.4271, "mean_token_accuracy": 0.13533934354782104, "num_tokens": 10246052.0, "step": 5230 }, { "entropy": 6.429741287231446, "epoch": 0.5233168391063128, "grad_norm": 1.1015625, "learning_rate": 0.0004979734030608222, "loss": 6.3278, "mean_token_accuracy": 0.13412164524197578, "num_tokens": 10255056.0, "step": 5235 }, { "entropy": 6.362507915496826, "epoch": 0.5238166641675414, "grad_norm": 1.140625, "learning_rate": 0.0004979686209711422, "loss": 6.2823, "mean_token_accuracy": 0.1377575747668743, "num_tokens": 10265403.0, "step": 5240 }, { "entropy": 6.301126480102539, "epoch": 0.5243164892287699, "grad_norm": 1.0078125, "learning_rate": 0.000497963833271629, "loss": 6.2542, "mean_token_accuracy": 0.14617456123232841, "num_tokens": 10275148.0, "step": 5245 }, { "entropy": 6.352523279190064, "epoch": 0.5248163142899985, "grad_norm": 1.1171875, "learning_rate": 0.0004979590399624031, "loss": 6.2978, "mean_token_accuracy": 0.13944504261016846, "num_tokens": 10285083.0, "step": 5250 }, { "entropy": 6.3316234111785885, "epoch": 0.5253161393512271, "grad_norm": 1.1015625, "learning_rate": 0.0004979542410435852, "loss": 6.2473, "mean_token_accuracy": 0.1363876312971115, "num_tokens": 10294466.0, "step": 5255 }, { "entropy": 6.440902662277222, "epoch": 0.5258159644124556, "grad_norm": 1.1953125, "learning_rate": 0.0004979494365152959, "loss": 6.3591, "mean_token_accuracy": 0.13570173531770707, "num_tokens": 10304333.0, "step": 5260 }, { "entropy": 6.436617088317871, "epoch": 0.5263157894736842, "grad_norm": 1.0703125, "learning_rate": 0.0004979446263776562, "loss": 6.2925, "mean_token_accuracy": 0.13742511495947837, "num_tokens": 10314880.0, "step": 5265 }, { "entropy": 6.390373945236206, "epoch": 0.5268156145349128, "grad_norm": 1.1796875, "learning_rate": 0.000497939810630787, "loss": 6.2632, "mean_token_accuracy": 0.13987749367952346, "num_tokens": 10324060.0, "step": 5270 }, { "entropy": 6.323992013931274, "epoch": 0.5273154395961414, "grad_norm": 1.03125, "learning_rate": 0.0004979349892748096, "loss": 6.3786, "mean_token_accuracy": 0.1369629204273224, "num_tokens": 10335248.0, "step": 5275 }, { "entropy": 6.365525913238526, "epoch": 0.5278152646573699, "grad_norm": 1.2734375, "learning_rate": 0.0004979301623098452, "loss": 6.1764, "mean_token_accuracy": 0.14416617378592492, "num_tokens": 10343974.0, "step": 5280 }, { "entropy": 6.409889984130859, "epoch": 0.5283150897185985, "grad_norm": 1.2109375, "learning_rate": 0.0004979253297360153, "loss": 6.2923, "mean_token_accuracy": 0.13761034682393075, "num_tokens": 10354037.0, "step": 5285 }, { "entropy": 6.427184581756592, "epoch": 0.528814914779827, "grad_norm": 1.0234375, "learning_rate": 0.0004979204915534415, "loss": 6.3421, "mean_token_accuracy": 0.13941146433353424, "num_tokens": 10364714.0, "step": 5290 }, { "entropy": 6.3684930324554445, "epoch": 0.5293147398410556, "grad_norm": 1.15625, "learning_rate": 0.0004979156477622454, "loss": 6.321, "mean_token_accuracy": 0.1379815936088562, "num_tokens": 10373972.0, "step": 5295 }, { "entropy": 6.265024280548095, "epoch": 0.5298145649022842, "grad_norm": 1.0546875, "learning_rate": 0.0004979107983625491, "loss": 6.219, "mean_token_accuracy": 0.14653107672929763, "num_tokens": 10382882.0, "step": 5300 }, { "entropy": 6.301440572738647, "epoch": 0.5303143899635128, "grad_norm": 1.078125, "learning_rate": 0.0004979059433544744, "loss": 6.2685, "mean_token_accuracy": 0.14495664685964585, "num_tokens": 10392257.0, "step": 5305 }, { "entropy": 6.395061731338501, "epoch": 0.5308142150247414, "grad_norm": 1.1015625, "learning_rate": 0.0004979010827381435, "loss": 6.3023, "mean_token_accuracy": 0.13960984945297242, "num_tokens": 10401055.0, "step": 5310 }, { "entropy": 6.412199068069458, "epoch": 0.5313140400859699, "grad_norm": 1.0390625, "learning_rate": 0.0004978962165136787, "loss": 6.4062, "mean_token_accuracy": 0.13208347037434578, "num_tokens": 10411443.0, "step": 5315 }, { "entropy": 6.459276485443115, "epoch": 0.5318138651471985, "grad_norm": 1.15625, "learning_rate": 0.0004978913446812025, "loss": 6.3952, "mean_token_accuracy": 0.13661471232771874, "num_tokens": 10422142.0, "step": 5320 }, { "entropy": 6.452884864807129, "epoch": 0.532313690208427, "grad_norm": 1.1328125, "learning_rate": 0.0004978864672408374, "loss": 6.309, "mean_token_accuracy": 0.13937231451272963, "num_tokens": 10432454.0, "step": 5325 }, { "entropy": 6.313589382171631, "epoch": 0.5328135152696556, "grad_norm": 0.99609375, "learning_rate": 0.0004978815841927061, "loss": 6.2813, "mean_token_accuracy": 0.14135064482688903, "num_tokens": 10443625.0, "step": 5330 }, { "entropy": 6.43781361579895, "epoch": 0.5333133403308842, "grad_norm": 1.078125, "learning_rate": 0.0004978766955369315, "loss": 6.3521, "mean_token_accuracy": 0.1418583534657955, "num_tokens": 10454055.0, "step": 5335 }, { "entropy": 6.324926519393921, "epoch": 0.5338131653921128, "grad_norm": 1.2890625, "learning_rate": 0.0004978718012736367, "loss": 6.1918, "mean_token_accuracy": 0.14811479896306992, "num_tokens": 10462683.0, "step": 5340 }, { "entropy": 6.282338714599609, "epoch": 0.5343129904533414, "grad_norm": 1.140625, "learning_rate": 0.0004978669014029446, "loss": 6.2115, "mean_token_accuracy": 0.1487436003983021, "num_tokens": 10471699.0, "step": 5345 }, { "entropy": 6.296060609817505, "epoch": 0.5348128155145699, "grad_norm": 1.078125, "learning_rate": 0.0004978619959249787, "loss": 6.1496, "mean_token_accuracy": 0.15180823877453803, "num_tokens": 10480790.0, "step": 5350 }, { "entropy": 6.321809577941894, "epoch": 0.5353126405757984, "grad_norm": 1.265625, "learning_rate": 0.0004978570848398623, "loss": 6.2535, "mean_token_accuracy": 0.1351524792611599, "num_tokens": 10490202.0, "step": 5355 }, { "entropy": 6.3398229598999025, "epoch": 0.535812465637027, "grad_norm": 1.078125, "learning_rate": 0.000497852168147719, "loss": 6.3211, "mean_token_accuracy": 0.13673623278737068, "num_tokens": 10499690.0, "step": 5360 }, { "entropy": 6.41335916519165, "epoch": 0.5363122906982556, "grad_norm": 1.109375, "learning_rate": 0.0004978472458486724, "loss": 6.2927, "mean_token_accuracy": 0.13549100011587142, "num_tokens": 10510120.0, "step": 5365 }, { "entropy": 6.417970085144043, "epoch": 0.5368121157594842, "grad_norm": 1.1953125, "learning_rate": 0.0004978423179428466, "loss": 6.4271, "mean_token_accuracy": 0.133928569406271, "num_tokens": 10520521.0, "step": 5370 }, { "entropy": 6.289327335357666, "epoch": 0.5373119408207128, "grad_norm": 1.3046875, "learning_rate": 0.0004978373844303653, "loss": 6.1127, "mean_token_accuracy": 0.14804793000221253, "num_tokens": 10530233.0, "step": 5375 }, { "entropy": 6.345554542541504, "epoch": 0.5378117658819414, "grad_norm": 1.046875, "learning_rate": 0.0004978324453113528, "loss": 6.2398, "mean_token_accuracy": 0.1437473401427269, "num_tokens": 10539683.0, "step": 5380 }, { "entropy": 6.34681248664856, "epoch": 0.5383115909431699, "grad_norm": 1.125, "learning_rate": 0.0004978275005859333, "loss": 6.2695, "mean_token_accuracy": 0.14396946206688882, "num_tokens": 10549483.0, "step": 5385 }, { "entropy": 6.408108568191528, "epoch": 0.5388114160043984, "grad_norm": 0.984375, "learning_rate": 0.0004978225502542313, "loss": 6.3746, "mean_token_accuracy": 0.1334490619599819, "num_tokens": 10560464.0, "step": 5390 }, { "entropy": 6.3947995662689205, "epoch": 0.539311241065627, "grad_norm": 1.1640625, "learning_rate": 0.0004978175943163712, "loss": 6.2731, "mean_token_accuracy": 0.13974858000874518, "num_tokens": 10568660.0, "step": 5395 }, { "entropy": 6.407984018325806, "epoch": 0.5398110661268556, "grad_norm": 1.125, "learning_rate": 0.0004978126327724777, "loss": 6.337, "mean_token_accuracy": 0.1405469924211502, "num_tokens": 10577304.0, "step": 5400 }, { "entropy": 6.36352276802063, "epoch": 0.5403108911880842, "grad_norm": 1.0859375, "learning_rate": 0.0004978076656226758, "loss": 6.2301, "mean_token_accuracy": 0.1479938320815563, "num_tokens": 10587591.0, "step": 5405 }, { "entropy": 6.3344934463500975, "epoch": 0.5408107162493128, "grad_norm": 2.140625, "learning_rate": 0.0004978026928670902, "loss": 6.1936, "mean_token_accuracy": 0.14546226859092712, "num_tokens": 10598591.0, "step": 5410 }, { "entropy": 6.2777117729187015, "epoch": 0.5413105413105413, "grad_norm": 1.0078125, "learning_rate": 0.0004977977145058463, "loss": 6.2212, "mean_token_accuracy": 0.13852583095431328, "num_tokens": 10608842.0, "step": 5415 }, { "entropy": 6.30012698173523, "epoch": 0.5418103663717699, "grad_norm": 1.0625, "learning_rate": 0.0004977927305390693, "loss": 6.3043, "mean_token_accuracy": 0.14666473120450974, "num_tokens": 10618812.0, "step": 5420 }, { "entropy": 6.421801662445068, "epoch": 0.5423101914329984, "grad_norm": 1.4140625, "learning_rate": 0.0004977877409668845, "loss": 6.4107, "mean_token_accuracy": 0.13223664835095406, "num_tokens": 10629244.0, "step": 5425 }, { "entropy": 6.456833124160767, "epoch": 0.542810016494227, "grad_norm": 1.1875, "learning_rate": 0.0004977827457894174, "loss": 6.3447, "mean_token_accuracy": 0.13367147296667098, "num_tokens": 10638931.0, "step": 5430 }, { "entropy": 6.362542581558228, "epoch": 0.5433098415554556, "grad_norm": 1.171875, "learning_rate": 0.0004977777450067937, "loss": 6.2081, "mean_token_accuracy": 0.14372213631868364, "num_tokens": 10648754.0, "step": 5435 }, { "entropy": 6.285918760299682, "epoch": 0.5438096666166842, "grad_norm": 1.171875, "learning_rate": 0.0004977727386191393, "loss": 6.187, "mean_token_accuracy": 0.14815898686647416, "num_tokens": 10657716.0, "step": 5440 }, { "entropy": 6.323311853408813, "epoch": 0.5443094916779128, "grad_norm": 1.0625, "learning_rate": 0.0004977677266265802, "loss": 6.2191, "mean_token_accuracy": 0.14353563338518144, "num_tokens": 10667621.0, "step": 5445 }, { "entropy": 6.348590230941772, "epoch": 0.5448093167391413, "grad_norm": 1.125, "learning_rate": 0.0004977627090292424, "loss": 6.1981, "mean_token_accuracy": 0.14093047380447388, "num_tokens": 10676640.0, "step": 5450 }, { "entropy": 6.300322103500366, "epoch": 0.5453091418003698, "grad_norm": 1.203125, "learning_rate": 0.0004977576858272521, "loss": 6.3171, "mean_token_accuracy": 0.13745146691799165, "num_tokens": 10687034.0, "step": 5455 }, { "entropy": 6.372998762130737, "epoch": 0.5458089668615984, "grad_norm": 1.09375, "learning_rate": 0.0004977526570207358, "loss": 6.2001, "mean_token_accuracy": 0.14638773947954178, "num_tokens": 10696234.0, "step": 5460 }, { "entropy": 6.274461793899536, "epoch": 0.546308791922827, "grad_norm": 1.234375, "learning_rate": 0.0004977476226098199, "loss": 6.2148, "mean_token_accuracy": 0.1524929493665695, "num_tokens": 10705733.0, "step": 5465 }, { "entropy": 6.352570295333862, "epoch": 0.5468086169840556, "grad_norm": 1.28125, "learning_rate": 0.0004977425825946312, "loss": 6.249, "mean_token_accuracy": 0.14258571341633797, "num_tokens": 10714628.0, "step": 5470 }, { "entropy": 6.3967187881469725, "epoch": 0.5473084420452842, "grad_norm": 1.1796875, "learning_rate": 0.0004977375369752964, "loss": 6.4011, "mean_token_accuracy": 0.1309283420443535, "num_tokens": 10726120.0, "step": 5475 }, { "entropy": 6.370625019073486, "epoch": 0.5478082671065128, "grad_norm": 1.1171875, "learning_rate": 0.0004977324857519425, "loss": 6.2556, "mean_token_accuracy": 0.14103192687034607, "num_tokens": 10735976.0, "step": 5480 }, { "entropy": 6.377379703521728, "epoch": 0.5483080921677413, "grad_norm": 1.0859375, "learning_rate": 0.0004977274289246967, "loss": 6.3458, "mean_token_accuracy": 0.13264099061489104, "num_tokens": 10745730.0, "step": 5485 }, { "entropy": 6.3523273944854735, "epoch": 0.5488079172289698, "grad_norm": 1.0625, "learning_rate": 0.0004977223664936859, "loss": 6.2485, "mean_token_accuracy": 0.14141613021492958, "num_tokens": 10755435.0, "step": 5490 }, { "entropy": 6.3246574878692625, "epoch": 0.5493077422901984, "grad_norm": 1.0859375, "learning_rate": 0.0004977172984590378, "loss": 6.1592, "mean_token_accuracy": 0.1442379593849182, "num_tokens": 10765483.0, "step": 5495 }, { "entropy": 6.300998735427856, "epoch": 0.549807567351427, "grad_norm": 1.1484375, "learning_rate": 0.0004977122248208798, "loss": 6.2384, "mean_token_accuracy": 0.14392194896936417, "num_tokens": 10775034.0, "step": 5500 }, { "entropy": 6.292659139633178, "epoch": 0.5503073924126556, "grad_norm": 1.0703125, "learning_rate": 0.0004977071455793394, "loss": 6.2054, "mean_token_accuracy": 0.14822374880313874, "num_tokens": 10784799.0, "step": 5505 }, { "entropy": 6.379563999176026, "epoch": 0.5508072174738842, "grad_norm": 1.0859375, "learning_rate": 0.0004977020607345445, "loss": 6.3093, "mean_token_accuracy": 0.1327025532722473, "num_tokens": 10794907.0, "step": 5510 }, { "entropy": 6.31625804901123, "epoch": 0.5513070425351128, "grad_norm": 1.09375, "learning_rate": 0.0004976969702866231, "loss": 6.2059, "mean_token_accuracy": 0.14766609147191048, "num_tokens": 10804374.0, "step": 5515 }, { "entropy": 6.332025003433228, "epoch": 0.5518068675963412, "grad_norm": 1.171875, "learning_rate": 0.0004976918742357033, "loss": 6.2386, "mean_token_accuracy": 0.1420293740928173, "num_tokens": 10814245.0, "step": 5520 }, { "entropy": 6.282225131988525, "epoch": 0.5523066926575698, "grad_norm": 1.0, "learning_rate": 0.0004976867725819133, "loss": 6.2497, "mean_token_accuracy": 0.1439930096268654, "num_tokens": 10824667.0, "step": 5525 }, { "entropy": 6.322996044158936, "epoch": 0.5528065177187984, "grad_norm": 1.1171875, "learning_rate": 0.0004976816653253813, "loss": 6.196, "mean_token_accuracy": 0.14456692785024644, "num_tokens": 10834890.0, "step": 5530 }, { "entropy": 6.33039288520813, "epoch": 0.553306342780027, "grad_norm": 1.09375, "learning_rate": 0.0004976765524662359, "loss": 6.1911, "mean_token_accuracy": 0.14612701460719107, "num_tokens": 10844751.0, "step": 5535 }, { "entropy": 6.375986814498901, "epoch": 0.5538061678412556, "grad_norm": 1.1171875, "learning_rate": 0.0004976714340046058, "loss": 6.3259, "mean_token_accuracy": 0.14123422801494598, "num_tokens": 10854113.0, "step": 5540 }, { "entropy": 6.272052812576294, "epoch": 0.5543059929024842, "grad_norm": 1.265625, "learning_rate": 0.0004976663099406196, "loss": 6.162, "mean_token_accuracy": 0.14373724684119224, "num_tokens": 10863468.0, "step": 5545 }, { "entropy": 6.368210744857788, "epoch": 0.5548058179637128, "grad_norm": 1.203125, "learning_rate": 0.0004976611802744066, "loss": 6.2815, "mean_token_accuracy": 0.14646353498101233, "num_tokens": 10873381.0, "step": 5550 }, { "entropy": 6.386367702484131, "epoch": 0.5553056430249412, "grad_norm": 1.1640625, "learning_rate": 0.0004976560450060954, "loss": 6.2059, "mean_token_accuracy": 0.14763978868722916, "num_tokens": 10883457.0, "step": 5555 }, { "entropy": 6.244527053833008, "epoch": 0.5558054680861698, "grad_norm": 1.09375, "learning_rate": 0.0004976509041358154, "loss": 6.1734, "mean_token_accuracy": 0.14715434312820436, "num_tokens": 10892822.0, "step": 5560 }, { "entropy": 6.289275741577148, "epoch": 0.5563052931473984, "grad_norm": 1.1484375, "learning_rate": 0.000497645757663696, "loss": 6.1534, "mean_token_accuracy": 0.15133251026272773, "num_tokens": 10901935.0, "step": 5565 }, { "entropy": 6.2485250473022464, "epoch": 0.556805118208627, "grad_norm": 1.15625, "learning_rate": 0.0004976406055898665, "loss": 6.2452, "mean_token_accuracy": 0.14060668796300888, "num_tokens": 10911863.0, "step": 5570 }, { "entropy": 6.329042434692383, "epoch": 0.5573049432698556, "grad_norm": 1.1875, "learning_rate": 0.0004976354479144568, "loss": 6.2083, "mean_token_accuracy": 0.14429977908730507, "num_tokens": 10921196.0, "step": 5575 }, { "entropy": 6.333301210403443, "epoch": 0.5578047683310842, "grad_norm": 1.109375, "learning_rate": 0.0004976302846375965, "loss": 6.1839, "mean_token_accuracy": 0.14238550141453743, "num_tokens": 10931374.0, "step": 5580 }, { "entropy": 6.400436305999756, "epoch": 0.5583045933923126, "grad_norm": 1.1328125, "learning_rate": 0.0004976251157594155, "loss": 6.3403, "mean_token_accuracy": 0.1371694512665272, "num_tokens": 10941002.0, "step": 5585 }, { "entropy": 6.418968963623047, "epoch": 0.5588044184535412, "grad_norm": 1.171875, "learning_rate": 0.0004976199412800437, "loss": 6.2727, "mean_token_accuracy": 0.14011965394020082, "num_tokens": 10950602.0, "step": 5590 }, { "entropy": 6.366796064376831, "epoch": 0.5593042435147698, "grad_norm": 1.1484375, "learning_rate": 0.0004976147611996118, "loss": 6.2315, "mean_token_accuracy": 0.14264914765954018, "num_tokens": 10960363.0, "step": 5595 }, { "entropy": 6.369522333145142, "epoch": 0.5598040685759984, "grad_norm": 1.2109375, "learning_rate": 0.0004976095755182496, "loss": 6.3354, "mean_token_accuracy": 0.13463364765048028, "num_tokens": 10970179.0, "step": 5600 }, { "entropy": 6.314689636230469, "epoch": 0.560303893637227, "grad_norm": 1.1875, "learning_rate": 0.0004976043842360877, "loss": 6.2307, "mean_token_accuracy": 0.1400937870144844, "num_tokens": 10980446.0, "step": 5605 }, { "entropy": 6.312025690078736, "epoch": 0.5608037186984556, "grad_norm": 1.109375, "learning_rate": 0.000497599187353257, "loss": 6.2782, "mean_token_accuracy": 0.1409224160015583, "num_tokens": 10990883.0, "step": 5610 }, { "entropy": 6.3605124950408936, "epoch": 0.5613035437596842, "grad_norm": 1.0859375, "learning_rate": 0.0004975939848698879, "loss": 6.1799, "mean_token_accuracy": 0.1477658122777939, "num_tokens": 11000956.0, "step": 5615 }, { "entropy": 6.2973676204681395, "epoch": 0.5618033688209126, "grad_norm": 1.1015625, "learning_rate": 0.0004975887767861113, "loss": 6.2397, "mean_token_accuracy": 0.14062583595514297, "num_tokens": 11010873.0, "step": 5620 }, { "entropy": 6.3561375617980955, "epoch": 0.5623031938821412, "grad_norm": 1.2265625, "learning_rate": 0.0004975835631020585, "loss": 6.2065, "mean_token_accuracy": 0.14184274300932884, "num_tokens": 11020192.0, "step": 5625 }, { "entropy": 6.32411642074585, "epoch": 0.5628030189433698, "grad_norm": 1.125, "learning_rate": 0.0004975783438178605, "loss": 6.2395, "mean_token_accuracy": 0.14021152928471564, "num_tokens": 11030466.0, "step": 5630 }, { "entropy": 6.265923690795899, "epoch": 0.5633028440045984, "grad_norm": 1.03125, "learning_rate": 0.0004975731189336487, "loss": 6.2029, "mean_token_accuracy": 0.14996592849493026, "num_tokens": 11040309.0, "step": 5635 }, { "entropy": 6.338271522521973, "epoch": 0.563802669065827, "grad_norm": 1.1328125, "learning_rate": 0.0004975678884495544, "loss": 6.2921, "mean_token_accuracy": 0.14094484001398086, "num_tokens": 11049560.0, "step": 5640 }, { "entropy": 6.419568157196045, "epoch": 0.5643024941270556, "grad_norm": 1.1640625, "learning_rate": 0.0004975626523657093, "loss": 6.3675, "mean_token_accuracy": 0.12910672202706336, "num_tokens": 11059352.0, "step": 5645 }, { "entropy": 6.401751756668091, "epoch": 0.564802319188284, "grad_norm": 1.0546875, "learning_rate": 0.0004975574106822451, "loss": 6.2646, "mean_token_accuracy": 0.1445077180862427, "num_tokens": 11069159.0, "step": 5650 }, { "entropy": 6.341478443145752, "epoch": 0.5653021442495126, "grad_norm": 1.125, "learning_rate": 0.0004975521633992938, "loss": 6.3459, "mean_token_accuracy": 0.13364666253328322, "num_tokens": 11078960.0, "step": 5655 }, { "entropy": 6.35322265625, "epoch": 0.5658019693107412, "grad_norm": 1.046875, "learning_rate": 0.0004975469105169873, "loss": 6.1762, "mean_token_accuracy": 0.15067835450172423, "num_tokens": 11089408.0, "step": 5660 }, { "entropy": 6.391804647445679, "epoch": 0.5663017943719698, "grad_norm": 1.2109375, "learning_rate": 0.0004975416520354579, "loss": 6.3354, "mean_token_accuracy": 0.13959866464138032, "num_tokens": 11099485.0, "step": 5665 }, { "entropy": 6.334350442886352, "epoch": 0.5668016194331984, "grad_norm": 1.25, "learning_rate": 0.0004975363879548377, "loss": 6.351, "mean_token_accuracy": 0.1425812341272831, "num_tokens": 11109568.0, "step": 5670 }, { "entropy": 6.533071231842041, "epoch": 0.567301444494427, "grad_norm": 1.1484375, "learning_rate": 0.0004975311182752592, "loss": 6.4188, "mean_token_accuracy": 0.1318359337747097, "num_tokens": 11119433.0, "step": 5675 }, { "entropy": 6.496234512329101, "epoch": 0.5678012695556556, "grad_norm": 1.2109375, "learning_rate": 0.0004975258429968551, "loss": 6.3272, "mean_token_accuracy": 0.13728075623512268, "num_tokens": 11130060.0, "step": 5680 }, { "entropy": 6.396345376968384, "epoch": 0.568301094616884, "grad_norm": 1.2421875, "learning_rate": 0.0004975205621197581, "loss": 6.3773, "mean_token_accuracy": 0.13217183873057364, "num_tokens": 11140417.0, "step": 5685 }, { "entropy": 6.433355045318604, "epoch": 0.5688009196781126, "grad_norm": 1.0625, "learning_rate": 0.0004975152756441009, "loss": 6.3254, "mean_token_accuracy": 0.1399938814342022, "num_tokens": 11150830.0, "step": 5690 }, { "entropy": 6.3664405822753904, "epoch": 0.5693007447393412, "grad_norm": 1.1484375, "learning_rate": 0.0004975099835700166, "loss": 6.1443, "mean_token_accuracy": 0.15007183998823165, "num_tokens": 11161057.0, "step": 5695 }, { "entropy": 6.253142976760865, "epoch": 0.5698005698005698, "grad_norm": 1.3046875, "learning_rate": 0.0004975046858976386, "loss": 6.2196, "mean_token_accuracy": 0.14115416407585143, "num_tokens": 11170182.0, "step": 5700 }, { "entropy": 6.260078001022339, "epoch": 0.5703003948617984, "grad_norm": 1.1640625, "learning_rate": 0.0004974993826270997, "loss": 6.1676, "mean_token_accuracy": 0.14473040029406548, "num_tokens": 11179962.0, "step": 5705 }, { "entropy": 6.33286337852478, "epoch": 0.570800219923027, "grad_norm": 1.2109375, "learning_rate": 0.0004974940737585337, "loss": 6.1085, "mean_token_accuracy": 0.15513153970241547, "num_tokens": 11189341.0, "step": 5710 }, { "entropy": 6.2625147819519045, "epoch": 0.5713000449842555, "grad_norm": 1.203125, "learning_rate": 0.000497488759292074, "loss": 6.2502, "mean_token_accuracy": 0.1522951252758503, "num_tokens": 11199264.0, "step": 5715 }, { "entropy": 6.2431128978729244, "epoch": 0.571799870045484, "grad_norm": 1.0546875, "learning_rate": 0.0004974834392278545, "loss": 6.2419, "mean_token_accuracy": 0.1471673645079136, "num_tokens": 11209257.0, "step": 5720 }, { "entropy": 6.395171689987182, "epoch": 0.5722996951067126, "grad_norm": 1.1015625, "learning_rate": 0.0004974781135660088, "loss": 6.2897, "mean_token_accuracy": 0.14230490028858184, "num_tokens": 11218294.0, "step": 5725 }, { "entropy": 6.288343524932861, "epoch": 0.5727995201679412, "grad_norm": 1.25, "learning_rate": 0.0004974727823066709, "loss": 6.1347, "mean_token_accuracy": 0.15037455558776855, "num_tokens": 11227684.0, "step": 5730 }, { "entropy": 6.406284475326538, "epoch": 0.5732993452291698, "grad_norm": 1.296875, "learning_rate": 0.0004974674454499753, "loss": 6.3439, "mean_token_accuracy": 0.1382959380745888, "num_tokens": 11237195.0, "step": 5735 }, { "entropy": 6.413314390182495, "epoch": 0.5737991702903984, "grad_norm": 1.203125, "learning_rate": 0.0004974621029960559, "loss": 6.311, "mean_token_accuracy": 0.13842954337596894, "num_tokens": 11246871.0, "step": 5740 }, { "entropy": 6.3722772121429445, "epoch": 0.574298995351627, "grad_norm": 1.3359375, "learning_rate": 0.0004974567549450472, "loss": 6.1532, "mean_token_accuracy": 0.15091011747717858, "num_tokens": 11256298.0, "step": 5745 }, { "entropy": 6.4279319763183596, "epoch": 0.5747988204128555, "grad_norm": 1.1328125, "learning_rate": 0.0004974514012970839, "loss": 6.3627, "mean_token_accuracy": 0.13900440111756324, "num_tokens": 11265857.0, "step": 5750 }, { "entropy": 6.272759199142456, "epoch": 0.575298645474084, "grad_norm": 1.0234375, "learning_rate": 0.0004974460420523005, "loss": 6.1397, "mean_token_accuracy": 0.14941828846931457, "num_tokens": 11275406.0, "step": 5755 }, { "entropy": 6.309527015686035, "epoch": 0.5757984705353126, "grad_norm": 1.109375, "learning_rate": 0.0004974406772108319, "loss": 6.1391, "mean_token_accuracy": 0.14953822940587996, "num_tokens": 11283910.0, "step": 5760 }, { "entropy": 6.307175874710083, "epoch": 0.5762982955965412, "grad_norm": 1.1015625, "learning_rate": 0.0004974353067728132, "loss": 6.2019, "mean_token_accuracy": 0.14291139543056489, "num_tokens": 11293808.0, "step": 5765 }, { "entropy": 6.313005542755127, "epoch": 0.5767981206577698, "grad_norm": 1.2109375, "learning_rate": 0.0004974299307383794, "loss": 6.244, "mean_token_accuracy": 0.14377905800938606, "num_tokens": 11302519.0, "step": 5770 }, { "entropy": 6.399163722991943, "epoch": 0.5772979457189984, "grad_norm": 1.1953125, "learning_rate": 0.0004974245491076656, "loss": 6.3541, "mean_token_accuracy": 0.135417915135622, "num_tokens": 11312609.0, "step": 5775 }, { "entropy": 6.3678234100341795, "epoch": 0.5777977707802269, "grad_norm": 1.1875, "learning_rate": 0.0004974191618808075, "loss": 6.2845, "mean_token_accuracy": 0.1417811058461666, "num_tokens": 11322471.0, "step": 5780 }, { "entropy": 6.440444850921631, "epoch": 0.5782975958414555, "grad_norm": 1.4140625, "learning_rate": 0.0004974137690579405, "loss": 6.2783, "mean_token_accuracy": 0.14394563660025597, "num_tokens": 11333332.0, "step": 5785 }, { "entropy": 6.370710325241089, "epoch": 0.578797420902684, "grad_norm": 1.234375, "learning_rate": 0.0004974083706392004, "loss": 6.2827, "mean_token_accuracy": 0.13744583651423453, "num_tokens": 11342952.0, "step": 5790 }, { "entropy": 6.3380354881286625, "epoch": 0.5792972459639126, "grad_norm": 1.0625, "learning_rate": 0.0004974029666247228, "loss": 6.3595, "mean_token_accuracy": 0.13167960494756697, "num_tokens": 11353509.0, "step": 5795 }, { "entropy": 6.501959228515625, "epoch": 0.5797970710251412, "grad_norm": 1.0703125, "learning_rate": 0.0004973975570146438, "loss": 6.3631, "mean_token_accuracy": 0.1348981648683548, "num_tokens": 11363065.0, "step": 5800 }, { "entropy": 6.295175361633301, "epoch": 0.5802968960863698, "grad_norm": 1.203125, "learning_rate": 0.0004973921418090997, "loss": 6.2263, "mean_token_accuracy": 0.14342114701867104, "num_tokens": 11373720.0, "step": 5805 }, { "entropy": 6.239151048660278, "epoch": 0.5807967211475984, "grad_norm": 1.1484375, "learning_rate": 0.0004973867210082263, "loss": 6.2176, "mean_token_accuracy": 0.1432886928319931, "num_tokens": 11384432.0, "step": 5810 }, { "entropy": 6.3962414264678955, "epoch": 0.5812965462088269, "grad_norm": 1.1484375, "learning_rate": 0.0004973812946121603, "loss": 6.3836, "mean_token_accuracy": 0.13938908129930497, "num_tokens": 11394100.0, "step": 5815 }, { "entropy": 6.33066029548645, "epoch": 0.5817963712700555, "grad_norm": 1.25, "learning_rate": 0.0004973758626210382, "loss": 6.2488, "mean_token_accuracy": 0.1417160674929619, "num_tokens": 11403359.0, "step": 5820 }, { "entropy": 6.364110088348388, "epoch": 0.582296196331284, "grad_norm": 1.25, "learning_rate": 0.0004973704250349965, "loss": 6.2859, "mean_token_accuracy": 0.1334216959774494, "num_tokens": 11412921.0, "step": 5825 }, { "entropy": 6.37510929107666, "epoch": 0.5827960213925126, "grad_norm": 1.15625, "learning_rate": 0.0004973649818541722, "loss": 6.2338, "mean_token_accuracy": 0.13970995396375657, "num_tokens": 11422459.0, "step": 5830 }, { "entropy": 6.358178663253784, "epoch": 0.5832958464537412, "grad_norm": 1.1484375, "learning_rate": 0.0004973595330787022, "loss": 6.1865, "mean_token_accuracy": 0.1506979987025261, "num_tokens": 11431517.0, "step": 5835 }, { "entropy": 6.336723709106446, "epoch": 0.5837956715149698, "grad_norm": 1.265625, "learning_rate": 0.0004973540787087235, "loss": 6.2381, "mean_token_accuracy": 0.14081623926758766, "num_tokens": 11440662.0, "step": 5840 }, { "entropy": 6.235829639434814, "epoch": 0.5842954965761983, "grad_norm": 1.3046875, "learning_rate": 0.0004973486187443734, "loss": 6.0816, "mean_token_accuracy": 0.15424600690603257, "num_tokens": 11449762.0, "step": 5845 }, { "entropy": 6.179425573348999, "epoch": 0.5847953216374269, "grad_norm": 1.1875, "learning_rate": 0.0004973431531857893, "loss": 6.1006, "mean_token_accuracy": 0.15300129354000092, "num_tokens": 11459963.0, "step": 5850 }, { "entropy": 6.3275891780853275, "epoch": 0.5852951466986555, "grad_norm": 1.1328125, "learning_rate": 0.0004973376820331087, "loss": 6.2651, "mean_token_accuracy": 0.14004729613661765, "num_tokens": 11469063.0, "step": 5855 }, { "entropy": 6.344074344635009, "epoch": 0.585794971759884, "grad_norm": 1.15625, "learning_rate": 0.0004973322052864692, "loss": 6.1642, "mean_token_accuracy": 0.15059844255447388, "num_tokens": 11477651.0, "step": 5860 }, { "entropy": 6.4009171485900875, "epoch": 0.5862947968211126, "grad_norm": 1.1015625, "learning_rate": 0.0004973267229460087, "loss": 6.3628, "mean_token_accuracy": 0.1331980399787426, "num_tokens": 11487248.0, "step": 5865 }, { "entropy": 6.331179523468018, "epoch": 0.5867946218823412, "grad_norm": 1.0859375, "learning_rate": 0.000497321235011865, "loss": 6.3433, "mean_token_accuracy": 0.1435278907418251, "num_tokens": 11497066.0, "step": 5870 }, { "entropy": 6.4113420963287355, "epoch": 0.5872944469435698, "grad_norm": 1.09375, "learning_rate": 0.0004973157414841763, "loss": 6.3115, "mean_token_accuracy": 0.13302920013666153, "num_tokens": 11508490.0, "step": 5875 }, { "entropy": 6.369688367843628, "epoch": 0.5877942720047983, "grad_norm": 1.203125, "learning_rate": 0.0004973102423630806, "loss": 6.2994, "mean_token_accuracy": 0.14273363649845122, "num_tokens": 11518851.0, "step": 5880 }, { "entropy": 6.323107671737671, "epoch": 0.5882940970660269, "grad_norm": 1.2265625, "learning_rate": 0.0004973047376487166, "loss": 6.2629, "mean_token_accuracy": 0.140333840996027, "num_tokens": 11529102.0, "step": 5885 }, { "entropy": 6.341410970687866, "epoch": 0.5887939221272555, "grad_norm": 1.15625, "learning_rate": 0.0004972992273412224, "loss": 6.2889, "mean_token_accuracy": 0.13700356483459472, "num_tokens": 11540563.0, "step": 5890 }, { "entropy": 6.337323474884033, "epoch": 0.589293747188484, "grad_norm": 1.1171875, "learning_rate": 0.0004972937114407369, "loss": 6.2045, "mean_token_accuracy": 0.1455566741526127, "num_tokens": 11549955.0, "step": 5895 }, { "entropy": 6.304736471176147, "epoch": 0.5897935722497126, "grad_norm": 1.1953125, "learning_rate": 0.000497288189947399, "loss": 6.1877, "mean_token_accuracy": 0.14470466002821922, "num_tokens": 11558932.0, "step": 5900 }, { "entropy": 6.216138076782227, "epoch": 0.5902933973109412, "grad_norm": 1.0703125, "learning_rate": 0.0004972826628613472, "loss": 6.2009, "mean_token_accuracy": 0.14667390063405036, "num_tokens": 11568901.0, "step": 5905 }, { "entropy": 6.339971828460693, "epoch": 0.5907932223721697, "grad_norm": 1.078125, "learning_rate": 0.0004972771301827209, "loss": 6.2558, "mean_token_accuracy": 0.14320868328213693, "num_tokens": 11579738.0, "step": 5910 }, { "entropy": 6.384644412994385, "epoch": 0.5912930474333983, "grad_norm": 1.2109375, "learning_rate": 0.0004972715919116592, "loss": 6.2366, "mean_token_accuracy": 0.14273437932133676, "num_tokens": 11590293.0, "step": 5915 }, { "entropy": 6.334532880783081, "epoch": 0.5917928724946269, "grad_norm": 1.109375, "learning_rate": 0.0004972660480483015, "loss": 6.3015, "mean_token_accuracy": 0.13526504263281822, "num_tokens": 11599745.0, "step": 5920 }, { "entropy": 6.35646915435791, "epoch": 0.5922926975558555, "grad_norm": 1.015625, "learning_rate": 0.0004972604985927871, "loss": 6.29, "mean_token_accuracy": 0.13545462265610694, "num_tokens": 11609958.0, "step": 5925 }, { "entropy": 6.412453746795654, "epoch": 0.592792522617084, "grad_norm": 1.1015625, "learning_rate": 0.0004972549435452558, "loss": 6.2698, "mean_token_accuracy": 0.1367018401622772, "num_tokens": 11619941.0, "step": 5930 }, { "entropy": 6.296717691421509, "epoch": 0.5932923476783126, "grad_norm": 1.1015625, "learning_rate": 0.0004972493829058474, "loss": 6.1477, "mean_token_accuracy": 0.1530252903699875, "num_tokens": 11630287.0, "step": 5935 }, { "entropy": 6.32022614479065, "epoch": 0.5937921727395412, "grad_norm": 1.1875, "learning_rate": 0.0004972438166747016, "loss": 6.2019, "mean_token_accuracy": 0.14405305236577987, "num_tokens": 11639806.0, "step": 5940 }, { "entropy": 6.295377397537232, "epoch": 0.5942919978007697, "grad_norm": 1.1328125, "learning_rate": 0.0004972382448519586, "loss": 6.294, "mean_token_accuracy": 0.1430134057998657, "num_tokens": 11650132.0, "step": 5945 }, { "entropy": 6.320089721679688, "epoch": 0.5947918228619983, "grad_norm": 1.171875, "learning_rate": 0.0004972326674377586, "loss": 6.21, "mean_token_accuracy": 0.1424887128174305, "num_tokens": 11659670.0, "step": 5950 }, { "entropy": 6.361303281784058, "epoch": 0.5952916479232269, "grad_norm": 1.0546875, "learning_rate": 0.0004972270844322418, "loss": 6.2706, "mean_token_accuracy": 0.14572205990552903, "num_tokens": 11669998.0, "step": 5955 }, { "entropy": 6.3370928287506105, "epoch": 0.5957914729844555, "grad_norm": 1.3125, "learning_rate": 0.0004972214958355488, "loss": 6.2654, "mean_token_accuracy": 0.14094047322869302, "num_tokens": 11679052.0, "step": 5960 }, { "entropy": 6.328358221054077, "epoch": 0.596291298045684, "grad_norm": 1.21875, "learning_rate": 0.0004972159016478201, "loss": 6.254, "mean_token_accuracy": 0.1448790781199932, "num_tokens": 11687957.0, "step": 5965 }, { "entropy": 6.362970972061158, "epoch": 0.5967911231069126, "grad_norm": 1.2578125, "learning_rate": 0.0004972103018691965, "loss": 6.1781, "mean_token_accuracy": 0.14631520956754684, "num_tokens": 11696922.0, "step": 5970 }, { "entropy": 6.295720767974854, "epoch": 0.5972909481681411, "grad_norm": 1.203125, "learning_rate": 0.0004972046964998189, "loss": 6.1718, "mean_token_accuracy": 0.14752159640192986, "num_tokens": 11706600.0, "step": 5975 }, { "entropy": 6.2522577285766605, "epoch": 0.5977907732293697, "grad_norm": 1.1484375, "learning_rate": 0.0004971990855398283, "loss": 6.2009, "mean_token_accuracy": 0.14315633177757264, "num_tokens": 11715933.0, "step": 5980 }, { "entropy": 6.289220237731934, "epoch": 0.5982905982905983, "grad_norm": 1.2109375, "learning_rate": 0.0004971934689893658, "loss": 6.1558, "mean_token_accuracy": 0.1515709176659584, "num_tokens": 11724807.0, "step": 5985 }, { "entropy": 6.345755100250244, "epoch": 0.5987904233518269, "grad_norm": 1.2890625, "learning_rate": 0.0004971878468485729, "loss": 6.2374, "mean_token_accuracy": 0.14083078131079674, "num_tokens": 11734985.0, "step": 5990 }, { "entropy": 6.343067836761475, "epoch": 0.5992902484130554, "grad_norm": 1.2890625, "learning_rate": 0.000497182219117591, "loss": 6.223, "mean_token_accuracy": 0.14369984343647957, "num_tokens": 11743418.0, "step": 5995 }, { "entropy": 6.274335336685181, "epoch": 0.599790073474284, "grad_norm": 1.1953125, "learning_rate": 0.0004971765857965615, "loss": 6.1777, "mean_token_accuracy": 0.14245593249797822, "num_tokens": 11752953.0, "step": 6000 }, { "epoch": 0.599790073474284, "eval_entropy": 6.13612363670819, "eval_loss": 6.280503273010254, "eval_mean_token_accuracy": 0.14671862201803096, "eval_num_tokens": 11752953.0, "eval_runtime": 24.0294, "eval_samples_per_second": 1291.956, "eval_steps_per_second": 161.51, "step": 6000 }, { "entropy": 6.3440389156341555, "epoch": 0.6002898985355126, "grad_norm": 1.15625, "learning_rate": 0.0004971709468856263, "loss": 6.316, "mean_token_accuracy": 0.13903788477182388, "num_tokens": 11763260.0, "step": 6005 }, { "entropy": 6.242662239074707, "epoch": 0.6007897235967411, "grad_norm": 1.40625, "learning_rate": 0.0004971653023849274, "loss": 6.0854, "mean_token_accuracy": 0.1641439639031887, "num_tokens": 11773255.0, "step": 6010 }, { "entropy": 6.377378034591675, "epoch": 0.6012895486579697, "grad_norm": 1.2265625, "learning_rate": 0.0004971596522946065, "loss": 6.2306, "mean_token_accuracy": 0.14113587737083436, "num_tokens": 11783443.0, "step": 6015 }, { "entropy": 6.2793535709381105, "epoch": 0.6017893737191983, "grad_norm": 1.203125, "learning_rate": 0.0004971539966148059, "loss": 6.1885, "mean_token_accuracy": 0.14466064497828485, "num_tokens": 11791932.0, "step": 6020 }, { "entropy": 6.291140842437744, "epoch": 0.6022891987804269, "grad_norm": 1.125, "learning_rate": 0.0004971483353456681, "loss": 6.1631, "mean_token_accuracy": 0.14731817394495011, "num_tokens": 11801420.0, "step": 6025 }, { "entropy": 6.356692886352539, "epoch": 0.6027890238416554, "grad_norm": 1.1171875, "learning_rate": 0.0004971426684873352, "loss": 6.3165, "mean_token_accuracy": 0.13832596838474273, "num_tokens": 11810977.0, "step": 6030 }, { "entropy": 6.271351766586304, "epoch": 0.603288848902884, "grad_norm": 1.21875, "learning_rate": 0.0004971369960399499, "loss": 6.1112, "mean_token_accuracy": 0.1504375457763672, "num_tokens": 11821016.0, "step": 6035 }, { "entropy": 6.332382154464722, "epoch": 0.6037886739641125, "grad_norm": 1.1171875, "learning_rate": 0.000497131318003655, "loss": 6.2628, "mean_token_accuracy": 0.13746074512600898, "num_tokens": 11831157.0, "step": 6040 }, { "entropy": 6.279897403717041, "epoch": 0.6042884990253411, "grad_norm": 1.2578125, "learning_rate": 0.0004971256343785932, "loss": 6.1728, "mean_token_accuracy": 0.14922841638326645, "num_tokens": 11840319.0, "step": 6045 }, { "entropy": 6.318679571151733, "epoch": 0.6047883240865697, "grad_norm": 1.09375, "learning_rate": 0.0004971199451649078, "loss": 6.3085, "mean_token_accuracy": 0.13916947543621064, "num_tokens": 11850808.0, "step": 6050 }, { "entropy": 6.400442695617675, "epoch": 0.6052881491477983, "grad_norm": 1.2890625, "learning_rate": 0.0004971142503627415, "loss": 6.3542, "mean_token_accuracy": 0.14150375127792358, "num_tokens": 11861123.0, "step": 6055 }, { "entropy": 6.240767335891723, "epoch": 0.6057879742090269, "grad_norm": 1.1015625, "learning_rate": 0.000497108549972238, "loss": 6.0891, "mean_token_accuracy": 0.14752269834280013, "num_tokens": 11870308.0, "step": 6060 }, { "entropy": 6.373895645141602, "epoch": 0.6062877992702554, "grad_norm": 1.328125, "learning_rate": 0.0004971028439935404, "loss": 6.2318, "mean_token_accuracy": 0.13867005333304405, "num_tokens": 11880254.0, "step": 6065 }, { "entropy": 6.327100563049316, "epoch": 0.606787624331484, "grad_norm": 1.265625, "learning_rate": 0.0004970971324267925, "loss": 6.2341, "mean_token_accuracy": 0.14898003488779069, "num_tokens": 11891272.0, "step": 6070 }, { "entropy": 6.312870216369629, "epoch": 0.6072874493927125, "grad_norm": 1.140625, "learning_rate": 0.0004970914152721378, "loss": 6.2626, "mean_token_accuracy": 0.14210639670491218, "num_tokens": 11901176.0, "step": 6075 }, { "entropy": 6.399405097961425, "epoch": 0.6077872744539411, "grad_norm": 1.4296875, "learning_rate": 0.0004970856925297204, "loss": 6.2639, "mean_token_accuracy": 0.136920203268528, "num_tokens": 11910820.0, "step": 6080 }, { "entropy": 6.290783786773682, "epoch": 0.6082870995151697, "grad_norm": 1.296875, "learning_rate": 0.000497079964199684, "loss": 6.215, "mean_token_accuracy": 0.13901869729161262, "num_tokens": 11920458.0, "step": 6085 }, { "entropy": 6.176512384414673, "epoch": 0.6087869245763983, "grad_norm": 1.1328125, "learning_rate": 0.0004970742302821729, "loss": 6.078, "mean_token_accuracy": 0.15024468004703523, "num_tokens": 11931150.0, "step": 6090 }, { "entropy": 6.303402709960937, "epoch": 0.6092867496376269, "grad_norm": 1.1015625, "learning_rate": 0.0004970684907773312, "loss": 6.1903, "mean_token_accuracy": 0.14731646180152894, "num_tokens": 11939960.0, "step": 6095 }, { "entropy": 6.430849695205689, "epoch": 0.6097865746988554, "grad_norm": 1.390625, "learning_rate": 0.0004970627456853036, "loss": 6.3687, "mean_token_accuracy": 0.13612013831734657, "num_tokens": 11950781.0, "step": 6100 }, { "entropy": 6.371213960647583, "epoch": 0.6102863997600839, "grad_norm": 1.2578125, "learning_rate": 0.0004970569950062343, "loss": 6.2074, "mean_token_accuracy": 0.1433712512254715, "num_tokens": 11960489.0, "step": 6105 }, { "entropy": 6.297654533386231, "epoch": 0.6107862248213125, "grad_norm": 1.1484375, "learning_rate": 0.0004970512387402682, "loss": 6.2333, "mean_token_accuracy": 0.1458951212465763, "num_tokens": 11970651.0, "step": 6110 }, { "entropy": 6.252086400985718, "epoch": 0.6112860498825411, "grad_norm": 1.234375, "learning_rate": 0.0004970454768875501, "loss": 6.1962, "mean_token_accuracy": 0.14458660632371903, "num_tokens": 11980349.0, "step": 6115 }, { "entropy": 6.311388921737671, "epoch": 0.6117858749437697, "grad_norm": 1.125, "learning_rate": 0.0004970397094482249, "loss": 6.239, "mean_token_accuracy": 0.14557712599635125, "num_tokens": 11990076.0, "step": 6120 }, { "entropy": 6.281975936889649, "epoch": 0.6122857000049983, "grad_norm": 1.0703125, "learning_rate": 0.0004970339364224378, "loss": 6.1421, "mean_token_accuracy": 0.1484926924109459, "num_tokens": 11999515.0, "step": 6125 }, { "entropy": 6.315656471252441, "epoch": 0.6127855250662269, "grad_norm": 1.0859375, "learning_rate": 0.0004970281578103339, "loss": 6.2927, "mean_token_accuracy": 0.1360795460641384, "num_tokens": 12009224.0, "step": 6130 }, { "entropy": 6.254594802856445, "epoch": 0.6132853501274554, "grad_norm": 1.1328125, "learning_rate": 0.0004970223736120587, "loss": 6.158, "mean_token_accuracy": 0.14876777231693267, "num_tokens": 12019295.0, "step": 6135 }, { "entropy": 6.348979473114014, "epoch": 0.6137851751886839, "grad_norm": 1.1015625, "learning_rate": 0.0004970165838277578, "loss": 6.2436, "mean_token_accuracy": 0.13932792767882346, "num_tokens": 12029130.0, "step": 6140 }, { "entropy": 6.330397748947144, "epoch": 0.6142850002499125, "grad_norm": 1.28125, "learning_rate": 0.0004970107884575767, "loss": 6.1932, "mean_token_accuracy": 0.1471465826034546, "num_tokens": 12038676.0, "step": 6145 }, { "entropy": 6.27381443977356, "epoch": 0.6147848253111411, "grad_norm": 1.1953125, "learning_rate": 0.0004970049875016613, "loss": 6.1647, "mean_token_accuracy": 0.15583466589450837, "num_tokens": 12048089.0, "step": 6150 }, { "entropy": 6.316942548751831, "epoch": 0.6152846503723697, "grad_norm": 1.1484375, "learning_rate": 0.0004969991809601576, "loss": 6.2437, "mean_token_accuracy": 0.14197300672531127, "num_tokens": 12059531.0, "step": 6155 }, { "entropy": 6.361162328720093, "epoch": 0.6157844754335983, "grad_norm": 1.15625, "learning_rate": 0.0004969933688332115, "loss": 6.2694, "mean_token_accuracy": 0.13537977114319802, "num_tokens": 12070103.0, "step": 6160 }, { "entropy": 6.284975576400757, "epoch": 0.6162843004948269, "grad_norm": 1.28125, "learning_rate": 0.0004969875511209694, "loss": 6.2245, "mean_token_accuracy": 0.1425408072769642, "num_tokens": 12078481.0, "step": 6165 }, { "entropy": 6.3813670635223385, "epoch": 0.6167841255560553, "grad_norm": 1.0859375, "learning_rate": 0.0004969817278235777, "loss": 6.3384, "mean_token_accuracy": 0.13671956434845925, "num_tokens": 12088875.0, "step": 6170 }, { "entropy": 6.381721639633179, "epoch": 0.6172839506172839, "grad_norm": 1.125, "learning_rate": 0.0004969758989411829, "loss": 6.2214, "mean_token_accuracy": 0.14257473722100258, "num_tokens": 12099769.0, "step": 6175 }, { "entropy": 6.35776538848877, "epoch": 0.6177837756785125, "grad_norm": 1.15625, "learning_rate": 0.0004969700644739315, "loss": 6.1849, "mean_token_accuracy": 0.14221653789281846, "num_tokens": 12109334.0, "step": 6180 }, { "entropy": 6.349963665008545, "epoch": 0.6182836007397411, "grad_norm": 1.109375, "learning_rate": 0.0004969642244219705, "loss": 6.2111, "mean_token_accuracy": 0.14354735389351844, "num_tokens": 12119017.0, "step": 6185 }, { "entropy": 6.214911699295044, "epoch": 0.6187834258009697, "grad_norm": 1.1171875, "learning_rate": 0.0004969583787854467, "loss": 6.1207, "mean_token_accuracy": 0.15771229714155197, "num_tokens": 12128002.0, "step": 6190 }, { "entropy": 6.311770343780518, "epoch": 0.6192832508621983, "grad_norm": 1.109375, "learning_rate": 0.0004969525275645071, "loss": 6.2245, "mean_token_accuracy": 0.1406985655426979, "num_tokens": 12137802.0, "step": 6195 }, { "entropy": 6.29865198135376, "epoch": 0.6197830759234269, "grad_norm": 1.2890625, "learning_rate": 0.0004969466707592991, "loss": 6.1841, "mean_token_accuracy": 0.14674678891897203, "num_tokens": 12147270.0, "step": 6200 }, { "entropy": 6.313567733764648, "epoch": 0.6202829009846553, "grad_norm": 1.203125, "learning_rate": 0.00049694080836997, "loss": 6.2237, "mean_token_accuracy": 0.14287682622671127, "num_tokens": 12157358.0, "step": 6205 }, { "entropy": 6.377605533599853, "epoch": 0.6207827260458839, "grad_norm": 1.25, "learning_rate": 0.0004969349403966672, "loss": 6.2886, "mean_token_accuracy": 0.14394927993416787, "num_tokens": 12166159.0, "step": 6210 }, { "entropy": 6.330509805679322, "epoch": 0.6212825511071125, "grad_norm": 1.125, "learning_rate": 0.0004969290668395385, "loss": 6.25, "mean_token_accuracy": 0.14399931356310844, "num_tokens": 12176405.0, "step": 6215 }, { "entropy": 6.404755306243897, "epoch": 0.6217823761683411, "grad_norm": 1.2734375, "learning_rate": 0.0004969231876987315, "loss": 6.2988, "mean_token_accuracy": 0.13984070494771003, "num_tokens": 12186021.0, "step": 6220 }, { "entropy": 6.312417984008789, "epoch": 0.6222822012295697, "grad_norm": 1.1796875, "learning_rate": 0.0004969173029743942, "loss": 6.1796, "mean_token_accuracy": 0.14615456983447075, "num_tokens": 12195222.0, "step": 6225 }, { "entropy": 6.289805746078491, "epoch": 0.6227820262907983, "grad_norm": 1.2109375, "learning_rate": 0.0004969114126666746, "loss": 6.1413, "mean_token_accuracy": 0.15038748309016228, "num_tokens": 12205443.0, "step": 6230 }, { "entropy": 6.365929222106933, "epoch": 0.6232818513520267, "grad_norm": 1.3359375, "learning_rate": 0.0004969055167757211, "loss": 6.3519, "mean_token_accuracy": 0.1405246950685978, "num_tokens": 12215181.0, "step": 6235 }, { "entropy": 6.365829992294311, "epoch": 0.6237816764132553, "grad_norm": 1.1484375, "learning_rate": 0.0004968996153016819, "loss": 6.2133, "mean_token_accuracy": 0.14518257826566697, "num_tokens": 12224327.0, "step": 6240 }, { "entropy": 6.293065214157105, "epoch": 0.6242815014744839, "grad_norm": 1.1875, "learning_rate": 0.0004968937082447054, "loss": 6.2436, "mean_token_accuracy": 0.14280423074960708, "num_tokens": 12234962.0, "step": 6245 }, { "entropy": 6.341446447372436, "epoch": 0.6247813265357125, "grad_norm": 1.1953125, "learning_rate": 0.0004968877956049403, "loss": 6.3128, "mean_token_accuracy": 0.14122455343604087, "num_tokens": 12245883.0, "step": 6250 }, { "entropy": 6.396516942977906, "epoch": 0.6252811515969411, "grad_norm": 1.3203125, "learning_rate": 0.0004968818773825355, "loss": 6.2943, "mean_token_accuracy": 0.13761424720287324, "num_tokens": 12254412.0, "step": 6255 }, { "entropy": 6.220240116119385, "epoch": 0.6257809766581697, "grad_norm": 1.171875, "learning_rate": 0.0004968759535776396, "loss": 6.1684, "mean_token_accuracy": 0.1464730307459831, "num_tokens": 12264894.0, "step": 6260 }, { "entropy": 6.33331789970398, "epoch": 0.6262808017193983, "grad_norm": 1.0859375, "learning_rate": 0.0004968700241904018, "loss": 6.2701, "mean_token_accuracy": 0.14257046431303025, "num_tokens": 12274557.0, "step": 6265 }, { "entropy": 6.336774826049805, "epoch": 0.6267806267806267, "grad_norm": 1.2890625, "learning_rate": 0.0004968640892209714, "loss": 6.0851, "mean_token_accuracy": 0.14928142875432968, "num_tokens": 12283696.0, "step": 6270 }, { "entropy": 6.241849374771118, "epoch": 0.6272804518418553, "grad_norm": 1.140625, "learning_rate": 0.0004968581486694975, "loss": 6.1659, "mean_token_accuracy": 0.14955419600009917, "num_tokens": 12292981.0, "step": 6275 }, { "entropy": 6.238350439071655, "epoch": 0.6277802769030839, "grad_norm": 1.1875, "learning_rate": 0.0004968522025361297, "loss": 6.0721, "mean_token_accuracy": 0.14934796392917632, "num_tokens": 12302865.0, "step": 6280 }, { "entropy": 6.2630171298980715, "epoch": 0.6282801019643125, "grad_norm": 1.2734375, "learning_rate": 0.0004968462508210176, "loss": 6.223, "mean_token_accuracy": 0.1475556805729866, "num_tokens": 12313099.0, "step": 6285 }, { "entropy": 6.364171743392944, "epoch": 0.6287799270255411, "grad_norm": 1.0703125, "learning_rate": 0.0004968402935243109, "loss": 6.2601, "mean_token_accuracy": 0.14661428183317185, "num_tokens": 12324155.0, "step": 6290 }, { "entropy": 6.240270185470581, "epoch": 0.6292797520867697, "grad_norm": 1.1875, "learning_rate": 0.0004968343306461595, "loss": 6.0982, "mean_token_accuracy": 0.1493609756231308, "num_tokens": 12334082.0, "step": 6295 }, { "entropy": 6.24729905128479, "epoch": 0.6297795771479981, "grad_norm": 1.171875, "learning_rate": 0.0004968283621867134, "loss": 6.198, "mean_token_accuracy": 0.14586353302001953, "num_tokens": 12344673.0, "step": 6300 }, { "entropy": 6.367838716506958, "epoch": 0.6302794022092267, "grad_norm": 1.140625, "learning_rate": 0.0004968223881461227, "loss": 6.2032, "mean_token_accuracy": 0.14202526360750198, "num_tokens": 12355149.0, "step": 6305 }, { "entropy": 6.305402755737305, "epoch": 0.6307792272704553, "grad_norm": 1.2265625, "learning_rate": 0.000496816408524538, "loss": 6.0996, "mean_token_accuracy": 0.15201123356819152, "num_tokens": 12364043.0, "step": 6310 }, { "entropy": 6.276588392257691, "epoch": 0.6312790523316839, "grad_norm": 1.3125, "learning_rate": 0.0004968104233221094, "loss": 6.3046, "mean_token_accuracy": 0.1399997130036354, "num_tokens": 12373591.0, "step": 6315 }, { "entropy": 6.297060108184814, "epoch": 0.6317788773929125, "grad_norm": 1.0703125, "learning_rate": 0.0004968044325389877, "loss": 6.2424, "mean_token_accuracy": 0.14478263184428214, "num_tokens": 12383570.0, "step": 6320 }, { "entropy": 6.436004304885865, "epoch": 0.6322787024541411, "grad_norm": 1.2109375, "learning_rate": 0.0004967984361753235, "loss": 6.2261, "mean_token_accuracy": 0.14246728867292405, "num_tokens": 12393682.0, "step": 6325 }, { "entropy": 6.302444887161255, "epoch": 0.6327785275153697, "grad_norm": 1.515625, "learning_rate": 0.0004967924342312677, "loss": 6.146, "mean_token_accuracy": 0.1438180610537529, "num_tokens": 12403478.0, "step": 6330 }, { "entropy": 6.281976413726807, "epoch": 0.6332783525765981, "grad_norm": 1.25, "learning_rate": 0.0004967864267069713, "loss": 6.2505, "mean_token_accuracy": 0.14182919263839722, "num_tokens": 12412810.0, "step": 6335 }, { "entropy": 6.266110277175903, "epoch": 0.6337781776378267, "grad_norm": 1.171875, "learning_rate": 0.0004967804136025856, "loss": 6.1394, "mean_token_accuracy": 0.15015392899513244, "num_tokens": 12422209.0, "step": 6340 }, { "entropy": 6.3207359790802, "epoch": 0.6342780026990553, "grad_norm": 1.1328125, "learning_rate": 0.0004967743949182617, "loss": 6.1998, "mean_token_accuracy": 0.14080120623111725, "num_tokens": 12431569.0, "step": 6345 }, { "entropy": 6.222105312347412, "epoch": 0.6347778277602839, "grad_norm": 1.296875, "learning_rate": 0.0004967683706541511, "loss": 6.0672, "mean_token_accuracy": 0.16392299085855483, "num_tokens": 12441607.0, "step": 6350 }, { "entropy": 6.266947269439697, "epoch": 0.6352776528215125, "grad_norm": 1.28125, "learning_rate": 0.0004967623408104054, "loss": 6.2071, "mean_token_accuracy": 0.1397886171936989, "num_tokens": 12451072.0, "step": 6355 }, { "entropy": 6.4045663356781, "epoch": 0.6357774778827411, "grad_norm": 1.203125, "learning_rate": 0.0004967563053871762, "loss": 6.2353, "mean_token_accuracy": 0.14162094816565513, "num_tokens": 12460798.0, "step": 6360 }, { "entropy": 6.2242199897766115, "epoch": 0.6362773029439696, "grad_norm": 1.171875, "learning_rate": 0.0004967502643846155, "loss": 6.1594, "mean_token_accuracy": 0.15118182748556136, "num_tokens": 12471891.0, "step": 6365 }, { "entropy": 6.243682718276977, "epoch": 0.6367771280051981, "grad_norm": 1.25, "learning_rate": 0.000496744217802875, "loss": 6.1925, "mean_token_accuracy": 0.14185698032379152, "num_tokens": 12482212.0, "step": 6370 }, { "entropy": 6.332003164291382, "epoch": 0.6372769530664267, "grad_norm": 1.421875, "learning_rate": 0.0004967381656421073, "loss": 6.2045, "mean_token_accuracy": 0.14490965455770494, "num_tokens": 12492517.0, "step": 6375 }, { "entropy": 6.310923624038696, "epoch": 0.6377767781276553, "grad_norm": 1.1640625, "learning_rate": 0.0004967321079024643, "loss": 6.1312, "mean_token_accuracy": 0.14473602846264838, "num_tokens": 12502521.0, "step": 6380 }, { "entropy": 6.33732328414917, "epoch": 0.6382766031888839, "grad_norm": 1.1875, "learning_rate": 0.0004967260445840985, "loss": 6.2676, "mean_token_accuracy": 0.14144754111766816, "num_tokens": 12513195.0, "step": 6385 }, { "entropy": 6.283482837677002, "epoch": 0.6387764282501125, "grad_norm": 1.171875, "learning_rate": 0.0004967199756871624, "loss": 6.0772, "mean_token_accuracy": 0.15662836655974388, "num_tokens": 12521640.0, "step": 6390 }, { "entropy": 6.282724618911743, "epoch": 0.6392762533113411, "grad_norm": 1.375, "learning_rate": 0.0004967139012118088, "loss": 6.2234, "mean_token_accuracy": 0.14944694191217422, "num_tokens": 12530807.0, "step": 6395 }, { "entropy": 6.32041449546814, "epoch": 0.6397760783725696, "grad_norm": 1.15625, "learning_rate": 0.0004967078211581907, "loss": 6.2757, "mean_token_accuracy": 0.14207592457532883, "num_tokens": 12542049.0, "step": 6400 }, { "entropy": 6.326205015182495, "epoch": 0.6402759034337981, "grad_norm": 1.2265625, "learning_rate": 0.0004967017355264606, "loss": 6.2137, "mean_token_accuracy": 0.15072372779250146, "num_tokens": 12551699.0, "step": 6405 }, { "entropy": 6.312424230575561, "epoch": 0.6407757284950267, "grad_norm": 1.1796875, "learning_rate": 0.000496695644316772, "loss": 6.2969, "mean_token_accuracy": 0.14193230271339416, "num_tokens": 12561414.0, "step": 6410 }, { "entropy": 6.3347960948944095, "epoch": 0.6412755535562553, "grad_norm": 1.109375, "learning_rate": 0.0004966895475292781, "loss": 6.2711, "mean_token_accuracy": 0.14173732250928878, "num_tokens": 12571950.0, "step": 6415 }, { "entropy": 6.4350605487823485, "epoch": 0.6417753786174839, "grad_norm": 1.28125, "learning_rate": 0.0004966834451641322, "loss": 6.2958, "mean_token_accuracy": 0.14328024685382842, "num_tokens": 12581264.0, "step": 6420 }, { "entropy": 6.333584213256836, "epoch": 0.6422752036787125, "grad_norm": 1.171875, "learning_rate": 0.0004966773372214878, "loss": 6.2398, "mean_token_accuracy": 0.14176533818244935, "num_tokens": 12590950.0, "step": 6425 }, { "entropy": 6.285247850418091, "epoch": 0.642775028739941, "grad_norm": 1.1953125, "learning_rate": 0.0004966712237014987, "loss": 6.182, "mean_token_accuracy": 0.1438572585582733, "num_tokens": 12599766.0, "step": 6430 }, { "entropy": 6.387751054763794, "epoch": 0.6432748538011696, "grad_norm": 1.171875, "learning_rate": 0.0004966651046043186, "loss": 6.2175, "mean_token_accuracy": 0.1467558190226555, "num_tokens": 12610074.0, "step": 6435 }, { "entropy": 6.215302324295044, "epoch": 0.6437746788623981, "grad_norm": 1.3203125, "learning_rate": 0.0004966589799301016, "loss": 6.0874, "mean_token_accuracy": 0.1569178357720375, "num_tokens": 12619117.0, "step": 6440 }, { "entropy": 6.310656785964966, "epoch": 0.6442745039236267, "grad_norm": 1.3671875, "learning_rate": 0.0004966528496790015, "loss": 6.2281, "mean_token_accuracy": 0.13886816501617433, "num_tokens": 12627993.0, "step": 6445 }, { "entropy": 6.337427949905395, "epoch": 0.6447743289848553, "grad_norm": 1.1953125, "learning_rate": 0.0004966467138511729, "loss": 6.2144, "mean_token_accuracy": 0.14373488277196883, "num_tokens": 12637787.0, "step": 6450 }, { "entropy": 6.35661039352417, "epoch": 0.6452741540460839, "grad_norm": 1.59375, "learning_rate": 0.00049664057244677, "loss": 6.3397, "mean_token_accuracy": 0.1412152901291847, "num_tokens": 12648409.0, "step": 6455 }, { "entropy": 6.280369901657105, "epoch": 0.6457739791073125, "grad_norm": 1.1953125, "learning_rate": 0.0004966344254659473, "loss": 6.1398, "mean_token_accuracy": 0.1532076209783554, "num_tokens": 12658391.0, "step": 6460 }, { "entropy": 6.260202646255493, "epoch": 0.646273804168541, "grad_norm": 1.2109375, "learning_rate": 0.0004966282729088595, "loss": 6.2045, "mean_token_accuracy": 0.14276923686265947, "num_tokens": 12669926.0, "step": 6465 }, { "entropy": 6.261676836013794, "epoch": 0.6467736292297696, "grad_norm": 1.234375, "learning_rate": 0.0004966221147756615, "loss": 6.2661, "mean_token_accuracy": 0.14284807145595552, "num_tokens": 12679176.0, "step": 6470 }, { "entropy": 6.265682744979858, "epoch": 0.6472734542909981, "grad_norm": 1.28125, "learning_rate": 0.0004966159510665079, "loss": 6.1554, "mean_token_accuracy": 0.146842310577631, "num_tokens": 12688954.0, "step": 6475 }, { "entropy": 6.244898319244385, "epoch": 0.6477732793522267, "grad_norm": 1.28125, "learning_rate": 0.0004966097817815542, "loss": 6.1533, "mean_token_accuracy": 0.14491694048047066, "num_tokens": 12697577.0, "step": 6480 }, { "entropy": 6.281431055068969, "epoch": 0.6482731044134553, "grad_norm": 1.15625, "learning_rate": 0.0004966036069209552, "loss": 6.2834, "mean_token_accuracy": 0.13943449333310126, "num_tokens": 12708153.0, "step": 6485 }, { "entropy": 6.342728471755981, "epoch": 0.6487729294746839, "grad_norm": 1.2265625, "learning_rate": 0.0004965974264848666, "loss": 6.2392, "mean_token_accuracy": 0.14364442005753517, "num_tokens": 12717329.0, "step": 6490 }, { "entropy": 6.330558776855469, "epoch": 0.6492727545359124, "grad_norm": 1.1015625, "learning_rate": 0.0004965912404734438, "loss": 6.2348, "mean_token_accuracy": 0.14568729028105737, "num_tokens": 12726528.0, "step": 6495 }, { "entropy": 6.333059644699096, "epoch": 0.649772579597141, "grad_norm": 1.015625, "learning_rate": 0.0004965850488868424, "loss": 6.2249, "mean_token_accuracy": 0.1396489255130291, "num_tokens": 12737341.0, "step": 6500 }, { "entropy": 6.32062258720398, "epoch": 0.6502724046583696, "grad_norm": 1.203125, "learning_rate": 0.0004965788517252181, "loss": 6.1424, "mean_token_accuracy": 0.14806357473134996, "num_tokens": 12746973.0, "step": 6505 }, { "entropy": 6.343089914321899, "epoch": 0.6507722297195981, "grad_norm": 1.171875, "learning_rate": 0.000496572648988727, "loss": 6.1739, "mean_token_accuracy": 0.14911404773592948, "num_tokens": 12756176.0, "step": 6510 }, { "entropy": 6.324216270446778, "epoch": 0.6512720547808267, "grad_norm": 1.1171875, "learning_rate": 0.000496566440677525, "loss": 6.1912, "mean_token_accuracy": 0.13954056277871132, "num_tokens": 12766349.0, "step": 6515 }, { "entropy": 6.212085580825805, "epoch": 0.6517718798420553, "grad_norm": 1.3125, "learning_rate": 0.0004965602267917685, "loss": 6.1328, "mean_token_accuracy": 0.14660271480679513, "num_tokens": 12775857.0, "step": 6520 }, { "entropy": 6.282214832305908, "epoch": 0.6522717049032839, "grad_norm": 1.7265625, "learning_rate": 0.0004965540073316136, "loss": 6.2013, "mean_token_accuracy": 0.14208867996931077, "num_tokens": 12786376.0, "step": 6525 }, { "entropy": 6.286488151550293, "epoch": 0.6527715299645124, "grad_norm": 1.1953125, "learning_rate": 0.0004965477822972169, "loss": 6.2221, "mean_token_accuracy": 0.14130338579416274, "num_tokens": 12795719.0, "step": 6530 }, { "entropy": 6.321103763580322, "epoch": 0.653271355025741, "grad_norm": 1.125, "learning_rate": 0.0004965415516887349, "loss": 6.2102, "mean_token_accuracy": 0.1439807489514351, "num_tokens": 12806742.0, "step": 6535 }, { "entropy": 6.25177412033081, "epoch": 0.6537711800869695, "grad_norm": 1.09375, "learning_rate": 0.0004965353155063246, "loss": 6.0818, "mean_token_accuracy": 0.14133842587471007, "num_tokens": 12817362.0, "step": 6540 }, { "entropy": 6.159471035003662, "epoch": 0.6542710051481981, "grad_norm": 1.1875, "learning_rate": 0.0004965290737501427, "loss": 6.0441, "mean_token_accuracy": 0.15827706903219224, "num_tokens": 12826516.0, "step": 6545 }, { "entropy": 6.264061784744262, "epoch": 0.6547708302094267, "grad_norm": 1.1640625, "learning_rate": 0.0004965228264203464, "loss": 6.2657, "mean_token_accuracy": 0.13436038196086883, "num_tokens": 12836321.0, "step": 6550 }, { "entropy": 6.297969245910645, "epoch": 0.6552706552706553, "grad_norm": 1.1796875, "learning_rate": 0.0004965165735170928, "loss": 6.1134, "mean_token_accuracy": 0.14968342557549477, "num_tokens": 12845955.0, "step": 6555 }, { "entropy": 6.309147787094116, "epoch": 0.6557704803318838, "grad_norm": 1.1953125, "learning_rate": 0.000496510315040539, "loss": 6.276, "mean_token_accuracy": 0.14372547939419747, "num_tokens": 12854749.0, "step": 6560 }, { "entropy": 6.326816082000732, "epoch": 0.6562703053931124, "grad_norm": 1.296875, "learning_rate": 0.0004965040509908429, "loss": 6.2409, "mean_token_accuracy": 0.139018664509058, "num_tokens": 12865145.0, "step": 6565 }, { "entropy": 6.290833425521851, "epoch": 0.656770130454341, "grad_norm": 1.0625, "learning_rate": 0.0004964977813681618, "loss": 6.1639, "mean_token_accuracy": 0.1501176491379738, "num_tokens": 12876109.0, "step": 6570 }, { "entropy": 6.270522165298462, "epoch": 0.6572699555155695, "grad_norm": 1.2421875, "learning_rate": 0.0004964915061726534, "loss": 6.2403, "mean_token_accuracy": 0.13995340913534166, "num_tokens": 12886813.0, "step": 6575 }, { "entropy": 6.288305282592773, "epoch": 0.6577697805767981, "grad_norm": 1.125, "learning_rate": 0.0004964852254044759, "loss": 6.2187, "mean_token_accuracy": 0.14275041222572327, "num_tokens": 12897991.0, "step": 6580 }, { "entropy": 6.290961265563965, "epoch": 0.6582696056380267, "grad_norm": 1.2578125, "learning_rate": 0.0004964789390637871, "loss": 6.2867, "mean_token_accuracy": 0.1336333706974983, "num_tokens": 12907354.0, "step": 6585 }, { "entropy": 6.327837562561035, "epoch": 0.6587694306992553, "grad_norm": 1.0859375, "learning_rate": 0.0004964726471507451, "loss": 6.1687, "mean_token_accuracy": 0.15185509622097015, "num_tokens": 12917187.0, "step": 6590 }, { "entropy": 6.211197280883789, "epoch": 0.6592692557604838, "grad_norm": 1.1796875, "learning_rate": 0.0004964663496655083, "loss": 6.134, "mean_token_accuracy": 0.15331015586853028, "num_tokens": 12926470.0, "step": 6595 }, { "entropy": 6.251475429534912, "epoch": 0.6597690808217124, "grad_norm": 1.2265625, "learning_rate": 0.0004964600466082351, "loss": 6.1932, "mean_token_accuracy": 0.1524736166000366, "num_tokens": 12936609.0, "step": 6600 }, { "entropy": 6.299889087677002, "epoch": 0.660268905882941, "grad_norm": 1.109375, "learning_rate": 0.0004964537379790842, "loss": 6.1108, "mean_token_accuracy": 0.14824423491954802, "num_tokens": 12946286.0, "step": 6605 }, { "entropy": 6.277209854125976, "epoch": 0.6607687309441695, "grad_norm": 1.2265625, "learning_rate": 0.0004964474237782141, "loss": 6.1376, "mean_token_accuracy": 0.1471827894449234, "num_tokens": 12955881.0, "step": 6610 }, { "entropy": 6.2671130180358885, "epoch": 0.6612685560053981, "grad_norm": 1.28125, "learning_rate": 0.0004964411040057839, "loss": 6.2871, "mean_token_accuracy": 0.14310781806707382, "num_tokens": 12966273.0, "step": 6615 }, { "entropy": 6.282306671142578, "epoch": 0.6617683810666267, "grad_norm": 1.3203125, "learning_rate": 0.0004964347786619524, "loss": 6.2574, "mean_token_accuracy": 0.14010658338665963, "num_tokens": 12975300.0, "step": 6620 }, { "entropy": 6.350692987442017, "epoch": 0.6622682061278552, "grad_norm": 1.2109375, "learning_rate": 0.0004964284477468791, "loss": 6.1849, "mean_token_accuracy": 0.1533190742135048, "num_tokens": 12985291.0, "step": 6625 }, { "entropy": 6.257151174545288, "epoch": 0.6627680311890838, "grad_norm": 1.3671875, "learning_rate": 0.0004964221112607228, "loss": 6.1481, "mean_token_accuracy": 0.1530764639377594, "num_tokens": 12995935.0, "step": 6630 }, { "entropy": 6.296711111068726, "epoch": 0.6632678562503124, "grad_norm": 1.1171875, "learning_rate": 0.0004964157692036432, "loss": 6.1264, "mean_token_accuracy": 0.15155061930418015, "num_tokens": 13006916.0, "step": 6635 }, { "entropy": 6.383872938156128, "epoch": 0.663767681311541, "grad_norm": 1.125, "learning_rate": 0.0004964094215757998, "loss": 6.4002, "mean_token_accuracy": 0.13124821931123734, "num_tokens": 13017247.0, "step": 6640 }, { "entropy": 6.354250049591064, "epoch": 0.6642675063727695, "grad_norm": 1.265625, "learning_rate": 0.0004964030683773525, "loss": 6.2234, "mean_token_accuracy": 0.1461649015545845, "num_tokens": 13026038.0, "step": 6645 }, { "entropy": 6.307520914077759, "epoch": 0.6647673314339981, "grad_norm": 1.1875, "learning_rate": 0.0004963967096084608, "loss": 6.2715, "mean_token_accuracy": 0.13808465301990508, "num_tokens": 13036436.0, "step": 6650 }, { "entropy": 6.330572319030762, "epoch": 0.6652671564952267, "grad_norm": 1.25, "learning_rate": 0.0004963903452692849, "loss": 6.233, "mean_token_accuracy": 0.1444825440645218, "num_tokens": 13045594.0, "step": 6655 }, { "entropy": 6.359673881530762, "epoch": 0.6657669815564552, "grad_norm": 1.203125, "learning_rate": 0.0004963839753599848, "loss": 6.2215, "mean_token_accuracy": 0.143858839571476, "num_tokens": 13056023.0, "step": 6660 }, { "entropy": 6.317483806610108, "epoch": 0.6662668066176838, "grad_norm": 1.2265625, "learning_rate": 0.000496377599880721, "loss": 6.174, "mean_token_accuracy": 0.1491334892809391, "num_tokens": 13064230.0, "step": 6665 }, { "entropy": 6.238755607604981, "epoch": 0.6667666316789124, "grad_norm": 2.0, "learning_rate": 0.0004963712188316537, "loss": 6.0889, "mean_token_accuracy": 0.15473163425922393, "num_tokens": 13073767.0, "step": 6670 }, { "entropy": 6.235145568847656, "epoch": 0.667266456740141, "grad_norm": 1.1484375, "learning_rate": 0.0004963648322129435, "loss": 6.1085, "mean_token_accuracy": 0.14921026378870011, "num_tokens": 13083026.0, "step": 6675 }, { "entropy": 6.306944036483765, "epoch": 0.6677662818013695, "grad_norm": 1.1796875, "learning_rate": 0.000496358440024751, "loss": 6.1501, "mean_token_accuracy": 0.149919793009758, "num_tokens": 13092029.0, "step": 6680 }, { "entropy": 6.313770484924317, "epoch": 0.6682661068625981, "grad_norm": 1.25, "learning_rate": 0.0004963520422672372, "loss": 6.2907, "mean_token_accuracy": 0.1392592266201973, "num_tokens": 13101859.0, "step": 6685 }, { "entropy": 6.310837841033935, "epoch": 0.6687659319238266, "grad_norm": 1.15625, "learning_rate": 0.000496345638940563, "loss": 6.1344, "mean_token_accuracy": 0.15150134414434432, "num_tokens": 13111007.0, "step": 6690 }, { "entropy": 6.215577077865601, "epoch": 0.6692657569850552, "grad_norm": 1.2109375, "learning_rate": 0.0004963392300448894, "loss": 6.1836, "mean_token_accuracy": 0.14991192072629927, "num_tokens": 13120662.0, "step": 6695 }, { "entropy": 6.309817981719971, "epoch": 0.6697655820462838, "grad_norm": 1.2734375, "learning_rate": 0.0004963328155803778, "loss": 6.0865, "mean_token_accuracy": 0.14408904016017915, "num_tokens": 13130263.0, "step": 6700 }, { "entropy": 6.341976642608643, "epoch": 0.6702654071075124, "grad_norm": 1.2265625, "learning_rate": 0.0004963263955471895, "loss": 6.1448, "mean_token_accuracy": 0.14620930105447769, "num_tokens": 13139821.0, "step": 6705 }, { "entropy": 6.231247997283935, "epoch": 0.670765232168741, "grad_norm": 1.1875, "learning_rate": 0.000496319969945486, "loss": 6.1395, "mean_token_accuracy": 0.14915765598416328, "num_tokens": 13149731.0, "step": 6710 }, { "entropy": 6.282005691528321, "epoch": 0.6712650572299695, "grad_norm": 1.296875, "learning_rate": 0.000496313538775429, "loss": 6.2245, "mean_token_accuracy": 0.14730927273631095, "num_tokens": 13160689.0, "step": 6715 }, { "entropy": 6.274010753631591, "epoch": 0.6717648822911981, "grad_norm": 1.3359375, "learning_rate": 0.0004963071020371803, "loss": 6.3393, "mean_token_accuracy": 0.14334413260221482, "num_tokens": 13170694.0, "step": 6720 }, { "entropy": 6.403909540176391, "epoch": 0.6722647073524266, "grad_norm": 1.140625, "learning_rate": 0.0004963006597309019, "loss": 6.3, "mean_token_accuracy": 0.1423768937587738, "num_tokens": 13180514.0, "step": 6725 }, { "entropy": 6.331519603729248, "epoch": 0.6727645324136552, "grad_norm": 1.2890625, "learning_rate": 0.0004962942118567559, "loss": 6.1034, "mean_token_accuracy": 0.14691800028085708, "num_tokens": 13190144.0, "step": 6730 }, { "entropy": 6.304260635375977, "epoch": 0.6732643574748838, "grad_norm": 1.25, "learning_rate": 0.0004962877584149043, "loss": 6.1565, "mean_token_accuracy": 0.1423011153936386, "num_tokens": 13199640.0, "step": 6735 }, { "entropy": 6.255619192123413, "epoch": 0.6737641825361124, "grad_norm": 1.1796875, "learning_rate": 0.0004962812994055098, "loss": 6.1178, "mean_token_accuracy": 0.15270792841911315, "num_tokens": 13208824.0, "step": 6740 }, { "entropy": 6.198691463470459, "epoch": 0.674264007597341, "grad_norm": 1.1796875, "learning_rate": 0.0004962748348287347, "loss": 6.0688, "mean_token_accuracy": 0.1588856428861618, "num_tokens": 13219305.0, "step": 6745 }, { "entropy": 6.245419836044311, "epoch": 0.6747638326585695, "grad_norm": 1.328125, "learning_rate": 0.0004962683646847416, "loss": 6.0901, "mean_token_accuracy": 0.15135168731212617, "num_tokens": 13227727.0, "step": 6750 }, { "entropy": 6.312480020523071, "epoch": 0.675263657719798, "grad_norm": 1.2109375, "learning_rate": 0.0004962618889736936, "loss": 6.151, "mean_token_accuracy": 0.1480355367064476, "num_tokens": 13237522.0, "step": 6755 }, { "entropy": 6.25027904510498, "epoch": 0.6757634827810266, "grad_norm": 1.3671875, "learning_rate": 0.0004962554076957533, "loss": 6.2101, "mean_token_accuracy": 0.1414764016866684, "num_tokens": 13247155.0, "step": 6760 }, { "entropy": 6.224506425857544, "epoch": 0.6762633078422552, "grad_norm": 1.296875, "learning_rate": 0.0004962489208510838, "loss": 6.2534, "mean_token_accuracy": 0.14092431366443633, "num_tokens": 13257324.0, "step": 6765 }, { "entropy": 6.232892608642578, "epoch": 0.6767631329034838, "grad_norm": 1.21875, "learning_rate": 0.0004962424284398484, "loss": 6.2316, "mean_token_accuracy": 0.14328891038894653, "num_tokens": 13267025.0, "step": 6770 }, { "entropy": 6.354032373428344, "epoch": 0.6772629579647124, "grad_norm": 1.203125, "learning_rate": 0.0004962359304622105, "loss": 6.1337, "mean_token_accuracy": 0.15617139488458634, "num_tokens": 13276709.0, "step": 6775 }, { "entropy": 6.288168001174927, "epoch": 0.677762783025941, "grad_norm": 1.2109375, "learning_rate": 0.0004962294269183335, "loss": 6.1372, "mean_token_accuracy": 0.1426538646221161, "num_tokens": 13286029.0, "step": 6780 }, { "entropy": 6.31599702835083, "epoch": 0.6782626080871695, "grad_norm": 1.296875, "learning_rate": 0.000496222917808381, "loss": 6.3013, "mean_token_accuracy": 0.13417728766798973, "num_tokens": 13296367.0, "step": 6785 }, { "entropy": 6.370834159851074, "epoch": 0.678762433148398, "grad_norm": 1.1640625, "learning_rate": 0.0004962164031325169, "loss": 6.2259, "mean_token_accuracy": 0.14463320076465608, "num_tokens": 13305186.0, "step": 6790 }, { "entropy": 6.298191785812378, "epoch": 0.6792622582096266, "grad_norm": 1.21875, "learning_rate": 0.000496209882890905, "loss": 6.1602, "mean_token_accuracy": 0.15014540180563926, "num_tokens": 13314512.0, "step": 6795 }, { "entropy": 6.325139904022217, "epoch": 0.6797620832708552, "grad_norm": 1.2265625, "learning_rate": 0.0004962033570837094, "loss": 6.2709, "mean_token_accuracy": 0.14526838138699533, "num_tokens": 13324423.0, "step": 6800 }, { "entropy": 6.303468942642212, "epoch": 0.6802619083320838, "grad_norm": 1.2421875, "learning_rate": 0.0004961968257110941, "loss": 6.2591, "mean_token_accuracy": 0.1405862882733345, "num_tokens": 13334133.0, "step": 6805 }, { "entropy": 6.388118839263916, "epoch": 0.6807617333933124, "grad_norm": 1.3125, "learning_rate": 0.0004961902887732236, "loss": 6.2583, "mean_token_accuracy": 0.1440707750618458, "num_tokens": 13344017.0, "step": 6810 }, { "entropy": 6.233449983596802, "epoch": 0.681261558454541, "grad_norm": 1.171875, "learning_rate": 0.0004961837462702626, "loss": 6.0123, "mean_token_accuracy": 0.15574013590812683, "num_tokens": 13353922.0, "step": 6815 }, { "entropy": 6.261878919601441, "epoch": 0.6817613835157694, "grad_norm": 1.265625, "learning_rate": 0.0004961771982023752, "loss": 6.1858, "mean_token_accuracy": 0.14553807079792022, "num_tokens": 13363890.0, "step": 6820 }, { "entropy": 6.2675285816192625, "epoch": 0.682261208576998, "grad_norm": 1.1484375, "learning_rate": 0.0004961706445697265, "loss": 6.1189, "mean_token_accuracy": 0.14782624989748, "num_tokens": 13373726.0, "step": 6825 }, { "entropy": 6.198501825332642, "epoch": 0.6827610336382266, "grad_norm": 1.2265625, "learning_rate": 0.0004961640853724813, "loss": 6.0373, "mean_token_accuracy": 0.15897899568080903, "num_tokens": 13382049.0, "step": 6830 }, { "entropy": 6.107681846618652, "epoch": 0.6832608586994552, "grad_norm": 1.21875, "learning_rate": 0.0004961575206108046, "loss": 5.9809, "mean_token_accuracy": 0.15685263127088547, "num_tokens": 13390977.0, "step": 6835 }, { "entropy": 6.29368314743042, "epoch": 0.6837606837606838, "grad_norm": 1.2421875, "learning_rate": 0.0004961509502848616, "loss": 6.192, "mean_token_accuracy": 0.14624952003359795, "num_tokens": 13400165.0, "step": 6840 }, { "entropy": 6.319872760772705, "epoch": 0.6842605088219124, "grad_norm": 1.2109375, "learning_rate": 0.0004961443743948177, "loss": 6.2193, "mean_token_accuracy": 0.13824222683906556, "num_tokens": 13410201.0, "step": 6845 }, { "entropy": 6.268837928771973, "epoch": 0.684760333883141, "grad_norm": 1.2734375, "learning_rate": 0.000496137792940838, "loss": 6.1959, "mean_token_accuracy": 0.149955914914608, "num_tokens": 13421074.0, "step": 6850 }, { "entropy": 6.197783422470093, "epoch": 0.6852601589443694, "grad_norm": 1.2578125, "learning_rate": 0.0004961312059230885, "loss": 6.0266, "mean_token_accuracy": 0.15611146837472917, "num_tokens": 13430387.0, "step": 6855 }, { "entropy": 6.211978149414063, "epoch": 0.685759984005598, "grad_norm": 1.1796875, "learning_rate": 0.0004961246133417348, "loss": 6.0954, "mean_token_accuracy": 0.15050722509622574, "num_tokens": 13439497.0, "step": 6860 }, { "entropy": 6.343523168563843, "epoch": 0.6862598090668266, "grad_norm": 1.3671875, "learning_rate": 0.0004961180151969427, "loss": 6.2344, "mean_token_accuracy": 0.14303319454193114, "num_tokens": 13450543.0, "step": 6865 }, { "entropy": 6.282239866256714, "epoch": 0.6867596341280552, "grad_norm": 1.21875, "learning_rate": 0.0004961114114888782, "loss": 6.1662, "mean_token_accuracy": 0.15495624169707298, "num_tokens": 13459996.0, "step": 6870 }, { "entropy": 6.216299295425415, "epoch": 0.6872594591892838, "grad_norm": 1.2890625, "learning_rate": 0.0004961048022177074, "loss": 6.1124, "mean_token_accuracy": 0.15178535506129265, "num_tokens": 13469141.0, "step": 6875 }, { "entropy": 6.249474763870239, "epoch": 0.6877592842505124, "grad_norm": 1.296875, "learning_rate": 0.0004960981873835968, "loss": 6.0934, "mean_token_accuracy": 0.15554443895816802, "num_tokens": 13478349.0, "step": 6880 }, { "entropy": 6.253992319107056, "epoch": 0.6882591093117408, "grad_norm": 1.2109375, "learning_rate": 0.0004960915669867126, "loss": 6.0597, "mean_token_accuracy": 0.14935113713145257, "num_tokens": 13487417.0, "step": 6885 }, { "entropy": 6.343624305725098, "epoch": 0.6887589343729694, "grad_norm": 1.2109375, "learning_rate": 0.0004960849410272216, "loss": 6.2971, "mean_token_accuracy": 0.13986774384975434, "num_tokens": 13497607.0, "step": 6890 }, { "entropy": 6.311396169662475, "epoch": 0.689258759434198, "grad_norm": 1.140625, "learning_rate": 0.0004960783095052903, "loss": 6.2558, "mean_token_accuracy": 0.13967615738511086, "num_tokens": 13508222.0, "step": 6895 }, { "entropy": 6.194321393966675, "epoch": 0.6897585844954266, "grad_norm": 1.1875, "learning_rate": 0.0004960716724210856, "loss": 6.0695, "mean_token_accuracy": 0.15555219054222108, "num_tokens": 13519593.0, "step": 6900 }, { "entropy": 6.381457090377808, "epoch": 0.6902584095566552, "grad_norm": 1.078125, "learning_rate": 0.0004960650297747746, "loss": 6.2735, "mean_token_accuracy": 0.13538890033960344, "num_tokens": 13531089.0, "step": 6905 }, { "entropy": 6.325894927978515, "epoch": 0.6907582346178838, "grad_norm": 1.28125, "learning_rate": 0.0004960583815665242, "loss": 6.1589, "mean_token_accuracy": 0.147079511731863, "num_tokens": 13539897.0, "step": 6910 }, { "entropy": 6.304473161697388, "epoch": 0.6912580596791124, "grad_norm": 1.171875, "learning_rate": 0.0004960517277965018, "loss": 6.2417, "mean_token_accuracy": 0.13882038742303848, "num_tokens": 13549986.0, "step": 6915 }, { "entropy": 6.32588210105896, "epoch": 0.6917578847403408, "grad_norm": 1.171875, "learning_rate": 0.0004960450684648749, "loss": 6.2492, "mean_token_accuracy": 0.14710931479930878, "num_tokens": 13559866.0, "step": 6920 }, { "entropy": 6.389265441894532, "epoch": 0.6922577098015694, "grad_norm": 1.2578125, "learning_rate": 0.000496038403571811, "loss": 6.2572, "mean_token_accuracy": 0.1386592723429203, "num_tokens": 13569789.0, "step": 6925 }, { "entropy": 6.312770366668701, "epoch": 0.692757534862798, "grad_norm": 0.98046875, "learning_rate": 0.0004960317331174777, "loss": 6.2462, "mean_token_accuracy": 0.14467992633581161, "num_tokens": 13579121.0, "step": 6930 }, { "entropy": 6.216776704788208, "epoch": 0.6932573599240266, "grad_norm": 1.2890625, "learning_rate": 0.0004960250571020428, "loss": 6.1388, "mean_token_accuracy": 0.15116308480501175, "num_tokens": 13589281.0, "step": 6935 }, { "entropy": 6.392689514160156, "epoch": 0.6937571849852552, "grad_norm": 1.1875, "learning_rate": 0.0004960183755256744, "loss": 6.1444, "mean_token_accuracy": 0.15153247416019439, "num_tokens": 13598312.0, "step": 6940 }, { "entropy": 6.234421300888061, "epoch": 0.6942570100464838, "grad_norm": 1.21875, "learning_rate": 0.0004960116883885406, "loss": 6.1721, "mean_token_accuracy": 0.1503891319036484, "num_tokens": 13608164.0, "step": 6945 }, { "entropy": 6.222692155838013, "epoch": 0.6947568351077124, "grad_norm": 1.234375, "learning_rate": 0.0004960049956908095, "loss": 6.2069, "mean_token_accuracy": 0.1400441512465477, "num_tokens": 13618314.0, "step": 6950 }, { "entropy": 6.340925025939941, "epoch": 0.6952566601689408, "grad_norm": 1.0703125, "learning_rate": 0.0004959982974326496, "loss": 6.1847, "mean_token_accuracy": 0.14271825179457664, "num_tokens": 13628846.0, "step": 6955 }, { "entropy": 6.262188482284546, "epoch": 0.6957564852301694, "grad_norm": 1.1953125, "learning_rate": 0.0004959915936142294, "loss": 6.0836, "mean_token_accuracy": 0.15636171847581865, "num_tokens": 13637941.0, "step": 6960 }, { "entropy": 6.301395273208618, "epoch": 0.696256310291398, "grad_norm": 1.2734375, "learning_rate": 0.0004959848842357175, "loss": 6.157, "mean_token_accuracy": 0.14335214495658874, "num_tokens": 13647734.0, "step": 6965 }, { "entropy": 6.254585075378418, "epoch": 0.6967561353526266, "grad_norm": 1.1953125, "learning_rate": 0.0004959781692972829, "loss": 6.1384, "mean_token_accuracy": 0.14826470315456391, "num_tokens": 13657929.0, "step": 6970 }, { "entropy": 6.263657426834106, "epoch": 0.6972559604138552, "grad_norm": 1.140625, "learning_rate": 0.0004959714487990943, "loss": 6.2294, "mean_token_accuracy": 0.13924643248319626, "num_tokens": 13668258.0, "step": 6975 }, { "entropy": 6.293397760391235, "epoch": 0.6977557854750838, "grad_norm": 1.203125, "learning_rate": 0.000495964722741321, "loss": 6.1677, "mean_token_accuracy": 0.1528436839580536, "num_tokens": 13677515.0, "step": 6980 }, { "entropy": 6.257136583328247, "epoch": 0.6982556105363122, "grad_norm": 1.203125, "learning_rate": 0.0004959579911241322, "loss": 6.1572, "mean_token_accuracy": 0.1477597177028656, "num_tokens": 13686865.0, "step": 6985 }, { "entropy": 6.228747272491455, "epoch": 0.6987554355975408, "grad_norm": 1.328125, "learning_rate": 0.0004959512539476971, "loss": 6.2665, "mean_token_accuracy": 0.14205617532134057, "num_tokens": 13696683.0, "step": 6990 }, { "entropy": 6.3137575626373295, "epoch": 0.6992552606587694, "grad_norm": 1.203125, "learning_rate": 0.0004959445112121853, "loss": 6.2373, "mean_token_accuracy": 0.1395167514681816, "num_tokens": 13706452.0, "step": 6995 }, { "entropy": 6.3202889919281, "epoch": 0.699755085719998, "grad_norm": 1.2578125, "learning_rate": 0.0004959377629177665, "loss": 6.1099, "mean_token_accuracy": 0.1506766676902771, "num_tokens": 13717474.0, "step": 7000 }, { "entropy": 6.222063255310059, "epoch": 0.7002549107812266, "grad_norm": 1.2578125, "learning_rate": 0.0004959310090646104, "loss": 6.1191, "mean_token_accuracy": 0.15438238829374312, "num_tokens": 13726723.0, "step": 7005 }, { "entropy": 6.322344446182251, "epoch": 0.7007547358424552, "grad_norm": 1.1328125, "learning_rate": 0.0004959242496528869, "loss": 6.349, "mean_token_accuracy": 0.13866892084479332, "num_tokens": 13736432.0, "step": 7010 }, { "entropy": 6.360767126083374, "epoch": 0.7012545609036838, "grad_norm": 1.2578125, "learning_rate": 0.0004959174846827663, "loss": 6.1608, "mean_token_accuracy": 0.14594118297100067, "num_tokens": 13745767.0, "step": 7015 }, { "entropy": 6.349599075317383, "epoch": 0.7017543859649122, "grad_norm": 1.3359375, "learning_rate": 0.0004959107141544186, "loss": 6.1917, "mean_token_accuracy": 0.1485964499413967, "num_tokens": 13756035.0, "step": 7020 }, { "entropy": 6.1866546154022215, "epoch": 0.7022542110261408, "grad_norm": 1.203125, "learning_rate": 0.000495903938068014, "loss": 6.0148, "mean_token_accuracy": 0.15764825716614722, "num_tokens": 13765715.0, "step": 7025 }, { "entropy": 6.230158805847168, "epoch": 0.7027540360873694, "grad_norm": 1.125, "learning_rate": 0.0004958971564237233, "loss": 6.1837, "mean_token_accuracy": 0.1422155648469925, "num_tokens": 13775987.0, "step": 7030 }, { "entropy": 6.292929363250733, "epoch": 0.703253861148598, "grad_norm": 1.1640625, "learning_rate": 0.000495890369221717, "loss": 6.1037, "mean_token_accuracy": 0.15195335894823075, "num_tokens": 13785095.0, "step": 7035 }, { "entropy": 6.34586763381958, "epoch": 0.7037536862098266, "grad_norm": 1.1640625, "learning_rate": 0.0004958835764621657, "loss": 6.1719, "mean_token_accuracy": 0.14128438681364058, "num_tokens": 13794777.0, "step": 7040 }, { "entropy": 6.222014904022217, "epoch": 0.7042535112710552, "grad_norm": 1.2578125, "learning_rate": 0.0004958767781452406, "loss": 6.0905, "mean_token_accuracy": 0.1442723661661148, "num_tokens": 13803534.0, "step": 7045 }, { "entropy": 6.25515923500061, "epoch": 0.7047533363322837, "grad_norm": 1.3359375, "learning_rate": 0.0004958699742711126, "loss": 6.163, "mean_token_accuracy": 0.1452835828065872, "num_tokens": 13813941.0, "step": 7050 }, { "entropy": 6.320334768295288, "epoch": 0.7052531613935122, "grad_norm": 1.1015625, "learning_rate": 0.0004958631648399528, "loss": 6.1479, "mean_token_accuracy": 0.15006570667028427, "num_tokens": 13823611.0, "step": 7055 }, { "entropy": 6.330420589447021, "epoch": 0.7057529864547408, "grad_norm": 1.1796875, "learning_rate": 0.0004958563498519327, "loss": 6.286, "mean_token_accuracy": 0.13946598321199416, "num_tokens": 13833047.0, "step": 7060 }, { "entropy": 6.216289043426514, "epoch": 0.7062528115159694, "grad_norm": 1.4375, "learning_rate": 0.0004958495293072235, "loss": 6.1961, "mean_token_accuracy": 0.15018607527017594, "num_tokens": 13843524.0, "step": 7065 }, { "entropy": 6.252985239028931, "epoch": 0.706752636577198, "grad_norm": 1.1796875, "learning_rate": 0.0004958427032059971, "loss": 6.0661, "mean_token_accuracy": 0.15229864716529845, "num_tokens": 13852188.0, "step": 7070 }, { "entropy": 6.229141330718994, "epoch": 0.7072524616384266, "grad_norm": 1.1953125, "learning_rate": 0.0004958358715484251, "loss": 6.2086, "mean_token_accuracy": 0.14524195045232774, "num_tokens": 13863540.0, "step": 7075 }, { "entropy": 6.332069635391235, "epoch": 0.7077522866996552, "grad_norm": 1.2109375, "learning_rate": 0.0004958290343346795, "loss": 6.1805, "mean_token_accuracy": 0.1465955287218094, "num_tokens": 13871828.0, "step": 7080 }, { "entropy": 6.300998258590698, "epoch": 0.7082521117608837, "grad_norm": 1.171875, "learning_rate": 0.000495822191564932, "loss": 6.2216, "mean_token_accuracy": 0.142748311907053, "num_tokens": 13882222.0, "step": 7085 }, { "entropy": 6.2999204158782955, "epoch": 0.7087519368221122, "grad_norm": 1.1875, "learning_rate": 0.0004958153432393553, "loss": 6.2623, "mean_token_accuracy": 0.14057695791125296, "num_tokens": 13891689.0, "step": 7090 }, { "entropy": 6.293786144256591, "epoch": 0.7092517618833408, "grad_norm": 1.0703125, "learning_rate": 0.000495808489358121, "loss": 6.1353, "mean_token_accuracy": 0.14565599709749222, "num_tokens": 13901310.0, "step": 7095 }, { "entropy": 6.284841108322143, "epoch": 0.7097515869445694, "grad_norm": 1.234375, "learning_rate": 0.0004958016299214022, "loss": 6.1293, "mean_token_accuracy": 0.14428649023175238, "num_tokens": 13910350.0, "step": 7100 }, { "entropy": 6.253100252151489, "epoch": 0.710251412005798, "grad_norm": 1.1015625, "learning_rate": 0.0004957947649293712, "loss": 6.1809, "mean_token_accuracy": 0.14693159386515617, "num_tokens": 13920481.0, "step": 7105 }, { "entropy": 6.337112760543823, "epoch": 0.7107512370670266, "grad_norm": 1.1484375, "learning_rate": 0.0004957878943822006, "loss": 6.1685, "mean_token_accuracy": 0.13915617093443872, "num_tokens": 13931232.0, "step": 7110 }, { "entropy": 6.333304405212402, "epoch": 0.7112510621282551, "grad_norm": 1.1328125, "learning_rate": 0.0004957810182800634, "loss": 6.2542, "mean_token_accuracy": 0.13936160653829574, "num_tokens": 13940717.0, "step": 7115 }, { "entropy": 6.286463499069214, "epoch": 0.7117508871894836, "grad_norm": 1.2109375, "learning_rate": 0.0004957741366231327, "loss": 6.0956, "mean_token_accuracy": 0.1488887868821621, "num_tokens": 13949918.0, "step": 7120 }, { "entropy": 6.278175210952758, "epoch": 0.7122507122507122, "grad_norm": 1.1640625, "learning_rate": 0.0004957672494115815, "loss": 6.1496, "mean_token_accuracy": 0.15120262354612352, "num_tokens": 13959914.0, "step": 7125 }, { "entropy": 6.259276962280273, "epoch": 0.7127505373119408, "grad_norm": 1.1796875, "learning_rate": 0.000495760356645583, "loss": 6.1534, "mean_token_accuracy": 0.1492697849869728, "num_tokens": 13970054.0, "step": 7130 }, { "entropy": 6.168964004516601, "epoch": 0.7132503623731694, "grad_norm": 1.4140625, "learning_rate": 0.0004957534583253108, "loss": 6.0668, "mean_token_accuracy": 0.15821440666913986, "num_tokens": 13980339.0, "step": 7135 }, { "entropy": 6.230792713165283, "epoch": 0.713750187434398, "grad_norm": 1.15625, "learning_rate": 0.0004957465544509384, "loss": 6.142, "mean_token_accuracy": 0.14590761363506316, "num_tokens": 13990466.0, "step": 7140 }, { "entropy": 6.340567970275879, "epoch": 0.7142500124956266, "grad_norm": 1.25, "learning_rate": 0.0004957396450226395, "loss": 6.177, "mean_token_accuracy": 0.14110314920544625, "num_tokens": 13999822.0, "step": 7145 }, { "entropy": 6.4066338539123535, "epoch": 0.7147498375568551, "grad_norm": 1.1484375, "learning_rate": 0.0004957327300405879, "loss": 6.2117, "mean_token_accuracy": 0.14593433663249017, "num_tokens": 14008939.0, "step": 7150 }, { "entropy": 6.255950021743774, "epoch": 0.7152496626180836, "grad_norm": 1.1953125, "learning_rate": 0.0004957258095049577, "loss": 6.1602, "mean_token_accuracy": 0.13879207521677017, "num_tokens": 14019005.0, "step": 7155 }, { "entropy": 6.244685506820678, "epoch": 0.7157494876793122, "grad_norm": 1.3203125, "learning_rate": 0.0004957188834159229, "loss": 6.06, "mean_token_accuracy": 0.14689342975616454, "num_tokens": 14029390.0, "step": 7160 }, { "entropy": 6.261938953399659, "epoch": 0.7162493127405408, "grad_norm": 1.1484375, "learning_rate": 0.0004957119517736577, "loss": 6.1392, "mean_token_accuracy": 0.14793641418218612, "num_tokens": 14038613.0, "step": 7165 }, { "entropy": 6.253458833694458, "epoch": 0.7167491378017694, "grad_norm": 1.1640625, "learning_rate": 0.0004957050145783366, "loss": 6.1326, "mean_token_accuracy": 0.1456688791513443, "num_tokens": 14048144.0, "step": 7170 }, { "entropy": 6.12710747718811, "epoch": 0.717248962862998, "grad_norm": 1.203125, "learning_rate": 0.0004956980718301342, "loss": 6.0247, "mean_token_accuracy": 0.16036900132894516, "num_tokens": 14056894.0, "step": 7175 }, { "entropy": 6.227234363555908, "epoch": 0.7177487879242265, "grad_norm": 1.1171875, "learning_rate": 0.0004956911235292251, "loss": 6.1495, "mean_token_accuracy": 0.14351562559604644, "num_tokens": 14066024.0, "step": 7180 }, { "entropy": 6.29120397567749, "epoch": 0.7182486129854551, "grad_norm": 1.1953125, "learning_rate": 0.0004956841696757841, "loss": 6.1491, "mean_token_accuracy": 0.14925071001052856, "num_tokens": 14075805.0, "step": 7185 }, { "entropy": 6.249656534194946, "epoch": 0.7187484380466836, "grad_norm": 1.171875, "learning_rate": 0.0004956772102699862, "loss": 6.1629, "mean_token_accuracy": 0.14800831228494643, "num_tokens": 14085229.0, "step": 7190 }, { "entropy": 6.27678918838501, "epoch": 0.7192482631079122, "grad_norm": 1.15625, "learning_rate": 0.0004956702453120064, "loss": 6.1291, "mean_token_accuracy": 0.1453297108411789, "num_tokens": 14094594.0, "step": 7195 }, { "entropy": 6.23982081413269, "epoch": 0.7197480881691408, "grad_norm": 1.84375, "learning_rate": 0.0004956632748020201, "loss": 6.1682, "mean_token_accuracy": 0.1511926256120205, "num_tokens": 14104373.0, "step": 7200 }, { "entropy": 6.194260454177856, "epoch": 0.7202479132303694, "grad_norm": 1.2578125, "learning_rate": 0.0004956562987402026, "loss": 6.0632, "mean_token_accuracy": 0.15217120125889777, "num_tokens": 14113918.0, "step": 7205 }, { "entropy": 6.34488582611084, "epoch": 0.720747738291598, "grad_norm": 1.1640625, "learning_rate": 0.0004956493171267293, "loss": 6.2913, "mean_token_accuracy": 0.13412214070558548, "num_tokens": 14123711.0, "step": 7210 }, { "entropy": 6.304417562484741, "epoch": 0.7212475633528265, "grad_norm": 1.2421875, "learning_rate": 0.000495642329961776, "loss": 6.0711, "mean_token_accuracy": 0.15149474442005156, "num_tokens": 14132994.0, "step": 7215 }, { "entropy": 6.211438131332398, "epoch": 0.7217473884140551, "grad_norm": 1.1953125, "learning_rate": 0.0004956353372455185, "loss": 6.1141, "mean_token_accuracy": 0.14841899201273917, "num_tokens": 14143398.0, "step": 7220 }, { "entropy": 6.260597848892212, "epoch": 0.7222472134752836, "grad_norm": 1.328125, "learning_rate": 0.0004956283389781327, "loss": 6.1277, "mean_token_accuracy": 0.15246413350105287, "num_tokens": 14152374.0, "step": 7225 }, { "entropy": 6.286064195632934, "epoch": 0.7227470385365122, "grad_norm": 1.234375, "learning_rate": 0.0004956213351597946, "loss": 6.0912, "mean_token_accuracy": 0.1527165576815605, "num_tokens": 14162123.0, "step": 7230 }, { "entropy": 6.283297920227051, "epoch": 0.7232468635977408, "grad_norm": 1.3359375, "learning_rate": 0.0004956143257906805, "loss": 6.2731, "mean_token_accuracy": 0.14748100861907004, "num_tokens": 14172004.0, "step": 7235 }, { "entropy": 6.125205707550049, "epoch": 0.7237466886589694, "grad_norm": 1.265625, "learning_rate": 0.0004956073108709667, "loss": 6.1491, "mean_token_accuracy": 0.1470201477408409, "num_tokens": 14181659.0, "step": 7240 }, { "entropy": 6.21792778968811, "epoch": 0.7242465137201979, "grad_norm": 1.234375, "learning_rate": 0.0004956002904008298, "loss": 6.1211, "mean_token_accuracy": 0.1494100198149681, "num_tokens": 14191051.0, "step": 7245 }, { "entropy": 6.375655031204223, "epoch": 0.7247463387814265, "grad_norm": 1.1171875, "learning_rate": 0.0004955932643804463, "loss": 6.2577, "mean_token_accuracy": 0.13779568821191787, "num_tokens": 14201232.0, "step": 7250 }, { "entropy": 6.298529720306396, "epoch": 0.7252461638426551, "grad_norm": 1.234375, "learning_rate": 0.000495586232809993, "loss": 6.1787, "mean_token_accuracy": 0.1432025372982025, "num_tokens": 14210426.0, "step": 7255 }, { "entropy": 6.154688215255737, "epoch": 0.7257459889038836, "grad_norm": 1.25, "learning_rate": 0.0004955791956896469, "loss": 6.0449, "mean_token_accuracy": 0.15584971606731415, "num_tokens": 14220013.0, "step": 7260 }, { "entropy": 6.279833030700684, "epoch": 0.7262458139651122, "grad_norm": 1.296875, "learning_rate": 0.000495572153019585, "loss": 6.1748, "mean_token_accuracy": 0.1474984735250473, "num_tokens": 14229249.0, "step": 7265 }, { "entropy": 6.281010627746582, "epoch": 0.7267456390263408, "grad_norm": 1.1953125, "learning_rate": 0.0004955651047999844, "loss": 6.0642, "mean_token_accuracy": 0.15525839626789092, "num_tokens": 14238370.0, "step": 7270 }, { "entropy": 6.174116420745849, "epoch": 0.7272454640875694, "grad_norm": 1.0859375, "learning_rate": 0.0004955580510310226, "loss": 6.1325, "mean_token_accuracy": 0.1603264719247818, "num_tokens": 14248037.0, "step": 7275 }, { "entropy": 6.215904712677002, "epoch": 0.7277452891487979, "grad_norm": 1.2890625, "learning_rate": 0.0004955509917128771, "loss": 6.1732, "mean_token_accuracy": 0.14549778550863265, "num_tokens": 14257480.0, "step": 7280 }, { "entropy": 6.2183716773986815, "epoch": 0.7282451142100265, "grad_norm": 1.21875, "learning_rate": 0.0004955439268457252, "loss": 6.1342, "mean_token_accuracy": 0.14461766853928565, "num_tokens": 14266114.0, "step": 7285 }, { "entropy": 6.1960225105285645, "epoch": 0.728744939271255, "grad_norm": 1.1171875, "learning_rate": 0.0004955368564297449, "loss": 6.1313, "mean_token_accuracy": 0.14872496724128723, "num_tokens": 14276048.0, "step": 7290 }, { "entropy": 6.290376043319702, "epoch": 0.7292447643324836, "grad_norm": 1.1640625, "learning_rate": 0.0004955297804651142, "loss": 6.0416, "mean_token_accuracy": 0.15893998593091965, "num_tokens": 14285225.0, "step": 7295 }, { "entropy": 6.325178861618042, "epoch": 0.7297445893937122, "grad_norm": 1.2734375, "learning_rate": 0.0004955226989520107, "loss": 6.1474, "mean_token_accuracy": 0.14429766312241554, "num_tokens": 14295566.0, "step": 7300 }, { "entropy": 6.225370311737061, "epoch": 0.7302444144549408, "grad_norm": 1.3828125, "learning_rate": 0.000495515611890613, "loss": 6.1257, "mean_token_accuracy": 0.14591144621372223, "num_tokens": 14305072.0, "step": 7305 }, { "entropy": 6.162986850738525, "epoch": 0.7307442395161693, "grad_norm": 1.1875, "learning_rate": 0.0004955085192810993, "loss": 5.978, "mean_token_accuracy": 0.15212754383683205, "num_tokens": 14315273.0, "step": 7310 }, { "entropy": 6.2624650478363035, "epoch": 0.7312440645773979, "grad_norm": 1.46875, "learning_rate": 0.0004955014211236479, "loss": 6.1661, "mean_token_accuracy": 0.1413229674100876, "num_tokens": 14324818.0, "step": 7315 }, { "entropy": 6.3168800354003904, "epoch": 0.7317438896386265, "grad_norm": 1.375, "learning_rate": 0.0004954943174184375, "loss": 6.2342, "mean_token_accuracy": 0.14350414872169495, "num_tokens": 14335129.0, "step": 7320 }, { "entropy": 6.349929332733154, "epoch": 0.732243714699855, "grad_norm": 1.1796875, "learning_rate": 0.0004954872081656469, "loss": 6.2181, "mean_token_accuracy": 0.14031280279159547, "num_tokens": 14344339.0, "step": 7325 }, { "entropy": 6.29350528717041, "epoch": 0.7327435397610836, "grad_norm": 1.203125, "learning_rate": 0.0004954800933654548, "loss": 6.1485, "mean_token_accuracy": 0.14367504715919494, "num_tokens": 14353391.0, "step": 7330 }, { "entropy": 6.327314662933349, "epoch": 0.7332433648223122, "grad_norm": 1.25, "learning_rate": 0.0004954729730180403, "loss": 6.2593, "mean_token_accuracy": 0.1388326495885849, "num_tokens": 14363684.0, "step": 7335 }, { "entropy": 6.330690670013428, "epoch": 0.7337431898835408, "grad_norm": 1.234375, "learning_rate": 0.0004954658471235825, "loss": 6.1515, "mean_token_accuracy": 0.15232093632221222, "num_tokens": 14372802.0, "step": 7340 }, { "entropy": 6.29860520362854, "epoch": 0.7342430149447693, "grad_norm": 1.203125, "learning_rate": 0.0004954587156822607, "loss": 6.1826, "mean_token_accuracy": 0.13735579922795296, "num_tokens": 14382665.0, "step": 7345 }, { "entropy": 6.25233678817749, "epoch": 0.7347428400059979, "grad_norm": 1.109375, "learning_rate": 0.0004954515786942544, "loss": 6.1327, "mean_token_accuracy": 0.14868216961622238, "num_tokens": 14393631.0, "step": 7350 }, { "entropy": 6.258598518371582, "epoch": 0.7352426650672265, "grad_norm": 1.2421875, "learning_rate": 0.000495444436159743, "loss": 6.1413, "mean_token_accuracy": 0.1490681141614914, "num_tokens": 14402713.0, "step": 7355 }, { "entropy": 6.388405275344849, "epoch": 0.735742490128455, "grad_norm": 1.1953125, "learning_rate": 0.0004954372880789064, "loss": 6.3014, "mean_token_accuracy": 0.1369183234870434, "num_tokens": 14412777.0, "step": 7360 }, { "entropy": 6.374183988571167, "epoch": 0.7362423151896836, "grad_norm": 1.1171875, "learning_rate": 0.0004954301344519244, "loss": 6.2337, "mean_token_accuracy": 0.14146374613046647, "num_tokens": 14422839.0, "step": 7365 }, { "entropy": 6.174902868270874, "epoch": 0.7367421402509122, "grad_norm": 1.3671875, "learning_rate": 0.0004954229752789769, "loss": 6.1094, "mean_token_accuracy": 0.15102093666791916, "num_tokens": 14433239.0, "step": 7370 }, { "entropy": 6.286706495285034, "epoch": 0.7372419653121407, "grad_norm": 1.2421875, "learning_rate": 0.0004954158105602441, "loss": 6.2137, "mean_token_accuracy": 0.14214254766702653, "num_tokens": 14442907.0, "step": 7375 }, { "entropy": 6.252299070358276, "epoch": 0.7377417903733693, "grad_norm": 1.109375, "learning_rate": 0.0004954086402959061, "loss": 6.05, "mean_token_accuracy": 0.1516972839832306, "num_tokens": 14452492.0, "step": 7380 }, { "entropy": 6.274751377105713, "epoch": 0.7382416154345979, "grad_norm": 1.3359375, "learning_rate": 0.0004954014644861435, "loss": 6.2011, "mean_token_accuracy": 0.14236974269151687, "num_tokens": 14461353.0, "step": 7385 }, { "entropy": 6.237046480178833, "epoch": 0.7387414404958265, "grad_norm": 1.1875, "learning_rate": 0.0004953942831311367, "loss": 6.0683, "mean_token_accuracy": 0.159549480676651, "num_tokens": 14470579.0, "step": 7390 }, { "entropy": 6.210099554061889, "epoch": 0.739241265557055, "grad_norm": 1.0859375, "learning_rate": 0.0004953870962310666, "loss": 6.039, "mean_token_accuracy": 0.1542980045080185, "num_tokens": 14481608.0, "step": 7395 }, { "entropy": 6.2453282356262205, "epoch": 0.7397410906182836, "grad_norm": 1.203125, "learning_rate": 0.0004953799037861138, "loss": 6.202, "mean_token_accuracy": 0.14560826495289803, "num_tokens": 14493074.0, "step": 7400 }, { "entropy": 6.25093183517456, "epoch": 0.7402409156795122, "grad_norm": 1.234375, "learning_rate": 0.0004953727057964594, "loss": 6.0557, "mean_token_accuracy": 0.15362336188554765, "num_tokens": 14502469.0, "step": 7405 }, { "entropy": 6.263181686401367, "epoch": 0.7407407407407407, "grad_norm": 1.25, "learning_rate": 0.0004953655022622843, "loss": 6.2016, "mean_token_accuracy": 0.1444786325097084, "num_tokens": 14512939.0, "step": 7410 }, { "entropy": 6.291695547103882, "epoch": 0.7412405658019693, "grad_norm": 1.1328125, "learning_rate": 0.0004953582931837699, "loss": 6.1987, "mean_token_accuracy": 0.14422058761119844, "num_tokens": 14522681.0, "step": 7415 }, { "entropy": 6.34011025428772, "epoch": 0.7417403908631979, "grad_norm": 1.359375, "learning_rate": 0.0004953510785610976, "loss": 6.0426, "mean_token_accuracy": 0.1551153466105461, "num_tokens": 14532115.0, "step": 7420 }, { "entropy": 6.249790334701538, "epoch": 0.7422402159244265, "grad_norm": 1.25, "learning_rate": 0.0004953438583944487, "loss": 6.1616, "mean_token_accuracy": 0.1463777095079422, "num_tokens": 14541147.0, "step": 7425 }, { "entropy": 6.221587467193603, "epoch": 0.742740040985655, "grad_norm": 1.1796875, "learning_rate": 0.0004953366326840052, "loss": 6.1851, "mean_token_accuracy": 0.1517923206090927, "num_tokens": 14550373.0, "step": 7430 }, { "entropy": 6.341326713562012, "epoch": 0.7432398660468836, "grad_norm": 1.3046875, "learning_rate": 0.0004953294014299486, "loss": 6.203, "mean_token_accuracy": 0.15120259523391724, "num_tokens": 14559396.0, "step": 7435 }, { "entropy": 6.33515477180481, "epoch": 0.7437396911081121, "grad_norm": 1.1875, "learning_rate": 0.0004953221646324611, "loss": 6.2511, "mean_token_accuracy": 0.14376300275325776, "num_tokens": 14570292.0, "step": 7440 }, { "entropy": 6.224924039840698, "epoch": 0.7442395161693407, "grad_norm": 1.203125, "learning_rate": 0.0004953149222917245, "loss": 6.1201, "mean_token_accuracy": 0.1470565378665924, "num_tokens": 14579887.0, "step": 7445 }, { "entropy": 6.313384675979615, "epoch": 0.7447393412305693, "grad_norm": 1.140625, "learning_rate": 0.0004953076744079213, "loss": 6.2159, "mean_token_accuracy": 0.14277174770832063, "num_tokens": 14590260.0, "step": 7450 }, { "entropy": 6.295294284820557, "epoch": 0.7452391662917979, "grad_norm": 1.3671875, "learning_rate": 0.0004953004209812335, "loss": 6.1375, "mean_token_accuracy": 0.1440180078148842, "num_tokens": 14599812.0, "step": 7455 }, { "entropy": 6.24394645690918, "epoch": 0.7457389913530265, "grad_norm": 1.1875, "learning_rate": 0.0004952931620118439, "loss": 6.0753, "mean_token_accuracy": 0.15063059329986572, "num_tokens": 14609147.0, "step": 7460 }, { "entropy": 6.296684455871582, "epoch": 0.746238816414255, "grad_norm": 1.2265625, "learning_rate": 0.0004952858974999351, "loss": 6.1698, "mean_token_accuracy": 0.14148258045315742, "num_tokens": 14618834.0, "step": 7465 }, { "entropy": 6.206604385375977, "epoch": 0.7467386414754836, "grad_norm": 1.1796875, "learning_rate": 0.0004952786274456896, "loss": 6.0698, "mean_token_accuracy": 0.15565451979637146, "num_tokens": 14628556.0, "step": 7470 }, { "entropy": 6.201365661621094, "epoch": 0.7472384665367121, "grad_norm": 1.2734375, "learning_rate": 0.0004952713518492907, "loss": 6.141, "mean_token_accuracy": 0.14673066288232803, "num_tokens": 14637486.0, "step": 7475 }, { "entropy": 6.199154376983643, "epoch": 0.7477382915979407, "grad_norm": 1.1875, "learning_rate": 0.0004952640707109213, "loss": 6.1284, "mean_token_accuracy": 0.1510494664311409, "num_tokens": 14647599.0, "step": 7480 }, { "entropy": 6.291010332107544, "epoch": 0.7482381166591693, "grad_norm": 1.375, "learning_rate": 0.0004952567840307644, "loss": 6.0289, "mean_token_accuracy": 0.15243840217590332, "num_tokens": 14656246.0, "step": 7485 }, { "entropy": 6.242139911651611, "epoch": 0.7487379417203979, "grad_norm": 1.171875, "learning_rate": 0.0004952494918090036, "loss": 6.1583, "mean_token_accuracy": 0.14685693830251695, "num_tokens": 14665550.0, "step": 7490 }, { "entropy": 6.3156510353088375, "epoch": 0.7492377667816265, "grad_norm": 1.2578125, "learning_rate": 0.0004952421940458222, "loss": 6.1814, "mean_token_accuracy": 0.1445535846054554, "num_tokens": 14676462.0, "step": 7495 }, { "entropy": 6.227349185943604, "epoch": 0.749737591842855, "grad_norm": 1.3125, "learning_rate": 0.0004952348907414039, "loss": 6.0179, "mean_token_accuracy": 0.15693516954779624, "num_tokens": 14685963.0, "step": 7500 }, { "entropy": 6.2448042869567875, "epoch": 0.7502374169040835, "grad_norm": 1.203125, "learning_rate": 0.0004952275818959325, "loss": 6.1707, "mean_token_accuracy": 0.14609416276216508, "num_tokens": 14695764.0, "step": 7505 }, { "entropy": 6.258151483535767, "epoch": 0.7507372419653121, "grad_norm": 1.3984375, "learning_rate": 0.0004952202675095916, "loss": 6.0992, "mean_token_accuracy": 0.1508508086204529, "num_tokens": 14705839.0, "step": 7510 }, { "entropy": 6.238934564590454, "epoch": 0.7512370670265407, "grad_norm": 1.1328125, "learning_rate": 0.0004952129475825657, "loss": 6.0751, "mean_token_accuracy": 0.15591567903757095, "num_tokens": 14714801.0, "step": 7515 }, { "entropy": 6.311402273178101, "epoch": 0.7517368920877693, "grad_norm": 1.234375, "learning_rate": 0.0004952056221150385, "loss": 6.2181, "mean_token_accuracy": 0.15030758529901506, "num_tokens": 14723803.0, "step": 7520 }, { "entropy": 6.318091297149659, "epoch": 0.7522367171489979, "grad_norm": 1.34375, "learning_rate": 0.0004951982911071945, "loss": 6.1139, "mean_token_accuracy": 0.152104152739048, "num_tokens": 14732598.0, "step": 7525 }, { "entropy": 6.27641453742981, "epoch": 0.7527365422102265, "grad_norm": 1.2421875, "learning_rate": 0.0004951909545592183, "loss": 6.164, "mean_token_accuracy": 0.1490496352314949, "num_tokens": 14742598.0, "step": 7530 }, { "entropy": 6.224202871322632, "epoch": 0.753236367271455, "grad_norm": 1.40625, "learning_rate": 0.0004951836124712942, "loss": 6.1868, "mean_token_accuracy": 0.1542062133550644, "num_tokens": 14751434.0, "step": 7535 }, { "entropy": 6.355421304702759, "epoch": 0.7537361923326835, "grad_norm": 1.2265625, "learning_rate": 0.0004951762648436073, "loss": 6.1844, "mean_token_accuracy": 0.1477696493268013, "num_tokens": 14760661.0, "step": 7540 }, { "entropy": 6.337145137786865, "epoch": 0.7542360173939121, "grad_norm": 1.1796875, "learning_rate": 0.0004951689116763419, "loss": 6.1808, "mean_token_accuracy": 0.14135282933712007, "num_tokens": 14770431.0, "step": 7545 }, { "entropy": 6.235747861862182, "epoch": 0.7547358424551407, "grad_norm": 1.2109375, "learning_rate": 0.0004951615529696835, "loss": 6.1779, "mean_token_accuracy": 0.14604596346616744, "num_tokens": 14780066.0, "step": 7550 }, { "entropy": 6.281822252273559, "epoch": 0.7552356675163693, "grad_norm": 1.296875, "learning_rate": 0.0004951541887238172, "loss": 6.1834, "mean_token_accuracy": 0.14925995394587516, "num_tokens": 14789531.0, "step": 7555 }, { "entropy": 6.32441291809082, "epoch": 0.7557354925775979, "grad_norm": 1.28125, "learning_rate": 0.0004951468189389281, "loss": 6.0949, "mean_token_accuracy": 0.14842487275600433, "num_tokens": 14799000.0, "step": 7560 }, { "entropy": 6.213815116882325, "epoch": 0.7562353176388265, "grad_norm": 1.171875, "learning_rate": 0.0004951394436152016, "loss": 6.1315, "mean_token_accuracy": 0.15473720282316208, "num_tokens": 14808991.0, "step": 7565 }, { "entropy": 6.242095899581909, "epoch": 0.7567351427000549, "grad_norm": 1.21875, "learning_rate": 0.0004951320627528234, "loss": 6.1652, "mean_token_accuracy": 0.15253257900476455, "num_tokens": 14819351.0, "step": 7570 }, { "entropy": 6.266114091873169, "epoch": 0.7572349677612835, "grad_norm": 1.390625, "learning_rate": 0.0004951246763519791, "loss": 6.1829, "mean_token_accuracy": 0.14603662714362145, "num_tokens": 14828924.0, "step": 7575 }, { "entropy": 6.448176622390747, "epoch": 0.7577347928225121, "grad_norm": 1.15625, "learning_rate": 0.0004951172844128546, "loss": 6.3275, "mean_token_accuracy": 0.1285861536860466, "num_tokens": 14841077.0, "step": 7580 }, { "entropy": 6.410078239440918, "epoch": 0.7582346178837407, "grad_norm": 1.2890625, "learning_rate": 0.0004951098869356358, "loss": 6.2551, "mean_token_accuracy": 0.1365300476551056, "num_tokens": 14851223.0, "step": 7585 }, { "entropy": 6.320130109786987, "epoch": 0.7587344429449693, "grad_norm": 1.1796875, "learning_rate": 0.000495102483920509, "loss": 6.088, "mean_token_accuracy": 0.1487969607114792, "num_tokens": 14861003.0, "step": 7590 }, { "entropy": 6.334915590286255, "epoch": 0.7592342680061979, "grad_norm": 1.2265625, "learning_rate": 0.0004950950753676603, "loss": 6.2199, "mean_token_accuracy": 0.14157491624355317, "num_tokens": 14870207.0, "step": 7595 }, { "entropy": 6.180481767654419, "epoch": 0.7597340930674265, "grad_norm": 1.3046875, "learning_rate": 0.0004950876612772763, "loss": 6.1095, "mean_token_accuracy": 0.1504347875714302, "num_tokens": 14879886.0, "step": 7600 }, { "entropy": 6.199652433395386, "epoch": 0.7602339181286549, "grad_norm": 1.296875, "learning_rate": 0.0004950802416495431, "loss": 6.0979, "mean_token_accuracy": 0.15191600620746612, "num_tokens": 14889275.0, "step": 7605 }, { "entropy": 6.374163436889648, "epoch": 0.7607337431898835, "grad_norm": 1.25, "learning_rate": 0.0004950728164846478, "loss": 6.1958, "mean_token_accuracy": 0.14734057039022447, "num_tokens": 14898317.0, "step": 7610 }, { "entropy": 6.291928720474243, "epoch": 0.7612335682511121, "grad_norm": 1.1796875, "learning_rate": 0.0004950653857827771, "loss": 6.1199, "mean_token_accuracy": 0.15374854654073716, "num_tokens": 14907183.0, "step": 7615 }, { "entropy": 6.262668514251709, "epoch": 0.7617333933123407, "grad_norm": 1.2890625, "learning_rate": 0.0004950579495441177, "loss": 6.2769, "mean_token_accuracy": 0.14063684716820718, "num_tokens": 14917564.0, "step": 7620 }, { "entropy": 6.322841644287109, "epoch": 0.7622332183735693, "grad_norm": 1.234375, "learning_rate": 0.0004950505077688572, "loss": 6.097, "mean_token_accuracy": 0.15270165205001832, "num_tokens": 14927102.0, "step": 7625 }, { "entropy": 6.144235038757325, "epoch": 0.7627330434347979, "grad_norm": 1.109375, "learning_rate": 0.0004950430604571824, "loss": 5.9942, "mean_token_accuracy": 0.1637290060520172, "num_tokens": 14937934.0, "step": 7630 }, { "entropy": 6.279917001724243, "epoch": 0.7632328684960263, "grad_norm": 1.1484375, "learning_rate": 0.0004950356076092808, "loss": 6.158, "mean_token_accuracy": 0.14633598923683167, "num_tokens": 14948109.0, "step": 7635 }, { "entropy": 6.273922777175903, "epoch": 0.7637326935572549, "grad_norm": 1.34375, "learning_rate": 0.00049502814922534, "loss": 6.1949, "mean_token_accuracy": 0.14215281307697297, "num_tokens": 14956971.0, "step": 7640 }, { "entropy": 6.253824615478516, "epoch": 0.7642325186184835, "grad_norm": 2.6875, "learning_rate": 0.0004950206853055475, "loss": 6.1432, "mean_token_accuracy": 0.15685205310583114, "num_tokens": 14967046.0, "step": 7645 }, { "entropy": 6.296667289733887, "epoch": 0.7647323436797121, "grad_norm": 1.3359375, "learning_rate": 0.0004950132158500913, "loss": 6.126, "mean_token_accuracy": 0.1458499863743782, "num_tokens": 14976234.0, "step": 7650 }, { "entropy": 6.1665582180023195, "epoch": 0.7652321687409407, "grad_norm": 1.296875, "learning_rate": 0.0004950057408591591, "loss": 6.0744, "mean_token_accuracy": 0.15667738020420074, "num_tokens": 14985205.0, "step": 7655 }, { "entropy": 6.139488077163696, "epoch": 0.7657319938021693, "grad_norm": 1.265625, "learning_rate": 0.0004949982603329391, "loss": 6.0707, "mean_token_accuracy": 0.15247628539800645, "num_tokens": 14994233.0, "step": 7660 }, { "entropy": 6.25272388458252, "epoch": 0.7662318188633979, "grad_norm": 1.296875, "learning_rate": 0.0004949907742716195, "loss": 6.1337, "mean_token_accuracy": 0.15385272800922395, "num_tokens": 15004001.0, "step": 7665 }, { "entropy": 6.324283599853516, "epoch": 0.7667316439246263, "grad_norm": 1.3515625, "learning_rate": 0.0004949832826753886, "loss": 6.1577, "mean_token_accuracy": 0.1397901549935341, "num_tokens": 15015046.0, "step": 7670 }, { "entropy": 6.21451735496521, "epoch": 0.7672314689858549, "grad_norm": 1.2578125, "learning_rate": 0.000494975785544435, "loss": 6.0893, "mean_token_accuracy": 0.1504504442214966, "num_tokens": 15025404.0, "step": 7675 }, { "entropy": 6.285001659393311, "epoch": 0.7677312940470835, "grad_norm": 1.171875, "learning_rate": 0.0004949682828789472, "loss": 6.1872, "mean_token_accuracy": 0.1416396342217922, "num_tokens": 15036160.0, "step": 7680 }, { "entropy": 6.2325386047363285, "epoch": 0.7682311191083121, "grad_norm": 1.234375, "learning_rate": 0.000494960774679114, "loss": 6.0999, "mean_token_accuracy": 0.15209167897701265, "num_tokens": 15046356.0, "step": 7685 }, { "entropy": 6.220134687423706, "epoch": 0.7687309441695407, "grad_norm": 1.4140625, "learning_rate": 0.0004949532609451242, "loss": 6.1047, "mean_token_accuracy": 0.14704525470733643, "num_tokens": 15056101.0, "step": 7690 }, { "entropy": 6.281166315078735, "epoch": 0.7692307692307693, "grad_norm": 1.296875, "learning_rate": 0.0004949457416771671, "loss": 6.1052, "mean_token_accuracy": 0.15407356172800063, "num_tokens": 15065726.0, "step": 7695 }, { "entropy": 6.217519998550415, "epoch": 0.7697305942919977, "grad_norm": 1.1875, "learning_rate": 0.0004949382168754316, "loss": 6.082, "mean_token_accuracy": 0.15789294242858887, "num_tokens": 15075211.0, "step": 7700 }, { "entropy": 6.176139068603516, "epoch": 0.7702304193532263, "grad_norm": 1.2109375, "learning_rate": 0.0004949306865401073, "loss": 6.0085, "mean_token_accuracy": 0.1518138200044632, "num_tokens": 15085525.0, "step": 7705 }, { "entropy": 6.290589666366577, "epoch": 0.7707302444144549, "grad_norm": 1.359375, "learning_rate": 0.0004949231506713833, "loss": 6.2111, "mean_token_accuracy": 0.14028151333332062, "num_tokens": 15093851.0, "step": 7710 }, { "entropy": 6.390812492370605, "epoch": 0.7712300694756835, "grad_norm": 1.2109375, "learning_rate": 0.0004949156092694496, "loss": 6.2805, "mean_token_accuracy": 0.13829066157341002, "num_tokens": 15104066.0, "step": 7715 }, { "entropy": 6.316229248046875, "epoch": 0.7717298945369121, "grad_norm": 1.3515625, "learning_rate": 0.0004949080623344958, "loss": 6.1169, "mean_token_accuracy": 0.1493843212723732, "num_tokens": 15114047.0, "step": 7720 }, { "entropy": 6.217624187469482, "epoch": 0.7722297195981407, "grad_norm": 1.140625, "learning_rate": 0.0004949005098667117, "loss": 6.1184, "mean_token_accuracy": 0.15427873581647872, "num_tokens": 15123719.0, "step": 7725 }, { "entropy": 6.179004573822022, "epoch": 0.7727295446593693, "grad_norm": 1.3515625, "learning_rate": 0.0004948929518662873, "loss": 6.1737, "mean_token_accuracy": 0.14911814630031586, "num_tokens": 15133978.0, "step": 7730 }, { "entropy": 6.300451707839966, "epoch": 0.7732293697205977, "grad_norm": 1.1953125, "learning_rate": 0.0004948853883334129, "loss": 6.199, "mean_token_accuracy": 0.1457667052745819, "num_tokens": 15145058.0, "step": 7735 }, { "entropy": 6.389480972290039, "epoch": 0.7737291947818263, "grad_norm": 1.296875, "learning_rate": 0.0004948778192682787, "loss": 6.2094, "mean_token_accuracy": 0.1432968035340309, "num_tokens": 15155400.0, "step": 7740 }, { "entropy": 6.18777379989624, "epoch": 0.7742290198430549, "grad_norm": 1.3203125, "learning_rate": 0.000494870244671075, "loss": 6.0416, "mean_token_accuracy": 0.1611133858561516, "num_tokens": 15164969.0, "step": 7745 }, { "entropy": 6.236864519119263, "epoch": 0.7747288449042835, "grad_norm": 1.3125, "learning_rate": 0.0004948626645419926, "loss": 6.12, "mean_token_accuracy": 0.15284099280834199, "num_tokens": 15173840.0, "step": 7750 }, { "entropy": 6.2907976627349855, "epoch": 0.7752286699655121, "grad_norm": 1.140625, "learning_rate": 0.0004948550788812222, "loss": 6.2204, "mean_token_accuracy": 0.13937411978840827, "num_tokens": 15184541.0, "step": 7755 }, { "entropy": 6.29304141998291, "epoch": 0.7757284950267407, "grad_norm": 1.265625, "learning_rate": 0.0004948474876889545, "loss": 6.1579, "mean_token_accuracy": 0.15075905323028566, "num_tokens": 15195060.0, "step": 7760 }, { "entropy": 6.320642518997192, "epoch": 0.7762283200879692, "grad_norm": 1.171875, "learning_rate": 0.0004948398909653806, "loss": 6.1885, "mean_token_accuracy": 0.1424543760716915, "num_tokens": 15206093.0, "step": 7765 }, { "entropy": 6.292466402053833, "epoch": 0.7767281451491977, "grad_norm": 1.0859375, "learning_rate": 0.0004948322887106917, "loss": 6.1425, "mean_token_accuracy": 0.14284879937767983, "num_tokens": 15215359.0, "step": 7770 }, { "entropy": 6.2611757755279545, "epoch": 0.7772279702104263, "grad_norm": 1.3359375, "learning_rate": 0.0004948246809250788, "loss": 6.1938, "mean_token_accuracy": 0.14619085863232611, "num_tokens": 15225283.0, "step": 7775 }, { "entropy": 6.220918893814087, "epoch": 0.7777277952716549, "grad_norm": 1.3203125, "learning_rate": 0.0004948170676087338, "loss": 6.0549, "mean_token_accuracy": 0.15439228415489198, "num_tokens": 15234319.0, "step": 7780 }, { "entropy": 6.220788431167603, "epoch": 0.7782276203328835, "grad_norm": 1.21875, "learning_rate": 0.0004948094487618476, "loss": 6.0271, "mean_token_accuracy": 0.15739640295505525, "num_tokens": 15244410.0, "step": 7785 }, { "entropy": 6.22987551689148, "epoch": 0.7787274453941121, "grad_norm": 1.25, "learning_rate": 0.0004948018243846126, "loss": 6.097, "mean_token_accuracy": 0.15216832756996154, "num_tokens": 15253431.0, "step": 7790 }, { "entropy": 6.249270248413086, "epoch": 0.7792272704553407, "grad_norm": 1.234375, "learning_rate": 0.0004947941944772199, "loss": 6.144, "mean_token_accuracy": 0.14642169028520585, "num_tokens": 15262566.0, "step": 7795 }, { "entropy": 6.298220920562744, "epoch": 0.7797270955165692, "grad_norm": 1.3984375, "learning_rate": 0.000494786559039862, "loss": 6.2042, "mean_token_accuracy": 0.146491177380085, "num_tokens": 15272122.0, "step": 7800 }, { "entropy": 6.30478572845459, "epoch": 0.7802269205777977, "grad_norm": 1.3125, "learning_rate": 0.0004947789180727308, "loss": 6.1742, "mean_token_accuracy": 0.14181172400712966, "num_tokens": 15281165.0, "step": 7805 }, { "entropy": 6.242979669570923, "epoch": 0.7807267456390263, "grad_norm": 1.40625, "learning_rate": 0.0004947712715760186, "loss": 6.1421, "mean_token_accuracy": 0.14454442709684373, "num_tokens": 15290992.0, "step": 7810 }, { "entropy": 6.349635267257691, "epoch": 0.7812265707002549, "grad_norm": 1.171875, "learning_rate": 0.0004947636195499177, "loss": 6.1435, "mean_token_accuracy": 0.1442279890179634, "num_tokens": 15300454.0, "step": 7815 }, { "entropy": 6.270070219039917, "epoch": 0.7817263957614835, "grad_norm": 1.203125, "learning_rate": 0.0004947559619946207, "loss": 6.098, "mean_token_accuracy": 0.1553158387541771, "num_tokens": 15310471.0, "step": 7820 }, { "entropy": 6.281497240066528, "epoch": 0.7822262208227121, "grad_norm": 1.1328125, "learning_rate": 0.0004947482989103203, "loss": 6.1823, "mean_token_accuracy": 0.14365701079368592, "num_tokens": 15320554.0, "step": 7825 }, { "entropy": 6.242315721511841, "epoch": 0.7827260458839406, "grad_norm": 1.2421875, "learning_rate": 0.0004947406302972092, "loss": 6.2175, "mean_token_accuracy": 0.1436364881694317, "num_tokens": 15331623.0, "step": 7830 }, { "entropy": 6.28975739479065, "epoch": 0.7832258709451692, "grad_norm": 1.375, "learning_rate": 0.0004947329561554804, "loss": 6.0692, "mean_token_accuracy": 0.15061132088303567, "num_tokens": 15340954.0, "step": 7835 }, { "entropy": 6.231539535522461, "epoch": 0.7837256960063977, "grad_norm": 1.515625, "learning_rate": 0.0004947252764853269, "loss": 6.1876, "mean_token_accuracy": 0.14777177199721336, "num_tokens": 15350858.0, "step": 7840 }, { "entropy": 6.227728748321534, "epoch": 0.7842255210676263, "grad_norm": 1.25, "learning_rate": 0.0004947175912869421, "loss": 6.0796, "mean_token_accuracy": 0.14888300895690917, "num_tokens": 15360382.0, "step": 7845 }, { "entropy": 6.245897674560547, "epoch": 0.7847253461288549, "grad_norm": 1.25, "learning_rate": 0.0004947099005605191, "loss": 6.1882, "mean_token_accuracy": 0.14180536866188048, "num_tokens": 15370626.0, "step": 7850 }, { "entropy": 6.27165904045105, "epoch": 0.7852251711900835, "grad_norm": 1.3515625, "learning_rate": 0.0004947022043062517, "loss": 6.1574, "mean_token_accuracy": 0.14667243137955666, "num_tokens": 15379582.0, "step": 7855 }, { "entropy": 6.261765432357788, "epoch": 0.7857249962513121, "grad_norm": 1.3359375, "learning_rate": 0.0004946945025243333, "loss": 6.0636, "mean_token_accuracy": 0.1543782025575638, "num_tokens": 15390168.0, "step": 7860 }, { "entropy": 6.078561210632325, "epoch": 0.7862248213125406, "grad_norm": 1.25, "learning_rate": 0.0004946867952149577, "loss": 5.9986, "mean_token_accuracy": 0.16364614814519882, "num_tokens": 15400979.0, "step": 7865 }, { "entropy": 6.269335794448852, "epoch": 0.7867246463737692, "grad_norm": 1.265625, "learning_rate": 0.0004946790823783189, "loss": 6.1056, "mean_token_accuracy": 0.14975828379392625, "num_tokens": 15409954.0, "step": 7870 }, { "entropy": 6.258737325668335, "epoch": 0.7872244714349977, "grad_norm": 1.375, "learning_rate": 0.000494671364014611, "loss": 6.1908, "mean_token_accuracy": 0.14610916376113892, "num_tokens": 15419539.0, "step": 7875 }, { "entropy": 6.174856567382813, "epoch": 0.7877242964962263, "grad_norm": 1.234375, "learning_rate": 0.000494663640124028, "loss": 6.1255, "mean_token_accuracy": 0.14952130913734435, "num_tokens": 15428751.0, "step": 7880 }, { "entropy": 6.304116821289062, "epoch": 0.7882241215574549, "grad_norm": 1.3203125, "learning_rate": 0.0004946559107067643, "loss": 6.1376, "mean_token_accuracy": 0.15365694165229798, "num_tokens": 15438466.0, "step": 7885 }, { "entropy": 6.259090757369995, "epoch": 0.7887239466186835, "grad_norm": 1.25, "learning_rate": 0.0004946481757630146, "loss": 6.1296, "mean_token_accuracy": 0.14955679550766945, "num_tokens": 15448395.0, "step": 7890 }, { "entropy": 6.228724956512451, "epoch": 0.789223771679912, "grad_norm": 1.21875, "learning_rate": 0.0004946404352929732, "loss": 6.1498, "mean_token_accuracy": 0.14119478985667228, "num_tokens": 15457986.0, "step": 7895 }, { "entropy": 6.2512843132019045, "epoch": 0.7897235967411406, "grad_norm": 1.171875, "learning_rate": 0.000494632689296835, "loss": 6.1416, "mean_token_accuracy": 0.1456635534763336, "num_tokens": 15467989.0, "step": 7900 }, { "entropy": 6.212045669555664, "epoch": 0.7902234218023692, "grad_norm": 1.1953125, "learning_rate": 0.0004946249377747947, "loss": 6.035, "mean_token_accuracy": 0.15187643766403197, "num_tokens": 15477537.0, "step": 7905 }, { "entropy": 6.246332311630249, "epoch": 0.7907232468635977, "grad_norm": 1.2421875, "learning_rate": 0.0004946171807270476, "loss": 6.1058, "mean_token_accuracy": 0.1481271728873253, "num_tokens": 15488007.0, "step": 7910 }, { "entropy": 6.2981274127960205, "epoch": 0.7912230719248263, "grad_norm": 1.2578125, "learning_rate": 0.0004946094181537887, "loss": 6.143, "mean_token_accuracy": 0.1494605705142021, "num_tokens": 15498122.0, "step": 7915 }, { "entropy": 6.269918155670166, "epoch": 0.7917228969860549, "grad_norm": 1.359375, "learning_rate": 0.0004946016500552134, "loss": 6.1629, "mean_token_accuracy": 0.14419534131884576, "num_tokens": 15507585.0, "step": 7920 }, { "entropy": 6.2122949123382565, "epoch": 0.7922227220472835, "grad_norm": 1.2265625, "learning_rate": 0.0004945938764315171, "loss": 6.0815, "mean_token_accuracy": 0.15033162757754326, "num_tokens": 15516260.0, "step": 7925 }, { "entropy": 6.265510845184326, "epoch": 0.792722547108512, "grad_norm": 1.2265625, "learning_rate": 0.0004945860972828954, "loss": 6.1941, "mean_token_accuracy": 0.14702940732240677, "num_tokens": 15527372.0, "step": 7930 }, { "entropy": 6.238861894607544, "epoch": 0.7932223721697406, "grad_norm": 1.171875, "learning_rate": 0.0004945783126095439, "loss": 6.1658, "mean_token_accuracy": 0.14506676122546197, "num_tokens": 15537244.0, "step": 7935 }, { "entropy": 6.359428453445434, "epoch": 0.7937221972309692, "grad_norm": 1.3046875, "learning_rate": 0.0004945705224116586, "loss": 6.169, "mean_token_accuracy": 0.14562607556581497, "num_tokens": 15546512.0, "step": 7940 }, { "entropy": 6.2519354820251465, "epoch": 0.7942220222921977, "grad_norm": 1.265625, "learning_rate": 0.0004945627266894354, "loss": 6.1266, "mean_token_accuracy": 0.14432251453399658, "num_tokens": 15557381.0, "step": 7945 }, { "entropy": 6.26039342880249, "epoch": 0.7947218473534263, "grad_norm": 1.2265625, "learning_rate": 0.0004945549254430707, "loss": 6.2042, "mean_token_accuracy": 0.14475180879235267, "num_tokens": 15565806.0, "step": 7950 }, { "entropy": 6.247186851501465, "epoch": 0.7952216724146549, "grad_norm": 1.1484375, "learning_rate": 0.0004945471186727603, "loss": 6.1235, "mean_token_accuracy": 0.1465785175561905, "num_tokens": 15577059.0, "step": 7955 }, { "entropy": 6.366255378723144, "epoch": 0.7957214974758834, "grad_norm": 1.3125, "learning_rate": 0.0004945393063787011, "loss": 6.3111, "mean_token_accuracy": 0.13643303140997887, "num_tokens": 15587827.0, "step": 7960 }, { "entropy": 6.386262559890747, "epoch": 0.796221322537112, "grad_norm": 1.1953125, "learning_rate": 0.0004945314885610894, "loss": 6.0886, "mean_token_accuracy": 0.14473408013582229, "num_tokens": 15598232.0, "step": 7965 }, { "entropy": 6.211160945892334, "epoch": 0.7967211475983406, "grad_norm": 1.2109375, "learning_rate": 0.0004945236652201219, "loss": 6.0492, "mean_token_accuracy": 0.1514046907424927, "num_tokens": 15606896.0, "step": 7970 }, { "entropy": 6.195062351226807, "epoch": 0.7972209726595691, "grad_norm": 1.25, "learning_rate": 0.0004945158363559955, "loss": 6.0659, "mean_token_accuracy": 0.15074210613965988, "num_tokens": 15616868.0, "step": 7975 }, { "entropy": 6.265796661376953, "epoch": 0.7977207977207977, "grad_norm": 1.46875, "learning_rate": 0.0004945080019689071, "loss": 6.0843, "mean_token_accuracy": 0.1455327734351158, "num_tokens": 15626521.0, "step": 7980 }, { "entropy": 6.209790182113648, "epoch": 0.7982206227820263, "grad_norm": 1.28125, "learning_rate": 0.0004945001620590538, "loss": 6.0783, "mean_token_accuracy": 0.15831656605005265, "num_tokens": 15635901.0, "step": 7985 }, { "entropy": 6.23649787902832, "epoch": 0.7987204478432549, "grad_norm": 1.359375, "learning_rate": 0.000494492316626633, "loss": 6.1337, "mean_token_accuracy": 0.14447178021073342, "num_tokens": 15645672.0, "step": 7990 }, { "entropy": 6.310642099380493, "epoch": 0.7992202729044834, "grad_norm": 1.21875, "learning_rate": 0.0004944844656718419, "loss": 6.1715, "mean_token_accuracy": 0.14741648957133294, "num_tokens": 15656668.0, "step": 7995 }, { "entropy": 6.2679932594299315, "epoch": 0.799720097965712, "grad_norm": 1.09375, "learning_rate": 0.0004944766091948783, "loss": 6.1111, "mean_token_accuracy": 0.148764169216156, "num_tokens": 15666176.0, "step": 8000 }, { "entropy": 6.252793312072754, "epoch": 0.8002199230269406, "grad_norm": 1.3046875, "learning_rate": 0.0004944687471959395, "loss": 6.1506, "mean_token_accuracy": 0.14224263802170753, "num_tokens": 15676162.0, "step": 8005 }, { "entropy": 6.297210264205932, "epoch": 0.8007197480881691, "grad_norm": 1.3046875, "learning_rate": 0.0004944608796752237, "loss": 6.1408, "mean_token_accuracy": 0.15124161988496782, "num_tokens": 15685393.0, "step": 8010 }, { "entropy": 6.234340572357178, "epoch": 0.8012195731493977, "grad_norm": 1.2421875, "learning_rate": 0.0004944530066329284, "loss": 6.0616, "mean_token_accuracy": 0.15364625602960585, "num_tokens": 15694944.0, "step": 8015 }, { "entropy": 6.277842998504639, "epoch": 0.8017193982106263, "grad_norm": 1.3359375, "learning_rate": 0.0004944451280692521, "loss": 6.2135, "mean_token_accuracy": 0.14151860475540162, "num_tokens": 15704410.0, "step": 8020 }, { "entropy": 6.284603595733643, "epoch": 0.8022192232718548, "grad_norm": 1.453125, "learning_rate": 0.0004944372439843927, "loss": 6.1111, "mean_token_accuracy": 0.1499621458351612, "num_tokens": 15713663.0, "step": 8025 }, { "entropy": 6.22285418510437, "epoch": 0.8027190483330834, "grad_norm": 1.3828125, "learning_rate": 0.0004944293543785489, "loss": 6.0662, "mean_token_accuracy": 0.15269689112901688, "num_tokens": 15722662.0, "step": 8030 }, { "entropy": 6.26998987197876, "epoch": 0.803218873394312, "grad_norm": 1.390625, "learning_rate": 0.0004944214592519188, "loss": 6.2397, "mean_token_accuracy": 0.14086568281054496, "num_tokens": 15732615.0, "step": 8035 }, { "entropy": 6.28104944229126, "epoch": 0.8037186984555406, "grad_norm": 1.28125, "learning_rate": 0.0004944135586047014, "loss": 6.164, "mean_token_accuracy": 0.15626058131456375, "num_tokens": 15741569.0, "step": 8040 }, { "entropy": 6.252986097335816, "epoch": 0.8042185235167691, "grad_norm": 1.4765625, "learning_rate": 0.0004944056524370953, "loss": 6.0319, "mean_token_accuracy": 0.15656131207942964, "num_tokens": 15750734.0, "step": 8045 }, { "entropy": 6.241338396072388, "epoch": 0.8047183485779977, "grad_norm": 1.25, "learning_rate": 0.0004943977407492994, "loss": 6.1107, "mean_token_accuracy": 0.15088774263858795, "num_tokens": 15761664.0, "step": 8050 }, { "entropy": 6.215361833572388, "epoch": 0.8052181736392263, "grad_norm": 1.1640625, "learning_rate": 0.0004943898235415128, "loss": 6.054, "mean_token_accuracy": 0.15960732698440552, "num_tokens": 15771159.0, "step": 8055 }, { "entropy": 6.287186574935913, "epoch": 0.8057179987004548, "grad_norm": 1.328125, "learning_rate": 0.0004943819008139347, "loss": 6.1713, "mean_token_accuracy": 0.14609452039003373, "num_tokens": 15781429.0, "step": 8060 }, { "entropy": 6.275288486480713, "epoch": 0.8062178237616834, "grad_norm": 1.46875, "learning_rate": 0.0004943739725667644, "loss": 6.0811, "mean_token_accuracy": 0.14959293454885483, "num_tokens": 15791361.0, "step": 8065 }, { "entropy": 6.283444452285766, "epoch": 0.806717648822912, "grad_norm": 1.2421875, "learning_rate": 0.0004943660388002014, "loss": 6.2176, "mean_token_accuracy": 0.13855115920305253, "num_tokens": 15802020.0, "step": 8070 }, { "entropy": 6.192579841613769, "epoch": 0.8072174738841406, "grad_norm": 1.2265625, "learning_rate": 0.0004943580995144454, "loss": 6.0219, "mean_token_accuracy": 0.1576543368399143, "num_tokens": 15811319.0, "step": 8075 }, { "entropy": 6.251135778427124, "epoch": 0.8077172989453691, "grad_norm": 1.28125, "learning_rate": 0.0004943501547096961, "loss": 6.165, "mean_token_accuracy": 0.14632676020264626, "num_tokens": 15821337.0, "step": 8080 }, { "entropy": 6.276842832565308, "epoch": 0.8082171240065977, "grad_norm": 2.03125, "learning_rate": 0.0004943422043861531, "loss": 6.1612, "mean_token_accuracy": 0.14304060935974122, "num_tokens": 15832234.0, "step": 8085 }, { "entropy": 6.32946662902832, "epoch": 0.8087169490678262, "grad_norm": 1.328125, "learning_rate": 0.0004943342485440169, "loss": 6.1484, "mean_token_accuracy": 0.14859842807054519, "num_tokens": 15841797.0, "step": 8090 }, { "entropy": 6.2384930610656735, "epoch": 0.8092167741290548, "grad_norm": 1.2890625, "learning_rate": 0.0004943262871834874, "loss": 6.1499, "mean_token_accuracy": 0.148804971575737, "num_tokens": 15851031.0, "step": 8095 }, { "entropy": 6.264900636672974, "epoch": 0.8097165991902834, "grad_norm": 1.2421875, "learning_rate": 0.0004943183203047649, "loss": 6.1598, "mean_token_accuracy": 0.1434067964553833, "num_tokens": 15861297.0, "step": 8100 }, { "entropy": 6.259158325195313, "epoch": 0.810216424251512, "grad_norm": 1.296875, "learning_rate": 0.0004943103479080499, "loss": 6.1818, "mean_token_accuracy": 0.14457603693008422, "num_tokens": 15871066.0, "step": 8105 }, { "entropy": 6.289132833480835, "epoch": 0.8107162493127406, "grad_norm": 1.3671875, "learning_rate": 0.000494302369993543, "loss": 6.1429, "mean_token_accuracy": 0.1471883848309517, "num_tokens": 15880395.0, "step": 8110 }, { "entropy": 6.2609984397888185, "epoch": 0.8112160743739691, "grad_norm": 1.2734375, "learning_rate": 0.0004942943865614449, "loss": 6.0989, "mean_token_accuracy": 0.15523406416177749, "num_tokens": 15889937.0, "step": 8115 }, { "entropy": 6.302601289749146, "epoch": 0.8117158994351977, "grad_norm": 1.4296875, "learning_rate": 0.0004942863976119565, "loss": 6.1147, "mean_token_accuracy": 0.1481298550963402, "num_tokens": 15899894.0, "step": 8120 }, { "entropy": 6.156360101699829, "epoch": 0.8122157244964262, "grad_norm": 1.359375, "learning_rate": 0.0004942784031452788, "loss": 5.9939, "mean_token_accuracy": 0.16302908807992936, "num_tokens": 15909038.0, "step": 8125 }, { "entropy": 6.1888800144195555, "epoch": 0.8127155495576548, "grad_norm": 1.21875, "learning_rate": 0.0004942704031616127, "loss": 6.1083, "mean_token_accuracy": 0.1479555383324623, "num_tokens": 15917891.0, "step": 8130 }, { "entropy": 6.356932258605957, "epoch": 0.8132153746188834, "grad_norm": 1.25, "learning_rate": 0.0004942623976611598, "loss": 6.2352, "mean_token_accuracy": 0.13697459399700165, "num_tokens": 15928079.0, "step": 8135 }, { "entropy": 6.232399320602417, "epoch": 0.813715199680112, "grad_norm": 1.2421875, "learning_rate": 0.0004942543866441215, "loss": 6.0724, "mean_token_accuracy": 0.1500664010643959, "num_tokens": 15938065.0, "step": 8140 }, { "entropy": 6.178165769577026, "epoch": 0.8142150247413406, "grad_norm": 1.1875, "learning_rate": 0.0004942463701106992, "loss": 6.0959, "mean_token_accuracy": 0.14846319928765297, "num_tokens": 15947650.0, "step": 8145 }, { "entropy": 6.237065696716309, "epoch": 0.8147148498025691, "grad_norm": 1.2109375, "learning_rate": 0.0004942383480610946, "loss": 6.1043, "mean_token_accuracy": 0.15195035934448242, "num_tokens": 15957194.0, "step": 8150 }, { "entropy": 6.291400337219239, "epoch": 0.8152146748637976, "grad_norm": 1.296875, "learning_rate": 0.0004942303204955096, "loss": 6.087, "mean_token_accuracy": 0.1471625730395317, "num_tokens": 15966068.0, "step": 8155 }, { "entropy": 6.212914705276489, "epoch": 0.8157144999250262, "grad_norm": 1.203125, "learning_rate": 0.0004942222874141461, "loss": 6.0863, "mean_token_accuracy": 0.15084351524710654, "num_tokens": 15975672.0, "step": 8160 }, { "entropy": 6.216798114776611, "epoch": 0.8162143249862548, "grad_norm": 1.4140625, "learning_rate": 0.0004942142488172063, "loss": 6.1177, "mean_token_accuracy": 0.1479246884584427, "num_tokens": 15986216.0, "step": 8165 }, { "entropy": 6.22374701499939, "epoch": 0.8167141500474834, "grad_norm": 1.3125, "learning_rate": 0.0004942062047048924, "loss": 6.0502, "mean_token_accuracy": 0.15558496564626695, "num_tokens": 15994673.0, "step": 8170 }, { "entropy": 6.242802095413208, "epoch": 0.817213975108712, "grad_norm": 1.6796875, "learning_rate": 0.0004941981550774068, "loss": 6.0851, "mean_token_accuracy": 0.15276721715927125, "num_tokens": 16003576.0, "step": 8175 }, { "entropy": 6.128625202178955, "epoch": 0.8177138001699406, "grad_norm": 1.4296875, "learning_rate": 0.0004941900999349521, "loss": 6.0744, "mean_token_accuracy": 0.15664535239338875, "num_tokens": 16013334.0, "step": 8180 }, { "entropy": 6.258645534515381, "epoch": 0.8182136252311691, "grad_norm": 1.2578125, "learning_rate": 0.0004941820392777307, "loss": 6.0872, "mean_token_accuracy": 0.15426221936941148, "num_tokens": 16023101.0, "step": 8185 }, { "entropy": 6.2186816215515135, "epoch": 0.8187134502923976, "grad_norm": 1.09375, "learning_rate": 0.0004941739731059457, "loss": 6.1569, "mean_token_accuracy": 0.14787602350115775, "num_tokens": 16034189.0, "step": 8190 }, { "entropy": 6.251330137252808, "epoch": 0.8192132753536262, "grad_norm": 1.3046875, "learning_rate": 0.0004941659014198, "loss": 6.0657, "mean_token_accuracy": 0.15217609703540802, "num_tokens": 16044008.0, "step": 8195 }, { "entropy": 6.324179697036743, "epoch": 0.8197131004148548, "grad_norm": 1.1875, "learning_rate": 0.0004941578242194965, "loss": 6.1555, "mean_token_accuracy": 0.1472798228263855, "num_tokens": 16053557.0, "step": 8200 }, { "entropy": 6.294137382507325, "epoch": 0.8202129254760834, "grad_norm": 1.2890625, "learning_rate": 0.0004941497415052387, "loss": 6.0813, "mean_token_accuracy": 0.1436959832906723, "num_tokens": 16063191.0, "step": 8205 }, { "entropy": 6.24939923286438, "epoch": 0.820712750537312, "grad_norm": 1.28125, "learning_rate": 0.0004941416532772296, "loss": 6.0924, "mean_token_accuracy": 0.14684049487113954, "num_tokens": 16072482.0, "step": 8210 }, { "entropy": 6.187750387191772, "epoch": 0.8212125755985406, "grad_norm": 1.2265625, "learning_rate": 0.000494133559535673, "loss": 6.0859, "mean_token_accuracy": 0.15419772565364837, "num_tokens": 16082848.0, "step": 8215 }, { "entropy": 6.2827372550964355, "epoch": 0.821712400659769, "grad_norm": 1.3359375, "learning_rate": 0.0004941254602807724, "loss": 6.2319, "mean_token_accuracy": 0.14404311627149582, "num_tokens": 16091604.0, "step": 8220 }, { "entropy": 6.328517723083496, "epoch": 0.8222122257209976, "grad_norm": 1.2734375, "learning_rate": 0.0004941173555127315, "loss": 6.1026, "mean_token_accuracy": 0.14960498064756395, "num_tokens": 16101427.0, "step": 8225 }, { "entropy": 6.179753541946411, "epoch": 0.8227120507822262, "grad_norm": 1.2890625, "learning_rate": 0.0004941092452317546, "loss": 6.0761, "mean_token_accuracy": 0.14994554594159126, "num_tokens": 16112206.0, "step": 8230 }, { "entropy": 6.25575442314148, "epoch": 0.8232118758434548, "grad_norm": 1.3515625, "learning_rate": 0.0004941011294380452, "loss": 6.2041, "mean_token_accuracy": 0.1474871329963207, "num_tokens": 16122652.0, "step": 8235 }, { "entropy": 6.22660722732544, "epoch": 0.8237117009046834, "grad_norm": 1.1015625, "learning_rate": 0.0004940930081318079, "loss": 6.0749, "mean_token_accuracy": 0.15140161216259002, "num_tokens": 16132976.0, "step": 8240 }, { "entropy": 6.294421243667602, "epoch": 0.824211525965912, "grad_norm": 1.1328125, "learning_rate": 0.0004940848813132469, "loss": 6.1688, "mean_token_accuracy": 0.14806075468659402, "num_tokens": 16143514.0, "step": 8245 }, { "entropy": 6.3129771709442135, "epoch": 0.8247113510271405, "grad_norm": 1.3828125, "learning_rate": 0.0004940767489825666, "loss": 6.1556, "mean_token_accuracy": 0.1452951177954674, "num_tokens": 16154235.0, "step": 8250 }, { "entropy": 6.252210807800293, "epoch": 0.825211176088369, "grad_norm": 1.2265625, "learning_rate": 0.0004940686111399716, "loss": 6.0709, "mean_token_accuracy": 0.14720857962965966, "num_tokens": 16164251.0, "step": 8255 }, { "entropy": 6.163020896911621, "epoch": 0.8257110011495976, "grad_norm": 1.21875, "learning_rate": 0.0004940604677856669, "loss": 6.0098, "mean_token_accuracy": 0.159994275867939, "num_tokens": 16172780.0, "step": 8260 }, { "entropy": 6.068484830856323, "epoch": 0.8262108262108262, "grad_norm": 1.265625, "learning_rate": 0.000494052318919857, "loss": 5.9823, "mean_token_accuracy": 0.1593278169631958, "num_tokens": 16182443.0, "step": 8265 }, { "entropy": 6.1880988597869875, "epoch": 0.8267106512720548, "grad_norm": 1.1640625, "learning_rate": 0.0004940441645427473, "loss": 6.0799, "mean_token_accuracy": 0.15314688831567763, "num_tokens": 16192515.0, "step": 8270 }, { "entropy": 6.235993576049805, "epoch": 0.8272104763332834, "grad_norm": 1.2421875, "learning_rate": 0.0004940360046545427, "loss": 6.0788, "mean_token_accuracy": 0.15016637444496156, "num_tokens": 16201615.0, "step": 8275 }, { "entropy": 6.296337890625, "epoch": 0.827710301394512, "grad_norm": 1.3671875, "learning_rate": 0.0004940278392554486, "loss": 6.1186, "mean_token_accuracy": 0.14623932614922525, "num_tokens": 16210461.0, "step": 8280 }, { "entropy": 6.212397527694702, "epoch": 0.8282101264557404, "grad_norm": 1.2578125, "learning_rate": 0.0004940196683456704, "loss": 6.1081, "mean_token_accuracy": 0.14230554327368736, "num_tokens": 16220293.0, "step": 8285 }, { "entropy": 6.192126226425171, "epoch": 0.828709951516969, "grad_norm": 1.3671875, "learning_rate": 0.0004940114919254137, "loss": 6.0461, "mean_token_accuracy": 0.147898331284523, "num_tokens": 16230020.0, "step": 8290 }, { "entropy": 6.2220683097839355, "epoch": 0.8292097765781976, "grad_norm": 1.359375, "learning_rate": 0.0004940033099948843, "loss": 6.0787, "mean_token_accuracy": 0.14865076094865798, "num_tokens": 16240187.0, "step": 8295 }, { "entropy": 6.185304594039917, "epoch": 0.8297096016394262, "grad_norm": 1.203125, "learning_rate": 0.0004939951225542879, "loss": 6.0881, "mean_token_accuracy": 0.15052397847175597, "num_tokens": 16250200.0, "step": 8300 }, { "entropy": 6.2307592868804935, "epoch": 0.8302094267006548, "grad_norm": 1.2109375, "learning_rate": 0.0004939869296038306, "loss": 6.1659, "mean_token_accuracy": 0.14886408001184465, "num_tokens": 16259396.0, "step": 8305 }, { "entropy": 6.297973155975342, "epoch": 0.8307092517618834, "grad_norm": 1.21875, "learning_rate": 0.0004939787311437185, "loss": 6.1629, "mean_token_accuracy": 0.13925077468156816, "num_tokens": 16270033.0, "step": 8310 }, { "entropy": 6.341564130783081, "epoch": 0.831209076823112, "grad_norm": 1.1796875, "learning_rate": 0.0004939705271741579, "loss": 6.1293, "mean_token_accuracy": 0.14668145179748535, "num_tokens": 16281464.0, "step": 8315 }, { "entropy": 6.344202089309692, "epoch": 0.8317089018843404, "grad_norm": 1.1796875, "learning_rate": 0.0004939623176953551, "loss": 6.1944, "mean_token_accuracy": 0.13954090774059297, "num_tokens": 16292125.0, "step": 8320 }, { "entropy": 6.198182868957519, "epoch": 0.832208726945569, "grad_norm": 1.5078125, "learning_rate": 0.0004939541027075168, "loss": 6.1069, "mean_token_accuracy": 0.1497854433953762, "num_tokens": 16302993.0, "step": 8325 }, { "entropy": 6.202881574630737, "epoch": 0.8327085520067976, "grad_norm": 1.2890625, "learning_rate": 0.0004939458822108496, "loss": 6.0897, "mean_token_accuracy": 0.1481951244175434, "num_tokens": 16311287.0, "step": 8330 }, { "entropy": 6.295244646072388, "epoch": 0.8332083770680262, "grad_norm": 1.1796875, "learning_rate": 0.0004939376562055602, "loss": 6.0758, "mean_token_accuracy": 0.14660119265317917, "num_tokens": 16320701.0, "step": 8335 }, { "entropy": 6.223574304580689, "epoch": 0.8337082021292548, "grad_norm": 1.375, "learning_rate": 0.0004939294246918558, "loss": 6.1108, "mean_token_accuracy": 0.1493000753223896, "num_tokens": 16329834.0, "step": 8340 }, { "entropy": 6.205131244659424, "epoch": 0.8342080271904834, "grad_norm": 1.2890625, "learning_rate": 0.0004939211876699435, "loss": 6.1, "mean_token_accuracy": 0.14822338297963142, "num_tokens": 16339043.0, "step": 8345 }, { "entropy": 6.293129634857178, "epoch": 0.8347078522517118, "grad_norm": 1.234375, "learning_rate": 0.0004939129451400305, "loss": 6.2134, "mean_token_accuracy": 0.14606078416109086, "num_tokens": 16348774.0, "step": 8350 }, { "entropy": 6.264648580551148, "epoch": 0.8352076773129404, "grad_norm": 1.3671875, "learning_rate": 0.000493904697102324, "loss": 6.077, "mean_token_accuracy": 0.1439671091735363, "num_tokens": 16357999.0, "step": 8355 }, { "entropy": 6.26352367401123, "epoch": 0.835707502374169, "grad_norm": 1.5625, "learning_rate": 0.0004938964435570317, "loss": 6.1451, "mean_token_accuracy": 0.14471773505210878, "num_tokens": 16369308.0, "step": 8360 }, { "entropy": 6.158105087280274, "epoch": 0.8362073274353976, "grad_norm": 1.203125, "learning_rate": 0.0004938881845043612, "loss": 6.04, "mean_token_accuracy": 0.1513890579342842, "num_tokens": 16378001.0, "step": 8365 }, { "entropy": 6.3232310771942135, "epoch": 0.8367071524966262, "grad_norm": 1.359375, "learning_rate": 0.0004938799199445202, "loss": 6.2509, "mean_token_accuracy": 0.14490632116794586, "num_tokens": 16387925.0, "step": 8370 }, { "entropy": 6.367937898635864, "epoch": 0.8372069775578548, "grad_norm": 1.203125, "learning_rate": 0.0004938716498777169, "loss": 6.1947, "mean_token_accuracy": 0.140191800147295, "num_tokens": 16398200.0, "step": 8375 }, { "entropy": 6.116406965255737, "epoch": 0.8377068026190834, "grad_norm": 1.21875, "learning_rate": 0.0004938633743041592, "loss": 5.9616, "mean_token_accuracy": 0.15980350077152253, "num_tokens": 16407874.0, "step": 8380 }, { "entropy": 6.201684188842774, "epoch": 0.8382066276803118, "grad_norm": 1.2109375, "learning_rate": 0.0004938550932240552, "loss": 6.0939, "mean_token_accuracy": 0.14970097839832305, "num_tokens": 16417825.0, "step": 8385 }, { "entropy": 6.239827442169189, "epoch": 0.8387064527415404, "grad_norm": 1.265625, "learning_rate": 0.0004938468066376134, "loss": 6.0868, "mean_token_accuracy": 0.1496803194284439, "num_tokens": 16427265.0, "step": 8390 }, { "entropy": 6.133868980407715, "epoch": 0.839206277802769, "grad_norm": 1.2734375, "learning_rate": 0.0004938385145450423, "loss": 6.021, "mean_token_accuracy": 0.15879987925291061, "num_tokens": 16436639.0, "step": 8395 }, { "entropy": 6.248953580856323, "epoch": 0.8397061028639976, "grad_norm": 1.390625, "learning_rate": 0.0004938302169465505, "loss": 6.1244, "mean_token_accuracy": 0.1505824476480484, "num_tokens": 16446411.0, "step": 8400 }, { "entropy": 6.289775371551514, "epoch": 0.8402059279252262, "grad_norm": 1.1953125, "learning_rate": 0.0004938219138423467, "loss": 6.1518, "mean_token_accuracy": 0.1493359997868538, "num_tokens": 16455784.0, "step": 8405 }, { "entropy": 6.1737555980682375, "epoch": 0.8407057529864548, "grad_norm": 1.21875, "learning_rate": 0.0004938136052326399, "loss": 5.9757, "mean_token_accuracy": 0.157905213534832, "num_tokens": 16464411.0, "step": 8410 }, { "entropy": 6.200588655471802, "epoch": 0.8412055780476833, "grad_norm": 1.2421875, "learning_rate": 0.0004938052911176392, "loss": 6.1569, "mean_token_accuracy": 0.14453719928860664, "num_tokens": 16473299.0, "step": 8415 }, { "entropy": 6.119726753234863, "epoch": 0.8417054031089118, "grad_norm": 1.28125, "learning_rate": 0.0004937969714975534, "loss": 5.9807, "mean_token_accuracy": 0.15740735679864884, "num_tokens": 16483040.0, "step": 8420 }, { "entropy": 6.188728380203247, "epoch": 0.8422052281701404, "grad_norm": 1.34375, "learning_rate": 0.0004937886463725923, "loss": 6.0587, "mean_token_accuracy": 0.15332949608564378, "num_tokens": 16492608.0, "step": 8425 }, { "entropy": 6.333893489837647, "epoch": 0.842705053231369, "grad_norm": 1.5078125, "learning_rate": 0.0004937803157429651, "loss": 6.2059, "mean_token_accuracy": 0.1431631065905094, "num_tokens": 16503139.0, "step": 8430 }, { "entropy": 6.225705146789551, "epoch": 0.8432048782925976, "grad_norm": 1.3359375, "learning_rate": 0.0004937719796088815, "loss": 6.0737, "mean_token_accuracy": 0.15347908735275267, "num_tokens": 16511584.0, "step": 8435 }, { "entropy": 6.15557370185852, "epoch": 0.8437047033538262, "grad_norm": 1.5546875, "learning_rate": 0.0004937636379705511, "loss": 6.0643, "mean_token_accuracy": 0.14917184859514238, "num_tokens": 16522407.0, "step": 8440 }, { "entropy": 6.127405500411987, "epoch": 0.8442045284150548, "grad_norm": 1.25, "learning_rate": 0.0004937552908281839, "loss": 6.0979, "mean_token_accuracy": 0.1465989112854004, "num_tokens": 16532351.0, "step": 8445 }, { "entropy": 6.334324598312378, "epoch": 0.8447043534762833, "grad_norm": 1.2578125, "learning_rate": 0.0004937469381819899, "loss": 6.1664, "mean_token_accuracy": 0.14261157140135766, "num_tokens": 16541673.0, "step": 8450 }, { "entropy": 6.2667001247406, "epoch": 0.8452041785375118, "grad_norm": 1.3046875, "learning_rate": 0.0004937385800321792, "loss": 6.1407, "mean_token_accuracy": 0.1521382987499237, "num_tokens": 16551622.0, "step": 8455 }, { "entropy": 6.210046052932739, "epoch": 0.8457040035987404, "grad_norm": 1.28125, "learning_rate": 0.0004937302163789621, "loss": 6.0865, "mean_token_accuracy": 0.15102536603808403, "num_tokens": 16559074.0, "step": 8460 }, { "entropy": 6.162340068817139, "epoch": 0.846203828659969, "grad_norm": 1.234375, "learning_rate": 0.0004937218472225491, "loss": 6.0602, "mean_token_accuracy": 0.15858377367258072, "num_tokens": 16568650.0, "step": 8465 }, { "entropy": 6.214577579498291, "epoch": 0.8467036537211976, "grad_norm": 1.3984375, "learning_rate": 0.0004937134725631506, "loss": 6.1061, "mean_token_accuracy": 0.15394459217786788, "num_tokens": 16578696.0, "step": 8470 }, { "entropy": 6.282371950149536, "epoch": 0.8472034787824262, "grad_norm": 1.2109375, "learning_rate": 0.0004937050924009775, "loss": 6.1594, "mean_token_accuracy": 0.1439043678343296, "num_tokens": 16589014.0, "step": 8475 }, { "entropy": 6.218377876281738, "epoch": 0.8477033038436548, "grad_norm": 1.2265625, "learning_rate": 0.0004936967067362406, "loss": 6.0361, "mean_token_accuracy": 0.15218364596366882, "num_tokens": 16598319.0, "step": 8480 }, { "entropy": 6.223678922653198, "epoch": 0.8482031289048833, "grad_norm": 1.2421875, "learning_rate": 0.0004936883155691507, "loss": 6.1755, "mean_token_accuracy": 0.14707616940140725, "num_tokens": 16607941.0, "step": 8485 }, { "entropy": 6.23028335571289, "epoch": 0.8487029539661118, "grad_norm": 1.4140625, "learning_rate": 0.0004936799188999192, "loss": 6.118, "mean_token_accuracy": 0.15177458226680757, "num_tokens": 16618398.0, "step": 8490 }, { "entropy": 6.320610618591308, "epoch": 0.8492027790273404, "grad_norm": 1.2578125, "learning_rate": 0.0004936715167287571, "loss": 6.144, "mean_token_accuracy": 0.14272797778248786, "num_tokens": 16628953.0, "step": 8495 }, { "entropy": 6.243732357025147, "epoch": 0.849702604088569, "grad_norm": 1.4140625, "learning_rate": 0.000493663109055876, "loss": 6.0653, "mean_token_accuracy": 0.15223424583673478, "num_tokens": 16638783.0, "step": 8500 }, { "entropy": 6.22808690071106, "epoch": 0.8502024291497976, "grad_norm": 1.25, "learning_rate": 0.0004936546958814873, "loss": 6.1197, "mean_token_accuracy": 0.15219603180885316, "num_tokens": 16647432.0, "step": 8505 }, { "entropy": 6.292452144622803, "epoch": 0.8507022542110262, "grad_norm": 1.3984375, "learning_rate": 0.0004936462772058026, "loss": 6.105, "mean_token_accuracy": 0.14516105651855468, "num_tokens": 16656839.0, "step": 8510 }, { "entropy": 6.264522695541382, "epoch": 0.8512020792722547, "grad_norm": 1.671875, "learning_rate": 0.0004936378530290339, "loss": 6.1858, "mean_token_accuracy": 0.14216080233454703, "num_tokens": 16667054.0, "step": 8515 }, { "entropy": 6.235785388946534, "epoch": 0.8517019043334833, "grad_norm": 1.3671875, "learning_rate": 0.0004936294233513931, "loss": 6.1115, "mean_token_accuracy": 0.1501529909670353, "num_tokens": 16676851.0, "step": 8520 }, { "entropy": 6.284620141983032, "epoch": 0.8522017293947118, "grad_norm": 1.375, "learning_rate": 0.0004936209881730922, "loss": 6.1148, "mean_token_accuracy": 0.14707250893115997, "num_tokens": 16686433.0, "step": 8525 }, { "entropy": 6.2035236835479735, "epoch": 0.8527015544559404, "grad_norm": 1.1953125, "learning_rate": 0.0004936125474943436, "loss": 6.0922, "mean_token_accuracy": 0.15978797525167465, "num_tokens": 16695859.0, "step": 8530 }, { "entropy": 6.230979251861572, "epoch": 0.853201379517169, "grad_norm": 1.34375, "learning_rate": 0.0004936041013153596, "loss": 6.1076, "mean_token_accuracy": 0.15107351392507554, "num_tokens": 16704391.0, "step": 8535 }, { "entropy": 6.24996976852417, "epoch": 0.8537012045783976, "grad_norm": 1.546875, "learning_rate": 0.0004935956496363525, "loss": 6.1888, "mean_token_accuracy": 0.1405817985534668, "num_tokens": 16715316.0, "step": 8540 }, { "entropy": 6.40833158493042, "epoch": 0.8542010296396262, "grad_norm": 1.2265625, "learning_rate": 0.0004935871924575352, "loss": 6.2714, "mean_token_accuracy": 0.13728706762194634, "num_tokens": 16726215.0, "step": 8545 }, { "entropy": 6.266237020492554, "epoch": 0.8547008547008547, "grad_norm": 1.2109375, "learning_rate": 0.0004935787297791204, "loss": 6.1056, "mean_token_accuracy": 0.14677743539214133, "num_tokens": 16735768.0, "step": 8550 }, { "entropy": 6.179116868972779, "epoch": 0.8552006797620832, "grad_norm": 1.2890625, "learning_rate": 0.0004935702616013209, "loss": 5.9155, "mean_token_accuracy": 0.16017419695854188, "num_tokens": 16744265.0, "step": 8555 }, { "entropy": 6.1934630393981935, "epoch": 0.8557005048233118, "grad_norm": 1.296875, "learning_rate": 0.00049356178792435, "loss": 6.166, "mean_token_accuracy": 0.15210893601179123, "num_tokens": 16753713.0, "step": 8560 }, { "entropy": 6.277865028381347, "epoch": 0.8562003298845404, "grad_norm": 1.2421875, "learning_rate": 0.0004935533087484207, "loss": 6.1129, "mean_token_accuracy": 0.14849793463945388, "num_tokens": 16763670.0, "step": 8565 }, { "entropy": 6.223178863525391, "epoch": 0.856700154945769, "grad_norm": 1.421875, "learning_rate": 0.0004935448240737464, "loss": 6.1255, "mean_token_accuracy": 0.14845992624759674, "num_tokens": 16773504.0, "step": 8570 }, { "entropy": 6.207229471206665, "epoch": 0.8571999800069976, "grad_norm": 1.34375, "learning_rate": 0.0004935363339005405, "loss": 6.1653, "mean_token_accuracy": 0.14824780002236365, "num_tokens": 16784181.0, "step": 8575 }, { "entropy": 6.280117988586426, "epoch": 0.8576998050682261, "grad_norm": 1.40625, "learning_rate": 0.0004935278382290168, "loss": 6.1476, "mean_token_accuracy": 0.14702174365520476, "num_tokens": 16793610.0, "step": 8580 }, { "entropy": 6.2846839904785154, "epoch": 0.8581996301294547, "grad_norm": 1.2109375, "learning_rate": 0.0004935193370593887, "loss": 6.1907, "mean_token_accuracy": 0.1370268478989601, "num_tokens": 16804068.0, "step": 8585 }, { "entropy": 6.231192111968994, "epoch": 0.8586994551906832, "grad_norm": 1.2890625, "learning_rate": 0.0004935108303918705, "loss": 6.1363, "mean_token_accuracy": 0.15340641140937805, "num_tokens": 16813769.0, "step": 8590 }, { "entropy": 6.209807109832764, "epoch": 0.8591992802519118, "grad_norm": 1.1171875, "learning_rate": 0.0004935023182266761, "loss": 6.0599, "mean_token_accuracy": 0.15377306640148164, "num_tokens": 16822859.0, "step": 8595 }, { "entropy": 6.3580468654632565, "epoch": 0.8596991053131404, "grad_norm": 2.046875, "learning_rate": 0.0004934938005640194, "loss": 6.2806, "mean_token_accuracy": 0.1398426979780197, "num_tokens": 16834839.0, "step": 8600 }, { "entropy": 6.372250032424927, "epoch": 0.860198930374369, "grad_norm": 1.34375, "learning_rate": 0.000493485277404115, "loss": 6.1219, "mean_token_accuracy": 0.1425008900463581, "num_tokens": 16845205.0, "step": 8605 }, { "entropy": 6.294728994369507, "epoch": 0.8606987554355976, "grad_norm": 1.2421875, "learning_rate": 0.0004934767487471772, "loss": 6.1049, "mean_token_accuracy": 0.14174228757619858, "num_tokens": 16854874.0, "step": 8610 }, { "entropy": 6.1609419822692875, "epoch": 0.8611985804968261, "grad_norm": 2.203125, "learning_rate": 0.0004934682145934207, "loss": 6.0113, "mean_token_accuracy": 0.15708543360233307, "num_tokens": 16864771.0, "step": 8615 }, { "entropy": 6.171891212463379, "epoch": 0.8616984055580547, "grad_norm": 1.3046875, "learning_rate": 0.00049345967494306, "loss": 6.0949, "mean_token_accuracy": 0.14856914430856705, "num_tokens": 16874227.0, "step": 8620 }, { "entropy": 6.167325353622436, "epoch": 0.8621982306192832, "grad_norm": 1.2265625, "learning_rate": 0.0004934511297963102, "loss": 6.0322, "mean_token_accuracy": 0.158851907402277, "num_tokens": 16883895.0, "step": 8625 }, { "entropy": 6.261799955368042, "epoch": 0.8626980556805118, "grad_norm": 1.2109375, "learning_rate": 0.0004934425791533861, "loss": 6.0544, "mean_token_accuracy": 0.1530415877699852, "num_tokens": 16893012.0, "step": 8630 }, { "entropy": 6.246605920791626, "epoch": 0.8631978807417404, "grad_norm": 1.4921875, "learning_rate": 0.0004934340230145031, "loss": 6.1349, "mean_token_accuracy": 0.15347109436988832, "num_tokens": 16903831.0, "step": 8635 }, { "entropy": 6.277946043014526, "epoch": 0.863697705802969, "grad_norm": 1.140625, "learning_rate": 0.0004934254613798761, "loss": 6.1795, "mean_token_accuracy": 0.13722404167056085, "num_tokens": 16913649.0, "step": 8640 }, { "entropy": 6.184159898757935, "epoch": 0.8641975308641975, "grad_norm": 1.515625, "learning_rate": 0.0004934168942497207, "loss": 6.0781, "mean_token_accuracy": 0.15299730226397515, "num_tokens": 16923063.0, "step": 8645 }, { "entropy": 6.291852617263794, "epoch": 0.8646973559254261, "grad_norm": 1.2109375, "learning_rate": 0.0004934083216242526, "loss": 6.0788, "mean_token_accuracy": 0.15082671046257018, "num_tokens": 16932901.0, "step": 8650 }, { "entropy": 6.288068199157715, "epoch": 0.8651971809866547, "grad_norm": 1.21875, "learning_rate": 0.0004933997435036873, "loss": 6.2039, "mean_token_accuracy": 0.14317680895328522, "num_tokens": 16942781.0, "step": 8655 }, { "entropy": 6.2505628108978275, "epoch": 0.8656970060478832, "grad_norm": 1.5546875, "learning_rate": 0.0004933911598882405, "loss": 6.0934, "mean_token_accuracy": 0.14813961684703827, "num_tokens": 16952064.0, "step": 8660 }, { "entropy": 6.16200885772705, "epoch": 0.8661968311091118, "grad_norm": 1.4140625, "learning_rate": 0.0004933825707781284, "loss": 6.0284, "mean_token_accuracy": 0.1516401693224907, "num_tokens": 16961528.0, "step": 8665 }, { "entropy": 6.233776664733886, "epoch": 0.8666966561703404, "grad_norm": 1.2890625, "learning_rate": 0.0004933739761735671, "loss": 6.1239, "mean_token_accuracy": 0.14984436184167862, "num_tokens": 16971066.0, "step": 8670 }, { "entropy": 6.2612748622894285, "epoch": 0.867196481231569, "grad_norm": 1.15625, "learning_rate": 0.0004933653760747726, "loss": 6.1497, "mean_token_accuracy": 0.14837488532066345, "num_tokens": 16981438.0, "step": 8675 }, { "entropy": 6.221832323074341, "epoch": 0.8676963062927975, "grad_norm": 1.28125, "learning_rate": 0.0004933567704819615, "loss": 6.0462, "mean_token_accuracy": 0.1588964506983757, "num_tokens": 16990836.0, "step": 8680 }, { "entropy": 6.193079948425293, "epoch": 0.8681961313540261, "grad_norm": 1.25, "learning_rate": 0.0004933481593953502, "loss": 6.0265, "mean_token_accuracy": 0.15681727975606918, "num_tokens": 17000254.0, "step": 8685 }, { "entropy": 6.216556119918823, "epoch": 0.8686959564152547, "grad_norm": 1.25, "learning_rate": 0.0004933395428151554, "loss": 6.0872, "mean_token_accuracy": 0.15317708849906922, "num_tokens": 17010081.0, "step": 8690 }, { "entropy": 6.17724757194519, "epoch": 0.8691957814764832, "grad_norm": 1.3984375, "learning_rate": 0.000493330920741594, "loss": 5.9406, "mean_token_accuracy": 0.1592693328857422, "num_tokens": 17018967.0, "step": 8695 }, { "entropy": 6.209882164001465, "epoch": 0.8696956065377118, "grad_norm": 1.2421875, "learning_rate": 0.0004933222931748827, "loss": 6.0998, "mean_token_accuracy": 0.14961342960596086, "num_tokens": 17027615.0, "step": 8700 }, { "entropy": 6.2211010456085205, "epoch": 0.8701954315989404, "grad_norm": 1.1875, "learning_rate": 0.0004933136601152387, "loss": 6.0741, "mean_token_accuracy": 0.15184015780687332, "num_tokens": 17038446.0, "step": 8705 }, { "entropy": 6.232716035842896, "epoch": 0.8706952566601689, "grad_norm": 1.265625, "learning_rate": 0.0004933050215628793, "loss": 6.1064, "mean_token_accuracy": 0.14452996253967285, "num_tokens": 17047787.0, "step": 8710 }, { "entropy": 6.216891050338745, "epoch": 0.8711950817213975, "grad_norm": 1.2734375, "learning_rate": 0.0004932963775180216, "loss": 6.1253, "mean_token_accuracy": 0.1500982813537121, "num_tokens": 17056842.0, "step": 8715 }, { "entropy": 6.197678565979004, "epoch": 0.8716949067826261, "grad_norm": 1.1484375, "learning_rate": 0.0004932877279808833, "loss": 6.1492, "mean_token_accuracy": 0.14616958051919937, "num_tokens": 17066217.0, "step": 8720 }, { "entropy": 6.339457702636719, "epoch": 0.8721947318438547, "grad_norm": 1.28125, "learning_rate": 0.0004932790729516818, "loss": 6.2127, "mean_token_accuracy": 0.14135319069027902, "num_tokens": 17077760.0, "step": 8725 }, { "entropy": 6.198708438873291, "epoch": 0.8726945569050832, "grad_norm": 1.71875, "learning_rate": 0.0004932704124306352, "loss": 6.0579, "mean_token_accuracy": 0.15177614539861678, "num_tokens": 17088251.0, "step": 8730 }, { "entropy": 6.2632228374481205, "epoch": 0.8731943819663118, "grad_norm": 1.3125, "learning_rate": 0.000493261746417961, "loss": 6.1029, "mean_token_accuracy": 0.14797398522496225, "num_tokens": 17098192.0, "step": 8735 }, { "entropy": 6.260759878158569, "epoch": 0.8736942070275404, "grad_norm": 1.2109375, "learning_rate": 0.0004932530749138775, "loss": 6.0776, "mean_token_accuracy": 0.1498183324933052, "num_tokens": 17107787.0, "step": 8740 }, { "entropy": 6.276432180404663, "epoch": 0.8741940320887689, "grad_norm": 1.2734375, "learning_rate": 0.0004932443979186028, "loss": 6.1783, "mean_token_accuracy": 0.15007296204566956, "num_tokens": 17118125.0, "step": 8745 }, { "entropy": 6.238847732543945, "epoch": 0.8746938571499975, "grad_norm": 1.2109375, "learning_rate": 0.0004932357154323552, "loss": 6.0485, "mean_token_accuracy": 0.1506869301199913, "num_tokens": 17127909.0, "step": 8750 }, { "entropy": 6.200756597518921, "epoch": 0.8751936822112261, "grad_norm": 1.4140625, "learning_rate": 0.0004932270274553531, "loss": 6.1126, "mean_token_accuracy": 0.14798829555511475, "num_tokens": 17137672.0, "step": 8755 }, { "entropy": 6.210784196853638, "epoch": 0.8756935072724547, "grad_norm": 1.265625, "learning_rate": 0.0004932183339878153, "loss": 6.0811, "mean_token_accuracy": 0.14794449508190155, "num_tokens": 17147151.0, "step": 8760 }, { "entropy": 6.215718841552734, "epoch": 0.8761933323336832, "grad_norm": 1.3125, "learning_rate": 0.0004932096350299602, "loss": 5.9748, "mean_token_accuracy": 0.15497036427259445, "num_tokens": 17156615.0, "step": 8765 }, { "entropy": 6.220007085800171, "epoch": 0.8766931573949118, "grad_norm": 1.1875, "learning_rate": 0.0004932009305820069, "loss": 6.1053, "mean_token_accuracy": 0.15130169838666915, "num_tokens": 17166089.0, "step": 8770 }, { "entropy": 6.2222010612487795, "epoch": 0.8771929824561403, "grad_norm": 1.15625, "learning_rate": 0.0004931922206441743, "loss": 6.1141, "mean_token_accuracy": 0.14922061413526536, "num_tokens": 17176565.0, "step": 8775 }, { "entropy": 6.1548075675964355, "epoch": 0.8776928075173689, "grad_norm": 1.265625, "learning_rate": 0.0004931835052166817, "loss": 6.0594, "mean_token_accuracy": 0.15178312957286835, "num_tokens": 17186987.0, "step": 8780 }, { "entropy": 6.180013036727905, "epoch": 0.8781926325785975, "grad_norm": 1.1796875, "learning_rate": 0.0004931747842997481, "loss": 6.052, "mean_token_accuracy": 0.1553016185760498, "num_tokens": 17196325.0, "step": 8785 }, { "entropy": 6.302029800415039, "epoch": 0.8786924576398261, "grad_norm": 1.234375, "learning_rate": 0.0004931660578935931, "loss": 6.1119, "mean_token_accuracy": 0.14662524461746215, "num_tokens": 17206210.0, "step": 8790 }, { "entropy": 6.223845148086548, "epoch": 0.8791922827010547, "grad_norm": 1.21875, "learning_rate": 0.0004931573259984363, "loss": 6.0513, "mean_token_accuracy": 0.15506964772939683, "num_tokens": 17216521.0, "step": 8795 }, { "entropy": 6.117723274230957, "epoch": 0.8796921077622832, "grad_norm": 1.21875, "learning_rate": 0.0004931485886144972, "loss": 6.0691, "mean_token_accuracy": 0.15074310451745987, "num_tokens": 17225125.0, "step": 8800 }, { "entropy": 6.193218088150024, "epoch": 0.8801919328235118, "grad_norm": 1.140625, "learning_rate": 0.0004931398457419959, "loss": 6.0878, "mean_token_accuracy": 0.14968049824237822, "num_tokens": 17234674.0, "step": 8805 }, { "entropy": 6.212806129455567, "epoch": 0.8806917578847403, "grad_norm": 1.2265625, "learning_rate": 0.0004931310973811521, "loss": 6.0378, "mean_token_accuracy": 0.1504512310028076, "num_tokens": 17244362.0, "step": 8810 }, { "entropy": 6.22478346824646, "epoch": 0.8811915829459689, "grad_norm": 1.296875, "learning_rate": 0.000493122343532186, "loss": 6.0024, "mean_token_accuracy": 0.15428674295544625, "num_tokens": 17253541.0, "step": 8815 }, { "entropy": 6.1872923374176025, "epoch": 0.8816914080071975, "grad_norm": 1.1328125, "learning_rate": 0.000493113584195318, "loss": 6.0318, "mean_token_accuracy": 0.15427838265895844, "num_tokens": 17263214.0, "step": 8820 }, { "entropy": 6.200919437408447, "epoch": 0.8821912330684261, "grad_norm": 1.0546875, "learning_rate": 0.0004931048193707681, "loss": 6.1164, "mean_token_accuracy": 0.14537843316793442, "num_tokens": 17273991.0, "step": 8825 }, { "entropy": 6.140426397323608, "epoch": 0.8826910581296546, "grad_norm": 1.2265625, "learning_rate": 0.0004930960490587573, "loss": 5.9532, "mean_token_accuracy": 0.15931536257266998, "num_tokens": 17283221.0, "step": 8830 }, { "entropy": 6.155590343475342, "epoch": 0.8831908831908832, "grad_norm": 1.1875, "learning_rate": 0.000493087273259506, "loss": 6.0832, "mean_token_accuracy": 0.15291211307048796, "num_tokens": 17293520.0, "step": 8835 }, { "entropy": 6.182627534866333, "epoch": 0.8836907082521117, "grad_norm": 1.1875, "learning_rate": 0.0004930784919732349, "loss": 6.093, "mean_token_accuracy": 0.15025223344564437, "num_tokens": 17303881.0, "step": 8840 }, { "entropy": 6.1930054187774655, "epoch": 0.8841905333133403, "grad_norm": 1.234375, "learning_rate": 0.0004930697052001651, "loss": 5.9742, "mean_token_accuracy": 0.16299348175525666, "num_tokens": 17314115.0, "step": 8845 }, { "entropy": 6.261048126220703, "epoch": 0.8846903583745689, "grad_norm": 1.328125, "learning_rate": 0.0004930609129405177, "loss": 6.1412, "mean_token_accuracy": 0.14706263393163682, "num_tokens": 17324517.0, "step": 8850 }, { "entropy": 6.235148668289185, "epoch": 0.8851901834357975, "grad_norm": 1.296875, "learning_rate": 0.0004930521151945138, "loss": 6.1136, "mean_token_accuracy": 0.1499358169734478, "num_tokens": 17334109.0, "step": 8855 }, { "entropy": 6.197334241867066, "epoch": 0.8856900084970261, "grad_norm": 1.2265625, "learning_rate": 0.0004930433119623749, "loss": 6.1104, "mean_token_accuracy": 0.14843170195817948, "num_tokens": 17344602.0, "step": 8860 }, { "entropy": 6.209990310668945, "epoch": 0.8861898335582546, "grad_norm": 1.234375, "learning_rate": 0.0004930345032443221, "loss": 6.0373, "mean_token_accuracy": 0.16051452308893205, "num_tokens": 17354476.0, "step": 8865 }, { "entropy": 6.213006114959716, "epoch": 0.8866896586194832, "grad_norm": 1.3359375, "learning_rate": 0.0004930256890405777, "loss": 6.0252, "mean_token_accuracy": 0.15292552709579468, "num_tokens": 17364748.0, "step": 8870 }, { "entropy": 6.180851888656616, "epoch": 0.8871894836807117, "grad_norm": 1.2734375, "learning_rate": 0.0004930168693513627, "loss": 6.0648, "mean_token_accuracy": 0.15097014904022216, "num_tokens": 17374162.0, "step": 8875 }, { "entropy": 6.188289833068848, "epoch": 0.8876893087419403, "grad_norm": 1.25, "learning_rate": 0.0004930080441768995, "loss": 6.1156, "mean_token_accuracy": 0.1504686877131462, "num_tokens": 17384042.0, "step": 8880 }, { "entropy": 6.197012996673584, "epoch": 0.8881891338031689, "grad_norm": 1.203125, "learning_rate": 0.00049299921351741, "loss": 6.0069, "mean_token_accuracy": 0.1541579082608223, "num_tokens": 17394181.0, "step": 8885 }, { "entropy": 6.24964747428894, "epoch": 0.8886889588643975, "grad_norm": 1.34375, "learning_rate": 0.0004929903773731164, "loss": 6.1932, "mean_token_accuracy": 0.13834179937839508, "num_tokens": 17402983.0, "step": 8890 }, { "entropy": 6.341733169555664, "epoch": 0.8891887839256261, "grad_norm": 1.359375, "learning_rate": 0.0004929815357442409, "loss": 6.2401, "mean_token_accuracy": 0.1434593215584755, "num_tokens": 17413442.0, "step": 8895 }, { "entropy": 6.276982593536377, "epoch": 0.8896886089868546, "grad_norm": 1.171875, "learning_rate": 0.0004929726886310062, "loss": 6.0578, "mean_token_accuracy": 0.1483489379286766, "num_tokens": 17423644.0, "step": 8900 }, { "entropy": 6.243321275711059, "epoch": 0.8901884340480831, "grad_norm": 1.546875, "learning_rate": 0.0004929638360336348, "loss": 6.1098, "mean_token_accuracy": 0.1475658483803272, "num_tokens": 17433400.0, "step": 8905 }, { "entropy": 6.223323965072632, "epoch": 0.8906882591093117, "grad_norm": 1.3515625, "learning_rate": 0.0004929549779523492, "loss": 6.0763, "mean_token_accuracy": 0.1483346626162529, "num_tokens": 17443146.0, "step": 8910 }, { "entropy": 6.1547651290893555, "epoch": 0.8911880841705403, "grad_norm": 1.265625, "learning_rate": 0.0004929461143873725, "loss": 5.9661, "mean_token_accuracy": 0.16434328854084015, "num_tokens": 17452880.0, "step": 8915 }, { "entropy": 6.137537097930908, "epoch": 0.8916879092317689, "grad_norm": 1.15625, "learning_rate": 0.0004929372453389277, "loss": 5.9857, "mean_token_accuracy": 0.15564365088939666, "num_tokens": 17461633.0, "step": 8920 }, { "entropy": 6.253197717666626, "epoch": 0.8921877342929975, "grad_norm": 1.2578125, "learning_rate": 0.0004929283708072378, "loss": 6.1826, "mean_token_accuracy": 0.14608959779143332, "num_tokens": 17470892.0, "step": 8925 }, { "entropy": 6.243263912200928, "epoch": 0.8926875593542261, "grad_norm": 1.28125, "learning_rate": 0.0004929194907925262, "loss": 6.0846, "mean_token_accuracy": 0.14708081781864166, "num_tokens": 17481457.0, "step": 8930 }, { "entropy": 6.229396486282349, "epoch": 0.8931873844154546, "grad_norm": 1.359375, "learning_rate": 0.0004929106052950163, "loss": 6.109, "mean_token_accuracy": 0.14611636251211166, "num_tokens": 17490387.0, "step": 8935 }, { "entropy": 6.274730634689331, "epoch": 0.8936872094766831, "grad_norm": 1.265625, "learning_rate": 0.0004929017143149317, "loss": 6.0762, "mean_token_accuracy": 0.15361128598451615, "num_tokens": 17499478.0, "step": 8940 }, { "entropy": 6.280763816833496, "epoch": 0.8941870345379117, "grad_norm": 1.46875, "learning_rate": 0.000492892817852496, "loss": 6.1843, "mean_token_accuracy": 0.142434324324131, "num_tokens": 17509396.0, "step": 8945 }, { "entropy": 6.163690662384033, "epoch": 0.8946868595991403, "grad_norm": 1.25, "learning_rate": 0.000492883915907933, "loss": 6.1008, "mean_token_accuracy": 0.15106959640979767, "num_tokens": 17519773.0, "step": 8950 }, { "entropy": 6.234408617019653, "epoch": 0.8951866846603689, "grad_norm": 1.1640625, "learning_rate": 0.0004928750084814668, "loss": 6.0931, "mean_token_accuracy": 0.15659594982862474, "num_tokens": 17529873.0, "step": 8955 }, { "entropy": 6.192315006256104, "epoch": 0.8956865097215975, "grad_norm": 1.1796875, "learning_rate": 0.0004928660955733214, "loss": 6.0061, "mean_token_accuracy": 0.15732004940509797, "num_tokens": 17538642.0, "step": 8960 }, { "entropy": 6.217100954055786, "epoch": 0.896186334782826, "grad_norm": 1.359375, "learning_rate": 0.0004928571771837211, "loss": 6.0537, "mean_token_accuracy": 0.14765094220638275, "num_tokens": 17546892.0, "step": 8965 }, { "entropy": 6.2676269054412845, "epoch": 0.8966861598440545, "grad_norm": 1.1484375, "learning_rate": 0.0004928482533128902, "loss": 6.1065, "mean_token_accuracy": 0.14703651741147042, "num_tokens": 17556283.0, "step": 8970 }, { "entropy": 6.176572465896607, "epoch": 0.8971859849052831, "grad_norm": 1.25, "learning_rate": 0.0004928393239610535, "loss": 6.0372, "mean_token_accuracy": 0.14964791908860206, "num_tokens": 17567021.0, "step": 8975 }, { "entropy": 6.225878524780273, "epoch": 0.8976858099665117, "grad_norm": 1.2890625, "learning_rate": 0.0004928303891284354, "loss": 6.0566, "mean_token_accuracy": 0.15498910546302797, "num_tokens": 17575927.0, "step": 8980 }, { "entropy": 6.2229187965393065, "epoch": 0.8981856350277403, "grad_norm": 1.234375, "learning_rate": 0.0004928214488152607, "loss": 6.0856, "mean_token_accuracy": 0.1536189168691635, "num_tokens": 17585882.0, "step": 8985 }, { "entropy": 6.150031852722168, "epoch": 0.8986854600889689, "grad_norm": 1.125, "learning_rate": 0.0004928125030217545, "loss": 6.0444, "mean_token_accuracy": 0.15631795972585677, "num_tokens": 17595998.0, "step": 8990 }, { "entropy": 6.286819410324097, "epoch": 0.8991852851501975, "grad_norm": 1.2265625, "learning_rate": 0.0004928035517481416, "loss": 6.0581, "mean_token_accuracy": 0.1565806120634079, "num_tokens": 17605177.0, "step": 8995 }, { "entropy": 6.254734373092651, "epoch": 0.899685110211426, "grad_norm": 1.453125, "learning_rate": 0.0004927945949946476, "loss": 6.1879, "mean_token_accuracy": 0.14481331557035446, "num_tokens": 17615089.0, "step": 9000 }, { "epoch": 0.899685110211426, "eval_entropy": 6.0719523968017155, "eval_loss": 6.127414226531982, "eval_mean_token_accuracy": 0.15489319380333408, "eval_num_tokens": 17615089.0, "eval_runtime": 24.011, "eval_samples_per_second": 1292.948, "eval_steps_per_second": 161.634, "step": 9000 }, { "entropy": 6.231038665771484, "epoch": 0.9001849352726545, "grad_norm": 1.2578125, "learning_rate": 0.0004927856327614975, "loss": 6.0595, "mean_token_accuracy": 0.1500016190111637, "num_tokens": 17624708.0, "step": 9005 }, { "entropy": 6.23131914138794, "epoch": 0.9006847603338831, "grad_norm": 1.3046875, "learning_rate": 0.000492776665048917, "loss": 6.0795, "mean_token_accuracy": 0.15019645541906357, "num_tokens": 17633639.0, "step": 9010 }, { "entropy": 6.171057796478271, "epoch": 0.9011845853951117, "grad_norm": 1.2265625, "learning_rate": 0.0004927676918571316, "loss": 6.1127, "mean_token_accuracy": 0.14683156684041024, "num_tokens": 17643092.0, "step": 9015 }, { "entropy": 6.234998607635498, "epoch": 0.9016844104563403, "grad_norm": 1.265625, "learning_rate": 0.0004927587131863671, "loss": 6.1382, "mean_token_accuracy": 0.14209688752889632, "num_tokens": 17652698.0, "step": 9020 }, { "entropy": 6.1679009914398195, "epoch": 0.9021842355175689, "grad_norm": 1.375, "learning_rate": 0.0004927497290368493, "loss": 5.9917, "mean_token_accuracy": 0.1590147167444229, "num_tokens": 17662654.0, "step": 9025 }, { "entropy": 6.19018931388855, "epoch": 0.9026840605787975, "grad_norm": 1.109375, "learning_rate": 0.0004927407394088046, "loss": 6.0394, "mean_token_accuracy": 0.14583585262298585, "num_tokens": 17672476.0, "step": 9030 }, { "entropy": 6.191551446914673, "epoch": 0.9031838856400259, "grad_norm": 1.4453125, "learning_rate": 0.0004927317443024587, "loss": 6.1126, "mean_token_accuracy": 0.14732194617390632, "num_tokens": 17682612.0, "step": 9035 }, { "entropy": 6.295206022262573, "epoch": 0.9036837107012545, "grad_norm": 1.4453125, "learning_rate": 0.0004927227437180382, "loss": 6.1013, "mean_token_accuracy": 0.1427030920982361, "num_tokens": 17692020.0, "step": 9040 }, { "entropy": 6.220331048965454, "epoch": 0.9041835357624831, "grad_norm": 1.28125, "learning_rate": 0.0004927137376557696, "loss": 6.078, "mean_token_accuracy": 0.15332088023424148, "num_tokens": 17702677.0, "step": 9045 }, { "entropy": 6.129501914978027, "epoch": 0.9046833608237117, "grad_norm": 1.3125, "learning_rate": 0.0004927047261158793, "loss": 5.9393, "mean_token_accuracy": 0.16101567447185516, "num_tokens": 17711753.0, "step": 9050 }, { "entropy": 6.200072240829468, "epoch": 0.9051831858849403, "grad_norm": 1.2578125, "learning_rate": 0.0004926957090985942, "loss": 6.0728, "mean_token_accuracy": 0.1509827569127083, "num_tokens": 17721293.0, "step": 9055 }, { "entropy": 6.317616891860962, "epoch": 0.9056830109461689, "grad_norm": 1.3203125, "learning_rate": 0.0004926866866041409, "loss": 6.1385, "mean_token_accuracy": 0.14871339425444602, "num_tokens": 17732311.0, "step": 9060 }, { "entropy": 6.210763263702392, "epoch": 0.9061828360073975, "grad_norm": 1.1796875, "learning_rate": 0.0004926776586327467, "loss": 6.0481, "mean_token_accuracy": 0.15548539906740189, "num_tokens": 17743040.0, "step": 9065 }, { "entropy": 6.165962743759155, "epoch": 0.9066826610686259, "grad_norm": 1.4140625, "learning_rate": 0.0004926686251846386, "loss": 5.9899, "mean_token_accuracy": 0.1647803232073784, "num_tokens": 17752436.0, "step": 9070 }, { "entropy": 6.212686586380005, "epoch": 0.9071824861298545, "grad_norm": 1.2421875, "learning_rate": 0.0004926595862600439, "loss": 6.0518, "mean_token_accuracy": 0.14493615478277205, "num_tokens": 17762043.0, "step": 9075 }, { "entropy": 6.19841046333313, "epoch": 0.9076823111910831, "grad_norm": 1.21875, "learning_rate": 0.0004926505418591901, "loss": 6.0771, "mean_token_accuracy": 0.152317875623703, "num_tokens": 17772065.0, "step": 9080 }, { "entropy": 6.1374993324279785, "epoch": 0.9081821362523117, "grad_norm": 1.2421875, "learning_rate": 0.0004926414919823045, "loss": 5.9929, "mean_token_accuracy": 0.15644051134586334, "num_tokens": 17781472.0, "step": 9085 }, { "entropy": 6.230915832519531, "epoch": 0.9086819613135403, "grad_norm": 1.28125, "learning_rate": 0.0004926324366296151, "loss": 6.0721, "mean_token_accuracy": 0.15163581520318986, "num_tokens": 17789435.0, "step": 9090 }, { "entropy": 6.24999885559082, "epoch": 0.9091817863747689, "grad_norm": 1.265625, "learning_rate": 0.0004926233758013494, "loss": 6.0505, "mean_token_accuracy": 0.15046188086271287, "num_tokens": 17798367.0, "step": 9095 }, { "entropy": 6.243617916107178, "epoch": 0.9096816114359974, "grad_norm": 1.4765625, "learning_rate": 0.0004926143094977359, "loss": 6.0569, "mean_token_accuracy": 0.15349369496107101, "num_tokens": 17807660.0, "step": 9100 }, { "entropy": 6.136161613464355, "epoch": 0.9101814364972259, "grad_norm": 1.2890625, "learning_rate": 0.0004926052377190022, "loss": 6.0738, "mean_token_accuracy": 0.15352212712168695, "num_tokens": 17816993.0, "step": 9105 }, { "entropy": 6.2376378059387205, "epoch": 0.9106812615584545, "grad_norm": 1.2578125, "learning_rate": 0.0004925961604653765, "loss": 6.0444, "mean_token_accuracy": 0.1527748979628086, "num_tokens": 17826570.0, "step": 9110 }, { "entropy": 6.2975146770477295, "epoch": 0.9111810866196831, "grad_norm": 1.21875, "learning_rate": 0.0004925870777370877, "loss": 6.0496, "mean_token_accuracy": 0.15350356101989746, "num_tokens": 17835921.0, "step": 9115 }, { "entropy": 6.19925742149353, "epoch": 0.9116809116809117, "grad_norm": 1.3359375, "learning_rate": 0.0004925779895343639, "loss": 6.0868, "mean_token_accuracy": 0.15331922620534896, "num_tokens": 17845713.0, "step": 9120 }, { "entropy": 6.231760787963867, "epoch": 0.9121807367421403, "grad_norm": 1.46875, "learning_rate": 0.0004925688958574339, "loss": 6.0853, "mean_token_accuracy": 0.15133204609155654, "num_tokens": 17855808.0, "step": 9125 }, { "entropy": 6.255069971084595, "epoch": 0.9126805618033689, "grad_norm": 1.265625, "learning_rate": 0.0004925597967065264, "loss": 6.0691, "mean_token_accuracy": 0.14928917735815048, "num_tokens": 17865427.0, "step": 9130 }, { "entropy": 6.227627325057983, "epoch": 0.9131803868645973, "grad_norm": 1.3515625, "learning_rate": 0.0004925506920818705, "loss": 6.1327, "mean_token_accuracy": 0.14354583397507667, "num_tokens": 17876371.0, "step": 9135 }, { "entropy": 6.205776786804199, "epoch": 0.9136802119258259, "grad_norm": 1.2578125, "learning_rate": 0.0004925415819836951, "loss": 6.0232, "mean_token_accuracy": 0.1528637856245041, "num_tokens": 17886050.0, "step": 9140 }, { "entropy": 6.261341524124146, "epoch": 0.9141800369870545, "grad_norm": 1.3359375, "learning_rate": 0.0004925324664122294, "loss": 6.0967, "mean_token_accuracy": 0.15840699076652526, "num_tokens": 17896509.0, "step": 9145 }, { "entropy": 6.290964269638062, "epoch": 0.9146798620482831, "grad_norm": 1.453125, "learning_rate": 0.0004925233453677029, "loss": 6.1281, "mean_token_accuracy": 0.14990468248724936, "num_tokens": 17906242.0, "step": 9150 }, { "entropy": 6.151191854476929, "epoch": 0.9151796871095117, "grad_norm": 1.2265625, "learning_rate": 0.0004925142188503451, "loss": 6.055, "mean_token_accuracy": 0.15152156352996826, "num_tokens": 17916261.0, "step": 9155 }, { "entropy": 6.201545238494873, "epoch": 0.9156795121707403, "grad_norm": 1.2578125, "learning_rate": 0.0004925050868603854, "loss": 6.0595, "mean_token_accuracy": 0.15109204202890397, "num_tokens": 17926486.0, "step": 9160 }, { "entropy": 6.218569374084472, "epoch": 0.9161793372319688, "grad_norm": 1.296875, "learning_rate": 0.0004924959493980537, "loss": 6.0829, "mean_token_accuracy": 0.1467864230275154, "num_tokens": 17936374.0, "step": 9165 }, { "entropy": 6.30111255645752, "epoch": 0.9166791622931973, "grad_norm": 1.3515625, "learning_rate": 0.0004924868064635798, "loss": 6.3435, "mean_token_accuracy": 0.13521681651473044, "num_tokens": 17946930.0, "step": 9170 }, { "entropy": 6.36268105506897, "epoch": 0.9171789873544259, "grad_norm": 1.375, "learning_rate": 0.000492477658057194, "loss": 6.0954, "mean_token_accuracy": 0.1502355843782425, "num_tokens": 17955760.0, "step": 9175 }, { "entropy": 6.191945123672485, "epoch": 0.9176788124156545, "grad_norm": 1.125, "learning_rate": 0.0004924685041791262, "loss": 6.0265, "mean_token_accuracy": 0.15668040066957473, "num_tokens": 17965871.0, "step": 9180 }, { "entropy": 6.046727180480957, "epoch": 0.9181786374768831, "grad_norm": 1.4296875, "learning_rate": 0.0004924593448296068, "loss": 5.9758, "mean_token_accuracy": 0.15996017903089524, "num_tokens": 17974551.0, "step": 9185 }, { "entropy": 6.2014867782592775, "epoch": 0.9186784625381117, "grad_norm": 1.3125, "learning_rate": 0.0004924501800088662, "loss": 6.0994, "mean_token_accuracy": 0.15105812400579452, "num_tokens": 17983675.0, "step": 9190 }, { "entropy": 6.242628669738769, "epoch": 0.9191782875993403, "grad_norm": 1.28125, "learning_rate": 0.0004924410097171351, "loss": 6.0527, "mean_token_accuracy": 0.15568673461675644, "num_tokens": 17993299.0, "step": 9195 }, { "entropy": 6.237846422195434, "epoch": 0.9196781126605688, "grad_norm": 1.796875, "learning_rate": 0.000492431833954644, "loss": 6.0935, "mean_token_accuracy": 0.15041086748242377, "num_tokens": 18004755.0, "step": 9200 }, { "entropy": 6.260499095916748, "epoch": 0.9201779377217973, "grad_norm": 1.46875, "learning_rate": 0.0004924226527216241, "loss": 6.1725, "mean_token_accuracy": 0.14105364829301834, "num_tokens": 18014908.0, "step": 9205 }, { "entropy": 6.222171878814697, "epoch": 0.9206777627830259, "grad_norm": 1.2265625, "learning_rate": 0.0004924134660183061, "loss": 6.0401, "mean_token_accuracy": 0.15047877728939058, "num_tokens": 18023919.0, "step": 9210 }, { "entropy": 6.178057622909546, "epoch": 0.9211775878442545, "grad_norm": 1.3671875, "learning_rate": 0.0004924042738449212, "loss": 5.9954, "mean_token_accuracy": 0.15466747879981996, "num_tokens": 18033706.0, "step": 9215 }, { "entropy": 6.255136966705322, "epoch": 0.9216774129054831, "grad_norm": 1.71875, "learning_rate": 0.0004923950762017008, "loss": 6.1117, "mean_token_accuracy": 0.14287826269865037, "num_tokens": 18043171.0, "step": 9220 }, { "entropy": 6.222732400894165, "epoch": 0.9221772379667117, "grad_norm": 1.3203125, "learning_rate": 0.0004923858730888762, "loss": 6.0271, "mean_token_accuracy": 0.16167323291301727, "num_tokens": 18052567.0, "step": 9225 }, { "entropy": 6.214358806610107, "epoch": 0.9226770630279402, "grad_norm": 1.3984375, "learning_rate": 0.000492376664506679, "loss": 6.0411, "mean_token_accuracy": 0.15918398052453994, "num_tokens": 18061648.0, "step": 9230 }, { "entropy": 6.22084674835205, "epoch": 0.9231768880891688, "grad_norm": 1.1953125, "learning_rate": 0.0004923674504553408, "loss": 6.0858, "mean_token_accuracy": 0.15076340436935426, "num_tokens": 18071079.0, "step": 9235 }, { "entropy": 6.187896585464477, "epoch": 0.9236767131503973, "grad_norm": 1.2578125, "learning_rate": 0.0004923582309350935, "loss": 6.1202, "mean_token_accuracy": 0.14868925660848617, "num_tokens": 18081162.0, "step": 9240 }, { "entropy": 6.260784482955932, "epoch": 0.9241765382116259, "grad_norm": 1.3125, "learning_rate": 0.000492349005946169, "loss": 6.0691, "mean_token_accuracy": 0.15349994897842406, "num_tokens": 18090072.0, "step": 9245 }, { "entropy": 6.306547069549561, "epoch": 0.9246763632728545, "grad_norm": 1.3125, "learning_rate": 0.0004923397754887994, "loss": 6.1133, "mean_token_accuracy": 0.1476108178496361, "num_tokens": 18100565.0, "step": 9250 }, { "entropy": 6.233260679244995, "epoch": 0.9251761883340831, "grad_norm": 1.34375, "learning_rate": 0.0004923305395632172, "loss": 6.065, "mean_token_accuracy": 0.1483036145567894, "num_tokens": 18109795.0, "step": 9255 }, { "entropy": 6.257886219024658, "epoch": 0.9256760133953117, "grad_norm": 1.2421875, "learning_rate": 0.0004923212981696543, "loss": 6.0993, "mean_token_accuracy": 0.1438927434384823, "num_tokens": 18118821.0, "step": 9260 }, { "entropy": 6.259016990661621, "epoch": 0.9261758384565402, "grad_norm": 1.4921875, "learning_rate": 0.0004923120513083436, "loss": 6.1098, "mean_token_accuracy": 0.15111489444971085, "num_tokens": 18128709.0, "step": 9265 }, { "entropy": 6.209259796142578, "epoch": 0.9266756635177688, "grad_norm": 1.3515625, "learning_rate": 0.0004923027989795175, "loss": 6.1537, "mean_token_accuracy": 0.14629934430122377, "num_tokens": 18138134.0, "step": 9270 }, { "entropy": 6.205793476104736, "epoch": 0.9271754885789973, "grad_norm": 1.375, "learning_rate": 0.000492293541183409, "loss": 6.0004, "mean_token_accuracy": 0.15127084851264955, "num_tokens": 18147455.0, "step": 9275 }, { "entropy": 6.208625650405883, "epoch": 0.9276753136402259, "grad_norm": 1.1484375, "learning_rate": 0.0004922842779202509, "loss": 6.0728, "mean_token_accuracy": 0.15632907748222352, "num_tokens": 18157787.0, "step": 9280 }, { "entropy": 6.129068899154663, "epoch": 0.9281751387014545, "grad_norm": 1.2890625, "learning_rate": 0.0004922750091902763, "loss": 6.0395, "mean_token_accuracy": 0.15793268382549286, "num_tokens": 18167607.0, "step": 9285 }, { "entropy": 6.214073991775512, "epoch": 0.9286749637626831, "grad_norm": 1.3125, "learning_rate": 0.0004922657349937183, "loss": 6.1022, "mean_token_accuracy": 0.14468628019094468, "num_tokens": 18178927.0, "step": 9290 }, { "entropy": 6.1747565269470215, "epoch": 0.9291747888239116, "grad_norm": 1.1796875, "learning_rate": 0.0004922564553308103, "loss": 5.9943, "mean_token_accuracy": 0.15306239128112792, "num_tokens": 18188907.0, "step": 9295 }, { "entropy": 6.130193758010864, "epoch": 0.9296746138851402, "grad_norm": 1.1484375, "learning_rate": 0.000492247170201786, "loss": 5.9396, "mean_token_accuracy": 0.15720709413290024, "num_tokens": 18198937.0, "step": 9300 }, { "entropy": 6.164691591262818, "epoch": 0.9301744389463688, "grad_norm": 1.1484375, "learning_rate": 0.0004922378796068785, "loss": 6.0155, "mean_token_accuracy": 0.15191463530063629, "num_tokens": 18209306.0, "step": 9305 }, { "entropy": 6.318961191177368, "epoch": 0.9306742640075973, "grad_norm": 1.34375, "learning_rate": 0.000492228583546322, "loss": 6.1847, "mean_token_accuracy": 0.13658268228173256, "num_tokens": 18219665.0, "step": 9310 }, { "entropy": 6.270161151885986, "epoch": 0.9311740890688259, "grad_norm": 1.15625, "learning_rate": 0.0004922192820203502, "loss": 6.0504, "mean_token_accuracy": 0.1484959080815315, "num_tokens": 18229044.0, "step": 9315 }, { "entropy": 6.174050140380859, "epoch": 0.9316739141300545, "grad_norm": 1.34375, "learning_rate": 0.0004922099750291972, "loss": 6.0207, "mean_token_accuracy": 0.15656452178955077, "num_tokens": 18239373.0, "step": 9320 }, { "entropy": 6.198981428146363, "epoch": 0.9321737391912831, "grad_norm": 1.3359375, "learning_rate": 0.0004922006625730971, "loss": 6.0229, "mean_token_accuracy": 0.15291590392589569, "num_tokens": 18249195.0, "step": 9325 }, { "entropy": 6.223763084411621, "epoch": 0.9326735642525116, "grad_norm": 1.296875, "learning_rate": 0.0004921913446522843, "loss": 6.0175, "mean_token_accuracy": 0.15656565874814987, "num_tokens": 18258399.0, "step": 9330 }, { "entropy": 6.18964467048645, "epoch": 0.9331733893137402, "grad_norm": 1.9296875, "learning_rate": 0.000492182021266993, "loss": 6.0594, "mean_token_accuracy": 0.15399105101823807, "num_tokens": 18268952.0, "step": 9335 }, { "entropy": 6.212173175811768, "epoch": 0.9336732143749688, "grad_norm": 1.3203125, "learning_rate": 0.000492172692417458, "loss": 6.0199, "mean_token_accuracy": 0.15111202225089074, "num_tokens": 18279482.0, "step": 9340 }, { "entropy": 6.187543964385986, "epoch": 0.9341730394361973, "grad_norm": 1.359375, "learning_rate": 0.000492163358103914, "loss": 6.0607, "mean_token_accuracy": 0.15307216495275497, "num_tokens": 18289069.0, "step": 9345 }, { "entropy": 6.184841823577881, "epoch": 0.9346728644974259, "grad_norm": 1.234375, "learning_rate": 0.0004921540183265957, "loss": 6.01, "mean_token_accuracy": 0.15416917502880095, "num_tokens": 18298333.0, "step": 9350 }, { "entropy": 6.219984722137451, "epoch": 0.9351726895586545, "grad_norm": 1.296875, "learning_rate": 0.0004921446730857383, "loss": 6.0834, "mean_token_accuracy": 0.14918960109353066, "num_tokens": 18307661.0, "step": 9355 }, { "entropy": 6.251865720748901, "epoch": 0.935672514619883, "grad_norm": 1.25, "learning_rate": 0.0004921353223815767, "loss": 6.1416, "mean_token_accuracy": 0.14653849452733994, "num_tokens": 18317786.0, "step": 9360 }, { "entropy": 6.235687494277954, "epoch": 0.9361723396811116, "grad_norm": 1.1484375, "learning_rate": 0.0004921259662143463, "loss": 6.1317, "mean_token_accuracy": 0.14261429905891418, "num_tokens": 18328430.0, "step": 9365 }, { "entropy": 6.254350471496582, "epoch": 0.9366721647423402, "grad_norm": 1.3359375, "learning_rate": 0.0004921166045842825, "loss": 6.1347, "mean_token_accuracy": 0.14653569906949998, "num_tokens": 18339800.0, "step": 9370 }, { "entropy": 6.33001937866211, "epoch": 0.9371719898035688, "grad_norm": 1.3671875, "learning_rate": 0.0004921072374916208, "loss": 6.1431, "mean_token_accuracy": 0.14112329632043838, "num_tokens": 18348819.0, "step": 9375 }, { "entropy": 6.186894130706787, "epoch": 0.9376718148647973, "grad_norm": 1.4765625, "learning_rate": 0.0004920978649365968, "loss": 5.9902, "mean_token_accuracy": 0.1623859539628029, "num_tokens": 18358189.0, "step": 9380 }, { "entropy": 6.186570739746093, "epoch": 0.9381716399260259, "grad_norm": 1.2734375, "learning_rate": 0.0004920884869194463, "loss": 5.9914, "mean_token_accuracy": 0.15406157970428466, "num_tokens": 18367571.0, "step": 9385 }, { "entropy": 6.197534465789795, "epoch": 0.9386714649872545, "grad_norm": 1.359375, "learning_rate": 0.0004920791034404054, "loss": 5.9892, "mean_token_accuracy": 0.1555450141429901, "num_tokens": 18376699.0, "step": 9390 }, { "entropy": 6.143626689910889, "epoch": 0.939171290048483, "grad_norm": 1.46875, "learning_rate": 0.0004920697144997102, "loss": 5.8852, "mean_token_accuracy": 0.16139229834079744, "num_tokens": 18386036.0, "step": 9395 }, { "entropy": 6.191374158859253, "epoch": 0.9396711151097116, "grad_norm": 1.3125, "learning_rate": 0.0004920603200975968, "loss": 6.0884, "mean_token_accuracy": 0.16238868981599808, "num_tokens": 18395363.0, "step": 9400 }, { "entropy": 6.24739785194397, "epoch": 0.9401709401709402, "grad_norm": 1.2890625, "learning_rate": 0.0004920509202343016, "loss": 6.0688, "mean_token_accuracy": 0.14848162084817887, "num_tokens": 18404919.0, "step": 9405 }, { "entropy": 6.218137788772583, "epoch": 0.9406707652321687, "grad_norm": 1.3046875, "learning_rate": 0.000492041514910061, "loss": 6.0887, "mean_token_accuracy": 0.1517230212688446, "num_tokens": 18413520.0, "step": 9410 }, { "entropy": 6.22852840423584, "epoch": 0.9411705902933973, "grad_norm": 1.2265625, "learning_rate": 0.0004920321041251118, "loss": 6.1081, "mean_token_accuracy": 0.15238470435142518, "num_tokens": 18422942.0, "step": 9415 }, { "entropy": 6.307512998580933, "epoch": 0.9416704153546259, "grad_norm": 1.5234375, "learning_rate": 0.0004920226878796908, "loss": 6.1128, "mean_token_accuracy": 0.14426910802721976, "num_tokens": 18432782.0, "step": 9420 }, { "entropy": 6.270034885406494, "epoch": 0.9421702404158544, "grad_norm": 1.2109375, "learning_rate": 0.0004920132661740348, "loss": 6.1013, "mean_token_accuracy": 0.15191699415445328, "num_tokens": 18443058.0, "step": 9425 }, { "entropy": 6.2411493301391605, "epoch": 0.942670065477083, "grad_norm": 1.3046875, "learning_rate": 0.0004920038390083808, "loss": 5.9896, "mean_token_accuracy": 0.15453899800777435, "num_tokens": 18453138.0, "step": 9430 }, { "entropy": 6.172799110412598, "epoch": 0.9431698905383116, "grad_norm": 1.34375, "learning_rate": 0.000491994406382966, "loss": 6.1322, "mean_token_accuracy": 0.15028438121080398, "num_tokens": 18463763.0, "step": 9435 }, { "entropy": 6.2097571849822994, "epoch": 0.9436697155995402, "grad_norm": 1.375, "learning_rate": 0.0004919849682980278, "loss": 6.0345, "mean_token_accuracy": 0.15386351495981215, "num_tokens": 18473391.0, "step": 9440 }, { "entropy": 6.220196533203125, "epoch": 0.9441695406607687, "grad_norm": 1.34375, "learning_rate": 0.0004919755247538037, "loss": 6.0639, "mean_token_accuracy": 0.1476370945572853, "num_tokens": 18483002.0, "step": 9445 }, { "entropy": 6.279415893554687, "epoch": 0.9446693657219973, "grad_norm": 1.4765625, "learning_rate": 0.0004919660757505312, "loss": 6.0655, "mean_token_accuracy": 0.15239429101347923, "num_tokens": 18493428.0, "step": 9450 }, { "entropy": 6.277664709091186, "epoch": 0.9451691907832259, "grad_norm": 1.7265625, "learning_rate": 0.0004919566212884481, "loss": 6.0481, "mean_token_accuracy": 0.1487953968346119, "num_tokens": 18502756.0, "step": 9455 }, { "entropy": 6.22528600692749, "epoch": 0.9456690158444544, "grad_norm": 1.2109375, "learning_rate": 0.0004919471613677921, "loss": 6.1189, "mean_token_accuracy": 0.14318000227212907, "num_tokens": 18512576.0, "step": 9460 }, { "entropy": 6.190670919418335, "epoch": 0.946168840905683, "grad_norm": 1.5, "learning_rate": 0.0004919376959888015, "loss": 5.9705, "mean_token_accuracy": 0.15100648999214172, "num_tokens": 18522271.0, "step": 9465 }, { "entropy": 6.161213350296021, "epoch": 0.9466686659669116, "grad_norm": 1.453125, "learning_rate": 0.0004919282251517142, "loss": 5.9892, "mean_token_accuracy": 0.15205149948596955, "num_tokens": 18532738.0, "step": 9470 }, { "entropy": 6.263359498977661, "epoch": 0.9471684910281402, "grad_norm": 1.15625, "learning_rate": 0.0004919187488567686, "loss": 6.2077, "mean_token_accuracy": 0.15216834098100662, "num_tokens": 18543132.0, "step": 9475 }, { "entropy": 6.20970311164856, "epoch": 0.9476683160893687, "grad_norm": 1.1953125, "learning_rate": 0.0004919092671042031, "loss": 5.9728, "mean_token_accuracy": 0.15883567780256272, "num_tokens": 18551777.0, "step": 9480 }, { "entropy": 6.12543568611145, "epoch": 0.9481681411505973, "grad_norm": 1.375, "learning_rate": 0.0004918997798942562, "loss": 6.0368, "mean_token_accuracy": 0.15105368942022324, "num_tokens": 18561137.0, "step": 9485 }, { "entropy": 6.173322629928589, "epoch": 0.9486679662118258, "grad_norm": 1.328125, "learning_rate": 0.0004918902872271668, "loss": 6.0903, "mean_token_accuracy": 0.14883806481957434, "num_tokens": 18571917.0, "step": 9490 }, { "entropy": 6.2400469303131105, "epoch": 0.9491677912730544, "grad_norm": 1.2109375, "learning_rate": 0.0004918807891031734, "loss": 6.0595, "mean_token_accuracy": 0.1494263380765915, "num_tokens": 18581670.0, "step": 9495 }, { "entropy": 6.134951543807984, "epoch": 0.949667616334283, "grad_norm": 1.25, "learning_rate": 0.0004918712855225154, "loss": 5.9995, "mean_token_accuracy": 0.15328548699617386, "num_tokens": 18590140.0, "step": 9500 }, { "entropy": 6.06361198425293, "epoch": 0.9501674413955116, "grad_norm": 1.3984375, "learning_rate": 0.0004918617764854314, "loss": 5.8939, "mean_token_accuracy": 0.15935043692588807, "num_tokens": 18599496.0, "step": 9505 }, { "entropy": 6.1570947647094725, "epoch": 0.9506672664567402, "grad_norm": 1.265625, "learning_rate": 0.000491852261992161, "loss": 6.0564, "mean_token_accuracy": 0.15687580555677413, "num_tokens": 18609415.0, "step": 9510 }, { "entropy": 6.242318725585937, "epoch": 0.9511670915179687, "grad_norm": 1.640625, "learning_rate": 0.0004918427420429435, "loss": 6.0616, "mean_token_accuracy": 0.15219078809022904, "num_tokens": 18619215.0, "step": 9515 }, { "entropy": 6.300957918167114, "epoch": 0.9516669165791973, "grad_norm": 1.2265625, "learning_rate": 0.0004918332166380185, "loss": 6.138, "mean_token_accuracy": 0.1504904732108116, "num_tokens": 18629381.0, "step": 9520 }, { "entropy": 6.209245109558106, "epoch": 0.9521667416404258, "grad_norm": 1.171875, "learning_rate": 0.0004918236857776254, "loss": 6.0784, "mean_token_accuracy": 0.15259324312210082, "num_tokens": 18639049.0, "step": 9525 }, { "entropy": 6.220205688476563, "epoch": 0.9526665667016544, "grad_norm": 1.328125, "learning_rate": 0.0004918141494620042, "loss": 6.0904, "mean_token_accuracy": 0.14841213822364807, "num_tokens": 18649096.0, "step": 9530 }, { "entropy": 6.207163238525391, "epoch": 0.953166391762883, "grad_norm": 1.25, "learning_rate": 0.0004918046076913949, "loss": 6.0389, "mean_token_accuracy": 0.15804794430732727, "num_tokens": 18658747.0, "step": 9535 }, { "entropy": 6.269297075271607, "epoch": 0.9536662168241116, "grad_norm": 1.375, "learning_rate": 0.0004917950604660374, "loss": 6.1209, "mean_token_accuracy": 0.1494915597140789, "num_tokens": 18668538.0, "step": 9540 }, { "entropy": 6.236788749694824, "epoch": 0.9541660418853402, "grad_norm": 1.3046875, "learning_rate": 0.000491785507786172, "loss": 6.0802, "mean_token_accuracy": 0.1503964349627495, "num_tokens": 18679241.0, "step": 9545 }, { "entropy": 6.182567882537842, "epoch": 0.9546658669465687, "grad_norm": 1.2421875, "learning_rate": 0.0004917759496520388, "loss": 6.0761, "mean_token_accuracy": 0.14858175814151764, "num_tokens": 18689405.0, "step": 9550 }, { "entropy": 6.2947179794311525, "epoch": 0.9551656920077972, "grad_norm": 1.40625, "learning_rate": 0.0004917663860638787, "loss": 6.1246, "mean_token_accuracy": 0.14366439804434777, "num_tokens": 18697989.0, "step": 9555 }, { "entropy": 6.196341228485108, "epoch": 0.9556655170690258, "grad_norm": 1.3046875, "learning_rate": 0.0004917568170219321, "loss": 6.0231, "mean_token_accuracy": 0.15023713409900666, "num_tokens": 18706992.0, "step": 9560 }, { "entropy": 6.121190166473388, "epoch": 0.9561653421302544, "grad_norm": 1.5078125, "learning_rate": 0.0004917472425264397, "loss": 6.0769, "mean_token_accuracy": 0.14825137630105018, "num_tokens": 18716742.0, "step": 9565 }, { "entropy": 6.245248031616211, "epoch": 0.956665167191483, "grad_norm": 1.4609375, "learning_rate": 0.0004917376625776425, "loss": 6.1791, "mean_token_accuracy": 0.14539650827646255, "num_tokens": 18725955.0, "step": 9570 }, { "entropy": 6.290267753601074, "epoch": 0.9571649922527116, "grad_norm": 1.2421875, "learning_rate": 0.0004917280771757814, "loss": 6.0837, "mean_token_accuracy": 0.15159521251916885, "num_tokens": 18735199.0, "step": 9575 }, { "entropy": 6.254014158248902, "epoch": 0.9576648173139402, "grad_norm": 1.2265625, "learning_rate": 0.0004917184863210977, "loss": 6.113, "mean_token_accuracy": 0.14517153799533844, "num_tokens": 18745457.0, "step": 9580 }, { "entropy": 6.246565961837769, "epoch": 0.9581646423751687, "grad_norm": 1.40625, "learning_rate": 0.0004917088900138326, "loss": 6.0962, "mean_token_accuracy": 0.14720577746629715, "num_tokens": 18753869.0, "step": 9585 }, { "entropy": 6.22707691192627, "epoch": 0.9586644674363972, "grad_norm": 1.3984375, "learning_rate": 0.0004916992882542276, "loss": 6.0687, "mean_token_accuracy": 0.1583326369524002, "num_tokens": 18763022.0, "step": 9590 }, { "entropy": 6.213897800445556, "epoch": 0.9591642924976258, "grad_norm": 1.3125, "learning_rate": 0.0004916896810425244, "loss": 5.9927, "mean_token_accuracy": 0.16006032824516297, "num_tokens": 18772827.0, "step": 9595 }, { "entropy": 6.199007415771485, "epoch": 0.9596641175588544, "grad_norm": 1.2421875, "learning_rate": 0.0004916800683789645, "loss": 6.0228, "mean_token_accuracy": 0.15236202478408814, "num_tokens": 18782272.0, "step": 9600 }, { "entropy": 6.207870101928711, "epoch": 0.960163942620083, "grad_norm": 1.328125, "learning_rate": 0.0004916704502637897, "loss": 6.0557, "mean_token_accuracy": 0.1502628892660141, "num_tokens": 18792125.0, "step": 9605 }, { "entropy": 6.167756366729736, "epoch": 0.9606637676813116, "grad_norm": 1.3515625, "learning_rate": 0.0004916608266972422, "loss": 6.0183, "mean_token_accuracy": 0.15662460178136825, "num_tokens": 18801498.0, "step": 9610 }, { "entropy": 6.232539939880371, "epoch": 0.9611635927425402, "grad_norm": 1.3359375, "learning_rate": 0.0004916511976795642, "loss": 6.1399, "mean_token_accuracy": 0.14556847885251045, "num_tokens": 18811904.0, "step": 9615 }, { "entropy": 6.228086853027344, "epoch": 0.9616634178037686, "grad_norm": 1.1796875, "learning_rate": 0.0004916415632109977, "loss": 6.0872, "mean_token_accuracy": 0.1518653929233551, "num_tokens": 18821388.0, "step": 9620 }, { "entropy": 6.276173448562622, "epoch": 0.9621632428649972, "grad_norm": 1.5, "learning_rate": 0.0004916319232917852, "loss": 6.1232, "mean_token_accuracy": 0.15319905579090118, "num_tokens": 18831392.0, "step": 9625 }, { "entropy": 6.218940687179566, "epoch": 0.9626630679262258, "grad_norm": 1.1484375, "learning_rate": 0.0004916222779221694, "loss": 6.0388, "mean_token_accuracy": 0.14967302829027176, "num_tokens": 18841211.0, "step": 9630 }, { "entropy": 6.274160099029541, "epoch": 0.9631628929874544, "grad_norm": 1.3828125, "learning_rate": 0.0004916126271023926, "loss": 6.0684, "mean_token_accuracy": 0.150314125418663, "num_tokens": 18851033.0, "step": 9635 }, { "entropy": 6.222961330413819, "epoch": 0.963662718048683, "grad_norm": 1.3828125, "learning_rate": 0.000491602970832698, "loss": 6.1083, "mean_token_accuracy": 0.15259940624237062, "num_tokens": 18861439.0, "step": 9640 }, { "entropy": 6.2386480331420895, "epoch": 0.9641625431099116, "grad_norm": 1.296875, "learning_rate": 0.0004915933091133284, "loss": 6.0958, "mean_token_accuracy": 0.1450348451733589, "num_tokens": 18872056.0, "step": 9645 }, { "entropy": 6.251325702667236, "epoch": 0.9646623681711401, "grad_norm": 1.2109375, "learning_rate": 0.0004915836419445268, "loss": 6.0046, "mean_token_accuracy": 0.15753925889730452, "num_tokens": 18881540.0, "step": 9650 }, { "entropy": 6.1729137897491455, "epoch": 0.9651621932323686, "grad_norm": 1.1875, "learning_rate": 0.0004915739693265365, "loss": 6.0299, "mean_token_accuracy": 0.1475259095430374, "num_tokens": 18890466.0, "step": 9655 }, { "entropy": 6.224126148223877, "epoch": 0.9656620182935972, "grad_norm": 1.4453125, "learning_rate": 0.0004915642912596009, "loss": 6.0909, "mean_token_accuracy": 0.1462048664689064, "num_tokens": 18901397.0, "step": 9660 }, { "entropy": 6.237620115280151, "epoch": 0.9661618433548258, "grad_norm": 1.421875, "learning_rate": 0.0004915546077439634, "loss": 6.0207, "mean_token_accuracy": 0.15306469202041625, "num_tokens": 18911357.0, "step": 9665 }, { "entropy": 6.0991614818572994, "epoch": 0.9666616684160544, "grad_norm": 1.2109375, "learning_rate": 0.0004915449187798677, "loss": 5.9653, "mean_token_accuracy": 0.16138627082109452, "num_tokens": 18920901.0, "step": 9670 }, { "entropy": 6.228220987319946, "epoch": 0.967161493477283, "grad_norm": 1.28125, "learning_rate": 0.0004915352243675576, "loss": 6.0893, "mean_token_accuracy": 0.1472497321665287, "num_tokens": 18931012.0, "step": 9675 }, { "entropy": 6.243789434432983, "epoch": 0.9676613185385116, "grad_norm": 1.359375, "learning_rate": 0.000491525524507277, "loss": 6.146, "mean_token_accuracy": 0.14576415121555328, "num_tokens": 18941222.0, "step": 9680 }, { "entropy": 6.2972959041595455, "epoch": 0.96816114359974, "grad_norm": 1.421875, "learning_rate": 0.0004915158191992699, "loss": 6.1301, "mean_token_accuracy": 0.14853508695960044, "num_tokens": 18951073.0, "step": 9685 }, { "entropy": 6.285033798217773, "epoch": 0.9686609686609686, "grad_norm": 1.2734375, "learning_rate": 0.0004915061084437805, "loss": 6.1261, "mean_token_accuracy": 0.146405328810215, "num_tokens": 18960996.0, "step": 9690 }, { "entropy": 6.212119197845459, "epoch": 0.9691607937221972, "grad_norm": 1.2734375, "learning_rate": 0.0004914963922410531, "loss": 6.1467, "mean_token_accuracy": 0.14198032170534133, "num_tokens": 18970451.0, "step": 9695 }, { "entropy": 6.143320941925049, "epoch": 0.9696606187834258, "grad_norm": 1.2421875, "learning_rate": 0.0004914866705913322, "loss": 6.02, "mean_token_accuracy": 0.14886799156665803, "num_tokens": 18979781.0, "step": 9700 }, { "entropy": 6.24599256515503, "epoch": 0.9701604438446544, "grad_norm": 1.1640625, "learning_rate": 0.0004914769434948623, "loss": 6.0806, "mean_token_accuracy": 0.15258603692054748, "num_tokens": 18989663.0, "step": 9705 }, { "entropy": 6.2854218006134035, "epoch": 0.970660268905883, "grad_norm": 1.3203125, "learning_rate": 0.0004914672109518883, "loss": 6.1984, "mean_token_accuracy": 0.14810571521520616, "num_tokens": 18999613.0, "step": 9710 }, { "entropy": 6.167517614364624, "epoch": 0.9711600939671116, "grad_norm": 1.3046875, "learning_rate": 0.000491457472962655, "loss": 5.9968, "mean_token_accuracy": 0.15997470319271087, "num_tokens": 19008976.0, "step": 9715 }, { "entropy": 6.117216634750366, "epoch": 0.97165991902834, "grad_norm": 1.25, "learning_rate": 0.0004914477295274073, "loss": 6.0121, "mean_token_accuracy": 0.15582980513572692, "num_tokens": 19019013.0, "step": 9720 }, { "entropy": 6.274588346481323, "epoch": 0.9721597440895686, "grad_norm": 1.234375, "learning_rate": 0.0004914379806463905, "loss": 6.1162, "mean_token_accuracy": 0.15064358934760094, "num_tokens": 19029252.0, "step": 9725 }, { "entropy": 6.259511709213257, "epoch": 0.9726595691507972, "grad_norm": 1.3046875, "learning_rate": 0.0004914282263198498, "loss": 6.0622, "mean_token_accuracy": 0.1498521536588669, "num_tokens": 19038563.0, "step": 9730 }, { "entropy": 6.177741575241089, "epoch": 0.9731593942120258, "grad_norm": 1.328125, "learning_rate": 0.0004914184665480305, "loss": 6.0845, "mean_token_accuracy": 0.14762043505907058, "num_tokens": 19048568.0, "step": 9735 }, { "entropy": 6.141620254516601, "epoch": 0.9736592192732544, "grad_norm": 1.4453125, "learning_rate": 0.0004914087013311784, "loss": 5.8567, "mean_token_accuracy": 0.166812152415514, "num_tokens": 19057527.0, "step": 9740 }, { "entropy": 6.2267848491668705, "epoch": 0.974159044334483, "grad_norm": 1.25, "learning_rate": 0.0004913989306695389, "loss": 6.0143, "mean_token_accuracy": 0.15289444401860236, "num_tokens": 19067372.0, "step": 9745 }, { "entropy": 6.1202271461486815, "epoch": 0.9746588693957114, "grad_norm": 1.3359375, "learning_rate": 0.0004913891545633582, "loss": 6.0186, "mean_token_accuracy": 0.1590340331196785, "num_tokens": 19077521.0, "step": 9750 }, { "entropy": 6.189548635482788, "epoch": 0.97515869445694, "grad_norm": 1.5078125, "learning_rate": 0.000491379373012882, "loss": 5.9832, "mean_token_accuracy": 0.15376351699233054, "num_tokens": 19086674.0, "step": 9755 }, { "entropy": 6.284615325927734, "epoch": 0.9756585195181686, "grad_norm": 1.265625, "learning_rate": 0.0004913695860183563, "loss": 6.1874, "mean_token_accuracy": 0.1400657922029495, "num_tokens": 19097586.0, "step": 9760 }, { "entropy": 6.257413387298584, "epoch": 0.9761583445793972, "grad_norm": 1.3515625, "learning_rate": 0.0004913597935800276, "loss": 6.1936, "mean_token_accuracy": 0.14045121744275094, "num_tokens": 19107763.0, "step": 9765 }, { "entropy": 6.207984066009521, "epoch": 0.9766581696406258, "grad_norm": 1.28125, "learning_rate": 0.0004913499956981422, "loss": 5.9862, "mean_token_accuracy": 0.16010566800832748, "num_tokens": 19117931.0, "step": 9770 }, { "entropy": 6.195990562438965, "epoch": 0.9771579947018544, "grad_norm": 1.203125, "learning_rate": 0.0004913401923729465, "loss": 6.0577, "mean_token_accuracy": 0.1509033925831318, "num_tokens": 19127707.0, "step": 9775 }, { "entropy": 6.177084016799927, "epoch": 0.977657819763083, "grad_norm": 1.3984375, "learning_rate": 0.0004913303836046873, "loss": 5.9847, "mean_token_accuracy": 0.15120234787464143, "num_tokens": 19137633.0, "step": 9780 }, { "entropy": 6.242629718780518, "epoch": 0.9781576448243114, "grad_norm": 1.3359375, "learning_rate": 0.0004913205693936112, "loss": 6.1016, "mean_token_accuracy": 0.15185408145189286, "num_tokens": 19146247.0, "step": 9785 }, { "entropy": 6.125142765045166, "epoch": 0.97865746988554, "grad_norm": 1.3203125, "learning_rate": 0.0004913107497399653, "loss": 6.0063, "mean_token_accuracy": 0.16843177229166031, "num_tokens": 19156225.0, "step": 9790 }, { "entropy": 6.180765914916992, "epoch": 0.9791572949467686, "grad_norm": 1.3828125, "learning_rate": 0.0004913009246439966, "loss": 5.9738, "mean_token_accuracy": 0.1527572140097618, "num_tokens": 19165763.0, "step": 9795 }, { "entropy": 6.167466640472412, "epoch": 0.9796571200079972, "grad_norm": 1.3359375, "learning_rate": 0.0004912910941059525, "loss": 5.9964, "mean_token_accuracy": 0.1560740739107132, "num_tokens": 19174116.0, "step": 9800 }, { "entropy": 6.239066648483276, "epoch": 0.9801569450692258, "grad_norm": 1.234375, "learning_rate": 0.0004912812581260799, "loss": 6.1829, "mean_token_accuracy": 0.14594337865710258, "num_tokens": 19184416.0, "step": 9805 }, { "entropy": 6.24222469329834, "epoch": 0.9806567701304544, "grad_norm": 1.3359375, "learning_rate": 0.0004912714167046265, "loss": 6.1351, "mean_token_accuracy": 0.14393481314182283, "num_tokens": 19193356.0, "step": 9810 }, { "entropy": 6.190090370178223, "epoch": 0.9811565951916829, "grad_norm": 1.8203125, "learning_rate": 0.0004912615698418399, "loss": 5.9466, "mean_token_accuracy": 0.1673352375626564, "num_tokens": 19204257.0, "step": 9815 }, { "entropy": 6.276273345947265, "epoch": 0.9816564202529114, "grad_norm": 1.28125, "learning_rate": 0.0004912517175379679, "loss": 6.0751, "mean_token_accuracy": 0.15363384038209915, "num_tokens": 19213889.0, "step": 9820 }, { "entropy": 6.282799339294433, "epoch": 0.98215624531414, "grad_norm": 1.2421875, "learning_rate": 0.0004912418597932584, "loss": 6.1386, "mean_token_accuracy": 0.1493024557828903, "num_tokens": 19224008.0, "step": 9825 }, { "entropy": 6.279945421218872, "epoch": 0.9826560703753686, "grad_norm": 1.25, "learning_rate": 0.0004912319966079592, "loss": 6.1309, "mean_token_accuracy": 0.14636823534965515, "num_tokens": 19234247.0, "step": 9830 }, { "entropy": 6.324870014190674, "epoch": 0.9831558954365972, "grad_norm": 2.40625, "learning_rate": 0.0004912221279823187, "loss": 6.159, "mean_token_accuracy": 0.1421165309846401, "num_tokens": 19244838.0, "step": 9835 }, { "entropy": 6.228650856018066, "epoch": 0.9836557204978258, "grad_norm": 1.21875, "learning_rate": 0.0004912122539165851, "loss": 6.065, "mean_token_accuracy": 0.15061584413051604, "num_tokens": 19254989.0, "step": 9840 }, { "entropy": 6.194226551055908, "epoch": 0.9841555455590544, "grad_norm": 1.2734375, "learning_rate": 0.0004912023744110068, "loss": 6.1121, "mean_token_accuracy": 0.14618947580456734, "num_tokens": 19264519.0, "step": 9845 }, { "entropy": 6.2256019592285154, "epoch": 0.9846553706202829, "grad_norm": 1.1875, "learning_rate": 0.0004911924894658324, "loss": 6.0729, "mean_token_accuracy": 0.15336726009845733, "num_tokens": 19274153.0, "step": 9850 }, { "entropy": 6.14973931312561, "epoch": 0.9851551956815114, "grad_norm": 1.421875, "learning_rate": 0.0004911825990813107, "loss": 5.9945, "mean_token_accuracy": 0.1522758722305298, "num_tokens": 19283383.0, "step": 9855 }, { "entropy": 6.156365537643433, "epoch": 0.98565502074274, "grad_norm": 1.25, "learning_rate": 0.0004911727032576903, "loss": 5.9788, "mean_token_accuracy": 0.15503705590963363, "num_tokens": 19292758.0, "step": 9860 }, { "entropy": 6.197921466827393, "epoch": 0.9861548458039686, "grad_norm": 1.1796875, "learning_rate": 0.0004911628019952203, "loss": 6.0867, "mean_token_accuracy": 0.14506686329841614, "num_tokens": 19302339.0, "step": 9865 }, { "entropy": 6.172068691253662, "epoch": 0.9866546708651972, "grad_norm": 2.609375, "learning_rate": 0.0004911528952941499, "loss": 5.9458, "mean_token_accuracy": 0.15001685172319412, "num_tokens": 19312560.0, "step": 9870 }, { "entropy": 6.235568523406982, "epoch": 0.9871544959264258, "grad_norm": 1.296875, "learning_rate": 0.0004911429831547283, "loss": 5.9889, "mean_token_accuracy": 0.1545190468430519, "num_tokens": 19322796.0, "step": 9875 }, { "entropy": 6.1740562438964846, "epoch": 0.9876543209876543, "grad_norm": 1.328125, "learning_rate": 0.0004911330655772047, "loss": 6.0821, "mean_token_accuracy": 0.1500004954636097, "num_tokens": 19332719.0, "step": 9880 }, { "entropy": 6.169285869598388, "epoch": 0.9881541460488829, "grad_norm": 1.34375, "learning_rate": 0.000491123142561829, "loss": 6.0799, "mean_token_accuracy": 0.14822375178337097, "num_tokens": 19342226.0, "step": 9885 }, { "entropy": 6.127970027923584, "epoch": 0.9886539711101114, "grad_norm": 1.21875, "learning_rate": 0.0004911132141088505, "loss": 6.074, "mean_token_accuracy": 0.14566567093133925, "num_tokens": 19351933.0, "step": 9890 }, { "entropy": 6.223727083206176, "epoch": 0.98915379617134, "grad_norm": 1.3671875, "learning_rate": 0.0004911032802185192, "loss": 5.9693, "mean_token_accuracy": 0.15183516442775727, "num_tokens": 19359900.0, "step": 9895 }, { "entropy": 6.234736013412475, "epoch": 0.9896536212325686, "grad_norm": 1.28125, "learning_rate": 0.000491093340891085, "loss": 6.0762, "mean_token_accuracy": 0.14417059123516082, "num_tokens": 19369139.0, "step": 9900 }, { "entropy": 6.166970491409302, "epoch": 0.9901534462937972, "grad_norm": 1.3359375, "learning_rate": 0.0004910833961267979, "loss": 5.9997, "mean_token_accuracy": 0.14931093007326127, "num_tokens": 19378765.0, "step": 9905 }, { "entropy": 6.233784627914429, "epoch": 0.9906532713550258, "grad_norm": 1.265625, "learning_rate": 0.0004910734459259081, "loss": 6.1026, "mean_token_accuracy": 0.14605162888765336, "num_tokens": 19389001.0, "step": 9910 }, { "entropy": 6.249694681167602, "epoch": 0.9911530964162543, "grad_norm": 1.3203125, "learning_rate": 0.0004910634902886662, "loss": 6.0221, "mean_token_accuracy": 0.1571980208158493, "num_tokens": 19397990.0, "step": 9915 }, { "entropy": 6.126401376724243, "epoch": 0.9916529214774829, "grad_norm": 1.28125, "learning_rate": 0.0004910535292153224, "loss": 5.9721, "mean_token_accuracy": 0.15890015438199043, "num_tokens": 19408060.0, "step": 9920 }, { "entropy": 6.119165897369385, "epoch": 0.9921527465387114, "grad_norm": 1.2734375, "learning_rate": 0.0004910435627061273, "loss": 5.9842, "mean_token_accuracy": 0.1566011816263199, "num_tokens": 19417675.0, "step": 9925 }, { "entropy": 6.2198375225067135, "epoch": 0.99265257159994, "grad_norm": 1.234375, "learning_rate": 0.0004910335907613318, "loss": 6.0072, "mean_token_accuracy": 0.15505679994821547, "num_tokens": 19426433.0, "step": 9930 }, { "entropy": 6.180503702163696, "epoch": 0.9931523966611686, "grad_norm": 1.1875, "learning_rate": 0.0004910236133811867, "loss": 5.9047, "mean_token_accuracy": 0.15755116045475007, "num_tokens": 19435459.0, "step": 9935 }, { "entropy": 6.173477220535278, "epoch": 0.9936522217223972, "grad_norm": 1.171875, "learning_rate": 0.0004910136305659432, "loss": 6.0392, "mean_token_accuracy": 0.15312758535146714, "num_tokens": 19445329.0, "step": 9940 }, { "entropy": 6.181215286254883, "epoch": 0.9941520467836257, "grad_norm": 1.2578125, "learning_rate": 0.0004910036423158523, "loss": 5.989, "mean_token_accuracy": 0.15353483185172082, "num_tokens": 19454417.0, "step": 9945 }, { "entropy": 6.172397804260254, "epoch": 0.9946518718448543, "grad_norm": 1.21875, "learning_rate": 0.0004909936486311653, "loss": 6.0775, "mean_token_accuracy": 0.14898218661546708, "num_tokens": 19464274.0, "step": 9950 }, { "entropy": 6.226012134552002, "epoch": 0.9951516969060828, "grad_norm": 1.265625, "learning_rate": 0.0004909836495121336, "loss": 6.0546, "mean_token_accuracy": 0.15275216549634935, "num_tokens": 19472455.0, "step": 9955 }, { "entropy": 6.241779804229736, "epoch": 0.9956515219673114, "grad_norm": 1.2421875, "learning_rate": 0.0004909736449590091, "loss": 6.1489, "mean_token_accuracy": 0.14590268433094025, "num_tokens": 19483320.0, "step": 9960 }, { "entropy": 6.1918559074401855, "epoch": 0.99615134702854, "grad_norm": 1.296875, "learning_rate": 0.000490963634972043, "loss": 6.0144, "mean_token_accuracy": 0.150690495967865, "num_tokens": 19493644.0, "step": 9965 }, { "entropy": 6.199136543273926, "epoch": 0.9966511720897686, "grad_norm": 1.1796875, "learning_rate": 0.0004909536195514875, "loss": 5.949, "mean_token_accuracy": 0.1585733525454998, "num_tokens": 19503035.0, "step": 9970 }, { "entropy": 6.23398642539978, "epoch": 0.9971509971509972, "grad_norm": 1.3671875, "learning_rate": 0.0004909435986975946, "loss": 6.0852, "mean_token_accuracy": 0.15468785911798477, "num_tokens": 19512254.0, "step": 9975 }, { "entropy": 6.181322050094605, "epoch": 0.9976508222122257, "grad_norm": 1.1953125, "learning_rate": 0.0004909335724106162, "loss": 5.9885, "mean_token_accuracy": 0.16040295213460923, "num_tokens": 19523114.0, "step": 9980 }, { "entropy": 6.229870271682739, "epoch": 0.9981506472734543, "grad_norm": 1.2421875, "learning_rate": 0.0004909235406908047, "loss": 6.0654, "mean_token_accuracy": 0.14656102210283278, "num_tokens": 19532940.0, "step": 9985 }, { "entropy": 6.110600519180298, "epoch": 0.9986504723346828, "grad_norm": 1.203125, "learning_rate": 0.0004909135035384126, "loss": 6.0512, "mean_token_accuracy": 0.1576165422797203, "num_tokens": 19542807.0, "step": 9990 }, { "entropy": 6.186435508728027, "epoch": 0.9991502973959114, "grad_norm": 1.265625, "learning_rate": 0.0004909034609536922, "loss": 5.9404, "mean_token_accuracy": 0.15428706333041192, "num_tokens": 19552099.0, "step": 9995 }, { "entropy": 6.187509489059448, "epoch": 0.99965012245714, "grad_norm": 1.2890625, "learning_rate": 0.0004908934129368963, "loss": 6.0076, "mean_token_accuracy": 0.15655447989702226, "num_tokens": 19561709.0, "step": 10000 }, { "entropy": 6.147636466556126, "epoch": 1.0000999650122457, "grad_norm": 1.25, "learning_rate": 0.0004908833594882777, "loss": 6.1405, "mean_token_accuracy": 0.15090219262573454, "num_tokens": 19571739.0, "step": 10005 }, { "entropy": 6.214311313629151, "epoch": 1.0005997900734742, "grad_norm": 1.390625, "learning_rate": 0.0004908733006080893, "loss": 5.9604, "mean_token_accuracy": 0.1582156628370285, "num_tokens": 19582084.0, "step": 10010 }, { "entropy": 6.165178966522217, "epoch": 1.001099615134703, "grad_norm": 1.1953125, "learning_rate": 0.0004908632362965842, "loss": 5.9341, "mean_token_accuracy": 0.15487467050552367, "num_tokens": 19591889.0, "step": 10015 }, { "entropy": 6.2151100635528564, "epoch": 1.0015994401959314, "grad_norm": 1.3671875, "learning_rate": 0.0004908531665540158, "loss": 6.0484, "mean_token_accuracy": 0.1532239392399788, "num_tokens": 19601998.0, "step": 10020 }, { "entropy": 6.160410356521607, "epoch": 1.00209926525716, "grad_norm": 1.328125, "learning_rate": 0.000490843091380637, "loss": 5.858, "mean_token_accuracy": 0.16190654635429383, "num_tokens": 19611347.0, "step": 10025 }, { "entropy": 6.257710123062134, "epoch": 1.0025990903183886, "grad_norm": 1.359375, "learning_rate": 0.0004908330107767018, "loss": 6.0238, "mean_token_accuracy": 0.15361922532320021, "num_tokens": 19621522.0, "step": 10030 }, { "entropy": 6.14965968132019, "epoch": 1.003098915379617, "grad_norm": 1.234375, "learning_rate": 0.0004908229247424633, "loss": 5.8657, "mean_token_accuracy": 0.16673783361911773, "num_tokens": 19630815.0, "step": 10035 }, { "entropy": 6.1763228416442875, "epoch": 1.0035987404408457, "grad_norm": 1.234375, "learning_rate": 0.0004908128332781758, "loss": 5.9648, "mean_token_accuracy": 0.1563599541783333, "num_tokens": 19640811.0, "step": 10040 }, { "entropy": 6.113300132751465, "epoch": 1.0040985655020742, "grad_norm": 1.34375, "learning_rate": 0.0004908027363840928, "loss": 5.9356, "mean_token_accuracy": 0.15947846919298173, "num_tokens": 19651335.0, "step": 10045 }, { "entropy": 6.128355693817139, "epoch": 1.004598390563303, "grad_norm": 1.203125, "learning_rate": 0.0004907926340604686, "loss": 5.8745, "mean_token_accuracy": 0.15726337879896163, "num_tokens": 19660242.0, "step": 10050 }, { "entropy": 6.181172132492065, "epoch": 1.0050982156245314, "grad_norm": 1.4375, "learning_rate": 0.0004907825263075573, "loss": 5.9719, "mean_token_accuracy": 0.14894978404045106, "num_tokens": 19670013.0, "step": 10055 }, { "entropy": 6.139958143234253, "epoch": 1.00559804068576, "grad_norm": 1.2578125, "learning_rate": 0.0004907724131256129, "loss": 5.8677, "mean_token_accuracy": 0.16356950700283052, "num_tokens": 19679479.0, "step": 10060 }, { "entropy": 6.144499588012695, "epoch": 1.0060978657469886, "grad_norm": 1.359375, "learning_rate": 0.0004907622945148903, "loss": 5.9158, "mean_token_accuracy": 0.15895372331142427, "num_tokens": 19688603.0, "step": 10065 }, { "entropy": 6.122173833847046, "epoch": 1.006597690808217, "grad_norm": 1.125, "learning_rate": 0.0004907521704756438, "loss": 5.904, "mean_token_accuracy": 0.14928135201334952, "num_tokens": 19698375.0, "step": 10070 }, { "entropy": 6.16668291091919, "epoch": 1.0070975158694457, "grad_norm": 1.2265625, "learning_rate": 0.0004907420410081284, "loss": 5.9506, "mean_token_accuracy": 0.15356743335723877, "num_tokens": 19708911.0, "step": 10075 }, { "entropy": 6.131812238693238, "epoch": 1.0075973409306742, "grad_norm": 1.2421875, "learning_rate": 0.0004907319061125986, "loss": 5.9125, "mean_token_accuracy": 0.15422869324684144, "num_tokens": 19717733.0, "step": 10080 }, { "entropy": 6.146936845779419, "epoch": 1.008097165991903, "grad_norm": 1.5078125, "learning_rate": 0.0004907217657893096, "loss": 5.9246, "mean_token_accuracy": 0.1555325761437416, "num_tokens": 19727192.0, "step": 10085 }, { "entropy": 6.125443983078003, "epoch": 1.0085969910531314, "grad_norm": 1.1953125, "learning_rate": 0.0004907116200385165, "loss": 5.9066, "mean_token_accuracy": 0.15680666267871857, "num_tokens": 19737937.0, "step": 10090 }, { "entropy": 6.1574780464172365, "epoch": 1.00909681611436, "grad_norm": 1.359375, "learning_rate": 0.0004907014688604745, "loss": 5.8755, "mean_token_accuracy": 0.15403746962547302, "num_tokens": 19748270.0, "step": 10095 }, { "entropy": 6.055540752410889, "epoch": 1.0095966411755886, "grad_norm": 1.2578125, "learning_rate": 0.0004906913122554391, "loss": 5.785, "mean_token_accuracy": 0.1718839794397354, "num_tokens": 19758328.0, "step": 10100 }, { "entropy": 6.041609239578247, "epoch": 1.010096466236817, "grad_norm": 1.3828125, "learning_rate": 0.0004906811502236657, "loss": 5.8763, "mean_token_accuracy": 0.15874550640583038, "num_tokens": 19767780.0, "step": 10105 }, { "entropy": 6.164412021636963, "epoch": 1.0105962912980457, "grad_norm": 1.3046875, "learning_rate": 0.0004906709827654101, "loss": 6.0277, "mean_token_accuracy": 0.14890106469392778, "num_tokens": 19777202.0, "step": 10110 }, { "entropy": 6.127697563171386, "epoch": 1.0110961163592742, "grad_norm": 1.2734375, "learning_rate": 0.0004906608098809281, "loss": 5.9044, "mean_token_accuracy": 0.15777188315987586, "num_tokens": 19788341.0, "step": 10115 }, { "entropy": 6.209414720535278, "epoch": 1.011595941420503, "grad_norm": 1.28125, "learning_rate": 0.0004906506315704756, "loss": 5.9956, "mean_token_accuracy": 0.15578036308288573, "num_tokens": 19797511.0, "step": 10120 }, { "entropy": 6.216711091995239, "epoch": 1.0120957664817314, "grad_norm": 1.28125, "learning_rate": 0.0004906404478343087, "loss": 5.9775, "mean_token_accuracy": 0.15336853340268136, "num_tokens": 19807639.0, "step": 10125 }, { "entropy": 6.28025598526001, "epoch": 1.0125955915429599, "grad_norm": 1.1953125, "learning_rate": 0.0004906302586726837, "loss": 6.0724, "mean_token_accuracy": 0.14119457602500915, "num_tokens": 19818379.0, "step": 10130 }, { "entropy": 6.158285284042359, "epoch": 1.0130954166041886, "grad_norm": 1.34375, "learning_rate": 0.0004906200640858567, "loss": 5.9238, "mean_token_accuracy": 0.1623810574412346, "num_tokens": 19828706.0, "step": 10135 }, { "entropy": 6.16143159866333, "epoch": 1.013595241665417, "grad_norm": 1.3125, "learning_rate": 0.0004906098640740846, "loss": 5.9267, "mean_token_accuracy": 0.16458344906568528, "num_tokens": 19838361.0, "step": 10140 }, { "entropy": 6.168706655502319, "epoch": 1.0140950667266457, "grad_norm": 1.2109375, "learning_rate": 0.0004905996586376236, "loss": 5.9882, "mean_token_accuracy": 0.1580349773168564, "num_tokens": 19848205.0, "step": 10145 }, { "entropy": 6.149914503097534, "epoch": 1.0145948917878742, "grad_norm": 1.375, "learning_rate": 0.0004905894477767308, "loss": 6.0313, "mean_token_accuracy": 0.1549482248723507, "num_tokens": 19858490.0, "step": 10150 }, { "entropy": 6.14423098564148, "epoch": 1.015094716849103, "grad_norm": 1.2734375, "learning_rate": 0.0004905792314916629, "loss": 5.9811, "mean_token_accuracy": 0.1590231716632843, "num_tokens": 19867551.0, "step": 10155 }, { "entropy": 6.1879993915557865, "epoch": 1.0155945419103314, "grad_norm": 1.375, "learning_rate": 0.0004905690097826769, "loss": 6.0125, "mean_token_accuracy": 0.15192604959011077, "num_tokens": 19877581.0, "step": 10160 }, { "entropy": 6.287931060791015, "epoch": 1.0160943669715599, "grad_norm": 1.2265625, "learning_rate": 0.0004905587826500303, "loss": 6.0577, "mean_token_accuracy": 0.15124099403619767, "num_tokens": 19887827.0, "step": 10165 }, { "entropy": 6.198428535461426, "epoch": 1.0165941920327886, "grad_norm": 1.390625, "learning_rate": 0.0004905485500939801, "loss": 5.9433, "mean_token_accuracy": 0.15472912341356276, "num_tokens": 19897395.0, "step": 10170 }, { "entropy": 6.1713724613189695, "epoch": 1.017094017094017, "grad_norm": 1.2734375, "learning_rate": 0.0004905383121147838, "loss": 5.9413, "mean_token_accuracy": 0.15247184932231903, "num_tokens": 19906601.0, "step": 10175 }, { "entropy": 6.178199195861817, "epoch": 1.0175938421552457, "grad_norm": 1.359375, "learning_rate": 0.0004905280687126991, "loss": 5.8922, "mean_token_accuracy": 0.163296677172184, "num_tokens": 19916422.0, "step": 10180 }, { "entropy": 6.222864723205566, "epoch": 1.0180936672164742, "grad_norm": 1.265625, "learning_rate": 0.0004905178198879837, "loss": 6.018, "mean_token_accuracy": 0.14862206801772118, "num_tokens": 19927182.0, "step": 10185 }, { "entropy": 6.1625419616699215, "epoch": 1.018593492277703, "grad_norm": 1.9140625, "learning_rate": 0.0004905075656408953, "loss": 5.9987, "mean_token_accuracy": 0.14578914418816566, "num_tokens": 19936537.0, "step": 10190 }, { "entropy": 6.200917482376099, "epoch": 1.0190933173389314, "grad_norm": 1.3671875, "learning_rate": 0.000490497305971692, "loss": 5.9958, "mean_token_accuracy": 0.1549546502530575, "num_tokens": 19946315.0, "step": 10195 }, { "entropy": 6.184721279144287, "epoch": 1.0195931424001599, "grad_norm": 1.2421875, "learning_rate": 0.000490487040880632, "loss": 5.8883, "mean_token_accuracy": 0.15741394013166427, "num_tokens": 19956145.0, "step": 10200 }, { "entropy": 6.202844524383545, "epoch": 1.0200929674613886, "grad_norm": 1.21875, "learning_rate": 0.0004904767703679735, "loss": 6.0178, "mean_token_accuracy": 0.14768111780285836, "num_tokens": 19966890.0, "step": 10205 }, { "entropy": 6.194277238845825, "epoch": 1.020592792522617, "grad_norm": 1.2421875, "learning_rate": 0.0004904664944339748, "loss": 5.9757, "mean_token_accuracy": 0.1512325443327427, "num_tokens": 19976156.0, "step": 10210 }, { "entropy": 6.201154279708862, "epoch": 1.0210926175838457, "grad_norm": 1.2109375, "learning_rate": 0.0004904562130788947, "loss": 5.8991, "mean_token_accuracy": 0.16157799661159516, "num_tokens": 19985851.0, "step": 10215 }, { "entropy": 6.1232868194580075, "epoch": 1.0215924426450742, "grad_norm": 1.3359375, "learning_rate": 0.0004904459263029916, "loss": 5.9988, "mean_token_accuracy": 0.1600301131606102, "num_tokens": 19996531.0, "step": 10220 }, { "entropy": 6.187566947937012, "epoch": 1.0220922677063027, "grad_norm": 1.46875, "learning_rate": 0.0004904356341065245, "loss": 5.8594, "mean_token_accuracy": 0.15702765434980392, "num_tokens": 20006050.0, "step": 10225 }, { "entropy": 6.199140501022339, "epoch": 1.0225920927675314, "grad_norm": 1.2890625, "learning_rate": 0.0004904253364897521, "loss": 5.9988, "mean_token_accuracy": 0.14996725916862488, "num_tokens": 20015997.0, "step": 10230 }, { "entropy": 6.206694078445435, "epoch": 1.0230919178287599, "grad_norm": 1.2421875, "learning_rate": 0.0004904150334529339, "loss": 6.1179, "mean_token_accuracy": 0.14577429443597795, "num_tokens": 20026682.0, "step": 10235 }, { "entropy": 6.186622428894043, "epoch": 1.0235917428899886, "grad_norm": 2.234375, "learning_rate": 0.0004904047249963289, "loss": 5.9273, "mean_token_accuracy": 0.15516939610242844, "num_tokens": 20036166.0, "step": 10240 }, { "entropy": 6.131216526031494, "epoch": 1.024091567951217, "grad_norm": 1.1875, "learning_rate": 0.0004903944111201964, "loss": 5.8999, "mean_token_accuracy": 0.16437097936868666, "num_tokens": 20045545.0, "step": 10245 }, { "entropy": 6.2051472663879395, "epoch": 1.0245913930124457, "grad_norm": 1.375, "learning_rate": 0.0004903840918247958, "loss": 5.9138, "mean_token_accuracy": 0.15454999953508378, "num_tokens": 20055072.0, "step": 10250 }, { "entropy": 6.251996040344238, "epoch": 1.0250912180736742, "grad_norm": 1.2578125, "learning_rate": 0.000490373767110387, "loss": 6.0258, "mean_token_accuracy": 0.14834926277399063, "num_tokens": 20064227.0, "step": 10255 }, { "entropy": 6.1686817646026615, "epoch": 1.0255910431349027, "grad_norm": 1.4296875, "learning_rate": 0.0004903634369772296, "loss": 5.9727, "mean_token_accuracy": 0.158766470849514, "num_tokens": 20074833.0, "step": 10260 }, { "entropy": 6.166867446899414, "epoch": 1.0260908681961314, "grad_norm": 1.25, "learning_rate": 0.0004903531014255835, "loss": 5.9593, "mean_token_accuracy": 0.1468280076980591, "num_tokens": 20084340.0, "step": 10265 }, { "entropy": 6.248073768615723, "epoch": 1.0265906932573599, "grad_norm": 1.4296875, "learning_rate": 0.0004903427604557089, "loss": 5.9467, "mean_token_accuracy": 0.15468152165412902, "num_tokens": 20094372.0, "step": 10270 }, { "entropy": 6.214684915542603, "epoch": 1.0270905183185886, "grad_norm": 1.3125, "learning_rate": 0.0004903324140678658, "loss": 5.9069, "mean_token_accuracy": 0.1550743706524372, "num_tokens": 20104015.0, "step": 10275 }, { "entropy": 6.157267093658447, "epoch": 1.027590343379817, "grad_norm": 1.40625, "learning_rate": 0.0004903220622623146, "loss": 5.9366, "mean_token_accuracy": 0.1536530524492264, "num_tokens": 20113570.0, "step": 10280 }, { "entropy": 6.144119644165039, "epoch": 1.0280901684410457, "grad_norm": 1.1484375, "learning_rate": 0.0004903117050393157, "loss": 5.9728, "mean_token_accuracy": 0.15331557244062424, "num_tokens": 20124147.0, "step": 10285 }, { "entropy": 6.165179967880249, "epoch": 1.0285899935022742, "grad_norm": 1.1640625, "learning_rate": 0.0004903013423991296, "loss": 5.9965, "mean_token_accuracy": 0.14884453564882277, "num_tokens": 20134310.0, "step": 10290 }, { "entropy": 6.175594902038574, "epoch": 1.0290898185635027, "grad_norm": 1.28125, "learning_rate": 0.0004902909743420173, "loss": 5.9209, "mean_token_accuracy": 0.15928234159946442, "num_tokens": 20143894.0, "step": 10295 }, { "entropy": 6.178833293914795, "epoch": 1.0295896436247314, "grad_norm": 1.109375, "learning_rate": 0.0004902806008682394, "loss": 5.9891, "mean_token_accuracy": 0.15750854164361955, "num_tokens": 20154862.0, "step": 10300 }, { "entropy": 6.1593873500823975, "epoch": 1.0300894686859599, "grad_norm": 1.4921875, "learning_rate": 0.000490270221978057, "loss": 5.8979, "mean_token_accuracy": 0.15869831740856172, "num_tokens": 20164109.0, "step": 10305 }, { "entropy": 6.223573780059814, "epoch": 1.0305892937471886, "grad_norm": 1.3046875, "learning_rate": 0.0004902598376717312, "loss": 5.9608, "mean_token_accuracy": 0.14981644973158836, "num_tokens": 20173971.0, "step": 10310 }, { "entropy": 6.16736626625061, "epoch": 1.031089118808417, "grad_norm": 1.265625, "learning_rate": 0.0004902494479495233, "loss": 6.012, "mean_token_accuracy": 0.14979782402515412, "num_tokens": 20183683.0, "step": 10315 }, { "entropy": 6.160792303085327, "epoch": 1.0315889438696457, "grad_norm": 1.375, "learning_rate": 0.0004902390528116946, "loss": 5.9017, "mean_token_accuracy": 0.15736511200666428, "num_tokens": 20192945.0, "step": 10320 }, { "entropy": 6.186724424362183, "epoch": 1.0320887689308742, "grad_norm": 1.1875, "learning_rate": 0.0004902286522585068, "loss": 5.9689, "mean_token_accuracy": 0.1567423090338707, "num_tokens": 20202919.0, "step": 10325 }, { "entropy": 6.137691164016724, "epoch": 1.0325885939921027, "grad_norm": 1.40625, "learning_rate": 0.0004902182462902215, "loss": 5.889, "mean_token_accuracy": 0.16214252412319183, "num_tokens": 20212377.0, "step": 10330 }, { "entropy": 6.138012838363648, "epoch": 1.0330884190533314, "grad_norm": 1.40625, "learning_rate": 0.0004902078349071004, "loss": 5.8658, "mean_token_accuracy": 0.16125884354114534, "num_tokens": 20221083.0, "step": 10335 }, { "entropy": 6.157989549636841, "epoch": 1.0335882441145599, "grad_norm": 1.3125, "learning_rate": 0.0004901974181094057, "loss": 6.0032, "mean_token_accuracy": 0.15755846947431565, "num_tokens": 20229577.0, "step": 10340 }, { "entropy": 6.204761075973511, "epoch": 1.0340880691757885, "grad_norm": 1.234375, "learning_rate": 0.0004901869958973991, "loss": 5.8633, "mean_token_accuracy": 0.16452007442712785, "num_tokens": 20238400.0, "step": 10345 }, { "entropy": 6.0796619892120365, "epoch": 1.034587894237017, "grad_norm": 1.28125, "learning_rate": 0.0004901765682713432, "loss": 6.0086, "mean_token_accuracy": 0.15354873538017272, "num_tokens": 20248479.0, "step": 10350 }, { "entropy": 6.1550952911376955, "epoch": 1.0350877192982457, "grad_norm": 1.296875, "learning_rate": 0.0004901661352315003, "loss": 5.9677, "mean_token_accuracy": 0.15186137706041336, "num_tokens": 20258268.0, "step": 10355 }, { "entropy": 6.199358510971069, "epoch": 1.0355875443594742, "grad_norm": 1.28125, "learning_rate": 0.0004901556967781327, "loss": 5.9001, "mean_token_accuracy": 0.16515364050865172, "num_tokens": 20267924.0, "step": 10360 }, { "entropy": 6.216310834884643, "epoch": 1.0360873694207027, "grad_norm": 1.4375, "learning_rate": 0.0004901452529115031, "loss": 5.9963, "mean_token_accuracy": 0.14871933683753014, "num_tokens": 20278173.0, "step": 10365 }, { "entropy": 6.076262331008911, "epoch": 1.0365871944819314, "grad_norm": 1.1953125, "learning_rate": 0.0004901348036318743, "loss": 5.8917, "mean_token_accuracy": 0.15932832062244415, "num_tokens": 20287557.0, "step": 10370 }, { "entropy": 6.1769074440002445, "epoch": 1.0370870195431598, "grad_norm": 1.3515625, "learning_rate": 0.0004901243489395093, "loss": 6.0269, "mean_token_accuracy": 0.15256206318736076, "num_tokens": 20297517.0, "step": 10375 }, { "entropy": 6.19257378578186, "epoch": 1.0375868446043885, "grad_norm": 1.296875, "learning_rate": 0.000490113888834671, "loss": 5.85, "mean_token_accuracy": 0.16008726358413697, "num_tokens": 20308029.0, "step": 10380 }, { "entropy": 6.060464477539062, "epoch": 1.038086669665617, "grad_norm": 1.21875, "learning_rate": 0.0004901034233176227, "loss": 5.8334, "mean_token_accuracy": 0.16678026169538498, "num_tokens": 20318962.0, "step": 10385 }, { "entropy": 6.1899237632751465, "epoch": 1.0385864947268455, "grad_norm": 1.625, "learning_rate": 0.0004900929523886274, "loss": 5.97, "mean_token_accuracy": 0.14651992917060852, "num_tokens": 20328729.0, "step": 10390 }, { "entropy": 6.220776700973511, "epoch": 1.0390863197880742, "grad_norm": 1.2109375, "learning_rate": 0.000490082476047949, "loss": 5.9933, "mean_token_accuracy": 0.1497042030096054, "num_tokens": 20339002.0, "step": 10395 }, { "entropy": 6.180819177627564, "epoch": 1.0395861448493027, "grad_norm": 1.4296875, "learning_rate": 0.0004900719942958506, "loss": 5.9198, "mean_token_accuracy": 0.16357310861349106, "num_tokens": 20347869.0, "step": 10400 }, { "entropy": 6.1000371932983395, "epoch": 1.0400859699105314, "grad_norm": 1.3828125, "learning_rate": 0.0004900615071325963, "loss": 5.8023, "mean_token_accuracy": 0.16311781257390975, "num_tokens": 20356609.0, "step": 10405 }, { "entropy": 6.078080701828003, "epoch": 1.0405857949717598, "grad_norm": 1.125, "learning_rate": 0.00049005101455845, "loss": 5.894, "mean_token_accuracy": 0.16752987056970597, "num_tokens": 20368793.0, "step": 10410 }, { "entropy": 6.09317102432251, "epoch": 1.0410856200329885, "grad_norm": 1.3125, "learning_rate": 0.0004900405165736753, "loss": 5.8483, "mean_token_accuracy": 0.1591524973511696, "num_tokens": 20379525.0, "step": 10415 }, { "entropy": 6.207449197769165, "epoch": 1.041585445094217, "grad_norm": 1.25, "learning_rate": 0.0004900300131785365, "loss": 5.9523, "mean_token_accuracy": 0.15846727937459945, "num_tokens": 20388253.0, "step": 10420 }, { "entropy": 6.118882846832276, "epoch": 1.0420852701554455, "grad_norm": 1.265625, "learning_rate": 0.000490019504373298, "loss": 5.9553, "mean_token_accuracy": 0.1522550530731678, "num_tokens": 20398086.0, "step": 10425 }, { "entropy": 6.122468042373657, "epoch": 1.0425850952166742, "grad_norm": 1.3671875, "learning_rate": 0.0004900089901582241, "loss": 6.0355, "mean_token_accuracy": 0.1552769273519516, "num_tokens": 20408113.0, "step": 10430 }, { "entropy": 6.203159952163697, "epoch": 1.0430849202779027, "grad_norm": 1.3359375, "learning_rate": 0.0004899984705335792, "loss": 6.0069, "mean_token_accuracy": 0.1545163795351982, "num_tokens": 20417717.0, "step": 10435 }, { "entropy": 6.14851222038269, "epoch": 1.0435847453391314, "grad_norm": 1.171875, "learning_rate": 0.0004899879454996282, "loss": 5.8783, "mean_token_accuracy": 0.158889739215374, "num_tokens": 20428307.0, "step": 10440 }, { "entropy": 6.063283061981201, "epoch": 1.0440845704003598, "grad_norm": 1.2421875, "learning_rate": 0.0004899774150566358, "loss": 5.908, "mean_token_accuracy": 0.1610788583755493, "num_tokens": 20437493.0, "step": 10445 }, { "entropy": 6.132338953018189, "epoch": 1.0445843954615885, "grad_norm": 1.5234375, "learning_rate": 0.000489966879204867, "loss": 5.9505, "mean_token_accuracy": 0.155977825820446, "num_tokens": 20448218.0, "step": 10450 }, { "entropy": 6.242360305786133, "epoch": 1.045084220522817, "grad_norm": 1.265625, "learning_rate": 0.0004899563379445869, "loss": 5.9753, "mean_token_accuracy": 0.15821472853422164, "num_tokens": 20457478.0, "step": 10455 }, { "entropy": 6.180446910858154, "epoch": 1.0455840455840455, "grad_norm": 1.359375, "learning_rate": 0.0004899457912760605, "loss": 5.8657, "mean_token_accuracy": 0.16103392392396926, "num_tokens": 20466776.0, "step": 10460 }, { "entropy": 6.099647903442383, "epoch": 1.0460838706452742, "grad_norm": 1.234375, "learning_rate": 0.0004899352391995533, "loss": 5.9161, "mean_token_accuracy": 0.15760088115930557, "num_tokens": 20476461.0, "step": 10465 }, { "entropy": 6.081489419937133, "epoch": 1.0465836957065027, "grad_norm": 1.1875, "learning_rate": 0.0004899246817153309, "loss": 5.9535, "mean_token_accuracy": 0.15264288932085038, "num_tokens": 20487022.0, "step": 10470 }, { "entropy": 6.1263350486755375, "epoch": 1.0470835207677314, "grad_norm": 1.3984375, "learning_rate": 0.0004899141188236587, "loss": 5.8985, "mean_token_accuracy": 0.15767640322446824, "num_tokens": 20496326.0, "step": 10475 }, { "entropy": 6.2036134719848635, "epoch": 1.0475833458289598, "grad_norm": 1.4765625, "learning_rate": 0.0004899035505248027, "loss": 5.9145, "mean_token_accuracy": 0.15668063312768937, "num_tokens": 20504933.0, "step": 10480 }, { "entropy": 6.120710277557373, "epoch": 1.0480831708901883, "grad_norm": 1.296875, "learning_rate": 0.0004898929768190286, "loss": 5.9022, "mean_token_accuracy": 0.1550515353679657, "num_tokens": 20513931.0, "step": 10485 }, { "entropy": 6.077323150634766, "epoch": 1.048582995951417, "grad_norm": 1.265625, "learning_rate": 0.0004898823977066024, "loss": 5.8552, "mean_token_accuracy": 0.16517774388194084, "num_tokens": 20523176.0, "step": 10490 }, { "entropy": 6.139301681518555, "epoch": 1.0490828210126455, "grad_norm": 1.3125, "learning_rate": 0.0004898718131877906, "loss": 5.9591, "mean_token_accuracy": 0.15306072384119035, "num_tokens": 20533049.0, "step": 10495 }, { "entropy": 6.1143545627594, "epoch": 1.0495826460738742, "grad_norm": 1.2890625, "learning_rate": 0.0004898612232628591, "loss": 5.8422, "mean_token_accuracy": 0.15934127420186997, "num_tokens": 20542132.0, "step": 10500 }, { "entropy": 6.1658447742462155, "epoch": 1.0500824711351027, "grad_norm": 1.265625, "learning_rate": 0.0004898506279320745, "loss": 5.9459, "mean_token_accuracy": 0.15497103929519654, "num_tokens": 20551779.0, "step": 10505 }, { "entropy": 6.154783296585083, "epoch": 1.0505822961963314, "grad_norm": 1.34375, "learning_rate": 0.0004898400271957034, "loss": 5.9955, "mean_token_accuracy": 0.1522693380713463, "num_tokens": 20560548.0, "step": 10510 }, { "entropy": 6.157649755477905, "epoch": 1.0510821212575598, "grad_norm": 1.2265625, "learning_rate": 0.0004898294210540126, "loss": 6.0489, "mean_token_accuracy": 0.15239737778902054, "num_tokens": 20570909.0, "step": 10515 }, { "entropy": 6.240548419952392, "epoch": 1.0515819463187883, "grad_norm": 1.1875, "learning_rate": 0.0004898188095072688, "loss": 5.9728, "mean_token_accuracy": 0.14969491511583327, "num_tokens": 20580367.0, "step": 10520 }, { "entropy": 6.20021014213562, "epoch": 1.052081771380017, "grad_norm": 1.21875, "learning_rate": 0.000489808192555739, "loss": 5.8877, "mean_token_accuracy": 0.15834127366542816, "num_tokens": 20589653.0, "step": 10525 }, { "entropy": 6.113036441802978, "epoch": 1.0525815964412455, "grad_norm": 1.2890625, "learning_rate": 0.0004897975701996903, "loss": 5.9109, "mean_token_accuracy": 0.15765326619148254, "num_tokens": 20599530.0, "step": 10530 }, { "entropy": 6.0761730670928955, "epoch": 1.0530814215024742, "grad_norm": 1.3515625, "learning_rate": 0.0004897869424393902, "loss": 5.8967, "mean_token_accuracy": 0.15822335332632065, "num_tokens": 20607989.0, "step": 10535 }, { "entropy": 6.134182596206665, "epoch": 1.0535812465637027, "grad_norm": 1.1171875, "learning_rate": 0.0004897763092751057, "loss": 5.8894, "mean_token_accuracy": 0.15557971596717834, "num_tokens": 20618315.0, "step": 10540 }, { "entropy": 6.110230112075806, "epoch": 1.0540810716249314, "grad_norm": 1.3046875, "learning_rate": 0.0004897656707071045, "loss": 5.9613, "mean_token_accuracy": 0.15172860473394395, "num_tokens": 20627554.0, "step": 10545 }, { "entropy": 6.116087198257446, "epoch": 1.0545808966861598, "grad_norm": 1.2734375, "learning_rate": 0.0004897550267356545, "loss": 5.9363, "mean_token_accuracy": 0.15402805656194687, "num_tokens": 20636841.0, "step": 10550 }, { "entropy": 6.125463628768921, "epoch": 1.0550807217473883, "grad_norm": 1.2265625, "learning_rate": 0.0004897443773610231, "loss": 5.8714, "mean_token_accuracy": 0.1593158110976219, "num_tokens": 20647129.0, "step": 10555 }, { "entropy": 6.190079593658448, "epoch": 1.055580546808617, "grad_norm": 1.578125, "learning_rate": 0.0004897337225834785, "loss": 5.9771, "mean_token_accuracy": 0.14718882888555526, "num_tokens": 20657971.0, "step": 10560 }, { "entropy": 6.164877271652221, "epoch": 1.0560803718698455, "grad_norm": 1.2890625, "learning_rate": 0.0004897230624032888, "loss": 5.9546, "mean_token_accuracy": 0.15360582023859023, "num_tokens": 20666266.0, "step": 10565 }, { "entropy": 6.191629362106323, "epoch": 1.0565801969310742, "grad_norm": 1.203125, "learning_rate": 0.0004897123968207219, "loss": 5.9373, "mean_token_accuracy": 0.15611499547958374, "num_tokens": 20676454.0, "step": 10570 }, { "entropy": 6.147012376785279, "epoch": 1.0570800219923027, "grad_norm": 1.265625, "learning_rate": 0.0004897017258360465, "loss": 6.0234, "mean_token_accuracy": 0.15055552497506142, "num_tokens": 20687333.0, "step": 10575 }, { "entropy": 6.109683704376221, "epoch": 1.0575798470535314, "grad_norm": 1.1875, "learning_rate": 0.0004896910494495308, "loss": 5.8385, "mean_token_accuracy": 0.16457239985466005, "num_tokens": 20696530.0, "step": 10580 }, { "entropy": 6.157804250717163, "epoch": 1.0580796721147598, "grad_norm": 1.40625, "learning_rate": 0.0004896803676614436, "loss": 6.0031, "mean_token_accuracy": 0.15323769450187683, "num_tokens": 20706674.0, "step": 10585 }, { "entropy": 6.066685962677002, "epoch": 1.0585794971759883, "grad_norm": 1.40625, "learning_rate": 0.0004896696804720536, "loss": 5.8219, "mean_token_accuracy": 0.1718673124909401, "num_tokens": 20715695.0, "step": 10590 }, { "entropy": 6.163532495498657, "epoch": 1.059079322237217, "grad_norm": 1.2421875, "learning_rate": 0.0004896589878816297, "loss": 6.0013, "mean_token_accuracy": 0.15940355211496354, "num_tokens": 20725763.0, "step": 10595 }, { "entropy": 6.115515184402466, "epoch": 1.0595791472984455, "grad_norm": 2.265625, "learning_rate": 0.0004896482898904409, "loss": 5.9239, "mean_token_accuracy": 0.15567436814308167, "num_tokens": 20734944.0, "step": 10600 }, { "entropy": 6.126058673858642, "epoch": 1.0600789723596742, "grad_norm": 1.359375, "learning_rate": 0.0004896375864987563, "loss": 5.8959, "mean_token_accuracy": 0.1661020740866661, "num_tokens": 20744951.0, "step": 10605 }, { "entropy": 6.125064563751221, "epoch": 1.0605787974209027, "grad_norm": 1.1640625, "learning_rate": 0.0004896268777068453, "loss": 5.8637, "mean_token_accuracy": 0.16403547376394273, "num_tokens": 20754937.0, "step": 10610 }, { "entropy": 6.165239095687866, "epoch": 1.0610786224821314, "grad_norm": 1.25, "learning_rate": 0.0004896161635149773, "loss": 5.9564, "mean_token_accuracy": 0.14778674244880677, "num_tokens": 20767373.0, "step": 10615 }, { "entropy": 6.1061114311218265, "epoch": 1.0615784475433598, "grad_norm": 1.2734375, "learning_rate": 0.0004896054439234217, "loss": 5.8972, "mean_token_accuracy": 0.15883555710315705, "num_tokens": 20777647.0, "step": 10620 }, { "entropy": 6.103294754028321, "epoch": 1.0620782726045883, "grad_norm": 1.3046875, "learning_rate": 0.0004895947189324486, "loss": 5.9224, "mean_token_accuracy": 0.16352221071720124, "num_tokens": 20788598.0, "step": 10625 }, { "entropy": 6.101770830154419, "epoch": 1.062578097665817, "grad_norm": 1.1640625, "learning_rate": 0.0004895839885423273, "loss": 5.8817, "mean_token_accuracy": 0.16014006584882737, "num_tokens": 20798586.0, "step": 10630 }, { "entropy": 6.115962743759155, "epoch": 1.0630779227270455, "grad_norm": 1.28125, "learning_rate": 0.0004895732527533283, "loss": 5.8752, "mean_token_accuracy": 0.16609516739845276, "num_tokens": 20807447.0, "step": 10635 }, { "entropy": 6.08459095954895, "epoch": 1.0635777477882742, "grad_norm": 1.1953125, "learning_rate": 0.0004895625115657215, "loss": 5.9168, "mean_token_accuracy": 0.1622459352016449, "num_tokens": 20817889.0, "step": 10640 }, { "entropy": 6.129696464538574, "epoch": 1.0640775728495027, "grad_norm": 1.34375, "learning_rate": 0.000489551764979777, "loss": 5.9092, "mean_token_accuracy": 0.15434760004281997, "num_tokens": 20827858.0, "step": 10645 }, { "entropy": 6.117703628540039, "epoch": 1.0645773979107314, "grad_norm": 1.234375, "learning_rate": 0.0004895410129957653, "loss": 5.9131, "mean_token_accuracy": 0.1598484195768833, "num_tokens": 20837114.0, "step": 10650 }, { "entropy": 6.186951684951782, "epoch": 1.0650772229719598, "grad_norm": 1.3515625, "learning_rate": 0.0004895302556139569, "loss": 5.9688, "mean_token_accuracy": 0.15327855944633484, "num_tokens": 20846979.0, "step": 10655 }, { "entropy": 6.123814678192138, "epoch": 1.0655770480331883, "grad_norm": 1.2421875, "learning_rate": 0.0004895194928346226, "loss": 5.9925, "mean_token_accuracy": 0.15588875859975815, "num_tokens": 20856831.0, "step": 10660 }, { "entropy": 6.055693435668945, "epoch": 1.066076873094417, "grad_norm": 2.359375, "learning_rate": 0.000489508724658033, "loss": 5.8917, "mean_token_accuracy": 0.16461400240659713, "num_tokens": 20866203.0, "step": 10665 }, { "entropy": 6.1558702945709225, "epoch": 1.0665766981556455, "grad_norm": 1.1328125, "learning_rate": 0.000489497951084459, "loss": 5.8926, "mean_token_accuracy": 0.15563634037971497, "num_tokens": 20875813.0, "step": 10670 }, { "entropy": 6.209543323516845, "epoch": 1.0670765232168742, "grad_norm": 1.203125, "learning_rate": 0.0004894871721141718, "loss": 5.9519, "mean_token_accuracy": 0.15867811739444732, "num_tokens": 20884773.0, "step": 10675 }, { "entropy": 6.081042146682739, "epoch": 1.0675763482781027, "grad_norm": 1.296875, "learning_rate": 0.0004894763877474426, "loss": 5.8898, "mean_token_accuracy": 0.16398087441921233, "num_tokens": 20894305.0, "step": 10680 }, { "entropy": 6.073525714874267, "epoch": 1.0680761733393311, "grad_norm": 1.3125, "learning_rate": 0.0004894655979845427, "loss": 5.9745, "mean_token_accuracy": 0.15942955762147903, "num_tokens": 20903849.0, "step": 10685 }, { "entropy": 6.120926427841186, "epoch": 1.0685759984005598, "grad_norm": 1.2578125, "learning_rate": 0.0004894548028257434, "loss": 5.8537, "mean_token_accuracy": 0.16132117360830306, "num_tokens": 20913380.0, "step": 10690 }, { "entropy": 6.097256088256836, "epoch": 1.0690758234617883, "grad_norm": 1.234375, "learning_rate": 0.0004894440022713165, "loss": 5.9502, "mean_token_accuracy": 0.1568446233868599, "num_tokens": 20923921.0, "step": 10695 }, { "entropy": 6.138236141204834, "epoch": 1.069575648523017, "grad_norm": 1.2265625, "learning_rate": 0.0004894331963215337, "loss": 5.8744, "mean_token_accuracy": 0.15862390846014024, "num_tokens": 20934613.0, "step": 10700 }, { "entropy": 6.113357877731323, "epoch": 1.0700754735842455, "grad_norm": 1.296875, "learning_rate": 0.000489422384976667, "loss": 5.926, "mean_token_accuracy": 0.15920139849185944, "num_tokens": 20944052.0, "step": 10705 }, { "entropy": 6.126824426651001, "epoch": 1.0705752986454742, "grad_norm": 1.34375, "learning_rate": 0.0004894115682369881, "loss": 5.9411, "mean_token_accuracy": 0.15480325222015381, "num_tokens": 20953406.0, "step": 10710 }, { "entropy": 6.194420385360718, "epoch": 1.0710751237067027, "grad_norm": 2.5625, "learning_rate": 0.0004894007461027693, "loss": 6.0491, "mean_token_accuracy": 0.15091044902801515, "num_tokens": 20963425.0, "step": 10715 }, { "entropy": 6.178598880767822, "epoch": 1.0715749487679311, "grad_norm": 1.2734375, "learning_rate": 0.0004893899185742828, "loss": 5.9963, "mean_token_accuracy": 0.15100168585777282, "num_tokens": 20973777.0, "step": 10720 }, { "entropy": 6.125496101379395, "epoch": 1.0720747738291598, "grad_norm": 1.5078125, "learning_rate": 0.0004893790856518014, "loss": 5.8597, "mean_token_accuracy": 0.15923932567238808, "num_tokens": 20983418.0, "step": 10725 }, { "entropy": 6.130977535247803, "epoch": 1.0725745988903883, "grad_norm": 1.6015625, "learning_rate": 0.0004893682473355972, "loss": 5.8473, "mean_token_accuracy": 0.15785391330718995, "num_tokens": 20993051.0, "step": 10730 }, { "entropy": 6.081547784805298, "epoch": 1.073074423951617, "grad_norm": 1.328125, "learning_rate": 0.0004893574036259432, "loss": 5.8879, "mean_token_accuracy": 0.1653227314352989, "num_tokens": 21003439.0, "step": 10735 }, { "entropy": 6.167814683914185, "epoch": 1.0735742490128455, "grad_norm": 1.2421875, "learning_rate": 0.0004893465545231119, "loss": 5.9135, "mean_token_accuracy": 0.16147751212120057, "num_tokens": 21013242.0, "step": 10740 }, { "entropy": 6.130961227416992, "epoch": 1.074074074074074, "grad_norm": 1.3671875, "learning_rate": 0.0004893357000273765, "loss": 5.9237, "mean_token_accuracy": 0.16037783026695251, "num_tokens": 21022268.0, "step": 10745 }, { "entropy": 6.143378162384034, "epoch": 1.0745738991353027, "grad_norm": 1.4140625, "learning_rate": 0.00048932484013901, "loss": 5.9653, "mean_token_accuracy": 0.15658110827207566, "num_tokens": 21032130.0, "step": 10750 }, { "entropy": 6.0662007331848145, "epoch": 1.0750737241965311, "grad_norm": 1.2421875, "learning_rate": 0.0004893139748582857, "loss": 5.8159, "mean_token_accuracy": 0.16519955098628997, "num_tokens": 21041966.0, "step": 10755 }, { "entropy": 6.034940147399903, "epoch": 1.0755735492577598, "grad_norm": 1.3046875, "learning_rate": 0.000489303104185477, "loss": 5.803, "mean_token_accuracy": 0.16406726092100143, "num_tokens": 21051270.0, "step": 10760 }, { "entropy": 6.187984228134155, "epoch": 1.0760733743189883, "grad_norm": 1.6015625, "learning_rate": 0.0004892922281208573, "loss": 6.0062, "mean_token_accuracy": 0.15241029858589172, "num_tokens": 21060926.0, "step": 10765 }, { "entropy": 6.244573545455933, "epoch": 1.076573199380217, "grad_norm": 1.2890625, "learning_rate": 0.0004892813466647002, "loss": 6.0579, "mean_token_accuracy": 0.14731452465057374, "num_tokens": 21071367.0, "step": 10770 }, { "entropy": 6.10287299156189, "epoch": 1.0770730244414455, "grad_norm": 1.140625, "learning_rate": 0.0004892704598172797, "loss": 5.9167, "mean_token_accuracy": 0.1556888461112976, "num_tokens": 21082775.0, "step": 10775 }, { "entropy": 6.177744340896607, "epoch": 1.077572849502674, "grad_norm": 1.328125, "learning_rate": 0.0004892595675788696, "loss": 6.0095, "mean_token_accuracy": 0.15000844076275827, "num_tokens": 21092018.0, "step": 10780 }, { "entropy": 6.177650499343872, "epoch": 1.0780726745639027, "grad_norm": 1.5390625, "learning_rate": 0.0004892486699497439, "loss": 5.9097, "mean_token_accuracy": 0.15728323087096213, "num_tokens": 21101246.0, "step": 10785 }, { "entropy": 6.1128153800964355, "epoch": 1.0785724996251311, "grad_norm": 1.46875, "learning_rate": 0.0004892377669301766, "loss": 5.958, "mean_token_accuracy": 0.1544174887239933, "num_tokens": 21110816.0, "step": 10790 }, { "entropy": 6.112386798858642, "epoch": 1.0790723246863598, "grad_norm": 1.3203125, "learning_rate": 0.0004892268585204423, "loss": 5.9314, "mean_token_accuracy": 0.15691734850406647, "num_tokens": 21120228.0, "step": 10795 }, { "entropy": 6.019856023788452, "epoch": 1.0795721497475883, "grad_norm": 1.1875, "learning_rate": 0.0004892159447208154, "loss": 5.8292, "mean_token_accuracy": 0.16394349187612534, "num_tokens": 21129921.0, "step": 10800 }, { "entropy": 6.138217449188232, "epoch": 1.080071974808817, "grad_norm": 1.265625, "learning_rate": 0.0004892050255315705, "loss": 6.0044, "mean_token_accuracy": 0.1535131722688675, "num_tokens": 21139605.0, "step": 10805 }, { "entropy": 6.071519994735718, "epoch": 1.0805717998700455, "grad_norm": 1.5, "learning_rate": 0.0004891941009529822, "loss": 5.8721, "mean_token_accuracy": 0.1676989421248436, "num_tokens": 21149004.0, "step": 10810 }, { "entropy": 6.19970121383667, "epoch": 1.081071624931274, "grad_norm": 1.15625, "learning_rate": 0.0004891831709853255, "loss": 5.9457, "mean_token_accuracy": 0.14905372858047486, "num_tokens": 21159013.0, "step": 10815 }, { "entropy": 6.138840961456299, "epoch": 1.0815714499925027, "grad_norm": 1.1953125, "learning_rate": 0.0004891722356288752, "loss": 5.88, "mean_token_accuracy": 0.1590219870209694, "num_tokens": 21169432.0, "step": 10820 }, { "entropy": 6.075982475280762, "epoch": 1.0820712750537311, "grad_norm": 1.140625, "learning_rate": 0.0004891612948839068, "loss": 5.8513, "mean_token_accuracy": 0.16560973972082138, "num_tokens": 21179672.0, "step": 10825 }, { "entropy": 6.06056957244873, "epoch": 1.0825711001149598, "grad_norm": 1.4140625, "learning_rate": 0.0004891503487506951, "loss": 5.8978, "mean_token_accuracy": 0.16178446263074875, "num_tokens": 21189562.0, "step": 10830 }, { "entropy": 6.20071120262146, "epoch": 1.0830709251761883, "grad_norm": 1.234375, "learning_rate": 0.0004891393972295159, "loss": 6.038, "mean_token_accuracy": 0.1428327202796936, "num_tokens": 21199538.0, "step": 10835 }, { "entropy": 6.1935553550720215, "epoch": 1.083570750237417, "grad_norm": 1.2109375, "learning_rate": 0.0004891284403206444, "loss": 5.9849, "mean_token_accuracy": 0.155917414277792, "num_tokens": 21209355.0, "step": 10840 }, { "entropy": 6.099454545974732, "epoch": 1.0840705752986455, "grad_norm": 1.25, "learning_rate": 0.0004891174780243566, "loss": 5.8697, "mean_token_accuracy": 0.16033392995595933, "num_tokens": 21218268.0, "step": 10845 }, { "entropy": 6.1465202331542965, "epoch": 1.084570400359874, "grad_norm": 1.1953125, "learning_rate": 0.000489106510340928, "loss": 5.9918, "mean_token_accuracy": 0.15531508922576903, "num_tokens": 21228376.0, "step": 10850 }, { "entropy": 6.220686721801758, "epoch": 1.0850702254211027, "grad_norm": 1.234375, "learning_rate": 0.0004890955372706348, "loss": 5.9884, "mean_token_accuracy": 0.15212095379829407, "num_tokens": 21237781.0, "step": 10855 }, { "entropy": 6.116746234893799, "epoch": 1.0855700504823311, "grad_norm": 1.328125, "learning_rate": 0.0004890845588137531, "loss": 5.8298, "mean_token_accuracy": 0.1613258957862854, "num_tokens": 21247096.0, "step": 10860 }, { "entropy": 6.115295934677124, "epoch": 1.0860698755435598, "grad_norm": 1.40625, "learning_rate": 0.0004890735749705587, "loss": 6.0153, "mean_token_accuracy": 0.15539822578430176, "num_tokens": 21258645.0, "step": 10865 }, { "entropy": 6.161628198623657, "epoch": 1.0865697006047883, "grad_norm": 1.3125, "learning_rate": 0.0004890625857413283, "loss": 5.9407, "mean_token_accuracy": 0.15730203241109847, "num_tokens": 21268634.0, "step": 10870 }, { "entropy": 6.155200004577637, "epoch": 1.087069525666017, "grad_norm": 1.25, "learning_rate": 0.0004890515911263385, "loss": 5.8998, "mean_token_accuracy": 0.1557600937783718, "num_tokens": 21278996.0, "step": 10875 }, { "entropy": 5.9977256774902346, "epoch": 1.0875693507272455, "grad_norm": 1.296875, "learning_rate": 0.0004890405911258656, "loss": 5.7303, "mean_token_accuracy": 0.17373621612787246, "num_tokens": 21288689.0, "step": 10880 }, { "entropy": 6.110237455368042, "epoch": 1.088069175788474, "grad_norm": 1.15625, "learning_rate": 0.0004890295857401866, "loss": 5.9598, "mean_token_accuracy": 0.15061759799718857, "num_tokens": 21298542.0, "step": 10885 }, { "entropy": 6.144878768920899, "epoch": 1.0885690008497027, "grad_norm": 1.3203125, "learning_rate": 0.0004890185749695783, "loss": 5.906, "mean_token_accuracy": 0.15705824345350267, "num_tokens": 21308035.0, "step": 10890 }, { "entropy": 6.221332359313965, "epoch": 1.0890688259109311, "grad_norm": 1.28125, "learning_rate": 0.0004890075588143176, "loss": 6.0395, "mean_token_accuracy": 0.1469349555671215, "num_tokens": 21317898.0, "step": 10895 }, { "entropy": 6.158019113540649, "epoch": 1.0895686509721598, "grad_norm": 1.21875, "learning_rate": 0.0004889965372746819, "loss": 5.9194, "mean_token_accuracy": 0.15325864255428315, "num_tokens": 21327347.0, "step": 10900 }, { "entropy": 6.153690147399902, "epoch": 1.0900684760333883, "grad_norm": 1.46875, "learning_rate": 0.0004889855103509484, "loss": 5.9502, "mean_token_accuracy": 0.15160580798983575, "num_tokens": 21336592.0, "step": 10905 }, { "entropy": 6.146178150177002, "epoch": 1.090568301094617, "grad_norm": 1.125, "learning_rate": 0.0004889744780433944, "loss": 5.9992, "mean_token_accuracy": 0.15149357169866562, "num_tokens": 21345764.0, "step": 10910 }, { "entropy": 6.1833874702453615, "epoch": 1.0910681261558455, "grad_norm": 1.1640625, "learning_rate": 0.0004889634403522976, "loss": 5.9173, "mean_token_accuracy": 0.1578316032886505, "num_tokens": 21354423.0, "step": 10915 }, { "entropy": 6.12634916305542, "epoch": 1.091567951217074, "grad_norm": 1.265625, "learning_rate": 0.0004889523972779359, "loss": 5.944, "mean_token_accuracy": 0.16468725353479385, "num_tokens": 21364407.0, "step": 10920 }, { "entropy": 6.190716123580932, "epoch": 1.0920677762783026, "grad_norm": 1.1953125, "learning_rate": 0.0004889413488205868, "loss": 6.0535, "mean_token_accuracy": 0.15155917033553123, "num_tokens": 21374642.0, "step": 10925 }, { "entropy": 6.089123868942261, "epoch": 1.0925676013395311, "grad_norm": 1.1875, "learning_rate": 0.0004889302949805283, "loss": 5.8216, "mean_token_accuracy": 0.1710789069533348, "num_tokens": 21384437.0, "step": 10930 }, { "entropy": 6.11716103553772, "epoch": 1.0930674264007598, "grad_norm": 1.2890625, "learning_rate": 0.0004889192357580388, "loss": 5.8411, "mean_token_accuracy": 0.16206925809383393, "num_tokens": 21393924.0, "step": 10935 }, { "entropy": 6.043091726303101, "epoch": 1.0935672514619883, "grad_norm": 1.375, "learning_rate": 0.0004889081711533964, "loss": 5.8672, "mean_token_accuracy": 0.16775585114955902, "num_tokens": 21402924.0, "step": 10940 }, { "entropy": 6.1635995388031, "epoch": 1.0940670765232168, "grad_norm": 1.234375, "learning_rate": 0.0004888971011668793, "loss": 6.0171, "mean_token_accuracy": 0.14716267064213753, "num_tokens": 21412422.0, "step": 10945 }, { "entropy": 6.181364631652832, "epoch": 1.0945669015844455, "grad_norm": 1.2421875, "learning_rate": 0.0004888860257987662, "loss": 5.9795, "mean_token_accuracy": 0.15764326080679894, "num_tokens": 21421830.0, "step": 10950 }, { "entropy": 6.143895864486694, "epoch": 1.095066726645674, "grad_norm": 1.2734375, "learning_rate": 0.0004888749450493358, "loss": 5.9125, "mean_token_accuracy": 0.16008587554097176, "num_tokens": 21431602.0, "step": 10955 }, { "entropy": 6.135023593902588, "epoch": 1.0955665517069026, "grad_norm": 1.328125, "learning_rate": 0.0004888638589188669, "loss": 5.9572, "mean_token_accuracy": 0.15589238554239274, "num_tokens": 21441110.0, "step": 10960 }, { "entropy": 6.194552850723267, "epoch": 1.0960663767681311, "grad_norm": 2.40625, "learning_rate": 0.0004888527674076382, "loss": 5.9732, "mean_token_accuracy": 0.1514907792210579, "num_tokens": 21450626.0, "step": 10965 }, { "entropy": 6.130096864700318, "epoch": 1.0965662018293598, "grad_norm": 1.2421875, "learning_rate": 0.000488841670515929, "loss": 5.8471, "mean_token_accuracy": 0.16127452552318572, "num_tokens": 21461174.0, "step": 10970 }, { "entropy": 6.110013437271118, "epoch": 1.0970660268905883, "grad_norm": 1.25, "learning_rate": 0.0004888305682440183, "loss": 5.9107, "mean_token_accuracy": 0.15942692905664443, "num_tokens": 21470895.0, "step": 10975 }, { "entropy": 6.081044864654541, "epoch": 1.0975658519518168, "grad_norm": 1.3125, "learning_rate": 0.0004888194605921855, "loss": 5.8517, "mean_token_accuracy": 0.16124730408191681, "num_tokens": 21480192.0, "step": 10980 }, { "entropy": 6.172085857391357, "epoch": 1.0980656770130455, "grad_norm": 1.25, "learning_rate": 0.0004888083475607102, "loss": 5.9504, "mean_token_accuracy": 0.1547415539622307, "num_tokens": 21489418.0, "step": 10985 }, { "entropy": 6.195443487167358, "epoch": 1.098565502074274, "grad_norm": 1.3515625, "learning_rate": 0.0004887972291498718, "loss": 6.0021, "mean_token_accuracy": 0.15475521832704545, "num_tokens": 21499228.0, "step": 10990 }, { "entropy": 6.194277811050415, "epoch": 1.0990653271355026, "grad_norm": 1.3359375, "learning_rate": 0.0004887861053599503, "loss": 5.8674, "mean_token_accuracy": 0.15728126466274261, "num_tokens": 21509051.0, "step": 10995 }, { "entropy": 6.1151832103729244, "epoch": 1.0995651521967311, "grad_norm": 1.3359375, "learning_rate": 0.0004887749761912252, "loss": 5.9378, "mean_token_accuracy": 0.15539976209402084, "num_tokens": 21518853.0, "step": 11000 }, { "entropy": 6.168104791641236, "epoch": 1.1000649772579596, "grad_norm": 1.9765625, "learning_rate": 0.0004887638416439768, "loss": 6.0083, "mean_token_accuracy": 0.1579429641366005, "num_tokens": 21528547.0, "step": 11005 }, { "entropy": 6.228917646408081, "epoch": 1.1005648023191883, "grad_norm": 1.171875, "learning_rate": 0.0004887527017184851, "loss": 5.9796, "mean_token_accuracy": 0.15040475875139236, "num_tokens": 21538166.0, "step": 11010 }, { "entropy": 6.192111921310425, "epoch": 1.1010646273804168, "grad_norm": 1.171875, "learning_rate": 0.0004887415564150305, "loss": 5.9326, "mean_token_accuracy": 0.15772496163845062, "num_tokens": 21548212.0, "step": 11015 }, { "entropy": 6.191812181472779, "epoch": 1.1015644524416455, "grad_norm": 1.3515625, "learning_rate": 0.0004887304057338934, "loss": 5.9243, "mean_token_accuracy": 0.15140566676855088, "num_tokens": 21558809.0, "step": 11020 }, { "entropy": 6.0244838237762455, "epoch": 1.102064277502874, "grad_norm": 1.1796875, "learning_rate": 0.000488719249675354, "loss": 5.8215, "mean_token_accuracy": 0.1684559941291809, "num_tokens": 21567923.0, "step": 11025 }, { "entropy": 6.051117420196533, "epoch": 1.1025641025641026, "grad_norm": 1.1484375, "learning_rate": 0.0004887080882396936, "loss": 5.9449, "mean_token_accuracy": 0.16105058640241623, "num_tokens": 21578051.0, "step": 11030 }, { "entropy": 6.105144405364991, "epoch": 1.1030639276253311, "grad_norm": 1.390625, "learning_rate": 0.0004886969214271925, "loss": 5.9608, "mean_token_accuracy": 0.16272468864917755, "num_tokens": 21586950.0, "step": 11035 }, { "entropy": 6.1967620849609375, "epoch": 1.1035637526865596, "grad_norm": 1.1953125, "learning_rate": 0.0004886857492381319, "loss": 5.953, "mean_token_accuracy": 0.15561981797218322, "num_tokens": 21596577.0, "step": 11040 }, { "entropy": 6.191910457611084, "epoch": 1.1040635777477883, "grad_norm": 1.3203125, "learning_rate": 0.0004886745716727928, "loss": 5.9874, "mean_token_accuracy": 0.15815995931625365, "num_tokens": 21606474.0, "step": 11045 }, { "entropy": 6.085840225219727, "epoch": 1.1045634028090168, "grad_norm": 1.328125, "learning_rate": 0.0004886633887314565, "loss": 5.7953, "mean_token_accuracy": 0.16914485394954681, "num_tokens": 21616277.0, "step": 11050 }, { "entropy": 6.156643676757812, "epoch": 1.1050632278702455, "grad_norm": 1.3359375, "learning_rate": 0.0004886522004144044, "loss": 5.981, "mean_token_accuracy": 0.1498487636446953, "num_tokens": 21626096.0, "step": 11055 }, { "entropy": 6.199607944488525, "epoch": 1.105563052931474, "grad_norm": 1.328125, "learning_rate": 0.0004886410067219178, "loss": 6.0119, "mean_token_accuracy": 0.1499502770602703, "num_tokens": 21635295.0, "step": 11060 }, { "entropy": 6.224227237701416, "epoch": 1.1060628779927026, "grad_norm": 1.359375, "learning_rate": 0.0004886298076542785, "loss": 6.023, "mean_token_accuracy": 0.1452885553240776, "num_tokens": 21645900.0, "step": 11065 }, { "entropy": 6.121536016464233, "epoch": 1.1065627030539311, "grad_norm": 1.3046875, "learning_rate": 0.0004886186032117682, "loss": 5.9212, "mean_token_accuracy": 0.15657880008220673, "num_tokens": 21654757.0, "step": 11070 }, { "entropy": 6.091936302185059, "epoch": 1.1070625281151596, "grad_norm": 1.3203125, "learning_rate": 0.0004886073933946688, "loss": 5.8579, "mean_token_accuracy": 0.16425320208072663, "num_tokens": 21665253.0, "step": 11075 }, { "entropy": 6.04825987815857, "epoch": 1.1075623531763883, "grad_norm": 1.640625, "learning_rate": 0.0004885961782032624, "loss": 5.7777, "mean_token_accuracy": 0.17008589953184128, "num_tokens": 21674345.0, "step": 11080 }, { "entropy": 6.104118824005127, "epoch": 1.1080621782376168, "grad_norm": 1.515625, "learning_rate": 0.000488584957637831, "loss": 5.9636, "mean_token_accuracy": 0.15971079617738723, "num_tokens": 21683110.0, "step": 11085 }, { "entropy": 6.0610589504241945, "epoch": 1.1085620032988455, "grad_norm": 1.390625, "learning_rate": 0.0004885737316986571, "loss": 5.8419, "mean_token_accuracy": 0.16379538476467131, "num_tokens": 21692141.0, "step": 11090 }, { "entropy": 6.2004670143127445, "epoch": 1.109061828360074, "grad_norm": 1.2109375, "learning_rate": 0.000488562500386023, "loss": 5.9557, "mean_token_accuracy": 0.15822781026363372, "num_tokens": 21700945.0, "step": 11095 }, { "entropy": 6.076145982742309, "epoch": 1.1095616534213026, "grad_norm": 1.328125, "learning_rate": 0.0004885512637002115, "loss": 5.8555, "mean_token_accuracy": 0.17093067169189452, "num_tokens": 21711630.0, "step": 11100 }, { "entropy": 6.213993406295776, "epoch": 1.1100614784825311, "grad_norm": 1.234375, "learning_rate": 0.0004885400216415051, "loss": 6.0415, "mean_token_accuracy": 0.14727294221520423, "num_tokens": 21721673.0, "step": 11105 }, { "entropy": 6.225103759765625, "epoch": 1.1105613035437596, "grad_norm": 1.4375, "learning_rate": 0.0004885287742101865, "loss": 5.9774, "mean_token_accuracy": 0.14789579063653946, "num_tokens": 21731655.0, "step": 11110 }, { "entropy": 6.115630149841309, "epoch": 1.1110611286049883, "grad_norm": 1.2265625, "learning_rate": 0.0004885175214065392, "loss": 5.9681, "mean_token_accuracy": 0.16154656708240508, "num_tokens": 21741465.0, "step": 11115 }, { "entropy": 6.132784795761109, "epoch": 1.1115609536662168, "grad_norm": 1.1328125, "learning_rate": 0.0004885062632308457, "loss": 5.9053, "mean_token_accuracy": 0.16261844485998153, "num_tokens": 21750313.0, "step": 11120 }, { "entropy": 6.22063512802124, "epoch": 1.1120607787274455, "grad_norm": 1.328125, "learning_rate": 0.0004884949996833898, "loss": 6.0262, "mean_token_accuracy": 0.14515237063169478, "num_tokens": 21759842.0, "step": 11125 }, { "entropy": 6.170238447189331, "epoch": 1.112560603788674, "grad_norm": 1.28125, "learning_rate": 0.0004884837307644545, "loss": 5.8768, "mean_token_accuracy": 0.16237102448940277, "num_tokens": 21770126.0, "step": 11130 }, { "entropy": 6.054769802093506, "epoch": 1.1130604288499026, "grad_norm": 1.296875, "learning_rate": 0.0004884724564743236, "loss": 5.8077, "mean_token_accuracy": 0.16065026372671126, "num_tokens": 21779878.0, "step": 11135 }, { "entropy": 6.156855869293213, "epoch": 1.1135602539111311, "grad_norm": 1.203125, "learning_rate": 0.0004884611768132805, "loss": 6.0, "mean_token_accuracy": 0.15262884944677352, "num_tokens": 21790971.0, "step": 11140 }, { "entropy": 6.19208836555481, "epoch": 1.1140600789723596, "grad_norm": 1.34375, "learning_rate": 0.0004884498917816092, "loss": 5.9994, "mean_token_accuracy": 0.147748701274395, "num_tokens": 21800733.0, "step": 11145 }, { "entropy": 6.155978870391846, "epoch": 1.1145599040335883, "grad_norm": 1.328125, "learning_rate": 0.0004884386013795935, "loss": 5.9083, "mean_token_accuracy": 0.16489729285240173, "num_tokens": 21809840.0, "step": 11150 }, { "entropy": 6.069447326660156, "epoch": 1.1150597290948168, "grad_norm": 1.6015625, "learning_rate": 0.0004884273056075175, "loss": 5.9508, "mean_token_accuracy": 0.1577574774622917, "num_tokens": 21819539.0, "step": 11155 }, { "entropy": 6.198151683807373, "epoch": 1.1155595541560455, "grad_norm": 1.21875, "learning_rate": 0.0004884160044656654, "loss": 5.9289, "mean_token_accuracy": 0.16398066580295562, "num_tokens": 21829488.0, "step": 11160 }, { "entropy": 6.24658784866333, "epoch": 1.116059379217274, "grad_norm": 1.2265625, "learning_rate": 0.0004884046979543217, "loss": 5.9779, "mean_token_accuracy": 0.15356515273451804, "num_tokens": 21839244.0, "step": 11165 }, { "entropy": 6.168745231628418, "epoch": 1.1165592042785026, "grad_norm": 1.2421875, "learning_rate": 0.0004883933860737706, "loss": 6.0692, "mean_token_accuracy": 0.15458495691418647, "num_tokens": 21850102.0, "step": 11170 }, { "entropy": 6.22074327468872, "epoch": 1.1170590293397311, "grad_norm": 1.25, "learning_rate": 0.0004883820688242968, "loss": 5.9601, "mean_token_accuracy": 0.15867770090699196, "num_tokens": 21860409.0, "step": 11175 }, { "entropy": 6.1002233028411865, "epoch": 1.1175588544009596, "grad_norm": 1.28125, "learning_rate": 0.0004883707462061851, "loss": 5.8247, "mean_token_accuracy": 0.15803707242012024, "num_tokens": 21870055.0, "step": 11180 }, { "entropy": 6.133212614059448, "epoch": 1.1180586794621883, "grad_norm": 1.390625, "learning_rate": 0.0004883594182197203, "loss": 5.9826, "mean_token_accuracy": 0.15488905608654022, "num_tokens": 21879103.0, "step": 11185 }, { "entropy": 6.144361162185669, "epoch": 1.1185585045234168, "grad_norm": 1.15625, "learning_rate": 0.0004883480848651875, "loss": 6.0008, "mean_token_accuracy": 0.15601723194122313, "num_tokens": 21890140.0, "step": 11190 }, { "entropy": 6.299938154220581, "epoch": 1.1190583295846455, "grad_norm": 1.3515625, "learning_rate": 0.0004883367461428716, "loss": 6.1177, "mean_token_accuracy": 0.14664446488022803, "num_tokens": 21900917.0, "step": 11195 }, { "entropy": 6.238546514511109, "epoch": 1.119558154645874, "grad_norm": 1.2578125, "learning_rate": 0.0004883254020530582, "loss": 5.953, "mean_token_accuracy": 0.15080673694610597, "num_tokens": 21910476.0, "step": 11200 }, { "entropy": 6.125157070159912, "epoch": 1.1200579797071024, "grad_norm": 1.2578125, "learning_rate": 0.0004883140525960327, "loss": 5.9289, "mean_token_accuracy": 0.15645034462213517, "num_tokens": 21920219.0, "step": 11205 }, { "entropy": 6.07569260597229, "epoch": 1.1205578047683311, "grad_norm": 1.3203125, "learning_rate": 0.0004883026977720803, "loss": 5.9009, "mean_token_accuracy": 0.1592889681458473, "num_tokens": 21930592.0, "step": 11210 }, { "entropy": 6.2165083408355715, "epoch": 1.1210576298295596, "grad_norm": 1.234375, "learning_rate": 0.000488291337581487, "loss": 6.1128, "mean_token_accuracy": 0.14356039613485336, "num_tokens": 21939785.0, "step": 11215 }, { "entropy": 6.225708532333374, "epoch": 1.1215574548907883, "grad_norm": 1.2890625, "learning_rate": 0.0004882799720245385, "loss": 5.9138, "mean_token_accuracy": 0.15952995121479036, "num_tokens": 21948243.0, "step": 11220 }, { "entropy": 6.20636134147644, "epoch": 1.1220572799520168, "grad_norm": 1.4609375, "learning_rate": 0.0004882686011015208, "loss": 5.9704, "mean_token_accuracy": 0.15272683650255203, "num_tokens": 21958523.0, "step": 11225 }, { "entropy": 6.110539436340332, "epoch": 1.1225571050132455, "grad_norm": 1.265625, "learning_rate": 0.00048825722481272006, "loss": 5.962, "mean_token_accuracy": 0.15418931245803832, "num_tokens": 21968685.0, "step": 11230 }, { "entropy": 6.15864405632019, "epoch": 1.123056930074474, "grad_norm": 1.6484375, "learning_rate": 0.0004882458431584223, "loss": 5.9776, "mean_token_accuracy": 0.14996535331010818, "num_tokens": 21979896.0, "step": 11235 }, { "entropy": 6.238428544998169, "epoch": 1.1235567551357024, "grad_norm": 1.234375, "learning_rate": 0.0004882344561389141, "loss": 5.9549, "mean_token_accuracy": 0.15391377434134484, "num_tokens": 21989513.0, "step": 11240 }, { "entropy": 6.1046394348144535, "epoch": 1.124056580196931, "grad_norm": 1.3046875, "learning_rate": 0.00048822306375448176, "loss": 5.904, "mean_token_accuracy": 0.15924802124500276, "num_tokens": 21999238.0, "step": 11245 }, { "entropy": 6.123053979873657, "epoch": 1.1245564052581596, "grad_norm": 1.375, "learning_rate": 0.0004882116660054121, "loss": 5.93, "mean_token_accuracy": 0.1566139817237854, "num_tokens": 22008992.0, "step": 11250 }, { "entropy": 6.166887712478638, "epoch": 1.1250562303193883, "grad_norm": 1.1953125, "learning_rate": 0.0004882002628919917, "loss": 5.908, "mean_token_accuracy": 0.15392929315567017, "num_tokens": 22018333.0, "step": 11255 }, { "entropy": 6.1368818283081055, "epoch": 1.1255560553806168, "grad_norm": 1.4296875, "learning_rate": 0.0004881888544145076, "loss": 5.9434, "mean_token_accuracy": 0.1624426931142807, "num_tokens": 22028003.0, "step": 11260 }, { "entropy": 6.174270677566528, "epoch": 1.1260558804418452, "grad_norm": 1.203125, "learning_rate": 0.00048817744057324673, "loss": 5.988, "mean_token_accuracy": 0.15294573158025743, "num_tokens": 22038318.0, "step": 11265 }, { "entropy": 6.154047346115112, "epoch": 1.126555705503074, "grad_norm": 1.265625, "learning_rate": 0.00048816602136849644, "loss": 5.9185, "mean_token_accuracy": 0.1574176475405693, "num_tokens": 22048180.0, "step": 11270 }, { "entropy": 6.137226724624634, "epoch": 1.1270555305643024, "grad_norm": 1.4609375, "learning_rate": 0.00048815459680054375, "loss": 5.956, "mean_token_accuracy": 0.14919542372226716, "num_tokens": 22057831.0, "step": 11275 }, { "entropy": 6.097395324707032, "epoch": 1.127555355625531, "grad_norm": 1.40625, "learning_rate": 0.00048814316686967635, "loss": 5.855, "mean_token_accuracy": 0.1623263344168663, "num_tokens": 22068569.0, "step": 11280 }, { "entropy": 6.203636169433594, "epoch": 1.1280551806867596, "grad_norm": 1.421875, "learning_rate": 0.0004881317315761817, "loss": 6.0236, "mean_token_accuracy": 0.1530197262763977, "num_tokens": 22079267.0, "step": 11285 }, { "entropy": 6.136734914779663, "epoch": 1.1285550057479883, "grad_norm": 1.1953125, "learning_rate": 0.00048812029092034747, "loss": 5.8664, "mean_token_accuracy": 0.1613774538040161, "num_tokens": 22089469.0, "step": 11290 }, { "entropy": 6.101068639755249, "epoch": 1.1290548308092168, "grad_norm": 1.2109375, "learning_rate": 0.00048810884490246164, "loss": 5.9207, "mean_token_accuracy": 0.1657998040318489, "num_tokens": 22099148.0, "step": 11295 }, { "entropy": 6.120045280456543, "epoch": 1.1295546558704452, "grad_norm": 1.2890625, "learning_rate": 0.000488097393522812, "loss": 5.8885, "mean_token_accuracy": 0.16285810470581055, "num_tokens": 22107750.0, "step": 11300 }, { "entropy": 6.177941370010376, "epoch": 1.130054480931674, "grad_norm": 1.4296875, "learning_rate": 0.0004880859367816868, "loss": 6.0177, "mean_token_accuracy": 0.15005035623908042, "num_tokens": 22118336.0, "step": 11305 }, { "entropy": 6.214954471588134, "epoch": 1.1305543059929024, "grad_norm": 1.2421875, "learning_rate": 0.0004880744746793744, "loss": 5.9228, "mean_token_accuracy": 0.1561885416507721, "num_tokens": 22128166.0, "step": 11310 }, { "entropy": 6.169269800186157, "epoch": 1.131054131054131, "grad_norm": 1.4375, "learning_rate": 0.00048806300721616295, "loss": 5.913, "mean_token_accuracy": 0.15371521562337875, "num_tokens": 22136810.0, "step": 11315 }, { "entropy": 6.0631739616394045, "epoch": 1.1315539561153596, "grad_norm": 1.3046875, "learning_rate": 0.00048805153439234107, "loss": 5.878, "mean_token_accuracy": 0.16770315319299697, "num_tokens": 22146398.0, "step": 11320 }, { "entropy": 6.1555359840393065, "epoch": 1.1320537811765883, "grad_norm": 1.4375, "learning_rate": 0.0004880400562081974, "loss": 5.9181, "mean_token_accuracy": 0.1562088444828987, "num_tokens": 22155161.0, "step": 11325 }, { "entropy": 6.109787702560425, "epoch": 1.1325536062378168, "grad_norm": 1.2734375, "learning_rate": 0.00048802857266402075, "loss": 5.9685, "mean_token_accuracy": 0.16022876799106597, "num_tokens": 22166486.0, "step": 11330 }, { "entropy": 6.076881980895996, "epoch": 1.1330534312990452, "grad_norm": 1.4921875, "learning_rate": 0.0004880170837601, "loss": 5.8722, "mean_token_accuracy": 0.16129899621009827, "num_tokens": 22176487.0, "step": 11335 }, { "entropy": 6.137448167800903, "epoch": 1.133553256360274, "grad_norm": 1.3515625, "learning_rate": 0.0004880055894967242, "loss": 5.9489, "mean_token_accuracy": 0.15399421602487565, "num_tokens": 22186513.0, "step": 11340 }, { "entropy": 6.175388669967651, "epoch": 1.1340530814215024, "grad_norm": 1.3046875, "learning_rate": 0.00048799408987418264, "loss": 5.9451, "mean_token_accuracy": 0.1530529133975506, "num_tokens": 22197325.0, "step": 11345 }, { "entropy": 6.235398578643799, "epoch": 1.134552906482731, "grad_norm": 1.375, "learning_rate": 0.00048798258489276457, "loss": 5.9558, "mean_token_accuracy": 0.15394756197929382, "num_tokens": 22207160.0, "step": 11350 }, { "entropy": 6.2171226978302006, "epoch": 1.1350527315439596, "grad_norm": 1.2578125, "learning_rate": 0.0004879710745527595, "loss": 5.9886, "mean_token_accuracy": 0.1499202013015747, "num_tokens": 22216533.0, "step": 11355 }, { "entropy": 6.168427658081055, "epoch": 1.1355525566051883, "grad_norm": 1.171875, "learning_rate": 0.00048795955885445696, "loss": 5.9375, "mean_token_accuracy": 0.154099303483963, "num_tokens": 22226186.0, "step": 11360 }, { "entropy": 6.132285690307617, "epoch": 1.1360523816664168, "grad_norm": 1.2734375, "learning_rate": 0.0004879480377981467, "loss": 5.9062, "mean_token_accuracy": 0.1605280488729477, "num_tokens": 22236315.0, "step": 11365 }, { "entropy": 6.150118064880371, "epoch": 1.1365522067276452, "grad_norm": 1.3671875, "learning_rate": 0.00048793651138411866, "loss": 5.8645, "mean_token_accuracy": 0.16115637719631196, "num_tokens": 22245250.0, "step": 11370 }, { "entropy": 6.224485445022583, "epoch": 1.137052031788874, "grad_norm": 1.90625, "learning_rate": 0.00048792497961266273, "loss": 6.0292, "mean_token_accuracy": 0.1485135167837143, "num_tokens": 22255093.0, "step": 11375 }, { "entropy": 6.039935493469239, "epoch": 1.1375518568501024, "grad_norm": 1.328125, "learning_rate": 0.00048791344248406916, "loss": 5.8264, "mean_token_accuracy": 0.15991712212562562, "num_tokens": 22264680.0, "step": 11380 }, { "entropy": 6.128985977172851, "epoch": 1.138051681911331, "grad_norm": 1.3359375, "learning_rate": 0.00048790189999862814, "loss": 5.9895, "mean_token_accuracy": 0.1472291514277458, "num_tokens": 22273804.0, "step": 11385 }, { "entropy": 6.181646013259888, "epoch": 1.1385515069725596, "grad_norm": 1.671875, "learning_rate": 0.00048789035215663013, "loss": 5.9326, "mean_token_accuracy": 0.15447390973567962, "num_tokens": 22284302.0, "step": 11390 }, { "entropy": 6.137444877624512, "epoch": 1.1390513320337883, "grad_norm": 1.359375, "learning_rate": 0.00048787879895836563, "loss": 5.867, "mean_token_accuracy": 0.16312607228755951, "num_tokens": 22293439.0, "step": 11395 }, { "entropy": 6.1159912109375, "epoch": 1.1395511570950168, "grad_norm": 1.2109375, "learning_rate": 0.0004878672404041253, "loss": 5.9019, "mean_token_accuracy": 0.15982389748096465, "num_tokens": 22303005.0, "step": 11400 }, { "entropy": 6.085371494293213, "epoch": 1.1400509821562452, "grad_norm": 1.4609375, "learning_rate": 0.00048785567649419994, "loss": 5.8304, "mean_token_accuracy": 0.16179968118667604, "num_tokens": 22311962.0, "step": 11405 }, { "entropy": 6.048926877975464, "epoch": 1.140550807217474, "grad_norm": 1.265625, "learning_rate": 0.0004878441072288806, "loss": 5.95, "mean_token_accuracy": 0.14932782649993898, "num_tokens": 22320998.0, "step": 11410 }, { "entropy": 6.135735702514649, "epoch": 1.1410506322787024, "grad_norm": 1.328125, "learning_rate": 0.00048783253260845826, "loss": 5.9274, "mean_token_accuracy": 0.15540642365813256, "num_tokens": 22330977.0, "step": 11415 }, { "entropy": 6.1888429641723635, "epoch": 1.141550457339931, "grad_norm": 1.3359375, "learning_rate": 0.0004878209526332242, "loss": 5.9255, "mean_token_accuracy": 0.15925299525260925, "num_tokens": 22341287.0, "step": 11420 }, { "entropy": 6.119518089294433, "epoch": 1.1420502824011596, "grad_norm": 1.4140625, "learning_rate": 0.00048780936730346967, "loss": 5.8915, "mean_token_accuracy": 0.15947517156600952, "num_tokens": 22350507.0, "step": 11425 }, { "entropy": 6.142720794677734, "epoch": 1.1425501074623883, "grad_norm": 1.453125, "learning_rate": 0.00048779777661948627, "loss": 5.9904, "mean_token_accuracy": 0.14859276562929152, "num_tokens": 22361202.0, "step": 11430 }, { "entropy": 6.217611837387085, "epoch": 1.1430499325236168, "grad_norm": 1.5546875, "learning_rate": 0.0004877861805815655, "loss": 6.0351, "mean_token_accuracy": 0.15991177707910537, "num_tokens": 22370824.0, "step": 11435 }, { "entropy": 6.117256784439087, "epoch": 1.1435497575848452, "grad_norm": 1.328125, "learning_rate": 0.0004877745791899993, "loss": 5.8993, "mean_token_accuracy": 0.16042656004428862, "num_tokens": 22380857.0, "step": 11440 }, { "entropy": 6.186435127258301, "epoch": 1.144049582646074, "grad_norm": 1.3203125, "learning_rate": 0.00048776297244507936, "loss": 5.9117, "mean_token_accuracy": 0.15356415063142775, "num_tokens": 22391354.0, "step": 11445 }, { "entropy": 6.0872776985168455, "epoch": 1.1445494077073024, "grad_norm": 1.2421875, "learning_rate": 0.00048775136034709784, "loss": 5.8421, "mean_token_accuracy": 0.15969178453087807, "num_tokens": 22400656.0, "step": 11450 }, { "entropy": 6.148261451721192, "epoch": 1.145049232768531, "grad_norm": 1.2109375, "learning_rate": 0.00048773974289634676, "loss": 5.9217, "mean_token_accuracy": 0.15257085114717484, "num_tokens": 22410887.0, "step": 11455 }, { "entropy": 6.164778852462769, "epoch": 1.1455490578297596, "grad_norm": 1.28125, "learning_rate": 0.0004877281200931185, "loss": 5.9273, "mean_token_accuracy": 0.15148293375968933, "num_tokens": 22420370.0, "step": 11460 }, { "entropy": 6.0964478015899655, "epoch": 1.1460488828909883, "grad_norm": 1.1953125, "learning_rate": 0.00048771649193770554, "loss": 5.8139, "mean_token_accuracy": 0.16508594900369644, "num_tokens": 22430746.0, "step": 11465 }, { "entropy": 6.139988899230957, "epoch": 1.1465487079522168, "grad_norm": 1.1875, "learning_rate": 0.0004877048584304004, "loss": 5.9214, "mean_token_accuracy": 0.15477398037910461, "num_tokens": 22440812.0, "step": 11470 }, { "entropy": 6.2163482189178465, "epoch": 1.1470485330134452, "grad_norm": 1.7578125, "learning_rate": 0.00048769321957149557, "loss": 6.0627, "mean_token_accuracy": 0.14305093809962272, "num_tokens": 22450460.0, "step": 11475 }, { "entropy": 6.15441632270813, "epoch": 1.147548358074674, "grad_norm": 1.328125, "learning_rate": 0.0004876815753612843, "loss": 5.9191, "mean_token_accuracy": 0.15828651040792466, "num_tokens": 22460660.0, "step": 11480 }, { "entropy": 6.117127704620361, "epoch": 1.1480481831359024, "grad_norm": 1.5546875, "learning_rate": 0.0004876699258000592, "loss": 5.8484, "mean_token_accuracy": 0.16004034876823425, "num_tokens": 22469238.0, "step": 11485 }, { "entropy": 6.089229393005371, "epoch": 1.148548008197131, "grad_norm": 1.375, "learning_rate": 0.0004876582708881135, "loss": 5.8919, "mean_token_accuracy": 0.1520943135023117, "num_tokens": 22479685.0, "step": 11490 }, { "entropy": 6.101541519165039, "epoch": 1.1490478332583596, "grad_norm": 1.2578125, "learning_rate": 0.0004876466106257404, "loss": 5.8746, "mean_token_accuracy": 0.15702069252729417, "num_tokens": 22489770.0, "step": 11495 }, { "entropy": 6.227074670791626, "epoch": 1.149547658319588, "grad_norm": 1.1640625, "learning_rate": 0.00048763494501323333, "loss": 6.0422, "mean_token_accuracy": 0.14994479939341546, "num_tokens": 22499957.0, "step": 11500 }, { "entropy": 6.0912751197814945, "epoch": 1.1500474833808167, "grad_norm": 1.3984375, "learning_rate": 0.00048762327405088573, "loss": 5.8444, "mean_token_accuracy": 0.16363071501255036, "num_tokens": 22508863.0, "step": 11505 }, { "entropy": 6.194194602966308, "epoch": 1.1505473084420452, "grad_norm": 1.3515625, "learning_rate": 0.0004876115977389913, "loss": 5.9218, "mean_token_accuracy": 0.1516316130757332, "num_tokens": 22517563.0, "step": 11510 }, { "entropy": 6.063374948501587, "epoch": 1.151047133503274, "grad_norm": 1.4453125, "learning_rate": 0.00048759991607784375, "loss": 5.7861, "mean_token_accuracy": 0.17359053045511247, "num_tokens": 22527907.0, "step": 11515 }, { "entropy": 6.033289194107056, "epoch": 1.1515469585645024, "grad_norm": 1.4765625, "learning_rate": 0.00048758822906773706, "loss": 5.8387, "mean_token_accuracy": 0.1652185320854187, "num_tokens": 22537373.0, "step": 11520 }, { "entropy": 6.139695024490356, "epoch": 1.1520467836257309, "grad_norm": 1.3203125, "learning_rate": 0.00048757653670896523, "loss": 5.9776, "mean_token_accuracy": 0.1563122510910034, "num_tokens": 22547851.0, "step": 11525 }, { "entropy": 6.2897301197052, "epoch": 1.1525466086869596, "grad_norm": 1.2734375, "learning_rate": 0.0004875648390018224, "loss": 5.9603, "mean_token_accuracy": 0.1579339623451233, "num_tokens": 22558127.0, "step": 11530 }, { "entropy": 6.13180570602417, "epoch": 1.153046433748188, "grad_norm": 1.2578125, "learning_rate": 0.000487553135946603, "loss": 5.9848, "mean_token_accuracy": 0.15117980912327766, "num_tokens": 22568151.0, "step": 11535 }, { "entropy": 6.138003778457642, "epoch": 1.1535462588094167, "grad_norm": 1.3125, "learning_rate": 0.00048754142754360135, "loss": 6.0592, "mean_token_accuracy": 0.1499926522374153, "num_tokens": 22579772.0, "step": 11540 }, { "entropy": 6.16640157699585, "epoch": 1.1540460838706452, "grad_norm": 1.3671875, "learning_rate": 0.0004875297137931121, "loss": 5.9397, "mean_token_accuracy": 0.15832630544900894, "num_tokens": 22589551.0, "step": 11545 }, { "entropy": 6.166927719116211, "epoch": 1.154545908931874, "grad_norm": 1.453125, "learning_rate": 0.0004875179946954298, "loss": 5.9474, "mean_token_accuracy": 0.1573859468102455, "num_tokens": 22599139.0, "step": 11550 }, { "entropy": 6.225337028503418, "epoch": 1.1550457339931024, "grad_norm": 1.484375, "learning_rate": 0.00048750627025084955, "loss": 6.0752, "mean_token_accuracy": 0.14671857059001922, "num_tokens": 22609413.0, "step": 11555 }, { "entropy": 6.2118078708648685, "epoch": 1.1555455590543309, "grad_norm": 1.34375, "learning_rate": 0.0004874945404596662, "loss": 6.0739, "mean_token_accuracy": 0.149736175686121, "num_tokens": 22619395.0, "step": 11560 }, { "entropy": 6.119500970840454, "epoch": 1.1560453841155596, "grad_norm": 1.3515625, "learning_rate": 0.00048748280532217485, "loss": 5.873, "mean_token_accuracy": 0.16254231929779053, "num_tokens": 22629623.0, "step": 11565 }, { "entropy": 6.106204700469971, "epoch": 1.156545209176788, "grad_norm": 1.265625, "learning_rate": 0.0004874710648386709, "loss": 5.9019, "mean_token_accuracy": 0.1501620218157768, "num_tokens": 22639735.0, "step": 11570 }, { "entropy": 6.126580715179443, "epoch": 1.1570450342380167, "grad_norm": 1.34375, "learning_rate": 0.0004874593190094496, "loss": 5.8246, "mean_token_accuracy": 0.15912945568561554, "num_tokens": 22648563.0, "step": 11575 }, { "entropy": 6.089101839065552, "epoch": 1.1575448592992452, "grad_norm": 1.515625, "learning_rate": 0.0004874475678348065, "loss": 5.8588, "mean_token_accuracy": 0.16259310096502305, "num_tokens": 22657137.0, "step": 11580 }, { "entropy": 6.10340051651001, "epoch": 1.158044684360474, "grad_norm": 1.3359375, "learning_rate": 0.00048743581131503716, "loss": 5.8895, "mean_token_accuracy": 0.15471033602952958, "num_tokens": 22667987.0, "step": 11585 }, { "entropy": 6.0946660995483395, "epoch": 1.1585445094217024, "grad_norm": 1.3984375, "learning_rate": 0.0004874240494504376, "loss": 5.9803, "mean_token_accuracy": 0.1506967782974243, "num_tokens": 22678830.0, "step": 11590 }, { "entropy": 6.251873636245728, "epoch": 1.1590443344829309, "grad_norm": 1.21875, "learning_rate": 0.00048741228224130357, "loss": 5.9691, "mean_token_accuracy": 0.15562665909528733, "num_tokens": 22690568.0, "step": 11595 }, { "entropy": 6.205672645568848, "epoch": 1.1595441595441596, "grad_norm": 1.2578125, "learning_rate": 0.00048740050968793116, "loss": 5.9795, "mean_token_accuracy": 0.1545748621225357, "num_tokens": 22700150.0, "step": 11600 }, { "entropy": 6.030290508270264, "epoch": 1.160043984605388, "grad_norm": 1.4140625, "learning_rate": 0.0004873887317906166, "loss": 5.8807, "mean_token_accuracy": 0.15282610505819322, "num_tokens": 22709365.0, "step": 11605 }, { "entropy": 6.236346769332886, "epoch": 1.1605438096666167, "grad_norm": 1.296875, "learning_rate": 0.00048737694854965617, "loss": 6.0389, "mean_token_accuracy": 0.15078128203749658, "num_tokens": 22718636.0, "step": 11610 }, { "entropy": 6.249845027923584, "epoch": 1.1610436347278452, "grad_norm": 1.75, "learning_rate": 0.00048736515996534644, "loss": 6.0214, "mean_token_accuracy": 0.15172371566295623, "num_tokens": 22728713.0, "step": 11615 }, { "entropy": 6.0499663829803465, "epoch": 1.161543459789074, "grad_norm": 1.1953125, "learning_rate": 0.0004873533660379839, "loss": 5.7814, "mean_token_accuracy": 0.16726926118135452, "num_tokens": 22739061.0, "step": 11620 }, { "entropy": 6.195918989181519, "epoch": 1.1620432848503024, "grad_norm": 1.546875, "learning_rate": 0.00048734156676786525, "loss": 5.9825, "mean_token_accuracy": 0.14829165786504744, "num_tokens": 22748752.0, "step": 11625 }, { "entropy": 6.10856523513794, "epoch": 1.1625431099115309, "grad_norm": 1.40625, "learning_rate": 0.0004873297621552875, "loss": 5.8453, "mean_token_accuracy": 0.16870082318782806, "num_tokens": 22758695.0, "step": 11630 }, { "entropy": 6.213428735733032, "epoch": 1.1630429349727596, "grad_norm": 1.3515625, "learning_rate": 0.00048731795220054755, "loss": 6.0129, "mean_token_accuracy": 0.15455391854047776, "num_tokens": 22768948.0, "step": 11635 }, { "entropy": 6.1464197635650635, "epoch": 1.163542760033988, "grad_norm": 1.484375, "learning_rate": 0.0004873061369039425, "loss": 5.9615, "mean_token_accuracy": 0.15550061464309692, "num_tokens": 22779446.0, "step": 11640 }, { "entropy": 6.070646715164185, "epoch": 1.1640425850952167, "grad_norm": 1.34375, "learning_rate": 0.0004872943162657697, "loss": 5.8804, "mean_token_accuracy": 0.15846378356218338, "num_tokens": 22789654.0, "step": 11645 }, { "entropy": 6.178193664550781, "epoch": 1.1645424101564452, "grad_norm": 1.328125, "learning_rate": 0.0004872824902863265, "loss": 5.988, "mean_token_accuracy": 0.15519210696220398, "num_tokens": 22798938.0, "step": 11650 }, { "entropy": 6.205599403381347, "epoch": 1.165042235217674, "grad_norm": 1.25, "learning_rate": 0.0004872706589659106, "loss": 5.9633, "mean_token_accuracy": 0.15547027438879013, "num_tokens": 22808279.0, "step": 11655 }, { "entropy": 6.109768390655518, "epoch": 1.1655420602789024, "grad_norm": 1.46875, "learning_rate": 0.00048725882230481947, "loss": 5.8922, "mean_token_accuracy": 0.16145075261592864, "num_tokens": 22817378.0, "step": 11660 }, { "entropy": 6.267738389968872, "epoch": 1.1660418853401309, "grad_norm": 1.390625, "learning_rate": 0.00048724698030335096, "loss": 5.994, "mean_token_accuracy": 0.14961753487586976, "num_tokens": 22828652.0, "step": 11665 }, { "entropy": 6.145955181121826, "epoch": 1.1665417104013596, "grad_norm": 1.4453125, "learning_rate": 0.0004872351329618031, "loss": 5.947, "mean_token_accuracy": 0.16081907153129577, "num_tokens": 22839156.0, "step": 11670 }, { "entropy": 6.184478807449341, "epoch": 1.167041535462588, "grad_norm": 1.3984375, "learning_rate": 0.00048722328028047386, "loss": 6.0175, "mean_token_accuracy": 0.15380825847387314, "num_tokens": 22849004.0, "step": 11675 }, { "entropy": 6.144978284835815, "epoch": 1.1675413605238167, "grad_norm": 1.5703125, "learning_rate": 0.00048721142225966146, "loss": 5.9943, "mean_token_accuracy": 0.14920471459627152, "num_tokens": 22858984.0, "step": 11680 }, { "entropy": 6.121554899215698, "epoch": 1.1680411855850452, "grad_norm": 1.15625, "learning_rate": 0.0004871995588996644, "loss": 5.8825, "mean_token_accuracy": 0.16054070591926575, "num_tokens": 22869149.0, "step": 11685 }, { "entropy": 6.213811826705933, "epoch": 1.168541010646274, "grad_norm": 1.2578125, "learning_rate": 0.0004871876902007809, "loss": 6.0419, "mean_token_accuracy": 0.15133528038859367, "num_tokens": 22878522.0, "step": 11690 }, { "entropy": 6.180964803695678, "epoch": 1.1690408357075024, "grad_norm": 1.328125, "learning_rate": 0.00048717581616330985, "loss": 5.9237, "mean_token_accuracy": 0.15596554428339005, "num_tokens": 22888356.0, "step": 11695 }, { "entropy": 6.160168790817261, "epoch": 1.1695406607687309, "grad_norm": 1.3125, "learning_rate": 0.00048716393678754975, "loss": 5.9325, "mean_token_accuracy": 0.15649837106466294, "num_tokens": 22897551.0, "step": 11700 }, { "entropy": 6.201762914657593, "epoch": 1.1700404858299596, "grad_norm": 1.4140625, "learning_rate": 0.0004871520520737996, "loss": 5.8999, "mean_token_accuracy": 0.1590888246893883, "num_tokens": 22906480.0, "step": 11705 }, { "entropy": 6.117210483551025, "epoch": 1.170540310891188, "grad_norm": 1.296875, "learning_rate": 0.0004871401620223585, "loss": 5.806, "mean_token_accuracy": 0.1601024404168129, "num_tokens": 22916544.0, "step": 11710 }, { "entropy": 6.051312208175659, "epoch": 1.1710401359524167, "grad_norm": 1.234375, "learning_rate": 0.0004871282666335255, "loss": 5.838, "mean_token_accuracy": 0.16646503210067748, "num_tokens": 22926083.0, "step": 11715 }, { "entropy": 6.225358390808106, "epoch": 1.1715399610136452, "grad_norm": 1.3125, "learning_rate": 0.00048711636590759985, "loss": 5.98, "mean_token_accuracy": 0.1536261223256588, "num_tokens": 22936127.0, "step": 11720 }, { "entropy": 6.183586120605469, "epoch": 1.172039786074874, "grad_norm": 1.3046875, "learning_rate": 0.00048710445984488106, "loss": 5.9121, "mean_token_accuracy": 0.15770825743675232, "num_tokens": 22946579.0, "step": 11725 }, { "entropy": 6.152203941345215, "epoch": 1.1725396111361024, "grad_norm": 1.2421875, "learning_rate": 0.0004870925484456686, "loss": 5.9291, "mean_token_accuracy": 0.15968383252620696, "num_tokens": 22956286.0, "step": 11730 }, { "entropy": 6.0786479949951175, "epoch": 1.1730394361973309, "grad_norm": 1.2578125, "learning_rate": 0.0004870806317102622, "loss": 5.9533, "mean_token_accuracy": 0.1588772267103195, "num_tokens": 22965625.0, "step": 11735 }, { "entropy": 6.232479047775269, "epoch": 1.1735392612585596, "grad_norm": 1.4609375, "learning_rate": 0.0004870687096389617, "loss": 6.0103, "mean_token_accuracy": 0.15224907100200652, "num_tokens": 22975853.0, "step": 11740 }, { "entropy": 6.203512573242188, "epoch": 1.174039086319788, "grad_norm": 1.4375, "learning_rate": 0.000487056782232067, "loss": 5.9744, "mean_token_accuracy": 0.15265572369098662, "num_tokens": 22985928.0, "step": 11745 }, { "entropy": 6.139250183105469, "epoch": 1.1745389113810167, "grad_norm": 1.390625, "learning_rate": 0.00048704484948987824, "loss": 5.9478, "mean_token_accuracy": 0.15957126766443253, "num_tokens": 22995222.0, "step": 11750 }, { "entropy": 6.131657457351684, "epoch": 1.1750387364422452, "grad_norm": 1.328125, "learning_rate": 0.0004870329114126956, "loss": 5.9021, "mean_token_accuracy": 0.1558387815952301, "num_tokens": 23005735.0, "step": 11755 }, { "entropy": 6.14085283279419, "epoch": 1.1755385615034737, "grad_norm": 1.5, "learning_rate": 0.0004870209680008196, "loss": 5.8862, "mean_token_accuracy": 0.15256378352642058, "num_tokens": 23016198.0, "step": 11760 }, { "entropy": 6.154154443740845, "epoch": 1.1760383865647024, "grad_norm": 1.3984375, "learning_rate": 0.0004870090192545505, "loss": 5.9631, "mean_token_accuracy": 0.15193866193294525, "num_tokens": 23025927.0, "step": 11765 }, { "entropy": 6.123627805709839, "epoch": 1.1765382116259309, "grad_norm": 1.4609375, "learning_rate": 0.000486997065174189, "loss": 5.7699, "mean_token_accuracy": 0.16785600930452346, "num_tokens": 23034626.0, "step": 11770 }, { "entropy": 6.05954794883728, "epoch": 1.1770380366871596, "grad_norm": 1.21875, "learning_rate": 0.00048698510576003593, "loss": 5.8764, "mean_token_accuracy": 0.15829506069421767, "num_tokens": 23045773.0, "step": 11775 }, { "entropy": 6.139459848403931, "epoch": 1.177537861748388, "grad_norm": 1.3515625, "learning_rate": 0.00048697314101239217, "loss": 5.8639, "mean_token_accuracy": 0.1559164971113205, "num_tokens": 23056803.0, "step": 11780 }, { "entropy": 6.170506858825684, "epoch": 1.1780376868096165, "grad_norm": 1.3203125, "learning_rate": 0.0004869611709315587, "loss": 5.9219, "mean_token_accuracy": 0.15472777485847472, "num_tokens": 23066513.0, "step": 11785 }, { "entropy": 6.162024259567261, "epoch": 1.1785375118708452, "grad_norm": 1.3203125, "learning_rate": 0.00048694919551783665, "loss": 5.9584, "mean_token_accuracy": 0.15121255367994307, "num_tokens": 23077309.0, "step": 11790 }, { "entropy": 6.02949275970459, "epoch": 1.1790373369320737, "grad_norm": 1.2734375, "learning_rate": 0.00048693721477152755, "loss": 5.901, "mean_token_accuracy": 0.1658010944724083, "num_tokens": 23088292.0, "step": 11795 }, { "entropy": 6.150199127197266, "epoch": 1.1795371619933024, "grad_norm": 1.3359375, "learning_rate": 0.00048692522869293246, "loss": 5.8983, "mean_token_accuracy": 0.15488027185201644, "num_tokens": 23098744.0, "step": 11800 }, { "entropy": 6.1170916080474855, "epoch": 1.1800369870545309, "grad_norm": 1.3515625, "learning_rate": 0.0004869132372823533, "loss": 5.8707, "mean_token_accuracy": 0.16533601582050322, "num_tokens": 23108223.0, "step": 11805 }, { "entropy": 6.151248598098755, "epoch": 1.1805368121157596, "grad_norm": 1.2421875, "learning_rate": 0.00048690124054009157, "loss": 5.9663, "mean_token_accuracy": 0.15317804142832755, "num_tokens": 23118595.0, "step": 11810 }, { "entropy": 6.114837217330932, "epoch": 1.181036637176988, "grad_norm": 1.34375, "learning_rate": 0.0004868892384664491, "loss": 5.8062, "mean_token_accuracy": 0.16875326484441758, "num_tokens": 23127640.0, "step": 11815 }, { "entropy": 6.148391914367676, "epoch": 1.1815364622382165, "grad_norm": 1.2578125, "learning_rate": 0.00048687723106172805, "loss": 5.9303, "mean_token_accuracy": 0.1543321892619133, "num_tokens": 23138409.0, "step": 11820 }, { "entropy": 6.133092403411865, "epoch": 1.1820362872994452, "grad_norm": 1.328125, "learning_rate": 0.00048686521832623026, "loss": 5.9285, "mean_token_accuracy": 0.15853227823972701, "num_tokens": 23148427.0, "step": 11825 }, { "entropy": 6.107066297531128, "epoch": 1.1825361123606737, "grad_norm": 1.3671875, "learning_rate": 0.0004868532002602581, "loss": 5.9234, "mean_token_accuracy": 0.16216319501399995, "num_tokens": 23157873.0, "step": 11830 }, { "entropy": 6.0920837879180905, "epoch": 1.1830359374219024, "grad_norm": 1.34375, "learning_rate": 0.000486841176864114, "loss": 5.849, "mean_token_accuracy": 0.1616566389799118, "num_tokens": 23166488.0, "step": 11835 }, { "entropy": 6.093384170532227, "epoch": 1.1835357624831309, "grad_norm": 1.3359375, "learning_rate": 0.00048682914813810035, "loss": 5.8084, "mean_token_accuracy": 0.16753440648317336, "num_tokens": 23176548.0, "step": 11840 }, { "entropy": 6.080803108215332, "epoch": 1.1840355875443596, "grad_norm": 1.328125, "learning_rate": 0.00048681711408251986, "loss": 5.8934, "mean_token_accuracy": 0.15499286949634553, "num_tokens": 23186269.0, "step": 11845 }, { "entropy": 6.100447750091552, "epoch": 1.184535412605588, "grad_norm": 1.2734375, "learning_rate": 0.00048680507469767533, "loss": 5.849, "mean_token_accuracy": 0.1630789592862129, "num_tokens": 23197181.0, "step": 11850 }, { "entropy": 6.143448066711426, "epoch": 1.1850352376668165, "grad_norm": 1.28125, "learning_rate": 0.0004867930299838696, "loss": 5.8386, "mean_token_accuracy": 0.16788185089826585, "num_tokens": 23207391.0, "step": 11855 }, { "entropy": 6.276797437667847, "epoch": 1.1855350627280452, "grad_norm": 1.640625, "learning_rate": 0.00048678097994140566, "loss": 6.0885, "mean_token_accuracy": 0.15211521089076996, "num_tokens": 23217510.0, "step": 11860 }, { "entropy": 6.032604551315307, "epoch": 1.1860348877892737, "grad_norm": 1.34375, "learning_rate": 0.00048676892457058687, "loss": 5.8109, "mean_token_accuracy": 0.1659929484128952, "num_tokens": 23226746.0, "step": 11865 }, { "entropy": 6.103962135314942, "epoch": 1.1865347128505024, "grad_norm": 1.40625, "learning_rate": 0.0004867568638717164, "loss": 5.9666, "mean_token_accuracy": 0.15252401754260064, "num_tokens": 23236333.0, "step": 11870 }, { "entropy": 6.103334569931031, "epoch": 1.1870345379117309, "grad_norm": 1.296875, "learning_rate": 0.00048674479784509766, "loss": 5.7674, "mean_token_accuracy": 0.16894800812005997, "num_tokens": 23245071.0, "step": 11875 }, { "entropy": 6.095103979110718, "epoch": 1.1875343629729596, "grad_norm": 1.2109375, "learning_rate": 0.00048673272649103435, "loss": 5.8701, "mean_token_accuracy": 0.161318339407444, "num_tokens": 23254225.0, "step": 11880 }, { "entropy": 6.12320728302002, "epoch": 1.188034188034188, "grad_norm": 1.3125, "learning_rate": 0.00048672064980983013, "loss": 5.865, "mean_token_accuracy": 0.1625265136361122, "num_tokens": 23264822.0, "step": 11885 }, { "entropy": 6.174591064453125, "epoch": 1.1885340130954165, "grad_norm": 1.5078125, "learning_rate": 0.00048670856780178874, "loss": 6.0039, "mean_token_accuracy": 0.15414587706327437, "num_tokens": 23274559.0, "step": 11890 }, { "entropy": 6.1506813049316404, "epoch": 1.1890338381566452, "grad_norm": 1.4140625, "learning_rate": 0.00048669648046721436, "loss": 5.9232, "mean_token_accuracy": 0.16194604858756065, "num_tokens": 23284431.0, "step": 11895 }, { "entropy": 6.149059772491455, "epoch": 1.1895336632178737, "grad_norm": 1.5859375, "learning_rate": 0.000486684387806411, "loss": 5.9773, "mean_token_accuracy": 0.15229665786027907, "num_tokens": 23294814.0, "step": 11900 }, { "entropy": 6.188577795028687, "epoch": 1.1900334882791024, "grad_norm": 1.2265625, "learning_rate": 0.00048667228981968285, "loss": 5.9174, "mean_token_accuracy": 0.15563267469406128, "num_tokens": 23304701.0, "step": 11905 }, { "entropy": 6.264931344985962, "epoch": 1.1905333133403309, "grad_norm": 1.1796875, "learning_rate": 0.00048666018650733446, "loss": 5.9555, "mean_token_accuracy": 0.15236850306391717, "num_tokens": 23314335.0, "step": 11910 }, { "entropy": 6.162019920349121, "epoch": 1.1910331384015596, "grad_norm": 1.3515625, "learning_rate": 0.0004866480778696702, "loss": 6.0068, "mean_token_accuracy": 0.15393581837415696, "num_tokens": 23324591.0, "step": 11915 }, { "entropy": 6.080836963653565, "epoch": 1.191532963462788, "grad_norm": 1.25, "learning_rate": 0.00048663596390699477, "loss": 5.9042, "mean_token_accuracy": 0.16133854836225509, "num_tokens": 23334682.0, "step": 11920 }, { "entropy": 6.169084978103638, "epoch": 1.1920327885240165, "grad_norm": 1.3515625, "learning_rate": 0.0004866238446196129, "loss": 5.9182, "mean_token_accuracy": 0.15725234448909758, "num_tokens": 23343943.0, "step": 11925 }, { "entropy": 6.130331420898438, "epoch": 1.1925326135852452, "grad_norm": 1.2265625, "learning_rate": 0.0004866117200078296, "loss": 5.8812, "mean_token_accuracy": 0.15819316059350969, "num_tokens": 23354031.0, "step": 11930 }, { "entropy": 6.205503606796265, "epoch": 1.1930324386464737, "grad_norm": 1.28125, "learning_rate": 0.00048659959007194985, "loss": 5.9935, "mean_token_accuracy": 0.15126484185457229, "num_tokens": 23363922.0, "step": 11935 }, { "entropy": 6.136963558197022, "epoch": 1.1935322637077024, "grad_norm": 1.296875, "learning_rate": 0.00048658745481227884, "loss": 5.9696, "mean_token_accuracy": 0.14811476692557335, "num_tokens": 23372552.0, "step": 11940 }, { "entropy": 6.1538183212280275, "epoch": 1.1940320887689309, "grad_norm": 1.296875, "learning_rate": 0.000486575314229122, "loss": 5.8947, "mean_token_accuracy": 0.16712473183870316, "num_tokens": 23383454.0, "step": 11945 }, { "entropy": 6.187349033355713, "epoch": 1.1945319138301596, "grad_norm": 1.1875, "learning_rate": 0.0004865631683227846, "loss": 5.9292, "mean_token_accuracy": 0.15424201488494874, "num_tokens": 23393429.0, "step": 11950 }, { "entropy": 6.104176139831543, "epoch": 1.195031738891388, "grad_norm": 1.6171875, "learning_rate": 0.00048655101709357243, "loss": 5.8826, "mean_token_accuracy": 0.15551133453845978, "num_tokens": 23403742.0, "step": 11955 }, { "entropy": 6.0717264175415036, "epoch": 1.1955315639526165, "grad_norm": 1.5, "learning_rate": 0.000486538860541791, "loss": 5.8342, "mean_token_accuracy": 0.16000038087368013, "num_tokens": 23412875.0, "step": 11960 }, { "entropy": 6.141061210632325, "epoch": 1.1960313890138452, "grad_norm": 1.2890625, "learning_rate": 0.00048652669866774636, "loss": 5.9461, "mean_token_accuracy": 0.15706803500652314, "num_tokens": 23422838.0, "step": 11965 }, { "entropy": 6.2078554153442385, "epoch": 1.1965312140750737, "grad_norm": 1.359375, "learning_rate": 0.0004865145314717443, "loss": 5.8965, "mean_token_accuracy": 0.15291520208120346, "num_tokens": 23431407.0, "step": 11970 }, { "entropy": 6.105554056167603, "epoch": 1.1970310391363024, "grad_norm": 1.5078125, "learning_rate": 0.00048650235895409115, "loss": 5.882, "mean_token_accuracy": 0.1668234571814537, "num_tokens": 23441580.0, "step": 11975 }, { "entropy": 6.088036966323853, "epoch": 1.1975308641975309, "grad_norm": 1.296875, "learning_rate": 0.0004864901811150931, "loss": 5.9639, "mean_token_accuracy": 0.15468232110142707, "num_tokens": 23451508.0, "step": 11980 }, { "entropy": 6.15867166519165, "epoch": 1.1980306892587596, "grad_norm": 1.171875, "learning_rate": 0.0004864779979550564, "loss": 5.9558, "mean_token_accuracy": 0.156481471657753, "num_tokens": 23461928.0, "step": 11985 }, { "entropy": 6.185863590240478, "epoch": 1.198530514319988, "grad_norm": 1.2109375, "learning_rate": 0.0004864658094742878, "loss": 5.8818, "mean_token_accuracy": 0.16178420633077623, "num_tokens": 23471501.0, "step": 11990 }, { "entropy": 6.22927508354187, "epoch": 1.1990303393812165, "grad_norm": 1.453125, "learning_rate": 0.00048645361567309375, "loss": 6.0367, "mean_token_accuracy": 0.1582635261118412, "num_tokens": 23481478.0, "step": 11995 }, { "entropy": 6.180087614059448, "epoch": 1.1995301644424452, "grad_norm": 1.3203125, "learning_rate": 0.0004864414165517812, "loss": 5.9858, "mean_token_accuracy": 0.15466733351349832, "num_tokens": 23491253.0, "step": 12000 }, { "epoch": 1.1995301644424452, "eval_entropy": 5.923490237341932, "eval_loss": 6.036754608154297, "eval_mean_token_accuracy": 0.16042811631977835, "eval_num_tokens": 23491253.0, "eval_runtime": 23.8632, "eval_samples_per_second": 1300.958, "eval_steps_per_second": 162.635, "step": 12000 }, { "entropy": 6.143440246582031, "epoch": 1.2000299895036737, "grad_norm": 1.2578125, "learning_rate": 0.000486429212110657, "loss": 5.974, "mean_token_accuracy": 0.1541808433830738, "num_tokens": 23500753.0, "step": 12005 }, { "entropy": 6.202025556564331, "epoch": 1.2005298145649024, "grad_norm": 1.328125, "learning_rate": 0.0004864170023500282, "loss": 5.9989, "mean_token_accuracy": 0.14976682364940644, "num_tokens": 23509837.0, "step": 12010 }, { "entropy": 6.141349983215332, "epoch": 1.2010296396261309, "grad_norm": 1.328125, "learning_rate": 0.0004864047872702021, "loss": 5.8879, "mean_token_accuracy": 0.1568389616906643, "num_tokens": 23519926.0, "step": 12015 }, { "entropy": 6.107258701324463, "epoch": 1.2015294646873593, "grad_norm": 1.2578125, "learning_rate": 0.0004863925668714859, "loss": 6.0677, "mean_token_accuracy": 0.14842357486486435, "num_tokens": 23531165.0, "step": 12020 }, { "entropy": 6.17024507522583, "epoch": 1.202029289748588, "grad_norm": 1.515625, "learning_rate": 0.0004863803411541871, "loss": 5.9056, "mean_token_accuracy": 0.1597069025039673, "num_tokens": 23541696.0, "step": 12025 }, { "entropy": 6.201007604598999, "epoch": 1.2025291148098165, "grad_norm": 1.421875, "learning_rate": 0.0004863681101186134, "loss": 5.9277, "mean_token_accuracy": 0.15260101705789567, "num_tokens": 23552382.0, "step": 12030 }, { "entropy": 6.144422149658203, "epoch": 1.2030289398710452, "grad_norm": 1.3359375, "learning_rate": 0.0004863558737650723, "loss": 5.9991, "mean_token_accuracy": 0.15438851416110994, "num_tokens": 23561444.0, "step": 12035 }, { "entropy": 6.103683614730835, "epoch": 1.2035287649322737, "grad_norm": 1.1953125, "learning_rate": 0.0004863436320938719, "loss": 5.9105, "mean_token_accuracy": 0.15528724938631058, "num_tokens": 23570985.0, "step": 12040 }, { "entropy": 6.043612432479859, "epoch": 1.2040285899935022, "grad_norm": 1.265625, "learning_rate": 0.00048633138510532003, "loss": 5.8322, "mean_token_accuracy": 0.1686202332377434, "num_tokens": 23581291.0, "step": 12045 }, { "entropy": 6.210238885879517, "epoch": 1.2045284150547308, "grad_norm": 1.3125, "learning_rate": 0.00048631913279972497, "loss": 5.9939, "mean_token_accuracy": 0.15565201342105867, "num_tokens": 23591087.0, "step": 12050 }, { "entropy": 6.146289730072022, "epoch": 1.2050282401159593, "grad_norm": 1.359375, "learning_rate": 0.00048630687517739484, "loss": 6.0009, "mean_token_accuracy": 0.14873012602329255, "num_tokens": 23601635.0, "step": 12055 }, { "entropy": 6.22243070602417, "epoch": 1.205528065177188, "grad_norm": 1.28125, "learning_rate": 0.0004862946122386381, "loss": 5.9478, "mean_token_accuracy": 0.1590518295764923, "num_tokens": 23612523.0, "step": 12060 }, { "entropy": 6.1395985126495365, "epoch": 1.2060278902384165, "grad_norm": 1.5078125, "learning_rate": 0.00048628234398376334, "loss": 5.9532, "mean_token_accuracy": 0.1569541722536087, "num_tokens": 23622258.0, "step": 12065 }, { "entropy": 6.03805103302002, "epoch": 1.2065277152996452, "grad_norm": 1.234375, "learning_rate": 0.00048627007041307914, "loss": 5.8032, "mean_token_accuracy": 0.16446440666913986, "num_tokens": 23631198.0, "step": 12070 }, { "entropy": 6.157372617721558, "epoch": 1.2070275403608737, "grad_norm": 1.3984375, "learning_rate": 0.00048625779152689435, "loss": 5.9542, "mean_token_accuracy": 0.15221483558416365, "num_tokens": 23641052.0, "step": 12075 }, { "entropy": 6.1856677532196045, "epoch": 1.2075273654221022, "grad_norm": 1.4140625, "learning_rate": 0.0004862455073255179, "loss": 5.9067, "mean_token_accuracy": 0.15828054696321486, "num_tokens": 23650785.0, "step": 12080 }, { "entropy": 6.110441732406616, "epoch": 1.2080271904833308, "grad_norm": 1.3203125, "learning_rate": 0.00048623321780925883, "loss": 5.9419, "mean_token_accuracy": 0.15526666194200517, "num_tokens": 23660548.0, "step": 12085 }, { "entropy": 6.033561134338379, "epoch": 1.2085270155445593, "grad_norm": 1.34375, "learning_rate": 0.00048622092297842637, "loss": 5.8067, "mean_token_accuracy": 0.16373466402292253, "num_tokens": 23669979.0, "step": 12090 }, { "entropy": 6.174818086624145, "epoch": 1.209026840605788, "grad_norm": 1.3203125, "learning_rate": 0.0004862086228333298, "loss": 5.9806, "mean_token_accuracy": 0.1489489808678627, "num_tokens": 23679740.0, "step": 12095 }, { "entropy": 6.223101806640625, "epoch": 1.2095266656670165, "grad_norm": 1.375, "learning_rate": 0.00048619631737427865, "loss": 5.9713, "mean_token_accuracy": 0.1611980602145195, "num_tokens": 23689688.0, "step": 12100 }, { "entropy": 6.164903545379639, "epoch": 1.2100264907282452, "grad_norm": 1.671875, "learning_rate": 0.0004861840066015825, "loss": 5.88, "mean_token_accuracy": 0.1636110857129097, "num_tokens": 23699550.0, "step": 12105 }, { "entropy": 6.152115392684936, "epoch": 1.2105263157894737, "grad_norm": 1.421875, "learning_rate": 0.00048617169051555113, "loss": 5.9662, "mean_token_accuracy": 0.15651750415563584, "num_tokens": 23709114.0, "step": 12110 }, { "entropy": 6.182860279083252, "epoch": 1.2110261408507021, "grad_norm": 1.53125, "learning_rate": 0.0004861593691164942, "loss": 5.9575, "mean_token_accuracy": 0.15342798531055452, "num_tokens": 23718758.0, "step": 12115 }, { "entropy": 6.204360389709473, "epoch": 1.2115259659119308, "grad_norm": 1.2265625, "learning_rate": 0.0004861470424047221, "loss": 5.9055, "mean_token_accuracy": 0.16160933673381805, "num_tokens": 23728175.0, "step": 12120 }, { "entropy": 5.968841123580932, "epoch": 1.2120257909731593, "grad_norm": 1.5234375, "learning_rate": 0.0004861347103805446, "loss": 5.7477, "mean_token_accuracy": 0.1743275284767151, "num_tokens": 23738308.0, "step": 12125 }, { "entropy": 6.171118879318238, "epoch": 1.212525616034388, "grad_norm": 1.328125, "learning_rate": 0.0004861223730442722, "loss": 5.9012, "mean_token_accuracy": 0.1530655413866043, "num_tokens": 23747867.0, "step": 12130 }, { "entropy": 6.090215253829956, "epoch": 1.2130254410956165, "grad_norm": 1.1953125, "learning_rate": 0.00048611003039621516, "loss": 5.8804, "mean_token_accuracy": 0.1588980495929718, "num_tokens": 23758347.0, "step": 12135 }, { "entropy": 6.1678403377532955, "epoch": 1.2135252661568452, "grad_norm": 1.296875, "learning_rate": 0.0004860976824366841, "loss": 5.9379, "mean_token_accuracy": 0.16392111480236055, "num_tokens": 23767847.0, "step": 12140 }, { "entropy": 6.174919557571411, "epoch": 1.2140250912180737, "grad_norm": 1.3125, "learning_rate": 0.00048608532916598964, "loss": 5.9708, "mean_token_accuracy": 0.15442277640104293, "num_tokens": 23777098.0, "step": 12145 }, { "entropy": 6.163359689712524, "epoch": 1.2145249162793021, "grad_norm": 1.546875, "learning_rate": 0.00048607297058444267, "loss": 5.963, "mean_token_accuracy": 0.16118056029081346, "num_tokens": 23787332.0, "step": 12150 }, { "entropy": 6.127607679367065, "epoch": 1.2150247413405308, "grad_norm": 1.40625, "learning_rate": 0.0004860606066923541, "loss": 5.8777, "mean_token_accuracy": 0.16466124951839448, "num_tokens": 23796263.0, "step": 12155 }, { "entropy": 6.14617223739624, "epoch": 1.2155245664017593, "grad_norm": 1.3203125, "learning_rate": 0.00048604823749003485, "loss": 5.911, "mean_token_accuracy": 0.15743542313575745, "num_tokens": 23806051.0, "step": 12160 }, { "entropy": 6.106583786010742, "epoch": 1.216024391462988, "grad_norm": 1.8359375, "learning_rate": 0.0004860358629777963, "loss": 5.8592, "mean_token_accuracy": 0.16498946845531465, "num_tokens": 23814925.0, "step": 12165 }, { "entropy": 6.083284664154053, "epoch": 1.2165242165242165, "grad_norm": 1.3515625, "learning_rate": 0.0004860234831559498, "loss": 5.8052, "mean_token_accuracy": 0.16558174788951874, "num_tokens": 23824785.0, "step": 12170 }, { "entropy": 6.172229862213134, "epoch": 1.2170240415854452, "grad_norm": 1.46875, "learning_rate": 0.00048601109802480676, "loss": 5.9929, "mean_token_accuracy": 0.1472548358142376, "num_tokens": 23835102.0, "step": 12175 }, { "entropy": 6.176716375350952, "epoch": 1.2175238666466737, "grad_norm": 1.3359375, "learning_rate": 0.00048599870758467875, "loss": 5.9464, "mean_token_accuracy": 0.15777206867933274, "num_tokens": 23845718.0, "step": 12180 }, { "entropy": 6.131068325042724, "epoch": 1.2180236917079021, "grad_norm": 1.2421875, "learning_rate": 0.00048598631183587753, "loss": 5.8817, "mean_token_accuracy": 0.16344125270843507, "num_tokens": 23855078.0, "step": 12185 }, { "entropy": 6.175488567352295, "epoch": 1.2185235167691308, "grad_norm": 1.59375, "learning_rate": 0.00048597391077871504, "loss": 5.955, "mean_token_accuracy": 0.15968553274869918, "num_tokens": 23864287.0, "step": 12190 }, { "entropy": 6.2001941204071045, "epoch": 1.2190233418303593, "grad_norm": 1.546875, "learning_rate": 0.00048596150441350324, "loss": 6.0496, "mean_token_accuracy": 0.14788421392440795, "num_tokens": 23874477.0, "step": 12195 }, { "entropy": 6.1178265571594235, "epoch": 1.219523166891588, "grad_norm": 1.4453125, "learning_rate": 0.0004859490927405543, "loss": 5.8163, "mean_token_accuracy": 0.1505747690796852, "num_tokens": 23884208.0, "step": 12200 }, { "entropy": 6.2836266040802, "epoch": 1.2200229919528165, "grad_norm": 1.3359375, "learning_rate": 0.0004859366757601804, "loss": 6.0522, "mean_token_accuracy": 0.15309324264526367, "num_tokens": 23894226.0, "step": 12205 }, { "entropy": 6.093864154815674, "epoch": 1.2205228170140452, "grad_norm": 1.265625, "learning_rate": 0.00048592425347269405, "loss": 5.8641, "mean_token_accuracy": 0.16805485039949417, "num_tokens": 23904238.0, "step": 12210 }, { "entropy": 6.091812467575073, "epoch": 1.2210226420752737, "grad_norm": 1.546875, "learning_rate": 0.00048591182587840777, "loss": 5.8723, "mean_token_accuracy": 0.16053334921598433, "num_tokens": 23914611.0, "step": 12215 }, { "entropy": 6.144492053985596, "epoch": 1.2215224671365021, "grad_norm": 1.3984375, "learning_rate": 0.0004858993929776342, "loss": 5.9985, "mean_token_accuracy": 0.14830951690673827, "num_tokens": 23924270.0, "step": 12220 }, { "entropy": 6.143527507781982, "epoch": 1.2220222921977308, "grad_norm": 1.328125, "learning_rate": 0.00048588695477068617, "loss": 5.896, "mean_token_accuracy": 0.15724143162369728, "num_tokens": 23932677.0, "step": 12225 }, { "entropy": 6.2154967308044435, "epoch": 1.2225221172589593, "grad_norm": 1.328125, "learning_rate": 0.00048587451125787665, "loss": 5.9286, "mean_token_accuracy": 0.15063874423503876, "num_tokens": 23943259.0, "step": 12230 }, { "entropy": 6.198149538040161, "epoch": 1.223021942320188, "grad_norm": 1.4765625, "learning_rate": 0.0004858620624395187, "loss": 5.9793, "mean_token_accuracy": 0.15282555669546127, "num_tokens": 23953162.0, "step": 12235 }, { "entropy": 6.253126049041748, "epoch": 1.2235217673814165, "grad_norm": 1.4375, "learning_rate": 0.00048584960831592547, "loss": 6.0202, "mean_token_accuracy": 0.14977033585309982, "num_tokens": 23961577.0, "step": 12240 }, { "entropy": 6.126883125305175, "epoch": 1.2240215924426452, "grad_norm": 1.5234375, "learning_rate": 0.00048583714888741035, "loss": 5.8278, "mean_token_accuracy": 0.16924876421689988, "num_tokens": 23969691.0, "step": 12245 }, { "entropy": 6.038387107849121, "epoch": 1.2245214175038737, "grad_norm": 1.265625, "learning_rate": 0.00048582468415428687, "loss": 5.9055, "mean_token_accuracy": 0.15907573848962783, "num_tokens": 23980753.0, "step": 12250 }, { "entropy": 6.183107614517212, "epoch": 1.2250212425651021, "grad_norm": 1.5, "learning_rate": 0.00048581221411686857, "loss": 5.9774, "mean_token_accuracy": 0.15522108525037764, "num_tokens": 23991841.0, "step": 12255 }, { "entropy": 6.180950736999511, "epoch": 1.2255210676263308, "grad_norm": 1.421875, "learning_rate": 0.00048579973877546916, "loss": 5.8767, "mean_token_accuracy": 0.16092007905244826, "num_tokens": 24000749.0, "step": 12260 }, { "entropy": 6.246607065200806, "epoch": 1.2260208926875593, "grad_norm": 1.7578125, "learning_rate": 0.00048578725813040263, "loss": 6.0764, "mean_token_accuracy": 0.1493350088596344, "num_tokens": 24010055.0, "step": 12265 }, { "entropy": 6.1432219505310055, "epoch": 1.226520717748788, "grad_norm": 1.28125, "learning_rate": 0.0004857747721819829, "loss": 5.9425, "mean_token_accuracy": 0.15949156284332275, "num_tokens": 24019307.0, "step": 12270 }, { "entropy": 6.118947696685791, "epoch": 1.2270205428100165, "grad_norm": 1.3984375, "learning_rate": 0.0004857622809305241, "loss": 5.7952, "mean_token_accuracy": 0.16963599920272826, "num_tokens": 24028913.0, "step": 12275 }, { "entropy": 6.136103773117066, "epoch": 1.2275203678712452, "grad_norm": 1.265625, "learning_rate": 0.00048574978437634057, "loss": 5.8192, "mean_token_accuracy": 0.16369618177413942, "num_tokens": 24038357.0, "step": 12280 }, { "entropy": 6.144922304153442, "epoch": 1.2280201929324737, "grad_norm": 1.2578125, "learning_rate": 0.0004857372825197468, "loss": 5.885, "mean_token_accuracy": 0.16259193122386933, "num_tokens": 24048199.0, "step": 12285 }, { "entropy": 6.149617767333984, "epoch": 1.2285200179937021, "grad_norm": 1.3984375, "learning_rate": 0.0004857247753610571, "loss": 5.9656, "mean_token_accuracy": 0.16008811444044113, "num_tokens": 24058311.0, "step": 12290 }, { "entropy": 6.178594255447388, "epoch": 1.2290198430549308, "grad_norm": 1.34375, "learning_rate": 0.00048571226290058635, "loss": 5.9345, "mean_token_accuracy": 0.15250544100999833, "num_tokens": 24068471.0, "step": 12295 }, { "entropy": 6.168077993392944, "epoch": 1.2295196681161593, "grad_norm": 1.234375, "learning_rate": 0.0004856997451386492, "loss": 5.9128, "mean_token_accuracy": 0.15999604612588883, "num_tokens": 24078118.0, "step": 12300 }, { "entropy": 6.174386119842529, "epoch": 1.2300194931773878, "grad_norm": 1.203125, "learning_rate": 0.0004856872220755607, "loss": 5.9231, "mean_token_accuracy": 0.16301810443401338, "num_tokens": 24088517.0, "step": 12305 }, { "entropy": 6.2022782325744625, "epoch": 1.2305193182386165, "grad_norm": 1.3515625, "learning_rate": 0.000485674693711636, "loss": 6.0139, "mean_token_accuracy": 0.1541484698653221, "num_tokens": 24097421.0, "step": 12310 }, { "entropy": 6.082457399368286, "epoch": 1.231019143299845, "grad_norm": 1.3046875, "learning_rate": 0.0004856621600471901, "loss": 5.8235, "mean_token_accuracy": 0.16490086764097214, "num_tokens": 24106531.0, "step": 12315 }, { "entropy": 6.133380794525147, "epoch": 1.2315189683610737, "grad_norm": 1.2578125, "learning_rate": 0.00048564962108253853, "loss": 5.8929, "mean_token_accuracy": 0.16117538064718245, "num_tokens": 24115246.0, "step": 12320 }, { "entropy": 6.212507724761963, "epoch": 1.2320187934223021, "grad_norm": 1.2421875, "learning_rate": 0.0004856370768179967, "loss": 5.9846, "mean_token_accuracy": 0.15108444541692734, "num_tokens": 24126163.0, "step": 12325 }, { "entropy": 6.148311281204224, "epoch": 1.2325186184835308, "grad_norm": 1.328125, "learning_rate": 0.00048562452725388024, "loss": 5.9421, "mean_token_accuracy": 0.15411113798618317, "num_tokens": 24135722.0, "step": 12330 }, { "entropy": 6.039162063598633, "epoch": 1.2330184435447593, "grad_norm": 1.296875, "learning_rate": 0.0004856119723905048, "loss": 5.757, "mean_token_accuracy": 0.16728441715240477, "num_tokens": 24145278.0, "step": 12335 }, { "entropy": 6.136285829544067, "epoch": 1.2335182686059878, "grad_norm": 1.2890625, "learning_rate": 0.0004855994122281864, "loss": 5.933, "mean_token_accuracy": 0.15703438371419906, "num_tokens": 24154710.0, "step": 12340 }, { "entropy": 6.157153034210205, "epoch": 1.2340180936672165, "grad_norm": 1.265625, "learning_rate": 0.00048558684676724083, "loss": 5.9662, "mean_token_accuracy": 0.14584285765886307, "num_tokens": 24164373.0, "step": 12345 }, { "entropy": 6.114428377151489, "epoch": 1.234517918728445, "grad_norm": 1.1796875, "learning_rate": 0.00048557427600798454, "loss": 5.8033, "mean_token_accuracy": 0.16437434107065202, "num_tokens": 24173085.0, "step": 12350 }, { "entropy": 6.133389234542847, "epoch": 1.2350177437896737, "grad_norm": 1.3125, "learning_rate": 0.0004855616999507336, "loss": 5.922, "mean_token_accuracy": 0.1623062863945961, "num_tokens": 24182936.0, "step": 12355 }, { "entropy": 6.206312608718872, "epoch": 1.2355175688509021, "grad_norm": 1.3203125, "learning_rate": 0.00048554911859580445, "loss": 5.9178, "mean_token_accuracy": 0.1538863644003868, "num_tokens": 24192407.0, "step": 12360 }, { "entropy": 6.263148021697998, "epoch": 1.2360173939121308, "grad_norm": 1.3046875, "learning_rate": 0.0004855365319435137, "loss": 5.9299, "mean_token_accuracy": 0.1604176089167595, "num_tokens": 24201770.0, "step": 12365 }, { "entropy": 6.0705146312713625, "epoch": 1.2365172189733593, "grad_norm": 1.25, "learning_rate": 0.000485523939994178, "loss": 5.8659, "mean_token_accuracy": 0.16046635955572128, "num_tokens": 24211287.0, "step": 12370 }, { "entropy": 6.066037034988403, "epoch": 1.2370170440345878, "grad_norm": 1.46875, "learning_rate": 0.0004855113427481141, "loss": 5.8959, "mean_token_accuracy": 0.15989235490560533, "num_tokens": 24221277.0, "step": 12375 }, { "entropy": 6.163655948638916, "epoch": 1.2375168690958165, "grad_norm": 1.2578125, "learning_rate": 0.000485498740205639, "loss": 5.8121, "mean_token_accuracy": 0.16204496324062348, "num_tokens": 24231272.0, "step": 12380 }, { "entropy": 6.160795259475708, "epoch": 1.238016694157045, "grad_norm": 1.796875, "learning_rate": 0.00048548613236706976, "loss": 5.947, "mean_token_accuracy": 0.1588428571820259, "num_tokens": 24242073.0, "step": 12385 }, { "entropy": 5.980325698852539, "epoch": 1.2385165192182737, "grad_norm": 1.2265625, "learning_rate": 0.0004854735192327236, "loss": 5.7687, "mean_token_accuracy": 0.1730379968881607, "num_tokens": 24251928.0, "step": 12390 }, { "entropy": 6.052261543273926, "epoch": 1.2390163442795021, "grad_norm": 1.3203125, "learning_rate": 0.00048546090080291783, "loss": 5.8633, "mean_token_accuracy": 0.16469375938177108, "num_tokens": 24261146.0, "step": 12395 }, { "entropy": 6.176646041870117, "epoch": 1.2395161693407308, "grad_norm": 1.2890625, "learning_rate": 0.00048544827707797, "loss": 6.0087, "mean_token_accuracy": 0.15118223130702974, "num_tokens": 24271675.0, "step": 12400 }, { "entropy": 6.197798395156861, "epoch": 1.2400159944019593, "grad_norm": 1.3515625, "learning_rate": 0.00048543564805819764, "loss": 5.8749, "mean_token_accuracy": 0.15736810266971588, "num_tokens": 24280795.0, "step": 12405 }, { "entropy": 6.131864166259765, "epoch": 1.2405158194631878, "grad_norm": 1.2265625, "learning_rate": 0.0004854230137439185, "loss": 5.9011, "mean_token_accuracy": 0.15908429622650147, "num_tokens": 24291204.0, "step": 12410 }, { "entropy": 6.114142274856567, "epoch": 1.2410156445244165, "grad_norm": 1.375, "learning_rate": 0.00048541037413545046, "loss": 5.8798, "mean_token_accuracy": 0.16358888447284697, "num_tokens": 24300926.0, "step": 12415 }, { "entropy": 6.085081577301025, "epoch": 1.241515469585645, "grad_norm": 1.3359375, "learning_rate": 0.0004853977292331116, "loss": 5.7744, "mean_token_accuracy": 0.1617984801530838, "num_tokens": 24310319.0, "step": 12420 }, { "entropy": 6.037611579895019, "epoch": 1.2420152946468737, "grad_norm": 1.265625, "learning_rate": 0.0004853850790372201, "loss": 5.9363, "mean_token_accuracy": 0.15590060651302337, "num_tokens": 24321671.0, "step": 12425 }, { "entropy": 6.136835527420044, "epoch": 1.2425151197081021, "grad_norm": 1.2734375, "learning_rate": 0.00048537242354809403, "loss": 5.9856, "mean_token_accuracy": 0.1503479741513729, "num_tokens": 24330275.0, "step": 12430 }, { "entropy": 6.193158340454102, "epoch": 1.2430149447693308, "grad_norm": 1.3359375, "learning_rate": 0.00048535976276605186, "loss": 5.9108, "mean_token_accuracy": 0.15676185339689255, "num_tokens": 24339753.0, "step": 12435 }, { "entropy": 6.115321302413941, "epoch": 1.2435147698305593, "grad_norm": 1.265625, "learning_rate": 0.0004853470966914123, "loss": 5.9097, "mean_token_accuracy": 0.15569395571947098, "num_tokens": 24349517.0, "step": 12440 }, { "entropy": 6.04531421661377, "epoch": 1.2440145948917878, "grad_norm": 1.375, "learning_rate": 0.0004853344253244939, "loss": 5.7996, "mean_token_accuracy": 0.16397407799959182, "num_tokens": 24358036.0, "step": 12445 }, { "entropy": 6.0908716201782225, "epoch": 1.2445144199530165, "grad_norm": 1.2578125, "learning_rate": 0.00048532174866561543, "loss": 5.7881, "mean_token_accuracy": 0.16707671880722047, "num_tokens": 24367488.0, "step": 12450 }, { "entropy": 6.2450621128082275, "epoch": 1.245014245014245, "grad_norm": 1.4609375, "learning_rate": 0.00048530906671509597, "loss": 6.0684, "mean_token_accuracy": 0.14787414222955703, "num_tokens": 24377053.0, "step": 12455 }, { "entropy": 6.197347784042359, "epoch": 1.2455140700754737, "grad_norm": 1.265625, "learning_rate": 0.00048529637947325444, "loss": 5.9664, "mean_token_accuracy": 0.14754286259412766, "num_tokens": 24387245.0, "step": 12460 }, { "entropy": 6.228249740600586, "epoch": 1.2460138951367021, "grad_norm": 1.484375, "learning_rate": 0.0004852836869404101, "loss": 5.9739, "mean_token_accuracy": 0.15413450449705124, "num_tokens": 24395901.0, "step": 12465 }, { "entropy": 6.145458030700683, "epoch": 1.2465137201979308, "grad_norm": 1.6640625, "learning_rate": 0.0004852709891168823, "loss": 5.865, "mean_token_accuracy": 0.16206178367137908, "num_tokens": 24405148.0, "step": 12470 }, { "entropy": 6.069533491134644, "epoch": 1.2470135452591593, "grad_norm": 1.328125, "learning_rate": 0.0004852582860029906, "loss": 5.8347, "mean_token_accuracy": 0.16046560406684876, "num_tokens": 24415406.0, "step": 12475 }, { "entropy": 6.0369627475738525, "epoch": 1.2475133703203878, "grad_norm": 1.4921875, "learning_rate": 0.00048524557759905445, "loss": 5.8139, "mean_token_accuracy": 0.1653281643986702, "num_tokens": 24425702.0, "step": 12480 }, { "entropy": 6.174066209793091, "epoch": 1.2480131953816165, "grad_norm": 1.359375, "learning_rate": 0.0004852328639053937, "loss": 5.9245, "mean_token_accuracy": 0.1507974810898304, "num_tokens": 24435702.0, "step": 12485 }, { "entropy": 6.197006750106811, "epoch": 1.248513020442845, "grad_norm": 1.2734375, "learning_rate": 0.0004852201449223282, "loss": 5.9521, "mean_token_accuracy": 0.1494345098733902, "num_tokens": 24445545.0, "step": 12490 }, { "entropy": 6.1598365783691404, "epoch": 1.2490128455040737, "grad_norm": 1.40625, "learning_rate": 0.000485207420650178, "loss": 5.9819, "mean_token_accuracy": 0.15773148462176323, "num_tokens": 24455269.0, "step": 12495 }, { "entropy": 6.160503768920899, "epoch": 1.2495126705653021, "grad_norm": 1.3515625, "learning_rate": 0.0004851946910892631, "loss": 5.929, "mean_token_accuracy": 0.16134475618600846, "num_tokens": 24465563.0, "step": 12500 }, { "entropy": 6.097579622268677, "epoch": 1.2500124956265308, "grad_norm": 1.3203125, "learning_rate": 0.0004851819562399039, "loss": 5.9698, "mean_token_accuracy": 0.15840654373168944, "num_tokens": 24475837.0, "step": 12505 }, { "entropy": 6.24086709022522, "epoch": 1.2505123206877593, "grad_norm": 1.3125, "learning_rate": 0.0004851692161024207, "loss": 6.0171, "mean_token_accuracy": 0.14837371334433555, "num_tokens": 24486384.0, "step": 12510 }, { "entropy": 6.227885293960571, "epoch": 1.2510121457489878, "grad_norm": 1.3125, "learning_rate": 0.00048515647067713425, "loss": 6.0304, "mean_token_accuracy": 0.15465719103813172, "num_tokens": 24495840.0, "step": 12515 }, { "entropy": 6.112557983398437, "epoch": 1.2515119708102165, "grad_norm": 1.375, "learning_rate": 0.000485143719964365, "loss": 5.8764, "mean_token_accuracy": 0.15842797607183456, "num_tokens": 24505849.0, "step": 12520 }, { "entropy": 6.109187746047974, "epoch": 1.252011795871445, "grad_norm": 1.1796875, "learning_rate": 0.0004851309639644338, "loss": 5.9793, "mean_token_accuracy": 0.15028330609202384, "num_tokens": 24517440.0, "step": 12525 }, { "entropy": 6.118728399276733, "epoch": 1.2525116209326734, "grad_norm": 1.140625, "learning_rate": 0.0004851182026776616, "loss": 5.8453, "mean_token_accuracy": 0.16685607880353928, "num_tokens": 24527602.0, "step": 12530 }, { "entropy": 6.097123289108277, "epoch": 1.2530114459939021, "grad_norm": 1.5078125, "learning_rate": 0.0004851054361043696, "loss": 5.8136, "mean_token_accuracy": 0.16851051151752472, "num_tokens": 24536770.0, "step": 12535 }, { "entropy": 6.124136161804199, "epoch": 1.2535112710551308, "grad_norm": 1.296875, "learning_rate": 0.00048509266424487873, "loss": 5.933, "mean_token_accuracy": 0.1538613349199295, "num_tokens": 24546230.0, "step": 12540 }, { "entropy": 6.050775623321533, "epoch": 1.2540110961163593, "grad_norm": 1.546875, "learning_rate": 0.0004850798870995106, "loss": 5.8765, "mean_token_accuracy": 0.15772414803504944, "num_tokens": 24555130.0, "step": 12545 }, { "entropy": 6.1660980701446535, "epoch": 1.2545109211775878, "grad_norm": 1.234375, "learning_rate": 0.00048506710466858657, "loss": 5.9823, "mean_token_accuracy": 0.15560240149497986, "num_tokens": 24565167.0, "step": 12550 }, { "entropy": 6.138290357589722, "epoch": 1.2550107462388165, "grad_norm": 1.390625, "learning_rate": 0.00048505431695242823, "loss": 5.9677, "mean_token_accuracy": 0.1618862971663475, "num_tokens": 24574545.0, "step": 12555 }, { "entropy": 6.170036697387696, "epoch": 1.255510571300045, "grad_norm": 1.3671875, "learning_rate": 0.00048504152395135726, "loss": 5.9833, "mean_token_accuracy": 0.15542703121900558, "num_tokens": 24585050.0, "step": 12560 }, { "entropy": 6.256245422363281, "epoch": 1.2560103963612734, "grad_norm": 1.3203125, "learning_rate": 0.00048502872566569564, "loss": 6.0113, "mean_token_accuracy": 0.14865442514419555, "num_tokens": 24596334.0, "step": 12565 }, { "entropy": 6.15869107246399, "epoch": 1.2565102214225021, "grad_norm": 1.328125, "learning_rate": 0.00048501592209576535, "loss": 5.9101, "mean_token_accuracy": 0.15852668583393098, "num_tokens": 24605947.0, "step": 12570 }, { "entropy": 6.0848160743713375, "epoch": 1.2570100464837308, "grad_norm": 1.3203125, "learning_rate": 0.0004850031132418885, "loss": 5.7945, "mean_token_accuracy": 0.17117061614990234, "num_tokens": 24614336.0, "step": 12575 }, { "entropy": 6.109485626220703, "epoch": 1.2575098715449593, "grad_norm": 1.21875, "learning_rate": 0.00048499029910438734, "loss": 5.8887, "mean_token_accuracy": 0.16080235689878464, "num_tokens": 24624906.0, "step": 12580 }, { "entropy": 6.215049362182617, "epoch": 1.2580096966061878, "grad_norm": 1.296875, "learning_rate": 0.00048497747968358424, "loss": 5.9384, "mean_token_accuracy": 0.15699917152523996, "num_tokens": 24634127.0, "step": 12585 }, { "entropy": 6.06918158531189, "epoch": 1.2585095216674165, "grad_norm": 1.328125, "learning_rate": 0.0004849646549798019, "loss": 5.8211, "mean_token_accuracy": 0.1637175738811493, "num_tokens": 24642451.0, "step": 12590 }, { "entropy": 6.116307544708252, "epoch": 1.259009346728645, "grad_norm": 1.3515625, "learning_rate": 0.00048495182499336275, "loss": 5.8379, "mean_token_accuracy": 0.16285798996686934, "num_tokens": 24651229.0, "step": 12595 }, { "entropy": 6.146953392028808, "epoch": 1.2595091717898734, "grad_norm": 1.5625, "learning_rate": 0.00048493898972458985, "loss": 6.0355, "mean_token_accuracy": 0.15328094512224197, "num_tokens": 24660435.0, "step": 12600 }, { "entropy": 6.131228876113892, "epoch": 1.2600089968511021, "grad_norm": 1.296875, "learning_rate": 0.0004849261491738059, "loss": 5.9337, "mean_token_accuracy": 0.15446446985006332, "num_tokens": 24669254.0, "step": 12605 }, { "entropy": 6.13405065536499, "epoch": 1.2605088219123306, "grad_norm": 1.3359375, "learning_rate": 0.00048491330334133405, "loss": 5.8254, "mean_token_accuracy": 0.1619556024670601, "num_tokens": 24677943.0, "step": 12610 }, { "entropy": 6.216641044616699, "epoch": 1.2610086469735593, "grad_norm": 1.6328125, "learning_rate": 0.00048490045222749744, "loss": 5.9961, "mean_token_accuracy": 0.149625363945961, "num_tokens": 24686678.0, "step": 12615 }, { "entropy": 6.142766618728638, "epoch": 1.2615084720347878, "grad_norm": 1.3515625, "learning_rate": 0.00048488759583261955, "loss": 5.8315, "mean_token_accuracy": 0.16586627811193466, "num_tokens": 24696417.0, "step": 12620 }, { "entropy": 6.1422553062438965, "epoch": 1.2620082970960165, "grad_norm": 1.296875, "learning_rate": 0.0004848747341570238, "loss": 5.9693, "mean_token_accuracy": 0.15504771694540978, "num_tokens": 24705624.0, "step": 12625 }, { "entropy": 6.149065208435059, "epoch": 1.262508122157245, "grad_norm": 1.3125, "learning_rate": 0.00048486186720103364, "loss": 5.8893, "mean_token_accuracy": 0.15257293730974197, "num_tokens": 24715705.0, "step": 12630 }, { "entropy": 6.116073226928711, "epoch": 1.2630079472184734, "grad_norm": 1.3046875, "learning_rate": 0.000484848994964973, "loss": 5.8561, "mean_token_accuracy": 0.16290032714605332, "num_tokens": 24725358.0, "step": 12635 }, { "entropy": 6.09953031539917, "epoch": 1.2635077722797021, "grad_norm": 1.21875, "learning_rate": 0.00048483611744916556, "loss": 5.9554, "mean_token_accuracy": 0.1561470717191696, "num_tokens": 24735457.0, "step": 12640 }, { "entropy": 6.258626937866211, "epoch": 1.2640075973409306, "grad_norm": 1.28125, "learning_rate": 0.00048482323465393545, "loss": 5.9732, "mean_token_accuracy": 0.1545448236167431, "num_tokens": 24745391.0, "step": 12645 }, { "entropy": 6.153474807739258, "epoch": 1.2645074224021593, "grad_norm": 1.3046875, "learning_rate": 0.0004848103465796067, "loss": 5.897, "mean_token_accuracy": 0.16451151072978973, "num_tokens": 24754578.0, "step": 12650 }, { "entropy": 6.087050724029541, "epoch": 1.2650072474633878, "grad_norm": 1.3515625, "learning_rate": 0.0004847974532265037, "loss": 5.9306, "mean_token_accuracy": 0.1613159030675888, "num_tokens": 24764115.0, "step": 12655 }, { "entropy": 6.140824604034424, "epoch": 1.2655070725246165, "grad_norm": 1.3515625, "learning_rate": 0.0004847845545949507, "loss": 5.8993, "mean_token_accuracy": 0.15882621258497237, "num_tokens": 24773247.0, "step": 12660 }, { "entropy": 6.101389408111572, "epoch": 1.266006897585845, "grad_norm": 1.2578125, "learning_rate": 0.00048477165068527237, "loss": 5.8787, "mean_token_accuracy": 0.16493503898382186, "num_tokens": 24783139.0, "step": 12665 }, { "entropy": 6.213921165466308, "epoch": 1.2665067226470734, "grad_norm": 1.53125, "learning_rate": 0.00048475874149779313, "loss": 5.9355, "mean_token_accuracy": 0.1574448376893997, "num_tokens": 24793591.0, "step": 12670 }, { "entropy": 6.1698345184326175, "epoch": 1.2670065477083021, "grad_norm": 1.3203125, "learning_rate": 0.000484745827032838, "loss": 5.8554, "mean_token_accuracy": 0.16278644055128097, "num_tokens": 24803340.0, "step": 12675 }, { "entropy": 6.071834707260132, "epoch": 1.2675063727695306, "grad_norm": 1.2890625, "learning_rate": 0.00048473290729073194, "loss": 5.7862, "mean_token_accuracy": 0.16299667656421662, "num_tokens": 24812133.0, "step": 12680 }, { "entropy": 6.071779394149781, "epoch": 1.2680061978307593, "grad_norm": 1.2734375, "learning_rate": 0.0004847199822717998, "loss": 5.9166, "mean_token_accuracy": 0.15988943725824356, "num_tokens": 24822443.0, "step": 12685 }, { "entropy": 6.088105487823486, "epoch": 1.2685060228919878, "grad_norm": 1.3359375, "learning_rate": 0.0004847070519763668, "loss": 5.8529, "mean_token_accuracy": 0.17268768846988677, "num_tokens": 24832390.0, "step": 12690 }, { "entropy": 6.130566692352295, "epoch": 1.2690058479532165, "grad_norm": 1.3046875, "learning_rate": 0.0004846941164047585, "loss": 5.8429, "mean_token_accuracy": 0.16656181067228318, "num_tokens": 24841704.0, "step": 12695 }, { "entropy": 6.235428762435913, "epoch": 1.269505673014445, "grad_norm": 1.171875, "learning_rate": 0.00048468117555730013, "loss": 5.9967, "mean_token_accuracy": 0.15421323403716086, "num_tokens": 24852459.0, "step": 12700 }, { "entropy": 6.137821531295776, "epoch": 1.2700054980756734, "grad_norm": 1.390625, "learning_rate": 0.0004846682294343173, "loss": 5.9582, "mean_token_accuracy": 0.15802925378084182, "num_tokens": 24861758.0, "step": 12705 }, { "entropy": 6.263102197647095, "epoch": 1.2705053231369021, "grad_norm": 1.21875, "learning_rate": 0.0004846552780361358, "loss": 5.994, "mean_token_accuracy": 0.1518670491874218, "num_tokens": 24871855.0, "step": 12710 }, { "entropy": 6.159356212615966, "epoch": 1.2710051481981306, "grad_norm": 1.3125, "learning_rate": 0.00048464232136308146, "loss": 5.8889, "mean_token_accuracy": 0.16126847863197327, "num_tokens": 24880602.0, "step": 12715 }, { "entropy": 6.095026016235352, "epoch": 1.2715049732593593, "grad_norm": 1.421875, "learning_rate": 0.0004846293594154802, "loss": 5.9184, "mean_token_accuracy": 0.15892921686172484, "num_tokens": 24891032.0, "step": 12720 }, { "entropy": 6.124080944061279, "epoch": 1.2720047983205878, "grad_norm": 1.1875, "learning_rate": 0.0004846163921936583, "loss": 5.8954, "mean_token_accuracy": 0.15868026465177537, "num_tokens": 24900892.0, "step": 12725 }, { "entropy": 6.210001373291016, "epoch": 1.2725046233818165, "grad_norm": 1.28125, "learning_rate": 0.00048460341969794183, "loss": 5.9724, "mean_token_accuracy": 0.15081714242696762, "num_tokens": 24910576.0, "step": 12730 }, { "entropy": 6.112710809707641, "epoch": 1.273004448443045, "grad_norm": 1.328125, "learning_rate": 0.00048459044192865726, "loss": 5.9639, "mean_token_accuracy": 0.1581423833966255, "num_tokens": 24920861.0, "step": 12735 }, { "entropy": 6.187848234176636, "epoch": 1.2735042735042734, "grad_norm": 1.234375, "learning_rate": 0.0004845774588861311, "loss": 5.9535, "mean_token_accuracy": 0.15202307403087617, "num_tokens": 24930539.0, "step": 12740 }, { "entropy": 6.106684780120849, "epoch": 1.2740040985655021, "grad_norm": 1.2578125, "learning_rate": 0.00048456447057069004, "loss": 5.9644, "mean_token_accuracy": 0.15325247421860694, "num_tokens": 24939737.0, "step": 12745 }, { "entropy": 6.174986457824707, "epoch": 1.2745039236267306, "grad_norm": 1.21875, "learning_rate": 0.00048455147698266084, "loss": 6.0029, "mean_token_accuracy": 0.1542637139558792, "num_tokens": 24949316.0, "step": 12750 }, { "entropy": 6.1558287143707275, "epoch": 1.2750037486879593, "grad_norm": 1.234375, "learning_rate": 0.0004845384781223703, "loss": 5.852, "mean_token_accuracy": 0.16335819512605668, "num_tokens": 24959454.0, "step": 12755 }, { "entropy": 6.12948055267334, "epoch": 1.2755035737491878, "grad_norm": 1.2578125, "learning_rate": 0.00048452547399014566, "loss": 5.9352, "mean_token_accuracy": 0.15802226662635804, "num_tokens": 24969091.0, "step": 12760 }, { "entropy": 6.145900726318359, "epoch": 1.2760033988104165, "grad_norm": 1.3125, "learning_rate": 0.000484512464586314, "loss": 5.7846, "mean_token_accuracy": 0.16441865712404252, "num_tokens": 24979239.0, "step": 12765 }, { "entropy": 6.2058042049407955, "epoch": 1.276503223871645, "grad_norm": 1.3984375, "learning_rate": 0.00048449944991120264, "loss": 5.9834, "mean_token_accuracy": 0.1546609953045845, "num_tokens": 24989274.0, "step": 12770 }, { "entropy": 6.18181848526001, "epoch": 1.2770030489328734, "grad_norm": 1.4140625, "learning_rate": 0.0004844864299651391, "loss": 5.8697, "mean_token_accuracy": 0.15770785361528397, "num_tokens": 24997873.0, "step": 12775 }, { "entropy": 6.043127346038818, "epoch": 1.2775028739941021, "grad_norm": 1.265625, "learning_rate": 0.00048447340474845076, "loss": 5.862, "mean_token_accuracy": 0.16047936379909516, "num_tokens": 25007829.0, "step": 12780 }, { "entropy": 6.05285062789917, "epoch": 1.2780026990553306, "grad_norm": 1.4296875, "learning_rate": 0.00048446037426146555, "loss": 5.8513, "mean_token_accuracy": 0.1603124648332596, "num_tokens": 25016795.0, "step": 12785 }, { "entropy": 6.138433170318604, "epoch": 1.278502524116559, "grad_norm": 1.25, "learning_rate": 0.0004844473385045112, "loss": 5.9159, "mean_token_accuracy": 0.15596069470047952, "num_tokens": 25026012.0, "step": 12790 }, { "entropy": 6.093439102172852, "epoch": 1.2790023491777878, "grad_norm": 1.3984375, "learning_rate": 0.0004844342974779157, "loss": 5.8291, "mean_token_accuracy": 0.1692409783601761, "num_tokens": 25035353.0, "step": 12795 }, { "entropy": 6.1351806163787845, "epoch": 1.2795021742390165, "grad_norm": 1.2265625, "learning_rate": 0.00048442125118200707, "loss": 5.9162, "mean_token_accuracy": 0.15810562670230865, "num_tokens": 25045301.0, "step": 12800 }, { "entropy": 6.173824310302734, "epoch": 1.280001999300245, "grad_norm": 1.328125, "learning_rate": 0.0004844081996171137, "loss": 5.9589, "mean_token_accuracy": 0.15624310076236725, "num_tokens": 25055576.0, "step": 12805 }, { "entropy": 6.0311055183410645, "epoch": 1.2805018243614734, "grad_norm": 1.3203125, "learning_rate": 0.000484395142783564, "loss": 5.8121, "mean_token_accuracy": 0.16766391843557357, "num_tokens": 25064077.0, "step": 12810 }, { "entropy": 6.017964506149292, "epoch": 1.2810016494227021, "grad_norm": 1.28125, "learning_rate": 0.0004843820806816863, "loss": 5.8144, "mean_token_accuracy": 0.1673479273915291, "num_tokens": 25072908.0, "step": 12815 }, { "entropy": 6.138772106170654, "epoch": 1.2815014744839306, "grad_norm": 1.2109375, "learning_rate": 0.0004843690133118094, "loss": 5.9236, "mean_token_accuracy": 0.15627482235431672, "num_tokens": 25082919.0, "step": 12820 }, { "entropy": 6.2176624774932865, "epoch": 1.282001299545159, "grad_norm": 1.21875, "learning_rate": 0.000484355940674262, "loss": 5.9598, "mean_token_accuracy": 0.1600956827402115, "num_tokens": 25092520.0, "step": 12825 }, { "entropy": 6.11890435218811, "epoch": 1.2825011246063878, "grad_norm": 1.3515625, "learning_rate": 0.00048434286276937294, "loss": 5.952, "mean_token_accuracy": 0.15088521540164948, "num_tokens": 25102638.0, "step": 12830 }, { "entropy": 6.05759973526001, "epoch": 1.2830009496676165, "grad_norm": 1.328125, "learning_rate": 0.0004843297795974713, "loss": 5.9399, "mean_token_accuracy": 0.15684837549924852, "num_tokens": 25112011.0, "step": 12835 }, { "entropy": 6.182925748825073, "epoch": 1.283500774728845, "grad_norm": 1.375, "learning_rate": 0.0004843166911588864, "loss": 5.9875, "mean_token_accuracy": 0.15050630867481232, "num_tokens": 25122051.0, "step": 12840 }, { "entropy": 6.237850284576416, "epoch": 1.2840005997900734, "grad_norm": 1.2265625, "learning_rate": 0.0004843035974539473, "loss": 5.9483, "mean_token_accuracy": 0.15074261724948884, "num_tokens": 25131928.0, "step": 12845 }, { "entropy": 6.022640514373779, "epoch": 1.2845004248513021, "grad_norm": 1.3671875, "learning_rate": 0.00048429049848298364, "loss": 5.7247, "mean_token_accuracy": 0.1703232541680336, "num_tokens": 25140204.0, "step": 12850 }, { "entropy": 6.0534802913665775, "epoch": 1.2850002499125306, "grad_norm": 1.3203125, "learning_rate": 0.00048427739424632485, "loss": 5.8285, "mean_token_accuracy": 0.16151807755231856, "num_tokens": 25149445.0, "step": 12855 }, { "entropy": 6.1226630210876465, "epoch": 1.285500074973759, "grad_norm": 1.2890625, "learning_rate": 0.00048426428474430055, "loss": 5.8684, "mean_token_accuracy": 0.16000229269266128, "num_tokens": 25159311.0, "step": 12860 }, { "entropy": 6.05877947807312, "epoch": 1.2859999000349878, "grad_norm": 1.359375, "learning_rate": 0.00048425116997724083, "loss": 5.8156, "mean_token_accuracy": 0.1679415859282017, "num_tokens": 25168880.0, "step": 12865 }, { "entropy": 6.10956826210022, "epoch": 1.2864997250962165, "grad_norm": 1.3671875, "learning_rate": 0.00048423804994547555, "loss": 5.8511, "mean_token_accuracy": 0.1589955359697342, "num_tokens": 25177812.0, "step": 12870 }, { "entropy": 6.012914180755615, "epoch": 1.286999550157445, "grad_norm": 1.265625, "learning_rate": 0.00048422492464933464, "loss": 5.8141, "mean_token_accuracy": 0.16360452622175217, "num_tokens": 25187831.0, "step": 12875 }, { "entropy": 6.074532222747803, "epoch": 1.2874993752186734, "grad_norm": 1.4453125, "learning_rate": 0.00048421179408914857, "loss": 5.8131, "mean_token_accuracy": 0.16218030005693435, "num_tokens": 25198164.0, "step": 12880 }, { "entropy": 6.217318916320801, "epoch": 1.2879992002799021, "grad_norm": 1.3203125, "learning_rate": 0.00048419865826524757, "loss": 5.9544, "mean_token_accuracy": 0.15810884088277816, "num_tokens": 25208740.0, "step": 12885 }, { "entropy": 6.136310720443726, "epoch": 1.2884990253411306, "grad_norm": 1.2890625, "learning_rate": 0.00048418551717796217, "loss": 5.8559, "mean_token_accuracy": 0.16279749274253846, "num_tokens": 25218475.0, "step": 12890 }, { "entropy": 6.1293775081634525, "epoch": 1.288998850402359, "grad_norm": 1.234375, "learning_rate": 0.00048417237082762295, "loss": 5.9791, "mean_token_accuracy": 0.15591106414794922, "num_tokens": 25227943.0, "step": 12895 }, { "entropy": 5.933111667633057, "epoch": 1.2894986754635878, "grad_norm": 1.4765625, "learning_rate": 0.00048415921921456074, "loss": 5.7717, "mean_token_accuracy": 0.16989419162273406, "num_tokens": 25237131.0, "step": 12900 }, { "entropy": 6.131748151779175, "epoch": 1.2899985005248162, "grad_norm": 1.421875, "learning_rate": 0.00048414606233910634, "loss": 5.8482, "mean_token_accuracy": 0.16231559514999389, "num_tokens": 25245983.0, "step": 12905 }, { "entropy": 6.080750846862793, "epoch": 1.290498325586045, "grad_norm": 1.2890625, "learning_rate": 0.0004841329002015909, "loss": 5.8689, "mean_token_accuracy": 0.1597699150443077, "num_tokens": 25255155.0, "step": 12910 }, { "entropy": 6.093892669677734, "epoch": 1.2909981506472734, "grad_norm": 1.203125, "learning_rate": 0.00048411973280234553, "loss": 5.8688, "mean_token_accuracy": 0.15933849513530732, "num_tokens": 25265207.0, "step": 12915 }, { "entropy": 6.13886079788208, "epoch": 1.291497975708502, "grad_norm": 1.390625, "learning_rate": 0.00048410656014170135, "loss": 5.8283, "mean_token_accuracy": 0.16692849695682527, "num_tokens": 25273995.0, "step": 12920 }, { "entropy": 6.0460280418396, "epoch": 1.2919978007697306, "grad_norm": 2.28125, "learning_rate": 0.00048409338221999, "loss": 5.813, "mean_token_accuracy": 0.1601512536406517, "num_tokens": 25284334.0, "step": 12925 }, { "entropy": 6.040530395507813, "epoch": 1.292497625830959, "grad_norm": 1.1953125, "learning_rate": 0.00048408019903754297, "loss": 5.8527, "mean_token_accuracy": 0.1636658266186714, "num_tokens": 25294360.0, "step": 12930 }, { "entropy": 6.108194208145141, "epoch": 1.2929974508921878, "grad_norm": 1.328125, "learning_rate": 0.000484067010594692, "loss": 5.8877, "mean_token_accuracy": 0.16477513164281846, "num_tokens": 25302869.0, "step": 12935 }, { "entropy": 6.073296117782593, "epoch": 1.2934972759534162, "grad_norm": 3.390625, "learning_rate": 0.00048405381689176877, "loss": 5.8498, "mean_token_accuracy": 0.16637372151017188, "num_tokens": 25313825.0, "step": 12940 }, { "entropy": 6.115132999420166, "epoch": 1.293997101014645, "grad_norm": 1.375, "learning_rate": 0.00048404061792910527, "loss": 5.9137, "mean_token_accuracy": 0.15858078002929688, "num_tokens": 25323212.0, "step": 12945 }, { "entropy": 6.204974508285522, "epoch": 1.2944969260758734, "grad_norm": 1.2421875, "learning_rate": 0.00048402741370703363, "loss": 5.9992, "mean_token_accuracy": 0.15611710101366044, "num_tokens": 25333037.0, "step": 12950 }, { "entropy": 6.165543413162231, "epoch": 1.294996751137102, "grad_norm": 1.25, "learning_rate": 0.0004840142042258861, "loss": 5.9156, "mean_token_accuracy": 0.1604437455534935, "num_tokens": 25342810.0, "step": 12955 }, { "entropy": 6.158083486557007, "epoch": 1.2954965761983306, "grad_norm": 1.078125, "learning_rate": 0.000484000989485995, "loss": 5.9863, "mean_token_accuracy": 0.15187346041202546, "num_tokens": 25353119.0, "step": 12960 }, { "entropy": 6.149922847747803, "epoch": 1.295996401259559, "grad_norm": 1.2265625, "learning_rate": 0.00048398776948769265, "loss": 5.8807, "mean_token_accuracy": 0.16456405818462372, "num_tokens": 25363450.0, "step": 12965 }, { "entropy": 6.064756059646607, "epoch": 1.2964962263207878, "grad_norm": 1.421875, "learning_rate": 0.0004839745442313119, "loss": 5.836, "mean_token_accuracy": 0.16085902005434036, "num_tokens": 25372830.0, "step": 12970 }, { "entropy": 6.139484786987305, "epoch": 1.2969960513820162, "grad_norm": 1.46875, "learning_rate": 0.00048396131371718535, "loss": 5.9098, "mean_token_accuracy": 0.15242418497800828, "num_tokens": 25382102.0, "step": 12975 }, { "entropy": 6.1773934841156, "epoch": 1.297495876443245, "grad_norm": 1.3515625, "learning_rate": 0.00048394807794564586, "loss": 5.9621, "mean_token_accuracy": 0.15555364340543748, "num_tokens": 25390817.0, "step": 12980 }, { "entropy": 6.145787382125855, "epoch": 1.2979957015044734, "grad_norm": 1.3125, "learning_rate": 0.0004839348369170266, "loss": 5.9251, "mean_token_accuracy": 0.1562415450811386, "num_tokens": 25399958.0, "step": 12985 }, { "entropy": 6.147863912582397, "epoch": 1.298495526565702, "grad_norm": 1.328125, "learning_rate": 0.00048392159063166055, "loss": 5.9144, "mean_token_accuracy": 0.156745782494545, "num_tokens": 25410870.0, "step": 12990 }, { "entropy": 6.208051347732544, "epoch": 1.2989953516269306, "grad_norm": 1.28125, "learning_rate": 0.0004839083390898811, "loss": 5.9616, "mean_token_accuracy": 0.15137394964694978, "num_tokens": 25420906.0, "step": 12995 }, { "entropy": 6.1741392612457275, "epoch": 1.299495176688159, "grad_norm": 1.1953125, "learning_rate": 0.0004838950822920215, "loss": 5.8808, "mean_token_accuracy": 0.15629660785198213, "num_tokens": 25430046.0, "step": 13000 }, { "entropy": 6.042098808288574, "epoch": 1.2999950017493878, "grad_norm": 1.2421875, "learning_rate": 0.0004838818202384155, "loss": 5.8352, "mean_token_accuracy": 0.1678431436419487, "num_tokens": 25438785.0, "step": 13005 }, { "entropy": 6.103204965591431, "epoch": 1.3004948268106162, "grad_norm": 1.2578125, "learning_rate": 0.00048386855292939664, "loss": 5.9232, "mean_token_accuracy": 0.1591215431690216, "num_tokens": 25448815.0, "step": 13010 }, { "entropy": 6.16128945350647, "epoch": 1.300994651871845, "grad_norm": 1.125, "learning_rate": 0.0004838552803652986, "loss": 5.8716, "mean_token_accuracy": 0.15830889195203782, "num_tokens": 25458528.0, "step": 13015 }, { "entropy": 6.137110948562622, "epoch": 1.3014944769330734, "grad_norm": 1.3046875, "learning_rate": 0.00048384200254645557, "loss": 5.8004, "mean_token_accuracy": 0.16168108433485032, "num_tokens": 25467678.0, "step": 13020 }, { "entropy": 6.017528963088989, "epoch": 1.301994301994302, "grad_norm": 1.3046875, "learning_rate": 0.00048382871947320145, "loss": 5.7896, "mean_token_accuracy": 0.17351060658693312, "num_tokens": 25478601.0, "step": 13025 }, { "entropy": 6.0995360851287845, "epoch": 1.3024941270555306, "grad_norm": 1.2421875, "learning_rate": 0.0004838154311458705, "loss": 5.8752, "mean_token_accuracy": 0.15749110281467438, "num_tokens": 25489439.0, "step": 13030 }, { "entropy": 6.068431997299195, "epoch": 1.302993952116759, "grad_norm": 1.2265625, "learning_rate": 0.00048380213756479704, "loss": 5.8835, "mean_token_accuracy": 0.16281150579452514, "num_tokens": 25499976.0, "step": 13035 }, { "entropy": 6.164010763168335, "epoch": 1.3034937771779878, "grad_norm": 1.5, "learning_rate": 0.00048378883873031553, "loss": 6.0211, "mean_token_accuracy": 0.15788150876760482, "num_tokens": 25509737.0, "step": 13040 }, { "entropy": 6.211325693130493, "epoch": 1.3039936022392162, "grad_norm": 1.2890625, "learning_rate": 0.0004837755346427605, "loss": 5.9352, "mean_token_accuracy": 0.15355114936828612, "num_tokens": 25519130.0, "step": 13045 }, { "entropy": 6.178356313705445, "epoch": 1.3044934273004447, "grad_norm": 1.2734375, "learning_rate": 0.00048376222530246684, "loss": 5.9339, "mean_token_accuracy": 0.15717733800411224, "num_tokens": 25528625.0, "step": 13050 }, { "entropy": 6.137736892700195, "epoch": 1.3049932523616734, "grad_norm": 1.2421875, "learning_rate": 0.00048374891070976925, "loss": 5.9609, "mean_token_accuracy": 0.1493631862103939, "num_tokens": 25537912.0, "step": 13055 }, { "entropy": 6.1544262886047365, "epoch": 1.305493077422902, "grad_norm": 1.359375, "learning_rate": 0.0004837355908650028, "loss": 5.9404, "mean_token_accuracy": 0.15519590377807618, "num_tokens": 25548622.0, "step": 13060 }, { "entropy": 6.00636248588562, "epoch": 1.3059929024841306, "grad_norm": 1.2265625, "learning_rate": 0.0004837222657685026, "loss": 5.7061, "mean_token_accuracy": 0.17257911413908006, "num_tokens": 25558322.0, "step": 13065 }, { "entropy": 6.144831800460816, "epoch": 1.306492727545359, "grad_norm": 1.2109375, "learning_rate": 0.00048370893542060383, "loss": 5.9349, "mean_token_accuracy": 0.15338888317346572, "num_tokens": 25568586.0, "step": 13070 }, { "entropy": 6.2042272090911865, "epoch": 1.3069925526065878, "grad_norm": 1.2890625, "learning_rate": 0.0004836955998216421, "loss": 5.9268, "mean_token_accuracy": 0.15211068466305733, "num_tokens": 25577405.0, "step": 13075 }, { "entropy": 6.11801323890686, "epoch": 1.3074923776678162, "grad_norm": 1.46875, "learning_rate": 0.00048368225897195264, "loss": 5.7577, "mean_token_accuracy": 0.16974805295467377, "num_tokens": 25587719.0, "step": 13080 }, { "entropy": 6.094621801376343, "epoch": 1.3079922027290447, "grad_norm": 1.15625, "learning_rate": 0.00048366891287187133, "loss": 5.9015, "mean_token_accuracy": 0.16151498407125472, "num_tokens": 25597334.0, "step": 13085 }, { "entropy": 6.273237609863282, "epoch": 1.3084920277902734, "grad_norm": 1.3515625, "learning_rate": 0.0004836555615217337, "loss": 6.063, "mean_token_accuracy": 0.1484041228890419, "num_tokens": 25606684.0, "step": 13090 }, { "entropy": 6.100587940216064, "epoch": 1.308991852851502, "grad_norm": 1.2734375, "learning_rate": 0.0004836422049218761, "loss": 5.7917, "mean_token_accuracy": 0.173512265086174, "num_tokens": 25615808.0, "step": 13095 }, { "entropy": 6.010607576370239, "epoch": 1.3094916779127306, "grad_norm": 1.265625, "learning_rate": 0.00048362884307263416, "loss": 5.8064, "mean_token_accuracy": 0.16788436025381087, "num_tokens": 25626444.0, "step": 13100 }, { "entropy": 6.135896348953247, "epoch": 1.309991502973959, "grad_norm": 1.3359375, "learning_rate": 0.00048361547597434426, "loss": 5.863, "mean_token_accuracy": 0.15651350393891333, "num_tokens": 25635730.0, "step": 13105 }, { "entropy": 6.183680772781372, "epoch": 1.3104913280351878, "grad_norm": 1.1953125, "learning_rate": 0.00048360210362734257, "loss": 5.8935, "mean_token_accuracy": 0.1595741964876652, "num_tokens": 25645938.0, "step": 13110 }, { "entropy": 6.127643585205078, "epoch": 1.3109911530964162, "grad_norm": 1.171875, "learning_rate": 0.0004835887260319657, "loss": 5.9768, "mean_token_accuracy": 0.15532899796962737, "num_tokens": 25656135.0, "step": 13115 }, { "entropy": 6.193100643157959, "epoch": 1.3114909781576447, "grad_norm": 1.3359375, "learning_rate": 0.0004835753431885502, "loss": 5.9862, "mean_token_accuracy": 0.1517387479543686, "num_tokens": 25666134.0, "step": 13120 }, { "entropy": 6.205765151977539, "epoch": 1.3119908032188734, "grad_norm": 1.40625, "learning_rate": 0.00048356195509743265, "loss": 6.0211, "mean_token_accuracy": 0.14750407189130782, "num_tokens": 25675716.0, "step": 13125 }, { "entropy": 6.161862325668335, "epoch": 1.312490628280102, "grad_norm": 1.1796875, "learning_rate": 0.00048354856175895, "loss": 5.8508, "mean_token_accuracy": 0.15966537594795227, "num_tokens": 25685814.0, "step": 13130 }, { "entropy": 6.139588689804077, "epoch": 1.3129904533413306, "grad_norm": 1.21875, "learning_rate": 0.0004835351631734392, "loss": 5.8502, "mean_token_accuracy": 0.1668509155511856, "num_tokens": 25694995.0, "step": 13135 }, { "entropy": 6.161866331100464, "epoch": 1.313490278402559, "grad_norm": 1.1953125, "learning_rate": 0.0004835217593412374, "loss": 5.9214, "mean_token_accuracy": 0.15764110907912254, "num_tokens": 25705041.0, "step": 13140 }, { "entropy": 6.22493896484375, "epoch": 1.3139901034637878, "grad_norm": 1.2265625, "learning_rate": 0.0004835083502626818, "loss": 5.9205, "mean_token_accuracy": 0.15436616092920302, "num_tokens": 25715830.0, "step": 13145 }, { "entropy": 6.123371934890747, "epoch": 1.3144899285250162, "grad_norm": 1.5546875, "learning_rate": 0.00048349493593810973, "loss": 5.8976, "mean_token_accuracy": 0.15670751929283142, "num_tokens": 25725357.0, "step": 13150 }, { "entropy": 6.122776222229004, "epoch": 1.3149897535862447, "grad_norm": 1.203125, "learning_rate": 0.0004834815163678587, "loss": 5.9302, "mean_token_accuracy": 0.16070552319288253, "num_tokens": 25735720.0, "step": 13155 }, { "entropy": 6.154614114761353, "epoch": 1.3154895786474734, "grad_norm": 1.2734375, "learning_rate": 0.0004834680915522664, "loss": 5.9087, "mean_token_accuracy": 0.15416300743818284, "num_tokens": 25745728.0, "step": 13160 }, { "entropy": 6.177586507797241, "epoch": 1.3159894037087019, "grad_norm": 1.3046875, "learning_rate": 0.0004834546614916705, "loss": 5.8928, "mean_token_accuracy": 0.1595405623316765, "num_tokens": 25755917.0, "step": 13165 }, { "entropy": 6.1583672046661375, "epoch": 1.3164892287699306, "grad_norm": 1.203125, "learning_rate": 0.00048344122618640905, "loss": 5.9844, "mean_token_accuracy": 0.1551694765686989, "num_tokens": 25766195.0, "step": 13170 }, { "entropy": 6.165318727493286, "epoch": 1.316989053831159, "grad_norm": 1.3359375, "learning_rate": 0.0004834277856368199, "loss": 5.8217, "mean_token_accuracy": 0.16466738730669023, "num_tokens": 25774134.0, "step": 13175 }, { "entropy": 6.073446655273438, "epoch": 1.3174888788923877, "grad_norm": 1.3359375, "learning_rate": 0.00048341433984324127, "loss": 5.8802, "mean_token_accuracy": 0.16324811279773713, "num_tokens": 25783377.0, "step": 13180 }, { "entropy": 6.016869354248047, "epoch": 1.3179887039536162, "grad_norm": 1.1640625, "learning_rate": 0.00048340088880601163, "loss": 5.7209, "mean_token_accuracy": 0.16514964103698732, "num_tokens": 25793562.0, "step": 13185 }, { "entropy": 6.117653751373291, "epoch": 1.3184885290148447, "grad_norm": 1.5234375, "learning_rate": 0.0004833874325254691, "loss": 5.9567, "mean_token_accuracy": 0.16125948578119279, "num_tokens": 25803299.0, "step": 13190 }, { "entropy": 6.188000154495239, "epoch": 1.3189883540760734, "grad_norm": 1.390625, "learning_rate": 0.00048337397100195245, "loss": 5.9752, "mean_token_accuracy": 0.15082984566688537, "num_tokens": 25813053.0, "step": 13195 }, { "entropy": 6.19323320388794, "epoch": 1.3194881791373019, "grad_norm": 1.265625, "learning_rate": 0.0004833605042358003, "loss": 5.9666, "mean_token_accuracy": 0.15669853687286378, "num_tokens": 25822311.0, "step": 13200 }, { "entropy": 6.1460075855255125, "epoch": 1.3199880041985306, "grad_norm": 1.2890625, "learning_rate": 0.0004833470322273515, "loss": 5.9845, "mean_token_accuracy": 0.1451917141675949, "num_tokens": 25832473.0, "step": 13205 }, { "entropy": 6.170310354232788, "epoch": 1.320487829259759, "grad_norm": 1.25, "learning_rate": 0.00048333355497694506, "loss": 5.8529, "mean_token_accuracy": 0.16258705407381058, "num_tokens": 25840919.0, "step": 13210 }, { "entropy": 6.120567417144775, "epoch": 1.3209876543209877, "grad_norm": 1.2109375, "learning_rate": 0.0004833200724849199, "loss": 5.8678, "mean_token_accuracy": 0.16181413531303407, "num_tokens": 25850517.0, "step": 13215 }, { "entropy": 6.221341276168824, "epoch": 1.3214874793822162, "grad_norm": 1.53125, "learning_rate": 0.00048330658475161526, "loss": 6.0339, "mean_token_accuracy": 0.14737141653895378, "num_tokens": 25861580.0, "step": 13220 }, { "entropy": 6.172426557540893, "epoch": 1.3219873044434447, "grad_norm": 1.28125, "learning_rate": 0.0004832930917773706, "loss": 5.9548, "mean_token_accuracy": 0.1602742850780487, "num_tokens": 25872383.0, "step": 13225 }, { "entropy": 6.122541618347168, "epoch": 1.3224871295046734, "grad_norm": 1.265625, "learning_rate": 0.00048327959356252544, "loss": 5.9422, "mean_token_accuracy": 0.1594276785850525, "num_tokens": 25883016.0, "step": 13230 }, { "entropy": 6.149798822402954, "epoch": 1.3229869545659019, "grad_norm": 1.3515625, "learning_rate": 0.0004832660901074192, "loss": 5.9223, "mean_token_accuracy": 0.15740931481122972, "num_tokens": 25892810.0, "step": 13235 }, { "entropy": 6.1663611888885494, "epoch": 1.3234867796271306, "grad_norm": 1.2578125, "learning_rate": 0.00048325258141239174, "loss": 5.9102, "mean_token_accuracy": 0.1587192162871361, "num_tokens": 25902548.0, "step": 13240 }, { "entropy": 6.130265474319458, "epoch": 1.323986604688359, "grad_norm": 1.3125, "learning_rate": 0.0004832390674777829, "loss": 5.8827, "mean_token_accuracy": 0.1631936974823475, "num_tokens": 25911572.0, "step": 13245 }, { "entropy": 6.061541223526001, "epoch": 1.3244864297495877, "grad_norm": 1.3515625, "learning_rate": 0.00048322554830393274, "loss": 5.7852, "mean_token_accuracy": 0.16264218240976333, "num_tokens": 25921226.0, "step": 13250 }, { "entropy": 6.1363156795501705, "epoch": 1.3249862548108162, "grad_norm": 1.4453125, "learning_rate": 0.0004832120238911813, "loss": 5.8991, "mean_token_accuracy": 0.15605154782533645, "num_tokens": 25930920.0, "step": 13255 }, { "entropy": 6.175198698043824, "epoch": 1.3254860798720447, "grad_norm": 1.125, "learning_rate": 0.000483198494239869, "loss": 5.843, "mean_token_accuracy": 0.1654557093977928, "num_tokens": 25941042.0, "step": 13260 }, { "entropy": 6.206301498413086, "epoch": 1.3259859049332734, "grad_norm": 1.375, "learning_rate": 0.00048318495935033615, "loss": 6.0046, "mean_token_accuracy": 0.14853819608688354, "num_tokens": 25950696.0, "step": 13265 }, { "entropy": 6.160824394226074, "epoch": 1.3264857299945019, "grad_norm": 1.3671875, "learning_rate": 0.00048317141922292326, "loss": 5.8926, "mean_token_accuracy": 0.16059210747480393, "num_tokens": 25960034.0, "step": 13270 }, { "entropy": 6.13079719543457, "epoch": 1.3269855550557306, "grad_norm": 1.4140625, "learning_rate": 0.0004831578738579711, "loss": 5.9003, "mean_token_accuracy": 0.1688828647136688, "num_tokens": 25969264.0, "step": 13275 }, { "entropy": 6.177458381652832, "epoch": 1.327485380116959, "grad_norm": 1.53125, "learning_rate": 0.0004831443232558203, "loss": 6.018, "mean_token_accuracy": 0.15124542117118836, "num_tokens": 25979046.0, "step": 13280 }, { "entropy": 6.111147260665893, "epoch": 1.3279852051781877, "grad_norm": 1.15625, "learning_rate": 0.00048313076741681186, "loss": 5.8821, "mean_token_accuracy": 0.1578248620033264, "num_tokens": 25988797.0, "step": 13285 }, { "entropy": 6.1148851871490475, "epoch": 1.3284850302394162, "grad_norm": 1.484375, "learning_rate": 0.00048311720634128697, "loss": 5.7741, "mean_token_accuracy": 0.1661039859056473, "num_tokens": 25997586.0, "step": 13290 }, { "entropy": 6.1335609436035154, "epoch": 1.3289848553006447, "grad_norm": 1.3046875, "learning_rate": 0.0004831036400295867, "loss": 5.9629, "mean_token_accuracy": 0.150631383061409, "num_tokens": 26007369.0, "step": 13295 }, { "entropy": 6.121255350112915, "epoch": 1.3294846803618734, "grad_norm": 1.25, "learning_rate": 0.00048309006848205237, "loss": 5.8906, "mean_token_accuracy": 0.16120503693819047, "num_tokens": 26017063.0, "step": 13300 }, { "entropy": 6.146492958068848, "epoch": 1.3299845054231019, "grad_norm": 1.3828125, "learning_rate": 0.0004830764916990255, "loss": 5.8487, "mean_token_accuracy": 0.16345795392990112, "num_tokens": 26026555.0, "step": 13305 }, { "entropy": 6.218799638748169, "epoch": 1.3304843304843303, "grad_norm": 1.28125, "learning_rate": 0.0004830629096808476, "loss": 5.9354, "mean_token_accuracy": 0.1593967080116272, "num_tokens": 26036698.0, "step": 13310 }, { "entropy": 6.13630781173706, "epoch": 1.330984155545559, "grad_norm": 1.375, "learning_rate": 0.0004830493224278605, "loss": 5.8822, "mean_token_accuracy": 0.15833362936973572, "num_tokens": 26046462.0, "step": 13315 }, { "entropy": 6.08898286819458, "epoch": 1.3314839806067877, "grad_norm": 1.453125, "learning_rate": 0.0004830357299404059, "loss": 5.902, "mean_token_accuracy": 0.16499090641736985, "num_tokens": 26056180.0, "step": 13320 }, { "entropy": 6.157568025588989, "epoch": 1.3319838056680162, "grad_norm": 1.25, "learning_rate": 0.0004830221322188259, "loss": 5.9192, "mean_token_accuracy": 0.1544218897819519, "num_tokens": 26065621.0, "step": 13325 }, { "entropy": 6.1957679271698, "epoch": 1.3324836307292447, "grad_norm": 1.296875, "learning_rate": 0.0004830085292634626, "loss": 5.921, "mean_token_accuracy": 0.15938180685043335, "num_tokens": 26074640.0, "step": 13330 }, { "entropy": 6.123087739944458, "epoch": 1.3329834557904734, "grad_norm": 1.2734375, "learning_rate": 0.00048299492107465816, "loss": 5.8815, "mean_token_accuracy": 0.15639126747846605, "num_tokens": 26084221.0, "step": 13335 }, { "entropy": 6.138051128387451, "epoch": 1.3334832808517019, "grad_norm": 1.3515625, "learning_rate": 0.0004829813076527551, "loss": 5.9231, "mean_token_accuracy": 0.16323902383446692, "num_tokens": 26095065.0, "step": 13340 }, { "entropy": 6.140139770507813, "epoch": 1.3339831059129303, "grad_norm": 1.2578125, "learning_rate": 0.00048296768899809577, "loss": 5.833, "mean_token_accuracy": 0.17097852975130082, "num_tokens": 26104978.0, "step": 13345 }, { "entropy": 6.043597555160522, "epoch": 1.334482930974159, "grad_norm": 1.28125, "learning_rate": 0.00048295406511102303, "loss": 5.8248, "mean_token_accuracy": 0.16585729271173477, "num_tokens": 26115023.0, "step": 13350 }, { "entropy": 6.142004013061523, "epoch": 1.3349827560353877, "grad_norm": 1.4296875, "learning_rate": 0.0004829404359918795, "loss": 5.9434, "mean_token_accuracy": 0.1579558677971363, "num_tokens": 26124533.0, "step": 13355 }, { "entropy": 6.186449956893921, "epoch": 1.3354825810966162, "grad_norm": 1.5859375, "learning_rate": 0.000482926801641008, "loss": 5.8489, "mean_token_accuracy": 0.16535816490650176, "num_tokens": 26134466.0, "step": 13360 }, { "entropy": 6.1876969814300535, "epoch": 1.3359824061578447, "grad_norm": 1.2890625, "learning_rate": 0.00048291316205875174, "loss": 5.9446, "mean_token_accuracy": 0.16021082252264024, "num_tokens": 26145710.0, "step": 13365 }, { "entropy": 6.114179897308349, "epoch": 1.3364822312190734, "grad_norm": 1.25, "learning_rate": 0.00048289951724545384, "loss": 5.8578, "mean_token_accuracy": 0.16406906694173812, "num_tokens": 26154393.0, "step": 13370 }, { "entropy": 6.012562322616577, "epoch": 1.3369820562803019, "grad_norm": 1.1875, "learning_rate": 0.00048288586720145757, "loss": 5.7725, "mean_token_accuracy": 0.17339322566986085, "num_tokens": 26164230.0, "step": 13375 }, { "entropy": 6.1056078433990475, "epoch": 1.3374818813415303, "grad_norm": 1.28125, "learning_rate": 0.0004828722119271064, "loss": 5.8889, "mean_token_accuracy": 0.15901896953582764, "num_tokens": 26174224.0, "step": 13380 }, { "entropy": 6.1055690288543705, "epoch": 1.337981706402759, "grad_norm": 1.2421875, "learning_rate": 0.00048285855142274375, "loss": 5.8669, "mean_token_accuracy": 0.16952089965343475, "num_tokens": 26183447.0, "step": 13385 }, { "entropy": 6.197963666915894, "epoch": 1.3384815314639877, "grad_norm": 1.2890625, "learning_rate": 0.0004828448856887135, "loss": 5.984, "mean_token_accuracy": 0.15778826624155046, "num_tokens": 26193479.0, "step": 13390 }, { "entropy": 6.184249401092529, "epoch": 1.3389813565252162, "grad_norm": 1.2734375, "learning_rate": 0.0004828312147253595, "loss": 5.9366, "mean_token_accuracy": 0.15459681898355485, "num_tokens": 26202493.0, "step": 13395 }, { "entropy": 6.151545810699463, "epoch": 1.3394811815864447, "grad_norm": 1.3046875, "learning_rate": 0.0004828175385330255, "loss": 5.9501, "mean_token_accuracy": 0.1563641160726547, "num_tokens": 26212133.0, "step": 13400 }, { "entropy": 6.089784860610962, "epoch": 1.3399810066476734, "grad_norm": 1.203125, "learning_rate": 0.0004828038571120558, "loss": 5.908, "mean_token_accuracy": 0.16656311452388764, "num_tokens": 26222905.0, "step": 13405 }, { "entropy": 6.181836986541748, "epoch": 1.3404808317089019, "grad_norm": 1.25, "learning_rate": 0.00048279017046279446, "loss": 5.9437, "mean_token_accuracy": 0.15331728756427765, "num_tokens": 26234273.0, "step": 13410 }, { "entropy": 6.1181422710418705, "epoch": 1.3409806567701303, "grad_norm": 1.3203125, "learning_rate": 0.00048277647858558596, "loss": 5.8464, "mean_token_accuracy": 0.16213321983814238, "num_tokens": 26243965.0, "step": 13415 }, { "entropy": 6.042984962463379, "epoch": 1.341480481831359, "grad_norm": 1.390625, "learning_rate": 0.00048276278148077465, "loss": 5.8979, "mean_token_accuracy": 0.16166059225797652, "num_tokens": 26253401.0, "step": 13420 }, { "entropy": 6.006541061401367, "epoch": 1.3419803068925875, "grad_norm": 1.3515625, "learning_rate": 0.00048274907914870526, "loss": 5.8344, "mean_token_accuracy": 0.16181168258190154, "num_tokens": 26262481.0, "step": 13425 }, { "entropy": 6.20740008354187, "epoch": 1.3424801319538162, "grad_norm": 1.2734375, "learning_rate": 0.00048273537158972246, "loss": 5.9998, "mean_token_accuracy": 0.15424103438854217, "num_tokens": 26271153.0, "step": 13430 }, { "entropy": 6.218473768234253, "epoch": 1.3429799570150447, "grad_norm": 1.4375, "learning_rate": 0.00048272165880417124, "loss": 6.051, "mean_token_accuracy": 0.14814718887209893, "num_tokens": 26281047.0, "step": 13435 }, { "entropy": 6.148539924621582, "epoch": 1.3434797820762734, "grad_norm": 1.3046875, "learning_rate": 0.00048270794079239643, "loss": 5.9644, "mean_token_accuracy": 0.1517001546919346, "num_tokens": 26291029.0, "step": 13440 }, { "entropy": 6.12006721496582, "epoch": 1.3439796071375019, "grad_norm": 1.3359375, "learning_rate": 0.00048269421755474336, "loss": 5.898, "mean_token_accuracy": 0.15874358937144278, "num_tokens": 26300637.0, "step": 13445 }, { "entropy": 6.1137724876403805, "epoch": 1.3444794321987303, "grad_norm": 1.3203125, "learning_rate": 0.0004826804890915572, "loss": 5.9562, "mean_token_accuracy": 0.1522716410458088, "num_tokens": 26309867.0, "step": 13450 }, { "entropy": 6.126278400421143, "epoch": 1.344979257259959, "grad_norm": 1.328125, "learning_rate": 0.0004826667554031834, "loss": 5.8497, "mean_token_accuracy": 0.16445547044277192, "num_tokens": 26318691.0, "step": 13455 }, { "entropy": 6.222006034851074, "epoch": 1.3454790823211875, "grad_norm": 1.4453125, "learning_rate": 0.0004826530164899674, "loss": 5.9651, "mean_token_accuracy": 0.15411202758550643, "num_tokens": 26327294.0, "step": 13460 }, { "entropy": 6.145077037811279, "epoch": 1.3459789073824162, "grad_norm": 1.3359375, "learning_rate": 0.00048263927235225505, "loss": 5.9377, "mean_token_accuracy": 0.15691346377134324, "num_tokens": 26339965.0, "step": 13465 }, { "entropy": 6.161531686782837, "epoch": 1.3464787324436447, "grad_norm": 1.28125, "learning_rate": 0.0004826255229903919, "loss": 5.8652, "mean_token_accuracy": 0.16356169581413268, "num_tokens": 26350447.0, "step": 13470 }, { "entropy": 6.129216861724854, "epoch": 1.3469785575048734, "grad_norm": 1.3359375, "learning_rate": 0.00048261176840472416, "loss": 5.9228, "mean_token_accuracy": 0.153837464004755, "num_tokens": 26359641.0, "step": 13475 }, { "entropy": 6.126151371002197, "epoch": 1.3474783825661019, "grad_norm": 1.21875, "learning_rate": 0.00048259800859559764, "loss": 6.0393, "mean_token_accuracy": 0.15073853433132173, "num_tokens": 26369161.0, "step": 13480 }, { "entropy": 6.204946708679199, "epoch": 1.3479782076273303, "grad_norm": 1.2890625, "learning_rate": 0.0004825842435633587, "loss": 5.9165, "mean_token_accuracy": 0.16021182984113694, "num_tokens": 26379592.0, "step": 13485 }, { "entropy": 6.14502911567688, "epoch": 1.348478032688559, "grad_norm": 1.234375, "learning_rate": 0.00048257047330835354, "loss": 5.8646, "mean_token_accuracy": 0.15866025686264038, "num_tokens": 26389164.0, "step": 13490 }, { "entropy": 6.120100498199463, "epoch": 1.3489778577497875, "grad_norm": 1.203125, "learning_rate": 0.00048255669783092876, "loss": 5.9396, "mean_token_accuracy": 0.15557236820459366, "num_tokens": 26399574.0, "step": 13495 }, { "entropy": 6.127181482315064, "epoch": 1.3494776828110162, "grad_norm": 1.4609375, "learning_rate": 0.00048254291713143083, "loss": 5.8774, "mean_token_accuracy": 0.16242548823356628, "num_tokens": 26410240.0, "step": 13500 }, { "entropy": 6.13079867362976, "epoch": 1.3499775078722447, "grad_norm": 1.3203125, "learning_rate": 0.0004825291312102066, "loss": 5.817, "mean_token_accuracy": 0.16208799332380294, "num_tokens": 26419763.0, "step": 13505 }, { "entropy": 6.068390893936157, "epoch": 1.3504773329334734, "grad_norm": 1.28125, "learning_rate": 0.0004825153400676027, "loss": 5.9472, "mean_token_accuracy": 0.15317082926630973, "num_tokens": 26429370.0, "step": 13510 }, { "entropy": 6.115858173370361, "epoch": 1.3509771579947019, "grad_norm": 1.421875, "learning_rate": 0.0004825015437039663, "loss": 5.8695, "mean_token_accuracy": 0.16802127212285994, "num_tokens": 26438425.0, "step": 13515 }, { "entropy": 6.176099061965942, "epoch": 1.3514769830559303, "grad_norm": 1.3671875, "learning_rate": 0.0004824877421196444, "loss": 5.9228, "mean_token_accuracy": 0.15681560933589936, "num_tokens": 26448039.0, "step": 13520 }, { "entropy": 6.085469961166382, "epoch": 1.351976808117159, "grad_norm": 1.3125, "learning_rate": 0.0004824739353149844, "loss": 5.8621, "mean_token_accuracy": 0.15977695286273957, "num_tokens": 26457682.0, "step": 13525 }, { "entropy": 6.013343858718872, "epoch": 1.3524766331783875, "grad_norm": 1.2890625, "learning_rate": 0.00048246012329033355, "loss": 5.7869, "mean_token_accuracy": 0.16719080209732057, "num_tokens": 26466292.0, "step": 13530 }, { "entropy": 6.2077422618865965, "epoch": 1.3529764582396162, "grad_norm": 1.5078125, "learning_rate": 0.00048244630604603935, "loss": 6.0495, "mean_token_accuracy": 0.15241734161973, "num_tokens": 26476880.0, "step": 13535 }, { "entropy": 6.21451096534729, "epoch": 1.3534762833008447, "grad_norm": 1.5234375, "learning_rate": 0.00048243248358244945, "loss": 5.9171, "mean_token_accuracy": 0.15523341447114944, "num_tokens": 26486132.0, "step": 13540 }, { "entropy": 6.1377252578735355, "epoch": 1.3539761083620734, "grad_norm": 1.5625, "learning_rate": 0.0004824186558999117, "loss": 5.8306, "mean_token_accuracy": 0.15467707961797714, "num_tokens": 26495647.0, "step": 13545 }, { "entropy": 5.986305570602417, "epoch": 1.3544759334233019, "grad_norm": 1.3515625, "learning_rate": 0.00048240482299877386, "loss": 5.8188, "mean_token_accuracy": 0.16964656263589858, "num_tokens": 26506048.0, "step": 13550 }, { "entropy": 6.1818756580352785, "epoch": 1.3549757584845303, "grad_norm": 1.3359375, "learning_rate": 0.0004823909848793841, "loss": 5.9594, "mean_token_accuracy": 0.16166492104530333, "num_tokens": 26515460.0, "step": 13555 }, { "entropy": 6.2131218910217285, "epoch": 1.355475583545759, "grad_norm": 1.328125, "learning_rate": 0.00048237714154209053, "loss": 5.9196, "mean_token_accuracy": 0.15648221224546432, "num_tokens": 26526106.0, "step": 13560 }, { "entropy": 6.131097030639649, "epoch": 1.3559754086069875, "grad_norm": 1.4765625, "learning_rate": 0.0004823632929872415, "loss": 5.8207, "mean_token_accuracy": 0.1589489161968231, "num_tokens": 26535582.0, "step": 13565 }, { "entropy": 6.098101186752319, "epoch": 1.3564752336682162, "grad_norm": 1.3125, "learning_rate": 0.00048234943921518524, "loss": 5.8195, "mean_token_accuracy": 0.1609871968626976, "num_tokens": 26544811.0, "step": 13570 }, { "entropy": 6.164801979064942, "epoch": 1.3569750587294447, "grad_norm": 1.40625, "learning_rate": 0.0004823355802262705, "loss": 5.9777, "mean_token_accuracy": 0.15619554072618486, "num_tokens": 26555340.0, "step": 13575 }, { "entropy": 6.186211824417114, "epoch": 1.3574748837906734, "grad_norm": 1.25, "learning_rate": 0.0004823217160208459, "loss": 5.873, "mean_token_accuracy": 0.1559571385383606, "num_tokens": 26564876.0, "step": 13580 }, { "entropy": 6.0705554485321045, "epoch": 1.3579747088519019, "grad_norm": 1.4609375, "learning_rate": 0.0004823078465992604, "loss": 5.8572, "mean_token_accuracy": 0.15852668285369872, "num_tokens": 26573967.0, "step": 13585 }, { "entropy": 6.1822394847869875, "epoch": 1.3584745339131303, "grad_norm": 1.3671875, "learning_rate": 0.0004822939719618627, "loss": 5.8806, "mean_token_accuracy": 0.16476380378007888, "num_tokens": 26583753.0, "step": 13590 }, { "entropy": 6.117038154602051, "epoch": 1.358974358974359, "grad_norm": 1.859375, "learning_rate": 0.000482280092109002, "loss": 5.8986, "mean_token_accuracy": 0.16375560015439988, "num_tokens": 26593214.0, "step": 13595 }, { "entropy": 6.095485734939575, "epoch": 1.3594741840355875, "grad_norm": 1.4296875, "learning_rate": 0.00048226620704102757, "loss": 5.9455, "mean_token_accuracy": 0.16200030893087386, "num_tokens": 26603257.0, "step": 13600 }, { "entropy": 6.0923604488372805, "epoch": 1.359974009096816, "grad_norm": 1.3984375, "learning_rate": 0.0004822523167582886, "loss": 5.8467, "mean_token_accuracy": 0.1613400548696518, "num_tokens": 26612483.0, "step": 13605 }, { "entropy": 6.151202249526977, "epoch": 1.3604738341580447, "grad_norm": 1.3203125, "learning_rate": 0.0004822384212611348, "loss": 5.9554, "mean_token_accuracy": 0.1553657755255699, "num_tokens": 26623116.0, "step": 13610 }, { "entropy": 6.163904523849487, "epoch": 1.3609736592192734, "grad_norm": 1.3671875, "learning_rate": 0.00048222452054991563, "loss": 5.8039, "mean_token_accuracy": 0.16505444794893265, "num_tokens": 26632648.0, "step": 13615 }, { "entropy": 6.08295841217041, "epoch": 1.3614734842805019, "grad_norm": 1.546875, "learning_rate": 0.0004822106146249808, "loss": 5.8556, "mean_token_accuracy": 0.16474096477031708, "num_tokens": 26642208.0, "step": 13620 }, { "entropy": 6.147450351715088, "epoch": 1.3619733093417303, "grad_norm": 1.4375, "learning_rate": 0.00048219670348668026, "loss": 5.9276, "mean_token_accuracy": 0.1589716464281082, "num_tokens": 26651967.0, "step": 13625 }, { "entropy": 6.092786264419556, "epoch": 1.362473134402959, "grad_norm": 1.5078125, "learning_rate": 0.00048218278713536394, "loss": 5.7735, "mean_token_accuracy": 0.1690451443195343, "num_tokens": 26661138.0, "step": 13630 }, { "entropy": 6.090594625473022, "epoch": 1.3629729594641875, "grad_norm": 1.421875, "learning_rate": 0.0004821688655713821, "loss": 5.9106, "mean_token_accuracy": 0.1559771254658699, "num_tokens": 26671779.0, "step": 13635 }, { "entropy": 5.960031890869141, "epoch": 1.363472784525416, "grad_norm": 1.3671875, "learning_rate": 0.00048215493879508474, "loss": 5.6095, "mean_token_accuracy": 0.18487453162670137, "num_tokens": 26681030.0, "step": 13640 }, { "entropy": 6.125823640823365, "epoch": 1.3639726095866447, "grad_norm": 1.390625, "learning_rate": 0.0004821410068068226, "loss": 5.9772, "mean_token_accuracy": 0.15146733373403548, "num_tokens": 26691609.0, "step": 13645 }, { "entropy": 6.205774259567261, "epoch": 1.3644724346478734, "grad_norm": 1.296875, "learning_rate": 0.0004821270696069459, "loss": 6.0046, "mean_token_accuracy": 0.14849706292152404, "num_tokens": 26700874.0, "step": 13650 }, { "entropy": 6.098849725723267, "epoch": 1.3649722597091019, "grad_norm": 1.4296875, "learning_rate": 0.00048211312719580553, "loss": 5.8448, "mean_token_accuracy": 0.1648109495639801, "num_tokens": 26711234.0, "step": 13655 }, { "entropy": 6.128755187988281, "epoch": 1.3654720847703303, "grad_norm": 1.3046875, "learning_rate": 0.0004820991795737521, "loss": 5.7828, "mean_token_accuracy": 0.17134784162044525, "num_tokens": 26720348.0, "step": 13660 }, { "entropy": 6.040027809143067, "epoch": 1.365971909831559, "grad_norm": 1.4609375, "learning_rate": 0.00048208522674113665, "loss": 5.8261, "mean_token_accuracy": 0.16448691338300706, "num_tokens": 26730868.0, "step": 13665 }, { "entropy": 6.110388898849488, "epoch": 1.3664717348927875, "grad_norm": 1.6875, "learning_rate": 0.0004820712686983101, "loss": 5.9274, "mean_token_accuracy": 0.15922615081071853, "num_tokens": 26740093.0, "step": 13670 }, { "entropy": 6.13338074684143, "epoch": 1.366971559954016, "grad_norm": 1.4140625, "learning_rate": 0.00048205730544562385, "loss": 5.8972, "mean_token_accuracy": 0.16107486560940742, "num_tokens": 26749550.0, "step": 13675 }, { "entropy": 6.190288639068603, "epoch": 1.3674713850152447, "grad_norm": 1.6640625, "learning_rate": 0.000482043336983429, "loss": 5.9434, "mean_token_accuracy": 0.16200666427612304, "num_tokens": 26759416.0, "step": 13680 }, { "entropy": 6.056473922729492, "epoch": 1.3679712100764732, "grad_norm": 1.5234375, "learning_rate": 0.00048202936331207707, "loss": 5.8552, "mean_token_accuracy": 0.15675311386585236, "num_tokens": 26769782.0, "step": 13685 }, { "entropy": 6.152235078811645, "epoch": 1.3684710351377019, "grad_norm": 1.4296875, "learning_rate": 0.0004820153844319196, "loss": 5.8528, "mean_token_accuracy": 0.16164583414793016, "num_tokens": 26779007.0, "step": 13690 }, { "entropy": 6.057853412628174, "epoch": 1.3689708601989303, "grad_norm": 1.2109375, "learning_rate": 0.00048200140034330844, "loss": 5.8405, "mean_token_accuracy": 0.16202525049448013, "num_tokens": 26787828.0, "step": 13695 }, { "entropy": 6.119669818878174, "epoch": 1.369470685260159, "grad_norm": 1.4765625, "learning_rate": 0.00048198741104659516, "loss": 5.7962, "mean_token_accuracy": 0.16255740225315093, "num_tokens": 26798190.0, "step": 13700 }, { "entropy": 6.097092819213867, "epoch": 1.3699705103213875, "grad_norm": 1.5390625, "learning_rate": 0.000481973416542132, "loss": 5.8578, "mean_token_accuracy": 0.16069574058055877, "num_tokens": 26807312.0, "step": 13705 }, { "entropy": 6.0869701385498045, "epoch": 1.370470335382616, "grad_norm": 1.375, "learning_rate": 0.0004819594168302709, "loss": 5.8539, "mean_token_accuracy": 0.1703674912452698, "num_tokens": 26816477.0, "step": 13710 }, { "entropy": 5.965642833709717, "epoch": 1.3709701604438447, "grad_norm": 1.4609375, "learning_rate": 0.0004819454119113641, "loss": 5.7613, "mean_token_accuracy": 0.1646174281835556, "num_tokens": 26825826.0, "step": 13715 }, { "entropy": 6.087044191360474, "epoch": 1.3714699855050732, "grad_norm": 1.5078125, "learning_rate": 0.000481931401785764, "loss": 5.8514, "mean_token_accuracy": 0.16051580533385276, "num_tokens": 26834809.0, "step": 13720 }, { "entropy": 6.028216552734375, "epoch": 1.3719698105663019, "grad_norm": 1.25, "learning_rate": 0.0004819173864538231, "loss": 5.8068, "mean_token_accuracy": 0.16428762823343276, "num_tokens": 26845322.0, "step": 13725 }, { "entropy": 6.156345558166504, "epoch": 1.3724696356275303, "grad_norm": 1.5234375, "learning_rate": 0.00048190336591589394, "loss": 5.9821, "mean_token_accuracy": 0.14763540029525757, "num_tokens": 26854328.0, "step": 13730 }, { "entropy": 6.182986927032471, "epoch": 1.372969460688759, "grad_norm": 1.359375, "learning_rate": 0.0004818893401723294, "loss": 5.9502, "mean_token_accuracy": 0.15230980068445205, "num_tokens": 26863299.0, "step": 13735 }, { "entropy": 6.066908836364746, "epoch": 1.3734692857499875, "grad_norm": 1.3828125, "learning_rate": 0.00048187530922348226, "loss": 5.8353, "mean_token_accuracy": 0.16558251082897185, "num_tokens": 26873461.0, "step": 13740 }, { "entropy": 6.071912574768066, "epoch": 1.373969110811216, "grad_norm": 1.234375, "learning_rate": 0.0004818612730697056, "loss": 5.8759, "mean_token_accuracy": 0.16145392060279845, "num_tokens": 26883310.0, "step": 13745 }, { "entropy": 6.096778821945191, "epoch": 1.3744689358724447, "grad_norm": 1.4765625, "learning_rate": 0.00048184723171135256, "loss": 5.8548, "mean_token_accuracy": 0.1662290424108505, "num_tokens": 26892009.0, "step": 13750 }, { "entropy": 6.097678089141846, "epoch": 1.3749687609336732, "grad_norm": 1.3046875, "learning_rate": 0.00048183318514877634, "loss": 5.8578, "mean_token_accuracy": 0.1552806481719017, "num_tokens": 26902246.0, "step": 13755 }, { "entropy": 6.165782499313354, "epoch": 1.3754685859949018, "grad_norm": 1.28125, "learning_rate": 0.0004818191333823305, "loss": 5.9292, "mean_token_accuracy": 0.16147550344467163, "num_tokens": 26912912.0, "step": 13760 }, { "entropy": 6.195747137069702, "epoch": 1.3759684110561303, "grad_norm": 1.484375, "learning_rate": 0.0004818050764123684, "loss": 5.8255, "mean_token_accuracy": 0.1638929709792137, "num_tokens": 26921431.0, "step": 13765 }, { "entropy": 6.1088663101196286, "epoch": 1.376468236117359, "grad_norm": 1.4453125, "learning_rate": 0.0004817910142392438, "loss": 5.8687, "mean_token_accuracy": 0.16177405864000322, "num_tokens": 26931990.0, "step": 13770 }, { "entropy": 6.126968431472778, "epoch": 1.3769680611785875, "grad_norm": 1.328125, "learning_rate": 0.00048177694686331047, "loss": 5.9213, "mean_token_accuracy": 0.16035618185997008, "num_tokens": 26942801.0, "step": 13775 }, { "entropy": 6.157605171203613, "epoch": 1.377467886239816, "grad_norm": 1.3515625, "learning_rate": 0.0004817628742849224, "loss": 5.9391, "mean_token_accuracy": 0.15881012231111527, "num_tokens": 26952896.0, "step": 13780 }, { "entropy": 6.166085433959961, "epoch": 1.3779677113010447, "grad_norm": 1.4609375, "learning_rate": 0.00048174879650443364, "loss": 5.976, "mean_token_accuracy": 0.15370875224471092, "num_tokens": 26963170.0, "step": 13785 }, { "entropy": 6.185829544067383, "epoch": 1.3784675363622731, "grad_norm": 1.3125, "learning_rate": 0.00048173471352219835, "loss": 5.9575, "mean_token_accuracy": 0.15716409757733346, "num_tokens": 26972937.0, "step": 13790 }, { "entropy": 6.240061950683594, "epoch": 1.3789673614235018, "grad_norm": 1.390625, "learning_rate": 0.0004817206253385708, "loss": 5.9841, "mean_token_accuracy": 0.15869363397359848, "num_tokens": 26985115.0, "step": 13795 }, { "entropy": 6.163411951065063, "epoch": 1.3794671864847303, "grad_norm": 1.2734375, "learning_rate": 0.00048170653195390555, "loss": 5.9306, "mean_token_accuracy": 0.1638138011097908, "num_tokens": 26993658.0, "step": 13800 }, { "entropy": 6.116409587860107, "epoch": 1.379967011545959, "grad_norm": 1.578125, "learning_rate": 0.0004816924333685572, "loss": 5.9143, "mean_token_accuracy": 0.15303592756390572, "num_tokens": 27003877.0, "step": 13805 }, { "entropy": 6.0737035274505615, "epoch": 1.3804668366071875, "grad_norm": 1.3359375, "learning_rate": 0.0004816783295828804, "loss": 5.7906, "mean_token_accuracy": 0.17063479274511337, "num_tokens": 27012125.0, "step": 13810 }, { "entropy": 6.142703104019165, "epoch": 1.380966661668416, "grad_norm": 1.4453125, "learning_rate": 0.00048166422059722996, "loss": 5.9892, "mean_token_accuracy": 0.1559419110417366, "num_tokens": 27022158.0, "step": 13815 }, { "entropy": 6.110621786117553, "epoch": 1.3814664867296447, "grad_norm": 1.171875, "learning_rate": 0.0004816501064119609, "loss": 5.8921, "mean_token_accuracy": 0.16148971170186996, "num_tokens": 27031966.0, "step": 13820 }, { "entropy": 6.175729990005493, "epoch": 1.3819663117908731, "grad_norm": 1.2890625, "learning_rate": 0.0004816359870274284, "loss": 5.8612, "mean_token_accuracy": 0.16162631064653396, "num_tokens": 27040805.0, "step": 13825 }, { "entropy": 6.131179237365723, "epoch": 1.3824661368521018, "grad_norm": 1.421875, "learning_rate": 0.0004816218624439876, "loss": 5.9535, "mean_token_accuracy": 0.15544168949127196, "num_tokens": 27049210.0, "step": 13830 }, { "entropy": 6.054516124725342, "epoch": 1.3829659619133303, "grad_norm": 1.3125, "learning_rate": 0.00048160773266199384, "loss": 5.7928, "mean_token_accuracy": 0.16536794155836104, "num_tokens": 27058980.0, "step": 13835 }, { "entropy": 6.185720729827881, "epoch": 1.383465786974559, "grad_norm": 1.5078125, "learning_rate": 0.0004815935976818028, "loss": 5.9276, "mean_token_accuracy": 0.16246310174465178, "num_tokens": 27068539.0, "step": 13840 }, { "entropy": 6.14019546508789, "epoch": 1.3839656120357875, "grad_norm": 1.4140625, "learning_rate": 0.00048157945750377005, "loss": 5.8319, "mean_token_accuracy": 0.16166296154260634, "num_tokens": 27077500.0, "step": 13845 }, { "entropy": 6.027490949630737, "epoch": 1.384465437097016, "grad_norm": 1.4296875, "learning_rate": 0.0004815653121282512, "loss": 5.7851, "mean_token_accuracy": 0.16689274460077286, "num_tokens": 27087039.0, "step": 13850 }, { "entropy": 6.0403172969818115, "epoch": 1.3849652621582447, "grad_norm": 1.28125, "learning_rate": 0.00048155116155560227, "loss": 5.8654, "mean_token_accuracy": 0.1638965755701065, "num_tokens": 27096575.0, "step": 13855 }, { "entropy": 6.169073820114136, "epoch": 1.3854650872194731, "grad_norm": 1.625, "learning_rate": 0.00048153700578617924, "loss": 5.9574, "mean_token_accuracy": 0.1572210446000099, "num_tokens": 27106246.0, "step": 13860 }, { "entropy": 6.152325296401978, "epoch": 1.3859649122807016, "grad_norm": 1.2421875, "learning_rate": 0.0004815228448203384, "loss": 5.9308, "mean_token_accuracy": 0.16242442280054092, "num_tokens": 27115529.0, "step": 13865 }, { "entropy": 6.134983539581299, "epoch": 1.3864647373419303, "grad_norm": 1.3046875, "learning_rate": 0.0004815086786584358, "loss": 5.8127, "mean_token_accuracy": 0.164150208234787, "num_tokens": 27125204.0, "step": 13870 }, { "entropy": 6.045771551132202, "epoch": 1.386964562403159, "grad_norm": 1.53125, "learning_rate": 0.000481494507300828, "loss": 5.8696, "mean_token_accuracy": 0.1608981430530548, "num_tokens": 27135053.0, "step": 13875 }, { "entropy": 6.191318941116333, "epoch": 1.3874643874643875, "grad_norm": 1.265625, "learning_rate": 0.0004814803307478716, "loss": 5.9147, "mean_token_accuracy": 0.15449856221675873, "num_tokens": 27144863.0, "step": 13880 }, { "entropy": 6.096641921997071, "epoch": 1.387964212525616, "grad_norm": 1.6796875, "learning_rate": 0.00048146614899992313, "loss": 5.831, "mean_token_accuracy": 0.16545611321926118, "num_tokens": 27154178.0, "step": 13885 }, { "entropy": 6.1149076461792, "epoch": 1.3884640375868447, "grad_norm": 1.3359375, "learning_rate": 0.00048145196205733954, "loss": 5.8078, "mean_token_accuracy": 0.162298721075058, "num_tokens": 27164218.0, "step": 13890 }, { "entropy": 6.118490076065063, "epoch": 1.3889638626480731, "grad_norm": 1.2109375, "learning_rate": 0.00048143776992047767, "loss": 5.8352, "mean_token_accuracy": 0.15735221058130264, "num_tokens": 27174255.0, "step": 13895 }, { "entropy": 6.157198476791382, "epoch": 1.3894636877093016, "grad_norm": 1.2578125, "learning_rate": 0.00048142357258969465, "loss": 5.9438, "mean_token_accuracy": 0.15201016068458556, "num_tokens": 27184989.0, "step": 13900 }, { "entropy": 6.114120054244995, "epoch": 1.3899635127705303, "grad_norm": 1.203125, "learning_rate": 0.0004814093700653477, "loss": 5.8477, "mean_token_accuracy": 0.1661065325140953, "num_tokens": 27196249.0, "step": 13905 }, { "entropy": 6.077417707443237, "epoch": 1.390463337831759, "grad_norm": 1.296875, "learning_rate": 0.00048139516234779403, "loss": 5.7859, "mean_token_accuracy": 0.17097297757864, "num_tokens": 27204997.0, "step": 13910 }, { "entropy": 6.129012250900269, "epoch": 1.3909631628929875, "grad_norm": 1.3984375, "learning_rate": 0.00048138094943739123, "loss": 5.8623, "mean_token_accuracy": 0.16172044426202775, "num_tokens": 27214344.0, "step": 13915 }, { "entropy": 6.155151796340943, "epoch": 1.391462987954216, "grad_norm": 1.2265625, "learning_rate": 0.00048136673133449687, "loss": 5.8783, "mean_token_accuracy": 0.15825018733739854, "num_tokens": 27223950.0, "step": 13920 }, { "entropy": 6.028068590164184, "epoch": 1.3919628130154447, "grad_norm": 1.3359375, "learning_rate": 0.0004813525080394686, "loss": 5.6914, "mean_token_accuracy": 0.16767370253801345, "num_tokens": 27233371.0, "step": 13925 }, { "entropy": 6.125385904312134, "epoch": 1.3924626380766731, "grad_norm": 1.3359375, "learning_rate": 0.0004813382795526644, "loss": 5.9383, "mean_token_accuracy": 0.16219381392002105, "num_tokens": 27243413.0, "step": 13930 }, { "entropy": 6.167134809494018, "epoch": 1.3929624631379016, "grad_norm": 1.2890625, "learning_rate": 0.0004813240458744421, "loss": 5.8513, "mean_token_accuracy": 0.16141010373830794, "num_tokens": 27254117.0, "step": 13935 }, { "entropy": 6.086665201187134, "epoch": 1.3934622881991303, "grad_norm": 1.1953125, "learning_rate": 0.00048130980700516, "loss": 5.9433, "mean_token_accuracy": 0.15809763520956038, "num_tokens": 27263202.0, "step": 13940 }, { "entropy": 6.082571744918823, "epoch": 1.3939621132603588, "grad_norm": 1.359375, "learning_rate": 0.0004812955629451761, "loss": 5.8153, "mean_token_accuracy": 0.16160611659288407, "num_tokens": 27272830.0, "step": 13945 }, { "entropy": 6.1360499382019045, "epoch": 1.3944619383215875, "grad_norm": 1.296875, "learning_rate": 0.0004812813136948491, "loss": 5.8548, "mean_token_accuracy": 0.16546165868639945, "num_tokens": 27283567.0, "step": 13950 }, { "entropy": 6.102085256576538, "epoch": 1.394961763382816, "grad_norm": 1.234375, "learning_rate": 0.00048126705925453716, "loss": 5.7733, "mean_token_accuracy": 0.16804579496383668, "num_tokens": 27292113.0, "step": 13955 }, { "entropy": 5.987590408325195, "epoch": 1.3954615884440447, "grad_norm": 1.3359375, "learning_rate": 0.0004812527996245992, "loss": 5.8333, "mean_token_accuracy": 0.16707413047552108, "num_tokens": 27301605.0, "step": 13960 }, { "entropy": 6.100281238555908, "epoch": 1.3959614135052731, "grad_norm": 1.1953125, "learning_rate": 0.0004812385348053938, "loss": 5.9296, "mean_token_accuracy": 0.1572559043765068, "num_tokens": 27312453.0, "step": 13965 }, { "entropy": 6.1346252918243405, "epoch": 1.3964612385665016, "grad_norm": 1.2578125, "learning_rate": 0.00048122426479728, "loss": 5.9253, "mean_token_accuracy": 0.15773826390504836, "num_tokens": 27322641.0, "step": 13970 }, { "entropy": 6.124874591827393, "epoch": 1.3969610636277303, "grad_norm": 1.3984375, "learning_rate": 0.0004812099896006167, "loss": 5.7268, "mean_token_accuracy": 0.17333748936653137, "num_tokens": 27332283.0, "step": 13975 }, { "entropy": 6.0636121273040775, "epoch": 1.3974608886889588, "grad_norm": 1.234375, "learning_rate": 0.0004811957092157631, "loss": 5.8188, "mean_token_accuracy": 0.16680866628885269, "num_tokens": 27341203.0, "step": 13980 }, { "entropy": 6.058031845092773, "epoch": 1.3979607137501875, "grad_norm": 1.3046875, "learning_rate": 0.00048118142364307864, "loss": 5.9137, "mean_token_accuracy": 0.1649721771478653, "num_tokens": 27351263.0, "step": 13985 }, { "entropy": 6.090591335296631, "epoch": 1.398460538811416, "grad_norm": 1.375, "learning_rate": 0.0004811671328829225, "loss": 5.8341, "mean_token_accuracy": 0.164004909992218, "num_tokens": 27361001.0, "step": 13990 }, { "entropy": 6.139341259002686, "epoch": 1.3989603638726447, "grad_norm": 1.2890625, "learning_rate": 0.00048115283693565445, "loss": 5.8438, "mean_token_accuracy": 0.16129040718078613, "num_tokens": 27370097.0, "step": 13995 }, { "entropy": 6.069870710372925, "epoch": 1.3994601889338731, "grad_norm": 1.4453125, "learning_rate": 0.000481138535801634, "loss": 5.8763, "mean_token_accuracy": 0.16523979902267455, "num_tokens": 27379795.0, "step": 14000 }, { "entropy": 6.0448414325714115, "epoch": 1.3999600139951016, "grad_norm": 1.2578125, "learning_rate": 0.000481124229481221, "loss": 5.8772, "mean_token_accuracy": 0.16665548384189605, "num_tokens": 27389515.0, "step": 14005 }, { "entropy": 6.130039167404175, "epoch": 1.4004598390563303, "grad_norm": 1.328125, "learning_rate": 0.0004811099179747755, "loss": 5.7807, "mean_token_accuracy": 0.18001209795475007, "num_tokens": 27400177.0, "step": 14010 }, { "entropy": 6.171075868606567, "epoch": 1.4009596641175588, "grad_norm": 1.25, "learning_rate": 0.00048109560128265747, "loss": 5.8543, "mean_token_accuracy": 0.15925300270318984, "num_tokens": 27409381.0, "step": 14015 }, { "entropy": 6.114352178573609, "epoch": 1.4014594891787875, "grad_norm": 1.3984375, "learning_rate": 0.0004810812794052271, "loss": 5.9659, "mean_token_accuracy": 0.15845771729946137, "num_tokens": 27419897.0, "step": 14020 }, { "entropy": 6.222824811935425, "epoch": 1.401959314240016, "grad_norm": 1.2109375, "learning_rate": 0.0004810669523428449, "loss": 6.0706, "mean_token_accuracy": 0.14748722389340402, "num_tokens": 27430693.0, "step": 14025 }, { "entropy": 6.264172220230103, "epoch": 1.4024591393012447, "grad_norm": 1.2421875, "learning_rate": 0.000481052620095871, "loss": 6.0102, "mean_token_accuracy": 0.15318381488323213, "num_tokens": 27440834.0, "step": 14030 }, { "entropy": 6.085946130752563, "epoch": 1.4029589643624731, "grad_norm": 1.171875, "learning_rate": 0.0004810382826646664, "loss": 5.7799, "mean_token_accuracy": 0.16960890740156173, "num_tokens": 27450166.0, "step": 14035 }, { "entropy": 6.0345203399658205, "epoch": 1.4034587894237016, "grad_norm": 1.453125, "learning_rate": 0.0004810239400495915, "loss": 5.8715, "mean_token_accuracy": 0.15571456998586655, "num_tokens": 27459863.0, "step": 14040 }, { "entropy": 6.072359609603882, "epoch": 1.4039586144849303, "grad_norm": 1.1796875, "learning_rate": 0.0004810095922510073, "loss": 5.7952, "mean_token_accuracy": 0.1644686669111252, "num_tokens": 27469118.0, "step": 14045 }, { "entropy": 6.148534345626831, "epoch": 1.4044584395461588, "grad_norm": 1.40625, "learning_rate": 0.00048099523926927487, "loss": 5.8729, "mean_token_accuracy": 0.16246576830744744, "num_tokens": 27479550.0, "step": 14050 }, { "entropy": 6.142660236358642, "epoch": 1.4049582646073875, "grad_norm": 1.296875, "learning_rate": 0.0004809808811047552, "loss": 5.9161, "mean_token_accuracy": 0.15946181863546371, "num_tokens": 27489625.0, "step": 14055 }, { "entropy": 6.239021968841553, "epoch": 1.405458089668616, "grad_norm": 1.3359375, "learning_rate": 0.00048096651775780943, "loss": 5.9611, "mean_token_accuracy": 0.1540763221681118, "num_tokens": 27501459.0, "step": 14060 }, { "entropy": 6.137648344039917, "epoch": 1.4059579147298447, "grad_norm": 1.4375, "learning_rate": 0.0004809521492287992, "loss": 5.7912, "mean_token_accuracy": 0.16124285236001015, "num_tokens": 27511450.0, "step": 14065 }, { "entropy": 6.02143030166626, "epoch": 1.4064577397910731, "grad_norm": 1.3984375, "learning_rate": 0.0004809377755180858, "loss": 5.7558, "mean_token_accuracy": 0.1690579757094383, "num_tokens": 27520783.0, "step": 14070 }, { "entropy": 6.167116355895996, "epoch": 1.4069575648523016, "grad_norm": 1.3828125, "learning_rate": 0.0004809233966260311, "loss": 5.883, "mean_token_accuracy": 0.15916331931948663, "num_tokens": 27529433.0, "step": 14075 }, { "entropy": 6.105887413024902, "epoch": 1.4074573899135303, "grad_norm": 1.40625, "learning_rate": 0.0004809090125529966, "loss": 5.8406, "mean_token_accuracy": 0.16154496520757675, "num_tokens": 27539278.0, "step": 14080 }, { "entropy": 6.119472408294678, "epoch": 1.4079572149747588, "grad_norm": 1.3515625, "learning_rate": 0.00048089462329934437, "loss": 5.9151, "mean_token_accuracy": 0.16004838794469833, "num_tokens": 27548474.0, "step": 14085 }, { "entropy": 6.116377115249634, "epoch": 1.4084570400359875, "grad_norm": 1.5234375, "learning_rate": 0.00048088022886543636, "loss": 5.9182, "mean_token_accuracy": 0.16162464618682862, "num_tokens": 27557757.0, "step": 14090 }, { "entropy": 6.134588813781738, "epoch": 1.408956865097216, "grad_norm": 1.3203125, "learning_rate": 0.0004808658292516348, "loss": 5.9702, "mean_token_accuracy": 0.15040709376335143, "num_tokens": 27567971.0, "step": 14095 }, { "entropy": 6.193719673156738, "epoch": 1.4094566901584447, "grad_norm": 1.265625, "learning_rate": 0.00048085142445830197, "loss": 5.9771, "mean_token_accuracy": 0.14814667254686356, "num_tokens": 27578135.0, "step": 14100 }, { "entropy": 6.172084617614746, "epoch": 1.4099565152196731, "grad_norm": 1.1640625, "learning_rate": 0.00048083701448580027, "loss": 5.8458, "mean_token_accuracy": 0.16409674137830735, "num_tokens": 27587459.0, "step": 14105 }, { "entropy": 6.197263956069946, "epoch": 1.4104563402809016, "grad_norm": 1.296875, "learning_rate": 0.00048082259933449224, "loss": 5.9325, "mean_token_accuracy": 0.16178551763296128, "num_tokens": 27596494.0, "step": 14110 }, { "entropy": 6.053715705871582, "epoch": 1.4109561653421303, "grad_norm": 2.359375, "learning_rate": 0.0004808081790047406, "loss": 5.7952, "mean_token_accuracy": 0.17472569346427919, "num_tokens": 27605482.0, "step": 14115 }, { "entropy": 6.076188707351685, "epoch": 1.4114559904033588, "grad_norm": 1.234375, "learning_rate": 0.00048079375349690807, "loss": 5.8251, "mean_token_accuracy": 0.16015429869294168, "num_tokens": 27615386.0, "step": 14120 }, { "entropy": 6.175529336929321, "epoch": 1.4119558154645873, "grad_norm": 1.2890625, "learning_rate": 0.00048077932281135775, "loss": 5.911, "mean_token_accuracy": 0.16377355605363847, "num_tokens": 27624834.0, "step": 14125 }, { "entropy": 6.1573728084564205, "epoch": 1.412455640525816, "grad_norm": 1.390625, "learning_rate": 0.00048076488694845257, "loss": 5.8231, "mean_token_accuracy": 0.1622598186135292, "num_tokens": 27634087.0, "step": 14130 }, { "entropy": 6.130871391296386, "epoch": 1.4129554655870447, "grad_norm": 1.1875, "learning_rate": 0.00048075044590855574, "loss": 5.7668, "mean_token_accuracy": 0.17290389388799668, "num_tokens": 27643739.0, "step": 14135 }, { "entropy": 6.098408794403076, "epoch": 1.4134552906482731, "grad_norm": 1.3125, "learning_rate": 0.00048073599969203064, "loss": 5.9041, "mean_token_accuracy": 0.15937146097421645, "num_tokens": 27652594.0, "step": 14140 }, { "entropy": 6.1507586479187015, "epoch": 1.4139551157095016, "grad_norm": 1.3984375, "learning_rate": 0.0004807215482992408, "loss": 5.9333, "mean_token_accuracy": 0.15585235953330995, "num_tokens": 27662766.0, "step": 14145 }, { "entropy": 6.168141508102417, "epoch": 1.4144549407707303, "grad_norm": 1.265625, "learning_rate": 0.0004807070917305497, "loss": 5.9181, "mean_token_accuracy": 0.15718501806259155, "num_tokens": 27673547.0, "step": 14150 }, { "entropy": 6.178928995132447, "epoch": 1.4149547658319588, "grad_norm": 1.7421875, "learning_rate": 0.00048069262998632115, "loss": 5.8977, "mean_token_accuracy": 0.15978171080350875, "num_tokens": 27683056.0, "step": 14155 }, { "entropy": 6.128573846817017, "epoch": 1.4154545908931873, "grad_norm": 1.28125, "learning_rate": 0.0004806781630669189, "loss": 5.8912, "mean_token_accuracy": 0.16052587777376176, "num_tokens": 27693049.0, "step": 14160 }, { "entropy": 6.171237134933472, "epoch": 1.415954415954416, "grad_norm": 1.5390625, "learning_rate": 0.00048066369097270694, "loss": 5.8603, "mean_token_accuracy": 0.15596067160367966, "num_tokens": 27703712.0, "step": 14165 }, { "entropy": 6.182238960266114, "epoch": 1.4164542410156447, "grad_norm": 1.3515625, "learning_rate": 0.0004806492137040495, "loss": 5.8845, "mean_token_accuracy": 0.15887209475040437, "num_tokens": 27713460.0, "step": 14170 }, { "entropy": 6.197443103790283, "epoch": 1.4169540660768731, "grad_norm": 1.3671875, "learning_rate": 0.00048063473126131086, "loss": 5.9246, "mean_token_accuracy": 0.16057073473930358, "num_tokens": 27722942.0, "step": 14175 }, { "entropy": 6.124551773071289, "epoch": 1.4174538911381016, "grad_norm": 1.2109375, "learning_rate": 0.0004806202436448551, "loss": 5.9002, "mean_token_accuracy": 0.15448820739984512, "num_tokens": 27732738.0, "step": 14180 }, { "entropy": 6.177687072753907, "epoch": 1.4179537161993303, "grad_norm": 1.3203125, "learning_rate": 0.0004806057508550471, "loss": 5.9331, "mean_token_accuracy": 0.15591414794325828, "num_tokens": 27742169.0, "step": 14185 }, { "entropy": 6.170655965805054, "epoch": 1.4184535412605588, "grad_norm": 1.3046875, "learning_rate": 0.0004805912528922512, "loss": 5.889, "mean_token_accuracy": 0.1644885301589966, "num_tokens": 27752539.0, "step": 14190 }, { "entropy": 6.184833097457886, "epoch": 1.4189533663217873, "grad_norm": 1.4375, "learning_rate": 0.0004805767497568323, "loss": 5.9516, "mean_token_accuracy": 0.15195757299661636, "num_tokens": 27763494.0, "step": 14195 }, { "entropy": 6.069012212753296, "epoch": 1.419453191383016, "grad_norm": 1.296875, "learning_rate": 0.00048056224144915534, "loss": 5.77, "mean_token_accuracy": 0.17369400560855866, "num_tokens": 27772884.0, "step": 14200 }, { "entropy": 6.046985912322998, "epoch": 1.4199530164442444, "grad_norm": 1.2578125, "learning_rate": 0.00048054772796958517, "loss": 5.7834, "mean_token_accuracy": 0.17454491853713988, "num_tokens": 27782447.0, "step": 14205 }, { "entropy": 6.1596465587615965, "epoch": 1.4204528415054731, "grad_norm": 1.25, "learning_rate": 0.00048053320931848713, "loss": 5.855, "mean_token_accuracy": 0.16317107528448105, "num_tokens": 27790781.0, "step": 14210 }, { "entropy": 6.140770721435547, "epoch": 1.4209526665667016, "grad_norm": 1.2578125, "learning_rate": 0.00048051868549622644, "loss": 5.7867, "mean_token_accuracy": 0.17033137679100036, "num_tokens": 27799781.0, "step": 14215 }, { "entropy": 6.013639974594116, "epoch": 1.4214524916279303, "grad_norm": 1.3046875, "learning_rate": 0.00048050415650316853, "loss": 5.84, "mean_token_accuracy": 0.15950441211462021, "num_tokens": 27809067.0, "step": 14220 }, { "entropy": 6.1785845279693605, "epoch": 1.4219523166891588, "grad_norm": 1.3359375, "learning_rate": 0.0004804896223396789, "loss": 5.9277, "mean_token_accuracy": 0.1541512832045555, "num_tokens": 27819194.0, "step": 14225 }, { "entropy": 6.195931100845337, "epoch": 1.4224521417503873, "grad_norm": 1.2421875, "learning_rate": 0.0004804750830061232, "loss": 5.8825, "mean_token_accuracy": 0.156583009660244, "num_tokens": 27830179.0, "step": 14230 }, { "entropy": 6.165843296051025, "epoch": 1.422951966811616, "grad_norm": 1.796875, "learning_rate": 0.0004804605385028673, "loss": 5.8679, "mean_token_accuracy": 0.15971438735723495, "num_tokens": 27840476.0, "step": 14235 }, { "entropy": 6.0903496742248535, "epoch": 1.4234517918728444, "grad_norm": 1.578125, "learning_rate": 0.0004804459888302772, "loss": 5.7724, "mean_token_accuracy": 0.16487712115049363, "num_tokens": 27850247.0, "step": 14240 }, { "entropy": 6.083036851882935, "epoch": 1.4239516169340731, "grad_norm": 1.4296875, "learning_rate": 0.00048043143398871874, "loss": 5.9114, "mean_token_accuracy": 0.15706351771950722, "num_tokens": 27860290.0, "step": 14245 }, { "entropy": 6.102430629730224, "epoch": 1.4244514419953016, "grad_norm": 1.34375, "learning_rate": 0.0004804168739785583, "loss": 5.908, "mean_token_accuracy": 0.15358297079801558, "num_tokens": 27870506.0, "step": 14250 }, { "entropy": 6.250571966171265, "epoch": 1.4249512670565303, "grad_norm": 1.3515625, "learning_rate": 0.0004804023088001623, "loss": 5.9583, "mean_token_accuracy": 0.14947654753923417, "num_tokens": 27880679.0, "step": 14255 }, { "entropy": 6.113212585449219, "epoch": 1.4254510921177588, "grad_norm": 1.234375, "learning_rate": 0.0004803877384538969, "loss": 5.8415, "mean_token_accuracy": 0.16503433585166932, "num_tokens": 27891532.0, "step": 14260 }, { "entropy": 5.879591083526611, "epoch": 1.4259509171789873, "grad_norm": 1.5390625, "learning_rate": 0.000480373162940129, "loss": 5.6479, "mean_token_accuracy": 0.18816069066524505, "num_tokens": 27902659.0, "step": 14265 }, { "entropy": 6.115726470947266, "epoch": 1.426450742240216, "grad_norm": 1.2890625, "learning_rate": 0.00048035858225922506, "loss": 5.8454, "mean_token_accuracy": 0.16464049518108367, "num_tokens": 27912422.0, "step": 14270 }, { "entropy": 6.113480281829834, "epoch": 1.4269505673014444, "grad_norm": 1.953125, "learning_rate": 0.00048034399641155206, "loss": 5.8583, "mean_token_accuracy": 0.1586094781756401, "num_tokens": 27922898.0, "step": 14275 }, { "entropy": 6.1192607402801515, "epoch": 1.4274503923626731, "grad_norm": 1.3359375, "learning_rate": 0.00048032940539747697, "loss": 5.878, "mean_token_accuracy": 0.16154274195432664, "num_tokens": 27932915.0, "step": 14280 }, { "entropy": 6.150334358215332, "epoch": 1.4279502174239016, "grad_norm": 1.296875, "learning_rate": 0.00048031480921736686, "loss": 5.8555, "mean_token_accuracy": 0.16029138937592508, "num_tokens": 27942760.0, "step": 14285 }, { "entropy": 6.158548259735108, "epoch": 1.4284500424851303, "grad_norm": 1.203125, "learning_rate": 0.000480300207871589, "loss": 5.9191, "mean_token_accuracy": 0.15693411529064177, "num_tokens": 27952898.0, "step": 14290 }, { "entropy": 6.102324390411377, "epoch": 1.4289498675463588, "grad_norm": 1.28125, "learning_rate": 0.00048028560136051076, "loss": 5.843, "mean_token_accuracy": 0.16362176239490508, "num_tokens": 27962292.0, "step": 14295 }, { "entropy": 6.128807067871094, "epoch": 1.4294496926075873, "grad_norm": 1.359375, "learning_rate": 0.00048027098968449954, "loss": 5.8937, "mean_token_accuracy": 0.15985726863145827, "num_tokens": 27972480.0, "step": 14300 }, { "entropy": 6.193449974060059, "epoch": 1.429949517668816, "grad_norm": 1.5, "learning_rate": 0.0004802563728439231, "loss": 5.9611, "mean_token_accuracy": 0.15251852124929427, "num_tokens": 27982224.0, "step": 14305 }, { "entropy": 6.17263240814209, "epoch": 1.4304493427300444, "grad_norm": 1.421875, "learning_rate": 0.0004802417508391491, "loss": 5.9485, "mean_token_accuracy": 0.16087263971567153, "num_tokens": 27991512.0, "step": 14310 }, { "entropy": 6.111741542816162, "epoch": 1.4309491677912731, "grad_norm": 1.453125, "learning_rate": 0.0004802271236705455, "loss": 5.7502, "mean_token_accuracy": 0.16769987046718599, "num_tokens": 28001392.0, "step": 14315 }, { "entropy": 6.005036163330078, "epoch": 1.4314489928525016, "grad_norm": 1.28125, "learning_rate": 0.00048021249133848025, "loss": 5.7397, "mean_token_accuracy": 0.1675102964043617, "num_tokens": 28009934.0, "step": 14320 }, { "entropy": 6.095283460617066, "epoch": 1.4319488179137303, "grad_norm": 1.3125, "learning_rate": 0.00048019785384332154, "loss": 5.8807, "mean_token_accuracy": 0.160319022834301, "num_tokens": 28019485.0, "step": 14325 }, { "entropy": 6.1149028778076175, "epoch": 1.4324486429749588, "grad_norm": 1.1875, "learning_rate": 0.0004801832111854376, "loss": 5.885, "mean_token_accuracy": 0.15777227729558946, "num_tokens": 28028666.0, "step": 14330 }, { "entropy": 6.1116303443908695, "epoch": 1.4329484680361873, "grad_norm": 1.2578125, "learning_rate": 0.0004801685633651969, "loss": 5.8772, "mean_token_accuracy": 0.15705778151750566, "num_tokens": 28038677.0, "step": 14335 }, { "entropy": 6.186305904388428, "epoch": 1.433448293097416, "grad_norm": 1.3984375, "learning_rate": 0.0004801539103829679, "loss": 5.9708, "mean_token_accuracy": 0.14852447658777237, "num_tokens": 28048580.0, "step": 14340 }, { "entropy": 6.174959421157837, "epoch": 1.4339481181586444, "grad_norm": 1.265625, "learning_rate": 0.0004801392522391193, "loss": 5.8875, "mean_token_accuracy": 0.15756209269165994, "num_tokens": 28058958.0, "step": 14345 }, { "entropy": 6.124604797363281, "epoch": 1.4344479432198731, "grad_norm": 1.4921875, "learning_rate": 0.00048012458893401995, "loss": 5.8682, "mean_token_accuracy": 0.16091903001070024, "num_tokens": 28068861.0, "step": 14350 }, { "entropy": 6.0634050369262695, "epoch": 1.4349477682811016, "grad_norm": 1.2109375, "learning_rate": 0.0004801099204680387, "loss": 5.9067, "mean_token_accuracy": 0.16454484760761262, "num_tokens": 28078638.0, "step": 14355 }, { "entropy": 6.133096504211426, "epoch": 1.4354475933423303, "grad_norm": 1.25, "learning_rate": 0.00048009524684154464, "loss": 5.8495, "mean_token_accuracy": 0.1610197439789772, "num_tokens": 28088549.0, "step": 14360 }, { "entropy": 6.251824569702149, "epoch": 1.4359474184035588, "grad_norm": 1.21875, "learning_rate": 0.0004800805680549069, "loss": 5.9046, "mean_token_accuracy": 0.1600938022136688, "num_tokens": 28097743.0, "step": 14365 }, { "entropy": 6.07877197265625, "epoch": 1.4364472434647872, "grad_norm": 1.2890625, "learning_rate": 0.00048006588410849497, "loss": 5.8207, "mean_token_accuracy": 0.16540497392416, "num_tokens": 28107187.0, "step": 14370 }, { "entropy": 6.06516923904419, "epoch": 1.436947068526016, "grad_norm": 1.171875, "learning_rate": 0.000480051195002678, "loss": 5.8026, "mean_token_accuracy": 0.16269998997449875, "num_tokens": 28117730.0, "step": 14375 }, { "entropy": 6.194702100753784, "epoch": 1.4374468935872444, "grad_norm": 1.2109375, "learning_rate": 0.00048003650073782586, "loss": 5.9159, "mean_token_accuracy": 0.1575499728322029, "num_tokens": 28127803.0, "step": 14380 }, { "entropy": 6.178099060058594, "epoch": 1.437946718648473, "grad_norm": 1.28125, "learning_rate": 0.000480021801314308, "loss": 5.8602, "mean_token_accuracy": 0.16381236612796785, "num_tokens": 28137946.0, "step": 14385 }, { "entropy": 6.114961194992065, "epoch": 1.4384465437097016, "grad_norm": 1.125, "learning_rate": 0.0004800070967324944, "loss": 5.9403, "mean_token_accuracy": 0.15581810474395752, "num_tokens": 28147895.0, "step": 14390 }, { "entropy": 6.044751787185669, "epoch": 1.4389463687709303, "grad_norm": 1.2734375, "learning_rate": 0.00047999238699275506, "loss": 5.846, "mean_token_accuracy": 0.169302798807621, "num_tokens": 28157641.0, "step": 14395 }, { "entropy": 6.111778831481933, "epoch": 1.4394461938321588, "grad_norm": 1.25, "learning_rate": 0.00047997767209546, "loss": 5.8888, "mean_token_accuracy": 0.15626642853021622, "num_tokens": 28167320.0, "step": 14400 }, { "entropy": 6.120743179321289, "epoch": 1.4399460188933872, "grad_norm": 1.2890625, "learning_rate": 0.0004799629520409795, "loss": 5.8367, "mean_token_accuracy": 0.16600980311632157, "num_tokens": 28176697.0, "step": 14405 }, { "entropy": 6.133093070983887, "epoch": 1.440445843954616, "grad_norm": 1.203125, "learning_rate": 0.00047994822682968373, "loss": 5.8924, "mean_token_accuracy": 0.16539354324340821, "num_tokens": 28186688.0, "step": 14410 }, { "entropy": 6.166804838180542, "epoch": 1.4409456690158444, "grad_norm": 1.1484375, "learning_rate": 0.00047993349646194343, "loss": 5.9894, "mean_token_accuracy": 0.15547190383076667, "num_tokens": 28197293.0, "step": 14415 }, { "entropy": 6.255355548858643, "epoch": 1.441445494077073, "grad_norm": 3.390625, "learning_rate": 0.00047991876093812904, "loss": 5.9856, "mean_token_accuracy": 0.15245133489370347, "num_tokens": 28207413.0, "step": 14420 }, { "entropy": 6.163256120681763, "epoch": 1.4419453191383016, "grad_norm": 1.2265625, "learning_rate": 0.00047990402025861143, "loss": 5.8773, "mean_token_accuracy": 0.16162368953227996, "num_tokens": 28217575.0, "step": 14425 }, { "entropy": 6.011227178573608, "epoch": 1.4424451441995303, "grad_norm": 1.2265625, "learning_rate": 0.0004798892744237613, "loss": 5.7261, "mean_token_accuracy": 0.1700431749224663, "num_tokens": 28226460.0, "step": 14430 }, { "entropy": 6.04676079750061, "epoch": 1.4429449692607588, "grad_norm": 1.40625, "learning_rate": 0.00047987452343394976, "loss": 5.8521, "mean_token_accuracy": 0.16183318942785263, "num_tokens": 28236689.0, "step": 14435 }, { "entropy": 6.108124876022339, "epoch": 1.4434447943219872, "grad_norm": 1.34375, "learning_rate": 0.00047985976728954794, "loss": 5.865, "mean_token_accuracy": 0.16307731419801713, "num_tokens": 28247057.0, "step": 14440 }, { "entropy": 6.221473932266235, "epoch": 1.443944619383216, "grad_norm": 1.2890625, "learning_rate": 0.0004798450059909271, "loss": 5.8886, "mean_token_accuracy": 0.15970712304115295, "num_tokens": 28256475.0, "step": 14445 }, { "entropy": 6.117563152313233, "epoch": 1.4444444444444444, "grad_norm": 1.2578125, "learning_rate": 0.0004798302395384586, "loss": 5.8484, "mean_token_accuracy": 0.1598137989640236, "num_tokens": 28266120.0, "step": 14450 }, { "entropy": 6.073667287826538, "epoch": 1.444944269505673, "grad_norm": 1.265625, "learning_rate": 0.00047981546793251405, "loss": 5.8519, "mean_token_accuracy": 0.1594000518321991, "num_tokens": 28276325.0, "step": 14455 }, { "entropy": 6.102376651763916, "epoch": 1.4454440945669016, "grad_norm": 1.2265625, "learning_rate": 0.000479800691173465, "loss": 5.8279, "mean_token_accuracy": 0.16341444477438927, "num_tokens": 28286007.0, "step": 14460 }, { "entropy": 6.107060384750366, "epoch": 1.4459439196281303, "grad_norm": 1.25, "learning_rate": 0.0004797859092616832, "loss": 5.8466, "mean_token_accuracy": 0.15577509999275208, "num_tokens": 28296346.0, "step": 14465 }, { "entropy": 6.014606571197509, "epoch": 1.4464437446893588, "grad_norm": 1.3671875, "learning_rate": 0.00047977112219754064, "loss": 5.7331, "mean_token_accuracy": 0.17575829103589058, "num_tokens": 28306137.0, "step": 14470 }, { "entropy": 6.142667531967163, "epoch": 1.4469435697505872, "grad_norm": 1.71875, "learning_rate": 0.0004797563299814094, "loss": 5.9694, "mean_token_accuracy": 0.1518622189760208, "num_tokens": 28316369.0, "step": 14475 }, { "entropy": 6.1949272632598875, "epoch": 1.447443394811816, "grad_norm": 1.328125, "learning_rate": 0.00047974153261366156, "loss": 5.8505, "mean_token_accuracy": 0.16391684710979462, "num_tokens": 28325338.0, "step": 14480 }, { "entropy": 6.084573125839233, "epoch": 1.4479432198730444, "grad_norm": 1.234375, "learning_rate": 0.0004797267300946694, "loss": 5.8456, "mean_token_accuracy": 0.16104142665863036, "num_tokens": 28334929.0, "step": 14485 }, { "entropy": 6.142187595367432, "epoch": 1.448443044934273, "grad_norm": 1.265625, "learning_rate": 0.00047971192242480544, "loss": 5.901, "mean_token_accuracy": 0.16370442360639573, "num_tokens": 28345157.0, "step": 14490 }, { "entropy": 6.08145055770874, "epoch": 1.4489428699955016, "grad_norm": 1.203125, "learning_rate": 0.0004796971096044422, "loss": 5.7909, "mean_token_accuracy": 0.1635267600417137, "num_tokens": 28354277.0, "step": 14495 }, { "entropy": 6.078655195236206, "epoch": 1.44944269505673, "grad_norm": 1.21875, "learning_rate": 0.0004796822916339523, "loss": 5.8034, "mean_token_accuracy": 0.16733310669660567, "num_tokens": 28364154.0, "step": 14500 }, { "entropy": 6.109423351287842, "epoch": 1.4499425201179588, "grad_norm": 1.2890625, "learning_rate": 0.00047966746851370865, "loss": 5.8813, "mean_token_accuracy": 0.16106073409318925, "num_tokens": 28375260.0, "step": 14505 }, { "entropy": 6.1359468460083, "epoch": 1.4504423451791872, "grad_norm": 1.328125, "learning_rate": 0.0004796526402440841, "loss": 5.8606, "mean_token_accuracy": 0.16572780460119246, "num_tokens": 28384359.0, "step": 14510 }, { "entropy": 6.103290605545044, "epoch": 1.450942170240416, "grad_norm": 1.3046875, "learning_rate": 0.0004796378068254518, "loss": 5.8745, "mean_token_accuracy": 0.16320171803236008, "num_tokens": 28394389.0, "step": 14515 }, { "entropy": 6.097010564804077, "epoch": 1.4514419953016444, "grad_norm": 1.296875, "learning_rate": 0.000479622968258185, "loss": 5.8711, "mean_token_accuracy": 0.15855445116758346, "num_tokens": 28403495.0, "step": 14520 }, { "entropy": 6.161702680587768, "epoch": 1.451941820362873, "grad_norm": 1.2890625, "learning_rate": 0.0004796081245426569, "loss": 5.9139, "mean_token_accuracy": 0.1594494789838791, "num_tokens": 28413132.0, "step": 14525 }, { "entropy": 6.191201543807983, "epoch": 1.4524416454241016, "grad_norm": 1.203125, "learning_rate": 0.00047959327567924115, "loss": 5.8604, "mean_token_accuracy": 0.1627531960606575, "num_tokens": 28423815.0, "step": 14530 }, { "entropy": 6.180623960494995, "epoch": 1.45294147048533, "grad_norm": 1.328125, "learning_rate": 0.00047957842166831103, "loss": 5.8272, "mean_token_accuracy": 0.15769873261451722, "num_tokens": 28433682.0, "step": 14535 }, { "entropy": 6.124186897277832, "epoch": 1.4534412955465588, "grad_norm": 1.3359375, "learning_rate": 0.00047956356251024066, "loss": 5.8287, "mean_token_accuracy": 0.1700795590877533, "num_tokens": 28442388.0, "step": 14540 }, { "entropy": 6.109618377685547, "epoch": 1.4539411206077872, "grad_norm": 1.5234375, "learning_rate": 0.0004795486982054036, "loss": 5.8494, "mean_token_accuracy": 0.16241691410541534, "num_tokens": 28452753.0, "step": 14545 }, { "entropy": 6.140168571472168, "epoch": 1.454440945669016, "grad_norm": 1.7578125, "learning_rate": 0.000479533828754174, "loss": 5.9442, "mean_token_accuracy": 0.1612556718289852, "num_tokens": 28462818.0, "step": 14550 }, { "entropy": 6.139218091964722, "epoch": 1.4549407707302444, "grad_norm": 1.2421875, "learning_rate": 0.0004795189541569258, "loss": 5.8826, "mean_token_accuracy": 0.16183040887117386, "num_tokens": 28472208.0, "step": 14555 }, { "entropy": 6.171624279022216, "epoch": 1.455440595791473, "grad_norm": 1.3125, "learning_rate": 0.00047950407441403343, "loss": 5.8696, "mean_token_accuracy": 0.16190688461065292, "num_tokens": 28480887.0, "step": 14560 }, { "entropy": 6.143547630310058, "epoch": 1.4559404208527016, "grad_norm": 1.296875, "learning_rate": 0.0004794891895258711, "loss": 5.9425, "mean_token_accuracy": 0.15840804129838942, "num_tokens": 28491805.0, "step": 14565 }, { "entropy": 6.12728443145752, "epoch": 1.45644024591393, "grad_norm": 1.3203125, "learning_rate": 0.0004794742994928134, "loss": 5.9062, "mean_token_accuracy": 0.16192419677972794, "num_tokens": 28502913.0, "step": 14570 }, { "entropy": 6.176183223724365, "epoch": 1.4569400709751588, "grad_norm": 1.4609375, "learning_rate": 0.000479459404315235, "loss": 5.8055, "mean_token_accuracy": 0.15854290276765823, "num_tokens": 28513143.0, "step": 14575 }, { "entropy": 6.164974021911621, "epoch": 1.4574398960363872, "grad_norm": 1.2421875, "learning_rate": 0.00047944450399351054, "loss": 5.8889, "mean_token_accuracy": 0.1610184833407402, "num_tokens": 28522211.0, "step": 14580 }, { "entropy": 6.1216721534729, "epoch": 1.457939721097616, "grad_norm": 2.03125, "learning_rate": 0.000479429598528015, "loss": 5.9144, "mean_token_accuracy": 0.15820422247052193, "num_tokens": 28531672.0, "step": 14585 }, { "entropy": 6.105369901657104, "epoch": 1.4584395461588444, "grad_norm": 1.34375, "learning_rate": 0.0004794146879191233, "loss": 5.8392, "mean_token_accuracy": 0.16402121782302856, "num_tokens": 28541614.0, "step": 14590 }, { "entropy": 6.1976540088653564, "epoch": 1.458939371220073, "grad_norm": 1.453125, "learning_rate": 0.0004793997721672107, "loss": 5.937, "mean_token_accuracy": 0.15269664153456688, "num_tokens": 28550353.0, "step": 14595 }, { "entropy": 6.115636348724365, "epoch": 1.4594391962813016, "grad_norm": 1.28125, "learning_rate": 0.00047938485127265243, "loss": 5.8429, "mean_token_accuracy": 0.1628204792737961, "num_tokens": 28559772.0, "step": 14600 }, { "entropy": 6.129355955123901, "epoch": 1.45993902134253, "grad_norm": 1.2109375, "learning_rate": 0.0004793699252358239, "loss": 5.8759, "mean_token_accuracy": 0.15915580987930297, "num_tokens": 28569564.0, "step": 14605 }, { "entropy": 6.0863288879394535, "epoch": 1.4604388464037588, "grad_norm": 1.3671875, "learning_rate": 0.0004793549940571006, "loss": 5.8921, "mean_token_accuracy": 0.15911906957626343, "num_tokens": 28579473.0, "step": 14610 }, { "entropy": 6.149911642074585, "epoch": 1.4609386714649872, "grad_norm": 1.359375, "learning_rate": 0.00047934005773685824, "loss": 5.8721, "mean_token_accuracy": 0.1584754019975662, "num_tokens": 28588407.0, "step": 14615 }, { "entropy": 6.164475393295288, "epoch": 1.461438496526216, "grad_norm": 1.171875, "learning_rate": 0.00047932511627547266, "loss": 5.9879, "mean_token_accuracy": 0.1551612690091133, "num_tokens": 28599931.0, "step": 14620 }, { "entropy": 5.937235975265503, "epoch": 1.4619383215874444, "grad_norm": 1.7421875, "learning_rate": 0.0004793101696733197, "loss": 5.6486, "mean_token_accuracy": 0.1821054771542549, "num_tokens": 28609317.0, "step": 14625 }, { "entropy": 6.0786644458770756, "epoch": 1.4624381466486729, "grad_norm": 1.3046875, "learning_rate": 0.00047929521793077545, "loss": 5.9327, "mean_token_accuracy": 0.1560387820005417, "num_tokens": 28618248.0, "step": 14630 }, { "entropy": 6.163923358917236, "epoch": 1.4629379717099016, "grad_norm": 1.203125, "learning_rate": 0.0004792802610482161, "loss": 5.9294, "mean_token_accuracy": 0.1587363637983799, "num_tokens": 28629046.0, "step": 14635 }, { "entropy": 6.292413330078125, "epoch": 1.46343779677113, "grad_norm": 1.25, "learning_rate": 0.0004792652990260179, "loss": 6.0115, "mean_token_accuracy": 0.14543681144714354, "num_tokens": 28640829.0, "step": 14640 }, { "entropy": 6.201502990722656, "epoch": 1.4639376218323585, "grad_norm": 1.640625, "learning_rate": 0.0004792503318645574, "loss": 5.9258, "mean_token_accuracy": 0.15602559000253677, "num_tokens": 28650812.0, "step": 14645 }, { "entropy": 6.200658321380615, "epoch": 1.4644374468935872, "grad_norm": 1.359375, "learning_rate": 0.00047923535956421104, "loss": 5.9195, "mean_token_accuracy": 0.15982192754745483, "num_tokens": 28661795.0, "step": 14650 }, { "entropy": 6.091787481307984, "epoch": 1.464937271954816, "grad_norm": 1.234375, "learning_rate": 0.00047922038212535565, "loss": 5.7629, "mean_token_accuracy": 0.16758955866098404, "num_tokens": 28670729.0, "step": 14655 }, { "entropy": 6.02588906288147, "epoch": 1.4654370970160444, "grad_norm": 1.359375, "learning_rate": 0.00047920539954836793, "loss": 5.7883, "mean_token_accuracy": 0.16938893347978592, "num_tokens": 28680469.0, "step": 14660 }, { "entropy": 6.076907157897949, "epoch": 1.4659369220772729, "grad_norm": 1.28125, "learning_rate": 0.000479190411833625, "loss": 5.8896, "mean_token_accuracy": 0.15583025217056273, "num_tokens": 28689698.0, "step": 14665 }, { "entropy": 6.178696012496948, "epoch": 1.4664367471385016, "grad_norm": 1.359375, "learning_rate": 0.00047917541898150377, "loss": 5.8302, "mean_token_accuracy": 0.1650609165430069, "num_tokens": 28699861.0, "step": 14670 }, { "entropy": 6.1417553424835205, "epoch": 1.46693657219973, "grad_norm": 1.359375, "learning_rate": 0.00047916042099238154, "loss": 5.8505, "mean_token_accuracy": 0.15783541575074195, "num_tokens": 28709370.0, "step": 14675 }, { "entropy": 6.146949434280396, "epoch": 1.4674363972609585, "grad_norm": 1.390625, "learning_rate": 0.00047914541786663566, "loss": 6.1112, "mean_token_accuracy": 0.1627703696489334, "num_tokens": 28718123.0, "step": 14680 }, { "entropy": 6.2011024951934814, "epoch": 1.4679362223221872, "grad_norm": 1.2265625, "learning_rate": 0.00047913040960464363, "loss": 5.9502, "mean_token_accuracy": 0.15725143104791642, "num_tokens": 28727972.0, "step": 14685 }, { "entropy": 6.142420721054077, "epoch": 1.468436047383416, "grad_norm": 1.3828125, "learning_rate": 0.00047911539620678305, "loss": 5.8579, "mean_token_accuracy": 0.15449655279517174, "num_tokens": 28737988.0, "step": 14690 }, { "entropy": 6.09318356513977, "epoch": 1.4689358724446444, "grad_norm": 1.3515625, "learning_rate": 0.0004791003776734316, "loss": 5.9154, "mean_token_accuracy": 0.16092705279588698, "num_tokens": 28747852.0, "step": 14695 }, { "entropy": 6.039407682418823, "epoch": 1.4694356975058729, "grad_norm": 1.15625, "learning_rate": 0.00047908535400496713, "loss": 5.8102, "mean_token_accuracy": 0.1638214409351349, "num_tokens": 28758652.0, "step": 14700 }, { "entropy": 6.081682538986206, "epoch": 1.4699355225671016, "grad_norm": 1.28125, "learning_rate": 0.00047907032520176765, "loss": 5.7801, "mean_token_accuracy": 0.16654175221920015, "num_tokens": 28767603.0, "step": 14705 }, { "entropy": 6.12945146560669, "epoch": 1.47043534762833, "grad_norm": 1.265625, "learning_rate": 0.0004790552912642113, "loss": 5.8589, "mean_token_accuracy": 0.16593801379203796, "num_tokens": 28777984.0, "step": 14710 }, { "entropy": 6.156704235076904, "epoch": 1.4709351726895585, "grad_norm": 1.3125, "learning_rate": 0.00047904025219267643, "loss": 5.9108, "mean_token_accuracy": 0.15695432722568511, "num_tokens": 28789033.0, "step": 14715 }, { "entropy": 6.065527153015137, "epoch": 1.4714349977507872, "grad_norm": 1.3515625, "learning_rate": 0.00047902520798754125, "loss": 5.7902, "mean_token_accuracy": 0.17116821855306624, "num_tokens": 28797728.0, "step": 14720 }, { "entropy": 6.015084457397461, "epoch": 1.471934822812016, "grad_norm": 1.3984375, "learning_rate": 0.0004790101586491843, "loss": 5.8123, "mean_token_accuracy": 0.15724297985434532, "num_tokens": 28807505.0, "step": 14725 }, { "entropy": 6.157178544998169, "epoch": 1.4724346478732444, "grad_norm": 1.4140625, "learning_rate": 0.0004789951041779843, "loss": 5.921, "mean_token_accuracy": 0.16030739694833757, "num_tokens": 28817289.0, "step": 14730 }, { "entropy": 6.120894813537598, "epoch": 1.4729344729344729, "grad_norm": 1.1953125, "learning_rate": 0.00047898004457432, "loss": 5.8748, "mean_token_accuracy": 0.15950123518705367, "num_tokens": 28827697.0, "step": 14735 }, { "entropy": 6.227978038787842, "epoch": 1.4734342979957016, "grad_norm": 1.296875, "learning_rate": 0.0004789649798385702, "loss": 5.9236, "mean_token_accuracy": 0.1580186054110527, "num_tokens": 28837427.0, "step": 14740 }, { "entropy": 6.114156007766724, "epoch": 1.47393412305693, "grad_norm": 1.328125, "learning_rate": 0.00047894990997111403, "loss": 5.8696, "mean_token_accuracy": 0.15791167616844176, "num_tokens": 28845692.0, "step": 14745 }, { "entropy": 6.051042079925537, "epoch": 1.4744339481181585, "grad_norm": 1.4765625, "learning_rate": 0.00047893483497233057, "loss": 5.7879, "mean_token_accuracy": 0.163599706441164, "num_tokens": 28854854.0, "step": 14750 }, { "entropy": 6.089698839187622, "epoch": 1.4749337731793872, "grad_norm": 1.1640625, "learning_rate": 0.0004789197548425992, "loss": 5.8877, "mean_token_accuracy": 0.15952688157558442, "num_tokens": 28865711.0, "step": 14755 }, { "entropy": 6.0582763195037845, "epoch": 1.4754335982406157, "grad_norm": 1.3046875, "learning_rate": 0.0004789046695822992, "loss": 5.7507, "mean_token_accuracy": 0.17356730848550797, "num_tokens": 28874193.0, "step": 14760 }, { "entropy": 6.034773921966552, "epoch": 1.4759334233018444, "grad_norm": 1.2578125, "learning_rate": 0.00047888957919181026, "loss": 5.8416, "mean_token_accuracy": 0.16772895008325578, "num_tokens": 28883652.0, "step": 14765 }, { "entropy": 6.120548915863037, "epoch": 1.4764332483630729, "grad_norm": 1.40625, "learning_rate": 0.0004788744836715119, "loss": 5.8631, "mean_token_accuracy": 0.1631767362356186, "num_tokens": 28893040.0, "step": 14770 }, { "entropy": 6.154530000686646, "epoch": 1.4769330734243016, "grad_norm": 1.1875, "learning_rate": 0.0004788593830217841, "loss": 5.8263, "mean_token_accuracy": 0.16373732835054397, "num_tokens": 28903330.0, "step": 14775 }, { "entropy": 6.1097158908844, "epoch": 1.47743289848553, "grad_norm": 1.1953125, "learning_rate": 0.00047884427724300657, "loss": 5.8691, "mean_token_accuracy": 0.16185442358255386, "num_tokens": 28913032.0, "step": 14780 }, { "entropy": 6.077975559234619, "epoch": 1.4779327235467585, "grad_norm": 1.3515625, "learning_rate": 0.0004788291663355595, "loss": 5.8568, "mean_token_accuracy": 0.16055911481380464, "num_tokens": 28921298.0, "step": 14785 }, { "entropy": 6.066040134429931, "epoch": 1.4784325486079872, "grad_norm": 1.3359375, "learning_rate": 0.0004788140502998231, "loss": 5.7869, "mean_token_accuracy": 0.16843023896217346, "num_tokens": 28930724.0, "step": 14790 }, { "entropy": 6.197900819778442, "epoch": 1.4789323736692157, "grad_norm": 1.234375, "learning_rate": 0.0004787989291361776, "loss": 5.9734, "mean_token_accuracy": 0.14943530261516572, "num_tokens": 28941670.0, "step": 14795 }, { "entropy": 6.080639886856079, "epoch": 1.4794321987304444, "grad_norm": 1.328125, "learning_rate": 0.0004787838028450035, "loss": 5.7802, "mean_token_accuracy": 0.1693911924958229, "num_tokens": 28950175.0, "step": 14800 }, { "entropy": 6.0849419116973875, "epoch": 1.4799320237916729, "grad_norm": 1.28125, "learning_rate": 0.00047876867142668136, "loss": 5.7577, "mean_token_accuracy": 0.1665428712964058, "num_tokens": 28958410.0, "step": 14805 }, { "entropy": 6.072857189178467, "epoch": 1.4804318488529016, "grad_norm": 1.28125, "learning_rate": 0.0004787535348815918, "loss": 5.702, "mean_token_accuracy": 0.1706013947725296, "num_tokens": 28967911.0, "step": 14810 }, { "entropy": 6.030284833908081, "epoch": 1.48093167391413, "grad_norm": 1.2421875, "learning_rate": 0.00047873839321011587, "loss": 5.8087, "mean_token_accuracy": 0.1703863710165024, "num_tokens": 28978112.0, "step": 14815 }, { "entropy": 6.074821853637696, "epoch": 1.4814314989753585, "grad_norm": 1.28125, "learning_rate": 0.0004787232464126343, "loss": 5.8205, "mean_token_accuracy": 0.16091413646936417, "num_tokens": 28987960.0, "step": 14820 }, { "entropy": 6.067629337310791, "epoch": 1.4819313240365872, "grad_norm": 1.4140625, "learning_rate": 0.0004787080944895283, "loss": 5.8699, "mean_token_accuracy": 0.15592397302389144, "num_tokens": 28997000.0, "step": 14825 }, { "entropy": 6.155301761627197, "epoch": 1.4824311490978157, "grad_norm": 1.3671875, "learning_rate": 0.00047869293744117906, "loss": 5.8667, "mean_token_accuracy": 0.16108942925930023, "num_tokens": 29005725.0, "step": 14830 }, { "entropy": 6.047872829437256, "epoch": 1.4829309741590444, "grad_norm": 1.2578125, "learning_rate": 0.00047867777526796793, "loss": 5.8178, "mean_token_accuracy": 0.16866486817598342, "num_tokens": 29015168.0, "step": 14835 }, { "entropy": 6.126291656494141, "epoch": 1.4834307992202729, "grad_norm": 1.1796875, "learning_rate": 0.0004786626079702764, "loss": 5.934, "mean_token_accuracy": 0.15931625217199324, "num_tokens": 29025170.0, "step": 14840 }, { "entropy": 6.1496683120727536, "epoch": 1.4839306242815016, "grad_norm": 1.328125, "learning_rate": 0.0004786474355484861, "loss": 5.7995, "mean_token_accuracy": 0.16587658524513244, "num_tokens": 29034262.0, "step": 14845 }, { "entropy": 6.1078180313110355, "epoch": 1.48443044934273, "grad_norm": 1.28125, "learning_rate": 0.0004786322580029786, "loss": 5.8885, "mean_token_accuracy": 0.15823860615491867, "num_tokens": 29043847.0, "step": 14850 }, { "entropy": 6.1236096858978275, "epoch": 1.4849302744039585, "grad_norm": 1.3984375, "learning_rate": 0.00047861707533413593, "loss": 5.8695, "mean_token_accuracy": 0.1647449553012848, "num_tokens": 29053378.0, "step": 14855 }, { "entropy": 6.1678955078125, "epoch": 1.4854300994651872, "grad_norm": 1.3515625, "learning_rate": 0.0004786018875423401, "loss": 5.8567, "mean_token_accuracy": 0.16231548935174941, "num_tokens": 29063335.0, "step": 14860 }, { "entropy": 6.075611305236817, "epoch": 1.4859299245264157, "grad_norm": 1.2734375, "learning_rate": 0.00047858669462797317, "loss": 5.8508, "mean_token_accuracy": 0.16726845651865005, "num_tokens": 29073322.0, "step": 14865 }, { "entropy": 6.1054102897644045, "epoch": 1.4864297495876444, "grad_norm": 1.1953125, "learning_rate": 0.00047857149659141736, "loss": 5.8549, "mean_token_accuracy": 0.16108544170856476, "num_tokens": 29082618.0, "step": 14870 }, { "entropy": 6.100301456451416, "epoch": 1.4869295746488729, "grad_norm": 1.21875, "learning_rate": 0.0004785562934330551, "loss": 5.7279, "mean_token_accuracy": 0.1672778844833374, "num_tokens": 29091854.0, "step": 14875 }, { "entropy": 6.0595207691192625, "epoch": 1.4874293997101016, "grad_norm": 1.3203125, "learning_rate": 0.00047854108515326885, "loss": 5.7741, "mean_token_accuracy": 0.16831050366163253, "num_tokens": 29100816.0, "step": 14880 }, { "entropy": 6.1129515171051025, "epoch": 1.48792922477133, "grad_norm": 1.4453125, "learning_rate": 0.0004785258717524412, "loss": 5.8346, "mean_token_accuracy": 0.16706235259771346, "num_tokens": 29110216.0, "step": 14885 }, { "entropy": 6.177827310562134, "epoch": 1.4884290498325585, "grad_norm": 1.2890625, "learning_rate": 0.00047851065323095514, "loss": 5.8812, "mean_token_accuracy": 0.15973010212182998, "num_tokens": 29120910.0, "step": 14890 }, { "entropy": 6.128977346420288, "epoch": 1.4889288748937872, "grad_norm": 1.28125, "learning_rate": 0.0004784954295891933, "loss": 5.9015, "mean_token_accuracy": 0.1597882926464081, "num_tokens": 29131163.0, "step": 14895 }, { "entropy": 6.067168426513672, "epoch": 1.4894286999550157, "grad_norm": 1.3359375, "learning_rate": 0.00047848020082753883, "loss": 5.7867, "mean_token_accuracy": 0.16889406889677047, "num_tokens": 29140549.0, "step": 14900 }, { "entropy": 6.057073497772217, "epoch": 1.4899285250162442, "grad_norm": 1.1953125, "learning_rate": 0.0004784649669463749, "loss": 5.7655, "mean_token_accuracy": 0.16541184931993486, "num_tokens": 29149884.0, "step": 14905 }, { "entropy": 6.090287542343139, "epoch": 1.4904283500774729, "grad_norm": 1.3046875, "learning_rate": 0.00047844972794608474, "loss": 5.921, "mean_token_accuracy": 0.16085264831781387, "num_tokens": 29158913.0, "step": 14910 }, { "entropy": 6.141239929199219, "epoch": 1.4909281751387016, "grad_norm": 1.375, "learning_rate": 0.00047843448382705185, "loss": 5.876, "mean_token_accuracy": 0.1552782490849495, "num_tokens": 29167548.0, "step": 14915 }, { "entropy": 6.1099042892456055, "epoch": 1.49142800019993, "grad_norm": 1.1953125, "learning_rate": 0.00047841923458965966, "loss": 5.8497, "mean_token_accuracy": 0.1688336357474327, "num_tokens": 29177155.0, "step": 14920 }, { "entropy": 6.115854930877686, "epoch": 1.4919278252611585, "grad_norm": 1.2734375, "learning_rate": 0.00047840398023429176, "loss": 5.8877, "mean_token_accuracy": 0.16071407347917557, "num_tokens": 29185920.0, "step": 14925 }, { "entropy": 6.204611968994141, "epoch": 1.4924276503223872, "grad_norm": 1.2734375, "learning_rate": 0.00047838872076133213, "loss": 5.8504, "mean_token_accuracy": 0.16223606914281846, "num_tokens": 29195707.0, "step": 14930 }, { "entropy": 6.169075012207031, "epoch": 1.4929274753836157, "grad_norm": 1.1328125, "learning_rate": 0.0004783734561711647, "loss": 5.9022, "mean_token_accuracy": 0.15263044387102126, "num_tokens": 29206395.0, "step": 14935 }, { "entropy": 6.0841480731964115, "epoch": 1.4934273004448442, "grad_norm": 1.3125, "learning_rate": 0.00047835818646417333, "loss": 5.8928, "mean_token_accuracy": 0.1655309572815895, "num_tokens": 29215903.0, "step": 14940 }, { "entropy": 6.181803750991821, "epoch": 1.4939271255060729, "grad_norm": 1.3828125, "learning_rate": 0.0004783429116407423, "loss": 5.9254, "mean_token_accuracy": 0.15845088362693788, "num_tokens": 29225768.0, "step": 14945 }, { "entropy": 6.159802579879761, "epoch": 1.4944269505673016, "grad_norm": 1.21875, "learning_rate": 0.00047832763170125605, "loss": 5.8786, "mean_token_accuracy": 0.16108133345842363, "num_tokens": 29235612.0, "step": 14950 }, { "entropy": 6.128161811828614, "epoch": 1.49492677562853, "grad_norm": 1.296875, "learning_rate": 0.00047831234664609887, "loss": 5.7647, "mean_token_accuracy": 0.1677384465932846, "num_tokens": 29244556.0, "step": 14955 }, { "entropy": 6.126919174194336, "epoch": 1.4954266006897585, "grad_norm": 1.3125, "learning_rate": 0.00047829705647565535, "loss": 5.9576, "mean_token_accuracy": 0.15524016469717025, "num_tokens": 29254978.0, "step": 14960 }, { "entropy": 6.034291076660156, "epoch": 1.4959264257509872, "grad_norm": 1.3359375, "learning_rate": 0.0004782817611903102, "loss": 5.7415, "mean_token_accuracy": 0.16946225315332414, "num_tokens": 29263339.0, "step": 14965 }, { "entropy": 6.062045955657959, "epoch": 1.4964262508122157, "grad_norm": 1.2109375, "learning_rate": 0.00047826646079044826, "loss": 5.7263, "mean_token_accuracy": 0.16392131000757218, "num_tokens": 29272707.0, "step": 14970 }, { "entropy": 6.097141981124878, "epoch": 1.4969260758734442, "grad_norm": 1.1640625, "learning_rate": 0.00047825115527645447, "loss": 5.8523, "mean_token_accuracy": 0.16153173446655272, "num_tokens": 29282292.0, "step": 14975 }, { "entropy": 6.084741592407227, "epoch": 1.4974259009346729, "grad_norm": 1.2109375, "learning_rate": 0.0004782358446487139, "loss": 5.9338, "mean_token_accuracy": 0.17100015804171562, "num_tokens": 29291289.0, "step": 14980 }, { "entropy": 6.066371965408325, "epoch": 1.4979257259959016, "grad_norm": 1.2734375, "learning_rate": 0.00047822052890761173, "loss": 5.7481, "mean_token_accuracy": 0.17149513810873032, "num_tokens": 29300166.0, "step": 14985 }, { "entropy": 6.044461393356324, "epoch": 1.49842555105713, "grad_norm": 1.3671875, "learning_rate": 0.0004782052080535334, "loss": 5.7504, "mean_token_accuracy": 0.1678796663880348, "num_tokens": 29308422.0, "step": 14990 }, { "entropy": 6.140214157104492, "epoch": 1.4989253761183585, "grad_norm": 1.2890625, "learning_rate": 0.0004781898820868644, "loss": 5.9046, "mean_token_accuracy": 0.16995158940553665, "num_tokens": 29317699.0, "step": 14995 }, { "entropy": 6.178449964523315, "epoch": 1.4994252011795872, "grad_norm": 1.21875, "learning_rate": 0.0004781745510079901, "loss": 5.9047, "mean_token_accuracy": 0.15471889525651933, "num_tokens": 29327711.0, "step": 15000 }, { "epoch": 1.4994252011795872, "eval_entropy": 5.969458627565655, "eval_loss": 5.963263988494873, "eval_mean_token_accuracy": 0.1646997789060181, "eval_num_tokens": 29327711.0, "eval_runtime": 23.8667, "eval_samples_per_second": 1300.765, "eval_steps_per_second": 162.611, "step": 15000 }, { "entropy": 6.077131271362305, "epoch": 1.4999250262408157, "grad_norm": 1.34375, "learning_rate": 0.00047815921481729647, "loss": 5.7928, "mean_token_accuracy": 0.16737655997276307, "num_tokens": 29336540.0, "step": 15005 }, { "entropy": 6.190031099319458, "epoch": 1.5004248513020442, "grad_norm": 1.2734375, "learning_rate": 0.0004781438735151693, "loss": 5.9999, "mean_token_accuracy": 0.15030388236045839, "num_tokens": 29345512.0, "step": 15010 }, { "entropy": 6.182788753509522, "epoch": 1.5009246763632729, "grad_norm": 1.390625, "learning_rate": 0.00047812852710199446, "loss": 5.9569, "mean_token_accuracy": 0.1508342981338501, "num_tokens": 29355726.0, "step": 15015 }, { "entropy": 6.116374826431274, "epoch": 1.5014245014245016, "grad_norm": 1.09375, "learning_rate": 0.0004781131755781582, "loss": 5.7993, "mean_token_accuracy": 0.16601921916007994, "num_tokens": 29366570.0, "step": 15020 }, { "entropy": 6.0964476585388185, "epoch": 1.50192432648573, "grad_norm": 1.578125, "learning_rate": 0.0004780978189440467, "loss": 5.9089, "mean_token_accuracy": 0.1565070003271103, "num_tokens": 29376356.0, "step": 15025 }, { "entropy": 6.175416374206543, "epoch": 1.5024241515469585, "grad_norm": 1.2890625, "learning_rate": 0.00047808245720004633, "loss": 5.9025, "mean_token_accuracy": 0.1557520419359207, "num_tokens": 29385246.0, "step": 15030 }, { "entropy": 6.104362535476684, "epoch": 1.5029239766081872, "grad_norm": 1.1875, "learning_rate": 0.00047806709034654355, "loss": 5.7773, "mean_token_accuracy": 0.16742318123579025, "num_tokens": 29395352.0, "step": 15035 }, { "entropy": 6.1111784934997555, "epoch": 1.5034238016694157, "grad_norm": 1.5859375, "learning_rate": 0.0004780517183839251, "loss": 5.9145, "mean_token_accuracy": 0.15390866845846177, "num_tokens": 29404771.0, "step": 15040 }, { "entropy": 6.0870363235473635, "epoch": 1.5039236267306442, "grad_norm": 1.234375, "learning_rate": 0.0004780363413125777, "loss": 5.819, "mean_token_accuracy": 0.1627956748008728, "num_tokens": 29413378.0, "step": 15045 }, { "entropy": 6.154175806045532, "epoch": 1.5044234517918729, "grad_norm": 1.203125, "learning_rate": 0.00047802095913288814, "loss": 5.9103, "mean_token_accuracy": 0.1604010283946991, "num_tokens": 29424125.0, "step": 15050 }, { "entropy": 6.143818044662476, "epoch": 1.5049232768531016, "grad_norm": 1.2109375, "learning_rate": 0.00047800557184524345, "loss": 5.8603, "mean_token_accuracy": 0.15866938084363938, "num_tokens": 29435411.0, "step": 15055 }, { "entropy": 6.081011343002319, "epoch": 1.5054231019143298, "grad_norm": 1.25, "learning_rate": 0.0004779901794500308, "loss": 5.9066, "mean_token_accuracy": 0.15717824548482895, "num_tokens": 29445515.0, "step": 15060 }, { "entropy": 6.181150102615357, "epoch": 1.5059229269755585, "grad_norm": 1.328125, "learning_rate": 0.00047797478194763754, "loss": 5.8884, "mean_token_accuracy": 0.15744663774967194, "num_tokens": 29454864.0, "step": 15065 }, { "entropy": 6.15263876914978, "epoch": 1.5064227520367872, "grad_norm": 1.375, "learning_rate": 0.00047795937933845103, "loss": 5.9136, "mean_token_accuracy": 0.15776969417929648, "num_tokens": 29464443.0, "step": 15070 }, { "entropy": 6.153004360198975, "epoch": 1.5069225770980157, "grad_norm": 1.3125, "learning_rate": 0.0004779439716228587, "loss": 5.909, "mean_token_accuracy": 0.15651096850633622, "num_tokens": 29474954.0, "step": 15075 }, { "entropy": 6.146423196792602, "epoch": 1.5074224021592442, "grad_norm": 1.3671875, "learning_rate": 0.0004779285588012482, "loss": 5.8769, "mean_token_accuracy": 0.16065066754817964, "num_tokens": 29484647.0, "step": 15080 }, { "entropy": 6.132674646377564, "epoch": 1.5079222272204729, "grad_norm": 1.25, "learning_rate": 0.00047791314087400745, "loss": 5.908, "mean_token_accuracy": 0.16260896474123002, "num_tokens": 29494782.0, "step": 15085 }, { "entropy": 6.086255264282227, "epoch": 1.5084220522817016, "grad_norm": 1.25, "learning_rate": 0.0004778977178415243, "loss": 5.8385, "mean_token_accuracy": 0.1640683740377426, "num_tokens": 29505311.0, "step": 15090 }, { "entropy": 6.116140699386596, "epoch": 1.5089218773429298, "grad_norm": 1.25, "learning_rate": 0.0004778822897041868, "loss": 5.8053, "mean_token_accuracy": 0.16211504340171815, "num_tokens": 29515192.0, "step": 15095 }, { "entropy": 6.181423807144165, "epoch": 1.5094217024041585, "grad_norm": 1.28125, "learning_rate": 0.000477866856462383, "loss": 5.868, "mean_token_accuracy": 0.16014138907194136, "num_tokens": 29524429.0, "step": 15100 }, { "entropy": 6.195126485824585, "epoch": 1.5099215274653872, "grad_norm": 1.3671875, "learning_rate": 0.0004778514181165014, "loss": 5.8018, "mean_token_accuracy": 0.1683039277791977, "num_tokens": 29532926.0, "step": 15105 }, { "entropy": 6.137876176834107, "epoch": 1.5104213525266157, "grad_norm": 1.21875, "learning_rate": 0.00047783597466693025, "loss": 5.9055, "mean_token_accuracy": 0.1598990947008133, "num_tokens": 29542588.0, "step": 15110 }, { "entropy": 6.106893825531006, "epoch": 1.5109211775878442, "grad_norm": 1.953125, "learning_rate": 0.0004778205261140582, "loss": 5.8346, "mean_token_accuracy": 0.16088825911283494, "num_tokens": 29551710.0, "step": 15115 }, { "entropy": 6.113062143325806, "epoch": 1.5114210026490729, "grad_norm": 1.234375, "learning_rate": 0.0004778050724582739, "loss": 5.9339, "mean_token_accuracy": 0.1654717057943344, "num_tokens": 29561357.0, "step": 15120 }, { "entropy": 6.120569181442261, "epoch": 1.5119208277103013, "grad_norm": 1.3125, "learning_rate": 0.00047778961369996623, "loss": 5.8372, "mean_token_accuracy": 0.16532306969165803, "num_tokens": 29570060.0, "step": 15125 }, { "entropy": 6.170530080795288, "epoch": 1.5124206527715298, "grad_norm": 1.34375, "learning_rate": 0.000477774149839524, "loss": 5.8555, "mean_token_accuracy": 0.16479945927858353, "num_tokens": 29580097.0, "step": 15130 }, { "entropy": 6.233632612228393, "epoch": 1.5129204778327585, "grad_norm": 1.2734375, "learning_rate": 0.00047775868087733634, "loss": 6.0435, "mean_token_accuracy": 0.14772638231515883, "num_tokens": 29590290.0, "step": 15135 }, { "entropy": 6.144825124740601, "epoch": 1.5134203028939872, "grad_norm": 1.4375, "learning_rate": 0.00047774320681379237, "loss": 5.8466, "mean_token_accuracy": 0.16631245240569115, "num_tokens": 29598839.0, "step": 15140 }, { "entropy": 6.1948157787323, "epoch": 1.5139201279552157, "grad_norm": 1.2734375, "learning_rate": 0.0004777277276492816, "loss": 5.9143, "mean_token_accuracy": 0.167092901468277, "num_tokens": 29609550.0, "step": 15145 }, { "entropy": 6.249425649642944, "epoch": 1.5144199530164442, "grad_norm": 1.2109375, "learning_rate": 0.00047771224338419326, "loss": 5.9996, "mean_token_accuracy": 0.1465565636754036, "num_tokens": 29619786.0, "step": 15150 }, { "entropy": 6.122082948684692, "epoch": 1.5149197780776729, "grad_norm": 1.4375, "learning_rate": 0.0004776967540189171, "loss": 5.8043, "mean_token_accuracy": 0.16506993174552917, "num_tokens": 29630492.0, "step": 15155 }, { "entropy": 6.176985406875611, "epoch": 1.5154196031389013, "grad_norm": 1.171875, "learning_rate": 0.0004776812595538428, "loss": 5.9099, "mean_token_accuracy": 0.15269644558429718, "num_tokens": 29641965.0, "step": 15160 }, { "entropy": 6.16685380935669, "epoch": 1.5159194282001298, "grad_norm": 1.2890625, "learning_rate": 0.00047766575998936013, "loss": 5.9204, "mean_token_accuracy": 0.15826703906059264, "num_tokens": 29651692.0, "step": 15165 }, { "entropy": 6.175631999969482, "epoch": 1.5164192532613585, "grad_norm": 1.390625, "learning_rate": 0.00047765025532585907, "loss": 5.8679, "mean_token_accuracy": 0.1623964712023735, "num_tokens": 29660541.0, "step": 15170 }, { "entropy": 6.08281397819519, "epoch": 1.5169190783225872, "grad_norm": 1.3359375, "learning_rate": 0.0004776347455637298, "loss": 5.8633, "mean_token_accuracy": 0.16244495958089827, "num_tokens": 29670498.0, "step": 15175 }, { "entropy": 6.046838092803955, "epoch": 1.5174189033838157, "grad_norm": 1.4296875, "learning_rate": 0.0004776192307033624, "loss": 5.7586, "mean_token_accuracy": 0.17302726060152054, "num_tokens": 29678898.0, "step": 15180 }, { "entropy": 6.175777292251587, "epoch": 1.5179187284450442, "grad_norm": 1.296875, "learning_rate": 0.0004776037107451473, "loss": 5.8981, "mean_token_accuracy": 0.15911915153265, "num_tokens": 29689723.0, "step": 15185 }, { "entropy": 6.110267448425293, "epoch": 1.5184185535062729, "grad_norm": 1.21875, "learning_rate": 0.000477588185689475, "loss": 5.7894, "mean_token_accuracy": 0.17264097929000854, "num_tokens": 29699246.0, "step": 15190 }, { "entropy": 6.060447120666504, "epoch": 1.5189183785675013, "grad_norm": 1.25, "learning_rate": 0.00047757265553673606, "loss": 5.7594, "mean_token_accuracy": 0.1698579266667366, "num_tokens": 29709125.0, "step": 15195 }, { "entropy": 6.082809066772461, "epoch": 1.5194182036287298, "grad_norm": 1.2265625, "learning_rate": 0.00047755712028732126, "loss": 5.7972, "mean_token_accuracy": 0.1643887847661972, "num_tokens": 29718953.0, "step": 15200 }, { "entropy": 6.1613805294036865, "epoch": 1.5199180286899585, "grad_norm": 1.3984375, "learning_rate": 0.0004775415799416214, "loss": 5.8539, "mean_token_accuracy": 0.15922629535198213, "num_tokens": 29728764.0, "step": 15205 }, { "entropy": 6.029280471801758, "epoch": 1.5204178537511872, "grad_norm": 1.390625, "learning_rate": 0.0004775260345000275, "loss": 5.8698, "mean_token_accuracy": 0.1581306904554367, "num_tokens": 29738033.0, "step": 15210 }, { "entropy": 6.008817434310913, "epoch": 1.5209176788124157, "grad_norm": 1.5078125, "learning_rate": 0.00047751048396293077, "loss": 5.7947, "mean_token_accuracy": 0.17406957894563674, "num_tokens": 29748450.0, "step": 15215 }, { "entropy": 6.227540063858032, "epoch": 1.5214175038736442, "grad_norm": 1.4375, "learning_rate": 0.00047749492833072226, "loss": 5.927, "mean_token_accuracy": 0.1563795879483223, "num_tokens": 29757984.0, "step": 15220 }, { "entropy": 6.137864112854004, "epoch": 1.5219173289348729, "grad_norm": 1.171875, "learning_rate": 0.00047747936760379354, "loss": 5.8629, "mean_token_accuracy": 0.15938941091299058, "num_tokens": 29768200.0, "step": 15225 }, { "entropy": 6.026132488250733, "epoch": 1.5224171539961013, "grad_norm": 1.2734375, "learning_rate": 0.000477463801782536, "loss": 5.8362, "mean_token_accuracy": 0.16058966964483262, "num_tokens": 29778242.0, "step": 15230 }, { "entropy": 6.174581670761109, "epoch": 1.5229169790573298, "grad_norm": 1.234375, "learning_rate": 0.00047744823086734136, "loss": 5.9735, "mean_token_accuracy": 0.152067668735981, "num_tokens": 29787636.0, "step": 15235 }, { "entropy": 6.198061227798462, "epoch": 1.5234168041185585, "grad_norm": 1.3984375, "learning_rate": 0.00047743265485860123, "loss": 5.803, "mean_token_accuracy": 0.16485027223825455, "num_tokens": 29796537.0, "step": 15240 }, { "entropy": 6.115128755569458, "epoch": 1.5239166291797872, "grad_norm": 1.359375, "learning_rate": 0.00047741707375670766, "loss": 5.8569, "mean_token_accuracy": 0.16327260583639144, "num_tokens": 29805495.0, "step": 15245 }, { "entropy": 6.095377445220947, "epoch": 1.5244164542410157, "grad_norm": 1.171875, "learning_rate": 0.0004774014875620526, "loss": 5.7601, "mean_token_accuracy": 0.16748379319906234, "num_tokens": 29815193.0, "step": 15250 }, { "entropy": 6.120562982559204, "epoch": 1.5249162793022442, "grad_norm": 1.4296875, "learning_rate": 0.00047738589627502814, "loss": 5.88, "mean_token_accuracy": 0.16375370174646378, "num_tokens": 29825004.0, "step": 15255 }, { "entropy": 6.067328929901123, "epoch": 1.5254161043634729, "grad_norm": 1.2890625, "learning_rate": 0.00047737029989602665, "loss": 5.8905, "mean_token_accuracy": 0.1636359930038452, "num_tokens": 29834507.0, "step": 15260 }, { "entropy": 6.038512897491455, "epoch": 1.5259159294247013, "grad_norm": 1.2421875, "learning_rate": 0.0004773546984254405, "loss": 5.7549, "mean_token_accuracy": 0.16233235597610474, "num_tokens": 29844397.0, "step": 15265 }, { "entropy": 6.152181100845337, "epoch": 1.5264157544859298, "grad_norm": 1.390625, "learning_rate": 0.0004773390918636622, "loss": 5.8732, "mean_token_accuracy": 0.16565565168857574, "num_tokens": 29855702.0, "step": 15270 }, { "entropy": 6.093813753128051, "epoch": 1.5269155795471585, "grad_norm": 1.2578125, "learning_rate": 0.0004773234802110844, "loss": 5.7635, "mean_token_accuracy": 0.16872600615024566, "num_tokens": 29865806.0, "step": 15275 }, { "entropy": 6.040602731704712, "epoch": 1.5274154046083872, "grad_norm": 1.3515625, "learning_rate": 0.0004773078634681, "loss": 5.7703, "mean_token_accuracy": 0.17455331087112427, "num_tokens": 29874827.0, "step": 15280 }, { "entropy": 6.043024969100952, "epoch": 1.5279152296696157, "grad_norm": 1.2578125, "learning_rate": 0.00047729224163510167, "loss": 5.8484, "mean_token_accuracy": 0.16239284127950668, "num_tokens": 29883517.0, "step": 15285 }, { "entropy": 6.061124610900879, "epoch": 1.5284150547308442, "grad_norm": 1.265625, "learning_rate": 0.00047727661471248263, "loss": 5.7637, "mean_token_accuracy": 0.16573414728045463, "num_tokens": 29893303.0, "step": 15290 }, { "entropy": 6.175179767608642, "epoch": 1.5289148797920729, "grad_norm": 1.6171875, "learning_rate": 0.000477260982700636, "loss": 5.9868, "mean_token_accuracy": 0.1538536839187145, "num_tokens": 29904719.0, "step": 15295 }, { "entropy": 6.186687374114991, "epoch": 1.5294147048533013, "grad_norm": 1.5703125, "learning_rate": 0.0004772453455999552, "loss": 5.8728, "mean_token_accuracy": 0.1573803335428238, "num_tokens": 29914852.0, "step": 15300 }, { "entropy": 6.064591646194458, "epoch": 1.5299145299145298, "grad_norm": 1.21875, "learning_rate": 0.0004772297034108334, "loss": 5.8224, "mean_token_accuracy": 0.16104813665151596, "num_tokens": 29924479.0, "step": 15305 }, { "entropy": 6.127867603302002, "epoch": 1.5304143549757585, "grad_norm": 1.21875, "learning_rate": 0.00047721405613366434, "loss": 5.8689, "mean_token_accuracy": 0.15917230993509293, "num_tokens": 29933162.0, "step": 15310 }, { "entropy": 6.082047605514527, "epoch": 1.5309141800369872, "grad_norm": 1.1640625, "learning_rate": 0.00047719840376884173, "loss": 5.7877, "mean_token_accuracy": 0.1677139550447464, "num_tokens": 29942468.0, "step": 15315 }, { "entropy": 6.075866079330444, "epoch": 1.5314140050982155, "grad_norm": 1.3046875, "learning_rate": 0.0004771827463167593, "loss": 5.8769, "mean_token_accuracy": 0.1628609538078308, "num_tokens": 29951716.0, "step": 15320 }, { "entropy": 6.1270959854125975, "epoch": 1.5319138301594442, "grad_norm": 1.2265625, "learning_rate": 0.0004771670837778109, "loss": 5.9359, "mean_token_accuracy": 0.1540454462170601, "num_tokens": 29960233.0, "step": 15325 }, { "entropy": 6.099421834945678, "epoch": 1.5324136552206729, "grad_norm": 1.3203125, "learning_rate": 0.00047715141615239075, "loss": 5.867, "mean_token_accuracy": 0.16315412521362305, "num_tokens": 29968979.0, "step": 15330 }, { "entropy": 6.07310733795166, "epoch": 1.5329134802819013, "grad_norm": 1.2421875, "learning_rate": 0.00047713574344089305, "loss": 5.8146, "mean_token_accuracy": 0.16052270978689193, "num_tokens": 29978830.0, "step": 15335 }, { "entropy": 6.146570539474487, "epoch": 1.5334133053431298, "grad_norm": 1.3203125, "learning_rate": 0.000477120065643712, "loss": 5.8325, "mean_token_accuracy": 0.16192905455827714, "num_tokens": 29987708.0, "step": 15340 }, { "entropy": 6.189952230453491, "epoch": 1.5339131304043585, "grad_norm": 1.171875, "learning_rate": 0.0004771043827612421, "loss": 5.8506, "mean_token_accuracy": 0.16452495157718658, "num_tokens": 29997351.0, "step": 15345 }, { "entropy": 6.081881093978882, "epoch": 1.5344129554655872, "grad_norm": 1.28125, "learning_rate": 0.00047708869479387795, "loss": 5.8555, "mean_token_accuracy": 0.1639459475874901, "num_tokens": 30006412.0, "step": 15350 }, { "entropy": 6.13397250175476, "epoch": 1.5349127805268155, "grad_norm": 1.7734375, "learning_rate": 0.0004770730017420143, "loss": 5.8544, "mean_token_accuracy": 0.15548537522554398, "num_tokens": 30016629.0, "step": 15355 }, { "entropy": 6.0898314952850345, "epoch": 1.5354126055880442, "grad_norm": 1.1640625, "learning_rate": 0.0004770573036060458, "loss": 5.7203, "mean_token_accuracy": 0.17135403901338578, "num_tokens": 30026395.0, "step": 15360 }, { "entropy": 6.131185531616211, "epoch": 1.5359124306492729, "grad_norm": 1.25, "learning_rate": 0.0004770416003863676, "loss": 5.8888, "mean_token_accuracy": 0.16102334409952163, "num_tokens": 30037178.0, "step": 15365 }, { "entropy": 6.065256881713867, "epoch": 1.5364122557105013, "grad_norm": 1.1953125, "learning_rate": 0.0004770258920833748, "loss": 5.7779, "mean_token_accuracy": 0.1677483156323433, "num_tokens": 30046335.0, "step": 15370 }, { "entropy": 6.1482987880706785, "epoch": 1.5369120807717298, "grad_norm": 1.3359375, "learning_rate": 0.00047701017869746236, "loss": 5.8505, "mean_token_accuracy": 0.1594402588903904, "num_tokens": 30056574.0, "step": 15375 }, { "entropy": 6.088780450820923, "epoch": 1.5374119058329585, "grad_norm": 1.5625, "learning_rate": 0.00047699446022902596, "loss": 5.774, "mean_token_accuracy": 0.165068681538105, "num_tokens": 30067048.0, "step": 15380 }, { "entropy": 5.999118947982788, "epoch": 1.537911730894187, "grad_norm": 1.2265625, "learning_rate": 0.00047697873667846094, "loss": 5.7974, "mean_token_accuracy": 0.16534364521503447, "num_tokens": 30077177.0, "step": 15385 }, { "entropy": 6.134491586685181, "epoch": 1.5384115559554155, "grad_norm": 1.421875, "learning_rate": 0.00047696300804616276, "loss": 5.9004, "mean_token_accuracy": 0.16050038784742354, "num_tokens": 30086348.0, "step": 15390 }, { "entropy": 6.0851703643798825, "epoch": 1.5389113810166442, "grad_norm": 1.4296875, "learning_rate": 0.0004769472743325273, "loss": 5.7752, "mean_token_accuracy": 0.16414364129304887, "num_tokens": 30096721.0, "step": 15395 }, { "entropy": 6.0597583770751955, "epoch": 1.5394112060778729, "grad_norm": 1.328125, "learning_rate": 0.00047693153553795046, "loss": 5.7698, "mean_token_accuracy": 0.16537482291460037, "num_tokens": 30106797.0, "step": 15400 }, { "entropy": 6.086478900909424, "epoch": 1.5399110311391013, "grad_norm": 1.3125, "learning_rate": 0.0004769157916628281, "loss": 5.8348, "mean_token_accuracy": 0.1604676753282547, "num_tokens": 30116643.0, "step": 15405 }, { "entropy": 6.09989366531372, "epoch": 1.5404108562003298, "grad_norm": 1.3828125, "learning_rate": 0.00047690004270755634, "loss": 5.7773, "mean_token_accuracy": 0.17121385931968688, "num_tokens": 30125336.0, "step": 15410 }, { "entropy": 5.986818647384643, "epoch": 1.5409106812615585, "grad_norm": 1.421875, "learning_rate": 0.0004768842886725314, "loss": 5.8022, "mean_token_accuracy": 0.16936761885881424, "num_tokens": 30135238.0, "step": 15415 }, { "entropy": 6.145879030227661, "epoch": 1.541410506322787, "grad_norm": 1.3515625, "learning_rate": 0.00047686852955814986, "loss": 5.8219, "mean_token_accuracy": 0.16371650546789168, "num_tokens": 30144469.0, "step": 15420 }, { "entropy": 6.086048984527588, "epoch": 1.5419103313840155, "grad_norm": 1.296875, "learning_rate": 0.000476852765364808, "loss": 5.8479, "mean_token_accuracy": 0.15872230231761933, "num_tokens": 30154484.0, "step": 15425 }, { "entropy": 6.081093215942383, "epoch": 1.5424101564452442, "grad_norm": 1.28125, "learning_rate": 0.0004768369960929025, "loss": 5.8312, "mean_token_accuracy": 0.1636373907327652, "num_tokens": 30163832.0, "step": 15430 }, { "entropy": 6.057599067687988, "epoch": 1.5429099815064728, "grad_norm": 1.4375, "learning_rate": 0.0004768212217428301, "loss": 5.7698, "mean_token_accuracy": 0.1623804524540901, "num_tokens": 30173503.0, "step": 15435 }, { "entropy": 6.128013038635254, "epoch": 1.5434098065677013, "grad_norm": 1.2265625, "learning_rate": 0.00047680544231498766, "loss": 5.8694, "mean_token_accuracy": 0.16631856858730315, "num_tokens": 30183476.0, "step": 15440 }, { "entropy": 6.144038534164428, "epoch": 1.5439096316289298, "grad_norm": 1.3203125, "learning_rate": 0.0004767896578097723, "loss": 5.8589, "mean_token_accuracy": 0.16868437975645065, "num_tokens": 30192552.0, "step": 15445 }, { "entropy": 6.209604787826538, "epoch": 1.5444094566901585, "grad_norm": 1.3203125, "learning_rate": 0.0004767738682275811, "loss": 5.9225, "mean_token_accuracy": 0.15715301781892776, "num_tokens": 30202796.0, "step": 15450 }, { "entropy": 6.133153104782105, "epoch": 1.544909281751387, "grad_norm": 1.28125, "learning_rate": 0.0004767580735688112, "loss": 5.8254, "mean_token_accuracy": 0.16285106614232064, "num_tokens": 30211878.0, "step": 15455 }, { "entropy": 6.077563190460205, "epoch": 1.5454091068126155, "grad_norm": 1.2109375, "learning_rate": 0.0004767422738338601, "loss": 5.8755, "mean_token_accuracy": 0.15973365157842637, "num_tokens": 30221572.0, "step": 15460 }, { "entropy": 6.072950315475464, "epoch": 1.5459089318738441, "grad_norm": 1.578125, "learning_rate": 0.0004767264690231253, "loss": 5.8215, "mean_token_accuracy": 0.16243474185466766, "num_tokens": 30230770.0, "step": 15465 }, { "entropy": 6.104480743408203, "epoch": 1.5464087569350728, "grad_norm": 1.2265625, "learning_rate": 0.0004767106591370045, "loss": 5.7707, "mean_token_accuracy": 0.17189311981201172, "num_tokens": 30241404.0, "step": 15470 }, { "entropy": 6.175734519958496, "epoch": 1.5469085819963013, "grad_norm": 1.2265625, "learning_rate": 0.00047669484417589537, "loss": 5.9095, "mean_token_accuracy": 0.15281098037958146, "num_tokens": 30251471.0, "step": 15475 }, { "entropy": 6.203527736663818, "epoch": 1.5474084070575298, "grad_norm": 1.2734375, "learning_rate": 0.00047667902414019585, "loss": 5.8697, "mean_token_accuracy": 0.15795407965779304, "num_tokens": 30260962.0, "step": 15480 }, { "entropy": 6.153222322463989, "epoch": 1.5479082321187585, "grad_norm": 1.1953125, "learning_rate": 0.000476663199030304, "loss": 5.9168, "mean_token_accuracy": 0.15842970907688142, "num_tokens": 30271959.0, "step": 15485 }, { "entropy": 6.013221788406372, "epoch": 1.548408057179987, "grad_norm": 1.3125, "learning_rate": 0.00047664736884661804, "loss": 5.7757, "mean_token_accuracy": 0.16625786870718, "num_tokens": 30281134.0, "step": 15490 }, { "entropy": 6.005005979537964, "epoch": 1.5489078822412155, "grad_norm": 1.421875, "learning_rate": 0.00047663153358953604, "loss": 5.7511, "mean_token_accuracy": 0.17048237919807435, "num_tokens": 30289989.0, "step": 15495 }, { "entropy": 6.120188283920288, "epoch": 1.5494077073024441, "grad_norm": 1.3671875, "learning_rate": 0.0004766156932594566, "loss": 5.8806, "mean_token_accuracy": 0.1587989792227745, "num_tokens": 30300416.0, "step": 15500 }, { "entropy": 6.169473457336426, "epoch": 1.5499075323636728, "grad_norm": 1.2734375, "learning_rate": 0.00047659984785677824, "loss": 5.8461, "mean_token_accuracy": 0.16052213683724403, "num_tokens": 30310056.0, "step": 15505 }, { "entropy": 6.112693500518799, "epoch": 1.5504073574249013, "grad_norm": 1.3125, "learning_rate": 0.00047658399738189955, "loss": 5.8686, "mean_token_accuracy": 0.16063059717416764, "num_tokens": 30319489.0, "step": 15510 }, { "entropy": 6.164441108703613, "epoch": 1.5509071824861298, "grad_norm": 1.1875, "learning_rate": 0.00047656814183521937, "loss": 5.9358, "mean_token_accuracy": 0.15607595890760423, "num_tokens": 30328814.0, "step": 15515 }, { "entropy": 6.138902950286865, "epoch": 1.5514070075473585, "grad_norm": 1.21875, "learning_rate": 0.0004765522812171366, "loss": 5.8031, "mean_token_accuracy": 0.1670185148715973, "num_tokens": 30339219.0, "step": 15520 }, { "entropy": 6.0118121147155765, "epoch": 1.551906832608587, "grad_norm": 1.3515625, "learning_rate": 0.00047653641552805023, "loss": 5.8179, "mean_token_accuracy": 0.1645095318555832, "num_tokens": 30349553.0, "step": 15525 }, { "entropy": 6.097389173507691, "epoch": 1.5524066576698154, "grad_norm": 1.265625, "learning_rate": 0.0004765205447683595, "loss": 5.876, "mean_token_accuracy": 0.155429208278656, "num_tokens": 30359782.0, "step": 15530 }, { "entropy": 6.129660320281983, "epoch": 1.5529064827310441, "grad_norm": 1.59375, "learning_rate": 0.0004765046689384638, "loss": 5.8277, "mean_token_accuracy": 0.16279025226831437, "num_tokens": 30369635.0, "step": 15535 }, { "entropy": 6.070033359527588, "epoch": 1.5534063077922728, "grad_norm": 1.296875, "learning_rate": 0.0004764887880387625, "loss": 5.7679, "mean_token_accuracy": 0.16790590286254883, "num_tokens": 30379453.0, "step": 15540 }, { "entropy": 6.1385540008544925, "epoch": 1.5539061328535013, "grad_norm": 1.5078125, "learning_rate": 0.00047647290206965506, "loss": 5.8466, "mean_token_accuracy": 0.15930682942271232, "num_tokens": 30388989.0, "step": 15545 }, { "entropy": 6.1380664825439455, "epoch": 1.5544059579147298, "grad_norm": 1.3203125, "learning_rate": 0.00047645701103154125, "loss": 5.8624, "mean_token_accuracy": 0.16486021429300307, "num_tokens": 30399401.0, "step": 15550 }, { "entropy": 6.185231351852417, "epoch": 1.5549057829759585, "grad_norm": 1.25, "learning_rate": 0.00047644111492482094, "loss": 5.8998, "mean_token_accuracy": 0.1483965940773487, "num_tokens": 30409795.0, "step": 15555 }, { "entropy": 6.179520320892334, "epoch": 1.555405608037187, "grad_norm": 1.2109375, "learning_rate": 0.000476425213749894, "loss": 5.9365, "mean_token_accuracy": 0.15703604742884636, "num_tokens": 30419243.0, "step": 15560 }, { "entropy": 6.111941385269165, "epoch": 1.5559054330984154, "grad_norm": 1.34375, "learning_rate": 0.0004764093075071605, "loss": 5.8799, "mean_token_accuracy": 0.1628809839487076, "num_tokens": 30429278.0, "step": 15565 }, { "entropy": 6.050267219543457, "epoch": 1.5564052581596441, "grad_norm": 1.453125, "learning_rate": 0.0004763933961970206, "loss": 5.8253, "mean_token_accuracy": 0.16774676442146302, "num_tokens": 30438442.0, "step": 15570 }, { "entropy": 6.087157726287842, "epoch": 1.5569050832208728, "grad_norm": 1.3125, "learning_rate": 0.0004763774798198748, "loss": 5.8235, "mean_token_accuracy": 0.16341341584920882, "num_tokens": 30448779.0, "step": 15575 }, { "entropy": 6.136054420471192, "epoch": 1.5574049082821013, "grad_norm": 1.5703125, "learning_rate": 0.0004763615583761234, "loss": 5.8009, "mean_token_accuracy": 0.163629412651062, "num_tokens": 30458219.0, "step": 15580 }, { "entropy": 6.173776245117187, "epoch": 1.5579047333433298, "grad_norm": 1.40625, "learning_rate": 0.0004763456318661669, "loss": 5.8506, "mean_token_accuracy": 0.1635434776544571, "num_tokens": 30467772.0, "step": 15585 }, { "entropy": 6.109755373001098, "epoch": 1.5584045584045585, "grad_norm": 1.3359375, "learning_rate": 0.0004763297002904062, "loss": 5.8096, "mean_token_accuracy": 0.16153863072395325, "num_tokens": 30477025.0, "step": 15590 }, { "entropy": 6.1238078594207765, "epoch": 1.558904383465787, "grad_norm": 1.3359375, "learning_rate": 0.00047631376364924195, "loss": 5.8759, "mean_token_accuracy": 0.1667680948972702, "num_tokens": 30486691.0, "step": 15595 }, { "entropy": 6.0402512550354, "epoch": 1.5594042085270154, "grad_norm": 1.234375, "learning_rate": 0.0004762978219430753, "loss": 5.7792, "mean_token_accuracy": 0.16216624081134795, "num_tokens": 30497138.0, "step": 15600 }, { "entropy": 6.145529699325562, "epoch": 1.5599040335882441, "grad_norm": 1.6328125, "learning_rate": 0.0004762818751723072, "loss": 5.9476, "mean_token_accuracy": 0.1560802549123764, "num_tokens": 30507526.0, "step": 15605 }, { "entropy": 6.1236495018005375, "epoch": 1.5604038586494728, "grad_norm": 1.2734375, "learning_rate": 0.00047626592333733895, "loss": 5.7904, "mean_token_accuracy": 0.16258176118135453, "num_tokens": 30517823.0, "step": 15610 }, { "entropy": 6.093144178390503, "epoch": 1.560903683710701, "grad_norm": 1.34375, "learning_rate": 0.0004762499664385719, "loss": 5.8179, "mean_token_accuracy": 0.16506240367889405, "num_tokens": 30527892.0, "step": 15615 }, { "entropy": 6.148361921310425, "epoch": 1.5614035087719298, "grad_norm": 1.2578125, "learning_rate": 0.00047623400447640733, "loss": 5.829, "mean_token_accuracy": 0.17027583867311477, "num_tokens": 30537329.0, "step": 15620 }, { "entropy": 6.107088327407837, "epoch": 1.5619033338331585, "grad_norm": 1.1875, "learning_rate": 0.00047621803745124717, "loss": 5.8467, "mean_token_accuracy": 0.16183447688817978, "num_tokens": 30546406.0, "step": 15625 }, { "entropy": 6.158752822875977, "epoch": 1.562403158894387, "grad_norm": 1.1640625, "learning_rate": 0.00047620206536349294, "loss": 5.9205, "mean_token_accuracy": 0.16163745671510696, "num_tokens": 30556646.0, "step": 15630 }, { "entropy": 6.104726314544678, "epoch": 1.5629029839556154, "grad_norm": 1.25, "learning_rate": 0.00047618608821354636, "loss": 5.7775, "mean_token_accuracy": 0.17397433370351792, "num_tokens": 30565984.0, "step": 15635 }, { "entropy": 6.158686113357544, "epoch": 1.5634028090168441, "grad_norm": 1.1484375, "learning_rate": 0.0004761701060018097, "loss": 5.8675, "mean_token_accuracy": 0.1569593667984009, "num_tokens": 30575257.0, "step": 15640 }, { "entropy": 6.080680274963379, "epoch": 1.5639026340780728, "grad_norm": 1.234375, "learning_rate": 0.000476154118728685, "loss": 5.8016, "mean_token_accuracy": 0.15917307734489441, "num_tokens": 30584248.0, "step": 15645 }, { "entropy": 6.128966856002807, "epoch": 1.564402459139301, "grad_norm": 1.4375, "learning_rate": 0.00047613812639457425, "loss": 5.862, "mean_token_accuracy": 0.16283520311117172, "num_tokens": 30593875.0, "step": 15650 }, { "entropy": 6.112940788269043, "epoch": 1.5649022842005298, "grad_norm": 1.5234375, "learning_rate": 0.0004761221289998801, "loss": 5.7588, "mean_token_accuracy": 0.1657870039343834, "num_tokens": 30603696.0, "step": 15655 }, { "entropy": 6.117493677139282, "epoch": 1.5654021092617585, "grad_norm": 1.3046875, "learning_rate": 0.0004761061265450049, "loss": 5.7938, "mean_token_accuracy": 0.16458658874034882, "num_tokens": 30613451.0, "step": 15660 }, { "entropy": 6.093286371231079, "epoch": 1.565901934322987, "grad_norm": 1.2109375, "learning_rate": 0.00047609011903035136, "loss": 5.8793, "mean_token_accuracy": 0.1588987961411476, "num_tokens": 30623567.0, "step": 15665 }, { "entropy": 6.12623143196106, "epoch": 1.5664017593842154, "grad_norm": 1.4453125, "learning_rate": 0.00047607410645632216, "loss": 5.8326, "mean_token_accuracy": 0.1615612030029297, "num_tokens": 30634828.0, "step": 15670 }, { "entropy": 6.197947978973389, "epoch": 1.5669015844454441, "grad_norm": 1.5546875, "learning_rate": 0.00047605808882332013, "loss": 5.9849, "mean_token_accuracy": 0.15303948819637297, "num_tokens": 30644552.0, "step": 15675 }, { "entropy": 6.170982313156128, "epoch": 1.5674014095066726, "grad_norm": 1.2890625, "learning_rate": 0.0004760420661317484, "loss": 5.9662, "mean_token_accuracy": 0.1577688455581665, "num_tokens": 30654874.0, "step": 15680 }, { "entropy": 6.173335075378418, "epoch": 1.567901234567901, "grad_norm": 1.1640625, "learning_rate": 0.0004760260383820099, "loss": 5.8174, "mean_token_accuracy": 0.1662250429391861, "num_tokens": 30665619.0, "step": 15685 }, { "entropy": 6.045621633529663, "epoch": 1.5684010596291298, "grad_norm": 1.3125, "learning_rate": 0.00047601000557450816, "loss": 5.802, "mean_token_accuracy": 0.16115155220031738, "num_tokens": 30675072.0, "step": 15690 }, { "entropy": 6.170194101333618, "epoch": 1.5689008846903585, "grad_norm": 1.2734375, "learning_rate": 0.0004759939677096463, "loss": 5.9146, "mean_token_accuracy": 0.15461870431900024, "num_tokens": 30684567.0, "step": 15695 }, { "entropy": 6.107315492630005, "epoch": 1.569400709751587, "grad_norm": 1.3046875, "learning_rate": 0.0004759779247878279, "loss": 5.8883, "mean_token_accuracy": 0.16287163645029068, "num_tokens": 30693808.0, "step": 15700 }, { "entropy": 5.993677473068237, "epoch": 1.5699005348128154, "grad_norm": 1.421875, "learning_rate": 0.00047596187680945675, "loss": 5.7905, "mean_token_accuracy": 0.1765650823712349, "num_tokens": 30702895.0, "step": 15705 }, { "entropy": 6.179835367202759, "epoch": 1.5704003598740441, "grad_norm": 1.1953125, "learning_rate": 0.0004759458237749364, "loss": 5.9413, "mean_token_accuracy": 0.15825000479817392, "num_tokens": 30714582.0, "step": 15710 }, { "entropy": 6.155795621871948, "epoch": 1.5709001849352726, "grad_norm": 1.3046875, "learning_rate": 0.0004759297656846708, "loss": 5.8901, "mean_token_accuracy": 0.1566804453730583, "num_tokens": 30724415.0, "step": 15715 }, { "entropy": 6.09362096786499, "epoch": 1.571400009996501, "grad_norm": 1.1875, "learning_rate": 0.00047591370253906415, "loss": 5.7779, "mean_token_accuracy": 0.16407259702682495, "num_tokens": 30733040.0, "step": 15720 }, { "entropy": 6.066727066040039, "epoch": 1.5718998350577298, "grad_norm": 1.4140625, "learning_rate": 0.00047589763433852027, "loss": 5.7973, "mean_token_accuracy": 0.16331228315830232, "num_tokens": 30743022.0, "step": 15725 }, { "entropy": 6.06973032951355, "epoch": 1.5723996601189585, "grad_norm": 1.2578125, "learning_rate": 0.0004758815610834437, "loss": 5.8029, "mean_token_accuracy": 0.1651538133621216, "num_tokens": 30753335.0, "step": 15730 }, { "entropy": 6.082103586196899, "epoch": 1.572899485180187, "grad_norm": 1.3984375, "learning_rate": 0.00047586548277423873, "loss": 5.8486, "mean_token_accuracy": 0.1571740135550499, "num_tokens": 30762863.0, "step": 15735 }, { "entropy": 6.121285057067871, "epoch": 1.5733993102414154, "grad_norm": 1.359375, "learning_rate": 0.00047584939941130994, "loss": 5.8614, "mean_token_accuracy": 0.1668570101261139, "num_tokens": 30773090.0, "step": 15740 }, { "entropy": 6.121962404251098, "epoch": 1.5738991353026441, "grad_norm": 1.2578125, "learning_rate": 0.0004758333109950619, "loss": 5.8841, "mean_token_accuracy": 0.16276065558195113, "num_tokens": 30782589.0, "step": 15745 }, { "entropy": 6.153895664215088, "epoch": 1.5743989603638726, "grad_norm": 1.40625, "learning_rate": 0.00047581721752589943, "loss": 5.7908, "mean_token_accuracy": 0.16383911520242692, "num_tokens": 30791508.0, "step": 15750 }, { "entropy": 6.067975234985352, "epoch": 1.574898785425101, "grad_norm": 1.296875, "learning_rate": 0.0004758011190042274, "loss": 5.7904, "mean_token_accuracy": 0.16405827254056932, "num_tokens": 30801133.0, "step": 15755 }, { "entropy": 6.057309293746949, "epoch": 1.5753986104863298, "grad_norm": 1.5234375, "learning_rate": 0.0004757850154304509, "loss": 5.7153, "mean_token_accuracy": 0.17136121839284896, "num_tokens": 30810100.0, "step": 15760 }, { "entropy": 6.072236824035644, "epoch": 1.5758984355475585, "grad_norm": 1.25, "learning_rate": 0.0004757689068049752, "loss": 5.7921, "mean_token_accuracy": 0.17318984419107436, "num_tokens": 30820118.0, "step": 15765 }, { "entropy": 6.068833875656128, "epoch": 1.576398260608787, "grad_norm": 1.3046875, "learning_rate": 0.00047575279312820533, "loss": 5.8262, "mean_token_accuracy": 0.15900918394327163, "num_tokens": 30830480.0, "step": 15770 }, { "entropy": 6.134298419952392, "epoch": 1.5768980856700154, "grad_norm": 1.21875, "learning_rate": 0.0004757366744005469, "loss": 5.9333, "mean_token_accuracy": 0.15336010754108428, "num_tokens": 30840421.0, "step": 15775 }, { "entropy": 6.163825654983521, "epoch": 1.5773979107312441, "grad_norm": 1.359375, "learning_rate": 0.00047572055062240537, "loss": 5.8268, "mean_token_accuracy": 0.15723081678152084, "num_tokens": 30849247.0, "step": 15780 }, { "entropy": 6.118316555023194, "epoch": 1.5778977357924726, "grad_norm": 1.578125, "learning_rate": 0.0004757044217941865, "loss": 5.8135, "mean_token_accuracy": 0.16745300889015197, "num_tokens": 30858804.0, "step": 15785 }, { "entropy": 6.123394727706909, "epoch": 1.578397560853701, "grad_norm": 1.390625, "learning_rate": 0.00047568828791629605, "loss": 5.8545, "mean_token_accuracy": 0.16265913397073745, "num_tokens": 30869150.0, "step": 15790 }, { "entropy": 6.0276207447052, "epoch": 1.5788973859149298, "grad_norm": 1.265625, "learning_rate": 0.0004756721489891398, "loss": 5.7715, "mean_token_accuracy": 0.17174263596534728, "num_tokens": 30878671.0, "step": 15795 }, { "entropy": 6.165126132965088, "epoch": 1.5793972109761585, "grad_norm": 1.171875, "learning_rate": 0.0004756560050131239, "loss": 5.904, "mean_token_accuracy": 0.15668088793754578, "num_tokens": 30888064.0, "step": 15800 }, { "entropy": 6.138621664047241, "epoch": 1.579897036037387, "grad_norm": 1.1640625, "learning_rate": 0.00047563985598865466, "loss": 5.9125, "mean_token_accuracy": 0.16091287955641748, "num_tokens": 30898205.0, "step": 15805 }, { "entropy": 6.169529819488526, "epoch": 1.5803968610986154, "grad_norm": 1.2578125, "learning_rate": 0.00047562370191613816, "loss": 5.8743, "mean_token_accuracy": 0.1600824385881424, "num_tokens": 30907371.0, "step": 15810 }, { "entropy": 6.270576000213623, "epoch": 1.5808966861598441, "grad_norm": 1.25, "learning_rate": 0.0004756075427959811, "loss": 5.9795, "mean_token_accuracy": 0.1534248858690262, "num_tokens": 30917481.0, "step": 15815 }, { "entropy": 6.14884614944458, "epoch": 1.5813965112210726, "grad_norm": 1.3125, "learning_rate": 0.0004755913786285898, "loss": 5.9044, "mean_token_accuracy": 0.15823470056056976, "num_tokens": 30927375.0, "step": 15820 }, { "entropy": 6.048176908493042, "epoch": 1.581896336282301, "grad_norm": 1.3359375, "learning_rate": 0.00047557520941437093, "loss": 5.8092, "mean_token_accuracy": 0.16888693273067473, "num_tokens": 30935888.0, "step": 15825 }, { "entropy": 6.135527896881103, "epoch": 1.5823961613435298, "grad_norm": 1.25, "learning_rate": 0.00047555903515373156, "loss": 5.8523, "mean_token_accuracy": 0.1688093736767769, "num_tokens": 30946433.0, "step": 15830 }, { "entropy": 6.187525510787964, "epoch": 1.5828959864047585, "grad_norm": 1.1484375, "learning_rate": 0.00047554285584707834, "loss": 5.8635, "mean_token_accuracy": 0.16482745110988617, "num_tokens": 30956951.0, "step": 15835 }, { "entropy": 6.019034337997437, "epoch": 1.583395811465987, "grad_norm": 1.2109375, "learning_rate": 0.0004755266714948186, "loss": 5.7279, "mean_token_accuracy": 0.1707964926958084, "num_tokens": 30967332.0, "step": 15840 }, { "entropy": 6.11483097076416, "epoch": 1.5838956365272154, "grad_norm": 1.1796875, "learning_rate": 0.0004755104820973593, "loss": 5.9249, "mean_token_accuracy": 0.15547935962677, "num_tokens": 30977704.0, "step": 15845 }, { "entropy": 6.277363061904907, "epoch": 1.5843954615884441, "grad_norm": 1.515625, "learning_rate": 0.00047549428765510793, "loss": 5.9985, "mean_token_accuracy": 0.1495994433760643, "num_tokens": 30987916.0, "step": 15850 }, { "entropy": 6.1189018249511715, "epoch": 1.5848952866496726, "grad_norm": 1.28125, "learning_rate": 0.00047547808816847186, "loss": 5.7789, "mean_token_accuracy": 0.17720956355333328, "num_tokens": 30997357.0, "step": 15855 }, { "entropy": 6.186125183105469, "epoch": 1.585395111710901, "grad_norm": 1.390625, "learning_rate": 0.0004754618836378587, "loss": 5.9121, "mean_token_accuracy": 0.1553702786564827, "num_tokens": 31006113.0, "step": 15860 }, { "entropy": 6.058428144454956, "epoch": 1.5858949367721298, "grad_norm": 1.3515625, "learning_rate": 0.0004754456740636761, "loss": 5.7793, "mean_token_accuracy": 0.16829523891210557, "num_tokens": 31014952.0, "step": 15865 }, { "entropy": 6.244317150115966, "epoch": 1.5863947618333585, "grad_norm": 1.421875, "learning_rate": 0.00047542945944633187, "loss": 5.9443, "mean_token_accuracy": 0.1488759696483612, "num_tokens": 31024934.0, "step": 15870 }, { "entropy": 6.117820978164673, "epoch": 1.5868945868945867, "grad_norm": 1.453125, "learning_rate": 0.00047541323978623405, "loss": 5.7569, "mean_token_accuracy": 0.17177275717258453, "num_tokens": 31033934.0, "step": 15875 }, { "entropy": 6.119710493087768, "epoch": 1.5873944119558154, "grad_norm": 1.2421875, "learning_rate": 0.00047539701508379073, "loss": 5.9298, "mean_token_accuracy": 0.16198905780911446, "num_tokens": 31043896.0, "step": 15880 }, { "entropy": 6.1023224830627445, "epoch": 1.5878942370170441, "grad_norm": 1.390625, "learning_rate": 0.0004753807853394101, "loss": 5.8652, "mean_token_accuracy": 0.16319505870342255, "num_tokens": 31055103.0, "step": 15885 }, { "entropy": 6.190455389022827, "epoch": 1.5883940620782726, "grad_norm": 1.2265625, "learning_rate": 0.00047536455055350034, "loss": 5.9312, "mean_token_accuracy": 0.15753868818283082, "num_tokens": 31065478.0, "step": 15890 }, { "entropy": 6.125552320480347, "epoch": 1.588893887139501, "grad_norm": 1.3203125, "learning_rate": 0.00047534831072647016, "loss": 5.8255, "mean_token_accuracy": 0.16183240264654158, "num_tokens": 31074408.0, "step": 15895 }, { "entropy": 6.1248459815979, "epoch": 1.5893937122007298, "grad_norm": 1.265625, "learning_rate": 0.00047533206585872805, "loss": 5.8667, "mean_token_accuracy": 0.16485778540372847, "num_tokens": 31084223.0, "step": 15900 }, { "entropy": 6.053799343109131, "epoch": 1.5898935372619585, "grad_norm": 1.171875, "learning_rate": 0.0004753158159506827, "loss": 5.7569, "mean_token_accuracy": 0.17025361359119415, "num_tokens": 31094133.0, "step": 15905 }, { "entropy": 6.161025905609131, "epoch": 1.5903933623231867, "grad_norm": 1.78125, "learning_rate": 0.0004752995610027429, "loss": 5.862, "mean_token_accuracy": 0.16503244936466216, "num_tokens": 31104283.0, "step": 15910 }, { "entropy": 6.090030574798584, "epoch": 1.5908931873844154, "grad_norm": 1.2109375, "learning_rate": 0.00047528330101531777, "loss": 5.8276, "mean_token_accuracy": 0.15893703922629357, "num_tokens": 31114274.0, "step": 15915 }, { "entropy": 6.1467639923095705, "epoch": 1.5913930124456441, "grad_norm": 1.2265625, "learning_rate": 0.00047526703598881623, "loss": 5.8427, "mean_token_accuracy": 0.16548595130443572, "num_tokens": 31123680.0, "step": 15920 }, { "entropy": 6.103705930709839, "epoch": 1.5918928375068726, "grad_norm": 1.375, "learning_rate": 0.0004752507659236476, "loss": 5.7904, "mean_token_accuracy": 0.17176930457353592, "num_tokens": 31133520.0, "step": 15925 }, { "entropy": 5.973827838897705, "epoch": 1.592392662568101, "grad_norm": 1.2890625, "learning_rate": 0.0004752344908202213, "loss": 5.7382, "mean_token_accuracy": 0.17715881764888763, "num_tokens": 31142915.0, "step": 15930 }, { "entropy": 6.03070330619812, "epoch": 1.5928924876293298, "grad_norm": 1.171875, "learning_rate": 0.0004752182106789467, "loss": 5.7589, "mean_token_accuracy": 0.1658123776316643, "num_tokens": 31152133.0, "step": 15935 }, { "entropy": 6.039987230300904, "epoch": 1.5933923126905583, "grad_norm": 1.3515625, "learning_rate": 0.00047520192550023344, "loss": 5.7747, "mean_token_accuracy": 0.1715406596660614, "num_tokens": 31161666.0, "step": 15940 }, { "entropy": 6.054074478149414, "epoch": 1.5938921377517867, "grad_norm": 1.3125, "learning_rate": 0.0004751856352844913, "loss": 5.8148, "mean_token_accuracy": 0.16528140008449554, "num_tokens": 31171591.0, "step": 15945 }, { "entropy": 6.212997913360596, "epoch": 1.5943919628130154, "grad_norm": 1.2421875, "learning_rate": 0.00047516934003213, "loss": 5.9348, "mean_token_accuracy": 0.15825078785419464, "num_tokens": 31181396.0, "step": 15950 }, { "entropy": 6.1554888725280765, "epoch": 1.5948917878742441, "grad_norm": 1.3515625, "learning_rate": 0.00047515303974355965, "loss": 5.8791, "mean_token_accuracy": 0.16116903126239776, "num_tokens": 31191926.0, "step": 15955 }, { "entropy": 6.1184299945831295, "epoch": 1.5953916129354726, "grad_norm": 1.296875, "learning_rate": 0.00047513673441919036, "loss": 5.864, "mean_token_accuracy": 0.15740237087011338, "num_tokens": 31202809.0, "step": 15960 }, { "entropy": 6.139546871185303, "epoch": 1.595891437996701, "grad_norm": 1.21875, "learning_rate": 0.0004751204240594323, "loss": 5.8326, "mean_token_accuracy": 0.16230722069740294, "num_tokens": 31211763.0, "step": 15965 }, { "entropy": 6.120927238464356, "epoch": 1.5963912630579298, "grad_norm": 1.2265625, "learning_rate": 0.0004751041086646959, "loss": 5.8468, "mean_token_accuracy": 0.15655516535043718, "num_tokens": 31220881.0, "step": 15970 }, { "entropy": 6.0632421493530275, "epoch": 1.5968910881191583, "grad_norm": 1.78125, "learning_rate": 0.0004750877882353915, "loss": 5.794, "mean_token_accuracy": 0.1687676802277565, "num_tokens": 31230740.0, "step": 15975 }, { "entropy": 6.018096780776977, "epoch": 1.5973909131803867, "grad_norm": 1.2578125, "learning_rate": 0.00047507146277192997, "loss": 5.6552, "mean_token_accuracy": 0.1715314656496048, "num_tokens": 31239777.0, "step": 15980 }, { "entropy": 6.066577672958374, "epoch": 1.5978907382416154, "grad_norm": 1.3359375, "learning_rate": 0.0004750551322747219, "loss": 5.8304, "mean_token_accuracy": 0.16165436059236526, "num_tokens": 31248574.0, "step": 15985 }, { "entropy": 6.11440601348877, "epoch": 1.5983905633028441, "grad_norm": 2.546875, "learning_rate": 0.0004750387967441781, "loss": 5.9047, "mean_token_accuracy": 0.16036269664764405, "num_tokens": 31258888.0, "step": 15990 }, { "entropy": 6.09486870765686, "epoch": 1.5988903883640726, "grad_norm": 2.25, "learning_rate": 0.00047502245618070976, "loss": 5.7846, "mean_token_accuracy": 0.17157715409994126, "num_tokens": 31269966.0, "step": 15995 }, { "entropy": 6.115769672393799, "epoch": 1.599390213425301, "grad_norm": 1.3515625, "learning_rate": 0.00047500611058472783, "loss": 5.8361, "mean_token_accuracy": 0.16435294970870018, "num_tokens": 31279746.0, "step": 16000 }, { "entropy": 6.044664716720581, "epoch": 1.5998900384865298, "grad_norm": 1.625, "learning_rate": 0.00047498975995664356, "loss": 5.8803, "mean_token_accuracy": 0.15991793125867843, "num_tokens": 31289677.0, "step": 16005 }, { "entropy": 6.062617492675781, "epoch": 1.6003898635477583, "grad_norm": 1.3515625, "learning_rate": 0.0004749734042968685, "loss": 5.894, "mean_token_accuracy": 0.1650659702718258, "num_tokens": 31299752.0, "step": 16010 }, { "entropy": 6.08680830001831, "epoch": 1.6008896886089867, "grad_norm": 1.296875, "learning_rate": 0.000474957043605814, "loss": 5.7699, "mean_token_accuracy": 0.16378215402364732, "num_tokens": 31308986.0, "step": 16015 }, { "entropy": 6.089492082595825, "epoch": 1.6013895136702154, "grad_norm": 1.3359375, "learning_rate": 0.00047494067788389174, "loss": 5.7554, "mean_token_accuracy": 0.17349808067083358, "num_tokens": 31318848.0, "step": 16020 }, { "entropy": 6.136660051345825, "epoch": 1.6018893387314441, "grad_norm": 1.3203125, "learning_rate": 0.00047492430713151347, "loss": 5.8885, "mean_token_accuracy": 0.15980696976184844, "num_tokens": 31329397.0, "step": 16025 }, { "entropy": 6.219451570510865, "epoch": 1.6023891637926726, "grad_norm": 1.2578125, "learning_rate": 0.0004749079313490911, "loss": 5.9444, "mean_token_accuracy": 0.15631850808858871, "num_tokens": 31340440.0, "step": 16030 }, { "entropy": 6.1272295951843265, "epoch": 1.602888988853901, "grad_norm": 1.390625, "learning_rate": 0.00047489155053703655, "loss": 5.8857, "mean_token_accuracy": 0.1611655905842781, "num_tokens": 31350418.0, "step": 16035 }, { "entropy": 6.070876932144165, "epoch": 1.6033888139151298, "grad_norm": 1.40625, "learning_rate": 0.0004748751646957621, "loss": 5.8305, "mean_token_accuracy": 0.1658831998705864, "num_tokens": 31360714.0, "step": 16040 }, { "entropy": 6.147923231124878, "epoch": 1.6038886389763582, "grad_norm": 1.390625, "learning_rate": 0.0004748587738256799, "loss": 5.8354, "mean_token_accuracy": 0.16950891315937042, "num_tokens": 31369693.0, "step": 16045 }, { "entropy": 6.051037693023682, "epoch": 1.6043884640375867, "grad_norm": 1.390625, "learning_rate": 0.0004748423779272024, "loss": 5.8123, "mean_token_accuracy": 0.16109999790787696, "num_tokens": 31380068.0, "step": 16050 }, { "entropy": 6.122638463973999, "epoch": 1.6048882890988154, "grad_norm": 1.21875, "learning_rate": 0.00047482597700074204, "loss": 5.8566, "mean_token_accuracy": 0.1613924875855446, "num_tokens": 31389151.0, "step": 16055 }, { "entropy": 6.17003288269043, "epoch": 1.6053881141600441, "grad_norm": 1.4921875, "learning_rate": 0.00047480957104671157, "loss": 5.9916, "mean_token_accuracy": 0.14955553263425828, "num_tokens": 31400260.0, "step": 16060 }, { "entropy": 6.2190080165863035, "epoch": 1.6058879392212726, "grad_norm": 1.3359375, "learning_rate": 0.0004747931600655237, "loss": 5.8873, "mean_token_accuracy": 0.15634534806013106, "num_tokens": 31410747.0, "step": 16065 }, { "entropy": 6.116169738769531, "epoch": 1.606387764282501, "grad_norm": 1.2578125, "learning_rate": 0.00047477674405759136, "loss": 5.8103, "mean_token_accuracy": 0.1668058693408966, "num_tokens": 31419230.0, "step": 16070 }, { "entropy": 6.0804932594299315, "epoch": 1.6068875893437298, "grad_norm": 1.3671875, "learning_rate": 0.0004747603230233275, "loss": 5.7983, "mean_token_accuracy": 0.16895988285541536, "num_tokens": 31428314.0, "step": 16075 }, { "entropy": 6.006974172592163, "epoch": 1.6073874144049582, "grad_norm": 1.7890625, "learning_rate": 0.0004747438969631453, "loss": 5.7879, "mean_token_accuracy": 0.1638770133256912, "num_tokens": 31438141.0, "step": 16080 }, { "entropy": 6.0893206119537355, "epoch": 1.6078872394661867, "grad_norm": 1.5546875, "learning_rate": 0.0004747274658774581, "loss": 5.8444, "mean_token_accuracy": 0.1598839282989502, "num_tokens": 31448609.0, "step": 16085 }, { "entropy": 6.156227111816406, "epoch": 1.6083870645274154, "grad_norm": 1.265625, "learning_rate": 0.0004747110297666793, "loss": 5.8622, "mean_token_accuracy": 0.159651480615139, "num_tokens": 31458603.0, "step": 16090 }, { "entropy": 6.104046201705932, "epoch": 1.6088868895886441, "grad_norm": 1.203125, "learning_rate": 0.0004746945886312223, "loss": 5.7595, "mean_token_accuracy": 0.17387848496437072, "num_tokens": 31468917.0, "step": 16095 }, { "entropy": 6.064031267166138, "epoch": 1.6093867146498726, "grad_norm": 1.234375, "learning_rate": 0.0004746781424715009, "loss": 5.8692, "mean_token_accuracy": 0.15919560045003892, "num_tokens": 31479061.0, "step": 16100 }, { "entropy": 6.134131193161011, "epoch": 1.609886539711101, "grad_norm": 1.21875, "learning_rate": 0.00047466169128792873, "loss": 5.9379, "mean_token_accuracy": 0.15091839134693147, "num_tokens": 31488723.0, "step": 16105 }, { "entropy": 6.108094692230225, "epoch": 1.6103863647723298, "grad_norm": 1.2734375, "learning_rate": 0.0004746452350809198, "loss": 5.8654, "mean_token_accuracy": 0.16363528221845627, "num_tokens": 31497715.0, "step": 16110 }, { "entropy": 6.101785278320312, "epoch": 1.6108861898335582, "grad_norm": 1.2890625, "learning_rate": 0.00047462877385088815, "loss": 5.8137, "mean_token_accuracy": 0.16396145522594452, "num_tokens": 31507571.0, "step": 16115 }, { "entropy": 6.03979721069336, "epoch": 1.6113860148947867, "grad_norm": 1.296875, "learning_rate": 0.00047461230759824794, "loss": 5.8595, "mean_token_accuracy": 0.16097067594528197, "num_tokens": 31517582.0, "step": 16120 }, { "entropy": 6.1500955581665036, "epoch": 1.6118858399560154, "grad_norm": 1.2734375, "learning_rate": 0.00047459583632341343, "loss": 5.9003, "mean_token_accuracy": 0.16386755257844926, "num_tokens": 31528225.0, "step": 16125 }, { "entropy": 6.1058070182800295, "epoch": 1.6123856650172441, "grad_norm": 1.2890625, "learning_rate": 0.00047457936002679905, "loss": 5.7112, "mean_token_accuracy": 0.1699998989701271, "num_tokens": 31537778.0, "step": 16130 }, { "entropy": 6.040977239608765, "epoch": 1.6128854900784724, "grad_norm": 1.1171875, "learning_rate": 0.00047456287870881924, "loss": 5.8032, "mean_token_accuracy": 0.16930240243673325, "num_tokens": 31548431.0, "step": 16135 }, { "entropy": 6.05656476020813, "epoch": 1.613385315139701, "grad_norm": 1.265625, "learning_rate": 0.0004745463923698888, "loss": 5.7655, "mean_token_accuracy": 0.1716919168829918, "num_tokens": 31557333.0, "step": 16140 }, { "entropy": 6.05495433807373, "epoch": 1.6138851402009298, "grad_norm": 1.28125, "learning_rate": 0.0004745299010104226, "loss": 5.8011, "mean_token_accuracy": 0.1625152423977852, "num_tokens": 31566333.0, "step": 16145 }, { "entropy": 5.978433322906494, "epoch": 1.6143849652621582, "grad_norm": 1.328125, "learning_rate": 0.00047451340463083527, "loss": 5.7504, "mean_token_accuracy": 0.17534879297018052, "num_tokens": 31575971.0, "step": 16150 }, { "entropy": 6.04327359199524, "epoch": 1.6148847903233867, "grad_norm": 1.3359375, "learning_rate": 0.00047449690323154206, "loss": 5.7903, "mean_token_accuracy": 0.17007804214954375, "num_tokens": 31585396.0, "step": 16155 }, { "entropy": 6.105011796951294, "epoch": 1.6153846153846154, "grad_norm": 1.1640625, "learning_rate": 0.00047448039681295814, "loss": 5.865, "mean_token_accuracy": 0.15810033455491065, "num_tokens": 31595800.0, "step": 16160 }, { "entropy": 6.128646326065064, "epoch": 1.6158844404458441, "grad_norm": 1.296875, "learning_rate": 0.00047446388537549867, "loss": 5.8682, "mean_token_accuracy": 0.1624359592795372, "num_tokens": 31604792.0, "step": 16165 }, { "entropy": 6.107560110092163, "epoch": 1.6163842655070724, "grad_norm": 1.2109375, "learning_rate": 0.0004744473689195793, "loss": 5.8754, "mean_token_accuracy": 0.15935287103056908, "num_tokens": 31614952.0, "step": 16170 }, { "entropy": 6.064169597625733, "epoch": 1.616884090568301, "grad_norm": 1.2109375, "learning_rate": 0.0004744308474456154, "loss": 5.803, "mean_token_accuracy": 0.17217198014259338, "num_tokens": 31624635.0, "step": 16175 }, { "entropy": 6.041958904266357, "epoch": 1.6173839156295298, "grad_norm": 1.234375, "learning_rate": 0.0004744143209540227, "loss": 5.7664, "mean_token_accuracy": 0.170831997692585, "num_tokens": 31634710.0, "step": 16180 }, { "entropy": 6.233108758926392, "epoch": 1.6178837406907582, "grad_norm": 1.140625, "learning_rate": 0.0004743977894452169, "loss": 5.9275, "mean_token_accuracy": 0.15390657782554626, "num_tokens": 31644371.0, "step": 16185 }, { "entropy": 6.128524303436279, "epoch": 1.6183835657519867, "grad_norm": 1.171875, "learning_rate": 0.0004743812529196142, "loss": 5.8071, "mean_token_accuracy": 0.16524098366498946, "num_tokens": 31654262.0, "step": 16190 }, { "entropy": 6.1295530796051025, "epoch": 1.6188833908132154, "grad_norm": 1.390625, "learning_rate": 0.0004743647113776304, "loss": 5.8821, "mean_token_accuracy": 0.1575243815779686, "num_tokens": 31663209.0, "step": 16195 }, { "entropy": 6.019235229492187, "epoch": 1.619383215874444, "grad_norm": 1.2421875, "learning_rate": 0.00047434816481968175, "loss": 5.8218, "mean_token_accuracy": 0.16196248382329942, "num_tokens": 31672370.0, "step": 16200 }, { "entropy": 6.1180863857269285, "epoch": 1.6198830409356724, "grad_norm": 1.21875, "learning_rate": 0.00047433161324618456, "loss": 5.8706, "mean_token_accuracy": 0.16636834293603897, "num_tokens": 31681886.0, "step": 16205 }, { "entropy": 6.158323907852173, "epoch": 1.620382865996901, "grad_norm": 1.265625, "learning_rate": 0.0004743150566575553, "loss": 5.8064, "mean_token_accuracy": 0.17043220698833467, "num_tokens": 31691098.0, "step": 16210 }, { "entropy": 6.049533033370972, "epoch": 1.6208826910581298, "grad_norm": 1.3046875, "learning_rate": 0.0004742984950542105, "loss": 5.7884, "mean_token_accuracy": 0.1622710943222046, "num_tokens": 31700638.0, "step": 16215 }, { "entropy": 6.031154680252075, "epoch": 1.6213825161193582, "grad_norm": 1.3515625, "learning_rate": 0.00047428192843656684, "loss": 5.8423, "mean_token_accuracy": 0.1616874635219574, "num_tokens": 31711326.0, "step": 16220 }, { "entropy": 6.0814954280853275, "epoch": 1.6218823411805867, "grad_norm": 1.265625, "learning_rate": 0.00047426535680504105, "loss": 5.7973, "mean_token_accuracy": 0.17051303386688232, "num_tokens": 31721220.0, "step": 16225 }, { "entropy": 6.0870726108551025, "epoch": 1.6223821662418154, "grad_norm": 1.4140625, "learning_rate": 0.00047424878016005036, "loss": 5.8528, "mean_token_accuracy": 0.16325292289257048, "num_tokens": 31731190.0, "step": 16230 }, { "entropy": 6.165756750106811, "epoch": 1.622881991303044, "grad_norm": 1.6796875, "learning_rate": 0.0004742321985020115, "loss": 5.8708, "mean_token_accuracy": 0.1659107655286789, "num_tokens": 31740761.0, "step": 16235 }, { "entropy": 6.115328359603882, "epoch": 1.6233818163642724, "grad_norm": 1.25, "learning_rate": 0.0004742156118313418, "loss": 5.8706, "mean_token_accuracy": 0.16334801465272902, "num_tokens": 31750038.0, "step": 16240 }, { "entropy": 6.146216678619385, "epoch": 1.623881641425501, "grad_norm": 1.140625, "learning_rate": 0.00047419902014845855, "loss": 5.8031, "mean_token_accuracy": 0.16566898673772812, "num_tokens": 31761574.0, "step": 16245 }, { "entropy": 6.0853657722473145, "epoch": 1.6243814664867298, "grad_norm": 1.3203125, "learning_rate": 0.0004741824234537793, "loss": 5.8185, "mean_token_accuracy": 0.16479350328445436, "num_tokens": 31771980.0, "step": 16250 }, { "entropy": 6.070226764678955, "epoch": 1.6248812915479582, "grad_norm": 1.375, "learning_rate": 0.00047416582174772143, "loss": 5.8274, "mean_token_accuracy": 0.16199822574853898, "num_tokens": 31781242.0, "step": 16255 }, { "entropy": 6.202419281005859, "epoch": 1.6253811166091867, "grad_norm": 1.3359375, "learning_rate": 0.00047414921503070276, "loss": 5.9052, "mean_token_accuracy": 0.1622503623366356, "num_tokens": 31792250.0, "step": 16260 }, { "entropy": 6.07946548461914, "epoch": 1.6258809416704154, "grad_norm": 1.2734375, "learning_rate": 0.00047413260330314116, "loss": 5.7727, "mean_token_accuracy": 0.16607222110033035, "num_tokens": 31802512.0, "step": 16265 }, { "entropy": 6.038339757919312, "epoch": 1.626380766731644, "grad_norm": 1.1875, "learning_rate": 0.0004741159865654544, "loss": 5.729, "mean_token_accuracy": 0.17349571436643602, "num_tokens": 31811957.0, "step": 16270 }, { "entropy": 6.101879644393921, "epoch": 1.6268805917928724, "grad_norm": 1.3359375, "learning_rate": 0.00047409936481806076, "loss": 5.8231, "mean_token_accuracy": 0.16853295117616654, "num_tokens": 31821101.0, "step": 16275 }, { "entropy": 6.130295038223267, "epoch": 1.627380416854101, "grad_norm": 1.375, "learning_rate": 0.0004740827380613782, "loss": 5.6867, "mean_token_accuracy": 0.16625203788280488, "num_tokens": 31831085.0, "step": 16280 }, { "entropy": 6.0749116897583, "epoch": 1.6278802419153298, "grad_norm": 1.265625, "learning_rate": 0.00047406610629582526, "loss": 5.8454, "mean_token_accuracy": 0.1650839328765869, "num_tokens": 31840354.0, "step": 16285 }, { "entropy": 6.010754680633545, "epoch": 1.6283800669765582, "grad_norm": 1.34375, "learning_rate": 0.00047404946952182034, "loss": 5.7837, "mean_token_accuracy": 0.16882811039686202, "num_tokens": 31849250.0, "step": 16290 }, { "entropy": 6.10916166305542, "epoch": 1.6288798920377867, "grad_norm": 1.3125, "learning_rate": 0.0004740328277397819, "loss": 5.8323, "mean_token_accuracy": 0.16149095296859742, "num_tokens": 31859533.0, "step": 16295 }, { "entropy": 6.193563222885132, "epoch": 1.6293797170990154, "grad_norm": 1.265625, "learning_rate": 0.0004740161809501288, "loss": 5.9022, "mean_token_accuracy": 0.15910781174898148, "num_tokens": 31868821.0, "step": 16300 }, { "entropy": 6.138738107681275, "epoch": 1.6298795421602439, "grad_norm": 1.1328125, "learning_rate": 0.00047399952915327975, "loss": 5.8308, "mean_token_accuracy": 0.15946413725614547, "num_tokens": 31878084.0, "step": 16305 }, { "entropy": 6.075612592697143, "epoch": 1.6303793672214724, "grad_norm": 1.21875, "learning_rate": 0.0004739828723496538, "loss": 5.7909, "mean_token_accuracy": 0.16261777132749558, "num_tokens": 31887634.0, "step": 16310 }, { "entropy": 6.019099235534668, "epoch": 1.630879192282701, "grad_norm": 1.25, "learning_rate": 0.00047396621053967, "loss": 5.7929, "mean_token_accuracy": 0.17053304314613343, "num_tokens": 31897871.0, "step": 16315 }, { "entropy": 6.119353866577148, "epoch": 1.6313790173439298, "grad_norm": 1.1953125, "learning_rate": 0.00047394954372374743, "loss": 5.8632, "mean_token_accuracy": 0.16035366654396058, "num_tokens": 31907960.0, "step": 16320 }, { "entropy": 6.119000482559204, "epoch": 1.6318788424051582, "grad_norm": 1.125, "learning_rate": 0.00047393287190230566, "loss": 5.8288, "mean_token_accuracy": 0.15797059535980223, "num_tokens": 31918550.0, "step": 16325 }, { "entropy": 6.154240369796753, "epoch": 1.6323786674663867, "grad_norm": 1.3046875, "learning_rate": 0.0004739161950757639, "loss": 5.9393, "mean_token_accuracy": 0.16078022569417955, "num_tokens": 31927941.0, "step": 16330 }, { "entropy": 6.169876337051392, "epoch": 1.6328784925276154, "grad_norm": 1.1796875, "learning_rate": 0.000473899513244542, "loss": 5.8912, "mean_token_accuracy": 0.16059373915195466, "num_tokens": 31938179.0, "step": 16335 }, { "entropy": 6.069890689849854, "epoch": 1.6333783175888439, "grad_norm": 1.2890625, "learning_rate": 0.0004738828264090594, "loss": 5.7495, "mean_token_accuracy": 0.1718252718448639, "num_tokens": 31947287.0, "step": 16340 }, { "entropy": 5.9992509365081785, "epoch": 1.6338781426500724, "grad_norm": 1.2421875, "learning_rate": 0.00047386613456973614, "loss": 5.7659, "mean_token_accuracy": 0.17057114690542222, "num_tokens": 31955953.0, "step": 16345 }, { "entropy": 6.052100753784179, "epoch": 1.634377967711301, "grad_norm": 2.359375, "learning_rate": 0.0004738494377269921, "loss": 5.8007, "mean_token_accuracy": 0.16357877850532532, "num_tokens": 31964874.0, "step": 16350 }, { "entropy": 6.133013296127319, "epoch": 1.6348777927725298, "grad_norm": 1.25, "learning_rate": 0.00047383273588124736, "loss": 5.8876, "mean_token_accuracy": 0.1596738412976265, "num_tokens": 31975865.0, "step": 16355 }, { "entropy": 6.079090547561646, "epoch": 1.6353776178337582, "grad_norm": 1.2734375, "learning_rate": 0.0004738160290329222, "loss": 5.7837, "mean_token_accuracy": 0.16713957935571672, "num_tokens": 31985229.0, "step": 16360 }, { "entropy": 6.038175058364868, "epoch": 1.6358774428949867, "grad_norm": 1.09375, "learning_rate": 0.00047379931718243684, "loss": 5.8908, "mean_token_accuracy": 0.16973757445812226, "num_tokens": 31995195.0, "step": 16365 }, { "entropy": 6.130444717407227, "epoch": 1.6363772679562154, "grad_norm": 1.203125, "learning_rate": 0.0004737826003302118, "loss": 5.8555, "mean_token_accuracy": 0.16212511360645293, "num_tokens": 32006053.0, "step": 16370 }, { "entropy": 6.15709753036499, "epoch": 1.6368770930174439, "grad_norm": 1.203125, "learning_rate": 0.00047376587847666767, "loss": 5.8842, "mean_token_accuracy": 0.15770581513643264, "num_tokens": 32015025.0, "step": 16375 }, { "entropy": 6.025450086593628, "epoch": 1.6373769180786724, "grad_norm": 1.4140625, "learning_rate": 0.0004737491516222253, "loss": 5.7522, "mean_token_accuracy": 0.1685287207365036, "num_tokens": 32025116.0, "step": 16380 }, { "entropy": 6.083757925033569, "epoch": 1.637876743139901, "grad_norm": 1.46875, "learning_rate": 0.00047373241976730537, "loss": 5.8145, "mean_token_accuracy": 0.16748420745134354, "num_tokens": 32034271.0, "step": 16385 }, { "entropy": 6.079638719558716, "epoch": 1.6383765682011298, "grad_norm": 1.328125, "learning_rate": 0.0004737156829123289, "loss": 5.7117, "mean_token_accuracy": 0.18040030896663667, "num_tokens": 32043139.0, "step": 16390 }, { "entropy": 6.068140888214112, "epoch": 1.638876393262358, "grad_norm": 1.296875, "learning_rate": 0.00047369894105771693, "loss": 5.7701, "mean_token_accuracy": 0.1635582000017166, "num_tokens": 32052719.0, "step": 16395 }, { "entropy": 6.14244122505188, "epoch": 1.6393762183235867, "grad_norm": 1.2578125, "learning_rate": 0.00047368219420389077, "loss": 5.8776, "mean_token_accuracy": 0.15964355021715165, "num_tokens": 32062430.0, "step": 16400 }, { "entropy": 6.086572074890137, "epoch": 1.6398760433848154, "grad_norm": 1.3359375, "learning_rate": 0.0004736654423512717, "loss": 5.7858, "mean_token_accuracy": 0.16606002449989318, "num_tokens": 32072396.0, "step": 16405 }, { "entropy": 6.102981662750244, "epoch": 1.6403758684460439, "grad_norm": 1.3046875, "learning_rate": 0.0004736486855002813, "loss": 5.8699, "mean_token_accuracy": 0.15601673871278762, "num_tokens": 32082200.0, "step": 16410 }, { "entropy": 6.092888641357422, "epoch": 1.6408756935072724, "grad_norm": 1.2890625, "learning_rate": 0.000473631923651341, "loss": 5.7761, "mean_token_accuracy": 0.17181171476840973, "num_tokens": 32091670.0, "step": 16415 }, { "entropy": 6.11961088180542, "epoch": 1.641375518568501, "grad_norm": 1.2265625, "learning_rate": 0.0004736151568048726, "loss": 5.9227, "mean_token_accuracy": 0.15400823205709457, "num_tokens": 32102072.0, "step": 16420 }, { "entropy": 6.060141372680664, "epoch": 1.6418753436297298, "grad_norm": 1.2734375, "learning_rate": 0.000473598384961298, "loss": 5.7312, "mean_token_accuracy": 0.16847492307424544, "num_tokens": 32111367.0, "step": 16425 }, { "entropy": 6.131742811203003, "epoch": 1.642375168690958, "grad_norm": 1.796875, "learning_rate": 0.00047358160812103925, "loss": 5.7966, "mean_token_accuracy": 0.16571346223354338, "num_tokens": 32121065.0, "step": 16430 }, { "entropy": 6.147887897491455, "epoch": 1.6428749937521867, "grad_norm": 1.2890625, "learning_rate": 0.0004735648262845182, "loss": 5.8319, "mean_token_accuracy": 0.1572011500597, "num_tokens": 32130142.0, "step": 16435 }, { "entropy": 6.124507904052734, "epoch": 1.6433748188134154, "grad_norm": 1.234375, "learning_rate": 0.00047354803945215727, "loss": 5.9434, "mean_token_accuracy": 0.16040437892079354, "num_tokens": 32140689.0, "step": 16440 }, { "entropy": 6.05601921081543, "epoch": 1.6438746438746439, "grad_norm": 1.3359375, "learning_rate": 0.00047353124762437865, "loss": 5.7124, "mean_token_accuracy": 0.1761801838874817, "num_tokens": 32150888.0, "step": 16445 }, { "entropy": 6.1184571266174315, "epoch": 1.6443744689358724, "grad_norm": 1.421875, "learning_rate": 0.0004735144508016051, "loss": 5.9402, "mean_token_accuracy": 0.1562290295958519, "num_tokens": 32161188.0, "step": 16450 }, { "entropy": 6.075448417663575, "epoch": 1.644874293997101, "grad_norm": 1.3203125, "learning_rate": 0.0004734976489842589, "loss": 5.8078, "mean_token_accuracy": 0.1667831540107727, "num_tokens": 32171684.0, "step": 16455 }, { "entropy": 6.130577850341797, "epoch": 1.6453741190583295, "grad_norm": 1.578125, "learning_rate": 0.000473480842172763, "loss": 5.8897, "mean_token_accuracy": 0.15875401496887206, "num_tokens": 32181497.0, "step": 16460 }, { "entropy": 6.125845527648925, "epoch": 1.645873944119558, "grad_norm": 1.25, "learning_rate": 0.00047346403036754023, "loss": 5.7575, "mean_token_accuracy": 0.16723476499319076, "num_tokens": 32190653.0, "step": 16465 }, { "entropy": 6.089094638824463, "epoch": 1.6463737691807867, "grad_norm": 1.3359375, "learning_rate": 0.00047344721356901344, "loss": 5.8546, "mean_token_accuracy": 0.16362821757793428, "num_tokens": 32200367.0, "step": 16470 }, { "entropy": 6.094277286529541, "epoch": 1.6468735942420154, "grad_norm": 1.1796875, "learning_rate": 0.0004734303917776059, "loss": 5.9003, "mean_token_accuracy": 0.15828943699598313, "num_tokens": 32210187.0, "step": 16475 }, { "entropy": 6.172597503662109, "epoch": 1.6473734193032439, "grad_norm": 1.3984375, "learning_rate": 0.00047341356499374065, "loss": 5.802, "mean_token_accuracy": 0.16504286378622054, "num_tokens": 32218754.0, "step": 16480 }, { "entropy": 6.107746171951294, "epoch": 1.6478732443644724, "grad_norm": 1.3671875, "learning_rate": 0.0004733967332178412, "loss": 5.8169, "mean_token_accuracy": 0.1639198824763298, "num_tokens": 32228105.0, "step": 16485 }, { "entropy": 6.112506961822509, "epoch": 1.648373069425701, "grad_norm": 1.203125, "learning_rate": 0.0004733798964503311, "loss": 5.8623, "mean_token_accuracy": 0.16502905786037445, "num_tokens": 32239303.0, "step": 16490 }, { "entropy": 6.032963657379151, "epoch": 1.6488728944869295, "grad_norm": 1.3671875, "learning_rate": 0.0004733630546916338, "loss": 5.7112, "mean_token_accuracy": 0.17206179052591325, "num_tokens": 32248614.0, "step": 16495 }, { "entropy": 6.08461709022522, "epoch": 1.649372719548158, "grad_norm": 1.3203125, "learning_rate": 0.00047334620794217306, "loss": 5.87, "mean_token_accuracy": 0.16419921219348907, "num_tokens": 32257012.0, "step": 16500 }, { "entropy": 6.111689567565918, "epoch": 1.6498725446093867, "grad_norm": 1.203125, "learning_rate": 0.0004733293562023727, "loss": 5.7954, "mean_token_accuracy": 0.16484722197055818, "num_tokens": 32267990.0, "step": 16505 }, { "entropy": 6.118923711776733, "epoch": 1.6503723696706154, "grad_norm": 1.2734375, "learning_rate": 0.00047331249947265685, "loss": 5.7684, "mean_token_accuracy": 0.16947761923074722, "num_tokens": 32277519.0, "step": 16510 }, { "entropy": 6.054642391204834, "epoch": 1.6508721947318439, "grad_norm": 1.28125, "learning_rate": 0.0004732956377534496, "loss": 5.7913, "mean_token_accuracy": 0.16124063730239868, "num_tokens": 32286749.0, "step": 16515 }, { "entropy": 6.148294067382812, "epoch": 1.6513720197930724, "grad_norm": 1.2265625, "learning_rate": 0.000473278771045175, "loss": 5.9654, "mean_token_accuracy": 0.15079726427793502, "num_tokens": 32296344.0, "step": 16520 }, { "entropy": 6.158928918838501, "epoch": 1.651871844854301, "grad_norm": 1.2890625, "learning_rate": 0.00047326189934825764, "loss": 5.7998, "mean_token_accuracy": 0.16486818790435792, "num_tokens": 32305857.0, "step": 16525 }, { "entropy": 6.082451868057251, "epoch": 1.6523716699155295, "grad_norm": 1.5546875, "learning_rate": 0.0004732450226631219, "loss": 5.8132, "mean_token_accuracy": 0.1678343653678894, "num_tokens": 32315265.0, "step": 16530 }, { "entropy": 6.2120177268981935, "epoch": 1.652871494976758, "grad_norm": 1.203125, "learning_rate": 0.00047322814099019236, "loss": 5.9519, "mean_token_accuracy": 0.15277455300092696, "num_tokens": 32324724.0, "step": 16535 }, { "entropy": 6.134037351608276, "epoch": 1.6533713200379867, "grad_norm": 1.328125, "learning_rate": 0.0004732112543298938, "loss": 5.8358, "mean_token_accuracy": 0.16458573937416077, "num_tokens": 32334958.0, "step": 16540 }, { "entropy": 6.098423910140991, "epoch": 1.6538711450992154, "grad_norm": 1.640625, "learning_rate": 0.0004731943626826511, "loss": 5.9167, "mean_token_accuracy": 0.1607313871383667, "num_tokens": 32345153.0, "step": 16545 }, { "entropy": 6.114382123947143, "epoch": 1.6543709701604439, "grad_norm": 1.4453125, "learning_rate": 0.00047317746604888923, "loss": 5.7889, "mean_token_accuracy": 0.16762964725494384, "num_tokens": 32354692.0, "step": 16550 }, { "entropy": 6.151679182052613, "epoch": 1.6548707952216724, "grad_norm": 1.4140625, "learning_rate": 0.00047316056442903333, "loss": 5.8719, "mean_token_accuracy": 0.15983538776636125, "num_tokens": 32363614.0, "step": 16555 }, { "entropy": 6.182926034927368, "epoch": 1.655370620282901, "grad_norm": 1.5390625, "learning_rate": 0.0004731436578235086, "loss": 5.8349, "mean_token_accuracy": 0.1624493904411793, "num_tokens": 32373139.0, "step": 16560 }, { "entropy": 6.159624338150024, "epoch": 1.6558704453441295, "grad_norm": 1.484375, "learning_rate": 0.00047312674623274046, "loss": 5.8551, "mean_token_accuracy": 0.1513068586587906, "num_tokens": 32383624.0, "step": 16565 }, { "entropy": 6.051584959030151, "epoch": 1.656370270405358, "grad_norm": 1.2421875, "learning_rate": 0.0004731098296571543, "loss": 5.6903, "mean_token_accuracy": 0.16859373450279236, "num_tokens": 32393221.0, "step": 16570 }, { "entropy": 6.115183734893799, "epoch": 1.6568700954665867, "grad_norm": 1.328125, "learning_rate": 0.00047309290809717584, "loss": 5.8881, "mean_token_accuracy": 0.16096863597631456, "num_tokens": 32402908.0, "step": 16575 }, { "entropy": 6.0643336296081545, "epoch": 1.6573699205278154, "grad_norm": 1.15625, "learning_rate": 0.00047307598155323083, "loss": 5.8268, "mean_token_accuracy": 0.15815944820642472, "num_tokens": 32413597.0, "step": 16580 }, { "entropy": 6.12480993270874, "epoch": 1.6578697455890439, "grad_norm": 1.625, "learning_rate": 0.000473059050025745, "loss": 5.8401, "mean_token_accuracy": 0.16443217694759368, "num_tokens": 32423948.0, "step": 16585 }, { "entropy": 6.095758581161499, "epoch": 1.6583695706502724, "grad_norm": 1.34375, "learning_rate": 0.0004730421135151445, "loss": 5.805, "mean_token_accuracy": 0.16168527454137802, "num_tokens": 32433176.0, "step": 16590 }, { "entropy": 6.007092761993408, "epoch": 1.658869395711501, "grad_norm": 1.1953125, "learning_rate": 0.0004730251720218554, "loss": 5.7785, "mean_token_accuracy": 0.16693072766065598, "num_tokens": 32442868.0, "step": 16595 }, { "entropy": 6.0971451759338375, "epoch": 1.6593692207727295, "grad_norm": 1.4375, "learning_rate": 0.00047300822554630393, "loss": 5.8154, "mean_token_accuracy": 0.16690618693828582, "num_tokens": 32451966.0, "step": 16600 }, { "entropy": 6.170837116241455, "epoch": 1.659869045833958, "grad_norm": 1.21875, "learning_rate": 0.0004729912740889164, "loss": 5.8276, "mean_token_accuracy": 0.17084040492773056, "num_tokens": 32462442.0, "step": 16605 }, { "entropy": 6.145010709762573, "epoch": 1.6603688708951867, "grad_norm": 1.2109375, "learning_rate": 0.00047297431765011945, "loss": 5.7589, "mean_token_accuracy": 0.17135907113552093, "num_tokens": 32471709.0, "step": 16610 }, { "entropy": 6.089041137695313, "epoch": 1.6608686959564154, "grad_norm": 1.1875, "learning_rate": 0.00047295735623033953, "loss": 5.8368, "mean_token_accuracy": 0.16932764202356337, "num_tokens": 32482147.0, "step": 16615 }, { "entropy": 6.061543416976929, "epoch": 1.6613685210176439, "grad_norm": 1.171875, "learning_rate": 0.0004729403898300035, "loss": 5.7421, "mean_token_accuracy": 0.1719137504696846, "num_tokens": 32492626.0, "step": 16620 }, { "entropy": 6.079841184616089, "epoch": 1.6618683460788723, "grad_norm": 1.25, "learning_rate": 0.00047292341844953813, "loss": 5.7884, "mean_token_accuracy": 0.17396891117095947, "num_tokens": 32502887.0, "step": 16625 }, { "entropy": 6.1855528354644775, "epoch": 1.662368171140101, "grad_norm": 1.2421875, "learning_rate": 0.0004729064420893706, "loss": 5.8915, "mean_token_accuracy": 0.1603488102555275, "num_tokens": 32512860.0, "step": 16630 }, { "entropy": 6.199327802658081, "epoch": 1.6628679962013295, "grad_norm": 1.5703125, "learning_rate": 0.0004728894607499278, "loss": 5.9473, "mean_token_accuracy": 0.1513063997030258, "num_tokens": 32523103.0, "step": 16635 }, { "entropy": 6.055564737319946, "epoch": 1.663367821262558, "grad_norm": 1.2109375, "learning_rate": 0.0004728724744316371, "loss": 5.7512, "mean_token_accuracy": 0.16596733629703522, "num_tokens": 32532940.0, "step": 16640 }, { "entropy": 6.176367378234863, "epoch": 1.6638676463237867, "grad_norm": 1.4140625, "learning_rate": 0.00047285548313492594, "loss": 5.8776, "mean_token_accuracy": 0.162559212744236, "num_tokens": 32543503.0, "step": 16645 }, { "entropy": 6.143779659271241, "epoch": 1.6643674713850154, "grad_norm": 1.2890625, "learning_rate": 0.0004728384868602217, "loss": 5.7509, "mean_token_accuracy": 0.17365916669368744, "num_tokens": 32552025.0, "step": 16650 }, { "entropy": 6.0741345405578615, "epoch": 1.6648672964462436, "grad_norm": 1.3828125, "learning_rate": 0.000472821485607952, "loss": 5.7635, "mean_token_accuracy": 0.16234611719846725, "num_tokens": 32561262.0, "step": 16655 }, { "entropy": 6.082498216629029, "epoch": 1.6653671215074723, "grad_norm": 1.1796875, "learning_rate": 0.0004728044793785446, "loss": 5.8501, "mean_token_accuracy": 0.16009418666362762, "num_tokens": 32572067.0, "step": 16660 }, { "entropy": 6.176837968826294, "epoch": 1.665866946568701, "grad_norm": 1.40625, "learning_rate": 0.00047278746817242754, "loss": 5.8361, "mean_token_accuracy": 0.17092930376529694, "num_tokens": 32582033.0, "step": 16665 }, { "entropy": 6.129619789123535, "epoch": 1.6663667716299295, "grad_norm": 1.3671875, "learning_rate": 0.0004727704519900286, "loss": 5.821, "mean_token_accuracy": 0.16560350358486176, "num_tokens": 32592338.0, "step": 16670 }, { "entropy": 6.105005979537964, "epoch": 1.666866596691158, "grad_norm": 1.328125, "learning_rate": 0.000472753430831776, "loss": 5.7835, "mean_token_accuracy": 0.16761494502425195, "num_tokens": 32602310.0, "step": 16675 }, { "entropy": 6.198736333847046, "epoch": 1.6673664217523867, "grad_norm": 1.421875, "learning_rate": 0.00047273640469809786, "loss": 5.9063, "mean_token_accuracy": 0.15738597139716148, "num_tokens": 32612632.0, "step": 16680 }, { "entropy": 6.135696268081665, "epoch": 1.6678662468136154, "grad_norm": 1.4375, "learning_rate": 0.0004727193735894227, "loss": 5.801, "mean_token_accuracy": 0.16541199535131454, "num_tokens": 32622455.0, "step": 16685 }, { "entropy": 6.028338527679443, "epoch": 1.6683660718748436, "grad_norm": 1.2890625, "learning_rate": 0.00047270233750617907, "loss": 5.7874, "mean_token_accuracy": 0.16524736434221268, "num_tokens": 32631854.0, "step": 16690 }, { "entropy": 6.0832243919372555, "epoch": 1.6688658969360723, "grad_norm": 1.21875, "learning_rate": 0.00047268529644879545, "loss": 5.8577, "mean_token_accuracy": 0.16892827898263932, "num_tokens": 32641532.0, "step": 16695 }, { "entropy": 6.140908575057983, "epoch": 1.669365721997301, "grad_norm": 1.2890625, "learning_rate": 0.00047266825041770066, "loss": 5.8326, "mean_token_accuracy": 0.1667509511113167, "num_tokens": 32650748.0, "step": 16700 }, { "entropy": 6.127052593231201, "epoch": 1.6698655470585295, "grad_norm": 1.2890625, "learning_rate": 0.0004726511994133235, "loss": 5.8444, "mean_token_accuracy": 0.16549401581287385, "num_tokens": 32660828.0, "step": 16705 }, { "entropy": 6.076432943344116, "epoch": 1.670365372119758, "grad_norm": 1.3359375, "learning_rate": 0.00047263414343609307, "loss": 5.8437, "mean_token_accuracy": 0.1624479979276657, "num_tokens": 32670951.0, "step": 16710 }, { "entropy": 6.120549201965332, "epoch": 1.6708651971809867, "grad_norm": 1.8203125, "learning_rate": 0.00047261708248643846, "loss": 5.8464, "mean_token_accuracy": 0.16010861843824387, "num_tokens": 32680977.0, "step": 16715 }, { "entropy": 6.190199565887451, "epoch": 1.6713650222422152, "grad_norm": 1.2578125, "learning_rate": 0.0004726000165647888, "loss": 5.8372, "mean_token_accuracy": 0.16532304733991623, "num_tokens": 32690004.0, "step": 16720 }, { "entropy": 6.128579092025757, "epoch": 1.6718648473034436, "grad_norm": 1.2265625, "learning_rate": 0.0004725829456715737, "loss": 5.8185, "mean_token_accuracy": 0.16368092298507692, "num_tokens": 32699862.0, "step": 16725 }, { "entropy": 6.052625274658203, "epoch": 1.6723646723646723, "grad_norm": 1.2578125, "learning_rate": 0.0004725658698072225, "loss": 5.7984, "mean_token_accuracy": 0.16279423832893372, "num_tokens": 32708732.0, "step": 16730 }, { "entropy": 6.120071268081665, "epoch": 1.672864497425901, "grad_norm": 1.2109375, "learning_rate": 0.0004725487889721648, "loss": 5.9455, "mean_token_accuracy": 0.1501711994409561, "num_tokens": 32719117.0, "step": 16735 }, { "entropy": 6.128191041946411, "epoch": 1.6733643224871295, "grad_norm": 1.390625, "learning_rate": 0.0004725317031668304, "loss": 5.8025, "mean_token_accuracy": 0.1618262618780136, "num_tokens": 32728357.0, "step": 16740 }, { "entropy": 6.159316539764404, "epoch": 1.673864147548358, "grad_norm": 1.2734375, "learning_rate": 0.00047251461239164916, "loss": 5.8362, "mean_token_accuracy": 0.16226603239774703, "num_tokens": 32738249.0, "step": 16745 }, { "entropy": 6.007031726837158, "epoch": 1.6743639726095867, "grad_norm": 1.203125, "learning_rate": 0.0004724975166470512, "loss": 5.752, "mean_token_accuracy": 0.17386188358068466, "num_tokens": 32747880.0, "step": 16750 }, { "entropy": 6.0817413330078125, "epoch": 1.6748637976708152, "grad_norm": 1.2109375, "learning_rate": 0.0004724804159334665, "loss": 5.769, "mean_token_accuracy": 0.1614336758852005, "num_tokens": 32758215.0, "step": 16755 }, { "entropy": 6.197255706787109, "epoch": 1.6753636227320436, "grad_norm": 1.453125, "learning_rate": 0.0004724633102513253, "loss": 5.9019, "mean_token_accuracy": 0.15056714415550232, "num_tokens": 32767426.0, "step": 16760 }, { "entropy": 6.071948909759522, "epoch": 1.6758634477932723, "grad_norm": 1.6640625, "learning_rate": 0.0004724461996010581, "loss": 5.7827, "mean_token_accuracy": 0.16054512411355973, "num_tokens": 32776507.0, "step": 16765 }, { "entropy": 6.003354883193969, "epoch": 1.676363272854501, "grad_norm": 1.234375, "learning_rate": 0.0004724290839830953, "loss": 5.7898, "mean_token_accuracy": 0.17102356851100922, "num_tokens": 32787386.0, "step": 16770 }, { "entropy": 6.089016151428223, "epoch": 1.6768630979157295, "grad_norm": 1.25, "learning_rate": 0.0004724119633978675, "loss": 5.8269, "mean_token_accuracy": 0.1615647107362747, "num_tokens": 32797245.0, "step": 16775 }, { "entropy": 6.1575757503509525, "epoch": 1.677362922976958, "grad_norm": 1.265625, "learning_rate": 0.00047239483784580554, "loss": 5.8628, "mean_token_accuracy": 0.16592977792024613, "num_tokens": 32807256.0, "step": 16780 }, { "entropy": 6.14875054359436, "epoch": 1.6778627480381867, "grad_norm": 1.265625, "learning_rate": 0.0004723777073273403, "loss": 5.8556, "mean_token_accuracy": 0.16490956842899324, "num_tokens": 32816818.0, "step": 16785 }, { "entropy": 6.059776020050049, "epoch": 1.6783625730994152, "grad_norm": 1.28125, "learning_rate": 0.0004723605718429026, "loss": 5.8898, "mean_token_accuracy": 0.16015442162752153, "num_tokens": 32826275.0, "step": 16790 }, { "entropy": 6.066444969177246, "epoch": 1.6788623981606436, "grad_norm": 1.265625, "learning_rate": 0.0004723434313929238, "loss": 5.8203, "mean_token_accuracy": 0.16815488338470458, "num_tokens": 32836703.0, "step": 16795 }, { "entropy": 6.039139986038208, "epoch": 1.6793622232218723, "grad_norm": 1.25, "learning_rate": 0.00047232628597783507, "loss": 5.738, "mean_token_accuracy": 0.1705315738916397, "num_tokens": 32847745.0, "step": 16800 }, { "entropy": 6.149748468399048, "epoch": 1.679862048283101, "grad_norm": 1.3671875, "learning_rate": 0.00047230913559806773, "loss": 5.8004, "mean_token_accuracy": 0.169490747153759, "num_tokens": 32857123.0, "step": 16805 }, { "entropy": 6.027956295013428, "epoch": 1.6803618733443295, "grad_norm": 1.3203125, "learning_rate": 0.0004722919802540533, "loss": 5.744, "mean_token_accuracy": 0.168426750600338, "num_tokens": 32866337.0, "step": 16810 }, { "entropy": 6.076097917556763, "epoch": 1.680861698405558, "grad_norm": 1.2109375, "learning_rate": 0.0004722748199462234, "loss": 5.8847, "mean_token_accuracy": 0.167574006319046, "num_tokens": 32877525.0, "step": 16815 }, { "entropy": 6.144401693344117, "epoch": 1.6813615234667867, "grad_norm": 2.125, "learning_rate": 0.0004722576546750098, "loss": 5.8454, "mean_token_accuracy": 0.16448385864496232, "num_tokens": 32888165.0, "step": 16820 }, { "entropy": 6.177789354324341, "epoch": 1.6818613485280152, "grad_norm": 1.9296875, "learning_rate": 0.00047224048444084434, "loss": 5.8995, "mean_token_accuracy": 0.1598668083548546, "num_tokens": 32898541.0, "step": 16825 }, { "entropy": 6.044449424743652, "epoch": 1.6823611735892436, "grad_norm": 1.21875, "learning_rate": 0.00047222330924415906, "loss": 5.7062, "mean_token_accuracy": 0.17765017002820968, "num_tokens": 32907796.0, "step": 16830 }, { "entropy": 6.085809135437012, "epoch": 1.6828609986504723, "grad_norm": 1.8125, "learning_rate": 0.0004722061290853862, "loss": 5.7493, "mean_token_accuracy": 0.1701370507478714, "num_tokens": 32917067.0, "step": 16835 }, { "entropy": 6.1288896083831785, "epoch": 1.683360823711701, "grad_norm": 1.390625, "learning_rate": 0.00047218894396495765, "loss": 5.8013, "mean_token_accuracy": 0.17118319720029831, "num_tokens": 32927039.0, "step": 16840 }, { "entropy": 6.09756555557251, "epoch": 1.6838606487729295, "grad_norm": 1.9609375, "learning_rate": 0.0004721717538833061, "loss": 5.8204, "mean_token_accuracy": 0.16473134905099868, "num_tokens": 32937574.0, "step": 16845 }, { "entropy": 6.164473009109497, "epoch": 1.684360473834158, "grad_norm": 1.21875, "learning_rate": 0.000472154558840864, "loss": 5.8837, "mean_token_accuracy": 0.1601118713617325, "num_tokens": 32948401.0, "step": 16850 }, { "entropy": 6.107227993011475, "epoch": 1.6848602988953867, "grad_norm": 1.2265625, "learning_rate": 0.000472137358838064, "loss": 5.7815, "mean_token_accuracy": 0.1681626707315445, "num_tokens": 32957359.0, "step": 16855 }, { "entropy": 6.053154563903808, "epoch": 1.6853601239566152, "grad_norm": 1.4765625, "learning_rate": 0.0004721201538753387, "loss": 5.7155, "mean_token_accuracy": 0.1769217073917389, "num_tokens": 32966340.0, "step": 16860 }, { "entropy": 6.070557594299316, "epoch": 1.6858599490178436, "grad_norm": 1.3671875, "learning_rate": 0.00047210294395312103, "loss": 5.7846, "mean_token_accuracy": 0.1664064809679985, "num_tokens": 32976376.0, "step": 16865 }, { "entropy": 6.070236921310425, "epoch": 1.6863597740790723, "grad_norm": 1.375, "learning_rate": 0.000472085729071844, "loss": 5.7584, "mean_token_accuracy": 0.1732776328921318, "num_tokens": 32985680.0, "step": 16870 }, { "entropy": 6.019136095046997, "epoch": 1.686859599140301, "grad_norm": 1.3203125, "learning_rate": 0.00047206850923194076, "loss": 5.7855, "mean_token_accuracy": 0.17065980285406113, "num_tokens": 32995557.0, "step": 16875 }, { "entropy": 6.122857189178466, "epoch": 1.6873594242015295, "grad_norm": 1.265625, "learning_rate": 0.00047205128443384456, "loss": 5.7808, "mean_token_accuracy": 0.16405878216028214, "num_tokens": 33004655.0, "step": 16880 }, { "entropy": 6.105445384979248, "epoch": 1.687859249262758, "grad_norm": 1.3828125, "learning_rate": 0.0004720340546779887, "loss": 5.8267, "mean_token_accuracy": 0.16379288583993912, "num_tokens": 33014621.0, "step": 16885 }, { "entropy": 6.09962739944458, "epoch": 1.6883590743239867, "grad_norm": 1.203125, "learning_rate": 0.0004720168199648068, "loss": 5.7648, "mean_token_accuracy": 0.17362350672483445, "num_tokens": 33024390.0, "step": 16890 }, { "entropy": 6.108802318572998, "epoch": 1.6888588993852152, "grad_norm": 1.2265625, "learning_rate": 0.00047199958029473237, "loss": 5.918, "mean_token_accuracy": 0.16664462685585021, "num_tokens": 33035351.0, "step": 16895 }, { "entropy": 6.053422307968139, "epoch": 1.6893587244464436, "grad_norm": 1.234375, "learning_rate": 0.00047198233566819915, "loss": 5.6958, "mean_token_accuracy": 0.1765718713402748, "num_tokens": 33044148.0, "step": 16900 }, { "entropy": 6.077435779571533, "epoch": 1.6898585495076723, "grad_norm": 1.2734375, "learning_rate": 0.0004719650860856411, "loss": 5.8235, "mean_token_accuracy": 0.16806502342224122, "num_tokens": 33053772.0, "step": 16905 }, { "entropy": 6.152287483215332, "epoch": 1.690358374568901, "grad_norm": 1.234375, "learning_rate": 0.00047194783154749217, "loss": 5.8031, "mean_token_accuracy": 0.17019152045249938, "num_tokens": 33064422.0, "step": 16910 }, { "entropy": 6.167243528366089, "epoch": 1.6908581996301293, "grad_norm": 1.3203125, "learning_rate": 0.0004719305720541865, "loss": 5.9626, "mean_token_accuracy": 0.15155426114797593, "num_tokens": 33075235.0, "step": 16915 }, { "entropy": 6.083862066268921, "epoch": 1.691358024691358, "grad_norm": 1.359375, "learning_rate": 0.00047191330760615823, "loss": 5.8079, "mean_token_accuracy": 0.16891692876815795, "num_tokens": 33085489.0, "step": 16920 }, { "entropy": 6.070099592208862, "epoch": 1.6918578497525867, "grad_norm": 1.2890625, "learning_rate": 0.00047189603820384186, "loss": 5.8438, "mean_token_accuracy": 0.16291453540325165, "num_tokens": 33094932.0, "step": 16925 }, { "entropy": 6.048491668701172, "epoch": 1.6923576748138152, "grad_norm": 1.2734375, "learning_rate": 0.00047187876384767187, "loss": 5.7728, "mean_token_accuracy": 0.1714451014995575, "num_tokens": 33104224.0, "step": 16930 }, { "entropy": 6.092360401153565, "epoch": 1.6928574998750436, "grad_norm": 1.203125, "learning_rate": 0.00047186148453808274, "loss": 5.798, "mean_token_accuracy": 0.16460594683885574, "num_tokens": 33114039.0, "step": 16935 }, { "entropy": 6.109842920303345, "epoch": 1.6933573249362723, "grad_norm": 1.265625, "learning_rate": 0.0004718442002755094, "loss": 5.832, "mean_token_accuracy": 0.16622547954320907, "num_tokens": 33123274.0, "step": 16940 }, { "entropy": 6.113402414321899, "epoch": 1.693857149997501, "grad_norm": 1.1484375, "learning_rate": 0.0004718269110603866, "loss": 5.839, "mean_token_accuracy": 0.16477811634540557, "num_tokens": 33134259.0, "step": 16945 }, { "entropy": 6.131065893173218, "epoch": 1.6943569750587293, "grad_norm": 1.15625, "learning_rate": 0.00047180961689314937, "loss": 5.7975, "mean_token_accuracy": 0.16725666373968123, "num_tokens": 33144662.0, "step": 16950 }, { "entropy": 6.084068727493286, "epoch": 1.694856800119958, "grad_norm": 1.2890625, "learning_rate": 0.0004717923177742329, "loss": 5.8005, "mean_token_accuracy": 0.16392777413129805, "num_tokens": 33154074.0, "step": 16955 }, { "entropy": 6.058197975158691, "epoch": 1.6953566251811867, "grad_norm": 1.2578125, "learning_rate": 0.00047177501370407223, "loss": 5.7888, "mean_token_accuracy": 0.16668004542589188, "num_tokens": 33163973.0, "step": 16960 }, { "entropy": 6.122508478164673, "epoch": 1.6958564502424152, "grad_norm": 1.2421875, "learning_rate": 0.00047175770468310294, "loss": 5.8824, "mean_token_accuracy": 0.15859579145908356, "num_tokens": 33173607.0, "step": 16965 }, { "entropy": 6.091284894943238, "epoch": 1.6963562753036436, "grad_norm": 1.2109375, "learning_rate": 0.00047174039071176037, "loss": 5.739, "mean_token_accuracy": 0.1705292895436287, "num_tokens": 33183104.0, "step": 16970 }, { "entropy": 6.096176481246948, "epoch": 1.6968561003648723, "grad_norm": 1.2421875, "learning_rate": 0.00047172307179048025, "loss": 5.7554, "mean_token_accuracy": 0.16481644958257674, "num_tokens": 33191066.0, "step": 16975 }, { "entropy": 6.067199325561523, "epoch": 1.697355925426101, "grad_norm": 1.640625, "learning_rate": 0.0004717057479196982, "loss": 5.806, "mean_token_accuracy": 0.16632929742336272, "num_tokens": 33201499.0, "step": 16980 }, { "entropy": 6.027872371673584, "epoch": 1.6978557504873293, "grad_norm": 1.125, "learning_rate": 0.0004716884190998502, "loss": 5.7427, "mean_token_accuracy": 0.1696314424276352, "num_tokens": 33211989.0, "step": 16985 }, { "entropy": 6.147678279876709, "epoch": 1.698355575548558, "grad_norm": 1.359375, "learning_rate": 0.0004716710853313721, "loss": 5.8695, "mean_token_accuracy": 0.1669941633939743, "num_tokens": 33221715.0, "step": 16990 }, { "entropy": 6.126942300796509, "epoch": 1.6988554006097867, "grad_norm": 1.21875, "learning_rate": 0.00047165374661470023, "loss": 5.8463, "mean_token_accuracy": 0.15994910150766373, "num_tokens": 33232812.0, "step": 16995 }, { "entropy": 6.171700191497803, "epoch": 1.6993552256710152, "grad_norm": 1.234375, "learning_rate": 0.00047163640295027064, "loss": 5.7589, "mean_token_accuracy": 0.16988738775253295, "num_tokens": 33242147.0, "step": 17000 }, { "entropy": 6.075820827484131, "epoch": 1.6998550507322436, "grad_norm": 1.25, "learning_rate": 0.00047161905433851974, "loss": 5.7857, "mean_token_accuracy": 0.16917648911476135, "num_tokens": 33251433.0, "step": 17005 }, { "entropy": 6.049834823608398, "epoch": 1.7003548757934723, "grad_norm": 1.125, "learning_rate": 0.00047160170077988403, "loss": 5.7222, "mean_token_accuracy": 0.16617857962846755, "num_tokens": 33261338.0, "step": 17010 }, { "entropy": 6.071846532821655, "epoch": 1.7008547008547008, "grad_norm": 1.1640625, "learning_rate": 0.0004715843422748001, "loss": 5.8493, "mean_token_accuracy": 0.16450188010931016, "num_tokens": 33271312.0, "step": 17015 }, { "entropy": 6.1309826374053955, "epoch": 1.7013545259159293, "grad_norm": 1.21875, "learning_rate": 0.00047156697882370474, "loss": 5.8194, "mean_token_accuracy": 0.16155257672071457, "num_tokens": 33280525.0, "step": 17020 }, { "entropy": 6.080914115905761, "epoch": 1.701854350977158, "grad_norm": 1.53125, "learning_rate": 0.0004715496104270348, "loss": 5.8035, "mean_token_accuracy": 0.17069359570741655, "num_tokens": 33289968.0, "step": 17025 }, { "entropy": 6.017856454849243, "epoch": 1.7023541760383867, "grad_norm": 1.2109375, "learning_rate": 0.0004715322370852272, "loss": 5.8047, "mean_token_accuracy": 0.1706988990306854, "num_tokens": 33299262.0, "step": 17030 }, { "entropy": 6.0879889011383055, "epoch": 1.7028540010996152, "grad_norm": 1.3359375, "learning_rate": 0.00047151485879871907, "loss": 5.812, "mean_token_accuracy": 0.16554296612739564, "num_tokens": 33309433.0, "step": 17035 }, { "entropy": 6.059764623641968, "epoch": 1.7033538261608436, "grad_norm": 1.328125, "learning_rate": 0.00047149747556794763, "loss": 5.7409, "mean_token_accuracy": 0.16620809584856033, "num_tokens": 33318587.0, "step": 17040 }, { "entropy": 6.047638750076294, "epoch": 1.7038536512220723, "grad_norm": 1.265625, "learning_rate": 0.00047148008739335035, "loss": 5.7951, "mean_token_accuracy": 0.16197993457317353, "num_tokens": 33327487.0, "step": 17045 }, { "entropy": 6.10042371749878, "epoch": 1.7043534762833008, "grad_norm": 1.4140625, "learning_rate": 0.0004714626942753646, "loss": 5.8804, "mean_token_accuracy": 0.1574838176369667, "num_tokens": 33337151.0, "step": 17050 }, { "entropy": 6.182776737213135, "epoch": 1.7048533013445293, "grad_norm": 1.2578125, "learning_rate": 0.000471445296214428, "loss": 5.7532, "mean_token_accuracy": 0.1659430220723152, "num_tokens": 33346547.0, "step": 17055 }, { "entropy": 6.05530195236206, "epoch": 1.705353126405758, "grad_norm": 1.1796875, "learning_rate": 0.00047142789321097834, "loss": 5.7753, "mean_token_accuracy": 0.16415545344352722, "num_tokens": 33355277.0, "step": 17060 }, { "entropy": 6.0681627750396725, "epoch": 1.7058529514669867, "grad_norm": 1.296875, "learning_rate": 0.0004714104852654534, "loss": 5.7484, "mean_token_accuracy": 0.1717139959335327, "num_tokens": 33364340.0, "step": 17065 }, { "entropy": 6.117710971832276, "epoch": 1.7063527765282152, "grad_norm": 1.484375, "learning_rate": 0.0004713930723782912, "loss": 5.7856, "mean_token_accuracy": 0.1688816323876381, "num_tokens": 33374302.0, "step": 17070 }, { "entropy": 6.074854707717895, "epoch": 1.7068526015894436, "grad_norm": 1.34375, "learning_rate": 0.00047137565454992983, "loss": 5.8634, "mean_token_accuracy": 0.16269135922193528, "num_tokens": 33384098.0, "step": 17075 }, { "entropy": 6.051084852218628, "epoch": 1.7073524266506723, "grad_norm": 1.1796875, "learning_rate": 0.00047135823178080745, "loss": 5.7422, "mean_token_accuracy": 0.16914181411266327, "num_tokens": 33393032.0, "step": 17080 }, { "entropy": 5.997193670272827, "epoch": 1.7078522517119008, "grad_norm": 1.2265625, "learning_rate": 0.0004713408040713626, "loss": 5.7375, "mean_token_accuracy": 0.16791051626205444, "num_tokens": 33402533.0, "step": 17085 }, { "entropy": 6.049596071243286, "epoch": 1.7083520767731293, "grad_norm": 1.171875, "learning_rate": 0.00047132337142203365, "loss": 5.8346, "mean_token_accuracy": 0.16434696763753892, "num_tokens": 33412826.0, "step": 17090 }, { "entropy": 6.127618503570557, "epoch": 1.708851901834358, "grad_norm": 1.2109375, "learning_rate": 0.0004713059338332591, "loss": 5.8077, "mean_token_accuracy": 0.16659756898880004, "num_tokens": 33422485.0, "step": 17095 }, { "entropy": 6.10188570022583, "epoch": 1.7093517268955867, "grad_norm": 1.1953125, "learning_rate": 0.00047128849130547774, "loss": 5.6968, "mean_token_accuracy": 0.17069557309150696, "num_tokens": 33432575.0, "step": 17100 }, { "entropy": 6.041983032226563, "epoch": 1.7098515519568152, "grad_norm": 1.59375, "learning_rate": 0.00047127104383912856, "loss": 5.8235, "mean_token_accuracy": 0.16690985560417176, "num_tokens": 33442893.0, "step": 17105 }, { "entropy": 6.048993539810181, "epoch": 1.7103513770180436, "grad_norm": 1.296875, "learning_rate": 0.0004712535914346504, "loss": 5.8862, "mean_token_accuracy": 0.16201318055391312, "num_tokens": 33452080.0, "step": 17110 }, { "entropy": 6.079095411300659, "epoch": 1.7108512020792723, "grad_norm": 1.2578125, "learning_rate": 0.00047123613409248233, "loss": 5.7377, "mean_token_accuracy": 0.16574988067150115, "num_tokens": 33461721.0, "step": 17115 }, { "entropy": 6.179989290237427, "epoch": 1.7113510271405008, "grad_norm": 1.2734375, "learning_rate": 0.00047121867181306365, "loss": 5.8546, "mean_token_accuracy": 0.15359147489070893, "num_tokens": 33470731.0, "step": 17120 }, { "entropy": 6.10111403465271, "epoch": 1.7118508522017293, "grad_norm": 1.2578125, "learning_rate": 0.0004712012045968337, "loss": 5.8246, "mean_token_accuracy": 0.16825323402881623, "num_tokens": 33481000.0, "step": 17125 }, { "entropy": 6.023765420913696, "epoch": 1.712350677262958, "grad_norm": 1.3203125, "learning_rate": 0.00047118373244423197, "loss": 5.803, "mean_token_accuracy": 0.1672479271888733, "num_tokens": 33489535.0, "step": 17130 }, { "entropy": 6.099935293197632, "epoch": 1.7128505023241867, "grad_norm": 1.328125, "learning_rate": 0.00047116625535569787, "loss": 5.7475, "mean_token_accuracy": 0.16362534165382386, "num_tokens": 33499746.0, "step": 17135 }, { "entropy": 6.135937976837158, "epoch": 1.7133503273854152, "grad_norm": 1.546875, "learning_rate": 0.00047114877333167133, "loss": 5.7979, "mean_token_accuracy": 0.17299656420946122, "num_tokens": 33508526.0, "step": 17140 }, { "entropy": 6.1000889301300045, "epoch": 1.7138501524466436, "grad_norm": 1.453125, "learning_rate": 0.00047113128637259216, "loss": 5.7867, "mean_token_accuracy": 0.16638194173574447, "num_tokens": 33518675.0, "step": 17145 }, { "entropy": 6.118789005279541, "epoch": 1.7143499775078723, "grad_norm": 1.265625, "learning_rate": 0.0004711137944789003, "loss": 5.8749, "mean_token_accuracy": 0.1637983128428459, "num_tokens": 33528132.0, "step": 17150 }, { "entropy": 6.059586048126221, "epoch": 1.7148498025691008, "grad_norm": 1.2578125, "learning_rate": 0.00047109629765103577, "loss": 5.7609, "mean_token_accuracy": 0.1721641793847084, "num_tokens": 33537259.0, "step": 17155 }, { "entropy": 5.99711127281189, "epoch": 1.7153496276303293, "grad_norm": 1.2734375, "learning_rate": 0.00047107879588943887, "loss": 5.7641, "mean_token_accuracy": 0.17076666802167892, "num_tokens": 33546189.0, "step": 17160 }, { "entropy": 6.14252724647522, "epoch": 1.715849452691558, "grad_norm": 1.2109375, "learning_rate": 0.00047106128919455, "loss": 5.8826, "mean_token_accuracy": 0.15790692418813707, "num_tokens": 33555392.0, "step": 17165 }, { "entropy": 6.164712142944336, "epoch": 1.7163492777527867, "grad_norm": 1.703125, "learning_rate": 0.0004710437775668094, "loss": 5.8828, "mean_token_accuracy": 0.1638158604502678, "num_tokens": 33564766.0, "step": 17170 }, { "entropy": 6.089115571975708, "epoch": 1.7168491028140151, "grad_norm": 1.2890625, "learning_rate": 0.0004710262610066579, "loss": 5.879, "mean_token_accuracy": 0.16215286105871202, "num_tokens": 33574680.0, "step": 17175 }, { "entropy": 6.128041410446167, "epoch": 1.7173489278752436, "grad_norm": 1.25, "learning_rate": 0.00047100873951453617, "loss": 5.809, "mean_token_accuracy": 0.16774974912405013, "num_tokens": 33583068.0, "step": 17180 }, { "entropy": 6.102362394332886, "epoch": 1.7178487529364723, "grad_norm": 1.4453125, "learning_rate": 0.00047099121309088487, "loss": 5.805, "mean_token_accuracy": 0.1657631665468216, "num_tokens": 33592838.0, "step": 17185 }, { "entropy": 6.097935724258423, "epoch": 1.7183485779977008, "grad_norm": 1.34375, "learning_rate": 0.00047097368173614515, "loss": 5.8124, "mean_token_accuracy": 0.1675238326191902, "num_tokens": 33603627.0, "step": 17190 }, { "entropy": 6.06316442489624, "epoch": 1.7188484030589293, "grad_norm": 1.2109375, "learning_rate": 0.00047095614545075807, "loss": 5.8475, "mean_token_accuracy": 0.16252281665802001, "num_tokens": 33614604.0, "step": 17195 }, { "entropy": 6.076611614227295, "epoch": 1.719348228120158, "grad_norm": 1.1796875, "learning_rate": 0.0004709386042351647, "loss": 5.7443, "mean_token_accuracy": 0.1678536355495453, "num_tokens": 33624604.0, "step": 17200 }, { "entropy": 6.209040832519531, "epoch": 1.7198480531813867, "grad_norm": 1.3203125, "learning_rate": 0.0004709210580898065, "loss": 5.8582, "mean_token_accuracy": 0.15945647582411765, "num_tokens": 33634842.0, "step": 17205 }, { "entropy": 6.187971305847168, "epoch": 1.720347878242615, "grad_norm": 1.2734375, "learning_rate": 0.0004709035070151249, "loss": 5.8775, "mean_token_accuracy": 0.15866751596331596, "num_tokens": 33644829.0, "step": 17210 }, { "entropy": 6.138267183303833, "epoch": 1.7208477033038436, "grad_norm": 1.375, "learning_rate": 0.0004708859510115614, "loss": 5.9231, "mean_token_accuracy": 0.15832079946994781, "num_tokens": 33653952.0, "step": 17215 }, { "entropy": 6.106216812133789, "epoch": 1.7213475283650723, "grad_norm": 2.109375, "learning_rate": 0.0004708683900795579, "loss": 5.926, "mean_token_accuracy": 0.16010939031839372, "num_tokens": 33664014.0, "step": 17220 }, { "entropy": 6.128833389282226, "epoch": 1.7218473534263008, "grad_norm": 1.15625, "learning_rate": 0.00047085082421955603, "loss": 5.7987, "mean_token_accuracy": 0.16811731308698655, "num_tokens": 33674575.0, "step": 17225 }, { "entropy": 6.087554693222046, "epoch": 1.7223471784875293, "grad_norm": 1.2421875, "learning_rate": 0.00047083325343199786, "loss": 5.8394, "mean_token_accuracy": 0.16705252528190612, "num_tokens": 33684431.0, "step": 17230 }, { "entropy": 6.155085802078247, "epoch": 1.722847003548758, "grad_norm": 1.421875, "learning_rate": 0.0004708156777173254, "loss": 5.8851, "mean_token_accuracy": 0.15852571576833724, "num_tokens": 33693502.0, "step": 17235 }, { "entropy": 6.081858777999878, "epoch": 1.7233468286099867, "grad_norm": 1.265625, "learning_rate": 0.0004707980970759809, "loss": 5.8556, "mean_token_accuracy": 0.1609411358833313, "num_tokens": 33703034.0, "step": 17240 }, { "entropy": 6.094609165191651, "epoch": 1.723846653671215, "grad_norm": 1.28125, "learning_rate": 0.00047078051150840666, "loss": 5.8141, "mean_token_accuracy": 0.16953291669487952, "num_tokens": 33712429.0, "step": 17245 }, { "entropy": 6.093194818496704, "epoch": 1.7243464787324436, "grad_norm": 1.3671875, "learning_rate": 0.0004707629210150451, "loss": 5.8713, "mean_token_accuracy": 0.16456263065338134, "num_tokens": 33724254.0, "step": 17250 }, { "entropy": 5.949827098846436, "epoch": 1.7248463037936723, "grad_norm": 1.65625, "learning_rate": 0.0004707453255963388, "loss": 5.5892, "mean_token_accuracy": 0.1814504086971283, "num_tokens": 33735706.0, "step": 17255 }, { "entropy": 6.118174266815186, "epoch": 1.7253461288549008, "grad_norm": 1.2578125, "learning_rate": 0.00047072772525273053, "loss": 5.8351, "mean_token_accuracy": 0.16584513038396836, "num_tokens": 33745683.0, "step": 17260 }, { "entropy": 6.1469803810119625, "epoch": 1.7258459539161293, "grad_norm": 1.3203125, "learning_rate": 0.00047071011998466304, "loss": 5.8531, "mean_token_accuracy": 0.15809971541166307, "num_tokens": 33756776.0, "step": 17265 }, { "entropy": 6.142675971984863, "epoch": 1.726345778977358, "grad_norm": 1.25, "learning_rate": 0.00047069250979257934, "loss": 5.741, "mean_token_accuracy": 0.1699790582060814, "num_tokens": 33766004.0, "step": 17270 }, { "entropy": 6.140097332000733, "epoch": 1.7268456040385864, "grad_norm": 1.375, "learning_rate": 0.00047067489467692236, "loss": 5.9064, "mean_token_accuracy": 0.15822670310735704, "num_tokens": 33774709.0, "step": 17275 }, { "entropy": 6.192679452896118, "epoch": 1.727345429099815, "grad_norm": 1.2265625, "learning_rate": 0.0004706572746381354, "loss": 5.8593, "mean_token_accuracy": 0.1668548360466957, "num_tokens": 33785032.0, "step": 17280 }, { "entropy": 6.110248613357544, "epoch": 1.7278452541610436, "grad_norm": 1.3828125, "learning_rate": 0.00047063964967666177, "loss": 5.7834, "mean_token_accuracy": 0.16075980588793753, "num_tokens": 33795320.0, "step": 17285 }, { "entropy": 6.150143146514893, "epoch": 1.7283450792222723, "grad_norm": 1.265625, "learning_rate": 0.0004706220197929449, "loss": 5.9064, "mean_token_accuracy": 0.16197581589221954, "num_tokens": 33805764.0, "step": 17290 }, { "entropy": 6.121720314025879, "epoch": 1.7288449042835008, "grad_norm": 1.3125, "learning_rate": 0.0004706043849874284, "loss": 5.8775, "mean_token_accuracy": 0.15801021754741668, "num_tokens": 33816045.0, "step": 17295 }, { "entropy": 6.1265195369720455, "epoch": 1.7293447293447293, "grad_norm": 1.296875, "learning_rate": 0.00047058674526055585, "loss": 5.8246, "mean_token_accuracy": 0.16347893178462983, "num_tokens": 33825192.0, "step": 17300 }, { "entropy": 6.10821213722229, "epoch": 1.729844554405958, "grad_norm": 1.234375, "learning_rate": 0.00047056910061277115, "loss": 5.8292, "mean_token_accuracy": 0.1663743495941162, "num_tokens": 33835034.0, "step": 17305 }, { "entropy": 6.131993627548217, "epoch": 1.7303443794671864, "grad_norm": 1.1953125, "learning_rate": 0.0004705514510445182, "loss": 5.8692, "mean_token_accuracy": 0.15888613164424897, "num_tokens": 33845225.0, "step": 17310 }, { "entropy": 6.114203786849975, "epoch": 1.730844204528415, "grad_norm": 1.3984375, "learning_rate": 0.000470533796556241, "loss": 5.829, "mean_token_accuracy": 0.16580835953354836, "num_tokens": 33855303.0, "step": 17315 }, { "entropy": 6.120185613632202, "epoch": 1.7313440295896436, "grad_norm": 1.2890625, "learning_rate": 0.0004705161371483839, "loss": 5.8538, "mean_token_accuracy": 0.16225065439939498, "num_tokens": 33865336.0, "step": 17320 }, { "entropy": 6.173816585540772, "epoch": 1.7318438546508723, "grad_norm": 1.3984375, "learning_rate": 0.00047049847282139095, "loss": 5.8786, "mean_token_accuracy": 0.15986034870147706, "num_tokens": 33875707.0, "step": 17325 }, { "entropy": 6.184801006317139, "epoch": 1.7323436797121008, "grad_norm": 1.2734375, "learning_rate": 0.00047048080357570685, "loss": 5.9423, "mean_token_accuracy": 0.16085763573646544, "num_tokens": 33886649.0, "step": 17330 }, { "entropy": 6.129288959503174, "epoch": 1.7328435047733293, "grad_norm": 1.3125, "learning_rate": 0.000470463129411776, "loss": 5.8659, "mean_token_accuracy": 0.15990834236145018, "num_tokens": 33896815.0, "step": 17335 }, { "entropy": 6.103807210922241, "epoch": 1.733343329834558, "grad_norm": 1.25, "learning_rate": 0.0004704454503300431, "loss": 5.837, "mean_token_accuracy": 0.16209650188684463, "num_tokens": 33907481.0, "step": 17340 }, { "entropy": 6.137941980361939, "epoch": 1.7338431548957864, "grad_norm": 1.5625, "learning_rate": 0.000470427766330953, "loss": 5.8189, "mean_token_accuracy": 0.16745028048753738, "num_tokens": 33917011.0, "step": 17345 }, { "entropy": 5.918174743652344, "epoch": 1.734342979957015, "grad_norm": 1.28125, "learning_rate": 0.0004704100774149506, "loss": 5.649, "mean_token_accuracy": 0.1769773095846176, "num_tokens": 33926528.0, "step": 17350 }, { "entropy": 6.08259596824646, "epoch": 1.7348428050182436, "grad_norm": 1.2890625, "learning_rate": 0.00047039238358248086, "loss": 5.8913, "mean_token_accuracy": 0.1613145127892494, "num_tokens": 33936207.0, "step": 17355 }, { "entropy": 6.063930368423462, "epoch": 1.7353426300794723, "grad_norm": 1.421875, "learning_rate": 0.000470374684833989, "loss": 5.8709, "mean_token_accuracy": 0.1652979999780655, "num_tokens": 33946632.0, "step": 17360 }, { "entropy": 6.165855836868286, "epoch": 1.7358424551407008, "grad_norm": 1.3671875, "learning_rate": 0.0004703569811699205, "loss": 5.87, "mean_token_accuracy": 0.16124885827302932, "num_tokens": 33956469.0, "step": 17365 }, { "entropy": 6.159896421432495, "epoch": 1.7363422802019293, "grad_norm": 1.234375, "learning_rate": 0.00047033927259072046, "loss": 5.8232, "mean_token_accuracy": 0.16769057959318162, "num_tokens": 33965699.0, "step": 17370 }, { "entropy": 6.063975095748901, "epoch": 1.736842105263158, "grad_norm": 1.3046875, "learning_rate": 0.00047032155909683464, "loss": 5.7511, "mean_token_accuracy": 0.16884975731372834, "num_tokens": 33975108.0, "step": 17375 }, { "entropy": 6.140924406051636, "epoch": 1.7373419303243864, "grad_norm": 1.515625, "learning_rate": 0.0004703038406887087, "loss": 5.9143, "mean_token_accuracy": 0.15361512675881386, "num_tokens": 33986321.0, "step": 17380 }, { "entropy": 6.215884828567505, "epoch": 1.737841755385615, "grad_norm": 1.2421875, "learning_rate": 0.00047028611736678837, "loss": 5.902, "mean_token_accuracy": 0.1550668701529503, "num_tokens": 33996038.0, "step": 17385 }, { "entropy": 6.079052972793579, "epoch": 1.7383415804468436, "grad_norm": 1.3203125, "learning_rate": 0.0004702683891315196, "loss": 5.7881, "mean_token_accuracy": 0.1749996766448021, "num_tokens": 34004773.0, "step": 17390 }, { "entropy": 6.098669767379761, "epoch": 1.7388414055080723, "grad_norm": 1.1953125, "learning_rate": 0.00047025065598334834, "loss": 5.8275, "mean_token_accuracy": 0.16623601466417312, "num_tokens": 34014249.0, "step": 17395 }, { "entropy": 6.146162128448486, "epoch": 1.7393412305693008, "grad_norm": 1.15625, "learning_rate": 0.0004702329179227208, "loss": 5.9293, "mean_token_accuracy": 0.15506404191255568, "num_tokens": 34025553.0, "step": 17400 }, { "entropy": 6.120491933822632, "epoch": 1.7398410556305293, "grad_norm": 1.21875, "learning_rate": 0.00047021517495008335, "loss": 5.8472, "mean_token_accuracy": 0.16255650371313096, "num_tokens": 34036536.0, "step": 17405 }, { "entropy": 6.135387849807739, "epoch": 1.740340880691758, "grad_norm": 1.21875, "learning_rate": 0.00047019742706588233, "loss": 5.8566, "mean_token_accuracy": 0.160465969145298, "num_tokens": 34046353.0, "step": 17410 }, { "entropy": 6.155795001983643, "epoch": 1.7408407057529864, "grad_norm": 1.3359375, "learning_rate": 0.0004701796742705642, "loss": 5.7585, "mean_token_accuracy": 0.1741766318678856, "num_tokens": 34056172.0, "step": 17415 }, { "entropy": 6.104709577560425, "epoch": 1.741340530814215, "grad_norm": 1.2734375, "learning_rate": 0.00047016191656457573, "loss": 5.7558, "mean_token_accuracy": 0.16570465713739396, "num_tokens": 34066313.0, "step": 17420 }, { "entropy": 6.090389537811279, "epoch": 1.7418403558754436, "grad_norm": 1.2421875, "learning_rate": 0.00047014415394836374, "loss": 5.7737, "mean_token_accuracy": 0.16618573516607285, "num_tokens": 34075594.0, "step": 17425 }, { "entropy": 6.071141147613526, "epoch": 1.7423401809366723, "grad_norm": 1.2265625, "learning_rate": 0.0004701263864223749, "loss": 5.8024, "mean_token_accuracy": 0.1702573597431183, "num_tokens": 34085619.0, "step": 17430 }, { "entropy": 6.121971178054809, "epoch": 1.7428400059979008, "grad_norm": 1.3203125, "learning_rate": 0.0004701086139870565, "loss": 5.8134, "mean_token_accuracy": 0.1667136251926422, "num_tokens": 34094626.0, "step": 17435 }, { "entropy": 6.129219961166382, "epoch": 1.7433398310591293, "grad_norm": 1.2421875, "learning_rate": 0.0004700908366428556, "loss": 5.7972, "mean_token_accuracy": 0.16450730562210084, "num_tokens": 34104950.0, "step": 17440 }, { "entropy": 6.206182146072388, "epoch": 1.743839656120358, "grad_norm": 1.234375, "learning_rate": 0.0004700730543902194, "loss": 5.9536, "mean_token_accuracy": 0.15412802696228028, "num_tokens": 34114407.0, "step": 17445 }, { "entropy": 6.203389883041382, "epoch": 1.7443394811815864, "grad_norm": 1.2734375, "learning_rate": 0.00047005526722959537, "loss": 5.8689, "mean_token_accuracy": 0.15363965630531312, "num_tokens": 34124842.0, "step": 17450 }, { "entropy": 6.147044563293457, "epoch": 1.744839306242815, "grad_norm": 1.296875, "learning_rate": 0.00047003747516143095, "loss": 5.7374, "mean_token_accuracy": 0.16998422741889954, "num_tokens": 34134265.0, "step": 17455 }, { "entropy": 6.167797803878784, "epoch": 1.7453391313040436, "grad_norm": 1.3671875, "learning_rate": 0.00047001967818617385, "loss": 5.8827, "mean_token_accuracy": 0.15722391605377198, "num_tokens": 34143915.0, "step": 17460 }, { "entropy": 6.110768032073975, "epoch": 1.7458389563652723, "grad_norm": 1.34375, "learning_rate": 0.0004700018763042719, "loss": 5.8518, "mean_token_accuracy": 0.16741512715816498, "num_tokens": 34154869.0, "step": 17465 }, { "entropy": 6.035772609710693, "epoch": 1.7463387814265006, "grad_norm": 1.1640625, "learning_rate": 0.0004699840695161728, "loss": 5.728, "mean_token_accuracy": 0.1715422511100769, "num_tokens": 34164494.0, "step": 17470 }, { "entropy": 6.122415018081665, "epoch": 1.7468386064877293, "grad_norm": 1.296875, "learning_rate": 0.0004699662578223248, "loss": 5.8095, "mean_token_accuracy": 0.16024689227342606, "num_tokens": 34173986.0, "step": 17475 }, { "entropy": 6.200676488876343, "epoch": 1.747338431548958, "grad_norm": 1.3125, "learning_rate": 0.00046994844122317587, "loss": 6.0051, "mean_token_accuracy": 0.15448372662067414, "num_tokens": 34183129.0, "step": 17480 }, { "entropy": 6.051246452331543, "epoch": 1.7478382566101864, "grad_norm": 1.109375, "learning_rate": 0.00046993061971917433, "loss": 5.7499, "mean_token_accuracy": 0.16709147840738298, "num_tokens": 34192559.0, "step": 17485 }, { "entropy": 6.142779779434204, "epoch": 1.748338081671415, "grad_norm": 1.1796875, "learning_rate": 0.00046991279331076865, "loss": 5.8654, "mean_token_accuracy": 0.15936491936445235, "num_tokens": 34202599.0, "step": 17490 }, { "entropy": 6.144532918930054, "epoch": 1.7488379067326436, "grad_norm": 1.203125, "learning_rate": 0.0004698949619984071, "loss": 5.9022, "mean_token_accuracy": 0.1548503190279007, "num_tokens": 34212883.0, "step": 17495 }, { "entropy": 6.110394287109375, "epoch": 1.7493377317938723, "grad_norm": 1.2265625, "learning_rate": 0.0004698771257825385, "loss": 5.8026, "mean_token_accuracy": 0.17068080604076385, "num_tokens": 34222019.0, "step": 17500 }, { "entropy": 6.060295724868775, "epoch": 1.7498375568551006, "grad_norm": 1.2734375, "learning_rate": 0.0004698592846636116, "loss": 5.7364, "mean_token_accuracy": 0.17127123475074768, "num_tokens": 34231817.0, "step": 17505 }, { "entropy": 6.148530435562134, "epoch": 1.7503373819163293, "grad_norm": 1.4140625, "learning_rate": 0.0004698414386420752, "loss": 5.8636, "mean_token_accuracy": 0.15936776995658875, "num_tokens": 34242035.0, "step": 17510 }, { "entropy": 6.110805654525757, "epoch": 1.750837206977558, "grad_norm": 1.2734375, "learning_rate": 0.0004698235877183784, "loss": 5.8102, "mean_token_accuracy": 0.16732075661420823, "num_tokens": 34251728.0, "step": 17515 }, { "entropy": 6.0559672832489015, "epoch": 1.7513370320387864, "grad_norm": 1.828125, "learning_rate": 0.00046980573189297017, "loss": 5.8425, "mean_token_accuracy": 0.1604541838169098, "num_tokens": 34262036.0, "step": 17520 }, { "entropy": 6.1391417503356935, "epoch": 1.751836857100015, "grad_norm": 1.203125, "learning_rate": 0.0004697878711662999, "loss": 5.8544, "mean_token_accuracy": 0.16002709716558455, "num_tokens": 34272335.0, "step": 17525 }, { "entropy": 6.163509321212769, "epoch": 1.7523366821612436, "grad_norm": 1.1796875, "learning_rate": 0.00046977000553881696, "loss": 5.831, "mean_token_accuracy": 0.15586317479610443, "num_tokens": 34282931.0, "step": 17530 }, { "entropy": 6.143906164169311, "epoch": 1.752836507222472, "grad_norm": 1.1796875, "learning_rate": 0.00046975213501097076, "loss": 5.7887, "mean_token_accuracy": 0.17016445100307465, "num_tokens": 34293716.0, "step": 17535 }, { "entropy": 6.161886692047119, "epoch": 1.7533363322837006, "grad_norm": 1.390625, "learning_rate": 0.0004697342595832109, "loss": 5.9131, "mean_token_accuracy": 0.1552520751953125, "num_tokens": 34303411.0, "step": 17540 }, { "entropy": 6.221400785446167, "epoch": 1.7538361573449293, "grad_norm": 1.3671875, "learning_rate": 0.00046971637925598725, "loss": 5.8225, "mean_token_accuracy": 0.1632259339094162, "num_tokens": 34313092.0, "step": 17545 }, { "entropy": 6.123753547668457, "epoch": 1.754335982406158, "grad_norm": 1.203125, "learning_rate": 0.0004696984940297496, "loss": 5.7545, "mean_token_accuracy": 0.16910040527582168, "num_tokens": 34321909.0, "step": 17550 }, { "entropy": 6.154235935211181, "epoch": 1.7548358074673864, "grad_norm": 1.2421875, "learning_rate": 0.000469680603904948, "loss": 5.9011, "mean_token_accuracy": 0.16492167115211487, "num_tokens": 34330213.0, "step": 17555 }, { "entropy": 6.157170152664184, "epoch": 1.755335632528615, "grad_norm": 1.28125, "learning_rate": 0.00046966270888203237, "loss": 5.8303, "mean_token_accuracy": 0.16324958801269532, "num_tokens": 34339731.0, "step": 17560 }, { "entropy": 6.066625118255615, "epoch": 1.7558354575898436, "grad_norm": 1.3515625, "learning_rate": 0.0004696448089614532, "loss": 5.7503, "mean_token_accuracy": 0.16717460006475449, "num_tokens": 34348620.0, "step": 17565 }, { "entropy": 6.0737700939178465, "epoch": 1.756335282651072, "grad_norm": 1.1796875, "learning_rate": 0.0004696269041436606, "loss": 5.7443, "mean_token_accuracy": 0.16805184334516526, "num_tokens": 34358292.0, "step": 17570 }, { "entropy": 6.123239040374756, "epoch": 1.7568351077123006, "grad_norm": 1.25, "learning_rate": 0.0004696089944291052, "loss": 5.8677, "mean_token_accuracy": 0.16359450817108154, "num_tokens": 34367379.0, "step": 17575 }, { "entropy": 6.216329050064087, "epoch": 1.7573349327735293, "grad_norm": 1.25, "learning_rate": 0.0004695910798182377, "loss": 5.8701, "mean_token_accuracy": 0.15662339627742766, "num_tokens": 34376422.0, "step": 17580 }, { "entropy": 6.1055644989013675, "epoch": 1.757834757834758, "grad_norm": 1.1484375, "learning_rate": 0.0004695731603115086, "loss": 5.9132, "mean_token_accuracy": 0.16396692991256714, "num_tokens": 34386509.0, "step": 17585 }, { "entropy": 6.12147479057312, "epoch": 1.7583345828959864, "grad_norm": 1.109375, "learning_rate": 0.00046955523590936884, "loss": 5.9044, "mean_token_accuracy": 0.15868469327688217, "num_tokens": 34396070.0, "step": 17590 }, { "entropy": 6.158386850357056, "epoch": 1.758834407957215, "grad_norm": 1.0703125, "learning_rate": 0.0004695373066122694, "loss": 5.8085, "mean_token_accuracy": 0.16521250903606416, "num_tokens": 34405707.0, "step": 17595 }, { "entropy": 6.11987042427063, "epoch": 1.7593342330184436, "grad_norm": 1.2109375, "learning_rate": 0.0004695193724206615, "loss": 5.8118, "mean_token_accuracy": 0.16511878073215486, "num_tokens": 34415621.0, "step": 17600 }, { "entropy": 6.160628461837769, "epoch": 1.759834058079672, "grad_norm": 1.2578125, "learning_rate": 0.00046950143333499613, "loss": 5.8717, "mean_token_accuracy": 0.16161109805107116, "num_tokens": 34425115.0, "step": 17605 }, { "entropy": 6.172643852233887, "epoch": 1.7603338831409006, "grad_norm": 1.328125, "learning_rate": 0.00046948348935572476, "loss": 5.8498, "mean_token_accuracy": 0.1610669359564781, "num_tokens": 34434164.0, "step": 17610 }, { "entropy": 6.016178941726684, "epoch": 1.7608337082021293, "grad_norm": 1.125, "learning_rate": 0.0004694655404832988, "loss": 5.7039, "mean_token_accuracy": 0.1701914981007576, "num_tokens": 34443620.0, "step": 17615 }, { "entropy": 6.139363574981689, "epoch": 1.761333533263358, "grad_norm": 1.3125, "learning_rate": 0.00046944758671817, "loss": 5.8242, "mean_token_accuracy": 0.16067755073308945, "num_tokens": 34452831.0, "step": 17620 }, { "entropy": 6.053916883468628, "epoch": 1.7618333583245864, "grad_norm": 1.2890625, "learning_rate": 0.0004694296280607899, "loss": 5.6813, "mean_token_accuracy": 0.1711435243487358, "num_tokens": 34462484.0, "step": 17625 }, { "entropy": 6.018930578231812, "epoch": 1.762333183385815, "grad_norm": 2.09375, "learning_rate": 0.0004694116645116104, "loss": 5.7483, "mean_token_accuracy": 0.17276942431926728, "num_tokens": 34471546.0, "step": 17630 }, { "entropy": 6.164613103866577, "epoch": 1.7628330084470436, "grad_norm": 1.1328125, "learning_rate": 0.0004693936960710834, "loss": 5.8649, "mean_token_accuracy": 0.16016077995300293, "num_tokens": 34482384.0, "step": 17635 }, { "entropy": 6.112231874465943, "epoch": 1.763332833508272, "grad_norm": 1.28125, "learning_rate": 0.00046937572273966104, "loss": 5.7151, "mean_token_accuracy": 0.17694345116615295, "num_tokens": 34491897.0, "step": 17640 }, { "entropy": 6.088321304321289, "epoch": 1.7638326585695006, "grad_norm": 1.265625, "learning_rate": 0.00046935774451779556, "loss": 5.8104, "mean_token_accuracy": 0.1603526785969734, "num_tokens": 34501709.0, "step": 17645 }, { "entropy": 6.054780149459839, "epoch": 1.7643324836307293, "grad_norm": 1.34375, "learning_rate": 0.0004693397614059392, "loss": 5.7468, "mean_token_accuracy": 0.17082723826169968, "num_tokens": 34510560.0, "step": 17650 }, { "entropy": 6.097449588775635, "epoch": 1.764832308691958, "grad_norm": 1.3125, "learning_rate": 0.0004693217734045445, "loss": 5.801, "mean_token_accuracy": 0.16515442430973054, "num_tokens": 34519363.0, "step": 17655 }, { "entropy": 6.052739000320434, "epoch": 1.7653321337531864, "grad_norm": 1.234375, "learning_rate": 0.00046930378051406393, "loss": 5.8073, "mean_token_accuracy": 0.1674882709980011, "num_tokens": 34530335.0, "step": 17660 }, { "entropy": 6.061106824874878, "epoch": 1.765831958814415, "grad_norm": 1.1640625, "learning_rate": 0.00046928578273495026, "loss": 5.7271, "mean_token_accuracy": 0.17058241218328477, "num_tokens": 34540603.0, "step": 17665 }, { "entropy": 6.103881072998047, "epoch": 1.7663317838756436, "grad_norm": 1.1640625, "learning_rate": 0.0004692677800676563, "loss": 5.7477, "mean_token_accuracy": 0.17275501787662506, "num_tokens": 34550765.0, "step": 17670 }, { "entropy": 6.150298738479615, "epoch": 1.766831608936872, "grad_norm": 1.40625, "learning_rate": 0.00046924977251263495, "loss": 5.7736, "mean_token_accuracy": 0.1703992635011673, "num_tokens": 34560330.0, "step": 17675 }, { "entropy": 6.060427570343018, "epoch": 1.7673314339981006, "grad_norm": 1.3671875, "learning_rate": 0.00046923176007033937, "loss": 5.7953, "mean_token_accuracy": 0.16737726777791978, "num_tokens": 34569356.0, "step": 17680 }, { "entropy": 6.056428289413452, "epoch": 1.7678312590593293, "grad_norm": 1.296875, "learning_rate": 0.00046921374274122265, "loss": 5.7551, "mean_token_accuracy": 0.17020260095596312, "num_tokens": 34578613.0, "step": 17685 }, { "entropy": 6.035226583480835, "epoch": 1.768331084120558, "grad_norm": 1.171875, "learning_rate": 0.00046919572052573814, "loss": 5.6696, "mean_token_accuracy": 0.17857344448566437, "num_tokens": 34587394.0, "step": 17690 }, { "entropy": 6.068990278244018, "epoch": 1.7688309091817864, "grad_norm": 1.25, "learning_rate": 0.00046917769342433925, "loss": 5.793, "mean_token_accuracy": 0.17222824394702912, "num_tokens": 34598707.0, "step": 17695 }, { "entropy": 6.142226934432983, "epoch": 1.769330734243015, "grad_norm": 1.203125, "learning_rate": 0.0004691596614374796, "loss": 5.8294, "mean_token_accuracy": 0.16175631284713746, "num_tokens": 34608270.0, "step": 17700 }, { "entropy": 6.106780385971069, "epoch": 1.7698305593042436, "grad_norm": 1.125, "learning_rate": 0.0004691416245656128, "loss": 5.8349, "mean_token_accuracy": 0.1698239229619503, "num_tokens": 34618533.0, "step": 17705 }, { "entropy": 6.14064130783081, "epoch": 1.770330384365472, "grad_norm": 1.140625, "learning_rate": 0.00046912358280919267, "loss": 5.893, "mean_token_accuracy": 0.15824734717607497, "num_tokens": 34628158.0, "step": 17710 }, { "entropy": 6.126226282119751, "epoch": 1.7708302094267006, "grad_norm": 1.203125, "learning_rate": 0.00046910553616867314, "loss": 5.747, "mean_token_accuracy": 0.17432289123535155, "num_tokens": 34638046.0, "step": 17715 }, { "entropy": 6.153215456008911, "epoch": 1.7713300344879293, "grad_norm": 1.2109375, "learning_rate": 0.0004690874846445083, "loss": 5.8691, "mean_token_accuracy": 0.1553115203976631, "num_tokens": 34647847.0, "step": 17720 }, { "entropy": 6.090858125686646, "epoch": 1.771829859549158, "grad_norm": 1.1015625, "learning_rate": 0.0004690694282371523, "loss": 5.7608, "mean_token_accuracy": 0.1657584860920906, "num_tokens": 34658830.0, "step": 17725 }, { "entropy": 6.024606037139892, "epoch": 1.7723296846103862, "grad_norm": 1.1640625, "learning_rate": 0.0004690513669470594, "loss": 5.7304, "mean_token_accuracy": 0.17838093042373657, "num_tokens": 34668679.0, "step": 17730 }, { "entropy": 6.096363973617554, "epoch": 1.772829509671615, "grad_norm": 1.3125, "learning_rate": 0.000469033300774684, "loss": 5.8054, "mean_token_accuracy": 0.16779908537864685, "num_tokens": 34678443.0, "step": 17735 }, { "entropy": 6.193962907791137, "epoch": 1.7733293347328436, "grad_norm": 1.078125, "learning_rate": 0.0004690152297204808, "loss": 5.8379, "mean_token_accuracy": 0.167942114174366, "num_tokens": 34688348.0, "step": 17740 }, { "entropy": 5.902188539505005, "epoch": 1.773829159794072, "grad_norm": 1.2421875, "learning_rate": 0.00046899715378490427, "loss": 5.5149, "mean_token_accuracy": 0.19103506654500962, "num_tokens": 34698402.0, "step": 17745 }, { "entropy": 6.014567852020264, "epoch": 1.7743289848553006, "grad_norm": 1.234375, "learning_rate": 0.00046897907296840927, "loss": 5.7573, "mean_token_accuracy": 0.1705679178237915, "num_tokens": 34707761.0, "step": 17750 }, { "entropy": 6.117718362808228, "epoch": 1.7748288099165292, "grad_norm": 1.25, "learning_rate": 0.0004689609872714507, "loss": 5.8774, "mean_token_accuracy": 0.16225721389055253, "num_tokens": 34717934.0, "step": 17755 }, { "entropy": 6.188833284378052, "epoch": 1.775328634977758, "grad_norm": 1.2578125, "learning_rate": 0.00046894289669448366, "loss": 5.8685, "mean_token_accuracy": 0.16039598286151885, "num_tokens": 34727486.0, "step": 17760 }, { "entropy": 6.145923137664795, "epoch": 1.7758284600389862, "grad_norm": 1.5703125, "learning_rate": 0.00046892480123796314, "loss": 5.7747, "mean_token_accuracy": 0.1702690452337265, "num_tokens": 34738080.0, "step": 17765 }, { "entropy": 6.066918277740479, "epoch": 1.776328285100215, "grad_norm": 1.296875, "learning_rate": 0.0004689067009023446, "loss": 5.8222, "mean_token_accuracy": 0.1629923477768898, "num_tokens": 34747595.0, "step": 17770 }, { "entropy": 6.045388078689575, "epoch": 1.7768281101614436, "grad_norm": 1.1484375, "learning_rate": 0.0004688885956880834, "loss": 5.6703, "mean_token_accuracy": 0.17143936604261398, "num_tokens": 34756818.0, "step": 17775 }, { "entropy": 6.07952880859375, "epoch": 1.777327935222672, "grad_norm": 1.265625, "learning_rate": 0.0004688704855956349, "loss": 5.7755, "mean_token_accuracy": 0.16656854301691054, "num_tokens": 34767263.0, "step": 17780 }, { "entropy": 6.171099138259888, "epoch": 1.7778277602839005, "grad_norm": 1.234375, "learning_rate": 0.00046885237062545493, "loss": 5.8643, "mean_token_accuracy": 0.15952659249305726, "num_tokens": 34776767.0, "step": 17785 }, { "entropy": 6.116524124145508, "epoch": 1.7783275853451292, "grad_norm": 1.125, "learning_rate": 0.00046883425077799923, "loss": 5.7904, "mean_token_accuracy": 0.1651027724146843, "num_tokens": 34787587.0, "step": 17790 }, { "entropy": 6.0904669761657715, "epoch": 1.7788274104063577, "grad_norm": 1.203125, "learning_rate": 0.0004688161260537236, "loss": 5.8666, "mean_token_accuracy": 0.1545224145054817, "num_tokens": 34798586.0, "step": 17795 }, { "entropy": 6.118031311035156, "epoch": 1.7793272354675862, "grad_norm": 1.2109375, "learning_rate": 0.0004687979964530842, "loss": 5.8177, "mean_token_accuracy": 0.16262117102742196, "num_tokens": 34808469.0, "step": 17800 }, { "entropy": 6.153189706802368, "epoch": 1.779827060528815, "grad_norm": 1.2421875, "learning_rate": 0.000468779861976537, "loss": 5.7937, "mean_token_accuracy": 0.16816478669643403, "num_tokens": 34817933.0, "step": 17805 }, { "entropy": 6.056660223007202, "epoch": 1.7803268855900436, "grad_norm": 1.5234375, "learning_rate": 0.00046876172262453843, "loss": 5.7472, "mean_token_accuracy": 0.16604597568511964, "num_tokens": 34827370.0, "step": 17810 }, { "entropy": 6.091251468658447, "epoch": 1.780826710651272, "grad_norm": 1.2890625, "learning_rate": 0.00046874357839754463, "loss": 5.7994, "mean_token_accuracy": 0.16718368828296662, "num_tokens": 34835521.0, "step": 17815 }, { "entropy": 6.190127658843994, "epoch": 1.7813265357125005, "grad_norm": 1.1875, "learning_rate": 0.00046872542929601234, "loss": 6.0719, "mean_token_accuracy": 0.15558838620781898, "num_tokens": 34846151.0, "step": 17820 }, { "entropy": 6.146645355224609, "epoch": 1.7818263607737292, "grad_norm": 1.3046875, "learning_rate": 0.00046870727532039816, "loss": 5.7238, "mean_token_accuracy": 0.16631383150815965, "num_tokens": 34855536.0, "step": 17825 }, { "entropy": 6.13318772315979, "epoch": 1.7823261858349577, "grad_norm": 1.3046875, "learning_rate": 0.0004686891164711586, "loss": 5.7935, "mean_token_accuracy": 0.16497173458337783, "num_tokens": 34865428.0, "step": 17830 }, { "entropy": 6.043006753921508, "epoch": 1.7828260108961862, "grad_norm": 1.375, "learning_rate": 0.00046867095274875085, "loss": 5.7425, "mean_token_accuracy": 0.163699933886528, "num_tokens": 34875273.0, "step": 17835 }, { "entropy": 6.0623523712158205, "epoch": 1.783325835957415, "grad_norm": 1.2421875, "learning_rate": 0.00046865278415363174, "loss": 5.848, "mean_token_accuracy": 0.1607326626777649, "num_tokens": 34885438.0, "step": 17840 }, { "entropy": 6.199893140792847, "epoch": 1.7838256610186436, "grad_norm": 1.140625, "learning_rate": 0.0004686346106862584, "loss": 5.8631, "mean_token_accuracy": 0.1620113119482994, "num_tokens": 34895245.0, "step": 17845 }, { "entropy": 6.114214897155762, "epoch": 1.784325486079872, "grad_norm": 1.234375, "learning_rate": 0.0004686164323470881, "loss": 5.7451, "mean_token_accuracy": 0.16725882589817048, "num_tokens": 34905028.0, "step": 17850 }, { "entropy": 6.126498985290527, "epoch": 1.7848253111411005, "grad_norm": 1.2734375, "learning_rate": 0.0004685982491365781, "loss": 5.8867, "mean_token_accuracy": 0.16192000955343247, "num_tokens": 34915756.0, "step": 17855 }, { "entropy": 6.1313621520996096, "epoch": 1.7853251362023292, "grad_norm": 1.109375, "learning_rate": 0.00046858006105518615, "loss": 5.7787, "mean_token_accuracy": 0.16696716845035553, "num_tokens": 34925369.0, "step": 17860 }, { "entropy": 6.100793695449829, "epoch": 1.7858249612635577, "grad_norm": 1.234375, "learning_rate": 0.0004685618681033695, "loss": 5.8422, "mean_token_accuracy": 0.16141773760318756, "num_tokens": 34935693.0, "step": 17865 }, { "entropy": 6.122704315185547, "epoch": 1.7863247863247862, "grad_norm": 1.3828125, "learning_rate": 0.0004685436702815861, "loss": 5.8239, "mean_token_accuracy": 0.16642831712961198, "num_tokens": 34944582.0, "step": 17870 }, { "entropy": 6.135226249694824, "epoch": 1.786824611386015, "grad_norm": 2.34375, "learning_rate": 0.0004685254675902938, "loss": 5.8046, "mean_token_accuracy": 0.16437610238790512, "num_tokens": 34953762.0, "step": 17875 }, { "entropy": 6.123812866210938, "epoch": 1.7873244364472436, "grad_norm": 1.359375, "learning_rate": 0.0004685072600299505, "loss": 5.8689, "mean_token_accuracy": 0.16340502351522446, "num_tokens": 34963003.0, "step": 17880 }, { "entropy": 6.083636713027954, "epoch": 1.787824261508472, "grad_norm": 1.34375, "learning_rate": 0.0004684890476010144, "loss": 5.834, "mean_token_accuracy": 0.1611725464463234, "num_tokens": 34972968.0, "step": 17885 }, { "entropy": 6.140351486206055, "epoch": 1.7883240865697005, "grad_norm": 1.4375, "learning_rate": 0.0004684708303039435, "loss": 5.9016, "mean_token_accuracy": 0.16559814512729645, "num_tokens": 34983050.0, "step": 17890 }, { "entropy": 6.200511360168457, "epoch": 1.7888239116309292, "grad_norm": 1.328125, "learning_rate": 0.00046845260813919645, "loss": 5.8233, "mean_token_accuracy": 0.16159948706626892, "num_tokens": 34992192.0, "step": 17895 }, { "entropy": 6.083561420440674, "epoch": 1.7893237366921577, "grad_norm": 1.3515625, "learning_rate": 0.00046843438110723143, "loss": 5.7742, "mean_token_accuracy": 0.169467294216156, "num_tokens": 35001135.0, "step": 17900 }, { "entropy": 6.073339605331421, "epoch": 1.7898235617533862, "grad_norm": 2.5625, "learning_rate": 0.00046841614920850724, "loss": 5.8377, "mean_token_accuracy": 0.162664508074522, "num_tokens": 35011389.0, "step": 17905 }, { "entropy": 6.131946611404419, "epoch": 1.790323386814615, "grad_norm": 1.4453125, "learning_rate": 0.00046839791244348243, "loss": 5.8616, "mean_token_accuracy": 0.16711240857839585, "num_tokens": 35021752.0, "step": 17910 }, { "entropy": 6.096583032608033, "epoch": 1.7908232118758436, "grad_norm": 1.1484375, "learning_rate": 0.00046837967081261606, "loss": 5.7851, "mean_token_accuracy": 0.16533706933259965, "num_tokens": 35031878.0, "step": 17915 }, { "entropy": 6.075601434707641, "epoch": 1.791323036937072, "grad_norm": 1.1953125, "learning_rate": 0.0004683614243163668, "loss": 5.7289, "mean_token_accuracy": 0.17105406820774077, "num_tokens": 35040995.0, "step": 17920 }, { "entropy": 6.0946441173553465, "epoch": 1.7918228619983005, "grad_norm": 1.203125, "learning_rate": 0.0004683431729551939, "loss": 5.7598, "mean_token_accuracy": 0.1701200619339943, "num_tokens": 35050680.0, "step": 17925 }, { "entropy": 6.097586345672608, "epoch": 1.7923226870595292, "grad_norm": 1.2109375, "learning_rate": 0.0004683249167295565, "loss": 5.7676, "mean_token_accuracy": 0.16994592994451524, "num_tokens": 35059910.0, "step": 17930 }, { "entropy": 6.054046154022217, "epoch": 1.7928225121207577, "grad_norm": 1.2265625, "learning_rate": 0.000468306655639914, "loss": 5.7356, "mean_token_accuracy": 0.17317907586693765, "num_tokens": 35069711.0, "step": 17935 }, { "entropy": 6.125696516036987, "epoch": 1.7933223371819862, "grad_norm": 1.140625, "learning_rate": 0.0004682883896867257, "loss": 5.8059, "mean_token_accuracy": 0.16578530818223952, "num_tokens": 35078711.0, "step": 17940 }, { "entropy": 6.069156980514526, "epoch": 1.793822162243215, "grad_norm": 1.265625, "learning_rate": 0.0004682701188704513, "loss": 5.7909, "mean_token_accuracy": 0.17187907844781875, "num_tokens": 35087632.0, "step": 17945 }, { "entropy": 6.0654350280761715, "epoch": 1.7943219873044436, "grad_norm": 1.2109375, "learning_rate": 0.0004682518431915505, "loss": 5.792, "mean_token_accuracy": 0.17536998689174652, "num_tokens": 35097257.0, "step": 17950 }, { "entropy": 6.129639291763306, "epoch": 1.794821812365672, "grad_norm": 1.296875, "learning_rate": 0.00046823356265048293, "loss": 5.8335, "mean_token_accuracy": 0.16681813597679138, "num_tokens": 35107734.0, "step": 17955 }, { "entropy": 6.13929295539856, "epoch": 1.7953216374269005, "grad_norm": 1.28125, "learning_rate": 0.0004682152772477087, "loss": 5.7772, "mean_token_accuracy": 0.16905079185962676, "num_tokens": 35117052.0, "step": 17960 }, { "entropy": 6.114010906219482, "epoch": 1.7958214624881292, "grad_norm": 1.3125, "learning_rate": 0.00046819698698368785, "loss": 5.8251, "mean_token_accuracy": 0.16201669871807098, "num_tokens": 35127345.0, "step": 17965 }, { "entropy": 6.073897933959961, "epoch": 1.7963212875493577, "grad_norm": 1.203125, "learning_rate": 0.00046817869185888044, "loss": 5.7265, "mean_token_accuracy": 0.16584499627351762, "num_tokens": 35137216.0, "step": 17970 }, { "entropy": 6.116776180267334, "epoch": 1.7968211126105862, "grad_norm": 1.8203125, "learning_rate": 0.0004681603918737469, "loss": 5.8016, "mean_token_accuracy": 0.17316877245903015, "num_tokens": 35146433.0, "step": 17975 }, { "entropy": 6.055818176269531, "epoch": 1.7973209376718149, "grad_norm": 1.1640625, "learning_rate": 0.00046814208702874766, "loss": 5.8131, "mean_token_accuracy": 0.16329140216112137, "num_tokens": 35155841.0, "step": 17980 }, { "entropy": 6.06991057395935, "epoch": 1.7978207627330436, "grad_norm": 1.234375, "learning_rate": 0.00046812377732434316, "loss": 5.8724, "mean_token_accuracy": 0.1664571315050125, "num_tokens": 35165962.0, "step": 17985 }, { "entropy": 6.119021606445313, "epoch": 1.7983205877942718, "grad_norm": 1.1640625, "learning_rate": 0.00046810546276099415, "loss": 5.8412, "mean_token_accuracy": 0.16151943281292916, "num_tokens": 35175887.0, "step": 17990 }, { "entropy": 6.173126745223999, "epoch": 1.7988204128555005, "grad_norm": 1.2421875, "learning_rate": 0.0004680871433391613, "loss": 5.8131, "mean_token_accuracy": 0.16589714735746383, "num_tokens": 35185763.0, "step": 17995 }, { "entropy": 6.090228176116943, "epoch": 1.7993202379167292, "grad_norm": 1.2734375, "learning_rate": 0.00046806881905930565, "loss": 5.8007, "mean_token_accuracy": 0.17068539410829545, "num_tokens": 35195452.0, "step": 18000 }, { "epoch": 1.7993202379167292, "eval_entropy": 5.861933311952877, "eval_loss": 5.897674560546875, "eval_mean_token_accuracy": 0.16906350237840279, "eval_num_tokens": 35195452.0, "eval_runtime": 23.9861, "eval_samples_per_second": 1294.293, "eval_steps_per_second": 161.802, "step": 18000 }, { "entropy": 6.105839586257934, "epoch": 1.7998200629779577, "grad_norm": 1.3671875, "learning_rate": 0.00046805048992188823, "loss": 5.8644, "mean_token_accuracy": 0.16288941502571105, "num_tokens": 35205261.0, "step": 18005 }, { "entropy": 6.133154010772705, "epoch": 1.8003198880391862, "grad_norm": 1.21875, "learning_rate": 0.00046803215592737014, "loss": 5.8433, "mean_token_accuracy": 0.16536638587713243, "num_tokens": 35214965.0, "step": 18010 }, { "entropy": 6.096221542358398, "epoch": 1.8008197131004149, "grad_norm": 1.265625, "learning_rate": 0.00046801381707621266, "loss": 5.8013, "mean_token_accuracy": 0.16576366424560546, "num_tokens": 35224371.0, "step": 18015 }, { "entropy": 6.037886095046997, "epoch": 1.8013195381616436, "grad_norm": 1.2578125, "learning_rate": 0.00046799547336887727, "loss": 5.7216, "mean_token_accuracy": 0.1736925557255745, "num_tokens": 35234282.0, "step": 18020 }, { "entropy": 6.122465515136719, "epoch": 1.8018193632228718, "grad_norm": 1.203125, "learning_rate": 0.0004679771248058254, "loss": 5.7429, "mean_token_accuracy": 0.17538924217224122, "num_tokens": 35243112.0, "step": 18025 }, { "entropy": 6.089845323562622, "epoch": 1.8023191882841005, "grad_norm": 1.2265625, "learning_rate": 0.0004679587713875187, "loss": 5.7837, "mean_token_accuracy": 0.15819660127162932, "num_tokens": 35253398.0, "step": 18030 }, { "entropy": 6.068023061752319, "epoch": 1.8028190133453292, "grad_norm": 1.1171875, "learning_rate": 0.000467940413114419, "loss": 5.7023, "mean_token_accuracy": 0.17255635261535646, "num_tokens": 35263359.0, "step": 18035 }, { "entropy": 6.145987033843994, "epoch": 1.8033188384065577, "grad_norm": 1.3515625, "learning_rate": 0.0004679220499869881, "loss": 5.8895, "mean_token_accuracy": 0.15931747555732728, "num_tokens": 35272500.0, "step": 18040 }, { "entropy": 6.202304124832153, "epoch": 1.8038186634677862, "grad_norm": 1.1796875, "learning_rate": 0.0004679036820056881, "loss": 5.8608, "mean_token_accuracy": 0.15133578553795815, "num_tokens": 35282415.0, "step": 18045 }, { "entropy": 6.172774791717529, "epoch": 1.8043184885290149, "grad_norm": 1.203125, "learning_rate": 0.00046788530917098105, "loss": 5.808, "mean_token_accuracy": 0.16334254890680314, "num_tokens": 35291567.0, "step": 18050 }, { "entropy": 6.101656436920166, "epoch": 1.8048183135902434, "grad_norm": 1.3203125, "learning_rate": 0.0004678669314833293, "loss": 5.9229, "mean_token_accuracy": 0.15782424211502075, "num_tokens": 35301397.0, "step": 18055 }, { "entropy": 6.087209606170655, "epoch": 1.8053181386514718, "grad_norm": 1.390625, "learning_rate": 0.00046784854894319525, "loss": 5.752, "mean_token_accuracy": 0.17305241525173187, "num_tokens": 35311296.0, "step": 18060 }, { "entropy": 6.131953477859497, "epoch": 1.8058179637127005, "grad_norm": 1.2109375, "learning_rate": 0.00046783016155104123, "loss": 5.844, "mean_token_accuracy": 0.17097675651311875, "num_tokens": 35322819.0, "step": 18065 }, { "entropy": 6.119858932495117, "epoch": 1.8063177887739292, "grad_norm": 1.21875, "learning_rate": 0.00046781176930732997, "loss": 5.7318, "mean_token_accuracy": 0.17132087498903276, "num_tokens": 35331374.0, "step": 18070 }, { "entropy": 6.049019622802734, "epoch": 1.8068176138351577, "grad_norm": 1.203125, "learning_rate": 0.0004677933722125243, "loss": 5.8277, "mean_token_accuracy": 0.16618005335330963, "num_tokens": 35341040.0, "step": 18075 }, { "entropy": 6.151770782470703, "epoch": 1.8073174388963862, "grad_norm": 1.375, "learning_rate": 0.0004677749702670869, "loss": 5.852, "mean_token_accuracy": 0.15483629703521729, "num_tokens": 35351387.0, "step": 18080 }, { "entropy": 6.152039098739624, "epoch": 1.8078172639576149, "grad_norm": 1.1484375, "learning_rate": 0.0004677565634714809, "loss": 5.8553, "mean_token_accuracy": 0.15843773186206817, "num_tokens": 35361864.0, "step": 18085 }, { "entropy": 6.059840106964112, "epoch": 1.8083170890188434, "grad_norm": 1.28125, "learning_rate": 0.0004677381518261693, "loss": 5.7478, "mean_token_accuracy": 0.1783355876803398, "num_tokens": 35370539.0, "step": 18090 }, { "entropy": 6.052991008758545, "epoch": 1.8088169140800718, "grad_norm": 1.15625, "learning_rate": 0.00046771973533161543, "loss": 5.7621, "mean_token_accuracy": 0.17573347836732864, "num_tokens": 35381851.0, "step": 18095 }, { "entropy": 6.130247116088867, "epoch": 1.8093167391413005, "grad_norm": 1.2265625, "learning_rate": 0.00046770131398828264, "loss": 5.773, "mean_token_accuracy": 0.17053579837083815, "num_tokens": 35391440.0, "step": 18100 }, { "entropy": 6.139250469207764, "epoch": 1.8098165642025292, "grad_norm": 1.21875, "learning_rate": 0.00046768288779663436, "loss": 5.8232, "mean_token_accuracy": 0.16423137187957765, "num_tokens": 35401370.0, "step": 18105 }, { "entropy": 6.155709218978882, "epoch": 1.8103163892637577, "grad_norm": 1.25, "learning_rate": 0.0004676644567571342, "loss": 5.8104, "mean_token_accuracy": 0.16085606962442398, "num_tokens": 35411015.0, "step": 18110 }, { "entropy": 6.176739311218261, "epoch": 1.8108162143249862, "grad_norm": 1.2421875, "learning_rate": 0.00046764602087024596, "loss": 5.8205, "mean_token_accuracy": 0.16111122071743011, "num_tokens": 35421741.0, "step": 18115 }, { "entropy": 6.208624267578125, "epoch": 1.8113160393862149, "grad_norm": 1.125, "learning_rate": 0.0004676275801364332, "loss": 5.9434, "mean_token_accuracy": 0.1547234460711479, "num_tokens": 35432899.0, "step": 18120 }, { "entropy": 6.056198310852051, "epoch": 1.8118158644474434, "grad_norm": 1.1953125, "learning_rate": 0.0004676091345561603, "loss": 5.6935, "mean_token_accuracy": 0.17496990412473679, "num_tokens": 35442220.0, "step": 18125 }, { "entropy": 6.025050115585327, "epoch": 1.8123156895086718, "grad_norm": 1.1796875, "learning_rate": 0.000467590684129891, "loss": 5.742, "mean_token_accuracy": 0.1747843787074089, "num_tokens": 35452193.0, "step": 18130 }, { "entropy": 6.109678840637207, "epoch": 1.8128155145699005, "grad_norm": 1.2421875, "learning_rate": 0.00046757222885808973, "loss": 5.8058, "mean_token_accuracy": 0.1708253502845764, "num_tokens": 35462152.0, "step": 18135 }, { "entropy": 6.111292505264283, "epoch": 1.8133153396311292, "grad_norm": 1.2109375, "learning_rate": 0.00046755376874122075, "loss": 5.7891, "mean_token_accuracy": 0.16616717875003814, "num_tokens": 35472210.0, "step": 18140 }, { "entropy": 6.133566665649414, "epoch": 1.8138151646923577, "grad_norm": 1.71875, "learning_rate": 0.0004675353037797485, "loss": 5.8598, "mean_token_accuracy": 0.15686623901128768, "num_tokens": 35482238.0, "step": 18145 }, { "entropy": 6.081112289428711, "epoch": 1.8143149897535862, "grad_norm": 1.25, "learning_rate": 0.0004675168339741375, "loss": 5.837, "mean_token_accuracy": 0.16125814765691757, "num_tokens": 35492042.0, "step": 18150 }, { "entropy": 6.1606358051300045, "epoch": 1.8148148148148149, "grad_norm": 1.5078125, "learning_rate": 0.0004674983593248525, "loss": 5.8976, "mean_token_accuracy": 0.15734914243221282, "num_tokens": 35501892.0, "step": 18155 }, { "entropy": 6.168277168273926, "epoch": 1.8153146398760434, "grad_norm": 1.1640625, "learning_rate": 0.00046747987983235836, "loss": 5.8473, "mean_token_accuracy": 0.16236926913261412, "num_tokens": 35512472.0, "step": 18160 }, { "entropy": 6.132704877853394, "epoch": 1.8158144649372718, "grad_norm": 1.5078125, "learning_rate": 0.00046746139549711993, "loss": 5.7211, "mean_token_accuracy": 0.17130089551210403, "num_tokens": 35521467.0, "step": 18165 }, { "entropy": 6.031136560440063, "epoch": 1.8163142899985005, "grad_norm": 1.2578125, "learning_rate": 0.0004674429063196023, "loss": 5.8204, "mean_token_accuracy": 0.16831044256687164, "num_tokens": 35531584.0, "step": 18170 }, { "entropy": 6.088880014419556, "epoch": 1.8168141150597292, "grad_norm": 1.4453125, "learning_rate": 0.00046742441230027067, "loss": 5.675, "mean_token_accuracy": 0.1743665799498558, "num_tokens": 35541687.0, "step": 18175 }, { "entropy": 6.0870436668396, "epoch": 1.8173139401209577, "grad_norm": 1.1484375, "learning_rate": 0.0004674059134395904, "loss": 5.78, "mean_token_accuracy": 0.16289244294166566, "num_tokens": 35551310.0, "step": 18180 }, { "entropy": 6.093764114379883, "epoch": 1.8178137651821862, "grad_norm": 1.3203125, "learning_rate": 0.0004673874097380268, "loss": 5.7475, "mean_token_accuracy": 0.16740995943546294, "num_tokens": 35560356.0, "step": 18185 }, { "entropy": 6.096996879577636, "epoch": 1.8183135902434149, "grad_norm": 1.1640625, "learning_rate": 0.0004673689011960455, "loss": 5.7268, "mean_token_accuracy": 0.17150569558143616, "num_tokens": 35570633.0, "step": 18190 }, { "entropy": 6.140740251541137, "epoch": 1.8188134153046434, "grad_norm": 1.1484375, "learning_rate": 0.00046735038781411204, "loss": 5.9291, "mean_token_accuracy": 0.15552953779697418, "num_tokens": 35581341.0, "step": 18195 }, { "entropy": 6.017335748672485, "epoch": 1.8193132403658718, "grad_norm": 1.0859375, "learning_rate": 0.0004673318695926925, "loss": 5.6591, "mean_token_accuracy": 0.1844051957130432, "num_tokens": 35592301.0, "step": 18200 }, { "entropy": 6.048006963729859, "epoch": 1.8198130654271005, "grad_norm": 1.1484375, "learning_rate": 0.0004673133465322525, "loss": 5.7074, "mean_token_accuracy": 0.17337230890989302, "num_tokens": 35601782.0, "step": 18205 }, { "entropy": 6.022095012664795, "epoch": 1.8203128904883292, "grad_norm": 1.2421875, "learning_rate": 0.0004672948186332582, "loss": 5.6806, "mean_token_accuracy": 0.17057230770587922, "num_tokens": 35611307.0, "step": 18210 }, { "entropy": 6.112345218658447, "epoch": 1.8208127155495577, "grad_norm": 1.3984375, "learning_rate": 0.00046727628589617574, "loss": 5.8542, "mean_token_accuracy": 0.16126495748758315, "num_tokens": 35621358.0, "step": 18215 }, { "entropy": 6.074323749542236, "epoch": 1.8213125406107862, "grad_norm": 1.1953125, "learning_rate": 0.00046725774832147147, "loss": 5.7665, "mean_token_accuracy": 0.16569652855396272, "num_tokens": 35630976.0, "step": 18220 }, { "entropy": 6.05137882232666, "epoch": 1.8218123656720149, "grad_norm": 1.1953125, "learning_rate": 0.00046723920590961167, "loss": 5.7369, "mean_token_accuracy": 0.16888122856616974, "num_tokens": 35640126.0, "step": 18225 }, { "entropy": 6.103144645690918, "epoch": 1.8223121907332434, "grad_norm": 1.1640625, "learning_rate": 0.0004672206586610629, "loss": 5.7807, "mean_token_accuracy": 0.16719338297843933, "num_tokens": 35649282.0, "step": 18230 }, { "entropy": 6.075000667572022, "epoch": 1.8228120157944718, "grad_norm": 1.2265625, "learning_rate": 0.00046720210657629185, "loss": 5.7131, "mean_token_accuracy": 0.17080237716436386, "num_tokens": 35658284.0, "step": 18235 }, { "entropy": 6.087240552902221, "epoch": 1.8233118408557005, "grad_norm": 1.140625, "learning_rate": 0.00046718354965576527, "loss": 5.8742, "mean_token_accuracy": 0.159806552529335, "num_tokens": 35668355.0, "step": 18240 }, { "entropy": 6.096940708160401, "epoch": 1.8238116659169292, "grad_norm": 1.390625, "learning_rate": 0.00046716498789995, "loss": 5.8315, "mean_token_accuracy": 0.1575819134712219, "num_tokens": 35677582.0, "step": 18245 }, { "entropy": 6.1221763610839846, "epoch": 1.8243114909781575, "grad_norm": 1.25, "learning_rate": 0.00046714642130931306, "loss": 5.8503, "mean_token_accuracy": 0.1635047286748886, "num_tokens": 35687691.0, "step": 18250 }, { "entropy": 6.086605978012085, "epoch": 1.8248113160393862, "grad_norm": 1.2890625, "learning_rate": 0.00046712784988432173, "loss": 5.821, "mean_token_accuracy": 0.16328749060630798, "num_tokens": 35697796.0, "step": 18255 }, { "entropy": 6.1273908615112305, "epoch": 1.8253111411006149, "grad_norm": 1.375, "learning_rate": 0.000467109273625443, "loss": 5.742, "mean_token_accuracy": 0.17108754366636275, "num_tokens": 35706795.0, "step": 18260 }, { "entropy": 6.140839529037476, "epoch": 1.8258109661618434, "grad_norm": 1.2890625, "learning_rate": 0.0004670906925331444, "loss": 5.8461, "mean_token_accuracy": 0.16877455860376359, "num_tokens": 35717260.0, "step": 18265 }, { "entropy": 6.097375726699829, "epoch": 1.8263107912230718, "grad_norm": 1.2578125, "learning_rate": 0.00046707210660789343, "loss": 5.8592, "mean_token_accuracy": 0.16497842818498612, "num_tokens": 35726671.0, "step": 18270 }, { "entropy": 6.155775165557861, "epoch": 1.8268106162843005, "grad_norm": 1.1484375, "learning_rate": 0.0004670535158501577, "loss": 5.857, "mean_token_accuracy": 0.16165828555822373, "num_tokens": 35736672.0, "step": 18275 }, { "entropy": 6.153855037689209, "epoch": 1.8273104413455292, "grad_norm": 1.21875, "learning_rate": 0.00046703492026040495, "loss": 5.7648, "mean_token_accuracy": 0.1625993475317955, "num_tokens": 35746291.0, "step": 18280 }, { "entropy": 6.041607856750488, "epoch": 1.8278102664067575, "grad_norm": 2.734375, "learning_rate": 0.00046701631983910296, "loss": 5.7417, "mean_token_accuracy": 0.16345332488417624, "num_tokens": 35755683.0, "step": 18285 }, { "entropy": 6.09064416885376, "epoch": 1.8283100914679862, "grad_norm": 1.1953125, "learning_rate": 0.00046699771458671974, "loss": 5.8019, "mean_token_accuracy": 0.1636059269309044, "num_tokens": 35765870.0, "step": 18290 }, { "entropy": 5.998325967788697, "epoch": 1.8288099165292149, "grad_norm": 1.1953125, "learning_rate": 0.00046697910450372356, "loss": 5.6444, "mean_token_accuracy": 0.18049484938383104, "num_tokens": 35777055.0, "step": 18295 }, { "entropy": 6.031801319122314, "epoch": 1.8293097415904434, "grad_norm": 1.3046875, "learning_rate": 0.00046696048959058236, "loss": 5.6892, "mean_token_accuracy": 0.17302531450986863, "num_tokens": 35786846.0, "step": 18300 }, { "entropy": 6.0700554847717285, "epoch": 1.8298095666516718, "grad_norm": 1.3671875, "learning_rate": 0.0004669418698477647, "loss": 5.7071, "mean_token_accuracy": 0.17461602240800858, "num_tokens": 35795471.0, "step": 18305 }, { "entropy": 6.039705896377564, "epoch": 1.8303093917129005, "grad_norm": 1.1875, "learning_rate": 0.00046692324527573907, "loss": 5.6621, "mean_token_accuracy": 0.1750674292445183, "num_tokens": 35804559.0, "step": 18310 }, { "entropy": 6.03839955329895, "epoch": 1.830809216774129, "grad_norm": 1.3203125, "learning_rate": 0.0004669046158749738, "loss": 5.7898, "mean_token_accuracy": 0.16533504724502562, "num_tokens": 35813545.0, "step": 18315 }, { "entropy": 6.034802579879761, "epoch": 1.8313090418353575, "grad_norm": 1.3203125, "learning_rate": 0.00046688598164593793, "loss": 5.8058, "mean_token_accuracy": 0.1689276859164238, "num_tokens": 35822740.0, "step": 18320 }, { "entropy": 6.063875293731689, "epoch": 1.8318088668965862, "grad_norm": 1.3125, "learning_rate": 0.0004668673425891001, "loss": 5.8279, "mean_token_accuracy": 0.16060149073600768, "num_tokens": 35832593.0, "step": 18325 }, { "entropy": 6.15786828994751, "epoch": 1.8323086919578149, "grad_norm": 1.296875, "learning_rate": 0.00046684869870492927, "loss": 5.7982, "mean_token_accuracy": 0.16117842346429825, "num_tokens": 35841399.0, "step": 18330 }, { "entropy": 6.0871964454650875, "epoch": 1.8328085170190433, "grad_norm": 1.3046875, "learning_rate": 0.00046683004999389455, "loss": 5.8193, "mean_token_accuracy": 0.166938915848732, "num_tokens": 35850099.0, "step": 18335 }, { "entropy": 6.107338857650757, "epoch": 1.8333083420802718, "grad_norm": 1.34375, "learning_rate": 0.0004668113964564651, "loss": 5.8472, "mean_token_accuracy": 0.16298332512378694, "num_tokens": 35860398.0, "step": 18340 }, { "entropy": 6.089983081817627, "epoch": 1.8338081671415005, "grad_norm": 2.0, "learning_rate": 0.0004667927380931104, "loss": 5.7529, "mean_token_accuracy": 0.1697830006480217, "num_tokens": 35870390.0, "step": 18345 }, { "entropy": 6.075755929946899, "epoch": 1.834307992202729, "grad_norm": 1.1015625, "learning_rate": 0.0004667740749042997, "loss": 5.7084, "mean_token_accuracy": 0.1685636967420578, "num_tokens": 35881633.0, "step": 18350 }, { "entropy": 6.078665542602539, "epoch": 1.8348078172639575, "grad_norm": 1.1875, "learning_rate": 0.00046675540689050253, "loss": 5.8463, "mean_token_accuracy": 0.16277169138193132, "num_tokens": 35891904.0, "step": 18355 }, { "entropy": 6.185885715484619, "epoch": 1.8353076423251862, "grad_norm": 1.2578125, "learning_rate": 0.00046673673405218876, "loss": 6.0559, "mean_token_accuracy": 0.15096188187599183, "num_tokens": 35901712.0, "step": 18360 }, { "entropy": 6.166149616241455, "epoch": 1.8358074673864149, "grad_norm": 1.25, "learning_rate": 0.0004667180563898281, "loss": 5.939, "mean_token_accuracy": 0.15502797663211823, "num_tokens": 35911314.0, "step": 18365 }, { "entropy": 6.229225587844849, "epoch": 1.8363072924476433, "grad_norm": 1.25, "learning_rate": 0.00046669937390389043, "loss": 5.8834, "mean_token_accuracy": 0.16151377111673354, "num_tokens": 35921135.0, "step": 18370 }, { "entropy": 6.2072821140289305, "epoch": 1.8368071175088718, "grad_norm": 1.265625, "learning_rate": 0.00046668068659484584, "loss": 5.8552, "mean_token_accuracy": 0.1617009609937668, "num_tokens": 35930784.0, "step": 18375 }, { "entropy": 6.102618980407715, "epoch": 1.8373069425701005, "grad_norm": 1.1875, "learning_rate": 0.00046666199446316454, "loss": 5.7425, "mean_token_accuracy": 0.1639061763882637, "num_tokens": 35940372.0, "step": 18380 }, { "entropy": 6.1054603099823, "epoch": 1.837806767631329, "grad_norm": 1.1484375, "learning_rate": 0.00046664329750931675, "loss": 5.7198, "mean_token_accuracy": 0.16964344680309296, "num_tokens": 35949507.0, "step": 18385 }, { "entropy": 6.124234867095947, "epoch": 1.8383065926925575, "grad_norm": 1.2421875, "learning_rate": 0.000466624595733773, "loss": 5.7312, "mean_token_accuracy": 0.16554549485445022, "num_tokens": 35958981.0, "step": 18390 }, { "entropy": 6.1013140201568605, "epoch": 1.8388064177537862, "grad_norm": 1.28125, "learning_rate": 0.0004666058891370036, "loss": 5.7648, "mean_token_accuracy": 0.16905977427959443, "num_tokens": 35967842.0, "step": 18395 }, { "entropy": 6.056987285614014, "epoch": 1.8393062428150149, "grad_norm": 1.1328125, "learning_rate": 0.0004665871777194794, "loss": 5.7674, "mean_token_accuracy": 0.16577101796865462, "num_tokens": 35977669.0, "step": 18400 }, { "entropy": 6.092403697967529, "epoch": 1.8398060678762433, "grad_norm": 1.21875, "learning_rate": 0.00046656846148167107, "loss": 5.7807, "mean_token_accuracy": 0.16774290651082993, "num_tokens": 35987815.0, "step": 18405 }, { "entropy": 6.183163356781006, "epoch": 1.8403058929374718, "grad_norm": 1.2265625, "learning_rate": 0.00046654974042404957, "loss": 5.9192, "mean_token_accuracy": 0.15566480308771133, "num_tokens": 35997831.0, "step": 18410 }, { "entropy": 6.127860116958618, "epoch": 1.8408057179987005, "grad_norm": 1.3203125, "learning_rate": 0.00046653101454708593, "loss": 5.792, "mean_token_accuracy": 0.1609821692109108, "num_tokens": 36006822.0, "step": 18415 }, { "entropy": 6.052264022827148, "epoch": 1.841305543059929, "grad_norm": 1.53125, "learning_rate": 0.0004665122838512512, "loss": 5.6801, "mean_token_accuracy": 0.17176989167928697, "num_tokens": 36015648.0, "step": 18420 }, { "entropy": 6.137369775772095, "epoch": 1.8418053681211575, "grad_norm": 1.1171875, "learning_rate": 0.0004664935483370167, "loss": 5.9226, "mean_token_accuracy": 0.15824417024850845, "num_tokens": 36025713.0, "step": 18425 }, { "entropy": 6.1446503639221195, "epoch": 1.8423051931823862, "grad_norm": 1.265625, "learning_rate": 0.0004664748080048537, "loss": 5.7328, "mean_token_accuracy": 0.17061990052461623, "num_tokens": 36035054.0, "step": 18430 }, { "entropy": 6.092377662658691, "epoch": 1.8428050182436149, "grad_norm": 1.15625, "learning_rate": 0.00046645606285523395, "loss": 5.7862, "mean_token_accuracy": 0.169942969083786, "num_tokens": 36045449.0, "step": 18435 }, { "entropy": 6.138909912109375, "epoch": 1.8433048433048433, "grad_norm": 1.1953125, "learning_rate": 0.00046643731288862884, "loss": 5.8266, "mean_token_accuracy": 0.1622672498226166, "num_tokens": 36055269.0, "step": 18440 }, { "entropy": 6.212170028686524, "epoch": 1.8438046683660718, "grad_norm": 1.328125, "learning_rate": 0.0004664185581055103, "loss": 5.9326, "mean_token_accuracy": 0.1618528373539448, "num_tokens": 36064791.0, "step": 18445 }, { "entropy": 6.112911081314087, "epoch": 1.8443044934273005, "grad_norm": 1.7421875, "learning_rate": 0.00046639979850634995, "loss": 5.7716, "mean_token_accuracy": 0.1615307152271271, "num_tokens": 36075583.0, "step": 18450 }, { "entropy": 6.145718288421631, "epoch": 1.844804318488529, "grad_norm": 1.34375, "learning_rate": 0.00046638103409162, "loss": 5.8473, "mean_token_accuracy": 0.16469219326972961, "num_tokens": 36084664.0, "step": 18455 }, { "entropy": 6.16836314201355, "epoch": 1.8453041435497575, "grad_norm": 1.4765625, "learning_rate": 0.00046636226486179244, "loss": 5.7805, "mean_token_accuracy": 0.17457810640335084, "num_tokens": 36094184.0, "step": 18460 }, { "entropy": 6.187822675704956, "epoch": 1.8458039686109862, "grad_norm": 1.3125, "learning_rate": 0.0004663434908173396, "loss": 5.7754, "mean_token_accuracy": 0.17000445276498793, "num_tokens": 36103148.0, "step": 18465 }, { "entropy": 6.136875057220459, "epoch": 1.8463037936722149, "grad_norm": 1.1640625, "learning_rate": 0.0004663247119587338, "loss": 5.7998, "mean_token_accuracy": 0.16611856520175933, "num_tokens": 36114268.0, "step": 18470 }, { "entropy": 6.129911613464356, "epoch": 1.8468036187334433, "grad_norm": 1.171875, "learning_rate": 0.0004663059282864474, "loss": 5.7838, "mean_token_accuracy": 0.1645222395658493, "num_tokens": 36124690.0, "step": 18475 }, { "entropy": 6.096324825286866, "epoch": 1.8473034437946718, "grad_norm": 1.453125, "learning_rate": 0.0004662871398009531, "loss": 5.78, "mean_token_accuracy": 0.16634131222963333, "num_tokens": 36134628.0, "step": 18480 }, { "entropy": 6.103436660766602, "epoch": 1.8478032688559005, "grad_norm": 1.2421875, "learning_rate": 0.0004662683465027235, "loss": 5.8313, "mean_token_accuracy": 0.1665041282773018, "num_tokens": 36144919.0, "step": 18485 }, { "entropy": 6.083250522613525, "epoch": 1.848303093917129, "grad_norm": 1.125, "learning_rate": 0.00046624954839223165, "loss": 5.7356, "mean_token_accuracy": 0.168557745218277, "num_tokens": 36154081.0, "step": 18490 }, { "entropy": 6.003883600234985, "epoch": 1.8488029189783575, "grad_norm": 1.21875, "learning_rate": 0.00046623074546995024, "loss": 5.7159, "mean_token_accuracy": 0.17256578356027602, "num_tokens": 36164318.0, "step": 18495 }, { "entropy": 6.084289598464966, "epoch": 1.8493027440395862, "grad_norm": 1.1484375, "learning_rate": 0.00046621193773635256, "loss": 5.8357, "mean_token_accuracy": 0.16844997107982634, "num_tokens": 36173361.0, "step": 18500 }, { "entropy": 6.026060676574707, "epoch": 1.8498025691008149, "grad_norm": 1.40625, "learning_rate": 0.0004661931251919118, "loss": 5.6809, "mean_token_accuracy": 0.17317914664745332, "num_tokens": 36183133.0, "step": 18505 }, { "entropy": 6.079961919784546, "epoch": 1.8503023941620433, "grad_norm": 1.265625, "learning_rate": 0.00046617430783710105, "loss": 5.7123, "mean_token_accuracy": 0.17176562249660493, "num_tokens": 36193041.0, "step": 18510 }, { "entropy": 6.0608189582824705, "epoch": 1.8508022192232718, "grad_norm": 1.21875, "learning_rate": 0.000466155485672394, "loss": 5.7104, "mean_token_accuracy": 0.17790914028882981, "num_tokens": 36202306.0, "step": 18515 }, { "entropy": 6.071835327148437, "epoch": 1.8513020442845005, "grad_norm": 1.46875, "learning_rate": 0.0004661366586982641, "loss": 5.7086, "mean_token_accuracy": 0.16952946037054062, "num_tokens": 36212342.0, "step": 18520 }, { "entropy": 6.106742095947266, "epoch": 1.851801869345729, "grad_norm": 1.1640625, "learning_rate": 0.0004661178269151851, "loss": 5.7914, "mean_token_accuracy": 0.1648620620369911, "num_tokens": 36221181.0, "step": 18525 }, { "entropy": 6.134703159332275, "epoch": 1.8523016944069575, "grad_norm": 1.1328125, "learning_rate": 0.00046609899032363074, "loss": 5.7942, "mean_token_accuracy": 0.17102007418870926, "num_tokens": 36230813.0, "step": 18530 }, { "entropy": 6.103135681152343, "epoch": 1.8528015194681862, "grad_norm": 1.2578125, "learning_rate": 0.0004660801489240749, "loss": 5.876, "mean_token_accuracy": 0.16575756371021272, "num_tokens": 36242315.0, "step": 18535 }, { "entropy": 6.129006624221802, "epoch": 1.8533013445294149, "grad_norm": 1.296875, "learning_rate": 0.00046606130271699175, "loss": 5.7499, "mean_token_accuracy": 0.17253651171922685, "num_tokens": 36253665.0, "step": 18540 }, { "entropy": 6.1301744937896725, "epoch": 1.8538011695906431, "grad_norm": 1.328125, "learning_rate": 0.0004660424517028553, "loss": 5.934, "mean_token_accuracy": 0.1596855565905571, "num_tokens": 36263514.0, "step": 18545 }, { "entropy": 6.052659749984741, "epoch": 1.8543009946518718, "grad_norm": 1.21875, "learning_rate": 0.00046602359588214, "loss": 5.7784, "mean_token_accuracy": 0.16314636170864105, "num_tokens": 36273103.0, "step": 18550 }, { "entropy": 6.138967132568359, "epoch": 1.8548008197131005, "grad_norm": 1.015625, "learning_rate": 0.0004660047352553202, "loss": 5.7852, "mean_token_accuracy": 0.1708177551627159, "num_tokens": 36283079.0, "step": 18555 }, { "entropy": 6.172525358200073, "epoch": 1.855300644774329, "grad_norm": 1.3125, "learning_rate": 0.00046598586982287034, "loss": 5.7928, "mean_token_accuracy": 0.16079241782426834, "num_tokens": 36292405.0, "step": 18560 }, { "entropy": 6.068410634994507, "epoch": 1.8558004698355575, "grad_norm": 1.1875, "learning_rate": 0.00046596699958526515, "loss": 5.7205, "mean_token_accuracy": 0.17415057122707367, "num_tokens": 36301516.0, "step": 18565 }, { "entropy": 6.092334651947022, "epoch": 1.8563002948967862, "grad_norm": 1.15625, "learning_rate": 0.00046594812454297944, "loss": 5.8532, "mean_token_accuracy": 0.16395721435546876, "num_tokens": 36311414.0, "step": 18570 }, { "entropy": 6.238265085220337, "epoch": 1.8568001199580149, "grad_norm": 1.2109375, "learning_rate": 0.000465929244696488, "loss": 5.93, "mean_token_accuracy": 0.1524401932954788, "num_tokens": 36321521.0, "step": 18575 }, { "entropy": 6.16213436126709, "epoch": 1.8572999450192431, "grad_norm": 1.171875, "learning_rate": 0.0004659103600462659, "loss": 5.849, "mean_token_accuracy": 0.16322463303804396, "num_tokens": 36331115.0, "step": 18580 }, { "entropy": 6.07241907119751, "epoch": 1.8577997700804718, "grad_norm": 1.109375, "learning_rate": 0.0004658914705927883, "loss": 5.8547, "mean_token_accuracy": 0.16690070927143097, "num_tokens": 36341131.0, "step": 18585 }, { "entropy": 6.022227096557617, "epoch": 1.8582995951417005, "grad_norm": 1.1953125, "learning_rate": 0.0004658725763365304, "loss": 5.6996, "mean_token_accuracy": 0.17466237992048264, "num_tokens": 36350378.0, "step": 18590 }, { "entropy": 6.046438407897949, "epoch": 1.858799420202929, "grad_norm": 1.1640625, "learning_rate": 0.0004658536772779676, "loss": 5.7458, "mean_token_accuracy": 0.16925732642412186, "num_tokens": 36359706.0, "step": 18595 }, { "entropy": 6.076794099807739, "epoch": 1.8592992452641575, "grad_norm": 1.1328125, "learning_rate": 0.0004658347734175754, "loss": 5.8235, "mean_token_accuracy": 0.16911087185144424, "num_tokens": 36370068.0, "step": 18600 }, { "entropy": 6.105840444564819, "epoch": 1.8597990703253862, "grad_norm": 1.140625, "learning_rate": 0.00046581586475582946, "loss": 5.768, "mean_token_accuracy": 0.16597312390804292, "num_tokens": 36380400.0, "step": 18605 }, { "entropy": 6.097484397888183, "epoch": 1.8602988953866146, "grad_norm": 1.2109375, "learning_rate": 0.0004657969512932054, "loss": 5.781, "mean_token_accuracy": 0.16529478132724762, "num_tokens": 36390114.0, "step": 18610 }, { "entropy": 6.085397386550904, "epoch": 1.8607987204478431, "grad_norm": 1.28125, "learning_rate": 0.0004657780330301791, "loss": 5.7142, "mean_token_accuracy": 0.17287175953388215, "num_tokens": 36399389.0, "step": 18615 }, { "entropy": 6.097321081161499, "epoch": 1.8612985455090718, "grad_norm": 1.296875, "learning_rate": 0.00046575910996722657, "loss": 5.7248, "mean_token_accuracy": 0.16774627119302749, "num_tokens": 36408512.0, "step": 18620 }, { "entropy": 6.1216953754425045, "epoch": 1.8617983705703005, "grad_norm": 1.1953125, "learning_rate": 0.000465740182104824, "loss": 5.9128, "mean_token_accuracy": 0.15857245475053788, "num_tokens": 36419049.0, "step": 18625 }, { "entropy": 6.070342063903809, "epoch": 1.862298195631529, "grad_norm": 1.2265625, "learning_rate": 0.00046572124944344745, "loss": 5.6508, "mean_token_accuracy": 0.17045060843229293, "num_tokens": 36428561.0, "step": 18630 }, { "entropy": 6.096560049057007, "epoch": 1.8627980206927575, "grad_norm": 1.1640625, "learning_rate": 0.00046570231198357344, "loss": 5.845, "mean_token_accuracy": 0.1630481779575348, "num_tokens": 36438346.0, "step": 18635 }, { "entropy": 6.10845627784729, "epoch": 1.8632978457539862, "grad_norm": 1.1015625, "learning_rate": 0.0004656833697256783, "loss": 5.7338, "mean_token_accuracy": 0.1745445817708969, "num_tokens": 36447756.0, "step": 18640 }, { "entropy": 6.075251960754395, "epoch": 1.8637976708152146, "grad_norm": 1.234375, "learning_rate": 0.0004656644226702386, "loss": 5.7395, "mean_token_accuracy": 0.17425116747617722, "num_tokens": 36457784.0, "step": 18645 }, { "entropy": 5.981507015228272, "epoch": 1.8642974958764431, "grad_norm": 1.34375, "learning_rate": 0.00046564547081773115, "loss": 5.7156, "mean_token_accuracy": 0.17283906787633896, "num_tokens": 36467952.0, "step": 18650 }, { "entropy": 6.193004608154297, "epoch": 1.8647973209376718, "grad_norm": 1.25, "learning_rate": 0.0004656265141686326, "loss": 5.9245, "mean_token_accuracy": 0.1537487730383873, "num_tokens": 36478595.0, "step": 18655 }, { "entropy": 6.0586381435394285, "epoch": 1.8652971459989005, "grad_norm": 1.21875, "learning_rate": 0.00046560755272342014, "loss": 5.6508, "mean_token_accuracy": 0.1800670802593231, "num_tokens": 36487866.0, "step": 18660 }, { "entropy": 6.111362266540527, "epoch": 1.865796971060129, "grad_norm": 1.109375, "learning_rate": 0.0004655885864825706, "loss": 5.7607, "mean_token_accuracy": 0.1629126936197281, "num_tokens": 36497828.0, "step": 18665 }, { "entropy": 6.075566673278809, "epoch": 1.8662967961213575, "grad_norm": 1.1171875, "learning_rate": 0.0004655696154465613, "loss": 5.7492, "mean_token_accuracy": 0.16650566458702087, "num_tokens": 36508361.0, "step": 18670 }, { "entropy": 6.049298715591431, "epoch": 1.8667966211825862, "grad_norm": 1.1953125, "learning_rate": 0.00046555063961586956, "loss": 5.6802, "mean_token_accuracy": 0.17370931506156922, "num_tokens": 36518458.0, "step": 18675 }, { "entropy": 6.047168207168579, "epoch": 1.8672964462438146, "grad_norm": 1.1796875, "learning_rate": 0.0004655316589909727, "loss": 5.7561, "mean_token_accuracy": 0.16698964387178422, "num_tokens": 36527952.0, "step": 18680 }, { "entropy": 6.062076091766357, "epoch": 1.867796271305043, "grad_norm": 1.2109375, "learning_rate": 0.0004655126735723484, "loss": 5.7971, "mean_token_accuracy": 0.16839283257722854, "num_tokens": 36537231.0, "step": 18685 }, { "entropy": 6.141802597045898, "epoch": 1.8682960963662718, "grad_norm": 1.2109375, "learning_rate": 0.00046549368336047415, "loss": 5.8468, "mean_token_accuracy": 0.16757193952798843, "num_tokens": 36546524.0, "step": 18690 }, { "entropy": 6.080959224700928, "epoch": 1.8687959214275005, "grad_norm": 1.2109375, "learning_rate": 0.0004654746883558279, "loss": 5.7305, "mean_token_accuracy": 0.17053497731685638, "num_tokens": 36557064.0, "step": 18695 }, { "entropy": 6.028773832321167, "epoch": 1.869295746488729, "grad_norm": 1.1796875, "learning_rate": 0.0004654556885588875, "loss": 5.6573, "mean_token_accuracy": 0.17342813163995743, "num_tokens": 36565986.0, "step": 18700 }, { "entropy": 6.128507804870606, "epoch": 1.8697955715499575, "grad_norm": 1.203125, "learning_rate": 0.00046543668397013103, "loss": 5.8362, "mean_token_accuracy": 0.16342108696699142, "num_tokens": 36575646.0, "step": 18705 }, { "entropy": 6.037174797058105, "epoch": 1.8702953966111862, "grad_norm": 1.265625, "learning_rate": 0.0004654176745900365, "loss": 5.7318, "mean_token_accuracy": 0.17030182033777236, "num_tokens": 36585472.0, "step": 18710 }, { "entropy": 6.100129556655884, "epoch": 1.8707952216724146, "grad_norm": 1.359375, "learning_rate": 0.00046539866041908233, "loss": 5.7323, "mean_token_accuracy": 0.17398363798856736, "num_tokens": 36594309.0, "step": 18715 }, { "entropy": 6.126501846313476, "epoch": 1.871295046733643, "grad_norm": 1.234375, "learning_rate": 0.00046537964145774687, "loss": 5.8495, "mean_token_accuracy": 0.16039469689130784, "num_tokens": 36604027.0, "step": 18720 }, { "entropy": 6.078078556060791, "epoch": 1.8717948717948718, "grad_norm": 1.15625, "learning_rate": 0.0004653606177065086, "loss": 5.7372, "mean_token_accuracy": 0.1676819607615471, "num_tokens": 36613613.0, "step": 18725 }, { "entropy": 6.124748706817627, "epoch": 1.8722946968561005, "grad_norm": 1.5703125, "learning_rate": 0.0004653415891658462, "loss": 5.8102, "mean_token_accuracy": 0.17030222862958908, "num_tokens": 36624049.0, "step": 18730 }, { "entropy": 6.12185263633728, "epoch": 1.872794521917329, "grad_norm": 1.2109375, "learning_rate": 0.00046532255583623837, "loss": 5.7799, "mean_token_accuracy": 0.16656329482793808, "num_tokens": 36634815.0, "step": 18735 }, { "entropy": 6.140682506561279, "epoch": 1.8732943469785575, "grad_norm": 1.2109375, "learning_rate": 0.000465303517718164, "loss": 5.8106, "mean_token_accuracy": 0.16147739291191102, "num_tokens": 36644701.0, "step": 18740 }, { "entropy": 6.033550548553467, "epoch": 1.8737941720397862, "grad_norm": 1.328125, "learning_rate": 0.0004652844748121021, "loss": 5.7288, "mean_token_accuracy": 0.17370669096708297, "num_tokens": 36653581.0, "step": 18745 }, { "entropy": 6.042649221420288, "epoch": 1.8742939971010146, "grad_norm": 1.1953125, "learning_rate": 0.0004652654271185318, "loss": 5.7928, "mean_token_accuracy": 0.1653350293636322, "num_tokens": 36662644.0, "step": 18750 }, { "entropy": 6.103317832946777, "epoch": 1.874793822162243, "grad_norm": 1.2578125, "learning_rate": 0.00046524637463793233, "loss": 5.798, "mean_token_accuracy": 0.16485292911529542, "num_tokens": 36673260.0, "step": 18755 }, { "entropy": 6.147920370101929, "epoch": 1.8752936472234718, "grad_norm": 1.1875, "learning_rate": 0.000465227317370783, "loss": 5.8545, "mean_token_accuracy": 0.16623802483081818, "num_tokens": 36682899.0, "step": 18760 }, { "entropy": 6.075865650177002, "epoch": 1.8757934722847005, "grad_norm": 1.2265625, "learning_rate": 0.00046520825531756326, "loss": 5.7828, "mean_token_accuracy": 0.1667063608765602, "num_tokens": 36693190.0, "step": 18765 }, { "entropy": 6.035709047317505, "epoch": 1.876293297345929, "grad_norm": 1.25, "learning_rate": 0.0004651891884787528, "loss": 5.6486, "mean_token_accuracy": 0.17097610086202622, "num_tokens": 36701263.0, "step": 18770 }, { "entropy": 6.069144153594971, "epoch": 1.8767931224071575, "grad_norm": 1.1328125, "learning_rate": 0.00046517011685483136, "loss": 5.7853, "mean_token_accuracy": 0.16177940219640732, "num_tokens": 36710622.0, "step": 18775 }, { "entropy": 6.090852212905884, "epoch": 1.8772929474683862, "grad_norm": 1.3828125, "learning_rate": 0.00046515104044627867, "loss": 5.7864, "mean_token_accuracy": 0.16395394802093505, "num_tokens": 36720510.0, "step": 18780 }, { "entropy": 6.030605506896973, "epoch": 1.8777927725296146, "grad_norm": 1.3203125, "learning_rate": 0.0004651319592535747, "loss": 5.8133, "mean_token_accuracy": 0.16223518401384354, "num_tokens": 36730570.0, "step": 18785 }, { "entropy": 6.120025396347046, "epoch": 1.878292597590843, "grad_norm": 1.203125, "learning_rate": 0.0004651128732771996, "loss": 5.7616, "mean_token_accuracy": 0.16895679086446763, "num_tokens": 36739834.0, "step": 18790 }, { "entropy": 6.080505084991455, "epoch": 1.8787924226520718, "grad_norm": 1.3828125, "learning_rate": 0.00046509378251763346, "loss": 5.6523, "mean_token_accuracy": 0.17071826308965682, "num_tokens": 36750193.0, "step": 18795 }, { "entropy": 6.12220311164856, "epoch": 1.8792922477133005, "grad_norm": 1.2734375, "learning_rate": 0.0004650746869753567, "loss": 5.772, "mean_token_accuracy": 0.1605657160282135, "num_tokens": 36759253.0, "step": 18800 }, { "entropy": 6.136216640472412, "epoch": 1.8797920727745288, "grad_norm": 1.203125, "learning_rate": 0.0004650555866508498, "loss": 5.8389, "mean_token_accuracy": 0.16491588205099106, "num_tokens": 36768841.0, "step": 18805 }, { "entropy": 6.093802881240845, "epoch": 1.8802918978357575, "grad_norm": 1.109375, "learning_rate": 0.00046503648154459315, "loss": 5.904, "mean_token_accuracy": 0.15969534516334533, "num_tokens": 36780146.0, "step": 18810 }, { "entropy": 6.149350309371949, "epoch": 1.8807917228969862, "grad_norm": 1.1875, "learning_rate": 0.0004650173716570676, "loss": 5.7935, "mean_token_accuracy": 0.1646161824464798, "num_tokens": 36789948.0, "step": 18815 }, { "entropy": 6.088639926910401, "epoch": 1.8812915479582146, "grad_norm": 1.375, "learning_rate": 0.00046499825698875384, "loss": 5.7006, "mean_token_accuracy": 0.17286859899759294, "num_tokens": 36799496.0, "step": 18820 }, { "entropy": 6.065236139297485, "epoch": 1.881791373019443, "grad_norm": 1.2265625, "learning_rate": 0.00046497913754013284, "loss": 5.7896, "mean_token_accuracy": 0.1652892604470253, "num_tokens": 36809905.0, "step": 18825 }, { "entropy": 6.074496936798096, "epoch": 1.8822911980806718, "grad_norm": 1.0546875, "learning_rate": 0.0004649600133116856, "loss": 5.7672, "mean_token_accuracy": 0.16325655877590178, "num_tokens": 36819855.0, "step": 18830 }, { "entropy": 6.11353554725647, "epoch": 1.8827910231419005, "grad_norm": 1.1171875, "learning_rate": 0.00046494088430389335, "loss": 5.7943, "mean_token_accuracy": 0.16365567594766617, "num_tokens": 36830456.0, "step": 18835 }, { "entropy": 5.9790726661682125, "epoch": 1.8832908482031288, "grad_norm": 1.203125, "learning_rate": 0.0004649217505172373, "loss": 5.7246, "mean_token_accuracy": 0.1732257917523384, "num_tokens": 36839914.0, "step": 18840 }, { "entropy": 6.0738489627838135, "epoch": 1.8837906732643575, "grad_norm": 1.234375, "learning_rate": 0.0004649026119521989, "loss": 5.6665, "mean_token_accuracy": 0.17092276513576507, "num_tokens": 36848644.0, "step": 18845 }, { "entropy": 6.0418110370635985, "epoch": 1.8842904983255861, "grad_norm": 1.2265625, "learning_rate": 0.00046488346860925955, "loss": 5.7595, "mean_token_accuracy": 0.17318593263626098, "num_tokens": 36857490.0, "step": 18850 }, { "entropy": 6.158822107315063, "epoch": 1.8847903233868146, "grad_norm": 1.2734375, "learning_rate": 0.00046486432048890104, "loss": 5.9476, "mean_token_accuracy": 0.15752012878656388, "num_tokens": 36867617.0, "step": 18855 }, { "entropy": 6.085655403137207, "epoch": 1.885290148448043, "grad_norm": 1.4296875, "learning_rate": 0.0004648451675916051, "loss": 5.7951, "mean_token_accuracy": 0.16660839021205903, "num_tokens": 36876626.0, "step": 18860 }, { "entropy": 6.133948707580567, "epoch": 1.8857899735092718, "grad_norm": 1.1328125, "learning_rate": 0.00046482600991785365, "loss": 5.8324, "mean_token_accuracy": 0.1593191958963871, "num_tokens": 36887693.0, "step": 18865 }, { "entropy": 6.188600635528564, "epoch": 1.8862897985705003, "grad_norm": 1.2578125, "learning_rate": 0.00046480684746812856, "loss": 5.8352, "mean_token_accuracy": 0.1673351749777794, "num_tokens": 36897817.0, "step": 18870 }, { "entropy": 6.090949964523316, "epoch": 1.8867896236317288, "grad_norm": 1.2578125, "learning_rate": 0.00046478768024291205, "loss": 5.7639, "mean_token_accuracy": 0.1682679161429405, "num_tokens": 36908154.0, "step": 18875 }, { "entropy": 6.0715961933135985, "epoch": 1.8872894486929574, "grad_norm": 1.171875, "learning_rate": 0.00046476850824268633, "loss": 5.7626, "mean_token_accuracy": 0.1669762521982193, "num_tokens": 36917748.0, "step": 18880 }, { "entropy": 6.0552294731140135, "epoch": 1.8877892737541861, "grad_norm": 1.1484375, "learning_rate": 0.0004647493314679338, "loss": 5.7772, "mean_token_accuracy": 0.17492305785417556, "num_tokens": 36927128.0, "step": 18885 }, { "entropy": 6.039291477203369, "epoch": 1.8882890988154146, "grad_norm": 1.1484375, "learning_rate": 0.000464730149919137, "loss": 5.7015, "mean_token_accuracy": 0.17666176557540894, "num_tokens": 36936822.0, "step": 18890 }, { "entropy": 6.166332101821899, "epoch": 1.888788923876643, "grad_norm": 1.1484375, "learning_rate": 0.0004647109635967783, "loss": 5.8238, "mean_token_accuracy": 0.16208354383707047, "num_tokens": 36946781.0, "step": 18895 }, { "entropy": 6.078222799301147, "epoch": 1.8892887489378718, "grad_norm": 1.21875, "learning_rate": 0.0004646917725013406, "loss": 5.7449, "mean_token_accuracy": 0.17030898183584214, "num_tokens": 36956998.0, "step": 18900 }, { "entropy": 6.105315685272217, "epoch": 1.8897885739991003, "grad_norm": 1.1328125, "learning_rate": 0.0004646725766333068, "loss": 5.7804, "mean_token_accuracy": 0.16810195446014403, "num_tokens": 36966138.0, "step": 18905 }, { "entropy": 6.039903783798218, "epoch": 1.8902883990603288, "grad_norm": 1.234375, "learning_rate": 0.00046465337599315966, "loss": 5.7562, "mean_token_accuracy": 0.17383481562137604, "num_tokens": 36976282.0, "step": 18910 }, { "entropy": 6.151530170440674, "epoch": 1.8907882241215574, "grad_norm": 1.1484375, "learning_rate": 0.00046463417058138247, "loss": 5.8076, "mean_token_accuracy": 0.16685803681612016, "num_tokens": 36986795.0, "step": 18915 }, { "entropy": 6.017239570617676, "epoch": 1.8912880491827861, "grad_norm": 1.1953125, "learning_rate": 0.0004646149603984583, "loss": 5.7734, "mean_token_accuracy": 0.16728876978158952, "num_tokens": 36997334.0, "step": 18920 }, { "entropy": 6.038569355010987, "epoch": 1.8917878742440146, "grad_norm": 1.2890625, "learning_rate": 0.0004645957454448706, "loss": 5.7026, "mean_token_accuracy": 0.17006948590278625, "num_tokens": 37006978.0, "step": 18925 }, { "entropy": 6.0481446266174315, "epoch": 1.892287699305243, "grad_norm": 1.21875, "learning_rate": 0.0004645765257211026, "loss": 5.7242, "mean_token_accuracy": 0.17828518599271775, "num_tokens": 37016821.0, "step": 18930 }, { "entropy": 6.051163148880005, "epoch": 1.8927875243664718, "grad_norm": 1.125, "learning_rate": 0.00046455730122763804, "loss": 5.7235, "mean_token_accuracy": 0.1725027248263359, "num_tokens": 37026596.0, "step": 18935 }, { "entropy": 6.071281147003174, "epoch": 1.8932873494277003, "grad_norm": 1.203125, "learning_rate": 0.0004645380719649606, "loss": 5.753, "mean_token_accuracy": 0.16666456311941147, "num_tokens": 37035899.0, "step": 18940 }, { "entropy": 6.077476072311401, "epoch": 1.8937871744889287, "grad_norm": 1.265625, "learning_rate": 0.00046451883793355406, "loss": 5.8492, "mean_token_accuracy": 0.1599900372326374, "num_tokens": 37045747.0, "step": 18945 }, { "entropy": 6.088874101638794, "epoch": 1.8942869995501574, "grad_norm": 1.171875, "learning_rate": 0.00046449959913390227, "loss": 5.8121, "mean_token_accuracy": 0.1613006740808487, "num_tokens": 37056673.0, "step": 18950 }, { "entropy": 6.0792169094085695, "epoch": 1.8947868246113861, "grad_norm": 1.1640625, "learning_rate": 0.00046448035556648936, "loss": 5.7857, "mean_token_accuracy": 0.16731211990118028, "num_tokens": 37065375.0, "step": 18955 }, { "entropy": 6.117296123504639, "epoch": 1.8952866496726146, "grad_norm": 1.3203125, "learning_rate": 0.00046446110723179945, "loss": 5.7348, "mean_token_accuracy": 0.17575096040964128, "num_tokens": 37074088.0, "step": 18960 }, { "entropy": 6.024017429351806, "epoch": 1.895786474733843, "grad_norm": 1.2265625, "learning_rate": 0.0004644418541303169, "loss": 5.7419, "mean_token_accuracy": 0.16408663541078566, "num_tokens": 37085418.0, "step": 18965 }, { "entropy": 6.117145347595215, "epoch": 1.8962862997950718, "grad_norm": 1.21875, "learning_rate": 0.00046442259626252593, "loss": 5.8237, "mean_token_accuracy": 0.16434903889894487, "num_tokens": 37095029.0, "step": 18970 }, { "entropy": 6.1155232906341555, "epoch": 1.8967861248563003, "grad_norm": 1.171875, "learning_rate": 0.00046440333362891123, "loss": 5.732, "mean_token_accuracy": 0.17899542003870011, "num_tokens": 37104398.0, "step": 18975 }, { "entropy": 6.187513732910157, "epoch": 1.8972859499175287, "grad_norm": 1.234375, "learning_rate": 0.0004643840662299574, "loss": 5.8447, "mean_token_accuracy": 0.16368479281663895, "num_tokens": 37114546.0, "step": 18980 }, { "entropy": 6.042089605331421, "epoch": 1.8977857749787574, "grad_norm": 1.28125, "learning_rate": 0.0004643647940661492, "loss": 5.7175, "mean_token_accuracy": 0.1786101996898651, "num_tokens": 37124113.0, "step": 18985 }, { "entropy": 6.0935453414917, "epoch": 1.8982856000399861, "grad_norm": 1.2265625, "learning_rate": 0.00046434551713797146, "loss": 5.7891, "mean_token_accuracy": 0.16713183224201203, "num_tokens": 37133661.0, "step": 18990 }, { "entropy": 6.105218839645386, "epoch": 1.8987854251012146, "grad_norm": 1.34375, "learning_rate": 0.0004643262354459093, "loss": 5.8121, "mean_token_accuracy": 0.16666805893182754, "num_tokens": 37143987.0, "step": 18995 }, { "entropy": 6.182411479949951, "epoch": 1.899285250162443, "grad_norm": 1.1640625, "learning_rate": 0.00046430694899044774, "loss": 5.8779, "mean_token_accuracy": 0.16336581334471703, "num_tokens": 37153227.0, "step": 19000 }, { "entropy": 6.154174709320069, "epoch": 1.8997850752236718, "grad_norm": 1.21875, "learning_rate": 0.000464287657772072, "loss": 5.8333, "mean_token_accuracy": 0.16556011885404587, "num_tokens": 37162524.0, "step": 19005 }, { "entropy": 6.06543869972229, "epoch": 1.9002849002849003, "grad_norm": 1.1796875, "learning_rate": 0.0004642683617912676, "loss": 5.7571, "mean_token_accuracy": 0.17216623276472093, "num_tokens": 37172729.0, "step": 19010 }, { "entropy": 6.039314031600952, "epoch": 1.9007847253461287, "grad_norm": 1.1015625, "learning_rate": 0.00046424906104851994, "loss": 5.718, "mean_token_accuracy": 0.17060794085264205, "num_tokens": 37182561.0, "step": 19015 }, { "entropy": 6.141635990142822, "epoch": 1.9012845504073574, "grad_norm": 1.2109375, "learning_rate": 0.00046422975554431453, "loss": 5.8134, "mean_token_accuracy": 0.16745396703481674, "num_tokens": 37192089.0, "step": 19020 }, { "entropy": 6.0860066413879395, "epoch": 1.9017843754685861, "grad_norm": 1.25, "learning_rate": 0.00046421044527913713, "loss": 5.7596, "mean_token_accuracy": 0.1681295409798622, "num_tokens": 37200739.0, "step": 19025 }, { "entropy": 6.11237940788269, "epoch": 1.9022842005298146, "grad_norm": 1.21875, "learning_rate": 0.0004641911302534737, "loss": 5.8063, "mean_token_accuracy": 0.16357001662254333, "num_tokens": 37209507.0, "step": 19030 }, { "entropy": 6.072798156738282, "epoch": 1.902784025591043, "grad_norm": 1.1328125, "learning_rate": 0.00046417181046781004, "loss": 5.7648, "mean_token_accuracy": 0.17092804610729218, "num_tokens": 37219252.0, "step": 19035 }, { "entropy": 6.075875186920166, "epoch": 1.9032838506522718, "grad_norm": 1.1875, "learning_rate": 0.0004641524859226324, "loss": 5.7191, "mean_token_accuracy": 0.17003142535686494, "num_tokens": 37229925.0, "step": 19040 }, { "entropy": 6.006577968597412, "epoch": 1.9037836757135003, "grad_norm": 1.0625, "learning_rate": 0.00046413315661842676, "loss": 5.7709, "mean_token_accuracy": 0.17010821849107743, "num_tokens": 37239513.0, "step": 19045 }, { "entropy": 6.093907403945923, "epoch": 1.9042835007747287, "grad_norm": 1.125, "learning_rate": 0.0004641138225556797, "loss": 5.7381, "mean_token_accuracy": 0.17301941514015198, "num_tokens": 37249143.0, "step": 19050 }, { "entropy": 6.126611280441284, "epoch": 1.9047833258359574, "grad_norm": 1.4609375, "learning_rate": 0.0004640944837348774, "loss": 5.7397, "mean_token_accuracy": 0.1657972514629364, "num_tokens": 37258834.0, "step": 19055 }, { "entropy": 6.088424158096314, "epoch": 1.9052831508971861, "grad_norm": 1.3046875, "learning_rate": 0.00046407514015650667, "loss": 5.8048, "mean_token_accuracy": 0.1649680331349373, "num_tokens": 37269554.0, "step": 19060 }, { "entropy": 6.117116069793701, "epoch": 1.9057829759584144, "grad_norm": 1.2109375, "learning_rate": 0.00046405579182105393, "loss": 5.7746, "mean_token_accuracy": 0.16499934643507003, "num_tokens": 37278842.0, "step": 19065 }, { "entropy": 6.035621976852417, "epoch": 1.906282801019643, "grad_norm": 1.7109375, "learning_rate": 0.0004640364387290062, "loss": 5.7368, "mean_token_accuracy": 0.17661378234624864, "num_tokens": 37289056.0, "step": 19070 }, { "entropy": 6.041466236114502, "epoch": 1.9067826260808718, "grad_norm": 1.21875, "learning_rate": 0.00046401708088085036, "loss": 5.7654, "mean_token_accuracy": 0.17235675901174546, "num_tokens": 37298823.0, "step": 19075 }, { "entropy": 6.128154611587524, "epoch": 1.9072824511421003, "grad_norm": 1.1328125, "learning_rate": 0.00046399771827707335, "loss": 5.8947, "mean_token_accuracy": 0.16330674067139625, "num_tokens": 37310065.0, "step": 19080 }, { "entropy": 6.1373449802398685, "epoch": 1.9077822762033287, "grad_norm": 1.1640625, "learning_rate": 0.00046397835091816235, "loss": 5.7815, "mean_token_accuracy": 0.16305789053440095, "num_tokens": 37320856.0, "step": 19085 }, { "entropy": 6.117679166793823, "epoch": 1.9082821012645574, "grad_norm": 1.046875, "learning_rate": 0.00046395897880460474, "loss": 5.7914, "mean_token_accuracy": 0.17044728845357895, "num_tokens": 37330705.0, "step": 19090 }, { "entropy": 6.041719961166382, "epoch": 1.9087819263257861, "grad_norm": 1.1640625, "learning_rate": 0.00046393960193688783, "loss": 5.7887, "mean_token_accuracy": 0.17170997709035873, "num_tokens": 37339450.0, "step": 19095 }, { "entropy": 6.013335561752319, "epoch": 1.9092817513870144, "grad_norm": 1.09375, "learning_rate": 0.00046392022031549907, "loss": 5.7649, "mean_token_accuracy": 0.1751130223274231, "num_tokens": 37349173.0, "step": 19100 }, { "entropy": 6.113027095794678, "epoch": 1.909781576448243, "grad_norm": 1.0859375, "learning_rate": 0.0004639008339409263, "loss": 5.8711, "mean_token_accuracy": 0.15661650896072388, "num_tokens": 37359246.0, "step": 19105 }, { "entropy": 6.167144727706909, "epoch": 1.9102814015094718, "grad_norm": 1.28125, "learning_rate": 0.0004638814428136571, "loss": 5.839, "mean_token_accuracy": 0.16727360785007478, "num_tokens": 37368056.0, "step": 19110 }, { "entropy": 6.2536163330078125, "epoch": 1.9107812265707003, "grad_norm": 1.203125, "learning_rate": 0.0004638620469341794, "loss": 6.0299, "mean_token_accuracy": 0.15128510296344758, "num_tokens": 37377997.0, "step": 19115 }, { "entropy": 6.076793003082275, "epoch": 1.9112810516319287, "grad_norm": 1.3046875, "learning_rate": 0.0004638426463029812, "loss": 5.7175, "mean_token_accuracy": 0.17027703076601028, "num_tokens": 37387365.0, "step": 19120 }, { "entropy": 6.069569301605225, "epoch": 1.9117808766931574, "grad_norm": 1.1953125, "learning_rate": 0.0004638232409205506, "loss": 5.7645, "mean_token_accuracy": 0.1706135168671608, "num_tokens": 37396649.0, "step": 19125 }, { "entropy": 6.111767292022705, "epoch": 1.912280701754386, "grad_norm": 1.1953125, "learning_rate": 0.00046380383078737584, "loss": 5.8847, "mean_token_accuracy": 0.1548004314303398, "num_tokens": 37407576.0, "step": 19130 }, { "entropy": 6.119776773452759, "epoch": 1.9127805268156144, "grad_norm": 1.2421875, "learning_rate": 0.00046378441590394525, "loss": 5.7956, "mean_token_accuracy": 0.16432779282331467, "num_tokens": 37419270.0, "step": 19135 }, { "entropy": 6.1692718982696535, "epoch": 1.913280351876843, "grad_norm": 1.171875, "learning_rate": 0.0004637649962707474, "loss": 5.8315, "mean_token_accuracy": 0.15893989354372023, "num_tokens": 37429155.0, "step": 19140 }, { "entropy": 6.0986082553863525, "epoch": 1.9137801769380718, "grad_norm": 1.1640625, "learning_rate": 0.00046374557188827084, "loss": 5.8245, "mean_token_accuracy": 0.1676712229847908, "num_tokens": 37439952.0, "step": 19145 }, { "entropy": 6.105557060241699, "epoch": 1.9142800019993003, "grad_norm": 1.2421875, "learning_rate": 0.0004637261427570042, "loss": 5.7664, "mean_token_accuracy": 0.16891346126794815, "num_tokens": 37449537.0, "step": 19150 }, { "entropy": 6.082227325439453, "epoch": 1.9147798270605287, "grad_norm": 1.21875, "learning_rate": 0.0004637067088774364, "loss": 5.8031, "mean_token_accuracy": 0.1688046395778656, "num_tokens": 37460202.0, "step": 19155 }, { "entropy": 6.060595464706421, "epoch": 1.9152796521217574, "grad_norm": 1.1953125, "learning_rate": 0.00046368727025005634, "loss": 5.7382, "mean_token_accuracy": 0.17145115584135057, "num_tokens": 37469715.0, "step": 19160 }, { "entropy": 6.085369205474853, "epoch": 1.915779477182986, "grad_norm": 1.1953125, "learning_rate": 0.00046366782687535315, "loss": 5.8157, "mean_token_accuracy": 0.1623654454946518, "num_tokens": 37478495.0, "step": 19165 }, { "entropy": 6.141348552703858, "epoch": 1.9162793022442144, "grad_norm": 1.2265625, "learning_rate": 0.000463648378753816, "loss": 5.8522, "mean_token_accuracy": 0.16692102402448655, "num_tokens": 37488125.0, "step": 19170 }, { "entropy": 6.052528238296508, "epoch": 1.916779127305443, "grad_norm": 1.1875, "learning_rate": 0.00046362892588593406, "loss": 5.6938, "mean_token_accuracy": 0.17493156492710113, "num_tokens": 37498097.0, "step": 19175 }, { "entropy": 6.071595907211304, "epoch": 1.9172789523666718, "grad_norm": 1.3359375, "learning_rate": 0.00046360946827219703, "loss": 5.8315, "mean_token_accuracy": 0.16990201622247697, "num_tokens": 37507713.0, "step": 19180 }, { "entropy": 6.10126256942749, "epoch": 1.9177787774279003, "grad_norm": 1.1484375, "learning_rate": 0.0004635900059130942, "loss": 5.8645, "mean_token_accuracy": 0.16321151852607726, "num_tokens": 37517862.0, "step": 19185 }, { "entropy": 6.0855896949768065, "epoch": 1.9182786024891287, "grad_norm": 1.0234375, "learning_rate": 0.0004635705388091154, "loss": 5.784, "mean_token_accuracy": 0.16281318962574004, "num_tokens": 37528988.0, "step": 19190 }, { "entropy": 6.123889636993408, "epoch": 1.9187784275503574, "grad_norm": 1.1484375, "learning_rate": 0.0004635510669607504, "loss": 5.8935, "mean_token_accuracy": 0.16121604889631272, "num_tokens": 37538467.0, "step": 19195 }, { "entropy": 6.134555768966675, "epoch": 1.919278252611586, "grad_norm": 1.2109375, "learning_rate": 0.000463531590368489, "loss": 5.7353, "mean_token_accuracy": 0.16187530755996704, "num_tokens": 37547986.0, "step": 19200 }, { "entropy": 6.101825904846192, "epoch": 1.9197780776728144, "grad_norm": 1.1953125, "learning_rate": 0.00046351210903282136, "loss": 5.8592, "mean_token_accuracy": 0.1670591041445732, "num_tokens": 37557403.0, "step": 19205 }, { "entropy": 6.134406423568725, "epoch": 1.920277902734043, "grad_norm": 1.296875, "learning_rate": 0.00046349262295423754, "loss": 5.8555, "mean_token_accuracy": 0.16069888770580293, "num_tokens": 37568504.0, "step": 19210 }, { "entropy": 6.062772655487061, "epoch": 1.9207777277952718, "grad_norm": 1.234375, "learning_rate": 0.00046347313213322786, "loss": 5.7636, "mean_token_accuracy": 0.17281778156757355, "num_tokens": 37577816.0, "step": 19215 }, { "entropy": 6.050261497497559, "epoch": 1.9212775528565003, "grad_norm": 1.1796875, "learning_rate": 0.0004634536365702826, "loss": 5.7184, "mean_token_accuracy": 0.1725157156586647, "num_tokens": 37587315.0, "step": 19220 }, { "entropy": 6.193058490753174, "epoch": 1.9217773779177287, "grad_norm": 1.1015625, "learning_rate": 0.00046343413626589243, "loss": 5.8543, "mean_token_accuracy": 0.15970131307840346, "num_tokens": 37597708.0, "step": 19225 }, { "entropy": 6.057876300811768, "epoch": 1.9222772029789574, "grad_norm": 1.0859375, "learning_rate": 0.0004634146312205478, "loss": 5.6911, "mean_token_accuracy": 0.17779562324285508, "num_tokens": 37608093.0, "step": 19230 }, { "entropy": 6.017205905914307, "epoch": 1.922777028040186, "grad_norm": 1.234375, "learning_rate": 0.00046339512143473956, "loss": 5.7173, "mean_token_accuracy": 0.16652730405330657, "num_tokens": 37617742.0, "step": 19235 }, { "entropy": 6.091655206680298, "epoch": 1.9232768531014144, "grad_norm": 1.2265625, "learning_rate": 0.00046337560690895856, "loss": 5.7701, "mean_token_accuracy": 0.17033307552337645, "num_tokens": 37626999.0, "step": 19240 }, { "entropy": 6.101268243789673, "epoch": 1.923776678162643, "grad_norm": 1.1796875, "learning_rate": 0.00046335608764369574, "loss": 5.8902, "mean_token_accuracy": 0.1596827283501625, "num_tokens": 37638142.0, "step": 19245 }, { "entropy": 6.0942178726196286, "epoch": 1.9242765032238718, "grad_norm": 1.1640625, "learning_rate": 0.00046333656363944226, "loss": 5.7839, "mean_token_accuracy": 0.1665309727191925, "num_tokens": 37647373.0, "step": 19250 }, { "entropy": 6.026559448242187, "epoch": 1.9247763282851003, "grad_norm": 1.265625, "learning_rate": 0.00046331703489668925, "loss": 5.7332, "mean_token_accuracy": 0.17193515747785568, "num_tokens": 37658677.0, "step": 19255 }, { "entropy": 6.036960935592651, "epoch": 1.9252761533463287, "grad_norm": 1.1015625, "learning_rate": 0.00046329750141592814, "loss": 5.6445, "mean_token_accuracy": 0.173639877140522, "num_tokens": 37668344.0, "step": 19260 }, { "entropy": 6.037993574142456, "epoch": 1.9257759784075574, "grad_norm": 1.1953125, "learning_rate": 0.0004632779631976503, "loss": 5.7591, "mean_token_accuracy": 0.1612626925110817, "num_tokens": 37678000.0, "step": 19265 }, { "entropy": 6.104062128067016, "epoch": 1.926275803468786, "grad_norm": 1.3125, "learning_rate": 0.00046325842024234735, "loss": 5.8894, "mean_token_accuracy": 0.15996284782886505, "num_tokens": 37688404.0, "step": 19270 }, { "entropy": 6.186236000061035, "epoch": 1.9267756285300144, "grad_norm": 1.171875, "learning_rate": 0.00046323887255051105, "loss": 5.834, "mean_token_accuracy": 0.16601556837558745, "num_tokens": 37697699.0, "step": 19275 }, { "entropy": 6.128203916549682, "epoch": 1.927275453591243, "grad_norm": 1.3671875, "learning_rate": 0.00046321932012263317, "loss": 5.7183, "mean_token_accuracy": 0.16982564330101013, "num_tokens": 37707261.0, "step": 19280 }, { "entropy": 6.034725522994995, "epoch": 1.9277752786524718, "grad_norm": 1.1640625, "learning_rate": 0.0004631997629592055, "loss": 5.7077, "mean_token_accuracy": 0.1732149377465248, "num_tokens": 37716500.0, "step": 19285 }, { "entropy": 5.94683346748352, "epoch": 1.9282751037137003, "grad_norm": 1.2109375, "learning_rate": 0.0004631802010607204, "loss": 5.6675, "mean_token_accuracy": 0.17550969868898392, "num_tokens": 37725881.0, "step": 19290 }, { "entropy": 6.003698444366455, "epoch": 1.9287749287749287, "grad_norm": 1.375, "learning_rate": 0.00046316063442766975, "loss": 5.7643, "mean_token_accuracy": 0.17130634784698487, "num_tokens": 37736233.0, "step": 19295 }, { "entropy": 6.118240880966186, "epoch": 1.9292747538361574, "grad_norm": 1.0625, "learning_rate": 0.00046314106306054596, "loss": 5.8024, "mean_token_accuracy": 0.16201290041208266, "num_tokens": 37747230.0, "step": 19300 }, { "entropy": 6.108151483535766, "epoch": 1.929774578897386, "grad_norm": 1.1640625, "learning_rate": 0.00046312148695984147, "loss": 5.7781, "mean_token_accuracy": 0.16905944645404816, "num_tokens": 37758470.0, "step": 19305 }, { "entropy": 6.193495512008667, "epoch": 1.9302744039586144, "grad_norm": 1.3203125, "learning_rate": 0.0004631019061260488, "loss": 5.902, "mean_token_accuracy": 0.16572934985160828, "num_tokens": 37767912.0, "step": 19310 }, { "entropy": 6.095262813568115, "epoch": 1.930774229019843, "grad_norm": 1.234375, "learning_rate": 0.0004630823205596605, "loss": 5.7327, "mean_token_accuracy": 0.17267486602067947, "num_tokens": 37776847.0, "step": 19315 }, { "entropy": 6.104116201400757, "epoch": 1.9312740540810718, "grad_norm": 1.203125, "learning_rate": 0.00046306273026116944, "loss": 5.8301, "mean_token_accuracy": 0.16072382628917695, "num_tokens": 37786960.0, "step": 19320 }, { "entropy": 6.04428129196167, "epoch": 1.9317738791423, "grad_norm": 1.1875, "learning_rate": 0.0004630431352310685, "loss": 5.8073, "mean_token_accuracy": 0.16352638304233552, "num_tokens": 37797007.0, "step": 19325 }, { "entropy": 6.0544764518737795, "epoch": 1.9322737042035287, "grad_norm": 1.1796875, "learning_rate": 0.00046302353546985066, "loss": 5.7236, "mean_token_accuracy": 0.1736273318529129, "num_tokens": 37806877.0, "step": 19330 }, { "entropy": 6.091245126724243, "epoch": 1.9327735292647574, "grad_norm": 1.21875, "learning_rate": 0.000463003930978009, "loss": 5.7147, "mean_token_accuracy": 0.16820840686559677, "num_tokens": 37815513.0, "step": 19335 }, { "entropy": 6.044360828399658, "epoch": 1.933273354325986, "grad_norm": 1.1953125, "learning_rate": 0.0004629843217560369, "loss": 5.7264, "mean_token_accuracy": 0.17193932384252547, "num_tokens": 37825240.0, "step": 19340 }, { "entropy": 6.142752981185913, "epoch": 1.9337731793872144, "grad_norm": 1.2421875, "learning_rate": 0.0004629647078044276, "loss": 5.7829, "mean_token_accuracy": 0.1690118968486786, "num_tokens": 37834333.0, "step": 19345 }, { "entropy": 6.110094308853149, "epoch": 1.934273004448443, "grad_norm": 1.421875, "learning_rate": 0.0004629450891236746, "loss": 5.7513, "mean_token_accuracy": 0.17380376905202866, "num_tokens": 37844548.0, "step": 19350 }, { "entropy": 6.084015226364135, "epoch": 1.9347728295096718, "grad_norm": 1.15625, "learning_rate": 0.0004629254657142715, "loss": 5.7454, "mean_token_accuracy": 0.1717337504029274, "num_tokens": 37853995.0, "step": 19355 }, { "entropy": 6.138976335525513, "epoch": 1.9352726545709, "grad_norm": 1.1796875, "learning_rate": 0.0004629058375767121, "loss": 5.8263, "mean_token_accuracy": 0.16265249401330947, "num_tokens": 37863472.0, "step": 19360 }, { "entropy": 6.130089807510376, "epoch": 1.9357724796321287, "grad_norm": 1.21875, "learning_rate": 0.00046288620471149014, "loss": 5.777, "mean_token_accuracy": 0.17358509451150894, "num_tokens": 37872690.0, "step": 19365 }, { "entropy": 6.146674728393554, "epoch": 1.9362723046933574, "grad_norm": 1.2109375, "learning_rate": 0.00046286656711909966, "loss": 5.8249, "mean_token_accuracy": 0.16314180791378022, "num_tokens": 37882296.0, "step": 19370 }, { "entropy": 6.088172340393067, "epoch": 1.936772129754586, "grad_norm": 1.3046875, "learning_rate": 0.00046284692480003467, "loss": 5.7649, "mean_token_accuracy": 0.16607498824596406, "num_tokens": 37891612.0, "step": 19375 }, { "entropy": 6.097758626937866, "epoch": 1.9372719548158144, "grad_norm": 1.1875, "learning_rate": 0.00046282727775478935, "loss": 5.7304, "mean_token_accuracy": 0.17140215933322905, "num_tokens": 37901107.0, "step": 19380 }, { "entropy": 6.091467189788818, "epoch": 1.937771779877043, "grad_norm": 1.2421875, "learning_rate": 0.0004628076259838581, "loss": 5.9028, "mean_token_accuracy": 0.1621468558907509, "num_tokens": 37912020.0, "step": 19385 }, { "entropy": 6.037467622756958, "epoch": 1.9382716049382716, "grad_norm": 1.15625, "learning_rate": 0.00046278796948773525, "loss": 5.7536, "mean_token_accuracy": 0.17437849044799805, "num_tokens": 37922681.0, "step": 19390 }, { "entropy": 6.124039649963379, "epoch": 1.9387714299995, "grad_norm": 1.1640625, "learning_rate": 0.00046276830826691553, "loss": 5.7924, "mean_token_accuracy": 0.1664620965719223, "num_tokens": 37934322.0, "step": 19395 }, { "entropy": 6.036565446853638, "epoch": 1.9392712550607287, "grad_norm": 1.0625, "learning_rate": 0.00046274864232189334, "loss": 5.7667, "mean_token_accuracy": 0.17003995478153228, "num_tokens": 37945028.0, "step": 19400 }, { "entropy": 6.036530685424805, "epoch": 1.9397710801219574, "grad_norm": 1.203125, "learning_rate": 0.00046272897165316367, "loss": 5.6758, "mean_token_accuracy": 0.1754847690463066, "num_tokens": 37955055.0, "step": 19405 }, { "entropy": 6.131713819503784, "epoch": 1.940270905183186, "grad_norm": 1.171875, "learning_rate": 0.0004627092962612215, "loss": 5.8484, "mean_token_accuracy": 0.16468506157398224, "num_tokens": 37966018.0, "step": 19410 }, { "entropy": 6.098749351501465, "epoch": 1.9407707302444144, "grad_norm": 1.2109375, "learning_rate": 0.0004626896161465616, "loss": 5.7561, "mean_token_accuracy": 0.17312566936016083, "num_tokens": 37975541.0, "step": 19415 }, { "entropy": 6.1257905006408695, "epoch": 1.941270555305643, "grad_norm": 1.234375, "learning_rate": 0.00046266993130967925, "loss": 5.8022, "mean_token_accuracy": 0.16003427356481553, "num_tokens": 37986312.0, "step": 19420 }, { "entropy": 6.069368553161621, "epoch": 1.9417703803668716, "grad_norm": 1.1953125, "learning_rate": 0.0004626502417510698, "loss": 5.7794, "mean_token_accuracy": 0.1684298425912857, "num_tokens": 37994717.0, "step": 19425 }, { "entropy": 6.094864273071289, "epoch": 1.9422702054281, "grad_norm": 1.109375, "learning_rate": 0.00046263054747122857, "loss": 5.8606, "mean_token_accuracy": 0.16345838755369185, "num_tokens": 38004282.0, "step": 19430 }, { "entropy": 6.127002096176147, "epoch": 1.9427700304893287, "grad_norm": 1.1328125, "learning_rate": 0.0004626108484706509, "loss": 5.7889, "mean_token_accuracy": 0.1696387767791748, "num_tokens": 38013255.0, "step": 19435 }, { "entropy": 6.137980842590332, "epoch": 1.9432698555505574, "grad_norm": 1.1171875, "learning_rate": 0.00046259114474983266, "loss": 5.7839, "mean_token_accuracy": 0.16523623019456862, "num_tokens": 38023041.0, "step": 19440 }, { "entropy": 6.115823078155517, "epoch": 1.943769680611786, "grad_norm": 1.15625, "learning_rate": 0.00046257143630926953, "loss": 5.7663, "mean_token_accuracy": 0.16982554346323014, "num_tokens": 38032193.0, "step": 19445 }, { "entropy": 6.053232145309448, "epoch": 1.9442695056730144, "grad_norm": 1.1953125, "learning_rate": 0.0004625517231494573, "loss": 5.7732, "mean_token_accuracy": 0.1650831401348114, "num_tokens": 38041470.0, "step": 19450 }, { "entropy": 5.935981559753418, "epoch": 1.944769330734243, "grad_norm": 1.6328125, "learning_rate": 0.0004625320052708919, "loss": 5.6279, "mean_token_accuracy": 0.18212861120700835, "num_tokens": 38051997.0, "step": 19455 }, { "entropy": 6.043599557876587, "epoch": 1.9452691557954715, "grad_norm": 1.234375, "learning_rate": 0.0004625122826740696, "loss": 5.7811, "mean_token_accuracy": 0.17515923380851744, "num_tokens": 38061418.0, "step": 19460 }, { "entropy": 6.059353303909302, "epoch": 1.9457689808567, "grad_norm": 1.1875, "learning_rate": 0.0004624925553594865, "loss": 5.6931, "mean_token_accuracy": 0.1744915008544922, "num_tokens": 38070853.0, "step": 19465 }, { "entropy": 6.147614288330078, "epoch": 1.9462688059179287, "grad_norm": 1.234375, "learning_rate": 0.0004624728233276389, "loss": 5.8105, "mean_token_accuracy": 0.16278544217348098, "num_tokens": 38080565.0, "step": 19470 }, { "entropy": 6.10917387008667, "epoch": 1.9467686309791574, "grad_norm": 1.484375, "learning_rate": 0.00046245308657902334, "loss": 5.7107, "mean_token_accuracy": 0.17540966868400573, "num_tokens": 38090899.0, "step": 19475 }, { "entropy": 6.0047252655029295, "epoch": 1.947268456040386, "grad_norm": 1.59375, "learning_rate": 0.0004624333451141364, "loss": 5.7209, "mean_token_accuracy": 0.17185274809598922, "num_tokens": 38100104.0, "step": 19480 }, { "entropy": 6.060470628738403, "epoch": 1.9477682811016144, "grad_norm": 1.21875, "learning_rate": 0.0004624135989334746, "loss": 5.7864, "mean_token_accuracy": 0.16969332993030548, "num_tokens": 38109720.0, "step": 19485 }, { "entropy": 6.076017236709594, "epoch": 1.948268106162843, "grad_norm": 1.109375, "learning_rate": 0.00046239384803753496, "loss": 5.8292, "mean_token_accuracy": 0.1675061360001564, "num_tokens": 38119703.0, "step": 19490 }, { "entropy": 6.097591257095337, "epoch": 1.9487679312240715, "grad_norm": 1.171875, "learning_rate": 0.00046237409242681435, "loss": 5.676, "mean_token_accuracy": 0.17280753701925278, "num_tokens": 38129329.0, "step": 19495 }, { "entropy": 6.15480637550354, "epoch": 1.9492677562853, "grad_norm": 1.1328125, "learning_rate": 0.0004623543321018097, "loss": 5.746, "mean_token_accuracy": 0.16588402092456817, "num_tokens": 38138607.0, "step": 19500 }, { "entropy": 6.05337176322937, "epoch": 1.9497675813465287, "grad_norm": 1.203125, "learning_rate": 0.0004623345670630184, "loss": 5.7615, "mean_token_accuracy": 0.16906457841396333, "num_tokens": 38148749.0, "step": 19505 }, { "entropy": 6.12797999382019, "epoch": 1.9502674064077574, "grad_norm": 1.171875, "learning_rate": 0.0004623147973109375, "loss": 5.8449, "mean_token_accuracy": 0.16413751244544983, "num_tokens": 38158929.0, "step": 19510 }, { "entropy": 6.165810775756836, "epoch": 1.950767231468986, "grad_norm": 1.125, "learning_rate": 0.00046229502284606455, "loss": 5.7705, "mean_token_accuracy": 0.16275450140237807, "num_tokens": 38169966.0, "step": 19515 }, { "entropy": 6.1165846824646, "epoch": 1.9512670565302144, "grad_norm": 1.1484375, "learning_rate": 0.000462275243668897, "loss": 5.8142, "mean_token_accuracy": 0.1642487794160843, "num_tokens": 38180363.0, "step": 19520 }, { "entropy": 6.088879585266113, "epoch": 1.951766881591443, "grad_norm": 1.1640625, "learning_rate": 0.00046225545977993245, "loss": 5.7331, "mean_token_accuracy": 0.16924408823251724, "num_tokens": 38190802.0, "step": 19525 }, { "entropy": 6.100208044052124, "epoch": 1.9522667066526715, "grad_norm": 1.28125, "learning_rate": 0.0004622356711796688, "loss": 5.7778, "mean_token_accuracy": 0.1664141148328781, "num_tokens": 38201183.0, "step": 19530 }, { "entropy": 6.144399213790893, "epoch": 1.9527665317139, "grad_norm": 1.1953125, "learning_rate": 0.0004622158778686038, "loss": 5.8619, "mean_token_accuracy": 0.15717450231313707, "num_tokens": 38210953.0, "step": 19535 }, { "entropy": 6.057804918289184, "epoch": 1.9532663567751287, "grad_norm": 1.8515625, "learning_rate": 0.00046219607984723554, "loss": 5.6958, "mean_token_accuracy": 0.17376583367586135, "num_tokens": 38220335.0, "step": 19540 }, { "entropy": 6.079552555084229, "epoch": 1.9537661818363574, "grad_norm": 1.390625, "learning_rate": 0.00046217627711606205, "loss": 5.7738, "mean_token_accuracy": 0.16597875356674194, "num_tokens": 38230530.0, "step": 19545 }, { "entropy": 6.120511722564697, "epoch": 1.954266006897586, "grad_norm": 1.765625, "learning_rate": 0.00046215646967558155, "loss": 5.6996, "mean_token_accuracy": 0.1737459808588028, "num_tokens": 38241275.0, "step": 19550 }, { "entropy": 6.130249547958374, "epoch": 1.9547658319588144, "grad_norm": 1.1484375, "learning_rate": 0.00046213665752629246, "loss": 5.7239, "mean_token_accuracy": 0.17319964170455932, "num_tokens": 38250158.0, "step": 19555 }, { "entropy": 6.116637134552002, "epoch": 1.955265657020043, "grad_norm": 1.3359375, "learning_rate": 0.0004621168406686933, "loss": 5.9533, "mean_token_accuracy": 0.16190205216407777, "num_tokens": 38259172.0, "step": 19560 }, { "entropy": 6.0760369300842285, "epoch": 1.9557654820812715, "grad_norm": 1.2421875, "learning_rate": 0.00046209701910328245, "loss": 5.8027, "mean_token_accuracy": 0.16568537801504135, "num_tokens": 38268261.0, "step": 19565 }, { "entropy": 6.073251056671142, "epoch": 1.9562653071425, "grad_norm": 1.21875, "learning_rate": 0.0004620771928305588, "loss": 5.7509, "mean_token_accuracy": 0.167454032599926, "num_tokens": 38277843.0, "step": 19570 }, { "entropy": 6.027876901626587, "epoch": 1.9567651322037287, "grad_norm": 1.171875, "learning_rate": 0.0004620573618510211, "loss": 5.639, "mean_token_accuracy": 0.17330751121044158, "num_tokens": 38286878.0, "step": 19575 }, { "entropy": 6.062406778335571, "epoch": 1.9572649572649574, "grad_norm": 1.109375, "learning_rate": 0.00046203752616516834, "loss": 5.6866, "mean_token_accuracy": 0.1700051724910736, "num_tokens": 38296289.0, "step": 19580 }, { "entropy": 6.098640966415405, "epoch": 1.9577647823261857, "grad_norm": 1.3203125, "learning_rate": 0.00046201768577349957, "loss": 5.8481, "mean_token_accuracy": 0.1600051149725914, "num_tokens": 38305238.0, "step": 19585 }, { "entropy": 6.041635274887085, "epoch": 1.9582646073874144, "grad_norm": 1.0859375, "learning_rate": 0.0004619978406765139, "loss": 5.7518, "mean_token_accuracy": 0.16940855979919434, "num_tokens": 38315079.0, "step": 19590 }, { "entropy": 6.140627145767212, "epoch": 1.958764432448643, "grad_norm": 1.234375, "learning_rate": 0.0004619779908747107, "loss": 5.8395, "mean_token_accuracy": 0.16493187844753265, "num_tokens": 38324314.0, "step": 19595 }, { "entropy": 6.2062671184539795, "epoch": 1.9592642575098715, "grad_norm": 1.1796875, "learning_rate": 0.0004619581363685893, "loss": 5.84, "mean_token_accuracy": 0.16414041668176652, "num_tokens": 38334708.0, "step": 19600 }, { "entropy": 6.180793714523316, "epoch": 1.9597640825711, "grad_norm": 1.1171875, "learning_rate": 0.0004619382771586494, "loss": 5.8071, "mean_token_accuracy": 0.1629054255783558, "num_tokens": 38344800.0, "step": 19605 }, { "entropy": 5.990603971481323, "epoch": 1.9602639076323287, "grad_norm": 1.3984375, "learning_rate": 0.0004619184132453905, "loss": 5.7137, "mean_token_accuracy": 0.17569042444229127, "num_tokens": 38354778.0, "step": 19610 }, { "entropy": 6.115309858322144, "epoch": 1.9607637326935574, "grad_norm": 1.2109375, "learning_rate": 0.0004618985446293125, "loss": 5.7087, "mean_token_accuracy": 0.16678045094013214, "num_tokens": 38365032.0, "step": 19615 }, { "entropy": 6.01761646270752, "epoch": 1.9612635577547857, "grad_norm": 1.171875, "learning_rate": 0.00046187867131091504, "loss": 5.729, "mean_token_accuracy": 0.1689993530511856, "num_tokens": 38375051.0, "step": 19620 }, { "entropy": 6.018592023849488, "epoch": 1.9617633828160144, "grad_norm": 1.1875, "learning_rate": 0.0004618587932906984, "loss": 5.7402, "mean_token_accuracy": 0.16969837993383408, "num_tokens": 38384107.0, "step": 19625 }, { "entropy": 5.990976619720459, "epoch": 1.962263207877243, "grad_norm": 1.2578125, "learning_rate": 0.00046183891056916256, "loss": 5.6158, "mean_token_accuracy": 0.18667572289705275, "num_tokens": 38394054.0, "step": 19630 }, { "entropy": 6.12450680732727, "epoch": 1.9627630329384715, "grad_norm": 1.203125, "learning_rate": 0.0004618190231468079, "loss": 5.7915, "mean_token_accuracy": 0.16688738763332367, "num_tokens": 38403001.0, "step": 19635 }, { "entropy": 5.969665384292602, "epoch": 1.9632628579997, "grad_norm": 1.28125, "learning_rate": 0.00046179913102413456, "loss": 5.6702, "mean_token_accuracy": 0.1773045003414154, "num_tokens": 38412752.0, "step": 19640 }, { "entropy": 6.188271236419678, "epoch": 1.9637626830609287, "grad_norm": 1.3125, "learning_rate": 0.0004617792342016433, "loss": 5.8873, "mean_token_accuracy": 0.16569602787494658, "num_tokens": 38423523.0, "step": 19645 }, { "entropy": 6.276740407943725, "epoch": 1.9642625081221572, "grad_norm": 1.1015625, "learning_rate": 0.0004617593326798344, "loss": 5.821, "mean_token_accuracy": 0.16507180035114288, "num_tokens": 38433062.0, "step": 19650 }, { "entropy": 6.122944736480713, "epoch": 1.9647623331833857, "grad_norm": 1.234375, "learning_rate": 0.0004617394264592089, "loss": 5.8988, "mean_token_accuracy": 0.15464505851268767, "num_tokens": 38443008.0, "step": 19655 }, { "entropy": 6.046458578109741, "epoch": 1.9652621582446144, "grad_norm": 1.1640625, "learning_rate": 0.0004617195155402674, "loss": 5.7215, "mean_token_accuracy": 0.1765754222869873, "num_tokens": 38451805.0, "step": 19660 }, { "entropy": 6.161144733428955, "epoch": 1.965761983305843, "grad_norm": 1.3359375, "learning_rate": 0.00046169959992351103, "loss": 5.82, "mean_token_accuracy": 0.16266558468341827, "num_tokens": 38461826.0, "step": 19665 }, { "entropy": 6.078861856460572, "epoch": 1.9662618083670715, "grad_norm": 1.28125, "learning_rate": 0.00046167967960944066, "loss": 5.7499, "mean_token_accuracy": 0.16985134184360504, "num_tokens": 38471746.0, "step": 19670 }, { "entropy": 6.127320909500122, "epoch": 1.9667616334283, "grad_norm": 1.25, "learning_rate": 0.0004616597545985577, "loss": 5.722, "mean_token_accuracy": 0.17380165457725524, "num_tokens": 38480749.0, "step": 19675 }, { "entropy": 6.065641450881958, "epoch": 1.9672614584895287, "grad_norm": 1.1796875, "learning_rate": 0.0004616398248913632, "loss": 5.786, "mean_token_accuracy": 0.16722732335329055, "num_tokens": 38491327.0, "step": 19680 }, { "entropy": 6.1317830085754395, "epoch": 1.9677612835507572, "grad_norm": 1.2265625, "learning_rate": 0.00046161989048835886, "loss": 5.8404, "mean_token_accuracy": 0.16861453652381897, "num_tokens": 38500573.0, "step": 19685 }, { "entropy": 6.092833852767944, "epoch": 1.9682611086119857, "grad_norm": 1.296875, "learning_rate": 0.00046159995139004594, "loss": 5.8249, "mean_token_accuracy": 0.16412762701511383, "num_tokens": 38510156.0, "step": 19690 }, { "entropy": 6.138033199310303, "epoch": 1.9687609336732144, "grad_norm": 1.2109375, "learning_rate": 0.0004615800075969264, "loss": 5.7571, "mean_token_accuracy": 0.17079517841339112, "num_tokens": 38519804.0, "step": 19695 }, { "entropy": 6.183056497573853, "epoch": 1.969260758734443, "grad_norm": 1.1953125, "learning_rate": 0.00046156005910950187, "loss": 5.8424, "mean_token_accuracy": 0.16714582741260528, "num_tokens": 38530332.0, "step": 19700 }, { "entropy": 6.165865325927735, "epoch": 1.9697605837956715, "grad_norm": 1.1484375, "learning_rate": 0.0004615401059282742, "loss": 5.8354, "mean_token_accuracy": 0.16495805233716965, "num_tokens": 38540480.0, "step": 19705 }, { "entropy": 6.079359483718872, "epoch": 1.9702604088569, "grad_norm": 1.25, "learning_rate": 0.00046152014805374546, "loss": 5.7679, "mean_token_accuracy": 0.17205318063497543, "num_tokens": 38549644.0, "step": 19710 }, { "entropy": 6.117202997207642, "epoch": 1.9707602339181287, "grad_norm": 1.1953125, "learning_rate": 0.0004615001854864179, "loss": 5.8644, "mean_token_accuracy": 0.1603493645787239, "num_tokens": 38560018.0, "step": 19715 }, { "entropy": 6.1183442115783695, "epoch": 1.9712600589793572, "grad_norm": 1.1328125, "learning_rate": 0.00046148021822679347, "loss": 5.7009, "mean_token_accuracy": 0.1753981053829193, "num_tokens": 38569584.0, "step": 19720 }, { "entropy": 6.149140644073486, "epoch": 1.9717598840405857, "grad_norm": 1.2109375, "learning_rate": 0.0004614602462753749, "loss": 5.8307, "mean_token_accuracy": 0.16554740965366363, "num_tokens": 38579358.0, "step": 19725 }, { "entropy": 6.04987211227417, "epoch": 1.9722597091018144, "grad_norm": 1.2109375, "learning_rate": 0.0004614402696326645, "loss": 5.7048, "mean_token_accuracy": 0.17232066094875337, "num_tokens": 38588850.0, "step": 19730 }, { "entropy": 6.0556724071502686, "epoch": 1.972759534163043, "grad_norm": 1.2109375, "learning_rate": 0.00046142028829916485, "loss": 5.8204, "mean_token_accuracy": 0.1696072205901146, "num_tokens": 38598972.0, "step": 19735 }, { "entropy": 6.245778369903564, "epoch": 1.9732593592242715, "grad_norm": 1.328125, "learning_rate": 0.0004614003022753787, "loss": 5.916, "mean_token_accuracy": 0.16266273111104965, "num_tokens": 38609640.0, "step": 19740 }, { "entropy": 6.122527647018432, "epoch": 1.9737591842855, "grad_norm": 1.3046875, "learning_rate": 0.0004613803115618089, "loss": 5.8166, "mean_token_accuracy": 0.16626644283533096, "num_tokens": 38619487.0, "step": 19745 }, { "entropy": 6.176519298553467, "epoch": 1.9742590093467287, "grad_norm": 1.3125, "learning_rate": 0.00046136031615895846, "loss": 5.9143, "mean_token_accuracy": 0.15774578005075454, "num_tokens": 38629681.0, "step": 19750 }, { "entropy": 6.14497857093811, "epoch": 1.9747588344079572, "grad_norm": 1.15625, "learning_rate": 0.0004613403160673305, "loss": 5.8507, "mean_token_accuracy": 0.16531630903482436, "num_tokens": 38640003.0, "step": 19755 }, { "entropy": 6.105613899230957, "epoch": 1.9752586594691857, "grad_norm": 1.125, "learning_rate": 0.000461320311287428, "loss": 5.7357, "mean_token_accuracy": 0.1658422216773033, "num_tokens": 38650691.0, "step": 19760 }, { "entropy": 6.088154983520508, "epoch": 1.9757584845304144, "grad_norm": 1.171875, "learning_rate": 0.00046130030181975446, "loss": 5.7512, "mean_token_accuracy": 0.1677144318819046, "num_tokens": 38660144.0, "step": 19765 }, { "entropy": 6.086434268951416, "epoch": 1.976258309591643, "grad_norm": 1.1796875, "learning_rate": 0.0004612802876648133, "loss": 5.8268, "mean_token_accuracy": 0.16864923536777496, "num_tokens": 38670654.0, "step": 19770 }, { "entropy": 6.094899988174438, "epoch": 1.9767581346528715, "grad_norm": 1.0859375, "learning_rate": 0.000461260268823108, "loss": 5.7444, "mean_token_accuracy": 0.16600856184959412, "num_tokens": 38681616.0, "step": 19775 }, { "entropy": 6.104507160186768, "epoch": 1.9772579597141, "grad_norm": 1.1796875, "learning_rate": 0.00046124024529514224, "loss": 5.6998, "mean_token_accuracy": 0.17901406437158585, "num_tokens": 38691586.0, "step": 19780 }, { "entropy": 6.201117324829101, "epoch": 1.9777577847753287, "grad_norm": 1.1171875, "learning_rate": 0.0004612202170814198, "loss": 5.8778, "mean_token_accuracy": 0.15796163380146028, "num_tokens": 38703320.0, "step": 19785 }, { "entropy": 6.10558443069458, "epoch": 1.9782576098365572, "grad_norm": 1.203125, "learning_rate": 0.0004612001841824447, "loss": 5.7808, "mean_token_accuracy": 0.17703987658023834, "num_tokens": 38713318.0, "step": 19790 }, { "entropy": 6.079635334014893, "epoch": 1.9787574348977857, "grad_norm": 1.1484375, "learning_rate": 0.00046118014659872085, "loss": 5.7935, "mean_token_accuracy": 0.1655510976910591, "num_tokens": 38723237.0, "step": 19795 }, { "entropy": 6.079729843139648, "epoch": 1.9792572599590144, "grad_norm": 1.0703125, "learning_rate": 0.0004611601043307525, "loss": 5.7387, "mean_token_accuracy": 0.17495503798127174, "num_tokens": 38732742.0, "step": 19800 }, { "entropy": 6.071866178512574, "epoch": 1.979757085020243, "grad_norm": 1.3828125, "learning_rate": 0.00046114005737904376, "loss": 5.848, "mean_token_accuracy": 0.1593129187822342, "num_tokens": 38743259.0, "step": 19805 }, { "entropy": 6.139212274551392, "epoch": 1.9802569100814715, "grad_norm": 1.1171875, "learning_rate": 0.000461120005744099, "loss": 5.806, "mean_token_accuracy": 0.16860250234603882, "num_tokens": 38753267.0, "step": 19810 }, { "entropy": 6.067881631851196, "epoch": 1.9807567351427, "grad_norm": 1.171875, "learning_rate": 0.00046109994942642287, "loss": 5.6976, "mean_token_accuracy": 0.17632412910461426, "num_tokens": 38763897.0, "step": 19815 }, { "entropy": 6.075835657119751, "epoch": 1.9812565602039287, "grad_norm": 1.2421875, "learning_rate": 0.0004610798884265199, "loss": 5.7703, "mean_token_accuracy": 0.1623072437942028, "num_tokens": 38774864.0, "step": 19820 }, { "entropy": 6.076566743850708, "epoch": 1.9817563852651572, "grad_norm": 1.2109375, "learning_rate": 0.00046105982274489483, "loss": 5.7284, "mean_token_accuracy": 0.17439104616641998, "num_tokens": 38784726.0, "step": 19825 }, { "entropy": 6.118537187576294, "epoch": 1.9822562103263857, "grad_norm": 1.2734375, "learning_rate": 0.00046103975238205244, "loss": 5.8154, "mean_token_accuracy": 0.1627314418554306, "num_tokens": 38794649.0, "step": 19830 }, { "entropy": 6.163331747055054, "epoch": 1.9827560353876144, "grad_norm": 1.21875, "learning_rate": 0.0004610196773384978, "loss": 5.8384, "mean_token_accuracy": 0.16460812240839004, "num_tokens": 38804567.0, "step": 19835 }, { "entropy": 6.13940200805664, "epoch": 1.983255860448843, "grad_norm": 1.2109375, "learning_rate": 0.00046099959761473593, "loss": 5.7931, "mean_token_accuracy": 0.16774245947599412, "num_tokens": 38813874.0, "step": 19840 }, { "entropy": 6.046881484985351, "epoch": 1.9837556855100713, "grad_norm": 1.25, "learning_rate": 0.00046097951321127207, "loss": 5.7882, "mean_token_accuracy": 0.17014411985874175, "num_tokens": 38822110.0, "step": 19845 }, { "entropy": 6.089656162261963, "epoch": 1.9842555105713, "grad_norm": 1.265625, "learning_rate": 0.00046095942412861145, "loss": 5.7835, "mean_token_accuracy": 0.1754411429166794, "num_tokens": 38832628.0, "step": 19850 }, { "entropy": 6.118313598632812, "epoch": 1.9847553356325287, "grad_norm": 1.203125, "learning_rate": 0.0004609393303672596, "loss": 5.7039, "mean_token_accuracy": 0.17272548973560334, "num_tokens": 38841742.0, "step": 19855 }, { "entropy": 6.118927335739135, "epoch": 1.9852551606937572, "grad_norm": 1.2109375, "learning_rate": 0.00046091923192772205, "loss": 5.7405, "mean_token_accuracy": 0.16846216470003128, "num_tokens": 38851338.0, "step": 19860 }, { "entropy": 6.043152666091919, "epoch": 1.9857549857549857, "grad_norm": 1.234375, "learning_rate": 0.0004608991288105045, "loss": 5.7225, "mean_token_accuracy": 0.1690527990460396, "num_tokens": 38861308.0, "step": 19865 }, { "entropy": 6.07279405593872, "epoch": 1.9862548108162144, "grad_norm": 1.2265625, "learning_rate": 0.00046087902101611265, "loss": 5.7751, "mean_token_accuracy": 0.16783604472875596, "num_tokens": 38871911.0, "step": 19870 }, { "entropy": 6.001902341842651, "epoch": 1.986754635877443, "grad_norm": 1.109375, "learning_rate": 0.0004608589085450525, "loss": 5.6414, "mean_token_accuracy": 0.17456620931625366, "num_tokens": 38882330.0, "step": 19875 }, { "entropy": 6.071153259277343, "epoch": 1.9872544609386713, "grad_norm": 1.0703125, "learning_rate": 0.00046083879139783, "loss": 5.7115, "mean_token_accuracy": 0.1743754267692566, "num_tokens": 38892080.0, "step": 19880 }, { "entropy": 6.06404390335083, "epoch": 1.9877542859999, "grad_norm": 1.21875, "learning_rate": 0.0004608186695749514, "loss": 5.7055, "mean_token_accuracy": 0.17080520540475846, "num_tokens": 38901190.0, "step": 19885 }, { "entropy": 6.103047037124634, "epoch": 1.9882541110611287, "grad_norm": 1.15625, "learning_rate": 0.0004607985430769228, "loss": 5.9175, "mean_token_accuracy": 0.16123861074447632, "num_tokens": 38910900.0, "step": 19890 }, { "entropy": 6.076416921615601, "epoch": 1.9887539361223572, "grad_norm": 1.234375, "learning_rate": 0.0004607784119042507, "loss": 5.7215, "mean_token_accuracy": 0.1716232880949974, "num_tokens": 38919988.0, "step": 19895 }, { "entropy": 6.0732134819030765, "epoch": 1.9892537611835857, "grad_norm": 1.2265625, "learning_rate": 0.0004607582760574416, "loss": 5.742, "mean_token_accuracy": 0.17206894010305404, "num_tokens": 38930288.0, "step": 19900 }, { "entropy": 6.038689708709716, "epoch": 1.9897535862448144, "grad_norm": 1.0703125, "learning_rate": 0.000460738135537002, "loss": 5.5809, "mean_token_accuracy": 0.1829849511384964, "num_tokens": 38938920.0, "step": 19905 }, { "entropy": 6.054684591293335, "epoch": 1.9902534113060428, "grad_norm": 1.171875, "learning_rate": 0.00046071799034343874, "loss": 5.7936, "mean_token_accuracy": 0.16589105725288392, "num_tokens": 38948453.0, "step": 19910 }, { "entropy": 6.179603099822998, "epoch": 1.9907532363672713, "grad_norm": 1.1328125, "learning_rate": 0.0004606978404772587, "loss": 5.9081, "mean_token_accuracy": 0.15770720317959785, "num_tokens": 38958421.0, "step": 19915 }, { "entropy": 6.0551900386810305, "epoch": 1.9912530614285, "grad_norm": 1.2109375, "learning_rate": 0.00046067768593896865, "loss": 5.6875, "mean_token_accuracy": 0.16920602023601533, "num_tokens": 38967641.0, "step": 19920 }, { "entropy": 6.142995452880859, "epoch": 1.9917528864897287, "grad_norm": 1.1953125, "learning_rate": 0.0004606575267290759, "loss": 5.7631, "mean_token_accuracy": 0.17873106598854066, "num_tokens": 38977601.0, "step": 19925 }, { "entropy": 6.00747275352478, "epoch": 1.9922527115509572, "grad_norm": 1.1640625, "learning_rate": 0.0004606373628480875, "loss": 5.7839, "mean_token_accuracy": 0.1697892889380455, "num_tokens": 38987398.0, "step": 19930 }, { "entropy": 6.034529066085815, "epoch": 1.9927525366121857, "grad_norm": 1.21875, "learning_rate": 0.0004606171942965108, "loss": 5.7455, "mean_token_accuracy": 0.17028876692056655, "num_tokens": 38997831.0, "step": 19935 }, { "entropy": 6.124624872207642, "epoch": 1.9932523616734144, "grad_norm": 1.2265625, "learning_rate": 0.0004605970210748533, "loss": 5.897, "mean_token_accuracy": 0.16648804843425752, "num_tokens": 39007667.0, "step": 19940 }, { "entropy": 6.091839027404785, "epoch": 1.9937521867346428, "grad_norm": 1.2265625, "learning_rate": 0.0004605768431836225, "loss": 5.7033, "mean_token_accuracy": 0.17937210351228713, "num_tokens": 39018192.0, "step": 19945 }, { "entropy": 6.087166023254395, "epoch": 1.9942520117958713, "grad_norm": 1.21875, "learning_rate": 0.00046055666062332605, "loss": 5.6988, "mean_token_accuracy": 0.17755381911993026, "num_tokens": 39027440.0, "step": 19950 }, { "entropy": 5.9695531845092775, "epoch": 1.9947518368571, "grad_norm": 1.2421875, "learning_rate": 0.00046053647339447184, "loss": 5.6387, "mean_token_accuracy": 0.1793017014861107, "num_tokens": 39037078.0, "step": 19955 }, { "entropy": 6.067123937606811, "epoch": 1.9952516619183287, "grad_norm": 1.2109375, "learning_rate": 0.00046051628149756767, "loss": 5.7946, "mean_token_accuracy": 0.1627612829208374, "num_tokens": 39046462.0, "step": 19960 }, { "entropy": 6.147229480743408, "epoch": 1.9957514869795572, "grad_norm": 1.515625, "learning_rate": 0.0004604960849331216, "loss": 5.7485, "mean_token_accuracy": 0.1696407288312912, "num_tokens": 39057004.0, "step": 19965 }, { "entropy": 6.160590553283692, "epoch": 1.9962513120407857, "grad_norm": 1.15625, "learning_rate": 0.0004604758837016417, "loss": 5.8509, "mean_token_accuracy": 0.1670793414115906, "num_tokens": 39066612.0, "step": 19970 }, { "entropy": 6.094274997711182, "epoch": 1.9967511371020144, "grad_norm": 1.140625, "learning_rate": 0.0004604556778036363, "loss": 5.8169, "mean_token_accuracy": 0.16017839908599854, "num_tokens": 39076702.0, "step": 19975 }, { "entropy": 5.988117361068726, "epoch": 1.9972509621632428, "grad_norm": 1.1875, "learning_rate": 0.00046043546723961384, "loss": 5.6355, "mean_token_accuracy": 0.18264233618974685, "num_tokens": 39087110.0, "step": 19980 }, { "entropy": 6.06049656867981, "epoch": 1.9977507872244713, "grad_norm": 1.1796875, "learning_rate": 0.00046041525201008266, "loss": 5.7887, "mean_token_accuracy": 0.1631213590502739, "num_tokens": 39097204.0, "step": 19985 }, { "entropy": 6.058638858795166, "epoch": 1.9982506122857, "grad_norm": 1.2265625, "learning_rate": 0.00046039503211555154, "loss": 5.7362, "mean_token_accuracy": 0.17046991139650344, "num_tokens": 39106469.0, "step": 19990 }, { "entropy": 6.087457847595215, "epoch": 1.9987504373469287, "grad_norm": 1.15625, "learning_rate": 0.00046037480755652913, "loss": 5.7535, "mean_token_accuracy": 0.17235818952322007, "num_tokens": 39116304.0, "step": 19995 }, { "entropy": 6.098694944381714, "epoch": 1.9992502624081572, "grad_norm": 1.234375, "learning_rate": 0.00046035457833352414, "loss": 5.8235, "mean_token_accuracy": 0.15795450061559677, "num_tokens": 39125573.0, "step": 20000 }, { "entropy": 6.10334358215332, "epoch": 1.9997500874693857, "grad_norm": 1.2578125, "learning_rate": 0.00046033434444704577, "loss": 5.7384, "mean_token_accuracy": 0.17256668508052825, "num_tokens": 39134876.0, "step": 20005 }, { "entropy": 6.07966152826945, "epoch": 2.0001999300244915, "grad_norm": 1.109375, "learning_rate": 0.00046031410589760294, "loss": 5.6833, "mean_token_accuracy": 0.17534273697270286, "num_tokens": 39143851.0, "step": 20010 }, { "entropy": 5.9369086742401125, "epoch": 2.00069975508572, "grad_norm": 1.234375, "learning_rate": 0.00046029386268570485, "loss": 5.5608, "mean_token_accuracy": 0.1846308782696724, "num_tokens": 39152748.0, "step": 20015 }, { "entropy": 6.044854688644409, "epoch": 2.0011995801469484, "grad_norm": 1.2421875, "learning_rate": 0.0004602736148118609, "loss": 5.7063, "mean_token_accuracy": 0.164373679459095, "num_tokens": 39162097.0, "step": 20020 }, { "entropy": 6.060443258285522, "epoch": 2.001699405208177, "grad_norm": 1.171875, "learning_rate": 0.00046025336227658047, "loss": 5.7107, "mean_token_accuracy": 0.1759570062160492, "num_tokens": 39171629.0, "step": 20025 }, { "entropy": 6.197247076034546, "epoch": 2.002199230269406, "grad_norm": 1.2265625, "learning_rate": 0.00046023310508037316, "loss": 5.8245, "mean_token_accuracy": 0.15730675905942917, "num_tokens": 39181368.0, "step": 20030 }, { "entropy": 6.053267621994019, "epoch": 2.002699055330634, "grad_norm": 1.4921875, "learning_rate": 0.00046021284322374847, "loss": 5.6174, "mean_token_accuracy": 0.1808698907494545, "num_tokens": 39190492.0, "step": 20035 }, { "entropy": 6.103080463409424, "epoch": 2.003198880391863, "grad_norm": 1.1796875, "learning_rate": 0.0004601925767072164, "loss": 5.7196, "mean_token_accuracy": 0.16754649132490157, "num_tokens": 39200915.0, "step": 20040 }, { "entropy": 6.083680534362793, "epoch": 2.0036987054530915, "grad_norm": 1.4296875, "learning_rate": 0.00046017230553128675, "loss": 5.6521, "mean_token_accuracy": 0.17290466278791428, "num_tokens": 39210370.0, "step": 20045 }, { "entropy": 6.167730808258057, "epoch": 2.00419853051432, "grad_norm": 1.1640625, "learning_rate": 0.00046015202969646953, "loss": 5.7501, "mean_token_accuracy": 0.1718434602022171, "num_tokens": 39221731.0, "step": 20050 }, { "entropy": 6.210087442398072, "epoch": 2.0046983555755484, "grad_norm": 1.2421875, "learning_rate": 0.0004601317492032749, "loss": 5.7194, "mean_token_accuracy": 0.1693051241338253, "num_tokens": 39232951.0, "step": 20055 }, { "entropy": 6.136258745193482, "epoch": 2.005198180636777, "grad_norm": 1.09375, "learning_rate": 0.000460111464052213, "loss": 5.7497, "mean_token_accuracy": 0.17018657624721528, "num_tokens": 39242433.0, "step": 20060 }, { "entropy": 6.090251541137695, "epoch": 2.005698005698006, "grad_norm": 1.171875, "learning_rate": 0.00046009117424379445, "loss": 5.7346, "mean_token_accuracy": 0.16759042739868163, "num_tokens": 39253496.0, "step": 20065 }, { "entropy": 6.044763469696045, "epoch": 2.006197830759234, "grad_norm": 1.1328125, "learning_rate": 0.00046007087977852947, "loss": 5.6881, "mean_token_accuracy": 0.17675623744726182, "num_tokens": 39263108.0, "step": 20070 }, { "entropy": 6.0318274974823, "epoch": 2.0066976558204628, "grad_norm": 1.2109375, "learning_rate": 0.00046005058065692883, "loss": 5.6228, "mean_token_accuracy": 0.1760835811495781, "num_tokens": 39272331.0, "step": 20075 }, { "entropy": 6.106259775161743, "epoch": 2.0071974808816915, "grad_norm": 1.15625, "learning_rate": 0.00046003027687950316, "loss": 5.6893, "mean_token_accuracy": 0.1708327889442444, "num_tokens": 39282387.0, "step": 20080 }, { "entropy": 6.064089441299439, "epoch": 2.00769730594292, "grad_norm": 1.203125, "learning_rate": 0.0004600099684467634, "loss": 5.6986, "mean_token_accuracy": 0.17566324919462203, "num_tokens": 39293212.0, "step": 20085 }, { "entropy": 6.135978364944458, "epoch": 2.0081971310041484, "grad_norm": 1.2578125, "learning_rate": 0.0004599896553592204, "loss": 5.7901, "mean_token_accuracy": 0.1670550897717476, "num_tokens": 39302728.0, "step": 20090 }, { "entropy": 6.077429533004761, "epoch": 2.008696956065377, "grad_norm": 1.34375, "learning_rate": 0.0004599693376173853, "loss": 5.644, "mean_token_accuracy": 0.1726323589682579, "num_tokens": 39313079.0, "step": 20095 }, { "entropy": 6.1456183910369875, "epoch": 2.009196781126606, "grad_norm": 1.1171875, "learning_rate": 0.0004599490152217692, "loss": 5.7739, "mean_token_accuracy": 0.1617901310324669, "num_tokens": 39323563.0, "step": 20100 }, { "entropy": 6.075893926620483, "epoch": 2.009696606187834, "grad_norm": 1.1953125, "learning_rate": 0.00045992868817288355, "loss": 5.6155, "mean_token_accuracy": 0.1734946548938751, "num_tokens": 39334541.0, "step": 20105 }, { "entropy": 6.112001514434814, "epoch": 2.0101964312490628, "grad_norm": 1.1171875, "learning_rate": 0.0004599083564712396, "loss": 5.7168, "mean_token_accuracy": 0.1722011536359787, "num_tokens": 39344848.0, "step": 20110 }, { "entropy": 6.111793804168701, "epoch": 2.0106962563102915, "grad_norm": 1.2109375, "learning_rate": 0.00045988802011734896, "loss": 5.6985, "mean_token_accuracy": 0.1607961818575859, "num_tokens": 39354830.0, "step": 20115 }, { "entropy": 6.141810035705566, "epoch": 2.01119608137152, "grad_norm": 1.1328125, "learning_rate": 0.00045986767911172343, "loss": 5.7622, "mean_token_accuracy": 0.1690826505422592, "num_tokens": 39363838.0, "step": 20120 }, { "entropy": 6.077844095230103, "epoch": 2.0116959064327484, "grad_norm": 1.1953125, "learning_rate": 0.00045984733345487465, "loss": 5.6629, "mean_token_accuracy": 0.16918161362409592, "num_tokens": 39373549.0, "step": 20125 }, { "entropy": 6.097675895690918, "epoch": 2.012195731493977, "grad_norm": 1.1328125, "learning_rate": 0.00045982698314731447, "loss": 5.6599, "mean_token_accuracy": 0.17269637882709504, "num_tokens": 39383747.0, "step": 20130 }, { "entropy": 6.076425790786743, "epoch": 2.012695556555206, "grad_norm": 1.203125, "learning_rate": 0.00045980662818955495, "loss": 5.7331, "mean_token_accuracy": 0.1705927088856697, "num_tokens": 39394283.0, "step": 20135 }, { "entropy": 6.098881340026855, "epoch": 2.013195381616434, "grad_norm": 1.2421875, "learning_rate": 0.00045978626858210833, "loss": 5.6155, "mean_token_accuracy": 0.179286889731884, "num_tokens": 39404777.0, "step": 20140 }, { "entropy": 6.064482641220093, "epoch": 2.0136952066776628, "grad_norm": 1.265625, "learning_rate": 0.0004597659043254866, "loss": 5.6014, "mean_token_accuracy": 0.17342885434627534, "num_tokens": 39414749.0, "step": 20145 }, { "entropy": 6.0715758323669435, "epoch": 2.0141950317388915, "grad_norm": 1.1640625, "learning_rate": 0.0004597455354202023, "loss": 5.6823, "mean_token_accuracy": 0.17355004101991653, "num_tokens": 39424185.0, "step": 20150 }, { "entropy": 6.068203067779541, "epoch": 2.01469485680012, "grad_norm": 1.2734375, "learning_rate": 0.0004597251618667679, "loss": 5.7475, "mean_token_accuracy": 0.17275481671094894, "num_tokens": 39433442.0, "step": 20155 }, { "entropy": 6.062960910797119, "epoch": 2.0151946818613484, "grad_norm": 1.1796875, "learning_rate": 0.00045970478366569594, "loss": 5.7048, "mean_token_accuracy": 0.17705900967121124, "num_tokens": 39443373.0, "step": 20160 }, { "entropy": 6.13445348739624, "epoch": 2.015694506922577, "grad_norm": 1.25, "learning_rate": 0.00045968440081749917, "loss": 5.6245, "mean_token_accuracy": 0.17833202481269836, "num_tokens": 39452293.0, "step": 20165 }, { "entropy": 6.0796795845031735, "epoch": 2.016194331983806, "grad_norm": 1.28125, "learning_rate": 0.0004596640133226904, "loss": 5.6671, "mean_token_accuracy": 0.17232218235731125, "num_tokens": 39463063.0, "step": 20170 }, { "entropy": 6.071743392944336, "epoch": 2.016694157045034, "grad_norm": 1.1328125, "learning_rate": 0.00045964362118178253, "loss": 5.6806, "mean_token_accuracy": 0.1720048189163208, "num_tokens": 39473349.0, "step": 20175 }, { "entropy": 6.085145044326782, "epoch": 2.0171939821062628, "grad_norm": 1.1875, "learning_rate": 0.0004596232243952887, "loss": 5.6813, "mean_token_accuracy": 0.1641944542527199, "num_tokens": 39485106.0, "step": 20180 }, { "entropy": 6.0731587409973145, "epoch": 2.0176938071674915, "grad_norm": 1.2578125, "learning_rate": 0.000459602822963722, "loss": 5.7663, "mean_token_accuracy": 0.1687481477856636, "num_tokens": 39494785.0, "step": 20185 }, { "entropy": 5.9859678745269775, "epoch": 2.01819363222872, "grad_norm": 1.5078125, "learning_rate": 0.00045958241688759583, "loss": 5.5661, "mean_token_accuracy": 0.18221739828586578, "num_tokens": 39503846.0, "step": 20190 }, { "entropy": 6.098060655593872, "epoch": 2.0186934572899484, "grad_norm": 1.125, "learning_rate": 0.00045956200616742356, "loss": 5.7405, "mean_token_accuracy": 0.16870652586221696, "num_tokens": 39515207.0, "step": 20195 }, { "entropy": 6.080890750885009, "epoch": 2.019193282351177, "grad_norm": 1.2734375, "learning_rate": 0.0004595415908037187, "loss": 5.6704, "mean_token_accuracy": 0.1687462255358696, "num_tokens": 39524698.0, "step": 20200 }, { "entropy": 6.061633777618408, "epoch": 2.019693107412406, "grad_norm": 1.2265625, "learning_rate": 0.0004595211707969948, "loss": 5.6096, "mean_token_accuracy": 0.18250036090612412, "num_tokens": 39534485.0, "step": 20205 }, { "entropy": 6.044603872299194, "epoch": 2.020192932473634, "grad_norm": 1.265625, "learning_rate": 0.0004595007461477658, "loss": 5.6204, "mean_token_accuracy": 0.18820348232984543, "num_tokens": 39544039.0, "step": 20210 }, { "entropy": 6.050969362258911, "epoch": 2.0206927575348628, "grad_norm": 1.3828125, "learning_rate": 0.00045948031685654557, "loss": 5.6757, "mean_token_accuracy": 0.17225667983293533, "num_tokens": 39553139.0, "step": 20215 }, { "entropy": 6.127994871139526, "epoch": 2.0211925825960915, "grad_norm": 1.1953125, "learning_rate": 0.0004594598829238479, "loss": 5.7273, "mean_token_accuracy": 0.16636809706687927, "num_tokens": 39562385.0, "step": 20220 }, { "entropy": 6.051290798187256, "epoch": 2.0216924076573197, "grad_norm": 1.234375, "learning_rate": 0.0004594394443501872, "loss": 5.6203, "mean_token_accuracy": 0.18062713295221328, "num_tokens": 39571855.0, "step": 20225 }, { "entropy": 6.049437141418457, "epoch": 2.0221922327185484, "grad_norm": 1.171875, "learning_rate": 0.0004594190011360775, "loss": 5.6117, "mean_token_accuracy": 0.17510585635900497, "num_tokens": 39581230.0, "step": 20230 }, { "entropy": 6.140601778030396, "epoch": 2.022692057779777, "grad_norm": 1.2265625, "learning_rate": 0.0004593985532820331, "loss": 5.7482, "mean_token_accuracy": 0.16142921894788742, "num_tokens": 39590730.0, "step": 20235 }, { "entropy": 6.10253529548645, "epoch": 2.023191882841006, "grad_norm": 1.4609375, "learning_rate": 0.0004593781007885686, "loss": 5.6854, "mean_token_accuracy": 0.1811680018901825, "num_tokens": 39600110.0, "step": 20240 }, { "entropy": 6.097172355651855, "epoch": 2.023691707902234, "grad_norm": 1.1328125, "learning_rate": 0.0004593576436561985, "loss": 5.7687, "mean_token_accuracy": 0.16142215430736542, "num_tokens": 39610379.0, "step": 20245 }, { "entropy": 6.06792197227478, "epoch": 2.0241915329634628, "grad_norm": 1.2421875, "learning_rate": 0.00045933718188543763, "loss": 5.7312, "mean_token_accuracy": 0.1643009901046753, "num_tokens": 39619857.0, "step": 20250 }, { "entropy": 6.089860916137695, "epoch": 2.0246913580246915, "grad_norm": 1.1171875, "learning_rate": 0.0004593167154768006, "loss": 5.6547, "mean_token_accuracy": 0.1776014819741249, "num_tokens": 39630049.0, "step": 20255 }, { "entropy": 6.103456592559814, "epoch": 2.0251911830859197, "grad_norm": 1.1796875, "learning_rate": 0.0004592962444308024, "loss": 5.7334, "mean_token_accuracy": 0.16641913950443268, "num_tokens": 39638794.0, "step": 20260 }, { "entropy": 6.075905466079712, "epoch": 2.0256910081471484, "grad_norm": 1.15625, "learning_rate": 0.0004592757687479582, "loss": 5.5968, "mean_token_accuracy": 0.17797008007764817, "num_tokens": 39648261.0, "step": 20265 }, { "entropy": 6.028750467300415, "epoch": 2.026190833208377, "grad_norm": 1.15625, "learning_rate": 0.000459255288428783, "loss": 5.5731, "mean_token_accuracy": 0.18388448506593705, "num_tokens": 39659217.0, "step": 20270 }, { "entropy": 5.884848642349243, "epoch": 2.026690658269606, "grad_norm": 1.046875, "learning_rate": 0.0004592348034737922, "loss": 5.4446, "mean_token_accuracy": 0.1976071774959564, "num_tokens": 39669535.0, "step": 20275 }, { "entropy": 6.093022775650025, "epoch": 2.027190483330834, "grad_norm": 1.265625, "learning_rate": 0.0004592143138835012, "loss": 5.7302, "mean_token_accuracy": 0.16700634509325027, "num_tokens": 39678640.0, "step": 20280 }, { "entropy": 6.0413614273071286, "epoch": 2.0276903083920628, "grad_norm": 1.1875, "learning_rate": 0.0004591938196584254, "loss": 5.6573, "mean_token_accuracy": 0.17724614292383195, "num_tokens": 39688000.0, "step": 20285 }, { "entropy": 6.063565349578857, "epoch": 2.0281901334532915, "grad_norm": 1.140625, "learning_rate": 0.00045917332079908055, "loss": 5.6742, "mean_token_accuracy": 0.17249096930027008, "num_tokens": 39697778.0, "step": 20290 }, { "entropy": 6.024125480651856, "epoch": 2.0286899585145197, "grad_norm": 1.1796875, "learning_rate": 0.0004591528173059823, "loss": 5.5859, "mean_token_accuracy": 0.17791785448789596, "num_tokens": 39707842.0, "step": 20295 }, { "entropy": 6.093098831176758, "epoch": 2.0291897835757484, "grad_norm": 1.1953125, "learning_rate": 0.0004591323091796465, "loss": 5.7263, "mean_token_accuracy": 0.16548821777105333, "num_tokens": 39716465.0, "step": 20300 }, { "entropy": 6.062314224243164, "epoch": 2.029689608636977, "grad_norm": 1.1953125, "learning_rate": 0.0004591117964205893, "loss": 5.6093, "mean_token_accuracy": 0.17624322026968003, "num_tokens": 39725862.0, "step": 20305 }, { "entropy": 6.005319499969483, "epoch": 2.030189433698206, "grad_norm": 1.2734375, "learning_rate": 0.00045909127902932657, "loss": 5.7069, "mean_token_accuracy": 0.16486865431070327, "num_tokens": 39737042.0, "step": 20310 }, { "entropy": 6.070501899719238, "epoch": 2.030689258759434, "grad_norm": 1.171875, "learning_rate": 0.0004590707570063747, "loss": 5.6758, "mean_token_accuracy": 0.1676729291677475, "num_tokens": 39747849.0, "step": 20315 }, { "entropy": 6.089812278747559, "epoch": 2.0311890838206628, "grad_norm": 1.2421875, "learning_rate": 0.00045905023035224993, "loss": 5.6628, "mean_token_accuracy": 0.17013980001211165, "num_tokens": 39757544.0, "step": 20320 }, { "entropy": 6.048898983001709, "epoch": 2.0316889088818915, "grad_norm": 1.2421875, "learning_rate": 0.00045902969906746875, "loss": 5.6062, "mean_token_accuracy": 0.17718302309513093, "num_tokens": 39766127.0, "step": 20325 }, { "entropy": 6.109204912185669, "epoch": 2.0321887339431197, "grad_norm": 1.203125, "learning_rate": 0.00045900916315254765, "loss": 5.7584, "mean_token_accuracy": 0.1678036108613014, "num_tokens": 39775711.0, "step": 20330 }, { "entropy": 6.112554836273193, "epoch": 2.0326885590043484, "grad_norm": 1.2890625, "learning_rate": 0.00045898862260800337, "loss": 5.7691, "mean_token_accuracy": 0.1748104766011238, "num_tokens": 39786132.0, "step": 20335 }, { "entropy": 6.1353082180023195, "epoch": 2.033188384065577, "grad_norm": 1.1875, "learning_rate": 0.00045896807743435263, "loss": 5.754, "mean_token_accuracy": 0.15817032307386397, "num_tokens": 39796196.0, "step": 20340 }, { "entropy": 6.099129962921142, "epoch": 2.033688209126806, "grad_norm": 1.21875, "learning_rate": 0.0004589475276321125, "loss": 5.6337, "mean_token_accuracy": 0.17562458515167237, "num_tokens": 39805912.0, "step": 20345 }, { "entropy": 6.051821613311768, "epoch": 2.034188034188034, "grad_norm": 1.234375, "learning_rate": 0.00045892697320179987, "loss": 5.6072, "mean_token_accuracy": 0.18414118736982346, "num_tokens": 39814990.0, "step": 20350 }, { "entropy": 6.000114870071411, "epoch": 2.0346878592492628, "grad_norm": 1.21875, "learning_rate": 0.0004589064141439319, "loss": 5.6977, "mean_token_accuracy": 0.17812246233224868, "num_tokens": 39823877.0, "step": 20355 }, { "entropy": 5.956132793426514, "epoch": 2.0351876843104915, "grad_norm": 1.2421875, "learning_rate": 0.0004588858504590259, "loss": 5.5648, "mean_token_accuracy": 0.1835416540503502, "num_tokens": 39832784.0, "step": 20360 }, { "entropy": 6.116368389129638, "epoch": 2.0356875093717197, "grad_norm": 1.1953125, "learning_rate": 0.0004588652821475992, "loss": 5.6703, "mean_token_accuracy": 0.1691375583410263, "num_tokens": 39842388.0, "step": 20365 }, { "entropy": 6.052047777175903, "epoch": 2.0361873344329484, "grad_norm": 1.1328125, "learning_rate": 0.00045884470921016935, "loss": 5.6353, "mean_token_accuracy": 0.18222550451755523, "num_tokens": 39851657.0, "step": 20370 }, { "entropy": 6.099119186401367, "epoch": 2.036687159494177, "grad_norm": 1.2578125, "learning_rate": 0.00045882413164725395, "loss": 5.71, "mean_token_accuracy": 0.17035361528396606, "num_tokens": 39861941.0, "step": 20375 }, { "entropy": 6.033570241928101, "epoch": 2.037186984555406, "grad_norm": 1.296875, "learning_rate": 0.00045880354945937056, "loss": 5.6375, "mean_token_accuracy": 0.17889701277017594, "num_tokens": 39872000.0, "step": 20380 }, { "entropy": 6.063420724868775, "epoch": 2.037686809616634, "grad_norm": 1.1484375, "learning_rate": 0.0004587829626470373, "loss": 5.6991, "mean_token_accuracy": 0.1693100854754448, "num_tokens": 39882281.0, "step": 20385 }, { "entropy": 6.086519765853882, "epoch": 2.0381866346778628, "grad_norm": 1.1484375, "learning_rate": 0.00045876237121077196, "loss": 5.698, "mean_token_accuracy": 0.17771842032670976, "num_tokens": 39892445.0, "step": 20390 }, { "entropy": 6.054373359680175, "epoch": 2.0386864597390915, "grad_norm": 1.2578125, "learning_rate": 0.0004587417751510926, "loss": 5.6419, "mean_token_accuracy": 0.1791992887854576, "num_tokens": 39902077.0, "step": 20395 }, { "entropy": 6.0784351348876955, "epoch": 2.0391862848003197, "grad_norm": 1.25, "learning_rate": 0.00045872117446851753, "loss": 5.726, "mean_token_accuracy": 0.16811724305152892, "num_tokens": 39912930.0, "step": 20400 }, { "entropy": 6.08008508682251, "epoch": 2.0396861098615484, "grad_norm": 1.3359375, "learning_rate": 0.0004587005691635649, "loss": 5.649, "mean_token_accuracy": 0.1756546229124069, "num_tokens": 39921884.0, "step": 20405 }, { "entropy": 6.153205537796021, "epoch": 2.040185934922777, "grad_norm": 1.125, "learning_rate": 0.00045867995923675326, "loss": 5.7405, "mean_token_accuracy": 0.1669187918305397, "num_tokens": 39931589.0, "step": 20410 }, { "entropy": 6.148994731903076, "epoch": 2.040685759984006, "grad_norm": 1.25, "learning_rate": 0.0004586593446886011, "loss": 5.7655, "mean_token_accuracy": 0.16430536061525344, "num_tokens": 39941624.0, "step": 20415 }, { "entropy": 6.049576616287231, "epoch": 2.041185585045234, "grad_norm": 1.2734375, "learning_rate": 0.0004586387255196271, "loss": 5.6356, "mean_token_accuracy": 0.1761637657880783, "num_tokens": 39951541.0, "step": 20420 }, { "entropy": 6.088350582122803, "epoch": 2.0416854101064628, "grad_norm": 1.1875, "learning_rate": 0.00045861810173035, "loss": 5.719, "mean_token_accuracy": 0.1736340641975403, "num_tokens": 39962729.0, "step": 20425 }, { "entropy": 6.116737270355225, "epoch": 2.0421852351676915, "grad_norm": 1.1640625, "learning_rate": 0.00045859747332128883, "loss": 5.7186, "mean_token_accuracy": 0.17478419095277786, "num_tokens": 39972193.0, "step": 20430 }, { "entropy": 6.080168676376343, "epoch": 2.0426850602289197, "grad_norm": 1.15625, "learning_rate": 0.0004585768402929623, "loss": 5.6938, "mean_token_accuracy": 0.1645065277814865, "num_tokens": 39980813.0, "step": 20435 }, { "entropy": 6.050087308883667, "epoch": 2.0431848852901484, "grad_norm": 1.1953125, "learning_rate": 0.0004585562026458898, "loss": 5.6639, "mean_token_accuracy": 0.18184519857168197, "num_tokens": 39989147.0, "step": 20440 }, { "entropy": 6.016243600845337, "epoch": 2.043684710351377, "grad_norm": 1.2578125, "learning_rate": 0.00045853556038059044, "loss": 5.6721, "mean_token_accuracy": 0.1791103884577751, "num_tokens": 40000091.0, "step": 20445 }, { "entropy": 6.150309991836548, "epoch": 2.0441845354126054, "grad_norm": 1.2265625, "learning_rate": 0.00045851491349758366, "loss": 5.7664, "mean_token_accuracy": 0.17039090096950532, "num_tokens": 40009443.0, "step": 20450 }, { "entropy": 6.126755285263061, "epoch": 2.044684360473834, "grad_norm": 1.1015625, "learning_rate": 0.00045849426199738884, "loss": 5.7182, "mean_token_accuracy": 0.1728259116411209, "num_tokens": 40020877.0, "step": 20455 }, { "entropy": 6.087894105911255, "epoch": 2.0451841855350628, "grad_norm": 1.2578125, "learning_rate": 0.0004584736058805256, "loss": 5.744, "mean_token_accuracy": 0.17785179913043975, "num_tokens": 40030952.0, "step": 20460 }, { "entropy": 6.082538700103759, "epoch": 2.0456840105962915, "grad_norm": 1.3671875, "learning_rate": 0.0004584529451475137, "loss": 5.6682, "mean_token_accuracy": 0.1715752512216568, "num_tokens": 40039995.0, "step": 20465 }, { "entropy": 6.035723543167114, "epoch": 2.0461838356575197, "grad_norm": 1.2421875, "learning_rate": 0.00045843227979887286, "loss": 5.6007, "mean_token_accuracy": 0.18163315206766129, "num_tokens": 40049346.0, "step": 20470 }, { "entropy": 6.066049814224243, "epoch": 2.0466836607187484, "grad_norm": 1.140625, "learning_rate": 0.00045841160983512303, "loss": 5.7074, "mean_token_accuracy": 0.17245981991291046, "num_tokens": 40058371.0, "step": 20475 }, { "entropy": 6.040920639038086, "epoch": 2.047183485779977, "grad_norm": 1.2578125, "learning_rate": 0.0004583909352567843, "loss": 5.6259, "mean_token_accuracy": 0.17842479944229125, "num_tokens": 40067504.0, "step": 20480 }, { "entropy": 6.065737533569336, "epoch": 2.0476833108412054, "grad_norm": 1.1875, "learning_rate": 0.0004583702560643769, "loss": 5.6799, "mean_token_accuracy": 0.18423683643341066, "num_tokens": 40077551.0, "step": 20485 }, { "entropy": 6.101685094833374, "epoch": 2.048183135902434, "grad_norm": 1.109375, "learning_rate": 0.000458349572258421, "loss": 5.7025, "mean_token_accuracy": 0.16679072380065918, "num_tokens": 40087896.0, "step": 20490 }, { "entropy": 6.076264047622681, "epoch": 2.0486829609636628, "grad_norm": 1.234375, "learning_rate": 0.00045832888383943706, "loss": 5.6418, "mean_token_accuracy": 0.1748429447412491, "num_tokens": 40097197.0, "step": 20495 }, { "entropy": 6.140564823150635, "epoch": 2.0491827860248915, "grad_norm": 1.140625, "learning_rate": 0.0004583081908079455, "loss": 5.7148, "mean_token_accuracy": 0.17130834907293319, "num_tokens": 40108068.0, "step": 20500 }, { "entropy": 6.032321453094482, "epoch": 2.0496826110861197, "grad_norm": 1.2265625, "learning_rate": 0.0004582874931644671, "loss": 5.6661, "mean_token_accuracy": 0.17062364071607589, "num_tokens": 40116905.0, "step": 20505 }, { "entropy": 6.02406120300293, "epoch": 2.0501824361473484, "grad_norm": 1.2109375, "learning_rate": 0.00045826679090952253, "loss": 5.655, "mean_token_accuracy": 0.17141062766313553, "num_tokens": 40126611.0, "step": 20510 }, { "entropy": 6.011526775360108, "epoch": 2.050682261208577, "grad_norm": 1.2265625, "learning_rate": 0.00045824608404363267, "loss": 5.5519, "mean_token_accuracy": 0.18007354587316513, "num_tokens": 40136557.0, "step": 20515 }, { "entropy": 6.0919411182403564, "epoch": 2.0511820862698054, "grad_norm": 1.125, "learning_rate": 0.0004582253725673184, "loss": 5.6757, "mean_token_accuracy": 0.168178927898407, "num_tokens": 40146637.0, "step": 20520 }, { "entropy": 6.115887594223023, "epoch": 2.051681911331034, "grad_norm": 1.1328125, "learning_rate": 0.000458204656481101, "loss": 5.6158, "mean_token_accuracy": 0.17620432525873184, "num_tokens": 40156763.0, "step": 20525 }, { "entropy": 6.031459331512451, "epoch": 2.0521817363922628, "grad_norm": 1.1953125, "learning_rate": 0.0004581839357855015, "loss": 5.6685, "mean_token_accuracy": 0.17504208236932756, "num_tokens": 40167024.0, "step": 20530 }, { "entropy": 6.060496807098389, "epoch": 2.0526815614534915, "grad_norm": 1.203125, "learning_rate": 0.00045816321048104143, "loss": 5.6367, "mean_token_accuracy": 0.17103224098682404, "num_tokens": 40176977.0, "step": 20535 }, { "entropy": 6.014176702499389, "epoch": 2.0531813865147197, "grad_norm": 1.1953125, "learning_rate": 0.0004581424805682421, "loss": 5.5804, "mean_token_accuracy": 0.17368256747722627, "num_tokens": 40187820.0, "step": 20540 }, { "entropy": 6.095091485977173, "epoch": 2.0536812115759484, "grad_norm": 1.2265625, "learning_rate": 0.000458121746047625, "loss": 5.6584, "mean_token_accuracy": 0.17084798067808152, "num_tokens": 40197518.0, "step": 20545 }, { "entropy": 6.092929887771606, "epoch": 2.054181036637177, "grad_norm": 1.109375, "learning_rate": 0.0004581010069197119, "loss": 5.7502, "mean_token_accuracy": 0.16642735227942468, "num_tokens": 40208360.0, "step": 20550 }, { "entropy": 6.074043464660645, "epoch": 2.0546808616984054, "grad_norm": 1.1640625, "learning_rate": 0.00045808026318502464, "loss": 5.7579, "mean_token_accuracy": 0.1720088705420494, "num_tokens": 40219526.0, "step": 20555 }, { "entropy": 6.126330280303955, "epoch": 2.055180686759634, "grad_norm": 1.15625, "learning_rate": 0.0004580595148440851, "loss": 5.6867, "mean_token_accuracy": 0.17019727379083632, "num_tokens": 40230661.0, "step": 20560 }, { "entropy": 6.094132995605468, "epoch": 2.0556805118208628, "grad_norm": 1.15625, "learning_rate": 0.0004580387618974152, "loss": 5.783, "mean_token_accuracy": 0.16729024052619934, "num_tokens": 40241675.0, "step": 20565 }, { "entropy": 6.07023344039917, "epoch": 2.0561803368820915, "grad_norm": 1.171875, "learning_rate": 0.00045801800434553715, "loss": 5.6173, "mean_token_accuracy": 0.17420373260974883, "num_tokens": 40251275.0, "step": 20570 }, { "entropy": 6.123404836654663, "epoch": 2.0566801619433197, "grad_norm": 1.140625, "learning_rate": 0.0004579972421889732, "loss": 5.7044, "mean_token_accuracy": 0.17232297360897064, "num_tokens": 40260975.0, "step": 20575 }, { "entropy": 6.043794631958008, "epoch": 2.0571799870045484, "grad_norm": 1.1328125, "learning_rate": 0.0004579764754282458, "loss": 5.6563, "mean_token_accuracy": 0.174043932557106, "num_tokens": 40271617.0, "step": 20580 }, { "entropy": 6.061738729476929, "epoch": 2.057679812065777, "grad_norm": 1.1953125, "learning_rate": 0.00045795570406387726, "loss": 5.6105, "mean_token_accuracy": 0.1701284572482109, "num_tokens": 40281365.0, "step": 20585 }, { "entropy": 6.060124444961548, "epoch": 2.0581796371270054, "grad_norm": 1.2890625, "learning_rate": 0.0004579349280963904, "loss": 5.6719, "mean_token_accuracy": 0.1702652871608734, "num_tokens": 40291050.0, "step": 20590 }, { "entropy": 6.034000015258789, "epoch": 2.058679462188234, "grad_norm": 1.203125, "learning_rate": 0.00045791414752630765, "loss": 5.5467, "mean_token_accuracy": 0.1794648513197899, "num_tokens": 40299911.0, "step": 20595 }, { "entropy": 6.04473123550415, "epoch": 2.0591792872494628, "grad_norm": 1.21875, "learning_rate": 0.0004578933623541522, "loss": 5.6544, "mean_token_accuracy": 0.1734946697950363, "num_tokens": 40310860.0, "step": 20600 }, { "entropy": 6.055109548568725, "epoch": 2.0596791123106915, "grad_norm": 1.296875, "learning_rate": 0.00045787257258044666, "loss": 5.7275, "mean_token_accuracy": 0.17559722810983658, "num_tokens": 40320045.0, "step": 20605 }, { "entropy": 6.0331666469573975, "epoch": 2.0601789373719197, "grad_norm": 1.265625, "learning_rate": 0.00045785177820571434, "loss": 5.7003, "mean_token_accuracy": 0.17166504561901091, "num_tokens": 40329082.0, "step": 20610 }, { "entropy": 6.0015363693237305, "epoch": 2.0606787624331484, "grad_norm": 1.21875, "learning_rate": 0.00045783097923047833, "loss": 5.6048, "mean_token_accuracy": 0.1797710731625557, "num_tokens": 40338161.0, "step": 20615 }, { "entropy": 6.099999618530274, "epoch": 2.061178587494377, "grad_norm": 1.1796875, "learning_rate": 0.00045781017565526194, "loss": 5.7244, "mean_token_accuracy": 0.16695560663938522, "num_tokens": 40348316.0, "step": 20620 }, { "entropy": 6.111133146286011, "epoch": 2.0616784125556054, "grad_norm": 1.890625, "learning_rate": 0.00045778936748058855, "loss": 5.6857, "mean_token_accuracy": 0.16966263204813004, "num_tokens": 40358112.0, "step": 20625 }, { "entropy": 6.052626705169677, "epoch": 2.062178237616834, "grad_norm": 1.0859375, "learning_rate": 0.00045776855470698163, "loss": 5.6514, "mean_token_accuracy": 0.18248414546251296, "num_tokens": 40368670.0, "step": 20630 }, { "entropy": 6.0200357913970945, "epoch": 2.0626780626780628, "grad_norm": 1.3359375, "learning_rate": 0.00045774773733496505, "loss": 5.642, "mean_token_accuracy": 0.17645278573036194, "num_tokens": 40378082.0, "step": 20635 }, { "entropy": 6.1242743015289305, "epoch": 2.0631778877392914, "grad_norm": 1.125, "learning_rate": 0.0004577269153650624, "loss": 5.7033, "mean_token_accuracy": 0.16984138488769532, "num_tokens": 40387679.0, "step": 20640 }, { "entropy": 6.11882209777832, "epoch": 2.0636777128005197, "grad_norm": 1.09375, "learning_rate": 0.0004577060887977975, "loss": 5.643, "mean_token_accuracy": 0.17401585280895232, "num_tokens": 40397599.0, "step": 20645 }, { "entropy": 6.154007768630981, "epoch": 2.0641775378617484, "grad_norm": 1.09375, "learning_rate": 0.00045768525763369443, "loss": 5.6711, "mean_token_accuracy": 0.17306867688894273, "num_tokens": 40407163.0, "step": 20650 }, { "entropy": 5.991796255111694, "epoch": 2.064677362922977, "grad_norm": 1.0859375, "learning_rate": 0.00045766442187327735, "loss": 5.6359, "mean_token_accuracy": 0.176875801384449, "num_tokens": 40416489.0, "step": 20655 }, { "entropy": 6.033590316772461, "epoch": 2.0651771879842054, "grad_norm": 1.265625, "learning_rate": 0.00045764358151707043, "loss": 5.7186, "mean_token_accuracy": 0.17028831988573073, "num_tokens": 40425193.0, "step": 20660 }, { "entropy": 6.072287845611572, "epoch": 2.065677013045434, "grad_norm": 1.125, "learning_rate": 0.0004576227365655979, "loss": 5.7355, "mean_token_accuracy": 0.17852805256843568, "num_tokens": 40434025.0, "step": 20665 }, { "entropy": 6.074138450622558, "epoch": 2.0661768381066627, "grad_norm": 1.265625, "learning_rate": 0.0004576018870193844, "loss": 5.7308, "mean_token_accuracy": 0.17524137943983079, "num_tokens": 40443010.0, "step": 20670 }, { "entropy": 6.081421518325806, "epoch": 2.0666766631678914, "grad_norm": 1.171875, "learning_rate": 0.0004575810328789543, "loss": 5.7027, "mean_token_accuracy": 0.16707088500261308, "num_tokens": 40452673.0, "step": 20675 }, { "entropy": 6.027284145355225, "epoch": 2.0671764882291197, "grad_norm": 1.171875, "learning_rate": 0.0004575601741448325, "loss": 5.6809, "mean_token_accuracy": 0.17248480916023254, "num_tokens": 40461747.0, "step": 20680 }, { "entropy": 6.0459771156311035, "epoch": 2.0676763132903484, "grad_norm": 1.2265625, "learning_rate": 0.00045753931081754366, "loss": 5.6335, "mean_token_accuracy": 0.17251685112714768, "num_tokens": 40470674.0, "step": 20685 }, { "entropy": 6.066454362869263, "epoch": 2.068176138351577, "grad_norm": 1.15625, "learning_rate": 0.0004575184428976127, "loss": 5.6342, "mean_token_accuracy": 0.17397847175598144, "num_tokens": 40480287.0, "step": 20690 }, { "entropy": 6.016861343383789, "epoch": 2.0686759634128054, "grad_norm": 1.2578125, "learning_rate": 0.0004574975703855647, "loss": 5.5704, "mean_token_accuracy": 0.1805051937699318, "num_tokens": 40489990.0, "step": 20695 }, { "entropy": 6.059269809722901, "epoch": 2.069175788474034, "grad_norm": 1.2265625, "learning_rate": 0.00045747669328192477, "loss": 5.695, "mean_token_accuracy": 0.17664320319890975, "num_tokens": 40500999.0, "step": 20700 }, { "entropy": 6.093976259231567, "epoch": 2.0696756135352627, "grad_norm": 1.15625, "learning_rate": 0.0004574558115872183, "loss": 5.6917, "mean_token_accuracy": 0.17347504943609238, "num_tokens": 40509607.0, "step": 20705 }, { "entropy": 5.961733627319336, "epoch": 2.0701754385964914, "grad_norm": 1.2890625, "learning_rate": 0.00045743492530197046, "loss": 5.5768, "mean_token_accuracy": 0.17583061009645462, "num_tokens": 40518312.0, "step": 20710 }, { "entropy": 6.011999702453613, "epoch": 2.0706752636577197, "grad_norm": 1.140625, "learning_rate": 0.0004574140344267069, "loss": 5.6945, "mean_token_accuracy": 0.17529899030923843, "num_tokens": 40528015.0, "step": 20715 }, { "entropy": 6.058765983581543, "epoch": 2.0711750887189484, "grad_norm": 1.1796875, "learning_rate": 0.0004573931389619531, "loss": 5.7077, "mean_token_accuracy": 0.16676236540079117, "num_tokens": 40537557.0, "step": 20720 }, { "entropy": 6.077595520019531, "epoch": 2.071674913780177, "grad_norm": 1.125, "learning_rate": 0.00045737223890823494, "loss": 5.6475, "mean_token_accuracy": 0.1656878873705864, "num_tokens": 40547360.0, "step": 20725 }, { "entropy": 6.156688928604126, "epoch": 2.0721747388414054, "grad_norm": 1.1953125, "learning_rate": 0.00045735133426607813, "loss": 5.8437, "mean_token_accuracy": 0.1636424332857132, "num_tokens": 40558156.0, "step": 20730 }, { "entropy": 6.09121470451355, "epoch": 2.072674563902634, "grad_norm": 1.15625, "learning_rate": 0.00045733042503600865, "loss": 5.7087, "mean_token_accuracy": 0.16733210682868957, "num_tokens": 40568732.0, "step": 20735 }, { "entropy": 5.977545738220215, "epoch": 2.0731743889638627, "grad_norm": 1.1171875, "learning_rate": 0.00045730951121855255, "loss": 5.5868, "mean_token_accuracy": 0.18073829412460327, "num_tokens": 40579093.0, "step": 20740 }, { "entropy": 6.138778591156006, "epoch": 2.0736742140250914, "grad_norm": 1.171875, "learning_rate": 0.0004572885928142362, "loss": 5.8127, "mean_token_accuracy": 0.1644661545753479, "num_tokens": 40589327.0, "step": 20745 }, { "entropy": 6.098407125473022, "epoch": 2.0741740390863197, "grad_norm": 1.171875, "learning_rate": 0.0004572676698235857, "loss": 5.6642, "mean_token_accuracy": 0.1729595184326172, "num_tokens": 40600054.0, "step": 20750 }, { "entropy": 6.138379526138306, "epoch": 2.0746738641475484, "grad_norm": 1.296875, "learning_rate": 0.0004572467422471275, "loss": 5.6953, "mean_token_accuracy": 0.1763329640030861, "num_tokens": 40609286.0, "step": 20755 }, { "entropy": 6.103570127487183, "epoch": 2.075173689208777, "grad_norm": 1.2421875, "learning_rate": 0.00045722581008538816, "loss": 5.7968, "mean_token_accuracy": 0.17277758866548537, "num_tokens": 40618150.0, "step": 20760 }, { "entropy": 6.036206436157227, "epoch": 2.0756735142700053, "grad_norm": 1.2890625, "learning_rate": 0.0004572048733388944, "loss": 5.5505, "mean_token_accuracy": 0.19003332108259202, "num_tokens": 40627842.0, "step": 20765 }, { "entropy": 6.081304216384888, "epoch": 2.076173339331234, "grad_norm": 1.203125, "learning_rate": 0.00045718393200817284, "loss": 5.6382, "mean_token_accuracy": 0.1789113014936447, "num_tokens": 40637767.0, "step": 20770 }, { "entropy": 6.029018545150757, "epoch": 2.0766731643924627, "grad_norm": 1.125, "learning_rate": 0.00045716298609375044, "loss": 5.7488, "mean_token_accuracy": 0.16704170554876327, "num_tokens": 40648611.0, "step": 20775 }, { "entropy": 6.110093402862549, "epoch": 2.077172989453691, "grad_norm": 1.1484375, "learning_rate": 0.00045714203559615423, "loss": 5.7212, "mean_token_accuracy": 0.1734963595867157, "num_tokens": 40659664.0, "step": 20780 }, { "entropy": 6.069572019577026, "epoch": 2.0776728145149197, "grad_norm": 1.21875, "learning_rate": 0.0004571210805159112, "loss": 5.6359, "mean_token_accuracy": 0.17799576967954636, "num_tokens": 40669145.0, "step": 20785 }, { "entropy": 6.088476705551147, "epoch": 2.0781726395761484, "grad_norm": 1.1640625, "learning_rate": 0.0004571001208535487, "loss": 5.6395, "mean_token_accuracy": 0.17895632982254028, "num_tokens": 40678250.0, "step": 20790 }, { "entropy": 6.043583011627197, "epoch": 2.078672464637377, "grad_norm": 1.078125, "learning_rate": 0.000457079156609594, "loss": 5.637, "mean_token_accuracy": 0.17629288882017136, "num_tokens": 40687590.0, "step": 20795 }, { "entropy": 5.894083452224732, "epoch": 2.0791722896986053, "grad_norm": 1.1640625, "learning_rate": 0.0004570581877845746, "loss": 5.5875, "mean_token_accuracy": 0.17559274286031723, "num_tokens": 40697452.0, "step": 20800 }, { "entropy": 6.08178973197937, "epoch": 2.079672114759834, "grad_norm": 1.1171875, "learning_rate": 0.000457037214379018, "loss": 5.7252, "mean_token_accuracy": 0.17359966188669204, "num_tokens": 40707608.0, "step": 20805 }, { "entropy": 6.127851343154907, "epoch": 2.0801719398210627, "grad_norm": 1.5390625, "learning_rate": 0.00045701623639345204, "loss": 5.6472, "mean_token_accuracy": 0.17511545568704606, "num_tokens": 40717369.0, "step": 20810 }, { "entropy": 6.026893377304077, "epoch": 2.080671764882291, "grad_norm": 1.21875, "learning_rate": 0.00045699525382840423, "loss": 5.58, "mean_token_accuracy": 0.18460170328617095, "num_tokens": 40725899.0, "step": 20815 }, { "entropy": 6.0821774959564205, "epoch": 2.0811715899435197, "grad_norm": 1.21875, "learning_rate": 0.00045697426668440277, "loss": 5.7551, "mean_token_accuracy": 0.1632165417075157, "num_tokens": 40735252.0, "step": 20820 }, { "entropy": 6.131407403945923, "epoch": 2.0816714150047484, "grad_norm": 1.1953125, "learning_rate": 0.00045695327496197557, "loss": 5.762, "mean_token_accuracy": 0.16980428248643875, "num_tokens": 40745828.0, "step": 20825 }, { "entropy": 6.075436592102051, "epoch": 2.082171240065977, "grad_norm": 1.3828125, "learning_rate": 0.0004569322786616508, "loss": 5.6601, "mean_token_accuracy": 0.17247687429189681, "num_tokens": 40756388.0, "step": 20830 }, { "entropy": 6.015303325653076, "epoch": 2.0826710651272053, "grad_norm": 1.34375, "learning_rate": 0.0004569112777839567, "loss": 5.5425, "mean_token_accuracy": 0.17467869967222213, "num_tokens": 40765914.0, "step": 20835 }, { "entropy": 6.032530689239502, "epoch": 2.083170890188434, "grad_norm": 1.28125, "learning_rate": 0.00045689027232942165, "loss": 5.604, "mean_token_accuracy": 0.17408095598220824, "num_tokens": 40775015.0, "step": 20840 }, { "entropy": 5.932141447067261, "epoch": 2.0836707152496627, "grad_norm": 1.2109375, "learning_rate": 0.0004568692622985742, "loss": 5.5926, "mean_token_accuracy": 0.17582179009914398, "num_tokens": 40783743.0, "step": 20845 }, { "entropy": 6.046247673034668, "epoch": 2.084170540310891, "grad_norm": 1.3203125, "learning_rate": 0.00045684824769194284, "loss": 5.7199, "mean_token_accuracy": 0.17527076750993728, "num_tokens": 40793973.0, "step": 20850 }, { "entropy": 6.114718008041382, "epoch": 2.0846703653721197, "grad_norm": 1.296875, "learning_rate": 0.0004568272285100564, "loss": 5.6639, "mean_token_accuracy": 0.17568481117486953, "num_tokens": 40803800.0, "step": 20855 }, { "entropy": 6.15155062675476, "epoch": 2.0851701904333484, "grad_norm": 1.53125, "learning_rate": 0.0004568062047534437, "loss": 5.7017, "mean_token_accuracy": 0.17210457772016524, "num_tokens": 40812791.0, "step": 20860 }, { "entropy": 6.057941818237305, "epoch": 2.085670015494577, "grad_norm": 1.2109375, "learning_rate": 0.0004567851764226337, "loss": 5.7054, "mean_token_accuracy": 0.1779686003923416, "num_tokens": 40822498.0, "step": 20865 }, { "entropy": 6.019943380355835, "epoch": 2.0861698405558053, "grad_norm": 1.1875, "learning_rate": 0.00045676414351815533, "loss": 5.5716, "mean_token_accuracy": 0.1813590943813324, "num_tokens": 40831965.0, "step": 20870 }, { "entropy": 6.062142324447632, "epoch": 2.086669665617034, "grad_norm": 1.21875, "learning_rate": 0.0004567431060405379, "loss": 5.6634, "mean_token_accuracy": 0.16894571781158446, "num_tokens": 40840521.0, "step": 20875 }, { "entropy": 6.044579792022705, "epoch": 2.0871694906782627, "grad_norm": 1.1640625, "learning_rate": 0.0004567220639903108, "loss": 5.7728, "mean_token_accuracy": 0.17107580453157425, "num_tokens": 40850935.0, "step": 20880 }, { "entropy": 6.056697034835816, "epoch": 2.087669315739491, "grad_norm": 1.171875, "learning_rate": 0.00045670101736800325, "loss": 5.6556, "mean_token_accuracy": 0.17859412133693695, "num_tokens": 40860662.0, "step": 20885 }, { "entropy": 5.920725727081299, "epoch": 2.0881691408007197, "grad_norm": 1.15625, "learning_rate": 0.00045667996617414485, "loss": 5.4648, "mean_token_accuracy": 0.18851417452096939, "num_tokens": 40870818.0, "step": 20890 }, { "entropy": 6.07517557144165, "epoch": 2.0886689658619484, "grad_norm": 1.1484375, "learning_rate": 0.0004566589104092653, "loss": 5.8042, "mean_token_accuracy": 0.1679603025317192, "num_tokens": 40880842.0, "step": 20895 }, { "entropy": 6.1298644065856935, "epoch": 2.089168790923177, "grad_norm": 1.109375, "learning_rate": 0.0004566378500738943, "loss": 5.7685, "mean_token_accuracy": 0.17060995250940322, "num_tokens": 40892070.0, "step": 20900 }, { "entropy": 6.01724591255188, "epoch": 2.0896686159844053, "grad_norm": 1.1171875, "learning_rate": 0.00045661678516856164, "loss": 5.5307, "mean_token_accuracy": 0.18394319713115692, "num_tokens": 40901588.0, "step": 20905 }, { "entropy": 6.113409805297851, "epoch": 2.090168441045634, "grad_norm": 1.1484375, "learning_rate": 0.0004565957156937975, "loss": 5.6849, "mean_token_accuracy": 0.1786071166396141, "num_tokens": 40909961.0, "step": 20910 }, { "entropy": 6.089390420913697, "epoch": 2.0906682661068627, "grad_norm": 1.09375, "learning_rate": 0.0004565746416501318, "loss": 5.6795, "mean_token_accuracy": 0.17709096074104308, "num_tokens": 40919528.0, "step": 20915 }, { "entropy": 6.065116119384766, "epoch": 2.091168091168091, "grad_norm": 1.1953125, "learning_rate": 0.00045655356303809494, "loss": 5.6762, "mean_token_accuracy": 0.17108058482408522, "num_tokens": 40929975.0, "step": 20920 }, { "entropy": 6.07010440826416, "epoch": 2.0916679162293197, "grad_norm": 1.1640625, "learning_rate": 0.00045653247985821707, "loss": 5.6288, "mean_token_accuracy": 0.17442016303539276, "num_tokens": 40939952.0, "step": 20925 }, { "entropy": 6.039519453048706, "epoch": 2.0921677412905484, "grad_norm": 1.203125, "learning_rate": 0.00045651139211102875, "loss": 5.5859, "mean_token_accuracy": 0.18164878636598586, "num_tokens": 40948935.0, "step": 20930 }, { "entropy": 5.984440660476684, "epoch": 2.092667566351777, "grad_norm": 1.125, "learning_rate": 0.00045649029979706054, "loss": 5.6282, "mean_token_accuracy": 0.17706005573272704, "num_tokens": 40958169.0, "step": 20935 }, { "entropy": 6.0194236755371096, "epoch": 2.0931673914130053, "grad_norm": 1.15625, "learning_rate": 0.00045646920291684303, "loss": 5.6527, "mean_token_accuracy": 0.17727464139461518, "num_tokens": 40967920.0, "step": 20940 }, { "entropy": 6.047277736663818, "epoch": 2.093667216474234, "grad_norm": 1.3515625, "learning_rate": 0.0004564481014709072, "loss": 5.6477, "mean_token_accuracy": 0.1758141800761223, "num_tokens": 40977494.0, "step": 20945 }, { "entropy": 6.131130838394165, "epoch": 2.0941670415354627, "grad_norm": 1.140625, "learning_rate": 0.0004564269954597836, "loss": 5.7313, "mean_token_accuracy": 0.16574118584394454, "num_tokens": 40987838.0, "step": 20950 }, { "entropy": 6.024343872070313, "epoch": 2.094666866596691, "grad_norm": 1.15625, "learning_rate": 0.00045640588488400364, "loss": 5.5447, "mean_token_accuracy": 0.17981948107481002, "num_tokens": 40997308.0, "step": 20955 }, { "entropy": 5.9922689437866214, "epoch": 2.0951666916579197, "grad_norm": 1.171875, "learning_rate": 0.0004563847697440983, "loss": 5.6863, "mean_token_accuracy": 0.17248110771179198, "num_tokens": 41008159.0, "step": 20960 }, { "entropy": 6.0828855514526365, "epoch": 2.0956665167191484, "grad_norm": 1.1796875, "learning_rate": 0.00045636365004059876, "loss": 5.7214, "mean_token_accuracy": 0.17098451554775237, "num_tokens": 41018224.0, "step": 20965 }, { "entropy": 6.058098173141479, "epoch": 2.0961663417803766, "grad_norm": 1.1640625, "learning_rate": 0.00045634252577403644, "loss": 5.6094, "mean_token_accuracy": 0.17631808072328567, "num_tokens": 41026995.0, "step": 20970 }, { "entropy": 6.0191734790802, "epoch": 2.0966661668416053, "grad_norm": 1.2734375, "learning_rate": 0.00045632139694494294, "loss": 5.5906, "mean_token_accuracy": 0.1857874482870102, "num_tokens": 41036243.0, "step": 20975 }, { "entropy": 6.04973349571228, "epoch": 2.097165991902834, "grad_norm": 1.296875, "learning_rate": 0.0004563002635538496, "loss": 5.6575, "mean_token_accuracy": 0.1716335192322731, "num_tokens": 41046196.0, "step": 20980 }, { "entropy": 6.042449283599853, "epoch": 2.0976658169640627, "grad_norm": 1.3203125, "learning_rate": 0.0004562791256012884, "loss": 5.6514, "mean_token_accuracy": 0.18357468396425247, "num_tokens": 41057053.0, "step": 20985 }, { "entropy": 6.151152467727661, "epoch": 2.098165642025291, "grad_norm": 1.2578125, "learning_rate": 0.0004562579830877911, "loss": 5.8007, "mean_token_accuracy": 0.1707794949412346, "num_tokens": 41067349.0, "step": 20990 }, { "entropy": 6.079155588150025, "epoch": 2.0986654670865197, "grad_norm": 1.21875, "learning_rate": 0.0004562368360138894, "loss": 5.7135, "mean_token_accuracy": 0.1743532732129097, "num_tokens": 41077327.0, "step": 20995 }, { "entropy": 6.058238410949707, "epoch": 2.0991652921477484, "grad_norm": 1.2421875, "learning_rate": 0.0004562156843801157, "loss": 5.6412, "mean_token_accuracy": 0.17634079456329346, "num_tokens": 41086569.0, "step": 21000 }, { "epoch": 2.0991652921477484, "eval_entropy": 5.882166661358593, "eval_loss": 5.825972557067871, "eval_mean_token_accuracy": 0.17458519192795968, "eval_num_tokens": 41086569.0, "eval_runtime": 23.7, "eval_samples_per_second": 1309.918, "eval_steps_per_second": 163.756, "step": 21000 }, { "entropy": 6.038561630249023, "epoch": 2.0996651172089766, "grad_norm": 1.1953125, "learning_rate": 0.00045619452818700194, "loss": 5.6254, "mean_token_accuracy": 0.17201472967863082, "num_tokens": 41095170.0, "step": 21005 }, { "entropy": 6.069289588928223, "epoch": 2.1001649422702053, "grad_norm": 1.2265625, "learning_rate": 0.00045617336743508056, "loss": 5.6093, "mean_token_accuracy": 0.18301283419132233, "num_tokens": 41104778.0, "step": 21010 }, { "entropy": 5.994983339309693, "epoch": 2.100664767331434, "grad_norm": 1.3046875, "learning_rate": 0.0004561522021248837, "loss": 5.5414, "mean_token_accuracy": 0.18350038081407546, "num_tokens": 41114133.0, "step": 21015 }, { "entropy": 6.073039722442627, "epoch": 2.1011645923926627, "grad_norm": 1.171875, "learning_rate": 0.0004561310322569442, "loss": 5.6556, "mean_token_accuracy": 0.17736288011074067, "num_tokens": 41125052.0, "step": 21020 }, { "entropy": 6.0408008098602295, "epoch": 2.101664417453891, "grad_norm": 1.21875, "learning_rate": 0.00045610985783179454, "loss": 5.6597, "mean_token_accuracy": 0.17129295617341994, "num_tokens": 41134160.0, "step": 21025 }, { "entropy": 6.0434144020080565, "epoch": 2.1021642425151197, "grad_norm": 1.1328125, "learning_rate": 0.0004560886788499674, "loss": 5.6042, "mean_token_accuracy": 0.18064468950033188, "num_tokens": 41144729.0, "step": 21030 }, { "entropy": 6.074617004394531, "epoch": 2.1026640675763484, "grad_norm": 1.359375, "learning_rate": 0.00045606749531199573, "loss": 5.7041, "mean_token_accuracy": 0.17435962110757827, "num_tokens": 41154935.0, "step": 21035 }, { "entropy": 6.071571254730225, "epoch": 2.1031638926375766, "grad_norm": 1.171875, "learning_rate": 0.00045604630721841243, "loss": 5.6392, "mean_token_accuracy": 0.17616469264030457, "num_tokens": 41164644.0, "step": 21040 }, { "entropy": 6.012654066085815, "epoch": 2.1036637176988053, "grad_norm": 1.171875, "learning_rate": 0.00045602511456975064, "loss": 5.5906, "mean_token_accuracy": 0.18359473198652268, "num_tokens": 41174656.0, "step": 21045 }, { "entropy": 6.058246707916259, "epoch": 2.104163542760034, "grad_norm": 1.1875, "learning_rate": 0.0004560039173665436, "loss": 5.68, "mean_token_accuracy": 0.17186628580093383, "num_tokens": 41184631.0, "step": 21050 }, { "entropy": 6.080548048019409, "epoch": 2.1046633678212627, "grad_norm": 1.15625, "learning_rate": 0.0004559827156093245, "loss": 5.6485, "mean_token_accuracy": 0.17425207942724227, "num_tokens": 41195157.0, "step": 21055 }, { "entropy": 6.11781940460205, "epoch": 2.105163192882491, "grad_norm": 1.265625, "learning_rate": 0.0004559615092986268, "loss": 5.698, "mean_token_accuracy": 0.17153821289539337, "num_tokens": 41205566.0, "step": 21060 }, { "entropy": 6.016005277633667, "epoch": 2.1056630179437197, "grad_norm": 1.171875, "learning_rate": 0.00045594029843498425, "loss": 5.6127, "mean_token_accuracy": 0.17525962144136428, "num_tokens": 41214194.0, "step": 21065 }, { "entropy": 6.090572309494019, "epoch": 2.1061628430049484, "grad_norm": 1.21875, "learning_rate": 0.00045591908301893027, "loss": 5.7851, "mean_token_accuracy": 0.16877472698688506, "num_tokens": 41223965.0, "step": 21070 }, { "entropy": 6.07534704208374, "epoch": 2.1066626680661766, "grad_norm": 1.1328125, "learning_rate": 0.00045589786305099875, "loss": 5.6703, "mean_token_accuracy": 0.1765807792544365, "num_tokens": 41233374.0, "step": 21075 }, { "entropy": 6.109201526641845, "epoch": 2.1071624931274053, "grad_norm": 1.203125, "learning_rate": 0.0004558766385317235, "loss": 5.7279, "mean_token_accuracy": 0.17084459066390992, "num_tokens": 41243365.0, "step": 21080 }, { "entropy": 6.11083345413208, "epoch": 2.107662318188634, "grad_norm": 1.375, "learning_rate": 0.00045585540946163855, "loss": 5.6485, "mean_token_accuracy": 0.18230974227190017, "num_tokens": 41253013.0, "step": 21085 }, { "entropy": 6.023306655883789, "epoch": 2.1081621432498627, "grad_norm": 1.1328125, "learning_rate": 0.0004558341758412781, "loss": 5.6248, "mean_token_accuracy": 0.1822210118174553, "num_tokens": 41261889.0, "step": 21090 }, { "entropy": 6.019154977798462, "epoch": 2.108661968311091, "grad_norm": 1.2421875, "learning_rate": 0.0004558129376711763, "loss": 5.6165, "mean_token_accuracy": 0.18100370615720748, "num_tokens": 41271777.0, "step": 21095 }, { "entropy": 6.100373458862305, "epoch": 2.1091617933723197, "grad_norm": 1.1640625, "learning_rate": 0.0004557916949518675, "loss": 5.7405, "mean_token_accuracy": 0.1698204904794693, "num_tokens": 41281840.0, "step": 21100 }, { "entropy": 6.152972984313965, "epoch": 2.1096616184335484, "grad_norm": 1.2890625, "learning_rate": 0.0004557704476838862, "loss": 5.7484, "mean_token_accuracy": 0.1689772129058838, "num_tokens": 41292200.0, "step": 21105 }, { "entropy": 6.13608684539795, "epoch": 2.1101614434947766, "grad_norm": 1.359375, "learning_rate": 0.00045574919586776686, "loss": 5.7698, "mean_token_accuracy": 0.16896164715290068, "num_tokens": 41301898.0, "step": 21110 }, { "entropy": 6.064538478851318, "epoch": 2.1106612685560053, "grad_norm": 1.234375, "learning_rate": 0.00045572793950404434, "loss": 5.6585, "mean_token_accuracy": 0.1727173462510109, "num_tokens": 41311519.0, "step": 21115 }, { "entropy": 6.1098658561706545, "epoch": 2.111161093617234, "grad_norm": 1.171875, "learning_rate": 0.00045570667859325337, "loss": 5.704, "mean_token_accuracy": 0.1702266439795494, "num_tokens": 41321955.0, "step": 21120 }, { "entropy": 6.149000453948974, "epoch": 2.1116609186784627, "grad_norm": 1.0390625, "learning_rate": 0.00045568541313592884, "loss": 5.7415, "mean_token_accuracy": 0.16554326713085174, "num_tokens": 41332467.0, "step": 21125 }, { "entropy": 6.1504301071167, "epoch": 2.112160743739691, "grad_norm": 1.140625, "learning_rate": 0.00045566414313260586, "loss": 5.7806, "mean_token_accuracy": 0.16828834712505342, "num_tokens": 41342451.0, "step": 21130 }, { "entropy": 6.040538311004639, "epoch": 2.1126605688009197, "grad_norm": 1.25, "learning_rate": 0.0004556428685838194, "loss": 5.6328, "mean_token_accuracy": 0.17486201822757722, "num_tokens": 41352678.0, "step": 21135 }, { "entropy": 6.044945240020752, "epoch": 2.1131603938621484, "grad_norm": 1.1015625, "learning_rate": 0.000455621589490105, "loss": 5.736, "mean_token_accuracy": 0.17222084999084472, "num_tokens": 41362584.0, "step": 21140 }, { "entropy": 6.038116836547852, "epoch": 2.1136602189233766, "grad_norm": 1.21875, "learning_rate": 0.0004556003058519979, "loss": 5.7152, "mean_token_accuracy": 0.1729067698121071, "num_tokens": 41371988.0, "step": 21145 }, { "entropy": 6.114104843139648, "epoch": 2.1141600439846053, "grad_norm": 1.21875, "learning_rate": 0.00045557901767003347, "loss": 5.6351, "mean_token_accuracy": 0.17364222109317778, "num_tokens": 41381281.0, "step": 21150 }, { "entropy": 6.009316253662109, "epoch": 2.114659869045834, "grad_norm": 1.359375, "learning_rate": 0.00045555772494474745, "loss": 5.5501, "mean_token_accuracy": 0.18858337998390198, "num_tokens": 41389711.0, "step": 21155 }, { "entropy": 6.1277862071990965, "epoch": 2.1151596941070627, "grad_norm": 1.2109375, "learning_rate": 0.0004555364276766756, "loss": 5.6845, "mean_token_accuracy": 0.17271229028701782, "num_tokens": 41398375.0, "step": 21160 }, { "entropy": 6.105295038223266, "epoch": 2.115659519168291, "grad_norm": 1.1875, "learning_rate": 0.0004555151258663535, "loss": 5.7572, "mean_token_accuracy": 0.17001912444829942, "num_tokens": 41408372.0, "step": 21165 }, { "entropy": 6.012362098693847, "epoch": 2.1161593442295197, "grad_norm": 1.2109375, "learning_rate": 0.0004554938195143175, "loss": 5.6508, "mean_token_accuracy": 0.17710380405187606, "num_tokens": 41418231.0, "step": 21170 }, { "entropy": 6.080168533325195, "epoch": 2.1166591692907484, "grad_norm": 1.4296875, "learning_rate": 0.0004554725086211033, "loss": 5.6606, "mean_token_accuracy": 0.18289808183908463, "num_tokens": 41427646.0, "step": 21175 }, { "entropy": 6.072376918792725, "epoch": 2.1171589943519766, "grad_norm": 1.203125, "learning_rate": 0.00045545119318724734, "loss": 5.7334, "mean_token_accuracy": 0.17166556119918824, "num_tokens": 41437352.0, "step": 21180 }, { "entropy": 6.094399785995483, "epoch": 2.1176588194132053, "grad_norm": 1.2109375, "learning_rate": 0.0004554298732132857, "loss": 5.692, "mean_token_accuracy": 0.17641753405332566, "num_tokens": 41446769.0, "step": 21185 }, { "entropy": 6.106627988815307, "epoch": 2.118158644474434, "grad_norm": 1.09375, "learning_rate": 0.0004554085486997549, "loss": 5.7055, "mean_token_accuracy": 0.16869733482599258, "num_tokens": 41456252.0, "step": 21190 }, { "entropy": 6.039885520935059, "epoch": 2.1186584695356627, "grad_norm": 1.71875, "learning_rate": 0.0004553872196471914, "loss": 5.6246, "mean_token_accuracy": 0.17406915724277497, "num_tokens": 41465388.0, "step": 21195 }, { "entropy": 6.090377950668335, "epoch": 2.119158294596891, "grad_norm": 1.15625, "learning_rate": 0.00045536588605613195, "loss": 5.694, "mean_token_accuracy": 0.16643404364585876, "num_tokens": 41474772.0, "step": 21200 }, { "entropy": 6.039781904220581, "epoch": 2.1196581196581197, "grad_norm": 1.15625, "learning_rate": 0.00045534454792711324, "loss": 5.603, "mean_token_accuracy": 0.17496849000453948, "num_tokens": 41484767.0, "step": 21205 }, { "entropy": 6.067582893371582, "epoch": 2.1201579447193484, "grad_norm": 1.1328125, "learning_rate": 0.00045532320526067206, "loss": 5.6789, "mean_token_accuracy": 0.1758434608578682, "num_tokens": 41495305.0, "step": 21210 }, { "entropy": 6.033560848236084, "epoch": 2.1206577697805766, "grad_norm": 1.125, "learning_rate": 0.0004553018580573454, "loss": 5.6118, "mean_token_accuracy": 0.17580133974552153, "num_tokens": 41504427.0, "step": 21215 }, { "entropy": 6.0532478332519535, "epoch": 2.1211575948418053, "grad_norm": 1.109375, "learning_rate": 0.00045528050631767037, "loss": 5.7003, "mean_token_accuracy": 0.17309947460889816, "num_tokens": 41514607.0, "step": 21220 }, { "entropy": 6.046260166168213, "epoch": 2.121657419903034, "grad_norm": 1.171875, "learning_rate": 0.00045525915004218426, "loss": 5.6756, "mean_token_accuracy": 0.1726166397333145, "num_tokens": 41524280.0, "step": 21225 }, { "entropy": 6.083261966705322, "epoch": 2.1221572449642627, "grad_norm": 1.2109375, "learning_rate": 0.00045523778923142435, "loss": 5.6629, "mean_token_accuracy": 0.17175640165805817, "num_tokens": 41533059.0, "step": 21230 }, { "entropy": 6.124611663818359, "epoch": 2.122657070025491, "grad_norm": 1.296875, "learning_rate": 0.0004552164238859279, "loss": 5.7094, "mean_token_accuracy": 0.17251282483339309, "num_tokens": 41542876.0, "step": 21235 }, { "entropy": 6.074017333984375, "epoch": 2.1231568950867197, "grad_norm": 1.2109375, "learning_rate": 0.00045519505400623274, "loss": 5.7317, "mean_token_accuracy": 0.16437674164772034, "num_tokens": 41552337.0, "step": 21240 }, { "entropy": 6.119915533065796, "epoch": 2.1236567201479484, "grad_norm": 1.171875, "learning_rate": 0.00045517367959287635, "loss": 5.833, "mean_token_accuracy": 0.163869471848011, "num_tokens": 41563190.0, "step": 21245 }, { "entropy": 6.042694473266602, "epoch": 2.1241565452091766, "grad_norm": 1.1171875, "learning_rate": 0.00045515230064639657, "loss": 5.6087, "mean_token_accuracy": 0.18154323250055313, "num_tokens": 41573927.0, "step": 21250 }, { "entropy": 6.028223180770874, "epoch": 2.1246563702704053, "grad_norm": 1.1796875, "learning_rate": 0.00045513091716733117, "loss": 5.4972, "mean_token_accuracy": 0.1968925639986992, "num_tokens": 41583828.0, "step": 21255 }, { "entropy": 5.955699491500854, "epoch": 2.125156195331634, "grad_norm": 1.171875, "learning_rate": 0.00045510952915621834, "loss": 5.6213, "mean_token_accuracy": 0.17516648322343825, "num_tokens": 41593179.0, "step": 21260 }, { "entropy": 6.015944099426269, "epoch": 2.1256560203928627, "grad_norm": 1.3515625, "learning_rate": 0.0004550881366135961, "loss": 5.7448, "mean_token_accuracy": 0.16823360472917556, "num_tokens": 41603366.0, "step": 21265 }, { "entropy": 6.111535692214966, "epoch": 2.126155845454091, "grad_norm": 1.171875, "learning_rate": 0.00045506673954000265, "loss": 5.6875, "mean_token_accuracy": 0.17646982669830322, "num_tokens": 41612916.0, "step": 21270 }, { "entropy": 6.141942834854126, "epoch": 2.1266556705153197, "grad_norm": 1.296875, "learning_rate": 0.0004550453379359763, "loss": 5.7415, "mean_token_accuracy": 0.16683694422245027, "num_tokens": 41622770.0, "step": 21275 }, { "entropy": 6.106043529510498, "epoch": 2.1271554955765484, "grad_norm": 1.15625, "learning_rate": 0.00045502393180205564, "loss": 5.7095, "mean_token_accuracy": 0.16883511543273927, "num_tokens": 41632590.0, "step": 21280 }, { "entropy": 6.051552724838257, "epoch": 2.1276553206377766, "grad_norm": 1.1796875, "learning_rate": 0.0004550025211387792, "loss": 5.7232, "mean_token_accuracy": 0.17379293441772461, "num_tokens": 41641932.0, "step": 21285 }, { "entropy": 6.12023549079895, "epoch": 2.1281551456990053, "grad_norm": 1.0859375, "learning_rate": 0.0004549811059466857, "loss": 5.7197, "mean_token_accuracy": 0.17084573060274125, "num_tokens": 41651915.0, "step": 21290 }, { "entropy": 5.985575532913208, "epoch": 2.128654970760234, "grad_norm": 1.1953125, "learning_rate": 0.0004549596862263138, "loss": 5.5457, "mean_token_accuracy": 0.18461011201143265, "num_tokens": 41661087.0, "step": 21295 }, { "entropy": 5.995650148391723, "epoch": 2.1291547958214627, "grad_norm": 1.1640625, "learning_rate": 0.0004549382619782025, "loss": 5.6979, "mean_token_accuracy": 0.17427356094121932, "num_tokens": 41670418.0, "step": 21300 }, { "entropy": 6.059004211425782, "epoch": 2.129654620882691, "grad_norm": 1.078125, "learning_rate": 0.0004549168332028908, "loss": 5.6207, "mean_token_accuracy": 0.17695794701576234, "num_tokens": 41680209.0, "step": 21305 }, { "entropy": 6.144467449188232, "epoch": 2.1301544459439197, "grad_norm": 1.140625, "learning_rate": 0.00045489539990091796, "loss": 5.686, "mean_token_accuracy": 0.17054597437381744, "num_tokens": 41689933.0, "step": 21310 }, { "entropy": 6.010845708847046, "epoch": 2.1306542710051484, "grad_norm": 1.2109375, "learning_rate": 0.00045487396207282316, "loss": 5.57, "mean_token_accuracy": 0.17796564549207688, "num_tokens": 41699017.0, "step": 21315 }, { "entropy": 5.999052238464356, "epoch": 2.1311540960663766, "grad_norm": 1.1875, "learning_rate": 0.00045485251971914565, "loss": 5.6502, "mean_token_accuracy": 0.1733529269695282, "num_tokens": 41708375.0, "step": 21320 }, { "entropy": 6.008264350891113, "epoch": 2.1316539211276053, "grad_norm": 1.5078125, "learning_rate": 0.0004548310728404251, "loss": 5.6147, "mean_token_accuracy": 0.1765448659658432, "num_tokens": 41718269.0, "step": 21325 }, { "entropy": 6.068723869323731, "epoch": 2.132153746188834, "grad_norm": 1.140625, "learning_rate": 0.000454809621437201, "loss": 5.6971, "mean_token_accuracy": 0.16611239463090896, "num_tokens": 41728426.0, "step": 21330 }, { "entropy": 6.031113576889038, "epoch": 2.1326535712500623, "grad_norm": 1.140625, "learning_rate": 0.0004547881655100131, "loss": 5.6616, "mean_token_accuracy": 0.16666532009840013, "num_tokens": 41738255.0, "step": 21335 }, { "entropy": 6.171995639801025, "epoch": 2.133153396311291, "grad_norm": 1.2265625, "learning_rate": 0.0004547667050594013, "loss": 5.7496, "mean_token_accuracy": 0.16798180043697358, "num_tokens": 41747668.0, "step": 21340 }, { "entropy": 6.111067533493042, "epoch": 2.1336532213725197, "grad_norm": 1.1875, "learning_rate": 0.00045474524008590536, "loss": 5.6371, "mean_token_accuracy": 0.17852789610624314, "num_tokens": 41757414.0, "step": 21345 }, { "entropy": 6.084634780883789, "epoch": 2.1341530464337484, "grad_norm": 1.296875, "learning_rate": 0.0004547237705900655, "loss": 5.7104, "mean_token_accuracy": 0.17668609768152238, "num_tokens": 41765413.0, "step": 21350 }, { "entropy": 6.022200965881348, "epoch": 2.1346528714949766, "grad_norm": 1.109375, "learning_rate": 0.00045470229657242176, "loss": 5.6781, "mean_token_accuracy": 0.17315897792577745, "num_tokens": 41775951.0, "step": 21355 }, { "entropy": 6.012775135040283, "epoch": 2.1351526965562053, "grad_norm": 1.3515625, "learning_rate": 0.00045468081803351447, "loss": 5.6313, "mean_token_accuracy": 0.17673833221197127, "num_tokens": 41785440.0, "step": 21360 }, { "entropy": 6.097571086883545, "epoch": 2.135652521617434, "grad_norm": 1.4140625, "learning_rate": 0.0004546593349738841, "loss": 5.6969, "mean_token_accuracy": 0.16910674721002578, "num_tokens": 41794757.0, "step": 21365 }, { "entropy": 6.0979584693908695, "epoch": 2.1361523466786623, "grad_norm": 1.1953125, "learning_rate": 0.000454637847394071, "loss": 5.7474, "mean_token_accuracy": 0.17688190191984177, "num_tokens": 41804491.0, "step": 21370 }, { "entropy": 6.053183078765869, "epoch": 2.136652171739891, "grad_norm": 1.203125, "learning_rate": 0.00045461635529461597, "loss": 5.6048, "mean_token_accuracy": 0.18072144240140914, "num_tokens": 41813867.0, "step": 21375 }, { "entropy": 6.1013788223266605, "epoch": 2.1371519968011197, "grad_norm": 1.1875, "learning_rate": 0.0004545948586760596, "loss": 5.7765, "mean_token_accuracy": 0.16022187396883963, "num_tokens": 41823167.0, "step": 21380 }, { "entropy": 6.0598876953125, "epoch": 2.1376518218623484, "grad_norm": 1.21875, "learning_rate": 0.0004545733575389428, "loss": 5.636, "mean_token_accuracy": 0.16958805471658706, "num_tokens": 41831757.0, "step": 21385 }, { "entropy": 6.07030553817749, "epoch": 2.1381516469235766, "grad_norm": 1.109375, "learning_rate": 0.0004545518518838066, "loss": 5.6047, "mean_token_accuracy": 0.18150582909584045, "num_tokens": 41841741.0, "step": 21390 }, { "entropy": 6.030051136016846, "epoch": 2.1386514719848053, "grad_norm": 1.3671875, "learning_rate": 0.000454530341711192, "loss": 5.5965, "mean_token_accuracy": 0.1800922393798828, "num_tokens": 41851940.0, "step": 21395 }, { "entropy": 6.064763164520263, "epoch": 2.139151297046034, "grad_norm": 1.1875, "learning_rate": 0.0004545088270216401, "loss": 5.6347, "mean_token_accuracy": 0.17788725942373276, "num_tokens": 41861240.0, "step": 21400 }, { "entropy": 6.030258703231811, "epoch": 2.1396511221072623, "grad_norm": 1.1171875, "learning_rate": 0.0004544873078156924, "loss": 5.744, "mean_token_accuracy": 0.16949288100004195, "num_tokens": 41871513.0, "step": 21405 }, { "entropy": 6.146198272705078, "epoch": 2.140150947168491, "grad_norm": 1.1796875, "learning_rate": 0.00045446578409389016, "loss": 5.7288, "mean_token_accuracy": 0.17184216380119324, "num_tokens": 41880346.0, "step": 21410 }, { "entropy": 6.0823462963104244, "epoch": 2.1406507722297197, "grad_norm": 1.203125, "learning_rate": 0.00045444425585677503, "loss": 5.6224, "mean_token_accuracy": 0.17804159522056578, "num_tokens": 41889182.0, "step": 21415 }, { "entropy": 6.050590085983276, "epoch": 2.1411505972909484, "grad_norm": 1.109375, "learning_rate": 0.0004544227231048886, "loss": 5.629, "mean_token_accuracy": 0.17439205795526505, "num_tokens": 41899108.0, "step": 21420 }, { "entropy": 5.98486909866333, "epoch": 2.1416504223521766, "grad_norm": 1.1328125, "learning_rate": 0.0004544011858387726, "loss": 5.6554, "mean_token_accuracy": 0.17556255012750627, "num_tokens": 41908930.0, "step": 21425 }, { "entropy": 6.034679126739502, "epoch": 2.1421502474134053, "grad_norm": 1.3828125, "learning_rate": 0.00045437964405896895, "loss": 5.6695, "mean_token_accuracy": 0.18038943707942962, "num_tokens": 41919043.0, "step": 21430 }, { "entropy": 6.023789930343628, "epoch": 2.142650072474634, "grad_norm": 1.1953125, "learning_rate": 0.00045435809776601954, "loss": 5.6145, "mean_token_accuracy": 0.1843360811471939, "num_tokens": 41929241.0, "step": 21435 }, { "entropy": 6.022858667373657, "epoch": 2.1431498975358623, "grad_norm": 1.078125, "learning_rate": 0.0004543365469604666, "loss": 5.6812, "mean_token_accuracy": 0.17405349165201187, "num_tokens": 41940829.0, "step": 21440 }, { "entropy": 6.066896533966064, "epoch": 2.143649722597091, "grad_norm": 1.125, "learning_rate": 0.0004543149916428523, "loss": 5.7291, "mean_token_accuracy": 0.1710815668106079, "num_tokens": 41950137.0, "step": 21445 }, { "entropy": 6.075569152832031, "epoch": 2.1441495476583197, "grad_norm": 1.0625, "learning_rate": 0.0004542934318137189, "loss": 5.6843, "mean_token_accuracy": 0.17403293251991273, "num_tokens": 41960089.0, "step": 21450 }, { "entropy": 6.09486985206604, "epoch": 2.1446493727195484, "grad_norm": 1.1953125, "learning_rate": 0.0004542718674736089, "loss": 5.642, "mean_token_accuracy": 0.17538643777370452, "num_tokens": 41970168.0, "step": 21455 }, { "entropy": 6.035608148574829, "epoch": 2.1451491977807766, "grad_norm": 1.1484375, "learning_rate": 0.0004542502986230649, "loss": 5.6309, "mean_token_accuracy": 0.1749051347374916, "num_tokens": 41979540.0, "step": 21460 }, { "entropy": 6.049019145965576, "epoch": 2.1456490228420053, "grad_norm": 1.1484375, "learning_rate": 0.0004542287252626295, "loss": 5.7001, "mean_token_accuracy": 0.17646882086992263, "num_tokens": 41990090.0, "step": 21465 }, { "entropy": 6.076330757141113, "epoch": 2.146148847903234, "grad_norm": 1.28125, "learning_rate": 0.0004542071473928455, "loss": 5.7345, "mean_token_accuracy": 0.1662833347916603, "num_tokens": 42000455.0, "step": 21470 }, { "entropy": 6.060870933532715, "epoch": 2.1466486729644623, "grad_norm": 1.1171875, "learning_rate": 0.0004541855650142557, "loss": 5.7427, "mean_token_accuracy": 0.17234362959861754, "num_tokens": 42010767.0, "step": 21475 }, { "entropy": 6.084904146194458, "epoch": 2.147148498025691, "grad_norm": 1.2109375, "learning_rate": 0.00045416397812740323, "loss": 5.6438, "mean_token_accuracy": 0.17523292154073716, "num_tokens": 42020043.0, "step": 21480 }, { "entropy": 6.00084228515625, "epoch": 2.1476483230869197, "grad_norm": 1.2265625, "learning_rate": 0.0004541423867328312, "loss": 5.7186, "mean_token_accuracy": 0.17343796342611312, "num_tokens": 42030511.0, "step": 21485 }, { "entropy": 6.075480318069458, "epoch": 2.148148148148148, "grad_norm": 1.265625, "learning_rate": 0.0004541207908310829, "loss": 5.6998, "mean_token_accuracy": 0.1739243283867836, "num_tokens": 42040051.0, "step": 21490 }, { "entropy": 6.060919570922851, "epoch": 2.1486479732093766, "grad_norm": 1.1796875, "learning_rate": 0.0004540991904227015, "loss": 5.7126, "mean_token_accuracy": 0.16983721256256104, "num_tokens": 42050206.0, "step": 21495 }, { "entropy": 6.070143508911133, "epoch": 2.1491477982706053, "grad_norm": 1.1953125, "learning_rate": 0.00045407758550823055, "loss": 5.6678, "mean_token_accuracy": 0.17248247414827347, "num_tokens": 42059420.0, "step": 21500 }, { "entropy": 6.090549564361572, "epoch": 2.149647623331834, "grad_norm": 1.1796875, "learning_rate": 0.00045405597608821365, "loss": 5.6482, "mean_token_accuracy": 0.17585248202085496, "num_tokens": 42068527.0, "step": 21505 }, { "entropy": 6.092186641693115, "epoch": 2.1501474483930623, "grad_norm": 1.1640625, "learning_rate": 0.0004540343621631944, "loss": 5.6926, "mean_token_accuracy": 0.172063010931015, "num_tokens": 42078006.0, "step": 21510 }, { "entropy": 6.087264776229858, "epoch": 2.150647273454291, "grad_norm": 1.2421875, "learning_rate": 0.0004540127437337167, "loss": 5.7339, "mean_token_accuracy": 0.1607787787914276, "num_tokens": 42087535.0, "step": 21515 }, { "entropy": 6.0491667747497555, "epoch": 2.1511470985155197, "grad_norm": 1.2421875, "learning_rate": 0.0004539911208003245, "loss": 5.6452, "mean_token_accuracy": 0.17441024631261826, "num_tokens": 42097259.0, "step": 21520 }, { "entropy": 6.0171784400939945, "epoch": 2.151646923576748, "grad_norm": 1.1640625, "learning_rate": 0.0004539694933635617, "loss": 5.5874, "mean_token_accuracy": 0.18415868878364564, "num_tokens": 42107216.0, "step": 21525 }, { "entropy": 6.038366508483887, "epoch": 2.1521467486379766, "grad_norm": 1.2578125, "learning_rate": 0.00045394786142397253, "loss": 5.7698, "mean_token_accuracy": 0.16704384982585907, "num_tokens": 42116014.0, "step": 21530 }, { "entropy": 6.046961545944214, "epoch": 2.1526465736992053, "grad_norm": 1.2421875, "learning_rate": 0.0004539262249821012, "loss": 5.6526, "mean_token_accuracy": 0.1749047741293907, "num_tokens": 42125864.0, "step": 21535 }, { "entropy": 5.964919328689575, "epoch": 2.153146398760434, "grad_norm": 1.140625, "learning_rate": 0.00045390458403849203, "loss": 5.5369, "mean_token_accuracy": 0.1877485528588295, "num_tokens": 42135048.0, "step": 21540 }, { "entropy": 6.035745573043823, "epoch": 2.1536462238216623, "grad_norm": 1.2578125, "learning_rate": 0.0004538829385936896, "loss": 5.6397, "mean_token_accuracy": 0.1712017238140106, "num_tokens": 42144692.0, "step": 21545 }, { "entropy": 6.146078729629517, "epoch": 2.154146048882891, "grad_norm": 1.1171875, "learning_rate": 0.0004538612886482385, "loss": 5.8196, "mean_token_accuracy": 0.1683724120259285, "num_tokens": 42155117.0, "step": 21550 }, { "entropy": 6.1041521549224855, "epoch": 2.1546458739441197, "grad_norm": 1.1796875, "learning_rate": 0.0004538396342026834, "loss": 5.7382, "mean_token_accuracy": 0.16777512282133103, "num_tokens": 42165428.0, "step": 21555 }, { "entropy": 5.991495561599732, "epoch": 2.155145699005348, "grad_norm": 1.15625, "learning_rate": 0.0004538179752575691, "loss": 5.6269, "mean_token_accuracy": 0.17486499547958373, "num_tokens": 42175841.0, "step": 21560 }, { "entropy": 6.1455882549285885, "epoch": 2.1556455240665766, "grad_norm": 1.296875, "learning_rate": 0.0004537963118134406, "loss": 5.6961, "mean_token_accuracy": 0.16670922040939332, "num_tokens": 42186450.0, "step": 21565 }, { "entropy": 6.063235950469971, "epoch": 2.1561453491278053, "grad_norm": 1.1796875, "learning_rate": 0.00045377464387084287, "loss": 5.7367, "mean_token_accuracy": 0.16863785535097123, "num_tokens": 42195994.0, "step": 21570 }, { "entropy": 6.07303786277771, "epoch": 2.156645174189034, "grad_norm": 1.1328125, "learning_rate": 0.0004537529714303211, "loss": 5.6069, "mean_token_accuracy": 0.18417707681655884, "num_tokens": 42206662.0, "step": 21575 }, { "entropy": 5.952543258666992, "epoch": 2.1571449992502623, "grad_norm": 1.1796875, "learning_rate": 0.00045373129449242054, "loss": 5.5356, "mean_token_accuracy": 0.18109029680490493, "num_tokens": 42216598.0, "step": 21580 }, { "entropy": 5.993759059906006, "epoch": 2.157644824311491, "grad_norm": 1.1875, "learning_rate": 0.0004537096130576866, "loss": 5.6259, "mean_token_accuracy": 0.17885473370552063, "num_tokens": 42225869.0, "step": 21585 }, { "entropy": 6.100814485549927, "epoch": 2.1581446493727197, "grad_norm": 1.1875, "learning_rate": 0.00045368792712666486, "loss": 5.7933, "mean_token_accuracy": 0.1629875421524048, "num_tokens": 42234749.0, "step": 21590 }, { "entropy": 6.099698257446289, "epoch": 2.158644474433948, "grad_norm": 1.1171875, "learning_rate": 0.0004536662366999008, "loss": 5.6902, "mean_token_accuracy": 0.16453911662101744, "num_tokens": 42243503.0, "step": 21595 }, { "entropy": 6.105169677734375, "epoch": 2.1591442994951766, "grad_norm": 1.1953125, "learning_rate": 0.0004536445417779402, "loss": 5.754, "mean_token_accuracy": 0.16610672622919082, "num_tokens": 42253888.0, "step": 21600 }, { "entropy": 6.126466178894043, "epoch": 2.1596441245564053, "grad_norm": 1.203125, "learning_rate": 0.00045362284236132895, "loss": 5.7468, "mean_token_accuracy": 0.17409078329801558, "num_tokens": 42264052.0, "step": 21605 }, { "entropy": 6.096316385269165, "epoch": 2.160143949617634, "grad_norm": 1.2421875, "learning_rate": 0.00045360113845061283, "loss": 5.7181, "mean_token_accuracy": 0.17177004963159562, "num_tokens": 42273749.0, "step": 21610 }, { "entropy": 6.035578680038452, "epoch": 2.1606437746788623, "grad_norm": 1.2578125, "learning_rate": 0.00045357943004633813, "loss": 5.6655, "mean_token_accuracy": 0.17622694075107576, "num_tokens": 42282209.0, "step": 21615 }, { "entropy": 6.045993614196777, "epoch": 2.161143599740091, "grad_norm": 1.1640625, "learning_rate": 0.00045355771714905086, "loss": 5.7062, "mean_token_accuracy": 0.17359004467725753, "num_tokens": 42291941.0, "step": 21620 }, { "entropy": 6.119871616363525, "epoch": 2.1616434248013197, "grad_norm": 1.234375, "learning_rate": 0.00045353599975929746, "loss": 5.7483, "mean_token_accuracy": 0.16945235282182694, "num_tokens": 42300630.0, "step": 21625 }, { "entropy": 6.050996446609497, "epoch": 2.162143249862548, "grad_norm": 1.1640625, "learning_rate": 0.0004535142778776241, "loss": 5.6004, "mean_token_accuracy": 0.17956664264202118, "num_tokens": 42309973.0, "step": 21630 }, { "entropy": 6.085428714752197, "epoch": 2.1626430749237766, "grad_norm": 1.1875, "learning_rate": 0.0004534925515045776, "loss": 5.7972, "mean_token_accuracy": 0.16310292780399321, "num_tokens": 42319880.0, "step": 21635 }, { "entropy": 6.053393840789795, "epoch": 2.1631428999850053, "grad_norm": 1.109375, "learning_rate": 0.00045347082064070435, "loss": 5.5702, "mean_token_accuracy": 0.1814407840371132, "num_tokens": 42329554.0, "step": 21640 }, { "entropy": 5.996116352081299, "epoch": 2.163642725046234, "grad_norm": 1.109375, "learning_rate": 0.0004534490852865512, "loss": 5.5562, "mean_token_accuracy": 0.1787356838583946, "num_tokens": 42339118.0, "step": 21645 }, { "entropy": 6.041047239303589, "epoch": 2.1641425501074623, "grad_norm": 1.0390625, "learning_rate": 0.00045342734544266493, "loss": 5.6073, "mean_token_accuracy": 0.1787823960185051, "num_tokens": 42349115.0, "step": 21650 }, { "entropy": 6.042277240753174, "epoch": 2.164642375168691, "grad_norm": 1.2734375, "learning_rate": 0.0004534056011095926, "loss": 5.6155, "mean_token_accuracy": 0.1813841089606285, "num_tokens": 42357772.0, "step": 21655 }, { "entropy": 6.047502231597901, "epoch": 2.1651422002299197, "grad_norm": 1.1953125, "learning_rate": 0.00045338385228788124, "loss": 5.6538, "mean_token_accuracy": 0.17192450314760208, "num_tokens": 42366908.0, "step": 21660 }, { "entropy": 5.915102577209472, "epoch": 2.165642025291148, "grad_norm": 1.2265625, "learning_rate": 0.00045336209897807813, "loss": 5.5405, "mean_token_accuracy": 0.19141213297843934, "num_tokens": 42377143.0, "step": 21665 }, { "entropy": 6.0820136070251465, "epoch": 2.1661418503523766, "grad_norm": 1.1484375, "learning_rate": 0.00045334034118073047, "loss": 5.6588, "mean_token_accuracy": 0.17062043845653535, "num_tokens": 42386815.0, "step": 21670 }, { "entropy": 6.051664161682129, "epoch": 2.1666416754136053, "grad_norm": 1.265625, "learning_rate": 0.00045331857889638566, "loss": 5.6241, "mean_token_accuracy": 0.18142822086811067, "num_tokens": 42395821.0, "step": 21675 }, { "entropy": 6.006423664093018, "epoch": 2.167141500474834, "grad_norm": 1.203125, "learning_rate": 0.0004532968121255914, "loss": 5.5714, "mean_token_accuracy": 0.18069135397672653, "num_tokens": 42406757.0, "step": 21680 }, { "entropy": 6.0146812915802, "epoch": 2.1676413255360623, "grad_norm": 1.109375, "learning_rate": 0.00045327504086889513, "loss": 5.6717, "mean_token_accuracy": 0.1748896837234497, "num_tokens": 42417288.0, "step": 21685 }, { "entropy": 5.96293535232544, "epoch": 2.168141150597291, "grad_norm": 1.140625, "learning_rate": 0.00045325326512684466, "loss": 5.5034, "mean_token_accuracy": 0.1824643313884735, "num_tokens": 42427614.0, "step": 21690 }, { "entropy": 6.097332859039307, "epoch": 2.1686409756585197, "grad_norm": 1.140625, "learning_rate": 0.00045323148489998807, "loss": 5.7804, "mean_token_accuracy": 0.16856229901313782, "num_tokens": 42437475.0, "step": 21695 }, { "entropy": 6.029554843902588, "epoch": 2.169140800719748, "grad_norm": 1.1796875, "learning_rate": 0.000453209700188873, "loss": 5.5803, "mean_token_accuracy": 0.1804562211036682, "num_tokens": 42446654.0, "step": 21700 }, { "entropy": 6.031294155120849, "epoch": 2.1696406257809766, "grad_norm": 1.1328125, "learning_rate": 0.00045318791099404785, "loss": 5.6464, "mean_token_accuracy": 0.1702555425465107, "num_tokens": 42456952.0, "step": 21705 }, { "entropy": 6.072096157073974, "epoch": 2.1701404508422053, "grad_norm": 1.171875, "learning_rate": 0.00045316611731606075, "loss": 5.6475, "mean_token_accuracy": 0.17707123458385468, "num_tokens": 42466133.0, "step": 21710 }, { "entropy": 6.107791233062744, "epoch": 2.170640275903434, "grad_norm": 1.1484375, "learning_rate": 0.0004531443191554598, "loss": 5.749, "mean_token_accuracy": 0.17108369767665862, "num_tokens": 42476068.0, "step": 21715 }, { "entropy": 6.119190216064453, "epoch": 2.1711401009646623, "grad_norm": 1.1640625, "learning_rate": 0.0004531225165127938, "loss": 5.6598, "mean_token_accuracy": 0.17543508112430573, "num_tokens": 42485914.0, "step": 21720 }, { "entropy": 5.973965787887574, "epoch": 2.171639926025891, "grad_norm": 1.140625, "learning_rate": 0.00045310070938861107, "loss": 5.6613, "mean_token_accuracy": 0.17104327976703643, "num_tokens": 42495563.0, "step": 21725 }, { "entropy": 6.06595811843872, "epoch": 2.1721397510871197, "grad_norm": 1.1953125, "learning_rate": 0.00045307889778346035, "loss": 5.6858, "mean_token_accuracy": 0.1727832719683647, "num_tokens": 42505441.0, "step": 21730 }, { "entropy": 6.166973495483399, "epoch": 2.172639576148348, "grad_norm": 1.2109375, "learning_rate": 0.0004530570816978903, "loss": 5.7371, "mean_token_accuracy": 0.16956319212913512, "num_tokens": 42515636.0, "step": 21735 }, { "entropy": 6.118170261383057, "epoch": 2.1731394012095766, "grad_norm": 1.1484375, "learning_rate": 0.00045303526113245, "loss": 5.7163, "mean_token_accuracy": 0.17003063559532167, "num_tokens": 42525143.0, "step": 21740 }, { "entropy": 6.00959792137146, "epoch": 2.1736392262708053, "grad_norm": 1.1953125, "learning_rate": 0.0004530134360876882, "loss": 5.6382, "mean_token_accuracy": 0.18087038844823838, "num_tokens": 42534591.0, "step": 21745 }, { "entropy": 6.140269708633423, "epoch": 2.174139051332034, "grad_norm": 1.265625, "learning_rate": 0.0004529916065641543, "loss": 5.7908, "mean_token_accuracy": 0.16796426475048065, "num_tokens": 42544956.0, "step": 21750 }, { "entropy": 6.065380811691284, "epoch": 2.1746388763932623, "grad_norm": 1.1875, "learning_rate": 0.0004529697725623973, "loss": 5.6017, "mean_token_accuracy": 0.18077627718448638, "num_tokens": 42554383.0, "step": 21755 }, { "entropy": 6.06083345413208, "epoch": 2.175138701454491, "grad_norm": 1.171875, "learning_rate": 0.00045294793408296656, "loss": 5.6102, "mean_token_accuracy": 0.18747687637805938, "num_tokens": 42563703.0, "step": 21760 }, { "entropy": 5.98844542503357, "epoch": 2.1756385265157197, "grad_norm": 1.15625, "learning_rate": 0.0004529260911264117, "loss": 5.5972, "mean_token_accuracy": 0.17997730523347855, "num_tokens": 42572225.0, "step": 21765 }, { "entropy": 6.012959289550781, "epoch": 2.176138351576948, "grad_norm": 1.109375, "learning_rate": 0.0004529042436932822, "loss": 5.5615, "mean_token_accuracy": 0.1820403143763542, "num_tokens": 42582053.0, "step": 21770 }, { "entropy": 6.003145790100097, "epoch": 2.1766381766381766, "grad_norm": 1.171875, "learning_rate": 0.00045288239178412754, "loss": 5.6382, "mean_token_accuracy": 0.1743568629026413, "num_tokens": 42590682.0, "step": 21775 }, { "entropy": 6.055115175247193, "epoch": 2.1771380016994053, "grad_norm": 1.1875, "learning_rate": 0.0004528605353994978, "loss": 5.7, "mean_token_accuracy": 0.1711456596851349, "num_tokens": 42598769.0, "step": 21780 }, { "entropy": 6.0031250476837155, "epoch": 2.177637826760634, "grad_norm": 1.1484375, "learning_rate": 0.0004528386745399428, "loss": 5.5836, "mean_token_accuracy": 0.1783204570412636, "num_tokens": 42608126.0, "step": 21785 }, { "entropy": 6.088155937194824, "epoch": 2.1781376518218623, "grad_norm": 1.1953125, "learning_rate": 0.00045281680920601235, "loss": 5.762, "mean_token_accuracy": 0.1736542358994484, "num_tokens": 42617602.0, "step": 21790 }, { "entropy": 6.050712013244629, "epoch": 2.178637476883091, "grad_norm": 1.2734375, "learning_rate": 0.0004527949393982569, "loss": 5.6037, "mean_token_accuracy": 0.1778274416923523, "num_tokens": 42627316.0, "step": 21795 }, { "entropy": 6.087167263031006, "epoch": 2.1791373019443196, "grad_norm": 1.109375, "learning_rate": 0.00045277306511722645, "loss": 5.6423, "mean_token_accuracy": 0.17012511640787126, "num_tokens": 42636872.0, "step": 21800 }, { "entropy": 6.067049264907837, "epoch": 2.179637127005548, "grad_norm": 1.3671875, "learning_rate": 0.0004527511863634714, "loss": 5.6464, "mean_token_accuracy": 0.17870114594697953, "num_tokens": 42645754.0, "step": 21805 }, { "entropy": 5.989529705047607, "epoch": 2.1801369520667766, "grad_norm": 1.1796875, "learning_rate": 0.0004527293031375422, "loss": 5.6379, "mean_token_accuracy": 0.17647577822208405, "num_tokens": 42655219.0, "step": 21810 }, { "entropy": 6.03337516784668, "epoch": 2.1806367771280053, "grad_norm": 1.21875, "learning_rate": 0.0004527074154399896, "loss": 5.6597, "mean_token_accuracy": 0.1794843003153801, "num_tokens": 42664398.0, "step": 21815 }, { "entropy": 6.040105485916138, "epoch": 2.181136602189234, "grad_norm": 1.2109375, "learning_rate": 0.00045268552327136415, "loss": 5.7148, "mean_token_accuracy": 0.1770220786333084, "num_tokens": 42674513.0, "step": 21820 }, { "entropy": 6.102819490432739, "epoch": 2.1816364272504623, "grad_norm": 1.359375, "learning_rate": 0.00045266362663221656, "loss": 5.682, "mean_token_accuracy": 0.18245375156402588, "num_tokens": 42684379.0, "step": 21825 }, { "entropy": 5.9896996974945065, "epoch": 2.182136252311691, "grad_norm": 1.1796875, "learning_rate": 0.00045264172552309786, "loss": 5.617, "mean_token_accuracy": 0.17842446714639665, "num_tokens": 42694020.0, "step": 21830 }, { "entropy": 6.031555032730102, "epoch": 2.1826360773729196, "grad_norm": 1.21875, "learning_rate": 0.0004526198199445591, "loss": 5.6058, "mean_token_accuracy": 0.17737309634685516, "num_tokens": 42703882.0, "step": 21835 }, { "entropy": 6.072951364517212, "epoch": 2.183135902434148, "grad_norm": 1.203125, "learning_rate": 0.00045259790989715133, "loss": 5.6411, "mean_token_accuracy": 0.17604389190673828, "num_tokens": 42713148.0, "step": 21840 }, { "entropy": 6.154191017150879, "epoch": 2.1836357274953766, "grad_norm": 1.421875, "learning_rate": 0.00045257599538142587, "loss": 5.7632, "mean_token_accuracy": 0.1739290773868561, "num_tokens": 42722177.0, "step": 21845 }, { "entropy": 6.093825149536133, "epoch": 2.1841355525566053, "grad_norm": 1.203125, "learning_rate": 0.00045255407639793407, "loss": 5.7231, "mean_token_accuracy": 0.17204727828502656, "num_tokens": 42732454.0, "step": 21850 }, { "entropy": 6.1231378555297855, "epoch": 2.1846353776178336, "grad_norm": 1.171875, "learning_rate": 0.0004525321529472274, "loss": 5.7708, "mean_token_accuracy": 0.16729852557182312, "num_tokens": 42742357.0, "step": 21855 }, { "entropy": 6.071427679061889, "epoch": 2.1851352026790622, "grad_norm": 1.203125, "learning_rate": 0.00045251022502985737, "loss": 5.6321, "mean_token_accuracy": 0.17326045632362366, "num_tokens": 42751703.0, "step": 21860 }, { "entropy": 6.072061824798584, "epoch": 2.185635027740291, "grad_norm": 1.125, "learning_rate": 0.0004524882926463758, "loss": 5.6588, "mean_token_accuracy": 0.17383660823106767, "num_tokens": 42762198.0, "step": 21865 }, { "entropy": 6.076790046691895, "epoch": 2.1861348528015196, "grad_norm": 1.203125, "learning_rate": 0.0004524663557973345, "loss": 5.7216, "mean_token_accuracy": 0.16407134830951692, "num_tokens": 42772348.0, "step": 21870 }, { "entropy": 6.0131713390350345, "epoch": 2.186634677862748, "grad_norm": 1.140625, "learning_rate": 0.00045244441448328535, "loss": 5.6383, "mean_token_accuracy": 0.17364995628595353, "num_tokens": 42782592.0, "step": 21875 }, { "entropy": 6.058275270462036, "epoch": 2.1871345029239766, "grad_norm": 1.296875, "learning_rate": 0.00045242246870478035, "loss": 5.6819, "mean_token_accuracy": 0.17835331857204437, "num_tokens": 42792452.0, "step": 21880 }, { "entropy": 6.032591390609741, "epoch": 2.1876343279852053, "grad_norm": 1.3203125, "learning_rate": 0.0004524005184623717, "loss": 5.6441, "mean_token_accuracy": 0.181292162835598, "num_tokens": 42801545.0, "step": 21885 }, { "entropy": 6.095549440383911, "epoch": 2.1881341530464335, "grad_norm": 1.34375, "learning_rate": 0.0004523785637566117, "loss": 5.6282, "mean_token_accuracy": 0.1765915721654892, "num_tokens": 42810504.0, "step": 21890 }, { "entropy": 6.028067255020142, "epoch": 2.1886339781076622, "grad_norm": 1.203125, "learning_rate": 0.0004523566045880527, "loss": 5.6495, "mean_token_accuracy": 0.17564905136823655, "num_tokens": 42820226.0, "step": 21895 }, { "entropy": 6.12649974822998, "epoch": 2.189133803168891, "grad_norm": 1.1328125, "learning_rate": 0.00045233464095724706, "loss": 5.6859, "mean_token_accuracy": 0.1660838395357132, "num_tokens": 42829707.0, "step": 21900 }, { "entropy": 6.051554250717163, "epoch": 2.1896336282301196, "grad_norm": 1.203125, "learning_rate": 0.00045231267286474755, "loss": 5.6806, "mean_token_accuracy": 0.16902831345796585, "num_tokens": 42840078.0, "step": 21905 }, { "entropy": 6.048523044586181, "epoch": 2.190133453291348, "grad_norm": 1.1875, "learning_rate": 0.0004522907003111068, "loss": 5.6068, "mean_token_accuracy": 0.1871507376432419, "num_tokens": 42849998.0, "step": 21910 }, { "entropy": 6.015602684020996, "epoch": 2.1906332783525766, "grad_norm": 1.1875, "learning_rate": 0.0004522687232968776, "loss": 5.5743, "mean_token_accuracy": 0.18271636962890625, "num_tokens": 42859290.0, "step": 21915 }, { "entropy": 5.969098281860352, "epoch": 2.1911331034138053, "grad_norm": 1.296875, "learning_rate": 0.00045224674182261306, "loss": 5.6356, "mean_token_accuracy": 0.17439277172088624, "num_tokens": 42867945.0, "step": 21920 }, { "entropy": 5.945876359939575, "epoch": 2.1916329284750335, "grad_norm": 1.125, "learning_rate": 0.00045222475588886597, "loss": 5.5249, "mean_token_accuracy": 0.18588104993104934, "num_tokens": 42877527.0, "step": 21925 }, { "entropy": 6.010125303268433, "epoch": 2.1921327535362622, "grad_norm": 1.34375, "learning_rate": 0.00045220276549618973, "loss": 5.6445, "mean_token_accuracy": 0.18437591195106506, "num_tokens": 42887049.0, "step": 21930 }, { "entropy": 6.057902860641479, "epoch": 2.192632578597491, "grad_norm": 1.1328125, "learning_rate": 0.00045218077064513744, "loss": 5.5971, "mean_token_accuracy": 0.17969248294830323, "num_tokens": 42896177.0, "step": 21935 }, { "entropy": 6.071481370925904, "epoch": 2.1931324036587196, "grad_norm": 1.0546875, "learning_rate": 0.0004521587713362626, "loss": 5.7207, "mean_token_accuracy": 0.1680138699710369, "num_tokens": 42906244.0, "step": 21940 }, { "entropy": 5.9518914222717285, "epoch": 2.193632228719948, "grad_norm": 1.21875, "learning_rate": 0.0004521367675701187, "loss": 5.6186, "mean_token_accuracy": 0.17892550975084304, "num_tokens": 42915776.0, "step": 21945 }, { "entropy": 6.081822299957276, "epoch": 2.1941320537811766, "grad_norm": 1.4375, "learning_rate": 0.0004521147593472592, "loss": 5.6183, "mean_token_accuracy": 0.18416496366262436, "num_tokens": 42926411.0, "step": 21950 }, { "entropy": 6.002219915390015, "epoch": 2.1946318788424053, "grad_norm": 1.265625, "learning_rate": 0.00045209274666823795, "loss": 5.503, "mean_token_accuracy": 0.18526443094015121, "num_tokens": 42935540.0, "step": 21955 }, { "entropy": 5.992690324783325, "epoch": 2.1951317039036335, "grad_norm": 1.1640625, "learning_rate": 0.0004520707295336088, "loss": 5.6486, "mean_token_accuracy": 0.17101467698812484, "num_tokens": 42944796.0, "step": 21960 }, { "entropy": 6.1037092208862305, "epoch": 2.1956315289648622, "grad_norm": 1.140625, "learning_rate": 0.00045204870794392574, "loss": 5.7388, "mean_token_accuracy": 0.1653115451335907, "num_tokens": 42954141.0, "step": 21965 }, { "entropy": 6.102824783325195, "epoch": 2.196131354026091, "grad_norm": 1.21875, "learning_rate": 0.00045202668189974263, "loss": 5.7156, "mean_token_accuracy": 0.16959594190120697, "num_tokens": 42963201.0, "step": 21970 }, { "entropy": 6.013363027572632, "epoch": 2.1966311790873196, "grad_norm": 1.109375, "learning_rate": 0.0004520046514016138, "loss": 5.6006, "mean_token_accuracy": 0.17957703769207, "num_tokens": 42973798.0, "step": 21975 }, { "entropy": 6.061620140075684, "epoch": 2.197131004148548, "grad_norm": 1.28125, "learning_rate": 0.00045198261645009347, "loss": 5.7663, "mean_token_accuracy": 0.16192597299814224, "num_tokens": 42983587.0, "step": 21980 }, { "entropy": 6.04732871055603, "epoch": 2.1976308292097766, "grad_norm": 1.1171875, "learning_rate": 0.000451960577045736, "loss": 5.7403, "mean_token_accuracy": 0.17270044833421708, "num_tokens": 42994802.0, "step": 21985 }, { "entropy": 6.122683429718018, "epoch": 2.1981306542710053, "grad_norm": 1.0703125, "learning_rate": 0.000451938533189096, "loss": 5.6426, "mean_token_accuracy": 0.17314900308847428, "num_tokens": 43003427.0, "step": 21990 }, { "entropy": 5.98048505783081, "epoch": 2.1986304793322335, "grad_norm": 1.2421875, "learning_rate": 0.0004519164848807281, "loss": 5.6045, "mean_token_accuracy": 0.17703433483839034, "num_tokens": 43013268.0, "step": 21995 }, { "entropy": 6.058509778976441, "epoch": 2.1991303043934622, "grad_norm": 1.2421875, "learning_rate": 0.00045189443212118686, "loss": 5.6306, "mean_token_accuracy": 0.17500248402357102, "num_tokens": 43022389.0, "step": 22000 }, { "entropy": 6.067094945907593, "epoch": 2.199630129454691, "grad_norm": 1.09375, "learning_rate": 0.00045187237491102727, "loss": 5.6247, "mean_token_accuracy": 0.17964363247156143, "num_tokens": 43033168.0, "step": 22005 }, { "entropy": 6.042067241668701, "epoch": 2.200129954515919, "grad_norm": 1.2734375, "learning_rate": 0.00045185031325080426, "loss": 5.7038, "mean_token_accuracy": 0.17055662125349044, "num_tokens": 43043002.0, "step": 22010 }, { "entropy": 6.057109022140503, "epoch": 2.200629779577148, "grad_norm": 1.0859375, "learning_rate": 0.00045182824714107284, "loss": 5.6746, "mean_token_accuracy": 0.17811395078897477, "num_tokens": 43053474.0, "step": 22015 }, { "entropy": 6.086128807067871, "epoch": 2.2011296046383766, "grad_norm": 1.3671875, "learning_rate": 0.00045180617658238827, "loss": 5.6753, "mean_token_accuracy": 0.17516648173332214, "num_tokens": 43063821.0, "step": 22020 }, { "entropy": 6.052876806259155, "epoch": 2.2016294296996053, "grad_norm": 1.203125, "learning_rate": 0.0004517841015753057, "loss": 5.6556, "mean_token_accuracy": 0.17615651786327363, "num_tokens": 43072981.0, "step": 22025 }, { "entropy": 5.9960111618042, "epoch": 2.2021292547608335, "grad_norm": 1.0859375, "learning_rate": 0.0004517620221203807, "loss": 5.6252, "mean_token_accuracy": 0.18304435908794403, "num_tokens": 43082992.0, "step": 22030 }, { "entropy": 6.038987398147583, "epoch": 2.2026290798220622, "grad_norm": 1.21875, "learning_rate": 0.00045173993821816873, "loss": 5.6987, "mean_token_accuracy": 0.17546250224113463, "num_tokens": 43092678.0, "step": 22035 }, { "entropy": 5.9675976753234865, "epoch": 2.203128904883291, "grad_norm": 1.3828125, "learning_rate": 0.0004517178498692253, "loss": 5.5898, "mean_token_accuracy": 0.18891261368989945, "num_tokens": 43102672.0, "step": 22040 }, { "entropy": 6.034510374069214, "epoch": 2.203628729944519, "grad_norm": 1.1875, "learning_rate": 0.00045169575707410637, "loss": 5.668, "mean_token_accuracy": 0.17588375508785248, "num_tokens": 43112747.0, "step": 22045 }, { "entropy": 6.027397108078003, "epoch": 2.204128555005748, "grad_norm": 1.2734375, "learning_rate": 0.00045167365983336756, "loss": 5.6327, "mean_token_accuracy": 0.17682866603136063, "num_tokens": 43122370.0, "step": 22050 }, { "entropy": 6.027716875076294, "epoch": 2.2046283800669766, "grad_norm": 1.0703125, "learning_rate": 0.00045165155814756497, "loss": 5.6475, "mean_token_accuracy": 0.18118370026350022, "num_tokens": 43131538.0, "step": 22055 }, { "entropy": 6.1900177001953125, "epoch": 2.2051282051282053, "grad_norm": 1.09375, "learning_rate": 0.00045162945201725457, "loss": 5.7977, "mean_token_accuracy": 0.16386715173721314, "num_tokens": 43141669.0, "step": 22060 }, { "entropy": 6.091287612915039, "epoch": 2.2056280301894335, "grad_norm": 1.15625, "learning_rate": 0.0004516073414429927, "loss": 5.7579, "mean_token_accuracy": 0.17163655459880828, "num_tokens": 43151456.0, "step": 22065 }, { "entropy": 6.039238405227661, "epoch": 2.2061278552506622, "grad_norm": 1.1875, "learning_rate": 0.0004515852264253356, "loss": 5.655, "mean_token_accuracy": 0.17147247195243837, "num_tokens": 43160491.0, "step": 22070 }, { "entropy": 6.064098501205445, "epoch": 2.206627680311891, "grad_norm": 1.2578125, "learning_rate": 0.00045156310696483953, "loss": 5.6425, "mean_token_accuracy": 0.17336027473211288, "num_tokens": 43170695.0, "step": 22075 }, { "entropy": 6.086498212814331, "epoch": 2.207127505373119, "grad_norm": 1.1796875, "learning_rate": 0.0004515409830620612, "loss": 5.7496, "mean_token_accuracy": 0.16989077776670455, "num_tokens": 43180542.0, "step": 22080 }, { "entropy": 6.020513248443604, "epoch": 2.207627330434348, "grad_norm": 1.4296875, "learning_rate": 0.0004515188547175571, "loss": 5.6684, "mean_token_accuracy": 0.17119597792625427, "num_tokens": 43190739.0, "step": 22085 }, { "entropy": 6.06134352684021, "epoch": 2.2081271554955766, "grad_norm": 1.1953125, "learning_rate": 0.000451496721931884, "loss": 5.7726, "mean_token_accuracy": 0.17430623024702072, "num_tokens": 43201808.0, "step": 22090 }, { "entropy": 6.1003166198730465, "epoch": 2.2086269805568053, "grad_norm": 1.1328125, "learning_rate": 0.0004514745847055989, "loss": 5.6697, "mean_token_accuracy": 0.1713427871465683, "num_tokens": 43211061.0, "step": 22095 }, { "entropy": 6.03029842376709, "epoch": 2.2091268056180335, "grad_norm": 1.2421875, "learning_rate": 0.0004514524430392586, "loss": 5.5639, "mean_token_accuracy": 0.18769593834877013, "num_tokens": 43220333.0, "step": 22100 }, { "entropy": 5.9788583278656, "epoch": 2.2096266306792622, "grad_norm": 1.171875, "learning_rate": 0.0004514302969334202, "loss": 5.6228, "mean_token_accuracy": 0.1857643112540245, "num_tokens": 43230134.0, "step": 22105 }, { "entropy": 6.022599172592163, "epoch": 2.210126455740491, "grad_norm": 1.2421875, "learning_rate": 0.00045140814638864105, "loss": 5.6297, "mean_token_accuracy": 0.1791934221982956, "num_tokens": 43239216.0, "step": 22110 }, { "entropy": 6.027814674377441, "epoch": 2.210626280801719, "grad_norm": 1.171875, "learning_rate": 0.0004513859914054782, "loss": 5.7432, "mean_token_accuracy": 0.16874404549598693, "num_tokens": 43249051.0, "step": 22115 }, { "entropy": 6.211530637741089, "epoch": 2.211126105862948, "grad_norm": 1.2890625, "learning_rate": 0.00045136383198448926, "loss": 5.8083, "mean_token_accuracy": 0.16471776291728019, "num_tokens": 43259507.0, "step": 22120 }, { "entropy": 6.087680053710938, "epoch": 2.2116259309241766, "grad_norm": 1.3203125, "learning_rate": 0.0004513416681262317, "loss": 5.7268, "mean_token_accuracy": 0.1705778107047081, "num_tokens": 43269097.0, "step": 22125 }, { "entropy": 6.050832843780517, "epoch": 2.2121257559854053, "grad_norm": 1.15625, "learning_rate": 0.0004513194998312631, "loss": 5.6249, "mean_token_accuracy": 0.17137878984212876, "num_tokens": 43278514.0, "step": 22130 }, { "entropy": 6.084692049026489, "epoch": 2.2126255810466335, "grad_norm": 1.2109375, "learning_rate": 0.0004512973271001413, "loss": 5.7518, "mean_token_accuracy": 0.16480341851711272, "num_tokens": 43288563.0, "step": 22135 }, { "entropy": 6.059920787811279, "epoch": 2.2131254061078622, "grad_norm": 1.171875, "learning_rate": 0.00045127514993342413, "loss": 5.5771, "mean_token_accuracy": 0.17250026762485504, "num_tokens": 43298168.0, "step": 22140 }, { "entropy": 5.999436950683593, "epoch": 2.213625231169091, "grad_norm": 1.1484375, "learning_rate": 0.0004512529683316695, "loss": 5.6602, "mean_token_accuracy": 0.17716497629880906, "num_tokens": 43308295.0, "step": 22145 }, { "entropy": 6.031063079833984, "epoch": 2.214125056230319, "grad_norm": 1.375, "learning_rate": 0.00045123078229543557, "loss": 5.6971, "mean_token_accuracy": 0.17268507033586503, "num_tokens": 43319283.0, "step": 22150 }, { "entropy": 6.122743129730225, "epoch": 2.214624881291548, "grad_norm": 1.2109375, "learning_rate": 0.0004512085918252805, "loss": 5.7194, "mean_token_accuracy": 0.1751079484820366, "num_tokens": 43329000.0, "step": 22155 }, { "entropy": 6.05804967880249, "epoch": 2.2151247063527766, "grad_norm": 1.171875, "learning_rate": 0.0004511863969217625, "loss": 5.5654, "mean_token_accuracy": 0.1824063166975975, "num_tokens": 43338150.0, "step": 22160 }, { "entropy": 6.000379371643066, "epoch": 2.2156245314140053, "grad_norm": 1.203125, "learning_rate": 0.00045116419758544024, "loss": 5.6247, "mean_token_accuracy": 0.18240000456571578, "num_tokens": 43348736.0, "step": 22165 }, { "entropy": 6.023730373382568, "epoch": 2.2161243564752335, "grad_norm": 1.125, "learning_rate": 0.00045114199381687207, "loss": 5.6509, "mean_token_accuracy": 0.18076959997415543, "num_tokens": 43359208.0, "step": 22170 }, { "entropy": 6.031237459182739, "epoch": 2.2166241815364622, "grad_norm": 1.1640625, "learning_rate": 0.0004511197856166166, "loss": 5.6298, "mean_token_accuracy": 0.17659648805856704, "num_tokens": 43368503.0, "step": 22175 }, { "entropy": 6.008730411529541, "epoch": 2.217124006597691, "grad_norm": 1.078125, "learning_rate": 0.0004510975729852327, "loss": 5.6737, "mean_token_accuracy": 0.16624808460474014, "num_tokens": 43378778.0, "step": 22180 }, { "entropy": 6.053968477249145, "epoch": 2.217623831658919, "grad_norm": 1.03125, "learning_rate": 0.0004510753559232792, "loss": 5.7113, "mean_token_accuracy": 0.17446492463350297, "num_tokens": 43389983.0, "step": 22185 }, { "entropy": 6.057756233215332, "epoch": 2.218123656720148, "grad_norm": 1.1484375, "learning_rate": 0.00045105313443131496, "loss": 5.6749, "mean_token_accuracy": 0.17128798067569734, "num_tokens": 43400008.0, "step": 22190 }, { "entropy": 6.095964241027832, "epoch": 2.2186234817813766, "grad_norm": 1.0703125, "learning_rate": 0.0004510309085098992, "loss": 5.6496, "mean_token_accuracy": 0.17622294872999192, "num_tokens": 43409626.0, "step": 22195 }, { "entropy": 6.112526512145996, "epoch": 2.2191233068426053, "grad_norm": 1.1171875, "learning_rate": 0.00045100867815959107, "loss": 5.6993, "mean_token_accuracy": 0.16991682052612306, "num_tokens": 43419277.0, "step": 22200 }, { "entropy": 5.987932395935059, "epoch": 2.2196231319038335, "grad_norm": 1.1328125, "learning_rate": 0.0004509864433809499, "loss": 5.6579, "mean_token_accuracy": 0.17732749432325362, "num_tokens": 43429226.0, "step": 22205 }, { "entropy": 6.082731103897094, "epoch": 2.2201229569650622, "grad_norm": 1.171875, "learning_rate": 0.0004509642041745351, "loss": 5.7274, "mean_token_accuracy": 0.16624752581119537, "num_tokens": 43438921.0, "step": 22210 }, { "entropy": 6.06203818321228, "epoch": 2.220622782026291, "grad_norm": 1.125, "learning_rate": 0.0004509419605409062, "loss": 5.6911, "mean_token_accuracy": 0.17973775118589402, "num_tokens": 43449450.0, "step": 22215 }, { "entropy": 6.113070154190064, "epoch": 2.221122607087519, "grad_norm": 1.28125, "learning_rate": 0.0004509197124806229, "loss": 5.6665, "mean_token_accuracy": 0.17515143305063247, "num_tokens": 43458587.0, "step": 22220 }, { "entropy": 6.044864463806152, "epoch": 2.221622432148748, "grad_norm": 1.2421875, "learning_rate": 0.00045089745999424486, "loss": 5.6795, "mean_token_accuracy": 0.17777097672224046, "num_tokens": 43467983.0, "step": 22225 }, { "entropy": 6.033739471435547, "epoch": 2.2221222572099766, "grad_norm": 1.171875, "learning_rate": 0.000450875203082332, "loss": 5.679, "mean_token_accuracy": 0.16325077116489412, "num_tokens": 43476887.0, "step": 22230 }, { "entropy": 6.052248191833496, "epoch": 2.2226220822712053, "grad_norm": 1.171875, "learning_rate": 0.0004508529417454442, "loss": 5.6219, "mean_token_accuracy": 0.17426965534687042, "num_tokens": 43485871.0, "step": 22235 }, { "entropy": 6.069500207901001, "epoch": 2.2231219073324335, "grad_norm": 1.1484375, "learning_rate": 0.00045083067598414176, "loss": 5.6953, "mean_token_accuracy": 0.1676015317440033, "num_tokens": 43496062.0, "step": 22240 }, { "entropy": 6.101183891296387, "epoch": 2.2236217323936622, "grad_norm": 1.15625, "learning_rate": 0.00045080840579898466, "loss": 5.742, "mean_token_accuracy": 0.16793988645076752, "num_tokens": 43505391.0, "step": 22245 }, { "entropy": 6.055177211761475, "epoch": 2.224121557454891, "grad_norm": 1.1875, "learning_rate": 0.0004507861311905334, "loss": 5.6813, "mean_token_accuracy": 0.16928481608629226, "num_tokens": 43515500.0, "step": 22250 }, { "entropy": 5.991426086425781, "epoch": 2.224621382516119, "grad_norm": 1.203125, "learning_rate": 0.0004507638521593482, "loss": 5.5597, "mean_token_accuracy": 0.18511694371700288, "num_tokens": 43524493.0, "step": 22255 }, { "entropy": 6.1207671642303465, "epoch": 2.225121207577348, "grad_norm": 1.171875, "learning_rate": 0.0004507415687059898, "loss": 5.6832, "mean_token_accuracy": 0.16908760368824005, "num_tokens": 43534075.0, "step": 22260 }, { "entropy": 6.06439437866211, "epoch": 2.2256210326385766, "grad_norm": 1.65625, "learning_rate": 0.00045071928083101874, "loss": 5.6634, "mean_token_accuracy": 0.17832424491643906, "num_tokens": 43543288.0, "step": 22265 }, { "entropy": 6.04383111000061, "epoch": 2.2261208576998053, "grad_norm": 1.1484375, "learning_rate": 0.0004506969885349957, "loss": 5.7062, "mean_token_accuracy": 0.17659382671117782, "num_tokens": 43553491.0, "step": 22270 }, { "entropy": 6.077741813659668, "epoch": 2.2266206827610335, "grad_norm": 1.3046875, "learning_rate": 0.0004506746918184818, "loss": 5.6866, "mean_token_accuracy": 0.17610663324594497, "num_tokens": 43563904.0, "step": 22275 }, { "entropy": 6.010642766952515, "epoch": 2.2271205078222622, "grad_norm": 1.2734375, "learning_rate": 0.0004506523906820378, "loss": 5.6852, "mean_token_accuracy": 0.17096028178930284, "num_tokens": 43573231.0, "step": 22280 }, { "entropy": 6.0773398876190186, "epoch": 2.227620332883491, "grad_norm": 1.265625, "learning_rate": 0.0004506300851262248, "loss": 5.6692, "mean_token_accuracy": 0.16963550448417664, "num_tokens": 43584538.0, "step": 22285 }, { "entropy": 6.1204675197601315, "epoch": 2.228120157944719, "grad_norm": 1.171875, "learning_rate": 0.00045060777515160404, "loss": 5.5373, "mean_token_accuracy": 0.18678200989961624, "num_tokens": 43594665.0, "step": 22290 }, { "entropy": 6.068657684326172, "epoch": 2.228619983005948, "grad_norm": 1.2890625, "learning_rate": 0.0004505854607587369, "loss": 5.701, "mean_token_accuracy": 0.17283949255943298, "num_tokens": 43604681.0, "step": 22295 }, { "entropy": 5.9363751888275145, "epoch": 2.2291198080671766, "grad_norm": 1.3125, "learning_rate": 0.0004505631419481847, "loss": 5.6142, "mean_token_accuracy": 0.17675758004188538, "num_tokens": 43614186.0, "step": 22300 }, { "entropy": 6.103043937683106, "epoch": 2.2296196331284053, "grad_norm": 1.1171875, "learning_rate": 0.0004505408187205091, "loss": 5.6818, "mean_token_accuracy": 0.16714295446872712, "num_tokens": 43624202.0, "step": 22305 }, { "entropy": 6.124151372909546, "epoch": 2.2301194581896335, "grad_norm": 1.1484375, "learning_rate": 0.0004505184910762716, "loss": 5.6987, "mean_token_accuracy": 0.17141597718000412, "num_tokens": 43634303.0, "step": 22310 }, { "entropy": 6.1126110553741455, "epoch": 2.2306192832508622, "grad_norm": 1.203125, "learning_rate": 0.00045049615901603406, "loss": 5.7158, "mean_token_accuracy": 0.1771593138575554, "num_tokens": 43644045.0, "step": 22315 }, { "entropy": 6.07891206741333, "epoch": 2.231119108312091, "grad_norm": 1.1953125, "learning_rate": 0.0004504738225403583, "loss": 5.7433, "mean_token_accuracy": 0.1725505292415619, "num_tokens": 43654220.0, "step": 22320 }, { "entropy": 6.061905336380005, "epoch": 2.231618933373319, "grad_norm": 1.078125, "learning_rate": 0.0004504514816498064, "loss": 5.7029, "mean_token_accuracy": 0.17058081775903702, "num_tokens": 43665124.0, "step": 22325 }, { "entropy": 6.050745487213135, "epoch": 2.232118758434548, "grad_norm": 1.171875, "learning_rate": 0.00045042913634494024, "loss": 5.5913, "mean_token_accuracy": 0.18154880702495574, "num_tokens": 43674029.0, "step": 22330 }, { "entropy": 6.035893964767456, "epoch": 2.2326185834957766, "grad_norm": 1.203125, "learning_rate": 0.0004504067866263222, "loss": 5.6627, "mean_token_accuracy": 0.1772293195128441, "num_tokens": 43683019.0, "step": 22335 }, { "entropy": 6.034237861633301, "epoch": 2.2331184085570053, "grad_norm": 1.1796875, "learning_rate": 0.0004503844324945146, "loss": 5.5968, "mean_token_accuracy": 0.17474510669708251, "num_tokens": 43692762.0, "step": 22340 }, { "entropy": 6.0099798202514645, "epoch": 2.2336182336182335, "grad_norm": 1.125, "learning_rate": 0.0004503620739500797, "loss": 5.6104, "mean_token_accuracy": 0.17870785146951676, "num_tokens": 43701899.0, "step": 22345 }, { "entropy": 6.057866430282592, "epoch": 2.2341180586794622, "grad_norm": 1.203125, "learning_rate": 0.0004503397109935802, "loss": 5.6058, "mean_token_accuracy": 0.17802409082651138, "num_tokens": 43711233.0, "step": 22350 }, { "entropy": 5.924233722686767, "epoch": 2.234617883740691, "grad_norm": 1.25, "learning_rate": 0.0004503173436255787, "loss": 5.4983, "mean_token_accuracy": 0.19454552829265595, "num_tokens": 43721754.0, "step": 22355 }, { "entropy": 5.992033195495606, "epoch": 2.235117708801919, "grad_norm": 1.171875, "learning_rate": 0.000450294971846638, "loss": 5.6298, "mean_token_accuracy": 0.1832828179001808, "num_tokens": 43731114.0, "step": 22360 }, { "entropy": 6.117801284790039, "epoch": 2.235617533863148, "grad_norm": 1.1796875, "learning_rate": 0.0004502725956573208, "loss": 5.6639, "mean_token_accuracy": 0.17628454566001892, "num_tokens": 43741011.0, "step": 22365 }, { "entropy": 6.1154687881469725, "epoch": 2.2361173589243766, "grad_norm": 1.2421875, "learning_rate": 0.0004502502150581903, "loss": 5.755, "mean_token_accuracy": 0.17173747569322587, "num_tokens": 43750075.0, "step": 22370 }, { "entropy": 5.991245222091675, "epoch": 2.2366171839856053, "grad_norm": 1.1015625, "learning_rate": 0.0004502278300498094, "loss": 5.6752, "mean_token_accuracy": 0.17549355030059816, "num_tokens": 43759826.0, "step": 22375 }, { "entropy": 6.048260307312011, "epoch": 2.2371170090468335, "grad_norm": 1.09375, "learning_rate": 0.00045020544063274147, "loss": 5.6371, "mean_token_accuracy": 0.17687432020902633, "num_tokens": 43769326.0, "step": 22380 }, { "entropy": 6.061201763153076, "epoch": 2.2376168341080622, "grad_norm": 1.2578125, "learning_rate": 0.00045018304680754975, "loss": 5.601, "mean_token_accuracy": 0.17728709280490876, "num_tokens": 43778549.0, "step": 22385 }, { "entropy": 6.1114034175872805, "epoch": 2.238116659169291, "grad_norm": 1.1171875, "learning_rate": 0.0004501606485747975, "loss": 5.7746, "mean_token_accuracy": 0.16107561439275742, "num_tokens": 43789032.0, "step": 22390 }, { "entropy": 6.112794351577759, "epoch": 2.238616484230519, "grad_norm": 1.1484375, "learning_rate": 0.0004501382459350485, "loss": 5.7403, "mean_token_accuracy": 0.1763688802719116, "num_tokens": 43798246.0, "step": 22395 }, { "entropy": 6.072865629196167, "epoch": 2.239116309291748, "grad_norm": 1.1640625, "learning_rate": 0.0004501158388888663, "loss": 5.6858, "mean_token_accuracy": 0.17559813857078552, "num_tokens": 43807572.0, "step": 22400 }, { "entropy": 6.0150528907775875, "epoch": 2.2396161343529766, "grad_norm": 1.1171875, "learning_rate": 0.0004500934274368147, "loss": 5.6831, "mean_token_accuracy": 0.17309265583753586, "num_tokens": 43816912.0, "step": 22405 }, { "entropy": 6.002626657485962, "epoch": 2.240115959414205, "grad_norm": 1.21875, "learning_rate": 0.00045007101157945747, "loss": 5.6573, "mean_token_accuracy": 0.1720070406794548, "num_tokens": 43826386.0, "step": 22410 }, { "entropy": 6.072042751312256, "epoch": 2.2406157844754335, "grad_norm": 1.15625, "learning_rate": 0.00045004859131735867, "loss": 5.6807, "mean_token_accuracy": 0.17359066307544707, "num_tokens": 43836456.0, "step": 22415 }, { "entropy": 6.003937244415283, "epoch": 2.2411156095366622, "grad_norm": 1.171875, "learning_rate": 0.00045002616665108233, "loss": 5.5564, "mean_token_accuracy": 0.18237012177705764, "num_tokens": 43846360.0, "step": 22420 }, { "entropy": 6.030667114257812, "epoch": 2.241615434597891, "grad_norm": 1.1171875, "learning_rate": 0.0004500037375811926, "loss": 5.6428, "mean_token_accuracy": 0.17764281779527663, "num_tokens": 43855999.0, "step": 22425 }, { "entropy": 6.039393281936645, "epoch": 2.242115259659119, "grad_norm": 1.1640625, "learning_rate": 0.00044998130410825395, "loss": 5.6272, "mean_token_accuracy": 0.17685568034648896, "num_tokens": 43865497.0, "step": 22430 }, { "entropy": 6.040842151641845, "epoch": 2.242615084720348, "grad_norm": 1.21875, "learning_rate": 0.0004499588662328307, "loss": 5.6217, "mean_token_accuracy": 0.17351048439741135, "num_tokens": 43874450.0, "step": 22435 }, { "entropy": 6.021168184280396, "epoch": 2.2431149097815766, "grad_norm": 1.109375, "learning_rate": 0.0004499364239554874, "loss": 5.6258, "mean_token_accuracy": 0.17424180656671523, "num_tokens": 43885552.0, "step": 22440 }, { "entropy": 6.119274854660034, "epoch": 2.243614734842805, "grad_norm": 1.3046875, "learning_rate": 0.0004499139772767887, "loss": 5.7228, "mean_token_accuracy": 0.1769503727555275, "num_tokens": 43894928.0, "step": 22445 }, { "entropy": 6.065196847915649, "epoch": 2.2441145599040335, "grad_norm": 1.1328125, "learning_rate": 0.0004498915261972993, "loss": 5.5651, "mean_token_accuracy": 0.1837917298078537, "num_tokens": 43904841.0, "step": 22450 }, { "entropy": 6.001014518737793, "epoch": 2.244614384965262, "grad_norm": 1.125, "learning_rate": 0.00044986907071758417, "loss": 5.5621, "mean_token_accuracy": 0.18431970626115798, "num_tokens": 43914690.0, "step": 22455 }, { "entropy": 5.923689556121826, "epoch": 2.245114210026491, "grad_norm": 1.125, "learning_rate": 0.0004498466108382082, "loss": 5.5578, "mean_token_accuracy": 0.18531722128391265, "num_tokens": 43925237.0, "step": 22460 }, { "entropy": 6.070363712310791, "epoch": 2.245614035087719, "grad_norm": 1.1796875, "learning_rate": 0.0004498241465597365, "loss": 5.7041, "mean_token_accuracy": 0.17300845831632614, "num_tokens": 43934635.0, "step": 22465 }, { "entropy": 6.063670015335083, "epoch": 2.246113860148948, "grad_norm": 1.3671875, "learning_rate": 0.0004498016778827342, "loss": 5.658, "mean_token_accuracy": 0.18038448095321655, "num_tokens": 43943705.0, "step": 22470 }, { "entropy": 6.039931106567383, "epoch": 2.2466136852101766, "grad_norm": 1.1875, "learning_rate": 0.0004497792048077667, "loss": 5.606, "mean_token_accuracy": 0.17851114869117737, "num_tokens": 43953559.0, "step": 22475 }, { "entropy": 6.0384022235870365, "epoch": 2.247113510271405, "grad_norm": 1.2265625, "learning_rate": 0.0004497567273353994, "loss": 5.6815, "mean_token_accuracy": 0.17560024708509445, "num_tokens": 43963940.0, "step": 22480 }, { "entropy": 6.031838512420654, "epoch": 2.2476133353326335, "grad_norm": 1.1484375, "learning_rate": 0.00044973424546619774, "loss": 5.5714, "mean_token_accuracy": 0.18169790953397752, "num_tokens": 43973364.0, "step": 22485 }, { "entropy": 6.09574294090271, "epoch": 2.248113160393862, "grad_norm": 1.203125, "learning_rate": 0.0004497117592007275, "loss": 5.6369, "mean_token_accuracy": 0.17298363894224167, "num_tokens": 43982531.0, "step": 22490 }, { "entropy": 6.096007823944092, "epoch": 2.248612985455091, "grad_norm": 1.0703125, "learning_rate": 0.0004496892685395543, "loss": 5.7946, "mean_token_accuracy": 0.16701375246047973, "num_tokens": 43994244.0, "step": 22495 }, { "entropy": 5.990036582946777, "epoch": 2.249112810516319, "grad_norm": 1.203125, "learning_rate": 0.0004496667734832441, "loss": 5.62, "mean_token_accuracy": 0.17978659570217131, "num_tokens": 44003809.0, "step": 22500 }, { "entropy": 6.064924860000611, "epoch": 2.249612635577548, "grad_norm": 1.1171875, "learning_rate": 0.00044964427403236274, "loss": 5.6466, "mean_token_accuracy": 0.171216182410717, "num_tokens": 44014850.0, "step": 22505 }, { "entropy": 5.967130947113037, "epoch": 2.2501124606387766, "grad_norm": 1.0703125, "learning_rate": 0.0004496217701874765, "loss": 5.5284, "mean_token_accuracy": 0.1821651816368103, "num_tokens": 44025594.0, "step": 22510 }, { "entropy": 6.060387039184571, "epoch": 2.250612285700005, "grad_norm": 1.1640625, "learning_rate": 0.0004495992619491514, "loss": 5.7424, "mean_token_accuracy": 0.17245593369007112, "num_tokens": 44034681.0, "step": 22515 }, { "entropy": 6.0845990657806395, "epoch": 2.2511121107612335, "grad_norm": 1.1953125, "learning_rate": 0.0004495767493179538, "loss": 5.6364, "mean_token_accuracy": 0.17254023402929305, "num_tokens": 44044149.0, "step": 22520 }, { "entropy": 6.091122341156006, "epoch": 2.251611935822462, "grad_norm": 1.25, "learning_rate": 0.0004495542322944501, "loss": 5.6824, "mean_token_accuracy": 0.17178913205862045, "num_tokens": 44054238.0, "step": 22525 }, { "entropy": 6.014432811737061, "epoch": 2.2521117608836905, "grad_norm": 1.1796875, "learning_rate": 0.00044953171087920693, "loss": 5.7333, "mean_token_accuracy": 0.1670988455414772, "num_tokens": 44063826.0, "step": 22530 }, { "entropy": 6.1266919612884525, "epoch": 2.252611585944919, "grad_norm": 1.1640625, "learning_rate": 0.0004495091850727907, "loss": 5.7271, "mean_token_accuracy": 0.16965164989233017, "num_tokens": 44074588.0, "step": 22535 }, { "entropy": 6.040569496154785, "epoch": 2.253111411006148, "grad_norm": 1.2265625, "learning_rate": 0.00044948665487576833, "loss": 5.6567, "mean_token_accuracy": 0.17420101910829544, "num_tokens": 44084737.0, "step": 22540 }, { "entropy": 6.125871276855468, "epoch": 2.2536112360673766, "grad_norm": 1.2109375, "learning_rate": 0.00044946412028870657, "loss": 5.6181, "mean_token_accuracy": 0.1773032248020172, "num_tokens": 44093542.0, "step": 22545 }, { "entropy": 6.097443246841431, "epoch": 2.254111061128605, "grad_norm": 1.2734375, "learning_rate": 0.0004494415813121725, "loss": 5.6876, "mean_token_accuracy": 0.16689204052090645, "num_tokens": 44104681.0, "step": 22550 }, { "entropy": 6.132251501083374, "epoch": 2.2546108861898335, "grad_norm": 1.0546875, "learning_rate": 0.0004494190379467331, "loss": 5.851, "mean_token_accuracy": 0.16538407951593398, "num_tokens": 44116567.0, "step": 22555 }, { "entropy": 6.028368520736694, "epoch": 2.255110711251062, "grad_norm": 1.203125, "learning_rate": 0.00044939649019295564, "loss": 5.6478, "mean_token_accuracy": 0.1739356592297554, "num_tokens": 44125176.0, "step": 22560 }, { "entropy": 6.055741548538208, "epoch": 2.2556105363122905, "grad_norm": 1.109375, "learning_rate": 0.0004493739380514073, "loss": 5.6763, "mean_token_accuracy": 0.17245809733867645, "num_tokens": 44136371.0, "step": 22565 }, { "entropy": 6.042793607711792, "epoch": 2.256110361373519, "grad_norm": 1.234375, "learning_rate": 0.0004493513815226556, "loss": 5.6023, "mean_token_accuracy": 0.18558013886213304, "num_tokens": 44146456.0, "step": 22570 }, { "entropy": 5.99357647895813, "epoch": 2.256610186434748, "grad_norm": 1.171875, "learning_rate": 0.000449328820607268, "loss": 5.6262, "mean_token_accuracy": 0.18093568831682205, "num_tokens": 44155719.0, "step": 22575 }, { "entropy": 5.983214235305786, "epoch": 2.2571100114959766, "grad_norm": 1.2265625, "learning_rate": 0.0004493062553058121, "loss": 5.6326, "mean_token_accuracy": 0.18207505643367766, "num_tokens": 44165994.0, "step": 22580 }, { "entropy": 6.0403584957122805, "epoch": 2.257609836557205, "grad_norm": 1.4375, "learning_rate": 0.00044928368561885566, "loss": 5.7575, "mean_token_accuracy": 0.17001302242279054, "num_tokens": 44175726.0, "step": 22585 }, { "entropy": 6.137831306457519, "epoch": 2.2581096616184335, "grad_norm": 1.25, "learning_rate": 0.00044926111154696655, "loss": 5.6798, "mean_token_accuracy": 0.17473064959049225, "num_tokens": 44185824.0, "step": 22590 }, { "entropy": 6.054876661300659, "epoch": 2.258609486679662, "grad_norm": 1.0703125, "learning_rate": 0.0004492385330907127, "loss": 5.6071, "mean_token_accuracy": 0.18138361126184463, "num_tokens": 44195817.0, "step": 22595 }, { "entropy": 5.9934288501739506, "epoch": 2.2591093117408905, "grad_norm": 1.1015625, "learning_rate": 0.0004492159502506622, "loss": 5.6132, "mean_token_accuracy": 0.18111189156770707, "num_tokens": 44205885.0, "step": 22600 }, { "entropy": 6.147416305541992, "epoch": 2.259609136802119, "grad_norm": 1.1796875, "learning_rate": 0.00044919336302738324, "loss": 5.6737, "mean_token_accuracy": 0.17354893833398818, "num_tokens": 44215472.0, "step": 22605 }, { "entropy": 6.136277961730957, "epoch": 2.260108961863348, "grad_norm": 1.1015625, "learning_rate": 0.00044917077142144407, "loss": 5.7015, "mean_token_accuracy": 0.17671042382717134, "num_tokens": 44225833.0, "step": 22610 }, { "entropy": 6.022605228424072, "epoch": 2.2606087869245766, "grad_norm": 1.234375, "learning_rate": 0.00044914817543341315, "loss": 5.6009, "mean_token_accuracy": 0.18302031755447387, "num_tokens": 44236252.0, "step": 22615 }, { "entropy": 6.046173477172852, "epoch": 2.261108611985805, "grad_norm": 1.3125, "learning_rate": 0.0004491255750638589, "loss": 5.699, "mean_token_accuracy": 0.17131995856761933, "num_tokens": 44245387.0, "step": 22620 }, { "entropy": 6.143176078796387, "epoch": 2.2616084370470335, "grad_norm": 1.15625, "learning_rate": 0.00044910297031335006, "loss": 5.7473, "mean_token_accuracy": 0.17100108414888382, "num_tokens": 44254578.0, "step": 22625 }, { "entropy": 6.032327365875244, "epoch": 2.262108262108262, "grad_norm": 1.1796875, "learning_rate": 0.00044908036118245523, "loss": 5.5612, "mean_token_accuracy": 0.18317103385925293, "num_tokens": 44263042.0, "step": 22630 }, { "entropy": 6.086282777786255, "epoch": 2.2626080871694905, "grad_norm": 1.1796875, "learning_rate": 0.0004490577476717433, "loss": 5.6839, "mean_token_accuracy": 0.1689959242939949, "num_tokens": 44272068.0, "step": 22635 }, { "entropy": 5.9729146480560305, "epoch": 2.263107912230719, "grad_norm": 1.171875, "learning_rate": 0.0004490351297817832, "loss": 5.5892, "mean_token_accuracy": 0.18363638669252397, "num_tokens": 44281829.0, "step": 22640 }, { "entropy": 6.028397512435913, "epoch": 2.263607737291948, "grad_norm": 1.2734375, "learning_rate": 0.000449012507513144, "loss": 5.6401, "mean_token_accuracy": 0.17523443400859834, "num_tokens": 44290097.0, "step": 22645 }, { "entropy": 6.048000431060791, "epoch": 2.2641075623531766, "grad_norm": 1.1484375, "learning_rate": 0.00044898988086639497, "loss": 5.6505, "mean_token_accuracy": 0.17964818477630615, "num_tokens": 44300611.0, "step": 22650 }, { "entropy": 6.047449588775635, "epoch": 2.264607387414405, "grad_norm": 1.234375, "learning_rate": 0.0004489672498421053, "loss": 5.6454, "mean_token_accuracy": 0.1749682679772377, "num_tokens": 44310324.0, "step": 22655 }, { "entropy": 5.909977197647095, "epoch": 2.2651072124756335, "grad_norm": 1.25, "learning_rate": 0.0004489446144408444, "loss": 5.4826, "mean_token_accuracy": 0.1874544396996498, "num_tokens": 44319750.0, "step": 22660 }, { "entropy": 6.0537059783935545, "epoch": 2.265607037536862, "grad_norm": 1.28125, "learning_rate": 0.0004489219746631817, "loss": 5.6781, "mean_token_accuracy": 0.17433273494243623, "num_tokens": 44329092.0, "step": 22665 }, { "entropy": 6.021524953842163, "epoch": 2.2661068625980905, "grad_norm": 1.21875, "learning_rate": 0.00044889933050968695, "loss": 5.5776, "mean_token_accuracy": 0.18377045691013336, "num_tokens": 44337608.0, "step": 22670 }, { "entropy": 6.076061153411866, "epoch": 2.266606687659319, "grad_norm": 1.1015625, "learning_rate": 0.00044887668198092975, "loss": 5.708, "mean_token_accuracy": 0.1752407044172287, "num_tokens": 44347600.0, "step": 22675 }, { "entropy": 6.008341360092163, "epoch": 2.267106512720548, "grad_norm": 1.1640625, "learning_rate": 0.00044885402907748, "loss": 5.6629, "mean_token_accuracy": 0.17800277024507521, "num_tokens": 44358187.0, "step": 22680 }, { "entropy": 6.099863767623901, "epoch": 2.2676063377817766, "grad_norm": 1.6171875, "learning_rate": 0.00044883137179990755, "loss": 5.6559, "mean_token_accuracy": 0.17946952134370803, "num_tokens": 44367563.0, "step": 22685 }, { "entropy": 6.127856492996216, "epoch": 2.268106162843005, "grad_norm": 1.1171875, "learning_rate": 0.00044880871014878253, "loss": 5.69, "mean_token_accuracy": 0.1662495568394661, "num_tokens": 44378123.0, "step": 22690 }, { "entropy": 6.054735565185547, "epoch": 2.2686059879042335, "grad_norm": 1.15625, "learning_rate": 0.00044878604412467517, "loss": 5.6918, "mean_token_accuracy": 0.16861882358789443, "num_tokens": 44387753.0, "step": 22695 }, { "entropy": 6.02043924331665, "epoch": 2.269105812965462, "grad_norm": 1.328125, "learning_rate": 0.00044876337372815555, "loss": 5.5982, "mean_token_accuracy": 0.17840524166822433, "num_tokens": 44397917.0, "step": 22700 }, { "entropy": 6.030861186981201, "epoch": 2.2696056380266905, "grad_norm": 1.25, "learning_rate": 0.00044874069895979417, "loss": 5.6628, "mean_token_accuracy": 0.18183663636445999, "num_tokens": 44407135.0, "step": 22705 }, { "entropy": 6.054340600967407, "epoch": 2.270105463087919, "grad_norm": 1.21875, "learning_rate": 0.0004487180198201616, "loss": 5.7059, "mean_token_accuracy": 0.17559201121330262, "num_tokens": 44416814.0, "step": 22710 }, { "entropy": 6.046470832824707, "epoch": 2.270605288149148, "grad_norm": 1.140625, "learning_rate": 0.00044869533630982833, "loss": 5.8059, "mean_token_accuracy": 0.16059192419052123, "num_tokens": 44427304.0, "step": 22715 }, { "entropy": 6.056251001358032, "epoch": 2.2711051132103766, "grad_norm": 1.5234375, "learning_rate": 0.000448672648429365, "loss": 5.6019, "mean_token_accuracy": 0.17755310088396073, "num_tokens": 44436813.0, "step": 22720 }, { "entropy": 5.99092469215393, "epoch": 2.271604938271605, "grad_norm": 1.296875, "learning_rate": 0.00044864995617934265, "loss": 5.57, "mean_token_accuracy": 0.1836025357246399, "num_tokens": 44446603.0, "step": 22725 }, { "entropy": 6.0076549530029295, "epoch": 2.2721047633328335, "grad_norm": 1.1796875, "learning_rate": 0.000448627259560332, "loss": 5.6752, "mean_token_accuracy": 0.17345665842294694, "num_tokens": 44456016.0, "step": 22730 }, { "entropy": 6.073874568939209, "epoch": 2.272604588394062, "grad_norm": 1.140625, "learning_rate": 0.00044860455857290415, "loss": 5.6428, "mean_token_accuracy": 0.18114509731531142, "num_tokens": 44465384.0, "step": 22735 }, { "entropy": 6.0320093631744385, "epoch": 2.2731044134552905, "grad_norm": 1.1875, "learning_rate": 0.0004485818532176304, "loss": 5.6798, "mean_token_accuracy": 0.16968780010938644, "num_tokens": 44475709.0, "step": 22740 }, { "entropy": 6.057575750350952, "epoch": 2.273604238516519, "grad_norm": 1.1953125, "learning_rate": 0.0004485591434950818, "loss": 5.7198, "mean_token_accuracy": 0.1708892598748207, "num_tokens": 44485602.0, "step": 22745 }, { "entropy": 6.038588523864746, "epoch": 2.274104063577748, "grad_norm": 1.2109375, "learning_rate": 0.0004485364294058298, "loss": 5.6782, "mean_token_accuracy": 0.17668967992067336, "num_tokens": 44495121.0, "step": 22750 }, { "entropy": 6.043997526168823, "epoch": 2.2746038886389766, "grad_norm": 1.15625, "learning_rate": 0.00044851371095044597, "loss": 5.5774, "mean_token_accuracy": 0.1805984854698181, "num_tokens": 44504336.0, "step": 22755 }, { "entropy": 6.116004180908203, "epoch": 2.275103713700205, "grad_norm": 1.34375, "learning_rate": 0.00044849098812950174, "loss": 5.6975, "mean_token_accuracy": 0.17600071728229522, "num_tokens": 44514076.0, "step": 22760 }, { "entropy": 6.052427625656128, "epoch": 2.2756035387614335, "grad_norm": 1.0859375, "learning_rate": 0.000448468260943569, "loss": 5.7678, "mean_token_accuracy": 0.16799335330724716, "num_tokens": 44523659.0, "step": 22765 }, { "entropy": 6.0135297775268555, "epoch": 2.276103363822662, "grad_norm": 1.2265625, "learning_rate": 0.00044844552939321937, "loss": 5.5985, "mean_token_accuracy": 0.18164594620466232, "num_tokens": 44534024.0, "step": 22770 }, { "entropy": 5.989290761947632, "epoch": 2.2766031888838905, "grad_norm": 1.125, "learning_rate": 0.0004484227934790248, "loss": 5.5706, "mean_token_accuracy": 0.18282771110534668, "num_tokens": 44543206.0, "step": 22775 }, { "entropy": 6.107430124282837, "epoch": 2.277103013945119, "grad_norm": 1.09375, "learning_rate": 0.0004484000532015575, "loss": 5.771, "mean_token_accuracy": 0.17538654059171677, "num_tokens": 44553670.0, "step": 22780 }, { "entropy": 5.995081090927124, "epoch": 2.277602839006348, "grad_norm": 1.125, "learning_rate": 0.00044837730856138935, "loss": 5.7173, "mean_token_accuracy": 0.16795311421155928, "num_tokens": 44564040.0, "step": 22785 }, { "entropy": 5.994439935684204, "epoch": 2.2781026640675766, "grad_norm": 1.2109375, "learning_rate": 0.0004483545595590928, "loss": 5.5701, "mean_token_accuracy": 0.1865209311246872, "num_tokens": 44573605.0, "step": 22790 }, { "entropy": 6.088307523727417, "epoch": 2.278602489128805, "grad_norm": 1.1796875, "learning_rate": 0.0004483318061952401, "loss": 5.6206, "mean_token_accuracy": 0.17592047899961472, "num_tokens": 44584298.0, "step": 22795 }, { "entropy": 6.100736522674561, "epoch": 2.2791023141900335, "grad_norm": 1.171875, "learning_rate": 0.0004483090484704038, "loss": 5.7448, "mean_token_accuracy": 0.16686265021562577, "num_tokens": 44594585.0, "step": 22800 }, { "entropy": 5.9258991241455075, "epoch": 2.279602139251262, "grad_norm": 1.1328125, "learning_rate": 0.00044828628638515647, "loss": 5.5247, "mean_token_accuracy": 0.18610540479421617, "num_tokens": 44604788.0, "step": 22805 }, { "entropy": 6.024156713485718, "epoch": 2.2801019643124905, "grad_norm": 1.1015625, "learning_rate": 0.0004482635199400707, "loss": 5.6775, "mean_token_accuracy": 0.1761302724480629, "num_tokens": 44614259.0, "step": 22810 }, { "entropy": 6.011697101593017, "epoch": 2.280601789373719, "grad_norm": 1.34375, "learning_rate": 0.00044824074913571936, "loss": 5.6142, "mean_token_accuracy": 0.17819089740514754, "num_tokens": 44624827.0, "step": 22815 }, { "entropy": 5.99537034034729, "epoch": 2.281101614434948, "grad_norm": 1.1953125, "learning_rate": 0.00044821797397267535, "loss": 5.5825, "mean_token_accuracy": 0.17829849272966386, "num_tokens": 44635741.0, "step": 22820 }, { "entropy": 6.11402735710144, "epoch": 2.2816014394961766, "grad_norm": 1.25, "learning_rate": 0.0004481951944515117, "loss": 5.7576, "mean_token_accuracy": 0.17041065394878388, "num_tokens": 44644935.0, "step": 22825 }, { "entropy": 5.931255054473877, "epoch": 2.282101264557405, "grad_norm": 1.6640625, "learning_rate": 0.00044817241057280155, "loss": 5.5465, "mean_token_accuracy": 0.18928992599248887, "num_tokens": 44654265.0, "step": 22830 }, { "entropy": 6.121523857116699, "epoch": 2.2826010896186335, "grad_norm": 1.171875, "learning_rate": 0.0004481496223371181, "loss": 5.6421, "mean_token_accuracy": 0.17326626628637315, "num_tokens": 44664461.0, "step": 22835 }, { "entropy": 6.0548779487609865, "epoch": 2.283100914679862, "grad_norm": 1.234375, "learning_rate": 0.00044812682974503464, "loss": 5.5838, "mean_token_accuracy": 0.17743927389383315, "num_tokens": 44673774.0, "step": 22840 }, { "entropy": 6.0594401359558105, "epoch": 2.2836007397410905, "grad_norm": 1.1484375, "learning_rate": 0.0004481040327971248, "loss": 5.6763, "mean_token_accuracy": 0.1744630068540573, "num_tokens": 44683061.0, "step": 22845 }, { "entropy": 6.073571443557739, "epoch": 2.284100564802319, "grad_norm": 1.1953125, "learning_rate": 0.00044808123149396193, "loss": 5.6601, "mean_token_accuracy": 0.1713159441947937, "num_tokens": 44691874.0, "step": 22850 }, { "entropy": 6.0932690620422365, "epoch": 2.284600389863548, "grad_norm": 1.09375, "learning_rate": 0.00044805842583611993, "loss": 5.7182, "mean_token_accuracy": 0.17390562891960143, "num_tokens": 44701796.0, "step": 22855 }, { "entropy": 6.129049491882324, "epoch": 2.2851002149247766, "grad_norm": 1.265625, "learning_rate": 0.00044803561582417237, "loss": 5.7745, "mean_token_accuracy": 0.16220706105232238, "num_tokens": 44711749.0, "step": 22860 }, { "entropy": 6.03991117477417, "epoch": 2.285600039986005, "grad_norm": 1.1015625, "learning_rate": 0.00044801280145869327, "loss": 5.5761, "mean_token_accuracy": 0.1820228949189186, "num_tokens": 44721507.0, "step": 22865 }, { "entropy": 6.081853246688842, "epoch": 2.2860998650472335, "grad_norm": 1.046875, "learning_rate": 0.0004479899827402566, "loss": 5.7347, "mean_token_accuracy": 0.17001610845327378, "num_tokens": 44731178.0, "step": 22870 }, { "entropy": 6.036158466339112, "epoch": 2.286599690108462, "grad_norm": 1.078125, "learning_rate": 0.00044796715966943654, "loss": 5.6276, "mean_token_accuracy": 0.17586903870105744, "num_tokens": 44741385.0, "step": 22875 }, { "entropy": 6.109137678146363, "epoch": 2.2870995151696905, "grad_norm": 1.1796875, "learning_rate": 0.0004479443322468072, "loss": 5.6844, "mean_token_accuracy": 0.17533629089593888, "num_tokens": 44751316.0, "step": 22880 }, { "entropy": 6.0589264869689945, "epoch": 2.287599340230919, "grad_norm": 1.2265625, "learning_rate": 0.0004479215004729429, "loss": 5.6745, "mean_token_accuracy": 0.1721330389380455, "num_tokens": 44760786.0, "step": 22885 }, { "entropy": 6.051329469680786, "epoch": 2.288099165292148, "grad_norm": 1.234375, "learning_rate": 0.0004478986643484183, "loss": 5.6818, "mean_token_accuracy": 0.17198379039764405, "num_tokens": 44771203.0, "step": 22890 }, { "entropy": 6.110095500946045, "epoch": 2.2885989903533765, "grad_norm": 1.234375, "learning_rate": 0.00044787582387380764, "loss": 5.7243, "mean_token_accuracy": 0.16875131130218507, "num_tokens": 44780739.0, "step": 22895 }, { "entropy": 6.127801179885864, "epoch": 2.289098815414605, "grad_norm": 1.2109375, "learning_rate": 0.0004478529790496858, "loss": 5.685, "mean_token_accuracy": 0.17555733472108842, "num_tokens": 44790534.0, "step": 22900 }, { "entropy": 6.0240319728851315, "epoch": 2.2895986404758335, "grad_norm": 1.4375, "learning_rate": 0.00044783012987662755, "loss": 5.6819, "mean_token_accuracy": 0.17706696093082427, "num_tokens": 44799767.0, "step": 22905 }, { "entropy": 6.034433603286743, "epoch": 2.290098465537062, "grad_norm": 1.1484375, "learning_rate": 0.0004478072763552076, "loss": 5.7262, "mean_token_accuracy": 0.16661795675754548, "num_tokens": 44810431.0, "step": 22910 }, { "entropy": 6.021226930618286, "epoch": 2.2905982905982905, "grad_norm": 1.2890625, "learning_rate": 0.0004477844184860011, "loss": 5.6032, "mean_token_accuracy": 0.17970228791236878, "num_tokens": 44820605.0, "step": 22915 }, { "entropy": 6.147016906738282, "epoch": 2.291098115659519, "grad_norm": 1.09375, "learning_rate": 0.00044776155626958305, "loss": 5.7142, "mean_token_accuracy": 0.1735147327184677, "num_tokens": 44829895.0, "step": 22920 }, { "entropy": 6.0952064990997314, "epoch": 2.291597940720748, "grad_norm": 1.0625, "learning_rate": 0.00044773868970652875, "loss": 5.7044, "mean_token_accuracy": 0.1727651759982109, "num_tokens": 44839162.0, "step": 22925 }, { "entropy": 6.04616060256958, "epoch": 2.2920977657819765, "grad_norm": 1.1640625, "learning_rate": 0.00044771581879741334, "loss": 5.4982, "mean_token_accuracy": 0.1821899652481079, "num_tokens": 44849395.0, "step": 22930 }, { "entropy": 6.056617736816406, "epoch": 2.292597590843205, "grad_norm": 1.15625, "learning_rate": 0.00044769294354281253, "loss": 5.626, "mean_token_accuracy": 0.17853233963251114, "num_tokens": 44858695.0, "step": 22935 }, { "entropy": 6.082744932174682, "epoch": 2.2930974159044335, "grad_norm": 1.3359375, "learning_rate": 0.00044767006394330166, "loss": 5.7424, "mean_token_accuracy": 0.17392259687185288, "num_tokens": 44869447.0, "step": 22940 }, { "entropy": 5.926930236816406, "epoch": 2.293597240965662, "grad_norm": 1.1328125, "learning_rate": 0.00044764717999945644, "loss": 5.4849, "mean_token_accuracy": 0.19093242585659026, "num_tokens": 44878155.0, "step": 22945 }, { "entropy": 6.031009197235107, "epoch": 2.2940970660268905, "grad_norm": 1.109375, "learning_rate": 0.00044762429171185246, "loss": 5.6854, "mean_token_accuracy": 0.1685200423002243, "num_tokens": 44888465.0, "step": 22950 }, { "entropy": 6.042946767807007, "epoch": 2.294596891088119, "grad_norm": 1.15625, "learning_rate": 0.00044760139908106583, "loss": 5.6342, "mean_token_accuracy": 0.17464472949504853, "num_tokens": 44898915.0, "step": 22955 }, { "entropy": 6.077787780761719, "epoch": 2.295096716149348, "grad_norm": 1.078125, "learning_rate": 0.0004475785021076724, "loss": 5.5975, "mean_token_accuracy": 0.17435404285788536, "num_tokens": 44908543.0, "step": 22960 }, { "entropy": 6.005533456802368, "epoch": 2.2955965412105765, "grad_norm": 1.1875, "learning_rate": 0.00044755560079224834, "loss": 5.6212, "mean_token_accuracy": 0.1799132212996483, "num_tokens": 44918429.0, "step": 22965 }, { "entropy": 6.042086029052735, "epoch": 2.296096366271805, "grad_norm": 1.1796875, "learning_rate": 0.0004475326951353697, "loss": 5.6031, "mean_token_accuracy": 0.17452608048915863, "num_tokens": 44927479.0, "step": 22970 }, { "entropy": 5.946207904815674, "epoch": 2.2965961913330335, "grad_norm": 1.25, "learning_rate": 0.00044750978513761276, "loss": 5.5686, "mean_token_accuracy": 0.18469358682632447, "num_tokens": 44937317.0, "step": 22975 }, { "entropy": 6.104387998580933, "epoch": 2.297096016394262, "grad_norm": 1.046875, "learning_rate": 0.0004474868707995541, "loss": 5.7639, "mean_token_accuracy": 0.1725318104028702, "num_tokens": 44947587.0, "step": 22980 }, { "entropy": 6.0311352729797365, "epoch": 2.2975958414554905, "grad_norm": 1.171875, "learning_rate": 0.00044746395212177015, "loss": 5.5557, "mean_token_accuracy": 0.1869001254439354, "num_tokens": 44956850.0, "step": 22985 }, { "entropy": 6.07925443649292, "epoch": 2.298095666516719, "grad_norm": 1.1953125, "learning_rate": 0.00044744102910483755, "loss": 5.6545, "mean_token_accuracy": 0.17090903967618942, "num_tokens": 44966310.0, "step": 22990 }, { "entropy": 6.066224527359009, "epoch": 2.298595491577948, "grad_norm": 1.2109375, "learning_rate": 0.000447418101749333, "loss": 5.6935, "mean_token_accuracy": 0.17769431918859482, "num_tokens": 44975361.0, "step": 22995 }, { "entropy": 6.074802255630493, "epoch": 2.299095316639176, "grad_norm": 1.0859375, "learning_rate": 0.0004473951700558334, "loss": 5.7141, "mean_token_accuracy": 0.16872006505727768, "num_tokens": 44985420.0, "step": 23000 }, { "entropy": 6.037393236160279, "epoch": 2.299595141700405, "grad_norm": 1.1640625, "learning_rate": 0.00044737223402491574, "loss": 5.6456, "mean_token_accuracy": 0.1764036923646927, "num_tokens": 44995622.0, "step": 23005 }, { "entropy": 6.055285406112671, "epoch": 2.3000949667616335, "grad_norm": 1.2265625, "learning_rate": 0.00044734929365715685, "loss": 5.6896, "mean_token_accuracy": 0.18102693259716035, "num_tokens": 45006017.0, "step": 23010 }, { "entropy": 6.092122554779053, "epoch": 2.3005947918228618, "grad_norm": 1.2578125, "learning_rate": 0.00044732634895313424, "loss": 5.6673, "mean_token_accuracy": 0.172272028028965, "num_tokens": 45017024.0, "step": 23015 }, { "entropy": 6.077941942214966, "epoch": 2.3010946168840904, "grad_norm": 1.1171875, "learning_rate": 0.000447303399913425, "loss": 5.6595, "mean_token_accuracy": 0.1731354206800461, "num_tokens": 45026384.0, "step": 23020 }, { "entropy": 5.968791818618774, "epoch": 2.301594441945319, "grad_norm": 1.1484375, "learning_rate": 0.00044728044653860653, "loss": 5.5623, "mean_token_accuracy": 0.19222511500120162, "num_tokens": 45037144.0, "step": 23025 }, { "entropy": 5.995727682113648, "epoch": 2.302094267006548, "grad_norm": 1.0625, "learning_rate": 0.0004472574888292564, "loss": 5.6928, "mean_token_accuracy": 0.171397802233696, "num_tokens": 45048272.0, "step": 23030 }, { "entropy": 6.069711589813233, "epoch": 2.302594092067776, "grad_norm": 1.234375, "learning_rate": 0.0004472345267859521, "loss": 5.6627, "mean_token_accuracy": 0.17340897619724274, "num_tokens": 45057799.0, "step": 23035 }, { "entropy": 6.030992460250855, "epoch": 2.303093917129005, "grad_norm": 1.25, "learning_rate": 0.0004472115604092715, "loss": 5.6782, "mean_token_accuracy": 0.1706493079662323, "num_tokens": 45066786.0, "step": 23040 }, { "entropy": 6.05184383392334, "epoch": 2.3035937421902335, "grad_norm": 1.2265625, "learning_rate": 0.00044718858969979236, "loss": 5.6698, "mean_token_accuracy": 0.1775143101811409, "num_tokens": 45075425.0, "step": 23045 }, { "entropy": 6.152289581298828, "epoch": 2.3040935672514617, "grad_norm": 1.1015625, "learning_rate": 0.00044716561465809256, "loss": 5.7653, "mean_token_accuracy": 0.17674290537834167, "num_tokens": 45085470.0, "step": 23050 }, { "entropy": 6.186959457397461, "epoch": 2.3045933923126904, "grad_norm": 1.1640625, "learning_rate": 0.00044714263528475024, "loss": 5.9183, "mean_token_accuracy": 0.16066047847270964, "num_tokens": 45096093.0, "step": 23055 }, { "entropy": 6.104692220687866, "epoch": 2.305093217373919, "grad_norm": 1.28125, "learning_rate": 0.00044711965158034345, "loss": 5.7125, "mean_token_accuracy": 0.16941499561071396, "num_tokens": 45106031.0, "step": 23060 }, { "entropy": 6.093301486968994, "epoch": 2.305593042435148, "grad_norm": 1.21875, "learning_rate": 0.0004470966635454506, "loss": 5.6382, "mean_token_accuracy": 0.18020707964897156, "num_tokens": 45116211.0, "step": 23065 }, { "entropy": 6.026928949356079, "epoch": 2.306092867496376, "grad_norm": 1.1171875, "learning_rate": 0.0004470736711806499, "loss": 5.6904, "mean_token_accuracy": 0.1716480165719986, "num_tokens": 45126232.0, "step": 23070 }, { "entropy": 6.075389432907104, "epoch": 2.306592692557605, "grad_norm": 1.1171875, "learning_rate": 0.00044705067448651996, "loss": 5.5846, "mean_token_accuracy": 0.18015961050987245, "num_tokens": 45136388.0, "step": 23075 }, { "entropy": 6.026543712615966, "epoch": 2.3070925176188335, "grad_norm": 1.1640625, "learning_rate": 0.0004470276734636393, "loss": 5.6703, "mean_token_accuracy": 0.1806821808218956, "num_tokens": 45145569.0, "step": 23080 }, { "entropy": 5.934084463119507, "epoch": 2.3075923426800617, "grad_norm": 1.09375, "learning_rate": 0.00044700466811258666, "loss": 5.6094, "mean_token_accuracy": 0.18117471784353256, "num_tokens": 45155172.0, "step": 23085 }, { "entropy": 6.014734601974487, "epoch": 2.3080921677412904, "grad_norm": 1.3203125, "learning_rate": 0.0004469816584339408, "loss": 5.5554, "mean_token_accuracy": 0.1887346997857094, "num_tokens": 45164537.0, "step": 23090 }, { "entropy": 6.095815229415893, "epoch": 2.308591992802519, "grad_norm": 1.2890625, "learning_rate": 0.00044695864442828066, "loss": 5.7353, "mean_token_accuracy": 0.1704954594373703, "num_tokens": 45174031.0, "step": 23095 }, { "entropy": 5.985543203353882, "epoch": 2.309091817863748, "grad_norm": 1.2109375, "learning_rate": 0.00044693562609618534, "loss": 5.6071, "mean_token_accuracy": 0.17279779314994811, "num_tokens": 45183211.0, "step": 23100 }, { "entropy": 6.0615095615386965, "epoch": 2.309591642924976, "grad_norm": 1.234375, "learning_rate": 0.0004469126034382339, "loss": 5.7108, "mean_token_accuracy": 0.170160610973835, "num_tokens": 45193619.0, "step": 23105 }, { "entropy": 6.056368446350097, "epoch": 2.310091467986205, "grad_norm": 1.109375, "learning_rate": 0.0004468895764550055, "loss": 5.5899, "mean_token_accuracy": 0.18198743015527724, "num_tokens": 45203541.0, "step": 23110 }, { "entropy": 6.058747911453247, "epoch": 2.3105912930474335, "grad_norm": 1.1640625, "learning_rate": 0.0004468665451470797, "loss": 5.7159, "mean_token_accuracy": 0.1720944419503212, "num_tokens": 45213231.0, "step": 23115 }, { "entropy": 6.123208856582641, "epoch": 2.3110911181086617, "grad_norm": 1.1640625, "learning_rate": 0.0004468435095150358, "loss": 5.7044, "mean_token_accuracy": 0.1635023534297943, "num_tokens": 45222585.0, "step": 23120 }, { "entropy": 6.071886301040649, "epoch": 2.3115909431698904, "grad_norm": 1.125, "learning_rate": 0.00044682046955945345, "loss": 5.7072, "mean_token_accuracy": 0.1736617550253868, "num_tokens": 45233068.0, "step": 23125 }, { "entropy": 6.020181560516358, "epoch": 2.312090768231119, "grad_norm": 1.234375, "learning_rate": 0.0004467974252809123, "loss": 5.6345, "mean_token_accuracy": 0.1786353513598442, "num_tokens": 45242643.0, "step": 23130 }, { "entropy": 6.0808085918426515, "epoch": 2.312590593292348, "grad_norm": 1.1796875, "learning_rate": 0.00044677437667999204, "loss": 5.6348, "mean_token_accuracy": 0.1746222198009491, "num_tokens": 45251870.0, "step": 23135 }, { "entropy": 6.0341767311096195, "epoch": 2.313090418353576, "grad_norm": 1.1171875, "learning_rate": 0.00044675132375727273, "loss": 5.6276, "mean_token_accuracy": 0.17861589342355727, "num_tokens": 45261209.0, "step": 23140 }, { "entropy": 6.052816724777221, "epoch": 2.313590243414805, "grad_norm": 1.2265625, "learning_rate": 0.0004467282665133343, "loss": 5.6929, "mean_token_accuracy": 0.17612568736076356, "num_tokens": 45270339.0, "step": 23145 }, { "entropy": 6.131492567062378, "epoch": 2.3140900684760335, "grad_norm": 1.15625, "learning_rate": 0.0004467052049487569, "loss": 5.7529, "mean_token_accuracy": 0.1654794007539749, "num_tokens": 45281107.0, "step": 23150 }, { "entropy": 6.074229717254639, "epoch": 2.3145898935372617, "grad_norm": 1.15625, "learning_rate": 0.00044668213906412074, "loss": 5.5786, "mean_token_accuracy": 0.17920369952917098, "num_tokens": 45289615.0, "step": 23155 }, { "entropy": 5.990182018280029, "epoch": 2.3150897185984904, "grad_norm": 1.0859375, "learning_rate": 0.00044665906886000604, "loss": 5.581, "mean_token_accuracy": 0.18555006384849548, "num_tokens": 45299768.0, "step": 23160 }, { "entropy": 5.974020051956177, "epoch": 2.315589543659719, "grad_norm": 1.1484375, "learning_rate": 0.00044663599433699346, "loss": 5.5439, "mean_token_accuracy": 0.18630737364292144, "num_tokens": 45310407.0, "step": 23165 }, { "entropy": 6.058645486831665, "epoch": 2.316089368720948, "grad_norm": 1.2265625, "learning_rate": 0.00044661291549566337, "loss": 5.6139, "mean_token_accuracy": 0.1766300991177559, "num_tokens": 45319993.0, "step": 23170 }, { "entropy": 6.014542484283448, "epoch": 2.316589193782176, "grad_norm": 1.15625, "learning_rate": 0.0004465898323365965, "loss": 5.6885, "mean_token_accuracy": 0.1731710433959961, "num_tokens": 45329598.0, "step": 23175 }, { "entropy": 6.0917784690856935, "epoch": 2.317089018843405, "grad_norm": 1.2890625, "learning_rate": 0.0004465667448603736, "loss": 5.6617, "mean_token_accuracy": 0.17391647398471832, "num_tokens": 45339630.0, "step": 23180 }, { "entropy": 6.013296794891358, "epoch": 2.3175888439046335, "grad_norm": 1.078125, "learning_rate": 0.00044654365306757553, "loss": 5.5955, "mean_token_accuracy": 0.175054694712162, "num_tokens": 45349441.0, "step": 23185 }, { "entropy": 6.096804523468018, "epoch": 2.3180886689658617, "grad_norm": 1.125, "learning_rate": 0.00044652055695878335, "loss": 5.7745, "mean_token_accuracy": 0.1690856099128723, "num_tokens": 45359858.0, "step": 23190 }, { "entropy": 6.104031658172607, "epoch": 2.3185884940270904, "grad_norm": 1.2265625, "learning_rate": 0.00044649745653457806, "loss": 5.6602, "mean_token_accuracy": 0.17211828529834747, "num_tokens": 45369100.0, "step": 23195 }, { "entropy": 6.068248701095581, "epoch": 2.319088319088319, "grad_norm": 1.15625, "learning_rate": 0.00044647435179554087, "loss": 5.6326, "mean_token_accuracy": 0.17745068818330764, "num_tokens": 45380514.0, "step": 23200 }, { "entropy": 6.068368721008301, "epoch": 2.319588144149548, "grad_norm": 1.2265625, "learning_rate": 0.0004464512427422531, "loss": 5.6981, "mean_token_accuracy": 0.16932753324508668, "num_tokens": 45390689.0, "step": 23205 }, { "entropy": 6.096634387969971, "epoch": 2.320087969210776, "grad_norm": 1.2109375, "learning_rate": 0.00044642812937529624, "loss": 5.673, "mean_token_accuracy": 0.16878530085086824, "num_tokens": 45400436.0, "step": 23210 }, { "entropy": 6.123605108261108, "epoch": 2.320587794272005, "grad_norm": 1.234375, "learning_rate": 0.0004464050116952517, "loss": 5.7407, "mean_token_accuracy": 0.17254570126533508, "num_tokens": 45409906.0, "step": 23215 }, { "entropy": 6.017495632171631, "epoch": 2.3210876193332335, "grad_norm": 1.1796875, "learning_rate": 0.00044638188970270114, "loss": 5.684, "mean_token_accuracy": 0.17094576358795166, "num_tokens": 45419869.0, "step": 23220 }, { "entropy": 6.0266517162322994, "epoch": 2.3215874443944617, "grad_norm": 1.2109375, "learning_rate": 0.00044635876339822647, "loss": 5.6002, "mean_token_accuracy": 0.18555708527565, "num_tokens": 45430630.0, "step": 23225 }, { "entropy": 6.059256553649902, "epoch": 2.3220872694556904, "grad_norm": 1.1484375, "learning_rate": 0.00044633563278240933, "loss": 5.5225, "mean_token_accuracy": 0.18503057062625886, "num_tokens": 45439765.0, "step": 23230 }, { "entropy": 6.136633014678955, "epoch": 2.322587094516919, "grad_norm": 1.296875, "learning_rate": 0.00044631249785583173, "loss": 5.6563, "mean_token_accuracy": 0.17462363988161086, "num_tokens": 45448619.0, "step": 23235 }, { "entropy": 6.079303026199341, "epoch": 2.323086919578148, "grad_norm": 1.1953125, "learning_rate": 0.0004462893586190758, "loss": 5.654, "mean_token_accuracy": 0.1770624950528145, "num_tokens": 45456874.0, "step": 23240 }, { "entropy": 6.0508819103240965, "epoch": 2.323586744639376, "grad_norm": 1.1796875, "learning_rate": 0.00044626621507272364, "loss": 5.7436, "mean_token_accuracy": 0.17352414429187774, "num_tokens": 45465971.0, "step": 23245 }, { "entropy": 6.079803848266602, "epoch": 2.324086569700605, "grad_norm": 1.2109375, "learning_rate": 0.00044624306721735763, "loss": 5.6945, "mean_token_accuracy": 0.16615247577428818, "num_tokens": 45475802.0, "step": 23250 }, { "entropy": 6.091593933105469, "epoch": 2.3245863947618335, "grad_norm": 1.1953125, "learning_rate": 0.00044621991505356014, "loss": 5.6665, "mean_token_accuracy": 0.18154877573251724, "num_tokens": 45486270.0, "step": 23255 }, { "entropy": 6.0929179191589355, "epoch": 2.3250862198230617, "grad_norm": 1.09375, "learning_rate": 0.00044619675858191353, "loss": 5.7012, "mean_token_accuracy": 0.1756749764084816, "num_tokens": 45495936.0, "step": 23260 }, { "entropy": 5.966797542572022, "epoch": 2.3255860448842904, "grad_norm": 1.2109375, "learning_rate": 0.0004461735978030006, "loss": 5.4976, "mean_token_accuracy": 0.19037146121263504, "num_tokens": 45505719.0, "step": 23265 }, { "entropy": 6.058510208129883, "epoch": 2.326085869945519, "grad_norm": 1.265625, "learning_rate": 0.00044615043271740404, "loss": 5.7013, "mean_token_accuracy": 0.17487429082393646, "num_tokens": 45515322.0, "step": 23270 }, { "entropy": 6.03613543510437, "epoch": 2.326585695006748, "grad_norm": 1.2734375, "learning_rate": 0.0004461272633257065, "loss": 5.5906, "mean_token_accuracy": 0.18316141963005067, "num_tokens": 45524763.0, "step": 23275 }, { "entropy": 6.043449211120605, "epoch": 2.327085520067976, "grad_norm": 1.1796875, "learning_rate": 0.0004461040896284912, "loss": 5.6245, "mean_token_accuracy": 0.17957112193107605, "num_tokens": 45533140.0, "step": 23280 }, { "entropy": 6.0959900379180905, "epoch": 2.327585345129205, "grad_norm": 2.140625, "learning_rate": 0.000446080911626341, "loss": 5.6452, "mean_token_accuracy": 0.17920673862099648, "num_tokens": 45543162.0, "step": 23285 }, { "entropy": 6.095486307144165, "epoch": 2.3280851701904335, "grad_norm": 1.1484375, "learning_rate": 0.0004460577293198391, "loss": 5.7887, "mean_token_accuracy": 0.16426983773708342, "num_tokens": 45552863.0, "step": 23290 }, { "entropy": 6.0184712409973145, "epoch": 2.3285849952516617, "grad_norm": 1.140625, "learning_rate": 0.00044603454270956863, "loss": 5.6654, "mean_token_accuracy": 0.1710359513759613, "num_tokens": 45562177.0, "step": 23295 }, { "entropy": 6.142314291000366, "epoch": 2.3290848203128904, "grad_norm": 1.546875, "learning_rate": 0.0004460113517961132, "loss": 5.7151, "mean_token_accuracy": 0.17252847254276277, "num_tokens": 45572864.0, "step": 23300 }, { "entropy": 6.1144633293151855, "epoch": 2.329584645374119, "grad_norm": 1.0546875, "learning_rate": 0.0004459881565800561, "loss": 5.723, "mean_token_accuracy": 0.1723456934094429, "num_tokens": 45582778.0, "step": 23305 }, { "entropy": 5.982622575759888, "epoch": 2.330084470435348, "grad_norm": 1.1953125, "learning_rate": 0.0004459649570619809, "loss": 5.5622, "mean_token_accuracy": 0.17738457322120665, "num_tokens": 45591659.0, "step": 23310 }, { "entropy": 6.036458206176758, "epoch": 2.330584295496576, "grad_norm": 1.140625, "learning_rate": 0.0004459417532424715, "loss": 5.8281, "mean_token_accuracy": 0.16232905983924867, "num_tokens": 45602215.0, "step": 23315 }, { "entropy": 6.069948625564575, "epoch": 2.331084120557805, "grad_norm": 1.21875, "learning_rate": 0.0004459185451221116, "loss": 5.64, "mean_token_accuracy": 0.17492918223142623, "num_tokens": 45611680.0, "step": 23320 }, { "entropy": 5.968486595153808, "epoch": 2.3315839456190335, "grad_norm": 1.3671875, "learning_rate": 0.000445895332701485, "loss": 5.5416, "mean_token_accuracy": 0.18527524173259735, "num_tokens": 45621452.0, "step": 23325 }, { "entropy": 6.098551321029663, "epoch": 2.3320837706802617, "grad_norm": 1.109375, "learning_rate": 0.00044587211598117577, "loss": 5.7645, "mean_token_accuracy": 0.17103444188833236, "num_tokens": 45631594.0, "step": 23330 }, { "entropy": 6.060859966278076, "epoch": 2.3325835957414904, "grad_norm": 1.2109375, "learning_rate": 0.00044584889496176815, "loss": 5.6591, "mean_token_accuracy": 0.17607979327440262, "num_tokens": 45642373.0, "step": 23335 }, { "entropy": 6.099746227264404, "epoch": 2.333083420802719, "grad_norm": 1.1484375, "learning_rate": 0.0004458256696438463, "loss": 5.6266, "mean_token_accuracy": 0.17169416546821595, "num_tokens": 45652851.0, "step": 23340 }, { "entropy": 5.88638596534729, "epoch": 2.333583245863948, "grad_norm": 1.2109375, "learning_rate": 0.00044580244002799454, "loss": 5.4824, "mean_token_accuracy": 0.1838074341416359, "num_tokens": 45662638.0, "step": 23345 }, { "entropy": 5.933127212524414, "epoch": 2.334083070925176, "grad_norm": 1.1328125, "learning_rate": 0.0004457792061147973, "loss": 5.5912, "mean_token_accuracy": 0.17635180354118346, "num_tokens": 45672252.0, "step": 23350 }, { "entropy": 6.09796175956726, "epoch": 2.334582895986405, "grad_norm": 1.1484375, "learning_rate": 0.0004457559679048392, "loss": 5.6641, "mean_token_accuracy": 0.17317719757556915, "num_tokens": 45682678.0, "step": 23355 }, { "entropy": 6.093754577636719, "epoch": 2.3350827210476335, "grad_norm": 1.21875, "learning_rate": 0.000445732725398705, "loss": 5.648, "mean_token_accuracy": 0.17362246066331863, "num_tokens": 45692454.0, "step": 23360 }, { "entropy": 6.082568883895874, "epoch": 2.3355825461088617, "grad_norm": 1.484375, "learning_rate": 0.0004457094785969792, "loss": 5.6679, "mean_token_accuracy": 0.1755481705069542, "num_tokens": 45701925.0, "step": 23365 }, { "entropy": 6.051724052429199, "epoch": 2.3360823711700904, "grad_norm": 1.203125, "learning_rate": 0.00044568622750024693, "loss": 5.6876, "mean_token_accuracy": 0.17561267465353012, "num_tokens": 45711217.0, "step": 23370 }, { "entropy": 5.994741582870484, "epoch": 2.336582196231319, "grad_norm": 1.0859375, "learning_rate": 0.0004456629721090931, "loss": 5.6171, "mean_token_accuracy": 0.182993283867836, "num_tokens": 45720651.0, "step": 23375 }, { "entropy": 6.0729694843292235, "epoch": 2.337082021292548, "grad_norm": 1.296875, "learning_rate": 0.0004456397124241028, "loss": 5.7621, "mean_token_accuracy": 0.1713467448949814, "num_tokens": 45730649.0, "step": 23380 }, { "entropy": 6.091461181640625, "epoch": 2.337581846353776, "grad_norm": 1.1171875, "learning_rate": 0.0004456164484458612, "loss": 5.6136, "mean_token_accuracy": 0.18295783400535584, "num_tokens": 45739862.0, "step": 23385 }, { "entropy": 6.056644058227539, "epoch": 2.338081671415005, "grad_norm": 1.1015625, "learning_rate": 0.0004455931801749537, "loss": 5.7024, "mean_token_accuracy": 0.1738718032836914, "num_tokens": 45750710.0, "step": 23390 }, { "entropy": 6.162650728225708, "epoch": 2.3385814964762335, "grad_norm": 1.1640625, "learning_rate": 0.00044556990761196566, "loss": 5.7586, "mean_token_accuracy": 0.16935701668262482, "num_tokens": 45759725.0, "step": 23395 }, { "entropy": 6.1244056224823, "epoch": 2.3390813215374617, "grad_norm": 1.140625, "learning_rate": 0.00044554663075748266, "loss": 5.7645, "mean_token_accuracy": 0.1709905281662941, "num_tokens": 45769143.0, "step": 23400 }, { "entropy": 6.073747158050537, "epoch": 2.3395811465986904, "grad_norm": 1.1015625, "learning_rate": 0.0004455233496120903, "loss": 5.7238, "mean_token_accuracy": 0.1674390822649002, "num_tokens": 45779505.0, "step": 23405 }, { "entropy": 6.1019505023956295, "epoch": 2.340080971659919, "grad_norm": 1.2734375, "learning_rate": 0.0004455000641763743, "loss": 5.7306, "mean_token_accuracy": 0.16764169186353683, "num_tokens": 45789337.0, "step": 23410 }, { "entropy": 6.039696836471558, "epoch": 2.340580796721148, "grad_norm": 1.3046875, "learning_rate": 0.00044547677445092064, "loss": 5.6958, "mean_token_accuracy": 0.17590183168649673, "num_tokens": 45799385.0, "step": 23415 }, { "entropy": 6.061013412475586, "epoch": 2.341080621782376, "grad_norm": 1.1796875, "learning_rate": 0.00044545348043631525, "loss": 5.6846, "mean_token_accuracy": 0.16533951908349992, "num_tokens": 45810918.0, "step": 23420 }, { "entropy": 6.11961555480957, "epoch": 2.341580446843605, "grad_norm": 1.109375, "learning_rate": 0.00044543018213314404, "loss": 5.6964, "mean_token_accuracy": 0.17520616203546524, "num_tokens": 45820910.0, "step": 23425 }, { "entropy": 6.007542085647583, "epoch": 2.3420802719048335, "grad_norm": 1.3203125, "learning_rate": 0.00044540687954199335, "loss": 5.5858, "mean_token_accuracy": 0.17503385245800018, "num_tokens": 45830709.0, "step": 23430 }, { "entropy": 6.029560852050781, "epoch": 2.3425800969660617, "grad_norm": 1.203125, "learning_rate": 0.00044538357266344936, "loss": 5.6114, "mean_token_accuracy": 0.17776171267032623, "num_tokens": 45840244.0, "step": 23435 }, { "entropy": 6.03725118637085, "epoch": 2.3430799220272904, "grad_norm": 1.1328125, "learning_rate": 0.0004453602614980986, "loss": 5.6817, "mean_token_accuracy": 0.17812149077653885, "num_tokens": 45849643.0, "step": 23440 }, { "entropy": 6.149209594726562, "epoch": 2.343579747088519, "grad_norm": 1.296875, "learning_rate": 0.0004453369460465274, "loss": 5.7045, "mean_token_accuracy": 0.17016686499118805, "num_tokens": 45858689.0, "step": 23445 }, { "entropy": 6.131392526626587, "epoch": 2.344079572149748, "grad_norm": 1.1171875, "learning_rate": 0.0004453136263093225, "loss": 5.7222, "mean_token_accuracy": 0.17099529057741164, "num_tokens": 45869538.0, "step": 23450 }, { "entropy": 6.103089237213135, "epoch": 2.344579397210976, "grad_norm": 1.2265625, "learning_rate": 0.0004452903022870707, "loss": 5.7337, "mean_token_accuracy": 0.17047263830900192, "num_tokens": 45878248.0, "step": 23455 }, { "entropy": 6.012277889251709, "epoch": 2.3450792222722048, "grad_norm": 1.1796875, "learning_rate": 0.0004452669739803586, "loss": 5.6186, "mean_token_accuracy": 0.17705504447221757, "num_tokens": 45888682.0, "step": 23460 }, { "entropy": 6.064145803451538, "epoch": 2.3455790473334335, "grad_norm": 1.1015625, "learning_rate": 0.0004452436413897733, "loss": 5.6775, "mean_token_accuracy": 0.1767082393169403, "num_tokens": 45898690.0, "step": 23465 }, { "entropy": 6.054799509048462, "epoch": 2.3460788723946617, "grad_norm": 1.09375, "learning_rate": 0.0004452203045159018, "loss": 5.6442, "mean_token_accuracy": 0.17071681171655656, "num_tokens": 45907579.0, "step": 23470 }, { "entropy": 5.966411495208741, "epoch": 2.3465786974558904, "grad_norm": 1.0546875, "learning_rate": 0.0004451969633593312, "loss": 5.5936, "mean_token_accuracy": 0.1785627767443657, "num_tokens": 45917065.0, "step": 23475 }, { "entropy": 6.0560143947601315, "epoch": 2.347078522517119, "grad_norm": 1.2421875, "learning_rate": 0.00044517361792064883, "loss": 5.7529, "mean_token_accuracy": 0.16877295225858688, "num_tokens": 45927427.0, "step": 23480 }, { "entropy": 6.080617952346802, "epoch": 2.347578347578348, "grad_norm": 1.1953125, "learning_rate": 0.00044515026820044195, "loss": 5.5475, "mean_token_accuracy": 0.1825200453400612, "num_tokens": 45937453.0, "step": 23485 }, { "entropy": 5.972042369842529, "epoch": 2.348078172639576, "grad_norm": 1.1796875, "learning_rate": 0.0004451269141992982, "loss": 5.5936, "mean_token_accuracy": 0.18557309359312057, "num_tokens": 45947285.0, "step": 23490 }, { "entropy": 6.111046600341797, "epoch": 2.3485779977008048, "grad_norm": 1.21875, "learning_rate": 0.00044510355591780503, "loss": 5.7466, "mean_token_accuracy": 0.1698734149336815, "num_tokens": 45956413.0, "step": 23495 }, { "entropy": 6.082316207885742, "epoch": 2.3490778227620335, "grad_norm": 1.1171875, "learning_rate": 0.0004450801933565502, "loss": 5.6844, "mean_token_accuracy": 0.1754311889410019, "num_tokens": 45967243.0, "step": 23500 }, { "entropy": 5.981764507293701, "epoch": 2.3495776478232617, "grad_norm": 1.1875, "learning_rate": 0.0004450568265161214, "loss": 5.6382, "mean_token_accuracy": 0.17779497802257538, "num_tokens": 45976837.0, "step": 23505 }, { "entropy": 6.030059957504273, "epoch": 2.3500774728844904, "grad_norm": 1.1171875, "learning_rate": 0.00044503345539710664, "loss": 5.6904, "mean_token_accuracy": 0.17372239232063294, "num_tokens": 45986498.0, "step": 23510 }, { "entropy": 6.10572829246521, "epoch": 2.350577297945719, "grad_norm": 1.34375, "learning_rate": 0.0004450100800000939, "loss": 5.6632, "mean_token_accuracy": 0.18146397918462753, "num_tokens": 45995490.0, "step": 23515 }, { "entropy": 6.042029571533203, "epoch": 2.3510771230069474, "grad_norm": 1.15625, "learning_rate": 0.0004449867003256713, "loss": 5.5999, "mean_token_accuracy": 0.18052243888378144, "num_tokens": 46004765.0, "step": 23520 }, { "entropy": 6.018957185745239, "epoch": 2.351576948068176, "grad_norm": 1.1875, "learning_rate": 0.00044496331637442697, "loss": 5.675, "mean_token_accuracy": 0.1732357159256935, "num_tokens": 46014666.0, "step": 23525 }, { "entropy": 5.996883296966553, "epoch": 2.3520767731294048, "grad_norm": 1.3203125, "learning_rate": 0.0004449399281469495, "loss": 5.6008, "mean_token_accuracy": 0.17808209955692292, "num_tokens": 46024104.0, "step": 23530 }, { "entropy": 5.9809380054473875, "epoch": 2.3525765981906335, "grad_norm": 1.1640625, "learning_rate": 0.00044491653564382704, "loss": 5.5779, "mean_token_accuracy": 0.18037257641553878, "num_tokens": 46034709.0, "step": 23535 }, { "entropy": 6.026202058792114, "epoch": 2.3530764232518617, "grad_norm": 1.1484375, "learning_rate": 0.0004448931388656483, "loss": 5.7001, "mean_token_accuracy": 0.172713603079319, "num_tokens": 46044404.0, "step": 23540 }, { "entropy": 6.021583938598633, "epoch": 2.3535762483130904, "grad_norm": 1.109375, "learning_rate": 0.00044486973781300196, "loss": 5.6373, "mean_token_accuracy": 0.17765775918960572, "num_tokens": 46054223.0, "step": 23545 }, { "entropy": 6.06899471282959, "epoch": 2.354076073374319, "grad_norm": 1.171875, "learning_rate": 0.00044484633248647665, "loss": 5.6425, "mean_token_accuracy": 0.1729290023446083, "num_tokens": 46063491.0, "step": 23550 }, { "entropy": 6.041161394119262, "epoch": 2.3545758984355474, "grad_norm": 1.1484375, "learning_rate": 0.00044482292288666134, "loss": 5.6534, "mean_token_accuracy": 0.17445360124111176, "num_tokens": 46072552.0, "step": 23555 }, { "entropy": 5.917170667648316, "epoch": 2.355075723496776, "grad_norm": 1.1953125, "learning_rate": 0.000444799509014145, "loss": 5.5246, "mean_token_accuracy": 0.19003575593233107, "num_tokens": 46083249.0, "step": 23560 }, { "entropy": 6.080554723739624, "epoch": 2.3555755485580048, "grad_norm": 1.21875, "learning_rate": 0.0004447760908695167, "loss": 5.7154, "mean_token_accuracy": 0.17288369536399842, "num_tokens": 46091842.0, "step": 23565 }, { "entropy": 5.939648151397705, "epoch": 2.356075373619233, "grad_norm": 1.2109375, "learning_rate": 0.00044475266845336566, "loss": 5.5561, "mean_token_accuracy": 0.18651992529630662, "num_tokens": 46101453.0, "step": 23570 }, { "entropy": 6.119129037857055, "epoch": 2.3565751986804617, "grad_norm": 1.171875, "learning_rate": 0.0004447292417662811, "loss": 5.8015, "mean_token_accuracy": 0.1650396004319191, "num_tokens": 46110969.0, "step": 23575 }, { "entropy": 6.068396186828613, "epoch": 2.3570750237416904, "grad_norm": 1.2265625, "learning_rate": 0.0004447058108088525, "loss": 5.5311, "mean_token_accuracy": 0.19118430018424987, "num_tokens": 46120846.0, "step": 23580 }, { "entropy": 6.022601556777954, "epoch": 2.357574848802919, "grad_norm": 1.1796875, "learning_rate": 0.00044468237558166945, "loss": 5.5581, "mean_token_accuracy": 0.18963632434606553, "num_tokens": 46130039.0, "step": 23585 }, { "entropy": 5.987316131591797, "epoch": 2.3580746738641474, "grad_norm": 1.1796875, "learning_rate": 0.00044465893608532146, "loss": 5.5913, "mean_token_accuracy": 0.18409784883260727, "num_tokens": 46139503.0, "step": 23590 }, { "entropy": 6.0680365562438965, "epoch": 2.358574498925376, "grad_norm": 1.1484375, "learning_rate": 0.00044463549232039824, "loss": 5.664, "mean_token_accuracy": 0.17304683476686478, "num_tokens": 46148247.0, "step": 23595 }, { "entropy": 6.058181953430176, "epoch": 2.3590743239866048, "grad_norm": 1.1875, "learning_rate": 0.0004446120442874898, "loss": 5.6648, "mean_token_accuracy": 0.18391262292861937, "num_tokens": 46157233.0, "step": 23600 }, { "entropy": 6.013462877273559, "epoch": 2.359574149047833, "grad_norm": 1.2265625, "learning_rate": 0.0004445885919871859, "loss": 5.6363, "mean_token_accuracy": 0.17553962469100953, "num_tokens": 46166621.0, "step": 23605 }, { "entropy": 6.07929220199585, "epoch": 2.3600739741090617, "grad_norm": 1.1796875, "learning_rate": 0.0004445651354200766, "loss": 5.6941, "mean_token_accuracy": 0.17370732128620148, "num_tokens": 46176142.0, "step": 23610 }, { "entropy": 6.006615829467774, "epoch": 2.3605737991702904, "grad_norm": 1.3046875, "learning_rate": 0.00044454167458675225, "loss": 5.5535, "mean_token_accuracy": 0.17931206226348878, "num_tokens": 46185506.0, "step": 23615 }, { "entropy": 6.030964517593384, "epoch": 2.361073624231519, "grad_norm": 1.0546875, "learning_rate": 0.00044451820948780295, "loss": 5.6805, "mean_token_accuracy": 0.1785634234547615, "num_tokens": 46195351.0, "step": 23620 }, { "entropy": 6.03352370262146, "epoch": 2.3615734492927474, "grad_norm": 1.140625, "learning_rate": 0.00044449474012381903, "loss": 5.6557, "mean_token_accuracy": 0.1691276401281357, "num_tokens": 46205431.0, "step": 23625 }, { "entropy": 6.092788600921631, "epoch": 2.362073274353976, "grad_norm": 1.2109375, "learning_rate": 0.00044447126649539123, "loss": 5.6283, "mean_token_accuracy": 0.17407059222459792, "num_tokens": 46214731.0, "step": 23630 }, { "entropy": 6.021127605438233, "epoch": 2.3625730994152048, "grad_norm": 1.140625, "learning_rate": 0.0004444477886031098, "loss": 5.6286, "mean_token_accuracy": 0.18202770352363587, "num_tokens": 46223951.0, "step": 23635 }, { "entropy": 6.059401559829712, "epoch": 2.363072924476433, "grad_norm": 1.0859375, "learning_rate": 0.0004444243064475657, "loss": 5.7296, "mean_token_accuracy": 0.16963689774274826, "num_tokens": 46234458.0, "step": 23640 }, { "entropy": 6.078516101837158, "epoch": 2.3635727495376617, "grad_norm": 1.0234375, "learning_rate": 0.0004444008200293496, "loss": 5.7014, "mean_token_accuracy": 0.1743922770023346, "num_tokens": 46244549.0, "step": 23645 }, { "entropy": 6.060221099853516, "epoch": 2.3640725745988904, "grad_norm": 1.171875, "learning_rate": 0.00044437732934905256, "loss": 5.6601, "mean_token_accuracy": 0.17803427428007126, "num_tokens": 46254360.0, "step": 23650 }, { "entropy": 6.0557066917419435, "epoch": 2.364572399660119, "grad_norm": 1.125, "learning_rate": 0.0004443538344072654, "loss": 5.6134, "mean_token_accuracy": 0.17843423932790756, "num_tokens": 46264153.0, "step": 23655 }, { "entropy": 6.080674695968628, "epoch": 2.3650722247213474, "grad_norm": 1.2890625, "learning_rate": 0.00044433033520457937, "loss": 5.5948, "mean_token_accuracy": 0.17616735696792601, "num_tokens": 46272797.0, "step": 23660 }, { "entropy": 6.049421262741089, "epoch": 2.365572049782576, "grad_norm": 1.578125, "learning_rate": 0.0004443068317415857, "loss": 5.6115, "mean_token_accuracy": 0.17518768459558487, "num_tokens": 46282515.0, "step": 23665 }, { "entropy": 6.059255838394165, "epoch": 2.3660718748438048, "grad_norm": 1.2734375, "learning_rate": 0.00044428332401887566, "loss": 5.7291, "mean_token_accuracy": 0.1694168046116829, "num_tokens": 46292682.0, "step": 23670 }, { "entropy": 5.997803592681885, "epoch": 2.366571699905033, "grad_norm": 1.2265625, "learning_rate": 0.0004442598120370408, "loss": 5.5806, "mean_token_accuracy": 0.18882497996091843, "num_tokens": 46302598.0, "step": 23675 }, { "entropy": 6.025753688812256, "epoch": 2.3670715249662617, "grad_norm": 1.1796875, "learning_rate": 0.0004442362957966726, "loss": 5.6006, "mean_token_accuracy": 0.18503525257110595, "num_tokens": 46313015.0, "step": 23680 }, { "entropy": 5.988218116760254, "epoch": 2.3675713500274904, "grad_norm": 1.09375, "learning_rate": 0.00044421277529836276, "loss": 5.6545, "mean_token_accuracy": 0.17723398208618163, "num_tokens": 46322450.0, "step": 23685 }, { "entropy": 6.058750104904175, "epoch": 2.368071175088719, "grad_norm": 1.0546875, "learning_rate": 0.0004441892505427031, "loss": 5.6378, "mean_token_accuracy": 0.17618710398674012, "num_tokens": 46332357.0, "step": 23690 }, { "entropy": 6.118291139602661, "epoch": 2.3685710001499474, "grad_norm": 1.21875, "learning_rate": 0.0004441657215302853, "loss": 5.6914, "mean_token_accuracy": 0.17251085937023164, "num_tokens": 46341805.0, "step": 23695 }, { "entropy": 6.060851812362671, "epoch": 2.369070825211176, "grad_norm": 1.171875, "learning_rate": 0.00044414218826170155, "loss": 5.6482, "mean_token_accuracy": 0.1757635071873665, "num_tokens": 46352814.0, "step": 23700 }, { "entropy": 6.0773509502410885, "epoch": 2.3695706502724048, "grad_norm": 1.3046875, "learning_rate": 0.0004441186507375439, "loss": 5.7075, "mean_token_accuracy": 0.1712249204516411, "num_tokens": 46362968.0, "step": 23705 }, { "entropy": 6.0236259460449215, "epoch": 2.370070475333633, "grad_norm": 1.0859375, "learning_rate": 0.00044409510895840446, "loss": 5.6867, "mean_token_accuracy": 0.17789150401949883, "num_tokens": 46373379.0, "step": 23710 }, { "entropy": 5.993005800247192, "epoch": 2.3705703003948617, "grad_norm": 1.3046875, "learning_rate": 0.00044407156292487553, "loss": 5.5718, "mean_token_accuracy": 0.18568568974733352, "num_tokens": 46382788.0, "step": 23715 }, { "entropy": 6.117120409011841, "epoch": 2.3710701254560904, "grad_norm": 1.0859375, "learning_rate": 0.0004440480126375497, "loss": 5.691, "mean_token_accuracy": 0.17374709397554397, "num_tokens": 46392984.0, "step": 23720 }, { "entropy": 6.030602884292603, "epoch": 2.371569950517319, "grad_norm": 1.0234375, "learning_rate": 0.0004440244580970193, "loss": 5.5867, "mean_token_accuracy": 0.17945046126842498, "num_tokens": 46403387.0, "step": 23725 }, { "entropy": 5.985666131973266, "epoch": 2.3720697755785474, "grad_norm": 1.2578125, "learning_rate": 0.00044400089930387703, "loss": 5.5932, "mean_token_accuracy": 0.17470182627439498, "num_tokens": 46413010.0, "step": 23730 }, { "entropy": 6.025519323348999, "epoch": 2.372569600639776, "grad_norm": 1.0859375, "learning_rate": 0.00044397733625871566, "loss": 5.6714, "mean_token_accuracy": 0.17632315158843995, "num_tokens": 46423790.0, "step": 23735 }, { "entropy": 6.1154101371765135, "epoch": 2.3730694257010048, "grad_norm": 1.2265625, "learning_rate": 0.00044395376896212805, "loss": 5.6591, "mean_token_accuracy": 0.1698581576347351, "num_tokens": 46434210.0, "step": 23740 }, { "entropy": 5.984733247756958, "epoch": 2.373569250762233, "grad_norm": 1.203125, "learning_rate": 0.00044393019741470696, "loss": 5.5404, "mean_token_accuracy": 0.1842620477080345, "num_tokens": 46443747.0, "step": 23745 }, { "entropy": 5.987794208526611, "epoch": 2.3740690758234617, "grad_norm": 1.234375, "learning_rate": 0.0004439066216170456, "loss": 5.5518, "mean_token_accuracy": 0.18251242190599443, "num_tokens": 46453829.0, "step": 23750 }, { "entropy": 6.052422761917114, "epoch": 2.3745689008846904, "grad_norm": 1.1328125, "learning_rate": 0.00044388304156973713, "loss": 5.7057, "mean_token_accuracy": 0.17490700632333755, "num_tokens": 46463406.0, "step": 23755 }, { "entropy": 6.024632310867309, "epoch": 2.375068725945919, "grad_norm": 1.171875, "learning_rate": 0.00044385945727337477, "loss": 5.643, "mean_token_accuracy": 0.1769236743450165, "num_tokens": 46473374.0, "step": 23760 }, { "entropy": 6.041012239456177, "epoch": 2.3755685510071474, "grad_norm": 1.1171875, "learning_rate": 0.000443835868728552, "loss": 5.6387, "mean_token_accuracy": 0.17929480820894242, "num_tokens": 46482881.0, "step": 23765 }, { "entropy": 6.013991594314575, "epoch": 2.376068376068376, "grad_norm": 1.1328125, "learning_rate": 0.0004438122759358621, "loss": 5.6557, "mean_token_accuracy": 0.17798885852098464, "num_tokens": 46493040.0, "step": 23770 }, { "entropy": 6.064805316925049, "epoch": 2.3765682011296048, "grad_norm": 1.09375, "learning_rate": 0.00044378867889589884, "loss": 5.6473, "mean_token_accuracy": 0.17287222743034364, "num_tokens": 46503243.0, "step": 23775 }, { "entropy": 6.027049732208252, "epoch": 2.377068026190833, "grad_norm": 1.1640625, "learning_rate": 0.0004437650776092558, "loss": 5.5755, "mean_token_accuracy": 0.177457694709301, "num_tokens": 46512864.0, "step": 23780 }, { "entropy": 6.018921613693237, "epoch": 2.3775678512520617, "grad_norm": 1.1640625, "learning_rate": 0.00044374147207652695, "loss": 5.6664, "mean_token_accuracy": 0.184862320125103, "num_tokens": 46522404.0, "step": 23785 }, { "entropy": 5.979655027389526, "epoch": 2.3780676763132904, "grad_norm": 1.2109375, "learning_rate": 0.000443717862298306, "loss": 5.6395, "mean_token_accuracy": 0.1699163407087326, "num_tokens": 46532235.0, "step": 23790 }, { "entropy": 6.023217296600341, "epoch": 2.378567501374519, "grad_norm": 1.2265625, "learning_rate": 0.00044369424827518704, "loss": 5.6075, "mean_token_accuracy": 0.17641149312257767, "num_tokens": 46542337.0, "step": 23795 }, { "entropy": 6.08636245727539, "epoch": 2.3790673264357474, "grad_norm": 1.328125, "learning_rate": 0.00044367063000776423, "loss": 5.693, "mean_token_accuracy": 0.17525937259197236, "num_tokens": 46551446.0, "step": 23800 }, { "entropy": 6.068008756637573, "epoch": 2.379567151496976, "grad_norm": 1.109375, "learning_rate": 0.0004436470074966317, "loss": 5.6973, "mean_token_accuracy": 0.17796041965484619, "num_tokens": 46562289.0, "step": 23805 }, { "entropy": 5.950279426574707, "epoch": 2.3800669765582048, "grad_norm": 1.1015625, "learning_rate": 0.000443623380742384, "loss": 5.5768, "mean_token_accuracy": 0.18046288788318635, "num_tokens": 46572135.0, "step": 23810 }, { "entropy": 6.028979873657226, "epoch": 2.380566801619433, "grad_norm": 1.1640625, "learning_rate": 0.0004435997497456153, "loss": 5.6471, "mean_token_accuracy": 0.1761978641152382, "num_tokens": 46581810.0, "step": 23815 }, { "entropy": 5.9980076313018795, "epoch": 2.3810666266806617, "grad_norm": 1.09375, "learning_rate": 0.0004435761145069203, "loss": 5.5853, "mean_token_accuracy": 0.1780306115746498, "num_tokens": 46591886.0, "step": 23820 }, { "entropy": 6.063993883132935, "epoch": 2.3815664517418904, "grad_norm": 1.09375, "learning_rate": 0.00044355247502689374, "loss": 5.7169, "mean_token_accuracy": 0.16958054155111313, "num_tokens": 46601632.0, "step": 23825 }, { "entropy": 6.036028575897217, "epoch": 2.382066276803119, "grad_norm": 1.09375, "learning_rate": 0.0004435288313061302, "loss": 5.6419, "mean_token_accuracy": 0.18105792105197907, "num_tokens": 46611802.0, "step": 23830 }, { "entropy": 6.012950325012207, "epoch": 2.3825661018643474, "grad_norm": 1.1328125, "learning_rate": 0.0004435051833452246, "loss": 5.5597, "mean_token_accuracy": 0.18311626464128494, "num_tokens": 46621965.0, "step": 23835 }, { "entropy": 6.045510721206665, "epoch": 2.383065926925576, "grad_norm": 1.140625, "learning_rate": 0.000443481531144772, "loss": 5.6114, "mean_token_accuracy": 0.17995087504386903, "num_tokens": 46632518.0, "step": 23840 }, { "entropy": 5.967634677886963, "epoch": 2.3835657519868048, "grad_norm": 1.15625, "learning_rate": 0.0004434578747053674, "loss": 5.5677, "mean_token_accuracy": 0.19097691476345063, "num_tokens": 46642393.0, "step": 23845 }, { "entropy": 5.991853332519531, "epoch": 2.384065577048033, "grad_norm": 1.1171875, "learning_rate": 0.00044343421402760606, "loss": 5.586, "mean_token_accuracy": 0.17931993007659913, "num_tokens": 46653025.0, "step": 23850 }, { "entropy": 6.072017431259155, "epoch": 2.3845654021092617, "grad_norm": 1.2109375, "learning_rate": 0.0004434105491120832, "loss": 5.6278, "mean_token_accuracy": 0.1773751497268677, "num_tokens": 46661655.0, "step": 23855 }, { "entropy": 6.100204181671143, "epoch": 2.3850652271704904, "grad_norm": 1.171875, "learning_rate": 0.00044338687995939424, "loss": 5.712, "mean_token_accuracy": 0.17500317394733428, "num_tokens": 46672392.0, "step": 23860 }, { "entropy": 6.084134340286255, "epoch": 2.385565052231719, "grad_norm": 1.171875, "learning_rate": 0.0004433632065701348, "loss": 5.6743, "mean_token_accuracy": 0.1716666743159294, "num_tokens": 46683099.0, "step": 23865 }, { "entropy": 6.029203462600708, "epoch": 2.3860648772929474, "grad_norm": 1.296875, "learning_rate": 0.0004433395289449003, "loss": 5.606, "mean_token_accuracy": 0.18551905006170272, "num_tokens": 46692807.0, "step": 23870 }, { "entropy": 5.988838529586792, "epoch": 2.386564702354176, "grad_norm": 1.171875, "learning_rate": 0.0004433158470842867, "loss": 5.5945, "mean_token_accuracy": 0.17838135808706285, "num_tokens": 46703093.0, "step": 23875 }, { "entropy": 5.983804845809937, "epoch": 2.3870645274154048, "grad_norm": 1.15625, "learning_rate": 0.0004432921609888896, "loss": 5.6113, "mean_token_accuracy": 0.17373797595500945, "num_tokens": 46712487.0, "step": 23880 }, { "entropy": 6.033302307128906, "epoch": 2.387564352476633, "grad_norm": 1.078125, "learning_rate": 0.00044326847065930507, "loss": 5.6611, "mean_token_accuracy": 0.17533704340457917, "num_tokens": 46723627.0, "step": 23885 }, { "entropy": 6.022245740890503, "epoch": 2.3880641775378617, "grad_norm": 1.1875, "learning_rate": 0.00044324477609612907, "loss": 5.5515, "mean_token_accuracy": 0.18532310128211976, "num_tokens": 46733130.0, "step": 23890 }, { "entropy": 6.052120161056519, "epoch": 2.3885640025990904, "grad_norm": 1.421875, "learning_rate": 0.0004432210772999578, "loss": 5.7614, "mean_token_accuracy": 0.16833141595125198, "num_tokens": 46743380.0, "step": 23895 }, { "entropy": 6.046127891540527, "epoch": 2.389063827660319, "grad_norm": 1.1796875, "learning_rate": 0.0004431973742713876, "loss": 5.687, "mean_token_accuracy": 0.16911535561084748, "num_tokens": 46753420.0, "step": 23900 }, { "entropy": 6.038953065872192, "epoch": 2.3895636527215474, "grad_norm": 1.125, "learning_rate": 0.0004431736670110146, "loss": 5.6271, "mean_token_accuracy": 0.174855338037014, "num_tokens": 46763342.0, "step": 23905 }, { "entropy": 5.973513841629028, "epoch": 2.390063477782776, "grad_norm": 1.2109375, "learning_rate": 0.00044314995551943554, "loss": 5.5507, "mean_token_accuracy": 0.18543343544006347, "num_tokens": 46772300.0, "step": 23910 }, { "entropy": 6.060969829559326, "epoch": 2.3905633028440048, "grad_norm": 1.1953125, "learning_rate": 0.0004431262397972468, "loss": 5.5812, "mean_token_accuracy": 0.18429369777441024, "num_tokens": 46781778.0, "step": 23915 }, { "entropy": 5.917259454727173, "epoch": 2.391063127905233, "grad_norm": 1.109375, "learning_rate": 0.00044310251984504517, "loss": 5.4622, "mean_token_accuracy": 0.19555078446865082, "num_tokens": 46792845.0, "step": 23920 }, { "entropy": 6.1373742580413815, "epoch": 2.3915629529664617, "grad_norm": 1.2890625, "learning_rate": 0.00044307879566342736, "loss": 5.7644, "mean_token_accuracy": 0.16085453033447267, "num_tokens": 46802940.0, "step": 23925 }, { "entropy": 6.079683685302735, "epoch": 2.3920627780276904, "grad_norm": 1.1015625, "learning_rate": 0.0004430550672529903, "loss": 5.5957, "mean_token_accuracy": 0.18066017031669618, "num_tokens": 46812493.0, "step": 23930 }, { "entropy": 6.075826787948609, "epoch": 2.392562603088919, "grad_norm": 1.2109375, "learning_rate": 0.000443031334614331, "loss": 5.6549, "mean_token_accuracy": 0.1781351834535599, "num_tokens": 46821102.0, "step": 23935 }, { "entropy": 5.996089172363281, "epoch": 2.3930624281501474, "grad_norm": 1.1875, "learning_rate": 0.0004430075977480466, "loss": 5.6529, "mean_token_accuracy": 0.17873415499925613, "num_tokens": 46832717.0, "step": 23940 }, { "entropy": 5.986906671524048, "epoch": 2.393562253211376, "grad_norm": 1.4296875, "learning_rate": 0.0004429838566547343, "loss": 5.566, "mean_token_accuracy": 0.1789796307682991, "num_tokens": 46842756.0, "step": 23945 }, { "entropy": 6.038371801376343, "epoch": 2.3940620782726048, "grad_norm": 1.1796875, "learning_rate": 0.0004429601113349913, "loss": 5.6743, "mean_token_accuracy": 0.1719118744134903, "num_tokens": 46853114.0, "step": 23950 }, { "entropy": 6.095573997497558, "epoch": 2.394561903333833, "grad_norm": 1.1328125, "learning_rate": 0.00044293636178941516, "loss": 5.6204, "mean_token_accuracy": 0.16998432576656342, "num_tokens": 46862286.0, "step": 23955 }, { "entropy": 6.045434904098511, "epoch": 2.3950617283950617, "grad_norm": 1.1640625, "learning_rate": 0.0004429126080186034, "loss": 5.6711, "mean_token_accuracy": 0.172371569275856, "num_tokens": 46872155.0, "step": 23960 }, { "entropy": 5.956069231033325, "epoch": 2.3955615534562904, "grad_norm": 1.1328125, "learning_rate": 0.00044288885002315354, "loss": 5.5962, "mean_token_accuracy": 0.18287757337093352, "num_tokens": 46881969.0, "step": 23965 }, { "entropy": 6.043852376937866, "epoch": 2.396061378517519, "grad_norm": 1.1640625, "learning_rate": 0.00044286508780366345, "loss": 5.6487, "mean_token_accuracy": 0.17964032888412476, "num_tokens": 46890855.0, "step": 23970 }, { "entropy": 6.035159111022949, "epoch": 2.3965612035787474, "grad_norm": 1.1171875, "learning_rate": 0.00044284132136073097, "loss": 5.5744, "mean_token_accuracy": 0.18571922928094864, "num_tokens": 46900803.0, "step": 23975 }, { "entropy": 5.959583377838134, "epoch": 2.397061028639976, "grad_norm": 1.1875, "learning_rate": 0.0004428175506949541, "loss": 5.6322, "mean_token_accuracy": 0.18005622625350953, "num_tokens": 46910178.0, "step": 23980 }, { "entropy": 6.0496374607086185, "epoch": 2.3975608537012048, "grad_norm": 1.1640625, "learning_rate": 0.00044279377580693077, "loss": 5.6134, "mean_token_accuracy": 0.1770930290222168, "num_tokens": 46919860.0, "step": 23985 }, { "entropy": 6.066586685180664, "epoch": 2.398060678762433, "grad_norm": 1.1640625, "learning_rate": 0.0004427699966972592, "loss": 5.5933, "mean_token_accuracy": 0.1857215568423271, "num_tokens": 46929570.0, "step": 23990 }, { "entropy": 6.009964466094971, "epoch": 2.3985605038236617, "grad_norm": 1.2421875, "learning_rate": 0.00044274621336653765, "loss": 5.6076, "mean_token_accuracy": 0.17551508247852327, "num_tokens": 46939685.0, "step": 23995 }, { "entropy": 5.9474201679229735, "epoch": 2.3990603288848904, "grad_norm": 1.34375, "learning_rate": 0.00044272242581536457, "loss": 5.5342, "mean_token_accuracy": 0.19125236421823502, "num_tokens": 46949720.0, "step": 24000 }, { "epoch": 2.3990603288848904, "eval_entropy": 5.821133703277517, "eval_loss": 5.770229816436768, "eval_mean_token_accuracy": 0.17952073723004824, "eval_num_tokens": 46949720.0, "eval_runtime": 23.8002, "eval_samples_per_second": 1304.403, "eval_steps_per_second": 163.066, "step": 24000 }, { "entropy": 6.023554801940918, "epoch": 2.399560153946119, "grad_norm": 1.15625, "learning_rate": 0.00044269863404433846, "loss": 5.616, "mean_token_accuracy": 0.1782217651605606, "num_tokens": 46958883.0, "step": 24005 }, { "entropy": 6.1249762058258055, "epoch": 2.4000599790073474, "grad_norm": 1.234375, "learning_rate": 0.0004426748380540578, "loss": 5.6955, "mean_token_accuracy": 0.1685681402683258, "num_tokens": 46969146.0, "step": 24010 }, { "entropy": 6.022667503356933, "epoch": 2.400559804068576, "grad_norm": 1.171875, "learning_rate": 0.0004426510378451215, "loss": 5.68, "mean_token_accuracy": 0.1747714638710022, "num_tokens": 46978250.0, "step": 24015 }, { "entropy": 6.0925352573394775, "epoch": 2.4010596291298048, "grad_norm": 1.28125, "learning_rate": 0.00044262723341812805, "loss": 5.6838, "mean_token_accuracy": 0.17414737939834596, "num_tokens": 46988413.0, "step": 24020 }, { "entropy": 6.142070150375366, "epoch": 2.401559454191033, "grad_norm": 1.125, "learning_rate": 0.0004426034247736766, "loss": 5.7541, "mean_token_accuracy": 0.16979750841856003, "num_tokens": 46998092.0, "step": 24025 }, { "entropy": 6.036782121658325, "epoch": 2.4020592792522617, "grad_norm": 1.1796875, "learning_rate": 0.0004425796119123662, "loss": 5.7009, "mean_token_accuracy": 0.1769142910838127, "num_tokens": 47006764.0, "step": 24030 }, { "entropy": 6.06001124382019, "epoch": 2.4025591043134904, "grad_norm": 1.1328125, "learning_rate": 0.00044255579483479577, "loss": 5.6317, "mean_token_accuracy": 0.17491981238126755, "num_tokens": 47016789.0, "step": 24035 }, { "entropy": 6.003628969192505, "epoch": 2.4030589293747187, "grad_norm": 1.296875, "learning_rate": 0.0004425319735415647, "loss": 5.5875, "mean_token_accuracy": 0.1821936547756195, "num_tokens": 47026984.0, "step": 24040 }, { "entropy": 6.049056816101074, "epoch": 2.4035587544359474, "grad_norm": 1.171875, "learning_rate": 0.0004425081480332723, "loss": 5.6826, "mean_token_accuracy": 0.17453884333372116, "num_tokens": 47035893.0, "step": 24045 }, { "entropy": 5.957960844039917, "epoch": 2.404058579497176, "grad_norm": 1.1953125, "learning_rate": 0.000442484318310518, "loss": 5.5663, "mean_token_accuracy": 0.1779484048485756, "num_tokens": 47045351.0, "step": 24050 }, { "entropy": 5.96492829322815, "epoch": 2.4045584045584047, "grad_norm": 1.0703125, "learning_rate": 0.00044246048437390133, "loss": 5.6585, "mean_token_accuracy": 0.1754602313041687, "num_tokens": 47055849.0, "step": 24055 }, { "entropy": 6.059024000167847, "epoch": 2.405058229619633, "grad_norm": 1.21875, "learning_rate": 0.000442436646224022, "loss": 5.654, "mean_token_accuracy": 0.1702026441693306, "num_tokens": 47065068.0, "step": 24060 }, { "entropy": 6.00704927444458, "epoch": 2.4055580546808617, "grad_norm": 1.09375, "learning_rate": 0.00044241280386147965, "loss": 5.5727, "mean_token_accuracy": 0.17969609647989274, "num_tokens": 47075000.0, "step": 24065 }, { "entropy": 5.9703278064727785, "epoch": 2.4060578797420904, "grad_norm": 1.125, "learning_rate": 0.00044238895728687433, "loss": 5.6284, "mean_token_accuracy": 0.17608874142169953, "num_tokens": 47084711.0, "step": 24070 }, { "entropy": 5.983452367782593, "epoch": 2.4065577048033187, "grad_norm": 1.1171875, "learning_rate": 0.0004423651065008059, "loss": 5.5228, "mean_token_accuracy": 0.17741337418556213, "num_tokens": 47094466.0, "step": 24075 }, { "entropy": 6.017945051193237, "epoch": 2.4070575298645474, "grad_norm": 1.1640625, "learning_rate": 0.0004423412515038744, "loss": 5.6209, "mean_token_accuracy": 0.1752084717154503, "num_tokens": 47104388.0, "step": 24080 }, { "entropy": 6.038263463973999, "epoch": 2.407557354925776, "grad_norm": 1.078125, "learning_rate": 0.0004423173922966802, "loss": 5.7139, "mean_token_accuracy": 0.17268013209104538, "num_tokens": 47115158.0, "step": 24085 }, { "entropy": 6.12706184387207, "epoch": 2.4080571799870043, "grad_norm": 1.1875, "learning_rate": 0.00044229352887982325, "loss": 5.7324, "mean_token_accuracy": 0.16658879965543746, "num_tokens": 47126739.0, "step": 24090 }, { "entropy": 6.117573404312134, "epoch": 2.408557005048233, "grad_norm": 1.21875, "learning_rate": 0.00044226966125390435, "loss": 5.6883, "mean_token_accuracy": 0.17589689791202545, "num_tokens": 47136586.0, "step": 24095 }, { "entropy": 5.983213567733765, "epoch": 2.4090568301094617, "grad_norm": 1.203125, "learning_rate": 0.0004422457894195237, "loss": 5.5791, "mean_token_accuracy": 0.1839229181408882, "num_tokens": 47146099.0, "step": 24100 }, { "entropy": 5.973686552047729, "epoch": 2.4095566551706904, "grad_norm": 1.09375, "learning_rate": 0.0004422219133772821, "loss": 5.6685, "mean_token_accuracy": 0.1767183482646942, "num_tokens": 47154165.0, "step": 24105 }, { "entropy": 6.013171672821045, "epoch": 2.4100564802319187, "grad_norm": 1.328125, "learning_rate": 0.0004421980331277802, "loss": 5.6549, "mean_token_accuracy": 0.18122874498367308, "num_tokens": 47164060.0, "step": 24110 }, { "entropy": 6.078809547424316, "epoch": 2.4105563052931473, "grad_norm": 1.125, "learning_rate": 0.00044217414867161873, "loss": 5.7364, "mean_token_accuracy": 0.16950304061174393, "num_tokens": 47174256.0, "step": 24115 }, { "entropy": 6.004992580413818, "epoch": 2.411056130354376, "grad_norm": 1.1484375, "learning_rate": 0.0004421502600093987, "loss": 5.6113, "mean_token_accuracy": 0.18138744533061982, "num_tokens": 47183553.0, "step": 24120 }, { "entropy": 6.049961948394776, "epoch": 2.4115559554156043, "grad_norm": 1.140625, "learning_rate": 0.00044212636714172115, "loss": 5.6571, "mean_token_accuracy": 0.17427137047052382, "num_tokens": 47194542.0, "step": 24125 }, { "entropy": 6.067128467559814, "epoch": 2.412055780476833, "grad_norm": 1.28125, "learning_rate": 0.0004421024700691873, "loss": 5.6352, "mean_token_accuracy": 0.17796468883752822, "num_tokens": 47204418.0, "step": 24130 }, { "entropy": 5.968400239944458, "epoch": 2.4125556055380617, "grad_norm": 1.21875, "learning_rate": 0.0004420785687923982, "loss": 5.5532, "mean_token_accuracy": 0.19123557358980178, "num_tokens": 47212727.0, "step": 24135 }, { "entropy": 5.9016228199005125, "epoch": 2.4130554305992904, "grad_norm": 1.203125, "learning_rate": 0.0004420546633119554, "loss": 5.6544, "mean_token_accuracy": 0.18143839240074158, "num_tokens": 47222907.0, "step": 24140 }, { "entropy": 5.959653568267822, "epoch": 2.4135552556605187, "grad_norm": 1.3046875, "learning_rate": 0.0004420307536284602, "loss": 5.5747, "mean_token_accuracy": 0.1852305218577385, "num_tokens": 47233170.0, "step": 24145 }, { "entropy": 6.111540937423706, "epoch": 2.4140550807217473, "grad_norm": 1.1640625, "learning_rate": 0.00044200683974251424, "loss": 5.5922, "mean_token_accuracy": 0.18360538482666017, "num_tokens": 47243747.0, "step": 24150 }, { "entropy": 6.011303806304932, "epoch": 2.414554905782976, "grad_norm": 1.1953125, "learning_rate": 0.0004419829216547191, "loss": 5.6196, "mean_token_accuracy": 0.17668455243110656, "num_tokens": 47253372.0, "step": 24155 }, { "entropy": 5.973196268081665, "epoch": 2.4150547308442043, "grad_norm": 1.1796875, "learning_rate": 0.0004419589993656767, "loss": 5.6179, "mean_token_accuracy": 0.1835993528366089, "num_tokens": 47263190.0, "step": 24160 }, { "entropy": 6.081429672241211, "epoch": 2.415554555905433, "grad_norm": 1.03125, "learning_rate": 0.0004419350728759888, "loss": 5.7623, "mean_token_accuracy": 0.17463454306125642, "num_tokens": 47273702.0, "step": 24165 }, { "entropy": 6.045127105712891, "epoch": 2.4160543809666617, "grad_norm": 1.1875, "learning_rate": 0.00044191114218625736, "loss": 5.5578, "mean_token_accuracy": 0.18675146847963334, "num_tokens": 47282613.0, "step": 24170 }, { "entropy": 5.959947490692139, "epoch": 2.4165542060278904, "grad_norm": 1.2578125, "learning_rate": 0.0004418872072970846, "loss": 5.5168, "mean_token_accuracy": 0.19066780805587769, "num_tokens": 47292515.0, "step": 24175 }, { "entropy": 6.107087469100952, "epoch": 2.4170540310891186, "grad_norm": 1.453125, "learning_rate": 0.0004418632682090727, "loss": 5.6433, "mean_token_accuracy": 0.1733883649110794, "num_tokens": 47303258.0, "step": 24180 }, { "entropy": 6.022756910324096, "epoch": 2.4175538561503473, "grad_norm": 1.1796875, "learning_rate": 0.0004418393249228238, "loss": 5.722, "mean_token_accuracy": 0.1668480381369591, "num_tokens": 47313544.0, "step": 24185 }, { "entropy": 6.138251066207886, "epoch": 2.418053681211576, "grad_norm": 1.0625, "learning_rate": 0.0004418153774389405, "loss": 5.7529, "mean_token_accuracy": 0.16700546741485595, "num_tokens": 47325221.0, "step": 24190 }, { "entropy": 6.101276493072509, "epoch": 2.4185535062728043, "grad_norm": 1.109375, "learning_rate": 0.0004417914257580252, "loss": 5.6652, "mean_token_accuracy": 0.1752559795975685, "num_tokens": 47335043.0, "step": 24195 }, { "entropy": 6.025561904907226, "epoch": 2.419053331334033, "grad_norm": 1.1640625, "learning_rate": 0.0004417674698806805, "loss": 5.6423, "mean_token_accuracy": 0.17508832067251207, "num_tokens": 47343572.0, "step": 24200 }, { "entropy": 6.066837739944458, "epoch": 2.4195531563952617, "grad_norm": 1.1015625, "learning_rate": 0.0004417435098075093, "loss": 5.7511, "mean_token_accuracy": 0.17415841072797775, "num_tokens": 47352944.0, "step": 24205 }, { "entropy": 6.01858344078064, "epoch": 2.4200529814564904, "grad_norm": 1.15625, "learning_rate": 0.0004417195455391142, "loss": 5.6158, "mean_token_accuracy": 0.18179512321949004, "num_tokens": 47362614.0, "step": 24210 }, { "entropy": 5.991080331802368, "epoch": 2.4205528065177186, "grad_norm": 1.1171875, "learning_rate": 0.00044169557707609826, "loss": 5.5978, "mean_token_accuracy": 0.17907897382974625, "num_tokens": 47372712.0, "step": 24215 }, { "entropy": 5.9922222137451175, "epoch": 2.4210526315789473, "grad_norm": 1.1953125, "learning_rate": 0.0004416716044190644, "loss": 5.6781, "mean_token_accuracy": 0.1747306242585182, "num_tokens": 47382570.0, "step": 24220 }, { "entropy": 6.020452880859375, "epoch": 2.421552456640176, "grad_norm": 1.28125, "learning_rate": 0.000441647627568616, "loss": 5.5937, "mean_token_accuracy": 0.1834121823310852, "num_tokens": 47392537.0, "step": 24225 }, { "entropy": 5.981452798843383, "epoch": 2.4220522817014043, "grad_norm": 1.21875, "learning_rate": 0.00044162364652535613, "loss": 5.6188, "mean_token_accuracy": 0.1810839831829071, "num_tokens": 47403213.0, "step": 24230 }, { "entropy": 6.062117719650269, "epoch": 2.422552106762633, "grad_norm": 1.171875, "learning_rate": 0.0004415996612898882, "loss": 5.6373, "mean_token_accuracy": 0.17094153612852098, "num_tokens": 47413832.0, "step": 24235 }, { "entropy": 5.9899232387542725, "epoch": 2.4230519318238617, "grad_norm": 1.109375, "learning_rate": 0.00044157567186281553, "loss": 5.6129, "mean_token_accuracy": 0.17884231060743333, "num_tokens": 47423051.0, "step": 24240 }, { "entropy": 6.047880506515503, "epoch": 2.4235517568850904, "grad_norm": 1.265625, "learning_rate": 0.000441551678244742, "loss": 5.7288, "mean_token_accuracy": 0.1723594382405281, "num_tokens": 47431755.0, "step": 24245 }, { "entropy": 6.098805952072143, "epoch": 2.4240515819463186, "grad_norm": 1.09375, "learning_rate": 0.000441527680436271, "loss": 5.6718, "mean_token_accuracy": 0.17861958891153334, "num_tokens": 47441510.0, "step": 24250 }, { "entropy": 6.0698505401611325, "epoch": 2.4245514070075473, "grad_norm": 1.109375, "learning_rate": 0.00044150367843800645, "loss": 5.661, "mean_token_accuracy": 0.173063001036644, "num_tokens": 47451559.0, "step": 24255 }, { "entropy": 6.0517051219940186, "epoch": 2.425051232068776, "grad_norm": 1.125, "learning_rate": 0.0004414796722505522, "loss": 5.6004, "mean_token_accuracy": 0.1733100339770317, "num_tokens": 47462068.0, "step": 24260 }, { "entropy": 6.039041900634766, "epoch": 2.4255510571300043, "grad_norm": 1.2578125, "learning_rate": 0.0004414556618745122, "loss": 5.5717, "mean_token_accuracy": 0.18225948214530946, "num_tokens": 47470684.0, "step": 24265 }, { "entropy": 6.035745096206665, "epoch": 2.426050882191233, "grad_norm": 1.1171875, "learning_rate": 0.00044143164731049063, "loss": 5.5828, "mean_token_accuracy": 0.18886494487524033, "num_tokens": 47480147.0, "step": 24270 }, { "entropy": 6.032062435150147, "epoch": 2.4265507072524617, "grad_norm": 1.4296875, "learning_rate": 0.0004414076285590916, "loss": 5.6584, "mean_token_accuracy": 0.17310948222875594, "num_tokens": 47489499.0, "step": 24275 }, { "entropy": 6.023316717147827, "epoch": 2.4270505323136904, "grad_norm": 1.1875, "learning_rate": 0.0004413836056209195, "loss": 5.4621, "mean_token_accuracy": 0.19797069132328032, "num_tokens": 47500155.0, "step": 24280 }, { "entropy": 6.010325193405151, "epoch": 2.4275503573749186, "grad_norm": 1.1640625, "learning_rate": 0.00044135957849657866, "loss": 5.6054, "mean_token_accuracy": 0.17980749011039734, "num_tokens": 47510302.0, "step": 24285 }, { "entropy": 5.990495395660401, "epoch": 2.4280501824361473, "grad_norm": 1.109375, "learning_rate": 0.00044133554718667363, "loss": 5.6401, "mean_token_accuracy": 0.17334047853946685, "num_tokens": 47519997.0, "step": 24290 }, { "entropy": 6.064727258682251, "epoch": 2.428550007497376, "grad_norm": 1.1484375, "learning_rate": 0.00044131151169180905, "loss": 5.6524, "mean_token_accuracy": 0.17154275625944138, "num_tokens": 47528417.0, "step": 24295 }, { "entropy": 6.037304973602295, "epoch": 2.4290498325586043, "grad_norm": 1.21875, "learning_rate": 0.00044128747201258956, "loss": 5.5461, "mean_token_accuracy": 0.18078582882881164, "num_tokens": 47538461.0, "step": 24300 }, { "entropy": 6.078216314315796, "epoch": 2.429549657619833, "grad_norm": 1.21875, "learning_rate": 0.00044126342814962015, "loss": 5.5851, "mean_token_accuracy": 0.1870872750878334, "num_tokens": 47547256.0, "step": 24305 }, { "entropy": 5.993676090240479, "epoch": 2.4300494826810617, "grad_norm": 1.109375, "learning_rate": 0.00044123938010350575, "loss": 5.6511, "mean_token_accuracy": 0.17038078606128693, "num_tokens": 47556827.0, "step": 24310 }, { "entropy": 6.017264413833618, "epoch": 2.4305493077422904, "grad_norm": 1.125, "learning_rate": 0.00044121532787485114, "loss": 5.5476, "mean_token_accuracy": 0.18001786023378372, "num_tokens": 47566600.0, "step": 24315 }, { "entropy": 6.026751613616943, "epoch": 2.4310491328035186, "grad_norm": 1.1953125, "learning_rate": 0.00044119127146426167, "loss": 5.5607, "mean_token_accuracy": 0.17912608683109282, "num_tokens": 47575849.0, "step": 24320 }, { "entropy": 6.0941685199737545, "epoch": 2.4315489578647473, "grad_norm": 1.125, "learning_rate": 0.00044116721087234266, "loss": 5.7081, "mean_token_accuracy": 0.17261117100715637, "num_tokens": 47586417.0, "step": 24325 }, { "entropy": 6.074436140060425, "epoch": 2.432048782925976, "grad_norm": 1.2265625, "learning_rate": 0.0004411431460996994, "loss": 5.693, "mean_token_accuracy": 0.17241280749440194, "num_tokens": 47596917.0, "step": 24330 }, { "entropy": 6.095558738708496, "epoch": 2.4325486079872043, "grad_norm": 1.203125, "learning_rate": 0.0004411190771469373, "loss": 5.7076, "mean_token_accuracy": 0.17015113383531572, "num_tokens": 47607231.0, "step": 24335 }, { "entropy": 6.0676453590393065, "epoch": 2.433048433048433, "grad_norm": 1.2109375, "learning_rate": 0.00044109500401466194, "loss": 5.662, "mean_token_accuracy": 0.1782022163271904, "num_tokens": 47616320.0, "step": 24340 }, { "entropy": 6.02717695236206, "epoch": 2.4335482581096617, "grad_norm": 1.2265625, "learning_rate": 0.0004410709267034791, "loss": 5.6333, "mean_token_accuracy": 0.17748998254537582, "num_tokens": 47625391.0, "step": 24345 }, { "entropy": 6.038974952697754, "epoch": 2.4340480831708904, "grad_norm": 1.125, "learning_rate": 0.00044104684521399434, "loss": 5.6522, "mean_token_accuracy": 0.17077535390853882, "num_tokens": 47635474.0, "step": 24350 }, { "entropy": 6.072029876708984, "epoch": 2.4345479082321186, "grad_norm": 1.1328125, "learning_rate": 0.0004410227595468138, "loss": 5.592, "mean_token_accuracy": 0.17991064339876175, "num_tokens": 47644860.0, "step": 24355 }, { "entropy": 5.967791271209717, "epoch": 2.4350477332933473, "grad_norm": 1.15625, "learning_rate": 0.00044099866970254327, "loss": 5.6328, "mean_token_accuracy": 0.18850301951169968, "num_tokens": 47654531.0, "step": 24360 }, { "entropy": 5.923406934738159, "epoch": 2.435547558354576, "grad_norm": 1.21875, "learning_rate": 0.00044097457568178903, "loss": 5.5032, "mean_token_accuracy": 0.19691420793533326, "num_tokens": 47663110.0, "step": 24365 }, { "entropy": 5.975079917907715, "epoch": 2.4360473834158043, "grad_norm": 1.1484375, "learning_rate": 0.00044095047748515706, "loss": 5.5316, "mean_token_accuracy": 0.18982431739568711, "num_tokens": 47672466.0, "step": 24370 }, { "entropy": 6.077485609054565, "epoch": 2.436547208477033, "grad_norm": 1.046875, "learning_rate": 0.00044092637511325384, "loss": 5.6711, "mean_token_accuracy": 0.18393763452768325, "num_tokens": 47681949.0, "step": 24375 }, { "entropy": 6.039769887924194, "epoch": 2.4370470335382617, "grad_norm": 1.109375, "learning_rate": 0.0004409022685666857, "loss": 5.6222, "mean_token_accuracy": 0.18226393908262253, "num_tokens": 47692515.0, "step": 24380 }, { "entropy": 6.054116439819336, "epoch": 2.4375468585994904, "grad_norm": 1.2421875, "learning_rate": 0.0004408781578460592, "loss": 5.743, "mean_token_accuracy": 0.17137934565544127, "num_tokens": 47701604.0, "step": 24385 }, { "entropy": 5.989136409759522, "epoch": 2.4380466836607186, "grad_norm": 1.046875, "learning_rate": 0.00044085404295198097, "loss": 5.5634, "mean_token_accuracy": 0.1819287955760956, "num_tokens": 47711567.0, "step": 24390 }, { "entropy": 6.096336841583252, "epoch": 2.4385465087219473, "grad_norm": 1.15625, "learning_rate": 0.0004408299238850576, "loss": 5.7119, "mean_token_accuracy": 0.17520872950553895, "num_tokens": 47721575.0, "step": 24395 }, { "entropy": 6.104909086227417, "epoch": 2.439046333783176, "grad_norm": 1.1015625, "learning_rate": 0.0004408058006458961, "loss": 5.7093, "mean_token_accuracy": 0.17287303507328033, "num_tokens": 47731510.0, "step": 24400 }, { "entropy": 6.059074831008911, "epoch": 2.4395461588444043, "grad_norm": 1.2421875, "learning_rate": 0.0004407816732351032, "loss": 5.7224, "mean_token_accuracy": 0.17018707394599913, "num_tokens": 47741842.0, "step": 24405 }, { "entropy": 6.095255041122437, "epoch": 2.440045983905633, "grad_norm": 1.1171875, "learning_rate": 0.00044075754165328614, "loss": 5.7074, "mean_token_accuracy": 0.1715589165687561, "num_tokens": 47752074.0, "step": 24410 }, { "entropy": 6.097635793685913, "epoch": 2.4405458089668617, "grad_norm": 1.2265625, "learning_rate": 0.000440733405901052, "loss": 5.6519, "mean_token_accuracy": 0.17655315697193147, "num_tokens": 47760584.0, "step": 24415 }, { "entropy": 6.072246360778808, "epoch": 2.4410456340280904, "grad_norm": 1.140625, "learning_rate": 0.00044070926597900804, "loss": 5.6994, "mean_token_accuracy": 0.17952407151460648, "num_tokens": 47770744.0, "step": 24420 }, { "entropy": 6.089491271972657, "epoch": 2.4415454590893186, "grad_norm": 1.2265625, "learning_rate": 0.0004406851218877615, "loss": 5.7073, "mean_token_accuracy": 0.17447005063295365, "num_tokens": 47780098.0, "step": 24425 }, { "entropy": 6.006195449829102, "epoch": 2.4420452841505473, "grad_norm": 1.1953125, "learning_rate": 0.00044066097362792, "loss": 5.5999, "mean_token_accuracy": 0.17984318137168884, "num_tokens": 47789807.0, "step": 24430 }, { "entropy": 6.021993112564087, "epoch": 2.442545109211776, "grad_norm": 1.3359375, "learning_rate": 0.000440636821200091, "loss": 5.5779, "mean_token_accuracy": 0.1863965645432472, "num_tokens": 47798110.0, "step": 24435 }, { "entropy": 6.057878589630127, "epoch": 2.4430449342730043, "grad_norm": 1.078125, "learning_rate": 0.0004406126646048822, "loss": 5.6768, "mean_token_accuracy": 0.17468643933534622, "num_tokens": 47809084.0, "step": 24440 }, { "entropy": 6.173198509216308, "epoch": 2.443544759334233, "grad_norm": 1.140625, "learning_rate": 0.0004405885038429014, "loss": 5.6846, "mean_token_accuracy": 0.17383741289377214, "num_tokens": 47819694.0, "step": 24445 }, { "entropy": 6.054164743423462, "epoch": 2.4440445843954617, "grad_norm": 1.09375, "learning_rate": 0.00044056433891475645, "loss": 5.6718, "mean_token_accuracy": 0.17495127171278, "num_tokens": 47828924.0, "step": 24450 }, { "entropy": 5.928030681610108, "epoch": 2.4445444094566904, "grad_norm": 1.1171875, "learning_rate": 0.0004405401698210553, "loss": 5.5149, "mean_token_accuracy": 0.18488841950893403, "num_tokens": 47838992.0, "step": 24455 }, { "entropy": 6.040327262878418, "epoch": 2.4450442345179186, "grad_norm": 1.15625, "learning_rate": 0.0004405159965624061, "loss": 5.5874, "mean_token_accuracy": 0.17767405062913894, "num_tokens": 47848682.0, "step": 24460 }, { "entropy": 6.055491209030151, "epoch": 2.4455440595791473, "grad_norm": 1.2109375, "learning_rate": 0.000440491819139417, "loss": 5.6305, "mean_token_accuracy": 0.18010813593864441, "num_tokens": 47858574.0, "step": 24465 }, { "entropy": 5.984416532516479, "epoch": 2.446043884640376, "grad_norm": 1.1875, "learning_rate": 0.0004404676375526963, "loss": 5.6774, "mean_token_accuracy": 0.18010955303907394, "num_tokens": 47868455.0, "step": 24470 }, { "entropy": 5.954157924652099, "epoch": 2.4465437097016043, "grad_norm": 1.1328125, "learning_rate": 0.00044044345180285245, "loss": 5.6319, "mean_token_accuracy": 0.1780990481376648, "num_tokens": 47878718.0, "step": 24475 }, { "entropy": 6.057654142379761, "epoch": 2.447043534762833, "grad_norm": 1.203125, "learning_rate": 0.000440419261890494, "loss": 5.5676, "mean_token_accuracy": 0.1834159567952156, "num_tokens": 47887444.0, "step": 24480 }, { "entropy": 6.02215838432312, "epoch": 2.4475433598240617, "grad_norm": 1.375, "learning_rate": 0.00044039506781622936, "loss": 5.5373, "mean_token_accuracy": 0.18781089335680007, "num_tokens": 47895935.0, "step": 24485 }, { "entropy": 6.000536489486694, "epoch": 2.4480431848852904, "grad_norm": 1.234375, "learning_rate": 0.0004403708695806674, "loss": 5.6498, "mean_token_accuracy": 0.17686448991298676, "num_tokens": 47906552.0, "step": 24490 }, { "entropy": 5.973035669326782, "epoch": 2.4485430099465186, "grad_norm": 1.09375, "learning_rate": 0.0004403466671844169, "loss": 5.5962, "mean_token_accuracy": 0.1853729099035263, "num_tokens": 47916691.0, "step": 24495 }, { "entropy": 6.054156684875489, "epoch": 2.4490428350077473, "grad_norm": 1.1328125, "learning_rate": 0.0004403224606280869, "loss": 5.6272, "mean_token_accuracy": 0.1815432071685791, "num_tokens": 47926579.0, "step": 24500 }, { "entropy": 6.010115003585815, "epoch": 2.449542660068976, "grad_norm": 1.1484375, "learning_rate": 0.0004402982499122862, "loss": 5.4852, "mean_token_accuracy": 0.18931954056024553, "num_tokens": 47935889.0, "step": 24505 }, { "entropy": 5.992005825042725, "epoch": 2.4500424851302043, "grad_norm": 1.2109375, "learning_rate": 0.00044027403503762416, "loss": 5.5912, "mean_token_accuracy": 0.17804358750581742, "num_tokens": 47944993.0, "step": 24510 }, { "entropy": 6.085336399078369, "epoch": 2.450542310191433, "grad_norm": 1.1171875, "learning_rate": 0.0004402498160047099, "loss": 5.6749, "mean_token_accuracy": 0.17265985608100892, "num_tokens": 47954984.0, "step": 24515 }, { "entropy": 6.0319281101226805, "epoch": 2.4510421352526617, "grad_norm": 1.2421875, "learning_rate": 0.0004402255928141528, "loss": 5.6535, "mean_token_accuracy": 0.1767471507191658, "num_tokens": 47964986.0, "step": 24520 }, { "entropy": 6.07125506401062, "epoch": 2.4515419603138904, "grad_norm": 1.1171875, "learning_rate": 0.0004402013654665623, "loss": 5.6733, "mean_token_accuracy": 0.17612204998731612, "num_tokens": 47975962.0, "step": 24525 }, { "entropy": 6.100185966491699, "epoch": 2.4520417853751186, "grad_norm": 1.2421875, "learning_rate": 0.00044017713396254796, "loss": 5.7093, "mean_token_accuracy": 0.17525184899568558, "num_tokens": 47985159.0, "step": 24530 }, { "entropy": 5.986420392990112, "epoch": 2.4525416104363473, "grad_norm": 1.2109375, "learning_rate": 0.00044015289830271945, "loss": 5.5696, "mean_token_accuracy": 0.18415430784225464, "num_tokens": 47993634.0, "step": 24535 }, { "entropy": 6.006438827514648, "epoch": 2.453041435497576, "grad_norm": 1.1796875, "learning_rate": 0.00044012865848768644, "loss": 5.6127, "mean_token_accuracy": 0.17167626619338988, "num_tokens": 48003573.0, "step": 24540 }, { "entropy": 5.923998260498047, "epoch": 2.4535412605588043, "grad_norm": 1.21875, "learning_rate": 0.00044010441451805896, "loss": 5.4904, "mean_token_accuracy": 0.1885721653699875, "num_tokens": 48013688.0, "step": 24545 }, { "entropy": 6.031884813308716, "epoch": 2.454041085620033, "grad_norm": 1.140625, "learning_rate": 0.0004400801663944468, "loss": 5.483, "mean_token_accuracy": 0.18609380722045898, "num_tokens": 48022629.0, "step": 24550 }, { "entropy": 6.0448671817779545, "epoch": 2.4545409106812617, "grad_norm": 1.0703125, "learning_rate": 0.00044005591411746023, "loss": 5.667, "mean_token_accuracy": 0.17622793316841126, "num_tokens": 48033495.0, "step": 24555 }, { "entropy": 6.011681175231933, "epoch": 2.4550407357424904, "grad_norm": 1.25, "learning_rate": 0.00044003165768770927, "loss": 5.5456, "mean_token_accuracy": 0.18541127145290376, "num_tokens": 48043471.0, "step": 24560 }, { "entropy": 6.0248839378356935, "epoch": 2.4555405608037186, "grad_norm": 1.0625, "learning_rate": 0.0004400073971058043, "loss": 5.6695, "mean_token_accuracy": 0.1759689912199974, "num_tokens": 48052811.0, "step": 24565 }, { "entropy": 6.05173807144165, "epoch": 2.4560403858649473, "grad_norm": 1.0703125, "learning_rate": 0.00043998313237235566, "loss": 5.6228, "mean_token_accuracy": 0.17885940074920653, "num_tokens": 48062826.0, "step": 24570 }, { "entropy": 6.036870765686035, "epoch": 2.456540210926176, "grad_norm": 1.1640625, "learning_rate": 0.0004399588634879739, "loss": 5.6236, "mean_token_accuracy": 0.17361117899417877, "num_tokens": 48072867.0, "step": 24575 }, { "entropy": 6.036831283569336, "epoch": 2.4570400359874043, "grad_norm": 1.0859375, "learning_rate": 0.0004399345904532695, "loss": 5.6224, "mean_token_accuracy": 0.17903644293546678, "num_tokens": 48082816.0, "step": 24580 }, { "entropy": 6.027196311950684, "epoch": 2.457539861048633, "grad_norm": 1.171875, "learning_rate": 0.0004399103132688533, "loss": 5.6158, "mean_token_accuracy": 0.18493862748146056, "num_tokens": 48092715.0, "step": 24585 }, { "entropy": 6.027986145019531, "epoch": 2.4580396861098617, "grad_norm": 1.3125, "learning_rate": 0.00043988603193533606, "loss": 5.5989, "mean_token_accuracy": 0.17064955234527587, "num_tokens": 48101372.0, "step": 24590 }, { "entropy": 6.011467790603637, "epoch": 2.45853951117109, "grad_norm": 1.1328125, "learning_rate": 0.0004398617464533287, "loss": 5.6041, "mean_token_accuracy": 0.1853222742676735, "num_tokens": 48111894.0, "step": 24595 }, { "entropy": 6.098705005645752, "epoch": 2.4590393362323186, "grad_norm": 1.15625, "learning_rate": 0.0004398374568234422, "loss": 5.7736, "mean_token_accuracy": 0.15889275968074798, "num_tokens": 48121480.0, "step": 24600 }, { "entropy": 6.068133974075318, "epoch": 2.4595391612935473, "grad_norm": 1.125, "learning_rate": 0.0004398131630462877, "loss": 5.6303, "mean_token_accuracy": 0.1769583359360695, "num_tokens": 48130404.0, "step": 24605 }, { "entropy": 6.1115068912506105, "epoch": 2.4600389863547756, "grad_norm": 1.140625, "learning_rate": 0.00043978886512247646, "loss": 5.6485, "mean_token_accuracy": 0.17188361585140227, "num_tokens": 48141218.0, "step": 24610 }, { "entropy": 6.069027471542358, "epoch": 2.4605388114160043, "grad_norm": 1.1875, "learning_rate": 0.0004397645630526197, "loss": 5.6642, "mean_token_accuracy": 0.17690529823303222, "num_tokens": 48151817.0, "step": 24615 }, { "entropy": 6.0522377490997314, "epoch": 2.461038636477233, "grad_norm": 1.140625, "learning_rate": 0.000439740256837329, "loss": 5.5717, "mean_token_accuracy": 0.18075603991746902, "num_tokens": 48161044.0, "step": 24620 }, { "entropy": 6.024737167358398, "epoch": 2.4615384615384617, "grad_norm": 1.234375, "learning_rate": 0.0004397159464772158, "loss": 5.6604, "mean_token_accuracy": 0.17505499869585037, "num_tokens": 48170139.0, "step": 24625 }, { "entropy": 5.963724851608276, "epoch": 2.46203828659969, "grad_norm": 1.140625, "learning_rate": 0.00043969163197289174, "loss": 5.6393, "mean_token_accuracy": 0.18492036759853364, "num_tokens": 48179418.0, "step": 24630 }, { "entropy": 6.067753028869629, "epoch": 2.4625381116609186, "grad_norm": 1.203125, "learning_rate": 0.0004396673133249687, "loss": 5.6147, "mean_token_accuracy": 0.18043505996465684, "num_tokens": 48188877.0, "step": 24635 }, { "entropy": 6.102846431732178, "epoch": 2.4630379367221473, "grad_norm": 1.109375, "learning_rate": 0.0004396429905340584, "loss": 5.7009, "mean_token_accuracy": 0.1701342761516571, "num_tokens": 48198969.0, "step": 24640 }, { "entropy": 6.16652626991272, "epoch": 2.4635377617833756, "grad_norm": 1.171875, "learning_rate": 0.00043961866360077266, "loss": 5.769, "mean_token_accuracy": 0.17000649720430375, "num_tokens": 48209814.0, "step": 24645 }, { "entropy": 6.020314359664917, "epoch": 2.4640375868446043, "grad_norm": 1.1171875, "learning_rate": 0.0004395943325257239, "loss": 5.6321, "mean_token_accuracy": 0.18322097659111022, "num_tokens": 48218810.0, "step": 24650 }, { "entropy": 6.022289562225342, "epoch": 2.464537411905833, "grad_norm": 1.1328125, "learning_rate": 0.00043956999730952403, "loss": 5.6225, "mean_token_accuracy": 0.18003946393728257, "num_tokens": 48228484.0, "step": 24655 }, { "entropy": 6.049333715438843, "epoch": 2.4650372369670617, "grad_norm": 1.109375, "learning_rate": 0.00043954565795278536, "loss": 5.6731, "mean_token_accuracy": 0.17862130105495452, "num_tokens": 48239029.0, "step": 24660 }, { "entropy": 6.068674850463867, "epoch": 2.46553706202829, "grad_norm": 1.125, "learning_rate": 0.0004395213144561203, "loss": 5.6008, "mean_token_accuracy": 0.1798049822449684, "num_tokens": 48249448.0, "step": 24665 }, { "entropy": 6.053813886642456, "epoch": 2.4660368870895186, "grad_norm": 1.1328125, "learning_rate": 0.0004394969668201413, "loss": 5.5956, "mean_token_accuracy": 0.18056170791387557, "num_tokens": 48258631.0, "step": 24670 }, { "entropy": 5.948708200454712, "epoch": 2.4665367121507473, "grad_norm": 1.203125, "learning_rate": 0.0004394726150454609, "loss": 5.4987, "mean_token_accuracy": 0.18710066825151445, "num_tokens": 48266800.0, "step": 24675 }, { "entropy": 6.0495470523834225, "epoch": 2.4670365372119756, "grad_norm": 1.078125, "learning_rate": 0.0004394482591326918, "loss": 5.6737, "mean_token_accuracy": 0.18270571678876876, "num_tokens": 48277566.0, "step": 24680 }, { "entropy": 6.032958269119263, "epoch": 2.4675363622732043, "grad_norm": 1.140625, "learning_rate": 0.00043942389908244693, "loss": 5.6128, "mean_token_accuracy": 0.17813760042190552, "num_tokens": 48287033.0, "step": 24685 }, { "entropy": 6.002897691726685, "epoch": 2.468036187334433, "grad_norm": 1.6171875, "learning_rate": 0.000439399534895339, "loss": 5.6117, "mean_token_accuracy": 0.17471453696489334, "num_tokens": 48296627.0, "step": 24690 }, { "entropy": 6.0418625831604, "epoch": 2.4685360123956617, "grad_norm": 1.1640625, "learning_rate": 0.0004393751665719811, "loss": 5.5941, "mean_token_accuracy": 0.17930218875408171, "num_tokens": 48305940.0, "step": 24695 }, { "entropy": 5.9872547626495365, "epoch": 2.46903583745689, "grad_norm": 1.1796875, "learning_rate": 0.0004393507941129863, "loss": 5.5723, "mean_token_accuracy": 0.17916447520256043, "num_tokens": 48315785.0, "step": 24700 }, { "entropy": 6.009989261627197, "epoch": 2.4695356625181186, "grad_norm": 1.109375, "learning_rate": 0.0004393264175189678, "loss": 5.6241, "mean_token_accuracy": 0.18514046519994737, "num_tokens": 48325803.0, "step": 24705 }, { "entropy": 6.067319440841675, "epoch": 2.4700354875793473, "grad_norm": 1.140625, "learning_rate": 0.00043930203679053885, "loss": 5.6131, "mean_token_accuracy": 0.1813179448246956, "num_tokens": 48334860.0, "step": 24710 }, { "entropy": 6.01424880027771, "epoch": 2.4705353126405756, "grad_norm": 1.1015625, "learning_rate": 0.00043927765192831305, "loss": 5.6605, "mean_token_accuracy": 0.17389233708381652, "num_tokens": 48344939.0, "step": 24715 }, { "entropy": 6.0112604141235355, "epoch": 2.4710351377018043, "grad_norm": 1.21875, "learning_rate": 0.0004392532629329038, "loss": 5.6332, "mean_token_accuracy": 0.17982484698295592, "num_tokens": 48354493.0, "step": 24720 }, { "entropy": 5.997668075561523, "epoch": 2.471534962763033, "grad_norm": 1.125, "learning_rate": 0.00043922886980492465, "loss": 5.6065, "mean_token_accuracy": 0.18695901334285736, "num_tokens": 48364650.0, "step": 24725 }, { "entropy": 6.048045063018799, "epoch": 2.4720347878242617, "grad_norm": 1.1484375, "learning_rate": 0.00043920447254498947, "loss": 5.688, "mean_token_accuracy": 0.17523399293422698, "num_tokens": 48374373.0, "step": 24730 }, { "entropy": 6.0222100734710695, "epoch": 2.47253461288549, "grad_norm": 1.1171875, "learning_rate": 0.0004391800711537119, "loss": 5.5729, "mean_token_accuracy": 0.17724181413650514, "num_tokens": 48384488.0, "step": 24735 }, { "entropy": 6.087334823608399, "epoch": 2.4730344379467186, "grad_norm": 1.1328125, "learning_rate": 0.00043915566563170605, "loss": 5.6657, "mean_token_accuracy": 0.1771863207221031, "num_tokens": 48395083.0, "step": 24740 }, { "entropy": 6.030396223068237, "epoch": 2.4735342630079473, "grad_norm": 1.140625, "learning_rate": 0.00043913125597958594, "loss": 5.5626, "mean_token_accuracy": 0.18976465314626695, "num_tokens": 48404229.0, "step": 24745 }, { "entropy": 6.043383693695068, "epoch": 2.4740340880691756, "grad_norm": 1.328125, "learning_rate": 0.00043910684219796564, "loss": 5.6819, "mean_token_accuracy": 0.17328319996595382, "num_tokens": 48413521.0, "step": 24750 }, { "entropy": 5.9874022006988525, "epoch": 2.4745339131304043, "grad_norm": 1.25, "learning_rate": 0.00043908242428745937, "loss": 5.6048, "mean_token_accuracy": 0.18587420433759688, "num_tokens": 48423229.0, "step": 24755 }, { "entropy": 6.070016384124756, "epoch": 2.475033738191633, "grad_norm": 1.1640625, "learning_rate": 0.00043905800224868153, "loss": 5.6689, "mean_token_accuracy": 0.17651266157627105, "num_tokens": 48432261.0, "step": 24760 }, { "entropy": 6.074644374847412, "epoch": 2.4755335632528617, "grad_norm": 1.1875, "learning_rate": 0.0004390335760822466, "loss": 5.6087, "mean_token_accuracy": 0.1795772820711136, "num_tokens": 48441484.0, "step": 24765 }, { "entropy": 6.024156856536865, "epoch": 2.47603338831409, "grad_norm": 1.4765625, "learning_rate": 0.0004390091457887691, "loss": 5.5366, "mean_token_accuracy": 0.19025348275899887, "num_tokens": 48452055.0, "step": 24770 }, { "entropy": 5.909773588180542, "epoch": 2.4765332133753186, "grad_norm": 1.1875, "learning_rate": 0.0004389847113688637, "loss": 5.4366, "mean_token_accuracy": 0.19471009075641632, "num_tokens": 48460349.0, "step": 24775 }, { "entropy": 5.974616050720215, "epoch": 2.4770330384365473, "grad_norm": 1.171875, "learning_rate": 0.00043896027282314516, "loss": 5.6217, "mean_token_accuracy": 0.17966757267713546, "num_tokens": 48470625.0, "step": 24780 }, { "entropy": 6.014792823791504, "epoch": 2.4775328634977756, "grad_norm": 1.359375, "learning_rate": 0.0004389358301522283, "loss": 5.5832, "mean_token_accuracy": 0.18376269936561584, "num_tokens": 48480866.0, "step": 24785 }, { "entropy": 5.953444242477417, "epoch": 2.4780326885590043, "grad_norm": 1.1875, "learning_rate": 0.00043891138335672825, "loss": 5.5592, "mean_token_accuracy": 0.18722262978553772, "num_tokens": 48490484.0, "step": 24790 }, { "entropy": 6.014924335479736, "epoch": 2.478532513620233, "grad_norm": 1.0703125, "learning_rate": 0.0004388869324372599, "loss": 5.6145, "mean_token_accuracy": 0.1766123354434967, "num_tokens": 48501139.0, "step": 24795 }, { "entropy": 6.119218015670777, "epoch": 2.4790323386814617, "grad_norm": 1.09375, "learning_rate": 0.0004388624773944385, "loss": 5.7259, "mean_token_accuracy": 0.17633720189332963, "num_tokens": 48510793.0, "step": 24800 }, { "entropy": 6.121218824386597, "epoch": 2.47953216374269, "grad_norm": 1.2109375, "learning_rate": 0.00043883801822887933, "loss": 5.7866, "mean_token_accuracy": 0.1680760458111763, "num_tokens": 48521193.0, "step": 24805 }, { "entropy": 6.033409976959229, "epoch": 2.4800319888039186, "grad_norm": 1.140625, "learning_rate": 0.00043881355494119773, "loss": 5.5879, "mean_token_accuracy": 0.18876389861106874, "num_tokens": 48530303.0, "step": 24810 }, { "entropy": 6.091024875640869, "epoch": 2.4805318138651473, "grad_norm": 1.125, "learning_rate": 0.0004387890875320093, "loss": 5.6562, "mean_token_accuracy": 0.17637317031621932, "num_tokens": 48539633.0, "step": 24815 }, { "entropy": 6.118903064727784, "epoch": 2.4810316389263756, "grad_norm": 1.375, "learning_rate": 0.00043876461600192955, "loss": 5.6007, "mean_token_accuracy": 0.19334306120872496, "num_tokens": 48550097.0, "step": 24820 }, { "entropy": 5.967060661315918, "epoch": 2.4815314639876043, "grad_norm": 1.1015625, "learning_rate": 0.0004387401403515743, "loss": 5.6212, "mean_token_accuracy": 0.18674899637699127, "num_tokens": 48561202.0, "step": 24825 }, { "entropy": 6.077824354171753, "epoch": 2.482031289048833, "grad_norm": 1.1328125, "learning_rate": 0.00043871566058155913, "loss": 5.7243, "mean_token_accuracy": 0.16668889820575714, "num_tokens": 48571283.0, "step": 24830 }, { "entropy": 6.13338418006897, "epoch": 2.4825311141100617, "grad_norm": 1.1640625, "learning_rate": 0.00043869117669250015, "loss": 5.6909, "mean_token_accuracy": 0.168531334400177, "num_tokens": 48581818.0, "step": 24835 }, { "entropy": 6.0660100936889645, "epoch": 2.48303093917129, "grad_norm": 1.2890625, "learning_rate": 0.0004386666886850132, "loss": 5.6487, "mean_token_accuracy": 0.1747722804546356, "num_tokens": 48591227.0, "step": 24840 }, { "entropy": 6.073725080490112, "epoch": 2.4835307642325186, "grad_norm": 1.1875, "learning_rate": 0.00043864219655971457, "loss": 5.6622, "mean_token_accuracy": 0.17236957401037217, "num_tokens": 48600704.0, "step": 24845 }, { "entropy": 6.117662382125855, "epoch": 2.4840305892937473, "grad_norm": 1.1484375, "learning_rate": 0.0004386177003172203, "loss": 5.7259, "mean_token_accuracy": 0.17661986649036407, "num_tokens": 48611964.0, "step": 24850 }, { "entropy": 6.135275793075562, "epoch": 2.4845304143549756, "grad_norm": 1.21875, "learning_rate": 0.00043859319995814686, "loss": 5.6641, "mean_token_accuracy": 0.17720798403024673, "num_tokens": 48621012.0, "step": 24855 }, { "entropy": 6.03787899017334, "epoch": 2.4850302394162043, "grad_norm": 1.140625, "learning_rate": 0.0004385686954831105, "loss": 5.593, "mean_token_accuracy": 0.17947347462177277, "num_tokens": 48630242.0, "step": 24860 }, { "entropy": 5.960056495666504, "epoch": 2.485530064477433, "grad_norm": 1.1875, "learning_rate": 0.00043854418689272793, "loss": 5.5678, "mean_token_accuracy": 0.1831405431032181, "num_tokens": 48640535.0, "step": 24865 }, { "entropy": 6.1383435249328615, "epoch": 2.4860298895386617, "grad_norm": 1.2265625, "learning_rate": 0.00043851967418761574, "loss": 5.6652, "mean_token_accuracy": 0.18322110921144485, "num_tokens": 48650096.0, "step": 24870 }, { "entropy": 6.056563138961792, "epoch": 2.48652971459989, "grad_norm": 1.1328125, "learning_rate": 0.00043849515736839057, "loss": 5.6464, "mean_token_accuracy": 0.1790487602353096, "num_tokens": 48660883.0, "step": 24875 }, { "entropy": 6.130646753311157, "epoch": 2.4870295396611186, "grad_norm": 1.1640625, "learning_rate": 0.00043847063643566935, "loss": 5.6904, "mean_token_accuracy": 0.17530573308467864, "num_tokens": 48671345.0, "step": 24880 }, { "entropy": 6.1251829147338865, "epoch": 2.4875293647223473, "grad_norm": 1.078125, "learning_rate": 0.00043844611139006893, "loss": 5.691, "mean_token_accuracy": 0.17284900695085526, "num_tokens": 48681296.0, "step": 24885 }, { "entropy": 6.011607503890991, "epoch": 2.4880291897835756, "grad_norm": 1.140625, "learning_rate": 0.00043842158223220644, "loss": 5.6422, "mean_token_accuracy": 0.17612471878528596, "num_tokens": 48691885.0, "step": 24890 }, { "entropy": 6.093929290771484, "epoch": 2.4885290148448043, "grad_norm": 1.203125, "learning_rate": 0.000438397048962699, "loss": 5.6295, "mean_token_accuracy": 0.16994370222091676, "num_tokens": 48701325.0, "step": 24895 }, { "entropy": 6.0605415344238285, "epoch": 2.489028839906033, "grad_norm": 0.9765625, "learning_rate": 0.00043837251158216386, "loss": 5.689, "mean_token_accuracy": 0.17656268626451493, "num_tokens": 48712212.0, "step": 24900 }, { "entropy": 6.03923454284668, "epoch": 2.4895286649672617, "grad_norm": 1.1953125, "learning_rate": 0.00043834797009121836, "loss": 5.6033, "mean_token_accuracy": 0.1818452551960945, "num_tokens": 48721482.0, "step": 24905 }, { "entropy": 6.04849534034729, "epoch": 2.49002849002849, "grad_norm": 1.078125, "learning_rate": 0.00043832342449047994, "loss": 5.6699, "mean_token_accuracy": 0.1791791945695877, "num_tokens": 48731740.0, "step": 24910 }, { "entropy": 6.058159351348877, "epoch": 2.4905283150897186, "grad_norm": 1.234375, "learning_rate": 0.0004382988747805661, "loss": 5.605, "mean_token_accuracy": 0.17844815105199813, "num_tokens": 48740351.0, "step": 24915 }, { "entropy": 6.048389291763305, "epoch": 2.4910281401509473, "grad_norm": 1.171875, "learning_rate": 0.0004382743209620948, "loss": 5.5952, "mean_token_accuracy": 0.18011426627635957, "num_tokens": 48750571.0, "step": 24920 }, { "entropy": 5.994932079315186, "epoch": 2.4915279652121756, "grad_norm": 1.2109375, "learning_rate": 0.0004382497630356835, "loss": 5.5716, "mean_token_accuracy": 0.1846693202853203, "num_tokens": 48758740.0, "step": 24925 }, { "entropy": 6.045602750778198, "epoch": 2.4920277902734043, "grad_norm": 1.171875, "learning_rate": 0.00043822520100195015, "loss": 5.5899, "mean_token_accuracy": 0.18199221044778824, "num_tokens": 48768469.0, "step": 24930 }, { "entropy": 6.039363145828247, "epoch": 2.492527615334633, "grad_norm": 1.1796875, "learning_rate": 0.00043820063486151267, "loss": 5.5378, "mean_token_accuracy": 0.18527698665857315, "num_tokens": 48778142.0, "step": 24935 }, { "entropy": 5.984345245361328, "epoch": 2.4930274403958617, "grad_norm": 1.21875, "learning_rate": 0.00043817606461498933, "loss": 5.5747, "mean_token_accuracy": 0.18233220130205155, "num_tokens": 48787224.0, "step": 24940 }, { "entropy": 6.118548917770386, "epoch": 2.49352726545709, "grad_norm": 1.1328125, "learning_rate": 0.00043815149026299823, "loss": 5.7267, "mean_token_accuracy": 0.17018845975399016, "num_tokens": 48797098.0, "step": 24945 }, { "entropy": 6.061496067047119, "epoch": 2.4940270905183186, "grad_norm": 1.078125, "learning_rate": 0.0004381269118061575, "loss": 5.6343, "mean_token_accuracy": 0.18324929624795913, "num_tokens": 48806764.0, "step": 24950 }, { "entropy": 6.0604229927062985, "epoch": 2.4945269155795473, "grad_norm": 1.0546875, "learning_rate": 0.0004381023292450857, "loss": 5.6639, "mean_token_accuracy": 0.1797009602189064, "num_tokens": 48818586.0, "step": 24955 }, { "entropy": 6.06632399559021, "epoch": 2.4950267406407756, "grad_norm": 1.140625, "learning_rate": 0.0004380777425804012, "loss": 5.6507, "mean_token_accuracy": 0.17895990014076232, "num_tokens": 48829229.0, "step": 24960 }, { "entropy": 6.046884441375733, "epoch": 2.4955265657020043, "grad_norm": 1.671875, "learning_rate": 0.00043805315181272275, "loss": 5.6135, "mean_token_accuracy": 0.18339742571115494, "num_tokens": 48838118.0, "step": 24965 }, { "entropy": 6.119746303558349, "epoch": 2.496026390763233, "grad_norm": 1.109375, "learning_rate": 0.0004380285569426689, "loss": 5.7337, "mean_token_accuracy": 0.16795803606510162, "num_tokens": 48847607.0, "step": 24970 }, { "entropy": 6.010901832580567, "epoch": 2.4965262158244617, "grad_norm": 1.2265625, "learning_rate": 0.0004380039579708586, "loss": 5.5346, "mean_token_accuracy": 0.18282132595777512, "num_tokens": 48856857.0, "step": 24975 }, { "entropy": 6.070848655700684, "epoch": 2.49702604088569, "grad_norm": 1.3203125, "learning_rate": 0.0004379793548979105, "loss": 5.6424, "mean_token_accuracy": 0.16897690296173096, "num_tokens": 48866145.0, "step": 24980 }, { "entropy": 6.027194166183472, "epoch": 2.4975258659469186, "grad_norm": 1.1953125, "learning_rate": 0.0004379547477244439, "loss": 5.6872, "mean_token_accuracy": 0.17480212301015854, "num_tokens": 48875941.0, "step": 24985 }, { "entropy": 6.02831883430481, "epoch": 2.4980256910081473, "grad_norm": 1.1171875, "learning_rate": 0.0004379301364510777, "loss": 5.5507, "mean_token_accuracy": 0.18451263010501862, "num_tokens": 48885870.0, "step": 24990 }, { "entropy": 6.083881568908692, "epoch": 2.4985255160693756, "grad_norm": 1.234375, "learning_rate": 0.0004379055210784313, "loss": 5.7027, "mean_token_accuracy": 0.1724776640534401, "num_tokens": 48896358.0, "step": 24995 }, { "entropy": 6.001648902893066, "epoch": 2.4990253411306043, "grad_norm": 1.140625, "learning_rate": 0.0004378809016071238, "loss": 5.6181, "mean_token_accuracy": 0.18031176626682283, "num_tokens": 48905397.0, "step": 25000 }, { "entropy": 6.044512462615967, "epoch": 2.499525166191833, "grad_norm": 1.1875, "learning_rate": 0.0004378562780377748, "loss": 5.6451, "mean_token_accuracy": 0.17894630879163742, "num_tokens": 48914385.0, "step": 25005 }, { "entropy": 6.008898019790649, "epoch": 2.5000249912530617, "grad_norm": 1.1953125, "learning_rate": 0.0004378316503710037, "loss": 5.5719, "mean_token_accuracy": 0.17830283790826798, "num_tokens": 48923515.0, "step": 25010 }, { "entropy": 5.9953066349029545, "epoch": 2.50052481631429, "grad_norm": 1.203125, "learning_rate": 0.0004378070186074302, "loss": 5.634, "mean_token_accuracy": 0.18055628687143327, "num_tokens": 48933210.0, "step": 25015 }, { "entropy": 6.0515271663665775, "epoch": 2.5010246413755186, "grad_norm": 1.140625, "learning_rate": 0.00043778238274767395, "loss": 5.6509, "mean_token_accuracy": 0.17209518253803252, "num_tokens": 48944292.0, "step": 25020 }, { "entropy": 6.050311803817749, "epoch": 2.501524466436747, "grad_norm": 1.21875, "learning_rate": 0.0004377577427923549, "loss": 5.5112, "mean_token_accuracy": 0.18575663566589357, "num_tokens": 48953883.0, "step": 25025 }, { "entropy": 6.065893030166626, "epoch": 2.5020242914979756, "grad_norm": 1.1328125, "learning_rate": 0.00043773309874209294, "loss": 5.5693, "mean_token_accuracy": 0.1796652555465698, "num_tokens": 48963779.0, "step": 25030 }, { "entropy": 6.102937984466553, "epoch": 2.5025241165592043, "grad_norm": 1.1875, "learning_rate": 0.00043770845059750807, "loss": 5.6457, "mean_token_accuracy": 0.17736321836709976, "num_tokens": 48972821.0, "step": 25035 }, { "entropy": 5.9912560939788815, "epoch": 2.503023941620433, "grad_norm": 1.09375, "learning_rate": 0.00043768379835922044, "loss": 5.6752, "mean_token_accuracy": 0.17770739793777465, "num_tokens": 48984288.0, "step": 25040 }, { "entropy": 6.055075931549072, "epoch": 2.5035237666816617, "grad_norm": 1.203125, "learning_rate": 0.0004376591420278503, "loss": 5.7156, "mean_token_accuracy": 0.16942063421010972, "num_tokens": 48994225.0, "step": 25045 }, { "entropy": 6.075097703933716, "epoch": 2.50402359174289, "grad_norm": 1.125, "learning_rate": 0.000437634481604018, "loss": 5.5965, "mean_token_accuracy": 0.17431594133377076, "num_tokens": 49004203.0, "step": 25050 }, { "entropy": 6.028526782989502, "epoch": 2.5045234168041186, "grad_norm": 1.1484375, "learning_rate": 0.000437609817088344, "loss": 5.6074, "mean_token_accuracy": 0.173251773416996, "num_tokens": 49014201.0, "step": 25055 }, { "entropy": 6.105017900466919, "epoch": 2.505023241865347, "grad_norm": 1.28125, "learning_rate": 0.00043758514848144886, "loss": 5.7172, "mean_token_accuracy": 0.17543850988149642, "num_tokens": 49022996.0, "step": 25060 }, { "entropy": 6.0873534202575685, "epoch": 2.5055230669265756, "grad_norm": 1.171875, "learning_rate": 0.0004375604757839532, "loss": 5.6686, "mean_token_accuracy": 0.17018261998891832, "num_tokens": 49033040.0, "step": 25065 }, { "entropy": 6.000858497619629, "epoch": 2.5060228919878043, "grad_norm": 1.1171875, "learning_rate": 0.00043753579899647783, "loss": 5.6568, "mean_token_accuracy": 0.17732374519109725, "num_tokens": 49043389.0, "step": 25070 }, { "entropy": 6.012435579299927, "epoch": 2.506522717049033, "grad_norm": 1.1875, "learning_rate": 0.00043751111811964353, "loss": 5.5275, "mean_token_accuracy": 0.18435606658458709, "num_tokens": 49052558.0, "step": 25075 }, { "entropy": 6.094233798980713, "epoch": 2.5070225421102617, "grad_norm": 1.1640625, "learning_rate": 0.0004374864331540713, "loss": 5.7678, "mean_token_accuracy": 0.16986480355262756, "num_tokens": 49062911.0, "step": 25080 }, { "entropy": 6.049513721466065, "epoch": 2.50752236717149, "grad_norm": 1.09375, "learning_rate": 0.0004374617441003823, "loss": 5.6425, "mean_token_accuracy": 0.17896757274866104, "num_tokens": 49072411.0, "step": 25085 }, { "entropy": 6.044946098327637, "epoch": 2.5080221922327186, "grad_norm": 1.25, "learning_rate": 0.0004374370509591976, "loss": 5.6071, "mean_token_accuracy": 0.17536772042512894, "num_tokens": 49082568.0, "step": 25090 }, { "entropy": 5.867707920074463, "epoch": 2.508522017293947, "grad_norm": 1.203125, "learning_rate": 0.00043741235373113854, "loss": 5.4659, "mean_token_accuracy": 0.19555341750383376, "num_tokens": 49092015.0, "step": 25095 }, { "entropy": 6.036697721481323, "epoch": 2.5090218423551756, "grad_norm": 1.15625, "learning_rate": 0.00043738765241682637, "loss": 5.5988, "mean_token_accuracy": 0.18216451704502107, "num_tokens": 49102877.0, "step": 25100 }, { "entropy": 6.075890159606933, "epoch": 2.5095216674164043, "grad_norm": 1.25, "learning_rate": 0.0004373629470168826, "loss": 5.5624, "mean_token_accuracy": 0.18062067031860352, "num_tokens": 49112227.0, "step": 25105 }, { "entropy": 5.971792364120484, "epoch": 2.510021492477633, "grad_norm": 1.1875, "learning_rate": 0.000437338237531929, "loss": 5.5788, "mean_token_accuracy": 0.18243009746074676, "num_tokens": 49122840.0, "step": 25110 }, { "entropy": 6.00071120262146, "epoch": 2.5105213175388617, "grad_norm": 1.0625, "learning_rate": 0.0004373135239625871, "loss": 5.7083, "mean_token_accuracy": 0.16833251267671584, "num_tokens": 49134067.0, "step": 25115 }, { "entropy": 6.030641412734985, "epoch": 2.51102114260009, "grad_norm": 1.1484375, "learning_rate": 0.00043728880630947864, "loss": 5.5978, "mean_token_accuracy": 0.1821572884917259, "num_tokens": 49144176.0, "step": 25120 }, { "entropy": 6.0262586116790775, "epoch": 2.5115209676613186, "grad_norm": 1.078125, "learning_rate": 0.00043726408457322557, "loss": 5.6235, "mean_token_accuracy": 0.17565979063510895, "num_tokens": 49153559.0, "step": 25125 }, { "entropy": 6.071233510971069, "epoch": 2.512020792722547, "grad_norm": 1.03125, "learning_rate": 0.00043723935875445, "loss": 5.5805, "mean_token_accuracy": 0.18248115330934525, "num_tokens": 49164604.0, "step": 25130 }, { "entropy": 6.069117593765259, "epoch": 2.5125206177837756, "grad_norm": 1.3359375, "learning_rate": 0.0004372146288537738, "loss": 5.6067, "mean_token_accuracy": 0.17795564234256744, "num_tokens": 49173766.0, "step": 25135 }, { "entropy": 6.006809520721435, "epoch": 2.5130204428450043, "grad_norm": 1.2734375, "learning_rate": 0.00043718989487181927, "loss": 5.6354, "mean_token_accuracy": 0.18981001079082488, "num_tokens": 49183244.0, "step": 25140 }, { "entropy": 6.025494766235352, "epoch": 2.513520267906233, "grad_norm": 1.0703125, "learning_rate": 0.0004371651568092088, "loss": 5.6461, "mean_token_accuracy": 0.1768049716949463, "num_tokens": 49194256.0, "step": 25145 }, { "entropy": 6.061176586151123, "epoch": 2.5140200929674617, "grad_norm": 1.1171875, "learning_rate": 0.0004371404146665647, "loss": 5.6793, "mean_token_accuracy": 0.17346113920211792, "num_tokens": 49204680.0, "step": 25150 }, { "entropy": 6.095919847488403, "epoch": 2.51451991802869, "grad_norm": 1.109375, "learning_rate": 0.00043711566844450934, "loss": 5.6165, "mean_token_accuracy": 0.17150792479515076, "num_tokens": 49213918.0, "step": 25155 }, { "entropy": 6.030353689193726, "epoch": 2.5150197430899186, "grad_norm": 1.0859375, "learning_rate": 0.00043709091814366565, "loss": 5.5437, "mean_token_accuracy": 0.18178821206092835, "num_tokens": 49223087.0, "step": 25160 }, { "entropy": 5.9685650825500485, "epoch": 2.515519568151147, "grad_norm": 1.109375, "learning_rate": 0.00043706616376465614, "loss": 5.4869, "mean_token_accuracy": 0.18629635870456696, "num_tokens": 49232072.0, "step": 25165 }, { "entropy": 5.988086795806884, "epoch": 2.5160193932123756, "grad_norm": 1.1171875, "learning_rate": 0.0004370414053081036, "loss": 5.5659, "mean_token_accuracy": 0.18271913081407548, "num_tokens": 49241772.0, "step": 25170 }, { "entropy": 6.056657838821411, "epoch": 2.5165192182736043, "grad_norm": 1.25, "learning_rate": 0.000437016642774631, "loss": 5.6235, "mean_token_accuracy": 0.1739221304655075, "num_tokens": 49250605.0, "step": 25175 }, { "entropy": 6.040666770935059, "epoch": 2.517019043334833, "grad_norm": 1.09375, "learning_rate": 0.00043699187616486144, "loss": 5.6627, "mean_token_accuracy": 0.17961738407611846, "num_tokens": 49261104.0, "step": 25180 }, { "entropy": 6.145008134841919, "epoch": 2.5175188683960616, "grad_norm": 1.015625, "learning_rate": 0.0004369671054794178, "loss": 5.8294, "mean_token_accuracy": 0.16986077427864074, "num_tokens": 49271456.0, "step": 25185 }, { "entropy": 6.0523652076721195, "epoch": 2.51801869345729, "grad_norm": 1.1875, "learning_rate": 0.00043694233071892366, "loss": 5.5819, "mean_token_accuracy": 0.18392395377159118, "num_tokens": 49279917.0, "step": 25190 }, { "entropy": 5.972069358825683, "epoch": 2.5185185185185186, "grad_norm": 1.1328125, "learning_rate": 0.00043691755188400203, "loss": 5.6312, "mean_token_accuracy": 0.1784198224544525, "num_tokens": 49290961.0, "step": 25195 }, { "entropy": 6.065690803527832, "epoch": 2.519018343579747, "grad_norm": 1.859375, "learning_rate": 0.0004368927689752765, "loss": 5.6502, "mean_token_accuracy": 0.1757780894637108, "num_tokens": 49299813.0, "step": 25200 }, { "entropy": 6.076753377914429, "epoch": 2.5195181686409756, "grad_norm": 1.140625, "learning_rate": 0.00043686798199337053, "loss": 5.6306, "mean_token_accuracy": 0.18513433039188384, "num_tokens": 49309041.0, "step": 25205 }, { "entropy": 6.012153911590576, "epoch": 2.5200179937022043, "grad_norm": 1.1640625, "learning_rate": 0.00043684319093890777, "loss": 5.5615, "mean_token_accuracy": 0.1849941283464432, "num_tokens": 49318647.0, "step": 25210 }, { "entropy": 5.978040981292724, "epoch": 2.520517818763433, "grad_norm": 1.2734375, "learning_rate": 0.00043681839581251206, "loss": 5.5916, "mean_token_accuracy": 0.19100126773118972, "num_tokens": 49328410.0, "step": 25215 }, { "entropy": 6.062349796295166, "epoch": 2.521017643824661, "grad_norm": 1.1484375, "learning_rate": 0.00043679359661480703, "loss": 5.6748, "mean_token_accuracy": 0.17783855497837067, "num_tokens": 49337766.0, "step": 25220 }, { "entropy": 5.918380832672119, "epoch": 2.52151746888589, "grad_norm": 1.1328125, "learning_rate": 0.00043676879334641686, "loss": 5.3976, "mean_token_accuracy": 0.19796301275491715, "num_tokens": 49348512.0, "step": 25225 }, { "entropy": 6.0247735500335695, "epoch": 2.5220172939471186, "grad_norm": 1.125, "learning_rate": 0.0004367439860079654, "loss": 5.6354, "mean_token_accuracy": 0.18012164831161498, "num_tokens": 49359149.0, "step": 25230 }, { "entropy": 6.091040849685669, "epoch": 2.522517119008347, "grad_norm": 1.1640625, "learning_rate": 0.00043671917460007693, "loss": 5.6259, "mean_token_accuracy": 0.1822964921593666, "num_tokens": 49368083.0, "step": 25235 }, { "entropy": 6.041050291061401, "epoch": 2.5230169440695756, "grad_norm": 1.140625, "learning_rate": 0.00043669435912337557, "loss": 5.6425, "mean_token_accuracy": 0.1778501570224762, "num_tokens": 49378205.0, "step": 25240 }, { "entropy": 6.019012355804444, "epoch": 2.5235167691308042, "grad_norm": 1.1328125, "learning_rate": 0.0004366695395784858, "loss": 5.6751, "mean_token_accuracy": 0.1778057411313057, "num_tokens": 49388405.0, "step": 25245 }, { "entropy": 5.997595739364624, "epoch": 2.524016594192033, "grad_norm": 1.140625, "learning_rate": 0.000436644715966032, "loss": 5.5482, "mean_token_accuracy": 0.18680273592472077, "num_tokens": 49397966.0, "step": 25250 }, { "entropy": 6.153399705886841, "epoch": 2.524516419253261, "grad_norm": 1.1328125, "learning_rate": 0.0004366198882866387, "loss": 5.7685, "mean_token_accuracy": 0.16822992712259294, "num_tokens": 49408542.0, "step": 25255 }, { "entropy": 6.036305332183838, "epoch": 2.52501624431449, "grad_norm": 1.140625, "learning_rate": 0.00043659505654093065, "loss": 5.6367, "mean_token_accuracy": 0.17789907306432723, "num_tokens": 49417499.0, "step": 25260 }, { "entropy": 5.992561960220337, "epoch": 2.5255160693757186, "grad_norm": 1.1328125, "learning_rate": 0.00043657022072953253, "loss": 5.6278, "mean_token_accuracy": 0.18159418404102326, "num_tokens": 49426962.0, "step": 25265 }, { "entropy": 5.993246078491211, "epoch": 2.526015894436947, "grad_norm": 1.0546875, "learning_rate": 0.0004365453808530693, "loss": 5.6104, "mean_token_accuracy": 0.17739917039871217, "num_tokens": 49437188.0, "step": 25270 }, { "entropy": 6.034706115722656, "epoch": 2.5265157194981755, "grad_norm": 1.1171875, "learning_rate": 0.00043652053691216574, "loss": 5.631, "mean_token_accuracy": 0.18205156922340393, "num_tokens": 49446939.0, "step": 25275 }, { "entropy": 6.092603158950806, "epoch": 2.5270155445594042, "grad_norm": 1.0234375, "learning_rate": 0.0004364956889074471, "loss": 5.6408, "mean_token_accuracy": 0.1872210055589676, "num_tokens": 49458160.0, "step": 25280 }, { "entropy": 5.978191137313843, "epoch": 2.527515369620633, "grad_norm": 1.203125, "learning_rate": 0.0004364708368395385, "loss": 5.6507, "mean_token_accuracy": 0.1771152511239052, "num_tokens": 49468284.0, "step": 25285 }, { "entropy": 6.10216760635376, "epoch": 2.528015194681861, "grad_norm": 1.046875, "learning_rate": 0.00043644598070906516, "loss": 5.6645, "mean_token_accuracy": 0.18177282959222793, "num_tokens": 49479348.0, "step": 25290 }, { "entropy": 6.01823058128357, "epoch": 2.52851501974309, "grad_norm": 1.234375, "learning_rate": 0.0004364211205166525, "loss": 5.4856, "mean_token_accuracy": 0.19238427877426148, "num_tokens": 49488802.0, "step": 25295 }, { "entropy": 6.044792556762696, "epoch": 2.5290148448043186, "grad_norm": 1.2265625, "learning_rate": 0.00043639625626292595, "loss": 5.6376, "mean_token_accuracy": 0.17598474770784378, "num_tokens": 49498682.0, "step": 25300 }, { "entropy": 6.007976961135864, "epoch": 2.529514669865547, "grad_norm": 1.1796875, "learning_rate": 0.0004363713879485112, "loss": 5.5331, "mean_token_accuracy": 0.18759500831365586, "num_tokens": 49507530.0, "step": 25305 }, { "entropy": 5.994236707687378, "epoch": 2.5300144949267755, "grad_norm": 1.125, "learning_rate": 0.0004363465155740338, "loss": 5.5232, "mean_token_accuracy": 0.18273307830095292, "num_tokens": 49518435.0, "step": 25310 }, { "entropy": 5.991797018051147, "epoch": 2.5305143199880042, "grad_norm": 1.328125, "learning_rate": 0.0004363216391401196, "loss": 5.5688, "mean_token_accuracy": 0.1822097510099411, "num_tokens": 49528251.0, "step": 25315 }, { "entropy": 6.003828430175782, "epoch": 2.531014145049233, "grad_norm": 1.1484375, "learning_rate": 0.0004362967586473945, "loss": 5.5654, "mean_token_accuracy": 0.18492062091827394, "num_tokens": 49536884.0, "step": 25320 }, { "entropy": 5.95617413520813, "epoch": 2.531513970110461, "grad_norm": 1.265625, "learning_rate": 0.0004362718740964844, "loss": 5.5373, "mean_token_accuracy": 0.18656033873558045, "num_tokens": 49547665.0, "step": 25325 }, { "entropy": 6.114248847961425, "epoch": 2.53201379517169, "grad_norm": 1.1328125, "learning_rate": 0.0004362469854880155, "loss": 5.7334, "mean_token_accuracy": 0.1700616106390953, "num_tokens": 49557413.0, "step": 25330 }, { "entropy": 6.095935344696045, "epoch": 2.5325136202329186, "grad_norm": 1.1875, "learning_rate": 0.0004362220928226139, "loss": 5.649, "mean_token_accuracy": 0.17813128232955933, "num_tokens": 49566305.0, "step": 25335 }, { "entropy": 6.034753036499024, "epoch": 2.533013445294147, "grad_norm": 1.1328125, "learning_rate": 0.00043619719610090595, "loss": 5.5649, "mean_token_accuracy": 0.17807136476039886, "num_tokens": 49576020.0, "step": 25340 }, { "entropy": 5.994367885589599, "epoch": 2.5335132703553755, "grad_norm": 1.0234375, "learning_rate": 0.000436172295323518, "loss": 5.61, "mean_token_accuracy": 0.17901006191968918, "num_tokens": 49586564.0, "step": 25345 }, { "entropy": 6.015358400344849, "epoch": 2.5340130954166042, "grad_norm": 1.1328125, "learning_rate": 0.00043614739049107666, "loss": 5.6618, "mean_token_accuracy": 0.17742062509059905, "num_tokens": 49595874.0, "step": 25350 }, { "entropy": 6.009614944458008, "epoch": 2.534512920477833, "grad_norm": 1.1484375, "learning_rate": 0.00043612248160420833, "loss": 5.588, "mean_token_accuracy": 0.18059496730566024, "num_tokens": 49605975.0, "step": 25355 }, { "entropy": 6.009717226028442, "epoch": 2.535012745539061, "grad_norm": 1.3515625, "learning_rate": 0.00043609756866353985, "loss": 5.5102, "mean_token_accuracy": 0.18871124386787413, "num_tokens": 49615187.0, "step": 25360 }, { "entropy": 6.029205703735352, "epoch": 2.53551257060029, "grad_norm": 1.1328125, "learning_rate": 0.000436072651669698, "loss": 5.6382, "mean_token_accuracy": 0.1747574746608734, "num_tokens": 49624660.0, "step": 25365 }, { "entropy": 6.011563634872436, "epoch": 2.5360123956615186, "grad_norm": 1.109375, "learning_rate": 0.0004360477306233097, "loss": 5.556, "mean_token_accuracy": 0.1844378799200058, "num_tokens": 49635450.0, "step": 25370 }, { "entropy": 6.05139536857605, "epoch": 2.536512220722747, "grad_norm": 1.1640625, "learning_rate": 0.00043602280552500195, "loss": 5.6691, "mean_token_accuracy": 0.16905487477779388, "num_tokens": 49646466.0, "step": 25375 }, { "entropy": 6.113451194763184, "epoch": 2.5370120457839755, "grad_norm": 1.34375, "learning_rate": 0.00043599787637540186, "loss": 5.6956, "mean_token_accuracy": 0.17256094217300416, "num_tokens": 49655440.0, "step": 25380 }, { "entropy": 6.054423809051514, "epoch": 2.5375118708452042, "grad_norm": 1.15625, "learning_rate": 0.00043597294317513654, "loss": 5.5613, "mean_token_accuracy": 0.18028899431228637, "num_tokens": 49664072.0, "step": 25385 }, { "entropy": 5.994001293182373, "epoch": 2.538011695906433, "grad_norm": 1.1640625, "learning_rate": 0.00043594800592483345, "loss": 5.6182, "mean_token_accuracy": 0.17664668411016465, "num_tokens": 49673439.0, "step": 25390 }, { "entropy": 5.980083274841308, "epoch": 2.538511520967661, "grad_norm": 1.0703125, "learning_rate": 0.00043592306462511993, "loss": 5.6216, "mean_token_accuracy": 0.18011473268270492, "num_tokens": 49682307.0, "step": 25395 }, { "entropy": 5.964274120330811, "epoch": 2.53901134602889, "grad_norm": 1.328125, "learning_rate": 0.00043589811927662356, "loss": 5.4348, "mean_token_accuracy": 0.20402052253484726, "num_tokens": 49692146.0, "step": 25400 }, { "entropy": 6.066128540039062, "epoch": 2.5395111710901186, "grad_norm": 1.15625, "learning_rate": 0.00043587316987997183, "loss": 5.6341, "mean_token_accuracy": 0.17935866862535477, "num_tokens": 49701465.0, "step": 25405 }, { "entropy": 6.024795246124268, "epoch": 2.540010996151347, "grad_norm": 1.1796875, "learning_rate": 0.00043584821643579265, "loss": 5.6271, "mean_token_accuracy": 0.18314309418201447, "num_tokens": 49711845.0, "step": 25410 }, { "entropy": 6.092045021057129, "epoch": 2.5405108212125755, "grad_norm": 1.2109375, "learning_rate": 0.00043582325894471366, "loss": 5.5653, "mean_token_accuracy": 0.1764240488409996, "num_tokens": 49721078.0, "step": 25415 }, { "entropy": 6.028663539886475, "epoch": 2.5410106462738042, "grad_norm": 1.140625, "learning_rate": 0.0004357982974073629, "loss": 5.6284, "mean_token_accuracy": 0.1777789130806923, "num_tokens": 49730987.0, "step": 25420 }, { "entropy": 5.980686998367309, "epoch": 2.541510471335033, "grad_norm": 1.109375, "learning_rate": 0.0004357733318243683, "loss": 5.4692, "mean_token_accuracy": 0.18540041148662567, "num_tokens": 49741688.0, "step": 25425 }, { "entropy": 6.100413751602173, "epoch": 2.542010296396261, "grad_norm": 1.25, "learning_rate": 0.00043574836219635805, "loss": 5.6791, "mean_token_accuracy": 0.17465580850839615, "num_tokens": 49750835.0, "step": 25430 }, { "entropy": 6.015394973754883, "epoch": 2.54251012145749, "grad_norm": 1.140625, "learning_rate": 0.00043572338852396035, "loss": 5.6489, "mean_token_accuracy": 0.17566115111112596, "num_tokens": 49760654.0, "step": 25435 }, { "entropy": 6.024277639389038, "epoch": 2.5430099465187186, "grad_norm": 1.1171875, "learning_rate": 0.00043569841080780367, "loss": 5.5931, "mean_token_accuracy": 0.18078823685646056, "num_tokens": 49771367.0, "step": 25440 }, { "entropy": 6.050155544281006, "epoch": 2.543509771579947, "grad_norm": 1.21875, "learning_rate": 0.00043567342904851625, "loss": 5.5926, "mean_token_accuracy": 0.18332703709602355, "num_tokens": 49781302.0, "step": 25445 }, { "entropy": 6.02756781578064, "epoch": 2.5440095966411755, "grad_norm": 1.1796875, "learning_rate": 0.0004356484432467267, "loss": 5.6845, "mean_token_accuracy": 0.1789763554930687, "num_tokens": 49790659.0, "step": 25450 }, { "entropy": 6.087275266647339, "epoch": 2.5445094217024042, "grad_norm": 1.1796875, "learning_rate": 0.00043562345340306363, "loss": 5.6837, "mean_token_accuracy": 0.18042251095175743, "num_tokens": 49800285.0, "step": 25455 }, { "entropy": 6.01382303237915, "epoch": 2.545009246763633, "grad_norm": 1.1484375, "learning_rate": 0.0004355984595181559, "loss": 5.6243, "mean_token_accuracy": 0.17223508059978485, "num_tokens": 49810810.0, "step": 25460 }, { "entropy": 6.042003631591797, "epoch": 2.545509071824861, "grad_norm": 1.1171875, "learning_rate": 0.0004355734615926321, "loss": 5.6345, "mean_token_accuracy": 0.17739037722349166, "num_tokens": 49820728.0, "step": 25465 }, { "entropy": 6.147556495666504, "epoch": 2.54600889688609, "grad_norm": 1.421875, "learning_rate": 0.0004355484596271214, "loss": 5.6346, "mean_token_accuracy": 0.17091596573591233, "num_tokens": 49830477.0, "step": 25470 }, { "entropy": 6.057489967346191, "epoch": 2.5465087219473186, "grad_norm": 1.140625, "learning_rate": 0.0004355234536222528, "loss": 5.677, "mean_token_accuracy": 0.180227130651474, "num_tokens": 49839154.0, "step": 25475 }, { "entropy": 5.995430994033813, "epoch": 2.547008547008547, "grad_norm": 1.09375, "learning_rate": 0.0004354984435786554, "loss": 5.6145, "mean_token_accuracy": 0.18437059670686723, "num_tokens": 49848894.0, "step": 25480 }, { "entropy": 6.053682088851929, "epoch": 2.5475083720697755, "grad_norm": 1.1328125, "learning_rate": 0.0004354734294969585, "loss": 5.6448, "mean_token_accuracy": 0.17560249119997023, "num_tokens": 49858730.0, "step": 25485 }, { "entropy": 6.0430680274963375, "epoch": 2.5480081971310042, "grad_norm": 1.0390625, "learning_rate": 0.00043544841137779127, "loss": 5.6625, "mean_token_accuracy": 0.17362688183784486, "num_tokens": 49868553.0, "step": 25490 }, { "entropy": 6.025748443603516, "epoch": 2.548508022192233, "grad_norm": 1.1796875, "learning_rate": 0.00043542338922178343, "loss": 5.613, "mean_token_accuracy": 0.18889534920454026, "num_tokens": 49878053.0, "step": 25495 }, { "entropy": 6.099374437332154, "epoch": 2.549007847253461, "grad_norm": 1.2421875, "learning_rate": 0.00043539836302956434, "loss": 5.5851, "mean_token_accuracy": 0.17879965305328369, "num_tokens": 49888693.0, "step": 25500 }, { "entropy": 6.131494474411011, "epoch": 2.54950767231469, "grad_norm": 1.2265625, "learning_rate": 0.0004353733328017637, "loss": 5.6144, "mean_token_accuracy": 0.17619494944810868, "num_tokens": 49899094.0, "step": 25505 }, { "entropy": 6.133269166946411, "epoch": 2.5500074973759186, "grad_norm": 1.2578125, "learning_rate": 0.0004353482985390113, "loss": 5.673, "mean_token_accuracy": 0.18462652266025542, "num_tokens": 49909341.0, "step": 25510 }, { "entropy": 5.968445491790772, "epoch": 2.550507322437147, "grad_norm": 1.1796875, "learning_rate": 0.000435323260241937, "loss": 5.6024, "mean_token_accuracy": 0.1810848668217659, "num_tokens": 49919602.0, "step": 25515 }, { "entropy": 5.965293502807617, "epoch": 2.5510071474983755, "grad_norm": 1.1015625, "learning_rate": 0.00043529821791117064, "loss": 5.6219, "mean_token_accuracy": 0.17873027920722961, "num_tokens": 49928958.0, "step": 25520 }, { "entropy": 5.9788017749786375, "epoch": 2.5515069725596042, "grad_norm": 1.0625, "learning_rate": 0.0004352731715473425, "loss": 5.5856, "mean_token_accuracy": 0.18194237500429153, "num_tokens": 49938988.0, "step": 25525 }, { "entropy": 6.046966457366944, "epoch": 2.552006797620833, "grad_norm": 1.265625, "learning_rate": 0.00043524812115108244, "loss": 5.6952, "mean_token_accuracy": 0.17284610718488694, "num_tokens": 49949399.0, "step": 25530 }, { "entropy": 6.1115538597106935, "epoch": 2.552506622682061, "grad_norm": 1.015625, "learning_rate": 0.00043522306672302103, "loss": 5.5194, "mean_token_accuracy": 0.1862720087170601, "num_tokens": 49958666.0, "step": 25535 }, { "entropy": 5.955815744400025, "epoch": 2.55300644774329, "grad_norm": 1.1328125, "learning_rate": 0.0004351980082637884, "loss": 5.5603, "mean_token_accuracy": 0.17760927379131317, "num_tokens": 49967739.0, "step": 25540 }, { "entropy": 5.980245542526245, "epoch": 2.5535062728045186, "grad_norm": 1.1484375, "learning_rate": 0.00043517294577401504, "loss": 5.6348, "mean_token_accuracy": 0.17998246103525162, "num_tokens": 49976980.0, "step": 25545 }, { "entropy": 6.066369438171387, "epoch": 2.554006097865747, "grad_norm": 1.1484375, "learning_rate": 0.00043514787925433176, "loss": 5.6491, "mean_token_accuracy": 0.17950748652219772, "num_tokens": 49986963.0, "step": 25550 }, { "entropy": 6.069003391265869, "epoch": 2.5545059229269755, "grad_norm": 1.34375, "learning_rate": 0.0004351228087053689, "loss": 5.6882, "mean_token_accuracy": 0.17043259590864182, "num_tokens": 49996009.0, "step": 25555 }, { "entropy": 6.056478214263916, "epoch": 2.5550057479882042, "grad_norm": 1.125, "learning_rate": 0.00043509773412775746, "loss": 5.6267, "mean_token_accuracy": 0.18063177168369293, "num_tokens": 50006346.0, "step": 25560 }, { "entropy": 5.996723461151123, "epoch": 2.555505573049433, "grad_norm": 1.0703125, "learning_rate": 0.0004350726555221282, "loss": 5.6152, "mean_token_accuracy": 0.184835746884346, "num_tokens": 50016512.0, "step": 25565 }, { "entropy": 5.977815723419189, "epoch": 2.556005398110661, "grad_norm": 1.1796875, "learning_rate": 0.0004350475728891121, "loss": 5.5994, "mean_token_accuracy": 0.17891016304492952, "num_tokens": 50027012.0, "step": 25570 }, { "entropy": 5.877023506164551, "epoch": 2.55650522317189, "grad_norm": 1.09375, "learning_rate": 0.0004350224862293403, "loss": 5.3546, "mean_token_accuracy": 0.19795173555612564, "num_tokens": 50036869.0, "step": 25575 }, { "entropy": 6.014264249801636, "epoch": 2.557005048233118, "grad_norm": 1.1171875, "learning_rate": 0.00043499739554344393, "loss": 5.5546, "mean_token_accuracy": 0.18941827565431596, "num_tokens": 50046186.0, "step": 25580 }, { "entropy": 6.00124077796936, "epoch": 2.557504873294347, "grad_norm": 1.0625, "learning_rate": 0.00043497230083205425, "loss": 5.5946, "mean_token_accuracy": 0.18423697650432586, "num_tokens": 50056915.0, "step": 25585 }, { "entropy": 5.944492197036743, "epoch": 2.5580046983555755, "grad_norm": 1.140625, "learning_rate": 0.0004349472020958026, "loss": 5.5413, "mean_token_accuracy": 0.18634007275104522, "num_tokens": 50066143.0, "step": 25590 }, { "entropy": 5.989619445800781, "epoch": 2.5585045234168042, "grad_norm": 1.125, "learning_rate": 0.00043492209933532054, "loss": 5.603, "mean_token_accuracy": 0.17646386176347734, "num_tokens": 50077031.0, "step": 25595 }, { "entropy": 6.089145040512085, "epoch": 2.559004348478033, "grad_norm": 1.2109375, "learning_rate": 0.00043489699255123954, "loss": 5.7378, "mean_token_accuracy": 0.16738774478435517, "num_tokens": 50087545.0, "step": 25600 }, { "entropy": 6.049642419815063, "epoch": 2.559504173539261, "grad_norm": 1.1015625, "learning_rate": 0.0004348718817441914, "loss": 5.5585, "mean_token_accuracy": 0.1843509331345558, "num_tokens": 50096427.0, "step": 25605 }, { "entropy": 6.016114950180054, "epoch": 2.56000399860049, "grad_norm": 1.21875, "learning_rate": 0.0004348467669148078, "loss": 5.5683, "mean_token_accuracy": 0.18083107471466064, "num_tokens": 50105382.0, "step": 25610 }, { "entropy": 6.083285808563232, "epoch": 2.560503823661718, "grad_norm": 1.1953125, "learning_rate": 0.00043482164806372075, "loss": 5.7319, "mean_token_accuracy": 0.16666824072599412, "num_tokens": 50116348.0, "step": 25615 }, { "entropy": 6.08129768371582, "epoch": 2.561003648722947, "grad_norm": 1.125, "learning_rate": 0.0004347965251915622, "loss": 5.6009, "mean_token_accuracy": 0.17826835811138153, "num_tokens": 50126081.0, "step": 25620 }, { "entropy": 6.034533262252808, "epoch": 2.5615034737841755, "grad_norm": 1.234375, "learning_rate": 0.00043477139829896415, "loss": 5.5802, "mean_token_accuracy": 0.17995201647281647, "num_tokens": 50135719.0, "step": 25625 }, { "entropy": 5.99252610206604, "epoch": 2.5620032988454042, "grad_norm": 1.1015625, "learning_rate": 0.00043474626738655876, "loss": 5.5793, "mean_token_accuracy": 0.1831786721944809, "num_tokens": 50146201.0, "step": 25630 }, { "entropy": 5.957275390625, "epoch": 2.562503123906633, "grad_norm": 1.1171875, "learning_rate": 0.0004347211324549785, "loss": 5.4856, "mean_token_accuracy": 0.19014020264148712, "num_tokens": 50156352.0, "step": 25635 }, { "entropy": 6.0669862747192385, "epoch": 2.563002948967861, "grad_norm": 1.2109375, "learning_rate": 0.00043469599350485556, "loss": 5.6055, "mean_token_accuracy": 0.17713395357131959, "num_tokens": 50165518.0, "step": 25640 }, { "entropy": 5.964083051681518, "epoch": 2.56350277402909, "grad_norm": 1.109375, "learning_rate": 0.0004346708505368225, "loss": 5.5269, "mean_token_accuracy": 0.1950780063867569, "num_tokens": 50173656.0, "step": 25645 }, { "entropy": 6.001626062393188, "epoch": 2.564002599090318, "grad_norm": 1.171875, "learning_rate": 0.0004346457035515121, "loss": 5.5971, "mean_token_accuracy": 0.18550993800163268, "num_tokens": 50183024.0, "step": 25650 }, { "entropy": 6.0426092624664305, "epoch": 2.564502424151547, "grad_norm": 1.109375, "learning_rate": 0.00043462055254955666, "loss": 5.7039, "mean_token_accuracy": 0.1721629187464714, "num_tokens": 50194192.0, "step": 25655 }, { "entropy": 6.059206771850586, "epoch": 2.5650022492127755, "grad_norm": 1.1640625, "learning_rate": 0.0004345953975315893, "loss": 5.6859, "mean_token_accuracy": 0.17969612330198287, "num_tokens": 50203655.0, "step": 25660 }, { "entropy": 6.127799797058105, "epoch": 2.5655020742740042, "grad_norm": 1.09375, "learning_rate": 0.0004345702384982429, "loss": 5.6889, "mean_token_accuracy": 0.1773183375597, "num_tokens": 50213400.0, "step": 25665 }, { "entropy": 6.032224178314209, "epoch": 2.566001899335233, "grad_norm": 1.1015625, "learning_rate": 0.0004345450754501502, "loss": 5.632, "mean_token_accuracy": 0.17818180918693544, "num_tokens": 50224113.0, "step": 25670 }, { "entropy": 6.0405285358428955, "epoch": 2.566501724396461, "grad_norm": 1.140625, "learning_rate": 0.00043451990838794453, "loss": 5.5842, "mean_token_accuracy": 0.1832118660211563, "num_tokens": 50232990.0, "step": 25675 }, { "entropy": 6.078109455108643, "epoch": 2.56700154945769, "grad_norm": 1.0859375, "learning_rate": 0.000434494737312259, "loss": 5.5858, "mean_token_accuracy": 0.17761754840612412, "num_tokens": 50242573.0, "step": 25680 }, { "entropy": 6.0545580863952635, "epoch": 2.567501374518918, "grad_norm": 1.0625, "learning_rate": 0.00043446956222372693, "loss": 5.6643, "mean_token_accuracy": 0.17474788576364517, "num_tokens": 50252654.0, "step": 25685 }, { "entropy": 6.002556848526001, "epoch": 2.568001199580147, "grad_norm": 1.0625, "learning_rate": 0.0004344443831229816, "loss": 5.5611, "mean_token_accuracy": 0.18188054859638214, "num_tokens": 50262654.0, "step": 25690 }, { "entropy": 6.091816329956055, "epoch": 2.5685010246413755, "grad_norm": 1.2109375, "learning_rate": 0.00043441920001065676, "loss": 5.6531, "mean_token_accuracy": 0.17601924240589142, "num_tokens": 50272653.0, "step": 25695 }, { "entropy": 6.0804407596588135, "epoch": 2.5690008497026042, "grad_norm": 1.15625, "learning_rate": 0.0004343940128873858, "loss": 5.7593, "mean_token_accuracy": 0.17241075038909912, "num_tokens": 50283157.0, "step": 25700 }, { "entropy": 5.995005989074707, "epoch": 2.569500674763833, "grad_norm": 1.25, "learning_rate": 0.00043436882175380256, "loss": 5.6333, "mean_token_accuracy": 0.18329019248485565, "num_tokens": 50292224.0, "step": 25705 }, { "entropy": 6.083192634582519, "epoch": 2.570000499825061, "grad_norm": 1.234375, "learning_rate": 0.0004343436266105407, "loss": 5.6673, "mean_token_accuracy": 0.17343535721302034, "num_tokens": 50302083.0, "step": 25710 }, { "entropy": 5.998964118957519, "epoch": 2.57050032488629, "grad_norm": 1.1953125, "learning_rate": 0.0004343184274582343, "loss": 5.5854, "mean_token_accuracy": 0.18362970650196075, "num_tokens": 50312001.0, "step": 25715 }, { "entropy": 5.999917888641358, "epoch": 2.571000149947518, "grad_norm": 1.046875, "learning_rate": 0.0004342932242975172, "loss": 5.5496, "mean_token_accuracy": 0.18245129734277726, "num_tokens": 50322652.0, "step": 25720 }, { "entropy": 6.077789354324341, "epoch": 2.571499975008747, "grad_norm": 1.2265625, "learning_rate": 0.0004342680171290235, "loss": 5.5864, "mean_token_accuracy": 0.18169565349817277, "num_tokens": 50332200.0, "step": 25725 }, { "entropy": 5.983381891250611, "epoch": 2.5719998000699755, "grad_norm": 1.140625, "learning_rate": 0.0004342428059533875, "loss": 5.5745, "mean_token_accuracy": 0.18744618743658065, "num_tokens": 50342567.0, "step": 25730 }, { "entropy": 6.007059955596924, "epoch": 2.5724996251312042, "grad_norm": 1.2109375, "learning_rate": 0.0004342175907712435, "loss": 5.6038, "mean_token_accuracy": 0.18887903541326523, "num_tokens": 50352009.0, "step": 25735 }, { "entropy": 6.005417585372925, "epoch": 2.572999450192433, "grad_norm": 1.1640625, "learning_rate": 0.00043419237158322596, "loss": 5.5962, "mean_token_accuracy": 0.1871936872601509, "num_tokens": 50362412.0, "step": 25740 }, { "entropy": 6.0767909526824955, "epoch": 2.573499275253661, "grad_norm": 1.1640625, "learning_rate": 0.00043416714838996915, "loss": 5.6514, "mean_token_accuracy": 0.17747277170419692, "num_tokens": 50372336.0, "step": 25745 }, { "entropy": 5.979908227920532, "epoch": 2.57399910031489, "grad_norm": 1.1328125, "learning_rate": 0.000434141921192108, "loss": 5.501, "mean_token_accuracy": 0.18922167420387268, "num_tokens": 50381612.0, "step": 25750 }, { "entropy": 6.00229549407959, "epoch": 2.574498925376118, "grad_norm": 1.15625, "learning_rate": 0.000434116689990277, "loss": 5.5812, "mean_token_accuracy": 0.1823129028081894, "num_tokens": 50392073.0, "step": 25755 }, { "entropy": 5.986251735687256, "epoch": 2.574998750437347, "grad_norm": 1.1640625, "learning_rate": 0.00043409145478511105, "loss": 5.5757, "mean_token_accuracy": 0.18765933960676193, "num_tokens": 50401306.0, "step": 25760 }, { "entropy": 5.965819692611694, "epoch": 2.5754985754985755, "grad_norm": 1.2734375, "learning_rate": 0.00043406621557724495, "loss": 5.6073, "mean_token_accuracy": 0.17393139749765396, "num_tokens": 50410592.0, "step": 25765 }, { "entropy": 6.057042217254638, "epoch": 2.5759984005598042, "grad_norm": 1.2109375, "learning_rate": 0.00043404097236731396, "loss": 5.6218, "mean_token_accuracy": 0.18104489296674728, "num_tokens": 50420863.0, "step": 25770 }, { "entropy": 6.063992595672607, "epoch": 2.5764982256210325, "grad_norm": 1.0390625, "learning_rate": 0.0004340157251559529, "loss": 5.6504, "mean_token_accuracy": 0.17818641364574433, "num_tokens": 50431321.0, "step": 25775 }, { "entropy": 6.017960023880005, "epoch": 2.576998050682261, "grad_norm": 1.1640625, "learning_rate": 0.00043399047394379717, "loss": 5.5858, "mean_token_accuracy": 0.17803821563720704, "num_tokens": 50442223.0, "step": 25780 }, { "entropy": 5.9525329113006595, "epoch": 2.57749787574349, "grad_norm": 1.125, "learning_rate": 0.00043396521873148195, "loss": 5.539, "mean_token_accuracy": 0.1847424566745758, "num_tokens": 50451082.0, "step": 25785 }, { "entropy": 6.034868860244751, "epoch": 2.577997700804718, "grad_norm": 1.1875, "learning_rate": 0.00043393995951964277, "loss": 5.5836, "mean_token_accuracy": 0.18509110808372498, "num_tokens": 50461061.0, "step": 25790 }, { "entropy": 5.973652648925781, "epoch": 2.578497525865947, "grad_norm": 1.0625, "learning_rate": 0.00043391469630891513, "loss": 5.5289, "mean_token_accuracy": 0.19015580117702485, "num_tokens": 50470098.0, "step": 25795 }, { "entropy": 6.042131328582764, "epoch": 2.5789973509271755, "grad_norm": 1.1328125, "learning_rate": 0.0004338894290999346, "loss": 5.5752, "mean_token_accuracy": 0.17874244302511216, "num_tokens": 50479669.0, "step": 25800 }, { "entropy": 5.993898391723633, "epoch": 2.5794971759884042, "grad_norm": 1.2109375, "learning_rate": 0.00043386415789333687, "loss": 5.5459, "mean_token_accuracy": 0.18553537875413895, "num_tokens": 50488608.0, "step": 25805 }, { "entropy": 5.991174936294556, "epoch": 2.5799970010496325, "grad_norm": 1.171875, "learning_rate": 0.0004338388826897579, "loss": 5.6516, "mean_token_accuracy": 0.17921123951673507, "num_tokens": 50497486.0, "step": 25810 }, { "entropy": 6.036907720565796, "epoch": 2.580496826110861, "grad_norm": 1.1953125, "learning_rate": 0.0004338136034898335, "loss": 5.6167, "mean_token_accuracy": 0.1798812374472618, "num_tokens": 50506034.0, "step": 25815 }, { "entropy": 6.021275377273559, "epoch": 2.58099665117209, "grad_norm": 1.0859375, "learning_rate": 0.0004337883202941997, "loss": 5.6838, "mean_token_accuracy": 0.17548028379678726, "num_tokens": 50516617.0, "step": 25820 }, { "entropy": 6.110475683212281, "epoch": 2.581496476233318, "grad_norm": 1.1328125, "learning_rate": 0.0004337630331034926, "loss": 5.6165, "mean_token_accuracy": 0.17462630420923234, "num_tokens": 50526287.0, "step": 25825 }, { "entropy": 6.060081720352173, "epoch": 2.581996301294547, "grad_norm": 1.15625, "learning_rate": 0.00043373774191834844, "loss": 5.6422, "mean_token_accuracy": 0.17585487961769103, "num_tokens": 50535803.0, "step": 25830 }, { "entropy": 6.095237684249878, "epoch": 2.5824961263557755, "grad_norm": 1.1171875, "learning_rate": 0.00043371244673940355, "loss": 5.7906, "mean_token_accuracy": 0.1663959190249443, "num_tokens": 50545386.0, "step": 25835 }, { "entropy": 6.090646696090698, "epoch": 2.582995951417004, "grad_norm": 1.1875, "learning_rate": 0.0004336871475672943, "loss": 5.6304, "mean_token_accuracy": 0.17919568568468094, "num_tokens": 50555299.0, "step": 25840 }, { "entropy": 5.993093585968017, "epoch": 2.5834957764782325, "grad_norm": 1.15625, "learning_rate": 0.0004336618444026573, "loss": 5.521, "mean_token_accuracy": 0.1871308743953705, "num_tokens": 50564530.0, "step": 25845 }, { "entropy": 5.999269580841064, "epoch": 2.583995601539461, "grad_norm": 1.140625, "learning_rate": 0.00043363653724612903, "loss": 5.6617, "mean_token_accuracy": 0.17446561455726622, "num_tokens": 50574783.0, "step": 25850 }, { "entropy": 5.925566959381103, "epoch": 2.58449542660069, "grad_norm": 1.15625, "learning_rate": 0.00043361122609834646, "loss": 5.4782, "mean_token_accuracy": 0.19122677445411682, "num_tokens": 50584764.0, "step": 25855 }, { "entropy": 5.979708337783814, "epoch": 2.584995251661918, "grad_norm": 1.21875, "learning_rate": 0.0004335859109599462, "loss": 5.5078, "mean_token_accuracy": 0.1893474504351616, "num_tokens": 50593547.0, "step": 25860 }, { "entropy": 5.987077474594116, "epoch": 2.585495076723147, "grad_norm": 1.390625, "learning_rate": 0.00043356059183156514, "loss": 5.5195, "mean_token_accuracy": 0.19342687875032424, "num_tokens": 50602749.0, "step": 25865 }, { "entropy": 6.047565603256226, "epoch": 2.5859949017843755, "grad_norm": 1.25, "learning_rate": 0.00043353526871384054, "loss": 5.5894, "mean_token_accuracy": 0.18508001714944838, "num_tokens": 50612900.0, "step": 25870 }, { "entropy": 6.097301959991455, "epoch": 2.586494726845604, "grad_norm": 1.140625, "learning_rate": 0.0004335099416074092, "loss": 5.6975, "mean_token_accuracy": 0.16681978851556778, "num_tokens": 50623131.0, "step": 25875 }, { "entropy": 6.010357856750488, "epoch": 2.5869945519068325, "grad_norm": 1.171875, "learning_rate": 0.0004334846105129086, "loss": 5.547, "mean_token_accuracy": 0.182301926612854, "num_tokens": 50632312.0, "step": 25880 }, { "entropy": 6.083261728286743, "epoch": 2.587494376968061, "grad_norm": 1.109375, "learning_rate": 0.000433459275430976, "loss": 5.7865, "mean_token_accuracy": 0.16547089591622352, "num_tokens": 50643264.0, "step": 25885 }, { "entropy": 6.019079351425171, "epoch": 2.58799420202929, "grad_norm": 1.3359375, "learning_rate": 0.0004334339363622488, "loss": 5.6449, "mean_token_accuracy": 0.17871276885271073, "num_tokens": 50652525.0, "step": 25890 }, { "entropy": 6.059764337539673, "epoch": 2.588494027090518, "grad_norm": 1.109375, "learning_rate": 0.00043340859330736454, "loss": 5.6376, "mean_token_accuracy": 0.18194933235645294, "num_tokens": 50661509.0, "step": 25895 }, { "entropy": 6.038602876663208, "epoch": 2.588993852151747, "grad_norm": 1.625, "learning_rate": 0.00043338324626696084, "loss": 5.598, "mean_token_accuracy": 0.18010858595371246, "num_tokens": 50672646.0, "step": 25900 }, { "entropy": 6.009282064437866, "epoch": 2.5894936772129755, "grad_norm": 1.1953125, "learning_rate": 0.0004333578952416753, "loss": 5.5121, "mean_token_accuracy": 0.19434583336114883, "num_tokens": 50681967.0, "step": 25905 }, { "entropy": 6.056621170043945, "epoch": 2.589993502274204, "grad_norm": 1.34375, "learning_rate": 0.000433332540232146, "loss": 5.6019, "mean_token_accuracy": 0.18699777126312256, "num_tokens": 50690630.0, "step": 25910 }, { "entropy": 5.9903041362762455, "epoch": 2.5904933273354325, "grad_norm": 0.93359375, "learning_rate": 0.00043330718123901074, "loss": 5.6085, "mean_token_accuracy": 0.1830119550228119, "num_tokens": 50700618.0, "step": 25915 }, { "entropy": 6.0103222846984865, "epoch": 2.590993152396661, "grad_norm": 1.265625, "learning_rate": 0.00043328181826290745, "loss": 5.5528, "mean_token_accuracy": 0.18427708446979524, "num_tokens": 50710825.0, "step": 25920 }, { "entropy": 6.022514009475708, "epoch": 2.59149297745789, "grad_norm": 1.09375, "learning_rate": 0.0004332564513044744, "loss": 5.5875, "mean_token_accuracy": 0.1825055092573166, "num_tokens": 50721869.0, "step": 25925 }, { "entropy": 6.02656397819519, "epoch": 2.591992802519118, "grad_norm": 1.0859375, "learning_rate": 0.00043323108036434974, "loss": 5.5233, "mean_token_accuracy": 0.187306809425354, "num_tokens": 50732088.0, "step": 25930 }, { "entropy": 5.985320806503296, "epoch": 2.592492627580347, "grad_norm": 1.125, "learning_rate": 0.0004332057054431718, "loss": 5.632, "mean_token_accuracy": 0.1801345616579056, "num_tokens": 50743419.0, "step": 25935 }, { "entropy": 6.015631246566772, "epoch": 2.5929924526415755, "grad_norm": 1.234375, "learning_rate": 0.000433180326541579, "loss": 5.5802, "mean_token_accuracy": 0.18342125564813613, "num_tokens": 50754371.0, "step": 25940 }, { "entropy": 6.061701250076294, "epoch": 2.593492277702804, "grad_norm": 1.1875, "learning_rate": 0.0004331549436602099, "loss": 5.5918, "mean_token_accuracy": 0.1836387351155281, "num_tokens": 50763737.0, "step": 25945 }, { "entropy": 6.05001425743103, "epoch": 2.5939921027640325, "grad_norm": 1.0703125, "learning_rate": 0.00043312955679970317, "loss": 5.687, "mean_token_accuracy": 0.1790593907237053, "num_tokens": 50774571.0, "step": 25950 }, { "entropy": 6.1326416492462155, "epoch": 2.594491927825261, "grad_norm": 1.2421875, "learning_rate": 0.00043310416596069746, "loss": 5.6333, "mean_token_accuracy": 0.1851600706577301, "num_tokens": 50783232.0, "step": 25955 }, { "entropy": 6.034183073043823, "epoch": 2.59499175288649, "grad_norm": 1.125, "learning_rate": 0.00043307877114383167, "loss": 5.6544, "mean_token_accuracy": 0.18526309728622437, "num_tokens": 50792238.0, "step": 25960 }, { "entropy": 5.931816339492798, "epoch": 2.595491577947718, "grad_norm": 1.1328125, "learning_rate": 0.0004330533723497445, "loss": 5.5113, "mean_token_accuracy": 0.18919307589530945, "num_tokens": 50802012.0, "step": 25965 }, { "entropy": 6.018684577941895, "epoch": 2.595991403008947, "grad_norm": 1.1640625, "learning_rate": 0.00043302796957907523, "loss": 5.5778, "mean_token_accuracy": 0.1899635910987854, "num_tokens": 50811938.0, "step": 25970 }, { "entropy": 6.001771259307861, "epoch": 2.5964912280701755, "grad_norm": 1.203125, "learning_rate": 0.00043300256283246297, "loss": 5.5641, "mean_token_accuracy": 0.18394985049962997, "num_tokens": 50820702.0, "step": 25975 }, { "entropy": 6.067397785186768, "epoch": 2.596991053131404, "grad_norm": 1.265625, "learning_rate": 0.00043297715211054684, "loss": 5.713, "mean_token_accuracy": 0.17036787569522857, "num_tokens": 50830291.0, "step": 25980 }, { "entropy": 5.9361851692199705, "epoch": 2.5974908781926325, "grad_norm": 1.078125, "learning_rate": 0.00043295173741396626, "loss": 5.5933, "mean_token_accuracy": 0.17891673147678375, "num_tokens": 50840428.0, "step": 25985 }, { "entropy": 6.060116720199585, "epoch": 2.597990703253861, "grad_norm": 1.21875, "learning_rate": 0.0004329263187433605, "loss": 5.6744, "mean_token_accuracy": 0.17266178280115127, "num_tokens": 50849596.0, "step": 25990 }, { "entropy": 6.046822738647461, "epoch": 2.59849052831509, "grad_norm": 1.109375, "learning_rate": 0.0004329008960993694, "loss": 5.5737, "mean_token_accuracy": 0.18023378551006317, "num_tokens": 50858347.0, "step": 25995 }, { "entropy": 6.048694133758545, "epoch": 2.598990353376318, "grad_norm": 1.078125, "learning_rate": 0.0004328754694826322, "loss": 5.5824, "mean_token_accuracy": 0.18659407943487166, "num_tokens": 50868979.0, "step": 26000 }, { "entropy": 6.020805597305298, "epoch": 2.599490178437547, "grad_norm": 1.296875, "learning_rate": 0.0004328500388937889, "loss": 5.6064, "mean_token_accuracy": 0.18512615710496902, "num_tokens": 50878789.0, "step": 26005 }, { "entropy": 6.0021617889404295, "epoch": 2.5999900034987755, "grad_norm": 1.1328125, "learning_rate": 0.00043282460433347926, "loss": 5.6186, "mean_token_accuracy": 0.17801228761672974, "num_tokens": 50889381.0, "step": 26010 }, { "entropy": 6.1454438209533695, "epoch": 2.600489828560004, "grad_norm": 1.171875, "learning_rate": 0.0004327991658023431, "loss": 5.6374, "mean_token_accuracy": 0.16995756477117538, "num_tokens": 50898201.0, "step": 26015 }, { "entropy": 6.062618255615234, "epoch": 2.6009896536212325, "grad_norm": 1.0859375, "learning_rate": 0.0004327737233010205, "loss": 5.652, "mean_token_accuracy": 0.18697686195373536, "num_tokens": 50908185.0, "step": 26020 }, { "entropy": 6.00340838432312, "epoch": 2.601489478682461, "grad_norm": 1.0625, "learning_rate": 0.00043274827683015174, "loss": 5.5411, "mean_token_accuracy": 0.18821829110383986, "num_tokens": 50918766.0, "step": 26025 }, { "entropy": 5.965804481506348, "epoch": 2.60198930374369, "grad_norm": 1.03125, "learning_rate": 0.00043272282639037683, "loss": 5.6013, "mean_token_accuracy": 0.18321091532707215, "num_tokens": 50928588.0, "step": 26030 }, { "entropy": 5.999594783782959, "epoch": 2.602489128804918, "grad_norm": 1.6328125, "learning_rate": 0.00043269737198233627, "loss": 5.6054, "mean_token_accuracy": 0.18262286782264708, "num_tokens": 50938106.0, "step": 26035 }, { "entropy": 6.132781744003296, "epoch": 2.602988953866147, "grad_norm": 1.171875, "learning_rate": 0.0004326719136066704, "loss": 5.7364, "mean_token_accuracy": 0.1732128694653511, "num_tokens": 50947723.0, "step": 26040 }, { "entropy": 6.089908409118652, "epoch": 2.6034887789273755, "grad_norm": 1.15625, "learning_rate": 0.00043264645126401977, "loss": 5.6679, "mean_token_accuracy": 0.17459918409585953, "num_tokens": 50956744.0, "step": 26045 }, { "entropy": 6.11665153503418, "epoch": 2.603988603988604, "grad_norm": 1.109375, "learning_rate": 0.00043262098495502497, "loss": 5.7903, "mean_token_accuracy": 0.17419612258672715, "num_tokens": 50967778.0, "step": 26050 }, { "entropy": 6.0627703189849855, "epoch": 2.6044884290498325, "grad_norm": 1.1796875, "learning_rate": 0.0004325955146803267, "loss": 5.5428, "mean_token_accuracy": 0.18596047461032866, "num_tokens": 50978635.0, "step": 26055 }, { "entropy": 6.158674001693726, "epoch": 2.604988254111061, "grad_norm": 1.21875, "learning_rate": 0.0004325700404405659, "loss": 5.7842, "mean_token_accuracy": 0.16777411550283433, "num_tokens": 50988823.0, "step": 26060 }, { "entropy": 6.040266609191894, "epoch": 2.60548807917229, "grad_norm": 1.078125, "learning_rate": 0.0004325445622363834, "loss": 5.683, "mean_token_accuracy": 0.17438930422067642, "num_tokens": 50998576.0, "step": 26065 }, { "entropy": 6.053354358673095, "epoch": 2.605987904233518, "grad_norm": 1.1953125, "learning_rate": 0.0004325190800684203, "loss": 5.5909, "mean_token_accuracy": 0.187750144302845, "num_tokens": 51008142.0, "step": 26070 }, { "entropy": 5.9316596508026125, "epoch": 2.606487729294747, "grad_norm": 1.0703125, "learning_rate": 0.0004324935939373176, "loss": 5.4361, "mean_token_accuracy": 0.19347186237573624, "num_tokens": 51018892.0, "step": 26075 }, { "entropy": 6.079810428619385, "epoch": 2.6069875543559755, "grad_norm": 1.1328125, "learning_rate": 0.0004324681038437166, "loss": 5.6906, "mean_token_accuracy": 0.172246515750885, "num_tokens": 51029116.0, "step": 26080 }, { "entropy": 5.9676214218139645, "epoch": 2.607487379417204, "grad_norm": 1.1796875, "learning_rate": 0.0004324426097882587, "loss": 5.4892, "mean_token_accuracy": 0.19268075972795487, "num_tokens": 51038392.0, "step": 26085 }, { "entropy": 6.031398916244507, "epoch": 2.6079872044784325, "grad_norm": 1.1015625, "learning_rate": 0.0004324171117715852, "loss": 5.6258, "mean_token_accuracy": 0.1798061817884445, "num_tokens": 51048344.0, "step": 26090 }, { "entropy": 6.049861860275269, "epoch": 2.608487029539661, "grad_norm": 1.359375, "learning_rate": 0.00043239160979433765, "loss": 5.683, "mean_token_accuracy": 0.18048959821462632, "num_tokens": 51057879.0, "step": 26095 }, { "entropy": 6.019409418106079, "epoch": 2.6089868546008894, "grad_norm": 1.234375, "learning_rate": 0.0004323661038571578, "loss": 5.5344, "mean_token_accuracy": 0.18801921904087066, "num_tokens": 51067365.0, "step": 26100 }, { "entropy": 5.978011989593506, "epoch": 2.609486679662118, "grad_norm": 1.15625, "learning_rate": 0.00043234059396068725, "loss": 5.5011, "mean_token_accuracy": 0.18201590776443483, "num_tokens": 51076168.0, "step": 26105 }, { "entropy": 6.042206573486328, "epoch": 2.609986504723347, "grad_norm": 1.171875, "learning_rate": 0.0004323150801055677, "loss": 5.6531, "mean_token_accuracy": 0.17807339280843734, "num_tokens": 51086438.0, "step": 26110 }, { "entropy": 6.046844005584717, "epoch": 2.6104863297845755, "grad_norm": 1.1953125, "learning_rate": 0.0004322895622924414, "loss": 5.6334, "mean_token_accuracy": 0.1804952010512352, "num_tokens": 51095386.0, "step": 26115 }, { "entropy": 5.979467964172363, "epoch": 2.610986154845804, "grad_norm": 1.1171875, "learning_rate": 0.0004322640405219501, "loss": 5.547, "mean_token_accuracy": 0.18753506392240524, "num_tokens": 51105224.0, "step": 26120 }, { "entropy": 6.035736703872681, "epoch": 2.6114859799070325, "grad_norm": 1.1328125, "learning_rate": 0.00043223851479473596, "loss": 5.6608, "mean_token_accuracy": 0.1776103511452675, "num_tokens": 51115011.0, "step": 26125 }, { "entropy": 6.105141067504883, "epoch": 2.611985804968261, "grad_norm": 1.1484375, "learning_rate": 0.00043221298511144133, "loss": 5.6421, "mean_token_accuracy": 0.17705494314432144, "num_tokens": 51124173.0, "step": 26130 }, { "entropy": 6.042300033569336, "epoch": 2.6124856300294894, "grad_norm": 1.21875, "learning_rate": 0.00043218745147270845, "loss": 5.5002, "mean_token_accuracy": 0.19035637378692627, "num_tokens": 51133493.0, "step": 26135 }, { "entropy": 6.042124891281128, "epoch": 2.612985455090718, "grad_norm": 1.1796875, "learning_rate": 0.00043216191387917966, "loss": 5.6945, "mean_token_accuracy": 0.17540936768054963, "num_tokens": 51142748.0, "step": 26140 }, { "entropy": 5.995274496078491, "epoch": 2.613485280151947, "grad_norm": 1.2109375, "learning_rate": 0.0004321363723314976, "loss": 5.5651, "mean_token_accuracy": 0.1895092323422432, "num_tokens": 51152681.0, "step": 26145 }, { "entropy": 5.982134628295898, "epoch": 2.6139851052131755, "grad_norm": 1.25, "learning_rate": 0.00043211082683030483, "loss": 5.5156, "mean_token_accuracy": 0.18443993330001832, "num_tokens": 51161134.0, "step": 26150 }, { "entropy": 5.993594789505005, "epoch": 2.614484930274404, "grad_norm": 1.171875, "learning_rate": 0.00043208527737624406, "loss": 5.5194, "mean_token_accuracy": 0.18869834393262863, "num_tokens": 51170623.0, "step": 26155 }, { "entropy": 6.083442974090576, "epoch": 2.6149847553356325, "grad_norm": 1.0859375, "learning_rate": 0.00043205972396995825, "loss": 5.6551, "mean_token_accuracy": 0.17430697679519652, "num_tokens": 51180290.0, "step": 26160 }, { "entropy": 6.037635087966919, "epoch": 2.615484580396861, "grad_norm": 1.2578125, "learning_rate": 0.0004320341666120901, "loss": 5.5629, "mean_token_accuracy": 0.18638709038496018, "num_tokens": 51188733.0, "step": 26165 }, { "entropy": 5.893578100204468, "epoch": 2.6159844054580894, "grad_norm": 1.140625, "learning_rate": 0.00043200860530328287, "loss": 5.5293, "mean_token_accuracy": 0.19662653505802155, "num_tokens": 51198403.0, "step": 26170 }, { "entropy": 5.940001726150513, "epoch": 2.616484230519318, "grad_norm": 1.09375, "learning_rate": 0.00043198304004417933, "loss": 5.5338, "mean_token_accuracy": 0.18433621525764465, "num_tokens": 51207654.0, "step": 26175 }, { "entropy": 6.046866369247437, "epoch": 2.616984055580547, "grad_norm": 1.140625, "learning_rate": 0.00043195747083542296, "loss": 5.5943, "mean_token_accuracy": 0.17785379737615586, "num_tokens": 51216285.0, "step": 26180 }, { "entropy": 5.8981798648834225, "epoch": 2.6174838806417755, "grad_norm": 1.1640625, "learning_rate": 0.000431931897677657, "loss": 5.3769, "mean_token_accuracy": 0.2034571185708046, "num_tokens": 51225182.0, "step": 26185 }, { "entropy": 6.018731880187988, "epoch": 2.617983705703004, "grad_norm": 1.1015625, "learning_rate": 0.00043190632057152497, "loss": 5.6797, "mean_token_accuracy": 0.18106243759393692, "num_tokens": 51235547.0, "step": 26190 }, { "entropy": 6.072481775283814, "epoch": 2.6184835307642325, "grad_norm": 1.125, "learning_rate": 0.0004318807395176702, "loss": 5.6254, "mean_token_accuracy": 0.17653151601552963, "num_tokens": 51244897.0, "step": 26195 }, { "entropy": 5.990633249282837, "epoch": 2.618983355825461, "grad_norm": 1.1328125, "learning_rate": 0.0004318551545167364, "loss": 5.534, "mean_token_accuracy": 0.19011463224887848, "num_tokens": 51255343.0, "step": 26200 }, { "entropy": 6.0199055671691895, "epoch": 2.6194831808866894, "grad_norm": 1.0546875, "learning_rate": 0.0004318295655693674, "loss": 5.5767, "mean_token_accuracy": 0.1835000365972519, "num_tokens": 51265448.0, "step": 26205 }, { "entropy": 5.999718761444091, "epoch": 2.619983005947918, "grad_norm": 1.1875, "learning_rate": 0.00043180397267620675, "loss": 5.4709, "mean_token_accuracy": 0.18767277747392655, "num_tokens": 51273330.0, "step": 26210 }, { "entropy": 5.999001312255859, "epoch": 2.620482831009147, "grad_norm": 1.171875, "learning_rate": 0.0004317783758378985, "loss": 5.6136, "mean_token_accuracy": 0.18070109337568283, "num_tokens": 51283564.0, "step": 26215 }, { "entropy": 6.019810009002685, "epoch": 2.6209826560703755, "grad_norm": 1.0859375, "learning_rate": 0.00043175277505508677, "loss": 5.6178, "mean_token_accuracy": 0.179011932015419, "num_tokens": 51293386.0, "step": 26220 }, { "entropy": 6.035797548294068, "epoch": 2.621482481131604, "grad_norm": 1.2109375, "learning_rate": 0.0004317271703284154, "loss": 5.5886, "mean_token_accuracy": 0.17942273765802383, "num_tokens": 51301813.0, "step": 26225 }, { "entropy": 6.015041780471802, "epoch": 2.6219823061928325, "grad_norm": 1.265625, "learning_rate": 0.00043170156165852887, "loss": 5.573, "mean_token_accuracy": 0.1803755581378937, "num_tokens": 51312378.0, "step": 26230 }, { "entropy": 6.005851697921753, "epoch": 2.622482131254061, "grad_norm": 1.203125, "learning_rate": 0.0004316759490460713, "loss": 5.604, "mean_token_accuracy": 0.1879439175128937, "num_tokens": 51322022.0, "step": 26235 }, { "entropy": 6.011146020889282, "epoch": 2.6229819563152894, "grad_norm": 1.21875, "learning_rate": 0.00043165033249168723, "loss": 5.5799, "mean_token_accuracy": 0.18212175071239473, "num_tokens": 51330288.0, "step": 26240 }, { "entropy": 6.011969041824341, "epoch": 2.623481781376518, "grad_norm": 1.140625, "learning_rate": 0.00043162471199602103, "loss": 5.6114, "mean_token_accuracy": 0.18009622395038605, "num_tokens": 51338893.0, "step": 26245 }, { "entropy": 6.010849666595459, "epoch": 2.623981606437747, "grad_norm": 1.09375, "learning_rate": 0.00043159908755971746, "loss": 5.5825, "mean_token_accuracy": 0.17565616071224213, "num_tokens": 51347860.0, "step": 26250 }, { "entropy": 6.032860136032104, "epoch": 2.6244814314989755, "grad_norm": 1.109375, "learning_rate": 0.00043157345918342103, "loss": 5.623, "mean_token_accuracy": 0.18308013826608657, "num_tokens": 51359240.0, "step": 26255 }, { "entropy": 6.091044855117798, "epoch": 2.624981256560204, "grad_norm": 1.1953125, "learning_rate": 0.0004315478268677768, "loss": 5.7094, "mean_token_accuracy": 0.17644814103841783, "num_tokens": 51368574.0, "step": 26260 }, { "entropy": 6.035233831405639, "epoch": 2.6254810816214325, "grad_norm": 1.15625, "learning_rate": 0.0004315221906134294, "loss": 5.6055, "mean_token_accuracy": 0.1824919879436493, "num_tokens": 51378895.0, "step": 26265 }, { "entropy": 5.996111965179443, "epoch": 2.625980906682661, "grad_norm": 1.21875, "learning_rate": 0.00043149655042102404, "loss": 5.5442, "mean_token_accuracy": 0.18598836660385132, "num_tokens": 51388659.0, "step": 26270 }, { "entropy": 6.091568803787231, "epoch": 2.6264807317438894, "grad_norm": 1.09375, "learning_rate": 0.00043147090629120575, "loss": 5.7007, "mean_token_accuracy": 0.17653495073318481, "num_tokens": 51398444.0, "step": 26275 }, { "entropy": 5.991745090484619, "epoch": 2.626980556805118, "grad_norm": 1.21875, "learning_rate": 0.0004314452582246197, "loss": 5.5781, "mean_token_accuracy": 0.1858636885881424, "num_tokens": 51408534.0, "step": 26280 }, { "entropy": 6.056564044952393, "epoch": 2.627480381866347, "grad_norm": 1.1171875, "learning_rate": 0.00043141960622191116, "loss": 5.6032, "mean_token_accuracy": 0.1816971555352211, "num_tokens": 51418174.0, "step": 26285 }, { "entropy": 5.9542001247406, "epoch": 2.6279802069275755, "grad_norm": 1.1171875, "learning_rate": 0.00043139395028372565, "loss": 5.6215, "mean_token_accuracy": 0.18038197457790375, "num_tokens": 51428249.0, "step": 26290 }, { "entropy": 6.002531433105469, "epoch": 2.6284800319888038, "grad_norm": 1.5625, "learning_rate": 0.00043136829041070856, "loss": 5.5927, "mean_token_accuracy": 0.17573944181203843, "num_tokens": 51438042.0, "step": 26295 }, { "entropy": 6.068287372589111, "epoch": 2.6289798570500325, "grad_norm": 1.1640625, "learning_rate": 0.00043134262660350555, "loss": 5.6895, "mean_token_accuracy": 0.17279312163591384, "num_tokens": 51447745.0, "step": 26300 }, { "entropy": 6.086700010299682, "epoch": 2.629479682111261, "grad_norm": 1.0859375, "learning_rate": 0.0004313169588627622, "loss": 5.5552, "mean_token_accuracy": 0.18347810655832292, "num_tokens": 51458163.0, "step": 26305 }, { "entropy": 6.064768123626709, "epoch": 2.6299795071724894, "grad_norm": 1.1328125, "learning_rate": 0.0004312912871891245, "loss": 5.6536, "mean_token_accuracy": 0.17847360372543336, "num_tokens": 51468753.0, "step": 26310 }, { "entropy": 6.035714769363404, "epoch": 2.630479332233718, "grad_norm": 1.28125, "learning_rate": 0.0004312656115832381, "loss": 5.6863, "mean_token_accuracy": 0.1785442814230919, "num_tokens": 51479411.0, "step": 26315 }, { "entropy": 6.060040521621704, "epoch": 2.630979157294947, "grad_norm": 1.2578125, "learning_rate": 0.00043123993204574926, "loss": 5.727, "mean_token_accuracy": 0.17263293713331224, "num_tokens": 51489663.0, "step": 26320 }, { "entropy": 6.109456157684326, "epoch": 2.6314789823561755, "grad_norm": 1.1171875, "learning_rate": 0.00043121424857730384, "loss": 5.6594, "mean_token_accuracy": 0.17569761276245116, "num_tokens": 51500455.0, "step": 26325 }, { "entropy": 6.036267900466919, "epoch": 2.6319788074174038, "grad_norm": 1.2421875, "learning_rate": 0.0004311885611785482, "loss": 5.6149, "mean_token_accuracy": 0.1818238839507103, "num_tokens": 51509536.0, "step": 26330 }, { "entropy": 5.977023077011109, "epoch": 2.6324786324786325, "grad_norm": 1.1328125, "learning_rate": 0.00043116286985012847, "loss": 5.5131, "mean_token_accuracy": 0.18480388671159745, "num_tokens": 51519016.0, "step": 26335 }, { "entropy": 5.993271923065185, "epoch": 2.632978457539861, "grad_norm": 1.203125, "learning_rate": 0.00043113717459269116, "loss": 5.5579, "mean_token_accuracy": 0.17882864326238632, "num_tokens": 51528165.0, "step": 26340 }, { "entropy": 6.060551261901855, "epoch": 2.6334782826010894, "grad_norm": 1.09375, "learning_rate": 0.0004311114754068827, "loss": 5.6406, "mean_token_accuracy": 0.1814943253993988, "num_tokens": 51538338.0, "step": 26345 }, { "entropy": 6.035416316986084, "epoch": 2.633978107662318, "grad_norm": 1.125, "learning_rate": 0.0004310857722933497, "loss": 5.6668, "mean_token_accuracy": 0.18159135729074477, "num_tokens": 51547397.0, "step": 26350 }, { "entropy": 5.984923601150513, "epoch": 2.634477932723547, "grad_norm": 1.0859375, "learning_rate": 0.00043106006525273896, "loss": 5.5632, "mean_token_accuracy": 0.18259994834661483, "num_tokens": 51558572.0, "step": 26355 }, { "entropy": 5.919953727722168, "epoch": 2.6349777577847755, "grad_norm": 1.140625, "learning_rate": 0.0004310343542856969, "loss": 5.4324, "mean_token_accuracy": 0.19488199502229692, "num_tokens": 51567522.0, "step": 26360 }, { "entropy": 6.028505849838257, "epoch": 2.6354775828460038, "grad_norm": 1.171875, "learning_rate": 0.00043100863939287077, "loss": 5.6255, "mean_token_accuracy": 0.17786143273115157, "num_tokens": 51577717.0, "step": 26365 }, { "entropy": 6.0693785667419435, "epoch": 2.6359774079072325, "grad_norm": 1.140625, "learning_rate": 0.0004309829205749074, "loss": 5.6543, "mean_token_accuracy": 0.18707954585552217, "num_tokens": 51587301.0, "step": 26370 }, { "entropy": 6.025286293029785, "epoch": 2.636477232968461, "grad_norm": 1.09375, "learning_rate": 0.00043095719783245386, "loss": 5.6178, "mean_token_accuracy": 0.1891126424074173, "num_tokens": 51597538.0, "step": 26375 }, { "entropy": 5.9920329570770265, "epoch": 2.6369770580296894, "grad_norm": 1.1484375, "learning_rate": 0.00043093147116615737, "loss": 5.529, "mean_token_accuracy": 0.19699204415082933, "num_tokens": 51607698.0, "step": 26380 }, { "entropy": 5.994296503067017, "epoch": 2.637476883090918, "grad_norm": 1.15625, "learning_rate": 0.0004309057405766652, "loss": 5.6541, "mean_token_accuracy": 0.1798229068517685, "num_tokens": 51616784.0, "step": 26385 }, { "entropy": 6.053320217132568, "epoch": 2.637976708152147, "grad_norm": 1.1328125, "learning_rate": 0.00043088000606462474, "loss": 5.6887, "mean_token_accuracy": 0.176905120909214, "num_tokens": 51627024.0, "step": 26390 }, { "entropy": 6.088989496231079, "epoch": 2.6384765332133755, "grad_norm": 1.171875, "learning_rate": 0.00043085426763068334, "loss": 5.6082, "mean_token_accuracy": 0.17780465483665467, "num_tokens": 51636224.0, "step": 26395 }, { "entropy": 5.993315315246582, "epoch": 2.6389763582746038, "grad_norm": 1.1640625, "learning_rate": 0.00043082852527548876, "loss": 5.6001, "mean_token_accuracy": 0.177258138358593, "num_tokens": 51645457.0, "step": 26400 }, { "entropy": 6.028305578231811, "epoch": 2.6394761833358324, "grad_norm": 1.15625, "learning_rate": 0.0004308027789996886, "loss": 5.5906, "mean_token_accuracy": 0.18581600189208985, "num_tokens": 51655649.0, "step": 26405 }, { "entropy": 5.988443040847779, "epoch": 2.639976008397061, "grad_norm": 1.1953125, "learning_rate": 0.0004307770288039306, "loss": 5.6355, "mean_token_accuracy": 0.17520159780979155, "num_tokens": 51664937.0, "step": 26410 }, { "entropy": 6.0312700271606445, "epoch": 2.6404758334582894, "grad_norm": 1.140625, "learning_rate": 0.00043075127468886264, "loss": 5.5383, "mean_token_accuracy": 0.18430096358060838, "num_tokens": 51674473.0, "step": 26415 }, { "entropy": 6.0390393257141115, "epoch": 2.640975658519518, "grad_norm": 1.078125, "learning_rate": 0.00043072551665513265, "loss": 5.5529, "mean_token_accuracy": 0.17954092472791672, "num_tokens": 51684510.0, "step": 26420 }, { "entropy": 5.941063451766968, "epoch": 2.641475483580747, "grad_norm": 1.1484375, "learning_rate": 0.00043069975470338875, "loss": 5.6075, "mean_token_accuracy": 0.18212295621633529, "num_tokens": 51693220.0, "step": 26425 }, { "entropy": 6.14421648979187, "epoch": 2.6419753086419755, "grad_norm": 1.1015625, "learning_rate": 0.00043067398883427907, "loss": 5.6662, "mean_token_accuracy": 0.17967286407947541, "num_tokens": 51702396.0, "step": 26430 }, { "entropy": 6.111770820617676, "epoch": 2.6424751337032037, "grad_norm": 1.21875, "learning_rate": 0.00043064821904845185, "loss": 5.5801, "mean_token_accuracy": 0.1821412816643715, "num_tokens": 51712651.0, "step": 26435 }, { "entropy": 6.015494251251221, "epoch": 2.6429749587644324, "grad_norm": 1.140625, "learning_rate": 0.0004306224453465556, "loss": 5.6648, "mean_token_accuracy": 0.17199369370937348, "num_tokens": 51722247.0, "step": 26440 }, { "entropy": 6.068347501754761, "epoch": 2.643474783825661, "grad_norm": 1.078125, "learning_rate": 0.00043059666772923854, "loss": 5.6345, "mean_token_accuracy": 0.1791454330086708, "num_tokens": 51731537.0, "step": 26445 }, { "entropy": 6.11707181930542, "epoch": 2.6439746088868894, "grad_norm": 1.046875, "learning_rate": 0.0004305708861971495, "loss": 5.6902, "mean_token_accuracy": 0.1751371592283249, "num_tokens": 51741661.0, "step": 26450 }, { "entropy": 5.986990976333618, "epoch": 2.644474433948118, "grad_norm": 1.078125, "learning_rate": 0.0004305451007509369, "loss": 5.5155, "mean_token_accuracy": 0.18261077105998993, "num_tokens": 51752813.0, "step": 26455 }, { "entropy": 6.01062970161438, "epoch": 2.644974259009347, "grad_norm": 1.53125, "learning_rate": 0.0004305193113912496, "loss": 5.5872, "mean_token_accuracy": 0.1857323542237282, "num_tokens": 51761690.0, "step": 26460 }, { "entropy": 6.029112958908081, "epoch": 2.6454740840705755, "grad_norm": 1.1640625, "learning_rate": 0.00043049351811873645, "loss": 5.5435, "mean_token_accuracy": 0.18410504460334778, "num_tokens": 51772002.0, "step": 26465 }, { "entropy": 6.084415483474731, "epoch": 2.6459739091318037, "grad_norm": 1.1875, "learning_rate": 0.0004304677209340464, "loss": 5.6929, "mean_token_accuracy": 0.17875198870897294, "num_tokens": 51783076.0, "step": 26470 }, { "entropy": 5.999786472320556, "epoch": 2.6464737341930324, "grad_norm": 1.296875, "learning_rate": 0.00043044191983782846, "loss": 5.5602, "mean_token_accuracy": 0.1910875454545021, "num_tokens": 51792710.0, "step": 26475 }, { "entropy": 6.076154184341431, "epoch": 2.646973559254261, "grad_norm": 1.0625, "learning_rate": 0.00043041611483073187, "loss": 5.7624, "mean_token_accuracy": 0.17419288009405137, "num_tokens": 51802896.0, "step": 26480 }, { "entropy": 6.010974359512329, "epoch": 2.6474733843154894, "grad_norm": 1.1640625, "learning_rate": 0.0004303903059134059, "loss": 5.5596, "mean_token_accuracy": 0.18701684474945068, "num_tokens": 51812363.0, "step": 26485 }, { "entropy": 6.027298402786255, "epoch": 2.647973209376718, "grad_norm": 1.1796875, "learning_rate": 0.00043036449308649967, "loss": 5.5669, "mean_token_accuracy": 0.1842468112707138, "num_tokens": 51820970.0, "step": 26490 }, { "entropy": 6.064905214309692, "epoch": 2.648473034437947, "grad_norm": 1.203125, "learning_rate": 0.00043033867635066287, "loss": 5.6108, "mean_token_accuracy": 0.1815474346280098, "num_tokens": 51830115.0, "step": 26495 }, { "entropy": 6.031705379486084, "epoch": 2.6489728594991755, "grad_norm": 1.1328125, "learning_rate": 0.0004303128557065448, "loss": 5.5496, "mean_token_accuracy": 0.18665410429239274, "num_tokens": 51839779.0, "step": 26500 }, { "entropy": 6.0120302677154545, "epoch": 2.6494726845604037, "grad_norm": 1.0859375, "learning_rate": 0.0004302870311547954, "loss": 5.6515, "mean_token_accuracy": 0.17526234015822412, "num_tokens": 51850800.0, "step": 26505 }, { "entropy": 6.027283573150635, "epoch": 2.6499725096216324, "grad_norm": 1.1796875, "learning_rate": 0.00043026120269606423, "loss": 5.6165, "mean_token_accuracy": 0.1834244519472122, "num_tokens": 51860059.0, "step": 26510 }, { "entropy": 6.078717041015625, "epoch": 2.650472334682861, "grad_norm": 1.046875, "learning_rate": 0.00043023537033100106, "loss": 5.6889, "mean_token_accuracy": 0.17518247067928314, "num_tokens": 51870001.0, "step": 26515 }, { "entropy": 6.077863168716431, "epoch": 2.6509721597440894, "grad_norm": 1.1171875, "learning_rate": 0.00043020953406025606, "loss": 5.5328, "mean_token_accuracy": 0.18552784621715546, "num_tokens": 51879004.0, "step": 26520 }, { "entropy": 6.003847455978393, "epoch": 2.651471984805318, "grad_norm": 1.1171875, "learning_rate": 0.000430183693884479, "loss": 5.607, "mean_token_accuracy": 0.18087068647146226, "num_tokens": 51887911.0, "step": 26525 }, { "entropy": 5.936503124237061, "epoch": 2.651971809866547, "grad_norm": 1.1875, "learning_rate": 0.0004301578498043202, "loss": 5.4853, "mean_token_accuracy": 0.19177916049957275, "num_tokens": 51897444.0, "step": 26530 }, { "entropy": 5.98862886428833, "epoch": 2.6524716349277755, "grad_norm": 1.09375, "learning_rate": 0.00043013200182042983, "loss": 5.5206, "mean_token_accuracy": 0.18935388773679734, "num_tokens": 51907344.0, "step": 26535 }, { "entropy": 6.027761173248291, "epoch": 2.6529714599890037, "grad_norm": 1.0859375, "learning_rate": 0.00043010614993345815, "loss": 5.5212, "mean_token_accuracy": 0.1893118530511856, "num_tokens": 51916541.0, "step": 26540 }, { "entropy": 6.063733291625977, "epoch": 2.6534712850502324, "grad_norm": 1.21875, "learning_rate": 0.0004300802941440557, "loss": 5.7248, "mean_token_accuracy": 0.17265397310256958, "num_tokens": 51926160.0, "step": 26545 }, { "entropy": 6.054165363311768, "epoch": 2.653971110111461, "grad_norm": 1.1875, "learning_rate": 0.0004300544344528729, "loss": 5.6506, "mean_token_accuracy": 0.17919763624668122, "num_tokens": 51936244.0, "step": 26550 }, { "entropy": 6.111879777908325, "epoch": 2.6544709351726894, "grad_norm": 1.1171875, "learning_rate": 0.00043002857086056053, "loss": 5.6001, "mean_token_accuracy": 0.18080134242773055, "num_tokens": 51946490.0, "step": 26555 }, { "entropy": 6.108101034164429, "epoch": 2.654970760233918, "grad_norm": 1.1640625, "learning_rate": 0.0004300027033677691, "loss": 5.6051, "mean_token_accuracy": 0.18039559870958327, "num_tokens": 51956129.0, "step": 26560 }, { "entropy": 5.983809947967529, "epoch": 2.655470585295147, "grad_norm": 1.15625, "learning_rate": 0.0004299768319751496, "loss": 5.6279, "mean_token_accuracy": 0.17894519716501237, "num_tokens": 51966274.0, "step": 26565 }, { "entropy": 5.91192741394043, "epoch": 2.6559704103563755, "grad_norm": 1.1171875, "learning_rate": 0.0004299509566833529, "loss": 5.523, "mean_token_accuracy": 0.18894741535186768, "num_tokens": 51975261.0, "step": 26570 }, { "entropy": 6.042177724838257, "epoch": 2.6564702354176037, "grad_norm": 1.1015625, "learning_rate": 0.00042992507749302995, "loss": 5.5898, "mean_token_accuracy": 0.1774608463048935, "num_tokens": 51984562.0, "step": 26575 }, { "entropy": 6.053143787384033, "epoch": 2.6569700604788324, "grad_norm": 1.1875, "learning_rate": 0.00042989919440483194, "loss": 5.5542, "mean_token_accuracy": 0.1784242421388626, "num_tokens": 51994763.0, "step": 26580 }, { "entropy": 6.106169366836548, "epoch": 2.657469885540061, "grad_norm": 1.203125, "learning_rate": 0.0004298733074194101, "loss": 5.6315, "mean_token_accuracy": 0.18968216180801392, "num_tokens": 52004935.0, "step": 26585 }, { "entropy": 5.992870473861695, "epoch": 2.6579697106012894, "grad_norm": 1.1171875, "learning_rate": 0.0004298474165374156, "loss": 5.565, "mean_token_accuracy": 0.1794860541820526, "num_tokens": 52013879.0, "step": 26590 }, { "entropy": 5.962762022018433, "epoch": 2.658469535662518, "grad_norm": 1.1171875, "learning_rate": 0.0004298215217595, "loss": 5.5558, "mean_token_accuracy": 0.19106806069612503, "num_tokens": 52023354.0, "step": 26595 }, { "entropy": 6.035774230957031, "epoch": 2.658969360723747, "grad_norm": 1.1640625, "learning_rate": 0.00042979562308631476, "loss": 5.6539, "mean_token_accuracy": 0.17981230616569518, "num_tokens": 52033058.0, "step": 26600 }, { "entropy": 6.102031803131103, "epoch": 2.6594691857849755, "grad_norm": 1.25, "learning_rate": 0.0004297697205185115, "loss": 5.6061, "mean_token_accuracy": 0.17129491716623307, "num_tokens": 52042544.0, "step": 26605 }, { "entropy": 6.037606620788575, "epoch": 2.6599690108462037, "grad_norm": 1.203125, "learning_rate": 0.0004297438140567419, "loss": 5.6073, "mean_token_accuracy": 0.1811242178082466, "num_tokens": 52052396.0, "step": 26610 }, { "entropy": 6.0375124454498295, "epoch": 2.6604688359074324, "grad_norm": 1.1875, "learning_rate": 0.0004297179037016577, "loss": 5.6247, "mean_token_accuracy": 0.1794034406542778, "num_tokens": 52061950.0, "step": 26615 }, { "entropy": 5.98329906463623, "epoch": 2.6609686609686607, "grad_norm": 1.0859375, "learning_rate": 0.00042969198945391084, "loss": 5.6311, "mean_token_accuracy": 0.1823697119951248, "num_tokens": 52071588.0, "step": 26620 }, { "entropy": 6.001740741729736, "epoch": 2.6614684860298894, "grad_norm": 1.1875, "learning_rate": 0.0004296660713141534, "loss": 5.5144, "mean_token_accuracy": 0.18170634359121324, "num_tokens": 52080826.0, "step": 26625 }, { "entropy": 6.052634572982788, "epoch": 2.661968311091118, "grad_norm": 1.140625, "learning_rate": 0.00042964014928303733, "loss": 5.6646, "mean_token_accuracy": 0.17764320522546767, "num_tokens": 52090844.0, "step": 26630 }, { "entropy": 6.108454656600952, "epoch": 2.662468136152347, "grad_norm": 1.1484375, "learning_rate": 0.000429614223361215, "loss": 5.7494, "mean_token_accuracy": 0.17372922748327255, "num_tokens": 52100189.0, "step": 26635 }, { "entropy": 6.034653282165527, "epoch": 2.6629679612135755, "grad_norm": 1.1328125, "learning_rate": 0.0004295882935493385, "loss": 5.6553, "mean_token_accuracy": 0.18262167274951935, "num_tokens": 52110323.0, "step": 26640 }, { "entropy": 5.990649461746216, "epoch": 2.6634677862748037, "grad_norm": 1.1015625, "learning_rate": 0.00042956235984806034, "loss": 5.5535, "mean_token_accuracy": 0.18390677571296693, "num_tokens": 52120816.0, "step": 26645 }, { "entropy": 6.12251238822937, "epoch": 2.6639676113360324, "grad_norm": 1.0703125, "learning_rate": 0.00042953642225803296, "loss": 5.6443, "mean_token_accuracy": 0.18099390268325805, "num_tokens": 52130610.0, "step": 26650 }, { "entropy": 6.072726631164551, "epoch": 2.6644674363972607, "grad_norm": 1.0703125, "learning_rate": 0.000429510480779909, "loss": 5.6009, "mean_token_accuracy": 0.18310339897871017, "num_tokens": 52140581.0, "step": 26655 }, { "entropy": 6.029133558273315, "epoch": 2.6649672614584894, "grad_norm": 1.640625, "learning_rate": 0.0004294845354143411, "loss": 5.598, "mean_token_accuracy": 0.18432868421077728, "num_tokens": 52150971.0, "step": 26660 }, { "entropy": 6.011661338806152, "epoch": 2.665467086519718, "grad_norm": 1.1015625, "learning_rate": 0.0004294585861619821, "loss": 5.6067, "mean_token_accuracy": 0.18296149373054504, "num_tokens": 52160663.0, "step": 26665 }, { "entropy": 5.975858592987061, "epoch": 2.665966911580947, "grad_norm": 1.046875, "learning_rate": 0.00042943263302348475, "loss": 5.6057, "mean_token_accuracy": 0.18469782173633575, "num_tokens": 52170570.0, "step": 26670 }, { "entropy": 6.121520614624023, "epoch": 2.6664667366421755, "grad_norm": 1.0859375, "learning_rate": 0.00042940667599950205, "loss": 5.6828, "mean_token_accuracy": 0.1736326575279236, "num_tokens": 52179682.0, "step": 26675 }, { "entropy": 6.049258613586426, "epoch": 2.6669665617034037, "grad_norm": 1.265625, "learning_rate": 0.00042938071509068717, "loss": 5.637, "mean_token_accuracy": 0.18291324526071548, "num_tokens": 52189856.0, "step": 26680 }, { "entropy": 5.971758842468262, "epoch": 2.6674663867646324, "grad_norm": 1.109375, "learning_rate": 0.00042935475029769323, "loss": 5.4626, "mean_token_accuracy": 0.1904817134141922, "num_tokens": 52197956.0, "step": 26685 }, { "entropy": 5.9092793464660645, "epoch": 2.6679662118258607, "grad_norm": 1.203125, "learning_rate": 0.00042932878162117347, "loss": 5.4752, "mean_token_accuracy": 0.1970234751701355, "num_tokens": 52208091.0, "step": 26690 }, { "entropy": 6.039830923080444, "epoch": 2.6684660368870894, "grad_norm": 1.1171875, "learning_rate": 0.0004293028090617813, "loss": 5.6743, "mean_token_accuracy": 0.16918589323759078, "num_tokens": 52218568.0, "step": 26695 }, { "entropy": 5.996864080429077, "epoch": 2.668965861948318, "grad_norm": 1.3203125, "learning_rate": 0.00042927683262017016, "loss": 5.5422, "mean_token_accuracy": 0.1867714211344719, "num_tokens": 52228048.0, "step": 26700 }, { "entropy": 6.029834461212158, "epoch": 2.669465687009547, "grad_norm": 1.1328125, "learning_rate": 0.0004292508522969935, "loss": 5.6638, "mean_token_accuracy": 0.17516565471887588, "num_tokens": 52239878.0, "step": 26705 }, { "entropy": 6.008866453170777, "epoch": 2.6699655120707755, "grad_norm": 1.078125, "learning_rate": 0.0004292248680929052, "loss": 5.6467, "mean_token_accuracy": 0.18211662769317627, "num_tokens": 52250244.0, "step": 26710 }, { "entropy": 6.030343866348266, "epoch": 2.6704653371320037, "grad_norm": 1.125, "learning_rate": 0.00042919888000855885, "loss": 5.6415, "mean_token_accuracy": 0.18294674158096313, "num_tokens": 52261420.0, "step": 26715 }, { "entropy": 5.952150344848633, "epoch": 2.6709651621932324, "grad_norm": 1.109375, "learning_rate": 0.00042917288804460835, "loss": 5.4989, "mean_token_accuracy": 0.18808284848928453, "num_tokens": 52270956.0, "step": 26720 }, { "entropy": 6.04210729598999, "epoch": 2.6714649872544607, "grad_norm": 1.0, "learning_rate": 0.0004291468922017078, "loss": 5.6061, "mean_token_accuracy": 0.1795856922864914, "num_tokens": 52280467.0, "step": 26725 }, { "entropy": 6.014393711090088, "epoch": 2.6719648123156894, "grad_norm": 1.0859375, "learning_rate": 0.000429120892480511, "loss": 5.6148, "mean_token_accuracy": 0.18586645722389222, "num_tokens": 52290630.0, "step": 26730 }, { "entropy": 6.001048469543457, "epoch": 2.672464637376918, "grad_norm": 1.140625, "learning_rate": 0.0004290948888816722, "loss": 5.6376, "mean_token_accuracy": 0.18222132027149202, "num_tokens": 52300956.0, "step": 26735 }, { "entropy": 5.981879043579101, "epoch": 2.672964462438147, "grad_norm": 1.1953125, "learning_rate": 0.0004290688814058456, "loss": 5.6494, "mean_token_accuracy": 0.17766705751419068, "num_tokens": 52310887.0, "step": 26740 }, { "entropy": 5.985613679885864, "epoch": 2.6734642874993755, "grad_norm": 1.2109375, "learning_rate": 0.0004290428700536857, "loss": 5.5429, "mean_token_accuracy": 0.18922256380319596, "num_tokens": 52320490.0, "step": 26745 }, { "entropy": 6.085641860961914, "epoch": 2.6739641125606037, "grad_norm": 1.1953125, "learning_rate": 0.0004290168548258467, "loss": 5.6193, "mean_token_accuracy": 0.1796812444925308, "num_tokens": 52330477.0, "step": 26750 }, { "entropy": 6.024813890457153, "epoch": 2.6744639376218324, "grad_norm": 1.140625, "learning_rate": 0.00042899083572298335, "loss": 5.6305, "mean_token_accuracy": 0.18234698921442033, "num_tokens": 52339909.0, "step": 26755 }, { "entropy": 5.957294893264771, "epoch": 2.6749637626830607, "grad_norm": 1.203125, "learning_rate": 0.00042896481274575014, "loss": 5.484, "mean_token_accuracy": 0.19024553298950195, "num_tokens": 52349554.0, "step": 26760 }, { "entropy": 5.973018026351928, "epoch": 2.6754635877442894, "grad_norm": 1.2421875, "learning_rate": 0.00042893878589480195, "loss": 5.5857, "mean_token_accuracy": 0.18102037757635117, "num_tokens": 52359561.0, "step": 26765 }, { "entropy": 5.893107557296753, "epoch": 2.675963412805518, "grad_norm": 1.1484375, "learning_rate": 0.00042891275517079345, "loss": 5.448, "mean_token_accuracy": 0.1908065527677536, "num_tokens": 52369360.0, "step": 26770 }, { "entropy": 6.112000370025635, "epoch": 2.676463237866747, "grad_norm": 1.2109375, "learning_rate": 0.00042888672057437964, "loss": 5.645, "mean_token_accuracy": 0.1738707773387432, "num_tokens": 52379433.0, "step": 26775 }, { "entropy": 6.0326180934906, "epoch": 2.6769630629279755, "grad_norm": 1.234375, "learning_rate": 0.00042886068210621557, "loss": 5.6186, "mean_token_accuracy": 0.1823671355843544, "num_tokens": 52389640.0, "step": 26780 }, { "entropy": 5.9240375518798825, "epoch": 2.6774628879892037, "grad_norm": 1.1015625, "learning_rate": 0.0004288346397669563, "loss": 5.5019, "mean_token_accuracy": 0.19580742716789246, "num_tokens": 52399542.0, "step": 26785 }, { "entropy": 6.033792304992676, "epoch": 2.6779627130504324, "grad_norm": 1.109375, "learning_rate": 0.0004288085935572571, "loss": 5.6089, "mean_token_accuracy": 0.18185745626688005, "num_tokens": 52408366.0, "step": 26790 }, { "entropy": 5.962434434890747, "epoch": 2.6784625381116607, "grad_norm": 1.109375, "learning_rate": 0.0004287825434777733, "loss": 5.5951, "mean_token_accuracy": 0.17849481254816055, "num_tokens": 52419047.0, "step": 26795 }, { "entropy": 5.948139953613281, "epoch": 2.6789623631728894, "grad_norm": 1.296875, "learning_rate": 0.00042875648952916024, "loss": 5.4998, "mean_token_accuracy": 0.19390154182910918, "num_tokens": 52428871.0, "step": 26800 }, { "entropy": 5.972239303588867, "epoch": 2.679462188234118, "grad_norm": 1.109375, "learning_rate": 0.0004287304317120734, "loss": 5.6295, "mean_token_accuracy": 0.1845841646194458, "num_tokens": 52439385.0, "step": 26805 }, { "entropy": 6.013038873672485, "epoch": 2.679962013295347, "grad_norm": 1.078125, "learning_rate": 0.00042870437002716854, "loss": 5.6026, "mean_token_accuracy": 0.1910457119345665, "num_tokens": 52449844.0, "step": 26810 }, { "entropy": 5.971204376220703, "epoch": 2.680461838356575, "grad_norm": 1.15625, "learning_rate": 0.0004286783044751013, "loss": 5.5686, "mean_token_accuracy": 0.18059124052524567, "num_tokens": 52458853.0, "step": 26815 }, { "entropy": 6.013601064682007, "epoch": 2.6809616634178037, "grad_norm": 1.1640625, "learning_rate": 0.0004286522350565274, "loss": 5.6235, "mean_token_accuracy": 0.1773431956768036, "num_tokens": 52468321.0, "step": 26820 }, { "entropy": 6.008394765853882, "epoch": 2.6814614884790324, "grad_norm": 1.2578125, "learning_rate": 0.00042862616177210286, "loss": 5.6348, "mean_token_accuracy": 0.17846055775880815, "num_tokens": 52478015.0, "step": 26825 }, { "entropy": 5.9596200466156, "epoch": 2.6819613135402607, "grad_norm": 1.15625, "learning_rate": 0.0004286000846224836, "loss": 5.5393, "mean_token_accuracy": 0.18044990450143814, "num_tokens": 52487589.0, "step": 26830 }, { "entropy": 5.96417350769043, "epoch": 2.6824611386014894, "grad_norm": 1.1484375, "learning_rate": 0.00042857400360832575, "loss": 5.636, "mean_token_accuracy": 0.1853545770049095, "num_tokens": 52496375.0, "step": 26835 }, { "entropy": 6.052075958251953, "epoch": 2.682960963662718, "grad_norm": 1.1796875, "learning_rate": 0.0004285479187302854, "loss": 5.6716, "mean_token_accuracy": 0.1761649563908577, "num_tokens": 52506469.0, "step": 26840 }, { "entropy": 6.117903804779052, "epoch": 2.6834607887239468, "grad_norm": 1.140625, "learning_rate": 0.000428521829989019, "loss": 5.6703, "mean_token_accuracy": 0.17436031401157379, "num_tokens": 52515748.0, "step": 26845 }, { "entropy": 6.006530523300171, "epoch": 2.683960613785175, "grad_norm": 1.3203125, "learning_rate": 0.0004284957373851829, "loss": 5.622, "mean_token_accuracy": 0.17840612679719925, "num_tokens": 52524742.0, "step": 26850 }, { "entropy": 6.044181156158447, "epoch": 2.6844604388464037, "grad_norm": 1.1953125, "learning_rate": 0.00042846964091943347, "loss": 5.6355, "mean_token_accuracy": 0.17338339239358902, "num_tokens": 52534502.0, "step": 26855 }, { "entropy": 6.033875179290772, "epoch": 2.6849602639076324, "grad_norm": 1.0625, "learning_rate": 0.00042844354059242735, "loss": 5.5617, "mean_token_accuracy": 0.17953009754419327, "num_tokens": 52544217.0, "step": 26860 }, { "entropy": 6.020219421386718, "epoch": 2.6854600889688607, "grad_norm": 1.09375, "learning_rate": 0.0004284174364048213, "loss": 5.5556, "mean_token_accuracy": 0.179906490445137, "num_tokens": 52555066.0, "step": 26865 }, { "entropy": 5.978253030776978, "epoch": 2.6859599140300894, "grad_norm": 1.078125, "learning_rate": 0.000428391328357272, "loss": 5.6166, "mean_token_accuracy": 0.17836934477090835, "num_tokens": 52564957.0, "step": 26870 }, { "entropy": 5.999014282226563, "epoch": 2.686459739091318, "grad_norm": 1.125, "learning_rate": 0.0004283652164504364, "loss": 5.559, "mean_token_accuracy": 0.1837862327694893, "num_tokens": 52574893.0, "step": 26875 }, { "entropy": 5.950049781799317, "epoch": 2.6869595641525468, "grad_norm": 1.1171875, "learning_rate": 0.00042833910068497134, "loss": 5.476, "mean_token_accuracy": 0.1946884274482727, "num_tokens": 52583307.0, "step": 26880 }, { "entropy": 5.9665642261505125, "epoch": 2.687459389213775, "grad_norm": 1.125, "learning_rate": 0.000428312981061534, "loss": 5.5236, "mean_token_accuracy": 0.18873154520988464, "num_tokens": 52593055.0, "step": 26885 }, { "entropy": 5.995660018920899, "epoch": 2.6879592142750037, "grad_norm": 1.25, "learning_rate": 0.0004282868575807815, "loss": 5.5163, "mean_token_accuracy": 0.18528735041618347, "num_tokens": 52602068.0, "step": 26890 }, { "entropy": 6.016930341720581, "epoch": 2.6884590393362324, "grad_norm": 1.2578125, "learning_rate": 0.00042826073024337117, "loss": 5.5577, "mean_token_accuracy": 0.191050623357296, "num_tokens": 52609964.0, "step": 26895 }, { "entropy": 6.039786863327026, "epoch": 2.6889588643974607, "grad_norm": 1.09375, "learning_rate": 0.0004282345990499602, "loss": 5.6217, "mean_token_accuracy": 0.17834055572748184, "num_tokens": 52619144.0, "step": 26900 }, { "entropy": 6.088885021209717, "epoch": 2.6894586894586894, "grad_norm": 1.125, "learning_rate": 0.0004282084640012062, "loss": 5.6946, "mean_token_accuracy": 0.17057913392782212, "num_tokens": 52629508.0, "step": 26905 }, { "entropy": 6.070838689804077, "epoch": 2.689958514519918, "grad_norm": 1.1328125, "learning_rate": 0.0004281823250977667, "loss": 5.6015, "mean_token_accuracy": 0.17516913414001464, "num_tokens": 52640037.0, "step": 26910 }, { "entropy": 5.965433406829834, "epoch": 2.6904583395811468, "grad_norm": 1.1953125, "learning_rate": 0.00042815618234029923, "loss": 5.5359, "mean_token_accuracy": 0.18618329465389252, "num_tokens": 52649293.0, "step": 26915 }, { "entropy": 6.016424608230591, "epoch": 2.690958164642375, "grad_norm": 1.2109375, "learning_rate": 0.00042813003572946163, "loss": 5.6131, "mean_token_accuracy": 0.1759931579232216, "num_tokens": 52659560.0, "step": 26920 }, { "entropy": 6.070631456375122, "epoch": 2.6914579897036037, "grad_norm": 1.2734375, "learning_rate": 0.00042810388526591184, "loss": 5.7665, "mean_token_accuracy": 0.17195162028074265, "num_tokens": 52669105.0, "step": 26925 }, { "entropy": 6.039253759384155, "epoch": 2.6919578147648324, "grad_norm": 1.15625, "learning_rate": 0.00042807773095030757, "loss": 5.5135, "mean_token_accuracy": 0.1972134903073311, "num_tokens": 52679633.0, "step": 26930 }, { "entropy": 5.96162896156311, "epoch": 2.6924576398260607, "grad_norm": 1.0859375, "learning_rate": 0.0004280515727833071, "loss": 5.5603, "mean_token_accuracy": 0.18953514248132705, "num_tokens": 52690037.0, "step": 26935 }, { "entropy": 6.055363559722901, "epoch": 2.6929574648872894, "grad_norm": 1.0390625, "learning_rate": 0.0004280254107655684, "loss": 5.6598, "mean_token_accuracy": 0.17485712468624115, "num_tokens": 52701796.0, "step": 26940 }, { "entropy": 5.916491746902466, "epoch": 2.693457289948518, "grad_norm": 1.296875, "learning_rate": 0.0004279992448977497, "loss": 5.397, "mean_token_accuracy": 0.1929888755083084, "num_tokens": 52710634.0, "step": 26945 }, { "entropy": 5.966639518737793, "epoch": 2.6939571150097468, "grad_norm": 1.1640625, "learning_rate": 0.0004279730751805094, "loss": 5.6659, "mean_token_accuracy": 0.17517506033182145, "num_tokens": 52721178.0, "step": 26950 }, { "entropy": 5.992067098617554, "epoch": 2.694456940070975, "grad_norm": 1.140625, "learning_rate": 0.00042794690161450583, "loss": 5.521, "mean_token_accuracy": 0.18638920038938522, "num_tokens": 52730635.0, "step": 26955 }, { "entropy": 6.054883003234863, "epoch": 2.6949567651322037, "grad_norm": 1.1640625, "learning_rate": 0.0004279207242003976, "loss": 5.5384, "mean_token_accuracy": 0.1896473839879036, "num_tokens": 52740711.0, "step": 26960 }, { "entropy": 5.950598669052124, "epoch": 2.6954565901934324, "grad_norm": 1.2109375, "learning_rate": 0.00042789454293884336, "loss": 5.6033, "mean_token_accuracy": 0.18343938291072845, "num_tokens": 52749430.0, "step": 26965 }, { "entropy": 5.962781286239624, "epoch": 2.6959564152546607, "grad_norm": 1.140625, "learning_rate": 0.0004278683578305017, "loss": 5.5077, "mean_token_accuracy": 0.19219315201044082, "num_tokens": 52758288.0, "step": 26970 }, { "entropy": 6.003366899490357, "epoch": 2.6964562403158894, "grad_norm": 1.046875, "learning_rate": 0.00042784216887603154, "loss": 5.6177, "mean_token_accuracy": 0.18064150363206863, "num_tokens": 52768190.0, "step": 26975 }, { "entropy": 6.069954919815063, "epoch": 2.696956065377118, "grad_norm": 1.15625, "learning_rate": 0.0004278159760760917, "loss": 5.5986, "mean_token_accuracy": 0.18276410698890685, "num_tokens": 52779262.0, "step": 26980 }, { "entropy": 6.005918502807617, "epoch": 2.6974558904383468, "grad_norm": 1.3984375, "learning_rate": 0.0004277897794313412, "loss": 5.6008, "mean_token_accuracy": 0.1810927927494049, "num_tokens": 52788564.0, "step": 26985 }, { "entropy": 6.007136297225952, "epoch": 2.697955715499575, "grad_norm": 1.1484375, "learning_rate": 0.0004277635789424393, "loss": 5.597, "mean_token_accuracy": 0.1826305106282234, "num_tokens": 52797293.0, "step": 26990 }, { "entropy": 5.957183074951172, "epoch": 2.6984555405608037, "grad_norm": 1.171875, "learning_rate": 0.0004277373746100449, "loss": 5.5173, "mean_token_accuracy": 0.18230416923761367, "num_tokens": 52806815.0, "step": 26995 }, { "entropy": 5.999039125442505, "epoch": 2.6989553656220324, "grad_norm": 1.2734375, "learning_rate": 0.00042771116643481753, "loss": 5.5619, "mean_token_accuracy": 0.1829219087958336, "num_tokens": 52815496.0, "step": 27000 }, { "epoch": 2.6989553656220324, "eval_entropy": 5.838070204011622, "eval_loss": 5.710117340087891, "eval_mean_token_accuracy": 0.18427451314484758, "eval_num_tokens": 52815496.0, "eval_runtime": 23.9487, "eval_samples_per_second": 1296.312, "eval_steps_per_second": 162.055, "step": 27000 }, { "entropy": 6.093468713760376, "epoch": 2.6994551906832607, "grad_norm": 1.2734375, "learning_rate": 0.0004276849544174166, "loss": 5.6742, "mean_token_accuracy": 0.17093367129564285, "num_tokens": 52825203.0, "step": 27005 }, { "entropy": 5.986290407180786, "epoch": 2.6999550157444894, "grad_norm": 1.0859375, "learning_rate": 0.00042765873855850133, "loss": 5.6361, "mean_token_accuracy": 0.1830984905362129, "num_tokens": 52835956.0, "step": 27010 }, { "entropy": 5.9616741180419925, "epoch": 2.700454840805718, "grad_norm": 1.203125, "learning_rate": 0.0004276325188587316, "loss": 5.5936, "mean_token_accuracy": 0.18605817705392838, "num_tokens": 52845314.0, "step": 27015 }, { "entropy": 6.025298023223877, "epoch": 2.7009546658669468, "grad_norm": 1.046875, "learning_rate": 0.0004276062953187669, "loss": 5.5668, "mean_token_accuracy": 0.1808945655822754, "num_tokens": 52855693.0, "step": 27020 }, { "entropy": 6.034712600708008, "epoch": 2.701454490928175, "grad_norm": 1.125, "learning_rate": 0.0004275800679392671, "loss": 5.6137, "mean_token_accuracy": 0.18032210618257521, "num_tokens": 52865931.0, "step": 27025 }, { "entropy": 6.026051950454712, "epoch": 2.7019543159894037, "grad_norm": 1.21875, "learning_rate": 0.0004275538367208921, "loss": 5.6078, "mean_token_accuracy": 0.1831350475549698, "num_tokens": 52876329.0, "step": 27030 }, { "entropy": 6.04150767326355, "epoch": 2.7024541410506324, "grad_norm": 1.1796875, "learning_rate": 0.00042752760166430185, "loss": 5.63, "mean_token_accuracy": 0.17290515452623367, "num_tokens": 52886876.0, "step": 27035 }, { "entropy": 6.01654167175293, "epoch": 2.7029539661118607, "grad_norm": 1.171875, "learning_rate": 0.00042750136277015625, "loss": 5.6375, "mean_token_accuracy": 0.178939650952816, "num_tokens": 52896584.0, "step": 27040 }, { "entropy": 6.063281869888305, "epoch": 2.7034537911730894, "grad_norm": 1.171875, "learning_rate": 0.00042747512003911577, "loss": 5.5672, "mean_token_accuracy": 0.18576823621988298, "num_tokens": 52906388.0, "step": 27045 }, { "entropy": 5.969471216201782, "epoch": 2.703953616234318, "grad_norm": 1.203125, "learning_rate": 0.00042744887347184035, "loss": 5.5, "mean_token_accuracy": 0.1872352808713913, "num_tokens": 52915732.0, "step": 27050 }, { "entropy": 5.985595703125, "epoch": 2.7044534412955468, "grad_norm": 1.1640625, "learning_rate": 0.0004274226230689906, "loss": 5.6605, "mean_token_accuracy": 0.17719454020261766, "num_tokens": 52926066.0, "step": 27055 }, { "entropy": 6.004272508621216, "epoch": 2.704953266356775, "grad_norm": 1.15625, "learning_rate": 0.00042739636883122687, "loss": 5.6017, "mean_token_accuracy": 0.18293238580226898, "num_tokens": 52936075.0, "step": 27060 }, { "entropy": 5.96013503074646, "epoch": 2.7054530914180037, "grad_norm": 1.171875, "learning_rate": 0.00042737011075920974, "loss": 5.6005, "mean_token_accuracy": 0.17806628197431565, "num_tokens": 52944266.0, "step": 27065 }, { "entropy": 6.088792419433593, "epoch": 2.7059529164792324, "grad_norm": 1.1484375, "learning_rate": 0.0004273438488535997, "loss": 5.7037, "mean_token_accuracy": 0.17846416383981706, "num_tokens": 52954999.0, "step": 27070 }, { "entropy": 6.077151203155518, "epoch": 2.7064527415404607, "grad_norm": 1.140625, "learning_rate": 0.00042731758311505773, "loss": 5.7234, "mean_token_accuracy": 0.16800843179225922, "num_tokens": 52965374.0, "step": 27075 }, { "entropy": 5.975375127792359, "epoch": 2.7069525666016894, "grad_norm": 1.1015625, "learning_rate": 0.00042729131354424455, "loss": 5.5372, "mean_token_accuracy": 0.18939847350120545, "num_tokens": 52975956.0, "step": 27080 }, { "entropy": 5.983653926849366, "epoch": 2.707452391662918, "grad_norm": 1.0390625, "learning_rate": 0.0004272650401418211, "loss": 5.5198, "mean_token_accuracy": 0.18422410935163497, "num_tokens": 52985595.0, "step": 27085 }, { "entropy": 6.015768814086914, "epoch": 2.7079522167241468, "grad_norm": 1.0390625, "learning_rate": 0.0004272387629084484, "loss": 5.6731, "mean_token_accuracy": 0.17442942559719085, "num_tokens": 52994755.0, "step": 27090 }, { "entropy": 6.057124042510987, "epoch": 2.708452041785375, "grad_norm": 1.2109375, "learning_rate": 0.00042721248184478765, "loss": 5.6425, "mean_token_accuracy": 0.17692352682352067, "num_tokens": 53004529.0, "step": 27095 }, { "entropy": 6.108982181549072, "epoch": 2.7089518668466037, "grad_norm": 1.125, "learning_rate": 0.0004271861969515, "loss": 5.7727, "mean_token_accuracy": 0.17348310798406602, "num_tokens": 53015223.0, "step": 27100 }, { "entropy": 6.0927080631256105, "epoch": 2.7094516919078324, "grad_norm": 1.3828125, "learning_rate": 0.00042715990822924673, "loss": 5.6868, "mean_token_accuracy": 0.17257785350084304, "num_tokens": 53026014.0, "step": 27105 }, { "entropy": 6.088343620300293, "epoch": 2.7099515169690607, "grad_norm": 1.09375, "learning_rate": 0.00042713361567868946, "loss": 5.6115, "mean_token_accuracy": 0.17847627848386766, "num_tokens": 53036463.0, "step": 27110 }, { "entropy": 6.0414213180542, "epoch": 2.7104513420302894, "grad_norm": 1.1171875, "learning_rate": 0.00042710731930048945, "loss": 5.5987, "mean_token_accuracy": 0.18209393620491027, "num_tokens": 53045933.0, "step": 27115 }, { "entropy": 5.9339954376220705, "epoch": 2.710951167091518, "grad_norm": 1.1015625, "learning_rate": 0.0004270810190953085, "loss": 5.4923, "mean_token_accuracy": 0.19113294333219527, "num_tokens": 53056098.0, "step": 27120 }, { "entropy": 5.954439687728882, "epoch": 2.7114509921527468, "grad_norm": 1.2734375, "learning_rate": 0.0004270547150638082, "loss": 5.516, "mean_token_accuracy": 0.1825221985578537, "num_tokens": 53065757.0, "step": 27125 }, { "entropy": 5.972350072860718, "epoch": 2.711950817213975, "grad_norm": 1.125, "learning_rate": 0.00042702840720665043, "loss": 5.5062, "mean_token_accuracy": 0.1932624489068985, "num_tokens": 53074616.0, "step": 27130 }, { "entropy": 6.023061370849609, "epoch": 2.7124506422752037, "grad_norm": 1.1171875, "learning_rate": 0.00042700209552449706, "loss": 5.6543, "mean_token_accuracy": 0.17162775993347168, "num_tokens": 53084861.0, "step": 27135 }, { "entropy": 6.126827812194824, "epoch": 2.7129504673364324, "grad_norm": 1.0390625, "learning_rate": 0.00042697578001801, "loss": 5.6654, "mean_token_accuracy": 0.16799379587173463, "num_tokens": 53095175.0, "step": 27140 }, { "entropy": 6.084599208831787, "epoch": 2.7134502923976607, "grad_norm": 1.1171875, "learning_rate": 0.0004269494606878515, "loss": 5.6472, "mean_token_accuracy": 0.17867687940597535, "num_tokens": 53105094.0, "step": 27145 }, { "entropy": 6.070139741897583, "epoch": 2.7139501174588894, "grad_norm": 1.109375, "learning_rate": 0.0004269231375346836, "loss": 5.6416, "mean_token_accuracy": 0.1760774627327919, "num_tokens": 53115716.0, "step": 27150 }, { "entropy": 5.983975076675415, "epoch": 2.714449942520118, "grad_norm": 1.109375, "learning_rate": 0.0004268968105591687, "loss": 5.5374, "mean_token_accuracy": 0.1832382619380951, "num_tokens": 53124375.0, "step": 27155 }, { "entropy": 5.863095283508301, "epoch": 2.7149497675813468, "grad_norm": 1.0625, "learning_rate": 0.0004268704797619692, "loss": 5.4799, "mean_token_accuracy": 0.19058356881141664, "num_tokens": 53135220.0, "step": 27160 }, { "entropy": 5.91553692817688, "epoch": 2.715449592642575, "grad_norm": 1.1484375, "learning_rate": 0.00042684414514374734, "loss": 5.5062, "mean_token_accuracy": 0.19097226858139038, "num_tokens": 53144424.0, "step": 27165 }, { "entropy": 5.98000316619873, "epoch": 2.7159494177038037, "grad_norm": 1.2421875, "learning_rate": 0.00042681780670516595, "loss": 5.5678, "mean_token_accuracy": 0.18549496233463286, "num_tokens": 53154611.0, "step": 27170 }, { "entropy": 6.134168338775635, "epoch": 2.716449242765032, "grad_norm": 1.1171875, "learning_rate": 0.0004267914644468877, "loss": 5.7243, "mean_token_accuracy": 0.17353716492652893, "num_tokens": 53163061.0, "step": 27175 }, { "entropy": 6.022347497940063, "epoch": 2.7169490678262607, "grad_norm": 1.1953125, "learning_rate": 0.0004267651183695752, "loss": 5.5357, "mean_token_accuracy": 0.18719310611486434, "num_tokens": 53173078.0, "step": 27180 }, { "entropy": 5.991395807266235, "epoch": 2.7174488928874894, "grad_norm": 1.25, "learning_rate": 0.0004267387684738913, "loss": 5.5235, "mean_token_accuracy": 0.18540988117456436, "num_tokens": 53182957.0, "step": 27185 }, { "entropy": 6.060959386825561, "epoch": 2.717948717948718, "grad_norm": 1.1640625, "learning_rate": 0.0004267124147604991, "loss": 5.6219, "mean_token_accuracy": 0.17635377496480942, "num_tokens": 53193074.0, "step": 27190 }, { "entropy": 6.0154413223266605, "epoch": 2.7184485430099468, "grad_norm": 1.125, "learning_rate": 0.0004266860572300615, "loss": 5.5866, "mean_token_accuracy": 0.18626046627759935, "num_tokens": 53202233.0, "step": 27195 }, { "entropy": 6.097850799560547, "epoch": 2.718948368071175, "grad_norm": 1.1328125, "learning_rate": 0.0004266596958832419, "loss": 5.7423, "mean_token_accuracy": 0.17335643917322158, "num_tokens": 53212332.0, "step": 27200 }, { "entropy": 5.987348890304565, "epoch": 2.7194481931324037, "grad_norm": 1.046875, "learning_rate": 0.0004266333307207032, "loss": 5.5815, "mean_token_accuracy": 0.18753986209630966, "num_tokens": 53222440.0, "step": 27205 }, { "entropy": 5.9790057182312015, "epoch": 2.719948018193632, "grad_norm": 1.0390625, "learning_rate": 0.00042660696174310904, "loss": 5.5611, "mean_token_accuracy": 0.18253172039985657, "num_tokens": 53232129.0, "step": 27210 }, { "entropy": 6.054220724105835, "epoch": 2.7204478432548607, "grad_norm": 1.1328125, "learning_rate": 0.0004265805889511227, "loss": 5.6578, "mean_token_accuracy": 0.17718640267848967, "num_tokens": 53241678.0, "step": 27215 }, { "entropy": 6.017231559753418, "epoch": 2.7209476683160894, "grad_norm": 1.109375, "learning_rate": 0.0004265542123454077, "loss": 5.635, "mean_token_accuracy": 0.17655487060546876, "num_tokens": 53250939.0, "step": 27220 }, { "entropy": 6.08200888633728, "epoch": 2.721447493377318, "grad_norm": 1.1640625, "learning_rate": 0.00042652783192662774, "loss": 5.6955, "mean_token_accuracy": 0.17173449397087098, "num_tokens": 53261058.0, "step": 27225 }, { "entropy": 6.067490530014038, "epoch": 2.7219473184385468, "grad_norm": 1.09375, "learning_rate": 0.0004265014476954465, "loss": 5.5665, "mean_token_accuracy": 0.18569913357496262, "num_tokens": 53270934.0, "step": 27230 }, { "entropy": 5.972762966156006, "epoch": 2.722447143499775, "grad_norm": 1.0546875, "learning_rate": 0.0004264750596525279, "loss": 5.594, "mean_token_accuracy": 0.18594417572021485, "num_tokens": 53280593.0, "step": 27235 }, { "entropy": 5.998912572860718, "epoch": 2.7229469685610037, "grad_norm": 1.2578125, "learning_rate": 0.00042644866779853577, "loss": 5.5998, "mean_token_accuracy": 0.18381264358758925, "num_tokens": 53289381.0, "step": 27240 }, { "entropy": 6.067308378219605, "epoch": 2.723446793622232, "grad_norm": 1.2109375, "learning_rate": 0.00042642227213413405, "loss": 5.7584, "mean_token_accuracy": 0.175156432390213, "num_tokens": 53298715.0, "step": 27245 }, { "entropy": 6.038973474502564, "epoch": 2.7239466186834607, "grad_norm": 1.109375, "learning_rate": 0.00042639587265998696, "loss": 5.5964, "mean_token_accuracy": 0.18051807433366776, "num_tokens": 53309056.0, "step": 27250 }, { "entropy": 6.068113040924072, "epoch": 2.7244464437446894, "grad_norm": 1.1171875, "learning_rate": 0.0004263694693767587, "loss": 5.6356, "mean_token_accuracy": 0.18045537769794465, "num_tokens": 53319028.0, "step": 27255 }, { "entropy": 6.057782745361328, "epoch": 2.724946268805918, "grad_norm": 1.0546875, "learning_rate": 0.0004263430622851135, "loss": 5.6326, "mean_token_accuracy": 0.16959791034460067, "num_tokens": 53329516.0, "step": 27260 }, { "entropy": 6.084223508834839, "epoch": 2.7254460938671468, "grad_norm": 1.125, "learning_rate": 0.0004263166513857158, "loss": 5.6641, "mean_token_accuracy": 0.17089378237724304, "num_tokens": 53341163.0, "step": 27265 }, { "entropy": 5.9875969886779785, "epoch": 2.725945918928375, "grad_norm": 1.2109375, "learning_rate": 0.00042629023667923016, "loss": 5.5435, "mean_token_accuracy": 0.18373292684555054, "num_tokens": 53350735.0, "step": 27270 }, { "entropy": 6.020624303817749, "epoch": 2.7264457439896037, "grad_norm": 1.0625, "learning_rate": 0.00042626381816632096, "loss": 5.5311, "mean_token_accuracy": 0.19173386693000793, "num_tokens": 53361023.0, "step": 27275 }, { "entropy": 6.0022681713104244, "epoch": 2.726945569050832, "grad_norm": 1.1875, "learning_rate": 0.00042623739584765315, "loss": 5.5966, "mean_token_accuracy": 0.17498223036527633, "num_tokens": 53370859.0, "step": 27280 }, { "entropy": 6.002542781829834, "epoch": 2.7274453941120607, "grad_norm": 1.09375, "learning_rate": 0.00042621096972389136, "loss": 5.5307, "mean_token_accuracy": 0.18992618471384048, "num_tokens": 53380610.0, "step": 27285 }, { "entropy": 6.031797933578491, "epoch": 2.7279452191732894, "grad_norm": 1.171875, "learning_rate": 0.00042618453979570035, "loss": 5.7414, "mean_token_accuracy": 0.17168987840414046, "num_tokens": 53392497.0, "step": 27290 }, { "entropy": 6.016695737838745, "epoch": 2.728445044234518, "grad_norm": 1.140625, "learning_rate": 0.00042615810606374535, "loss": 5.5864, "mean_token_accuracy": 0.1842956066131592, "num_tokens": 53402234.0, "step": 27295 }, { "entropy": 6.010934925079345, "epoch": 2.7289448692957468, "grad_norm": 1.125, "learning_rate": 0.0004261316685286913, "loss": 5.637, "mean_token_accuracy": 0.1797935500741005, "num_tokens": 53412430.0, "step": 27300 }, { "entropy": 6.053708791732788, "epoch": 2.729444694356975, "grad_norm": 1.09375, "learning_rate": 0.0004261052271912033, "loss": 5.627, "mean_token_accuracy": 0.17945598363876342, "num_tokens": 53422574.0, "step": 27305 }, { "entropy": 5.958252048492431, "epoch": 2.7299445194182037, "grad_norm": 1.984375, "learning_rate": 0.0004260787820519467, "loss": 5.407, "mean_token_accuracy": 0.20558411926031112, "num_tokens": 53431322.0, "step": 27310 }, { "entropy": 5.958083868026733, "epoch": 2.730444344479432, "grad_norm": 1.1015625, "learning_rate": 0.0004260523331115868, "loss": 5.4461, "mean_token_accuracy": 0.18894680738449096, "num_tokens": 53440389.0, "step": 27315 }, { "entropy": 5.953938341140747, "epoch": 2.7309441695406607, "grad_norm": 1.1015625, "learning_rate": 0.00042602588037078903, "loss": 5.6348, "mean_token_accuracy": 0.18176087886095046, "num_tokens": 53449458.0, "step": 27320 }, { "entropy": 6.079331970214843, "epoch": 2.7314439946018894, "grad_norm": 1.0703125, "learning_rate": 0.00042599942383021906, "loss": 5.6376, "mean_token_accuracy": 0.17840943485498428, "num_tokens": 53459075.0, "step": 27325 }, { "entropy": 6.089920902252198, "epoch": 2.731943819663118, "grad_norm": 1.0859375, "learning_rate": 0.0004259729634905424, "loss": 5.6563, "mean_token_accuracy": 0.1795509934425354, "num_tokens": 53468660.0, "step": 27330 }, { "entropy": 5.99136872291565, "epoch": 2.7324436447243468, "grad_norm": 1.1875, "learning_rate": 0.00042594649935242493, "loss": 5.5908, "mean_token_accuracy": 0.1872320994734764, "num_tokens": 53477663.0, "step": 27335 }, { "entropy": 6.020648527145386, "epoch": 2.732943469785575, "grad_norm": 1.203125, "learning_rate": 0.0004259200314165322, "loss": 5.6132, "mean_token_accuracy": 0.18416111022233964, "num_tokens": 53487226.0, "step": 27340 }, { "entropy": 6.018085145950318, "epoch": 2.7334432948468037, "grad_norm": 1.2109375, "learning_rate": 0.0004258935596835303, "loss": 5.5403, "mean_token_accuracy": 0.18396894484758378, "num_tokens": 53496483.0, "step": 27345 }, { "entropy": 6.071332359313965, "epoch": 2.733943119908032, "grad_norm": 1.171875, "learning_rate": 0.00042586708415408547, "loss": 5.7025, "mean_token_accuracy": 0.17057203352451325, "num_tokens": 53506042.0, "step": 27350 }, { "entropy": 5.950396347045898, "epoch": 2.7344429449692607, "grad_norm": 1.1171875, "learning_rate": 0.0004258406048288635, "loss": 5.5218, "mean_token_accuracy": 0.18781934678554535, "num_tokens": 53516543.0, "step": 27355 }, { "entropy": 6.035513114929199, "epoch": 2.7349427700304894, "grad_norm": 1.1796875, "learning_rate": 0.00042581412170853073, "loss": 5.6795, "mean_token_accuracy": 0.18417606353759766, "num_tokens": 53527432.0, "step": 27360 }, { "entropy": 6.074202251434326, "epoch": 2.735442595091718, "grad_norm": 1.078125, "learning_rate": 0.0004257876347937535, "loss": 5.6646, "mean_token_accuracy": 0.18017210960388183, "num_tokens": 53535930.0, "step": 27365 }, { "entropy": 5.916111183166504, "epoch": 2.7359424201529463, "grad_norm": 1.140625, "learning_rate": 0.0004257611440851981, "loss": 5.4916, "mean_token_accuracy": 0.19297810196876525, "num_tokens": 53545123.0, "step": 27370 }, { "entropy": 6.01715407371521, "epoch": 2.736442245214175, "grad_norm": 1.1015625, "learning_rate": 0.00042573464958353116, "loss": 5.5787, "mean_token_accuracy": 0.1854477345943451, "num_tokens": 53554892.0, "step": 27375 }, { "entropy": 6.00073390007019, "epoch": 2.7369420702754037, "grad_norm": 1.3203125, "learning_rate": 0.0004257081512894192, "loss": 5.5093, "mean_token_accuracy": 0.19489142447710037, "num_tokens": 53564858.0, "step": 27380 }, { "entropy": 5.957695817947387, "epoch": 2.737441895336632, "grad_norm": 1.140625, "learning_rate": 0.00042568164920352895, "loss": 5.4747, "mean_token_accuracy": 0.19229158461093904, "num_tokens": 53573750.0, "step": 27385 }, { "entropy": 5.841927099227905, "epoch": 2.7379417203978607, "grad_norm": 1.0, "learning_rate": 0.0004256551433265273, "loss": 5.427, "mean_token_accuracy": 0.20349105149507524, "num_tokens": 53584416.0, "step": 27390 }, { "entropy": 5.927203512191772, "epoch": 2.7384415454590894, "grad_norm": 1.15625, "learning_rate": 0.0004256286336590808, "loss": 5.4959, "mean_token_accuracy": 0.18907767981290818, "num_tokens": 53593166.0, "step": 27395 }, { "entropy": 6.009900236129761, "epoch": 2.738941370520318, "grad_norm": 1.1875, "learning_rate": 0.0004256021202018568, "loss": 5.6234, "mean_token_accuracy": 0.17576504051685332, "num_tokens": 53603025.0, "step": 27400 }, { "entropy": 6.0701700210571286, "epoch": 2.7394411955815463, "grad_norm": 1.078125, "learning_rate": 0.0004255756029555222, "loss": 5.5841, "mean_token_accuracy": 0.1801871046423912, "num_tokens": 53613266.0, "step": 27405 }, { "entropy": 5.938579559326172, "epoch": 2.739941020642775, "grad_norm": 1.2109375, "learning_rate": 0.00042554908192074406, "loss": 5.5407, "mean_token_accuracy": 0.19068458974361419, "num_tokens": 53622271.0, "step": 27410 }, { "entropy": 6.0222169876098635, "epoch": 2.7404408457040037, "grad_norm": 1.1015625, "learning_rate": 0.00042552255709818975, "loss": 5.6708, "mean_token_accuracy": 0.17701807916164397, "num_tokens": 53632096.0, "step": 27415 }, { "entropy": 6.0275609493255615, "epoch": 2.740940670765232, "grad_norm": 1.1640625, "learning_rate": 0.00042549602848852673, "loss": 5.5928, "mean_token_accuracy": 0.18312969505786897, "num_tokens": 53640875.0, "step": 27420 }, { "entropy": 5.960612487792969, "epoch": 2.7414404958264607, "grad_norm": 1.171875, "learning_rate": 0.0004254694960924224, "loss": 5.5283, "mean_token_accuracy": 0.19398050755262375, "num_tokens": 53650186.0, "step": 27425 }, { "entropy": 5.940154552459717, "epoch": 2.7419403208876894, "grad_norm": 1.1484375, "learning_rate": 0.0004254429599105442, "loss": 5.5431, "mean_token_accuracy": 0.18482432514429092, "num_tokens": 53659608.0, "step": 27430 }, { "entropy": 6.058273267745972, "epoch": 2.742440145948918, "grad_norm": 1.1640625, "learning_rate": 0.0004254164199435598, "loss": 5.5865, "mean_token_accuracy": 0.1770264208316803, "num_tokens": 53668479.0, "step": 27435 }, { "entropy": 6.010121583938599, "epoch": 2.7429399710101463, "grad_norm": 1.1953125, "learning_rate": 0.0004253898761921371, "loss": 5.5854, "mean_token_accuracy": 0.18623895943164825, "num_tokens": 53677496.0, "step": 27440 }, { "entropy": 6.054209136962891, "epoch": 2.743439796071375, "grad_norm": 1.203125, "learning_rate": 0.0004253633286569437, "loss": 5.6507, "mean_token_accuracy": 0.17868286073207856, "num_tokens": 53686865.0, "step": 27445 }, { "entropy": 6.088141632080078, "epoch": 2.7439396211326037, "grad_norm": 1.1875, "learning_rate": 0.0004253367773386476, "loss": 5.6393, "mean_token_accuracy": 0.1796304240822792, "num_tokens": 53696159.0, "step": 27450 }, { "entropy": 6.082489395141602, "epoch": 2.744439446193832, "grad_norm": 1.140625, "learning_rate": 0.000425310222237917, "loss": 5.5963, "mean_token_accuracy": 0.17227582782506942, "num_tokens": 53705512.0, "step": 27455 }, { "entropy": 6.002741479873658, "epoch": 2.7449392712550607, "grad_norm": 1.1875, "learning_rate": 0.00042528366335541984, "loss": 5.6246, "mean_token_accuracy": 0.17753540575504304, "num_tokens": 53714361.0, "step": 27460 }, { "entropy": 6.032882976531982, "epoch": 2.7454390963162894, "grad_norm": 1.09375, "learning_rate": 0.0004252571006918243, "loss": 5.5978, "mean_token_accuracy": 0.18241076916456223, "num_tokens": 53723606.0, "step": 27465 }, { "entropy": 6.020380067825317, "epoch": 2.745938921377518, "grad_norm": 1.1875, "learning_rate": 0.0004252305342477989, "loss": 5.5514, "mean_token_accuracy": 0.1878909021615982, "num_tokens": 53734041.0, "step": 27470 }, { "entropy": 6.0489044189453125, "epoch": 2.7464387464387463, "grad_norm": 1.1015625, "learning_rate": 0.00042520396402401185, "loss": 5.5471, "mean_token_accuracy": 0.1853782892227173, "num_tokens": 53743735.0, "step": 27475 }, { "entropy": 6.018071699142456, "epoch": 2.746938571499975, "grad_norm": 1.0078125, "learning_rate": 0.0004251773900211317, "loss": 5.6348, "mean_token_accuracy": 0.18193268030881882, "num_tokens": 53753960.0, "step": 27480 }, { "entropy": 6.025861215591431, "epoch": 2.7474383965612037, "grad_norm": 1.15625, "learning_rate": 0.00042515081223982716, "loss": 5.6475, "mean_token_accuracy": 0.18406011462211608, "num_tokens": 53764874.0, "step": 27485 }, { "entropy": 6.100893354415893, "epoch": 2.747938221622432, "grad_norm": 1.1953125, "learning_rate": 0.00042512423068076673, "loss": 5.6514, "mean_token_accuracy": 0.18138669133186341, "num_tokens": 53775153.0, "step": 27490 }, { "entropy": 6.020990037918091, "epoch": 2.7484380466836607, "grad_norm": 1.2421875, "learning_rate": 0.0004250976453446193, "loss": 5.4934, "mean_token_accuracy": 0.18941137492656707, "num_tokens": 53785091.0, "step": 27495 }, { "entropy": 5.994096803665161, "epoch": 2.7489378717448893, "grad_norm": 1.1640625, "learning_rate": 0.0004250710562320538, "loss": 5.5027, "mean_token_accuracy": 0.1884840250015259, "num_tokens": 53794154.0, "step": 27500 }, { "entropy": 5.971716260910034, "epoch": 2.749437696806118, "grad_norm": 1.1171875, "learning_rate": 0.00042504446334373905, "loss": 5.5382, "mean_token_accuracy": 0.1826824054121971, "num_tokens": 53804129.0, "step": 27505 }, { "entropy": 6.001299953460693, "epoch": 2.7499375218673463, "grad_norm": 1.171875, "learning_rate": 0.0004250178666803442, "loss": 5.6649, "mean_token_accuracy": 0.18248123526573182, "num_tokens": 53813081.0, "step": 27510 }, { "entropy": 6.018114328384399, "epoch": 2.750437346928575, "grad_norm": 1.078125, "learning_rate": 0.0004249912662425385, "loss": 5.5655, "mean_token_accuracy": 0.18710773140192033, "num_tokens": 53821949.0, "step": 27515 }, { "entropy": 6.090381717681884, "epoch": 2.7509371719898037, "grad_norm": 1.1796875, "learning_rate": 0.00042496466203099107, "loss": 5.5966, "mean_token_accuracy": 0.18027124553918839, "num_tokens": 53831232.0, "step": 27520 }, { "entropy": 6.058498668670654, "epoch": 2.751436997051032, "grad_norm": 1.0625, "learning_rate": 0.00042493805404637136, "loss": 5.5799, "mean_token_accuracy": 0.1783789113163948, "num_tokens": 53841068.0, "step": 27525 }, { "entropy": 5.890639352798462, "epoch": 2.7519368221122606, "grad_norm": 1.1328125, "learning_rate": 0.00042491144228934885, "loss": 5.4541, "mean_token_accuracy": 0.19586748480796815, "num_tokens": 53849874.0, "step": 27530 }, { "entropy": 5.9231809139251705, "epoch": 2.7524366471734893, "grad_norm": 1.1328125, "learning_rate": 0.000424884826760593, "loss": 5.4961, "mean_token_accuracy": 0.1936953544616699, "num_tokens": 53859173.0, "step": 27535 }, { "entropy": 6.016198682785034, "epoch": 2.752936472234718, "grad_norm": 1.1484375, "learning_rate": 0.00042485820746077346, "loss": 5.5722, "mean_token_accuracy": 0.1853718489408493, "num_tokens": 53869000.0, "step": 27540 }, { "entropy": 6.088893556594849, "epoch": 2.7534362972959463, "grad_norm": 1.0859375, "learning_rate": 0.00042483158439055995, "loss": 5.6937, "mean_token_accuracy": 0.17470086216926575, "num_tokens": 53879941.0, "step": 27545 }, { "entropy": 5.972760105133057, "epoch": 2.753936122357175, "grad_norm": 1.0625, "learning_rate": 0.0004248049575506224, "loss": 5.5211, "mean_token_accuracy": 0.18745189160108566, "num_tokens": 53889480.0, "step": 27550 }, { "entropy": 6.021461629867554, "epoch": 2.7544359474184037, "grad_norm": 1.15625, "learning_rate": 0.0004247783269416306, "loss": 5.5918, "mean_token_accuracy": 0.18462428599596023, "num_tokens": 53898554.0, "step": 27555 }, { "entropy": 6.006372451782227, "epoch": 2.754935772479632, "grad_norm": 1.0390625, "learning_rate": 0.00042475169256425466, "loss": 5.5217, "mean_token_accuracy": 0.1879958063364029, "num_tokens": 53907898.0, "step": 27560 }, { "entropy": 6.063958215713501, "epoch": 2.7554355975408606, "grad_norm": 1.1640625, "learning_rate": 0.0004247250544191647, "loss": 5.6526, "mean_token_accuracy": 0.17136678397655486, "num_tokens": 53917948.0, "step": 27565 }, { "entropy": 6.022657823562622, "epoch": 2.7559354226020893, "grad_norm": 1.0859375, "learning_rate": 0.00042469841250703086, "loss": 5.5821, "mean_token_accuracy": 0.18458817452192305, "num_tokens": 53927409.0, "step": 27570 }, { "entropy": 6.047533369064331, "epoch": 2.756435247663318, "grad_norm": 1.1484375, "learning_rate": 0.0004246717668285235, "loss": 5.6213, "mean_token_accuracy": 0.18155992776155472, "num_tokens": 53936600.0, "step": 27575 }, { "entropy": 6.017524576187133, "epoch": 2.7569350727245463, "grad_norm": 1.0546875, "learning_rate": 0.00042464511738431296, "loss": 5.5609, "mean_token_accuracy": 0.19726441651582718, "num_tokens": 53946247.0, "step": 27580 }, { "entropy": 5.881282997131348, "epoch": 2.757434897785775, "grad_norm": 1.125, "learning_rate": 0.00042461846417506983, "loss": 5.4088, "mean_token_accuracy": 0.19651411473751068, "num_tokens": 53956009.0, "step": 27585 }, { "entropy": 6.064783716201783, "epoch": 2.7579347228470037, "grad_norm": 1.359375, "learning_rate": 0.0004245918072014646, "loss": 5.599, "mean_token_accuracy": 0.18396134972572326, "num_tokens": 53965549.0, "step": 27590 }, { "entropy": 6.031863975524902, "epoch": 2.758434547908232, "grad_norm": 1.078125, "learning_rate": 0.000424565146464168, "loss": 5.6126, "mean_token_accuracy": 0.17688046395778656, "num_tokens": 53975901.0, "step": 27595 }, { "entropy": 6.079634666442871, "epoch": 2.7589343729694606, "grad_norm": 1.046875, "learning_rate": 0.00042453848196385085, "loss": 5.653, "mean_token_accuracy": 0.17516692578792573, "num_tokens": 53985334.0, "step": 27600 }, { "entropy": 5.922613668441772, "epoch": 2.7594341980306893, "grad_norm": 1.25, "learning_rate": 0.00042451181370118394, "loss": 5.4727, "mean_token_accuracy": 0.19682121127843857, "num_tokens": 53995445.0, "step": 27605 }, { "entropy": 5.982703685760498, "epoch": 2.759934023091918, "grad_norm": 1.171875, "learning_rate": 0.0004244851416768383, "loss": 5.5716, "mean_token_accuracy": 0.1887113556265831, "num_tokens": 54004845.0, "step": 27610 }, { "entropy": 5.995750761032104, "epoch": 2.7604338481531463, "grad_norm": 1.0546875, "learning_rate": 0.0004244584658914849, "loss": 5.5742, "mean_token_accuracy": 0.1909280464053154, "num_tokens": 54015074.0, "step": 27615 }, { "entropy": 6.000145769119262, "epoch": 2.760933673214375, "grad_norm": 1.078125, "learning_rate": 0.00042443178634579497, "loss": 5.5901, "mean_token_accuracy": 0.1760549396276474, "num_tokens": 54025022.0, "step": 27620 }, { "entropy": 6.02004189491272, "epoch": 2.7614334982756037, "grad_norm": 1.078125, "learning_rate": 0.0004244051030404398, "loss": 5.6104, "mean_token_accuracy": 0.1820294290781021, "num_tokens": 54034901.0, "step": 27625 }, { "entropy": 6.02276840209961, "epoch": 2.761933323336832, "grad_norm": 1.2109375, "learning_rate": 0.00042437841597609054, "loss": 5.6009, "mean_token_accuracy": 0.1790747120976448, "num_tokens": 54044032.0, "step": 27630 }, { "entropy": 5.994511985778809, "epoch": 2.7624331483980606, "grad_norm": 1.09375, "learning_rate": 0.0004243517251534189, "loss": 5.5945, "mean_token_accuracy": 0.1817207843065262, "num_tokens": 54054635.0, "step": 27635 }, { "entropy": 6.002866315841675, "epoch": 2.7629329734592893, "grad_norm": 1.2578125, "learning_rate": 0.0004243250305730963, "loss": 5.5456, "mean_token_accuracy": 0.18994971215724946, "num_tokens": 54064658.0, "step": 27640 }, { "entropy": 6.036200380325317, "epoch": 2.763432798520518, "grad_norm": 1.109375, "learning_rate": 0.00042429833223579436, "loss": 5.6563, "mean_token_accuracy": 0.18281290382146836, "num_tokens": 54074788.0, "step": 27645 }, { "entropy": 6.052637672424316, "epoch": 2.7639326235817463, "grad_norm": 1.171875, "learning_rate": 0.00042427163014218473, "loss": 5.5736, "mean_token_accuracy": 0.18284720778465272, "num_tokens": 54084468.0, "step": 27650 }, { "entropy": 6.055946731567383, "epoch": 2.764432448642975, "grad_norm": 1.1484375, "learning_rate": 0.00042424492429293933, "loss": 5.6037, "mean_token_accuracy": 0.18308687061071396, "num_tokens": 54094223.0, "step": 27655 }, { "entropy": 6.03621187210083, "epoch": 2.7649322737042037, "grad_norm": 1.125, "learning_rate": 0.00042421821468873003, "loss": 5.5282, "mean_token_accuracy": 0.18118002414703369, "num_tokens": 54102721.0, "step": 27660 }, { "entropy": 6.017914199829102, "epoch": 2.765432098765432, "grad_norm": 1.1796875, "learning_rate": 0.00042419150133022883, "loss": 5.6381, "mean_token_accuracy": 0.17906796038150788, "num_tokens": 54111986.0, "step": 27665 }, { "entropy": 5.9548944473266605, "epoch": 2.7659319238266606, "grad_norm": 1.234375, "learning_rate": 0.0004241647842181078, "loss": 5.536, "mean_token_accuracy": 0.1823952630162239, "num_tokens": 54121074.0, "step": 27670 }, { "entropy": 6.0230934619903564, "epoch": 2.7664317488878893, "grad_norm": 1.0546875, "learning_rate": 0.00042413806335303935, "loss": 5.5942, "mean_token_accuracy": 0.17811220288276672, "num_tokens": 54131518.0, "step": 27675 }, { "entropy": 6.059011602401734, "epoch": 2.766931573949118, "grad_norm": 1.0625, "learning_rate": 0.00042411133873569544, "loss": 5.6469, "mean_token_accuracy": 0.18088393211364745, "num_tokens": 54141228.0, "step": 27680 }, { "entropy": 5.91871657371521, "epoch": 2.7674313990103463, "grad_norm": 1.0859375, "learning_rate": 0.0004240846103667487, "loss": 5.5189, "mean_token_accuracy": 0.18601272851228715, "num_tokens": 54150365.0, "step": 27685 }, { "entropy": 6.034135913848877, "epoch": 2.767931224071575, "grad_norm": 1.140625, "learning_rate": 0.00042405787824687153, "loss": 5.6129, "mean_token_accuracy": 0.1797341838479042, "num_tokens": 54159941.0, "step": 27690 }, { "entropy": 6.029040670394897, "epoch": 2.7684310491328032, "grad_norm": 1.1015625, "learning_rate": 0.0004240311423767364, "loss": 5.5955, "mean_token_accuracy": 0.18315049558877944, "num_tokens": 54169613.0, "step": 27695 }, { "entropy": 5.9963521480560305, "epoch": 2.768930874194032, "grad_norm": 1.09375, "learning_rate": 0.0004240044027570162, "loss": 5.5993, "mean_token_accuracy": 0.18479035496711732, "num_tokens": 54179927.0, "step": 27700 }, { "entropy": 5.975746154785156, "epoch": 2.7694306992552606, "grad_norm": 1.140625, "learning_rate": 0.0004239776593883835, "loss": 5.5291, "mean_token_accuracy": 0.186295685172081, "num_tokens": 54189572.0, "step": 27705 }, { "entropy": 6.066424465179443, "epoch": 2.7699305243164893, "grad_norm": 1.1328125, "learning_rate": 0.00042395091227151124, "loss": 5.6409, "mean_token_accuracy": 0.18009108304977417, "num_tokens": 54200561.0, "step": 27710 }, { "entropy": 6.119863224029541, "epoch": 2.770430349377718, "grad_norm": 1.0703125, "learning_rate": 0.00042392416140707233, "loss": 5.6918, "mean_token_accuracy": 0.18286965787410736, "num_tokens": 54210519.0, "step": 27715 }, { "entropy": 5.947615242004394, "epoch": 2.7709301744389463, "grad_norm": 1.140625, "learning_rate": 0.0004238974067957399, "loss": 5.4418, "mean_token_accuracy": 0.19199668020009994, "num_tokens": 54219142.0, "step": 27720 }, { "entropy": 6.0093316555023195, "epoch": 2.771429999500175, "grad_norm": 1.0859375, "learning_rate": 0.000423870648438187, "loss": 5.5709, "mean_token_accuracy": 0.17600685954093934, "num_tokens": 54228728.0, "step": 27725 }, { "entropy": 6.07203688621521, "epoch": 2.7719298245614032, "grad_norm": 1.1953125, "learning_rate": 0.0004238438863350869, "loss": 5.5768, "mean_token_accuracy": 0.18053983747959138, "num_tokens": 54237767.0, "step": 27730 }, { "entropy": 6.012223482131958, "epoch": 2.772429649622632, "grad_norm": 1.171875, "learning_rate": 0.0004238171204871129, "loss": 5.5272, "mean_token_accuracy": 0.1877514824271202, "num_tokens": 54247453.0, "step": 27735 }, { "entropy": 6.033645963668823, "epoch": 2.7729294746838606, "grad_norm": 1.328125, "learning_rate": 0.00042379035089493844, "loss": 5.6369, "mean_token_accuracy": 0.18506467193365098, "num_tokens": 54256398.0, "step": 27740 }, { "entropy": 5.978144407272339, "epoch": 2.7734292997450893, "grad_norm": 1.1171875, "learning_rate": 0.0004237635775592371, "loss": 5.6365, "mean_token_accuracy": 0.17690690457820893, "num_tokens": 54265981.0, "step": 27745 }, { "entropy": 5.932096338272094, "epoch": 2.773929124806318, "grad_norm": 1.0859375, "learning_rate": 0.0004237368004806823, "loss": 5.5348, "mean_token_accuracy": 0.19090358316898345, "num_tokens": 54277285.0, "step": 27750 }, { "entropy": 6.051091146469116, "epoch": 2.7744289498675463, "grad_norm": 1.125, "learning_rate": 0.000423710019659948, "loss": 5.4994, "mean_token_accuracy": 0.19150387793779372, "num_tokens": 54286211.0, "step": 27755 }, { "entropy": 6.003693723678589, "epoch": 2.774928774928775, "grad_norm": 1.203125, "learning_rate": 0.00042368323509770785, "loss": 5.5925, "mean_token_accuracy": 0.1879944086074829, "num_tokens": 54296101.0, "step": 27760 }, { "entropy": 6.010381650924683, "epoch": 2.7754285999900032, "grad_norm": 1.265625, "learning_rate": 0.0004236564467946357, "loss": 5.5873, "mean_token_accuracy": 0.1858461707830429, "num_tokens": 54306027.0, "step": 27765 }, { "entropy": 6.0117754459381105, "epoch": 2.775928425051232, "grad_norm": 1.078125, "learning_rate": 0.0004236296547514056, "loss": 5.5303, "mean_token_accuracy": 0.18937959969043733, "num_tokens": 54315551.0, "step": 27770 }, { "entropy": 6.090894794464111, "epoch": 2.7764282501124606, "grad_norm": 1.15625, "learning_rate": 0.0004236028589686917, "loss": 5.6456, "mean_token_accuracy": 0.1778438925743103, "num_tokens": 54325312.0, "step": 27775 }, { "entropy": 6.026579523086548, "epoch": 2.7769280751736893, "grad_norm": 1.1796875, "learning_rate": 0.00042357605944716816, "loss": 5.6204, "mean_token_accuracy": 0.1783723771572113, "num_tokens": 54335854.0, "step": 27780 }, { "entropy": 6.053278303146362, "epoch": 2.777427900234918, "grad_norm": 1.1640625, "learning_rate": 0.00042354925618750904, "loss": 5.5095, "mean_token_accuracy": 0.1843124583363533, "num_tokens": 54345887.0, "step": 27785 }, { "entropy": 6.081729984283447, "epoch": 2.7779277252961463, "grad_norm": 1.2109375, "learning_rate": 0.00042352244919038895, "loss": 5.6185, "mean_token_accuracy": 0.1848454251885414, "num_tokens": 54355367.0, "step": 27790 }, { "entropy": 6.009240674972534, "epoch": 2.778427550357375, "grad_norm": 1.0703125, "learning_rate": 0.00042349563845648226, "loss": 5.5852, "mean_token_accuracy": 0.18463554084300995, "num_tokens": 54365689.0, "step": 27795 }, { "entropy": 6.043126487731934, "epoch": 2.7789273754186032, "grad_norm": 1.125, "learning_rate": 0.0004234688239864634, "loss": 5.6342, "mean_token_accuracy": 0.17924828082323074, "num_tokens": 54375317.0, "step": 27800 }, { "entropy": 6.013046455383301, "epoch": 2.779427200479832, "grad_norm": 1.1640625, "learning_rate": 0.0004234420057810073, "loss": 5.56, "mean_token_accuracy": 0.17965205609798432, "num_tokens": 54384926.0, "step": 27805 }, { "entropy": 6.059171056747436, "epoch": 2.7799270255410606, "grad_norm": 1.1328125, "learning_rate": 0.00042341518384078847, "loss": 5.6549, "mean_token_accuracy": 0.17446608543395997, "num_tokens": 54394691.0, "step": 27810 }, { "entropy": 6.072454309463501, "epoch": 2.7804268506022893, "grad_norm": 1.1484375, "learning_rate": 0.0004233883581664818, "loss": 5.6807, "mean_token_accuracy": 0.17811790555715562, "num_tokens": 54405264.0, "step": 27815 }, { "entropy": 6.07448296546936, "epoch": 2.780926675663518, "grad_norm": 1.1796875, "learning_rate": 0.0004233615287587622, "loss": 5.6033, "mean_token_accuracy": 0.18048861175775527, "num_tokens": 54415477.0, "step": 27820 }, { "entropy": 6.060410690307617, "epoch": 2.7814265007247463, "grad_norm": 1.1328125, "learning_rate": 0.00042333469561830475, "loss": 5.7084, "mean_token_accuracy": 0.17407267093658446, "num_tokens": 54425715.0, "step": 27825 }, { "entropy": 6.1172572612762455, "epoch": 2.781926325785975, "grad_norm": 1.1328125, "learning_rate": 0.0004233078587457845, "loss": 5.63, "mean_token_accuracy": 0.17979361414909362, "num_tokens": 54435097.0, "step": 27830 }, { "entropy": 6.0340522766113285, "epoch": 2.7824261508472032, "grad_norm": 1.1015625, "learning_rate": 0.0004232810181418767, "loss": 5.6498, "mean_token_accuracy": 0.17559524327516557, "num_tokens": 54445511.0, "step": 27835 }, { "entropy": 6.010582971572876, "epoch": 2.782925975908432, "grad_norm": 1.0546875, "learning_rate": 0.0004232541738072566, "loss": 5.58, "mean_token_accuracy": 0.18093815296888352, "num_tokens": 54456463.0, "step": 27840 }, { "entropy": 5.917420387268066, "epoch": 2.7834258009696606, "grad_norm": 1.1328125, "learning_rate": 0.00042322732574259976, "loss": 5.4435, "mean_token_accuracy": 0.19813568741083146, "num_tokens": 54466262.0, "step": 27845 }, { "entropy": 6.0742157936096195, "epoch": 2.7839256260308893, "grad_norm": 1.109375, "learning_rate": 0.00042320047394858143, "loss": 5.6077, "mean_token_accuracy": 0.177427276968956, "num_tokens": 54476270.0, "step": 27850 }, { "entropy": 5.992970705032349, "epoch": 2.784425451092118, "grad_norm": 1.1015625, "learning_rate": 0.0004231736184258773, "loss": 5.6071, "mean_token_accuracy": 0.17857687324285507, "num_tokens": 54486803.0, "step": 27855 }, { "entropy": 6.1002429008483885, "epoch": 2.7849252761533463, "grad_norm": 1.078125, "learning_rate": 0.0004231467591751631, "loss": 5.6094, "mean_token_accuracy": 0.17805061042308806, "num_tokens": 54495525.0, "step": 27860 }, { "entropy": 5.924673986434937, "epoch": 2.785425101214575, "grad_norm": 1.140625, "learning_rate": 0.0004231198961971145, "loss": 5.4844, "mean_token_accuracy": 0.19135912358760834, "num_tokens": 54506335.0, "step": 27865 }, { "entropy": 5.977017116546631, "epoch": 2.7859249262758032, "grad_norm": 1.109375, "learning_rate": 0.0004230930294924075, "loss": 5.583, "mean_token_accuracy": 0.18913626223802565, "num_tokens": 54516505.0, "step": 27870 }, { "entropy": 6.100473546981812, "epoch": 2.786424751337032, "grad_norm": 1.21875, "learning_rate": 0.00042306615906171794, "loss": 5.6367, "mean_token_accuracy": 0.1759947955608368, "num_tokens": 54525407.0, "step": 27875 }, { "entropy": 5.997759103775024, "epoch": 2.7869245763982606, "grad_norm": 1.1171875, "learning_rate": 0.000423039284905722, "loss": 5.5671, "mean_token_accuracy": 0.1867338851094246, "num_tokens": 54535750.0, "step": 27880 }, { "entropy": 6.044288778305054, "epoch": 2.7874244014594893, "grad_norm": 1.2109375, "learning_rate": 0.00042301240702509576, "loss": 5.5649, "mean_token_accuracy": 0.185624460875988, "num_tokens": 54544284.0, "step": 27885 }, { "entropy": 5.965339517593383, "epoch": 2.7879242265207176, "grad_norm": 1.09375, "learning_rate": 0.0004229855254205154, "loss": 5.4598, "mean_token_accuracy": 0.1978113517165184, "num_tokens": 54553168.0, "step": 27890 }, { "entropy": 6.020461320877075, "epoch": 2.7884240515819463, "grad_norm": 1.1328125, "learning_rate": 0.00042295864009265723, "loss": 5.5655, "mean_token_accuracy": 0.18420883864164353, "num_tokens": 54563553.0, "step": 27895 }, { "entropy": 5.969381046295166, "epoch": 2.788923876643175, "grad_norm": 1.1875, "learning_rate": 0.00042293175104219776, "loss": 5.5411, "mean_token_accuracy": 0.1885160356760025, "num_tokens": 54573195.0, "step": 27900 }, { "entropy": 5.896646308898926, "epoch": 2.7894237017044032, "grad_norm": 1.1328125, "learning_rate": 0.00042290485826981355, "loss": 5.4691, "mean_token_accuracy": 0.19725273698568344, "num_tokens": 54583417.0, "step": 27905 }, { "entropy": 6.0664534091949465, "epoch": 2.789923526765632, "grad_norm": 1.1640625, "learning_rate": 0.00042287796177618115, "loss": 5.6368, "mean_token_accuracy": 0.18244190514087677, "num_tokens": 54592961.0, "step": 27910 }, { "entropy": 6.01856164932251, "epoch": 2.7904233518268606, "grad_norm": 1.09375, "learning_rate": 0.00042285106156197727, "loss": 5.5637, "mean_token_accuracy": 0.18064869046211243, "num_tokens": 54602161.0, "step": 27915 }, { "entropy": 6.060322093963623, "epoch": 2.7909231768880893, "grad_norm": 1.1171875, "learning_rate": 0.0004228241576278787, "loss": 5.6717, "mean_token_accuracy": 0.1794242262840271, "num_tokens": 54612816.0, "step": 27920 }, { "entropy": 6.004883050918579, "epoch": 2.7914230019493176, "grad_norm": 1.0390625, "learning_rate": 0.00042279724997456246, "loss": 5.5515, "mean_token_accuracy": 0.186871500313282, "num_tokens": 54622808.0, "step": 27925 }, { "entropy": 6.021888542175293, "epoch": 2.7919228270105463, "grad_norm": 1.453125, "learning_rate": 0.00042277033860270544, "loss": 5.5676, "mean_token_accuracy": 0.18442469984292983, "num_tokens": 54633316.0, "step": 27930 }, { "entropy": 5.9878771781921385, "epoch": 2.792422652071775, "grad_norm": 1.09375, "learning_rate": 0.00042274342351298467, "loss": 5.5295, "mean_token_accuracy": 0.18753096908330918, "num_tokens": 54642655.0, "step": 27935 }, { "entropy": 5.975928878784179, "epoch": 2.7929224771330032, "grad_norm": 1.171875, "learning_rate": 0.0004227165047060773, "loss": 5.5595, "mean_token_accuracy": 0.18920902162790298, "num_tokens": 54652390.0, "step": 27940 }, { "entropy": 6.019753503799438, "epoch": 2.793422302194232, "grad_norm": 1.1328125, "learning_rate": 0.0004226895821826608, "loss": 5.6208, "mean_token_accuracy": 0.17861968725919725, "num_tokens": 54661525.0, "step": 27945 }, { "entropy": 6.074170160293579, "epoch": 2.7939221272554606, "grad_norm": 1.171875, "learning_rate": 0.0004226626559434124, "loss": 5.5612, "mean_token_accuracy": 0.18532527834177018, "num_tokens": 54670416.0, "step": 27950 }, { "entropy": 5.960095357894898, "epoch": 2.7944219523166893, "grad_norm": 1.015625, "learning_rate": 0.00042263572598900956, "loss": 5.5664, "mean_token_accuracy": 0.18352464884519576, "num_tokens": 54680025.0, "step": 27955 }, { "entropy": 5.966314220428467, "epoch": 2.7949217773779176, "grad_norm": 1.1171875, "learning_rate": 0.00042260879232012985, "loss": 5.6103, "mean_token_accuracy": 0.17926261574029922, "num_tokens": 54689591.0, "step": 27960 }, { "entropy": 6.012644672393799, "epoch": 2.7954216024391463, "grad_norm": 1.078125, "learning_rate": 0.00042258185493745086, "loss": 5.5809, "mean_token_accuracy": 0.18528272956609726, "num_tokens": 54699521.0, "step": 27965 }, { "entropy": 5.987171840667725, "epoch": 2.795921427500375, "grad_norm": 1.0546875, "learning_rate": 0.0004225549138416504, "loss": 5.4841, "mean_token_accuracy": 0.19158498495817183, "num_tokens": 54710159.0, "step": 27970 }, { "entropy": 6.0290771484375, "epoch": 2.7964212525616032, "grad_norm": 1.1875, "learning_rate": 0.0004225279690334063, "loss": 5.5351, "mean_token_accuracy": 0.18951656371355058, "num_tokens": 54719657.0, "step": 27975 }, { "entropy": 6.07677583694458, "epoch": 2.796921077622832, "grad_norm": 1.203125, "learning_rate": 0.00042250102051339647, "loss": 5.6837, "mean_token_accuracy": 0.187198406457901, "num_tokens": 54730681.0, "step": 27980 }, { "entropy": 6.075413656234741, "epoch": 2.7974209026840606, "grad_norm": 1.0859375, "learning_rate": 0.00042247406828229897, "loss": 5.6449, "mean_token_accuracy": 0.17425135374069214, "num_tokens": 54740606.0, "step": 27985 }, { "entropy": 5.951979112625122, "epoch": 2.7979207277452893, "grad_norm": 1.21875, "learning_rate": 0.0004224471123407917, "loss": 5.3813, "mean_token_accuracy": 0.20599449574947357, "num_tokens": 54750233.0, "step": 27990 }, { "entropy": 6.058263349533081, "epoch": 2.7984205528065176, "grad_norm": 1.21875, "learning_rate": 0.0004224201526895531, "loss": 5.7411, "mean_token_accuracy": 0.16788301467895508, "num_tokens": 54760287.0, "step": 27995 }, { "entropy": 6.061223459243775, "epoch": 2.7989203778677463, "grad_norm": 1.09375, "learning_rate": 0.00042239318932926144, "loss": 5.5657, "mean_token_accuracy": 0.18387955725193023, "num_tokens": 54770287.0, "step": 28000 }, { "entropy": 6.0317626953125, "epoch": 2.799420202928975, "grad_norm": 1.1875, "learning_rate": 0.000422366222260595, "loss": 5.6096, "mean_token_accuracy": 0.1811448737978935, "num_tokens": 54779780.0, "step": 28005 }, { "entropy": 5.98747410774231, "epoch": 2.7999200279902032, "grad_norm": 1.140625, "learning_rate": 0.00042233925148423235, "loss": 5.4959, "mean_token_accuracy": 0.19672053456306457, "num_tokens": 54789628.0, "step": 28010 }, { "entropy": 5.941774511337281, "epoch": 2.800419853051432, "grad_norm": 1.109375, "learning_rate": 0.0004223122770008521, "loss": 5.5074, "mean_token_accuracy": 0.19365909844636917, "num_tokens": 54799228.0, "step": 28015 }, { "entropy": 6.006224584579468, "epoch": 2.8009196781126606, "grad_norm": 1.0703125, "learning_rate": 0.00042228529881113285, "loss": 5.54, "mean_token_accuracy": 0.1858419731259346, "num_tokens": 54809666.0, "step": 28020 }, { "entropy": 6.056027555465699, "epoch": 2.8014195031738893, "grad_norm": 1.140625, "learning_rate": 0.00042225831691575336, "loss": 5.5386, "mean_token_accuracy": 0.18815133422613145, "num_tokens": 54818948.0, "step": 28025 }, { "entropy": 6.0163429260253904, "epoch": 2.8019193282351176, "grad_norm": 1.2578125, "learning_rate": 0.0004222313313153925, "loss": 5.6243, "mean_token_accuracy": 0.183944371342659, "num_tokens": 54830091.0, "step": 28030 }, { "entropy": 5.996781539916992, "epoch": 2.8024191532963463, "grad_norm": 1.1484375, "learning_rate": 0.00042220434201072917, "loss": 5.5603, "mean_token_accuracy": 0.19026835411787033, "num_tokens": 54839385.0, "step": 28035 }, { "entropy": 6.04871244430542, "epoch": 2.802918978357575, "grad_norm": 1.1484375, "learning_rate": 0.0004221773490024426, "loss": 5.6102, "mean_token_accuracy": 0.18257113099098204, "num_tokens": 54850034.0, "step": 28040 }, { "entropy": 6.077244091033935, "epoch": 2.8034188034188032, "grad_norm": 1.125, "learning_rate": 0.0004221503522912117, "loss": 5.6953, "mean_token_accuracy": 0.17234439104795457, "num_tokens": 54859522.0, "step": 28045 }, { "entropy": 5.986248016357422, "epoch": 2.803918628480032, "grad_norm": 1.125, "learning_rate": 0.00042212335187771587, "loss": 5.5408, "mean_token_accuracy": 0.1872730329632759, "num_tokens": 54868938.0, "step": 28050 }, { "entropy": 5.959762477874756, "epoch": 2.8044184535412606, "grad_norm": 1.25, "learning_rate": 0.00042209634776263434, "loss": 5.4558, "mean_token_accuracy": 0.1910246342420578, "num_tokens": 54878125.0, "step": 28055 }, { "entropy": 6.07199444770813, "epoch": 2.8049182786024893, "grad_norm": 1.15625, "learning_rate": 0.0004220693399466466, "loss": 5.6287, "mean_token_accuracy": 0.17363103181123735, "num_tokens": 54886615.0, "step": 28060 }, { "entropy": 6.062364006042481, "epoch": 2.8054181036637176, "grad_norm": 1.1328125, "learning_rate": 0.00042204232843043207, "loss": 5.6721, "mean_token_accuracy": 0.1788029670715332, "num_tokens": 54897316.0, "step": 28065 }, { "entropy": 6.035115051269531, "epoch": 2.8059179287249463, "grad_norm": 1.21875, "learning_rate": 0.00042201531321467027, "loss": 5.5351, "mean_token_accuracy": 0.18434848338365556, "num_tokens": 54906672.0, "step": 28070 }, { "entropy": 6.0549492835998535, "epoch": 2.806417753786175, "grad_norm": 1.09375, "learning_rate": 0.00042198829430004114, "loss": 5.6087, "mean_token_accuracy": 0.1766224667429924, "num_tokens": 54916465.0, "step": 28075 }, { "entropy": 5.97222638130188, "epoch": 2.8069175788474032, "grad_norm": 1.1796875, "learning_rate": 0.00042196127168722436, "loss": 5.5311, "mean_token_accuracy": 0.18027301877737045, "num_tokens": 54926655.0, "step": 28080 }, { "entropy": 6.010865688323975, "epoch": 2.807417403908632, "grad_norm": 1.1015625, "learning_rate": 0.0004219342453768998, "loss": 5.5463, "mean_token_accuracy": 0.18402189761400223, "num_tokens": 54936151.0, "step": 28085 }, { "entropy": 6.003515291213989, "epoch": 2.8079172289698606, "grad_norm": 1.3203125, "learning_rate": 0.0004219072153697474, "loss": 5.5558, "mean_token_accuracy": 0.1858503669500351, "num_tokens": 54946303.0, "step": 28090 }, { "entropy": 5.979242753982544, "epoch": 2.8084170540310893, "grad_norm": 1.140625, "learning_rate": 0.0004218801816664473, "loss": 5.5846, "mean_token_accuracy": 0.18515522480010987, "num_tokens": 54956078.0, "step": 28095 }, { "entropy": 5.971443462371826, "epoch": 2.8089168790923176, "grad_norm": 1.171875, "learning_rate": 0.0004218531442676796, "loss": 5.6002, "mean_token_accuracy": 0.18520632535219192, "num_tokens": 54965851.0, "step": 28100 }, { "entropy": 6.105798816680908, "epoch": 2.8094167041535463, "grad_norm": 1.125, "learning_rate": 0.0004218261031741246, "loss": 5.6624, "mean_token_accuracy": 0.17750029116868973, "num_tokens": 54975381.0, "step": 28105 }, { "entropy": 6.034116888046265, "epoch": 2.809916529214775, "grad_norm": 1.15625, "learning_rate": 0.00042179905838646254, "loss": 5.5587, "mean_token_accuracy": 0.18979046046733855, "num_tokens": 54986192.0, "step": 28110 }, { "entropy": 6.0397562980651855, "epoch": 2.8104163542760032, "grad_norm": 1.2265625, "learning_rate": 0.000421772009905374, "loss": 5.598, "mean_token_accuracy": 0.1855422616004944, "num_tokens": 54996093.0, "step": 28115 }, { "entropy": 6.048256349563599, "epoch": 2.810916179337232, "grad_norm": 1.1875, "learning_rate": 0.0004217449577315395, "loss": 5.5656, "mean_token_accuracy": 0.18815297782421112, "num_tokens": 55005284.0, "step": 28120 }, { "entropy": 6.061623001098633, "epoch": 2.8114160043984606, "grad_norm": 1.15625, "learning_rate": 0.0004217179018656396, "loss": 5.6247, "mean_token_accuracy": 0.1812191888689995, "num_tokens": 55014693.0, "step": 28125 }, { "entropy": 5.9792969703674315, "epoch": 2.8119158294596893, "grad_norm": 1.3046875, "learning_rate": 0.000421690842308355, "loss": 5.519, "mean_token_accuracy": 0.18898403495550156, "num_tokens": 55024354.0, "step": 28130 }, { "entropy": 5.8983197689056395, "epoch": 2.8124156545209176, "grad_norm": 1.125, "learning_rate": 0.0004216637790603667, "loss": 5.4284, "mean_token_accuracy": 0.19604831486940383, "num_tokens": 55033590.0, "step": 28135 }, { "entropy": 5.964046382904053, "epoch": 2.8129154795821463, "grad_norm": 1.1640625, "learning_rate": 0.0004216367121223553, "loss": 5.5024, "mean_token_accuracy": 0.1881198689341545, "num_tokens": 55042639.0, "step": 28140 }, { "entropy": 6.024931240081787, "epoch": 2.813415304643375, "grad_norm": 1.0625, "learning_rate": 0.000421609641495002, "loss": 5.583, "mean_token_accuracy": 0.18375220745801926, "num_tokens": 55053825.0, "step": 28145 }, { "entropy": 5.957256555557251, "epoch": 2.8139151297046032, "grad_norm": 1.1015625, "learning_rate": 0.00042158256717898785, "loss": 5.524, "mean_token_accuracy": 0.18842488676309585, "num_tokens": 55063142.0, "step": 28150 }, { "entropy": 5.989586973190308, "epoch": 2.814414954765832, "grad_norm": 1.0625, "learning_rate": 0.000421555489174994, "loss": 5.5605, "mean_token_accuracy": 0.19287996292114257, "num_tokens": 55073122.0, "step": 28155 }, { "entropy": 6.075976800918579, "epoch": 2.8149147798270606, "grad_norm": 1.0390625, "learning_rate": 0.00042152840748370184, "loss": 5.6447, "mean_token_accuracy": 0.17689227908849717, "num_tokens": 55083364.0, "step": 28160 }, { "entropy": 6.063017416000366, "epoch": 2.8154146048882893, "grad_norm": 1.140625, "learning_rate": 0.0004215013221057926, "loss": 5.6111, "mean_token_accuracy": 0.18050871938467025, "num_tokens": 55092540.0, "step": 28165 }, { "entropy": 6.05877275466919, "epoch": 2.8159144299495176, "grad_norm": 1.2578125, "learning_rate": 0.0004214742330419478, "loss": 5.6743, "mean_token_accuracy": 0.17534727305173875, "num_tokens": 55103085.0, "step": 28170 }, { "entropy": 6.074978494644165, "epoch": 2.8164142550107463, "grad_norm": 1.1328125, "learning_rate": 0.00042144714029284893, "loss": 5.6637, "mean_token_accuracy": 0.17925862073898316, "num_tokens": 55112962.0, "step": 28175 }, { "entropy": 5.930502939224243, "epoch": 2.816914080071975, "grad_norm": 1.125, "learning_rate": 0.00042142004385917783, "loss": 5.4537, "mean_token_accuracy": 0.19370130002498626, "num_tokens": 55122795.0, "step": 28180 }, { "entropy": 5.854910469055175, "epoch": 2.8174139051332032, "grad_norm": 1.9453125, "learning_rate": 0.000421392943741616, "loss": 5.487, "mean_token_accuracy": 0.19756831973791122, "num_tokens": 55133082.0, "step": 28185 }, { "entropy": 6.062303161621093, "epoch": 2.817913730194432, "grad_norm": 1.15625, "learning_rate": 0.0004213658399408454, "loss": 5.585, "mean_token_accuracy": 0.1882267937064171, "num_tokens": 55142940.0, "step": 28190 }, { "entropy": 6.22761754989624, "epoch": 2.8184135552556606, "grad_norm": 1.171875, "learning_rate": 0.0004213387324575479, "loss": 5.7493, "mean_token_accuracy": 0.1718323349952698, "num_tokens": 55152233.0, "step": 28195 }, { "entropy": 6.134977054595947, "epoch": 2.8189133803168893, "grad_norm": 1.0390625, "learning_rate": 0.0004213116212924056, "loss": 5.6426, "mean_token_accuracy": 0.18438841700553893, "num_tokens": 55163159.0, "step": 28200 }, { "entropy": 5.97796483039856, "epoch": 2.8194132053781176, "grad_norm": 1.28125, "learning_rate": 0.00042128450644610046, "loss": 5.5265, "mean_token_accuracy": 0.19111181199550628, "num_tokens": 55173902.0, "step": 28205 }, { "entropy": 5.967923879623413, "epoch": 2.8199130304393463, "grad_norm": 1.0078125, "learning_rate": 0.00042125738791931486, "loss": 5.5626, "mean_token_accuracy": 0.18753696233034134, "num_tokens": 55184698.0, "step": 28210 }, { "entropy": 6.017305088043213, "epoch": 2.8204128555005745, "grad_norm": 1.015625, "learning_rate": 0.000421230265712731, "loss": 5.6324, "mean_token_accuracy": 0.1737662822008133, "num_tokens": 55194463.0, "step": 28215 }, { "entropy": 5.984061813354492, "epoch": 2.820912680561803, "grad_norm": 1.03125, "learning_rate": 0.0004212031398270313, "loss": 5.6184, "mean_token_accuracy": 0.1885695993900299, "num_tokens": 55205844.0, "step": 28220 }, { "entropy": 6.098659706115723, "epoch": 2.821412505623032, "grad_norm": 1.140625, "learning_rate": 0.00042117601026289827, "loss": 5.6604, "mean_token_accuracy": 0.18004756569862365, "num_tokens": 55215760.0, "step": 28225 }, { "entropy": 6.064934635162354, "epoch": 2.8219123306842606, "grad_norm": 1.015625, "learning_rate": 0.00042114887702101434, "loss": 5.575, "mean_token_accuracy": 0.18543704599142075, "num_tokens": 55226182.0, "step": 28230 }, { "entropy": 6.005737972259522, "epoch": 2.8224121557454893, "grad_norm": 1.1015625, "learning_rate": 0.00042112174010206226, "loss": 5.6107, "mean_token_accuracy": 0.17432308495044707, "num_tokens": 55236200.0, "step": 28235 }, { "entropy": 6.065285015106201, "epoch": 2.8229119808067176, "grad_norm": 1.2265625, "learning_rate": 0.00042109459950672487, "loss": 5.613, "mean_token_accuracy": 0.18020668923854827, "num_tokens": 55245455.0, "step": 28240 }, { "entropy": 6.078323268890381, "epoch": 2.8234118058679463, "grad_norm": 1.171875, "learning_rate": 0.00042106745523568494, "loss": 5.6072, "mean_token_accuracy": 0.18309133499860764, "num_tokens": 55254555.0, "step": 28245 }, { "entropy": 6.097473812103272, "epoch": 2.8239116309291745, "grad_norm": 1.1171875, "learning_rate": 0.00042104030728962535, "loss": 5.6494, "mean_token_accuracy": 0.18647712022066115, "num_tokens": 55262897.0, "step": 28250 }, { "entropy": 5.981614971160889, "epoch": 2.824411455990403, "grad_norm": 1.1171875, "learning_rate": 0.00042101315566922927, "loss": 5.6061, "mean_token_accuracy": 0.18715454190969466, "num_tokens": 55272715.0, "step": 28255 }, { "entropy": 6.0277454376220705, "epoch": 2.824911281051632, "grad_norm": 1.1171875, "learning_rate": 0.00042098600037517985, "loss": 5.5471, "mean_token_accuracy": 0.18292974829673767, "num_tokens": 55282281.0, "step": 28260 }, { "entropy": 6.017353534698486, "epoch": 2.8254111061128606, "grad_norm": 1.078125, "learning_rate": 0.0004209588414081601, "loss": 5.5539, "mean_token_accuracy": 0.18410571813583373, "num_tokens": 55292708.0, "step": 28265 }, { "entropy": 5.901357269287109, "epoch": 2.8259109311740893, "grad_norm": 1.375, "learning_rate": 0.00042093167876885345, "loss": 5.5575, "mean_token_accuracy": 0.18468155860900878, "num_tokens": 55302750.0, "step": 28270 }, { "entropy": 6.003642320632935, "epoch": 2.8264107562353176, "grad_norm": 1.0859375, "learning_rate": 0.0004209045124579434, "loss": 5.5719, "mean_token_accuracy": 0.186366006731987, "num_tokens": 55312136.0, "step": 28275 }, { "entropy": 6.0965108394622805, "epoch": 2.8269105812965463, "grad_norm": 1.140625, "learning_rate": 0.00042087734247611333, "loss": 5.5837, "mean_token_accuracy": 0.18688869178295137, "num_tokens": 55321770.0, "step": 28280 }, { "entropy": 5.927344942092896, "epoch": 2.8274104063577745, "grad_norm": 1.125, "learning_rate": 0.0004208501688240468, "loss": 5.5369, "mean_token_accuracy": 0.18252337872982025, "num_tokens": 55331758.0, "step": 28285 }, { "entropy": 6.007903909683227, "epoch": 2.827910231419003, "grad_norm": 1.0859375, "learning_rate": 0.00042082299150242764, "loss": 5.5915, "mean_token_accuracy": 0.18374226242303848, "num_tokens": 55341879.0, "step": 28290 }, { "entropy": 5.934148645401001, "epoch": 2.828410056480232, "grad_norm": 1.078125, "learning_rate": 0.0004207958105119395, "loss": 5.418, "mean_token_accuracy": 0.19988171458244325, "num_tokens": 55351313.0, "step": 28295 }, { "entropy": 6.029666900634766, "epoch": 2.8289098815414606, "grad_norm": 1.1953125, "learning_rate": 0.00042076862585326626, "loss": 5.5307, "mean_token_accuracy": 0.1941484272480011, "num_tokens": 55360838.0, "step": 28300 }, { "entropy": 6.044083547592163, "epoch": 2.8294097066026893, "grad_norm": 1.109375, "learning_rate": 0.00042074143752709195, "loss": 5.6479, "mean_token_accuracy": 0.18610639721155167, "num_tokens": 55370698.0, "step": 28305 }, { "entropy": 6.05050630569458, "epoch": 2.8299095316639176, "grad_norm": 1.171875, "learning_rate": 0.0004207142455341005, "loss": 5.6176, "mean_token_accuracy": 0.17785695493221282, "num_tokens": 55379897.0, "step": 28310 }, { "entropy": 6.005379486083984, "epoch": 2.8304093567251463, "grad_norm": 1.0859375, "learning_rate": 0.00042068704987497627, "loss": 5.5609, "mean_token_accuracy": 0.18364194184541702, "num_tokens": 55390950.0, "step": 28315 }, { "entropy": 5.9986021518707275, "epoch": 2.8309091817863745, "grad_norm": 1.1484375, "learning_rate": 0.00042065985055040326, "loss": 5.4933, "mean_token_accuracy": 0.1941374883055687, "num_tokens": 55400400.0, "step": 28320 }, { "entropy": 5.994783020019531, "epoch": 2.831409006847603, "grad_norm": 1.1484375, "learning_rate": 0.0004206326475610658, "loss": 5.5272, "mean_token_accuracy": 0.18441078662872315, "num_tokens": 55409583.0, "step": 28325 }, { "entropy": 5.917728424072266, "epoch": 2.831908831908832, "grad_norm": 1.0703125, "learning_rate": 0.00042060544090764856, "loss": 5.4622, "mean_token_accuracy": 0.19623906463384627, "num_tokens": 55418142.0, "step": 28330 }, { "entropy": 6.043118953704834, "epoch": 2.8324086569700606, "grad_norm": 1.125, "learning_rate": 0.0004205782305908358, "loss": 5.6434, "mean_token_accuracy": 0.17756642550230026, "num_tokens": 55428258.0, "step": 28335 }, { "entropy": 6.117092132568359, "epoch": 2.8329084820312893, "grad_norm": 1.1640625, "learning_rate": 0.0004205510166113122, "loss": 5.6235, "mean_token_accuracy": 0.18092392086982728, "num_tokens": 55438414.0, "step": 28340 }, { "entropy": 6.043471002578736, "epoch": 2.8334083070925176, "grad_norm": 1.234375, "learning_rate": 0.00042052379896976254, "loss": 5.594, "mean_token_accuracy": 0.1773039758205414, "num_tokens": 55448820.0, "step": 28345 }, { "entropy": 5.963432550430298, "epoch": 2.8339081321537463, "grad_norm": 1.1171875, "learning_rate": 0.0004204965776668716, "loss": 5.5128, "mean_token_accuracy": 0.19347514659166337, "num_tokens": 55459031.0, "step": 28350 }, { "entropy": 5.983527183532715, "epoch": 2.8344079572149745, "grad_norm": 1.1796875, "learning_rate": 0.0004204693527033241, "loss": 5.5488, "mean_token_accuracy": 0.19018649011850358, "num_tokens": 55468647.0, "step": 28355 }, { "entropy": 6.060431718826294, "epoch": 2.834907782276203, "grad_norm": 1.0078125, "learning_rate": 0.00042044212407980517, "loss": 5.5562, "mean_token_accuracy": 0.18662760853767396, "num_tokens": 55478727.0, "step": 28360 }, { "entropy": 6.022957515716553, "epoch": 2.835407607337432, "grad_norm": 1.203125, "learning_rate": 0.00042041489179699983, "loss": 5.5884, "mean_token_accuracy": 0.18447542041540146, "num_tokens": 55489115.0, "step": 28365 }, { "entropy": 6.04775767326355, "epoch": 2.8359074323986606, "grad_norm": 1.1796875, "learning_rate": 0.0004203876558555932, "loss": 5.5698, "mean_token_accuracy": 0.18437811583280564, "num_tokens": 55498730.0, "step": 28370 }, { "entropy": 5.970817041397095, "epoch": 2.8364072574598893, "grad_norm": 1.171875, "learning_rate": 0.00042036041625627055, "loss": 5.5831, "mean_token_accuracy": 0.18742517679929732, "num_tokens": 55507659.0, "step": 28375 }, { "entropy": 5.888478946685791, "epoch": 2.8369070825211176, "grad_norm": 1.203125, "learning_rate": 0.00042033317299971726, "loss": 5.4861, "mean_token_accuracy": 0.19035938531160354, "num_tokens": 55517077.0, "step": 28380 }, { "entropy": 5.976660633087159, "epoch": 2.8374069075823463, "grad_norm": 1.1640625, "learning_rate": 0.0004203059260866187, "loss": 5.4697, "mean_token_accuracy": 0.19187301844358445, "num_tokens": 55526349.0, "step": 28385 }, { "entropy": 5.955709791183471, "epoch": 2.8379067326435745, "grad_norm": 1.125, "learning_rate": 0.0004202786755176604, "loss": 5.5466, "mean_token_accuracy": 0.18648500740528107, "num_tokens": 55537417.0, "step": 28390 }, { "entropy": 6.0244239330291744, "epoch": 2.838406557704803, "grad_norm": 1.1953125, "learning_rate": 0.0004202514212935281, "loss": 5.5634, "mean_token_accuracy": 0.18386086523532869, "num_tokens": 55546123.0, "step": 28395 }, { "entropy": 5.975232982635498, "epoch": 2.838906382766032, "grad_norm": 1.140625, "learning_rate": 0.0004202241634149074, "loss": 5.4476, "mean_token_accuracy": 0.19614486694335936, "num_tokens": 55555740.0, "step": 28400 }, { "entropy": 6.001878118515014, "epoch": 2.8394062078272606, "grad_norm": 1.078125, "learning_rate": 0.00042019690188248407, "loss": 5.5151, "mean_token_accuracy": 0.18818969428539276, "num_tokens": 55564435.0, "step": 28405 }, { "entropy": 6.068162679672241, "epoch": 2.839906032888489, "grad_norm": 1.1640625, "learning_rate": 0.0004201696366969441, "loss": 5.5992, "mean_token_accuracy": 0.18622733801603317, "num_tokens": 55573893.0, "step": 28410 }, { "entropy": 6.045925760269165, "epoch": 2.8404058579497176, "grad_norm": 1.1796875, "learning_rate": 0.0004201423678589734, "loss": 5.5358, "mean_token_accuracy": 0.1953730583190918, "num_tokens": 55583330.0, "step": 28415 }, { "entropy": 5.911889171600341, "epoch": 2.8409056830109463, "grad_norm": 1.171875, "learning_rate": 0.000420115095369258, "loss": 5.5168, "mean_token_accuracy": 0.190187007188797, "num_tokens": 55593000.0, "step": 28420 }, { "entropy": 5.916242599487305, "epoch": 2.8414055080721745, "grad_norm": 1.140625, "learning_rate": 0.0004200878192284843, "loss": 5.5847, "mean_token_accuracy": 0.18218401521444322, "num_tokens": 55602835.0, "step": 28425 }, { "entropy": 5.9824730396270756, "epoch": 2.841905333133403, "grad_norm": 1.09375, "learning_rate": 0.0004200605394373383, "loss": 5.4861, "mean_token_accuracy": 0.1885057955980301, "num_tokens": 55612978.0, "step": 28430 }, { "entropy": 6.042035675048828, "epoch": 2.842405158194632, "grad_norm": 1.1796875, "learning_rate": 0.0004200332559965065, "loss": 5.6389, "mean_token_accuracy": 0.1758533537387848, "num_tokens": 55622386.0, "step": 28435 }, { "entropy": 6.041363668441773, "epoch": 2.8429049832558606, "grad_norm": 1.0859375, "learning_rate": 0.0004200059689066752, "loss": 5.6154, "mean_token_accuracy": 0.17586992979049682, "num_tokens": 55631340.0, "step": 28440 }, { "entropy": 6.1090989112854, "epoch": 2.843404808317089, "grad_norm": 1.203125, "learning_rate": 0.00041997867816853115, "loss": 5.6171, "mean_token_accuracy": 0.1789204716682434, "num_tokens": 55641000.0, "step": 28445 }, { "entropy": 5.9946599960327145, "epoch": 2.8439046333783176, "grad_norm": 1.2890625, "learning_rate": 0.00041995138378276084, "loss": 5.5292, "mean_token_accuracy": 0.18895063698291778, "num_tokens": 55650398.0, "step": 28450 }, { "entropy": 6.026237535476684, "epoch": 2.8444044584395463, "grad_norm": 1.140625, "learning_rate": 0.00041992408575005095, "loss": 5.5624, "mean_token_accuracy": 0.1907188832759857, "num_tokens": 55659454.0, "step": 28455 }, { "entropy": 6.001522779464722, "epoch": 2.8449042835007745, "grad_norm": 1.1328125, "learning_rate": 0.0004198967840710884, "loss": 5.6948, "mean_token_accuracy": 0.17695683985948563, "num_tokens": 55669166.0, "step": 28460 }, { "entropy": 6.072432565689087, "epoch": 2.845404108562003, "grad_norm": 1.0859375, "learning_rate": 0.00041986947874656, "loss": 5.6239, "mean_token_accuracy": 0.18336772322654724, "num_tokens": 55678753.0, "step": 28465 }, { "entropy": 6.039589166641235, "epoch": 2.845903933623232, "grad_norm": 1.2578125, "learning_rate": 0.0004198421697771529, "loss": 5.5429, "mean_token_accuracy": 0.18833259493112564, "num_tokens": 55688291.0, "step": 28470 }, { "entropy": 6.023969125747681, "epoch": 2.8464037586844606, "grad_norm": 1.1484375, "learning_rate": 0.000419814857163554, "loss": 5.6112, "mean_token_accuracy": 0.18299014568328859, "num_tokens": 55697526.0, "step": 28475 }, { "entropy": 6.016570520401001, "epoch": 2.846903583745689, "grad_norm": 1.4140625, "learning_rate": 0.0004197875409064506, "loss": 5.5681, "mean_token_accuracy": 0.17914360165596008, "num_tokens": 55707560.0, "step": 28480 }, { "entropy": 6.055263090133667, "epoch": 2.8474034088069176, "grad_norm": 1.265625, "learning_rate": 0.0004197602210065299, "loss": 5.6349, "mean_token_accuracy": 0.181109781563282, "num_tokens": 55716428.0, "step": 28485 }, { "entropy": 6.030656194686889, "epoch": 2.8479032338681463, "grad_norm": 1.0625, "learning_rate": 0.0004197328974644793, "loss": 5.6225, "mean_token_accuracy": 0.18076672852039338, "num_tokens": 55726123.0, "step": 28490 }, { "entropy": 5.976618051528931, "epoch": 2.8484030589293745, "grad_norm": 1.1796875, "learning_rate": 0.0004197055702809862, "loss": 5.4891, "mean_token_accuracy": 0.1837794303894043, "num_tokens": 55735668.0, "step": 28495 }, { "entropy": 5.973111009597778, "epoch": 2.848902883990603, "grad_norm": 1.15625, "learning_rate": 0.0004196782394567382, "loss": 5.5065, "mean_token_accuracy": 0.19095882624387742, "num_tokens": 55745651.0, "step": 28500 }, { "entropy": 6.006844520568848, "epoch": 2.849402709051832, "grad_norm": 1.1484375, "learning_rate": 0.000419650904992423, "loss": 5.5546, "mean_token_accuracy": 0.1836229145526886, "num_tokens": 55755024.0, "step": 28505 }, { "entropy": 6.084911775588989, "epoch": 2.8499025341130606, "grad_norm": 1.0390625, "learning_rate": 0.00041962356688872817, "loss": 5.6162, "mean_token_accuracy": 0.17497019618749618, "num_tokens": 55765524.0, "step": 28510 }, { "entropy": 6.11924262046814, "epoch": 2.850402359174289, "grad_norm": 1.09375, "learning_rate": 0.0004195962251463417, "loss": 5.6134, "mean_token_accuracy": 0.1736270934343338, "num_tokens": 55775630.0, "step": 28515 }, { "entropy": 6.027758550643921, "epoch": 2.8509021842355176, "grad_norm": 2.046875, "learning_rate": 0.0004195688797659513, "loss": 5.6469, "mean_token_accuracy": 0.18698108643293382, "num_tokens": 55786375.0, "step": 28520 }, { "entropy": 5.998108291625977, "epoch": 2.8514020092967463, "grad_norm": 1.0859375, "learning_rate": 0.00041954153074824516, "loss": 5.5844, "mean_token_accuracy": 0.18436254560947418, "num_tokens": 55795080.0, "step": 28525 }, { "entropy": 6.066546678543091, "epoch": 2.8519018343579745, "grad_norm": 1.1015625, "learning_rate": 0.0004195141780939113, "loss": 5.5701, "mean_token_accuracy": 0.18169667720794677, "num_tokens": 55804737.0, "step": 28530 }, { "entropy": 5.950295162200928, "epoch": 2.852401659419203, "grad_norm": 1.0546875, "learning_rate": 0.00041948682180363784, "loss": 5.4318, "mean_token_accuracy": 0.19042568951845168, "num_tokens": 55814166.0, "step": 28535 }, { "entropy": 5.978711891174316, "epoch": 2.852901484480432, "grad_norm": 1.0625, "learning_rate": 0.0004194594618781132, "loss": 5.5127, "mean_token_accuracy": 0.18893036395311355, "num_tokens": 55823758.0, "step": 28540 }, { "entropy": 6.101582050323486, "epoch": 2.8534013095416606, "grad_norm": 1.109375, "learning_rate": 0.00041943209831802567, "loss": 5.5763, "mean_token_accuracy": 0.18851593136787415, "num_tokens": 55833798.0, "step": 28545 }, { "entropy": 6.027812957763672, "epoch": 2.853901134602889, "grad_norm": 1.1171875, "learning_rate": 0.00041940473112406365, "loss": 5.5817, "mean_token_accuracy": 0.1830003321170807, "num_tokens": 55843456.0, "step": 28550 }, { "entropy": 5.926304912567138, "epoch": 2.8544009596641176, "grad_norm": 1.1171875, "learning_rate": 0.00041937736029691575, "loss": 5.5067, "mean_token_accuracy": 0.1916378140449524, "num_tokens": 55853401.0, "step": 28555 }, { "entropy": 5.99504132270813, "epoch": 2.8549007847253463, "grad_norm": 1.1171875, "learning_rate": 0.0004193499858372706, "loss": 5.5369, "mean_token_accuracy": 0.19255839437246322, "num_tokens": 55863549.0, "step": 28560 }, { "entropy": 6.107935285568237, "epoch": 2.8554006097865745, "grad_norm": 1.1171875, "learning_rate": 0.000419322607745817, "loss": 5.6071, "mean_token_accuracy": 0.1828018918633461, "num_tokens": 55873718.0, "step": 28565 }, { "entropy": 5.98563404083252, "epoch": 2.855900434847803, "grad_norm": 1.1015625, "learning_rate": 0.00041929522602324377, "loss": 5.5174, "mean_token_accuracy": 0.1877002462744713, "num_tokens": 55883909.0, "step": 28570 }, { "entropy": 6.006081295013428, "epoch": 2.856400259909032, "grad_norm": 1.1171875, "learning_rate": 0.0004192678406702398, "loss": 5.6013, "mean_token_accuracy": 0.17771776914596557, "num_tokens": 55893090.0, "step": 28575 }, { "entropy": 5.955460071563721, "epoch": 2.8569000849702606, "grad_norm": 1.1875, "learning_rate": 0.000419240451687494, "loss": 5.4947, "mean_token_accuracy": 0.19303350597620011, "num_tokens": 55903820.0, "step": 28580 }, { "entropy": 6.085053873062134, "epoch": 2.857399910031489, "grad_norm": 1.140625, "learning_rate": 0.00041921305907569555, "loss": 5.6099, "mean_token_accuracy": 0.18184424191713333, "num_tokens": 55913540.0, "step": 28585 }, { "entropy": 6.022350835800171, "epoch": 2.8578997350927176, "grad_norm": 1.046875, "learning_rate": 0.0004191856628355337, "loss": 5.5892, "mean_token_accuracy": 0.17954727858304978, "num_tokens": 55923766.0, "step": 28590 }, { "entropy": 6.017279815673828, "epoch": 2.8583995601539463, "grad_norm": 1.078125, "learning_rate": 0.0004191582629676977, "loss": 5.614, "mean_token_accuracy": 0.1853022575378418, "num_tokens": 55932855.0, "step": 28595 }, { "entropy": 6.010232830047608, "epoch": 2.8588993852151745, "grad_norm": 1.1171875, "learning_rate": 0.00041913085947287675, "loss": 5.5639, "mean_token_accuracy": 0.18282729834318162, "num_tokens": 55942163.0, "step": 28600 }, { "entropy": 6.007336902618408, "epoch": 2.859399210276403, "grad_norm": 1.0390625, "learning_rate": 0.0004191034523517606, "loss": 5.5286, "mean_token_accuracy": 0.1871779292821884, "num_tokens": 55952521.0, "step": 28605 }, { "entropy": 5.974952554702758, "epoch": 2.859899035337632, "grad_norm": 1.078125, "learning_rate": 0.00041907604160503864, "loss": 5.5577, "mean_token_accuracy": 0.18954758942127228, "num_tokens": 55962071.0, "step": 28610 }, { "entropy": 5.908056020736694, "epoch": 2.8603988603988606, "grad_norm": 1.2109375, "learning_rate": 0.00041904862723340046, "loss": 5.4822, "mean_token_accuracy": 0.193089035153389, "num_tokens": 55971387.0, "step": 28615 }, { "entropy": 6.0225306987762455, "epoch": 2.860898685460089, "grad_norm": 1.09375, "learning_rate": 0.00041902120923753593, "loss": 5.565, "mean_token_accuracy": 0.1818866103887558, "num_tokens": 55980435.0, "step": 28620 }, { "entropy": 5.96475133895874, "epoch": 2.8613985105213176, "grad_norm": 1.140625, "learning_rate": 0.0004189937876181349, "loss": 5.4745, "mean_token_accuracy": 0.19197167456150055, "num_tokens": 55989868.0, "step": 28625 }, { "entropy": 5.990807962417603, "epoch": 2.8618983355825462, "grad_norm": 1.140625, "learning_rate": 0.0004189663623758872, "loss": 5.4926, "mean_token_accuracy": 0.19352337419986726, "num_tokens": 55999423.0, "step": 28630 }, { "entropy": 5.92466368675232, "epoch": 2.8623981606437745, "grad_norm": 1.1328125, "learning_rate": 0.00041893893351148284, "loss": 5.5171, "mean_token_accuracy": 0.18917523473501205, "num_tokens": 56009429.0, "step": 28635 }, { "entropy": 6.055291271209716, "epoch": 2.862897985705003, "grad_norm": 1.0859375, "learning_rate": 0.000418911501025612, "loss": 5.5778, "mean_token_accuracy": 0.18064332902431487, "num_tokens": 56019039.0, "step": 28640 }, { "entropy": 6.037579727172852, "epoch": 2.863397810766232, "grad_norm": 1.1171875, "learning_rate": 0.0004188840649189648, "loss": 5.5973, "mean_token_accuracy": 0.1792689248919487, "num_tokens": 56029465.0, "step": 28645 }, { "entropy": 6.0482306480407715, "epoch": 2.8638976358274606, "grad_norm": 1.15625, "learning_rate": 0.00041885662519223154, "loss": 5.6535, "mean_token_accuracy": 0.17834306359291077, "num_tokens": 56038882.0, "step": 28650 }, { "entropy": 6.092318058013916, "epoch": 2.864397460888689, "grad_norm": 1.0703125, "learning_rate": 0.0004188291818461026, "loss": 5.654, "mean_token_accuracy": 0.175331312417984, "num_tokens": 56048512.0, "step": 28655 }, { "entropy": 5.983028554916382, "epoch": 2.8648972859499175, "grad_norm": 1.1171875, "learning_rate": 0.00041880173488126847, "loss": 5.5163, "mean_token_accuracy": 0.19009689539670943, "num_tokens": 56057553.0, "step": 28660 }, { "entropy": 5.962471580505371, "epoch": 2.8653971110111462, "grad_norm": 1.171875, "learning_rate": 0.00041877428429841967, "loss": 5.552, "mean_token_accuracy": 0.18870423436164857, "num_tokens": 56066819.0, "step": 28665 }, { "entropy": 6.01138277053833, "epoch": 2.8658969360723745, "grad_norm": 1.078125, "learning_rate": 0.0004187468300982469, "loss": 5.6007, "mean_token_accuracy": 0.1881350666284561, "num_tokens": 56077012.0, "step": 28670 }, { "entropy": 6.0268206119537355, "epoch": 2.866396761133603, "grad_norm": 1.1875, "learning_rate": 0.0004187193722814409, "loss": 5.6517, "mean_token_accuracy": 0.17870944142341613, "num_tokens": 56086405.0, "step": 28675 }, { "entropy": 6.046143960952759, "epoch": 2.866896586194832, "grad_norm": 1.046875, "learning_rate": 0.0004186919108486925, "loss": 5.513, "mean_token_accuracy": 0.1838408052921295, "num_tokens": 56097135.0, "step": 28680 }, { "entropy": 5.9668967723846436, "epoch": 2.8673964112560606, "grad_norm": 1.28125, "learning_rate": 0.0004186644458006925, "loss": 5.4686, "mean_token_accuracy": 0.1953880861401558, "num_tokens": 56106401.0, "step": 28685 }, { "entropy": 5.913062381744385, "epoch": 2.867896236317289, "grad_norm": 1.1171875, "learning_rate": 0.000418636977138132, "loss": 5.4168, "mean_token_accuracy": 0.19903374463319778, "num_tokens": 56115763.0, "step": 28690 }, { "entropy": 5.9367152690887455, "epoch": 2.8683960613785175, "grad_norm": 1.078125, "learning_rate": 0.00041860950486170227, "loss": 5.5385, "mean_token_accuracy": 0.19022829085588455, "num_tokens": 56124873.0, "step": 28695 }, { "entropy": 5.958936548233032, "epoch": 2.8688958864397462, "grad_norm": 1.1640625, "learning_rate": 0.0004185820289720942, "loss": 5.4355, "mean_token_accuracy": 0.19386904090642929, "num_tokens": 56133801.0, "step": 28700 }, { "entropy": 6.018774747848511, "epoch": 2.8693957115009745, "grad_norm": 1.0859375, "learning_rate": 0.00041855454946999925, "loss": 5.6173, "mean_token_accuracy": 0.18138625025749205, "num_tokens": 56143827.0, "step": 28705 }, { "entropy": 6.002480792999267, "epoch": 2.869895536562203, "grad_norm": 1.09375, "learning_rate": 0.00041852706635610884, "loss": 5.6244, "mean_token_accuracy": 0.17511110454797746, "num_tokens": 56152780.0, "step": 28710 }, { "entropy": 5.945188903808594, "epoch": 2.870395361623432, "grad_norm": 1.03125, "learning_rate": 0.00041849957963111434, "loss": 5.4897, "mean_token_accuracy": 0.19288689345121385, "num_tokens": 56162168.0, "step": 28715 }, { "entropy": 5.97844820022583, "epoch": 2.8708951866846606, "grad_norm": 1.1171875, "learning_rate": 0.0004184720892957073, "loss": 5.5621, "mean_token_accuracy": 0.18794063478708267, "num_tokens": 56172069.0, "step": 28720 }, { "entropy": 6.008296632766724, "epoch": 2.871395011745889, "grad_norm": 1.140625, "learning_rate": 0.0004184445953505795, "loss": 5.5829, "mean_token_accuracy": 0.18538438975811006, "num_tokens": 56181904.0, "step": 28725 }, { "entropy": 5.967702722549438, "epoch": 2.8718948368071175, "grad_norm": 1.1640625, "learning_rate": 0.0004184170977964225, "loss": 5.5266, "mean_token_accuracy": 0.19165645241737367, "num_tokens": 56191203.0, "step": 28730 }, { "entropy": 5.990869665145874, "epoch": 2.8723946618683462, "grad_norm": 1.546875, "learning_rate": 0.00041838959663392827, "loss": 5.5798, "mean_token_accuracy": 0.18961986601352693, "num_tokens": 56201714.0, "step": 28735 }, { "entropy": 6.006943416595459, "epoch": 2.8728944869295745, "grad_norm": 1.0078125, "learning_rate": 0.0004183620918637887, "loss": 5.5752, "mean_token_accuracy": 0.184392948448658, "num_tokens": 56213287.0, "step": 28740 }, { "entropy": 5.974403524398804, "epoch": 2.873394311990803, "grad_norm": 1.4609375, "learning_rate": 0.0004183345834866957, "loss": 5.4793, "mean_token_accuracy": 0.19338324069976806, "num_tokens": 56222593.0, "step": 28745 }, { "entropy": 6.006207132339478, "epoch": 2.873894137052032, "grad_norm": 1.046875, "learning_rate": 0.00041830707150334164, "loss": 5.5181, "mean_token_accuracy": 0.1796454593539238, "num_tokens": 56232292.0, "step": 28750 }, { "entropy": 5.945680332183838, "epoch": 2.8743939621132606, "grad_norm": 1.1484375, "learning_rate": 0.0004182795559144184, "loss": 5.5086, "mean_token_accuracy": 0.1913171887397766, "num_tokens": 56242389.0, "step": 28755 }, { "entropy": 5.956672477722168, "epoch": 2.874893787174489, "grad_norm": 1.1171875, "learning_rate": 0.0004182520367206184, "loss": 5.6358, "mean_token_accuracy": 0.18494925498962403, "num_tokens": 56252383.0, "step": 28760 }, { "entropy": 5.984306335449219, "epoch": 2.8753936122357175, "grad_norm": 1.140625, "learning_rate": 0.00041822451392263413, "loss": 5.5834, "mean_token_accuracy": 0.18412245362997054, "num_tokens": 56261676.0, "step": 28765 }, { "entropy": 6.018061828613281, "epoch": 2.875893437296946, "grad_norm": 1.0390625, "learning_rate": 0.0004181969875211578, "loss": 5.5109, "mean_token_accuracy": 0.19147640317678452, "num_tokens": 56271938.0, "step": 28770 }, { "entropy": 5.994848918914795, "epoch": 2.8763932623581745, "grad_norm": 1.0703125, "learning_rate": 0.00041816945751688215, "loss": 5.5681, "mean_token_accuracy": 0.18030113875865936, "num_tokens": 56281370.0, "step": 28775 }, { "entropy": 5.95074429512024, "epoch": 2.876893087419403, "grad_norm": 1.140625, "learning_rate": 0.00041814192391049983, "loss": 5.5509, "mean_token_accuracy": 0.18601560294628144, "num_tokens": 56292162.0, "step": 28780 }, { "entropy": 6.035732173919678, "epoch": 2.877392912480632, "grad_norm": 1.109375, "learning_rate": 0.0004181143867027036, "loss": 5.5072, "mean_token_accuracy": 0.19902151674032212, "num_tokens": 56301129.0, "step": 28785 }, { "entropy": 6.046225690841675, "epoch": 2.8778927375418606, "grad_norm": 1.0234375, "learning_rate": 0.00041808684589418615, "loss": 5.5901, "mean_token_accuracy": 0.18414104729890823, "num_tokens": 56310781.0, "step": 28790 }, { "entropy": 5.97324013710022, "epoch": 2.878392562603089, "grad_norm": 1.078125, "learning_rate": 0.0004180593014856404, "loss": 5.5414, "mean_token_accuracy": 0.19050752222537995, "num_tokens": 56320401.0, "step": 28795 }, { "entropy": 5.97267632484436, "epoch": 2.8788923876643175, "grad_norm": 1.03125, "learning_rate": 0.0004180317534777596, "loss": 5.5721, "mean_token_accuracy": 0.18503506481647491, "num_tokens": 56330606.0, "step": 28800 }, { "entropy": 6.028334474563598, "epoch": 2.879392212725546, "grad_norm": 1.0234375, "learning_rate": 0.00041800420187123656, "loss": 5.5393, "mean_token_accuracy": 0.19180229008197786, "num_tokens": 56340832.0, "step": 28805 }, { "entropy": 5.921131372451782, "epoch": 2.8798920377867745, "grad_norm": 1.125, "learning_rate": 0.0004179766466667646, "loss": 5.5032, "mean_token_accuracy": 0.19368707984685898, "num_tokens": 56350228.0, "step": 28810 }, { "entropy": 5.993889045715332, "epoch": 2.880391862848003, "grad_norm": 1.109375, "learning_rate": 0.0004179490878650371, "loss": 5.5311, "mean_token_accuracy": 0.18093425184488296, "num_tokens": 56360087.0, "step": 28815 }, { "entropy": 5.988643503189087, "epoch": 2.880891687909232, "grad_norm": 1.0625, "learning_rate": 0.0004179215254667473, "loss": 5.5023, "mean_token_accuracy": 0.19206811636686325, "num_tokens": 56369214.0, "step": 28820 }, { "entropy": 5.972115421295166, "epoch": 2.8813915129704606, "grad_norm": 1.140625, "learning_rate": 0.0004178939594725887, "loss": 5.6088, "mean_token_accuracy": 0.18332124054431914, "num_tokens": 56378331.0, "step": 28825 }, { "entropy": 6.025776481628418, "epoch": 2.881891338031689, "grad_norm": 1.0859375, "learning_rate": 0.0004178663898832548, "loss": 5.6135, "mean_token_accuracy": 0.17637778222560882, "num_tokens": 56387856.0, "step": 28830 }, { "entropy": 6.133811664581299, "epoch": 2.8823911630929175, "grad_norm": 1.0078125, "learning_rate": 0.0004178388166994392, "loss": 5.6657, "mean_token_accuracy": 0.17454176992177964, "num_tokens": 56398885.0, "step": 28835 }, { "entropy": 5.942352771759033, "epoch": 2.882890988154146, "grad_norm": 1.1015625, "learning_rate": 0.0004178112399218359, "loss": 5.4876, "mean_token_accuracy": 0.1880880892276764, "num_tokens": 56408169.0, "step": 28840 }, { "entropy": 5.896474170684814, "epoch": 2.8833908132153745, "grad_norm": 1.09375, "learning_rate": 0.00041778365955113844, "loss": 5.4704, "mean_token_accuracy": 0.1864808514714241, "num_tokens": 56417221.0, "step": 28845 }, { "entropy": 5.966894054412842, "epoch": 2.883890638276603, "grad_norm": 1.0859375, "learning_rate": 0.0004177560755880409, "loss": 5.5099, "mean_token_accuracy": 0.19265046268701552, "num_tokens": 56426860.0, "step": 28850 }, { "entropy": 6.0585455894470215, "epoch": 2.884390463337832, "grad_norm": 1.1328125, "learning_rate": 0.0004177284880332373, "loss": 5.6458, "mean_token_accuracy": 0.17821545600891114, "num_tokens": 56436264.0, "step": 28855 }, { "entropy": 6.026314067840576, "epoch": 2.8848902883990606, "grad_norm": 1.171875, "learning_rate": 0.00041770089688742155, "loss": 5.5463, "mean_token_accuracy": 0.18867271542549133, "num_tokens": 56445835.0, "step": 28860 }, { "entropy": 6.0123148441314695, "epoch": 2.885390113460289, "grad_norm": 1.1953125, "learning_rate": 0.000417673302151288, "loss": 5.6071, "mean_token_accuracy": 0.1851532354950905, "num_tokens": 56455090.0, "step": 28865 }, { "entropy": 5.999368810653687, "epoch": 2.8858899385215175, "grad_norm": 1.125, "learning_rate": 0.0004176457038255309, "loss": 5.5786, "mean_token_accuracy": 0.18709810078144073, "num_tokens": 56464782.0, "step": 28870 }, { "entropy": 6.041669273376465, "epoch": 2.886389763582746, "grad_norm": 1.140625, "learning_rate": 0.0004176181019108446, "loss": 5.5634, "mean_token_accuracy": 0.18640597760677338, "num_tokens": 56475375.0, "step": 28875 }, { "entropy": 5.9645270824432375, "epoch": 2.8868895886439745, "grad_norm": 1.1484375, "learning_rate": 0.0004175904964079236, "loss": 5.4467, "mean_token_accuracy": 0.18990441113710405, "num_tokens": 56485654.0, "step": 28880 }, { "entropy": 6.01309642791748, "epoch": 2.887389413705203, "grad_norm": 1.15625, "learning_rate": 0.0004175628873174623, "loss": 5.5952, "mean_token_accuracy": 0.18496671169996262, "num_tokens": 56495554.0, "step": 28885 }, { "entropy": 5.993366146087647, "epoch": 2.887889238766432, "grad_norm": 1.1640625, "learning_rate": 0.00041753527464015547, "loss": 5.4767, "mean_token_accuracy": 0.19217303693294524, "num_tokens": 56504760.0, "step": 28890 }, { "entropy": 5.936500692367554, "epoch": 2.8883890638276606, "grad_norm": 1.1640625, "learning_rate": 0.0004175076583766978, "loss": 5.5194, "mean_token_accuracy": 0.1932409942150116, "num_tokens": 56514312.0, "step": 28895 }, { "entropy": 5.979573535919189, "epoch": 2.888888888888889, "grad_norm": 0.9921875, "learning_rate": 0.0004174800385277842, "loss": 5.5772, "mean_token_accuracy": 0.18206910341978072, "num_tokens": 56524741.0, "step": 28900 }, { "entropy": 5.955585575103759, "epoch": 2.8893887139501175, "grad_norm": 1.09375, "learning_rate": 0.0004174524150941094, "loss": 5.5436, "mean_token_accuracy": 0.18373286724090576, "num_tokens": 56534339.0, "step": 28905 }, { "entropy": 6.079880714416504, "epoch": 2.889888539011346, "grad_norm": 1.0703125, "learning_rate": 0.0004174247880763685, "loss": 5.6537, "mean_token_accuracy": 0.1766335979104042, "num_tokens": 56544722.0, "step": 28910 }, { "entropy": 6.003150606155396, "epoch": 2.8903883640725745, "grad_norm": 1.15625, "learning_rate": 0.0004173971574752566, "loss": 5.4832, "mean_token_accuracy": 0.19007839560508727, "num_tokens": 56553917.0, "step": 28915 }, { "entropy": 6.052454423904419, "epoch": 2.890888189133803, "grad_norm": 1.1953125, "learning_rate": 0.0004173695232914688, "loss": 5.5988, "mean_token_accuracy": 0.1853411614894867, "num_tokens": 56563876.0, "step": 28920 }, { "entropy": 5.9820314884185795, "epoch": 2.891388014195032, "grad_norm": 1.109375, "learning_rate": 0.0004173418855257005, "loss": 5.5113, "mean_token_accuracy": 0.19004387110471727, "num_tokens": 56574017.0, "step": 28925 }, { "entropy": 5.986132621765137, "epoch": 2.8918878392562606, "grad_norm": 1.0703125, "learning_rate": 0.000417314244178647, "loss": 5.5295, "mean_token_accuracy": 0.17762120813131332, "num_tokens": 56583927.0, "step": 28930 }, { "entropy": 5.996918630599976, "epoch": 2.892387664317489, "grad_norm": 1.109375, "learning_rate": 0.0004172865992510037, "loss": 5.5465, "mean_token_accuracy": 0.1874375656247139, "num_tokens": 56593421.0, "step": 28935 }, { "entropy": 6.005105686187744, "epoch": 2.8928874893787175, "grad_norm": 1.09375, "learning_rate": 0.00041725895074346615, "loss": 5.5197, "mean_token_accuracy": 0.1865562990307808, "num_tokens": 56601820.0, "step": 28940 }, { "entropy": 5.915988302230835, "epoch": 2.893387314439946, "grad_norm": 1.046875, "learning_rate": 0.0004172312986567301, "loss": 5.4927, "mean_token_accuracy": 0.18815140724182128, "num_tokens": 56611688.0, "step": 28945 }, { "entropy": 5.943217849731445, "epoch": 2.8938871395011745, "grad_norm": 1.1015625, "learning_rate": 0.0004172036429914911, "loss": 5.4779, "mean_token_accuracy": 0.19051360934972764, "num_tokens": 56620719.0, "step": 28950 }, { "entropy": 5.984273433685303, "epoch": 2.894386964562403, "grad_norm": 1.75, "learning_rate": 0.00041717598374844505, "loss": 5.6221, "mean_token_accuracy": 0.18108896911144257, "num_tokens": 56631045.0, "step": 28955 }, { "entropy": 6.057505655288696, "epoch": 2.894886789623632, "grad_norm": 1.1640625, "learning_rate": 0.00041714832092828785, "loss": 5.5538, "mean_token_accuracy": 0.1832215428352356, "num_tokens": 56640935.0, "step": 28960 }, { "entropy": 6.102058029174804, "epoch": 2.89538661468486, "grad_norm": 1.1953125, "learning_rate": 0.00041712065453171544, "loss": 5.6339, "mean_token_accuracy": 0.1757847011089325, "num_tokens": 56651023.0, "step": 28965 }, { "entropy": 6.028440141677857, "epoch": 2.895886439746089, "grad_norm": 1.171875, "learning_rate": 0.00041709298455942394, "loss": 5.5846, "mean_token_accuracy": 0.18127516955137252, "num_tokens": 56660591.0, "step": 28970 }, { "entropy": 6.064974594116211, "epoch": 2.8963862648073175, "grad_norm": 1.1796875, "learning_rate": 0.00041706531101210956, "loss": 5.6679, "mean_token_accuracy": 0.17992310374975204, "num_tokens": 56671635.0, "step": 28975 }, { "entropy": 5.97171573638916, "epoch": 2.896886089868546, "grad_norm": 1.1328125, "learning_rate": 0.00041703763389046853, "loss": 5.4763, "mean_token_accuracy": 0.18965007066726686, "num_tokens": 56681309.0, "step": 28980 }, { "entropy": 5.912668132781983, "epoch": 2.8973859149297745, "grad_norm": 1.265625, "learning_rate": 0.00041700995319519707, "loss": 5.5303, "mean_token_accuracy": 0.1942803144454956, "num_tokens": 56692594.0, "step": 28985 }, { "entropy": 6.039387464523315, "epoch": 2.897885739991003, "grad_norm": 1.1015625, "learning_rate": 0.0004169822689269918, "loss": 5.5943, "mean_token_accuracy": 0.18250313103199006, "num_tokens": 56702165.0, "step": 28990 }, { "entropy": 6.054687929153443, "epoch": 2.898385565052232, "grad_norm": 1.2421875, "learning_rate": 0.00041695458108654914, "loss": 5.5568, "mean_token_accuracy": 0.19027812778949738, "num_tokens": 56711398.0, "step": 28995 }, { "entropy": 5.971416044235229, "epoch": 2.89888539011346, "grad_norm": 1.078125, "learning_rate": 0.00041692688967456576, "loss": 5.508, "mean_token_accuracy": 0.18859827965497972, "num_tokens": 56720984.0, "step": 29000 }, { "entropy": 5.956514930725097, "epoch": 2.899385215174689, "grad_norm": 1.171875, "learning_rate": 0.00041689919469173835, "loss": 5.577, "mean_token_accuracy": 0.19008856117725373, "num_tokens": 56732126.0, "step": 29005 }, { "entropy": 5.948633337020874, "epoch": 2.8998850402359175, "grad_norm": 1.171875, "learning_rate": 0.0004168714961387637, "loss": 5.4814, "mean_token_accuracy": 0.1918627843260765, "num_tokens": 56741235.0, "step": 29010 }, { "entropy": 6.03798885345459, "epoch": 2.900384865297146, "grad_norm": 1.140625, "learning_rate": 0.0004168437940163388, "loss": 5.6685, "mean_token_accuracy": 0.1847105860710144, "num_tokens": 56751695.0, "step": 29015 }, { "entropy": 6.089259672164917, "epoch": 2.9008846903583745, "grad_norm": 1.15625, "learning_rate": 0.0004168160883251605, "loss": 5.5709, "mean_token_accuracy": 0.18372823297977448, "num_tokens": 56761067.0, "step": 29020 }, { "entropy": 6.081299734115601, "epoch": 2.901384515419603, "grad_norm": 1.125, "learning_rate": 0.00041678837906592586, "loss": 5.5436, "mean_token_accuracy": 0.18564230650663377, "num_tokens": 56770267.0, "step": 29025 }, { "entropy": 6.0022491931915285, "epoch": 2.901884340480832, "grad_norm": 1.140625, "learning_rate": 0.00041676066623933216, "loss": 5.5525, "mean_token_accuracy": 0.19222951531410218, "num_tokens": 56780263.0, "step": 29030 }, { "entropy": 5.93476824760437, "epoch": 2.90238416554206, "grad_norm": 1.21875, "learning_rate": 0.0004167329498460766, "loss": 5.508, "mean_token_accuracy": 0.189471335709095, "num_tokens": 56789490.0, "step": 29035 }, { "entropy": 6.010347318649292, "epoch": 2.902883990603289, "grad_norm": 1.140625, "learning_rate": 0.00041670522988685637, "loss": 5.5532, "mean_token_accuracy": 0.1902566984295845, "num_tokens": 56799299.0, "step": 29040 }, { "entropy": 6.01339693069458, "epoch": 2.9033838156645175, "grad_norm": 1.0703125, "learning_rate": 0.00041667750636236914, "loss": 5.5044, "mean_token_accuracy": 0.18552822470664979, "num_tokens": 56808518.0, "step": 29045 }, { "entropy": 6.0758884906768795, "epoch": 2.903883640725746, "grad_norm": 1.109375, "learning_rate": 0.0004166497792733122, "loss": 5.669, "mean_token_accuracy": 0.18003336489200591, "num_tokens": 56819458.0, "step": 29050 }, { "entropy": 6.061254405975342, "epoch": 2.9043834657869745, "grad_norm": 1.125, "learning_rate": 0.0004166220486203834, "loss": 5.5938, "mean_token_accuracy": 0.18263496160507203, "num_tokens": 56828219.0, "step": 29055 }, { "entropy": 5.981641054153442, "epoch": 2.904883290848203, "grad_norm": 1.1875, "learning_rate": 0.0004165943144042802, "loss": 5.4952, "mean_token_accuracy": 0.19456336498260499, "num_tokens": 56837998.0, "step": 29060 }, { "entropy": 6.0832360744476315, "epoch": 2.905383115909432, "grad_norm": 1.203125, "learning_rate": 0.00041656657662570047, "loss": 5.6344, "mean_token_accuracy": 0.17916933000087737, "num_tokens": 56848244.0, "step": 29065 }, { "entropy": 6.032700395584106, "epoch": 2.90588294097066, "grad_norm": 1.2421875, "learning_rate": 0.0004165388352853421, "loss": 5.4925, "mean_token_accuracy": 0.18839731961488723, "num_tokens": 56857809.0, "step": 29070 }, { "entropy": 5.911396074295044, "epoch": 2.906382766031889, "grad_norm": 1.15625, "learning_rate": 0.00041651109038390305, "loss": 5.4232, "mean_token_accuracy": 0.1994226321578026, "num_tokens": 56866985.0, "step": 29075 }, { "entropy": 5.970412254333496, "epoch": 2.9068825910931175, "grad_norm": 1.1171875, "learning_rate": 0.00041648334192208146, "loss": 5.567, "mean_token_accuracy": 0.1783318117260933, "num_tokens": 56877402.0, "step": 29080 }, { "entropy": 6.087867498397827, "epoch": 2.907382416154346, "grad_norm": 1.0625, "learning_rate": 0.00041645558990057536, "loss": 5.5322, "mean_token_accuracy": 0.18673183619976044, "num_tokens": 56886322.0, "step": 29085 }, { "entropy": 6.044263410568237, "epoch": 2.9078822412155745, "grad_norm": 1.0625, "learning_rate": 0.00041642783432008294, "loss": 5.6036, "mean_token_accuracy": 0.18337072879076005, "num_tokens": 56896067.0, "step": 29090 }, { "entropy": 6.030143737792969, "epoch": 2.908382066276803, "grad_norm": 1.15625, "learning_rate": 0.00041640007518130274, "loss": 5.6049, "mean_token_accuracy": 0.18122841119766236, "num_tokens": 56904850.0, "step": 29095 }, { "entropy": 6.043479585647583, "epoch": 2.908881891338032, "grad_norm": 1.0625, "learning_rate": 0.000416372312484933, "loss": 5.572, "mean_token_accuracy": 0.18325877338647842, "num_tokens": 56915856.0, "step": 29100 }, { "entropy": 6.012440824508667, "epoch": 2.90938171639926, "grad_norm": 1.234375, "learning_rate": 0.00041634454623167217, "loss": 5.5557, "mean_token_accuracy": 0.1906826227903366, "num_tokens": 56925817.0, "step": 29105 }, { "entropy": 5.965674257278442, "epoch": 2.909881541460489, "grad_norm": 1.15625, "learning_rate": 0.00041631677642221896, "loss": 5.5201, "mean_token_accuracy": 0.19558734744787215, "num_tokens": 56935838.0, "step": 29110 }, { "entropy": 6.0460399150848385, "epoch": 2.9103813665217175, "grad_norm": 1.1328125, "learning_rate": 0.000416289003057272, "loss": 5.5538, "mean_token_accuracy": 0.19448685348033906, "num_tokens": 56945926.0, "step": 29115 }, { "entropy": 5.9277036666870115, "epoch": 2.910881191582946, "grad_norm": 0.921875, "learning_rate": 0.0004162612261375302, "loss": 5.4115, "mean_token_accuracy": 0.1968894362449646, "num_tokens": 56955639.0, "step": 29120 }, { "entropy": 5.979749059677124, "epoch": 2.9113810166441745, "grad_norm": 1.125, "learning_rate": 0.00041623344566369216, "loss": 5.5405, "mean_token_accuracy": 0.18687474429607392, "num_tokens": 56966653.0, "step": 29125 }, { "entropy": 5.961220073699951, "epoch": 2.911880841705403, "grad_norm": 1.109375, "learning_rate": 0.000416205661636457, "loss": 5.4702, "mean_token_accuracy": 0.1969687506556511, "num_tokens": 56975797.0, "step": 29130 }, { "entropy": 5.959200429916382, "epoch": 2.912380666766632, "grad_norm": 1.09375, "learning_rate": 0.0004161778740565238, "loss": 5.4671, "mean_token_accuracy": 0.19511618763208388, "num_tokens": 56984994.0, "step": 29135 }, { "entropy": 5.995854902267456, "epoch": 2.91288049182786, "grad_norm": 1.1171875, "learning_rate": 0.00041615008292459157, "loss": 5.5884, "mean_token_accuracy": 0.188632133603096, "num_tokens": 56995630.0, "step": 29140 }, { "entropy": 6.0458526611328125, "epoch": 2.913380316889089, "grad_norm": 1.09375, "learning_rate": 0.00041612228824135954, "loss": 5.5786, "mean_token_accuracy": 0.18571010529994963, "num_tokens": 57005864.0, "step": 29145 }, { "entropy": 6.046120738983154, "epoch": 2.9138801419503175, "grad_norm": 1.1015625, "learning_rate": 0.00041609449000752706, "loss": 5.5541, "mean_token_accuracy": 0.18958573937416076, "num_tokens": 57015821.0, "step": 29150 }, { "entropy": 6.022066307067871, "epoch": 2.914379967011546, "grad_norm": 1.828125, "learning_rate": 0.0004160666882237936, "loss": 5.5264, "mean_token_accuracy": 0.19660263657569885, "num_tokens": 57024849.0, "step": 29155 }, { "entropy": 5.938467884063721, "epoch": 2.9148797920727745, "grad_norm": 1.2734375, "learning_rate": 0.0004160388828908585, "loss": 5.5295, "mean_token_accuracy": 0.18750450611114503, "num_tokens": 57033754.0, "step": 29160 }, { "entropy": 5.9739786148071286, "epoch": 2.915379617134003, "grad_norm": 1.1640625, "learning_rate": 0.00041601107400942146, "loss": 5.4854, "mean_token_accuracy": 0.1916822835803032, "num_tokens": 57042880.0, "step": 29165 }, { "entropy": 6.028504133224487, "epoch": 2.915879442195232, "grad_norm": 1.1875, "learning_rate": 0.00041598326158018197, "loss": 5.592, "mean_token_accuracy": 0.17805259376764299, "num_tokens": 57052717.0, "step": 29170 }, { "entropy": 6.014332294464111, "epoch": 2.91637926725646, "grad_norm": 1.140625, "learning_rate": 0.00041595544560384004, "loss": 5.5313, "mean_token_accuracy": 0.19062376022338867, "num_tokens": 57062813.0, "step": 29175 }, { "entropy": 6.024864912033081, "epoch": 2.916879092317689, "grad_norm": 1.0390625, "learning_rate": 0.0004159276260810952, "loss": 5.5226, "mean_token_accuracy": 0.1862972319126129, "num_tokens": 57072798.0, "step": 29180 }, { "entropy": 5.96354489326477, "epoch": 2.9173789173789175, "grad_norm": 1.109375, "learning_rate": 0.00041589980301264765, "loss": 5.4768, "mean_token_accuracy": 0.19568116813898087, "num_tokens": 57082114.0, "step": 29185 }, { "entropy": 5.907982635498047, "epoch": 2.917878742440146, "grad_norm": 1.171875, "learning_rate": 0.0004158719763991973, "loss": 5.4967, "mean_token_accuracy": 0.19103347808122634, "num_tokens": 57091603.0, "step": 29190 }, { "entropy": 5.943726873397827, "epoch": 2.9183785675013745, "grad_norm": 1.1796875, "learning_rate": 0.00041584414624144426, "loss": 5.5422, "mean_token_accuracy": 0.1842697888612747, "num_tokens": 57101403.0, "step": 29195 }, { "entropy": 6.005723285675049, "epoch": 2.918878392562603, "grad_norm": 1.2421875, "learning_rate": 0.0004158163125400887, "loss": 5.4918, "mean_token_accuracy": 0.1900193765759468, "num_tokens": 57109732.0, "step": 29200 }, { "entropy": 6.013118267059326, "epoch": 2.919378217623832, "grad_norm": 1.078125, "learning_rate": 0.00041578847529583106, "loss": 5.567, "mean_token_accuracy": 0.18855001032352448, "num_tokens": 57119289.0, "step": 29205 }, { "entropy": 5.939472627639771, "epoch": 2.91987804268506, "grad_norm": 1.171875, "learning_rate": 0.0004157606345093715, "loss": 5.4934, "mean_token_accuracy": 0.19221878796815872, "num_tokens": 57130243.0, "step": 29210 }, { "entropy": 6.071733713150024, "epoch": 2.920377867746289, "grad_norm": 1.1015625, "learning_rate": 0.0004157327901814107, "loss": 5.5949, "mean_token_accuracy": 0.17863181978464127, "num_tokens": 57140885.0, "step": 29215 }, { "entropy": 5.925492000579834, "epoch": 2.9208776928075175, "grad_norm": 1.15625, "learning_rate": 0.00041570494231264906, "loss": 5.4437, "mean_token_accuracy": 0.195447202026844, "num_tokens": 57150479.0, "step": 29220 }, { "entropy": 5.949387836456299, "epoch": 2.9213775178687458, "grad_norm": 1.0078125, "learning_rate": 0.00041567709090378725, "loss": 5.4297, "mean_token_accuracy": 0.1908073365688324, "num_tokens": 57161561.0, "step": 29225 }, { "entropy": 5.968845653533935, "epoch": 2.9218773429299745, "grad_norm": 1.203125, "learning_rate": 0.00041564923595552604, "loss": 5.6127, "mean_token_accuracy": 0.1870241194963455, "num_tokens": 57171734.0, "step": 29230 }, { "entropy": 6.050087404251099, "epoch": 2.922377167991203, "grad_norm": 1.0859375, "learning_rate": 0.00041562137746856625, "loss": 5.6264, "mean_token_accuracy": 0.17728988975286483, "num_tokens": 57182448.0, "step": 29235 }, { "entropy": 5.980618286132812, "epoch": 2.922876993052432, "grad_norm": 1.1875, "learning_rate": 0.00041559351544360893, "loss": 5.5581, "mean_token_accuracy": 0.18161847740411757, "num_tokens": 57192331.0, "step": 29240 }, { "entropy": 5.860567855834961, "epoch": 2.92337681811366, "grad_norm": 1.125, "learning_rate": 0.00041556564988135474, "loss": 5.33, "mean_token_accuracy": 0.20920469015836715, "num_tokens": 57201636.0, "step": 29245 }, { "entropy": 5.981903553009033, "epoch": 2.923876643174889, "grad_norm": 1.1015625, "learning_rate": 0.0004155377807825051, "loss": 5.5513, "mean_token_accuracy": 0.18700242340564727, "num_tokens": 57210186.0, "step": 29250 }, { "entropy": 5.956227779388428, "epoch": 2.9243764682361175, "grad_norm": 1.1328125, "learning_rate": 0.000415509908147761, "loss": 5.4902, "mean_token_accuracy": 0.19028568714857103, "num_tokens": 57219212.0, "step": 29255 }, { "entropy": 5.9900413990020756, "epoch": 2.9248762932973458, "grad_norm": 1.1015625, "learning_rate": 0.00041548203197782377, "loss": 5.5734, "mean_token_accuracy": 0.19159263819456102, "num_tokens": 57229728.0, "step": 29260 }, { "entropy": 5.994774913787841, "epoch": 2.9253761183585745, "grad_norm": 1.09375, "learning_rate": 0.00041545415227339474, "loss": 5.5824, "mean_token_accuracy": 0.18521761596202851, "num_tokens": 57240233.0, "step": 29265 }, { "entropy": 6.023496341705322, "epoch": 2.925875943419803, "grad_norm": 1.109375, "learning_rate": 0.0004154262690351754, "loss": 5.6154, "mean_token_accuracy": 0.18550288826227188, "num_tokens": 57249502.0, "step": 29270 }, { "entropy": 6.022699975967408, "epoch": 2.926375768481032, "grad_norm": 1.1484375, "learning_rate": 0.0004153983822638673, "loss": 5.524, "mean_token_accuracy": 0.1864834487438202, "num_tokens": 57258825.0, "step": 29275 }, { "entropy": 5.945605897903443, "epoch": 2.92687559354226, "grad_norm": 1.1953125, "learning_rate": 0.00041537049196017196, "loss": 5.5906, "mean_token_accuracy": 0.1858075425028801, "num_tokens": 57269657.0, "step": 29280 }, { "entropy": 5.9945969581604, "epoch": 2.927375418603489, "grad_norm": 1.1328125, "learning_rate": 0.00041534259812479125, "loss": 5.4349, "mean_token_accuracy": 0.19943612664937974, "num_tokens": 57280192.0, "step": 29285 }, { "entropy": 5.867608737945557, "epoch": 2.927875243664717, "grad_norm": 1.1328125, "learning_rate": 0.0004153147007584269, "loss": 5.3924, "mean_token_accuracy": 0.19645698815584184, "num_tokens": 57290292.0, "step": 29290 }, { "entropy": 5.9818117141723635, "epoch": 2.9283750687259458, "grad_norm": 1.0859375, "learning_rate": 0.00041528679986178066, "loss": 5.5653, "mean_token_accuracy": 0.1852535277605057, "num_tokens": 57300844.0, "step": 29295 }, { "entropy": 5.9570880889892575, "epoch": 2.9288748937871745, "grad_norm": 1.1875, "learning_rate": 0.00041525889543555475, "loss": 5.509, "mean_token_accuracy": 0.1934513732790947, "num_tokens": 57310162.0, "step": 29300 }, { "entropy": 6.023156261444091, "epoch": 2.929374718848403, "grad_norm": 1.171875, "learning_rate": 0.000415230987480451, "loss": 5.6123, "mean_token_accuracy": 0.18756709694862367, "num_tokens": 57319599.0, "step": 29305 }, { "entropy": 6.040363502502442, "epoch": 2.929874543909632, "grad_norm": 1.1484375, "learning_rate": 0.0004152030759971718, "loss": 5.6561, "mean_token_accuracy": 0.1859562337398529, "num_tokens": 57329901.0, "step": 29310 }, { "entropy": 6.008559703826904, "epoch": 2.93037436897086, "grad_norm": 1.1171875, "learning_rate": 0.0004151751609864193, "loss": 5.5983, "mean_token_accuracy": 0.18865681290626526, "num_tokens": 57339362.0, "step": 29315 }, { "entropy": 6.039473676681519, "epoch": 2.930874194032089, "grad_norm": 1.1640625, "learning_rate": 0.0004151472424488957, "loss": 5.5582, "mean_token_accuracy": 0.184381602704525, "num_tokens": 57349527.0, "step": 29320 }, { "entropy": 6.06801438331604, "epoch": 2.931374019093317, "grad_norm": 1.1015625, "learning_rate": 0.0004151193203853036, "loss": 5.5566, "mean_token_accuracy": 0.18170531317591668, "num_tokens": 57360021.0, "step": 29325 }, { "entropy": 6.067793607711792, "epoch": 2.9318738441545458, "grad_norm": 1.1015625, "learning_rate": 0.00041509139479634544, "loss": 5.6049, "mean_token_accuracy": 0.18299957662820815, "num_tokens": 57369938.0, "step": 29330 }, { "entropy": 6.001828861236572, "epoch": 2.9323736692157745, "grad_norm": 1.03125, "learning_rate": 0.00041506346568272385, "loss": 5.5697, "mean_token_accuracy": 0.19260056614875792, "num_tokens": 57380399.0, "step": 29335 }, { "entropy": 6.0501243591308596, "epoch": 2.932873494277003, "grad_norm": 1.03125, "learning_rate": 0.00041503553304514157, "loss": 5.637, "mean_token_accuracy": 0.18347941040992738, "num_tokens": 57390639.0, "step": 29340 }, { "entropy": 6.054699325561524, "epoch": 2.933373319338232, "grad_norm": 1.1484375, "learning_rate": 0.0004150075968843012, "loss": 5.557, "mean_token_accuracy": 0.19377168864011765, "num_tokens": 57401567.0, "step": 29345 }, { "entropy": 5.972626543045044, "epoch": 2.93387314439946, "grad_norm": 1.234375, "learning_rate": 0.00041497965720090573, "loss": 5.5135, "mean_token_accuracy": 0.192818720638752, "num_tokens": 57410550.0, "step": 29350 }, { "entropy": 5.983793783187866, "epoch": 2.934372969460689, "grad_norm": 1.0703125, "learning_rate": 0.00041495171399565816, "loss": 5.6207, "mean_token_accuracy": 0.17977932542562486, "num_tokens": 57420029.0, "step": 29355 }, { "entropy": 6.1336568832397464, "epoch": 2.934872794521917, "grad_norm": 1.125, "learning_rate": 0.0004149237672692615, "loss": 5.7273, "mean_token_accuracy": 0.17756507098674773, "num_tokens": 57429732.0, "step": 29360 }, { "entropy": 6.039405393600464, "epoch": 2.9353726195831458, "grad_norm": 1.1484375, "learning_rate": 0.0004148958170224188, "loss": 5.547, "mean_token_accuracy": 0.19167325049638748, "num_tokens": 57439469.0, "step": 29365 }, { "entropy": 5.9620569229125975, "epoch": 2.9358724446443745, "grad_norm": 1.1875, "learning_rate": 0.00041486786325583343, "loss": 5.5098, "mean_token_accuracy": 0.19799445271492006, "num_tokens": 57450218.0, "step": 29370 }, { "entropy": 6.122945547103882, "epoch": 2.936372269705603, "grad_norm": 1.15625, "learning_rate": 0.00041483990597020854, "loss": 5.6226, "mean_token_accuracy": 0.17981446236371995, "num_tokens": 57459610.0, "step": 29375 }, { "entropy": 6.066587448120117, "epoch": 2.936872094766832, "grad_norm": 1.1015625, "learning_rate": 0.00041481194516624763, "loss": 5.6016, "mean_token_accuracy": 0.1807072401046753, "num_tokens": 57468849.0, "step": 29380 }, { "entropy": 6.029281663894653, "epoch": 2.93737191982806, "grad_norm": 1.171875, "learning_rate": 0.0004147839808446541, "loss": 5.5415, "mean_token_accuracy": 0.18786125332117082, "num_tokens": 57477827.0, "step": 29385 }, { "entropy": 5.94865050315857, "epoch": 2.937871744889289, "grad_norm": 1.1328125, "learning_rate": 0.00041475601300613166, "loss": 5.5265, "mean_token_accuracy": 0.19161620289087294, "num_tokens": 57487502.0, "step": 29390 }, { "entropy": 5.988337230682373, "epoch": 2.938371569950517, "grad_norm": 1.0703125, "learning_rate": 0.00041472804165138384, "loss": 5.5198, "mean_token_accuracy": 0.18503762036561966, "num_tokens": 57498281.0, "step": 29395 }, { "entropy": 6.022827768325806, "epoch": 2.9388713950117458, "grad_norm": 1.1015625, "learning_rate": 0.0004147000667811145, "loss": 5.5991, "mean_token_accuracy": 0.19076108634471894, "num_tokens": 57509612.0, "step": 29400 }, { "entropy": 6.056727170944214, "epoch": 2.9393712200729745, "grad_norm": 1.140625, "learning_rate": 0.0004146720883960273, "loss": 5.5827, "mean_token_accuracy": 0.18651618659496308, "num_tokens": 57519211.0, "step": 29405 }, { "entropy": 5.976264524459839, "epoch": 2.939871045134203, "grad_norm": 1.1640625, "learning_rate": 0.0004146441064968264, "loss": 5.5449, "mean_token_accuracy": 0.1872389316558838, "num_tokens": 57528756.0, "step": 29410 }, { "entropy": 6.009111499786377, "epoch": 2.940370870195432, "grad_norm": 1.3203125, "learning_rate": 0.00041461612108421576, "loss": 5.588, "mean_token_accuracy": 0.17851599603891372, "num_tokens": 57537892.0, "step": 29415 }, { "entropy": 6.0385541915893555, "epoch": 2.94087069525666, "grad_norm": 1.0390625, "learning_rate": 0.00041458813215889935, "loss": 5.6243, "mean_token_accuracy": 0.17685019671916963, "num_tokens": 57547650.0, "step": 29420 }, { "entropy": 5.927580308914185, "epoch": 2.941370520317889, "grad_norm": 1.0703125, "learning_rate": 0.0004145601397215815, "loss": 5.5329, "mean_token_accuracy": 0.1908237025141716, "num_tokens": 57557077.0, "step": 29425 }, { "entropy": 6.072788047790527, "epoch": 2.941870345379117, "grad_norm": 1.203125, "learning_rate": 0.00041453214377296636, "loss": 5.627, "mean_token_accuracy": 0.18544137924909593, "num_tokens": 57566402.0, "step": 29430 }, { "entropy": 6.0405707359313965, "epoch": 2.9423701704403458, "grad_norm": 1.1015625, "learning_rate": 0.0004145041443137585, "loss": 5.5691, "mean_token_accuracy": 0.1847331181168556, "num_tokens": 57577093.0, "step": 29435 }, { "entropy": 6.050566053390503, "epoch": 2.9428699955015745, "grad_norm": 1.1640625, "learning_rate": 0.0004144761413446622, "loss": 5.5259, "mean_token_accuracy": 0.18981388211250305, "num_tokens": 57586790.0, "step": 29440 }, { "entropy": 5.956250953674316, "epoch": 2.943369820562803, "grad_norm": 1.1171875, "learning_rate": 0.00041444813486638215, "loss": 5.4657, "mean_token_accuracy": 0.19388211220502855, "num_tokens": 57595615.0, "step": 29445 }, { "entropy": 5.972224378585816, "epoch": 2.943869645624032, "grad_norm": 1.109375, "learning_rate": 0.00041442012487962284, "loss": 5.5577, "mean_token_accuracy": 0.1889161393046379, "num_tokens": 57605436.0, "step": 29450 }, { "entropy": 6.08711609840393, "epoch": 2.94436947068526, "grad_norm": 1.109375, "learning_rate": 0.0004143921113850891, "loss": 5.6058, "mean_token_accuracy": 0.17517657279968263, "num_tokens": 57614286.0, "step": 29455 }, { "entropy": 5.926671981811523, "epoch": 2.944869295746489, "grad_norm": 1.078125, "learning_rate": 0.00041436409438348564, "loss": 5.4671, "mean_token_accuracy": 0.1945877715945244, "num_tokens": 57624591.0, "step": 29460 }, { "entropy": 5.985031461715698, "epoch": 2.945369120807717, "grad_norm": 1.0859375, "learning_rate": 0.0004143360738755175, "loss": 5.5189, "mean_token_accuracy": 0.19162131994962692, "num_tokens": 57633987.0, "step": 29465 }, { "entropy": 6.072393465042114, "epoch": 2.9458689458689458, "grad_norm": 1.1328125, "learning_rate": 0.0004143080498618895, "loss": 5.6078, "mean_token_accuracy": 0.18133717626333237, "num_tokens": 57643989.0, "step": 29470 }, { "entropy": 5.981821918487549, "epoch": 2.9463687709301745, "grad_norm": 1.0703125, "learning_rate": 0.00041428002234330694, "loss": 5.5295, "mean_token_accuracy": 0.18350795954465865, "num_tokens": 57653860.0, "step": 29475 }, { "entropy": 5.917502927780151, "epoch": 2.946868595991403, "grad_norm": 1.1015625, "learning_rate": 0.0004142519913204748, "loss": 5.4693, "mean_token_accuracy": 0.2024311438202858, "num_tokens": 57663245.0, "step": 29480 }, { "entropy": 6.020078420639038, "epoch": 2.9473684210526314, "grad_norm": 1.1171875, "learning_rate": 0.00041422395679409834, "loss": 5.4743, "mean_token_accuracy": 0.19178796857595443, "num_tokens": 57672624.0, "step": 29485 }, { "entropy": 5.931502723693848, "epoch": 2.94786824611386, "grad_norm": 1.078125, "learning_rate": 0.00041419591876488304, "loss": 5.5504, "mean_token_accuracy": 0.19396725594997405, "num_tokens": 57683278.0, "step": 29490 }, { "entropy": 5.967512702941894, "epoch": 2.948368071175089, "grad_norm": 1.1953125, "learning_rate": 0.0004141678772335342, "loss": 5.5014, "mean_token_accuracy": 0.18988406360149385, "num_tokens": 57692252.0, "step": 29495 }, { "entropy": 6.053036403656006, "epoch": 2.948867896236317, "grad_norm": 1.046875, "learning_rate": 0.00041413983220075736, "loss": 5.5441, "mean_token_accuracy": 0.1812570199370384, "num_tokens": 57703154.0, "step": 29500 }, { "entropy": 6.121570587158203, "epoch": 2.9493677212975458, "grad_norm": 1.09375, "learning_rate": 0.00041411178366725814, "loss": 5.7296, "mean_token_accuracy": 0.17207881957292556, "num_tokens": 57714526.0, "step": 29505 }, { "entropy": 6.009703016281128, "epoch": 2.9498675463587745, "grad_norm": 1.1953125, "learning_rate": 0.0004140837316337423, "loss": 5.5314, "mean_token_accuracy": 0.19020500630140305, "num_tokens": 57724143.0, "step": 29510 }, { "entropy": 6.078697443008423, "epoch": 2.950367371420003, "grad_norm": 1.2578125, "learning_rate": 0.0004140556761009155, "loss": 5.6914, "mean_token_accuracy": 0.1728191152215004, "num_tokens": 57732772.0, "step": 29515 }, { "entropy": 5.975446653366089, "epoch": 2.9508671964812314, "grad_norm": 1.078125, "learning_rate": 0.0004140276170694837, "loss": 5.5394, "mean_token_accuracy": 0.1871001347899437, "num_tokens": 57742200.0, "step": 29520 }, { "entropy": 6.065972471237183, "epoch": 2.95136702154246, "grad_norm": 1.1328125, "learning_rate": 0.00041399955454015286, "loss": 5.6033, "mean_token_accuracy": 0.180644291639328, "num_tokens": 57752477.0, "step": 29525 }, { "entropy": 6.02420392036438, "epoch": 2.951866846603689, "grad_norm": 1.2109375, "learning_rate": 0.00041397148851362903, "loss": 5.5307, "mean_token_accuracy": 0.18796690702438354, "num_tokens": 57761204.0, "step": 29530 }, { "entropy": 5.903612899780273, "epoch": 2.952366671664917, "grad_norm": 1.03125, "learning_rate": 0.00041394341899061814, "loss": 5.4192, "mean_token_accuracy": 0.19416651874780655, "num_tokens": 57771222.0, "step": 29535 }, { "entropy": 5.993813610076904, "epoch": 2.9528664967261458, "grad_norm": 1.0546875, "learning_rate": 0.0004139153459718267, "loss": 5.6356, "mean_token_accuracy": 0.17262024581432342, "num_tokens": 57781200.0, "step": 29540 }, { "entropy": 5.903094339370727, "epoch": 2.9533663217873745, "grad_norm": 1.109375, "learning_rate": 0.000413887269457961, "loss": 5.3897, "mean_token_accuracy": 0.2032831758260727, "num_tokens": 57790139.0, "step": 29545 }, { "entropy": 5.982140064239502, "epoch": 2.953866146848603, "grad_norm": 1.2109375, "learning_rate": 0.00041385918944972716, "loss": 5.5626, "mean_token_accuracy": 0.1853357195854187, "num_tokens": 57800156.0, "step": 29550 }, { "entropy": 6.062548351287842, "epoch": 2.9543659719098314, "grad_norm": 1.1171875, "learning_rate": 0.00041383110594783197, "loss": 5.5998, "mean_token_accuracy": 0.18874290883541106, "num_tokens": 57810344.0, "step": 29555 }, { "entropy": 5.95925555229187, "epoch": 2.95486579697106, "grad_norm": 1.0546875, "learning_rate": 0.00041380301895298173, "loss": 5.4909, "mean_token_accuracy": 0.1859721064567566, "num_tokens": 57820382.0, "step": 29560 }, { "entropy": 5.975183773040771, "epoch": 2.955365622032289, "grad_norm": 1.2421875, "learning_rate": 0.00041377492846588333, "loss": 5.6401, "mean_token_accuracy": 0.17948297262191773, "num_tokens": 57831250.0, "step": 29565 }, { "entropy": 5.974965906143188, "epoch": 2.955865447093517, "grad_norm": 1.15625, "learning_rate": 0.00041374683448724346, "loss": 5.5598, "mean_token_accuracy": 0.19483625888824463, "num_tokens": 57840134.0, "step": 29570 }, { "entropy": 6.082124996185303, "epoch": 2.9563652721547458, "grad_norm": 1.171875, "learning_rate": 0.0004137187370177689, "loss": 5.5968, "mean_token_accuracy": 0.1854638710618019, "num_tokens": 57850147.0, "step": 29575 }, { "entropy": 5.946426963806152, "epoch": 2.9568650972159745, "grad_norm": 1.1328125, "learning_rate": 0.00041369063605816667, "loss": 5.4843, "mean_token_accuracy": 0.1984087646007538, "num_tokens": 57859516.0, "step": 29580 }, { "entropy": 5.9339570045471195, "epoch": 2.957364922277203, "grad_norm": 1.1171875, "learning_rate": 0.0004136625316091437, "loss": 5.5477, "mean_token_accuracy": 0.18196811378002167, "num_tokens": 57869858.0, "step": 29585 }, { "entropy": 6.034710931777954, "epoch": 2.9578647473384314, "grad_norm": 1.0, "learning_rate": 0.0004136344236714071, "loss": 5.6457, "mean_token_accuracy": 0.17853848338127137, "num_tokens": 57879804.0, "step": 29590 }, { "entropy": 6.06839952468872, "epoch": 2.95836457239966, "grad_norm": 1.171875, "learning_rate": 0.00041360631224566407, "loss": 5.5227, "mean_token_accuracy": 0.20286415219306947, "num_tokens": 57889936.0, "step": 29595 }, { "entropy": 5.958437538146972, "epoch": 2.958864397460889, "grad_norm": 1.0859375, "learning_rate": 0.0004135781973326219, "loss": 5.4955, "mean_token_accuracy": 0.1934566840529442, "num_tokens": 57899230.0, "step": 29600 }, { "entropy": 6.007947635650635, "epoch": 2.959364222522117, "grad_norm": 1.0703125, "learning_rate": 0.00041355007893298796, "loss": 5.6002, "mean_token_accuracy": 0.1784466564655304, "num_tokens": 57909741.0, "step": 29605 }, { "entropy": 5.968269777297974, "epoch": 2.9598640475833458, "grad_norm": 1.2734375, "learning_rate": 0.0004135219570474697, "loss": 5.5506, "mean_token_accuracy": 0.18746088892221452, "num_tokens": 57918558.0, "step": 29610 }, { "entropy": 5.895211410522461, "epoch": 2.9603638726445745, "grad_norm": 1.1015625, "learning_rate": 0.00041349383167677456, "loss": 5.3787, "mean_token_accuracy": 0.20397517532110215, "num_tokens": 57928868.0, "step": 29615 }, { "entropy": 6.008860874176025, "epoch": 2.960863697705803, "grad_norm": 1.125, "learning_rate": 0.00041346570282161033, "loss": 5.5033, "mean_token_accuracy": 0.18880465179681777, "num_tokens": 57937890.0, "step": 29620 }, { "entropy": 5.954699468612671, "epoch": 2.9613635227670314, "grad_norm": 1.2109375, "learning_rate": 0.00041343757048268464, "loss": 5.5811, "mean_token_accuracy": 0.1833593800663948, "num_tokens": 57946340.0, "step": 29625 }, { "entropy": 6.0650512218475345, "epoch": 2.96186334782826, "grad_norm": 0.96875, "learning_rate": 0.0004134094346607053, "loss": 5.6508, "mean_token_accuracy": 0.17725763618946075, "num_tokens": 57955968.0, "step": 29630 }, { "entropy": 5.998663091659546, "epoch": 2.962363172889489, "grad_norm": 1.0859375, "learning_rate": 0.0004133812953563802, "loss": 5.4661, "mean_token_accuracy": 0.19454983174800872, "num_tokens": 57965345.0, "step": 29635 }, { "entropy": 5.971135091781616, "epoch": 2.962862997950717, "grad_norm": 1.1015625, "learning_rate": 0.00041335315257041733, "loss": 5.5151, "mean_token_accuracy": 0.18974445909261703, "num_tokens": 57974652.0, "step": 29640 }, { "entropy": 5.980753612518311, "epoch": 2.9633628230119458, "grad_norm": 1.1953125, "learning_rate": 0.00041332500630352463, "loss": 5.5756, "mean_token_accuracy": 0.1838421866297722, "num_tokens": 57983845.0, "step": 29645 }, { "entropy": 5.9552192211151125, "epoch": 2.9638626480731745, "grad_norm": 1.1796875, "learning_rate": 0.0004132968565564105, "loss": 5.563, "mean_token_accuracy": 0.19131224900484084, "num_tokens": 57993455.0, "step": 29650 }, { "entropy": 6.039216756820679, "epoch": 2.964362473134403, "grad_norm": 1.0390625, "learning_rate": 0.000413268703329783, "loss": 5.5626, "mean_token_accuracy": 0.17748664170503617, "num_tokens": 58003983.0, "step": 29655 }, { "entropy": 5.993852233886718, "epoch": 2.9648622981956314, "grad_norm": 1.1015625, "learning_rate": 0.0004132405466243505, "loss": 5.5344, "mean_token_accuracy": 0.1858879432082176, "num_tokens": 58014486.0, "step": 29660 }, { "entropy": 5.980943012237549, "epoch": 2.96536212325686, "grad_norm": 1.0703125, "learning_rate": 0.00041321238644082144, "loss": 5.4498, "mean_token_accuracy": 0.19472070783376694, "num_tokens": 58023610.0, "step": 29665 }, { "entropy": 6.072493839263916, "epoch": 2.965861948318089, "grad_norm": 1.3125, "learning_rate": 0.00041318422277990426, "loss": 5.6665, "mean_token_accuracy": 0.18644228279590608, "num_tokens": 58033829.0, "step": 29670 }, { "entropy": 5.97233772277832, "epoch": 2.966361773379317, "grad_norm": 1.0390625, "learning_rate": 0.0004131560556423076, "loss": 5.529, "mean_token_accuracy": 0.18147474825382232, "num_tokens": 58042716.0, "step": 29675 }, { "entropy": 5.967957639694214, "epoch": 2.9668615984405458, "grad_norm": 1.1171875, "learning_rate": 0.0004131278850287401, "loss": 5.5174, "mean_token_accuracy": 0.1817076474428177, "num_tokens": 58052667.0, "step": 29680 }, { "entropy": 6.014030981063843, "epoch": 2.9673614235017745, "grad_norm": 1.078125, "learning_rate": 0.00041309971093991067, "loss": 5.5836, "mean_token_accuracy": 0.1796314537525177, "num_tokens": 58061690.0, "step": 29685 }, { "entropy": 6.072140884399414, "epoch": 2.967861248563003, "grad_norm": 1.09375, "learning_rate": 0.00041307153337652805, "loss": 5.5541, "mean_token_accuracy": 0.18361676186323167, "num_tokens": 58071212.0, "step": 29690 }, { "entropy": 5.982745409011841, "epoch": 2.9683610736242314, "grad_norm": 1.1015625, "learning_rate": 0.000413043352339301, "loss": 5.5292, "mean_token_accuracy": 0.18420960903167724, "num_tokens": 58081227.0, "step": 29695 }, { "entropy": 6.0355487823486325, "epoch": 2.96886089868546, "grad_norm": 1.015625, "learning_rate": 0.0004130151678289388, "loss": 5.5893, "mean_token_accuracy": 0.18170927762985228, "num_tokens": 58091303.0, "step": 29700 }, { "entropy": 5.959450769424438, "epoch": 2.969360723746689, "grad_norm": 1.0703125, "learning_rate": 0.0004129869798461506, "loss": 5.4419, "mean_token_accuracy": 0.1965516358613968, "num_tokens": 58100124.0, "step": 29705 }, { "entropy": 5.946548795700073, "epoch": 2.969860548807917, "grad_norm": 1.078125, "learning_rate": 0.0004129587883916454, "loss": 5.5722, "mean_token_accuracy": 0.18986990600824355, "num_tokens": 58110326.0, "step": 29710 }, { "entropy": 5.974349021911621, "epoch": 2.9703603738691458, "grad_norm": 1.0703125, "learning_rate": 0.0004129305934661326, "loss": 5.5348, "mean_token_accuracy": 0.18973829001188278, "num_tokens": 58119465.0, "step": 29715 }, { "entropy": 6.000444984436035, "epoch": 2.9708601989303745, "grad_norm": 1.140625, "learning_rate": 0.00041290239507032155, "loss": 5.6234, "mean_token_accuracy": 0.18723777532577515, "num_tokens": 58130136.0, "step": 29720 }, { "entropy": 5.942437028884887, "epoch": 2.971360023991603, "grad_norm": 1.1484375, "learning_rate": 0.0004128741932049218, "loss": 5.4674, "mean_token_accuracy": 0.19492389857769013, "num_tokens": 58139725.0, "step": 29725 }, { "entropy": 5.900717258453369, "epoch": 2.9718598490528314, "grad_norm": 1.140625, "learning_rate": 0.0004128459878706428, "loss": 5.4586, "mean_token_accuracy": 0.20155538022518157, "num_tokens": 58149060.0, "step": 29730 }, { "entropy": 5.94240894317627, "epoch": 2.97235967411406, "grad_norm": 1.078125, "learning_rate": 0.0004128177790681942, "loss": 5.546, "mean_token_accuracy": 0.1866272807121277, "num_tokens": 58159627.0, "step": 29735 }, { "entropy": 5.991946792602539, "epoch": 2.972859499175289, "grad_norm": 1.125, "learning_rate": 0.00041278956679828566, "loss": 5.4553, "mean_token_accuracy": 0.19701793193817138, "num_tokens": 58169546.0, "step": 29740 }, { "entropy": 5.948609066009522, "epoch": 2.973359324236517, "grad_norm": 1.1640625, "learning_rate": 0.00041276135106162713, "loss": 5.4907, "mean_token_accuracy": 0.19415191262960435, "num_tokens": 58179521.0, "step": 29745 }, { "entropy": 5.986577701568604, "epoch": 2.9738591492977458, "grad_norm": 1.1484375, "learning_rate": 0.0004127331318589285, "loss": 5.5285, "mean_token_accuracy": 0.18708404153585434, "num_tokens": 58188975.0, "step": 29750 }, { "entropy": 6.021513748168945, "epoch": 2.9743589743589745, "grad_norm": 1.1484375, "learning_rate": 0.00041270490919089966, "loss": 5.5671, "mean_token_accuracy": 0.18219734132289886, "num_tokens": 58198692.0, "step": 29755 }, { "entropy": 6.093898820877075, "epoch": 2.974858799420203, "grad_norm": 1.1328125, "learning_rate": 0.0004126766830582508, "loss": 5.6754, "mean_token_accuracy": 0.17540400773286818, "num_tokens": 58208441.0, "step": 29760 }, { "entropy": 6.0223057746887205, "epoch": 2.9753586244814314, "grad_norm": 1.0703125, "learning_rate": 0.000412648453461692, "loss": 5.6228, "mean_token_accuracy": 0.18570591807365416, "num_tokens": 58218750.0, "step": 29765 }, { "entropy": 5.885152864456177, "epoch": 2.97585844954266, "grad_norm": 1.0234375, "learning_rate": 0.00041262022040193346, "loss": 5.4708, "mean_token_accuracy": 0.1874534472823143, "num_tokens": 58229445.0, "step": 29770 }, { "entropy": 6.046731901168823, "epoch": 2.976358274603889, "grad_norm": 1.046875, "learning_rate": 0.00041259198387968564, "loss": 5.6397, "mean_token_accuracy": 0.18157826662063598, "num_tokens": 58240012.0, "step": 29775 }, { "entropy": 6.0540198802948, "epoch": 2.976858099665117, "grad_norm": 1.1171875, "learning_rate": 0.00041256374389565895, "loss": 5.6552, "mean_token_accuracy": 0.17606754451990128, "num_tokens": 58250303.0, "step": 29780 }, { "entropy": 5.927592182159424, "epoch": 2.9773579247263458, "grad_norm": 1.125, "learning_rate": 0.00041253550045056375, "loss": 5.3955, "mean_token_accuracy": 0.20423873960971833, "num_tokens": 58259376.0, "step": 29785 }, { "entropy": 6.00399169921875, "epoch": 2.9778577497875744, "grad_norm": 1.125, "learning_rate": 0.00041250725354511085, "loss": 5.6566, "mean_token_accuracy": 0.17770321816205978, "num_tokens": 58269620.0, "step": 29790 }, { "entropy": 5.942795372009277, "epoch": 2.978357574848803, "grad_norm": 1.1484375, "learning_rate": 0.0004124790031800109, "loss": 5.4741, "mean_token_accuracy": 0.19657584577798842, "num_tokens": 58280121.0, "step": 29795 }, { "entropy": 6.045471668243408, "epoch": 2.9788573999100314, "grad_norm": 1.21875, "learning_rate": 0.0004124507493559745, "loss": 5.6489, "mean_token_accuracy": 0.18027630001306533, "num_tokens": 58289944.0, "step": 29800 }, { "entropy": 6.087820911407471, "epoch": 2.97935722497126, "grad_norm": 1.15625, "learning_rate": 0.0004124224920737126, "loss": 5.6392, "mean_token_accuracy": 0.17862434238195418, "num_tokens": 58300091.0, "step": 29805 }, { "entropy": 5.917552471160889, "epoch": 2.9798570500324884, "grad_norm": 1.15625, "learning_rate": 0.0004123942313339361, "loss": 5.3653, "mean_token_accuracy": 0.1994468092918396, "num_tokens": 58309249.0, "step": 29810 }, { "entropy": 6.02134690284729, "epoch": 2.980356875093717, "grad_norm": 1.1171875, "learning_rate": 0.00041236596713735624, "loss": 5.6293, "mean_token_accuracy": 0.18090686053037644, "num_tokens": 58319238.0, "step": 29815 }, { "entropy": 6.062193965911865, "epoch": 2.9808567001549457, "grad_norm": 1.0703125, "learning_rate": 0.0004123376994846839, "loss": 5.5828, "mean_token_accuracy": 0.18343030363321305, "num_tokens": 58329091.0, "step": 29820 }, { "entropy": 6.040722370147705, "epoch": 2.9813565252161744, "grad_norm": 1.15625, "learning_rate": 0.0004123094283766304, "loss": 5.5027, "mean_token_accuracy": 0.19234997034072876, "num_tokens": 58338581.0, "step": 29825 }, { "entropy": 6.059003734588623, "epoch": 2.981856350277403, "grad_norm": 1.1171875, "learning_rate": 0.00041228115381390705, "loss": 5.6031, "mean_token_accuracy": 0.18422225415706633, "num_tokens": 58347890.0, "step": 29830 }, { "entropy": 6.051473951339721, "epoch": 2.9823561753386314, "grad_norm": 1.15625, "learning_rate": 0.00041225287579722526, "loss": 5.6473, "mean_token_accuracy": 0.1763221427798271, "num_tokens": 58357910.0, "step": 29835 }, { "entropy": 6.0867105484008786, "epoch": 2.98285600039986, "grad_norm": 1.0546875, "learning_rate": 0.0004122245943272963, "loss": 5.626, "mean_token_accuracy": 0.1790614143013954, "num_tokens": 58367819.0, "step": 29840 }, { "entropy": 5.991890144348145, "epoch": 2.9833558254610884, "grad_norm": 1.09375, "learning_rate": 0.00041219630940483187, "loss": 5.5539, "mean_token_accuracy": 0.1857790470123291, "num_tokens": 58377324.0, "step": 29845 }, { "entropy": 5.990442085266113, "epoch": 2.983855650522317, "grad_norm": 1.203125, "learning_rate": 0.0004121680210305436, "loss": 5.5403, "mean_token_accuracy": 0.18527545630931855, "num_tokens": 58386018.0, "step": 29850 }, { "entropy": 6.01331934928894, "epoch": 2.9843554755835457, "grad_norm": 1.09375, "learning_rate": 0.0004121397292051433, "loss": 5.4859, "mean_token_accuracy": 0.19112567454576493, "num_tokens": 58396049.0, "step": 29855 }, { "entropy": 6.058278131484985, "epoch": 2.9848553006447744, "grad_norm": 1.0625, "learning_rate": 0.0004121114339293427, "loss": 5.5758, "mean_token_accuracy": 0.18413000404834748, "num_tokens": 58407443.0, "step": 29860 }, { "entropy": 5.8019428730010985, "epoch": 2.985355125706003, "grad_norm": 1.09375, "learning_rate": 0.0004120831352038537, "loss": 5.3536, "mean_token_accuracy": 0.2081429824233055, "num_tokens": 58417466.0, "step": 29865 }, { "entropy": 6.016385650634765, "epoch": 2.9858549507672314, "grad_norm": 1.0625, "learning_rate": 0.0004120548330293882, "loss": 5.5193, "mean_token_accuracy": 0.18847994208335878, "num_tokens": 58426819.0, "step": 29870 }, { "entropy": 6.012957000732422, "epoch": 2.98635477582846, "grad_norm": 1.1796875, "learning_rate": 0.00041202652740665845, "loss": 5.5307, "mean_token_accuracy": 0.186588317155838, "num_tokens": 58436470.0, "step": 29875 }, { "entropy": 6.039665985107422, "epoch": 2.9868546008896883, "grad_norm": 1.1171875, "learning_rate": 0.0004119982183363765, "loss": 5.5454, "mean_token_accuracy": 0.19019873440265656, "num_tokens": 58448095.0, "step": 29880 }, { "entropy": 5.972097396850586, "epoch": 2.987354425950917, "grad_norm": 1.1484375, "learning_rate": 0.00041196990581925466, "loss": 5.5504, "mean_token_accuracy": 0.18915600925683976, "num_tokens": 58457162.0, "step": 29885 }, { "entropy": 6.042478561401367, "epoch": 2.9878542510121457, "grad_norm": 1.140625, "learning_rate": 0.0004119415898560052, "loss": 5.6761, "mean_token_accuracy": 0.18269980251789092, "num_tokens": 58467763.0, "step": 29890 }, { "entropy": 6.0925201892852785, "epoch": 2.9883540760733744, "grad_norm": 1.1484375, "learning_rate": 0.0004119132704473405, "loss": 5.5731, "mean_token_accuracy": 0.18319107592105865, "num_tokens": 58477769.0, "step": 29895 }, { "entropy": 6.0691667079925535, "epoch": 2.988853901134603, "grad_norm": 1.1875, "learning_rate": 0.0004118849475939733, "loss": 5.5949, "mean_token_accuracy": 0.17806579619646073, "num_tokens": 58486656.0, "step": 29900 }, { "entropy": 6.020935869216919, "epoch": 2.9893537261958314, "grad_norm": 1.125, "learning_rate": 0.00041185662129661593, "loss": 5.6258, "mean_token_accuracy": 0.18053748607635497, "num_tokens": 58496979.0, "step": 29905 }, { "entropy": 6.0426445484161375, "epoch": 2.98985355125706, "grad_norm": 1.1328125, "learning_rate": 0.0004118282915559813, "loss": 5.6174, "mean_token_accuracy": 0.18860926628112792, "num_tokens": 58507340.0, "step": 29910 }, { "entropy": 5.966879272460938, "epoch": 2.9903533763182883, "grad_norm": 1.0703125, "learning_rate": 0.0004117999583727819, "loss": 5.5545, "mean_token_accuracy": 0.18002053648233413, "num_tokens": 58517364.0, "step": 29915 }, { "entropy": 6.036857986450196, "epoch": 2.990853201379517, "grad_norm": 1.1640625, "learning_rate": 0.00041177162174773084, "loss": 5.4821, "mean_token_accuracy": 0.19262961596250533, "num_tokens": 58526435.0, "step": 29920 }, { "entropy": 5.986081981658936, "epoch": 2.9913530264407457, "grad_norm": 1.1953125, "learning_rate": 0.00041174328168154094, "loss": 5.5017, "mean_token_accuracy": 0.19622809141874314, "num_tokens": 58536694.0, "step": 29925 }, { "entropy": 5.965514469146728, "epoch": 2.9918528515019744, "grad_norm": 1.078125, "learning_rate": 0.0004117149381749253, "loss": 5.5187, "mean_token_accuracy": 0.1915062576532364, "num_tokens": 58546854.0, "step": 29930 }, { "entropy": 5.97601547241211, "epoch": 2.992352676563203, "grad_norm": 1.09375, "learning_rate": 0.0004116865912285971, "loss": 5.5529, "mean_token_accuracy": 0.18865127712488175, "num_tokens": 58557936.0, "step": 29935 }, { "entropy": 6.038477373123169, "epoch": 2.9928525016244314, "grad_norm": 1.046875, "learning_rate": 0.00041165824084326923, "loss": 5.6344, "mean_token_accuracy": 0.17815895527601242, "num_tokens": 58568107.0, "step": 29940 }, { "entropy": 5.982776212692261, "epoch": 2.99335232668566, "grad_norm": 1.140625, "learning_rate": 0.0004116298870196553, "loss": 5.4434, "mean_token_accuracy": 0.19593830555677413, "num_tokens": 58576756.0, "step": 29945 }, { "entropy": 5.978842926025391, "epoch": 2.9938521517468883, "grad_norm": 1.09375, "learning_rate": 0.00041160152975846853, "loss": 5.5456, "mean_token_accuracy": 0.193827985227108, "num_tokens": 58586894.0, "step": 29950 }, { "entropy": 6.007510423660278, "epoch": 2.994351976808117, "grad_norm": 1.1015625, "learning_rate": 0.0004115731690604225, "loss": 5.4948, "mean_token_accuracy": 0.18850331455469133, "num_tokens": 58596720.0, "step": 29955 }, { "entropy": 6.037660360336304, "epoch": 2.9948518018693457, "grad_norm": 1.1328125, "learning_rate": 0.0004115448049262306, "loss": 5.546, "mean_token_accuracy": 0.18342062681913376, "num_tokens": 58605705.0, "step": 29960 }, { "entropy": 6.088764953613281, "epoch": 2.9953516269305744, "grad_norm": 1.25, "learning_rate": 0.0004115164373566065, "loss": 5.7009, "mean_token_accuracy": 0.1766279548406601, "num_tokens": 58615669.0, "step": 29965 }, { "entropy": 6.06580228805542, "epoch": 2.995851451991803, "grad_norm": 1.2265625, "learning_rate": 0.00041148806635226407, "loss": 5.5989, "mean_token_accuracy": 0.1895786091685295, "num_tokens": 58625900.0, "step": 29970 }, { "entropy": 5.9440093517303465, "epoch": 2.9963512770530314, "grad_norm": 1.0078125, "learning_rate": 0.000411459691913917, "loss": 5.6262, "mean_token_accuracy": 0.18612994402647018, "num_tokens": 58637323.0, "step": 29975 }, { "entropy": 6.022060585021973, "epoch": 2.99685110211426, "grad_norm": 1.171875, "learning_rate": 0.00041143131404227913, "loss": 5.521, "mean_token_accuracy": 0.18842182457447051, "num_tokens": 58646395.0, "step": 29980 }, { "entropy": 6.000775671005249, "epoch": 2.9973509271754883, "grad_norm": 1.125, "learning_rate": 0.0004114029327380645, "loss": 5.4617, "mean_token_accuracy": 0.19264070093631744, "num_tokens": 58655966.0, "step": 29985 }, { "entropy": 6.00114860534668, "epoch": 2.997850752236717, "grad_norm": 1.03125, "learning_rate": 0.0004113745480019872, "loss": 5.4315, "mean_token_accuracy": 0.19758610129356385, "num_tokens": 58666030.0, "step": 29990 }, { "entropy": 5.97138295173645, "epoch": 2.9983505772979457, "grad_norm": 1.21875, "learning_rate": 0.0004113461598347614, "loss": 5.4644, "mean_token_accuracy": 0.1926880344748497, "num_tokens": 58674702.0, "step": 29995 }, { "entropy": 6.014968347549439, "epoch": 2.9988504023591744, "grad_norm": 1.0, "learning_rate": 0.00041131776823710134, "loss": 5.622, "mean_token_accuracy": 0.17895247787237167, "num_tokens": 58686103.0, "step": 30000 }, { "epoch": 2.9988504023591744, "eval_entropy": 5.850692069828433, "eval_loss": 5.647598743438721, "eval_mean_token_accuracy": 0.1909934875479266, "eval_num_tokens": 58686103.0, "eval_runtime": 23.8821, "eval_samples_per_second": 1299.929, "eval_steps_per_second": 162.507, "step": 30000 }, { "entropy": 6.030605268478394, "epoch": 2.9993502274204027, "grad_norm": 1.2421875, "learning_rate": 0.0004112893732097213, "loss": 5.509, "mean_token_accuracy": 0.19309124499559402, "num_tokens": 58695173.0, "step": 30005 }, { "entropy": 6.029189920425415, "epoch": 2.9998500524816314, "grad_norm": 1.2421875, "learning_rate": 0.0004112609747533356, "loss": 5.6264, "mean_token_accuracy": 0.17998196184635162, "num_tokens": 58705014.0, "step": 30010 }, { "entropy": 5.997407383388943, "epoch": 3.000299895036737, "grad_norm": 1.1015625, "learning_rate": 0.0004112325728686589, "loss": 5.5045, "mean_token_accuracy": 0.19685902694861093, "num_tokens": 58714656.0, "step": 30015 }, { "entropy": 6.063377428054809, "epoch": 3.000799720097966, "grad_norm": 1.203125, "learning_rate": 0.00041120416755640574, "loss": 5.4201, "mean_token_accuracy": 0.19232141077518464, "num_tokens": 58725157.0, "step": 30020 }, { "entropy": 6.021855258941651, "epoch": 3.001299545159194, "grad_norm": 1.109375, "learning_rate": 0.00041117575881729075, "loss": 5.5506, "mean_token_accuracy": 0.18044667840003967, "num_tokens": 58734229.0, "step": 30025 }, { "entropy": 5.964059066772461, "epoch": 3.001799370220423, "grad_norm": 1.15625, "learning_rate": 0.00041114734665202875, "loss": 5.3543, "mean_token_accuracy": 0.1979486122727394, "num_tokens": 58743374.0, "step": 30030 }, { "entropy": 5.966495418548584, "epoch": 3.0022991952816516, "grad_norm": 1.0703125, "learning_rate": 0.0004111189310613344, "loss": 5.3586, "mean_token_accuracy": 0.19842974990606307, "num_tokens": 58752846.0, "step": 30035 }, { "entropy": 6.034306764602661, "epoch": 3.00279902034288, "grad_norm": 1.046875, "learning_rate": 0.00041109051204592294, "loss": 5.5036, "mean_token_accuracy": 0.18650470077991485, "num_tokens": 58763407.0, "step": 30040 }, { "entropy": 5.990033340454102, "epoch": 3.0032988454041085, "grad_norm": 1.09375, "learning_rate": 0.00041106208960650913, "loss": 5.4308, "mean_token_accuracy": 0.18966882824897766, "num_tokens": 58774207.0, "step": 30045 }, { "entropy": 5.957082653045655, "epoch": 3.003798670465337, "grad_norm": 1.171875, "learning_rate": 0.00041103366374380817, "loss": 5.469, "mean_token_accuracy": 0.18997844606637954, "num_tokens": 58783270.0, "step": 30050 }, { "entropy": 5.939996147155762, "epoch": 3.004298495526566, "grad_norm": 1.109375, "learning_rate": 0.00041100523445853525, "loss": 5.4618, "mean_token_accuracy": 0.19548161774873735, "num_tokens": 58793007.0, "step": 30055 }, { "entropy": 6.088390445709228, "epoch": 3.004798320587794, "grad_norm": 1.1953125, "learning_rate": 0.0004109768017514056, "loss": 5.5725, "mean_token_accuracy": 0.18739273697137832, "num_tokens": 58802604.0, "step": 30060 }, { "entropy": 6.030565071105957, "epoch": 3.005298145649023, "grad_norm": 1.171875, "learning_rate": 0.0004109483656231346, "loss": 5.4904, "mean_token_accuracy": 0.1913704514503479, "num_tokens": 58811739.0, "step": 30065 }, { "entropy": 5.976911783218384, "epoch": 3.0057979707102516, "grad_norm": 1.1953125, "learning_rate": 0.00041091992607443777, "loss": 5.5077, "mean_token_accuracy": 0.1935662269592285, "num_tokens": 58821079.0, "step": 30070 }, { "entropy": 6.076920127868652, "epoch": 3.00629779577148, "grad_norm": 1.125, "learning_rate": 0.00041089148310603053, "loss": 5.5665, "mean_token_accuracy": 0.185103115439415, "num_tokens": 58831030.0, "step": 30075 }, { "entropy": 6.0436419486999515, "epoch": 3.0067976208327085, "grad_norm": 1.1015625, "learning_rate": 0.0004108630367186285, "loss": 5.4457, "mean_token_accuracy": 0.19681727588176728, "num_tokens": 58840241.0, "step": 30080 }, { "entropy": 6.004191827774048, "epoch": 3.007297445893937, "grad_norm": 1.1640625, "learning_rate": 0.00041083458691294755, "loss": 5.5015, "mean_token_accuracy": 0.18672581315040587, "num_tokens": 58849411.0, "step": 30085 }, { "entropy": 5.971017122268677, "epoch": 3.007797270955166, "grad_norm": 1.1640625, "learning_rate": 0.0004108061336897032, "loss": 5.4638, "mean_token_accuracy": 0.19412903785705565, "num_tokens": 58860478.0, "step": 30090 }, { "entropy": 6.0727095127105715, "epoch": 3.008297096016394, "grad_norm": 1.0859375, "learning_rate": 0.0004107776770496116, "loss": 5.5533, "mean_token_accuracy": 0.18970211446285248, "num_tokens": 58871700.0, "step": 30095 }, { "entropy": 6.082751941680908, "epoch": 3.008796921077623, "grad_norm": 1.125, "learning_rate": 0.0004107492169933885, "loss": 5.5697, "mean_token_accuracy": 0.17710745632648467, "num_tokens": 58882154.0, "step": 30100 }, { "entropy": 6.029969882965088, "epoch": 3.0092967461388516, "grad_norm": 1.1328125, "learning_rate": 0.00041072075352175004, "loss": 5.4712, "mean_token_accuracy": 0.1902804359793663, "num_tokens": 58892012.0, "step": 30105 }, { "entropy": 6.009149503707886, "epoch": 3.00979657120008, "grad_norm": 1.1640625, "learning_rate": 0.00041069228663541234, "loss": 5.4551, "mean_token_accuracy": 0.19363496899604798, "num_tokens": 58901196.0, "step": 30110 }, { "entropy": 5.96389102935791, "epoch": 3.0102963962613085, "grad_norm": 1.1640625, "learning_rate": 0.0004106638163350917, "loss": 5.4082, "mean_token_accuracy": 0.19631130993366241, "num_tokens": 58911474.0, "step": 30115 }, { "entropy": 5.993680429458618, "epoch": 3.010796221322537, "grad_norm": 1.1328125, "learning_rate": 0.0004106353426215043, "loss": 5.3951, "mean_token_accuracy": 0.1942811965942383, "num_tokens": 58920440.0, "step": 30120 }, { "entropy": 6.005222797393799, "epoch": 3.0112960463837655, "grad_norm": 1.2421875, "learning_rate": 0.00041060686549536656, "loss": 5.5111, "mean_token_accuracy": 0.18773080110549928, "num_tokens": 58929652.0, "step": 30125 }, { "entropy": 6.004841613769531, "epoch": 3.011795871444994, "grad_norm": 1.078125, "learning_rate": 0.000410578384957395, "loss": 5.429, "mean_token_accuracy": 0.19671889990568162, "num_tokens": 58940216.0, "step": 30130 }, { "entropy": 5.971134090423584, "epoch": 3.012295696506223, "grad_norm": 1.1171875, "learning_rate": 0.0004105499010083062, "loss": 5.4364, "mean_token_accuracy": 0.20153791159391404, "num_tokens": 58949517.0, "step": 30135 }, { "entropy": 5.897588300704956, "epoch": 3.0127955215674516, "grad_norm": 1.1171875, "learning_rate": 0.00041052141364881665, "loss": 5.4356, "mean_token_accuracy": 0.1977866366505623, "num_tokens": 58959044.0, "step": 30140 }, { "entropy": 6.014861011505127, "epoch": 3.01329534662868, "grad_norm": 1.09375, "learning_rate": 0.00041049292287964335, "loss": 5.4904, "mean_token_accuracy": 0.1937011808156967, "num_tokens": 58968352.0, "step": 30145 }, { "entropy": 5.916047143936157, "epoch": 3.0137951716899085, "grad_norm": 1.1640625, "learning_rate": 0.00041046442870150293, "loss": 5.3556, "mean_token_accuracy": 0.2039957046508789, "num_tokens": 58979082.0, "step": 30150 }, { "entropy": 5.9360755443572994, "epoch": 3.014294996751137, "grad_norm": 1.25, "learning_rate": 0.00041043593111511227, "loss": 5.4103, "mean_token_accuracy": 0.19594788551330566, "num_tokens": 58988181.0, "step": 30155 }, { "entropy": 5.9963761329650875, "epoch": 3.0147948218123655, "grad_norm": 1.171875, "learning_rate": 0.0004104074301211885, "loss": 5.4922, "mean_token_accuracy": 0.19489680826663972, "num_tokens": 58999907.0, "step": 30160 }, { "entropy": 6.009028053283691, "epoch": 3.015294646873594, "grad_norm": 1.1875, "learning_rate": 0.00041037892572044863, "loss": 5.547, "mean_token_accuracy": 0.1875782772898674, "num_tokens": 59009293.0, "step": 30165 }, { "entropy": 5.965840435028076, "epoch": 3.015794471934823, "grad_norm": 1.21875, "learning_rate": 0.00041035041791360983, "loss": 5.4783, "mean_token_accuracy": 0.19045298397541047, "num_tokens": 59017079.0, "step": 30170 }, { "entropy": 5.994843244552612, "epoch": 3.0162942969960516, "grad_norm": 1.2265625, "learning_rate": 0.0004103219067013893, "loss": 5.4406, "mean_token_accuracy": 0.19507923126220703, "num_tokens": 59027008.0, "step": 30175 }, { "entropy": 5.996065092086792, "epoch": 3.01679412205728, "grad_norm": 1.1640625, "learning_rate": 0.00041029339208450445, "loss": 5.503, "mean_token_accuracy": 0.18910137712955474, "num_tokens": 59036971.0, "step": 30180 }, { "entropy": 5.981302118301391, "epoch": 3.0172939471185085, "grad_norm": 1.1171875, "learning_rate": 0.0004102648740636727, "loss": 5.4525, "mean_token_accuracy": 0.19139693826436996, "num_tokens": 59048264.0, "step": 30185 }, { "entropy": 5.981693887710572, "epoch": 3.017793772179737, "grad_norm": 1.1015625, "learning_rate": 0.0004102363526396115, "loss": 5.5685, "mean_token_accuracy": 0.1885414257645607, "num_tokens": 59057981.0, "step": 30190 }, { "entropy": 6.072077989578247, "epoch": 3.0182935972409655, "grad_norm": 1.1328125, "learning_rate": 0.0004102078278130384, "loss": 5.5868, "mean_token_accuracy": 0.18251278698444368, "num_tokens": 59068441.0, "step": 30195 }, { "entropy": 6.028339624404907, "epoch": 3.018793422302194, "grad_norm": 1.0859375, "learning_rate": 0.00041017929958467113, "loss": 5.5027, "mean_token_accuracy": 0.19216036945581436, "num_tokens": 59078544.0, "step": 30200 }, { "entropy": 5.987252616882325, "epoch": 3.019293247363423, "grad_norm": 1.078125, "learning_rate": 0.0004101507679552276, "loss": 5.4957, "mean_token_accuracy": 0.19467708468437195, "num_tokens": 59088063.0, "step": 30205 }, { "entropy": 5.983454704284668, "epoch": 3.0197930724246516, "grad_norm": 1.109375, "learning_rate": 0.0004101222329254255, "loss": 5.5023, "mean_token_accuracy": 0.18630857467651368, "num_tokens": 59098003.0, "step": 30210 }, { "entropy": 6.03258171081543, "epoch": 3.02029289748588, "grad_norm": 1.15625, "learning_rate": 0.0004100936944959828, "loss": 5.4998, "mean_token_accuracy": 0.1843581274151802, "num_tokens": 59108595.0, "step": 30215 }, { "entropy": 6.037194299697876, "epoch": 3.0207927225471085, "grad_norm": 1.0234375, "learning_rate": 0.0004100651526676174, "loss": 5.5674, "mean_token_accuracy": 0.18235031515359879, "num_tokens": 59118453.0, "step": 30220 }, { "entropy": 5.971056652069092, "epoch": 3.021292547608337, "grad_norm": 1.1484375, "learning_rate": 0.0004100366074410476, "loss": 5.4443, "mean_token_accuracy": 0.19176288545131684, "num_tokens": 59128005.0, "step": 30225 }, { "entropy": 6.052638244628906, "epoch": 3.0217923726695655, "grad_norm": 1.0703125, "learning_rate": 0.00041000805881699143, "loss": 5.5012, "mean_token_accuracy": 0.18907860964536666, "num_tokens": 59137694.0, "step": 30230 }, { "entropy": 5.969610691070557, "epoch": 3.022292197730794, "grad_norm": 1.1484375, "learning_rate": 0.0004099795067961673, "loss": 5.5017, "mean_token_accuracy": 0.19380665123462676, "num_tokens": 59147715.0, "step": 30235 }, { "entropy": 5.978658294677734, "epoch": 3.022792022792023, "grad_norm": 1.078125, "learning_rate": 0.0004099509513792935, "loss": 5.4904, "mean_token_accuracy": 0.19054348915815353, "num_tokens": 59157151.0, "step": 30240 }, { "entropy": 6.105502414703369, "epoch": 3.0232918478532516, "grad_norm": 1.0625, "learning_rate": 0.00040992239256708844, "loss": 5.5576, "mean_token_accuracy": 0.18616366088390351, "num_tokens": 59167349.0, "step": 30245 }, { "entropy": 5.92483811378479, "epoch": 3.02379167291448, "grad_norm": 1.109375, "learning_rate": 0.0004098938303602708, "loss": 5.4351, "mean_token_accuracy": 0.19585761725902556, "num_tokens": 59176412.0, "step": 30250 }, { "entropy": 5.886774158477783, "epoch": 3.0242914979757085, "grad_norm": 1.140625, "learning_rate": 0.00040986526475955904, "loss": 5.4379, "mean_token_accuracy": 0.19260677695274353, "num_tokens": 59186050.0, "step": 30255 }, { "entropy": 5.958836793899536, "epoch": 3.024791323036937, "grad_norm": 1.109375, "learning_rate": 0.000409836695765672, "loss": 5.4382, "mean_token_accuracy": 0.19863022714853287, "num_tokens": 59196185.0, "step": 30260 }, { "entropy": 6.0170591354370115, "epoch": 3.0252911480981655, "grad_norm": 1.1015625, "learning_rate": 0.00040980812337932835, "loss": 5.4945, "mean_token_accuracy": 0.18979185521602632, "num_tokens": 59208079.0, "step": 30265 }, { "entropy": 6.002722692489624, "epoch": 3.025790973159394, "grad_norm": 1.1953125, "learning_rate": 0.00040977954760124693, "loss": 5.4654, "mean_token_accuracy": 0.18891989439725876, "num_tokens": 59216968.0, "step": 30270 }, { "entropy": 5.993566656112671, "epoch": 3.026290798220623, "grad_norm": 1.1171875, "learning_rate": 0.00040975096843214677, "loss": 5.415, "mean_token_accuracy": 0.1977374732494354, "num_tokens": 59226481.0, "step": 30275 }, { "entropy": 5.927251148223877, "epoch": 3.0267906232818516, "grad_norm": 1.234375, "learning_rate": 0.00040972238587274695, "loss": 5.3931, "mean_token_accuracy": 0.19563258290290833, "num_tokens": 59235794.0, "step": 30280 }, { "entropy": 5.96700086593628, "epoch": 3.02729044834308, "grad_norm": 1.0703125, "learning_rate": 0.00040969379992376664, "loss": 5.5024, "mean_token_accuracy": 0.18695476651191711, "num_tokens": 59245691.0, "step": 30285 }, { "entropy": 6.050683259963989, "epoch": 3.0277902734043085, "grad_norm": 1.15625, "learning_rate": 0.0004096652105859249, "loss": 5.5025, "mean_token_accuracy": 0.1870974987745285, "num_tokens": 59255591.0, "step": 30290 }, { "entropy": 5.9751667976379395, "epoch": 3.028290098465537, "grad_norm": 1.0859375, "learning_rate": 0.0004096366178599412, "loss": 5.369, "mean_token_accuracy": 0.20313187092542648, "num_tokens": 59266183.0, "step": 30295 }, { "entropy": 5.998158645629883, "epoch": 3.0287899235267655, "grad_norm": 1.125, "learning_rate": 0.0004096080217465347, "loss": 5.5269, "mean_token_accuracy": 0.18803392797708512, "num_tokens": 59276241.0, "step": 30300 }, { "entropy": 5.938171815872193, "epoch": 3.029289748587994, "grad_norm": 1.15625, "learning_rate": 0.0004095794222464252, "loss": 5.4647, "mean_token_accuracy": 0.19286196827888488, "num_tokens": 59286089.0, "step": 30305 }, { "entropy": 5.973509311676025, "epoch": 3.029789573649223, "grad_norm": 1.1640625, "learning_rate": 0.0004095508193603319, "loss": 5.5277, "mean_token_accuracy": 0.185259547829628, "num_tokens": 59295122.0, "step": 30310 }, { "entropy": 6.001608753204346, "epoch": 3.0302893987104516, "grad_norm": 1.1328125, "learning_rate": 0.0004095222130889747, "loss": 5.5446, "mean_token_accuracy": 0.18400773108005525, "num_tokens": 59304277.0, "step": 30315 }, { "entropy": 5.959620523452759, "epoch": 3.03078922377168, "grad_norm": 1.1015625, "learning_rate": 0.00040949360343307324, "loss": 5.38, "mean_token_accuracy": 0.19379789233207703, "num_tokens": 59315560.0, "step": 30320 }, { "entropy": 5.963546323776245, "epoch": 3.0312890488329085, "grad_norm": 1.09375, "learning_rate": 0.0004094649903933472, "loss": 5.4422, "mean_token_accuracy": 0.19200112223625182, "num_tokens": 59325238.0, "step": 30325 }, { "entropy": 5.9470704078674315, "epoch": 3.031788873894137, "grad_norm": 1.0390625, "learning_rate": 0.00040943637397051683, "loss": 5.3858, "mean_token_accuracy": 0.20288256853818892, "num_tokens": 59335800.0, "step": 30330 }, { "entropy": 5.979463291168213, "epoch": 3.0322886989553655, "grad_norm": 1.109375, "learning_rate": 0.00040940775416530164, "loss": 5.5399, "mean_token_accuracy": 0.18505657613277435, "num_tokens": 59345854.0, "step": 30335 }, { "entropy": 5.951516151428223, "epoch": 3.032788524016594, "grad_norm": 1.25, "learning_rate": 0.00040937913097842204, "loss": 5.3855, "mean_token_accuracy": 0.2013171672821045, "num_tokens": 59354789.0, "step": 30340 }, { "entropy": 6.029586553573608, "epoch": 3.033288349077823, "grad_norm": 1.265625, "learning_rate": 0.0004093505044105982, "loss": 5.5469, "mean_token_accuracy": 0.18387166559696197, "num_tokens": 59364205.0, "step": 30345 }, { "entropy": 6.015558910369873, "epoch": 3.033788174139051, "grad_norm": 1.234375, "learning_rate": 0.00040932187446255004, "loss": 5.5287, "mean_token_accuracy": 0.1883456215262413, "num_tokens": 59375037.0, "step": 30350 }, { "entropy": 5.930894565582276, "epoch": 3.03428799920028, "grad_norm": 1.0625, "learning_rate": 0.0004092932411349982, "loss": 5.3485, "mean_token_accuracy": 0.20393879860639572, "num_tokens": 59384820.0, "step": 30355 }, { "entropy": 5.925769567489624, "epoch": 3.0347878242615085, "grad_norm": 1.140625, "learning_rate": 0.000409264604428663, "loss": 5.4602, "mean_token_accuracy": 0.19299192428588868, "num_tokens": 59394571.0, "step": 30360 }, { "entropy": 5.95932149887085, "epoch": 3.035287649322737, "grad_norm": 1.0625, "learning_rate": 0.0004092359643442648, "loss": 5.5191, "mean_token_accuracy": 0.18958512395620347, "num_tokens": 59405758.0, "step": 30365 }, { "entropy": 5.983124780654907, "epoch": 3.0357874743839655, "grad_norm": 1.15625, "learning_rate": 0.0004092073208825243, "loss": 5.4097, "mean_token_accuracy": 0.19802277237176896, "num_tokens": 59415091.0, "step": 30370 }, { "entropy": 6.016193437576294, "epoch": 3.036287299445194, "grad_norm": 1.1328125, "learning_rate": 0.0004091786740441622, "loss": 5.5402, "mean_token_accuracy": 0.1825582802295685, "num_tokens": 59423867.0, "step": 30375 }, { "entropy": 6.004262495040893, "epoch": 3.036787124506423, "grad_norm": 1.203125, "learning_rate": 0.00040915002382989915, "loss": 5.4817, "mean_token_accuracy": 0.18756930083036422, "num_tokens": 59433594.0, "step": 30380 }, { "entropy": 5.971362447738647, "epoch": 3.037286949567651, "grad_norm": 1.1953125, "learning_rate": 0.000409121370240456, "loss": 5.4929, "mean_token_accuracy": 0.19448105245828629, "num_tokens": 59442411.0, "step": 30385 }, { "entropy": 5.940098619461059, "epoch": 3.03778677462888, "grad_norm": 1.0859375, "learning_rate": 0.0004090927132765537, "loss": 5.4234, "mean_token_accuracy": 0.1975530728697777, "num_tokens": 59451507.0, "step": 30390 }, { "entropy": 5.982679128646851, "epoch": 3.0382865996901085, "grad_norm": 1.140625, "learning_rate": 0.00040906405293891323, "loss": 5.4866, "mean_token_accuracy": 0.19379795491695403, "num_tokens": 59462497.0, "step": 30395 }, { "entropy": 5.997652292251587, "epoch": 3.038786424751337, "grad_norm": 1.1953125, "learning_rate": 0.0004090353892282557, "loss": 5.5341, "mean_token_accuracy": 0.1855769082903862, "num_tokens": 59472574.0, "step": 30400 }, { "entropy": 5.9626383781433105, "epoch": 3.0392862498125655, "grad_norm": 1.15625, "learning_rate": 0.0004090067221453024, "loss": 5.3453, "mean_token_accuracy": 0.1995700016617775, "num_tokens": 59482508.0, "step": 30405 }, { "entropy": 6.097778844833374, "epoch": 3.039786074873794, "grad_norm": 1.2265625, "learning_rate": 0.0004089780516907743, "loss": 5.6139, "mean_token_accuracy": 0.18135517984628677, "num_tokens": 59493032.0, "step": 30410 }, { "entropy": 6.029333972930909, "epoch": 3.040285899935023, "grad_norm": 1.1953125, "learning_rate": 0.00040894937786539287, "loss": 5.5499, "mean_token_accuracy": 0.1911746382713318, "num_tokens": 59502769.0, "step": 30415 }, { "entropy": 5.924650621414185, "epoch": 3.040785724996251, "grad_norm": 1.09375, "learning_rate": 0.00040892070066987966, "loss": 5.4616, "mean_token_accuracy": 0.18673219680786132, "num_tokens": 59512392.0, "step": 30420 }, { "entropy": 5.954359149932861, "epoch": 3.04128555005748, "grad_norm": 1.0625, "learning_rate": 0.00040889202010495595, "loss": 5.4373, "mean_token_accuracy": 0.1942717909812927, "num_tokens": 59521936.0, "step": 30425 }, { "entropy": 6.021448564529419, "epoch": 3.0417853751187085, "grad_norm": 1.078125, "learning_rate": 0.0004088633361713436, "loss": 5.5468, "mean_token_accuracy": 0.17846721708774566, "num_tokens": 59531460.0, "step": 30430 }, { "entropy": 6.007031536102295, "epoch": 3.042285200179937, "grad_norm": 1.1953125, "learning_rate": 0.00040883464886976414, "loss": 5.5451, "mean_token_accuracy": 0.1857913002371788, "num_tokens": 59541898.0, "step": 30435 }, { "entropy": 5.982570219039917, "epoch": 3.0427850252411655, "grad_norm": 1.0859375, "learning_rate": 0.0004088059582009393, "loss": 5.5602, "mean_token_accuracy": 0.18607865124940873, "num_tokens": 59552960.0, "step": 30440 }, { "entropy": 5.958920812606811, "epoch": 3.043284850302394, "grad_norm": 1.078125, "learning_rate": 0.000408777264165591, "loss": 5.4634, "mean_token_accuracy": 0.18935898691415787, "num_tokens": 59563655.0, "step": 30445 }, { "entropy": 5.989930725097656, "epoch": 3.043784675363623, "grad_norm": 1.140625, "learning_rate": 0.00040874856676444116, "loss": 5.459, "mean_token_accuracy": 0.20893779546022415, "num_tokens": 59573554.0, "step": 30450 }, { "entropy": 6.017723178863525, "epoch": 3.044284500424851, "grad_norm": 1.078125, "learning_rate": 0.00040871986599821177, "loss": 5.4614, "mean_token_accuracy": 0.19616154879331588, "num_tokens": 59582720.0, "step": 30455 }, { "entropy": 5.9622289657592775, "epoch": 3.04478432548608, "grad_norm": 1.3046875, "learning_rate": 0.0004086911618676251, "loss": 5.4631, "mean_token_accuracy": 0.194390606880188, "num_tokens": 59591589.0, "step": 30460 }, { "entropy": 6.064439535140991, "epoch": 3.0452841505473085, "grad_norm": 1.1171875, "learning_rate": 0.000408662454373403, "loss": 5.574, "mean_token_accuracy": 0.18266939967870713, "num_tokens": 59601575.0, "step": 30465 }, { "entropy": 5.954619312286377, "epoch": 3.045783975608537, "grad_norm": 1.2265625, "learning_rate": 0.000408633743516268, "loss": 5.4277, "mean_token_accuracy": 0.20069137513637542, "num_tokens": 59610842.0, "step": 30470 }, { "entropy": 6.064501237869263, "epoch": 3.0462838006697655, "grad_norm": 1.2109375, "learning_rate": 0.00040860502929694246, "loss": 5.6264, "mean_token_accuracy": 0.1847103714942932, "num_tokens": 59622054.0, "step": 30475 }, { "entropy": 6.035087156295776, "epoch": 3.046783625730994, "grad_norm": 1.1796875, "learning_rate": 0.00040857631171614873, "loss": 5.4542, "mean_token_accuracy": 0.20064682513475418, "num_tokens": 59631516.0, "step": 30480 }, { "entropy": 6.021350145339966, "epoch": 3.047283450792223, "grad_norm": 1.1171875, "learning_rate": 0.00040854759077460934, "loss": 5.4374, "mean_token_accuracy": 0.19266469180583953, "num_tokens": 59641999.0, "step": 30485 }, { "entropy": 5.950778341293335, "epoch": 3.047783275853451, "grad_norm": 1.046875, "learning_rate": 0.00040851886647304703, "loss": 5.4092, "mean_token_accuracy": 0.19618182480335236, "num_tokens": 59651107.0, "step": 30490 }, { "entropy": 5.992885589599609, "epoch": 3.04828310091468, "grad_norm": 1.3046875, "learning_rate": 0.0004084901388121843, "loss": 5.496, "mean_token_accuracy": 0.19318617433309554, "num_tokens": 59661075.0, "step": 30495 }, { "entropy": 5.8981458187103275, "epoch": 3.0487829259759085, "grad_norm": 1.140625, "learning_rate": 0.00040846140779274406, "loss": 5.3529, "mean_token_accuracy": 0.19944416880607604, "num_tokens": 59671449.0, "step": 30500 }, { "entropy": 6.044550848007202, "epoch": 3.049282751037137, "grad_norm": 1.234375, "learning_rate": 0.00040843267341544913, "loss": 5.5813, "mean_token_accuracy": 0.18360042870044707, "num_tokens": 59680824.0, "step": 30505 }, { "entropy": 6.046122407913208, "epoch": 3.0497825760983654, "grad_norm": 1.109375, "learning_rate": 0.00040840393568102246, "loss": 5.468, "mean_token_accuracy": 0.18739250004291536, "num_tokens": 59689293.0, "step": 30510 }, { "entropy": 5.977842712402344, "epoch": 3.050282401159594, "grad_norm": 1.109375, "learning_rate": 0.0004083751945901871, "loss": 5.5901, "mean_token_accuracy": 0.179594948887825, "num_tokens": 59698693.0, "step": 30515 }, { "entropy": 6.01931848526001, "epoch": 3.050782226220823, "grad_norm": 1.09375, "learning_rate": 0.00040834645014366623, "loss": 5.5176, "mean_token_accuracy": 0.17952830642461776, "num_tokens": 59709047.0, "step": 30520 }, { "entropy": 6.136570262908935, "epoch": 3.051282051282051, "grad_norm": 1.1015625, "learning_rate": 0.0004083177023421829, "loss": 5.52, "mean_token_accuracy": 0.18502768576145173, "num_tokens": 59719392.0, "step": 30525 }, { "entropy": 5.933347415924072, "epoch": 3.05178187634328, "grad_norm": 1.109375, "learning_rate": 0.0004082889511864606, "loss": 5.3611, "mean_token_accuracy": 0.1960995689034462, "num_tokens": 59728736.0, "step": 30530 }, { "entropy": 5.999807691574096, "epoch": 3.0522817014045085, "grad_norm": 1.09375, "learning_rate": 0.00040826019667722244, "loss": 5.5522, "mean_token_accuracy": 0.18433912098407745, "num_tokens": 59738816.0, "step": 30535 }, { "entropy": 6.018436241149902, "epoch": 3.052781526465737, "grad_norm": 1.1640625, "learning_rate": 0.0004082314388151921, "loss": 5.4638, "mean_token_accuracy": 0.1980438709259033, "num_tokens": 59747785.0, "step": 30540 }, { "entropy": 6.023428535461425, "epoch": 3.0532813515269654, "grad_norm": 1.15625, "learning_rate": 0.0004082026776010931, "loss": 5.4808, "mean_token_accuracy": 0.19526928812265396, "num_tokens": 59757429.0, "step": 30545 }, { "entropy": 6.057660007476807, "epoch": 3.053781176588194, "grad_norm": 1.125, "learning_rate": 0.0004081739130356489, "loss": 5.5287, "mean_token_accuracy": 0.18965768814086914, "num_tokens": 59767996.0, "step": 30550 }, { "entropy": 5.9598394393920895, "epoch": 3.054281001649423, "grad_norm": 1.1015625, "learning_rate": 0.00040814514511958335, "loss": 5.5211, "mean_token_accuracy": 0.19030696600675584, "num_tokens": 59778487.0, "step": 30555 }, { "entropy": 5.955559539794922, "epoch": 3.054780826710651, "grad_norm": 1.1953125, "learning_rate": 0.00040811637385362024, "loss": 5.4001, "mean_token_accuracy": 0.20734449625015258, "num_tokens": 59788929.0, "step": 30560 }, { "entropy": 6.01504921913147, "epoch": 3.05528065177188, "grad_norm": 1.296875, "learning_rate": 0.0004080875992384834, "loss": 5.5036, "mean_token_accuracy": 0.1927926242351532, "num_tokens": 59797548.0, "step": 30565 }, { "entropy": 6.033369874954223, "epoch": 3.0557804768331085, "grad_norm": 1.171875, "learning_rate": 0.0004080588212748968, "loss": 5.5214, "mean_token_accuracy": 0.19239838868379594, "num_tokens": 59807811.0, "step": 30570 }, { "entropy": 5.94784026145935, "epoch": 3.056280301894337, "grad_norm": 1.0390625, "learning_rate": 0.00040803003996358445, "loss": 5.3726, "mean_token_accuracy": 0.20236717462539672, "num_tokens": 59818118.0, "step": 30575 }, { "entropy": 5.970272874832153, "epoch": 3.0567801269555654, "grad_norm": 1.09375, "learning_rate": 0.00040800125530527064, "loss": 5.5108, "mean_token_accuracy": 0.1887582316994667, "num_tokens": 59827749.0, "step": 30580 }, { "entropy": 6.001681280136109, "epoch": 3.057279952016794, "grad_norm": 1.2421875, "learning_rate": 0.00040797246730067937, "loss": 5.4402, "mean_token_accuracy": 0.20499979555606843, "num_tokens": 59836519.0, "step": 30585 }, { "entropy": 5.9798869609832765, "epoch": 3.057779777078023, "grad_norm": 1.125, "learning_rate": 0.0004079436759505351, "loss": 5.4372, "mean_token_accuracy": 0.19689854085445405, "num_tokens": 59847201.0, "step": 30590 }, { "entropy": 5.973022317886352, "epoch": 3.058279602139251, "grad_norm": 1.2421875, "learning_rate": 0.0004079148812555621, "loss": 5.3963, "mean_token_accuracy": 0.2057907223701477, "num_tokens": 59855366.0, "step": 30595 }, { "entropy": 5.867964029312134, "epoch": 3.05877942720048, "grad_norm": 1.09375, "learning_rate": 0.00040788608321648496, "loss": 5.3577, "mean_token_accuracy": 0.20114185959100722, "num_tokens": 59864820.0, "step": 30600 }, { "entropy": 6.020285034179688, "epoch": 3.0592792522617085, "grad_norm": 1.0546875, "learning_rate": 0.0004078572818340281, "loss": 5.5184, "mean_token_accuracy": 0.19121836125850677, "num_tokens": 59875757.0, "step": 30605 }, { "entropy": 6.125909233093262, "epoch": 3.059779077322937, "grad_norm": 1.15625, "learning_rate": 0.00040782847710891623, "loss": 5.6321, "mean_token_accuracy": 0.18233714401721954, "num_tokens": 59885039.0, "step": 30610 }, { "entropy": 6.029363346099854, "epoch": 3.0602789023841654, "grad_norm": 1.203125, "learning_rate": 0.00040779966904187407, "loss": 5.5106, "mean_token_accuracy": 0.1825796663761139, "num_tokens": 59894516.0, "step": 30615 }, { "entropy": 6.053947782516479, "epoch": 3.060778727445394, "grad_norm": 1.1796875, "learning_rate": 0.00040777085763362634, "loss": 5.5736, "mean_token_accuracy": 0.18760325759649277, "num_tokens": 59905004.0, "step": 30620 }, { "entropy": 6.102583646774292, "epoch": 3.061278552506623, "grad_norm": 1.2109375, "learning_rate": 0.00040774204288489805, "loss": 5.573, "mean_token_accuracy": 0.18139005154371263, "num_tokens": 59914814.0, "step": 30625 }, { "entropy": 6.096563148498535, "epoch": 3.061778377567851, "grad_norm": 1.078125, "learning_rate": 0.0004077132247964142, "loss": 5.5627, "mean_token_accuracy": 0.18816659301519395, "num_tokens": 59924451.0, "step": 30630 }, { "entropy": 5.948845958709716, "epoch": 3.06227820262908, "grad_norm": 1.09375, "learning_rate": 0.00040768440336889965, "loss": 5.4651, "mean_token_accuracy": 0.19535193592309952, "num_tokens": 59934607.0, "step": 30635 }, { "entropy": 5.811318206787109, "epoch": 3.0627780276903085, "grad_norm": 1.203125, "learning_rate": 0.0004076555786030797, "loss": 5.3318, "mean_token_accuracy": 0.20427658557891845, "num_tokens": 59945172.0, "step": 30640 }, { "entropy": 6.068199682235718, "epoch": 3.063277852751537, "grad_norm": 1.1484375, "learning_rate": 0.0004076267504996795, "loss": 5.4443, "mean_token_accuracy": 0.19637513011693955, "num_tokens": 59955022.0, "step": 30645 }, { "entropy": 6.030975389480591, "epoch": 3.0637776778127654, "grad_norm": 1.1484375, "learning_rate": 0.0004075979190594244, "loss": 5.5128, "mean_token_accuracy": 0.1946458712220192, "num_tokens": 59965666.0, "step": 30650 }, { "entropy": 6.033237791061401, "epoch": 3.064277502873994, "grad_norm": 1.1796875, "learning_rate": 0.00040756908428303984, "loss": 5.4972, "mean_token_accuracy": 0.19392139613628387, "num_tokens": 59975069.0, "step": 30655 }, { "entropy": 6.0857728004455565, "epoch": 3.064777327935223, "grad_norm": 1.1640625, "learning_rate": 0.00040754024617125115, "loss": 5.5616, "mean_token_accuracy": 0.1910158321261406, "num_tokens": 59986100.0, "step": 30660 }, { "entropy": 5.9344337463378904, "epoch": 3.065277152996451, "grad_norm": 1.2421875, "learning_rate": 0.000407511404724784, "loss": 5.4466, "mean_token_accuracy": 0.19695445895195007, "num_tokens": 59995929.0, "step": 30665 }, { "entropy": 6.004751491546631, "epoch": 3.06577697805768, "grad_norm": 1.15625, "learning_rate": 0.000407482559944364, "loss": 5.5143, "mean_token_accuracy": 0.19022249579429626, "num_tokens": 60005526.0, "step": 30670 }, { "entropy": 5.964439249038696, "epoch": 3.0662768031189085, "grad_norm": 1.0546875, "learning_rate": 0.0004074537118307169, "loss": 5.3466, "mean_token_accuracy": 0.203788460791111, "num_tokens": 60014833.0, "step": 30675 }, { "entropy": 6.010521078109742, "epoch": 3.0667766281801367, "grad_norm": 1.0625, "learning_rate": 0.0004074248603845684, "loss": 5.5622, "mean_token_accuracy": 0.18321948647499084, "num_tokens": 60024579.0, "step": 30680 }, { "entropy": 6.025298547744751, "epoch": 3.0672764532413654, "grad_norm": 1.0703125, "learning_rate": 0.00040739600560664457, "loss": 5.5601, "mean_token_accuracy": 0.18332307040691376, "num_tokens": 60035162.0, "step": 30685 }, { "entropy": 6.019966554641724, "epoch": 3.067776278302594, "grad_norm": 1.203125, "learning_rate": 0.00040736714749767136, "loss": 5.4162, "mean_token_accuracy": 0.1951565131545067, "num_tokens": 60044894.0, "step": 30690 }, { "entropy": 6.0357190608978275, "epoch": 3.068276103363823, "grad_norm": 1.109375, "learning_rate": 0.0004073382860583747, "loss": 5.481, "mean_token_accuracy": 0.1934180125594139, "num_tokens": 60054441.0, "step": 30695 }, { "entropy": 6.029822874069214, "epoch": 3.068775928425051, "grad_norm": 1.09375, "learning_rate": 0.0004073094212894809, "loss": 5.5025, "mean_token_accuracy": 0.19655562490224837, "num_tokens": 60063701.0, "step": 30700 }, { "entropy": 6.011656761169434, "epoch": 3.06927575348628, "grad_norm": 1.1015625, "learning_rate": 0.000407280553191716, "loss": 5.5086, "mean_token_accuracy": 0.1797790825366974, "num_tokens": 60073455.0, "step": 30705 }, { "entropy": 5.948316287994385, "epoch": 3.0697755785475085, "grad_norm": 1.140625, "learning_rate": 0.0004072516817658065, "loss": 5.4489, "mean_token_accuracy": 0.19318412393331527, "num_tokens": 60083898.0, "step": 30710 }, { "entropy": 6.032275772094726, "epoch": 3.0702754036087367, "grad_norm": 1.265625, "learning_rate": 0.00040722280701247865, "loss": 5.5637, "mean_token_accuracy": 0.18973370641469955, "num_tokens": 60093605.0, "step": 30715 }, { "entropy": 6.146461057662964, "epoch": 3.0707752286699654, "grad_norm": 1.15625, "learning_rate": 0.00040719392893245903, "loss": 5.5892, "mean_token_accuracy": 0.18367933183908464, "num_tokens": 60103240.0, "step": 30720 }, { "entropy": 5.912042188644409, "epoch": 3.071275053731194, "grad_norm": 1.140625, "learning_rate": 0.0004071650475264742, "loss": 5.4145, "mean_token_accuracy": 0.1943598136305809, "num_tokens": 60112850.0, "step": 30725 }, { "entropy": 5.959503984451294, "epoch": 3.071774878792423, "grad_norm": 1.0859375, "learning_rate": 0.00040713616279525075, "loss": 5.4122, "mean_token_accuracy": 0.19782360047101974, "num_tokens": 60122565.0, "step": 30730 }, { "entropy": 6.04570198059082, "epoch": 3.072274703853651, "grad_norm": 1.25, "learning_rate": 0.00040710727473951546, "loss": 5.4444, "mean_token_accuracy": 0.18810687810182572, "num_tokens": 60132239.0, "step": 30735 }, { "entropy": 5.972931814193726, "epoch": 3.07277452891488, "grad_norm": 1.0546875, "learning_rate": 0.0004070783833599951, "loss": 5.4814, "mean_token_accuracy": 0.1892448455095291, "num_tokens": 60141993.0, "step": 30740 }, { "entropy": 5.980544900894165, "epoch": 3.0732743539761085, "grad_norm": 1.2265625, "learning_rate": 0.0004070494886574166, "loss": 5.5042, "mean_token_accuracy": 0.19280767887830735, "num_tokens": 60151350.0, "step": 30745 }, { "entropy": 6.022108268737793, "epoch": 3.0737741790373367, "grad_norm": 1.0859375, "learning_rate": 0.000407020590632507, "loss": 5.5055, "mean_token_accuracy": 0.18922441750764846, "num_tokens": 60161120.0, "step": 30750 }, { "entropy": 6.0213648796081545, "epoch": 3.0742740040985654, "grad_norm": 1.1484375, "learning_rate": 0.0004069916892859933, "loss": 5.5136, "mean_token_accuracy": 0.19891939014196397, "num_tokens": 60170762.0, "step": 30755 }, { "entropy": 5.9689947128295895, "epoch": 3.074773829159794, "grad_norm": 1.1171875, "learning_rate": 0.0004069627846186026, "loss": 5.4558, "mean_token_accuracy": 0.19468655437231064, "num_tokens": 60180729.0, "step": 30760 }, { "entropy": 5.9586786270141605, "epoch": 3.075273654221023, "grad_norm": 1.046875, "learning_rate": 0.00040693387663106223, "loss": 5.4478, "mean_token_accuracy": 0.1976270481944084, "num_tokens": 60190640.0, "step": 30765 }, { "entropy": 5.973170471191406, "epoch": 3.075773479282251, "grad_norm": 1.0859375, "learning_rate": 0.0004069049653240996, "loss": 5.4377, "mean_token_accuracy": 0.1922805055975914, "num_tokens": 60200163.0, "step": 30770 }, { "entropy": 6.070269536972046, "epoch": 3.07627330434348, "grad_norm": 1.1015625, "learning_rate": 0.0004068760506984418, "loss": 5.5422, "mean_token_accuracy": 0.1869718223810196, "num_tokens": 60209469.0, "step": 30775 }, { "entropy": 5.894810962677002, "epoch": 3.0767731294047085, "grad_norm": 1.15625, "learning_rate": 0.0004068471327548166, "loss": 5.3495, "mean_token_accuracy": 0.20090408474206925, "num_tokens": 60218950.0, "step": 30780 }, { "entropy": 6.029858207702636, "epoch": 3.0772729544659367, "grad_norm": 1.1953125, "learning_rate": 0.00040681821149395146, "loss": 5.4934, "mean_token_accuracy": 0.1886974185705185, "num_tokens": 60228428.0, "step": 30785 }, { "entropy": 5.978582906723022, "epoch": 3.0777727795271654, "grad_norm": 1.0703125, "learning_rate": 0.00040678928691657395, "loss": 5.4621, "mean_token_accuracy": 0.19608478397130966, "num_tokens": 60237558.0, "step": 30790 }, { "entropy": 5.967212200164795, "epoch": 3.078272604588394, "grad_norm": 1.2109375, "learning_rate": 0.00040676035902341195, "loss": 5.4156, "mean_token_accuracy": 0.19483400285243987, "num_tokens": 60246282.0, "step": 30795 }, { "entropy": 5.883442354202271, "epoch": 3.078772429649623, "grad_norm": 1.1484375, "learning_rate": 0.0004067314278151933, "loss": 5.2987, "mean_token_accuracy": 0.20551279336214065, "num_tokens": 60255678.0, "step": 30800 }, { "entropy": 5.914713573455811, "epoch": 3.079272254710851, "grad_norm": 1.140625, "learning_rate": 0.00040670249329264577, "loss": 5.3914, "mean_token_accuracy": 0.21275220811367035, "num_tokens": 60266900.0, "step": 30805 }, { "entropy": 6.075995397567749, "epoch": 3.07977207977208, "grad_norm": 1.1953125, "learning_rate": 0.0004066735554564973, "loss": 5.536, "mean_token_accuracy": 0.18987746983766557, "num_tokens": 60276974.0, "step": 30810 }, { "entropy": 6.125108146667481, "epoch": 3.0802719048333085, "grad_norm": 1.390625, "learning_rate": 0.0004066446143074762, "loss": 5.5668, "mean_token_accuracy": 0.18497112542390823, "num_tokens": 60285830.0, "step": 30815 }, { "entropy": 5.963441658020019, "epoch": 3.0807717298945367, "grad_norm": 1.140625, "learning_rate": 0.0004066156698463104, "loss": 5.4073, "mean_token_accuracy": 0.19244676530361177, "num_tokens": 60295178.0, "step": 30820 }, { "entropy": 5.967557001113891, "epoch": 3.0812715549557654, "grad_norm": 1.0546875, "learning_rate": 0.0004065867220737282, "loss": 5.4826, "mean_token_accuracy": 0.19200898408889772, "num_tokens": 60305514.0, "step": 30825 }, { "entropy": 5.890975570678711, "epoch": 3.081771380016994, "grad_norm": 1.171875, "learning_rate": 0.00040655777099045794, "loss": 5.3848, "mean_token_accuracy": 0.19554249495267867, "num_tokens": 60314407.0, "step": 30830 }, { "entropy": 5.957977819442749, "epoch": 3.082271205078223, "grad_norm": 1.125, "learning_rate": 0.0004065288165972281, "loss": 5.3596, "mean_token_accuracy": 0.20213798880577089, "num_tokens": 60322711.0, "step": 30835 }, { "entropy": 5.995135402679443, "epoch": 3.082771030139451, "grad_norm": 1.109375, "learning_rate": 0.000406499858894767, "loss": 5.563, "mean_token_accuracy": 0.1891617640852928, "num_tokens": 60332718.0, "step": 30840 }, { "entropy": 5.938999271392822, "epoch": 3.08327085520068, "grad_norm": 1.0859375, "learning_rate": 0.0004064708978838033, "loss": 5.4149, "mean_token_accuracy": 0.1949584126472473, "num_tokens": 60343513.0, "step": 30845 }, { "entropy": 5.949363279342651, "epoch": 3.0837706802619085, "grad_norm": 1.0390625, "learning_rate": 0.00040644193356506565, "loss": 5.3922, "mean_token_accuracy": 0.19715723693370818, "num_tokens": 60353374.0, "step": 30850 }, { "entropy": 6.011474609375, "epoch": 3.0842705053231367, "grad_norm": 1.0625, "learning_rate": 0.0004064129659392828, "loss": 5.4643, "mean_token_accuracy": 0.1954444393515587, "num_tokens": 60364303.0, "step": 30855 }, { "entropy": 5.969551992416382, "epoch": 3.0847703303843654, "grad_norm": 1.1015625, "learning_rate": 0.0004063839950071835, "loss": 5.366, "mean_token_accuracy": 0.19368677735328674, "num_tokens": 60374282.0, "step": 30860 }, { "entropy": 6.036526346206665, "epoch": 3.085270155445594, "grad_norm": 1.1171875, "learning_rate": 0.00040635502076949665, "loss": 5.5393, "mean_token_accuracy": 0.1832280859351158, "num_tokens": 60384711.0, "step": 30865 }, { "entropy": 5.972257280349732, "epoch": 3.0857699805068224, "grad_norm": 1.09375, "learning_rate": 0.00040632604322695135, "loss": 5.5287, "mean_token_accuracy": 0.18705183416604995, "num_tokens": 60394681.0, "step": 30870 }, { "entropy": 5.972606420516968, "epoch": 3.086269805568051, "grad_norm": 1.25, "learning_rate": 0.0004062970623802766, "loss": 5.4716, "mean_token_accuracy": 0.18866738379001619, "num_tokens": 60404226.0, "step": 30875 }, { "entropy": 6.017214632034301, "epoch": 3.08676963062928, "grad_norm": 1.0390625, "learning_rate": 0.0004062680782302015, "loss": 5.4885, "mean_token_accuracy": 0.1954237103462219, "num_tokens": 60413657.0, "step": 30880 }, { "entropy": 6.004489183425903, "epoch": 3.0872694556905085, "grad_norm": 1.1953125, "learning_rate": 0.00040623909077745535, "loss": 5.4188, "mean_token_accuracy": 0.18996618390083314, "num_tokens": 60423574.0, "step": 30885 }, { "entropy": 5.964860677719116, "epoch": 3.0877692807517367, "grad_norm": 1.109375, "learning_rate": 0.0004062101000227674, "loss": 5.4286, "mean_token_accuracy": 0.19782689958810806, "num_tokens": 60433349.0, "step": 30890 }, { "entropy": 5.973463678359986, "epoch": 3.0882691058129654, "grad_norm": 1.1484375, "learning_rate": 0.0004061811059668672, "loss": 5.557, "mean_token_accuracy": 0.18203110992908478, "num_tokens": 60442435.0, "step": 30895 }, { "entropy": 5.969042634963989, "epoch": 3.088768930874194, "grad_norm": 1.140625, "learning_rate": 0.0004061521086104841, "loss": 5.4286, "mean_token_accuracy": 0.19608967304229735, "num_tokens": 60451386.0, "step": 30900 }, { "entropy": 6.001058721542359, "epoch": 3.0892687559354224, "grad_norm": 1.15625, "learning_rate": 0.00040612310795434765, "loss": 5.4493, "mean_token_accuracy": 0.18629872798919678, "num_tokens": 60460780.0, "step": 30905 }, { "entropy": 6.006352949142456, "epoch": 3.089768580996651, "grad_norm": 1.2109375, "learning_rate": 0.00040609410399918754, "loss": 5.5103, "mean_token_accuracy": 0.18906446993350984, "num_tokens": 60470563.0, "step": 30910 }, { "entropy": 5.957207345962525, "epoch": 3.09026840605788, "grad_norm": 1.125, "learning_rate": 0.00040606509674573354, "loss": 5.4257, "mean_token_accuracy": 0.20174840092658997, "num_tokens": 60481170.0, "step": 30915 }, { "entropy": 6.104734086990357, "epoch": 3.0907682311191085, "grad_norm": 1.1484375, "learning_rate": 0.0004060360861947155, "loss": 5.5677, "mean_token_accuracy": 0.18357649594545364, "num_tokens": 60490700.0, "step": 30920 }, { "entropy": 6.004500675201416, "epoch": 3.0912680561803367, "grad_norm": 1.03125, "learning_rate": 0.00040600707234686315, "loss": 5.4325, "mean_token_accuracy": 0.19631525725126267, "num_tokens": 60500262.0, "step": 30925 }, { "entropy": 5.980014896392822, "epoch": 3.0917678812415654, "grad_norm": 1.1484375, "learning_rate": 0.00040597805520290657, "loss": 5.555, "mean_token_accuracy": 0.18620217591524124, "num_tokens": 60510453.0, "step": 30930 }, { "entropy": 6.069574022293091, "epoch": 3.092267706302794, "grad_norm": 1.25, "learning_rate": 0.0004059490347635759, "loss": 5.4763, "mean_token_accuracy": 0.1913177490234375, "num_tokens": 60520069.0, "step": 30935 }, { "entropy": 6.022724771499634, "epoch": 3.0927675313640224, "grad_norm": 1.1015625, "learning_rate": 0.00040592001102960116, "loss": 5.5336, "mean_token_accuracy": 0.1911913424730301, "num_tokens": 60530193.0, "step": 30940 }, { "entropy": 6.015159940719604, "epoch": 3.093267356425251, "grad_norm": 1.1015625, "learning_rate": 0.0004058909840017126, "loss": 5.5218, "mean_token_accuracy": 0.19492380917072297, "num_tokens": 60539768.0, "step": 30945 }, { "entropy": 5.9368555545806885, "epoch": 3.09376718148648, "grad_norm": 1.125, "learning_rate": 0.0004058619536806407, "loss": 5.4631, "mean_token_accuracy": 0.19210435897111894, "num_tokens": 60549488.0, "step": 30950 }, { "entropy": 5.984806251525879, "epoch": 3.0942670065477085, "grad_norm": 1.171875, "learning_rate": 0.0004058329200671155, "loss": 5.4981, "mean_token_accuracy": 0.19363281577825547, "num_tokens": 60559611.0, "step": 30955 }, { "entropy": 6.008777236938476, "epoch": 3.0947668316089367, "grad_norm": 1.0625, "learning_rate": 0.00040580388316186785, "loss": 5.468, "mean_token_accuracy": 0.19958247244358063, "num_tokens": 60569091.0, "step": 30960 }, { "entropy": 6.055223560333252, "epoch": 3.0952666566701654, "grad_norm": 1.125, "learning_rate": 0.0004057748429656281, "loss": 5.644, "mean_token_accuracy": 0.18091422617435454, "num_tokens": 60581173.0, "step": 30965 }, { "entropy": 5.9480588912963865, "epoch": 3.095766481731394, "grad_norm": 1.203125, "learning_rate": 0.000405745799479127, "loss": 5.3708, "mean_token_accuracy": 0.2008643075823784, "num_tokens": 60590677.0, "step": 30970 }, { "entropy": 6.117230415344238, "epoch": 3.0962663067926224, "grad_norm": 1.1953125, "learning_rate": 0.0004057167527030952, "loss": 5.5769, "mean_token_accuracy": 0.1839364007115364, "num_tokens": 60599861.0, "step": 30975 }, { "entropy": 6.015076780319214, "epoch": 3.096766131853851, "grad_norm": 1.0859375, "learning_rate": 0.00040568770263826355, "loss": 5.5353, "mean_token_accuracy": 0.18713659793138504, "num_tokens": 60609061.0, "step": 30980 }, { "entropy": 5.9668725490570065, "epoch": 3.0972659569150798, "grad_norm": 1.125, "learning_rate": 0.0004056586492853629, "loss": 5.4755, "mean_token_accuracy": 0.19587499499320984, "num_tokens": 60618935.0, "step": 30985 }, { "entropy": 6.065490245819092, "epoch": 3.0977657819763085, "grad_norm": 1.1953125, "learning_rate": 0.0004056295926451243, "loss": 5.4778, "mean_token_accuracy": 0.20377503335475922, "num_tokens": 60628549.0, "step": 30990 }, { "entropy": 5.961002397537231, "epoch": 3.0982656070375367, "grad_norm": 1.109375, "learning_rate": 0.00040560053271827866, "loss": 5.4355, "mean_token_accuracy": 0.19493339508771895, "num_tokens": 60638253.0, "step": 30995 }, { "entropy": 5.982589483261108, "epoch": 3.0987654320987654, "grad_norm": 1.125, "learning_rate": 0.00040557146950555734, "loss": 5.4451, "mean_token_accuracy": 0.1984004110097885, "num_tokens": 60647575.0, "step": 31000 }, { "entropy": 5.95160870552063, "epoch": 3.099265257159994, "grad_norm": 1.1328125, "learning_rate": 0.0004055424030076914, "loss": 5.4878, "mean_token_accuracy": 0.18906869888305664, "num_tokens": 60658020.0, "step": 31005 }, { "entropy": 5.967223405838013, "epoch": 3.0997650822212224, "grad_norm": 1.1796875, "learning_rate": 0.00040551333322541225, "loss": 5.4042, "mean_token_accuracy": 0.19389633536338807, "num_tokens": 60668330.0, "step": 31010 }, { "entropy": 6.007176256179809, "epoch": 3.100264907282451, "grad_norm": 1.0703125, "learning_rate": 0.0004054842601594512, "loss": 5.5125, "mean_token_accuracy": 0.19099824130535126, "num_tokens": 60679573.0, "step": 31015 }, { "entropy": 5.967203760147095, "epoch": 3.1007647323436798, "grad_norm": 1.03125, "learning_rate": 0.00040545518381053964, "loss": 5.3875, "mean_token_accuracy": 0.2010224238038063, "num_tokens": 60689363.0, "step": 31020 }, { "entropy": 5.906686782836914, "epoch": 3.1012645574049085, "grad_norm": 1.171875, "learning_rate": 0.00040542610417940926, "loss": 5.4195, "mean_token_accuracy": 0.19787361472845078, "num_tokens": 60699120.0, "step": 31025 }, { "entropy": 5.985939645767212, "epoch": 3.1017643824661367, "grad_norm": 1.0390625, "learning_rate": 0.0004053970212667917, "loss": 5.5094, "mean_token_accuracy": 0.19330466091632842, "num_tokens": 60709235.0, "step": 31030 }, { "entropy": 5.991764211654663, "epoch": 3.1022642075273654, "grad_norm": 1.109375, "learning_rate": 0.0004053679350734186, "loss": 5.4217, "mean_token_accuracy": 0.1949220657348633, "num_tokens": 60718674.0, "step": 31035 }, { "entropy": 5.939059495925903, "epoch": 3.102764032588594, "grad_norm": 1.1640625, "learning_rate": 0.00040533884560002196, "loss": 5.3634, "mean_token_accuracy": 0.2028452515602112, "num_tokens": 60727456.0, "step": 31040 }, { "entropy": 5.901403188705444, "epoch": 3.1032638576498224, "grad_norm": 1.1875, "learning_rate": 0.00040530975284733327, "loss": 5.3485, "mean_token_accuracy": 0.19595887660980224, "num_tokens": 60736556.0, "step": 31045 }, { "entropy": 6.021659088134766, "epoch": 3.103763682711051, "grad_norm": 1.1875, "learning_rate": 0.0004052806568160849, "loss": 5.468, "mean_token_accuracy": 0.18901082277297973, "num_tokens": 60746868.0, "step": 31050 }, { "entropy": 6.058588266372681, "epoch": 3.1042635077722798, "grad_norm": 1.1484375, "learning_rate": 0.00040525155750700863, "loss": 5.5721, "mean_token_accuracy": 0.18371787816286086, "num_tokens": 60757200.0, "step": 31055 }, { "entropy": 5.963805198669434, "epoch": 3.1047633328335085, "grad_norm": 1.0546875, "learning_rate": 0.00040522245492083674, "loss": 5.4259, "mean_token_accuracy": 0.1992632657289505, "num_tokens": 60767966.0, "step": 31060 }, { "entropy": 5.949222087860107, "epoch": 3.1052631578947367, "grad_norm": 1.0625, "learning_rate": 0.00040519334905830134, "loss": 5.4115, "mean_token_accuracy": 0.19230178147554397, "num_tokens": 60777556.0, "step": 31065 }, { "entropy": 5.975813722610473, "epoch": 3.1057629829559654, "grad_norm": 1.1484375, "learning_rate": 0.0004051642399201349, "loss": 5.4315, "mean_token_accuracy": 0.20370898991823197, "num_tokens": 60787601.0, "step": 31070 }, { "entropy": 5.950928497314453, "epoch": 3.106262808017194, "grad_norm": 1.125, "learning_rate": 0.00040513512750706956, "loss": 5.4471, "mean_token_accuracy": 0.19431656897068023, "num_tokens": 60797023.0, "step": 31075 }, { "entropy": 6.054173755645752, "epoch": 3.1067626330784224, "grad_norm": 1.09375, "learning_rate": 0.000405106011819838, "loss": 5.5104, "mean_token_accuracy": 0.18883266150951386, "num_tokens": 60807030.0, "step": 31080 }, { "entropy": 5.963209342956543, "epoch": 3.107262458139651, "grad_norm": 1.109375, "learning_rate": 0.00040507689285917254, "loss": 5.452, "mean_token_accuracy": 0.1903813973069191, "num_tokens": 60816397.0, "step": 31085 }, { "entropy": 6.027845287322998, "epoch": 3.1077622832008798, "grad_norm": 1.109375, "learning_rate": 0.00040504777062580597, "loss": 5.5196, "mean_token_accuracy": 0.18293308168649675, "num_tokens": 60826859.0, "step": 31090 }, { "entropy": 5.874378776550293, "epoch": 3.1082621082621085, "grad_norm": 1.09375, "learning_rate": 0.000405018645120471, "loss": 5.3385, "mean_token_accuracy": 0.20255100429058076, "num_tokens": 60837010.0, "step": 31095 }, { "entropy": 5.9676813125610355, "epoch": 3.1087619333233367, "grad_norm": 1.1640625, "learning_rate": 0.0004049895163439003, "loss": 5.4756, "mean_token_accuracy": 0.18521452993154525, "num_tokens": 60845502.0, "step": 31100 }, { "entropy": 5.943050670623779, "epoch": 3.1092617583845654, "grad_norm": 1.0390625, "learning_rate": 0.00040496038429682684, "loss": 5.4539, "mean_token_accuracy": 0.19593143314123154, "num_tokens": 60856783.0, "step": 31105 }, { "entropy": 5.963225507736206, "epoch": 3.109761583445794, "grad_norm": 1.1328125, "learning_rate": 0.00040493124897998363, "loss": 5.4649, "mean_token_accuracy": 0.19092865735292436, "num_tokens": 60866560.0, "step": 31110 }, { "entropy": 5.9622515678405765, "epoch": 3.1102614085070224, "grad_norm": 1.1328125, "learning_rate": 0.0004049021103941036, "loss": 5.4841, "mean_token_accuracy": 0.19011935442686081, "num_tokens": 60876677.0, "step": 31115 }, { "entropy": 6.006877803802491, "epoch": 3.110761233568251, "grad_norm": 1.1796875, "learning_rate": 0.00040487296853991984, "loss": 5.5008, "mean_token_accuracy": 0.18963577449321747, "num_tokens": 60886943.0, "step": 31120 }, { "entropy": 6.08043532371521, "epoch": 3.1112610586294798, "grad_norm": 1.109375, "learning_rate": 0.0004048438234181657, "loss": 5.5043, "mean_token_accuracy": 0.1905519962310791, "num_tokens": 60895740.0, "step": 31125 }, { "entropy": 5.960463285446167, "epoch": 3.1117608836907085, "grad_norm": 1.21875, "learning_rate": 0.00040481467502957426, "loss": 5.4009, "mean_token_accuracy": 0.198969104886055, "num_tokens": 60905354.0, "step": 31130 }, { "entropy": 6.0036561489105225, "epoch": 3.1122607087519367, "grad_norm": 0.98828125, "learning_rate": 0.000404785523374879, "loss": 5.4725, "mean_token_accuracy": 0.19711743742227555, "num_tokens": 60915040.0, "step": 31135 }, { "entropy": 5.976144647598266, "epoch": 3.1127605338131654, "grad_norm": 1.1484375, "learning_rate": 0.00040475636845481347, "loss": 5.5127, "mean_token_accuracy": 0.18820121884346008, "num_tokens": 60925023.0, "step": 31140 }, { "entropy": 6.012701511383057, "epoch": 3.113260358874394, "grad_norm": 1.125, "learning_rate": 0.00040472721027011107, "loss": 5.4914, "mean_token_accuracy": 0.18952536582946777, "num_tokens": 60935058.0, "step": 31145 }, { "entropy": 5.996023750305175, "epoch": 3.1137601839356224, "grad_norm": 1.109375, "learning_rate": 0.0004046980488215054, "loss": 5.4731, "mean_token_accuracy": 0.1979200705885887, "num_tokens": 60945241.0, "step": 31150 }, { "entropy": 5.995792818069458, "epoch": 3.114260008996851, "grad_norm": 1.0234375, "learning_rate": 0.00040466888410973026, "loss": 5.5094, "mean_token_accuracy": 0.19191270619630812, "num_tokens": 60955402.0, "step": 31155 }, { "entropy": 6.001737022399903, "epoch": 3.1147598340580798, "grad_norm": 1.1328125, "learning_rate": 0.0004046397161355193, "loss": 5.4594, "mean_token_accuracy": 0.19466737359762193, "num_tokens": 60964837.0, "step": 31160 }, { "entropy": 6.014556121826172, "epoch": 3.1152596591193085, "grad_norm": 1.15625, "learning_rate": 0.0004046105448996064, "loss": 5.5842, "mean_token_accuracy": 0.18034202456474305, "num_tokens": 60975441.0, "step": 31165 }, { "entropy": 5.997760581970215, "epoch": 3.1157594841805367, "grad_norm": 1.078125, "learning_rate": 0.0004045813704027257, "loss": 5.543, "mean_token_accuracy": 0.19279961735010148, "num_tokens": 60985883.0, "step": 31170 }, { "entropy": 5.9966123580932615, "epoch": 3.1162593092417654, "grad_norm": 1.1484375, "learning_rate": 0.0004045521926456109, "loss": 5.4583, "mean_token_accuracy": 0.19740626215934753, "num_tokens": 60996545.0, "step": 31175 }, { "entropy": 5.949262952804565, "epoch": 3.116759134302994, "grad_norm": 1.1015625, "learning_rate": 0.0004045230116289964, "loss": 5.4499, "mean_token_accuracy": 0.19802429974079133, "num_tokens": 61006805.0, "step": 31180 }, { "entropy": 6.005507755279541, "epoch": 3.1172589593642224, "grad_norm": 1.1171875, "learning_rate": 0.00040449382735361614, "loss": 5.5136, "mean_token_accuracy": 0.18675364255905152, "num_tokens": 61017579.0, "step": 31185 }, { "entropy": 6.005194282531738, "epoch": 3.117758784425451, "grad_norm": 1.125, "learning_rate": 0.0004044646398202046, "loss": 5.484, "mean_token_accuracy": 0.19588165134191513, "num_tokens": 61027939.0, "step": 31190 }, { "entropy": 6.026525688171387, "epoch": 3.1182586094866798, "grad_norm": 1.1171875, "learning_rate": 0.000404435449029496, "loss": 5.4416, "mean_token_accuracy": 0.1963612988591194, "num_tokens": 61038445.0, "step": 31195 }, { "entropy": 6.008419466018677, "epoch": 3.118758434547908, "grad_norm": 1.203125, "learning_rate": 0.0004044062549822248, "loss": 5.5243, "mean_token_accuracy": 0.18976651281118392, "num_tokens": 61049434.0, "step": 31200 }, { "entropy": 6.017463207244873, "epoch": 3.1192582596091367, "grad_norm": 1.171875, "learning_rate": 0.0004043770576791255, "loss": 5.5225, "mean_token_accuracy": 0.1880732610821724, "num_tokens": 61058405.0, "step": 31205 }, { "entropy": 5.977043867111206, "epoch": 3.1197580846703654, "grad_norm": 1.234375, "learning_rate": 0.0004043478571209328, "loss": 5.4484, "mean_token_accuracy": 0.1959860146045685, "num_tokens": 61068639.0, "step": 31210 }, { "entropy": 5.9850122928619385, "epoch": 3.120257909731594, "grad_norm": 1.171875, "learning_rate": 0.0004043186533083812, "loss": 5.4553, "mean_token_accuracy": 0.20035867094993592, "num_tokens": 61078336.0, "step": 31215 }, { "entropy": 6.025325918197632, "epoch": 3.1207577347928224, "grad_norm": 1.1328125, "learning_rate": 0.00040428944624220557, "loss": 5.5029, "mean_token_accuracy": 0.19290732592344284, "num_tokens": 61087940.0, "step": 31220 }, { "entropy": 5.995983695983886, "epoch": 3.121257559854051, "grad_norm": 1.0078125, "learning_rate": 0.0004042602359231409, "loss": 5.4865, "mean_token_accuracy": 0.18704578429460525, "num_tokens": 61098688.0, "step": 31225 }, { "entropy": 5.97469801902771, "epoch": 3.1217573849152798, "grad_norm": 1.078125, "learning_rate": 0.0004042310223519218, "loss": 5.4407, "mean_token_accuracy": 0.198845773935318, "num_tokens": 61108066.0, "step": 31230 }, { "entropy": 5.925361967086792, "epoch": 3.122257209976508, "grad_norm": 1.171875, "learning_rate": 0.0004042018055292835, "loss": 5.3946, "mean_token_accuracy": 0.20092176049947738, "num_tokens": 61117009.0, "step": 31235 }, { "entropy": 6.042518091201782, "epoch": 3.1227570350377367, "grad_norm": 1.2109375, "learning_rate": 0.0004041725854559609, "loss": 5.5018, "mean_token_accuracy": 0.1959958165884018, "num_tokens": 61127285.0, "step": 31240 }, { "entropy": 5.990555238723755, "epoch": 3.1232568600989654, "grad_norm": 1.1328125, "learning_rate": 0.00040414336213268943, "loss": 5.4433, "mean_token_accuracy": 0.1966252699494362, "num_tokens": 61136894.0, "step": 31245 }, { "entropy": 6.072669792175293, "epoch": 3.123756685160194, "grad_norm": 1.0859375, "learning_rate": 0.0004041141355602041, "loss": 5.6275, "mean_token_accuracy": 0.18639821857213973, "num_tokens": 61147308.0, "step": 31250 }, { "entropy": 6.007371807098389, "epoch": 3.1242565102214224, "grad_norm": 1.1171875, "learning_rate": 0.0004040849057392405, "loss": 5.4491, "mean_token_accuracy": 0.18802175521850586, "num_tokens": 61157021.0, "step": 31255 }, { "entropy": 6.072435188293457, "epoch": 3.124756335282651, "grad_norm": 1.1328125, "learning_rate": 0.0004040556726705337, "loss": 5.5484, "mean_token_accuracy": 0.19272898882627487, "num_tokens": 61166741.0, "step": 31260 }, { "entropy": 5.995324182510376, "epoch": 3.1252561603438798, "grad_norm": 1.0703125, "learning_rate": 0.0004040264363548195, "loss": 5.3547, "mean_token_accuracy": 0.19878922402858734, "num_tokens": 61175951.0, "step": 31265 }, { "entropy": 5.972700023651123, "epoch": 3.125755985405108, "grad_norm": 1.1171875, "learning_rate": 0.0004039971967928333, "loss": 5.4639, "mean_token_accuracy": 0.1947838097810745, "num_tokens": 61185950.0, "step": 31270 }, { "entropy": 5.896227073669434, "epoch": 3.1262558104663367, "grad_norm": 1.1171875, "learning_rate": 0.0004039679539853108, "loss": 5.3405, "mean_token_accuracy": 0.20707086026668547, "num_tokens": 61195305.0, "step": 31275 }, { "entropy": 5.943407201766968, "epoch": 3.1267556355275654, "grad_norm": 1.0625, "learning_rate": 0.0004039387079329878, "loss": 5.4938, "mean_token_accuracy": 0.19513427466154099, "num_tokens": 61204640.0, "step": 31280 }, { "entropy": 5.928497457504273, "epoch": 3.127255460588794, "grad_norm": 1.0078125, "learning_rate": 0.0004039094586366001, "loss": 5.3896, "mean_token_accuracy": 0.203026182949543, "num_tokens": 61214644.0, "step": 31285 }, { "entropy": 5.98371000289917, "epoch": 3.1277552856500224, "grad_norm": 1.078125, "learning_rate": 0.00040388020609688366, "loss": 5.399, "mean_token_accuracy": 0.2034771904349327, "num_tokens": 61223970.0, "step": 31290 }, { "entropy": 5.961815261840821, "epoch": 3.128255110711251, "grad_norm": 1.1328125, "learning_rate": 0.00040385095031457435, "loss": 5.5143, "mean_token_accuracy": 0.19046448022127152, "num_tokens": 61233503.0, "step": 31295 }, { "entropy": 5.976302528381348, "epoch": 3.1287549357724798, "grad_norm": 1.0859375, "learning_rate": 0.0004038216912904082, "loss": 5.3673, "mean_token_accuracy": 0.1967140644788742, "num_tokens": 61243342.0, "step": 31300 }, { "entropy": 5.833013343811035, "epoch": 3.129254760833708, "grad_norm": 1.0078125, "learning_rate": 0.0004037924290251215, "loss": 5.3043, "mean_token_accuracy": 0.20247678458690643, "num_tokens": 61253456.0, "step": 31305 }, { "entropy": 5.9864119529724125, "epoch": 3.1297545858949367, "grad_norm": 1.1484375, "learning_rate": 0.0004037631635194505, "loss": 5.4994, "mean_token_accuracy": 0.19144104421138763, "num_tokens": 61262604.0, "step": 31310 }, { "entropy": 6.002148675918579, "epoch": 3.1302544109561654, "grad_norm": 1.390625, "learning_rate": 0.0004037338947741313, "loss": 5.3406, "mean_token_accuracy": 0.20016105622053146, "num_tokens": 61272127.0, "step": 31315 }, { "entropy": 5.974411201477051, "epoch": 3.130754236017394, "grad_norm": 1.0625, "learning_rate": 0.00040370462278990055, "loss": 5.5033, "mean_token_accuracy": 0.18566085696220397, "num_tokens": 61280808.0, "step": 31320 }, { "entropy": 5.968501091003418, "epoch": 3.1312540610786224, "grad_norm": 1.28125, "learning_rate": 0.0004036753475674945, "loss": 5.5371, "mean_token_accuracy": 0.19026852399110794, "num_tokens": 61290047.0, "step": 31325 }, { "entropy": 6.098319864273071, "epoch": 3.131753886139851, "grad_norm": 1.1796875, "learning_rate": 0.00040364606910764996, "loss": 5.5739, "mean_token_accuracy": 0.1881429597735405, "num_tokens": 61300140.0, "step": 31330 }, { "entropy": 6.1101240634918215, "epoch": 3.1322537112010798, "grad_norm": 1.140625, "learning_rate": 0.0004036167874111034, "loss": 5.6217, "mean_token_accuracy": 0.1777956172823906, "num_tokens": 61310790.0, "step": 31335 }, { "entropy": 6.079577875137329, "epoch": 3.132753536262308, "grad_norm": 1.125, "learning_rate": 0.00040358750247859146, "loss": 5.5199, "mean_token_accuracy": 0.19071124643087387, "num_tokens": 61320835.0, "step": 31340 }, { "entropy": 5.96912899017334, "epoch": 3.1332533613235367, "grad_norm": 1.15625, "learning_rate": 0.0004035582143108511, "loss": 5.3966, "mean_token_accuracy": 0.20028960704803467, "num_tokens": 61330585.0, "step": 31345 }, { "entropy": 5.8844043731689455, "epoch": 3.1337531863847654, "grad_norm": 1.1015625, "learning_rate": 0.00040352892290861916, "loss": 5.3886, "mean_token_accuracy": 0.21352204978466033, "num_tokens": 61341089.0, "step": 31350 }, { "entropy": 5.916169595718384, "epoch": 3.134253011445994, "grad_norm": 1.1640625, "learning_rate": 0.0004034996282726326, "loss": 5.4338, "mean_token_accuracy": 0.19236407727003096, "num_tokens": 61349796.0, "step": 31355 }, { "entropy": 6.043759202957153, "epoch": 3.1347528365072224, "grad_norm": 1.1640625, "learning_rate": 0.00040347033040362835, "loss": 5.5337, "mean_token_accuracy": 0.19310266077518462, "num_tokens": 61359345.0, "step": 31360 }, { "entropy": 6.068906641006469, "epoch": 3.135252661568451, "grad_norm": 1.1171875, "learning_rate": 0.00040344102930234385, "loss": 5.5118, "mean_token_accuracy": 0.18501905351877213, "num_tokens": 61369462.0, "step": 31365 }, { "entropy": 5.9947288036346436, "epoch": 3.1357524866296798, "grad_norm": 1.21875, "learning_rate": 0.00040341172496951596, "loss": 5.438, "mean_token_accuracy": 0.19270329773426056, "num_tokens": 61378170.0, "step": 31370 }, { "entropy": 5.943666887283325, "epoch": 3.136252311690908, "grad_norm": 1.0859375, "learning_rate": 0.0004033824174058821, "loss": 5.5065, "mean_token_accuracy": 0.1973063349723816, "num_tokens": 61388307.0, "step": 31375 }, { "entropy": 5.957320213317871, "epoch": 3.1367521367521367, "grad_norm": 1.1328125, "learning_rate": 0.0004033531066121797, "loss": 5.4326, "mean_token_accuracy": 0.19526997208595276, "num_tokens": 61398351.0, "step": 31380 }, { "entropy": 5.959526872634887, "epoch": 3.1372519618133654, "grad_norm": 1.140625, "learning_rate": 0.00040332379258914614, "loss": 5.4336, "mean_token_accuracy": 0.19409244060516356, "num_tokens": 61406893.0, "step": 31385 }, { "entropy": 6.0558812618255615, "epoch": 3.1377517868745937, "grad_norm": 1.1484375, "learning_rate": 0.000403294475337519, "loss": 5.5626, "mean_token_accuracy": 0.1920332431793213, "num_tokens": 61416655.0, "step": 31390 }, { "entropy": 5.941634702682495, "epoch": 3.1382516119358224, "grad_norm": 1.1015625, "learning_rate": 0.0004032651548580359, "loss": 5.4064, "mean_token_accuracy": 0.19905501902103423, "num_tokens": 61425655.0, "step": 31395 }, { "entropy": 5.927916145324707, "epoch": 3.138751436997051, "grad_norm": 1.1640625, "learning_rate": 0.00040323583115143446, "loss": 5.3731, "mean_token_accuracy": 0.2067493885755539, "num_tokens": 61435820.0, "step": 31400 }, { "entropy": 5.996844720840454, "epoch": 3.1392512620582798, "grad_norm": 1.1171875, "learning_rate": 0.00040320650421845256, "loss": 5.4607, "mean_token_accuracy": 0.20048202723264694, "num_tokens": 61445906.0, "step": 31405 }, { "entropy": 5.980939865112305, "epoch": 3.139751087119508, "grad_norm": 1.109375, "learning_rate": 0.00040317717405982797, "loss": 5.4093, "mean_token_accuracy": 0.1948748603463173, "num_tokens": 61455237.0, "step": 31410 }, { "entropy": 6.037376546859742, "epoch": 3.1402509121807367, "grad_norm": 1.1875, "learning_rate": 0.00040314784067629867, "loss": 5.5243, "mean_token_accuracy": 0.18970895260572435, "num_tokens": 61464735.0, "step": 31415 }, { "entropy": 6.022462558746338, "epoch": 3.1407507372419654, "grad_norm": 1.140625, "learning_rate": 0.00040311850406860267, "loss": 5.4921, "mean_token_accuracy": 0.1899375006556511, "num_tokens": 61475187.0, "step": 31420 }, { "entropy": 5.988220453262329, "epoch": 3.1412505623031937, "grad_norm": 1.03125, "learning_rate": 0.00040308916423747803, "loss": 5.4833, "mean_token_accuracy": 0.1920618250966072, "num_tokens": 61485232.0, "step": 31425 }, { "entropy": 6.080350112915039, "epoch": 3.1417503873644224, "grad_norm": 1.1015625, "learning_rate": 0.000403059821183663, "loss": 5.6651, "mean_token_accuracy": 0.18806249946355819, "num_tokens": 61495601.0, "step": 31430 }, { "entropy": 5.996184253692627, "epoch": 3.142250212425651, "grad_norm": 1.0859375, "learning_rate": 0.0004030304749078959, "loss": 5.4437, "mean_token_accuracy": 0.19302066117525102, "num_tokens": 61506659.0, "step": 31435 }, { "entropy": 5.912986469268799, "epoch": 3.1427500374868798, "grad_norm": 1.234375, "learning_rate": 0.00040300112541091494, "loss": 5.4206, "mean_token_accuracy": 0.20081949681043626, "num_tokens": 61517376.0, "step": 31440 }, { "entropy": 5.974144840240479, "epoch": 3.143249862548108, "grad_norm": 1.171875, "learning_rate": 0.0004029717726934586, "loss": 5.4148, "mean_token_accuracy": 0.19888361990451814, "num_tokens": 61527001.0, "step": 31445 }, { "entropy": 6.027616739273071, "epoch": 3.1437496876093367, "grad_norm": 1.0859375, "learning_rate": 0.00040294241675626534, "loss": 5.5313, "mean_token_accuracy": 0.1919981762766838, "num_tokens": 61537554.0, "step": 31450 }, { "entropy": 6.0610116481781, "epoch": 3.1442495126705654, "grad_norm": 1.1875, "learning_rate": 0.0004029130576000739, "loss": 5.474, "mean_token_accuracy": 0.19901783168315887, "num_tokens": 61546457.0, "step": 31455 }, { "entropy": 5.959495735168457, "epoch": 3.1447493377317937, "grad_norm": 1.078125, "learning_rate": 0.0004028836952256227, "loss": 5.5197, "mean_token_accuracy": 0.1866837352514267, "num_tokens": 61555872.0, "step": 31460 }, { "entropy": 5.976934623718262, "epoch": 3.1452491627930224, "grad_norm": 1.1171875, "learning_rate": 0.0004028543296336508, "loss": 5.4338, "mean_token_accuracy": 0.19786111116409302, "num_tokens": 61565820.0, "step": 31465 }, { "entropy": 6.015416097640991, "epoch": 3.145748987854251, "grad_norm": 1.234375, "learning_rate": 0.00040282496082489684, "loss": 5.4945, "mean_token_accuracy": 0.20036117881536483, "num_tokens": 61575344.0, "step": 31470 }, { "entropy": 5.912573909759521, "epoch": 3.1462488129154798, "grad_norm": 1.171875, "learning_rate": 0.00040279558880009967, "loss": 5.3779, "mean_token_accuracy": 0.21140339970588684, "num_tokens": 61584906.0, "step": 31475 }, { "entropy": 5.858107614517212, "epoch": 3.146748637976708, "grad_norm": 1.125, "learning_rate": 0.0004027662135599984, "loss": 5.3438, "mean_token_accuracy": 0.2060943514108658, "num_tokens": 61594490.0, "step": 31480 }, { "entropy": 5.98683533668518, "epoch": 3.1472484630379367, "grad_norm": 1.1328125, "learning_rate": 0.0004027368351053321, "loss": 5.4047, "mean_token_accuracy": 0.19936572164297103, "num_tokens": 61603280.0, "step": 31485 }, { "entropy": 6.008887672424317, "epoch": 3.1477482880991654, "grad_norm": 1.1875, "learning_rate": 0.0004027074534368399, "loss": 5.4416, "mean_token_accuracy": 0.20299321562051773, "num_tokens": 61612474.0, "step": 31490 }, { "entropy": 5.8276454448699955, "epoch": 3.1482481131603937, "grad_norm": 1.171875, "learning_rate": 0.00040267806855526103, "loss": 5.2773, "mean_token_accuracy": 0.20983189940452576, "num_tokens": 61622719.0, "step": 31495 }, { "entropy": 5.881341791152954, "epoch": 3.1487479382216224, "grad_norm": 1.1328125, "learning_rate": 0.0004026486804613347, "loss": 5.4171, "mean_token_accuracy": 0.19876565784215927, "num_tokens": 61633171.0, "step": 31500 }, { "entropy": 5.899614477157593, "epoch": 3.149247763282851, "grad_norm": 1.046875, "learning_rate": 0.00040261928915580065, "loss": 5.3627, "mean_token_accuracy": 0.20101428776979446, "num_tokens": 61642437.0, "step": 31505 }, { "entropy": 6.005756855010986, "epoch": 3.1497475883440798, "grad_norm": 1.109375, "learning_rate": 0.0004025898946393979, "loss": 5.586, "mean_token_accuracy": 0.18486790955066681, "num_tokens": 61651884.0, "step": 31510 }, { "entropy": 5.988962936401367, "epoch": 3.150247413405308, "grad_norm": 0.98828125, "learning_rate": 0.0004025604969128663, "loss": 5.5075, "mean_token_accuracy": 0.18993653655052184, "num_tokens": 61661821.0, "step": 31515 }, { "entropy": 5.960079860687256, "epoch": 3.1507472384665367, "grad_norm": 1.109375, "learning_rate": 0.00040253109597694544, "loss": 5.4405, "mean_token_accuracy": 0.1946353167295456, "num_tokens": 61672363.0, "step": 31520 }, { "entropy": 5.986041593551636, "epoch": 3.1512470635277654, "grad_norm": 1.1328125, "learning_rate": 0.00040250169183237507, "loss": 5.4399, "mean_token_accuracy": 0.20062762200832368, "num_tokens": 61681318.0, "step": 31525 }, { "entropy": 5.97133321762085, "epoch": 3.1517468885889937, "grad_norm": 1.0625, "learning_rate": 0.00040247228447989485, "loss": 5.4902, "mean_token_accuracy": 0.18878630995750428, "num_tokens": 61690710.0, "step": 31530 }, { "entropy": 6.008075857162476, "epoch": 3.1522467136502224, "grad_norm": 1.2890625, "learning_rate": 0.00040244287392024485, "loss": 5.4878, "mean_token_accuracy": 0.19416080117225648, "num_tokens": 61700913.0, "step": 31535 }, { "entropy": 6.014084339141846, "epoch": 3.152746538711451, "grad_norm": 1.03125, "learning_rate": 0.0004024134601541649, "loss": 5.4586, "mean_token_accuracy": 0.19326173663139343, "num_tokens": 61710905.0, "step": 31540 }, { "entropy": 5.901244974136352, "epoch": 3.1532463637726798, "grad_norm": 1.1328125, "learning_rate": 0.0004023840431823951, "loss": 5.4074, "mean_token_accuracy": 0.2017873078584671, "num_tokens": 61719952.0, "step": 31545 }, { "entropy": 5.983846616744995, "epoch": 3.153746188833908, "grad_norm": 1.1484375, "learning_rate": 0.0004023546230056754, "loss": 5.3818, "mean_token_accuracy": 0.19737586379051208, "num_tokens": 61728948.0, "step": 31550 }, { "entropy": 6.069068431854248, "epoch": 3.1542460138951367, "grad_norm": 1.1953125, "learning_rate": 0.00040232519962474635, "loss": 5.5912, "mean_token_accuracy": 0.1858069270849228, "num_tokens": 61738235.0, "step": 31555 }, { "entropy": 6.015467929840088, "epoch": 3.1547458389563654, "grad_norm": 1.28125, "learning_rate": 0.00040229577304034793, "loss": 5.5094, "mean_token_accuracy": 0.19658226817846297, "num_tokens": 61746934.0, "step": 31560 }, { "entropy": 5.984611082077026, "epoch": 3.1552456640175937, "grad_norm": 1.1171875, "learning_rate": 0.00040226634325322063, "loss": 5.4843, "mean_token_accuracy": 0.19597231298685075, "num_tokens": 61756346.0, "step": 31565 }, { "entropy": 5.990927505493164, "epoch": 3.1557454890788224, "grad_norm": 1.1171875, "learning_rate": 0.0004022369102641049, "loss": 5.5215, "mean_token_accuracy": 0.19015911221504211, "num_tokens": 61765900.0, "step": 31570 }, { "entropy": 6.056782484054565, "epoch": 3.156245314140051, "grad_norm": 1.09375, "learning_rate": 0.00040220747407374133, "loss": 5.5167, "mean_token_accuracy": 0.19033144414424896, "num_tokens": 61775657.0, "step": 31575 }, { "entropy": 6.02979154586792, "epoch": 3.1567451392012797, "grad_norm": 1.1875, "learning_rate": 0.00040217803468287034, "loss": 5.4635, "mean_token_accuracy": 0.19816322326660157, "num_tokens": 61784977.0, "step": 31580 }, { "entropy": 6.008619737625122, "epoch": 3.157244964262508, "grad_norm": 1.1015625, "learning_rate": 0.00040214859209223273, "loss": 5.419, "mean_token_accuracy": 0.1980102077126503, "num_tokens": 61794086.0, "step": 31585 }, { "entropy": 5.936828851699829, "epoch": 3.1577447893237367, "grad_norm": 1.109375, "learning_rate": 0.0004021191463025693, "loss": 5.4485, "mean_token_accuracy": 0.18989246785640718, "num_tokens": 61803737.0, "step": 31590 }, { "entropy": 5.948536014556884, "epoch": 3.1582446143849654, "grad_norm": 1.09375, "learning_rate": 0.0004020896973146208, "loss": 5.4572, "mean_token_accuracy": 0.19096762090921401, "num_tokens": 61814078.0, "step": 31595 }, { "entropy": 6.01352825164795, "epoch": 3.1587444394461937, "grad_norm": 1.1953125, "learning_rate": 0.00040206024512912824, "loss": 5.4349, "mean_token_accuracy": 0.19202901870012284, "num_tokens": 61823680.0, "step": 31600 }, { "entropy": 5.952416181564331, "epoch": 3.1592442645074224, "grad_norm": 1.0390625, "learning_rate": 0.00040203078974683265, "loss": 5.5047, "mean_token_accuracy": 0.18932773321866989, "num_tokens": 61833704.0, "step": 31605 }, { "entropy": 6.00891523361206, "epoch": 3.159744089568651, "grad_norm": 1.1484375, "learning_rate": 0.0004020013311684751, "loss": 5.4862, "mean_token_accuracy": 0.19134989231824875, "num_tokens": 61842402.0, "step": 31610 }, { "entropy": 6.02498574256897, "epoch": 3.1602439146298797, "grad_norm": 1.2109375, "learning_rate": 0.00040197186939479665, "loss": 5.4994, "mean_token_accuracy": 0.186500683426857, "num_tokens": 61852184.0, "step": 31615 }, { "entropy": 6.070594120025635, "epoch": 3.160743739691108, "grad_norm": 1.109375, "learning_rate": 0.00040194240442653867, "loss": 5.5055, "mean_token_accuracy": 0.19075935035943986, "num_tokens": 61861260.0, "step": 31620 }, { "entropy": 5.96283974647522, "epoch": 3.1612435647523367, "grad_norm": 1.09375, "learning_rate": 0.0004019129362644425, "loss": 5.4056, "mean_token_accuracy": 0.19637784063816072, "num_tokens": 61871131.0, "step": 31625 }, { "entropy": 5.980798768997192, "epoch": 3.1617433898135654, "grad_norm": 1.1171875, "learning_rate": 0.0004018834649092494, "loss": 5.4497, "mean_token_accuracy": 0.19673945158720016, "num_tokens": 61881826.0, "step": 31630 }, { "entropy": 6.024117088317871, "epoch": 3.1622432148747937, "grad_norm": 1.140625, "learning_rate": 0.0004018539903617011, "loss": 5.4289, "mean_token_accuracy": 0.19039698243141173, "num_tokens": 61891253.0, "step": 31635 }, { "entropy": 5.882132196426392, "epoch": 3.1627430399360223, "grad_norm": 1.109375, "learning_rate": 0.00040182451262253904, "loss": 5.4013, "mean_token_accuracy": 0.19969268441200255, "num_tokens": 61901054.0, "step": 31640 }, { "entropy": 5.959255313873291, "epoch": 3.163242864997251, "grad_norm": 1.2734375, "learning_rate": 0.0004017950316925049, "loss": 5.3952, "mean_token_accuracy": 0.1971738949418068, "num_tokens": 61912298.0, "step": 31645 }, { "entropy": 6.020190858840943, "epoch": 3.1637426900584797, "grad_norm": 1.1328125, "learning_rate": 0.00040176554757234017, "loss": 5.4613, "mean_token_accuracy": 0.1914720579981804, "num_tokens": 61921449.0, "step": 31650 }, { "entropy": 5.925162220001221, "epoch": 3.164242515119708, "grad_norm": 1.109375, "learning_rate": 0.0004017360602627871, "loss": 5.3978, "mean_token_accuracy": 0.20227099508047103, "num_tokens": 61931220.0, "step": 31655 }, { "entropy": 6.047433567047119, "epoch": 3.1647423401809367, "grad_norm": 1.0703125, "learning_rate": 0.00040170656976458723, "loss": 5.6025, "mean_token_accuracy": 0.18652133345603944, "num_tokens": 61940981.0, "step": 31660 }, { "entropy": 6.074125289916992, "epoch": 3.1652421652421654, "grad_norm": 1.140625, "learning_rate": 0.00040167707607848273, "loss": 5.5386, "mean_token_accuracy": 0.19303042888641359, "num_tokens": 61950632.0, "step": 31665 }, { "entropy": 5.941245365142822, "epoch": 3.1657419903033936, "grad_norm": 1.125, "learning_rate": 0.0004016475792052157, "loss": 5.4253, "mean_token_accuracy": 0.19680525213479996, "num_tokens": 61960652.0, "step": 31670 }, { "entropy": 6.021413278579712, "epoch": 3.1662418153646223, "grad_norm": 1.171875, "learning_rate": 0.000401618079145528, "loss": 5.5135, "mean_token_accuracy": 0.18435123860836028, "num_tokens": 61969480.0, "step": 31675 }, { "entropy": 5.929448890686035, "epoch": 3.166741640425851, "grad_norm": 1.09375, "learning_rate": 0.0004015885759001621, "loss": 5.4817, "mean_token_accuracy": 0.19591234624385834, "num_tokens": 61979164.0, "step": 31680 }, { "entropy": 5.921716356277466, "epoch": 3.1672414654870797, "grad_norm": 1.0234375, "learning_rate": 0.00040155906946986027, "loss": 5.4325, "mean_token_accuracy": 0.19898353517055511, "num_tokens": 61990513.0, "step": 31685 }, { "entropy": 6.049787282943726, "epoch": 3.167741290548308, "grad_norm": 1.1796875, "learning_rate": 0.0004015295598553647, "loss": 5.4784, "mean_token_accuracy": 0.18927515000104905, "num_tokens": 61999599.0, "step": 31690 }, { "entropy": 6.023807621002197, "epoch": 3.1682411156095367, "grad_norm": 1.0390625, "learning_rate": 0.0004015000470574179, "loss": 5.5318, "mean_token_accuracy": 0.18936030715703964, "num_tokens": 62009548.0, "step": 31695 }, { "entropy": 5.99323296546936, "epoch": 3.1687409406707654, "grad_norm": 1.3046875, "learning_rate": 0.00040147053107676266, "loss": 5.4677, "mean_token_accuracy": 0.189926777780056, "num_tokens": 62018536.0, "step": 31700 }, { "entropy": 5.991889762878418, "epoch": 3.1692407657319936, "grad_norm": 1.140625, "learning_rate": 0.00040144101191414127, "loss": 5.5594, "mean_token_accuracy": 0.18568063527345657, "num_tokens": 62027991.0, "step": 31705 }, { "entropy": 5.940165996551514, "epoch": 3.1697405907932223, "grad_norm": 1.1015625, "learning_rate": 0.0004014114895702966, "loss": 5.4626, "mean_token_accuracy": 0.19803366661071778, "num_tokens": 62038554.0, "step": 31710 }, { "entropy": 6.0047767639160154, "epoch": 3.170240415854451, "grad_norm": 1.3203125, "learning_rate": 0.0004013819640459714, "loss": 5.4246, "mean_token_accuracy": 0.20164646804332734, "num_tokens": 62048060.0, "step": 31715 }, { "entropy": 5.996233987808227, "epoch": 3.1707402409156797, "grad_norm": 1.1484375, "learning_rate": 0.00040135243534190847, "loss": 5.4572, "mean_token_accuracy": 0.1935113176703453, "num_tokens": 62057905.0, "step": 31720 }, { "entropy": 5.98726978302002, "epoch": 3.171240065976908, "grad_norm": 1.1484375, "learning_rate": 0.00040132290345885077, "loss": 5.47, "mean_token_accuracy": 0.19013614654541017, "num_tokens": 62067022.0, "step": 31725 }, { "entropy": 6.039809370040894, "epoch": 3.1717398910381367, "grad_norm": 1.0625, "learning_rate": 0.0004012933683975413, "loss": 5.4849, "mean_token_accuracy": 0.19068132042884828, "num_tokens": 62075696.0, "step": 31730 }, { "entropy": 5.961600637435913, "epoch": 3.1722397160993654, "grad_norm": 1.078125, "learning_rate": 0.00040126383015872324, "loss": 5.4869, "mean_token_accuracy": 0.19163547456264496, "num_tokens": 62085620.0, "step": 31735 }, { "entropy": 6.012762498855591, "epoch": 3.1727395411605936, "grad_norm": 1.2578125, "learning_rate": 0.00040123428874313974, "loss": 5.4723, "mean_token_accuracy": 0.18888215869665145, "num_tokens": 62094531.0, "step": 31740 }, { "entropy": 6.084392166137695, "epoch": 3.1732393662218223, "grad_norm": 1.1484375, "learning_rate": 0.00040120474415153396, "loss": 5.5896, "mean_token_accuracy": 0.18357840329408645, "num_tokens": 62104036.0, "step": 31745 }, { "entropy": 6.003712177276611, "epoch": 3.173739191283051, "grad_norm": 1.234375, "learning_rate": 0.00040117519638464935, "loss": 5.4406, "mean_token_accuracy": 0.1878862276673317, "num_tokens": 62113772.0, "step": 31750 }, { "entropy": 5.94217357635498, "epoch": 3.1742390163442793, "grad_norm": 1.3046875, "learning_rate": 0.00040114564544322913, "loss": 5.4145, "mean_token_accuracy": 0.19738237857818602, "num_tokens": 62123237.0, "step": 31755 }, { "entropy": 5.940281963348388, "epoch": 3.174738841405508, "grad_norm": 1.171875, "learning_rate": 0.000401116091328017, "loss": 5.4324, "mean_token_accuracy": 0.1949404150247574, "num_tokens": 62132391.0, "step": 31760 }, { "entropy": 5.8717821598052975, "epoch": 3.1752386664667367, "grad_norm": 1.1953125, "learning_rate": 0.00040108653403975647, "loss": 5.338, "mean_token_accuracy": 0.21413731724023818, "num_tokens": 62141808.0, "step": 31765 }, { "entropy": 5.808552217483521, "epoch": 3.1757384915279654, "grad_norm": 1.0859375, "learning_rate": 0.0004010569735791912, "loss": 5.1356, "mean_token_accuracy": 0.2220717191696167, "num_tokens": 62151065.0, "step": 31770 }, { "entropy": 5.965939378738403, "epoch": 3.1762383165891936, "grad_norm": 1.1875, "learning_rate": 0.0004010274099470649, "loss": 5.4306, "mean_token_accuracy": 0.1946471944451332, "num_tokens": 62160885.0, "step": 31775 }, { "entropy": 5.826192808151245, "epoch": 3.1767381416504223, "grad_norm": 1.6875, "learning_rate": 0.0004009978431441214, "loss": 5.3344, "mean_token_accuracy": 0.20928571224212647, "num_tokens": 62169917.0, "step": 31780 }, { "entropy": 5.912977981567383, "epoch": 3.177237966711651, "grad_norm": 1.1015625, "learning_rate": 0.00040096827317110463, "loss": 5.4379, "mean_token_accuracy": 0.1948835015296936, "num_tokens": 62179896.0, "step": 31785 }, { "entropy": 5.9609979629516605, "epoch": 3.1777377917728793, "grad_norm": 1.1875, "learning_rate": 0.0004009387000287585, "loss": 5.4454, "mean_token_accuracy": 0.19321976006031036, "num_tokens": 62189378.0, "step": 31790 }, { "entropy": 5.995979452133179, "epoch": 3.178237616834108, "grad_norm": 1.078125, "learning_rate": 0.000400909123717827, "loss": 5.4936, "mean_token_accuracy": 0.1972079575061798, "num_tokens": 62198602.0, "step": 31795 }, { "entropy": 6.004583692550659, "epoch": 3.1787374418953367, "grad_norm": 1.15625, "learning_rate": 0.0004008795442390544, "loss": 5.4522, "mean_token_accuracy": 0.18629064708948134, "num_tokens": 62206989.0, "step": 31800 }, { "entropy": 5.997479248046875, "epoch": 3.1792372669565654, "grad_norm": 1.1015625, "learning_rate": 0.0004008499615931849, "loss": 5.486, "mean_token_accuracy": 0.19609298855066298, "num_tokens": 62216922.0, "step": 31805 }, { "entropy": 6.089541101455689, "epoch": 3.1797370920177936, "grad_norm": 1.2265625, "learning_rate": 0.0004008203757809627, "loss": 5.5033, "mean_token_accuracy": 0.1859486311674118, "num_tokens": 62225946.0, "step": 31810 }, { "entropy": 5.993651294708252, "epoch": 3.1802369170790223, "grad_norm": 1.15625, "learning_rate": 0.00040079078680313224, "loss": 5.4777, "mean_token_accuracy": 0.19616598188877105, "num_tokens": 62236464.0, "step": 31815 }, { "entropy": 6.043734216690064, "epoch": 3.180736742140251, "grad_norm": 1.1484375, "learning_rate": 0.000400761194660438, "loss": 5.4669, "mean_token_accuracy": 0.19294981956481932, "num_tokens": 62245789.0, "step": 31820 }, { "entropy": 5.907081842422485, "epoch": 3.1812365672014793, "grad_norm": 1.09375, "learning_rate": 0.0004007315993536244, "loss": 5.4132, "mean_token_accuracy": 0.1964319109916687, "num_tokens": 62254843.0, "step": 31825 }, { "entropy": 5.937596225738526, "epoch": 3.181736392262708, "grad_norm": 1.171875, "learning_rate": 0.00040070200088343613, "loss": 5.4632, "mean_token_accuracy": 0.19304445385932922, "num_tokens": 62265239.0, "step": 31830 }, { "entropy": 5.933077669143676, "epoch": 3.1822362173239367, "grad_norm": 1.0859375, "learning_rate": 0.00040067239925061784, "loss": 5.4122, "mean_token_accuracy": 0.2026483803987503, "num_tokens": 62275496.0, "step": 31835 }, { "entropy": 6.013749027252198, "epoch": 3.1827360423851654, "grad_norm": 1.2265625, "learning_rate": 0.0004006427944559144, "loss": 5.4913, "mean_token_accuracy": 0.1972864344716072, "num_tokens": 62286071.0, "step": 31840 }, { "entropy": 5.945190477371216, "epoch": 3.1832358674463936, "grad_norm": 1.1640625, "learning_rate": 0.00040061318650007045, "loss": 5.4075, "mean_token_accuracy": 0.1980511277914047, "num_tokens": 62295242.0, "step": 31845 }, { "entropy": 5.912838554382324, "epoch": 3.1837356925076223, "grad_norm": 1.171875, "learning_rate": 0.00040058357538383117, "loss": 5.4283, "mean_token_accuracy": 0.2005800798535347, "num_tokens": 62305546.0, "step": 31850 }, { "entropy": 5.976898574829102, "epoch": 3.184235517568851, "grad_norm": 1.3515625, "learning_rate": 0.0004005539611079414, "loss": 5.4906, "mean_token_accuracy": 0.19358714669942856, "num_tokens": 62315181.0, "step": 31855 }, { "entropy": 6.007874059677124, "epoch": 3.1847353426300793, "grad_norm": 1.125, "learning_rate": 0.00040052434367314634, "loss": 5.4385, "mean_token_accuracy": 0.19311296790838242, "num_tokens": 62324741.0, "step": 31860 }, { "entropy": 5.960619401931763, "epoch": 3.185235167691308, "grad_norm": 1.109375, "learning_rate": 0.00040049472308019104, "loss": 5.4474, "mean_token_accuracy": 0.20098691582679748, "num_tokens": 62334637.0, "step": 31865 }, { "entropy": 6.15636420249939, "epoch": 3.1857349927525367, "grad_norm": 1.109375, "learning_rate": 0.00040046509932982076, "loss": 5.6349, "mean_token_accuracy": 0.1836501330137253, "num_tokens": 62344637.0, "step": 31870 }, { "entropy": 5.982431411743164, "epoch": 3.1862348178137654, "grad_norm": 1.140625, "learning_rate": 0.0004004354724227809, "loss": 5.4281, "mean_token_accuracy": 0.19599066376686097, "num_tokens": 62353867.0, "step": 31875 }, { "entropy": 5.817639255523682, "epoch": 3.1867346428749936, "grad_norm": 1.0234375, "learning_rate": 0.0004004058423598168, "loss": 5.3432, "mean_token_accuracy": 0.21051892787218093, "num_tokens": 62364729.0, "step": 31880 }, { "entropy": 5.990703964233399, "epoch": 3.1872344679362223, "grad_norm": 1.09375, "learning_rate": 0.00040037620914167406, "loss": 5.4808, "mean_token_accuracy": 0.18948947489261628, "num_tokens": 62374295.0, "step": 31885 }, { "entropy": 6.016822814941406, "epoch": 3.187734292997451, "grad_norm": 1.1015625, "learning_rate": 0.0004003465727690981, "loss": 5.4988, "mean_token_accuracy": 0.19389074444770812, "num_tokens": 62383276.0, "step": 31890 }, { "entropy": 6.016742897033692, "epoch": 3.1882341180586793, "grad_norm": 1.0546875, "learning_rate": 0.00040031693324283464, "loss": 5.4989, "mean_token_accuracy": 0.19156708121299743, "num_tokens": 62392473.0, "step": 31895 }, { "entropy": 6.040921545028686, "epoch": 3.188733943119908, "grad_norm": 1.203125, "learning_rate": 0.0004002872905636294, "loss": 5.6335, "mean_token_accuracy": 0.18517186045646666, "num_tokens": 62402127.0, "step": 31900 }, { "entropy": 6.054186487197876, "epoch": 3.1892337681811367, "grad_norm": 1.1953125, "learning_rate": 0.00040025764473222816, "loss": 5.5364, "mean_token_accuracy": 0.18769917339086534, "num_tokens": 62411757.0, "step": 31905 }, { "entropy": 5.8423333168029785, "epoch": 3.189733593242365, "grad_norm": 1.1015625, "learning_rate": 0.00040022799574937674, "loss": 5.2635, "mean_token_accuracy": 0.21091450601816178, "num_tokens": 62422446.0, "step": 31910 }, { "entropy": 5.941195964813232, "epoch": 3.1902334183035936, "grad_norm": 1.1328125, "learning_rate": 0.00040019834361582123, "loss": 5.3734, "mean_token_accuracy": 0.20959193706512452, "num_tokens": 62430970.0, "step": 31915 }, { "entropy": 5.9468447208404545, "epoch": 3.1907332433648223, "grad_norm": 1.125, "learning_rate": 0.00040016868833230766, "loss": 5.4216, "mean_token_accuracy": 0.1934804692864418, "num_tokens": 62440666.0, "step": 31920 }, { "entropy": 6.0380699634552, "epoch": 3.191233068426051, "grad_norm": 1.1796875, "learning_rate": 0.0004001390298995821, "loss": 5.5224, "mean_token_accuracy": 0.1975189059972763, "num_tokens": 62450008.0, "step": 31925 }, { "entropy": 5.84752631187439, "epoch": 3.1917328934872793, "grad_norm": 1.25, "learning_rate": 0.00040010936831839065, "loss": 5.2884, "mean_token_accuracy": 0.2085451990365982, "num_tokens": 62459225.0, "step": 31930 }, { "entropy": 5.991556024551391, "epoch": 3.192232718548508, "grad_norm": 1.2421875, "learning_rate": 0.00040007970358947977, "loss": 5.4587, "mean_token_accuracy": 0.18982192128896713, "num_tokens": 62469094.0, "step": 31935 }, { "entropy": 5.97147421836853, "epoch": 3.1927325436097367, "grad_norm": 1.1328125, "learning_rate": 0.00040005003571359565, "loss": 5.4256, "mean_token_accuracy": 0.19228993207216263, "num_tokens": 62479308.0, "step": 31940 }, { "entropy": 5.892456436157227, "epoch": 3.193232368670965, "grad_norm": 1.15625, "learning_rate": 0.00040002036469148486, "loss": 5.3469, "mean_token_accuracy": 0.20419482588768006, "num_tokens": 62489758.0, "step": 31945 }, { "entropy": 5.999871349334716, "epoch": 3.1937321937321936, "grad_norm": 1.1015625, "learning_rate": 0.00039999069052389384, "loss": 5.5159, "mean_token_accuracy": 0.18863907158374787, "num_tokens": 62499084.0, "step": 31950 }, { "entropy": 5.971793937683105, "epoch": 3.1942320187934223, "grad_norm": 1.125, "learning_rate": 0.00039996101321156926, "loss": 5.4597, "mean_token_accuracy": 0.19206098467111588, "num_tokens": 62508054.0, "step": 31955 }, { "entropy": 6.0303062915802, "epoch": 3.194731843854651, "grad_norm": 1.0859375, "learning_rate": 0.00039993133275525777, "loss": 5.4662, "mean_token_accuracy": 0.1934739589691162, "num_tokens": 62517823.0, "step": 31960 }, { "entropy": 6.001662540435791, "epoch": 3.1952316689158793, "grad_norm": 1.0546875, "learning_rate": 0.000399901649155706, "loss": 5.5082, "mean_token_accuracy": 0.19245974719524384, "num_tokens": 62528579.0, "step": 31965 }, { "entropy": 6.027767610549927, "epoch": 3.195731493977108, "grad_norm": 1.125, "learning_rate": 0.00039987196241366086, "loss": 5.5371, "mean_token_accuracy": 0.18775540143251418, "num_tokens": 62539682.0, "step": 31970 }, { "entropy": 6.093766069412231, "epoch": 3.1962313190383367, "grad_norm": 1.15625, "learning_rate": 0.00039984227252986936, "loss": 5.5972, "mean_token_accuracy": 0.18218024522066117, "num_tokens": 62549431.0, "step": 31975 }, { "entropy": 6.010634040832519, "epoch": 3.196731144099565, "grad_norm": 1.1171875, "learning_rate": 0.00039981257950507835, "loss": 5.4505, "mean_token_accuracy": 0.1962405264377594, "num_tokens": 62559372.0, "step": 31980 }, { "entropy": 5.918906307220459, "epoch": 3.1972309691607936, "grad_norm": 1.1328125, "learning_rate": 0.000399782883340035, "loss": 5.4111, "mean_token_accuracy": 0.19937752485275267, "num_tokens": 62568415.0, "step": 31985 }, { "entropy": 5.9657470703125, "epoch": 3.1977307942220223, "grad_norm": 1.140625, "learning_rate": 0.0003997531840354865, "loss": 5.5156, "mean_token_accuracy": 0.18717618733644487, "num_tokens": 62578419.0, "step": 31990 }, { "entropy": 6.038073444366455, "epoch": 3.198230619283251, "grad_norm": 1.25, "learning_rate": 0.00039972348159217987, "loss": 5.403, "mean_token_accuracy": 0.20354871302843094, "num_tokens": 62587408.0, "step": 31995 }, { "entropy": 5.942176294326782, "epoch": 3.1987304443444793, "grad_norm": 1.015625, "learning_rate": 0.00039969377601086257, "loss": 5.4473, "mean_token_accuracy": 0.19438078999519348, "num_tokens": 62598753.0, "step": 32000 }, { "entropy": 5.953826236724853, "epoch": 3.199230269405708, "grad_norm": 1.046875, "learning_rate": 0.00039966406729228187, "loss": 5.4093, "mean_token_accuracy": 0.20518541038036348, "num_tokens": 62608700.0, "step": 32005 }, { "entropy": 5.895655488967895, "epoch": 3.1997300944669367, "grad_norm": 1.1328125, "learning_rate": 0.00039963435543718544, "loss": 5.4051, "mean_token_accuracy": 0.20115143805742264, "num_tokens": 62618870.0, "step": 32010 }, { "entropy": 5.9198321342468265, "epoch": 3.200229919528165, "grad_norm": 1.1484375, "learning_rate": 0.00039960464044632067, "loss": 5.4352, "mean_token_accuracy": 0.20230301916599275, "num_tokens": 62629681.0, "step": 32015 }, { "entropy": 6.028596544265747, "epoch": 3.2007297445893936, "grad_norm": 1.1640625, "learning_rate": 0.0003995749223204351, "loss": 5.5203, "mean_token_accuracy": 0.1888175204396248, "num_tokens": 62638792.0, "step": 32020 }, { "entropy": 5.937923526763916, "epoch": 3.2012295696506223, "grad_norm": 1.2265625, "learning_rate": 0.0003995452010602767, "loss": 5.4132, "mean_token_accuracy": 0.2068414121866226, "num_tokens": 62648353.0, "step": 32025 }, { "entropy": 5.945056915283203, "epoch": 3.201729394711851, "grad_norm": 1.109375, "learning_rate": 0.00039951547666659305, "loss": 5.4439, "mean_token_accuracy": 0.19346626549959184, "num_tokens": 62657585.0, "step": 32030 }, { "entropy": 5.94196081161499, "epoch": 3.2022292197730793, "grad_norm": 1.0390625, "learning_rate": 0.000399485749140132, "loss": 5.3784, "mean_token_accuracy": 0.19720625132322311, "num_tokens": 62668055.0, "step": 32035 }, { "entropy": 5.988038396835327, "epoch": 3.202729044834308, "grad_norm": 1.09375, "learning_rate": 0.00039945601848164153, "loss": 5.4882, "mean_token_accuracy": 0.19586727619171143, "num_tokens": 62678279.0, "step": 32040 }, { "entropy": 5.935755729675293, "epoch": 3.2032288698955367, "grad_norm": 1.1875, "learning_rate": 0.0003994262846918697, "loss": 5.339, "mean_token_accuracy": 0.20476308912038804, "num_tokens": 62687875.0, "step": 32045 }, { "entropy": 6.00769739151001, "epoch": 3.203728694956765, "grad_norm": 1.03125, "learning_rate": 0.00039939654777156454, "loss": 5.4755, "mean_token_accuracy": 0.20105334967374802, "num_tokens": 62698345.0, "step": 32050 }, { "entropy": 6.008812808990479, "epoch": 3.2042285200179936, "grad_norm": 1.2734375, "learning_rate": 0.0003993668077214742, "loss": 5.4561, "mean_token_accuracy": 0.18656180948019027, "num_tokens": 62708176.0, "step": 32055 }, { "entropy": 5.925177049636841, "epoch": 3.2047283450792223, "grad_norm": 1.1875, "learning_rate": 0.0003993370645423471, "loss": 5.4691, "mean_token_accuracy": 0.19545457810163497, "num_tokens": 62717194.0, "step": 32060 }, { "entropy": 5.913721418380737, "epoch": 3.205228170140451, "grad_norm": 1.109375, "learning_rate": 0.00039930731823493136, "loss": 5.337, "mean_token_accuracy": 0.20477207750082016, "num_tokens": 62727095.0, "step": 32065 }, { "entropy": 5.888753032684326, "epoch": 3.2057279952016793, "grad_norm": 1.078125, "learning_rate": 0.00039927756879997556, "loss": 5.3358, "mean_token_accuracy": 0.2086097851395607, "num_tokens": 62737452.0, "step": 32070 }, { "entropy": 5.967770767211914, "epoch": 3.206227820262908, "grad_norm": 1.125, "learning_rate": 0.00039924781623822803, "loss": 5.4306, "mean_token_accuracy": 0.20212257504463196, "num_tokens": 62747345.0, "step": 32075 }, { "entropy": 5.9492340087890625, "epoch": 3.2067276453241367, "grad_norm": 1.1015625, "learning_rate": 0.0003992180605504374, "loss": 5.5266, "mean_token_accuracy": 0.1939336657524109, "num_tokens": 62757222.0, "step": 32080 }, { "entropy": 5.9753522872924805, "epoch": 3.207227470385365, "grad_norm": 1.09375, "learning_rate": 0.0003991883017373523, "loss": 5.486, "mean_token_accuracy": 0.18968759328126908, "num_tokens": 62767279.0, "step": 32085 }, { "entropy": 6.012639808654785, "epoch": 3.2077272954465936, "grad_norm": 1.2265625, "learning_rate": 0.0003991585397997216, "loss": 5.4384, "mean_token_accuracy": 0.19791668504476548, "num_tokens": 62776547.0, "step": 32090 }, { "entropy": 5.990026760101318, "epoch": 3.2082271205078223, "grad_norm": 0.9921875, "learning_rate": 0.000399128774738294, "loss": 5.4343, "mean_token_accuracy": 0.19857974350452423, "num_tokens": 62786689.0, "step": 32095 }, { "entropy": 6.022890996932984, "epoch": 3.208726945569051, "grad_norm": 1.1171875, "learning_rate": 0.0003990990065538183, "loss": 5.5671, "mean_token_accuracy": 0.18533232063055038, "num_tokens": 62795862.0, "step": 32100 }, { "entropy": 5.995427465438842, "epoch": 3.2092267706302793, "grad_norm": 1.109375, "learning_rate": 0.0003990692352470435, "loss": 5.4104, "mean_token_accuracy": 0.19688408076763153, "num_tokens": 62806065.0, "step": 32105 }, { "entropy": 5.979330730438233, "epoch": 3.209726595691508, "grad_norm": 1.0234375, "learning_rate": 0.00039903946081871865, "loss": 5.4616, "mean_token_accuracy": 0.1865861490368843, "num_tokens": 62815107.0, "step": 32110 }, { "entropy": 5.9161454200744625, "epoch": 3.2102264207527367, "grad_norm": 1.4375, "learning_rate": 0.00039900968326959295, "loss": 5.3222, "mean_token_accuracy": 0.20949522852897645, "num_tokens": 62823734.0, "step": 32115 }, { "entropy": 5.962410831451416, "epoch": 3.210726245813965, "grad_norm": 1.234375, "learning_rate": 0.00039897990260041557, "loss": 5.4801, "mean_token_accuracy": 0.1972297579050064, "num_tokens": 62833804.0, "step": 32120 }, { "entropy": 5.949703550338745, "epoch": 3.2112260708751936, "grad_norm": 1.171875, "learning_rate": 0.0003989501188119357, "loss": 5.4493, "mean_token_accuracy": 0.19458282738924026, "num_tokens": 62844414.0, "step": 32125 }, { "entropy": 6.015921592712402, "epoch": 3.2117258959364223, "grad_norm": 1.015625, "learning_rate": 0.00039892033190490274, "loss": 5.4274, "mean_token_accuracy": 0.20380644649267196, "num_tokens": 62855315.0, "step": 32130 }, { "entropy": 5.9333353519439695, "epoch": 3.212225720997651, "grad_norm": 1.125, "learning_rate": 0.00039889054188006615, "loss": 5.388, "mean_token_accuracy": 0.1952349603176117, "num_tokens": 62864526.0, "step": 32135 }, { "entropy": 5.900043678283692, "epoch": 3.2127255460588793, "grad_norm": 1.03125, "learning_rate": 0.0003988607487381753, "loss": 5.4632, "mean_token_accuracy": 0.19127848595380784, "num_tokens": 62874599.0, "step": 32140 }, { "entropy": 6.010245370864868, "epoch": 3.213225371120108, "grad_norm": 1.0546875, "learning_rate": 0.0003988309524799799, "loss": 5.473, "mean_token_accuracy": 0.19200847446918487, "num_tokens": 62885956.0, "step": 32145 }, { "entropy": 5.7966968536376955, "epoch": 3.2137251961813367, "grad_norm": 1.0703125, "learning_rate": 0.00039880115310622974, "loss": 5.2634, "mean_token_accuracy": 0.2188959613442421, "num_tokens": 62896202.0, "step": 32150 }, { "entropy": 5.8727803230285645, "epoch": 3.214225021242565, "grad_norm": 1.125, "learning_rate": 0.00039877135061767424, "loss": 5.365, "mean_token_accuracy": 0.19803449064493178, "num_tokens": 62905650.0, "step": 32155 }, { "entropy": 5.985955047607422, "epoch": 3.2147248463037936, "grad_norm": 1.0859375, "learning_rate": 0.0003987415450150635, "loss": 5.4476, "mean_token_accuracy": 0.19568676352500916, "num_tokens": 62916036.0, "step": 32160 }, { "entropy": 6.031588172912597, "epoch": 3.2152246713650223, "grad_norm": 1.0859375, "learning_rate": 0.00039871173629914736, "loss": 5.515, "mean_token_accuracy": 0.1888739973306656, "num_tokens": 62925221.0, "step": 32165 }, { "entropy": 5.967233753204345, "epoch": 3.215724496426251, "grad_norm": 1.09375, "learning_rate": 0.00039868192447067575, "loss": 5.4448, "mean_token_accuracy": 0.1909988969564438, "num_tokens": 62934917.0, "step": 32170 }, { "entropy": 5.889790821075439, "epoch": 3.2162243214874793, "grad_norm": 1.1171875, "learning_rate": 0.00039865210953039863, "loss": 5.4113, "mean_token_accuracy": 0.19866092950105668, "num_tokens": 62944357.0, "step": 32175 }, { "entropy": 5.971069622039795, "epoch": 3.216724146548708, "grad_norm": 1.0859375, "learning_rate": 0.0003986222914790664, "loss": 5.4631, "mean_token_accuracy": 0.20101162046194077, "num_tokens": 62954149.0, "step": 32180 }, { "entropy": 6.042191696166992, "epoch": 3.2172239716099367, "grad_norm": 1.0234375, "learning_rate": 0.00039859247031742907, "loss": 5.524, "mean_token_accuracy": 0.1833211213350296, "num_tokens": 62964721.0, "step": 32185 }, { "entropy": 5.966105556488037, "epoch": 3.217723796671165, "grad_norm": 1.21875, "learning_rate": 0.000398562646046237, "loss": 5.4063, "mean_token_accuracy": 0.20036827325820922, "num_tokens": 62974738.0, "step": 32190 }, { "entropy": 5.923502635955811, "epoch": 3.2182236217323936, "grad_norm": 1.15625, "learning_rate": 0.00039853281866624054, "loss": 5.4438, "mean_token_accuracy": 0.20329310297966002, "num_tokens": 62984109.0, "step": 32195 }, { "entropy": 6.038552474975586, "epoch": 3.2187234467936223, "grad_norm": 1.0390625, "learning_rate": 0.00039850298817819017, "loss": 5.5478, "mean_token_accuracy": 0.18799534142017366, "num_tokens": 62994443.0, "step": 32200 }, { "entropy": 6.05847282409668, "epoch": 3.219223271854851, "grad_norm": 1.078125, "learning_rate": 0.0003984731545828364, "loss": 5.5978, "mean_token_accuracy": 0.18122070282697678, "num_tokens": 63003897.0, "step": 32205 }, { "entropy": 6.00833740234375, "epoch": 3.2197230969160793, "grad_norm": 1.09375, "learning_rate": 0.00039844331788092986, "loss": 5.5004, "mean_token_accuracy": 0.1926969528198242, "num_tokens": 63013012.0, "step": 32210 }, { "entropy": 5.9991683006286625, "epoch": 3.220222921977308, "grad_norm": 1.0546875, "learning_rate": 0.0003984134780732211, "loss": 5.5047, "mean_token_accuracy": 0.19382333606481553, "num_tokens": 63022756.0, "step": 32215 }, { "entropy": 5.93957929611206, "epoch": 3.2207227470385367, "grad_norm": 1.0625, "learning_rate": 0.0003983836351604611, "loss": 5.4182, "mean_token_accuracy": 0.1937337651848793, "num_tokens": 63033109.0, "step": 32220 }, { "entropy": 5.970108127593994, "epoch": 3.221222572099765, "grad_norm": 1.1015625, "learning_rate": 0.0003983537891434005, "loss": 5.4564, "mean_token_accuracy": 0.18687559068202972, "num_tokens": 63042733.0, "step": 32225 }, { "entropy": 5.890345478057862, "epoch": 3.2217223971609936, "grad_norm": 1.234375, "learning_rate": 0.0003983239400227903, "loss": 5.3266, "mean_token_accuracy": 0.208632230758667, "num_tokens": 63053654.0, "step": 32230 }, { "entropy": 5.942334842681885, "epoch": 3.2222222222222223, "grad_norm": 1.140625, "learning_rate": 0.0003982940877993816, "loss": 5.4213, "mean_token_accuracy": 0.19690677970647813, "num_tokens": 63063285.0, "step": 32235 }, { "entropy": 6.125774383544922, "epoch": 3.222722047283451, "grad_norm": 1.2421875, "learning_rate": 0.00039826423247392537, "loss": 5.6187, "mean_token_accuracy": 0.17516909390687943, "num_tokens": 63072730.0, "step": 32240 }, { "entropy": 5.94420485496521, "epoch": 3.2232218723446793, "grad_norm": 1.1953125, "learning_rate": 0.0003982343740471727, "loss": 5.4137, "mean_token_accuracy": 0.19510273933410643, "num_tokens": 63081703.0, "step": 32245 }, { "entropy": 5.964404964447022, "epoch": 3.223721697405908, "grad_norm": 1.0703125, "learning_rate": 0.00039820451251987494, "loss": 5.4284, "mean_token_accuracy": 0.19674137532711028, "num_tokens": 63091382.0, "step": 32250 }, { "entropy": 5.969366216659546, "epoch": 3.2242215224671367, "grad_norm": 1.1171875, "learning_rate": 0.00039817464789278326, "loss": 5.3677, "mean_token_accuracy": 0.20497010946273803, "num_tokens": 63101256.0, "step": 32255 }, { "entropy": 5.953371047973633, "epoch": 3.224721347528365, "grad_norm": 1.1328125, "learning_rate": 0.00039814478016664923, "loss": 5.3799, "mean_token_accuracy": 0.197530098259449, "num_tokens": 63111001.0, "step": 32260 }, { "entropy": 5.909182834625244, "epoch": 3.2252211725895936, "grad_norm": 1.1015625, "learning_rate": 0.00039811490934222416, "loss": 5.4681, "mean_token_accuracy": 0.19409203976392747, "num_tokens": 63120524.0, "step": 32265 }, { "entropy": 5.985256195068359, "epoch": 3.2257209976508223, "grad_norm": 1.1328125, "learning_rate": 0.0003980850354202598, "loss": 5.4831, "mean_token_accuracy": 0.19086410403251647, "num_tokens": 63130673.0, "step": 32270 }, { "entropy": 6.063601970672607, "epoch": 3.226220822712051, "grad_norm": 1.1484375, "learning_rate": 0.00039805515840150743, "loss": 5.4844, "mean_token_accuracy": 0.19006870985031127, "num_tokens": 63140949.0, "step": 32275 }, { "entropy": 6.062148904800415, "epoch": 3.2267206477732793, "grad_norm": 1.0546875, "learning_rate": 0.00039802527828671896, "loss": 5.4955, "mean_token_accuracy": 0.190481998026371, "num_tokens": 63151088.0, "step": 32280 }, { "entropy": 5.923337030410766, "epoch": 3.227220472834508, "grad_norm": 1.2421875, "learning_rate": 0.0003979953950766462, "loss": 5.3588, "mean_token_accuracy": 0.20028552114963533, "num_tokens": 63160739.0, "step": 32285 }, { "entropy": 5.87428092956543, "epoch": 3.2277202978957367, "grad_norm": 1.203125, "learning_rate": 0.00039796550877204095, "loss": 5.4457, "mean_token_accuracy": 0.19607153683900833, "num_tokens": 63170657.0, "step": 32290 }, { "entropy": 5.978527021408081, "epoch": 3.228220122956965, "grad_norm": 1.1171875, "learning_rate": 0.00039793561937365515, "loss": 5.4454, "mean_token_accuracy": 0.19925541430711746, "num_tokens": 63180603.0, "step": 32295 }, { "entropy": 5.9439527034759525, "epoch": 3.2287199480181936, "grad_norm": 1.25, "learning_rate": 0.00039790572688224075, "loss": 5.4946, "mean_token_accuracy": 0.19529586732387544, "num_tokens": 63190589.0, "step": 32300 }, { "entropy": 6.03615779876709, "epoch": 3.2292197730794223, "grad_norm": 1.3515625, "learning_rate": 0.00039787583129854997, "loss": 5.4881, "mean_token_accuracy": 0.19561329931020738, "num_tokens": 63200227.0, "step": 32305 }, { "entropy": 5.932640123367309, "epoch": 3.2297195981406506, "grad_norm": 1.1640625, "learning_rate": 0.0003978459326233349, "loss": 5.4127, "mean_token_accuracy": 0.20077780932188033, "num_tokens": 63209273.0, "step": 32310 }, { "entropy": 5.853814792633057, "epoch": 3.2302194232018793, "grad_norm": 1.53125, "learning_rate": 0.0003978160308573477, "loss": 5.3646, "mean_token_accuracy": 0.2054761603474617, "num_tokens": 63218711.0, "step": 32315 }, { "entropy": 5.858217000961304, "epoch": 3.230719248263108, "grad_norm": 0.99609375, "learning_rate": 0.0003977861260013407, "loss": 5.3045, "mean_token_accuracy": 0.21386423707008362, "num_tokens": 63229982.0, "step": 32320 }, { "entropy": 6.131993341445923, "epoch": 3.2312190733243367, "grad_norm": 1.0859375, "learning_rate": 0.0003977562180560665, "loss": 5.6062, "mean_token_accuracy": 0.18484318852424622, "num_tokens": 63239659.0, "step": 32325 }, { "entropy": 6.0088193893432615, "epoch": 3.231718898385565, "grad_norm": 1.1796875, "learning_rate": 0.0003977263070222774, "loss": 5.4503, "mean_token_accuracy": 0.19535393714904786, "num_tokens": 63249379.0, "step": 32330 }, { "entropy": 5.925339269638061, "epoch": 3.2322187234467936, "grad_norm": 1.2421875, "learning_rate": 0.000397696392900726, "loss": 5.3527, "mean_token_accuracy": 0.20175118297338485, "num_tokens": 63259857.0, "step": 32335 }, { "entropy": 5.985756874084473, "epoch": 3.2327185485080223, "grad_norm": 1.21875, "learning_rate": 0.0003976664756921649, "loss": 5.4338, "mean_token_accuracy": 0.18929346650838852, "num_tokens": 63268209.0, "step": 32340 }, { "entropy": 5.986113405227661, "epoch": 3.2332183735692506, "grad_norm": 1.171875, "learning_rate": 0.0003976365553973469, "loss": 5.4357, "mean_token_accuracy": 0.19302802085876464, "num_tokens": 63278649.0, "step": 32345 }, { "entropy": 5.9589011669158936, "epoch": 3.2337181986304793, "grad_norm": 1.0859375, "learning_rate": 0.0003976066320170247, "loss": 5.4447, "mean_token_accuracy": 0.19558094888925553, "num_tokens": 63288090.0, "step": 32350 }, { "entropy": 6.0012282371521, "epoch": 3.234218023691708, "grad_norm": 1.15625, "learning_rate": 0.00039757670555195114, "loss": 5.4822, "mean_token_accuracy": 0.19337985217571257, "num_tokens": 63297443.0, "step": 32355 }, { "entropy": 5.979399061203003, "epoch": 3.2347178487529367, "grad_norm": 1.1171875, "learning_rate": 0.00039754677600287923, "loss": 5.4565, "mean_token_accuracy": 0.18965043723583222, "num_tokens": 63306485.0, "step": 32360 }, { "entropy": 5.96643328666687, "epoch": 3.235217673814165, "grad_norm": 1.109375, "learning_rate": 0.00039751684337056197, "loss": 5.4033, "mean_token_accuracy": 0.20225052535533905, "num_tokens": 63315872.0, "step": 32365 }, { "entropy": 5.938296175003051, "epoch": 3.2357174988753936, "grad_norm": 1.2265625, "learning_rate": 0.0003974869076557525, "loss": 5.373, "mean_token_accuracy": 0.1901915431022644, "num_tokens": 63325778.0, "step": 32370 }, { "entropy": 5.9178002834320065, "epoch": 3.2362173239366223, "grad_norm": 1.21875, "learning_rate": 0.0003974569688592038, "loss": 5.372, "mean_token_accuracy": 0.20267438739538193, "num_tokens": 63335312.0, "step": 32375 }, { "entropy": 5.945513439178467, "epoch": 3.2367171489978506, "grad_norm": 1.2421875, "learning_rate": 0.0003974270269816695, "loss": 5.4569, "mean_token_accuracy": 0.19776187241077423, "num_tokens": 63344338.0, "step": 32380 }, { "entropy": 6.000157833099365, "epoch": 3.2372169740590793, "grad_norm": 1.1328125, "learning_rate": 0.00039739708202390255, "loss": 5.4808, "mean_token_accuracy": 0.19030797183513642, "num_tokens": 63353775.0, "step": 32385 }, { "entropy": 6.018087673187256, "epoch": 3.237716799120308, "grad_norm": 1.1171875, "learning_rate": 0.0003973671339866566, "loss": 5.5197, "mean_token_accuracy": 0.18502146303653716, "num_tokens": 63363474.0, "step": 32390 }, { "entropy": 5.971002244949341, "epoch": 3.2382166241815367, "grad_norm": 1.1328125, "learning_rate": 0.00039733718287068495, "loss": 5.4924, "mean_token_accuracy": 0.19443051964044572, "num_tokens": 63374120.0, "step": 32395 }, { "entropy": 6.00261664390564, "epoch": 3.238716449242765, "grad_norm": 1.140625, "learning_rate": 0.0003973072286767413, "loss": 5.4742, "mean_token_accuracy": 0.19164223372936248, "num_tokens": 63384206.0, "step": 32400 }, { "entropy": 5.798675632476806, "epoch": 3.2392162743039936, "grad_norm": 1.0390625, "learning_rate": 0.0003972772714055793, "loss": 5.2737, "mean_token_accuracy": 0.20901548266410827, "num_tokens": 63394354.0, "step": 32405 }, { "entropy": 5.994867944717408, "epoch": 3.2397160993652223, "grad_norm": 1.0703125, "learning_rate": 0.00039724731105795255, "loss": 5.466, "mean_token_accuracy": 0.1963673412799835, "num_tokens": 63403758.0, "step": 32410 }, { "entropy": 5.9399913311004635, "epoch": 3.2402159244264506, "grad_norm": 1.1875, "learning_rate": 0.000397217347634615, "loss": 5.446, "mean_token_accuracy": 0.19341851621866227, "num_tokens": 63413539.0, "step": 32415 }, { "entropy": 5.9856616973876955, "epoch": 3.2407157494876793, "grad_norm": 1.09375, "learning_rate": 0.0003971873811363203, "loss": 5.5151, "mean_token_accuracy": 0.18972061276435853, "num_tokens": 63423577.0, "step": 32420 }, { "entropy": 5.9915224552154545, "epoch": 3.241215574548908, "grad_norm": 1.1484375, "learning_rate": 0.00039715741156382255, "loss": 5.4865, "mean_token_accuracy": 0.19524515867233277, "num_tokens": 63433483.0, "step": 32425 }, { "entropy": 6.015208911895752, "epoch": 3.241715399610136, "grad_norm": 1.125, "learning_rate": 0.0003971274389178759, "loss": 5.4733, "mean_token_accuracy": 0.19445499926805496, "num_tokens": 63443341.0, "step": 32430 }, { "entropy": 5.899695825576782, "epoch": 3.242215224671365, "grad_norm": 1.15625, "learning_rate": 0.0003970974631992342, "loss": 5.3698, "mean_token_accuracy": 0.20037556439638138, "num_tokens": 63452783.0, "step": 32435 }, { "entropy": 6.034071731567383, "epoch": 3.2427150497325936, "grad_norm": 1.15625, "learning_rate": 0.0003970674844086517, "loss": 5.5289, "mean_token_accuracy": 0.1883870467543602, "num_tokens": 63463420.0, "step": 32440 }, { "entropy": 5.969696140289306, "epoch": 3.2432148747938223, "grad_norm": 1.203125, "learning_rate": 0.0003970375025468829, "loss": 5.3979, "mean_token_accuracy": 0.19731472730636596, "num_tokens": 63472405.0, "step": 32445 }, { "entropy": 5.964757347106934, "epoch": 3.2437146998550506, "grad_norm": 1.1953125, "learning_rate": 0.00039700751761468175, "loss": 5.487, "mean_token_accuracy": 0.19593070447444916, "num_tokens": 63481242.0, "step": 32450 }, { "entropy": 5.9313397884368895, "epoch": 3.2442145249162793, "grad_norm": 1.140625, "learning_rate": 0.0003969775296128029, "loss": 5.4303, "mean_token_accuracy": 0.2022685945034027, "num_tokens": 63492244.0, "step": 32455 }, { "entropy": 5.995953464508057, "epoch": 3.244714349977508, "grad_norm": 1.2109375, "learning_rate": 0.0003969475385420008, "loss": 5.4458, "mean_token_accuracy": 0.19367871135473252, "num_tokens": 63501117.0, "step": 32460 }, { "entropy": 6.076545476913452, "epoch": 3.245214175038736, "grad_norm": 1.0859375, "learning_rate": 0.00039691754440303003, "loss": 5.549, "mean_token_accuracy": 0.18655347526073457, "num_tokens": 63509603.0, "step": 32465 }, { "entropy": 5.99781436920166, "epoch": 3.245714000099965, "grad_norm": 1.03125, "learning_rate": 0.00039688754719664516, "loss": 5.5175, "mean_token_accuracy": 0.1906546637415886, "num_tokens": 63519600.0, "step": 32470 }, { "entropy": 5.965010023117065, "epoch": 3.2462138251611936, "grad_norm": 1.1328125, "learning_rate": 0.000396857546923601, "loss": 5.4798, "mean_token_accuracy": 0.19504607617855071, "num_tokens": 63529712.0, "step": 32475 }, { "entropy": 5.917618179321289, "epoch": 3.2467136502224223, "grad_norm": 1.0234375, "learning_rate": 0.0003968275435846523, "loss": 5.4277, "mean_token_accuracy": 0.19459076821804047, "num_tokens": 63540327.0, "step": 32480 }, { "entropy": 5.912710189819336, "epoch": 3.2472134752836506, "grad_norm": 1.0859375, "learning_rate": 0.000396797537180554, "loss": 5.3928, "mean_token_accuracy": 0.20077248960733413, "num_tokens": 63549898.0, "step": 32485 }, { "entropy": 5.913759088516235, "epoch": 3.2477133003448793, "grad_norm": 1.0546875, "learning_rate": 0.000396767527712061, "loss": 5.3789, "mean_token_accuracy": 0.20283818542957305, "num_tokens": 63559296.0, "step": 32490 }, { "entropy": 5.963737869262696, "epoch": 3.248213125406108, "grad_norm": 1.25, "learning_rate": 0.00039673751517992827, "loss": 5.5018, "mean_token_accuracy": 0.193226720392704, "num_tokens": 63568464.0, "step": 32495 }, { "entropy": 5.971447896957398, "epoch": 3.248712950467336, "grad_norm": 1.1484375, "learning_rate": 0.00039670749958491103, "loss": 5.5035, "mean_token_accuracy": 0.18985623121261597, "num_tokens": 63577623.0, "step": 32500 }, { "entropy": 5.969267463684082, "epoch": 3.249212775528565, "grad_norm": 1.125, "learning_rate": 0.00039667748092776453, "loss": 5.3488, "mean_token_accuracy": 0.19808870404958726, "num_tokens": 63586809.0, "step": 32505 }, { "entropy": 5.947438430786133, "epoch": 3.2497126005897936, "grad_norm": 1.609375, "learning_rate": 0.00039664745920924374, "loss": 5.4723, "mean_token_accuracy": 0.19350059032440187, "num_tokens": 63597262.0, "step": 32510 }, { "entropy": 5.935785961151123, "epoch": 3.2502124256510223, "grad_norm": 1.03125, "learning_rate": 0.0003966174344301043, "loss": 5.4494, "mean_token_accuracy": 0.1976221263408661, "num_tokens": 63608688.0, "step": 32515 }, { "entropy": 5.911927366256714, "epoch": 3.2507122507122506, "grad_norm": 1.71875, "learning_rate": 0.0003965874065911014, "loss": 5.3404, "mean_token_accuracy": 0.2038295492529869, "num_tokens": 63619894.0, "step": 32520 }, { "entropy": 5.93956880569458, "epoch": 3.2512120757734793, "grad_norm": 1.2265625, "learning_rate": 0.00039655737569299073, "loss": 5.3595, "mean_token_accuracy": 0.19913107752799988, "num_tokens": 63628607.0, "step": 32525 }, { "entropy": 5.991753578186035, "epoch": 3.251711900834708, "grad_norm": 1.1171875, "learning_rate": 0.0003965273417365277, "loss": 5.4751, "mean_token_accuracy": 0.19137845039367676, "num_tokens": 63639058.0, "step": 32530 }, { "entropy": 5.958595943450928, "epoch": 3.252211725895936, "grad_norm": 1.140625, "learning_rate": 0.00039649730472246796, "loss": 5.3913, "mean_token_accuracy": 0.2016705483198166, "num_tokens": 63647338.0, "step": 32535 }, { "entropy": 5.908549451828003, "epoch": 3.252711550957165, "grad_norm": 1.09375, "learning_rate": 0.0003964672646515674, "loss": 5.3733, "mean_token_accuracy": 0.1995784729719162, "num_tokens": 63657990.0, "step": 32540 }, { "entropy": 6.009171199798584, "epoch": 3.2532113760183936, "grad_norm": 1.21875, "learning_rate": 0.0003964372215245817, "loss": 5.5321, "mean_token_accuracy": 0.18942881524562835, "num_tokens": 63667310.0, "step": 32545 }, { "entropy": 5.949365186691284, "epoch": 3.2537112010796223, "grad_norm": 1.0625, "learning_rate": 0.00039640717534226684, "loss": 5.395, "mean_token_accuracy": 0.20098046213388443, "num_tokens": 63677254.0, "step": 32550 }, { "entropy": 6.0275390625, "epoch": 3.2542110261408506, "grad_norm": 1.5546875, "learning_rate": 0.0003963771261053786, "loss": 5.4972, "mean_token_accuracy": 0.18634617775678636, "num_tokens": 63686441.0, "step": 32555 }, { "entropy": 5.8771219730377195, "epoch": 3.2547108512020793, "grad_norm": 1.1796875, "learning_rate": 0.00039634707381467303, "loss": 5.3824, "mean_token_accuracy": 0.21153170764446258, "num_tokens": 63696445.0, "step": 32560 }, { "entropy": 6.0427404880523685, "epoch": 3.255210676263308, "grad_norm": 1.0625, "learning_rate": 0.0003963170184709064, "loss": 5.5254, "mean_token_accuracy": 0.19048393219709397, "num_tokens": 63706536.0, "step": 32565 }, { "entropy": 5.991190433502197, "epoch": 3.255710501324536, "grad_norm": 1.171875, "learning_rate": 0.00039628696007483477, "loss": 5.4749, "mean_token_accuracy": 0.1909590020775795, "num_tokens": 63716752.0, "step": 32570 }, { "entropy": 5.989365339279175, "epoch": 3.256210326385765, "grad_norm": 1.1171875, "learning_rate": 0.00039625689862721447, "loss": 5.4653, "mean_token_accuracy": 0.19581492096185685, "num_tokens": 63726995.0, "step": 32575 }, { "entropy": 5.998375129699707, "epoch": 3.2567101514469936, "grad_norm": 1.2265625, "learning_rate": 0.00039622683412880174, "loss": 5.3851, "mean_token_accuracy": 0.20347429811954498, "num_tokens": 63735261.0, "step": 32580 }, { "entropy": 6.012545013427735, "epoch": 3.2572099765082223, "grad_norm": 1.1015625, "learning_rate": 0.0003961967665803532, "loss": 5.4822, "mean_token_accuracy": 0.200266532599926, "num_tokens": 63746307.0, "step": 32585 }, { "entropy": 5.985945415496826, "epoch": 3.2577098015694506, "grad_norm": 1.28125, "learning_rate": 0.00039616669598262504, "loss": 5.5148, "mean_token_accuracy": 0.18986794352531433, "num_tokens": 63755802.0, "step": 32590 }, { "entropy": 5.893173789978027, "epoch": 3.2582096266306793, "grad_norm": 1.09375, "learning_rate": 0.00039613662233637406, "loss": 5.4075, "mean_token_accuracy": 0.19969454407691956, "num_tokens": 63765759.0, "step": 32595 }, { "entropy": 6.049416780471802, "epoch": 3.258709451691908, "grad_norm": 1.1484375, "learning_rate": 0.00039610654564235684, "loss": 5.5199, "mean_token_accuracy": 0.19321747571229936, "num_tokens": 63775528.0, "step": 32600 }, { "entropy": 5.955934286117554, "epoch": 3.259209276753136, "grad_norm": 1.078125, "learning_rate": 0.0003960764659013301, "loss": 5.3845, "mean_token_accuracy": 0.20289321839809418, "num_tokens": 63785480.0, "step": 32605 }, { "entropy": 5.908633756637573, "epoch": 3.259709101814365, "grad_norm": 1.2421875, "learning_rate": 0.0003960463831140505, "loss": 5.3006, "mean_token_accuracy": 0.2090962275862694, "num_tokens": 63793710.0, "step": 32610 }, { "entropy": 5.986551904678345, "epoch": 3.2602089268755936, "grad_norm": 1.3203125, "learning_rate": 0.00039601629728127524, "loss": 5.5382, "mean_token_accuracy": 0.1934936299920082, "num_tokens": 63802664.0, "step": 32615 }, { "entropy": 5.827068614959717, "epoch": 3.2607087519368223, "grad_norm": 1.03125, "learning_rate": 0.00039598620840376096, "loss": 5.1774, "mean_token_accuracy": 0.22475902885198593, "num_tokens": 63813146.0, "step": 32620 }, { "entropy": 5.989646625518799, "epoch": 3.2612085769980506, "grad_norm": 1.09375, "learning_rate": 0.00039595611648226485, "loss": 5.5118, "mean_token_accuracy": 0.19027557075023652, "num_tokens": 63823182.0, "step": 32625 }, { "entropy": 5.912678194046021, "epoch": 3.2617084020592793, "grad_norm": 1.171875, "learning_rate": 0.000395926021517544, "loss": 5.4353, "mean_token_accuracy": 0.19567957073450087, "num_tokens": 63832370.0, "step": 32630 }, { "entropy": 5.898246765136719, "epoch": 3.262208227120508, "grad_norm": 1.015625, "learning_rate": 0.00039589592351035554, "loss": 5.4377, "mean_token_accuracy": 0.19987795650959014, "num_tokens": 63843156.0, "step": 32635 }, { "entropy": 6.04361047744751, "epoch": 3.262708052181736, "grad_norm": 1.1015625, "learning_rate": 0.0003958658224614567, "loss": 5.5326, "mean_token_accuracy": 0.19348996132612228, "num_tokens": 63852744.0, "step": 32640 }, { "entropy": 5.980628252029419, "epoch": 3.263207877242965, "grad_norm": 1.015625, "learning_rate": 0.00039583571837160497, "loss": 5.3801, "mean_token_accuracy": 0.20639743357896806, "num_tokens": 63862694.0, "step": 32645 }, { "entropy": 5.884800148010254, "epoch": 3.2637077023041936, "grad_norm": 1.109375, "learning_rate": 0.0003958056112415576, "loss": 5.423, "mean_token_accuracy": 0.19404355734586715, "num_tokens": 63871943.0, "step": 32650 }, { "entropy": 5.951906681060791, "epoch": 3.2642075273654223, "grad_norm": 1.203125, "learning_rate": 0.0003957755010720721, "loss": 5.4401, "mean_token_accuracy": 0.20310761034488678, "num_tokens": 63881354.0, "step": 32655 }, { "entropy": 5.9902876853942875, "epoch": 3.2647073524266506, "grad_norm": 1.046875, "learning_rate": 0.00039574538786390617, "loss": 5.4728, "mean_token_accuracy": 0.19310243427753448, "num_tokens": 63890750.0, "step": 32660 }, { "entropy": 6.034393358230591, "epoch": 3.2652071774878793, "grad_norm": 1.3046875, "learning_rate": 0.0003957152716178173, "loss": 5.4966, "mean_token_accuracy": 0.18786927610635756, "num_tokens": 63900730.0, "step": 32665 }, { "entropy": 5.8904547691345215, "epoch": 3.265707002549108, "grad_norm": 1.0390625, "learning_rate": 0.00039568515233456326, "loss": 5.5274, "mean_token_accuracy": 0.18830336332321168, "num_tokens": 63911812.0, "step": 32670 }, { "entropy": 5.946032333374023, "epoch": 3.266206827610336, "grad_norm": 1.15625, "learning_rate": 0.0003956550300149018, "loss": 5.4465, "mean_token_accuracy": 0.19210401624441148, "num_tokens": 63920785.0, "step": 32675 }, { "entropy": 5.99282054901123, "epoch": 3.266706652671565, "grad_norm": 1.1484375, "learning_rate": 0.0003956249046595909, "loss": 5.4377, "mean_token_accuracy": 0.19841964095830916, "num_tokens": 63931167.0, "step": 32680 }, { "entropy": 6.043642330169678, "epoch": 3.2672064777327936, "grad_norm": 1.0546875, "learning_rate": 0.0003955947762693884, "loss": 5.5235, "mean_token_accuracy": 0.18476913422346114, "num_tokens": 63941448.0, "step": 32685 }, { "entropy": 6.091418218612671, "epoch": 3.2677063027940223, "grad_norm": 1.109375, "learning_rate": 0.00039556464484505235, "loss": 5.513, "mean_token_accuracy": 0.18360398411750795, "num_tokens": 63951412.0, "step": 32690 }, { "entropy": 6.023193454742431, "epoch": 3.2682061278552506, "grad_norm": 1.1484375, "learning_rate": 0.0003955345103873409, "loss": 5.5602, "mean_token_accuracy": 0.18616772443056107, "num_tokens": 63960957.0, "step": 32695 }, { "entropy": 5.916533184051514, "epoch": 3.2687059529164793, "grad_norm": 1.171875, "learning_rate": 0.0003955043728970121, "loss": 5.497, "mean_token_accuracy": 0.1933011904358864, "num_tokens": 63970229.0, "step": 32700 }, { "entropy": 5.9458503246307375, "epoch": 3.269205777977708, "grad_norm": 1.2734375, "learning_rate": 0.0003954742323748244, "loss": 5.4396, "mean_token_accuracy": 0.1968454658985138, "num_tokens": 63979816.0, "step": 32705 }, { "entropy": 5.953328657150268, "epoch": 3.269705603038936, "grad_norm": 1.125, "learning_rate": 0.00039544408882153596, "loss": 5.2956, "mean_token_accuracy": 0.21041571497917175, "num_tokens": 63989612.0, "step": 32710 }, { "entropy": 6.001097822189331, "epoch": 3.270205428100165, "grad_norm": 0.96875, "learning_rate": 0.0003954139422379052, "loss": 5.4835, "mean_token_accuracy": 0.18749974370002748, "num_tokens": 64001254.0, "step": 32715 }, { "entropy": 5.923443078994751, "epoch": 3.2707052531613936, "grad_norm": 1.1015625, "learning_rate": 0.0003953837926246907, "loss": 5.4549, "mean_token_accuracy": 0.19719965010881424, "num_tokens": 64011235.0, "step": 32720 }, { "entropy": 5.920061826705933, "epoch": 3.2712050782226223, "grad_norm": 1.1328125, "learning_rate": 0.00039535363998265095, "loss": 5.4365, "mean_token_accuracy": 0.1908642277121544, "num_tokens": 64020437.0, "step": 32725 }, { "entropy": 6.063912677764892, "epoch": 3.2717049032838506, "grad_norm": 1.140625, "learning_rate": 0.00039532348431254455, "loss": 5.5914, "mean_token_accuracy": 0.18496422320604325, "num_tokens": 64030930.0, "step": 32730 }, { "entropy": 5.970167922973633, "epoch": 3.2722047283450792, "grad_norm": 1.1484375, "learning_rate": 0.0003952933256151303, "loss": 5.4275, "mean_token_accuracy": 0.20161616057157516, "num_tokens": 64041175.0, "step": 32735 }, { "entropy": 5.978709745407104, "epoch": 3.272704553406308, "grad_norm": 1.1484375, "learning_rate": 0.0003952631638911669, "loss": 5.3933, "mean_token_accuracy": 0.19550527930259703, "num_tokens": 64050208.0, "step": 32740 }, { "entropy": 5.997635459899902, "epoch": 3.273204378467536, "grad_norm": 1.1796875, "learning_rate": 0.0003952329991414132, "loss": 5.4791, "mean_token_accuracy": 0.19290563762187957, "num_tokens": 64060303.0, "step": 32745 }, { "entropy": 5.972135210037232, "epoch": 3.273704203528765, "grad_norm": 1.140625, "learning_rate": 0.00039520283136662825, "loss": 5.4367, "mean_token_accuracy": 0.19364765137434006, "num_tokens": 64070240.0, "step": 32750 }, { "entropy": 6.089263486862182, "epoch": 3.2742040285899936, "grad_norm": 1.0390625, "learning_rate": 0.00039517266056757097, "loss": 5.6754, "mean_token_accuracy": 0.1754453957080841, "num_tokens": 64080836.0, "step": 32755 }, { "entropy": 6.000471591949463, "epoch": 3.2747038536512223, "grad_norm": 1.1640625, "learning_rate": 0.00039514248674500055, "loss": 5.4682, "mean_token_accuracy": 0.1985825330018997, "num_tokens": 64090533.0, "step": 32760 }, { "entropy": 5.947028636932373, "epoch": 3.2752036787124506, "grad_norm": 1.171875, "learning_rate": 0.00039511230989967594, "loss": 5.3907, "mean_token_accuracy": 0.19812233746051788, "num_tokens": 64100156.0, "step": 32765 }, { "entropy": 5.9004558563232425, "epoch": 3.2757035037736792, "grad_norm": 1.15625, "learning_rate": 0.0003950821300323566, "loss": 5.3897, "mean_token_accuracy": 0.19731011092662812, "num_tokens": 64108906.0, "step": 32770 }, { "entropy": 5.929925870895386, "epoch": 3.276203328834908, "grad_norm": 1.140625, "learning_rate": 0.0003950519471438017, "loss": 5.4379, "mean_token_accuracy": 0.20190121680498124, "num_tokens": 64118361.0, "step": 32775 }, { "entropy": 6.064482545852661, "epoch": 3.276703153896136, "grad_norm": 1.1484375, "learning_rate": 0.00039502176123477076, "loss": 5.6012, "mean_token_accuracy": 0.18348991870880127, "num_tokens": 64128978.0, "step": 32780 }, { "entropy": 6.002956295013428, "epoch": 3.277202978957365, "grad_norm": 0.94140625, "learning_rate": 0.00039499157230602313, "loss": 5.4245, "mean_token_accuracy": 0.20104742795228958, "num_tokens": 64139424.0, "step": 32785 }, { "entropy": 5.979306030273437, "epoch": 3.2777028040185936, "grad_norm": 1.109375, "learning_rate": 0.00039496138035831845, "loss": 5.5018, "mean_token_accuracy": 0.19063517600297927, "num_tokens": 64149814.0, "step": 32790 }, { "entropy": 5.994144058227539, "epoch": 3.2782026290798223, "grad_norm": 1.078125, "learning_rate": 0.00039493118539241643, "loss": 5.5089, "mean_token_accuracy": 0.18826308995485305, "num_tokens": 64159777.0, "step": 32795 }, { "entropy": 5.935672664642334, "epoch": 3.2787024541410505, "grad_norm": 1.0625, "learning_rate": 0.00039490098740907654, "loss": 5.3805, "mean_token_accuracy": 0.20332874804735185, "num_tokens": 64170241.0, "step": 32800 }, { "entropy": 5.907087659835815, "epoch": 3.2792022792022792, "grad_norm": 1.046875, "learning_rate": 0.00039487078640905866, "loss": 5.3797, "mean_token_accuracy": 0.1994429662823677, "num_tokens": 64180514.0, "step": 32805 }, { "entropy": 5.957804012298584, "epoch": 3.279702104263508, "grad_norm": 1.125, "learning_rate": 0.00039484058239312264, "loss": 5.4851, "mean_token_accuracy": 0.19189665615558624, "num_tokens": 64191184.0, "step": 32810 }, { "entropy": 6.015394878387451, "epoch": 3.280201929324736, "grad_norm": 1.1796875, "learning_rate": 0.00039481037536202835, "loss": 5.4771, "mean_token_accuracy": 0.19653286635875702, "num_tokens": 64201134.0, "step": 32815 }, { "entropy": 6.007282352447509, "epoch": 3.280701754385965, "grad_norm": 1.234375, "learning_rate": 0.00039478016531653586, "loss": 5.415, "mean_token_accuracy": 0.19773150980472565, "num_tokens": 64210578.0, "step": 32820 }, { "entropy": 6.0441371440887455, "epoch": 3.2812015794471936, "grad_norm": 1.078125, "learning_rate": 0.00039474995225740526, "loss": 5.6108, "mean_token_accuracy": 0.1851646140217781, "num_tokens": 64219762.0, "step": 32825 }, { "entropy": 5.938585567474365, "epoch": 3.2817014045084223, "grad_norm": 1.03125, "learning_rate": 0.0003947197361853968, "loss": 5.4219, "mean_token_accuracy": 0.1977101296186447, "num_tokens": 64230371.0, "step": 32830 }, { "entropy": 5.9383721351623535, "epoch": 3.2822012295696505, "grad_norm": 1.203125, "learning_rate": 0.00039468951710127043, "loss": 5.4951, "mean_token_accuracy": 0.1996215507388115, "num_tokens": 64239154.0, "step": 32835 }, { "entropy": 5.9371413230896, "epoch": 3.2827010546308792, "grad_norm": 1.1484375, "learning_rate": 0.0003946592950057867, "loss": 5.4221, "mean_token_accuracy": 0.20122209638357164, "num_tokens": 64249257.0, "step": 32840 }, { "entropy": 6.0398822784423825, "epoch": 3.283200879692108, "grad_norm": 1.1796875, "learning_rate": 0.0003946290698997058, "loss": 5.4974, "mean_token_accuracy": 0.19162861555814742, "num_tokens": 64259171.0, "step": 32845 }, { "entropy": 5.900046300888062, "epoch": 3.283700704753336, "grad_norm": 1.140625, "learning_rate": 0.0003945988417837883, "loss": 5.3103, "mean_token_accuracy": 0.20960710644721986, "num_tokens": 64268178.0, "step": 32850 }, { "entropy": 5.98159122467041, "epoch": 3.284200529814565, "grad_norm": 1.21875, "learning_rate": 0.0003945686106587948, "loss": 5.5126, "mean_token_accuracy": 0.18921183049678802, "num_tokens": 64278136.0, "step": 32855 }, { "entropy": 5.883253765106201, "epoch": 3.2847003548757936, "grad_norm": 1.03125, "learning_rate": 0.00039453837652548575, "loss": 5.3982, "mean_token_accuracy": 0.19769660532474517, "num_tokens": 64288305.0, "step": 32860 }, { "entropy": 5.922656011581421, "epoch": 3.2852001799370223, "grad_norm": 1.1171875, "learning_rate": 0.00039450813938462197, "loss": 5.403, "mean_token_accuracy": 0.20403777062892914, "num_tokens": 64297636.0, "step": 32865 }, { "entropy": 5.999955844879151, "epoch": 3.2857000049982505, "grad_norm": 1.1640625, "learning_rate": 0.00039447789923696415, "loss": 5.4329, "mean_token_accuracy": 0.20167066305875778, "num_tokens": 64306706.0, "step": 32870 }, { "entropy": 5.942225408554077, "epoch": 3.2861998300594792, "grad_norm": 1.2890625, "learning_rate": 0.000394447656083273, "loss": 5.4088, "mean_token_accuracy": 0.1963708594441414, "num_tokens": 64316909.0, "step": 32875 }, { "entropy": 5.893703460693359, "epoch": 3.286699655120708, "grad_norm": 1.140625, "learning_rate": 0.00039441740992430965, "loss": 5.3843, "mean_token_accuracy": 0.1995649218559265, "num_tokens": 64326103.0, "step": 32880 }, { "entropy": 5.969772529602051, "epoch": 3.287199480181936, "grad_norm": 1.1875, "learning_rate": 0.00039438716076083504, "loss": 5.4347, "mean_token_accuracy": 0.19892969578504563, "num_tokens": 64334915.0, "step": 32885 }, { "entropy": 5.775533866882324, "epoch": 3.287699305243165, "grad_norm": 1.0078125, "learning_rate": 0.00039435690859361013, "loss": 5.3884, "mean_token_accuracy": 0.20987465381622314, "num_tokens": 64344102.0, "step": 32890 }, { "entropy": 5.893475961685181, "epoch": 3.2881991303043936, "grad_norm": 1.0546875, "learning_rate": 0.00039432665342339614, "loss": 5.4373, "mean_token_accuracy": 0.19906232208013536, "num_tokens": 64353011.0, "step": 32895 }, { "entropy": 5.9246190071105955, "epoch": 3.288698955365622, "grad_norm": 1.265625, "learning_rate": 0.0003942963952509543, "loss": 5.3926, "mean_token_accuracy": 0.19638497531414031, "num_tokens": 64361658.0, "step": 32900 }, { "entropy": 6.036815547943116, "epoch": 3.2891987804268505, "grad_norm": 1.015625, "learning_rate": 0.00039426613407704574, "loss": 5.5908, "mean_token_accuracy": 0.1855558693408966, "num_tokens": 64371878.0, "step": 32905 }, { "entropy": 6.002215623855591, "epoch": 3.2896986054880792, "grad_norm": 1.0234375, "learning_rate": 0.000394235869902432, "loss": 5.4211, "mean_token_accuracy": 0.19577086567878724, "num_tokens": 64381896.0, "step": 32910 }, { "entropy": 5.985514688491821, "epoch": 3.2901984305493075, "grad_norm": 1.109375, "learning_rate": 0.00039420560272787446, "loss": 5.5043, "mean_token_accuracy": 0.18994371443986893, "num_tokens": 64391618.0, "step": 32915 }, { "entropy": 5.972357225418091, "epoch": 3.290698255610536, "grad_norm": 1.1015625, "learning_rate": 0.00039417533255413465, "loss": 5.4607, "mean_token_accuracy": 0.194880847632885, "num_tokens": 64402165.0, "step": 32920 }, { "entropy": 6.02699728012085, "epoch": 3.291198080671765, "grad_norm": 1.1484375, "learning_rate": 0.00039414505938197404, "loss": 5.5434, "mean_token_accuracy": 0.18551586121320723, "num_tokens": 64411334.0, "step": 32925 }, { "entropy": 6.051137065887451, "epoch": 3.2916979057329936, "grad_norm": 1.1953125, "learning_rate": 0.0003941147832121545, "loss": 5.4624, "mean_token_accuracy": 0.19409819394350053, "num_tokens": 64420985.0, "step": 32930 }, { "entropy": 5.997770023345947, "epoch": 3.292197730794222, "grad_norm": 1.15625, "learning_rate": 0.0003940845040454376, "loss": 5.5013, "mean_token_accuracy": 0.1922399193048477, "num_tokens": 64430141.0, "step": 32935 }, { "entropy": 5.918601417541504, "epoch": 3.2926975558554505, "grad_norm": 1.140625, "learning_rate": 0.0003940542218825853, "loss": 5.4272, "mean_token_accuracy": 0.19425111562013625, "num_tokens": 64440321.0, "step": 32940 }, { "entropy": 5.919700336456299, "epoch": 3.2931973809166792, "grad_norm": 1.140625, "learning_rate": 0.00039402393672435934, "loss": 5.4841, "mean_token_accuracy": 0.19722367972135543, "num_tokens": 64449422.0, "step": 32945 }, { "entropy": 6.0273191928863525, "epoch": 3.2936972059779075, "grad_norm": 1.1640625, "learning_rate": 0.00039399364857152177, "loss": 5.5675, "mean_token_accuracy": 0.18517733812332154, "num_tokens": 64459179.0, "step": 32950 }, { "entropy": 5.974307060241699, "epoch": 3.294197031039136, "grad_norm": 1.1328125, "learning_rate": 0.0003939633574248346, "loss": 5.4029, "mean_token_accuracy": 0.2018720880150795, "num_tokens": 64468454.0, "step": 32955 }, { "entropy": 5.897057056427002, "epoch": 3.294696856100365, "grad_norm": 1.1484375, "learning_rate": 0.00039393306328506004, "loss": 5.4207, "mean_token_accuracy": 0.2072811871767044, "num_tokens": 64478374.0, "step": 32960 }, { "entropy": 5.985844087600708, "epoch": 3.2951966811615936, "grad_norm": 1.0546875, "learning_rate": 0.00039390276615296015, "loss": 5.5105, "mean_token_accuracy": 0.19520298838615419, "num_tokens": 64489692.0, "step": 32965 }, { "entropy": 6.008019018173218, "epoch": 3.295696506222822, "grad_norm": 1.171875, "learning_rate": 0.00039387246602929726, "loss": 5.4418, "mean_token_accuracy": 0.20357026308774948, "num_tokens": 64500167.0, "step": 32970 }, { "entropy": 6.030167198181152, "epoch": 3.2961963312840505, "grad_norm": 1.4921875, "learning_rate": 0.0003938421629148338, "loss": 5.4833, "mean_token_accuracy": 0.1901509091258049, "num_tokens": 64509973.0, "step": 32975 }, { "entropy": 5.983188199996948, "epoch": 3.2966961563452792, "grad_norm": 1.1484375, "learning_rate": 0.000393811856810332, "loss": 5.4917, "mean_token_accuracy": 0.19164818227291108, "num_tokens": 64519926.0, "step": 32980 }, { "entropy": 6.025173282623291, "epoch": 3.2971959814065075, "grad_norm": 1.1328125, "learning_rate": 0.0003937815477165545, "loss": 5.5386, "mean_token_accuracy": 0.19527139961719514, "num_tokens": 64529770.0, "step": 32985 }, { "entropy": 5.9973344802856445, "epoch": 3.297695806467736, "grad_norm": 1.03125, "learning_rate": 0.0003937512356342638, "loss": 5.3327, "mean_token_accuracy": 0.20868856757879256, "num_tokens": 64539867.0, "step": 32990 }, { "entropy": 5.9944030284881595, "epoch": 3.298195631528965, "grad_norm": 1.0703125, "learning_rate": 0.0003937209205642226, "loss": 5.422, "mean_token_accuracy": 0.20812058746814727, "num_tokens": 64549276.0, "step": 32995 }, { "entropy": 5.979561710357666, "epoch": 3.2986954565901936, "grad_norm": 1.15625, "learning_rate": 0.0003936906025071936, "loss": 5.5154, "mean_token_accuracy": 0.19104951471090317, "num_tokens": 64559294.0, "step": 33000 }, { "epoch": 3.2986954565901936, "eval_entropy": 5.761125814788767, "eval_loss": 5.603759288787842, "eval_mean_token_accuracy": 0.19607604573668203, "eval_num_tokens": 64559294.0, "eval_runtime": 24.387, "eval_samples_per_second": 1273.015, "eval_steps_per_second": 159.142, "step": 33000 } ], "logging_steps": 5, "max_steps": 100030, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.02454941044736e+17, "train_batch_size": 16, "trial_name": null, "trial_params": null }