{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.08937848436435139, "eval_steps": 500, "global_step": 4000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.69185152053833, "epoch": 0.00011172310545543924, "grad_norm": 18.5, "learning_rate": 2e-06, "loss": 10.5751, "mean_token_accuracy": 0.00030030030757188797, "num_tokens": 4264.0, "step": 5 }, { "entropy": 10.691861820220947, "epoch": 0.00022344621091087847, "grad_norm": 16.75, "learning_rate": 4.5e-06, "loss": 10.4625, "mean_token_accuracy": 0.0, "num_tokens": 8413.0, "step": 10 }, { "entropy": 10.690832233428955, "epoch": 0.0003351693163663177, "grad_norm": 13.4375, "learning_rate": 7e-06, "loss": 10.1956, "mean_token_accuracy": 0.03499803415033966, "num_tokens": 12394.0, "step": 15 }, { "entropy": 10.681817626953125, "epoch": 0.00044689242182175694, "grad_norm": 8.4375, "learning_rate": 9.5e-06, "loss": 9.8891, "mean_token_accuracy": 0.052673622593283655, "num_tokens": 16610.0, "step": 20 }, { "entropy": 10.648191356658936, "epoch": 0.0005586155272771962, "grad_norm": 5.84375, "learning_rate": 1.2e-05, "loss": 9.6415, "mean_token_accuracy": 0.059712447226047516, "num_tokens": 21243.0, "step": 25 }, { "entropy": 10.600524044036865, "epoch": 0.0006703386327326354, "grad_norm": 4.21875, "learning_rate": 1.4500000000000002e-05, "loss": 9.3955, "mean_token_accuracy": 0.06313439272344112, "num_tokens": 25571.0, "step": 30 }, { "entropy": 10.565627956390381, "epoch": 0.0007820617381880747, "grad_norm": 4.28125, "learning_rate": 1.7000000000000003e-05, "loss": 9.2501, "mean_token_accuracy": 0.058146678283810614, "num_tokens": 29412.0, "step": 35 }, { "entropy": 10.537028217315674, "epoch": 0.0008937848436435139, "grad_norm": 3.796875, "learning_rate": 1.95e-05, "loss": 9.2173, "mean_token_accuracy": 0.061766361258924006, "num_tokens": 33893.0, "step": 40 }, { "entropy": 10.526171112060547, "epoch": 0.0010055079490989532, "grad_norm": 3.765625, "learning_rate": 2.2e-05, "loss": 9.1499, "mean_token_accuracy": 0.06647200398147106, "num_tokens": 38043.0, "step": 45 }, { "entropy": 10.459559440612793, "epoch": 0.0011172310545543925, "grad_norm": 3.296875, "learning_rate": 2.4500000000000003e-05, "loss": 9.0927, "mean_token_accuracy": 0.06208832561969757, "num_tokens": 42222.0, "step": 50 }, { "entropy": 10.321250820159912, "epoch": 0.0012289541600098315, "grad_norm": 3.640625, "learning_rate": 2.7e-05, "loss": 8.9929, "mean_token_accuracy": 0.06888641528785229, "num_tokens": 46321.0, "step": 55 }, { "entropy": 10.221459579467773, "epoch": 0.0013406772654652708, "grad_norm": 3.140625, "learning_rate": 2.95e-05, "loss": 9.0121, "mean_token_accuracy": 0.07621248066425323, "num_tokens": 50816.0, "step": 60 }, { "entropy": 10.167527294158935, "epoch": 0.0014524003709207101, "grad_norm": 3.046875, "learning_rate": 3.2e-05, "loss": 8.9766, "mean_token_accuracy": 0.06631188206374646, "num_tokens": 55331.0, "step": 65 }, { "entropy": 10.158582305908203, "epoch": 0.0015641234763761494, "grad_norm": 2.828125, "learning_rate": 3.4500000000000005e-05, "loss": 8.8916, "mean_token_accuracy": 0.06474936045706273, "num_tokens": 59379.0, "step": 70 }, { "entropy": 10.132518291473389, "epoch": 0.0016758465818315885, "grad_norm": 2.671875, "learning_rate": 3.7e-05, "loss": 8.7691, "mean_token_accuracy": 0.07134371958673, "num_tokens": 63463.0, "step": 75 }, { "entropy": 10.115495491027833, "epoch": 0.0017875696872870278, "grad_norm": 2.625, "learning_rate": 3.95e-05, "loss": 8.8345, "mean_token_accuracy": 0.07139550410211086, "num_tokens": 67897.0, "step": 80 }, { "entropy": 10.076316165924073, "epoch": 0.001899292792742467, "grad_norm": 2.796875, "learning_rate": 4.2000000000000004e-05, "loss": 8.6081, "mean_token_accuracy": 0.07515238299965858, "num_tokens": 71995.0, "step": 85 }, { "entropy": 10.003674030303955, "epoch": 0.0020110158981979064, "grad_norm": 2.78125, "learning_rate": 4.45e-05, "loss": 8.4613, "mean_token_accuracy": 0.07963024936616421, "num_tokens": 75745.0, "step": 90 }, { "entropy": 9.955099964141846, "epoch": 0.0021227390036533456, "grad_norm": 2.34375, "learning_rate": 4.7000000000000004e-05, "loss": 8.4039, "mean_token_accuracy": 0.0783398538827896, "num_tokens": 79641.0, "step": 95 }, { "entropy": 9.907726192474366, "epoch": 0.002234462109108785, "grad_norm": 2.15625, "learning_rate": 4.9500000000000004e-05, "loss": 8.3639, "mean_token_accuracy": 0.07564271241426468, "num_tokens": 84368.0, "step": 100 }, { "entropy": 9.777185916900635, "epoch": 0.0023461852145642242, "grad_norm": 3.046875, "learning_rate": 5.2e-05, "loss": 8.3562, "mean_token_accuracy": 0.07499068863689899, "num_tokens": 89177.0, "step": 105 }, { "entropy": 9.874152565002442, "epoch": 0.002457908320019663, "grad_norm": 2.09375, "learning_rate": 5.45e-05, "loss": 8.1616, "mean_token_accuracy": 0.08200128600001336, "num_tokens": 93266.0, "step": 110 }, { "entropy": 9.573559665679932, "epoch": 0.0025696314254751024, "grad_norm": 2.515625, "learning_rate": 5.7e-05, "loss": 8.0628, "mean_token_accuracy": 0.08064724728465081, "num_tokens": 97385.0, "step": 115 }, { "entropy": 9.477795314788818, "epoch": 0.0026813545309305417, "grad_norm": 2.03125, "learning_rate": 5.9499999999999996e-05, "loss": 7.8909, "mean_token_accuracy": 0.08364077880978585, "num_tokens": 100911.0, "step": 120 }, { "entropy": 9.406207180023193, "epoch": 0.002793077636385981, "grad_norm": 1.765625, "learning_rate": 6.2e-05, "loss": 7.8101, "mean_token_accuracy": 0.08597532883286477, "num_tokens": 104785.0, "step": 125 }, { "entropy": 9.198468017578126, "epoch": 0.0029048007418414202, "grad_norm": 2.265625, "learning_rate": 6.450000000000001e-05, "loss": 7.7507, "mean_token_accuracy": 0.08100780844688416, "num_tokens": 109434.0, "step": 130 }, { "entropy": 9.137882709503174, "epoch": 0.0030165238472968595, "grad_norm": 1.734375, "learning_rate": 6.7e-05, "loss": 7.7526, "mean_token_accuracy": 0.08647556751966476, "num_tokens": 113869.0, "step": 135 }, { "entropy": 8.982115554809571, "epoch": 0.003128246952752299, "grad_norm": 1.828125, "learning_rate": 6.950000000000001e-05, "loss": 7.6855, "mean_token_accuracy": 0.0863442875444889, "num_tokens": 118332.0, "step": 140 }, { "entropy": 8.803977680206298, "epoch": 0.003239970058207738, "grad_norm": 1.8828125, "learning_rate": 7.2e-05, "loss": 7.5951, "mean_token_accuracy": 0.07965997867286205, "num_tokens": 122140.0, "step": 145 }, { "entropy": 8.717557144165038, "epoch": 0.003351693163663177, "grad_norm": 1.796875, "learning_rate": 7.45e-05, "loss": 7.4489, "mean_token_accuracy": 0.08853708282113075, "num_tokens": 126515.0, "step": 150 }, { "entropy": 8.480121898651124, "epoch": 0.0034634162691186163, "grad_norm": 1.9375, "learning_rate": 7.7e-05, "loss": 7.5078, "mean_token_accuracy": 0.0842710092663765, "num_tokens": 130397.0, "step": 155 }, { "entropy": 8.55941562652588, "epoch": 0.0035751393745740555, "grad_norm": 1.796875, "learning_rate": 7.950000000000001e-05, "loss": 7.448, "mean_token_accuracy": 0.086439348757267, "num_tokens": 134428.0, "step": 160 }, { "entropy": 8.38999900817871, "epoch": 0.003686862480029495, "grad_norm": 2.0625, "learning_rate": 8.2e-05, "loss": 7.3523, "mean_token_accuracy": 0.09324855357408524, "num_tokens": 138294.0, "step": 165 }, { "entropy": 8.155976009368896, "epoch": 0.003798585585484934, "grad_norm": 1.4140625, "learning_rate": 8.450000000000001e-05, "loss": 7.3474, "mean_token_accuracy": 0.08743810728192329, "num_tokens": 142750.0, "step": 170 }, { "entropy": 8.256286525726319, "epoch": 0.003910308690940373, "grad_norm": 1.5390625, "learning_rate": 8.7e-05, "loss": 7.3177, "mean_token_accuracy": 0.08836911171674729, "num_tokens": 147220.0, "step": 175 }, { "entropy": 7.98900089263916, "epoch": 0.004022031796395813, "grad_norm": 1.765625, "learning_rate": 8.95e-05, "loss": 7.2059, "mean_token_accuracy": 0.09879823476076126, "num_tokens": 151396.0, "step": 180 }, { "entropy": 8.085029649734498, "epoch": 0.0041337549018512516, "grad_norm": 1.859375, "learning_rate": 9.2e-05, "loss": 7.2565, "mean_token_accuracy": 0.0990697756409645, "num_tokens": 155336.0, "step": 185 }, { "entropy": 8.046411085128785, "epoch": 0.004245478007306691, "grad_norm": 3.03125, "learning_rate": 9.45e-05, "loss": 7.2963, "mean_token_accuracy": 0.08894443586468696, "num_tokens": 159752.0, "step": 190 }, { "entropy": 8.043665552139283, "epoch": 0.00435720111276213, "grad_norm": 1.671875, "learning_rate": 9.7e-05, "loss": 7.3874, "mean_token_accuracy": 0.08465041853487491, "num_tokens": 163895.0, "step": 195 }, { "entropy": 7.914860630035401, "epoch": 0.00446892421821757, "grad_norm": 1.3984375, "learning_rate": 9.95e-05, "loss": 7.1927, "mean_token_accuracy": 0.093280029296875, "num_tokens": 168312.0, "step": 200 }, { "entropy": 7.915866088867188, "epoch": 0.004580647323673009, "grad_norm": 1.9375, "learning_rate": 0.000102, "loss": 7.2334, "mean_token_accuracy": 0.09746119827032089, "num_tokens": 172358.0, "step": 205 }, { "entropy": 7.660448884963989, "epoch": 0.0046923704291284484, "grad_norm": 1.671875, "learning_rate": 0.00010449999999999999, "loss": 7.2206, "mean_token_accuracy": 0.09569770470261574, "num_tokens": 177085.0, "step": 210 }, { "entropy": 7.943923139572144, "epoch": 0.004804093534583887, "grad_norm": 2.015625, "learning_rate": 0.000107, "loss": 7.3482, "mean_token_accuracy": 0.08808798864483833, "num_tokens": 181410.0, "step": 215 }, { "entropy": 7.640953445434571, "epoch": 0.004915816640039326, "grad_norm": 1.6875, "learning_rate": 0.0001095, "loss": 7.0931, "mean_token_accuracy": 0.0959208883345127, "num_tokens": 185649.0, "step": 220 }, { "entropy": 7.714695310592651, "epoch": 0.005027539745494766, "grad_norm": 1.609375, "learning_rate": 0.000112, "loss": 7.1461, "mean_token_accuracy": 0.09635853916406631, "num_tokens": 190055.0, "step": 225 }, { "entropy": 7.722128820419312, "epoch": 0.005139262850950205, "grad_norm": 1.8125, "learning_rate": 0.0001145, "loss": 7.1545, "mean_token_accuracy": 0.10052503794431686, "num_tokens": 194267.0, "step": 230 }, { "entropy": 7.67925763130188, "epoch": 0.0052509859564056445, "grad_norm": 1.78125, "learning_rate": 0.00011700000000000001, "loss": 7.0976, "mean_token_accuracy": 0.09923605695366859, "num_tokens": 198483.0, "step": 235 }, { "entropy": 7.5812575340271, "epoch": 0.005362709061861083, "grad_norm": 1.5703125, "learning_rate": 0.00011949999999999999, "loss": 7.0173, "mean_token_accuracy": 0.10283883661031723, "num_tokens": 202514.0, "step": 240 }, { "entropy": 7.598950576782227, "epoch": 0.005474432167316523, "grad_norm": 1.796875, "learning_rate": 0.000122, "loss": 7.1592, "mean_token_accuracy": 0.09925142973661423, "num_tokens": 206748.0, "step": 245 }, { "entropy": 7.573145723342895, "epoch": 0.005586155272771962, "grad_norm": 1.875, "learning_rate": 0.0001245, "loss": 7.0229, "mean_token_accuracy": 0.10259764194488526, "num_tokens": 210981.0, "step": 250 }, { "entropy": 7.5371081829071045, "epoch": 0.005697878378227402, "grad_norm": 1.5859375, "learning_rate": 0.000127, "loss": 7.1679, "mean_token_accuracy": 0.09469496235251426, "num_tokens": 215551.0, "step": 255 }, { "entropy": 7.520426607131958, "epoch": 0.0058096014836828405, "grad_norm": 1.453125, "learning_rate": 0.0001295, "loss": 6.9739, "mean_token_accuracy": 0.11107034981250763, "num_tokens": 219677.0, "step": 260 }, { "entropy": 7.612557506561279, "epoch": 0.005921324589138279, "grad_norm": 1.75, "learning_rate": 0.000132, "loss": 7.072, "mean_token_accuracy": 0.10267340168356895, "num_tokens": 223457.0, "step": 265 }, { "entropy": 7.546310329437256, "epoch": 0.006033047694593719, "grad_norm": 1.734375, "learning_rate": 0.00013450000000000002, "loss": 6.9226, "mean_token_accuracy": 0.1154308445751667, "num_tokens": 227135.0, "step": 270 }, { "entropy": 7.572003746032715, "epoch": 0.006144770800049158, "grad_norm": 1.6328125, "learning_rate": 0.00013700000000000002, "loss": 7.1372, "mean_token_accuracy": 0.09673138484358787, "num_tokens": 231393.0, "step": 275 }, { "entropy": 7.611022663116455, "epoch": 0.006256493905504598, "grad_norm": 1.6484375, "learning_rate": 0.0001395, "loss": 7.1052, "mean_token_accuracy": 0.10218687430024147, "num_tokens": 235959.0, "step": 280 }, { "entropy": 7.403985118865966, "epoch": 0.0063682170109600365, "grad_norm": 1.734375, "learning_rate": 0.00014199999999999998, "loss": 6.9434, "mean_token_accuracy": 0.10860099717974663, "num_tokens": 239875.0, "step": 285 }, { "entropy": 7.420692682266235, "epoch": 0.006479940116415476, "grad_norm": 1.4765625, "learning_rate": 0.0001445, "loss": 7.0656, "mean_token_accuracy": 0.11386927664279937, "num_tokens": 244397.0, "step": 290 }, { "entropy": 7.5308808326721195, "epoch": 0.006591663221870915, "grad_norm": 1.6015625, "learning_rate": 0.000147, "loss": 7.0, "mean_token_accuracy": 0.10292632281780242, "num_tokens": 248441.0, "step": 295 }, { "entropy": 7.551111650466919, "epoch": 0.006703386327326354, "grad_norm": 2.0625, "learning_rate": 0.0001495, "loss": 7.0078, "mean_token_accuracy": 0.10877085924148559, "num_tokens": 252693.0, "step": 300 }, { "entropy": 7.420186233520508, "epoch": 0.006815109432781794, "grad_norm": 1.96875, "learning_rate": 0.000152, "loss": 6.9778, "mean_token_accuracy": 0.1077166736125946, "num_tokens": 257135.0, "step": 305 }, { "entropy": 7.455549049377441, "epoch": 0.0069268325382372325, "grad_norm": 1.7421875, "learning_rate": 0.00015450000000000001, "loss": 7.101, "mean_token_accuracy": 0.09917000532150269, "num_tokens": 261919.0, "step": 310 }, { "entropy": 7.428725242614746, "epoch": 0.007038555643692672, "grad_norm": 1.71875, "learning_rate": 0.000157, "loss": 7.0018, "mean_token_accuracy": 0.1032940112054348, "num_tokens": 266656.0, "step": 315 }, { "entropy": 7.4056861877441404, "epoch": 0.007150278749148111, "grad_norm": 1.484375, "learning_rate": 0.0001595, "loss": 6.9649, "mean_token_accuracy": 0.10402853935956954, "num_tokens": 270879.0, "step": 320 }, { "entropy": 7.356624603271484, "epoch": 0.007262001854603551, "grad_norm": 1.65625, "learning_rate": 0.000162, "loss": 6.9156, "mean_token_accuracy": 0.11899577528238296, "num_tokens": 274884.0, "step": 325 }, { "entropy": 7.359720230102539, "epoch": 0.00737372496005899, "grad_norm": 1.6953125, "learning_rate": 0.00016450000000000001, "loss": 6.8492, "mean_token_accuracy": 0.10880193561315536, "num_tokens": 279096.0, "step": 330 }, { "entropy": 7.420133590698242, "epoch": 0.007485448065514429, "grad_norm": 1.875, "learning_rate": 0.00016700000000000002, "loss": 6.9547, "mean_token_accuracy": 0.10481383726000786, "num_tokens": 282923.0, "step": 335 }, { "entropy": 7.375938367843628, "epoch": 0.007597171170969868, "grad_norm": 1.5078125, "learning_rate": 0.00016950000000000003, "loss": 6.8854, "mean_token_accuracy": 0.11555279865860939, "num_tokens": 287283.0, "step": 340 }, { "entropy": 7.266809701919556, "epoch": 0.007708894276425307, "grad_norm": 1.671875, "learning_rate": 0.00017199999999999998, "loss": 6.8566, "mean_token_accuracy": 0.11106687858700752, "num_tokens": 291409.0, "step": 345 }, { "entropy": 7.351815128326416, "epoch": 0.007820617381880746, "grad_norm": 1.640625, "learning_rate": 0.00017449999999999999, "loss": 6.9102, "mean_token_accuracy": 0.10942614153027534, "num_tokens": 295157.0, "step": 350 }, { "entropy": 7.481018209457398, "epoch": 0.007932340487336187, "grad_norm": 1.9765625, "learning_rate": 0.000177, "loss": 6.9203, "mean_token_accuracy": 0.10715582817792893, "num_tokens": 299370.0, "step": 355 }, { "entropy": 7.2193928241729735, "epoch": 0.008044063592791625, "grad_norm": 1.765625, "learning_rate": 0.0001795, "loss": 6.9256, "mean_token_accuracy": 0.11601178944110871, "num_tokens": 303955.0, "step": 360 }, { "entropy": 7.46614179611206, "epoch": 0.008155786698247064, "grad_norm": 2.28125, "learning_rate": 0.000182, "loss": 6.8992, "mean_token_accuracy": 0.11738249063491821, "num_tokens": 308047.0, "step": 365 }, { "entropy": 7.339001560211182, "epoch": 0.008267509803702503, "grad_norm": 1.8359375, "learning_rate": 0.0001845, "loss": 6.8353, "mean_token_accuracy": 0.12007508799433708, "num_tokens": 312050.0, "step": 370 }, { "entropy": 7.393199253082275, "epoch": 0.008379232909157944, "grad_norm": 1.6015625, "learning_rate": 0.000187, "loss": 6.789, "mean_token_accuracy": 0.11748188808560371, "num_tokens": 315901.0, "step": 375 }, { "entropy": 7.206725311279297, "epoch": 0.008490956014613383, "grad_norm": 1.5390625, "learning_rate": 0.0001895, "loss": 6.8387, "mean_token_accuracy": 0.11932774782180786, "num_tokens": 320077.0, "step": 380 }, { "entropy": 7.309018516540528, "epoch": 0.008602679120068821, "grad_norm": 1.859375, "learning_rate": 0.000192, "loss": 6.7772, "mean_token_accuracy": 0.12389342486858368, "num_tokens": 324365.0, "step": 385 }, { "entropy": 7.1502117156982425, "epoch": 0.00871440222552426, "grad_norm": 1.7421875, "learning_rate": 0.0001945, "loss": 6.7342, "mean_token_accuracy": 0.12538171485066413, "num_tokens": 327971.0, "step": 390 }, { "entropy": 7.207239198684692, "epoch": 0.0088261253309797, "grad_norm": 1.8046875, "learning_rate": 0.00019700000000000002, "loss": 6.7814, "mean_token_accuracy": 0.12070702090859413, "num_tokens": 331791.0, "step": 395 }, { "entropy": 7.188077354431153, "epoch": 0.00893784843643514, "grad_norm": 1.7265625, "learning_rate": 0.00019950000000000002, "loss": 6.8347, "mean_token_accuracy": 0.11772776916623115, "num_tokens": 335616.0, "step": 400 }, { "entropy": 7.238067245483398, "epoch": 0.009049571541890579, "grad_norm": 1.5, "learning_rate": 0.000202, "loss": 6.7448, "mean_token_accuracy": 0.12914832159876824, "num_tokens": 339815.0, "step": 405 }, { "entropy": 7.271863889694214, "epoch": 0.009161294647346017, "grad_norm": 1.6875, "learning_rate": 0.00020449999999999998, "loss": 6.7314, "mean_token_accuracy": 0.12098882421851158, "num_tokens": 344045.0, "step": 410 }, { "entropy": 7.054260921478272, "epoch": 0.009273017752801456, "grad_norm": 1.9296875, "learning_rate": 0.000207, "loss": 6.8258, "mean_token_accuracy": 0.12370770499110222, "num_tokens": 348726.0, "step": 415 }, { "entropy": 7.25892219543457, "epoch": 0.009384740858256897, "grad_norm": 1.609375, "learning_rate": 0.0002095, "loss": 6.811, "mean_token_accuracy": 0.12439991980791092, "num_tokens": 353228.0, "step": 420 }, { "entropy": 7.089362478256225, "epoch": 0.009496463963712336, "grad_norm": 1.65625, "learning_rate": 0.000212, "loss": 6.7731, "mean_token_accuracy": 0.12979045361280442, "num_tokens": 357379.0, "step": 425 }, { "entropy": 7.264574861526489, "epoch": 0.009608187069167775, "grad_norm": 2.015625, "learning_rate": 0.0002145, "loss": 6.7426, "mean_token_accuracy": 0.11879147663712501, "num_tokens": 361347.0, "step": 430 }, { "entropy": 7.1300811767578125, "epoch": 0.009719910174623213, "grad_norm": 1.7265625, "learning_rate": 0.00021700000000000002, "loss": 6.7019, "mean_token_accuracy": 0.12289151027798653, "num_tokens": 365364.0, "step": 435 }, { "entropy": 7.1097527027130125, "epoch": 0.009831633280078652, "grad_norm": 1.6171875, "learning_rate": 0.0002195, "loss": 6.7534, "mean_token_accuracy": 0.12068467438220978, "num_tokens": 369648.0, "step": 440 }, { "entropy": 7.229344892501831, "epoch": 0.009943356385534093, "grad_norm": 1.578125, "learning_rate": 0.000222, "loss": 6.7309, "mean_token_accuracy": 0.12263526245951653, "num_tokens": 373734.0, "step": 445 }, { "entropy": 7.1849524021148685, "epoch": 0.010055079490989532, "grad_norm": 1.765625, "learning_rate": 0.0002245, "loss": 6.7276, "mean_token_accuracy": 0.12742977142333983, "num_tokens": 378184.0, "step": 450 }, { "entropy": 7.064081621170044, "epoch": 0.01016680259644497, "grad_norm": 1.546875, "learning_rate": 0.00022700000000000002, "loss": 6.8377, "mean_token_accuracy": 0.12056938409805298, "num_tokens": 382686.0, "step": 455 }, { "entropy": 7.035848474502563, "epoch": 0.01027852570190041, "grad_norm": 1.84375, "learning_rate": 0.00022950000000000002, "loss": 6.7467, "mean_token_accuracy": 0.13145566657185553, "num_tokens": 387210.0, "step": 460 }, { "entropy": 7.06201696395874, "epoch": 0.01039024880735585, "grad_norm": 1.734375, "learning_rate": 0.00023200000000000003, "loss": 6.7263, "mean_token_accuracy": 0.12420300841331482, "num_tokens": 391247.0, "step": 465 }, { "entropy": 7.2231800079345705, "epoch": 0.010501971912811289, "grad_norm": 1.8125, "learning_rate": 0.00023449999999999998, "loss": 6.6101, "mean_token_accuracy": 0.12484818920493126, "num_tokens": 395188.0, "step": 470 }, { "entropy": 6.963715267181397, "epoch": 0.010613695018266728, "grad_norm": 1.7734375, "learning_rate": 0.000237, "loss": 6.6759, "mean_token_accuracy": 0.1323227606713772, "num_tokens": 399513.0, "step": 475 }, { "entropy": 7.180826234817505, "epoch": 0.010725418123722167, "grad_norm": 1.6875, "learning_rate": 0.0002395, "loss": 6.7397, "mean_token_accuracy": 0.1241152174770832, "num_tokens": 404052.0, "step": 480 }, { "entropy": 7.000790357589722, "epoch": 0.010837141229177606, "grad_norm": 1.6875, "learning_rate": 0.000242, "loss": 6.6031, "mean_token_accuracy": 0.13010914325714112, "num_tokens": 408299.0, "step": 485 }, { "entropy": 6.951791143417358, "epoch": 0.010948864334633046, "grad_norm": 1.890625, "learning_rate": 0.0002445, "loss": 6.597, "mean_token_accuracy": 0.13655143678188325, "num_tokens": 412376.0, "step": 490 }, { "entropy": 6.940329837799072, "epoch": 0.011060587440088485, "grad_norm": 1.5, "learning_rate": 0.000247, "loss": 6.6731, "mean_token_accuracy": 0.13289386332035064, "num_tokens": 417010.0, "step": 495 }, { "entropy": 7.088097476959229, "epoch": 0.011172310545543924, "grad_norm": 1.796875, "learning_rate": 0.0002495, "loss": 6.5194, "mean_token_accuracy": 0.14706601724028587, "num_tokens": 421167.0, "step": 500 }, { "entropy": 6.922516012191773, "epoch": 0.011284033650999363, "grad_norm": 1.703125, "learning_rate": 0.000252, "loss": 6.6178, "mean_token_accuracy": 0.13619204014539718, "num_tokens": 425942.0, "step": 505 }, { "entropy": 7.03532772064209, "epoch": 0.011395756756454803, "grad_norm": 1.578125, "learning_rate": 0.0002545, "loss": 6.6648, "mean_token_accuracy": 0.13011146634817122, "num_tokens": 430529.0, "step": 510 }, { "entropy": 6.945074939727784, "epoch": 0.011507479861910242, "grad_norm": 1.828125, "learning_rate": 0.000257, "loss": 6.5181, "mean_token_accuracy": 0.12947220131754875, "num_tokens": 434464.0, "step": 515 }, { "entropy": 6.959482002258301, "epoch": 0.011619202967365681, "grad_norm": 1.7421875, "learning_rate": 0.0002595, "loss": 6.6253, "mean_token_accuracy": 0.13869500905275345, "num_tokens": 438763.0, "step": 520 }, { "entropy": 6.914068031311035, "epoch": 0.01173092607282112, "grad_norm": 1.6875, "learning_rate": 0.000262, "loss": 6.5756, "mean_token_accuracy": 0.1341098003089428, "num_tokens": 442945.0, "step": 525 }, { "entropy": 7.105465316772461, "epoch": 0.011842649178276559, "grad_norm": 1.671875, "learning_rate": 0.00026450000000000003, "loss": 6.6796, "mean_token_accuracy": 0.12466075941920281, "num_tokens": 447301.0, "step": 530 }, { "entropy": 6.853219223022461, "epoch": 0.011954372283732, "grad_norm": 1.671875, "learning_rate": 0.00026700000000000004, "loss": 6.5349, "mean_token_accuracy": 0.13604073524475097, "num_tokens": 451365.0, "step": 535 }, { "entropy": 6.9650640964508055, "epoch": 0.012066095389187438, "grad_norm": 1.7734375, "learning_rate": 0.00026950000000000005, "loss": 6.5806, "mean_token_accuracy": 0.13407194539904593, "num_tokens": 455469.0, "step": 540 }, { "entropy": 6.94967565536499, "epoch": 0.012177818494642877, "grad_norm": 1.53125, "learning_rate": 0.00027200000000000005, "loss": 6.6521, "mean_token_accuracy": 0.13110672906041146, "num_tokens": 459641.0, "step": 545 }, { "entropy": 6.912797451019287, "epoch": 0.012289541600098316, "grad_norm": 1.6796875, "learning_rate": 0.0002745, "loss": 6.5912, "mean_token_accuracy": 0.1325491264462471, "num_tokens": 463866.0, "step": 550 }, { "entropy": 6.911716938018799, "epoch": 0.012401264705553756, "grad_norm": 1.921875, "learning_rate": 0.000277, "loss": 6.4776, "mean_token_accuracy": 0.1369607262313366, "num_tokens": 467692.0, "step": 555 }, { "entropy": 6.93188853263855, "epoch": 0.012512987811009195, "grad_norm": 1.84375, "learning_rate": 0.0002795, "loss": 6.611, "mean_token_accuracy": 0.1433392733335495, "num_tokens": 471719.0, "step": 560 }, { "entropy": 6.887971878051758, "epoch": 0.012624710916464634, "grad_norm": 1.6015625, "learning_rate": 0.00028199999999999997, "loss": 6.5399, "mean_token_accuracy": 0.13064411506056786, "num_tokens": 475978.0, "step": 565 }, { "entropy": 6.961443710327148, "epoch": 0.012736434021920073, "grad_norm": 1.6171875, "learning_rate": 0.0002845, "loss": 6.6299, "mean_token_accuracy": 0.1282844863831997, "num_tokens": 480538.0, "step": 570 }, { "entropy": 6.9848442554473875, "epoch": 0.012848157127375512, "grad_norm": 1.75, "learning_rate": 0.000287, "loss": 6.5282, "mean_token_accuracy": 0.13599977716803552, "num_tokens": 484604.0, "step": 575 }, { "entropy": 6.9366988182067875, "epoch": 0.012959880232830952, "grad_norm": 1.4140625, "learning_rate": 0.0002895, "loss": 6.5757, "mean_token_accuracy": 0.12946860045194625, "num_tokens": 489117.0, "step": 580 }, { "entropy": 6.9284679889678955, "epoch": 0.013071603338286391, "grad_norm": 1.90625, "learning_rate": 0.000292, "loss": 6.454, "mean_token_accuracy": 0.13936082720756532, "num_tokens": 493020.0, "step": 585 }, { "entropy": 6.81143798828125, "epoch": 0.01318332644374183, "grad_norm": 1.765625, "learning_rate": 0.0002945, "loss": 6.6045, "mean_token_accuracy": 0.1356659173965454, "num_tokens": 497224.0, "step": 590 }, { "entropy": 6.871704006195069, "epoch": 0.013295049549197269, "grad_norm": 1.640625, "learning_rate": 0.000297, "loss": 6.5519, "mean_token_accuracy": 0.1327143579721451, "num_tokens": 501323.0, "step": 595 }, { "entropy": 6.897035217285156, "epoch": 0.013406772654652708, "grad_norm": 1.765625, "learning_rate": 0.0002995, "loss": 6.6141, "mean_token_accuracy": 0.13350649401545525, "num_tokens": 505544.0, "step": 600 }, { "entropy": 6.890090608596802, "epoch": 0.013518495760108148, "grad_norm": 1.6796875, "learning_rate": 0.000302, "loss": 6.5533, "mean_token_accuracy": 0.13723233789205552, "num_tokens": 509980.0, "step": 605 }, { "entropy": 6.711225366592407, "epoch": 0.013630218865563587, "grad_norm": 1.7265625, "learning_rate": 0.0003045, "loss": 6.4153, "mean_token_accuracy": 0.14487348720431328, "num_tokens": 514264.0, "step": 610 }, { "entropy": 6.843616533279419, "epoch": 0.013741941971019026, "grad_norm": 1.8359375, "learning_rate": 0.000307, "loss": 6.498, "mean_token_accuracy": 0.13974266350269318, "num_tokens": 518482.0, "step": 615 }, { "entropy": 6.874301528930664, "epoch": 0.013853665076474465, "grad_norm": 1.65625, "learning_rate": 0.0003095, "loss": 6.5465, "mean_token_accuracy": 0.13032930791378022, "num_tokens": 522765.0, "step": 620 }, { "entropy": 6.749671411514282, "epoch": 0.013965388181929906, "grad_norm": 1.375, "learning_rate": 0.000312, "loss": 6.369, "mean_token_accuracy": 0.14341583847999573, "num_tokens": 526794.0, "step": 625 }, { "entropy": 6.787525320053101, "epoch": 0.014077111287385344, "grad_norm": 1.640625, "learning_rate": 0.0003145, "loss": 6.528, "mean_token_accuracy": 0.14095058366656305, "num_tokens": 531070.0, "step": 630 }, { "entropy": 6.8752782344818115, "epoch": 0.014188834392840783, "grad_norm": 1.4375, "learning_rate": 0.000317, "loss": 6.5556, "mean_token_accuracy": 0.1387290321290493, "num_tokens": 535655.0, "step": 635 }, { "entropy": 6.793731594085694, "epoch": 0.014300557498296222, "grad_norm": 1.4296875, "learning_rate": 0.0003195, "loss": 6.5852, "mean_token_accuracy": 0.13649069741368294, "num_tokens": 540231.0, "step": 640 }, { "entropy": 6.764686965942383, "epoch": 0.014412280603751661, "grad_norm": 1.609375, "learning_rate": 0.000322, "loss": 6.4429, "mean_token_accuracy": 0.14507341384887695, "num_tokens": 544180.0, "step": 645 }, { "entropy": 6.750355339050293, "epoch": 0.014524003709207102, "grad_norm": 1.703125, "learning_rate": 0.00032450000000000003, "loss": 6.413, "mean_token_accuracy": 0.14032018259167672, "num_tokens": 547905.0, "step": 650 }, { "entropy": 6.633134460449218, "epoch": 0.01463572681466254, "grad_norm": 1.515625, "learning_rate": 0.00032700000000000003, "loss": 6.4971, "mean_token_accuracy": 0.14342024102807044, "num_tokens": 552248.0, "step": 655 }, { "entropy": 6.69278130531311, "epoch": 0.01474744992011798, "grad_norm": 1.8671875, "learning_rate": 0.00032950000000000004, "loss": 6.3103, "mean_token_accuracy": 0.15002134442329407, "num_tokens": 556430.0, "step": 660 }, { "entropy": 6.606019735336304, "epoch": 0.014859173025573418, "grad_norm": 1.796875, "learning_rate": 0.00033200000000000005, "loss": 6.4126, "mean_token_accuracy": 0.14947109222412108, "num_tokens": 560114.0, "step": 665 }, { "entropy": 6.456874704360962, "epoch": 0.014970896131028859, "grad_norm": 1.484375, "learning_rate": 0.00033450000000000005, "loss": 6.432, "mean_token_accuracy": 0.1395042322576046, "num_tokens": 564624.0, "step": 670 }, { "entropy": 6.712696886062622, "epoch": 0.015082619236484298, "grad_norm": 1.7265625, "learning_rate": 0.000337, "loss": 6.3378, "mean_token_accuracy": 0.1465103656053543, "num_tokens": 568918.0, "step": 675 }, { "entropy": 6.637308168411255, "epoch": 0.015194342341939737, "grad_norm": 1.6171875, "learning_rate": 0.0003395, "loss": 6.4062, "mean_token_accuracy": 0.14732098281383516, "num_tokens": 572972.0, "step": 680 }, { "entropy": 6.601571273803711, "epoch": 0.015306065447395175, "grad_norm": 1.65625, "learning_rate": 0.000342, "loss": 6.4433, "mean_token_accuracy": 0.150725756585598, "num_tokens": 577250.0, "step": 685 }, { "entropy": 6.742843151092529, "epoch": 0.015417788552850614, "grad_norm": 1.46875, "learning_rate": 0.00034449999999999997, "loss": 6.343, "mean_token_accuracy": 0.14816580414772035, "num_tokens": 581418.0, "step": 690 }, { "entropy": 6.67585711479187, "epoch": 0.015529511658306055, "grad_norm": 1.796875, "learning_rate": 0.000347, "loss": 6.4489, "mean_token_accuracy": 0.14566415771842003, "num_tokens": 585675.0, "step": 695 }, { "entropy": 6.479352045059204, "epoch": 0.015641234763761492, "grad_norm": 1.6640625, "learning_rate": 0.0003495, "loss": 6.35, "mean_token_accuracy": 0.1425018362700939, "num_tokens": 590032.0, "step": 700 }, { "entropy": 6.537110137939453, "epoch": 0.015752957869216933, "grad_norm": 1.7578125, "learning_rate": 0.000352, "loss": 6.3371, "mean_token_accuracy": 0.15346041396260263, "num_tokens": 594185.0, "step": 705 }, { "entropy": 6.561723518371582, "epoch": 0.015864680974672373, "grad_norm": 1.609375, "learning_rate": 0.0003545, "loss": 6.2759, "mean_token_accuracy": 0.15528617724776267, "num_tokens": 598246.0, "step": 710 }, { "entropy": 6.575086498260498, "epoch": 0.01597640408012781, "grad_norm": 1.609375, "learning_rate": 0.000357, "loss": 6.4107, "mean_token_accuracy": 0.14987436532974244, "num_tokens": 602676.0, "step": 715 }, { "entropy": 6.5285728931427, "epoch": 0.01608812718558325, "grad_norm": 1.6171875, "learning_rate": 0.0003595, "loss": 6.2682, "mean_token_accuracy": 0.15596837252378465, "num_tokens": 606693.0, "step": 720 }, { "entropy": 6.538558626174927, "epoch": 0.01619985029103869, "grad_norm": 1.5859375, "learning_rate": 0.000362, "loss": 6.3284, "mean_token_accuracy": 0.13880535289645196, "num_tokens": 610780.0, "step": 725 }, { "entropy": 6.484487867355346, "epoch": 0.01631157339649413, "grad_norm": 1.640625, "learning_rate": 0.0003645, "loss": 6.365, "mean_token_accuracy": 0.148425579816103, "num_tokens": 614746.0, "step": 730 }, { "entropy": 6.57484130859375, "epoch": 0.01642329650194957, "grad_norm": 1.4296875, "learning_rate": 0.000367, "loss": 6.3217, "mean_token_accuracy": 0.1501600444316864, "num_tokens": 619222.0, "step": 735 }, { "entropy": 6.699773979187012, "epoch": 0.016535019607405006, "grad_norm": 1.453125, "learning_rate": 0.0003695, "loss": 6.4575, "mean_token_accuracy": 0.1470234327018261, "num_tokens": 623746.0, "step": 740 }, { "entropy": 6.542045211791992, "epoch": 0.016646742712860447, "grad_norm": 1.390625, "learning_rate": 0.000372, "loss": 6.3108, "mean_token_accuracy": 0.15406130626797676, "num_tokens": 628392.0, "step": 745 }, { "entropy": 6.443634414672852, "epoch": 0.016758465818315887, "grad_norm": 1.5859375, "learning_rate": 0.0003745, "loss": 6.3252, "mean_token_accuracy": 0.1483919471502304, "num_tokens": 632439.0, "step": 750 }, { "entropy": 6.462843322753907, "epoch": 0.016870188923771325, "grad_norm": 1.40625, "learning_rate": 0.000377, "loss": 6.3639, "mean_token_accuracy": 0.14475394636392594, "num_tokens": 636801.0, "step": 755 }, { "entropy": 6.5299022674560545, "epoch": 0.016981912029226765, "grad_norm": 1.71875, "learning_rate": 0.0003795, "loss": 6.1376, "mean_token_accuracy": 0.16324445307254792, "num_tokens": 640818.0, "step": 760 }, { "entropy": 6.448936939239502, "epoch": 0.017093635134682202, "grad_norm": 1.546875, "learning_rate": 0.000382, "loss": 6.3332, "mean_token_accuracy": 0.1428905963897705, "num_tokens": 644914.0, "step": 765 }, { "entropy": 6.681206798553466, "epoch": 0.017205358240137643, "grad_norm": 1.46875, "learning_rate": 0.0003845, "loss": 6.4011, "mean_token_accuracy": 0.1510247729718685, "num_tokens": 649368.0, "step": 770 }, { "entropy": 6.323616456985474, "epoch": 0.017317081345593083, "grad_norm": 1.6796875, "learning_rate": 0.00038700000000000003, "loss": 6.2719, "mean_token_accuracy": 0.1547230713069439, "num_tokens": 653537.0, "step": 775 }, { "entropy": 6.604541254043579, "epoch": 0.01742880445104852, "grad_norm": 1.625, "learning_rate": 0.00038950000000000003, "loss": 6.3935, "mean_token_accuracy": 0.1366790473461151, "num_tokens": 658232.0, "step": 780 }, { "entropy": 6.442852210998535, "epoch": 0.01754052755650396, "grad_norm": 1.5, "learning_rate": 0.00039200000000000004, "loss": 6.3431, "mean_token_accuracy": 0.1412769600749016, "num_tokens": 662512.0, "step": 785 }, { "entropy": 6.617573547363281, "epoch": 0.0176522506619594, "grad_norm": 1.4296875, "learning_rate": 0.00039450000000000005, "loss": 6.317, "mean_token_accuracy": 0.15297196432948112, "num_tokens": 666759.0, "step": 790 }, { "entropy": 6.2801289558410645, "epoch": 0.01776397376741484, "grad_norm": 1.4921875, "learning_rate": 0.00039700000000000005, "loss": 6.2359, "mean_token_accuracy": 0.15913384407758713, "num_tokens": 670870.0, "step": 795 }, { "entropy": 6.4234747886657715, "epoch": 0.01787569687287028, "grad_norm": 1.5859375, "learning_rate": 0.0003995, "loss": 6.2002, "mean_token_accuracy": 0.15476782992482185, "num_tokens": 675150.0, "step": 800 }, { "entropy": 6.242582082748413, "epoch": 0.017987419978325717, "grad_norm": 1.6953125, "learning_rate": 0.000402, "loss": 6.1478, "mean_token_accuracy": 0.16312235742807388, "num_tokens": 679083.0, "step": 805 }, { "entropy": 6.390512132644654, "epoch": 0.018099143083781157, "grad_norm": 1.515625, "learning_rate": 0.0004045, "loss": 6.3339, "mean_token_accuracy": 0.14840762168169022, "num_tokens": 683477.0, "step": 810 }, { "entropy": 6.346619319915772, "epoch": 0.018210866189236594, "grad_norm": 1.515625, "learning_rate": 0.00040699999999999997, "loss": 6.1433, "mean_token_accuracy": 0.15934223383665086, "num_tokens": 687819.0, "step": 815 }, { "entropy": 6.47499303817749, "epoch": 0.018322589294692035, "grad_norm": 1.4296875, "learning_rate": 0.0004095, "loss": 6.3563, "mean_token_accuracy": 0.15130842924118043, "num_tokens": 692017.0, "step": 820 }, { "entropy": 6.57763991355896, "epoch": 0.018434312400147475, "grad_norm": 1.4609375, "learning_rate": 0.000412, "loss": 6.3471, "mean_token_accuracy": 0.1486021101474762, "num_tokens": 696853.0, "step": 825 }, { "entropy": 6.5021766185760494, "epoch": 0.018546035505602913, "grad_norm": 1.4375, "learning_rate": 0.0004145, "loss": 6.4022, "mean_token_accuracy": 0.13754147440195083, "num_tokens": 701131.0, "step": 830 }, { "entropy": 6.329108572006225, "epoch": 0.018657758611058353, "grad_norm": 1.7109375, "learning_rate": 0.000417, "loss": 6.3438, "mean_token_accuracy": 0.14031846597790718, "num_tokens": 705428.0, "step": 835 }, { "entropy": 6.359441089630127, "epoch": 0.018769481716513794, "grad_norm": 1.421875, "learning_rate": 0.0004195, "loss": 6.1931, "mean_token_accuracy": 0.16036254167556763, "num_tokens": 709760.0, "step": 840 }, { "entropy": 6.268203020095825, "epoch": 0.01888120482196923, "grad_norm": 1.4453125, "learning_rate": 0.000422, "loss": 6.1527, "mean_token_accuracy": 0.16414240151643752, "num_tokens": 713964.0, "step": 845 }, { "entropy": 6.395886707305908, "epoch": 0.01899292792742467, "grad_norm": 1.5625, "learning_rate": 0.0004245, "loss": 6.3232, "mean_token_accuracy": 0.15316279977560043, "num_tokens": 718305.0, "step": 850 }, { "entropy": 6.378367567062378, "epoch": 0.01910465103288011, "grad_norm": 1.546875, "learning_rate": 0.000427, "loss": 6.2283, "mean_token_accuracy": 0.15503655076026918, "num_tokens": 722705.0, "step": 855 }, { "entropy": 6.2019463062286375, "epoch": 0.01921637413833555, "grad_norm": 1.5, "learning_rate": 0.0004295, "loss": 6.1186, "mean_token_accuracy": 0.16495653316378595, "num_tokens": 726529.0, "step": 860 }, { "entropy": 6.353125715255738, "epoch": 0.01932809724379099, "grad_norm": 1.5234375, "learning_rate": 0.000432, "loss": 6.2228, "mean_token_accuracy": 0.15027105957269668, "num_tokens": 730535.0, "step": 865 }, { "entropy": 6.341917848587036, "epoch": 0.019439820349246427, "grad_norm": 1.40625, "learning_rate": 0.0004345, "loss": 6.1982, "mean_token_accuracy": 0.15795509219169618, "num_tokens": 734836.0, "step": 870 }, { "entropy": 6.281454563140869, "epoch": 0.019551543454701868, "grad_norm": 1.5, "learning_rate": 0.000437, "loss": 6.2734, "mean_token_accuracy": 0.15110851228237152, "num_tokens": 739176.0, "step": 875 }, { "entropy": 6.2023228168487545, "epoch": 0.019663266560157305, "grad_norm": 1.5546875, "learning_rate": 0.0004395, "loss": 6.2473, "mean_token_accuracy": 0.15088646113872528, "num_tokens": 743497.0, "step": 880 }, { "entropy": 6.359633541107177, "epoch": 0.019774989665612745, "grad_norm": 1.515625, "learning_rate": 0.000442, "loss": 6.2555, "mean_token_accuracy": 0.15800251960754394, "num_tokens": 747185.0, "step": 885 }, { "entropy": 6.299527931213379, "epoch": 0.019886712771068186, "grad_norm": 1.5234375, "learning_rate": 0.0004445, "loss": 6.3705, "mean_token_accuracy": 0.1479213811457157, "num_tokens": 751345.0, "step": 890 }, { "entropy": 6.348771095275879, "epoch": 0.019998435876523623, "grad_norm": 1.5234375, "learning_rate": 0.000447, "loss": 6.2641, "mean_token_accuracy": 0.1576582223176956, "num_tokens": 755618.0, "step": 895 }, { "entropy": 6.318030929565429, "epoch": 0.020110158981979064, "grad_norm": 1.515625, "learning_rate": 0.00044950000000000003, "loss": 6.2539, "mean_token_accuracy": 0.15391020849347115, "num_tokens": 759583.0, "step": 900 }, { "entropy": 6.339395999908447, "epoch": 0.0202218820874345, "grad_norm": 1.5625, "learning_rate": 0.00045200000000000004, "loss": 6.1856, "mean_token_accuracy": 0.16274880915880202, "num_tokens": 763861.0, "step": 905 }, { "entropy": 6.222519493103027, "epoch": 0.02033360519288994, "grad_norm": 1.4609375, "learning_rate": 0.00045450000000000004, "loss": 6.1597, "mean_token_accuracy": 0.16332034766674042, "num_tokens": 768046.0, "step": 910 }, { "entropy": 6.363137149810791, "epoch": 0.020445328298345382, "grad_norm": 1.5234375, "learning_rate": 0.00045700000000000005, "loss": 6.1448, "mean_token_accuracy": 0.15950068086385727, "num_tokens": 772570.0, "step": 915 }, { "entropy": 6.369995403289795, "epoch": 0.02055705140380082, "grad_norm": 1.421875, "learning_rate": 0.00045950000000000006, "loss": 6.2981, "mean_token_accuracy": 0.1562412589788437, "num_tokens": 777324.0, "step": 920 }, { "entropy": 6.437484455108643, "epoch": 0.02066877450925626, "grad_norm": 1.3125, "learning_rate": 0.000462, "loss": 6.273, "mean_token_accuracy": 0.14749887958168983, "num_tokens": 781829.0, "step": 925 }, { "entropy": 6.290871667861938, "epoch": 0.0207804976147117, "grad_norm": 1.34375, "learning_rate": 0.0004645, "loss": 6.139, "mean_token_accuracy": 0.15945375710725784, "num_tokens": 786089.0, "step": 930 }, { "entropy": 6.188903331756592, "epoch": 0.020892220720167137, "grad_norm": 1.3359375, "learning_rate": 0.000467, "loss": 6.135, "mean_token_accuracy": 0.16696064472198485, "num_tokens": 790273.0, "step": 935 }, { "entropy": 6.331109428405762, "epoch": 0.021003943825622578, "grad_norm": 1.3828125, "learning_rate": 0.0004695, "loss": 6.1418, "mean_token_accuracy": 0.16708167791366577, "num_tokens": 794600.0, "step": 940 }, { "entropy": 6.217516183853149, "epoch": 0.021115666931078015, "grad_norm": 1.5390625, "learning_rate": 0.000472, "loss": 6.1176, "mean_token_accuracy": 0.1658843532204628, "num_tokens": 798756.0, "step": 945 }, { "entropy": 6.395580863952636, "epoch": 0.021227390036533456, "grad_norm": 1.4453125, "learning_rate": 0.0004745, "loss": 6.1259, "mean_token_accuracy": 0.16052196100354194, "num_tokens": 803122.0, "step": 950 }, { "entropy": 6.081810760498047, "epoch": 0.021339113141988896, "grad_norm": 1.625, "learning_rate": 0.000477, "loss": 6.164, "mean_token_accuracy": 0.16162788346409798, "num_tokens": 807393.0, "step": 955 }, { "entropy": 6.248359203338623, "epoch": 0.021450836247444333, "grad_norm": 1.5078125, "learning_rate": 0.0004795, "loss": 6.1023, "mean_token_accuracy": 0.16735041439533233, "num_tokens": 811735.0, "step": 960 }, { "entropy": 6.347312164306641, "epoch": 0.021562559352899774, "grad_norm": 1.40625, "learning_rate": 0.000482, "loss": 6.309, "mean_token_accuracy": 0.15177485793828965, "num_tokens": 816327.0, "step": 965 }, { "entropy": 6.2607207775115965, "epoch": 0.02167428245835521, "grad_norm": 1.5546875, "learning_rate": 0.0004845, "loss": 6.0873, "mean_token_accuracy": 0.16931966543197632, "num_tokens": 820476.0, "step": 970 }, { "entropy": 6.144009685516357, "epoch": 0.02178600556381065, "grad_norm": 1.4375, "learning_rate": 0.000487, "loss": 6.1081, "mean_token_accuracy": 0.16204737722873688, "num_tokens": 824563.0, "step": 975 }, { "entropy": 6.143129920959472, "epoch": 0.021897728669266092, "grad_norm": 1.3046875, "learning_rate": 0.0004895, "loss": 6.2294, "mean_token_accuracy": 0.15659647509455682, "num_tokens": 829307.0, "step": 980 }, { "entropy": 6.235242652893066, "epoch": 0.02200945177472153, "grad_norm": 1.4140625, "learning_rate": 0.000492, "loss": 6.2047, "mean_token_accuracy": 0.15783022493124008, "num_tokens": 833876.0, "step": 985 }, { "entropy": 6.273316383361816, "epoch": 0.02212117488017697, "grad_norm": 1.4296875, "learning_rate": 0.0004945, "loss": 6.2855, "mean_token_accuracy": 0.15405729338526725, "num_tokens": 838484.0, "step": 990 }, { "entropy": 6.237334489822388, "epoch": 0.022232897985632407, "grad_norm": 1.46875, "learning_rate": 0.000497, "loss": 6.1138, "mean_token_accuracy": 0.15904016494750978, "num_tokens": 842813.0, "step": 995 }, { "entropy": 6.182960510253906, "epoch": 0.022344621091087848, "grad_norm": 1.671875, "learning_rate": 0.0004995, "loss": 6.0759, "mean_token_accuracy": 0.16501354575157165, "num_tokens": 846638.0, "step": 1000 }, { "entropy": 6.176758861541748, "epoch": 0.022456344196543288, "grad_norm": 1.59375, "learning_rate": 0.000499998026082006, "loss": 6.0475, "mean_token_accuracy": 0.1734422266483307, "num_tokens": 850577.0, "step": 1005 }, { "entropy": 6.231747055053711, "epoch": 0.022568067301998725, "grad_norm": 1.359375, "learning_rate": 0.0004999900070995136, "loss": 6.0858, "mean_token_accuracy": 0.16294893622398376, "num_tokens": 854904.0, "step": 1010 }, { "entropy": 6.121539163589477, "epoch": 0.022679790407454166, "grad_norm": 1.4609375, "learning_rate": 0.0004999758199023239, "loss": 6.081, "mean_token_accuracy": 0.16951507180929185, "num_tokens": 858859.0, "step": 1015 }, { "entropy": 6.083382177352905, "epoch": 0.022791513512909607, "grad_norm": 1.515625, "learning_rate": 0.0004999554648793858, "loss": 6.0267, "mean_token_accuracy": 0.17120128124952316, "num_tokens": 863121.0, "step": 1020 }, { "entropy": 6.1603466987609865, "epoch": 0.022903236618365044, "grad_norm": 1.4921875, "learning_rate": 0.0004999289425887425, "loss": 6.1551, "mean_token_accuracy": 0.15693418234586715, "num_tokens": 867805.0, "step": 1025 }, { "entropy": 6.104901504516602, "epoch": 0.023014959723820484, "grad_norm": 1.3125, "learning_rate": 0.0004998962537575161, "loss": 6.1175, "mean_token_accuracy": 0.15979633256793022, "num_tokens": 871988.0, "step": 1030 }, { "entropy": 6.240704679489136, "epoch": 0.02312668282927592, "grad_norm": 1.4453125, "learning_rate": 0.0004998573992818874, "loss": 6.0985, "mean_token_accuracy": 0.15933127254247664, "num_tokens": 876181.0, "step": 1035 }, { "entropy": 5.971805095672607, "epoch": 0.023238405934731362, "grad_norm": 1.9765625, "learning_rate": 0.0004998123802270715, "loss": 5.9561, "mean_token_accuracy": 0.178880412876606, "num_tokens": 880521.0, "step": 1040 }, { "entropy": 5.992498254776001, "epoch": 0.023350129040186803, "grad_norm": 1.4140625, "learning_rate": 0.0004997611978272886, "loss": 6.0967, "mean_token_accuracy": 0.16714801341295243, "num_tokens": 885006.0, "step": 1045 }, { "entropy": 6.120235300064087, "epoch": 0.02346185214564224, "grad_norm": 1.40625, "learning_rate": 0.0004997038534857298, "loss": 6.0853, "mean_token_accuracy": 0.16448681205511093, "num_tokens": 889184.0, "step": 1050 }, { "entropy": 6.119455003738404, "epoch": 0.02357357525109768, "grad_norm": 1.546875, "learning_rate": 0.0004996403487745194, "loss": 6.0012, "mean_token_accuracy": 0.17143121510744094, "num_tokens": 893806.0, "step": 1055 }, { "entropy": 6.055149364471435, "epoch": 0.023685298356553117, "grad_norm": 1.4609375, "learning_rate": 0.000499570685434671, "loss": 6.0071, "mean_token_accuracy": 0.16834600120782853, "num_tokens": 897578.0, "step": 1060 }, { "entropy": 6.227984523773193, "epoch": 0.023797021462008558, "grad_norm": 1.4375, "learning_rate": 0.0004994948653760405, "loss": 6.2897, "mean_token_accuracy": 0.15649080276489258, "num_tokens": 902225.0, "step": 1065 }, { "entropy": 6.1664598941802975, "epoch": 0.023908744567464, "grad_norm": 1.3046875, "learning_rate": 0.0004994128906772729, "loss": 6.1097, "mean_token_accuracy": 0.16405512094497682, "num_tokens": 906477.0, "step": 1070 }, { "entropy": 6.110595417022705, "epoch": 0.024020467672919436, "grad_norm": 1.2890625, "learning_rate": 0.000499324763585746, "loss": 6.1071, "mean_token_accuracy": 0.15544368103146552, "num_tokens": 910948.0, "step": 1075 }, { "entropy": 6.197442293167114, "epoch": 0.024132190778374876, "grad_norm": 1.46875, "learning_rate": 0.0004992304865175085, "loss": 6.2299, "mean_token_accuracy": 0.1479525662958622, "num_tokens": 915157.0, "step": 1080 }, { "entropy": 6.140390396118164, "epoch": 0.024243913883830313, "grad_norm": 1.359375, "learning_rate": 0.0004991300620572138, "loss": 6.0491, "mean_token_accuracy": 0.16512299925088883, "num_tokens": 920251.0, "step": 1085 }, { "entropy": 6.003958606719971, "epoch": 0.024355636989285754, "grad_norm": 1.390625, "learning_rate": 0.0004990234929580494, "loss": 6.1163, "mean_token_accuracy": 0.15651995092630386, "num_tokens": 924510.0, "step": 1090 }, { "entropy": 6.04054217338562, "epoch": 0.024467360094741195, "grad_norm": 1.3671875, "learning_rate": 0.0004989107821416609, "loss": 6.0239, "mean_token_accuracy": 0.16540934443473815, "num_tokens": 928925.0, "step": 1095 }, { "entropy": 6.079621315002441, "epoch": 0.02457908320019663, "grad_norm": 1.3359375, "learning_rate": 0.0004987919326980723, "loss": 6.0004, "mean_token_accuracy": 0.17250575870275497, "num_tokens": 933211.0, "step": 1100 }, { "entropy": 6.115182685852051, "epoch": 0.024690806305652072, "grad_norm": 1.3984375, "learning_rate": 0.0004986669478856011, "loss": 6.1689, "mean_token_accuracy": 0.16165492981672286, "num_tokens": 937621.0, "step": 1105 }, { "entropy": 6.006317281723023, "epoch": 0.024802529411107513, "grad_norm": 1.390625, "learning_rate": 0.0004985358311307688, "loss": 6.087, "mean_token_accuracy": 0.15697798803448676, "num_tokens": 941629.0, "step": 1110 }, { "entropy": 6.04360728263855, "epoch": 0.02491425251656295, "grad_norm": 1.3984375, "learning_rate": 0.0004983985860282081, "loss": 6.0674, "mean_token_accuracy": 0.15867182463407517, "num_tokens": 945853.0, "step": 1115 }, { "entropy": 6.042965602874756, "epoch": 0.02502597562201839, "grad_norm": 1.609375, "learning_rate": 0.0004982552163405623, "loss": 5.8914, "mean_token_accuracy": 0.17837537676095963, "num_tokens": 949758.0, "step": 1120 }, { "entropy": 5.911374568939209, "epoch": 0.025137698727473828, "grad_norm": 1.4296875, "learning_rate": 0.0004981057259983839, "loss": 6.046, "mean_token_accuracy": 0.17550223916769028, "num_tokens": 954028.0, "step": 1125 }, { "entropy": 6.2100794315338135, "epoch": 0.02524942183292927, "grad_norm": 1.484375, "learning_rate": 0.0004979501191000262, "loss": 6.0439, "mean_token_accuracy": 0.1597377523779869, "num_tokens": 958006.0, "step": 1130 }, { "entropy": 5.997774934768676, "epoch": 0.02536114493838471, "grad_norm": 1.46875, "learning_rate": 0.0004977883999115311, "loss": 5.9673, "mean_token_accuracy": 0.1754068598151207, "num_tokens": 962637.0, "step": 1135 }, { "entropy": 6.133125972747803, "epoch": 0.025472868043840146, "grad_norm": 1.3203125, "learning_rate": 0.0004976205728665113, "loss": 5.9539, "mean_token_accuracy": 0.17636077851057053, "num_tokens": 966770.0, "step": 1140 }, { "entropy": 5.795867204666138, "epoch": 0.025584591149295587, "grad_norm": 1.5859375, "learning_rate": 0.0004974466425660307, "loss": 5.9624, "mean_token_accuracy": 0.17465363889932634, "num_tokens": 970976.0, "step": 1145 }, { "entropy": 6.01137866973877, "epoch": 0.025696314254751024, "grad_norm": 1.578125, "learning_rate": 0.0004972666137784759, "loss": 6.0146, "mean_token_accuracy": 0.16153744012117385, "num_tokens": 975253.0, "step": 1150 }, { "entropy": 6.057316732406616, "epoch": 0.025808037360206464, "grad_norm": 1.2734375, "learning_rate": 0.0004970804914394271, "loss": 5.9926, "mean_token_accuracy": 0.16764254570007325, "num_tokens": 979388.0, "step": 1155 }, { "entropy": 5.929347705841065, "epoch": 0.025919760465661905, "grad_norm": 1.5546875, "learning_rate": 0.0004968882806515225, "loss": 5.9724, "mean_token_accuracy": 0.1787356838583946, "num_tokens": 983216.0, "step": 1160 }, { "entropy": 6.045448160171508, "epoch": 0.026031483571117342, "grad_norm": 1.3359375, "learning_rate": 0.0004966899866843177, "loss": 6.0631, "mean_token_accuracy": 0.16194660663604737, "num_tokens": 987850.0, "step": 1165 }, { "entropy": 6.053802442550659, "epoch": 0.026143206676572783, "grad_norm": 1.34375, "learning_rate": 0.000496485614974142, "loss": 6.0138, "mean_token_accuracy": 0.16602955460548402, "num_tokens": 992232.0, "step": 1170 }, { "entropy": 6.0259240627288815, "epoch": 0.02625492978202822, "grad_norm": 1.4765625, "learning_rate": 0.0004962751711239492, "loss": 6.0693, "mean_token_accuracy": 0.16301065385341645, "num_tokens": 996428.0, "step": 1175 }, { "entropy": 6.157499313354492, "epoch": 0.02636665288748366, "grad_norm": 1.4609375, "learning_rate": 0.0004960586609031636, "loss": 5.9524, "mean_token_accuracy": 0.17110942751169206, "num_tokens": 1000336.0, "step": 1180 }, { "entropy": 6.04528169631958, "epoch": 0.0264783759929391, "grad_norm": 1.6328125, "learning_rate": 0.0004958360902475224, "loss": 5.9189, "mean_token_accuracy": 0.16904981136322023, "num_tokens": 1004312.0, "step": 1185 }, { "entropy": 6.089739894866943, "epoch": 0.026590099098394538, "grad_norm": 1.453125, "learning_rate": 0.0004956074652589125, "loss": 6.174, "mean_token_accuracy": 0.15594123005867006, "num_tokens": 1008728.0, "step": 1190 }, { "entropy": 6.1193163871765135, "epoch": 0.02670182220384998, "grad_norm": 1.3828125, "learning_rate": 0.0004953727922052035, "loss": 6.0671, "mean_token_accuracy": 0.16603883504867553, "num_tokens": 1013385.0, "step": 1195 }, { "entropy": 6.139393329620361, "epoch": 0.026813545309305416, "grad_norm": 1.359375, "learning_rate": 0.0004951320775200756, "loss": 6.0219, "mean_token_accuracy": 0.16773877292871475, "num_tokens": 1017537.0, "step": 1200 }, { "entropy": 5.894366598129272, "epoch": 0.026925268414760856, "grad_norm": 1.5, "learning_rate": 0.0004948853278028436, "loss": 5.9409, "mean_token_accuracy": 0.17285942137241364, "num_tokens": 1021753.0, "step": 1205 }, { "entropy": 5.971589708328247, "epoch": 0.027036991520216297, "grad_norm": 1.3984375, "learning_rate": 0.0004946325498182755, "loss": 6.0589, "mean_token_accuracy": 0.1600156843662262, "num_tokens": 1026248.0, "step": 1210 }, { "entropy": 5.97881760597229, "epoch": 0.027148714625671734, "grad_norm": 1.453125, "learning_rate": 0.0004943737504964076, "loss": 5.8084, "mean_token_accuracy": 0.18238039016723634, "num_tokens": 1030284.0, "step": 1215 }, { "entropy": 6.004219436645508, "epoch": 0.027260437731127175, "grad_norm": 1.3984375, "learning_rate": 0.000494108936932354, "loss": 6.1125, "mean_token_accuracy": 0.1722887262701988, "num_tokens": 1034444.0, "step": 1220 }, { "entropy": 6.072319364547729, "epoch": 0.027372160836582615, "grad_norm": 1.3671875, "learning_rate": 0.0004938381163861124, "loss": 5.9253, "mean_token_accuracy": 0.18728673458099365, "num_tokens": 1038819.0, "step": 1225 }, { "entropy": 6.105956125259399, "epoch": 0.027483883942038052, "grad_norm": 1.328125, "learning_rate": 0.0004935612962823645, "loss": 6.1433, "mean_token_accuracy": 0.1664537325501442, "num_tokens": 1043303.0, "step": 1230 }, { "entropy": 5.987173557281494, "epoch": 0.027595607047493493, "grad_norm": 1.5078125, "learning_rate": 0.0004932784842102739, "loss": 5.9435, "mean_token_accuracy": 0.1737391769886017, "num_tokens": 1047451.0, "step": 1235 }, { "entropy": 6.031593132019043, "epoch": 0.02770733015294893, "grad_norm": 1.2578125, "learning_rate": 0.0004929896879232758, "loss": 5.9946, "mean_token_accuracy": 0.1745271012187004, "num_tokens": 1052370.0, "step": 1240 }, { "entropy": 6.133889484405517, "epoch": 0.02781905325840437, "grad_norm": 1.421875, "learning_rate": 0.0004926949153388668, "loss": 6.1184, "mean_token_accuracy": 0.15884814709424971, "num_tokens": 1056755.0, "step": 1245 }, { "entropy": 6.027875137329102, "epoch": 0.02793077636385981, "grad_norm": 1.328125, "learning_rate": 0.0004923941745383859, "loss": 6.0237, "mean_token_accuracy": 0.1649158090353012, "num_tokens": 1061380.0, "step": 1250 }, { "entropy": 5.859837007522583, "epoch": 0.02804249946931525, "grad_norm": 1.34375, "learning_rate": 0.000492087473766794, "loss": 5.9049, "mean_token_accuracy": 0.1740475058555603, "num_tokens": 1065633.0, "step": 1255 }, { "entropy": 5.939010953903198, "epoch": 0.02815422257477069, "grad_norm": 1.5234375, "learning_rate": 0.000491774821432448, "loss": 6.043, "mean_token_accuracy": 0.1675959825515747, "num_tokens": 1070131.0, "step": 1260 }, { "entropy": 6.035466241836548, "epoch": 0.028265945680226126, "grad_norm": 1.3125, "learning_rate": 0.0004914562261068693, "loss": 5.956, "mean_token_accuracy": 0.17018137276172637, "num_tokens": 1074465.0, "step": 1265 }, { "entropy": 5.894679594039917, "epoch": 0.028377668785681567, "grad_norm": 1.5546875, "learning_rate": 0.0004911316965245098, "loss": 5.8307, "mean_token_accuracy": 0.17515944987535476, "num_tokens": 1078738.0, "step": 1270 }, { "entropy": 5.887772560119629, "epoch": 0.028489391891137007, "grad_norm": 1.4375, "learning_rate": 0.000490801241582512, "loss": 5.9601, "mean_token_accuracy": 0.1752310276031494, "num_tokens": 1082529.0, "step": 1275 }, { "entropy": 6.000855207443237, "epoch": 0.028601114996592444, "grad_norm": 1.328125, "learning_rate": 0.000490464870340465, "loss": 6.0392, "mean_token_accuracy": 0.16873422712087632, "num_tokens": 1087043.0, "step": 1280 }, { "entropy": 5.8165771007537845, "epoch": 0.028712838102047885, "grad_norm": 1.53125, "learning_rate": 0.0004901225920201563, "loss": 5.9401, "mean_token_accuracy": 0.18170406371355058, "num_tokens": 1091045.0, "step": 1285 }, { "entropy": 6.046920347213745, "epoch": 0.028824561207503322, "grad_norm": 1.515625, "learning_rate": 0.000489774416005319, "loss": 5.911, "mean_token_accuracy": 0.17549529373645784, "num_tokens": 1094949.0, "step": 1290 }, { "entropy": 5.849216651916504, "epoch": 0.028936284312958763, "grad_norm": 1.5546875, "learning_rate": 0.0004894203518413742, "loss": 5.9407, "mean_token_accuracy": 0.1647828571498394, "num_tokens": 1099131.0, "step": 1295 }, { "entropy": 5.80899658203125, "epoch": 0.029048007418414203, "grad_norm": 1.4765625, "learning_rate": 0.0004890604092351701, "loss": 5.8729, "mean_token_accuracy": 0.17930638641119004, "num_tokens": 1102967.0, "step": 1300 }, { "entropy": 5.98758225440979, "epoch": 0.02915973052386964, "grad_norm": 1.4375, "learning_rate": 0.000488694598054715, "loss": 5.9128, "mean_token_accuracy": 0.17649397403001785, "num_tokens": 1106777.0, "step": 1305 }, { "entropy": 5.834689521789551, "epoch": 0.02927145362932508, "grad_norm": 1.4296875, "learning_rate": 0.0004883229283289071, "loss": 5.9249, "mean_token_accuracy": 0.1766020655632019, "num_tokens": 1111184.0, "step": 1310 }, { "entropy": 6.064471244812012, "epoch": 0.02938317673478052, "grad_norm": 1.328125, "learning_rate": 0.00048794541024725993, "loss": 5.9235, "mean_token_accuracy": 0.17901833802461625, "num_tokens": 1115651.0, "step": 1315 }, { "entropy": 6.012405014038086, "epoch": 0.02949489984023596, "grad_norm": 1.3671875, "learning_rate": 0.0004875620541596221, "loss": 5.956, "mean_token_accuracy": 0.1633922666311264, "num_tokens": 1120012.0, "step": 1320 }, { "entropy": 5.800662183761597, "epoch": 0.0296066229456914, "grad_norm": 1.4296875, "learning_rate": 0.00048717287057589454, "loss": 5.859, "mean_token_accuracy": 0.18077441900968552, "num_tokens": 1124549.0, "step": 1325 }, { "entropy": 5.966872882843018, "epoch": 0.029718346051146836, "grad_norm": 1.4140625, "learning_rate": 0.0004867778701657417, "loss": 5.9441, "mean_token_accuracy": 0.17887909561395646, "num_tokens": 1128968.0, "step": 1330 }, { "entropy": 5.908768558502198, "epoch": 0.029830069156602277, "grad_norm": 1.3671875, "learning_rate": 0.00048637706375829955, "loss": 6.0053, "mean_token_accuracy": 0.17145692855119704, "num_tokens": 1133396.0, "step": 1335 }, { "entropy": 6.086913299560547, "epoch": 0.029941792262057718, "grad_norm": 1.4140625, "learning_rate": 0.000485970462341878, "loss": 5.9048, "mean_token_accuracy": 0.17118549942970276, "num_tokens": 1137577.0, "step": 1340 }, { "entropy": 5.773934030532837, "epoch": 0.030053515367513155, "grad_norm": 1.40625, "learning_rate": 0.00048555807706366044, "loss": 5.8044, "mean_token_accuracy": 0.17675584256649018, "num_tokens": 1141551.0, "step": 1345 }, { "entropy": 5.967331218719482, "epoch": 0.030165238472968595, "grad_norm": 1.484375, "learning_rate": 0.00048513991922939756, "loss": 5.8297, "mean_token_accuracy": 0.17623057961463928, "num_tokens": 1145295.0, "step": 1350 }, { "entropy": 5.916956901550293, "epoch": 0.030276961578424032, "grad_norm": 1.328125, "learning_rate": 0.00048471600030309744, "loss": 6.0757, "mean_token_accuracy": 0.16089194118976594, "num_tokens": 1149946.0, "step": 1355 }, { "entropy": 5.946835136413574, "epoch": 0.030388684683879473, "grad_norm": 1.625, "learning_rate": 0.00048428633190671186, "loss": 5.9579, "mean_token_accuracy": 0.17933496832847595, "num_tokens": 1153955.0, "step": 1360 }, { "entropy": 5.879767847061157, "epoch": 0.030500407789334914, "grad_norm": 1.4140625, "learning_rate": 0.0004838509258198167, "loss": 5.8494, "mean_token_accuracy": 0.17823615819215774, "num_tokens": 1158568.0, "step": 1365 }, { "entropy": 5.8853926181793215, "epoch": 0.03061213089479035, "grad_norm": 1.515625, "learning_rate": 0.00048340979397929, "loss": 5.8017, "mean_token_accuracy": 0.17762538492679597, "num_tokens": 1162217.0, "step": 1370 }, { "entropy": 5.819405508041382, "epoch": 0.03072385400024579, "grad_norm": 1.453125, "learning_rate": 0.00048296294847898386, "loss": 5.8786, "mean_token_accuracy": 0.17288521826267242, "num_tokens": 1165905.0, "step": 1375 }, { "entropy": 5.949618673324585, "epoch": 0.03083557710570123, "grad_norm": 1.484375, "learning_rate": 0.0004825104015693934, "loss": 5.8634, "mean_token_accuracy": 0.1736384004354477, "num_tokens": 1170352.0, "step": 1380 }, { "entropy": 5.8261597633361815, "epoch": 0.03094730021115667, "grad_norm": 1.390625, "learning_rate": 0.0004820521656573208, "loss": 5.9311, "mean_token_accuracy": 0.17523645013570785, "num_tokens": 1174560.0, "step": 1385 }, { "entropy": 5.963821220397949, "epoch": 0.03105902331661211, "grad_norm": 1.3828125, "learning_rate": 0.00048158825330553505, "loss": 5.8748, "mean_token_accuracy": 0.1740915596485138, "num_tokens": 1178544.0, "step": 1390 }, { "entropy": 5.702950811386108, "epoch": 0.031170746422067547, "grad_norm": 1.5546875, "learning_rate": 0.00048111867723242763, "loss": 5.7173, "mean_token_accuracy": 0.19122548252344132, "num_tokens": 1182541.0, "step": 1395 }, { "entropy": 5.825392246246338, "epoch": 0.031282469527522984, "grad_norm": 1.328125, "learning_rate": 0.0004806434503116637, "loss": 5.803, "mean_token_accuracy": 0.18207484632730483, "num_tokens": 1186684.0, "step": 1400 }, { "entropy": 5.852643585205078, "epoch": 0.03139419263297843, "grad_norm": 1.4296875, "learning_rate": 0.0004801625855718296, "loss": 5.7638, "mean_token_accuracy": 0.1846204161643982, "num_tokens": 1190785.0, "step": 1405 }, { "entropy": 5.6974410057067875, "epoch": 0.031505915738433865, "grad_norm": 1.3671875, "learning_rate": 0.00047967609619607477, "loss": 5.7808, "mean_token_accuracy": 0.17526547610759735, "num_tokens": 1194940.0, "step": 1410 }, { "entropy": 5.803288984298706, "epoch": 0.0316176388438893, "grad_norm": 1.3984375, "learning_rate": 0.0004791839955217513, "loss": 5.7563, "mean_token_accuracy": 0.18818183541297911, "num_tokens": 1198765.0, "step": 1415 }, { "entropy": 5.929622077941895, "epoch": 0.031729361949344746, "grad_norm": 1.3203125, "learning_rate": 0.00047868629704004786, "loss": 5.979, "mean_token_accuracy": 0.1642720431089401, "num_tokens": 1203266.0, "step": 1420 }, { "entropy": 5.848547840118409, "epoch": 0.03184108505480018, "grad_norm": 1.3203125, "learning_rate": 0.00047818301439561965, "loss": 5.7561, "mean_token_accuracy": 0.1881594181060791, "num_tokens": 1207414.0, "step": 1425 }, { "entropy": 5.699222707748413, "epoch": 0.03195280816025562, "grad_norm": 1.359375, "learning_rate": 0.00047767416138621454, "loss": 5.7656, "mean_token_accuracy": 0.18503025323152542, "num_tokens": 1211325.0, "step": 1430 }, { "entropy": 5.976352977752685, "epoch": 0.032064531265711065, "grad_norm": 1.4453125, "learning_rate": 0.000477159751962295, "loss": 5.801, "mean_token_accuracy": 0.18062487095594407, "num_tokens": 1215866.0, "step": 1435 }, { "entropy": 5.736691808700561, "epoch": 0.0321762543711665, "grad_norm": 1.375, "learning_rate": 0.00047663980022665507, "loss": 5.861, "mean_token_accuracy": 0.17032930999994278, "num_tokens": 1220241.0, "step": 1440 }, { "entropy": 5.691896915435791, "epoch": 0.03228797747662194, "grad_norm": 1.5390625, "learning_rate": 0.00047611432043403437, "loss": 5.8819, "mean_token_accuracy": 0.1773227259516716, "num_tokens": 1224330.0, "step": 1445 }, { "entropy": 6.069937038421631, "epoch": 0.03239970058207738, "grad_norm": 1.4609375, "learning_rate": 0.0004755833269907267, "loss": 5.9618, "mean_token_accuracy": 0.16885158866643907, "num_tokens": 1228518.0, "step": 1450 }, { "entropy": 5.808598423004151, "epoch": 0.03251142368753282, "grad_norm": 1.3671875, "learning_rate": 0.0004750468344541857, "loss": 5.8203, "mean_token_accuracy": 0.18446521908044816, "num_tokens": 1232556.0, "step": 1455 }, { "entropy": 5.866223096847534, "epoch": 0.03262314679298826, "grad_norm": 1.6015625, "learning_rate": 0.00047450485753262525, "loss": 5.8594, "mean_token_accuracy": 0.1794953316450119, "num_tokens": 1236464.0, "step": 1460 }, { "entropy": 5.9548783779144285, "epoch": 0.032734869898443694, "grad_norm": 1.3828125, "learning_rate": 0.00047395741108461633, "loss": 5.8455, "mean_token_accuracy": 0.18512817621231079, "num_tokens": 1240478.0, "step": 1465 }, { "entropy": 5.9534708023071286, "epoch": 0.03284659300389914, "grad_norm": 1.40625, "learning_rate": 0.00047340451011867985, "loss": 5.906, "mean_token_accuracy": 0.1799629181623459, "num_tokens": 1244149.0, "step": 1470 }, { "entropy": 6.017633962631225, "epoch": 0.032958316109354575, "grad_norm": 1.671875, "learning_rate": 0.00047284616979287515, "loss": 5.9879, "mean_token_accuracy": 0.16287869438529015, "num_tokens": 1248617.0, "step": 1475 }, { "entropy": 5.903649234771729, "epoch": 0.03307003921481001, "grad_norm": 1.3046875, "learning_rate": 0.00047228240541438433, "loss": 5.8795, "mean_token_accuracy": 0.1832698553800583, "num_tokens": 1253044.0, "step": 1480 }, { "entropy": 5.926074123382568, "epoch": 0.03318176232026546, "grad_norm": 1.4609375, "learning_rate": 0.00047171323243909257, "loss": 5.9143, "mean_token_accuracy": 0.1814977541565895, "num_tokens": 1257651.0, "step": 1485 }, { "entropy": 5.833726167678833, "epoch": 0.033293485425720894, "grad_norm": 1.4453125, "learning_rate": 0.00047113866647116457, "loss": 5.8368, "mean_token_accuracy": 0.18549390286207199, "num_tokens": 1261805.0, "step": 1490 }, { "entropy": 5.733483600616455, "epoch": 0.03340520853117633, "grad_norm": 1.453125, "learning_rate": 0.0004705587232626164, "loss": 5.6356, "mean_token_accuracy": 0.19865250885486602, "num_tokens": 1265625.0, "step": 1495 }, { "entropy": 5.693035125732422, "epoch": 0.033516931636631775, "grad_norm": 1.34375, "learning_rate": 0.00046997341871288424, "loss": 5.8133, "mean_token_accuracy": 0.18278113082051278, "num_tokens": 1269876.0, "step": 1500 }, { "entropy": 5.831105041503906, "epoch": 0.03362865474208721, "grad_norm": 1.265625, "learning_rate": 0.0004693827688683879, "loss": 5.7775, "mean_token_accuracy": 0.18592336624860764, "num_tokens": 1273821.0, "step": 1505 }, { "entropy": 5.830736303329468, "epoch": 0.03374037784754265, "grad_norm": 1.3125, "learning_rate": 0.0004687867899220914, "loss": 5.8811, "mean_token_accuracy": 0.18795700818300248, "num_tokens": 1278574.0, "step": 1510 }, { "entropy": 5.784781217575073, "epoch": 0.033852100952998086, "grad_norm": 1.40625, "learning_rate": 0.00046818549821305846, "loss": 5.8642, "mean_token_accuracy": 0.17242854535579683, "num_tokens": 1283271.0, "step": 1515 }, { "entropy": 5.806311082839966, "epoch": 0.03396382405845353, "grad_norm": 1.4375, "learning_rate": 0.00046757891022600494, "loss": 5.6992, "mean_token_accuracy": 0.1895821213722229, "num_tokens": 1287633.0, "step": 1520 }, { "entropy": 5.612684059143066, "epoch": 0.03407554716390897, "grad_norm": 1.5234375, "learning_rate": 0.0004669670425908471, "loss": 5.7039, "mean_token_accuracy": 0.19535314291715622, "num_tokens": 1291796.0, "step": 1525 }, { "entropy": 5.7842505931854244, "epoch": 0.034187270269364405, "grad_norm": 1.4609375, "learning_rate": 0.0004663499120822451, "loss": 5.8562, "mean_token_accuracy": 0.18286515921354293, "num_tokens": 1296086.0, "step": 1530 }, { "entropy": 5.824511098861694, "epoch": 0.03429899337481985, "grad_norm": 1.2890625, "learning_rate": 0.0004657275356191437, "loss": 5.8006, "mean_token_accuracy": 0.17361746430397035, "num_tokens": 1300651.0, "step": 1535 }, { "entropy": 5.797060441970825, "epoch": 0.034410716480275286, "grad_norm": 1.46875, "learning_rate": 0.00046509993026430804, "loss": 5.7873, "mean_token_accuracy": 0.18226577788591386, "num_tokens": 1304930.0, "step": 1540 }, { "entropy": 5.883905744552612, "epoch": 0.03452243958573072, "grad_norm": 1.390625, "learning_rate": 0.0004644671132238558, "loss": 5.9211, "mean_token_accuracy": 0.16726794093847275, "num_tokens": 1308950.0, "step": 1545 }, { "entropy": 5.8268091678619385, "epoch": 0.03463416269118617, "grad_norm": 1.53125, "learning_rate": 0.00046382910184678585, "loss": 5.7787, "mean_token_accuracy": 0.17821203917264938, "num_tokens": 1313059.0, "step": 1550 }, { "entropy": 5.647272109985352, "epoch": 0.034745885796641604, "grad_norm": 1.453125, "learning_rate": 0.0004631859136245025, "loss": 5.6842, "mean_token_accuracy": 0.19873663783073425, "num_tokens": 1316756.0, "step": 1555 }, { "entropy": 5.785255432128906, "epoch": 0.03485760890209704, "grad_norm": 1.3671875, "learning_rate": 0.0004625375661903357, "loss": 5.9699, "mean_token_accuracy": 0.1627327397465706, "num_tokens": 1320834.0, "step": 1560 }, { "entropy": 5.799972629547119, "epoch": 0.034969332007552485, "grad_norm": 1.453125, "learning_rate": 0.00046188407731905787, "loss": 5.747, "mean_token_accuracy": 0.17980815470218658, "num_tokens": 1324484.0, "step": 1565 }, { "entropy": 5.779381561279297, "epoch": 0.03508105511300792, "grad_norm": 1.2421875, "learning_rate": 0.00046122546492639643, "loss": 5.7251, "mean_token_accuracy": 0.18375469446182252, "num_tokens": 1328935.0, "step": 1570 }, { "entropy": 5.741471004486084, "epoch": 0.03519277821846336, "grad_norm": 1.53125, "learning_rate": 0.000460561747068543, "loss": 5.7432, "mean_token_accuracy": 0.1859663426876068, "num_tokens": 1333225.0, "step": 1575 }, { "entropy": 5.714008522033692, "epoch": 0.0353045013239188, "grad_norm": 1.4921875, "learning_rate": 0.0004598929419416578, "loss": 5.6636, "mean_token_accuracy": 0.18822408169507981, "num_tokens": 1337234.0, "step": 1580 }, { "entropy": 5.844133186340332, "epoch": 0.03541622442937424, "grad_norm": 1.4375, "learning_rate": 0.00045921906788137123, "loss": 5.9233, "mean_token_accuracy": 0.1749085620045662, "num_tokens": 1341765.0, "step": 1585 }, { "entropy": 5.890516853332519, "epoch": 0.03552794753482968, "grad_norm": 1.5234375, "learning_rate": 0.00045854014336228115, "loss": 5.8023, "mean_token_accuracy": 0.17829006016254426, "num_tokens": 1346087.0, "step": 1590 }, { "entropy": 5.80145001411438, "epoch": 0.035639670640285115, "grad_norm": 1.390625, "learning_rate": 0.00045785618699744615, "loss": 5.8247, "mean_token_accuracy": 0.1754228189587593, "num_tokens": 1350443.0, "step": 1595 }, { "entropy": 5.880692100524902, "epoch": 0.03575139374574056, "grad_norm": 1.2578125, "learning_rate": 0.00045716721753787543, "loss": 5.8544, "mean_token_accuracy": 0.1789305865764618, "num_tokens": 1355092.0, "step": 1600 }, { "entropy": 5.775990533828735, "epoch": 0.035863116851195996, "grad_norm": 1.2890625, "learning_rate": 0.0004564732538720148, "loss": 5.8375, "mean_token_accuracy": 0.18685502409934998, "num_tokens": 1359379.0, "step": 1605 }, { "entropy": 5.826099395751953, "epoch": 0.03597483995665143, "grad_norm": 1.5, "learning_rate": 0.00045577431502522877, "loss": 5.6924, "mean_token_accuracy": 0.18221372812986375, "num_tokens": 1363346.0, "step": 1610 }, { "entropy": 5.730778932571411, "epoch": 0.03608656306210688, "grad_norm": 1.359375, "learning_rate": 0.0004550704201592787, "loss": 5.773, "mean_token_accuracy": 0.17810402810573578, "num_tokens": 1367322.0, "step": 1615 }, { "entropy": 5.649629878997803, "epoch": 0.036198286167562314, "grad_norm": 1.3671875, "learning_rate": 0.0004543615885717981, "loss": 5.7162, "mean_token_accuracy": 0.1771922379732132, "num_tokens": 1371165.0, "step": 1620 }, { "entropy": 5.648497486114502, "epoch": 0.03631000927301775, "grad_norm": 1.390625, "learning_rate": 0.00045364783969576296, "loss": 5.7376, "mean_token_accuracy": 0.1936981901526451, "num_tokens": 1375119.0, "step": 1625 }, { "entropy": 5.806000185012818, "epoch": 0.03642173237847319, "grad_norm": 1.3125, "learning_rate": 0.0004529291930989592, "loss": 5.6657, "mean_token_accuracy": 0.18797771632671356, "num_tokens": 1379268.0, "step": 1630 }, { "entropy": 5.663884687423706, "epoch": 0.03653345548392863, "grad_norm": 1.421875, "learning_rate": 0.0004522056684834464, "loss": 5.785, "mean_token_accuracy": 0.16971432119607927, "num_tokens": 1383477.0, "step": 1635 }, { "entropy": 5.687128686904908, "epoch": 0.03664517858938407, "grad_norm": 1.421875, "learning_rate": 0.0004514772856850173, "loss": 5.7087, "mean_token_accuracy": 0.1861000046133995, "num_tokens": 1387138.0, "step": 1640 }, { "entropy": 5.865495443344116, "epoch": 0.03675690169483951, "grad_norm": 1.3359375, "learning_rate": 0.0004507440646726542, "loss": 5.835, "mean_token_accuracy": 0.16652033776044844, "num_tokens": 1391758.0, "step": 1645 }, { "entropy": 5.652455759048462, "epoch": 0.03686862480029495, "grad_norm": 1.484375, "learning_rate": 0.0004500060255479818, "loss": 5.7357, "mean_token_accuracy": 0.17026722058653831, "num_tokens": 1395517.0, "step": 1650 }, { "entropy": 5.77337498664856, "epoch": 0.03698034790575039, "grad_norm": 1.4609375, "learning_rate": 0.0004492631885447151, "loss": 5.7572, "mean_token_accuracy": 0.1879993349313736, "num_tokens": 1400021.0, "step": 1655 }, { "entropy": 5.89671516418457, "epoch": 0.037092071011205825, "grad_norm": 1.4375, "learning_rate": 0.00044851557402810616, "loss": 5.918, "mean_token_accuracy": 0.17465589046478272, "num_tokens": 1404456.0, "step": 1660 }, { "entropy": 5.753234243392944, "epoch": 0.03720379411666127, "grad_norm": 1.2890625, "learning_rate": 0.00044776320249438444, "loss": 5.8144, "mean_token_accuracy": 0.17828851491212844, "num_tokens": 1408612.0, "step": 1665 }, { "entropy": 5.80224084854126, "epoch": 0.037315517222116706, "grad_norm": 1.3984375, "learning_rate": 0.00044700609457019565, "loss": 5.7924, "mean_token_accuracy": 0.18226661533117294, "num_tokens": 1412688.0, "step": 1670 }, { "entropy": 5.919682836532592, "epoch": 0.037427240327572144, "grad_norm": 1.375, "learning_rate": 0.0004462442710120359, "loss": 5.8297, "mean_token_accuracy": 0.17643865197896957, "num_tokens": 1417273.0, "step": 1675 }, { "entropy": 5.83403468132019, "epoch": 0.03753896343302759, "grad_norm": 1.5, "learning_rate": 0.000445477752705683, "loss": 5.7559, "mean_token_accuracy": 0.17946113049983978, "num_tokens": 1421737.0, "step": 1680 }, { "entropy": 5.653639125823974, "epoch": 0.037650686538483025, "grad_norm": 1.3671875, "learning_rate": 0.00044470656066562336, "loss": 5.528, "mean_token_accuracy": 0.20140709578990937, "num_tokens": 1426154.0, "step": 1685 }, { "entropy": 5.726971578598023, "epoch": 0.03776240964393846, "grad_norm": 1.421875, "learning_rate": 0.0004439307160344765, "loss": 5.7815, "mean_token_accuracy": 0.17367986142635344, "num_tokens": 1430270.0, "step": 1690 }, { "entropy": 5.809293508529663, "epoch": 0.0378741327493939, "grad_norm": 1.34375, "learning_rate": 0.00044315024008241473, "loss": 5.6611, "mean_token_accuracy": 0.1972547873854637, "num_tokens": 1434877.0, "step": 1695 }, { "entropy": 5.65094747543335, "epoch": 0.03798585585484934, "grad_norm": 1.4140625, "learning_rate": 0.0004423651542065806, "loss": 5.7318, "mean_token_accuracy": 0.19258931577205657, "num_tokens": 1438690.0, "step": 1700 }, { "entropy": 5.721880674362183, "epoch": 0.03809757896030478, "grad_norm": 1.53125, "learning_rate": 0.00044157547993050006, "loss": 5.6646, "mean_token_accuracy": 0.19387782514095306, "num_tokens": 1443085.0, "step": 1705 }, { "entropy": 5.580819368362427, "epoch": 0.03820930206576022, "grad_norm": 1.5078125, "learning_rate": 0.00044078123890349227, "loss": 5.5564, "mean_token_accuracy": 0.20745181739330293, "num_tokens": 1447280.0, "step": 1710 }, { "entropy": 5.709810638427735, "epoch": 0.03832102517121566, "grad_norm": 1.328125, "learning_rate": 0.00043998245290007606, "loss": 5.7408, "mean_token_accuracy": 0.1841261014342308, "num_tokens": 1451639.0, "step": 1715 }, { "entropy": 5.823773813247681, "epoch": 0.0384327482766711, "grad_norm": 1.4765625, "learning_rate": 0.00043917914381937323, "loss": 5.7155, "mean_token_accuracy": 0.18863430619239807, "num_tokens": 1455473.0, "step": 1720 }, { "entropy": 5.738099813461304, "epoch": 0.038544471382126536, "grad_norm": 1.265625, "learning_rate": 0.00043837133368450815, "loss": 5.7901, "mean_token_accuracy": 0.1780441515147686, "num_tokens": 1460332.0, "step": 1725 }, { "entropy": 5.72046480178833, "epoch": 0.03865619448758198, "grad_norm": 1.296875, "learning_rate": 0.0004375590446420037, "loss": 5.6767, "mean_token_accuracy": 0.19585542976856232, "num_tokens": 1465013.0, "step": 1730 }, { "entropy": 5.666249418258667, "epoch": 0.03876791759303742, "grad_norm": 1.3671875, "learning_rate": 0.0004367422989611743, "loss": 5.5938, "mean_token_accuracy": 0.1894269183278084, "num_tokens": 1469070.0, "step": 1735 }, { "entropy": 5.807224321365356, "epoch": 0.038879640698492854, "grad_norm": 1.234375, "learning_rate": 0.0004359211190335153, "loss": 5.6786, "mean_token_accuracy": 0.1812390998005867, "num_tokens": 1473426.0, "step": 1740 }, { "entropy": 5.647406721115113, "epoch": 0.0389913638039483, "grad_norm": 1.421875, "learning_rate": 0.00043509552737208923, "loss": 5.7754, "mean_token_accuracy": 0.18348126858472824, "num_tokens": 1477631.0, "step": 1745 }, { "entropy": 5.6247352123260494, "epoch": 0.039103086909403735, "grad_norm": 1.3046875, "learning_rate": 0.00043426554661090853, "loss": 5.8263, "mean_token_accuracy": 0.17752304524183274, "num_tokens": 1481921.0, "step": 1750 }, { "entropy": 5.883453607559204, "epoch": 0.03921481001485917, "grad_norm": 1.3671875, "learning_rate": 0.00043343119950431516, "loss": 5.7789, "mean_token_accuracy": 0.18748508542776107, "num_tokens": 1486571.0, "step": 1755 }, { "entropy": 5.773577117919922, "epoch": 0.03932653312031461, "grad_norm": 1.4296875, "learning_rate": 0.00043259250892635644, "loss": 5.7668, "mean_token_accuracy": 0.17757585793733596, "num_tokens": 1490952.0, "step": 1760 }, { "entropy": 5.652618646621704, "epoch": 0.03943825622577005, "grad_norm": 1.3359375, "learning_rate": 0.0004317494978701582, "loss": 5.6286, "mean_token_accuracy": 0.1940794676542282, "num_tokens": 1495144.0, "step": 1765 }, { "entropy": 5.822029495239258, "epoch": 0.03954997933122549, "grad_norm": 1.3671875, "learning_rate": 0.0004309021894472943, "loss": 5.7134, "mean_token_accuracy": 0.18479356169700623, "num_tokens": 1499386.0, "step": 1770 }, { "entropy": 5.70394229888916, "epoch": 0.03966170243668093, "grad_norm": 1.578125, "learning_rate": 0.0004300506068871534, "loss": 5.6437, "mean_token_accuracy": 0.19557296335697175, "num_tokens": 1503583.0, "step": 1775 }, { "entropy": 5.668413591384888, "epoch": 0.03977342554213637, "grad_norm": 1.46875, "learning_rate": 0.00042919477353630135, "loss": 5.6645, "mean_token_accuracy": 0.184171424806118, "num_tokens": 1507680.0, "step": 1780 }, { "entropy": 5.8005297660827635, "epoch": 0.03988514864759181, "grad_norm": 1.3203125, "learning_rate": 0.000428334712857842, "loss": 5.7538, "mean_token_accuracy": 0.18311063945293427, "num_tokens": 1511856.0, "step": 1785 }, { "entropy": 5.912327814102173, "epoch": 0.039996871753047246, "grad_norm": 1.234375, "learning_rate": 0.00042747044843077304, "loss": 5.7356, "mean_token_accuracy": 0.17745298892259598, "num_tokens": 1516176.0, "step": 1790 }, { "entropy": 5.7352742671966555, "epoch": 0.04010859485850269, "grad_norm": 1.4296875, "learning_rate": 0.00042660200394934047, "loss": 5.635, "mean_token_accuracy": 0.19073558300733567, "num_tokens": 1520060.0, "step": 1795 }, { "entropy": 5.495400428771973, "epoch": 0.04022031796395813, "grad_norm": 1.40625, "learning_rate": 0.00042572940322238844, "loss": 5.7122, "mean_token_accuracy": 0.18623971492052077, "num_tokens": 1524165.0, "step": 1800 }, { "entropy": 5.868027305603027, "epoch": 0.040332041069413564, "grad_norm": 1.359375, "learning_rate": 0.00042485267017270664, "loss": 5.8853, "mean_token_accuracy": 0.1717434585094452, "num_tokens": 1528065.0, "step": 1805 }, { "entropy": 5.821336555480957, "epoch": 0.040443764174869, "grad_norm": 1.328125, "learning_rate": 0.0004239718288363745, "loss": 5.6691, "mean_token_accuracy": 0.19097715318202974, "num_tokens": 1532618.0, "step": 1810 }, { "entropy": 5.592393159866333, "epoch": 0.040555487280324445, "grad_norm": 1.3046875, "learning_rate": 0.0004230869033621023, "loss": 5.6987, "mean_token_accuracy": 0.1828291967511177, "num_tokens": 1536965.0, "step": 1815 }, { "entropy": 5.767320680618286, "epoch": 0.04066721038577988, "grad_norm": 1.453125, "learning_rate": 0.0004221979180105688, "loss": 5.8283, "mean_token_accuracy": 0.17617318630218506, "num_tokens": 1541332.0, "step": 1820 }, { "entropy": 5.672343111038208, "epoch": 0.04077893349123532, "grad_norm": 1.3359375, "learning_rate": 0.00042130489715375645, "loss": 5.5244, "mean_token_accuracy": 0.2023320123553276, "num_tokens": 1545324.0, "step": 1825 }, { "entropy": 5.767176914215088, "epoch": 0.040890656596690764, "grad_norm": 1.3515625, "learning_rate": 0.00042040786527428335, "loss": 5.7512, "mean_token_accuracy": 0.1897562712430954, "num_tokens": 1549409.0, "step": 1830 }, { "entropy": 5.759979391098023, "epoch": 0.0410023797021462, "grad_norm": 1.40625, "learning_rate": 0.0004195068469647315, "loss": 5.7413, "mean_token_accuracy": 0.1818301036953926, "num_tokens": 1553526.0, "step": 1835 }, { "entropy": 5.775640344619751, "epoch": 0.04111410280760164, "grad_norm": 1.28125, "learning_rate": 0.00041860186692697297, "loss": 5.8355, "mean_token_accuracy": 0.1880885362625122, "num_tokens": 1558475.0, "step": 1840 }, { "entropy": 5.726383304595947, "epoch": 0.04122582591305708, "grad_norm": 1.453125, "learning_rate": 0.00041769294997149264, "loss": 5.6429, "mean_token_accuracy": 0.18811526596546174, "num_tokens": 1562702.0, "step": 1845 }, { "entropy": 5.63990626335144, "epoch": 0.04133754901851252, "grad_norm": 1.3828125, "learning_rate": 0.0004167801210167081, "loss": 5.6439, "mean_token_accuracy": 0.1975985050201416, "num_tokens": 1566706.0, "step": 1850 }, { "entropy": 5.644278717041016, "epoch": 0.041449272123967956, "grad_norm": 1.4296875, "learning_rate": 0.0004158634050882861, "loss": 5.6656, "mean_token_accuracy": 0.1993358850479126, "num_tokens": 1570843.0, "step": 1855 }, { "entropy": 5.706397962570191, "epoch": 0.0415609952294234, "grad_norm": 1.3046875, "learning_rate": 0.0004149428273184569, "loss": 5.7084, "mean_token_accuracy": 0.18736132681369783, "num_tokens": 1575308.0, "step": 1860 }, { "entropy": 5.728898191452027, "epoch": 0.04167271833487884, "grad_norm": 1.34375, "learning_rate": 0.0004140184129453253, "loss": 5.8393, "mean_token_accuracy": 0.17313541173934938, "num_tokens": 1579397.0, "step": 1865 }, { "entropy": 5.7663342475891115, "epoch": 0.041784441440334275, "grad_norm": 1.4765625, "learning_rate": 0.000413090187312178, "loss": 5.6239, "mean_token_accuracy": 0.18672820925712585, "num_tokens": 1583464.0, "step": 1870 }, { "entropy": 5.718973779678345, "epoch": 0.04189616454578971, "grad_norm": 1.3046875, "learning_rate": 0.0004121581758667898, "loss": 5.6461, "mean_token_accuracy": 0.18322024047374724, "num_tokens": 1587948.0, "step": 1875 }, { "entropy": 5.578612995147705, "epoch": 0.042007887651245156, "grad_norm": 1.421875, "learning_rate": 0.00041122240416072533, "loss": 5.5589, "mean_token_accuracy": 0.21150048673152924, "num_tokens": 1591855.0, "step": 1880 }, { "entropy": 5.71712212562561, "epoch": 0.04211961075670059, "grad_norm": 1.3125, "learning_rate": 0.0004102828978486385, "loss": 5.6911, "mean_token_accuracy": 0.19235271066427231, "num_tokens": 1595951.0, "step": 1885 }, { "entropy": 5.7032770156860355, "epoch": 0.04223133386215603, "grad_norm": 1.4765625, "learning_rate": 0.0004093396826875695, "loss": 5.6402, "mean_token_accuracy": 0.1927582010626793, "num_tokens": 1600091.0, "step": 1890 }, { "entropy": 5.731023693084717, "epoch": 0.042343056967611474, "grad_norm": 1.40625, "learning_rate": 0.00040839278453623837, "loss": 5.706, "mean_token_accuracy": 0.1776691198348999, "num_tokens": 1604093.0, "step": 1895 }, { "entropy": 5.688064241409302, "epoch": 0.04245478007306691, "grad_norm": 1.3984375, "learning_rate": 0.0004074422293543363, "loss": 5.6452, "mean_token_accuracy": 0.19756510853767395, "num_tokens": 1608254.0, "step": 1900 }, { "entropy": 5.602776527404785, "epoch": 0.04256650317852235, "grad_norm": 1.2890625, "learning_rate": 0.0004064880432018137, "loss": 5.7254, "mean_token_accuracy": 0.18962162733078003, "num_tokens": 1612064.0, "step": 1905 }, { "entropy": 5.6795135021209715, "epoch": 0.04267822628397779, "grad_norm": 1.3359375, "learning_rate": 0.00040553025223816615, "loss": 5.7919, "mean_token_accuracy": 0.18375196754932405, "num_tokens": 1616494.0, "step": 1910 }, { "entropy": 5.72490439414978, "epoch": 0.04278994938943323, "grad_norm": 1.421875, "learning_rate": 0.00040456888272171653, "loss": 5.4819, "mean_token_accuracy": 0.20083572566509247, "num_tokens": 1620432.0, "step": 1915 }, { "entropy": 5.752138948440551, "epoch": 0.04290167249488867, "grad_norm": 1.3828125, "learning_rate": 0.00040360396100889577, "loss": 5.7682, "mean_token_accuracy": 0.17632409781217576, "num_tokens": 1625170.0, "step": 1920 }, { "entropy": 5.650776195526123, "epoch": 0.043013395600344104, "grad_norm": 1.3359375, "learning_rate": 0.0004026355135535202, "loss": 5.6995, "mean_token_accuracy": 0.17991890013217926, "num_tokens": 1629487.0, "step": 1925 }, { "entropy": 5.6605809211730955, "epoch": 0.04312511870579955, "grad_norm": 1.3984375, "learning_rate": 0.000401663566906066, "loss": 5.6162, "mean_token_accuracy": 0.19089022427797317, "num_tokens": 1633868.0, "step": 1930 }, { "entropy": 5.6820018768310545, "epoch": 0.043236841811254985, "grad_norm": 1.4453125, "learning_rate": 0.00040068814771294134, "loss": 5.7443, "mean_token_accuracy": 0.17744273394346238, "num_tokens": 1638153.0, "step": 1935 }, { "entropy": 5.644814300537109, "epoch": 0.04334856491671042, "grad_norm": 1.359375, "learning_rate": 0.0003997092827157562, "loss": 5.5181, "mean_token_accuracy": 0.22187568694353105, "num_tokens": 1642365.0, "step": 1940 }, { "entropy": 5.932576513290405, "epoch": 0.043460288022165866, "grad_norm": 1.3515625, "learning_rate": 0.000398726998750589, "loss": 5.6869, "mean_token_accuracy": 0.1798103779554367, "num_tokens": 1646202.0, "step": 1945 }, { "entropy": 5.623147630691529, "epoch": 0.0435720111276213, "grad_norm": 1.3671875, "learning_rate": 0.00039774132274725076, "loss": 5.566, "mean_token_accuracy": 0.198709699511528, "num_tokens": 1650542.0, "step": 1950 }, { "entropy": 5.543530559539795, "epoch": 0.04368373423307674, "grad_norm": 1.515625, "learning_rate": 0.00039675228172854707, "loss": 5.5123, "mean_token_accuracy": 0.1991402894258499, "num_tokens": 1654386.0, "step": 1955 }, { "entropy": 5.532556343078613, "epoch": 0.043795457338532184, "grad_norm": 1.4296875, "learning_rate": 0.0003957599028095371, "loss": 5.5337, "mean_token_accuracy": 0.19989801347255706, "num_tokens": 1658211.0, "step": 1960 }, { "entropy": 5.6866264820098875, "epoch": 0.04390718044398762, "grad_norm": 1.4921875, "learning_rate": 0.00039476421319679017, "loss": 5.684, "mean_token_accuracy": 0.18525188714265822, "num_tokens": 1662757.0, "step": 1965 }, { "entropy": 5.693357276916504, "epoch": 0.04401890354944306, "grad_norm": 1.4609375, "learning_rate": 0.00039376524018764, "loss": 5.667, "mean_token_accuracy": 0.18190956711769105, "num_tokens": 1666714.0, "step": 1970 }, { "entropy": 5.652660083770752, "epoch": 0.0441306266548985, "grad_norm": 1.2421875, "learning_rate": 0.00039276301116943616, "loss": 5.6781, "mean_token_accuracy": 0.18582605719566345, "num_tokens": 1671029.0, "step": 1975 }, { "entropy": 5.742524433135986, "epoch": 0.04424234976035394, "grad_norm": 1.34375, "learning_rate": 0.0003917575536187936, "loss": 5.6653, "mean_token_accuracy": 0.18949595242738723, "num_tokens": 1675366.0, "step": 1980 }, { "entropy": 5.644546365737915, "epoch": 0.04435407286580938, "grad_norm": 1.5078125, "learning_rate": 0.00039074889510083894, "loss": 5.5579, "mean_token_accuracy": 0.2034739837050438, "num_tokens": 1679657.0, "step": 1985 }, { "entropy": 5.530533266067505, "epoch": 0.044465795971264814, "grad_norm": 1.4375, "learning_rate": 0.00038973706326845495, "loss": 5.5582, "mean_token_accuracy": 0.19022609293460846, "num_tokens": 1683676.0, "step": 1990 }, { "entropy": 5.533994388580322, "epoch": 0.04457751907672026, "grad_norm": 1.4140625, "learning_rate": 0.0003887220858615225, "loss": 5.5562, "mean_token_accuracy": 0.20196932703256607, "num_tokens": 1687718.0, "step": 1995 }, { "entropy": 5.549967861175537, "epoch": 0.044689242182175695, "grad_norm": 1.515625, "learning_rate": 0.0003877039907061597, "loss": 5.598, "mean_token_accuracy": 0.18386923521757126, "num_tokens": 1691434.0, "step": 2000 }, { "entropy": 5.598109769821167, "epoch": 0.04480096528763113, "grad_norm": 1.3125, "learning_rate": 0.0003866828057139598, "loss": 5.6704, "mean_token_accuracy": 0.1848026692867279, "num_tokens": 1695714.0, "step": 2005 }, { "entropy": 5.667990732192993, "epoch": 0.044912688393086576, "grad_norm": 1.4921875, "learning_rate": 0.00038565855888122503, "loss": 5.4512, "mean_token_accuracy": 0.19753458797931672, "num_tokens": 1700245.0, "step": 2010 }, { "entropy": 5.413176441192627, "epoch": 0.045024411498542014, "grad_norm": 1.4765625, "learning_rate": 0.00038463127828819975, "loss": 5.5758, "mean_token_accuracy": 0.19638268798589706, "num_tokens": 1704329.0, "step": 2015 }, { "entropy": 5.654092931747437, "epoch": 0.04513613460399745, "grad_norm": 1.5, "learning_rate": 0.00038360099209830043, "loss": 5.601, "mean_token_accuracy": 0.1924460396170616, "num_tokens": 1708387.0, "step": 2020 }, { "entropy": 5.643488121032715, "epoch": 0.045247857709452895, "grad_norm": 1.4296875, "learning_rate": 0.0003825677285573433, "loss": 5.5818, "mean_token_accuracy": 0.190503291785717, "num_tokens": 1712620.0, "step": 2025 }, { "entropy": 5.61337571144104, "epoch": 0.04535958081490833, "grad_norm": 1.3359375, "learning_rate": 0.00038153151599277027, "loss": 5.5974, "mean_token_accuracy": 0.19394924491643906, "num_tokens": 1716862.0, "step": 2030 }, { "entropy": 5.756779384613037, "epoch": 0.04547130392036377, "grad_norm": 1.4140625, "learning_rate": 0.0003804923828128723, "loss": 5.6628, "mean_token_accuracy": 0.17784910202026366, "num_tokens": 1721121.0, "step": 2035 }, { "entropy": 5.6854815006256105, "epoch": 0.04558302702581921, "grad_norm": 1.296875, "learning_rate": 0.0003794503575060104, "loss": 5.4768, "mean_token_accuracy": 0.20856099724769592, "num_tokens": 1725307.0, "step": 2040 }, { "entropy": 5.673893165588379, "epoch": 0.04569475013127465, "grad_norm": 1.2421875, "learning_rate": 0.00037840546863983484, "loss": 5.7124, "mean_token_accuracy": 0.18246976882219315, "num_tokens": 1729931.0, "step": 2045 }, { "entropy": 5.563566875457764, "epoch": 0.04580647323673009, "grad_norm": 1.40625, "learning_rate": 0.0003773577448605015, "loss": 5.6909, "mean_token_accuracy": 0.18922285884618759, "num_tokens": 1734117.0, "step": 2050 }, { "entropy": 5.712671947479248, "epoch": 0.045918196342185524, "grad_norm": 1.375, "learning_rate": 0.0003763072148918872, "loss": 5.7125, "mean_token_accuracy": 0.18284738808870316, "num_tokens": 1738246.0, "step": 2055 }, { "entropy": 5.79467134475708, "epoch": 0.04602991944764097, "grad_norm": 1.421875, "learning_rate": 0.0003752539075348017, "loss": 5.6553, "mean_token_accuracy": 0.1847241759300232, "num_tokens": 1742557.0, "step": 2060 }, { "entropy": 5.5943460941314695, "epoch": 0.046141642553096406, "grad_norm": 1.359375, "learning_rate": 0.00037419785166619817, "loss": 5.5863, "mean_token_accuracy": 0.19431493878364564, "num_tokens": 1746639.0, "step": 2065 }, { "entropy": 5.792494869232177, "epoch": 0.04625336565855184, "grad_norm": 1.265625, "learning_rate": 0.0003731390762383818, "loss": 5.673, "mean_token_accuracy": 0.1853930190205574, "num_tokens": 1751528.0, "step": 2070 }, { "entropy": 5.629391717910766, "epoch": 0.04636508876400729, "grad_norm": 1.3359375, "learning_rate": 0.0003720776102782158, "loss": 5.4907, "mean_token_accuracy": 0.20055108666419982, "num_tokens": 1755734.0, "step": 2075 }, { "entropy": 5.545011901855469, "epoch": 0.046476811869462724, "grad_norm": 1.3671875, "learning_rate": 0.00037101348288632555, "loss": 5.6238, "mean_token_accuracy": 0.19830233454704285, "num_tokens": 1760188.0, "step": 2080 }, { "entropy": 5.631131315231324, "epoch": 0.04658853497491816, "grad_norm": 1.453125, "learning_rate": 0.0003699467232363012, "loss": 5.5733, "mean_token_accuracy": 0.19923410564661026, "num_tokens": 1764469.0, "step": 2085 }, { "entropy": 5.608803081512451, "epoch": 0.046700258080373605, "grad_norm": 1.3203125, "learning_rate": 0.0003688773605738973, "loss": 5.6552, "mean_token_accuracy": 0.18862041234970092, "num_tokens": 1768946.0, "step": 2090 }, { "entropy": 5.570499086380005, "epoch": 0.04681198118582904, "grad_norm": 1.4375, "learning_rate": 0.00036780542421623134, "loss": 5.4629, "mean_token_accuracy": 0.21054447591304778, "num_tokens": 1772806.0, "step": 2095 }, { "entropy": 5.711140966415405, "epoch": 0.04692370429128448, "grad_norm": 1.3671875, "learning_rate": 0.0003667309435509802, "loss": 5.7695, "mean_token_accuracy": 0.17885771691799163, "num_tokens": 1777333.0, "step": 2100 }, { "entropy": 5.665574312210083, "epoch": 0.047035427396739916, "grad_norm": 1.515625, "learning_rate": 0.0003656539480355741, "loss": 5.5474, "mean_token_accuracy": 0.19172714352607728, "num_tokens": 1781232.0, "step": 2105 }, { "entropy": 5.638804864883423, "epoch": 0.04714715050219536, "grad_norm": 1.390625, "learning_rate": 0.0003645744671963891, "loss": 5.6286, "mean_token_accuracy": 0.18934958130121232, "num_tokens": 1785543.0, "step": 2110 }, { "entropy": 5.59114089012146, "epoch": 0.0472588736076508, "grad_norm": 1.328125, "learning_rate": 0.0003634925306279376, "loss": 5.6293, "mean_token_accuracy": 0.19169047027826308, "num_tokens": 1789926.0, "step": 2115 }, { "entropy": 5.635175561904907, "epoch": 0.047370596713106235, "grad_norm": 1.3203125, "learning_rate": 0.0003624081679920574, "loss": 5.5693, "mean_token_accuracy": 0.19705144166946412, "num_tokens": 1794307.0, "step": 2120 }, { "entropy": 5.572471618652344, "epoch": 0.04748231981856168, "grad_norm": 1.3515625, "learning_rate": 0.0003613214090170977, "loss": 5.4883, "mean_token_accuracy": 0.20081721395254135, "num_tokens": 1798553.0, "step": 2125 }, { "entropy": 5.60513825416565, "epoch": 0.047594042924017116, "grad_norm": 1.34375, "learning_rate": 0.0003602322834971048, "loss": 5.4432, "mean_token_accuracy": 0.21184519529342652, "num_tokens": 1802795.0, "step": 2130 }, { "entropy": 5.560659694671631, "epoch": 0.04770576602947255, "grad_norm": 1.421875, "learning_rate": 0.0003591408212910051, "loss": 5.4397, "mean_token_accuracy": 0.20747311115264894, "num_tokens": 1806762.0, "step": 2135 }, { "entropy": 5.505787324905396, "epoch": 0.047817489134928, "grad_norm": 1.375, "learning_rate": 0.0003580470523217863, "loss": 5.4877, "mean_token_accuracy": 0.20571576803922653, "num_tokens": 1811067.0, "step": 2140 }, { "entropy": 5.4739891529083256, "epoch": 0.047929212240383434, "grad_norm": 1.3828125, "learning_rate": 0.0003569510065756771, "loss": 5.4798, "mean_token_accuracy": 0.20073288083076476, "num_tokens": 1815180.0, "step": 2145 }, { "entropy": 5.503992986679077, "epoch": 0.04804093534583887, "grad_norm": 1.4296875, "learning_rate": 0.0003558527141013254, "loss": 5.6137, "mean_token_accuracy": 0.18731415420770645, "num_tokens": 1819564.0, "step": 2150 }, { "entropy": 5.636356496810913, "epoch": 0.048152658451294315, "grad_norm": 1.21875, "learning_rate": 0.0003547522050089742, "loss": 5.5458, "mean_token_accuracy": 0.20209146589040755, "num_tokens": 1823974.0, "step": 2155 }, { "entropy": 5.744458246231079, "epoch": 0.04826438155674975, "grad_norm": 1.28125, "learning_rate": 0.00035364950946963606, "loss": 5.627, "mean_token_accuracy": 0.19121788069605827, "num_tokens": 1828532.0, "step": 2160 }, { "entropy": 5.5946817874908445, "epoch": 0.04837610466220519, "grad_norm": 1.265625, "learning_rate": 0.0003525446577142663, "loss": 5.5438, "mean_token_accuracy": 0.20079231560230254, "num_tokens": 1832678.0, "step": 2165 }, { "entropy": 5.55777587890625, "epoch": 0.04848782776766063, "grad_norm": 1.34375, "learning_rate": 0.00035143768003293395, "loss": 5.5345, "mean_token_accuracy": 0.20150283724069595, "num_tokens": 1837118.0, "step": 2170 }, { "entropy": 5.531144762039185, "epoch": 0.04859955087311607, "grad_norm": 1.3125, "learning_rate": 0.0003503286067739913, "loss": 5.4624, "mean_token_accuracy": 0.1982642188668251, "num_tokens": 1841348.0, "step": 2175 }, { "entropy": 5.564840984344483, "epoch": 0.04871127397857151, "grad_norm": 1.3515625, "learning_rate": 0.00034921746834324193, "loss": 5.5966, "mean_token_accuracy": 0.19088261425495148, "num_tokens": 1845715.0, "step": 2180 }, { "entropy": 5.588362360000611, "epoch": 0.048822997084026945, "grad_norm": 1.359375, "learning_rate": 0.0003481042952031072, "loss": 5.5474, "mean_token_accuracy": 0.18980715721845626, "num_tokens": 1850028.0, "step": 2185 }, { "entropy": 5.563361167907715, "epoch": 0.04893472018948239, "grad_norm": 1.3828125, "learning_rate": 0.0003469891178717911, "loss": 5.5563, "mean_token_accuracy": 0.19482785314321518, "num_tokens": 1854331.0, "step": 2190 }, { "entropy": 5.4609252452850345, "epoch": 0.049046443294937826, "grad_norm": 1.4609375, "learning_rate": 0.0003458719669224436, "loss": 5.5058, "mean_token_accuracy": 0.21373057812452317, "num_tokens": 1858740.0, "step": 2195 }, { "entropy": 5.689063501358032, "epoch": 0.04915816640039326, "grad_norm": 1.328125, "learning_rate": 0.0003447528729823221, "loss": 5.6488, "mean_token_accuracy": 0.19399519264698029, "num_tokens": 1863091.0, "step": 2200 }, { "entropy": 5.661524486541748, "epoch": 0.04926988950584871, "grad_norm": 1.375, "learning_rate": 0.0003436318667319525, "loss": 5.5638, "mean_token_accuracy": 0.1881960764527321, "num_tokens": 1867164.0, "step": 2205 }, { "entropy": 5.527868843078613, "epoch": 0.049381612611304145, "grad_norm": 1.453125, "learning_rate": 0.00034250897890428716, "loss": 5.6453, "mean_token_accuracy": 0.18407594561576843, "num_tokens": 1871614.0, "step": 2210 }, { "entropy": 5.720584440231323, "epoch": 0.04949333571675958, "grad_norm": 1.2578125, "learning_rate": 0.0003413842402838633, "loss": 5.668, "mean_token_accuracy": 0.18221641331911087, "num_tokens": 1876315.0, "step": 2215 }, { "entropy": 5.667582225799561, "epoch": 0.049605058822215026, "grad_norm": 1.3359375, "learning_rate": 0.00034025768170595834, "loss": 5.6102, "mean_token_accuracy": 0.18524401932954787, "num_tokens": 1880404.0, "step": 2220 }, { "entropy": 5.604895305633545, "epoch": 0.04971678192767046, "grad_norm": 1.3515625, "learning_rate": 0.0003391293340557446, "loss": 5.5866, "mean_token_accuracy": 0.18956515491008757, "num_tokens": 1885056.0, "step": 2225 }, { "entropy": 5.529463148117065, "epoch": 0.0498285050331259, "grad_norm": 1.3125, "learning_rate": 0.0003379992282674431, "loss": 5.5078, "mean_token_accuracy": 0.19293873012065887, "num_tokens": 1889170.0, "step": 2230 }, { "entropy": 5.542259788513183, "epoch": 0.04994022813858134, "grad_norm": 1.4453125, "learning_rate": 0.0003368673953234749, "loss": 5.4402, "mean_token_accuracy": 0.20548522472381592, "num_tokens": 1893344.0, "step": 2235 }, { "entropy": 5.5274498462677, "epoch": 0.05005195124403678, "grad_norm": 1.5, "learning_rate": 0.00033573386625361176, "loss": 5.5269, "mean_token_accuracy": 0.20261189937591553, "num_tokens": 1897399.0, "step": 2240 }, { "entropy": 5.537028121948242, "epoch": 0.05016367434949222, "grad_norm": 1.3125, "learning_rate": 0.00033459867213412567, "loss": 5.6219, "mean_token_accuracy": 0.19377635270357133, "num_tokens": 1901687.0, "step": 2245 }, { "entropy": 5.4919548511505125, "epoch": 0.050275397454947655, "grad_norm": 1.5, "learning_rate": 0.000333461844086937, "loss": 5.3408, "mean_token_accuracy": 0.2090111032128334, "num_tokens": 1905556.0, "step": 2250 }, { "entropy": 5.511547946929932, "epoch": 0.0503871205604031, "grad_norm": 1.5546875, "learning_rate": 0.00033232341327876097, "loss": 5.5062, "mean_token_accuracy": 0.19810119569301604, "num_tokens": 1909477.0, "step": 2255 }, { "entropy": 5.554897499084473, "epoch": 0.05049884366585854, "grad_norm": 1.421875, "learning_rate": 0.0003311834109202531, "loss": 5.551, "mean_token_accuracy": 0.18918206989765168, "num_tokens": 1913593.0, "step": 2260 }, { "entropy": 5.570584964752197, "epoch": 0.050610566771313974, "grad_norm": 1.578125, "learning_rate": 0.00033004186826515416, "loss": 5.6149, "mean_token_accuracy": 0.19200795739889145, "num_tokens": 1917853.0, "step": 2265 }, { "entropy": 5.660935258865356, "epoch": 0.05072228987676942, "grad_norm": 1.5390625, "learning_rate": 0.0003288988166094324, "loss": 5.4973, "mean_token_accuracy": 0.19082937389612198, "num_tokens": 1922075.0, "step": 2270 }, { "entropy": 5.602800416946411, "epoch": 0.050834012982224855, "grad_norm": 1.34375, "learning_rate": 0.00032775428729042656, "loss": 5.5452, "mean_token_accuracy": 0.1940069317817688, "num_tokens": 1926595.0, "step": 2275 }, { "entropy": 5.500808811187744, "epoch": 0.05094573608768029, "grad_norm": 1.2734375, "learning_rate": 0.000326608311685986, "loss": 5.4548, "mean_token_accuracy": 0.20891236662864685, "num_tokens": 1930748.0, "step": 2280 }, { "entropy": 5.621628379821777, "epoch": 0.05105745919313573, "grad_norm": 1.3828125, "learning_rate": 0.0003254609212136108, "loss": 5.6094, "mean_token_accuracy": 0.19751961529254913, "num_tokens": 1935243.0, "step": 2285 }, { "entropy": 5.719082927703857, "epoch": 0.05116918229859117, "grad_norm": 1.265625, "learning_rate": 0.00032431214732959036, "loss": 5.6297, "mean_token_accuracy": 0.1876582086086273, "num_tokens": 1939932.0, "step": 2290 }, { "entropy": 5.7131959915161135, "epoch": 0.05128090540404661, "grad_norm": 1.3828125, "learning_rate": 0.000323162021528141, "loss": 5.5889, "mean_token_accuracy": 0.18834880739450455, "num_tokens": 1944021.0, "step": 2295 }, { "entropy": 5.4991027355194095, "epoch": 0.05139262850950205, "grad_norm": 1.34375, "learning_rate": 0.00032201057534054264, "loss": 5.5017, "mean_token_accuracy": 0.18835568577051162, "num_tokens": 1948339.0, "step": 2300 }, { "entropy": 5.584790372848511, "epoch": 0.05150435161495749, "grad_norm": 1.4375, "learning_rate": 0.00032085784033427414, "loss": 5.6607, "mean_token_accuracy": 0.1897027984261513, "num_tokens": 1952489.0, "step": 2305 }, { "entropy": 5.5921056270599365, "epoch": 0.05161607472041293, "grad_norm": 1.3046875, "learning_rate": 0.0003197038481121478, "loss": 5.4742, "mean_token_accuracy": 0.19483380615711213, "num_tokens": 1956765.0, "step": 2310 }, { "entropy": 5.654494667053223, "epoch": 0.051727797825868366, "grad_norm": 1.3828125, "learning_rate": 0.0003185486303114436, "loss": 5.5262, "mean_token_accuracy": 0.19184301048517227, "num_tokens": 1960490.0, "step": 2315 }, { "entropy": 5.637120246887207, "epoch": 0.05183952093132381, "grad_norm": 1.421875, "learning_rate": 0.0003173922186030409, "loss": 5.5961, "mean_token_accuracy": 0.18270457834005355, "num_tokens": 1964452.0, "step": 2320 }, { "entropy": 5.681508779525757, "epoch": 0.05195124403677925, "grad_norm": 1.3671875, "learning_rate": 0.000316234644690551, "loss": 5.556, "mean_token_accuracy": 0.20058944523334504, "num_tokens": 1968765.0, "step": 2325 }, { "entropy": 5.449357986450195, "epoch": 0.052062967142234684, "grad_norm": 1.296875, "learning_rate": 0.0003150759403094473, "loss": 5.3411, "mean_token_accuracy": 0.20803572088479996, "num_tokens": 1972696.0, "step": 2330 }, { "entropy": 5.553472948074341, "epoch": 0.05217469024769013, "grad_norm": 1.34375, "learning_rate": 0.00031391613722619587, "loss": 5.6746, "mean_token_accuracy": 0.16769066452980042, "num_tokens": 1976873.0, "step": 2335 }, { "entropy": 5.63549394607544, "epoch": 0.052286413353145565, "grad_norm": 1.3046875, "learning_rate": 0.000312755267237384, "loss": 5.4565, "mean_token_accuracy": 0.202728009223938, "num_tokens": 1981203.0, "step": 2340 }, { "entropy": 5.582929229736328, "epoch": 0.052398136458601, "grad_norm": 1.296875, "learning_rate": 0.0003115933621688488, "loss": 5.5184, "mean_token_accuracy": 0.1903327912092209, "num_tokens": 1985311.0, "step": 2345 }, { "entropy": 5.554009914398193, "epoch": 0.05250985956405644, "grad_norm": 1.40625, "learning_rate": 0.00031043045387480487, "loss": 5.498, "mean_token_accuracy": 0.19480977058410645, "num_tokens": 1989525.0, "step": 2350 }, { "entropy": 5.5623664379119875, "epoch": 0.052621582669511884, "grad_norm": 1.3984375, "learning_rate": 0.0003092665742369703, "loss": 5.5656, "mean_token_accuracy": 0.19292740523815155, "num_tokens": 1993322.0, "step": 2355 }, { "entropy": 5.655750799179077, "epoch": 0.05273330577496732, "grad_norm": 1.3671875, "learning_rate": 0.00030810175516369343, "loss": 5.6241, "mean_token_accuracy": 0.18445832878351212, "num_tokens": 1997360.0, "step": 2360 }, { "entropy": 5.713097095489502, "epoch": 0.05284502888042276, "grad_norm": 1.453125, "learning_rate": 0.0003069360285890775, "loss": 5.4548, "mean_token_accuracy": 0.19537921547889708, "num_tokens": 2001867.0, "step": 2365 }, { "entropy": 5.628135013580322, "epoch": 0.0529567519858782, "grad_norm": 1.3671875, "learning_rate": 0.00030576942647210547, "loss": 5.6659, "mean_token_accuracy": 0.1955395072698593, "num_tokens": 2005729.0, "step": 2370 }, { "entropy": 5.563907194137573, "epoch": 0.05306847509133364, "grad_norm": 1.359375, "learning_rate": 0.00030460198079576355, "loss": 5.5383, "mean_token_accuracy": 0.19072917848825455, "num_tokens": 2009839.0, "step": 2375 }, { "entropy": 5.570201206207275, "epoch": 0.053180198196789076, "grad_norm": 1.453125, "learning_rate": 0.0003034337235661648, "loss": 5.4604, "mean_token_accuracy": 0.19360036700963973, "num_tokens": 2013967.0, "step": 2380 }, { "entropy": 5.60407509803772, "epoch": 0.05329192130224452, "grad_norm": 1.4453125, "learning_rate": 0.0003022646868116714, "loss": 5.583, "mean_token_accuracy": 0.19008321315050125, "num_tokens": 2018353.0, "step": 2385 }, { "entropy": 5.69129376411438, "epoch": 0.05340364440769996, "grad_norm": 1.59375, "learning_rate": 0.0003010949025820163, "loss": 5.6493, "mean_token_accuracy": 0.1880006343126297, "num_tokens": 2022171.0, "step": 2390 }, { "entropy": 5.608281373977661, "epoch": 0.053515367513155394, "grad_norm": 1.5390625, "learning_rate": 0.0002999244029474252, "loss": 5.5591, "mean_token_accuracy": 0.20259366631507875, "num_tokens": 2026341.0, "step": 2395 }, { "entropy": 5.683151006698608, "epoch": 0.05362709061861083, "grad_norm": 1.3046875, "learning_rate": 0.00029875321999773684, "loss": 5.5891, "mean_token_accuracy": 0.18821725249290466, "num_tokens": 2031021.0, "step": 2400 }, { "entropy": 5.754010438919067, "epoch": 0.053738813724066276, "grad_norm": 1.34375, "learning_rate": 0.00029758138584152333, "loss": 5.7149, "mean_token_accuracy": 0.17457710206508636, "num_tokens": 2035653.0, "step": 2405 }, { "entropy": 5.656412887573242, "epoch": 0.05385053682952171, "grad_norm": 1.34375, "learning_rate": 0.0002964089326052102, "loss": 5.6126, "mean_token_accuracy": 0.1949571579694748, "num_tokens": 2039728.0, "step": 2410 }, { "entropy": 5.580978488922119, "epoch": 0.05396225993497715, "grad_norm": 1.4765625, "learning_rate": 0.0002952358924321949, "loss": 5.4874, "mean_token_accuracy": 0.19023145288228988, "num_tokens": 2044078.0, "step": 2415 }, { "entropy": 5.599613666534424, "epoch": 0.054073983040432594, "grad_norm": 1.40625, "learning_rate": 0.00029406229748196657, "loss": 5.3794, "mean_token_accuracy": 0.20781491547822953, "num_tokens": 2048138.0, "step": 2420 }, { "entropy": 5.596552801132202, "epoch": 0.05418570614588803, "grad_norm": 1.28125, "learning_rate": 0.0002928881799292235, "loss": 5.6829, "mean_token_accuracy": 0.18918677568435668, "num_tokens": 2052837.0, "step": 2425 }, { "entropy": 5.640849542617798, "epoch": 0.05429742925134347, "grad_norm": 1.375, "learning_rate": 0.00029171357196299154, "loss": 5.5745, "mean_token_accuracy": 0.19951188415288926, "num_tokens": 2056715.0, "step": 2430 }, { "entropy": 5.623363733291626, "epoch": 0.05440915235679891, "grad_norm": 1.328125, "learning_rate": 0.0002905385057857414, "loss": 5.5352, "mean_token_accuracy": 0.19049001783132552, "num_tokens": 2060508.0, "step": 2435 }, { "entropy": 5.679731750488282, "epoch": 0.05452087546225435, "grad_norm": 1.3046875, "learning_rate": 0.0002893630136125058, "loss": 5.5896, "mean_token_accuracy": 0.18565710335969926, "num_tokens": 2065050.0, "step": 2440 }, { "entropy": 5.565289402008057, "epoch": 0.054632598567709786, "grad_norm": 1.265625, "learning_rate": 0.0002881871276699967, "loss": 5.4692, "mean_token_accuracy": 0.19635592103004457, "num_tokens": 2069488.0, "step": 2445 }, { "entropy": 5.526049280166626, "epoch": 0.05474432167316523, "grad_norm": 1.40625, "learning_rate": 0.00028701088019572114, "loss": 5.5709, "mean_token_accuracy": 0.19352198988199235, "num_tokens": 2073605.0, "step": 2450 }, { "entropy": 5.54777684211731, "epoch": 0.05485604477862067, "grad_norm": 1.328125, "learning_rate": 0.0002858343034370977, "loss": 5.4322, "mean_token_accuracy": 0.1995716482400894, "num_tokens": 2077721.0, "step": 2455 }, { "entropy": 5.556557703018188, "epoch": 0.054967767884076105, "grad_norm": 1.3828125, "learning_rate": 0.00028465742965057267, "loss": 5.5684, "mean_token_accuracy": 0.18811332881450654, "num_tokens": 2081945.0, "step": 2460 }, { "entropy": 5.629191112518311, "epoch": 0.05507949098953154, "grad_norm": 1.3515625, "learning_rate": 0.00028348029110073533, "loss": 5.659, "mean_token_accuracy": 0.1851786345243454, "num_tokens": 2086184.0, "step": 2465 }, { "entropy": 5.602310562133789, "epoch": 0.055191214094986986, "grad_norm": 1.4609375, "learning_rate": 0.00028230292005943365, "loss": 5.4623, "mean_token_accuracy": 0.20515158921480178, "num_tokens": 2090271.0, "step": 2470 }, { "entropy": 5.481738805770874, "epoch": 0.05530293720044242, "grad_norm": 1.3046875, "learning_rate": 0.00028112534880488945, "loss": 5.4505, "mean_token_accuracy": 0.19859495311975478, "num_tokens": 2094427.0, "step": 2475 }, { "entropy": 5.461277008056641, "epoch": 0.05541466030589786, "grad_norm": 1.5078125, "learning_rate": 0.0002799476096208137, "loss": 5.2431, "mean_token_accuracy": 0.22603217214345933, "num_tokens": 2098795.0, "step": 2480 }, { "entropy": 5.590682172775269, "epoch": 0.055526383411353304, "grad_norm": 1.390625, "learning_rate": 0.00027876973479552087, "loss": 5.4535, "mean_token_accuracy": 0.2132108509540558, "num_tokens": 2103190.0, "step": 2485 }, { "entropy": 5.509807920455932, "epoch": 0.05563810651680874, "grad_norm": 1.3359375, "learning_rate": 0.00027759175662104424, "loss": 5.4031, "mean_token_accuracy": 0.20948465317487716, "num_tokens": 2107253.0, "step": 2490 }, { "entropy": 5.449338150024414, "epoch": 0.05574982962226418, "grad_norm": 1.3046875, "learning_rate": 0.0002764137073922508, "loss": 5.5747, "mean_token_accuracy": 0.20230767428874968, "num_tokens": 2111361.0, "step": 2495 }, { "entropy": 5.551156520843506, "epoch": 0.05586155272771962, "grad_norm": 1.3359375, "learning_rate": 0.00027523561940595505, "loss": 5.3984, "mean_token_accuracy": 0.19894679635763168, "num_tokens": 2115586.0, "step": 2500 }, { "entropy": 5.694902515411377, "epoch": 0.05597327583317506, "grad_norm": 1.28125, "learning_rate": 0.0002740575249600342, "loss": 5.566, "mean_token_accuracy": 0.195435930788517, "num_tokens": 2119746.0, "step": 2505 }, { "entropy": 5.544569110870361, "epoch": 0.0560849989386305, "grad_norm": 1.3125, "learning_rate": 0.00027287945635254263, "loss": 5.5441, "mean_token_accuracy": 0.19535554200410843, "num_tokens": 2124367.0, "step": 2510 }, { "entropy": 5.614282655715942, "epoch": 0.05619672204408594, "grad_norm": 1.40625, "learning_rate": 0.00027170144588082635, "loss": 5.551, "mean_token_accuracy": 0.19392893612384796, "num_tokens": 2128772.0, "step": 2515 }, { "entropy": 5.573938083648682, "epoch": 0.05630844514954138, "grad_norm": 1.3203125, "learning_rate": 0.00027052352584063763, "loss": 5.4191, "mean_token_accuracy": 0.2079363003373146, "num_tokens": 2132943.0, "step": 2520 }, { "entropy": 5.487898683547973, "epoch": 0.056420168254996815, "grad_norm": 1.359375, "learning_rate": 0.00026934572852524907, "loss": 5.392, "mean_token_accuracy": 0.19988818913698198, "num_tokens": 2137332.0, "step": 2525 }, { "entropy": 5.467745065689087, "epoch": 0.05653189136045225, "grad_norm": 1.3671875, "learning_rate": 0.00026816808622456937, "loss": 5.419, "mean_token_accuracy": 0.2094484195113182, "num_tokens": 2141459.0, "step": 2530 }, { "entropy": 5.452517700195313, "epoch": 0.056643614465907696, "grad_norm": 1.484375, "learning_rate": 0.0002669906312242569, "loss": 5.4083, "mean_token_accuracy": 0.21005303263664246, "num_tokens": 2145450.0, "step": 2535 }, { "entropy": 5.602050828933716, "epoch": 0.05675533757136313, "grad_norm": 1.3515625, "learning_rate": 0.00026581339580483525, "loss": 5.5267, "mean_token_accuracy": 0.19471557140350343, "num_tokens": 2149908.0, "step": 2540 }, { "entropy": 5.690647792816162, "epoch": 0.05686706067681857, "grad_norm": 1.359375, "learning_rate": 0.0002646364122408082, "loss": 5.6694, "mean_token_accuracy": 0.18805797398090363, "num_tokens": 2154641.0, "step": 2545 }, { "entropy": 5.627089929580689, "epoch": 0.056978783782274015, "grad_norm": 1.5, "learning_rate": 0.0002634597127997749, "loss": 5.4543, "mean_token_accuracy": 0.19414004385471345, "num_tokens": 2158558.0, "step": 2550 }, { "entropy": 5.584254217147827, "epoch": 0.05709050688772945, "grad_norm": 1.3125, "learning_rate": 0.0002622833297415445, "loss": 5.456, "mean_token_accuracy": 0.208853816986084, "num_tokens": 2162953.0, "step": 2555 }, { "entropy": 5.595224857330322, "epoch": 0.05720222999318489, "grad_norm": 1.5078125, "learning_rate": 0.0002611072953172531, "loss": 5.5737, "mean_token_accuracy": 0.18954876512289048, "num_tokens": 2167438.0, "step": 2560 }, { "entropy": 5.499865961074829, "epoch": 0.05731395309864033, "grad_norm": 1.4140625, "learning_rate": 0.00025993164176847845, "loss": 5.4796, "mean_token_accuracy": 0.2069467142224312, "num_tokens": 2171603.0, "step": 2565 }, { "entropy": 5.609521293640137, "epoch": 0.05742567620409577, "grad_norm": 1.3046875, "learning_rate": 0.0002587564013263564, "loss": 5.513, "mean_token_accuracy": 0.19456874430179597, "num_tokens": 2175976.0, "step": 2570 }, { "entropy": 5.575256299972534, "epoch": 0.05753739930955121, "grad_norm": 1.5859375, "learning_rate": 0.0002575816062106974, "loss": 5.3426, "mean_token_accuracy": 0.22373394966125487, "num_tokens": 2179626.0, "step": 2575 }, { "entropy": 5.505822420120239, "epoch": 0.057649122415006644, "grad_norm": 1.3515625, "learning_rate": 0.00025640728862910293, "loss": 5.4963, "mean_token_accuracy": 0.19739323556423188, "num_tokens": 2183903.0, "step": 2580 }, { "entropy": 5.43558783531189, "epoch": 0.05776084552046209, "grad_norm": 1.34375, "learning_rate": 0.00025523348077608285, "loss": 5.5247, "mean_token_accuracy": 0.19990537464618682, "num_tokens": 2188232.0, "step": 2585 }, { "entropy": 5.544040584564209, "epoch": 0.057872568625917525, "grad_norm": 1.3828125, "learning_rate": 0.00025406021483217225, "loss": 5.4192, "mean_token_accuracy": 0.21156198531389236, "num_tokens": 2192465.0, "step": 2590 }, { "entropy": 5.689551210403442, "epoch": 0.05798429173137296, "grad_norm": 1.40625, "learning_rate": 0.00025288752296304963, "loss": 5.4929, "mean_token_accuracy": 0.20315711349248886, "num_tokens": 2196597.0, "step": 2595 }, { "entropy": 5.523239231109619, "epoch": 0.05809601483682841, "grad_norm": 1.4921875, "learning_rate": 0.000251715437318655, "loss": 5.4215, "mean_token_accuracy": 0.19697629809379577, "num_tokens": 2200590.0, "step": 2600 }, { "entropy": 5.487602472305298, "epoch": 0.058207737942283844, "grad_norm": 1.484375, "learning_rate": 0.0002505439900323084, "loss": 5.4214, "mean_token_accuracy": 0.2029174730181694, "num_tokens": 2204897.0, "step": 2605 }, { "entropy": 5.583431100845337, "epoch": 0.05831946104773928, "grad_norm": 1.40625, "learning_rate": 0.00024937321321982894, "loss": 5.5056, "mean_token_accuracy": 0.1958489641547203, "num_tokens": 2209187.0, "step": 2610 }, { "entropy": 5.578114795684814, "epoch": 0.058431184153194725, "grad_norm": 1.3984375, "learning_rate": 0.00024820313897865433, "loss": 5.5772, "mean_token_accuracy": 0.20329798758029938, "num_tokens": 2213496.0, "step": 2615 }, { "entropy": 5.598162508010864, "epoch": 0.05854290725865016, "grad_norm": 1.3515625, "learning_rate": 0.00024703379938696105, "loss": 5.3453, "mean_token_accuracy": 0.2178236186504364, "num_tokens": 2217612.0, "step": 2620 }, { "entropy": 5.452975940704346, "epoch": 0.0586546303641056, "grad_norm": 1.265625, "learning_rate": 0.00024586522650278447, "loss": 5.3145, "mean_token_accuracy": 0.20461161732673644, "num_tokens": 2221830.0, "step": 2625 }, { "entropy": 5.435471057891846, "epoch": 0.05876635346956104, "grad_norm": 1.296875, "learning_rate": 0.00024469745236314064, "loss": 5.4124, "mean_token_accuracy": 0.20239788442850112, "num_tokens": 2226552.0, "step": 2630 }, { "entropy": 5.544402122497559, "epoch": 0.05887807657501648, "grad_norm": 1.5390625, "learning_rate": 0.00024353050898314767, "loss": 5.5141, "mean_token_accuracy": 0.19912706017494203, "num_tokens": 2230785.0, "step": 2635 }, { "entropy": 5.555133724212647, "epoch": 0.05898979968047192, "grad_norm": 1.46875, "learning_rate": 0.00024236442835514743, "loss": 5.3555, "mean_token_accuracy": 0.2107112556695938, "num_tokens": 2235103.0, "step": 2640 }, { "entropy": 5.583991765975952, "epoch": 0.059101522785927355, "grad_norm": 1.40625, "learning_rate": 0.00024119924244782965, "loss": 5.4541, "mean_token_accuracy": 0.20082907378673553, "num_tokens": 2239699.0, "step": 2645 }, { "entropy": 5.585312128067017, "epoch": 0.0592132458913828, "grad_norm": 1.3828125, "learning_rate": 0.00024003498320535462, "loss": 5.5365, "mean_token_accuracy": 0.18660178482532502, "num_tokens": 2244112.0, "step": 2650 }, { "entropy": 5.4673206329345705, "epoch": 0.059324968996838236, "grad_norm": 1.5, "learning_rate": 0.00023887168254647727, "loss": 5.3513, "mean_token_accuracy": 0.20897922813892364, "num_tokens": 2247902.0, "step": 2655 }, { "entropy": 5.441995763778687, "epoch": 0.05943669210229367, "grad_norm": 1.3984375, "learning_rate": 0.00023770937236367308, "loss": 5.4251, "mean_token_accuracy": 0.18857751041650772, "num_tokens": 2251966.0, "step": 2660 }, { "entropy": 5.519895887374878, "epoch": 0.05954841520774912, "grad_norm": 1.2734375, "learning_rate": 0.00023654808452226278, "loss": 5.4362, "mean_token_accuracy": 0.19682098627090455, "num_tokens": 2256579.0, "step": 2665 }, { "entropy": 5.603710651397705, "epoch": 0.059660138313204554, "grad_norm": 1.1953125, "learning_rate": 0.00023538785085953912, "loss": 5.4993, "mean_token_accuracy": 0.20378711223602294, "num_tokens": 2261466.0, "step": 2670 }, { "entropy": 5.510274267196655, "epoch": 0.05977186141865999, "grad_norm": 1.2734375, "learning_rate": 0.00023422870318389404, "loss": 5.4346, "mean_token_accuracy": 0.19869014620780945, "num_tokens": 2266547.0, "step": 2675 }, { "entropy": 5.546743679046631, "epoch": 0.059883584524115435, "grad_norm": 1.4140625, "learning_rate": 0.0002330706732739468, "loss": 5.5125, "mean_token_accuracy": 0.19375152587890626, "num_tokens": 2270686.0, "step": 2680 }, { "entropy": 5.462349605560303, "epoch": 0.05999530762957087, "grad_norm": 1.421875, "learning_rate": 0.00023191379287767211, "loss": 5.3637, "mean_token_accuracy": 0.21243515461683274, "num_tokens": 2274819.0, "step": 2685 }, { "entropy": 5.43172254562378, "epoch": 0.06010703073502631, "grad_norm": 1.4375, "learning_rate": 0.0002307580937115305, "loss": 5.3449, "mean_token_accuracy": 0.21378139406442642, "num_tokens": 2278991.0, "step": 2690 }, { "entropy": 5.544791221618652, "epoch": 0.06021875384048175, "grad_norm": 1.3125, "learning_rate": 0.00022960360745959846, "loss": 5.4994, "mean_token_accuracy": 0.19600761830806732, "num_tokens": 2283300.0, "step": 2695 }, { "entropy": 5.614039134979248, "epoch": 0.06033047694593719, "grad_norm": 1.2265625, "learning_rate": 0.00022845036577269972, "loss": 5.5559, "mean_token_accuracy": 0.1941295385360718, "num_tokens": 2288263.0, "step": 2700 }, { "entropy": 5.639177036285401, "epoch": 0.06044220005139263, "grad_norm": 1.3671875, "learning_rate": 0.00022729840026753777, "loss": 5.449, "mean_token_accuracy": 0.19523033797740935, "num_tokens": 2292413.0, "step": 2705 }, { "entropy": 5.539922666549683, "epoch": 0.060553923156848065, "grad_norm": 1.390625, "learning_rate": 0.0002261477425258287, "loss": 5.465, "mean_token_accuracy": 0.20829073935747147, "num_tokens": 2297154.0, "step": 2710 }, { "entropy": 5.481073951721191, "epoch": 0.06066564626230351, "grad_norm": 1.4140625, "learning_rate": 0.0002249984240934358, "loss": 5.4538, "mean_token_accuracy": 0.2031441956758499, "num_tokens": 2301162.0, "step": 2715 }, { "entropy": 5.603000640869141, "epoch": 0.060777369367758946, "grad_norm": 1.34375, "learning_rate": 0.00022385047647950464, "loss": 5.464, "mean_token_accuracy": 0.19900059401988984, "num_tokens": 2305827.0, "step": 2720 }, { "entropy": 5.536140727996826, "epoch": 0.06088909247321438, "grad_norm": 1.203125, "learning_rate": 0.0002227039311555986, "loss": 5.4378, "mean_token_accuracy": 0.19830939769744874, "num_tokens": 2310167.0, "step": 2725 }, { "entropy": 5.434991359710693, "epoch": 0.06100081557866983, "grad_norm": 1.375, "learning_rate": 0.0002215588195548372, "loss": 5.3972, "mean_token_accuracy": 0.2103495329618454, "num_tokens": 2314324.0, "step": 2730 }, { "entropy": 5.4463379859924315, "epoch": 0.061112538684125264, "grad_norm": 1.4765625, "learning_rate": 0.00022041517307103337, "loss": 5.4068, "mean_token_accuracy": 0.19898709803819656, "num_tokens": 2318316.0, "step": 2735 }, { "entropy": 5.494653606414795, "epoch": 0.0612242617895807, "grad_norm": 1.34375, "learning_rate": 0.0002192730230578331, "loss": 5.3993, "mean_token_accuracy": 0.2058892607688904, "num_tokens": 2322450.0, "step": 2740 }, { "entropy": 5.576783895492554, "epoch": 0.061335984895036146, "grad_norm": 1.421875, "learning_rate": 0.0002181324008278559, "loss": 5.5483, "mean_token_accuracy": 0.19335435777902604, "num_tokens": 2326849.0, "step": 2745 }, { "entropy": 5.511387968063355, "epoch": 0.06144770800049158, "grad_norm": 1.3671875, "learning_rate": 0.00021699333765183655, "loss": 5.3254, "mean_token_accuracy": 0.20634406358003615, "num_tokens": 2331326.0, "step": 2750 }, { "entropy": 5.403991651535034, "epoch": 0.06155943110594702, "grad_norm": 1.4375, "learning_rate": 0.0002158558647577673, "loss": 5.3124, "mean_token_accuracy": 0.21327273398637772, "num_tokens": 2335443.0, "step": 2755 }, { "entropy": 5.56891450881958, "epoch": 0.06167115421140246, "grad_norm": 1.4140625, "learning_rate": 0.00021472001333004215, "loss": 5.5842, "mean_token_accuracy": 0.19100278466939927, "num_tokens": 2339836.0, "step": 2760 }, { "entropy": 5.5373400211334225, "epoch": 0.0617828773168579, "grad_norm": 1.2890625, "learning_rate": 0.00021358581450860186, "loss": 5.4322, "mean_token_accuracy": 0.20189495682716369, "num_tokens": 2344125.0, "step": 2765 }, { "entropy": 5.434415578842163, "epoch": 0.06189460042231334, "grad_norm": 1.3515625, "learning_rate": 0.0002124532993880799, "loss": 5.3485, "mean_token_accuracy": 0.20517417788505554, "num_tokens": 2348375.0, "step": 2770 }, { "entropy": 5.433170652389526, "epoch": 0.062006323527768775, "grad_norm": 1.359375, "learning_rate": 0.00021132249901695044, "loss": 5.272, "mean_token_accuracy": 0.22851505130529404, "num_tokens": 2352315.0, "step": 2775 }, { "entropy": 5.423984336853027, "epoch": 0.06211804663322422, "grad_norm": 1.4765625, "learning_rate": 0.00021019344439667705, "loss": 5.3114, "mean_token_accuracy": 0.21443118155002594, "num_tokens": 2356351.0, "step": 2780 }, { "entropy": 5.470494794845581, "epoch": 0.062229769738679656, "grad_norm": 1.46875, "learning_rate": 0.00020906616648086213, "loss": 5.342, "mean_token_accuracy": 0.198398956656456, "num_tokens": 2360690.0, "step": 2785 }, { "entropy": 5.5504798412323, "epoch": 0.062341492844135094, "grad_norm": 1.359375, "learning_rate": 0.00020794069617439942, "loss": 5.3853, "mean_token_accuracy": 0.2108204558491707, "num_tokens": 2364581.0, "step": 2790 }, { "entropy": 5.508401012420654, "epoch": 0.06245321594959054, "grad_norm": 1.4921875, "learning_rate": 0.00020681706433262593, "loss": 5.505, "mean_token_accuracy": 0.20594742596149446, "num_tokens": 2368799.0, "step": 2795 }, { "entropy": 5.444084358215332, "epoch": 0.06256493905504597, "grad_norm": 1.4921875, "learning_rate": 0.00020569530176047602, "loss": 5.3852, "mean_token_accuracy": 0.20221322327852248, "num_tokens": 2372843.0, "step": 2800 }, { "entropy": 5.416363048553467, "epoch": 0.06267666216050141, "grad_norm": 1.3984375, "learning_rate": 0.0002045754392116374, "loss": 5.2879, "mean_token_accuracy": 0.2204835444688797, "num_tokens": 2376998.0, "step": 2805 }, { "entropy": 5.55823450088501, "epoch": 0.06278838526595686, "grad_norm": 1.3515625, "learning_rate": 0.00020345750738770757, "loss": 5.4691, "mean_token_accuracy": 0.1983243003487587, "num_tokens": 2381511.0, "step": 2810 }, { "entropy": 5.600541019439698, "epoch": 0.06290010837141229, "grad_norm": 1.3125, "learning_rate": 0.00020234153693735214, "loss": 5.4477, "mean_token_accuracy": 0.21541933864355087, "num_tokens": 2385352.0, "step": 2815 }, { "entropy": 5.449322366714478, "epoch": 0.06301183147686773, "grad_norm": 1.328125, "learning_rate": 0.0002012275584554647, "loss": 5.367, "mean_token_accuracy": 0.2078718438744545, "num_tokens": 2389631.0, "step": 2820 }, { "entropy": 5.49873628616333, "epoch": 0.06312355458232317, "grad_norm": 1.359375, "learning_rate": 0.00020011560248232803, "loss": 5.5103, "mean_token_accuracy": 0.2008284516632557, "num_tokens": 2394253.0, "step": 2825 }, { "entropy": 5.497902774810791, "epoch": 0.0632352776877786, "grad_norm": 1.4296875, "learning_rate": 0.00019900569950277692, "loss": 5.3563, "mean_token_accuracy": 0.20818308144807815, "num_tokens": 2398397.0, "step": 2830 }, { "entropy": 5.443813848495483, "epoch": 0.06334700079323405, "grad_norm": 1.359375, "learning_rate": 0.00019789787994536228, "loss": 5.3684, "mean_token_accuracy": 0.21781200766563416, "num_tokens": 2402624.0, "step": 2835 }, { "entropy": 5.453783559799194, "epoch": 0.06345872389868949, "grad_norm": 1.4921875, "learning_rate": 0.00019679217418151667, "loss": 5.3316, "mean_token_accuracy": 0.20361825376749038, "num_tokens": 2406841.0, "step": 2840 }, { "entropy": 5.561903762817383, "epoch": 0.06357044700414492, "grad_norm": 1.5078125, "learning_rate": 0.00019568861252472236, "loss": 5.3654, "mean_token_accuracy": 0.20293028503656388, "num_tokens": 2410760.0, "step": 2845 }, { "entropy": 5.411029291152954, "epoch": 0.06368217010960037, "grad_norm": 1.3125, "learning_rate": 0.00019458722522967952, "loss": 5.2783, "mean_token_accuracy": 0.21624853014945983, "num_tokens": 2415022.0, "step": 2850 }, { "entropy": 5.511258745193482, "epoch": 0.06379389321505581, "grad_norm": 1.359375, "learning_rate": 0.00019348804249147723, "loss": 5.4845, "mean_token_accuracy": 0.2040348917245865, "num_tokens": 2419569.0, "step": 2855 }, { "entropy": 5.364731311798096, "epoch": 0.06390561632051124, "grad_norm": 1.28125, "learning_rate": 0.0001923910944447655, "loss": 5.3947, "mean_token_accuracy": 0.21875673085451125, "num_tokens": 2423979.0, "step": 2860 }, { "entropy": 5.480422115325927, "epoch": 0.06401733942596669, "grad_norm": 1.171875, "learning_rate": 0.00019129641116292928, "loss": 5.3368, "mean_token_accuracy": 0.2143225759267807, "num_tokens": 2428714.0, "step": 2865 }, { "entropy": 5.494543027877808, "epoch": 0.06412906253142213, "grad_norm": 1.296875, "learning_rate": 0.00019020402265726343, "loss": 5.3908, "mean_token_accuracy": 0.21381141990423203, "num_tokens": 2433133.0, "step": 2870 }, { "entropy": 5.607168102264405, "epoch": 0.06424078563687756, "grad_norm": 1.4453125, "learning_rate": 0.0001891139588761509, "loss": 5.3769, "mean_token_accuracy": 0.20927911698818208, "num_tokens": 2436934.0, "step": 2875 }, { "entropy": 5.665495729446411, "epoch": 0.064352508742333, "grad_norm": 1.4375, "learning_rate": 0.00018802624970424076, "loss": 5.4809, "mean_token_accuracy": 0.19802022427320481, "num_tokens": 2441569.0, "step": 2880 }, { "entropy": 5.526089906692505, "epoch": 0.06446423184778845, "grad_norm": 1.5, "learning_rate": 0.00018694092496162945, "loss": 5.4654, "mean_token_accuracy": 0.19548578411340714, "num_tokens": 2445672.0, "step": 2885 }, { "entropy": 5.5076977729797365, "epoch": 0.06457595495324388, "grad_norm": 1.3984375, "learning_rate": 0.00018585801440304306, "loss": 5.394, "mean_token_accuracy": 0.2151073396205902, "num_tokens": 2449608.0, "step": 2890 }, { "entropy": 5.456825017929077, "epoch": 0.06468767805869932, "grad_norm": 1.3984375, "learning_rate": 0.00018477754771702165, "loss": 5.2967, "mean_token_accuracy": 0.20913369357585906, "num_tokens": 2453604.0, "step": 2895 }, { "entropy": 5.619221115112305, "epoch": 0.06479940116415477, "grad_norm": 1.3671875, "learning_rate": 0.00018369955452510506, "loss": 5.5393, "mean_token_accuracy": 0.19366907477378845, "num_tokens": 2457973.0, "step": 2900 }, { "entropy": 5.41515531539917, "epoch": 0.0649111242696102, "grad_norm": 1.25, "learning_rate": 0.0001826240643810212, "loss": 5.292, "mean_token_accuracy": 0.22454154193401338, "num_tokens": 2462123.0, "step": 2905 }, { "entropy": 5.439104080200195, "epoch": 0.06502284737506564, "grad_norm": 1.421875, "learning_rate": 0.0001815511067698758, "loss": 5.3578, "mean_token_accuracy": 0.20102971494197847, "num_tokens": 2466404.0, "step": 2910 }, { "entropy": 5.479712390899659, "epoch": 0.06513457048052107, "grad_norm": 1.3828125, "learning_rate": 0.0001804807111073436, "loss": 5.4185, "mean_token_accuracy": 0.2085522621870041, "num_tokens": 2471086.0, "step": 2915 }, { "entropy": 5.615272760391235, "epoch": 0.06524629358597651, "grad_norm": 1.328125, "learning_rate": 0.0001794129067388625, "loss": 5.4374, "mean_token_accuracy": 0.1996435061097145, "num_tokens": 2475411.0, "step": 2920 }, { "entropy": 5.626146364212036, "epoch": 0.06535801669143196, "grad_norm": 1.2421875, "learning_rate": 0.00017834772293882868, "loss": 5.5039, "mean_token_accuracy": 0.198169307410717, "num_tokens": 2479742.0, "step": 2925 }, { "entropy": 5.5833946704864506, "epoch": 0.06546973979688739, "grad_norm": 1.3203125, "learning_rate": 0.000177285188909794, "loss": 5.5156, "mean_token_accuracy": 0.19249760061502458, "num_tokens": 2484339.0, "step": 2930 }, { "entropy": 5.535617303848267, "epoch": 0.06558146290234283, "grad_norm": 1.390625, "learning_rate": 0.0001762253337816656, "loss": 5.4886, "mean_token_accuracy": 0.20366908311843873, "num_tokens": 2488619.0, "step": 2935 }, { "entropy": 5.616153717041016, "epoch": 0.06569318600779828, "grad_norm": 1.359375, "learning_rate": 0.00017516818661090738, "loss": 5.4977, "mean_token_accuracy": 0.19479814618825914, "num_tokens": 2493068.0, "step": 2940 }, { "entropy": 5.444133853912353, "epoch": 0.0658049091132537, "grad_norm": 1.4609375, "learning_rate": 0.0001741137763797428, "loss": 5.2794, "mean_token_accuracy": 0.22618790566921235, "num_tokens": 2497322.0, "step": 2945 }, { "entropy": 5.598397159576416, "epoch": 0.06591663221870915, "grad_norm": 1.5234375, "learning_rate": 0.00017306213199536115, "loss": 5.5189, "mean_token_accuracy": 0.18690935373306275, "num_tokens": 2501476.0, "step": 2950 }, { "entropy": 5.480272245407105, "epoch": 0.0660283553241646, "grad_norm": 1.5078125, "learning_rate": 0.0001720132822891243, "loss": 5.2946, "mean_token_accuracy": 0.219456946849823, "num_tokens": 2505520.0, "step": 2955 }, { "entropy": 5.450000047683716, "epoch": 0.06614007842962003, "grad_norm": 1.3515625, "learning_rate": 0.0001709672560157769, "loss": 5.2907, "mean_token_accuracy": 0.21174060553312302, "num_tokens": 2509912.0, "step": 2960 }, { "entropy": 5.558126449584961, "epoch": 0.06625180153507547, "grad_norm": 1.328125, "learning_rate": 0.00016992408185265758, "loss": 5.5601, "mean_token_accuracy": 0.19151482731103897, "num_tokens": 2514342.0, "step": 2965 }, { "entropy": 5.44414496421814, "epoch": 0.06636352464053091, "grad_norm": 1.28125, "learning_rate": 0.00016888378839891298, "loss": 5.2547, "mean_token_accuracy": 0.20875033140182495, "num_tokens": 2518771.0, "step": 2970 }, { "entropy": 5.504908561706543, "epoch": 0.06647524774598634, "grad_norm": 1.3515625, "learning_rate": 0.0001678464041747137, "loss": 5.3741, "mean_token_accuracy": 0.20108503401279448, "num_tokens": 2522908.0, "step": 2975 }, { "entropy": 5.479175662994384, "epoch": 0.06658697085144179, "grad_norm": 1.390625, "learning_rate": 0.00016681195762047223, "loss": 5.3508, "mean_token_accuracy": 0.21597259640693664, "num_tokens": 2527150.0, "step": 2980 }, { "entropy": 5.484701108932495, "epoch": 0.06669869395689723, "grad_norm": 1.3515625, "learning_rate": 0.00016578047709606337, "loss": 5.2591, "mean_token_accuracy": 0.2119537800550461, "num_tokens": 2531708.0, "step": 2985 }, { "entropy": 5.54809832572937, "epoch": 0.06681041706235266, "grad_norm": 1.2890625, "learning_rate": 0.00016475199088004678, "loss": 5.3988, "mean_token_accuracy": 0.19869269132614137, "num_tokens": 2536403.0, "step": 2990 }, { "entropy": 5.427238988876343, "epoch": 0.0669221401678081, "grad_norm": 1.421875, "learning_rate": 0.00016372652716889163, "loss": 5.292, "mean_token_accuracy": 0.2228750094771385, "num_tokens": 2540527.0, "step": 2995 }, { "entropy": 5.5223753452301025, "epoch": 0.06703386327326355, "grad_norm": 1.4921875, "learning_rate": 0.0001627041140762035, "loss": 5.3955, "mean_token_accuracy": 0.20547986775636673, "num_tokens": 2544603.0, "step": 3000 }, { "entropy": 5.458887052536011, "epoch": 0.06714558637871898, "grad_norm": 1.5234375, "learning_rate": 0.00016168477963195382, "loss": 5.3807, "mean_token_accuracy": 0.20805781632661818, "num_tokens": 2548211.0, "step": 3005 }, { "entropy": 5.446782636642456, "epoch": 0.06725730948417442, "grad_norm": 1.2890625, "learning_rate": 0.0001606685517817114, "loss": 5.3492, "mean_token_accuracy": 0.2124717801809311, "num_tokens": 2552772.0, "step": 3010 }, { "entropy": 5.499838495254517, "epoch": 0.06736903258962987, "grad_norm": 1.453125, "learning_rate": 0.00015965545838587592, "loss": 5.3419, "mean_token_accuracy": 0.2048182189464569, "num_tokens": 2557221.0, "step": 3015 }, { "entropy": 5.479594421386719, "epoch": 0.0674807556950853, "grad_norm": 1.390625, "learning_rate": 0.00015864552721891467, "loss": 5.3063, "mean_token_accuracy": 0.2209122970700264, "num_tokens": 2561383.0, "step": 3020 }, { "entropy": 5.523051118850708, "epoch": 0.06759247880054074, "grad_norm": 1.359375, "learning_rate": 0.00015763878596860076, "loss": 5.4251, "mean_token_accuracy": 0.20889354199171067, "num_tokens": 2565688.0, "step": 3025 }, { "entropy": 5.553555822372436, "epoch": 0.06770420190599617, "grad_norm": 1.3828125, "learning_rate": 0.00015663526223525412, "loss": 5.436, "mean_token_accuracy": 0.21014404892921448, "num_tokens": 2569677.0, "step": 3030 }, { "entropy": 5.536660003662109, "epoch": 0.06781592501145162, "grad_norm": 1.4609375, "learning_rate": 0.0001556349835309848, "loss": 5.3798, "mean_token_accuracy": 0.2050727352499962, "num_tokens": 2573507.0, "step": 3035 }, { "entropy": 5.47586407661438, "epoch": 0.06792764811690706, "grad_norm": 1.1796875, "learning_rate": 0.0001546379772789389, "loss": 5.3594, "mean_token_accuracy": 0.20650021582841874, "num_tokens": 2578069.0, "step": 3040 }, { "entropy": 5.592712163925171, "epoch": 0.06803937122236249, "grad_norm": 1.3671875, "learning_rate": 0.00015364427081254622, "loss": 5.4022, "mean_token_accuracy": 0.20022505521774292, "num_tokens": 2582054.0, "step": 3045 }, { "entropy": 5.47581205368042, "epoch": 0.06815109432781793, "grad_norm": 1.359375, "learning_rate": 0.00015265389137477165, "loss": 5.2296, "mean_token_accuracy": 0.2094968244433403, "num_tokens": 2585729.0, "step": 3050 }, { "entropy": 5.419918775558472, "epoch": 0.06826281743327338, "grad_norm": 1.4375, "learning_rate": 0.00015166686611736786, "loss": 5.3607, "mean_token_accuracy": 0.21663562059402466, "num_tokens": 2589872.0, "step": 3055 }, { "entropy": 5.413179206848144, "epoch": 0.06837454053872881, "grad_norm": 1.3984375, "learning_rate": 0.00015068322210013064, "loss": 5.2946, "mean_token_accuracy": 0.21898578256368637, "num_tokens": 2593616.0, "step": 3060 }, { "entropy": 5.4749900817871096, "epoch": 0.06848626364418425, "grad_norm": 1.390625, "learning_rate": 0.0001497029862901578, "loss": 5.3271, "mean_token_accuracy": 0.2052648261189461, "num_tokens": 2597907.0, "step": 3065 }, { "entropy": 5.534900379180908, "epoch": 0.0685979867496397, "grad_norm": 1.2890625, "learning_rate": 0.00014872618556110905, "loss": 5.3438, "mean_token_accuracy": 0.20970946848392485, "num_tokens": 2602051.0, "step": 3070 }, { "entropy": 5.448874807357788, "epoch": 0.06870970985509513, "grad_norm": 1.3828125, "learning_rate": 0.00014775284669246992, "loss": 5.3009, "mean_token_accuracy": 0.223245307803154, "num_tokens": 2606214.0, "step": 3075 }, { "entropy": 5.533495283126831, "epoch": 0.06882143296055057, "grad_norm": 1.3515625, "learning_rate": 0.00014678299636881716, "loss": 5.4383, "mean_token_accuracy": 0.20488590747117996, "num_tokens": 2610766.0, "step": 3080 }, { "entropy": 5.5536116600036625, "epoch": 0.06893315606600602, "grad_norm": 1.34375, "learning_rate": 0.0001458166611790873, "loss": 5.4894, "mean_token_accuracy": 0.19983330518007278, "num_tokens": 2614715.0, "step": 3085 }, { "entropy": 5.551689147949219, "epoch": 0.06904487917146145, "grad_norm": 1.5, "learning_rate": 0.00014485386761584773, "loss": 5.3427, "mean_token_accuracy": 0.20717331767082214, "num_tokens": 2618750.0, "step": 3090 }, { "entropy": 5.474444437026977, "epoch": 0.06915660227691689, "grad_norm": 1.2890625, "learning_rate": 0.00014389464207457042, "loss": 5.2566, "mean_token_accuracy": 0.21632168740034102, "num_tokens": 2623692.0, "step": 3095 }, { "entropy": 5.542936134338379, "epoch": 0.06926832538237233, "grad_norm": 1.296875, "learning_rate": 0.00014293901085290795, "loss": 5.3424, "mean_token_accuracy": 0.21294647455215454, "num_tokens": 2628797.0, "step": 3100 }, { "entropy": 5.442723035812378, "epoch": 0.06938004848782776, "grad_norm": 1.4140625, "learning_rate": 0.00014198700014997307, "loss": 5.3559, "mean_token_accuracy": 0.20353555232286452, "num_tokens": 2633246.0, "step": 3105 }, { "entropy": 5.428716468811035, "epoch": 0.06949177159328321, "grad_norm": 1.3515625, "learning_rate": 0.00014103863606562016, "loss": 5.2725, "mean_token_accuracy": 0.21681724935770036, "num_tokens": 2637455.0, "step": 3110 }, { "entropy": 5.576107120513916, "epoch": 0.06960349469873865, "grad_norm": 1.34375, "learning_rate": 0.00014009394459972964, "loss": 5.5594, "mean_token_accuracy": 0.2013178825378418, "num_tokens": 2642205.0, "step": 3115 }, { "entropy": 5.585235261917115, "epoch": 0.06971521780419408, "grad_norm": 1.4453125, "learning_rate": 0.00013915295165149513, "loss": 5.4688, "mean_token_accuracy": 0.1979968622326851, "num_tokens": 2646534.0, "step": 3120 }, { "entropy": 5.520123720169067, "epoch": 0.06982694090964953, "grad_norm": 1.3203125, "learning_rate": 0.00013821568301871384, "loss": 5.4619, "mean_token_accuracy": 0.1930053174495697, "num_tokens": 2651164.0, "step": 3125 }, { "entropy": 5.442639589309692, "epoch": 0.06993866401510497, "grad_norm": 1.3671875, "learning_rate": 0.00013728216439707862, "loss": 5.2034, "mean_token_accuracy": 0.2200526311993599, "num_tokens": 2654874.0, "step": 3130 }, { "entropy": 5.489715719223023, "epoch": 0.0700503871205604, "grad_norm": 1.3984375, "learning_rate": 0.00013635242137947419, "loss": 5.4364, "mean_token_accuracy": 0.20189702063798903, "num_tokens": 2659125.0, "step": 3135 }, { "entropy": 5.4870867252349855, "epoch": 0.07016211022601584, "grad_norm": 1.34375, "learning_rate": 0.00013542647945527498, "loss": 5.2983, "mean_token_accuracy": 0.21716402918100358, "num_tokens": 2663161.0, "step": 3140 }, { "entropy": 5.450554656982422, "epoch": 0.07027383333147127, "grad_norm": 1.328125, "learning_rate": 0.0001345043640096465, "loss": 5.2558, "mean_token_accuracy": 0.21917290687561036, "num_tokens": 2667561.0, "step": 3145 }, { "entropy": 5.433200120925903, "epoch": 0.07038555643692672, "grad_norm": 1.2578125, "learning_rate": 0.00013358610032284957, "loss": 5.2334, "mean_token_accuracy": 0.22107691317796707, "num_tokens": 2671854.0, "step": 3150 }, { "entropy": 5.454058408737183, "epoch": 0.07049727954238216, "grad_norm": 1.34375, "learning_rate": 0.000132671713569547, "loss": 5.3866, "mean_token_accuracy": 0.20238388627767562, "num_tokens": 2676350.0, "step": 3155 }, { "entropy": 5.470601606369018, "epoch": 0.0706090026478376, "grad_norm": 1.2578125, "learning_rate": 0.0001317612288181136, "loss": 5.3432, "mean_token_accuracy": 0.20145028233528137, "num_tokens": 2680290.0, "step": 3160 }, { "entropy": 5.365545463562012, "epoch": 0.07072072575329304, "grad_norm": 1.25, "learning_rate": 0.00013085467102994864, "loss": 5.2449, "mean_token_accuracy": 0.21957221180200576, "num_tokens": 2684856.0, "step": 3165 }, { "entropy": 5.367370843887329, "epoch": 0.07083244885874848, "grad_norm": 1.40625, "learning_rate": 0.00012995206505879198, "loss": 5.238, "mean_token_accuracy": 0.22642118781805037, "num_tokens": 2689344.0, "step": 3170 }, { "entropy": 5.478096199035645, "epoch": 0.07094417196420391, "grad_norm": 1.3125, "learning_rate": 0.0001290534356500421, "loss": 5.4346, "mean_token_accuracy": 0.19786614775657654, "num_tokens": 2693646.0, "step": 3175 }, { "entropy": 5.502420330047608, "epoch": 0.07105589506965936, "grad_norm": 1.421875, "learning_rate": 0.00012815880744007827, "loss": 5.3608, "mean_token_accuracy": 0.20751018524169923, "num_tokens": 2697624.0, "step": 3180 }, { "entropy": 5.313633871078491, "epoch": 0.0711676181751148, "grad_norm": 1.390625, "learning_rate": 0.00012726820495558483, "loss": 5.157, "mean_token_accuracy": 0.2384783521294594, "num_tokens": 2701715.0, "step": 3185 }, { "entropy": 5.435722923278808, "epoch": 0.07127934128057023, "grad_norm": 1.328125, "learning_rate": 0.00012638165261287868, "loss": 5.3466, "mean_token_accuracy": 0.21552689671516417, "num_tokens": 2705944.0, "step": 3190 }, { "entropy": 5.4387619972229, "epoch": 0.07139106438602567, "grad_norm": 1.5234375, "learning_rate": 0.0001254991747172402, "loss": 5.349, "mean_token_accuracy": 0.2148300066590309, "num_tokens": 2710131.0, "step": 3195 }, { "entropy": 5.505114269256592, "epoch": 0.07150278749148112, "grad_norm": 1.2109375, "learning_rate": 0.00012462079546224662, "loss": 5.5073, "mean_token_accuracy": 0.19940556436777115, "num_tokens": 2714667.0, "step": 3200 }, { "entropy": 5.480318927764893, "epoch": 0.07161451059693655, "grad_norm": 1.421875, "learning_rate": 0.00012374653892910896, "loss": 5.2464, "mean_token_accuracy": 0.2203660488128662, "num_tokens": 2719067.0, "step": 3205 }, { "entropy": 5.441334581375122, "epoch": 0.07172623370239199, "grad_norm": 1.4453125, "learning_rate": 0.00012287642908601166, "loss": 5.2838, "mean_token_accuracy": 0.21297864764928817, "num_tokens": 2723283.0, "step": 3210 }, { "entropy": 5.5557328224182125, "epoch": 0.07183795680784744, "grad_norm": 1.328125, "learning_rate": 0.00012201048978745569, "loss": 5.395, "mean_token_accuracy": 0.2045811280608177, "num_tokens": 2727838.0, "step": 3215 }, { "entropy": 5.508611869812012, "epoch": 0.07194967991330287, "grad_norm": 2.75, "learning_rate": 0.00012114874477360427, "loss": 5.2943, "mean_token_accuracy": 0.20704104602336884, "num_tokens": 2732225.0, "step": 3220 }, { "entropy": 5.48407940864563, "epoch": 0.07206140301875831, "grad_norm": 1.4609375, "learning_rate": 0.00012029121766963236, "loss": 5.3724, "mean_token_accuracy": 0.21981985569000245, "num_tokens": 2736392.0, "step": 3225 }, { "entropy": 5.4333906173706055, "epoch": 0.07217312612421375, "grad_norm": 1.3984375, "learning_rate": 0.00011943793198507858, "loss": 5.31, "mean_token_accuracy": 0.2141679510474205, "num_tokens": 2740807.0, "step": 3230 }, { "entropy": 5.470813369750976, "epoch": 0.07228484922966918, "grad_norm": 1.453125, "learning_rate": 0.00011858891111320104, "loss": 5.2798, "mean_token_accuracy": 0.21179069578647614, "num_tokens": 2744882.0, "step": 3235 }, { "entropy": 5.506641054153443, "epoch": 0.07239657233512463, "grad_norm": 1.4453125, "learning_rate": 0.0001177441783303359, "loss": 5.3502, "mean_token_accuracy": 0.19995848536491395, "num_tokens": 2749005.0, "step": 3240 }, { "entropy": 5.434474515914917, "epoch": 0.07250829544058007, "grad_norm": 1.5234375, "learning_rate": 0.00011690375679525896, "loss": 5.3076, "mean_token_accuracy": 0.21662334501743316, "num_tokens": 2753144.0, "step": 3245 }, { "entropy": 5.472179841995239, "epoch": 0.0726200185460355, "grad_norm": 1.3515625, "learning_rate": 0.00011606766954855124, "loss": 5.3814, "mean_token_accuracy": 0.20520275533199311, "num_tokens": 2757166.0, "step": 3250 }, { "entropy": 5.546165800094604, "epoch": 0.07273174165149095, "grad_norm": 1.2734375, "learning_rate": 0.00011523593951196702, "loss": 5.4959, "mean_token_accuracy": 0.20842718929052353, "num_tokens": 2761694.0, "step": 3255 }, { "entropy": 5.533315849304199, "epoch": 0.07284346475694638, "grad_norm": 1.3359375, "learning_rate": 0.00011440858948780523, "loss": 5.3433, "mean_token_accuracy": 0.2045893684029579, "num_tokens": 2765805.0, "step": 3260 }, { "entropy": 5.557415008544922, "epoch": 0.07295518786240182, "grad_norm": 1.3125, "learning_rate": 0.00011358564215828484, "loss": 5.4152, "mean_token_accuracy": 0.20709057599306108, "num_tokens": 2769943.0, "step": 3265 }, { "entropy": 5.510483074188232, "epoch": 0.07306691096785727, "grad_norm": 1.375, "learning_rate": 0.00011276712008492254, "loss": 5.3901, "mean_token_accuracy": 0.2013670414686203, "num_tokens": 2773942.0, "step": 3270 }, { "entropy": 5.555422639846801, "epoch": 0.0731786340733127, "grad_norm": 1.3828125, "learning_rate": 0.00011195304570791451, "loss": 5.354, "mean_token_accuracy": 0.20491219609975814, "num_tokens": 2778400.0, "step": 3275 }, { "entropy": 5.482663106918335, "epoch": 0.07329035717876814, "grad_norm": 1.5390625, "learning_rate": 0.00011114344134552094, "loss": 5.3781, "mean_token_accuracy": 0.21284210234880446, "num_tokens": 2782508.0, "step": 3280 }, { "entropy": 5.591659450531006, "epoch": 0.07340208028422358, "grad_norm": 1.3515625, "learning_rate": 0.0001103383291934545, "loss": 5.4082, "mean_token_accuracy": 0.1941552832722664, "num_tokens": 2786691.0, "step": 3285 }, { "entropy": 5.58315372467041, "epoch": 0.07351380338967901, "grad_norm": 1.3828125, "learning_rate": 0.00010953773132427141, "loss": 5.4764, "mean_token_accuracy": 0.19130755513906478, "num_tokens": 2791548.0, "step": 3290 }, { "entropy": 5.50788106918335, "epoch": 0.07362552649513446, "grad_norm": 1.2734375, "learning_rate": 0.00010874166968676677, "loss": 5.2255, "mean_token_accuracy": 0.2075751855969429, "num_tokens": 2795852.0, "step": 3295 }, { "entropy": 5.5313183784484865, "epoch": 0.0737372496005899, "grad_norm": 1.3515625, "learning_rate": 0.00010795016610537251, "loss": 5.3225, "mean_token_accuracy": 0.2028919756412506, "num_tokens": 2800385.0, "step": 3300 }, { "entropy": 5.421395921707154, "epoch": 0.07384897270604533, "grad_norm": 1.4375, "learning_rate": 0.00010716324227955904, "loss": 5.2085, "mean_token_accuracy": 0.2127124100923538, "num_tokens": 2804295.0, "step": 3305 }, { "entropy": 5.343268156051636, "epoch": 0.07396069581150078, "grad_norm": 1.3671875, "learning_rate": 0.0001063809197832406, "loss": 5.1804, "mean_token_accuracy": 0.21540430933237076, "num_tokens": 2808305.0, "step": 3310 }, { "entropy": 5.304156923294068, "epoch": 0.07407241891695622, "grad_norm": 1.3203125, "learning_rate": 0.00010560322006418368, "loss": 5.2336, "mean_token_accuracy": 0.22822542488574982, "num_tokens": 2813215.0, "step": 3315 }, { "entropy": 5.412682247161865, "epoch": 0.07418414202241165, "grad_norm": 1.46875, "learning_rate": 0.00010483016444341887, "loss": 5.2878, "mean_token_accuracy": 0.21170184314250945, "num_tokens": 2817352.0, "step": 3320 }, { "entropy": 5.357539558410645, "epoch": 0.0742958651278671, "grad_norm": 1.421875, "learning_rate": 0.00010406177411465654, "loss": 5.1525, "mean_token_accuracy": 0.22596207857131959, "num_tokens": 2821486.0, "step": 3325 }, { "entropy": 5.481936025619507, "epoch": 0.07440758823332254, "grad_norm": 1.328125, "learning_rate": 0.00010329807014370562, "loss": 5.3528, "mean_token_accuracy": 0.20809320211410523, "num_tokens": 2825772.0, "step": 3330 }, { "entropy": 5.422374486923218, "epoch": 0.07451931133877797, "grad_norm": 1.46875, "learning_rate": 0.00010253907346789632, "loss": 5.2065, "mean_token_accuracy": 0.22140031158924103, "num_tokens": 2829751.0, "step": 3335 }, { "entropy": 5.404621171951294, "epoch": 0.07463103444423341, "grad_norm": 1.3203125, "learning_rate": 0.00010178480489550596, "loss": 5.2479, "mean_token_accuracy": 0.2144748941063881, "num_tokens": 2833887.0, "step": 3340 }, { "entropy": 5.43502459526062, "epoch": 0.07474275754968886, "grad_norm": 1.578125, "learning_rate": 0.00010103528510518836, "loss": 5.3803, "mean_token_accuracy": 0.2070963367819786, "num_tokens": 2838255.0, "step": 3345 }, { "entropy": 5.492996263504028, "epoch": 0.07485448065514429, "grad_norm": 1.4765625, "learning_rate": 0.0001002905346454073, "loss": 5.4135, "mean_token_accuracy": 0.20539223849773408, "num_tokens": 2842432.0, "step": 3350 }, { "entropy": 5.373112440109253, "epoch": 0.07496620376059973, "grad_norm": 1.3046875, "learning_rate": 9.955057393387285e-05, "loss": 5.1975, "mean_token_accuracy": 0.2243659406900406, "num_tokens": 2846793.0, "step": 3355 }, { "entropy": 5.456656122207642, "epoch": 0.07507792686605518, "grad_norm": 1.4453125, "learning_rate": 9.88154232569816e-05, "loss": 5.2963, "mean_token_accuracy": 0.21691622585058212, "num_tokens": 2850640.0, "step": 3360 }, { "entropy": 5.374510669708252, "epoch": 0.0751896499715106, "grad_norm": 1.34375, "learning_rate": 9.808510276926075e-05, "loss": 5.2861, "mean_token_accuracy": 0.2222789630293846, "num_tokens": 2854935.0, "step": 3365 }, { "entropy": 5.392180967330932, "epoch": 0.07530137307696605, "grad_norm": 1.34375, "learning_rate": 9.735963249281549e-05, "loss": 5.1537, "mean_token_accuracy": 0.22890147864818572, "num_tokens": 2858777.0, "step": 3370 }, { "entropy": 5.474043607711792, "epoch": 0.0754130961824215, "grad_norm": 1.484375, "learning_rate": 9.663903231677974e-05, "loss": 5.3274, "mean_token_accuracy": 0.2042478621006012, "num_tokens": 2863048.0, "step": 3375 }, { "entropy": 5.5118146419525145, "epoch": 0.07552481928787692, "grad_norm": 1.3125, "learning_rate": 9.592332199677145e-05, "loss": 5.4592, "mean_token_accuracy": 0.20294993072748185, "num_tokens": 2867614.0, "step": 3380 }, { "entropy": 5.460476446151733, "epoch": 0.07563654239333237, "grad_norm": 1.484375, "learning_rate": 9.521252115435061e-05, "loss": 5.375, "mean_token_accuracy": 0.20788123458623886, "num_tokens": 2871872.0, "step": 3385 }, { "entropy": 5.536714363098144, "epoch": 0.0757482654987878, "grad_norm": 1.40625, "learning_rate": 9.450664927648126e-05, "loss": 5.4114, "mean_token_accuracy": 0.20224810689687728, "num_tokens": 2876240.0, "step": 3390 }, { "entropy": 5.48695011138916, "epoch": 0.07585998860424324, "grad_norm": 1.46875, "learning_rate": 9.380572571499758e-05, "loss": 5.2708, "mean_token_accuracy": 0.21488912999629975, "num_tokens": 2880301.0, "step": 3395 }, { "entropy": 5.535502910614014, "epoch": 0.07597171170969869, "grad_norm": 1.2734375, "learning_rate": 9.310976968607307e-05, "loss": 5.3006, "mean_token_accuracy": 0.21221349835395814, "num_tokens": 2884552.0, "step": 3400 }, { "entropy": 5.48386025428772, "epoch": 0.07608343481515412, "grad_norm": 1.4609375, "learning_rate": 9.241880026969381e-05, "loss": 5.2903, "mean_token_accuracy": 0.20202295780181884, "num_tokens": 2888851.0, "step": 3405 }, { "entropy": 5.409109258651734, "epoch": 0.07619515792060956, "grad_norm": 1.3828125, "learning_rate": 9.173283640913537e-05, "loss": 5.2352, "mean_token_accuracy": 0.22855947017669678, "num_tokens": 2892712.0, "step": 3410 }, { "entropy": 5.468653345108033, "epoch": 0.076306881026065, "grad_norm": 1.3203125, "learning_rate": 9.10518969104436e-05, "loss": 5.3441, "mean_token_accuracy": 0.20783532857894899, "num_tokens": 2897018.0, "step": 3415 }, { "entropy": 5.367815017700195, "epoch": 0.07641860413152043, "grad_norm": 2.390625, "learning_rate": 9.037600044191868e-05, "loss": 5.4434, "mean_token_accuracy": 0.21158043444156646, "num_tokens": 2901689.0, "step": 3420 }, { "entropy": 5.36310601234436, "epoch": 0.07653032723697588, "grad_norm": 1.3125, "learning_rate": 8.970516553360383e-05, "loss": 5.2378, "mean_token_accuracy": 0.22523299604654312, "num_tokens": 2905625.0, "step": 3425 }, { "entropy": 5.427180051803589, "epoch": 0.07664205034243132, "grad_norm": 1.34375, "learning_rate": 8.903941057677692e-05, "loss": 5.3213, "mean_token_accuracy": 0.21469760239124297, "num_tokens": 2909913.0, "step": 3430 }, { "entropy": 5.450718259811401, "epoch": 0.07675377344788675, "grad_norm": 1.328125, "learning_rate": 8.837875382344635e-05, "loss": 5.3333, "mean_token_accuracy": 0.21575213670730592, "num_tokens": 2914583.0, "step": 3435 }, { "entropy": 5.469852161407471, "epoch": 0.0768654965533422, "grad_norm": 1.34375, "learning_rate": 8.772321338585076e-05, "loss": 5.2892, "mean_token_accuracy": 0.20794924795627595, "num_tokens": 2918753.0, "step": 3440 }, { "entropy": 5.437172555923462, "epoch": 0.07697721965879764, "grad_norm": 1.3984375, "learning_rate": 8.707280723596242e-05, "loss": 5.3379, "mean_token_accuracy": 0.21011864244937897, "num_tokens": 2922982.0, "step": 3445 }, { "entropy": 5.399620008468628, "epoch": 0.07708894276425307, "grad_norm": 1.3828125, "learning_rate": 8.64275532049944e-05, "loss": 5.2164, "mean_token_accuracy": 0.2157105028629303, "num_tokens": 2927603.0, "step": 3450 }, { "entropy": 5.424432229995728, "epoch": 0.07720066586970852, "grad_norm": 1.2734375, "learning_rate": 8.578746898291198e-05, "loss": 5.1749, "mean_token_accuracy": 0.22035693526268005, "num_tokens": 2932040.0, "step": 3455 }, { "entropy": 5.474033689498901, "epoch": 0.07731238897516396, "grad_norm": 1.4609375, "learning_rate": 8.515257211794742e-05, "loss": 5.2275, "mean_token_accuracy": 0.21214390993118287, "num_tokens": 2935857.0, "step": 3460 }, { "entropy": 5.433276748657226, "epoch": 0.07742411208061939, "grad_norm": 1.296875, "learning_rate": 8.452288001611896e-05, "loss": 5.2795, "mean_token_accuracy": 0.2194603443145752, "num_tokens": 2940103.0, "step": 3465 }, { "entropy": 5.435501146316528, "epoch": 0.07753583518607483, "grad_norm": 1.2578125, "learning_rate": 8.389840994075379e-05, "loss": 5.3643, "mean_token_accuracy": 0.22076392024755478, "num_tokens": 2944437.0, "step": 3470 }, { "entropy": 5.418190431594849, "epoch": 0.07764755829153028, "grad_norm": 1.4140625, "learning_rate": 8.327917901201435e-05, "loss": 5.2851, "mean_token_accuracy": 0.21600028425455092, "num_tokens": 2948550.0, "step": 3475 }, { "entropy": 5.434340858459473, "epoch": 0.07775928139698571, "grad_norm": 1.4609375, "learning_rate": 8.266520420642931e-05, "loss": 5.2847, "mean_token_accuracy": 0.213292396068573, "num_tokens": 2952466.0, "step": 3480 }, { "entropy": 5.518459129333496, "epoch": 0.07787100450244115, "grad_norm": 1.734375, "learning_rate": 8.205650235642828e-05, "loss": 5.4022, "mean_token_accuracy": 0.19717635363340377, "num_tokens": 2956504.0, "step": 3485 }, { "entropy": 5.489944791793823, "epoch": 0.0779827276078966, "grad_norm": 1.46875, "learning_rate": 8.145309014987978e-05, "loss": 5.3858, "mean_token_accuracy": 0.2087165370583534, "num_tokens": 2961034.0, "step": 3490 }, { "entropy": 5.433361673355103, "epoch": 0.07809445071335203, "grad_norm": 1.3203125, "learning_rate": 8.085498412963437e-05, "loss": 5.4068, "mean_token_accuracy": 0.21266327798366547, "num_tokens": 2965522.0, "step": 3495 }, { "entropy": 5.387338018417358, "epoch": 0.07820617381880747, "grad_norm": 1.3671875, "learning_rate": 8.026220069307078e-05, "loss": 5.1488, "mean_token_accuracy": 0.2288610428571701, "num_tokens": 2969523.0, "step": 3500 }, { "entropy": 5.470460987091064, "epoch": 0.0783178969242629, "grad_norm": 1.40625, "learning_rate": 7.967475609164621e-05, "loss": 5.2309, "mean_token_accuracy": 0.21927955895662307, "num_tokens": 2973482.0, "step": 3505 }, { "entropy": 5.483710384368896, "epoch": 0.07842962002971834, "grad_norm": 1.4375, "learning_rate": 7.909266643045124e-05, "loss": 5.3822, "mean_token_accuracy": 0.20508345812559128, "num_tokens": 2977696.0, "step": 3510 }, { "entropy": 5.490404939651489, "epoch": 0.07854134313517379, "grad_norm": 1.296875, "learning_rate": 7.851594766776802e-05, "loss": 5.2877, "mean_token_accuracy": 0.21141858249902726, "num_tokens": 2981683.0, "step": 3515 }, { "entropy": 5.4180018424987795, "epoch": 0.07865306624062922, "grad_norm": 1.2890625, "learning_rate": 7.794461561463265e-05, "loss": 5.2535, "mean_token_accuracy": 0.22262844890356065, "num_tokens": 2986040.0, "step": 3520 }, { "entropy": 5.381098127365112, "epoch": 0.07876478934608466, "grad_norm": 2.296875, "learning_rate": 7.7378685934402e-05, "loss": 5.178, "mean_token_accuracy": 0.22615289092063903, "num_tokens": 2990453.0, "step": 3525 }, { "entropy": 5.401708889007568, "epoch": 0.0788765124515401, "grad_norm": 1.3046875, "learning_rate": 7.68181741423242e-05, "loss": 5.3721, "mean_token_accuracy": 0.20061049312353135, "num_tokens": 2994870.0, "step": 3530 }, { "entropy": 5.414038228988647, "epoch": 0.07898823555699554, "grad_norm": 1.4609375, "learning_rate": 7.626309560511313e-05, "loss": 5.2164, "mean_token_accuracy": 0.22463481575250627, "num_tokens": 2998692.0, "step": 3535 }, { "entropy": 5.471405553817749, "epoch": 0.07909995866245098, "grad_norm": 1.3515625, "learning_rate": 7.571346554052724e-05, "loss": 5.4103, "mean_token_accuracy": 0.20698553025722505, "num_tokens": 3002830.0, "step": 3540 }, { "entropy": 5.46899151802063, "epoch": 0.07921168176790643, "grad_norm": 1.3515625, "learning_rate": 7.516929901695249e-05, "loss": 5.2924, "mean_token_accuracy": 0.21017846316099167, "num_tokens": 3007302.0, "step": 3545 }, { "entropy": 5.472835683822632, "epoch": 0.07932340487336186, "grad_norm": 1.5234375, "learning_rate": 7.463061095298893e-05, "loss": 5.2318, "mean_token_accuracy": 0.22335348278284073, "num_tokens": 3011156.0, "step": 3550 }, { "entropy": 5.4681624412536625, "epoch": 0.0794351279788173, "grad_norm": 1.359375, "learning_rate": 7.409741611704198e-05, "loss": 5.3367, "mean_token_accuracy": 0.20153497159481049, "num_tokens": 3015577.0, "step": 3555 }, { "entropy": 5.322337579727173, "epoch": 0.07954685108427274, "grad_norm": 1.3515625, "learning_rate": 7.35697291269174e-05, "loss": 5.1662, "mean_token_accuracy": 0.21798265427351, "num_tokens": 3019801.0, "step": 3560 }, { "entropy": 5.420376873016357, "epoch": 0.07965857418972817, "grad_norm": 1.3125, "learning_rate": 7.304756444942056e-05, "loss": 5.3314, "mean_token_accuracy": 0.21185551434755326, "num_tokens": 3023916.0, "step": 3565 }, { "entropy": 5.43432650566101, "epoch": 0.07977029729518362, "grad_norm": 1.3828125, "learning_rate": 7.253093639995994e-05, "loss": 5.3112, "mean_token_accuracy": 0.20175264328718184, "num_tokens": 3028161.0, "step": 3570 }, { "entropy": 5.513448667526245, "epoch": 0.07988202040063906, "grad_norm": 1.4921875, "learning_rate": 7.20198591421544e-05, "loss": 5.3184, "mean_token_accuracy": 0.21527192294597625, "num_tokens": 3032080.0, "step": 3575 }, { "entropy": 5.500356006622314, "epoch": 0.07999374350609449, "grad_norm": 1.28125, "learning_rate": 7.151434668744517e-05, "loss": 5.4272, "mean_token_accuracy": 0.19863877594470977, "num_tokens": 3036535.0, "step": 3580 }, { "entropy": 5.425574064254761, "epoch": 0.08010546661154994, "grad_norm": 1.4375, "learning_rate": 7.101441289471153e-05, "loss": 5.368, "mean_token_accuracy": 0.20326582193374634, "num_tokens": 3040649.0, "step": 3585 }, { "entropy": 5.460882616043091, "epoch": 0.08021718971700538, "grad_norm": 1.34375, "learning_rate": 7.052007146989098e-05, "loss": 5.3237, "mean_token_accuracy": 0.2185202419757843, "num_tokens": 3044883.0, "step": 3590 }, { "entropy": 5.451679611206055, "epoch": 0.08032891282246081, "grad_norm": 1.734375, "learning_rate": 7.003133596560341e-05, "loss": 5.1965, "mean_token_accuracy": 0.2224562868475914, "num_tokens": 3048802.0, "step": 3595 }, { "entropy": 5.4767327308654785, "epoch": 0.08044063592791625, "grad_norm": 1.3515625, "learning_rate": 6.954821978077952e-05, "loss": 5.3728, "mean_token_accuracy": 0.21814717054367067, "num_tokens": 3053078.0, "step": 3600 }, { "entropy": 5.496955013275146, "epoch": 0.0805523590333717, "grad_norm": 1.2734375, "learning_rate": 6.907073616029356e-05, "loss": 5.3011, "mean_token_accuracy": 0.2068978577852249, "num_tokens": 3057691.0, "step": 3605 }, { "entropy": 5.607783651351928, "epoch": 0.08066408213882713, "grad_norm": 1.3046875, "learning_rate": 6.85988981946002e-05, "loss": 5.4936, "mean_token_accuracy": 0.2021944925189018, "num_tokens": 3062459.0, "step": 3610 }, { "entropy": 5.533841896057129, "epoch": 0.08077580524428257, "grad_norm": 1.453125, "learning_rate": 6.813271881937564e-05, "loss": 5.3606, "mean_token_accuracy": 0.2029819145798683, "num_tokens": 3066453.0, "step": 3615 }, { "entropy": 5.36773796081543, "epoch": 0.080887528349738, "grad_norm": 1.359375, "learning_rate": 6.767221081516286e-05, "loss": 5.2517, "mean_token_accuracy": 0.2185253158211708, "num_tokens": 3070726.0, "step": 3620 }, { "entropy": 5.544235038757324, "epoch": 0.08099925145519345, "grad_norm": 1.4453125, "learning_rate": 6.72173868070215e-05, "loss": 5.3501, "mean_token_accuracy": 0.2105439469218254, "num_tokens": 3074907.0, "step": 3625 }, { "entropy": 5.498954916000367, "epoch": 0.08111097456064889, "grad_norm": 1.4375, "learning_rate": 6.676825926418149e-05, "loss": 5.351, "mean_token_accuracy": 0.2052205190062523, "num_tokens": 3078851.0, "step": 3630 }, { "entropy": 5.448353242874146, "epoch": 0.08122269766610432, "grad_norm": 1.4375, "learning_rate": 6.632484049970122e-05, "loss": 5.2145, "mean_token_accuracy": 0.21834060549736023, "num_tokens": 3082871.0, "step": 3635 }, { "entropy": 5.507769203186035, "epoch": 0.08133442077155977, "grad_norm": 1.34375, "learning_rate": 6.588714267013019e-05, "loss": 5.3462, "mean_token_accuracy": 0.21094026565551757, "num_tokens": 3087385.0, "step": 3640 }, { "entropy": 5.40455994606018, "epoch": 0.08144614387701521, "grad_norm": 1.2421875, "learning_rate": 6.545517777517544e-05, "loss": 5.2943, "mean_token_accuracy": 0.20447153896093367, "num_tokens": 3091818.0, "step": 3645 }, { "entropy": 5.483021259307861, "epoch": 0.08155786698247064, "grad_norm": 1.375, "learning_rate": 6.502895765737281e-05, "loss": 5.3218, "mean_token_accuracy": 0.2072039380669594, "num_tokens": 3096045.0, "step": 3650 }, { "entropy": 5.495946168899536, "epoch": 0.08166959008792608, "grad_norm": 1.4609375, "learning_rate": 6.460849400176212e-05, "loss": 5.3629, "mean_token_accuracy": 0.2022266775369644, "num_tokens": 3100313.0, "step": 3655 }, { "entropy": 5.456543207168579, "epoch": 0.08178131319338153, "grad_norm": 1.4375, "learning_rate": 6.419379833556694e-05, "loss": 5.3421, "mean_token_accuracy": 0.2174874246120453, "num_tokens": 3104434.0, "step": 3660 }, { "entropy": 5.485145187377929, "epoch": 0.08189303629883696, "grad_norm": 1.3125, "learning_rate": 6.378488202787835e-05, "loss": 5.2584, "mean_token_accuracy": 0.22993357926607133, "num_tokens": 3108801.0, "step": 3665 }, { "entropy": 5.477007341384888, "epoch": 0.0820047594042924, "grad_norm": 1.359375, "learning_rate": 6.33817562893435e-05, "loss": 5.3548, "mean_token_accuracy": 0.20239174962043763, "num_tokens": 3113250.0, "step": 3670 }, { "entropy": 5.444193124771118, "epoch": 0.08211648250974785, "grad_norm": 1.359375, "learning_rate": 6.29844321718582e-05, "loss": 5.2573, "mean_token_accuracy": 0.22313680201768876, "num_tokens": 3117524.0, "step": 3675 }, { "entropy": 5.4564752101898195, "epoch": 0.08222820561520328, "grad_norm": 1.453125, "learning_rate": 6.259292056826383e-05, "loss": 5.3893, "mean_token_accuracy": 0.20390169620513915, "num_tokens": 3122416.0, "step": 3680 }, { "entropy": 5.478220844268799, "epoch": 0.08233992872065872, "grad_norm": 1.328125, "learning_rate": 6.220723221204873e-05, "loss": 5.3286, "mean_token_accuracy": 0.21259014457464218, "num_tokens": 3126556.0, "step": 3685 }, { "entropy": 5.422747087478638, "epoch": 0.08245165182611416, "grad_norm": 1.3671875, "learning_rate": 6.182737767705406e-05, "loss": 5.2702, "mean_token_accuracy": 0.21507012695074082, "num_tokens": 3130802.0, "step": 3690 }, { "entropy": 5.507152128219604, "epoch": 0.0825633749315696, "grad_norm": 1.3515625, "learning_rate": 6.145336737718375e-05, "loss": 5.2914, "mean_token_accuracy": 0.21328252404928208, "num_tokens": 3135123.0, "step": 3695 }, { "entropy": 5.430543422698975, "epoch": 0.08267509803702504, "grad_norm": 1.34375, "learning_rate": 6.10852115661191e-05, "loss": 5.2963, "mean_token_accuracy": 0.20893368870019913, "num_tokens": 3139154.0, "step": 3700 }, { "entropy": 5.492835521697998, "epoch": 0.08278682114248048, "grad_norm": 1.3515625, "learning_rate": 6.072292033703766e-05, "loss": 5.3047, "mean_token_accuracy": 0.2156550645828247, "num_tokens": 3143563.0, "step": 3705 }, { "entropy": 5.449473524093628, "epoch": 0.08289854424793591, "grad_norm": 1.4375, "learning_rate": 6.036650362233648e-05, "loss": 5.2671, "mean_token_accuracy": 0.21509288251399994, "num_tokens": 3147426.0, "step": 3710 }, { "entropy": 5.49048490524292, "epoch": 0.08301026735339136, "grad_norm": 1.3359375, "learning_rate": 6.0015971193359824e-05, "loss": 5.305, "mean_token_accuracy": 0.22211327999830247, "num_tokens": 3151602.0, "step": 3715 }, { "entropy": 5.507481718063355, "epoch": 0.0831219904588468, "grad_norm": 1.3828125, "learning_rate": 5.9671332660131306e-05, "loss": 5.2952, "mean_token_accuracy": 0.2074457436800003, "num_tokens": 3155494.0, "step": 3720 }, { "entropy": 5.475460243225098, "epoch": 0.08323371356430223, "grad_norm": 1.3828125, "learning_rate": 5.933259747109042e-05, "loss": 5.2336, "mean_token_accuracy": 0.22381201088428498, "num_tokens": 3159548.0, "step": 3725 }, { "entropy": 5.450302600860596, "epoch": 0.08334543666975767, "grad_norm": 1.4140625, "learning_rate": 5.899977491283351e-05, "loss": 5.2869, "mean_token_accuracy": 0.21753088086843492, "num_tokens": 3163531.0, "step": 3730 }, { "entropy": 5.510595321655273, "epoch": 0.0834571597752131, "grad_norm": 1.3203125, "learning_rate": 5.867287410985908e-05, "loss": 5.2868, "mean_token_accuracy": 0.21071509271860123, "num_tokens": 3167833.0, "step": 3735 }, { "entropy": 5.544836187362671, "epoch": 0.08356888288066855, "grad_norm": 1.328125, "learning_rate": 5.835190402431779e-05, "loss": 5.3727, "mean_token_accuracy": 0.20985618978738785, "num_tokens": 3172022.0, "step": 3740 }, { "entropy": 5.513324832916259, "epoch": 0.083680605986124, "grad_norm": 1.46875, "learning_rate": 5.803687345576673e-05, "loss": 5.3992, "mean_token_accuracy": 0.20568832904100418, "num_tokens": 3176354.0, "step": 3745 }, { "entropy": 5.433866930007935, "epoch": 0.08379232909157942, "grad_norm": 1.3203125, "learning_rate": 5.7727791040927977e-05, "loss": 5.272, "mean_token_accuracy": 0.21877482533454895, "num_tokens": 3180828.0, "step": 3750 }, { "entropy": 5.5256876945495605, "epoch": 0.08390405219703487, "grad_norm": 1.3359375, "learning_rate": 5.742466525345213e-05, "loss": 5.3348, "mean_token_accuracy": 0.20798473358154296, "num_tokens": 3185032.0, "step": 3755 }, { "entropy": 5.458694982528686, "epoch": 0.08401577530249031, "grad_norm": 1.3671875, "learning_rate": 5.7127504403685775e-05, "loss": 5.2539, "mean_token_accuracy": 0.21859435439109803, "num_tokens": 3189160.0, "step": 3760 }, { "entropy": 5.522771692276001, "epoch": 0.08412749840794574, "grad_norm": 1.375, "learning_rate": 5.6836316638443664e-05, "loss": 5.3989, "mean_token_accuracy": 0.20239912271499633, "num_tokens": 3193489.0, "step": 3765 }, { "entropy": 5.474758338928223, "epoch": 0.08423922151340119, "grad_norm": 1.34375, "learning_rate": 5.655110994078553e-05, "loss": 5.3185, "mean_token_accuracy": 0.20446956753730774, "num_tokens": 3197847.0, "step": 3770 }, { "entropy": 5.495055246353149, "epoch": 0.08435094461885663, "grad_norm": 1.3671875, "learning_rate": 5.6271892129797056e-05, "loss": 5.3793, "mean_token_accuracy": 0.20453994870185851, "num_tokens": 3202248.0, "step": 3775 }, { "entropy": 5.400522518157959, "epoch": 0.08446266772431206, "grad_norm": 1.4140625, "learning_rate": 5.599867086037556e-05, "loss": 5.2176, "mean_token_accuracy": 0.22377493381500244, "num_tokens": 3206458.0, "step": 3780 }, { "entropy": 5.54693021774292, "epoch": 0.0845743908297675, "grad_norm": 1.5234375, "learning_rate": 5.573145362302012e-05, "loss": 5.388, "mean_token_accuracy": 0.20280489176511765, "num_tokens": 3210283.0, "step": 3785 }, { "entropy": 5.5878074169158936, "epoch": 0.08468611393522295, "grad_norm": 1.4609375, "learning_rate": 5.5470247743626404e-05, "loss": 5.4592, "mean_token_accuracy": 0.19342145025730134, "num_tokens": 3214630.0, "step": 3790 }, { "entropy": 5.544018411636353, "epoch": 0.08479783704067838, "grad_norm": 1.328125, "learning_rate": 5.5215060383285414e-05, "loss": 5.3699, "mean_token_accuracy": 0.19167541712522507, "num_tokens": 3218614.0, "step": 3795 }, { "entropy": 5.508673572540284, "epoch": 0.08490956014613382, "grad_norm": 1.3828125, "learning_rate": 5.496589853808759e-05, "loss": 5.1767, "mean_token_accuracy": 0.218325611948967, "num_tokens": 3222629.0, "step": 3800 }, { "entropy": 5.492918205261231, "epoch": 0.08502128325158927, "grad_norm": 1.3671875, "learning_rate": 5.47227690389308e-05, "loss": 5.3284, "mean_token_accuracy": 0.20557464957237243, "num_tokens": 3226610.0, "step": 3805 }, { "entropy": 5.473085546493531, "epoch": 0.0851330063570447, "grad_norm": 1.3984375, "learning_rate": 5.448567855133306e-05, "loss": 5.2217, "mean_token_accuracy": 0.21302822530269622, "num_tokens": 3230733.0, "step": 3810 }, { "entropy": 5.484267282485962, "epoch": 0.08524472946250014, "grad_norm": 1.375, "learning_rate": 5.425463357524986e-05, "loss": 5.3566, "mean_token_accuracy": 0.20863422751426697, "num_tokens": 3234886.0, "step": 3815 }, { "entropy": 5.462905406951904, "epoch": 0.08535645256795558, "grad_norm": 1.296875, "learning_rate": 5.402964044489591e-05, "loss": 5.2309, "mean_token_accuracy": 0.21108572483062743, "num_tokens": 3239256.0, "step": 3820 }, { "entropy": 5.465615940093994, "epoch": 0.08546817567341101, "grad_norm": 1.40625, "learning_rate": 5.381070532857153e-05, "loss": 5.3067, "mean_token_accuracy": 0.21286491453647613, "num_tokens": 3243300.0, "step": 3825 }, { "entropy": 5.525377655029297, "epoch": 0.08557989877886646, "grad_norm": 1.390625, "learning_rate": 5.359783422849357e-05, "loss": 5.4335, "mean_token_accuracy": 0.19877439439296724, "num_tokens": 3248038.0, "step": 3830 }, { "entropy": 5.420501375198365, "epoch": 0.0856916218843219, "grad_norm": 1.5859375, "learning_rate": 5.3391032980630736e-05, "loss": 5.2929, "mean_token_accuracy": 0.20999147444963456, "num_tokens": 3251987.0, "step": 3835 }, { "entropy": 5.484584617614746, "epoch": 0.08580334498977733, "grad_norm": 1.3671875, "learning_rate": 5.31903072545437e-05, "loss": 5.3792, "mean_token_accuracy": 0.20324931740760804, "num_tokens": 3256104.0, "step": 3840 }, { "entropy": 5.518879795074463, "epoch": 0.08591506809523278, "grad_norm": 1.3515625, "learning_rate": 5.29956625532297e-05, "loss": 5.267, "mean_token_accuracy": 0.20985907614231109, "num_tokens": 3260439.0, "step": 3845 }, { "entropy": 5.446215724945068, "epoch": 0.08602679120068821, "grad_norm": 1.46875, "learning_rate": 5.280710421297146e-05, "loss": 5.3346, "mean_token_accuracy": 0.20712810158729553, "num_tokens": 3264766.0, "step": 3850 }, { "entropy": 5.479389429092407, "epoch": 0.08613851430614365, "grad_norm": 1.359375, "learning_rate": 5.2624637403191165e-05, "loss": 5.4389, "mean_token_accuracy": 0.1983839675784111, "num_tokens": 3269211.0, "step": 3855 }, { "entropy": 5.4416468143463135, "epoch": 0.0862502374115991, "grad_norm": 1.4296875, "learning_rate": 5.2448267126308605e-05, "loss": 5.3025, "mean_token_accuracy": 0.21161485761404036, "num_tokens": 3273116.0, "step": 3860 }, { "entropy": 5.432149600982666, "epoch": 0.08636196051705453, "grad_norm": 1.3359375, "learning_rate": 5.2277998217603954e-05, "loss": 5.3587, "mean_token_accuracy": 0.20577728152275085, "num_tokens": 3277347.0, "step": 3865 }, { "entropy": 5.552227210998535, "epoch": 0.08647368362250997, "grad_norm": 1.4921875, "learning_rate": 5.211383534508541e-05, "loss": 5.3781, "mean_token_accuracy": 0.20554954707622528, "num_tokens": 3281772.0, "step": 3870 }, { "entropy": 5.423211908340454, "epoch": 0.08658540672796541, "grad_norm": 1.2578125, "learning_rate": 5.1955783009361044e-05, "loss": 5.2727, "mean_token_accuracy": 0.21731619089841842, "num_tokens": 3286115.0, "step": 3875 }, { "entropy": 5.508418703079224, "epoch": 0.08669712983342084, "grad_norm": 1.3984375, "learning_rate": 5.180384554351543e-05, "loss": 5.3584, "mean_token_accuracy": 0.21214410215616225, "num_tokens": 3290791.0, "step": 3880 }, { "entropy": 5.518609809875488, "epoch": 0.08680885293887629, "grad_norm": 1.296875, "learning_rate": 5.1658027112990976e-05, "loss": 5.3323, "mean_token_accuracy": 0.2126715898513794, "num_tokens": 3295327.0, "step": 3885 }, { "entropy": 5.573560953140259, "epoch": 0.08692057604433173, "grad_norm": 1.421875, "learning_rate": 5.151833171547365e-05, "loss": 5.4551, "mean_token_accuracy": 0.2000301867723465, "num_tokens": 3299267.0, "step": 3890 }, { "entropy": 5.503855562210083, "epoch": 0.08703229914978716, "grad_norm": 1.1875, "learning_rate": 5.1384763180783274e-05, "loss": 5.4126, "mean_token_accuracy": 0.20867222547531128, "num_tokens": 3304074.0, "step": 3895 }, { "entropy": 5.502064275741577, "epoch": 0.0871440222552426, "grad_norm": 1.4296875, "learning_rate": 5.125732517076876e-05, "loss": 5.3218, "mean_token_accuracy": 0.21082943081855773, "num_tokens": 3308292.0, "step": 3900 }, { "entropy": 5.495740509033203, "epoch": 0.08725574536069805, "grad_norm": 1.3515625, "learning_rate": 5.113602117920747e-05, "loss": 5.381, "mean_token_accuracy": 0.2111126720905304, "num_tokens": 3312161.0, "step": 3905 }, { "entropy": 5.515297079086304, "epoch": 0.08736746846615348, "grad_norm": 1.359375, "learning_rate": 5.102085453170966e-05, "loss": 5.3083, "mean_token_accuracy": 0.20120840817689895, "num_tokens": 3316271.0, "step": 3910 }, { "entropy": 5.524663591384888, "epoch": 0.08747919157160892, "grad_norm": 1.3515625, "learning_rate": 5.091182838562709e-05, "loss": 5.3983, "mean_token_accuracy": 0.19642595946788788, "num_tokens": 3320663.0, "step": 3915 }, { "entropy": 5.462934875488282, "epoch": 0.08759091467706437, "grad_norm": 1.34375, "learning_rate": 5.0808945729966716e-05, "loss": 5.3825, "mean_token_accuracy": 0.21193809062242508, "num_tokens": 3324699.0, "step": 3920 }, { "entropy": 5.555219984054565, "epoch": 0.0877026377825198, "grad_norm": 1.3359375, "learning_rate": 5.071220938530844e-05, "loss": 5.3412, "mean_token_accuracy": 0.19343438744544983, "num_tokens": 3328737.0, "step": 3925 }, { "entropy": 5.5828653335571286, "epoch": 0.08781436088797524, "grad_norm": 1.3984375, "learning_rate": 5.0621622003728026e-05, "loss": 5.4562, "mean_token_accuracy": 0.20372304171323777, "num_tokens": 3333238.0, "step": 3930 }, { "entropy": 5.500009250640869, "epoch": 0.08792608399343069, "grad_norm": 1.3984375, "learning_rate": 5.053718606872433e-05, "loss": 5.3826, "mean_token_accuracy": 0.19335117787122727, "num_tokens": 3337505.0, "step": 3935 }, { "entropy": 5.459330749511719, "epoch": 0.08803780709888612, "grad_norm": 1.46875, "learning_rate": 5.0458903895151134e-05, "loss": 5.257, "mean_token_accuracy": 0.2263408586382866, "num_tokens": 3341870.0, "step": 3940 }, { "entropy": 5.512932300567627, "epoch": 0.08814953020434156, "grad_norm": 1.34375, "learning_rate": 5.038677762915381e-05, "loss": 5.2713, "mean_token_accuracy": 0.20057151317596436, "num_tokens": 3346200.0, "step": 3945 }, { "entropy": 5.48393669128418, "epoch": 0.088261253309797, "grad_norm": 1.421875, "learning_rate": 5.032080924811033e-05, "loss": 5.1986, "mean_token_accuracy": 0.21341070383787156, "num_tokens": 3350463.0, "step": 3950 }, { "entropy": 5.391775321960449, "epoch": 0.08837297641525244, "grad_norm": 1.3828125, "learning_rate": 5.026100056057718e-05, "loss": 5.1955, "mean_token_accuracy": 0.2334876224398613, "num_tokens": 3354207.0, "step": 3955 }, { "entropy": 5.493735694885254, "epoch": 0.08848469952070788, "grad_norm": 1.2734375, "learning_rate": 5.0207353206239764e-05, "loss": 5.3364, "mean_token_accuracy": 0.2122746080160141, "num_tokens": 3358954.0, "step": 3960 }, { "entropy": 5.554306364059448, "epoch": 0.08859642262616332, "grad_norm": 1.390625, "learning_rate": 5.0159868655867436e-05, "loss": 5.3931, "mean_token_accuracy": 0.20576016306877137, "num_tokens": 3363031.0, "step": 3965 }, { "entropy": 5.477046060562134, "epoch": 0.08870814573161875, "grad_norm": 1.390625, "learning_rate": 5.011854821127305e-05, "loss": 5.3664, "mean_token_accuracy": 0.2064191699028015, "num_tokens": 3367512.0, "step": 3970 }, { "entropy": 5.512136840820313, "epoch": 0.0888198688370742, "grad_norm": 1.3984375, "learning_rate": 5.008339300527755e-05, "loss": 5.3311, "mean_token_accuracy": 0.20445204377174378, "num_tokens": 3371509.0, "step": 3975 }, { "entropy": 5.457255792617798, "epoch": 0.08893159194252963, "grad_norm": 1.578125, "learning_rate": 5.005440400167859e-05, "loss": 5.2995, "mean_token_accuracy": 0.20580489337444305, "num_tokens": 3375476.0, "step": 3980 }, { "entropy": 5.416080379486084, "epoch": 0.08904331504798507, "grad_norm": 1.453125, "learning_rate": 5.003158199522442e-05, "loss": 5.2217, "mean_token_accuracy": 0.21574150919914245, "num_tokens": 3379687.0, "step": 3985 }, { "entropy": 5.457759857177734, "epoch": 0.08915503815344052, "grad_norm": 1.546875, "learning_rate": 5.0014927611591806e-05, "loss": 5.3268, "mean_token_accuracy": 0.21540835797786712, "num_tokens": 3383750.0, "step": 3990 }, { "entropy": 5.480675888061524, "epoch": 0.08926676125889595, "grad_norm": 1.4921875, "learning_rate": 5.000444130736916e-05, "loss": 5.3281, "mean_token_accuracy": 0.21331347525119781, "num_tokens": 3387621.0, "step": 3995 }, { "entropy": 5.383882904052735, "epoch": 0.08937848436435139, "grad_norm": 1.296875, "learning_rate": 5.0000123370043736e-05, "loss": 5.2639, "mean_token_accuracy": 0.21681594997644424, "num_tokens": 3392112.0, "step": 4000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4913800796160000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }