{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.044689242182175695, "eval_steps": 500, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.69185152053833, "epoch": 0.00011172310545543924, "grad_norm": 18.5, "learning_rate": 2e-06, "loss": 10.5751, "mean_token_accuracy": 0.00030030030757188797, "num_tokens": 4264.0, "step": 5 }, { "entropy": 10.691861820220947, "epoch": 0.00022344621091087847, "grad_norm": 16.75, "learning_rate": 4.5e-06, "loss": 10.4625, "mean_token_accuracy": 0.0, "num_tokens": 8413.0, "step": 10 }, { "entropy": 10.690832233428955, "epoch": 0.0003351693163663177, "grad_norm": 13.4375, "learning_rate": 7e-06, "loss": 10.1956, "mean_token_accuracy": 0.03499803415033966, "num_tokens": 12394.0, "step": 15 }, { "entropy": 10.681817626953125, "epoch": 0.00044689242182175694, "grad_norm": 8.4375, "learning_rate": 9.5e-06, "loss": 9.8891, "mean_token_accuracy": 0.052673622593283655, "num_tokens": 16610.0, "step": 20 }, { "entropy": 10.648191356658936, "epoch": 0.0005586155272771962, "grad_norm": 5.84375, "learning_rate": 1.2e-05, "loss": 9.6415, "mean_token_accuracy": 0.059712447226047516, "num_tokens": 21243.0, "step": 25 }, { "entropy": 10.600524044036865, "epoch": 0.0006703386327326354, "grad_norm": 4.21875, "learning_rate": 1.4500000000000002e-05, "loss": 9.3955, "mean_token_accuracy": 0.06313439272344112, "num_tokens": 25571.0, "step": 30 }, { "entropy": 10.565627956390381, "epoch": 0.0007820617381880747, "grad_norm": 4.28125, "learning_rate": 1.7000000000000003e-05, "loss": 9.2501, "mean_token_accuracy": 0.058146678283810614, "num_tokens": 29412.0, "step": 35 }, { "entropy": 10.537028217315674, "epoch": 0.0008937848436435139, "grad_norm": 3.796875, "learning_rate": 1.95e-05, "loss": 9.2173, "mean_token_accuracy": 0.061766361258924006, "num_tokens": 33893.0, "step": 40 }, { "entropy": 10.526171112060547, "epoch": 0.0010055079490989532, "grad_norm": 3.765625, "learning_rate": 2.2e-05, "loss": 9.1499, "mean_token_accuracy": 0.06647200398147106, "num_tokens": 38043.0, "step": 45 }, { "entropy": 10.459559440612793, "epoch": 0.0011172310545543925, "grad_norm": 3.296875, "learning_rate": 2.4500000000000003e-05, "loss": 9.0927, "mean_token_accuracy": 0.06208832561969757, "num_tokens": 42222.0, "step": 50 }, { "entropy": 10.321250820159912, "epoch": 0.0012289541600098315, "grad_norm": 3.640625, "learning_rate": 2.7e-05, "loss": 8.9929, "mean_token_accuracy": 0.06888641528785229, "num_tokens": 46321.0, "step": 55 }, { "entropy": 10.221459579467773, "epoch": 0.0013406772654652708, "grad_norm": 3.140625, "learning_rate": 2.95e-05, "loss": 9.0121, "mean_token_accuracy": 0.07621248066425323, "num_tokens": 50816.0, "step": 60 }, { "entropy": 10.167527294158935, "epoch": 0.0014524003709207101, "grad_norm": 3.046875, "learning_rate": 3.2e-05, "loss": 8.9766, "mean_token_accuracy": 0.06631188206374646, "num_tokens": 55331.0, "step": 65 }, { "entropy": 10.158582305908203, "epoch": 0.0015641234763761494, "grad_norm": 2.828125, "learning_rate": 3.4500000000000005e-05, "loss": 8.8916, "mean_token_accuracy": 0.06474936045706273, "num_tokens": 59379.0, "step": 70 }, { "entropy": 10.132518291473389, "epoch": 0.0016758465818315885, "grad_norm": 2.671875, "learning_rate": 3.7e-05, "loss": 8.7691, "mean_token_accuracy": 0.07134371958673, "num_tokens": 63463.0, "step": 75 }, { "entropy": 10.115495491027833, "epoch": 0.0017875696872870278, "grad_norm": 2.625, "learning_rate": 3.95e-05, "loss": 8.8345, "mean_token_accuracy": 0.07139550410211086, "num_tokens": 67897.0, "step": 80 }, { "entropy": 10.076316165924073, "epoch": 0.001899292792742467, "grad_norm": 2.796875, "learning_rate": 4.2000000000000004e-05, "loss": 8.6081, "mean_token_accuracy": 0.07515238299965858, "num_tokens": 71995.0, "step": 85 }, { "entropy": 10.003674030303955, "epoch": 0.0020110158981979064, "grad_norm": 2.78125, "learning_rate": 4.45e-05, "loss": 8.4613, "mean_token_accuracy": 0.07963024936616421, "num_tokens": 75745.0, "step": 90 }, { "entropy": 9.955099964141846, "epoch": 0.0021227390036533456, "grad_norm": 2.34375, "learning_rate": 4.7000000000000004e-05, "loss": 8.4039, "mean_token_accuracy": 0.0783398538827896, "num_tokens": 79641.0, "step": 95 }, { "entropy": 9.907726192474366, "epoch": 0.002234462109108785, "grad_norm": 2.15625, "learning_rate": 4.9500000000000004e-05, "loss": 8.3639, "mean_token_accuracy": 0.07564271241426468, "num_tokens": 84368.0, "step": 100 }, { "entropy": 9.777185916900635, "epoch": 0.0023461852145642242, "grad_norm": 3.046875, "learning_rate": 5.2e-05, "loss": 8.3562, "mean_token_accuracy": 0.07499068863689899, "num_tokens": 89177.0, "step": 105 }, { "entropy": 9.874152565002442, "epoch": 0.002457908320019663, "grad_norm": 2.09375, "learning_rate": 5.45e-05, "loss": 8.1616, "mean_token_accuracy": 0.08200128600001336, "num_tokens": 93266.0, "step": 110 }, { "entropy": 9.573559665679932, "epoch": 0.0025696314254751024, "grad_norm": 2.515625, "learning_rate": 5.7e-05, "loss": 8.0628, "mean_token_accuracy": 0.08064724728465081, "num_tokens": 97385.0, "step": 115 }, { "entropy": 9.477795314788818, "epoch": 0.0026813545309305417, "grad_norm": 2.03125, "learning_rate": 5.9499999999999996e-05, "loss": 7.8909, "mean_token_accuracy": 0.08364077880978585, "num_tokens": 100911.0, "step": 120 }, { "entropy": 9.406207180023193, "epoch": 0.002793077636385981, "grad_norm": 1.765625, "learning_rate": 6.2e-05, "loss": 7.8101, "mean_token_accuracy": 0.08597532883286477, "num_tokens": 104785.0, "step": 125 }, { "entropy": 9.198468017578126, "epoch": 0.0029048007418414202, "grad_norm": 2.265625, "learning_rate": 6.450000000000001e-05, "loss": 7.7507, "mean_token_accuracy": 0.08100780844688416, "num_tokens": 109434.0, "step": 130 }, { "entropy": 9.137882709503174, "epoch": 0.0030165238472968595, "grad_norm": 1.734375, "learning_rate": 6.7e-05, "loss": 7.7526, "mean_token_accuracy": 0.08647556751966476, "num_tokens": 113869.0, "step": 135 }, { "entropy": 8.982115554809571, "epoch": 0.003128246952752299, "grad_norm": 1.828125, "learning_rate": 6.950000000000001e-05, "loss": 7.6855, "mean_token_accuracy": 0.0863442875444889, "num_tokens": 118332.0, "step": 140 }, { "entropy": 8.803977680206298, "epoch": 0.003239970058207738, "grad_norm": 1.8828125, "learning_rate": 7.2e-05, "loss": 7.5951, "mean_token_accuracy": 0.07965997867286205, "num_tokens": 122140.0, "step": 145 }, { "entropy": 8.717557144165038, "epoch": 0.003351693163663177, "grad_norm": 1.796875, "learning_rate": 7.45e-05, "loss": 7.4489, "mean_token_accuracy": 0.08853708282113075, "num_tokens": 126515.0, "step": 150 }, { "entropy": 8.480121898651124, "epoch": 0.0034634162691186163, "grad_norm": 1.9375, "learning_rate": 7.7e-05, "loss": 7.5078, "mean_token_accuracy": 0.0842710092663765, "num_tokens": 130397.0, "step": 155 }, { "entropy": 8.55941562652588, "epoch": 0.0035751393745740555, "grad_norm": 1.796875, "learning_rate": 7.950000000000001e-05, "loss": 7.448, "mean_token_accuracy": 0.086439348757267, "num_tokens": 134428.0, "step": 160 }, { "entropy": 8.38999900817871, "epoch": 0.003686862480029495, "grad_norm": 2.0625, "learning_rate": 8.2e-05, "loss": 7.3523, "mean_token_accuracy": 0.09324855357408524, "num_tokens": 138294.0, "step": 165 }, { "entropy": 8.155976009368896, "epoch": 0.003798585585484934, "grad_norm": 1.4140625, "learning_rate": 8.450000000000001e-05, "loss": 7.3474, "mean_token_accuracy": 0.08743810728192329, "num_tokens": 142750.0, "step": 170 }, { "entropy": 8.256286525726319, "epoch": 0.003910308690940373, "grad_norm": 1.5390625, "learning_rate": 8.7e-05, "loss": 7.3177, "mean_token_accuracy": 0.08836911171674729, "num_tokens": 147220.0, "step": 175 }, { "entropy": 7.98900089263916, "epoch": 0.004022031796395813, "grad_norm": 1.765625, "learning_rate": 8.95e-05, "loss": 7.2059, "mean_token_accuracy": 0.09879823476076126, "num_tokens": 151396.0, "step": 180 }, { "entropy": 8.085029649734498, "epoch": 0.0041337549018512516, "grad_norm": 1.859375, "learning_rate": 9.2e-05, "loss": 7.2565, "mean_token_accuracy": 0.0990697756409645, "num_tokens": 155336.0, "step": 185 }, { "entropy": 8.046411085128785, "epoch": 0.004245478007306691, "grad_norm": 3.03125, "learning_rate": 9.45e-05, "loss": 7.2963, "mean_token_accuracy": 0.08894443586468696, "num_tokens": 159752.0, "step": 190 }, { "entropy": 8.043665552139283, "epoch": 0.00435720111276213, "grad_norm": 1.671875, "learning_rate": 9.7e-05, "loss": 7.3874, "mean_token_accuracy": 0.08465041853487491, "num_tokens": 163895.0, "step": 195 }, { "entropy": 7.914860630035401, "epoch": 0.00446892421821757, "grad_norm": 1.3984375, "learning_rate": 9.95e-05, "loss": 7.1927, "mean_token_accuracy": 0.093280029296875, "num_tokens": 168312.0, "step": 200 }, { "entropy": 7.915866088867188, "epoch": 0.004580647323673009, "grad_norm": 1.9375, "learning_rate": 0.000102, "loss": 7.2334, "mean_token_accuracy": 0.09746119827032089, "num_tokens": 172358.0, "step": 205 }, { "entropy": 7.660448884963989, "epoch": 0.0046923704291284484, "grad_norm": 1.671875, "learning_rate": 0.00010449999999999999, "loss": 7.2206, "mean_token_accuracy": 0.09569770470261574, "num_tokens": 177085.0, "step": 210 }, { "entropy": 7.943923139572144, "epoch": 0.004804093534583887, "grad_norm": 2.015625, "learning_rate": 0.000107, "loss": 7.3482, "mean_token_accuracy": 0.08808798864483833, "num_tokens": 181410.0, "step": 215 }, { "entropy": 7.640953445434571, "epoch": 0.004915816640039326, "grad_norm": 1.6875, "learning_rate": 0.0001095, "loss": 7.0931, "mean_token_accuracy": 0.0959208883345127, "num_tokens": 185649.0, "step": 220 }, { "entropy": 7.714695310592651, "epoch": 0.005027539745494766, "grad_norm": 1.609375, "learning_rate": 0.000112, "loss": 7.1461, "mean_token_accuracy": 0.09635853916406631, "num_tokens": 190055.0, "step": 225 }, { "entropy": 7.722128820419312, "epoch": 0.005139262850950205, "grad_norm": 1.8125, "learning_rate": 0.0001145, "loss": 7.1545, "mean_token_accuracy": 0.10052503794431686, "num_tokens": 194267.0, "step": 230 }, { "entropy": 7.67925763130188, "epoch": 0.0052509859564056445, "grad_norm": 1.78125, "learning_rate": 0.00011700000000000001, "loss": 7.0976, "mean_token_accuracy": 0.09923605695366859, "num_tokens": 198483.0, "step": 235 }, { "entropy": 7.5812575340271, "epoch": 0.005362709061861083, "grad_norm": 1.5703125, "learning_rate": 0.00011949999999999999, "loss": 7.0173, "mean_token_accuracy": 0.10283883661031723, "num_tokens": 202514.0, "step": 240 }, { "entropy": 7.598950576782227, "epoch": 0.005474432167316523, "grad_norm": 1.796875, "learning_rate": 0.000122, "loss": 7.1592, "mean_token_accuracy": 0.09925142973661423, "num_tokens": 206748.0, "step": 245 }, { "entropy": 7.573145723342895, "epoch": 0.005586155272771962, "grad_norm": 1.875, "learning_rate": 0.0001245, "loss": 7.0229, "mean_token_accuracy": 0.10259764194488526, "num_tokens": 210981.0, "step": 250 }, { "entropy": 7.5371081829071045, "epoch": 0.005697878378227402, "grad_norm": 1.5859375, "learning_rate": 0.000127, "loss": 7.1679, "mean_token_accuracy": 0.09469496235251426, "num_tokens": 215551.0, "step": 255 }, { "entropy": 7.520426607131958, "epoch": 0.0058096014836828405, "grad_norm": 1.453125, "learning_rate": 0.0001295, "loss": 6.9739, "mean_token_accuracy": 0.11107034981250763, "num_tokens": 219677.0, "step": 260 }, { "entropy": 7.612557506561279, "epoch": 0.005921324589138279, "grad_norm": 1.75, "learning_rate": 0.000132, "loss": 7.072, "mean_token_accuracy": 0.10267340168356895, "num_tokens": 223457.0, "step": 265 }, { "entropy": 7.546310329437256, "epoch": 0.006033047694593719, "grad_norm": 1.734375, "learning_rate": 0.00013450000000000002, "loss": 6.9226, "mean_token_accuracy": 0.1154308445751667, "num_tokens": 227135.0, "step": 270 }, { "entropy": 7.572003746032715, "epoch": 0.006144770800049158, "grad_norm": 1.6328125, "learning_rate": 0.00013700000000000002, "loss": 7.1372, "mean_token_accuracy": 0.09673138484358787, "num_tokens": 231393.0, "step": 275 }, { "entropy": 7.611022663116455, "epoch": 0.006256493905504598, "grad_norm": 1.6484375, "learning_rate": 0.0001395, "loss": 7.1052, "mean_token_accuracy": 0.10218687430024147, "num_tokens": 235959.0, "step": 280 }, { "entropy": 7.403985118865966, "epoch": 0.0063682170109600365, "grad_norm": 1.734375, "learning_rate": 0.00014199999999999998, "loss": 6.9434, "mean_token_accuracy": 0.10860099717974663, "num_tokens": 239875.0, "step": 285 }, { "entropy": 7.420692682266235, "epoch": 0.006479940116415476, "grad_norm": 1.4765625, "learning_rate": 0.0001445, "loss": 7.0656, "mean_token_accuracy": 0.11386927664279937, "num_tokens": 244397.0, "step": 290 }, { "entropy": 7.5308808326721195, "epoch": 0.006591663221870915, "grad_norm": 1.6015625, "learning_rate": 0.000147, "loss": 7.0, "mean_token_accuracy": 0.10292632281780242, "num_tokens": 248441.0, "step": 295 }, { "entropy": 7.551111650466919, "epoch": 0.006703386327326354, "grad_norm": 2.0625, "learning_rate": 0.0001495, "loss": 7.0078, "mean_token_accuracy": 0.10877085924148559, "num_tokens": 252693.0, "step": 300 }, { "entropy": 7.420186233520508, "epoch": 0.006815109432781794, "grad_norm": 1.96875, "learning_rate": 0.000152, "loss": 6.9778, "mean_token_accuracy": 0.1077166736125946, "num_tokens": 257135.0, "step": 305 }, { "entropy": 7.455549049377441, "epoch": 0.0069268325382372325, "grad_norm": 1.7421875, "learning_rate": 0.00015450000000000001, "loss": 7.101, "mean_token_accuracy": 0.09917000532150269, "num_tokens": 261919.0, "step": 310 }, { "entropy": 7.428725242614746, "epoch": 0.007038555643692672, "grad_norm": 1.71875, "learning_rate": 0.000157, "loss": 7.0018, "mean_token_accuracy": 0.1032940112054348, "num_tokens": 266656.0, "step": 315 }, { "entropy": 7.4056861877441404, "epoch": 0.007150278749148111, "grad_norm": 1.484375, "learning_rate": 0.0001595, "loss": 6.9649, "mean_token_accuracy": 0.10402853935956954, "num_tokens": 270879.0, "step": 320 }, { "entropy": 7.356624603271484, "epoch": 0.007262001854603551, "grad_norm": 1.65625, "learning_rate": 0.000162, "loss": 6.9156, "mean_token_accuracy": 0.11899577528238296, "num_tokens": 274884.0, "step": 325 }, { "entropy": 7.359720230102539, "epoch": 0.00737372496005899, "grad_norm": 1.6953125, "learning_rate": 0.00016450000000000001, "loss": 6.8492, "mean_token_accuracy": 0.10880193561315536, "num_tokens": 279096.0, "step": 330 }, { "entropy": 7.420133590698242, "epoch": 0.007485448065514429, "grad_norm": 1.875, "learning_rate": 0.00016700000000000002, "loss": 6.9547, "mean_token_accuracy": 0.10481383726000786, "num_tokens": 282923.0, "step": 335 }, { "entropy": 7.375938367843628, "epoch": 0.007597171170969868, "grad_norm": 1.5078125, "learning_rate": 0.00016950000000000003, "loss": 6.8854, "mean_token_accuracy": 0.11555279865860939, "num_tokens": 287283.0, "step": 340 }, { "entropy": 7.266809701919556, "epoch": 0.007708894276425307, "grad_norm": 1.671875, "learning_rate": 0.00017199999999999998, "loss": 6.8566, "mean_token_accuracy": 0.11106687858700752, "num_tokens": 291409.0, "step": 345 }, { "entropy": 7.351815128326416, "epoch": 0.007820617381880746, "grad_norm": 1.640625, "learning_rate": 0.00017449999999999999, "loss": 6.9102, "mean_token_accuracy": 0.10942614153027534, "num_tokens": 295157.0, "step": 350 }, { "entropy": 7.481018209457398, "epoch": 0.007932340487336187, "grad_norm": 1.9765625, "learning_rate": 0.000177, "loss": 6.9203, "mean_token_accuracy": 0.10715582817792893, "num_tokens": 299370.0, "step": 355 }, { "entropy": 7.2193928241729735, "epoch": 0.008044063592791625, "grad_norm": 1.765625, "learning_rate": 0.0001795, "loss": 6.9256, "mean_token_accuracy": 0.11601178944110871, "num_tokens": 303955.0, "step": 360 }, { "entropy": 7.46614179611206, "epoch": 0.008155786698247064, "grad_norm": 2.28125, "learning_rate": 0.000182, "loss": 6.8992, "mean_token_accuracy": 0.11738249063491821, "num_tokens": 308047.0, "step": 365 }, { "entropy": 7.339001560211182, "epoch": 0.008267509803702503, "grad_norm": 1.8359375, "learning_rate": 0.0001845, "loss": 6.8353, "mean_token_accuracy": 0.12007508799433708, "num_tokens": 312050.0, "step": 370 }, { "entropy": 7.393199253082275, "epoch": 0.008379232909157944, "grad_norm": 1.6015625, "learning_rate": 0.000187, "loss": 6.789, "mean_token_accuracy": 0.11748188808560371, "num_tokens": 315901.0, "step": 375 }, { "entropy": 7.206725311279297, "epoch": 0.008490956014613383, "grad_norm": 1.5390625, "learning_rate": 0.0001895, "loss": 6.8387, "mean_token_accuracy": 0.11932774782180786, "num_tokens": 320077.0, "step": 380 }, { "entropy": 7.309018516540528, "epoch": 0.008602679120068821, "grad_norm": 1.859375, "learning_rate": 0.000192, "loss": 6.7772, "mean_token_accuracy": 0.12389342486858368, "num_tokens": 324365.0, "step": 385 }, { "entropy": 7.1502117156982425, "epoch": 0.00871440222552426, "grad_norm": 1.7421875, "learning_rate": 0.0001945, "loss": 6.7342, "mean_token_accuracy": 0.12538171485066413, "num_tokens": 327971.0, "step": 390 }, { "entropy": 7.207239198684692, "epoch": 0.0088261253309797, "grad_norm": 1.8046875, "learning_rate": 0.00019700000000000002, "loss": 6.7814, "mean_token_accuracy": 0.12070702090859413, "num_tokens": 331791.0, "step": 395 }, { "entropy": 7.188077354431153, "epoch": 0.00893784843643514, "grad_norm": 1.7265625, "learning_rate": 0.00019950000000000002, "loss": 6.8347, "mean_token_accuracy": 0.11772776916623115, "num_tokens": 335616.0, "step": 400 }, { "entropy": 7.238067245483398, "epoch": 0.009049571541890579, "grad_norm": 1.5, "learning_rate": 0.000202, "loss": 6.7448, "mean_token_accuracy": 0.12914832159876824, "num_tokens": 339815.0, "step": 405 }, { "entropy": 7.271863889694214, "epoch": 0.009161294647346017, "grad_norm": 1.6875, "learning_rate": 0.00020449999999999998, "loss": 6.7314, "mean_token_accuracy": 0.12098882421851158, "num_tokens": 344045.0, "step": 410 }, { "entropy": 7.054260921478272, "epoch": 0.009273017752801456, "grad_norm": 1.9296875, "learning_rate": 0.000207, "loss": 6.8258, "mean_token_accuracy": 0.12370770499110222, "num_tokens": 348726.0, "step": 415 }, { "entropy": 7.25892219543457, "epoch": 0.009384740858256897, "grad_norm": 1.609375, "learning_rate": 0.0002095, "loss": 6.811, "mean_token_accuracy": 0.12439991980791092, "num_tokens": 353228.0, "step": 420 }, { "entropy": 7.089362478256225, "epoch": 0.009496463963712336, "grad_norm": 1.65625, "learning_rate": 0.000212, "loss": 6.7731, "mean_token_accuracy": 0.12979045361280442, "num_tokens": 357379.0, "step": 425 }, { "entropy": 7.264574861526489, "epoch": 0.009608187069167775, "grad_norm": 2.015625, "learning_rate": 0.0002145, "loss": 6.7426, "mean_token_accuracy": 0.11879147663712501, "num_tokens": 361347.0, "step": 430 }, { "entropy": 7.1300811767578125, "epoch": 0.009719910174623213, "grad_norm": 1.7265625, "learning_rate": 0.00021700000000000002, "loss": 6.7019, "mean_token_accuracy": 0.12289151027798653, "num_tokens": 365364.0, "step": 435 }, { "entropy": 7.1097527027130125, "epoch": 0.009831633280078652, "grad_norm": 1.6171875, "learning_rate": 0.0002195, "loss": 6.7534, "mean_token_accuracy": 0.12068467438220978, "num_tokens": 369648.0, "step": 440 }, { "entropy": 7.229344892501831, "epoch": 0.009943356385534093, "grad_norm": 1.578125, "learning_rate": 0.000222, "loss": 6.7309, "mean_token_accuracy": 0.12263526245951653, "num_tokens": 373734.0, "step": 445 }, { "entropy": 7.1849524021148685, "epoch": 0.010055079490989532, "grad_norm": 1.765625, "learning_rate": 0.0002245, "loss": 6.7276, "mean_token_accuracy": 0.12742977142333983, "num_tokens": 378184.0, "step": 450 }, { "entropy": 7.064081621170044, "epoch": 0.01016680259644497, "grad_norm": 1.546875, "learning_rate": 0.00022700000000000002, "loss": 6.8377, "mean_token_accuracy": 0.12056938409805298, "num_tokens": 382686.0, "step": 455 }, { "entropy": 7.035848474502563, "epoch": 0.01027852570190041, "grad_norm": 1.84375, "learning_rate": 0.00022950000000000002, "loss": 6.7467, "mean_token_accuracy": 0.13145566657185553, "num_tokens": 387210.0, "step": 460 }, { "entropy": 7.06201696395874, "epoch": 0.01039024880735585, "grad_norm": 1.734375, "learning_rate": 0.00023200000000000003, "loss": 6.7263, "mean_token_accuracy": 0.12420300841331482, "num_tokens": 391247.0, "step": 465 }, { "entropy": 7.2231800079345705, "epoch": 0.010501971912811289, "grad_norm": 1.8125, "learning_rate": 0.00023449999999999998, "loss": 6.6101, "mean_token_accuracy": 0.12484818920493126, "num_tokens": 395188.0, "step": 470 }, { "entropy": 6.963715267181397, "epoch": 0.010613695018266728, "grad_norm": 1.7734375, "learning_rate": 0.000237, "loss": 6.6759, "mean_token_accuracy": 0.1323227606713772, "num_tokens": 399513.0, "step": 475 }, { "entropy": 7.180826234817505, "epoch": 0.010725418123722167, "grad_norm": 1.6875, "learning_rate": 0.0002395, "loss": 6.7397, "mean_token_accuracy": 0.1241152174770832, "num_tokens": 404052.0, "step": 480 }, { "entropy": 7.000790357589722, "epoch": 0.010837141229177606, "grad_norm": 1.6875, "learning_rate": 0.000242, "loss": 6.6031, "mean_token_accuracy": 0.13010914325714112, "num_tokens": 408299.0, "step": 485 }, { "entropy": 6.951791143417358, "epoch": 0.010948864334633046, "grad_norm": 1.890625, "learning_rate": 0.0002445, "loss": 6.597, "mean_token_accuracy": 0.13655143678188325, "num_tokens": 412376.0, "step": 490 }, { "entropy": 6.940329837799072, "epoch": 0.011060587440088485, "grad_norm": 1.5, "learning_rate": 0.000247, "loss": 6.6731, "mean_token_accuracy": 0.13289386332035064, "num_tokens": 417010.0, "step": 495 }, { "entropy": 7.088097476959229, "epoch": 0.011172310545543924, "grad_norm": 1.796875, "learning_rate": 0.0002495, "loss": 6.5194, "mean_token_accuracy": 0.14706601724028587, "num_tokens": 421167.0, "step": 500 }, { "entropy": 6.922516012191773, "epoch": 0.011284033650999363, "grad_norm": 1.703125, "learning_rate": 0.000252, "loss": 6.6178, "mean_token_accuracy": 0.13619204014539718, "num_tokens": 425942.0, "step": 505 }, { "entropy": 7.03532772064209, "epoch": 0.011395756756454803, "grad_norm": 1.578125, "learning_rate": 0.0002545, "loss": 6.6648, "mean_token_accuracy": 0.13011146634817122, "num_tokens": 430529.0, "step": 510 }, { "entropy": 6.945074939727784, "epoch": 0.011507479861910242, "grad_norm": 1.828125, "learning_rate": 0.000257, "loss": 6.5181, "mean_token_accuracy": 0.12947220131754875, "num_tokens": 434464.0, "step": 515 }, { "entropy": 6.959482002258301, "epoch": 0.011619202967365681, "grad_norm": 1.7421875, "learning_rate": 0.0002595, "loss": 6.6253, "mean_token_accuracy": 0.13869500905275345, "num_tokens": 438763.0, "step": 520 }, { "entropy": 6.914068031311035, "epoch": 0.01173092607282112, "grad_norm": 1.6875, "learning_rate": 0.000262, "loss": 6.5756, "mean_token_accuracy": 0.1341098003089428, "num_tokens": 442945.0, "step": 525 }, { "entropy": 7.105465316772461, "epoch": 0.011842649178276559, "grad_norm": 1.671875, "learning_rate": 0.00026450000000000003, "loss": 6.6796, "mean_token_accuracy": 0.12466075941920281, "num_tokens": 447301.0, "step": 530 }, { "entropy": 6.853219223022461, "epoch": 0.011954372283732, "grad_norm": 1.671875, "learning_rate": 0.00026700000000000004, "loss": 6.5349, "mean_token_accuracy": 0.13604073524475097, "num_tokens": 451365.0, "step": 535 }, { "entropy": 6.9650640964508055, "epoch": 0.012066095389187438, "grad_norm": 1.7734375, "learning_rate": 0.00026950000000000005, "loss": 6.5806, "mean_token_accuracy": 0.13407194539904593, "num_tokens": 455469.0, "step": 540 }, { "entropy": 6.94967565536499, "epoch": 0.012177818494642877, "grad_norm": 1.53125, "learning_rate": 0.00027200000000000005, "loss": 6.6521, "mean_token_accuracy": 0.13110672906041146, "num_tokens": 459641.0, "step": 545 }, { "entropy": 6.912797451019287, "epoch": 0.012289541600098316, "grad_norm": 1.6796875, "learning_rate": 0.0002745, "loss": 6.5912, "mean_token_accuracy": 0.1325491264462471, "num_tokens": 463866.0, "step": 550 }, { "entropy": 6.911716938018799, "epoch": 0.012401264705553756, "grad_norm": 1.921875, "learning_rate": 0.000277, "loss": 6.4776, "mean_token_accuracy": 0.1369607262313366, "num_tokens": 467692.0, "step": 555 }, { "entropy": 6.93188853263855, "epoch": 0.012512987811009195, "grad_norm": 1.84375, "learning_rate": 0.0002795, "loss": 6.611, "mean_token_accuracy": 0.1433392733335495, "num_tokens": 471719.0, "step": 560 }, { "entropy": 6.887971878051758, "epoch": 0.012624710916464634, "grad_norm": 1.6015625, "learning_rate": 0.00028199999999999997, "loss": 6.5399, "mean_token_accuracy": 0.13064411506056786, "num_tokens": 475978.0, "step": 565 }, { "entropy": 6.961443710327148, "epoch": 0.012736434021920073, "grad_norm": 1.6171875, "learning_rate": 0.0002845, "loss": 6.6299, "mean_token_accuracy": 0.1282844863831997, "num_tokens": 480538.0, "step": 570 }, { "entropy": 6.9848442554473875, "epoch": 0.012848157127375512, "grad_norm": 1.75, "learning_rate": 0.000287, "loss": 6.5282, "mean_token_accuracy": 0.13599977716803552, "num_tokens": 484604.0, "step": 575 }, { "entropy": 6.9366988182067875, "epoch": 0.012959880232830952, "grad_norm": 1.4140625, "learning_rate": 0.0002895, "loss": 6.5757, "mean_token_accuracy": 0.12946860045194625, "num_tokens": 489117.0, "step": 580 }, { "entropy": 6.9284679889678955, "epoch": 0.013071603338286391, "grad_norm": 1.90625, "learning_rate": 0.000292, "loss": 6.454, "mean_token_accuracy": 0.13936082720756532, "num_tokens": 493020.0, "step": 585 }, { "entropy": 6.81143798828125, "epoch": 0.01318332644374183, "grad_norm": 1.765625, "learning_rate": 0.0002945, "loss": 6.6045, "mean_token_accuracy": 0.1356659173965454, "num_tokens": 497224.0, "step": 590 }, { "entropy": 6.871704006195069, "epoch": 0.013295049549197269, "grad_norm": 1.640625, "learning_rate": 0.000297, "loss": 6.5519, "mean_token_accuracy": 0.1327143579721451, "num_tokens": 501323.0, "step": 595 }, { "entropy": 6.897035217285156, "epoch": 0.013406772654652708, "grad_norm": 1.765625, "learning_rate": 0.0002995, "loss": 6.6141, "mean_token_accuracy": 0.13350649401545525, "num_tokens": 505544.0, "step": 600 }, { "entropy": 6.890090608596802, "epoch": 0.013518495760108148, "grad_norm": 1.6796875, "learning_rate": 0.000302, "loss": 6.5533, "mean_token_accuracy": 0.13723233789205552, "num_tokens": 509980.0, "step": 605 }, { "entropy": 6.711225366592407, "epoch": 0.013630218865563587, "grad_norm": 1.7265625, "learning_rate": 0.0003045, "loss": 6.4153, "mean_token_accuracy": 0.14487348720431328, "num_tokens": 514264.0, "step": 610 }, { "entropy": 6.843616533279419, "epoch": 0.013741941971019026, "grad_norm": 1.8359375, "learning_rate": 0.000307, "loss": 6.498, "mean_token_accuracy": 0.13974266350269318, "num_tokens": 518482.0, "step": 615 }, { "entropy": 6.874301528930664, "epoch": 0.013853665076474465, "grad_norm": 1.65625, "learning_rate": 0.0003095, "loss": 6.5465, "mean_token_accuracy": 0.13032930791378022, "num_tokens": 522765.0, "step": 620 }, { "entropy": 6.749671411514282, "epoch": 0.013965388181929906, "grad_norm": 1.375, "learning_rate": 0.000312, "loss": 6.369, "mean_token_accuracy": 0.14341583847999573, "num_tokens": 526794.0, "step": 625 }, { "entropy": 6.787525320053101, "epoch": 0.014077111287385344, "grad_norm": 1.640625, "learning_rate": 0.0003145, "loss": 6.528, "mean_token_accuracy": 0.14095058366656305, "num_tokens": 531070.0, "step": 630 }, { "entropy": 6.8752782344818115, "epoch": 0.014188834392840783, "grad_norm": 1.4375, "learning_rate": 0.000317, "loss": 6.5556, "mean_token_accuracy": 0.1387290321290493, "num_tokens": 535655.0, "step": 635 }, { "entropy": 6.793731594085694, "epoch": 0.014300557498296222, "grad_norm": 1.4296875, "learning_rate": 0.0003195, "loss": 6.5852, "mean_token_accuracy": 0.13649069741368294, "num_tokens": 540231.0, "step": 640 }, { "entropy": 6.764686965942383, "epoch": 0.014412280603751661, "grad_norm": 1.609375, "learning_rate": 0.000322, "loss": 6.4429, "mean_token_accuracy": 0.14507341384887695, "num_tokens": 544180.0, "step": 645 }, { "entropy": 6.750355339050293, "epoch": 0.014524003709207102, "grad_norm": 1.703125, "learning_rate": 0.00032450000000000003, "loss": 6.413, "mean_token_accuracy": 0.14032018259167672, "num_tokens": 547905.0, "step": 650 }, { "entropy": 6.633134460449218, "epoch": 0.01463572681466254, "grad_norm": 1.515625, "learning_rate": 0.00032700000000000003, "loss": 6.4971, "mean_token_accuracy": 0.14342024102807044, "num_tokens": 552248.0, "step": 655 }, { "entropy": 6.69278130531311, "epoch": 0.01474744992011798, "grad_norm": 1.8671875, "learning_rate": 0.00032950000000000004, "loss": 6.3103, "mean_token_accuracy": 0.15002134442329407, "num_tokens": 556430.0, "step": 660 }, { "entropy": 6.606019735336304, "epoch": 0.014859173025573418, "grad_norm": 1.796875, "learning_rate": 0.00033200000000000005, "loss": 6.4126, "mean_token_accuracy": 0.14947109222412108, "num_tokens": 560114.0, "step": 665 }, { "entropy": 6.456874704360962, "epoch": 0.014970896131028859, "grad_norm": 1.484375, "learning_rate": 0.00033450000000000005, "loss": 6.432, "mean_token_accuracy": 0.1395042322576046, "num_tokens": 564624.0, "step": 670 }, { "entropy": 6.712696886062622, "epoch": 0.015082619236484298, "grad_norm": 1.7265625, "learning_rate": 0.000337, "loss": 6.3378, "mean_token_accuracy": 0.1465103656053543, "num_tokens": 568918.0, "step": 675 }, { "entropy": 6.637308168411255, "epoch": 0.015194342341939737, "grad_norm": 1.6171875, "learning_rate": 0.0003395, "loss": 6.4062, "mean_token_accuracy": 0.14732098281383516, "num_tokens": 572972.0, "step": 680 }, { "entropy": 6.601571273803711, "epoch": 0.015306065447395175, "grad_norm": 1.65625, "learning_rate": 0.000342, "loss": 6.4433, "mean_token_accuracy": 0.150725756585598, "num_tokens": 577250.0, "step": 685 }, { "entropy": 6.742843151092529, "epoch": 0.015417788552850614, "grad_norm": 1.46875, "learning_rate": 0.00034449999999999997, "loss": 6.343, "mean_token_accuracy": 0.14816580414772035, "num_tokens": 581418.0, "step": 690 }, { "entropy": 6.67585711479187, "epoch": 0.015529511658306055, "grad_norm": 1.796875, "learning_rate": 0.000347, "loss": 6.4489, "mean_token_accuracy": 0.14566415771842003, "num_tokens": 585675.0, "step": 695 }, { "entropy": 6.479352045059204, "epoch": 0.015641234763761492, "grad_norm": 1.6640625, "learning_rate": 0.0003495, "loss": 6.35, "mean_token_accuracy": 0.1425018362700939, "num_tokens": 590032.0, "step": 700 }, { "entropy": 6.537110137939453, "epoch": 0.015752957869216933, "grad_norm": 1.7578125, "learning_rate": 0.000352, "loss": 6.3371, "mean_token_accuracy": 0.15346041396260263, "num_tokens": 594185.0, "step": 705 }, { "entropy": 6.561723518371582, "epoch": 0.015864680974672373, "grad_norm": 1.609375, "learning_rate": 0.0003545, "loss": 6.2759, "mean_token_accuracy": 0.15528617724776267, "num_tokens": 598246.0, "step": 710 }, { "entropy": 6.575086498260498, "epoch": 0.01597640408012781, "grad_norm": 1.609375, "learning_rate": 0.000357, "loss": 6.4107, "mean_token_accuracy": 0.14987436532974244, "num_tokens": 602676.0, "step": 715 }, { "entropy": 6.5285728931427, "epoch": 0.01608812718558325, "grad_norm": 1.6171875, "learning_rate": 0.0003595, "loss": 6.2682, "mean_token_accuracy": 0.15596837252378465, "num_tokens": 606693.0, "step": 720 }, { "entropy": 6.538558626174927, "epoch": 0.01619985029103869, "grad_norm": 1.5859375, "learning_rate": 0.000362, "loss": 6.3284, "mean_token_accuracy": 0.13880535289645196, "num_tokens": 610780.0, "step": 725 }, { "entropy": 6.484487867355346, "epoch": 0.01631157339649413, "grad_norm": 1.640625, "learning_rate": 0.0003645, "loss": 6.365, "mean_token_accuracy": 0.148425579816103, "num_tokens": 614746.0, "step": 730 }, { "entropy": 6.57484130859375, "epoch": 0.01642329650194957, "grad_norm": 1.4296875, "learning_rate": 0.000367, "loss": 6.3217, "mean_token_accuracy": 0.1501600444316864, "num_tokens": 619222.0, "step": 735 }, { "entropy": 6.699773979187012, "epoch": 0.016535019607405006, "grad_norm": 1.453125, "learning_rate": 0.0003695, "loss": 6.4575, "mean_token_accuracy": 0.1470234327018261, "num_tokens": 623746.0, "step": 740 }, { "entropy": 6.542045211791992, "epoch": 0.016646742712860447, "grad_norm": 1.390625, "learning_rate": 0.000372, "loss": 6.3108, "mean_token_accuracy": 0.15406130626797676, "num_tokens": 628392.0, "step": 745 }, { "entropy": 6.443634414672852, "epoch": 0.016758465818315887, "grad_norm": 1.5859375, "learning_rate": 0.0003745, "loss": 6.3252, "mean_token_accuracy": 0.1483919471502304, "num_tokens": 632439.0, "step": 750 }, { "entropy": 6.462843322753907, "epoch": 0.016870188923771325, "grad_norm": 1.40625, "learning_rate": 0.000377, "loss": 6.3639, "mean_token_accuracy": 0.14475394636392594, "num_tokens": 636801.0, "step": 755 }, { "entropy": 6.5299022674560545, "epoch": 0.016981912029226765, "grad_norm": 1.71875, "learning_rate": 0.0003795, "loss": 6.1376, "mean_token_accuracy": 0.16324445307254792, "num_tokens": 640818.0, "step": 760 }, { "entropy": 6.448936939239502, "epoch": 0.017093635134682202, "grad_norm": 1.546875, "learning_rate": 0.000382, "loss": 6.3332, "mean_token_accuracy": 0.1428905963897705, "num_tokens": 644914.0, "step": 765 }, { "entropy": 6.681206798553466, "epoch": 0.017205358240137643, "grad_norm": 1.46875, "learning_rate": 0.0003845, "loss": 6.4011, "mean_token_accuracy": 0.1510247729718685, "num_tokens": 649368.0, "step": 770 }, { "entropy": 6.323616456985474, "epoch": 0.017317081345593083, "grad_norm": 1.6796875, "learning_rate": 0.00038700000000000003, "loss": 6.2719, "mean_token_accuracy": 0.1547230713069439, "num_tokens": 653537.0, "step": 775 }, { "entropy": 6.604541254043579, "epoch": 0.01742880445104852, "grad_norm": 1.625, "learning_rate": 0.00038950000000000003, "loss": 6.3935, "mean_token_accuracy": 0.1366790473461151, "num_tokens": 658232.0, "step": 780 }, { "entropy": 6.442852210998535, "epoch": 0.01754052755650396, "grad_norm": 1.5, "learning_rate": 0.00039200000000000004, "loss": 6.3431, "mean_token_accuracy": 0.1412769600749016, "num_tokens": 662512.0, "step": 785 }, { "entropy": 6.617573547363281, "epoch": 0.0176522506619594, "grad_norm": 1.4296875, "learning_rate": 0.00039450000000000005, "loss": 6.317, "mean_token_accuracy": 0.15297196432948112, "num_tokens": 666759.0, "step": 790 }, { "entropy": 6.2801289558410645, "epoch": 0.01776397376741484, "grad_norm": 1.4921875, "learning_rate": 0.00039700000000000005, "loss": 6.2359, "mean_token_accuracy": 0.15913384407758713, "num_tokens": 670870.0, "step": 795 }, { "entropy": 6.4234747886657715, "epoch": 0.01787569687287028, "grad_norm": 1.5859375, "learning_rate": 0.0003995, "loss": 6.2002, "mean_token_accuracy": 0.15476782992482185, "num_tokens": 675150.0, "step": 800 }, { "entropy": 6.242582082748413, "epoch": 0.017987419978325717, "grad_norm": 1.6953125, "learning_rate": 0.000402, "loss": 6.1478, "mean_token_accuracy": 0.16312235742807388, "num_tokens": 679083.0, "step": 805 }, { "entropy": 6.390512132644654, "epoch": 0.018099143083781157, "grad_norm": 1.515625, "learning_rate": 0.0004045, "loss": 6.3339, "mean_token_accuracy": 0.14840762168169022, "num_tokens": 683477.0, "step": 810 }, { "entropy": 6.346619319915772, "epoch": 0.018210866189236594, "grad_norm": 1.515625, "learning_rate": 0.00040699999999999997, "loss": 6.1433, "mean_token_accuracy": 0.15934223383665086, "num_tokens": 687819.0, "step": 815 }, { "entropy": 6.47499303817749, "epoch": 0.018322589294692035, "grad_norm": 1.4296875, "learning_rate": 0.0004095, "loss": 6.3563, "mean_token_accuracy": 0.15130842924118043, "num_tokens": 692017.0, "step": 820 }, { "entropy": 6.57763991355896, "epoch": 0.018434312400147475, "grad_norm": 1.4609375, "learning_rate": 0.000412, "loss": 6.3471, "mean_token_accuracy": 0.1486021101474762, "num_tokens": 696853.0, "step": 825 }, { "entropy": 6.5021766185760494, "epoch": 0.018546035505602913, "grad_norm": 1.4375, "learning_rate": 0.0004145, "loss": 6.4022, "mean_token_accuracy": 0.13754147440195083, "num_tokens": 701131.0, "step": 830 }, { "entropy": 6.329108572006225, "epoch": 0.018657758611058353, "grad_norm": 1.7109375, "learning_rate": 0.000417, "loss": 6.3438, "mean_token_accuracy": 0.14031846597790718, "num_tokens": 705428.0, "step": 835 }, { "entropy": 6.359441089630127, "epoch": 0.018769481716513794, "grad_norm": 1.421875, "learning_rate": 0.0004195, "loss": 6.1931, "mean_token_accuracy": 0.16036254167556763, "num_tokens": 709760.0, "step": 840 }, { "entropy": 6.268203020095825, "epoch": 0.01888120482196923, "grad_norm": 1.4453125, "learning_rate": 0.000422, "loss": 6.1527, "mean_token_accuracy": 0.16414240151643752, "num_tokens": 713964.0, "step": 845 }, { "entropy": 6.395886707305908, "epoch": 0.01899292792742467, "grad_norm": 1.5625, "learning_rate": 0.0004245, "loss": 6.3232, "mean_token_accuracy": 0.15316279977560043, "num_tokens": 718305.0, "step": 850 }, { "entropy": 6.378367567062378, "epoch": 0.01910465103288011, "grad_norm": 1.546875, "learning_rate": 0.000427, "loss": 6.2283, "mean_token_accuracy": 0.15503655076026918, "num_tokens": 722705.0, "step": 855 }, { "entropy": 6.2019463062286375, "epoch": 0.01921637413833555, "grad_norm": 1.5, "learning_rate": 0.0004295, "loss": 6.1186, "mean_token_accuracy": 0.16495653316378595, "num_tokens": 726529.0, "step": 860 }, { "entropy": 6.353125715255738, "epoch": 0.01932809724379099, "grad_norm": 1.5234375, "learning_rate": 0.000432, "loss": 6.2228, "mean_token_accuracy": 0.15027105957269668, "num_tokens": 730535.0, "step": 865 }, { "entropy": 6.341917848587036, "epoch": 0.019439820349246427, "grad_norm": 1.40625, "learning_rate": 0.0004345, "loss": 6.1982, "mean_token_accuracy": 0.15795509219169618, "num_tokens": 734836.0, "step": 870 }, { "entropy": 6.281454563140869, "epoch": 0.019551543454701868, "grad_norm": 1.5, "learning_rate": 0.000437, "loss": 6.2734, "mean_token_accuracy": 0.15110851228237152, "num_tokens": 739176.0, "step": 875 }, { "entropy": 6.2023228168487545, "epoch": 0.019663266560157305, "grad_norm": 1.5546875, "learning_rate": 0.0004395, "loss": 6.2473, "mean_token_accuracy": 0.15088646113872528, "num_tokens": 743497.0, "step": 880 }, { "entropy": 6.359633541107177, "epoch": 0.019774989665612745, "grad_norm": 1.515625, "learning_rate": 0.000442, "loss": 6.2555, "mean_token_accuracy": 0.15800251960754394, "num_tokens": 747185.0, "step": 885 }, { "entropy": 6.299527931213379, "epoch": 0.019886712771068186, "grad_norm": 1.5234375, "learning_rate": 0.0004445, "loss": 6.3705, "mean_token_accuracy": 0.1479213811457157, "num_tokens": 751345.0, "step": 890 }, { "entropy": 6.348771095275879, "epoch": 0.019998435876523623, "grad_norm": 1.5234375, "learning_rate": 0.000447, "loss": 6.2641, "mean_token_accuracy": 0.1576582223176956, "num_tokens": 755618.0, "step": 895 }, { "entropy": 6.318030929565429, "epoch": 0.020110158981979064, "grad_norm": 1.515625, "learning_rate": 0.00044950000000000003, "loss": 6.2539, "mean_token_accuracy": 0.15391020849347115, "num_tokens": 759583.0, "step": 900 }, { "entropy": 6.339395999908447, "epoch": 0.0202218820874345, "grad_norm": 1.5625, "learning_rate": 0.00045200000000000004, "loss": 6.1856, "mean_token_accuracy": 0.16274880915880202, "num_tokens": 763861.0, "step": 905 }, { "entropy": 6.222519493103027, "epoch": 0.02033360519288994, "grad_norm": 1.4609375, "learning_rate": 0.00045450000000000004, "loss": 6.1597, "mean_token_accuracy": 0.16332034766674042, "num_tokens": 768046.0, "step": 910 }, { "entropy": 6.363137149810791, "epoch": 0.020445328298345382, "grad_norm": 1.5234375, "learning_rate": 0.00045700000000000005, "loss": 6.1448, "mean_token_accuracy": 0.15950068086385727, "num_tokens": 772570.0, "step": 915 }, { "entropy": 6.369995403289795, "epoch": 0.02055705140380082, "grad_norm": 1.421875, "learning_rate": 0.00045950000000000006, "loss": 6.2981, "mean_token_accuracy": 0.1562412589788437, "num_tokens": 777324.0, "step": 920 }, { "entropy": 6.437484455108643, "epoch": 0.02066877450925626, "grad_norm": 1.3125, "learning_rate": 0.000462, "loss": 6.273, "mean_token_accuracy": 0.14749887958168983, "num_tokens": 781829.0, "step": 925 }, { "entropy": 6.290871667861938, "epoch": 0.0207804976147117, "grad_norm": 1.34375, "learning_rate": 0.0004645, "loss": 6.139, "mean_token_accuracy": 0.15945375710725784, "num_tokens": 786089.0, "step": 930 }, { "entropy": 6.188903331756592, "epoch": 0.020892220720167137, "grad_norm": 1.3359375, "learning_rate": 0.000467, "loss": 6.135, "mean_token_accuracy": 0.16696064472198485, "num_tokens": 790273.0, "step": 935 }, { "entropy": 6.331109428405762, "epoch": 0.021003943825622578, "grad_norm": 1.3828125, "learning_rate": 0.0004695, "loss": 6.1418, "mean_token_accuracy": 0.16708167791366577, "num_tokens": 794600.0, "step": 940 }, { "entropy": 6.217516183853149, "epoch": 0.021115666931078015, "grad_norm": 1.5390625, "learning_rate": 0.000472, "loss": 6.1176, "mean_token_accuracy": 0.1658843532204628, "num_tokens": 798756.0, "step": 945 }, { "entropy": 6.395580863952636, "epoch": 0.021227390036533456, "grad_norm": 1.4453125, "learning_rate": 0.0004745, "loss": 6.1259, "mean_token_accuracy": 0.16052196100354194, "num_tokens": 803122.0, "step": 950 }, { "entropy": 6.081810760498047, "epoch": 0.021339113141988896, "grad_norm": 1.625, "learning_rate": 0.000477, "loss": 6.164, "mean_token_accuracy": 0.16162788346409798, "num_tokens": 807393.0, "step": 955 }, { "entropy": 6.248359203338623, "epoch": 0.021450836247444333, "grad_norm": 1.5078125, "learning_rate": 0.0004795, "loss": 6.1023, "mean_token_accuracy": 0.16735041439533233, "num_tokens": 811735.0, "step": 960 }, { "entropy": 6.347312164306641, "epoch": 0.021562559352899774, "grad_norm": 1.40625, "learning_rate": 0.000482, "loss": 6.309, "mean_token_accuracy": 0.15177485793828965, "num_tokens": 816327.0, "step": 965 }, { "entropy": 6.2607207775115965, "epoch": 0.02167428245835521, "grad_norm": 1.5546875, "learning_rate": 0.0004845, "loss": 6.0873, "mean_token_accuracy": 0.16931966543197632, "num_tokens": 820476.0, "step": 970 }, { "entropy": 6.144009685516357, "epoch": 0.02178600556381065, "grad_norm": 1.4375, "learning_rate": 0.000487, "loss": 6.1081, "mean_token_accuracy": 0.16204737722873688, "num_tokens": 824563.0, "step": 975 }, { "entropy": 6.143129920959472, "epoch": 0.021897728669266092, "grad_norm": 1.3046875, "learning_rate": 0.0004895, "loss": 6.2294, "mean_token_accuracy": 0.15659647509455682, "num_tokens": 829307.0, "step": 980 }, { "entropy": 6.235242652893066, "epoch": 0.02200945177472153, "grad_norm": 1.4140625, "learning_rate": 0.000492, "loss": 6.2047, "mean_token_accuracy": 0.15783022493124008, "num_tokens": 833876.0, "step": 985 }, { "entropy": 6.273316383361816, "epoch": 0.02212117488017697, "grad_norm": 1.4296875, "learning_rate": 0.0004945, "loss": 6.2855, "mean_token_accuracy": 0.15405729338526725, "num_tokens": 838484.0, "step": 990 }, { "entropy": 6.237334489822388, "epoch": 0.022232897985632407, "grad_norm": 1.46875, "learning_rate": 0.000497, "loss": 6.1138, "mean_token_accuracy": 0.15904016494750978, "num_tokens": 842813.0, "step": 995 }, { "entropy": 6.182960510253906, "epoch": 0.022344621091087848, "grad_norm": 1.671875, "learning_rate": 0.0004995, "loss": 6.0759, "mean_token_accuracy": 0.16501354575157165, "num_tokens": 846638.0, "step": 1000 }, { "entropy": 6.176758861541748, "epoch": 0.022456344196543288, "grad_norm": 1.59375, "learning_rate": 0.000499998026082006, "loss": 6.0475, "mean_token_accuracy": 0.1734422266483307, "num_tokens": 850577.0, "step": 1005 }, { "entropy": 6.231747055053711, "epoch": 0.022568067301998725, "grad_norm": 1.359375, "learning_rate": 0.0004999900070995136, "loss": 6.0858, "mean_token_accuracy": 0.16294893622398376, "num_tokens": 854904.0, "step": 1010 }, { "entropy": 6.121539163589477, "epoch": 0.022679790407454166, "grad_norm": 1.4609375, "learning_rate": 0.0004999758199023239, "loss": 6.081, "mean_token_accuracy": 0.16951507180929185, "num_tokens": 858859.0, "step": 1015 }, { "entropy": 6.083382177352905, "epoch": 0.022791513512909607, "grad_norm": 1.515625, "learning_rate": 0.0004999554648793858, "loss": 6.0267, "mean_token_accuracy": 0.17120128124952316, "num_tokens": 863121.0, "step": 1020 }, { "entropy": 6.1603466987609865, "epoch": 0.022903236618365044, "grad_norm": 1.4921875, "learning_rate": 0.0004999289425887425, "loss": 6.1551, "mean_token_accuracy": 0.15693418234586715, "num_tokens": 867805.0, "step": 1025 }, { "entropy": 6.104901504516602, "epoch": 0.023014959723820484, "grad_norm": 1.3125, "learning_rate": 0.0004998962537575161, "loss": 6.1175, "mean_token_accuracy": 0.15979633256793022, "num_tokens": 871988.0, "step": 1030 }, { "entropy": 6.240704679489136, "epoch": 0.02312668282927592, "grad_norm": 1.4453125, "learning_rate": 0.0004998573992818874, "loss": 6.0985, "mean_token_accuracy": 0.15933127254247664, "num_tokens": 876181.0, "step": 1035 }, { "entropy": 5.971805095672607, "epoch": 0.023238405934731362, "grad_norm": 1.9765625, "learning_rate": 0.0004998123802270715, "loss": 5.9561, "mean_token_accuracy": 0.178880412876606, "num_tokens": 880521.0, "step": 1040 }, { "entropy": 5.992498254776001, "epoch": 0.023350129040186803, "grad_norm": 1.4140625, "learning_rate": 0.0004997611978272886, "loss": 6.0967, "mean_token_accuracy": 0.16714801341295243, "num_tokens": 885006.0, "step": 1045 }, { "entropy": 6.120235300064087, "epoch": 0.02346185214564224, "grad_norm": 1.40625, "learning_rate": 0.0004997038534857298, "loss": 6.0853, "mean_token_accuracy": 0.16448681205511093, "num_tokens": 889184.0, "step": 1050 }, { "entropy": 6.119455003738404, "epoch": 0.02357357525109768, "grad_norm": 1.546875, "learning_rate": 0.0004996403487745194, "loss": 6.0012, "mean_token_accuracy": 0.17143121510744094, "num_tokens": 893806.0, "step": 1055 }, { "entropy": 6.055149364471435, "epoch": 0.023685298356553117, "grad_norm": 1.4609375, "learning_rate": 0.000499570685434671, "loss": 6.0071, "mean_token_accuracy": 0.16834600120782853, "num_tokens": 897578.0, "step": 1060 }, { "entropy": 6.227984523773193, "epoch": 0.023797021462008558, "grad_norm": 1.4375, "learning_rate": 0.0004994948653760405, "loss": 6.2897, "mean_token_accuracy": 0.15649080276489258, "num_tokens": 902225.0, "step": 1065 }, { "entropy": 6.1664598941802975, "epoch": 0.023908744567464, "grad_norm": 1.3046875, "learning_rate": 0.0004994128906772729, "loss": 6.1097, "mean_token_accuracy": 0.16405512094497682, "num_tokens": 906477.0, "step": 1070 }, { "entropy": 6.110595417022705, "epoch": 0.024020467672919436, "grad_norm": 1.2890625, "learning_rate": 0.000499324763585746, "loss": 6.1071, "mean_token_accuracy": 0.15544368103146552, "num_tokens": 910948.0, "step": 1075 }, { "entropy": 6.197442293167114, "epoch": 0.024132190778374876, "grad_norm": 1.46875, "learning_rate": 0.0004992304865175085, "loss": 6.2299, "mean_token_accuracy": 0.1479525662958622, "num_tokens": 915157.0, "step": 1080 }, { "entropy": 6.140390396118164, "epoch": 0.024243913883830313, "grad_norm": 1.359375, "learning_rate": 0.0004991300620572138, "loss": 6.0491, "mean_token_accuracy": 0.16512299925088883, "num_tokens": 920251.0, "step": 1085 }, { "entropy": 6.003958606719971, "epoch": 0.024355636989285754, "grad_norm": 1.390625, "learning_rate": 0.0004990234929580494, "loss": 6.1163, "mean_token_accuracy": 0.15651995092630386, "num_tokens": 924510.0, "step": 1090 }, { "entropy": 6.04054217338562, "epoch": 0.024467360094741195, "grad_norm": 1.3671875, "learning_rate": 0.0004989107821416609, "loss": 6.0239, "mean_token_accuracy": 0.16540934443473815, "num_tokens": 928925.0, "step": 1095 }, { "entropy": 6.079621315002441, "epoch": 0.02457908320019663, "grad_norm": 1.3359375, "learning_rate": 0.0004987919326980723, "loss": 6.0004, "mean_token_accuracy": 0.17250575870275497, "num_tokens": 933211.0, "step": 1100 }, { "entropy": 6.115182685852051, "epoch": 0.024690806305652072, "grad_norm": 1.3984375, "learning_rate": 0.0004986669478856011, "loss": 6.1689, "mean_token_accuracy": 0.16165492981672286, "num_tokens": 937621.0, "step": 1105 }, { "entropy": 6.006317281723023, "epoch": 0.024802529411107513, "grad_norm": 1.390625, "learning_rate": 0.0004985358311307688, "loss": 6.087, "mean_token_accuracy": 0.15697798803448676, "num_tokens": 941629.0, "step": 1110 }, { "entropy": 6.04360728263855, "epoch": 0.02491425251656295, "grad_norm": 1.3984375, "learning_rate": 0.0004983985860282081, "loss": 6.0674, "mean_token_accuracy": 0.15867182463407517, "num_tokens": 945853.0, "step": 1115 }, { "entropy": 6.042965602874756, "epoch": 0.02502597562201839, "grad_norm": 1.609375, "learning_rate": 0.0004982552163405623, "loss": 5.8914, "mean_token_accuracy": 0.17837537676095963, "num_tokens": 949758.0, "step": 1120 }, { "entropy": 5.911374568939209, "epoch": 0.025137698727473828, "grad_norm": 1.4296875, "learning_rate": 0.0004981057259983839, "loss": 6.046, "mean_token_accuracy": 0.17550223916769028, "num_tokens": 954028.0, "step": 1125 }, { "entropy": 6.2100794315338135, "epoch": 0.02524942183292927, "grad_norm": 1.484375, "learning_rate": 0.0004979501191000262, "loss": 6.0439, "mean_token_accuracy": 0.1597377523779869, "num_tokens": 958006.0, "step": 1130 }, { "entropy": 5.997774934768676, "epoch": 0.02536114493838471, "grad_norm": 1.46875, "learning_rate": 0.0004977883999115311, "loss": 5.9673, "mean_token_accuracy": 0.1754068598151207, "num_tokens": 962637.0, "step": 1135 }, { "entropy": 6.133125972747803, "epoch": 0.025472868043840146, "grad_norm": 1.3203125, "learning_rate": 0.0004976205728665113, "loss": 5.9539, "mean_token_accuracy": 0.17636077851057053, "num_tokens": 966770.0, "step": 1140 }, { "entropy": 5.795867204666138, "epoch": 0.025584591149295587, "grad_norm": 1.5859375, "learning_rate": 0.0004974466425660307, "loss": 5.9624, "mean_token_accuracy": 0.17465363889932634, "num_tokens": 970976.0, "step": 1145 }, { "entropy": 6.01137866973877, "epoch": 0.025696314254751024, "grad_norm": 1.578125, "learning_rate": 0.0004972666137784759, "loss": 6.0146, "mean_token_accuracy": 0.16153744012117385, "num_tokens": 975253.0, "step": 1150 }, { "entropy": 6.057316732406616, "epoch": 0.025808037360206464, "grad_norm": 1.2734375, "learning_rate": 0.0004970804914394271, "loss": 5.9926, "mean_token_accuracy": 0.16764254570007325, "num_tokens": 979388.0, "step": 1155 }, { "entropy": 5.929347705841065, "epoch": 0.025919760465661905, "grad_norm": 1.5546875, "learning_rate": 0.0004968882806515225, "loss": 5.9724, "mean_token_accuracy": 0.1787356838583946, "num_tokens": 983216.0, "step": 1160 }, { "entropy": 6.045448160171508, "epoch": 0.026031483571117342, "grad_norm": 1.3359375, "learning_rate": 0.0004966899866843177, "loss": 6.0631, "mean_token_accuracy": 0.16194660663604737, "num_tokens": 987850.0, "step": 1165 }, { "entropy": 6.053802442550659, "epoch": 0.026143206676572783, "grad_norm": 1.34375, "learning_rate": 0.000496485614974142, "loss": 6.0138, "mean_token_accuracy": 0.16602955460548402, "num_tokens": 992232.0, "step": 1170 }, { "entropy": 6.0259240627288815, "epoch": 0.02625492978202822, "grad_norm": 1.4765625, "learning_rate": 0.0004962751711239492, "loss": 6.0693, "mean_token_accuracy": 0.16301065385341645, "num_tokens": 996428.0, "step": 1175 }, { "entropy": 6.157499313354492, "epoch": 0.02636665288748366, "grad_norm": 1.4609375, "learning_rate": 0.0004960586609031636, "loss": 5.9524, "mean_token_accuracy": 0.17110942751169206, "num_tokens": 1000336.0, "step": 1180 }, { "entropy": 6.04528169631958, "epoch": 0.0264783759929391, "grad_norm": 1.6328125, "learning_rate": 0.0004958360902475224, "loss": 5.9189, "mean_token_accuracy": 0.16904981136322023, "num_tokens": 1004312.0, "step": 1185 }, { "entropy": 6.089739894866943, "epoch": 0.026590099098394538, "grad_norm": 1.453125, "learning_rate": 0.0004956074652589125, "loss": 6.174, "mean_token_accuracy": 0.15594123005867006, "num_tokens": 1008728.0, "step": 1190 }, { "entropy": 6.1193163871765135, "epoch": 0.02670182220384998, "grad_norm": 1.3828125, "learning_rate": 0.0004953727922052035, "loss": 6.0671, "mean_token_accuracy": 0.16603883504867553, "num_tokens": 1013385.0, "step": 1195 }, { "entropy": 6.139393329620361, "epoch": 0.026813545309305416, "grad_norm": 1.359375, "learning_rate": 0.0004951320775200756, "loss": 6.0219, "mean_token_accuracy": 0.16773877292871475, "num_tokens": 1017537.0, "step": 1200 }, { "entropy": 5.894366598129272, "epoch": 0.026925268414760856, "grad_norm": 1.5, "learning_rate": 0.0004948853278028436, "loss": 5.9409, "mean_token_accuracy": 0.17285942137241364, "num_tokens": 1021753.0, "step": 1205 }, { "entropy": 5.971589708328247, "epoch": 0.027036991520216297, "grad_norm": 1.3984375, "learning_rate": 0.0004946325498182755, "loss": 6.0589, "mean_token_accuracy": 0.1600156843662262, "num_tokens": 1026248.0, "step": 1210 }, { "entropy": 5.97881760597229, "epoch": 0.027148714625671734, "grad_norm": 1.453125, "learning_rate": 0.0004943737504964076, "loss": 5.8084, "mean_token_accuracy": 0.18238039016723634, "num_tokens": 1030284.0, "step": 1215 }, { "entropy": 6.004219436645508, "epoch": 0.027260437731127175, "grad_norm": 1.3984375, "learning_rate": 0.000494108936932354, "loss": 6.1125, "mean_token_accuracy": 0.1722887262701988, "num_tokens": 1034444.0, "step": 1220 }, { "entropy": 6.072319364547729, "epoch": 0.027372160836582615, "grad_norm": 1.3671875, "learning_rate": 0.0004938381163861124, "loss": 5.9253, "mean_token_accuracy": 0.18728673458099365, "num_tokens": 1038819.0, "step": 1225 }, { "entropy": 6.105956125259399, "epoch": 0.027483883942038052, "grad_norm": 1.328125, "learning_rate": 0.0004935612962823645, "loss": 6.1433, "mean_token_accuracy": 0.1664537325501442, "num_tokens": 1043303.0, "step": 1230 }, { "entropy": 5.987173557281494, "epoch": 0.027595607047493493, "grad_norm": 1.5078125, "learning_rate": 0.0004932784842102739, "loss": 5.9435, "mean_token_accuracy": 0.1737391769886017, "num_tokens": 1047451.0, "step": 1235 }, { "entropy": 6.031593132019043, "epoch": 0.02770733015294893, "grad_norm": 1.2578125, "learning_rate": 0.0004929896879232758, "loss": 5.9946, "mean_token_accuracy": 0.1745271012187004, "num_tokens": 1052370.0, "step": 1240 }, { "entropy": 6.133889484405517, "epoch": 0.02781905325840437, "grad_norm": 1.421875, "learning_rate": 0.0004926949153388668, "loss": 6.1184, "mean_token_accuracy": 0.15884814709424971, "num_tokens": 1056755.0, "step": 1245 }, { "entropy": 6.027875137329102, "epoch": 0.02793077636385981, "grad_norm": 1.328125, "learning_rate": 0.0004923941745383859, "loss": 6.0237, "mean_token_accuracy": 0.1649158090353012, "num_tokens": 1061380.0, "step": 1250 }, { "entropy": 5.859837007522583, "epoch": 0.02804249946931525, "grad_norm": 1.34375, "learning_rate": 0.000492087473766794, "loss": 5.9049, "mean_token_accuracy": 0.1740475058555603, "num_tokens": 1065633.0, "step": 1255 }, { "entropy": 5.939010953903198, "epoch": 0.02815422257477069, "grad_norm": 1.5234375, "learning_rate": 0.000491774821432448, "loss": 6.043, "mean_token_accuracy": 0.1675959825515747, "num_tokens": 1070131.0, "step": 1260 }, { "entropy": 6.035466241836548, "epoch": 0.028265945680226126, "grad_norm": 1.3125, "learning_rate": 0.0004914562261068693, "loss": 5.956, "mean_token_accuracy": 0.17018137276172637, "num_tokens": 1074465.0, "step": 1265 }, { "entropy": 5.894679594039917, "epoch": 0.028377668785681567, "grad_norm": 1.5546875, "learning_rate": 0.0004911316965245098, "loss": 5.8307, "mean_token_accuracy": 0.17515944987535476, "num_tokens": 1078738.0, "step": 1270 }, { "entropy": 5.887772560119629, "epoch": 0.028489391891137007, "grad_norm": 1.4375, "learning_rate": 0.000490801241582512, "loss": 5.9601, "mean_token_accuracy": 0.1752310276031494, "num_tokens": 1082529.0, "step": 1275 }, { "entropy": 6.000855207443237, "epoch": 0.028601114996592444, "grad_norm": 1.328125, "learning_rate": 0.000490464870340465, "loss": 6.0392, "mean_token_accuracy": 0.16873422712087632, "num_tokens": 1087043.0, "step": 1280 }, { "entropy": 5.8165771007537845, "epoch": 0.028712838102047885, "grad_norm": 1.53125, "learning_rate": 0.0004901225920201563, "loss": 5.9401, "mean_token_accuracy": 0.18170406371355058, "num_tokens": 1091045.0, "step": 1285 }, { "entropy": 6.046920347213745, "epoch": 0.028824561207503322, "grad_norm": 1.515625, "learning_rate": 0.000489774416005319, "loss": 5.911, "mean_token_accuracy": 0.17549529373645784, "num_tokens": 1094949.0, "step": 1290 }, { "entropy": 5.849216651916504, "epoch": 0.028936284312958763, "grad_norm": 1.5546875, "learning_rate": 0.0004894203518413742, "loss": 5.9407, "mean_token_accuracy": 0.1647828571498394, "num_tokens": 1099131.0, "step": 1295 }, { "entropy": 5.80899658203125, "epoch": 0.029048007418414203, "grad_norm": 1.4765625, "learning_rate": 0.0004890604092351701, "loss": 5.8729, "mean_token_accuracy": 0.17930638641119004, "num_tokens": 1102967.0, "step": 1300 }, { "entropy": 5.98758225440979, "epoch": 0.02915973052386964, "grad_norm": 1.4375, "learning_rate": 0.000488694598054715, "loss": 5.9128, "mean_token_accuracy": 0.17649397403001785, "num_tokens": 1106777.0, "step": 1305 }, { "entropy": 5.834689521789551, "epoch": 0.02927145362932508, "grad_norm": 1.4296875, "learning_rate": 0.0004883229283289071, "loss": 5.9249, "mean_token_accuracy": 0.1766020655632019, "num_tokens": 1111184.0, "step": 1310 }, { "entropy": 6.064471244812012, "epoch": 0.02938317673478052, "grad_norm": 1.328125, "learning_rate": 0.00048794541024725993, "loss": 5.9235, "mean_token_accuracy": 0.17901833802461625, "num_tokens": 1115651.0, "step": 1315 }, { "entropy": 6.012405014038086, "epoch": 0.02949489984023596, "grad_norm": 1.3671875, "learning_rate": 0.0004875620541596221, "loss": 5.956, "mean_token_accuracy": 0.1633922666311264, "num_tokens": 1120012.0, "step": 1320 }, { "entropy": 5.800662183761597, "epoch": 0.0296066229456914, "grad_norm": 1.4296875, "learning_rate": 0.00048717287057589454, "loss": 5.859, "mean_token_accuracy": 0.18077441900968552, "num_tokens": 1124549.0, "step": 1325 }, { "entropy": 5.966872882843018, "epoch": 0.029718346051146836, "grad_norm": 1.4140625, "learning_rate": 0.0004867778701657417, "loss": 5.9441, "mean_token_accuracy": 0.17887909561395646, "num_tokens": 1128968.0, "step": 1330 }, { "entropy": 5.908768558502198, "epoch": 0.029830069156602277, "grad_norm": 1.3671875, "learning_rate": 0.00048637706375829955, "loss": 6.0053, "mean_token_accuracy": 0.17145692855119704, "num_tokens": 1133396.0, "step": 1335 }, { "entropy": 6.086913299560547, "epoch": 0.029941792262057718, "grad_norm": 1.4140625, "learning_rate": 0.000485970462341878, "loss": 5.9048, "mean_token_accuracy": 0.17118549942970276, "num_tokens": 1137577.0, "step": 1340 }, { "entropy": 5.773934030532837, "epoch": 0.030053515367513155, "grad_norm": 1.40625, "learning_rate": 0.00048555807706366044, "loss": 5.8044, "mean_token_accuracy": 0.17675584256649018, "num_tokens": 1141551.0, "step": 1345 }, { "entropy": 5.967331218719482, "epoch": 0.030165238472968595, "grad_norm": 1.484375, "learning_rate": 0.00048513991922939756, "loss": 5.8297, "mean_token_accuracy": 0.17623057961463928, "num_tokens": 1145295.0, "step": 1350 }, { "entropy": 5.916956901550293, "epoch": 0.030276961578424032, "grad_norm": 1.328125, "learning_rate": 0.00048471600030309744, "loss": 6.0757, "mean_token_accuracy": 0.16089194118976594, "num_tokens": 1149946.0, "step": 1355 }, { "entropy": 5.946835136413574, "epoch": 0.030388684683879473, "grad_norm": 1.625, "learning_rate": 0.00048428633190671186, "loss": 5.9579, "mean_token_accuracy": 0.17933496832847595, "num_tokens": 1153955.0, "step": 1360 }, { "entropy": 5.879767847061157, "epoch": 0.030500407789334914, "grad_norm": 1.4140625, "learning_rate": 0.0004838509258198167, "loss": 5.8494, "mean_token_accuracy": 0.17823615819215774, "num_tokens": 1158568.0, "step": 1365 }, { "entropy": 5.8853926181793215, "epoch": 0.03061213089479035, "grad_norm": 1.515625, "learning_rate": 0.00048340979397929, "loss": 5.8017, "mean_token_accuracy": 0.17762538492679597, "num_tokens": 1162217.0, "step": 1370 }, { "entropy": 5.819405508041382, "epoch": 0.03072385400024579, "grad_norm": 1.453125, "learning_rate": 0.00048296294847898386, "loss": 5.8786, "mean_token_accuracy": 0.17288521826267242, "num_tokens": 1165905.0, "step": 1375 }, { "entropy": 5.949618673324585, "epoch": 0.03083557710570123, "grad_norm": 1.484375, "learning_rate": 0.0004825104015693934, "loss": 5.8634, "mean_token_accuracy": 0.1736384004354477, "num_tokens": 1170352.0, "step": 1380 }, { "entropy": 5.8261597633361815, "epoch": 0.03094730021115667, "grad_norm": 1.390625, "learning_rate": 0.0004820521656573208, "loss": 5.9311, "mean_token_accuracy": 0.17523645013570785, "num_tokens": 1174560.0, "step": 1385 }, { "entropy": 5.963821220397949, "epoch": 0.03105902331661211, "grad_norm": 1.3828125, "learning_rate": 0.00048158825330553505, "loss": 5.8748, "mean_token_accuracy": 0.1740915596485138, "num_tokens": 1178544.0, "step": 1390 }, { "entropy": 5.702950811386108, "epoch": 0.031170746422067547, "grad_norm": 1.5546875, "learning_rate": 0.00048111867723242763, "loss": 5.7173, "mean_token_accuracy": 0.19122548252344132, "num_tokens": 1182541.0, "step": 1395 }, { "entropy": 5.825392246246338, "epoch": 0.031282469527522984, "grad_norm": 1.328125, "learning_rate": 0.0004806434503116637, "loss": 5.803, "mean_token_accuracy": 0.18207484632730483, "num_tokens": 1186684.0, "step": 1400 }, { "entropy": 5.852643585205078, "epoch": 0.03139419263297843, "grad_norm": 1.4296875, "learning_rate": 0.0004801625855718296, "loss": 5.7638, "mean_token_accuracy": 0.1846204161643982, "num_tokens": 1190785.0, "step": 1405 }, { "entropy": 5.6974410057067875, "epoch": 0.031505915738433865, "grad_norm": 1.3671875, "learning_rate": 0.00047967609619607477, "loss": 5.7808, "mean_token_accuracy": 0.17526547610759735, "num_tokens": 1194940.0, "step": 1410 }, { "entropy": 5.803288984298706, "epoch": 0.0316176388438893, "grad_norm": 1.3984375, "learning_rate": 0.0004791839955217513, "loss": 5.7563, "mean_token_accuracy": 0.18818183541297911, "num_tokens": 1198765.0, "step": 1415 }, { "entropy": 5.929622077941895, "epoch": 0.031729361949344746, "grad_norm": 1.3203125, "learning_rate": 0.00047868629704004786, "loss": 5.979, "mean_token_accuracy": 0.1642720431089401, "num_tokens": 1203266.0, "step": 1420 }, { "entropy": 5.848547840118409, "epoch": 0.03184108505480018, "grad_norm": 1.3203125, "learning_rate": 0.00047818301439561965, "loss": 5.7561, "mean_token_accuracy": 0.1881594181060791, "num_tokens": 1207414.0, "step": 1425 }, { "entropy": 5.699222707748413, "epoch": 0.03195280816025562, "grad_norm": 1.359375, "learning_rate": 0.00047767416138621454, "loss": 5.7656, "mean_token_accuracy": 0.18503025323152542, "num_tokens": 1211325.0, "step": 1430 }, { "entropy": 5.976352977752685, "epoch": 0.032064531265711065, "grad_norm": 1.4453125, "learning_rate": 0.000477159751962295, "loss": 5.801, "mean_token_accuracy": 0.18062487095594407, "num_tokens": 1215866.0, "step": 1435 }, { "entropy": 5.736691808700561, "epoch": 0.0321762543711665, "grad_norm": 1.375, "learning_rate": 0.00047663980022665507, "loss": 5.861, "mean_token_accuracy": 0.17032930999994278, "num_tokens": 1220241.0, "step": 1440 }, { "entropy": 5.691896915435791, "epoch": 0.03228797747662194, "grad_norm": 1.5390625, "learning_rate": 0.00047611432043403437, "loss": 5.8819, "mean_token_accuracy": 0.1773227259516716, "num_tokens": 1224330.0, "step": 1445 }, { "entropy": 6.069937038421631, "epoch": 0.03239970058207738, "grad_norm": 1.4609375, "learning_rate": 0.0004755833269907267, "loss": 5.9618, "mean_token_accuracy": 0.16885158866643907, "num_tokens": 1228518.0, "step": 1450 }, { "entropy": 5.808598423004151, "epoch": 0.03251142368753282, "grad_norm": 1.3671875, "learning_rate": 0.0004750468344541857, "loss": 5.8203, "mean_token_accuracy": 0.18446521908044816, "num_tokens": 1232556.0, "step": 1455 }, { "entropy": 5.866223096847534, "epoch": 0.03262314679298826, "grad_norm": 1.6015625, "learning_rate": 0.00047450485753262525, "loss": 5.8594, "mean_token_accuracy": 0.1794953316450119, "num_tokens": 1236464.0, "step": 1460 }, { "entropy": 5.9548783779144285, "epoch": 0.032734869898443694, "grad_norm": 1.3828125, "learning_rate": 0.00047395741108461633, "loss": 5.8455, "mean_token_accuracy": 0.18512817621231079, "num_tokens": 1240478.0, "step": 1465 }, { "entropy": 5.9534708023071286, "epoch": 0.03284659300389914, "grad_norm": 1.40625, "learning_rate": 0.00047340451011867985, "loss": 5.906, "mean_token_accuracy": 0.1799629181623459, "num_tokens": 1244149.0, "step": 1470 }, { "entropy": 6.017633962631225, "epoch": 0.032958316109354575, "grad_norm": 1.671875, "learning_rate": 0.00047284616979287515, "loss": 5.9879, "mean_token_accuracy": 0.16287869438529015, "num_tokens": 1248617.0, "step": 1475 }, { "entropy": 5.903649234771729, "epoch": 0.03307003921481001, "grad_norm": 1.3046875, "learning_rate": 0.00047228240541438433, "loss": 5.8795, "mean_token_accuracy": 0.1832698553800583, "num_tokens": 1253044.0, "step": 1480 }, { "entropy": 5.926074123382568, "epoch": 0.03318176232026546, "grad_norm": 1.4609375, "learning_rate": 0.00047171323243909257, "loss": 5.9143, "mean_token_accuracy": 0.1814977541565895, "num_tokens": 1257651.0, "step": 1485 }, { "entropy": 5.833726167678833, "epoch": 0.033293485425720894, "grad_norm": 1.4453125, "learning_rate": 0.00047113866647116457, "loss": 5.8368, "mean_token_accuracy": 0.18549390286207199, "num_tokens": 1261805.0, "step": 1490 }, { "entropy": 5.733483600616455, "epoch": 0.03340520853117633, "grad_norm": 1.453125, "learning_rate": 0.0004705587232626164, "loss": 5.6356, "mean_token_accuracy": 0.19865250885486602, "num_tokens": 1265625.0, "step": 1495 }, { "entropy": 5.693035125732422, "epoch": 0.033516931636631775, "grad_norm": 1.34375, "learning_rate": 0.00046997341871288424, "loss": 5.8133, "mean_token_accuracy": 0.18278113082051278, "num_tokens": 1269876.0, "step": 1500 }, { "entropy": 5.831105041503906, "epoch": 0.03362865474208721, "grad_norm": 1.265625, "learning_rate": 0.0004693827688683879, "loss": 5.7775, "mean_token_accuracy": 0.18592336624860764, "num_tokens": 1273821.0, "step": 1505 }, { "entropy": 5.830736303329468, "epoch": 0.03374037784754265, "grad_norm": 1.3125, "learning_rate": 0.0004687867899220914, "loss": 5.8811, "mean_token_accuracy": 0.18795700818300248, "num_tokens": 1278574.0, "step": 1510 }, { "entropy": 5.784781217575073, "epoch": 0.033852100952998086, "grad_norm": 1.40625, "learning_rate": 0.00046818549821305846, "loss": 5.8642, "mean_token_accuracy": 0.17242854535579683, "num_tokens": 1283271.0, "step": 1515 }, { "entropy": 5.806311082839966, "epoch": 0.03396382405845353, "grad_norm": 1.4375, "learning_rate": 0.00046757891022600494, "loss": 5.6992, "mean_token_accuracy": 0.1895821213722229, "num_tokens": 1287633.0, "step": 1520 }, { "entropy": 5.612684059143066, "epoch": 0.03407554716390897, "grad_norm": 1.5234375, "learning_rate": 0.0004669670425908471, "loss": 5.7039, "mean_token_accuracy": 0.19535314291715622, "num_tokens": 1291796.0, "step": 1525 }, { "entropy": 5.7842505931854244, "epoch": 0.034187270269364405, "grad_norm": 1.4609375, "learning_rate": 0.0004663499120822451, "loss": 5.8562, "mean_token_accuracy": 0.18286515921354293, "num_tokens": 1296086.0, "step": 1530 }, { "entropy": 5.824511098861694, "epoch": 0.03429899337481985, "grad_norm": 1.2890625, "learning_rate": 0.0004657275356191437, "loss": 5.8006, "mean_token_accuracy": 0.17361746430397035, "num_tokens": 1300651.0, "step": 1535 }, { "entropy": 5.797060441970825, "epoch": 0.034410716480275286, "grad_norm": 1.46875, "learning_rate": 0.00046509993026430804, "loss": 5.7873, "mean_token_accuracy": 0.18226577788591386, "num_tokens": 1304930.0, "step": 1540 }, { "entropy": 5.883905744552612, "epoch": 0.03452243958573072, "grad_norm": 1.390625, "learning_rate": 0.0004644671132238558, "loss": 5.9211, "mean_token_accuracy": 0.16726794093847275, "num_tokens": 1308950.0, "step": 1545 }, { "entropy": 5.8268091678619385, "epoch": 0.03463416269118617, "grad_norm": 1.53125, "learning_rate": 0.00046382910184678585, "loss": 5.7787, "mean_token_accuracy": 0.17821203917264938, "num_tokens": 1313059.0, "step": 1550 }, { "entropy": 5.647272109985352, "epoch": 0.034745885796641604, "grad_norm": 1.453125, "learning_rate": 0.0004631859136245025, "loss": 5.6842, "mean_token_accuracy": 0.19873663783073425, "num_tokens": 1316756.0, "step": 1555 }, { "entropy": 5.785255432128906, "epoch": 0.03485760890209704, "grad_norm": 1.3671875, "learning_rate": 0.0004625375661903357, "loss": 5.9699, "mean_token_accuracy": 0.1627327397465706, "num_tokens": 1320834.0, "step": 1560 }, { "entropy": 5.799972629547119, "epoch": 0.034969332007552485, "grad_norm": 1.453125, "learning_rate": 0.00046188407731905787, "loss": 5.747, "mean_token_accuracy": 0.17980815470218658, "num_tokens": 1324484.0, "step": 1565 }, { "entropy": 5.779381561279297, "epoch": 0.03508105511300792, "grad_norm": 1.2421875, "learning_rate": 0.00046122546492639643, "loss": 5.7251, "mean_token_accuracy": 0.18375469446182252, "num_tokens": 1328935.0, "step": 1570 }, { "entropy": 5.741471004486084, "epoch": 0.03519277821846336, "grad_norm": 1.53125, "learning_rate": 0.000460561747068543, "loss": 5.7432, "mean_token_accuracy": 0.1859663426876068, "num_tokens": 1333225.0, "step": 1575 }, { "entropy": 5.714008522033692, "epoch": 0.0353045013239188, "grad_norm": 1.4921875, "learning_rate": 0.0004598929419416578, "loss": 5.6636, "mean_token_accuracy": 0.18822408169507981, "num_tokens": 1337234.0, "step": 1580 }, { "entropy": 5.844133186340332, "epoch": 0.03541622442937424, "grad_norm": 1.4375, "learning_rate": 0.00045921906788137123, "loss": 5.9233, "mean_token_accuracy": 0.1749085620045662, "num_tokens": 1341765.0, "step": 1585 }, { "entropy": 5.890516853332519, "epoch": 0.03552794753482968, "grad_norm": 1.5234375, "learning_rate": 0.00045854014336228115, "loss": 5.8023, "mean_token_accuracy": 0.17829006016254426, "num_tokens": 1346087.0, "step": 1590 }, { "entropy": 5.80145001411438, "epoch": 0.035639670640285115, "grad_norm": 1.390625, "learning_rate": 0.00045785618699744615, "loss": 5.8247, "mean_token_accuracy": 0.1754228189587593, "num_tokens": 1350443.0, "step": 1595 }, { "entropy": 5.880692100524902, "epoch": 0.03575139374574056, "grad_norm": 1.2578125, "learning_rate": 0.00045716721753787543, "loss": 5.8544, "mean_token_accuracy": 0.1789305865764618, "num_tokens": 1355092.0, "step": 1600 }, { "entropy": 5.775990533828735, "epoch": 0.035863116851195996, "grad_norm": 1.2890625, "learning_rate": 0.0004564732538720148, "loss": 5.8375, "mean_token_accuracy": 0.18685502409934998, "num_tokens": 1359379.0, "step": 1605 }, { "entropy": 5.826099395751953, "epoch": 0.03597483995665143, "grad_norm": 1.5, "learning_rate": 0.00045577431502522877, "loss": 5.6924, "mean_token_accuracy": 0.18221372812986375, "num_tokens": 1363346.0, "step": 1610 }, { "entropy": 5.730778932571411, "epoch": 0.03608656306210688, "grad_norm": 1.359375, "learning_rate": 0.0004550704201592787, "loss": 5.773, "mean_token_accuracy": 0.17810402810573578, "num_tokens": 1367322.0, "step": 1615 }, { "entropy": 5.649629878997803, "epoch": 0.036198286167562314, "grad_norm": 1.3671875, "learning_rate": 0.0004543615885717981, "loss": 5.7162, "mean_token_accuracy": 0.1771922379732132, "num_tokens": 1371165.0, "step": 1620 }, { "entropy": 5.648497486114502, "epoch": 0.03631000927301775, "grad_norm": 1.390625, "learning_rate": 0.00045364783969576296, "loss": 5.7376, "mean_token_accuracy": 0.1936981901526451, "num_tokens": 1375119.0, "step": 1625 }, { "entropy": 5.806000185012818, "epoch": 0.03642173237847319, "grad_norm": 1.3125, "learning_rate": 0.0004529291930989592, "loss": 5.6657, "mean_token_accuracy": 0.18797771632671356, "num_tokens": 1379268.0, "step": 1630 }, { "entropy": 5.663884687423706, "epoch": 0.03653345548392863, "grad_norm": 1.421875, "learning_rate": 0.0004522056684834464, "loss": 5.785, "mean_token_accuracy": 0.16971432119607927, "num_tokens": 1383477.0, "step": 1635 }, { "entropy": 5.687128686904908, "epoch": 0.03664517858938407, "grad_norm": 1.421875, "learning_rate": 0.0004514772856850173, "loss": 5.7087, "mean_token_accuracy": 0.1861000046133995, "num_tokens": 1387138.0, "step": 1640 }, { "entropy": 5.865495443344116, "epoch": 0.03675690169483951, "grad_norm": 1.3359375, "learning_rate": 0.0004507440646726542, "loss": 5.835, "mean_token_accuracy": 0.16652033776044844, "num_tokens": 1391758.0, "step": 1645 }, { "entropy": 5.652455759048462, "epoch": 0.03686862480029495, "grad_norm": 1.484375, "learning_rate": 0.0004500060255479818, "loss": 5.7357, "mean_token_accuracy": 0.17026722058653831, "num_tokens": 1395517.0, "step": 1650 }, { "entropy": 5.77337498664856, "epoch": 0.03698034790575039, "grad_norm": 1.4609375, "learning_rate": 0.0004492631885447151, "loss": 5.7572, "mean_token_accuracy": 0.1879993349313736, "num_tokens": 1400021.0, "step": 1655 }, { "entropy": 5.89671516418457, "epoch": 0.037092071011205825, "grad_norm": 1.4375, "learning_rate": 0.00044851557402810616, "loss": 5.918, "mean_token_accuracy": 0.17465589046478272, "num_tokens": 1404456.0, "step": 1660 }, { "entropy": 5.753234243392944, "epoch": 0.03720379411666127, "grad_norm": 1.2890625, "learning_rate": 0.00044776320249438444, "loss": 5.8144, "mean_token_accuracy": 0.17828851491212844, "num_tokens": 1408612.0, "step": 1665 }, { "entropy": 5.80224084854126, "epoch": 0.037315517222116706, "grad_norm": 1.3984375, "learning_rate": 0.00044700609457019565, "loss": 5.7924, "mean_token_accuracy": 0.18226661533117294, "num_tokens": 1412688.0, "step": 1670 }, { "entropy": 5.919682836532592, "epoch": 0.037427240327572144, "grad_norm": 1.375, "learning_rate": 0.0004462442710120359, "loss": 5.8297, "mean_token_accuracy": 0.17643865197896957, "num_tokens": 1417273.0, "step": 1675 }, { "entropy": 5.83403468132019, "epoch": 0.03753896343302759, "grad_norm": 1.5, "learning_rate": 0.000445477752705683, "loss": 5.7559, "mean_token_accuracy": 0.17946113049983978, "num_tokens": 1421737.0, "step": 1680 }, { "entropy": 5.653639125823974, "epoch": 0.037650686538483025, "grad_norm": 1.3671875, "learning_rate": 0.00044470656066562336, "loss": 5.528, "mean_token_accuracy": 0.20140709578990937, "num_tokens": 1426154.0, "step": 1685 }, { "entropy": 5.726971578598023, "epoch": 0.03776240964393846, "grad_norm": 1.421875, "learning_rate": 0.0004439307160344765, "loss": 5.7815, "mean_token_accuracy": 0.17367986142635344, "num_tokens": 1430270.0, "step": 1690 }, { "entropy": 5.809293508529663, "epoch": 0.0378741327493939, "grad_norm": 1.34375, "learning_rate": 0.00044315024008241473, "loss": 5.6611, "mean_token_accuracy": 0.1972547873854637, "num_tokens": 1434877.0, "step": 1695 }, { "entropy": 5.65094747543335, "epoch": 0.03798585585484934, "grad_norm": 1.4140625, "learning_rate": 0.0004423651542065806, "loss": 5.7318, "mean_token_accuracy": 0.19258931577205657, "num_tokens": 1438690.0, "step": 1700 }, { "entropy": 5.721880674362183, "epoch": 0.03809757896030478, "grad_norm": 1.53125, "learning_rate": 0.00044157547993050006, "loss": 5.6646, "mean_token_accuracy": 0.19387782514095306, "num_tokens": 1443085.0, "step": 1705 }, { "entropy": 5.580819368362427, "epoch": 0.03820930206576022, "grad_norm": 1.5078125, "learning_rate": 0.00044078123890349227, "loss": 5.5564, "mean_token_accuracy": 0.20745181739330293, "num_tokens": 1447280.0, "step": 1710 }, { "entropy": 5.709810638427735, "epoch": 0.03832102517121566, "grad_norm": 1.328125, "learning_rate": 0.00043998245290007606, "loss": 5.7408, "mean_token_accuracy": 0.1841261014342308, "num_tokens": 1451639.0, "step": 1715 }, { "entropy": 5.823773813247681, "epoch": 0.0384327482766711, "grad_norm": 1.4765625, "learning_rate": 0.00043917914381937323, "loss": 5.7155, "mean_token_accuracy": 0.18863430619239807, "num_tokens": 1455473.0, "step": 1720 }, { "entropy": 5.738099813461304, "epoch": 0.038544471382126536, "grad_norm": 1.265625, "learning_rate": 0.00043837133368450815, "loss": 5.7901, "mean_token_accuracy": 0.1780441515147686, "num_tokens": 1460332.0, "step": 1725 }, { "entropy": 5.72046480178833, "epoch": 0.03865619448758198, "grad_norm": 1.296875, "learning_rate": 0.0004375590446420037, "loss": 5.6767, "mean_token_accuracy": 0.19585542976856232, "num_tokens": 1465013.0, "step": 1730 }, { "entropy": 5.666249418258667, "epoch": 0.03876791759303742, "grad_norm": 1.3671875, "learning_rate": 0.0004367422989611743, "loss": 5.5938, "mean_token_accuracy": 0.1894269183278084, "num_tokens": 1469070.0, "step": 1735 }, { "entropy": 5.807224321365356, "epoch": 0.038879640698492854, "grad_norm": 1.234375, "learning_rate": 0.0004359211190335153, "loss": 5.6786, "mean_token_accuracy": 0.1812390998005867, "num_tokens": 1473426.0, "step": 1740 }, { "entropy": 5.647406721115113, "epoch": 0.0389913638039483, "grad_norm": 1.421875, "learning_rate": 0.00043509552737208923, "loss": 5.7754, "mean_token_accuracy": 0.18348126858472824, "num_tokens": 1477631.0, "step": 1745 }, { "entropy": 5.6247352123260494, "epoch": 0.039103086909403735, "grad_norm": 1.3046875, "learning_rate": 0.00043426554661090853, "loss": 5.8263, "mean_token_accuracy": 0.17752304524183274, "num_tokens": 1481921.0, "step": 1750 }, { "entropy": 5.883453607559204, "epoch": 0.03921481001485917, "grad_norm": 1.3671875, "learning_rate": 0.00043343119950431516, "loss": 5.7789, "mean_token_accuracy": 0.18748508542776107, "num_tokens": 1486571.0, "step": 1755 }, { "entropy": 5.773577117919922, "epoch": 0.03932653312031461, "grad_norm": 1.4296875, "learning_rate": 0.00043259250892635644, "loss": 5.7668, "mean_token_accuracy": 0.17757585793733596, "num_tokens": 1490952.0, "step": 1760 }, { "entropy": 5.652618646621704, "epoch": 0.03943825622577005, "grad_norm": 1.3359375, "learning_rate": 0.0004317494978701582, "loss": 5.6286, "mean_token_accuracy": 0.1940794676542282, "num_tokens": 1495144.0, "step": 1765 }, { "entropy": 5.822029495239258, "epoch": 0.03954997933122549, "grad_norm": 1.3671875, "learning_rate": 0.0004309021894472943, "loss": 5.7134, "mean_token_accuracy": 0.18479356169700623, "num_tokens": 1499386.0, "step": 1770 }, { "entropy": 5.70394229888916, "epoch": 0.03966170243668093, "grad_norm": 1.578125, "learning_rate": 0.0004300506068871534, "loss": 5.6437, "mean_token_accuracy": 0.19557296335697175, "num_tokens": 1503583.0, "step": 1775 }, { "entropy": 5.668413591384888, "epoch": 0.03977342554213637, "grad_norm": 1.46875, "learning_rate": 0.00042919477353630135, "loss": 5.6645, "mean_token_accuracy": 0.184171424806118, "num_tokens": 1507680.0, "step": 1780 }, { "entropy": 5.8005297660827635, "epoch": 0.03988514864759181, "grad_norm": 1.3203125, "learning_rate": 0.000428334712857842, "loss": 5.7538, "mean_token_accuracy": 0.18311063945293427, "num_tokens": 1511856.0, "step": 1785 }, { "entropy": 5.912327814102173, "epoch": 0.039996871753047246, "grad_norm": 1.234375, "learning_rate": 0.00042747044843077304, "loss": 5.7356, "mean_token_accuracy": 0.17745298892259598, "num_tokens": 1516176.0, "step": 1790 }, { "entropy": 5.7352742671966555, "epoch": 0.04010859485850269, "grad_norm": 1.4296875, "learning_rate": 0.00042660200394934047, "loss": 5.635, "mean_token_accuracy": 0.19073558300733567, "num_tokens": 1520060.0, "step": 1795 }, { "entropy": 5.495400428771973, "epoch": 0.04022031796395813, "grad_norm": 1.40625, "learning_rate": 0.00042572940322238844, "loss": 5.7122, "mean_token_accuracy": 0.18623971492052077, "num_tokens": 1524165.0, "step": 1800 }, { "entropy": 5.868027305603027, "epoch": 0.040332041069413564, "grad_norm": 1.359375, "learning_rate": 0.00042485267017270664, "loss": 5.8853, "mean_token_accuracy": 0.1717434585094452, "num_tokens": 1528065.0, "step": 1805 }, { "entropy": 5.821336555480957, "epoch": 0.040443764174869, "grad_norm": 1.328125, "learning_rate": 0.0004239718288363745, "loss": 5.6691, "mean_token_accuracy": 0.19097715318202974, "num_tokens": 1532618.0, "step": 1810 }, { "entropy": 5.592393159866333, "epoch": 0.040555487280324445, "grad_norm": 1.3046875, "learning_rate": 0.0004230869033621023, "loss": 5.6987, "mean_token_accuracy": 0.1828291967511177, "num_tokens": 1536965.0, "step": 1815 }, { "entropy": 5.767320680618286, "epoch": 0.04066721038577988, "grad_norm": 1.453125, "learning_rate": 0.0004221979180105688, "loss": 5.8283, "mean_token_accuracy": 0.17617318630218506, "num_tokens": 1541332.0, "step": 1820 }, { "entropy": 5.672343111038208, "epoch": 0.04077893349123532, "grad_norm": 1.3359375, "learning_rate": 0.00042130489715375645, "loss": 5.5244, "mean_token_accuracy": 0.2023320123553276, "num_tokens": 1545324.0, "step": 1825 }, { "entropy": 5.767176914215088, "epoch": 0.040890656596690764, "grad_norm": 1.3515625, "learning_rate": 0.00042040786527428335, "loss": 5.7512, "mean_token_accuracy": 0.1897562712430954, "num_tokens": 1549409.0, "step": 1830 }, { "entropy": 5.759979391098023, "epoch": 0.0410023797021462, "grad_norm": 1.40625, "learning_rate": 0.0004195068469647315, "loss": 5.7413, "mean_token_accuracy": 0.1818301036953926, "num_tokens": 1553526.0, "step": 1835 }, { "entropy": 5.775640344619751, "epoch": 0.04111410280760164, "grad_norm": 1.28125, "learning_rate": 0.00041860186692697297, "loss": 5.8355, "mean_token_accuracy": 0.1880885362625122, "num_tokens": 1558475.0, "step": 1840 }, { "entropy": 5.726383304595947, "epoch": 0.04122582591305708, "grad_norm": 1.453125, "learning_rate": 0.00041769294997149264, "loss": 5.6429, "mean_token_accuracy": 0.18811526596546174, "num_tokens": 1562702.0, "step": 1845 }, { "entropy": 5.63990626335144, "epoch": 0.04133754901851252, "grad_norm": 1.3828125, "learning_rate": 0.0004167801210167081, "loss": 5.6439, "mean_token_accuracy": 0.1975985050201416, "num_tokens": 1566706.0, "step": 1850 }, { "entropy": 5.644278717041016, "epoch": 0.041449272123967956, "grad_norm": 1.4296875, "learning_rate": 0.0004158634050882861, "loss": 5.6656, "mean_token_accuracy": 0.1993358850479126, "num_tokens": 1570843.0, "step": 1855 }, { "entropy": 5.706397962570191, "epoch": 0.0415609952294234, "grad_norm": 1.3046875, "learning_rate": 0.0004149428273184569, "loss": 5.7084, "mean_token_accuracy": 0.18736132681369783, "num_tokens": 1575308.0, "step": 1860 }, { "entropy": 5.728898191452027, "epoch": 0.04167271833487884, "grad_norm": 1.34375, "learning_rate": 0.0004140184129453253, "loss": 5.8393, "mean_token_accuracy": 0.17313541173934938, "num_tokens": 1579397.0, "step": 1865 }, { "entropy": 5.7663342475891115, "epoch": 0.041784441440334275, "grad_norm": 1.4765625, "learning_rate": 0.000413090187312178, "loss": 5.6239, "mean_token_accuracy": 0.18672820925712585, "num_tokens": 1583464.0, "step": 1870 }, { "entropy": 5.718973779678345, "epoch": 0.04189616454578971, "grad_norm": 1.3046875, "learning_rate": 0.0004121581758667898, "loss": 5.6461, "mean_token_accuracy": 0.18322024047374724, "num_tokens": 1587948.0, "step": 1875 }, { "entropy": 5.578612995147705, "epoch": 0.042007887651245156, "grad_norm": 1.421875, "learning_rate": 0.00041122240416072533, "loss": 5.5589, "mean_token_accuracy": 0.21150048673152924, "num_tokens": 1591855.0, "step": 1880 }, { "entropy": 5.71712212562561, "epoch": 0.04211961075670059, "grad_norm": 1.3125, "learning_rate": 0.0004102828978486385, "loss": 5.6911, "mean_token_accuracy": 0.19235271066427231, "num_tokens": 1595951.0, "step": 1885 }, { "entropy": 5.7032770156860355, "epoch": 0.04223133386215603, "grad_norm": 1.4765625, "learning_rate": 0.0004093396826875695, "loss": 5.6402, "mean_token_accuracy": 0.1927582010626793, "num_tokens": 1600091.0, "step": 1890 }, { "entropy": 5.731023693084717, "epoch": 0.042343056967611474, "grad_norm": 1.40625, "learning_rate": 0.00040839278453623837, "loss": 5.706, "mean_token_accuracy": 0.1776691198348999, "num_tokens": 1604093.0, "step": 1895 }, { "entropy": 5.688064241409302, "epoch": 0.04245478007306691, "grad_norm": 1.3984375, "learning_rate": 0.0004074422293543363, "loss": 5.6452, "mean_token_accuracy": 0.19756510853767395, "num_tokens": 1608254.0, "step": 1900 }, { "entropy": 5.602776527404785, "epoch": 0.04256650317852235, "grad_norm": 1.2890625, "learning_rate": 0.0004064880432018137, "loss": 5.7254, "mean_token_accuracy": 0.18962162733078003, "num_tokens": 1612064.0, "step": 1905 }, { "entropy": 5.6795135021209715, "epoch": 0.04267822628397779, "grad_norm": 1.3359375, "learning_rate": 0.00040553025223816615, "loss": 5.7919, "mean_token_accuracy": 0.18375196754932405, "num_tokens": 1616494.0, "step": 1910 }, { "entropy": 5.72490439414978, "epoch": 0.04278994938943323, "grad_norm": 1.421875, "learning_rate": 0.00040456888272171653, "loss": 5.4819, "mean_token_accuracy": 0.20083572566509247, "num_tokens": 1620432.0, "step": 1915 }, { "entropy": 5.752138948440551, "epoch": 0.04290167249488867, "grad_norm": 1.3828125, "learning_rate": 0.00040360396100889577, "loss": 5.7682, "mean_token_accuracy": 0.17632409781217576, "num_tokens": 1625170.0, "step": 1920 }, { "entropy": 5.650776195526123, "epoch": 0.043013395600344104, "grad_norm": 1.3359375, "learning_rate": 0.0004026355135535202, "loss": 5.6995, "mean_token_accuracy": 0.17991890013217926, "num_tokens": 1629487.0, "step": 1925 }, { "entropy": 5.6605809211730955, "epoch": 0.04312511870579955, "grad_norm": 1.3984375, "learning_rate": 0.000401663566906066, "loss": 5.6162, "mean_token_accuracy": 0.19089022427797317, "num_tokens": 1633868.0, "step": 1930 }, { "entropy": 5.6820018768310545, "epoch": 0.043236841811254985, "grad_norm": 1.4453125, "learning_rate": 0.00040068814771294134, "loss": 5.7443, "mean_token_accuracy": 0.17744273394346238, "num_tokens": 1638153.0, "step": 1935 }, { "entropy": 5.644814300537109, "epoch": 0.04334856491671042, "grad_norm": 1.359375, "learning_rate": 0.0003997092827157562, "loss": 5.5181, "mean_token_accuracy": 0.22187568694353105, "num_tokens": 1642365.0, "step": 1940 }, { "entropy": 5.932576513290405, "epoch": 0.043460288022165866, "grad_norm": 1.3515625, "learning_rate": 0.000398726998750589, "loss": 5.6869, "mean_token_accuracy": 0.1798103779554367, "num_tokens": 1646202.0, "step": 1945 }, { "entropy": 5.623147630691529, "epoch": 0.0435720111276213, "grad_norm": 1.3671875, "learning_rate": 0.00039774132274725076, "loss": 5.566, "mean_token_accuracy": 0.198709699511528, "num_tokens": 1650542.0, "step": 1950 }, { "entropy": 5.543530559539795, "epoch": 0.04368373423307674, "grad_norm": 1.515625, "learning_rate": 0.00039675228172854707, "loss": 5.5123, "mean_token_accuracy": 0.1991402894258499, "num_tokens": 1654386.0, "step": 1955 }, { "entropy": 5.532556343078613, "epoch": 0.043795457338532184, "grad_norm": 1.4296875, "learning_rate": 0.0003957599028095371, "loss": 5.5337, "mean_token_accuracy": 0.19989801347255706, "num_tokens": 1658211.0, "step": 1960 }, { "entropy": 5.6866264820098875, "epoch": 0.04390718044398762, "grad_norm": 1.4921875, "learning_rate": 0.00039476421319679017, "loss": 5.684, "mean_token_accuracy": 0.18525188714265822, "num_tokens": 1662757.0, "step": 1965 }, { "entropy": 5.693357276916504, "epoch": 0.04401890354944306, "grad_norm": 1.4609375, "learning_rate": 0.00039376524018764, "loss": 5.667, "mean_token_accuracy": 0.18190956711769105, "num_tokens": 1666714.0, "step": 1970 }, { "entropy": 5.652660083770752, "epoch": 0.0441306266548985, "grad_norm": 1.2421875, "learning_rate": 0.00039276301116943616, "loss": 5.6781, "mean_token_accuracy": 0.18582605719566345, "num_tokens": 1671029.0, "step": 1975 }, { "entropy": 5.742524433135986, "epoch": 0.04424234976035394, "grad_norm": 1.34375, "learning_rate": 0.0003917575536187936, "loss": 5.6653, "mean_token_accuracy": 0.18949595242738723, "num_tokens": 1675366.0, "step": 1980 }, { "entropy": 5.644546365737915, "epoch": 0.04435407286580938, "grad_norm": 1.5078125, "learning_rate": 0.00039074889510083894, "loss": 5.5579, "mean_token_accuracy": 0.2034739837050438, "num_tokens": 1679657.0, "step": 1985 }, { "entropy": 5.530533266067505, "epoch": 0.044465795971264814, "grad_norm": 1.4375, "learning_rate": 0.00038973706326845495, "loss": 5.5582, "mean_token_accuracy": 0.19022609293460846, "num_tokens": 1683676.0, "step": 1990 }, { "entropy": 5.533994388580322, "epoch": 0.04457751907672026, "grad_norm": 1.4140625, "learning_rate": 0.0003887220858615225, "loss": 5.5562, "mean_token_accuracy": 0.20196932703256607, "num_tokens": 1687718.0, "step": 1995 }, { "entropy": 5.549967861175537, "epoch": 0.044689242182175695, "grad_norm": 1.515625, "learning_rate": 0.0003877039907061597, "loss": 5.598, "mean_token_accuracy": 0.18386923521757126, "num_tokens": 1691434.0, "step": 2000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2440149129216000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }