{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.011172310545543924, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.69185152053833, "epoch": 0.00011172310545543924, "grad_norm": 18.5, "learning_rate": 2e-06, "loss": 10.5751, "mean_token_accuracy": 0.00030030030757188797, "num_tokens": 4264.0, "step": 5 }, { "entropy": 10.691861820220947, "epoch": 0.00022344621091087847, "grad_norm": 16.75, "learning_rate": 4.5e-06, "loss": 10.4625, "mean_token_accuracy": 0.0, "num_tokens": 8413.0, "step": 10 }, { "entropy": 10.690832233428955, "epoch": 0.0003351693163663177, "grad_norm": 13.4375, "learning_rate": 7e-06, "loss": 10.1956, "mean_token_accuracy": 0.03499803415033966, "num_tokens": 12394.0, "step": 15 }, { "entropy": 10.681817626953125, "epoch": 0.00044689242182175694, "grad_norm": 8.4375, "learning_rate": 9.5e-06, "loss": 9.8891, "mean_token_accuracy": 0.052673622593283655, "num_tokens": 16610.0, "step": 20 }, { "entropy": 10.648191356658936, "epoch": 0.0005586155272771962, "grad_norm": 5.84375, "learning_rate": 1.2e-05, "loss": 9.6415, "mean_token_accuracy": 0.059712447226047516, "num_tokens": 21243.0, "step": 25 }, { "entropy": 10.600524044036865, "epoch": 0.0006703386327326354, "grad_norm": 4.21875, "learning_rate": 1.4500000000000002e-05, "loss": 9.3955, "mean_token_accuracy": 0.06313439272344112, "num_tokens": 25571.0, "step": 30 }, { "entropy": 10.565627956390381, "epoch": 0.0007820617381880747, "grad_norm": 4.28125, "learning_rate": 1.7000000000000003e-05, "loss": 9.2501, "mean_token_accuracy": 0.058146678283810614, "num_tokens": 29412.0, "step": 35 }, { "entropy": 10.537028217315674, "epoch": 0.0008937848436435139, "grad_norm": 3.796875, "learning_rate": 1.95e-05, "loss": 9.2173, "mean_token_accuracy": 0.061766361258924006, "num_tokens": 33893.0, "step": 40 }, { "entropy": 10.526171112060547, "epoch": 0.0010055079490989532, "grad_norm": 3.765625, "learning_rate": 2.2e-05, "loss": 9.1499, "mean_token_accuracy": 0.06647200398147106, "num_tokens": 38043.0, "step": 45 }, { "entropy": 10.459559440612793, "epoch": 0.0011172310545543925, "grad_norm": 3.296875, "learning_rate": 2.4500000000000003e-05, "loss": 9.0927, "mean_token_accuracy": 0.06208832561969757, "num_tokens": 42222.0, "step": 50 }, { "entropy": 10.321250820159912, "epoch": 0.0012289541600098315, "grad_norm": 3.640625, "learning_rate": 2.7e-05, "loss": 8.9929, "mean_token_accuracy": 0.06888641528785229, "num_tokens": 46321.0, "step": 55 }, { "entropy": 10.221459579467773, "epoch": 0.0013406772654652708, "grad_norm": 3.140625, "learning_rate": 2.95e-05, "loss": 9.0121, "mean_token_accuracy": 0.07621248066425323, "num_tokens": 50816.0, "step": 60 }, { "entropy": 10.167527294158935, "epoch": 0.0014524003709207101, "grad_norm": 3.046875, "learning_rate": 3.2e-05, "loss": 8.9766, "mean_token_accuracy": 0.06631188206374646, "num_tokens": 55331.0, "step": 65 }, { "entropy": 10.158582305908203, "epoch": 0.0015641234763761494, "grad_norm": 2.828125, "learning_rate": 3.4500000000000005e-05, "loss": 8.8916, "mean_token_accuracy": 0.06474936045706273, "num_tokens": 59379.0, "step": 70 }, { "entropy": 10.132518291473389, "epoch": 0.0016758465818315885, "grad_norm": 2.671875, "learning_rate": 3.7e-05, "loss": 8.7691, "mean_token_accuracy": 0.07134371958673, "num_tokens": 63463.0, "step": 75 }, { "entropy": 10.115495491027833, "epoch": 0.0017875696872870278, "grad_norm": 2.625, "learning_rate": 3.95e-05, "loss": 8.8345, "mean_token_accuracy": 0.07139550410211086, "num_tokens": 67897.0, "step": 80 }, { "entropy": 10.076316165924073, "epoch": 0.001899292792742467, "grad_norm": 2.796875, "learning_rate": 4.2000000000000004e-05, "loss": 8.6081, "mean_token_accuracy": 0.07515238299965858, "num_tokens": 71995.0, "step": 85 }, { "entropy": 10.003674030303955, "epoch": 0.0020110158981979064, "grad_norm": 2.78125, "learning_rate": 4.45e-05, "loss": 8.4613, "mean_token_accuracy": 0.07963024936616421, "num_tokens": 75745.0, "step": 90 }, { "entropy": 9.955099964141846, "epoch": 0.0021227390036533456, "grad_norm": 2.34375, "learning_rate": 4.7000000000000004e-05, "loss": 8.4039, "mean_token_accuracy": 0.0783398538827896, "num_tokens": 79641.0, "step": 95 }, { "entropy": 9.907726192474366, "epoch": 0.002234462109108785, "grad_norm": 2.15625, "learning_rate": 4.9500000000000004e-05, "loss": 8.3639, "mean_token_accuracy": 0.07564271241426468, "num_tokens": 84368.0, "step": 100 }, { "entropy": 9.777185916900635, "epoch": 0.0023461852145642242, "grad_norm": 3.046875, "learning_rate": 5.2e-05, "loss": 8.3562, "mean_token_accuracy": 0.07499068863689899, "num_tokens": 89177.0, "step": 105 }, { "entropy": 9.874152565002442, "epoch": 0.002457908320019663, "grad_norm": 2.09375, "learning_rate": 5.45e-05, "loss": 8.1616, "mean_token_accuracy": 0.08200128600001336, "num_tokens": 93266.0, "step": 110 }, { "entropy": 9.573559665679932, "epoch": 0.0025696314254751024, "grad_norm": 2.515625, "learning_rate": 5.7e-05, "loss": 8.0628, "mean_token_accuracy": 0.08064724728465081, "num_tokens": 97385.0, "step": 115 }, { "entropy": 9.477795314788818, "epoch": 0.0026813545309305417, "grad_norm": 2.03125, "learning_rate": 5.9499999999999996e-05, "loss": 7.8909, "mean_token_accuracy": 0.08364077880978585, "num_tokens": 100911.0, "step": 120 }, { "entropy": 9.406207180023193, "epoch": 0.002793077636385981, "grad_norm": 1.765625, "learning_rate": 6.2e-05, "loss": 7.8101, "mean_token_accuracy": 0.08597532883286477, "num_tokens": 104785.0, "step": 125 }, { "entropy": 9.198468017578126, "epoch": 0.0029048007418414202, "grad_norm": 2.265625, "learning_rate": 6.450000000000001e-05, "loss": 7.7507, "mean_token_accuracy": 0.08100780844688416, "num_tokens": 109434.0, "step": 130 }, { "entropy": 9.137882709503174, "epoch": 0.0030165238472968595, "grad_norm": 1.734375, "learning_rate": 6.7e-05, "loss": 7.7526, "mean_token_accuracy": 0.08647556751966476, "num_tokens": 113869.0, "step": 135 }, { "entropy": 8.982115554809571, "epoch": 0.003128246952752299, "grad_norm": 1.828125, "learning_rate": 6.950000000000001e-05, "loss": 7.6855, "mean_token_accuracy": 0.0863442875444889, "num_tokens": 118332.0, "step": 140 }, { "entropy": 8.803977680206298, "epoch": 0.003239970058207738, "grad_norm": 1.8828125, "learning_rate": 7.2e-05, "loss": 7.5951, "mean_token_accuracy": 0.07965997867286205, "num_tokens": 122140.0, "step": 145 }, { "entropy": 8.717557144165038, "epoch": 0.003351693163663177, "grad_norm": 1.796875, "learning_rate": 7.45e-05, "loss": 7.4489, "mean_token_accuracy": 0.08853708282113075, "num_tokens": 126515.0, "step": 150 }, { "entropy": 8.480121898651124, "epoch": 0.0034634162691186163, "grad_norm": 1.9375, "learning_rate": 7.7e-05, "loss": 7.5078, "mean_token_accuracy": 0.0842710092663765, "num_tokens": 130397.0, "step": 155 }, { "entropy": 8.55941562652588, "epoch": 0.0035751393745740555, "grad_norm": 1.796875, "learning_rate": 7.950000000000001e-05, "loss": 7.448, "mean_token_accuracy": 0.086439348757267, "num_tokens": 134428.0, "step": 160 }, { "entropy": 8.38999900817871, "epoch": 0.003686862480029495, "grad_norm": 2.0625, "learning_rate": 8.2e-05, "loss": 7.3523, "mean_token_accuracy": 0.09324855357408524, "num_tokens": 138294.0, "step": 165 }, { "entropy": 8.155976009368896, "epoch": 0.003798585585484934, "grad_norm": 1.4140625, "learning_rate": 8.450000000000001e-05, "loss": 7.3474, "mean_token_accuracy": 0.08743810728192329, "num_tokens": 142750.0, "step": 170 }, { "entropy": 8.256286525726319, "epoch": 0.003910308690940373, "grad_norm": 1.5390625, "learning_rate": 8.7e-05, "loss": 7.3177, "mean_token_accuracy": 0.08836911171674729, "num_tokens": 147220.0, "step": 175 }, { "entropy": 7.98900089263916, "epoch": 0.004022031796395813, "grad_norm": 1.765625, "learning_rate": 8.95e-05, "loss": 7.2059, "mean_token_accuracy": 0.09879823476076126, "num_tokens": 151396.0, "step": 180 }, { "entropy": 8.085029649734498, "epoch": 0.0041337549018512516, "grad_norm": 1.859375, "learning_rate": 9.2e-05, "loss": 7.2565, "mean_token_accuracy": 0.0990697756409645, "num_tokens": 155336.0, "step": 185 }, { "entropy": 8.046411085128785, "epoch": 0.004245478007306691, "grad_norm": 3.03125, "learning_rate": 9.45e-05, "loss": 7.2963, "mean_token_accuracy": 0.08894443586468696, "num_tokens": 159752.0, "step": 190 }, { "entropy": 8.043665552139283, "epoch": 0.00435720111276213, "grad_norm": 1.671875, "learning_rate": 9.7e-05, "loss": 7.3874, "mean_token_accuracy": 0.08465041853487491, "num_tokens": 163895.0, "step": 195 }, { "entropy": 7.914860630035401, "epoch": 0.00446892421821757, "grad_norm": 1.3984375, "learning_rate": 9.95e-05, "loss": 7.1927, "mean_token_accuracy": 0.093280029296875, "num_tokens": 168312.0, "step": 200 }, { "entropy": 7.915866088867188, "epoch": 0.004580647323673009, "grad_norm": 1.9375, "learning_rate": 0.000102, "loss": 7.2334, "mean_token_accuracy": 0.09746119827032089, "num_tokens": 172358.0, "step": 205 }, { "entropy": 7.660448884963989, "epoch": 0.0046923704291284484, "grad_norm": 1.671875, "learning_rate": 0.00010449999999999999, "loss": 7.2206, "mean_token_accuracy": 0.09569770470261574, "num_tokens": 177085.0, "step": 210 }, { "entropy": 7.943923139572144, "epoch": 0.004804093534583887, "grad_norm": 2.015625, "learning_rate": 0.000107, "loss": 7.3482, "mean_token_accuracy": 0.08808798864483833, "num_tokens": 181410.0, "step": 215 }, { "entropy": 7.640953445434571, "epoch": 0.004915816640039326, "grad_norm": 1.6875, "learning_rate": 0.0001095, "loss": 7.0931, "mean_token_accuracy": 0.0959208883345127, "num_tokens": 185649.0, "step": 220 }, { "entropy": 7.714695310592651, "epoch": 0.005027539745494766, "grad_norm": 1.609375, "learning_rate": 0.000112, "loss": 7.1461, "mean_token_accuracy": 0.09635853916406631, "num_tokens": 190055.0, "step": 225 }, { "entropy": 7.722128820419312, "epoch": 0.005139262850950205, "grad_norm": 1.8125, "learning_rate": 0.0001145, "loss": 7.1545, "mean_token_accuracy": 0.10052503794431686, "num_tokens": 194267.0, "step": 230 }, { "entropy": 7.67925763130188, "epoch": 0.0052509859564056445, "grad_norm": 1.78125, "learning_rate": 0.00011700000000000001, "loss": 7.0976, "mean_token_accuracy": 0.09923605695366859, "num_tokens": 198483.0, "step": 235 }, { "entropy": 7.5812575340271, "epoch": 0.005362709061861083, "grad_norm": 1.5703125, "learning_rate": 0.00011949999999999999, "loss": 7.0173, "mean_token_accuracy": 0.10283883661031723, "num_tokens": 202514.0, "step": 240 }, { "entropy": 7.598950576782227, "epoch": 0.005474432167316523, "grad_norm": 1.796875, "learning_rate": 0.000122, "loss": 7.1592, "mean_token_accuracy": 0.09925142973661423, "num_tokens": 206748.0, "step": 245 }, { "entropy": 7.573145723342895, "epoch": 0.005586155272771962, "grad_norm": 1.875, "learning_rate": 0.0001245, "loss": 7.0229, "mean_token_accuracy": 0.10259764194488526, "num_tokens": 210981.0, "step": 250 }, { "entropy": 7.5371081829071045, "epoch": 0.005697878378227402, "grad_norm": 1.5859375, "learning_rate": 0.000127, "loss": 7.1679, "mean_token_accuracy": 0.09469496235251426, "num_tokens": 215551.0, "step": 255 }, { "entropy": 7.520426607131958, "epoch": 0.0058096014836828405, "grad_norm": 1.453125, "learning_rate": 0.0001295, "loss": 6.9739, "mean_token_accuracy": 0.11107034981250763, "num_tokens": 219677.0, "step": 260 }, { "entropy": 7.612557506561279, "epoch": 0.005921324589138279, "grad_norm": 1.75, "learning_rate": 0.000132, "loss": 7.072, "mean_token_accuracy": 0.10267340168356895, "num_tokens": 223457.0, "step": 265 }, { "entropy": 7.546310329437256, "epoch": 0.006033047694593719, "grad_norm": 1.734375, "learning_rate": 0.00013450000000000002, "loss": 6.9226, "mean_token_accuracy": 0.1154308445751667, "num_tokens": 227135.0, "step": 270 }, { "entropy": 7.572003746032715, "epoch": 0.006144770800049158, "grad_norm": 1.6328125, "learning_rate": 0.00013700000000000002, "loss": 7.1372, "mean_token_accuracy": 0.09673138484358787, "num_tokens": 231393.0, "step": 275 }, { "entropy": 7.611022663116455, "epoch": 0.006256493905504598, "grad_norm": 1.6484375, "learning_rate": 0.0001395, "loss": 7.1052, "mean_token_accuracy": 0.10218687430024147, "num_tokens": 235959.0, "step": 280 }, { "entropy": 7.403985118865966, "epoch": 0.0063682170109600365, "grad_norm": 1.734375, "learning_rate": 0.00014199999999999998, "loss": 6.9434, "mean_token_accuracy": 0.10860099717974663, "num_tokens": 239875.0, "step": 285 }, { "entropy": 7.420692682266235, "epoch": 0.006479940116415476, "grad_norm": 1.4765625, "learning_rate": 0.0001445, "loss": 7.0656, "mean_token_accuracy": 0.11386927664279937, "num_tokens": 244397.0, "step": 290 }, { "entropy": 7.5308808326721195, "epoch": 0.006591663221870915, "grad_norm": 1.6015625, "learning_rate": 0.000147, "loss": 7.0, "mean_token_accuracy": 0.10292632281780242, "num_tokens": 248441.0, "step": 295 }, { "entropy": 7.551111650466919, "epoch": 0.006703386327326354, "grad_norm": 2.0625, "learning_rate": 0.0001495, "loss": 7.0078, "mean_token_accuracy": 0.10877085924148559, "num_tokens": 252693.0, "step": 300 }, { "entropy": 7.420186233520508, "epoch": 0.006815109432781794, "grad_norm": 1.96875, "learning_rate": 0.000152, "loss": 6.9778, "mean_token_accuracy": 0.1077166736125946, "num_tokens": 257135.0, "step": 305 }, { "entropy": 7.455549049377441, "epoch": 0.0069268325382372325, "grad_norm": 1.7421875, "learning_rate": 0.00015450000000000001, "loss": 7.101, "mean_token_accuracy": 0.09917000532150269, "num_tokens": 261919.0, "step": 310 }, { "entropy": 7.428725242614746, "epoch": 0.007038555643692672, "grad_norm": 1.71875, "learning_rate": 0.000157, "loss": 7.0018, "mean_token_accuracy": 0.1032940112054348, "num_tokens": 266656.0, "step": 315 }, { "entropy": 7.4056861877441404, "epoch": 0.007150278749148111, "grad_norm": 1.484375, "learning_rate": 0.0001595, "loss": 6.9649, "mean_token_accuracy": 0.10402853935956954, "num_tokens": 270879.0, "step": 320 }, { "entropy": 7.356624603271484, "epoch": 0.007262001854603551, "grad_norm": 1.65625, "learning_rate": 0.000162, "loss": 6.9156, "mean_token_accuracy": 0.11899577528238296, "num_tokens": 274884.0, "step": 325 }, { "entropy": 7.359720230102539, "epoch": 0.00737372496005899, "grad_norm": 1.6953125, "learning_rate": 0.00016450000000000001, "loss": 6.8492, "mean_token_accuracy": 0.10880193561315536, "num_tokens": 279096.0, "step": 330 }, { "entropy": 7.420133590698242, "epoch": 0.007485448065514429, "grad_norm": 1.875, "learning_rate": 0.00016700000000000002, "loss": 6.9547, "mean_token_accuracy": 0.10481383726000786, "num_tokens": 282923.0, "step": 335 }, { "entropy": 7.375938367843628, "epoch": 0.007597171170969868, "grad_norm": 1.5078125, "learning_rate": 0.00016950000000000003, "loss": 6.8854, "mean_token_accuracy": 0.11555279865860939, "num_tokens": 287283.0, "step": 340 }, { "entropy": 7.266809701919556, "epoch": 0.007708894276425307, "grad_norm": 1.671875, "learning_rate": 0.00017199999999999998, "loss": 6.8566, "mean_token_accuracy": 0.11106687858700752, "num_tokens": 291409.0, "step": 345 }, { "entropy": 7.351815128326416, "epoch": 0.007820617381880746, "grad_norm": 1.640625, "learning_rate": 0.00017449999999999999, "loss": 6.9102, "mean_token_accuracy": 0.10942614153027534, "num_tokens": 295157.0, "step": 350 }, { "entropy": 7.481018209457398, "epoch": 0.007932340487336187, "grad_norm": 1.9765625, "learning_rate": 0.000177, "loss": 6.9203, "mean_token_accuracy": 0.10715582817792893, "num_tokens": 299370.0, "step": 355 }, { "entropy": 7.2193928241729735, "epoch": 0.008044063592791625, "grad_norm": 1.765625, "learning_rate": 0.0001795, "loss": 6.9256, "mean_token_accuracy": 0.11601178944110871, "num_tokens": 303955.0, "step": 360 }, { "entropy": 7.46614179611206, "epoch": 0.008155786698247064, "grad_norm": 2.28125, "learning_rate": 0.000182, "loss": 6.8992, "mean_token_accuracy": 0.11738249063491821, "num_tokens": 308047.0, "step": 365 }, { "entropy": 7.339001560211182, "epoch": 0.008267509803702503, "grad_norm": 1.8359375, "learning_rate": 0.0001845, "loss": 6.8353, "mean_token_accuracy": 0.12007508799433708, "num_tokens": 312050.0, "step": 370 }, { "entropy": 7.393199253082275, "epoch": 0.008379232909157944, "grad_norm": 1.6015625, "learning_rate": 0.000187, "loss": 6.789, "mean_token_accuracy": 0.11748188808560371, "num_tokens": 315901.0, "step": 375 }, { "entropy": 7.206725311279297, "epoch": 0.008490956014613383, "grad_norm": 1.5390625, "learning_rate": 0.0001895, "loss": 6.8387, "mean_token_accuracy": 0.11932774782180786, "num_tokens": 320077.0, "step": 380 }, { "entropy": 7.309018516540528, "epoch": 0.008602679120068821, "grad_norm": 1.859375, "learning_rate": 0.000192, "loss": 6.7772, "mean_token_accuracy": 0.12389342486858368, "num_tokens": 324365.0, "step": 385 }, { "entropy": 7.1502117156982425, "epoch": 0.00871440222552426, "grad_norm": 1.7421875, "learning_rate": 0.0001945, "loss": 6.7342, "mean_token_accuracy": 0.12538171485066413, "num_tokens": 327971.0, "step": 390 }, { "entropy": 7.207239198684692, "epoch": 0.0088261253309797, "grad_norm": 1.8046875, "learning_rate": 0.00019700000000000002, "loss": 6.7814, "mean_token_accuracy": 0.12070702090859413, "num_tokens": 331791.0, "step": 395 }, { "entropy": 7.188077354431153, "epoch": 0.00893784843643514, "grad_norm": 1.7265625, "learning_rate": 0.00019950000000000002, "loss": 6.8347, "mean_token_accuracy": 0.11772776916623115, "num_tokens": 335616.0, "step": 400 }, { "entropy": 7.238067245483398, "epoch": 0.009049571541890579, "grad_norm": 1.5, "learning_rate": 0.000202, "loss": 6.7448, "mean_token_accuracy": 0.12914832159876824, "num_tokens": 339815.0, "step": 405 }, { "entropy": 7.271863889694214, "epoch": 0.009161294647346017, "grad_norm": 1.6875, "learning_rate": 0.00020449999999999998, "loss": 6.7314, "mean_token_accuracy": 0.12098882421851158, "num_tokens": 344045.0, "step": 410 }, { "entropy": 7.054260921478272, "epoch": 0.009273017752801456, "grad_norm": 1.9296875, "learning_rate": 0.000207, "loss": 6.8258, "mean_token_accuracy": 0.12370770499110222, "num_tokens": 348726.0, "step": 415 }, { "entropy": 7.25892219543457, "epoch": 0.009384740858256897, "grad_norm": 1.609375, "learning_rate": 0.0002095, "loss": 6.811, "mean_token_accuracy": 0.12439991980791092, "num_tokens": 353228.0, "step": 420 }, { "entropy": 7.089362478256225, "epoch": 0.009496463963712336, "grad_norm": 1.65625, "learning_rate": 0.000212, "loss": 6.7731, "mean_token_accuracy": 0.12979045361280442, "num_tokens": 357379.0, "step": 425 }, { "entropy": 7.264574861526489, "epoch": 0.009608187069167775, "grad_norm": 2.015625, "learning_rate": 0.0002145, "loss": 6.7426, "mean_token_accuracy": 0.11879147663712501, "num_tokens": 361347.0, "step": 430 }, { "entropy": 7.1300811767578125, "epoch": 0.009719910174623213, "grad_norm": 1.7265625, "learning_rate": 0.00021700000000000002, "loss": 6.7019, "mean_token_accuracy": 0.12289151027798653, "num_tokens": 365364.0, "step": 435 }, { "entropy": 7.1097527027130125, "epoch": 0.009831633280078652, "grad_norm": 1.6171875, "learning_rate": 0.0002195, "loss": 6.7534, "mean_token_accuracy": 0.12068467438220978, "num_tokens": 369648.0, "step": 440 }, { "entropy": 7.229344892501831, "epoch": 0.009943356385534093, "grad_norm": 1.578125, "learning_rate": 0.000222, "loss": 6.7309, "mean_token_accuracy": 0.12263526245951653, "num_tokens": 373734.0, "step": 445 }, { "entropy": 7.1849524021148685, "epoch": 0.010055079490989532, "grad_norm": 1.765625, "learning_rate": 0.0002245, "loss": 6.7276, "mean_token_accuracy": 0.12742977142333983, "num_tokens": 378184.0, "step": 450 }, { "entropy": 7.064081621170044, "epoch": 0.01016680259644497, "grad_norm": 1.546875, "learning_rate": 0.00022700000000000002, "loss": 6.8377, "mean_token_accuracy": 0.12056938409805298, "num_tokens": 382686.0, "step": 455 }, { "entropy": 7.035848474502563, "epoch": 0.01027852570190041, "grad_norm": 1.84375, "learning_rate": 0.00022950000000000002, "loss": 6.7467, "mean_token_accuracy": 0.13145566657185553, "num_tokens": 387210.0, "step": 460 }, { "entropy": 7.06201696395874, "epoch": 0.01039024880735585, "grad_norm": 1.734375, "learning_rate": 0.00023200000000000003, "loss": 6.7263, "mean_token_accuracy": 0.12420300841331482, "num_tokens": 391247.0, "step": 465 }, { "entropy": 7.2231800079345705, "epoch": 0.010501971912811289, "grad_norm": 1.8125, "learning_rate": 0.00023449999999999998, "loss": 6.6101, "mean_token_accuracy": 0.12484818920493126, "num_tokens": 395188.0, "step": 470 }, { "entropy": 6.963715267181397, "epoch": 0.010613695018266728, "grad_norm": 1.7734375, "learning_rate": 0.000237, "loss": 6.6759, "mean_token_accuracy": 0.1323227606713772, "num_tokens": 399513.0, "step": 475 }, { "entropy": 7.180826234817505, "epoch": 0.010725418123722167, "grad_norm": 1.6875, "learning_rate": 0.0002395, "loss": 6.7397, "mean_token_accuracy": 0.1241152174770832, "num_tokens": 404052.0, "step": 480 }, { "entropy": 7.000790357589722, "epoch": 0.010837141229177606, "grad_norm": 1.6875, "learning_rate": 0.000242, "loss": 6.6031, "mean_token_accuracy": 0.13010914325714112, "num_tokens": 408299.0, "step": 485 }, { "entropy": 6.951791143417358, "epoch": 0.010948864334633046, "grad_norm": 1.890625, "learning_rate": 0.0002445, "loss": 6.597, "mean_token_accuracy": 0.13655143678188325, "num_tokens": 412376.0, "step": 490 }, { "entropy": 6.940329837799072, "epoch": 0.011060587440088485, "grad_norm": 1.5, "learning_rate": 0.000247, "loss": 6.6731, "mean_token_accuracy": 0.13289386332035064, "num_tokens": 417010.0, "step": 495 }, { "entropy": 7.088097476959229, "epoch": 0.011172310545543924, "grad_norm": 1.796875, "learning_rate": 0.0002495, "loss": 6.5194, "mean_token_accuracy": 0.14706601724028587, "num_tokens": 421167.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 614281236480000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }