{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.30789066032925055, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.1113718893378972, "epoch": 0.0015394533016462528, "grad_norm": 23.25, "learning_rate": 2.666666666666667e-07, "loss": 1.4148, "mean_token_accuracy": 0.6499394655227662, "num_tokens": 379552.0, "step": 5 }, { "entropy": 1.1505246445536614, "epoch": 0.0030789066032925055, "grad_norm": 25.375, "learning_rate": 6.000000000000001e-07, "loss": 1.4742, "mean_token_accuracy": 0.6414433296769857, "num_tokens": 743248.0, "step": 10 }, { "entropy": 1.1535595946013928, "epoch": 0.004618359904938758, "grad_norm": 24.0, "learning_rate": 9.333333333333334e-07, "loss": 1.4559, "mean_token_accuracy": 0.6436704084277153, "num_tokens": 1124191.0, "step": 15 }, { "entropy": 1.1471380971372127, "epoch": 0.006157813206585011, "grad_norm": 21.5, "learning_rate": 1.2666666666666669e-06, "loss": 1.4609, "mean_token_accuracy": 0.642368745803833, "num_tokens": 1488145.0, "step": 20 }, { "entropy": 1.155402697250247, "epoch": 0.007697266508231265, "grad_norm": 18.25, "learning_rate": 1.6000000000000001e-06, "loss": 1.4329, "mean_token_accuracy": 0.6484112951904535, "num_tokens": 1860647.0, "step": 25 }, { "entropy": 1.1452072311192751, "epoch": 0.009236719809877517, "grad_norm": 17.25, "learning_rate": 1.9333333333333336e-06, "loss": 1.3712, "mean_token_accuracy": 0.6529930120334029, "num_tokens": 2245973.0, "step": 30 }, { "entropy": 1.123310711979866, "epoch": 0.01077617311152377, "grad_norm": 13.8125, "learning_rate": 2.266666666666667e-06, "loss": 1.3082, "mean_token_accuracy": 0.6658382505178452, "num_tokens": 2631053.0, "step": 35 }, { "entropy": 1.1543800953775645, "epoch": 0.012315626413170022, "grad_norm": 8.75, "learning_rate": 2.6e-06, "loss": 1.2982, "mean_token_accuracy": 0.6618854686617851, "num_tokens": 2992829.0, "step": 40 }, { "entropy": 1.1680023059248925, "epoch": 0.013855079714816277, "grad_norm": 6.1875, "learning_rate": 2.9333333333333338e-06, "loss": 1.2948, "mean_token_accuracy": 0.6657806046307087, "num_tokens": 3382112.0, "step": 45 }, { "entropy": 1.147538623958826, "epoch": 0.01539453301646253, "grad_norm": 5.375, "learning_rate": 3.266666666666667e-06, "loss": 1.2509, "mean_token_accuracy": 0.675503570586443, "num_tokens": 3764785.0, "step": 50 }, { "entropy": 1.107958966679871, "epoch": 0.01693398631810878, "grad_norm": 4.90625, "learning_rate": 3.6000000000000003e-06, "loss": 1.1997, "mean_token_accuracy": 0.6811204344034195, "num_tokens": 4126394.0, "step": 55 }, { "entropy": 1.1157011151313783, "epoch": 0.018473439619755033, "grad_norm": 2.265625, "learning_rate": 3.9333333333333335e-06, "loss": 1.193, "mean_token_accuracy": 0.6808499224483967, "num_tokens": 4510149.0, "step": 60 }, { "entropy": 1.1392802488058806, "epoch": 0.020012892921401286, "grad_norm": 1.1953125, "learning_rate": 4.266666666666668e-06, "loss": 1.1903, "mean_token_accuracy": 0.6806150872260333, "num_tokens": 4875984.0, "step": 65 }, { "entropy": 1.1204315345734357, "epoch": 0.02155234622304754, "grad_norm": 1.0078125, "learning_rate": 4.600000000000001e-06, "loss": 1.1621, "mean_token_accuracy": 0.6908985383808612, "num_tokens": 5251973.0, "step": 70 }, { "entropy": 1.1343737579882145, "epoch": 0.02309179952469379, "grad_norm": 0.90234375, "learning_rate": 4.933333333333334e-06, "loss": 1.1367, "mean_token_accuracy": 0.6892836567014455, "num_tokens": 5622302.0, "step": 75 }, { "entropy": 1.138794292882085, "epoch": 0.024631252826340044, "grad_norm": 0.81640625, "learning_rate": 5.2666666666666665e-06, "loss": 1.1657, "mean_token_accuracy": 0.6916824176907539, "num_tokens": 5987467.0, "step": 80 }, { "entropy": 1.1140711281448603, "epoch": 0.0261707061279863, "grad_norm": 0.796875, "learning_rate": 5.600000000000001e-06, "loss": 1.1287, "mean_token_accuracy": 0.6946257088333369, "num_tokens": 6369083.0, "step": 85 }, { "entropy": 1.1451053522527217, "epoch": 0.027710159429632553, "grad_norm": 0.78515625, "learning_rate": 5.933333333333335e-06, "loss": 1.1546, "mean_token_accuracy": 0.6903918959200382, "num_tokens": 6749350.0, "step": 90 }, { "entropy": 1.1201870743185283, "epoch": 0.029249612731278806, "grad_norm": 0.7890625, "learning_rate": 6.266666666666668e-06, "loss": 1.1166, "mean_token_accuracy": 0.6962686065584421, "num_tokens": 7118012.0, "step": 95 }, { "entropy": 1.149271610751748, "epoch": 0.03078906603292506, "grad_norm": 0.796875, "learning_rate": 6.600000000000001e-06, "loss": 1.1534, "mean_token_accuracy": 0.6903159897774458, "num_tokens": 7486407.0, "step": 100 }, { "entropy": 1.1452004179358481, "epoch": 0.03232851933457131, "grad_norm": 0.74609375, "learning_rate": 6.9333333333333344e-06, "loss": 1.1658, "mean_token_accuracy": 0.6880020551383496, "num_tokens": 7853929.0, "step": 105 }, { "entropy": 1.133518392033875, "epoch": 0.03386797263621756, "grad_norm": 0.71484375, "learning_rate": 7.266666666666668e-06, "loss": 1.1477, "mean_token_accuracy": 0.691348098218441, "num_tokens": 8224258.0, "step": 110 }, { "entropy": 1.1419388929381966, "epoch": 0.035407425937863814, "grad_norm": 0.7734375, "learning_rate": 7.600000000000001e-06, "loss": 1.1499, "mean_token_accuracy": 0.6935681894421577, "num_tokens": 8601374.0, "step": 115 }, { "entropy": 1.1601579703390599, "epoch": 0.036946879239510066, "grad_norm": 0.7265625, "learning_rate": 7.933333333333334e-06, "loss": 1.1652, "mean_token_accuracy": 0.6893212374299764, "num_tokens": 8976860.0, "step": 120 }, { "entropy": 1.1541021421551705, "epoch": 0.03848633254115632, "grad_norm": 0.75, "learning_rate": 8.266666666666667e-06, "loss": 1.1553, "mean_token_accuracy": 0.6880058489739895, "num_tokens": 9342172.0, "step": 125 }, { "entropy": 1.1215011529624461, "epoch": 0.04002578584280257, "grad_norm": 0.73828125, "learning_rate": 8.6e-06, "loss": 1.11, "mean_token_accuracy": 0.6971393920481205, "num_tokens": 9711234.0, "step": 130 }, { "entropy": 1.1288955546915531, "epoch": 0.041565239144448825, "grad_norm": 0.69921875, "learning_rate": 8.933333333333333e-06, "loss": 1.1331, "mean_token_accuracy": 0.69485286436975, "num_tokens": 10092041.0, "step": 135 }, { "entropy": 1.1383998703211546, "epoch": 0.04310469244609508, "grad_norm": 0.71484375, "learning_rate": 9.266666666666667e-06, "loss": 1.1608, "mean_token_accuracy": 0.6917846284806728, "num_tokens": 10470367.0, "step": 140 }, { "entropy": 1.1720476493239402, "epoch": 0.04464414574774133, "grad_norm": 0.7890625, "learning_rate": 9.600000000000001e-06, "loss": 1.1643, "mean_token_accuracy": 0.6900354858487845, "num_tokens": 10840227.0, "step": 145 }, { "entropy": 1.1642087884247303, "epoch": 0.04618359904938758, "grad_norm": 0.765625, "learning_rate": 9.933333333333334e-06, "loss": 1.1662, "mean_token_accuracy": 0.6894872546195984, "num_tokens": 11212704.0, "step": 150 }, { "entropy": 1.1504485111683607, "epoch": 0.047723052351033836, "grad_norm": 0.734375, "learning_rate": 1.0266666666666668e-05, "loss": 1.1618, "mean_token_accuracy": 0.6902470916509629, "num_tokens": 11585050.0, "step": 155 }, { "entropy": 1.139546208642423, "epoch": 0.04926250565268009, "grad_norm": 0.71484375, "learning_rate": 1.0600000000000002e-05, "loss": 1.1371, "mean_token_accuracy": 0.6940638959407807, "num_tokens": 11955470.0, "step": 160 }, { "entropy": 1.1310970352962613, "epoch": 0.05080195895432634, "grad_norm": 0.73828125, "learning_rate": 1.0933333333333334e-05, "loss": 1.1217, "mean_token_accuracy": 0.697192519530654, "num_tokens": 12326414.0, "step": 165 }, { "entropy": 1.1263095822185278, "epoch": 0.0523414122559726, "grad_norm": 0.7109375, "learning_rate": 1.1266666666666668e-05, "loss": 1.1226, "mean_token_accuracy": 0.695407111570239, "num_tokens": 12699566.0, "step": 170 }, { "entropy": 1.1608664955943824, "epoch": 0.053880865557618854, "grad_norm": 0.6953125, "learning_rate": 1.16e-05, "loss": 1.156, "mean_token_accuracy": 0.6909525521099568, "num_tokens": 13076955.0, "step": 175 }, { "entropy": 1.1388528019189834, "epoch": 0.05542031885926511, "grad_norm": 0.7265625, "learning_rate": 1.1933333333333335e-05, "loss": 1.1475, "mean_token_accuracy": 0.6935607939958572, "num_tokens": 13457841.0, "step": 180 }, { "entropy": 1.1540386551991104, "epoch": 0.05695977216091136, "grad_norm": 0.71484375, "learning_rate": 1.2266666666666667e-05, "loss": 1.1501, "mean_token_accuracy": 0.690580427646637, "num_tokens": 13823331.0, "step": 185 }, { "entropy": 1.1634995128959418, "epoch": 0.05849922546255761, "grad_norm": 0.74609375, "learning_rate": 1.2600000000000001e-05, "loss": 1.1689, "mean_token_accuracy": 0.6883407317101955, "num_tokens": 14189829.0, "step": 190 }, { "entropy": 1.1286564406007529, "epoch": 0.060038678764203865, "grad_norm": 0.68359375, "learning_rate": 1.2933333333333334e-05, "loss": 1.1091, "mean_token_accuracy": 0.6968111153692007, "num_tokens": 14568687.0, "step": 195 }, { "entropy": 1.0947596225887537, "epoch": 0.06157813206585012, "grad_norm": 0.73828125, "learning_rate": 1.3266666666666668e-05, "loss": 1.0865, "mean_token_accuracy": 0.7018399801105261, "num_tokens": 14956883.0, "step": 200 }, { "entropy": 1.105372793599963, "epoch": 0.06311758536749637, "grad_norm": 0.76171875, "learning_rate": 1.3600000000000002e-05, "loss": 1.098, "mean_token_accuracy": 0.7011617802083492, "num_tokens": 15329120.0, "step": 205 }, { "entropy": 1.1237883031368257, "epoch": 0.06465703866914262, "grad_norm": 0.73828125, "learning_rate": 1.3933333333333334e-05, "loss": 1.1159, "mean_token_accuracy": 0.6975264508277178, "num_tokens": 15706521.0, "step": 210 }, { "entropy": 1.1330916548147798, "epoch": 0.06619649197078888, "grad_norm": 0.76953125, "learning_rate": 1.4266666666666668e-05, "loss": 1.1323, "mean_token_accuracy": 0.6972741197794676, "num_tokens": 16066978.0, "step": 215 }, { "entropy": 1.1772997351363301, "epoch": 0.06773594527243512, "grad_norm": 0.7421875, "learning_rate": 1.46e-05, "loss": 1.1734, "mean_token_accuracy": 0.6860150098800659, "num_tokens": 16449339.0, "step": 220 }, { "entropy": 1.158057621307671, "epoch": 0.06927539857408138, "grad_norm": 0.73828125, "learning_rate": 1.4933333333333335e-05, "loss": 1.1629, "mean_token_accuracy": 0.6880886014550924, "num_tokens": 16831396.0, "step": 225 }, { "entropy": 1.139371989108622, "epoch": 0.07081485187572763, "grad_norm": 0.75390625, "learning_rate": 1.5266666666666667e-05, "loss": 1.1223, "mean_token_accuracy": 0.6936335910111666, "num_tokens": 17210779.0, "step": 230 }, { "entropy": 1.1907519888132811, "epoch": 0.07235430517737389, "grad_norm": 0.78515625, "learning_rate": 1.5600000000000003e-05, "loss": 1.187, "mean_token_accuracy": 0.6834761939942837, "num_tokens": 17582881.0, "step": 235 }, { "entropy": 1.1354382883757352, "epoch": 0.07389375847902013, "grad_norm": 0.765625, "learning_rate": 1.5933333333333336e-05, "loss": 1.1418, "mean_token_accuracy": 0.6936424177139997, "num_tokens": 17952831.0, "step": 240 }, { "entropy": 1.131275094114244, "epoch": 0.07543321178066639, "grad_norm": 0.68359375, "learning_rate": 1.6266666666666668e-05, "loss": 1.1324, "mean_token_accuracy": 0.6951741587370635, "num_tokens": 18341435.0, "step": 245 }, { "entropy": 1.1359387850388885, "epoch": 0.07697266508231264, "grad_norm": 0.7109375, "learning_rate": 1.66e-05, "loss": 1.1273, "mean_token_accuracy": 0.6938830468803644, "num_tokens": 18710959.0, "step": 250 }, { "entropy": 1.1200769424438477, "epoch": 0.0785121183839589, "grad_norm": 0.75390625, "learning_rate": 1.6933333333333336e-05, "loss": 1.1116, "mean_token_accuracy": 0.698444551974535, "num_tokens": 19077026.0, "step": 255 }, { "entropy": 1.144037862494588, "epoch": 0.08005157168560514, "grad_norm": 0.6953125, "learning_rate": 1.726666666666667e-05, "loss": 1.1399, "mean_token_accuracy": 0.694709181971848, "num_tokens": 19433930.0, "step": 260 }, { "entropy": 1.1314732745289802, "epoch": 0.0815910249872514, "grad_norm": 0.7421875, "learning_rate": 1.76e-05, "loss": 1.1265, "mean_token_accuracy": 0.6972466479986906, "num_tokens": 19801472.0, "step": 265 }, { "entropy": 1.1006763726472855, "epoch": 0.08313047828889765, "grad_norm": 0.734375, "learning_rate": 1.7933333333333333e-05, "loss": 1.0907, "mean_token_accuracy": 0.7027702957391739, "num_tokens": 20178765.0, "step": 270 }, { "entropy": 1.1250910840928554, "epoch": 0.08466993159054391, "grad_norm": 0.6640625, "learning_rate": 1.826666666666667e-05, "loss": 1.1259, "mean_token_accuracy": 0.6969286557286978, "num_tokens": 20540840.0, "step": 275 }, { "entropy": 1.1310079213231803, "epoch": 0.08620938489219016, "grad_norm": 0.734375, "learning_rate": 1.86e-05, "loss": 1.1182, "mean_token_accuracy": 0.6943910989910365, "num_tokens": 20917703.0, "step": 280 }, { "entropy": 1.1366374537348747, "epoch": 0.08774883819383641, "grad_norm": 0.76953125, "learning_rate": 1.8933333333333334e-05, "loss": 1.1538, "mean_token_accuracy": 0.692281323671341, "num_tokens": 21286716.0, "step": 285 }, { "entropy": 1.1471243999898433, "epoch": 0.08928829149548266, "grad_norm": 0.73828125, "learning_rate": 1.926666666666667e-05, "loss": 1.1422, "mean_token_accuracy": 0.6914283595979214, "num_tokens": 21672957.0, "step": 290 }, { "entropy": 1.0941655661910772, "epoch": 0.09082774479712892, "grad_norm": 0.734375, "learning_rate": 1.9600000000000002e-05, "loss": 1.0918, "mean_token_accuracy": 0.703205331414938, "num_tokens": 22057533.0, "step": 295 }, { "entropy": 1.1071835961192846, "epoch": 0.09236719809877517, "grad_norm": 0.70703125, "learning_rate": 1.9933333333333334e-05, "loss": 1.1111, "mean_token_accuracy": 0.6998405870050192, "num_tokens": 22435546.0, "step": 300 }, { "entropy": 1.1055552622303366, "epoch": 0.09390665140042143, "grad_norm": 0.70703125, "learning_rate": 1.9999991608372392e-05, "loss": 1.0997, "mean_token_accuracy": 0.7011382140219211, "num_tokens": 22797277.0, "step": 305 }, { "entropy": 1.1513552486896514, "epoch": 0.09544610470206767, "grad_norm": 0.76953125, "learning_rate": 1.9999957517409375e-05, "loss": 1.1525, "mean_token_accuracy": 0.6906207267194986, "num_tokens": 23157199.0, "step": 310 }, { "entropy": 1.1360066479071975, "epoch": 0.09698555800371393, "grad_norm": 0.74609375, "learning_rate": 1.9999897202723546e-05, "loss": 1.1269, "mean_token_accuracy": 0.6963287502527237, "num_tokens": 23542710.0, "step": 315 }, { "entropy": 1.1110562330111862, "epoch": 0.09852501130536018, "grad_norm": 0.734375, "learning_rate": 1.999981066447308e-05, "loss": 1.103, "mean_token_accuracy": 0.700805151462555, "num_tokens": 23929848.0, "step": 320 }, { "entropy": 1.0776942696422338, "epoch": 0.10006446460700644, "grad_norm": 0.70703125, "learning_rate": 1.999969790288491e-05, "loss": 1.0754, "mean_token_accuracy": 0.706406794860959, "num_tokens": 24320781.0, "step": 325 }, { "entropy": 1.1285138919949531, "epoch": 0.10160391790865268, "grad_norm": 0.69140625, "learning_rate": 1.9999558918254746e-05, "loss": 1.1159, "mean_token_accuracy": 0.6957792080938816, "num_tokens": 24718182.0, "step": 330 }, { "entropy": 1.1143408741801977, "epoch": 0.10314337121029894, "grad_norm": 0.71875, "learning_rate": 1.999939371094705e-05, "loss": 1.1132, "mean_token_accuracy": 0.6973476313054562, "num_tokens": 25078136.0, "step": 335 }, { "entropy": 1.1544642113149166, "epoch": 0.1046828245119452, "grad_norm": 0.71484375, "learning_rate": 1.9999202281395064e-05, "loss": 1.1505, "mean_token_accuracy": 0.6898461397737264, "num_tokens": 25462544.0, "step": 340 }, { "entropy": 1.110057471320033, "epoch": 0.10622227781359145, "grad_norm": 0.69921875, "learning_rate": 1.999898463010079e-05, "loss": 1.1093, "mean_token_accuracy": 0.696648533269763, "num_tokens": 25832507.0, "step": 345 }, { "entropy": 1.121138433739543, "epoch": 0.10776173111523771, "grad_norm": 0.765625, "learning_rate": 1.9998740757634998e-05, "loss": 1.1206, "mean_token_accuracy": 0.695626575127244, "num_tokens": 26208168.0, "step": 350 }, { "entropy": 1.1249326327815652, "epoch": 0.10930118441688395, "grad_norm": 0.7109375, "learning_rate": 1.9998470664637205e-05, "loss": 1.1066, "mean_token_accuracy": 0.6976452205330134, "num_tokens": 26567141.0, "step": 355 }, { "entropy": 1.1190939696505666, "epoch": 0.11084063771853021, "grad_norm": 0.74609375, "learning_rate": 1.9998174351815704e-05, "loss": 1.109, "mean_token_accuracy": 0.696621885150671, "num_tokens": 26946409.0, "step": 360 }, { "entropy": 1.097430343925953, "epoch": 0.11238009102017646, "grad_norm": 0.7265625, "learning_rate": 1.9997851819947537e-05, "loss": 1.0981, "mean_token_accuracy": 0.6984185025095939, "num_tokens": 27323310.0, "step": 365 }, { "entropy": 1.1255185015499591, "epoch": 0.11391954432182272, "grad_norm": 0.7109375, "learning_rate": 1.9997503069878515e-05, "loss": 1.1021, "mean_token_accuracy": 0.6977558217942714, "num_tokens": 27728681.0, "step": 370 }, { "entropy": 1.1182758403941988, "epoch": 0.11545899762346896, "grad_norm": 0.7421875, "learning_rate": 1.9997128102523186e-05, "loss": 1.1144, "mean_token_accuracy": 0.6975483104586602, "num_tokens": 28099689.0, "step": 375 }, { "entropy": 1.0848099140450358, "epoch": 0.11699845092511522, "grad_norm": 0.69921875, "learning_rate": 1.9996726918864857e-05, "loss": 1.0807, "mean_token_accuracy": 0.7057063952088356, "num_tokens": 28470608.0, "step": 380 }, { "entropy": 1.147358151897788, "epoch": 0.11853790422676147, "grad_norm": 0.72265625, "learning_rate": 1.999629951995559e-05, "loss": 1.1361, "mean_token_accuracy": 0.6940991956740618, "num_tokens": 28850518.0, "step": 385 }, { "entropy": 1.158296991325915, "epoch": 0.12007735752840773, "grad_norm": 0.7109375, "learning_rate": 1.999584590691619e-05, "loss": 1.1613, "mean_token_accuracy": 0.6874197501689195, "num_tokens": 29223644.0, "step": 390 }, { "entropy": 1.1296958446502685, "epoch": 0.12161681083005398, "grad_norm": 0.7265625, "learning_rate": 1.9995366080936206e-05, "loss": 1.1062, "mean_token_accuracy": 0.6964040424674749, "num_tokens": 29597922.0, "step": 395 }, { "entropy": 1.1090093098580838, "epoch": 0.12315626413170024, "grad_norm": 0.70703125, "learning_rate": 1.9994860043273915e-05, "loss": 1.1119, "mean_token_accuracy": 0.6979490287601948, "num_tokens": 29967597.0, "step": 400 }, { "entropy": 1.1302901729941368, "epoch": 0.12469571743334648, "grad_norm": 0.7109375, "learning_rate": 1.999432779525635e-05, "loss": 1.113, "mean_token_accuracy": 0.6980737678706646, "num_tokens": 30351751.0, "step": 405 }, { "entropy": 1.0851911935955285, "epoch": 0.12623517073499274, "grad_norm": 0.7109375, "learning_rate": 1.999376933827927e-05, "loss": 1.0852, "mean_token_accuracy": 0.7041132722049952, "num_tokens": 30718524.0, "step": 410 }, { "entropy": 1.092500716075301, "epoch": 0.127774624036639, "grad_norm": 0.68359375, "learning_rate": 1.999318467380716e-05, "loss": 1.0757, "mean_token_accuracy": 0.7052585650235415, "num_tokens": 31099388.0, "step": 415 }, { "entropy": 1.1496953256428242, "epoch": 0.12931407733828523, "grad_norm": 0.7265625, "learning_rate": 1.9992573803373242e-05, "loss": 1.1516, "mean_token_accuracy": 0.6907676491886378, "num_tokens": 31461359.0, "step": 420 }, { "entropy": 1.1136517949402331, "epoch": 0.1308535306399315, "grad_norm": 0.71875, "learning_rate": 1.9991936728579438e-05, "loss": 1.1098, "mean_token_accuracy": 0.6990172352641821, "num_tokens": 31837580.0, "step": 425 }, { "entropy": 1.1240890389308333, "epoch": 0.13239298394157775, "grad_norm": 0.7265625, "learning_rate": 1.9991273451096414e-05, "loss": 1.1144, "mean_token_accuracy": 0.6938084073364734, "num_tokens": 32219381.0, "step": 430 }, { "entropy": 1.1162253782153129, "epoch": 0.133932437243224, "grad_norm": 0.73046875, "learning_rate": 1.9990583972663534e-05, "loss": 1.107, "mean_token_accuracy": 0.6976239930838346, "num_tokens": 32600761.0, "step": 435 }, { "entropy": 1.1294534251093864, "epoch": 0.13547189054487024, "grad_norm": 0.78515625, "learning_rate": 1.9989868295088876e-05, "loss": 1.1381, "mean_token_accuracy": 0.6945139471441507, "num_tokens": 32967708.0, "step": 440 }, { "entropy": 1.1337316358461975, "epoch": 0.1370113438465165, "grad_norm": 0.73828125, "learning_rate": 1.998912642024922e-05, "loss": 1.1376, "mean_token_accuracy": 0.6949200943112374, "num_tokens": 33348622.0, "step": 445 }, { "entropy": 1.1307091983035207, "epoch": 0.13855079714816276, "grad_norm": 0.74609375, "learning_rate": 1.9988358350090045e-05, "loss": 1.1169, "mean_token_accuracy": 0.6963778145611286, "num_tokens": 33718264.0, "step": 450 }, { "entropy": 1.1685293976217508, "epoch": 0.14009025044980902, "grad_norm": 0.71484375, "learning_rate": 1.998756408662553e-05, "loss": 1.1656, "mean_token_accuracy": 0.6891588238999248, "num_tokens": 34095351.0, "step": 455 }, { "entropy": 1.1300161950290204, "epoch": 0.14162970375145525, "grad_norm": 0.70703125, "learning_rate": 1.9986743631938536e-05, "loss": 1.1278, "mean_token_accuracy": 0.6970746215432883, "num_tokens": 34470308.0, "step": 460 }, { "entropy": 1.1416201300919055, "epoch": 0.14316915705310151, "grad_norm": 0.7265625, "learning_rate": 1.9985896988180607e-05, "loss": 1.1224, "mean_token_accuracy": 0.6962168168276548, "num_tokens": 34842571.0, "step": 465 }, { "entropy": 1.1438201934099197, "epoch": 0.14470861035474777, "grad_norm": 0.75, "learning_rate": 1.9985024157571972e-05, "loss": 1.146, "mean_token_accuracy": 0.6919929884374142, "num_tokens": 35212666.0, "step": 470 }, { "entropy": 1.1576870299875737, "epoch": 0.14624806365639403, "grad_norm": 0.69921875, "learning_rate": 1.998412514240152e-05, "loss": 1.1606, "mean_token_accuracy": 0.692124840989709, "num_tokens": 35593532.0, "step": 475 }, { "entropy": 1.1232300328090787, "epoch": 0.14778751695804027, "grad_norm": 0.74609375, "learning_rate": 1.9983199945026822e-05, "loss": 1.1198, "mean_token_accuracy": 0.6935272339731455, "num_tokens": 35980581.0, "step": 480 }, { "entropy": 1.1406380519270898, "epoch": 0.14932697025968653, "grad_norm": 0.7109375, "learning_rate": 1.9982248567874098e-05, "loss": 1.1303, "mean_token_accuracy": 0.6920850377529859, "num_tokens": 36366818.0, "step": 485 }, { "entropy": 1.1526461832225323, "epoch": 0.15086642356133279, "grad_norm": 0.69921875, "learning_rate": 1.998127101343822e-05, "loss": 1.1452, "mean_token_accuracy": 0.6928542651236057, "num_tokens": 36739879.0, "step": 490 }, { "entropy": 1.127664201334119, "epoch": 0.15240587686297905, "grad_norm": 0.69921875, "learning_rate": 1.9980267284282718e-05, "loss": 1.1309, "mean_token_accuracy": 0.6948033161461353, "num_tokens": 37126967.0, "step": 495 }, { "entropy": 1.1573752466589213, "epoch": 0.15394533016462528, "grad_norm": 0.75, "learning_rate": 1.9979237383039745e-05, "loss": 1.1486, "mean_token_accuracy": 0.6922336863353848, "num_tokens": 37491480.0, "step": 500 }, { "entropy": 1.1195718679577111, "epoch": 0.15548478346627154, "grad_norm": 0.70703125, "learning_rate": 1.9978181312410104e-05, "loss": 1.1097, "mean_token_accuracy": 0.6958762314170599, "num_tokens": 37855648.0, "step": 505 }, { "entropy": 1.1157226022332907, "epoch": 0.1570242367679178, "grad_norm": 0.70703125, "learning_rate": 1.9977099075163216e-05, "loss": 1.1044, "mean_token_accuracy": 0.6988037750124931, "num_tokens": 38239757.0, "step": 510 }, { "entropy": 1.1437922086566688, "epoch": 0.15856369006956406, "grad_norm": 0.66796875, "learning_rate": 1.997599067413712e-05, "loss": 1.1402, "mean_token_accuracy": 0.6914523551240563, "num_tokens": 38626774.0, "step": 515 }, { "entropy": 1.1398277616128325, "epoch": 0.1601031433712103, "grad_norm": 0.75390625, "learning_rate": 1.997485611223847e-05, "loss": 1.1292, "mean_token_accuracy": 0.6958260778337717, "num_tokens": 38999361.0, "step": 520 }, { "entropy": 1.1146018091589212, "epoch": 0.16164259667285655, "grad_norm": 0.765625, "learning_rate": 1.997369539244252e-05, "loss": 1.1124, "mean_token_accuracy": 0.7005707703530788, "num_tokens": 39381117.0, "step": 525 }, { "entropy": 1.1075803402811288, "epoch": 0.1631820499745028, "grad_norm": 0.71875, "learning_rate": 1.9972508517793125e-05, "loss": 1.1011, "mean_token_accuracy": 0.6986994445323944, "num_tokens": 39748243.0, "step": 530 }, { "entropy": 1.1309567619115115, "epoch": 0.16472150327614907, "grad_norm": 0.796875, "learning_rate": 1.9971295491402725e-05, "loss": 1.1364, "mean_token_accuracy": 0.6940356496721506, "num_tokens": 40115293.0, "step": 535 }, { "entropy": 1.18396236859262, "epoch": 0.1662609565777953, "grad_norm": 0.71484375, "learning_rate": 1.997005631645234e-05, "loss": 1.1725, "mean_token_accuracy": 0.686182476207614, "num_tokens": 40508440.0, "step": 540 }, { "entropy": 1.1049391619861126, "epoch": 0.16780040987944156, "grad_norm": 0.71484375, "learning_rate": 1.996879099619156e-05, "loss": 1.1144, "mean_token_accuracy": 0.696911821886897, "num_tokens": 40896598.0, "step": 545 }, { "entropy": 1.1429337464272975, "epoch": 0.16933986318108782, "grad_norm": 0.7265625, "learning_rate": 1.9967499533938544e-05, "loss": 1.136, "mean_token_accuracy": 0.6921508580446243, "num_tokens": 41271458.0, "step": 550 }, { "entropy": 1.1443469554185868, "epoch": 0.17087931648273408, "grad_norm": 0.71875, "learning_rate": 1.996618193308e-05, "loss": 1.133, "mean_token_accuracy": 0.6909565668553114, "num_tokens": 41652091.0, "step": 555 }, { "entropy": 1.1591787867248058, "epoch": 0.1724187697843803, "grad_norm": 0.6875, "learning_rate": 1.9964838197071173e-05, "loss": 1.1434, "mean_token_accuracy": 0.6915002010762692, "num_tokens": 42027815.0, "step": 560 }, { "entropy": 1.1327795442193747, "epoch": 0.17395822308602657, "grad_norm": 0.796875, "learning_rate": 1.9963468329435872e-05, "loss": 1.1364, "mean_token_accuracy": 0.6924004014581442, "num_tokens": 42390261.0, "step": 565 }, { "entropy": 1.1397675037384034, "epoch": 0.17549767638767283, "grad_norm": 0.734375, "learning_rate": 1.99620723337664e-05, "loss": 1.1406, "mean_token_accuracy": 0.6912539415061474, "num_tokens": 42759613.0, "step": 570 }, { "entropy": 1.107204508036375, "epoch": 0.1770371296893191, "grad_norm": 0.71875, "learning_rate": 1.9960650213723604e-05, "loss": 1.0852, "mean_token_accuracy": 0.6994996588677168, "num_tokens": 43132014.0, "step": 575 }, { "entropy": 1.099429708532989, "epoch": 0.17857658299096532, "grad_norm": 0.734375, "learning_rate": 1.9959201973036816e-05, "loss": 1.1041, "mean_token_accuracy": 0.7006071075797081, "num_tokens": 43518177.0, "step": 580 }, { "entropy": 1.1445161992684008, "epoch": 0.18011603629261158, "grad_norm": 0.71484375, "learning_rate": 1.995772761550389e-05, "loss": 1.1382, "mean_token_accuracy": 0.6925386656075716, "num_tokens": 43894430.0, "step": 585 }, { "entropy": 1.1534817535430193, "epoch": 0.18165548959425784, "grad_norm": 0.73046875, "learning_rate": 1.995622714499115e-05, "loss": 1.1493, "mean_token_accuracy": 0.6913147930055856, "num_tokens": 44258015.0, "step": 590 }, { "entropy": 1.1478193078190089, "epoch": 0.1831949428959041, "grad_norm": 0.7109375, "learning_rate": 1.9954700565433406e-05, "loss": 1.1502, "mean_token_accuracy": 0.6935486130416393, "num_tokens": 44636368.0, "step": 595 }, { "entropy": 1.1420258667320013, "epoch": 0.18473439619755033, "grad_norm": 0.6796875, "learning_rate": 1.9953147880833935e-05, "loss": 1.1395, "mean_token_accuracy": 0.693219494074583, "num_tokens": 45009190.0, "step": 600 }, { "entropy": 1.1204937249422073, "epoch": 0.1862738494991966, "grad_norm": 0.76953125, "learning_rate": 1.9951569095264473e-05, "loss": 1.1237, "mean_token_accuracy": 0.6966589823365211, "num_tokens": 45369198.0, "step": 605 }, { "entropy": 1.1316735215485096, "epoch": 0.18781330280084285, "grad_norm": 0.7578125, "learning_rate": 1.99499642128652e-05, "loss": 1.1151, "mean_token_accuracy": 0.6951681729406118, "num_tokens": 45735650.0, "step": 610 }, { "entropy": 1.119157313928008, "epoch": 0.1893527561024891, "grad_norm": 0.73828125, "learning_rate": 1.994833323784473e-05, "loss": 1.1205, "mean_token_accuracy": 0.6974445167928934, "num_tokens": 46105045.0, "step": 615 }, { "entropy": 1.1227743715047835, "epoch": 0.19089220940413534, "grad_norm": 0.74609375, "learning_rate": 1.9946676174480115e-05, "loss": 1.1122, "mean_token_accuracy": 0.6958862528204918, "num_tokens": 46468345.0, "step": 620 }, { "entropy": 1.123009406030178, "epoch": 0.1924316627057816, "grad_norm": 0.71484375, "learning_rate": 1.9944993027116798e-05, "loss": 1.1064, "mean_token_accuracy": 0.6993745014071464, "num_tokens": 46839653.0, "step": 625 }, { "entropy": 1.13520105779171, "epoch": 0.19397111600742786, "grad_norm": 0.734375, "learning_rate": 1.9943283800168643e-05, "loss": 1.1432, "mean_token_accuracy": 0.69097990244627, "num_tokens": 47218180.0, "step": 630 }, { "entropy": 1.1393942264840007, "epoch": 0.19551056930907412, "grad_norm": 0.72265625, "learning_rate": 1.9941548498117894e-05, "loss": 1.1382, "mean_token_accuracy": 0.6938273806124926, "num_tokens": 47595740.0, "step": 635 }, { "entropy": 1.1325588449835777, "epoch": 0.19705002261072035, "grad_norm": 0.7109375, "learning_rate": 1.9939787125515188e-05, "loss": 1.1298, "mean_token_accuracy": 0.6938525449484587, "num_tokens": 47982358.0, "step": 640 }, { "entropy": 1.121693492308259, "epoch": 0.19858947591236661, "grad_norm": 0.75, "learning_rate": 1.993799968697951e-05, "loss": 1.1191, "mean_token_accuracy": 0.6956870190799236, "num_tokens": 48372670.0, "step": 645 }, { "entropy": 1.1251621477305889, "epoch": 0.20012892921401287, "grad_norm": 0.76953125, "learning_rate": 1.9936186187198214e-05, "loss": 1.1236, "mean_token_accuracy": 0.6986733213067055, "num_tokens": 48737613.0, "step": 650 }, { "entropy": 1.139292366988957, "epoch": 0.20166838251565913, "grad_norm": 0.7109375, "learning_rate": 1.9934346630926988e-05, "loss": 1.1304, "mean_token_accuracy": 0.6938830778002739, "num_tokens": 49100209.0, "step": 655 }, { "entropy": 1.1345834810286761, "epoch": 0.20320783581730537, "grad_norm": 0.66796875, "learning_rate": 1.9932481022989857e-05, "loss": 1.1181, "mean_token_accuracy": 0.6951233502477407, "num_tokens": 49467553.0, "step": 660 }, { "entropy": 1.094562499411404, "epoch": 0.20474728911895163, "grad_norm": 0.76171875, "learning_rate": 1.993058936827916e-05, "loss": 1.0977, "mean_token_accuracy": 0.7043172724545002, "num_tokens": 49849811.0, "step": 665 }, { "entropy": 1.139369383826852, "epoch": 0.20628674242059789, "grad_norm": 0.73828125, "learning_rate": 1.992867167175554e-05, "loss": 1.1425, "mean_token_accuracy": 0.6948151815682649, "num_tokens": 50225933.0, "step": 670 }, { "entropy": 1.079656113870442, "epoch": 0.20782619572224414, "grad_norm": 0.6875, "learning_rate": 1.9926727938447935e-05, "loss": 1.0692, "mean_token_accuracy": 0.7051354993134737, "num_tokens": 50610063.0, "step": 675 }, { "entropy": 1.1766547793522477, "epoch": 0.2093656490238904, "grad_norm": 0.7109375, "learning_rate": 1.9924758173453555e-05, "loss": 1.1785, "mean_token_accuracy": 0.6878008231520653, "num_tokens": 50990235.0, "step": 680 }, { "entropy": 1.0988596007227898, "epoch": 0.21090510232553664, "grad_norm": 0.671875, "learning_rate": 1.992276238193788e-05, "loss": 1.0932, "mean_token_accuracy": 0.7026484467089176, "num_tokens": 51363981.0, "step": 685 }, { "entropy": 1.1409345027059317, "epoch": 0.2124445556271829, "grad_norm": 0.73046875, "learning_rate": 1.992074056913464e-05, "loss": 1.1352, "mean_token_accuracy": 0.6939107369631529, "num_tokens": 51737796.0, "step": 690 }, { "entropy": 1.120890161767602, "epoch": 0.21398400892882916, "grad_norm": 0.7109375, "learning_rate": 1.9918692740345804e-05, "loss": 1.1338, "mean_token_accuracy": 0.6986452504992485, "num_tokens": 52114356.0, "step": 695 }, { "entropy": 1.119481140933931, "epoch": 0.21552346223047542, "grad_norm": 0.74609375, "learning_rate": 1.9916618900941567e-05, "loss": 1.1131, "mean_token_accuracy": 0.6989668853580951, "num_tokens": 52484836.0, "step": 700 }, { "entropy": 1.0964285958558322, "epoch": 0.21706291553212165, "grad_norm": 0.71484375, "learning_rate": 1.991451905636033e-05, "loss": 1.0937, "mean_token_accuracy": 0.7034055396914483, "num_tokens": 52859792.0, "step": 705 }, { "entropy": 1.1160279937088489, "epoch": 0.2186023688337679, "grad_norm": 0.75390625, "learning_rate": 1.9912393212108692e-05, "loss": 1.1109, "mean_token_accuracy": 0.6976350143551826, "num_tokens": 53212860.0, "step": 710 }, { "entropy": 1.14042426943779, "epoch": 0.22014182213541417, "grad_norm": 0.71484375, "learning_rate": 1.9910241373761426e-05, "loss": 1.1385, "mean_token_accuracy": 0.694380571320653, "num_tokens": 53583748.0, "step": 715 }, { "entropy": 1.1466562129557132, "epoch": 0.22168127543706043, "grad_norm": 0.74609375, "learning_rate": 1.9908063546961482e-05, "loss": 1.1338, "mean_token_accuracy": 0.6904741197824478, "num_tokens": 53940694.0, "step": 720 }, { "entropy": 1.121897478029132, "epoch": 0.22322072873870666, "grad_norm": 0.7265625, "learning_rate": 1.990585973741996e-05, "loss": 1.1211, "mean_token_accuracy": 0.6964031044393778, "num_tokens": 54316660.0, "step": 725 }, { "entropy": 1.1026945130899548, "epoch": 0.22476018204035292, "grad_norm": 0.7265625, "learning_rate": 1.9903629950916083e-05, "loss": 1.0919, "mean_token_accuracy": 0.7022646889090538, "num_tokens": 54700093.0, "step": 730 }, { "entropy": 1.1913654580712318, "epoch": 0.22629963534199918, "grad_norm": 0.71875, "learning_rate": 1.9901374193297212e-05, "loss": 1.1867, "mean_token_accuracy": 0.6831524942070246, "num_tokens": 55072259.0, "step": 735 }, { "entropy": 1.0986135648563504, "epoch": 0.22783908864364544, "grad_norm": 0.69921875, "learning_rate": 1.989909247047881e-05, "loss": 1.0859, "mean_token_accuracy": 0.70220061019063, "num_tokens": 55431253.0, "step": 740 }, { "entropy": 1.1104688480496407, "epoch": 0.22937854194529167, "grad_norm": 0.70703125, "learning_rate": 1.989678478844443e-05, "loss": 1.1053, "mean_token_accuracy": 0.7009272977709771, "num_tokens": 55806238.0, "step": 745 }, { "entropy": 1.1378316521644591, "epoch": 0.23091799524693793, "grad_norm": 0.77734375, "learning_rate": 1.9894451153245695e-05, "loss": 1.1323, "mean_token_accuracy": 0.6941636923700572, "num_tokens": 56167420.0, "step": 750 }, { "entropy": 1.0988559927791357, "epoch": 0.2324574485485842, "grad_norm": 0.6875, "learning_rate": 1.9892091571002295e-05, "loss": 1.1008, "mean_token_accuracy": 0.7004305239766836, "num_tokens": 56550823.0, "step": 755 }, { "entropy": 1.1214569361880422, "epoch": 0.23399690185023045, "grad_norm": 0.75, "learning_rate": 1.9889706047901956e-05, "loss": 1.1044, "mean_token_accuracy": 0.6996850349009037, "num_tokens": 56920052.0, "step": 760 }, { "entropy": 1.1102859888225793, "epoch": 0.23553635515187668, "grad_norm": 0.70703125, "learning_rate": 1.9887294590200437e-05, "loss": 1.11, "mean_token_accuracy": 0.6958253476768732, "num_tokens": 57288683.0, "step": 765 }, { "entropy": 1.1473000289872288, "epoch": 0.23707580845352294, "grad_norm": 0.734375, "learning_rate": 1.9884857204221503e-05, "loss": 1.1542, "mean_token_accuracy": 0.6928766690194607, "num_tokens": 57645195.0, "step": 770 }, { "entropy": 1.1104052532464266, "epoch": 0.2386152617551692, "grad_norm": 0.7421875, "learning_rate": 1.9882393896356915e-05, "loss": 1.096, "mean_token_accuracy": 0.6981043085455895, "num_tokens": 58010298.0, "step": 775 }, { "entropy": 1.1217896696180105, "epoch": 0.24015471505681546, "grad_norm": 0.69921875, "learning_rate": 1.987990467306641e-05, "loss": 1.1139, "mean_token_accuracy": 0.6969779424369336, "num_tokens": 58403545.0, "step": 780 }, { "entropy": 1.1406789550557732, "epoch": 0.2416941683584617, "grad_norm": 0.640625, "learning_rate": 1.9877389540877686e-05, "loss": 1.1472, "mean_token_accuracy": 0.6947149783372879, "num_tokens": 58774798.0, "step": 785 }, { "entropy": 1.124403426796198, "epoch": 0.24323362166010795, "grad_norm": 0.7109375, "learning_rate": 1.9874848506386392e-05, "loss": 1.1214, "mean_token_accuracy": 0.6990401953458786, "num_tokens": 59159772.0, "step": 790 }, { "entropy": 1.0997486164793373, "epoch": 0.2447730749617542, "grad_norm": 0.70703125, "learning_rate": 1.9872281576256078e-05, "loss": 1.0879, "mean_token_accuracy": 0.7038913916796445, "num_tokens": 59540395.0, "step": 795 }, { "entropy": 1.1355868607759476, "epoch": 0.24631252826340047, "grad_norm": 0.73046875, "learning_rate": 1.9869688757218233e-05, "loss": 1.1415, "mean_token_accuracy": 0.6912806447595358, "num_tokens": 59905249.0, "step": 800 }, { "entropy": 1.1410336146131157, "epoch": 0.2478519815650467, "grad_norm": 0.71875, "learning_rate": 1.9867070056072215e-05, "loss": 1.1433, "mean_token_accuracy": 0.695595920830965, "num_tokens": 60268255.0, "step": 805 }, { "entropy": 1.1349990352988244, "epoch": 0.24939143486669296, "grad_norm": 0.734375, "learning_rate": 1.986442547968527e-05, "loss": 1.1253, "mean_token_accuracy": 0.6944803945720196, "num_tokens": 60639389.0, "step": 810 }, { "entropy": 1.071821440383792, "epoch": 0.2509308881683392, "grad_norm": 0.75, "learning_rate": 1.9861755034992483e-05, "loss": 1.0666, "mean_token_accuracy": 0.7084377076476812, "num_tokens": 61024428.0, "step": 815 }, { "entropy": 1.1051497608423233, "epoch": 0.2524703414699855, "grad_norm": 0.7421875, "learning_rate": 1.9859058728996788e-05, "loss": 1.0965, "mean_token_accuracy": 0.7005310852080584, "num_tokens": 61402658.0, "step": 820 }, { "entropy": 1.1438620645552873, "epoch": 0.2540097947716317, "grad_norm": 0.71875, "learning_rate": 1.9856336568768936e-05, "loss": 1.1399, "mean_token_accuracy": 0.6912882044911385, "num_tokens": 61780493.0, "step": 825 }, { "entropy": 1.0913935292512178, "epoch": 0.255549248073278, "grad_norm": 0.76953125, "learning_rate": 1.985358856144747e-05, "loss": 1.0922, "mean_token_accuracy": 0.7028463281691074, "num_tokens": 62152861.0, "step": 830 }, { "entropy": 1.1374814191833138, "epoch": 0.25708870137492423, "grad_norm": 0.75, "learning_rate": 1.9850814714238718e-05, "loss": 1.13, "mean_token_accuracy": 0.6964493870735169, "num_tokens": 62514124.0, "step": 835 }, { "entropy": 1.1332073567435146, "epoch": 0.25862815467657047, "grad_norm": 0.69140625, "learning_rate": 1.9848015034416776e-05, "loss": 1.1199, "mean_token_accuracy": 0.6939284823834896, "num_tokens": 62901998.0, "step": 840 }, { "entropy": 1.1137794975191355, "epoch": 0.26016760797821675, "grad_norm": 0.7734375, "learning_rate": 1.9845189529323473e-05, "loss": 1.103, "mean_token_accuracy": 0.7006840953603387, "num_tokens": 63266839.0, "step": 845 }, { "entropy": 1.1099360350519418, "epoch": 0.261707061279863, "grad_norm": 0.7109375, "learning_rate": 1.9842338206368375e-05, "loss": 1.0998, "mean_token_accuracy": 0.6972894985228777, "num_tokens": 63654737.0, "step": 850 }, { "entropy": 1.1284802999347447, "epoch": 0.2632465145815092, "grad_norm": 0.75390625, "learning_rate": 1.9839461073028733e-05, "loss": 1.1083, "mean_token_accuracy": 0.6968803893774748, "num_tokens": 64032094.0, "step": 855 }, { "entropy": 1.0841836363077164, "epoch": 0.2647859678831555, "grad_norm": 0.75390625, "learning_rate": 1.98365581368495e-05, "loss": 1.0933, "mean_token_accuracy": 0.7028985098004341, "num_tokens": 64418973.0, "step": 860 }, { "entropy": 1.1070842415094375, "epoch": 0.26632542118480174, "grad_norm": 0.7265625, "learning_rate": 1.9833629405443283e-05, "loss": 1.1091, "mean_token_accuracy": 0.7023597385734319, "num_tokens": 64798969.0, "step": 865 }, { "entropy": 1.1159617979079486, "epoch": 0.267864874486448, "grad_norm": 0.734375, "learning_rate": 1.983067488649035e-05, "loss": 1.1119, "mean_token_accuracy": 0.6988450512290001, "num_tokens": 65171715.0, "step": 870 }, { "entropy": 1.1518226452171803, "epoch": 0.26940432778809426, "grad_norm": 0.72265625, "learning_rate": 1.982769458773857e-05, "loss": 1.1421, "mean_token_accuracy": 0.6895007479935884, "num_tokens": 65548454.0, "step": 875 }, { "entropy": 1.1310207761824131, "epoch": 0.2709437810897405, "grad_norm": 0.71875, "learning_rate": 1.9824688517003433e-05, "loss": 1.1165, "mean_token_accuracy": 0.6969778280705213, "num_tokens": 65912713.0, "step": 880 }, { "entropy": 1.0850966442376375, "epoch": 0.2724832343913868, "grad_norm": 0.78125, "learning_rate": 1.9821656682168013e-05, "loss": 1.0868, "mean_token_accuracy": 0.7045084740966558, "num_tokens": 66288389.0, "step": 885 }, { "entropy": 1.116120758280158, "epoch": 0.274022687693033, "grad_norm": 0.69921875, "learning_rate": 1.981859909118294e-05, "loss": 1.1183, "mean_token_accuracy": 0.6976446002721787, "num_tokens": 66673853.0, "step": 890 }, { "entropy": 1.1547842472791672, "epoch": 0.27556214099467924, "grad_norm": 0.76171875, "learning_rate": 1.9815515752066386e-05, "loss": 1.1512, "mean_token_accuracy": 0.6902260981500149, "num_tokens": 67054614.0, "step": 895 }, { "entropy": 1.0831589922308922, "epoch": 0.2771015942963255, "grad_norm": 0.6796875, "learning_rate": 1.9812406672904058e-05, "loss": 1.0824, "mean_token_accuracy": 0.7042932607233524, "num_tokens": 67422842.0, "step": 900 }, { "entropy": 1.1236521264538168, "epoch": 0.27864104759797176, "grad_norm": 0.80078125, "learning_rate": 1.9809271861849147e-05, "loss": 1.1257, "mean_token_accuracy": 0.6985704395920038, "num_tokens": 67791499.0, "step": 905 }, { "entropy": 1.1213534710928799, "epoch": 0.28018050089961805, "grad_norm": 0.72265625, "learning_rate": 1.9806111327122332e-05, "loss": 1.1056, "mean_token_accuracy": 0.6963206488639117, "num_tokens": 68168533.0, "step": 910 }, { "entropy": 1.0945915594696998, "epoch": 0.2817199542012643, "grad_norm": 0.7265625, "learning_rate": 1.9802925077011742e-05, "loss": 1.0805, "mean_token_accuracy": 0.7033400624990463, "num_tokens": 68534200.0, "step": 915 }, { "entropy": 1.1363273495808244, "epoch": 0.2832594075029105, "grad_norm": 0.74609375, "learning_rate": 1.979971311987295e-05, "loss": 1.1331, "mean_token_accuracy": 0.6933297269046307, "num_tokens": 68904756.0, "step": 920 }, { "entropy": 1.113439468294382, "epoch": 0.2847988608045568, "grad_norm": 0.67578125, "learning_rate": 1.9796475464128943e-05, "loss": 1.1136, "mean_token_accuracy": 0.6984921019524336, "num_tokens": 69279269.0, "step": 925 }, { "entropy": 1.106918627768755, "epoch": 0.28633831410620303, "grad_norm": 0.7265625, "learning_rate": 1.979321211827009e-05, "loss": 1.0971, "mean_token_accuracy": 0.699981477856636, "num_tokens": 69652060.0, "step": 930 }, { "entropy": 1.1193274904042483, "epoch": 0.28787776740784926, "grad_norm": 0.6953125, "learning_rate": 1.9789923090854138e-05, "loss": 1.1141, "mean_token_accuracy": 0.6945442810654641, "num_tokens": 70031530.0, "step": 935 }, { "entropy": 1.1201645512133838, "epoch": 0.28941722070949555, "grad_norm": 0.69921875, "learning_rate": 1.9786608390506176e-05, "loss": 1.1248, "mean_token_accuracy": 0.6959635071456433, "num_tokens": 70405759.0, "step": 940 }, { "entropy": 1.158202064409852, "epoch": 0.2909566740111418, "grad_norm": 0.7578125, "learning_rate": 1.9783268025918622e-05, "loss": 1.1405, "mean_token_accuracy": 0.6916137792170047, "num_tokens": 70773411.0, "step": 945 }, { "entropy": 1.1136011434718966, "epoch": 0.29249612731278807, "grad_norm": 0.7109375, "learning_rate": 1.9779902005851187e-05, "loss": 1.1032, "mean_token_accuracy": 0.6998088311403989, "num_tokens": 71138724.0, "step": 950 }, { "entropy": 1.1528440322726965, "epoch": 0.2940355806144343, "grad_norm": 0.7109375, "learning_rate": 1.9776510339130874e-05, "loss": 1.1432, "mean_token_accuracy": 0.6916706405580044, "num_tokens": 71522642.0, "step": 955 }, { "entropy": 1.1416105089709163, "epoch": 0.29557503391608053, "grad_norm": 0.70703125, "learning_rate": 1.9773093034651928e-05, "loss": 1.1315, "mean_token_accuracy": 0.6934664513915777, "num_tokens": 71885197.0, "step": 960 }, { "entropy": 1.1288053080439568, "epoch": 0.2971144872177268, "grad_norm": 0.7109375, "learning_rate": 1.9769650101375835e-05, "loss": 1.1253, "mean_token_accuracy": 0.6961982771754265, "num_tokens": 72262607.0, "step": 965 }, { "entropy": 1.1250951839610934, "epoch": 0.29865394051937305, "grad_norm": 0.6796875, "learning_rate": 1.9766181548331283e-05, "loss": 1.1186, "mean_token_accuracy": 0.6970525443553924, "num_tokens": 72653402.0, "step": 970 }, { "entropy": 1.1368791069835424, "epoch": 0.3001933938210193, "grad_norm": 0.78125, "learning_rate": 1.9762687384614152e-05, "loss": 1.132, "mean_token_accuracy": 0.6947309102863073, "num_tokens": 73049063.0, "step": 975 }, { "entropy": 1.083188571408391, "epoch": 0.30173284712266557, "grad_norm": 0.69921875, "learning_rate": 1.9759167619387474e-05, "loss": 1.0838, "mean_token_accuracy": 0.7051486879587173, "num_tokens": 73435640.0, "step": 980 }, { "entropy": 1.1301437310874463, "epoch": 0.3032723004243118, "grad_norm": 0.71875, "learning_rate": 1.975562226188143e-05, "loss": 1.1135, "mean_token_accuracy": 0.6951402083039284, "num_tokens": 73804251.0, "step": 985 }, { "entropy": 1.1021712820976972, "epoch": 0.3048117537259581, "grad_norm": 0.72265625, "learning_rate": 1.97520513213933e-05, "loss": 1.1047, "mean_token_accuracy": 0.6995002727955579, "num_tokens": 74186734.0, "step": 990 }, { "entropy": 1.1268383231014014, "epoch": 0.3063512070276043, "grad_norm": 0.67578125, "learning_rate": 1.9748454807287458e-05, "loss": 1.1197, "mean_token_accuracy": 0.6963075909763574, "num_tokens": 74564695.0, "step": 995 }, { "entropy": 1.1207784935832024, "epoch": 0.30789066032925055, "grad_norm": 0.7421875, "learning_rate": 1.974483272899535e-05, "loss": 1.1225, "mean_token_accuracy": 0.6975628361105919, "num_tokens": 74954009.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 10000, "num_input_tokens_seen": 0, "num_train_epochs": 4, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.247882499766354e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }