{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.539424436896847, "eval_steps": 500, "global_step": 5000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.1113718893378972, "epoch": 0.0015394533016462528, "grad_norm": 23.25, "learning_rate": 2.666666666666667e-07, "loss": 1.4148, "mean_token_accuracy": 0.6499394655227662, "num_tokens": 379552.0, "step": 5 }, { "entropy": 1.1505246445536614, "epoch": 0.0030789066032925055, "grad_norm": 25.375, "learning_rate": 6.000000000000001e-07, "loss": 1.4742, "mean_token_accuracy": 0.6414433296769857, "num_tokens": 743248.0, "step": 10 }, { "entropy": 1.1535595946013928, "epoch": 0.004618359904938758, "grad_norm": 24.0, "learning_rate": 9.333333333333334e-07, "loss": 1.4559, "mean_token_accuracy": 0.6436704084277153, "num_tokens": 1124191.0, "step": 15 }, { "entropy": 1.1471380971372127, "epoch": 0.006157813206585011, "grad_norm": 21.5, "learning_rate": 1.2666666666666669e-06, "loss": 1.4609, "mean_token_accuracy": 0.642368745803833, "num_tokens": 1488145.0, "step": 20 }, { "entropy": 1.155402697250247, "epoch": 0.007697266508231265, "grad_norm": 18.25, "learning_rate": 1.6000000000000001e-06, "loss": 1.4329, "mean_token_accuracy": 0.6484112951904535, "num_tokens": 1860647.0, "step": 25 }, { "entropy": 1.1452072311192751, "epoch": 0.009236719809877517, "grad_norm": 17.25, "learning_rate": 1.9333333333333336e-06, "loss": 1.3712, "mean_token_accuracy": 0.6529930120334029, "num_tokens": 2245973.0, "step": 30 }, { "entropy": 1.123310711979866, "epoch": 0.01077617311152377, "grad_norm": 13.8125, "learning_rate": 2.266666666666667e-06, "loss": 1.3082, "mean_token_accuracy": 0.6658382505178452, "num_tokens": 2631053.0, "step": 35 }, { "entropy": 1.1543800953775645, "epoch": 0.012315626413170022, "grad_norm": 8.75, "learning_rate": 2.6e-06, "loss": 1.2982, "mean_token_accuracy": 0.6618854686617851, "num_tokens": 2992829.0, "step": 40 }, { "entropy": 1.1680023059248925, "epoch": 0.013855079714816277, "grad_norm": 6.1875, "learning_rate": 2.9333333333333338e-06, "loss": 1.2948, "mean_token_accuracy": 0.6657806046307087, "num_tokens": 3382112.0, "step": 45 }, { "entropy": 1.147538623958826, "epoch": 0.01539453301646253, "grad_norm": 5.375, "learning_rate": 3.266666666666667e-06, "loss": 1.2509, "mean_token_accuracy": 0.675503570586443, "num_tokens": 3764785.0, "step": 50 }, { "entropy": 1.107958966679871, "epoch": 0.01693398631810878, "grad_norm": 4.90625, "learning_rate": 3.6000000000000003e-06, "loss": 1.1997, "mean_token_accuracy": 0.6811204344034195, "num_tokens": 4126394.0, "step": 55 }, { "entropy": 1.1157011151313783, "epoch": 0.018473439619755033, "grad_norm": 2.265625, "learning_rate": 3.9333333333333335e-06, "loss": 1.193, "mean_token_accuracy": 0.6808499224483967, "num_tokens": 4510149.0, "step": 60 }, { "entropy": 1.1392802488058806, "epoch": 0.020012892921401286, "grad_norm": 1.1953125, "learning_rate": 4.266666666666668e-06, "loss": 1.1903, "mean_token_accuracy": 0.6806150872260333, "num_tokens": 4875984.0, "step": 65 }, { "entropy": 1.1204315345734357, "epoch": 0.02155234622304754, "grad_norm": 1.0078125, "learning_rate": 4.600000000000001e-06, "loss": 1.1621, "mean_token_accuracy": 0.6908985383808612, "num_tokens": 5251973.0, "step": 70 }, { "entropy": 1.1343737579882145, "epoch": 0.02309179952469379, "grad_norm": 0.90234375, "learning_rate": 4.933333333333334e-06, "loss": 1.1367, "mean_token_accuracy": 0.6892836567014455, "num_tokens": 5622302.0, "step": 75 }, { "entropy": 1.138794292882085, "epoch": 0.024631252826340044, "grad_norm": 0.81640625, "learning_rate": 5.2666666666666665e-06, "loss": 1.1657, "mean_token_accuracy": 0.6916824176907539, "num_tokens": 5987467.0, "step": 80 }, { "entropy": 1.1140711281448603, "epoch": 0.0261707061279863, "grad_norm": 0.796875, "learning_rate": 5.600000000000001e-06, "loss": 1.1287, "mean_token_accuracy": 0.6946257088333369, "num_tokens": 6369083.0, "step": 85 }, { "entropy": 1.1451053522527217, "epoch": 0.027710159429632553, "grad_norm": 0.78515625, "learning_rate": 5.933333333333335e-06, "loss": 1.1546, "mean_token_accuracy": 0.6903918959200382, "num_tokens": 6749350.0, "step": 90 }, { "entropy": 1.1201870743185283, "epoch": 0.029249612731278806, "grad_norm": 0.7890625, "learning_rate": 6.266666666666668e-06, "loss": 1.1166, "mean_token_accuracy": 0.6962686065584421, "num_tokens": 7118012.0, "step": 95 }, { "entropy": 1.149271610751748, "epoch": 0.03078906603292506, "grad_norm": 0.796875, "learning_rate": 6.600000000000001e-06, "loss": 1.1534, "mean_token_accuracy": 0.6903159897774458, "num_tokens": 7486407.0, "step": 100 }, { "entropy": 1.1452004179358481, "epoch": 0.03232851933457131, "grad_norm": 0.74609375, "learning_rate": 6.9333333333333344e-06, "loss": 1.1658, "mean_token_accuracy": 0.6880020551383496, "num_tokens": 7853929.0, "step": 105 }, { "entropy": 1.133518392033875, "epoch": 0.03386797263621756, "grad_norm": 0.71484375, "learning_rate": 7.266666666666668e-06, "loss": 1.1477, "mean_token_accuracy": 0.691348098218441, "num_tokens": 8224258.0, "step": 110 }, { "entropy": 1.1419388929381966, "epoch": 0.035407425937863814, "grad_norm": 0.7734375, "learning_rate": 7.600000000000001e-06, "loss": 1.1499, "mean_token_accuracy": 0.6935681894421577, "num_tokens": 8601374.0, "step": 115 }, { "entropy": 1.1601579703390599, "epoch": 0.036946879239510066, "grad_norm": 0.7265625, "learning_rate": 7.933333333333334e-06, "loss": 1.1652, "mean_token_accuracy": 0.6893212374299764, "num_tokens": 8976860.0, "step": 120 }, { "entropy": 1.1541021421551705, "epoch": 0.03848633254115632, "grad_norm": 0.75, "learning_rate": 8.266666666666667e-06, "loss": 1.1553, "mean_token_accuracy": 0.6880058489739895, "num_tokens": 9342172.0, "step": 125 }, { "entropy": 1.1215011529624461, "epoch": 0.04002578584280257, "grad_norm": 0.73828125, "learning_rate": 8.6e-06, "loss": 1.11, "mean_token_accuracy": 0.6971393920481205, "num_tokens": 9711234.0, "step": 130 }, { "entropy": 1.1288955546915531, "epoch": 0.041565239144448825, "grad_norm": 0.69921875, "learning_rate": 8.933333333333333e-06, "loss": 1.1331, "mean_token_accuracy": 0.69485286436975, "num_tokens": 10092041.0, "step": 135 }, { "entropy": 1.1383998703211546, "epoch": 0.04310469244609508, "grad_norm": 0.71484375, "learning_rate": 9.266666666666667e-06, "loss": 1.1608, "mean_token_accuracy": 0.6917846284806728, "num_tokens": 10470367.0, "step": 140 }, { "entropy": 1.1720476493239402, "epoch": 0.04464414574774133, "grad_norm": 0.7890625, "learning_rate": 9.600000000000001e-06, "loss": 1.1643, "mean_token_accuracy": 0.6900354858487845, "num_tokens": 10840227.0, "step": 145 }, { "entropy": 1.1642087884247303, "epoch": 0.04618359904938758, "grad_norm": 0.765625, "learning_rate": 9.933333333333334e-06, "loss": 1.1662, "mean_token_accuracy": 0.6894872546195984, "num_tokens": 11212704.0, "step": 150 }, { "entropy": 1.1504485111683607, "epoch": 0.047723052351033836, "grad_norm": 0.734375, "learning_rate": 1.0266666666666668e-05, "loss": 1.1618, "mean_token_accuracy": 0.6902470916509629, "num_tokens": 11585050.0, "step": 155 }, { "entropy": 1.139546208642423, "epoch": 0.04926250565268009, "grad_norm": 0.71484375, "learning_rate": 1.0600000000000002e-05, "loss": 1.1371, "mean_token_accuracy": 0.6940638959407807, "num_tokens": 11955470.0, "step": 160 }, { "entropy": 1.1310970352962613, "epoch": 0.05080195895432634, "grad_norm": 0.73828125, "learning_rate": 1.0933333333333334e-05, "loss": 1.1217, "mean_token_accuracy": 0.697192519530654, "num_tokens": 12326414.0, "step": 165 }, { "entropy": 1.1263095822185278, "epoch": 0.0523414122559726, "grad_norm": 0.7109375, "learning_rate": 1.1266666666666668e-05, "loss": 1.1226, "mean_token_accuracy": 0.695407111570239, "num_tokens": 12699566.0, "step": 170 }, { "entropy": 1.1608664955943824, "epoch": 0.053880865557618854, "grad_norm": 0.6953125, "learning_rate": 1.16e-05, "loss": 1.156, "mean_token_accuracy": 0.6909525521099568, "num_tokens": 13076955.0, "step": 175 }, { "entropy": 1.1388528019189834, "epoch": 0.05542031885926511, "grad_norm": 0.7265625, "learning_rate": 1.1933333333333335e-05, "loss": 1.1475, "mean_token_accuracy": 0.6935607939958572, "num_tokens": 13457841.0, "step": 180 }, { "entropy": 1.1540386551991104, "epoch": 0.05695977216091136, "grad_norm": 0.71484375, "learning_rate": 1.2266666666666667e-05, "loss": 1.1501, "mean_token_accuracy": 0.690580427646637, "num_tokens": 13823331.0, "step": 185 }, { "entropy": 1.1634995128959418, "epoch": 0.05849922546255761, "grad_norm": 0.74609375, "learning_rate": 1.2600000000000001e-05, "loss": 1.1689, "mean_token_accuracy": 0.6883407317101955, "num_tokens": 14189829.0, "step": 190 }, { "entropy": 1.1286564406007529, "epoch": 0.060038678764203865, "grad_norm": 0.68359375, "learning_rate": 1.2933333333333334e-05, "loss": 1.1091, "mean_token_accuracy": 0.6968111153692007, "num_tokens": 14568687.0, "step": 195 }, { "entropy": 1.0947596225887537, "epoch": 0.06157813206585012, "grad_norm": 0.73828125, "learning_rate": 1.3266666666666668e-05, "loss": 1.0865, "mean_token_accuracy": 0.7018399801105261, "num_tokens": 14956883.0, "step": 200 }, { "entropy": 1.105372793599963, "epoch": 0.06311758536749637, "grad_norm": 0.76171875, "learning_rate": 1.3600000000000002e-05, "loss": 1.098, "mean_token_accuracy": 0.7011617802083492, "num_tokens": 15329120.0, "step": 205 }, { "entropy": 1.1237883031368257, "epoch": 0.06465703866914262, "grad_norm": 0.73828125, "learning_rate": 1.3933333333333334e-05, "loss": 1.1159, "mean_token_accuracy": 0.6975264508277178, "num_tokens": 15706521.0, "step": 210 }, { "entropy": 1.1330916548147798, "epoch": 0.06619649197078888, "grad_norm": 0.76953125, "learning_rate": 1.4266666666666668e-05, "loss": 1.1323, "mean_token_accuracy": 0.6972741197794676, "num_tokens": 16066978.0, "step": 215 }, { "entropy": 1.1772997351363301, "epoch": 0.06773594527243512, "grad_norm": 0.7421875, "learning_rate": 1.46e-05, "loss": 1.1734, "mean_token_accuracy": 0.6860150098800659, "num_tokens": 16449339.0, "step": 220 }, { "entropy": 1.158057621307671, "epoch": 0.06927539857408138, "grad_norm": 0.73828125, "learning_rate": 1.4933333333333335e-05, "loss": 1.1629, "mean_token_accuracy": 0.6880886014550924, "num_tokens": 16831396.0, "step": 225 }, { "entropy": 1.139371989108622, "epoch": 0.07081485187572763, "grad_norm": 0.75390625, "learning_rate": 1.5266666666666667e-05, "loss": 1.1223, "mean_token_accuracy": 0.6936335910111666, "num_tokens": 17210779.0, "step": 230 }, { "entropy": 1.1907519888132811, "epoch": 0.07235430517737389, "grad_norm": 0.78515625, "learning_rate": 1.5600000000000003e-05, "loss": 1.187, "mean_token_accuracy": 0.6834761939942837, "num_tokens": 17582881.0, "step": 235 }, { "entropy": 1.1354382883757352, "epoch": 0.07389375847902013, "grad_norm": 0.765625, "learning_rate": 1.5933333333333336e-05, "loss": 1.1418, "mean_token_accuracy": 0.6936424177139997, "num_tokens": 17952831.0, "step": 240 }, { "entropy": 1.131275094114244, "epoch": 0.07543321178066639, "grad_norm": 0.68359375, "learning_rate": 1.6266666666666668e-05, "loss": 1.1324, "mean_token_accuracy": 0.6951741587370635, "num_tokens": 18341435.0, "step": 245 }, { "entropy": 1.1359387850388885, "epoch": 0.07697266508231264, "grad_norm": 0.7109375, "learning_rate": 1.66e-05, "loss": 1.1273, "mean_token_accuracy": 0.6938830468803644, "num_tokens": 18710959.0, "step": 250 }, { "entropy": 1.1200769424438477, "epoch": 0.0785121183839589, "grad_norm": 0.75390625, "learning_rate": 1.6933333333333336e-05, "loss": 1.1116, "mean_token_accuracy": 0.698444551974535, "num_tokens": 19077026.0, "step": 255 }, { "entropy": 1.144037862494588, "epoch": 0.08005157168560514, "grad_norm": 0.6953125, "learning_rate": 1.726666666666667e-05, "loss": 1.1399, "mean_token_accuracy": 0.694709181971848, "num_tokens": 19433930.0, "step": 260 }, { "entropy": 1.1314732745289802, "epoch": 0.0815910249872514, "grad_norm": 0.7421875, "learning_rate": 1.76e-05, "loss": 1.1265, "mean_token_accuracy": 0.6972466479986906, "num_tokens": 19801472.0, "step": 265 }, { "entropy": 1.1006763726472855, "epoch": 0.08313047828889765, "grad_norm": 0.734375, "learning_rate": 1.7933333333333333e-05, "loss": 1.0907, "mean_token_accuracy": 0.7027702957391739, "num_tokens": 20178765.0, "step": 270 }, { "entropy": 1.1250910840928554, "epoch": 0.08466993159054391, "grad_norm": 0.6640625, "learning_rate": 1.826666666666667e-05, "loss": 1.1259, "mean_token_accuracy": 0.6969286557286978, "num_tokens": 20540840.0, "step": 275 }, { "entropy": 1.1310079213231803, "epoch": 0.08620938489219016, "grad_norm": 0.734375, "learning_rate": 1.86e-05, "loss": 1.1182, "mean_token_accuracy": 0.6943910989910365, "num_tokens": 20917703.0, "step": 280 }, { "entropy": 1.1366374537348747, "epoch": 0.08774883819383641, "grad_norm": 0.76953125, "learning_rate": 1.8933333333333334e-05, "loss": 1.1538, "mean_token_accuracy": 0.692281323671341, "num_tokens": 21286716.0, "step": 285 }, { "entropy": 1.1471243999898433, "epoch": 0.08928829149548266, "grad_norm": 0.73828125, "learning_rate": 1.926666666666667e-05, "loss": 1.1422, "mean_token_accuracy": 0.6914283595979214, "num_tokens": 21672957.0, "step": 290 }, { "entropy": 1.0941655661910772, "epoch": 0.09082774479712892, "grad_norm": 0.734375, "learning_rate": 1.9600000000000002e-05, "loss": 1.0918, "mean_token_accuracy": 0.703205331414938, "num_tokens": 22057533.0, "step": 295 }, { "entropy": 1.1071835961192846, "epoch": 0.09236719809877517, "grad_norm": 0.70703125, "learning_rate": 1.9933333333333334e-05, "loss": 1.1111, "mean_token_accuracy": 0.6998405870050192, "num_tokens": 22435546.0, "step": 300 }, { "entropy": 1.1055552622303366, "epoch": 0.09390665140042143, "grad_norm": 0.70703125, "learning_rate": 1.9999991608372392e-05, "loss": 1.0997, "mean_token_accuracy": 0.7011382140219211, "num_tokens": 22797277.0, "step": 305 }, { "entropy": 1.1513552486896514, "epoch": 0.09544610470206767, "grad_norm": 0.76953125, "learning_rate": 1.9999957517409375e-05, "loss": 1.1525, "mean_token_accuracy": 0.6906207267194986, "num_tokens": 23157199.0, "step": 310 }, { "entropy": 1.1360066479071975, "epoch": 0.09698555800371393, "grad_norm": 0.74609375, "learning_rate": 1.9999897202723546e-05, "loss": 1.1269, "mean_token_accuracy": 0.6963287502527237, "num_tokens": 23542710.0, "step": 315 }, { "entropy": 1.1110562330111862, "epoch": 0.09852501130536018, "grad_norm": 0.734375, "learning_rate": 1.999981066447308e-05, "loss": 1.103, "mean_token_accuracy": 0.700805151462555, "num_tokens": 23929848.0, "step": 320 }, { "entropy": 1.0776942696422338, "epoch": 0.10006446460700644, "grad_norm": 0.70703125, "learning_rate": 1.999969790288491e-05, "loss": 1.0754, "mean_token_accuracy": 0.706406794860959, "num_tokens": 24320781.0, "step": 325 }, { "entropy": 1.1285138919949531, "epoch": 0.10160391790865268, "grad_norm": 0.69140625, "learning_rate": 1.9999558918254746e-05, "loss": 1.1159, "mean_token_accuracy": 0.6957792080938816, "num_tokens": 24718182.0, "step": 330 }, { "entropy": 1.1143408741801977, "epoch": 0.10314337121029894, "grad_norm": 0.71875, "learning_rate": 1.999939371094705e-05, "loss": 1.1132, "mean_token_accuracy": 0.6973476313054562, "num_tokens": 25078136.0, "step": 335 }, { "entropy": 1.1544642113149166, "epoch": 0.1046828245119452, "grad_norm": 0.71484375, "learning_rate": 1.9999202281395064e-05, "loss": 1.1505, "mean_token_accuracy": 0.6898461397737264, "num_tokens": 25462544.0, "step": 340 }, { "entropy": 1.110057471320033, "epoch": 0.10622227781359145, "grad_norm": 0.69921875, "learning_rate": 1.999898463010079e-05, "loss": 1.1093, "mean_token_accuracy": 0.696648533269763, "num_tokens": 25832507.0, "step": 345 }, { "entropy": 1.121138433739543, "epoch": 0.10776173111523771, "grad_norm": 0.765625, "learning_rate": 1.9998740757634998e-05, "loss": 1.1206, "mean_token_accuracy": 0.695626575127244, "num_tokens": 26208168.0, "step": 350 }, { "entropy": 1.1249326327815652, "epoch": 0.10930118441688395, "grad_norm": 0.7109375, "learning_rate": 1.9998470664637205e-05, "loss": 1.1066, "mean_token_accuracy": 0.6976452205330134, "num_tokens": 26567141.0, "step": 355 }, { "entropy": 1.1190939696505666, "epoch": 0.11084063771853021, "grad_norm": 0.74609375, "learning_rate": 1.9998174351815704e-05, "loss": 1.109, "mean_token_accuracy": 0.696621885150671, "num_tokens": 26946409.0, "step": 360 }, { "entropy": 1.097430343925953, "epoch": 0.11238009102017646, "grad_norm": 0.7265625, "learning_rate": 1.9997851819947537e-05, "loss": 1.0981, "mean_token_accuracy": 0.6984185025095939, "num_tokens": 27323310.0, "step": 365 }, { "entropy": 1.1255185015499591, "epoch": 0.11391954432182272, "grad_norm": 0.7109375, "learning_rate": 1.9997503069878515e-05, "loss": 1.1021, "mean_token_accuracy": 0.6977558217942714, "num_tokens": 27728681.0, "step": 370 }, { "entropy": 1.1182758403941988, "epoch": 0.11545899762346896, "grad_norm": 0.7421875, "learning_rate": 1.9997128102523186e-05, "loss": 1.1144, "mean_token_accuracy": 0.6975483104586602, "num_tokens": 28099689.0, "step": 375 }, { "entropy": 1.0848099140450358, "epoch": 0.11699845092511522, "grad_norm": 0.69921875, "learning_rate": 1.9996726918864857e-05, "loss": 1.0807, "mean_token_accuracy": 0.7057063952088356, "num_tokens": 28470608.0, "step": 380 }, { "entropy": 1.147358151897788, "epoch": 0.11853790422676147, "grad_norm": 0.72265625, "learning_rate": 1.999629951995559e-05, "loss": 1.1361, "mean_token_accuracy": 0.6940991956740618, "num_tokens": 28850518.0, "step": 385 }, { "entropy": 1.158296991325915, "epoch": 0.12007735752840773, "grad_norm": 0.7109375, "learning_rate": 1.999584590691619e-05, "loss": 1.1613, "mean_token_accuracy": 0.6874197501689195, "num_tokens": 29223644.0, "step": 390 }, { "entropy": 1.1296958446502685, "epoch": 0.12161681083005398, "grad_norm": 0.7265625, "learning_rate": 1.9995366080936206e-05, "loss": 1.1062, "mean_token_accuracy": 0.6964040424674749, "num_tokens": 29597922.0, "step": 395 }, { "entropy": 1.1090093098580838, "epoch": 0.12315626413170024, "grad_norm": 0.70703125, "learning_rate": 1.9994860043273915e-05, "loss": 1.1119, "mean_token_accuracy": 0.6979490287601948, "num_tokens": 29967597.0, "step": 400 }, { "entropy": 1.1302901729941368, "epoch": 0.12469571743334648, "grad_norm": 0.7109375, "learning_rate": 1.999432779525635e-05, "loss": 1.113, "mean_token_accuracy": 0.6980737678706646, "num_tokens": 30351751.0, "step": 405 }, { "entropy": 1.0851911935955285, "epoch": 0.12623517073499274, "grad_norm": 0.7109375, "learning_rate": 1.999376933827927e-05, "loss": 1.0852, "mean_token_accuracy": 0.7041132722049952, "num_tokens": 30718524.0, "step": 410 }, { "entropy": 1.092500716075301, "epoch": 0.127774624036639, "grad_norm": 0.68359375, "learning_rate": 1.999318467380716e-05, "loss": 1.0757, "mean_token_accuracy": 0.7052585650235415, "num_tokens": 31099388.0, "step": 415 }, { "entropy": 1.1496953256428242, "epoch": 0.12931407733828523, "grad_norm": 0.7265625, "learning_rate": 1.9992573803373242e-05, "loss": 1.1516, "mean_token_accuracy": 0.6907676491886378, "num_tokens": 31461359.0, "step": 420 }, { "entropy": 1.1136517949402331, "epoch": 0.1308535306399315, "grad_norm": 0.71875, "learning_rate": 1.9991936728579438e-05, "loss": 1.1098, "mean_token_accuracy": 0.6990172352641821, "num_tokens": 31837580.0, "step": 425 }, { "entropy": 1.1240890389308333, "epoch": 0.13239298394157775, "grad_norm": 0.7265625, "learning_rate": 1.9991273451096414e-05, "loss": 1.1144, "mean_token_accuracy": 0.6938084073364734, "num_tokens": 32219381.0, "step": 430 }, { "entropy": 1.1162253782153129, "epoch": 0.133932437243224, "grad_norm": 0.73046875, "learning_rate": 1.9990583972663534e-05, "loss": 1.107, "mean_token_accuracy": 0.6976239930838346, "num_tokens": 32600761.0, "step": 435 }, { "entropy": 1.1294534251093864, "epoch": 0.13547189054487024, "grad_norm": 0.78515625, "learning_rate": 1.9989868295088876e-05, "loss": 1.1381, "mean_token_accuracy": 0.6945139471441507, "num_tokens": 32967708.0, "step": 440 }, { "entropy": 1.1337316358461975, "epoch": 0.1370113438465165, "grad_norm": 0.73828125, "learning_rate": 1.998912642024922e-05, "loss": 1.1376, "mean_token_accuracy": 0.6949200943112374, "num_tokens": 33348622.0, "step": 445 }, { "entropy": 1.1307091983035207, "epoch": 0.13855079714816276, "grad_norm": 0.74609375, "learning_rate": 1.9988358350090045e-05, "loss": 1.1169, "mean_token_accuracy": 0.6963778145611286, "num_tokens": 33718264.0, "step": 450 }, { "entropy": 1.1685293976217508, "epoch": 0.14009025044980902, "grad_norm": 0.71484375, "learning_rate": 1.998756408662553e-05, "loss": 1.1656, "mean_token_accuracy": 0.6891588238999248, "num_tokens": 34095351.0, "step": 455 }, { "entropy": 1.1300161950290204, "epoch": 0.14162970375145525, "grad_norm": 0.70703125, "learning_rate": 1.9986743631938536e-05, "loss": 1.1278, "mean_token_accuracy": 0.6970746215432883, "num_tokens": 34470308.0, "step": 460 }, { "entropy": 1.1416201300919055, "epoch": 0.14316915705310151, "grad_norm": 0.7265625, "learning_rate": 1.9985896988180607e-05, "loss": 1.1224, "mean_token_accuracy": 0.6962168168276548, "num_tokens": 34842571.0, "step": 465 }, { "entropy": 1.1438201934099197, "epoch": 0.14470861035474777, "grad_norm": 0.75, "learning_rate": 1.9985024157571972e-05, "loss": 1.146, "mean_token_accuracy": 0.6919929884374142, "num_tokens": 35212666.0, "step": 470 }, { "entropy": 1.1576870299875737, "epoch": 0.14624806365639403, "grad_norm": 0.69921875, "learning_rate": 1.998412514240152e-05, "loss": 1.1606, "mean_token_accuracy": 0.692124840989709, "num_tokens": 35593532.0, "step": 475 }, { "entropy": 1.1232300328090787, "epoch": 0.14778751695804027, "grad_norm": 0.74609375, "learning_rate": 1.9983199945026822e-05, "loss": 1.1198, "mean_token_accuracy": 0.6935272339731455, "num_tokens": 35980581.0, "step": 480 }, { "entropy": 1.1406380519270898, "epoch": 0.14932697025968653, "grad_norm": 0.7109375, "learning_rate": 1.9982248567874098e-05, "loss": 1.1303, "mean_token_accuracy": 0.6920850377529859, "num_tokens": 36366818.0, "step": 485 }, { "entropy": 1.1526461832225323, "epoch": 0.15086642356133279, "grad_norm": 0.69921875, "learning_rate": 1.998127101343822e-05, "loss": 1.1452, "mean_token_accuracy": 0.6928542651236057, "num_tokens": 36739879.0, "step": 490 }, { "entropy": 1.127664201334119, "epoch": 0.15240587686297905, "grad_norm": 0.69921875, "learning_rate": 1.9980267284282718e-05, "loss": 1.1309, "mean_token_accuracy": 0.6948033161461353, "num_tokens": 37126967.0, "step": 495 }, { "entropy": 1.1573752466589213, "epoch": 0.15394533016462528, "grad_norm": 0.75, "learning_rate": 1.9979237383039745e-05, "loss": 1.1486, "mean_token_accuracy": 0.6922336863353848, "num_tokens": 37491480.0, "step": 500 }, { "entropy": 1.1195718679577111, "epoch": 0.15548478346627154, "grad_norm": 0.70703125, "learning_rate": 1.9978181312410104e-05, "loss": 1.1097, "mean_token_accuracy": 0.6958762314170599, "num_tokens": 37855648.0, "step": 505 }, { "entropy": 1.1157226022332907, "epoch": 0.1570242367679178, "grad_norm": 0.70703125, "learning_rate": 1.9977099075163216e-05, "loss": 1.1044, "mean_token_accuracy": 0.6988037750124931, "num_tokens": 38239757.0, "step": 510 }, { "entropy": 1.1437922086566688, "epoch": 0.15856369006956406, "grad_norm": 0.66796875, "learning_rate": 1.997599067413712e-05, "loss": 1.1402, "mean_token_accuracy": 0.6914523551240563, "num_tokens": 38626774.0, "step": 515 }, { "entropy": 1.1398277616128325, "epoch": 0.1601031433712103, "grad_norm": 0.75390625, "learning_rate": 1.997485611223847e-05, "loss": 1.1292, "mean_token_accuracy": 0.6958260778337717, "num_tokens": 38999361.0, "step": 520 }, { "entropy": 1.1146018091589212, "epoch": 0.16164259667285655, "grad_norm": 0.765625, "learning_rate": 1.997369539244252e-05, "loss": 1.1124, "mean_token_accuracy": 0.7005707703530788, "num_tokens": 39381117.0, "step": 525 }, { "entropy": 1.1075803402811288, "epoch": 0.1631820499745028, "grad_norm": 0.71875, "learning_rate": 1.9972508517793125e-05, "loss": 1.1011, "mean_token_accuracy": 0.6986994445323944, "num_tokens": 39748243.0, "step": 530 }, { "entropy": 1.1309567619115115, "epoch": 0.16472150327614907, "grad_norm": 0.796875, "learning_rate": 1.9971295491402725e-05, "loss": 1.1364, "mean_token_accuracy": 0.6940356496721506, "num_tokens": 40115293.0, "step": 535 }, { "entropy": 1.18396236859262, "epoch": 0.1662609565777953, "grad_norm": 0.71484375, "learning_rate": 1.997005631645234e-05, "loss": 1.1725, "mean_token_accuracy": 0.686182476207614, "num_tokens": 40508440.0, "step": 540 }, { "entropy": 1.1049391619861126, "epoch": 0.16780040987944156, "grad_norm": 0.71484375, "learning_rate": 1.996879099619156e-05, "loss": 1.1144, "mean_token_accuracy": 0.696911821886897, "num_tokens": 40896598.0, "step": 545 }, { "entropy": 1.1429337464272975, "epoch": 0.16933986318108782, "grad_norm": 0.7265625, "learning_rate": 1.9967499533938544e-05, "loss": 1.136, "mean_token_accuracy": 0.6921508580446243, "num_tokens": 41271458.0, "step": 550 }, { "entropy": 1.1443469554185868, "epoch": 0.17087931648273408, "grad_norm": 0.71875, "learning_rate": 1.996618193308e-05, "loss": 1.133, "mean_token_accuracy": 0.6909565668553114, "num_tokens": 41652091.0, "step": 555 }, { "entropy": 1.1591787867248058, "epoch": 0.1724187697843803, "grad_norm": 0.6875, "learning_rate": 1.9964838197071173e-05, "loss": 1.1434, "mean_token_accuracy": 0.6915002010762692, "num_tokens": 42027815.0, "step": 560 }, { "entropy": 1.1327795442193747, "epoch": 0.17395822308602657, "grad_norm": 0.796875, "learning_rate": 1.9963468329435872e-05, "loss": 1.1364, "mean_token_accuracy": 0.6924004014581442, "num_tokens": 42390261.0, "step": 565 }, { "entropy": 1.1397675037384034, "epoch": 0.17549767638767283, "grad_norm": 0.734375, "learning_rate": 1.99620723337664e-05, "loss": 1.1406, "mean_token_accuracy": 0.6912539415061474, "num_tokens": 42759613.0, "step": 570 }, { "entropy": 1.107204508036375, "epoch": 0.1770371296893191, "grad_norm": 0.71875, "learning_rate": 1.9960650213723604e-05, "loss": 1.0852, "mean_token_accuracy": 0.6994996588677168, "num_tokens": 43132014.0, "step": 575 }, { "entropy": 1.099429708532989, "epoch": 0.17857658299096532, "grad_norm": 0.734375, "learning_rate": 1.9959201973036816e-05, "loss": 1.1041, "mean_token_accuracy": 0.7006071075797081, "num_tokens": 43518177.0, "step": 580 }, { "entropy": 1.1445161992684008, "epoch": 0.18011603629261158, "grad_norm": 0.71484375, "learning_rate": 1.995772761550389e-05, "loss": 1.1382, "mean_token_accuracy": 0.6925386656075716, "num_tokens": 43894430.0, "step": 585 }, { "entropy": 1.1534817535430193, "epoch": 0.18165548959425784, "grad_norm": 0.73046875, "learning_rate": 1.995622714499115e-05, "loss": 1.1493, "mean_token_accuracy": 0.6913147930055856, "num_tokens": 44258015.0, "step": 590 }, { "entropy": 1.1478193078190089, "epoch": 0.1831949428959041, "grad_norm": 0.7109375, "learning_rate": 1.9954700565433406e-05, "loss": 1.1502, "mean_token_accuracy": 0.6935486130416393, "num_tokens": 44636368.0, "step": 595 }, { "entropy": 1.1420258667320013, "epoch": 0.18473439619755033, "grad_norm": 0.6796875, "learning_rate": 1.9953147880833935e-05, "loss": 1.1395, "mean_token_accuracy": 0.693219494074583, "num_tokens": 45009190.0, "step": 600 }, { "entropy": 1.1204937249422073, "epoch": 0.1862738494991966, "grad_norm": 0.76953125, "learning_rate": 1.9951569095264473e-05, "loss": 1.1237, "mean_token_accuracy": 0.6966589823365211, "num_tokens": 45369198.0, "step": 605 }, { "entropy": 1.1316735215485096, "epoch": 0.18781330280084285, "grad_norm": 0.7578125, "learning_rate": 1.99499642128652e-05, "loss": 1.1151, "mean_token_accuracy": 0.6951681729406118, "num_tokens": 45735650.0, "step": 610 }, { "entropy": 1.119157313928008, "epoch": 0.1893527561024891, "grad_norm": 0.73828125, "learning_rate": 1.994833323784473e-05, "loss": 1.1205, "mean_token_accuracy": 0.6974445167928934, "num_tokens": 46105045.0, "step": 615 }, { "entropy": 1.1227743715047835, "epoch": 0.19089220940413534, "grad_norm": 0.74609375, "learning_rate": 1.9946676174480115e-05, "loss": 1.1122, "mean_token_accuracy": 0.6958862528204918, "num_tokens": 46468345.0, "step": 620 }, { "entropy": 1.123009406030178, "epoch": 0.1924316627057816, "grad_norm": 0.71484375, "learning_rate": 1.9944993027116798e-05, "loss": 1.1064, "mean_token_accuracy": 0.6993745014071464, "num_tokens": 46839653.0, "step": 625 }, { "entropy": 1.13520105779171, "epoch": 0.19397111600742786, "grad_norm": 0.734375, "learning_rate": 1.9943283800168643e-05, "loss": 1.1432, "mean_token_accuracy": 0.69097990244627, "num_tokens": 47218180.0, "step": 630 }, { "entropy": 1.1393942264840007, "epoch": 0.19551056930907412, "grad_norm": 0.72265625, "learning_rate": 1.9941548498117894e-05, "loss": 1.1382, "mean_token_accuracy": 0.6938273806124926, "num_tokens": 47595740.0, "step": 635 }, { "entropy": 1.1325588449835777, "epoch": 0.19705002261072035, "grad_norm": 0.7109375, "learning_rate": 1.9939787125515188e-05, "loss": 1.1298, "mean_token_accuracy": 0.6938525449484587, "num_tokens": 47982358.0, "step": 640 }, { "entropy": 1.121693492308259, "epoch": 0.19858947591236661, "grad_norm": 0.75, "learning_rate": 1.993799968697951e-05, "loss": 1.1191, "mean_token_accuracy": 0.6956870190799236, "num_tokens": 48372670.0, "step": 645 }, { "entropy": 1.1251621477305889, "epoch": 0.20012892921401287, "grad_norm": 0.76953125, "learning_rate": 1.9936186187198214e-05, "loss": 1.1236, "mean_token_accuracy": 0.6986733213067055, "num_tokens": 48737613.0, "step": 650 }, { "entropy": 1.139292366988957, "epoch": 0.20166838251565913, "grad_norm": 0.7109375, "learning_rate": 1.9934346630926988e-05, "loss": 1.1304, "mean_token_accuracy": 0.6938830778002739, "num_tokens": 49100209.0, "step": 655 }, { "entropy": 1.1345834810286761, "epoch": 0.20320783581730537, "grad_norm": 0.66796875, "learning_rate": 1.9932481022989857e-05, "loss": 1.1181, "mean_token_accuracy": 0.6951233502477407, "num_tokens": 49467553.0, "step": 660 }, { "entropy": 1.094562499411404, "epoch": 0.20474728911895163, "grad_norm": 0.76171875, "learning_rate": 1.993058936827916e-05, "loss": 1.0977, "mean_token_accuracy": 0.7043172724545002, "num_tokens": 49849811.0, "step": 665 }, { "entropy": 1.139369383826852, "epoch": 0.20628674242059789, "grad_norm": 0.73828125, "learning_rate": 1.992867167175554e-05, "loss": 1.1425, "mean_token_accuracy": 0.6948151815682649, "num_tokens": 50225933.0, "step": 670 }, { "entropy": 1.079656113870442, "epoch": 0.20782619572224414, "grad_norm": 0.6875, "learning_rate": 1.9926727938447935e-05, "loss": 1.0692, "mean_token_accuracy": 0.7051354993134737, "num_tokens": 50610063.0, "step": 675 }, { "entropy": 1.1766547793522477, "epoch": 0.2093656490238904, "grad_norm": 0.7109375, "learning_rate": 1.9924758173453555e-05, "loss": 1.1785, "mean_token_accuracy": 0.6878008231520653, "num_tokens": 50990235.0, "step": 680 }, { "entropy": 1.0988596007227898, "epoch": 0.21090510232553664, "grad_norm": 0.671875, "learning_rate": 1.992276238193788e-05, "loss": 1.0932, "mean_token_accuracy": 0.7026484467089176, "num_tokens": 51363981.0, "step": 685 }, { "entropy": 1.1409345027059317, "epoch": 0.2124445556271829, "grad_norm": 0.73046875, "learning_rate": 1.992074056913464e-05, "loss": 1.1352, "mean_token_accuracy": 0.6939107369631529, "num_tokens": 51737796.0, "step": 690 }, { "entropy": 1.120890161767602, "epoch": 0.21398400892882916, "grad_norm": 0.7109375, "learning_rate": 1.9918692740345804e-05, "loss": 1.1338, "mean_token_accuracy": 0.6986452504992485, "num_tokens": 52114356.0, "step": 695 }, { "entropy": 1.119481140933931, "epoch": 0.21552346223047542, "grad_norm": 0.74609375, "learning_rate": 1.9916618900941567e-05, "loss": 1.1131, "mean_token_accuracy": 0.6989668853580951, "num_tokens": 52484836.0, "step": 700 }, { "entropy": 1.0964285958558322, "epoch": 0.21706291553212165, "grad_norm": 0.71484375, "learning_rate": 1.991451905636033e-05, "loss": 1.0937, "mean_token_accuracy": 0.7034055396914483, "num_tokens": 52859792.0, "step": 705 }, { "entropy": 1.1160279937088489, "epoch": 0.2186023688337679, "grad_norm": 0.75390625, "learning_rate": 1.9912393212108692e-05, "loss": 1.1109, "mean_token_accuracy": 0.6976350143551826, "num_tokens": 53212860.0, "step": 710 }, { "entropy": 1.14042426943779, "epoch": 0.22014182213541417, "grad_norm": 0.71484375, "learning_rate": 1.9910241373761426e-05, "loss": 1.1385, "mean_token_accuracy": 0.694380571320653, "num_tokens": 53583748.0, "step": 715 }, { "entropy": 1.1466562129557132, "epoch": 0.22168127543706043, "grad_norm": 0.74609375, "learning_rate": 1.9908063546961482e-05, "loss": 1.1338, "mean_token_accuracy": 0.6904741197824478, "num_tokens": 53940694.0, "step": 720 }, { "entropy": 1.121897478029132, "epoch": 0.22322072873870666, "grad_norm": 0.7265625, "learning_rate": 1.990585973741996e-05, "loss": 1.1211, "mean_token_accuracy": 0.6964031044393778, "num_tokens": 54316660.0, "step": 725 }, { "entropy": 1.1026945130899548, "epoch": 0.22476018204035292, "grad_norm": 0.7265625, "learning_rate": 1.9903629950916083e-05, "loss": 1.0919, "mean_token_accuracy": 0.7022646889090538, "num_tokens": 54700093.0, "step": 730 }, { "entropy": 1.1913654580712318, "epoch": 0.22629963534199918, "grad_norm": 0.71875, "learning_rate": 1.9901374193297212e-05, "loss": 1.1867, "mean_token_accuracy": 0.6831524942070246, "num_tokens": 55072259.0, "step": 735 }, { "entropy": 1.0986135648563504, "epoch": 0.22783908864364544, "grad_norm": 0.69921875, "learning_rate": 1.989909247047881e-05, "loss": 1.0859, "mean_token_accuracy": 0.70220061019063, "num_tokens": 55431253.0, "step": 740 }, { "entropy": 1.1104688480496407, "epoch": 0.22937854194529167, "grad_norm": 0.70703125, "learning_rate": 1.989678478844443e-05, "loss": 1.1053, "mean_token_accuracy": 0.7009272977709771, "num_tokens": 55806238.0, "step": 745 }, { "entropy": 1.1378316521644591, "epoch": 0.23091799524693793, "grad_norm": 0.77734375, "learning_rate": 1.9894451153245695e-05, "loss": 1.1323, "mean_token_accuracy": 0.6941636923700572, "num_tokens": 56167420.0, "step": 750 }, { "entropy": 1.0988559927791357, "epoch": 0.2324574485485842, "grad_norm": 0.6875, "learning_rate": 1.9892091571002295e-05, "loss": 1.1008, "mean_token_accuracy": 0.7004305239766836, "num_tokens": 56550823.0, "step": 755 }, { "entropy": 1.1214569361880422, "epoch": 0.23399690185023045, "grad_norm": 0.75, "learning_rate": 1.9889706047901956e-05, "loss": 1.1044, "mean_token_accuracy": 0.6996850349009037, "num_tokens": 56920052.0, "step": 760 }, { "entropy": 1.1102859888225793, "epoch": 0.23553635515187668, "grad_norm": 0.70703125, "learning_rate": 1.9887294590200437e-05, "loss": 1.11, "mean_token_accuracy": 0.6958253476768732, "num_tokens": 57288683.0, "step": 765 }, { "entropy": 1.1473000289872288, "epoch": 0.23707580845352294, "grad_norm": 0.734375, "learning_rate": 1.9884857204221503e-05, "loss": 1.1542, "mean_token_accuracy": 0.6928766690194607, "num_tokens": 57645195.0, "step": 770 }, { "entropy": 1.1104052532464266, "epoch": 0.2386152617551692, "grad_norm": 0.7421875, "learning_rate": 1.9882393896356915e-05, "loss": 1.096, "mean_token_accuracy": 0.6981043085455895, "num_tokens": 58010298.0, "step": 775 }, { "entropy": 1.1217896696180105, "epoch": 0.24015471505681546, "grad_norm": 0.69921875, "learning_rate": 1.987990467306641e-05, "loss": 1.1139, "mean_token_accuracy": 0.6969779424369336, "num_tokens": 58403545.0, "step": 780 }, { "entropy": 1.1406789550557732, "epoch": 0.2416941683584617, "grad_norm": 0.640625, "learning_rate": 1.9877389540877686e-05, "loss": 1.1472, "mean_token_accuracy": 0.6947149783372879, "num_tokens": 58774798.0, "step": 785 }, { "entropy": 1.124403426796198, "epoch": 0.24323362166010795, "grad_norm": 0.7109375, "learning_rate": 1.9874848506386392e-05, "loss": 1.1214, "mean_token_accuracy": 0.6990401953458786, "num_tokens": 59159772.0, "step": 790 }, { "entropy": 1.0997486164793373, "epoch": 0.2447730749617542, "grad_norm": 0.70703125, "learning_rate": 1.9872281576256078e-05, "loss": 1.0879, "mean_token_accuracy": 0.7038913916796445, "num_tokens": 59540395.0, "step": 795 }, { "entropy": 1.1355868607759476, "epoch": 0.24631252826340047, "grad_norm": 0.73046875, "learning_rate": 1.9869688757218233e-05, "loss": 1.1415, "mean_token_accuracy": 0.6912806447595358, "num_tokens": 59905249.0, "step": 800 }, { "entropy": 1.1410336146131157, "epoch": 0.2478519815650467, "grad_norm": 0.71875, "learning_rate": 1.9867070056072215e-05, "loss": 1.1433, "mean_token_accuracy": 0.695595920830965, "num_tokens": 60268255.0, "step": 805 }, { "entropy": 1.1349990352988244, "epoch": 0.24939143486669296, "grad_norm": 0.734375, "learning_rate": 1.986442547968527e-05, "loss": 1.1253, "mean_token_accuracy": 0.6944803945720196, "num_tokens": 60639389.0, "step": 810 }, { "entropy": 1.071821440383792, "epoch": 0.2509308881683392, "grad_norm": 0.75, "learning_rate": 1.9861755034992483e-05, "loss": 1.0666, "mean_token_accuracy": 0.7084377076476812, "num_tokens": 61024428.0, "step": 815 }, { "entropy": 1.1051497608423233, "epoch": 0.2524703414699855, "grad_norm": 0.7421875, "learning_rate": 1.9859058728996788e-05, "loss": 1.0965, "mean_token_accuracy": 0.7005310852080584, "num_tokens": 61402658.0, "step": 820 }, { "entropy": 1.1438620645552873, "epoch": 0.2540097947716317, "grad_norm": 0.71875, "learning_rate": 1.9856336568768936e-05, "loss": 1.1399, "mean_token_accuracy": 0.6912882044911385, "num_tokens": 61780493.0, "step": 825 }, { "entropy": 1.0913935292512178, "epoch": 0.255549248073278, "grad_norm": 0.76953125, "learning_rate": 1.985358856144747e-05, "loss": 1.0922, "mean_token_accuracy": 0.7028463281691074, "num_tokens": 62152861.0, "step": 830 }, { "entropy": 1.1374814191833138, "epoch": 0.25708870137492423, "grad_norm": 0.75, "learning_rate": 1.9850814714238718e-05, "loss": 1.13, "mean_token_accuracy": 0.6964493870735169, "num_tokens": 62514124.0, "step": 835 }, { "entropy": 1.1332073567435146, "epoch": 0.25862815467657047, "grad_norm": 0.69140625, "learning_rate": 1.9848015034416776e-05, "loss": 1.1199, "mean_token_accuracy": 0.6939284823834896, "num_tokens": 62901998.0, "step": 840 }, { "entropy": 1.1137794975191355, "epoch": 0.26016760797821675, "grad_norm": 0.7734375, "learning_rate": 1.9845189529323473e-05, "loss": 1.103, "mean_token_accuracy": 0.7006840953603387, "num_tokens": 63266839.0, "step": 845 }, { "entropy": 1.1099360350519418, "epoch": 0.261707061279863, "grad_norm": 0.7109375, "learning_rate": 1.9842338206368375e-05, "loss": 1.0998, "mean_token_accuracy": 0.6972894985228777, "num_tokens": 63654737.0, "step": 850 }, { "entropy": 1.1284802999347447, "epoch": 0.2632465145815092, "grad_norm": 0.75390625, "learning_rate": 1.9839461073028733e-05, "loss": 1.1083, "mean_token_accuracy": 0.6968803893774748, "num_tokens": 64032094.0, "step": 855 }, { "entropy": 1.0841836363077164, "epoch": 0.2647859678831555, "grad_norm": 0.75390625, "learning_rate": 1.98365581368495e-05, "loss": 1.0933, "mean_token_accuracy": 0.7028985098004341, "num_tokens": 64418973.0, "step": 860 }, { "entropy": 1.1070842415094375, "epoch": 0.26632542118480174, "grad_norm": 0.7265625, "learning_rate": 1.9833629405443283e-05, "loss": 1.1091, "mean_token_accuracy": 0.7023597385734319, "num_tokens": 64798969.0, "step": 865 }, { "entropy": 1.1159617979079486, "epoch": 0.267864874486448, "grad_norm": 0.734375, "learning_rate": 1.983067488649035e-05, "loss": 1.1119, "mean_token_accuracy": 0.6988450512290001, "num_tokens": 65171715.0, "step": 870 }, { "entropy": 1.1518226452171803, "epoch": 0.26940432778809426, "grad_norm": 0.72265625, "learning_rate": 1.982769458773857e-05, "loss": 1.1421, "mean_token_accuracy": 0.6895007479935884, "num_tokens": 65548454.0, "step": 875 }, { "entropy": 1.1310207761824131, "epoch": 0.2709437810897405, "grad_norm": 0.71875, "learning_rate": 1.9824688517003433e-05, "loss": 1.1165, "mean_token_accuracy": 0.6969778280705213, "num_tokens": 65912713.0, "step": 880 }, { "entropy": 1.0850966442376375, "epoch": 0.2724832343913868, "grad_norm": 0.78125, "learning_rate": 1.9821656682168013e-05, "loss": 1.0868, "mean_token_accuracy": 0.7045084740966558, "num_tokens": 66288389.0, "step": 885 }, { "entropy": 1.116120758280158, "epoch": 0.274022687693033, "grad_norm": 0.69921875, "learning_rate": 1.981859909118294e-05, "loss": 1.1183, "mean_token_accuracy": 0.6976446002721787, "num_tokens": 66673853.0, "step": 890 }, { "entropy": 1.1547842472791672, "epoch": 0.27556214099467924, "grad_norm": 0.76171875, "learning_rate": 1.9815515752066386e-05, "loss": 1.1512, "mean_token_accuracy": 0.6902260981500149, "num_tokens": 67054614.0, "step": 895 }, { "entropy": 1.0831589922308922, "epoch": 0.2771015942963255, "grad_norm": 0.6796875, "learning_rate": 1.9812406672904058e-05, "loss": 1.0824, "mean_token_accuracy": 0.7042932607233524, "num_tokens": 67422842.0, "step": 900 }, { "entropy": 1.1236521264538168, "epoch": 0.27864104759797176, "grad_norm": 0.80078125, "learning_rate": 1.9809271861849147e-05, "loss": 1.1257, "mean_token_accuracy": 0.6985704395920038, "num_tokens": 67791499.0, "step": 905 }, { "entropy": 1.1213534710928799, "epoch": 0.28018050089961805, "grad_norm": 0.72265625, "learning_rate": 1.9806111327122332e-05, "loss": 1.1056, "mean_token_accuracy": 0.6963206488639117, "num_tokens": 68168533.0, "step": 910 }, { "entropy": 1.0945915594696998, "epoch": 0.2817199542012643, "grad_norm": 0.7265625, "learning_rate": 1.9802925077011742e-05, "loss": 1.0805, "mean_token_accuracy": 0.7033400624990463, "num_tokens": 68534200.0, "step": 915 }, { "entropy": 1.1363273495808244, "epoch": 0.2832594075029105, "grad_norm": 0.74609375, "learning_rate": 1.979971311987295e-05, "loss": 1.1331, "mean_token_accuracy": 0.6933297269046307, "num_tokens": 68904756.0, "step": 920 }, { "entropy": 1.113439468294382, "epoch": 0.2847988608045568, "grad_norm": 0.67578125, "learning_rate": 1.9796475464128943e-05, "loss": 1.1136, "mean_token_accuracy": 0.6984921019524336, "num_tokens": 69279269.0, "step": 925 }, { "entropy": 1.106918627768755, "epoch": 0.28633831410620303, "grad_norm": 0.7265625, "learning_rate": 1.979321211827009e-05, "loss": 1.0971, "mean_token_accuracy": 0.699981477856636, "num_tokens": 69652060.0, "step": 930 }, { "entropy": 1.1193274904042483, "epoch": 0.28787776740784926, "grad_norm": 0.6953125, "learning_rate": 1.9789923090854138e-05, "loss": 1.1141, "mean_token_accuracy": 0.6945442810654641, "num_tokens": 70031530.0, "step": 935 }, { "entropy": 1.1201645512133838, "epoch": 0.28941722070949555, "grad_norm": 0.69921875, "learning_rate": 1.9786608390506176e-05, "loss": 1.1248, "mean_token_accuracy": 0.6959635071456433, "num_tokens": 70405759.0, "step": 940 }, { "entropy": 1.158202064409852, "epoch": 0.2909566740111418, "grad_norm": 0.7578125, "learning_rate": 1.9783268025918622e-05, "loss": 1.1405, "mean_token_accuracy": 0.6916137792170047, "num_tokens": 70773411.0, "step": 945 }, { "entropy": 1.1136011434718966, "epoch": 0.29249612731278807, "grad_norm": 0.7109375, "learning_rate": 1.9779902005851187e-05, "loss": 1.1032, "mean_token_accuracy": 0.6998088311403989, "num_tokens": 71138724.0, "step": 950 }, { "entropy": 1.1528440322726965, "epoch": 0.2940355806144343, "grad_norm": 0.7109375, "learning_rate": 1.9776510339130874e-05, "loss": 1.1432, "mean_token_accuracy": 0.6916706405580044, "num_tokens": 71522642.0, "step": 955 }, { "entropy": 1.1416105089709163, "epoch": 0.29557503391608053, "grad_norm": 0.70703125, "learning_rate": 1.9773093034651928e-05, "loss": 1.1315, "mean_token_accuracy": 0.6934664513915777, "num_tokens": 71885197.0, "step": 960 }, { "entropy": 1.1288053080439568, "epoch": 0.2971144872177268, "grad_norm": 0.7109375, "learning_rate": 1.9769650101375835e-05, "loss": 1.1253, "mean_token_accuracy": 0.6961982771754265, "num_tokens": 72262607.0, "step": 965 }, { "entropy": 1.1250951839610934, "epoch": 0.29865394051937305, "grad_norm": 0.6796875, "learning_rate": 1.9766181548331283e-05, "loss": 1.1186, "mean_token_accuracy": 0.6970525443553924, "num_tokens": 72653402.0, "step": 970 }, { "entropy": 1.1368791069835424, "epoch": 0.3001933938210193, "grad_norm": 0.78125, "learning_rate": 1.9762687384614152e-05, "loss": 1.132, "mean_token_accuracy": 0.6947309102863073, "num_tokens": 73049063.0, "step": 975 }, { "entropy": 1.083188571408391, "epoch": 0.30173284712266557, "grad_norm": 0.69921875, "learning_rate": 1.9759167619387474e-05, "loss": 1.0838, "mean_token_accuracy": 0.7051486879587173, "num_tokens": 73435640.0, "step": 980 }, { "entropy": 1.1301437310874463, "epoch": 0.3032723004243118, "grad_norm": 0.71875, "learning_rate": 1.975562226188143e-05, "loss": 1.1135, "mean_token_accuracy": 0.6951402083039284, "num_tokens": 73804251.0, "step": 985 }, { "entropy": 1.1021712820976972, "epoch": 0.3048117537259581, "grad_norm": 0.72265625, "learning_rate": 1.97520513213933e-05, "loss": 1.1047, "mean_token_accuracy": 0.6995002727955579, "num_tokens": 74186734.0, "step": 990 }, { "entropy": 1.1268383231014014, "epoch": 0.3063512070276043, "grad_norm": 0.67578125, "learning_rate": 1.9748454807287458e-05, "loss": 1.1197, "mean_token_accuracy": 0.6963075909763574, "num_tokens": 74564695.0, "step": 995 }, { "entropy": 1.1207784935832024, "epoch": 0.30789066032925055, "grad_norm": 0.7421875, "learning_rate": 1.974483272899535e-05, "loss": 1.1225, "mean_token_accuracy": 0.6975628361105919, "num_tokens": 74954009.0, "step": 1000 }, { "entropy": 1.1320615615695715, "epoch": 0.30943011363089684, "grad_norm": 0.7109375, "learning_rate": 1.974118509601545e-05, "loss": 1.1245, "mean_token_accuracy": 0.6957272073253989, "num_tokens": 75329081.0, "step": 1005 }, { "entropy": 1.0997402749955654, "epoch": 0.3109695669325431, "grad_norm": 0.7265625, "learning_rate": 1.973751191791325e-05, "loss": 1.0889, "mean_token_accuracy": 0.7017048012465239, "num_tokens": 75696214.0, "step": 1010 }, { "entropy": 1.0914274197071792, "epoch": 0.31250902023418936, "grad_norm": 0.671875, "learning_rate": 1.9733813204321233e-05, "loss": 1.0761, "mean_token_accuracy": 0.7037324849516153, "num_tokens": 76068328.0, "step": 1015 }, { "entropy": 1.1191833563148976, "epoch": 0.3140484735358356, "grad_norm": 0.71484375, "learning_rate": 1.9730088964938842e-05, "loss": 1.1121, "mean_token_accuracy": 0.6989397961646319, "num_tokens": 76441289.0, "step": 1020 }, { "entropy": 1.1179291112348437, "epoch": 0.3155879268374818, "grad_norm": 0.70703125, "learning_rate": 1.9726339209532462e-05, "loss": 1.0951, "mean_token_accuracy": 0.7015183545649052, "num_tokens": 76814090.0, "step": 1025 }, { "entropy": 1.1256714541465045, "epoch": 0.3171273801391281, "grad_norm": 0.72265625, "learning_rate": 1.972256394793539e-05, "loss": 1.1131, "mean_token_accuracy": 0.6952388241887093, "num_tokens": 77179591.0, "step": 1030 }, { "entropy": 1.136961457133293, "epoch": 0.31866683344077434, "grad_norm": 0.7421875, "learning_rate": 1.971876319004781e-05, "loss": 1.1182, "mean_token_accuracy": 0.6935086127370595, "num_tokens": 77550799.0, "step": 1035 }, { "entropy": 1.1292035300284624, "epoch": 0.3202062867424206, "grad_norm": 0.73828125, "learning_rate": 1.9714936945836764e-05, "loss": 1.1177, "mean_token_accuracy": 0.6930017314851284, "num_tokens": 77920454.0, "step": 1040 }, { "entropy": 1.0919932153075933, "epoch": 0.32174574004406686, "grad_norm": 0.75390625, "learning_rate": 1.971108522533613e-05, "loss": 1.078, "mean_token_accuracy": 0.7059255817905068, "num_tokens": 78285931.0, "step": 1045 }, { "entropy": 1.116225427389145, "epoch": 0.3232851933457131, "grad_norm": 0.73046875, "learning_rate": 1.9707208038646605e-05, "loss": 1.1197, "mean_token_accuracy": 0.6983599919825793, "num_tokens": 78657492.0, "step": 1050 }, { "entropy": 1.1196499440819025, "epoch": 0.3248246466473594, "grad_norm": 0.7109375, "learning_rate": 1.970330539593565e-05, "loss": 1.1043, "mean_token_accuracy": 0.6965556625276804, "num_tokens": 79026794.0, "step": 1055 }, { "entropy": 1.1315435644239187, "epoch": 0.3263640999490056, "grad_norm": 0.71875, "learning_rate": 1.969937730743749e-05, "loss": 1.1248, "mean_token_accuracy": 0.696228601038456, "num_tokens": 79400596.0, "step": 1060 }, { "entropy": 1.0820589877665043, "epoch": 0.32790355325065185, "grad_norm": 0.7421875, "learning_rate": 1.9695423783453086e-05, "loss": 1.0836, "mean_token_accuracy": 0.705596823990345, "num_tokens": 79767657.0, "step": 1065 }, { "entropy": 1.1282978903502225, "epoch": 0.32944300655229813, "grad_norm": 0.703125, "learning_rate": 1.969144483435009e-05, "loss": 1.1241, "mean_token_accuracy": 0.6953945115208626, "num_tokens": 80144261.0, "step": 1070 }, { "entropy": 1.1406402667984366, "epoch": 0.33098245985394437, "grad_norm": 0.734375, "learning_rate": 1.968744047056283e-05, "loss": 1.1297, "mean_token_accuracy": 0.6934267330914736, "num_tokens": 80525193.0, "step": 1075 }, { "entropy": 1.1295597156509758, "epoch": 0.3325219131555906, "grad_norm": 0.75, "learning_rate": 1.9683410702592284e-05, "loss": 1.1203, "mean_token_accuracy": 0.6963451337069273, "num_tokens": 80905579.0, "step": 1080 }, { "entropy": 1.1091342974454164, "epoch": 0.3340613664572369, "grad_norm": 0.72265625, "learning_rate": 1.9679355541006056e-05, "loss": 1.1029, "mean_token_accuracy": 0.6987722083926201, "num_tokens": 81285902.0, "step": 1085 }, { "entropy": 1.1366256965324282, "epoch": 0.3356008197588831, "grad_norm": 0.77734375, "learning_rate": 1.9675274996438324e-05, "loss": 1.1364, "mean_token_accuracy": 0.6947485759854317, "num_tokens": 81653385.0, "step": 1090 }, { "entropy": 1.1193459507077932, "epoch": 0.3371402730605294, "grad_norm": 0.74609375, "learning_rate": 1.967116907958985e-05, "loss": 1.1022, "mean_token_accuracy": 0.7003271400928497, "num_tokens": 82021575.0, "step": 1095 }, { "entropy": 1.1462248302996159, "epoch": 0.33867972636217564, "grad_norm": 0.70703125, "learning_rate": 1.9667037801227914e-05, "loss": 1.1351, "mean_token_accuracy": 0.6924805622547865, "num_tokens": 82399380.0, "step": 1100 }, { "entropy": 1.107696833834052, "epoch": 0.34021917966382187, "grad_norm": 0.7109375, "learning_rate": 1.9662881172186313e-05, "loss": 1.1058, "mean_token_accuracy": 0.7026475485414266, "num_tokens": 82771918.0, "step": 1105 }, { "entropy": 1.1295810148119927, "epoch": 0.34175863296546816, "grad_norm": 0.75390625, "learning_rate": 1.965869920336533e-05, "loss": 1.1236, "mean_token_accuracy": 0.6973136257380247, "num_tokens": 83137444.0, "step": 1110 }, { "entropy": 1.1330510720610618, "epoch": 0.3432980862671144, "grad_norm": 0.80859375, "learning_rate": 1.965449190573168e-05, "loss": 1.1317, "mean_token_accuracy": 0.6966150533407927, "num_tokens": 83500864.0, "step": 1115 }, { "entropy": 1.1691056948155165, "epoch": 0.3448375395687606, "grad_norm": 0.7109375, "learning_rate": 1.965025929031852e-05, "loss": 1.1643, "mean_token_accuracy": 0.6873539566993714, "num_tokens": 83868277.0, "step": 1120 }, { "entropy": 1.0945931367576123, "epoch": 0.3463769928704069, "grad_norm": 0.67578125, "learning_rate": 1.9646001368225382e-05, "loss": 1.1016, "mean_token_accuracy": 0.7012989364564419, "num_tokens": 84252198.0, "step": 1125 }, { "entropy": 1.165550697594881, "epoch": 0.34791644617205314, "grad_norm": 0.74609375, "learning_rate": 1.9641718150618177e-05, "loss": 1.1467, "mean_token_accuracy": 0.6915617097169161, "num_tokens": 84617359.0, "step": 1130 }, { "entropy": 1.1262395735830069, "epoch": 0.3494558994736994, "grad_norm": 0.71875, "learning_rate": 1.9637409648729142e-05, "loss": 1.1208, "mean_token_accuracy": 0.6933946672827005, "num_tokens": 85000015.0, "step": 1135 }, { "entropy": 1.129942279495299, "epoch": 0.35099535277534566, "grad_norm": 0.7109375, "learning_rate": 1.963307587385682e-05, "loss": 1.1206, "mean_token_accuracy": 0.6961002223193645, "num_tokens": 85384245.0, "step": 1140 }, { "entropy": 1.1344817027449607, "epoch": 0.3525348060769919, "grad_norm": 0.703125, "learning_rate": 1.962871683736603e-05, "loss": 1.1255, "mean_token_accuracy": 0.6936954416334629, "num_tokens": 85754567.0, "step": 1145 }, { "entropy": 1.1344742052257062, "epoch": 0.3540742593786382, "grad_norm": 0.69921875, "learning_rate": 1.9624332550687834e-05, "loss": 1.1209, "mean_token_accuracy": 0.695965689048171, "num_tokens": 86130538.0, "step": 1150 }, { "entropy": 1.1286322576925159, "epoch": 0.3556137126802844, "grad_norm": 0.703125, "learning_rate": 1.961992302531952e-05, "loss": 1.1213, "mean_token_accuracy": 0.6975085325539112, "num_tokens": 86505523.0, "step": 1155 }, { "entropy": 1.161212246119976, "epoch": 0.35715316598193064, "grad_norm": 0.69140625, "learning_rate": 1.961548827282455e-05, "loss": 1.1607, "mean_token_accuracy": 0.6912364710122347, "num_tokens": 86889854.0, "step": 1160 }, { "entropy": 1.1156503956764936, "epoch": 0.35869261928357693, "grad_norm": 0.7265625, "learning_rate": 1.9611028304832547e-05, "loss": 1.1063, "mean_token_accuracy": 0.697390603646636, "num_tokens": 87275027.0, "step": 1165 }, { "entropy": 1.117064966261387, "epoch": 0.36023207258522316, "grad_norm": 0.69140625, "learning_rate": 1.9606543133039254e-05, "loss": 1.1028, "mean_token_accuracy": 0.70021205060184, "num_tokens": 87649310.0, "step": 1170 }, { "entropy": 1.1142473477870225, "epoch": 0.36177152588686945, "grad_norm": 0.71484375, "learning_rate": 1.9602032769206517e-05, "loss": 1.1113, "mean_token_accuracy": 0.6982534524053335, "num_tokens": 88021284.0, "step": 1175 }, { "entropy": 1.1146583622321486, "epoch": 0.3633109791885157, "grad_norm": 0.734375, "learning_rate": 1.9597497225162233e-05, "loss": 1.1098, "mean_token_accuracy": 0.6998208686709404, "num_tokens": 88397256.0, "step": 1180 }, { "entropy": 1.1496895281597972, "epoch": 0.3648504324901619, "grad_norm": 0.76171875, "learning_rate": 1.959293651280034e-05, "loss": 1.1573, "mean_token_accuracy": 0.6919562425464392, "num_tokens": 88763426.0, "step": 1185 }, { "entropy": 1.1269241459667683, "epoch": 0.3663898857918082, "grad_norm": 0.73828125, "learning_rate": 1.9588350644080777e-05, "loss": 1.1105, "mean_token_accuracy": 0.6988791462033987, "num_tokens": 89118435.0, "step": 1190 }, { "entropy": 1.0833050038665533, "epoch": 0.36792933909345443, "grad_norm": 0.6796875, "learning_rate": 1.9583739631029446e-05, "loss": 1.0802, "mean_token_accuracy": 0.7041361082345248, "num_tokens": 89508601.0, "step": 1195 }, { "entropy": 1.1451345276087523, "epoch": 0.36946879239510066, "grad_norm": 0.734375, "learning_rate": 1.957910348573819e-05, "loss": 1.1369, "mean_token_accuracy": 0.6917477056384087, "num_tokens": 89893267.0, "step": 1200 }, { "entropy": 1.0983753545209765, "epoch": 0.37100824569674695, "grad_norm": 0.6953125, "learning_rate": 1.9574442220364768e-05, "loss": 1.0951, "mean_token_accuracy": 0.7006513494998217, "num_tokens": 90284037.0, "step": 1205 }, { "entropy": 1.116368711926043, "epoch": 0.3725476989983932, "grad_norm": 0.71484375, "learning_rate": 1.9569755847132796e-05, "loss": 1.1144, "mean_token_accuracy": 0.6977820225059986, "num_tokens": 90670311.0, "step": 1210 }, { "entropy": 1.094654480740428, "epoch": 0.37408715230003947, "grad_norm": 0.734375, "learning_rate": 1.9565044378331745e-05, "loss": 1.0829, "mean_token_accuracy": 0.7023903023451566, "num_tokens": 91055385.0, "step": 1215 }, { "entropy": 1.115629038028419, "epoch": 0.3756266056016857, "grad_norm": 0.71484375, "learning_rate": 1.9560307826316892e-05, "loss": 1.1184, "mean_token_accuracy": 0.6971225813031197, "num_tokens": 91424223.0, "step": 1220 }, { "entropy": 1.1635486509650945, "epoch": 0.37716605890333194, "grad_norm": 0.75390625, "learning_rate": 1.9555546203509297e-05, "loss": 1.1615, "mean_token_accuracy": 0.6906606066972018, "num_tokens": 91796012.0, "step": 1225 }, { "entropy": 1.120249069854617, "epoch": 0.3787055122049782, "grad_norm": 0.7265625, "learning_rate": 1.9550759522395753e-05, "loss": 1.1022, "mean_token_accuracy": 0.6964717313647271, "num_tokens": 92162375.0, "step": 1230 }, { "entropy": 1.1134164540097118, "epoch": 0.38024496550662445, "grad_norm": 0.734375, "learning_rate": 1.9545947795528777e-05, "loss": 1.1205, "mean_token_accuracy": 0.6987472154200077, "num_tokens": 92545936.0, "step": 1235 }, { "entropy": 1.086888193897903, "epoch": 0.3817844188082707, "grad_norm": 0.70703125, "learning_rate": 1.9541111035526563e-05, "loss": 1.0868, "mean_token_accuracy": 0.7030756056308747, "num_tokens": 92928503.0, "step": 1240 }, { "entropy": 1.1007358327507972, "epoch": 0.383323872109917, "grad_norm": 0.6953125, "learning_rate": 1.953624925507295e-05, "loss": 1.0914, "mean_token_accuracy": 0.7022611912339926, "num_tokens": 93313261.0, "step": 1245 }, { "entropy": 1.135701997205615, "epoch": 0.3848633254115632, "grad_norm": 0.71875, "learning_rate": 1.9531362466917388e-05, "loss": 1.1208, "mean_token_accuracy": 0.6953465500846505, "num_tokens": 93694867.0, "step": 1250 }, { "entropy": 1.141565052047372, "epoch": 0.3864027787132095, "grad_norm": 0.74609375, "learning_rate": 1.952645068387491e-05, "loss": 1.1328, "mean_token_accuracy": 0.69326724819839, "num_tokens": 94082631.0, "step": 1255 }, { "entropy": 1.1221220299601555, "epoch": 0.3879422320148557, "grad_norm": 0.72265625, "learning_rate": 1.95215139188261e-05, "loss": 1.1079, "mean_token_accuracy": 0.6988440815359354, "num_tokens": 94457533.0, "step": 1260 }, { "entropy": 1.1194452840834856, "epoch": 0.38948168531650196, "grad_norm": 0.73046875, "learning_rate": 1.9516552184717036e-05, "loss": 1.1215, "mean_token_accuracy": 0.696359645575285, "num_tokens": 94829571.0, "step": 1265 }, { "entropy": 1.095098103582859, "epoch": 0.39102113861814825, "grad_norm": 0.69140625, "learning_rate": 1.9511565494559298e-05, "loss": 1.0958, "mean_token_accuracy": 0.7043366067111492, "num_tokens": 95200118.0, "step": 1270 }, { "entropy": 1.1012009687721729, "epoch": 0.3925605919197945, "grad_norm": 0.73828125, "learning_rate": 1.95065538614299e-05, "loss": 1.0911, "mean_token_accuracy": 0.7037279218435287, "num_tokens": 95570272.0, "step": 1275 }, { "entropy": 1.1257656961679459, "epoch": 0.3941000452214407, "grad_norm": 0.77734375, "learning_rate": 1.950151729847126e-05, "loss": 1.1224, "mean_token_accuracy": 0.6986918987706303, "num_tokens": 95942085.0, "step": 1280 }, { "entropy": 1.1478566963225603, "epoch": 0.395639498523087, "grad_norm": 0.68359375, "learning_rate": 1.949645581889118e-05, "loss": 1.1455, "mean_token_accuracy": 0.6915257848799229, "num_tokens": 96317314.0, "step": 1285 }, { "entropy": 1.1262834113091231, "epoch": 0.39717895182473323, "grad_norm": 0.68359375, "learning_rate": 1.9491369435962802e-05, "loss": 1.1219, "mean_token_accuracy": 0.6945701058954, "num_tokens": 96698109.0, "step": 1290 }, { "entropy": 1.0999675188213587, "epoch": 0.3987184051263795, "grad_norm": 0.71875, "learning_rate": 1.9486258163024567e-05, "loss": 1.0967, "mean_token_accuracy": 0.7008256938308477, "num_tokens": 97074251.0, "step": 1295 }, { "entropy": 1.127872526086867, "epoch": 0.40025785842802575, "grad_norm": 0.76171875, "learning_rate": 1.94811220134802e-05, "loss": 1.1225, "mean_token_accuracy": 0.6996113903820514, "num_tokens": 97446524.0, "step": 1300 }, { "entropy": 1.1096723936498165, "epoch": 0.401797311729672, "grad_norm": 0.73046875, "learning_rate": 1.9475961000798645e-05, "loss": 1.1048, "mean_token_accuracy": 0.6985050681978464, "num_tokens": 97831999.0, "step": 1305 }, { "entropy": 1.1193984607234597, "epoch": 0.40333676503131827, "grad_norm": 0.734375, "learning_rate": 1.9470775138514063e-05, "loss": 1.111, "mean_token_accuracy": 0.6988893166184426, "num_tokens": 98203695.0, "step": 1310 }, { "entropy": 1.1497751019895077, "epoch": 0.4048762183329645, "grad_norm": 0.7265625, "learning_rate": 1.9465564440225768e-05, "loss": 1.1275, "mean_token_accuracy": 0.6922019004821778, "num_tokens": 98579150.0, "step": 1315 }, { "entropy": 1.146084163337946, "epoch": 0.40641567163461073, "grad_norm": 0.7421875, "learning_rate": 1.9460328919598216e-05, "loss": 1.1382, "mean_token_accuracy": 0.6955520674586296, "num_tokens": 98943956.0, "step": 1320 }, { "entropy": 1.1438047185540199, "epoch": 0.407955124936257, "grad_norm": 0.7421875, "learning_rate": 1.9455068590360943e-05, "loss": 1.1408, "mean_token_accuracy": 0.6917512208223343, "num_tokens": 99326339.0, "step": 1325 }, { "entropy": 1.1105543179437518, "epoch": 0.40949457823790325, "grad_norm": 0.765625, "learning_rate": 1.9449783466308553e-05, "loss": 1.1093, "mean_token_accuracy": 0.6983879100531339, "num_tokens": 99693304.0, "step": 1330 }, { "entropy": 1.1154874304309488, "epoch": 0.41103403153954954, "grad_norm": 0.67578125, "learning_rate": 1.9444473561300666e-05, "loss": 1.1124, "mean_token_accuracy": 0.6970164556056261, "num_tokens": 100076953.0, "step": 1335 }, { "entropy": 1.1657130055129528, "epoch": 0.41257348484119577, "grad_norm": 0.7109375, "learning_rate": 1.943913888926189e-05, "loss": 1.1697, "mean_token_accuracy": 0.6894268091768027, "num_tokens": 100447813.0, "step": 1340 }, { "entropy": 1.0991169594228267, "epoch": 0.414112938142842, "grad_norm": 0.7109375, "learning_rate": 1.943377946418178e-05, "loss": 1.0923, "mean_token_accuracy": 0.7011879209429026, "num_tokens": 100835066.0, "step": 1345 }, { "entropy": 1.0682245310395957, "epoch": 0.4156523914444883, "grad_norm": 0.7734375, "learning_rate": 1.9428395300114803e-05, "loss": 1.0678, "mean_token_accuracy": 0.709788928553462, "num_tokens": 101195353.0, "step": 1350 }, { "entropy": 1.1283558243885636, "epoch": 0.4171918447461345, "grad_norm": 0.66796875, "learning_rate": 1.94229864111803e-05, "loss": 1.1191, "mean_token_accuracy": 0.6948264576494694, "num_tokens": 101571638.0, "step": 1355 }, { "entropy": 1.114413278736174, "epoch": 0.4187312980477808, "grad_norm": 0.6953125, "learning_rate": 1.9417552811562457e-05, "loss": 1.1174, "mean_token_accuracy": 0.6991838045418263, "num_tokens": 101941042.0, "step": 1360 }, { "entropy": 1.1175668630748987, "epoch": 0.42027075134942704, "grad_norm": 0.74609375, "learning_rate": 1.941209451551025e-05, "loss": 1.1069, "mean_token_accuracy": 0.6971942469477653, "num_tokens": 102314017.0, "step": 1365 }, { "entropy": 1.0761339336633682, "epoch": 0.4218102046510733, "grad_norm": 0.69921875, "learning_rate": 1.9406611537337425e-05, "loss": 1.0622, "mean_token_accuracy": 0.7066352400928736, "num_tokens": 102691186.0, "step": 1370 }, { "entropy": 1.127281517535448, "epoch": 0.42334965795271956, "grad_norm": 0.7890625, "learning_rate": 1.9401103891422455e-05, "loss": 1.1202, "mean_token_accuracy": 0.6942048665136099, "num_tokens": 103071698.0, "step": 1375 }, { "entropy": 1.086047711968422, "epoch": 0.4248891112543658, "grad_norm": 0.71484375, "learning_rate": 1.93955715922085e-05, "loss": 1.0819, "mean_token_accuracy": 0.7019645646214485, "num_tokens": 103457908.0, "step": 1380 }, { "entropy": 1.1055951166898013, "epoch": 0.426428564556012, "grad_norm": 0.71875, "learning_rate": 1.939001465420337e-05, "loss": 1.1062, "mean_token_accuracy": 0.6994627211242914, "num_tokens": 103836470.0, "step": 1385 }, { "entropy": 1.1144292425364255, "epoch": 0.4279680178576583, "grad_norm": 0.71875, "learning_rate": 1.938443309197948e-05, "loss": 1.1048, "mean_token_accuracy": 0.6957655198872089, "num_tokens": 104216895.0, "step": 1390 }, { "entropy": 1.1153745524585248, "epoch": 0.42950747115930454, "grad_norm": 0.7265625, "learning_rate": 1.9378826920173835e-05, "loss": 1.1234, "mean_token_accuracy": 0.6969841800630092, "num_tokens": 104601319.0, "step": 1395 }, { "entropy": 1.1316595112904906, "epoch": 0.43104692446095083, "grad_norm": 0.71875, "learning_rate": 1.9373196153487962e-05, "loss": 1.129, "mean_token_accuracy": 0.6969845864921809, "num_tokens": 104967171.0, "step": 1400 }, { "entropy": 1.1544791884720325, "epoch": 0.43258637776259706, "grad_norm": 0.7265625, "learning_rate": 1.9367540806687894e-05, "loss": 1.15, "mean_token_accuracy": 0.6929264325648546, "num_tokens": 105333438.0, "step": 1405 }, { "entropy": 1.1271388109773397, "epoch": 0.4341258310642433, "grad_norm": 0.796875, "learning_rate": 1.9361860894604116e-05, "loss": 1.1161, "mean_token_accuracy": 0.6955098442733287, "num_tokens": 105691785.0, "step": 1410 }, { "entropy": 1.1479596089571715, "epoch": 0.4356652843658896, "grad_norm": 0.69140625, "learning_rate": 1.9356156432131533e-05, "loss": 1.1482, "mean_token_accuracy": 0.6920965306460858, "num_tokens": 106078624.0, "step": 1415 }, { "entropy": 1.1149195641279221, "epoch": 0.4372047376675358, "grad_norm": 0.72265625, "learning_rate": 1.935042743422944e-05, "loss": 1.1028, "mean_token_accuracy": 0.6970803182572126, "num_tokens": 106454246.0, "step": 1420 }, { "entropy": 1.0929339196532966, "epoch": 0.43874419096918205, "grad_norm": 0.75390625, "learning_rate": 1.934467391592146e-05, "loss": 1.1047, "mean_token_accuracy": 0.7016421973705291, "num_tokens": 106810481.0, "step": 1425 }, { "entropy": 1.0979965701699257, "epoch": 0.44028364427082833, "grad_norm": 0.765625, "learning_rate": 1.9338895892295527e-05, "loss": 1.0956, "mean_token_accuracy": 0.7029366530478001, "num_tokens": 107196667.0, "step": 1430 }, { "entropy": 1.1433403573930263, "epoch": 0.44182309757247457, "grad_norm": 0.78515625, "learning_rate": 1.9333093378503832e-05, "loss": 1.1375, "mean_token_accuracy": 0.6927531309425831, "num_tokens": 107575900.0, "step": 1435 }, { "entropy": 1.1472560165449976, "epoch": 0.44336255087412085, "grad_norm": 0.74609375, "learning_rate": 1.9327266389762787e-05, "loss": 1.1371, "mean_token_accuracy": 0.6947022203356028, "num_tokens": 107944294.0, "step": 1440 }, { "entropy": 1.101127756945789, "epoch": 0.4449020041757671, "grad_norm": 0.75390625, "learning_rate": 1.9321414941353006e-05, "loss": 1.0928, "mean_token_accuracy": 0.7010299023240805, "num_tokens": 108312798.0, "step": 1445 }, { "entropy": 1.1180545002222062, "epoch": 0.4464414574774133, "grad_norm": 0.70703125, "learning_rate": 1.9315539048619212e-05, "loss": 1.1234, "mean_token_accuracy": 0.6960787653923035, "num_tokens": 108690533.0, "step": 1450 }, { "entropy": 1.1227679682895542, "epoch": 0.4479809107790596, "grad_norm": 0.76953125, "learning_rate": 1.930963872697026e-05, "loss": 1.1046, "mean_token_accuracy": 0.6982706602662802, "num_tokens": 109068398.0, "step": 1455 }, { "entropy": 1.107317195646465, "epoch": 0.44952036408070584, "grad_norm": 0.71875, "learning_rate": 1.9303713991879052e-05, "loss": 1.1001, "mean_token_accuracy": 0.6980501331388951, "num_tokens": 109446077.0, "step": 1460 }, { "entropy": 1.1386326614767313, "epoch": 0.45105981738235207, "grad_norm": 0.71875, "learning_rate": 1.9297764858882516e-05, "loss": 1.1239, "mean_token_accuracy": 0.6934384491294623, "num_tokens": 109826830.0, "step": 1465 }, { "entropy": 1.1245597016066313, "epoch": 0.45259927068399836, "grad_norm": 0.765625, "learning_rate": 1.9291791343581557e-05, "loss": 1.1149, "mean_token_accuracy": 0.6970586907118559, "num_tokens": 110206021.0, "step": 1470 }, { "entropy": 1.112450549006462, "epoch": 0.4541387239856446, "grad_norm": 0.7578125, "learning_rate": 1.928579346164103e-05, "loss": 1.1129, "mean_token_accuracy": 0.6991185300052166, "num_tokens": 110575825.0, "step": 1475 }, { "entropy": 1.1001921689137817, "epoch": 0.4556781772872909, "grad_norm": 0.734375, "learning_rate": 1.927977122878967e-05, "loss": 1.1028, "mean_token_accuracy": 0.7005803253501653, "num_tokens": 110933606.0, "step": 1480 }, { "entropy": 1.136134173721075, "epoch": 0.4572176305889371, "grad_norm": 0.69921875, "learning_rate": 1.9273724660820086e-05, "loss": 1.1169, "mean_token_accuracy": 0.6969247065484524, "num_tokens": 111297173.0, "step": 1485 }, { "entropy": 1.1197788801044226, "epoch": 0.45875708389058334, "grad_norm": 0.671875, "learning_rate": 1.9267653773588702e-05, "loss": 1.1111, "mean_token_accuracy": 0.6978486493229866, "num_tokens": 111679485.0, "step": 1490 }, { "entropy": 1.1003839764744043, "epoch": 0.4602965371922296, "grad_norm": 0.66796875, "learning_rate": 1.926155858301571e-05, "loss": 1.0893, "mean_token_accuracy": 0.7018561966717243, "num_tokens": 112067380.0, "step": 1495 }, { "entropy": 1.0989170737564564, "epoch": 0.46183599049387586, "grad_norm": 0.71484375, "learning_rate": 1.925543910508503e-05, "loss": 1.1127, "mean_token_accuracy": 0.699932586029172, "num_tokens": 112448405.0, "step": 1500 }, { "entropy": 1.0723091229796409, "epoch": 0.4633754437955221, "grad_norm": 0.66796875, "learning_rate": 1.9249295355844286e-05, "loss": 1.058, "mean_token_accuracy": 0.7080515351146459, "num_tokens": 112821434.0, "step": 1505 }, { "entropy": 1.1173736985772849, "epoch": 0.4649148970971684, "grad_norm": 0.71484375, "learning_rate": 1.9243127351404743e-05, "loss": 1.1042, "mean_token_accuracy": 0.6990774724632501, "num_tokens": 113207766.0, "step": 1510 }, { "entropy": 1.136980064958334, "epoch": 0.4664543503988146, "grad_norm": 0.765625, "learning_rate": 1.9236935107941272e-05, "loss": 1.1307, "mean_token_accuracy": 0.6950142856687307, "num_tokens": 113564658.0, "step": 1515 }, { "entropy": 1.1760700676590203, "epoch": 0.4679938037004609, "grad_norm": 0.79296875, "learning_rate": 1.923071864169231e-05, "loss": 1.1714, "mean_token_accuracy": 0.6890874560922384, "num_tokens": 113935260.0, "step": 1520 }, { "entropy": 1.1633779585361481, "epoch": 0.46953325700210713, "grad_norm": 0.72265625, "learning_rate": 1.922447796895982e-05, "loss": 1.1552, "mean_token_accuracy": 0.6897667136043311, "num_tokens": 114300528.0, "step": 1525 }, { "entropy": 1.096606163494289, "epoch": 0.47107271030375336, "grad_norm": 0.6796875, "learning_rate": 1.9218213106109234e-05, "loss": 1.0923, "mean_token_accuracy": 0.7029213454574347, "num_tokens": 114670533.0, "step": 1530 }, { "entropy": 1.0995285920798779, "epoch": 0.47261216360539965, "grad_norm": 0.7265625, "learning_rate": 1.9211924069569422e-05, "loss": 1.1045, "mean_token_accuracy": 0.7023968610912561, "num_tokens": 115033065.0, "step": 1535 }, { "entropy": 1.1373300217092037, "epoch": 0.4741516169070459, "grad_norm": 0.734375, "learning_rate": 1.920561087583265e-05, "loss": 1.1375, "mean_token_accuracy": 0.6914490062743426, "num_tokens": 115395504.0, "step": 1540 }, { "entropy": 1.1257287595421075, "epoch": 0.4756910702086921, "grad_norm": 0.74609375, "learning_rate": 1.919927354145454e-05, "loss": 1.1123, "mean_token_accuracy": 0.6976802740246058, "num_tokens": 115768072.0, "step": 1545 }, { "entropy": 1.1214987369254232, "epoch": 0.4772305235103384, "grad_norm": 0.73046875, "learning_rate": 1.9192912083054003e-05, "loss": 1.1191, "mean_token_accuracy": 0.6951532650738954, "num_tokens": 116143853.0, "step": 1550 }, { "entropy": 1.1636530596762895, "epoch": 0.47876997681198463, "grad_norm": 0.7421875, "learning_rate": 1.9186526517313227e-05, "loss": 1.1578, "mean_token_accuracy": 0.6905960509553551, "num_tokens": 116501275.0, "step": 1555 }, { "entropy": 1.1044294204562903, "epoch": 0.4803094301136309, "grad_norm": 0.7109375, "learning_rate": 1.9180116860977613e-05, "loss": 1.0837, "mean_token_accuracy": 0.703742691129446, "num_tokens": 116885903.0, "step": 1560 }, { "entropy": 1.1139429537579417, "epoch": 0.48184888341527715, "grad_norm": 0.6953125, "learning_rate": 1.9173683130855737e-05, "loss": 1.104, "mean_token_accuracy": 0.6986370030790567, "num_tokens": 117262674.0, "step": 1565 }, { "entropy": 1.0733769409358502, "epoch": 0.4833883367169234, "grad_norm": 0.70703125, "learning_rate": 1.916722534381931e-05, "loss": 1.0699, "mean_token_accuracy": 0.7072780448943377, "num_tokens": 117633261.0, "step": 1570 }, { "entropy": 1.0940893176943063, "epoch": 0.48492779001856967, "grad_norm": 0.69921875, "learning_rate": 1.916074351680312e-05, "loss": 1.0899, "mean_token_accuracy": 0.7040331065654755, "num_tokens": 117994519.0, "step": 1575 }, { "entropy": 1.1256133463233708, "epoch": 0.4864672433202159, "grad_norm": 0.70703125, "learning_rate": 1.9154237666805005e-05, "loss": 1.1178, "mean_token_accuracy": 0.6980132691562175, "num_tokens": 118357854.0, "step": 1580 }, { "entropy": 1.1461247742176055, "epoch": 0.48800669662186213, "grad_norm": 0.7421875, "learning_rate": 1.9147707810885798e-05, "loss": 1.1273, "mean_token_accuracy": 0.6937376245856285, "num_tokens": 118727990.0, "step": 1585 }, { "entropy": 1.105697209574282, "epoch": 0.4895461499235084, "grad_norm": 0.78125, "learning_rate": 1.9141153966169287e-05, "loss": 1.0988, "mean_token_accuracy": 0.6974029045552015, "num_tokens": 119104452.0, "step": 1590 }, { "entropy": 1.0973486991599202, "epoch": 0.49108560322515465, "grad_norm": 0.72265625, "learning_rate": 1.9134576149842164e-05, "loss": 1.0897, "mean_token_accuracy": 0.7024951457977295, "num_tokens": 119492541.0, "step": 1595 }, { "entropy": 1.1395431403070688, "epoch": 0.49262505652680094, "grad_norm": 0.71484375, "learning_rate": 1.9127974379153983e-05, "loss": 1.1284, "mean_token_accuracy": 0.6936916135251522, "num_tokens": 119861950.0, "step": 1600 }, { "entropy": 1.119615512341261, "epoch": 0.4941645098284472, "grad_norm": 0.73828125, "learning_rate": 1.912134867141712e-05, "loss": 1.1297, "mean_token_accuracy": 0.6973624024540186, "num_tokens": 120235402.0, "step": 1605 }, { "entropy": 1.127389458194375, "epoch": 0.4957039631300934, "grad_norm": 0.76171875, "learning_rate": 1.9114699044006725e-05, "loss": 1.1246, "mean_token_accuracy": 0.6948788855224848, "num_tokens": 120616115.0, "step": 1610 }, { "entropy": 1.1248438712209463, "epoch": 0.4972434164317397, "grad_norm": 0.71875, "learning_rate": 1.910802551436066e-05, "loss": 1.1298, "mean_token_accuracy": 0.6980609927326441, "num_tokens": 120995993.0, "step": 1615 }, { "entropy": 1.0943362485617398, "epoch": 0.4987828697333859, "grad_norm": 0.765625, "learning_rate": 1.9101328099979496e-05, "loss": 1.0998, "mean_token_accuracy": 0.7005326244980097, "num_tokens": 121357538.0, "step": 1620 }, { "entropy": 1.158146957680583, "epoch": 0.5003223230350322, "grad_norm": 0.7421875, "learning_rate": 1.9094606818426403e-05, "loss": 1.1539, "mean_token_accuracy": 0.6923132240772247, "num_tokens": 121710013.0, "step": 1625 }, { "entropy": 1.1276648858562113, "epoch": 0.5018617763366784, "grad_norm": 0.6796875, "learning_rate": 1.908786168732717e-05, "loss": 1.1182, "mean_token_accuracy": 0.6962565090507269, "num_tokens": 122085828.0, "step": 1630 }, { "entropy": 1.0802762266248465, "epoch": 0.5034012296383247, "grad_norm": 0.69921875, "learning_rate": 1.9081092724370112e-05, "loss": 1.0793, "mean_token_accuracy": 0.7047099947929383, "num_tokens": 122464366.0, "step": 1635 }, { "entropy": 1.136762074381113, "epoch": 0.504940682939971, "grad_norm": 0.68359375, "learning_rate": 1.907429994730605e-05, "loss": 1.1273, "mean_token_accuracy": 0.6950546491891145, "num_tokens": 122835610.0, "step": 1640 }, { "entropy": 1.0965771291404962, "epoch": 0.5064801362416171, "grad_norm": 0.73828125, "learning_rate": 1.9067483373948245e-05, "loss": 1.0801, "mean_token_accuracy": 0.7031420111656189, "num_tokens": 123198090.0, "step": 1645 }, { "entropy": 1.1391410026699305, "epoch": 0.5080195895432634, "grad_norm": 0.7421875, "learning_rate": 1.9060643022172364e-05, "loss": 1.138, "mean_token_accuracy": 0.6941679731011391, "num_tokens": 123574849.0, "step": 1650 }, { "entropy": 1.1137908024713397, "epoch": 0.5095590428449097, "grad_norm": 0.77734375, "learning_rate": 1.905377890991644e-05, "loss": 1.1011, "mean_token_accuracy": 0.7002455405890942, "num_tokens": 123958243.0, "step": 1655 }, { "entropy": 1.0767975924536586, "epoch": 0.511098496146556, "grad_norm": 0.65625, "learning_rate": 1.90468910551808e-05, "loss": 1.0628, "mean_token_accuracy": 0.7064414627850055, "num_tokens": 124354285.0, "step": 1660 }, { "entropy": 1.1056279137730598, "epoch": 0.5126379494482022, "grad_norm": 0.76953125, "learning_rate": 1.9039979476028044e-05, "loss": 1.1108, "mean_token_accuracy": 0.7005944430828095, "num_tokens": 124716477.0, "step": 1665 }, { "entropy": 1.121751406788826, "epoch": 0.5141774027498485, "grad_norm": 0.7734375, "learning_rate": 1.903304419058298e-05, "loss": 1.1054, "mean_token_accuracy": 0.6988046038895845, "num_tokens": 125084153.0, "step": 1670 }, { "entropy": 1.1113942619413137, "epoch": 0.5157168560514948, "grad_norm": 0.73828125, "learning_rate": 1.9026085217032592e-05, "loss": 1.1038, "mean_token_accuracy": 0.6969317603856325, "num_tokens": 125454921.0, "step": 1675 }, { "entropy": 1.1110334230586887, "epoch": 0.5172563093531409, "grad_norm": 0.78125, "learning_rate": 1.9019102573625966e-05, "loss": 1.112, "mean_token_accuracy": 0.6979748774319887, "num_tokens": 125814552.0, "step": 1680 }, { "entropy": 1.115121967718005, "epoch": 0.5187957626547872, "grad_norm": 0.74609375, "learning_rate": 1.9012096278674283e-05, "loss": 1.1022, "mean_token_accuracy": 0.6978176638484002, "num_tokens": 126180100.0, "step": 1685 }, { "entropy": 1.1214980090036988, "epoch": 0.5203352159564335, "grad_norm": 0.75, "learning_rate": 1.9005066350550724e-05, "loss": 1.1107, "mean_token_accuracy": 0.6994861856102943, "num_tokens": 126544212.0, "step": 1690 }, { "entropy": 1.1030220981687306, "epoch": 0.5218746692580797, "grad_norm": 0.7109375, "learning_rate": 1.899801280769046e-05, "loss": 1.1027, "mean_token_accuracy": 0.7016896925866604, "num_tokens": 126936632.0, "step": 1695 }, { "entropy": 1.0752276331186295, "epoch": 0.523414122559726, "grad_norm": 0.73828125, "learning_rate": 1.8990935668590583e-05, "loss": 1.0732, "mean_token_accuracy": 0.706041594222188, "num_tokens": 127334816.0, "step": 1700 }, { "entropy": 1.137972903251648, "epoch": 0.5249535758613723, "grad_norm": 0.7421875, "learning_rate": 1.8983834951810068e-05, "loss": 1.1276, "mean_token_accuracy": 0.6936356756836176, "num_tokens": 127710399.0, "step": 1705 }, { "entropy": 1.1167596075683832, "epoch": 0.5264930291630184, "grad_norm": 0.67578125, "learning_rate": 1.8976710675969715e-05, "loss": 1.1118, "mean_token_accuracy": 0.6976578302681447, "num_tokens": 128099437.0, "step": 1710 }, { "entropy": 1.0992528446018697, "epoch": 0.5280324824646647, "grad_norm": 0.765625, "learning_rate": 1.896956285975211e-05, "loss": 1.0875, "mean_token_accuracy": 0.7028979767113924, "num_tokens": 128467478.0, "step": 1715 }, { "entropy": 1.0609646894037723, "epoch": 0.529571935766311, "grad_norm": 0.71875, "learning_rate": 1.8962391521901565e-05, "loss": 1.0554, "mean_token_accuracy": 0.7095225866883993, "num_tokens": 128838188.0, "step": 1720 }, { "entropy": 1.1092106204479932, "epoch": 0.5311113890679573, "grad_norm": 0.7109375, "learning_rate": 1.895519668122408e-05, "loss": 1.0967, "mean_token_accuracy": 0.6991548746824264, "num_tokens": 129214099.0, "step": 1725 }, { "entropy": 1.0980365563184022, "epoch": 0.5326508423696035, "grad_norm": 0.6796875, "learning_rate": 1.8947978356587283e-05, "loss": 1.0886, "mean_token_accuracy": 0.702478701993823, "num_tokens": 129593189.0, "step": 1730 }, { "entropy": 1.1081396404653787, "epoch": 0.5341902956712498, "grad_norm": 0.703125, "learning_rate": 1.8940736566920386e-05, "loss": 1.0974, "mean_token_accuracy": 0.7000274512916803, "num_tokens": 129972696.0, "step": 1735 }, { "entropy": 1.0982466185465456, "epoch": 0.535729748972896, "grad_norm": 0.69921875, "learning_rate": 1.893347133121415e-05, "loss": 1.0822, "mean_token_accuracy": 0.7039383064955473, "num_tokens": 130350766.0, "step": 1740 }, { "entropy": 1.1378747086971999, "epoch": 0.5372692022745422, "grad_norm": 0.71484375, "learning_rate": 1.8926182668520794e-05, "loss": 1.1298, "mean_token_accuracy": 0.6929653998464346, "num_tokens": 130712736.0, "step": 1745 }, { "entropy": 1.1180994376540183, "epoch": 0.5388086555761885, "grad_norm": 0.6640625, "learning_rate": 1.8918870597953996e-05, "loss": 1.1166, "mean_token_accuracy": 0.697513160482049, "num_tokens": 131108827.0, "step": 1750 }, { "entropy": 1.1118130307644605, "epoch": 0.5403481088778348, "grad_norm": 0.7578125, "learning_rate": 1.89115351386888e-05, "loss": 1.1135, "mean_token_accuracy": 0.7016211155802011, "num_tokens": 131484362.0, "step": 1755 }, { "entropy": 1.154317499510944, "epoch": 0.541887562179481, "grad_norm": 0.74609375, "learning_rate": 1.8904176309961606e-05, "loss": 1.1623, "mean_token_accuracy": 0.6900074496865273, "num_tokens": 131854979.0, "step": 1760 }, { "entropy": 1.1418317448347808, "epoch": 0.5434270154811273, "grad_norm": 0.7578125, "learning_rate": 1.8896794131070073e-05, "loss": 1.1409, "mean_token_accuracy": 0.6961004845798016, "num_tokens": 132231075.0, "step": 1765 }, { "entropy": 1.1063750840723514, "epoch": 0.5449664687827735, "grad_norm": 0.72265625, "learning_rate": 1.8889388621373107e-05, "loss": 1.094, "mean_token_accuracy": 0.6988186117261648, "num_tokens": 132614827.0, "step": 1770 }, { "entropy": 1.0908017337322236, "epoch": 0.5465059220844197, "grad_norm": 0.6796875, "learning_rate": 1.88819598002908e-05, "loss": 1.0762, "mean_token_accuracy": 0.7036438055336476, "num_tokens": 133006606.0, "step": 1775 }, { "entropy": 1.1063918098807335, "epoch": 0.548045375386066, "grad_norm": 0.7109375, "learning_rate": 1.887450768730436e-05, "loss": 1.0865, "mean_token_accuracy": 0.7016949482262135, "num_tokens": 133391329.0, "step": 1780 }, { "entropy": 1.111767608858645, "epoch": 0.5495848286877123, "grad_norm": 0.70703125, "learning_rate": 1.886703230195609e-05, "loss": 1.1104, "mean_token_accuracy": 0.7000030245631933, "num_tokens": 133783664.0, "step": 1785 }, { "entropy": 1.1513528198003768, "epoch": 0.5511242819893585, "grad_norm": 0.7265625, "learning_rate": 1.8859533663849318e-05, "loss": 1.1441, "mean_token_accuracy": 0.6949969541281462, "num_tokens": 134154971.0, "step": 1790 }, { "entropy": 1.109261892735958, "epoch": 0.5526637352910048, "grad_norm": 0.6875, "learning_rate": 1.885201179264834e-05, "loss": 1.1072, "mean_token_accuracy": 0.7005063198506832, "num_tokens": 134541521.0, "step": 1795 }, { "entropy": 1.1210583060979844, "epoch": 0.554203188592651, "grad_norm": 0.73828125, "learning_rate": 1.8844466708078398e-05, "loss": 1.1179, "mean_token_accuracy": 0.6973602317273617, "num_tokens": 134909569.0, "step": 1800 }, { "entropy": 1.1100708212703467, "epoch": 0.5557426418942973, "grad_norm": 0.71875, "learning_rate": 1.8836898429925586e-05, "loss": 1.09, "mean_token_accuracy": 0.7016674302518368, "num_tokens": 135278194.0, "step": 1805 }, { "entropy": 1.133229278959334, "epoch": 0.5572820951959435, "grad_norm": 0.75390625, "learning_rate": 1.8829306978036837e-05, "loss": 1.1279, "mean_token_accuracy": 0.6966449148952961, "num_tokens": 135644126.0, "step": 1810 }, { "entropy": 1.094052490964532, "epoch": 0.5588215484975898, "grad_norm": 0.68359375, "learning_rate": 1.8821692372319852e-05, "loss": 1.0881, "mean_token_accuracy": 0.7018960192799568, "num_tokens": 136040093.0, "step": 1815 }, { "entropy": 1.102319024130702, "epoch": 0.5603610017992361, "grad_norm": 0.69140625, "learning_rate": 1.8814054632743038e-05, "loss": 1.1009, "mean_token_accuracy": 0.7015113096684218, "num_tokens": 136421328.0, "step": 1820 }, { "entropy": 1.1264159340411424, "epoch": 0.5619004551008823, "grad_norm": 0.68359375, "learning_rate": 1.8806393779335483e-05, "loss": 1.1106, "mean_token_accuracy": 0.6967556666582823, "num_tokens": 136796837.0, "step": 1825 }, { "entropy": 1.1152265276759863, "epoch": 0.5634399084025286, "grad_norm": 0.6796875, "learning_rate": 1.879870983218688e-05, "loss": 1.0994, "mean_token_accuracy": 0.6976462483406067, "num_tokens": 137174396.0, "step": 1830 }, { "entropy": 1.116674688272178, "epoch": 0.5649793617041748, "grad_norm": 0.71484375, "learning_rate": 1.8791002811447483e-05, "loss": 1.1104, "mean_token_accuracy": 0.7000731214880943, "num_tokens": 137556532.0, "step": 1835 }, { "entropy": 1.1110275972634553, "epoch": 0.566518815005821, "grad_norm": 0.70703125, "learning_rate": 1.878327273732806e-05, "loss": 1.1098, "mean_token_accuracy": 0.698979677259922, "num_tokens": 137949242.0, "step": 1840 }, { "entropy": 1.0584419948980213, "epoch": 0.5680582683074673, "grad_norm": 0.703125, "learning_rate": 1.8775519630099822e-05, "loss": 1.0544, "mean_token_accuracy": 0.7107167650014162, "num_tokens": 138325463.0, "step": 1845 }, { "entropy": 1.120271611586213, "epoch": 0.5695977216091136, "grad_norm": 0.76171875, "learning_rate": 1.8767743510094395e-05, "loss": 1.1202, "mean_token_accuracy": 0.6949244394898415, "num_tokens": 138692189.0, "step": 1850 }, { "entropy": 1.1016495576128364, "epoch": 0.5711371749107598, "grad_norm": 0.7578125, "learning_rate": 1.8759944397703748e-05, "loss": 1.1078, "mean_token_accuracy": 0.7005269210785627, "num_tokens": 139066457.0, "step": 1855 }, { "entropy": 1.1251827346161007, "epoch": 0.5726766282124061, "grad_norm": 0.71484375, "learning_rate": 1.8752122313380137e-05, "loss": 1.1007, "mean_token_accuracy": 0.6988253463059664, "num_tokens": 139426172.0, "step": 1860 }, { "entropy": 1.1180114712566138, "epoch": 0.5742160815140523, "grad_norm": 0.68359375, "learning_rate": 1.874427727763607e-05, "loss": 1.1112, "mean_token_accuracy": 0.69961117208004, "num_tokens": 139801332.0, "step": 1865 }, { "entropy": 1.129542938247323, "epoch": 0.5757555348156985, "grad_norm": 0.734375, "learning_rate": 1.8736409311044244e-05, "loss": 1.1289, "mean_token_accuracy": 0.695055254548788, "num_tokens": 140171056.0, "step": 1870 }, { "entropy": 1.0734907962381839, "epoch": 0.5772949881173448, "grad_norm": 0.6796875, "learning_rate": 1.8728518434237476e-05, "loss": 1.0626, "mean_token_accuracy": 0.7072399683296681, "num_tokens": 140566923.0, "step": 1875 }, { "entropy": 1.1328235883265734, "epoch": 0.5788344414189911, "grad_norm": 0.74609375, "learning_rate": 1.8720604667908673e-05, "loss": 1.1338, "mean_token_accuracy": 0.6954614106565714, "num_tokens": 140929032.0, "step": 1880 }, { "entropy": 1.1626869395375252, "epoch": 0.5803738947206374, "grad_norm": 0.6875, "learning_rate": 1.8712668032810767e-05, "loss": 1.153, "mean_token_accuracy": 0.6904126744717359, "num_tokens": 141306794.0, "step": 1885 }, { "entropy": 1.0925796177238225, "epoch": 0.5819133480222836, "grad_norm": 0.703125, "learning_rate": 1.8704708549756657e-05, "loss": 1.0896, "mean_token_accuracy": 0.7039735574275255, "num_tokens": 141679922.0, "step": 1890 }, { "entropy": 1.1325601134449244, "epoch": 0.5834528013239298, "grad_norm": 0.73828125, "learning_rate": 1.869672623961916e-05, "loss": 1.1236, "mean_token_accuracy": 0.695359307155013, "num_tokens": 142064042.0, "step": 1895 }, { "entropy": 1.1089297072961926, "epoch": 0.5849922546255761, "grad_norm": 0.73828125, "learning_rate": 1.8688721123330952e-05, "loss": 1.0961, "mean_token_accuracy": 0.7020201427862048, "num_tokens": 142450974.0, "step": 1900 }, { "entropy": 1.0782432477921247, "epoch": 0.5865317079272223, "grad_norm": 0.73828125, "learning_rate": 1.868069322188452e-05, "loss": 1.077, "mean_token_accuracy": 0.7056647684425116, "num_tokens": 142833583.0, "step": 1905 }, { "entropy": 1.090103941783309, "epoch": 0.5880711612288686, "grad_norm": 0.67578125, "learning_rate": 1.8672642556332093e-05, "loss": 1.0815, "mean_token_accuracy": 0.7041718065738678, "num_tokens": 143202881.0, "step": 1910 }, { "entropy": 1.1132526526227593, "epoch": 0.5896106145305149, "grad_norm": 0.7578125, "learning_rate": 1.8664569147785615e-05, "loss": 1.1143, "mean_token_accuracy": 0.7002504725009203, "num_tokens": 143575381.0, "step": 1915 }, { "entropy": 1.0923281263560056, "epoch": 0.5911500678321611, "grad_norm": 0.6953125, "learning_rate": 1.8656473017416644e-05, "loss": 1.0894, "mean_token_accuracy": 0.7025896862149239, "num_tokens": 143945584.0, "step": 1920 }, { "entropy": 1.1606475939974188, "epoch": 0.5926895211338074, "grad_norm": 0.6875, "learning_rate": 1.864835418645635e-05, "loss": 1.1518, "mean_token_accuracy": 0.69000857565552, "num_tokens": 144327615.0, "step": 1925 }, { "entropy": 1.076964562945068, "epoch": 0.5942289744354536, "grad_norm": 0.72265625, "learning_rate": 1.8640212676195415e-05, "loss": 1.0674, "mean_token_accuracy": 0.705032504722476, "num_tokens": 144702165.0, "step": 1930 }, { "entropy": 1.1039565896615386, "epoch": 0.5957684277370998, "grad_norm": 0.703125, "learning_rate": 1.8632048507984e-05, "loss": 1.0888, "mean_token_accuracy": 0.7024720892310142, "num_tokens": 145076417.0, "step": 1935 }, { "entropy": 1.093964084982872, "epoch": 0.5973078810387461, "grad_norm": 0.75, "learning_rate": 1.862386170323169e-05, "loss": 1.081, "mean_token_accuracy": 0.7047437366098166, "num_tokens": 145455366.0, "step": 1940 }, { "entropy": 1.1448205880820752, "epoch": 0.5988473343403924, "grad_norm": 0.6953125, "learning_rate": 1.861565228340742e-05, "loss": 1.1458, "mean_token_accuracy": 0.6915356520563364, "num_tokens": 145838812.0, "step": 1945 }, { "entropy": 1.1012870259582996, "epoch": 0.6003867876420386, "grad_norm": 0.71484375, "learning_rate": 1.860742027003944e-05, "loss": 1.0907, "mean_token_accuracy": 0.7037778791040182, "num_tokens": 146208431.0, "step": 1950 }, { "entropy": 1.1052306432276964, "epoch": 0.6019262409436849, "grad_norm": 0.7421875, "learning_rate": 1.8599165684715238e-05, "loss": 1.0995, "mean_token_accuracy": 0.7021346285939216, "num_tokens": 146587958.0, "step": 1955 }, { "entropy": 1.0908923922106624, "epoch": 0.6034656942453311, "grad_norm": 0.74609375, "learning_rate": 1.8590888549081514e-05, "loss": 1.0687, "mean_token_accuracy": 0.7040816470980644, "num_tokens": 146956196.0, "step": 1960 }, { "entropy": 1.1141000390052795, "epoch": 0.6050051475469774, "grad_norm": 0.74609375, "learning_rate": 1.8582588884844086e-05, "loss": 1.1103, "mean_token_accuracy": 0.6970112754032016, "num_tokens": 147320054.0, "step": 1965 }, { "entropy": 1.0900843566283585, "epoch": 0.6065446008486236, "grad_norm": 0.7265625, "learning_rate": 1.857426671376785e-05, "loss": 1.0764, "mean_token_accuracy": 0.7049407433718443, "num_tokens": 147703735.0, "step": 1970 }, { "entropy": 1.1240591725334526, "epoch": 0.6080840541502699, "grad_norm": 0.734375, "learning_rate": 1.8565922057676738e-05, "loss": 1.1196, "mean_token_accuracy": 0.6968345880508423, "num_tokens": 148073305.0, "step": 1975 }, { "entropy": 1.1471635062247514, "epoch": 0.6096235074519162, "grad_norm": 0.74609375, "learning_rate": 1.855755493845363e-05, "loss": 1.1427, "mean_token_accuracy": 0.6943592650815844, "num_tokens": 148444038.0, "step": 1980 }, { "entropy": 1.132018794864416, "epoch": 0.6111629607535624, "grad_norm": 0.74609375, "learning_rate": 1.8549165378040328e-05, "loss": 1.1394, "mean_token_accuracy": 0.6943659249693155, "num_tokens": 148822233.0, "step": 1985 }, { "entropy": 1.0830021239817142, "epoch": 0.6127024140552086, "grad_norm": 0.69140625, "learning_rate": 1.8540753398437473e-05, "loss": 1.0754, "mean_token_accuracy": 0.7037800218909979, "num_tokens": 149211582.0, "step": 1990 }, { "entropy": 1.1431629927828908, "epoch": 0.6142418673568549, "grad_norm": 0.73046875, "learning_rate": 1.8532319021704502e-05, "loss": 1.1372, "mean_token_accuracy": 0.6933602422475815, "num_tokens": 149586556.0, "step": 1995 }, { "entropy": 1.1282612700015306, "epoch": 0.6157813206585011, "grad_norm": 0.7734375, "learning_rate": 1.852386226995958e-05, "loss": 1.1324, "mean_token_accuracy": 0.6929793257266283, "num_tokens": 149951555.0, "step": 2000 }, { "entropy": 1.133526834100485, "epoch": 0.6173207739601474, "grad_norm": 0.75390625, "learning_rate": 1.851538316537956e-05, "loss": 1.1148, "mean_token_accuracy": 0.6985038254410029, "num_tokens": 150316391.0, "step": 2005 }, { "entropy": 1.0895660797134041, "epoch": 0.6188602272617937, "grad_norm": 0.7109375, "learning_rate": 1.85068817301999e-05, "loss": 1.0834, "mean_token_accuracy": 0.7006191689521074, "num_tokens": 150688099.0, "step": 2010 }, { "entropy": 1.1398447638377547, "epoch": 0.6203996805634399, "grad_norm": 0.80859375, "learning_rate": 1.8498357986714624e-05, "loss": 1.1352, "mean_token_accuracy": 0.6944937206804752, "num_tokens": 151052692.0, "step": 2015 }, { "entropy": 1.15070056989789, "epoch": 0.6219391338650861, "grad_norm": 0.69921875, "learning_rate": 1.8489811957276254e-05, "loss": 1.1302, "mean_token_accuracy": 0.6918449435383082, "num_tokens": 151430576.0, "step": 2020 }, { "entropy": 1.1349072763696313, "epoch": 0.6234785871667324, "grad_norm": 0.765625, "learning_rate": 1.848124366429576e-05, "loss": 1.124, "mean_token_accuracy": 0.6965412970632314, "num_tokens": 151792787.0, "step": 2025 }, { "entropy": 1.1112722108140587, "epoch": 0.6250180404683787, "grad_norm": 0.70703125, "learning_rate": 1.8472653130242485e-05, "loss": 1.112, "mean_token_accuracy": 0.7012020844966174, "num_tokens": 152168683.0, "step": 2030 }, { "entropy": 1.1380321444943546, "epoch": 0.6265574937700249, "grad_norm": 0.7421875, "learning_rate": 1.846404037764411e-05, "loss": 1.1238, "mean_token_accuracy": 0.6950769029557705, "num_tokens": 152545104.0, "step": 2035 }, { "entropy": 1.1669288910925388, "epoch": 0.6280969470716712, "grad_norm": 0.71875, "learning_rate": 1.8455405429086576e-05, "loss": 1.1662, "mean_token_accuracy": 0.6907285895198584, "num_tokens": 152918857.0, "step": 2040 }, { "entropy": 1.144454488158226, "epoch": 0.6296364003733175, "grad_norm": 0.6796875, "learning_rate": 1.844674830721402e-05, "loss": 1.1435, "mean_token_accuracy": 0.6939992997795343, "num_tokens": 153304877.0, "step": 2045 }, { "entropy": 1.1009058840572834, "epoch": 0.6311758536749636, "grad_norm": 0.671875, "learning_rate": 1.8438069034728738e-05, "loss": 1.0929, "mean_token_accuracy": 0.7022685822099447, "num_tokens": 153689362.0, "step": 2050 }, { "entropy": 1.1297755874693394, "epoch": 0.6327153069766099, "grad_norm": 0.7578125, "learning_rate": 1.8429367634391116e-05, "loss": 1.1184, "mean_token_accuracy": 0.6954657424241304, "num_tokens": 154059184.0, "step": 2055 }, { "entropy": 1.1133303932845593, "epoch": 0.6342547602782562, "grad_norm": 0.734375, "learning_rate": 1.8420644129019555e-05, "loss": 1.0993, "mean_token_accuracy": 0.7026321858167648, "num_tokens": 154435058.0, "step": 2060 }, { "entropy": 1.1748030522838235, "epoch": 0.6357942135799024, "grad_norm": 0.7734375, "learning_rate": 1.8411898541490433e-05, "loss": 1.1758, "mean_token_accuracy": 0.6871446866542101, "num_tokens": 154795848.0, "step": 2065 }, { "entropy": 1.1518771335482598, "epoch": 0.6373336668815487, "grad_norm": 0.78125, "learning_rate": 1.8403130894738038e-05, "loss": 1.1465, "mean_token_accuracy": 0.6935045797377825, "num_tokens": 155153389.0, "step": 2070 }, { "entropy": 1.1386884730309248, "epoch": 0.638873120183195, "grad_norm": 0.75, "learning_rate": 1.8394341211754496e-05, "loss": 1.1447, "mean_token_accuracy": 0.6941363386809826, "num_tokens": 155515587.0, "step": 2075 }, { "entropy": 1.1431025385856628, "epoch": 0.6404125734848412, "grad_norm": 0.75390625, "learning_rate": 1.8385529515589726e-05, "loss": 1.1386, "mean_token_accuracy": 0.6931343143805861, "num_tokens": 155891606.0, "step": 2080 }, { "entropy": 1.1411488141864539, "epoch": 0.6419520267864874, "grad_norm": 0.734375, "learning_rate": 1.8376695829351378e-05, "loss": 1.1272, "mean_token_accuracy": 0.6926099382340908, "num_tokens": 156273092.0, "step": 2085 }, { "entropy": 1.1294952983036637, "epoch": 0.6434914800881337, "grad_norm": 0.69140625, "learning_rate": 1.836784017620476e-05, "loss": 1.1181, "mean_token_accuracy": 0.6974793665111065, "num_tokens": 156641690.0, "step": 2090 }, { "entropy": 1.142337768152356, "epoch": 0.6450309333897799, "grad_norm": 0.73828125, "learning_rate": 1.8358962579372797e-05, "loss": 1.1507, "mean_token_accuracy": 0.6917462650686502, "num_tokens": 157011422.0, "step": 2095 }, { "entropy": 1.0961598601192235, "epoch": 0.6465703866914262, "grad_norm": 0.71875, "learning_rate": 1.835006306213594e-05, "loss": 1.1, "mean_token_accuracy": 0.703354274854064, "num_tokens": 157388966.0, "step": 2100 }, { "entropy": 1.118635695055127, "epoch": 0.6481098399930725, "grad_norm": 0.7265625, "learning_rate": 1.834114164783215e-05, "loss": 1.1093, "mean_token_accuracy": 0.6975133273750543, "num_tokens": 157781000.0, "step": 2105 }, { "entropy": 1.1703529071062804, "epoch": 0.6496492932947188, "grad_norm": 0.75390625, "learning_rate": 1.8332198359856782e-05, "loss": 1.1621, "mean_token_accuracy": 0.6912976618856191, "num_tokens": 158148821.0, "step": 2110 }, { "entropy": 1.139431282877922, "epoch": 0.6511887465963649, "grad_norm": 0.71875, "learning_rate": 1.8323233221662574e-05, "loss": 1.1272, "mean_token_accuracy": 0.6936106860637665, "num_tokens": 158519240.0, "step": 2115 }, { "entropy": 1.137386091426015, "epoch": 0.6527281998980112, "grad_norm": 0.69140625, "learning_rate": 1.8314246256759556e-05, "loss": 1.1254, "mean_token_accuracy": 0.6957115132361651, "num_tokens": 158896885.0, "step": 2120 }, { "entropy": 1.132150064781308, "epoch": 0.6542676531996575, "grad_norm": 0.796875, "learning_rate": 1.8305237488714995e-05, "loss": 1.1325, "mean_token_accuracy": 0.6934053935110569, "num_tokens": 159265519.0, "step": 2125 }, { "entropy": 1.1579696323722601, "epoch": 0.6558071065013037, "grad_norm": 0.765625, "learning_rate": 1.8296206941153333e-05, "loss": 1.1517, "mean_token_accuracy": 0.689340352639556, "num_tokens": 159634386.0, "step": 2130 }, { "entropy": 1.142648032307625, "epoch": 0.65734655980295, "grad_norm": 0.76953125, "learning_rate": 1.8287154637756125e-05, "loss": 1.1318, "mean_token_accuracy": 0.6927073132246733, "num_tokens": 160008254.0, "step": 2135 }, { "entropy": 1.1443445168435573, "epoch": 0.6588860131045963, "grad_norm": 0.73046875, "learning_rate": 1.827808060226199e-05, "loss": 1.1434, "mean_token_accuracy": 0.6936221666634083, "num_tokens": 160367712.0, "step": 2140 }, { "entropy": 1.0978737404569983, "epoch": 0.6604254664062424, "grad_norm": 0.703125, "learning_rate": 1.8268984858466524e-05, "loss": 1.0886, "mean_token_accuracy": 0.7030142482370139, "num_tokens": 160733299.0, "step": 2145 }, { "entropy": 1.1296749690547585, "epoch": 0.6619649197078887, "grad_norm": 0.72265625, "learning_rate": 1.825986743022225e-05, "loss": 1.1273, "mean_token_accuracy": 0.6956211663782597, "num_tokens": 161103268.0, "step": 2150 }, { "entropy": 1.1379246138036252, "epoch": 0.663504373009535, "grad_norm": 0.73046875, "learning_rate": 1.825072834143857e-05, "loss": 1.1355, "mean_token_accuracy": 0.6943081360310316, "num_tokens": 161476085.0, "step": 2155 }, { "entropy": 1.0913480401039124, "epoch": 0.6650438263111812, "grad_norm": 0.76171875, "learning_rate": 1.8241567616081674e-05, "loss": 1.0802, "mean_token_accuracy": 0.7027659468352795, "num_tokens": 161846954.0, "step": 2160 }, { "entropy": 1.1175310904160143, "epoch": 0.6665832796128275, "grad_norm": 0.73046875, "learning_rate": 1.823238527817449e-05, "loss": 1.1097, "mean_token_accuracy": 0.6994062628597021, "num_tokens": 162214500.0, "step": 2165 }, { "entropy": 1.0967560213059186, "epoch": 0.6681227329144738, "grad_norm": 0.734375, "learning_rate": 1.8223181351796642e-05, "loss": 1.1022, "mean_token_accuracy": 0.7011716574430465, "num_tokens": 162600939.0, "step": 2170 }, { "entropy": 1.1191772257909178, "epoch": 0.66966218621612, "grad_norm": 0.7109375, "learning_rate": 1.8213955861084342e-05, "loss": 1.1047, "mean_token_accuracy": 0.698114974796772, "num_tokens": 162989103.0, "step": 2175 }, { "entropy": 1.078780804388225, "epoch": 0.6712016395177662, "grad_norm": 0.7421875, "learning_rate": 1.8204708830230372e-05, "loss": 1.0769, "mean_token_accuracy": 0.7026279237121343, "num_tokens": 163365199.0, "step": 2180 }, { "entropy": 1.102193933725357, "epoch": 0.6727410928194125, "grad_norm": 0.81640625, "learning_rate": 1.819544028348399e-05, "loss": 1.1007, "mean_token_accuracy": 0.7027922391891479, "num_tokens": 163737628.0, "step": 2185 }, { "entropy": 1.1276447394862772, "epoch": 0.6742805461210588, "grad_norm": 0.7109375, "learning_rate": 1.8186150245150876e-05, "loss": 1.1184, "mean_token_accuracy": 0.6979492522776127, "num_tokens": 164121012.0, "step": 2190 }, { "entropy": 1.1386257752776145, "epoch": 0.675819999422705, "grad_norm": 0.73046875, "learning_rate": 1.8176838739593078e-05, "loss": 1.1337, "mean_token_accuracy": 0.6927195183932782, "num_tokens": 164482798.0, "step": 2195 }, { "entropy": 1.127764510177076, "epoch": 0.6773594527243513, "grad_norm": 0.71484375, "learning_rate": 1.816750579122893e-05, "loss": 1.1284, "mean_token_accuracy": 0.6954803835600615, "num_tokens": 164859917.0, "step": 2200 }, { "entropy": 1.0942645370960236, "epoch": 0.6788989060259976, "grad_norm": 0.73828125, "learning_rate": 1.8158151424533002e-05, "loss": 1.0873, "mean_token_accuracy": 0.7031883802264929, "num_tokens": 165247314.0, "step": 2205 }, { "entropy": 1.1059243634343148, "epoch": 0.6804383593276437, "grad_norm": 0.68359375, "learning_rate": 1.814877566403603e-05, "loss": 1.1071, "mean_token_accuracy": 0.6975095085799694, "num_tokens": 165636534.0, "step": 2210 }, { "entropy": 1.1076618060469627, "epoch": 0.68197781262929, "grad_norm": 0.75, "learning_rate": 1.813937853432485e-05, "loss": 1.0991, "mean_token_accuracy": 0.7021389830857515, "num_tokens": 166000924.0, "step": 2215 }, { "entropy": 1.1220650862902404, "epoch": 0.6835172659309363, "grad_norm": 0.703125, "learning_rate": 1.8129960060042345e-05, "loss": 1.1088, "mean_token_accuracy": 0.6972477741539478, "num_tokens": 166359772.0, "step": 2220 }, { "entropy": 1.068718210607767, "epoch": 0.6850567192325825, "grad_norm": 0.6953125, "learning_rate": 1.8120520265887364e-05, "loss": 1.0561, "mean_token_accuracy": 0.7072693090885878, "num_tokens": 166735638.0, "step": 2225 }, { "entropy": 1.1178116356953978, "epoch": 0.6865961725342288, "grad_norm": 0.69921875, "learning_rate": 1.8111059176614665e-05, "loss": 1.1218, "mean_token_accuracy": 0.6972925592213869, "num_tokens": 167111121.0, "step": 2230 }, { "entropy": 1.130570314452052, "epoch": 0.6881356258358751, "grad_norm": 0.6953125, "learning_rate": 1.8101576817034853e-05, "loss": 1.126, "mean_token_accuracy": 0.6954567573964596, "num_tokens": 167477412.0, "step": 2235 }, { "entropy": 1.1099465020000934, "epoch": 0.6896750791375212, "grad_norm": 0.6875, "learning_rate": 1.8092073212014307e-05, "loss": 1.1033, "mean_token_accuracy": 0.7016259111464024, "num_tokens": 167840862.0, "step": 2240 }, { "entropy": 1.0539396397769452, "epoch": 0.6912145324391675, "grad_norm": 0.71484375, "learning_rate": 1.808254838647513e-05, "loss": 1.056, "mean_token_accuracy": 0.7084746707230807, "num_tokens": 168239811.0, "step": 2245 }, { "entropy": 1.0955925872549415, "epoch": 0.6927539857408138, "grad_norm": 0.734375, "learning_rate": 1.807300236539506e-05, "loss": 1.0801, "mean_token_accuracy": 0.7024415228515863, "num_tokens": 168629807.0, "step": 2250 }, { "entropy": 1.1386502474546432, "epoch": 0.69429343904246, "grad_norm": 0.74609375, "learning_rate": 1.806343517380743e-05, "loss": 1.1515, "mean_token_accuracy": 0.6970106501132249, "num_tokens": 168997119.0, "step": 2255 }, { "entropy": 1.1127931490540504, "epoch": 0.6958328923441063, "grad_norm": 0.73828125, "learning_rate": 1.8053846836801076e-05, "loss": 1.1158, "mean_token_accuracy": 0.6967024650424719, "num_tokens": 169368874.0, "step": 2260 }, { "entropy": 1.1397660907357932, "epoch": 0.6973723456457526, "grad_norm": 0.68359375, "learning_rate": 1.8044237379520305e-05, "loss": 1.1374, "mean_token_accuracy": 0.6930058509111404, "num_tokens": 169744480.0, "step": 2265 }, { "entropy": 1.1199751045554875, "epoch": 0.6989117989473989, "grad_norm": 0.7109375, "learning_rate": 1.8034606827164795e-05, "loss": 1.1056, "mean_token_accuracy": 0.6997339356690645, "num_tokens": 170127695.0, "step": 2270 }, { "entropy": 1.119225537776947, "epoch": 0.700451252249045, "grad_norm": 0.71484375, "learning_rate": 1.8024955204989537e-05, "loss": 1.1199, "mean_token_accuracy": 0.6996861334890128, "num_tokens": 170508510.0, "step": 2275 }, { "entropy": 1.1192351464182138, "epoch": 0.7019907055506913, "grad_norm": 0.73046875, "learning_rate": 1.80152825383048e-05, "loss": 1.1094, "mean_token_accuracy": 0.693935377895832, "num_tokens": 170873383.0, "step": 2280 }, { "entropy": 1.115487469546497, "epoch": 0.7035301588523376, "grad_norm": 0.72265625, "learning_rate": 1.8005588852476018e-05, "loss": 1.1068, "mean_token_accuracy": 0.6981241587549448, "num_tokens": 171261938.0, "step": 2285 }, { "entropy": 1.1232613749802112, "epoch": 0.7050696121539838, "grad_norm": 0.74609375, "learning_rate": 1.799587417292375e-05, "loss": 1.1239, "mean_token_accuracy": 0.6959119252860546, "num_tokens": 171645402.0, "step": 2290 }, { "entropy": 1.1076678885146976, "epoch": 0.7066090654556301, "grad_norm": 0.6953125, "learning_rate": 1.798613852512361e-05, "loss": 1.0969, "mean_token_accuracy": 0.7003442455083132, "num_tokens": 172025713.0, "step": 2295 }, { "entropy": 1.1507720805704593, "epoch": 0.7081485187572764, "grad_norm": 0.75, "learning_rate": 1.79763819346062e-05, "loss": 1.1442, "mean_token_accuracy": 0.6917078942060471, "num_tokens": 172386627.0, "step": 2300 }, { "entropy": 1.1178302532061934, "epoch": 0.7096879720589225, "grad_norm": 0.7421875, "learning_rate": 1.796660442695705e-05, "loss": 1.099, "mean_token_accuracy": 0.6997009709477424, "num_tokens": 172762148.0, "step": 2305 }, { "entropy": 1.110177224688232, "epoch": 0.7112274253605688, "grad_norm": 0.79296875, "learning_rate": 1.795680602781652e-05, "loss": 1.1017, "mean_token_accuracy": 0.6984499383717775, "num_tokens": 173139010.0, "step": 2310 }, { "entropy": 1.1373082049191, "epoch": 0.7127668786622151, "grad_norm": 0.6796875, "learning_rate": 1.7946986762879785e-05, "loss": 1.1251, "mean_token_accuracy": 0.6973337743431329, "num_tokens": 173521573.0, "step": 2315 }, { "entropy": 1.0916681990027428, "epoch": 0.7143063319638613, "grad_norm": 0.73828125, "learning_rate": 1.7937146657896708e-05, "loss": 1.0895, "mean_token_accuracy": 0.7012616876512766, "num_tokens": 173914670.0, "step": 2320 }, { "entropy": 1.188042016327381, "epoch": 0.7158457852655076, "grad_norm": 0.7421875, "learning_rate": 1.7927285738671825e-05, "loss": 1.1786, "mean_token_accuracy": 0.6875874120742083, "num_tokens": 174291376.0, "step": 2325 }, { "entropy": 1.0931476794183255, "epoch": 0.7173852385671539, "grad_norm": 0.7109375, "learning_rate": 1.7917404031064245e-05, "loss": 1.082, "mean_token_accuracy": 0.702524871379137, "num_tokens": 174670593.0, "step": 2330 }, { "entropy": 1.1133252872154116, "epoch": 0.7189246918688001, "grad_norm": 0.6796875, "learning_rate": 1.7907501560987594e-05, "loss": 1.1079, "mean_token_accuracy": 0.6983722053468228, "num_tokens": 175048912.0, "step": 2335 }, { "entropy": 1.167278153076768, "epoch": 0.7204641451704463, "grad_norm": 0.76171875, "learning_rate": 1.7897578354409945e-05, "loss": 1.1646, "mean_token_accuracy": 0.6914217924699188, "num_tokens": 175419284.0, "step": 2340 }, { "entropy": 1.114026983268559, "epoch": 0.7220035984720926, "grad_norm": 0.76953125, "learning_rate": 1.7887634437353754e-05, "loss": 1.1154, "mean_token_accuracy": 0.6988561425358057, "num_tokens": 175793045.0, "step": 2345 }, { "entropy": 1.1095017280429602, "epoch": 0.7235430517737389, "grad_norm": 0.7265625, "learning_rate": 1.787766983589578e-05, "loss": 1.1076, "mean_token_accuracy": 0.7001173861324788, "num_tokens": 176159168.0, "step": 2350 }, { "entropy": 1.114397633448243, "epoch": 0.7250825050753851, "grad_norm": 0.69921875, "learning_rate": 1.7867684576167028e-05, "loss": 1.1065, "mean_token_accuracy": 0.6991507276892662, "num_tokens": 176538415.0, "step": 2355 }, { "entropy": 1.1345725648105145, "epoch": 0.7266219583770314, "grad_norm": 0.734375, "learning_rate": 1.7857678684352684e-05, "loss": 1.1261, "mean_token_accuracy": 0.6978184632956982, "num_tokens": 176902529.0, "step": 2360 }, { "entropy": 1.1068701507523655, "epoch": 0.7281614116786777, "grad_norm": 0.78125, "learning_rate": 1.7847652186692025e-05, "loss": 1.096, "mean_token_accuracy": 0.6995298650115729, "num_tokens": 177273706.0, "step": 2365 }, { "entropy": 1.0690416656434536, "epoch": 0.7297008649803238, "grad_norm": 0.76171875, "learning_rate": 1.783760510947838e-05, "loss": 1.0606, "mean_token_accuracy": 0.7073897119611502, "num_tokens": 177642545.0, "step": 2370 }, { "entropy": 1.1013412851840259, "epoch": 0.7312403182819701, "grad_norm": 0.7109375, "learning_rate": 1.7827537479059026e-05, "loss": 1.0872, "mean_token_accuracy": 0.7016142923384905, "num_tokens": 178023026.0, "step": 2375 }, { "entropy": 1.08609632384032, "epoch": 0.7327797715836164, "grad_norm": 0.73046875, "learning_rate": 1.7817449321835166e-05, "loss": 1.0756, "mean_token_accuracy": 0.7015501491725444, "num_tokens": 178416678.0, "step": 2380 }, { "entropy": 1.0995122667402029, "epoch": 0.7343192248852626, "grad_norm": 0.6953125, "learning_rate": 1.78073406642618e-05, "loss": 1.0907, "mean_token_accuracy": 0.7023708283901214, "num_tokens": 178792520.0, "step": 2385 }, { "entropy": 1.1085374269634485, "epoch": 0.7358586781869089, "grad_norm": 0.7109375, "learning_rate": 1.779721153284772e-05, "loss": 1.1006, "mean_token_accuracy": 0.7005628883838654, "num_tokens": 179177915.0, "step": 2390 }, { "entropy": 1.0867597110569478, "epoch": 0.7373981314885552, "grad_norm": 0.69921875, "learning_rate": 1.778706195415538e-05, "loss": 1.0764, "mean_token_accuracy": 0.7046916723251343, "num_tokens": 179554799.0, "step": 2395 }, { "entropy": 1.1686318777501583, "epoch": 0.7389375847902013, "grad_norm": 0.703125, "learning_rate": 1.777689195480087e-05, "loss": 1.17, "mean_token_accuracy": 0.6879521161317825, "num_tokens": 179918900.0, "step": 2400 }, { "entropy": 1.0987579802051186, "epoch": 0.7404770380918476, "grad_norm": 0.71484375, "learning_rate": 1.776670156145383e-05, "loss": 1.1023, "mean_token_accuracy": 0.7014432933181525, "num_tokens": 180303889.0, "step": 2405 }, { "entropy": 1.1044664761051535, "epoch": 0.7420164913934939, "grad_norm": 0.72265625, "learning_rate": 1.7756490800837377e-05, "loss": 1.1022, "mean_token_accuracy": 0.6991443373262882, "num_tokens": 180665150.0, "step": 2410 }, { "entropy": 1.1001021387055516, "epoch": 0.7435559446951402, "grad_norm": 0.75390625, "learning_rate": 1.774625969972804e-05, "loss": 1.0877, "mean_token_accuracy": 0.7032657440751791, "num_tokens": 181037748.0, "step": 2415 }, { "entropy": 1.124724223650992, "epoch": 0.7450953979967864, "grad_norm": 0.78515625, "learning_rate": 1.7736008284955693e-05, "loss": 1.1304, "mean_token_accuracy": 0.698460428789258, "num_tokens": 181406422.0, "step": 2420 }, { "entropy": 1.0898881725966931, "epoch": 0.7466348512984327, "grad_norm": 0.71484375, "learning_rate": 1.772573658340347e-05, "loss": 1.0731, "mean_token_accuracy": 0.7067207857966423, "num_tokens": 181780292.0, "step": 2425 }, { "entropy": 1.1112020071595907, "epoch": 0.7481743046000789, "grad_norm": 0.75, "learning_rate": 1.7715444622007715e-05, "loss": 1.1118, "mean_token_accuracy": 0.7000539500266314, "num_tokens": 182155860.0, "step": 2430 }, { "entropy": 1.1400660768151283, "epoch": 0.7497137579017251, "grad_norm": 0.71875, "learning_rate": 1.7705132427757895e-05, "loss": 1.1317, "mean_token_accuracy": 0.693534354865551, "num_tokens": 182541127.0, "step": 2435 }, { "entropy": 1.101803145557642, "epoch": 0.7512532112033714, "grad_norm": 0.72265625, "learning_rate": 1.7694800027696536e-05, "loss": 1.0949, "mean_token_accuracy": 0.7003138996660709, "num_tokens": 182916319.0, "step": 2440 }, { "entropy": 1.1126858746632933, "epoch": 0.7527926645050177, "grad_norm": 0.734375, "learning_rate": 1.7684447448919156e-05, "loss": 1.1117, "mean_token_accuracy": 0.6983442030847072, "num_tokens": 183291099.0, "step": 2445 }, { "entropy": 1.0931305399164557, "epoch": 0.7543321178066639, "grad_norm": 0.7578125, "learning_rate": 1.7674074718574187e-05, "loss": 1.087, "mean_token_accuracy": 0.7029769979417324, "num_tokens": 183656984.0, "step": 2450 }, { "entropy": 1.0863770237192512, "epoch": 0.7558715711083102, "grad_norm": 0.74609375, "learning_rate": 1.7663681863862895e-05, "loss": 1.0745, "mean_token_accuracy": 0.7050878301262855, "num_tokens": 184030898.0, "step": 2455 }, { "entropy": 1.1342706704512238, "epoch": 0.7574110244099564, "grad_norm": 0.703125, "learning_rate": 1.7653268912039346e-05, "loss": 1.1146, "mean_token_accuracy": 0.6934974033385515, "num_tokens": 184409379.0, "step": 2460 }, { "entropy": 1.1351441755890845, "epoch": 0.7589504777116026, "grad_norm": 0.765625, "learning_rate": 1.764283589041028e-05, "loss": 1.1331, "mean_token_accuracy": 0.6928224857896567, "num_tokens": 184785789.0, "step": 2465 }, { "entropy": 1.1305670756846666, "epoch": 0.7604899310132489, "grad_norm": 0.73828125, "learning_rate": 1.7632382826335082e-05, "loss": 1.1201, "mean_token_accuracy": 0.6961219064891339, "num_tokens": 185152907.0, "step": 2470 }, { "entropy": 1.1167133485898375, "epoch": 0.7620293843148952, "grad_norm": 0.75, "learning_rate": 1.76219097472257e-05, "loss": 1.1284, "mean_token_accuracy": 0.6951590169221162, "num_tokens": 185527048.0, "step": 2475 }, { "entropy": 1.1290605710819364, "epoch": 0.7635688376165414, "grad_norm": 0.69140625, "learning_rate": 1.761141668054655e-05, "loss": 1.1299, "mean_token_accuracy": 0.69532679207623, "num_tokens": 185898944.0, "step": 2480 }, { "entropy": 1.1405559226870536, "epoch": 0.7651082909181877, "grad_norm": 0.7109375, "learning_rate": 1.760090365381449e-05, "loss": 1.1399, "mean_token_accuracy": 0.692203239351511, "num_tokens": 186258758.0, "step": 2485 }, { "entropy": 1.1181536603718996, "epoch": 0.766647744219834, "grad_norm": 0.734375, "learning_rate": 1.75903706945987e-05, "loss": 1.1058, "mean_token_accuracy": 0.6988699793815613, "num_tokens": 186624684.0, "step": 2490 }, { "entropy": 1.1159826684743166, "epoch": 0.7681871975214802, "grad_norm": 0.703125, "learning_rate": 1.7579817830520644e-05, "loss": 1.1029, "mean_token_accuracy": 0.6988367810845375, "num_tokens": 187007877.0, "step": 2495 }, { "entropy": 1.0837754575535654, "epoch": 0.7697266508231264, "grad_norm": 0.703125, "learning_rate": 1.756924508925397e-05, "loss": 1.0795, "mean_token_accuracy": 0.7029804602265358, "num_tokens": 187395823.0, "step": 2500 }, { "entropy": 1.0903053333982826, "epoch": 0.7712661041247727, "grad_norm": 0.77734375, "learning_rate": 1.7558652498524464e-05, "loss": 1.0712, "mean_token_accuracy": 0.7018662039190531, "num_tokens": 187767014.0, "step": 2505 }, { "entropy": 1.1511711820960044, "epoch": 0.772805557426419, "grad_norm": 0.74609375, "learning_rate": 1.7548040086109957e-05, "loss": 1.1538, "mean_token_accuracy": 0.6920887984335422, "num_tokens": 188140908.0, "step": 2510 }, { "entropy": 1.1196786388754845, "epoch": 0.7743450107280652, "grad_norm": 0.66796875, "learning_rate": 1.7537407879840266e-05, "loss": 1.1192, "mean_token_accuracy": 0.7018770579248667, "num_tokens": 188516656.0, "step": 2515 }, { "entropy": 1.135399747081101, "epoch": 0.7758844640297115, "grad_norm": 0.71484375, "learning_rate": 1.752675590759711e-05, "loss": 1.1263, "mean_token_accuracy": 0.6961784608662128, "num_tokens": 188890179.0, "step": 2520 }, { "entropy": 1.1367985662072897, "epoch": 0.7774239173313577, "grad_norm": 0.6953125, "learning_rate": 1.7516084197314044e-05, "loss": 1.1356, "mean_token_accuracy": 0.6949714899063111, "num_tokens": 189261560.0, "step": 2525 }, { "entropy": 1.1175121076405048, "epoch": 0.7789633706330039, "grad_norm": 0.69921875, "learning_rate": 1.7505392776976392e-05, "loss": 1.1152, "mean_token_accuracy": 0.6998940669000149, "num_tokens": 189635927.0, "step": 2530 }, { "entropy": 1.0612255077809096, "epoch": 0.7805028239346502, "grad_norm": 0.66796875, "learning_rate": 1.7494681674621148e-05, "loss": 1.0615, "mean_token_accuracy": 0.7076791275292635, "num_tokens": 190031986.0, "step": 2535 }, { "entropy": 1.0870164155960083, "epoch": 0.7820422772362965, "grad_norm": 0.6953125, "learning_rate": 1.7483950918336933e-05, "loss": 1.0821, "mean_token_accuracy": 0.7051350273191929, "num_tokens": 190406510.0, "step": 2540 }, { "entropy": 1.098094793781638, "epoch": 0.7835817305379427, "grad_norm": 0.78125, "learning_rate": 1.7473200536263905e-05, "loss": 1.0897, "mean_token_accuracy": 0.7014690071344376, "num_tokens": 190770948.0, "step": 2545 }, { "entropy": 1.1395260747522116, "epoch": 0.785121183839589, "grad_norm": 0.7109375, "learning_rate": 1.7462430556593687e-05, "loss": 1.1415, "mean_token_accuracy": 0.6940800420939922, "num_tokens": 191145348.0, "step": 2550 }, { "entropy": 1.1120876904577017, "epoch": 0.7866606371412352, "grad_norm": 0.7421875, "learning_rate": 1.7451641007569296e-05, "loss": 1.1064, "mean_token_accuracy": 0.702504301816225, "num_tokens": 191510545.0, "step": 2555 }, { "entropy": 1.1490049432963132, "epoch": 0.7882000904428814, "grad_norm": 0.6640625, "learning_rate": 1.7440831917485064e-05, "loss": 1.1411, "mean_token_accuracy": 0.6938914064317941, "num_tokens": 191894746.0, "step": 2560 }, { "entropy": 1.107052903994918, "epoch": 0.7897395437445277, "grad_norm": 0.7265625, "learning_rate": 1.743000331468657e-05, "loss": 1.0903, "mean_token_accuracy": 0.6995991533622146, "num_tokens": 192276582.0, "step": 2565 }, { "entropy": 1.1070753591135145, "epoch": 0.791278997046174, "grad_norm": 0.703125, "learning_rate": 1.7419155227570564e-05, "loss": 1.0866, "mean_token_accuracy": 0.7038450885564089, "num_tokens": 192621423.0, "step": 2570 }, { "entropy": 1.0929330352693796, "epoch": 0.7928184503478203, "grad_norm": 0.77734375, "learning_rate": 1.740828768458489e-05, "loss": 1.0926, "mean_token_accuracy": 0.70133086591959, "num_tokens": 192989973.0, "step": 2575 }, { "entropy": 1.129907682351768, "epoch": 0.7943579036494665, "grad_norm": 0.69140625, "learning_rate": 1.7397400714228414e-05, "loss": 1.1243, "mean_token_accuracy": 0.6967439528554678, "num_tokens": 193363104.0, "step": 2580 }, { "entropy": 1.142175304144621, "epoch": 0.7958973569511127, "grad_norm": 0.7578125, "learning_rate": 1.7386494345050944e-05, "loss": 1.1438, "mean_token_accuracy": 0.6937367048114538, "num_tokens": 193734742.0, "step": 2585 }, { "entropy": 1.1326942648738623, "epoch": 0.797436810252759, "grad_norm": 0.734375, "learning_rate": 1.737556860565316e-05, "loss": 1.1384, "mean_token_accuracy": 0.6964565064758063, "num_tokens": 194114488.0, "step": 2590 }, { "entropy": 1.1030776659026742, "epoch": 0.7989762635544052, "grad_norm": 0.703125, "learning_rate": 1.7364623524686542e-05, "loss": 1.0997, "mean_token_accuracy": 0.6996722735464573, "num_tokens": 194502358.0, "step": 2595 }, { "entropy": 1.0948217798024416, "epoch": 0.8005157168560515, "grad_norm": 0.71484375, "learning_rate": 1.735365913085329e-05, "loss": 1.0789, "mean_token_accuracy": 0.7024578548967838, "num_tokens": 194876850.0, "step": 2600 }, { "entropy": 1.118626402504742, "epoch": 0.8020551701576978, "grad_norm": 0.703125, "learning_rate": 1.734267545290625e-05, "loss": 1.1246, "mean_token_accuracy": 0.6985007669776678, "num_tokens": 195246768.0, "step": 2605 }, { "entropy": 1.121052284166217, "epoch": 0.803594623459344, "grad_norm": 0.7421875, "learning_rate": 1.7331672519648834e-05, "loss": 1.109, "mean_token_accuracy": 0.699789596349001, "num_tokens": 195637767.0, "step": 2610 }, { "entropy": 1.041398036852479, "epoch": 0.8051340767609902, "grad_norm": 0.70703125, "learning_rate": 1.732065035993495e-05, "loss": 1.0279, "mean_token_accuracy": 0.7113026835024356, "num_tokens": 196018909.0, "step": 2615 }, { "entropy": 1.1239682227373122, "epoch": 0.8066735300626365, "grad_norm": 0.71484375, "learning_rate": 1.7309609002668932e-05, "loss": 1.1141, "mean_token_accuracy": 0.6974333211779594, "num_tokens": 196401477.0, "step": 2620 }, { "entropy": 1.082462282292545, "epoch": 0.8082129833642827, "grad_norm": 0.74609375, "learning_rate": 1.7298548476805446e-05, "loss": 1.0828, "mean_token_accuracy": 0.7064408622682095, "num_tokens": 196769663.0, "step": 2625 }, { "entropy": 1.08235105490312, "epoch": 0.809752436665929, "grad_norm": 0.69921875, "learning_rate": 1.7287468811349437e-05, "loss": 1.0772, "mean_token_accuracy": 0.7040530938655138, "num_tokens": 197149098.0, "step": 2630 }, { "entropy": 1.0794834055006504, "epoch": 0.8112918899675753, "grad_norm": 0.71484375, "learning_rate": 1.7276370035356037e-05, "loss": 1.0788, "mean_token_accuracy": 0.7081692714244128, "num_tokens": 197507939.0, "step": 2635 }, { "entropy": 1.1190556347370149, "epoch": 0.8128313432692215, "grad_norm": 0.765625, "learning_rate": 1.7265252177930483e-05, "loss": 1.1102, "mean_token_accuracy": 0.6978001076728105, "num_tokens": 197878831.0, "step": 2640 }, { "entropy": 1.121983960829675, "epoch": 0.8143707965708677, "grad_norm": 0.73046875, "learning_rate": 1.7254115268228073e-05, "loss": 1.1101, "mean_token_accuracy": 0.6971151124686003, "num_tokens": 198240722.0, "step": 2645 }, { "entropy": 1.0984731782227755, "epoch": 0.815910249872514, "grad_norm": 0.7109375, "learning_rate": 1.724295933545404e-05, "loss": 1.0999, "mean_token_accuracy": 0.7044171739369631, "num_tokens": 198623643.0, "step": 2650 }, { "entropy": 1.1332397196441888, "epoch": 0.8174497031741603, "grad_norm": 0.703125, "learning_rate": 1.723178440886353e-05, "loss": 1.143, "mean_token_accuracy": 0.6969984227791428, "num_tokens": 199002171.0, "step": 2655 }, { "entropy": 1.1465369185432792, "epoch": 0.8189891564758065, "grad_norm": 0.66796875, "learning_rate": 1.722059051776148e-05, "loss": 1.1355, "mean_token_accuracy": 0.6944274462759494, "num_tokens": 199396183.0, "step": 2660 }, { "entropy": 1.130674248188734, "epoch": 0.8205286097774528, "grad_norm": 0.71875, "learning_rate": 1.7209377691502565e-05, "loss": 1.1236, "mean_token_accuracy": 0.6986651346087456, "num_tokens": 199766961.0, "step": 2665 }, { "entropy": 1.1448373874649405, "epoch": 0.8220680630790991, "grad_norm": 0.74609375, "learning_rate": 1.7198145959491113e-05, "loss": 1.1518, "mean_token_accuracy": 0.6953822866082191, "num_tokens": 200150523.0, "step": 2670 }, { "entropy": 1.1163246229290962, "epoch": 0.8236075163807453, "grad_norm": 0.67578125, "learning_rate": 1.718689535118103e-05, "loss": 1.0971, "mean_token_accuracy": 0.6998222548514604, "num_tokens": 200531969.0, "step": 2675 }, { "entropy": 1.1107960917055606, "epoch": 0.8251469696823915, "grad_norm": 0.77734375, "learning_rate": 1.7175625896075732e-05, "loss": 1.1005, "mean_token_accuracy": 0.7001858238130808, "num_tokens": 200904361.0, "step": 2680 }, { "entropy": 1.1194037832319736, "epoch": 0.8266864229840378, "grad_norm": 0.7109375, "learning_rate": 1.7164337623728044e-05, "loss": 1.1158, "mean_token_accuracy": 0.6979843948036433, "num_tokens": 201277752.0, "step": 2685 }, { "entropy": 1.149041135236621, "epoch": 0.828225876285684, "grad_norm": 0.71875, "learning_rate": 1.715303056374015e-05, "loss": 1.1487, "mean_token_accuracy": 0.691906564310193, "num_tokens": 201639026.0, "step": 2690 }, { "entropy": 1.1252323003485798, "epoch": 0.8297653295873303, "grad_norm": 0.70703125, "learning_rate": 1.7141704745763494e-05, "loss": 1.1085, "mean_token_accuracy": 0.6988822910934687, "num_tokens": 202032196.0, "step": 2695 }, { "entropy": 1.1688425466418266, "epoch": 0.8313047828889766, "grad_norm": 0.7578125, "learning_rate": 1.713036019949871e-05, "loss": 1.1736, "mean_token_accuracy": 0.68868796415627, "num_tokens": 202396787.0, "step": 2700 }, { "entropy": 1.0816320231184364, "epoch": 0.8328442361906228, "grad_norm": 0.71875, "learning_rate": 1.7118996954695553e-05, "loss": 1.0761, "mean_token_accuracy": 0.7047209940850735, "num_tokens": 202787506.0, "step": 2705 }, { "entropy": 1.1424961797893047, "epoch": 0.834383689492269, "grad_norm": 0.69140625, "learning_rate": 1.7107615041152807e-05, "loss": 1.1331, "mean_token_accuracy": 0.6949755053967237, "num_tokens": 203162645.0, "step": 2710 }, { "entropy": 1.1023723732680082, "epoch": 0.8359231427939153, "grad_norm": 0.71875, "learning_rate": 1.709621448871821e-05, "loss": 1.097, "mean_token_accuracy": 0.7015528365969658, "num_tokens": 203527557.0, "step": 2715 }, { "entropy": 1.1118264703080059, "epoch": 0.8374625960955616, "grad_norm": 0.734375, "learning_rate": 1.7084795327288387e-05, "loss": 1.1031, "mean_token_accuracy": 0.7010146964341402, "num_tokens": 203897448.0, "step": 2720 }, { "entropy": 1.0787724321708083, "epoch": 0.8390020493972078, "grad_norm": 0.72265625, "learning_rate": 1.7073357586808753e-05, "loss": 1.0665, "mean_token_accuracy": 0.7078627742826938, "num_tokens": 204269665.0, "step": 2725 }, { "entropy": 1.0742497980594634, "epoch": 0.8405415026988541, "grad_norm": 0.71875, "learning_rate": 1.706190129727345e-05, "loss": 1.0766, "mean_token_accuracy": 0.706443578377366, "num_tokens": 204640083.0, "step": 2730 }, { "entropy": 1.1287441933527589, "epoch": 0.8420809560005004, "grad_norm": 0.671875, "learning_rate": 1.7050426488725264e-05, "loss": 1.1246, "mean_token_accuracy": 0.6960625112056732, "num_tokens": 205010565.0, "step": 2735 }, { "entropy": 1.114234597980976, "epoch": 0.8436204093021465, "grad_norm": 0.6953125, "learning_rate": 1.703893319125554e-05, "loss": 1.1083, "mean_token_accuracy": 0.6985804803669453, "num_tokens": 205394241.0, "step": 2740 }, { "entropy": 1.0446887370198965, "epoch": 0.8451598626037928, "grad_norm": 0.69921875, "learning_rate": 1.7027421435004114e-05, "loss": 1.0396, "mean_token_accuracy": 0.7130256239324808, "num_tokens": 205778044.0, "step": 2745 }, { "entropy": 1.127483463473618, "epoch": 0.8466993159054391, "grad_norm": 0.70703125, "learning_rate": 1.701589125015922e-05, "loss": 1.1229, "mean_token_accuracy": 0.6960821971297264, "num_tokens": 206151325.0, "step": 2750 }, { "entropy": 1.1459118625149132, "epoch": 0.8482387692070853, "grad_norm": 0.734375, "learning_rate": 1.7004342666957426e-05, "loss": 1.1477, "mean_token_accuracy": 0.6906679786741734, "num_tokens": 206515412.0, "step": 2755 }, { "entropy": 1.1285589247941972, "epoch": 0.8497782225087316, "grad_norm": 0.73828125, "learning_rate": 1.6992775715683544e-05, "loss": 1.1317, "mean_token_accuracy": 0.6945409368723631, "num_tokens": 206884678.0, "step": 2760 }, { "entropy": 1.099574868567288, "epoch": 0.8513176758103779, "grad_norm": 0.75, "learning_rate": 1.698119042667056e-05, "loss": 1.0839, "mean_token_accuracy": 0.7026559956371784, "num_tokens": 207250423.0, "step": 2765 }, { "entropy": 1.1219121659174562, "epoch": 0.852857129112024, "grad_norm": 0.71875, "learning_rate": 1.696958683029954e-05, "loss": 1.1054, "mean_token_accuracy": 0.6976403135806322, "num_tokens": 207623348.0, "step": 2770 }, { "entropy": 1.1164616649970411, "epoch": 0.8543965824136703, "grad_norm": 0.73828125, "learning_rate": 1.6957964956999563e-05, "loss": 1.1202, "mean_token_accuracy": 0.6999995116144418, "num_tokens": 208001124.0, "step": 2775 }, { "entropy": 1.1377616070210934, "epoch": 0.8559360357153166, "grad_norm": 0.734375, "learning_rate": 1.6946324837247636e-05, "loss": 1.1271, "mean_token_accuracy": 0.6944478377699852, "num_tokens": 208375994.0, "step": 2780 }, { "entropy": 1.1082529162988066, "epoch": 0.8574754890169628, "grad_norm": 0.68359375, "learning_rate": 1.6934666501568618e-05, "loss": 1.104, "mean_token_accuracy": 0.6988645371049642, "num_tokens": 208752812.0, "step": 2785 }, { "entropy": 1.1542402550578117, "epoch": 0.8590149423186091, "grad_norm": 0.75, "learning_rate": 1.6922989980535135e-05, "loss": 1.1351, "mean_token_accuracy": 0.6953271046280861, "num_tokens": 209128737.0, "step": 2790 }, { "entropy": 1.121809756755829, "epoch": 0.8605543956202554, "grad_norm": 0.69921875, "learning_rate": 1.6911295304767497e-05, "loss": 1.1157, "mean_token_accuracy": 0.6957637727260589, "num_tokens": 209520264.0, "step": 2795 }, { "entropy": 1.1145857820287346, "epoch": 0.8620938489219017, "grad_norm": 0.72265625, "learning_rate": 1.6899582504933637e-05, "loss": 1.1059, "mean_token_accuracy": 0.7002962566912174, "num_tokens": 209892479.0, "step": 2800 }, { "entropy": 1.0788703871890903, "epoch": 0.8636333022235478, "grad_norm": 0.71875, "learning_rate": 1.6887851611749005e-05, "loss": 1.0604, "mean_token_accuracy": 0.706576419994235, "num_tokens": 210259673.0, "step": 2805 }, { "entropy": 1.1228289678692818, "epoch": 0.8651727555251941, "grad_norm": 0.7578125, "learning_rate": 1.6876102655976492e-05, "loss": 1.1182, "mean_token_accuracy": 0.6995963159948587, "num_tokens": 210620500.0, "step": 2810 }, { "entropy": 1.1059047624468803, "epoch": 0.8667122088268404, "grad_norm": 0.703125, "learning_rate": 1.6864335668426373e-05, "loss": 1.1059, "mean_token_accuracy": 0.7024442825466395, "num_tokens": 211012574.0, "step": 2815 }, { "entropy": 1.1174401119351387, "epoch": 0.8682516621284866, "grad_norm": 0.703125, "learning_rate": 1.68525506799562e-05, "loss": 1.1297, "mean_token_accuracy": 0.6935884576290846, "num_tokens": 211378656.0, "step": 2820 }, { "entropy": 1.0923995364457368, "epoch": 0.8697911154301329, "grad_norm": 0.7578125, "learning_rate": 1.6840747721470733e-05, "loss": 1.0902, "mean_token_accuracy": 0.7031279694288969, "num_tokens": 211748096.0, "step": 2825 }, { "entropy": 1.0991105940192938, "epoch": 0.8713305687317792, "grad_norm": 0.73828125, "learning_rate": 1.6828926823921845e-05, "loss": 1.0853, "mean_token_accuracy": 0.7029936861246824, "num_tokens": 212131750.0, "step": 2830 }, { "entropy": 1.1157667137682439, "epoch": 0.8728700220334253, "grad_norm": 0.69921875, "learning_rate": 1.6817088018308477e-05, "loss": 1.1162, "mean_token_accuracy": 0.6973326183855534, "num_tokens": 212507126.0, "step": 2835 }, { "entropy": 1.1045021768659353, "epoch": 0.8744094753350716, "grad_norm": 0.75390625, "learning_rate": 1.6805231335676505e-05, "loss": 1.1009, "mean_token_accuracy": 0.7020870693027973, "num_tokens": 212871116.0, "step": 2840 }, { "entropy": 1.1048178130760788, "epoch": 0.8759489286367179, "grad_norm": 0.6875, "learning_rate": 1.6793356807118695e-05, "loss": 1.0877, "mean_token_accuracy": 0.702137915417552, "num_tokens": 213241519.0, "step": 2845 }, { "entropy": 1.099703123793006, "epoch": 0.8774883819383641, "grad_norm": 0.70703125, "learning_rate": 1.6781464463774628e-05, "loss": 1.0733, "mean_token_accuracy": 0.70214060023427, "num_tokens": 213623745.0, "step": 2850 }, { "entropy": 1.1110018253326417, "epoch": 0.8790278352400104, "grad_norm": 0.765625, "learning_rate": 1.6769554336830577e-05, "loss": 1.1057, "mean_token_accuracy": 0.6998776510357857, "num_tokens": 213997461.0, "step": 2855 }, { "entropy": 1.1340667808428406, "epoch": 0.8805672885416567, "grad_norm": 0.75, "learning_rate": 1.675762645751946e-05, "loss": 1.1343, "mean_token_accuracy": 0.692723986506462, "num_tokens": 214370570.0, "step": 2860 }, { "entropy": 1.0941222723573447, "epoch": 0.8821067418433028, "grad_norm": 0.7265625, "learning_rate": 1.6745680857120757e-05, "loss": 1.077, "mean_token_accuracy": 0.7049151591956615, "num_tokens": 214748557.0, "step": 2865 }, { "entropy": 1.1092702638357879, "epoch": 0.8836461951449491, "grad_norm": 0.734375, "learning_rate": 1.673371756696041e-05, "loss": 1.1077, "mean_token_accuracy": 0.6991445735096932, "num_tokens": 215124225.0, "step": 2870 }, { "entropy": 1.0871345413848759, "epoch": 0.8851856484465954, "grad_norm": 0.69140625, "learning_rate": 1.672173661841075e-05, "loss": 1.0845, "mean_token_accuracy": 0.7042425669729709, "num_tokens": 215507111.0, "step": 2875 }, { "entropy": 1.148904792405665, "epoch": 0.8867251017482417, "grad_norm": 0.734375, "learning_rate": 1.670973804289042e-05, "loss": 1.1502, "mean_token_accuracy": 0.6910400237888098, "num_tokens": 215875633.0, "step": 2880 }, { "entropy": 1.15465437322855, "epoch": 0.8882645550498879, "grad_norm": 0.75, "learning_rate": 1.6697721871864286e-05, "loss": 1.1557, "mean_token_accuracy": 0.6898221826180816, "num_tokens": 216254799.0, "step": 2885 }, { "entropy": 1.1274722613394261, "epoch": 0.8898040083515342, "grad_norm": 0.69140625, "learning_rate": 1.6685688136843355e-05, "loss": 1.1143, "mean_token_accuracy": 0.6991093195974827, "num_tokens": 216630501.0, "step": 2890 }, { "entropy": 1.1437790846452116, "epoch": 0.8913434616531805, "grad_norm": 0.75, "learning_rate": 1.667363686938469e-05, "loss": 1.1427, "mean_token_accuracy": 0.6937702525407076, "num_tokens": 216998378.0, "step": 2895 }, { "entropy": 1.1149624142795802, "epoch": 0.8928829149548266, "grad_norm": 0.7265625, "learning_rate": 1.6661568101091345e-05, "loss": 1.1057, "mean_token_accuracy": 0.7003548592329025, "num_tokens": 217369136.0, "step": 2900 }, { "entropy": 1.1179976981133222, "epoch": 0.8944223682564729, "grad_norm": 0.7109375, "learning_rate": 1.664948186361225e-05, "loss": 1.1073, "mean_token_accuracy": 0.6955419234931469, "num_tokens": 217739308.0, "step": 2905 }, { "entropy": 1.0808471154421568, "epoch": 0.8959618215581192, "grad_norm": 0.734375, "learning_rate": 1.6637378188642156e-05, "loss": 1.0781, "mean_token_accuracy": 0.7017045050859452, "num_tokens": 218124777.0, "step": 2910 }, { "entropy": 1.0651660868898034, "epoch": 0.8975012748597654, "grad_norm": 0.6640625, "learning_rate": 1.662525710792154e-05, "loss": 1.0522, "mean_token_accuracy": 0.7084551777690649, "num_tokens": 218515006.0, "step": 2915 }, { "entropy": 1.0998478880152107, "epoch": 0.8990407281614117, "grad_norm": 0.72265625, "learning_rate": 1.661311865323652e-05, "loss": 1.0942, "mean_token_accuracy": 0.7040021698921919, "num_tokens": 218879337.0, "step": 2920 }, { "entropy": 1.0932244323194027, "epoch": 0.900580181463058, "grad_norm": 0.68359375, "learning_rate": 1.6600962856418782e-05, "loss": 1.087, "mean_token_accuracy": 0.703185360506177, "num_tokens": 219251883.0, "step": 2925 }, { "entropy": 1.1038317073136568, "epoch": 0.9021196347647041, "grad_norm": 0.73828125, "learning_rate": 1.6588789749345487e-05, "loss": 1.0918, "mean_token_accuracy": 0.7009527865797281, "num_tokens": 219632445.0, "step": 2930 }, { "entropy": 1.0950964797288179, "epoch": 0.9036590880663504, "grad_norm": 0.73828125, "learning_rate": 1.6576599363939185e-05, "loss": 1.0764, "mean_token_accuracy": 0.7027178958058358, "num_tokens": 220010934.0, "step": 2935 }, { "entropy": 1.101254301518202, "epoch": 0.9051985413679967, "grad_norm": 0.6953125, "learning_rate": 1.6564391732167743e-05, "loss": 1.0912, "mean_token_accuracy": 0.7002034839242697, "num_tokens": 220374695.0, "step": 2940 }, { "entropy": 1.0901438646018504, "epoch": 0.9067379946696429, "grad_norm": 0.71875, "learning_rate": 1.6552166886044253e-05, "loss": 1.0903, "mean_token_accuracy": 0.7034961324185133, "num_tokens": 220739608.0, "step": 2945 }, { "entropy": 1.0934947073459624, "epoch": 0.9082774479712892, "grad_norm": 0.6796875, "learning_rate": 1.6539924857626947e-05, "loss": 1.0803, "mean_token_accuracy": 0.7044488485902548, "num_tokens": 221109955.0, "step": 2950 }, { "entropy": 1.0877722285687923, "epoch": 0.9098169012729355, "grad_norm": 0.76953125, "learning_rate": 1.652766567901912e-05, "loss": 1.0912, "mean_token_accuracy": 0.7042174067348241, "num_tokens": 221469786.0, "step": 2955 }, { "entropy": 1.1298996726050974, "epoch": 0.9113563545745818, "grad_norm": 0.734375, "learning_rate": 1.6515389382369034e-05, "loss": 1.1242, "mean_token_accuracy": 0.6937161698937416, "num_tokens": 221837816.0, "step": 2960 }, { "entropy": 1.1138132132589817, "epoch": 0.9128958078762279, "grad_norm": 0.7109375, "learning_rate": 1.650309599986985e-05, "loss": 1.1076, "mean_token_accuracy": 0.6995945759117603, "num_tokens": 222203420.0, "step": 2965 }, { "entropy": 1.102806118503213, "epoch": 0.9144352611778742, "grad_norm": 0.78515625, "learning_rate": 1.649078556375953e-05, "loss": 1.0925, "mean_token_accuracy": 0.6999370910227298, "num_tokens": 222580138.0, "step": 2970 }, { "entropy": 1.1294960187748075, "epoch": 0.9159747144795205, "grad_norm": 0.7109375, "learning_rate": 1.6478458106320755e-05, "loss": 1.1236, "mean_token_accuracy": 0.6974813371896744, "num_tokens": 222953640.0, "step": 2975 }, { "entropy": 1.1324309218674897, "epoch": 0.9175141677811667, "grad_norm": 0.65234375, "learning_rate": 1.6466113659880845e-05, "loss": 1.1234, "mean_token_accuracy": 0.6944039441645146, "num_tokens": 223333549.0, "step": 2980 }, { "entropy": 1.0994510252028704, "epoch": 0.919053621082813, "grad_norm": 0.71875, "learning_rate": 1.6453752256811676e-05, "loss": 1.1045, "mean_token_accuracy": 0.6973139215260744, "num_tokens": 223703963.0, "step": 2985 }, { "entropy": 1.137350879982114, "epoch": 0.9205930743844593, "grad_norm": 0.71484375, "learning_rate": 1.6441373929529583e-05, "loss": 1.1329, "mean_token_accuracy": 0.6942195292562247, "num_tokens": 224081482.0, "step": 2990 }, { "entropy": 1.1128303619101643, "epoch": 0.9221325276861054, "grad_norm": 0.6875, "learning_rate": 1.6428978710495286e-05, "loss": 1.1036, "mean_token_accuracy": 0.7014426335692405, "num_tokens": 224448417.0, "step": 2995 }, { "entropy": 1.0825168298557402, "epoch": 0.9236719809877517, "grad_norm": 0.71875, "learning_rate": 1.6416566632213803e-05, "loss": 1.0628, "mean_token_accuracy": 0.7056166708469391, "num_tokens": 224813610.0, "step": 3000 }, { "entropy": 1.0959913771599532, "epoch": 0.925211434289398, "grad_norm": 0.73046875, "learning_rate": 1.6404137727234366e-05, "loss": 1.0949, "mean_token_accuracy": 0.7023037023842335, "num_tokens": 225192153.0, "step": 3005 }, { "entropy": 1.0896434228867293, "epoch": 0.9267508875910442, "grad_norm": 0.6875, "learning_rate": 1.6391692028150323e-05, "loss": 1.0827, "mean_token_accuracy": 0.7022975075989961, "num_tokens": 225577668.0, "step": 3010 }, { "entropy": 1.1384891115128994, "epoch": 0.9282903408926905, "grad_norm": 0.73828125, "learning_rate": 1.6379229567599072e-05, "loss": 1.129, "mean_token_accuracy": 0.695337663218379, "num_tokens": 225962836.0, "step": 3015 }, { "entropy": 1.099364478327334, "epoch": 0.9298297941943368, "grad_norm": 0.68359375, "learning_rate": 1.636675037826196e-05, "loss": 1.0941, "mean_token_accuracy": 0.701835821568966, "num_tokens": 226344216.0, "step": 3020 }, { "entropy": 1.1219324097037315, "epoch": 0.931369247495983, "grad_norm": 0.73828125, "learning_rate": 1.635425449286421e-05, "loss": 1.1147, "mean_token_accuracy": 0.6947548136115074, "num_tokens": 226714910.0, "step": 3025 }, { "entropy": 1.12341584302485, "epoch": 0.9329087007976292, "grad_norm": 0.75390625, "learning_rate": 1.6341741944174824e-05, "loss": 1.1249, "mean_token_accuracy": 0.6955896835774183, "num_tokens": 227086456.0, "step": 3030 }, { "entropy": 1.1454509980976582, "epoch": 0.9344481540992755, "grad_norm": 0.72265625, "learning_rate": 1.6329212765006503e-05, "loss": 1.1434, "mean_token_accuracy": 0.692763788253069, "num_tokens": 227462478.0, "step": 3035 }, { "entropy": 1.1061009069904686, "epoch": 0.9359876074009218, "grad_norm": 0.74609375, "learning_rate": 1.6316666988215558e-05, "loss": 1.1083, "mean_token_accuracy": 0.7021861042827368, "num_tokens": 227832910.0, "step": 3040 }, { "entropy": 1.0905923018231989, "epoch": 0.937527060702568, "grad_norm": 0.69921875, "learning_rate": 1.6304104646701818e-05, "loss": 1.0791, "mean_token_accuracy": 0.7025436852127314, "num_tokens": 228197150.0, "step": 3045 }, { "entropy": 1.105141183361411, "epoch": 0.9390665140042143, "grad_norm": 0.72265625, "learning_rate": 1.6291525773408576e-05, "loss": 1.081, "mean_token_accuracy": 0.7014652032405138, "num_tokens": 228564387.0, "step": 3050 }, { "entropy": 1.093245293945074, "epoch": 0.9406059673058605, "grad_norm": 0.6875, "learning_rate": 1.6278930401322445e-05, "loss": 1.0915, "mean_token_accuracy": 0.7042498689144849, "num_tokens": 228935148.0, "step": 3055 }, { "entropy": 1.1256541293114424, "epoch": 0.9421454206075067, "grad_norm": 0.68359375, "learning_rate": 1.626631856347333e-05, "loss": 1.1151, "mean_token_accuracy": 0.6959347855299711, "num_tokens": 229321596.0, "step": 3060 }, { "entropy": 1.1019672907888889, "epoch": 0.943684873909153, "grad_norm": 0.734375, "learning_rate": 1.6253690292934303e-05, "loss": 1.0862, "mean_token_accuracy": 0.7024039305746556, "num_tokens": 229698077.0, "step": 3065 }, { "entropy": 1.1103874322026968, "epoch": 0.9452243272107993, "grad_norm": 0.7109375, "learning_rate": 1.6241045622821526e-05, "loss": 1.0971, "mean_token_accuracy": 0.7011660991236568, "num_tokens": 230066796.0, "step": 3070 }, { "entropy": 1.1184454999864102, "epoch": 0.9467637805124455, "grad_norm": 0.765625, "learning_rate": 1.6228384586294178e-05, "loss": 1.1099, "mean_token_accuracy": 0.6986790463328362, "num_tokens": 230440474.0, "step": 3075 }, { "entropy": 1.1222109664231539, "epoch": 0.9483032338140918, "grad_norm": 0.72265625, "learning_rate": 1.621570721655435e-05, "loss": 1.1173, "mean_token_accuracy": 0.6964509148150683, "num_tokens": 230825384.0, "step": 3080 }, { "entropy": 1.0932182375341655, "epoch": 0.949842687115738, "grad_norm": 0.71875, "learning_rate": 1.6203013546846967e-05, "loss": 1.1004, "mean_token_accuracy": 0.7018071874976158, "num_tokens": 231197174.0, "step": 3085 }, { "entropy": 1.0848873758688569, "epoch": 0.9513821404173842, "grad_norm": 0.69921875, "learning_rate": 1.6190303610459696e-05, "loss": 1.077, "mean_token_accuracy": 0.7023764166980981, "num_tokens": 231575969.0, "step": 3090 }, { "entropy": 1.119613417983055, "epoch": 0.9529215937190305, "grad_norm": 0.73828125, "learning_rate": 1.6177577440722863e-05, "loss": 1.1007, "mean_token_accuracy": 0.7002534594386816, "num_tokens": 231939206.0, "step": 3095 }, { "entropy": 1.143301498889923, "epoch": 0.9544610470206768, "grad_norm": 0.7890625, "learning_rate": 1.6164835071009364e-05, "loss": 1.1498, "mean_token_accuracy": 0.6908706534653902, "num_tokens": 232309662.0, "step": 3100 }, { "entropy": 1.1348078405484556, "epoch": 0.9560005003223231, "grad_norm": 0.73046875, "learning_rate": 1.6152076534734585e-05, "loss": 1.1165, "mean_token_accuracy": 0.6982807531952858, "num_tokens": 232680430.0, "step": 3105 }, { "entropy": 1.1175556883215905, "epoch": 0.9575399536239693, "grad_norm": 0.75, "learning_rate": 1.6139301865356292e-05, "loss": 1.1164, "mean_token_accuracy": 0.6980854213237763, "num_tokens": 233040916.0, "step": 3110 }, { "entropy": 1.0916607104241849, "epoch": 0.9590794069256156, "grad_norm": 0.68359375, "learning_rate": 1.612651109637457e-05, "loss": 1.074, "mean_token_accuracy": 0.7059085302054882, "num_tokens": 233422778.0, "step": 3115 }, { "entropy": 1.1530342236161233, "epoch": 0.9606188602272618, "grad_norm": 0.74609375, "learning_rate": 1.611370426133172e-05, "loss": 1.1506, "mean_token_accuracy": 0.6922825556248426, "num_tokens": 233783431.0, "step": 3120 }, { "entropy": 1.0918744718655944, "epoch": 0.962158313528908, "grad_norm": 0.69921875, "learning_rate": 1.610088139381217e-05, "loss": 1.0871, "mean_token_accuracy": 0.7025839403271675, "num_tokens": 234157549.0, "step": 3125 }, { "entropy": 1.1136182451620698, "epoch": 0.9636977668305543, "grad_norm": 0.71484375, "learning_rate": 1.60880425274424e-05, "loss": 1.1022, "mean_token_accuracy": 0.6993775106966496, "num_tokens": 234533593.0, "step": 3130 }, { "entropy": 1.1217090966179968, "epoch": 0.9652372201322006, "grad_norm": 0.7578125, "learning_rate": 1.6075187695890837e-05, "loss": 1.1123, "mean_token_accuracy": 0.6977352771908045, "num_tokens": 234901573.0, "step": 3135 }, { "entropy": 1.1311538334935904, "epoch": 0.9667766734338468, "grad_norm": 0.72265625, "learning_rate": 1.6062316932867777e-05, "loss": 1.1157, "mean_token_accuracy": 0.6953879836946726, "num_tokens": 235276736.0, "step": 3140 }, { "entropy": 1.1336469167843461, "epoch": 0.968316126735493, "grad_norm": 0.7578125, "learning_rate": 1.60494302721253e-05, "loss": 1.1228, "mean_token_accuracy": 0.6957072228193283, "num_tokens": 235637944.0, "step": 3145 }, { "entropy": 1.1148815231397748, "epoch": 0.9698555800371393, "grad_norm": 0.76171875, "learning_rate": 1.6036527747457172e-05, "loss": 1.1195, "mean_token_accuracy": 0.696688824146986, "num_tokens": 236004424.0, "step": 3150 }, { "entropy": 1.0731347337365151, "epoch": 0.9713950333387855, "grad_norm": 0.70703125, "learning_rate": 1.6023609392698753e-05, "loss": 1.0624, "mean_token_accuracy": 0.7073259465396404, "num_tokens": 236373459.0, "step": 3155 }, { "entropy": 1.1305216647684575, "epoch": 0.9729344866404318, "grad_norm": 0.70703125, "learning_rate": 1.601067524172693e-05, "loss": 1.135, "mean_token_accuracy": 0.6961314767599106, "num_tokens": 236737997.0, "step": 3160 }, { "entropy": 1.0698123347014188, "epoch": 0.9744739399420781, "grad_norm": 0.765625, "learning_rate": 1.599772532846e-05, "loss": 1.062, "mean_token_accuracy": 0.7111779380589723, "num_tokens": 237114157.0, "step": 3165 }, { "entropy": 1.104625035636127, "epoch": 0.9760133932437243, "grad_norm": 0.71875, "learning_rate": 1.5984759686857602e-05, "loss": 1.0899, "mean_token_accuracy": 0.7029267687350511, "num_tokens": 237486042.0, "step": 3170 }, { "entropy": 1.1002591367810965, "epoch": 0.9775528465453706, "grad_norm": 0.7265625, "learning_rate": 1.5971778350920622e-05, "loss": 1.1151, "mean_token_accuracy": 0.6989728376269341, "num_tokens": 237869988.0, "step": 3175 }, { "entropy": 1.1284619925543666, "epoch": 0.9790922998470168, "grad_norm": 0.73046875, "learning_rate": 1.59587813546911e-05, "loss": 1.1141, "mean_token_accuracy": 0.6970653466880321, "num_tokens": 238251465.0, "step": 3180 }, { "entropy": 1.0933161690831183, "epoch": 0.9806317531486631, "grad_norm": 0.73828125, "learning_rate": 1.5945768732252144e-05, "loss": 1.0765, "mean_token_accuracy": 0.7060096051543951, "num_tokens": 238609740.0, "step": 3185 }, { "entropy": 1.0971500884741545, "epoch": 0.9821712064503093, "grad_norm": 0.703125, "learning_rate": 1.5932740517727835e-05, "loss": 1.093, "mean_token_accuracy": 0.7040771137923002, "num_tokens": 238990674.0, "step": 3190 }, { "entropy": 1.1219343401491642, "epoch": 0.9837106597519556, "grad_norm": 0.7421875, "learning_rate": 1.5919696745283154e-05, "loss": 1.1152, "mean_token_accuracy": 0.6963998835533858, "num_tokens": 239362660.0, "step": 3195 }, { "entropy": 1.1336881577968598, "epoch": 0.9852501130536019, "grad_norm": 0.73828125, "learning_rate": 1.5906637449123864e-05, "loss": 1.1267, "mean_token_accuracy": 0.695428854227066, "num_tokens": 239742807.0, "step": 3200 }, { "entropy": 1.1454315075650812, "epoch": 0.9867895663552481, "grad_norm": 0.73828125, "learning_rate": 1.589356266349645e-05, "loss": 1.1388, "mean_token_accuracy": 0.6935530882328749, "num_tokens": 240117079.0, "step": 3205 }, { "entropy": 1.1146605210378766, "epoch": 0.9883290196568943, "grad_norm": 0.6640625, "learning_rate": 1.5880472422688023e-05, "loss": 1.0933, "mean_token_accuracy": 0.69862554743886, "num_tokens": 240508411.0, "step": 3210 }, { "entropy": 1.1043241050094366, "epoch": 0.9898684729585406, "grad_norm": 0.73046875, "learning_rate": 1.5867366761026198e-05, "loss": 1.0962, "mean_token_accuracy": 0.6992103181779384, "num_tokens": 240878729.0, "step": 3215 }, { "entropy": 1.1375742366537451, "epoch": 0.9914079262601868, "grad_norm": 0.72265625, "learning_rate": 1.585424571287906e-05, "loss": 1.1282, "mean_token_accuracy": 0.6959919854998589, "num_tokens": 241254983.0, "step": 3220 }, { "entropy": 1.1033312421292067, "epoch": 0.9929473795618331, "grad_norm": 0.7109375, "learning_rate": 1.5841109312655017e-05, "loss": 1.1034, "mean_token_accuracy": 0.6991308070719242, "num_tokens": 241613413.0, "step": 3225 }, { "entropy": 1.1465192284435033, "epoch": 0.9944868328634794, "grad_norm": 0.703125, "learning_rate": 1.582795759480275e-05, "loss": 1.1459, "mean_token_accuracy": 0.6932627018541098, "num_tokens": 242001055.0, "step": 3230 }, { "entropy": 1.110090786218643, "epoch": 0.9960262861651256, "grad_norm": 0.70703125, "learning_rate": 1.581479059381111e-05, "loss": 1.0991, "mean_token_accuracy": 0.7005109634250403, "num_tokens": 242376518.0, "step": 3235 }, { "entropy": 1.1250158324837685, "epoch": 0.9975657394667719, "grad_norm": 0.8125, "learning_rate": 1.5801608344209012e-05, "loss": 1.1132, "mean_token_accuracy": 0.6980336494743824, "num_tokens": 242748045.0, "step": 3240 }, { "entropy": 1.1198844194412232, "epoch": 0.9991051927684181, "grad_norm": 0.6953125, "learning_rate": 1.578841088056538e-05, "loss": 1.1037, "mean_token_accuracy": 0.6987688016146422, "num_tokens": 243106650.0, "step": 3245 }, { "entropy": 1.0790818838556862, "epoch": 1.0006157813206584, "grad_norm": 0.7109375, "learning_rate": 1.5775198237489016e-05, "loss": 1.0821, "mean_token_accuracy": 0.7054923860130796, "num_tokens": 243439850.0, "step": 3250 }, { "entropy": 1.1380303783342243, "epoch": 1.0021552346223048, "grad_norm": 0.6875, "learning_rate": 1.576197044962854e-05, "loss": 1.1069, "mean_token_accuracy": 0.6983545649796724, "num_tokens": 243819045.0, "step": 3255 }, { "entropy": 1.1184853481128811, "epoch": 1.003694687923951, "grad_norm": 0.75390625, "learning_rate": 1.574872755167229e-05, "loss": 1.1113, "mean_token_accuracy": 0.700910248234868, "num_tokens": 244187786.0, "step": 3260 }, { "entropy": 1.1144864093512297, "epoch": 1.0052341412255972, "grad_norm": 0.703125, "learning_rate": 1.573546957834821e-05, "loss": 1.1082, "mean_token_accuracy": 0.7001832645386458, "num_tokens": 244561413.0, "step": 3265 }, { "entropy": 1.0656934957951307, "epoch": 1.0067735945272436, "grad_norm": 0.6953125, "learning_rate": 1.572219656442379e-05, "loss": 1.0573, "mean_token_accuracy": 0.7083818852901459, "num_tokens": 244931946.0, "step": 3270 }, { "entropy": 1.1119527027010918, "epoch": 1.0083130478288898, "grad_norm": 0.71875, "learning_rate": 1.5708908544705973e-05, "loss": 1.1102, "mean_token_accuracy": 0.7011913001537323, "num_tokens": 245292016.0, "step": 3275 }, { "entropy": 1.0942462753504514, "epoch": 1.009852501130536, "grad_norm": 0.6875, "learning_rate": 1.5695605554041035e-05, "loss": 1.0912, "mean_token_accuracy": 0.7022478103637695, "num_tokens": 245678063.0, "step": 3280 }, { "entropy": 1.1299390774220228, "epoch": 1.0113919544321823, "grad_norm": 0.73046875, "learning_rate": 1.5682287627314513e-05, "loss": 1.1255, "mean_token_accuracy": 0.6984323725104332, "num_tokens": 246052415.0, "step": 3285 }, { "entropy": 1.086801677197218, "epoch": 1.0129314077338285, "grad_norm": 0.6796875, "learning_rate": 1.566895479945113e-05, "loss": 1.0716, "mean_token_accuracy": 0.7040470905601979, "num_tokens": 246431821.0, "step": 3290 }, { "entropy": 1.0988284349441528, "epoch": 1.0144708610354747, "grad_norm": 0.703125, "learning_rate": 1.565560710541466e-05, "loss": 1.0975, "mean_token_accuracy": 0.7010353293269873, "num_tokens": 246798259.0, "step": 3295 }, { "entropy": 1.1112470647320152, "epoch": 1.016010314337121, "grad_norm": 0.7578125, "learning_rate": 1.5642244580207877e-05, "loss": 1.097, "mean_token_accuracy": 0.7007181420922279, "num_tokens": 247170864.0, "step": 3300 }, { "entropy": 1.0867752809077502, "epoch": 1.0175497676387673, "grad_norm": 0.72265625, "learning_rate": 1.562886725887245e-05, "loss": 1.0825, "mean_token_accuracy": 0.7039108872413635, "num_tokens": 247548714.0, "step": 3305 }, { "entropy": 1.1126468144357204, "epoch": 1.0190892209404134, "grad_norm": 0.76171875, "learning_rate": 1.5615475176488843e-05, "loss": 1.102, "mean_token_accuracy": 0.6979229044169187, "num_tokens": 247920202.0, "step": 3310 }, { "entropy": 1.1279393577948214, "epoch": 1.0206286742420598, "grad_norm": 0.7265625, "learning_rate": 1.5602068368176233e-05, "loss": 1.1142, "mean_token_accuracy": 0.6973439697176218, "num_tokens": 248287755.0, "step": 3315 }, { "entropy": 1.089619634114206, "epoch": 1.022168127543706, "grad_norm": 0.703125, "learning_rate": 1.558864686909241e-05, "loss": 1.0762, "mean_token_accuracy": 0.7067389722913504, "num_tokens": 248663289.0, "step": 3320 }, { "entropy": 1.0786739451810718, "epoch": 1.0237075808453522, "grad_norm": 0.71484375, "learning_rate": 1.5575210714433687e-05, "loss": 1.0639, "mean_token_accuracy": 0.7083170812577009, "num_tokens": 249058665.0, "step": 3325 }, { "entropy": 1.083180119469762, "epoch": 1.0252470341469986, "grad_norm": 0.765625, "learning_rate": 1.5561759939434818e-05, "loss": 1.0713, "mean_token_accuracy": 0.7050989974290133, "num_tokens": 249418923.0, "step": 3330 }, { "entropy": 1.0916719660162926, "epoch": 1.0267864874486448, "grad_norm": 0.74609375, "learning_rate": 1.554829457936889e-05, "loss": 1.1016, "mean_token_accuracy": 0.7027929250150919, "num_tokens": 249786573.0, "step": 3335 }, { "entropy": 1.0770644983276725, "epoch": 1.0283259407502912, "grad_norm": 0.72265625, "learning_rate": 1.553481466954724e-05, "loss": 1.0545, "mean_token_accuracy": 0.7072896599769593, "num_tokens": 250150055.0, "step": 3340 }, { "entropy": 1.0874699326232076, "epoch": 1.0298653940519373, "grad_norm": 0.75390625, "learning_rate": 1.5521320245319364e-05, "loss": 1.0778, "mean_token_accuracy": 0.7057900652289391, "num_tokens": 250528230.0, "step": 3345 }, { "entropy": 1.1083404203876852, "epoch": 1.0314048473535835, "grad_norm": 0.7265625, "learning_rate": 1.5507811342072807e-05, "loss": 1.0947, "mean_token_accuracy": 0.7005495946854353, "num_tokens": 250897457.0, "step": 3350 }, { "entropy": 1.0969204226508737, "epoch": 1.03294430065523, "grad_norm": 0.73828125, "learning_rate": 1.5494287995233107e-05, "loss": 1.0896, "mean_token_accuracy": 0.7037246078252792, "num_tokens": 251268849.0, "step": 3355 }, { "entropy": 1.1020029282197357, "epoch": 1.034483753956876, "grad_norm": 0.7265625, "learning_rate": 1.5480750240263653e-05, "loss": 1.101, "mean_token_accuracy": 0.7017880592495203, "num_tokens": 251649825.0, "step": 3360 }, { "entropy": 1.0707179462537169, "epoch": 1.0360232072585223, "grad_norm": 0.71484375, "learning_rate": 1.5467198112665632e-05, "loss": 1.057, "mean_token_accuracy": 0.70832026489079, "num_tokens": 252017005.0, "step": 3365 }, { "entropy": 1.1088285092264414, "epoch": 1.0375626605601687, "grad_norm": 0.73046875, "learning_rate": 1.545363164797792e-05, "loss": 1.0969, "mean_token_accuracy": 0.7014712538570166, "num_tokens": 252391928.0, "step": 3370 }, { "entropy": 1.1104559611529112, "epoch": 1.0391021138618148, "grad_norm": 0.734375, "learning_rate": 1.544005088177699e-05, "loss": 1.1055, "mean_token_accuracy": 0.7030448831617833, "num_tokens": 252767948.0, "step": 3375 }, { "entropy": 1.071060193143785, "epoch": 1.040641567163461, "grad_norm": 0.703125, "learning_rate": 1.5426455849676814e-05, "loss": 1.0729, "mean_token_accuracy": 0.7063076078891755, "num_tokens": 253142814.0, "step": 3380 }, { "entropy": 1.1031985484063624, "epoch": 1.0421810204651074, "grad_norm": 0.765625, "learning_rate": 1.541284658732878e-05, "loss": 1.0926, "mean_token_accuracy": 0.7044143036007882, "num_tokens": 253492628.0, "step": 3385 }, { "entropy": 1.1096234690397977, "epoch": 1.0437204737667536, "grad_norm": 0.70703125, "learning_rate": 1.5399223130421603e-05, "loss": 1.1033, "mean_token_accuracy": 0.7006593316793441, "num_tokens": 253863343.0, "step": 3390 }, { "entropy": 1.123650367371738, "epoch": 1.0452599270683998, "grad_norm": 0.6953125, "learning_rate": 1.5385585514681193e-05, "loss": 1.1068, "mean_token_accuracy": 0.7009589888155461, "num_tokens": 254232726.0, "step": 3395 }, { "entropy": 1.068775920011103, "epoch": 1.0467993803700462, "grad_norm": 0.7265625, "learning_rate": 1.5371933775870617e-05, "loss": 1.0529, "mean_token_accuracy": 0.7107639875262975, "num_tokens": 254598584.0, "step": 3400 }, { "entropy": 1.1284779205918312, "epoch": 1.0483388336716923, "grad_norm": 0.73828125, "learning_rate": 1.5358267949789968e-05, "loss": 1.1209, "mean_token_accuracy": 0.6933364421129227, "num_tokens": 254972956.0, "step": 3405 }, { "entropy": 1.0772378951311112, "epoch": 1.0498782869733385, "grad_norm": 0.76171875, "learning_rate": 1.534458807227628e-05, "loss": 1.0632, "mean_token_accuracy": 0.7072331700474024, "num_tokens": 255343282.0, "step": 3410 }, { "entropy": 1.0695318503305316, "epoch": 1.051417740274985, "grad_norm": 0.72265625, "learning_rate": 1.5330894179203436e-05, "loss": 1.0706, "mean_token_accuracy": 0.7079185370355845, "num_tokens": 255725174.0, "step": 3415 }, { "entropy": 1.115126764588058, "epoch": 1.052957193576631, "grad_norm": 0.70703125, "learning_rate": 1.5317186306482082e-05, "loss": 1.1045, "mean_token_accuracy": 0.6999828219413757, "num_tokens": 256107670.0, "step": 3420 }, { "entropy": 1.079553702287376, "epoch": 1.0544966468782773, "grad_norm": 0.70703125, "learning_rate": 1.5303464490059506e-05, "loss": 1.0608, "mean_token_accuracy": 0.705764663591981, "num_tokens": 256478764.0, "step": 3425 }, { "entropy": 1.1074867418035865, "epoch": 1.0560361001799237, "grad_norm": 0.73046875, "learning_rate": 1.5289728765919575e-05, "loss": 1.1004, "mean_token_accuracy": 0.6995379611849785, "num_tokens": 256861547.0, "step": 3430 }, { "entropy": 1.0644168920814991, "epoch": 1.0575755534815698, "grad_norm": 0.76171875, "learning_rate": 1.5275979170082627e-05, "loss": 1.0493, "mean_token_accuracy": 0.7086089801043272, "num_tokens": 257233684.0, "step": 3435 }, { "entropy": 1.1241430930793286, "epoch": 1.059115006783216, "grad_norm": 0.78125, "learning_rate": 1.526221573860537e-05, "loss": 1.1199, "mean_token_accuracy": 0.6986060209572316, "num_tokens": 257593259.0, "step": 3440 }, { "entropy": 1.1017340887337923, "epoch": 1.0606544600848624, "grad_norm": 0.72265625, "learning_rate": 1.5248438507580806e-05, "loss": 1.0838, "mean_token_accuracy": 0.7036949813365936, "num_tokens": 257972827.0, "step": 3445 }, { "entropy": 1.1030063794925808, "epoch": 1.0621939133865086, "grad_norm": 0.7421875, "learning_rate": 1.5234647513138106e-05, "loss": 1.0858, "mean_token_accuracy": 0.7019711222499609, "num_tokens": 258333006.0, "step": 3450 }, { "entropy": 1.1096134843304752, "epoch": 1.0637333666881548, "grad_norm": 0.73046875, "learning_rate": 1.5220842791442558e-05, "loss": 1.1048, "mean_token_accuracy": 0.6985780593007803, "num_tokens": 258702676.0, "step": 3455 }, { "entropy": 1.0898446917533875, "epoch": 1.0652728199898012, "grad_norm": 0.73046875, "learning_rate": 1.5207024378695423e-05, "loss": 1.0804, "mean_token_accuracy": 0.7027714267373085, "num_tokens": 259081794.0, "step": 3460 }, { "entropy": 1.090567890740931, "epoch": 1.0668122732914473, "grad_norm": 0.734375, "learning_rate": 1.5193192311133884e-05, "loss": 1.0799, "mean_token_accuracy": 0.7049614746123553, "num_tokens": 259460345.0, "step": 3465 }, { "entropy": 1.1061916414648294, "epoch": 1.0683517265930935, "grad_norm": 0.6796875, "learning_rate": 1.5179346625030929e-05, "loss": 1.0817, "mean_token_accuracy": 0.6996982850134372, "num_tokens": 259848553.0, "step": 3470 }, { "entropy": 1.07463312856853, "epoch": 1.06989117989474, "grad_norm": 0.69140625, "learning_rate": 1.5165487356695247e-05, "loss": 1.0634, "mean_token_accuracy": 0.7061924941837787, "num_tokens": 260230396.0, "step": 3475 }, { "entropy": 1.1183871056884527, "epoch": 1.071430633196386, "grad_norm": 0.68359375, "learning_rate": 1.515161454247116e-05, "loss": 1.1159, "mean_token_accuracy": 0.6978505562990904, "num_tokens": 260622270.0, "step": 3480 }, { "entropy": 1.10673236399889, "epoch": 1.0729700864980325, "grad_norm": 0.71484375, "learning_rate": 1.5137728218738504e-05, "loss": 1.1018, "mean_token_accuracy": 0.6978911388665437, "num_tokens": 260994502.0, "step": 3485 }, { "entropy": 1.0810140335932374, "epoch": 1.0745095397996787, "grad_norm": 0.71484375, "learning_rate": 1.5123828421912545e-05, "loss": 1.0822, "mean_token_accuracy": 0.704467673227191, "num_tokens": 261392623.0, "step": 3490 }, { "entropy": 1.1192033480852843, "epoch": 1.0760489931013248, "grad_norm": 0.703125, "learning_rate": 1.5109915188443877e-05, "loss": 1.1124, "mean_token_accuracy": 0.6981711078435182, "num_tokens": 261772045.0, "step": 3495 }, { "entropy": 1.0997706385329367, "epoch": 1.0775884464029712, "grad_norm": 0.70703125, "learning_rate": 1.5095988554818335e-05, "loss": 1.0844, "mean_token_accuracy": 0.7032960936427116, "num_tokens": 262148618.0, "step": 3500 }, { "entropy": 1.0644664347171784, "epoch": 1.0791278997046174, "grad_norm": 0.72265625, "learning_rate": 1.5082048557556892e-05, "loss": 1.0571, "mean_token_accuracy": 0.7109281823039055, "num_tokens": 262518491.0, "step": 3505 }, { "entropy": 1.1189897157251836, "epoch": 1.0806673530062636, "grad_norm": 0.6953125, "learning_rate": 1.5068095233215569e-05, "loss": 1.1039, "mean_token_accuracy": 0.7006072781980037, "num_tokens": 262877915.0, "step": 3510 }, { "entropy": 1.0769080670550466, "epoch": 1.08220680630791, "grad_norm": 0.6796875, "learning_rate": 1.5054128618385324e-05, "loss": 1.0731, "mean_token_accuracy": 0.7063977219164371, "num_tokens": 263255026.0, "step": 3515 }, { "entropy": 1.1102627951651811, "epoch": 1.0837462596095562, "grad_norm": 0.71484375, "learning_rate": 1.5040148749691983e-05, "loss": 1.1111, "mean_token_accuracy": 0.699586209654808, "num_tokens": 263655337.0, "step": 3520 }, { "entropy": 1.1181556399911643, "epoch": 1.0852857129112023, "grad_norm": 0.76171875, "learning_rate": 1.5026155663796123e-05, "loss": 1.1126, "mean_token_accuracy": 0.7016866445541382, "num_tokens": 264031676.0, "step": 3525 }, { "entropy": 1.12592663615942, "epoch": 1.0868251662128487, "grad_norm": 0.71875, "learning_rate": 1.5012149397392977e-05, "loss": 1.1157, "mean_token_accuracy": 0.6999137448146939, "num_tokens": 264421610.0, "step": 3530 }, { "entropy": 1.0964605376124381, "epoch": 1.088364619514495, "grad_norm": 0.71484375, "learning_rate": 1.4998129987212344e-05, "loss": 1.0927, "mean_token_accuracy": 0.7018980991095305, "num_tokens": 264795627.0, "step": 3535 }, { "entropy": 1.0974158430472016, "epoch": 1.089904072816141, "grad_norm": 0.71484375, "learning_rate": 1.4984097470018496e-05, "loss": 1.1027, "mean_token_accuracy": 0.6999371856451034, "num_tokens": 265170809.0, "step": 3540 }, { "entropy": 1.0960556104779244, "epoch": 1.0914435261177875, "grad_norm": 0.7421875, "learning_rate": 1.4970051882610073e-05, "loss": 1.0865, "mean_token_accuracy": 0.7036111738532782, "num_tokens": 265551705.0, "step": 3545 }, { "entropy": 1.0820874767377973, "epoch": 1.0929829794194337, "grad_norm": 0.74609375, "learning_rate": 1.4955993261819988e-05, "loss": 1.0914, "mean_token_accuracy": 0.70390057079494, "num_tokens": 265916997.0, "step": 3550 }, { "entropy": 1.0396881414577366, "epoch": 1.0945224327210799, "grad_norm": 0.71484375, "learning_rate": 1.4941921644515338e-05, "loss": 1.0376, "mean_token_accuracy": 0.7147219311445951, "num_tokens": 266290736.0, "step": 3555 }, { "entropy": 1.0917097030207514, "epoch": 1.0960618860227263, "grad_norm": 0.6875, "learning_rate": 1.4927837067597301e-05, "loss": 1.0735, "mean_token_accuracy": 0.7030528210103512, "num_tokens": 266675917.0, "step": 3560 }, { "entropy": 1.0518924606963993, "epoch": 1.0976013393243724, "grad_norm": 0.6953125, "learning_rate": 1.4913739568001034e-05, "loss": 1.0392, "mean_token_accuracy": 0.7105511274188757, "num_tokens": 267043257.0, "step": 3565 }, { "entropy": 1.0787627583369612, "epoch": 1.0991407926260186, "grad_norm": 0.7265625, "learning_rate": 1.4899629182695587e-05, "loss": 1.0656, "mean_token_accuracy": 0.7066638015210629, "num_tokens": 267413448.0, "step": 3570 }, { "entropy": 1.1016970597207547, "epoch": 1.100680245927665, "grad_norm": 0.7421875, "learning_rate": 1.4885505948683801e-05, "loss": 1.0929, "mean_token_accuracy": 0.7007608834654093, "num_tokens": 267785654.0, "step": 3575 }, { "entropy": 1.1083873145282268, "epoch": 1.1022196992293112, "grad_norm": 0.71484375, "learning_rate": 1.4871369903002211e-05, "loss": 1.0932, "mean_token_accuracy": 0.7019945353269577, "num_tokens": 268146865.0, "step": 3580 }, { "entropy": 1.134457977488637, "epoch": 1.1037591525309574, "grad_norm": 0.734375, "learning_rate": 1.485722108272095e-05, "loss": 1.1346, "mean_token_accuracy": 0.6938718508929014, "num_tokens": 268524381.0, "step": 3585 }, { "entropy": 1.0996076967567205, "epoch": 1.1052986058326038, "grad_norm": 0.73828125, "learning_rate": 1.4843059524943644e-05, "loss": 1.0886, "mean_token_accuracy": 0.7024534575641155, "num_tokens": 268884631.0, "step": 3590 }, { "entropy": 1.105134224332869, "epoch": 1.10683805913425, "grad_norm": 0.7578125, "learning_rate": 1.4828885266807335e-05, "loss": 1.0943, "mean_token_accuracy": 0.7044342806562781, "num_tokens": 269265070.0, "step": 3595 }, { "entropy": 1.087464764341712, "epoch": 1.108377512435896, "grad_norm": 0.66796875, "learning_rate": 1.4814698345482359e-05, "loss": 1.0661, "mean_token_accuracy": 0.7041431359946728, "num_tokens": 269625648.0, "step": 3600 }, { "entropy": 1.0556759916245937, "epoch": 1.1099169657375425, "grad_norm": 0.70703125, "learning_rate": 1.4800498798172263e-05, "loss": 1.0575, "mean_token_accuracy": 0.7074072834104299, "num_tokens": 270000439.0, "step": 3605 }, { "entropy": 1.104642354696989, "epoch": 1.1114564190391887, "grad_norm": 0.703125, "learning_rate": 1.4786286662113704e-05, "loss": 1.093, "mean_token_accuracy": 0.70103506334126, "num_tokens": 270382298.0, "step": 3610 }, { "entropy": 1.0876236338168384, "epoch": 1.1129958723408349, "grad_norm": 0.74609375, "learning_rate": 1.4772061974576353e-05, "loss": 1.078, "mean_token_accuracy": 0.7041713990271091, "num_tokens": 270758001.0, "step": 3615 }, { "entropy": 1.1207205276936292, "epoch": 1.1145353256424813, "grad_norm": 0.7265625, "learning_rate": 1.4757824772862797e-05, "loss": 1.1103, "mean_token_accuracy": 0.6994964867830277, "num_tokens": 271125595.0, "step": 3620 }, { "entropy": 1.1021299615502358, "epoch": 1.1160747789441274, "grad_norm": 0.73046875, "learning_rate": 1.474357509430843e-05, "loss": 1.0981, "mean_token_accuracy": 0.7028808105736971, "num_tokens": 271487570.0, "step": 3625 }, { "entropy": 1.0768470207229257, "epoch": 1.1176142322457738, "grad_norm": 0.7109375, "learning_rate": 1.4729312976281385e-05, "loss": 1.0715, "mean_token_accuracy": 0.7054811583831906, "num_tokens": 271846926.0, "step": 3630 }, { "entropy": 1.0420935848727821, "epoch": 1.11915368554742, "grad_norm": 0.671875, "learning_rate": 1.4715038456182394e-05, "loss": 1.0222, "mean_token_accuracy": 0.7153880059719085, "num_tokens": 272211353.0, "step": 3635 }, { "entropy": 1.0648265935480594, "epoch": 1.1206931388490662, "grad_norm": 0.72265625, "learning_rate": 1.4700751571444724e-05, "loss": 1.0545, "mean_token_accuracy": 0.7072536498308182, "num_tokens": 272588511.0, "step": 3640 }, { "entropy": 1.1259229142218827, "epoch": 1.1222325921507124, "grad_norm": 0.72265625, "learning_rate": 1.4686452359534067e-05, "loss": 1.123, "mean_token_accuracy": 0.6968998841941356, "num_tokens": 272961381.0, "step": 3645 }, { "entropy": 1.1046750681474804, "epoch": 1.1237720454523588, "grad_norm": 0.7109375, "learning_rate": 1.4672140857948436e-05, "loss": 1.0893, "mean_token_accuracy": 0.7021125748753547, "num_tokens": 273333979.0, "step": 3650 }, { "entropy": 1.0746611554175616, "epoch": 1.125311498754005, "grad_norm": 0.73046875, "learning_rate": 1.4657817104218075e-05, "loss": 1.0637, "mean_token_accuracy": 0.7094436049461365, "num_tokens": 273723286.0, "step": 3655 }, { "entropy": 1.0648497132584454, "epoch": 1.1268509520556513, "grad_norm": 0.703125, "learning_rate": 1.4643481135905367e-05, "loss": 1.055, "mean_token_accuracy": 0.7079874064773322, "num_tokens": 274117421.0, "step": 3660 }, { "entropy": 1.1093654725700617, "epoch": 1.1283904053572975, "grad_norm": 0.69140625, "learning_rate": 1.4629132990604706e-05, "loss": 1.0893, "mean_token_accuracy": 0.7024959847331047, "num_tokens": 274473536.0, "step": 3665 }, { "entropy": 1.072011518292129, "epoch": 1.1299298586589437, "grad_norm": 0.74609375, "learning_rate": 1.4614772705942437e-05, "loss": 1.0744, "mean_token_accuracy": 0.7079994067549705, "num_tokens": 274840225.0, "step": 3670 }, { "entropy": 1.071100211329758, "epoch": 1.13146931196059, "grad_norm": 0.7734375, "learning_rate": 1.4600400319576734e-05, "loss": 1.067, "mean_token_accuracy": 0.7057722929865122, "num_tokens": 275213917.0, "step": 3675 }, { "entropy": 1.09051328971982, "epoch": 1.1330087652622363, "grad_norm": 0.7109375, "learning_rate": 1.4586015869197499e-05, "loss": 1.0807, "mean_token_accuracy": 0.705567728728056, "num_tokens": 275579038.0, "step": 3680 }, { "entropy": 1.077046674862504, "epoch": 1.1345482185638824, "grad_norm": 0.703125, "learning_rate": 1.4571619392526279e-05, "loss": 1.0648, "mean_token_accuracy": 0.7068696942180395, "num_tokens": 275959239.0, "step": 3685 }, { "entropy": 1.0694725250825285, "epoch": 1.1360876718655288, "grad_norm": 0.69921875, "learning_rate": 1.4557210927316157e-05, "loss": 1.0616, "mean_token_accuracy": 0.7077067773789167, "num_tokens": 276330200.0, "step": 3690 }, { "entropy": 1.1030939321964979, "epoch": 1.137627125167175, "grad_norm": 0.73828125, "learning_rate": 1.4542790511351652e-05, "loss": 1.0958, "mean_token_accuracy": 0.7006549630314112, "num_tokens": 276694719.0, "step": 3695 }, { "entropy": 1.0825718816369772, "epoch": 1.1391665784688212, "grad_norm": 0.6953125, "learning_rate": 1.4528358182448621e-05, "loss": 1.0753, "mean_token_accuracy": 0.7074236158281565, "num_tokens": 277065169.0, "step": 3700 }, { "entropy": 1.08927030172199, "epoch": 1.1407060317704676, "grad_norm": 0.70703125, "learning_rate": 1.4513913978454169e-05, "loss": 1.0889, "mean_token_accuracy": 0.7043962199240923, "num_tokens": 277440519.0, "step": 3705 }, { "entropy": 1.09373946338892, "epoch": 1.1422454850721138, "grad_norm": 0.72265625, "learning_rate": 1.4499457937246537e-05, "loss": 1.0934, "mean_token_accuracy": 0.7008316054940223, "num_tokens": 277826775.0, "step": 3710 }, { "entropy": 1.0762307036668062, "epoch": 1.14378493837376, "grad_norm": 0.7265625, "learning_rate": 1.4484990096735002e-05, "loss": 1.0639, "mean_token_accuracy": 0.7074637677520513, "num_tokens": 278192561.0, "step": 3715 }, { "entropy": 1.0538242898881436, "epoch": 1.1453243916754063, "grad_norm": 0.71484375, "learning_rate": 1.4470510494859796e-05, "loss": 1.0455, "mean_token_accuracy": 0.7116703744977713, "num_tokens": 278555749.0, "step": 3720 }, { "entropy": 1.102267589047551, "epoch": 1.1468638449770525, "grad_norm": 0.71484375, "learning_rate": 1.445601916959198e-05, "loss": 1.0909, "mean_token_accuracy": 0.7021027714014053, "num_tokens": 278927881.0, "step": 3725 }, { "entropy": 1.0908799674361944, "epoch": 1.1484032982786987, "grad_norm": 0.70703125, "learning_rate": 1.4441516158933374e-05, "loss": 1.0848, "mean_token_accuracy": 0.7060389311984181, "num_tokens": 279290842.0, "step": 3730 }, { "entropy": 1.0705156188458205, "epoch": 1.149942751580345, "grad_norm": 0.69140625, "learning_rate": 1.4427001500916422e-05, "loss": 1.0644, "mean_token_accuracy": 0.7053807284682989, "num_tokens": 279675661.0, "step": 3735 }, { "entropy": 1.0985583700239658, "epoch": 1.1514822048819913, "grad_norm": 0.7421875, "learning_rate": 1.441247523360413e-05, "loss": 1.0854, "mean_token_accuracy": 0.7020877465605736, "num_tokens": 280056192.0, "step": 3740 }, { "entropy": 1.110937137156725, "epoch": 1.1530216581836374, "grad_norm": 0.703125, "learning_rate": 1.439793739508994e-05, "loss": 1.091, "mean_token_accuracy": 0.7005519773811102, "num_tokens": 280439934.0, "step": 3745 }, { "entropy": 1.0774476202204823, "epoch": 1.1545611114852838, "grad_norm": 0.73046875, "learning_rate": 1.4383388023497635e-05, "loss": 1.0771, "mean_token_accuracy": 0.7086040396243334, "num_tokens": 280809278.0, "step": 3750 }, { "entropy": 1.0923065768554807, "epoch": 1.15610056478693, "grad_norm": 0.76953125, "learning_rate": 1.436882715698125e-05, "loss": 1.0936, "mean_token_accuracy": 0.7011645477265119, "num_tokens": 281185731.0, "step": 3755 }, { "entropy": 1.0968502664938569, "epoch": 1.1576400180885762, "grad_norm": 0.6875, "learning_rate": 1.4354254833724958e-05, "loss": 1.0872, "mean_token_accuracy": 0.7064242403954267, "num_tokens": 281544422.0, "step": 3760 }, { "entropy": 1.10315215382725, "epoch": 1.1591794713902226, "grad_norm": 0.6875, "learning_rate": 1.433967109194298e-05, "loss": 1.0876, "mean_token_accuracy": 0.7011684492230416, "num_tokens": 281917408.0, "step": 3765 }, { "entropy": 1.0998672913759946, "epoch": 1.1607189246918688, "grad_norm": 0.69921875, "learning_rate": 1.4325075969879473e-05, "loss": 1.0934, "mean_token_accuracy": 0.703576971963048, "num_tokens": 282298921.0, "step": 3770 }, { "entropy": 1.1076439332216979, "epoch": 1.1622583779935152, "grad_norm": 0.7109375, "learning_rate": 1.4310469505808447e-05, "loss": 1.1093, "mean_token_accuracy": 0.7008686907589435, "num_tokens": 282668103.0, "step": 3775 }, { "entropy": 1.0751024398952722, "epoch": 1.1637978312951613, "grad_norm": 0.71484375, "learning_rate": 1.4295851738033655e-05, "loss": 1.0533, "mean_token_accuracy": 0.708766408637166, "num_tokens": 283041394.0, "step": 3780 }, { "entropy": 1.125790061429143, "epoch": 1.1653372845968075, "grad_norm": 0.77734375, "learning_rate": 1.428122270488848e-05, "loss": 1.1117, "mean_token_accuracy": 0.6996684454381465, "num_tokens": 283407969.0, "step": 3785 }, { "entropy": 1.1088317811489106, "epoch": 1.1668767378984537, "grad_norm": 0.671875, "learning_rate": 1.4266582444735866e-05, "loss": 1.0988, "mean_token_accuracy": 0.7021414436399936, "num_tokens": 283790471.0, "step": 3790 }, { "entropy": 1.1067815016955138, "epoch": 1.1684161912001, "grad_norm": 0.71875, "learning_rate": 1.4251930995968179e-05, "loss": 1.103, "mean_token_accuracy": 0.699557737633586, "num_tokens": 284162486.0, "step": 3795 }, { "entropy": 1.1341670166701079, "epoch": 1.1699556445017463, "grad_norm": 0.70703125, "learning_rate": 1.4237268397007145e-05, "loss": 1.1297, "mean_token_accuracy": 0.6976292546838522, "num_tokens": 284551266.0, "step": 3800 }, { "entropy": 1.1079873451963067, "epoch": 1.1714950978033927, "grad_norm": 0.6953125, "learning_rate": 1.4222594686303707e-05, "loss": 1.0834, "mean_token_accuracy": 0.7043620748445392, "num_tokens": 284928528.0, "step": 3805 }, { "entropy": 1.1108773406594992, "epoch": 1.1730345511050388, "grad_norm": 0.7578125, "learning_rate": 1.4207909902337978e-05, "loss": 1.1072, "mean_token_accuracy": 0.7001920165494084, "num_tokens": 285294660.0, "step": 3810 }, { "entropy": 1.062958618067205, "epoch": 1.174574004406685, "grad_norm": 0.6875, "learning_rate": 1.4193214083619075e-05, "loss": 1.0593, "mean_token_accuracy": 0.7087547797709703, "num_tokens": 285684946.0, "step": 3815 }, { "entropy": 1.1068306148052216, "epoch": 1.1761134577083314, "grad_norm": 0.734375, "learning_rate": 1.4178507268685082e-05, "loss": 1.107, "mean_token_accuracy": 0.7006458751857281, "num_tokens": 286052105.0, "step": 3820 }, { "entropy": 1.1562053855508565, "epoch": 1.1776529110099776, "grad_norm": 0.74609375, "learning_rate": 1.4163789496102902e-05, "loss": 1.162, "mean_token_accuracy": 0.6939568098634481, "num_tokens": 286423234.0, "step": 3825 }, { "entropy": 1.091459297388792, "epoch": 1.1791923643116238, "grad_norm": 0.703125, "learning_rate": 1.4149060804468178e-05, "loss": 1.0842, "mean_token_accuracy": 0.7039418306201697, "num_tokens": 286800888.0, "step": 3830 }, { "entropy": 1.0655298441648484, "epoch": 1.1807318176132702, "grad_norm": 0.70703125, "learning_rate": 1.4134321232405185e-05, "loss": 1.0594, "mean_token_accuracy": 0.7100500397384166, "num_tokens": 287181273.0, "step": 3835 }, { "entropy": 1.109318332746625, "epoch": 1.1822712709149164, "grad_norm": 0.70703125, "learning_rate": 1.4119570818566735e-05, "loss": 1.0964, "mean_token_accuracy": 0.699808219820261, "num_tokens": 287573395.0, "step": 3840 }, { "entropy": 1.0877777617424726, "epoch": 1.1838107242165625, "grad_norm": 0.70703125, "learning_rate": 1.4104809601634069e-05, "loss": 1.0803, "mean_token_accuracy": 0.7033943865448237, "num_tokens": 287952267.0, "step": 3845 }, { "entropy": 1.100570411980152, "epoch": 1.185350177518209, "grad_norm": 0.75, "learning_rate": 1.4090037620316752e-05, "loss": 1.0977, "mean_token_accuracy": 0.7031412627547979, "num_tokens": 288327604.0, "step": 3850 }, { "entropy": 1.0824162557721138, "epoch": 1.186889630819855, "grad_norm": 0.7578125, "learning_rate": 1.407525491335259e-05, "loss": 1.0867, "mean_token_accuracy": 0.7073274951428175, "num_tokens": 288699268.0, "step": 3855 }, { "entropy": 1.0807831861078738, "epoch": 1.1884290841215013, "grad_norm": 0.69140625, "learning_rate": 1.4060461519507506e-05, "loss": 1.0675, "mean_token_accuracy": 0.7040595654398203, "num_tokens": 289088327.0, "step": 3860 }, { "entropy": 1.0778952922672034, "epoch": 1.1899685374231477, "grad_norm": 0.6953125, "learning_rate": 1.404565747757545e-05, "loss": 1.0807, "mean_token_accuracy": 0.7046718124300242, "num_tokens": 289460784.0, "step": 3865 }, { "entropy": 1.105709740705788, "epoch": 1.1915079907247939, "grad_norm": 0.765625, "learning_rate": 1.4030842826378297e-05, "loss": 1.0985, "mean_token_accuracy": 0.6993788905441761, "num_tokens": 289836163.0, "step": 3870 }, { "entropy": 1.0828698825091123, "epoch": 1.19304744402644, "grad_norm": 0.7265625, "learning_rate": 1.4016017604765742e-05, "loss": 1.0674, "mean_token_accuracy": 0.7059365000575781, "num_tokens": 290212352.0, "step": 3875 }, { "entropy": 1.1272259410470724, "epoch": 1.1945868973280864, "grad_norm": 0.6875, "learning_rate": 1.4001181851615203e-05, "loss": 1.1078, "mean_token_accuracy": 0.6969783172011376, "num_tokens": 290595707.0, "step": 3880 }, { "entropy": 1.1166004659608006, "epoch": 1.1961263506297326, "grad_norm": 0.76171875, "learning_rate": 1.3986335605831707e-05, "loss": 1.1046, "mean_token_accuracy": 0.7005794644355774, "num_tokens": 290950788.0, "step": 3885 }, { "entropy": 1.10059260930866, "epoch": 1.1976658039313788, "grad_norm": 0.72265625, "learning_rate": 1.3971478906347806e-05, "loss": 1.0963, "mean_token_accuracy": 0.703722882270813, "num_tokens": 291324381.0, "step": 3890 }, { "entropy": 1.1057688169181348, "epoch": 1.1992052572330252, "grad_norm": 0.7734375, "learning_rate": 1.3956611792123469e-05, "loss": 1.1043, "mean_token_accuracy": 0.7007663905620575, "num_tokens": 291696879.0, "step": 3895 }, { "entropy": 1.0631301939487456, "epoch": 1.2007447105346714, "grad_norm": 0.703125, "learning_rate": 1.394173430214596e-05, "loss": 1.0527, "mean_token_accuracy": 0.7092026572674512, "num_tokens": 292061900.0, "step": 3900 }, { "entropy": 1.0981714664027096, "epoch": 1.2022841638363175, "grad_norm": 0.6953125, "learning_rate": 1.3926846475429767e-05, "loss": 1.097, "mean_token_accuracy": 0.7036932848393918, "num_tokens": 292440222.0, "step": 3905 }, { "entropy": 1.0864885102957487, "epoch": 1.203823617137964, "grad_norm": 0.73046875, "learning_rate": 1.3911948351016475e-05, "loss": 1.0723, "mean_token_accuracy": 0.7052678003907203, "num_tokens": 292834119.0, "step": 3910 }, { "entropy": 1.1018056087195873, "epoch": 1.20536307043961, "grad_norm": 0.6953125, "learning_rate": 1.3897039967974688e-05, "loss": 1.1052, "mean_token_accuracy": 0.6991815757006407, "num_tokens": 293209771.0, "step": 3915 }, { "entropy": 1.10480572078377, "epoch": 1.2069025237412565, "grad_norm": 0.70703125, "learning_rate": 1.3882121365399894e-05, "loss": 1.1075, "mean_token_accuracy": 0.6998530514538288, "num_tokens": 293595862.0, "step": 3920 }, { "entropy": 1.0803724970668553, "epoch": 1.2084419770429027, "grad_norm": 0.69140625, "learning_rate": 1.3867192582414393e-05, "loss": 1.0597, "mean_token_accuracy": 0.7073673088103533, "num_tokens": 293963946.0, "step": 3925 }, { "entropy": 1.117409136891365, "epoch": 1.2099814303445489, "grad_norm": 0.77734375, "learning_rate": 1.3852253658167178e-05, "loss": 1.1043, "mean_token_accuracy": 0.6973974499851465, "num_tokens": 294339121.0, "step": 3930 }, { "entropy": 1.1202900214120746, "epoch": 1.211520883646195, "grad_norm": 0.68359375, "learning_rate": 1.3837304631833832e-05, "loss": 1.1237, "mean_token_accuracy": 0.6978885032236576, "num_tokens": 294715492.0, "step": 3935 }, { "entropy": 1.072257279790938, "epoch": 1.2130603369478414, "grad_norm": 0.75390625, "learning_rate": 1.3822345542616443e-05, "loss": 1.0769, "mean_token_accuracy": 0.7074934743344784, "num_tokens": 295073986.0, "step": 3940 }, { "entropy": 1.1001626962795854, "epoch": 1.2145997902494876, "grad_norm": 0.6875, "learning_rate": 1.3807376429743467e-05, "loss": 1.0944, "mean_token_accuracy": 0.7036080248653889, "num_tokens": 295449555.0, "step": 3945 }, { "entropy": 1.088081386126578, "epoch": 1.216139243551134, "grad_norm": 0.72265625, "learning_rate": 1.3792397332469667e-05, "loss": 1.0871, "mean_token_accuracy": 0.7042498320341111, "num_tokens": 295821464.0, "step": 3950 }, { "entropy": 1.1149036642163992, "epoch": 1.2176786968527802, "grad_norm": 0.7265625, "learning_rate": 1.377740829007597e-05, "loss": 1.1149, "mean_token_accuracy": 0.7015709541738033, "num_tokens": 296187517.0, "step": 3955 }, { "entropy": 1.0869786012917757, "epoch": 1.2192181501544264, "grad_norm": 0.73046875, "learning_rate": 1.3762409341869404e-05, "loss": 1.0821, "mean_token_accuracy": 0.7066392619162798, "num_tokens": 296562886.0, "step": 3960 }, { "entropy": 1.108170660212636, "epoch": 1.2207576034560725, "grad_norm": 0.69921875, "learning_rate": 1.3747400527182952e-05, "loss": 1.0985, "mean_token_accuracy": 0.7013059981167317, "num_tokens": 296936231.0, "step": 3965 }, { "entropy": 1.0889248762279748, "epoch": 1.222297056757719, "grad_norm": 0.72265625, "learning_rate": 1.3732381885375488e-05, "loss": 1.0764, "mean_token_accuracy": 0.7024991292506456, "num_tokens": 297307474.0, "step": 3970 }, { "entropy": 1.1260383136570453, "epoch": 1.2238365100593651, "grad_norm": 0.71875, "learning_rate": 1.3717353455831643e-05, "loss": 1.1166, "mean_token_accuracy": 0.6974424548447132, "num_tokens": 297683247.0, "step": 3975 }, { "entropy": 1.0552282366901635, "epoch": 1.2253759633610115, "grad_norm": 0.71875, "learning_rate": 1.3702315277961724e-05, "loss": 1.0525, "mean_token_accuracy": 0.7067247483879328, "num_tokens": 298060015.0, "step": 3980 }, { "entropy": 1.0938646005466581, "epoch": 1.2269154166626577, "grad_norm": 0.77734375, "learning_rate": 1.3687267391201604e-05, "loss": 1.0785, "mean_token_accuracy": 0.7049194592982531, "num_tokens": 298425827.0, "step": 3985 }, { "entropy": 1.0813276052474976, "epoch": 1.2284548699643039, "grad_norm": 0.76171875, "learning_rate": 1.3672209835012602e-05, "loss": 1.0754, "mean_token_accuracy": 0.7052431304007769, "num_tokens": 298796982.0, "step": 3990 }, { "entropy": 1.1203918613493442, "epoch": 1.2299943232659503, "grad_norm": 0.6953125, "learning_rate": 1.3657142648881414e-05, "loss": 1.1066, "mean_token_accuracy": 0.7010459274053573, "num_tokens": 299172779.0, "step": 3995 }, { "entropy": 1.0993194514885545, "epoch": 1.2315337765675964, "grad_norm": 0.73828125, "learning_rate": 1.3642065872319971e-05, "loss": 1.0942, "mean_token_accuracy": 0.7016201814636588, "num_tokens": 299549995.0, "step": 4000 }, { "entropy": 1.0879132468253374, "epoch": 1.2330732298692426, "grad_norm": 0.69140625, "learning_rate": 1.3626979544865369e-05, "loss": 1.0739, "mean_token_accuracy": 0.7027346216142177, "num_tokens": 299924096.0, "step": 4005 }, { "entropy": 1.0912355059757828, "epoch": 1.234612683170889, "grad_norm": 0.70703125, "learning_rate": 1.3611883706079735e-05, "loss": 1.0701, "mean_token_accuracy": 0.7062455844134092, "num_tokens": 300293703.0, "step": 4010 }, { "entropy": 1.0860985442996025, "epoch": 1.2361521364725352, "grad_norm": 0.67578125, "learning_rate": 1.3596778395550154e-05, "loss": 1.0879, "mean_token_accuracy": 0.7033099625259638, "num_tokens": 300667916.0, "step": 4015 }, { "entropy": 1.10459204018116, "epoch": 1.2376915897741814, "grad_norm": 0.703125, "learning_rate": 1.3581663652888536e-05, "loss": 1.0968, "mean_token_accuracy": 0.702700025960803, "num_tokens": 301040155.0, "step": 4020 }, { "entropy": 1.0972048163414, "epoch": 1.2392310430758278, "grad_norm": 0.72265625, "learning_rate": 1.3566539517731536e-05, "loss": 1.0859, "mean_token_accuracy": 0.7038055300712586, "num_tokens": 301428658.0, "step": 4025 }, { "entropy": 1.1335016749799252, "epoch": 1.240770496377474, "grad_norm": 0.7109375, "learning_rate": 1.3551406029740435e-05, "loss": 1.1263, "mean_token_accuracy": 0.6956704515963793, "num_tokens": 301815674.0, "step": 4030 }, { "entropy": 1.0878054179251193, "epoch": 1.2423099496791201, "grad_norm": 0.73046875, "learning_rate": 1.3536263228601036e-05, "loss": 1.0822, "mean_token_accuracy": 0.7042242761701345, "num_tokens": 302184720.0, "step": 4035 }, { "entropy": 1.1134215828031302, "epoch": 1.2438494029807665, "grad_norm": 0.72265625, "learning_rate": 1.3521111154023573e-05, "loss": 1.0983, "mean_token_accuracy": 0.6978894144296646, "num_tokens": 302569833.0, "step": 4040 }, { "entropy": 1.1078709946945309, "epoch": 1.2453888562824127, "grad_norm": 0.71484375, "learning_rate": 1.3505949845742599e-05, "loss": 1.1053, "mean_token_accuracy": 0.7004428334534168, "num_tokens": 302953234.0, "step": 4045 }, { "entropy": 1.101970660686493, "epoch": 1.2469283095840589, "grad_norm": 0.71875, "learning_rate": 1.349077934351687e-05, "loss": 1.1017, "mean_token_accuracy": 0.703122254833579, "num_tokens": 303323574.0, "step": 4050 }, { "entropy": 1.0964781964197754, "epoch": 1.2484677628857053, "grad_norm": 0.73046875, "learning_rate": 1.3475599687129265e-05, "loss": 1.0883, "mean_token_accuracy": 0.7021753527224064, "num_tokens": 303694386.0, "step": 4055 }, { "entropy": 1.1142654318362475, "epoch": 1.2500072161873514, "grad_norm": 0.70703125, "learning_rate": 1.3460410916386661e-05, "loss": 1.097, "mean_token_accuracy": 0.7025595799088478, "num_tokens": 304057550.0, "step": 4060 }, { "entropy": 1.0823018303140999, "epoch": 1.2515466694889978, "grad_norm": 0.7109375, "learning_rate": 1.3445213071119841e-05, "loss": 1.0755, "mean_token_accuracy": 0.7057725608348846, "num_tokens": 304428244.0, "step": 4065 }, { "entropy": 1.0827654430642724, "epoch": 1.253086122790644, "grad_norm": 0.7265625, "learning_rate": 1.3430006191183378e-05, "loss": 1.0718, "mean_token_accuracy": 0.7041387222707272, "num_tokens": 304795321.0, "step": 4070 }, { "entropy": 1.087675553932786, "epoch": 1.2546255760922902, "grad_norm": 0.73828125, "learning_rate": 1.3414790316455546e-05, "loss": 1.0755, "mean_token_accuracy": 0.7059319779276848, "num_tokens": 305155851.0, "step": 4075 }, { "entropy": 1.1189695112407207, "epoch": 1.2561650293939364, "grad_norm": 0.69921875, "learning_rate": 1.33995654868382e-05, "loss": 1.1109, "mean_token_accuracy": 0.697902848571539, "num_tokens": 305529834.0, "step": 4080 }, { "entropy": 1.130313978344202, "epoch": 1.2577044826955828, "grad_norm": 0.75390625, "learning_rate": 1.338433174225668e-05, "loss": 1.1234, "mean_token_accuracy": 0.6920732576400042, "num_tokens": 305901433.0, "step": 4085 }, { "entropy": 1.1158683093264699, "epoch": 1.259243935997229, "grad_norm": 0.7890625, "learning_rate": 1.336908912265971e-05, "loss": 1.1119, "mean_token_accuracy": 0.6996138449758291, "num_tokens": 306256021.0, "step": 4090 }, { "entropy": 1.0976204611361027, "epoch": 1.2607833892988753, "grad_norm": 0.72265625, "learning_rate": 1.335383766801928e-05, "loss": 1.0974, "mean_token_accuracy": 0.7025588437914848, "num_tokens": 306638385.0, "step": 4095 }, { "entropy": 1.0980824884027243, "epoch": 1.2623228426005215, "grad_norm": 0.69140625, "learning_rate": 1.3338577418330552e-05, "loss": 1.097, "mean_token_accuracy": 0.7022494181990624, "num_tokens": 307020861.0, "step": 4100 }, { "entropy": 1.1165331147611142, "epoch": 1.2638622959021677, "grad_norm": 0.72265625, "learning_rate": 1.3323308413611748e-05, "loss": 1.1204, "mean_token_accuracy": 0.6978170141577721, "num_tokens": 307402322.0, "step": 4105 }, { "entropy": 1.0698299165815115, "epoch": 1.2654017492038139, "grad_norm": 0.7109375, "learning_rate": 1.330803069390406e-05, "loss": 1.0616, "mean_token_accuracy": 0.7063970111310482, "num_tokens": 307767960.0, "step": 4110 }, { "entropy": 1.1018039194867015, "epoch": 1.2669412025054603, "grad_norm": 0.7109375, "learning_rate": 1.329274429927152e-05, "loss": 1.088, "mean_token_accuracy": 0.7032159678637981, "num_tokens": 308132035.0, "step": 4115 }, { "entropy": 1.068551710061729, "epoch": 1.2684806558071064, "grad_norm": 0.6796875, "learning_rate": 1.3277449269800924e-05, "loss": 1.0623, "mean_token_accuracy": 0.7077741719782352, "num_tokens": 308513720.0, "step": 4120 }, { "entropy": 1.075303773023188, "epoch": 1.2700201091087528, "grad_norm": 0.7421875, "learning_rate": 1.3262145645601693e-05, "loss": 1.0695, "mean_token_accuracy": 0.705178477242589, "num_tokens": 308892864.0, "step": 4125 }, { "entropy": 1.0696294579654932, "epoch": 1.271559562410399, "grad_norm": 0.7265625, "learning_rate": 1.3246833466805807e-05, "loss": 1.0606, "mean_token_accuracy": 0.7081389222294092, "num_tokens": 309255759.0, "step": 4130 }, { "entropy": 1.1095837157219648, "epoch": 1.2730990157120452, "grad_norm": 0.73046875, "learning_rate": 1.3231512773567667e-05, "loss": 1.0926, "mean_token_accuracy": 0.6996402077376842, "num_tokens": 309625858.0, "step": 4135 }, { "entropy": 1.0998979141935705, "epoch": 1.2746384690136914, "grad_norm": 0.6875, "learning_rate": 1.3216183606064e-05, "loss": 1.0815, "mean_token_accuracy": 0.701217382773757, "num_tokens": 310016897.0, "step": 4140 }, { "entropy": 1.090337529964745, "epoch": 1.2761779223153378, "grad_norm": 0.76953125, "learning_rate": 1.320084600449377e-05, "loss": 1.0798, "mean_token_accuracy": 0.703149201348424, "num_tokens": 310379094.0, "step": 4145 }, { "entropy": 1.169959270954132, "epoch": 1.277717375616984, "grad_norm": 0.69921875, "learning_rate": 1.3185500009078038e-05, "loss": 1.166, "mean_token_accuracy": 0.6912180252373219, "num_tokens": 310755617.0, "step": 4150 }, { "entropy": 1.095761689171195, "epoch": 1.2792568289186304, "grad_norm": 0.67578125, "learning_rate": 1.3170145660059898e-05, "loss": 1.0898, "mean_token_accuracy": 0.7043176185339689, "num_tokens": 311116787.0, "step": 4155 }, { "entropy": 1.1159634843468667, "epoch": 1.2807962822202765, "grad_norm": 0.76171875, "learning_rate": 1.3154782997704336e-05, "loss": 1.1085, "mean_token_accuracy": 0.7013845149427652, "num_tokens": 311487265.0, "step": 4160 }, { "entropy": 1.1149285018444062, "epoch": 1.2823357355219227, "grad_norm": 0.69921875, "learning_rate": 1.3139412062298141e-05, "loss": 1.1026, "mean_token_accuracy": 0.700192927569151, "num_tokens": 311866005.0, "step": 4165 }, { "entropy": 1.08015791811049, "epoch": 1.283875188823569, "grad_norm": 0.734375, "learning_rate": 1.3124032894149803e-05, "loss": 1.0776, "mean_token_accuracy": 0.7082461465150118, "num_tokens": 312239762.0, "step": 4170 }, { "entropy": 1.1041171737015247, "epoch": 1.2854146421252153, "grad_norm": 0.78515625, "learning_rate": 1.3108645533589394e-05, "loss": 1.1019, "mean_token_accuracy": 0.7005550045520067, "num_tokens": 312609769.0, "step": 4175 }, { "entropy": 1.099213395267725, "epoch": 1.2869540954268615, "grad_norm": 0.72265625, "learning_rate": 1.3093250020968477e-05, "loss": 1.0992, "mean_token_accuracy": 0.7003675859421492, "num_tokens": 312982466.0, "step": 4180 }, { "entropy": 1.11904187053442, "epoch": 1.2884935487285079, "grad_norm": 0.734375, "learning_rate": 1.3077846396659986e-05, "loss": 1.1115, "mean_token_accuracy": 0.698601096123457, "num_tokens": 313351958.0, "step": 4185 }, { "entropy": 1.118068947084248, "epoch": 1.290033002030154, "grad_norm": 0.78125, "learning_rate": 1.3062434701058134e-05, "loss": 1.1143, "mean_token_accuracy": 0.6988352715969086, "num_tokens": 313731502.0, "step": 4190 }, { "entropy": 1.0864052549004555, "epoch": 1.2915724553318002, "grad_norm": 0.73828125, "learning_rate": 1.304701497457829e-05, "loss": 1.0913, "mean_token_accuracy": 0.7051464155316353, "num_tokens": 314101396.0, "step": 4195 }, { "entropy": 1.1178832422941922, "epoch": 1.2931119086334466, "grad_norm": 0.73828125, "learning_rate": 1.3031587257656892e-05, "loss": 1.1079, "mean_token_accuracy": 0.6991049367934465, "num_tokens": 314471199.0, "step": 4200 }, { "entropy": 1.0726791629567742, "epoch": 1.2946513619350928, "grad_norm": 0.703125, "learning_rate": 1.3016151590751332e-05, "loss": 1.0549, "mean_token_accuracy": 0.7091517373919487, "num_tokens": 314845420.0, "step": 4205 }, { "entropy": 1.130228528380394, "epoch": 1.2961908152367392, "grad_norm": 0.66796875, "learning_rate": 1.3000708014339842e-05, "loss": 1.1247, "mean_token_accuracy": 0.694831214658916, "num_tokens": 315245088.0, "step": 4210 }, { "entropy": 1.117298081330955, "epoch": 1.2977302685383854, "grad_norm": 0.703125, "learning_rate": 1.2985256568921404e-05, "loss": 1.1101, "mean_token_accuracy": 0.6972995031625032, "num_tokens": 315621573.0, "step": 4215 }, { "entropy": 1.1329909652471541, "epoch": 1.2992697218400315, "grad_norm": 0.6953125, "learning_rate": 1.2969797295015632e-05, "loss": 1.1142, "mean_token_accuracy": 0.6969684008508921, "num_tokens": 315994459.0, "step": 4220 }, { "entropy": 1.091454226896167, "epoch": 1.3008091751416777, "grad_norm": 0.75, "learning_rate": 1.2954330233162669e-05, "loss": 1.0852, "mean_token_accuracy": 0.7018275778740645, "num_tokens": 316363875.0, "step": 4225 }, { "entropy": 1.0521494638174773, "epoch": 1.302348628443324, "grad_norm": 0.68359375, "learning_rate": 1.2938855423923081e-05, "loss": 1.0423, "mean_token_accuracy": 0.713319156691432, "num_tokens": 316749176.0, "step": 4230 }, { "entropy": 1.1046339757740498, "epoch": 1.3038880817449703, "grad_norm": 0.70703125, "learning_rate": 1.2923372907877752e-05, "loss": 1.106, "mean_token_accuracy": 0.7031476181000471, "num_tokens": 317124450.0, "step": 4235 }, { "entropy": 1.1137266840785742, "epoch": 1.3054275350466167, "grad_norm": 0.69921875, "learning_rate": 1.2907882725627776e-05, "loss": 1.109, "mean_token_accuracy": 0.6983969565480947, "num_tokens": 317494302.0, "step": 4240 }, { "entropy": 1.1341589827090501, "epoch": 1.3069669883482629, "grad_norm": 0.7421875, "learning_rate": 1.2892384917794347e-05, "loss": 1.1172, "mean_token_accuracy": 0.6974227242171764, "num_tokens": 317863339.0, "step": 4245 }, { "entropy": 1.0884424960240722, "epoch": 1.308506441649909, "grad_norm": 0.71875, "learning_rate": 1.2876879525018664e-05, "loss": 1.073, "mean_token_accuracy": 0.7051871689036489, "num_tokens": 318249845.0, "step": 4250 }, { "entropy": 1.0661856941878796, "epoch": 1.3100458949515552, "grad_norm": 0.7109375, "learning_rate": 1.286136658796181e-05, "loss": 1.0612, "mean_token_accuracy": 0.7064540844410658, "num_tokens": 318637131.0, "step": 4255 }, { "entropy": 1.0893873495981097, "epoch": 1.3115853482532016, "grad_norm": 0.7421875, "learning_rate": 1.284584614730465e-05, "loss": 1.0757, "mean_token_accuracy": 0.7065093696117402, "num_tokens": 319007830.0, "step": 4260 }, { "entropy": 1.0531156476587058, "epoch": 1.3131248015548478, "grad_norm": 0.7421875, "learning_rate": 1.2830318243747736e-05, "loss": 1.053, "mean_token_accuracy": 0.7108749382197856, "num_tokens": 319368163.0, "step": 4265 }, { "entropy": 1.1421661697328092, "epoch": 1.3146642548564942, "grad_norm": 0.73828125, "learning_rate": 1.2814782918011183e-05, "loss": 1.1389, "mean_token_accuracy": 0.6936265856027604, "num_tokens": 319737992.0, "step": 4270 }, { "entropy": 1.0545647602528334, "epoch": 1.3162037081581404, "grad_norm": 0.671875, "learning_rate": 1.2799240210834572e-05, "loss": 1.0397, "mean_token_accuracy": 0.7110533300787211, "num_tokens": 320126655.0, "step": 4275 }, { "entropy": 1.1091747922822832, "epoch": 1.3177431614597865, "grad_norm": 0.72265625, "learning_rate": 1.2783690162976839e-05, "loss": 1.1117, "mean_token_accuracy": 0.7007482405751944, "num_tokens": 320487977.0, "step": 4280 }, { "entropy": 1.069710309058428, "epoch": 1.3192826147614327, "grad_norm": 0.703125, "learning_rate": 1.2768132815216174e-05, "loss": 1.0711, "mean_token_accuracy": 0.7076846122741699, "num_tokens": 320881284.0, "step": 4285 }, { "entropy": 1.1291945701465012, "epoch": 1.3208220680630791, "grad_norm": 0.71875, "learning_rate": 1.2752568208349905e-05, "loss": 1.1151, "mean_token_accuracy": 0.697771786339581, "num_tokens": 321264088.0, "step": 4290 }, { "entropy": 1.1011108864098786, "epoch": 1.3223615213647253, "grad_norm": 0.6796875, "learning_rate": 1.2736996383194403e-05, "loss": 1.0921, "mean_token_accuracy": 0.7011332143098116, "num_tokens": 321650295.0, "step": 4295 }, { "entropy": 1.1025992177426815, "epoch": 1.3239009746663717, "grad_norm": 0.7265625, "learning_rate": 1.2721417380584957e-05, "loss": 1.0897, "mean_token_accuracy": 0.7015523098409175, "num_tokens": 322025737.0, "step": 4300 }, { "entropy": 1.1109730444848538, "epoch": 1.3254404279680179, "grad_norm": 0.75, "learning_rate": 1.2705831241375695e-05, "loss": 1.1065, "mean_token_accuracy": 0.6985065761953593, "num_tokens": 322400305.0, "step": 4305 }, { "entropy": 1.1235045375302435, "epoch": 1.326979881269664, "grad_norm": 0.7109375, "learning_rate": 1.269023800643944e-05, "loss": 1.1235, "mean_token_accuracy": 0.6968322839587927, "num_tokens": 322778721.0, "step": 4310 }, { "entropy": 1.1202509528025986, "epoch": 1.3285193345713104, "grad_norm": 0.71484375, "learning_rate": 1.2674637716667641e-05, "loss": 1.1101, "mean_token_accuracy": 0.6995937298983336, "num_tokens": 323157401.0, "step": 4315 }, { "entropy": 1.1317413434386254, "epoch": 1.3300587878729566, "grad_norm": 0.7109375, "learning_rate": 1.2659030412970236e-05, "loss": 1.1308, "mean_token_accuracy": 0.6953566465526819, "num_tokens": 323521144.0, "step": 4320 }, { "entropy": 1.139741295017302, "epoch": 1.3315982411746028, "grad_norm": 0.75390625, "learning_rate": 1.2643416136275557e-05, "loss": 1.137, "mean_token_accuracy": 0.6940133567899466, "num_tokens": 323895960.0, "step": 4325 }, { "entropy": 1.0244571387767791, "epoch": 1.3331376944762492, "grad_norm": 0.71484375, "learning_rate": 1.262779492753023e-05, "loss": 1.0119, "mean_token_accuracy": 0.7153892401605845, "num_tokens": 324253131.0, "step": 4330 }, { "entropy": 1.1104781314730645, "epoch": 1.3346771477778954, "grad_norm": 0.76171875, "learning_rate": 1.2612166827699049e-05, "loss": 1.0916, "mean_token_accuracy": 0.6988188102841377, "num_tokens": 324627652.0, "step": 4335 }, { "entropy": 1.1045080471783877, "epoch": 1.3362166010795415, "grad_norm": 0.7109375, "learning_rate": 1.2596531877764887e-05, "loss": 1.1103, "mean_token_accuracy": 0.7010735843330622, "num_tokens": 325000500.0, "step": 4340 }, { "entropy": 1.1149308316409587, "epoch": 1.337756054381188, "grad_norm": 0.68359375, "learning_rate": 1.2580890118728572e-05, "loss": 1.1017, "mean_token_accuracy": 0.6998983439058065, "num_tokens": 325377888.0, "step": 4345 }, { "entropy": 1.1100379809737206, "epoch": 1.3392955076828341, "grad_norm": 0.703125, "learning_rate": 1.2565241591608798e-05, "loss": 1.1059, "mean_token_accuracy": 0.6978743225336075, "num_tokens": 325756763.0, "step": 4350 }, { "entropy": 1.1045261159539224, "epoch": 1.3408349609844805, "grad_norm": 0.75390625, "learning_rate": 1.2549586337442006e-05, "loss": 1.0947, "mean_token_accuracy": 0.7020975951105356, "num_tokens": 326135312.0, "step": 4355 }, { "entropy": 1.1263693606480956, "epoch": 1.3423744142861267, "grad_norm": 0.70703125, "learning_rate": 1.2533924397282268e-05, "loss": 1.125, "mean_token_accuracy": 0.6978525524958968, "num_tokens": 326515109.0, "step": 4360 }, { "entropy": 1.1515977576375007, "epoch": 1.3439138675877729, "grad_norm": 0.6953125, "learning_rate": 1.2518255812201203e-05, "loss": 1.1418, "mean_token_accuracy": 0.6906513828784228, "num_tokens": 326882050.0, "step": 4365 }, { "entropy": 1.1000885490328074, "epoch": 1.345453320889419, "grad_norm": 0.71875, "learning_rate": 1.2502580623287846e-05, "loss": 1.0976, "mean_token_accuracy": 0.701859263703227, "num_tokens": 327238398.0, "step": 4370 }, { "entropy": 1.0934124041348696, "epoch": 1.3469927741910654, "grad_norm": 0.72265625, "learning_rate": 1.2486898871648552e-05, "loss": 1.0896, "mean_token_accuracy": 0.7043805528432131, "num_tokens": 327619947.0, "step": 4375 }, { "entropy": 1.088824531622231, "epoch": 1.3485322274927116, "grad_norm": 0.68359375, "learning_rate": 1.2471210598406882e-05, "loss": 1.0783, "mean_token_accuracy": 0.7049058906733989, "num_tokens": 328004206.0, "step": 4380 }, { "entropy": 1.1130892544984818, "epoch": 1.350071680794358, "grad_norm": 0.73046875, "learning_rate": 1.2455515844703512e-05, "loss": 1.1092, "mean_token_accuracy": 0.697757763043046, "num_tokens": 328384919.0, "step": 4385 }, { "entropy": 1.0882465865463018, "epoch": 1.3516111340960042, "grad_norm": 0.69921875, "learning_rate": 1.24398146516961e-05, "loss": 1.0728, "mean_token_accuracy": 0.7054531000554561, "num_tokens": 328758461.0, "step": 4390 }, { "entropy": 1.1190194971859455, "epoch": 1.3531505873976504, "grad_norm": 0.67578125, "learning_rate": 1.2424107060559194e-05, "loss": 1.1216, "mean_token_accuracy": 0.6980281412601471, "num_tokens": 329139091.0, "step": 4395 }, { "entropy": 1.1049264952540399, "epoch": 1.3546900406992965, "grad_norm": 0.703125, "learning_rate": 1.2408393112484123e-05, "loss": 1.1002, "mean_token_accuracy": 0.7026136528700591, "num_tokens": 329517841.0, "step": 4400 }, { "entropy": 1.10797795727849, "epoch": 1.356229494000943, "grad_norm": 0.73046875, "learning_rate": 1.2392672848678877e-05, "loss": 1.0861, "mean_token_accuracy": 0.7025578137487173, "num_tokens": 329886529.0, "step": 4405 }, { "entropy": 1.1214808518067003, "epoch": 1.3577689473025891, "grad_norm": 0.734375, "learning_rate": 1.2376946310368023e-05, "loss": 1.1214, "mean_token_accuracy": 0.6982703737914562, "num_tokens": 330272866.0, "step": 4410 }, { "entropy": 1.1336385294795037, "epoch": 1.3593084006042355, "grad_norm": 0.7265625, "learning_rate": 1.236121353879257e-05, "loss": 1.129, "mean_token_accuracy": 0.6968680553138256, "num_tokens": 330647862.0, "step": 4415 }, { "entropy": 1.1065171971917152, "epoch": 1.3608478539058817, "grad_norm": 0.69140625, "learning_rate": 1.2345474575209884e-05, "loss": 1.1058, "mean_token_accuracy": 0.7020408466458321, "num_tokens": 331018179.0, "step": 4420 }, { "entropy": 1.132369793392718, "epoch": 1.3623873072075279, "grad_norm": 0.75390625, "learning_rate": 1.2329729460893552e-05, "loss": 1.1263, "mean_token_accuracy": 0.6953357547521591, "num_tokens": 331401445.0, "step": 4425 }, { "entropy": 1.0903928074985743, "epoch": 1.363926760509174, "grad_norm": 0.7109375, "learning_rate": 1.2313978237133308e-05, "loss": 1.0856, "mean_token_accuracy": 0.7031658750027419, "num_tokens": 331778605.0, "step": 4430 }, { "entropy": 1.1155294952914119, "epoch": 1.3654662138108205, "grad_norm": 0.703125, "learning_rate": 1.2298220945234896e-05, "loss": 1.1136, "mean_token_accuracy": 0.6989368978887797, "num_tokens": 332164233.0, "step": 4435 }, { "entropy": 1.116128033772111, "epoch": 1.3670056671124666, "grad_norm": 0.73828125, "learning_rate": 1.228245762651998e-05, "loss": 1.1099, "mean_token_accuracy": 0.6996843375265598, "num_tokens": 332535147.0, "step": 4440 }, { "entropy": 1.1336406484246253, "epoch": 1.368545120414113, "grad_norm": 0.734375, "learning_rate": 1.2266688322326024e-05, "loss": 1.1237, "mean_token_accuracy": 0.6948333293199539, "num_tokens": 332905717.0, "step": 4445 }, { "entropy": 1.0700359644368291, "epoch": 1.3700845737157592, "grad_norm": 0.703125, "learning_rate": 1.225091307400619e-05, "loss": 1.0706, "mean_token_accuracy": 0.7095909129828215, "num_tokens": 333275426.0, "step": 4450 }, { "entropy": 1.0737925486639142, "epoch": 1.3716240270174054, "grad_norm": 0.71484375, "learning_rate": 1.223513192292923e-05, "loss": 1.0585, "mean_token_accuracy": 0.7085043963044881, "num_tokens": 333652235.0, "step": 4455 }, { "entropy": 1.0694486383348702, "epoch": 1.3731634803190518, "grad_norm": 0.72265625, "learning_rate": 1.2219344910479368e-05, "loss": 1.051, "mean_token_accuracy": 0.7077645469456911, "num_tokens": 334031083.0, "step": 4460 }, { "entropy": 1.086533097922802, "epoch": 1.374702933620698, "grad_norm": 0.69140625, "learning_rate": 1.2203552078056209e-05, "loss": 1.0857, "mean_token_accuracy": 0.7078838661313057, "num_tokens": 334412528.0, "step": 4465 }, { "entropy": 1.056171497516334, "epoch": 1.3762423869223441, "grad_norm": 0.74609375, "learning_rate": 1.2187753467074613e-05, "loss": 1.0461, "mean_token_accuracy": 0.709338441863656, "num_tokens": 334782737.0, "step": 4470 }, { "entropy": 1.0703082425519823, "epoch": 1.3777818402239905, "grad_norm": 0.6953125, "learning_rate": 1.2171949118964592e-05, "loss": 1.0679, "mean_token_accuracy": 0.7064750380814075, "num_tokens": 335171730.0, "step": 4475 }, { "entropy": 1.0893489208072424, "epoch": 1.3793212935256367, "grad_norm": 0.76953125, "learning_rate": 1.2156139075171212e-05, "loss": 1.0797, "mean_token_accuracy": 0.7035396687686444, "num_tokens": 335539104.0, "step": 4480 }, { "entropy": 1.0840103393420577, "epoch": 1.3808607468272829, "grad_norm": 0.71875, "learning_rate": 1.2140323377154467e-05, "loss": 1.0684, "mean_token_accuracy": 0.7045680597424507, "num_tokens": 335909756.0, "step": 4485 }, { "entropy": 1.0821194671094418, "epoch": 1.3824002001289293, "grad_norm": 0.7109375, "learning_rate": 1.2124502066389181e-05, "loss": 1.082, "mean_token_accuracy": 0.7039589412510395, "num_tokens": 336287736.0, "step": 4490 }, { "entropy": 1.10668462254107, "epoch": 1.3839396534305755, "grad_norm": 0.6796875, "learning_rate": 1.2108675184364898e-05, "loss": 1.1053, "mean_token_accuracy": 0.7001998176798224, "num_tokens": 336659080.0, "step": 4495 }, { "entropy": 1.0968632355332375, "epoch": 1.3854791067322219, "grad_norm": 0.71875, "learning_rate": 1.2092842772585773e-05, "loss": 1.0959, "mean_token_accuracy": 0.7023633774369955, "num_tokens": 337027318.0, "step": 4500 }, { "entropy": 1.0873358672484756, "epoch": 1.387018560033868, "grad_norm": 0.70703125, "learning_rate": 1.2077004872570454e-05, "loss": 1.0826, "mean_token_accuracy": 0.7054312709718943, "num_tokens": 337389051.0, "step": 4505 }, { "entropy": 1.1103742688894271, "epoch": 1.3885580133355142, "grad_norm": 0.7265625, "learning_rate": 1.2061161525851991e-05, "loss": 1.1031, "mean_token_accuracy": 0.7011483401060105, "num_tokens": 337765571.0, "step": 4510 }, { "entropy": 1.1220366286113859, "epoch": 1.3900974666371604, "grad_norm": 0.7265625, "learning_rate": 1.204531277397772e-05, "loss": 1.119, "mean_token_accuracy": 0.7016996089369059, "num_tokens": 338135563.0, "step": 4515 }, { "entropy": 1.0903385024517775, "epoch": 1.3916369199388068, "grad_norm": 0.6953125, "learning_rate": 1.2029458658509135e-05, "loss": 1.0713, "mean_token_accuracy": 0.7042645826935768, "num_tokens": 338526759.0, "step": 4520 }, { "entropy": 1.088469509407878, "epoch": 1.393176373240453, "grad_norm": 0.72265625, "learning_rate": 1.201359922102181e-05, "loss": 1.0777, "mean_token_accuracy": 0.7016157642006874, "num_tokens": 338902220.0, "step": 4525 }, { "entropy": 1.11191342510283, "epoch": 1.3947158265420994, "grad_norm": 0.76171875, "learning_rate": 1.199773450310527e-05, "loss": 1.0914, "mean_token_accuracy": 0.7026226468384266, "num_tokens": 339272556.0, "step": 4530 }, { "entropy": 1.0702030174434185, "epoch": 1.3962552798437455, "grad_norm": 0.73828125, "learning_rate": 1.1981864546362891e-05, "loss": 1.0726, "mean_token_accuracy": 0.70561035387218, "num_tokens": 339654550.0, "step": 4535 }, { "entropy": 1.0890689438208938, "epoch": 1.3977947331453917, "grad_norm": 0.72265625, "learning_rate": 1.196598939241178e-05, "loss": 1.0837, "mean_token_accuracy": 0.7063101982697845, "num_tokens": 340017338.0, "step": 4540 }, { "entropy": 1.0902572806924582, "epoch": 1.3993341864470379, "grad_norm": 0.7109375, "learning_rate": 1.1950109082882681e-05, "loss": 1.0801, "mean_token_accuracy": 0.7041763126850128, "num_tokens": 340398192.0, "step": 4545 }, { "entropy": 1.0909225117415189, "epoch": 1.4008736397486843, "grad_norm": 0.7421875, "learning_rate": 1.1934223659419855e-05, "loss": 1.0755, "mean_token_accuracy": 0.7034576587378979, "num_tokens": 340783549.0, "step": 4550 }, { "entropy": 1.0837211914360523, "epoch": 1.4024130930503305, "grad_norm": 0.72265625, "learning_rate": 1.1918333163680968e-05, "loss": 1.0821, "mean_token_accuracy": 0.7019367016851902, "num_tokens": 341166651.0, "step": 4555 }, { "entropy": 1.104997373558581, "epoch": 1.4039525463519769, "grad_norm": 0.65625, "learning_rate": 1.1902437637337e-05, "loss": 1.1084, "mean_token_accuracy": 0.7023465141654015, "num_tokens": 341559392.0, "step": 4560 }, { "entropy": 1.0747286787256598, "epoch": 1.405491999653623, "grad_norm": 0.7890625, "learning_rate": 1.1886537122072106e-05, "loss": 1.0713, "mean_token_accuracy": 0.7080269675701857, "num_tokens": 341947887.0, "step": 4565 }, { "entropy": 1.112991374358535, "epoch": 1.4070314529552692, "grad_norm": 0.71875, "learning_rate": 1.1870631659583547e-05, "loss": 1.1103, "mean_token_accuracy": 0.7009411683306098, "num_tokens": 342328586.0, "step": 4570 }, { "entropy": 1.1081901915371417, "epoch": 1.4085709062569154, "grad_norm": 0.76953125, "learning_rate": 1.185472129158153e-05, "loss": 1.1038, "mean_token_accuracy": 0.6989708282053471, "num_tokens": 342709281.0, "step": 4575 }, { "entropy": 1.0794160701334476, "epoch": 1.4101103595585618, "grad_norm": 0.70703125, "learning_rate": 1.1838806059789151e-05, "loss": 1.0751, "mean_token_accuracy": 0.7048471983522177, "num_tokens": 343073827.0, "step": 4580 }, { "entropy": 1.1020493187010287, "epoch": 1.411649812860208, "grad_norm": 0.74609375, "learning_rate": 1.1822886005942244e-05, "loss": 1.0861, "mean_token_accuracy": 0.7011720657348632, "num_tokens": 343461960.0, "step": 4585 }, { "entropy": 1.0860462600365282, "epoch": 1.4131892661618544, "grad_norm": 0.734375, "learning_rate": 1.1806961171789297e-05, "loss": 1.0809, "mean_token_accuracy": 0.7038892190903425, "num_tokens": 343840940.0, "step": 4590 }, { "entropy": 1.1033543476834893, "epoch": 1.4147287194635005, "grad_norm": 0.7421875, "learning_rate": 1.179103159909133e-05, "loss": 1.0965, "mean_token_accuracy": 0.7027289818972349, "num_tokens": 344210514.0, "step": 4595 }, { "entropy": 1.1446595331653953, "epoch": 1.4162681727651467, "grad_norm": 0.72265625, "learning_rate": 1.1775097329621793e-05, "loss": 1.1332, "mean_token_accuracy": 0.6938136965036392, "num_tokens": 344585915.0, "step": 4600 }, { "entropy": 1.0780494783073664, "epoch": 1.417807626066793, "grad_norm": 0.71875, "learning_rate": 1.1759158405166446e-05, "loss": 1.0753, "mean_token_accuracy": 0.706804946810007, "num_tokens": 344958388.0, "step": 4605 }, { "entropy": 1.073190340399742, "epoch": 1.4193470793684393, "grad_norm": 0.734375, "learning_rate": 1.174321486752326e-05, "loss": 1.0739, "mean_token_accuracy": 0.7058147221803666, "num_tokens": 345342534.0, "step": 4610 }, { "entropy": 1.0797380482777954, "epoch": 1.4208865326700855, "grad_norm": 0.6796875, "learning_rate": 1.172726675850231e-05, "loss": 1.0682, "mean_token_accuracy": 0.70791350081563, "num_tokens": 345722416.0, "step": 4615 }, { "entropy": 1.1051574341952801, "epoch": 1.4224259859717319, "grad_norm": 0.70703125, "learning_rate": 1.1711314119925644e-05, "loss": 1.0908, "mean_token_accuracy": 0.6985630553215743, "num_tokens": 346111353.0, "step": 4620 }, { "entropy": 1.109693994373083, "epoch": 1.423965439273378, "grad_norm": 0.7265625, "learning_rate": 1.1695356993627203e-05, "loss": 1.1038, "mean_token_accuracy": 0.7008035439997912, "num_tokens": 346487176.0, "step": 4625 }, { "entropy": 1.0987954657524823, "epoch": 1.4255048925750242, "grad_norm": 0.69921875, "learning_rate": 1.1679395421452688e-05, "loss": 1.0869, "mean_token_accuracy": 0.7036832481622696, "num_tokens": 346877422.0, "step": 4630 }, { "entropy": 1.12406539991498, "epoch": 1.4270443458766706, "grad_norm": 0.671875, "learning_rate": 1.1663429445259464e-05, "loss": 1.1235, "mean_token_accuracy": 0.6969954641535878, "num_tokens": 347258117.0, "step": 4635 }, { "entropy": 1.1262548461556434, "epoch": 1.4285837991783168, "grad_norm": 0.71484375, "learning_rate": 1.1647459106916438e-05, "loss": 1.1121, "mean_token_accuracy": 0.698977418243885, "num_tokens": 347615486.0, "step": 4640 }, { "entropy": 1.083485627733171, "epoch": 1.4301232524799632, "grad_norm": 0.73828125, "learning_rate": 1.1631484448303964e-05, "loss": 1.0767, "mean_token_accuracy": 0.7037990376353264, "num_tokens": 347993978.0, "step": 4645 }, { "entropy": 1.104743254557252, "epoch": 1.4316627057816094, "grad_norm": 0.7265625, "learning_rate": 1.1615505511313723e-05, "loss": 1.0982, "mean_token_accuracy": 0.7019114103168249, "num_tokens": 348363109.0, "step": 4650 }, { "entropy": 1.1204315826296807, "epoch": 1.4332021590832555, "grad_norm": 0.703125, "learning_rate": 1.159952233784861e-05, "loss": 1.12, "mean_token_accuracy": 0.6980244889855385, "num_tokens": 348738479.0, "step": 4655 }, { "entropy": 1.0870197594165802, "epoch": 1.4347416123849017, "grad_norm": 0.72265625, "learning_rate": 1.1583534969822634e-05, "loss": 1.0781, "mean_token_accuracy": 0.7041078258305788, "num_tokens": 349114597.0, "step": 4660 }, { "entropy": 1.131915664114058, "epoch": 1.4362810656865481, "grad_norm": 0.70703125, "learning_rate": 1.156754344916081e-05, "loss": 1.1266, "mean_token_accuracy": 0.6947113610804081, "num_tokens": 349495721.0, "step": 4665 }, { "entropy": 1.1002964191138744, "epoch": 1.4378205189881943, "grad_norm": 0.7109375, "learning_rate": 1.155154781779903e-05, "loss": 1.0966, "mean_token_accuracy": 0.7026873178780079, "num_tokens": 349857054.0, "step": 4670 }, { "entropy": 1.1086486119776964, "epoch": 1.4393599722898407, "grad_norm": 0.6953125, "learning_rate": 1.1535548117683977e-05, "loss": 1.0956, "mean_token_accuracy": 0.7016890406608581, "num_tokens": 350235771.0, "step": 4675 }, { "entropy": 1.0940628914162516, "epoch": 1.4408994255914869, "grad_norm": 0.71484375, "learning_rate": 1.1519544390772996e-05, "loss": 1.0933, "mean_token_accuracy": 0.7022279798984528, "num_tokens": 350594431.0, "step": 4680 }, { "entropy": 1.0739692451432348, "epoch": 1.442438878893133, "grad_norm": 0.74609375, "learning_rate": 1.1503536679034e-05, "loss": 1.0582, "mean_token_accuracy": 0.7093446459621191, "num_tokens": 350966729.0, "step": 4685 }, { "entropy": 1.1036204397678375, "epoch": 1.4439783321947792, "grad_norm": 0.7421875, "learning_rate": 1.148752502444534e-05, "loss": 1.0968, "mean_token_accuracy": 0.7027051884680986, "num_tokens": 351348015.0, "step": 4690 }, { "entropy": 1.0984970558434726, "epoch": 1.4455177854964256, "grad_norm": 0.73046875, "learning_rate": 1.1471509468995719e-05, "loss": 1.0748, "mean_token_accuracy": 0.7056610502302647, "num_tokens": 351724259.0, "step": 4695 }, { "entropy": 1.0869323208928108, "epoch": 1.4470572387980718, "grad_norm": 0.71875, "learning_rate": 1.1455490054684063e-05, "loss": 1.0785, "mean_token_accuracy": 0.7069425046443939, "num_tokens": 352089350.0, "step": 4700 }, { "entropy": 1.1182052005082368, "epoch": 1.4485966920997182, "grad_norm": 0.6953125, "learning_rate": 1.1439466823519414e-05, "loss": 1.1111, "mean_token_accuracy": 0.6985241148620844, "num_tokens": 352466679.0, "step": 4705 }, { "entropy": 1.1125420741736889, "epoch": 1.4501361454013644, "grad_norm": 0.6953125, "learning_rate": 1.1423439817520837e-05, "loss": 1.1155, "mean_token_accuracy": 0.7014571156352758, "num_tokens": 352826493.0, "step": 4710 }, { "entropy": 1.0784962832927705, "epoch": 1.4516755987030106, "grad_norm": 0.7109375, "learning_rate": 1.1407409078717275e-05, "loss": 1.0696, "mean_token_accuracy": 0.7046381793916225, "num_tokens": 353205948.0, "step": 4715 }, { "entropy": 1.0519383791834116, "epoch": 1.4532150520046567, "grad_norm": 0.71484375, "learning_rate": 1.1391374649147482e-05, "loss": 1.0406, "mean_token_accuracy": 0.7135688032954931, "num_tokens": 353591448.0, "step": 4720 }, { "entropy": 1.1096265275031327, "epoch": 1.4547545053063031, "grad_norm": 0.7109375, "learning_rate": 1.1375336570859877e-05, "loss": 1.0982, "mean_token_accuracy": 0.7041479632258415, "num_tokens": 353950453.0, "step": 4725 }, { "entropy": 1.0867053436115384, "epoch": 1.4562939586079493, "grad_norm": 0.76171875, "learning_rate": 1.1359294885912449e-05, "loss": 1.0785, "mean_token_accuracy": 0.7096118059009313, "num_tokens": 354327137.0, "step": 4730 }, { "entropy": 1.1087339762598276, "epoch": 1.4578334119095957, "grad_norm": 0.78125, "learning_rate": 1.1343249636372646e-05, "loss": 1.102, "mean_token_accuracy": 0.7003944184631109, "num_tokens": 354689574.0, "step": 4735 }, { "entropy": 1.0943115957081317, "epoch": 1.4593728652112419, "grad_norm": 0.66015625, "learning_rate": 1.132720086431727e-05, "loss": 1.0829, "mean_token_accuracy": 0.7030307587236166, "num_tokens": 355073304.0, "step": 4740 }, { "entropy": 1.1095132680609823, "epoch": 1.460912318512888, "grad_norm": 0.703125, "learning_rate": 1.1311148611832346e-05, "loss": 1.1043, "mean_token_accuracy": 0.6999218583106994, "num_tokens": 355451708.0, "step": 4745 }, { "entropy": 1.1087484553456306, "epoch": 1.4624517718145342, "grad_norm": 0.71875, "learning_rate": 1.129509292101304e-05, "loss": 1.1009, "mean_token_accuracy": 0.6988322615623475, "num_tokens": 355820578.0, "step": 4750 }, { "entropy": 1.094297254830599, "epoch": 1.4639912251161806, "grad_norm": 0.7265625, "learning_rate": 1.1279033833963532e-05, "loss": 1.075, "mean_token_accuracy": 0.7040094539523125, "num_tokens": 356185880.0, "step": 4755 }, { "entropy": 1.069185835123062, "epoch": 1.4655306784178268, "grad_norm": 0.71875, "learning_rate": 1.12629713927969e-05, "loss": 1.0557, "mean_token_accuracy": 0.7063707388937474, "num_tokens": 356557400.0, "step": 4760 }, { "entropy": 1.0941881004720926, "epoch": 1.4670701317194732, "grad_norm": 0.671875, "learning_rate": 1.1246905639635029e-05, "loss": 1.0747, "mean_token_accuracy": 0.7060420401394367, "num_tokens": 356945971.0, "step": 4765 }, { "entropy": 1.0458490543067456, "epoch": 1.4686095850211194, "grad_norm": 0.71484375, "learning_rate": 1.1230836616608479e-05, "loss": 1.0369, "mean_token_accuracy": 0.7089097138494254, "num_tokens": 357328145.0, "step": 4770 }, { "entropy": 1.097815372236073, "epoch": 1.4701490383227656, "grad_norm": 0.6953125, "learning_rate": 1.1214764365856393e-05, "loss": 1.0897, "mean_token_accuracy": 0.7041168842464686, "num_tokens": 357703680.0, "step": 4775 }, { "entropy": 1.1202220287173987, "epoch": 1.471688491624412, "grad_norm": 0.73046875, "learning_rate": 1.1198688929526369e-05, "loss": 1.1033, "mean_token_accuracy": 0.6995015844702721, "num_tokens": 358070299.0, "step": 4780 }, { "entropy": 1.124421639367938, "epoch": 1.4732279449260581, "grad_norm": 0.71875, "learning_rate": 1.118261034977437e-05, "loss": 1.12, "mean_token_accuracy": 0.699353015422821, "num_tokens": 358446153.0, "step": 4785 }, { "entropy": 1.078741892427206, "epoch": 1.4747673982277043, "grad_norm": 0.68359375, "learning_rate": 1.11665286687646e-05, "loss": 1.0736, "mean_token_accuracy": 0.7057676538825035, "num_tokens": 358837143.0, "step": 4790 }, { "entropy": 1.1247838504612446, "epoch": 1.4763068515293507, "grad_norm": 0.72265625, "learning_rate": 1.1150443928669383e-05, "loss": 1.1311, "mean_token_accuracy": 0.6956282909959555, "num_tokens": 359212022.0, "step": 4795 }, { "entropy": 1.109905306249857, "epoch": 1.4778463048309969, "grad_norm": 0.71484375, "learning_rate": 1.1134356171669085e-05, "loss": 1.1015, "mean_token_accuracy": 0.701968039572239, "num_tokens": 359597317.0, "step": 4800 }, { "entropy": 1.076607409492135, "epoch": 1.479385758132643, "grad_norm": 0.71484375, "learning_rate": 1.1118265439951968e-05, "loss": 1.0682, "mean_token_accuracy": 0.7075003888458014, "num_tokens": 359972997.0, "step": 4805 }, { "entropy": 1.0871192902326583, "epoch": 1.4809252114342895, "grad_norm": 0.70703125, "learning_rate": 1.1102171775714097e-05, "loss": 1.0864, "mean_token_accuracy": 0.7057229354977608, "num_tokens": 360338277.0, "step": 4810 }, { "entropy": 1.1171676289290189, "epoch": 1.4824646647359356, "grad_norm": 0.69921875, "learning_rate": 1.1086075221159237e-05, "loss": 1.1133, "mean_token_accuracy": 0.6995074581354856, "num_tokens": 360730974.0, "step": 4815 }, { "entropy": 1.0742021584883332, "epoch": 1.484004118037582, "grad_norm": 0.70703125, "learning_rate": 1.1069975818498724e-05, "loss": 1.0647, "mean_token_accuracy": 0.7100146293640137, "num_tokens": 361103120.0, "step": 4820 }, { "entropy": 1.095327810011804, "epoch": 1.4855435713392282, "grad_norm": 0.76953125, "learning_rate": 1.1053873609951362e-05, "loss": 1.0845, "mean_token_accuracy": 0.7042764712125062, "num_tokens": 361464494.0, "step": 4825 }, { "entropy": 1.0706271074712277, "epoch": 1.4870830246408744, "grad_norm": 0.70703125, "learning_rate": 1.1037768637743316e-05, "loss": 1.0652, "mean_token_accuracy": 0.7063718538731336, "num_tokens": 361827914.0, "step": 4830 }, { "entropy": 1.108374112099409, "epoch": 1.4886224779425206, "grad_norm": 0.73046875, "learning_rate": 1.1021660944108e-05, "loss": 1.1046, "mean_token_accuracy": 0.7001846972852945, "num_tokens": 362199069.0, "step": 4835 }, { "entropy": 1.1093880301341414, "epoch": 1.490161931244167, "grad_norm": 0.71484375, "learning_rate": 1.1005550571285964e-05, "loss": 1.1008, "mean_token_accuracy": 0.7009815942496062, "num_tokens": 362581369.0, "step": 4840 }, { "entropy": 1.105388099886477, "epoch": 1.4917013845458131, "grad_norm": 0.734375, "learning_rate": 1.0989437561524776e-05, "loss": 1.0941, "mean_token_accuracy": 0.7039092086255551, "num_tokens": 362943341.0, "step": 4845 }, { "entropy": 1.1012696333229541, "epoch": 1.4932408378474595, "grad_norm": 0.6953125, "learning_rate": 1.0973321957078935e-05, "loss": 1.0877, "mean_token_accuracy": 0.7057942543178797, "num_tokens": 363312084.0, "step": 4850 }, { "entropy": 1.0516272846609354, "epoch": 1.4947802911491057, "grad_norm": 0.6875, "learning_rate": 1.0957203800209729e-05, "loss": 1.0494, "mean_token_accuracy": 0.713024589791894, "num_tokens": 363693229.0, "step": 4855 }, { "entropy": 1.1145474841818213, "epoch": 1.4963197444507519, "grad_norm": 0.671875, "learning_rate": 1.0941083133185146e-05, "loss": 1.1039, "mean_token_accuracy": 0.6989588256925344, "num_tokens": 364077647.0, "step": 4860 }, { "entropy": 1.111084546893835, "epoch": 1.497859197752398, "grad_norm": 0.69921875, "learning_rate": 1.0924959998279754e-05, "loss": 1.0972, "mean_token_accuracy": 0.7017969522625208, "num_tokens": 364448259.0, "step": 4865 }, { "entropy": 1.102950258180499, "epoch": 1.4993986510540445, "grad_norm": 0.7109375, "learning_rate": 1.09088344377746e-05, "loss": 1.104, "mean_token_accuracy": 0.7009441778063774, "num_tokens": 364837230.0, "step": 4870 }, { "entropy": 1.1102787114679813, "epoch": 1.5009381043556906, "grad_norm": 0.734375, "learning_rate": 1.0892706493957083e-05, "loss": 1.1014, "mean_token_accuracy": 0.7027213271707297, "num_tokens": 365219203.0, "step": 4875 }, { "entropy": 1.0819869244471192, "epoch": 1.502477557657337, "grad_norm": 0.70703125, "learning_rate": 1.0876576209120857e-05, "loss": 1.0785, "mean_token_accuracy": 0.7077439911663532, "num_tokens": 365579341.0, "step": 4880 }, { "entropy": 1.1024604262784123, "epoch": 1.5040170109589832, "grad_norm": 0.703125, "learning_rate": 1.0860443625565712e-05, "loss": 1.0952, "mean_token_accuracy": 0.7008481990545988, "num_tokens": 365946705.0, "step": 4885 }, { "entropy": 1.0811700403690339, "epoch": 1.5055564642606294, "grad_norm": 0.65625, "learning_rate": 1.084430878559747e-05, "loss": 1.0586, "mean_token_accuracy": 0.7069568939507007, "num_tokens": 366329972.0, "step": 4890 }, { "entropy": 1.0681102907285094, "epoch": 1.5070959175622756, "grad_norm": 0.671875, "learning_rate": 1.0828171731527863e-05, "loss": 1.065, "mean_token_accuracy": 0.709576641023159, "num_tokens": 366721584.0, "step": 4895 }, { "entropy": 1.1116036470979451, "epoch": 1.508635370863922, "grad_norm": 0.75390625, "learning_rate": 1.081203250567444e-05, "loss": 1.0981, "mean_token_accuracy": 0.7008657567203045, "num_tokens": 367089660.0, "step": 4900 }, { "entropy": 1.0942118011415005, "epoch": 1.5101748241655684, "grad_norm": 0.7421875, "learning_rate": 1.0795891150360435e-05, "loss": 1.1012, "mean_token_accuracy": 0.701570986956358, "num_tokens": 367460688.0, "step": 4905 }, { "entropy": 1.09613887835294, "epoch": 1.5117142774672145, "grad_norm": 0.73046875, "learning_rate": 1.0779747707914672e-05, "loss": 1.0905, "mean_token_accuracy": 0.7026755798608064, "num_tokens": 367839853.0, "step": 4910 }, { "entropy": 1.0824256701394916, "epoch": 1.5132537307688607, "grad_norm": 0.671875, "learning_rate": 1.076360222067145e-05, "loss": 1.0698, "mean_token_accuracy": 0.7053290653973818, "num_tokens": 368212436.0, "step": 4915 }, { "entropy": 1.1290051667019725, "epoch": 1.514793184070507, "grad_norm": 0.7578125, "learning_rate": 1.0747454730970422e-05, "loss": 1.1126, "mean_token_accuracy": 0.6994906149804592, "num_tokens": 368580297.0, "step": 4920 }, { "entropy": 1.118296029418707, "epoch": 1.516332637372153, "grad_norm": 0.72265625, "learning_rate": 1.0731305281156499e-05, "loss": 1.115, "mean_token_accuracy": 0.6976137042045594, "num_tokens": 368946846.0, "step": 4925 }, { "entropy": 1.0706999147310854, "epoch": 1.5178720906737995, "grad_norm": 0.73046875, "learning_rate": 1.071515391357973e-05, "loss": 1.0663, "mean_token_accuracy": 0.7087556172162295, "num_tokens": 369331900.0, "step": 4930 }, { "entropy": 1.1037400741130114, "epoch": 1.5194115439754459, "grad_norm": 0.7734375, "learning_rate": 1.0699000670595194e-05, "loss": 1.0975, "mean_token_accuracy": 0.7014547817409038, "num_tokens": 369703262.0, "step": 4935 }, { "entropy": 1.091360279917717, "epoch": 1.520950997277092, "grad_norm": 0.71484375, "learning_rate": 1.0682845594562892e-05, "loss": 1.0927, "mean_token_accuracy": 0.7037259839475155, "num_tokens": 370094998.0, "step": 4940 }, { "entropy": 1.0874795876443386, "epoch": 1.5224904505787382, "grad_norm": 0.6796875, "learning_rate": 1.066668872784762e-05, "loss": 1.0817, "mean_token_accuracy": 0.7028707899153233, "num_tokens": 370473771.0, "step": 4945 }, { "entropy": 1.0719008050858974, "epoch": 1.5240299038803844, "grad_norm": 0.73828125, "learning_rate": 1.0650530112818884e-05, "loss": 1.0753, "mean_token_accuracy": 0.7052478577941657, "num_tokens": 370843105.0, "step": 4950 }, { "entropy": 1.0888731945306063, "epoch": 1.5255693571820306, "grad_norm": 0.7421875, "learning_rate": 1.0634369791850761e-05, "loss": 1.0789, "mean_token_accuracy": 0.7031285293400288, "num_tokens": 371220483.0, "step": 4955 }, { "entropy": 1.080846518278122, "epoch": 1.527108810483677, "grad_norm": 0.71484375, "learning_rate": 1.0618207807321817e-05, "loss": 1.0834, "mean_token_accuracy": 0.7047945097088814, "num_tokens": 371598916.0, "step": 4960 }, { "entropy": 1.1104522667825223, "epoch": 1.5286482637853234, "grad_norm": 0.74609375, "learning_rate": 1.0602044201614965e-05, "loss": 1.1029, "mean_token_accuracy": 0.6997536733746529, "num_tokens": 371974118.0, "step": 4965 }, { "entropy": 1.055209456756711, "epoch": 1.5301877170869695, "grad_norm": 0.70703125, "learning_rate": 1.058587901711738e-05, "loss": 1.0539, "mean_token_accuracy": 0.7098731644451618, "num_tokens": 372358939.0, "step": 4970 }, { "entropy": 1.138210940361023, "epoch": 1.5317271703886157, "grad_norm": 0.74609375, "learning_rate": 1.0569712296220375e-05, "loss": 1.1311, "mean_token_accuracy": 0.6945899702608586, "num_tokens": 372729363.0, "step": 4975 }, { "entropy": 1.0763438038527966, "epoch": 1.533266623690262, "grad_norm": 0.69140625, "learning_rate": 1.055354408131929e-05, "loss": 1.0736, "mean_token_accuracy": 0.7102150522172451, "num_tokens": 373108891.0, "step": 4980 }, { "entropy": 1.0876709651201963, "epoch": 1.5348060769919083, "grad_norm": 0.7578125, "learning_rate": 1.0537374414813384e-05, "loss": 1.086, "mean_token_accuracy": 0.7007746994495392, "num_tokens": 373481297.0, "step": 4985 }, { "entropy": 1.1017237912863493, "epoch": 1.5363455302935545, "grad_norm": 0.7265625, "learning_rate": 1.0521203339105719e-05, "loss": 1.0912, "mean_token_accuracy": 0.7007615003734827, "num_tokens": 373857906.0, "step": 4990 }, { "entropy": 1.0609590832144022, "epoch": 1.5378849835952009, "grad_norm": 0.69140625, "learning_rate": 1.0505030896603059e-05, "loss": 1.0593, "mean_token_accuracy": 0.7097893103957176, "num_tokens": 374233925.0, "step": 4995 }, { "entropy": 1.0860246624797583, "epoch": 1.539424436896847, "grad_norm": 0.7421875, "learning_rate": 1.0488857129715748e-05, "loss": 1.0739, "mean_token_accuracy": 0.7066695354878902, "num_tokens": 374605891.0, "step": 5000 } ], "logging_steps": 5, "max_steps": 10000, "num_input_tokens_seen": 0, "num_train_epochs": 4, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 6.237318753814577e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }