{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.1971349717439874, "eval_steps": 500, "global_step": 1500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691970920562744, "epoch": 0.000657116572479958, "grad_norm": 11.375, "learning_rate": 2e-06, "loss": 10.9102, "mean_token_accuracy": 0.0, "num_tokens": 18160.0, "step": 5 }, { "entropy": 10.69195909500122, "epoch": 0.001314233144959916, "grad_norm": 11.8125, "learning_rate": 4.5e-06, "loss": 10.8426, "mean_token_accuracy": 0.00034901105682365595, "num_tokens": 34700.0, "step": 10 }, { "entropy": 10.689266014099122, "epoch": 0.001971349717439874, "grad_norm": 8.375, "learning_rate": 7e-06, "loss": 10.5846, "mean_token_accuracy": 0.0499508892185986, "num_tokens": 52678.0, "step": 15 }, { "entropy": 10.562198734283447, "epoch": 0.002628466289919832, "grad_norm": 5.40625, "learning_rate": 9.5e-06, "loss": 10.3172, "mean_token_accuracy": 0.0605622336268425, "num_tokens": 69607.0, "step": 20 }, { "entropy": 10.345282936096192, "epoch": 0.0032855828623997896, "grad_norm": 3.71875, "learning_rate": 1.2e-05, "loss": 10.0938, "mean_token_accuracy": 0.06148592121899128, "num_tokens": 88068.0, "step": 25 }, { "entropy": 10.521661567687989, "epoch": 0.003942699434879748, "grad_norm": 3.171875, "learning_rate": 1.4500000000000002e-05, "loss": 9.9441, "mean_token_accuracy": 0.06816631071269512, "num_tokens": 105839.0, "step": 30 }, { "entropy": 10.302499389648437, "epoch": 0.004599816007359705, "grad_norm": 2.375, "learning_rate": 1.7000000000000003e-05, "loss": 9.899, "mean_token_accuracy": 0.0670669324696064, "num_tokens": 125068.0, "step": 35 }, { "entropy": 10.426428699493409, "epoch": 0.005256932579839664, "grad_norm": 2.765625, "learning_rate": 1.95e-05, "loss": 9.8561, "mean_token_accuracy": 0.06749101914465427, "num_tokens": 143271.0, "step": 40 }, { "entropy": 10.273355770111085, "epoch": 0.0059140491523196215, "grad_norm": 2.0, "learning_rate": 2.2e-05, "loss": 9.8657, "mean_token_accuracy": 0.06502391099929809, "num_tokens": 160886.0, "step": 45 }, { "entropy": 10.348071479797364, "epoch": 0.006571165724799579, "grad_norm": 2.359375, "learning_rate": 2.4500000000000003e-05, "loss": 9.7845, "mean_token_accuracy": 0.06918984390795231, "num_tokens": 179036.0, "step": 50 }, { "entropy": 10.29029483795166, "epoch": 0.007228282297279538, "grad_norm": 1.7578125, "learning_rate": 2.7e-05, "loss": 9.731, "mean_token_accuracy": 0.07089065425097943, "num_tokens": 195478.0, "step": 55 }, { "entropy": 10.25726251602173, "epoch": 0.007885398869759495, "grad_norm": 2.296875, "learning_rate": 2.95e-05, "loss": 9.7119, "mean_token_accuracy": 0.0690944753587246, "num_tokens": 213003.0, "step": 60 }, { "entropy": 10.302559661865235, "epoch": 0.008542515442239454, "grad_norm": 2.265625, "learning_rate": 3.2e-05, "loss": 9.6475, "mean_token_accuracy": 0.07418905831873417, "num_tokens": 230223.0, "step": 65 }, { "entropy": 10.087755107879639, "epoch": 0.00919963201471941, "grad_norm": 1.578125, "learning_rate": 3.4500000000000005e-05, "loss": 9.5049, "mean_token_accuracy": 0.0840003713965416, "num_tokens": 246555.0, "step": 70 }, { "entropy": 10.160563468933105, "epoch": 0.00985674858719937, "grad_norm": 1.7109375, "learning_rate": 3.7e-05, "loss": 9.4854, "mean_token_accuracy": 0.07695499211549758, "num_tokens": 262985.0, "step": 75 }, { "entropy": 10.03568115234375, "epoch": 0.010513865159679328, "grad_norm": 2.140625, "learning_rate": 3.95e-05, "loss": 9.3528, "mean_token_accuracy": 0.08797612711787224, "num_tokens": 281701.0, "step": 80 }, { "entropy": 10.050819873809814, "epoch": 0.011170981732159285, "grad_norm": 1.6171875, "learning_rate": 4.2000000000000004e-05, "loss": 9.3271, "mean_token_accuracy": 0.08114923164248466, "num_tokens": 298432.0, "step": 85 }, { "entropy": 10.067263984680176, "epoch": 0.011828098304639243, "grad_norm": 1.640625, "learning_rate": 4.45e-05, "loss": 9.2657, "mean_token_accuracy": 0.08178326860070229, "num_tokens": 315559.0, "step": 90 }, { "entropy": 9.996760272979737, "epoch": 0.012485214877119202, "grad_norm": 1.59375, "learning_rate": 4.7000000000000004e-05, "loss": 9.174, "mean_token_accuracy": 0.08735092431306839, "num_tokens": 332959.0, "step": 95 }, { "entropy": 10.032902812957763, "epoch": 0.013142331449599158, "grad_norm": 1.9609375, "learning_rate": 4.9500000000000004e-05, "loss": 9.1565, "mean_token_accuracy": 0.07826860286295415, "num_tokens": 349872.0, "step": 100 }, { "entropy": 9.87295093536377, "epoch": 0.013799448022079117, "grad_norm": 1.3203125, "learning_rate": 5.2e-05, "loss": 9.0779, "mean_token_accuracy": 0.07845050990581512, "num_tokens": 365952.0, "step": 105 }, { "entropy": 9.94616346359253, "epoch": 0.014456564594559075, "grad_norm": 1.1171875, "learning_rate": 5.45e-05, "loss": 8.9723, "mean_token_accuracy": 0.0847774550318718, "num_tokens": 382830.0, "step": 110 }, { "entropy": 9.765446853637695, "epoch": 0.015113681167039032, "grad_norm": 1.6796875, "learning_rate": 5.7e-05, "loss": 8.8959, "mean_token_accuracy": 0.08348627090454101, "num_tokens": 401729.0, "step": 115 }, { "entropy": 9.696452522277832, "epoch": 0.01577079773951899, "grad_norm": 1.296875, "learning_rate": 5.9499999999999996e-05, "loss": 8.7663, "mean_token_accuracy": 0.0866998441517353, "num_tokens": 419094.0, "step": 120 }, { "entropy": 9.62384328842163, "epoch": 0.01642791431199895, "grad_norm": 1.0625, "learning_rate": 6.2e-05, "loss": 8.7123, "mean_token_accuracy": 0.08670503944158554, "num_tokens": 438632.0, "step": 125 }, { "entropy": 9.458528423309327, "epoch": 0.017085030884478908, "grad_norm": 2.109375, "learning_rate": 6.450000000000001e-05, "loss": 8.5991, "mean_token_accuracy": 0.08925274014472961, "num_tokens": 456025.0, "step": 130 }, { "entropy": 9.395387935638428, "epoch": 0.017742147456958863, "grad_norm": 0.98046875, "learning_rate": 6.7e-05, "loss": 8.5874, "mean_token_accuracy": 0.08284339755773544, "num_tokens": 473414.0, "step": 135 }, { "entropy": 9.288764190673827, "epoch": 0.01839926402943882, "grad_norm": 0.91796875, "learning_rate": 6.950000000000001e-05, "loss": 8.484, "mean_token_accuracy": 0.08540036529302597, "num_tokens": 490039.0, "step": 140 }, { "entropy": 9.080249691009522, "epoch": 0.01905638060191878, "grad_norm": 0.92578125, "learning_rate": 7.2e-05, "loss": 8.4185, "mean_token_accuracy": 0.09069929495453835, "num_tokens": 506896.0, "step": 145 }, { "entropy": 8.990424156188965, "epoch": 0.01971349717439874, "grad_norm": 1.140625, "learning_rate": 7.45e-05, "loss": 8.3134, "mean_token_accuracy": 0.0939207799732685, "num_tokens": 523544.0, "step": 150 }, { "entropy": 8.895142555236816, "epoch": 0.020370613746878697, "grad_norm": 1.078125, "learning_rate": 7.7e-05, "loss": 8.3193, "mean_token_accuracy": 0.0861300639808178, "num_tokens": 540240.0, "step": 155 }, { "entropy": 8.84927806854248, "epoch": 0.021027730319358656, "grad_norm": 0.94140625, "learning_rate": 7.950000000000001e-05, "loss": 8.3388, "mean_token_accuracy": 0.08859094232320786, "num_tokens": 558460.0, "step": 160 }, { "entropy": 8.804749298095704, "epoch": 0.02168484689183861, "grad_norm": 1.671875, "learning_rate": 8.2e-05, "loss": 8.3132, "mean_token_accuracy": 0.08978721722960473, "num_tokens": 577356.0, "step": 165 }, { "entropy": 8.755771827697753, "epoch": 0.02234196346431857, "grad_norm": 0.8359375, "learning_rate": 8.450000000000001e-05, "loss": 8.3233, "mean_token_accuracy": 0.08325318172574044, "num_tokens": 594702.0, "step": 170 }, { "entropy": 8.61918659210205, "epoch": 0.022999080036798528, "grad_norm": 0.7734375, "learning_rate": 8.7e-05, "loss": 8.2927, "mean_token_accuracy": 0.08967687636613846, "num_tokens": 612005.0, "step": 175 }, { "entropy": 8.692005062103272, "epoch": 0.023656196609278486, "grad_norm": 1.171875, "learning_rate": 8.95e-05, "loss": 8.2979, "mean_token_accuracy": 0.08311463445425034, "num_tokens": 629271.0, "step": 180 }, { "entropy": 8.543895149230957, "epoch": 0.024313313181758445, "grad_norm": 1.25, "learning_rate": 9.2e-05, "loss": 8.2711, "mean_token_accuracy": 0.09236689656972885, "num_tokens": 646273.0, "step": 185 }, { "entropy": 8.623021125793457, "epoch": 0.024970429754238403, "grad_norm": 0.94140625, "learning_rate": 9.45e-05, "loss": 8.2622, "mean_token_accuracy": 0.08237618803977967, "num_tokens": 663263.0, "step": 190 }, { "entropy": 8.503989696502686, "epoch": 0.02562754632671836, "grad_norm": 1.015625, "learning_rate": 9.7e-05, "loss": 8.1725, "mean_token_accuracy": 0.09226469621062279, "num_tokens": 681032.0, "step": 195 }, { "entropy": 8.496358585357665, "epoch": 0.026284662899198317, "grad_norm": 0.89453125, "learning_rate": 9.95e-05, "loss": 8.2157, "mean_token_accuracy": 0.08867634385824204, "num_tokens": 699353.0, "step": 200 }, { "entropy": 8.597747421264648, "epoch": 0.026941779471678275, "grad_norm": 0.90625, "learning_rate": 0.000102, "loss": 8.2941, "mean_token_accuracy": 0.08325276263058186, "num_tokens": 717777.0, "step": 205 }, { "entropy": 8.493968677520751, "epoch": 0.027598896044158234, "grad_norm": 0.8671875, "learning_rate": 0.00010449999999999999, "loss": 8.2395, "mean_token_accuracy": 0.08642884120345115, "num_tokens": 733831.0, "step": 210 }, { "entropy": 8.45910186767578, "epoch": 0.028256012616638192, "grad_norm": 0.7734375, "learning_rate": 0.000107, "loss": 8.202, "mean_token_accuracy": 0.0875705562531948, "num_tokens": 750057.0, "step": 215 }, { "entropy": 8.502654266357421, "epoch": 0.02891312918911815, "grad_norm": 1.5, "learning_rate": 0.0001095, "loss": 8.2335, "mean_token_accuracy": 0.08846379294991494, "num_tokens": 767590.0, "step": 220 }, { "entropy": 8.471471691131592, "epoch": 0.029570245761598106, "grad_norm": 0.8359375, "learning_rate": 0.000112, "loss": 8.1997, "mean_token_accuracy": 0.0836844079196453, "num_tokens": 784496.0, "step": 225 }, { "entropy": 8.473236179351806, "epoch": 0.030227362334078064, "grad_norm": 0.8359375, "learning_rate": 0.0001145, "loss": 8.22, "mean_token_accuracy": 0.08451615646481514, "num_tokens": 802589.0, "step": 230 }, { "entropy": 8.466453552246094, "epoch": 0.030884478906558023, "grad_norm": 0.68359375, "learning_rate": 0.00011700000000000001, "loss": 8.2459, "mean_token_accuracy": 0.08304352685809135, "num_tokens": 820375.0, "step": 235 }, { "entropy": 8.500118160247803, "epoch": 0.03154159547903798, "grad_norm": 0.9140625, "learning_rate": 0.00011949999999999999, "loss": 8.1952, "mean_token_accuracy": 0.08304070755839348, "num_tokens": 838658.0, "step": 240 }, { "entropy": 8.381299304962159, "epoch": 0.03219871205151794, "grad_norm": 0.78515625, "learning_rate": 0.000122, "loss": 8.205, "mean_token_accuracy": 0.0860319972038269, "num_tokens": 856534.0, "step": 245 }, { "entropy": 8.390718936920166, "epoch": 0.0328558286239979, "grad_norm": 0.98828125, "learning_rate": 0.0001245, "loss": 8.1696, "mean_token_accuracy": 0.09368039518594742, "num_tokens": 872813.0, "step": 250 }, { "entropy": 8.36027283668518, "epoch": 0.03351294519647786, "grad_norm": 0.83984375, "learning_rate": 0.000127, "loss": 8.1428, "mean_token_accuracy": 0.09875724688172341, "num_tokens": 891675.0, "step": 255 }, { "entropy": 8.41018009185791, "epoch": 0.034170061768957816, "grad_norm": 0.8515625, "learning_rate": 0.0001295, "loss": 8.1972, "mean_token_accuracy": 0.08137553408741952, "num_tokens": 907440.0, "step": 260 }, { "entropy": 8.448321056365966, "epoch": 0.034827178341437774, "grad_norm": 0.9921875, "learning_rate": 0.000132, "loss": 8.2255, "mean_token_accuracy": 0.08277432322502136, "num_tokens": 923909.0, "step": 265 }, { "entropy": 8.386664962768554, "epoch": 0.035484294913917726, "grad_norm": 0.859375, "learning_rate": 0.00013450000000000002, "loss": 8.1077, "mean_token_accuracy": 0.09150323122739792, "num_tokens": 940658.0, "step": 270 }, { "entropy": 8.34205665588379, "epoch": 0.036141411486397684, "grad_norm": 0.8203125, "learning_rate": 0.00013700000000000002, "loss": 8.1535, "mean_token_accuracy": 0.08561521768569946, "num_tokens": 959095.0, "step": 275 }, { "entropy": 8.375339221954345, "epoch": 0.03679852805887764, "grad_norm": 0.94921875, "learning_rate": 0.0001395, "loss": 8.1774, "mean_token_accuracy": 0.08340813145041466, "num_tokens": 976656.0, "step": 280 }, { "entropy": 8.368755626678468, "epoch": 0.0374556446313576, "grad_norm": 0.8515625, "learning_rate": 0.00014199999999999998, "loss": 8.2048, "mean_token_accuracy": 0.08358296155929565, "num_tokens": 994326.0, "step": 285 }, { "entropy": 8.306324100494384, "epoch": 0.03811276120383756, "grad_norm": 0.90234375, "learning_rate": 0.0001445, "loss": 8.1147, "mean_token_accuracy": 0.0932599276304245, "num_tokens": 1011859.0, "step": 290 }, { "entropy": 8.31154556274414, "epoch": 0.03876987777631752, "grad_norm": 0.87890625, "learning_rate": 0.000147, "loss": 8.142, "mean_token_accuracy": 0.08438249453902244, "num_tokens": 1028329.0, "step": 295 }, { "entropy": 8.38582706451416, "epoch": 0.03942699434879748, "grad_norm": 0.890625, "learning_rate": 0.0001495, "loss": 8.1226, "mean_token_accuracy": 0.08788742870092392, "num_tokens": 1045519.0, "step": 300 }, { "entropy": 8.42501277923584, "epoch": 0.040084110921277435, "grad_norm": 1.265625, "learning_rate": 0.000152, "loss": 8.1104, "mean_token_accuracy": 0.09161722511053086, "num_tokens": 1063832.0, "step": 305 }, { "entropy": 8.180773544311524, "epoch": 0.040741227493757394, "grad_norm": 1.4921875, "learning_rate": 0.00015450000000000001, "loss": 8.0692, "mean_token_accuracy": 0.09160381332039833, "num_tokens": 1081062.0, "step": 310 }, { "entropy": 8.319191455841064, "epoch": 0.04139834406623735, "grad_norm": 1.0546875, "learning_rate": 0.000157, "loss": 8.1206, "mean_token_accuracy": 0.08650392666459084, "num_tokens": 1100139.0, "step": 315 }, { "entropy": 8.339826774597167, "epoch": 0.04205546063871731, "grad_norm": 1.0234375, "learning_rate": 0.0001595, "loss": 8.0878, "mean_token_accuracy": 0.08833744451403618, "num_tokens": 1117100.0, "step": 320 }, { "entropy": 8.358532238006593, "epoch": 0.04271257721119727, "grad_norm": 0.83984375, "learning_rate": 0.000162, "loss": 8.1339, "mean_token_accuracy": 0.08414132967591285, "num_tokens": 1136607.0, "step": 325 }, { "entropy": 8.360890769958496, "epoch": 0.04336969378367722, "grad_norm": 1.0859375, "learning_rate": 0.00016450000000000001, "loss": 8.1636, "mean_token_accuracy": 0.08001711294054985, "num_tokens": 1154463.0, "step": 330 }, { "entropy": 8.302077484130859, "epoch": 0.04402681035615718, "grad_norm": 0.953125, "learning_rate": 0.00016700000000000002, "loss": 8.0492, "mean_token_accuracy": 0.08888905569911003, "num_tokens": 1172540.0, "step": 335 }, { "entropy": 8.284979152679444, "epoch": 0.04468392692863714, "grad_norm": 0.87890625, "learning_rate": 0.00016950000000000003, "loss": 8.089, "mean_token_accuracy": 0.08480592146515846, "num_tokens": 1189393.0, "step": 340 }, { "entropy": 8.305260276794433, "epoch": 0.0453410435011171, "grad_norm": 1.03125, "learning_rate": 0.00017199999999999998, "loss": 8.0804, "mean_token_accuracy": 0.087804014980793, "num_tokens": 1205232.0, "step": 345 }, { "entropy": 8.235641956329346, "epoch": 0.045998160073597055, "grad_norm": 0.87890625, "learning_rate": 0.00017449999999999999, "loss": 8.0386, "mean_token_accuracy": 0.08915610313415527, "num_tokens": 1222020.0, "step": 350 }, { "entropy": 8.296236038208008, "epoch": 0.046655276646077014, "grad_norm": 0.9453125, "learning_rate": 0.000177, "loss": 8.0122, "mean_token_accuracy": 0.09561690092086791, "num_tokens": 1239201.0, "step": 355 }, { "entropy": 8.312324523925781, "epoch": 0.04731239321855697, "grad_norm": 1.0390625, "learning_rate": 0.0001795, "loss": 8.0528, "mean_token_accuracy": 0.09137414395809174, "num_tokens": 1256715.0, "step": 360 }, { "entropy": 8.276749324798583, "epoch": 0.04796950979103693, "grad_norm": 1.1484375, "learning_rate": 0.000182, "loss": 8.0682, "mean_token_accuracy": 0.08286751359701157, "num_tokens": 1273800.0, "step": 365 }, { "entropy": 8.162324810028077, "epoch": 0.04862662636351689, "grad_norm": 0.99609375, "learning_rate": 0.0001845, "loss": 8.0052, "mean_token_accuracy": 0.09242228120565414, "num_tokens": 1291181.0, "step": 370 }, { "entropy": 8.235886669158935, "epoch": 0.04928374293599685, "grad_norm": 0.90234375, "learning_rate": 0.000187, "loss": 8.088, "mean_token_accuracy": 0.08434378504753112, "num_tokens": 1309264.0, "step": 375 }, { "entropy": 8.252655410766602, "epoch": 0.049940859508476806, "grad_norm": 0.88671875, "learning_rate": 0.0001895, "loss": 7.9823, "mean_token_accuracy": 0.08949511088430881, "num_tokens": 1327117.0, "step": 380 }, { "entropy": 8.148046970367432, "epoch": 0.050597976080956765, "grad_norm": 1.3359375, "learning_rate": 0.000192, "loss": 8.0288, "mean_token_accuracy": 0.08982144668698311, "num_tokens": 1343972.0, "step": 385 }, { "entropy": 8.245464324951172, "epoch": 0.05125509265343672, "grad_norm": 1.2578125, "learning_rate": 0.0001945, "loss": 7.9572, "mean_token_accuracy": 0.08928473889827729, "num_tokens": 1361432.0, "step": 390 }, { "entropy": 8.094884061813355, "epoch": 0.051912209225916675, "grad_norm": 1.4296875, "learning_rate": 0.00019700000000000002, "loss": 7.9669, "mean_token_accuracy": 0.09419442862272262, "num_tokens": 1378191.0, "step": 395 }, { "entropy": 8.211234951019287, "epoch": 0.052569325798396634, "grad_norm": 0.875, "learning_rate": 0.00019950000000000002, "loss": 7.9813, "mean_token_accuracy": 0.08906673565506935, "num_tokens": 1395872.0, "step": 400 }, { "entropy": 8.18825888633728, "epoch": 0.05322644237087659, "grad_norm": 1.1484375, "learning_rate": 0.000202, "loss": 7.9578, "mean_token_accuracy": 0.09145129919052124, "num_tokens": 1412816.0, "step": 405 }, { "entropy": 8.134449100494384, "epoch": 0.05388355894335655, "grad_norm": 2.1875, "learning_rate": 0.00020449999999999998, "loss": 7.8935, "mean_token_accuracy": 0.10044471621513366, "num_tokens": 1430644.0, "step": 410 }, { "entropy": 8.148541164398193, "epoch": 0.05454067551583651, "grad_norm": 1.015625, "learning_rate": 0.000207, "loss": 7.9432, "mean_token_accuracy": 0.09160158559679984, "num_tokens": 1448021.0, "step": 415 }, { "entropy": 8.23169984817505, "epoch": 0.05519779208831647, "grad_norm": 0.84765625, "learning_rate": 0.0002095, "loss": 7.9585, "mean_token_accuracy": 0.09313838183879852, "num_tokens": 1466428.0, "step": 420 }, { "entropy": 8.167637252807618, "epoch": 0.055854908660796426, "grad_norm": 1.0625, "learning_rate": 0.000212, "loss": 7.8798, "mean_token_accuracy": 0.09942131265997886, "num_tokens": 1484554.0, "step": 425 }, { "entropy": 8.104038047790528, "epoch": 0.056512025233276385, "grad_norm": 1.34375, "learning_rate": 0.0002145, "loss": 7.8905, "mean_token_accuracy": 0.09655392467975617, "num_tokens": 1500452.0, "step": 430 }, { "entropy": 8.07980990409851, "epoch": 0.05716914180575634, "grad_norm": 1.0, "learning_rate": 0.00021700000000000002, "loss": 7.9718, "mean_token_accuracy": 0.0888563945889473, "num_tokens": 1518482.0, "step": 435 }, { "entropy": 8.099183750152587, "epoch": 0.0578262583782363, "grad_norm": 1.1171875, "learning_rate": 0.0002195, "loss": 7.9304, "mean_token_accuracy": 0.0907039225101471, "num_tokens": 1536107.0, "step": 440 }, { "entropy": 8.13019618988037, "epoch": 0.05848337495071626, "grad_norm": 1.015625, "learning_rate": 0.000222, "loss": 7.9209, "mean_token_accuracy": 0.08752450793981552, "num_tokens": 1553722.0, "step": 445 }, { "entropy": 8.061606645584106, "epoch": 0.05914049152319621, "grad_norm": 0.92578125, "learning_rate": 0.0002245, "loss": 7.878, "mean_token_accuracy": 0.09788650721311569, "num_tokens": 1571959.0, "step": 450 }, { "entropy": 8.092618274688721, "epoch": 0.05979760809567617, "grad_norm": 0.98828125, "learning_rate": 0.00022700000000000002, "loss": 7.965, "mean_token_accuracy": 0.08797019943594933, "num_tokens": 1588595.0, "step": 455 }, { "entropy": 8.051505088806152, "epoch": 0.06045472466815613, "grad_norm": 0.828125, "learning_rate": 0.00022950000000000002, "loss": 7.8329, "mean_token_accuracy": 0.08995860144495964, "num_tokens": 1605185.0, "step": 460 }, { "entropy": 8.061400985717773, "epoch": 0.06111184124063609, "grad_norm": 0.90625, "learning_rate": 0.00023200000000000003, "loss": 7.8334, "mean_token_accuracy": 0.0945149227976799, "num_tokens": 1622966.0, "step": 465 }, { "entropy": 8.077755498886109, "epoch": 0.061768957813116046, "grad_norm": 1.0390625, "learning_rate": 0.00023449999999999998, "loss": 7.8267, "mean_token_accuracy": 0.09398441277444362, "num_tokens": 1639697.0, "step": 470 }, { "entropy": 8.02926688194275, "epoch": 0.062426074385596005, "grad_norm": 0.92578125, "learning_rate": 0.000237, "loss": 7.851, "mean_token_accuracy": 0.09462198317050934, "num_tokens": 1656342.0, "step": 475 }, { "entropy": 8.030053997039795, "epoch": 0.06308319095807596, "grad_norm": 1.0859375, "learning_rate": 0.0002395, "loss": 7.9004, "mean_token_accuracy": 0.09348834380507469, "num_tokens": 1673829.0, "step": 480 }, { "entropy": 8.142562198638917, "epoch": 0.06374030753055591, "grad_norm": 0.84765625, "learning_rate": 0.000242, "loss": 7.9383, "mean_token_accuracy": 0.08797306269407272, "num_tokens": 1691938.0, "step": 485 }, { "entropy": 7.987461423873901, "epoch": 0.06439742410303588, "grad_norm": 1.0, "learning_rate": 0.0002445, "loss": 7.8913, "mean_token_accuracy": 0.09134467840194702, "num_tokens": 1708545.0, "step": 490 }, { "entropy": 7.951012325286865, "epoch": 0.06505454067551583, "grad_norm": 0.83203125, "learning_rate": 0.000247, "loss": 7.8445, "mean_token_accuracy": 0.09492667466402054, "num_tokens": 1725199.0, "step": 495 }, { "entropy": 8.079988193511962, "epoch": 0.0657116572479958, "grad_norm": 1.03125, "learning_rate": 0.0002495, "loss": 7.8607, "mean_token_accuracy": 0.09226195812225342, "num_tokens": 1742893.0, "step": 500 }, { "entropy": 8.04035177230835, "epoch": 0.06636877382047575, "grad_norm": 0.9453125, "learning_rate": 0.000252, "loss": 7.8558, "mean_token_accuracy": 0.09375119879841805, "num_tokens": 1759540.0, "step": 505 }, { "entropy": 8.108158254623413, "epoch": 0.06702589039295571, "grad_norm": 0.8984375, "learning_rate": 0.0002545, "loss": 7.8746, "mean_token_accuracy": 0.0892824463546276, "num_tokens": 1776617.0, "step": 510 }, { "entropy": 7.932979726791382, "epoch": 0.06768300696543567, "grad_norm": 0.99609375, "learning_rate": 0.000257, "loss": 7.8364, "mean_token_accuracy": 0.0924128919839859, "num_tokens": 1795065.0, "step": 515 }, { "entropy": 8.049097728729247, "epoch": 0.06834012353791563, "grad_norm": 0.94140625, "learning_rate": 0.0002595, "loss": 7.8169, "mean_token_accuracy": 0.08902051150798798, "num_tokens": 1811477.0, "step": 520 }, { "entropy": 8.031516742706298, "epoch": 0.06899724011039558, "grad_norm": 0.953125, "learning_rate": 0.000262, "loss": 7.8404, "mean_token_accuracy": 0.09564107805490493, "num_tokens": 1829272.0, "step": 525 }, { "entropy": 8.003777980804443, "epoch": 0.06965435668287555, "grad_norm": 0.9296875, "learning_rate": 0.00026450000000000003, "loss": 7.8549, "mean_token_accuracy": 0.08890713900327682, "num_tokens": 1845882.0, "step": 530 }, { "entropy": 8.024421834945679, "epoch": 0.0703114732553555, "grad_norm": 0.953125, "learning_rate": 0.00026700000000000004, "loss": 7.8113, "mean_token_accuracy": 0.09261564016342164, "num_tokens": 1861000.0, "step": 535 }, { "entropy": 8.050934314727783, "epoch": 0.07096858982783545, "grad_norm": 1.1015625, "learning_rate": 0.00026950000000000005, "loss": 7.8551, "mean_token_accuracy": 0.08385444208979606, "num_tokens": 1876979.0, "step": 540 }, { "entropy": 7.997040605545044, "epoch": 0.07162570640031542, "grad_norm": 0.82421875, "learning_rate": 0.00027200000000000005, "loss": 7.8555, "mean_token_accuracy": 0.08732549175620079, "num_tokens": 1895191.0, "step": 545 }, { "entropy": 7.934540605545044, "epoch": 0.07228282297279537, "grad_norm": 0.96484375, "learning_rate": 0.0002745, "loss": 7.7701, "mean_token_accuracy": 0.08872183412313461, "num_tokens": 1912466.0, "step": 550 }, { "entropy": 7.969846534729004, "epoch": 0.07293993954527533, "grad_norm": 1.0390625, "learning_rate": 0.000277, "loss": 7.7246, "mean_token_accuracy": 0.09994208216667175, "num_tokens": 1932285.0, "step": 555 }, { "entropy": 8.008286952972412, "epoch": 0.07359705611775529, "grad_norm": 1.15625, "learning_rate": 0.0002795, "loss": 7.7973, "mean_token_accuracy": 0.08675110414624214, "num_tokens": 1948437.0, "step": 560 }, { "entropy": 7.939477729797363, "epoch": 0.07425417269023525, "grad_norm": 1.4453125, "learning_rate": 0.00028199999999999997, "loss": 7.8076, "mean_token_accuracy": 0.08641846030950547, "num_tokens": 1964579.0, "step": 565 }, { "entropy": 7.910443115234375, "epoch": 0.0749112892627152, "grad_norm": 0.9921875, "learning_rate": 0.0002845, "loss": 7.7054, "mean_token_accuracy": 0.10115818828344345, "num_tokens": 1981247.0, "step": 570 }, { "entropy": 7.956994104385376, "epoch": 0.07556840583519517, "grad_norm": 0.8359375, "learning_rate": 0.000287, "loss": 7.7938, "mean_token_accuracy": 0.09043643400073051, "num_tokens": 1999031.0, "step": 575 }, { "entropy": 7.981093311309815, "epoch": 0.07622552240767512, "grad_norm": 0.8515625, "learning_rate": 0.0002895, "loss": 7.7212, "mean_token_accuracy": 0.09121812731027604, "num_tokens": 2015715.0, "step": 580 }, { "entropy": 7.911635208129883, "epoch": 0.07688263898015509, "grad_norm": 0.94140625, "learning_rate": 0.000292, "loss": 7.7238, "mean_token_accuracy": 0.09262361451983452, "num_tokens": 2032235.0, "step": 585 }, { "entropy": 7.910367107391357, "epoch": 0.07753975555263504, "grad_norm": 0.9921875, "learning_rate": 0.0002945, "loss": 7.7125, "mean_token_accuracy": 0.09460373297333717, "num_tokens": 2050378.0, "step": 590 }, { "entropy": 7.8812439918518065, "epoch": 0.078196872125115, "grad_norm": 0.90234375, "learning_rate": 0.000297, "loss": 7.7713, "mean_token_accuracy": 0.08955961838364601, "num_tokens": 2067713.0, "step": 595 }, { "entropy": 7.799747514724731, "epoch": 0.07885398869759495, "grad_norm": 0.98828125, "learning_rate": 0.0002995, "loss": 7.6174, "mean_token_accuracy": 0.09769630283117295, "num_tokens": 2086602.0, "step": 600 }, { "entropy": 7.92856650352478, "epoch": 0.0795111052700749, "grad_norm": 0.9453125, "learning_rate": 0.000302, "loss": 7.5796, "mean_token_accuracy": 0.09621628671884537, "num_tokens": 2103142.0, "step": 605 }, { "entropy": 7.727544260025025, "epoch": 0.08016822184255487, "grad_norm": 1.0625, "learning_rate": 0.0003045, "loss": 7.5822, "mean_token_accuracy": 0.09833648353815079, "num_tokens": 2120792.0, "step": 610 }, { "entropy": 7.851658725738526, "epoch": 0.08082533841503482, "grad_norm": 0.96484375, "learning_rate": 0.000307, "loss": 7.6633, "mean_token_accuracy": 0.1018780030310154, "num_tokens": 2137688.0, "step": 615 }, { "entropy": 7.81537652015686, "epoch": 0.08148245498751479, "grad_norm": 0.875, "learning_rate": 0.0003095, "loss": 7.7289, "mean_token_accuracy": 0.0900080993771553, "num_tokens": 2155353.0, "step": 620 }, { "entropy": 7.8868913650512695, "epoch": 0.08213957155999474, "grad_norm": 0.9765625, "learning_rate": 0.000312, "loss": 7.6782, "mean_token_accuracy": 0.09196878299117088, "num_tokens": 2173999.0, "step": 625 }, { "entropy": 7.794561433792114, "epoch": 0.0827966881324747, "grad_norm": 1.03125, "learning_rate": 0.0003145, "loss": 7.6572, "mean_token_accuracy": 0.0915692389011383, "num_tokens": 2190657.0, "step": 630 }, { "entropy": 7.878007602691651, "epoch": 0.08345380470495466, "grad_norm": 0.91796875, "learning_rate": 0.000317, "loss": 7.6938, "mean_token_accuracy": 0.09030900672078132, "num_tokens": 2207512.0, "step": 635 }, { "entropy": 7.812237787246704, "epoch": 0.08411092127743462, "grad_norm": 0.9453125, "learning_rate": 0.0003195, "loss": 7.6791, "mean_token_accuracy": 0.09167201295495034, "num_tokens": 2224911.0, "step": 640 }, { "entropy": 7.797879552841186, "epoch": 0.08476803784991457, "grad_norm": 1.015625, "learning_rate": 0.000322, "loss": 7.6568, "mean_token_accuracy": 0.0889101818203926, "num_tokens": 2244030.0, "step": 645 }, { "entropy": 7.85651330947876, "epoch": 0.08542515442239454, "grad_norm": 1.546875, "learning_rate": 0.00032450000000000003, "loss": 7.6423, "mean_token_accuracy": 0.0900063842535019, "num_tokens": 2260550.0, "step": 650 }, { "entropy": 7.780899906158448, "epoch": 0.08608227099487449, "grad_norm": 0.87109375, "learning_rate": 0.00032700000000000003, "loss": 7.7007, "mean_token_accuracy": 0.0889291986823082, "num_tokens": 2277732.0, "step": 655 }, { "entropy": 7.779685974121094, "epoch": 0.08673938756735444, "grad_norm": 1.0625, "learning_rate": 0.00032950000000000004, "loss": 7.58, "mean_token_accuracy": 0.09410673379898071, "num_tokens": 2294074.0, "step": 660 }, { "entropy": 7.794468116760254, "epoch": 0.08739650413983441, "grad_norm": 0.92578125, "learning_rate": 0.00033200000000000005, "loss": 7.6426, "mean_token_accuracy": 0.09421529322862625, "num_tokens": 2309118.0, "step": 665 }, { "entropy": 7.813050365447998, "epoch": 0.08805362071231436, "grad_norm": 0.9375, "learning_rate": 0.00033450000000000005, "loss": 7.6292, "mean_token_accuracy": 0.09069699347019196, "num_tokens": 2327193.0, "step": 670 }, { "entropy": 7.743873262405396, "epoch": 0.08871073728479432, "grad_norm": 0.88671875, "learning_rate": 0.000337, "loss": 7.5902, "mean_token_accuracy": 0.09050673618912697, "num_tokens": 2344357.0, "step": 675 }, { "entropy": 7.736028623580933, "epoch": 0.08936785385727428, "grad_norm": 0.86328125, "learning_rate": 0.0003395, "loss": 7.5732, "mean_token_accuracy": 0.09712009504437447, "num_tokens": 2361933.0, "step": 680 }, { "entropy": 7.702030611038208, "epoch": 0.09002497042975424, "grad_norm": 0.9453125, "learning_rate": 0.000342, "loss": 7.5759, "mean_token_accuracy": 0.09285529553890229, "num_tokens": 2377774.0, "step": 685 }, { "entropy": 7.651546764373779, "epoch": 0.0906820870022342, "grad_norm": 0.92578125, "learning_rate": 0.00034449999999999997, "loss": 7.4294, "mean_token_accuracy": 0.11124403774738312, "num_tokens": 2395363.0, "step": 690 }, { "entropy": 7.507357358932495, "epoch": 0.09133920357471416, "grad_norm": 0.89453125, "learning_rate": 0.000347, "loss": 7.4995, "mean_token_accuracy": 0.1047697126865387, "num_tokens": 2413270.0, "step": 695 }, { "entropy": 7.713213491439819, "epoch": 0.09199632014719411, "grad_norm": 1.140625, "learning_rate": 0.0003495, "loss": 7.5303, "mean_token_accuracy": 0.09587173163890839, "num_tokens": 2432077.0, "step": 700 }, { "entropy": 7.674976873397827, "epoch": 0.09265343671967408, "grad_norm": 0.91015625, "learning_rate": 0.000352, "loss": 7.6357, "mean_token_accuracy": 0.09107815846800804, "num_tokens": 2449541.0, "step": 705 }, { "entropy": 7.67608757019043, "epoch": 0.09331055329215403, "grad_norm": 1.109375, "learning_rate": 0.0003545, "loss": 7.5318, "mean_token_accuracy": 0.09878497794270516, "num_tokens": 2466375.0, "step": 710 }, { "entropy": 7.702895450592041, "epoch": 0.09396766986463398, "grad_norm": 0.828125, "learning_rate": 0.000357, "loss": 7.6132, "mean_token_accuracy": 0.0879031240940094, "num_tokens": 2483793.0, "step": 715 }, { "entropy": 7.7163526058197025, "epoch": 0.09462478643711394, "grad_norm": 0.90234375, "learning_rate": 0.0003595, "loss": 7.5686, "mean_token_accuracy": 0.0924137331545353, "num_tokens": 2500689.0, "step": 720 }, { "entropy": 7.652881479263305, "epoch": 0.0952819030095939, "grad_norm": 0.95703125, "learning_rate": 0.000362, "loss": 7.4627, "mean_token_accuracy": 0.10279997587203979, "num_tokens": 2517867.0, "step": 725 }, { "entropy": 7.693321084976196, "epoch": 0.09593901958207386, "grad_norm": 0.99609375, "learning_rate": 0.0003645, "loss": 7.5954, "mean_token_accuracy": 0.09244397953152657, "num_tokens": 2536356.0, "step": 730 }, { "entropy": 7.569602060317993, "epoch": 0.09659613615455381, "grad_norm": 0.8515625, "learning_rate": 0.000367, "loss": 7.4796, "mean_token_accuracy": 0.09813716039061546, "num_tokens": 2552821.0, "step": 735 }, { "entropy": 7.72858157157898, "epoch": 0.09725325272703378, "grad_norm": 0.8671875, "learning_rate": 0.0003695, "loss": 7.595, "mean_token_accuracy": 0.09159181639552116, "num_tokens": 2570098.0, "step": 740 }, { "entropy": 7.5410655498504635, "epoch": 0.09791036929951373, "grad_norm": 1.578125, "learning_rate": 0.000372, "loss": 7.3465, "mean_token_accuracy": 0.11115500703454018, "num_tokens": 2587508.0, "step": 745 }, { "entropy": 7.601456546783448, "epoch": 0.0985674858719937, "grad_norm": 1.046875, "learning_rate": 0.0003745, "loss": 7.5464, "mean_token_accuracy": 0.09635312631726264, "num_tokens": 2604845.0, "step": 750 }, { "entropy": 7.641898345947266, "epoch": 0.09922460244447365, "grad_norm": 0.98828125, "learning_rate": 0.000377, "loss": 7.5835, "mean_token_accuracy": 0.0863256387412548, "num_tokens": 2623281.0, "step": 755 }, { "entropy": 7.665192556381226, "epoch": 0.09988171901695361, "grad_norm": 0.93359375, "learning_rate": 0.0003795, "loss": 7.5832, "mean_token_accuracy": 0.09262030571699142, "num_tokens": 2641315.0, "step": 760 }, { "entropy": 7.523155879974365, "epoch": 0.10053883558943356, "grad_norm": 0.94921875, "learning_rate": 0.000382, "loss": 7.4307, "mean_token_accuracy": 0.11434739604592323, "num_tokens": 2658404.0, "step": 765 }, { "entropy": 7.55363826751709, "epoch": 0.10119595216191353, "grad_norm": 1.21875, "learning_rate": 0.0003845, "loss": 7.4513, "mean_token_accuracy": 0.10143931359052658, "num_tokens": 2675980.0, "step": 770 }, { "entropy": 7.607959318161011, "epoch": 0.10185306873439348, "grad_norm": 0.9140625, "learning_rate": 0.00038700000000000003, "loss": 7.4692, "mean_token_accuracy": 0.10197424218058586, "num_tokens": 2694290.0, "step": 775 }, { "entropy": 7.581793880462646, "epoch": 0.10251018530687343, "grad_norm": 0.890625, "learning_rate": 0.00038950000000000003, "loss": 7.5235, "mean_token_accuracy": 0.09472638443112373, "num_tokens": 2710661.0, "step": 780 }, { "entropy": 7.651349306106567, "epoch": 0.1031673018793534, "grad_norm": 1.109375, "learning_rate": 0.00039200000000000004, "loss": 7.523, "mean_token_accuracy": 0.09317268952727317, "num_tokens": 2728660.0, "step": 785 }, { "entropy": 7.531972074508667, "epoch": 0.10382441845183335, "grad_norm": 1.1953125, "learning_rate": 0.00039450000000000005, "loss": 7.4728, "mean_token_accuracy": 0.09988932237029076, "num_tokens": 2745130.0, "step": 790 }, { "entropy": 7.562900590896606, "epoch": 0.10448153502431332, "grad_norm": 0.8984375, "learning_rate": 0.00039700000000000005, "loss": 7.4529, "mean_token_accuracy": 0.0973394624888897, "num_tokens": 2762001.0, "step": 795 }, { "entropy": 7.580878829956054, "epoch": 0.10513865159679327, "grad_norm": 0.8359375, "learning_rate": 0.0003995, "loss": 7.4957, "mean_token_accuracy": 0.09426558315753937, "num_tokens": 2778634.0, "step": 800 }, { "entropy": 7.577242612838745, "epoch": 0.10579576816927323, "grad_norm": 0.828125, "learning_rate": 0.000402, "loss": 7.5104, "mean_token_accuracy": 0.0927124135196209, "num_tokens": 2795207.0, "step": 805 }, { "entropy": 7.537419080734253, "epoch": 0.10645288474175318, "grad_norm": 0.83984375, "learning_rate": 0.0004045, "loss": 7.3978, "mean_token_accuracy": 0.10554074496030807, "num_tokens": 2813506.0, "step": 810 }, { "entropy": 7.516330528259277, "epoch": 0.10711000131423315, "grad_norm": 0.8984375, "learning_rate": 0.00040699999999999997, "loss": 7.4253, "mean_token_accuracy": 0.0940089389681816, "num_tokens": 2829732.0, "step": 815 }, { "entropy": 7.539044332504273, "epoch": 0.1077671178867131, "grad_norm": 0.921875, "learning_rate": 0.0004095, "loss": 7.46, "mean_token_accuracy": 0.09880606159567833, "num_tokens": 2846436.0, "step": 820 }, { "entropy": 7.575464391708374, "epoch": 0.10842423445919307, "grad_norm": 1.4453125, "learning_rate": 0.000412, "loss": 7.491, "mean_token_accuracy": 0.09248777329921723, "num_tokens": 2864719.0, "step": 825 }, { "entropy": 7.577031135559082, "epoch": 0.10908135103167302, "grad_norm": 0.97265625, "learning_rate": 0.0004145, "loss": 7.4707, "mean_token_accuracy": 0.09447416216135025, "num_tokens": 2881566.0, "step": 830 }, { "entropy": 7.481828498840332, "epoch": 0.10973846760415297, "grad_norm": 0.9140625, "learning_rate": 0.000417, "loss": 7.3937, "mean_token_accuracy": 0.09647827595472336, "num_tokens": 2899034.0, "step": 835 }, { "entropy": 7.493137073516846, "epoch": 0.11039558417663294, "grad_norm": 0.87890625, "learning_rate": 0.0004195, "loss": 7.4897, "mean_token_accuracy": 0.09726456999778747, "num_tokens": 2915773.0, "step": 840 }, { "entropy": 7.474357795715332, "epoch": 0.11105270074911289, "grad_norm": 1.0390625, "learning_rate": 0.000422, "loss": 7.4534, "mean_token_accuracy": 0.08885478526353836, "num_tokens": 2933718.0, "step": 845 }, { "entropy": 7.565765857696533, "epoch": 0.11170981732159285, "grad_norm": 1.1796875, "learning_rate": 0.0004245, "loss": 7.4222, "mean_token_accuracy": 0.09584522470831872, "num_tokens": 2951690.0, "step": 850 }, { "entropy": 7.415678358078003, "epoch": 0.1123669338940728, "grad_norm": 0.875, "learning_rate": 0.000427, "loss": 7.4284, "mean_token_accuracy": 0.10300374701619149, "num_tokens": 2969331.0, "step": 855 }, { "entropy": 7.552033138275147, "epoch": 0.11302405046655277, "grad_norm": 0.8359375, "learning_rate": 0.0004295, "loss": 7.4741, "mean_token_accuracy": 0.09474552050232887, "num_tokens": 2985229.0, "step": 860 }, { "entropy": 7.461298561096191, "epoch": 0.11368116703903272, "grad_norm": 0.8828125, "learning_rate": 0.000432, "loss": 7.4336, "mean_token_accuracy": 0.08998932093381881, "num_tokens": 3001075.0, "step": 865 }, { "entropy": 7.452679061889649, "epoch": 0.11433828361151269, "grad_norm": 1.0234375, "learning_rate": 0.0004345, "loss": 7.3945, "mean_token_accuracy": 0.09610669687390327, "num_tokens": 3018095.0, "step": 870 }, { "entropy": 7.448093366622925, "epoch": 0.11499540018399264, "grad_norm": 0.9765625, "learning_rate": 0.000437, "loss": 7.3951, "mean_token_accuracy": 0.1022491253912449, "num_tokens": 3035726.0, "step": 875 }, { "entropy": 7.428170299530029, "epoch": 0.1156525167564726, "grad_norm": 0.91796875, "learning_rate": 0.0004395, "loss": 7.3273, "mean_token_accuracy": 0.10195292830467224, "num_tokens": 3052054.0, "step": 880 }, { "entropy": 7.476611471176147, "epoch": 0.11630963332895256, "grad_norm": 0.83203125, "learning_rate": 0.000442, "loss": 7.4027, "mean_token_accuracy": 0.09874287694692611, "num_tokens": 3069350.0, "step": 885 }, { "entropy": 7.442331171035766, "epoch": 0.11696674990143252, "grad_norm": 0.94140625, "learning_rate": 0.0004445, "loss": 7.3826, "mean_token_accuracy": 0.09821617379784583, "num_tokens": 3085891.0, "step": 890 }, { "entropy": 7.453686094284057, "epoch": 0.11762386647391247, "grad_norm": 0.84375, "learning_rate": 0.000447, "loss": 7.4196, "mean_token_accuracy": 0.09896242916584015, "num_tokens": 3103571.0, "step": 895 }, { "entropy": 7.417425680160522, "epoch": 0.11828098304639242, "grad_norm": 0.98046875, "learning_rate": 0.00044950000000000003, "loss": 7.3775, "mean_token_accuracy": 0.1023717314004898, "num_tokens": 3120883.0, "step": 900 }, { "entropy": 7.509283113479614, "epoch": 0.11893809961887239, "grad_norm": 0.94921875, "learning_rate": 0.00045200000000000004, "loss": 7.4598, "mean_token_accuracy": 0.09272672832012177, "num_tokens": 3140137.0, "step": 905 }, { "entropy": 7.376467370986939, "epoch": 0.11959521619135234, "grad_norm": 0.90234375, "learning_rate": 0.00045450000000000004, "loss": 7.3768, "mean_token_accuracy": 0.09941514804959298, "num_tokens": 3157118.0, "step": 910 }, { "entropy": 7.486584043502807, "epoch": 0.1202523327638323, "grad_norm": 0.8515625, "learning_rate": 0.00045700000000000005, "loss": 7.4627, "mean_token_accuracy": 0.089472546428442, "num_tokens": 3174967.0, "step": 915 }, { "entropy": 7.364890909194946, "epoch": 0.12090944933631226, "grad_norm": 0.875, "learning_rate": 0.00045950000000000006, "loss": 7.3251, "mean_token_accuracy": 0.10790883004665375, "num_tokens": 3193791.0, "step": 920 }, { "entropy": 7.424156236648559, "epoch": 0.12156656590879222, "grad_norm": 1.171875, "learning_rate": 0.000462, "loss": 7.3888, "mean_token_accuracy": 0.10138912200927734, "num_tokens": 3212807.0, "step": 925 }, { "entropy": 7.483264064788818, "epoch": 0.12222368248127218, "grad_norm": 0.7890625, "learning_rate": 0.0004645, "loss": 7.4603, "mean_token_accuracy": 0.09148271009325981, "num_tokens": 3229945.0, "step": 930 }, { "entropy": 7.443746614456177, "epoch": 0.12288079905375214, "grad_norm": 0.88671875, "learning_rate": 0.000467, "loss": 7.4491, "mean_token_accuracy": 0.0934921719133854, "num_tokens": 3248333.0, "step": 935 }, { "entropy": 7.459245109558106, "epoch": 0.12353791562623209, "grad_norm": 0.91796875, "learning_rate": 0.0004695, "loss": 7.3967, "mean_token_accuracy": 0.09736947789788246, "num_tokens": 3266344.0, "step": 940 }, { "entropy": 7.429486465454102, "epoch": 0.12419503219871206, "grad_norm": 0.890625, "learning_rate": 0.000472, "loss": 7.4148, "mean_token_accuracy": 0.10019433051347733, "num_tokens": 3283346.0, "step": 945 }, { "entropy": 7.285105895996094, "epoch": 0.12485214877119201, "grad_norm": 0.8046875, "learning_rate": 0.0004745, "loss": 7.1709, "mean_token_accuracy": 0.11596085354685784, "num_tokens": 3301983.0, "step": 950 }, { "entropy": 7.412484455108642, "epoch": 0.12550926534367196, "grad_norm": 0.82421875, "learning_rate": 0.000477, "loss": 7.3552, "mean_token_accuracy": 0.10020338520407676, "num_tokens": 3320075.0, "step": 955 }, { "entropy": 7.315499114990234, "epoch": 0.12616638191615193, "grad_norm": 0.87109375, "learning_rate": 0.0004795, "loss": 7.291, "mean_token_accuracy": 0.09955885633826256, "num_tokens": 3337782.0, "step": 960 }, { "entropy": 7.315990972518921, "epoch": 0.1268234984886319, "grad_norm": 0.8671875, "learning_rate": 0.000482, "loss": 7.3124, "mean_token_accuracy": 0.09781972020864486, "num_tokens": 3355114.0, "step": 965 }, { "entropy": 7.252899885177612, "epoch": 0.12748061506111183, "grad_norm": 1.0703125, "learning_rate": 0.0004845, "loss": 7.1967, "mean_token_accuracy": 0.10971798375248909, "num_tokens": 3372664.0, "step": 970 }, { "entropy": 7.372587108612061, "epoch": 0.1281377316335918, "grad_norm": 0.83203125, "learning_rate": 0.000487, "loss": 7.2742, "mean_token_accuracy": 0.10190480425953866, "num_tokens": 3389687.0, "step": 975 }, { "entropy": 7.19590539932251, "epoch": 0.12879484820607176, "grad_norm": 0.84765625, "learning_rate": 0.0004895, "loss": 7.2387, "mean_token_accuracy": 0.10876442939043045, "num_tokens": 3406613.0, "step": 980 }, { "entropy": 7.346618175506592, "epoch": 0.12945196477855173, "grad_norm": 0.9296875, "learning_rate": 0.000492, "loss": 7.4155, "mean_token_accuracy": 0.09423026889562607, "num_tokens": 3425530.0, "step": 985 }, { "entropy": 7.372848224639893, "epoch": 0.13010908135103166, "grad_norm": 0.94140625, "learning_rate": 0.0004945, "loss": 7.3894, "mean_token_accuracy": 0.09545382708311081, "num_tokens": 3442988.0, "step": 990 }, { "entropy": 7.38320107460022, "epoch": 0.13076619792351163, "grad_norm": 0.91796875, "learning_rate": 0.000497, "loss": 7.3628, "mean_token_accuracy": 0.09607246294617652, "num_tokens": 3460763.0, "step": 995 }, { "entropy": 7.417674016952515, "epoch": 0.1314233144959916, "grad_norm": 0.8671875, "learning_rate": 0.0004995, "loss": 7.3943, "mean_token_accuracy": 0.09602649509906769, "num_tokens": 3479425.0, "step": 1000 }, { "entropy": 7.343002462387085, "epoch": 0.13208043106847156, "grad_norm": 0.89453125, "learning_rate": 0.000499998026082006, "loss": 7.3564, "mean_token_accuracy": 0.09569800049066543, "num_tokens": 3497403.0, "step": 1005 }, { "entropy": 7.324274969100952, "epoch": 0.1327375476409515, "grad_norm": 0.85546875, "learning_rate": 0.0004999900070995136, "loss": 7.2737, "mean_token_accuracy": 0.09939010664820672, "num_tokens": 3514376.0, "step": 1010 }, { "entropy": 7.334035348892212, "epoch": 0.13339466421343146, "grad_norm": 0.8359375, "learning_rate": 0.0004999758199023239, "loss": 7.2586, "mean_token_accuracy": 0.10601741299033166, "num_tokens": 3532288.0, "step": 1015 }, { "entropy": 7.304716682434082, "epoch": 0.13405178078591143, "grad_norm": 0.83203125, "learning_rate": 0.0004999554648793858, "loss": 7.3554, "mean_token_accuracy": 0.09575305506587029, "num_tokens": 3549354.0, "step": 1020 }, { "entropy": 7.30626745223999, "epoch": 0.13470889735839137, "grad_norm": 0.79296875, "learning_rate": 0.0004999289425887425, "loss": 7.3139, "mean_token_accuracy": 0.09804008454084397, "num_tokens": 3569161.0, "step": 1025 }, { "entropy": 7.337455797195434, "epoch": 0.13536601393087133, "grad_norm": 0.86328125, "learning_rate": 0.0004998962537575161, "loss": 7.385, "mean_token_accuracy": 0.09783728495240211, "num_tokens": 3586165.0, "step": 1030 }, { "entropy": 7.395480298995972, "epoch": 0.1360231305033513, "grad_norm": 0.87109375, "learning_rate": 0.0004998573992818874, "loss": 7.3912, "mean_token_accuracy": 0.09173386469483376, "num_tokens": 3604938.0, "step": 1035 }, { "entropy": 7.343952703475952, "epoch": 0.13668024707583126, "grad_norm": 1.3125, "learning_rate": 0.0004998123802270715, "loss": 7.3583, "mean_token_accuracy": 0.09979218170046807, "num_tokens": 3621850.0, "step": 1040 }, { "entropy": 7.169143867492676, "epoch": 0.1373373636483112, "grad_norm": 0.90234375, "learning_rate": 0.0004997611978272886, "loss": 7.1837, "mean_token_accuracy": 0.10983845517039299, "num_tokens": 3641860.0, "step": 1045 }, { "entropy": 7.344118547439575, "epoch": 0.13799448022079117, "grad_norm": 0.921875, "learning_rate": 0.0004997038534857298, "loss": 7.2699, "mean_token_accuracy": 0.09669720306992531, "num_tokens": 3659086.0, "step": 1050 }, { "entropy": 7.209481334686279, "epoch": 0.13865159679327113, "grad_norm": 0.77734375, "learning_rate": 0.0004996403487745194, "loss": 7.3641, "mean_token_accuracy": 0.09310299232602119, "num_tokens": 3676971.0, "step": 1055 }, { "entropy": 7.406137371063233, "epoch": 0.1393087133657511, "grad_norm": 0.78515625, "learning_rate": 0.000499570685434671, "loss": 7.2983, "mean_token_accuracy": 0.09514517113566398, "num_tokens": 3696163.0, "step": 1060 }, { "entropy": 7.265346097946167, "epoch": 0.13996582993823103, "grad_norm": 0.83984375, "learning_rate": 0.0004994948653760405, "loss": 7.3231, "mean_token_accuracy": 0.09595919102430343, "num_tokens": 3713140.0, "step": 1065 }, { "entropy": 7.286369800567627, "epoch": 0.140622946510711, "grad_norm": 0.86328125, "learning_rate": 0.0004994128906772729, "loss": 7.2661, "mean_token_accuracy": 0.09544462934136391, "num_tokens": 3730600.0, "step": 1070 }, { "entropy": 7.2847730159759525, "epoch": 0.14128006308319097, "grad_norm": 0.86328125, "learning_rate": 0.000499324763585746, "loss": 7.3234, "mean_token_accuracy": 0.10120683461427689, "num_tokens": 3747866.0, "step": 1075 }, { "entropy": 7.184893703460693, "epoch": 0.1419371796556709, "grad_norm": 0.99609375, "learning_rate": 0.0004992304865175085, "loss": 7.1738, "mean_token_accuracy": 0.11132644340395928, "num_tokens": 3765444.0, "step": 1080 }, { "entropy": 7.333232975006103, "epoch": 0.14259429622815087, "grad_norm": 0.921875, "learning_rate": 0.0004991300620572138, "loss": 7.3202, "mean_token_accuracy": 0.09391410201787949, "num_tokens": 3781970.0, "step": 1085 }, { "entropy": 7.304718732833862, "epoch": 0.14325141280063083, "grad_norm": 0.91015625, "learning_rate": 0.0004990234929580494, "loss": 7.2165, "mean_token_accuracy": 0.10574242919683456, "num_tokens": 3799884.0, "step": 1090 }, { "entropy": 7.2470235347747805, "epoch": 0.1439085293731108, "grad_norm": 0.81640625, "learning_rate": 0.0004989107821416609, "loss": 7.261, "mean_token_accuracy": 0.09376102611422539, "num_tokens": 3816300.0, "step": 1095 }, { "entropy": 7.350685548782349, "epoch": 0.14456564594559074, "grad_norm": 0.80078125, "learning_rate": 0.0004987919326980723, "loss": 7.3215, "mean_token_accuracy": 0.09178780242800713, "num_tokens": 3835268.0, "step": 1100 }, { "entropy": 7.30710916519165, "epoch": 0.1452227625180707, "grad_norm": 0.8515625, "learning_rate": 0.0004986669478856011, "loss": 7.2716, "mean_token_accuracy": 0.10289521887898445, "num_tokens": 3852209.0, "step": 1105 }, { "entropy": 7.262703132629395, "epoch": 0.14587987909055067, "grad_norm": 0.89453125, "learning_rate": 0.0004985358311307688, "loss": 7.298, "mean_token_accuracy": 0.09492710009217262, "num_tokens": 3869024.0, "step": 1110 }, { "entropy": 7.169306993484497, "epoch": 0.14653699566303063, "grad_norm": 0.87890625, "learning_rate": 0.0004983985860282081, "loss": 7.1996, "mean_token_accuracy": 0.1061355285346508, "num_tokens": 3886897.0, "step": 1115 }, { "entropy": 7.180309152603149, "epoch": 0.14719411223551057, "grad_norm": 0.8515625, "learning_rate": 0.0004982552163405623, "loss": 7.1839, "mean_token_accuracy": 0.10160853713750839, "num_tokens": 3904397.0, "step": 1120 }, { "entropy": 7.284969186782837, "epoch": 0.14785122880799054, "grad_norm": 0.85546875, "learning_rate": 0.0004981057259983839, "loss": 7.2364, "mean_token_accuracy": 0.09974497929215431, "num_tokens": 3921792.0, "step": 1125 }, { "entropy": 7.175367546081543, "epoch": 0.1485083453804705, "grad_norm": 0.921875, "learning_rate": 0.0004979501191000262, "loss": 7.1779, "mean_token_accuracy": 0.10670020878314972, "num_tokens": 3939896.0, "step": 1130 }, { "entropy": 7.243035173416137, "epoch": 0.14916546195295044, "grad_norm": 1.25, "learning_rate": 0.0004977883999115311, "loss": 7.2189, "mean_token_accuracy": 0.09671530574560165, "num_tokens": 3958019.0, "step": 1135 }, { "entropy": 7.291995239257813, "epoch": 0.1498225785254304, "grad_norm": 0.80859375, "learning_rate": 0.0004976205728665113, "loss": 7.3026, "mean_token_accuracy": 0.1016198918223381, "num_tokens": 3975880.0, "step": 1140 }, { "entropy": 7.189220190048218, "epoch": 0.15047969509791037, "grad_norm": 0.83984375, "learning_rate": 0.0004974466425660307, "loss": 7.1553, "mean_token_accuracy": 0.10134812369942665, "num_tokens": 3992649.0, "step": 1145 }, { "entropy": 7.181387281417846, "epoch": 0.15113681167039034, "grad_norm": 0.80859375, "learning_rate": 0.0004972666137784759, "loss": 7.1851, "mean_token_accuracy": 0.10243008136749268, "num_tokens": 4009641.0, "step": 1150 }, { "entropy": 7.194750642776489, "epoch": 0.15179392824287027, "grad_norm": 0.96875, "learning_rate": 0.0004970804914394271, "loss": 7.2668, "mean_token_accuracy": 0.09644793346524239, "num_tokens": 4028324.0, "step": 1155 }, { "entropy": 7.255599069595337, "epoch": 0.15245104481535024, "grad_norm": 0.9296875, "learning_rate": 0.0004968882806515225, "loss": 7.2032, "mean_token_accuracy": 0.10386807322502137, "num_tokens": 4046547.0, "step": 1160 }, { "entropy": 7.242625427246094, "epoch": 0.1531081613878302, "grad_norm": 0.90625, "learning_rate": 0.0004966899866843177, "loss": 7.2258, "mean_token_accuracy": 0.1007157877087593, "num_tokens": 4062227.0, "step": 1165 }, { "entropy": 7.163462209701538, "epoch": 0.15376527796031017, "grad_norm": 1.125, "learning_rate": 0.000496485614974142, "loss": 7.1801, "mean_token_accuracy": 0.10540101230144501, "num_tokens": 4079046.0, "step": 1170 }, { "entropy": 7.251097249984741, "epoch": 0.1544223945327901, "grad_norm": 0.8671875, "learning_rate": 0.0004962751711239492, "loss": 7.244, "mean_token_accuracy": 0.10471903905272484, "num_tokens": 4096559.0, "step": 1175 }, { "entropy": 7.216784477233887, "epoch": 0.15507951110527007, "grad_norm": 0.87890625, "learning_rate": 0.0004960586609031636, "loss": 7.1556, "mean_token_accuracy": 0.10767733827233314, "num_tokens": 4113251.0, "step": 1180 }, { "entropy": 7.065131950378418, "epoch": 0.15573662767775004, "grad_norm": 0.81640625, "learning_rate": 0.0004958360902475224, "loss": 7.0617, "mean_token_accuracy": 0.11634833589196206, "num_tokens": 4133967.0, "step": 1185 }, { "entropy": 7.220524168014526, "epoch": 0.15639374425023, "grad_norm": 0.84375, "learning_rate": 0.0004956074652589125, "loss": 7.1619, "mean_token_accuracy": 0.1012740470468998, "num_tokens": 4150801.0, "step": 1190 }, { "entropy": 7.286528825759888, "epoch": 0.15705086082270994, "grad_norm": 0.78125, "learning_rate": 0.0004953727922052035, "loss": 7.2604, "mean_token_accuracy": 0.0940374843776226, "num_tokens": 4168727.0, "step": 1195 }, { "entropy": 7.180148553848267, "epoch": 0.1577079773951899, "grad_norm": 0.796875, "learning_rate": 0.0004951320775200756, "loss": 7.1508, "mean_token_accuracy": 0.10601523295044898, "num_tokens": 4187639.0, "step": 1200 }, { "entropy": 7.135108709335327, "epoch": 0.15836509396766987, "grad_norm": 0.79296875, "learning_rate": 0.0004948853278028436, "loss": 7.1612, "mean_token_accuracy": 0.10450763776898384, "num_tokens": 4204266.0, "step": 1205 }, { "entropy": 7.2624317646026615, "epoch": 0.1590222105401498, "grad_norm": 0.90234375, "learning_rate": 0.0004946325498182755, "loss": 7.1404, "mean_token_accuracy": 0.10236875712871552, "num_tokens": 4221724.0, "step": 1210 }, { "entropy": 7.164175224304199, "epoch": 0.15967932711262978, "grad_norm": 0.8125, "learning_rate": 0.0004943737504964076, "loss": 7.2273, "mean_token_accuracy": 0.10266198962926865, "num_tokens": 4240729.0, "step": 1215 }, { "entropy": 7.121058464050293, "epoch": 0.16033644368510974, "grad_norm": 0.9765625, "learning_rate": 0.000494108936932354, "loss": 7.1063, "mean_token_accuracy": 0.11425342187285423, "num_tokens": 4260604.0, "step": 1220 }, { "entropy": 7.142035484313965, "epoch": 0.1609935602575897, "grad_norm": 0.78125, "learning_rate": 0.0004938381163861124, "loss": 7.1992, "mean_token_accuracy": 0.10155246257781983, "num_tokens": 4277763.0, "step": 1225 }, { "entropy": 7.209809589385986, "epoch": 0.16165067683006965, "grad_norm": 0.88671875, "learning_rate": 0.0004935612962823645, "loss": 7.2427, "mean_token_accuracy": 0.09955391138792039, "num_tokens": 4294625.0, "step": 1230 }, { "entropy": 7.154326152801514, "epoch": 0.1623077934025496, "grad_norm": 0.7734375, "learning_rate": 0.0004932784842102739, "loss": 7.1676, "mean_token_accuracy": 0.10906312316656112, "num_tokens": 4312247.0, "step": 1235 }, { "entropy": 7.254214096069336, "epoch": 0.16296490997502958, "grad_norm": 0.82421875, "learning_rate": 0.0004929896879232758, "loss": 7.2685, "mean_token_accuracy": 0.09215258359909058, "num_tokens": 4329618.0, "step": 1240 }, { "entropy": 7.223868036270142, "epoch": 0.16362202654750954, "grad_norm": 0.77734375, "learning_rate": 0.0004926949153388668, "loss": 7.2086, "mean_token_accuracy": 0.1000858373939991, "num_tokens": 4347702.0, "step": 1245 }, { "entropy": 7.246126794815064, "epoch": 0.16427914311998948, "grad_norm": 0.88671875, "learning_rate": 0.0004923941745383859, "loss": 7.1858, "mean_token_accuracy": 0.09782344475388527, "num_tokens": 4365116.0, "step": 1250 }, { "entropy": 7.171083784103393, "epoch": 0.16493625969246944, "grad_norm": 0.84375, "learning_rate": 0.000492087473766794, "loss": 7.2512, "mean_token_accuracy": 0.10115259513258934, "num_tokens": 4382634.0, "step": 1255 }, { "entropy": 7.264097499847412, "epoch": 0.1655933762649494, "grad_norm": 0.875, "learning_rate": 0.000491774821432448, "loss": 7.2555, "mean_token_accuracy": 0.09854963570833206, "num_tokens": 4400067.0, "step": 1260 }, { "entropy": 7.18475866317749, "epoch": 0.16625049283742935, "grad_norm": 0.97265625, "learning_rate": 0.0004914562261068693, "loss": 7.1363, "mean_token_accuracy": 0.0983266532421112, "num_tokens": 4415974.0, "step": 1265 }, { "entropy": 7.142167472839356, "epoch": 0.1669076094099093, "grad_norm": 0.86328125, "learning_rate": 0.0004911316965245098, "loss": 7.1565, "mean_token_accuracy": 0.10286837294697762, "num_tokens": 4433718.0, "step": 1270 }, { "entropy": 7.263294696807861, "epoch": 0.16756472598238928, "grad_norm": 0.8828125, "learning_rate": 0.000490801241582512, "loss": 7.2295, "mean_token_accuracy": 0.09759362787008286, "num_tokens": 4452327.0, "step": 1275 }, { "entropy": 7.116361236572265, "epoch": 0.16822184255486924, "grad_norm": 0.94140625, "learning_rate": 0.000490464870340465, "loss": 7.112, "mean_token_accuracy": 0.10486611649394036, "num_tokens": 4468025.0, "step": 1280 }, { "entropy": 7.023391008377075, "epoch": 0.16887895912734918, "grad_norm": 0.91015625, "learning_rate": 0.0004901225920201563, "loss": 6.9262, "mean_token_accuracy": 0.12515356317162513, "num_tokens": 4486104.0, "step": 1285 }, { "entropy": 7.159882354736328, "epoch": 0.16953607569982915, "grad_norm": 0.83984375, "learning_rate": 0.000489774416005319, "loss": 7.2428, "mean_token_accuracy": 0.09691546708345414, "num_tokens": 4503776.0, "step": 1290 }, { "entropy": 7.169772386550903, "epoch": 0.1701931922723091, "grad_norm": 0.90234375, "learning_rate": 0.0004894203518413742, "loss": 7.2116, "mean_token_accuracy": 0.1008364237844944, "num_tokens": 4521574.0, "step": 1295 }, { "entropy": 7.2007242202758786, "epoch": 0.17085030884478908, "grad_norm": 0.8203125, "learning_rate": 0.0004890604092351701, "loss": 7.1505, "mean_token_accuracy": 0.11244964003562927, "num_tokens": 4539276.0, "step": 1300 }, { "entropy": 7.171060848236084, "epoch": 0.17150742541726902, "grad_norm": 0.7265625, "learning_rate": 0.000488694598054715, "loss": 7.1326, "mean_token_accuracy": 0.1008635438978672, "num_tokens": 4557626.0, "step": 1305 }, { "entropy": 7.142626094818115, "epoch": 0.17216454198974898, "grad_norm": 0.796875, "learning_rate": 0.0004883229283289071, "loss": 7.1549, "mean_token_accuracy": 0.10123615637421608, "num_tokens": 4574045.0, "step": 1310 }, { "entropy": 7.167723512649536, "epoch": 0.17282165856222895, "grad_norm": 0.859375, "learning_rate": 0.00048794541024725993, "loss": 7.1759, "mean_token_accuracy": 0.10515163168311119, "num_tokens": 4590743.0, "step": 1315 }, { "entropy": 7.111159324645996, "epoch": 0.17347877513470888, "grad_norm": 0.79296875, "learning_rate": 0.0004875620541596221, "loss": 7.0989, "mean_token_accuracy": 0.10333124399185181, "num_tokens": 4607616.0, "step": 1320 }, { "entropy": 7.161529684066773, "epoch": 0.17413589170718885, "grad_norm": 1.3203125, "learning_rate": 0.00048717287057589454, "loss": 7.0922, "mean_token_accuracy": 0.10455577373504639, "num_tokens": 4624723.0, "step": 1325 }, { "entropy": 7.1527036190032955, "epoch": 0.17479300827966882, "grad_norm": 0.85546875, "learning_rate": 0.0004867778701657417, "loss": 7.1299, "mean_token_accuracy": 0.09841537550091743, "num_tokens": 4642535.0, "step": 1330 }, { "entropy": 7.17755012512207, "epoch": 0.17545012485214878, "grad_norm": 0.88671875, "learning_rate": 0.00048637706375829955, "loss": 7.1287, "mean_token_accuracy": 0.09741237014532089, "num_tokens": 4660068.0, "step": 1335 }, { "entropy": 7.029680061340332, "epoch": 0.17610724142462872, "grad_norm": 0.82421875, "learning_rate": 0.000485970462341878, "loss": 7.0628, "mean_token_accuracy": 0.11555436253547668, "num_tokens": 4678985.0, "step": 1340 }, { "entropy": 7.155279445648193, "epoch": 0.17676435799710868, "grad_norm": 0.77734375, "learning_rate": 0.00048555807706366044, "loss": 7.1287, "mean_token_accuracy": 0.09945940226316452, "num_tokens": 4697827.0, "step": 1345 }, { "entropy": 7.107897138595581, "epoch": 0.17742147456958865, "grad_norm": 0.8359375, "learning_rate": 0.00048513991922939756, "loss": 7.1291, "mean_token_accuracy": 0.09734978899359703, "num_tokens": 4716437.0, "step": 1350 }, { "entropy": 7.036555910110474, "epoch": 0.17807859114206862, "grad_norm": 0.87109375, "learning_rate": 0.00048471600030309744, "loss": 7.0523, "mean_token_accuracy": 0.10956270396709442, "num_tokens": 4734528.0, "step": 1355 }, { "entropy": 7.1375220775604244, "epoch": 0.17873570771454855, "grad_norm": 0.8984375, "learning_rate": 0.00048428633190671186, "loss": 7.1495, "mean_token_accuracy": 0.09941326081752777, "num_tokens": 4752174.0, "step": 1360 }, { "entropy": 7.162973308563233, "epoch": 0.17939282428702852, "grad_norm": 0.8984375, "learning_rate": 0.0004838509258198167, "loss": 7.0365, "mean_token_accuracy": 0.10331410691142082, "num_tokens": 4769040.0, "step": 1365 }, { "entropy": 7.036287784576416, "epoch": 0.18004994085950848, "grad_norm": 0.8359375, "learning_rate": 0.00048340979397929, "loss": 7.1211, "mean_token_accuracy": 0.10569187849760056, "num_tokens": 4787769.0, "step": 1370 }, { "entropy": 7.198102760314941, "epoch": 0.18070705743198842, "grad_norm": 0.76953125, "learning_rate": 0.00048296294847898386, "loss": 7.1446, "mean_token_accuracy": 0.09686194062232971, "num_tokens": 4805730.0, "step": 1375 }, { "entropy": 7.123643064498902, "epoch": 0.1813641740044684, "grad_norm": 0.78125, "learning_rate": 0.0004825104015693934, "loss": 7.1348, "mean_token_accuracy": 0.10434755310416222, "num_tokens": 4823518.0, "step": 1380 }, { "entropy": 7.153635454177857, "epoch": 0.18202129057694835, "grad_norm": 0.98046875, "learning_rate": 0.0004820521656573208, "loss": 7.1404, "mean_token_accuracy": 0.10507838502526283, "num_tokens": 4840332.0, "step": 1385 }, { "entropy": 7.123753452301026, "epoch": 0.18267840714942832, "grad_norm": 0.89453125, "learning_rate": 0.00048158825330553505, "loss": 7.1231, "mean_token_accuracy": 0.09961956813931465, "num_tokens": 4857633.0, "step": 1390 }, { "entropy": 7.068319320678711, "epoch": 0.18333552372190826, "grad_norm": 0.98828125, "learning_rate": 0.00048111867723242763, "loss": 7.0578, "mean_token_accuracy": 0.10383191257715225, "num_tokens": 4874145.0, "step": 1395 }, { "entropy": 7.05531587600708, "epoch": 0.18399264029438822, "grad_norm": 1.0078125, "learning_rate": 0.0004806434503116637, "loss": 6.9817, "mean_token_accuracy": 0.10680583864450455, "num_tokens": 4892231.0, "step": 1400 }, { "entropy": 7.049816274642945, "epoch": 0.1846497568668682, "grad_norm": 0.9140625, "learning_rate": 0.0004801625855718296, "loss": 7.1012, "mean_token_accuracy": 0.10223743543028832, "num_tokens": 4908095.0, "step": 1405 }, { "entropy": 7.0817399501800535, "epoch": 0.18530687343934815, "grad_norm": 0.8671875, "learning_rate": 0.00047967609619607477, "loss": 6.9911, "mean_token_accuracy": 0.11124311462044716, "num_tokens": 4926608.0, "step": 1410 }, { "entropy": 6.9987890243530275, "epoch": 0.1859639900118281, "grad_norm": 0.921875, "learning_rate": 0.0004791839955217513, "loss": 6.9371, "mean_token_accuracy": 0.11885873302817344, "num_tokens": 4943617.0, "step": 1415 }, { "entropy": 7.06851634979248, "epoch": 0.18662110658430806, "grad_norm": 0.8515625, "learning_rate": 0.00047868629704004786, "loss": 7.0327, "mean_token_accuracy": 0.1135017842054367, "num_tokens": 4962255.0, "step": 1420 }, { "entropy": 7.001637077331543, "epoch": 0.18727822315678802, "grad_norm": 1.03125, "learning_rate": 0.00047818301439561965, "loss": 6.9265, "mean_token_accuracy": 0.12256510108709336, "num_tokens": 4980276.0, "step": 1425 }, { "entropy": 7.053653526306152, "epoch": 0.18793533972926796, "grad_norm": 0.91796875, "learning_rate": 0.00047767416138621454, "loss": 7.0544, "mean_token_accuracy": 0.10385716408491134, "num_tokens": 4996244.0, "step": 1430 }, { "entropy": 7.084101438522339, "epoch": 0.18859245630174792, "grad_norm": 1.046875, "learning_rate": 0.000477159751962295, "loss": 7.0743, "mean_token_accuracy": 0.1009013146162033, "num_tokens": 5016070.0, "step": 1435 }, { "entropy": 7.109147834777832, "epoch": 0.1892495728742279, "grad_norm": 0.89453125, "learning_rate": 0.00047663980022665507, "loss": 7.138, "mean_token_accuracy": 0.0944010891020298, "num_tokens": 5032302.0, "step": 1440 }, { "entropy": 7.157390308380127, "epoch": 0.18990668944670785, "grad_norm": 0.7421875, "learning_rate": 0.00047611432043403437, "loss": 7.0823, "mean_token_accuracy": 0.10348261818289757, "num_tokens": 5050474.0, "step": 1445 }, { "entropy": 6.962280035018921, "epoch": 0.1905638060191878, "grad_norm": 0.8203125, "learning_rate": 0.0004755833269907267, "loss": 7.0122, "mean_token_accuracy": 0.10257056131958961, "num_tokens": 5069626.0, "step": 1450 }, { "entropy": 7.163888025283813, "epoch": 0.19122092259166776, "grad_norm": 0.89453125, "learning_rate": 0.0004750468344541857, "loss": 7.1151, "mean_token_accuracy": 0.0981297992169857, "num_tokens": 5087126.0, "step": 1455 }, { "entropy": 7.0553618431091305, "epoch": 0.19187803916414772, "grad_norm": 0.8515625, "learning_rate": 0.00047450485753262525, "loss": 7.0958, "mean_token_accuracy": 0.10250502526760101, "num_tokens": 5105324.0, "step": 1460 }, { "entropy": 7.1029359817504885, "epoch": 0.1925351557366277, "grad_norm": 0.8671875, "learning_rate": 0.00047395741108461633, "loss": 7.1372, "mean_token_accuracy": 0.1008988417685032, "num_tokens": 5121832.0, "step": 1465 }, { "entropy": 7.041136693954468, "epoch": 0.19319227230910763, "grad_norm": 0.85546875, "learning_rate": 0.00047340451011867985, "loss": 7.0571, "mean_token_accuracy": 0.1045589379966259, "num_tokens": 5138072.0, "step": 1470 }, { "entropy": 7.143003797531128, "epoch": 0.1938493888815876, "grad_norm": 0.86328125, "learning_rate": 0.00047284616979287515, "loss": 7.0829, "mean_token_accuracy": 0.10569359660148621, "num_tokens": 5154486.0, "step": 1475 }, { "entropy": 7.041785955429077, "epoch": 0.19450650545406756, "grad_norm": 0.85546875, "learning_rate": 0.00047228240541438433, "loss": 7.0603, "mean_token_accuracy": 0.10345918461680412, "num_tokens": 5171995.0, "step": 1480 }, { "entropy": 6.947126388549805, "epoch": 0.19516362202654752, "grad_norm": 0.85546875, "learning_rate": 0.00047171323243909257, "loss": 6.8975, "mean_token_accuracy": 0.12085305452346802, "num_tokens": 5190708.0, "step": 1485 }, { "entropy": 7.049253225326538, "epoch": 0.19582073859902746, "grad_norm": 0.8046875, "learning_rate": 0.00047113866647116457, "loss": 7.0137, "mean_token_accuracy": 0.10840069875121117, "num_tokens": 5207518.0, "step": 1490 }, { "entropy": 6.979583120346069, "epoch": 0.19647785517150743, "grad_norm": 0.89453125, "learning_rate": 0.0004705587232626164, "loss": 6.9889, "mean_token_accuracy": 0.11757338047027588, "num_tokens": 5225043.0, "step": 1495 }, { "entropy": 7.06225094795227, "epoch": 0.1971349717439874, "grad_norm": 0.79296875, "learning_rate": 0.00046997341871288424, "loss": 7.0219, "mean_token_accuracy": 0.1079759307205677, "num_tokens": 5242101.0, "step": 1500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 6991815499776000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }