{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.1478298238074776, "eval_steps": 500, "global_step": 2500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.69186782836914, "epoch": 0.004297378599054577, "grad_norm": 14.0625, "learning_rate": 2e-06, "loss": 10.767, "mean_token_accuracy": 0.0, "num_tokens": 8559.0, "step": 5 }, { "entropy": 10.691853904724121, "epoch": 0.008594757198109154, "grad_norm": 13.4375, "learning_rate": 4.5e-06, "loss": 10.7343, "mean_token_accuracy": 0.0006453584705013782, "num_tokens": 18235.0, "step": 10 }, { "entropy": 10.68972110748291, "epoch": 0.01289213579716373, "grad_norm": 10.375, "learning_rate": 7e-06, "loss": 10.4481, "mean_token_accuracy": 0.04634292460978031, "num_tokens": 28257.0, "step": 15 }, { "entropy": 10.653952026367188, "epoch": 0.017189514396218308, "grad_norm": 6.28125, "learning_rate": 9.5e-06, "loss": 10.1016, "mean_token_accuracy": 0.05583016015589237, "num_tokens": 38142.0, "step": 20 }, { "entropy": 10.492306423187255, "epoch": 0.021486892995272882, "grad_norm": 3.90625, "learning_rate": 1.2e-05, "loss": 9.8388, "mean_token_accuracy": 0.051388037577271464, "num_tokens": 47363.0, "step": 25 }, { "entropy": 10.393956565856934, "epoch": 0.02578427159432746, "grad_norm": 3.09375, "learning_rate": 1.4500000000000002e-05, "loss": 9.6855, "mean_token_accuracy": 0.05032752677798271, "num_tokens": 57121.0, "step": 30 }, { "entropy": 10.352927017211915, "epoch": 0.030081650193382038, "grad_norm": 2.71875, "learning_rate": 1.7000000000000003e-05, "loss": 9.59, "mean_token_accuracy": 0.056775762140750884, "num_tokens": 66785.0, "step": 35 }, { "entropy": 10.365454959869385, "epoch": 0.034379028792436615, "grad_norm": 2.671875, "learning_rate": 1.95e-05, "loss": 9.4974, "mean_token_accuracy": 0.05595241449773312, "num_tokens": 76313.0, "step": 40 }, { "entropy": 10.268372726440429, "epoch": 0.03867640739149119, "grad_norm": 2.25, "learning_rate": 2.2e-05, "loss": 9.546, "mean_token_accuracy": 0.05818333774805069, "num_tokens": 86151.0, "step": 45 }, { "entropy": 10.402025985717774, "epoch": 0.042973785990545764, "grad_norm": 2.484375, "learning_rate": 2.4500000000000003e-05, "loss": 9.4872, "mean_token_accuracy": 0.06535410135984421, "num_tokens": 94916.0, "step": 50 }, { "entropy": 10.304343509674073, "epoch": 0.047271164589600345, "grad_norm": 2.265625, "learning_rate": 2.7e-05, "loss": 9.4098, "mean_token_accuracy": 0.06619026586413383, "num_tokens": 104592.0, "step": 55 }, { "entropy": 10.089207649230957, "epoch": 0.05156854318865492, "grad_norm": 2.28125, "learning_rate": 2.95e-05, "loss": 9.317, "mean_token_accuracy": 0.07636640071868897, "num_tokens": 113942.0, "step": 60 }, { "entropy": 10.178072547912597, "epoch": 0.055865921787709494, "grad_norm": 2.6875, "learning_rate": 3.2e-05, "loss": 9.329, "mean_token_accuracy": 0.07130967006087303, "num_tokens": 123190.0, "step": 65 }, { "entropy": 10.223089408874511, "epoch": 0.060163300386764075, "grad_norm": 1.8125, "learning_rate": 3.4500000000000005e-05, "loss": 9.3231, "mean_token_accuracy": 0.06454960964620113, "num_tokens": 132367.0, "step": 70 }, { "entropy": 10.157601451873779, "epoch": 0.06446067898581866, "grad_norm": 1.8828125, "learning_rate": 3.7e-05, "loss": 9.1389, "mean_token_accuracy": 0.07756163887679576, "num_tokens": 141375.0, "step": 75 }, { "entropy": 10.095236587524415, "epoch": 0.06875805758487323, "grad_norm": 1.859375, "learning_rate": 3.95e-05, "loss": 9.0625, "mean_token_accuracy": 0.07905065715312957, "num_tokens": 150791.0, "step": 80 }, { "entropy": 10.089058017730713, "epoch": 0.0730554361839278, "grad_norm": 1.96875, "learning_rate": 4.2000000000000004e-05, "loss": 9.0294, "mean_token_accuracy": 0.07317423708736896, "num_tokens": 158686.0, "step": 85 }, { "entropy": 10.112849235534668, "epoch": 0.07735281478298238, "grad_norm": 1.65625, "learning_rate": 4.45e-05, "loss": 8.9757, "mean_token_accuracy": 0.06819208525121212, "num_tokens": 167482.0, "step": 90 }, { "entropy": 9.973779201507568, "epoch": 0.08165019338203695, "grad_norm": 2.046875, "learning_rate": 4.7000000000000004e-05, "loss": 8.802, "mean_token_accuracy": 0.08643188402056694, "num_tokens": 176598.0, "step": 95 }, { "entropy": 9.932288265228271, "epoch": 0.08594757198109153, "grad_norm": 1.8984375, "learning_rate": 4.9500000000000004e-05, "loss": 8.7014, "mean_token_accuracy": 0.08371126018464566, "num_tokens": 185883.0, "step": 100 }, { "entropy": 9.903890705108642, "epoch": 0.09024495058014612, "grad_norm": 1.65625, "learning_rate": 5.2e-05, "loss": 8.672, "mean_token_accuracy": 0.0767141304910183, "num_tokens": 194820.0, "step": 105 }, { "entropy": 9.905889225006103, "epoch": 0.09454232917920069, "grad_norm": 1.8671875, "learning_rate": 5.45e-05, "loss": 8.5994, "mean_token_accuracy": 0.07663930654525757, "num_tokens": 203710.0, "step": 110 }, { "entropy": 9.7015700340271, "epoch": 0.09883970777825526, "grad_norm": 1.640625, "learning_rate": 5.7e-05, "loss": 8.4883, "mean_token_accuracy": 0.08735396713018417, "num_tokens": 212642.0, "step": 115 }, { "entropy": 9.712564849853516, "epoch": 0.10313708637730984, "grad_norm": 1.4375, "learning_rate": 5.9499999999999996e-05, "loss": 8.4829, "mean_token_accuracy": 0.07560812048614025, "num_tokens": 221411.0, "step": 120 }, { "entropy": 9.618709659576416, "epoch": 0.10743446497636441, "grad_norm": 1.3828125, "learning_rate": 6.2e-05, "loss": 8.276, "mean_token_accuracy": 0.07886423245072365, "num_tokens": 230454.0, "step": 125 }, { "entropy": 9.445035266876221, "epoch": 0.11173184357541899, "grad_norm": 1.78125, "learning_rate": 6.450000000000001e-05, "loss": 8.2553, "mean_token_accuracy": 0.08224238455295563, "num_tokens": 240272.0, "step": 130 }, { "entropy": 9.343283653259277, "epoch": 0.11602922217447358, "grad_norm": 1.2109375, "learning_rate": 6.7e-05, "loss": 8.1773, "mean_token_accuracy": 0.07860668338835239, "num_tokens": 249652.0, "step": 135 }, { "entropy": 9.141777420043946, "epoch": 0.12032660077352815, "grad_norm": 1.359375, "learning_rate": 6.950000000000001e-05, "loss": 8.0586, "mean_token_accuracy": 0.08432014659047127, "num_tokens": 258359.0, "step": 140 }, { "entropy": 9.028361320495605, "epoch": 0.12462397937258272, "grad_norm": 1.9296875, "learning_rate": 7.2e-05, "loss": 7.965, "mean_token_accuracy": 0.08845296204090118, "num_tokens": 266863.0, "step": 145 }, { "entropy": 8.872007942199707, "epoch": 0.1289213579716373, "grad_norm": 1.703125, "learning_rate": 7.45e-05, "loss": 7.9485, "mean_token_accuracy": 0.08544271066784859, "num_tokens": 274694.0, "step": 150 }, { "entropy": 8.746376705169677, "epoch": 0.1332187365706919, "grad_norm": 1.0078125, "learning_rate": 7.7e-05, "loss": 7.998, "mean_token_accuracy": 0.07424286939203739, "num_tokens": 285038.0, "step": 155 }, { "entropy": 8.652623462677003, "epoch": 0.13751611516974646, "grad_norm": 1.34375, "learning_rate": 7.950000000000001e-05, "loss": 7.9434, "mean_token_accuracy": 0.07819288298487663, "num_tokens": 293451.0, "step": 160 }, { "entropy": 8.498311519622803, "epoch": 0.14181349376880104, "grad_norm": 1.171875, "learning_rate": 8.2e-05, "loss": 7.7897, "mean_token_accuracy": 0.08914674445986748, "num_tokens": 302184.0, "step": 165 }, { "entropy": 8.397662544250489, "epoch": 0.1461108723678556, "grad_norm": 1.2109375, "learning_rate": 8.450000000000001e-05, "loss": 7.8596, "mean_token_accuracy": 0.08310422226786614, "num_tokens": 311069.0, "step": 170 }, { "entropy": 8.409068965911866, "epoch": 0.15040825096691018, "grad_norm": 1.25, "learning_rate": 8.7e-05, "loss": 7.8454, "mean_token_accuracy": 0.07755065970122814, "num_tokens": 319841.0, "step": 175 }, { "entropy": 8.261888885498047, "epoch": 0.15470562956596476, "grad_norm": 1.0546875, "learning_rate": 8.95e-05, "loss": 7.7995, "mean_token_accuracy": 0.0760527990758419, "num_tokens": 328621.0, "step": 180 }, { "entropy": 8.25572681427002, "epoch": 0.15900300816501933, "grad_norm": 1.46875, "learning_rate": 9.2e-05, "loss": 7.7913, "mean_token_accuracy": 0.07687021419405937, "num_tokens": 336469.0, "step": 185 }, { "entropy": 8.273696994781494, "epoch": 0.1633003867640739, "grad_norm": 1.21875, "learning_rate": 9.45e-05, "loss": 7.8148, "mean_token_accuracy": 0.07753114774823189, "num_tokens": 344859.0, "step": 190 }, { "entropy": 8.1952486038208, "epoch": 0.16759776536312848, "grad_norm": 1.0859375, "learning_rate": 9.7e-05, "loss": 7.8017, "mean_token_accuracy": 0.08184871897101402, "num_tokens": 354536.0, "step": 195 }, { "entropy": 8.130875205993652, "epoch": 0.17189514396218306, "grad_norm": 1.2265625, "learning_rate": 9.95e-05, "loss": 7.782, "mean_token_accuracy": 0.08327300399541855, "num_tokens": 363592.0, "step": 200 }, { "entropy": 8.071674633026124, "epoch": 0.17619252256123766, "grad_norm": 1.2421875, "learning_rate": 0.000102, "loss": 7.7545, "mean_token_accuracy": 0.08299842327833176, "num_tokens": 373278.0, "step": 205 }, { "entropy": 8.152774953842163, "epoch": 0.18048990116029223, "grad_norm": 1.3203125, "learning_rate": 0.00010449999999999999, "loss": 7.8002, "mean_token_accuracy": 0.08091530725359916, "num_tokens": 382498.0, "step": 210 }, { "entropy": 8.122348976135253, "epoch": 0.1847872797593468, "grad_norm": 1.046875, "learning_rate": 0.000107, "loss": 7.7393, "mean_token_accuracy": 0.09220762960612774, "num_tokens": 391273.0, "step": 215 }, { "entropy": 8.141310453414917, "epoch": 0.18908465835840138, "grad_norm": 1.0703125, "learning_rate": 0.0001095, "loss": 7.6711, "mean_token_accuracy": 0.07944022566080093, "num_tokens": 400340.0, "step": 220 }, { "entropy": 8.08761625289917, "epoch": 0.19338203695745596, "grad_norm": 1.6171875, "learning_rate": 0.000112, "loss": 7.7203, "mean_token_accuracy": 0.07989789322018623, "num_tokens": 409162.0, "step": 225 }, { "entropy": 8.068865013122558, "epoch": 0.19767941555651053, "grad_norm": 1.203125, "learning_rate": 0.0001145, "loss": 7.6955, "mean_token_accuracy": 0.08263300582766533, "num_tokens": 417345.0, "step": 230 }, { "entropy": 8.020773887634277, "epoch": 0.2019767941555651, "grad_norm": 1.1484375, "learning_rate": 0.00011700000000000001, "loss": 7.6885, "mean_token_accuracy": 0.08577688783407211, "num_tokens": 427488.0, "step": 235 }, { "entropy": 8.00288724899292, "epoch": 0.20627417275461968, "grad_norm": 1.390625, "learning_rate": 0.00011949999999999999, "loss": 7.6381, "mean_token_accuracy": 0.08082681894302368, "num_tokens": 435496.0, "step": 240 }, { "entropy": 8.024074983596801, "epoch": 0.21057155135367425, "grad_norm": 1.2421875, "learning_rate": 0.000122, "loss": 7.592, "mean_token_accuracy": 0.08299721553921699, "num_tokens": 444290.0, "step": 245 }, { "entropy": 8.002217769622803, "epoch": 0.21486892995272883, "grad_norm": 1.1796875, "learning_rate": 0.0001245, "loss": 7.7047, "mean_token_accuracy": 0.0830993577837944, "num_tokens": 452704.0, "step": 250 }, { "entropy": 8.036895895004273, "epoch": 0.2191663085517834, "grad_norm": 1.40625, "learning_rate": 0.000127, "loss": 7.6246, "mean_token_accuracy": 0.08470720425248146, "num_tokens": 461445.0, "step": 255 }, { "entropy": 8.038204240798951, "epoch": 0.22346368715083798, "grad_norm": 1.3203125, "learning_rate": 0.0001295, "loss": 7.6401, "mean_token_accuracy": 0.08966793864965439, "num_tokens": 470644.0, "step": 260 }, { "entropy": 7.892484998703003, "epoch": 0.22776106574989258, "grad_norm": 1.671875, "learning_rate": 0.000132, "loss": 7.5766, "mean_token_accuracy": 0.08981397226452828, "num_tokens": 479212.0, "step": 265 }, { "entropy": 7.9553313732147215, "epoch": 0.23205844434894715, "grad_norm": 1.09375, "learning_rate": 0.00013450000000000002, "loss": 7.6849, "mean_token_accuracy": 0.07991519421339036, "num_tokens": 489027.0, "step": 270 }, { "entropy": 8.001228666305542, "epoch": 0.23635582294800173, "grad_norm": 1.125, "learning_rate": 0.00013700000000000002, "loss": 7.7078, "mean_token_accuracy": 0.0864037737250328, "num_tokens": 497548.0, "step": 275 }, { "entropy": 7.95409255027771, "epoch": 0.2406532015470563, "grad_norm": 1.2578125, "learning_rate": 0.0001395, "loss": 7.523, "mean_token_accuracy": 0.09064189270138741, "num_tokens": 505836.0, "step": 280 }, { "entropy": 8.008459424972534, "epoch": 0.24495058014611087, "grad_norm": 1.1953125, "learning_rate": 0.00014199999999999998, "loss": 7.6857, "mean_token_accuracy": 0.08223827481269837, "num_tokens": 515463.0, "step": 285 }, { "entropy": 8.042573165893554, "epoch": 0.24924795874516545, "grad_norm": 1.25, "learning_rate": 0.0001445, "loss": 7.5642, "mean_token_accuracy": 0.08510619327425957, "num_tokens": 524882.0, "step": 290 }, { "entropy": 7.878521060943603, "epoch": 0.25354533734422, "grad_norm": 1.171875, "learning_rate": 0.000147, "loss": 7.5627, "mean_token_accuracy": 0.08412178531289101, "num_tokens": 534523.0, "step": 295 }, { "entropy": 7.9167151927948, "epoch": 0.2578427159432746, "grad_norm": 1.21875, "learning_rate": 0.0001495, "loss": 7.5608, "mean_token_accuracy": 0.08494351357221604, "num_tokens": 543772.0, "step": 300 }, { "entropy": 7.85640025138855, "epoch": 0.26214009454232917, "grad_norm": 1.203125, "learning_rate": 0.000152, "loss": 7.5374, "mean_token_accuracy": 0.0830413281917572, "num_tokens": 552024.0, "step": 305 }, { "entropy": 7.888205242156983, "epoch": 0.2664374731413838, "grad_norm": 1.1484375, "learning_rate": 0.00015450000000000001, "loss": 7.5269, "mean_token_accuracy": 0.08928481489419937, "num_tokens": 561114.0, "step": 310 }, { "entropy": 8.020092916488647, "epoch": 0.2707348517404383, "grad_norm": 1.3046875, "learning_rate": 0.000157, "loss": 7.5728, "mean_token_accuracy": 0.08862031325697899, "num_tokens": 569655.0, "step": 315 }, { "entropy": 7.867624950408936, "epoch": 0.2750322303394929, "grad_norm": 1.3515625, "learning_rate": 0.0001595, "loss": 7.5604, "mean_token_accuracy": 0.08833226263523102, "num_tokens": 578701.0, "step": 320 }, { "entropy": 7.848216819763183, "epoch": 0.27932960893854747, "grad_norm": 1.25, "learning_rate": 0.000162, "loss": 7.5257, "mean_token_accuracy": 0.08904304206371308, "num_tokens": 588166.0, "step": 325 }, { "entropy": 7.775031900405883, "epoch": 0.28362698753760207, "grad_norm": 1.125, "learning_rate": 0.00016450000000000001, "loss": 7.5406, "mean_token_accuracy": 0.08560147807002068, "num_tokens": 598862.0, "step": 330 }, { "entropy": 7.946314001083374, "epoch": 0.2879243661366566, "grad_norm": 1.1015625, "learning_rate": 0.00016700000000000002, "loss": 7.5054, "mean_token_accuracy": 0.08752046972513199, "num_tokens": 607680.0, "step": 335 }, { "entropy": 7.798824310302734, "epoch": 0.2922217447357112, "grad_norm": 1.0390625, "learning_rate": 0.00016950000000000003, "loss": 7.5409, "mean_token_accuracy": 0.08527569100260735, "num_tokens": 617194.0, "step": 340 }, { "entropy": 7.840095901489258, "epoch": 0.29651912333476577, "grad_norm": 1.234375, "learning_rate": 0.00017199999999999998, "loss": 7.4681, "mean_token_accuracy": 0.09199495688080787, "num_tokens": 625946.0, "step": 345 }, { "entropy": 7.863882684707642, "epoch": 0.30081650193382037, "grad_norm": 1.40625, "learning_rate": 0.00017449999999999999, "loss": 7.4424, "mean_token_accuracy": 0.09303685426712036, "num_tokens": 634293.0, "step": 350 }, { "entropy": 7.814202308654785, "epoch": 0.30511388053287497, "grad_norm": 1.0390625, "learning_rate": 0.000177, "loss": 7.4365, "mean_token_accuracy": 0.08837181255221367, "num_tokens": 643479.0, "step": 355 }, { "entropy": 7.780666065216065, "epoch": 0.3094112591319295, "grad_norm": 1.0625, "learning_rate": 0.0001795, "loss": 7.4565, "mean_token_accuracy": 0.0916847325861454, "num_tokens": 653599.0, "step": 360 }, { "entropy": 7.727724599838257, "epoch": 0.3137086377309841, "grad_norm": 1.3046875, "learning_rate": 0.000182, "loss": 7.4396, "mean_token_accuracy": 0.0935065358877182, "num_tokens": 663042.0, "step": 365 }, { "entropy": 7.7599810600280765, "epoch": 0.31800601633003867, "grad_norm": 1.1953125, "learning_rate": 0.0001845, "loss": 7.3799, "mean_token_accuracy": 0.09194350391626357, "num_tokens": 672254.0, "step": 370 }, { "entropy": 7.850320053100586, "epoch": 0.32230339492909327, "grad_norm": 1.1796875, "learning_rate": 0.000187, "loss": 7.4208, "mean_token_accuracy": 0.09203241541981697, "num_tokens": 681648.0, "step": 375 }, { "entropy": 7.66558690071106, "epoch": 0.3266007735281478, "grad_norm": 1.25, "learning_rate": 0.0001895, "loss": 7.3756, "mean_token_accuracy": 0.09696918800473213, "num_tokens": 691080.0, "step": 380 }, { "entropy": 7.681433391571045, "epoch": 0.3308981521272024, "grad_norm": 1.4296875, "learning_rate": 0.000192, "loss": 7.4656, "mean_token_accuracy": 0.08918402977287769, "num_tokens": 700549.0, "step": 385 }, { "entropy": 7.880253696441651, "epoch": 0.33519553072625696, "grad_norm": 1.109375, "learning_rate": 0.0001945, "loss": 7.5014, "mean_token_accuracy": 0.09039791896939278, "num_tokens": 710623.0, "step": 390 }, { "entropy": 7.726108407974243, "epoch": 0.33949290932531156, "grad_norm": 1.3828125, "learning_rate": 0.00019700000000000002, "loss": 7.4269, "mean_token_accuracy": 0.09598973840475082, "num_tokens": 719695.0, "step": 395 }, { "entropy": 7.658704042434692, "epoch": 0.3437902879243661, "grad_norm": 1.140625, "learning_rate": 0.00019950000000000002, "loss": 7.3817, "mean_token_accuracy": 0.09576035216450692, "num_tokens": 728998.0, "step": 400 }, { "entropy": 7.817303800582886, "epoch": 0.3480876665234207, "grad_norm": 1.25, "learning_rate": 0.000202, "loss": 7.4597, "mean_token_accuracy": 0.08954662233591079, "num_tokens": 738537.0, "step": 405 }, { "entropy": 7.673436260223388, "epoch": 0.3523850451224753, "grad_norm": 1.2109375, "learning_rate": 0.00020449999999999998, "loss": 7.4039, "mean_token_accuracy": 0.092615757137537, "num_tokens": 747555.0, "step": 410 }, { "entropy": 7.643343782424926, "epoch": 0.35668242372152986, "grad_norm": 1.2734375, "learning_rate": 0.000207, "loss": 7.3747, "mean_token_accuracy": 0.09669034704566001, "num_tokens": 756857.0, "step": 415 }, { "entropy": 7.74475588798523, "epoch": 0.36097980232058446, "grad_norm": 1.15625, "learning_rate": 0.0002095, "loss": 7.3802, "mean_token_accuracy": 0.10021467804908753, "num_tokens": 766181.0, "step": 420 }, { "entropy": 7.649684762954712, "epoch": 0.365277180919639, "grad_norm": 1.1328125, "learning_rate": 0.000212, "loss": 7.4102, "mean_token_accuracy": 0.09460910633206368, "num_tokens": 774894.0, "step": 425 }, { "entropy": 7.730149173736573, "epoch": 0.3695745595186936, "grad_norm": 1.34375, "learning_rate": 0.0002145, "loss": 7.4062, "mean_token_accuracy": 0.090732641518116, "num_tokens": 784601.0, "step": 430 }, { "entropy": 7.6217389583587645, "epoch": 0.37387193811774816, "grad_norm": 1.390625, "learning_rate": 0.00021700000000000002, "loss": 7.4417, "mean_token_accuracy": 0.09168312624096871, "num_tokens": 794373.0, "step": 435 }, { "entropy": 7.600076055526733, "epoch": 0.37816931671680276, "grad_norm": 1.0546875, "learning_rate": 0.0002195, "loss": 7.3455, "mean_token_accuracy": 0.09434943050146102, "num_tokens": 803608.0, "step": 440 }, { "entropy": 7.752554702758789, "epoch": 0.3824666953158573, "grad_norm": 1.203125, "learning_rate": 0.000222, "loss": 7.3726, "mean_token_accuracy": 0.09299151077866555, "num_tokens": 812287.0, "step": 445 }, { "entropy": 7.518798732757569, "epoch": 0.3867640739149119, "grad_norm": 1.1796875, "learning_rate": 0.0002245, "loss": 7.2985, "mean_token_accuracy": 0.0987668864428997, "num_tokens": 821049.0, "step": 450 }, { "entropy": 7.701573610305786, "epoch": 0.39106145251396646, "grad_norm": 1.140625, "learning_rate": 0.00022700000000000002, "loss": 7.3033, "mean_token_accuracy": 0.10087452456355095, "num_tokens": 829148.0, "step": 455 }, { "entropy": 7.614718294143676, "epoch": 0.39535883111302106, "grad_norm": 1.4140625, "learning_rate": 0.00022950000000000002, "loss": 7.338, "mean_token_accuracy": 0.09538405686616898, "num_tokens": 838228.0, "step": 460 }, { "entropy": 7.615123701095581, "epoch": 0.39965620971207566, "grad_norm": 1.3828125, "learning_rate": 0.00023200000000000003, "loss": 7.3246, "mean_token_accuracy": 0.09597658589482308, "num_tokens": 846059.0, "step": 465 }, { "entropy": 7.705140447616577, "epoch": 0.4039535883111302, "grad_norm": 1.1328125, "learning_rate": 0.00023449999999999998, "loss": 7.4473, "mean_token_accuracy": 0.09011114612221718, "num_tokens": 856309.0, "step": 470 }, { "entropy": 7.4943718910217285, "epoch": 0.4082509669101848, "grad_norm": 1.0546875, "learning_rate": 0.000237, "loss": 7.2909, "mean_token_accuracy": 0.1010310634970665, "num_tokens": 865921.0, "step": 475 }, { "entropy": 7.549269151687622, "epoch": 0.41254834550923936, "grad_norm": 1.125, "learning_rate": 0.0002395, "loss": 7.2654, "mean_token_accuracy": 0.10411950796842576, "num_tokens": 875076.0, "step": 480 }, { "entropy": 7.629985094070435, "epoch": 0.41684572410829396, "grad_norm": 1.2265625, "learning_rate": 0.000242, "loss": 7.3165, "mean_token_accuracy": 0.0936420701444149, "num_tokens": 884586.0, "step": 485 }, { "entropy": 7.624928522109985, "epoch": 0.4211431027073485, "grad_norm": 1.203125, "learning_rate": 0.0002445, "loss": 7.4262, "mean_token_accuracy": 0.09749620333313942, "num_tokens": 894192.0, "step": 490 }, { "entropy": 7.579270219802856, "epoch": 0.4254404813064031, "grad_norm": 1.078125, "learning_rate": 0.000247, "loss": 7.3251, "mean_token_accuracy": 0.09591478407382965, "num_tokens": 903542.0, "step": 495 }, { "entropy": 7.532130336761474, "epoch": 0.42973785990545765, "grad_norm": 1.1171875, "learning_rate": 0.0002495, "loss": 7.259, "mean_token_accuracy": 0.10112758129835128, "num_tokens": 912625.0, "step": 500 }, { "epoch": 0.42973785990545765, "eval_entropy": 7.499067693143277, "eval_loss": 7.302952289581299, "eval_mean_token_accuracy": 0.1013092825793334, "eval_num_tokens": 912625.0, "eval_runtime": 2.6557, "eval_samples_per_second": 1336.368, "eval_steps_per_second": 167.187, "step": 500 }, { "entropy": 7.4851487159729, "epoch": 0.43403523850451226, "grad_norm": 1.2265625, "learning_rate": 0.000252, "loss": 7.218, "mean_token_accuracy": 0.10128417685627937, "num_tokens": 921438.0, "step": 505 }, { "entropy": 7.5242674350738525, "epoch": 0.4383326171035668, "grad_norm": 1.1015625, "learning_rate": 0.0002545, "loss": 7.2178, "mean_token_accuracy": 0.10356576293706894, "num_tokens": 931097.0, "step": 510 }, { "entropy": 7.51934700012207, "epoch": 0.4426299957026214, "grad_norm": 1.1796875, "learning_rate": 0.000257, "loss": 7.1837, "mean_token_accuracy": 0.10203342065215111, "num_tokens": 939375.0, "step": 515 }, { "entropy": 7.429151105880737, "epoch": 0.44692737430167595, "grad_norm": 1.625, "learning_rate": 0.0002595, "loss": 7.1856, "mean_token_accuracy": 0.10627232864499092, "num_tokens": 948223.0, "step": 520 }, { "entropy": 7.493127393722534, "epoch": 0.45122475290073055, "grad_norm": 1.2421875, "learning_rate": 0.000262, "loss": 7.2191, "mean_token_accuracy": 0.09962140917778015, "num_tokens": 956243.0, "step": 525 }, { "entropy": 7.528323316574097, "epoch": 0.45552213149978515, "grad_norm": 1.1171875, "learning_rate": 0.00026450000000000003, "loss": 7.2164, "mean_token_accuracy": 0.10636536180973052, "num_tokens": 964506.0, "step": 530 }, { "entropy": 7.4207946300506595, "epoch": 0.4598195100988397, "grad_norm": 1.2890625, "learning_rate": 0.00026700000000000004, "loss": 7.2399, "mean_token_accuracy": 0.0981321543455124, "num_tokens": 973617.0, "step": 535 }, { "entropy": 7.458613157272339, "epoch": 0.4641168886978943, "grad_norm": 1.2265625, "learning_rate": 0.00026950000000000005, "loss": 7.153, "mean_token_accuracy": 0.10467413961887359, "num_tokens": 981796.0, "step": 540 }, { "entropy": 7.461965847015381, "epoch": 0.46841426729694885, "grad_norm": 1.2890625, "learning_rate": 0.00027200000000000005, "loss": 7.2143, "mean_token_accuracy": 0.10574938952922822, "num_tokens": 990677.0, "step": 545 }, { "entropy": 7.328928756713867, "epoch": 0.47271164589600345, "grad_norm": 1.15625, "learning_rate": 0.0002745, "loss": 7.1479, "mean_token_accuracy": 0.10492404326796531, "num_tokens": 1001131.0, "step": 550 }, { "entropy": 7.405250549316406, "epoch": 0.477009024495058, "grad_norm": 1.1640625, "learning_rate": 0.000277, "loss": 7.2806, "mean_token_accuracy": 0.0978497438132763, "num_tokens": 1009925.0, "step": 555 }, { "entropy": 7.450163650512695, "epoch": 0.4813064030941126, "grad_norm": 1.140625, "learning_rate": 0.0002795, "loss": 7.211, "mean_token_accuracy": 0.10683610290288925, "num_tokens": 1018998.0, "step": 560 }, { "entropy": 7.455226850509644, "epoch": 0.48560378169316715, "grad_norm": 1.1015625, "learning_rate": 0.00028199999999999997, "loss": 7.1873, "mean_token_accuracy": 0.10439918413758278, "num_tokens": 1027496.0, "step": 565 }, { "entropy": 7.419484996795655, "epoch": 0.48990116029222175, "grad_norm": 1.0390625, "learning_rate": 0.0002845, "loss": 7.1247, "mean_token_accuracy": 0.11058635860681534, "num_tokens": 1035669.0, "step": 570 }, { "entropy": 7.423511219024658, "epoch": 0.4941985388912763, "grad_norm": 1.171875, "learning_rate": 0.000287, "loss": 7.2032, "mean_token_accuracy": 0.10203403383493423, "num_tokens": 1044416.0, "step": 575 }, { "entropy": 7.437924432754516, "epoch": 0.4984959174903309, "grad_norm": 1.3125, "learning_rate": 0.0002895, "loss": 7.2185, "mean_token_accuracy": 0.10163830146193505, "num_tokens": 1053500.0, "step": 580 }, { "entropy": 7.371481227874756, "epoch": 0.5027932960893855, "grad_norm": 1.15625, "learning_rate": 0.000292, "loss": 7.1261, "mean_token_accuracy": 0.10348242074251175, "num_tokens": 1061758.0, "step": 585 }, { "entropy": 7.363918590545654, "epoch": 0.50709067468844, "grad_norm": 1.28125, "learning_rate": 0.0002945, "loss": 7.1857, "mean_token_accuracy": 0.10252994000911712, "num_tokens": 1070570.0, "step": 590 }, { "entropy": 7.363972854614258, "epoch": 0.5113880532874946, "grad_norm": 1.1640625, "learning_rate": 0.000297, "loss": 7.1311, "mean_token_accuracy": 0.1051255501806736, "num_tokens": 1080640.0, "step": 595 }, { "entropy": 7.389889287948608, "epoch": 0.5156854318865493, "grad_norm": 1.34375, "learning_rate": 0.0002995, "loss": 7.1887, "mean_token_accuracy": 0.10394371747970581, "num_tokens": 1090680.0, "step": 600 }, { "entropy": 7.449554491043091, "epoch": 0.5199828104856038, "grad_norm": 1.0859375, "learning_rate": 0.000302, "loss": 7.2423, "mean_token_accuracy": 0.0991745762526989, "num_tokens": 1100453.0, "step": 605 }, { "entropy": 7.254623937606811, "epoch": 0.5242801890846583, "grad_norm": 1.3125, "learning_rate": 0.0003045, "loss": 7.0726, "mean_token_accuracy": 0.11043546348810196, "num_tokens": 1109085.0, "step": 610 }, { "entropy": 7.319861698150635, "epoch": 0.5285775676837129, "grad_norm": 1.21875, "learning_rate": 0.000307, "loss": 7.0439, "mean_token_accuracy": 0.1101709671318531, "num_tokens": 1118333.0, "step": 615 }, { "entropy": 7.288142681121826, "epoch": 0.5328749462827675, "grad_norm": 1.140625, "learning_rate": 0.0003095, "loss": 7.0361, "mean_token_accuracy": 0.11464432403445243, "num_tokens": 1127459.0, "step": 620 }, { "entropy": 7.3332359790802, "epoch": 0.5371723248818221, "grad_norm": 1.15625, "learning_rate": 0.000312, "loss": 7.1691, "mean_token_accuracy": 0.1035873532295227, "num_tokens": 1137071.0, "step": 625 }, { "entropy": 7.295236444473266, "epoch": 0.5414697034808766, "grad_norm": 1.1796875, "learning_rate": 0.0003145, "loss": 7.1535, "mean_token_accuracy": 0.10194391012191772, "num_tokens": 1146856.0, "step": 630 }, { "entropy": 7.367660856246948, "epoch": 0.5457670820799312, "grad_norm": 1.3125, "learning_rate": 0.000317, "loss": 7.1897, "mean_token_accuracy": 0.10307556018233299, "num_tokens": 1155847.0, "step": 635 }, { "entropy": 7.313199043273926, "epoch": 0.5500644606789858, "grad_norm": 1.21875, "learning_rate": 0.0003195, "loss": 7.1504, "mean_token_accuracy": 0.10430814623832703, "num_tokens": 1164922.0, "step": 640 }, { "entropy": 7.366647577285766, "epoch": 0.5543618392780404, "grad_norm": 1.25, "learning_rate": 0.000322, "loss": 7.1199, "mean_token_accuracy": 0.10304575935006141, "num_tokens": 1174389.0, "step": 645 }, { "entropy": 7.232296657562256, "epoch": 0.5586592178770949, "grad_norm": 1.078125, "learning_rate": 0.00032450000000000003, "loss": 7.1016, "mean_token_accuracy": 0.10503174364566803, "num_tokens": 1182959.0, "step": 650 }, { "entropy": 7.329212665557861, "epoch": 0.5629565964761496, "grad_norm": 1.2265625, "learning_rate": 0.00032700000000000003, "loss": 7.1193, "mean_token_accuracy": 0.10655850470066071, "num_tokens": 1191777.0, "step": 655 }, { "entropy": 7.235855960845948, "epoch": 0.5672539750752041, "grad_norm": 1.125, "learning_rate": 0.00032950000000000004, "loss": 7.0269, "mean_token_accuracy": 0.11145639792084694, "num_tokens": 1200658.0, "step": 660 }, { "entropy": 7.195139932632446, "epoch": 0.5715513536742587, "grad_norm": 1.2421875, "learning_rate": 0.00033200000000000005, "loss": 7.0138, "mean_token_accuracy": 0.11196710541844368, "num_tokens": 1209607.0, "step": 665 }, { "entropy": 7.403189420700073, "epoch": 0.5758487322733132, "grad_norm": 1.2109375, "learning_rate": 0.00033450000000000005, "loss": 7.158, "mean_token_accuracy": 0.10276976600289345, "num_tokens": 1218146.0, "step": 670 }, { "entropy": 7.122986936569214, "epoch": 0.5801461108723679, "grad_norm": 1.234375, "learning_rate": 0.000337, "loss": 7.0265, "mean_token_accuracy": 0.11236484497785568, "num_tokens": 1226886.0, "step": 675 }, { "entropy": 7.288639545440674, "epoch": 0.5844434894714224, "grad_norm": 1.1640625, "learning_rate": 0.0003395, "loss": 7.0344, "mean_token_accuracy": 0.11365340650081635, "num_tokens": 1235408.0, "step": 680 }, { "entropy": 7.159159898757935, "epoch": 0.588740868070477, "grad_norm": 1.2734375, "learning_rate": 0.000342, "loss": 7.025, "mean_token_accuracy": 0.11552022844552993, "num_tokens": 1244643.0, "step": 685 }, { "entropy": 7.252866315841675, "epoch": 0.5930382466695315, "grad_norm": 1.328125, "learning_rate": 0.00034449999999999997, "loss": 7.0859, "mean_token_accuracy": 0.10846259817481041, "num_tokens": 1254145.0, "step": 690 }, { "entropy": 7.239425182342529, "epoch": 0.5973356252685862, "grad_norm": 1.1015625, "learning_rate": 0.000347, "loss": 7.1242, "mean_token_accuracy": 0.10573266297578812, "num_tokens": 1263395.0, "step": 695 }, { "entropy": 7.336990690231323, "epoch": 0.6016330038676407, "grad_norm": 1.171875, "learning_rate": 0.0003495, "loss": 7.0478, "mean_token_accuracy": 0.11208071708679199, "num_tokens": 1272942.0, "step": 700 }, { "entropy": 7.102862453460693, "epoch": 0.6059303824666953, "grad_norm": 1.171875, "learning_rate": 0.000352, "loss": 6.9782, "mean_token_accuracy": 0.11494042649865151, "num_tokens": 1281481.0, "step": 705 }, { "entropy": 7.3168416023254395, "epoch": 0.6102277610657499, "grad_norm": 1.1015625, "learning_rate": 0.0003545, "loss": 7.1398, "mean_token_accuracy": 0.10162141174077988, "num_tokens": 1290455.0, "step": 710 }, { "entropy": 7.213319635391235, "epoch": 0.6145251396648045, "grad_norm": 1.1953125, "learning_rate": 0.000357, "loss": 7.0151, "mean_token_accuracy": 0.1105075441300869, "num_tokens": 1299241.0, "step": 715 }, { "entropy": 7.2681577682495115, "epoch": 0.618822518263859, "grad_norm": 1.234375, "learning_rate": 0.0003595, "loss": 7.0957, "mean_token_accuracy": 0.10155534744262695, "num_tokens": 1308658.0, "step": 720 }, { "entropy": 7.2813207626342775, "epoch": 0.6231198968629136, "grad_norm": 1.1328125, "learning_rate": 0.000362, "loss": 7.0292, "mean_token_accuracy": 0.10810133516788482, "num_tokens": 1316987.0, "step": 725 }, { "entropy": 7.062563180923462, "epoch": 0.6274172754619682, "grad_norm": 1.2265625, "learning_rate": 0.0003645, "loss": 6.984, "mean_token_accuracy": 0.10933754518628121, "num_tokens": 1325500.0, "step": 730 }, { "entropy": 7.164379596710205, "epoch": 0.6317146540610228, "grad_norm": 1.2265625, "learning_rate": 0.000367, "loss": 7.1053, "mean_token_accuracy": 0.11041567921638488, "num_tokens": 1335048.0, "step": 735 }, { "entropy": 7.225457286834716, "epoch": 0.6360120326600773, "grad_norm": 1.2734375, "learning_rate": 0.0003695, "loss": 7.0434, "mean_token_accuracy": 0.11181584149599075, "num_tokens": 1343879.0, "step": 740 }, { "entropy": 7.160865116119385, "epoch": 0.6403094112591319, "grad_norm": 1.1875, "learning_rate": 0.000372, "loss": 6.9566, "mean_token_accuracy": 0.11149153709411622, "num_tokens": 1353169.0, "step": 745 }, { "entropy": 7.17898383140564, "epoch": 0.6446067898581865, "grad_norm": 1.15625, "learning_rate": 0.0003745, "loss": 7.0493, "mean_token_accuracy": 0.10884664580225945, "num_tokens": 1362912.0, "step": 750 }, { "entropy": 7.154080009460449, "epoch": 0.6489041684572411, "grad_norm": 1.171875, "learning_rate": 0.000377, "loss": 7.053, "mean_token_accuracy": 0.1088360756635666, "num_tokens": 1372331.0, "step": 755 }, { "entropy": 7.138390731811524, "epoch": 0.6532015470562956, "grad_norm": 1.1484375, "learning_rate": 0.0003795, "loss": 6.9359, "mean_token_accuracy": 0.11739541292190551, "num_tokens": 1381060.0, "step": 760 }, { "entropy": 7.090542840957641, "epoch": 0.6574989256553503, "grad_norm": 1.2890625, "learning_rate": 0.000382, "loss": 6.9446, "mean_token_accuracy": 0.12408584356307983, "num_tokens": 1388749.0, "step": 765 }, { "entropy": 7.075214385986328, "epoch": 0.6617963042544048, "grad_norm": 1.0703125, "learning_rate": 0.0003845, "loss": 6.9269, "mean_token_accuracy": 0.11776903718709945, "num_tokens": 1398456.0, "step": 770 }, { "entropy": 7.124542617797852, "epoch": 0.6660936828534594, "grad_norm": 1.1875, "learning_rate": 0.00038700000000000003, "loss": 6.9221, "mean_token_accuracy": 0.1167554147541523, "num_tokens": 1407430.0, "step": 775 }, { "entropy": 7.009809112548828, "epoch": 0.6703910614525139, "grad_norm": 1.125, "learning_rate": 0.00038950000000000003, "loss": 7.0097, "mean_token_accuracy": 0.10950447097420693, "num_tokens": 1416631.0, "step": 780 }, { "entropy": 7.185323333740234, "epoch": 0.6746884400515686, "grad_norm": 1.1875, "learning_rate": 0.00039200000000000004, "loss": 6.9554, "mean_token_accuracy": 0.1113646723330021, "num_tokens": 1426124.0, "step": 785 }, { "entropy": 7.108248376846314, "epoch": 0.6789858186506231, "grad_norm": 1.2109375, "learning_rate": 0.00039450000000000005, "loss": 7.0781, "mean_token_accuracy": 0.10988424271345139, "num_tokens": 1436510.0, "step": 790 }, { "entropy": 7.196552371978759, "epoch": 0.6832831972496777, "grad_norm": 1.1640625, "learning_rate": 0.00039700000000000005, "loss": 7.007, "mean_token_accuracy": 0.10850347205996513, "num_tokens": 1445954.0, "step": 795 }, { "entropy": 7.0683338165283205, "epoch": 0.6875805758487322, "grad_norm": 1.046875, "learning_rate": 0.0003995, "loss": 7.0326, "mean_token_accuracy": 0.10642682984471322, "num_tokens": 1454981.0, "step": 800 }, { "entropy": 7.130348634719849, "epoch": 0.6918779544477869, "grad_norm": 1.1640625, "learning_rate": 0.000402, "loss": 6.981, "mean_token_accuracy": 0.11366944611072541, "num_tokens": 1464904.0, "step": 805 }, { "entropy": 7.058192777633667, "epoch": 0.6961753330468414, "grad_norm": 1.140625, "learning_rate": 0.0004045, "loss": 6.8463, "mean_token_accuracy": 0.1203661397099495, "num_tokens": 1473605.0, "step": 810 }, { "entropy": 7.020400810241699, "epoch": 0.700472711645896, "grad_norm": 1.2890625, "learning_rate": 0.00040699999999999997, "loss": 6.8966, "mean_token_accuracy": 0.12048028632998467, "num_tokens": 1482989.0, "step": 815 }, { "entropy": 7.021880626678467, "epoch": 0.7047700902449506, "grad_norm": 1.0859375, "learning_rate": 0.0004095, "loss": 6.9765, "mean_token_accuracy": 0.11234921589493752, "num_tokens": 1492514.0, "step": 820 }, { "entropy": 7.082749080657959, "epoch": 0.7090674688440052, "grad_norm": 1.1953125, "learning_rate": 0.000412, "loss": 6.9776, "mean_token_accuracy": 0.11630082428455353, "num_tokens": 1501127.0, "step": 825 }, { "entropy": 7.084704065322876, "epoch": 0.7133648474430597, "grad_norm": 1.21875, "learning_rate": 0.0004145, "loss": 6.9896, "mean_token_accuracy": 0.11336685940623284, "num_tokens": 1509698.0, "step": 830 }, { "entropy": 7.083193683624268, "epoch": 0.7176622260421143, "grad_norm": 1.125, "learning_rate": 0.000417, "loss": 6.9501, "mean_token_accuracy": 0.1161960445344448, "num_tokens": 1518224.0, "step": 835 }, { "entropy": 7.068277740478516, "epoch": 0.7219596046411689, "grad_norm": 1.1484375, "learning_rate": 0.0004195, "loss": 6.9509, "mean_token_accuracy": 0.11460287198424339, "num_tokens": 1527163.0, "step": 840 }, { "entropy": 7.035658502578736, "epoch": 0.7262569832402235, "grad_norm": 1.1875, "learning_rate": 0.000422, "loss": 6.9773, "mean_token_accuracy": 0.11205969154834747, "num_tokens": 1536980.0, "step": 845 }, { "entropy": 7.014459228515625, "epoch": 0.730554361839278, "grad_norm": 1.1328125, "learning_rate": 0.0004245, "loss": 6.933, "mean_token_accuracy": 0.1107229508459568, "num_tokens": 1546388.0, "step": 850 }, { "entropy": 7.04270453453064, "epoch": 0.7348517404383326, "grad_norm": 1.171875, "learning_rate": 0.000427, "loss": 6.9719, "mean_token_accuracy": 0.1091302290558815, "num_tokens": 1555618.0, "step": 855 }, { "entropy": 7.163297176361084, "epoch": 0.7391491190373872, "grad_norm": 1.1171875, "learning_rate": 0.0004295, "loss": 7.0471, "mean_token_accuracy": 0.11037192791700363, "num_tokens": 1565398.0, "step": 860 }, { "entropy": 7.015673398971558, "epoch": 0.7434464976364418, "grad_norm": 1.09375, "learning_rate": 0.000432, "loss": 6.9003, "mean_token_accuracy": 0.11521378830075264, "num_tokens": 1574052.0, "step": 865 }, { "entropy": 6.948957300186157, "epoch": 0.7477438762354963, "grad_norm": 1.0859375, "learning_rate": 0.0004345, "loss": 6.8385, "mean_token_accuracy": 0.12051832377910614, "num_tokens": 1582930.0, "step": 870 }, { "entropy": 6.9927011013031, "epoch": 0.752041254834551, "grad_norm": 1.140625, "learning_rate": 0.000437, "loss": 6.9591, "mean_token_accuracy": 0.11156816780567169, "num_tokens": 1592007.0, "step": 875 }, { "entropy": 7.008735847473145, "epoch": 0.7563386334336055, "grad_norm": 1.140625, "learning_rate": 0.0004395, "loss": 6.7845, "mean_token_accuracy": 0.12361353784799575, "num_tokens": 1600532.0, "step": 880 }, { "entropy": 6.962292051315307, "epoch": 0.7606360120326601, "grad_norm": 1.125, "learning_rate": 0.000442, "loss": 6.9289, "mean_token_accuracy": 0.1097280241549015, "num_tokens": 1610319.0, "step": 885 }, { "entropy": 6.939612913131714, "epoch": 0.7649333906317146, "grad_norm": 1.296875, "learning_rate": 0.0004445, "loss": 6.7976, "mean_token_accuracy": 0.11956171989440918, "num_tokens": 1618161.0, "step": 890 }, { "entropy": 7.0276683330535885, "epoch": 0.7692307692307693, "grad_norm": 1.0703125, "learning_rate": 0.000447, "loss": 6.9023, "mean_token_accuracy": 0.11797274127602578, "num_tokens": 1627676.0, "step": 895 }, { "entropy": 6.978840589523315, "epoch": 0.7735281478298238, "grad_norm": 1.1875, "learning_rate": 0.00044950000000000003, "loss": 6.8601, "mean_token_accuracy": 0.1139043152332306, "num_tokens": 1636693.0, "step": 900 }, { "entropy": 6.861077356338501, "epoch": 0.7778255264288784, "grad_norm": 1.046875, "learning_rate": 0.00045200000000000004, "loss": 6.8644, "mean_token_accuracy": 0.11552541553974152, "num_tokens": 1645577.0, "step": 905 }, { "entropy": 6.998029899597168, "epoch": 0.7821229050279329, "grad_norm": 1.1015625, "learning_rate": 0.00045450000000000004, "loss": 6.8572, "mean_token_accuracy": 0.1161652997136116, "num_tokens": 1654239.0, "step": 910 }, { "entropy": 7.036835432052612, "epoch": 0.7864202836269876, "grad_norm": 1.2421875, "learning_rate": 0.00045700000000000005, "loss": 6.8756, "mean_token_accuracy": 0.11719652488827706, "num_tokens": 1663085.0, "step": 915 }, { "entropy": 6.875935173034668, "epoch": 0.7907176622260421, "grad_norm": 1.2578125, "learning_rate": 0.00045950000000000006, "loss": 6.9058, "mean_token_accuracy": 0.11936888322234154, "num_tokens": 1671621.0, "step": 920 }, { "entropy": 7.0160260677337645, "epoch": 0.7950150408250967, "grad_norm": 1.3203125, "learning_rate": 0.000462, "loss": 6.8876, "mean_token_accuracy": 0.11704642698168755, "num_tokens": 1680912.0, "step": 925 }, { "entropy": 6.802255773544312, "epoch": 0.7993124194241513, "grad_norm": 1.078125, "learning_rate": 0.0004645, "loss": 6.7984, "mean_token_accuracy": 0.1263578489422798, "num_tokens": 1689772.0, "step": 930 }, { "entropy": 7.00699782371521, "epoch": 0.8036097980232059, "grad_norm": 1.1484375, "learning_rate": 0.000467, "loss": 6.9767, "mean_token_accuracy": 0.10714940577745438, "num_tokens": 1698985.0, "step": 935 }, { "entropy": 6.9496043682098385, "epoch": 0.8079071766222604, "grad_norm": 1.1015625, "learning_rate": 0.0004695, "loss": 6.8334, "mean_token_accuracy": 0.11713856160640716, "num_tokens": 1707365.0, "step": 940 }, { "entropy": 6.864590072631836, "epoch": 0.812204555221315, "grad_norm": 1.0703125, "learning_rate": 0.000472, "loss": 6.8486, "mean_token_accuracy": 0.12177055031061172, "num_tokens": 1715858.0, "step": 945 }, { "entropy": 7.043800115585327, "epoch": 0.8165019338203696, "grad_norm": 1.0625, "learning_rate": 0.0004745, "loss": 6.8787, "mean_token_accuracy": 0.11329701766371728, "num_tokens": 1724721.0, "step": 950 }, { "entropy": 6.8629217624664305, "epoch": 0.8207993124194242, "grad_norm": 1.1875, "learning_rate": 0.000477, "loss": 6.8973, "mean_token_accuracy": 0.11501588821411132, "num_tokens": 1733700.0, "step": 955 }, { "entropy": 6.911140823364258, "epoch": 0.8250966910184787, "grad_norm": 1.0546875, "learning_rate": 0.0004795, "loss": 6.8497, "mean_token_accuracy": 0.11782671734690667, "num_tokens": 1742167.0, "step": 960 }, { "entropy": 7.022890186309814, "epoch": 0.8293940696175333, "grad_norm": 1.125, "learning_rate": 0.000482, "loss": 6.8634, "mean_token_accuracy": 0.11890430226922036, "num_tokens": 1752087.0, "step": 965 }, { "entropy": 6.841674852371216, "epoch": 0.8336914482165879, "grad_norm": 1.109375, "learning_rate": 0.0004845, "loss": 6.8119, "mean_token_accuracy": 0.12273848205804824, "num_tokens": 1760749.0, "step": 970 }, { "entropy": 6.708367443084716, "epoch": 0.8379888268156425, "grad_norm": 1.1953125, "learning_rate": 0.000487, "loss": 6.8394, "mean_token_accuracy": 0.118587414175272, "num_tokens": 1770923.0, "step": 975 }, { "entropy": 6.947722911834717, "epoch": 0.842286205414697, "grad_norm": 1.28125, "learning_rate": 0.0004895, "loss": 6.8257, "mean_token_accuracy": 0.11907628253102302, "num_tokens": 1779233.0, "step": 980 }, { "entropy": 6.948696708679199, "epoch": 0.8465835840137517, "grad_norm": 1.375, "learning_rate": 0.000492, "loss": 6.8234, "mean_token_accuracy": 0.11929655894637108, "num_tokens": 1787593.0, "step": 985 }, { "entropy": 6.848589468002319, "epoch": 0.8508809626128062, "grad_norm": 1.2109375, "learning_rate": 0.0004945, "loss": 6.8683, "mean_token_accuracy": 0.11564295887947082, "num_tokens": 1796655.0, "step": 990 }, { "entropy": 6.848339986801148, "epoch": 0.8551783412118608, "grad_norm": 1.3359375, "learning_rate": 0.000497, "loss": 6.7993, "mean_token_accuracy": 0.1252160184085369, "num_tokens": 1805790.0, "step": 995 }, { "entropy": 6.861878204345703, "epoch": 0.8594757198109153, "grad_norm": 1.1875, "learning_rate": 0.0004995, "loss": 6.7821, "mean_token_accuracy": 0.11595688387751579, "num_tokens": 1813776.0, "step": 1000 }, { "epoch": 0.8594757198109153, "eval_entropy": 6.850721193863465, "eval_loss": 6.848105430603027, "eval_mean_token_accuracy": 0.12149045062628952, "eval_num_tokens": 1813776.0, "eval_runtime": 2.8306, "eval_samples_per_second": 1253.81, "eval_steps_per_second": 156.859, "step": 1000 }, { "entropy": 6.787899780273437, "epoch": 0.86377309840997, "grad_norm": 1.078125, "learning_rate": 0.0004999998427807679, "loss": 6.7924, "mean_token_accuracy": 0.11906375139951705, "num_tokens": 1823034.0, "step": 1005 }, { "entropy": 6.925178575515747, "epoch": 0.8680704770090245, "grad_norm": 1.1953125, "learning_rate": 0.0004999992040780138, "loss": 6.8714, "mean_token_accuracy": 0.115791717171669, "num_tokens": 1832320.0, "step": 1010 }, { "entropy": 6.781938219070435, "epoch": 0.8723678556080791, "grad_norm": 1.1015625, "learning_rate": 0.0004999980740669294, "loss": 6.7573, "mean_token_accuracy": 0.12310137376189231, "num_tokens": 1841165.0, "step": 1015 }, { "entropy": 6.863918399810791, "epoch": 0.8766652342071336, "grad_norm": 0.98828125, "learning_rate": 0.0004999964527499823, "loss": 6.8264, "mean_token_accuracy": 0.11974046677350998, "num_tokens": 1850440.0, "step": 1020 }, { "entropy": 6.80152702331543, "epoch": 0.8809626128061883, "grad_norm": 1.4375, "learning_rate": 0.0004999943401307127, "loss": 6.8336, "mean_token_accuracy": 0.11709848865866661, "num_tokens": 1859304.0, "step": 1025 }, { "entropy": 6.884733772277832, "epoch": 0.8852599914052428, "grad_norm": 1.0703125, "learning_rate": 0.0004999917362137337, "loss": 6.7027, "mean_token_accuracy": 0.12448290213942528, "num_tokens": 1867560.0, "step": 1030 }, { "entropy": 6.801468753814698, "epoch": 0.8895573700042974, "grad_norm": 1.0703125, "learning_rate": 0.0004999886410047312, "loss": 6.7809, "mean_token_accuracy": 0.12414068430662155, "num_tokens": 1876742.0, "step": 1035 }, { "entropy": 6.889640283584595, "epoch": 0.8938547486033519, "grad_norm": 1.2265625, "learning_rate": 0.0004999850545104638, "loss": 6.7848, "mean_token_accuracy": 0.12225122228264809, "num_tokens": 1885738.0, "step": 1040 }, { "entropy": 6.826289463043213, "epoch": 0.8981521272024066, "grad_norm": 1.1328125, "learning_rate": 0.0004999809767387633, "loss": 6.8167, "mean_token_accuracy": 0.11297583729028701, "num_tokens": 1894688.0, "step": 1045 }, { "entropy": 6.887860727310181, "epoch": 0.9024495058014611, "grad_norm": 1.2109375, "learning_rate": 0.0004999764076985337, "loss": 6.8767, "mean_token_accuracy": 0.12184796631336212, "num_tokens": 1903809.0, "step": 1050 }, { "entropy": 6.873423671722412, "epoch": 0.9067468844005157, "grad_norm": 1.1171875, "learning_rate": 0.0004999713473997519, "loss": 6.834, "mean_token_accuracy": 0.1166172593832016, "num_tokens": 1913558.0, "step": 1055 }, { "entropy": 6.811271381378174, "epoch": 0.9110442629995703, "grad_norm": 1.265625, "learning_rate": 0.0004999657958534677, "loss": 6.8109, "mean_token_accuracy": 0.11310545653104782, "num_tokens": 1923324.0, "step": 1060 }, { "entropy": 6.750212335586548, "epoch": 0.9153416415986249, "grad_norm": 1.0703125, "learning_rate": 0.0004999597530718034, "loss": 6.7839, "mean_token_accuracy": 0.120677300542593, "num_tokens": 1932849.0, "step": 1065 }, { "entropy": 6.9223932266235355, "epoch": 0.9196390201976794, "grad_norm": 1.09375, "learning_rate": 0.000499953219067954, "loss": 6.9007, "mean_token_accuracy": 0.11593888625502587, "num_tokens": 1942678.0, "step": 1070 }, { "entropy": 6.778281164169312, "epoch": 0.923936398796734, "grad_norm": 1.0390625, "learning_rate": 0.0004999461938561873, "loss": 6.7536, "mean_token_accuracy": 0.11781821995973588, "num_tokens": 1951670.0, "step": 1075 }, { "entropy": 6.896324634552002, "epoch": 0.9282337773957886, "grad_norm": 1.0625, "learning_rate": 0.0004999386774518432, "loss": 6.8645, "mean_token_accuracy": 0.12120396941900254, "num_tokens": 1961060.0, "step": 1080 }, { "entropy": 6.905940532684326, "epoch": 0.9325311559948432, "grad_norm": 1.1171875, "learning_rate": 0.0004999306698713349, "loss": 6.8059, "mean_token_accuracy": 0.11919425427913666, "num_tokens": 1970790.0, "step": 1085 }, { "entropy": 6.860645055770874, "epoch": 0.9368285345938977, "grad_norm": 1.203125, "learning_rate": 0.0004999221711321477, "loss": 6.8232, "mean_token_accuracy": 0.11798580288887024, "num_tokens": 1980016.0, "step": 1090 }, { "entropy": 6.765835952758789, "epoch": 0.9411259131929522, "grad_norm": 1.171875, "learning_rate": 0.0004999131812528393, "loss": 6.7942, "mean_token_accuracy": 0.12255456075072288, "num_tokens": 1989542.0, "step": 1095 }, { "entropy": 6.922926950454712, "epoch": 0.9454232917920069, "grad_norm": 1.0078125, "learning_rate": 0.00049990370025304, "loss": 6.7695, "mean_token_accuracy": 0.1269351787865162, "num_tokens": 1999212.0, "step": 1100 }, { "entropy": 6.666564416885376, "epoch": 0.9497206703910615, "grad_norm": 1.0390625, "learning_rate": 0.0004998937281534526, "loss": 6.7551, "mean_token_accuracy": 0.12631533294916153, "num_tokens": 2008378.0, "step": 1105 }, { "entropy": 6.820988655090332, "epoch": 0.954018048990116, "grad_norm": 1.2890625, "learning_rate": 0.0004998832649758521, "loss": 6.8346, "mean_token_accuracy": 0.11563185527920723, "num_tokens": 2018985.0, "step": 1110 }, { "entropy": 6.789529275894165, "epoch": 0.9583154275891707, "grad_norm": 1.1640625, "learning_rate": 0.0004998723107430862, "loss": 6.7218, "mean_token_accuracy": 0.12006904929876328, "num_tokens": 2027274.0, "step": 1115 }, { "entropy": 6.760359621047973, "epoch": 0.9626128061882252, "grad_norm": 1.0390625, "learning_rate": 0.0004998608654790741, "loss": 6.8206, "mean_token_accuracy": 0.12053585797548294, "num_tokens": 2036892.0, "step": 1120 }, { "entropy": 6.926661109924316, "epoch": 0.9669101847872797, "grad_norm": 1.015625, "learning_rate": 0.000499848929208808, "loss": 6.7966, "mean_token_accuracy": 0.11386888101696968, "num_tokens": 2046042.0, "step": 1125 }, { "entropy": 6.7287068367004395, "epoch": 0.9712075633863343, "grad_norm": 1.1015625, "learning_rate": 0.0004998365019583519, "loss": 6.7663, "mean_token_accuracy": 0.11801247894763947, "num_tokens": 2054576.0, "step": 1130 }, { "entropy": 6.731119585037232, "epoch": 0.975504941985389, "grad_norm": 1.046875, "learning_rate": 0.0004998235837548417, "loss": 6.7113, "mean_token_accuracy": 0.12452540397644044, "num_tokens": 2063552.0, "step": 1135 }, { "entropy": 6.721849632263184, "epoch": 0.9798023205844435, "grad_norm": 0.9921875, "learning_rate": 0.000499810174626486, "loss": 6.7168, "mean_token_accuracy": 0.12163661047816277, "num_tokens": 2072965.0, "step": 1140 }, { "entropy": 6.808212089538574, "epoch": 0.984099699183498, "grad_norm": 1.328125, "learning_rate": 0.0004997962746025646, "loss": 6.7754, "mean_token_accuracy": 0.12033762335777283, "num_tokens": 2082461.0, "step": 1145 }, { "entropy": 6.747566175460816, "epoch": 0.9883970777825526, "grad_norm": 1.21875, "learning_rate": 0.0004997818837134298, "loss": 6.7715, "mean_token_accuracy": 0.12163460701704025, "num_tokens": 2091022.0, "step": 1150 }, { "entropy": 6.744241046905517, "epoch": 0.9926944563816072, "grad_norm": 1.1875, "learning_rate": 0.0004997670019905057, "loss": 6.6552, "mean_token_accuracy": 0.13288048580288886, "num_tokens": 2099896.0, "step": 1155 }, { "entropy": 6.769083023071289, "epoch": 0.9969918349806618, "grad_norm": 1.109375, "learning_rate": 0.0004997516294662876, "loss": 6.7577, "mean_token_accuracy": 0.12401864305138588, "num_tokens": 2109122.0, "step": 1160 }, { "entropy": 6.859591378106011, "epoch": 1.0008594757198108, "grad_norm": 1.0234375, "learning_rate": 0.0004997357661743433, "loss": 6.7057, "mean_token_accuracy": 0.12527080294158724, "num_tokens": 2117879.0, "step": 1165 }, { "entropy": 6.636478424072266, "epoch": 1.0051568543188656, "grad_norm": 1.0234375, "learning_rate": 0.0004997194121493118, "loss": 6.4751, "mean_token_accuracy": 0.13114811182022096, "num_tokens": 2127552.0, "step": 1170 }, { "entropy": 6.738952016830444, "epoch": 1.0094542329179201, "grad_norm": 1.125, "learning_rate": 0.0004997025674269037, "loss": 6.4838, "mean_token_accuracy": 0.12866360768675805, "num_tokens": 2136648.0, "step": 1175 }, { "entropy": 6.67201509475708, "epoch": 1.0137516115169747, "grad_norm": 1.0625, "learning_rate": 0.0004996852320439013, "loss": 6.5263, "mean_token_accuracy": 0.13279551938176154, "num_tokens": 2144852.0, "step": 1180 }, { "entropy": 6.675800752639771, "epoch": 1.0180489901160292, "grad_norm": 1.0859375, "learning_rate": 0.0004996674060381578, "loss": 6.5531, "mean_token_accuracy": 0.12884859815239907, "num_tokens": 2154567.0, "step": 1185 }, { "entropy": 6.688924407958984, "epoch": 1.0223463687150838, "grad_norm": 1.0390625, "learning_rate": 0.0004996490894485985, "loss": 6.5359, "mean_token_accuracy": 0.12873365879058837, "num_tokens": 2164260.0, "step": 1190 }, { "entropy": 6.644716072082519, "epoch": 1.0266437473141383, "grad_norm": 1.0859375, "learning_rate": 0.0004996302823152193, "loss": 6.5181, "mean_token_accuracy": 0.12822481170296668, "num_tokens": 2173247.0, "step": 1195 }, { "entropy": 6.574692296981811, "epoch": 1.0309411259131929, "grad_norm": 1.0859375, "learning_rate": 0.0004996109846790873, "loss": 6.5603, "mean_token_accuracy": 0.12655097916722297, "num_tokens": 2181595.0, "step": 1200 }, { "entropy": 6.753303909301758, "epoch": 1.0352385045122476, "grad_norm": 1.03125, "learning_rate": 0.0004995911965823412, "loss": 6.4769, "mean_token_accuracy": 0.12973184511065483, "num_tokens": 2190608.0, "step": 1205 }, { "entropy": 6.538211107254028, "epoch": 1.0395358831113022, "grad_norm": 1.0546875, "learning_rate": 0.0004995709180681899, "loss": 6.4797, "mean_token_accuracy": 0.14387280195951463, "num_tokens": 2199131.0, "step": 1210 }, { "entropy": 6.674481058120728, "epoch": 1.0438332617103567, "grad_norm": 1.078125, "learning_rate": 0.000499550149180914, "loss": 6.6247, "mean_token_accuracy": 0.12701441198587418, "num_tokens": 2208365.0, "step": 1215 }, { "entropy": 6.658597755432129, "epoch": 1.0481306403094113, "grad_norm": 1.1484375, "learning_rate": 0.0004995288899658641, "loss": 6.4953, "mean_token_accuracy": 0.1288551889359951, "num_tokens": 2216851.0, "step": 1220 }, { "entropy": 6.630938100814819, "epoch": 1.0524280189084658, "grad_norm": 1.046875, "learning_rate": 0.0004995071404694619, "loss": 6.5736, "mean_token_accuracy": 0.12576404958963394, "num_tokens": 2225309.0, "step": 1225 }, { "entropy": 6.695171594619751, "epoch": 1.0567253975075204, "grad_norm": 1.1484375, "learning_rate": 0.0004994849007391996, "loss": 6.5228, "mean_token_accuracy": 0.1320165403187275, "num_tokens": 2235036.0, "step": 1230 }, { "entropy": 6.625878429412841, "epoch": 1.061022776106575, "grad_norm": 1.1171875, "learning_rate": 0.0004994621708236401, "loss": 6.5198, "mean_token_accuracy": 0.12893396690487863, "num_tokens": 2244038.0, "step": 1235 }, { "entropy": 6.645451402664184, "epoch": 1.0653201547056295, "grad_norm": 0.99609375, "learning_rate": 0.000499438950772416, "loss": 6.4709, "mean_token_accuracy": 0.13499100208282472, "num_tokens": 2252828.0, "step": 1240 }, { "entropy": 6.610739994049072, "epoch": 1.0696175333046842, "grad_norm": 1.125, "learning_rate": 0.0004994152406362311, "loss": 6.4523, "mean_token_accuracy": 0.13818272650241853, "num_tokens": 2261709.0, "step": 1245 }, { "entropy": 6.59524974822998, "epoch": 1.0739149119037388, "grad_norm": 1.140625, "learning_rate": 0.0004993910404668586, "loss": 6.4923, "mean_token_accuracy": 0.13403210416436195, "num_tokens": 2269801.0, "step": 1250 }, { "entropy": 6.591278791427612, "epoch": 1.0782122905027933, "grad_norm": 1.0546875, "learning_rate": 0.000499366350317142, "loss": 6.4461, "mean_token_accuracy": 0.1370372988283634, "num_tokens": 2280587.0, "step": 1255 }, { "entropy": 6.460198545455933, "epoch": 1.0825096691018479, "grad_norm": 1.1484375, "learning_rate": 0.0004993411702409948, "loss": 6.4397, "mean_token_accuracy": 0.1323759824037552, "num_tokens": 2289783.0, "step": 1260 }, { "entropy": 6.588274049758911, "epoch": 1.0868070477009024, "grad_norm": 1.1171875, "learning_rate": 0.0004993155002934002, "loss": 6.5313, "mean_token_accuracy": 0.12670424431562424, "num_tokens": 2298785.0, "step": 1265 }, { "entropy": 6.64993691444397, "epoch": 1.091104426299957, "grad_norm": 1.1875, "learning_rate": 0.0004992893405304111, "loss": 6.6208, "mean_token_accuracy": 0.13185966834425927, "num_tokens": 2308400.0, "step": 1270 }, { "entropy": 6.641791296005249, "epoch": 1.0954018048990115, "grad_norm": 1.03125, "learning_rate": 0.00049926269100915, "loss": 6.4313, "mean_token_accuracy": 0.13738049939274788, "num_tokens": 2317440.0, "step": 1275 }, { "entropy": 6.503924989700318, "epoch": 1.0996991834980663, "grad_norm": 1.1171875, "learning_rate": 0.0004992355517878087, "loss": 6.4783, "mean_token_accuracy": 0.131829671561718, "num_tokens": 2326730.0, "step": 1280 }, { "entropy": 6.57679181098938, "epoch": 1.1039965620971208, "grad_norm": 1.0390625, "learning_rate": 0.0004992079229256484, "loss": 6.4692, "mean_token_accuracy": 0.13649967312812805, "num_tokens": 2336126.0, "step": 1285 }, { "entropy": 6.6197991371154785, "epoch": 1.1082939406961754, "grad_norm": 1.0234375, "learning_rate": 0.0004991798044829996, "loss": 6.4954, "mean_token_accuracy": 0.13550228029489517, "num_tokens": 2345144.0, "step": 1290 }, { "entropy": 6.5108154773712155, "epoch": 1.11259131929523, "grad_norm": 1.046875, "learning_rate": 0.0004991511965212618, "loss": 6.444, "mean_token_accuracy": 0.13719593361020088, "num_tokens": 2353851.0, "step": 1295 }, { "entropy": 6.5021027565002445, "epoch": 1.1168886978942845, "grad_norm": 1.125, "learning_rate": 0.0004991220991029032, "loss": 6.4387, "mean_token_accuracy": 0.13497617840766907, "num_tokens": 2362316.0, "step": 1300 }, { "entropy": 6.660447835922241, "epoch": 1.121186076493339, "grad_norm": 1.0078125, "learning_rate": 0.000499092512291461, "loss": 6.5457, "mean_token_accuracy": 0.1298186369240284, "num_tokens": 2373350.0, "step": 1305 }, { "entropy": 6.587765121459961, "epoch": 1.1254834550923936, "grad_norm": 1.078125, "learning_rate": 0.000499062436151541, "loss": 6.4847, "mean_token_accuracy": 0.13602642267942427, "num_tokens": 2381753.0, "step": 1310 }, { "entropy": 6.5865904808044435, "epoch": 1.129780833691448, "grad_norm": 1.125, "learning_rate": 0.0004990318707488173, "loss": 6.5174, "mean_token_accuracy": 0.1304781563580036, "num_tokens": 2390093.0, "step": 1315 }, { "entropy": 6.707785511016846, "epoch": 1.1340782122905029, "grad_norm": 1.09375, "learning_rate": 0.0004990008161500327, "loss": 6.5307, "mean_token_accuracy": 0.13693483620882035, "num_tokens": 2399103.0, "step": 1320 }, { "entropy": 6.539694452285767, "epoch": 1.1383755908895574, "grad_norm": 1.0546875, "learning_rate": 0.000498969272422998, "loss": 6.4963, "mean_token_accuracy": 0.13442791253328323, "num_tokens": 2407530.0, "step": 1325 }, { "entropy": 6.5834043502807615, "epoch": 1.142672969488612, "grad_norm": 1.046875, "learning_rate": 0.0004989372396365921, "loss": 6.4721, "mean_token_accuracy": 0.13653133809566498, "num_tokens": 2416264.0, "step": 1330 }, { "entropy": 6.560483932495117, "epoch": 1.1469703480876665, "grad_norm": 1.0703125, "learning_rate": 0.0004989047178607618, "loss": 6.5643, "mean_token_accuracy": 0.1255203329026699, "num_tokens": 2425256.0, "step": 1335 }, { "entropy": 6.543246126174926, "epoch": 1.151267726686721, "grad_norm": 1.015625, "learning_rate": 0.0004988717071665215, "loss": 6.5303, "mean_token_accuracy": 0.12744321376085282, "num_tokens": 2434343.0, "step": 1340 }, { "entropy": 6.625397109985352, "epoch": 1.1555651052857756, "grad_norm": 1.59375, "learning_rate": 0.0004988382076259537, "loss": 6.439, "mean_token_accuracy": 0.13895059525966644, "num_tokens": 2442864.0, "step": 1345 }, { "entropy": 6.505967378616333, "epoch": 1.1598624838848304, "grad_norm": 1.21875, "learning_rate": 0.0004988042193122077, "loss": 6.482, "mean_token_accuracy": 0.1311720348894596, "num_tokens": 2451701.0, "step": 1350 }, { "entropy": 6.503494215011597, "epoch": 1.164159862483885, "grad_norm": 1.0859375, "learning_rate": 0.0004987697422995005, "loss": 6.4696, "mean_token_accuracy": 0.13065513744950294, "num_tokens": 2460943.0, "step": 1355 }, { "entropy": 6.595712518692016, "epoch": 1.1684572410829395, "grad_norm": 1.1015625, "learning_rate": 0.0004987347766631161, "loss": 6.4954, "mean_token_accuracy": 0.13297019228339196, "num_tokens": 2470294.0, "step": 1360 }, { "entropy": 6.517033290863037, "epoch": 1.172754619681994, "grad_norm": 1.53125, "learning_rate": 0.0004986993224794055, "loss": 6.5629, "mean_token_accuracy": 0.13079115897417068, "num_tokens": 2479530.0, "step": 1365 }, { "entropy": 6.589979982376098, "epoch": 1.1770519982810486, "grad_norm": 1.0625, "learning_rate": 0.0004986633798257865, "loss": 6.3268, "mean_token_accuracy": 0.13975912407040597, "num_tokens": 2488511.0, "step": 1370 }, { "entropy": 6.550735712051392, "epoch": 1.181349376880103, "grad_norm": 1.125, "learning_rate": 0.0004986269487807434, "loss": 6.5284, "mean_token_accuracy": 0.1279216580092907, "num_tokens": 2497868.0, "step": 1375 }, { "entropy": 6.562166547775268, "epoch": 1.1856467554791577, "grad_norm": 0.98046875, "learning_rate": 0.000498590029423827, "loss": 6.4477, "mean_token_accuracy": 0.13719073608517646, "num_tokens": 2506873.0, "step": 1380 }, { "entropy": 6.647982025146485, "epoch": 1.1899441340782122, "grad_norm": 0.93359375, "learning_rate": 0.0004985526218356546, "loss": 6.5799, "mean_token_accuracy": 0.13164269253611566, "num_tokens": 2517317.0, "step": 1385 }, { "entropy": 6.559144067764282, "epoch": 1.1942415126772667, "grad_norm": 0.98828125, "learning_rate": 0.0004985147260979093, "loss": 6.4983, "mean_token_accuracy": 0.13328756764531136, "num_tokens": 2527348.0, "step": 1390 }, { "entropy": 6.5675629615783695, "epoch": 1.1985388912763215, "grad_norm": 1.0703125, "learning_rate": 0.0004984763422933402, "loss": 6.4813, "mean_token_accuracy": 0.13246413692831993, "num_tokens": 2536277.0, "step": 1395 }, { "entropy": 6.5679216384887695, "epoch": 1.202836269875376, "grad_norm": 1.0546875, "learning_rate": 0.0004984374705057623, "loss": 6.5581, "mean_token_accuracy": 0.1256929397583008, "num_tokens": 2545638.0, "step": 1400 }, { "entropy": 6.445409727096558, "epoch": 1.2071336484744306, "grad_norm": 1.0234375, "learning_rate": 0.0004983981108200561, "loss": 6.3901, "mean_token_accuracy": 0.13980056941509247, "num_tokens": 2555694.0, "step": 1405 }, { "entropy": 6.59971604347229, "epoch": 1.2114310270734852, "grad_norm": 1.1171875, "learning_rate": 0.0004983582633221672, "loss": 6.4436, "mean_token_accuracy": 0.13092342391610146, "num_tokens": 2564344.0, "step": 1410 }, { "entropy": 6.468144750595092, "epoch": 1.2157284056725397, "grad_norm": 1.046875, "learning_rate": 0.0004983179280991068, "loss": 6.4329, "mean_token_accuracy": 0.13643699064850806, "num_tokens": 2573726.0, "step": 1415 }, { "entropy": 6.531007194519043, "epoch": 1.2200257842715942, "grad_norm": 1.0703125, "learning_rate": 0.0004982771052389508, "loss": 6.4943, "mean_token_accuracy": 0.13096859753131868, "num_tokens": 2582845.0, "step": 1420 }, { "entropy": 6.531826734542847, "epoch": 1.224323162870649, "grad_norm": 1.140625, "learning_rate": 0.0004982357948308401, "loss": 6.3872, "mean_token_accuracy": 0.1383131504058838, "num_tokens": 2591258.0, "step": 1425 }, { "entropy": 6.575545120239258, "epoch": 1.2286205414697036, "grad_norm": 1.15625, "learning_rate": 0.0004981939969649799, "loss": 6.4782, "mean_token_accuracy": 0.13248563408851624, "num_tokens": 2600099.0, "step": 1430 }, { "entropy": 6.531699705123901, "epoch": 1.232917920068758, "grad_norm": 1.09375, "learning_rate": 0.0004981517117326404, "loss": 6.4466, "mean_token_accuracy": 0.1367930218577385, "num_tokens": 2608845.0, "step": 1435 }, { "entropy": 6.4251275062561035, "epoch": 1.2372152986678127, "grad_norm": 1.046875, "learning_rate": 0.0004981089392261553, "loss": 6.3915, "mean_token_accuracy": 0.14260655716061593, "num_tokens": 2618723.0, "step": 1440 }, { "entropy": 6.515915298461914, "epoch": 1.2415126772668672, "grad_norm": 1.0390625, "learning_rate": 0.000498065679538923, "loss": 6.4512, "mean_token_accuracy": 0.13224708959460257, "num_tokens": 2628542.0, "step": 1445 }, { "entropy": 6.4922788619995115, "epoch": 1.2458100558659218, "grad_norm": 1.140625, "learning_rate": 0.0004980219327654049, "loss": 6.4214, "mean_token_accuracy": 0.14079917669296266, "num_tokens": 2637395.0, "step": 1450 }, { "entropy": 6.43779935836792, "epoch": 1.2501074344649763, "grad_norm": 1.09375, "learning_rate": 0.000497977699001127, "loss": 6.2848, "mean_token_accuracy": 0.14780827164649962, "num_tokens": 2645545.0, "step": 1455 }, { "entropy": 6.449300241470337, "epoch": 1.2544048130640308, "grad_norm": 1.0546875, "learning_rate": 0.0004979329783426778, "loss": 6.4446, "mean_token_accuracy": 0.1389339432120323, "num_tokens": 2654000.0, "step": 1460 }, { "entropy": 6.54451584815979, "epoch": 1.2587021916630854, "grad_norm": 1.0859375, "learning_rate": 0.0004978877708877094, "loss": 6.4506, "mean_token_accuracy": 0.13394884243607522, "num_tokens": 2664017.0, "step": 1465 }, { "entropy": 6.453659868240356, "epoch": 1.2629995702621402, "grad_norm": 1.0703125, "learning_rate": 0.0004978420767349368, "loss": 6.4412, "mean_token_accuracy": 0.13818295150995255, "num_tokens": 2673250.0, "step": 1470 }, { "entropy": 6.53358006477356, "epoch": 1.2672969488611947, "grad_norm": 1.0625, "learning_rate": 0.0004977958959841379, "loss": 6.4796, "mean_token_accuracy": 0.13405440375208855, "num_tokens": 2682190.0, "step": 1475 }, { "entropy": 6.550917911529541, "epoch": 1.2715943274602493, "grad_norm": 1.2265625, "learning_rate": 0.000497749228736153, "loss": 6.4152, "mean_token_accuracy": 0.13004215285182, "num_tokens": 2691425.0, "step": 1480 }, { "entropy": 6.5540321350097654, "epoch": 1.2758917060593038, "grad_norm": 1.3671875, "learning_rate": 0.0004977020750928845, "loss": 6.5022, "mean_token_accuracy": 0.1328156165778637, "num_tokens": 2701123.0, "step": 1485 }, { "entropy": 6.401340389251709, "epoch": 1.2801890846583583, "grad_norm": 1.109375, "learning_rate": 0.0004976544351572973, "loss": 6.5081, "mean_token_accuracy": 0.1309308812022209, "num_tokens": 2710829.0, "step": 1490 }, { "entropy": 6.600834655761719, "epoch": 1.2844864632574131, "grad_norm": 1.140625, "learning_rate": 0.0004976063090334179, "loss": 6.4494, "mean_token_accuracy": 0.13603252917528152, "num_tokens": 2720313.0, "step": 1495 }, { "entropy": 6.446039533615112, "epoch": 1.2887838418564677, "grad_norm": 1.078125, "learning_rate": 0.0004975576968263346, "loss": 6.3644, "mean_token_accuracy": 0.13654347658157348, "num_tokens": 2729734.0, "step": 1500 }, { "epoch": 1.2887838418564677, "eval_entropy": 6.42241061270774, "eval_loss": 6.562856674194336, "eval_mean_token_accuracy": 0.13629841859880332, "eval_num_tokens": 2729734.0, "eval_runtime": 2.6412, "eval_samples_per_second": 1343.717, "eval_steps_per_second": 168.107, "step": 1500 }, { "entropy": 6.496413612365723, "epoch": 1.2930812204555222, "grad_norm": 1.09375, "learning_rate": 0.000497508598642197, "loss": 6.4498, "mean_token_accuracy": 0.13591181635856628, "num_tokens": 2739001.0, "step": 1505 }, { "entropy": 6.4927387714385985, "epoch": 1.2973785990545768, "grad_norm": 1.0859375, "learning_rate": 0.000497459014588216, "loss": 6.3461, "mean_token_accuracy": 0.14019913077354432, "num_tokens": 2748460.0, "step": 1510 }, { "entropy": 6.442285966873169, "epoch": 1.3016759776536313, "grad_norm": 1.0625, "learning_rate": 0.000497408944772663, "loss": 6.4495, "mean_token_accuracy": 0.13356760740280152, "num_tokens": 2757993.0, "step": 1515 }, { "entropy": 6.442544317245483, "epoch": 1.3059733562526858, "grad_norm": 1.0078125, "learning_rate": 0.0004973583893048707, "loss": 6.4679, "mean_token_accuracy": 0.1391291558742523, "num_tokens": 2767380.0, "step": 1520 }, { "entropy": 6.537827825546264, "epoch": 1.3102707348517404, "grad_norm": 0.97265625, "learning_rate": 0.0004973073482952321, "loss": 6.3971, "mean_token_accuracy": 0.1322616696357727, "num_tokens": 2776207.0, "step": 1525 }, { "entropy": 6.452885007858276, "epoch": 1.314568113450795, "grad_norm": 1.015625, "learning_rate": 0.0004972558218552004, "loss": 6.4398, "mean_token_accuracy": 0.13432919085025788, "num_tokens": 2785857.0, "step": 1530 }, { "entropy": 6.486521863937378, "epoch": 1.3188654920498495, "grad_norm": 1.1640625, "learning_rate": 0.0004972038100972885, "loss": 6.5342, "mean_token_accuracy": 0.1303657077252865, "num_tokens": 2795500.0, "step": 1535 }, { "entropy": 6.549186372756958, "epoch": 1.323162870648904, "grad_norm": 1.109375, "learning_rate": 0.0004971513131350697, "loss": 6.4088, "mean_token_accuracy": 0.13469692692160606, "num_tokens": 2804188.0, "step": 1540 }, { "entropy": 6.489724349975586, "epoch": 1.3274602492479588, "grad_norm": 1.2109375, "learning_rate": 0.0004970983310831759, "loss": 6.424, "mean_token_accuracy": 0.12920740991830826, "num_tokens": 2814255.0, "step": 1545 }, { "entropy": 6.468247175216675, "epoch": 1.3317576278470133, "grad_norm": 1.171875, "learning_rate": 0.0004970448640572989, "loss": 6.3908, "mean_token_accuracy": 0.13704784587025642, "num_tokens": 2823059.0, "step": 1550 }, { "entropy": 6.443971824645996, "epoch": 1.336055006446068, "grad_norm": 1.0703125, "learning_rate": 0.0004969909121741895, "loss": 6.3212, "mean_token_accuracy": 0.14167552590370178, "num_tokens": 2831729.0, "step": 1555 }, { "entropy": 6.461103248596191, "epoch": 1.3403523850451224, "grad_norm": 1.203125, "learning_rate": 0.0004969364755516569, "loss": 6.3786, "mean_token_accuracy": 0.1437497019767761, "num_tokens": 2839597.0, "step": 1560 }, { "entropy": 6.413368654251099, "epoch": 1.344649763644177, "grad_norm": 1.078125, "learning_rate": 0.0004968815543085689, "loss": 6.2597, "mean_token_accuracy": 0.1471225917339325, "num_tokens": 2847964.0, "step": 1565 }, { "entropy": 6.442201375961304, "epoch": 1.3489471422432318, "grad_norm": 1.1015625, "learning_rate": 0.0004968261485648516, "loss": 6.4682, "mean_token_accuracy": 0.13341710045933725, "num_tokens": 2857712.0, "step": 1570 }, { "entropy": 6.399351978302002, "epoch": 1.3532445208422863, "grad_norm": 1.1875, "learning_rate": 0.000496770258441489, "loss": 6.4641, "mean_token_accuracy": 0.13078686520457267, "num_tokens": 2866724.0, "step": 1575 }, { "entropy": 6.548488187789917, "epoch": 1.3575418994413408, "grad_norm": 1.109375, "learning_rate": 0.0004967138840605228, "loss": 6.3578, "mean_token_accuracy": 0.14059459790587425, "num_tokens": 2875318.0, "step": 1580 }, { "entropy": 6.420933103561401, "epoch": 1.3618392780403954, "grad_norm": 1.1015625, "learning_rate": 0.000496657025545052, "loss": 6.3964, "mean_token_accuracy": 0.13322596848011017, "num_tokens": 2883794.0, "step": 1585 }, { "entropy": 6.4831382751464846, "epoch": 1.36613665663945, "grad_norm": 1.171875, "learning_rate": 0.000496599683019233, "loss": 6.4175, "mean_token_accuracy": 0.1317307434976101, "num_tokens": 2891996.0, "step": 1590 }, { "entropy": 6.506607484817505, "epoch": 1.3704340352385045, "grad_norm": 1.015625, "learning_rate": 0.000496541856608279, "loss": 6.5069, "mean_token_accuracy": 0.13520395755767822, "num_tokens": 2901718.0, "step": 1595 }, { "entropy": 6.488222885131836, "epoch": 1.374731413837559, "grad_norm": 1.1015625, "learning_rate": 0.0004964835464384595, "loss": 6.3369, "mean_token_accuracy": 0.1403390385210514, "num_tokens": 2910924.0, "step": 1600 }, { "entropy": 6.356355381011963, "epoch": 1.3790287924366136, "grad_norm": 1.0703125, "learning_rate": 0.000496424752637101, "loss": 6.4404, "mean_token_accuracy": 0.1325266629457474, "num_tokens": 2920075.0, "step": 1605 }, { "entropy": 6.4637175559997555, "epoch": 1.3833261710356681, "grad_norm": 1.078125, "learning_rate": 0.0004963654753325853, "loss": 6.3958, "mean_token_accuracy": 0.14068760275840758, "num_tokens": 2928946.0, "step": 1610 }, { "entropy": 6.382746267318725, "epoch": 1.387623549634723, "grad_norm": 1.1796875, "learning_rate": 0.0004963057146543505, "loss": 6.3788, "mean_token_accuracy": 0.14359928518533707, "num_tokens": 2936817.0, "step": 1615 }, { "entropy": 6.462194156646729, "epoch": 1.3919209282337774, "grad_norm": 1.2109375, "learning_rate": 0.00049624547073289, "loss": 6.3627, "mean_token_accuracy": 0.1397081971168518, "num_tokens": 2946096.0, "step": 1620 }, { "entropy": 6.3689014434814455, "epoch": 1.396218306832832, "grad_norm": 0.97265625, "learning_rate": 0.0004961847436997526, "loss": 6.2999, "mean_token_accuracy": 0.147130286693573, "num_tokens": 2955632.0, "step": 1625 }, { "entropy": 6.4761738777160645, "epoch": 1.4005156854318865, "grad_norm": 1.1484375, "learning_rate": 0.0004961235336875416, "loss": 6.3289, "mean_token_accuracy": 0.14046488851308822, "num_tokens": 2963779.0, "step": 1630 }, { "entropy": 6.419768238067627, "epoch": 1.404813064030941, "grad_norm": 1.1875, "learning_rate": 0.0004960618408299154, "loss": 6.3199, "mean_token_accuracy": 0.14862223267555236, "num_tokens": 2972778.0, "step": 1635 }, { "entropy": 6.360955905914307, "epoch": 1.4091104426299956, "grad_norm": 1.125, "learning_rate": 0.0004959996652615865, "loss": 6.4341, "mean_token_accuracy": 0.1319722667336464, "num_tokens": 2982318.0, "step": 1640 }, { "entropy": 6.514253997802735, "epoch": 1.4134078212290504, "grad_norm": 1.015625, "learning_rate": 0.0004959370071183216, "loss": 6.4039, "mean_token_accuracy": 0.14093454405665398, "num_tokens": 2991822.0, "step": 1645 }, { "entropy": 6.470624685287476, "epoch": 1.417705199828105, "grad_norm": 1.25, "learning_rate": 0.0004958738665369407, "loss": 6.4473, "mean_token_accuracy": 0.13844559118151664, "num_tokens": 3001203.0, "step": 1650 }, { "entropy": 6.412876272201538, "epoch": 1.4220025784271595, "grad_norm": 1.1171875, "learning_rate": 0.0004958102436553179, "loss": 6.3646, "mean_token_accuracy": 0.13862057998776436, "num_tokens": 3010445.0, "step": 1655 }, { "entropy": 6.440686845779419, "epoch": 1.426299957026214, "grad_norm": 0.98828125, "learning_rate": 0.00049574613861238, "loss": 6.3898, "mean_token_accuracy": 0.13541134893894197, "num_tokens": 3019919.0, "step": 1660 }, { "entropy": 6.509662914276123, "epoch": 1.4305973356252686, "grad_norm": 1.0078125, "learning_rate": 0.0004956815515481069, "loss": 6.5165, "mean_token_accuracy": 0.12789023146033288, "num_tokens": 3029469.0, "step": 1665 }, { "entropy": 6.461795949935913, "epoch": 1.4348947142243231, "grad_norm": 1.171875, "learning_rate": 0.0004956164826035309, "loss": 6.3809, "mean_token_accuracy": 0.14309595823287963, "num_tokens": 3038627.0, "step": 1670 }, { "entropy": 6.41576566696167, "epoch": 1.4391920928233777, "grad_norm": 0.9296875, "learning_rate": 0.0004955509319207363, "loss": 6.4312, "mean_token_accuracy": 0.13531435057520866, "num_tokens": 3048124.0, "step": 1675 }, { "entropy": 6.411845588684082, "epoch": 1.4434894714224322, "grad_norm": 1.1796875, "learning_rate": 0.0004954848996428601, "loss": 6.269, "mean_token_accuracy": 0.14824977070093154, "num_tokens": 3056394.0, "step": 1680 }, { "entropy": 6.383704996109008, "epoch": 1.4477868500214868, "grad_norm": 1.171875, "learning_rate": 0.00049541838591409, "loss": 6.3767, "mean_token_accuracy": 0.1388603314757347, "num_tokens": 3066521.0, "step": 1685 }, { "entropy": 6.452395057678222, "epoch": 1.4520842286205415, "grad_norm": 1.1015625, "learning_rate": 0.0004953513908796657, "loss": 6.4368, "mean_token_accuracy": 0.13928449675440788, "num_tokens": 3076571.0, "step": 1690 }, { "entropy": 6.397390127182007, "epoch": 1.456381607219596, "grad_norm": 1.234375, "learning_rate": 0.0004952839146858773, "loss": 6.4782, "mean_token_accuracy": 0.1314165897667408, "num_tokens": 3086086.0, "step": 1695 }, { "entropy": 6.3878926753997805, "epoch": 1.4606789858186506, "grad_norm": 1.3125, "learning_rate": 0.0004952159574800658, "loss": 6.3599, "mean_token_accuracy": 0.14619865864515305, "num_tokens": 3095046.0, "step": 1700 }, { "entropy": 6.403419876098633, "epoch": 1.4649763644177052, "grad_norm": 1.0703125, "learning_rate": 0.0004951475194106229, "loss": 6.3232, "mean_token_accuracy": 0.13754306733608246, "num_tokens": 3104193.0, "step": 1705 }, { "entropy": 6.475354766845703, "epoch": 1.4692737430167597, "grad_norm": 1.046875, "learning_rate": 0.0004950786006269898, "loss": 6.4103, "mean_token_accuracy": 0.1397714652121067, "num_tokens": 3112965.0, "step": 1710 }, { "entropy": 6.420578479766846, "epoch": 1.4735711216158143, "grad_norm": 1.015625, "learning_rate": 0.0004950092012796576, "loss": 6.4802, "mean_token_accuracy": 0.13525724932551383, "num_tokens": 3122883.0, "step": 1715 }, { "entropy": 6.446125411987305, "epoch": 1.477868500214869, "grad_norm": 1.078125, "learning_rate": 0.0004949393215201666, "loss": 6.334, "mean_token_accuracy": 0.14860173985362052, "num_tokens": 3132182.0, "step": 1720 }, { "entropy": 6.438638639450073, "epoch": 1.4821658788139236, "grad_norm": 1.0, "learning_rate": 0.0004948689615011065, "loss": 6.3881, "mean_token_accuracy": 0.13537878468632697, "num_tokens": 3141957.0, "step": 1725 }, { "entropy": 6.339945554733276, "epoch": 1.4864632574129781, "grad_norm": 1.203125, "learning_rate": 0.0004947981213761154, "loss": 6.3201, "mean_token_accuracy": 0.1484260804951191, "num_tokens": 3151374.0, "step": 1730 }, { "entropy": 6.324282693862915, "epoch": 1.4907606360120327, "grad_norm": 1.0390625, "learning_rate": 0.0004947268012998797, "loss": 6.3382, "mean_token_accuracy": 0.13972473591566087, "num_tokens": 3160815.0, "step": 1735 }, { "entropy": 6.4526674270629885, "epoch": 1.4950580146110872, "grad_norm": 1.078125, "learning_rate": 0.000494655001428134, "loss": 6.345, "mean_token_accuracy": 0.14593861922621726, "num_tokens": 3169684.0, "step": 1740 }, { "entropy": 6.443645286560058, "epoch": 1.4993553932101418, "grad_norm": 1.1015625, "learning_rate": 0.0004945827219176604, "loss": 6.3344, "mean_token_accuracy": 0.13984118551015853, "num_tokens": 3178754.0, "step": 1745 }, { "entropy": 6.419276237487793, "epoch": 1.5036527718091963, "grad_norm": 1.15625, "learning_rate": 0.0004945099629262888, "loss": 6.4109, "mean_token_accuracy": 0.1383548989892006, "num_tokens": 3187315.0, "step": 1750 }, { "entropy": 6.409943437576294, "epoch": 1.5079501504082509, "grad_norm": 1.125, "learning_rate": 0.0004944367246128954, "loss": 6.2452, "mean_token_accuracy": 0.1493537425994873, "num_tokens": 3195975.0, "step": 1755 }, { "entropy": 6.326399850845337, "epoch": 1.5122475290073054, "grad_norm": 1.140625, "learning_rate": 0.0004943630071374036, "loss": 6.3539, "mean_token_accuracy": 0.14070346504449843, "num_tokens": 3204071.0, "step": 1760 }, { "entropy": 6.41026463508606, "epoch": 1.51654490760636, "grad_norm": 1.0625, "learning_rate": 0.0004942888106607828, "loss": 6.339, "mean_token_accuracy": 0.14475558772683145, "num_tokens": 3213001.0, "step": 1765 }, { "entropy": 6.4736912727355955, "epoch": 1.5208422862054147, "grad_norm": 1.0546875, "learning_rate": 0.0004942141353450486, "loss": 6.3736, "mean_token_accuracy": 0.13328379541635513, "num_tokens": 3222576.0, "step": 1770 }, { "entropy": 6.408621740341187, "epoch": 1.5251396648044693, "grad_norm": 1.1171875, "learning_rate": 0.0004941389813532619, "loss": 6.3922, "mean_token_accuracy": 0.1397964984178543, "num_tokens": 3230474.0, "step": 1775 }, { "entropy": 6.462115287780762, "epoch": 1.5294370434035238, "grad_norm": 1.0703125, "learning_rate": 0.000494063348849529, "loss": 6.3624, "mean_token_accuracy": 0.14171589016914368, "num_tokens": 3238723.0, "step": 1780 }, { "entropy": 6.310955953598023, "epoch": 1.5337344220025786, "grad_norm": 1.1171875, "learning_rate": 0.0004939872379990011, "loss": 6.3057, "mean_token_accuracy": 0.1414056584239006, "num_tokens": 3247844.0, "step": 1785 }, { "entropy": 6.499557447433472, "epoch": 1.5380318006016331, "grad_norm": 1.1328125, "learning_rate": 0.0004939106489678739, "loss": 6.3996, "mean_token_accuracy": 0.13961976021528244, "num_tokens": 3257228.0, "step": 1790 }, { "entropy": 6.428326511383057, "epoch": 1.5423291792006877, "grad_norm": 1.109375, "learning_rate": 0.000493833581923387, "loss": 6.3806, "mean_token_accuracy": 0.1350629784166813, "num_tokens": 3266655.0, "step": 1795 }, { "entropy": 6.40258674621582, "epoch": 1.5466265577997422, "grad_norm": 1.078125, "learning_rate": 0.0004937560370338244, "loss": 6.3076, "mean_token_accuracy": 0.13736466988921164, "num_tokens": 3275213.0, "step": 1800 }, { "entropy": 6.4639317989349365, "epoch": 1.5509239363987968, "grad_norm": 1.0546875, "learning_rate": 0.000493678014468513, "loss": 6.4331, "mean_token_accuracy": 0.13448011130094528, "num_tokens": 3284447.0, "step": 1805 }, { "entropy": 6.456356191635132, "epoch": 1.5552213149978513, "grad_norm": 1.1015625, "learning_rate": 0.0004935995143978227, "loss": 6.3597, "mean_token_accuracy": 0.13500829488039018, "num_tokens": 3293568.0, "step": 1810 }, { "entropy": 6.347956132888794, "epoch": 1.5595186935969059, "grad_norm": 1.078125, "learning_rate": 0.0004935205369931664, "loss": 6.2955, "mean_token_accuracy": 0.14433372840285302, "num_tokens": 3302055.0, "step": 1815 }, { "entropy": 6.415659618377686, "epoch": 1.5638160721959604, "grad_norm": 1.25, "learning_rate": 0.0004934410824269992, "loss": 6.3521, "mean_token_accuracy": 0.141788549721241, "num_tokens": 3310672.0, "step": 1820 }, { "entropy": 6.385811614990234, "epoch": 1.568113450795015, "grad_norm": 1.1171875, "learning_rate": 0.0004933611508728182, "loss": 6.3045, "mean_token_accuracy": 0.14355277717113496, "num_tokens": 3319666.0, "step": 1825 }, { "entropy": 6.430783605575561, "epoch": 1.5724108293940695, "grad_norm": 1.1484375, "learning_rate": 0.000493280742505162, "loss": 6.3168, "mean_token_accuracy": 0.14499156102538108, "num_tokens": 3329121.0, "step": 1830 }, { "entropy": 6.328087186813354, "epoch": 1.576708207993124, "grad_norm": 1.1640625, "learning_rate": 0.0004931998574996102, "loss": 6.2982, "mean_token_accuracy": 0.14460441917181016, "num_tokens": 3337868.0, "step": 1835 }, { "entropy": 6.422233009338379, "epoch": 1.5810055865921788, "grad_norm": 1.171875, "learning_rate": 0.0004931184960327832, "loss": 6.3359, "mean_token_accuracy": 0.14177661910653114, "num_tokens": 3346447.0, "step": 1840 }, { "entropy": 6.337698698043823, "epoch": 1.5853029651912334, "grad_norm": 1.21875, "learning_rate": 0.0004930366582823421, "loss": 6.2971, "mean_token_accuracy": 0.13885951936244964, "num_tokens": 3355187.0, "step": 1845 }, { "entropy": 6.434715986251831, "epoch": 1.589600343790288, "grad_norm": 1.0234375, "learning_rate": 0.0004929543444269879, "loss": 6.5041, "mean_token_accuracy": 0.12198112457990647, "num_tokens": 3365978.0, "step": 1850 }, { "entropy": 6.421086025238037, "epoch": 1.5938977223893425, "grad_norm": 1.1484375, "learning_rate": 0.000492871554646461, "loss": 6.4553, "mean_token_accuracy": 0.13949850127100943, "num_tokens": 3374607.0, "step": 1855 }, { "entropy": 6.452510786056519, "epoch": 1.5981951009883972, "grad_norm": 1.03125, "learning_rate": 0.0004927882891215413, "loss": 6.3641, "mean_token_accuracy": 0.14000257328152657, "num_tokens": 3384541.0, "step": 1860 }, { "entropy": 6.383066320419312, "epoch": 1.6024924795874518, "grad_norm": 1.1328125, "learning_rate": 0.0004927045480340475, "loss": 6.3822, "mean_token_accuracy": 0.1305439554154873, "num_tokens": 3394009.0, "step": 1865 }, { "entropy": 6.446542024612427, "epoch": 1.6067898581865063, "grad_norm": 1.1015625, "learning_rate": 0.0004926203315668363, "loss": 6.3698, "mean_token_accuracy": 0.14797376990318298, "num_tokens": 3402550.0, "step": 1870 }, { "entropy": 6.390069961547852, "epoch": 1.6110872367855609, "grad_norm": 1.1015625, "learning_rate": 0.0004925356399038032, "loss": 6.3408, "mean_token_accuracy": 0.1447392597794533, "num_tokens": 3413230.0, "step": 1875 }, { "entropy": 6.27685923576355, "epoch": 1.6153846153846154, "grad_norm": 1.0859375, "learning_rate": 0.0004924504732298808, "loss": 6.3117, "mean_token_accuracy": 0.14603087455034255, "num_tokens": 3422325.0, "step": 1880 }, { "entropy": 6.474649381637573, "epoch": 1.61968199398367, "grad_norm": 0.97265625, "learning_rate": 0.0004923648317310391, "loss": 6.392, "mean_token_accuracy": 0.13447986543178558, "num_tokens": 3431758.0, "step": 1885 }, { "entropy": 6.331472253799438, "epoch": 1.6239793725827245, "grad_norm": 1.0703125, "learning_rate": 0.0004922787155942849, "loss": 6.2769, "mean_token_accuracy": 0.14332059174776077, "num_tokens": 3441281.0, "step": 1890 }, { "entropy": 6.405183362960815, "epoch": 1.628276751181779, "grad_norm": 1.1171875, "learning_rate": 0.0004921921250076611, "loss": 6.32, "mean_token_accuracy": 0.1474598653614521, "num_tokens": 3449822.0, "step": 1895 }, { "entropy": 6.439214515686035, "epoch": 1.6325741297808336, "grad_norm": 0.98828125, "learning_rate": 0.0004921050601602475, "loss": 6.3252, "mean_token_accuracy": 0.14000287130475045, "num_tokens": 3459437.0, "step": 1900 }, { "entropy": 6.364074611663819, "epoch": 1.6368715083798882, "grad_norm": 1.1953125, "learning_rate": 0.0004920175212421587, "loss": 6.3453, "mean_token_accuracy": 0.14289369359612464, "num_tokens": 3469546.0, "step": 1905 }, { "entropy": 6.427534103393555, "epoch": 1.6411688869789427, "grad_norm": 1.125, "learning_rate": 0.0004919295084445445, "loss": 6.316, "mean_token_accuracy": 0.13860969692468644, "num_tokens": 3478521.0, "step": 1910 }, { "entropy": 6.320402002334594, "epoch": 1.6454662655779975, "grad_norm": 1.125, "learning_rate": 0.0004918410219595899, "loss": 6.2135, "mean_token_accuracy": 0.1451512724161148, "num_tokens": 3487958.0, "step": 1915 }, { "entropy": 6.288850164413452, "epoch": 1.649763644177052, "grad_norm": 1.09375, "learning_rate": 0.000491752061980514, "loss": 6.3142, "mean_token_accuracy": 0.14572881534695625, "num_tokens": 3495941.0, "step": 1920 }, { "entropy": 6.415158891677857, "epoch": 1.6540610227761066, "grad_norm": 1.1171875, "learning_rate": 0.0004916626287015697, "loss": 6.3295, "mean_token_accuracy": 0.1428305320441723, "num_tokens": 3505172.0, "step": 1925 }, { "entropy": 6.391680335998535, "epoch": 1.658358401375161, "grad_norm": 1.15625, "learning_rate": 0.0004915727223180436, "loss": 6.3138, "mean_token_accuracy": 0.14527018666267394, "num_tokens": 3514084.0, "step": 1930 }, { "entropy": 6.442883253097534, "epoch": 1.6626557799742159, "grad_norm": 1.140625, "learning_rate": 0.0004914823430262554, "loss": 6.4421, "mean_token_accuracy": 0.13630780205130577, "num_tokens": 3523318.0, "step": 1935 }, { "entropy": 6.3719299793243405, "epoch": 1.6669531585732704, "grad_norm": 1.046875, "learning_rate": 0.0004913914910235573, "loss": 6.2712, "mean_token_accuracy": 0.1465964734554291, "num_tokens": 3531681.0, "step": 1940 }, { "entropy": 6.30449800491333, "epoch": 1.671250537172325, "grad_norm": 1.234375, "learning_rate": 0.0004913001665083337, "loss": 6.3462, "mean_token_accuracy": 0.14266296550631524, "num_tokens": 3540326.0, "step": 1945 }, { "entropy": 6.393455266952515, "epoch": 1.6755479157713795, "grad_norm": 1.0703125, "learning_rate": 0.0004912083696800008, "loss": 6.2845, "mean_token_accuracy": 0.13957952111959457, "num_tokens": 3548319.0, "step": 1950 }, { "entropy": 6.2641520500183105, "epoch": 1.679845294370434, "grad_norm": 1.0625, "learning_rate": 0.0004911161007390063, "loss": 6.1394, "mean_token_accuracy": 0.15182972550392151, "num_tokens": 3557743.0, "step": 1955 }, { "entropy": 6.277702379226684, "epoch": 1.6841426729694886, "grad_norm": 1.109375, "learning_rate": 0.0004910233598868287, "loss": 6.2682, "mean_token_accuracy": 0.14529897049069404, "num_tokens": 3566810.0, "step": 1960 }, { "entropy": 6.337201499938965, "epoch": 1.6884400515685432, "grad_norm": 1.1796875, "learning_rate": 0.0004909301473259769, "loss": 6.3446, "mean_token_accuracy": 0.1441364496946335, "num_tokens": 3576273.0, "step": 1965 }, { "entropy": 6.315463352203369, "epoch": 1.6927374301675977, "grad_norm": 1.15625, "learning_rate": 0.0004908364632599899, "loss": 6.3265, "mean_token_accuracy": 0.1417617380619049, "num_tokens": 3585362.0, "step": 1970 }, { "entropy": 6.334482049942016, "epoch": 1.6970348087666522, "grad_norm": 1.1796875, "learning_rate": 0.0004907423078934362, "loss": 6.3112, "mean_token_accuracy": 0.1375837117433548, "num_tokens": 3594445.0, "step": 1975 }, { "entropy": 6.350462293624878, "epoch": 1.7013321873657068, "grad_norm": 1.1640625, "learning_rate": 0.0004906476814319134, "loss": 6.3339, "mean_token_accuracy": 0.14064698591828345, "num_tokens": 3604046.0, "step": 1980 }, { "entropy": 6.426722812652588, "epoch": 1.7056295659647613, "grad_norm": 1.0703125, "learning_rate": 0.0004905525840820481, "loss": 6.3385, "mean_token_accuracy": 0.14573438987135887, "num_tokens": 3613264.0, "step": 1985 }, { "entropy": 6.352614307403565, "epoch": 1.709926944563816, "grad_norm": 1.109375, "learning_rate": 0.0004904570160514948, "loss": 6.2274, "mean_token_accuracy": 0.1472587391734123, "num_tokens": 3620938.0, "step": 1990 }, { "entropy": 6.332766199111939, "epoch": 1.7142243231628707, "grad_norm": 1.1875, "learning_rate": 0.0004903609775489358, "loss": 6.3316, "mean_token_accuracy": 0.141658017039299, "num_tokens": 3629782.0, "step": 1995 }, { "entropy": 6.470893049240113, "epoch": 1.7185217017619252, "grad_norm": 1.140625, "learning_rate": 0.0004902644687840809, "loss": 6.3851, "mean_token_accuracy": 0.13716112747788428, "num_tokens": 3638389.0, "step": 2000 }, { "epoch": 1.7185217017619252, "eval_entropy": 6.099528554323557, "eval_loss": 6.394359588623047, "eval_mean_token_accuracy": 0.1416532844808456, "eval_num_tokens": 3638389.0, "eval_runtime": 2.6474, "eval_samples_per_second": 1340.554, "eval_steps_per_second": 167.711, "step": 2000 }, { "entropy": 6.261544561386108, "epoch": 1.7228190803609797, "grad_norm": 1.1328125, "learning_rate": 0.0004901674899676667, "loss": 6.2108, "mean_token_accuracy": 0.15050435364246367, "num_tokens": 3647196.0, "step": 2005 }, { "entropy": 6.274995756149292, "epoch": 1.7271164589600345, "grad_norm": 1.0546875, "learning_rate": 0.0004900700413114561, "loss": 6.1529, "mean_token_accuracy": 0.14831772446632385, "num_tokens": 3655931.0, "step": 2010 }, { "entropy": 6.3229820728302, "epoch": 1.731413837559089, "grad_norm": 1.0390625, "learning_rate": 0.000489972123028238, "loss": 6.321, "mean_token_accuracy": 0.14567042738199235, "num_tokens": 3665340.0, "step": 2015 }, { "entropy": 6.3659852027893065, "epoch": 1.7357112161581436, "grad_norm": 1.046875, "learning_rate": 0.0004898737353318268, "loss": 6.2768, "mean_token_accuracy": 0.1477080449461937, "num_tokens": 3674674.0, "step": 2020 }, { "entropy": 6.348592519760132, "epoch": 1.7400085947571982, "grad_norm": 1.1171875, "learning_rate": 0.000489774878437062, "loss": 6.3145, "mean_token_accuracy": 0.14947012513875962, "num_tokens": 3683910.0, "step": 2025 }, { "entropy": 6.259040975570679, "epoch": 1.7443059733562527, "grad_norm": 1.1015625, "learning_rate": 0.0004896755525598074, "loss": 6.2112, "mean_token_accuracy": 0.14689078107476233, "num_tokens": 3692772.0, "step": 2030 }, { "entropy": 6.342519044876099, "epoch": 1.7486033519553073, "grad_norm": 1.046875, "learning_rate": 0.0004895757579169511, "loss": 6.2427, "mean_token_accuracy": 0.15017979145050048, "num_tokens": 3701875.0, "step": 2035 }, { "entropy": 6.292976188659668, "epoch": 1.7529007305543618, "grad_norm": 1.125, "learning_rate": 0.0004894754947264047, "loss": 6.2553, "mean_token_accuracy": 0.13835104927420616, "num_tokens": 3711059.0, "step": 2040 }, { "entropy": 6.299735260009766, "epoch": 1.7571981091534163, "grad_norm": 1.1015625, "learning_rate": 0.000489374763207103, "loss": 6.2281, "mean_token_accuracy": 0.15146950185298919, "num_tokens": 3719667.0, "step": 2045 }, { "entropy": 6.301810169219971, "epoch": 1.761495487752471, "grad_norm": 1.15625, "learning_rate": 0.0004892735635790033, "loss": 6.2123, "mean_token_accuracy": 0.1495981313288212, "num_tokens": 3728905.0, "step": 2050 }, { "entropy": 6.30145845413208, "epoch": 1.7657928663515254, "grad_norm": 1.078125, "learning_rate": 0.000489171896063085, "loss": 6.2537, "mean_token_accuracy": 0.1459835670888424, "num_tokens": 3737973.0, "step": 2055 }, { "entropy": 6.2883388042449955, "epoch": 1.77009024495058, "grad_norm": 1.0546875, "learning_rate": 0.0004890697608813495, "loss": 6.2163, "mean_token_accuracy": 0.14961224421858788, "num_tokens": 3747160.0, "step": 2060 }, { "entropy": 6.263640260696411, "epoch": 1.7743876235496348, "grad_norm": 1.140625, "learning_rate": 0.0004889671582568193, "loss": 6.1784, "mean_token_accuracy": 0.15031145811080932, "num_tokens": 3754908.0, "step": 2065 }, { "entropy": 6.346582460403442, "epoch": 1.7786850021486893, "grad_norm": 1.1484375, "learning_rate": 0.0004888640884135374, "loss": 6.2829, "mean_token_accuracy": 0.13900179788470268, "num_tokens": 3763588.0, "step": 2070 }, { "entropy": 6.257235670089722, "epoch": 1.7829823807477438, "grad_norm": 1.1796875, "learning_rate": 0.0004887605515765671, "loss": 6.1709, "mean_token_accuracy": 0.14929060488939286, "num_tokens": 3771932.0, "step": 2075 }, { "entropy": 6.365653419494629, "epoch": 1.7872797593467986, "grad_norm": 1.125, "learning_rate": 0.0004886565479719914, "loss": 6.3345, "mean_token_accuracy": 0.14113251492381096, "num_tokens": 3780761.0, "step": 2080 }, { "entropy": 6.262348651885986, "epoch": 1.7915771379458532, "grad_norm": 1.1171875, "learning_rate": 0.0004885520778269128, "loss": 6.1321, "mean_token_accuracy": 0.1545582115650177, "num_tokens": 3789511.0, "step": 2085 }, { "entropy": 6.2817658424377445, "epoch": 1.7958745165449077, "grad_norm": 1.0390625, "learning_rate": 0.0004884471413694523, "loss": 6.314, "mean_token_accuracy": 0.13621936738491058, "num_tokens": 3799068.0, "step": 2090 }, { "entropy": 6.329490661621094, "epoch": 1.8001718951439623, "grad_norm": 1.109375, "learning_rate": 0.0004883417388287491, "loss": 6.203, "mean_token_accuracy": 0.14342657700181008, "num_tokens": 3807850.0, "step": 2095 }, { "entropy": 6.38734540939331, "epoch": 1.8044692737430168, "grad_norm": 1.1796875, "learning_rate": 0.0004882358704349603, "loss": 6.2334, "mean_token_accuracy": 0.1539076805114746, "num_tokens": 3816232.0, "step": 2100 }, { "entropy": 6.277137184143067, "epoch": 1.8087666523420713, "grad_norm": 1.09375, "learning_rate": 0.0004881295364192601, "loss": 6.2852, "mean_token_accuracy": 0.14138692021369934, "num_tokens": 3825334.0, "step": 2105 }, { "entropy": 6.2631055355072025, "epoch": 1.813064030941126, "grad_norm": 1.1484375, "learning_rate": 0.0004880227370138394, "loss": 6.249, "mean_token_accuracy": 0.1496968075633049, "num_tokens": 3834756.0, "step": 2110 }, { "entropy": 6.390051364898682, "epoch": 1.8173614095401804, "grad_norm": 1.0859375, "learning_rate": 0.0004879154724519057, "loss": 6.3121, "mean_token_accuracy": 0.14131874218583107, "num_tokens": 3843852.0, "step": 2115 }, { "entropy": 6.326163721084595, "epoch": 1.821658788139235, "grad_norm": 1.109375, "learning_rate": 0.0004878077429676816, "loss": 6.1782, "mean_token_accuracy": 0.15569255948066713, "num_tokens": 3852213.0, "step": 2120 }, { "entropy": 6.302305793762207, "epoch": 1.8259561667382895, "grad_norm": 1.125, "learning_rate": 0.0004876995487964054, "loss": 6.3249, "mean_token_accuracy": 0.13407231569290162, "num_tokens": 3861522.0, "step": 2125 }, { "entropy": 6.268641996383667, "epoch": 1.830253545337344, "grad_norm": 1.15625, "learning_rate": 0.00048759089017432996, "loss": 6.2752, "mean_token_accuracy": 0.1495513841509819, "num_tokens": 3870328.0, "step": 2130 }, { "entropy": 6.366842555999756, "epoch": 1.8345509239363988, "grad_norm": 1.1953125, "learning_rate": 0.0004874817673387222, "loss": 6.253, "mean_token_accuracy": 0.14391155242919923, "num_tokens": 3880399.0, "step": 2135 }, { "entropy": 6.331115055084228, "epoch": 1.8388483025354534, "grad_norm": 1.0390625, "learning_rate": 0.00048737218052786275, "loss": 6.202, "mean_token_accuracy": 0.146192529797554, "num_tokens": 3889859.0, "step": 2140 }, { "entropy": 6.224690389633179, "epoch": 1.843145681134508, "grad_norm": 1.046875, "learning_rate": 0.00048726212998104554, "loss": 6.1712, "mean_token_accuracy": 0.1507162019610405, "num_tokens": 3899609.0, "step": 2145 }, { "entropy": 6.3443187236785885, "epoch": 1.8474430597335625, "grad_norm": 1.09375, "learning_rate": 0.0004871516159385768, "loss": 6.2796, "mean_token_accuracy": 0.13646257296204567, "num_tokens": 3909452.0, "step": 2150 }, { "entropy": 6.383110523223877, "epoch": 1.8517404383326173, "grad_norm": 1.1640625, "learning_rate": 0.0004870406386417752, "loss": 6.3188, "mean_token_accuracy": 0.14102417081594468, "num_tokens": 3918579.0, "step": 2155 }, { "entropy": 6.2510617733001705, "epoch": 1.8560378169316718, "grad_norm": 1.0703125, "learning_rate": 0.0004869291983329707, "loss": 6.2026, "mean_token_accuracy": 0.15068159848451615, "num_tokens": 3926951.0, "step": 2160 }, { "entropy": 6.326785755157471, "epoch": 1.8603351955307263, "grad_norm": 1.109375, "learning_rate": 0.0004868172952555044, "loss": 6.2538, "mean_token_accuracy": 0.14530059248208999, "num_tokens": 3935771.0, "step": 2165 }, { "entropy": 6.247272396087647, "epoch": 1.864632574129781, "grad_norm": 1.0390625, "learning_rate": 0.0004867049296537278, "loss": 6.1507, "mean_token_accuracy": 0.15399375408887864, "num_tokens": 3944577.0, "step": 2170 }, { "entropy": 6.3375420570373535, "epoch": 1.8689299527288354, "grad_norm": 1.0859375, "learning_rate": 0.0004865921017730027, "loss": 6.3118, "mean_token_accuracy": 0.14250392094254494, "num_tokens": 3954499.0, "step": 2175 }, { "entropy": 6.286665630340576, "epoch": 1.87322733132789, "grad_norm": 0.9921875, "learning_rate": 0.00048647881185969995, "loss": 6.2527, "mean_token_accuracy": 0.14288917630910875, "num_tokens": 3963953.0, "step": 2180 }, { "entropy": 6.279871034622192, "epoch": 1.8775247099269445, "grad_norm": 1.09375, "learning_rate": 0.0004863650601611994, "loss": 6.2466, "mean_token_accuracy": 0.14417033568024634, "num_tokens": 3973925.0, "step": 2185 }, { "entropy": 6.310920095443725, "epoch": 1.881822088525999, "grad_norm": 0.99609375, "learning_rate": 0.00048625084692588937, "loss": 6.2296, "mean_token_accuracy": 0.1480042040348053, "num_tokens": 3983280.0, "step": 2190 }, { "entropy": 6.281775856018067, "epoch": 1.8861194671250536, "grad_norm": 1.1171875, "learning_rate": 0.00048613617240316593, "loss": 6.2275, "mean_token_accuracy": 0.14622583016753196, "num_tokens": 3992767.0, "step": 2195 }, { "entropy": 6.342629909515381, "epoch": 1.8904168457241082, "grad_norm": 1.109375, "learning_rate": 0.0004860210368434323, "loss": 6.3037, "mean_token_accuracy": 0.1325987122952938, "num_tokens": 4001600.0, "step": 2200 }, { "entropy": 6.265765047073364, "epoch": 1.8947142243231627, "grad_norm": 1.15625, "learning_rate": 0.00048590544049809857, "loss": 6.2767, "mean_token_accuracy": 0.1438748598098755, "num_tokens": 4010852.0, "step": 2205 }, { "entropy": 6.340087509155273, "epoch": 1.8990116029222175, "grad_norm": 1.015625, "learning_rate": 0.000485789383619581, "loss": 6.1808, "mean_token_accuracy": 0.1515198156237602, "num_tokens": 4020280.0, "step": 2210 }, { "entropy": 6.251649570465088, "epoch": 1.903308981521272, "grad_norm": 1.0859375, "learning_rate": 0.0004856728664613015, "loss": 6.1924, "mean_token_accuracy": 0.14853738620877266, "num_tokens": 4029283.0, "step": 2215 }, { "entropy": 6.3928605079650875, "epoch": 1.9076063601203266, "grad_norm": 1.078125, "learning_rate": 0.00048555588927768674, "loss": 6.2813, "mean_token_accuracy": 0.15265752896666526, "num_tokens": 4038704.0, "step": 2220 }, { "entropy": 6.133363246917725, "epoch": 1.9119037387193811, "grad_norm": 1.109375, "learning_rate": 0.0004854384523241683, "loss": 6.149, "mean_token_accuracy": 0.14911998957395553, "num_tokens": 4047492.0, "step": 2225 }, { "entropy": 6.350856971740723, "epoch": 1.916201117318436, "grad_norm": 1.1328125, "learning_rate": 0.00048532055585718143, "loss": 6.3258, "mean_token_accuracy": 0.14355307817459106, "num_tokens": 4056792.0, "step": 2230 }, { "entropy": 6.365505075454712, "epoch": 1.9204984959174904, "grad_norm": 1.15625, "learning_rate": 0.00048520220013416505, "loss": 6.2246, "mean_token_accuracy": 0.1529555104672909, "num_tokens": 4065284.0, "step": 2235 }, { "entropy": 6.168982744216919, "epoch": 1.924795874516545, "grad_norm": 1.0625, "learning_rate": 0.0004850833854135607, "loss": 6.2088, "mean_token_accuracy": 0.1461514100432396, "num_tokens": 4074727.0, "step": 2240 }, { "entropy": 6.41944990158081, "epoch": 1.9290932531155995, "grad_norm": 1.1328125, "learning_rate": 0.0004849641119548122, "loss": 6.2592, "mean_token_accuracy": 0.15032583549618722, "num_tokens": 4083360.0, "step": 2245 }, { "entropy": 6.2758283615112305, "epoch": 1.933390631714654, "grad_norm": 1.203125, "learning_rate": 0.000484844380018365, "loss": 6.3513, "mean_token_accuracy": 0.13633401170372964, "num_tokens": 4092431.0, "step": 2250 }, { "entropy": 6.3127405643463135, "epoch": 1.9376880103137086, "grad_norm": 1.0390625, "learning_rate": 0.000484724189865666, "loss": 6.2257, "mean_token_accuracy": 0.1493070751428604, "num_tokens": 4102198.0, "step": 2255 }, { "entropy": 6.309014892578125, "epoch": 1.9419853889127632, "grad_norm": 1.0546875, "learning_rate": 0.0004846035417591624, "loss": 6.2159, "mean_token_accuracy": 0.14939168095588684, "num_tokens": 4111568.0, "step": 2260 }, { "entropy": 6.260059499740601, "epoch": 1.9462827675118177, "grad_norm": 1.03125, "learning_rate": 0.0004844824359623014, "loss": 6.2428, "mean_token_accuracy": 0.1440415069460869, "num_tokens": 4121151.0, "step": 2265 }, { "entropy": 6.318060827255249, "epoch": 1.9505801461108723, "grad_norm": 1.09375, "learning_rate": 0.00048436087273952966, "loss": 6.1757, "mean_token_accuracy": 0.14666527807712554, "num_tokens": 4130197.0, "step": 2270 }, { "entropy": 6.161466360092163, "epoch": 1.9548775247099268, "grad_norm": 1.171875, "learning_rate": 0.00048423885235629265, "loss": 6.1784, "mean_token_accuracy": 0.1395201563835144, "num_tokens": 4138310.0, "step": 2275 }, { "entropy": 6.2752457618713375, "epoch": 1.9591749033089814, "grad_norm": 1.03125, "learning_rate": 0.0004841163750790342, "loss": 6.1845, "mean_token_accuracy": 0.15314925760030745, "num_tokens": 4148270.0, "step": 2280 }, { "entropy": 6.315674591064453, "epoch": 1.9634722819080361, "grad_norm": 1.1875, "learning_rate": 0.00048399344117519555, "loss": 6.2468, "mean_token_accuracy": 0.14707700312137603, "num_tokens": 4157276.0, "step": 2285 }, { "entropy": 6.204446601867676, "epoch": 1.9677696605070907, "grad_norm": 1.0625, "learning_rate": 0.00048387005091321544, "loss": 6.2742, "mean_token_accuracy": 0.15154237672686577, "num_tokens": 4166144.0, "step": 2290 }, { "entropy": 6.408171319961548, "epoch": 1.9720670391061452, "grad_norm": 1.1796875, "learning_rate": 0.00048374620456252877, "loss": 6.2501, "mean_token_accuracy": 0.14817840680480004, "num_tokens": 4175146.0, "step": 2295 }, { "entropy": 6.269484567642212, "epoch": 1.9763644177052, "grad_norm": 1.078125, "learning_rate": 0.00048362190239356644, "loss": 6.2973, "mean_token_accuracy": 0.14276304692029954, "num_tokens": 4184089.0, "step": 2300 }, { "entropy": 6.2955399513244625, "epoch": 1.9806617963042545, "grad_norm": 1.171875, "learning_rate": 0.00048349714467775474, "loss": 6.2199, "mean_token_accuracy": 0.14973291605710984, "num_tokens": 4192453.0, "step": 2305 }, { "entropy": 6.279147005081176, "epoch": 1.984959174903309, "grad_norm": 1.171875, "learning_rate": 0.00048337193168751464, "loss": 6.1458, "mean_token_accuracy": 0.15528891682624818, "num_tokens": 4201323.0, "step": 2310 }, { "entropy": 6.252904844284058, "epoch": 1.9892565535023636, "grad_norm": 1.1796875, "learning_rate": 0.0004832462636962613, "loss": 6.1965, "mean_token_accuracy": 0.14820378869771958, "num_tokens": 4209805.0, "step": 2315 }, { "entropy": 6.274013090133667, "epoch": 1.9935539321014182, "grad_norm": 0.9921875, "learning_rate": 0.0004831201409784034, "loss": 6.1716, "mean_token_accuracy": 0.1535733938217163, "num_tokens": 4218562.0, "step": 2320 }, { "entropy": 6.276880836486816, "epoch": 1.9978513107004727, "grad_norm": 1.09375, "learning_rate": 0.0004829935638093424, "loss": 6.2489, "mean_token_accuracy": 0.14822545498609543, "num_tokens": 4227605.0, "step": 2325 }, { "entropy": 6.305307547251384, "epoch": 2.0017189514396216, "grad_norm": 1.15625, "learning_rate": 0.0004828665324654724, "loss": 6.0808, "mean_token_accuracy": 0.15109746985965306, "num_tokens": 4235441.0, "step": 2330 }, { "entropy": 6.1959953784942625, "epoch": 2.006016330038676, "grad_norm": 1.1953125, "learning_rate": 0.0004827390472241791, "loss": 5.8773, "mean_token_accuracy": 0.15755202025175094, "num_tokens": 4243982.0, "step": 2335 }, { "entropy": 6.151334667205811, "epoch": 2.010313708637731, "grad_norm": 1.140625, "learning_rate": 0.0004826111083638392, "loss": 5.9654, "mean_token_accuracy": 0.15486665964126586, "num_tokens": 4253032.0, "step": 2340 }, { "entropy": 6.237190914154053, "epoch": 2.0146110872367857, "grad_norm": 1.109375, "learning_rate": 0.00048248271616382, "loss": 5.8539, "mean_token_accuracy": 0.1612431138753891, "num_tokens": 4262000.0, "step": 2345 }, { "entropy": 6.14679217338562, "epoch": 2.0189084658358403, "grad_norm": 1.2109375, "learning_rate": 0.00048235387090447894, "loss": 5.8772, "mean_token_accuracy": 0.16036980897188186, "num_tokens": 4271089.0, "step": 2350 }, { "entropy": 6.216695976257324, "epoch": 2.023205844434895, "grad_norm": 1.2265625, "learning_rate": 0.00048222457286716235, "loss": 5.8748, "mean_token_accuracy": 0.1604112282395363, "num_tokens": 4280064.0, "step": 2355 }, { "entropy": 6.1386841297149655, "epoch": 2.0275032230339494, "grad_norm": 1.2109375, "learning_rate": 0.00048209482233420564, "loss": 5.8701, "mean_token_accuracy": 0.16113310903310776, "num_tokens": 4289096.0, "step": 2360 }, { "entropy": 6.134747457504273, "epoch": 2.031800601633004, "grad_norm": 1.140625, "learning_rate": 0.000481964619588932, "loss": 5.878, "mean_token_accuracy": 0.1504762887954712, "num_tokens": 4298341.0, "step": 2365 }, { "entropy": 6.1863165378570555, "epoch": 2.0360979802320585, "grad_norm": 1.1640625, "learning_rate": 0.0004818339649156523, "loss": 5.927, "mean_token_accuracy": 0.1504568099975586, "num_tokens": 4307466.0, "step": 2370 }, { "entropy": 6.122588872909546, "epoch": 2.040395358831113, "grad_norm": 1.1484375, "learning_rate": 0.00048170285859966395, "loss": 5.8523, "mean_token_accuracy": 0.15609132051467894, "num_tokens": 4316559.0, "step": 2375 }, { "entropy": 6.180559778213501, "epoch": 2.0446927374301676, "grad_norm": 1.203125, "learning_rate": 0.00048157130092725087, "loss": 5.8607, "mean_token_accuracy": 0.1605754405260086, "num_tokens": 4326002.0, "step": 2380 }, { "entropy": 6.1395592212677, "epoch": 2.048990116029222, "grad_norm": 1.2109375, "learning_rate": 0.0004814392921856824, "loss": 5.8467, "mean_token_accuracy": 0.16454231590032578, "num_tokens": 4333767.0, "step": 2385 }, { "entropy": 6.13576455116272, "epoch": 2.0532874946282766, "grad_norm": 1.3984375, "learning_rate": 0.0004813068326632128, "loss": 5.8941, "mean_token_accuracy": 0.16491636782884597, "num_tokens": 4342726.0, "step": 2390 }, { "entropy": 6.0936521053314205, "epoch": 2.057584873227331, "grad_norm": 1.1328125, "learning_rate": 0.0004811739226490809, "loss": 5.7842, "mean_token_accuracy": 0.16501135975122452, "num_tokens": 4351278.0, "step": 2395 }, { "entropy": 6.10044412612915, "epoch": 2.0618822518263857, "grad_norm": 1.2890625, "learning_rate": 0.00048104056243350896, "loss": 5.8079, "mean_token_accuracy": 0.16724471151828765, "num_tokens": 4360146.0, "step": 2400 }, { "entropy": 6.106970643997192, "epoch": 2.0661796304254403, "grad_norm": 1.1875, "learning_rate": 0.0004809067523077023, "loss": 5.8729, "mean_token_accuracy": 0.157526695728302, "num_tokens": 4368474.0, "step": 2405 }, { "entropy": 6.171187162399292, "epoch": 2.0704770090244953, "grad_norm": 1.375, "learning_rate": 0.00048077249256384884, "loss": 5.9415, "mean_token_accuracy": 0.1573039174079895, "num_tokens": 4378430.0, "step": 2410 }, { "entropy": 6.091280841827393, "epoch": 2.07477438762355, "grad_norm": 1.203125, "learning_rate": 0.0004806377834951182, "loss": 5.935, "mean_token_accuracy": 0.16114620715379716, "num_tokens": 4387661.0, "step": 2415 }, { "entropy": 6.2243939399719235, "epoch": 2.0790717662226044, "grad_norm": 1.1171875, "learning_rate": 0.00048050262539566104, "loss": 5.878, "mean_token_accuracy": 0.16368078142404557, "num_tokens": 4396568.0, "step": 2420 }, { "entropy": 6.03709397315979, "epoch": 2.083369144821659, "grad_norm": 1.296875, "learning_rate": 0.0004803670185606087, "loss": 5.8322, "mean_token_accuracy": 0.16086018234491348, "num_tokens": 4405113.0, "step": 2425 }, { "entropy": 6.130343770980835, "epoch": 2.0876665234207135, "grad_norm": 1.1171875, "learning_rate": 0.0004802309632860724, "loss": 5.9079, "mean_token_accuracy": 0.15909243375062943, "num_tokens": 4414930.0, "step": 2430 }, { "entropy": 6.135715103149414, "epoch": 2.091963902019768, "grad_norm": 1.140625, "learning_rate": 0.00048009445986914236, "loss": 5.9472, "mean_token_accuracy": 0.15476218312978746, "num_tokens": 4424200.0, "step": 2435 }, { "entropy": 6.087995195388794, "epoch": 2.0962612806188226, "grad_norm": 1.1484375, "learning_rate": 0.00047995750860788756, "loss": 5.8909, "mean_token_accuracy": 0.16245823204517365, "num_tokens": 4433533.0, "step": 2440 }, { "entropy": 6.122352218627929, "epoch": 2.100558659217877, "grad_norm": 1.171875, "learning_rate": 0.0004798201098013547, "loss": 5.9404, "mean_token_accuracy": 0.1550127923488617, "num_tokens": 4442752.0, "step": 2445 }, { "entropy": 6.078053426742554, "epoch": 2.1048560378169316, "grad_norm": 1.0625, "learning_rate": 0.00047968226374956797, "loss": 5.971, "mean_token_accuracy": 0.15189971923828124, "num_tokens": 4453624.0, "step": 2450 }, { "entropy": 6.135152006149292, "epoch": 2.109153416415986, "grad_norm": 1.1171875, "learning_rate": 0.00047954397075352794, "loss": 5.9528, "mean_token_accuracy": 0.15271927714347838, "num_tokens": 4462101.0, "step": 2455 }, { "entropy": 6.186189222335815, "epoch": 2.1134507950150407, "grad_norm": 1.1640625, "learning_rate": 0.00047940523111521136, "loss": 5.9668, "mean_token_accuracy": 0.15061386451125144, "num_tokens": 4471274.0, "step": 2460 }, { "entropy": 6.176623678207397, "epoch": 2.1177481736140953, "grad_norm": 1.1640625, "learning_rate": 0.0004792660451375701, "loss": 5.9378, "mean_token_accuracy": 0.15836917012929916, "num_tokens": 4480281.0, "step": 2465 }, { "entropy": 6.131458759307861, "epoch": 2.12204555221315, "grad_norm": 1.1171875, "learning_rate": 0.00047912641312453064, "loss": 5.8644, "mean_token_accuracy": 0.15682227164506912, "num_tokens": 4489325.0, "step": 2470 }, { "entropy": 6.136132478713989, "epoch": 2.1263429308122044, "grad_norm": 1.296875, "learning_rate": 0.00047898633538099363, "loss": 5.8624, "mean_token_accuracy": 0.16200080662965774, "num_tokens": 4497977.0, "step": 2475 }, { "entropy": 6.082278108596801, "epoch": 2.130640309411259, "grad_norm": 1.0703125, "learning_rate": 0.0004788458122128327, "loss": 5.9842, "mean_token_accuracy": 0.15614993274211883, "num_tokens": 4509133.0, "step": 2480 }, { "entropy": 6.15927677154541, "epoch": 2.134937688010314, "grad_norm": 1.265625, "learning_rate": 0.00047870484392689434, "loss": 5.9287, "mean_token_accuracy": 0.16319320052862168, "num_tokens": 4518431.0, "step": 2485 }, { "entropy": 6.090216445922851, "epoch": 2.1392350666093685, "grad_norm": 1.1171875, "learning_rate": 0.000478563430830997, "loss": 5.9317, "mean_token_accuracy": 0.15791197270154952, "num_tokens": 4528489.0, "step": 2490 }, { "entropy": 6.161773586273194, "epoch": 2.143532445208423, "grad_norm": 1.1640625, "learning_rate": 0.00047842157323393035, "loss": 5.821, "mean_token_accuracy": 0.1565369412302971, "num_tokens": 4537068.0, "step": 2495 }, { "entropy": 6.096503257751465, "epoch": 2.1478298238074776, "grad_norm": 1.21875, "learning_rate": 0.0004782792714454547, "loss": 5.9322, "mean_token_accuracy": 0.16345749497413636, "num_tokens": 4545773.0, "step": 2500 }, { "epoch": 2.1478298238074776, "eval_entropy": 5.961080405089232, "eval_loss": 6.284891128540039, "eval_mean_token_accuracy": 0.152339708798372, "eval_num_tokens": 4545773.0, "eval_runtime": 2.6434, "eval_samples_per_second": 1342.578, "eval_steps_per_second": 167.964, "step": 2500 } ], "logging_steps": 5, "max_steps": 11630, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 6872272353792000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }