{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.05904233335301411, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742573165893555, "epoch": 0.00029521166676507054, "grad_norm": 4.96875, "learning_rate": 2e-06, "loss": 10.7764, "mean_token_accuracy": 0.00011173184029757976, "num_tokens": 10275.0, "step": 5 }, { "entropy": 10.74255199432373, "epoch": 0.0005904233335301411, "grad_norm": 5.4375, "learning_rate": 4.5e-06, "loss": 10.7784, "mean_token_accuracy": 0.00011086474405601621, "num_tokens": 22020.0, "step": 10 }, { "entropy": 10.742577171325683, "epoch": 0.0008856350002952116, "grad_norm": 5.09375, "learning_rate": 7e-06, "loss": 10.7479, "mean_token_accuracy": 0.0, "num_tokens": 32612.0, "step": 15 }, { "entropy": 10.742585563659668, "epoch": 0.0011808466670602822, "grad_norm": 5.125, "learning_rate": 9.5e-06, "loss": 10.692, "mean_token_accuracy": 0.0002895977755542845, "num_tokens": 43270.0, "step": 20 }, { "entropy": 10.74253044128418, "epoch": 0.0014760583338253527, "grad_norm": 4.34375, "learning_rate": 1.2e-05, "loss": 10.5945, "mean_token_accuracy": 0.0037050600280053914, "num_tokens": 54178.0, "step": 25 }, { "entropy": 10.742242050170898, "epoch": 0.0017712700005904232, "grad_norm": 4.15625, "learning_rate": 1.4500000000000002e-05, "loss": 10.4602, "mean_token_accuracy": 0.02422279641032219, "num_tokens": 64390.0, "step": 30 }, { "entropy": 10.741262912750244, "epoch": 0.002066481667355494, "grad_norm": 3.3125, "learning_rate": 1.7000000000000003e-05, "loss": 10.2806, "mean_token_accuracy": 0.041601650416851044, "num_tokens": 73703.0, "step": 35 }, { "entropy": 10.738601016998292, "epoch": 0.0023616933341205643, "grad_norm": 2.625, "learning_rate": 1.95e-05, "loss": 10.1485, "mean_token_accuracy": 0.04163007400929928, "num_tokens": 83463.0, "step": 40 }, { "entropy": 10.734784793853759, "epoch": 0.002656905000885635, "grad_norm": 2.265625, "learning_rate": 2.2e-05, "loss": 10.0675, "mean_token_accuracy": 0.04389659091830254, "num_tokens": 94129.0, "step": 45 }, { "entropy": 10.73138256072998, "epoch": 0.0029521166676507054, "grad_norm": 2.109375, "learning_rate": 2.4500000000000003e-05, "loss": 9.9969, "mean_token_accuracy": 0.043133416399359706, "num_tokens": 105482.0, "step": 50 }, { "entropy": 10.729689979553223, "epoch": 0.003247328334415776, "grad_norm": 2.0625, "learning_rate": 2.7e-05, "loss": 9.9129, "mean_token_accuracy": 0.04309733100235462, "num_tokens": 117342.0, "step": 55 }, { "entropy": 10.728583812713623, "epoch": 0.0035425400011808465, "grad_norm": 1.859375, "learning_rate": 2.95e-05, "loss": 9.8878, "mean_token_accuracy": 0.04118645377457142, "num_tokens": 127691.0, "step": 60 }, { "entropy": 10.727480697631837, "epoch": 0.0038377516679459172, "grad_norm": 1.90625, "learning_rate": 3.2e-05, "loss": 9.7761, "mean_token_accuracy": 0.04004005677998066, "num_tokens": 138186.0, "step": 65 }, { "entropy": 10.725414276123047, "epoch": 0.004132963334710988, "grad_norm": 1.9375, "learning_rate": 3.4500000000000005e-05, "loss": 9.7581, "mean_token_accuracy": 0.0433019045740366, "num_tokens": 149578.0, "step": 70 }, { "entropy": 10.720968532562257, "epoch": 0.004428175001476058, "grad_norm": 1.9140625, "learning_rate": 3.7e-05, "loss": 9.6737, "mean_token_accuracy": 0.04341540932655334, "num_tokens": 160139.0, "step": 75 }, { "entropy": 10.71543197631836, "epoch": 0.004723386668241129, "grad_norm": 1.90625, "learning_rate": 3.95e-05, "loss": 9.6176, "mean_token_accuracy": 0.042911310121417044, "num_tokens": 170768.0, "step": 80 }, { "entropy": 10.708538818359376, "epoch": 0.0050185983350062, "grad_norm": 1.984375, "learning_rate": 4.2000000000000004e-05, "loss": 9.5004, "mean_token_accuracy": 0.04607887454330921, "num_tokens": 180702.0, "step": 85 }, { "entropy": 10.699075031280518, "epoch": 0.00531381000177127, "grad_norm": 1.9921875, "learning_rate": 4.45e-05, "loss": 9.4474, "mean_token_accuracy": 0.04201225638389587, "num_tokens": 191188.0, "step": 90 }, { "entropy": 10.691750621795654, "epoch": 0.0056090216685363405, "grad_norm": 1.90625, "learning_rate": 4.7000000000000004e-05, "loss": 9.381, "mean_token_accuracy": 0.03792413603514433, "num_tokens": 201094.0, "step": 95 }, { "entropy": 10.6837984085083, "epoch": 0.005904233335301411, "grad_norm": 1.8984375, "learning_rate": 4.9500000000000004e-05, "loss": 9.2614, "mean_token_accuracy": 0.04629642106592655, "num_tokens": 211718.0, "step": 100 }, { "entropy": 10.667647075653075, "epoch": 0.006199445002066482, "grad_norm": 1.8828125, "learning_rate": 5.2e-05, "loss": 9.1409, "mean_token_accuracy": 0.05333527401089668, "num_tokens": 221446.0, "step": 105 }, { "entropy": 10.640782737731934, "epoch": 0.006494656668831552, "grad_norm": 1.7578125, "learning_rate": 5.45e-05, "loss": 9.1093, "mean_token_accuracy": 0.05261831916868687, "num_tokens": 232848.0, "step": 110 }, { "entropy": 10.602476406097413, "epoch": 0.006789868335596623, "grad_norm": 1.75, "learning_rate": 5.7e-05, "loss": 9.0166, "mean_token_accuracy": 0.05226000994443893, "num_tokens": 244008.0, "step": 115 }, { "entropy": 10.5585186958313, "epoch": 0.007085080002361693, "grad_norm": 1.7265625, "learning_rate": 5.9499999999999996e-05, "loss": 8.8449, "mean_token_accuracy": 0.05914722830057144, "num_tokens": 256211.0, "step": 120 }, { "entropy": 10.501475620269776, "epoch": 0.007380291669126764, "grad_norm": 1.671875, "learning_rate": 6.2e-05, "loss": 8.7664, "mean_token_accuracy": 0.05910652950406074, "num_tokens": 266688.0, "step": 125 }, { "entropy": 10.426000499725342, "epoch": 0.0076755033358918345, "grad_norm": 1.5625, "learning_rate": 6.450000000000001e-05, "loss": 8.57, "mean_token_accuracy": 0.0610476765781641, "num_tokens": 276930.0, "step": 130 }, { "entropy": 10.339440727233887, "epoch": 0.007970715002656906, "grad_norm": 1.625, "learning_rate": 6.7e-05, "loss": 8.4277, "mean_token_accuracy": 0.07068866156041623, "num_tokens": 287508.0, "step": 135 }, { "entropy": 10.240792846679687, "epoch": 0.008265926669421976, "grad_norm": 1.546875, "learning_rate": 6.950000000000001e-05, "loss": 8.2713, "mean_token_accuracy": 0.07111315764486789, "num_tokens": 298021.0, "step": 140 }, { "entropy": 10.135569763183593, "epoch": 0.008561138336187046, "grad_norm": 1.3828125, "learning_rate": 7.2e-05, "loss": 8.1726, "mean_token_accuracy": 0.07181189507246018, "num_tokens": 308301.0, "step": 145 }, { "entropy": 9.984276580810548, "epoch": 0.008856350002952117, "grad_norm": 1.375, "learning_rate": 7.45e-05, "loss": 8.0427, "mean_token_accuracy": 0.06862774454057216, "num_tokens": 319321.0, "step": 150 }, { "entropy": 9.829378795623779, "epoch": 0.009151561669717187, "grad_norm": 1.25, "learning_rate": 7.7e-05, "loss": 8.0055, "mean_token_accuracy": 0.07413771599531174, "num_tokens": 330926.0, "step": 155 }, { "entropy": 9.623138332366944, "epoch": 0.009446773336482257, "grad_norm": 1.125, "learning_rate": 7.950000000000001e-05, "loss": 7.7929, "mean_token_accuracy": 0.07890797778964043, "num_tokens": 341133.0, "step": 160 }, { "entropy": 9.416749095916748, "epoch": 0.009741985003247328, "grad_norm": 1.28125, "learning_rate": 8.2e-05, "loss": 7.7407, "mean_token_accuracy": 0.07391801774501801, "num_tokens": 351897.0, "step": 165 }, { "entropy": 9.196506309509278, "epoch": 0.0100371966700124, "grad_norm": 0.96875, "learning_rate": 8.450000000000001e-05, "loss": 7.6663, "mean_token_accuracy": 0.07125836983323097, "num_tokens": 362644.0, "step": 170 }, { "entropy": 8.932462692260742, "epoch": 0.01033240833677747, "grad_norm": 0.9296875, "learning_rate": 8.7e-05, "loss": 7.628, "mean_token_accuracy": 0.07178853973746299, "num_tokens": 373902.0, "step": 175 }, { "entropy": 8.703715133666993, "epoch": 0.01062762000354254, "grad_norm": 0.87890625, "learning_rate": 8.95e-05, "loss": 7.4958, "mean_token_accuracy": 0.08398130461573601, "num_tokens": 384828.0, "step": 180 }, { "entropy": 8.474815559387206, "epoch": 0.01092283167030761, "grad_norm": 0.8359375, "learning_rate": 9.2e-05, "loss": 7.4684, "mean_token_accuracy": 0.07413811013102531, "num_tokens": 395103.0, "step": 185 }, { "entropy": 8.360427570343017, "epoch": 0.011218043337072681, "grad_norm": 0.8515625, "learning_rate": 9.45e-05, "loss": 7.374, "mean_token_accuracy": 0.08157729879021644, "num_tokens": 405283.0, "step": 190 }, { "entropy": 8.21293478012085, "epoch": 0.011513255003837751, "grad_norm": 0.96484375, "learning_rate": 9.7e-05, "loss": 7.3468, "mean_token_accuracy": 0.0755577202886343, "num_tokens": 416005.0, "step": 195 }, { "entropy": 8.12078037261963, "epoch": 0.011808466670602822, "grad_norm": 0.828125, "learning_rate": 9.95e-05, "loss": 7.3518, "mean_token_accuracy": 0.08057705461978912, "num_tokens": 426547.0, "step": 200 }, { "entropy": 8.019514322280884, "epoch": 0.012103678337367892, "grad_norm": 1.1328125, "learning_rate": 0.000102, "loss": 7.2823, "mean_token_accuracy": 0.08034192845225334, "num_tokens": 436262.0, "step": 205 }, { "entropy": 7.997368812561035, "epoch": 0.012398890004132964, "grad_norm": 1.0390625, "learning_rate": 0.00010449999999999999, "loss": 7.3018, "mean_token_accuracy": 0.07936789095401764, "num_tokens": 446899.0, "step": 210 }, { "entropy": 7.968120145797729, "epoch": 0.012694101670898034, "grad_norm": 0.9140625, "learning_rate": 0.000107, "loss": 7.3322, "mean_token_accuracy": 0.07839082404971123, "num_tokens": 458224.0, "step": 215 }, { "entropy": 8.01854157447815, "epoch": 0.012989313337663105, "grad_norm": 0.92578125, "learning_rate": 0.0001095, "loss": 7.2688, "mean_token_accuracy": 0.0764270156621933, "num_tokens": 469306.0, "step": 220 }, { "entropy": 7.9349792957305905, "epoch": 0.013284525004428175, "grad_norm": 1.1796875, "learning_rate": 0.000112, "loss": 7.2614, "mean_token_accuracy": 0.08024230971932411, "num_tokens": 478685.0, "step": 225 }, { "entropy": 7.891508388519287, "epoch": 0.013579736671193245, "grad_norm": 0.9140625, "learning_rate": 0.0001145, "loss": 7.1822, "mean_token_accuracy": 0.0861165277659893, "num_tokens": 489376.0, "step": 230 }, { "entropy": 7.872423553466797, "epoch": 0.013874948337958316, "grad_norm": 0.9453125, "learning_rate": 0.00011700000000000001, "loss": 7.1724, "mean_token_accuracy": 0.08608285039663315, "num_tokens": 500260.0, "step": 235 }, { "entropy": 7.763920402526855, "epoch": 0.014170160004723386, "grad_norm": 0.953125, "learning_rate": 0.00011949999999999999, "loss": 7.1567, "mean_token_accuracy": 0.08700917065143585, "num_tokens": 511953.0, "step": 240 }, { "entropy": 7.8764701843261715, "epoch": 0.014465371671488458, "grad_norm": 0.91796875, "learning_rate": 0.000122, "loss": 7.3427, "mean_token_accuracy": 0.07973492071032524, "num_tokens": 523055.0, "step": 245 }, { "entropy": 7.788686466217041, "epoch": 0.014760583338253528, "grad_norm": 0.9453125, "learning_rate": 0.0001245, "loss": 7.1424, "mean_token_accuracy": 0.0809820182621479, "num_tokens": 534337.0, "step": 250 }, { "entropy": 7.773524141311645, "epoch": 0.015055795005018599, "grad_norm": 0.96875, "learning_rate": 0.000127, "loss": 7.1488, "mean_token_accuracy": 0.08801065608859063, "num_tokens": 545189.0, "step": 255 }, { "entropy": 7.762392187118531, "epoch": 0.015351006671783669, "grad_norm": 0.859375, "learning_rate": 0.0001295, "loss": 7.1789, "mean_token_accuracy": 0.08976453244686126, "num_tokens": 555506.0, "step": 260 }, { "entropy": 7.752877712249756, "epoch": 0.01564621833854874, "grad_norm": 0.84765625, "learning_rate": 0.000132, "loss": 7.0892, "mean_token_accuracy": 0.08789646476507187, "num_tokens": 565936.0, "step": 265 }, { "entropy": 7.730583906173706, "epoch": 0.01594143000531381, "grad_norm": 1.1015625, "learning_rate": 0.00013450000000000002, "loss": 7.1826, "mean_token_accuracy": 0.08930487185716629, "num_tokens": 575691.0, "step": 270 }, { "entropy": 7.710203313827515, "epoch": 0.01623664167207888, "grad_norm": 0.9765625, "learning_rate": 0.00013700000000000002, "loss": 7.1496, "mean_token_accuracy": 0.08626075237989425, "num_tokens": 586170.0, "step": 275 }, { "entropy": 7.728785562515259, "epoch": 0.016531853338843952, "grad_norm": 1.2265625, "learning_rate": 0.0001395, "loss": 7.1356, "mean_token_accuracy": 0.08597519621253014, "num_tokens": 596458.0, "step": 280 }, { "entropy": 7.711720895767212, "epoch": 0.016827065005609022, "grad_norm": 0.94921875, "learning_rate": 0.00014199999999999998, "loss": 7.0549, "mean_token_accuracy": 0.08382375612854957, "num_tokens": 606214.0, "step": 285 }, { "entropy": 7.6635658740997314, "epoch": 0.017122276672374093, "grad_norm": 1.2421875, "learning_rate": 0.0001445, "loss": 7.1085, "mean_token_accuracy": 0.08702588006854058, "num_tokens": 617074.0, "step": 290 }, { "entropy": 7.613530492782592, "epoch": 0.017417488339139163, "grad_norm": 1.03125, "learning_rate": 0.000147, "loss": 7.1582, "mean_token_accuracy": 0.0854655608534813, "num_tokens": 628057.0, "step": 295 }, { "entropy": 7.640975618362427, "epoch": 0.017712700005904233, "grad_norm": 0.95703125, "learning_rate": 0.0001495, "loss": 7.0762, "mean_token_accuracy": 0.0919909045100212, "num_tokens": 638150.0, "step": 300 }, { "entropy": 7.644310426712036, "epoch": 0.018007911672669304, "grad_norm": 1.03125, "learning_rate": 0.000152, "loss": 6.9574, "mean_token_accuracy": 0.09665790945291519, "num_tokens": 648377.0, "step": 305 }, { "entropy": 7.570417594909668, "epoch": 0.018303123339434374, "grad_norm": 0.89453125, "learning_rate": 0.00015450000000000001, "loss": 7.0219, "mean_token_accuracy": 0.09368904307484627, "num_tokens": 658777.0, "step": 310 }, { "entropy": 7.5545618534088135, "epoch": 0.018598335006199444, "grad_norm": 1.078125, "learning_rate": 0.000157, "loss": 7.1283, "mean_token_accuracy": 0.08728318810462951, "num_tokens": 669105.0, "step": 315 }, { "entropy": 7.581419992446899, "epoch": 0.018893546672964515, "grad_norm": 0.8671875, "learning_rate": 0.0001595, "loss": 6.9931, "mean_token_accuracy": 0.08857197985053063, "num_tokens": 679294.0, "step": 320 }, { "entropy": 7.5300342559814455, "epoch": 0.019188758339729585, "grad_norm": 0.8125, "learning_rate": 0.000162, "loss": 6.9576, "mean_token_accuracy": 0.09436112716794014, "num_tokens": 690495.0, "step": 325 }, { "entropy": 7.517716407775879, "epoch": 0.019483970006494655, "grad_norm": 0.86328125, "learning_rate": 0.00016450000000000001, "loss": 6.979, "mean_token_accuracy": 0.09718031734228134, "num_tokens": 701002.0, "step": 330 }, { "entropy": 7.48517951965332, "epoch": 0.019779181673259726, "grad_norm": 0.97265625, "learning_rate": 0.00016700000000000002, "loss": 6.8828, "mean_token_accuracy": 0.09275271818041801, "num_tokens": 711488.0, "step": 335 }, { "entropy": 7.405734252929688, "epoch": 0.0200743933400248, "grad_norm": 0.984375, "learning_rate": 0.00016950000000000003, "loss": 6.9022, "mean_token_accuracy": 0.09012737646698951, "num_tokens": 722637.0, "step": 340 }, { "entropy": 7.489488410949707, "epoch": 0.02036960500678987, "grad_norm": 0.88671875, "learning_rate": 0.00017199999999999998, "loss": 6.9705, "mean_token_accuracy": 0.09417287185788155, "num_tokens": 733212.0, "step": 345 }, { "entropy": 7.45473804473877, "epoch": 0.02066481667355494, "grad_norm": 1.390625, "learning_rate": 0.00017449999999999999, "loss": 6.9008, "mean_token_accuracy": 0.09309542924165726, "num_tokens": 743602.0, "step": 350 }, { "entropy": 7.441885089874267, "epoch": 0.02096002834032001, "grad_norm": 1.15625, "learning_rate": 0.000177, "loss": 6.9506, "mean_token_accuracy": 0.09587474688887596, "num_tokens": 754094.0, "step": 355 }, { "entropy": 7.430218076705932, "epoch": 0.02125524000708508, "grad_norm": 1.0390625, "learning_rate": 0.0001795, "loss": 6.8964, "mean_token_accuracy": 0.09253331273794174, "num_tokens": 763823.0, "step": 360 }, { "entropy": 7.417900943756104, "epoch": 0.02155045167385015, "grad_norm": 1.2109375, "learning_rate": 0.000182, "loss": 6.8424, "mean_token_accuracy": 0.09944578483700753, "num_tokens": 774128.0, "step": 365 }, { "entropy": 7.384387731552124, "epoch": 0.02184566334061522, "grad_norm": 1.1484375, "learning_rate": 0.0001845, "loss": 6.913, "mean_token_accuracy": 0.09629636481404305, "num_tokens": 784292.0, "step": 370 }, { "entropy": 7.428071117401123, "epoch": 0.02214087500738029, "grad_norm": 0.921875, "learning_rate": 0.000187, "loss": 6.896, "mean_token_accuracy": 0.09847814217209816, "num_tokens": 795437.0, "step": 375 }, { "entropy": 7.368625783920288, "epoch": 0.022436086674145362, "grad_norm": 1.0078125, "learning_rate": 0.0001895, "loss": 6.8038, "mean_token_accuracy": 0.09553659558296204, "num_tokens": 806543.0, "step": 380 }, { "entropy": 7.34774341583252, "epoch": 0.022731298340910432, "grad_norm": 1.1484375, "learning_rate": 0.000192, "loss": 6.9575, "mean_token_accuracy": 0.09456263706088067, "num_tokens": 817179.0, "step": 385 }, { "entropy": 7.4415544986724855, "epoch": 0.023026510007675503, "grad_norm": 0.94921875, "learning_rate": 0.0001945, "loss": 6.8667, "mean_token_accuracy": 0.09976130351424217, "num_tokens": 826749.0, "step": 390 }, { "entropy": 7.363486337661743, "epoch": 0.023321721674440573, "grad_norm": 1.109375, "learning_rate": 0.00019700000000000002, "loss": 6.8927, "mean_token_accuracy": 0.0938490979373455, "num_tokens": 838807.0, "step": 395 }, { "entropy": 7.37176923751831, "epoch": 0.023616933341205643, "grad_norm": 0.99609375, "learning_rate": 0.00019950000000000002, "loss": 6.8827, "mean_token_accuracy": 0.09748194366693497, "num_tokens": 849651.0, "step": 400 }, { "entropy": 7.367251443862915, "epoch": 0.023912145007970714, "grad_norm": 1.0234375, "learning_rate": 0.000202, "loss": 6.934, "mean_token_accuracy": 0.09160904809832573, "num_tokens": 859753.0, "step": 405 }, { "entropy": 7.345250177383423, "epoch": 0.024207356674735784, "grad_norm": 0.90625, "learning_rate": 0.00020449999999999998, "loss": 6.8134, "mean_token_accuracy": 0.10118522644042968, "num_tokens": 869904.0, "step": 410 }, { "entropy": 7.267154836654663, "epoch": 0.024502568341500858, "grad_norm": 0.88671875, "learning_rate": 0.000207, "loss": 6.8152, "mean_token_accuracy": 0.09964827746152878, "num_tokens": 880948.0, "step": 415 }, { "entropy": 7.350914382934571, "epoch": 0.024797780008265928, "grad_norm": 0.94921875, "learning_rate": 0.0002095, "loss": 6.8961, "mean_token_accuracy": 0.09352625384926797, "num_tokens": 892331.0, "step": 420 }, { "entropy": 7.300309419631958, "epoch": 0.025092991675031, "grad_norm": 1.09375, "learning_rate": 0.000212, "loss": 6.731, "mean_token_accuracy": 0.10073179304599762, "num_tokens": 901691.0, "step": 425 }, { "entropy": 7.247861719131469, "epoch": 0.02538820334179607, "grad_norm": 1.0390625, "learning_rate": 0.0002145, "loss": 6.7662, "mean_token_accuracy": 0.0965045303106308, "num_tokens": 912495.0, "step": 430 }, { "entropy": 7.235934734344482, "epoch": 0.02568341500856114, "grad_norm": 1.0234375, "learning_rate": 0.00021700000000000002, "loss": 6.7406, "mean_token_accuracy": 0.10061677768826485, "num_tokens": 923420.0, "step": 435 }, { "entropy": 7.153478145599365, "epoch": 0.02597862667532621, "grad_norm": 0.94140625, "learning_rate": 0.0002195, "loss": 6.7327, "mean_token_accuracy": 0.10134619474411011, "num_tokens": 933598.0, "step": 440 }, { "entropy": 7.279621028900147, "epoch": 0.02627383834209128, "grad_norm": 1.1953125, "learning_rate": 0.000222, "loss": 6.8611, "mean_token_accuracy": 0.09994317889213562, "num_tokens": 943229.0, "step": 445 }, { "entropy": 7.256894063949585, "epoch": 0.02656905000885635, "grad_norm": 1.0390625, "learning_rate": 0.0002245, "loss": 6.7288, "mean_token_accuracy": 0.09972334206104279, "num_tokens": 954425.0, "step": 450 }, { "entropy": 7.333712911605835, "epoch": 0.02686426167562142, "grad_norm": 1.1328125, "learning_rate": 0.00022700000000000002, "loss": 6.8322, "mean_token_accuracy": 0.10051686838269233, "num_tokens": 965516.0, "step": 455 }, { "entropy": 7.109683799743652, "epoch": 0.02715947334238649, "grad_norm": 0.90234375, "learning_rate": 0.00022950000000000002, "loss": 6.7124, "mean_token_accuracy": 0.10072791278362274, "num_tokens": 976469.0, "step": 460 }, { "entropy": 7.249271726608276, "epoch": 0.02745468500915156, "grad_norm": 1.046875, "learning_rate": 0.00023200000000000003, "loss": 6.8029, "mean_token_accuracy": 0.09443021714687347, "num_tokens": 986946.0, "step": 465 }, { "entropy": 7.233931303024292, "epoch": 0.02774989667591663, "grad_norm": 1.015625, "learning_rate": 0.00023449999999999998, "loss": 6.6988, "mean_token_accuracy": 0.10011776387691498, "num_tokens": 997101.0, "step": 470 }, { "entropy": 7.123860883712768, "epoch": 0.0280451083426817, "grad_norm": 1.0703125, "learning_rate": 0.000237, "loss": 6.8063, "mean_token_accuracy": 0.09995891153812408, "num_tokens": 1007866.0, "step": 475 }, { "entropy": 7.302121591567993, "epoch": 0.028340320009446772, "grad_norm": 1.15625, "learning_rate": 0.0002395, "loss": 6.8209, "mean_token_accuracy": 0.09563429430127143, "num_tokens": 1019377.0, "step": 480 }, { "entropy": 7.214538860321045, "epoch": 0.028635531676211842, "grad_norm": 0.97265625, "learning_rate": 0.000242, "loss": 6.7985, "mean_token_accuracy": 0.10173870101571084, "num_tokens": 1031278.0, "step": 485 }, { "entropy": 7.053379869461059, "epoch": 0.028930743342976916, "grad_norm": 0.94140625, "learning_rate": 0.0002445, "loss": 6.609, "mean_token_accuracy": 0.10857169032096863, "num_tokens": 1041663.0, "step": 490 }, { "entropy": 7.141558599472046, "epoch": 0.029225955009741986, "grad_norm": 1.0078125, "learning_rate": 0.000247, "loss": 6.68, "mean_token_accuracy": 0.10325370877981185, "num_tokens": 1052286.0, "step": 495 }, { "entropy": 7.082495021820068, "epoch": 0.029521166676507057, "grad_norm": 1.1953125, "learning_rate": 0.0002495, "loss": 6.7424, "mean_token_accuracy": 0.10430480614304542, "num_tokens": 1061945.0, "step": 500 }, { "entropy": 7.1918810367584225, "epoch": 0.029816378343272127, "grad_norm": 1.0625, "learning_rate": 0.000252, "loss": 6.7286, "mean_token_accuracy": 0.09890020415186881, "num_tokens": 1074057.0, "step": 505 }, { "entropy": 7.1423930644989015, "epoch": 0.030111590010037197, "grad_norm": 0.984375, "learning_rate": 0.0002545, "loss": 6.7168, "mean_token_accuracy": 0.10386160910129547, "num_tokens": 1084830.0, "step": 510 }, { "entropy": 7.120156860351562, "epoch": 0.030406801676802268, "grad_norm": 1.0390625, "learning_rate": 0.000257, "loss": 6.6608, "mean_token_accuracy": 0.10988141670823097, "num_tokens": 1095540.0, "step": 515 }, { "entropy": 7.1051233291625975, "epoch": 0.030702013343567338, "grad_norm": 0.95703125, "learning_rate": 0.0002595, "loss": 6.6721, "mean_token_accuracy": 0.10224077701568604, "num_tokens": 1105395.0, "step": 520 }, { "entropy": 7.0473850727081295, "epoch": 0.03099722501033241, "grad_norm": 0.93359375, "learning_rate": 0.000262, "loss": 6.6362, "mean_token_accuracy": 0.101447893679142, "num_tokens": 1117007.0, "step": 525 }, { "entropy": 7.1096114158630375, "epoch": 0.03129243667709748, "grad_norm": 0.9921875, "learning_rate": 0.00026450000000000003, "loss": 6.6533, "mean_token_accuracy": 0.10817406699061394, "num_tokens": 1128531.0, "step": 530 }, { "entropy": 7.0557671070098875, "epoch": 0.03158764834386255, "grad_norm": 1.0234375, "learning_rate": 0.00026700000000000004, "loss": 6.6677, "mean_token_accuracy": 0.10507503002882004, "num_tokens": 1139194.0, "step": 535 }, { "entropy": 7.096202421188354, "epoch": 0.03188286001062762, "grad_norm": 1.0078125, "learning_rate": 0.00026950000000000005, "loss": 6.7203, "mean_token_accuracy": 0.09265467226505279, "num_tokens": 1150371.0, "step": 540 }, { "entropy": 7.058306312561035, "epoch": 0.03217807167739269, "grad_norm": 0.9609375, "learning_rate": 0.00027200000000000005, "loss": 6.6125, "mean_token_accuracy": 0.10768099054694176, "num_tokens": 1160840.0, "step": 545 }, { "entropy": 7.038476371765137, "epoch": 0.03247328334415776, "grad_norm": 0.97265625, "learning_rate": 0.0002745, "loss": 6.6663, "mean_token_accuracy": 0.10139054954051971, "num_tokens": 1171438.0, "step": 550 }, { "entropy": 7.088100433349609, "epoch": 0.032768495010922834, "grad_norm": 1.1953125, "learning_rate": 0.000277, "loss": 6.6141, "mean_token_accuracy": 0.10576796308159828, "num_tokens": 1180889.0, "step": 555 }, { "entropy": 6.985959911346436, "epoch": 0.033063706677687904, "grad_norm": 1.03125, "learning_rate": 0.0002795, "loss": 6.6253, "mean_token_accuracy": 0.1048286035656929, "num_tokens": 1190755.0, "step": 560 }, { "entropy": 7.112613868713379, "epoch": 0.033358918344452974, "grad_norm": 1.1328125, "learning_rate": 0.00028199999999999997, "loss": 6.696, "mean_token_accuracy": 0.10307028964161873, "num_tokens": 1202002.0, "step": 565 }, { "entropy": 7.091805744171142, "epoch": 0.033654130011218045, "grad_norm": 0.890625, "learning_rate": 0.0002845, "loss": 6.7127, "mean_token_accuracy": 0.09907137230038643, "num_tokens": 1213611.0, "step": 570 }, { "entropy": 7.045700263977051, "epoch": 0.033949341677983115, "grad_norm": 0.99609375, "learning_rate": 0.000287, "loss": 6.7282, "mean_token_accuracy": 0.10283370316028595, "num_tokens": 1224450.0, "step": 575 }, { "entropy": 7.071837377548218, "epoch": 0.034244553344748185, "grad_norm": 1.0546875, "learning_rate": 0.0002895, "loss": 6.6784, "mean_token_accuracy": 0.10268105193972588, "num_tokens": 1235229.0, "step": 580 }, { "entropy": 7.046443367004395, "epoch": 0.034539765011513256, "grad_norm": 0.98046875, "learning_rate": 0.000292, "loss": 6.6526, "mean_token_accuracy": 0.10178791806101799, "num_tokens": 1245015.0, "step": 585 }, { "entropy": 6.939273357391357, "epoch": 0.034834976678278326, "grad_norm": 1.046875, "learning_rate": 0.0002945, "loss": 6.5344, "mean_token_accuracy": 0.11150246858596802, "num_tokens": 1256307.0, "step": 590 }, { "entropy": 6.975376844406128, "epoch": 0.035130188345043396, "grad_norm": 1.015625, "learning_rate": 0.000297, "loss": 6.6105, "mean_token_accuracy": 0.10918646082282066, "num_tokens": 1267042.0, "step": 595 }, { "entropy": 7.035576105117798, "epoch": 0.03542540001180847, "grad_norm": 1.078125, "learning_rate": 0.0002995, "loss": 6.5985, "mean_token_accuracy": 0.10955018848180771, "num_tokens": 1277571.0, "step": 600 }, { "entropy": 6.996139717102051, "epoch": 0.03572061167857354, "grad_norm": 1.09375, "learning_rate": 0.000302, "loss": 6.665, "mean_token_accuracy": 0.10872082561254501, "num_tokens": 1288203.0, "step": 605 }, { "entropy": 6.967156648635864, "epoch": 0.03601582334533861, "grad_norm": 1.1015625, "learning_rate": 0.0003045, "loss": 6.6366, "mean_token_accuracy": 0.10694377049803734, "num_tokens": 1299510.0, "step": 610 }, { "entropy": 6.97563099861145, "epoch": 0.03631103501210368, "grad_norm": 1.25, "learning_rate": 0.000307, "loss": 6.5127, "mean_token_accuracy": 0.11007486656308174, "num_tokens": 1309573.0, "step": 615 }, { "entropy": 6.906992053985595, "epoch": 0.03660624667886875, "grad_norm": 0.984375, "learning_rate": 0.0003095, "loss": 6.5878, "mean_token_accuracy": 0.10692002549767494, "num_tokens": 1321104.0, "step": 620 }, { "entropy": 6.917443513870239, "epoch": 0.03690145834563382, "grad_norm": 1.0, "learning_rate": 0.000312, "loss": 6.5916, "mean_token_accuracy": 0.10439730063080788, "num_tokens": 1332671.0, "step": 625 }, { "entropy": 6.861900806427002, "epoch": 0.03719667001239889, "grad_norm": 1.0546875, "learning_rate": 0.0003145, "loss": 6.4747, "mean_token_accuracy": 0.11168068125844002, "num_tokens": 1344416.0, "step": 630 }, { "entropy": 7.0240528106689455, "epoch": 0.03749188167916396, "grad_norm": 1.125, "learning_rate": 0.000317, "loss": 6.606, "mean_token_accuracy": 0.10131711885333061, "num_tokens": 1355740.0, "step": 635 }, { "entropy": 6.917941236495972, "epoch": 0.03778709334592903, "grad_norm": 0.984375, "learning_rate": 0.0003195, "loss": 6.5638, "mean_token_accuracy": 0.1071008414030075, "num_tokens": 1366465.0, "step": 640 }, { "entropy": 6.809306955337524, "epoch": 0.0380823050126941, "grad_norm": 0.96484375, "learning_rate": 0.000322, "loss": 6.4827, "mean_token_accuracy": 0.10806326791644097, "num_tokens": 1376476.0, "step": 645 }, { "entropy": 7.007070827484131, "epoch": 0.03837751667945917, "grad_norm": 1.2421875, "learning_rate": 0.00032450000000000003, "loss": 6.4837, "mean_token_accuracy": 0.1201641671359539, "num_tokens": 1386172.0, "step": 650 }, { "entropy": 6.835911703109741, "epoch": 0.03867272834622424, "grad_norm": 1.171875, "learning_rate": 0.00032700000000000003, "loss": 6.4762, "mean_token_accuracy": 0.1076883353292942, "num_tokens": 1396655.0, "step": 655 }, { "entropy": 6.812751722335816, "epoch": 0.03896794001298931, "grad_norm": 1.0234375, "learning_rate": 0.00032950000000000004, "loss": 6.4853, "mean_token_accuracy": 0.11088723838329315, "num_tokens": 1407816.0, "step": 660 }, { "entropy": 6.715743827819824, "epoch": 0.03926315167975438, "grad_norm": 1.046875, "learning_rate": 0.00033200000000000005, "loss": 6.4645, "mean_token_accuracy": 0.11460546851158142, "num_tokens": 1418265.0, "step": 665 }, { "entropy": 6.841448259353638, "epoch": 0.03955836334651945, "grad_norm": 1.0859375, "learning_rate": 0.00033450000000000005, "loss": 6.449, "mean_token_accuracy": 0.1139136053621769, "num_tokens": 1429776.0, "step": 670 }, { "entropy": 6.8621501445770265, "epoch": 0.03985357501328453, "grad_norm": 1.1171875, "learning_rate": 0.000337, "loss": 6.475, "mean_token_accuracy": 0.11356844678521157, "num_tokens": 1440295.0, "step": 675 }, { "entropy": 6.859308671951294, "epoch": 0.0401487866800496, "grad_norm": 0.98046875, "learning_rate": 0.0003395, "loss": 6.5194, "mean_token_accuracy": 0.11261903643608093, "num_tokens": 1450505.0, "step": 680 }, { "entropy": 6.922615432739258, "epoch": 0.04044399834681467, "grad_norm": 0.99609375, "learning_rate": 0.000342, "loss": 6.6088, "mean_token_accuracy": 0.10697626769542694, "num_tokens": 1461768.0, "step": 685 }, { "entropy": 6.882122468948364, "epoch": 0.04073921001357974, "grad_norm": 0.90234375, "learning_rate": 0.00034449999999999997, "loss": 6.5527, "mean_token_accuracy": 0.1090085543692112, "num_tokens": 1473965.0, "step": 690 }, { "entropy": 6.839772033691406, "epoch": 0.04103442168034481, "grad_norm": 1.0546875, "learning_rate": 0.000347, "loss": 6.4935, "mean_token_accuracy": 0.1170326255261898, "num_tokens": 1484750.0, "step": 695 }, { "entropy": 6.841724634170532, "epoch": 0.04132963334710988, "grad_norm": 1.0, "learning_rate": 0.0003495, "loss": 6.4818, "mean_token_accuracy": 0.10687893703579902, "num_tokens": 1496474.0, "step": 700 }, { "entropy": 6.801630210876465, "epoch": 0.04162484501387495, "grad_norm": 1.0625, "learning_rate": 0.000352, "loss": 6.6095, "mean_token_accuracy": 0.10371644273400307, "num_tokens": 1507880.0, "step": 705 }, { "entropy": 6.8716658592224125, "epoch": 0.04192005668064002, "grad_norm": 1.0625, "learning_rate": 0.0003545, "loss": 6.5201, "mean_token_accuracy": 0.11054393872618676, "num_tokens": 1519115.0, "step": 710 }, { "entropy": 6.830336380004883, "epoch": 0.04221526834740509, "grad_norm": 1.0703125, "learning_rate": 0.000357, "loss": 6.4674, "mean_token_accuracy": 0.11907401829957961, "num_tokens": 1529031.0, "step": 715 }, { "entropy": 6.835891342163086, "epoch": 0.04251048001417016, "grad_norm": 1.1640625, "learning_rate": 0.0003595, "loss": 6.4217, "mean_token_accuracy": 0.10899701043963432, "num_tokens": 1539954.0, "step": 720 }, { "entropy": 6.782188510894775, "epoch": 0.04280569168093523, "grad_norm": 1.0234375, "learning_rate": 0.000362, "loss": 6.5934, "mean_token_accuracy": 0.10825273916125297, "num_tokens": 1550713.0, "step": 725 }, { "entropy": 6.784424448013306, "epoch": 0.0431009033477003, "grad_norm": 0.984375, "learning_rate": 0.0003645, "loss": 6.4856, "mean_token_accuracy": 0.1092301182448864, "num_tokens": 1562569.0, "step": 730 }, { "entropy": 6.857142400741577, "epoch": 0.04339611501446537, "grad_norm": 0.97265625, "learning_rate": 0.000367, "loss": 6.5065, "mean_token_accuracy": 0.12176962345838546, "num_tokens": 1572999.0, "step": 735 }, { "entropy": 6.821650075912475, "epoch": 0.04369132668123044, "grad_norm": 1.046875, "learning_rate": 0.0003695, "loss": 6.5002, "mean_token_accuracy": 0.10788078010082244, "num_tokens": 1583560.0, "step": 740 }, { "entropy": 6.770935106277466, "epoch": 0.04398653834799551, "grad_norm": 1.0546875, "learning_rate": 0.000372, "loss": 6.4037, "mean_token_accuracy": 0.1184255413711071, "num_tokens": 1593931.0, "step": 745 }, { "entropy": 6.738411855697632, "epoch": 0.04428175001476058, "grad_norm": 0.953125, "learning_rate": 0.0003745, "loss": 6.4744, "mean_token_accuracy": 0.11096556782722473, "num_tokens": 1605182.0, "step": 750 }, { "entropy": 6.793981218338013, "epoch": 0.044576961681525654, "grad_norm": 1.0390625, "learning_rate": 0.000377, "loss": 6.4367, "mean_token_accuracy": 0.11491051763296127, "num_tokens": 1615912.0, "step": 755 }, { "entropy": 6.664726591110229, "epoch": 0.044872173348290724, "grad_norm": 1.0546875, "learning_rate": 0.0003795, "loss": 6.4296, "mean_token_accuracy": 0.11536637470126151, "num_tokens": 1626322.0, "step": 760 }, { "entropy": 6.80378909111023, "epoch": 0.045167385015055794, "grad_norm": 0.984375, "learning_rate": 0.000382, "loss": 6.4088, "mean_token_accuracy": 0.11972564309835435, "num_tokens": 1636859.0, "step": 765 }, { "entropy": 6.7000233173370365, "epoch": 0.045462596681820865, "grad_norm": 0.921875, "learning_rate": 0.0003845, "loss": 6.4417, "mean_token_accuracy": 0.11232743039727211, "num_tokens": 1648511.0, "step": 770 }, { "entropy": 6.739704561233521, "epoch": 0.045757808348585935, "grad_norm": 1.015625, "learning_rate": 0.00038700000000000003, "loss": 6.4156, "mean_token_accuracy": 0.11628528609871865, "num_tokens": 1659350.0, "step": 775 }, { "entropy": 6.675900602340699, "epoch": 0.046053020015351005, "grad_norm": 0.98046875, "learning_rate": 0.00038950000000000003, "loss": 6.4359, "mean_token_accuracy": 0.10967965424060822, "num_tokens": 1670077.0, "step": 780 }, { "entropy": 6.777168655395508, "epoch": 0.046348231682116076, "grad_norm": 0.9140625, "learning_rate": 0.00039200000000000004, "loss": 6.4389, "mean_token_accuracy": 0.11821731701493263, "num_tokens": 1681877.0, "step": 785 }, { "entropy": 6.737879991531372, "epoch": 0.046643443348881146, "grad_norm": 1.1484375, "learning_rate": 0.00039450000000000005, "loss": 6.4192, "mean_token_accuracy": 0.11788794547319412, "num_tokens": 1692448.0, "step": 790 }, { "entropy": 6.714100122451782, "epoch": 0.046938655015646216, "grad_norm": 1.1953125, "learning_rate": 0.00039700000000000005, "loss": 6.4915, "mean_token_accuracy": 0.11439365297555923, "num_tokens": 1702437.0, "step": 795 }, { "entropy": 6.764936017990112, "epoch": 0.04723386668241129, "grad_norm": 1.078125, "learning_rate": 0.0003995, "loss": 6.3825, "mean_token_accuracy": 0.1186959095299244, "num_tokens": 1712587.0, "step": 800 }, { "entropy": 6.780900764465332, "epoch": 0.04752907834917636, "grad_norm": 1.078125, "learning_rate": 0.000402, "loss": 6.4733, "mean_token_accuracy": 0.1111880011856556, "num_tokens": 1722782.0, "step": 805 }, { "entropy": 6.784157133102417, "epoch": 0.04782429001594143, "grad_norm": 0.9765625, "learning_rate": 0.0004045, "loss": 6.4429, "mean_token_accuracy": 0.11309729292988777, "num_tokens": 1733993.0, "step": 810 }, { "entropy": 6.661256790161133, "epoch": 0.0481195016827065, "grad_norm": 1.015625, "learning_rate": 0.00040699999999999997, "loss": 6.4319, "mean_token_accuracy": 0.12013896554708481, "num_tokens": 1744095.0, "step": 815 }, { "entropy": 6.627638578414917, "epoch": 0.04841471334947157, "grad_norm": 1.25, "learning_rate": 0.0004095, "loss": 6.3862, "mean_token_accuracy": 0.11798101216554642, "num_tokens": 1754356.0, "step": 820 }, { "entropy": 6.718645000457764, "epoch": 0.048709925016236645, "grad_norm": 1.046875, "learning_rate": 0.000412, "loss": 6.4632, "mean_token_accuracy": 0.11508424431085587, "num_tokens": 1765628.0, "step": 825 }, { "entropy": 6.697535753250122, "epoch": 0.049005136683001715, "grad_norm": 1.046875, "learning_rate": 0.0004145, "loss": 6.3341, "mean_token_accuracy": 0.11765867844223976, "num_tokens": 1775697.0, "step": 830 }, { "entropy": 6.703864526748657, "epoch": 0.049300348349766786, "grad_norm": 0.984375, "learning_rate": 0.000417, "loss": 6.4334, "mean_token_accuracy": 0.11458561718463897, "num_tokens": 1786066.0, "step": 835 }, { "entropy": 6.613457870483399, "epoch": 0.049595560016531856, "grad_norm": 1.0390625, "learning_rate": 0.0004195, "loss": 6.2576, "mean_token_accuracy": 0.12075778916478157, "num_tokens": 1796735.0, "step": 840 }, { "entropy": 6.7064070224761965, "epoch": 0.049890771683296926, "grad_norm": 1.125, "learning_rate": 0.000422, "loss": 6.4148, "mean_token_accuracy": 0.11420085206627846, "num_tokens": 1807164.0, "step": 845 }, { "entropy": 6.664913654327393, "epoch": 0.050185983350062, "grad_norm": 1.09375, "learning_rate": 0.0004245, "loss": 6.4446, "mean_token_accuracy": 0.11588526219129562, "num_tokens": 1818788.0, "step": 850 }, { "entropy": 6.706023120880127, "epoch": 0.05048119501682707, "grad_norm": 1.09375, "learning_rate": 0.000427, "loss": 6.4336, "mean_token_accuracy": 0.11620423197746277, "num_tokens": 1830488.0, "step": 855 }, { "entropy": 6.5659849643707275, "epoch": 0.05077640668359214, "grad_norm": 1.078125, "learning_rate": 0.0004295, "loss": 6.3689, "mean_token_accuracy": 0.11279175132513046, "num_tokens": 1841085.0, "step": 860 }, { "entropy": 6.62478985786438, "epoch": 0.05107161835035721, "grad_norm": 0.8984375, "learning_rate": 0.000432, "loss": 6.3439, "mean_token_accuracy": 0.11958979964256286, "num_tokens": 1852831.0, "step": 865 }, { "entropy": 6.638272142410278, "epoch": 0.05136683001712228, "grad_norm": 1.0078125, "learning_rate": 0.0004345, "loss": 6.3074, "mean_token_accuracy": 0.12059865668416023, "num_tokens": 1863868.0, "step": 870 }, { "entropy": 6.604048776626587, "epoch": 0.05166204168388735, "grad_norm": 1.03125, "learning_rate": 0.000437, "loss": 6.2958, "mean_token_accuracy": 0.11414773985743523, "num_tokens": 1874227.0, "step": 875 }, { "entropy": 6.589703607559204, "epoch": 0.05195725335065242, "grad_norm": 1.1015625, "learning_rate": 0.0004395, "loss": 6.2993, "mean_token_accuracy": 0.12205377146601677, "num_tokens": 1883712.0, "step": 880 }, { "entropy": 6.678598642349243, "epoch": 0.05225246501741749, "grad_norm": 1.0703125, "learning_rate": 0.000442, "loss": 6.4011, "mean_token_accuracy": 0.11998820379376411, "num_tokens": 1894909.0, "step": 885 }, { "entropy": 6.598682498931884, "epoch": 0.05254767668418256, "grad_norm": 1.0859375, "learning_rate": 0.0004445, "loss": 6.3208, "mean_token_accuracy": 0.1276823714375496, "num_tokens": 1904973.0, "step": 890 }, { "entropy": 6.58713927268982, "epoch": 0.05284288835094763, "grad_norm": 0.96484375, "learning_rate": 0.000447, "loss": 6.29, "mean_token_accuracy": 0.11684366688132286, "num_tokens": 1915131.0, "step": 895 }, { "entropy": 6.627308464050293, "epoch": 0.0531381000177127, "grad_norm": 0.94921875, "learning_rate": 0.00044950000000000003, "loss": 6.3868, "mean_token_accuracy": 0.11667721047997474, "num_tokens": 1925893.0, "step": 900 }, { "entropy": 6.6627851009368895, "epoch": 0.05343331168447777, "grad_norm": 1.0546875, "learning_rate": 0.00045200000000000004, "loss": 6.3972, "mean_token_accuracy": 0.11407171338796615, "num_tokens": 1936830.0, "step": 905 }, { "entropy": 6.569732666015625, "epoch": 0.05372852335124284, "grad_norm": 1.0, "learning_rate": 0.00045450000000000004, "loss": 6.3268, "mean_token_accuracy": 0.12334559336304665, "num_tokens": 1948291.0, "step": 910 }, { "entropy": 6.645078706741333, "epoch": 0.05402373501800791, "grad_norm": 0.9609375, "learning_rate": 0.00045700000000000005, "loss": 6.3853, "mean_token_accuracy": 0.11478180214762687, "num_tokens": 1959168.0, "step": 915 }, { "entropy": 6.565263366699218, "epoch": 0.05431894668477298, "grad_norm": 1.046875, "learning_rate": 0.00045950000000000006, "loss": 6.3516, "mean_token_accuracy": 0.12495195642113685, "num_tokens": 1970046.0, "step": 920 }, { "entropy": 6.566036319732666, "epoch": 0.05461415835153805, "grad_norm": 1.0546875, "learning_rate": 0.000462, "loss": 6.3371, "mean_token_accuracy": 0.12042524293065071, "num_tokens": 1980430.0, "step": 925 }, { "entropy": 6.663130235671997, "epoch": 0.05490937001830312, "grad_norm": 0.9921875, "learning_rate": 0.0004645, "loss": 6.3409, "mean_token_accuracy": 0.12344788387417793, "num_tokens": 1991035.0, "step": 930 }, { "entropy": 6.647854423522949, "epoch": 0.05520458168506819, "grad_norm": 0.96875, "learning_rate": 0.000467, "loss": 6.3706, "mean_token_accuracy": 0.1162357397377491, "num_tokens": 2002122.0, "step": 935 }, { "entropy": 6.557170581817627, "epoch": 0.05549979335183326, "grad_norm": 1.0078125, "learning_rate": 0.0004695, "loss": 6.3101, "mean_token_accuracy": 0.11861225590109825, "num_tokens": 2012676.0, "step": 940 }, { "entropy": 6.556992673873902, "epoch": 0.05579500501859833, "grad_norm": 1.0703125, "learning_rate": 0.000472, "loss": 6.328, "mean_token_accuracy": 0.11912066489458084, "num_tokens": 2023124.0, "step": 945 }, { "entropy": 6.683170127868652, "epoch": 0.0560902166853634, "grad_norm": 0.984375, "learning_rate": 0.0004745, "loss": 6.3176, "mean_token_accuracy": 0.11822493821382522, "num_tokens": 2034030.0, "step": 950 }, { "entropy": 6.448392868041992, "epoch": 0.056385428352128474, "grad_norm": 1.2578125, "learning_rate": 0.000477, "loss": 6.3329, "mean_token_accuracy": 0.11704078093171119, "num_tokens": 2044499.0, "step": 955 }, { "entropy": 6.59168119430542, "epoch": 0.056680640018893544, "grad_norm": 1.09375, "learning_rate": 0.0004795, "loss": 6.3684, "mean_token_accuracy": 0.11949558109045029, "num_tokens": 2055242.0, "step": 960 }, { "entropy": 6.52003698348999, "epoch": 0.056975851685658614, "grad_norm": 1.015625, "learning_rate": 0.000482, "loss": 6.3533, "mean_token_accuracy": 0.11890814751386643, "num_tokens": 2065987.0, "step": 965 }, { "entropy": 6.531438779830933, "epoch": 0.057271063352423685, "grad_norm": 0.97265625, "learning_rate": 0.0004845, "loss": 6.2626, "mean_token_accuracy": 0.12552469298243524, "num_tokens": 2077015.0, "step": 970 }, { "entropy": 6.661432361602783, "epoch": 0.05756627501918876, "grad_norm": 1.03125, "learning_rate": 0.000487, "loss": 6.3877, "mean_token_accuracy": 0.12421264126896858, "num_tokens": 2087411.0, "step": 975 }, { "entropy": 6.554572677612304, "epoch": 0.05786148668595383, "grad_norm": 1.03125, "learning_rate": 0.0004895, "loss": 6.2903, "mean_token_accuracy": 0.12133480757474899, "num_tokens": 2097612.0, "step": 980 }, { "entropy": 6.477239942550659, "epoch": 0.0581566983527189, "grad_norm": 1.0546875, "learning_rate": 0.000492, "loss": 6.2478, "mean_token_accuracy": 0.12306424006819724, "num_tokens": 2108118.0, "step": 985 }, { "entropy": 6.513996744155884, "epoch": 0.05845191001948397, "grad_norm": 1.0625, "learning_rate": 0.0004945, "loss": 6.3221, "mean_token_accuracy": 0.12351070642471314, "num_tokens": 2118262.0, "step": 990 }, { "entropy": 6.5929190158844, "epoch": 0.05874712168624904, "grad_norm": 1.078125, "learning_rate": 0.000497, "loss": 6.3173, "mean_token_accuracy": 0.12096539437770844, "num_tokens": 2128819.0, "step": 995 }, { "entropy": 6.52128791809082, "epoch": 0.05904233335301411, "grad_norm": 0.9375, "learning_rate": 0.0004995, "loss": 6.2396, "mean_token_accuracy": 0.12479885071516036, "num_tokens": 2139852.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 464442284113920.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }