{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.029521166676507057, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742573165893555, "epoch": 0.00029521166676507054, "grad_norm": 4.96875, "learning_rate": 2e-06, "loss": 10.7764, "mean_token_accuracy": 0.00011173184029757976, "num_tokens": 10275.0, "step": 5 }, { "entropy": 10.74255199432373, "epoch": 0.0005904233335301411, "grad_norm": 5.4375, "learning_rate": 4.5e-06, "loss": 10.7784, "mean_token_accuracy": 0.00011086474405601621, "num_tokens": 22020.0, "step": 10 }, { "entropy": 10.742577171325683, "epoch": 0.0008856350002952116, "grad_norm": 5.09375, "learning_rate": 7e-06, "loss": 10.7479, "mean_token_accuracy": 0.0, "num_tokens": 32612.0, "step": 15 }, { "entropy": 10.742585563659668, "epoch": 0.0011808466670602822, "grad_norm": 5.125, "learning_rate": 9.5e-06, "loss": 10.692, "mean_token_accuracy": 0.0002895977755542845, "num_tokens": 43270.0, "step": 20 }, { "entropy": 10.74253044128418, "epoch": 0.0014760583338253527, "grad_norm": 4.34375, "learning_rate": 1.2e-05, "loss": 10.5945, "mean_token_accuracy": 0.0037050600280053914, "num_tokens": 54178.0, "step": 25 }, { "entropy": 10.742242050170898, "epoch": 0.0017712700005904232, "grad_norm": 4.15625, "learning_rate": 1.4500000000000002e-05, "loss": 10.4602, "mean_token_accuracy": 0.02422279641032219, "num_tokens": 64390.0, "step": 30 }, { "entropy": 10.741262912750244, "epoch": 0.002066481667355494, "grad_norm": 3.3125, "learning_rate": 1.7000000000000003e-05, "loss": 10.2806, "mean_token_accuracy": 0.041601650416851044, "num_tokens": 73703.0, "step": 35 }, { "entropy": 10.738601016998292, "epoch": 0.0023616933341205643, "grad_norm": 2.625, "learning_rate": 1.95e-05, "loss": 10.1485, "mean_token_accuracy": 0.04163007400929928, "num_tokens": 83463.0, "step": 40 }, { "entropy": 10.734784793853759, "epoch": 0.002656905000885635, "grad_norm": 2.265625, "learning_rate": 2.2e-05, "loss": 10.0675, "mean_token_accuracy": 0.04389659091830254, "num_tokens": 94129.0, "step": 45 }, { "entropy": 10.73138256072998, "epoch": 0.0029521166676507054, "grad_norm": 2.109375, "learning_rate": 2.4500000000000003e-05, "loss": 9.9969, "mean_token_accuracy": 0.043133416399359706, "num_tokens": 105482.0, "step": 50 }, { "entropy": 10.729689979553223, "epoch": 0.003247328334415776, "grad_norm": 2.0625, "learning_rate": 2.7e-05, "loss": 9.9129, "mean_token_accuracy": 0.04309733100235462, "num_tokens": 117342.0, "step": 55 }, { "entropy": 10.728583812713623, "epoch": 0.0035425400011808465, "grad_norm": 1.859375, "learning_rate": 2.95e-05, "loss": 9.8878, "mean_token_accuracy": 0.04118645377457142, "num_tokens": 127691.0, "step": 60 }, { "entropy": 10.727480697631837, "epoch": 0.0038377516679459172, "grad_norm": 1.90625, "learning_rate": 3.2e-05, "loss": 9.7761, "mean_token_accuracy": 0.04004005677998066, "num_tokens": 138186.0, "step": 65 }, { "entropy": 10.725414276123047, "epoch": 0.004132963334710988, "grad_norm": 1.9375, "learning_rate": 3.4500000000000005e-05, "loss": 9.7581, "mean_token_accuracy": 0.0433019045740366, "num_tokens": 149578.0, "step": 70 }, { "entropy": 10.720968532562257, "epoch": 0.004428175001476058, "grad_norm": 1.9140625, "learning_rate": 3.7e-05, "loss": 9.6737, "mean_token_accuracy": 0.04341540932655334, "num_tokens": 160139.0, "step": 75 }, { "entropy": 10.71543197631836, "epoch": 0.004723386668241129, "grad_norm": 1.90625, "learning_rate": 3.95e-05, "loss": 9.6176, "mean_token_accuracy": 0.042911310121417044, "num_tokens": 170768.0, "step": 80 }, { "entropy": 10.708538818359376, "epoch": 0.0050185983350062, "grad_norm": 1.984375, "learning_rate": 4.2000000000000004e-05, "loss": 9.5004, "mean_token_accuracy": 0.04607887454330921, "num_tokens": 180702.0, "step": 85 }, { "entropy": 10.699075031280518, "epoch": 0.00531381000177127, "grad_norm": 1.9921875, "learning_rate": 4.45e-05, "loss": 9.4474, "mean_token_accuracy": 0.04201225638389587, "num_tokens": 191188.0, "step": 90 }, { "entropy": 10.691750621795654, "epoch": 0.0056090216685363405, "grad_norm": 1.90625, "learning_rate": 4.7000000000000004e-05, "loss": 9.381, "mean_token_accuracy": 0.03792413603514433, "num_tokens": 201094.0, "step": 95 }, { "entropy": 10.6837984085083, "epoch": 0.005904233335301411, "grad_norm": 1.8984375, "learning_rate": 4.9500000000000004e-05, "loss": 9.2614, "mean_token_accuracy": 0.04629642106592655, "num_tokens": 211718.0, "step": 100 }, { "entropy": 10.667647075653075, "epoch": 0.006199445002066482, "grad_norm": 1.8828125, "learning_rate": 5.2e-05, "loss": 9.1409, "mean_token_accuracy": 0.05333527401089668, "num_tokens": 221446.0, "step": 105 }, { "entropy": 10.640782737731934, "epoch": 0.006494656668831552, "grad_norm": 1.7578125, "learning_rate": 5.45e-05, "loss": 9.1093, "mean_token_accuracy": 0.05261831916868687, "num_tokens": 232848.0, "step": 110 }, { "entropy": 10.602476406097413, "epoch": 0.006789868335596623, "grad_norm": 1.75, "learning_rate": 5.7e-05, "loss": 9.0166, "mean_token_accuracy": 0.05226000994443893, "num_tokens": 244008.0, "step": 115 }, { "entropy": 10.5585186958313, "epoch": 0.007085080002361693, "grad_norm": 1.7265625, "learning_rate": 5.9499999999999996e-05, "loss": 8.8449, "mean_token_accuracy": 0.05914722830057144, "num_tokens": 256211.0, "step": 120 }, { "entropy": 10.501475620269776, "epoch": 0.007380291669126764, "grad_norm": 1.671875, "learning_rate": 6.2e-05, "loss": 8.7664, "mean_token_accuracy": 0.05910652950406074, "num_tokens": 266688.0, "step": 125 }, { "entropy": 10.426000499725342, "epoch": 0.0076755033358918345, "grad_norm": 1.5625, "learning_rate": 6.450000000000001e-05, "loss": 8.57, "mean_token_accuracy": 0.0610476765781641, "num_tokens": 276930.0, "step": 130 }, { "entropy": 10.339440727233887, "epoch": 0.007970715002656906, "grad_norm": 1.625, "learning_rate": 6.7e-05, "loss": 8.4277, "mean_token_accuracy": 0.07068866156041623, "num_tokens": 287508.0, "step": 135 }, { "entropy": 10.240792846679687, "epoch": 0.008265926669421976, "grad_norm": 1.546875, "learning_rate": 6.950000000000001e-05, "loss": 8.2713, "mean_token_accuracy": 0.07111315764486789, "num_tokens": 298021.0, "step": 140 }, { "entropy": 10.135569763183593, "epoch": 0.008561138336187046, "grad_norm": 1.3828125, "learning_rate": 7.2e-05, "loss": 8.1726, "mean_token_accuracy": 0.07181189507246018, "num_tokens": 308301.0, "step": 145 }, { "entropy": 9.984276580810548, "epoch": 0.008856350002952117, "grad_norm": 1.375, "learning_rate": 7.45e-05, "loss": 8.0427, "mean_token_accuracy": 0.06862774454057216, "num_tokens": 319321.0, "step": 150 }, { "entropy": 9.829378795623779, "epoch": 0.009151561669717187, "grad_norm": 1.25, "learning_rate": 7.7e-05, "loss": 8.0055, "mean_token_accuracy": 0.07413771599531174, "num_tokens": 330926.0, "step": 155 }, { "entropy": 9.623138332366944, "epoch": 0.009446773336482257, "grad_norm": 1.125, "learning_rate": 7.950000000000001e-05, "loss": 7.7929, "mean_token_accuracy": 0.07890797778964043, "num_tokens": 341133.0, "step": 160 }, { "entropy": 9.416749095916748, "epoch": 0.009741985003247328, "grad_norm": 1.28125, "learning_rate": 8.2e-05, "loss": 7.7407, "mean_token_accuracy": 0.07391801774501801, "num_tokens": 351897.0, "step": 165 }, { "entropy": 9.196506309509278, "epoch": 0.0100371966700124, "grad_norm": 0.96875, "learning_rate": 8.450000000000001e-05, "loss": 7.6663, "mean_token_accuracy": 0.07125836983323097, "num_tokens": 362644.0, "step": 170 }, { "entropy": 8.932462692260742, "epoch": 0.01033240833677747, "grad_norm": 0.9296875, "learning_rate": 8.7e-05, "loss": 7.628, "mean_token_accuracy": 0.07178853973746299, "num_tokens": 373902.0, "step": 175 }, { "entropy": 8.703715133666993, "epoch": 0.01062762000354254, "grad_norm": 0.87890625, "learning_rate": 8.95e-05, "loss": 7.4958, "mean_token_accuracy": 0.08398130461573601, "num_tokens": 384828.0, "step": 180 }, { "entropy": 8.474815559387206, "epoch": 0.01092283167030761, "grad_norm": 0.8359375, "learning_rate": 9.2e-05, "loss": 7.4684, "mean_token_accuracy": 0.07413811013102531, "num_tokens": 395103.0, "step": 185 }, { "entropy": 8.360427570343017, "epoch": 0.011218043337072681, "grad_norm": 0.8515625, "learning_rate": 9.45e-05, "loss": 7.374, "mean_token_accuracy": 0.08157729879021644, "num_tokens": 405283.0, "step": 190 }, { "entropy": 8.21293478012085, "epoch": 0.011513255003837751, "grad_norm": 0.96484375, "learning_rate": 9.7e-05, "loss": 7.3468, "mean_token_accuracy": 0.0755577202886343, "num_tokens": 416005.0, "step": 195 }, { "entropy": 8.12078037261963, "epoch": 0.011808466670602822, "grad_norm": 0.828125, "learning_rate": 9.95e-05, "loss": 7.3518, "mean_token_accuracy": 0.08057705461978912, "num_tokens": 426547.0, "step": 200 }, { "entropy": 8.019514322280884, "epoch": 0.012103678337367892, "grad_norm": 1.1328125, "learning_rate": 0.000102, "loss": 7.2823, "mean_token_accuracy": 0.08034192845225334, "num_tokens": 436262.0, "step": 205 }, { "entropy": 7.997368812561035, "epoch": 0.012398890004132964, "grad_norm": 1.0390625, "learning_rate": 0.00010449999999999999, "loss": 7.3018, "mean_token_accuracy": 0.07936789095401764, "num_tokens": 446899.0, "step": 210 }, { "entropy": 7.968120145797729, "epoch": 0.012694101670898034, "grad_norm": 0.9140625, "learning_rate": 0.000107, "loss": 7.3322, "mean_token_accuracy": 0.07839082404971123, "num_tokens": 458224.0, "step": 215 }, { "entropy": 8.01854157447815, "epoch": 0.012989313337663105, "grad_norm": 0.92578125, "learning_rate": 0.0001095, "loss": 7.2688, "mean_token_accuracy": 0.0764270156621933, "num_tokens": 469306.0, "step": 220 }, { "entropy": 7.9349792957305905, "epoch": 0.013284525004428175, "grad_norm": 1.1796875, "learning_rate": 0.000112, "loss": 7.2614, "mean_token_accuracy": 0.08024230971932411, "num_tokens": 478685.0, "step": 225 }, { "entropy": 7.891508388519287, "epoch": 0.013579736671193245, "grad_norm": 0.9140625, "learning_rate": 0.0001145, "loss": 7.1822, "mean_token_accuracy": 0.0861165277659893, "num_tokens": 489376.0, "step": 230 }, { "entropy": 7.872423553466797, "epoch": 0.013874948337958316, "grad_norm": 0.9453125, "learning_rate": 0.00011700000000000001, "loss": 7.1724, "mean_token_accuracy": 0.08608285039663315, "num_tokens": 500260.0, "step": 235 }, { "entropy": 7.763920402526855, "epoch": 0.014170160004723386, "grad_norm": 0.953125, "learning_rate": 0.00011949999999999999, "loss": 7.1567, "mean_token_accuracy": 0.08700917065143585, "num_tokens": 511953.0, "step": 240 }, { "entropy": 7.8764701843261715, "epoch": 0.014465371671488458, "grad_norm": 0.91796875, "learning_rate": 0.000122, "loss": 7.3427, "mean_token_accuracy": 0.07973492071032524, "num_tokens": 523055.0, "step": 245 }, { "entropy": 7.788686466217041, "epoch": 0.014760583338253528, "grad_norm": 0.9453125, "learning_rate": 0.0001245, "loss": 7.1424, "mean_token_accuracy": 0.0809820182621479, "num_tokens": 534337.0, "step": 250 }, { "entropy": 7.773524141311645, "epoch": 0.015055795005018599, "grad_norm": 0.96875, "learning_rate": 0.000127, "loss": 7.1488, "mean_token_accuracy": 0.08801065608859063, "num_tokens": 545189.0, "step": 255 }, { "entropy": 7.762392187118531, "epoch": 0.015351006671783669, "grad_norm": 0.859375, "learning_rate": 0.0001295, "loss": 7.1789, "mean_token_accuracy": 0.08976453244686126, "num_tokens": 555506.0, "step": 260 }, { "entropy": 7.752877712249756, "epoch": 0.01564621833854874, "grad_norm": 0.84765625, "learning_rate": 0.000132, "loss": 7.0892, "mean_token_accuracy": 0.08789646476507187, "num_tokens": 565936.0, "step": 265 }, { "entropy": 7.730583906173706, "epoch": 0.01594143000531381, "grad_norm": 1.1015625, "learning_rate": 0.00013450000000000002, "loss": 7.1826, "mean_token_accuracy": 0.08930487185716629, "num_tokens": 575691.0, "step": 270 }, { "entropy": 7.710203313827515, "epoch": 0.01623664167207888, "grad_norm": 0.9765625, "learning_rate": 0.00013700000000000002, "loss": 7.1496, "mean_token_accuracy": 0.08626075237989425, "num_tokens": 586170.0, "step": 275 }, { "entropy": 7.728785562515259, "epoch": 0.016531853338843952, "grad_norm": 1.2265625, "learning_rate": 0.0001395, "loss": 7.1356, "mean_token_accuracy": 0.08597519621253014, "num_tokens": 596458.0, "step": 280 }, { "entropy": 7.711720895767212, "epoch": 0.016827065005609022, "grad_norm": 0.94921875, "learning_rate": 0.00014199999999999998, "loss": 7.0549, "mean_token_accuracy": 0.08382375612854957, "num_tokens": 606214.0, "step": 285 }, { "entropy": 7.6635658740997314, "epoch": 0.017122276672374093, "grad_norm": 1.2421875, "learning_rate": 0.0001445, "loss": 7.1085, "mean_token_accuracy": 0.08702588006854058, "num_tokens": 617074.0, "step": 290 }, { "entropy": 7.613530492782592, "epoch": 0.017417488339139163, "grad_norm": 1.03125, "learning_rate": 0.000147, "loss": 7.1582, "mean_token_accuracy": 0.0854655608534813, "num_tokens": 628057.0, "step": 295 }, { "entropy": 7.640975618362427, "epoch": 0.017712700005904233, "grad_norm": 0.95703125, "learning_rate": 0.0001495, "loss": 7.0762, "mean_token_accuracy": 0.0919909045100212, "num_tokens": 638150.0, "step": 300 }, { "entropy": 7.644310426712036, "epoch": 0.018007911672669304, "grad_norm": 1.03125, "learning_rate": 0.000152, "loss": 6.9574, "mean_token_accuracy": 0.09665790945291519, "num_tokens": 648377.0, "step": 305 }, { "entropy": 7.570417594909668, "epoch": 0.018303123339434374, "grad_norm": 0.89453125, "learning_rate": 0.00015450000000000001, "loss": 7.0219, "mean_token_accuracy": 0.09368904307484627, "num_tokens": 658777.0, "step": 310 }, { "entropy": 7.5545618534088135, "epoch": 0.018598335006199444, "grad_norm": 1.078125, "learning_rate": 0.000157, "loss": 7.1283, "mean_token_accuracy": 0.08728318810462951, "num_tokens": 669105.0, "step": 315 }, { "entropy": 7.581419992446899, "epoch": 0.018893546672964515, "grad_norm": 0.8671875, "learning_rate": 0.0001595, "loss": 6.9931, "mean_token_accuracy": 0.08857197985053063, "num_tokens": 679294.0, "step": 320 }, { "entropy": 7.5300342559814455, "epoch": 0.019188758339729585, "grad_norm": 0.8125, "learning_rate": 0.000162, "loss": 6.9576, "mean_token_accuracy": 0.09436112716794014, "num_tokens": 690495.0, "step": 325 }, { "entropy": 7.517716407775879, "epoch": 0.019483970006494655, "grad_norm": 0.86328125, "learning_rate": 0.00016450000000000001, "loss": 6.979, "mean_token_accuracy": 0.09718031734228134, "num_tokens": 701002.0, "step": 330 }, { "entropy": 7.48517951965332, "epoch": 0.019779181673259726, "grad_norm": 0.97265625, "learning_rate": 0.00016700000000000002, "loss": 6.8828, "mean_token_accuracy": 0.09275271818041801, "num_tokens": 711488.0, "step": 335 }, { "entropy": 7.405734252929688, "epoch": 0.0200743933400248, "grad_norm": 0.984375, "learning_rate": 0.00016950000000000003, "loss": 6.9022, "mean_token_accuracy": 0.09012737646698951, "num_tokens": 722637.0, "step": 340 }, { "entropy": 7.489488410949707, "epoch": 0.02036960500678987, "grad_norm": 0.88671875, "learning_rate": 0.00017199999999999998, "loss": 6.9705, "mean_token_accuracy": 0.09417287185788155, "num_tokens": 733212.0, "step": 345 }, { "entropy": 7.45473804473877, "epoch": 0.02066481667355494, "grad_norm": 1.390625, "learning_rate": 0.00017449999999999999, "loss": 6.9008, "mean_token_accuracy": 0.09309542924165726, "num_tokens": 743602.0, "step": 350 }, { "entropy": 7.441885089874267, "epoch": 0.02096002834032001, "grad_norm": 1.15625, "learning_rate": 0.000177, "loss": 6.9506, "mean_token_accuracy": 0.09587474688887596, "num_tokens": 754094.0, "step": 355 }, { "entropy": 7.430218076705932, "epoch": 0.02125524000708508, "grad_norm": 1.0390625, "learning_rate": 0.0001795, "loss": 6.8964, "mean_token_accuracy": 0.09253331273794174, "num_tokens": 763823.0, "step": 360 }, { "entropy": 7.417900943756104, "epoch": 0.02155045167385015, "grad_norm": 1.2109375, "learning_rate": 0.000182, "loss": 6.8424, "mean_token_accuracy": 0.09944578483700753, "num_tokens": 774128.0, "step": 365 }, { "entropy": 7.384387731552124, "epoch": 0.02184566334061522, "grad_norm": 1.1484375, "learning_rate": 0.0001845, "loss": 6.913, "mean_token_accuracy": 0.09629636481404305, "num_tokens": 784292.0, "step": 370 }, { "entropy": 7.428071117401123, "epoch": 0.02214087500738029, "grad_norm": 0.921875, "learning_rate": 0.000187, "loss": 6.896, "mean_token_accuracy": 0.09847814217209816, "num_tokens": 795437.0, "step": 375 }, { "entropy": 7.368625783920288, "epoch": 0.022436086674145362, "grad_norm": 1.0078125, "learning_rate": 0.0001895, "loss": 6.8038, "mean_token_accuracy": 0.09553659558296204, "num_tokens": 806543.0, "step": 380 }, { "entropy": 7.34774341583252, "epoch": 0.022731298340910432, "grad_norm": 1.1484375, "learning_rate": 0.000192, "loss": 6.9575, "mean_token_accuracy": 0.09456263706088067, "num_tokens": 817179.0, "step": 385 }, { "entropy": 7.4415544986724855, "epoch": 0.023026510007675503, "grad_norm": 0.94921875, "learning_rate": 0.0001945, "loss": 6.8667, "mean_token_accuracy": 0.09976130351424217, "num_tokens": 826749.0, "step": 390 }, { "entropy": 7.363486337661743, "epoch": 0.023321721674440573, "grad_norm": 1.109375, "learning_rate": 0.00019700000000000002, "loss": 6.8927, "mean_token_accuracy": 0.0938490979373455, "num_tokens": 838807.0, "step": 395 }, { "entropy": 7.37176923751831, "epoch": 0.023616933341205643, "grad_norm": 0.99609375, "learning_rate": 0.00019950000000000002, "loss": 6.8827, "mean_token_accuracy": 0.09748194366693497, "num_tokens": 849651.0, "step": 400 }, { "entropy": 7.367251443862915, "epoch": 0.023912145007970714, "grad_norm": 1.0234375, "learning_rate": 0.000202, "loss": 6.934, "mean_token_accuracy": 0.09160904809832573, "num_tokens": 859753.0, "step": 405 }, { "entropy": 7.345250177383423, "epoch": 0.024207356674735784, "grad_norm": 0.90625, "learning_rate": 0.00020449999999999998, "loss": 6.8134, "mean_token_accuracy": 0.10118522644042968, "num_tokens": 869904.0, "step": 410 }, { "entropy": 7.267154836654663, "epoch": 0.024502568341500858, "grad_norm": 0.88671875, "learning_rate": 0.000207, "loss": 6.8152, "mean_token_accuracy": 0.09964827746152878, "num_tokens": 880948.0, "step": 415 }, { "entropy": 7.350914382934571, "epoch": 0.024797780008265928, "grad_norm": 0.94921875, "learning_rate": 0.0002095, "loss": 6.8961, "mean_token_accuracy": 0.09352625384926797, "num_tokens": 892331.0, "step": 420 }, { "entropy": 7.300309419631958, "epoch": 0.025092991675031, "grad_norm": 1.09375, "learning_rate": 0.000212, "loss": 6.731, "mean_token_accuracy": 0.10073179304599762, "num_tokens": 901691.0, "step": 425 }, { "entropy": 7.247861719131469, "epoch": 0.02538820334179607, "grad_norm": 1.0390625, "learning_rate": 0.0002145, "loss": 6.7662, "mean_token_accuracy": 0.0965045303106308, "num_tokens": 912495.0, "step": 430 }, { "entropy": 7.235934734344482, "epoch": 0.02568341500856114, "grad_norm": 1.0234375, "learning_rate": 0.00021700000000000002, "loss": 6.7406, "mean_token_accuracy": 0.10061677768826485, "num_tokens": 923420.0, "step": 435 }, { "entropy": 7.153478145599365, "epoch": 0.02597862667532621, "grad_norm": 0.94140625, "learning_rate": 0.0002195, "loss": 6.7327, "mean_token_accuracy": 0.10134619474411011, "num_tokens": 933598.0, "step": 440 }, { "entropy": 7.279621028900147, "epoch": 0.02627383834209128, "grad_norm": 1.1953125, "learning_rate": 0.000222, "loss": 6.8611, "mean_token_accuracy": 0.09994317889213562, "num_tokens": 943229.0, "step": 445 }, { "entropy": 7.256894063949585, "epoch": 0.02656905000885635, "grad_norm": 1.0390625, "learning_rate": 0.0002245, "loss": 6.7288, "mean_token_accuracy": 0.09972334206104279, "num_tokens": 954425.0, "step": 450 }, { "entropy": 7.333712911605835, "epoch": 0.02686426167562142, "grad_norm": 1.1328125, "learning_rate": 0.00022700000000000002, "loss": 6.8322, "mean_token_accuracy": 0.10051686838269233, "num_tokens": 965516.0, "step": 455 }, { "entropy": 7.109683799743652, "epoch": 0.02715947334238649, "grad_norm": 0.90234375, "learning_rate": 0.00022950000000000002, "loss": 6.7124, "mean_token_accuracy": 0.10072791278362274, "num_tokens": 976469.0, "step": 460 }, { "entropy": 7.249271726608276, "epoch": 0.02745468500915156, "grad_norm": 1.046875, "learning_rate": 0.00023200000000000003, "loss": 6.8029, "mean_token_accuracy": 0.09443021714687347, "num_tokens": 986946.0, "step": 465 }, { "entropy": 7.233931303024292, "epoch": 0.02774989667591663, "grad_norm": 1.015625, "learning_rate": 0.00023449999999999998, "loss": 6.6988, "mean_token_accuracy": 0.10011776387691498, "num_tokens": 997101.0, "step": 470 }, { "entropy": 7.123860883712768, "epoch": 0.0280451083426817, "grad_norm": 1.0703125, "learning_rate": 0.000237, "loss": 6.8063, "mean_token_accuracy": 0.09995891153812408, "num_tokens": 1007866.0, "step": 475 }, { "entropy": 7.302121591567993, "epoch": 0.028340320009446772, "grad_norm": 1.15625, "learning_rate": 0.0002395, "loss": 6.8209, "mean_token_accuracy": 0.09563429430127143, "num_tokens": 1019377.0, "step": 480 }, { "entropy": 7.214538860321045, "epoch": 0.028635531676211842, "grad_norm": 0.97265625, "learning_rate": 0.000242, "loss": 6.7985, "mean_token_accuracy": 0.10173870101571084, "num_tokens": 1031278.0, "step": 485 }, { "entropy": 7.053379869461059, "epoch": 0.028930743342976916, "grad_norm": 0.94140625, "learning_rate": 0.0002445, "loss": 6.609, "mean_token_accuracy": 0.10857169032096863, "num_tokens": 1041663.0, "step": 490 }, { "entropy": 7.141558599472046, "epoch": 0.029225955009741986, "grad_norm": 1.0078125, "learning_rate": 0.000247, "loss": 6.68, "mean_token_accuracy": 0.10325370877981185, "num_tokens": 1052286.0, "step": 495 }, { "entropy": 7.082495021820068, "epoch": 0.029521166676507057, "grad_norm": 1.1953125, "learning_rate": 0.0002495, "loss": 6.7424, "mean_token_accuracy": 0.10430480614304542, "num_tokens": 1061945.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 228077211156480.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }