{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.029521166676507057, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.69201593399048, "epoch": 0.00029521166676507054, "grad_norm": 12.6875, "learning_rate": 2e-06, "loss": 10.8334, "mean_token_accuracy": 0.0, "num_tokens": 10275.0, "step": 5 }, { "entropy": 10.691933250427246, "epoch": 0.0005904233335301411, "grad_norm": 13.1875, "learning_rate": 4.5e-06, "loss": 10.7937, "mean_token_accuracy": 0.0, "num_tokens": 22020.0, "step": 10 }, { "entropy": 10.691065883636474, "epoch": 0.0008856350002952116, "grad_norm": 9.5625, "learning_rate": 7e-06, "loss": 10.5174, "mean_token_accuracy": 0.021099633118137718, "num_tokens": 32612.0, "step": 15 }, { "entropy": 10.68113021850586, "epoch": 0.0011808466670602822, "grad_norm": 6.21875, "learning_rate": 9.5e-06, "loss": 10.1848, "mean_token_accuracy": 0.04274020157754421, "num_tokens": 43270.0, "step": 20 }, { "entropy": 10.621037483215332, "epoch": 0.0014760583338253527, "grad_norm": 3.84375, "learning_rate": 1.2e-05, "loss": 9.9202, "mean_token_accuracy": 0.04267438128590584, "num_tokens": 54178.0, "step": 25 }, { "entropy": 10.595892238616944, "epoch": 0.0017712700005904232, "grad_norm": 3.234375, "learning_rate": 1.4500000000000002e-05, "loss": 9.7559, "mean_token_accuracy": 0.043279900401830676, "num_tokens": 64390.0, "step": 30 }, { "entropy": 10.602502059936523, "epoch": 0.002066481667355494, "grad_norm": 2.921875, "learning_rate": 1.7000000000000003e-05, "loss": 9.6682, "mean_token_accuracy": 0.043131088465452196, "num_tokens": 73703.0, "step": 35 }, { "entropy": 10.59941120147705, "epoch": 0.0023616933341205643, "grad_norm": 2.6875, "learning_rate": 1.95e-05, "loss": 9.6023, "mean_token_accuracy": 0.04174515642225742, "num_tokens": 83463.0, "step": 40 }, { "entropy": 10.594866466522216, "epoch": 0.002656905000885635, "grad_norm": 2.515625, "learning_rate": 2.2e-05, "loss": 9.6097, "mean_token_accuracy": 0.04398317113518715, "num_tokens": 94129.0, "step": 45 }, { "entropy": 10.567664051055909, "epoch": 0.0029521166676507054, "grad_norm": 2.421875, "learning_rate": 2.4500000000000003e-05, "loss": 9.558, "mean_token_accuracy": 0.043352384492754935, "num_tokens": 105482.0, "step": 50 }, { "entropy": 10.569747066497802, "epoch": 0.003247328334415776, "grad_norm": 2.453125, "learning_rate": 2.7e-05, "loss": 9.4562, "mean_token_accuracy": 0.043072767183184625, "num_tokens": 117342.0, "step": 55 }, { "entropy": 10.565975093841553, "epoch": 0.0035425400011808465, "grad_norm": 2.25, "learning_rate": 2.95e-05, "loss": 9.44, "mean_token_accuracy": 0.050405914708971974, "num_tokens": 127691.0, "step": 60 }, { "entropy": 10.458717250823975, "epoch": 0.0038377516679459172, "grad_norm": 2.46875, "learning_rate": 3.2e-05, "loss": 9.2492, "mean_token_accuracy": 0.05396741069853306, "num_tokens": 138186.0, "step": 65 }, { "entropy": 10.420860767364502, "epoch": 0.004132963334710988, "grad_norm": 2.28125, "learning_rate": 3.4500000000000005e-05, "loss": 9.2326, "mean_token_accuracy": 0.06198026090860367, "num_tokens": 149578.0, "step": 70 }, { "entropy": 10.452775382995606, "epoch": 0.004428175001476058, "grad_norm": 2.21875, "learning_rate": 3.7e-05, "loss": 9.1186, "mean_token_accuracy": 0.06664705500006676, "num_tokens": 160139.0, "step": 75 }, { "entropy": 10.454645347595214, "epoch": 0.004723386668241129, "grad_norm": 2.296875, "learning_rate": 3.95e-05, "loss": 9.037, "mean_token_accuracy": 0.06905781887471676, "num_tokens": 170768.0, "step": 80 }, { "entropy": 10.332771587371827, "epoch": 0.0050185983350062, "grad_norm": 2.3125, "learning_rate": 4.2000000000000004e-05, "loss": 8.8423, "mean_token_accuracy": 0.07480080313980579, "num_tokens": 180702.0, "step": 85 }, { "entropy": 10.249947929382325, "epoch": 0.00531381000177127, "grad_norm": 2.328125, "learning_rate": 4.45e-05, "loss": 8.7738, "mean_token_accuracy": 0.07588593885302544, "num_tokens": 191188.0, "step": 90 }, { "entropy": 10.206402206420899, "epoch": 0.0056090216685363405, "grad_norm": 3.609375, "learning_rate": 4.7000000000000004e-05, "loss": 8.6866, "mean_token_accuracy": 0.07205914407968521, "num_tokens": 201094.0, "step": 95 }, { "entropy": 10.155156707763672, "epoch": 0.005904233335301411, "grad_norm": 3.046875, "learning_rate": 4.9500000000000004e-05, "loss": 8.5626, "mean_token_accuracy": 0.076263627409935, "num_tokens": 211718.0, "step": 100 }, { "entropy": 10.151510620117188, "epoch": 0.006199445002066482, "grad_norm": 2.25, "learning_rate": 5.2e-05, "loss": 8.4394, "mean_token_accuracy": 0.07763982266187668, "num_tokens": 221446.0, "step": 105 }, { "entropy": 10.075346565246582, "epoch": 0.006494656668831552, "grad_norm": 1.84375, "learning_rate": 5.45e-05, "loss": 8.4619, "mean_token_accuracy": 0.07559167668223381, "num_tokens": 232848.0, "step": 110 }, { "entropy": 10.015703201293945, "epoch": 0.006789868335596623, "grad_norm": 1.8046875, "learning_rate": 5.7e-05, "loss": 8.3798, "mean_token_accuracy": 0.0727357666939497, "num_tokens": 244008.0, "step": 115 }, { "entropy": 9.909519577026368, "epoch": 0.007085080002361693, "grad_norm": 1.6171875, "learning_rate": 5.9499999999999996e-05, "loss": 8.1771, "mean_token_accuracy": 0.08037759214639664, "num_tokens": 256211.0, "step": 120 }, { "entropy": 9.780295848846436, "epoch": 0.007380291669126764, "grad_norm": 1.6171875, "learning_rate": 6.2e-05, "loss": 8.1207, "mean_token_accuracy": 0.07622570730745792, "num_tokens": 266688.0, "step": 125 }, { "entropy": 9.564407634735108, "epoch": 0.0076755033358918345, "grad_norm": 1.4609375, "learning_rate": 6.450000000000001e-05, "loss": 7.9156, "mean_token_accuracy": 0.07875195294618606, "num_tokens": 276930.0, "step": 130 }, { "entropy": 9.403815078735352, "epoch": 0.007970715002656906, "grad_norm": 1.5546875, "learning_rate": 6.7e-05, "loss": 7.7559, "mean_token_accuracy": 0.08111081309616566, "num_tokens": 287508.0, "step": 135 }, { "entropy": 9.18376874923706, "epoch": 0.008265926669421976, "grad_norm": 1.4609375, "learning_rate": 6.950000000000001e-05, "loss": 7.6109, "mean_token_accuracy": 0.08215704038739205, "num_tokens": 298021.0, "step": 140 }, { "entropy": 8.89451036453247, "epoch": 0.008561138336187046, "grad_norm": 1.1875, "learning_rate": 7.2e-05, "loss": 7.5483, "mean_token_accuracy": 0.0828169234097004, "num_tokens": 308301.0, "step": 145 }, { "entropy": 8.718179512023926, "epoch": 0.008856350002952117, "grad_norm": 1.734375, "learning_rate": 7.45e-05, "loss": 7.4558, "mean_token_accuracy": 0.07895909734070301, "num_tokens": 319321.0, "step": 150 }, { "entropy": 8.486823749542236, "epoch": 0.009151561669717187, "grad_norm": 1.3125, "learning_rate": 7.7e-05, "loss": 7.5026, "mean_token_accuracy": 0.07978610247373581, "num_tokens": 330926.0, "step": 155 }, { "entropy": 8.353065967559814, "epoch": 0.009446773336482257, "grad_norm": 1.1953125, "learning_rate": 7.950000000000001e-05, "loss": 7.3196, "mean_token_accuracy": 0.08807190880179405, "num_tokens": 341133.0, "step": 160 }, { "entropy": 8.217400360107423, "epoch": 0.009741985003247328, "grad_norm": 1.40625, "learning_rate": 8.2e-05, "loss": 7.3374, "mean_token_accuracy": 0.08286328092217446, "num_tokens": 351897.0, "step": 165 }, { "entropy": 8.153849840164185, "epoch": 0.0100371966700124, "grad_norm": 1.1796875, "learning_rate": 8.450000000000001e-05, "loss": 7.3121, "mean_token_accuracy": 0.08045563325285912, "num_tokens": 362644.0, "step": 170 }, { "entropy": 8.020972394943238, "epoch": 0.01033240833677747, "grad_norm": 1.3515625, "learning_rate": 8.7e-05, "loss": 7.3254, "mean_token_accuracy": 0.08039250746369361, "num_tokens": 373902.0, "step": 175 }, { "entropy": 7.979048109054565, "epoch": 0.01062762000354254, "grad_norm": 1.453125, "learning_rate": 8.95e-05, "loss": 7.2138, "mean_token_accuracy": 0.09198684617877007, "num_tokens": 384828.0, "step": 180 }, { "entropy": 7.852319145202637, "epoch": 0.01092283167030761, "grad_norm": 1.375, "learning_rate": 9.2e-05, "loss": 7.227, "mean_token_accuracy": 0.08049636781215667, "num_tokens": 395103.0, "step": 185 }, { "entropy": 7.785118961334229, "epoch": 0.011218043337072681, "grad_norm": 1.3359375, "learning_rate": 9.45e-05, "loss": 7.1629, "mean_token_accuracy": 0.09020237326622009, "num_tokens": 405283.0, "step": 190 }, { "entropy": 7.803817939758301, "epoch": 0.011513255003837751, "grad_norm": 1.53125, "learning_rate": 9.7e-05, "loss": 7.1458, "mean_token_accuracy": 0.08684369623661041, "num_tokens": 416005.0, "step": 195 }, { "entropy": 7.734343099594116, "epoch": 0.011808466670602822, "grad_norm": 1.28125, "learning_rate": 9.95e-05, "loss": 7.1475, "mean_token_accuracy": 0.08818956762552262, "num_tokens": 426547.0, "step": 200 }, { "entropy": 7.702443599700928, "epoch": 0.012103678337367892, "grad_norm": 1.1484375, "learning_rate": 0.000102, "loss": 7.0801, "mean_token_accuracy": 0.09228792935609817, "num_tokens": 436262.0, "step": 205 }, { "entropy": 7.663109302520752, "epoch": 0.012398890004132964, "grad_norm": 1.578125, "learning_rate": 0.00010449999999999999, "loss": 7.101, "mean_token_accuracy": 0.08728625029325485, "num_tokens": 446899.0, "step": 210 }, { "entropy": 7.67796368598938, "epoch": 0.012694101670898034, "grad_norm": 1.140625, "learning_rate": 0.000107, "loss": 7.1407, "mean_token_accuracy": 0.08986683264374733, "num_tokens": 458224.0, "step": 215 }, { "entropy": 7.675721073150635, "epoch": 0.012989313337663105, "grad_norm": 1.2109375, "learning_rate": 0.0001095, "loss": 7.0746, "mean_token_accuracy": 0.08677861616015434, "num_tokens": 469306.0, "step": 220 }, { "entropy": 7.5801355838775635, "epoch": 0.013284525004428175, "grad_norm": 1.6953125, "learning_rate": 0.000112, "loss": 7.0774, "mean_token_accuracy": 0.0875390887260437, "num_tokens": 478685.0, "step": 225 }, { "entropy": 7.611648845672607, "epoch": 0.013579736671193245, "grad_norm": 1.296875, "learning_rate": 0.0001145, "loss": 7.0051, "mean_token_accuracy": 0.09632268622517585, "num_tokens": 489376.0, "step": 230 }, { "entropy": 7.525375843048096, "epoch": 0.013874948337958316, "grad_norm": 1.2109375, "learning_rate": 0.00011700000000000001, "loss": 7.0117, "mean_token_accuracy": 0.0921477772295475, "num_tokens": 500260.0, "step": 235 }, { "entropy": 7.426083660125732, "epoch": 0.014170160004723386, "grad_norm": 1.265625, "learning_rate": 0.00011949999999999999, "loss": 7.0023, "mean_token_accuracy": 0.09566814824938774, "num_tokens": 511953.0, "step": 240 }, { "entropy": 7.632671928405761, "epoch": 0.014465371671488458, "grad_norm": 1.3359375, "learning_rate": 0.000122, "loss": 7.1873, "mean_token_accuracy": 0.08889849931001663, "num_tokens": 523055.0, "step": 245 }, { "entropy": 7.509737873077393, "epoch": 0.014760583338253528, "grad_norm": 1.296875, "learning_rate": 0.0001245, "loss": 6.9947, "mean_token_accuracy": 0.09188270270824432, "num_tokens": 534337.0, "step": 250 }, { "entropy": 7.46486268043518, "epoch": 0.015055795005018599, "grad_norm": 1.421875, "learning_rate": 0.000127, "loss": 6.9868, "mean_token_accuracy": 0.09533577933907508, "num_tokens": 545189.0, "step": 255 }, { "entropy": 7.538589096069336, "epoch": 0.015351006671783669, "grad_norm": 1.1875, "learning_rate": 0.0001295, "loss": 7.0231, "mean_token_accuracy": 0.09476621299982071, "num_tokens": 555506.0, "step": 260 }, { "entropy": 7.462624025344849, "epoch": 0.01564621833854874, "grad_norm": 1.1328125, "learning_rate": 0.000132, "loss": 6.9308, "mean_token_accuracy": 0.0939927913248539, "num_tokens": 565936.0, "step": 265 }, { "entropy": 7.461940479278565, "epoch": 0.01594143000531381, "grad_norm": 1.1796875, "learning_rate": 0.00013450000000000002, "loss": 7.033, "mean_token_accuracy": 0.09217713922262191, "num_tokens": 575691.0, "step": 270 }, { "entropy": 7.481535339355469, "epoch": 0.01623664167207888, "grad_norm": 1.2265625, "learning_rate": 0.00013700000000000002, "loss": 6.9921, "mean_token_accuracy": 0.09237621873617172, "num_tokens": 586170.0, "step": 275 }, { "entropy": 7.461501359939575, "epoch": 0.016531853338843952, "grad_norm": 1.453125, "learning_rate": 0.0001395, "loss": 6.9755, "mean_token_accuracy": 0.09221490249037742, "num_tokens": 596458.0, "step": 280 }, { "entropy": 7.365391731262207, "epoch": 0.016827065005609022, "grad_norm": 1.125, "learning_rate": 0.00014199999999999998, "loss": 6.9201, "mean_token_accuracy": 0.08767134547233582, "num_tokens": 606214.0, "step": 285 }, { "entropy": 7.444003868103027, "epoch": 0.017122276672374093, "grad_norm": 1.4296875, "learning_rate": 0.0001445, "loss": 6.9609, "mean_token_accuracy": 0.09265968054533005, "num_tokens": 617074.0, "step": 290 }, { "entropy": 7.425234937667847, "epoch": 0.017417488339139163, "grad_norm": 1.3125, "learning_rate": 0.000147, "loss": 6.998, "mean_token_accuracy": 0.08931455463171005, "num_tokens": 628057.0, "step": 295 }, { "entropy": 7.338685989379883, "epoch": 0.017712700005904233, "grad_norm": 1.1171875, "learning_rate": 0.0001495, "loss": 6.9406, "mean_token_accuracy": 0.09267161414027214, "num_tokens": 638150.0, "step": 300 }, { "entropy": 7.352516222000122, "epoch": 0.018007911672669304, "grad_norm": 1.25, "learning_rate": 0.000152, "loss": 6.8101, "mean_token_accuracy": 0.10107955634593964, "num_tokens": 648377.0, "step": 305 }, { "entropy": 7.305817174911499, "epoch": 0.018303123339434374, "grad_norm": 1.2734375, "learning_rate": 0.00015450000000000001, "loss": 6.8875, "mean_token_accuracy": 0.09907981753349304, "num_tokens": 658777.0, "step": 310 }, { "entropy": 7.311208295822143, "epoch": 0.018598335006199444, "grad_norm": 1.2734375, "learning_rate": 0.000157, "loss": 6.9908, "mean_token_accuracy": 0.09044492170214653, "num_tokens": 669105.0, "step": 315 }, { "entropy": 7.355552816390992, "epoch": 0.018893546672964515, "grad_norm": 1.109375, "learning_rate": 0.0001595, "loss": 6.8608, "mean_token_accuracy": 0.09483690708875656, "num_tokens": 679294.0, "step": 320 }, { "entropy": 7.222180414199829, "epoch": 0.019188758339729585, "grad_norm": 1.125, "learning_rate": 0.000162, "loss": 6.829, "mean_token_accuracy": 0.09829319342970848, "num_tokens": 690495.0, "step": 325 }, { "entropy": 7.220251893997192, "epoch": 0.019483970006494655, "grad_norm": 1.1640625, "learning_rate": 0.00016450000000000001, "loss": 6.8432, "mean_token_accuracy": 0.09830230325460435, "num_tokens": 701002.0, "step": 330 }, { "entropy": 7.257207536697388, "epoch": 0.019779181673259726, "grad_norm": 1.40625, "learning_rate": 0.00016700000000000002, "loss": 6.753, "mean_token_accuracy": 0.09737947657704353, "num_tokens": 711488.0, "step": 335 }, { "entropy": 7.091268253326416, "epoch": 0.0200743933400248, "grad_norm": 1.203125, "learning_rate": 0.00016950000000000003, "loss": 6.7863, "mean_token_accuracy": 0.09428932666778564, "num_tokens": 722637.0, "step": 340 }, { "entropy": 7.228825855255127, "epoch": 0.02036960500678987, "grad_norm": 1.2734375, "learning_rate": 0.00017199999999999998, "loss": 6.8498, "mean_token_accuracy": 0.09802942052483558, "num_tokens": 733212.0, "step": 345 }, { "entropy": 7.253208494186401, "epoch": 0.02066481667355494, "grad_norm": 1.2578125, "learning_rate": 0.00017449999999999999, "loss": 6.7639, "mean_token_accuracy": 0.09950084388256072, "num_tokens": 743602.0, "step": 350 }, { "entropy": 7.207983446121216, "epoch": 0.02096002834032001, "grad_norm": 1.59375, "learning_rate": 0.000177, "loss": 6.8151, "mean_token_accuracy": 0.09879285991191863, "num_tokens": 754094.0, "step": 355 }, { "entropy": 7.099168062210083, "epoch": 0.02125524000708508, "grad_norm": 1.1953125, "learning_rate": 0.0001795, "loss": 6.7724, "mean_token_accuracy": 0.09406139552593232, "num_tokens": 763823.0, "step": 360 }, { "entropy": 7.163098907470703, "epoch": 0.02155045167385015, "grad_norm": 1.25, "learning_rate": 0.000182, "loss": 6.7096, "mean_token_accuracy": 0.10476447790861129, "num_tokens": 774128.0, "step": 365 }, { "entropy": 7.131285381317139, "epoch": 0.02184566334061522, "grad_norm": 1.375, "learning_rate": 0.0001845, "loss": 6.7883, "mean_token_accuracy": 0.09998859390616417, "num_tokens": 784292.0, "step": 370 }, { "entropy": 7.133191156387329, "epoch": 0.02214087500738029, "grad_norm": 1.125, "learning_rate": 0.000187, "loss": 6.7794, "mean_token_accuracy": 0.09937844276428223, "num_tokens": 795437.0, "step": 375 }, { "entropy": 7.124974298477173, "epoch": 0.022436086674145362, "grad_norm": 1.1875, "learning_rate": 0.0001895, "loss": 6.687, "mean_token_accuracy": 0.10222809389233589, "num_tokens": 806543.0, "step": 380 }, { "entropy": 7.1218994140625, "epoch": 0.022731298340910432, "grad_norm": 1.34375, "learning_rate": 0.000192, "loss": 6.843, "mean_token_accuracy": 0.09876690059900284, "num_tokens": 817179.0, "step": 385 }, { "entropy": 7.118319416046143, "epoch": 0.023026510007675503, "grad_norm": 1.2421875, "learning_rate": 0.0001945, "loss": 6.7608, "mean_token_accuracy": 0.10439011678099633, "num_tokens": 826749.0, "step": 390 }, { "entropy": 7.08788104057312, "epoch": 0.023321721674440573, "grad_norm": 1.1796875, "learning_rate": 0.00019700000000000002, "loss": 6.798, "mean_token_accuracy": 0.09762646481394768, "num_tokens": 838807.0, "step": 395 }, { "entropy": 7.131559801101685, "epoch": 0.023616933341205643, "grad_norm": 1.2109375, "learning_rate": 0.00019950000000000002, "loss": 6.7766, "mean_token_accuracy": 0.10133634880185127, "num_tokens": 849651.0, "step": 400 }, { "entropy": 7.159732913970947, "epoch": 0.023912145007970714, "grad_norm": 1.28125, "learning_rate": 0.000202, "loss": 6.8434, "mean_token_accuracy": 0.09272509887814522, "num_tokens": 859753.0, "step": 405 }, { "entropy": 7.0073809146881105, "epoch": 0.024207356674735784, "grad_norm": 1.1875, "learning_rate": 0.00020449999999999998, "loss": 6.7134, "mean_token_accuracy": 0.10226179882884026, "num_tokens": 869904.0, "step": 410 }, { "entropy": 6.957417392730713, "epoch": 0.024502568341500858, "grad_norm": 1.0390625, "learning_rate": 0.000207, "loss": 6.73, "mean_token_accuracy": 0.10192711651325226, "num_tokens": 880948.0, "step": 415 }, { "entropy": 7.170308446884155, "epoch": 0.024797780008265928, "grad_norm": 1.046875, "learning_rate": 0.0002095, "loss": 6.7966, "mean_token_accuracy": 0.09502052217721939, "num_tokens": 892331.0, "step": 420 }, { "entropy": 6.980013370513916, "epoch": 0.025092991675031, "grad_norm": 1.21875, "learning_rate": 0.000212, "loss": 6.628, "mean_token_accuracy": 0.1050586886703968, "num_tokens": 901691.0, "step": 425 }, { "entropy": 7.007831001281739, "epoch": 0.02538820334179607, "grad_norm": 1.1875, "learning_rate": 0.0002145, "loss": 6.6769, "mean_token_accuracy": 0.10150302425026894, "num_tokens": 912495.0, "step": 430 }, { "entropy": 7.010691833496094, "epoch": 0.02568341500856114, "grad_norm": 1.2421875, "learning_rate": 0.00021700000000000002, "loss": 6.636, "mean_token_accuracy": 0.1017840936779976, "num_tokens": 923420.0, "step": 435 }, { "entropy": 6.8785758972167965, "epoch": 0.02597862667532621, "grad_norm": 1.1875, "learning_rate": 0.0002195, "loss": 6.6396, "mean_token_accuracy": 0.09978873506188393, "num_tokens": 933598.0, "step": 440 }, { "entropy": 6.98797607421875, "epoch": 0.02627383834209128, "grad_norm": 1.3046875, "learning_rate": 0.000222, "loss": 6.7659, "mean_token_accuracy": 0.1045355699956417, "num_tokens": 943229.0, "step": 445 }, { "entropy": 6.983278131484985, "epoch": 0.02656905000885635, "grad_norm": 1.0625, "learning_rate": 0.0002245, "loss": 6.6247, "mean_token_accuracy": 0.10298437029123306, "num_tokens": 954425.0, "step": 450 }, { "entropy": 7.073006629943848, "epoch": 0.02686426167562142, "grad_norm": 1.3359375, "learning_rate": 0.00022700000000000002, "loss": 6.745, "mean_token_accuracy": 0.10184216126799583, "num_tokens": 965516.0, "step": 455 }, { "entropy": 6.900727653503418, "epoch": 0.02715947334238649, "grad_norm": 1.0390625, "learning_rate": 0.00022950000000000002, "loss": 6.6285, "mean_token_accuracy": 0.10302256718277931, "num_tokens": 976469.0, "step": 460 }, { "entropy": 6.955856561660767, "epoch": 0.02745468500915156, "grad_norm": 1.140625, "learning_rate": 0.00023200000000000003, "loss": 6.7139, "mean_token_accuracy": 0.09732916429638863, "num_tokens": 986946.0, "step": 465 }, { "entropy": 6.982401418685913, "epoch": 0.02774989667591663, "grad_norm": 1.1796875, "learning_rate": 0.00023449999999999998, "loss": 6.612, "mean_token_accuracy": 0.10779485702514649, "num_tokens": 997101.0, "step": 470 }, { "entropy": 6.9505868434906, "epoch": 0.0280451083426817, "grad_norm": 1.2890625, "learning_rate": 0.000237, "loss": 6.7346, "mean_token_accuracy": 0.10266673490405083, "num_tokens": 1007866.0, "step": 475 }, { "entropy": 7.019359874725342, "epoch": 0.028340320009446772, "grad_norm": 1.3203125, "learning_rate": 0.0002395, "loss": 6.7355, "mean_token_accuracy": 0.09643693268299103, "num_tokens": 1019377.0, "step": 480 }, { "entropy": 6.936902332305908, "epoch": 0.028635531676211842, "grad_norm": 1.28125, "learning_rate": 0.000242, "loss": 6.7267, "mean_token_accuracy": 0.09898768290877343, "num_tokens": 1031278.0, "step": 485 }, { "entropy": 6.772035408020019, "epoch": 0.028930743342976916, "grad_norm": 1.25, "learning_rate": 0.0002445, "loss": 6.5192, "mean_token_accuracy": 0.1116688534617424, "num_tokens": 1041663.0, "step": 490 }, { "entropy": 6.908066129684448, "epoch": 0.029225955009741986, "grad_norm": 1.203125, "learning_rate": 0.000247, "loss": 6.5969, "mean_token_accuracy": 0.10450899600982666, "num_tokens": 1052286.0, "step": 495 }, { "entropy": 6.807862234115601, "epoch": 0.029521166676507057, "grad_norm": 1.3359375, "learning_rate": 0.0002495, "loss": 6.6629, "mean_token_accuracy": 0.10684632584452629, "num_tokens": 1061945.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1538340507648000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }