{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.05904233335301411, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.69201593399048, "epoch": 0.00029521166676507054, "grad_norm": 12.6875, "learning_rate": 2e-06, "loss": 10.8334, "mean_token_accuracy": 0.0, "num_tokens": 10275.0, "step": 5 }, { "entropy": 10.691933250427246, "epoch": 0.0005904233335301411, "grad_norm": 13.1875, "learning_rate": 4.5e-06, "loss": 10.7937, "mean_token_accuracy": 0.0, "num_tokens": 22020.0, "step": 10 }, { "entropy": 10.691065883636474, "epoch": 0.0008856350002952116, "grad_norm": 9.5625, "learning_rate": 7e-06, "loss": 10.5174, "mean_token_accuracy": 0.021099633118137718, "num_tokens": 32612.0, "step": 15 }, { "entropy": 10.68113021850586, "epoch": 0.0011808466670602822, "grad_norm": 6.21875, "learning_rate": 9.5e-06, "loss": 10.1848, "mean_token_accuracy": 0.04274020157754421, "num_tokens": 43270.0, "step": 20 }, { "entropy": 10.621037483215332, "epoch": 0.0014760583338253527, "grad_norm": 3.84375, "learning_rate": 1.2e-05, "loss": 9.9202, "mean_token_accuracy": 0.04267438128590584, "num_tokens": 54178.0, "step": 25 }, { "entropy": 10.595892238616944, "epoch": 0.0017712700005904232, "grad_norm": 3.234375, "learning_rate": 1.4500000000000002e-05, "loss": 9.7559, "mean_token_accuracy": 0.043279900401830676, "num_tokens": 64390.0, "step": 30 }, { "entropy": 10.602502059936523, "epoch": 0.002066481667355494, "grad_norm": 2.921875, "learning_rate": 1.7000000000000003e-05, "loss": 9.6682, "mean_token_accuracy": 0.043131088465452196, "num_tokens": 73703.0, "step": 35 }, { "entropy": 10.59941120147705, "epoch": 0.0023616933341205643, "grad_norm": 2.6875, "learning_rate": 1.95e-05, "loss": 9.6023, "mean_token_accuracy": 0.04174515642225742, "num_tokens": 83463.0, "step": 40 }, { "entropy": 10.594866466522216, "epoch": 0.002656905000885635, "grad_norm": 2.515625, "learning_rate": 2.2e-05, "loss": 9.6097, "mean_token_accuracy": 0.04398317113518715, "num_tokens": 94129.0, "step": 45 }, { "entropy": 10.567664051055909, "epoch": 0.0029521166676507054, "grad_norm": 2.421875, "learning_rate": 2.4500000000000003e-05, "loss": 9.558, "mean_token_accuracy": 0.043352384492754935, "num_tokens": 105482.0, "step": 50 }, { "entropy": 10.569747066497802, "epoch": 0.003247328334415776, "grad_norm": 2.453125, "learning_rate": 2.7e-05, "loss": 9.4562, "mean_token_accuracy": 0.043072767183184625, "num_tokens": 117342.0, "step": 55 }, { "entropy": 10.565975093841553, "epoch": 0.0035425400011808465, "grad_norm": 2.25, "learning_rate": 2.95e-05, "loss": 9.44, "mean_token_accuracy": 0.050405914708971974, "num_tokens": 127691.0, "step": 60 }, { "entropy": 10.458717250823975, "epoch": 0.0038377516679459172, "grad_norm": 2.46875, "learning_rate": 3.2e-05, "loss": 9.2492, "mean_token_accuracy": 0.05396741069853306, "num_tokens": 138186.0, "step": 65 }, { "entropy": 10.420860767364502, "epoch": 0.004132963334710988, "grad_norm": 2.28125, "learning_rate": 3.4500000000000005e-05, "loss": 9.2326, "mean_token_accuracy": 0.06198026090860367, "num_tokens": 149578.0, "step": 70 }, { "entropy": 10.452775382995606, "epoch": 0.004428175001476058, "grad_norm": 2.21875, "learning_rate": 3.7e-05, "loss": 9.1186, "mean_token_accuracy": 0.06664705500006676, "num_tokens": 160139.0, "step": 75 }, { "entropy": 10.454645347595214, "epoch": 0.004723386668241129, "grad_norm": 2.296875, "learning_rate": 3.95e-05, "loss": 9.037, "mean_token_accuracy": 0.06905781887471676, "num_tokens": 170768.0, "step": 80 }, { "entropy": 10.332771587371827, "epoch": 0.0050185983350062, "grad_norm": 2.3125, "learning_rate": 4.2000000000000004e-05, "loss": 8.8423, "mean_token_accuracy": 0.07480080313980579, "num_tokens": 180702.0, "step": 85 }, { "entropy": 10.249947929382325, "epoch": 0.00531381000177127, "grad_norm": 2.328125, "learning_rate": 4.45e-05, "loss": 8.7738, "mean_token_accuracy": 0.07588593885302544, "num_tokens": 191188.0, "step": 90 }, { "entropy": 10.206402206420899, "epoch": 0.0056090216685363405, "grad_norm": 3.609375, "learning_rate": 4.7000000000000004e-05, "loss": 8.6866, "mean_token_accuracy": 0.07205914407968521, "num_tokens": 201094.0, "step": 95 }, { "entropy": 10.155156707763672, "epoch": 0.005904233335301411, "grad_norm": 3.046875, "learning_rate": 4.9500000000000004e-05, "loss": 8.5626, "mean_token_accuracy": 0.076263627409935, "num_tokens": 211718.0, "step": 100 }, { "entropy": 10.151510620117188, "epoch": 0.006199445002066482, "grad_norm": 2.25, "learning_rate": 5.2e-05, "loss": 8.4394, "mean_token_accuracy": 0.07763982266187668, "num_tokens": 221446.0, "step": 105 }, { "entropy": 10.075346565246582, "epoch": 0.006494656668831552, "grad_norm": 1.84375, "learning_rate": 5.45e-05, "loss": 8.4619, "mean_token_accuracy": 0.07559167668223381, "num_tokens": 232848.0, "step": 110 }, { "entropy": 10.015703201293945, "epoch": 0.006789868335596623, "grad_norm": 1.8046875, "learning_rate": 5.7e-05, "loss": 8.3798, "mean_token_accuracy": 0.0727357666939497, "num_tokens": 244008.0, "step": 115 }, { "entropy": 9.909519577026368, "epoch": 0.007085080002361693, "grad_norm": 1.6171875, "learning_rate": 5.9499999999999996e-05, "loss": 8.1771, "mean_token_accuracy": 0.08037759214639664, "num_tokens": 256211.0, "step": 120 }, { "entropy": 9.780295848846436, "epoch": 0.007380291669126764, "grad_norm": 1.6171875, "learning_rate": 6.2e-05, "loss": 8.1207, "mean_token_accuracy": 0.07622570730745792, "num_tokens": 266688.0, "step": 125 }, { "entropy": 9.564407634735108, "epoch": 0.0076755033358918345, "grad_norm": 1.4609375, "learning_rate": 6.450000000000001e-05, "loss": 7.9156, "mean_token_accuracy": 0.07875195294618606, "num_tokens": 276930.0, "step": 130 }, { "entropy": 9.403815078735352, "epoch": 0.007970715002656906, "grad_norm": 1.5546875, "learning_rate": 6.7e-05, "loss": 7.7559, "mean_token_accuracy": 0.08111081309616566, "num_tokens": 287508.0, "step": 135 }, { "entropy": 9.18376874923706, "epoch": 0.008265926669421976, "grad_norm": 1.4609375, "learning_rate": 6.950000000000001e-05, "loss": 7.6109, "mean_token_accuracy": 0.08215704038739205, "num_tokens": 298021.0, "step": 140 }, { "entropy": 8.89451036453247, "epoch": 0.008561138336187046, "grad_norm": 1.1875, "learning_rate": 7.2e-05, "loss": 7.5483, "mean_token_accuracy": 0.0828169234097004, "num_tokens": 308301.0, "step": 145 }, { "entropy": 8.718179512023926, "epoch": 0.008856350002952117, "grad_norm": 1.734375, "learning_rate": 7.45e-05, "loss": 7.4558, "mean_token_accuracy": 0.07895909734070301, "num_tokens": 319321.0, "step": 150 }, { "entropy": 8.486823749542236, "epoch": 0.009151561669717187, "grad_norm": 1.3125, "learning_rate": 7.7e-05, "loss": 7.5026, "mean_token_accuracy": 0.07978610247373581, "num_tokens": 330926.0, "step": 155 }, { "entropy": 8.353065967559814, "epoch": 0.009446773336482257, "grad_norm": 1.1953125, "learning_rate": 7.950000000000001e-05, "loss": 7.3196, "mean_token_accuracy": 0.08807190880179405, "num_tokens": 341133.0, "step": 160 }, { "entropy": 8.217400360107423, "epoch": 0.009741985003247328, "grad_norm": 1.40625, "learning_rate": 8.2e-05, "loss": 7.3374, "mean_token_accuracy": 0.08286328092217446, "num_tokens": 351897.0, "step": 165 }, { "entropy": 8.153849840164185, "epoch": 0.0100371966700124, "grad_norm": 1.1796875, "learning_rate": 8.450000000000001e-05, "loss": 7.3121, "mean_token_accuracy": 0.08045563325285912, "num_tokens": 362644.0, "step": 170 }, { "entropy": 8.020972394943238, "epoch": 0.01033240833677747, "grad_norm": 1.3515625, "learning_rate": 8.7e-05, "loss": 7.3254, "mean_token_accuracy": 0.08039250746369361, "num_tokens": 373902.0, "step": 175 }, { "entropy": 7.979048109054565, "epoch": 0.01062762000354254, "grad_norm": 1.453125, "learning_rate": 8.95e-05, "loss": 7.2138, "mean_token_accuracy": 0.09198684617877007, "num_tokens": 384828.0, "step": 180 }, { "entropy": 7.852319145202637, "epoch": 0.01092283167030761, "grad_norm": 1.375, "learning_rate": 9.2e-05, "loss": 7.227, "mean_token_accuracy": 0.08049636781215667, "num_tokens": 395103.0, "step": 185 }, { "entropy": 7.785118961334229, "epoch": 0.011218043337072681, "grad_norm": 1.3359375, "learning_rate": 9.45e-05, "loss": 7.1629, "mean_token_accuracy": 0.09020237326622009, "num_tokens": 405283.0, "step": 190 }, { "entropy": 7.803817939758301, "epoch": 0.011513255003837751, "grad_norm": 1.53125, "learning_rate": 9.7e-05, "loss": 7.1458, "mean_token_accuracy": 0.08684369623661041, "num_tokens": 416005.0, "step": 195 }, { "entropy": 7.734343099594116, "epoch": 0.011808466670602822, "grad_norm": 1.28125, "learning_rate": 9.95e-05, "loss": 7.1475, "mean_token_accuracy": 0.08818956762552262, "num_tokens": 426547.0, "step": 200 }, { "entropy": 7.702443599700928, "epoch": 0.012103678337367892, "grad_norm": 1.1484375, "learning_rate": 0.000102, "loss": 7.0801, "mean_token_accuracy": 0.09228792935609817, "num_tokens": 436262.0, "step": 205 }, { "entropy": 7.663109302520752, "epoch": 0.012398890004132964, "grad_norm": 1.578125, "learning_rate": 0.00010449999999999999, "loss": 7.101, "mean_token_accuracy": 0.08728625029325485, "num_tokens": 446899.0, "step": 210 }, { "entropy": 7.67796368598938, "epoch": 0.012694101670898034, "grad_norm": 1.140625, "learning_rate": 0.000107, "loss": 7.1407, "mean_token_accuracy": 0.08986683264374733, "num_tokens": 458224.0, "step": 215 }, { "entropy": 7.675721073150635, "epoch": 0.012989313337663105, "grad_norm": 1.2109375, "learning_rate": 0.0001095, "loss": 7.0746, "mean_token_accuracy": 0.08677861616015434, "num_tokens": 469306.0, "step": 220 }, { "entropy": 7.5801355838775635, "epoch": 0.013284525004428175, "grad_norm": 1.6953125, "learning_rate": 0.000112, "loss": 7.0774, "mean_token_accuracy": 0.0875390887260437, "num_tokens": 478685.0, "step": 225 }, { "entropy": 7.611648845672607, "epoch": 0.013579736671193245, "grad_norm": 1.296875, "learning_rate": 0.0001145, "loss": 7.0051, "mean_token_accuracy": 0.09632268622517585, "num_tokens": 489376.0, "step": 230 }, { "entropy": 7.525375843048096, "epoch": 0.013874948337958316, "grad_norm": 1.2109375, "learning_rate": 0.00011700000000000001, "loss": 7.0117, "mean_token_accuracy": 0.0921477772295475, "num_tokens": 500260.0, "step": 235 }, { "entropy": 7.426083660125732, "epoch": 0.014170160004723386, "grad_norm": 1.265625, "learning_rate": 0.00011949999999999999, "loss": 7.0023, "mean_token_accuracy": 0.09566814824938774, "num_tokens": 511953.0, "step": 240 }, { "entropy": 7.632671928405761, "epoch": 0.014465371671488458, "grad_norm": 1.3359375, "learning_rate": 0.000122, "loss": 7.1873, "mean_token_accuracy": 0.08889849931001663, "num_tokens": 523055.0, "step": 245 }, { "entropy": 7.509737873077393, "epoch": 0.014760583338253528, "grad_norm": 1.296875, "learning_rate": 0.0001245, "loss": 6.9947, "mean_token_accuracy": 0.09188270270824432, "num_tokens": 534337.0, "step": 250 }, { "entropy": 7.46486268043518, "epoch": 0.015055795005018599, "grad_norm": 1.421875, "learning_rate": 0.000127, "loss": 6.9868, "mean_token_accuracy": 0.09533577933907508, "num_tokens": 545189.0, "step": 255 }, { "entropy": 7.538589096069336, "epoch": 0.015351006671783669, "grad_norm": 1.1875, "learning_rate": 0.0001295, "loss": 7.0231, "mean_token_accuracy": 0.09476621299982071, "num_tokens": 555506.0, "step": 260 }, { "entropy": 7.462624025344849, "epoch": 0.01564621833854874, "grad_norm": 1.1328125, "learning_rate": 0.000132, "loss": 6.9308, "mean_token_accuracy": 0.0939927913248539, "num_tokens": 565936.0, "step": 265 }, { "entropy": 7.461940479278565, "epoch": 0.01594143000531381, "grad_norm": 1.1796875, "learning_rate": 0.00013450000000000002, "loss": 7.033, "mean_token_accuracy": 0.09217713922262191, "num_tokens": 575691.0, "step": 270 }, { "entropy": 7.481535339355469, "epoch": 0.01623664167207888, "grad_norm": 1.2265625, "learning_rate": 0.00013700000000000002, "loss": 6.9921, "mean_token_accuracy": 0.09237621873617172, "num_tokens": 586170.0, "step": 275 }, { "entropy": 7.461501359939575, "epoch": 0.016531853338843952, "grad_norm": 1.453125, "learning_rate": 0.0001395, "loss": 6.9755, "mean_token_accuracy": 0.09221490249037742, "num_tokens": 596458.0, "step": 280 }, { "entropy": 7.365391731262207, "epoch": 0.016827065005609022, "grad_norm": 1.125, "learning_rate": 0.00014199999999999998, "loss": 6.9201, "mean_token_accuracy": 0.08767134547233582, "num_tokens": 606214.0, "step": 285 }, { "entropy": 7.444003868103027, "epoch": 0.017122276672374093, "grad_norm": 1.4296875, "learning_rate": 0.0001445, "loss": 6.9609, "mean_token_accuracy": 0.09265968054533005, "num_tokens": 617074.0, "step": 290 }, { "entropy": 7.425234937667847, "epoch": 0.017417488339139163, "grad_norm": 1.3125, "learning_rate": 0.000147, "loss": 6.998, "mean_token_accuracy": 0.08931455463171005, "num_tokens": 628057.0, "step": 295 }, { "entropy": 7.338685989379883, "epoch": 0.017712700005904233, "grad_norm": 1.1171875, "learning_rate": 0.0001495, "loss": 6.9406, "mean_token_accuracy": 0.09267161414027214, "num_tokens": 638150.0, "step": 300 }, { "entropy": 7.352516222000122, "epoch": 0.018007911672669304, "grad_norm": 1.25, "learning_rate": 0.000152, "loss": 6.8101, "mean_token_accuracy": 0.10107955634593964, "num_tokens": 648377.0, "step": 305 }, { "entropy": 7.305817174911499, "epoch": 0.018303123339434374, "grad_norm": 1.2734375, "learning_rate": 0.00015450000000000001, "loss": 6.8875, "mean_token_accuracy": 0.09907981753349304, "num_tokens": 658777.0, "step": 310 }, { "entropy": 7.311208295822143, "epoch": 0.018598335006199444, "grad_norm": 1.2734375, "learning_rate": 0.000157, "loss": 6.9908, "mean_token_accuracy": 0.09044492170214653, "num_tokens": 669105.0, "step": 315 }, { "entropy": 7.355552816390992, "epoch": 0.018893546672964515, "grad_norm": 1.109375, "learning_rate": 0.0001595, "loss": 6.8608, "mean_token_accuracy": 0.09483690708875656, "num_tokens": 679294.0, "step": 320 }, { "entropy": 7.222180414199829, "epoch": 0.019188758339729585, "grad_norm": 1.125, "learning_rate": 0.000162, "loss": 6.829, "mean_token_accuracy": 0.09829319342970848, "num_tokens": 690495.0, "step": 325 }, { "entropy": 7.220251893997192, "epoch": 0.019483970006494655, "grad_norm": 1.1640625, "learning_rate": 0.00016450000000000001, "loss": 6.8432, "mean_token_accuracy": 0.09830230325460435, "num_tokens": 701002.0, "step": 330 }, { "entropy": 7.257207536697388, "epoch": 0.019779181673259726, "grad_norm": 1.40625, "learning_rate": 0.00016700000000000002, "loss": 6.753, "mean_token_accuracy": 0.09737947657704353, "num_tokens": 711488.0, "step": 335 }, { "entropy": 7.091268253326416, "epoch": 0.0200743933400248, "grad_norm": 1.203125, "learning_rate": 0.00016950000000000003, "loss": 6.7863, "mean_token_accuracy": 0.09428932666778564, "num_tokens": 722637.0, "step": 340 }, { "entropy": 7.228825855255127, "epoch": 0.02036960500678987, "grad_norm": 1.2734375, "learning_rate": 0.00017199999999999998, "loss": 6.8498, "mean_token_accuracy": 0.09802942052483558, "num_tokens": 733212.0, "step": 345 }, { "entropy": 7.253208494186401, "epoch": 0.02066481667355494, "grad_norm": 1.2578125, "learning_rate": 0.00017449999999999999, "loss": 6.7639, "mean_token_accuracy": 0.09950084388256072, "num_tokens": 743602.0, "step": 350 }, { "entropy": 7.207983446121216, "epoch": 0.02096002834032001, "grad_norm": 1.59375, "learning_rate": 0.000177, "loss": 6.8151, "mean_token_accuracy": 0.09879285991191863, "num_tokens": 754094.0, "step": 355 }, { "entropy": 7.099168062210083, "epoch": 0.02125524000708508, "grad_norm": 1.1953125, "learning_rate": 0.0001795, "loss": 6.7724, "mean_token_accuracy": 0.09406139552593232, "num_tokens": 763823.0, "step": 360 }, { "entropy": 7.163098907470703, "epoch": 0.02155045167385015, "grad_norm": 1.25, "learning_rate": 0.000182, "loss": 6.7096, "mean_token_accuracy": 0.10476447790861129, "num_tokens": 774128.0, "step": 365 }, { "entropy": 7.131285381317139, "epoch": 0.02184566334061522, "grad_norm": 1.375, "learning_rate": 0.0001845, "loss": 6.7883, "mean_token_accuracy": 0.09998859390616417, "num_tokens": 784292.0, "step": 370 }, { "entropy": 7.133191156387329, "epoch": 0.02214087500738029, "grad_norm": 1.125, "learning_rate": 0.000187, "loss": 6.7794, "mean_token_accuracy": 0.09937844276428223, "num_tokens": 795437.0, "step": 375 }, { "entropy": 7.124974298477173, "epoch": 0.022436086674145362, "grad_norm": 1.1875, "learning_rate": 0.0001895, "loss": 6.687, "mean_token_accuracy": 0.10222809389233589, "num_tokens": 806543.0, "step": 380 }, { "entropy": 7.1218994140625, "epoch": 0.022731298340910432, "grad_norm": 1.34375, "learning_rate": 0.000192, "loss": 6.843, "mean_token_accuracy": 0.09876690059900284, "num_tokens": 817179.0, "step": 385 }, { "entropy": 7.118319416046143, "epoch": 0.023026510007675503, "grad_norm": 1.2421875, "learning_rate": 0.0001945, "loss": 6.7608, "mean_token_accuracy": 0.10439011678099633, "num_tokens": 826749.0, "step": 390 }, { "entropy": 7.08788104057312, "epoch": 0.023321721674440573, "grad_norm": 1.1796875, "learning_rate": 0.00019700000000000002, "loss": 6.798, "mean_token_accuracy": 0.09762646481394768, "num_tokens": 838807.0, "step": 395 }, { "entropy": 7.131559801101685, "epoch": 0.023616933341205643, "grad_norm": 1.2109375, "learning_rate": 0.00019950000000000002, "loss": 6.7766, "mean_token_accuracy": 0.10133634880185127, "num_tokens": 849651.0, "step": 400 }, { "entropy": 7.159732913970947, "epoch": 0.023912145007970714, "grad_norm": 1.28125, "learning_rate": 0.000202, "loss": 6.8434, "mean_token_accuracy": 0.09272509887814522, "num_tokens": 859753.0, "step": 405 }, { "entropy": 7.0073809146881105, "epoch": 0.024207356674735784, "grad_norm": 1.1875, "learning_rate": 0.00020449999999999998, "loss": 6.7134, "mean_token_accuracy": 0.10226179882884026, "num_tokens": 869904.0, "step": 410 }, { "entropy": 6.957417392730713, "epoch": 0.024502568341500858, "grad_norm": 1.0390625, "learning_rate": 0.000207, "loss": 6.73, "mean_token_accuracy": 0.10192711651325226, "num_tokens": 880948.0, "step": 415 }, { "entropy": 7.170308446884155, "epoch": 0.024797780008265928, "grad_norm": 1.046875, "learning_rate": 0.0002095, "loss": 6.7966, "mean_token_accuracy": 0.09502052217721939, "num_tokens": 892331.0, "step": 420 }, { "entropy": 6.980013370513916, "epoch": 0.025092991675031, "grad_norm": 1.21875, "learning_rate": 0.000212, "loss": 6.628, "mean_token_accuracy": 0.1050586886703968, "num_tokens": 901691.0, "step": 425 }, { "entropy": 7.007831001281739, "epoch": 0.02538820334179607, "grad_norm": 1.1875, "learning_rate": 0.0002145, "loss": 6.6769, "mean_token_accuracy": 0.10150302425026894, "num_tokens": 912495.0, "step": 430 }, { "entropy": 7.010691833496094, "epoch": 0.02568341500856114, "grad_norm": 1.2421875, "learning_rate": 0.00021700000000000002, "loss": 6.636, "mean_token_accuracy": 0.1017840936779976, "num_tokens": 923420.0, "step": 435 }, { "entropy": 6.8785758972167965, "epoch": 0.02597862667532621, "grad_norm": 1.1875, "learning_rate": 0.0002195, "loss": 6.6396, "mean_token_accuracy": 0.09978873506188393, "num_tokens": 933598.0, "step": 440 }, { "entropy": 6.98797607421875, "epoch": 0.02627383834209128, "grad_norm": 1.3046875, "learning_rate": 0.000222, "loss": 6.7659, "mean_token_accuracy": 0.1045355699956417, "num_tokens": 943229.0, "step": 445 }, { "entropy": 6.983278131484985, "epoch": 0.02656905000885635, "grad_norm": 1.0625, "learning_rate": 0.0002245, "loss": 6.6247, "mean_token_accuracy": 0.10298437029123306, "num_tokens": 954425.0, "step": 450 }, { "entropy": 7.073006629943848, "epoch": 0.02686426167562142, "grad_norm": 1.3359375, "learning_rate": 0.00022700000000000002, "loss": 6.745, "mean_token_accuracy": 0.10184216126799583, "num_tokens": 965516.0, "step": 455 }, { "entropy": 6.900727653503418, "epoch": 0.02715947334238649, "grad_norm": 1.0390625, "learning_rate": 0.00022950000000000002, "loss": 6.6285, "mean_token_accuracy": 0.10302256718277931, "num_tokens": 976469.0, "step": 460 }, { "entropy": 6.955856561660767, "epoch": 0.02745468500915156, "grad_norm": 1.140625, "learning_rate": 0.00023200000000000003, "loss": 6.7139, "mean_token_accuracy": 0.09732916429638863, "num_tokens": 986946.0, "step": 465 }, { "entropy": 6.982401418685913, "epoch": 0.02774989667591663, "grad_norm": 1.1796875, "learning_rate": 0.00023449999999999998, "loss": 6.612, "mean_token_accuracy": 0.10779485702514649, "num_tokens": 997101.0, "step": 470 }, { "entropy": 6.9505868434906, "epoch": 0.0280451083426817, "grad_norm": 1.2890625, "learning_rate": 0.000237, "loss": 6.7346, "mean_token_accuracy": 0.10266673490405083, "num_tokens": 1007866.0, "step": 475 }, { "entropy": 7.019359874725342, "epoch": 0.028340320009446772, "grad_norm": 1.3203125, "learning_rate": 0.0002395, "loss": 6.7355, "mean_token_accuracy": 0.09643693268299103, "num_tokens": 1019377.0, "step": 480 }, { "entropy": 6.936902332305908, "epoch": 0.028635531676211842, "grad_norm": 1.28125, "learning_rate": 0.000242, "loss": 6.7267, "mean_token_accuracy": 0.09898768290877343, "num_tokens": 1031278.0, "step": 485 }, { "entropy": 6.772035408020019, "epoch": 0.028930743342976916, "grad_norm": 1.25, "learning_rate": 0.0002445, "loss": 6.5192, "mean_token_accuracy": 0.1116688534617424, "num_tokens": 1041663.0, "step": 490 }, { "entropy": 6.908066129684448, "epoch": 0.029225955009741986, "grad_norm": 1.203125, "learning_rate": 0.000247, "loss": 6.5969, "mean_token_accuracy": 0.10450899600982666, "num_tokens": 1052286.0, "step": 495 }, { "entropy": 6.807862234115601, "epoch": 0.029521166676507057, "grad_norm": 1.3359375, "learning_rate": 0.0002495, "loss": 6.6629, "mean_token_accuracy": 0.10684632584452629, "num_tokens": 1061945.0, "step": 500 }, { "entropy": 6.962998628616333, "epoch": 0.029816378343272127, "grad_norm": 1.265625, "learning_rate": 0.000252, "loss": 6.6436, "mean_token_accuracy": 0.10230686739087105, "num_tokens": 1074057.0, "step": 505 }, { "entropy": 6.809896945953369, "epoch": 0.030111590010037197, "grad_norm": 1.0390625, "learning_rate": 0.0002545, "loss": 6.6465, "mean_token_accuracy": 0.10390325114130974, "num_tokens": 1084830.0, "step": 510 }, { "entropy": 6.909462213516235, "epoch": 0.030406801676802268, "grad_norm": 1.203125, "learning_rate": 0.000257, "loss": 6.5865, "mean_token_accuracy": 0.11080023497343064, "num_tokens": 1095540.0, "step": 515 }, { "entropy": 6.853788089752197, "epoch": 0.030702013343567338, "grad_norm": 1.0390625, "learning_rate": 0.0002595, "loss": 6.5906, "mean_token_accuracy": 0.10921324118971824, "num_tokens": 1105395.0, "step": 520 }, { "entropy": 6.8561993598937985, "epoch": 0.03099722501033241, "grad_norm": 1.2109375, "learning_rate": 0.000262, "loss": 6.5617, "mean_token_accuracy": 0.0991988554596901, "num_tokens": 1117007.0, "step": 525 }, { "entropy": 6.876309776306153, "epoch": 0.03129243667709748, "grad_norm": 1.078125, "learning_rate": 0.00026450000000000003, "loss": 6.5751, "mean_token_accuracy": 0.11366137936711311, "num_tokens": 1128531.0, "step": 530 }, { "entropy": 6.810136461257935, "epoch": 0.03158764834386255, "grad_norm": 1.2109375, "learning_rate": 0.00026700000000000004, "loss": 6.5986, "mean_token_accuracy": 0.10317134782671929, "num_tokens": 1139194.0, "step": 535 }, { "entropy": 6.84046630859375, "epoch": 0.03188286001062762, "grad_norm": 1.1796875, "learning_rate": 0.00026950000000000005, "loss": 6.64, "mean_token_accuracy": 0.09497019648551941, "num_tokens": 1150371.0, "step": 540 }, { "entropy": 6.778982639312744, "epoch": 0.03217807167739269, "grad_norm": 1.1328125, "learning_rate": 0.00027200000000000005, "loss": 6.5427, "mean_token_accuracy": 0.10634316056966782, "num_tokens": 1160840.0, "step": 545 }, { "entropy": 6.843386459350586, "epoch": 0.03247328334415776, "grad_norm": 1.1171875, "learning_rate": 0.0002745, "loss": 6.595, "mean_token_accuracy": 0.10080070197582244, "num_tokens": 1171438.0, "step": 550 }, { "entropy": 6.788133335113526, "epoch": 0.032768495010922834, "grad_norm": 1.2890625, "learning_rate": 0.000277, "loss": 6.5448, "mean_token_accuracy": 0.11157862991094589, "num_tokens": 1180889.0, "step": 555 }, { "entropy": 6.7335409164428714, "epoch": 0.033063706677687904, "grad_norm": 1.1328125, "learning_rate": 0.0002795, "loss": 6.5536, "mean_token_accuracy": 0.10646847784519195, "num_tokens": 1190755.0, "step": 560 }, { "entropy": 6.849792003631592, "epoch": 0.033358918344452974, "grad_norm": 1.2734375, "learning_rate": 0.00028199999999999997, "loss": 6.6392, "mean_token_accuracy": 0.10497644990682602, "num_tokens": 1202002.0, "step": 565 }, { "entropy": 6.836796712875366, "epoch": 0.033654130011218045, "grad_norm": 1.1171875, "learning_rate": 0.0002845, "loss": 6.6549, "mean_token_accuracy": 0.10088638663291931, "num_tokens": 1213611.0, "step": 570 }, { "entropy": 6.87101526260376, "epoch": 0.033949341677983115, "grad_norm": 1.1015625, "learning_rate": 0.000287, "loss": 6.665, "mean_token_accuracy": 0.10538341179490089, "num_tokens": 1224450.0, "step": 575 }, { "entropy": 6.789998292922974, "epoch": 0.034244553344748185, "grad_norm": 1.125, "learning_rate": 0.0002895, "loss": 6.6039, "mean_token_accuracy": 0.10749325305223464, "num_tokens": 1235229.0, "step": 580 }, { "entropy": 6.817308807373047, "epoch": 0.034539765011513256, "grad_norm": 1.2109375, "learning_rate": 0.000292, "loss": 6.6003, "mean_token_accuracy": 0.10448379814624786, "num_tokens": 1245015.0, "step": 585 }, { "entropy": 6.658805990219117, "epoch": 0.034834976678278326, "grad_norm": 1.171875, "learning_rate": 0.0002945, "loss": 6.4771, "mean_token_accuracy": 0.11165011152625084, "num_tokens": 1256307.0, "step": 590 }, { "entropy": 6.781815767288208, "epoch": 0.035130188345043396, "grad_norm": 1.109375, "learning_rate": 0.000297, "loss": 6.5426, "mean_token_accuracy": 0.1121568076312542, "num_tokens": 1267042.0, "step": 595 }, { "entropy": 6.763632011413574, "epoch": 0.03542540001180847, "grad_norm": 1.1171875, "learning_rate": 0.0002995, "loss": 6.5296, "mean_token_accuracy": 0.11234459504485131, "num_tokens": 1277571.0, "step": 600 }, { "entropy": 6.766745567321777, "epoch": 0.03572061167857354, "grad_norm": 1.125, "learning_rate": 0.000302, "loss": 6.6043, "mean_token_accuracy": 0.10907782688736915, "num_tokens": 1288203.0, "step": 605 }, { "entropy": 6.755765724182129, "epoch": 0.03601582334533861, "grad_norm": 1.171875, "learning_rate": 0.0003045, "loss": 6.5908, "mean_token_accuracy": 0.11033066883683204, "num_tokens": 1299510.0, "step": 610 }, { "entropy": 6.666236639022827, "epoch": 0.03631103501210368, "grad_norm": 1.265625, "learning_rate": 0.000307, "loss": 6.4499, "mean_token_accuracy": 0.11379646882414818, "num_tokens": 1309573.0, "step": 615 }, { "entropy": 6.696754121780396, "epoch": 0.03660624667886875, "grad_norm": 1.1796875, "learning_rate": 0.0003095, "loss": 6.5194, "mean_token_accuracy": 0.11005613952875137, "num_tokens": 1321104.0, "step": 620 }, { "entropy": 6.693728637695313, "epoch": 0.03690145834563382, "grad_norm": 1.0, "learning_rate": 0.000312, "loss": 6.536, "mean_token_accuracy": 0.10800015479326248, "num_tokens": 1332671.0, "step": 625 }, { "entropy": 6.623374509811401, "epoch": 0.03719667001239889, "grad_norm": 1.234375, "learning_rate": 0.0003145, "loss": 6.4132, "mean_token_accuracy": 0.11599879413843155, "num_tokens": 1344416.0, "step": 630 }, { "entropy": 6.784224557876587, "epoch": 0.03749188167916396, "grad_norm": 1.1796875, "learning_rate": 0.000317, "loss": 6.5499, "mean_token_accuracy": 0.10508671477437019, "num_tokens": 1355740.0, "step": 635 }, { "entropy": 6.663637495040893, "epoch": 0.03778709334592903, "grad_norm": 1.15625, "learning_rate": 0.0003195, "loss": 6.5103, "mean_token_accuracy": 0.10943645983934402, "num_tokens": 1366465.0, "step": 640 }, { "entropy": 6.570268201828003, "epoch": 0.0380823050126941, "grad_norm": 1.125, "learning_rate": 0.000322, "loss": 6.4257, "mean_token_accuracy": 0.10816865861415863, "num_tokens": 1376476.0, "step": 645 }, { "entropy": 6.72826361656189, "epoch": 0.03837751667945917, "grad_norm": 1.3828125, "learning_rate": 0.00032450000000000003, "loss": 6.4271, "mean_token_accuracy": 0.11982382684946061, "num_tokens": 1386172.0, "step": 650 }, { "entropy": 6.599955940246582, "epoch": 0.03867272834622424, "grad_norm": 1.1796875, "learning_rate": 0.00032700000000000003, "loss": 6.4205, "mean_token_accuracy": 0.10781983509659768, "num_tokens": 1396655.0, "step": 655 }, { "entropy": 6.604927682876587, "epoch": 0.03896794001298931, "grad_norm": 1.125, "learning_rate": 0.00032950000000000004, "loss": 6.4394, "mean_token_accuracy": 0.10952353551983833, "num_tokens": 1407816.0, "step": 660 }, { "entropy": 6.50361123085022, "epoch": 0.03926315167975438, "grad_norm": 1.109375, "learning_rate": 0.00033200000000000005, "loss": 6.4102, "mean_token_accuracy": 0.11540385410189628, "num_tokens": 1418265.0, "step": 665 }, { "entropy": 6.59829306602478, "epoch": 0.03955836334651945, "grad_norm": 1.0859375, "learning_rate": 0.00033450000000000005, "loss": 6.404, "mean_token_accuracy": 0.11367250382900237, "num_tokens": 1429776.0, "step": 670 }, { "entropy": 6.546575927734375, "epoch": 0.03985357501328453, "grad_norm": 1.265625, "learning_rate": 0.000337, "loss": 6.4344, "mean_token_accuracy": 0.11163216009736061, "num_tokens": 1440295.0, "step": 675 }, { "entropy": 6.640892171859742, "epoch": 0.0401487866800496, "grad_norm": 1.0703125, "learning_rate": 0.0003395, "loss": 6.4677, "mean_token_accuracy": 0.11355267614126205, "num_tokens": 1450505.0, "step": 680 }, { "entropy": 6.712115478515625, "epoch": 0.04044399834681467, "grad_norm": 1.0625, "learning_rate": 0.000342, "loss": 6.5529, "mean_token_accuracy": 0.11008020266890525, "num_tokens": 1461768.0, "step": 685 }, { "entropy": 6.6160581588745115, "epoch": 0.04073921001357974, "grad_norm": 0.96484375, "learning_rate": 0.00034449999999999997, "loss": 6.4961, "mean_token_accuracy": 0.11170130670070648, "num_tokens": 1473965.0, "step": 690 }, { "entropy": 6.568212413787842, "epoch": 0.04103442168034481, "grad_norm": 1.1015625, "learning_rate": 0.000347, "loss": 6.4378, "mean_token_accuracy": 0.11968905776739121, "num_tokens": 1484750.0, "step": 695 }, { "entropy": 6.620304441452026, "epoch": 0.04132963334710988, "grad_norm": 1.0625, "learning_rate": 0.0003495, "loss": 6.4357, "mean_token_accuracy": 0.10914467945694924, "num_tokens": 1496474.0, "step": 700 }, { "entropy": 6.5506373882293705, "epoch": 0.04162484501387495, "grad_norm": 1.046875, "learning_rate": 0.000352, "loss": 6.5706, "mean_token_accuracy": 0.1017179697751999, "num_tokens": 1507880.0, "step": 705 }, { "entropy": 6.623064422607422, "epoch": 0.04192005668064002, "grad_norm": 1.3984375, "learning_rate": 0.0003545, "loss": 6.4875, "mean_token_accuracy": 0.10796806961297989, "num_tokens": 1519115.0, "step": 710 }, { "entropy": 6.600681447982788, "epoch": 0.04221526834740509, "grad_norm": 1.3671875, "learning_rate": 0.000357, "loss": 6.4319, "mean_token_accuracy": 0.11712071001529693, "num_tokens": 1529031.0, "step": 715 }, { "entropy": 6.581659746170044, "epoch": 0.04251048001417016, "grad_norm": 1.21875, "learning_rate": 0.0003595, "loss": 6.3756, "mean_token_accuracy": 0.11652529910206795, "num_tokens": 1539954.0, "step": 720 }, { "entropy": 6.566905403137207, "epoch": 0.04280569168093523, "grad_norm": 1.140625, "learning_rate": 0.000362, "loss": 6.5397, "mean_token_accuracy": 0.10744471997022628, "num_tokens": 1550713.0, "step": 725 }, { "entropy": 6.5449799537658695, "epoch": 0.0431009033477003, "grad_norm": 1.078125, "learning_rate": 0.0003645, "loss": 6.4371, "mean_token_accuracy": 0.10990587547421456, "num_tokens": 1562569.0, "step": 730 }, { "entropy": 6.6069684505462645, "epoch": 0.04339611501446537, "grad_norm": 1.0390625, "learning_rate": 0.000367, "loss": 6.4711, "mean_token_accuracy": 0.11592478230595589, "num_tokens": 1572999.0, "step": 735 }, { "entropy": 6.60914249420166, "epoch": 0.04369132668123044, "grad_norm": 1.1328125, "learning_rate": 0.0003695, "loss": 6.4636, "mean_token_accuracy": 0.10721064656972885, "num_tokens": 1583560.0, "step": 740 }, { "entropy": 6.513941383361816, "epoch": 0.04398653834799551, "grad_norm": 1.1796875, "learning_rate": 0.000372, "loss": 6.3622, "mean_token_accuracy": 0.11819557920098304, "num_tokens": 1593931.0, "step": 745 }, { "entropy": 6.53983850479126, "epoch": 0.04428175001476058, "grad_norm": 1.09375, "learning_rate": 0.0003745, "loss": 6.4451, "mean_token_accuracy": 0.10905564352869987, "num_tokens": 1605182.0, "step": 750 }, { "entropy": 6.547965335845947, "epoch": 0.044576961681525654, "grad_norm": 1.09375, "learning_rate": 0.000377, "loss": 6.3938, "mean_token_accuracy": 0.11519684940576554, "num_tokens": 1615912.0, "step": 755 }, { "entropy": 6.417063283920288, "epoch": 0.044872173348290724, "grad_norm": 1.140625, "learning_rate": 0.0003795, "loss": 6.3974, "mean_token_accuracy": 0.11966018378734589, "num_tokens": 1626322.0, "step": 760 }, { "entropy": 6.590868949890137, "epoch": 0.045167385015055794, "grad_norm": 1.1015625, "learning_rate": 0.000382, "loss": 6.3744, "mean_token_accuracy": 0.11621762439608574, "num_tokens": 1636859.0, "step": 765 }, { "entropy": 6.502106046676635, "epoch": 0.045462596681820865, "grad_norm": 1.03125, "learning_rate": 0.0003845, "loss": 6.4183, "mean_token_accuracy": 0.10947346538305283, "num_tokens": 1648511.0, "step": 770 }, { "entropy": 6.496643590927124, "epoch": 0.045757808348585935, "grad_norm": 1.0703125, "learning_rate": 0.00038700000000000003, "loss": 6.3729, "mean_token_accuracy": 0.11914441511034965, "num_tokens": 1659350.0, "step": 775 }, { "entropy": 6.433891248703003, "epoch": 0.046053020015351005, "grad_norm": 1.1640625, "learning_rate": 0.00038950000000000003, "loss": 6.4166, "mean_token_accuracy": 0.11184289306402206, "num_tokens": 1670077.0, "step": 780 }, { "entropy": 6.547736930847168, "epoch": 0.046348231682116076, "grad_norm": 1.046875, "learning_rate": 0.00039200000000000004, "loss": 6.4018, "mean_token_accuracy": 0.11911343410611153, "num_tokens": 1681877.0, "step": 785 }, { "entropy": 6.486341857910157, "epoch": 0.046643443348881146, "grad_norm": 1.1796875, "learning_rate": 0.00039450000000000005, "loss": 6.3895, "mean_token_accuracy": 0.11960405185818672, "num_tokens": 1692448.0, "step": 790 }, { "entropy": 6.552379465103149, "epoch": 0.046938655015646216, "grad_norm": 1.3203125, "learning_rate": 0.00039700000000000005, "loss": 6.4569, "mean_token_accuracy": 0.11376626342535019, "num_tokens": 1702437.0, "step": 795 }, { "entropy": 6.533510732650757, "epoch": 0.04723386668241129, "grad_norm": 0.9609375, "learning_rate": 0.0003995, "loss": 6.3491, "mean_token_accuracy": 0.11783147305250168, "num_tokens": 1712587.0, "step": 800 }, { "entropy": 6.516396141052246, "epoch": 0.04752907834917636, "grad_norm": 1.109375, "learning_rate": 0.000402, "loss": 6.4434, "mean_token_accuracy": 0.11643455773591996, "num_tokens": 1722782.0, "step": 805 }, { "entropy": 6.544632863998413, "epoch": 0.04782429001594143, "grad_norm": 1.0703125, "learning_rate": 0.0004045, "loss": 6.3938, "mean_token_accuracy": 0.1165135882794857, "num_tokens": 1733993.0, "step": 810 }, { "entropy": 6.4083781242370605, "epoch": 0.0481195016827065, "grad_norm": 1.0625, "learning_rate": 0.00040699999999999997, "loss": 6.4062, "mean_token_accuracy": 0.11843438744544983, "num_tokens": 1744095.0, "step": 815 }, { "entropy": 6.446332406997681, "epoch": 0.04841471334947157, "grad_norm": 1.3125, "learning_rate": 0.0004095, "loss": 6.3581, "mean_token_accuracy": 0.11571272611618041, "num_tokens": 1754356.0, "step": 820 }, { "entropy": 6.452772045135498, "epoch": 0.048709925016236645, "grad_norm": 1.1640625, "learning_rate": 0.000412, "loss": 6.4377, "mean_token_accuracy": 0.11594505831599236, "num_tokens": 1765628.0, "step": 825 }, { "entropy": 6.456363677978516, "epoch": 0.049005136683001715, "grad_norm": 1.078125, "learning_rate": 0.0004145, "loss": 6.3107, "mean_token_accuracy": 0.11763904914259911, "num_tokens": 1775697.0, "step": 830 }, { "entropy": 6.446932458877564, "epoch": 0.049300348349766786, "grad_norm": 1.0703125, "learning_rate": 0.000417, "loss": 6.412, "mean_token_accuracy": 0.1122404970228672, "num_tokens": 1786066.0, "step": 835 }, { "entropy": 6.421263313293457, "epoch": 0.049595560016531856, "grad_norm": 1.1015625, "learning_rate": 0.0004195, "loss": 6.2323, "mean_token_accuracy": 0.12168351784348488, "num_tokens": 1796735.0, "step": 840 }, { "entropy": 6.4752278327941895, "epoch": 0.049890771683296926, "grad_norm": 1.140625, "learning_rate": 0.000422, "loss": 6.3938, "mean_token_accuracy": 0.11445808708667755, "num_tokens": 1807164.0, "step": 845 }, { "entropy": 6.44355959892273, "epoch": 0.050185983350062, "grad_norm": 1.1640625, "learning_rate": 0.0004245, "loss": 6.4254, "mean_token_accuracy": 0.11221889480948448, "num_tokens": 1818788.0, "step": 850 }, { "entropy": 6.524218511581421, "epoch": 0.05048119501682707, "grad_norm": 1.0859375, "learning_rate": 0.000427, "loss": 6.4196, "mean_token_accuracy": 0.11620973348617554, "num_tokens": 1830488.0, "step": 855 }, { "entropy": 6.335734176635742, "epoch": 0.05077640668359214, "grad_norm": 1.1015625, "learning_rate": 0.0004295, "loss": 6.3469, "mean_token_accuracy": 0.11381080970168114, "num_tokens": 1841085.0, "step": 860 }, { "entropy": 6.448235368728637, "epoch": 0.05107161835035721, "grad_norm": 1.0, "learning_rate": 0.000432, "loss": 6.324, "mean_token_accuracy": 0.11611942201852798, "num_tokens": 1852831.0, "step": 865 }, { "entropy": 6.353146409988403, "epoch": 0.05136683001712228, "grad_norm": 1.09375, "learning_rate": 0.0004345, "loss": 6.2856, "mean_token_accuracy": 0.12149567529559135, "num_tokens": 1863868.0, "step": 870 }, { "entropy": 6.34972448348999, "epoch": 0.05166204168388735, "grad_norm": 1.03125, "learning_rate": 0.000437, "loss": 6.2641, "mean_token_accuracy": 0.11966291964054107, "num_tokens": 1874227.0, "step": 875 }, { "entropy": 6.424135446548462, "epoch": 0.05195725335065242, "grad_norm": 1.1953125, "learning_rate": 0.0004395, "loss": 6.2741, "mean_token_accuracy": 0.11863231882452965, "num_tokens": 1883712.0, "step": 880 }, { "entropy": 6.426289415359497, "epoch": 0.05225246501741749, "grad_norm": 1.015625, "learning_rate": 0.000442, "loss": 6.3813, "mean_token_accuracy": 0.12182779237627983, "num_tokens": 1894909.0, "step": 885 }, { "entropy": 6.322753953933716, "epoch": 0.05254767668418256, "grad_norm": 1.1875, "learning_rate": 0.0004445, "loss": 6.2976, "mean_token_accuracy": 0.12649846225976943, "num_tokens": 1904973.0, "step": 890 }, { "entropy": 6.352806806564331, "epoch": 0.05284288835094763, "grad_norm": 1.046875, "learning_rate": 0.000447, "loss": 6.2755, "mean_token_accuracy": 0.1184873789548874, "num_tokens": 1915131.0, "step": 895 }, { "entropy": 6.3792942523956295, "epoch": 0.0531381000177127, "grad_norm": 1.0078125, "learning_rate": 0.00044950000000000003, "loss": 6.3776, "mean_token_accuracy": 0.11576106548309326, "num_tokens": 1925893.0, "step": 900 }, { "entropy": 6.471661901473999, "epoch": 0.05343331168447777, "grad_norm": 1.046875, "learning_rate": 0.00045200000000000004, "loss": 6.3869, "mean_token_accuracy": 0.11486705616116524, "num_tokens": 1936830.0, "step": 905 }, { "entropy": 6.366755723953247, "epoch": 0.05372852335124284, "grad_norm": 1.09375, "learning_rate": 0.00045450000000000004, "loss": 6.32, "mean_token_accuracy": 0.12052246332168579, "num_tokens": 1948291.0, "step": 910 }, { "entropy": 6.413037490844727, "epoch": 0.05402373501800791, "grad_norm": 1.078125, "learning_rate": 0.00045700000000000005, "loss": 6.3619, "mean_token_accuracy": 0.11181799247860909, "num_tokens": 1959168.0, "step": 915 }, { "entropy": 6.320397138595581, "epoch": 0.05431894668477298, "grad_norm": 1.1015625, "learning_rate": 0.00045950000000000006, "loss": 6.3454, "mean_token_accuracy": 0.11968773975968361, "num_tokens": 1970046.0, "step": 920 }, { "entropy": 6.349421739578247, "epoch": 0.05461415835153805, "grad_norm": 1.1484375, "learning_rate": 0.000462, "loss": 6.333, "mean_token_accuracy": 0.11495715156197547, "num_tokens": 1980430.0, "step": 925 }, { "entropy": 6.475516033172608, "epoch": 0.05490937001830312, "grad_norm": 1.015625, "learning_rate": 0.0004645, "loss": 6.3077, "mean_token_accuracy": 0.12274432182312012, "num_tokens": 1991035.0, "step": 930 }, { "entropy": 6.42578911781311, "epoch": 0.05520458168506819, "grad_norm": 1.03125, "learning_rate": 0.000467, "loss": 6.3654, "mean_token_accuracy": 0.11354202851653099, "num_tokens": 2002122.0, "step": 935 }, { "entropy": 6.304956388473511, "epoch": 0.05549979335183326, "grad_norm": 1.1015625, "learning_rate": 0.0004695, "loss": 6.2948, "mean_token_accuracy": 0.11706151142716407, "num_tokens": 2012676.0, "step": 940 }, { "entropy": 6.362958908081055, "epoch": 0.05579500501859833, "grad_norm": 1.1171875, "learning_rate": 0.000472, "loss": 6.3144, "mean_token_accuracy": 0.11494619697332382, "num_tokens": 2023124.0, "step": 945 }, { "entropy": 6.352200746536255, "epoch": 0.0560902166853634, "grad_norm": 1.0546875, "learning_rate": 0.0004745, "loss": 6.3036, "mean_token_accuracy": 0.1179499588906765, "num_tokens": 2034030.0, "step": 950 }, { "entropy": 6.315423631668091, "epoch": 0.056385428352128474, "grad_norm": 1.171875, "learning_rate": 0.000477, "loss": 6.3389, "mean_token_accuracy": 0.11249075978994369, "num_tokens": 2044499.0, "step": 955 }, { "entropy": 6.378019380569458, "epoch": 0.056680640018893544, "grad_norm": 1.125, "learning_rate": 0.0004795, "loss": 6.3761, "mean_token_accuracy": 0.1221327118575573, "num_tokens": 2055242.0, "step": 960 }, { "entropy": 6.296391916275025, "epoch": 0.056975851685658614, "grad_norm": 1.1015625, "learning_rate": 0.000482, "loss": 6.3379, "mean_token_accuracy": 0.11753152683377266, "num_tokens": 2065987.0, "step": 965 }, { "entropy": 6.374587059020996, "epoch": 0.057271063352423685, "grad_norm": 1.0078125, "learning_rate": 0.0004845, "loss": 6.2512, "mean_token_accuracy": 0.12176798135042191, "num_tokens": 2077015.0, "step": 970 }, { "entropy": 6.433490657806397, "epoch": 0.05756627501918876, "grad_norm": 1.046875, "learning_rate": 0.000487, "loss": 6.3711, "mean_token_accuracy": 0.12369481921195984, "num_tokens": 2087411.0, "step": 975 }, { "entropy": 6.3158018589019775, "epoch": 0.05786148668595383, "grad_norm": 1.046875, "learning_rate": 0.0004895, "loss": 6.2923, "mean_token_accuracy": 0.12385761588811875, "num_tokens": 2097612.0, "step": 980 }, { "entropy": 6.208762693405151, "epoch": 0.0581566983527189, "grad_norm": 1.0625, "learning_rate": 0.000492, "loss": 6.2291, "mean_token_accuracy": 0.1223476842045784, "num_tokens": 2108118.0, "step": 985 }, { "entropy": 6.340756034851074, "epoch": 0.05845191001948397, "grad_norm": 1.0859375, "learning_rate": 0.0004945, "loss": 6.3148, "mean_token_accuracy": 0.11962561458349227, "num_tokens": 2118262.0, "step": 990 }, { "entropy": 6.331036233901978, "epoch": 0.05874712168624904, "grad_norm": 1.0703125, "learning_rate": 0.000497, "loss": 6.3164, "mean_token_accuracy": 0.11812316924333573, "num_tokens": 2128819.0, "step": 995 }, { "entropy": 6.350315570831299, "epoch": 0.05904233335301411, "grad_norm": 1.0859375, "learning_rate": 0.0004995, "loss": 6.2294, "mean_token_accuracy": 0.12225014418363571, "num_tokens": 2139852.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3132581179392000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }