{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 896, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.2742946662008763, "epoch": 0.011166945840312675, "grad_norm": 57.75, "learning_rate": 2.02247191011236e-06, "loss": 2.0921743392944334, "mean_token_accuracy": 0.6198021434247494, "num_tokens": 27228.0, "step": 10 }, { "entropy": 1.4035808108747005, "epoch": 0.02233389168062535, "grad_norm": 27.5, "learning_rate": 4.269662921348315e-06, "loss": 1.8684164047241212, "mean_token_accuracy": 0.6308974869549274, "num_tokens": 54263.0, "step": 20 }, { "entropy": 1.3806322045624255, "epoch": 0.03350083752093802, "grad_norm": 7.4375, "learning_rate": 6.51685393258427e-06, "loss": 1.5451434135437012, "mean_token_accuracy": 0.6709699966013432, "num_tokens": 80355.0, "step": 30 }, { "entropy": 1.2432026788592339, "epoch": 0.0446677833612507, "grad_norm": 4.4375, "learning_rate": 8.764044943820226e-06, "loss": 1.3852472305297852, "mean_token_accuracy": 0.727528478205204, "num_tokens": 107262.0, "step": 40 }, { "entropy": 1.2347759172320365, "epoch": 0.05583472920156337, "grad_norm": 3.96875, "learning_rate": 1.101123595505618e-05, "loss": 1.3566075325012208, "mean_token_accuracy": 0.7324926406145096, "num_tokens": 134872.0, "step": 50 }, { "entropy": 1.1513216629624368, "epoch": 0.06700167504187604, "grad_norm": 4.0, "learning_rate": 1.3258426966292135e-05, "loss": 1.2471713066101073, "mean_token_accuracy": 0.7584743887186051, "num_tokens": 159459.0, "step": 60 }, { "entropy": 1.156738107651472, "epoch": 0.07816862088218872, "grad_norm": 3.578125, "learning_rate": 1.5505617977528093e-05, "loss": 1.239414596557617, "mean_token_accuracy": 0.749166414886713, "num_tokens": 184576.0, "step": 70 }, { "entropy": 1.157951571792364, "epoch": 0.0893355667225014, "grad_norm": 3.640625, "learning_rate": 1.7752808988764045e-05, "loss": 1.2582244873046875, "mean_token_accuracy": 0.7544261917471886, "num_tokens": 210131.0, "step": 80 }, { "entropy": 1.1601063475012778, "epoch": 0.10050251256281408, "grad_norm": 3.625, "learning_rate": 2e-05, "loss": 1.2618935585021973, "mean_token_accuracy": 0.747503137588501, "num_tokens": 237729.0, "step": 90 }, { "entropy": 1.0921222895383835, "epoch": 0.11166945840312674, "grad_norm": 3.59375, "learning_rate": 1.975216852540273e-05, "loss": 1.1785853385925293, "mean_token_accuracy": 0.7695864170789719, "num_tokens": 262275.0, "step": 100 }, { "entropy": 1.1327178589999676, "epoch": 0.12283640424343942, "grad_norm": 3.609375, "learning_rate": 1.9504337050805453e-05, "loss": 1.216773509979248, "mean_token_accuracy": 0.7555348932743072, "num_tokens": 288546.0, "step": 110 }, { "entropy": 1.035539500042796, "epoch": 0.13400335008375208, "grad_norm": 3.78125, "learning_rate": 1.925650557620818e-05, "loss": 1.1224644660949707, "mean_token_accuracy": 0.7721244119107723, "num_tokens": 312401.0, "step": 120 }, { "entropy": 1.1713032595813275, "epoch": 0.14517029592406477, "grad_norm": 3.671875, "learning_rate": 1.9008674101610908e-05, "loss": 1.3123122215270997, "mean_token_accuracy": 0.7460119985044003, "num_tokens": 339734.0, "step": 130 }, { "entropy": 1.1201179042458533, "epoch": 0.15633724176437744, "grad_norm": 3.65625, "learning_rate": 1.8760842627013632e-05, "loss": 1.2395885467529297, "mean_token_accuracy": 0.7611079879105092, "num_tokens": 364808.0, "step": 140 }, { "entropy": 1.1376964189112186, "epoch": 0.16750418760469013, "grad_norm": 3.171875, "learning_rate": 1.851301115241636e-05, "loss": 1.2277887344360352, "mean_token_accuracy": 0.7598711617290974, "num_tokens": 391934.0, "step": 150 }, { "entropy": 1.0489437825977803, "epoch": 0.1786711334450028, "grad_norm": 3.96875, "learning_rate": 1.8265179677819083e-05, "loss": 1.1456377029418945, "mean_token_accuracy": 0.7739411622285843, "num_tokens": 416529.0, "step": 160 }, { "entropy": 1.0241498839110137, "epoch": 0.18983807928531546, "grad_norm": 3.6875, "learning_rate": 1.801734820322181e-05, "loss": 1.1425954818725585, "mean_token_accuracy": 0.77560595870018, "num_tokens": 441104.0, "step": 170 }, { "entropy": 1.1297610633075237, "epoch": 0.20100502512562815, "grad_norm": 3.3125, "learning_rate": 1.7769516728624535e-05, "loss": 1.2210969924926758, "mean_token_accuracy": 0.7550569862127304, "num_tokens": 468069.0, "step": 180 }, { "entropy": 1.112941750138998, "epoch": 0.21217197096594081, "grad_norm": 3.65625, "learning_rate": 1.7521685254027262e-05, "loss": 1.192617416381836, "mean_token_accuracy": 0.7619749017059803, "num_tokens": 494025.0, "step": 190 }, { "entropy": 1.063616494834423, "epoch": 0.22333891680625348, "grad_norm": 3.828125, "learning_rate": 1.727385377942999e-05, "loss": 1.188753604888916, "mean_token_accuracy": 0.7676796585321426, "num_tokens": 519158.0, "step": 200 }, { "entropy": 1.1531932204961777, "epoch": 0.23450586264656617, "grad_norm": 3.59375, "learning_rate": 1.7026022304832714e-05, "loss": 1.2400163650512694, "mean_token_accuracy": 0.7510207004845142, "num_tokens": 546677.0, "step": 210 }, { "entropy": 1.1051580917090178, "epoch": 0.24567280848687884, "grad_norm": 3.703125, "learning_rate": 1.677819083023544e-05, "loss": 1.1891214370727539, "mean_token_accuracy": 0.7638134479522705, "num_tokens": 571855.0, "step": 220 }, { "entropy": 1.1669820021837949, "epoch": 0.2568397543271915, "grad_norm": 3.546875, "learning_rate": 1.653035935563817e-05, "loss": 1.2794105529785156, "mean_token_accuracy": 0.7478987194597722, "num_tokens": 599409.0, "step": 230 }, { "entropy": 1.118950032442808, "epoch": 0.26800670016750416, "grad_norm": 4.0, "learning_rate": 1.6282527881040892e-05, "loss": 1.2216855049133302, "mean_token_accuracy": 0.7556364260613918, "num_tokens": 625984.0, "step": 240 }, { "entropy": 1.1487022332847119, "epoch": 0.27917364600781686, "grad_norm": 3.0625, "learning_rate": 1.603469640644362e-05, "loss": 1.3041958808898926, "mean_token_accuracy": 0.7531310901045799, "num_tokens": 654422.0, "step": 250 }, { "entropy": 1.067482265457511, "epoch": 0.29034059184812955, "grad_norm": 3.84375, "learning_rate": 1.5786864931846347e-05, "loss": 1.1802674293518067, "mean_token_accuracy": 0.7648798644542694, "num_tokens": 679950.0, "step": 260 }, { "entropy": 1.1374815497547388, "epoch": 0.3015075376884422, "grad_norm": 3.234375, "learning_rate": 1.553903345724907e-05, "loss": 1.2403667449951172, "mean_token_accuracy": 0.7576499588787555, "num_tokens": 707691.0, "step": 270 }, { "entropy": 1.0954229425638915, "epoch": 0.3126744835287549, "grad_norm": 3.8125, "learning_rate": 1.52912019826518e-05, "loss": 1.1737814903259278, "mean_token_accuracy": 0.765420364588499, "num_tokens": 732904.0, "step": 280 }, { "entropy": 1.1397546224296093, "epoch": 0.32384142936906757, "grad_norm": 3.5625, "learning_rate": 1.5043370508054524e-05, "loss": 1.2469436645507812, "mean_token_accuracy": 0.7499822400510311, "num_tokens": 760829.0, "step": 290 }, { "entropy": 1.0366052724421024, "epoch": 0.33500837520938026, "grad_norm": 3.84375, "learning_rate": 1.4795539033457252e-05, "loss": 1.140453815460205, "mean_token_accuracy": 0.7735538497567177, "num_tokens": 785442.0, "step": 300 }, { "entropy": 1.1235052689909935, "epoch": 0.3461753210496929, "grad_norm": 3.21875, "learning_rate": 1.4547707558859976e-05, "loss": 1.23864803314209, "mean_token_accuracy": 0.7578027009963989, "num_tokens": 813321.0, "step": 310 }, { "entropy": 1.0663026701658964, "epoch": 0.3573422668900056, "grad_norm": 3.296875, "learning_rate": 1.4299876084262703e-05, "loss": 1.1644706726074219, "mean_token_accuracy": 0.7657143622636795, "num_tokens": 840571.0, "step": 320 }, { "entropy": 1.1613866232335568, "epoch": 0.3685092127303183, "grad_norm": 3.296875, "learning_rate": 1.4052044609665429e-05, "loss": 1.215484046936035, "mean_token_accuracy": 0.7551229789853096, "num_tokens": 868204.0, "step": 330 }, { "entropy": 1.038713937997818, "epoch": 0.3796761585706309, "grad_norm": 3.609375, "learning_rate": 1.3804213135068155e-05, "loss": 1.133761501312256, "mean_token_accuracy": 0.7695340342819691, "num_tokens": 893234.0, "step": 340 }, { "entropy": 1.117867962270975, "epoch": 0.3908431044109436, "grad_norm": 3.359375, "learning_rate": 1.355638166047088e-05, "loss": 1.2365485191345216, "mean_token_accuracy": 0.751798415929079, "num_tokens": 920370.0, "step": 350 }, { "entropy": 1.066711399704218, "epoch": 0.4020100502512563, "grad_norm": 3.25, "learning_rate": 1.3308550185873608e-05, "loss": 1.149217128753662, "mean_token_accuracy": 0.7712466239929199, "num_tokens": 944799.0, "step": 360 }, { "entropy": 1.09353599101305, "epoch": 0.41317699609156894, "grad_norm": 3.640625, "learning_rate": 1.3060718711276332e-05, "loss": 1.1921247482299804, "mean_token_accuracy": 0.7622878901660443, "num_tokens": 970357.0, "step": 370 }, { "entropy": 1.0636055015027523, "epoch": 0.42434394193188163, "grad_norm": 3.40625, "learning_rate": 1.281288723667906e-05, "loss": 1.1449426651000976, "mean_token_accuracy": 0.7751508951187134, "num_tokens": 995627.0, "step": 380 }, { "entropy": 1.0997799094766378, "epoch": 0.4355108877721943, "grad_norm": 3.46875, "learning_rate": 1.2565055762081787e-05, "loss": 1.1890180587768555, "mean_token_accuracy": 0.7632672250270843, "num_tokens": 1021258.0, "step": 390 }, { "entropy": 1.0799225345253944, "epoch": 0.44667783361250696, "grad_norm": 3.328125, "learning_rate": 1.231722428748451e-05, "loss": 1.1613880157470704, "mean_token_accuracy": 0.7609394922852516, "num_tokens": 1048009.0, "step": 400 }, { "entropy": 1.0300600126385688, "epoch": 0.45784477945281965, "grad_norm": 3.296875, "learning_rate": 1.2069392812887238e-05, "loss": 1.1121676445007325, "mean_token_accuracy": 0.7761823385953903, "num_tokens": 1072790.0, "step": 410 }, { "entropy": 1.03407681286335, "epoch": 0.46901172529313234, "grad_norm": 3.421875, "learning_rate": 1.1821561338289964e-05, "loss": 1.1337100982666015, "mean_token_accuracy": 0.779456903040409, "num_tokens": 1096424.0, "step": 420 }, { "entropy": 1.0816764250397681, "epoch": 0.480178671133445, "grad_norm": 3.09375, "learning_rate": 1.1573729863692691e-05, "loss": 1.168564796447754, "mean_token_accuracy": 0.7695191375911236, "num_tokens": 1121279.0, "step": 430 }, { "entropy": 1.0950494274497031, "epoch": 0.49134561697375767, "grad_norm": 3.671875, "learning_rate": 1.1325898389095415e-05, "loss": 1.220743751525879, "mean_token_accuracy": 0.7663791351020336, "num_tokens": 1146975.0, "step": 440 }, { "entropy": 1.0629482321441173, "epoch": 0.5025125628140703, "grad_norm": 3.359375, "learning_rate": 1.1078066914498143e-05, "loss": 1.17555513381958, "mean_token_accuracy": 0.7702355854213238, "num_tokens": 1171720.0, "step": 450 }, { "entropy": 1.0769638925790788, "epoch": 0.513679508654383, "grad_norm": 3.203125, "learning_rate": 1.083023543990087e-05, "loss": 1.1584683418273927, "mean_token_accuracy": 0.7703170344233513, "num_tokens": 1197191.0, "step": 460 }, { "entropy": 1.0924316361546516, "epoch": 0.5248464544946957, "grad_norm": 3.53125, "learning_rate": 1.0582403965303594e-05, "loss": 1.197894287109375, "mean_token_accuracy": 0.7625605218112469, "num_tokens": 1223732.0, "step": 470 }, { "entropy": 1.1760938204824924, "epoch": 0.5360134003350083, "grad_norm": 3.21875, "learning_rate": 1.0334572490706321e-05, "loss": 1.3036236763000488, "mean_token_accuracy": 0.7476884454488755, "num_tokens": 1252654.0, "step": 480 }, { "entropy": 1.1041141584515572, "epoch": 0.5471803461753211, "grad_norm": 3.328125, "learning_rate": 1.0086741016109047e-05, "loss": 1.1862168312072754, "mean_token_accuracy": 0.7658242657780647, "num_tokens": 1278284.0, "step": 490 }, { "entropy": 1.0600057408213615, "epoch": 0.5583472920156337, "grad_norm": 3.640625, "learning_rate": 9.838909541511773e-06, "loss": 1.1444557189941407, "mean_token_accuracy": 0.7672035470604897, "num_tokens": 1303786.0, "step": 500 }, { "entropy": 1.1602862119674682, "epoch": 0.5695142378559463, "grad_norm": 3.546875, "learning_rate": 9.591078066914498e-06, "loss": 1.2625015258789063, "mean_token_accuracy": 0.7455270260572433, "num_tokens": 1330403.0, "step": 510 }, { "entropy": 1.0500171076506377, "epoch": 0.5806811836962591, "grad_norm": 3.34375, "learning_rate": 9.343246592317226e-06, "loss": 1.1100471496582032, "mean_token_accuracy": 0.7771873719990253, "num_tokens": 1355913.0, "step": 520 }, { "entropy": 1.0421214148402214, "epoch": 0.5918481295365717, "grad_norm": 3.421875, "learning_rate": 9.095415117719952e-06, "loss": 1.1434844970703124, "mean_token_accuracy": 0.7771047562360763, "num_tokens": 1381048.0, "step": 530 }, { "entropy": 1.1398710921406745, "epoch": 0.6030150753768844, "grad_norm": 3.765625, "learning_rate": 8.847583643122677e-06, "loss": 1.237742042541504, "mean_token_accuracy": 0.7521290302276611, "num_tokens": 1407965.0, "step": 540 }, { "entropy": 1.0272238925099373, "epoch": 0.6141820212171971, "grad_norm": 3.28125, "learning_rate": 8.599752168525403e-06, "loss": 1.1173413276672364, "mean_token_accuracy": 0.7779941506683826, "num_tokens": 1432806.0, "step": 550 }, { "entropy": 1.0616241727024316, "epoch": 0.6253489670575098, "grad_norm": 3.15625, "learning_rate": 8.351920693928129e-06, "loss": 1.1724609375, "mean_token_accuracy": 0.7691180802881717, "num_tokens": 1458745.0, "step": 560 }, { "entropy": 1.1184002067893744, "epoch": 0.6365159128978225, "grad_norm": 3.65625, "learning_rate": 8.104089219330854e-06, "loss": 1.228511905670166, "mean_token_accuracy": 0.7584543086588382, "num_tokens": 1485413.0, "step": 570 }, { "entropy": 1.123507371917367, "epoch": 0.6476828587381351, "grad_norm": 3.4375, "learning_rate": 7.856257744733582e-06, "loss": 1.2577102661132813, "mean_token_accuracy": 0.7598744049668312, "num_tokens": 1513305.0, "step": 580 }, { "entropy": 1.0770755916833878, "epoch": 0.6588498045784478, "grad_norm": 3.28125, "learning_rate": 7.608426270136308e-06, "loss": 1.1567678451538086, "mean_token_accuracy": 0.7634399652481079, "num_tokens": 1539813.0, "step": 590 }, { "entropy": 0.9889072474092245, "epoch": 0.6700167504187605, "grad_norm": 3.65625, "learning_rate": 7.360594795539034e-06, "loss": 1.0486254692077637, "mean_token_accuracy": 0.7880329728126526, "num_tokens": 1563321.0, "step": 600 }, { "entropy": 1.0968003824353219, "epoch": 0.6811836962590732, "grad_norm": 3.28125, "learning_rate": 7.11276332094176e-06, "loss": 1.1853549003601074, "mean_token_accuracy": 0.7634060740470886, "num_tokens": 1590121.0, "step": 610 }, { "entropy": 1.0346317429095506, "epoch": 0.6923506420993858, "grad_norm": 3.078125, "learning_rate": 6.8649318463444856e-06, "loss": 1.09486722946167, "mean_token_accuracy": 0.7758483737707138, "num_tokens": 1616645.0, "step": 620 }, { "entropy": 1.1052446074783802, "epoch": 0.7035175879396985, "grad_norm": 4.09375, "learning_rate": 6.617100371747213e-06, "loss": 1.18992280960083, "mean_token_accuracy": 0.7618899635970593, "num_tokens": 1642059.0, "step": 630 }, { "entropy": 1.0749453879892825, "epoch": 0.7146845337800112, "grad_norm": 3.4375, "learning_rate": 6.369268897149939e-06, "loss": 1.1491153717041016, "mean_token_accuracy": 0.7696318380534649, "num_tokens": 1666939.0, "step": 640 }, { "entropy": 1.0601326443254948, "epoch": 0.7258514796203238, "grad_norm": 3.640625, "learning_rate": 6.121437422552665e-06, "loss": 1.1444756507873535, "mean_token_accuracy": 0.7738051861524582, "num_tokens": 1692634.0, "step": 650 }, { "entropy": 1.1047037810087204, "epoch": 0.7370184254606366, "grad_norm": 3.53125, "learning_rate": 5.873605947955391e-06, "loss": 1.2263466835021972, "mean_token_accuracy": 0.7588796854019165, "num_tokens": 1720055.0, "step": 660 }, { "entropy": 1.0764735087752342, "epoch": 0.7481853713009492, "grad_norm": 3.40625, "learning_rate": 5.625774473358117e-06, "loss": 1.2022334098815919, "mean_token_accuracy": 0.7653821043670177, "num_tokens": 1746264.0, "step": 670 }, { "entropy": 1.0576500050723552, "epoch": 0.7593523171412618, "grad_norm": 3.21875, "learning_rate": 5.377942998760843e-06, "loss": 1.1265974998474122, "mean_token_accuracy": 0.7686478443443775, "num_tokens": 1773301.0, "step": 680 }, { "entropy": 1.1367420602589846, "epoch": 0.7705192629815746, "grad_norm": 3.4375, "learning_rate": 5.130111524163569e-06, "loss": 1.2707669258117675, "mean_token_accuracy": 0.7557471729815006, "num_tokens": 1800329.0, "step": 690 }, { "entropy": 1.0998500097543, "epoch": 0.7816862088218872, "grad_norm": 3.875, "learning_rate": 4.8822800495662955e-06, "loss": 1.184847068786621, "mean_token_accuracy": 0.7647615008056163, "num_tokens": 1825475.0, "step": 700 }, { "entropy": 1.1467237778007984, "epoch": 0.7928531546621999, "grad_norm": 3.171875, "learning_rate": 4.634448574969021e-06, "loss": 1.2255634307861327, "mean_token_accuracy": 0.7532035551965237, "num_tokens": 1852394.0, "step": 710 }, { "entropy": 1.079410395771265, "epoch": 0.8040201005025126, "grad_norm": 3.59375, "learning_rate": 4.386617100371748e-06, "loss": 1.2125642776489258, "mean_token_accuracy": 0.767810083925724, "num_tokens": 1878744.0, "step": 720 }, { "entropy": 1.0579048234969377, "epoch": 0.8151870463428252, "grad_norm": 3.296875, "learning_rate": 4.1387856257744735e-06, "loss": 1.1596202850341797, "mean_token_accuracy": 0.7713351771235466, "num_tokens": 1903148.0, "step": 730 }, { "entropy": 1.0731349058449269, "epoch": 0.8263539921831379, "grad_norm": 3.328125, "learning_rate": 3.8909541511772e-06, "loss": 1.1340813636779785, "mean_token_accuracy": 0.7696133933961391, "num_tokens": 1928626.0, "step": 740 }, { "entropy": 1.1284345269203186, "epoch": 0.8375209380234506, "grad_norm": 3.625, "learning_rate": 3.643122676579926e-06, "loss": 1.2018820762634277, "mean_token_accuracy": 0.7566148206591606, "num_tokens": 1955732.0, "step": 750 }, { "entropy": 1.1177599750459195, "epoch": 0.8486878838637633, "grad_norm": 3.703125, "learning_rate": 3.3952912019826523e-06, "loss": 1.2435114860534668, "mean_token_accuracy": 0.7585679024457932, "num_tokens": 1981894.0, "step": 760 }, { "entropy": 1.0989192590117454, "epoch": 0.8598548297040759, "grad_norm": 3.40625, "learning_rate": 3.147459727385378e-06, "loss": 1.1960742950439454, "mean_token_accuracy": 0.7629640743136406, "num_tokens": 2008438.0, "step": 770 }, { "entropy": 1.0289450511336327, "epoch": 0.8710217755443886, "grad_norm": 3.453125, "learning_rate": 2.899628252788104e-06, "loss": 1.112326717376709, "mean_token_accuracy": 0.7783081293106079, "num_tokens": 2033527.0, "step": 780 }, { "entropy": 1.1425920329988002, "epoch": 0.8821887213847013, "grad_norm": 3.453125, "learning_rate": 2.6517967781908303e-06, "loss": 1.2318533897399901, "mean_token_accuracy": 0.7519856467843056, "num_tokens": 2060494.0, "step": 790 }, { "entropy": 1.1216130927205086, "epoch": 0.8933556672250139, "grad_norm": 3.671875, "learning_rate": 2.4039653035935564e-06, "loss": 1.195895004272461, "mean_token_accuracy": 0.7575728356838226, "num_tokens": 2086503.0, "step": 800 }, { "entropy": 1.1177167922258378, "epoch": 0.9045226130653267, "grad_norm": 3.765625, "learning_rate": 2.1561338289962826e-06, "loss": 1.180656909942627, "mean_token_accuracy": 0.7616930149495602, "num_tokens": 2112895.0, "step": 810 }, { "entropy": 1.0543908223509788, "epoch": 0.9156895589056393, "grad_norm": 3.65625, "learning_rate": 1.908302354399009e-06, "loss": 1.1741219520568849, "mean_token_accuracy": 0.7708107247948647, "num_tokens": 2138001.0, "step": 820 }, { "entropy": 1.087718739360571, "epoch": 0.9268565047459519, "grad_norm": 3.28125, "learning_rate": 1.6604708798017348e-06, "loss": 1.177952480316162, "mean_token_accuracy": 0.7635545134544373, "num_tokens": 2164192.0, "step": 830 }, { "entropy": 1.060328460112214, "epoch": 0.9380234505862647, "grad_norm": 3.71875, "learning_rate": 1.4126394052044612e-06, "loss": 1.1673462867736817, "mean_token_accuracy": 0.7744978621602059, "num_tokens": 2189210.0, "step": 840 }, { "entropy": 1.0364069953560828, "epoch": 0.9491903964265773, "grad_norm": 3.484375, "learning_rate": 1.1648079306071871e-06, "loss": 1.1158721923828125, "mean_token_accuracy": 0.7778892047703266, "num_tokens": 2214446.0, "step": 850 }, { "entropy": 1.0322446286678315, "epoch": 0.96035734226689, "grad_norm": 3.015625, "learning_rate": 9.169764560099133e-07, "loss": 1.0796822547912597, "mean_token_accuracy": 0.7774909734725952, "num_tokens": 2239557.0, "step": 860 }, { "entropy": 1.1237488869577645, "epoch": 0.9715242881072027, "grad_norm": 3.265625, "learning_rate": 6.691449814126394e-07, "loss": 1.2529041290283203, "mean_token_accuracy": 0.7569354966282844, "num_tokens": 2266609.0, "step": 870 }, { "entropy": 1.02969014570117, "epoch": 0.9826912339475153, "grad_norm": 3.265625, "learning_rate": 4.213135068153656e-07, "loss": 1.1265899658203125, "mean_token_accuracy": 0.7792067192494869, "num_tokens": 2291191.0, "step": 880 }, { "entropy": 1.0750355511903762, "epoch": 0.993858179787828, "grad_norm": 3.453125, "learning_rate": 1.7348203221809172e-07, "loss": 1.143712043762207, "mean_token_accuracy": 0.7723280422389507, "num_tokens": 2316691.0, "step": 890 } ], "logging_steps": 10, "max_steps": 896, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.4891590857728e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }