{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 3125, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.2839297465980053, "epoch": 0.00320038404608553, "grad_norm": 73.0, "learning_rate": 5.76923076923077e-07, "loss": 1.9901968002319337, "mean_token_accuracy": 0.6237266078591347, "num_tokens": 33961.0, "step": 10 }, { "entropy": 1.2595087066292763, "epoch": 0.00640076809217106, "grad_norm": 64.5, "learning_rate": 1.217948717948718e-06, "loss": 1.8751590728759766, "mean_token_accuracy": 0.6309439569711686, "num_tokens": 71819.0, "step": 20 }, { "entropy": 1.2931475669145585, "epoch": 0.00960115213825659, "grad_norm": 22.625, "learning_rate": 1.8589743589743592e-06, "loss": 1.7506515502929687, "mean_token_accuracy": 0.6388503693044185, "num_tokens": 112770.0, "step": 30 }, { "entropy": 1.2734985046088696, "epoch": 0.01280153618434212, "grad_norm": 23.75, "learning_rate": 2.5e-06, "loss": 1.6540241241455078, "mean_token_accuracy": 0.657498425245285, "num_tokens": 146669.0, "step": 40 }, { "entropy": 1.287195574492216, "epoch": 0.016001920230427652, "grad_norm": 13.3125, "learning_rate": 3.141025641025641e-06, "loss": 1.5025008201599122, "mean_token_accuracy": 0.6669101666659116, "num_tokens": 183443.0, "step": 50 }, { "entropy": 1.3111741445958613, "epoch": 0.01920230427651318, "grad_norm": 6.46875, "learning_rate": 3.782051282051282e-06, "loss": 1.485818862915039, "mean_token_accuracy": 0.685324776172638, "num_tokens": 219455.0, "step": 60 }, { "entropy": 1.2205842301249503, "epoch": 0.022402688322598712, "grad_norm": 4.8125, "learning_rate": 4.423076923076924e-06, "loss": 1.3609664916992188, "mean_token_accuracy": 0.7222387321293354, "num_tokens": 253077.0, "step": 70 }, { "entropy": 1.2416748367249966, "epoch": 0.02560307236868424, "grad_norm": 5.15625, "learning_rate": 5.064102564102565e-06, "loss": 1.3642989158630372, "mean_token_accuracy": 0.7237147346138955, "num_tokens": 287333.0, "step": 80 }, { "entropy": 1.2347557865083219, "epoch": 0.028803456414769772, "grad_norm": 4.4375, "learning_rate": 5.705128205128206e-06, "loss": 1.3442096710205078, "mean_token_accuracy": 0.7320359282195568, "num_tokens": 319994.0, "step": 90 }, { "entropy": 1.298496885597706, "epoch": 0.032003840460855304, "grad_norm": 4.71875, "learning_rate": 6.3461538461538466e-06, "loss": 1.3953542709350586, "mean_token_accuracy": 0.720856224745512, "num_tokens": 353798.0, "step": 100 }, { "entropy": 1.283773996680975, "epoch": 0.035204224506940836, "grad_norm": 3.78125, "learning_rate": 6.9871794871794876e-06, "loss": 1.3582657814025878, "mean_token_accuracy": 0.7274449437856674, "num_tokens": 387975.0, "step": 110 }, { "entropy": 1.2386538445949555, "epoch": 0.03840460855302636, "grad_norm": 3.96875, "learning_rate": 7.6282051282051286e-06, "loss": 1.2965816497802733, "mean_token_accuracy": 0.7260297447443008, "num_tokens": 426086.0, "step": 120 }, { "entropy": 1.2428459793329238, "epoch": 0.04160499259911189, "grad_norm": 4.6875, "learning_rate": 8.26923076923077e-06, "loss": 1.3305319786071776, "mean_token_accuracy": 0.7313816711306572, "num_tokens": 459435.0, "step": 130 }, { "entropy": 1.2068071104586124, "epoch": 0.044805376645197424, "grad_norm": 4.59375, "learning_rate": 8.910256410256411e-06, "loss": 1.246315860748291, "mean_token_accuracy": 0.7372891046106815, "num_tokens": 490867.0, "step": 140 }, { "entropy": 1.2453301914036274, "epoch": 0.048005760691282956, "grad_norm": 3.84375, "learning_rate": 9.551282051282053e-06, "loss": 1.2801061630249024, "mean_token_accuracy": 0.7317046545445919, "num_tokens": 524633.0, "step": 150 }, { "entropy": 1.2111680828034879, "epoch": 0.05120614473736848, "grad_norm": 3.375, "learning_rate": 1.0192307692307692e-05, "loss": 1.2264927864074706, "mean_token_accuracy": 0.7354309558868408, "num_tokens": 558869.0, "step": 160 }, { "entropy": 1.2417247883975506, "epoch": 0.05440652878345401, "grad_norm": 3.8125, "learning_rate": 1.0833333333333334e-05, "loss": 1.296145248413086, "mean_token_accuracy": 0.7288267895579338, "num_tokens": 594200.0, "step": 170 }, { "entropy": 1.2903451286256313, "epoch": 0.057606912829539544, "grad_norm": 3.953125, "learning_rate": 1.1474358974358974e-05, "loss": 1.391792392730713, "mean_token_accuracy": 0.7263986520469189, "num_tokens": 628749.0, "step": 180 }, { "entropy": 1.1508908517658711, "epoch": 0.060807296875625076, "grad_norm": 4.59375, "learning_rate": 1.2115384615384615e-05, "loss": 1.170935821533203, "mean_token_accuracy": 0.7482860818505287, "num_tokens": 660930.0, "step": 190 }, { "entropy": 1.1952558353543281, "epoch": 0.06400768092171061, "grad_norm": 3.953125, "learning_rate": 1.2756410256410257e-05, "loss": 1.2448080062866211, "mean_token_accuracy": 0.7362503379583358, "num_tokens": 696715.0, "step": 200 }, { "entropy": 1.2021137841045857, "epoch": 0.06720806496779613, "grad_norm": 4.28125, "learning_rate": 1.3397435897435897e-05, "loss": 1.2594975471496581, "mean_token_accuracy": 0.7392350442707538, "num_tokens": 730982.0, "step": 210 }, { "entropy": 1.1502027772367, "epoch": 0.07040844901388167, "grad_norm": 4.0, "learning_rate": 1.403846153846154e-05, "loss": 1.2263619422912597, "mean_token_accuracy": 0.7455356031656265, "num_tokens": 765369.0, "step": 220 }, { "entropy": 1.2468636624515057, "epoch": 0.0736088330599672, "grad_norm": 3.875, "learning_rate": 1.467948717948718e-05, "loss": 1.317853832244873, "mean_token_accuracy": 0.7300475873053074, "num_tokens": 800884.0, "step": 230 }, { "entropy": 1.1318104140460492, "epoch": 0.07680921710605272, "grad_norm": 3.234375, "learning_rate": 1.5320512820512823e-05, "loss": 1.1992506980895996, "mean_token_accuracy": 0.7450634054839611, "num_tokens": 837605.0, "step": 240 }, { "entropy": 1.1415463611483574, "epoch": 0.08000960115213826, "grad_norm": 3.640625, "learning_rate": 1.5961538461538465e-05, "loss": 1.1817726135253905, "mean_token_accuracy": 0.7463984578847885, "num_tokens": 876274.0, "step": 250 }, { "entropy": 1.2368000820279121, "epoch": 0.08320998519822378, "grad_norm": 3.546875, "learning_rate": 1.6602564102564103e-05, "loss": 1.297637367248535, "mean_token_accuracy": 0.7309112548828125, "num_tokens": 911704.0, "step": 260 }, { "entropy": 1.1496265470981597, "epoch": 0.08641036924430932, "grad_norm": 3.875, "learning_rate": 1.7243589743589745e-05, "loss": 1.2197935104370117, "mean_token_accuracy": 0.7450173661112786, "num_tokens": 947611.0, "step": 270 }, { "entropy": 1.1289438650012016, "epoch": 0.08961075329039485, "grad_norm": 4.5, "learning_rate": 1.7884615384615387e-05, "loss": 1.2045019149780274, "mean_token_accuracy": 0.745516513288021, "num_tokens": 984535.0, "step": 280 }, { "entropy": 1.1794409573078155, "epoch": 0.09281113733648037, "grad_norm": 3.71875, "learning_rate": 1.852564102564103e-05, "loss": 1.211575698852539, "mean_token_accuracy": 0.7406493924558163, "num_tokens": 1018018.0, "step": 290 }, { "entropy": 1.1385122388601303, "epoch": 0.09601152138256591, "grad_norm": 4.53125, "learning_rate": 1.916666666666667e-05, "loss": 1.1774465560913085, "mean_token_accuracy": 0.7501121394336223, "num_tokens": 1051431.0, "step": 300 }, { "entropy": 1.1633801862597466, "epoch": 0.09921190542865144, "grad_norm": 3.359375, "learning_rate": 1.980769230769231e-05, "loss": 1.2100112915039063, "mean_token_accuracy": 0.7403162129223346, "num_tokens": 1086575.0, "step": 310 }, { "entropy": 1.1853495672345162, "epoch": 0.10241228947473696, "grad_norm": 3.546875, "learning_rate": 1.9950231070031995e-05, "loss": 1.234422206878662, "mean_token_accuracy": 0.7415597856044769, "num_tokens": 1122816.0, "step": 320 }, { "entropy": 1.1737073637545108, "epoch": 0.1056126735208225, "grad_norm": 3.671875, "learning_rate": 1.9879132598649133e-05, "loss": 1.2083673477172852, "mean_token_accuracy": 0.7407836645841599, "num_tokens": 1158910.0, "step": 330 }, { "entropy": 1.2292249217629432, "epoch": 0.10881305756690803, "grad_norm": 3.875, "learning_rate": 1.9808034127266264e-05, "loss": 1.269577407836914, "mean_token_accuracy": 0.7345698416233063, "num_tokens": 1196019.0, "step": 340 }, { "entropy": 1.18642889931798, "epoch": 0.11201344161299356, "grad_norm": 3.578125, "learning_rate": 1.97369356558834e-05, "loss": 1.2697922706604003, "mean_token_accuracy": 0.741942162066698, "num_tokens": 1229987.0, "step": 350 }, { "entropy": 1.1096315152943135, "epoch": 0.11521382565907909, "grad_norm": 3.9375, "learning_rate": 1.9665837184500536e-05, "loss": 1.1929906845092773, "mean_token_accuracy": 0.7551799714565277, "num_tokens": 1263509.0, "step": 360 }, { "entropy": 1.1739558205008507, "epoch": 0.11841420970516461, "grad_norm": 3.8125, "learning_rate": 1.959473871311767e-05, "loss": 1.2080945014953612, "mean_token_accuracy": 0.7452260315418243, "num_tokens": 1301070.0, "step": 370 }, { "entropy": 1.11664487272501, "epoch": 0.12161459375125015, "grad_norm": 4.15625, "learning_rate": 1.9523640241734804e-05, "loss": 1.189216423034668, "mean_token_accuracy": 0.7564452636986971, "num_tokens": 1333449.0, "step": 380 }, { "entropy": 1.1409478083252906, "epoch": 0.12481497779733568, "grad_norm": 3.34375, "learning_rate": 1.9452541770351938e-05, "loss": 1.2088672637939453, "mean_token_accuracy": 0.7491289660334587, "num_tokens": 1368459.0, "step": 390 }, { "entropy": 1.2013175174593926, "epoch": 0.12801536184342122, "grad_norm": 4.5625, "learning_rate": 1.9381443298969072e-05, "loss": 1.26448335647583, "mean_token_accuracy": 0.7352619163691998, "num_tokens": 1406859.0, "step": 400 }, { "entropy": 1.1907868802547454, "epoch": 0.13121574588950674, "grad_norm": 3.015625, "learning_rate": 1.931034482758621e-05, "loss": 1.2475446701049804, "mean_token_accuracy": 0.7453009270131588, "num_tokens": 1442179.0, "step": 410 }, { "entropy": 1.0694843657314776, "epoch": 0.13441612993559227, "grad_norm": 3.59375, "learning_rate": 1.9239246356203344e-05, "loss": 1.1248330116271972, "mean_token_accuracy": 0.756801488250494, "num_tokens": 1481135.0, "step": 420 }, { "entropy": 1.1419598631560803, "epoch": 0.1376165139816778, "grad_norm": 3.71875, "learning_rate": 1.916814788482048e-05, "loss": 1.2056102752685547, "mean_token_accuracy": 0.7461046256124974, "num_tokens": 1518329.0, "step": 430 }, { "entropy": 1.1788324914872645, "epoch": 0.14081689802776334, "grad_norm": 3.421875, "learning_rate": 1.9097049413437613e-05, "loss": 1.2716377258300782, "mean_token_accuracy": 0.7431618466973304, "num_tokens": 1554359.0, "step": 440 }, { "entropy": 1.2097309075295926, "epoch": 0.14401728207384887, "grad_norm": 3.984375, "learning_rate": 1.9025950942054747e-05, "loss": 1.246030616760254, "mean_token_accuracy": 0.7390106923878192, "num_tokens": 1591000.0, "step": 450 }, { "entropy": 1.2036252733319999, "epoch": 0.1472176661199344, "grad_norm": 3.21875, "learning_rate": 1.8954852470671884e-05, "loss": 1.2812904357910155, "mean_token_accuracy": 0.7348502896726131, "num_tokens": 1627205.0, "step": 460 }, { "entropy": 1.1779422886669635, "epoch": 0.15041805016601992, "grad_norm": 3.234375, "learning_rate": 1.8883753999289015e-05, "loss": 1.2817980766296386, "mean_token_accuracy": 0.7440513700246811, "num_tokens": 1663831.0, "step": 470 }, { "entropy": 1.1881464742124082, "epoch": 0.15361843421210544, "grad_norm": 3.03125, "learning_rate": 1.8812655527906153e-05, "loss": 1.2011470794677734, "mean_token_accuracy": 0.7412468865513802, "num_tokens": 1701847.0, "step": 480 }, { "entropy": 1.1195977296680213, "epoch": 0.156818818258191, "grad_norm": 3.328125, "learning_rate": 1.8741557056523287e-05, "loss": 1.1337278366088868, "mean_token_accuracy": 0.7538985311985016, "num_tokens": 1740516.0, "step": 490 }, { "entropy": 1.2133471183478832, "epoch": 0.16001920230427652, "grad_norm": 3.40625, "learning_rate": 1.867045858514042e-05, "loss": 1.2486845970153808, "mean_token_accuracy": 0.7390272334218025, "num_tokens": 1778065.0, "step": 500 }, { "entropy": 1.1336760543286801, "epoch": 0.16321958635036204, "grad_norm": 3.53125, "learning_rate": 1.8599360113757556e-05, "loss": 1.1790239334106445, "mean_token_accuracy": 0.7476340506225825, "num_tokens": 1817855.0, "step": 510 }, { "entropy": 1.193576630949974, "epoch": 0.16641997039644757, "grad_norm": 3.4375, "learning_rate": 1.852826164237469e-05, "loss": 1.2632747650146485, "mean_token_accuracy": 0.7385985501110554, "num_tokens": 1853124.0, "step": 520 }, { "entropy": 1.1418399840593338, "epoch": 0.1696203544425331, "grad_norm": 3.640625, "learning_rate": 1.8457163170991824e-05, "loss": 1.194384479522705, "mean_token_accuracy": 0.7507250174880028, "num_tokens": 1887889.0, "step": 530 }, { "entropy": 1.1441261656582355, "epoch": 0.17282073848861865, "grad_norm": 2.96875, "learning_rate": 1.838606469960896e-05, "loss": 1.1474828720092773, "mean_token_accuracy": 0.7484897166490555, "num_tokens": 1925355.0, "step": 540 }, { "entropy": 1.1772041961550712, "epoch": 0.17602112253470417, "grad_norm": 2.859375, "learning_rate": 1.8314966228226096e-05, "loss": 1.2581243515014648, "mean_token_accuracy": 0.7401691168546677, "num_tokens": 1962021.0, "step": 550 }, { "entropy": 1.154813179373741, "epoch": 0.1792215065807897, "grad_norm": 3.140625, "learning_rate": 1.824386775684323e-05, "loss": 1.2013533592224122, "mean_token_accuracy": 0.7461690090596675, "num_tokens": 1999387.0, "step": 560 }, { "entropy": 1.1134828917682171, "epoch": 0.18242189062687522, "grad_norm": 4.0625, "learning_rate": 1.8172769285460364e-05, "loss": 1.155961513519287, "mean_token_accuracy": 0.7565418593585491, "num_tokens": 2033366.0, "step": 570 }, { "entropy": 1.129069809615612, "epoch": 0.18562227467296075, "grad_norm": 3.3125, "learning_rate": 1.81016708140775e-05, "loss": 1.202240562438965, "mean_token_accuracy": 0.7467389106750488, "num_tokens": 2068012.0, "step": 580 }, { "entropy": 1.1413575001060963, "epoch": 0.1888226587190463, "grad_norm": 2.859375, "learning_rate": 1.8030572342694636e-05, "loss": 1.1733809471130372, "mean_token_accuracy": 0.7480724595487118, "num_tokens": 2103208.0, "step": 590 }, { "entropy": 1.1593846715986729, "epoch": 0.19202304276513182, "grad_norm": 3.65625, "learning_rate": 1.7959473871311767e-05, "loss": 1.2416004180908202, "mean_token_accuracy": 0.7419706009328365, "num_tokens": 2139071.0, "step": 600 }, { "entropy": 1.2044602517038583, "epoch": 0.19522342681121735, "grad_norm": 2.640625, "learning_rate": 1.7888375399928905e-05, "loss": 1.2507460594177247, "mean_token_accuracy": 0.7382100090384484, "num_tokens": 2178499.0, "step": 610 }, { "entropy": 1.096942011639476, "epoch": 0.19842381085730287, "grad_norm": 3.359375, "learning_rate": 1.7817276928546035e-05, "loss": 1.1269610404968262, "mean_token_accuracy": 0.7565630108118058, "num_tokens": 2214448.0, "step": 620 }, { "entropy": 1.1488182917237282, "epoch": 0.2016241949033884, "grad_norm": 4.0625, "learning_rate": 1.7746178457163173e-05, "loss": 1.1636892318725587, "mean_token_accuracy": 0.7449747450649739, "num_tokens": 2249587.0, "step": 630 }, { "entropy": 1.072244780510664, "epoch": 0.20482457894947392, "grad_norm": 2.875, "learning_rate": 1.7675079985780307e-05, "loss": 1.1519594192504883, "mean_token_accuracy": 0.7612439051270485, "num_tokens": 2285832.0, "step": 640 }, { "entropy": 1.137603597342968, "epoch": 0.20802496299555948, "grad_norm": 3.65625, "learning_rate": 1.760398151439744e-05, "loss": 1.2033388137817382, "mean_token_accuracy": 0.750407163798809, "num_tokens": 2323267.0, "step": 650 }, { "entropy": 1.1386778496205807, "epoch": 0.211225347041645, "grad_norm": 3.90625, "learning_rate": 1.7532883043014576e-05, "loss": 1.2194600105285645, "mean_token_accuracy": 0.7539191976189613, "num_tokens": 2356234.0, "step": 660 }, { "entropy": 1.171764300018549, "epoch": 0.21442573108773053, "grad_norm": 3.734375, "learning_rate": 1.746178457163171e-05, "loss": 1.2068530082702638, "mean_token_accuracy": 0.7431434363126754, "num_tokens": 2394092.0, "step": 670 }, { "entropy": 1.1694385975599288, "epoch": 0.21762611513381605, "grad_norm": 3.609375, "learning_rate": 1.7390686100248847e-05, "loss": 1.2267550468444823, "mean_token_accuracy": 0.7448949955403805, "num_tokens": 2429083.0, "step": 680 }, { "entropy": 1.0907738648355008, "epoch": 0.22082649917990158, "grad_norm": 3.0625, "learning_rate": 1.731958762886598e-05, "loss": 1.139704990386963, "mean_token_accuracy": 0.7525829285383224, "num_tokens": 2466650.0, "step": 690 }, { "entropy": 1.263149094209075, "epoch": 0.22402688322598713, "grad_norm": 3.421875, "learning_rate": 1.7248489157483116e-05, "loss": 1.3419886589050294, "mean_token_accuracy": 0.7293422102928162, "num_tokens": 2502306.0, "step": 700 }, { "entropy": 1.0920586667954921, "epoch": 0.22722726727207265, "grad_norm": 3.484375, "learning_rate": 1.717739068610025e-05, "loss": 1.1174333572387696, "mean_token_accuracy": 0.7606853067874908, "num_tokens": 2535111.0, "step": 710 }, { "entropy": 1.1392102960497141, "epoch": 0.23042765131815818, "grad_norm": 4.03125, "learning_rate": 1.7106292214717384e-05, "loss": 1.2493625640869142, "mean_token_accuracy": 0.7505488857626915, "num_tokens": 2569698.0, "step": 720 }, { "entropy": 1.1885175816714764, "epoch": 0.2336280353642437, "grad_norm": 3.046875, "learning_rate": 1.703519374333452e-05, "loss": 1.2571531295776368, "mean_token_accuracy": 0.7408242344856262, "num_tokens": 2606190.0, "step": 730 }, { "entropy": 1.1989564672112465, "epoch": 0.23682841941032923, "grad_norm": 3.03125, "learning_rate": 1.6964095271951656e-05, "loss": 1.2598919868469238, "mean_token_accuracy": 0.7383935242891312, "num_tokens": 2643059.0, "step": 740 }, { "entropy": 1.0843516297638416, "epoch": 0.24002880345641478, "grad_norm": 3.265625, "learning_rate": 1.6892996800568787e-05, "loss": 1.1271354675292968, "mean_token_accuracy": 0.7592886902391911, "num_tokens": 2677827.0, "step": 750 }, { "entropy": 1.1722411584109067, "epoch": 0.2432291875025003, "grad_norm": 4.25, "learning_rate": 1.6821898329185925e-05, "loss": 1.2755705833435058, "mean_token_accuracy": 0.7432561241090297, "num_tokens": 2711876.0, "step": 760 }, { "entropy": 1.1528743766248226, "epoch": 0.24642957154858583, "grad_norm": 3.125, "learning_rate": 1.675079985780306e-05, "loss": 1.1825839042663575, "mean_token_accuracy": 0.7412553071975708, "num_tokens": 2753314.0, "step": 770 }, { "entropy": 1.1880130164325238, "epoch": 0.24962995559467135, "grad_norm": 3.453125, "learning_rate": 1.6679701386420193e-05, "loss": 1.2241481781005858, "mean_token_accuracy": 0.7429691925644875, "num_tokens": 2789807.0, "step": 780 }, { "entropy": 1.10604536421597, "epoch": 0.2528303396407569, "grad_norm": 3.171875, "learning_rate": 1.6608602915037327e-05, "loss": 1.133774185180664, "mean_token_accuracy": 0.7567876607179642, "num_tokens": 2822248.0, "step": 790 }, { "entropy": 1.1902866654098034, "epoch": 0.25603072368684243, "grad_norm": 3.734375, "learning_rate": 1.653750444365446e-05, "loss": 1.2399630546569824, "mean_token_accuracy": 0.7448862664401531, "num_tokens": 2858863.0, "step": 800 }, { "entropy": 1.0581065572798252, "epoch": 0.25923110773292796, "grad_norm": 3.625, "learning_rate": 1.64664059722716e-05, "loss": 1.1121423721313477, "mean_token_accuracy": 0.7639019310474395, "num_tokens": 2892587.0, "step": 810 }, { "entropy": 1.1235411427915096, "epoch": 0.2624314917790135, "grad_norm": 4.0, "learning_rate": 1.6395307500888733e-05, "loss": 1.1847190856933594, "mean_token_accuracy": 0.7517336331307888, "num_tokens": 2926589.0, "step": 820 }, { "entropy": 1.1476600162684918, "epoch": 0.265631875825099, "grad_norm": 3.375, "learning_rate": 1.6324209029505868e-05, "loss": 1.1705162048339843, "mean_token_accuracy": 0.7479592509567737, "num_tokens": 2963433.0, "step": 830 }, { "entropy": 1.1264712318778038, "epoch": 0.26883225987118453, "grad_norm": 3.625, "learning_rate": 1.6253110558123002e-05, "loss": 1.1919547080993653, "mean_token_accuracy": 0.7536672279238701, "num_tokens": 2997829.0, "step": 840 }, { "entropy": 1.139496796950698, "epoch": 0.27203264391727006, "grad_norm": 3.296875, "learning_rate": 1.6182012086740136e-05, "loss": 1.1688892364501953, "mean_token_accuracy": 0.7543122127652169, "num_tokens": 3032167.0, "step": 850 }, { "entropy": 1.1148510150611401, "epoch": 0.2752330279633556, "grad_norm": 4.40625, "learning_rate": 1.611091361535727e-05, "loss": 1.1610650062561034, "mean_token_accuracy": 0.7572085842490196, "num_tokens": 3066591.0, "step": 860 }, { "entropy": 1.1900723941624165, "epoch": 0.2784334120094411, "grad_norm": 3.59375, "learning_rate": 1.6039815143974408e-05, "loss": 1.2732099533081054, "mean_token_accuracy": 0.7386304296553134, "num_tokens": 3104866.0, "step": 870 }, { "entropy": 1.1151873588562011, "epoch": 0.2816337960555267, "grad_norm": 3.609375, "learning_rate": 1.596871667259154e-05, "loss": 1.194847583770752, "mean_token_accuracy": 0.7530852198600769, "num_tokens": 3140582.0, "step": 880 }, { "entropy": 1.1318743109703064, "epoch": 0.2848341801016122, "grad_norm": 3.5, "learning_rate": 1.5897618201208676e-05, "loss": 1.1644593238830567, "mean_token_accuracy": 0.7507477700710297, "num_tokens": 3172606.0, "step": 890 }, { "entropy": 1.1317258846014737, "epoch": 0.28803456414769774, "grad_norm": 3.109375, "learning_rate": 1.582651972982581e-05, "loss": 1.2329046249389648, "mean_token_accuracy": 0.7497393228113651, "num_tokens": 3211067.0, "step": 900 }, { "entropy": 1.0851800233125686, "epoch": 0.29123494819378326, "grad_norm": 2.890625, "learning_rate": 1.5755421258442945e-05, "loss": 1.0999431610107422, "mean_token_accuracy": 0.757631991803646, "num_tokens": 3245422.0, "step": 910 }, { "entropy": 1.159644392132759, "epoch": 0.2944353322398688, "grad_norm": 2.703125, "learning_rate": 1.568432278706008e-05, "loss": 1.2022081375122071, "mean_token_accuracy": 0.7452364444732666, "num_tokens": 3281658.0, "step": 920 }, { "entropy": 1.1171356670558452, "epoch": 0.2976357162859543, "grad_norm": 3.53125, "learning_rate": 1.5613224315677213e-05, "loss": 1.1644085884094237, "mean_token_accuracy": 0.7566865622997284, "num_tokens": 3313665.0, "step": 930 }, { "entropy": 1.1976551342755557, "epoch": 0.30083610033203984, "grad_norm": 2.71875, "learning_rate": 1.554212584429435e-05, "loss": 1.2674903869628906, "mean_token_accuracy": 0.7411434464156628, "num_tokens": 3351040.0, "step": 940 }, { "entropy": 1.1759327344596386, "epoch": 0.30403648437812536, "grad_norm": 3.140625, "learning_rate": 1.5471027372911485e-05, "loss": 1.2738938331604004, "mean_token_accuracy": 0.7425175003707409, "num_tokens": 3391557.0, "step": 950 }, { "entropy": 1.137892946600914, "epoch": 0.3072368684242109, "grad_norm": 3.34375, "learning_rate": 1.539992890152862e-05, "loss": 1.163702392578125, "mean_token_accuracy": 0.7516510836780071, "num_tokens": 3426954.0, "step": 960 }, { "entropy": 1.1136261202394961, "epoch": 0.3104372524702964, "grad_norm": 3.875, "learning_rate": 1.5328830430145753e-05, "loss": 1.1672924041748047, "mean_token_accuracy": 0.7556798778474331, "num_tokens": 3461984.0, "step": 970 }, { "entropy": 1.1157550118863582, "epoch": 0.313637636516382, "grad_norm": 3.359375, "learning_rate": 1.5257731958762888e-05, "loss": 1.177406406402588, "mean_token_accuracy": 0.7517608553171158, "num_tokens": 3496620.0, "step": 980 }, { "entropy": 1.1827008694410324, "epoch": 0.3168380205624675, "grad_norm": 3.140625, "learning_rate": 1.5186633487380022e-05, "loss": 1.2889988899230957, "mean_token_accuracy": 0.7372566133737564, "num_tokens": 3533170.0, "step": 990 }, { "entropy": 1.1758067298680543, "epoch": 0.32003840460855304, "grad_norm": 3.421875, "learning_rate": 1.5115535015997158e-05, "loss": 1.2371768951416016, "mean_token_accuracy": 0.7458655416965485, "num_tokens": 3567810.0, "step": 1000 }, { "entropy": 1.1418688822537661, "epoch": 0.32323878865463856, "grad_norm": 3.6875, "learning_rate": 1.5044436544614292e-05, "loss": 1.186594009399414, "mean_token_accuracy": 0.7467859581112861, "num_tokens": 3603353.0, "step": 1010 }, { "entropy": 1.1797917354851961, "epoch": 0.3264391727007241, "grad_norm": 2.96875, "learning_rate": 1.4973338073231428e-05, "loss": 1.2142827033996582, "mean_token_accuracy": 0.7416288331151009, "num_tokens": 3641475.0, "step": 1020 }, { "entropy": 1.1130448926240206, "epoch": 0.3296395567468096, "grad_norm": 3.109375, "learning_rate": 1.490223960184856e-05, "loss": 1.1746935844421387, "mean_token_accuracy": 0.7544396013021469, "num_tokens": 3675103.0, "step": 1030 }, { "entropy": 1.1146599553525447, "epoch": 0.33283994079289514, "grad_norm": 3.765625, "learning_rate": 1.4831141130465696e-05, "loss": 1.1683859825134277, "mean_token_accuracy": 0.7539133220911026, "num_tokens": 3710930.0, "step": 1040 }, { "entropy": 1.1133470050990582, "epoch": 0.33604032483898066, "grad_norm": 3.671875, "learning_rate": 1.4760042659082832e-05, "loss": 1.1540699005126953, "mean_token_accuracy": 0.7554305769503117, "num_tokens": 3744764.0, "step": 1050 }, { "entropy": 1.2018603175878524, "epoch": 0.3392407088850662, "grad_norm": 3.59375, "learning_rate": 1.4688944187699965e-05, "loss": 1.267392635345459, "mean_token_accuracy": 0.741713160276413, "num_tokens": 3781290.0, "step": 1060 }, { "entropy": 1.1392232250422238, "epoch": 0.3424410929311517, "grad_norm": 3.359375, "learning_rate": 1.46178457163171e-05, "loss": 1.2040764808654785, "mean_token_accuracy": 0.7544347628951072, "num_tokens": 3817138.0, "step": 1070 }, { "entropy": 1.0759797591716052, "epoch": 0.3456414769772373, "grad_norm": 3.609375, "learning_rate": 1.4546747244934237e-05, "loss": 1.1521276473999023, "mean_token_accuracy": 0.762228213250637, "num_tokens": 3852430.0, "step": 1080 }, { "entropy": 1.0658919643610716, "epoch": 0.3488418610233228, "grad_norm": 3.4375, "learning_rate": 1.4475648773551369e-05, "loss": 1.103238582611084, "mean_token_accuracy": 0.7651597328484059, "num_tokens": 3885416.0, "step": 1090 }, { "entropy": 1.1337019324302673, "epoch": 0.35204224506940834, "grad_norm": 3.234375, "learning_rate": 1.4404550302168505e-05, "loss": 1.1847347259521483, "mean_token_accuracy": 0.7472888924181461, "num_tokens": 3925885.0, "step": 1100 }, { "entropy": 1.124852604046464, "epoch": 0.35524262911549387, "grad_norm": 3.421875, "learning_rate": 1.433345183078564e-05, "loss": 1.166029167175293, "mean_token_accuracy": 0.752812971919775, "num_tokens": 3961029.0, "step": 1110 }, { "entropy": 1.1096541091799736, "epoch": 0.3584430131615794, "grad_norm": 3.21875, "learning_rate": 1.4262353359402773e-05, "loss": 1.1557273864746094, "mean_token_accuracy": 0.7548218049108982, "num_tokens": 3998345.0, "step": 1120 }, { "entropy": 1.1478759333491326, "epoch": 0.3616433972076649, "grad_norm": 3.59375, "learning_rate": 1.419125488801991e-05, "loss": 1.2064693450927735, "mean_token_accuracy": 0.7461572416126728, "num_tokens": 4032627.0, "step": 1130 }, { "entropy": 1.1037006203085185, "epoch": 0.36484378125375044, "grad_norm": 3.546875, "learning_rate": 1.4120156416637044e-05, "loss": 1.148093032836914, "mean_token_accuracy": 0.7576483316719532, "num_tokens": 4067935.0, "step": 1140 }, { "entropy": 1.1473457373678684, "epoch": 0.36804416529983597, "grad_norm": 3.375, "learning_rate": 1.404905794525418e-05, "loss": 1.2009618759155274, "mean_token_accuracy": 0.751000577956438, "num_tokens": 4105088.0, "step": 1150 }, { "entropy": 1.0734026059508324, "epoch": 0.3712445493459215, "grad_norm": 3.453125, "learning_rate": 1.3977959473871312e-05, "loss": 1.154836368560791, "mean_token_accuracy": 0.7619151666760444, "num_tokens": 4138662.0, "step": 1160 }, { "entropy": 1.106279893964529, "epoch": 0.374444933392007, "grad_norm": 3.265625, "learning_rate": 1.3906861002488448e-05, "loss": 1.1779499053955078, "mean_token_accuracy": 0.7563652314245701, "num_tokens": 4172413.0, "step": 1170 }, { "entropy": 1.1056948460638523, "epoch": 0.3776453174380926, "grad_norm": 3.5, "learning_rate": 1.3835762531105584e-05, "loss": 1.137861728668213, "mean_token_accuracy": 0.7500715628266335, "num_tokens": 4210692.0, "step": 1180 }, { "entropy": 1.0903994772583245, "epoch": 0.3808457014841781, "grad_norm": 3.09375, "learning_rate": 1.3764664059722716e-05, "loss": 1.1262723922729492, "mean_token_accuracy": 0.7594648048281669, "num_tokens": 4245849.0, "step": 1190 }, { "entropy": 1.1103523924946785, "epoch": 0.38404608553026365, "grad_norm": 3.46875, "learning_rate": 1.3693565588339852e-05, "loss": 1.1854586601257324, "mean_token_accuracy": 0.7494940027594567, "num_tokens": 4285585.0, "step": 1200 }, { "entropy": 1.2059497661888599, "epoch": 0.3872464695763492, "grad_norm": 3.609375, "learning_rate": 1.3622467116956985e-05, "loss": 1.2371363639831543, "mean_token_accuracy": 0.7376365043222904, "num_tokens": 4321004.0, "step": 1210 }, { "entropy": 1.0978240944445132, "epoch": 0.3904468536224347, "grad_norm": 3.53125, "learning_rate": 1.355136864557412e-05, "loss": 1.1326991081237794, "mean_token_accuracy": 0.7563932791352272, "num_tokens": 4354913.0, "step": 1220 }, { "entropy": 1.1807831916958094, "epoch": 0.3936472376685202, "grad_norm": 3.546875, "learning_rate": 1.3480270174191257e-05, "loss": 1.2626652717590332, "mean_token_accuracy": 0.7423581592738628, "num_tokens": 4390839.0, "step": 1230 }, { "entropy": 1.1470067836344242, "epoch": 0.39684762171460575, "grad_norm": 3.25, "learning_rate": 1.340917170280839e-05, "loss": 1.2084031105041504, "mean_token_accuracy": 0.7459581665694713, "num_tokens": 4430160.0, "step": 1240 }, { "entropy": 1.1267010770738124, "epoch": 0.40004800576069127, "grad_norm": 3.25, "learning_rate": 1.3338073231425525e-05, "loss": 1.1781652450561524, "mean_token_accuracy": 0.7555549241602421, "num_tokens": 4465773.0, "step": 1250 }, { "entropy": 1.0811494186520576, "epoch": 0.4032483898067768, "grad_norm": 3.28125, "learning_rate": 1.3266974760042661e-05, "loss": 1.105443000793457, "mean_token_accuracy": 0.7561785206198692, "num_tokens": 4506676.0, "step": 1260 }, { "entropy": 1.1555583395063878, "epoch": 0.4064487738528623, "grad_norm": 3.453125, "learning_rate": 1.3195876288659795e-05, "loss": 1.2035257339477539, "mean_token_accuracy": 0.7430454775691032, "num_tokens": 4544343.0, "step": 1270 }, { "entropy": 1.1449554897844791, "epoch": 0.40964915789894785, "grad_norm": 2.8125, "learning_rate": 1.3124777817276931e-05, "loss": 1.1892909049987792, "mean_token_accuracy": 0.7470510423183441, "num_tokens": 4580275.0, "step": 1280 }, { "entropy": 1.2319265089929103, "epoch": 0.4128495419450334, "grad_norm": 3.1875, "learning_rate": 1.3053679345894064e-05, "loss": 1.3125531196594238, "mean_token_accuracy": 0.7335422746837139, "num_tokens": 4619336.0, "step": 1290 }, { "entropy": 1.1227019898593427, "epoch": 0.41604992599111895, "grad_norm": 4.03125, "learning_rate": 1.29825808745112e-05, "loss": 1.1845033645629883, "mean_token_accuracy": 0.7563824310898781, "num_tokens": 4652166.0, "step": 1300 }, { "entropy": 1.0604043878614902, "epoch": 0.4192503100372045, "grad_norm": 3.390625, "learning_rate": 1.2911482403128335e-05, "loss": 1.100246524810791, "mean_token_accuracy": 0.7669279538094997, "num_tokens": 4684045.0, "step": 1310 }, { "entropy": 1.0832354299724103, "epoch": 0.42245069408329, "grad_norm": 3.40625, "learning_rate": 1.2840383931745468e-05, "loss": 1.1006074905395509, "mean_token_accuracy": 0.7616540372371674, "num_tokens": 4716393.0, "step": 1320 }, { "entropy": 1.1083704240620136, "epoch": 0.4256510781293755, "grad_norm": 3.5, "learning_rate": 1.2769285460362604e-05, "loss": 1.169978427886963, "mean_token_accuracy": 0.7535225711762905, "num_tokens": 4751437.0, "step": 1330 }, { "entropy": 1.0894863862544297, "epoch": 0.42885146217546105, "grad_norm": 2.96875, "learning_rate": 1.2698186988979736e-05, "loss": 1.132776641845703, "mean_token_accuracy": 0.7577138744294644, "num_tokens": 4788926.0, "step": 1340 }, { "entropy": 1.0949448980391026, "epoch": 0.4320518462215466, "grad_norm": 3.078125, "learning_rate": 1.2627088517596872e-05, "loss": 1.1491366386413575, "mean_token_accuracy": 0.7596271999180317, "num_tokens": 4825682.0, "step": 1350 }, { "entropy": 1.1359346587210895, "epoch": 0.4352522302676321, "grad_norm": 2.984375, "learning_rate": 1.2555990046214008e-05, "loss": 1.186843204498291, "mean_token_accuracy": 0.7496764816343784, "num_tokens": 4860636.0, "step": 1360 }, { "entropy": 1.1405926086008549, "epoch": 0.4384526143137176, "grad_norm": 2.765625, "learning_rate": 1.2484891574831142e-05, "loss": 1.2072190284729003, "mean_token_accuracy": 0.7515955492854118, "num_tokens": 4895008.0, "step": 1370 }, { "entropy": 1.188784885033965, "epoch": 0.44165299835980315, "grad_norm": 3.046875, "learning_rate": 1.2413793103448277e-05, "loss": 1.2465777397155762, "mean_token_accuracy": 0.7442488387227059, "num_tokens": 4934544.0, "step": 1380 }, { "entropy": 1.128134048730135, "epoch": 0.44485338240588873, "grad_norm": 3.109375, "learning_rate": 1.2342694632065411e-05, "loss": 1.1832526206970215, "mean_token_accuracy": 0.7498147763311863, "num_tokens": 4971830.0, "step": 1390 }, { "entropy": 1.0631931692361831, "epoch": 0.44805376645197426, "grad_norm": 3.234375, "learning_rate": 1.2271596160682547e-05, "loss": 1.0955133438110352, "mean_token_accuracy": 0.7623707666993141, "num_tokens": 5005602.0, "step": 1400 }, { "entropy": 1.1206502683460713, "epoch": 0.4512541504980598, "grad_norm": 3.6875, "learning_rate": 1.2200497689299681e-05, "loss": 1.1475549697875977, "mean_token_accuracy": 0.7556483931839466, "num_tokens": 5041164.0, "step": 1410 }, { "entropy": 1.1239325635135173, "epoch": 0.4544545345441453, "grad_norm": 3.109375, "learning_rate": 1.2129399217916815e-05, "loss": 1.166731357574463, "mean_token_accuracy": 0.7522053651511669, "num_tokens": 5078129.0, "step": 1420 }, { "entropy": 1.0859558291733264, "epoch": 0.45765491859023083, "grad_norm": 2.875, "learning_rate": 1.2058300746533951e-05, "loss": 1.1344684600830077, "mean_token_accuracy": 0.7648185789585114, "num_tokens": 5110323.0, "step": 1430 }, { "entropy": 1.101494075730443, "epoch": 0.46085530263631636, "grad_norm": 2.609375, "learning_rate": 1.1987202275151084e-05, "loss": 1.1418500900268556, "mean_token_accuracy": 0.7596986934542656, "num_tokens": 5145202.0, "step": 1440 }, { "entropy": 1.1369270034134389, "epoch": 0.4640556866824019, "grad_norm": 3.734375, "learning_rate": 1.191610380376822e-05, "loss": 1.1892250061035157, "mean_token_accuracy": 0.752144105732441, "num_tokens": 5179225.0, "step": 1450 }, { "entropy": 1.1221182450652123, "epoch": 0.4672560707284874, "grad_norm": 3.4375, "learning_rate": 1.1845005332385355e-05, "loss": 1.1399892807006835, "mean_token_accuracy": 0.7525438450276851, "num_tokens": 5213701.0, "step": 1460 }, { "entropy": 1.136232825368643, "epoch": 0.47045645477457293, "grad_norm": 2.890625, "learning_rate": 1.1773906861002488e-05, "loss": 1.1965130805969237, "mean_token_accuracy": 0.7524074338376522, "num_tokens": 5246772.0, "step": 1470 }, { "entropy": 1.1669704608619214, "epoch": 0.47365683882065845, "grad_norm": 3.296875, "learning_rate": 1.1702808389619624e-05, "loss": 1.2590208053588867, "mean_token_accuracy": 0.7439424701035022, "num_tokens": 5284402.0, "step": 1480 }, { "entropy": 1.1522224962711334, "epoch": 0.47685722286674403, "grad_norm": 3.234375, "learning_rate": 1.163170991823676e-05, "loss": 1.2222829818725587, "mean_token_accuracy": 0.7506221950054168, "num_tokens": 5318670.0, "step": 1490 }, { "entropy": 1.1795588433742523, "epoch": 0.48005760691282956, "grad_norm": 3.734375, "learning_rate": 1.1560611446853894e-05, "loss": 1.2275501251220704, "mean_token_accuracy": 0.7433199048042297, "num_tokens": 5353791.0, "step": 1500 }, { "entropy": 1.1336502090096474, "epoch": 0.4832579909589151, "grad_norm": 2.96875, "learning_rate": 1.1489512975471028e-05, "loss": 1.1771859169006347, "mean_token_accuracy": 0.7523209981620311, "num_tokens": 5387895.0, "step": 1510 }, { "entropy": 1.1373966462910174, "epoch": 0.4864583750050006, "grad_norm": 3.28125, "learning_rate": 1.1418414504088162e-05, "loss": 1.210038948059082, "mean_token_accuracy": 0.7523334570229053, "num_tokens": 5421253.0, "step": 1520 }, { "entropy": 1.1127303969115019, "epoch": 0.48965875905108613, "grad_norm": 3.203125, "learning_rate": 1.1347316032705298e-05, "loss": 1.1646257400512696, "mean_token_accuracy": 0.7546454407274723, "num_tokens": 5453927.0, "step": 1530 }, { "entropy": 1.0216515570878983, "epoch": 0.49285914309717166, "grad_norm": 3.734375, "learning_rate": 1.1276217561322433e-05, "loss": 1.0620564460754394, "mean_token_accuracy": 0.7721667498350143, "num_tokens": 5486994.0, "step": 1540 }, { "entropy": 1.1356555175036191, "epoch": 0.4960595271432572, "grad_norm": 3.390625, "learning_rate": 1.1205119089939567e-05, "loss": 1.1835213661193849, "mean_token_accuracy": 0.7511269651353359, "num_tokens": 5522667.0, "step": 1550 }, { "entropy": 1.1677010275423527, "epoch": 0.4992599111893427, "grad_norm": 3.25, "learning_rate": 1.1134020618556703e-05, "loss": 1.2388330459594727, "mean_token_accuracy": 0.747014632821083, "num_tokens": 5559683.0, "step": 1560 }, { "entropy": 1.0452032934874296, "epoch": 0.5024602952354282, "grad_norm": 3.09375, "learning_rate": 1.1062922147173835e-05, "loss": 1.0709638595581055, "mean_token_accuracy": 0.7606437459588051, "num_tokens": 5596318.0, "step": 1570 }, { "entropy": 1.0912953674793244, "epoch": 0.5056606792815138, "grad_norm": 3.59375, "learning_rate": 1.0991823675790971e-05, "loss": 1.1132530212402343, "mean_token_accuracy": 0.7621871262788773, "num_tokens": 5633417.0, "step": 1580 }, { "entropy": 1.0394235443323852, "epoch": 0.5088610633275993, "grad_norm": 3.734375, "learning_rate": 1.0920725204408107e-05, "loss": 1.0933416366577149, "mean_token_accuracy": 0.7706859618425369, "num_tokens": 5667849.0, "step": 1590 }, { "entropy": 1.0913284711539746, "epoch": 0.5120614473736849, "grad_norm": 3.203125, "learning_rate": 1.084962673302524e-05, "loss": 1.149476909637451, "mean_token_accuracy": 0.7546762965619565, "num_tokens": 5703443.0, "step": 1600 }, { "entropy": 1.0678091116249562, "epoch": 0.5152618314197703, "grad_norm": 3.515625, "learning_rate": 1.0778528261642376e-05, "loss": 1.117019271850586, "mean_token_accuracy": 0.764804369956255, "num_tokens": 5738612.0, "step": 1610 }, { "entropy": 1.079986510053277, "epoch": 0.5184622154658559, "grad_norm": 3.75, "learning_rate": 1.070742979025951e-05, "loss": 1.1276843070983886, "mean_token_accuracy": 0.761953490972519, "num_tokens": 5771959.0, "step": 1620 }, { "entropy": 1.1219593778252601, "epoch": 0.5216625995119414, "grad_norm": 3.3125, "learning_rate": 1.0636331318876646e-05, "loss": 1.1727846145629883, "mean_token_accuracy": 0.7556007139384746, "num_tokens": 5806127.0, "step": 1630 }, { "entropy": 1.1329836711287498, "epoch": 0.524862983558027, "grad_norm": 3.671875, "learning_rate": 1.056523284749378e-05, "loss": 1.1895696640014648, "mean_token_accuracy": 0.7470721893012524, "num_tokens": 5842096.0, "step": 1640 }, { "entropy": 1.138121072202921, "epoch": 0.5280633676041125, "grad_norm": 3.859375, "learning_rate": 1.0494134376110914e-05, "loss": 1.1915018081665039, "mean_token_accuracy": 0.7498403996229172, "num_tokens": 5879201.0, "step": 1650 }, { "entropy": 1.1121512524783612, "epoch": 0.531263751650198, "grad_norm": 3.703125, "learning_rate": 1.042303590472805e-05, "loss": 1.1451727867126464, "mean_token_accuracy": 0.7555429771542549, "num_tokens": 5914614.0, "step": 1660 }, { "entropy": 1.1279703747481107, "epoch": 0.5344641356962836, "grad_norm": 3.6875, "learning_rate": 1.0351937433345184e-05, "loss": 1.166687297821045, "mean_token_accuracy": 0.7522629871964455, "num_tokens": 5952819.0, "step": 1670 }, { "entropy": 1.077747032791376, "epoch": 0.5376645197423691, "grad_norm": 3.453125, "learning_rate": 1.0280838961962318e-05, "loss": 1.161451244354248, "mean_token_accuracy": 0.7590492330491543, "num_tokens": 5987954.0, "step": 1680 }, { "entropy": 1.1237775962799788, "epoch": 0.5408649037884546, "grad_norm": 3.90625, "learning_rate": 1.0209740490579454e-05, "loss": 1.189088726043701, "mean_token_accuracy": 0.7514919534325599, "num_tokens": 6026626.0, "step": 1690 }, { "entropy": 1.1484537214040755, "epoch": 0.5440652878345401, "grad_norm": 3.328125, "learning_rate": 1.0138642019196587e-05, "loss": 1.1888233184814454, "mean_token_accuracy": 0.7529322817921639, "num_tokens": 6061599.0, "step": 1700 }, { "entropy": 1.1195942271500825, "epoch": 0.5472656718806257, "grad_norm": 3.359375, "learning_rate": 1.0067543547813723e-05, "loss": 1.165010643005371, "mean_token_accuracy": 0.7539791353046894, "num_tokens": 6099492.0, "step": 1710 }, { "entropy": 1.105513620376587, "epoch": 0.5504660559267112, "grad_norm": 3.46875, "learning_rate": 9.996445076430857e-06, "loss": 1.1810117721557618, "mean_token_accuracy": 0.7567639537155628, "num_tokens": 6133396.0, "step": 1720 }, { "entropy": 1.0676775388419628, "epoch": 0.5536664399727967, "grad_norm": 2.953125, "learning_rate": 9.925346605047991e-06, "loss": 1.0936067581176758, "mean_token_accuracy": 0.7665429212152958, "num_tokens": 6170567.0, "step": 1730 }, { "entropy": 1.0640709735453129, "epoch": 0.5568668240188822, "grad_norm": 2.953125, "learning_rate": 9.854248133665127e-06, "loss": 1.1169232368469237, "mean_token_accuracy": 0.7632769830524921, "num_tokens": 6206392.0, "step": 1740 }, { "entropy": 1.0739900685846806, "epoch": 0.5600672080649678, "grad_norm": 3.359375, "learning_rate": 9.783149662282261e-06, "loss": 1.1153389930725097, "mean_token_accuracy": 0.7636542163789273, "num_tokens": 6240974.0, "step": 1750 }, { "entropy": 1.1187460146844388, "epoch": 0.5632675921110534, "grad_norm": 3.515625, "learning_rate": 9.712051190899396e-06, "loss": 1.213233757019043, "mean_token_accuracy": 0.7538353092968464, "num_tokens": 6276403.0, "step": 1760 }, { "entropy": 1.1634088471531867, "epoch": 0.5664679761571388, "grad_norm": 3.0, "learning_rate": 9.640952719516532e-06, "loss": 1.222030258178711, "mean_token_accuracy": 0.7500277526676655, "num_tokens": 6311555.0, "step": 1770 }, { "entropy": 1.124206557497382, "epoch": 0.5696683602032244, "grad_norm": 3.15625, "learning_rate": 9.569854248133666e-06, "loss": 1.166236114501953, "mean_token_accuracy": 0.7465378858149052, "num_tokens": 6349569.0, "step": 1780 }, { "entropy": 1.086308826133609, "epoch": 0.5728687442493099, "grad_norm": 3.921875, "learning_rate": 9.498755776750802e-06, "loss": 1.1150911331176758, "mean_token_accuracy": 0.7645099796354771, "num_tokens": 6381129.0, "step": 1790 }, { "entropy": 1.0747945971786976, "epoch": 0.5760691282953955, "grad_norm": 3.28125, "learning_rate": 9.427657305367936e-06, "loss": 1.107960319519043, "mean_token_accuracy": 0.7637169934809208, "num_tokens": 6417344.0, "step": 1800 }, { "entropy": 1.0966923542320728, "epoch": 0.5792695123414809, "grad_norm": 3.109375, "learning_rate": 9.35655883398507e-06, "loss": 1.1019758224487304, "mean_token_accuracy": 0.7635716639459134, "num_tokens": 6453097.0, "step": 1810 }, { "entropy": 1.0623582422733306, "epoch": 0.5824698963875665, "grad_norm": 3.09375, "learning_rate": 9.285460362602204e-06, "loss": 1.1345792770385743, "mean_token_accuracy": 0.7689974352717399, "num_tokens": 6485206.0, "step": 1820 }, { "entropy": 1.1150407858192921, "epoch": 0.585670280433652, "grad_norm": 3.640625, "learning_rate": 9.21436189121934e-06, "loss": 1.1899590492248535, "mean_token_accuracy": 0.7584320530295372, "num_tokens": 6518230.0, "step": 1830 }, { "entropy": 1.0844181418418883, "epoch": 0.5888706644797376, "grad_norm": 3.796875, "learning_rate": 9.143263419836474e-06, "loss": 1.1547722816467285, "mean_token_accuracy": 0.7595572479069232, "num_tokens": 6551894.0, "step": 1840 }, { "entropy": 1.137659491598606, "epoch": 0.5920710485258232, "grad_norm": 4.0625, "learning_rate": 9.072164948453609e-06, "loss": 1.215767002105713, "mean_token_accuracy": 0.7511265553534031, "num_tokens": 6586711.0, "step": 1850 }, { "entropy": 1.121223869174719, "epoch": 0.5952714325719086, "grad_norm": 3.28125, "learning_rate": 9.001066477070743e-06, "loss": 1.1829781532287598, "mean_token_accuracy": 0.753217040002346, "num_tokens": 6622616.0, "step": 1860 }, { "entropy": 1.1693847570568323, "epoch": 0.5984718166179942, "grad_norm": 3.546875, "learning_rate": 8.929968005687877e-06, "loss": 1.2190765380859374, "mean_token_accuracy": 0.7442550092935563, "num_tokens": 6657486.0, "step": 1870 }, { "entropy": 1.0904726900160313, "epoch": 0.6016722006640797, "grad_norm": 2.421875, "learning_rate": 8.858869534305013e-06, "loss": 1.1301965713500977, "mean_token_accuracy": 0.7556341625750065, "num_tokens": 6696509.0, "step": 1880 }, { "entropy": 1.085164299607277, "epoch": 0.6048725847101653, "grad_norm": 3.25, "learning_rate": 8.787771062922147e-06, "loss": 1.1311585426330566, "mean_token_accuracy": 0.7562328241765499, "num_tokens": 6733277.0, "step": 1890 }, { "entropy": 1.1221049219369887, "epoch": 0.6080729687562507, "grad_norm": 3.515625, "learning_rate": 8.716672591539283e-06, "loss": 1.151298999786377, "mean_token_accuracy": 0.7528480552136898, "num_tokens": 6771453.0, "step": 1900 }, { "entropy": 1.0780573837459086, "epoch": 0.6112733528023363, "grad_norm": 2.90625, "learning_rate": 8.645574120156417e-06, "loss": 1.1247942924499512, "mean_token_accuracy": 0.7603120274841786, "num_tokens": 6804903.0, "step": 1910 }, { "entropy": 1.2069343857467174, "epoch": 0.6144737368484218, "grad_norm": 2.78125, "learning_rate": 8.574475648773553e-06, "loss": 1.2467212677001953, "mean_token_accuracy": 0.7350850224494934, "num_tokens": 6844790.0, "step": 1920 }, { "entropy": 1.1031412109732628, "epoch": 0.6176741208945074, "grad_norm": 3.03125, "learning_rate": 8.503377177390687e-06, "loss": 1.1550896644592286, "mean_token_accuracy": 0.7549904160201549, "num_tokens": 6882003.0, "step": 1930 }, { "entropy": 1.0845932632684707, "epoch": 0.6208745049405928, "grad_norm": 3.625, "learning_rate": 8.432278706007822e-06, "loss": 1.110933780670166, "mean_token_accuracy": 0.7586763650178909, "num_tokens": 6919965.0, "step": 1940 }, { "entropy": 1.1197873912751675, "epoch": 0.6240748889866784, "grad_norm": 3.4375, "learning_rate": 8.361180234624956e-06, "loss": 1.185824203491211, "mean_token_accuracy": 0.7533484481275081, "num_tokens": 6954264.0, "step": 1950 }, { "entropy": 1.157302127033472, "epoch": 0.627275273032764, "grad_norm": 3.3125, "learning_rate": 8.29008176324209e-06, "loss": 1.1991801261901855, "mean_token_accuracy": 0.7502691283822059, "num_tokens": 6991391.0, "step": 1960 }, { "entropy": 1.1476174682378768, "epoch": 0.6304756570788494, "grad_norm": 3.1875, "learning_rate": 8.218983291859226e-06, "loss": 1.1750798225402832, "mean_token_accuracy": 0.7515600122511387, "num_tokens": 7028463.0, "step": 1970 }, { "entropy": 1.1342898778617383, "epoch": 0.633676041124935, "grad_norm": 3.328125, "learning_rate": 8.14788482047636e-06, "loss": 1.2121641159057617, "mean_token_accuracy": 0.7529564268887043, "num_tokens": 7064064.0, "step": 1980 }, { "entropy": 1.1010157510638237, "epoch": 0.6368764251710205, "grad_norm": 3.75, "learning_rate": 8.076786349093494e-06, "loss": 1.1628602981567382, "mean_token_accuracy": 0.7538565069437027, "num_tokens": 7098862.0, "step": 1990 }, { "entropy": 1.1578264623880385, "epoch": 0.6400768092171061, "grad_norm": 3.59375, "learning_rate": 8.005687877710629e-06, "loss": 1.2299229621887207, "mean_token_accuracy": 0.7478043004870415, "num_tokens": 7136374.0, "step": 2000 }, { "entropy": 1.0698354601860047, "epoch": 0.6432771932631915, "grad_norm": 3.390625, "learning_rate": 7.934589406327765e-06, "loss": 1.1068886756896972, "mean_token_accuracy": 0.7641137100756168, "num_tokens": 7169636.0, "step": 2010 }, { "entropy": 1.112225916981697, "epoch": 0.6464775773092771, "grad_norm": 3.453125, "learning_rate": 7.863490934944899e-06, "loss": 1.166696834564209, "mean_token_accuracy": 0.7522329725325108, "num_tokens": 7205044.0, "step": 2020 }, { "entropy": 1.1038395315408707, "epoch": 0.6496779613553626, "grad_norm": 3.5, "learning_rate": 7.792392463562035e-06, "loss": 1.1359478950500488, "mean_token_accuracy": 0.756668771058321, "num_tokens": 7240663.0, "step": 2030 }, { "entropy": 1.0801053799688816, "epoch": 0.6528783454014482, "grad_norm": 3.078125, "learning_rate": 7.721293992179169e-06, "loss": 1.119198989868164, "mean_token_accuracy": 0.7593862563371658, "num_tokens": 7278637.0, "step": 2040 }, { "entropy": 1.1753631062805652, "epoch": 0.6560787294475338, "grad_norm": 2.90625, "learning_rate": 7.650195520796303e-06, "loss": 1.2429065704345703, "mean_token_accuracy": 0.7447149440646171, "num_tokens": 7314162.0, "step": 2050 }, { "entropy": 1.0993228390812875, "epoch": 0.6592791134936192, "grad_norm": 3.390625, "learning_rate": 7.579097049413438e-06, "loss": 1.1387292861938476, "mean_token_accuracy": 0.7615065090358257, "num_tokens": 7349124.0, "step": 2060 }, { "entropy": 1.1077005062252283, "epoch": 0.6624794975397048, "grad_norm": 3.84375, "learning_rate": 7.507998578030573e-06, "loss": 1.2013302803039552, "mean_token_accuracy": 0.7560870915651321, "num_tokens": 7383405.0, "step": 2070 }, { "entropy": 1.1307024940848351, "epoch": 0.6656798815857903, "grad_norm": 4.28125, "learning_rate": 7.4369001066477075e-06, "loss": 1.198493766784668, "mean_token_accuracy": 0.7485630966722965, "num_tokens": 7414714.0, "step": 2080 }, { "entropy": 1.1086504600942135, "epoch": 0.6688802656318759, "grad_norm": 3.59375, "learning_rate": 7.365801635264842e-06, "loss": 1.1572361946105958, "mean_token_accuracy": 0.7570925623178482, "num_tokens": 7451556.0, "step": 2090 }, { "entropy": 1.0650083281099796, "epoch": 0.6720806496779613, "grad_norm": 3.109375, "learning_rate": 7.294703163881978e-06, "loss": 1.124489688873291, "mean_token_accuracy": 0.7592034861445427, "num_tokens": 7491824.0, "step": 2100 }, { "entropy": 1.160896249115467, "epoch": 0.6752810337240469, "grad_norm": 3.8125, "learning_rate": 7.223604692499112e-06, "loss": 1.2408259391784668, "mean_token_accuracy": 0.7528047002851963, "num_tokens": 7522213.0, "step": 2110 }, { "entropy": 1.131654118001461, "epoch": 0.6784814177701324, "grad_norm": 3.40625, "learning_rate": 7.152506221116247e-06, "loss": 1.1762347221374512, "mean_token_accuracy": 0.7540035150945187, "num_tokens": 7556942.0, "step": 2120 }, { "entropy": 1.1728335734456778, "epoch": 0.681681801816218, "grad_norm": 2.828125, "learning_rate": 7.081407749733381e-06, "loss": 1.2240229606628419, "mean_token_accuracy": 0.7472974568605423, "num_tokens": 7592279.0, "step": 2130 }, { "entropy": 1.1371040247380733, "epoch": 0.6848821858623034, "grad_norm": 3.5, "learning_rate": 7.010309278350515e-06, "loss": 1.1692868232727052, "mean_token_accuracy": 0.7444953367114067, "num_tokens": 7631064.0, "step": 2140 }, { "entropy": 1.079392648115754, "epoch": 0.688082569908389, "grad_norm": 3.5625, "learning_rate": 6.939210806967651e-06, "loss": 1.1272685050964355, "mean_token_accuracy": 0.7608507804572582, "num_tokens": 7663853.0, "step": 2150 }, { "entropy": 1.1790861997753381, "epoch": 0.6912829539544746, "grad_norm": 4.0, "learning_rate": 6.8681123355847855e-06, "loss": 1.271801471710205, "mean_token_accuracy": 0.7439754210412503, "num_tokens": 7699593.0, "step": 2160 }, { "entropy": 1.1712711922824384, "epoch": 0.6944833380005601, "grad_norm": 3.359375, "learning_rate": 6.79701386420192e-06, "loss": 1.2302053451538086, "mean_token_accuracy": 0.7436926513910294, "num_tokens": 7735279.0, "step": 2170 }, { "entropy": 1.0742683559656143, "epoch": 0.6976837220466456, "grad_norm": 3.28125, "learning_rate": 6.725915392819055e-06, "loss": 1.1179491043090821, "mean_token_accuracy": 0.7624569363892079, "num_tokens": 7771538.0, "step": 2180 }, { "entropy": 1.1455774445086717, "epoch": 0.7008841060927311, "grad_norm": 3.703125, "learning_rate": 6.65481692143619e-06, "loss": 1.210339641571045, "mean_token_accuracy": 0.750506728887558, "num_tokens": 7805334.0, "step": 2190 }, { "entropy": 1.1600065805017947, "epoch": 0.7040844901388167, "grad_norm": 3.296875, "learning_rate": 6.583718450053325e-06, "loss": 1.2067691802978515, "mean_token_accuracy": 0.7510503888130188, "num_tokens": 7838406.0, "step": 2200 }, { "entropy": 1.1392403941601514, "epoch": 0.7072848741849022, "grad_norm": 3.40625, "learning_rate": 6.512619978670459e-06, "loss": 1.162048053741455, "mean_token_accuracy": 0.7528949834406375, "num_tokens": 7871227.0, "step": 2210 }, { "entropy": 1.0721043154597283, "epoch": 0.7104852582309877, "grad_norm": 3.03125, "learning_rate": 6.441521507287593e-06, "loss": 1.1128012657165527, "mean_token_accuracy": 0.7630540691316128, "num_tokens": 7904703.0, "step": 2220 }, { "entropy": 1.0537261202931405, "epoch": 0.7136856422770732, "grad_norm": 3.078125, "learning_rate": 6.3704230359047284e-06, "loss": 1.0881397247314453, "mean_token_accuracy": 0.7647965393960476, "num_tokens": 7943799.0, "step": 2230 }, { "entropy": 1.1213313553482294, "epoch": 0.7168860263231588, "grad_norm": 3.09375, "learning_rate": 6.2993245645218635e-06, "loss": 1.161877155303955, "mean_token_accuracy": 0.7525055252015591, "num_tokens": 7979863.0, "step": 2240 }, { "entropy": 1.2231854621320963, "epoch": 0.7200864103692443, "grad_norm": 3.5625, "learning_rate": 6.2282260931389986e-06, "loss": 1.305109691619873, "mean_token_accuracy": 0.7315145306289196, "num_tokens": 8016742.0, "step": 2250 }, { "entropy": 1.0974082320928573, "epoch": 0.7232867944153298, "grad_norm": 2.9375, "learning_rate": 6.157127621756133e-06, "loss": 1.150672149658203, "mean_token_accuracy": 0.7546444937586785, "num_tokens": 8053669.0, "step": 2260 }, { "entropy": 1.1266177907586097, "epoch": 0.7264871784614154, "grad_norm": 3.265625, "learning_rate": 6.086029150373267e-06, "loss": 1.2110174179077149, "mean_token_accuracy": 0.7550385102629662, "num_tokens": 8087480.0, "step": 2270 }, { "entropy": 1.135270792245865, "epoch": 0.7296875625075009, "grad_norm": 3.21875, "learning_rate": 6.014930678990403e-06, "loss": 1.1860703468322753, "mean_token_accuracy": 0.7481087513267994, "num_tokens": 8123625.0, "step": 2280 }, { "entropy": 1.14946624673903, "epoch": 0.7328879465535865, "grad_norm": 3.453125, "learning_rate": 5.943832207607537e-06, "loss": 1.190632438659668, "mean_token_accuracy": 0.7547764800488949, "num_tokens": 8156665.0, "step": 2290 }, { "entropy": 1.1558411501348018, "epoch": 0.7360883305996719, "grad_norm": 3.1875, "learning_rate": 5.872733736224671e-06, "loss": 1.2208381652832032, "mean_token_accuracy": 0.7456505544483661, "num_tokens": 8193545.0, "step": 2300 }, { "entropy": 1.0852365911006927, "epoch": 0.7392887146457575, "grad_norm": 3.15625, "learning_rate": 5.801635264841806e-06, "loss": 1.1065022468566894, "mean_token_accuracy": 0.7572917930781842, "num_tokens": 8226934.0, "step": 2310 }, { "entropy": 1.0914320670068265, "epoch": 0.742489098691843, "grad_norm": 3.78125, "learning_rate": 5.730536793458941e-06, "loss": 1.099323844909668, "mean_token_accuracy": 0.7600689142942428, "num_tokens": 8260774.0, "step": 2320 }, { "entropy": 1.1091071009635924, "epoch": 0.7456894827379286, "grad_norm": 3.078125, "learning_rate": 5.6594383220760765e-06, "loss": 1.1712286949157715, "mean_token_accuracy": 0.7567473009228707, "num_tokens": 8295211.0, "step": 2330 }, { "entropy": 1.1220351219177247, "epoch": 0.748889866784014, "grad_norm": 3.140625, "learning_rate": 5.588339850693211e-06, "loss": 1.1657176971435548, "mean_token_accuracy": 0.7564576506614685, "num_tokens": 8330743.0, "step": 2340 }, { "entropy": 1.0823850885033608, "epoch": 0.7520902508300996, "grad_norm": 3.796875, "learning_rate": 5.517241379310345e-06, "loss": 1.1302215576171875, "mean_token_accuracy": 0.7629231609404087, "num_tokens": 8363593.0, "step": 2350 }, { "entropy": 1.114680102840066, "epoch": 0.7552906348761852, "grad_norm": 3.390625, "learning_rate": 5.44614290792748e-06, "loss": 1.176011848449707, "mean_token_accuracy": 0.7503922112286091, "num_tokens": 8402137.0, "step": 2360 }, { "entropy": 1.0473700985312462, "epoch": 0.7584910189222707, "grad_norm": 3.859375, "learning_rate": 5.375044436544615e-06, "loss": 1.085726547241211, "mean_token_accuracy": 0.7641149386763573, "num_tokens": 8438324.0, "step": 2370 }, { "entropy": 1.1461260944604874, "epoch": 0.7616914029683562, "grad_norm": 3.21875, "learning_rate": 5.303945965161749e-06, "loss": 1.2125227928161622, "mean_token_accuracy": 0.7528879292309284, "num_tokens": 8474170.0, "step": 2380 }, { "entropy": 1.1439074050635099, "epoch": 0.7648917870144417, "grad_norm": 3.5, "learning_rate": 5.232847493778884e-06, "loss": 1.1473745346069335, "mean_token_accuracy": 0.7443250894546509, "num_tokens": 8513458.0, "step": 2390 }, { "entropy": 1.0630555912852286, "epoch": 0.7680921710605273, "grad_norm": 3.5, "learning_rate": 5.161749022396019e-06, "loss": 1.1160799980163574, "mean_token_accuracy": 0.7668336167931556, "num_tokens": 8547193.0, "step": 2400 }, { "entropy": 1.0855234183371067, "epoch": 0.7712925551066128, "grad_norm": 3.171875, "learning_rate": 5.090650551013153e-06, "loss": 1.1209659576416016, "mean_token_accuracy": 0.7573182880878448, "num_tokens": 8583593.0, "step": 2410 }, { "entropy": 1.16197330057621, "epoch": 0.7744929391526983, "grad_norm": 3.4375, "learning_rate": 5.019552079630289e-06, "loss": 1.234616184234619, "mean_token_accuracy": 0.7473996456712484, "num_tokens": 8619710.0, "step": 2420 }, { "entropy": 1.2096669979393482, "epoch": 0.7776933231987838, "grad_norm": 3.421875, "learning_rate": 4.948453608247423e-06, "loss": 1.2796695709228516, "mean_token_accuracy": 0.7381796896457672, "num_tokens": 8657019.0, "step": 2430 }, { "entropy": 1.1043912775814533, "epoch": 0.7808937072448694, "grad_norm": 3.5, "learning_rate": 4.877355136864558e-06, "loss": 1.121436882019043, "mean_token_accuracy": 0.75357426404953, "num_tokens": 8693681.0, "step": 2440 }, { "entropy": 1.0841567002236843, "epoch": 0.7840940912909549, "grad_norm": 2.859375, "learning_rate": 4.806256665481693e-06, "loss": 1.104970645904541, "mean_token_accuracy": 0.7571829192340374, "num_tokens": 8730108.0, "step": 2450 }, { "entropy": 1.126195802539587, "epoch": 0.7872944753370404, "grad_norm": 3.359375, "learning_rate": 4.735158194098827e-06, "loss": 1.1975386619567872, "mean_token_accuracy": 0.7514684118330479, "num_tokens": 8764461.0, "step": 2460 }, { "entropy": 1.0726923126727343, "epoch": 0.790494859383126, "grad_norm": 3.90625, "learning_rate": 4.6640597227159615e-06, "loss": 1.1125378608703613, "mean_token_accuracy": 0.7626473598182202, "num_tokens": 8799890.0, "step": 2470 }, { "entropy": 1.1773266084492207, "epoch": 0.7936952434292115, "grad_norm": 3.4375, "learning_rate": 4.592961251333097e-06, "loss": 1.2108798980712892, "mean_token_accuracy": 0.7410904221236706, "num_tokens": 8838818.0, "step": 2480 }, { "entropy": 1.090137529373169, "epoch": 0.7968956274752971, "grad_norm": 3.59375, "learning_rate": 4.521862779950232e-06, "loss": 1.1148558616638184, "mean_token_accuracy": 0.7648926541209221, "num_tokens": 8870816.0, "step": 2490 }, { "entropy": 1.1689164392650127, "epoch": 0.8000960115213825, "grad_norm": 2.890625, "learning_rate": 4.450764308567366e-06, "loss": 1.2032492637634278, "mean_token_accuracy": 0.7398371711373329, "num_tokens": 8909484.0, "step": 2500 }, { "entropy": 1.0879596583545208, "epoch": 0.8032963955674681, "grad_norm": 3.203125, "learning_rate": 4.379665837184501e-06, "loss": 1.1078178405761718, "mean_token_accuracy": 0.7553422212600708, "num_tokens": 8944951.0, "step": 2510 }, { "entropy": 1.1411900214850903, "epoch": 0.8064967796135536, "grad_norm": 3.875, "learning_rate": 4.308567365801636e-06, "loss": 1.1979658126831054, "mean_token_accuracy": 0.7543410055339337, "num_tokens": 8979216.0, "step": 2520 }, { "entropy": 1.1815967209637166, "epoch": 0.8096971636596392, "grad_norm": 3.46875, "learning_rate": 4.23746889441877e-06, "loss": 1.2603289604187011, "mean_token_accuracy": 0.7485571041703224, "num_tokens": 9011929.0, "step": 2530 }, { "entropy": 1.1050000466406344, "epoch": 0.8128975477057246, "grad_norm": 3.328125, "learning_rate": 4.166370423035905e-06, "loss": 1.1503895759582519, "mean_token_accuracy": 0.7591159790754318, "num_tokens": 9045737.0, "step": 2540 }, { "entropy": 1.046723449230194, "epoch": 0.8160979317518102, "grad_norm": 3.1875, "learning_rate": 4.0952719516530395e-06, "loss": 1.0639203071594239, "mean_token_accuracy": 0.7683053657412529, "num_tokens": 9079676.0, "step": 2550 }, { "entropy": 1.1944607935845852, "epoch": 0.8192983157978957, "grad_norm": 3.125, "learning_rate": 4.024173480270175e-06, "loss": 1.247727394104004, "mean_token_accuracy": 0.7391177780926228, "num_tokens": 9114644.0, "step": 2560 }, { "entropy": 1.1602688152343035, "epoch": 0.8224986998439813, "grad_norm": 3.296875, "learning_rate": 3.95307500888731e-06, "loss": 1.2294767379760743, "mean_token_accuracy": 0.7495340570807457, "num_tokens": 9152236.0, "step": 2570 }, { "entropy": 1.2158122390508652, "epoch": 0.8256990838900669, "grad_norm": 2.90625, "learning_rate": 3.881976537504444e-06, "loss": 1.2398143768310548, "mean_token_accuracy": 0.7380207255482674, "num_tokens": 9190733.0, "step": 2580 }, { "entropy": 1.1768857415765523, "epoch": 0.8288994679361523, "grad_norm": 4.21875, "learning_rate": 3.810878066121579e-06, "loss": 1.2839090347290039, "mean_token_accuracy": 0.7433359183371067, "num_tokens": 9225408.0, "step": 2590 }, { "entropy": 1.0817514464259148, "epoch": 0.8320998519822379, "grad_norm": 2.890625, "learning_rate": 3.739779594738713e-06, "loss": 1.1311766624450683, "mean_token_accuracy": 0.7620703734457492, "num_tokens": 9259655.0, "step": 2600 }, { "entropy": 1.1603660874068737, "epoch": 0.8353002360283234, "grad_norm": 2.921875, "learning_rate": 3.6686811233558482e-06, "loss": 1.2468878746032714, "mean_token_accuracy": 0.7444131776690484, "num_tokens": 9296792.0, "step": 2610 }, { "entropy": 1.1298386432230472, "epoch": 0.838500620074409, "grad_norm": 3.1875, "learning_rate": 3.597582651972983e-06, "loss": 1.1794001579284668, "mean_token_accuracy": 0.7496243976056576, "num_tokens": 9333174.0, "step": 2620 }, { "entropy": 1.1448624573647976, "epoch": 0.8417010041204944, "grad_norm": 3.125, "learning_rate": 3.526484180590118e-06, "loss": 1.1680842399597169, "mean_token_accuracy": 0.7462442465126514, "num_tokens": 9374875.0, "step": 2630 }, { "entropy": 1.1212282598018646, "epoch": 0.84490138816658, "grad_norm": 3.5, "learning_rate": 3.455385709207252e-06, "loss": 1.18281888961792, "mean_token_accuracy": 0.7593762136995792, "num_tokens": 9408490.0, "step": 2640 }, { "entropy": 1.1325732119381429, "epoch": 0.8481017722126655, "grad_norm": 3.578125, "learning_rate": 3.384287237824387e-06, "loss": 1.1580286979675294, "mean_token_accuracy": 0.7503605335950851, "num_tokens": 9443447.0, "step": 2650 }, { "entropy": 1.142949765175581, "epoch": 0.851302156258751, "grad_norm": 3.203125, "learning_rate": 3.313188766441522e-06, "loss": 1.1941743850708009, "mean_token_accuracy": 0.752988663315773, "num_tokens": 9478354.0, "step": 2660 }, { "entropy": 1.1249619655311107, "epoch": 0.8545025403048366, "grad_norm": 3.46875, "learning_rate": 3.2420902950586565e-06, "loss": 1.2092914581298828, "mean_token_accuracy": 0.7525562759488821, "num_tokens": 9517475.0, "step": 2670 }, { "entropy": 1.1741073250770568, "epoch": 0.8577029243509221, "grad_norm": 3.578125, "learning_rate": 3.1709918236757916e-06, "loss": 1.262247371673584, "mean_token_accuracy": 0.7427960857748985, "num_tokens": 9553289.0, "step": 2680 }, { "entropy": 1.105969700962305, "epoch": 0.8609033083970077, "grad_norm": 3.3125, "learning_rate": 3.0998933522929258e-06, "loss": 1.1461322784423829, "mean_token_accuracy": 0.75559606179595, "num_tokens": 9588549.0, "step": 2690 }, { "entropy": 1.1349318251013756, "epoch": 0.8641036924430932, "grad_norm": 3.078125, "learning_rate": 3.028794880910061e-06, "loss": 1.1659625053405762, "mean_token_accuracy": 0.7462083771824837, "num_tokens": 9625305.0, "step": 2700 }, { "entropy": 1.0998256973922254, "epoch": 0.8673040764891787, "grad_norm": 2.90625, "learning_rate": 2.9576964095271955e-06, "loss": 1.173351001739502, "mean_token_accuracy": 0.7538725100457668, "num_tokens": 9663574.0, "step": 2710 }, { "entropy": 1.1989767000079155, "epoch": 0.8705044605352642, "grad_norm": 3.515625, "learning_rate": 2.8865979381443297e-06, "loss": 1.278292465209961, "mean_token_accuracy": 0.737822500616312, "num_tokens": 9699248.0, "step": 2720 }, { "entropy": 1.131580077856779, "epoch": 0.8737048445813498, "grad_norm": 3.1875, "learning_rate": 2.8154994667614648e-06, "loss": 1.1636852264404296, "mean_token_accuracy": 0.7542126163840294, "num_tokens": 9733347.0, "step": 2730 }, { "entropy": 1.0964635238051414, "epoch": 0.8769052286274353, "grad_norm": 3.6875, "learning_rate": 2.7444009953785994e-06, "loss": 1.1526992797851563, "mean_token_accuracy": 0.7599952027201653, "num_tokens": 9770524.0, "step": 2740 }, { "entropy": 1.0702364332973957, "epoch": 0.8801056126735208, "grad_norm": 3.59375, "learning_rate": 2.6733025239957345e-06, "loss": 1.0925715446472168, "mean_token_accuracy": 0.7613530211150646, "num_tokens": 9805904.0, "step": 2750 }, { "entropy": 1.143309585005045, "epoch": 0.8833059967196063, "grad_norm": 3.4375, "learning_rate": 2.6022040526128687e-06, "loss": 1.185093879699707, "mean_token_accuracy": 0.748717375099659, "num_tokens": 9843097.0, "step": 2760 }, { "entropy": 1.1525050312280656, "epoch": 0.8865063807656919, "grad_norm": 3.484375, "learning_rate": 2.5311055812300038e-06, "loss": 1.186710262298584, "mean_token_accuracy": 0.7498737536370754, "num_tokens": 9878625.0, "step": 2770 }, { "entropy": 1.096405889093876, "epoch": 0.8897067648117775, "grad_norm": 3.0625, "learning_rate": 2.4600071098471384e-06, "loss": 1.1552643775939941, "mean_token_accuracy": 0.7564327225089074, "num_tokens": 9913940.0, "step": 2780 }, { "entropy": 1.075688973069191, "epoch": 0.8929071488578629, "grad_norm": 3.59375, "learning_rate": 2.388908638464273e-06, "loss": 1.0996969223022461, "mean_token_accuracy": 0.7608482711017132, "num_tokens": 9950221.0, "step": 2790 }, { "entropy": 1.1116474494338036, "epoch": 0.8961075329039485, "grad_norm": 3.578125, "learning_rate": 2.317810167081408e-06, "loss": 1.183712863922119, "mean_token_accuracy": 0.7586163900792599, "num_tokens": 9982826.0, "step": 2800 }, { "entropy": 1.1222521997988224, "epoch": 0.899307916950034, "grad_norm": 3.296875, "learning_rate": 2.2467116956985428e-06, "loss": 1.1775464057922362, "mean_token_accuracy": 0.7527868509292602, "num_tokens": 10018325.0, "step": 2810 }, { "entropy": 1.12875221632421, "epoch": 0.9025083009961196, "grad_norm": 3.328125, "learning_rate": 2.1756132243156774e-06, "loss": 1.206295108795166, "mean_token_accuracy": 0.7542196542024613, "num_tokens": 10052547.0, "step": 2820 }, { "entropy": 1.1360722210258245, "epoch": 0.905708685042205, "grad_norm": 3.515625, "learning_rate": 2.104514752932812e-06, "loss": 1.1869568824768066, "mean_token_accuracy": 0.7474234350025654, "num_tokens": 10091594.0, "step": 2830 }, { "entropy": 1.0468792729079723, "epoch": 0.9089090690882906, "grad_norm": 3.703125, "learning_rate": 2.033416281549947e-06, "loss": 1.0732879638671875, "mean_token_accuracy": 0.7691854566335679, "num_tokens": 10126242.0, "step": 2840 }, { "entropy": 1.1514717623591424, "epoch": 0.9121094531343761, "grad_norm": 3.265625, "learning_rate": 1.9623178101670813e-06, "loss": 1.196326732635498, "mean_token_accuracy": 0.7465457141399383, "num_tokens": 10162663.0, "step": 2850 }, { "entropy": 1.1170444838702678, "epoch": 0.9153098371804617, "grad_norm": 2.8125, "learning_rate": 1.8912193387842162e-06, "loss": 1.1753318786621094, "mean_token_accuracy": 0.7546933814883232, "num_tokens": 10199344.0, "step": 2860 }, { "entropy": 1.1827090494334698, "epoch": 0.9185102212265472, "grad_norm": 3.625, "learning_rate": 1.820120867401351e-06, "loss": 1.2415277481079101, "mean_token_accuracy": 0.739153602719307, "num_tokens": 10233777.0, "step": 2870 }, { "entropy": 1.0766679864376782, "epoch": 0.9217106052726327, "grad_norm": 3.6875, "learning_rate": 1.7490223960184857e-06, "loss": 1.1411251068115233, "mean_token_accuracy": 0.7570614032447338, "num_tokens": 10270302.0, "step": 2880 }, { "entropy": 1.0990701586008071, "epoch": 0.9249109893187183, "grad_norm": 3.421875, "learning_rate": 1.6779239246356205e-06, "loss": 1.1710631370544433, "mean_token_accuracy": 0.7585064023733139, "num_tokens": 10305178.0, "step": 2890 }, { "entropy": 1.0720692560076714, "epoch": 0.9281113733648038, "grad_norm": 3.21875, "learning_rate": 1.6068254532527552e-06, "loss": 1.0985607147216796, "mean_token_accuracy": 0.7623618088662625, "num_tokens": 10341351.0, "step": 2900 }, { "entropy": 1.0809118885546922, "epoch": 0.9313117574108893, "grad_norm": 3.34375, "learning_rate": 1.53572698186989e-06, "loss": 1.1065154075622559, "mean_token_accuracy": 0.7592159628868103, "num_tokens": 10378308.0, "step": 2910 }, { "entropy": 1.0883469644933939, "epoch": 0.9345121414569748, "grad_norm": 3.140625, "learning_rate": 1.4646285104870247e-06, "loss": 1.1307219505310058, "mean_token_accuracy": 0.7604426823556423, "num_tokens": 10411774.0, "step": 2920 }, { "entropy": 1.1618533357977867, "epoch": 0.9377125255030604, "grad_norm": 3.75, "learning_rate": 1.3935300391041593e-06, "loss": 1.2212342262268066, "mean_token_accuracy": 0.746428107470274, "num_tokens": 10447555.0, "step": 2930 }, { "entropy": 1.0985857374966144, "epoch": 0.9409129095491459, "grad_norm": 3.1875, "learning_rate": 1.322431567721294e-06, "loss": 1.1086782455444335, "mean_token_accuracy": 0.7579902283847332, "num_tokens": 10485342.0, "step": 2940 }, { "entropy": 1.113938895612955, "epoch": 0.9441132935952314, "grad_norm": 3.4375, "learning_rate": 1.2513330963384288e-06, "loss": 1.1549474716186523, "mean_token_accuracy": 0.7552253149449826, "num_tokens": 10519459.0, "step": 2950 }, { "entropy": 1.1388332910835743, "epoch": 0.9473136776413169, "grad_norm": 3.234375, "learning_rate": 1.1802346249555635e-06, "loss": 1.213517189025879, "mean_token_accuracy": 0.7471270561218262, "num_tokens": 10555227.0, "step": 2960 }, { "entropy": 1.0419878501445055, "epoch": 0.9505140616874025, "grad_norm": 3.359375, "learning_rate": 1.1091361535726983e-06, "loss": 1.085500717163086, "mean_token_accuracy": 0.7708059817552566, "num_tokens": 10590479.0, "step": 2970 }, { "entropy": 1.1476553842425345, "epoch": 0.9537144457334881, "grad_norm": 3.40625, "learning_rate": 1.038037682189833e-06, "loss": 1.1976530075073242, "mean_token_accuracy": 0.7469619035720825, "num_tokens": 10626605.0, "step": 2980 }, { "entropy": 1.126973857730627, "epoch": 0.9569148297795735, "grad_norm": 3.578125, "learning_rate": 9.669392108069678e-07, "loss": 1.1434929847717286, "mean_token_accuracy": 0.7535457745194435, "num_tokens": 10660781.0, "step": 2990 }, { "entropy": 1.0904895570129156, "epoch": 0.9601152138256591, "grad_norm": 3.59375, "learning_rate": 8.958407394241024e-07, "loss": 1.144233798980713, "mean_token_accuracy": 0.7603662610054016, "num_tokens": 10695321.0, "step": 3000 }, { "entropy": 1.0829311583191157, "epoch": 0.9633155978717446, "grad_norm": 3.3125, "learning_rate": 8.247422680412372e-07, "loss": 1.1176697731018066, "mean_token_accuracy": 0.7594211801886559, "num_tokens": 10730739.0, "step": 3010 }, { "entropy": 1.1191859498620034, "epoch": 0.9665159819178302, "grad_norm": 3.9375, "learning_rate": 7.536437966583719e-07, "loss": 1.1339409828186036, "mean_token_accuracy": 0.7513566389679909, "num_tokens": 10765642.0, "step": 3020 }, { "entropy": 1.1836695678532123, "epoch": 0.9697163659639156, "grad_norm": 3.296875, "learning_rate": 6.825453252755067e-07, "loss": 1.2448589324951171, "mean_token_accuracy": 0.7450046464800835, "num_tokens": 10798289.0, "step": 3030 }, { "entropy": 1.12890649959445, "epoch": 0.9729167500100012, "grad_norm": 3.078125, "learning_rate": 6.114468538926413e-07, "loss": 1.1511384010314942, "mean_token_accuracy": 0.7531974203884602, "num_tokens": 10833449.0, "step": 3040 }, { "entropy": 1.148883668333292, "epoch": 0.9761171340560867, "grad_norm": 3.1875, "learning_rate": 5.403483825097761e-07, "loss": 1.2151781082153321, "mean_token_accuracy": 0.7502546660602093, "num_tokens": 10868447.0, "step": 3050 }, { "entropy": 1.0672550223767758, "epoch": 0.9793175181021723, "grad_norm": 3.109375, "learning_rate": 4.6924991112691083e-07, "loss": 1.082494354248047, "mean_token_accuracy": 0.7678111597895623, "num_tokens": 10901598.0, "step": 3060 }, { "entropy": 1.042473478242755, "epoch": 0.9825179021482577, "grad_norm": 3.6875, "learning_rate": 3.9815143974404553e-07, "loss": 1.114789867401123, "mean_token_accuracy": 0.772429596632719, "num_tokens": 10933312.0, "step": 3070 }, { "entropy": 1.1300311595201493, "epoch": 0.9857182861943433, "grad_norm": 3.640625, "learning_rate": 3.270529683611803e-07, "loss": 1.2087718009948731, "mean_token_accuracy": 0.7560340866446496, "num_tokens": 10966726.0, "step": 3080 }, { "entropy": 1.1198654279112816, "epoch": 0.9889186702404289, "grad_norm": 3.484375, "learning_rate": 2.5595449697831497e-07, "loss": 1.1944404602050782, "mean_token_accuracy": 0.7567917600274086, "num_tokens": 11002300.0, "step": 3090 }, { "entropy": 1.1630706571042537, "epoch": 0.9921190542865144, "grad_norm": 3.734375, "learning_rate": 1.8485602559544972e-07, "loss": 1.2107239723205567, "mean_token_accuracy": 0.7448431417346001, "num_tokens": 11039145.0, "step": 3100 }, { "entropy": 1.0874366093426944, "epoch": 0.9953194383326, "grad_norm": 3.328125, "learning_rate": 1.1375755421258444e-07, "loss": 1.1232175827026367, "mean_token_accuracy": 0.7573442026972771, "num_tokens": 11074957.0, "step": 3110 }, { "entropy": 1.163031455129385, "epoch": 0.9985198223786854, "grad_norm": 3.140625, "learning_rate": 4.265908282971917e-08, "loss": 1.1890130996704102, "mean_token_accuracy": 0.7419414661824704, "num_tokens": 11114151.0, "step": 3120 } ], "logging_steps": 10, "max_steps": 3125, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.2571499019753062e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }