Files
general_knowledge_model/checkpoint-3125/trainer_state.json
ModelHub XC e7f998cf6d 初始化项目,由ModelHub XC社区提供模型
Model: cs-552-2026-the-transformers/general_knowledge_model
Source: Original Platform
2026-07-20 05:53:10 +08:00

3155 lines
90 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 3125,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.2839297465980053,
"epoch": 0.00320038404608553,
"grad_norm": 73.0,
"learning_rate": 5.76923076923077e-07,
"loss": 1.9901968002319337,
"mean_token_accuracy": 0.6237266078591347,
"num_tokens": 33961.0,
"step": 10
},
{
"entropy": 1.2595087066292763,
"epoch": 0.00640076809217106,
"grad_norm": 64.5,
"learning_rate": 1.217948717948718e-06,
"loss": 1.8751590728759766,
"mean_token_accuracy": 0.6309439569711686,
"num_tokens": 71819.0,
"step": 20
},
{
"entropy": 1.2931475669145585,
"epoch": 0.00960115213825659,
"grad_norm": 22.625,
"learning_rate": 1.8589743589743592e-06,
"loss": 1.7506515502929687,
"mean_token_accuracy": 0.6388503693044185,
"num_tokens": 112770.0,
"step": 30
},
{
"entropy": 1.2734985046088696,
"epoch": 0.01280153618434212,
"grad_norm": 23.75,
"learning_rate": 2.5e-06,
"loss": 1.6540241241455078,
"mean_token_accuracy": 0.657498425245285,
"num_tokens": 146669.0,
"step": 40
},
{
"entropy": 1.287195574492216,
"epoch": 0.016001920230427652,
"grad_norm": 13.3125,
"learning_rate": 3.141025641025641e-06,
"loss": 1.5025008201599122,
"mean_token_accuracy": 0.6669101666659116,
"num_tokens": 183443.0,
"step": 50
},
{
"entropy": 1.3111741445958613,
"epoch": 0.01920230427651318,
"grad_norm": 6.46875,
"learning_rate": 3.782051282051282e-06,
"loss": 1.485818862915039,
"mean_token_accuracy": 0.685324776172638,
"num_tokens": 219455.0,
"step": 60
},
{
"entropy": 1.2205842301249503,
"epoch": 0.022402688322598712,
"grad_norm": 4.8125,
"learning_rate": 4.423076923076924e-06,
"loss": 1.3609664916992188,
"mean_token_accuracy": 0.7222387321293354,
"num_tokens": 253077.0,
"step": 70
},
{
"entropy": 1.2416748367249966,
"epoch": 0.02560307236868424,
"grad_norm": 5.15625,
"learning_rate": 5.064102564102565e-06,
"loss": 1.3642989158630372,
"mean_token_accuracy": 0.7237147346138955,
"num_tokens": 287333.0,
"step": 80
},
{
"entropy": 1.2347557865083219,
"epoch": 0.028803456414769772,
"grad_norm": 4.4375,
"learning_rate": 5.705128205128206e-06,
"loss": 1.3442096710205078,
"mean_token_accuracy": 0.7320359282195568,
"num_tokens": 319994.0,
"step": 90
},
{
"entropy": 1.298496885597706,
"epoch": 0.032003840460855304,
"grad_norm": 4.71875,
"learning_rate": 6.3461538461538466e-06,
"loss": 1.3953542709350586,
"mean_token_accuracy": 0.720856224745512,
"num_tokens": 353798.0,
"step": 100
},
{
"entropy": 1.283773996680975,
"epoch": 0.035204224506940836,
"grad_norm": 3.78125,
"learning_rate": 6.9871794871794876e-06,
"loss": 1.3582657814025878,
"mean_token_accuracy": 0.7274449437856674,
"num_tokens": 387975.0,
"step": 110
},
{
"entropy": 1.2386538445949555,
"epoch": 0.03840460855302636,
"grad_norm": 3.96875,
"learning_rate": 7.6282051282051286e-06,
"loss": 1.2965816497802733,
"mean_token_accuracy": 0.7260297447443008,
"num_tokens": 426086.0,
"step": 120
},
{
"entropy": 1.2428459793329238,
"epoch": 0.04160499259911189,
"grad_norm": 4.6875,
"learning_rate": 8.26923076923077e-06,
"loss": 1.3305319786071776,
"mean_token_accuracy": 0.7313816711306572,
"num_tokens": 459435.0,
"step": 130
},
{
"entropy": 1.2068071104586124,
"epoch": 0.044805376645197424,
"grad_norm": 4.59375,
"learning_rate": 8.910256410256411e-06,
"loss": 1.246315860748291,
"mean_token_accuracy": 0.7372891046106815,
"num_tokens": 490867.0,
"step": 140
},
{
"entropy": 1.2453301914036274,
"epoch": 0.048005760691282956,
"grad_norm": 3.84375,
"learning_rate": 9.551282051282053e-06,
"loss": 1.2801061630249024,
"mean_token_accuracy": 0.7317046545445919,
"num_tokens": 524633.0,
"step": 150
},
{
"entropy": 1.2111680828034879,
"epoch": 0.05120614473736848,
"grad_norm": 3.375,
"learning_rate": 1.0192307692307692e-05,
"loss": 1.2264927864074706,
"mean_token_accuracy": 0.7354309558868408,
"num_tokens": 558869.0,
"step": 160
},
{
"entropy": 1.2417247883975506,
"epoch": 0.05440652878345401,
"grad_norm": 3.8125,
"learning_rate": 1.0833333333333334e-05,
"loss": 1.296145248413086,
"mean_token_accuracy": 0.7288267895579338,
"num_tokens": 594200.0,
"step": 170
},
{
"entropy": 1.2903451286256313,
"epoch": 0.057606912829539544,
"grad_norm": 3.953125,
"learning_rate": 1.1474358974358974e-05,
"loss": 1.391792392730713,
"mean_token_accuracy": 0.7263986520469189,
"num_tokens": 628749.0,
"step": 180
},
{
"entropy": 1.1508908517658711,
"epoch": 0.060807296875625076,
"grad_norm": 4.59375,
"learning_rate": 1.2115384615384615e-05,
"loss": 1.170935821533203,
"mean_token_accuracy": 0.7482860818505287,
"num_tokens": 660930.0,
"step": 190
},
{
"entropy": 1.1952558353543281,
"epoch": 0.06400768092171061,
"grad_norm": 3.953125,
"learning_rate": 1.2756410256410257e-05,
"loss": 1.2448080062866211,
"mean_token_accuracy": 0.7362503379583358,
"num_tokens": 696715.0,
"step": 200
},
{
"entropy": 1.2021137841045857,
"epoch": 0.06720806496779613,
"grad_norm": 4.28125,
"learning_rate": 1.3397435897435897e-05,
"loss": 1.2594975471496581,
"mean_token_accuracy": 0.7392350442707538,
"num_tokens": 730982.0,
"step": 210
},
{
"entropy": 1.1502027772367,
"epoch": 0.07040844901388167,
"grad_norm": 4.0,
"learning_rate": 1.403846153846154e-05,
"loss": 1.2263619422912597,
"mean_token_accuracy": 0.7455356031656265,
"num_tokens": 765369.0,
"step": 220
},
{
"entropy": 1.2468636624515057,
"epoch": 0.0736088330599672,
"grad_norm": 3.875,
"learning_rate": 1.467948717948718e-05,
"loss": 1.317853832244873,
"mean_token_accuracy": 0.7300475873053074,
"num_tokens": 800884.0,
"step": 230
},
{
"entropy": 1.1318104140460492,
"epoch": 0.07680921710605272,
"grad_norm": 3.234375,
"learning_rate": 1.5320512820512823e-05,
"loss": 1.1992506980895996,
"mean_token_accuracy": 0.7450634054839611,
"num_tokens": 837605.0,
"step": 240
},
{
"entropy": 1.1415463611483574,
"epoch": 0.08000960115213826,
"grad_norm": 3.640625,
"learning_rate": 1.5961538461538465e-05,
"loss": 1.1817726135253905,
"mean_token_accuracy": 0.7463984578847885,
"num_tokens": 876274.0,
"step": 250
},
{
"entropy": 1.2368000820279121,
"epoch": 0.08320998519822378,
"grad_norm": 3.546875,
"learning_rate": 1.6602564102564103e-05,
"loss": 1.297637367248535,
"mean_token_accuracy": 0.7309112548828125,
"num_tokens": 911704.0,
"step": 260
},
{
"entropy": 1.1496265470981597,
"epoch": 0.08641036924430932,
"grad_norm": 3.875,
"learning_rate": 1.7243589743589745e-05,
"loss": 1.2197935104370117,
"mean_token_accuracy": 0.7450173661112786,
"num_tokens": 947611.0,
"step": 270
},
{
"entropy": 1.1289438650012016,
"epoch": 0.08961075329039485,
"grad_norm": 4.5,
"learning_rate": 1.7884615384615387e-05,
"loss": 1.2045019149780274,
"mean_token_accuracy": 0.745516513288021,
"num_tokens": 984535.0,
"step": 280
},
{
"entropy": 1.1794409573078155,
"epoch": 0.09281113733648037,
"grad_norm": 3.71875,
"learning_rate": 1.852564102564103e-05,
"loss": 1.211575698852539,
"mean_token_accuracy": 0.7406493924558163,
"num_tokens": 1018018.0,
"step": 290
},
{
"entropy": 1.1385122388601303,
"epoch": 0.09601152138256591,
"grad_norm": 4.53125,
"learning_rate": 1.916666666666667e-05,
"loss": 1.1774465560913085,
"mean_token_accuracy": 0.7501121394336223,
"num_tokens": 1051431.0,
"step": 300
},
{
"entropy": 1.1633801862597466,
"epoch": 0.09921190542865144,
"grad_norm": 3.359375,
"learning_rate": 1.980769230769231e-05,
"loss": 1.2100112915039063,
"mean_token_accuracy": 0.7403162129223346,
"num_tokens": 1086575.0,
"step": 310
},
{
"entropy": 1.1853495672345162,
"epoch": 0.10241228947473696,
"grad_norm": 3.546875,
"learning_rate": 1.9950231070031995e-05,
"loss": 1.234422206878662,
"mean_token_accuracy": 0.7415597856044769,
"num_tokens": 1122816.0,
"step": 320
},
{
"entropy": 1.1737073637545108,
"epoch": 0.1056126735208225,
"grad_norm": 3.671875,
"learning_rate": 1.9879132598649133e-05,
"loss": 1.2083673477172852,
"mean_token_accuracy": 0.7407836645841599,
"num_tokens": 1158910.0,
"step": 330
},
{
"entropy": 1.2292249217629432,
"epoch": 0.10881305756690803,
"grad_norm": 3.875,
"learning_rate": 1.9808034127266264e-05,
"loss": 1.269577407836914,
"mean_token_accuracy": 0.7345698416233063,
"num_tokens": 1196019.0,
"step": 340
},
{
"entropy": 1.18642889931798,
"epoch": 0.11201344161299356,
"grad_norm": 3.578125,
"learning_rate": 1.97369356558834e-05,
"loss": 1.2697922706604003,
"mean_token_accuracy": 0.741942162066698,
"num_tokens": 1229987.0,
"step": 350
},
{
"entropy": 1.1096315152943135,
"epoch": 0.11521382565907909,
"grad_norm": 3.9375,
"learning_rate": 1.9665837184500536e-05,
"loss": 1.1929906845092773,
"mean_token_accuracy": 0.7551799714565277,
"num_tokens": 1263509.0,
"step": 360
},
{
"entropy": 1.1739558205008507,
"epoch": 0.11841420970516461,
"grad_norm": 3.8125,
"learning_rate": 1.959473871311767e-05,
"loss": 1.2080945014953612,
"mean_token_accuracy": 0.7452260315418243,
"num_tokens": 1301070.0,
"step": 370
},
{
"entropy": 1.11664487272501,
"epoch": 0.12161459375125015,
"grad_norm": 4.15625,
"learning_rate": 1.9523640241734804e-05,
"loss": 1.189216423034668,
"mean_token_accuracy": 0.7564452636986971,
"num_tokens": 1333449.0,
"step": 380
},
{
"entropy": 1.1409478083252906,
"epoch": 0.12481497779733568,
"grad_norm": 3.34375,
"learning_rate": 1.9452541770351938e-05,
"loss": 1.2088672637939453,
"mean_token_accuracy": 0.7491289660334587,
"num_tokens": 1368459.0,
"step": 390
},
{
"entropy": 1.2013175174593926,
"epoch": 0.12801536184342122,
"grad_norm": 4.5625,
"learning_rate": 1.9381443298969072e-05,
"loss": 1.26448335647583,
"mean_token_accuracy": 0.7352619163691998,
"num_tokens": 1406859.0,
"step": 400
},
{
"entropy": 1.1907868802547454,
"epoch": 0.13121574588950674,
"grad_norm": 3.015625,
"learning_rate": 1.931034482758621e-05,
"loss": 1.2475446701049804,
"mean_token_accuracy": 0.7453009270131588,
"num_tokens": 1442179.0,
"step": 410
},
{
"entropy": 1.0694843657314776,
"epoch": 0.13441612993559227,
"grad_norm": 3.59375,
"learning_rate": 1.9239246356203344e-05,
"loss": 1.1248330116271972,
"mean_token_accuracy": 0.756801488250494,
"num_tokens": 1481135.0,
"step": 420
},
{
"entropy": 1.1419598631560803,
"epoch": 0.1376165139816778,
"grad_norm": 3.71875,
"learning_rate": 1.916814788482048e-05,
"loss": 1.2056102752685547,
"mean_token_accuracy": 0.7461046256124974,
"num_tokens": 1518329.0,
"step": 430
},
{
"entropy": 1.1788324914872645,
"epoch": 0.14081689802776334,
"grad_norm": 3.421875,
"learning_rate": 1.9097049413437613e-05,
"loss": 1.2716377258300782,
"mean_token_accuracy": 0.7431618466973304,
"num_tokens": 1554359.0,
"step": 440
},
{
"entropy": 1.2097309075295926,
"epoch": 0.14401728207384887,
"grad_norm": 3.984375,
"learning_rate": 1.9025950942054747e-05,
"loss": 1.246030616760254,
"mean_token_accuracy": 0.7390106923878192,
"num_tokens": 1591000.0,
"step": 450
},
{
"entropy": 1.2036252733319999,
"epoch": 0.1472176661199344,
"grad_norm": 3.21875,
"learning_rate": 1.8954852470671884e-05,
"loss": 1.2812904357910155,
"mean_token_accuracy": 0.7348502896726131,
"num_tokens": 1627205.0,
"step": 460
},
{
"entropy": 1.1779422886669635,
"epoch": 0.15041805016601992,
"grad_norm": 3.234375,
"learning_rate": 1.8883753999289015e-05,
"loss": 1.2817980766296386,
"mean_token_accuracy": 0.7440513700246811,
"num_tokens": 1663831.0,
"step": 470
},
{
"entropy": 1.1881464742124082,
"epoch": 0.15361843421210544,
"grad_norm": 3.03125,
"learning_rate": 1.8812655527906153e-05,
"loss": 1.2011470794677734,
"mean_token_accuracy": 0.7412468865513802,
"num_tokens": 1701847.0,
"step": 480
},
{
"entropy": 1.1195977296680213,
"epoch": 0.156818818258191,
"grad_norm": 3.328125,
"learning_rate": 1.8741557056523287e-05,
"loss": 1.1337278366088868,
"mean_token_accuracy": 0.7538985311985016,
"num_tokens": 1740516.0,
"step": 490
},
{
"entropy": 1.2133471183478832,
"epoch": 0.16001920230427652,
"grad_norm": 3.40625,
"learning_rate": 1.867045858514042e-05,
"loss": 1.2486845970153808,
"mean_token_accuracy": 0.7390272334218025,
"num_tokens": 1778065.0,
"step": 500
},
{
"entropy": 1.1336760543286801,
"epoch": 0.16321958635036204,
"grad_norm": 3.53125,
"learning_rate": 1.8599360113757556e-05,
"loss": 1.1790239334106445,
"mean_token_accuracy": 0.7476340506225825,
"num_tokens": 1817855.0,
"step": 510
},
{
"entropy": 1.193576630949974,
"epoch": 0.16641997039644757,
"grad_norm": 3.4375,
"learning_rate": 1.852826164237469e-05,
"loss": 1.2632747650146485,
"mean_token_accuracy": 0.7385985501110554,
"num_tokens": 1853124.0,
"step": 520
},
{
"entropy": 1.1418399840593338,
"epoch": 0.1696203544425331,
"grad_norm": 3.640625,
"learning_rate": 1.8457163170991824e-05,
"loss": 1.194384479522705,
"mean_token_accuracy": 0.7507250174880028,
"num_tokens": 1887889.0,
"step": 530
},
{
"entropy": 1.1441261656582355,
"epoch": 0.17282073848861865,
"grad_norm": 2.96875,
"learning_rate": 1.838606469960896e-05,
"loss": 1.1474828720092773,
"mean_token_accuracy": 0.7484897166490555,
"num_tokens": 1925355.0,
"step": 540
},
{
"entropy": 1.1772041961550712,
"epoch": 0.17602112253470417,
"grad_norm": 2.859375,
"learning_rate": 1.8314966228226096e-05,
"loss": 1.2581243515014648,
"mean_token_accuracy": 0.7401691168546677,
"num_tokens": 1962021.0,
"step": 550
},
{
"entropy": 1.154813179373741,
"epoch": 0.1792215065807897,
"grad_norm": 3.140625,
"learning_rate": 1.824386775684323e-05,
"loss": 1.2013533592224122,
"mean_token_accuracy": 0.7461690090596675,
"num_tokens": 1999387.0,
"step": 560
},
{
"entropy": 1.1134828917682171,
"epoch": 0.18242189062687522,
"grad_norm": 4.0625,
"learning_rate": 1.8172769285460364e-05,
"loss": 1.155961513519287,
"mean_token_accuracy": 0.7565418593585491,
"num_tokens": 2033366.0,
"step": 570
},
{
"entropy": 1.129069809615612,
"epoch": 0.18562227467296075,
"grad_norm": 3.3125,
"learning_rate": 1.81016708140775e-05,
"loss": 1.202240562438965,
"mean_token_accuracy": 0.7467389106750488,
"num_tokens": 2068012.0,
"step": 580
},
{
"entropy": 1.1413575001060963,
"epoch": 0.1888226587190463,
"grad_norm": 2.859375,
"learning_rate": 1.8030572342694636e-05,
"loss": 1.1733809471130372,
"mean_token_accuracy": 0.7480724595487118,
"num_tokens": 2103208.0,
"step": 590
},
{
"entropy": 1.1593846715986729,
"epoch": 0.19202304276513182,
"grad_norm": 3.65625,
"learning_rate": 1.7959473871311767e-05,
"loss": 1.2416004180908202,
"mean_token_accuracy": 0.7419706009328365,
"num_tokens": 2139071.0,
"step": 600
},
{
"entropy": 1.2044602517038583,
"epoch": 0.19522342681121735,
"grad_norm": 2.640625,
"learning_rate": 1.7888375399928905e-05,
"loss": 1.2507460594177247,
"mean_token_accuracy": 0.7382100090384484,
"num_tokens": 2178499.0,
"step": 610
},
{
"entropy": 1.096942011639476,
"epoch": 0.19842381085730287,
"grad_norm": 3.359375,
"learning_rate": 1.7817276928546035e-05,
"loss": 1.1269610404968262,
"mean_token_accuracy": 0.7565630108118058,
"num_tokens": 2214448.0,
"step": 620
},
{
"entropy": 1.1488182917237282,
"epoch": 0.2016241949033884,
"grad_norm": 4.0625,
"learning_rate": 1.7746178457163173e-05,
"loss": 1.1636892318725587,
"mean_token_accuracy": 0.7449747450649739,
"num_tokens": 2249587.0,
"step": 630
},
{
"entropy": 1.072244780510664,
"epoch": 0.20482457894947392,
"grad_norm": 2.875,
"learning_rate": 1.7675079985780307e-05,
"loss": 1.1519594192504883,
"mean_token_accuracy": 0.7612439051270485,
"num_tokens": 2285832.0,
"step": 640
},
{
"entropy": 1.137603597342968,
"epoch": 0.20802496299555948,
"grad_norm": 3.65625,
"learning_rate": 1.760398151439744e-05,
"loss": 1.2033388137817382,
"mean_token_accuracy": 0.750407163798809,
"num_tokens": 2323267.0,
"step": 650
},
{
"entropy": 1.1386778496205807,
"epoch": 0.211225347041645,
"grad_norm": 3.90625,
"learning_rate": 1.7532883043014576e-05,
"loss": 1.2194600105285645,
"mean_token_accuracy": 0.7539191976189613,
"num_tokens": 2356234.0,
"step": 660
},
{
"entropy": 1.171764300018549,
"epoch": 0.21442573108773053,
"grad_norm": 3.734375,
"learning_rate": 1.746178457163171e-05,
"loss": 1.2068530082702638,
"mean_token_accuracy": 0.7431434363126754,
"num_tokens": 2394092.0,
"step": 670
},
{
"entropy": 1.1694385975599288,
"epoch": 0.21762611513381605,
"grad_norm": 3.609375,
"learning_rate": 1.7390686100248847e-05,
"loss": 1.2267550468444823,
"mean_token_accuracy": 0.7448949955403805,
"num_tokens": 2429083.0,
"step": 680
},
{
"entropy": 1.0907738648355008,
"epoch": 0.22082649917990158,
"grad_norm": 3.0625,
"learning_rate": 1.731958762886598e-05,
"loss": 1.139704990386963,
"mean_token_accuracy": 0.7525829285383224,
"num_tokens": 2466650.0,
"step": 690
},
{
"entropy": 1.263149094209075,
"epoch": 0.22402688322598713,
"grad_norm": 3.421875,
"learning_rate": 1.7248489157483116e-05,
"loss": 1.3419886589050294,
"mean_token_accuracy": 0.7293422102928162,
"num_tokens": 2502306.0,
"step": 700
},
{
"entropy": 1.0920586667954921,
"epoch": 0.22722726727207265,
"grad_norm": 3.484375,
"learning_rate": 1.717739068610025e-05,
"loss": 1.1174333572387696,
"mean_token_accuracy": 0.7606853067874908,
"num_tokens": 2535111.0,
"step": 710
},
{
"entropy": 1.1392102960497141,
"epoch": 0.23042765131815818,
"grad_norm": 4.03125,
"learning_rate": 1.7106292214717384e-05,
"loss": 1.2493625640869142,
"mean_token_accuracy": 0.7505488857626915,
"num_tokens": 2569698.0,
"step": 720
},
{
"entropy": 1.1885175816714764,
"epoch": 0.2336280353642437,
"grad_norm": 3.046875,
"learning_rate": 1.703519374333452e-05,
"loss": 1.2571531295776368,
"mean_token_accuracy": 0.7408242344856262,
"num_tokens": 2606190.0,
"step": 730
},
{
"entropy": 1.1989564672112465,
"epoch": 0.23682841941032923,
"grad_norm": 3.03125,
"learning_rate": 1.6964095271951656e-05,
"loss": 1.2598919868469238,
"mean_token_accuracy": 0.7383935242891312,
"num_tokens": 2643059.0,
"step": 740
},
{
"entropy": 1.0843516297638416,
"epoch": 0.24002880345641478,
"grad_norm": 3.265625,
"learning_rate": 1.6892996800568787e-05,
"loss": 1.1271354675292968,
"mean_token_accuracy": 0.7592886902391911,
"num_tokens": 2677827.0,
"step": 750
},
{
"entropy": 1.1722411584109067,
"epoch": 0.2432291875025003,
"grad_norm": 4.25,
"learning_rate": 1.6821898329185925e-05,
"loss": 1.2755705833435058,
"mean_token_accuracy": 0.7432561241090297,
"num_tokens": 2711876.0,
"step": 760
},
{
"entropy": 1.1528743766248226,
"epoch": 0.24642957154858583,
"grad_norm": 3.125,
"learning_rate": 1.675079985780306e-05,
"loss": 1.1825839042663575,
"mean_token_accuracy": 0.7412553071975708,
"num_tokens": 2753314.0,
"step": 770
},
{
"entropy": 1.1880130164325238,
"epoch": 0.24962995559467135,
"grad_norm": 3.453125,
"learning_rate": 1.6679701386420193e-05,
"loss": 1.2241481781005858,
"mean_token_accuracy": 0.7429691925644875,
"num_tokens": 2789807.0,
"step": 780
},
{
"entropy": 1.10604536421597,
"epoch": 0.2528303396407569,
"grad_norm": 3.171875,
"learning_rate": 1.6608602915037327e-05,
"loss": 1.133774185180664,
"mean_token_accuracy": 0.7567876607179642,
"num_tokens": 2822248.0,
"step": 790
},
{
"entropy": 1.1902866654098034,
"epoch": 0.25603072368684243,
"grad_norm": 3.734375,
"learning_rate": 1.653750444365446e-05,
"loss": 1.2399630546569824,
"mean_token_accuracy": 0.7448862664401531,
"num_tokens": 2858863.0,
"step": 800
},
{
"entropy": 1.0581065572798252,
"epoch": 0.25923110773292796,
"grad_norm": 3.625,
"learning_rate": 1.64664059722716e-05,
"loss": 1.1121423721313477,
"mean_token_accuracy": 0.7639019310474395,
"num_tokens": 2892587.0,
"step": 810
},
{
"entropy": 1.1235411427915096,
"epoch": 0.2624314917790135,
"grad_norm": 4.0,
"learning_rate": 1.6395307500888733e-05,
"loss": 1.1847190856933594,
"mean_token_accuracy": 0.7517336331307888,
"num_tokens": 2926589.0,
"step": 820
},
{
"entropy": 1.1476600162684918,
"epoch": 0.265631875825099,
"grad_norm": 3.375,
"learning_rate": 1.6324209029505868e-05,
"loss": 1.1705162048339843,
"mean_token_accuracy": 0.7479592509567737,
"num_tokens": 2963433.0,
"step": 830
},
{
"entropy": 1.1264712318778038,
"epoch": 0.26883225987118453,
"grad_norm": 3.625,
"learning_rate": 1.6253110558123002e-05,
"loss": 1.1919547080993653,
"mean_token_accuracy": 0.7536672279238701,
"num_tokens": 2997829.0,
"step": 840
},
{
"entropy": 1.139496796950698,
"epoch": 0.27203264391727006,
"grad_norm": 3.296875,
"learning_rate": 1.6182012086740136e-05,
"loss": 1.1688892364501953,
"mean_token_accuracy": 0.7543122127652169,
"num_tokens": 3032167.0,
"step": 850
},
{
"entropy": 1.1148510150611401,
"epoch": 0.2752330279633556,
"grad_norm": 4.40625,
"learning_rate": 1.611091361535727e-05,
"loss": 1.1610650062561034,
"mean_token_accuracy": 0.7572085842490196,
"num_tokens": 3066591.0,
"step": 860
},
{
"entropy": 1.1900723941624165,
"epoch": 0.2784334120094411,
"grad_norm": 3.59375,
"learning_rate": 1.6039815143974408e-05,
"loss": 1.2732099533081054,
"mean_token_accuracy": 0.7386304296553134,
"num_tokens": 3104866.0,
"step": 870
},
{
"entropy": 1.1151873588562011,
"epoch": 0.2816337960555267,
"grad_norm": 3.609375,
"learning_rate": 1.596871667259154e-05,
"loss": 1.194847583770752,
"mean_token_accuracy": 0.7530852198600769,
"num_tokens": 3140582.0,
"step": 880
},
{
"entropy": 1.1318743109703064,
"epoch": 0.2848341801016122,
"grad_norm": 3.5,
"learning_rate": 1.5897618201208676e-05,
"loss": 1.1644593238830567,
"mean_token_accuracy": 0.7507477700710297,
"num_tokens": 3172606.0,
"step": 890
},
{
"entropy": 1.1317258846014737,
"epoch": 0.28803456414769774,
"grad_norm": 3.109375,
"learning_rate": 1.582651972982581e-05,
"loss": 1.2329046249389648,
"mean_token_accuracy": 0.7497393228113651,
"num_tokens": 3211067.0,
"step": 900
},
{
"entropy": 1.0851800233125686,
"epoch": 0.29123494819378326,
"grad_norm": 2.890625,
"learning_rate": 1.5755421258442945e-05,
"loss": 1.0999431610107422,
"mean_token_accuracy": 0.757631991803646,
"num_tokens": 3245422.0,
"step": 910
},
{
"entropy": 1.159644392132759,
"epoch": 0.2944353322398688,
"grad_norm": 2.703125,
"learning_rate": 1.568432278706008e-05,
"loss": 1.2022081375122071,
"mean_token_accuracy": 0.7452364444732666,
"num_tokens": 3281658.0,
"step": 920
},
{
"entropy": 1.1171356670558452,
"epoch": 0.2976357162859543,
"grad_norm": 3.53125,
"learning_rate": 1.5613224315677213e-05,
"loss": 1.1644085884094237,
"mean_token_accuracy": 0.7566865622997284,
"num_tokens": 3313665.0,
"step": 930
},
{
"entropy": 1.1976551342755557,
"epoch": 0.30083610033203984,
"grad_norm": 2.71875,
"learning_rate": 1.554212584429435e-05,
"loss": 1.2674903869628906,
"mean_token_accuracy": 0.7411434464156628,
"num_tokens": 3351040.0,
"step": 940
},
{
"entropy": 1.1759327344596386,
"epoch": 0.30403648437812536,
"grad_norm": 3.140625,
"learning_rate": 1.5471027372911485e-05,
"loss": 1.2738938331604004,
"mean_token_accuracy": 0.7425175003707409,
"num_tokens": 3391557.0,
"step": 950
},
{
"entropy": 1.137892946600914,
"epoch": 0.3072368684242109,
"grad_norm": 3.34375,
"learning_rate": 1.539992890152862e-05,
"loss": 1.163702392578125,
"mean_token_accuracy": 0.7516510836780071,
"num_tokens": 3426954.0,
"step": 960
},
{
"entropy": 1.1136261202394961,
"epoch": 0.3104372524702964,
"grad_norm": 3.875,
"learning_rate": 1.5328830430145753e-05,
"loss": 1.1672924041748047,
"mean_token_accuracy": 0.7556798778474331,
"num_tokens": 3461984.0,
"step": 970
},
{
"entropy": 1.1157550118863582,
"epoch": 0.313637636516382,
"grad_norm": 3.359375,
"learning_rate": 1.5257731958762888e-05,
"loss": 1.177406406402588,
"mean_token_accuracy": 0.7517608553171158,
"num_tokens": 3496620.0,
"step": 980
},
{
"entropy": 1.1827008694410324,
"epoch": 0.3168380205624675,
"grad_norm": 3.140625,
"learning_rate": 1.5186633487380022e-05,
"loss": 1.2889988899230957,
"mean_token_accuracy": 0.7372566133737564,
"num_tokens": 3533170.0,
"step": 990
},
{
"entropy": 1.1758067298680543,
"epoch": 0.32003840460855304,
"grad_norm": 3.421875,
"learning_rate": 1.5115535015997158e-05,
"loss": 1.2371768951416016,
"mean_token_accuracy": 0.7458655416965485,
"num_tokens": 3567810.0,
"step": 1000
},
{
"entropy": 1.1418688822537661,
"epoch": 0.32323878865463856,
"grad_norm": 3.6875,
"learning_rate": 1.5044436544614292e-05,
"loss": 1.186594009399414,
"mean_token_accuracy": 0.7467859581112861,
"num_tokens": 3603353.0,
"step": 1010
},
{
"entropy": 1.1797917354851961,
"epoch": 0.3264391727007241,
"grad_norm": 2.96875,
"learning_rate": 1.4973338073231428e-05,
"loss": 1.2142827033996582,
"mean_token_accuracy": 0.7416288331151009,
"num_tokens": 3641475.0,
"step": 1020
},
{
"entropy": 1.1130448926240206,
"epoch": 0.3296395567468096,
"grad_norm": 3.109375,
"learning_rate": 1.490223960184856e-05,
"loss": 1.1746935844421387,
"mean_token_accuracy": 0.7544396013021469,
"num_tokens": 3675103.0,
"step": 1030
},
{
"entropy": 1.1146599553525447,
"epoch": 0.33283994079289514,
"grad_norm": 3.765625,
"learning_rate": 1.4831141130465696e-05,
"loss": 1.1683859825134277,
"mean_token_accuracy": 0.7539133220911026,
"num_tokens": 3710930.0,
"step": 1040
},
{
"entropy": 1.1133470050990582,
"epoch": 0.33604032483898066,
"grad_norm": 3.671875,
"learning_rate": 1.4760042659082832e-05,
"loss": 1.1540699005126953,
"mean_token_accuracy": 0.7554305769503117,
"num_tokens": 3744764.0,
"step": 1050
},
{
"entropy": 1.2018603175878524,
"epoch": 0.3392407088850662,
"grad_norm": 3.59375,
"learning_rate": 1.4688944187699965e-05,
"loss": 1.267392635345459,
"mean_token_accuracy": 0.741713160276413,
"num_tokens": 3781290.0,
"step": 1060
},
{
"entropy": 1.1392232250422238,
"epoch": 0.3424410929311517,
"grad_norm": 3.359375,
"learning_rate": 1.46178457163171e-05,
"loss": 1.2040764808654785,
"mean_token_accuracy": 0.7544347628951072,
"num_tokens": 3817138.0,
"step": 1070
},
{
"entropy": 1.0759797591716052,
"epoch": 0.3456414769772373,
"grad_norm": 3.609375,
"learning_rate": 1.4546747244934237e-05,
"loss": 1.1521276473999023,
"mean_token_accuracy": 0.762228213250637,
"num_tokens": 3852430.0,
"step": 1080
},
{
"entropy": 1.0658919643610716,
"epoch": 0.3488418610233228,
"grad_norm": 3.4375,
"learning_rate": 1.4475648773551369e-05,
"loss": 1.103238582611084,
"mean_token_accuracy": 0.7651597328484059,
"num_tokens": 3885416.0,
"step": 1090
},
{
"entropy": 1.1337019324302673,
"epoch": 0.35204224506940834,
"grad_norm": 3.234375,
"learning_rate": 1.4404550302168505e-05,
"loss": 1.1847347259521483,
"mean_token_accuracy": 0.7472888924181461,
"num_tokens": 3925885.0,
"step": 1100
},
{
"entropy": 1.124852604046464,
"epoch": 0.35524262911549387,
"grad_norm": 3.421875,
"learning_rate": 1.433345183078564e-05,
"loss": 1.166029167175293,
"mean_token_accuracy": 0.752812971919775,
"num_tokens": 3961029.0,
"step": 1110
},
{
"entropy": 1.1096541091799736,
"epoch": 0.3584430131615794,
"grad_norm": 3.21875,
"learning_rate": 1.4262353359402773e-05,
"loss": 1.1557273864746094,
"mean_token_accuracy": 0.7548218049108982,
"num_tokens": 3998345.0,
"step": 1120
},
{
"entropy": 1.1478759333491326,
"epoch": 0.3616433972076649,
"grad_norm": 3.59375,
"learning_rate": 1.419125488801991e-05,
"loss": 1.2064693450927735,
"mean_token_accuracy": 0.7461572416126728,
"num_tokens": 4032627.0,
"step": 1130
},
{
"entropy": 1.1037006203085185,
"epoch": 0.36484378125375044,
"grad_norm": 3.546875,
"learning_rate": 1.4120156416637044e-05,
"loss": 1.148093032836914,
"mean_token_accuracy": 0.7576483316719532,
"num_tokens": 4067935.0,
"step": 1140
},
{
"entropy": 1.1473457373678684,
"epoch": 0.36804416529983597,
"grad_norm": 3.375,
"learning_rate": 1.404905794525418e-05,
"loss": 1.2009618759155274,
"mean_token_accuracy": 0.751000577956438,
"num_tokens": 4105088.0,
"step": 1150
},
{
"entropy": 1.0734026059508324,
"epoch": 0.3712445493459215,
"grad_norm": 3.453125,
"learning_rate": 1.3977959473871312e-05,
"loss": 1.154836368560791,
"mean_token_accuracy": 0.7619151666760444,
"num_tokens": 4138662.0,
"step": 1160
},
{
"entropy": 1.106279893964529,
"epoch": 0.374444933392007,
"grad_norm": 3.265625,
"learning_rate": 1.3906861002488448e-05,
"loss": 1.1779499053955078,
"mean_token_accuracy": 0.7563652314245701,
"num_tokens": 4172413.0,
"step": 1170
},
{
"entropy": 1.1056948460638523,
"epoch": 0.3776453174380926,
"grad_norm": 3.5,
"learning_rate": 1.3835762531105584e-05,
"loss": 1.137861728668213,
"mean_token_accuracy": 0.7500715628266335,
"num_tokens": 4210692.0,
"step": 1180
},
{
"entropy": 1.0903994772583245,
"epoch": 0.3808457014841781,
"grad_norm": 3.09375,
"learning_rate": 1.3764664059722716e-05,
"loss": 1.1262723922729492,
"mean_token_accuracy": 0.7594648048281669,
"num_tokens": 4245849.0,
"step": 1190
},
{
"entropy": 1.1103523924946785,
"epoch": 0.38404608553026365,
"grad_norm": 3.46875,
"learning_rate": 1.3693565588339852e-05,
"loss": 1.1854586601257324,
"mean_token_accuracy": 0.7494940027594567,
"num_tokens": 4285585.0,
"step": 1200
},
{
"entropy": 1.2059497661888599,
"epoch": 0.3872464695763492,
"grad_norm": 3.609375,
"learning_rate": 1.3622467116956985e-05,
"loss": 1.2371363639831543,
"mean_token_accuracy": 0.7376365043222904,
"num_tokens": 4321004.0,
"step": 1210
},
{
"entropy": 1.0978240944445132,
"epoch": 0.3904468536224347,
"grad_norm": 3.53125,
"learning_rate": 1.355136864557412e-05,
"loss": 1.1326991081237794,
"mean_token_accuracy": 0.7563932791352272,
"num_tokens": 4354913.0,
"step": 1220
},
{
"entropy": 1.1807831916958094,
"epoch": 0.3936472376685202,
"grad_norm": 3.546875,
"learning_rate": 1.3480270174191257e-05,
"loss": 1.2626652717590332,
"mean_token_accuracy": 0.7423581592738628,
"num_tokens": 4390839.0,
"step": 1230
},
{
"entropy": 1.1470067836344242,
"epoch": 0.39684762171460575,
"grad_norm": 3.25,
"learning_rate": 1.340917170280839e-05,
"loss": 1.2084031105041504,
"mean_token_accuracy": 0.7459581665694713,
"num_tokens": 4430160.0,
"step": 1240
},
{
"entropy": 1.1267010770738124,
"epoch": 0.40004800576069127,
"grad_norm": 3.25,
"learning_rate": 1.3338073231425525e-05,
"loss": 1.1781652450561524,
"mean_token_accuracy": 0.7555549241602421,
"num_tokens": 4465773.0,
"step": 1250
},
{
"entropy": 1.0811494186520576,
"epoch": 0.4032483898067768,
"grad_norm": 3.28125,
"learning_rate": 1.3266974760042661e-05,
"loss": 1.105443000793457,
"mean_token_accuracy": 0.7561785206198692,
"num_tokens": 4506676.0,
"step": 1260
},
{
"entropy": 1.1555583395063878,
"epoch": 0.4064487738528623,
"grad_norm": 3.453125,
"learning_rate": 1.3195876288659795e-05,
"loss": 1.2035257339477539,
"mean_token_accuracy": 0.7430454775691032,
"num_tokens": 4544343.0,
"step": 1270
},
{
"entropy": 1.1449554897844791,
"epoch": 0.40964915789894785,
"grad_norm": 2.8125,
"learning_rate": 1.3124777817276931e-05,
"loss": 1.1892909049987792,
"mean_token_accuracy": 0.7470510423183441,
"num_tokens": 4580275.0,
"step": 1280
},
{
"entropy": 1.2319265089929103,
"epoch": 0.4128495419450334,
"grad_norm": 3.1875,
"learning_rate": 1.3053679345894064e-05,
"loss": 1.3125531196594238,
"mean_token_accuracy": 0.7335422746837139,
"num_tokens": 4619336.0,
"step": 1290
},
{
"entropy": 1.1227019898593427,
"epoch": 0.41604992599111895,
"grad_norm": 4.03125,
"learning_rate": 1.29825808745112e-05,
"loss": 1.1845033645629883,
"mean_token_accuracy": 0.7563824310898781,
"num_tokens": 4652166.0,
"step": 1300
},
{
"entropy": 1.0604043878614902,
"epoch": 0.4192503100372045,
"grad_norm": 3.390625,
"learning_rate": 1.2911482403128335e-05,
"loss": 1.100246524810791,
"mean_token_accuracy": 0.7669279538094997,
"num_tokens": 4684045.0,
"step": 1310
},
{
"entropy": 1.0832354299724103,
"epoch": 0.42245069408329,
"grad_norm": 3.40625,
"learning_rate": 1.2840383931745468e-05,
"loss": 1.1006074905395509,
"mean_token_accuracy": 0.7616540372371674,
"num_tokens": 4716393.0,
"step": 1320
},
{
"entropy": 1.1083704240620136,
"epoch": 0.4256510781293755,
"grad_norm": 3.5,
"learning_rate": 1.2769285460362604e-05,
"loss": 1.169978427886963,
"mean_token_accuracy": 0.7535225711762905,
"num_tokens": 4751437.0,
"step": 1330
},
{
"entropy": 1.0894863862544297,
"epoch": 0.42885146217546105,
"grad_norm": 2.96875,
"learning_rate": 1.2698186988979736e-05,
"loss": 1.132776641845703,
"mean_token_accuracy": 0.7577138744294644,
"num_tokens": 4788926.0,
"step": 1340
},
{
"entropy": 1.0949448980391026,
"epoch": 0.4320518462215466,
"grad_norm": 3.078125,
"learning_rate": 1.2627088517596872e-05,
"loss": 1.1491366386413575,
"mean_token_accuracy": 0.7596271999180317,
"num_tokens": 4825682.0,
"step": 1350
},
{
"entropy": 1.1359346587210895,
"epoch": 0.4352522302676321,
"grad_norm": 2.984375,
"learning_rate": 1.2555990046214008e-05,
"loss": 1.186843204498291,
"mean_token_accuracy": 0.7496764816343784,
"num_tokens": 4860636.0,
"step": 1360
},
{
"entropy": 1.1405926086008549,
"epoch": 0.4384526143137176,
"grad_norm": 2.765625,
"learning_rate": 1.2484891574831142e-05,
"loss": 1.2072190284729003,
"mean_token_accuracy": 0.7515955492854118,
"num_tokens": 4895008.0,
"step": 1370
},
{
"entropy": 1.188784885033965,
"epoch": 0.44165299835980315,
"grad_norm": 3.046875,
"learning_rate": 1.2413793103448277e-05,
"loss": 1.2465777397155762,
"mean_token_accuracy": 0.7442488387227059,
"num_tokens": 4934544.0,
"step": 1380
},
{
"entropy": 1.128134048730135,
"epoch": 0.44485338240588873,
"grad_norm": 3.109375,
"learning_rate": 1.2342694632065411e-05,
"loss": 1.1832526206970215,
"mean_token_accuracy": 0.7498147763311863,
"num_tokens": 4971830.0,
"step": 1390
},
{
"entropy": 1.0631931692361831,
"epoch": 0.44805376645197426,
"grad_norm": 3.234375,
"learning_rate": 1.2271596160682547e-05,
"loss": 1.0955133438110352,
"mean_token_accuracy": 0.7623707666993141,
"num_tokens": 5005602.0,
"step": 1400
},
{
"entropy": 1.1206502683460713,
"epoch": 0.4512541504980598,
"grad_norm": 3.6875,
"learning_rate": 1.2200497689299681e-05,
"loss": 1.1475549697875977,
"mean_token_accuracy": 0.7556483931839466,
"num_tokens": 5041164.0,
"step": 1410
},
{
"entropy": 1.1239325635135173,
"epoch": 0.4544545345441453,
"grad_norm": 3.109375,
"learning_rate": 1.2129399217916815e-05,
"loss": 1.166731357574463,
"mean_token_accuracy": 0.7522053651511669,
"num_tokens": 5078129.0,
"step": 1420
},
{
"entropy": 1.0859558291733264,
"epoch": 0.45765491859023083,
"grad_norm": 2.875,
"learning_rate": 1.2058300746533951e-05,
"loss": 1.1344684600830077,
"mean_token_accuracy": 0.7648185789585114,
"num_tokens": 5110323.0,
"step": 1430
},
{
"entropy": 1.101494075730443,
"epoch": 0.46085530263631636,
"grad_norm": 2.609375,
"learning_rate": 1.1987202275151084e-05,
"loss": 1.1418500900268556,
"mean_token_accuracy": 0.7596986934542656,
"num_tokens": 5145202.0,
"step": 1440
},
{
"entropy": 1.1369270034134389,
"epoch": 0.4640556866824019,
"grad_norm": 3.734375,
"learning_rate": 1.191610380376822e-05,
"loss": 1.1892250061035157,
"mean_token_accuracy": 0.752144105732441,
"num_tokens": 5179225.0,
"step": 1450
},
{
"entropy": 1.1221182450652123,
"epoch": 0.4672560707284874,
"grad_norm": 3.4375,
"learning_rate": 1.1845005332385355e-05,
"loss": 1.1399892807006835,
"mean_token_accuracy": 0.7525438450276851,
"num_tokens": 5213701.0,
"step": 1460
},
{
"entropy": 1.136232825368643,
"epoch": 0.47045645477457293,
"grad_norm": 2.890625,
"learning_rate": 1.1773906861002488e-05,
"loss": 1.1965130805969237,
"mean_token_accuracy": 0.7524074338376522,
"num_tokens": 5246772.0,
"step": 1470
},
{
"entropy": 1.1669704608619214,
"epoch": 0.47365683882065845,
"grad_norm": 3.296875,
"learning_rate": 1.1702808389619624e-05,
"loss": 1.2590208053588867,
"mean_token_accuracy": 0.7439424701035022,
"num_tokens": 5284402.0,
"step": 1480
},
{
"entropy": 1.1522224962711334,
"epoch": 0.47685722286674403,
"grad_norm": 3.234375,
"learning_rate": 1.163170991823676e-05,
"loss": 1.2222829818725587,
"mean_token_accuracy": 0.7506221950054168,
"num_tokens": 5318670.0,
"step": 1490
},
{
"entropy": 1.1795588433742523,
"epoch": 0.48005760691282956,
"grad_norm": 3.734375,
"learning_rate": 1.1560611446853894e-05,
"loss": 1.2275501251220704,
"mean_token_accuracy": 0.7433199048042297,
"num_tokens": 5353791.0,
"step": 1500
},
{
"entropy": 1.1336502090096474,
"epoch": 0.4832579909589151,
"grad_norm": 2.96875,
"learning_rate": 1.1489512975471028e-05,
"loss": 1.1771859169006347,
"mean_token_accuracy": 0.7523209981620311,
"num_tokens": 5387895.0,
"step": 1510
},
{
"entropy": 1.1373966462910174,
"epoch": 0.4864583750050006,
"grad_norm": 3.28125,
"learning_rate": 1.1418414504088162e-05,
"loss": 1.210038948059082,
"mean_token_accuracy": 0.7523334570229053,
"num_tokens": 5421253.0,
"step": 1520
},
{
"entropy": 1.1127303969115019,
"epoch": 0.48965875905108613,
"grad_norm": 3.203125,
"learning_rate": 1.1347316032705298e-05,
"loss": 1.1646257400512696,
"mean_token_accuracy": 0.7546454407274723,
"num_tokens": 5453927.0,
"step": 1530
},
{
"entropy": 1.0216515570878983,
"epoch": 0.49285914309717166,
"grad_norm": 3.734375,
"learning_rate": 1.1276217561322433e-05,
"loss": 1.0620564460754394,
"mean_token_accuracy": 0.7721667498350143,
"num_tokens": 5486994.0,
"step": 1540
},
{
"entropy": 1.1356555175036191,
"epoch": 0.4960595271432572,
"grad_norm": 3.390625,
"learning_rate": 1.1205119089939567e-05,
"loss": 1.1835213661193849,
"mean_token_accuracy": 0.7511269651353359,
"num_tokens": 5522667.0,
"step": 1550
},
{
"entropy": 1.1677010275423527,
"epoch": 0.4992599111893427,
"grad_norm": 3.25,
"learning_rate": 1.1134020618556703e-05,
"loss": 1.2388330459594727,
"mean_token_accuracy": 0.747014632821083,
"num_tokens": 5559683.0,
"step": 1560
},
{
"entropy": 1.0452032934874296,
"epoch": 0.5024602952354282,
"grad_norm": 3.09375,
"learning_rate": 1.1062922147173835e-05,
"loss": 1.0709638595581055,
"mean_token_accuracy": 0.7606437459588051,
"num_tokens": 5596318.0,
"step": 1570
},
{
"entropy": 1.0912953674793244,
"epoch": 0.5056606792815138,
"grad_norm": 3.59375,
"learning_rate": 1.0991823675790971e-05,
"loss": 1.1132530212402343,
"mean_token_accuracy": 0.7621871262788773,
"num_tokens": 5633417.0,
"step": 1580
},
{
"entropy": 1.0394235443323852,
"epoch": 0.5088610633275993,
"grad_norm": 3.734375,
"learning_rate": 1.0920725204408107e-05,
"loss": 1.0933416366577149,
"mean_token_accuracy": 0.7706859618425369,
"num_tokens": 5667849.0,
"step": 1590
},
{
"entropy": 1.0913284711539746,
"epoch": 0.5120614473736849,
"grad_norm": 3.203125,
"learning_rate": 1.084962673302524e-05,
"loss": 1.149476909637451,
"mean_token_accuracy": 0.7546762965619565,
"num_tokens": 5703443.0,
"step": 1600
},
{
"entropy": 1.0678091116249562,
"epoch": 0.5152618314197703,
"grad_norm": 3.515625,
"learning_rate": 1.0778528261642376e-05,
"loss": 1.117019271850586,
"mean_token_accuracy": 0.764804369956255,
"num_tokens": 5738612.0,
"step": 1610
},
{
"entropy": 1.079986510053277,
"epoch": 0.5184622154658559,
"grad_norm": 3.75,
"learning_rate": 1.070742979025951e-05,
"loss": 1.1276843070983886,
"mean_token_accuracy": 0.761953490972519,
"num_tokens": 5771959.0,
"step": 1620
},
{
"entropy": 1.1219593778252601,
"epoch": 0.5216625995119414,
"grad_norm": 3.3125,
"learning_rate": 1.0636331318876646e-05,
"loss": 1.1727846145629883,
"mean_token_accuracy": 0.7556007139384746,
"num_tokens": 5806127.0,
"step": 1630
},
{
"entropy": 1.1329836711287498,
"epoch": 0.524862983558027,
"grad_norm": 3.671875,
"learning_rate": 1.056523284749378e-05,
"loss": 1.1895696640014648,
"mean_token_accuracy": 0.7470721893012524,
"num_tokens": 5842096.0,
"step": 1640
},
{
"entropy": 1.138121072202921,
"epoch": 0.5280633676041125,
"grad_norm": 3.859375,
"learning_rate": 1.0494134376110914e-05,
"loss": 1.1915018081665039,
"mean_token_accuracy": 0.7498403996229172,
"num_tokens": 5879201.0,
"step": 1650
},
{
"entropy": 1.1121512524783612,
"epoch": 0.531263751650198,
"grad_norm": 3.703125,
"learning_rate": 1.042303590472805e-05,
"loss": 1.1451727867126464,
"mean_token_accuracy": 0.7555429771542549,
"num_tokens": 5914614.0,
"step": 1660
},
{
"entropy": 1.1279703747481107,
"epoch": 0.5344641356962836,
"grad_norm": 3.6875,
"learning_rate": 1.0351937433345184e-05,
"loss": 1.166687297821045,
"mean_token_accuracy": 0.7522629871964455,
"num_tokens": 5952819.0,
"step": 1670
},
{
"entropy": 1.077747032791376,
"epoch": 0.5376645197423691,
"grad_norm": 3.453125,
"learning_rate": 1.0280838961962318e-05,
"loss": 1.161451244354248,
"mean_token_accuracy": 0.7590492330491543,
"num_tokens": 5987954.0,
"step": 1680
},
{
"entropy": 1.1237775962799788,
"epoch": 0.5408649037884546,
"grad_norm": 3.90625,
"learning_rate": 1.0209740490579454e-05,
"loss": 1.189088726043701,
"mean_token_accuracy": 0.7514919534325599,
"num_tokens": 6026626.0,
"step": 1690
},
{
"entropy": 1.1484537214040755,
"epoch": 0.5440652878345401,
"grad_norm": 3.328125,
"learning_rate": 1.0138642019196587e-05,
"loss": 1.1888233184814454,
"mean_token_accuracy": 0.7529322817921639,
"num_tokens": 6061599.0,
"step": 1700
},
{
"entropy": 1.1195942271500825,
"epoch": 0.5472656718806257,
"grad_norm": 3.359375,
"learning_rate": 1.0067543547813723e-05,
"loss": 1.165010643005371,
"mean_token_accuracy": 0.7539791353046894,
"num_tokens": 6099492.0,
"step": 1710
},
{
"entropy": 1.105513620376587,
"epoch": 0.5504660559267112,
"grad_norm": 3.46875,
"learning_rate": 9.996445076430857e-06,
"loss": 1.1810117721557618,
"mean_token_accuracy": 0.7567639537155628,
"num_tokens": 6133396.0,
"step": 1720
},
{
"entropy": 1.0676775388419628,
"epoch": 0.5536664399727967,
"grad_norm": 2.953125,
"learning_rate": 9.925346605047991e-06,
"loss": 1.0936067581176758,
"mean_token_accuracy": 0.7665429212152958,
"num_tokens": 6170567.0,
"step": 1730
},
{
"entropy": 1.0640709735453129,
"epoch": 0.5568668240188822,
"grad_norm": 2.953125,
"learning_rate": 9.854248133665127e-06,
"loss": 1.1169232368469237,
"mean_token_accuracy": 0.7632769830524921,
"num_tokens": 6206392.0,
"step": 1740
},
{
"entropy": 1.0739900685846806,
"epoch": 0.5600672080649678,
"grad_norm": 3.359375,
"learning_rate": 9.783149662282261e-06,
"loss": 1.1153389930725097,
"mean_token_accuracy": 0.7636542163789273,
"num_tokens": 6240974.0,
"step": 1750
},
{
"entropy": 1.1187460146844388,
"epoch": 0.5632675921110534,
"grad_norm": 3.515625,
"learning_rate": 9.712051190899396e-06,
"loss": 1.213233757019043,
"mean_token_accuracy": 0.7538353092968464,
"num_tokens": 6276403.0,
"step": 1760
},
{
"entropy": 1.1634088471531867,
"epoch": 0.5664679761571388,
"grad_norm": 3.0,
"learning_rate": 9.640952719516532e-06,
"loss": 1.222030258178711,
"mean_token_accuracy": 0.7500277526676655,
"num_tokens": 6311555.0,
"step": 1770
},
{
"entropy": 1.124206557497382,
"epoch": 0.5696683602032244,
"grad_norm": 3.15625,
"learning_rate": 9.569854248133666e-06,
"loss": 1.166236114501953,
"mean_token_accuracy": 0.7465378858149052,
"num_tokens": 6349569.0,
"step": 1780
},
{
"entropy": 1.086308826133609,
"epoch": 0.5728687442493099,
"grad_norm": 3.921875,
"learning_rate": 9.498755776750802e-06,
"loss": 1.1150911331176758,
"mean_token_accuracy": 0.7645099796354771,
"num_tokens": 6381129.0,
"step": 1790
},
{
"entropy": 1.0747945971786976,
"epoch": 0.5760691282953955,
"grad_norm": 3.28125,
"learning_rate": 9.427657305367936e-06,
"loss": 1.107960319519043,
"mean_token_accuracy": 0.7637169934809208,
"num_tokens": 6417344.0,
"step": 1800
},
{
"entropy": 1.0966923542320728,
"epoch": 0.5792695123414809,
"grad_norm": 3.109375,
"learning_rate": 9.35655883398507e-06,
"loss": 1.1019758224487304,
"mean_token_accuracy": 0.7635716639459134,
"num_tokens": 6453097.0,
"step": 1810
},
{
"entropy": 1.0623582422733306,
"epoch": 0.5824698963875665,
"grad_norm": 3.09375,
"learning_rate": 9.285460362602204e-06,
"loss": 1.1345792770385743,
"mean_token_accuracy": 0.7689974352717399,
"num_tokens": 6485206.0,
"step": 1820
},
{
"entropy": 1.1150407858192921,
"epoch": 0.585670280433652,
"grad_norm": 3.640625,
"learning_rate": 9.21436189121934e-06,
"loss": 1.1899590492248535,
"mean_token_accuracy": 0.7584320530295372,
"num_tokens": 6518230.0,
"step": 1830
},
{
"entropy": 1.0844181418418883,
"epoch": 0.5888706644797376,
"grad_norm": 3.796875,
"learning_rate": 9.143263419836474e-06,
"loss": 1.1547722816467285,
"mean_token_accuracy": 0.7595572479069232,
"num_tokens": 6551894.0,
"step": 1840
},
{
"entropy": 1.137659491598606,
"epoch": 0.5920710485258232,
"grad_norm": 4.0625,
"learning_rate": 9.072164948453609e-06,
"loss": 1.215767002105713,
"mean_token_accuracy": 0.7511265553534031,
"num_tokens": 6586711.0,
"step": 1850
},
{
"entropy": 1.121223869174719,
"epoch": 0.5952714325719086,
"grad_norm": 3.28125,
"learning_rate": 9.001066477070743e-06,
"loss": 1.1829781532287598,
"mean_token_accuracy": 0.753217040002346,
"num_tokens": 6622616.0,
"step": 1860
},
{
"entropy": 1.1693847570568323,
"epoch": 0.5984718166179942,
"grad_norm": 3.546875,
"learning_rate": 8.929968005687877e-06,
"loss": 1.2190765380859374,
"mean_token_accuracy": 0.7442550092935563,
"num_tokens": 6657486.0,
"step": 1870
},
{
"entropy": 1.0904726900160313,
"epoch": 0.6016722006640797,
"grad_norm": 2.421875,
"learning_rate": 8.858869534305013e-06,
"loss": 1.1301965713500977,
"mean_token_accuracy": 0.7556341625750065,
"num_tokens": 6696509.0,
"step": 1880
},
{
"entropy": 1.085164299607277,
"epoch": 0.6048725847101653,
"grad_norm": 3.25,
"learning_rate": 8.787771062922147e-06,
"loss": 1.1311585426330566,
"mean_token_accuracy": 0.7562328241765499,
"num_tokens": 6733277.0,
"step": 1890
},
{
"entropy": 1.1221049219369887,
"epoch": 0.6080729687562507,
"grad_norm": 3.515625,
"learning_rate": 8.716672591539283e-06,
"loss": 1.151298999786377,
"mean_token_accuracy": 0.7528480552136898,
"num_tokens": 6771453.0,
"step": 1900
},
{
"entropy": 1.0780573837459086,
"epoch": 0.6112733528023363,
"grad_norm": 2.90625,
"learning_rate": 8.645574120156417e-06,
"loss": 1.1247942924499512,
"mean_token_accuracy": 0.7603120274841786,
"num_tokens": 6804903.0,
"step": 1910
},
{
"entropy": 1.2069343857467174,
"epoch": 0.6144737368484218,
"grad_norm": 2.78125,
"learning_rate": 8.574475648773553e-06,
"loss": 1.2467212677001953,
"mean_token_accuracy": 0.7350850224494934,
"num_tokens": 6844790.0,
"step": 1920
},
{
"entropy": 1.1031412109732628,
"epoch": 0.6176741208945074,
"grad_norm": 3.03125,
"learning_rate": 8.503377177390687e-06,
"loss": 1.1550896644592286,
"mean_token_accuracy": 0.7549904160201549,
"num_tokens": 6882003.0,
"step": 1930
},
{
"entropy": 1.0845932632684707,
"epoch": 0.6208745049405928,
"grad_norm": 3.625,
"learning_rate": 8.432278706007822e-06,
"loss": 1.110933780670166,
"mean_token_accuracy": 0.7586763650178909,
"num_tokens": 6919965.0,
"step": 1940
},
{
"entropy": 1.1197873912751675,
"epoch": 0.6240748889866784,
"grad_norm": 3.4375,
"learning_rate": 8.361180234624956e-06,
"loss": 1.185824203491211,
"mean_token_accuracy": 0.7533484481275081,
"num_tokens": 6954264.0,
"step": 1950
},
{
"entropy": 1.157302127033472,
"epoch": 0.627275273032764,
"grad_norm": 3.3125,
"learning_rate": 8.29008176324209e-06,
"loss": 1.1991801261901855,
"mean_token_accuracy": 0.7502691283822059,
"num_tokens": 6991391.0,
"step": 1960
},
{
"entropy": 1.1476174682378768,
"epoch": 0.6304756570788494,
"grad_norm": 3.1875,
"learning_rate": 8.218983291859226e-06,
"loss": 1.1750798225402832,
"mean_token_accuracy": 0.7515600122511387,
"num_tokens": 7028463.0,
"step": 1970
},
{
"entropy": 1.1342898778617383,
"epoch": 0.633676041124935,
"grad_norm": 3.328125,
"learning_rate": 8.14788482047636e-06,
"loss": 1.2121641159057617,
"mean_token_accuracy": 0.7529564268887043,
"num_tokens": 7064064.0,
"step": 1980
},
{
"entropy": 1.1010157510638237,
"epoch": 0.6368764251710205,
"grad_norm": 3.75,
"learning_rate": 8.076786349093494e-06,
"loss": 1.1628602981567382,
"mean_token_accuracy": 0.7538565069437027,
"num_tokens": 7098862.0,
"step": 1990
},
{
"entropy": 1.1578264623880385,
"epoch": 0.6400768092171061,
"grad_norm": 3.59375,
"learning_rate": 8.005687877710629e-06,
"loss": 1.2299229621887207,
"mean_token_accuracy": 0.7478043004870415,
"num_tokens": 7136374.0,
"step": 2000
},
{
"entropy": 1.0698354601860047,
"epoch": 0.6432771932631915,
"grad_norm": 3.390625,
"learning_rate": 7.934589406327765e-06,
"loss": 1.1068886756896972,
"mean_token_accuracy": 0.7641137100756168,
"num_tokens": 7169636.0,
"step": 2010
},
{
"entropy": 1.112225916981697,
"epoch": 0.6464775773092771,
"grad_norm": 3.453125,
"learning_rate": 7.863490934944899e-06,
"loss": 1.166696834564209,
"mean_token_accuracy": 0.7522329725325108,
"num_tokens": 7205044.0,
"step": 2020
},
{
"entropy": 1.1038395315408707,
"epoch": 0.6496779613553626,
"grad_norm": 3.5,
"learning_rate": 7.792392463562035e-06,
"loss": 1.1359478950500488,
"mean_token_accuracy": 0.756668771058321,
"num_tokens": 7240663.0,
"step": 2030
},
{
"entropy": 1.0801053799688816,
"epoch": 0.6528783454014482,
"grad_norm": 3.078125,
"learning_rate": 7.721293992179169e-06,
"loss": 1.119198989868164,
"mean_token_accuracy": 0.7593862563371658,
"num_tokens": 7278637.0,
"step": 2040
},
{
"entropy": 1.1753631062805652,
"epoch": 0.6560787294475338,
"grad_norm": 2.90625,
"learning_rate": 7.650195520796303e-06,
"loss": 1.2429065704345703,
"mean_token_accuracy": 0.7447149440646171,
"num_tokens": 7314162.0,
"step": 2050
},
{
"entropy": 1.0993228390812875,
"epoch": 0.6592791134936192,
"grad_norm": 3.390625,
"learning_rate": 7.579097049413438e-06,
"loss": 1.1387292861938476,
"mean_token_accuracy": 0.7615065090358257,
"num_tokens": 7349124.0,
"step": 2060
},
{
"entropy": 1.1077005062252283,
"epoch": 0.6624794975397048,
"grad_norm": 3.84375,
"learning_rate": 7.507998578030573e-06,
"loss": 1.2013302803039552,
"mean_token_accuracy": 0.7560870915651321,
"num_tokens": 7383405.0,
"step": 2070
},
{
"entropy": 1.1307024940848351,
"epoch": 0.6656798815857903,
"grad_norm": 4.28125,
"learning_rate": 7.4369001066477075e-06,
"loss": 1.198493766784668,
"mean_token_accuracy": 0.7485630966722965,
"num_tokens": 7414714.0,
"step": 2080
},
{
"entropy": 1.1086504600942135,
"epoch": 0.6688802656318759,
"grad_norm": 3.59375,
"learning_rate": 7.365801635264842e-06,
"loss": 1.1572361946105958,
"mean_token_accuracy": 0.7570925623178482,
"num_tokens": 7451556.0,
"step": 2090
},
{
"entropy": 1.0650083281099796,
"epoch": 0.6720806496779613,
"grad_norm": 3.109375,
"learning_rate": 7.294703163881978e-06,
"loss": 1.124489688873291,
"mean_token_accuracy": 0.7592034861445427,
"num_tokens": 7491824.0,
"step": 2100
},
{
"entropy": 1.160896249115467,
"epoch": 0.6752810337240469,
"grad_norm": 3.8125,
"learning_rate": 7.223604692499112e-06,
"loss": 1.2408259391784668,
"mean_token_accuracy": 0.7528047002851963,
"num_tokens": 7522213.0,
"step": 2110
},
{
"entropy": 1.131654118001461,
"epoch": 0.6784814177701324,
"grad_norm": 3.40625,
"learning_rate": 7.152506221116247e-06,
"loss": 1.1762347221374512,
"mean_token_accuracy": 0.7540035150945187,
"num_tokens": 7556942.0,
"step": 2120
},
{
"entropy": 1.1728335734456778,
"epoch": 0.681681801816218,
"grad_norm": 2.828125,
"learning_rate": 7.081407749733381e-06,
"loss": 1.2240229606628419,
"mean_token_accuracy": 0.7472974568605423,
"num_tokens": 7592279.0,
"step": 2130
},
{
"entropy": 1.1371040247380733,
"epoch": 0.6848821858623034,
"grad_norm": 3.5,
"learning_rate": 7.010309278350515e-06,
"loss": 1.1692868232727052,
"mean_token_accuracy": 0.7444953367114067,
"num_tokens": 7631064.0,
"step": 2140
},
{
"entropy": 1.079392648115754,
"epoch": 0.688082569908389,
"grad_norm": 3.5625,
"learning_rate": 6.939210806967651e-06,
"loss": 1.1272685050964355,
"mean_token_accuracy": 0.7608507804572582,
"num_tokens": 7663853.0,
"step": 2150
},
{
"entropy": 1.1790861997753381,
"epoch": 0.6912829539544746,
"grad_norm": 4.0,
"learning_rate": 6.8681123355847855e-06,
"loss": 1.271801471710205,
"mean_token_accuracy": 0.7439754210412503,
"num_tokens": 7699593.0,
"step": 2160
},
{
"entropy": 1.1712711922824384,
"epoch": 0.6944833380005601,
"grad_norm": 3.359375,
"learning_rate": 6.79701386420192e-06,
"loss": 1.2302053451538086,
"mean_token_accuracy": 0.7436926513910294,
"num_tokens": 7735279.0,
"step": 2170
},
{
"entropy": 1.0742683559656143,
"epoch": 0.6976837220466456,
"grad_norm": 3.28125,
"learning_rate": 6.725915392819055e-06,
"loss": 1.1179491043090821,
"mean_token_accuracy": 0.7624569363892079,
"num_tokens": 7771538.0,
"step": 2180
},
{
"entropy": 1.1455774445086717,
"epoch": 0.7008841060927311,
"grad_norm": 3.703125,
"learning_rate": 6.65481692143619e-06,
"loss": 1.210339641571045,
"mean_token_accuracy": 0.750506728887558,
"num_tokens": 7805334.0,
"step": 2190
},
{
"entropy": 1.1600065805017947,
"epoch": 0.7040844901388167,
"grad_norm": 3.296875,
"learning_rate": 6.583718450053325e-06,
"loss": 1.2067691802978515,
"mean_token_accuracy": 0.7510503888130188,
"num_tokens": 7838406.0,
"step": 2200
},
{
"entropy": 1.1392403941601514,
"epoch": 0.7072848741849022,
"grad_norm": 3.40625,
"learning_rate": 6.512619978670459e-06,
"loss": 1.162048053741455,
"mean_token_accuracy": 0.7528949834406375,
"num_tokens": 7871227.0,
"step": 2210
},
{
"entropy": 1.0721043154597283,
"epoch": 0.7104852582309877,
"grad_norm": 3.03125,
"learning_rate": 6.441521507287593e-06,
"loss": 1.1128012657165527,
"mean_token_accuracy": 0.7630540691316128,
"num_tokens": 7904703.0,
"step": 2220
},
{
"entropy": 1.0537261202931405,
"epoch": 0.7136856422770732,
"grad_norm": 3.078125,
"learning_rate": 6.3704230359047284e-06,
"loss": 1.0881397247314453,
"mean_token_accuracy": 0.7647965393960476,
"num_tokens": 7943799.0,
"step": 2230
},
{
"entropy": 1.1213313553482294,
"epoch": 0.7168860263231588,
"grad_norm": 3.09375,
"learning_rate": 6.2993245645218635e-06,
"loss": 1.161877155303955,
"mean_token_accuracy": 0.7525055252015591,
"num_tokens": 7979863.0,
"step": 2240
},
{
"entropy": 1.2231854621320963,
"epoch": 0.7200864103692443,
"grad_norm": 3.5625,
"learning_rate": 6.2282260931389986e-06,
"loss": 1.305109691619873,
"mean_token_accuracy": 0.7315145306289196,
"num_tokens": 8016742.0,
"step": 2250
},
{
"entropy": 1.0974082320928573,
"epoch": 0.7232867944153298,
"grad_norm": 2.9375,
"learning_rate": 6.157127621756133e-06,
"loss": 1.150672149658203,
"mean_token_accuracy": 0.7546444937586785,
"num_tokens": 8053669.0,
"step": 2260
},
{
"entropy": 1.1266177907586097,
"epoch": 0.7264871784614154,
"grad_norm": 3.265625,
"learning_rate": 6.086029150373267e-06,
"loss": 1.2110174179077149,
"mean_token_accuracy": 0.7550385102629662,
"num_tokens": 8087480.0,
"step": 2270
},
{
"entropy": 1.135270792245865,
"epoch": 0.7296875625075009,
"grad_norm": 3.21875,
"learning_rate": 6.014930678990403e-06,
"loss": 1.1860703468322753,
"mean_token_accuracy": 0.7481087513267994,
"num_tokens": 8123625.0,
"step": 2280
},
{
"entropy": 1.14946624673903,
"epoch": 0.7328879465535865,
"grad_norm": 3.453125,
"learning_rate": 5.943832207607537e-06,
"loss": 1.190632438659668,
"mean_token_accuracy": 0.7547764800488949,
"num_tokens": 8156665.0,
"step": 2290
},
{
"entropy": 1.1558411501348018,
"epoch": 0.7360883305996719,
"grad_norm": 3.1875,
"learning_rate": 5.872733736224671e-06,
"loss": 1.2208381652832032,
"mean_token_accuracy": 0.7456505544483661,
"num_tokens": 8193545.0,
"step": 2300
},
{
"entropy": 1.0852365911006927,
"epoch": 0.7392887146457575,
"grad_norm": 3.15625,
"learning_rate": 5.801635264841806e-06,
"loss": 1.1065022468566894,
"mean_token_accuracy": 0.7572917930781842,
"num_tokens": 8226934.0,
"step": 2310
},
{
"entropy": 1.0914320670068265,
"epoch": 0.742489098691843,
"grad_norm": 3.78125,
"learning_rate": 5.730536793458941e-06,
"loss": 1.099323844909668,
"mean_token_accuracy": 0.7600689142942428,
"num_tokens": 8260774.0,
"step": 2320
},
{
"entropy": 1.1091071009635924,
"epoch": 0.7456894827379286,
"grad_norm": 3.078125,
"learning_rate": 5.6594383220760765e-06,
"loss": 1.1712286949157715,
"mean_token_accuracy": 0.7567473009228707,
"num_tokens": 8295211.0,
"step": 2330
},
{
"entropy": 1.1220351219177247,
"epoch": 0.748889866784014,
"grad_norm": 3.140625,
"learning_rate": 5.588339850693211e-06,
"loss": 1.1657176971435548,
"mean_token_accuracy": 0.7564576506614685,
"num_tokens": 8330743.0,
"step": 2340
},
{
"entropy": 1.0823850885033608,
"epoch": 0.7520902508300996,
"grad_norm": 3.796875,
"learning_rate": 5.517241379310345e-06,
"loss": 1.1302215576171875,
"mean_token_accuracy": 0.7629231609404087,
"num_tokens": 8363593.0,
"step": 2350
},
{
"entropy": 1.114680102840066,
"epoch": 0.7552906348761852,
"grad_norm": 3.390625,
"learning_rate": 5.44614290792748e-06,
"loss": 1.176011848449707,
"mean_token_accuracy": 0.7503922112286091,
"num_tokens": 8402137.0,
"step": 2360
},
{
"entropy": 1.0473700985312462,
"epoch": 0.7584910189222707,
"grad_norm": 3.859375,
"learning_rate": 5.375044436544615e-06,
"loss": 1.085726547241211,
"mean_token_accuracy": 0.7641149386763573,
"num_tokens": 8438324.0,
"step": 2370
},
{
"entropy": 1.1461260944604874,
"epoch": 0.7616914029683562,
"grad_norm": 3.21875,
"learning_rate": 5.303945965161749e-06,
"loss": 1.2125227928161622,
"mean_token_accuracy": 0.7528879292309284,
"num_tokens": 8474170.0,
"step": 2380
},
{
"entropy": 1.1439074050635099,
"epoch": 0.7648917870144417,
"grad_norm": 3.5,
"learning_rate": 5.232847493778884e-06,
"loss": 1.1473745346069335,
"mean_token_accuracy": 0.7443250894546509,
"num_tokens": 8513458.0,
"step": 2390
},
{
"entropy": 1.0630555912852286,
"epoch": 0.7680921710605273,
"grad_norm": 3.5,
"learning_rate": 5.161749022396019e-06,
"loss": 1.1160799980163574,
"mean_token_accuracy": 0.7668336167931556,
"num_tokens": 8547193.0,
"step": 2400
},
{
"entropy": 1.0855234183371067,
"epoch": 0.7712925551066128,
"grad_norm": 3.171875,
"learning_rate": 5.090650551013153e-06,
"loss": 1.1209659576416016,
"mean_token_accuracy": 0.7573182880878448,
"num_tokens": 8583593.0,
"step": 2410
},
{
"entropy": 1.16197330057621,
"epoch": 0.7744929391526983,
"grad_norm": 3.4375,
"learning_rate": 5.019552079630289e-06,
"loss": 1.234616184234619,
"mean_token_accuracy": 0.7473996456712484,
"num_tokens": 8619710.0,
"step": 2420
},
{
"entropy": 1.2096669979393482,
"epoch": 0.7776933231987838,
"grad_norm": 3.421875,
"learning_rate": 4.948453608247423e-06,
"loss": 1.2796695709228516,
"mean_token_accuracy": 0.7381796896457672,
"num_tokens": 8657019.0,
"step": 2430
},
{
"entropy": 1.1043912775814533,
"epoch": 0.7808937072448694,
"grad_norm": 3.5,
"learning_rate": 4.877355136864558e-06,
"loss": 1.121436882019043,
"mean_token_accuracy": 0.75357426404953,
"num_tokens": 8693681.0,
"step": 2440
},
{
"entropy": 1.0841567002236843,
"epoch": 0.7840940912909549,
"grad_norm": 2.859375,
"learning_rate": 4.806256665481693e-06,
"loss": 1.104970645904541,
"mean_token_accuracy": 0.7571829192340374,
"num_tokens": 8730108.0,
"step": 2450
},
{
"entropy": 1.126195802539587,
"epoch": 0.7872944753370404,
"grad_norm": 3.359375,
"learning_rate": 4.735158194098827e-06,
"loss": 1.1975386619567872,
"mean_token_accuracy": 0.7514684118330479,
"num_tokens": 8764461.0,
"step": 2460
},
{
"entropy": 1.0726923126727343,
"epoch": 0.790494859383126,
"grad_norm": 3.90625,
"learning_rate": 4.6640597227159615e-06,
"loss": 1.1125378608703613,
"mean_token_accuracy": 0.7626473598182202,
"num_tokens": 8799890.0,
"step": 2470
},
{
"entropy": 1.1773266084492207,
"epoch": 0.7936952434292115,
"grad_norm": 3.4375,
"learning_rate": 4.592961251333097e-06,
"loss": 1.2108798980712892,
"mean_token_accuracy": 0.7410904221236706,
"num_tokens": 8838818.0,
"step": 2480
},
{
"entropy": 1.090137529373169,
"epoch": 0.7968956274752971,
"grad_norm": 3.59375,
"learning_rate": 4.521862779950232e-06,
"loss": 1.1148558616638184,
"mean_token_accuracy": 0.7648926541209221,
"num_tokens": 8870816.0,
"step": 2490
},
{
"entropy": 1.1689164392650127,
"epoch": 0.8000960115213825,
"grad_norm": 2.890625,
"learning_rate": 4.450764308567366e-06,
"loss": 1.2032492637634278,
"mean_token_accuracy": 0.7398371711373329,
"num_tokens": 8909484.0,
"step": 2500
},
{
"entropy": 1.0879596583545208,
"epoch": 0.8032963955674681,
"grad_norm": 3.203125,
"learning_rate": 4.379665837184501e-06,
"loss": 1.1078178405761718,
"mean_token_accuracy": 0.7553422212600708,
"num_tokens": 8944951.0,
"step": 2510
},
{
"entropy": 1.1411900214850903,
"epoch": 0.8064967796135536,
"grad_norm": 3.875,
"learning_rate": 4.308567365801636e-06,
"loss": 1.1979658126831054,
"mean_token_accuracy": 0.7543410055339337,
"num_tokens": 8979216.0,
"step": 2520
},
{
"entropy": 1.1815967209637166,
"epoch": 0.8096971636596392,
"grad_norm": 3.46875,
"learning_rate": 4.23746889441877e-06,
"loss": 1.2603289604187011,
"mean_token_accuracy": 0.7485571041703224,
"num_tokens": 9011929.0,
"step": 2530
},
{
"entropy": 1.1050000466406344,
"epoch": 0.8128975477057246,
"grad_norm": 3.328125,
"learning_rate": 4.166370423035905e-06,
"loss": 1.1503895759582519,
"mean_token_accuracy": 0.7591159790754318,
"num_tokens": 9045737.0,
"step": 2540
},
{
"entropy": 1.046723449230194,
"epoch": 0.8160979317518102,
"grad_norm": 3.1875,
"learning_rate": 4.0952719516530395e-06,
"loss": 1.0639203071594239,
"mean_token_accuracy": 0.7683053657412529,
"num_tokens": 9079676.0,
"step": 2550
},
{
"entropy": 1.1944607935845852,
"epoch": 0.8192983157978957,
"grad_norm": 3.125,
"learning_rate": 4.024173480270175e-06,
"loss": 1.247727394104004,
"mean_token_accuracy": 0.7391177780926228,
"num_tokens": 9114644.0,
"step": 2560
},
{
"entropy": 1.1602688152343035,
"epoch": 0.8224986998439813,
"grad_norm": 3.296875,
"learning_rate": 3.95307500888731e-06,
"loss": 1.2294767379760743,
"mean_token_accuracy": 0.7495340570807457,
"num_tokens": 9152236.0,
"step": 2570
},
{
"entropy": 1.2158122390508652,
"epoch": 0.8256990838900669,
"grad_norm": 2.90625,
"learning_rate": 3.881976537504444e-06,
"loss": 1.2398143768310548,
"mean_token_accuracy": 0.7380207255482674,
"num_tokens": 9190733.0,
"step": 2580
},
{
"entropy": 1.1768857415765523,
"epoch": 0.8288994679361523,
"grad_norm": 4.21875,
"learning_rate": 3.810878066121579e-06,
"loss": 1.2839090347290039,
"mean_token_accuracy": 0.7433359183371067,
"num_tokens": 9225408.0,
"step": 2590
},
{
"entropy": 1.0817514464259148,
"epoch": 0.8320998519822379,
"grad_norm": 2.890625,
"learning_rate": 3.739779594738713e-06,
"loss": 1.1311766624450683,
"mean_token_accuracy": 0.7620703734457492,
"num_tokens": 9259655.0,
"step": 2600
},
{
"entropy": 1.1603660874068737,
"epoch": 0.8353002360283234,
"grad_norm": 2.921875,
"learning_rate": 3.6686811233558482e-06,
"loss": 1.2468878746032714,
"mean_token_accuracy": 0.7444131776690484,
"num_tokens": 9296792.0,
"step": 2610
},
{
"entropy": 1.1298386432230472,
"epoch": 0.838500620074409,
"grad_norm": 3.1875,
"learning_rate": 3.597582651972983e-06,
"loss": 1.1794001579284668,
"mean_token_accuracy": 0.7496243976056576,
"num_tokens": 9333174.0,
"step": 2620
},
{
"entropy": 1.1448624573647976,
"epoch": 0.8417010041204944,
"grad_norm": 3.125,
"learning_rate": 3.526484180590118e-06,
"loss": 1.1680842399597169,
"mean_token_accuracy": 0.7462442465126514,
"num_tokens": 9374875.0,
"step": 2630
},
{
"entropy": 1.1212282598018646,
"epoch": 0.84490138816658,
"grad_norm": 3.5,
"learning_rate": 3.455385709207252e-06,
"loss": 1.18281888961792,
"mean_token_accuracy": 0.7593762136995792,
"num_tokens": 9408490.0,
"step": 2640
},
{
"entropy": 1.1325732119381429,
"epoch": 0.8481017722126655,
"grad_norm": 3.578125,
"learning_rate": 3.384287237824387e-06,
"loss": 1.1580286979675294,
"mean_token_accuracy": 0.7503605335950851,
"num_tokens": 9443447.0,
"step": 2650
},
{
"entropy": 1.142949765175581,
"epoch": 0.851302156258751,
"grad_norm": 3.203125,
"learning_rate": 3.313188766441522e-06,
"loss": 1.1941743850708009,
"mean_token_accuracy": 0.752988663315773,
"num_tokens": 9478354.0,
"step": 2660
},
{
"entropy": 1.1249619655311107,
"epoch": 0.8545025403048366,
"grad_norm": 3.46875,
"learning_rate": 3.2420902950586565e-06,
"loss": 1.2092914581298828,
"mean_token_accuracy": 0.7525562759488821,
"num_tokens": 9517475.0,
"step": 2670
},
{
"entropy": 1.1741073250770568,
"epoch": 0.8577029243509221,
"grad_norm": 3.578125,
"learning_rate": 3.1709918236757916e-06,
"loss": 1.262247371673584,
"mean_token_accuracy": 0.7427960857748985,
"num_tokens": 9553289.0,
"step": 2680
},
{
"entropy": 1.105969700962305,
"epoch": 0.8609033083970077,
"grad_norm": 3.3125,
"learning_rate": 3.0998933522929258e-06,
"loss": 1.1461322784423829,
"mean_token_accuracy": 0.75559606179595,
"num_tokens": 9588549.0,
"step": 2690
},
{
"entropy": 1.1349318251013756,
"epoch": 0.8641036924430932,
"grad_norm": 3.078125,
"learning_rate": 3.028794880910061e-06,
"loss": 1.1659625053405762,
"mean_token_accuracy": 0.7462083771824837,
"num_tokens": 9625305.0,
"step": 2700
},
{
"entropy": 1.0998256973922254,
"epoch": 0.8673040764891787,
"grad_norm": 2.90625,
"learning_rate": 2.9576964095271955e-06,
"loss": 1.173351001739502,
"mean_token_accuracy": 0.7538725100457668,
"num_tokens": 9663574.0,
"step": 2710
},
{
"entropy": 1.1989767000079155,
"epoch": 0.8705044605352642,
"grad_norm": 3.515625,
"learning_rate": 2.8865979381443297e-06,
"loss": 1.278292465209961,
"mean_token_accuracy": 0.737822500616312,
"num_tokens": 9699248.0,
"step": 2720
},
{
"entropy": 1.131580077856779,
"epoch": 0.8737048445813498,
"grad_norm": 3.1875,
"learning_rate": 2.8154994667614648e-06,
"loss": 1.1636852264404296,
"mean_token_accuracy": 0.7542126163840294,
"num_tokens": 9733347.0,
"step": 2730
},
{
"entropy": 1.0964635238051414,
"epoch": 0.8769052286274353,
"grad_norm": 3.6875,
"learning_rate": 2.7444009953785994e-06,
"loss": 1.1526992797851563,
"mean_token_accuracy": 0.7599952027201653,
"num_tokens": 9770524.0,
"step": 2740
},
{
"entropy": 1.0702364332973957,
"epoch": 0.8801056126735208,
"grad_norm": 3.59375,
"learning_rate": 2.6733025239957345e-06,
"loss": 1.0925715446472168,
"mean_token_accuracy": 0.7613530211150646,
"num_tokens": 9805904.0,
"step": 2750
},
{
"entropy": 1.143309585005045,
"epoch": 0.8833059967196063,
"grad_norm": 3.4375,
"learning_rate": 2.6022040526128687e-06,
"loss": 1.185093879699707,
"mean_token_accuracy": 0.748717375099659,
"num_tokens": 9843097.0,
"step": 2760
},
{
"entropy": 1.1525050312280656,
"epoch": 0.8865063807656919,
"grad_norm": 3.484375,
"learning_rate": 2.5311055812300038e-06,
"loss": 1.186710262298584,
"mean_token_accuracy": 0.7498737536370754,
"num_tokens": 9878625.0,
"step": 2770
},
{
"entropy": 1.096405889093876,
"epoch": 0.8897067648117775,
"grad_norm": 3.0625,
"learning_rate": 2.4600071098471384e-06,
"loss": 1.1552643775939941,
"mean_token_accuracy": 0.7564327225089074,
"num_tokens": 9913940.0,
"step": 2780
},
{
"entropy": 1.075688973069191,
"epoch": 0.8929071488578629,
"grad_norm": 3.59375,
"learning_rate": 2.388908638464273e-06,
"loss": 1.0996969223022461,
"mean_token_accuracy": 0.7608482711017132,
"num_tokens": 9950221.0,
"step": 2790
},
{
"entropy": 1.1116474494338036,
"epoch": 0.8961075329039485,
"grad_norm": 3.578125,
"learning_rate": 2.317810167081408e-06,
"loss": 1.183712863922119,
"mean_token_accuracy": 0.7586163900792599,
"num_tokens": 9982826.0,
"step": 2800
},
{
"entropy": 1.1222521997988224,
"epoch": 0.899307916950034,
"grad_norm": 3.296875,
"learning_rate": 2.2467116956985428e-06,
"loss": 1.1775464057922362,
"mean_token_accuracy": 0.7527868509292602,
"num_tokens": 10018325.0,
"step": 2810
},
{
"entropy": 1.12875221632421,
"epoch": 0.9025083009961196,
"grad_norm": 3.328125,
"learning_rate": 2.1756132243156774e-06,
"loss": 1.206295108795166,
"mean_token_accuracy": 0.7542196542024613,
"num_tokens": 10052547.0,
"step": 2820
},
{
"entropy": 1.1360722210258245,
"epoch": 0.905708685042205,
"grad_norm": 3.515625,
"learning_rate": 2.104514752932812e-06,
"loss": 1.1869568824768066,
"mean_token_accuracy": 0.7474234350025654,
"num_tokens": 10091594.0,
"step": 2830
},
{
"entropy": 1.0468792729079723,
"epoch": 0.9089090690882906,
"grad_norm": 3.703125,
"learning_rate": 2.033416281549947e-06,
"loss": 1.0732879638671875,
"mean_token_accuracy": 0.7691854566335679,
"num_tokens": 10126242.0,
"step": 2840
},
{
"entropy": 1.1514717623591424,
"epoch": 0.9121094531343761,
"grad_norm": 3.265625,
"learning_rate": 1.9623178101670813e-06,
"loss": 1.196326732635498,
"mean_token_accuracy": 0.7465457141399383,
"num_tokens": 10162663.0,
"step": 2850
},
{
"entropy": 1.1170444838702678,
"epoch": 0.9153098371804617,
"grad_norm": 2.8125,
"learning_rate": 1.8912193387842162e-06,
"loss": 1.1753318786621094,
"mean_token_accuracy": 0.7546933814883232,
"num_tokens": 10199344.0,
"step": 2860
},
{
"entropy": 1.1827090494334698,
"epoch": 0.9185102212265472,
"grad_norm": 3.625,
"learning_rate": 1.820120867401351e-06,
"loss": 1.2415277481079101,
"mean_token_accuracy": 0.739153602719307,
"num_tokens": 10233777.0,
"step": 2870
},
{
"entropy": 1.0766679864376782,
"epoch": 0.9217106052726327,
"grad_norm": 3.6875,
"learning_rate": 1.7490223960184857e-06,
"loss": 1.1411251068115233,
"mean_token_accuracy": 0.7570614032447338,
"num_tokens": 10270302.0,
"step": 2880
},
{
"entropy": 1.0990701586008071,
"epoch": 0.9249109893187183,
"grad_norm": 3.421875,
"learning_rate": 1.6779239246356205e-06,
"loss": 1.1710631370544433,
"mean_token_accuracy": 0.7585064023733139,
"num_tokens": 10305178.0,
"step": 2890
},
{
"entropy": 1.0720692560076714,
"epoch": 0.9281113733648038,
"grad_norm": 3.21875,
"learning_rate": 1.6068254532527552e-06,
"loss": 1.0985607147216796,
"mean_token_accuracy": 0.7623618088662625,
"num_tokens": 10341351.0,
"step": 2900
},
{
"entropy": 1.0809118885546922,
"epoch": 0.9313117574108893,
"grad_norm": 3.34375,
"learning_rate": 1.53572698186989e-06,
"loss": 1.1065154075622559,
"mean_token_accuracy": 0.7592159628868103,
"num_tokens": 10378308.0,
"step": 2910
},
{
"entropy": 1.0883469644933939,
"epoch": 0.9345121414569748,
"grad_norm": 3.140625,
"learning_rate": 1.4646285104870247e-06,
"loss": 1.1307219505310058,
"mean_token_accuracy": 0.7604426823556423,
"num_tokens": 10411774.0,
"step": 2920
},
{
"entropy": 1.1618533357977867,
"epoch": 0.9377125255030604,
"grad_norm": 3.75,
"learning_rate": 1.3935300391041593e-06,
"loss": 1.2212342262268066,
"mean_token_accuracy": 0.746428107470274,
"num_tokens": 10447555.0,
"step": 2930
},
{
"entropy": 1.0985857374966144,
"epoch": 0.9409129095491459,
"grad_norm": 3.1875,
"learning_rate": 1.322431567721294e-06,
"loss": 1.1086782455444335,
"mean_token_accuracy": 0.7579902283847332,
"num_tokens": 10485342.0,
"step": 2940
},
{
"entropy": 1.113938895612955,
"epoch": 0.9441132935952314,
"grad_norm": 3.4375,
"learning_rate": 1.2513330963384288e-06,
"loss": 1.1549474716186523,
"mean_token_accuracy": 0.7552253149449826,
"num_tokens": 10519459.0,
"step": 2950
},
{
"entropy": 1.1388332910835743,
"epoch": 0.9473136776413169,
"grad_norm": 3.234375,
"learning_rate": 1.1802346249555635e-06,
"loss": 1.213517189025879,
"mean_token_accuracy": 0.7471270561218262,
"num_tokens": 10555227.0,
"step": 2960
},
{
"entropy": 1.0419878501445055,
"epoch": 0.9505140616874025,
"grad_norm": 3.359375,
"learning_rate": 1.1091361535726983e-06,
"loss": 1.085500717163086,
"mean_token_accuracy": 0.7708059817552566,
"num_tokens": 10590479.0,
"step": 2970
},
{
"entropy": 1.1476553842425345,
"epoch": 0.9537144457334881,
"grad_norm": 3.40625,
"learning_rate": 1.038037682189833e-06,
"loss": 1.1976530075073242,
"mean_token_accuracy": 0.7469619035720825,
"num_tokens": 10626605.0,
"step": 2980
},
{
"entropy": 1.126973857730627,
"epoch": 0.9569148297795735,
"grad_norm": 3.578125,
"learning_rate": 9.669392108069678e-07,
"loss": 1.1434929847717286,
"mean_token_accuracy": 0.7535457745194435,
"num_tokens": 10660781.0,
"step": 2990
},
{
"entropy": 1.0904895570129156,
"epoch": 0.9601152138256591,
"grad_norm": 3.59375,
"learning_rate": 8.958407394241024e-07,
"loss": 1.144233798980713,
"mean_token_accuracy": 0.7603662610054016,
"num_tokens": 10695321.0,
"step": 3000
},
{
"entropy": 1.0829311583191157,
"epoch": 0.9633155978717446,
"grad_norm": 3.3125,
"learning_rate": 8.247422680412372e-07,
"loss": 1.1176697731018066,
"mean_token_accuracy": 0.7594211801886559,
"num_tokens": 10730739.0,
"step": 3010
},
{
"entropy": 1.1191859498620034,
"epoch": 0.9665159819178302,
"grad_norm": 3.9375,
"learning_rate": 7.536437966583719e-07,
"loss": 1.1339409828186036,
"mean_token_accuracy": 0.7513566389679909,
"num_tokens": 10765642.0,
"step": 3020
},
{
"entropy": 1.1836695678532123,
"epoch": 0.9697163659639156,
"grad_norm": 3.296875,
"learning_rate": 6.825453252755067e-07,
"loss": 1.2448589324951171,
"mean_token_accuracy": 0.7450046464800835,
"num_tokens": 10798289.0,
"step": 3030
},
{
"entropy": 1.12890649959445,
"epoch": 0.9729167500100012,
"grad_norm": 3.078125,
"learning_rate": 6.114468538926413e-07,
"loss": 1.1511384010314942,
"mean_token_accuracy": 0.7531974203884602,
"num_tokens": 10833449.0,
"step": 3040
},
{
"entropy": 1.148883668333292,
"epoch": 0.9761171340560867,
"grad_norm": 3.1875,
"learning_rate": 5.403483825097761e-07,
"loss": 1.2151781082153321,
"mean_token_accuracy": 0.7502546660602093,
"num_tokens": 10868447.0,
"step": 3050
},
{
"entropy": 1.0672550223767758,
"epoch": 0.9793175181021723,
"grad_norm": 3.109375,
"learning_rate": 4.6924991112691083e-07,
"loss": 1.082494354248047,
"mean_token_accuracy": 0.7678111597895623,
"num_tokens": 10901598.0,
"step": 3060
},
{
"entropy": 1.042473478242755,
"epoch": 0.9825179021482577,
"grad_norm": 3.6875,
"learning_rate": 3.9815143974404553e-07,
"loss": 1.114789867401123,
"mean_token_accuracy": 0.772429596632719,
"num_tokens": 10933312.0,
"step": 3070
},
{
"entropy": 1.1300311595201493,
"epoch": 0.9857182861943433,
"grad_norm": 3.640625,
"learning_rate": 3.270529683611803e-07,
"loss": 1.2087718009948731,
"mean_token_accuracy": 0.7560340866446496,
"num_tokens": 10966726.0,
"step": 3080
},
{
"entropy": 1.1198654279112816,
"epoch": 0.9889186702404289,
"grad_norm": 3.484375,
"learning_rate": 2.5595449697831497e-07,
"loss": 1.1944404602050782,
"mean_token_accuracy": 0.7567917600274086,
"num_tokens": 11002300.0,
"step": 3090
},
{
"entropy": 1.1630706571042537,
"epoch": 0.9921190542865144,
"grad_norm": 3.734375,
"learning_rate": 1.8485602559544972e-07,
"loss": 1.2107239723205567,
"mean_token_accuracy": 0.7448431417346001,
"num_tokens": 11039145.0,
"step": 3100
},
{
"entropy": 1.0874366093426944,
"epoch": 0.9953194383326,
"grad_norm": 3.328125,
"learning_rate": 1.1375755421258444e-07,
"loss": 1.1232175827026367,
"mean_token_accuracy": 0.7573442026972771,
"num_tokens": 11074957.0,
"step": 3110
},
{
"entropy": 1.163031455129385,
"epoch": 0.9985198223786854,
"grad_norm": 3.140625,
"learning_rate": 4.265908282971917e-08,
"loss": 1.1890130996704102,
"mean_token_accuracy": 0.7419414661824704,
"num_tokens": 11114151.0,
"step": 3120
}
],
"logging_steps": 10,
"max_steps": 3125,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.2571499019753062e+17,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}