Files
Qwen3-14B-Instruct-2512-SFT/trainer_state.json

4684 lines
122 KiB
JSON
Raw Normal View History

{
"best_global_step": 6200,
"best_metric": 0.57034385,
"best_model_checkpoint": "/root/data/output/14B-SFT-Zero3/v1-20251202-132624/checkpoint-6200",
"epoch": 1.0,
"eval_steps": 200,
"global_step": 6228,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.00016056518946692356,
"grad_norm": 4.759260503459119,
"learning_rate": 4e-08,
"loss": 0.864223837852478,
"step": 1
},
{
"epoch": 0.0016056518946692357,
"grad_norm": 6.708539221917098,
"learning_rate": 4.0000000000000003e-07,
"loss": 0.884010738796658,
"step": 10
},
{
"epoch": 0.0032113037893384713,
"grad_norm": 5.882288099451299,
"learning_rate": 8.000000000000001e-07,
"loss": 0.8287239074707031,
"step": 20
},
{
"epoch": 0.004816955684007707,
"grad_norm": 2.9474128729077966,
"learning_rate": 1.2000000000000002e-06,
"loss": 0.7924188613891602,
"step": 30
},
{
"epoch": 0.006422607578676943,
"grad_norm": 2.3311716309146617,
"learning_rate": 1.6000000000000001e-06,
"loss": 0.8175813674926757,
"step": 40
},
{
"epoch": 0.00802825947334618,
"grad_norm": 2.1516347676740146,
"learning_rate": 2.0000000000000003e-06,
"loss": 0.723994779586792,
"step": 50
},
{
"epoch": 0.009633911368015413,
"grad_norm": 2.5263601194756258,
"learning_rate": 2.4000000000000003e-06,
"loss": 0.7877510070800782,
"step": 60
},
{
"epoch": 0.01123956326268465,
"grad_norm": 1.9776603721255415,
"learning_rate": 2.8000000000000003e-06,
"loss": 0.7068247318267822,
"step": 70
},
{
"epoch": 0.012845215157353885,
"grad_norm": 1.729578271108341,
"learning_rate": 3.2000000000000003e-06,
"loss": 0.7023281574249267,
"step": 80
},
{
"epoch": 0.014450867052023121,
"grad_norm": 2.1522946923251585,
"learning_rate": 3.6000000000000003e-06,
"loss": 0.7004528045654297,
"step": 90
},
{
"epoch": 0.01605651894669236,
"grad_norm": 2.0048746604259002,
"learning_rate": 4.000000000000001e-06,
"loss": 0.7160505771636962,
"step": 100
},
{
"epoch": 0.017662170841361593,
"grad_norm": 2.1276390555471667,
"learning_rate": 4.4e-06,
"loss": 0.6201703071594238,
"step": 110
},
{
"epoch": 0.019267822736030827,
"grad_norm": 2.3931953254109466,
"learning_rate": 4.800000000000001e-06,
"loss": 0.7100973129272461,
"step": 120
},
{
"epoch": 0.020873474630700065,
"grad_norm": 1.7632629841494898,
"learning_rate": 5.2e-06,
"loss": 0.6558451652526855,
"step": 130
},
{
"epoch": 0.0224791265253693,
"grad_norm": 2.009414501812128,
"learning_rate": 5.600000000000001e-06,
"loss": 0.7142935276031495,
"step": 140
},
{
"epoch": 0.024084778420038536,
"grad_norm": 2.160814354773918,
"learning_rate": 6e-06,
"loss": 0.6885526657104493,
"step": 150
},
{
"epoch": 0.02569043031470777,
"grad_norm": 1.8014277771410736,
"learning_rate": 6.4000000000000006e-06,
"loss": 0.7136541366577148,
"step": 160
},
{
"epoch": 0.027296082209377008,
"grad_norm": 2.018318003300108,
"learning_rate": 6.800000000000001e-06,
"loss": 0.6216143608093262,
"step": 170
},
{
"epoch": 0.028901734104046242,
"grad_norm": 1.952369538810581,
"learning_rate": 7.2000000000000005e-06,
"loss": 0.6702580928802491,
"step": 180
},
{
"epoch": 0.03050738599871548,
"grad_norm": 1.984247792321809,
"learning_rate": 7.600000000000001e-06,
"loss": 0.6995386123657227,
"step": 190
},
{
"epoch": 0.03211303789338472,
"grad_norm": 1.7794659354500173,
"learning_rate": 8.000000000000001e-06,
"loss": 0.6760697841644288,
"step": 200
},
{
"epoch": 0.03211303789338472,
"eval_loss": 0.6378431916236877,
"eval_runtime": 116.2437,
"eval_samples_per_second": 17.403,
"eval_steps_per_second": 4.353,
"eval_token_acc": 0.7867874882579367,
"step": 200
},
{
"epoch": 0.03371868978805395,
"grad_norm": 2.031179863122134,
"learning_rate": 8.400000000000001e-06,
"loss": 0.6848911285400391,
"step": 210
},
{
"epoch": 0.035324341682723186,
"grad_norm": 1.769054282614552,
"learning_rate": 8.8e-06,
"loss": 0.6733917236328125,
"step": 220
},
{
"epoch": 0.03692999357739242,
"grad_norm": 2.013750130238611,
"learning_rate": 9.200000000000002e-06,
"loss": 0.6920295715332031,
"step": 230
},
{
"epoch": 0.038535645472061654,
"grad_norm": 1.720816299583957,
"learning_rate": 9.600000000000001e-06,
"loss": 0.7383328914642334,
"step": 240
},
{
"epoch": 0.040141297366730895,
"grad_norm": 1.819465060907524,
"learning_rate": 1e-05,
"loss": 0.7244165420532227,
"step": 250
},
{
"epoch": 0.04174694926140013,
"grad_norm": 1.7972539217653594,
"learning_rate": 9.99993095584273e-06,
"loss": 0.692912483215332,
"step": 260
},
{
"epoch": 0.04335260115606936,
"grad_norm": 1.7067105337641253,
"learning_rate": 9.999723825277754e-06,
"loss": 0.660883617401123,
"step": 270
},
{
"epoch": 0.0449582530507386,
"grad_norm": 2.125091297709986,
"learning_rate": 9.999378614025538e-06,
"loss": 0.6718532085418701,
"step": 280
},
{
"epoch": 0.04656390494540784,
"grad_norm": 2.216748916449176,
"learning_rate": 9.998895331620009e-06,
"loss": 0.6847996711730957,
"step": 290
},
{
"epoch": 0.04816955684007707,
"grad_norm": 1.7631756878355385,
"learning_rate": 9.998273991408293e-06,
"loss": 0.6685489177703857,
"step": 300
},
{
"epoch": 0.04977520873474631,
"grad_norm": 1.839149164708947,
"learning_rate": 9.997514610550363e-06,
"loss": 0.7628218173980713,
"step": 310
},
{
"epoch": 0.05138086062941554,
"grad_norm": 1.856684857256113,
"learning_rate": 9.996617210018536e-06,
"loss": 0.6952354431152343,
"step": 320
},
{
"epoch": 0.052986512524084775,
"grad_norm": 1.9416524505459372,
"learning_rate": 9.995581814596923e-06,
"loss": 0.7695009708404541,
"step": 330
},
{
"epoch": 0.054592164418754016,
"grad_norm": 1.7934258979637172,
"learning_rate": 9.99440845288072e-06,
"loss": 0.6912702560424805,
"step": 340
},
{
"epoch": 0.05619781631342325,
"grad_norm": 1.9412822952421416,
"learning_rate": 9.99309715727544e-06,
"loss": 0.6723281860351562,
"step": 350
},
{
"epoch": 0.057803468208092484,
"grad_norm": 1.7740426112390544,
"learning_rate": 9.991647963996001e-06,
"loss": 0.6599285125732421,
"step": 360
},
{
"epoch": 0.05940912010276172,
"grad_norm": 1.7505849691964597,
"learning_rate": 9.990060913065735e-06,
"loss": 0.7061182022094726,
"step": 370
},
{
"epoch": 0.06101477199743096,
"grad_norm": 1.9101134530734751,
"learning_rate": 9.988336048315278e-06,
"loss": 0.6839250087738037,
"step": 380
},
{
"epoch": 0.0626204238921002,
"grad_norm": 1.7094030187030334,
"learning_rate": 9.986473417381366e-06,
"loss": 0.6800565242767334,
"step": 390
},
{
"epoch": 0.06422607578676943,
"grad_norm": 1.8014199624305205,
"learning_rate": 9.984473071705512e-06,
"loss": 0.6838696479797364,
"step": 400
},
{
"epoch": 0.06422607578676943,
"eval_loss": 0.6409494876861572,
"eval_runtime": 116.1986,
"eval_samples_per_second": 17.41,
"eval_steps_per_second": 4.355,
"eval_token_acc": 0.7858714821779255,
"step": 400
},
{
"epoch": 0.06583172768143866,
"grad_norm": 1.8806108814717688,
"learning_rate": 9.982335066532586e-06,
"loss": 0.6559715747833252,
"step": 410
},
{
"epoch": 0.0674373795761079,
"grad_norm": 1.9102818068882665,
"learning_rate": 9.980059460909298e-06,
"loss": 0.7044609069824219,
"step": 420
},
{
"epoch": 0.06904303147077713,
"grad_norm": 1.770001699523884,
"learning_rate": 9.977646317682553e-06,
"loss": 0.659632396697998,
"step": 430
},
{
"epoch": 0.07064868336544637,
"grad_norm": 1.3567863695029754,
"learning_rate": 9.975095703497727e-06,
"loss": 0.6679704666137696,
"step": 440
},
{
"epoch": 0.07225433526011561,
"grad_norm": 1.6131966739758206,
"learning_rate": 9.972407688796827e-06,
"loss": 0.7166173934936524,
"step": 450
},
{
"epoch": 0.07385998715478484,
"grad_norm": 1.7567050641511104,
"learning_rate": 9.969582347816534e-06,
"loss": 0.6758874893188477,
"step": 460
},
{
"epoch": 0.07546563904945408,
"grad_norm": 1.8735720372468838,
"learning_rate": 9.966619758586164e-06,
"loss": 0.70075364112854,
"step": 470
},
{
"epoch": 0.07707129094412331,
"grad_norm": 1.6791415879981288,
"learning_rate": 9.963520002925506e-06,
"loss": 0.680471658706665,
"step": 480
},
{
"epoch": 0.07867694283879255,
"grad_norm": 2.003529169289507,
"learning_rate": 9.960283166442569e-06,
"loss": 0.6862464904785156,
"step": 490
},
{
"epoch": 0.08028259473346179,
"grad_norm": 1.974113049309557,
"learning_rate": 9.956909338531211e-06,
"loss": 0.6817655086517334,
"step": 500
},
{
"epoch": 0.08188824662813102,
"grad_norm": 2.0172408497940135,
"learning_rate": 9.953398612368673e-06,
"loss": 0.7146397590637207,
"step": 510
},
{
"epoch": 0.08349389852280026,
"grad_norm": 1.7093747574962004,
"learning_rate": 9.949751084913008e-06,
"loss": 0.744438648223877,
"step": 520
},
{
"epoch": 0.0850995504174695,
"grad_norm": 1.5003850976474211,
"learning_rate": 9.9459668569004e-06,
"loss": 0.703244972229004,
"step": 530
},
{
"epoch": 0.08670520231213873,
"grad_norm": 1.798651846954389,
"learning_rate": 9.942046032842381e-06,
"loss": 0.6592291831970215,
"step": 540
},
{
"epoch": 0.08831085420680797,
"grad_norm": 1.6787086638075364,
"learning_rate": 9.937988721022948e-06,
"loss": 0.6808198451995849,
"step": 550
},
{
"epoch": 0.0899165061014772,
"grad_norm": 1.9058721108189276,
"learning_rate": 9.933795033495575e-06,
"loss": 0.6961453914642334,
"step": 560
},
{
"epoch": 0.09152215799614644,
"grad_norm": 1.9916891886759354,
"learning_rate": 9.929465086080106e-06,
"loss": 0.6704145908355713,
"step": 570
},
{
"epoch": 0.09312780989081568,
"grad_norm": 1.91373844820144,
"learning_rate": 9.924998998359571e-06,
"loss": 0.6643758773803711,
"step": 580
},
{
"epoch": 0.0947334617854849,
"grad_norm": 1.5237514585691028,
"learning_rate": 9.920396893676875e-06,
"loss": 0.663077449798584,
"step": 590
},
{
"epoch": 0.09633911368015415,
"grad_norm": 2.145422792432776,
"learning_rate": 9.915658899131393e-06,
"loss": 0.6999767303466797,
"step": 600
},
{
"epoch": 0.09633911368015415,
"eval_loss": 0.6344712972640991,
"eval_runtime": 117.1674,
"eval_samples_per_second": 17.266,
"eval_steps_per_second": 4.319,
"eval_token_acc": 0.7857755434719134,
"step": 600
},
{
"epoch": 0.09794476557482337,
"grad_norm": 1.8307593239051754,
"learning_rate": 9.910785145575464e-06,
"loss": 0.6796013355255127,
"step": 610
},
{
"epoch": 0.09955041746949261,
"grad_norm": 1.6921064740470149,
"learning_rate": 9.905775767610767e-06,
"loss": 0.6893137931823731,
"step": 620
},
{
"epoch": 0.10115606936416185,
"grad_norm": 1.733473142410972,
"learning_rate": 9.900630903584616e-06,
"loss": 0.7370388984680176,
"step": 630
},
{
"epoch": 0.10276172125883108,
"grad_norm": 1.743574703106915,
"learning_rate": 9.895350695586133e-06,
"loss": 0.7003519058227539,
"step": 640
},
{
"epoch": 0.10436737315350032,
"grad_norm": 1.9204364261217848,
"learning_rate": 9.889935289442318e-06,
"loss": 0.6717376232147216,
"step": 650
},
{
"epoch": 0.10597302504816955,
"grad_norm": 1.965527006659715,
"learning_rate": 9.884384834714038e-06,
"loss": 0.6846941471099853,
"step": 660
},
{
"epoch": 0.10757867694283879,
"grad_norm": 1.4820962727349916,
"learning_rate": 9.878699484691876e-06,
"loss": 0.6158783435821533,
"step": 670
},
{
"epoch": 0.10918432883750803,
"grad_norm": 2.0025449794706103,
"learning_rate": 9.872879396391915e-06,
"loss": 0.7124279022216797,
"step": 680
},
{
"epoch": 0.11078998073217726,
"grad_norm": 1.8236979976681365,
"learning_rate": 9.866924730551391e-06,
"loss": 0.6713937759399414,
"step": 690
},
{
"epoch": 0.1123956326268465,
"grad_norm": 1.9199756005068356,
"learning_rate": 9.860835651624259e-06,
"loss": 0.6933858871459961,
"step": 700
},
{
"epoch": 0.11400128452151574,
"grad_norm": 1.8893458383300172,
"learning_rate": 9.854612327776644e-06,
"loss": 0.7108138084411622,
"step": 710
},
{
"epoch": 0.11560693641618497,
"grad_norm": 1.5931503496779096,
"learning_rate": 9.848254930882214e-06,
"loss": 0.6837646961212158,
"step": 720
},
{
"epoch": 0.11721258831085421,
"grad_norm": 2.037361191773241,
"learning_rate": 9.841763636517406e-06,
"loss": 0.7361730098724365,
"step": 730
},
{
"epoch": 0.11881824020552344,
"grad_norm": 1.6947109413422603,
"learning_rate": 9.835138623956603e-06,
"loss": 0.6639810562133789,
"step": 740
},
{
"epoch": 0.12042389210019268,
"grad_norm": 1.5747894809434468,
"learning_rate": 9.828380076167167e-06,
"loss": 0.7038897514343262,
"step": 750
},
{
"epoch": 0.12202954399486192,
"grad_norm": 1.7564416225223747,
"learning_rate": 9.821488179804394e-06,
"loss": 0.6923412322998047,
"step": 760
},
{
"epoch": 0.12363519588953115,
"grad_norm": 1.9384590291788866,
"learning_rate": 9.814463125206356e-06,
"loss": 0.7407946586608887,
"step": 770
},
{
"epoch": 0.1252408477842004,
"grad_norm": 1.75724556040692,
"learning_rate": 9.80730510638864e-06,
"loss": 0.6715410709381103,
"step": 780
},
{
"epoch": 0.12684649967886963,
"grad_norm": 2.202752788945079,
"learning_rate": 9.800014321038998e-06,
"loss": 0.7091189384460449,
"step": 790
},
{
"epoch": 0.12845215157353887,
"grad_norm": 1.7259836719893948,
"learning_rate": 9.792590970511882e-06,
"loss": 0.6885900020599365,
"step": 800
},
{
"epoch": 0.12845215157353887,
"eval_loss": 0.635792076587677,
"eval_runtime": 115.7799,
"eval_samples_per_second": 17.473,
"eval_steps_per_second": 4.37,
"eval_token_acc": 0.7863286509683135,
"step": 800
},
{
"epoch": 0.13005780346820808,
"grad_norm": 1.9935003932751265,
"learning_rate": 9.785035259822884e-06,
"loss": 0.6880996227264404,
"step": 810
},
{
"epoch": 0.13166345536287732,
"grad_norm": 1.804254347504194,
"learning_rate": 9.777347397643075e-06,
"loss": 0.7218072414398193,
"step": 820
},
{
"epoch": 0.13326910725754657,
"grad_norm": 1.778836828004283,
"learning_rate": 9.769527596293242e-06,
"loss": 0.6733824253082276,
"step": 830
},
{
"epoch": 0.1348747591522158,
"grad_norm": 1.6016327944206012,
"learning_rate": 9.761576071738023e-06,
"loss": 0.644852590560913,
"step": 840
},
{
"epoch": 0.13648041104688505,
"grad_norm": 1.7317265857548507,
"learning_rate": 9.753493043579942e-06,
"loss": 0.6704113006591796,
"step": 850
},
{
"epoch": 0.13808606294155426,
"grad_norm": 1.5502607757107583,
"learning_rate": 9.745278735053345e-06,
"loss": 0.684635591506958,
"step": 860
},
{
"epoch": 0.1396917148362235,
"grad_norm": 1.6322250587933358,
"learning_rate": 9.736933373018236e-06,
"loss": 0.6296725273132324,
"step": 870
},
{
"epoch": 0.14129736673089274,
"grad_norm": 1.6281328633715226,
"learning_rate": 9.728457187954013e-06,
"loss": 0.6954986572265625,
"step": 880
},
{
"epoch": 0.14290301862556198,
"grad_norm": 1.6762404325968152,
"learning_rate": 9.719850413953095e-06,
"loss": 0.6957962036132812,
"step": 890
},
{
"epoch": 0.14450867052023122,
"grad_norm": 1.5869956357406125,
"learning_rate": 9.711113288714466e-06,
"loss": 0.6982949256896973,
"step": 900
},
{
"epoch": 0.14611432241490044,
"grad_norm": 1.6499691327729804,
"learning_rate": 9.702246053537108e-06,
"loss": 0.7158383369445801,
"step": 910
},
{
"epoch": 0.14771997430956968,
"grad_norm": 1.66525937964079,
"learning_rate": 9.69324895331333e-06,
"loss": 0.7226263046264648,
"step": 920
},
{
"epoch": 0.14932562620423892,
"grad_norm": 1.5423485440185492,
"learning_rate": 9.684122236522014e-06,
"loss": 0.6935669898986816,
"step": 930
},
{
"epoch": 0.15093127809890816,
"grad_norm": 2.1327741851835467,
"learning_rate": 9.674866155221745e-06,
"loss": 0.6882006168365479,
"step": 940
},
{
"epoch": 0.1525369299935774,
"grad_norm": 2.1405917646231063,
"learning_rate": 9.665480965043862e-06,
"loss": 0.6898535251617431,
"step": 950
},
{
"epoch": 0.15414258188824662,
"grad_norm": 1.5835812345374503,
"learning_rate": 9.655966925185381e-06,
"loss": 0.6587895393371582,
"step": 960
},
{
"epoch": 0.15574823378291586,
"grad_norm": 1.5996285353746509,
"learning_rate": 9.646324298401849e-06,
"loss": 0.7359085083007812,
"step": 970
},
{
"epoch": 0.1573538856775851,
"grad_norm": 1.9180234912666367,
"learning_rate": 9.636553351000077e-06,
"loss": 0.7528255462646485,
"step": 980
},
{
"epoch": 0.15895953757225434,
"grad_norm": 1.7126844032545163,
"learning_rate": 9.626654352830801e-06,
"loss": 0.667484188079834,
"step": 990
},
{
"epoch": 0.16056518946692358,
"grad_norm": 1.9579386418721534,
"learning_rate": 9.616627577281217e-06,
"loss": 0.7283291816711426,
"step": 1000
},
{
"epoch": 0.16056518946692358,
"eval_loss": 0.6324719786643982,
"eval_runtime": 117.4402,
"eval_samples_per_second": 17.226,
"eval_steps_per_second": 4.309,
"eval_token_acc": 0.7870844811217654,
"step": 1000
},
{
"epoch": 0.1621708413615928,
"grad_norm": 2.124330762824706,
"learning_rate": 9.606473301267427e-06,
"loss": 0.7245466232299804,
"step": 1010
},
{
"epoch": 0.16377649325626203,
"grad_norm": 1.7661184806882184,
"learning_rate": 9.59619180522681e-06,
"loss": 0.6639774322509766,
"step": 1020
},
{
"epoch": 0.16538214515093128,
"grad_norm": 1.8821025912253,
"learning_rate": 9.585783373110248e-06,
"loss": 0.6982080459594726,
"step": 1030
},
{
"epoch": 0.16698779704560052,
"grad_norm": 1.7845462984409228,
"learning_rate": 9.575248292374322e-06,
"loss": 0.6804990768432617,
"step": 1040
},
{
"epoch": 0.16859344894026976,
"grad_norm": 1.777143469617724,
"learning_rate": 9.564586853973332e-06,
"loss": 0.7265186309814453,
"step": 1050
},
{
"epoch": 0.170199100834939,
"grad_norm": 1.6943629817215575,
"learning_rate": 9.553799352351293e-06,
"loss": 0.6963564872741699,
"step": 1060
},
{
"epoch": 0.1718047527296082,
"grad_norm": 1.851666049439146,
"learning_rate": 9.54288608543379e-06,
"loss": 0.6982178688049316,
"step": 1070
},
{
"epoch": 0.17341040462427745,
"grad_norm": 1.7784015364121233,
"learning_rate": 9.531847354619745e-06,
"loss": 0.6448168277740478,
"step": 1080
},
{
"epoch": 0.1750160565189467,
"grad_norm": 1.6328432019971293,
"learning_rate": 9.52068346477311e-06,
"loss": 0.689232587814331,
"step": 1090
},
{
"epoch": 0.17662170841361594,
"grad_norm": 1.6395747590691885,
"learning_rate": 9.509394724214428e-06,
"loss": 0.6840867042541504,
"step": 1100
},
{
"epoch": 0.17822736030828518,
"grad_norm": 1.7013838480613497,
"learning_rate": 9.497981444712332e-06,
"loss": 0.7155774593353271,
"step": 1110
},
{
"epoch": 0.1798330122029544,
"grad_norm": 1.800392000928992,
"learning_rate": 9.486443941474928e-06,
"loss": 0.7150219917297364,
"step": 1120
},
{
"epoch": 0.18143866409762363,
"grad_norm": 1.8225619060168265,
"learning_rate": 9.47478253314109e-06,
"loss": 0.7047001838684082,
"step": 1130
},
{
"epoch": 0.18304431599229287,
"grad_norm": 1.6921831025517564,
"learning_rate": 9.462997541771664e-06,
"loss": 0.691263484954834,
"step": 1140
},
{
"epoch": 0.1846499678869621,
"grad_norm": 1.5988960134584689,
"learning_rate": 9.451089292840569e-06,
"loss": 0.6462996482849122,
"step": 1150
},
{
"epoch": 0.18625561978163135,
"grad_norm": 1.6624610693181532,
"learning_rate": 9.439058115225808e-06,
"loss": 0.7005721092224121,
"step": 1160
},
{
"epoch": 0.18786127167630057,
"grad_norm": 1.7408908224585418,
"learning_rate": 9.42690434120039e-06,
"loss": 0.6465234279632568,
"step": 1170
},
{
"epoch": 0.1894669235709698,
"grad_norm": 2.0230964704240093,
"learning_rate": 9.414628306423148e-06,
"loss": 0.7096317291259766,
"step": 1180
},
{
"epoch": 0.19107257546563905,
"grad_norm": 1.5438413479774158,
"learning_rate": 9.402230349929475e-06,
"loss": 0.687491512298584,
"step": 1190
},
{
"epoch": 0.1926782273603083,
"grad_norm": 1.6673847990845716,
"learning_rate": 9.389710814121951e-06,
"loss": 0.7050128936767578,
"step": 1200
},
{
"epoch": 0.1926782273603083,
"eval_loss": 0.6267312169075012,
"eval_runtime": 116.5867,
"eval_samples_per_second": 17.352,
"eval_steps_per_second": 4.34,
"eval_token_acc": 0.7883133308083379,
"step": 1200
},
{
"epoch": 0.19428387925497753,
"grad_norm": 1.9036108770716342,
"learning_rate": 9.377070044760899e-06,
"loss": 0.6793604850769043,
"step": 1210
},
{
"epoch": 0.19588953114964675,
"grad_norm": 1.7574024142219666,
"learning_rate": 9.364308390954823e-06,
"loss": 0.6633443355560302,
"step": 1220
},
{
"epoch": 0.197495183044316,
"grad_norm": 1.8418482772911668,
"learning_rate": 9.351426205150778e-06,
"loss": 0.6838456153869629,
"step": 1230
},
{
"epoch": 0.19910083493898523,
"grad_norm": 1.780986059541626,
"learning_rate": 9.338423843124627e-06,
"loss": 0.7096598625183106,
"step": 1240
},
{
"epoch": 0.20070648683365447,
"grad_norm": 1.467140963611623,
"learning_rate": 9.325301663971222e-06,
"loss": 0.7107316017150879,
"step": 1250
},
{
"epoch": 0.2023121387283237,
"grad_norm": 2.1182017546402827,
"learning_rate": 9.312060030094487e-06,
"loss": 0.714271354675293,
"step": 1260
},
{
"epoch": 0.20391779062299292,
"grad_norm": 1.8241480529102874,
"learning_rate": 9.298699307197398e-06,
"loss": 0.6439716339111328,
"step": 1270
},
{
"epoch": 0.20552344251766216,
"grad_norm": 2.074514301094621,
"learning_rate": 9.2852198642719e-06,
"loss": 0.6223122119903565,
"step": 1280
},
{
"epoch": 0.2071290944123314,
"grad_norm": 1.6495995877234806,
"learning_rate": 9.271622073588699e-06,
"loss": 0.6849968910217286,
"step": 1290
},
{
"epoch": 0.20873474630700065,
"grad_norm": 1.5842560579717333,
"learning_rate": 9.257906310686999e-06,
"loss": 0.6660888671875,
"step": 1300
},
{
"epoch": 0.2103403982016699,
"grad_norm": 1.7025944783720839,
"learning_rate": 9.244072954364116e-06,
"loss": 0.689777946472168,
"step": 1310
},
{
"epoch": 0.2119460500963391,
"grad_norm": 1.6143671464056364,
"learning_rate": 9.23012238666502e-06,
"loss": 0.6809407234191894,
"step": 1320
},
{
"epoch": 0.21355170199100834,
"grad_norm": 1.750371013085034,
"learning_rate": 9.216054992871787e-06,
"loss": 0.6946802616119385,
"step": 1330
},
{
"epoch": 0.21515735388567758,
"grad_norm": 1.6296247737445233,
"learning_rate": 9.201871161492957e-06,
"loss": 0.669765043258667,
"step": 1340
},
{
"epoch": 0.21676300578034682,
"grad_norm": 1.589845342046221,
"learning_rate": 9.187571284252806e-06,
"loss": 0.6649596214294433,
"step": 1350
},
{
"epoch": 0.21836865767501606,
"grad_norm": 1.8048450397597646,
"learning_rate": 9.17315575608052e-06,
"loss": 0.6881882667541503,
"step": 1360
},
{
"epoch": 0.2199743095696853,
"grad_norm": 1.8342938642969528,
"learning_rate": 9.158624975099299e-06,
"loss": 0.7048683166503906,
"step": 1370
},
{
"epoch": 0.22157996146435452,
"grad_norm": 1.6243711900499107,
"learning_rate": 9.143979342615354e-06,
"loss": 0.7189963817596435,
"step": 1380
},
{
"epoch": 0.22318561335902376,
"grad_norm": 1.8230485495669633,
"learning_rate": 9.129219263106825e-06,
"loss": 0.683738899230957,
"step": 1390
},
{
"epoch": 0.224791265253693,
"grad_norm": 1.5695908073726854,
"learning_rate": 9.11434514421261e-06,
"loss": 0.6511239051818848,
"step": 1400
},
{
"epoch": 0.224791265253693,
"eval_loss": 0.6287193894386292,
"eval_runtime": 116.9521,
"eval_samples_per_second": 17.298,
"eval_steps_per_second": 4.327,
"eval_token_acc": 0.7881156136489912,
"step": 1400
},
{
"epoch": 0.22639691714836224,
"grad_norm": 1.4800767435988433,
"learning_rate": 9.099357396721117e-06,
"loss": 0.6380510330200195,
"step": 1410
},
{
"epoch": 0.22800256904303148,
"grad_norm": 1.9797567309083863,
"learning_rate": 9.084256434558898e-06,
"loss": 0.6463112831115723,
"step": 1420
},
{
"epoch": 0.2296082209377007,
"grad_norm": 1.7618381398848315,
"learning_rate": 9.069042674779238e-06,
"loss": 0.6677730560302735,
"step": 1430
},
{
"epoch": 0.23121387283236994,
"grad_norm": 1.6958553368070852,
"learning_rate": 9.053716537550627e-06,
"loss": 0.6688085556030273,
"step": 1440
},
{
"epoch": 0.23281952472703918,
"grad_norm": 1.4712510577159659,
"learning_rate": 9.038278446145155e-06,
"loss": 0.7256585121154785,
"step": 1450
},
{
"epoch": 0.23442517662170842,
"grad_norm": 1.5054612032282009,
"learning_rate": 9.022728826926825e-06,
"loss": 0.6773605823516846,
"step": 1460
},
{
"epoch": 0.23603082851637766,
"grad_norm": 1.9511000712849178,
"learning_rate": 9.007068109339783e-06,
"loss": 0.6480167388916016,
"step": 1470
},
{
"epoch": 0.23763648041104687,
"grad_norm": 1.8030816945625912,
"learning_rate": 8.991296725896449e-06,
"loss": 0.706729507446289,
"step": 1480
},
{
"epoch": 0.23924213230571612,
"grad_norm": 1.7469991434387138,
"learning_rate": 8.975415112165566e-06,
"loss": 0.697143840789795,
"step": 1490
},
{
"epoch": 0.24084778420038536,
"grad_norm": 1.4639433653164637,
"learning_rate": 8.959423706760197e-06,
"loss": 0.6564635276794434,
"step": 1500
},
{
"epoch": 0.2424534360950546,
"grad_norm": 1.829707419585373,
"learning_rate": 8.943322951325583e-06,
"loss": 0.6853602409362793,
"step": 1510
},
{
"epoch": 0.24405908798972384,
"grad_norm": 1.6079876857975004,
"learning_rate": 8.927113290526961e-06,
"loss": 0.64951171875,
"step": 1520
},
{
"epoch": 0.24566473988439305,
"grad_norm": 1.962740635067071,
"learning_rate": 8.910795172037278e-06,
"loss": 0.6620121002197266,
"step": 1530
},
{
"epoch": 0.2472703917790623,
"grad_norm": 1.816612343146698,
"learning_rate": 8.894369046524829e-06,
"loss": 0.6383034706115722,
"step": 1540
},
{
"epoch": 0.24887604367373153,
"grad_norm": 1.58678618072732,
"learning_rate": 8.877835367640813e-06,
"loss": 0.6568033218383789,
"step": 1550
},
{
"epoch": 0.2504816955684008,
"grad_norm": 1.5302435443839166,
"learning_rate": 8.861194592006798e-06,
"loss": 0.6800635814666748,
"step": 1560
},
{
"epoch": 0.25208734746307,
"grad_norm": 1.8654625116067247,
"learning_rate": 8.844447179202119e-06,
"loss": 0.6741923809051513,
"step": 1570
},
{
"epoch": 0.25369299935773926,
"grad_norm": 1.5369005787200434,
"learning_rate": 8.827593591751172e-06,
"loss": 0.7129825592041016,
"step": 1580
},
{
"epoch": 0.25529865125240847,
"grad_norm": 1.7043874051543522,
"learning_rate": 8.810634295110661e-06,
"loss": 0.660031795501709,
"step": 1590
},
{
"epoch": 0.25690430314707774,
"grad_norm": 1.6582761173205205,
"learning_rate": 8.793569757656718e-06,
"loss": 0.6948627471923828,
"step": 1600
},
{
"epoch": 0.25690430314707774,
"eval_loss": 0.6219077706336975,
"eval_runtime": 116.5993,
"eval_samples_per_second": 17.35,
"eval_steps_per_second": 4.34,
"eval_token_acc": 0.7890674924625547,
"step": 1600
},
{
"epoch": 0.25850995504174695,
"grad_norm": 1.8529510991569655,
"learning_rate": 8.77640045067199e-06,
"loss": 0.6722494602203369,
"step": 1610
},
{
"epoch": 0.26011560693641617,
"grad_norm": 1.9357141571987,
"learning_rate": 8.759126848332608e-06,
"loss": 0.6848864078521728,
"step": 1620
},
{
"epoch": 0.26172125883108543,
"grad_norm": 1.6096339964942243,
"learning_rate": 8.7417494276951e-06,
"loss": 0.6899352073669434,
"step": 1630
},
{
"epoch": 0.26332691072575465,
"grad_norm": 1.7064573876372433,
"learning_rate": 8.724268668683207e-06,
"loss": 0.7040124893188476,
"step": 1640
},
{
"epoch": 0.2649325626204239,
"grad_norm": 1.7909548168508456,
"learning_rate": 8.706685054074644e-06,
"loss": 0.6199952125549316,
"step": 1650
},
{
"epoch": 0.26653821451509313,
"grad_norm": 1.8418407360742293,
"learning_rate": 8.688999069487749e-06,
"loss": 0.6850284576416016,
"step": 1660
},
{
"epoch": 0.26814386640976234,
"grad_norm": 1.5253465102049333,
"learning_rate": 8.671211203368083e-06,
"loss": 0.6807417869567871,
"step": 1670
},
{
"epoch": 0.2697495183044316,
"grad_norm": 1.6746489328318919,
"learning_rate": 8.653321946974939e-06,
"loss": 0.6941102981567383,
"step": 1680
},
{
"epoch": 0.2713551701991008,
"grad_norm": 1.4937171287944617,
"learning_rate": 8.635331794367766e-06,
"loss": 0.6537214279174804,
"step": 1690
},
{
"epoch": 0.2729608220937701,
"grad_norm": 1.6787435216248838,
"learning_rate": 8.617241242392535e-06,
"loss": 0.6437517642974854,
"step": 1700
},
{
"epoch": 0.2745664739884393,
"grad_norm": 2.052971205655963,
"learning_rate": 8.599050790668016e-06,
"loss": 0.6665167331695556,
"step": 1710
},
{
"epoch": 0.2761721258831085,
"grad_norm": 1.737556496234147,
"learning_rate": 8.580760941571968e-06,
"loss": 0.7035176277160644,
"step": 1720
},
{
"epoch": 0.2777777777777778,
"grad_norm": 1.7432018470950634,
"learning_rate": 8.56237220022728e-06,
"loss": 0.7075429916381836,
"step": 1730
},
{
"epoch": 0.279383429672447,
"grad_norm": 1.860416768706513,
"learning_rate": 8.543885074488012e-06,
"loss": 0.6828268051147461,
"step": 1740
},
{
"epoch": 0.2809890815671163,
"grad_norm": 1.7610785827294768,
"learning_rate": 8.525300074925371e-06,
"loss": 0.6819411277770996,
"step": 1750
},
{
"epoch": 0.2825947334617855,
"grad_norm": 1.804081843028565,
"learning_rate": 8.50661771481361e-06,
"loss": 0.6932484626770019,
"step": 1760
},
{
"epoch": 0.2842003853564547,
"grad_norm": 1.6441985906441237,
"learning_rate": 8.48783851011585e-06,
"loss": 0.6582047462463378,
"step": 1770
},
{
"epoch": 0.28580603725112397,
"grad_norm": 1.7329173754267528,
"learning_rate": 8.468962979469841e-06,
"loss": 0.7075380325317383,
"step": 1780
},
{
"epoch": 0.2874116891457932,
"grad_norm": 1.4693447118521001,
"learning_rate": 8.449991644173624e-06,
"loss": 0.6702975273132324,
"step": 1790
},
{
"epoch": 0.28901734104046245,
"grad_norm": 1.6100326348735192,
"learning_rate": 8.43092502817114e-06,
"loss": 0.6638934135437011,
"step": 1800
},
{
"epoch": 0.28901734104046245,
"eval_loss": 0.6190060973167419,
"eval_runtime": 115.7311,
"eval_samples_per_second": 17.48,
"eval_steps_per_second": 4.372,
"eval_token_acc": 0.7904098000971067,
"step": 1800
},
{
"epoch": 0.29062299293513166,
"grad_norm": 1.8046113407221105,
"learning_rate": 8.411763658037764e-06,
"loss": 0.6865541458129882,
"step": 1810
},
{
"epoch": 0.2922286448298009,
"grad_norm": 1.66384985336402,
"learning_rate": 8.392508062965758e-06,
"loss": 0.7061246395111084,
"step": 1820
},
{
"epoch": 0.29383429672447015,
"grad_norm": 1.4509377462492312,
"learning_rate": 8.373158774749654e-06,
"loss": 0.6638317584991456,
"step": 1830
},
{
"epoch": 0.29543994861913936,
"grad_norm": 1.5250629360772658,
"learning_rate": 8.353716327771572e-06,
"loss": 0.6382759571075439,
"step": 1840
},
{
"epoch": 0.2970456005138086,
"grad_norm": 1.7177671490174162,
"learning_rate": 8.33418125898646e-06,
"loss": 0.675161075592041,
"step": 1850
},
{
"epoch": 0.29865125240847784,
"grad_norm": 1.7352785342373054,
"learning_rate": 8.314554107907262e-06,
"loss": 0.6799586772918701,
"step": 1860
},
{
"epoch": 0.30025690430314705,
"grad_norm": 1.8297976880260405,
"learning_rate": 8.294835416590019e-06,
"loss": 0.6495511054992675,
"step": 1870
},
{
"epoch": 0.3018625561978163,
"grad_norm": 1.7771603972640657,
"learning_rate": 8.275025729618902e-06,
"loss": 0.6970042705535888,
"step": 1880
},
{
"epoch": 0.30346820809248554,
"grad_norm": 1.692739401160697,
"learning_rate": 8.255125594091169e-06,
"loss": 0.6314344882965088,
"step": 1890
},
{
"epoch": 0.3050738599871548,
"grad_norm": 1.5647739461600825,
"learning_rate": 8.235135559602055e-06,
"loss": 0.6312388896942138,
"step": 1900
},
{
"epoch": 0.306679511881824,
"grad_norm": 1.8745989880906309,
"learning_rate": 8.21505617822959e-06,
"loss": 0.7160224437713623,
"step": 1910
},
{
"epoch": 0.30828516377649323,
"grad_norm": 1.794790643737546,
"learning_rate": 8.194888004519365e-06,
"loss": 0.7057693481445313,
"step": 1920
},
{
"epoch": 0.3098908156711625,
"grad_norm": 1.5750000095656258,
"learning_rate": 8.1746315954692e-06,
"loss": 0.6810090065002441,
"step": 1930
},
{
"epoch": 0.3114964675658317,
"grad_norm": 1.7006910513410733,
"learning_rate": 8.154287510513773e-06,
"loss": 0.6751882553100585,
"step": 1940
},
{
"epoch": 0.313102119460501,
"grad_norm": 1.5282577764518495,
"learning_rate": 8.133856311509165e-06,
"loss": 0.6727633476257324,
"step": 1950
},
{
"epoch": 0.3147077713551702,
"grad_norm": 1.5855730147878353,
"learning_rate": 8.113338562717341e-06,
"loss": 0.6358974933624267,
"step": 1960
},
{
"epoch": 0.3163134232498394,
"grad_norm": 1.624282628411416,
"learning_rate": 8.092734830790575e-06,
"loss": 0.634096622467041,
"step": 1970
},
{
"epoch": 0.3179190751445087,
"grad_norm": 1.8557574949773143,
"learning_rate": 8.072045684755783e-06,
"loss": 0.673964548110962,
"step": 1980
},
{
"epoch": 0.3195247270391779,
"grad_norm": 1.6098240624386007,
"learning_rate": 8.051271695998832e-06,
"loss": 0.6814305782318115,
"step": 1990
},
{
"epoch": 0.32113037893384716,
"grad_norm": 1.8638715234892917,
"learning_rate": 8.03041343824874e-06,
"loss": 0.7079939842224121,
"step": 2000
},
{
"epoch": 0.32113037893384716,
"eval_loss": 0.6177350878715515,
"eval_runtime": 115.694,
"eval_samples_per_second": 17.486,
"eval_steps_per_second": 4.374,
"eval_token_acc": 0.7912348729688108,
"step": 2000
},
{
"epoch": 0.3227360308285164,
"grad_norm": 1.6815059735101043,
"learning_rate": 8.009471487561837e-06,
"loss": 0.6493409156799317,
"step": 2010
},
{
"epoch": 0.3243416827231856,
"grad_norm": 2.1534893724823303,
"learning_rate": 7.988446422305857e-06,
"loss": 0.7218660354614258,
"step": 2020
},
{
"epoch": 0.32594733461785486,
"grad_norm": 1.4898609880434688,
"learning_rate": 7.967338823143967e-06,
"loss": 0.6944834232330322,
"step": 2030
},
{
"epoch": 0.32755298651252407,
"grad_norm": 1.7981374103572556,
"learning_rate": 7.946149273018723e-06,
"loss": 0.6680311679840087,
"step": 2040
},
{
"epoch": 0.32915863840719334,
"grad_norm": 1.7153248644552248,
"learning_rate": 7.92487835713598e-06,
"loss": 0.6817049503326416,
"step": 2050
},
{
"epoch": 0.33076429030186255,
"grad_norm": 1.5225633936289904,
"learning_rate": 7.903526662948721e-06,
"loss": 0.659334945678711,
"step": 2060
},
{
"epoch": 0.33236994219653176,
"grad_norm": 1.870644237710989,
"learning_rate": 7.882094780140838e-06,
"loss": 0.6837968826293945,
"step": 2070
},
{
"epoch": 0.33397559409120103,
"grad_norm": 1.6975397564317007,
"learning_rate": 7.860583300610849e-06,
"loss": 0.6264148235321045,
"step": 2080
},
{
"epoch": 0.33558124598587025,
"grad_norm": 1.5490837406732572,
"learning_rate": 7.838992818455542e-06,
"loss": 0.6516887187957764,
"step": 2090
},
{
"epoch": 0.3371868978805395,
"grad_norm": 1.8074910342864772,
"learning_rate": 7.817323929953575e-06,
"loss": 0.6940847873687744,
"step": 2100
},
{
"epoch": 0.33879254977520873,
"grad_norm": 1.7586469146797696,
"learning_rate": 7.795577233549006e-06,
"loss": 0.6694756031036377,
"step": 2110
},
{
"epoch": 0.340398201669878,
"grad_norm": 1.6458423161196865,
"learning_rate": 7.773753329834767e-06,
"loss": 0.6358282566070557,
"step": 2120
},
{
"epoch": 0.3420038535645472,
"grad_norm": 1.5559151397357136,
"learning_rate": 7.751852821536073e-06,
"loss": 0.7031454086303711,
"step": 2130
},
{
"epoch": 0.3436095054592164,
"grad_norm": 1.8641173427315336,
"learning_rate": 7.729876313493781e-06,
"loss": 0.6741362094879151,
"step": 2140
},
{
"epoch": 0.3452151573538857,
"grad_norm": 1.8782029134936515,
"learning_rate": 7.70782441264768e-06,
"loss": 0.7104865550994873,
"step": 2150
},
{
"epoch": 0.3468208092485549,
"grad_norm": 1.663908552844927,
"learning_rate": 7.68569772801974e-06,
"loss": 0.6510393619537354,
"step": 2160
},
{
"epoch": 0.3484264611432242,
"grad_norm": 1.9798217750009868,
"learning_rate": 7.663496870697267e-06,
"loss": 0.6797806739807128,
"step": 2170
},
{
"epoch": 0.3500321130378934,
"grad_norm": 1.6234497136185502,
"learning_rate": 7.641222453816064e-06,
"loss": 0.6498265266418457,
"step": 2180
},
{
"epoch": 0.3516377649325626,
"grad_norm": 1.7308643473117888,
"learning_rate": 7.618875092543467e-06,
"loss": 0.6692814826965332,
"step": 2190
},
{
"epoch": 0.35324341682723187,
"grad_norm": 1.805844797993927,
"learning_rate": 7.596455404061365e-06,
"loss": 0.6444426536560058,
"step": 2200
},
{
"epoch": 0.35324341682723187,
"eval_loss": 0.6147180199623108,
"eval_runtime": 117.4034,
"eval_samples_per_second": 17.231,
"eval_steps_per_second": 4.31,
"eval_token_acc": 0.7917295829919861,
"step": 2200
},
{
"epoch": 0.3548490687219011,
"grad_norm": 1.818860826365226,
"learning_rate": 7.5739640075491546e-06,
"loss": 0.6568302154541016,
"step": 2210
},
{
"epoch": 0.35645472061657035,
"grad_norm": 1.8515151048630425,
"learning_rate": 7.551401524166646e-06,
"loss": 0.6514512062072754,
"step": 2220
},
{
"epoch": 0.35806037251123957,
"grad_norm": 1.5941745195897792,
"learning_rate": 7.5287685770369e-06,
"loss": 0.6203208446502686,
"step": 2230
},
{
"epoch": 0.3596660244059088,
"grad_norm": 1.9079336044757396,
"learning_rate": 7.506065791229018e-06,
"loss": 0.6402321338653565,
"step": 2240
},
{
"epoch": 0.36127167630057805,
"grad_norm": 1.8381168124624487,
"learning_rate": 7.48329379374089e-06,
"loss": 0.6790849685668945,
"step": 2250
},
{
"epoch": 0.36287732819524726,
"grad_norm": 1.9481710547040232,
"learning_rate": 7.460453213481862e-06,
"loss": 0.6818710803985596,
"step": 2260
},
{
"epoch": 0.36448298008991653,
"grad_norm": 1.6938215893010562,
"learning_rate": 7.437544681255383e-06,
"loss": 0.6768095970153809,
"step": 2270
},
{
"epoch": 0.36608863198458574,
"grad_norm": 1.7075992895641596,
"learning_rate": 7.414568829741572e-06,
"loss": 0.6130049228668213,
"step": 2280
},
{
"epoch": 0.36769428387925496,
"grad_norm": 1.7491228083237265,
"learning_rate": 7.3915262934797525e-06,
"loss": 0.662748908996582,
"step": 2290
},
{
"epoch": 0.3692999357739242,
"grad_norm": 1.6584152969999681,
"learning_rate": 7.368417708850923e-06,
"loss": 0.7056490898132324,
"step": 2300
},
{
"epoch": 0.37090558766859344,
"grad_norm": 1.7027901094047575,
"learning_rate": 7.3452437140601855e-06,
"loss": 0.7262134552001953,
"step": 2310
},
{
"epoch": 0.3725112395632627,
"grad_norm": 1.6192575463774184,
"learning_rate": 7.322004949119114e-06,
"loss": 0.6772657871246338,
"step": 2320
},
{
"epoch": 0.3741168914579319,
"grad_norm": 1.5966299076510366,
"learning_rate": 7.298702055828086e-06,
"loss": 0.6767099857330322,
"step": 2330
},
{
"epoch": 0.37572254335260113,
"grad_norm": 1.6940198781585711,
"learning_rate": 7.275335677758553e-06,
"loss": 0.6707070350646973,
"step": 2340
},
{
"epoch": 0.3773281952472704,
"grad_norm": 1.3801221057150768,
"learning_rate": 7.251906460235268e-06,
"loss": 0.6307042121887207,
"step": 2350
},
{
"epoch": 0.3789338471419396,
"grad_norm": 1.5598911491306946,
"learning_rate": 7.228415050318463e-06,
"loss": 0.7124890804290771,
"step": 2360
},
{
"epoch": 0.3805394990366089,
"grad_norm": 1.8708516506090664,
"learning_rate": 7.204862096785978e-06,
"loss": 0.6433597087860108,
"step": 2370
},
{
"epoch": 0.3821451509312781,
"grad_norm": 1.706542614787211,
"learning_rate": 7.181248250115346e-06,
"loss": 0.6750481128692627,
"step": 2380
},
{
"epoch": 0.3837508028259473,
"grad_norm": 1.719256978853715,
"learning_rate": 7.1575741624658215e-06,
"loss": 0.6577974319458008,
"step": 2390
},
{
"epoch": 0.3853564547206166,
"grad_norm": 1.7008700295216381,
"learning_rate": 7.1338404876603784e-06,
"loss": 0.6774620532989502,
"step": 2400
},
{
"epoch": 0.3853564547206166,
"eval_loss": 0.6114417314529419,
"eval_runtime": 117.9272,
"eval_samples_per_second": 17.155,
"eval_steps_per_second": 4.291,
"eval_token_acc": 0.7923302427165837,
"step": 2400
},
{
"epoch": 0.3869621066152858,
"grad_norm": 1.570715977392802,
"learning_rate": 7.110047881167647e-06,
"loss": 0.6567262649536133,
"step": 2410
},
{
"epoch": 0.38856775850995506,
"grad_norm": 1.7488962726005084,
"learning_rate": 7.086197000083812e-06,
"loss": 0.6914029598236084,
"step": 2420
},
{
"epoch": 0.3901734104046243,
"grad_norm": 1.7579994392685563,
"learning_rate": 7.0622885031144685e-06,
"loss": 0.674524450302124,
"step": 2430
},
{
"epoch": 0.3917790622992935,
"grad_norm": 1.9538185949651201,
"learning_rate": 7.038323050556426e-06,
"loss": 0.7166782855987549,
"step": 2440
},
{
"epoch": 0.39338471419396276,
"grad_norm": 1.616334748220648,
"learning_rate": 7.014301304279476e-06,
"loss": 0.6658863067626953,
"step": 2450
},
{
"epoch": 0.394990366088632,
"grad_norm": 2.1028001883855563,
"learning_rate": 6.990223927708107e-06,
"loss": 0.6730957984924316,
"step": 2460
},
{
"epoch": 0.39659601798330124,
"grad_norm": 1.9382549699960543,
"learning_rate": 6.966091585803191e-06,
"loss": 0.6466156482696533,
"step": 2470
},
{
"epoch": 0.39820166987797045,
"grad_norm": 1.874004069716299,
"learning_rate": 6.94190494504361e-06,
"loss": 0.6450675010681153,
"step": 2480
},
{
"epoch": 0.39980732177263967,
"grad_norm": 1.825141725895593,
"learning_rate": 6.917664673407858e-06,
"loss": 0.6538877487182617,
"step": 2490
},
{
"epoch": 0.40141297366730894,
"grad_norm": 1.6769353130289677,
"learning_rate": 6.893371440355585e-06,
"loss": 0.6547831535339356,
"step": 2500
},
{
"epoch": 0.40301862556197815,
"grad_norm": 1.718505237274443,
"learning_rate": 6.8690259168091115e-06,
"loss": 0.7072465896606446,
"step": 2510
},
{
"epoch": 0.4046242774566474,
"grad_norm": 1.6116686542587728,
"learning_rate": 6.8446287751349e-06,
"loss": 0.6458945274353027,
"step": 2520
},
{
"epoch": 0.40622992935131663,
"grad_norm": 1.6485734517298922,
"learning_rate": 6.820180689124984e-06,
"loss": 0.634568452835083,
"step": 2530
},
{
"epoch": 0.40783558124598585,
"grad_norm": 1.693905081233172,
"learning_rate": 6.795682333978365e-06,
"loss": 0.6384255409240722,
"step": 2540
},
{
"epoch": 0.4094412331406551,
"grad_norm": 1.8429999773263868,
"learning_rate": 6.771134386282355e-06,
"loss": 0.6711873054504395,
"step": 2550
},
{
"epoch": 0.4110468850353243,
"grad_norm": 1.5334617046393333,
"learning_rate": 6.7465375239939e-06,
"loss": 0.6835154533386231,
"step": 2560
},
{
"epoch": 0.4126525369299936,
"grad_norm": 1.8079819637608645,
"learning_rate": 6.721892426420851e-06,
"loss": 0.6307646751403808,
"step": 2570
},
{
"epoch": 0.4142581888246628,
"grad_norm": 1.6979554296520882,
"learning_rate": 6.697199774203203e-06,
"loss": 0.6037578582763672,
"step": 2580
},
{
"epoch": 0.415863840719332,
"grad_norm": 1.8244704576295199,
"learning_rate": 6.6724602492943035e-06,
"loss": 0.6572129726409912,
"step": 2590
},
{
"epoch": 0.4174694926140013,
"grad_norm": 1.6572633090594417,
"learning_rate": 6.64767453494201e-06,
"loss": 0.6604421615600586,
"step": 2600
},
{
"epoch": 0.4174694926140013,
"eval_loss": 0.6077189445495605,
"eval_runtime": 116.5488,
"eval_samples_per_second": 17.358,
"eval_steps_per_second": 4.342,
"eval_token_acc": 0.7931561498379053,
"step": 2600
},
{
"epoch": 0.4190751445086705,
"grad_norm": 1.9987895534078324,
"learning_rate": 6.6228433156698295e-06,
"loss": 0.6792376518249512,
"step": 2610
},
{
"epoch": 0.4206807964033398,
"grad_norm": 1.7158981483927298,
"learning_rate": 6.597967277258003e-06,
"loss": 0.6651222229003906,
"step": 2620
},
{
"epoch": 0.422286448298009,
"grad_norm": 1.7697895779850215,
"learning_rate": 6.573047106724574e-06,
"loss": 0.6623071670532227,
"step": 2630
},
{
"epoch": 0.4238921001926782,
"grad_norm": 2.126926145770739,
"learning_rate": 6.548083492306413e-06,
"loss": 0.6466917037963867,
"step": 2640
},
{
"epoch": 0.42549775208734747,
"grad_norm": 1.4780847013631149,
"learning_rate": 6.523077123440207e-06,
"loss": 0.6583863258361816,
"step": 2650
},
{
"epoch": 0.4271034039820167,
"grad_norm": 1.791311406001526,
"learning_rate": 6.498028690743422e-06,
"loss": 0.6781702041625977,
"step": 2660
},
{
"epoch": 0.42870905587668595,
"grad_norm": 1.8418453284917216,
"learning_rate": 6.472938885995229e-06,
"loss": 0.615170955657959,
"step": 2670
},
{
"epoch": 0.43031470777135516,
"grad_norm": 1.6061882049729523,
"learning_rate": 6.447808402117399e-06,
"loss": 0.6200252056121827,
"step": 2680
},
{
"epoch": 0.4319203596660244,
"grad_norm": 1.610665082618569,
"learning_rate": 6.4226379331551625e-06,
"loss": 0.6884698390960693,
"step": 2690
},
{
"epoch": 0.43352601156069365,
"grad_norm": 1.7081082215160799,
"learning_rate": 6.397428174258048e-06,
"loss": 0.6035865783691406,
"step": 2700
},
{
"epoch": 0.43513166345536286,
"grad_norm": 1.8692250975455653,
"learning_rate": 6.372179821660678e-06,
"loss": 0.6964015960693359,
"step": 2710
},
{
"epoch": 0.43673731535003213,
"grad_norm": 1.8172056429331103,
"learning_rate": 6.346893572663544e-06,
"loss": 0.6734973430633545,
"step": 2720
},
{
"epoch": 0.43834296724470134,
"grad_norm": 1.7475659871290619,
"learning_rate": 6.321570125613744e-06,
"loss": 0.6315503597259522,
"step": 2730
},
{
"epoch": 0.4399486191393706,
"grad_norm": 1.9819397747884144,
"learning_rate": 6.296210179885708e-06,
"loss": 0.7144417762756348,
"step": 2740
},
{
"epoch": 0.4415542710340398,
"grad_norm": 1.38229654099846,
"learning_rate": 6.270814435861864e-06,
"loss": 0.6535766124725342,
"step": 2750
},
{
"epoch": 0.44315992292870904,
"grad_norm": 1.5166113099535783,
"learning_rate": 6.245383594913312e-06,
"loss": 0.6655025482177734,
"step": 2760
},
{
"epoch": 0.4447655748233783,
"grad_norm": 1.775768796293097,
"learning_rate": 6.219918359380444e-06,
"loss": 0.6785330772399902,
"step": 2770
},
{
"epoch": 0.4463712267180475,
"grad_norm": 1.5738294130781245,
"learning_rate": 6.19441943255355e-06,
"loss": 0.6220744132995606,
"step": 2780
},
{
"epoch": 0.4479768786127168,
"grad_norm": 1.7091333372670319,
"learning_rate": 6.1688875186533955e-06,
"loss": 0.6746760368347168,
"step": 2790
},
{
"epoch": 0.449582530507386,
"grad_norm": 1.7540765777044425,
"learning_rate": 6.143323322811776e-06,
"loss": 0.6595097541809082,
"step": 2800
},
{
"epoch": 0.449582530507386,
"eval_loss": 0.6046592593193054,
"eval_runtime": 117.4341,
"eval_samples_per_second": 17.227,
"eval_steps_per_second": 4.309,
"eval_token_acc": 0.7942915635673181,
"step": 2800
},
{
"epoch": 0.4511881824020552,
"grad_norm": 1.716083495202826,
"learning_rate": 6.11772755105203e-06,
"loss": 0.6908525466918946,
"step": 2810
},
{
"epoch": 0.4527938342967245,
"grad_norm": 1.928873820576655,
"learning_rate": 6.092100910269556e-06,
"loss": 0.6462475776672363,
"step": 2820
},
{
"epoch": 0.4543994861913937,
"grad_norm": 1.7539886891121115,
"learning_rate": 6.06644410821228e-06,
"loss": 0.6449719905853272,
"step": 2830
},
{
"epoch": 0.45600513808606297,
"grad_norm": 1.75928350945977,
"learning_rate": 6.040757853461113e-06,
"loss": 0.6407927989959716,
"step": 2840
},
{
"epoch": 0.4576107899807322,
"grad_norm": 1.8255993162951358,
"learning_rate": 6.015042855410379e-06,
"loss": 0.6738231182098389,
"step": 2850
},
{
"epoch": 0.4592164418754014,
"grad_norm": 1.4721143485918229,
"learning_rate": 5.989299824248227e-06,
"loss": 0.6249940872192383,
"step": 2860
},
{
"epoch": 0.46082209377007066,
"grad_norm": 1.7825384178192991,
"learning_rate": 5.963529470937015e-06,
"loss": 0.6549758434295654,
"step": 2870
},
{
"epoch": 0.4624277456647399,
"grad_norm": 1.5080117937257649,
"learning_rate": 5.937732507193671e-06,
"loss": 0.6731220245361328,
"step": 2880
},
{
"epoch": 0.46403339755940914,
"grad_norm": 1.4123229770662427,
"learning_rate": 5.911909645470045e-06,
"loss": 0.6912211418151856,
"step": 2890
},
{
"epoch": 0.46563904945407836,
"grad_norm": 1.553691648545866,
"learning_rate": 5.886061598933228e-06,
"loss": 0.697138500213623,
"step": 2900
},
{
"epoch": 0.46724470134874757,
"grad_norm": 1.8969673644940426,
"learning_rate": 5.860189081445854e-06,
"loss": 0.6818105697631835,
"step": 2910
},
{
"epoch": 0.46885035324341684,
"grad_norm": 1.5267813484245596,
"learning_rate": 5.834292807546392e-06,
"loss": 0.6768715858459473,
"step": 2920
},
{
"epoch": 0.47045600513808605,
"grad_norm": 1.7034363371695085,
"learning_rate": 5.808373492429405e-06,
"loss": 0.6772209167480469,
"step": 2930
},
{
"epoch": 0.4720616570327553,
"grad_norm": 1.9475266449191355,
"learning_rate": 5.782431851925801e-06,
"loss": 0.6492327690124512,
"step": 2940
},
{
"epoch": 0.47366730892742454,
"grad_norm": 1.80685354115223,
"learning_rate": 5.75646860248306e-06,
"loss": 0.6602900505065918,
"step": 2950
},
{
"epoch": 0.47527296082209375,
"grad_norm": 1.5940654124212363,
"learning_rate": 5.730484461145455e-06,
"loss": 0.6496998786926269,
"step": 2960
},
{
"epoch": 0.476878612716763,
"grad_norm": 1.7231523708453245,
"learning_rate": 5.704480145534243e-06,
"loss": 0.634641456604004,
"step": 2970
},
{
"epoch": 0.47848426461143223,
"grad_norm": 1.6146352266889579,
"learning_rate": 5.678456373827843e-06,
"loss": 0.6208431720733643,
"step": 2980
},
{
"epoch": 0.4800899165061015,
"grad_norm": 1.6144539162269365,
"learning_rate": 5.652413864742016e-06,
"loss": 0.6912257194519043,
"step": 2990
},
{
"epoch": 0.4816955684007707,
"grad_norm": 1.7420176395616938,
"learning_rate": 5.626353337509994e-06,
"loss": 0.6629442691802978,
"step": 3000
},
{
"epoch": 0.4816955684007707,
"eval_loss": 0.6017531156539917,
"eval_runtime": 115.8046,
"eval_samples_per_second": 17.469,
"eval_steps_per_second": 4.369,
"eval_token_acc": 0.7953243645937789,
"step": 3000
},
{
"epoch": 0.4833012202954399,
"grad_norm": 1.5529601886653754,
"learning_rate": 5.600275511862636e-06,
"loss": 0.6236114501953125,
"step": 3010
},
{
"epoch": 0.4849068721901092,
"grad_norm": 1.7395798527530288,
"learning_rate": 5.574181108008539e-06,
"loss": 0.6623884201049804,
"step": 3020
},
{
"epoch": 0.4865125240847784,
"grad_norm": 1.5588683689028933,
"learning_rate": 5.548070846614153e-06,
"loss": 0.6456201076507568,
"step": 3030
},
{
"epoch": 0.4881181759794477,
"grad_norm": 1.6619854159322849,
"learning_rate": 5.521945448783874e-06,
"loss": 0.649496603012085,
"step": 3040
},
{
"epoch": 0.4897238278741169,
"grad_norm": 1.5892807391385169,
"learning_rate": 5.495805636040135e-06,
"loss": 0.6367308616638183,
"step": 3050
},
{
"epoch": 0.4913294797687861,
"grad_norm": 1.3345792855489715,
"learning_rate": 5.469652130303471e-06,
"loss": 0.6645633697509765,
"step": 3060
},
{
"epoch": 0.4929351316634554,
"grad_norm": 1.6214025907079206,
"learning_rate": 5.443485653872589e-06,
"loss": 0.6398410797119141,
"step": 3070
},
{
"epoch": 0.4945407835581246,
"grad_norm": 1.8451717722456522,
"learning_rate": 5.417306929404413e-06,
"loss": 0.7045126914978027,
"step": 3080
},
{
"epoch": 0.49614643545279385,
"grad_norm": 1.7162335450102724,
"learning_rate": 5.391116679894131e-06,
"loss": 0.6747453689575196,
"step": 3090
},
{
"epoch": 0.49775208734746307,
"grad_norm": 1.721924213910723,
"learning_rate": 5.364915628655227e-06,
"loss": 0.6267594337463379,
"step": 3100
},
{
"epoch": 0.4993577392421323,
"grad_norm": 1.8376897417896412,
"learning_rate": 5.3387044992995e-06,
"loss": 0.6397854804992675,
"step": 3110
},
{
"epoch": 0.5009633911368016,
"grad_norm": 1.869292144863384,
"learning_rate": 5.312484015717087e-06,
"loss": 0.6486954689025879,
"step": 3120
},
{
"epoch": 0.5025690430314708,
"grad_norm": 1.8544608956904656,
"learning_rate": 5.286254902056462e-06,
"loss": 0.689535665512085,
"step": 3130
},
{
"epoch": 0.50417469492614,
"grad_norm": 1.524780140770319,
"learning_rate": 5.2600178827044476e-06,
"loss": 0.5976661682128906,
"step": 3140
},
{
"epoch": 0.5057803468208093,
"grad_norm": 1.8393482466508677,
"learning_rate": 5.233773682266198e-06,
"loss": 0.652738380432129,
"step": 3150
},
{
"epoch": 0.5073859987154785,
"grad_norm": 1.680461273244531,
"learning_rate": 5.2075230255451924e-06,
"loss": 0.6367105484008789,
"step": 3160
},
{
"epoch": 0.5089916506101477,
"grad_norm": 1.4007542325300602,
"learning_rate": 5.181266637523225e-06,
"loss": 0.6549857139587403,
"step": 3170
},
{
"epoch": 0.5105973025048169,
"grad_norm": 1.7448220295886547,
"learning_rate": 5.155005243340364e-06,
"loss": 0.6184686183929443,
"step": 3180
},
{
"epoch": 0.5122029543994862,
"grad_norm": 1.66049201084311,
"learning_rate": 5.1287395682749444e-06,
"loss": 0.6485123634338379,
"step": 3190
},
{
"epoch": 0.5138086062941555,
"grad_norm": 1.521120678369957,
"learning_rate": 5.102470337723524e-06,
"loss": 0.6847625732421875,
"step": 3200
},
{
"epoch": 0.5138086062941555,
"eval_loss": 0.6003468036651611,
"eval_runtime": 117.3388,
"eval_samples_per_second": 17.241,
"eval_steps_per_second": 4.312,
"eval_token_acc": 0.7958849803367365,
"step": 3200
},
{
"epoch": 0.5154142581888247,
"grad_norm": 1.7475620617915268,
"learning_rate": 5.0761982771808595e-06,
"loss": 0.627868938446045,
"step": 3210
},
{
"epoch": 0.5170199100834939,
"grad_norm": 1.6492543156794781,
"learning_rate": 5.049924112219859e-06,
"loss": 0.6768051147460937,
"step": 3220
},
{
"epoch": 0.5186255619781631,
"grad_norm": 1.4702868123981876,
"learning_rate": 5.023648568471559e-06,
"loss": 0.6329309463500976,
"step": 3230
},
{
"epoch": 0.5202312138728323,
"grad_norm": 1.4631063429180151,
"learning_rate": 4.997372371605066e-06,
"loss": 0.6819337844848633,
"step": 3240
},
{
"epoch": 0.5218368657675017,
"grad_norm": 1.7194677170725678,
"learning_rate": 4.971096247307528e-06,
"loss": 0.6357659339904785,
"step": 3250
},
{
"epoch": 0.5234425176621709,
"grad_norm": 1.5391644286812827,
"learning_rate": 4.944820921264089e-06,
"loss": 0.6160742282867432,
"step": 3260
},
{
"epoch": 0.5250481695568401,
"grad_norm": 2.0292281910388414,
"learning_rate": 4.918547119137846e-06,
"loss": 0.6846878051757812,
"step": 3270
},
{
"epoch": 0.5266538214515093,
"grad_norm": 1.610879668884779,
"learning_rate": 4.89227556654981e-06,
"loss": 0.6450191020965577,
"step": 3280
},
{
"epoch": 0.5282594733461785,
"grad_norm": 1.339824263555254,
"learning_rate": 4.866006989058862e-06,
"loss": 0.6322847843170166,
"step": 3290
},
{
"epoch": 0.5298651252408478,
"grad_norm": 1.6543124351661145,
"learning_rate": 4.839742112141725e-06,
"loss": 0.6306018829345703,
"step": 3300
},
{
"epoch": 0.531470777135517,
"grad_norm": 1.660724826354808,
"learning_rate": 4.813481661172912e-06,
"loss": 0.610607099533081,
"step": 3310
},
{
"epoch": 0.5330764290301863,
"grad_norm": 1.6235734157752637,
"learning_rate": 4.787226361404706e-06,
"loss": 0.6995952606201172,
"step": 3320
},
{
"epoch": 0.5346820809248555,
"grad_norm": 1.868542231230083,
"learning_rate": 4.760976937947128e-06,
"loss": 0.6855478286743164,
"step": 3330
},
{
"epoch": 0.5362877328195247,
"grad_norm": 1.8331443076088598,
"learning_rate": 4.7347341157479055e-06,
"loss": 0.6339561462402343,
"step": 3340
},
{
"epoch": 0.537893384714194,
"grad_norm": 2.047103683230832,
"learning_rate": 4.708498619572455e-06,
"loss": 0.6341542720794677,
"step": 3350
},
{
"epoch": 0.5394990366088632,
"grad_norm": 1.6856551740545285,
"learning_rate": 4.682271173983865e-06,
"loss": 0.627877140045166,
"step": 3360
},
{
"epoch": 0.5411046885035324,
"grad_norm": 1.7444781147322475,
"learning_rate": 4.6560525033228885e-06,
"loss": 0.6696052551269531,
"step": 3370
},
{
"epoch": 0.5427103403982017,
"grad_norm": 1.818336504765959,
"learning_rate": 4.629843331687935e-06,
"loss": 0.6628055095672607,
"step": 3380
},
{
"epoch": 0.5443159922928709,
"grad_norm": 1.7541018451283887,
"learning_rate": 4.603644382915069e-06,
"loss": 0.6368642807006836,
"step": 3390
},
{
"epoch": 0.5459216441875402,
"grad_norm": 1.5154218896792584,
"learning_rate": 4.577456380558028e-06,
"loss": 0.6845203399658203,
"step": 3400
},
{
"epoch": 0.5459216441875402,
"eval_loss": 0.5972935557365417,
"eval_runtime": 115.9781,
"eval_samples_per_second": 17.443,
"eval_steps_per_second": 4.363,
"eval_token_acc": 0.7971763987446212,
"step": 3400
},
{
"epoch": 0.5475272960822094,
"grad_norm": 1.4551618658916237,
"learning_rate": 4.551280047868233e-06,
"loss": 0.639791202545166,
"step": 3410
},
{
"epoch": 0.5491329479768786,
"grad_norm": 1.892484597161116,
"learning_rate": 4.525116107774815e-06,
"loss": 0.6300538063049317,
"step": 3420
},
{
"epoch": 0.5507385998715478,
"grad_norm": 1.7651880235207764,
"learning_rate": 4.498965282864654e-06,
"loss": 0.7026824474334716,
"step": 3430
},
{
"epoch": 0.552344251766217,
"grad_norm": 1.6140223643155915,
"learning_rate": 4.472828295362417e-06,
"loss": 0.6442500114440918,
"step": 3440
},
{
"epoch": 0.5539499036608864,
"grad_norm": 1.7964942234618715,
"learning_rate": 4.446705867110613e-06,
"loss": 0.6450382232666015,
"step": 3450
},
{
"epoch": 0.5555555555555556,
"grad_norm": 1.5966192338898915,
"learning_rate": 4.420598719549661e-06,
"loss": 0.6269045829772949,
"step": 3460
},
{
"epoch": 0.5571612074502248,
"grad_norm": 1.6393500389444646,
"learning_rate": 4.39450757369796e-06,
"loss": 0.6151111602783204,
"step": 3470
},
{
"epoch": 0.558766859344894,
"grad_norm": 1.6460466953020223,
"learning_rate": 4.368433150131983e-06,
"loss": 0.6323574542999267,
"step": 3480
},
{
"epoch": 0.5603725112395632,
"grad_norm": 1.6778931367902616,
"learning_rate": 4.342376168966368e-06,
"loss": 0.6251521110534668,
"step": 3490
},
{
"epoch": 0.5619781631342325,
"grad_norm": 1.5349958675516662,
"learning_rate": 4.316337349834041e-06,
"loss": 0.622771167755127,
"step": 3500
},
{
"epoch": 0.5635838150289018,
"grad_norm": 1.7416286846749827,
"learning_rate": 4.290317411866329e-06,
"loss": 0.6873036384582519,
"step": 3510
},
{
"epoch": 0.565189466923571,
"grad_norm": 1.5581465818937876,
"learning_rate": 4.264317073673108e-06,
"loss": 0.5988898754119873,
"step": 3520
},
{
"epoch": 0.5667951188182402,
"grad_norm": 1.6185414612296933,
"learning_rate": 4.238337053322954e-06,
"loss": 0.624824333190918,
"step": 3530
},
{
"epoch": 0.5684007707129094,
"grad_norm": 1.9065074174136774,
"learning_rate": 4.212378068323312e-06,
"loss": 0.673931360244751,
"step": 3540
},
{
"epoch": 0.5700064226075787,
"grad_norm": 1.656265815281467,
"learning_rate": 4.186440835600677e-06,
"loss": 0.6439894676208496,
"step": 3550
},
{
"epoch": 0.5716120745022479,
"grad_norm": 1.8776786172892783,
"learning_rate": 4.1605260714808e-06,
"loss": 0.6581153869628906,
"step": 3560
},
{
"epoch": 0.5732177263969171,
"grad_norm": 1.703747054653242,
"learning_rate": 4.134634491668903e-06,
"loss": 0.61540846824646,
"step": 3570
},
{
"epoch": 0.5748233782915864,
"grad_norm": 1.5507582889339149,
"learning_rate": 4.108766811229906e-06,
"loss": 0.640535831451416,
"step": 3580
},
{
"epoch": 0.5764290301862556,
"grad_norm": 1.618375014888649,
"learning_rate": 4.0829237445686895e-06,
"loss": 0.6489696502685547,
"step": 3590
},
{
"epoch": 0.5780346820809249,
"grad_norm": 1.752024337684377,
"learning_rate": 4.057106005410356e-06,
"loss": 0.6690279960632324,
"step": 3600
},
{
"epoch": 0.5780346820809249,
"eval_loss": 0.5927916765213013,
"eval_runtime": 115.8054,
"eval_samples_per_second": 17.469,
"eval_steps_per_second": 4.369,
"eval_token_acc": 0.7976844567616765,
"step": 3600
},
{
"epoch": 0.5796403339755941,
"grad_norm": 1.5341837355565895,
"learning_rate": 4.0313143067805255e-06,
"loss": 0.6698870658874512,
"step": 3610
},
{
"epoch": 0.5812459858702633,
"grad_norm": 1.6467496057484918,
"learning_rate": 4.005549360985633e-06,
"loss": 0.5921213150024414,
"step": 3620
},
{
"epoch": 0.5828516377649325,
"grad_norm": 1.6053152728267086,
"learning_rate": 3.979811879593269e-06,
"loss": 0.6558093070983887,
"step": 3630
},
{
"epoch": 0.5844572896596018,
"grad_norm": 1.9032471949878327,
"learning_rate": 3.954102573412517e-06,
"loss": 0.6461283683776855,
"step": 3640
},
{
"epoch": 0.5860629415542711,
"grad_norm": 1.689193286628274,
"learning_rate": 3.9284221524743285e-06,
"loss": 0.6304150581359863,
"step": 3650
},
{
"epoch": 0.5876685934489403,
"grad_norm": 1.6774991480461452,
"learning_rate": 3.902771326011914e-06,
"loss": 0.6262317657470703,
"step": 3660
},
{
"epoch": 0.5892742453436095,
"grad_norm": 1.8474226985791815,
"learning_rate": 3.877150802441151e-06,
"loss": 0.6774571418762207,
"step": 3670
},
{
"epoch": 0.5908798972382787,
"grad_norm": 1.6063158015617602,
"learning_rate": 3.851561289341023e-06,
"loss": 0.6113105297088623,
"step": 3680
},
{
"epoch": 0.5924855491329479,
"grad_norm": 1.6990382513407551,
"learning_rate": 3.8260034934340774e-06,
"loss": 0.632629108428955,
"step": 3690
},
{
"epoch": 0.5940912010276173,
"grad_norm": 1.7284057501817178,
"learning_rate": 3.800478120566906e-06,
"loss": 0.6128873348236084,
"step": 3700
},
{
"epoch": 0.5956968529222865,
"grad_norm": 1.7913233473229204,
"learning_rate": 3.7749858756906516e-06,
"loss": 0.6623647689819336,
"step": 3710
},
{
"epoch": 0.5973025048169557,
"grad_norm": 1.8150662300786826,
"learning_rate": 3.749527462841539e-06,
"loss": 0.6639890670776367,
"step": 3720
},
{
"epoch": 0.5989081567116249,
"grad_norm": 1.5307570049241765,
"learning_rate": 3.724103585121436e-06,
"loss": 0.6226850032806397,
"step": 3730
},
{
"epoch": 0.6005138086062941,
"grad_norm": 1.6481951251937415,
"learning_rate": 3.698714944678424e-06,
"loss": 0.6433711528778077,
"step": 3740
},
{
"epoch": 0.6021194605009634,
"grad_norm": 1.8311326245894355,
"learning_rate": 3.6733622426874184e-06,
"loss": 0.6615542411804199,
"step": 3750
},
{
"epoch": 0.6037251123956326,
"grad_norm": 1.695513446479562,
"learning_rate": 3.648046179330796e-06,
"loss": 0.6288583755493165,
"step": 3760
},
{
"epoch": 0.6053307642903019,
"grad_norm": 1.8554703021185914,
"learning_rate": 3.62276745377906e-06,
"loss": 0.668128490447998,
"step": 3770
},
{
"epoch": 0.6069364161849711,
"grad_norm": 1.8414598334221723,
"learning_rate": 3.597526764171532e-06,
"loss": 0.6891838073730469,
"step": 3780
},
{
"epoch": 0.6085420680796403,
"grad_norm": 1.544742622918396,
"learning_rate": 3.5723248075970684e-06,
"loss": 0.6486976146697998,
"step": 3790
},
{
"epoch": 0.6101477199743096,
"grad_norm": 1.5027378360941297,
"learning_rate": 3.547162280074813e-06,
"loss": 0.6122174263000488,
"step": 3800
},
{
"epoch": 0.6101477199743096,
"eval_loss": 0.5898537635803223,
"eval_runtime": 115.7711,
"eval_samples_per_second": 17.474,
"eval_steps_per_second": 4.371,
"eval_token_acc": 0.7986213190821252,
"step": 3800
},
{
"epoch": 0.6117533718689788,
"grad_norm": 1.56493074871109,
"learning_rate": 3.5220398765349662e-06,
"loss": 0.592191743850708,
"step": 3810
},
{
"epoch": 0.613359023763648,
"grad_norm": 1.5559314443165084,
"learning_rate": 3.4969582907996015e-06,
"loss": 0.7172041893005371,
"step": 3820
},
{
"epoch": 0.6149646756583173,
"grad_norm": 1.881786450582419,
"learning_rate": 3.471918215563499e-06,
"loss": 0.6604925155639648,
"step": 3830
},
{
"epoch": 0.6165703275529865,
"grad_norm": 1.6686394422851605,
"learning_rate": 3.4469203423750152e-06,
"loss": 0.6463912487030029,
"step": 3840
},
{
"epoch": 0.6181759794476558,
"grad_norm": 1.7643375635456229,
"learning_rate": 3.421965361616985e-06,
"loss": 0.6369779109954834,
"step": 3850
},
{
"epoch": 0.619781631342325,
"grad_norm": 1.723114857381474,
"learning_rate": 3.3970539624876565e-06,
"loss": 0.7152776718139648,
"step": 3860
},
{
"epoch": 0.6213872832369942,
"grad_norm": 1.6636836288686383,
"learning_rate": 3.372186832981652e-06,
"loss": 0.6432122230529785,
"step": 3870
},
{
"epoch": 0.6229929351316634,
"grad_norm": 1.8013891223015748,
"learning_rate": 3.3473646598709724e-06,
"loss": 0.6690933227539062,
"step": 3880
},
{
"epoch": 0.6245985870263326,
"grad_norm": 1.832975956776872,
"learning_rate": 3.322588128686027e-06,
"loss": 0.573091459274292,
"step": 3890
},
{
"epoch": 0.626204238921002,
"grad_norm": 1.8006171372641149,
"learning_rate": 3.297857923696702e-06,
"loss": 0.641511344909668,
"step": 3900
},
{
"epoch": 0.6278098908156712,
"grad_norm": 1.6491853355530541,
"learning_rate": 3.273174727893463e-06,
"loss": 0.6224217414855957,
"step": 3910
},
{
"epoch": 0.6294155427103404,
"grad_norm": 1.7497490967216878,
"learning_rate": 3.248539222968489e-06,
"loss": 0.6409141540527343,
"step": 3920
},
{
"epoch": 0.6310211946050096,
"grad_norm": 1.7397516831302413,
"learning_rate": 3.223952089296854e-06,
"loss": 0.6265341758728027,
"step": 3930
},
{
"epoch": 0.6326268464996788,
"grad_norm": 1.5441779493196535,
"learning_rate": 3.199414005917726e-06,
"loss": 0.6394174098968506,
"step": 3940
},
{
"epoch": 0.6342324983943481,
"grad_norm": 1.649609687364375,
"learning_rate": 3.1749256505156203e-06,
"loss": 0.6349728107452393,
"step": 3950
},
{
"epoch": 0.6358381502890174,
"grad_norm": 1.782563240036328,
"learning_rate": 3.150487699401681e-06,
"loss": 0.6500693798065186,
"step": 3960
},
{
"epoch": 0.6374438021836866,
"grad_norm": 1.8528260207135643,
"learning_rate": 3.1261008274950045e-06,
"loss": 0.630257511138916,
"step": 3970
},
{
"epoch": 0.6390494540783558,
"grad_norm": 1.936677866102448,
"learning_rate": 3.1017657083039974e-06,
"loss": 0.6424071788787842,
"step": 3980
},
{
"epoch": 0.640655105973025,
"grad_norm": 1.568379134898161,
"learning_rate": 3.0774830139077816e-06,
"loss": 0.6053402423858643,
"step": 3990
},
{
"epoch": 0.6422607578676943,
"grad_norm": 1.514777836052795,
"learning_rate": 3.0532534149376225e-06,
"loss": 0.5991374492645264,
"step": 4000
},
{
"epoch": 0.6422607578676943,
"eval_loss": 0.5840339064598083,
"eval_runtime": 116.031,
"eval_samples_per_second": 17.435,
"eval_steps_per_second": 4.361,
"eval_token_acc": 0.7992353268006026,
"step": 4000
},
{
"epoch": 0.6438664097623635,
"grad_norm": 1.7950486729629296,
"learning_rate": 3.0290775805584182e-06,
"loss": 0.6125258445739746,
"step": 4010
},
{
"epoch": 0.6454720616570327,
"grad_norm": 1.6708646123073856,
"learning_rate": 3.0049561784502125e-06,
"loss": 0.6363659858703613,
"step": 4020
},
{
"epoch": 0.647077713551702,
"grad_norm": 1.692649611123861,
"learning_rate": 2.980889874789758e-06,
"loss": 0.6517571926116943,
"step": 4030
},
{
"epoch": 0.6486833654463712,
"grad_norm": 1.3401264023308128,
"learning_rate": 2.956879334232117e-06,
"loss": 0.6088146686553955,
"step": 4040
},
{
"epoch": 0.6502890173410405,
"grad_norm": 1.5769633797907998,
"learning_rate": 2.9329252198923026e-06,
"loss": 0.6375810623168945,
"step": 4050
},
{
"epoch": 0.6518946692357097,
"grad_norm": 1.7284597516150746,
"learning_rate": 2.909028193326974e-06,
"loss": 0.6683880805969238,
"step": 4060
},
{
"epoch": 0.6535003211303789,
"grad_norm": 1.856703537001769,
"learning_rate": 2.8851889145161515e-06,
"loss": 0.6554866313934327,
"step": 4070
},
{
"epoch": 0.6551059730250481,
"grad_norm": 1.953161442150085,
"learning_rate": 2.861408041845002e-06,
"loss": 0.6188833236694335,
"step": 4080
},
{
"epoch": 0.6567116249197174,
"grad_norm": 1.7195675953857033,
"learning_rate": 2.8376862320856524e-06,
"loss": 0.6229765892028809,
"step": 4090
},
{
"epoch": 0.6583172768143867,
"grad_norm": 1.8260724058291402,
"learning_rate": 2.814024140379048e-06,
"loss": 0.6316720008850097,
"step": 4100
},
{
"epoch": 0.6599229287090559,
"grad_norm": 1.9499916194335019,
"learning_rate": 2.7904224202168608e-06,
"loss": 0.5982970237731934,
"step": 4110
},
{
"epoch": 0.6615285806037251,
"grad_norm": 1.8038413382260061,
"learning_rate": 2.766881723423441e-06,
"loss": 0.6522846221923828,
"step": 4120
},
{
"epoch": 0.6631342324983943,
"grad_norm": 1.542415640870293,
"learning_rate": 2.7434027001378194e-06,
"loss": 0.6323680877685547,
"step": 4130
},
{
"epoch": 0.6647398843930635,
"grad_norm": 1.5534418727849721,
"learning_rate": 2.719985998795747e-06,
"loss": 0.6778179168701172,
"step": 4140
},
{
"epoch": 0.6663455362877329,
"grad_norm": 1.5712742360039995,
"learning_rate": 2.696632266111784e-06,
"loss": 0.6367866516113281,
"step": 4150
},
{
"epoch": 0.6679511881824021,
"grad_norm": 1.833593699902694,
"learning_rate": 2.67334214706145e-06,
"loss": 0.6607365608215332,
"step": 4160
},
{
"epoch": 0.6695568400770713,
"grad_norm": 1.644689383370669,
"learning_rate": 2.6501162848634023e-06,
"loss": 0.6528053760528565,
"step": 4170
},
{
"epoch": 0.6711624919717405,
"grad_norm": 1.8086124772278036,
"learning_rate": 2.6269553209616705e-06,
"loss": 0.6112563133239746,
"step": 4180
},
{
"epoch": 0.6727681438664097,
"grad_norm": 1.9128089462595501,
"learning_rate": 2.603859895007953e-06,
"loss": 0.6744743347167969,
"step": 4190
},
{
"epoch": 0.674373795761079,
"grad_norm": 1.503328791218411,
"learning_rate": 2.5808306448439363e-06,
"loss": 0.6157184600830078,
"step": 4200
},
{
"epoch": 0.674373795761079,
"eval_loss": 0.5820798873901367,
"eval_runtime": 115.5668,
"eval_samples_per_second": 17.505,
"eval_steps_per_second": 4.378,
"eval_token_acc": 0.8002397633400685,
"step": 4200
},
{
"epoch": 0.6759794476557482,
"grad_norm": 2.045147193567602,
"learning_rate": 2.557868206483689e-06,
"loss": 0.6391608238220214,
"step": 4210
},
{
"epoch": 0.6775850995504175,
"grad_norm": 1.7147802927742894,
"learning_rate": 2.5349732140960924e-06,
"loss": 0.6371169567108155,
"step": 4220
},
{
"epoch": 0.6791907514450867,
"grad_norm": 1.685988655934266,
"learning_rate": 2.5121462999873304e-06,
"loss": 0.5960301876068115,
"step": 4230
},
{
"epoch": 0.680796403339756,
"grad_norm": 1.6786670117397713,
"learning_rate": 2.48938809458342e-06,
"loss": 0.6312998294830322,
"step": 4240
},
{
"epoch": 0.6824020552344252,
"grad_norm": 1.4873973912798752,
"learning_rate": 2.466699226412807e-06,
"loss": 0.6012437343597412,
"step": 4250
},
{
"epoch": 0.6840077071290944,
"grad_norm": 1.7189122820194944,
"learning_rate": 2.4440803220890054e-06,
"loss": 0.6181604385375976,
"step": 4260
},
{
"epoch": 0.6856133590237636,
"grad_norm": 1.7992978742198917,
"learning_rate": 2.4215320062932884e-06,
"loss": 0.616178321838379,
"step": 4270
},
{
"epoch": 0.6872190109184328,
"grad_norm": 1.633995574685268,
"learning_rate": 2.399054901757442e-06,
"loss": 0.6509074211120606,
"step": 4280
},
{
"epoch": 0.6888246628131022,
"grad_norm": 1.8247436739266203,
"learning_rate": 2.3766496292465626e-06,
"loss": 0.6111636161804199,
"step": 4290
},
{
"epoch": 0.6904303147077714,
"grad_norm": 2.010698175443969,
"learning_rate": 2.3543168075419128e-06,
"loss": 0.6828377723693848,
"step": 4300
},
{
"epoch": 0.6920359666024406,
"grad_norm": 1.5603806270643172,
"learning_rate": 2.3320570534238333e-06,
"loss": 0.6230679512023926,
"step": 4310
},
{
"epoch": 0.6936416184971098,
"grad_norm": 1.7656937668495685,
"learning_rate": 2.3098709816547126e-06,
"loss": 0.6073711395263672,
"step": 4320
},
{
"epoch": 0.695247270391779,
"grad_norm": 1.5675790546975539,
"learning_rate": 2.2877592049620013e-06,
"loss": 0.6132484912872315,
"step": 4330
},
{
"epoch": 0.6968529222864484,
"grad_norm": 1.8840928192176054,
"learning_rate": 2.2657223340212937e-06,
"loss": 0.6499895095825196,
"step": 4340
},
{
"epoch": 0.6984585741811176,
"grad_norm": 1.485949916458336,
"learning_rate": 2.243760977439463e-06,
"loss": 0.615330696105957,
"step": 4350
},
{
"epoch": 0.7000642260757868,
"grad_norm": 1.7164083590388903,
"learning_rate": 2.2218757417378524e-06,
"loss": 0.6341984748840332,
"step": 4360
},
{
"epoch": 0.701669877970456,
"grad_norm": 1.4624278832608588,
"learning_rate": 2.2000672313355243e-06,
"loss": 0.5987278938293457,
"step": 4370
},
{
"epoch": 0.7032755298651252,
"grad_norm": 1.7173759962972308,
"learning_rate": 2.178336048532567e-06,
"loss": 0.601482629776001,
"step": 4380
},
{
"epoch": 0.7048811817597945,
"grad_norm": 1.7808810749639428,
"learning_rate": 2.1566827934934625e-06,
"loss": 0.667569351196289,
"step": 4390
},
{
"epoch": 0.7064868336544637,
"grad_norm": 1.4738305673809178,
"learning_rate": 2.1351080642305087e-06,
"loss": 0.6533387660980224,
"step": 4400
},
{
"epoch": 0.7064868336544637,
"eval_loss": 0.580632746219635,
"eval_runtime": 117.1398,
"eval_samples_per_second": 17.27,
"eval_steps_per_second": 4.32,
"eval_token_acc": 0.800744484358654,
"step": 4400
},
{
"epoch": 0.708092485549133,
"grad_norm": 1.6325615237394804,
"learning_rate": 2.1136124565873067e-06,
"loss": 0.5981454372406005,
"step": 4410
},
{
"epoch": 0.7096981374438022,
"grad_norm": 1.4296787875753854,
"learning_rate": 2.092196564222301e-06,
"loss": 0.6405043601989746,
"step": 4420
},
{
"epoch": 0.7113037893384714,
"grad_norm": 1.949785258946256,
"learning_rate": 2.070860978592389e-06,
"loss": 0.6880702972412109,
"step": 4430
},
{
"epoch": 0.7129094412331407,
"grad_norm": 1.7526041237317675,
"learning_rate": 2.04960628893658e-06,
"loss": 0.6139644622802735,
"step": 4440
},
{
"epoch": 0.7145150931278099,
"grad_norm": 1.5476358574696476,
"learning_rate": 2.0284330822597328e-06,
"loss": 0.6332278251647949,
"step": 4450
},
{
"epoch": 0.7161207450224791,
"grad_norm": 1.8500596491674761,
"learning_rate": 2.0073419433163287e-06,
"loss": 0.6281499862670898,
"step": 4460
},
{
"epoch": 0.7177263969171483,
"grad_norm": 1.7651733298943222,
"learning_rate": 1.9863334545943346e-06,
"loss": 0.6181722640991211,
"step": 4470
},
{
"epoch": 0.7193320488118176,
"grad_norm": 1.6049924741534642,
"learning_rate": 1.96540819629911e-06,
"loss": 0.6430582523345947,
"step": 4480
},
{
"epoch": 0.7209377007064869,
"grad_norm": 1.4421025800768663,
"learning_rate": 1.944566746337384e-06,
"loss": 0.6036171913146973,
"step": 4490
},
{
"epoch": 0.7225433526011561,
"grad_norm": 1.6285363292438688,
"learning_rate": 1.9238096803012977e-06,
"loss": 0.6362571716308594,
"step": 4500
},
{
"epoch": 0.7241490044958253,
"grad_norm": 1.7068600729705337,
"learning_rate": 1.9031375714525024e-06,
"loss": 0.6020670890808105,
"step": 4510
},
{
"epoch": 0.7257546563904945,
"grad_norm": 1.8694371561958198,
"learning_rate": 1.8825509907063328e-06,
"loss": 0.6477363109588623,
"step": 4520
},
{
"epoch": 0.7273603082851637,
"grad_norm": 1.5483620034723313,
"learning_rate": 1.862050506616036e-06,
"loss": 0.634291410446167,
"step": 4530
},
{
"epoch": 0.7289659601798331,
"grad_norm": 1.6864092934529722,
"learning_rate": 1.841636685357071e-06,
"loss": 0.6551846027374267,
"step": 4540
},
{
"epoch": 0.7305716120745023,
"grad_norm": 1.6916900725584771,
"learning_rate": 1.8213100907114723e-06,
"loss": 0.6069769859313965,
"step": 4550
},
{
"epoch": 0.7321772639691715,
"grad_norm": 1.6735002405038526,
"learning_rate": 1.8010712840522787e-06,
"loss": 0.6614324569702148,
"step": 4560
},
{
"epoch": 0.7337829158638407,
"grad_norm": 1.8585454189612793,
"learning_rate": 1.7809208243280295e-06,
"loss": 0.6140747547149659,
"step": 4570
},
{
"epoch": 0.7353885677585099,
"grad_norm": 1.67101610321688,
"learning_rate": 1.7608592680473286e-06,
"loss": 0.596295166015625,
"step": 4580
},
{
"epoch": 0.7369942196531792,
"grad_norm": 1.6090351086530328,
"learning_rate": 1.740887169263477e-06,
"loss": 0.6292660236358643,
"step": 4590
},
{
"epoch": 0.7385998715478485,
"grad_norm": 1.6470392339720403,
"learning_rate": 1.7210050795591659e-06,
"loss": 0.6159173011779785,
"step": 4600
},
{
"epoch": 0.7385998715478485,
"eval_loss": 0.5773460865020752,
"eval_runtime": 115.7364,
"eval_samples_per_second": 17.479,
"eval_steps_per_second": 4.372,
"eval_token_acc": 0.8012725643665293,
"step": 4600
},
{
"epoch": 0.7402055234425177,
"grad_norm": 1.9918438283277915,
"learning_rate": 1.7012135480312453e-06,
"loss": 0.700563621520996,
"step": 4610
},
{
"epoch": 0.7418111753371869,
"grad_norm": 1.6743656898343373,
"learning_rate": 1.681513121275562e-06,
"loss": 0.5890089988708496,
"step": 4620
},
{
"epoch": 0.7434168272318561,
"grad_norm": 1.7197766351679413,
"learning_rate": 1.6619043433718618e-06,
"loss": 0.5891599655151367,
"step": 4630
},
{
"epoch": 0.7450224791265254,
"grad_norm": 1.8377522310891323,
"learning_rate": 1.6423877558687618e-06,
"loss": 0.6465985298156738,
"step": 4640
},
{
"epoch": 0.7466281310211946,
"grad_norm": 1.693859000264474,
"learning_rate": 1.6229638977687978e-06,
"loss": 0.6260784149169922,
"step": 4650
},
{
"epoch": 0.7482337829158638,
"grad_norm": 1.7224187559205801,
"learning_rate": 1.6036333055135345e-06,
"loss": 0.6414599418640137,
"step": 4660
},
{
"epoch": 0.7498394348105331,
"grad_norm": 1.470812358394573,
"learning_rate": 1.5843965129687534e-06,
"loss": 0.5949658870697021,
"step": 4670
},
{
"epoch": 0.7514450867052023,
"grad_norm": 1.9470524033349248,
"learning_rate": 1.5652540514097053e-06,
"loss": 0.6360251426696777,
"step": 4680
},
{
"epoch": 0.7530507385998716,
"grad_norm": 1.502544150605463,
"learning_rate": 1.5462064495064422e-06,
"loss": 0.642902946472168,
"step": 4690
},
{
"epoch": 0.7546563904945408,
"grad_norm": 1.8899266627864577,
"learning_rate": 1.5272542333092111e-06,
"loss": 0.6440675258636475,
"step": 4700
},
{
"epoch": 0.75626204238921,
"grad_norm": 1.8027721737162652,
"learning_rate": 1.5083979262339299e-06,
"loss": 0.6398180961608887,
"step": 4710
},
{
"epoch": 0.7578676942838792,
"grad_norm": 2.0384841764171733,
"learning_rate": 1.4896380490477336e-06,
"loss": 0.6641289710998535,
"step": 4720
},
{
"epoch": 0.7594733461785484,
"grad_norm": 1.6291499323229892,
"learning_rate": 1.4709751198545858e-06,
"loss": 0.6209500789642334,
"step": 4730
},
{
"epoch": 0.7610789980732178,
"grad_norm": 1.7406815962711,
"learning_rate": 1.4524096540809746e-06,
"loss": 0.6143218040466308,
"step": 4740
},
{
"epoch": 0.762684649967887,
"grad_norm": 1.6318467742073794,
"learning_rate": 1.4339421644616723e-06,
"loss": 0.602264404296875,
"step": 4750
},
{
"epoch": 0.7642903018625562,
"grad_norm": 1.6983566290312326,
"learning_rate": 1.415573161025584e-06,
"loss": 0.5744462013244629,
"step": 4760
},
{
"epoch": 0.7658959537572254,
"grad_norm": 1.5568550381005917,
"learning_rate": 1.3973031510816542e-06,
"loss": 0.6219449520111084,
"step": 4770
},
{
"epoch": 0.7675016056518946,
"grad_norm": 1.7262384743458887,
"learning_rate": 1.3791326392048593e-06,
"loss": 0.6433005809783936,
"step": 4780
},
{
"epoch": 0.769107257546564,
"grad_norm": 1.8571619626510951,
"learning_rate": 1.3610621272222713e-06,
"loss": 0.6154828548431397,
"step": 4790
},
{
"epoch": 0.7707129094412332,
"grad_norm": 1.5136725460512475,
"learning_rate": 1.3430921141991977e-06,
"loss": 0.6346235275268555,
"step": 4800
},
{
"epoch": 0.7707129094412332,
"eval_loss": 0.5772837996482849,
"eval_runtime": 117.978,
"eval_samples_per_second": 17.147,
"eval_steps_per_second": 4.289,
"eval_token_acc": 0.8020625987542984,
"step": 4800
},
{
"epoch": 0.7723185613359024,
"grad_norm": 1.941479206845148,
"learning_rate": 1.3252230964253998e-06,
"loss": 0.6047333717346192,
"step": 4810
},
{
"epoch": 0.7739242132305716,
"grad_norm": 1.4802656853080443,
"learning_rate": 1.3074555674013901e-06,
"loss": 0.6177777290344239,
"step": 4820
},
{
"epoch": 0.7755298651252408,
"grad_norm": 1.8409632389077035,
"learning_rate": 1.2897900178247945e-06,
"loss": 0.6657865524291993,
"step": 4830
},
{
"epoch": 0.7771355170199101,
"grad_norm": 1.7465471409023423,
"learning_rate": 1.2722269355768058e-06,
"loss": 0.6325933456420898,
"step": 4840
},
{
"epoch": 0.7787411689145793,
"grad_norm": 1.7357172898681474,
"learning_rate": 1.2547668057087097e-06,
"loss": 0.6073914527893066,
"step": 4850
},
{
"epoch": 0.7803468208092486,
"grad_norm": 1.5826493279336413,
"learning_rate": 1.237410110428487e-06,
"loss": 0.6457367420196534,
"step": 4860
},
{
"epoch": 0.7819524727039178,
"grad_norm": 2.169817614599634,
"learning_rate": 1.2201573290874963e-06,
"loss": 0.5977273941040039,
"step": 4870
},
{
"epoch": 0.783558124598587,
"grad_norm": 1.6865545638523116,
"learning_rate": 1.2030089381672384e-06,
"loss": 0.6518450260162354,
"step": 4880
},
{
"epoch": 0.7851637764932563,
"grad_norm": 1.8293621274972247,
"learning_rate": 1.1859654112661923e-06,
"loss": 0.6506802082061768,
"step": 4890
},
{
"epoch": 0.7867694283879255,
"grad_norm": 1.8105963381339787,
"learning_rate": 1.169027219086739e-06,
"loss": 0.6600035667419434,
"step": 4900
},
{
"epoch": 0.7883750802825947,
"grad_norm": 1.604620184322651,
"learning_rate": 1.1521948294221603e-06,
"loss": 0.6555306434631347,
"step": 4910
},
{
"epoch": 0.789980732177264,
"grad_norm": 1.7855453593256356,
"learning_rate": 1.1354687071437197e-06,
"loss": 0.5738696575164794,
"step": 4920
},
{
"epoch": 0.7915863840719332,
"grad_norm": 1.6455556925524137,
"learning_rate": 1.1188493141878248e-06,
"loss": 0.6280563354492188,
"step": 4930
},
{
"epoch": 0.7931920359666025,
"grad_norm": 1.5084264332429083,
"learning_rate": 1.1023371095432656e-06,
"loss": 0.6412508010864257,
"step": 4940
},
{
"epoch": 0.7947976878612717,
"grad_norm": 1.748454465592618,
"learning_rate": 1.085932549238547e-06,
"loss": 0.6463836669921875,
"step": 4950
},
{
"epoch": 0.7964033397559409,
"grad_norm": 1.5700493018887136,
"learning_rate": 1.0696360863292842e-06,
"loss": 0.6505722045898438,
"step": 4960
},
{
"epoch": 0.7980089916506101,
"grad_norm": 2.1173458296345244,
"learning_rate": 1.053448170885697e-06,
"loss": 0.5998007774353027,
"step": 4970
},
{
"epoch": 0.7996146435452793,
"grad_norm": 1.7193892335616814,
"learning_rate": 1.0373692499801763e-06,
"loss": 0.6597327709197998,
"step": 4980
},
{
"epoch": 0.8012202954399487,
"grad_norm": 1.5021327733245695,
"learning_rate": 1.021399767674941e-06,
"loss": 0.6283426761627198,
"step": 4990
},
{
"epoch": 0.8028259473346179,
"grad_norm": 2.050460593018747,
"learning_rate": 1.0055401650097685e-06,
"loss": 0.6920224189758301,
"step": 5000
},
{
"epoch": 0.8028259473346179,
"eval_loss": 0.5766663551330566,
"eval_runtime": 116.4968,
"eval_samples_per_second": 17.365,
"eval_steps_per_second": 4.343,
"eval_token_acc": 0.8022861776517876,
"step": 5000
},
{
"epoch": 0.8044315992292871,
"grad_norm": 1.5486550221902147,
"learning_rate": 9.89790879989821e-07,
"loss": 0.6464922428131104,
"step": 5010
},
{
"epoch": 0.8060372511239563,
"grad_norm": 1.6738208657333828,
"learning_rate": 9.741523475735414e-07,
"loss": 0.6773768424987793,
"step": 5020
},
{
"epoch": 0.8076429030186255,
"grad_norm": 1.600400825176277,
"learning_rate": 9.586249996606473e-07,
"loss": 0.6198241710662842,
"step": 5030
},
{
"epoch": 0.8092485549132948,
"grad_norm": 1.604271483427513,
"learning_rate": 9.432092650801994e-07,
"loss": 0.644795274734497,
"step": 5040
},
{
"epoch": 0.810854206807964,
"grad_norm": 1.7603640838795784,
"learning_rate": 9.279055695787582e-07,
"loss": 0.5961036682128906,
"step": 5050
},
{
"epoch": 0.8124598587026333,
"grad_norm": 1.6707735318483077,
"learning_rate": 9.127143358086277e-07,
"loss": 0.6223243713378906,
"step": 5060
},
{
"epoch": 0.8140655105973025,
"grad_norm": 1.4399237322867773,
"learning_rate": 8.976359833161796e-07,
"loss": 0.6160260200500488,
"step": 5070
},
{
"epoch": 0.8156711624919717,
"grad_norm": 1.5683323659854056,
"learning_rate": 8.826709285302737e-07,
"loss": 0.6315612316131591,
"step": 5080
},
{
"epoch": 0.817276814386641,
"grad_norm": 2.0831948488502423,
"learning_rate": 8.678195847507464e-07,
"loss": 0.6538731098175049,
"step": 5090
},
{
"epoch": 0.8188824662813102,
"grad_norm": 1.7432408963106332,
"learning_rate": 8.530823621370043e-07,
"loss": 0.6310447216033935,
"step": 5100
},
{
"epoch": 0.8204881181759794,
"grad_norm": 1.5823330528149908,
"learning_rate": 8.384596676966938e-07,
"loss": 0.5536775112152099,
"step": 5110
},
{
"epoch": 0.8220937700706487,
"grad_norm": 1.7106531605451956,
"learning_rate": 8.239519052744605e-07,
"loss": 0.6286486625671387,
"step": 5120
},
{
"epoch": 0.8236994219653179,
"grad_norm": 1.936155046132306,
"learning_rate": 8.095594755407971e-07,
"loss": 0.6777469635009765,
"step": 5130
},
{
"epoch": 0.8253050738599872,
"grad_norm": 1.3901083055492947,
"learning_rate": 7.952827759809756e-07,
"loss": 0.6293821811676026,
"step": 5140
},
{
"epoch": 0.8269107257546564,
"grad_norm": 1.718191378615406,
"learning_rate": 7.811222008840719e-07,
"loss": 0.6516339302062988,
"step": 5150
},
{
"epoch": 0.8285163776493256,
"grad_norm": 1.902823159131978,
"learning_rate": 7.670781413320766e-07,
"loss": 0.5841949462890625,
"step": 5160
},
{
"epoch": 0.8301220295439948,
"grad_norm": 1.6396798192512863,
"learning_rate": 7.531509851890911e-07,
"loss": 0.6197714328765869,
"step": 5170
},
{
"epoch": 0.831727681438664,
"grad_norm": 1.753661211335331,
"learning_rate": 7.393411170906201e-07,
"loss": 0.6171721935272216,
"step": 5180
},
{
"epoch": 0.8333333333333334,
"grad_norm": 1.5127497599851492,
"learning_rate": 7.256489184329452e-07,
"loss": 0.604136323928833,
"step": 5190
},
{
"epoch": 0.8349389852280026,
"grad_norm": 1.4904625841129133,
"learning_rate": 7.120747673625916e-07,
"loss": 0.6176275253295899,
"step": 5200
},
{
"epoch": 0.8349389852280026,
"eval_loss": 0.5767529010772705,
"eval_runtime": 115.3879,
"eval_samples_per_second": 17.532,
"eval_steps_per_second": 4.385,
"eval_token_acc": 0.8026373967407536,
"step": 5200
},
{
"epoch": 0.8365446371226718,
"grad_norm": 1.6616720449719025,
"learning_rate": 6.986190387658909e-07,
"loss": 0.6671013832092285,
"step": 5210
},
{
"epoch": 0.838150289017341,
"grad_norm": 1.7360372162228797,
"learning_rate": 6.852821042586183e-07,
"loss": 0.6652707099914551,
"step": 5220
},
{
"epoch": 0.8397559409120102,
"grad_norm": 1.6228551388753156,
"learning_rate": 6.720643321757348e-07,
"loss": 0.6581364631652832,
"step": 5230
},
{
"epoch": 0.8413615928066795,
"grad_norm": 1.722082150924103,
"learning_rate": 6.589660875612147e-07,
"loss": 0.6475844383239746,
"step": 5240
},
{
"epoch": 0.8429672447013488,
"grad_norm": 2.116679273977666,
"learning_rate": 6.459877321579628e-07,
"loss": 0.6615125656127929,
"step": 5250
},
{
"epoch": 0.844572896596018,
"grad_norm": 1.8762326334249044,
"learning_rate": 6.33129624397823e-07,
"loss": 0.6376981258392334,
"step": 5260
},
{
"epoch": 0.8461785484906872,
"grad_norm": 1.5775860849763117,
"learning_rate": 6.203921193916812e-07,
"loss": 0.5770237922668457,
"step": 5270
},
{
"epoch": 0.8477842003853564,
"grad_norm": 1.9029054905764342,
"learning_rate": 6.077755689196574e-07,
"loss": 0.6483820915222168,
"step": 5280
},
{
"epoch": 0.8493898522800257,
"grad_norm": 1.8325196688318919,
"learning_rate": 5.952803214213887e-07,
"loss": 0.6220078468322754,
"step": 5290
},
{
"epoch": 0.8509955041746949,
"grad_norm": 1.6696224296793218,
"learning_rate": 5.829067219864099e-07,
"loss": 0.666869831085205,
"step": 5300
},
{
"epoch": 0.8526011560693642,
"grad_norm": 1.5010642399247371,
"learning_rate": 5.706551123446175e-07,
"loss": 0.5817923545837402,
"step": 5310
},
{
"epoch": 0.8542068079640334,
"grad_norm": 1.6418838210429256,
"learning_rate": 5.585258308568381e-07,
"loss": 0.6304399490356445,
"step": 5320
},
{
"epoch": 0.8558124598587026,
"grad_norm": 1.9627540497013132,
"learning_rate": 5.465192125054769e-07,
"loss": 0.6063569068908692,
"step": 5330
},
{
"epoch": 0.8574181117533719,
"grad_norm": 1.8273506016319814,
"learning_rate": 5.346355888852767e-07,
"loss": 0.610871696472168,
"step": 5340
},
{
"epoch": 0.8590237636480411,
"grad_norm": 1.7712709881033286,
"learning_rate": 5.22875288194144e-07,
"loss": 0.5931038856506348,
"step": 5350
},
{
"epoch": 0.8606294155427103,
"grad_norm": 1.690149934214249,
"learning_rate": 5.112386352241017e-07,
"loss": 0.6216620922088623,
"step": 5360
},
{
"epoch": 0.8622350674373795,
"grad_norm": 1.57401450836848,
"learning_rate": 4.997259513523079e-07,
"loss": 0.6697893619537354,
"step": 5370
},
{
"epoch": 0.8638407193320488,
"grad_norm": 1.766758207988638,
"learning_rate": 4.883375545321845e-07,
"loss": 0.6087721347808838,
"step": 5380
},
{
"epoch": 0.8654463712267181,
"grad_norm": 1.4690060560601916,
"learning_rate": 4.770737592846375e-07,
"loss": 0.6009274482727051,
"step": 5390
},
{
"epoch": 0.8670520231213873,
"grad_norm": 1.6074705175725752,
"learning_rate": 4.6593487668936565e-07,
"loss": 0.6610477924346924,
"step": 5400
},
{
"epoch": 0.8670520231213873,
"eval_loss": 0.5729334950447083,
"eval_runtime": 116.3697,
"eval_samples_per_second": 17.384,
"eval_steps_per_second": 4.348,
"eval_token_acc": 0.8028926771237075,
"step": 5400
},
{
"epoch": 0.8686576750160565,
"grad_norm": 1.57876027358775,
"learning_rate": 4.5492121437627433e-07,
"loss": 0.6015999794006348,
"step": 5410
},
{
"epoch": 0.8702633269107257,
"grad_norm": 1.7832820730897672,
"learning_rate": 4.440330765169765e-07,
"loss": 0.5984902381896973,
"step": 5420
},
{
"epoch": 0.871868978805395,
"grad_norm": 1.6137384209920154,
"learning_rate": 4.3327076381639357e-07,
"loss": 0.6636902809143066,
"step": 5430
},
{
"epoch": 0.8734746307000643,
"grad_norm": 1.8766192417776106,
"learning_rate": 4.226345735044485e-07,
"loss": 0.6453081130981445,
"step": 5440
},
{
"epoch": 0.8750802825947335,
"grad_norm": 1.7263370713948474,
"learning_rate": 4.121247993278621e-07,
"loss": 0.6501432418823242,
"step": 5450
},
{
"epoch": 0.8766859344894027,
"grad_norm": 1.6370094742186325,
"learning_rate": 4.0174173154203356e-07,
"loss": 0.6349458694458008,
"step": 5460
},
{
"epoch": 0.8782915863840719,
"grad_norm": 1.6338222328943681,
"learning_rate": 3.9148565690302896e-07,
"loss": 0.6203731536865235,
"step": 5470
},
{
"epoch": 0.8798972382787412,
"grad_norm": 1.5790217288544453,
"learning_rate": 3.813568586596611e-07,
"loss": 0.5949804306030273,
"step": 5480
},
{
"epoch": 0.8815028901734104,
"grad_norm": 1.39406428632037,
"learning_rate": 3.7135561654566497e-07,
"loss": 0.6562387466430664,
"step": 5490
},
{
"epoch": 0.8831085420680796,
"grad_norm": 1.6638397207650397,
"learning_rate": 3.6148220677197364e-07,
"loss": 0.6203203201293945,
"step": 5500
},
{
"epoch": 0.8847141939627489,
"grad_norm": 1.4019127036161603,
"learning_rate": 3.5173690201909084e-07,
"loss": 0.6110305786132812,
"step": 5510
},
{
"epoch": 0.8863198458574181,
"grad_norm": 1.7918708664402199,
"learning_rate": 3.4211997142955756e-07,
"loss": 0.6375399589538574,
"step": 5520
},
{
"epoch": 0.8879254977520874,
"grad_norm": 1.9616932846212223,
"learning_rate": 3.326316806005209e-07,
"loss": 0.6158774375915528,
"step": 5530
},
{
"epoch": 0.8895311496467566,
"grad_norm": 1.8162630013198795,
"learning_rate": 3.2327229157639915e-07,
"loss": 0.6023660659790039,
"step": 5540
},
{
"epoch": 0.8911368015414258,
"grad_norm": 1.5475924483567713,
"learning_rate": 3.1404206284164295e-07,
"loss": 0.6220304489135742,
"step": 5550
},
{
"epoch": 0.892742453436095,
"grad_norm": 1.780906089201377,
"learning_rate": 3.0494124931359834e-07,
"loss": 0.605389404296875,
"step": 5560
},
{
"epoch": 0.8943481053307643,
"grad_norm": 1.6714265896053035,
"learning_rate": 2.959701023354644e-07,
"loss": 0.6368635177612305,
"step": 5570
},
{
"epoch": 0.8959537572254336,
"grad_norm": 1.5909364323881428,
"learning_rate": 2.871288696693564e-07,
"loss": 0.6405464172363281,
"step": 5580
},
{
"epoch": 0.8975594091201028,
"grad_norm": 1.8531889188206607,
"learning_rate": 2.7841779548945626e-07,
"loss": 0.5804450511932373,
"step": 5590
},
{
"epoch": 0.899165061014772,
"grad_norm": 1.5833984517267605,
"learning_rate": 2.698371203752753e-07,
"loss": 0.6217172145843506,
"step": 5600
},
{
"epoch": 0.899165061014772,
"eval_loss": 0.5752645134925842,
"eval_runtime": 115.6265,
"eval_samples_per_second": 17.496,
"eval_steps_per_second": 4.376,
"eval_token_acc": 0.803150460255514,
"step": 5600
},
{
"epoch": 0.9007707129094412,
"grad_norm": 1.6237404405424622,
"learning_rate": 2.613870813050051e-07,
"loss": 0.5858840465545654,
"step": 5610
},
{
"epoch": 0.9023763648041104,
"grad_norm": 1.8525333922294798,
"learning_rate": 2.53067911648977e-07,
"loss": 0.6315989971160889,
"step": 5620
},
{
"epoch": 0.9039820166987798,
"grad_norm": 1.768138904733902,
"learning_rate": 2.4487984116321474e-07,
"loss": 0.6300556659698486,
"step": 5630
},
{
"epoch": 0.905587668593449,
"grad_norm": 1.7161529988705222,
"learning_rate": 2.368230959830875e-07,
"loss": 0.6011830329895019,
"step": 5640
},
{
"epoch": 0.9071933204881182,
"grad_norm": 1.600603600858998,
"learning_rate": 2.2889789861706868e-07,
"loss": 0.6122558116912842,
"step": 5650
},
{
"epoch": 0.9087989723827874,
"grad_norm": 1.928618788414808,
"learning_rate": 2.211044679405877e-07,
"loss": 0.5967905044555664,
"step": 5660
},
{
"epoch": 0.9104046242774566,
"grad_norm": 1.5630153842153907,
"learning_rate": 2.1344301918998555e-07,
"loss": 0.6117796421051025,
"step": 5670
},
{
"epoch": 0.9120102761721259,
"grad_norm": 1.6679276269534378,
"learning_rate": 2.059137639565717e-07,
"loss": 0.6195221900939941,
"step": 5680
},
{
"epoch": 0.9136159280667951,
"grad_norm": 1.638132151814036,
"learning_rate": 1.9851691018077824e-07,
"loss": 0.6240126609802246,
"step": 5690
},
{
"epoch": 0.9152215799614644,
"grad_norm": 1.6864448316312712,
"learning_rate": 1.9125266214642e-07,
"loss": 0.6728627681732178,
"step": 5700
},
{
"epoch": 0.9168272318561336,
"grad_norm": 1.8998671947688817,
"learning_rate": 1.8412122047505032e-07,
"loss": 0.6206884384155273,
"step": 5710
},
{
"epoch": 0.9184328837508028,
"grad_norm": 1.5534987287794495,
"learning_rate": 1.7712278212042134e-07,
"loss": 0.6320960998535157,
"step": 5720
},
{
"epoch": 0.9200385356454721,
"grad_norm": 1.681299514817593,
"learning_rate": 1.7025754036304466e-07,
"loss": 0.6238042831420898,
"step": 5730
},
{
"epoch": 0.9216441875401413,
"grad_norm": 1.6265592202582009,
"learning_rate": 1.6352568480485277e-07,
"loss": 0.6073272228240967,
"step": 5740
},
{
"epoch": 0.9232498394348105,
"grad_norm": 1.8025202193600034,
"learning_rate": 1.5692740136396324e-07,
"loss": 0.5922677993774415,
"step": 5750
},
{
"epoch": 0.9248554913294798,
"grad_norm": 1.791643260329241,
"learning_rate": 1.5046287226954394e-07,
"loss": 0.6612445831298828,
"step": 5760
},
{
"epoch": 0.926461143224149,
"grad_norm": 1.6626324219461264,
"learning_rate": 1.4413227605677983e-07,
"loss": 0.6229853630065918,
"step": 5770
},
{
"epoch": 0.9280667951188183,
"grad_norm": 1.679861943616916,
"learning_rate": 1.379357875619436e-07,
"loss": 0.6264891147613525,
"step": 5780
},
{
"epoch": 0.9296724470134875,
"grad_norm": 1.721027746101911,
"learning_rate": 1.3187357791756504e-07,
"loss": 0.6237311363220215,
"step": 5790
},
{
"epoch": 0.9312780989081567,
"grad_norm": 1.6107596914991866,
"learning_rate": 1.2594581454770772e-07,
"loss": 0.5913224697113038,
"step": 5800
},
{
"epoch": 0.9312780989081567,
"eval_loss": 0.5708259344100952,
"eval_runtime": 117.1262,
"eval_samples_per_second": 17.272,
"eval_steps_per_second": 4.32,
"eval_token_acc": 0.8033098019324558,
"step": 5800
},
{
"epoch": 0.9328837508028259,
"grad_norm": 1.7093807551813902,
"learning_rate": 1.2015266116334135e-07,
"loss": 0.6007876396179199,
"step": 5810
},
{
"epoch": 0.9344894026974951,
"grad_norm": 1.62030645952606,
"learning_rate": 1.1449427775782396e-07,
"loss": 0.5883060932159424,
"step": 5820
},
{
"epoch": 0.9360950545921645,
"grad_norm": 2.4493142088797346,
"learning_rate": 1.0897082060247976e-07,
"loss": 0.6372334003448487,
"step": 5830
},
{
"epoch": 0.9377007064868337,
"grad_norm": 1.6352836346158377,
"learning_rate": 1.0358244224228764e-07,
"loss": 0.6133495330810547,
"step": 5840
},
{
"epoch": 0.9393063583815029,
"grad_norm": 1.5838720024708473,
"learning_rate": 9.832929149166503e-08,
"loss": 0.5925948143005371,
"step": 5850
},
{
"epoch": 0.9409120102761721,
"grad_norm": 1.6297564720837419,
"learning_rate": 9.32115134303574e-08,
"loss": 0.6138250350952148,
"step": 5860
},
{
"epoch": 0.9425176621708413,
"grad_norm": 1.6701533347653996,
"learning_rate": 8.822924939943523e-08,
"loss": 0.6651721000671387,
"step": 5870
},
{
"epoch": 0.9441233140655106,
"grad_norm": 1.5684211124230398,
"learning_rate": 8.338263699738668e-08,
"loss": 0.5427798271179199,
"step": 5880
},
{
"epoch": 0.9457289659601799,
"grad_norm": 1.9455396681578898,
"learning_rate": 7.867181007631897e-08,
"loss": 0.6322480201721191,
"step": 5890
},
{
"epoch": 0.9473346178548491,
"grad_norm": 1.7580700885542513,
"learning_rate": 7.409689873826232e-08,
"loss": 0.6054346561431885,
"step": 5900
},
{
"epoch": 0.9489402697495183,
"grad_norm": 1.9972458734560363,
"learning_rate": 6.965802933157573e-08,
"loss": 0.639186429977417,
"step": 5910
},
{
"epoch": 0.9505459216441875,
"grad_norm": 1.7180914027664866,
"learning_rate": 6.535532444745862e-08,
"loss": 0.6357224464416504,
"step": 5920
},
{
"epoch": 0.9521515735388568,
"grad_norm": 1.9042172337567278,
"learning_rate": 6.118890291656355e-08,
"loss": 0.6573823928833008,
"step": 5930
},
{
"epoch": 0.953757225433526,
"grad_norm": 1.7870529920045328,
"learning_rate": 5.7158879805716e-08,
"loss": 0.573056697845459,
"step": 5940
},
{
"epoch": 0.9553628773281952,
"grad_norm": 1.840970426056217,
"learning_rate": 5.32653664147359e-08,
"loss": 0.5925376892089844,
"step": 5950
},
{
"epoch": 0.9569685292228645,
"grad_norm": 1.6478271540265557,
"learning_rate": 4.950847027336336e-08,
"loss": 0.6077459335327149,
"step": 5960
},
{
"epoch": 0.9585741811175337,
"grad_norm": 1.6679108958537707,
"learning_rate": 4.588829513828996e-08,
"loss": 0.6572588443756103,
"step": 5970
},
{
"epoch": 0.960179833012203,
"grad_norm": 1.5893205392993202,
"learning_rate": 4.2404940990292135e-08,
"loss": 0.5608067512512207,
"step": 5980
},
{
"epoch": 0.9617854849068722,
"grad_norm": 1.725453941125604,
"learning_rate": 3.90585040314706e-08,
"loss": 0.5632122039794922,
"step": 5990
},
{
"epoch": 0.9633911368015414,
"grad_norm": 1.7376641214713817,
"learning_rate": 3.584907668259308e-08,
"loss": 0.6706958770751953,
"step": 6000
},
{
"epoch": 0.9633911368015414,
"eval_loss": 0.5741922855377197,
"eval_runtime": 116.3672,
"eval_samples_per_second": 17.385,
"eval_steps_per_second": 4.348,
"eval_token_acc": 0.8032964539385758,
"step": 6000
},
{
"epoch": 0.9649967886962106,
"grad_norm": 1.5435197879461982,
"learning_rate": 3.2776747580541835e-08,
"loss": 0.6008576393127442,
"step": 6010
},
{
"epoch": 0.9666024405908799,
"grad_norm": 1.6555958936202548,
"learning_rate": 2.984160157586735e-08,
"loss": 0.6182814598083496,
"step": 6020
},
{
"epoch": 0.9682080924855492,
"grad_norm": 1.5683265883313169,
"learning_rate": 2.7043719730441288e-08,
"loss": 0.6090614318847656,
"step": 6030
},
{
"epoch": 0.9698137443802184,
"grad_norm": 1.6330006682221332,
"learning_rate": 2.4383179315222717e-08,
"loss": 0.5801780223846436,
"step": 6040
},
{
"epoch": 0.9714193962748876,
"grad_norm": 1.9282013764770385,
"learning_rate": 2.186005380811873e-08,
"loss": 0.6230826377868652,
"step": 6050
},
{
"epoch": 0.9730250481695568,
"grad_norm": 1.612559249065291,
"learning_rate": 1.9474412891959395e-08,
"loss": 0.6020002365112305,
"step": 6060
},
{
"epoch": 0.974630700064226,
"grad_norm": 1.6913118413453614,
"learning_rate": 1.7226322452572055e-08,
"loss": 0.6456441402435302,
"step": 6070
},
{
"epoch": 0.9762363519588954,
"grad_norm": 1.5870625483228484,
"learning_rate": 1.5115844576960027e-08,
"loss": 0.6072479248046875,
"step": 6080
},
{
"epoch": 0.9778420038535646,
"grad_norm": 1.4885864603630632,
"learning_rate": 1.3143037551590076e-08,
"loss": 0.6364302635192871,
"step": 6090
},
{
"epoch": 0.9794476557482338,
"grad_norm": 1.7423098004833633,
"learning_rate": 1.1307955860781483e-08,
"loss": 0.630467700958252,
"step": 6100
},
{
"epoch": 0.981053307642903,
"grad_norm": 1.7819265377180369,
"learning_rate": 9.610650185202242e-09,
"loss": 0.6165467262268066,
"step": 6110
},
{
"epoch": 0.9826589595375722,
"grad_norm": 1.493769172139119,
"learning_rate": 8.051167400467408e-09,
"loss": 0.6086311340332031,
"step": 6120
},
{
"epoch": 0.9842646114322415,
"grad_norm": 1.4828619626593085,
"learning_rate": 6.629550575847355e-09,
"loss": 0.6316121101379395,
"step": 6130
},
{
"epoch": 0.9858702633269107,
"grad_norm": 1.6623261401956104,
"learning_rate": 5.3458389730765006e-09,
"loss": 0.6523394107818603,
"step": 6140
},
{
"epoch": 0.98747591522158,
"grad_norm": 1.7908448179525431,
"learning_rate": 4.200068045269179e-09,
"loss": 0.6246747016906739,
"step": 6150
},
{
"epoch": 0.9890815671162492,
"grad_norm": 1.7502121618975803,
"learning_rate": 3.1922694359404207e-09,
"loss": 0.6109015464782714,
"step": 6160
},
{
"epoch": 0.9906872190109184,
"grad_norm": 1.9849207865849259,
"learning_rate": 2.3224709781322075e-09,
"loss": 0.5936941623687744,
"step": 6170
},
{
"epoch": 0.9922928709055877,
"grad_norm": 1.5565505599418075,
"learning_rate": 1.5906966936457545e-09,
"loss": 0.6239344120025635,
"step": 6180
},
{
"epoch": 0.9938985228002569,
"grad_norm": 1.8598198518642268,
"learning_rate": 9.969667923764859e-10,
"loss": 0.6211441993713379,
"step": 6190
},
{
"epoch": 0.9955041746949261,
"grad_norm": 1.924048487204165,
"learning_rate": 5.412976717561469e-10,
"loss": 0.5937876224517822,
"step": 6200
},
{
"epoch": 0.9955041746949261,
"eval_loss": 0.5703438520431519,
"eval_runtime": 116.1219,
"eval_samples_per_second": 17.421,
"eval_steps_per_second": 4.357,
"eval_token_acc": 0.8032922826904884,
"step": 6200
},
{
"epoch": 0.9971098265895953,
"grad_norm": 1.6927629675679943,
"learning_rate": 2.2370191630149974e-10,
"loss": 0.5909645557403564,
"step": 6210
},
{
"epoch": 0.9987154784842646,
"grad_norm": 1.6900193485291426,
"learning_rate": 4.418829726460239e-11,
"loss": 0.6455328941345215,
"step": 6220
},
{
"epoch": 1.0,
"eval_loss": 0.5718016028404236,
"eval_runtime": 116.7597,
"eval_samples_per_second": 17.326,
"eval_steps_per_second": 4.334,
"eval_token_acc": 0.8033565199110356,
"step": 6228
}
],
"logging_steps": 10,
"max_steps": 6228,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 264777532440576.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}