Files
general_knowledge_model/checkpoint-896/trainer_state.json

925 lines
26 KiB
JSON
Raw Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 896,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.2742946662008763,
"epoch": 0.011166945840312675,
"grad_norm": 57.75,
"learning_rate": 2.02247191011236e-06,
"loss": 2.0921743392944334,
"mean_token_accuracy": 0.6198021434247494,
"num_tokens": 27228.0,
"step": 10
},
{
"entropy": 1.4035808108747005,
"epoch": 0.02233389168062535,
"grad_norm": 27.5,
"learning_rate": 4.269662921348315e-06,
"loss": 1.8684164047241212,
"mean_token_accuracy": 0.6308974869549274,
"num_tokens": 54263.0,
"step": 20
},
{
"entropy": 1.3806322045624255,
"epoch": 0.03350083752093802,
"grad_norm": 7.4375,
"learning_rate": 6.51685393258427e-06,
"loss": 1.5451434135437012,
"mean_token_accuracy": 0.6709699966013432,
"num_tokens": 80355.0,
"step": 30
},
{
"entropy": 1.2432026788592339,
"epoch": 0.0446677833612507,
"grad_norm": 4.4375,
"learning_rate": 8.764044943820226e-06,
"loss": 1.3852472305297852,
"mean_token_accuracy": 0.727528478205204,
"num_tokens": 107262.0,
"step": 40
},
{
"entropy": 1.2347759172320365,
"epoch": 0.05583472920156337,
"grad_norm": 3.96875,
"learning_rate": 1.101123595505618e-05,
"loss": 1.3566075325012208,
"mean_token_accuracy": 0.7324926406145096,
"num_tokens": 134872.0,
"step": 50
},
{
"entropy": 1.1513216629624368,
"epoch": 0.06700167504187604,
"grad_norm": 4.0,
"learning_rate": 1.3258426966292135e-05,
"loss": 1.2471713066101073,
"mean_token_accuracy": 0.7584743887186051,
"num_tokens": 159459.0,
"step": 60
},
{
"entropy": 1.156738107651472,
"epoch": 0.07816862088218872,
"grad_norm": 3.578125,
"learning_rate": 1.5505617977528093e-05,
"loss": 1.239414596557617,
"mean_token_accuracy": 0.749166414886713,
"num_tokens": 184576.0,
"step": 70
},
{
"entropy": 1.157951571792364,
"epoch": 0.0893355667225014,
"grad_norm": 3.640625,
"learning_rate": 1.7752808988764045e-05,
"loss": 1.2582244873046875,
"mean_token_accuracy": 0.7544261917471886,
"num_tokens": 210131.0,
"step": 80
},
{
"entropy": 1.1601063475012778,
"epoch": 0.10050251256281408,
"grad_norm": 3.625,
"learning_rate": 2e-05,
"loss": 1.2618935585021973,
"mean_token_accuracy": 0.747503137588501,
"num_tokens": 237729.0,
"step": 90
},
{
"entropy": 1.0921222895383835,
"epoch": 0.11166945840312674,
"grad_norm": 3.59375,
"learning_rate": 1.975216852540273e-05,
"loss": 1.1785853385925293,
"mean_token_accuracy": 0.7695864170789719,
"num_tokens": 262275.0,
"step": 100
},
{
"entropy": 1.1327178589999676,
"epoch": 0.12283640424343942,
"grad_norm": 3.609375,
"learning_rate": 1.9504337050805453e-05,
"loss": 1.216773509979248,
"mean_token_accuracy": 0.7555348932743072,
"num_tokens": 288546.0,
"step": 110
},
{
"entropy": 1.035539500042796,
"epoch": 0.13400335008375208,
"grad_norm": 3.78125,
"learning_rate": 1.925650557620818e-05,
"loss": 1.1224644660949707,
"mean_token_accuracy": 0.7721244119107723,
"num_tokens": 312401.0,
"step": 120
},
{
"entropy": 1.1713032595813275,
"epoch": 0.14517029592406477,
"grad_norm": 3.671875,
"learning_rate": 1.9008674101610908e-05,
"loss": 1.3123122215270997,
"mean_token_accuracy": 0.7460119985044003,
"num_tokens": 339734.0,
"step": 130
},
{
"entropy": 1.1201179042458533,
"epoch": 0.15633724176437744,
"grad_norm": 3.65625,
"learning_rate": 1.8760842627013632e-05,
"loss": 1.2395885467529297,
"mean_token_accuracy": 0.7611079879105092,
"num_tokens": 364808.0,
"step": 140
},
{
"entropy": 1.1376964189112186,
"epoch": 0.16750418760469013,
"grad_norm": 3.171875,
"learning_rate": 1.851301115241636e-05,
"loss": 1.2277887344360352,
"mean_token_accuracy": 0.7598711617290974,
"num_tokens": 391934.0,
"step": 150
},
{
"entropy": 1.0489437825977803,
"epoch": 0.1786711334450028,
"grad_norm": 3.96875,
"learning_rate": 1.8265179677819083e-05,
"loss": 1.1456377029418945,
"mean_token_accuracy": 0.7739411622285843,
"num_tokens": 416529.0,
"step": 160
},
{
"entropy": 1.0241498839110137,
"epoch": 0.18983807928531546,
"grad_norm": 3.6875,
"learning_rate": 1.801734820322181e-05,
"loss": 1.1425954818725585,
"mean_token_accuracy": 0.77560595870018,
"num_tokens": 441104.0,
"step": 170
},
{
"entropy": 1.1297610633075237,
"epoch": 0.20100502512562815,
"grad_norm": 3.3125,
"learning_rate": 1.7769516728624535e-05,
"loss": 1.2210969924926758,
"mean_token_accuracy": 0.7550569862127304,
"num_tokens": 468069.0,
"step": 180
},
{
"entropy": 1.112941750138998,
"epoch": 0.21217197096594081,
"grad_norm": 3.65625,
"learning_rate": 1.7521685254027262e-05,
"loss": 1.192617416381836,
"mean_token_accuracy": 0.7619749017059803,
"num_tokens": 494025.0,
"step": 190
},
{
"entropy": 1.063616494834423,
"epoch": 0.22333891680625348,
"grad_norm": 3.828125,
"learning_rate": 1.727385377942999e-05,
"loss": 1.188753604888916,
"mean_token_accuracy": 0.7676796585321426,
"num_tokens": 519158.0,
"step": 200
},
{
"entropy": 1.1531932204961777,
"epoch": 0.23450586264656617,
"grad_norm": 3.59375,
"learning_rate": 1.7026022304832714e-05,
"loss": 1.2400163650512694,
"mean_token_accuracy": 0.7510207004845142,
"num_tokens": 546677.0,
"step": 210
},
{
"entropy": 1.1051580917090178,
"epoch": 0.24567280848687884,
"grad_norm": 3.703125,
"learning_rate": 1.677819083023544e-05,
"loss": 1.1891214370727539,
"mean_token_accuracy": 0.7638134479522705,
"num_tokens": 571855.0,
"step": 220
},
{
"entropy": 1.1669820021837949,
"epoch": 0.2568397543271915,
"grad_norm": 3.546875,
"learning_rate": 1.653035935563817e-05,
"loss": 1.2794105529785156,
"mean_token_accuracy": 0.7478987194597722,
"num_tokens": 599409.0,
"step": 230
},
{
"entropy": 1.118950032442808,
"epoch": 0.26800670016750416,
"grad_norm": 4.0,
"learning_rate": 1.6282527881040892e-05,
"loss": 1.2216855049133302,
"mean_token_accuracy": 0.7556364260613918,
"num_tokens": 625984.0,
"step": 240
},
{
"entropy": 1.1487022332847119,
"epoch": 0.27917364600781686,
"grad_norm": 3.0625,
"learning_rate": 1.603469640644362e-05,
"loss": 1.3041958808898926,
"mean_token_accuracy": 0.7531310901045799,
"num_tokens": 654422.0,
"step": 250
},
{
"entropy": 1.067482265457511,
"epoch": 0.29034059184812955,
"grad_norm": 3.84375,
"learning_rate": 1.5786864931846347e-05,
"loss": 1.1802674293518067,
"mean_token_accuracy": 0.7648798644542694,
"num_tokens": 679950.0,
"step": 260
},
{
"entropy": 1.1374815497547388,
"epoch": 0.3015075376884422,
"grad_norm": 3.234375,
"learning_rate": 1.553903345724907e-05,
"loss": 1.2403667449951172,
"mean_token_accuracy": 0.7576499588787555,
"num_tokens": 707691.0,
"step": 270
},
{
"entropy": 1.0954229425638915,
"epoch": 0.3126744835287549,
"grad_norm": 3.8125,
"learning_rate": 1.52912019826518e-05,
"loss": 1.1737814903259278,
"mean_token_accuracy": 0.765420364588499,
"num_tokens": 732904.0,
"step": 280
},
{
"entropy": 1.1397546224296093,
"epoch": 0.32384142936906757,
"grad_norm": 3.5625,
"learning_rate": 1.5043370508054524e-05,
"loss": 1.2469436645507812,
"mean_token_accuracy": 0.7499822400510311,
"num_tokens": 760829.0,
"step": 290
},
{
"entropy": 1.0366052724421024,
"epoch": 0.33500837520938026,
"grad_norm": 3.84375,
"learning_rate": 1.4795539033457252e-05,
"loss": 1.140453815460205,
"mean_token_accuracy": 0.7735538497567177,
"num_tokens": 785442.0,
"step": 300
},
{
"entropy": 1.1235052689909935,
"epoch": 0.3461753210496929,
"grad_norm": 3.21875,
"learning_rate": 1.4547707558859976e-05,
"loss": 1.23864803314209,
"mean_token_accuracy": 0.7578027009963989,
"num_tokens": 813321.0,
"step": 310
},
{
"entropy": 1.0663026701658964,
"epoch": 0.3573422668900056,
"grad_norm": 3.296875,
"learning_rate": 1.4299876084262703e-05,
"loss": 1.1644706726074219,
"mean_token_accuracy": 0.7657143622636795,
"num_tokens": 840571.0,
"step": 320
},
{
"entropy": 1.1613866232335568,
"epoch": 0.3685092127303183,
"grad_norm": 3.296875,
"learning_rate": 1.4052044609665429e-05,
"loss": 1.215484046936035,
"mean_token_accuracy": 0.7551229789853096,
"num_tokens": 868204.0,
"step": 330
},
{
"entropy": 1.038713937997818,
"epoch": 0.3796761585706309,
"grad_norm": 3.609375,
"learning_rate": 1.3804213135068155e-05,
"loss": 1.133761501312256,
"mean_token_accuracy": 0.7695340342819691,
"num_tokens": 893234.0,
"step": 340
},
{
"entropy": 1.117867962270975,
"epoch": 0.3908431044109436,
"grad_norm": 3.359375,
"learning_rate": 1.355638166047088e-05,
"loss": 1.2365485191345216,
"mean_token_accuracy": 0.751798415929079,
"num_tokens": 920370.0,
"step": 350
},
{
"entropy": 1.066711399704218,
"epoch": 0.4020100502512563,
"grad_norm": 3.25,
"learning_rate": 1.3308550185873608e-05,
"loss": 1.149217128753662,
"mean_token_accuracy": 0.7712466239929199,
"num_tokens": 944799.0,
"step": 360
},
{
"entropy": 1.09353599101305,
"epoch": 0.41317699609156894,
"grad_norm": 3.640625,
"learning_rate": 1.3060718711276332e-05,
"loss": 1.1921247482299804,
"mean_token_accuracy": 0.7622878901660443,
"num_tokens": 970357.0,
"step": 370
},
{
"entropy": 1.0636055015027523,
"epoch": 0.42434394193188163,
"grad_norm": 3.40625,
"learning_rate": 1.281288723667906e-05,
"loss": 1.1449426651000976,
"mean_token_accuracy": 0.7751508951187134,
"num_tokens": 995627.0,
"step": 380
},
{
"entropy": 1.0997799094766378,
"epoch": 0.4355108877721943,
"grad_norm": 3.46875,
"learning_rate": 1.2565055762081787e-05,
"loss": 1.1890180587768555,
"mean_token_accuracy": 0.7632672250270843,
"num_tokens": 1021258.0,
"step": 390
},
{
"entropy": 1.0799225345253944,
"epoch": 0.44667783361250696,
"grad_norm": 3.328125,
"learning_rate": 1.231722428748451e-05,
"loss": 1.1613880157470704,
"mean_token_accuracy": 0.7609394922852516,
"num_tokens": 1048009.0,
"step": 400
},
{
"entropy": 1.0300600126385688,
"epoch": 0.45784477945281965,
"grad_norm": 3.296875,
"learning_rate": 1.2069392812887238e-05,
"loss": 1.1121676445007325,
"mean_token_accuracy": 0.7761823385953903,
"num_tokens": 1072790.0,
"step": 410
},
{
"entropy": 1.03407681286335,
"epoch": 0.46901172529313234,
"grad_norm": 3.421875,
"learning_rate": 1.1821561338289964e-05,
"loss": 1.1337100982666015,
"mean_token_accuracy": 0.779456903040409,
"num_tokens": 1096424.0,
"step": 420
},
{
"entropy": 1.0816764250397681,
"epoch": 0.480178671133445,
"grad_norm": 3.09375,
"learning_rate": 1.1573729863692691e-05,
"loss": 1.168564796447754,
"mean_token_accuracy": 0.7695191375911236,
"num_tokens": 1121279.0,
"step": 430
},
{
"entropy": 1.0950494274497031,
"epoch": 0.49134561697375767,
"grad_norm": 3.671875,
"learning_rate": 1.1325898389095415e-05,
"loss": 1.220743751525879,
"mean_token_accuracy": 0.7663791351020336,
"num_tokens": 1146975.0,
"step": 440
},
{
"entropy": 1.0629482321441173,
"epoch": 0.5025125628140703,
"grad_norm": 3.359375,
"learning_rate": 1.1078066914498143e-05,
"loss": 1.17555513381958,
"mean_token_accuracy": 0.7702355854213238,
"num_tokens": 1171720.0,
"step": 450
},
{
"entropy": 1.0769638925790788,
"epoch": 0.513679508654383,
"grad_norm": 3.203125,
"learning_rate": 1.083023543990087e-05,
"loss": 1.1584683418273927,
"mean_token_accuracy": 0.7703170344233513,
"num_tokens": 1197191.0,
"step": 460
},
{
"entropy": 1.0924316361546516,
"epoch": 0.5248464544946957,
"grad_norm": 3.53125,
"learning_rate": 1.0582403965303594e-05,
"loss": 1.197894287109375,
"mean_token_accuracy": 0.7625605218112469,
"num_tokens": 1223732.0,
"step": 470
},
{
"entropy": 1.1760938204824924,
"epoch": 0.5360134003350083,
"grad_norm": 3.21875,
"learning_rate": 1.0334572490706321e-05,
"loss": 1.3036236763000488,
"mean_token_accuracy": 0.7476884454488755,
"num_tokens": 1252654.0,
"step": 480
},
{
"entropy": 1.1041141584515572,
"epoch": 0.5471803461753211,
"grad_norm": 3.328125,
"learning_rate": 1.0086741016109047e-05,
"loss": 1.1862168312072754,
"mean_token_accuracy": 0.7658242657780647,
"num_tokens": 1278284.0,
"step": 490
},
{
"entropy": 1.0600057408213615,
"epoch": 0.5583472920156337,
"grad_norm": 3.640625,
"learning_rate": 9.838909541511773e-06,
"loss": 1.1444557189941407,
"mean_token_accuracy": 0.7672035470604897,
"num_tokens": 1303786.0,
"step": 500
},
{
"entropy": 1.1602862119674682,
"epoch": 0.5695142378559463,
"grad_norm": 3.546875,
"learning_rate": 9.591078066914498e-06,
"loss": 1.2625015258789063,
"mean_token_accuracy": 0.7455270260572433,
"num_tokens": 1330403.0,
"step": 510
},
{
"entropy": 1.0500171076506377,
"epoch": 0.5806811836962591,
"grad_norm": 3.34375,
"learning_rate": 9.343246592317226e-06,
"loss": 1.1100471496582032,
"mean_token_accuracy": 0.7771873719990253,
"num_tokens": 1355913.0,
"step": 520
},
{
"entropy": 1.0421214148402214,
"epoch": 0.5918481295365717,
"grad_norm": 3.421875,
"learning_rate": 9.095415117719952e-06,
"loss": 1.1434844970703124,
"mean_token_accuracy": 0.7771047562360763,
"num_tokens": 1381048.0,
"step": 530
},
{
"entropy": 1.1398710921406745,
"epoch": 0.6030150753768844,
"grad_norm": 3.765625,
"learning_rate": 8.847583643122677e-06,
"loss": 1.237742042541504,
"mean_token_accuracy": 0.7521290302276611,
"num_tokens": 1407965.0,
"step": 540
},
{
"entropy": 1.0272238925099373,
"epoch": 0.6141820212171971,
"grad_norm": 3.28125,
"learning_rate": 8.599752168525403e-06,
"loss": 1.1173413276672364,
"mean_token_accuracy": 0.7779941506683826,
"num_tokens": 1432806.0,
"step": 550
},
{
"entropy": 1.0616241727024316,
"epoch": 0.6253489670575098,
"grad_norm": 3.15625,
"learning_rate": 8.351920693928129e-06,
"loss": 1.1724609375,
"mean_token_accuracy": 0.7691180802881717,
"num_tokens": 1458745.0,
"step": 560
},
{
"entropy": 1.1184002067893744,
"epoch": 0.6365159128978225,
"grad_norm": 3.65625,
"learning_rate": 8.104089219330854e-06,
"loss": 1.228511905670166,
"mean_token_accuracy": 0.7584543086588382,
"num_tokens": 1485413.0,
"step": 570
},
{
"entropy": 1.123507371917367,
"epoch": 0.6476828587381351,
"grad_norm": 3.4375,
"learning_rate": 7.856257744733582e-06,
"loss": 1.2577102661132813,
"mean_token_accuracy": 0.7598744049668312,
"num_tokens": 1513305.0,
"step": 580
},
{
"entropy": 1.0770755916833878,
"epoch": 0.6588498045784478,
"grad_norm": 3.28125,
"learning_rate": 7.608426270136308e-06,
"loss": 1.1567678451538086,
"mean_token_accuracy": 0.7634399652481079,
"num_tokens": 1539813.0,
"step": 590
},
{
"entropy": 0.9889072474092245,
"epoch": 0.6700167504187605,
"grad_norm": 3.65625,
"learning_rate": 7.360594795539034e-06,
"loss": 1.0486254692077637,
"mean_token_accuracy": 0.7880329728126526,
"num_tokens": 1563321.0,
"step": 600
},
{
"entropy": 1.0968003824353219,
"epoch": 0.6811836962590732,
"grad_norm": 3.28125,
"learning_rate": 7.11276332094176e-06,
"loss": 1.1853549003601074,
"mean_token_accuracy": 0.7634060740470886,
"num_tokens": 1590121.0,
"step": 610
},
{
"entropy": 1.0346317429095506,
"epoch": 0.6923506420993858,
"grad_norm": 3.078125,
"learning_rate": 6.8649318463444856e-06,
"loss": 1.09486722946167,
"mean_token_accuracy": 0.7758483737707138,
"num_tokens": 1616645.0,
"step": 620
},
{
"entropy": 1.1052446074783802,
"epoch": 0.7035175879396985,
"grad_norm": 4.09375,
"learning_rate": 6.617100371747213e-06,
"loss": 1.18992280960083,
"mean_token_accuracy": 0.7618899635970593,
"num_tokens": 1642059.0,
"step": 630
},
{
"entropy": 1.0749453879892825,
"epoch": 0.7146845337800112,
"grad_norm": 3.4375,
"learning_rate": 6.369268897149939e-06,
"loss": 1.1491153717041016,
"mean_token_accuracy": 0.7696318380534649,
"num_tokens": 1666939.0,
"step": 640
},
{
"entropy": 1.0601326443254948,
"epoch": 0.7258514796203238,
"grad_norm": 3.640625,
"learning_rate": 6.121437422552665e-06,
"loss": 1.1444756507873535,
"mean_token_accuracy": 0.7738051861524582,
"num_tokens": 1692634.0,
"step": 650
},
{
"entropy": 1.1047037810087204,
"epoch": 0.7370184254606366,
"grad_norm": 3.53125,
"learning_rate": 5.873605947955391e-06,
"loss": 1.2263466835021972,
"mean_token_accuracy": 0.7588796854019165,
"num_tokens": 1720055.0,
"step": 660
},
{
"entropy": 1.0764735087752342,
"epoch": 0.7481853713009492,
"grad_norm": 3.40625,
"learning_rate": 5.625774473358117e-06,
"loss": 1.2022334098815919,
"mean_token_accuracy": 0.7653821043670177,
"num_tokens": 1746264.0,
"step": 670
},
{
"entropy": 1.0576500050723552,
"epoch": 0.7593523171412618,
"grad_norm": 3.21875,
"learning_rate": 5.377942998760843e-06,
"loss": 1.1265974998474122,
"mean_token_accuracy": 0.7686478443443775,
"num_tokens": 1773301.0,
"step": 680
},
{
"entropy": 1.1367420602589846,
"epoch": 0.7705192629815746,
"grad_norm": 3.4375,
"learning_rate": 5.130111524163569e-06,
"loss": 1.2707669258117675,
"mean_token_accuracy": 0.7557471729815006,
"num_tokens": 1800329.0,
"step": 690
},
{
"entropy": 1.0998500097543,
"epoch": 0.7816862088218872,
"grad_norm": 3.875,
"learning_rate": 4.8822800495662955e-06,
"loss": 1.184847068786621,
"mean_token_accuracy": 0.7647615008056163,
"num_tokens": 1825475.0,
"step": 700
},
{
"entropy": 1.1467237778007984,
"epoch": 0.7928531546621999,
"grad_norm": 3.171875,
"learning_rate": 4.634448574969021e-06,
"loss": 1.2255634307861327,
"mean_token_accuracy": 0.7532035551965237,
"num_tokens": 1852394.0,
"step": 710
},
{
"entropy": 1.079410395771265,
"epoch": 0.8040201005025126,
"grad_norm": 3.59375,
"learning_rate": 4.386617100371748e-06,
"loss": 1.2125642776489258,
"mean_token_accuracy": 0.767810083925724,
"num_tokens": 1878744.0,
"step": 720
},
{
"entropy": 1.0579048234969377,
"epoch": 0.8151870463428252,
"grad_norm": 3.296875,
"learning_rate": 4.1387856257744735e-06,
"loss": 1.1596202850341797,
"mean_token_accuracy": 0.7713351771235466,
"num_tokens": 1903148.0,
"step": 730
},
{
"entropy": 1.0731349058449269,
"epoch": 0.8263539921831379,
"grad_norm": 3.328125,
"learning_rate": 3.8909541511772e-06,
"loss": 1.1340813636779785,
"mean_token_accuracy": 0.7696133933961391,
"num_tokens": 1928626.0,
"step": 740
},
{
"entropy": 1.1284345269203186,
"epoch": 0.8375209380234506,
"grad_norm": 3.625,
"learning_rate": 3.643122676579926e-06,
"loss": 1.2018820762634277,
"mean_token_accuracy": 0.7566148206591606,
"num_tokens": 1955732.0,
"step": 750
},
{
"entropy": 1.1177599750459195,
"epoch": 0.8486878838637633,
"grad_norm": 3.703125,
"learning_rate": 3.3952912019826523e-06,
"loss": 1.2435114860534668,
"mean_token_accuracy": 0.7585679024457932,
"num_tokens": 1981894.0,
"step": 760
},
{
"entropy": 1.0989192590117454,
"epoch": 0.8598548297040759,
"grad_norm": 3.40625,
"learning_rate": 3.147459727385378e-06,
"loss": 1.1960742950439454,
"mean_token_accuracy": 0.7629640743136406,
"num_tokens": 2008438.0,
"step": 770
},
{
"entropy": 1.0289450511336327,
"epoch": 0.8710217755443886,
"grad_norm": 3.453125,
"learning_rate": 2.899628252788104e-06,
"loss": 1.112326717376709,
"mean_token_accuracy": 0.7783081293106079,
"num_tokens": 2033527.0,
"step": 780
},
{
"entropy": 1.1425920329988002,
"epoch": 0.8821887213847013,
"grad_norm": 3.453125,
"learning_rate": 2.6517967781908303e-06,
"loss": 1.2318533897399901,
"mean_token_accuracy": 0.7519856467843056,
"num_tokens": 2060494.0,
"step": 790
},
{
"entropy": 1.1216130927205086,
"epoch": 0.8933556672250139,
"grad_norm": 3.671875,
"learning_rate": 2.4039653035935564e-06,
"loss": 1.195895004272461,
"mean_token_accuracy": 0.7575728356838226,
"num_tokens": 2086503.0,
"step": 800
},
{
"entropy": 1.1177167922258378,
"epoch": 0.9045226130653267,
"grad_norm": 3.765625,
"learning_rate": 2.1561338289962826e-06,
"loss": 1.180656909942627,
"mean_token_accuracy": 0.7616930149495602,
"num_tokens": 2112895.0,
"step": 810
},
{
"entropy": 1.0543908223509788,
"epoch": 0.9156895589056393,
"grad_norm": 3.65625,
"learning_rate": 1.908302354399009e-06,
"loss": 1.1741219520568849,
"mean_token_accuracy": 0.7708107247948647,
"num_tokens": 2138001.0,
"step": 820
},
{
"entropy": 1.087718739360571,
"epoch": 0.9268565047459519,
"grad_norm": 3.28125,
"learning_rate": 1.6604708798017348e-06,
"loss": 1.177952480316162,
"mean_token_accuracy": 0.7635545134544373,
"num_tokens": 2164192.0,
"step": 830
},
{
"entropy": 1.060328460112214,
"epoch": 0.9380234505862647,
"grad_norm": 3.71875,
"learning_rate": 1.4126394052044612e-06,
"loss": 1.1673462867736817,
"mean_token_accuracy": 0.7744978621602059,
"num_tokens": 2189210.0,
"step": 840
},
{
"entropy": 1.0364069953560828,
"epoch": 0.9491903964265773,
"grad_norm": 3.484375,
"learning_rate": 1.1648079306071871e-06,
"loss": 1.1158721923828125,
"mean_token_accuracy": 0.7778892047703266,
"num_tokens": 2214446.0,
"step": 850
},
{
"entropy": 1.0322446286678315,
"epoch": 0.96035734226689,
"grad_norm": 3.015625,
"learning_rate": 9.169764560099133e-07,
"loss": 1.0796822547912597,
"mean_token_accuracy": 0.7774909734725952,
"num_tokens": 2239557.0,
"step": 860
},
{
"entropy": 1.1237488869577645,
"epoch": 0.9715242881072027,
"grad_norm": 3.265625,
"learning_rate": 6.691449814126394e-07,
"loss": 1.2529041290283203,
"mean_token_accuracy": 0.7569354966282844,
"num_tokens": 2266609.0,
"step": 870
},
{
"entropy": 1.02969014570117,
"epoch": 0.9826912339475153,
"grad_norm": 3.265625,
"learning_rate": 4.213135068153656e-07,
"loss": 1.1265899658203125,
"mean_token_accuracy": 0.7792067192494869,
"num_tokens": 2291191.0,
"step": 880
},
{
"entropy": 1.0750355511903762,
"epoch": 0.993858179787828,
"grad_norm": 3.453125,
"learning_rate": 1.7348203221809172e-07,
"loss": 1.143712043762207,
"mean_token_accuracy": 0.7723280422389507,
"num_tokens": 2316691.0,
"step": 890
}
],
"logging_steps": 10,
"max_steps": 896,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.4891590857728e+16,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}