1035 lines
27 KiB
JSON
1035 lines
27 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 0.035640459049112554,
|
|
"eval_steps": 500,
|
|
"global_step": 500,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 10.742571830749512,
|
|
"epoch": 0.0003564045904911255,
|
|
"grad_norm": 5.375,
|
|
"learning_rate": 2e-06,
|
|
"loss": 10.7796,
|
|
"mean_token_accuracy": 0.0001526242063846439,
|
|
"num_tokens": 11399.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 10.742592334747314,
|
|
"epoch": 0.000712809180982251,
|
|
"grad_norm": 5.65625,
|
|
"learning_rate": 4.5e-06,
|
|
"loss": 10.7732,
|
|
"mean_token_accuracy": 0.00015220778295770286,
|
|
"num_tokens": 22686.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 10.742580223083497,
|
|
"epoch": 0.0010692137714733766,
|
|
"grad_norm": 5.28125,
|
|
"learning_rate": 7e-06,
|
|
"loss": 10.7223,
|
|
"mean_token_accuracy": 0.0,
|
|
"num_tokens": 32728.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 10.742625427246093,
|
|
"epoch": 0.001425618361964502,
|
|
"grad_norm": 5.25,
|
|
"learning_rate": 9.5e-06,
|
|
"loss": 10.6798,
|
|
"mean_token_accuracy": 0.0005484026798512787,
|
|
"num_tokens": 42808.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 10.742498874664307,
|
|
"epoch": 0.0017820229524556277,
|
|
"grad_norm": 4.75,
|
|
"learning_rate": 1.2e-05,
|
|
"loss": 10.5751,
|
|
"mean_token_accuracy": 0.006744108803104609,
|
|
"num_tokens": 54058.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 10.742173194885254,
|
|
"epoch": 0.002138427542946753,
|
|
"grad_norm": 3.96875,
|
|
"learning_rate": 1.4500000000000002e-05,
|
|
"loss": 10.4546,
|
|
"mean_token_accuracy": 0.025261138379573823,
|
|
"num_tokens": 65338.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 10.741145706176757,
|
|
"epoch": 0.0024948321334378786,
|
|
"grad_norm": 3.9375,
|
|
"learning_rate": 1.7000000000000003e-05,
|
|
"loss": 10.2901,
|
|
"mean_token_accuracy": 0.034458070248365405,
|
|
"num_tokens": 76598.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 10.738759613037109,
|
|
"epoch": 0.002851236723929004,
|
|
"grad_norm": 2.65625,
|
|
"learning_rate": 1.95e-05,
|
|
"loss": 10.1426,
|
|
"mean_token_accuracy": 0.039705483429133895,
|
|
"num_tokens": 87364.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 10.735179233551026,
|
|
"epoch": 0.00320764131442013,
|
|
"grad_norm": 2.359375,
|
|
"learning_rate": 2.2e-05,
|
|
"loss": 10.0394,
|
|
"mean_token_accuracy": 0.04000021629035473,
|
|
"num_tokens": 99019.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 10.732727909088135,
|
|
"epoch": 0.0035640459049112554,
|
|
"grad_norm": 2.171875,
|
|
"learning_rate": 2.4500000000000003e-05,
|
|
"loss": 9.9672,
|
|
"mean_token_accuracy": 0.04283946715295315,
|
|
"num_tokens": 111087.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 10.73162260055542,
|
|
"epoch": 0.00392045049540238,
|
|
"grad_norm": 2.140625,
|
|
"learning_rate": 2.7e-05,
|
|
"loss": 9.9085,
|
|
"mean_token_accuracy": 0.03926678970456123,
|
|
"num_tokens": 123401.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 10.730762577056884,
|
|
"epoch": 0.004276855085893506,
|
|
"grad_norm": 2.171875,
|
|
"learning_rate": 2.95e-05,
|
|
"loss": 9.8396,
|
|
"mean_token_accuracy": 0.04287007227540016,
|
|
"num_tokens": 135554.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 10.729378986358643,
|
|
"epoch": 0.004633259676384632,
|
|
"grad_norm": 2.09375,
|
|
"learning_rate": 3.2e-05,
|
|
"loss": 9.7598,
|
|
"mean_token_accuracy": 0.0466454017907381,
|
|
"num_tokens": 146700.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 10.726875305175781,
|
|
"epoch": 0.004989664266875757,
|
|
"grad_norm": 1.9453125,
|
|
"learning_rate": 3.4500000000000005e-05,
|
|
"loss": 9.7227,
|
|
"mean_token_accuracy": 0.041810817271471026,
|
|
"num_tokens": 157606.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 10.724038028717041,
|
|
"epoch": 0.005346068857366883,
|
|
"grad_norm": 1.9453125,
|
|
"learning_rate": 3.7e-05,
|
|
"loss": 9.664,
|
|
"mean_token_accuracy": 0.04535525776445866,
|
|
"num_tokens": 168705.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 10.720051860809326,
|
|
"epoch": 0.005702473447858008,
|
|
"grad_norm": 2.09375,
|
|
"learning_rate": 3.95e-05,
|
|
"loss": 9.6147,
|
|
"mean_token_accuracy": 0.04609923996031284,
|
|
"num_tokens": 181497.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 10.71345911026001,
|
|
"epoch": 0.006058878038349134,
|
|
"grad_norm": 1.9609375,
|
|
"learning_rate": 4.2000000000000004e-05,
|
|
"loss": 9.5166,
|
|
"mean_token_accuracy": 0.0461752537637949,
|
|
"num_tokens": 192991.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 10.705201339721679,
|
|
"epoch": 0.00641528262884026,
|
|
"grad_norm": 2.109375,
|
|
"learning_rate": 4.45e-05,
|
|
"loss": 9.3949,
|
|
"mean_token_accuracy": 0.049161479249596594,
|
|
"num_tokens": 203969.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 10.695504951477051,
|
|
"epoch": 0.006771687219331385,
|
|
"grad_norm": 1.8984375,
|
|
"learning_rate": 4.7000000000000004e-05,
|
|
"loss": 9.3681,
|
|
"mean_token_accuracy": 0.049966185539960864,
|
|
"num_tokens": 215809.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 10.68418607711792,
|
|
"epoch": 0.007128091809822511,
|
|
"grad_norm": 1.796875,
|
|
"learning_rate": 4.9500000000000004e-05,
|
|
"loss": 9.316,
|
|
"mean_token_accuracy": 0.048291167616844176,
|
|
"num_tokens": 227826.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 10.668262958526611,
|
|
"epoch": 0.007484496400313636,
|
|
"grad_norm": 1.9609375,
|
|
"learning_rate": 5.2e-05,
|
|
"loss": 9.1803,
|
|
"mean_token_accuracy": 0.058137640729546546,
|
|
"num_tokens": 240073.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 10.644538402557373,
|
|
"epoch": 0.00784090099080476,
|
|
"grad_norm": 1.96875,
|
|
"learning_rate": 5.45e-05,
|
|
"loss": 9.0385,
|
|
"mean_token_accuracy": 0.057943309843540194,
|
|
"num_tokens": 251073.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 10.616683769226075,
|
|
"epoch": 0.008197305581295887,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 5.7e-05,
|
|
"loss": 9.0264,
|
|
"mean_token_accuracy": 0.05736844353377819,
|
|
"num_tokens": 264607.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 10.58455696105957,
|
|
"epoch": 0.008553710171787013,
|
|
"grad_norm": 1.875,
|
|
"learning_rate": 5.9499999999999996e-05,
|
|
"loss": 8.7984,
|
|
"mean_token_accuracy": 0.06613890007138253,
|
|
"num_tokens": 275688.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 10.523236083984376,
|
|
"epoch": 0.008910114762278138,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 6.2e-05,
|
|
"loss": 8.652,
|
|
"mean_token_accuracy": 0.06381725408136844,
|
|
"num_tokens": 287024.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 10.454036426544189,
|
|
"epoch": 0.009266519352769264,
|
|
"grad_norm": 1.828125,
|
|
"learning_rate": 6.450000000000001e-05,
|
|
"loss": 8.5662,
|
|
"mean_token_accuracy": 0.06661000251770019,
|
|
"num_tokens": 297605.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 10.365349960327148,
|
|
"epoch": 0.009622923943260388,
|
|
"grad_norm": 1.828125,
|
|
"learning_rate": 6.7e-05,
|
|
"loss": 8.4279,
|
|
"mean_token_accuracy": 0.06779800169169903,
|
|
"num_tokens": 307956.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 10.26084508895874,
|
|
"epoch": 0.009979328533751514,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 6.950000000000001e-05,
|
|
"loss": 8.3001,
|
|
"mean_token_accuracy": 0.06663309819996358,
|
|
"num_tokens": 318724.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 10.160690593719483,
|
|
"epoch": 0.01033573312424264,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 7.2e-05,
|
|
"loss": 8.1425,
|
|
"mean_token_accuracy": 0.07099423781037331,
|
|
"num_tokens": 330488.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 10.021271991729737,
|
|
"epoch": 0.010692137714733766,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 7.45e-05,
|
|
"loss": 8.1226,
|
|
"mean_token_accuracy": 0.07147609815001488,
|
|
"num_tokens": 343057.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 9.84426851272583,
|
|
"epoch": 0.011048542305224892,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 7.7e-05,
|
|
"loss": 7.922,
|
|
"mean_token_accuracy": 0.07516647689044476,
|
|
"num_tokens": 355224.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 9.662067031860351,
|
|
"epoch": 0.011404946895716016,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 7.950000000000001e-05,
|
|
"loss": 7.8644,
|
|
"mean_token_accuracy": 0.07227759584784507,
|
|
"num_tokens": 366926.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 9.455039691925048,
|
|
"epoch": 0.011761351486207142,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 8.2e-05,
|
|
"loss": 7.742,
|
|
"mean_token_accuracy": 0.07173869498074055,
|
|
"num_tokens": 378180.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 9.217700099945068,
|
|
"epoch": 0.012117756076698268,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 8.450000000000001e-05,
|
|
"loss": 7.6739,
|
|
"mean_token_accuracy": 0.07917889729142188,
|
|
"num_tokens": 388639.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 8.98402910232544,
|
|
"epoch": 0.012474160667189394,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 8.7e-05,
|
|
"loss": 7.563,
|
|
"mean_token_accuracy": 0.08437970206141472,
|
|
"num_tokens": 398752.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 8.738731479644775,
|
|
"epoch": 0.01283056525768052,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 8.95e-05,
|
|
"loss": 7.4995,
|
|
"mean_token_accuracy": 0.07861107215285301,
|
|
"num_tokens": 411341.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 8.582833385467529,
|
|
"epoch": 0.013186969848171644,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 9.2e-05,
|
|
"loss": 7.4019,
|
|
"mean_token_accuracy": 0.07919293940067292,
|
|
"num_tokens": 421736.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 8.410860538482666,
|
|
"epoch": 0.01354337443866277,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 9.45e-05,
|
|
"loss": 7.4428,
|
|
"mean_token_accuracy": 0.08342698290944099,
|
|
"num_tokens": 432934.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 8.250172996520996,
|
|
"epoch": 0.013899779029153896,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 9.7e-05,
|
|
"loss": 7.3743,
|
|
"mean_token_accuracy": 0.08416533321142197,
|
|
"num_tokens": 442929.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 8.198361492156982,
|
|
"epoch": 0.014256183619645021,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 9.95e-05,
|
|
"loss": 7.3499,
|
|
"mean_token_accuracy": 0.08039835765957833,
|
|
"num_tokens": 455544.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 8.08715353012085,
|
|
"epoch": 0.014612588210136147,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000102,
|
|
"loss": 7.2678,
|
|
"mean_token_accuracy": 0.08803733438253403,
|
|
"num_tokens": 466476.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 8.042504119873048,
|
|
"epoch": 0.014968992800627271,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00010449999999999999,
|
|
"loss": 7.2552,
|
|
"mean_token_accuracy": 0.08520074412226677,
|
|
"num_tokens": 477149.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 7.974717617034912,
|
|
"epoch": 0.015325397391118397,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000107,
|
|
"loss": 7.3936,
|
|
"mean_token_accuracy": 0.0847919188439846,
|
|
"num_tokens": 489684.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 7.970945692062378,
|
|
"epoch": 0.01568180198160952,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0001095,
|
|
"loss": 7.32,
|
|
"mean_token_accuracy": 0.08788989782333374,
|
|
"num_tokens": 500724.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 7.915714168548584,
|
|
"epoch": 0.016038206572100647,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000112,
|
|
"loss": 7.1834,
|
|
"mean_token_accuracy": 0.09220796525478363,
|
|
"num_tokens": 511301.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 7.900463056564331,
|
|
"epoch": 0.016394611162591773,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0001145,
|
|
"loss": 7.2187,
|
|
"mean_token_accuracy": 0.08324612528085709,
|
|
"num_tokens": 522925.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 7.857335376739502,
|
|
"epoch": 0.0167510157530829,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00011700000000000001,
|
|
"loss": 7.2262,
|
|
"mean_token_accuracy": 0.09082898795604706,
|
|
"num_tokens": 533742.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 7.882049703598023,
|
|
"epoch": 0.017107420343574025,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00011949999999999999,
|
|
"loss": 7.1824,
|
|
"mean_token_accuracy": 0.0936901956796646,
|
|
"num_tokens": 545526.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 7.793568754196167,
|
|
"epoch": 0.01746382493406515,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.000122,
|
|
"loss": 7.1257,
|
|
"mean_token_accuracy": 0.09565059095621109,
|
|
"num_tokens": 555735.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 7.741059350967407,
|
|
"epoch": 0.017820229524556277,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0001245,
|
|
"loss": 7.2118,
|
|
"mean_token_accuracy": 0.09219442456960678,
|
|
"num_tokens": 568443.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 7.821925401687622,
|
|
"epoch": 0.018176634115047403,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.000127,
|
|
"loss": 7.1074,
|
|
"mean_token_accuracy": 0.09640756845474244,
|
|
"num_tokens": 579091.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 7.703673696517944,
|
|
"epoch": 0.01853303870553853,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0001295,
|
|
"loss": 7.0316,
|
|
"mean_token_accuracy": 0.09788540452718734,
|
|
"num_tokens": 591683.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 7.649093818664551,
|
|
"epoch": 0.018889443296029654,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000132,
|
|
"loss": 7.1601,
|
|
"mean_token_accuracy": 0.09608315378427505,
|
|
"num_tokens": 603464.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 7.753079223632812,
|
|
"epoch": 0.019245847886520777,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00013450000000000002,
|
|
"loss": 7.2118,
|
|
"mean_token_accuracy": 0.0977549560368061,
|
|
"num_tokens": 615626.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 7.689573907852173,
|
|
"epoch": 0.019602252477011903,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00013700000000000002,
|
|
"loss": 7.1333,
|
|
"mean_token_accuracy": 0.09726834744215011,
|
|
"num_tokens": 627270.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 7.662051963806152,
|
|
"epoch": 0.01995865706750303,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0001395,
|
|
"loss": 7.0505,
|
|
"mean_token_accuracy": 0.09889725744724273,
|
|
"num_tokens": 638403.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 7.641796112060547,
|
|
"epoch": 0.020315061657994155,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00014199999999999998,
|
|
"loss": 7.0687,
|
|
"mean_token_accuracy": 0.10083996653556823,
|
|
"num_tokens": 650046.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 7.634785175323486,
|
|
"epoch": 0.02067146624848528,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0001445,
|
|
"loss": 6.9997,
|
|
"mean_token_accuracy": 0.10420416370034218,
|
|
"num_tokens": 659818.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 7.5922698974609375,
|
|
"epoch": 0.021027870838976406,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000147,
|
|
"loss": 7.0209,
|
|
"mean_token_accuracy": 0.10451438650488853,
|
|
"num_tokens": 672404.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 7.534389448165894,
|
|
"epoch": 0.021384275429467532,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0001495,
|
|
"loss": 6.9976,
|
|
"mean_token_accuracy": 0.10352390706539154,
|
|
"num_tokens": 684048.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 7.588808202743531,
|
|
"epoch": 0.021740680019958658,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000152,
|
|
"loss": 7.0077,
|
|
"mean_token_accuracy": 0.10355912148952484,
|
|
"num_tokens": 694590.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 7.526580429077148,
|
|
"epoch": 0.022097084610449784,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00015450000000000001,
|
|
"loss": 6.9348,
|
|
"mean_token_accuracy": 0.10375382453203201,
|
|
"num_tokens": 706949.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 7.53011155128479,
|
|
"epoch": 0.02245348920094091,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000157,
|
|
"loss": 7.0441,
|
|
"mean_token_accuracy": 0.10697530284523964,
|
|
"num_tokens": 717400.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 7.550104141235352,
|
|
"epoch": 0.022809893791432032,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0001595,
|
|
"loss": 6.9815,
|
|
"mean_token_accuracy": 0.10357886925339699,
|
|
"num_tokens": 728842.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 7.465000009536743,
|
|
"epoch": 0.023166298381923158,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000162,
|
|
"loss": 6.9683,
|
|
"mean_token_accuracy": 0.10274564027786255,
|
|
"num_tokens": 740598.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 7.529222631454468,
|
|
"epoch": 0.023522702972414284,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00016450000000000001,
|
|
"loss": 6.9989,
|
|
"mean_token_accuracy": 0.1049557864665985,
|
|
"num_tokens": 752512.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 7.580902624130249,
|
|
"epoch": 0.02387910756290541,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00016700000000000002,
|
|
"loss": 7.0602,
|
|
"mean_token_accuracy": 0.09983156248927116,
|
|
"num_tokens": 764679.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 7.5142491340637205,
|
|
"epoch": 0.024235512153396536,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00016950000000000003,
|
|
"loss": 7.0932,
|
|
"mean_token_accuracy": 0.10753691717982292,
|
|
"num_tokens": 776267.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 7.439674139022827,
|
|
"epoch": 0.02459191674388766,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00017199999999999998,
|
|
"loss": 6.8853,
|
|
"mean_token_accuracy": 0.11588529199361801,
|
|
"num_tokens": 788178.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 7.517330646514893,
|
|
"epoch": 0.024948321334378788,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00017449999999999999,
|
|
"loss": 6.9833,
|
|
"mean_token_accuracy": 0.11000660359859467,
|
|
"num_tokens": 798643.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 7.445536041259766,
|
|
"epoch": 0.025304725924869913,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000177,
|
|
"loss": 6.9894,
|
|
"mean_token_accuracy": 0.10883523225784301,
|
|
"num_tokens": 809448.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 7.333874130249024,
|
|
"epoch": 0.02566113051536104,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0001795,
|
|
"loss": 6.9268,
|
|
"mean_token_accuracy": 0.11306785941123962,
|
|
"num_tokens": 821107.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 7.386691951751709,
|
|
"epoch": 0.02601753510585216,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000182,
|
|
"loss": 6.8761,
|
|
"mean_token_accuracy": 0.11081241220235824,
|
|
"num_tokens": 832800.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 7.474579668045044,
|
|
"epoch": 0.026373939696343288,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0001845,
|
|
"loss": 6.928,
|
|
"mean_token_accuracy": 0.11076254919171333,
|
|
"num_tokens": 845207.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 7.365311479568481,
|
|
"epoch": 0.026730344286834413,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000187,
|
|
"loss": 6.9474,
|
|
"mean_token_accuracy": 0.11366913244128227,
|
|
"num_tokens": 857270.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 7.398762464523315,
|
|
"epoch": 0.02708674887732554,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0001895,
|
|
"loss": 6.8581,
|
|
"mean_token_accuracy": 0.11230278387665749,
|
|
"num_tokens": 867892.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 7.316660690307617,
|
|
"epoch": 0.027443153467816665,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000192,
|
|
"loss": 6.7972,
|
|
"mean_token_accuracy": 0.10899836272001266,
|
|
"num_tokens": 879516.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 7.332602882385254,
|
|
"epoch": 0.02779955805830779,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0001945,
|
|
"loss": 6.7966,
|
|
"mean_token_accuracy": 0.11280329450964928,
|
|
"num_tokens": 889693.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 7.21000304222107,
|
|
"epoch": 0.028155962648798917,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00019700000000000002,
|
|
"loss": 6.8075,
|
|
"mean_token_accuracy": 0.11519677788019181,
|
|
"num_tokens": 901591.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 7.289150762557983,
|
|
"epoch": 0.028512367239290043,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00019950000000000002,
|
|
"loss": 6.7701,
|
|
"mean_token_accuracy": 0.11484072580933571,
|
|
"num_tokens": 912146.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 7.22770209312439,
|
|
"epoch": 0.02886877182978117,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.000202,
|
|
"loss": 6.6398,
|
|
"mean_token_accuracy": 0.12384215593338013,
|
|
"num_tokens": 923219.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 7.202323579788208,
|
|
"epoch": 0.029225176420272295,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00020449999999999998,
|
|
"loss": 6.6816,
|
|
"mean_token_accuracy": 0.12373454198241234,
|
|
"num_tokens": 934330.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 7.256154108047485,
|
|
"epoch": 0.029581581010763417,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000207,
|
|
"loss": 6.7722,
|
|
"mean_token_accuracy": 0.11721484363079071,
|
|
"num_tokens": 944993.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 7.258368110656738,
|
|
"epoch": 0.029937985601254543,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0002095,
|
|
"loss": 6.8156,
|
|
"mean_token_accuracy": 0.11557363644242287,
|
|
"num_tokens": 955746.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 7.2072389125823975,
|
|
"epoch": 0.03029439019174567,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000212,
|
|
"loss": 6.8293,
|
|
"mean_token_accuracy": 0.11993886753916741,
|
|
"num_tokens": 966600.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 7.266004419326782,
|
|
"epoch": 0.030650794782236795,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0002145,
|
|
"loss": 6.805,
|
|
"mean_token_accuracy": 0.1269981436431408,
|
|
"num_tokens": 976984.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 7.150535726547242,
|
|
"epoch": 0.03100719937272792,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00021700000000000002,
|
|
"loss": 6.8464,
|
|
"mean_token_accuracy": 0.11060970276594162,
|
|
"num_tokens": 990221.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 7.21864423751831,
|
|
"epoch": 0.03136360396321904,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0002195,
|
|
"loss": 6.7375,
|
|
"mean_token_accuracy": 0.1192592665553093,
|
|
"num_tokens": 1001583.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 7.220152044296265,
|
|
"epoch": 0.03172000855371017,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000222,
|
|
"loss": 6.677,
|
|
"mean_token_accuracy": 0.12302321866154671,
|
|
"num_tokens": 1012170.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 7.151835870742798,
|
|
"epoch": 0.032076413144201295,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0002245,
|
|
"loss": 6.7166,
|
|
"mean_token_accuracy": 0.11390936076641082,
|
|
"num_tokens": 1022948.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 7.09367880821228,
|
|
"epoch": 0.03243281773469242,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00022700000000000002,
|
|
"loss": 6.7164,
|
|
"mean_token_accuracy": 0.12434423863887786,
|
|
"num_tokens": 1034764.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 7.170623111724853,
|
|
"epoch": 0.03278922232518355,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00022950000000000002,
|
|
"loss": 6.7499,
|
|
"mean_token_accuracy": 0.12258012518286705,
|
|
"num_tokens": 1046485.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 7.13931450843811,
|
|
"epoch": 0.03314562691567467,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00023200000000000003,
|
|
"loss": 6.6814,
|
|
"mean_token_accuracy": 0.11752169504761696,
|
|
"num_tokens": 1057819.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 7.144642114639282,
|
|
"epoch": 0.0335020315061658,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00023449999999999998,
|
|
"loss": 6.734,
|
|
"mean_token_accuracy": 0.12212828546762466,
|
|
"num_tokens": 1068905.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 7.147123908996582,
|
|
"epoch": 0.033858436096656924,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000237,
|
|
"loss": 6.73,
|
|
"mean_token_accuracy": 0.11864650025963783,
|
|
"num_tokens": 1081033.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 7.132015943527222,
|
|
"epoch": 0.03421484068714805,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0002395,
|
|
"loss": 6.7168,
|
|
"mean_token_accuracy": 0.1197434201836586,
|
|
"num_tokens": 1091294.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 6.992530441284179,
|
|
"epoch": 0.034571245277639176,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.000242,
|
|
"loss": 6.6487,
|
|
"mean_token_accuracy": 0.11802349910140038,
|
|
"num_tokens": 1103184.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 7.111927604675293,
|
|
"epoch": 0.0349276498681303,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0002445,
|
|
"loss": 6.7453,
|
|
"mean_token_accuracy": 0.11722799465060234,
|
|
"num_tokens": 1115141.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 7.059013175964355,
|
|
"epoch": 0.03528405445862143,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.000247,
|
|
"loss": 6.6724,
|
|
"mean_token_accuracy": 0.12403023093938828,
|
|
"num_tokens": 1126021.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 7.1118261337280275,
|
|
"epoch": 0.035640459049112554,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0002495,
|
|
"loss": 6.7861,
|
|
"mean_token_accuracy": 0.11621439829468727,
|
|
"num_tokens": 1138198.0,
|
|
"step": 500
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 4000,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 1,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 266147382067200.0,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|