2035 lines
54 KiB
JSON
2035 lines
54 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 0.07128091809822511,
|
|
"eval_steps": 500,
|
|
"global_step": 1000,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 10.692017364501954,
|
|
"epoch": 0.0003564045904911255,
|
|
"grad_norm": 14.125,
|
|
"learning_rate": 2e-06,
|
|
"loss": 10.8367,
|
|
"mean_token_accuracy": 0.0,
|
|
"num_tokens": 11399.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 10.691957569122314,
|
|
"epoch": 0.000712809180982251,
|
|
"grad_norm": 13.625,
|
|
"learning_rate": 4.5e-06,
|
|
"loss": 10.7639,
|
|
"mean_token_accuracy": 6.901310989633202e-05,
|
|
"num_tokens": 22686.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 10.69105806350708,
|
|
"epoch": 0.0010692137714733766,
|
|
"grad_norm": 9.75,
|
|
"learning_rate": 7e-06,
|
|
"loss": 10.4704,
|
|
"mean_token_accuracy": 0.01642136035952717,
|
|
"num_tokens": 32728.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 10.683691692352294,
|
|
"epoch": 0.001425618361964502,
|
|
"grad_norm": 6.34375,
|
|
"learning_rate": 9.5e-06,
|
|
"loss": 10.1573,
|
|
"mean_token_accuracy": 0.035650182887911795,
|
|
"num_tokens": 42808.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 10.64972677230835,
|
|
"epoch": 0.0017820229524556277,
|
|
"grad_norm": 4.0625,
|
|
"learning_rate": 1.2e-05,
|
|
"loss": 9.8635,
|
|
"mean_token_accuracy": 0.035930054076015946,
|
|
"num_tokens": 54058.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 10.611275386810302,
|
|
"epoch": 0.002138427542946753,
|
|
"grad_norm": 3.140625,
|
|
"learning_rate": 1.4500000000000002e-05,
|
|
"loss": 9.7137,
|
|
"mean_token_accuracy": 0.03763993177562952,
|
|
"num_tokens": 65338.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 10.598550796508789,
|
|
"epoch": 0.0024948321334378786,
|
|
"grad_norm": 3.890625,
|
|
"learning_rate": 1.7000000000000003e-05,
|
|
"loss": 9.612,
|
|
"mean_token_accuracy": 0.04252670388668776,
|
|
"num_tokens": 76598.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 10.599444103240966,
|
|
"epoch": 0.002851236723929004,
|
|
"grad_norm": 2.703125,
|
|
"learning_rate": 1.95e-05,
|
|
"loss": 9.5696,
|
|
"mean_token_accuracy": 0.04173162579536438,
|
|
"num_tokens": 87364.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 10.571285438537597,
|
|
"epoch": 0.00320764131442013,
|
|
"grad_norm": 2.59375,
|
|
"learning_rate": 2.2e-05,
|
|
"loss": 9.5333,
|
|
"mean_token_accuracy": 0.040771466493606565,
|
|
"num_tokens": 99019.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 10.56482973098755,
|
|
"epoch": 0.0035640459049112554,
|
|
"grad_norm": 2.5,
|
|
"learning_rate": 2.4500000000000003e-05,
|
|
"loss": 9.5004,
|
|
"mean_token_accuracy": 0.042115325853228566,
|
|
"num_tokens": 111087.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 10.555388832092286,
|
|
"epoch": 0.00392045049540238,
|
|
"grad_norm": 2.53125,
|
|
"learning_rate": 2.7e-05,
|
|
"loss": 9.4487,
|
|
"mean_token_accuracy": 0.046751032769680026,
|
|
"num_tokens": 123401.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 10.569499969482422,
|
|
"epoch": 0.004276855085893506,
|
|
"grad_norm": 2.578125,
|
|
"learning_rate": 2.95e-05,
|
|
"loss": 9.3385,
|
|
"mean_token_accuracy": 0.051391019485890865,
|
|
"num_tokens": 135554.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 10.512379455566407,
|
|
"epoch": 0.004633259676384632,
|
|
"grad_norm": 2.46875,
|
|
"learning_rate": 3.2e-05,
|
|
"loss": 9.2173,
|
|
"mean_token_accuracy": 0.060007892176508905,
|
|
"num_tokens": 146700.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 10.373568439483643,
|
|
"epoch": 0.004989664266875757,
|
|
"grad_norm": 2.3125,
|
|
"learning_rate": 3.4500000000000005e-05,
|
|
"loss": 9.1634,
|
|
"mean_token_accuracy": 0.05574713312089443,
|
|
"num_tokens": 157606.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 10.454727077484131,
|
|
"epoch": 0.005346068857366883,
|
|
"grad_norm": 2.296875,
|
|
"learning_rate": 3.7e-05,
|
|
"loss": 9.0943,
|
|
"mean_token_accuracy": 0.05970448292791843,
|
|
"num_tokens": 168705.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 10.436204051971435,
|
|
"epoch": 0.005702473447858008,
|
|
"grad_norm": 2.59375,
|
|
"learning_rate": 3.95e-05,
|
|
"loss": 9.0076,
|
|
"mean_token_accuracy": 0.06562120430171489,
|
|
"num_tokens": 181497.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 10.350591468811036,
|
|
"epoch": 0.006058878038349134,
|
|
"grad_norm": 2.59375,
|
|
"learning_rate": 4.2000000000000004e-05,
|
|
"loss": 8.8524,
|
|
"mean_token_accuracy": 0.0729046493768692,
|
|
"num_tokens": 192991.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 10.254280471801758,
|
|
"epoch": 0.00641528262884026,
|
|
"grad_norm": 2.703125,
|
|
"learning_rate": 4.45e-05,
|
|
"loss": 8.6787,
|
|
"mean_token_accuracy": 0.0757947500795126,
|
|
"num_tokens": 203969.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 10.204264450073243,
|
|
"epoch": 0.006771687219331385,
|
|
"grad_norm": 2.109375,
|
|
"learning_rate": 4.7000000000000004e-05,
|
|
"loss": 8.6609,
|
|
"mean_token_accuracy": 0.07682550996541977,
|
|
"num_tokens": 215809.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 10.189391613006592,
|
|
"epoch": 0.007128091809822511,
|
|
"grad_norm": 2.109375,
|
|
"learning_rate": 4.9500000000000004e-05,
|
|
"loss": 8.5959,
|
|
"mean_token_accuracy": 0.07614239081740379,
|
|
"num_tokens": 227826.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 10.087896060943603,
|
|
"epoch": 0.007484496400313636,
|
|
"grad_norm": 2.03125,
|
|
"learning_rate": 5.2e-05,
|
|
"loss": 8.4633,
|
|
"mean_token_accuracy": 0.08133391663432121,
|
|
"num_tokens": 240073.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 9.981376838684081,
|
|
"epoch": 0.00784090099080476,
|
|
"grad_norm": 2.21875,
|
|
"learning_rate": 5.45e-05,
|
|
"loss": 8.2916,
|
|
"mean_token_accuracy": 0.08083986043930054,
|
|
"num_tokens": 251073.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 9.942218494415282,
|
|
"epoch": 0.008197305581295887,
|
|
"grad_norm": 1.890625,
|
|
"learning_rate": 5.7e-05,
|
|
"loss": 8.292,
|
|
"mean_token_accuracy": 0.07924356088042259,
|
|
"num_tokens": 264607.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 9.826002407073975,
|
|
"epoch": 0.008553710171787013,
|
|
"grad_norm": 1.8046875,
|
|
"learning_rate": 5.9499999999999996e-05,
|
|
"loss": 8.0674,
|
|
"mean_token_accuracy": 0.08344096019864082,
|
|
"num_tokens": 275688.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 9.725812625885009,
|
|
"epoch": 0.008910114762278138,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 6.2e-05,
|
|
"loss": 7.9033,
|
|
"mean_token_accuracy": 0.08407644256949424,
|
|
"num_tokens": 287024.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 9.538934803009033,
|
|
"epoch": 0.009266519352769264,
|
|
"grad_norm": 1.765625,
|
|
"learning_rate": 6.450000000000001e-05,
|
|
"loss": 7.8564,
|
|
"mean_token_accuracy": 0.08399767056107521,
|
|
"num_tokens": 297605.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 9.370525646209718,
|
|
"epoch": 0.009622923943260388,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 6.7e-05,
|
|
"loss": 7.7135,
|
|
"mean_token_accuracy": 0.08679336085915565,
|
|
"num_tokens": 307956.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 9.153919219970703,
|
|
"epoch": 0.009979328533751514,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 6.950000000000001e-05,
|
|
"loss": 7.5976,
|
|
"mean_token_accuracy": 0.08618754744529725,
|
|
"num_tokens": 318724.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 8.899112701416016,
|
|
"epoch": 0.01033573312424264,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 7.2e-05,
|
|
"loss": 7.4406,
|
|
"mean_token_accuracy": 0.08834938332438469,
|
|
"num_tokens": 330488.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 8.675454139709473,
|
|
"epoch": 0.010692137714733766,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 7.45e-05,
|
|
"loss": 7.5299,
|
|
"mean_token_accuracy": 0.08864943459630012,
|
|
"num_tokens": 343057.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 8.480731201171874,
|
|
"epoch": 0.011048542305224892,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 7.7e-05,
|
|
"loss": 7.3532,
|
|
"mean_token_accuracy": 0.09288429766893387,
|
|
"num_tokens": 355224.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 8.344585990905761,
|
|
"epoch": 0.011404946895716016,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 7.950000000000001e-05,
|
|
"loss": 7.3521,
|
|
"mean_token_accuracy": 0.09180220365524291,
|
|
"num_tokens": 366926.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 8.18641996383667,
|
|
"epoch": 0.011761351486207142,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 8.2e-05,
|
|
"loss": 7.2732,
|
|
"mean_token_accuracy": 0.09202986061573029,
|
|
"num_tokens": 378180.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 8.100344848632812,
|
|
"epoch": 0.012117756076698268,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 8.450000000000001e-05,
|
|
"loss": 7.3021,
|
|
"mean_token_accuracy": 0.09149679765105248,
|
|
"num_tokens": 388639.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 7.991573286056519,
|
|
"epoch": 0.012474160667189394,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 8.7e-05,
|
|
"loss": 7.2275,
|
|
"mean_token_accuracy": 0.09744204580783844,
|
|
"num_tokens": 398752.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 7.88223123550415,
|
|
"epoch": 0.01283056525768052,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 8.95e-05,
|
|
"loss": 7.1954,
|
|
"mean_token_accuracy": 0.09606479555368423,
|
|
"num_tokens": 411341.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 7.8277486801147464,
|
|
"epoch": 0.013186969848171644,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 9.2e-05,
|
|
"loss": 7.1005,
|
|
"mean_token_accuracy": 0.09566677063703537,
|
|
"num_tokens": 421736.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 7.860902547836304,
|
|
"epoch": 0.01354337443866277,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 9.45e-05,
|
|
"loss": 7.1857,
|
|
"mean_token_accuracy": 0.09552413523197174,
|
|
"num_tokens": 432934.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 7.822595310211182,
|
|
"epoch": 0.013899779029153896,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 9.7e-05,
|
|
"loss": 7.12,
|
|
"mean_token_accuracy": 0.10211173966526985,
|
|
"num_tokens": 442929.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 7.693083477020264,
|
|
"epoch": 0.014256183619645021,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 9.95e-05,
|
|
"loss": 7.1199,
|
|
"mean_token_accuracy": 0.0966656155884266,
|
|
"num_tokens": 455544.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 7.67202787399292,
|
|
"epoch": 0.014612588210136147,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.000102,
|
|
"loss": 7.0383,
|
|
"mean_token_accuracy": 0.10238562151789665,
|
|
"num_tokens": 466476.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 7.641747999191284,
|
|
"epoch": 0.014968992800627271,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00010449999999999999,
|
|
"loss": 7.0423,
|
|
"mean_token_accuracy": 0.10611227676272392,
|
|
"num_tokens": 477149.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 7.678851318359375,
|
|
"epoch": 0.015325397391118397,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000107,
|
|
"loss": 7.194,
|
|
"mean_token_accuracy": 0.09881364479660988,
|
|
"num_tokens": 489684.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 7.6810675144195555,
|
|
"epoch": 0.01568180198160952,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0001095,
|
|
"loss": 7.1195,
|
|
"mean_token_accuracy": 0.10285983234643936,
|
|
"num_tokens": 500724.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 7.516607046127319,
|
|
"epoch": 0.016038206572100647,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.000112,
|
|
"loss": 7.0014,
|
|
"mean_token_accuracy": 0.10714144557714463,
|
|
"num_tokens": 511301.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 7.589178037643433,
|
|
"epoch": 0.016394611162591773,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.0001145,
|
|
"loss": 7.0292,
|
|
"mean_token_accuracy": 0.0986006237566471,
|
|
"num_tokens": 522925.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 7.550503349304199,
|
|
"epoch": 0.0167510157530829,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.00011700000000000001,
|
|
"loss": 7.0411,
|
|
"mean_token_accuracy": 0.10731777027249337,
|
|
"num_tokens": 533742.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 7.437931919097901,
|
|
"epoch": 0.017107420343574025,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00011949999999999999,
|
|
"loss": 7.0108,
|
|
"mean_token_accuracy": 0.1048599824309349,
|
|
"num_tokens": 545526.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 7.485028076171875,
|
|
"epoch": 0.01746382493406515,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000122,
|
|
"loss": 6.9512,
|
|
"mean_token_accuracy": 0.10988161414861679,
|
|
"num_tokens": 555735.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 7.441792440414429,
|
|
"epoch": 0.017820229524556277,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0001245,
|
|
"loss": 7.0456,
|
|
"mean_token_accuracy": 0.10132465660572051,
|
|
"num_tokens": 568443.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 7.456151485443115,
|
|
"epoch": 0.018176634115047403,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.000127,
|
|
"loss": 6.9256,
|
|
"mean_token_accuracy": 0.11248807981610298,
|
|
"num_tokens": 579091.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 7.312637805938721,
|
|
"epoch": 0.01853303870553853,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0001295,
|
|
"loss": 6.8611,
|
|
"mean_token_accuracy": 0.10876356959342956,
|
|
"num_tokens": 591683.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 7.3945722579956055,
|
|
"epoch": 0.018889443296029654,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.000132,
|
|
"loss": 6.9957,
|
|
"mean_token_accuracy": 0.10596117228269578,
|
|
"num_tokens": 603464.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 7.438564348220825,
|
|
"epoch": 0.019245847886520777,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00013450000000000002,
|
|
"loss": 7.0678,
|
|
"mean_token_accuracy": 0.104298285394907,
|
|
"num_tokens": 615626.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 7.447065210342407,
|
|
"epoch": 0.019602252477011903,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00013700000000000002,
|
|
"loss": 6.9806,
|
|
"mean_token_accuracy": 0.10557826459407807,
|
|
"num_tokens": 627270.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 7.331842660903931,
|
|
"epoch": 0.01995865706750303,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0001395,
|
|
"loss": 6.8978,
|
|
"mean_token_accuracy": 0.11048185899853706,
|
|
"num_tokens": 638403.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 7.369898748397827,
|
|
"epoch": 0.020315061657994155,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00014199999999999998,
|
|
"loss": 6.9043,
|
|
"mean_token_accuracy": 0.11137154400348663,
|
|
"num_tokens": 650046.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 7.282534790039063,
|
|
"epoch": 0.02067146624848528,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0001445,
|
|
"loss": 6.8625,
|
|
"mean_token_accuracy": 0.11072641685605049,
|
|
"num_tokens": 659818.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 7.2380547523498535,
|
|
"epoch": 0.021027870838976406,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000147,
|
|
"loss": 6.8756,
|
|
"mean_token_accuracy": 0.11218505501747131,
|
|
"num_tokens": 672404.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 7.28413872718811,
|
|
"epoch": 0.021384275429467532,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0001495,
|
|
"loss": 6.8657,
|
|
"mean_token_accuracy": 0.10923274457454682,
|
|
"num_tokens": 684048.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 7.311151695251465,
|
|
"epoch": 0.021740680019958658,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.000152,
|
|
"loss": 6.8738,
|
|
"mean_token_accuracy": 0.10937001630663871,
|
|
"num_tokens": 694590.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 7.160674905776977,
|
|
"epoch": 0.022097084610449784,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00015450000000000001,
|
|
"loss": 6.7966,
|
|
"mean_token_accuracy": 0.1082501120865345,
|
|
"num_tokens": 706949.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 7.300990581512451,
|
|
"epoch": 0.02245348920094091,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000157,
|
|
"loss": 6.9186,
|
|
"mean_token_accuracy": 0.1130599781870842,
|
|
"num_tokens": 717400.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 7.261720275878906,
|
|
"epoch": 0.022809893791432032,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0001595,
|
|
"loss": 6.8517,
|
|
"mean_token_accuracy": 0.11169279888272285,
|
|
"num_tokens": 728842.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 7.1845160007476805,
|
|
"epoch": 0.023166298381923158,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000162,
|
|
"loss": 6.8315,
|
|
"mean_token_accuracy": 0.1084785707294941,
|
|
"num_tokens": 740598.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 7.230294179916382,
|
|
"epoch": 0.023522702972414284,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00016450000000000001,
|
|
"loss": 6.8676,
|
|
"mean_token_accuracy": 0.11259512975811958,
|
|
"num_tokens": 752512.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 7.300836181640625,
|
|
"epoch": 0.02387910756290541,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00016700000000000002,
|
|
"loss": 6.9408,
|
|
"mean_token_accuracy": 0.10492971390485764,
|
|
"num_tokens": 764679.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 7.184459400177002,
|
|
"epoch": 0.024235512153396536,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00016950000000000003,
|
|
"loss": 6.9801,
|
|
"mean_token_accuracy": 0.11560937166213989,
|
|
"num_tokens": 776267.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 7.161315059661865,
|
|
"epoch": 0.02459191674388766,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00017199999999999998,
|
|
"loss": 6.7515,
|
|
"mean_token_accuracy": 0.12069559693336487,
|
|
"num_tokens": 788178.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 7.21292634010315,
|
|
"epoch": 0.024948321334378788,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00017449999999999999,
|
|
"loss": 6.8638,
|
|
"mean_token_accuracy": 0.11443236991763114,
|
|
"num_tokens": 798643.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 7.162191772460938,
|
|
"epoch": 0.025304725924869913,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.000177,
|
|
"loss": 6.8749,
|
|
"mean_token_accuracy": 0.11219770759344101,
|
|
"num_tokens": 809448.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 7.070344543457031,
|
|
"epoch": 0.02566113051536104,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0001795,
|
|
"loss": 6.8172,
|
|
"mean_token_accuracy": 0.11555075868964196,
|
|
"num_tokens": 821107.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 7.131128549575806,
|
|
"epoch": 0.02601753510585216,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.000182,
|
|
"loss": 6.7602,
|
|
"mean_token_accuracy": 0.11315757408738136,
|
|
"num_tokens": 832800.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 7.158021736145019,
|
|
"epoch": 0.026373939696343288,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0001845,
|
|
"loss": 6.811,
|
|
"mean_token_accuracy": 0.11933915168046952,
|
|
"num_tokens": 845207.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 7.099034166336059,
|
|
"epoch": 0.026730344286834413,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000187,
|
|
"loss": 6.8469,
|
|
"mean_token_accuracy": 0.11549493819475173,
|
|
"num_tokens": 857270.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 7.05969123840332,
|
|
"epoch": 0.02708674887732554,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0001895,
|
|
"loss": 6.7642,
|
|
"mean_token_accuracy": 0.11390233710408211,
|
|
"num_tokens": 867892.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 7.056723403930664,
|
|
"epoch": 0.027443153467816665,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000192,
|
|
"loss": 6.6796,
|
|
"mean_token_accuracy": 0.11220178827643394,
|
|
"num_tokens": 879516.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 7.027820062637329,
|
|
"epoch": 0.02779955805830779,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0001945,
|
|
"loss": 6.6856,
|
|
"mean_token_accuracy": 0.11767275109887124,
|
|
"num_tokens": 889693.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 6.93689923286438,
|
|
"epoch": 0.028155962648798917,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00019700000000000002,
|
|
"loss": 6.716,
|
|
"mean_token_accuracy": 0.11856673210859299,
|
|
"num_tokens": 901591.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 7.036142110824585,
|
|
"epoch": 0.028512367239290043,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00019950000000000002,
|
|
"loss": 6.6789,
|
|
"mean_token_accuracy": 0.11616217717528343,
|
|
"num_tokens": 912146.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 6.947995281219482,
|
|
"epoch": 0.02886877182978117,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000202,
|
|
"loss": 6.5378,
|
|
"mean_token_accuracy": 0.12628986611962317,
|
|
"num_tokens": 923219.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 6.915331506729126,
|
|
"epoch": 0.029225176420272295,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00020449999999999998,
|
|
"loss": 6.5891,
|
|
"mean_token_accuracy": 0.1272263564169407,
|
|
"num_tokens": 934330.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 6.956090450286865,
|
|
"epoch": 0.029581581010763417,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000207,
|
|
"loss": 6.6703,
|
|
"mean_token_accuracy": 0.12228544279932976,
|
|
"num_tokens": 944993.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 7.0030059814453125,
|
|
"epoch": 0.029937985601254543,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0002095,
|
|
"loss": 6.7281,
|
|
"mean_token_accuracy": 0.12065548226237297,
|
|
"num_tokens": 955746.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 7.023007392883301,
|
|
"epoch": 0.03029439019174567,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000212,
|
|
"loss": 6.7385,
|
|
"mean_token_accuracy": 0.122479547560215,
|
|
"num_tokens": 966600.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 6.893257761001587,
|
|
"epoch": 0.030650794782236795,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0002145,
|
|
"loss": 6.731,
|
|
"mean_token_accuracy": 0.1273415558040142,
|
|
"num_tokens": 976984.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 7.020415782928467,
|
|
"epoch": 0.03100719937272792,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00021700000000000002,
|
|
"loss": 6.7715,
|
|
"mean_token_accuracy": 0.1136875256896019,
|
|
"num_tokens": 990221.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 6.892011499404907,
|
|
"epoch": 0.03136360396321904,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0002195,
|
|
"loss": 6.6491,
|
|
"mean_token_accuracy": 0.11894271299242973,
|
|
"num_tokens": 1001583.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 6.992098093032837,
|
|
"epoch": 0.03172000855371017,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000222,
|
|
"loss": 6.595,
|
|
"mean_token_accuracy": 0.1258418917655945,
|
|
"num_tokens": 1012170.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 6.916194820404053,
|
|
"epoch": 0.032076413144201295,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0002245,
|
|
"loss": 6.6358,
|
|
"mean_token_accuracy": 0.11565389856696129,
|
|
"num_tokens": 1022948.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 6.822894620895386,
|
|
"epoch": 0.03243281773469242,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00022700000000000002,
|
|
"loss": 6.6369,
|
|
"mean_token_accuracy": 0.12339216992259025,
|
|
"num_tokens": 1034764.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 6.846291399002075,
|
|
"epoch": 0.03278922232518355,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00022950000000000002,
|
|
"loss": 6.6751,
|
|
"mean_token_accuracy": 0.123189727216959,
|
|
"num_tokens": 1046485.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 6.8924657821655275,
|
|
"epoch": 0.03314562691567467,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00023200000000000003,
|
|
"loss": 6.6122,
|
|
"mean_token_accuracy": 0.11978656575083732,
|
|
"num_tokens": 1057819.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 6.885383605957031,
|
|
"epoch": 0.0335020315061658,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00023449999999999998,
|
|
"loss": 6.6677,
|
|
"mean_token_accuracy": 0.1239581860601902,
|
|
"num_tokens": 1068905.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 6.8635218143463135,
|
|
"epoch": 0.033858436096656924,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000237,
|
|
"loss": 6.6536,
|
|
"mean_token_accuracy": 0.12101132348179817,
|
|
"num_tokens": 1081033.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 6.913784456253052,
|
|
"epoch": 0.03421484068714805,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0002395,
|
|
"loss": 6.6395,
|
|
"mean_token_accuracy": 0.12054148092865943,
|
|
"num_tokens": 1091294.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 6.835070037841797,
|
|
"epoch": 0.034571245277639176,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000242,
|
|
"loss": 6.5823,
|
|
"mean_token_accuracy": 0.12020587176084518,
|
|
"num_tokens": 1103184.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 6.747617959976196,
|
|
"epoch": 0.0349276498681303,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0002445,
|
|
"loss": 6.6714,
|
|
"mean_token_accuracy": 0.11630546823143958,
|
|
"num_tokens": 1115141.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 6.877911472320557,
|
|
"epoch": 0.03528405445862143,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000247,
|
|
"loss": 6.594,
|
|
"mean_token_accuracy": 0.12337350100278854,
|
|
"num_tokens": 1126021.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 6.950392246246338,
|
|
"epoch": 0.035640459049112554,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0002495,
|
|
"loss": 6.7084,
|
|
"mean_token_accuracy": 0.11963340565562249,
|
|
"num_tokens": 1138198.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 6.821749448776245,
|
|
"epoch": 0.03599686363960368,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000252,
|
|
"loss": 6.6156,
|
|
"mean_token_accuracy": 0.12002535238862037,
|
|
"num_tokens": 1149477.0,
|
|
"step": 505
|
|
},
|
|
{
|
|
"entropy": 6.788367557525635,
|
|
"epoch": 0.036353268230094805,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0002545,
|
|
"loss": 6.5983,
|
|
"mean_token_accuracy": 0.12122073546051979,
|
|
"num_tokens": 1160088.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 6.818660545349121,
|
|
"epoch": 0.03670967282058593,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000257,
|
|
"loss": 6.5689,
|
|
"mean_token_accuracy": 0.1215900219976902,
|
|
"num_tokens": 1171592.0,
|
|
"step": 515
|
|
},
|
|
{
|
|
"entropy": 6.684890222549439,
|
|
"epoch": 0.03706607741107706,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0002595,
|
|
"loss": 6.4421,
|
|
"mean_token_accuracy": 0.12829117700457573,
|
|
"num_tokens": 1182696.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 6.7838616371154785,
|
|
"epoch": 0.03742248200156818,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.000262,
|
|
"loss": 6.5508,
|
|
"mean_token_accuracy": 0.12244702428579331,
|
|
"num_tokens": 1194334.0,
|
|
"step": 525
|
|
},
|
|
{
|
|
"entropy": 6.795234823226929,
|
|
"epoch": 0.03777888659205931,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00026450000000000003,
|
|
"loss": 6.6407,
|
|
"mean_token_accuracy": 0.12377305775880813,
|
|
"num_tokens": 1206258.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 6.711533164978027,
|
|
"epoch": 0.03813529118255043,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00026700000000000004,
|
|
"loss": 6.5593,
|
|
"mean_token_accuracy": 0.1248534381389618,
|
|
"num_tokens": 1219233.0,
|
|
"step": 535
|
|
},
|
|
{
|
|
"entropy": 6.751263809204102,
|
|
"epoch": 0.038491695773041554,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00026950000000000005,
|
|
"loss": 6.5907,
|
|
"mean_token_accuracy": 0.12478451505303383,
|
|
"num_tokens": 1230581.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 6.797735548019409,
|
|
"epoch": 0.03884810036353268,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00027200000000000005,
|
|
"loss": 6.5787,
|
|
"mean_token_accuracy": 0.12564107850193978,
|
|
"num_tokens": 1242046.0,
|
|
"step": 545
|
|
},
|
|
{
|
|
"entropy": 6.824971294403076,
|
|
"epoch": 0.039204504954023806,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0002745,
|
|
"loss": 6.5802,
|
|
"mean_token_accuracy": 0.12138499319553375,
|
|
"num_tokens": 1254167.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 6.7520105838775635,
|
|
"epoch": 0.03956090954451493,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000277,
|
|
"loss": 6.5764,
|
|
"mean_token_accuracy": 0.1260920248925686,
|
|
"num_tokens": 1265613.0,
|
|
"step": 555
|
|
},
|
|
{
|
|
"entropy": 6.812003946304321,
|
|
"epoch": 0.03991731413500606,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0002795,
|
|
"loss": 6.6682,
|
|
"mean_token_accuracy": 0.11812930405139924,
|
|
"num_tokens": 1277347.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 6.747121286392212,
|
|
"epoch": 0.04027371872549718,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00028199999999999997,
|
|
"loss": 6.5691,
|
|
"mean_token_accuracy": 0.12312827929854393,
|
|
"num_tokens": 1289523.0,
|
|
"step": 565
|
|
},
|
|
{
|
|
"entropy": 6.6098151206970215,
|
|
"epoch": 0.04063012331598831,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0002845,
|
|
"loss": 6.4979,
|
|
"mean_token_accuracy": 0.1243820309638977,
|
|
"num_tokens": 1302811.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 6.7549159049987795,
|
|
"epoch": 0.040986527906479435,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000287,
|
|
"loss": 6.5263,
|
|
"mean_token_accuracy": 0.1290876366198063,
|
|
"num_tokens": 1313312.0,
|
|
"step": 575
|
|
},
|
|
{
|
|
"entropy": 6.687855625152588,
|
|
"epoch": 0.04134293249697056,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0002895,
|
|
"loss": 6.4392,
|
|
"mean_token_accuracy": 0.13016564697027205,
|
|
"num_tokens": 1324211.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 6.756774044036865,
|
|
"epoch": 0.04169933708746169,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000292,
|
|
"loss": 6.5125,
|
|
"mean_token_accuracy": 0.12907068356871604,
|
|
"num_tokens": 1334630.0,
|
|
"step": 585
|
|
},
|
|
{
|
|
"entropy": 6.6873047828674315,
|
|
"epoch": 0.04205574167795281,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0002945,
|
|
"loss": 6.6081,
|
|
"mean_token_accuracy": 0.1214562140405178,
|
|
"num_tokens": 1346765.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 6.665805673599243,
|
|
"epoch": 0.04241214626844394,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000297,
|
|
"loss": 6.5212,
|
|
"mean_token_accuracy": 0.12480536177754402,
|
|
"num_tokens": 1358328.0,
|
|
"step": 595
|
|
},
|
|
{
|
|
"entropy": 6.735954523086548,
|
|
"epoch": 0.042768550858935064,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0002995,
|
|
"loss": 6.4598,
|
|
"mean_token_accuracy": 0.12877192124724388,
|
|
"num_tokens": 1369679.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 6.522557735443115,
|
|
"epoch": 0.04312495544942619,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000302,
|
|
"loss": 6.4563,
|
|
"mean_token_accuracy": 0.12848613560199737,
|
|
"num_tokens": 1380819.0,
|
|
"step": 605
|
|
},
|
|
{
|
|
"entropy": 6.631491756439209,
|
|
"epoch": 0.043481360039917316,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0003045,
|
|
"loss": 6.411,
|
|
"mean_token_accuracy": 0.13062736690044402,
|
|
"num_tokens": 1391634.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 6.529157543182373,
|
|
"epoch": 0.04383776463040844,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000307,
|
|
"loss": 6.4015,
|
|
"mean_token_accuracy": 0.13542434126138686,
|
|
"num_tokens": 1403502.0,
|
|
"step": 615
|
|
},
|
|
{
|
|
"entropy": 6.693103885650634,
|
|
"epoch": 0.04419416922089957,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0003095,
|
|
"loss": 6.5811,
|
|
"mean_token_accuracy": 0.12361188158392906,
|
|
"num_tokens": 1415154.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 6.804668426513672,
|
|
"epoch": 0.044550573811390694,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000312,
|
|
"loss": 6.6181,
|
|
"mean_token_accuracy": 0.12486119493842125,
|
|
"num_tokens": 1427373.0,
|
|
"step": 625
|
|
},
|
|
{
|
|
"entropy": 6.5153413772583,
|
|
"epoch": 0.04490697840188182,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0003145,
|
|
"loss": 6.4316,
|
|
"mean_token_accuracy": 0.12452183067798614,
|
|
"num_tokens": 1438366.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 6.685751962661743,
|
|
"epoch": 0.04526338299237294,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000317,
|
|
"loss": 6.551,
|
|
"mean_token_accuracy": 0.12643099054694176,
|
|
"num_tokens": 1450263.0,
|
|
"step": 635
|
|
},
|
|
{
|
|
"entropy": 6.753390741348267,
|
|
"epoch": 0.045619787582864064,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0003195,
|
|
"loss": 6.6029,
|
|
"mean_token_accuracy": 0.12731706649065017,
|
|
"num_tokens": 1461545.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 6.5972900390625,
|
|
"epoch": 0.04597619217335519,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000322,
|
|
"loss": 6.4952,
|
|
"mean_token_accuracy": 0.13171270489692688,
|
|
"num_tokens": 1472475.0,
|
|
"step": 645
|
|
},
|
|
{
|
|
"entropy": 6.6490813255310055,
|
|
"epoch": 0.046332596763846316,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00032450000000000003,
|
|
"loss": 6.466,
|
|
"mean_token_accuracy": 0.12866560816764833,
|
|
"num_tokens": 1483360.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 6.536572408676148,
|
|
"epoch": 0.04668900135433744,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00032700000000000003,
|
|
"loss": 6.5461,
|
|
"mean_token_accuracy": 0.12317833974957466,
|
|
"num_tokens": 1495306.0,
|
|
"step": 655
|
|
},
|
|
{
|
|
"entropy": 6.694786024093628,
|
|
"epoch": 0.04704540594482857,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00032950000000000004,
|
|
"loss": 6.4381,
|
|
"mean_token_accuracy": 0.12758397534489632,
|
|
"num_tokens": 1506595.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 6.465610027313232,
|
|
"epoch": 0.047401810535319694,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00033200000000000005,
|
|
"loss": 6.463,
|
|
"mean_token_accuracy": 0.13299945294857024,
|
|
"num_tokens": 1517657.0,
|
|
"step": 665
|
|
},
|
|
{
|
|
"entropy": 6.560718393325805,
|
|
"epoch": 0.04775821512581082,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00033450000000000005,
|
|
"loss": 6.4709,
|
|
"mean_token_accuracy": 0.12701933905482293,
|
|
"num_tokens": 1528780.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 6.673565006256103,
|
|
"epoch": 0.048114619716301946,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000337,
|
|
"loss": 6.6255,
|
|
"mean_token_accuracy": 0.12928676679730416,
|
|
"num_tokens": 1541282.0,
|
|
"step": 675
|
|
},
|
|
{
|
|
"entropy": 6.723560523986817,
|
|
"epoch": 0.04847102430679307,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0003395,
|
|
"loss": 6.5933,
|
|
"mean_token_accuracy": 0.12618897408246993,
|
|
"num_tokens": 1552176.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 6.5214701175689695,
|
|
"epoch": 0.0488274288972842,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000342,
|
|
"loss": 6.4551,
|
|
"mean_token_accuracy": 0.13662071749567986,
|
|
"num_tokens": 1562610.0,
|
|
"step": 685
|
|
},
|
|
{
|
|
"entropy": 6.6679027557373045,
|
|
"epoch": 0.04918383348777532,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00034449999999999997,
|
|
"loss": 6.4894,
|
|
"mean_token_accuracy": 0.12981411963701248,
|
|
"num_tokens": 1573800.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 6.63905701637268,
|
|
"epoch": 0.04954023807826645,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000347,
|
|
"loss": 6.4374,
|
|
"mean_token_accuracy": 0.12991899773478507,
|
|
"num_tokens": 1584090.0,
|
|
"step": 695
|
|
},
|
|
{
|
|
"entropy": 6.625251626968383,
|
|
"epoch": 0.049896642668757575,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003495,
|
|
"loss": 6.5999,
|
|
"mean_token_accuracy": 0.12750338912010192,
|
|
"num_tokens": 1595784.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 6.614082956314087,
|
|
"epoch": 0.0502530472592487,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000352,
|
|
"loss": 6.4354,
|
|
"mean_token_accuracy": 0.1324896700680256,
|
|
"num_tokens": 1607655.0,
|
|
"step": 705
|
|
},
|
|
{
|
|
"entropy": 6.614631175994873,
|
|
"epoch": 0.05060945184973983,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0003545,
|
|
"loss": 6.5556,
|
|
"mean_token_accuracy": 0.12384111508727073,
|
|
"num_tokens": 1619488.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 6.53868260383606,
|
|
"epoch": 0.05096585644023095,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.000357,
|
|
"loss": 6.3805,
|
|
"mean_token_accuracy": 0.13853650614619256,
|
|
"num_tokens": 1631854.0,
|
|
"step": 715
|
|
},
|
|
{
|
|
"entropy": 6.495734786987304,
|
|
"epoch": 0.05132226103072208,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003595,
|
|
"loss": 6.3798,
|
|
"mean_token_accuracy": 0.13574498295783996,
|
|
"num_tokens": 1643039.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 6.593002891540527,
|
|
"epoch": 0.051678665621213205,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.000362,
|
|
"loss": 6.3716,
|
|
"mean_token_accuracy": 0.1352020263671875,
|
|
"num_tokens": 1654398.0,
|
|
"step": 725
|
|
},
|
|
{
|
|
"entropy": 6.432076501846313,
|
|
"epoch": 0.05203507021170432,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0003645,
|
|
"loss": 6.4133,
|
|
"mean_token_accuracy": 0.12993604987859725,
|
|
"num_tokens": 1665853.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 6.516031074523926,
|
|
"epoch": 0.05239147480219545,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000367,
|
|
"loss": 6.4928,
|
|
"mean_token_accuracy": 0.1255275346338749,
|
|
"num_tokens": 1677116.0,
|
|
"step": 735
|
|
},
|
|
{
|
|
"entropy": 6.595679378509521,
|
|
"epoch": 0.052747879392686575,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0003695,
|
|
"loss": 6.4301,
|
|
"mean_token_accuracy": 0.12602694407105447,
|
|
"num_tokens": 1688429.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 6.47861385345459,
|
|
"epoch": 0.0531042839831777,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000372,
|
|
"loss": 6.3769,
|
|
"mean_token_accuracy": 0.12989522889256477,
|
|
"num_tokens": 1698462.0,
|
|
"step": 745
|
|
},
|
|
{
|
|
"entropy": 6.642209720611572,
|
|
"epoch": 0.05346068857366883,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0003745,
|
|
"loss": 6.5421,
|
|
"mean_token_accuracy": 0.1301214426755905,
|
|
"num_tokens": 1710856.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 6.543574380874634,
|
|
"epoch": 0.05381709316415995,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000377,
|
|
"loss": 6.4566,
|
|
"mean_token_accuracy": 0.13353927284479142,
|
|
"num_tokens": 1721241.0,
|
|
"step": 755
|
|
},
|
|
{
|
|
"entropy": 6.576838397979737,
|
|
"epoch": 0.05417349775465108,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0003795,
|
|
"loss": 6.5306,
|
|
"mean_token_accuracy": 0.12337611317634582,
|
|
"num_tokens": 1733352.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 6.447806310653687,
|
|
"epoch": 0.054529902345142205,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000382,
|
|
"loss": 6.4116,
|
|
"mean_token_accuracy": 0.1302800454199314,
|
|
"num_tokens": 1744935.0,
|
|
"step": 765
|
|
},
|
|
{
|
|
"entropy": 6.540251922607422,
|
|
"epoch": 0.05488630693563333,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0003845,
|
|
"loss": 6.5281,
|
|
"mean_token_accuracy": 0.1278146781027317,
|
|
"num_tokens": 1756853.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 6.521353387832642,
|
|
"epoch": 0.055242711526124456,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00038700000000000003,
|
|
"loss": 6.4064,
|
|
"mean_token_accuracy": 0.12865520864725113,
|
|
"num_tokens": 1768563.0,
|
|
"step": 775
|
|
},
|
|
{
|
|
"entropy": 6.503901243209839,
|
|
"epoch": 0.05559911611661558,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00038950000000000003,
|
|
"loss": 6.443,
|
|
"mean_token_accuracy": 0.13027106374502181,
|
|
"num_tokens": 1781122.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 6.572109794616699,
|
|
"epoch": 0.05595552070710671,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00039200000000000004,
|
|
"loss": 6.4716,
|
|
"mean_token_accuracy": 0.1295333534479141,
|
|
"num_tokens": 1792844.0,
|
|
"step": 785
|
|
},
|
|
{
|
|
"entropy": 6.585176658630371,
|
|
"epoch": 0.056311925297597834,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00039450000000000005,
|
|
"loss": 6.564,
|
|
"mean_token_accuracy": 0.1305658407509327,
|
|
"num_tokens": 1804558.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 6.422967195510864,
|
|
"epoch": 0.05666832988808896,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00039700000000000005,
|
|
"loss": 6.3578,
|
|
"mean_token_accuracy": 0.13267487660050392,
|
|
"num_tokens": 1818413.0,
|
|
"step": 795
|
|
},
|
|
{
|
|
"entropy": 6.533610534667969,
|
|
"epoch": 0.057024734478580086,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0003995,
|
|
"loss": 6.4071,
|
|
"mean_token_accuracy": 0.1327553428709507,
|
|
"num_tokens": 1828987.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 6.436796951293945,
|
|
"epoch": 0.05738113906907121,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000402,
|
|
"loss": 6.324,
|
|
"mean_token_accuracy": 0.13091181069612504,
|
|
"num_tokens": 1839797.0,
|
|
"step": 805
|
|
},
|
|
{
|
|
"entropy": 6.594801616668701,
|
|
"epoch": 0.05773754365956234,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004045,
|
|
"loss": 6.541,
|
|
"mean_token_accuracy": 0.13109391555190086,
|
|
"num_tokens": 1850979.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 6.371268939971924,
|
|
"epoch": 0.05809394825005346,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00040699999999999997,
|
|
"loss": 6.317,
|
|
"mean_token_accuracy": 0.12867073565721512,
|
|
"num_tokens": 1862328.0,
|
|
"step": 815
|
|
},
|
|
{
|
|
"entropy": 6.467564868927002,
|
|
"epoch": 0.05845035284054459,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004095,
|
|
"loss": 6.2482,
|
|
"mean_token_accuracy": 0.13217326626181602,
|
|
"num_tokens": 1872347.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 6.463844585418701,
|
|
"epoch": 0.05880675743103571,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000412,
|
|
"loss": 6.4967,
|
|
"mean_token_accuracy": 0.13336380571126938,
|
|
"num_tokens": 1883523.0,
|
|
"step": 825
|
|
},
|
|
{
|
|
"entropy": 6.43877911567688,
|
|
"epoch": 0.059163162021526834,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004145,
|
|
"loss": 6.4509,
|
|
"mean_token_accuracy": 0.12890932485461234,
|
|
"num_tokens": 1895686.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 6.565287065505982,
|
|
"epoch": 0.05951956661201796,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000417,
|
|
"loss": 6.5354,
|
|
"mean_token_accuracy": 0.13073515892028809,
|
|
"num_tokens": 1908262.0,
|
|
"step": 835
|
|
},
|
|
{
|
|
"entropy": 6.518001508712769,
|
|
"epoch": 0.059875971202509086,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004195,
|
|
"loss": 6.4302,
|
|
"mean_token_accuracy": 0.13468318432569504,
|
|
"num_tokens": 1919907.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 6.460860633850098,
|
|
"epoch": 0.06023237579300021,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000422,
|
|
"loss": 6.3553,
|
|
"mean_token_accuracy": 0.13497007563710212,
|
|
"num_tokens": 1931671.0,
|
|
"step": 845
|
|
},
|
|
{
|
|
"entropy": 6.485175657272339,
|
|
"epoch": 0.06058878038349134,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004245,
|
|
"loss": 6.3805,
|
|
"mean_token_accuracy": 0.13863845989108087,
|
|
"num_tokens": 1941687.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 6.483077478408814,
|
|
"epoch": 0.060945184973982464,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000427,
|
|
"loss": 6.406,
|
|
"mean_token_accuracy": 0.12826280370354654,
|
|
"num_tokens": 1953444.0,
|
|
"step": 855
|
|
},
|
|
{
|
|
"entropy": 6.402612495422363,
|
|
"epoch": 0.06130158956447359,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004295,
|
|
"loss": 6.401,
|
|
"mean_token_accuracy": 0.12523565962910652,
|
|
"num_tokens": 1964999.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 6.489323329925537,
|
|
"epoch": 0.061657994154964715,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000432,
|
|
"loss": 6.4444,
|
|
"mean_token_accuracy": 0.12409620508551597,
|
|
"num_tokens": 1977452.0,
|
|
"step": 865
|
|
},
|
|
{
|
|
"entropy": 6.5719421863555905,
|
|
"epoch": 0.06201439874545584,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004345,
|
|
"loss": 6.5375,
|
|
"mean_token_accuracy": 0.12561874836683273,
|
|
"num_tokens": 1988362.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 6.32892746925354,
|
|
"epoch": 0.06237080333594697,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000437,
|
|
"loss": 6.3076,
|
|
"mean_token_accuracy": 0.13660703897476195,
|
|
"num_tokens": 2000201.0,
|
|
"step": 875
|
|
},
|
|
{
|
|
"entropy": 6.469229078292846,
|
|
"epoch": 0.06272720792643809,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004395,
|
|
"loss": 6.4013,
|
|
"mean_token_accuracy": 0.12952255308628083,
|
|
"num_tokens": 2011944.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 6.445242691040039,
|
|
"epoch": 0.06308361251692922,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000442,
|
|
"loss": 6.4476,
|
|
"mean_token_accuracy": 0.13307790830731392,
|
|
"num_tokens": 2023630.0,
|
|
"step": 885
|
|
},
|
|
{
|
|
"entropy": 6.44045844078064,
|
|
"epoch": 0.06344001710742034,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004445,
|
|
"loss": 6.4136,
|
|
"mean_token_accuracy": 0.12842540666460991,
|
|
"num_tokens": 2036171.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 6.439805173873902,
|
|
"epoch": 0.06379642169791147,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.000447,
|
|
"loss": 6.438,
|
|
"mean_token_accuracy": 0.13159651011228563,
|
|
"num_tokens": 2049504.0,
|
|
"step": 895
|
|
},
|
|
{
|
|
"entropy": 6.405153512954712,
|
|
"epoch": 0.06415282628840259,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00044950000000000003,
|
|
"loss": 6.3627,
|
|
"mean_token_accuracy": 0.1326387383043766,
|
|
"num_tokens": 2059325.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 6.525048160552979,
|
|
"epoch": 0.06450923087889372,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00045200000000000004,
|
|
"loss": 6.4356,
|
|
"mean_token_accuracy": 0.13329405188560486,
|
|
"num_tokens": 2070412.0,
|
|
"step": 905
|
|
},
|
|
{
|
|
"entropy": 6.537260293960571,
|
|
"epoch": 0.06486563546938484,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00045450000000000004,
|
|
"loss": 6.4373,
|
|
"mean_token_accuracy": 0.13315050303936005,
|
|
"num_tokens": 2080236.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 6.283264064788819,
|
|
"epoch": 0.06522204005987597,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00045700000000000005,
|
|
"loss": 6.3515,
|
|
"mean_token_accuracy": 0.1297558829188347,
|
|
"num_tokens": 2091518.0,
|
|
"step": 915
|
|
},
|
|
{
|
|
"entropy": 6.526217222213745,
|
|
"epoch": 0.0655784446503671,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00045950000000000006,
|
|
"loss": 6.368,
|
|
"mean_token_accuracy": 0.1325083076953888,
|
|
"num_tokens": 2101516.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 6.375706481933594,
|
|
"epoch": 0.06593484924085823,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000462,
|
|
"loss": 6.345,
|
|
"mean_token_accuracy": 0.13234054744243623,
|
|
"num_tokens": 2112528.0,
|
|
"step": 925
|
|
},
|
|
{
|
|
"entropy": 6.246534633636474,
|
|
"epoch": 0.06629125383134934,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004645,
|
|
"loss": 6.248,
|
|
"mean_token_accuracy": 0.13760901093482972,
|
|
"num_tokens": 2123141.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 6.34368371963501,
|
|
"epoch": 0.06664765842184048,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.000467,
|
|
"loss": 6.2634,
|
|
"mean_token_accuracy": 0.138457553088665,
|
|
"num_tokens": 2133846.0,
|
|
"step": 935
|
|
},
|
|
{
|
|
"entropy": 6.325902462005615,
|
|
"epoch": 0.0670040630123316,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004695,
|
|
"loss": 6.3193,
|
|
"mean_token_accuracy": 0.1425301358103752,
|
|
"num_tokens": 2145149.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 6.3917014598846436,
|
|
"epoch": 0.06736046760282273,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000472,
|
|
"loss": 6.4106,
|
|
"mean_token_accuracy": 0.1307942695915699,
|
|
"num_tokens": 2157701.0,
|
|
"step": 945
|
|
},
|
|
{
|
|
"entropy": 6.460545301437378,
|
|
"epoch": 0.06771687219331385,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004745,
|
|
"loss": 6.5573,
|
|
"mean_token_accuracy": 0.12468130961060524,
|
|
"num_tokens": 2169628.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 6.404773569107055,
|
|
"epoch": 0.06807327678380498,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000477,
|
|
"loss": 6.4053,
|
|
"mean_token_accuracy": 0.13866689130663873,
|
|
"num_tokens": 2180514.0,
|
|
"step": 955
|
|
},
|
|
{
|
|
"entropy": 6.353378248214722,
|
|
"epoch": 0.0684296813742961,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004795,
|
|
"loss": 6.384,
|
|
"mean_token_accuracy": 0.13784398436546325,
|
|
"num_tokens": 2191444.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 6.355839490890503,
|
|
"epoch": 0.06878608596478723,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000482,
|
|
"loss": 6.285,
|
|
"mean_token_accuracy": 0.14290510043501853,
|
|
"num_tokens": 2201697.0,
|
|
"step": 965
|
|
},
|
|
{
|
|
"entropy": 6.55248761177063,
|
|
"epoch": 0.06914249055527835,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004845,
|
|
"loss": 6.4695,
|
|
"mean_token_accuracy": 0.13385656401515006,
|
|
"num_tokens": 2214445.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 6.186372995376587,
|
|
"epoch": 0.06949889514576947,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000487,
|
|
"loss": 6.3001,
|
|
"mean_token_accuracy": 0.13443736881017684,
|
|
"num_tokens": 2225641.0,
|
|
"step": 975
|
|
},
|
|
{
|
|
"entropy": 6.355304479598999,
|
|
"epoch": 0.0698552997362606,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004895,
|
|
"loss": 6.325,
|
|
"mean_token_accuracy": 0.13117533475160598,
|
|
"num_tokens": 2236361.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 6.355004453659058,
|
|
"epoch": 0.07021170432675172,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000492,
|
|
"loss": 6.2434,
|
|
"mean_token_accuracy": 0.13566968366503715,
|
|
"num_tokens": 2248165.0,
|
|
"step": 985
|
|
},
|
|
{
|
|
"entropy": 6.318191242218018,
|
|
"epoch": 0.07056810891724286,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004945,
|
|
"loss": 6.3146,
|
|
"mean_token_accuracy": 0.13415816202759742,
|
|
"num_tokens": 2259620.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 6.307800722122193,
|
|
"epoch": 0.07092451350773397,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000497,
|
|
"loss": 6.3535,
|
|
"mean_token_accuracy": 0.13583842292428017,
|
|
"num_tokens": 2272002.0,
|
|
"step": 995
|
|
},
|
|
{
|
|
"entropy": 6.434981966018677,
|
|
"epoch": 0.07128091809822511,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004995,
|
|
"loss": 6.377,
|
|
"mean_token_accuracy": 0.13304205238819122,
|
|
"num_tokens": 2283141.0,
|
|
"step": 1000
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 4000,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 1,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 3636001105920000.0,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|