Files
eng-latn-100mb-ppt-Dp-100mb…/checkpoint-500/trainer_state.json

1035 lines
27 KiB
JSON
Raw Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.035640459049112554,
"eval_steps": 500,
"global_step": 500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.692017364501954,
"epoch": 0.0003564045904911255,
"grad_norm": 14.125,
"learning_rate": 2e-06,
"loss": 10.8367,
"mean_token_accuracy": 0.0,
"num_tokens": 11399.0,
"step": 5
},
{
"entropy": 10.691957569122314,
"epoch": 0.000712809180982251,
"grad_norm": 13.625,
"learning_rate": 4.5e-06,
"loss": 10.7639,
"mean_token_accuracy": 6.901310989633202e-05,
"num_tokens": 22686.0,
"step": 10
},
{
"entropy": 10.69105806350708,
"epoch": 0.0010692137714733766,
"grad_norm": 9.75,
"learning_rate": 7e-06,
"loss": 10.4704,
"mean_token_accuracy": 0.01642136035952717,
"num_tokens": 32728.0,
"step": 15
},
{
"entropy": 10.683691692352294,
"epoch": 0.001425618361964502,
"grad_norm": 6.34375,
"learning_rate": 9.5e-06,
"loss": 10.1573,
"mean_token_accuracy": 0.035650182887911795,
"num_tokens": 42808.0,
"step": 20
},
{
"entropy": 10.64972677230835,
"epoch": 0.0017820229524556277,
"grad_norm": 4.0625,
"learning_rate": 1.2e-05,
"loss": 9.8635,
"mean_token_accuracy": 0.035930054076015946,
"num_tokens": 54058.0,
"step": 25
},
{
"entropy": 10.611275386810302,
"epoch": 0.002138427542946753,
"grad_norm": 3.140625,
"learning_rate": 1.4500000000000002e-05,
"loss": 9.7137,
"mean_token_accuracy": 0.03763993177562952,
"num_tokens": 65338.0,
"step": 30
},
{
"entropy": 10.598550796508789,
"epoch": 0.0024948321334378786,
"grad_norm": 3.890625,
"learning_rate": 1.7000000000000003e-05,
"loss": 9.612,
"mean_token_accuracy": 0.04252670388668776,
"num_tokens": 76598.0,
"step": 35
},
{
"entropy": 10.599444103240966,
"epoch": 0.002851236723929004,
"grad_norm": 2.703125,
"learning_rate": 1.95e-05,
"loss": 9.5696,
"mean_token_accuracy": 0.04173162579536438,
"num_tokens": 87364.0,
"step": 40
},
{
"entropy": 10.571285438537597,
"epoch": 0.00320764131442013,
"grad_norm": 2.59375,
"learning_rate": 2.2e-05,
"loss": 9.5333,
"mean_token_accuracy": 0.040771466493606565,
"num_tokens": 99019.0,
"step": 45
},
{
"entropy": 10.56482973098755,
"epoch": 0.0035640459049112554,
"grad_norm": 2.5,
"learning_rate": 2.4500000000000003e-05,
"loss": 9.5004,
"mean_token_accuracy": 0.042115325853228566,
"num_tokens": 111087.0,
"step": 50
},
{
"entropy": 10.555388832092286,
"epoch": 0.00392045049540238,
"grad_norm": 2.53125,
"learning_rate": 2.7e-05,
"loss": 9.4487,
"mean_token_accuracy": 0.046751032769680026,
"num_tokens": 123401.0,
"step": 55
},
{
"entropy": 10.569499969482422,
"epoch": 0.004276855085893506,
"grad_norm": 2.578125,
"learning_rate": 2.95e-05,
"loss": 9.3385,
"mean_token_accuracy": 0.051391019485890865,
"num_tokens": 135554.0,
"step": 60
},
{
"entropy": 10.512379455566407,
"epoch": 0.004633259676384632,
"grad_norm": 2.46875,
"learning_rate": 3.2e-05,
"loss": 9.2173,
"mean_token_accuracy": 0.060007892176508905,
"num_tokens": 146700.0,
"step": 65
},
{
"entropy": 10.373568439483643,
"epoch": 0.004989664266875757,
"grad_norm": 2.3125,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.1634,
"mean_token_accuracy": 0.05574713312089443,
"num_tokens": 157606.0,
"step": 70
},
{
"entropy": 10.454727077484131,
"epoch": 0.005346068857366883,
"grad_norm": 2.296875,
"learning_rate": 3.7e-05,
"loss": 9.0943,
"mean_token_accuracy": 0.05970448292791843,
"num_tokens": 168705.0,
"step": 75
},
{
"entropy": 10.436204051971435,
"epoch": 0.005702473447858008,
"grad_norm": 2.59375,
"learning_rate": 3.95e-05,
"loss": 9.0076,
"mean_token_accuracy": 0.06562120430171489,
"num_tokens": 181497.0,
"step": 80
},
{
"entropy": 10.350591468811036,
"epoch": 0.006058878038349134,
"grad_norm": 2.59375,
"learning_rate": 4.2000000000000004e-05,
"loss": 8.8524,
"mean_token_accuracy": 0.0729046493768692,
"num_tokens": 192991.0,
"step": 85
},
{
"entropy": 10.254280471801758,
"epoch": 0.00641528262884026,
"grad_norm": 2.703125,
"learning_rate": 4.45e-05,
"loss": 8.6787,
"mean_token_accuracy": 0.0757947500795126,
"num_tokens": 203969.0,
"step": 90
},
{
"entropy": 10.204264450073243,
"epoch": 0.006771687219331385,
"grad_norm": 2.109375,
"learning_rate": 4.7000000000000004e-05,
"loss": 8.6609,
"mean_token_accuracy": 0.07682550996541977,
"num_tokens": 215809.0,
"step": 95
},
{
"entropy": 10.189391613006592,
"epoch": 0.007128091809822511,
"grad_norm": 2.109375,
"learning_rate": 4.9500000000000004e-05,
"loss": 8.5959,
"mean_token_accuracy": 0.07614239081740379,
"num_tokens": 227826.0,
"step": 100
},
{
"entropy": 10.087896060943603,
"epoch": 0.007484496400313636,
"grad_norm": 2.03125,
"learning_rate": 5.2e-05,
"loss": 8.4633,
"mean_token_accuracy": 0.08133391663432121,
"num_tokens": 240073.0,
"step": 105
},
{
"entropy": 9.981376838684081,
"epoch": 0.00784090099080476,
"grad_norm": 2.21875,
"learning_rate": 5.45e-05,
"loss": 8.2916,
"mean_token_accuracy": 0.08083986043930054,
"num_tokens": 251073.0,
"step": 110
},
{
"entropy": 9.942218494415282,
"epoch": 0.008197305581295887,
"grad_norm": 1.890625,
"learning_rate": 5.7e-05,
"loss": 8.292,
"mean_token_accuracy": 0.07924356088042259,
"num_tokens": 264607.0,
"step": 115
},
{
"entropy": 9.826002407073975,
"epoch": 0.008553710171787013,
"grad_norm": 1.8046875,
"learning_rate": 5.9499999999999996e-05,
"loss": 8.0674,
"mean_token_accuracy": 0.08344096019864082,
"num_tokens": 275688.0,
"step": 120
},
{
"entropy": 9.725812625885009,
"epoch": 0.008910114762278138,
"grad_norm": 1.75,
"learning_rate": 6.2e-05,
"loss": 7.9033,
"mean_token_accuracy": 0.08407644256949424,
"num_tokens": 287024.0,
"step": 125
},
{
"entropy": 9.538934803009033,
"epoch": 0.009266519352769264,
"grad_norm": 1.765625,
"learning_rate": 6.450000000000001e-05,
"loss": 7.8564,
"mean_token_accuracy": 0.08399767056107521,
"num_tokens": 297605.0,
"step": 130
},
{
"entropy": 9.370525646209718,
"epoch": 0.009622923943260388,
"grad_norm": 1.7734375,
"learning_rate": 6.7e-05,
"loss": 7.7135,
"mean_token_accuracy": 0.08679336085915565,
"num_tokens": 307956.0,
"step": 135
},
{
"entropy": 9.153919219970703,
"epoch": 0.009979328533751514,
"grad_norm": 1.625,
"learning_rate": 6.950000000000001e-05,
"loss": 7.5976,
"mean_token_accuracy": 0.08618754744529725,
"num_tokens": 318724.0,
"step": 140
},
{
"entropy": 8.899112701416016,
"epoch": 0.01033573312424264,
"grad_norm": 1.4375,
"learning_rate": 7.2e-05,
"loss": 7.4406,
"mean_token_accuracy": 0.08834938332438469,
"num_tokens": 330488.0,
"step": 145
},
{
"entropy": 8.675454139709473,
"epoch": 0.010692137714733766,
"grad_norm": 1.3671875,
"learning_rate": 7.45e-05,
"loss": 7.5299,
"mean_token_accuracy": 0.08864943459630012,
"num_tokens": 343057.0,
"step": 150
},
{
"entropy": 8.480731201171874,
"epoch": 0.011048542305224892,
"grad_norm": 1.390625,
"learning_rate": 7.7e-05,
"loss": 7.3532,
"mean_token_accuracy": 0.09288429766893387,
"num_tokens": 355224.0,
"step": 155
},
{
"entropy": 8.344585990905761,
"epoch": 0.011404946895716016,
"grad_norm": 1.2578125,
"learning_rate": 7.950000000000001e-05,
"loss": 7.3521,
"mean_token_accuracy": 0.09180220365524291,
"num_tokens": 366926.0,
"step": 160
},
{
"entropy": 8.18641996383667,
"epoch": 0.011761351486207142,
"grad_norm": 1.5234375,
"learning_rate": 8.2e-05,
"loss": 7.2732,
"mean_token_accuracy": 0.09202986061573029,
"num_tokens": 378180.0,
"step": 165
},
{
"entropy": 8.100344848632812,
"epoch": 0.012117756076698268,
"grad_norm": 1.6328125,
"learning_rate": 8.450000000000001e-05,
"loss": 7.3021,
"mean_token_accuracy": 0.09149679765105248,
"num_tokens": 388639.0,
"step": 170
},
{
"entropy": 7.991573286056519,
"epoch": 0.012474160667189394,
"grad_norm": 1.4609375,
"learning_rate": 8.7e-05,
"loss": 7.2275,
"mean_token_accuracy": 0.09744204580783844,
"num_tokens": 398752.0,
"step": 175
},
{
"entropy": 7.88223123550415,
"epoch": 0.01283056525768052,
"grad_norm": 1.3359375,
"learning_rate": 8.95e-05,
"loss": 7.1954,
"mean_token_accuracy": 0.09606479555368423,
"num_tokens": 411341.0,
"step": 180
},
{
"entropy": 7.8277486801147464,
"epoch": 0.013186969848171644,
"grad_norm": 1.2421875,
"learning_rate": 9.2e-05,
"loss": 7.1005,
"mean_token_accuracy": 0.09566677063703537,
"num_tokens": 421736.0,
"step": 185
},
{
"entropy": 7.860902547836304,
"epoch": 0.01354337443866277,
"grad_norm": 1.21875,
"learning_rate": 9.45e-05,
"loss": 7.1857,
"mean_token_accuracy": 0.09552413523197174,
"num_tokens": 432934.0,
"step": 190
},
{
"entropy": 7.822595310211182,
"epoch": 0.013899779029153896,
"grad_norm": 1.3359375,
"learning_rate": 9.7e-05,
"loss": 7.12,
"mean_token_accuracy": 0.10211173966526985,
"num_tokens": 442929.0,
"step": 195
},
{
"entropy": 7.693083477020264,
"epoch": 0.014256183619645021,
"grad_norm": 1.5,
"learning_rate": 9.95e-05,
"loss": 7.1199,
"mean_token_accuracy": 0.0966656155884266,
"num_tokens": 455544.0,
"step": 200
},
{
"entropy": 7.67202787399292,
"epoch": 0.014612588210136147,
"grad_norm": 1.375,
"learning_rate": 0.000102,
"loss": 7.0383,
"mean_token_accuracy": 0.10238562151789665,
"num_tokens": 466476.0,
"step": 205
},
{
"entropy": 7.641747999191284,
"epoch": 0.014968992800627271,
"grad_norm": 1.46875,
"learning_rate": 0.00010449999999999999,
"loss": 7.0423,
"mean_token_accuracy": 0.10611227676272392,
"num_tokens": 477149.0,
"step": 210
},
{
"entropy": 7.678851318359375,
"epoch": 0.015325397391118397,
"grad_norm": 1.171875,
"learning_rate": 0.000107,
"loss": 7.194,
"mean_token_accuracy": 0.09881364479660988,
"num_tokens": 489684.0,
"step": 215
},
{
"entropy": 7.6810675144195555,
"epoch": 0.01568180198160952,
"grad_norm": 1.1796875,
"learning_rate": 0.0001095,
"loss": 7.1195,
"mean_token_accuracy": 0.10285983234643936,
"num_tokens": 500724.0,
"step": 220
},
{
"entropy": 7.516607046127319,
"epoch": 0.016038206572100647,
"grad_norm": 1.484375,
"learning_rate": 0.000112,
"loss": 7.0014,
"mean_token_accuracy": 0.10714144557714463,
"num_tokens": 511301.0,
"step": 225
},
{
"entropy": 7.589178037643433,
"epoch": 0.016394611162591773,
"grad_norm": 1.640625,
"learning_rate": 0.0001145,
"loss": 7.0292,
"mean_token_accuracy": 0.0986006237566471,
"num_tokens": 522925.0,
"step": 230
},
{
"entropy": 7.550503349304199,
"epoch": 0.0167510157530829,
"grad_norm": 1.515625,
"learning_rate": 0.00011700000000000001,
"loss": 7.0411,
"mean_token_accuracy": 0.10731777027249337,
"num_tokens": 533742.0,
"step": 235
},
{
"entropy": 7.437931919097901,
"epoch": 0.017107420343574025,
"grad_norm": 1.4453125,
"learning_rate": 0.00011949999999999999,
"loss": 7.0108,
"mean_token_accuracy": 0.1048599824309349,
"num_tokens": 545526.0,
"step": 240
},
{
"entropy": 7.485028076171875,
"epoch": 0.01746382493406515,
"grad_norm": 1.3203125,
"learning_rate": 0.000122,
"loss": 6.9512,
"mean_token_accuracy": 0.10988161414861679,
"num_tokens": 555735.0,
"step": 245
},
{
"entropy": 7.441792440414429,
"epoch": 0.017820229524556277,
"grad_norm": 1.375,
"learning_rate": 0.0001245,
"loss": 7.0456,
"mean_token_accuracy": 0.10132465660572051,
"num_tokens": 568443.0,
"step": 250
},
{
"entropy": 7.456151485443115,
"epoch": 0.018176634115047403,
"grad_norm": 1.3515625,
"learning_rate": 0.000127,
"loss": 6.9256,
"mean_token_accuracy": 0.11248807981610298,
"num_tokens": 579091.0,
"step": 255
},
{
"entropy": 7.312637805938721,
"epoch": 0.01853303870553853,
"grad_norm": 1.1640625,
"learning_rate": 0.0001295,
"loss": 6.8611,
"mean_token_accuracy": 0.10876356959342956,
"num_tokens": 591683.0,
"step": 260
},
{
"entropy": 7.3945722579956055,
"epoch": 0.018889443296029654,
"grad_norm": 1.4140625,
"learning_rate": 0.000132,
"loss": 6.9957,
"mean_token_accuracy": 0.10596117228269578,
"num_tokens": 603464.0,
"step": 265
},
{
"entropy": 7.438564348220825,
"epoch": 0.019245847886520777,
"grad_norm": 1.34375,
"learning_rate": 0.00013450000000000002,
"loss": 7.0678,
"mean_token_accuracy": 0.104298285394907,
"num_tokens": 615626.0,
"step": 270
},
{
"entropy": 7.447065210342407,
"epoch": 0.019602252477011903,
"grad_norm": 1.2890625,
"learning_rate": 0.00013700000000000002,
"loss": 6.9806,
"mean_token_accuracy": 0.10557826459407807,
"num_tokens": 627270.0,
"step": 275
},
{
"entropy": 7.331842660903931,
"epoch": 0.01995865706750303,
"grad_norm": 1.2109375,
"learning_rate": 0.0001395,
"loss": 6.8978,
"mean_token_accuracy": 0.11048185899853706,
"num_tokens": 638403.0,
"step": 280
},
{
"entropy": 7.369898748397827,
"epoch": 0.020315061657994155,
"grad_norm": 1.078125,
"learning_rate": 0.00014199999999999998,
"loss": 6.9043,
"mean_token_accuracy": 0.11137154400348663,
"num_tokens": 650046.0,
"step": 285
},
{
"entropy": 7.282534790039063,
"epoch": 0.02067146624848528,
"grad_norm": 1.375,
"learning_rate": 0.0001445,
"loss": 6.8625,
"mean_token_accuracy": 0.11072641685605049,
"num_tokens": 659818.0,
"step": 290
},
{
"entropy": 7.2380547523498535,
"epoch": 0.021027870838976406,
"grad_norm": 1.0703125,
"learning_rate": 0.000147,
"loss": 6.8756,
"mean_token_accuracy": 0.11218505501747131,
"num_tokens": 672404.0,
"step": 295
},
{
"entropy": 7.28413872718811,
"epoch": 0.021384275429467532,
"grad_norm": 1.15625,
"learning_rate": 0.0001495,
"loss": 6.8657,
"mean_token_accuracy": 0.10923274457454682,
"num_tokens": 684048.0,
"step": 300
},
{
"entropy": 7.311151695251465,
"epoch": 0.021740680019958658,
"grad_norm": 1.625,
"learning_rate": 0.000152,
"loss": 6.8738,
"mean_token_accuracy": 0.10937001630663871,
"num_tokens": 694590.0,
"step": 305
},
{
"entropy": 7.160674905776977,
"epoch": 0.022097084610449784,
"grad_norm": 1.1640625,
"learning_rate": 0.00015450000000000001,
"loss": 6.7966,
"mean_token_accuracy": 0.1082501120865345,
"num_tokens": 706949.0,
"step": 310
},
{
"entropy": 7.300990581512451,
"epoch": 0.02245348920094091,
"grad_norm": 1.203125,
"learning_rate": 0.000157,
"loss": 6.9186,
"mean_token_accuracy": 0.1130599781870842,
"num_tokens": 717400.0,
"step": 315
},
{
"entropy": 7.261720275878906,
"epoch": 0.022809893791432032,
"grad_norm": 1.2734375,
"learning_rate": 0.0001595,
"loss": 6.8517,
"mean_token_accuracy": 0.11169279888272285,
"num_tokens": 728842.0,
"step": 320
},
{
"entropy": 7.1845160007476805,
"epoch": 0.023166298381923158,
"grad_norm": 1.1484375,
"learning_rate": 0.000162,
"loss": 6.8315,
"mean_token_accuracy": 0.1084785707294941,
"num_tokens": 740598.0,
"step": 325
},
{
"entropy": 7.230294179916382,
"epoch": 0.023522702972414284,
"grad_norm": 1.1484375,
"learning_rate": 0.00016450000000000001,
"loss": 6.8676,
"mean_token_accuracy": 0.11259512975811958,
"num_tokens": 752512.0,
"step": 330
},
{
"entropy": 7.300836181640625,
"epoch": 0.02387910756290541,
"grad_norm": 1.1796875,
"learning_rate": 0.00016700000000000002,
"loss": 6.9408,
"mean_token_accuracy": 0.10492971390485764,
"num_tokens": 764679.0,
"step": 335
},
{
"entropy": 7.184459400177002,
"epoch": 0.024235512153396536,
"grad_norm": 1.3359375,
"learning_rate": 0.00016950000000000003,
"loss": 6.9801,
"mean_token_accuracy": 0.11560937166213989,
"num_tokens": 776267.0,
"step": 340
},
{
"entropy": 7.161315059661865,
"epoch": 0.02459191674388766,
"grad_norm": 1.078125,
"learning_rate": 0.00017199999999999998,
"loss": 6.7515,
"mean_token_accuracy": 0.12069559693336487,
"num_tokens": 788178.0,
"step": 345
},
{
"entropy": 7.21292634010315,
"epoch": 0.024948321334378788,
"grad_norm": 1.2421875,
"learning_rate": 0.00017449999999999999,
"loss": 6.8638,
"mean_token_accuracy": 0.11443236991763114,
"num_tokens": 798643.0,
"step": 350
},
{
"entropy": 7.162191772460938,
"epoch": 0.025304725924869913,
"grad_norm": 1.375,
"learning_rate": 0.000177,
"loss": 6.8749,
"mean_token_accuracy": 0.11219770759344101,
"num_tokens": 809448.0,
"step": 355
},
{
"entropy": 7.070344543457031,
"epoch": 0.02566113051536104,
"grad_norm": 1.328125,
"learning_rate": 0.0001795,
"loss": 6.8172,
"mean_token_accuracy": 0.11555075868964196,
"num_tokens": 821107.0,
"step": 360
},
{
"entropy": 7.131128549575806,
"epoch": 0.02601753510585216,
"grad_norm": 1.2734375,
"learning_rate": 0.000182,
"loss": 6.7602,
"mean_token_accuracy": 0.11315757408738136,
"num_tokens": 832800.0,
"step": 365
},
{
"entropy": 7.158021736145019,
"epoch": 0.026373939696343288,
"grad_norm": 1.2890625,
"learning_rate": 0.0001845,
"loss": 6.811,
"mean_token_accuracy": 0.11933915168046952,
"num_tokens": 845207.0,
"step": 370
},
{
"entropy": 7.099034166336059,
"epoch": 0.026730344286834413,
"grad_norm": 1.1796875,
"learning_rate": 0.000187,
"loss": 6.8469,
"mean_token_accuracy": 0.11549493819475173,
"num_tokens": 857270.0,
"step": 375
},
{
"entropy": 7.05969123840332,
"epoch": 0.02708674887732554,
"grad_norm": 1.28125,
"learning_rate": 0.0001895,
"loss": 6.7642,
"mean_token_accuracy": 0.11390233710408211,
"num_tokens": 867892.0,
"step": 380
},
{
"entropy": 7.056723403930664,
"epoch": 0.027443153467816665,
"grad_norm": 1.0546875,
"learning_rate": 0.000192,
"loss": 6.6796,
"mean_token_accuracy": 0.11220178827643394,
"num_tokens": 879516.0,
"step": 385
},
{
"entropy": 7.027820062637329,
"epoch": 0.02779955805830779,
"grad_norm": 1.2421875,
"learning_rate": 0.0001945,
"loss": 6.6856,
"mean_token_accuracy": 0.11767275109887124,
"num_tokens": 889693.0,
"step": 390
},
{
"entropy": 6.93689923286438,
"epoch": 0.028155962648798917,
"grad_norm": 1.171875,
"learning_rate": 0.00019700000000000002,
"loss": 6.716,
"mean_token_accuracy": 0.11856673210859299,
"num_tokens": 901591.0,
"step": 395
},
{
"entropy": 7.036142110824585,
"epoch": 0.028512367239290043,
"grad_norm": 1.234375,
"learning_rate": 0.00019950000000000002,
"loss": 6.6789,
"mean_token_accuracy": 0.11616217717528343,
"num_tokens": 912146.0,
"step": 400
},
{
"entropy": 6.947995281219482,
"epoch": 0.02886877182978117,
"grad_norm": 1.0703125,
"learning_rate": 0.000202,
"loss": 6.5378,
"mean_token_accuracy": 0.12628986611962317,
"num_tokens": 923219.0,
"step": 405
},
{
"entropy": 6.915331506729126,
"epoch": 0.029225176420272295,
"grad_norm": 1.390625,
"learning_rate": 0.00020449999999999998,
"loss": 6.5891,
"mean_token_accuracy": 0.1272263564169407,
"num_tokens": 934330.0,
"step": 410
},
{
"entropy": 6.956090450286865,
"epoch": 0.029581581010763417,
"grad_norm": 1.1640625,
"learning_rate": 0.000207,
"loss": 6.6703,
"mean_token_accuracy": 0.12228544279932976,
"num_tokens": 944993.0,
"step": 415
},
{
"entropy": 7.0030059814453125,
"epoch": 0.029937985601254543,
"grad_norm": 1.234375,
"learning_rate": 0.0002095,
"loss": 6.7281,
"mean_token_accuracy": 0.12065548226237297,
"num_tokens": 955746.0,
"step": 420
},
{
"entropy": 7.023007392883301,
"epoch": 0.03029439019174567,
"grad_norm": 1.203125,
"learning_rate": 0.000212,
"loss": 6.7385,
"mean_token_accuracy": 0.122479547560215,
"num_tokens": 966600.0,
"step": 425
},
{
"entropy": 6.893257761001587,
"epoch": 0.030650794782236795,
"grad_norm": 1.15625,
"learning_rate": 0.0002145,
"loss": 6.731,
"mean_token_accuracy": 0.1273415558040142,
"num_tokens": 976984.0,
"step": 430
},
{
"entropy": 7.020415782928467,
"epoch": 0.03100719937272792,
"grad_norm": 1.1484375,
"learning_rate": 0.00021700000000000002,
"loss": 6.7715,
"mean_token_accuracy": 0.1136875256896019,
"num_tokens": 990221.0,
"step": 435
},
{
"entropy": 6.892011499404907,
"epoch": 0.03136360396321904,
"grad_norm": 1.1640625,
"learning_rate": 0.0002195,
"loss": 6.6491,
"mean_token_accuracy": 0.11894271299242973,
"num_tokens": 1001583.0,
"step": 440
},
{
"entropy": 6.992098093032837,
"epoch": 0.03172000855371017,
"grad_norm": 1.28125,
"learning_rate": 0.000222,
"loss": 6.595,
"mean_token_accuracy": 0.1258418917655945,
"num_tokens": 1012170.0,
"step": 445
},
{
"entropy": 6.916194820404053,
"epoch": 0.032076413144201295,
"grad_norm": 1.421875,
"learning_rate": 0.0002245,
"loss": 6.6358,
"mean_token_accuracy": 0.11565389856696129,
"num_tokens": 1022948.0,
"step": 450
},
{
"entropy": 6.822894620895386,
"epoch": 0.03243281773469242,
"grad_norm": 1.0703125,
"learning_rate": 0.00022700000000000002,
"loss": 6.6369,
"mean_token_accuracy": 0.12339216992259025,
"num_tokens": 1034764.0,
"step": 455
},
{
"entropy": 6.846291399002075,
"epoch": 0.03278922232518355,
"grad_norm": 1.1640625,
"learning_rate": 0.00022950000000000002,
"loss": 6.6751,
"mean_token_accuracy": 0.123189727216959,
"num_tokens": 1046485.0,
"step": 460
},
{
"entropy": 6.8924657821655275,
"epoch": 0.03314562691567467,
"grad_norm": 1.1171875,
"learning_rate": 0.00023200000000000003,
"loss": 6.6122,
"mean_token_accuracy": 0.11978656575083732,
"num_tokens": 1057819.0,
"step": 465
},
{
"entropy": 6.885383605957031,
"epoch": 0.0335020315061658,
"grad_norm": 1.296875,
"learning_rate": 0.00023449999999999998,
"loss": 6.6677,
"mean_token_accuracy": 0.1239581860601902,
"num_tokens": 1068905.0,
"step": 470
},
{
"entropy": 6.8635218143463135,
"epoch": 0.033858436096656924,
"grad_norm": 1.234375,
"learning_rate": 0.000237,
"loss": 6.6536,
"mean_token_accuracy": 0.12101132348179817,
"num_tokens": 1081033.0,
"step": 475
},
{
"entropy": 6.913784456253052,
"epoch": 0.03421484068714805,
"grad_norm": 1.125,
"learning_rate": 0.0002395,
"loss": 6.6395,
"mean_token_accuracy": 0.12054148092865943,
"num_tokens": 1091294.0,
"step": 480
},
{
"entropy": 6.835070037841797,
"epoch": 0.034571245277639176,
"grad_norm": 1.25,
"learning_rate": 0.000242,
"loss": 6.5823,
"mean_token_accuracy": 0.12020587176084518,
"num_tokens": 1103184.0,
"step": 485
},
{
"entropy": 6.747617959976196,
"epoch": 0.0349276498681303,
"grad_norm": 1.203125,
"learning_rate": 0.0002445,
"loss": 6.6714,
"mean_token_accuracy": 0.11630546823143958,
"num_tokens": 1115141.0,
"step": 490
},
{
"entropy": 6.877911472320557,
"epoch": 0.03528405445862143,
"grad_norm": 1.1796875,
"learning_rate": 0.000247,
"loss": 6.594,
"mean_token_accuracy": 0.12337350100278854,
"num_tokens": 1126021.0,
"step": 495
},
{
"entropy": 6.950392246246338,
"epoch": 0.035640459049112554,
"grad_norm": 1.03125,
"learning_rate": 0.0002495,
"loss": 6.7084,
"mean_token_accuracy": 0.11963340565562249,
"num_tokens": 1138198.0,
"step": 500
}
],
"logging_steps": 5,
"max_steps": 4000,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1795117086720000.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}