Files
ModelHub XC 3d9ea833ff 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/eng-latn-100mb-ppt-Dp-100mb_seed3407
Source: Original Platform
2026-07-30 01:57:17 +08:00

2035 lines
54 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.07128091809822511,
"eval_steps": 500,
"global_step": 1000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.692017364501954,
"epoch": 0.0003564045904911255,
"grad_norm": 14.125,
"learning_rate": 2e-06,
"loss": 10.8367,
"mean_token_accuracy": 0.0,
"num_tokens": 11399.0,
"step": 5
},
{
"entropy": 10.691957569122314,
"epoch": 0.000712809180982251,
"grad_norm": 13.625,
"learning_rate": 4.5e-06,
"loss": 10.7639,
"mean_token_accuracy": 6.901310989633202e-05,
"num_tokens": 22686.0,
"step": 10
},
{
"entropy": 10.69105806350708,
"epoch": 0.0010692137714733766,
"grad_norm": 9.75,
"learning_rate": 7e-06,
"loss": 10.4704,
"mean_token_accuracy": 0.01642136035952717,
"num_tokens": 32728.0,
"step": 15
},
{
"entropy": 10.683691692352294,
"epoch": 0.001425618361964502,
"grad_norm": 6.34375,
"learning_rate": 9.5e-06,
"loss": 10.1573,
"mean_token_accuracy": 0.035650182887911795,
"num_tokens": 42808.0,
"step": 20
},
{
"entropy": 10.64972677230835,
"epoch": 0.0017820229524556277,
"grad_norm": 4.0625,
"learning_rate": 1.2e-05,
"loss": 9.8635,
"mean_token_accuracy": 0.035930054076015946,
"num_tokens": 54058.0,
"step": 25
},
{
"entropy": 10.611275386810302,
"epoch": 0.002138427542946753,
"grad_norm": 3.140625,
"learning_rate": 1.4500000000000002e-05,
"loss": 9.7137,
"mean_token_accuracy": 0.03763993177562952,
"num_tokens": 65338.0,
"step": 30
},
{
"entropy": 10.598550796508789,
"epoch": 0.0024948321334378786,
"grad_norm": 3.890625,
"learning_rate": 1.7000000000000003e-05,
"loss": 9.612,
"mean_token_accuracy": 0.04252670388668776,
"num_tokens": 76598.0,
"step": 35
},
{
"entropy": 10.599444103240966,
"epoch": 0.002851236723929004,
"grad_norm": 2.703125,
"learning_rate": 1.95e-05,
"loss": 9.5696,
"mean_token_accuracy": 0.04173162579536438,
"num_tokens": 87364.0,
"step": 40
},
{
"entropy": 10.571285438537597,
"epoch": 0.00320764131442013,
"grad_norm": 2.59375,
"learning_rate": 2.2e-05,
"loss": 9.5333,
"mean_token_accuracy": 0.040771466493606565,
"num_tokens": 99019.0,
"step": 45
},
{
"entropy": 10.56482973098755,
"epoch": 0.0035640459049112554,
"grad_norm": 2.5,
"learning_rate": 2.4500000000000003e-05,
"loss": 9.5004,
"mean_token_accuracy": 0.042115325853228566,
"num_tokens": 111087.0,
"step": 50
},
{
"entropy": 10.555388832092286,
"epoch": 0.00392045049540238,
"grad_norm": 2.53125,
"learning_rate": 2.7e-05,
"loss": 9.4487,
"mean_token_accuracy": 0.046751032769680026,
"num_tokens": 123401.0,
"step": 55
},
{
"entropy": 10.569499969482422,
"epoch": 0.004276855085893506,
"grad_norm": 2.578125,
"learning_rate": 2.95e-05,
"loss": 9.3385,
"mean_token_accuracy": 0.051391019485890865,
"num_tokens": 135554.0,
"step": 60
},
{
"entropy": 10.512379455566407,
"epoch": 0.004633259676384632,
"grad_norm": 2.46875,
"learning_rate": 3.2e-05,
"loss": 9.2173,
"mean_token_accuracy": 0.060007892176508905,
"num_tokens": 146700.0,
"step": 65
},
{
"entropy": 10.373568439483643,
"epoch": 0.004989664266875757,
"grad_norm": 2.3125,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.1634,
"mean_token_accuracy": 0.05574713312089443,
"num_tokens": 157606.0,
"step": 70
},
{
"entropy": 10.454727077484131,
"epoch": 0.005346068857366883,
"grad_norm": 2.296875,
"learning_rate": 3.7e-05,
"loss": 9.0943,
"mean_token_accuracy": 0.05970448292791843,
"num_tokens": 168705.0,
"step": 75
},
{
"entropy": 10.436204051971435,
"epoch": 0.005702473447858008,
"grad_norm": 2.59375,
"learning_rate": 3.95e-05,
"loss": 9.0076,
"mean_token_accuracy": 0.06562120430171489,
"num_tokens": 181497.0,
"step": 80
},
{
"entropy": 10.350591468811036,
"epoch": 0.006058878038349134,
"grad_norm": 2.59375,
"learning_rate": 4.2000000000000004e-05,
"loss": 8.8524,
"mean_token_accuracy": 0.0729046493768692,
"num_tokens": 192991.0,
"step": 85
},
{
"entropy": 10.254280471801758,
"epoch": 0.00641528262884026,
"grad_norm": 2.703125,
"learning_rate": 4.45e-05,
"loss": 8.6787,
"mean_token_accuracy": 0.0757947500795126,
"num_tokens": 203969.0,
"step": 90
},
{
"entropy": 10.204264450073243,
"epoch": 0.006771687219331385,
"grad_norm": 2.109375,
"learning_rate": 4.7000000000000004e-05,
"loss": 8.6609,
"mean_token_accuracy": 0.07682550996541977,
"num_tokens": 215809.0,
"step": 95
},
{
"entropy": 10.189391613006592,
"epoch": 0.007128091809822511,
"grad_norm": 2.109375,
"learning_rate": 4.9500000000000004e-05,
"loss": 8.5959,
"mean_token_accuracy": 0.07614239081740379,
"num_tokens": 227826.0,
"step": 100
},
{
"entropy": 10.087896060943603,
"epoch": 0.007484496400313636,
"grad_norm": 2.03125,
"learning_rate": 5.2e-05,
"loss": 8.4633,
"mean_token_accuracy": 0.08133391663432121,
"num_tokens": 240073.0,
"step": 105
},
{
"entropy": 9.981376838684081,
"epoch": 0.00784090099080476,
"grad_norm": 2.21875,
"learning_rate": 5.45e-05,
"loss": 8.2916,
"mean_token_accuracy": 0.08083986043930054,
"num_tokens": 251073.0,
"step": 110
},
{
"entropy": 9.942218494415282,
"epoch": 0.008197305581295887,
"grad_norm": 1.890625,
"learning_rate": 5.7e-05,
"loss": 8.292,
"mean_token_accuracy": 0.07924356088042259,
"num_tokens": 264607.0,
"step": 115
},
{
"entropy": 9.826002407073975,
"epoch": 0.008553710171787013,
"grad_norm": 1.8046875,
"learning_rate": 5.9499999999999996e-05,
"loss": 8.0674,
"mean_token_accuracy": 0.08344096019864082,
"num_tokens": 275688.0,
"step": 120
},
{
"entropy": 9.725812625885009,
"epoch": 0.008910114762278138,
"grad_norm": 1.75,
"learning_rate": 6.2e-05,
"loss": 7.9033,
"mean_token_accuracy": 0.08407644256949424,
"num_tokens": 287024.0,
"step": 125
},
{
"entropy": 9.538934803009033,
"epoch": 0.009266519352769264,
"grad_norm": 1.765625,
"learning_rate": 6.450000000000001e-05,
"loss": 7.8564,
"mean_token_accuracy": 0.08399767056107521,
"num_tokens": 297605.0,
"step": 130
},
{
"entropy": 9.370525646209718,
"epoch": 0.009622923943260388,
"grad_norm": 1.7734375,
"learning_rate": 6.7e-05,
"loss": 7.7135,
"mean_token_accuracy": 0.08679336085915565,
"num_tokens": 307956.0,
"step": 135
},
{
"entropy": 9.153919219970703,
"epoch": 0.009979328533751514,
"grad_norm": 1.625,
"learning_rate": 6.950000000000001e-05,
"loss": 7.5976,
"mean_token_accuracy": 0.08618754744529725,
"num_tokens": 318724.0,
"step": 140
},
{
"entropy": 8.899112701416016,
"epoch": 0.01033573312424264,
"grad_norm": 1.4375,
"learning_rate": 7.2e-05,
"loss": 7.4406,
"mean_token_accuracy": 0.08834938332438469,
"num_tokens": 330488.0,
"step": 145
},
{
"entropy": 8.675454139709473,
"epoch": 0.010692137714733766,
"grad_norm": 1.3671875,
"learning_rate": 7.45e-05,
"loss": 7.5299,
"mean_token_accuracy": 0.08864943459630012,
"num_tokens": 343057.0,
"step": 150
},
{
"entropy": 8.480731201171874,
"epoch": 0.011048542305224892,
"grad_norm": 1.390625,
"learning_rate": 7.7e-05,
"loss": 7.3532,
"mean_token_accuracy": 0.09288429766893387,
"num_tokens": 355224.0,
"step": 155
},
{
"entropy": 8.344585990905761,
"epoch": 0.011404946895716016,
"grad_norm": 1.2578125,
"learning_rate": 7.950000000000001e-05,
"loss": 7.3521,
"mean_token_accuracy": 0.09180220365524291,
"num_tokens": 366926.0,
"step": 160
},
{
"entropy": 8.18641996383667,
"epoch": 0.011761351486207142,
"grad_norm": 1.5234375,
"learning_rate": 8.2e-05,
"loss": 7.2732,
"mean_token_accuracy": 0.09202986061573029,
"num_tokens": 378180.0,
"step": 165
},
{
"entropy": 8.100344848632812,
"epoch": 0.012117756076698268,
"grad_norm": 1.6328125,
"learning_rate": 8.450000000000001e-05,
"loss": 7.3021,
"mean_token_accuracy": 0.09149679765105248,
"num_tokens": 388639.0,
"step": 170
},
{
"entropy": 7.991573286056519,
"epoch": 0.012474160667189394,
"grad_norm": 1.4609375,
"learning_rate": 8.7e-05,
"loss": 7.2275,
"mean_token_accuracy": 0.09744204580783844,
"num_tokens": 398752.0,
"step": 175
},
{
"entropy": 7.88223123550415,
"epoch": 0.01283056525768052,
"grad_norm": 1.3359375,
"learning_rate": 8.95e-05,
"loss": 7.1954,
"mean_token_accuracy": 0.09606479555368423,
"num_tokens": 411341.0,
"step": 180
},
{
"entropy": 7.8277486801147464,
"epoch": 0.013186969848171644,
"grad_norm": 1.2421875,
"learning_rate": 9.2e-05,
"loss": 7.1005,
"mean_token_accuracy": 0.09566677063703537,
"num_tokens": 421736.0,
"step": 185
},
{
"entropy": 7.860902547836304,
"epoch": 0.01354337443866277,
"grad_norm": 1.21875,
"learning_rate": 9.45e-05,
"loss": 7.1857,
"mean_token_accuracy": 0.09552413523197174,
"num_tokens": 432934.0,
"step": 190
},
{
"entropy": 7.822595310211182,
"epoch": 0.013899779029153896,
"grad_norm": 1.3359375,
"learning_rate": 9.7e-05,
"loss": 7.12,
"mean_token_accuracy": 0.10211173966526985,
"num_tokens": 442929.0,
"step": 195
},
{
"entropy": 7.693083477020264,
"epoch": 0.014256183619645021,
"grad_norm": 1.5,
"learning_rate": 9.95e-05,
"loss": 7.1199,
"mean_token_accuracy": 0.0966656155884266,
"num_tokens": 455544.0,
"step": 200
},
{
"entropy": 7.67202787399292,
"epoch": 0.014612588210136147,
"grad_norm": 1.375,
"learning_rate": 0.000102,
"loss": 7.0383,
"mean_token_accuracy": 0.10238562151789665,
"num_tokens": 466476.0,
"step": 205
},
{
"entropy": 7.641747999191284,
"epoch": 0.014968992800627271,
"grad_norm": 1.46875,
"learning_rate": 0.00010449999999999999,
"loss": 7.0423,
"mean_token_accuracy": 0.10611227676272392,
"num_tokens": 477149.0,
"step": 210
},
{
"entropy": 7.678851318359375,
"epoch": 0.015325397391118397,
"grad_norm": 1.171875,
"learning_rate": 0.000107,
"loss": 7.194,
"mean_token_accuracy": 0.09881364479660988,
"num_tokens": 489684.0,
"step": 215
},
{
"entropy": 7.6810675144195555,
"epoch": 0.01568180198160952,
"grad_norm": 1.1796875,
"learning_rate": 0.0001095,
"loss": 7.1195,
"mean_token_accuracy": 0.10285983234643936,
"num_tokens": 500724.0,
"step": 220
},
{
"entropy": 7.516607046127319,
"epoch": 0.016038206572100647,
"grad_norm": 1.484375,
"learning_rate": 0.000112,
"loss": 7.0014,
"mean_token_accuracy": 0.10714144557714463,
"num_tokens": 511301.0,
"step": 225
},
{
"entropy": 7.589178037643433,
"epoch": 0.016394611162591773,
"grad_norm": 1.640625,
"learning_rate": 0.0001145,
"loss": 7.0292,
"mean_token_accuracy": 0.0986006237566471,
"num_tokens": 522925.0,
"step": 230
},
{
"entropy": 7.550503349304199,
"epoch": 0.0167510157530829,
"grad_norm": 1.515625,
"learning_rate": 0.00011700000000000001,
"loss": 7.0411,
"mean_token_accuracy": 0.10731777027249337,
"num_tokens": 533742.0,
"step": 235
},
{
"entropy": 7.437931919097901,
"epoch": 0.017107420343574025,
"grad_norm": 1.4453125,
"learning_rate": 0.00011949999999999999,
"loss": 7.0108,
"mean_token_accuracy": 0.1048599824309349,
"num_tokens": 545526.0,
"step": 240
},
{
"entropy": 7.485028076171875,
"epoch": 0.01746382493406515,
"grad_norm": 1.3203125,
"learning_rate": 0.000122,
"loss": 6.9512,
"mean_token_accuracy": 0.10988161414861679,
"num_tokens": 555735.0,
"step": 245
},
{
"entropy": 7.441792440414429,
"epoch": 0.017820229524556277,
"grad_norm": 1.375,
"learning_rate": 0.0001245,
"loss": 7.0456,
"mean_token_accuracy": 0.10132465660572051,
"num_tokens": 568443.0,
"step": 250
},
{
"entropy": 7.456151485443115,
"epoch": 0.018176634115047403,
"grad_norm": 1.3515625,
"learning_rate": 0.000127,
"loss": 6.9256,
"mean_token_accuracy": 0.11248807981610298,
"num_tokens": 579091.0,
"step": 255
},
{
"entropy": 7.312637805938721,
"epoch": 0.01853303870553853,
"grad_norm": 1.1640625,
"learning_rate": 0.0001295,
"loss": 6.8611,
"mean_token_accuracy": 0.10876356959342956,
"num_tokens": 591683.0,
"step": 260
},
{
"entropy": 7.3945722579956055,
"epoch": 0.018889443296029654,
"grad_norm": 1.4140625,
"learning_rate": 0.000132,
"loss": 6.9957,
"mean_token_accuracy": 0.10596117228269578,
"num_tokens": 603464.0,
"step": 265
},
{
"entropy": 7.438564348220825,
"epoch": 0.019245847886520777,
"grad_norm": 1.34375,
"learning_rate": 0.00013450000000000002,
"loss": 7.0678,
"mean_token_accuracy": 0.104298285394907,
"num_tokens": 615626.0,
"step": 270
},
{
"entropy": 7.447065210342407,
"epoch": 0.019602252477011903,
"grad_norm": 1.2890625,
"learning_rate": 0.00013700000000000002,
"loss": 6.9806,
"mean_token_accuracy": 0.10557826459407807,
"num_tokens": 627270.0,
"step": 275
},
{
"entropy": 7.331842660903931,
"epoch": 0.01995865706750303,
"grad_norm": 1.2109375,
"learning_rate": 0.0001395,
"loss": 6.8978,
"mean_token_accuracy": 0.11048185899853706,
"num_tokens": 638403.0,
"step": 280
},
{
"entropy": 7.369898748397827,
"epoch": 0.020315061657994155,
"grad_norm": 1.078125,
"learning_rate": 0.00014199999999999998,
"loss": 6.9043,
"mean_token_accuracy": 0.11137154400348663,
"num_tokens": 650046.0,
"step": 285
},
{
"entropy": 7.282534790039063,
"epoch": 0.02067146624848528,
"grad_norm": 1.375,
"learning_rate": 0.0001445,
"loss": 6.8625,
"mean_token_accuracy": 0.11072641685605049,
"num_tokens": 659818.0,
"step": 290
},
{
"entropy": 7.2380547523498535,
"epoch": 0.021027870838976406,
"grad_norm": 1.0703125,
"learning_rate": 0.000147,
"loss": 6.8756,
"mean_token_accuracy": 0.11218505501747131,
"num_tokens": 672404.0,
"step": 295
},
{
"entropy": 7.28413872718811,
"epoch": 0.021384275429467532,
"grad_norm": 1.15625,
"learning_rate": 0.0001495,
"loss": 6.8657,
"mean_token_accuracy": 0.10923274457454682,
"num_tokens": 684048.0,
"step": 300
},
{
"entropy": 7.311151695251465,
"epoch": 0.021740680019958658,
"grad_norm": 1.625,
"learning_rate": 0.000152,
"loss": 6.8738,
"mean_token_accuracy": 0.10937001630663871,
"num_tokens": 694590.0,
"step": 305
},
{
"entropy": 7.160674905776977,
"epoch": 0.022097084610449784,
"grad_norm": 1.1640625,
"learning_rate": 0.00015450000000000001,
"loss": 6.7966,
"mean_token_accuracy": 0.1082501120865345,
"num_tokens": 706949.0,
"step": 310
},
{
"entropy": 7.300990581512451,
"epoch": 0.02245348920094091,
"grad_norm": 1.203125,
"learning_rate": 0.000157,
"loss": 6.9186,
"mean_token_accuracy": 0.1130599781870842,
"num_tokens": 717400.0,
"step": 315
},
{
"entropy": 7.261720275878906,
"epoch": 0.022809893791432032,
"grad_norm": 1.2734375,
"learning_rate": 0.0001595,
"loss": 6.8517,
"mean_token_accuracy": 0.11169279888272285,
"num_tokens": 728842.0,
"step": 320
},
{
"entropy": 7.1845160007476805,
"epoch": 0.023166298381923158,
"grad_norm": 1.1484375,
"learning_rate": 0.000162,
"loss": 6.8315,
"mean_token_accuracy": 0.1084785707294941,
"num_tokens": 740598.0,
"step": 325
},
{
"entropy": 7.230294179916382,
"epoch": 0.023522702972414284,
"grad_norm": 1.1484375,
"learning_rate": 0.00016450000000000001,
"loss": 6.8676,
"mean_token_accuracy": 0.11259512975811958,
"num_tokens": 752512.0,
"step": 330
},
{
"entropy": 7.300836181640625,
"epoch": 0.02387910756290541,
"grad_norm": 1.1796875,
"learning_rate": 0.00016700000000000002,
"loss": 6.9408,
"mean_token_accuracy": 0.10492971390485764,
"num_tokens": 764679.0,
"step": 335
},
{
"entropy": 7.184459400177002,
"epoch": 0.024235512153396536,
"grad_norm": 1.3359375,
"learning_rate": 0.00016950000000000003,
"loss": 6.9801,
"mean_token_accuracy": 0.11560937166213989,
"num_tokens": 776267.0,
"step": 340
},
{
"entropy": 7.161315059661865,
"epoch": 0.02459191674388766,
"grad_norm": 1.078125,
"learning_rate": 0.00017199999999999998,
"loss": 6.7515,
"mean_token_accuracy": 0.12069559693336487,
"num_tokens": 788178.0,
"step": 345
},
{
"entropy": 7.21292634010315,
"epoch": 0.024948321334378788,
"grad_norm": 1.2421875,
"learning_rate": 0.00017449999999999999,
"loss": 6.8638,
"mean_token_accuracy": 0.11443236991763114,
"num_tokens": 798643.0,
"step": 350
},
{
"entropy": 7.162191772460938,
"epoch": 0.025304725924869913,
"grad_norm": 1.375,
"learning_rate": 0.000177,
"loss": 6.8749,
"mean_token_accuracy": 0.11219770759344101,
"num_tokens": 809448.0,
"step": 355
},
{
"entropy": 7.070344543457031,
"epoch": 0.02566113051536104,
"grad_norm": 1.328125,
"learning_rate": 0.0001795,
"loss": 6.8172,
"mean_token_accuracy": 0.11555075868964196,
"num_tokens": 821107.0,
"step": 360
},
{
"entropy": 7.131128549575806,
"epoch": 0.02601753510585216,
"grad_norm": 1.2734375,
"learning_rate": 0.000182,
"loss": 6.7602,
"mean_token_accuracy": 0.11315757408738136,
"num_tokens": 832800.0,
"step": 365
},
{
"entropy": 7.158021736145019,
"epoch": 0.026373939696343288,
"grad_norm": 1.2890625,
"learning_rate": 0.0001845,
"loss": 6.811,
"mean_token_accuracy": 0.11933915168046952,
"num_tokens": 845207.0,
"step": 370
},
{
"entropy": 7.099034166336059,
"epoch": 0.026730344286834413,
"grad_norm": 1.1796875,
"learning_rate": 0.000187,
"loss": 6.8469,
"mean_token_accuracy": 0.11549493819475173,
"num_tokens": 857270.0,
"step": 375
},
{
"entropy": 7.05969123840332,
"epoch": 0.02708674887732554,
"grad_norm": 1.28125,
"learning_rate": 0.0001895,
"loss": 6.7642,
"mean_token_accuracy": 0.11390233710408211,
"num_tokens": 867892.0,
"step": 380
},
{
"entropy": 7.056723403930664,
"epoch": 0.027443153467816665,
"grad_norm": 1.0546875,
"learning_rate": 0.000192,
"loss": 6.6796,
"mean_token_accuracy": 0.11220178827643394,
"num_tokens": 879516.0,
"step": 385
},
{
"entropy": 7.027820062637329,
"epoch": 0.02779955805830779,
"grad_norm": 1.2421875,
"learning_rate": 0.0001945,
"loss": 6.6856,
"mean_token_accuracy": 0.11767275109887124,
"num_tokens": 889693.0,
"step": 390
},
{
"entropy": 6.93689923286438,
"epoch": 0.028155962648798917,
"grad_norm": 1.171875,
"learning_rate": 0.00019700000000000002,
"loss": 6.716,
"mean_token_accuracy": 0.11856673210859299,
"num_tokens": 901591.0,
"step": 395
},
{
"entropy": 7.036142110824585,
"epoch": 0.028512367239290043,
"grad_norm": 1.234375,
"learning_rate": 0.00019950000000000002,
"loss": 6.6789,
"mean_token_accuracy": 0.11616217717528343,
"num_tokens": 912146.0,
"step": 400
},
{
"entropy": 6.947995281219482,
"epoch": 0.02886877182978117,
"grad_norm": 1.0703125,
"learning_rate": 0.000202,
"loss": 6.5378,
"mean_token_accuracy": 0.12628986611962317,
"num_tokens": 923219.0,
"step": 405
},
{
"entropy": 6.915331506729126,
"epoch": 0.029225176420272295,
"grad_norm": 1.390625,
"learning_rate": 0.00020449999999999998,
"loss": 6.5891,
"mean_token_accuracy": 0.1272263564169407,
"num_tokens": 934330.0,
"step": 410
},
{
"entropy": 6.956090450286865,
"epoch": 0.029581581010763417,
"grad_norm": 1.1640625,
"learning_rate": 0.000207,
"loss": 6.6703,
"mean_token_accuracy": 0.12228544279932976,
"num_tokens": 944993.0,
"step": 415
},
{
"entropy": 7.0030059814453125,
"epoch": 0.029937985601254543,
"grad_norm": 1.234375,
"learning_rate": 0.0002095,
"loss": 6.7281,
"mean_token_accuracy": 0.12065548226237297,
"num_tokens": 955746.0,
"step": 420
},
{
"entropy": 7.023007392883301,
"epoch": 0.03029439019174567,
"grad_norm": 1.203125,
"learning_rate": 0.000212,
"loss": 6.7385,
"mean_token_accuracy": 0.122479547560215,
"num_tokens": 966600.0,
"step": 425
},
{
"entropy": 6.893257761001587,
"epoch": 0.030650794782236795,
"grad_norm": 1.15625,
"learning_rate": 0.0002145,
"loss": 6.731,
"mean_token_accuracy": 0.1273415558040142,
"num_tokens": 976984.0,
"step": 430
},
{
"entropy": 7.020415782928467,
"epoch": 0.03100719937272792,
"grad_norm": 1.1484375,
"learning_rate": 0.00021700000000000002,
"loss": 6.7715,
"mean_token_accuracy": 0.1136875256896019,
"num_tokens": 990221.0,
"step": 435
},
{
"entropy": 6.892011499404907,
"epoch": 0.03136360396321904,
"grad_norm": 1.1640625,
"learning_rate": 0.0002195,
"loss": 6.6491,
"mean_token_accuracy": 0.11894271299242973,
"num_tokens": 1001583.0,
"step": 440
},
{
"entropy": 6.992098093032837,
"epoch": 0.03172000855371017,
"grad_norm": 1.28125,
"learning_rate": 0.000222,
"loss": 6.595,
"mean_token_accuracy": 0.1258418917655945,
"num_tokens": 1012170.0,
"step": 445
},
{
"entropy": 6.916194820404053,
"epoch": 0.032076413144201295,
"grad_norm": 1.421875,
"learning_rate": 0.0002245,
"loss": 6.6358,
"mean_token_accuracy": 0.11565389856696129,
"num_tokens": 1022948.0,
"step": 450
},
{
"entropy": 6.822894620895386,
"epoch": 0.03243281773469242,
"grad_norm": 1.0703125,
"learning_rate": 0.00022700000000000002,
"loss": 6.6369,
"mean_token_accuracy": 0.12339216992259025,
"num_tokens": 1034764.0,
"step": 455
},
{
"entropy": 6.846291399002075,
"epoch": 0.03278922232518355,
"grad_norm": 1.1640625,
"learning_rate": 0.00022950000000000002,
"loss": 6.6751,
"mean_token_accuracy": 0.123189727216959,
"num_tokens": 1046485.0,
"step": 460
},
{
"entropy": 6.8924657821655275,
"epoch": 0.03314562691567467,
"grad_norm": 1.1171875,
"learning_rate": 0.00023200000000000003,
"loss": 6.6122,
"mean_token_accuracy": 0.11978656575083732,
"num_tokens": 1057819.0,
"step": 465
},
{
"entropy": 6.885383605957031,
"epoch": 0.0335020315061658,
"grad_norm": 1.296875,
"learning_rate": 0.00023449999999999998,
"loss": 6.6677,
"mean_token_accuracy": 0.1239581860601902,
"num_tokens": 1068905.0,
"step": 470
},
{
"entropy": 6.8635218143463135,
"epoch": 0.033858436096656924,
"grad_norm": 1.234375,
"learning_rate": 0.000237,
"loss": 6.6536,
"mean_token_accuracy": 0.12101132348179817,
"num_tokens": 1081033.0,
"step": 475
},
{
"entropy": 6.913784456253052,
"epoch": 0.03421484068714805,
"grad_norm": 1.125,
"learning_rate": 0.0002395,
"loss": 6.6395,
"mean_token_accuracy": 0.12054148092865943,
"num_tokens": 1091294.0,
"step": 480
},
{
"entropy": 6.835070037841797,
"epoch": 0.034571245277639176,
"grad_norm": 1.25,
"learning_rate": 0.000242,
"loss": 6.5823,
"mean_token_accuracy": 0.12020587176084518,
"num_tokens": 1103184.0,
"step": 485
},
{
"entropy": 6.747617959976196,
"epoch": 0.0349276498681303,
"grad_norm": 1.203125,
"learning_rate": 0.0002445,
"loss": 6.6714,
"mean_token_accuracy": 0.11630546823143958,
"num_tokens": 1115141.0,
"step": 490
},
{
"entropy": 6.877911472320557,
"epoch": 0.03528405445862143,
"grad_norm": 1.1796875,
"learning_rate": 0.000247,
"loss": 6.594,
"mean_token_accuracy": 0.12337350100278854,
"num_tokens": 1126021.0,
"step": 495
},
{
"entropy": 6.950392246246338,
"epoch": 0.035640459049112554,
"grad_norm": 1.03125,
"learning_rate": 0.0002495,
"loss": 6.7084,
"mean_token_accuracy": 0.11963340565562249,
"num_tokens": 1138198.0,
"step": 500
},
{
"entropy": 6.821749448776245,
"epoch": 0.03599686363960368,
"grad_norm": 1.28125,
"learning_rate": 0.000252,
"loss": 6.6156,
"mean_token_accuracy": 0.12002535238862037,
"num_tokens": 1149477.0,
"step": 505
},
{
"entropy": 6.788367557525635,
"epoch": 0.036353268230094805,
"grad_norm": 1.1796875,
"learning_rate": 0.0002545,
"loss": 6.5983,
"mean_token_accuracy": 0.12122073546051979,
"num_tokens": 1160088.0,
"step": 510
},
{
"entropy": 6.818660545349121,
"epoch": 0.03670967282058593,
"grad_norm": 1.1484375,
"learning_rate": 0.000257,
"loss": 6.5689,
"mean_token_accuracy": 0.1215900219976902,
"num_tokens": 1171592.0,
"step": 515
},
{
"entropy": 6.684890222549439,
"epoch": 0.03706607741107706,
"grad_norm": 1.25,
"learning_rate": 0.0002595,
"loss": 6.4421,
"mean_token_accuracy": 0.12829117700457573,
"num_tokens": 1182696.0,
"step": 520
},
{
"entropy": 6.7838616371154785,
"epoch": 0.03742248200156818,
"grad_norm": 0.98046875,
"learning_rate": 0.000262,
"loss": 6.5508,
"mean_token_accuracy": 0.12244702428579331,
"num_tokens": 1194334.0,
"step": 525
},
{
"entropy": 6.795234823226929,
"epoch": 0.03777888659205931,
"grad_norm": 0.9609375,
"learning_rate": 0.00026450000000000003,
"loss": 6.6407,
"mean_token_accuracy": 0.12377305775880813,
"num_tokens": 1206258.0,
"step": 530
},
{
"entropy": 6.711533164978027,
"epoch": 0.03813529118255043,
"grad_norm": 1.109375,
"learning_rate": 0.00026700000000000004,
"loss": 6.5593,
"mean_token_accuracy": 0.1248534381389618,
"num_tokens": 1219233.0,
"step": 535
},
{
"entropy": 6.751263809204102,
"epoch": 0.038491695773041554,
"grad_norm": 1.2578125,
"learning_rate": 0.00026950000000000005,
"loss": 6.5907,
"mean_token_accuracy": 0.12478451505303383,
"num_tokens": 1230581.0,
"step": 540
},
{
"entropy": 6.797735548019409,
"epoch": 0.03884810036353268,
"grad_norm": 1.171875,
"learning_rate": 0.00027200000000000005,
"loss": 6.5787,
"mean_token_accuracy": 0.12564107850193978,
"num_tokens": 1242046.0,
"step": 545
},
{
"entropy": 6.824971294403076,
"epoch": 0.039204504954023806,
"grad_norm": 1.1953125,
"learning_rate": 0.0002745,
"loss": 6.5802,
"mean_token_accuracy": 0.12138499319553375,
"num_tokens": 1254167.0,
"step": 550
},
{
"entropy": 6.7520105838775635,
"epoch": 0.03956090954451493,
"grad_norm": 1.265625,
"learning_rate": 0.000277,
"loss": 6.5764,
"mean_token_accuracy": 0.1260920248925686,
"num_tokens": 1265613.0,
"step": 555
},
{
"entropy": 6.812003946304321,
"epoch": 0.03991731413500606,
"grad_norm": 1.1796875,
"learning_rate": 0.0002795,
"loss": 6.6682,
"mean_token_accuracy": 0.11812930405139924,
"num_tokens": 1277347.0,
"step": 560
},
{
"entropy": 6.747121286392212,
"epoch": 0.04027371872549718,
"grad_norm": 1.109375,
"learning_rate": 0.00028199999999999997,
"loss": 6.5691,
"mean_token_accuracy": 0.12312827929854393,
"num_tokens": 1289523.0,
"step": 565
},
{
"entropy": 6.6098151206970215,
"epoch": 0.04063012331598831,
"grad_norm": 1.03125,
"learning_rate": 0.0002845,
"loss": 6.4979,
"mean_token_accuracy": 0.1243820309638977,
"num_tokens": 1302811.0,
"step": 570
},
{
"entropy": 6.7549159049987795,
"epoch": 0.040986527906479435,
"grad_norm": 1.203125,
"learning_rate": 0.000287,
"loss": 6.5263,
"mean_token_accuracy": 0.1290876366198063,
"num_tokens": 1313312.0,
"step": 575
},
{
"entropy": 6.687855625152588,
"epoch": 0.04134293249697056,
"grad_norm": 1.265625,
"learning_rate": 0.0002895,
"loss": 6.4392,
"mean_token_accuracy": 0.13016564697027205,
"num_tokens": 1324211.0,
"step": 580
},
{
"entropy": 6.756774044036865,
"epoch": 0.04169933708746169,
"grad_norm": 1.1484375,
"learning_rate": 0.000292,
"loss": 6.5125,
"mean_token_accuracy": 0.12907068356871604,
"num_tokens": 1334630.0,
"step": 585
},
{
"entropy": 6.6873047828674315,
"epoch": 0.04205574167795281,
"grad_norm": 1.2421875,
"learning_rate": 0.0002945,
"loss": 6.6081,
"mean_token_accuracy": 0.1214562140405178,
"num_tokens": 1346765.0,
"step": 590
},
{
"entropy": 6.665805673599243,
"epoch": 0.04241214626844394,
"grad_norm": 1.0390625,
"learning_rate": 0.000297,
"loss": 6.5212,
"mean_token_accuracy": 0.12480536177754402,
"num_tokens": 1358328.0,
"step": 595
},
{
"entropy": 6.735954523086548,
"epoch": 0.042768550858935064,
"grad_norm": 1.125,
"learning_rate": 0.0002995,
"loss": 6.4598,
"mean_token_accuracy": 0.12877192124724388,
"num_tokens": 1369679.0,
"step": 600
},
{
"entropy": 6.522557735443115,
"epoch": 0.04312495544942619,
"grad_norm": 1.15625,
"learning_rate": 0.000302,
"loss": 6.4563,
"mean_token_accuracy": 0.12848613560199737,
"num_tokens": 1380819.0,
"step": 605
},
{
"entropy": 6.631491756439209,
"epoch": 0.043481360039917316,
"grad_norm": 1.1796875,
"learning_rate": 0.0003045,
"loss": 6.411,
"mean_token_accuracy": 0.13062736690044402,
"num_tokens": 1391634.0,
"step": 610
},
{
"entropy": 6.529157543182373,
"epoch": 0.04383776463040844,
"grad_norm": 1.203125,
"learning_rate": 0.000307,
"loss": 6.4015,
"mean_token_accuracy": 0.13542434126138686,
"num_tokens": 1403502.0,
"step": 615
},
{
"entropy": 6.693103885650634,
"epoch": 0.04419416922089957,
"grad_norm": 1.328125,
"learning_rate": 0.0003095,
"loss": 6.5811,
"mean_token_accuracy": 0.12361188158392906,
"num_tokens": 1415154.0,
"step": 620
},
{
"entropy": 6.804668426513672,
"epoch": 0.044550573811390694,
"grad_norm": 1.1953125,
"learning_rate": 0.000312,
"loss": 6.6181,
"mean_token_accuracy": 0.12486119493842125,
"num_tokens": 1427373.0,
"step": 625
},
{
"entropy": 6.5153413772583,
"epoch": 0.04490697840188182,
"grad_norm": 1.1796875,
"learning_rate": 0.0003145,
"loss": 6.4316,
"mean_token_accuracy": 0.12452183067798614,
"num_tokens": 1438366.0,
"step": 630
},
{
"entropy": 6.685751962661743,
"epoch": 0.04526338299237294,
"grad_norm": 1.234375,
"learning_rate": 0.000317,
"loss": 6.551,
"mean_token_accuracy": 0.12643099054694176,
"num_tokens": 1450263.0,
"step": 635
},
{
"entropy": 6.753390741348267,
"epoch": 0.045619787582864064,
"grad_norm": 1.0078125,
"learning_rate": 0.0003195,
"loss": 6.6029,
"mean_token_accuracy": 0.12731706649065017,
"num_tokens": 1461545.0,
"step": 640
},
{
"entropy": 6.5972900390625,
"epoch": 0.04597619217335519,
"grad_norm": 1.203125,
"learning_rate": 0.000322,
"loss": 6.4952,
"mean_token_accuracy": 0.13171270489692688,
"num_tokens": 1472475.0,
"step": 645
},
{
"entropy": 6.6490813255310055,
"epoch": 0.046332596763846316,
"grad_norm": 1.1953125,
"learning_rate": 0.00032450000000000003,
"loss": 6.466,
"mean_token_accuracy": 0.12866560816764833,
"num_tokens": 1483360.0,
"step": 650
},
{
"entropy": 6.536572408676148,
"epoch": 0.04668900135433744,
"grad_norm": 1.1171875,
"learning_rate": 0.00032700000000000003,
"loss": 6.5461,
"mean_token_accuracy": 0.12317833974957466,
"num_tokens": 1495306.0,
"step": 655
},
{
"entropy": 6.694786024093628,
"epoch": 0.04704540594482857,
"grad_norm": 1.25,
"learning_rate": 0.00032950000000000004,
"loss": 6.4381,
"mean_token_accuracy": 0.12758397534489632,
"num_tokens": 1506595.0,
"step": 660
},
{
"entropy": 6.465610027313232,
"epoch": 0.047401810535319694,
"grad_norm": 1.0859375,
"learning_rate": 0.00033200000000000005,
"loss": 6.463,
"mean_token_accuracy": 0.13299945294857024,
"num_tokens": 1517657.0,
"step": 665
},
{
"entropy": 6.560718393325805,
"epoch": 0.04775821512581082,
"grad_norm": 1.1953125,
"learning_rate": 0.00033450000000000005,
"loss": 6.4709,
"mean_token_accuracy": 0.12701933905482293,
"num_tokens": 1528780.0,
"step": 670
},
{
"entropy": 6.673565006256103,
"epoch": 0.048114619716301946,
"grad_norm": 1.3203125,
"learning_rate": 0.000337,
"loss": 6.6255,
"mean_token_accuracy": 0.12928676679730416,
"num_tokens": 1541282.0,
"step": 675
},
{
"entropy": 6.723560523986817,
"epoch": 0.04847102430679307,
"grad_norm": 1.0703125,
"learning_rate": 0.0003395,
"loss": 6.5933,
"mean_token_accuracy": 0.12618897408246993,
"num_tokens": 1552176.0,
"step": 680
},
{
"entropy": 6.5214701175689695,
"epoch": 0.0488274288972842,
"grad_norm": 1.203125,
"learning_rate": 0.000342,
"loss": 6.4551,
"mean_token_accuracy": 0.13662071749567986,
"num_tokens": 1562610.0,
"step": 685
},
{
"entropy": 6.6679027557373045,
"epoch": 0.04918383348777532,
"grad_norm": 1.078125,
"learning_rate": 0.00034449999999999997,
"loss": 6.4894,
"mean_token_accuracy": 0.12981411963701248,
"num_tokens": 1573800.0,
"step": 690
},
{
"entropy": 6.63905701637268,
"epoch": 0.04954023807826645,
"grad_norm": 1.15625,
"learning_rate": 0.000347,
"loss": 6.4374,
"mean_token_accuracy": 0.12991899773478507,
"num_tokens": 1584090.0,
"step": 695
},
{
"entropy": 6.625251626968383,
"epoch": 0.049896642668757575,
"grad_norm": 1.1015625,
"learning_rate": 0.0003495,
"loss": 6.5999,
"mean_token_accuracy": 0.12750338912010192,
"num_tokens": 1595784.0,
"step": 700
},
{
"entropy": 6.614082956314087,
"epoch": 0.0502530472592487,
"grad_norm": 1.0859375,
"learning_rate": 0.000352,
"loss": 6.4354,
"mean_token_accuracy": 0.1324896700680256,
"num_tokens": 1607655.0,
"step": 705
},
{
"entropy": 6.614631175994873,
"epoch": 0.05060945184973983,
"grad_norm": 0.9921875,
"learning_rate": 0.0003545,
"loss": 6.5556,
"mean_token_accuracy": 0.12384111508727073,
"num_tokens": 1619488.0,
"step": 710
},
{
"entropy": 6.53868260383606,
"epoch": 0.05096585644023095,
"grad_norm": 0.98828125,
"learning_rate": 0.000357,
"loss": 6.3805,
"mean_token_accuracy": 0.13853650614619256,
"num_tokens": 1631854.0,
"step": 715
},
{
"entropy": 6.495734786987304,
"epoch": 0.05132226103072208,
"grad_norm": 1.046875,
"learning_rate": 0.0003595,
"loss": 6.3798,
"mean_token_accuracy": 0.13574498295783996,
"num_tokens": 1643039.0,
"step": 720
},
{
"entropy": 6.593002891540527,
"epoch": 0.051678665621213205,
"grad_norm": 1.2578125,
"learning_rate": 0.000362,
"loss": 6.3716,
"mean_token_accuracy": 0.1352020263671875,
"num_tokens": 1654398.0,
"step": 725
},
{
"entropy": 6.432076501846313,
"epoch": 0.05203507021170432,
"grad_norm": 1.1328125,
"learning_rate": 0.0003645,
"loss": 6.4133,
"mean_token_accuracy": 0.12993604987859725,
"num_tokens": 1665853.0,
"step": 730
},
{
"entropy": 6.516031074523926,
"epoch": 0.05239147480219545,
"grad_norm": 1.0390625,
"learning_rate": 0.000367,
"loss": 6.4928,
"mean_token_accuracy": 0.1255275346338749,
"num_tokens": 1677116.0,
"step": 735
},
{
"entropy": 6.595679378509521,
"epoch": 0.052747879392686575,
"grad_norm": 1.0390625,
"learning_rate": 0.0003695,
"loss": 6.4301,
"mean_token_accuracy": 0.12602694407105447,
"num_tokens": 1688429.0,
"step": 740
},
{
"entropy": 6.47861385345459,
"epoch": 0.0531042839831777,
"grad_norm": 1.1640625,
"learning_rate": 0.000372,
"loss": 6.3769,
"mean_token_accuracy": 0.12989522889256477,
"num_tokens": 1698462.0,
"step": 745
},
{
"entropy": 6.642209720611572,
"epoch": 0.05346068857366883,
"grad_norm": 1.0078125,
"learning_rate": 0.0003745,
"loss": 6.5421,
"mean_token_accuracy": 0.1301214426755905,
"num_tokens": 1710856.0,
"step": 750
},
{
"entropy": 6.543574380874634,
"epoch": 0.05381709316415995,
"grad_norm": 1.1484375,
"learning_rate": 0.000377,
"loss": 6.4566,
"mean_token_accuracy": 0.13353927284479142,
"num_tokens": 1721241.0,
"step": 755
},
{
"entropy": 6.576838397979737,
"epoch": 0.05417349775465108,
"grad_norm": 1.1171875,
"learning_rate": 0.0003795,
"loss": 6.5306,
"mean_token_accuracy": 0.12337611317634582,
"num_tokens": 1733352.0,
"step": 760
},
{
"entropy": 6.447806310653687,
"epoch": 0.054529902345142205,
"grad_norm": 1.109375,
"learning_rate": 0.000382,
"loss": 6.4116,
"mean_token_accuracy": 0.1302800454199314,
"num_tokens": 1744935.0,
"step": 765
},
{
"entropy": 6.540251922607422,
"epoch": 0.05488630693563333,
"grad_norm": 1.2109375,
"learning_rate": 0.0003845,
"loss": 6.5281,
"mean_token_accuracy": 0.1278146781027317,
"num_tokens": 1756853.0,
"step": 770
},
{
"entropy": 6.521353387832642,
"epoch": 0.055242711526124456,
"grad_norm": 1.09375,
"learning_rate": 0.00038700000000000003,
"loss": 6.4064,
"mean_token_accuracy": 0.12865520864725113,
"num_tokens": 1768563.0,
"step": 775
},
{
"entropy": 6.503901243209839,
"epoch": 0.05559911611661558,
"grad_norm": 0.96875,
"learning_rate": 0.00038950000000000003,
"loss": 6.443,
"mean_token_accuracy": 0.13027106374502181,
"num_tokens": 1781122.0,
"step": 780
},
{
"entropy": 6.572109794616699,
"epoch": 0.05595552070710671,
"grad_norm": 1.09375,
"learning_rate": 0.00039200000000000004,
"loss": 6.4716,
"mean_token_accuracy": 0.1295333534479141,
"num_tokens": 1792844.0,
"step": 785
},
{
"entropy": 6.585176658630371,
"epoch": 0.056311925297597834,
"grad_norm": 1.0703125,
"learning_rate": 0.00039450000000000005,
"loss": 6.564,
"mean_token_accuracy": 0.1305658407509327,
"num_tokens": 1804558.0,
"step": 790
},
{
"entropy": 6.422967195510864,
"epoch": 0.05666832988808896,
"grad_norm": 0.98828125,
"learning_rate": 0.00039700000000000005,
"loss": 6.3578,
"mean_token_accuracy": 0.13267487660050392,
"num_tokens": 1818413.0,
"step": 795
},
{
"entropy": 6.533610534667969,
"epoch": 0.057024734478580086,
"grad_norm": 0.97265625,
"learning_rate": 0.0003995,
"loss": 6.4071,
"mean_token_accuracy": 0.1327553428709507,
"num_tokens": 1828987.0,
"step": 800
},
{
"entropy": 6.436796951293945,
"epoch": 0.05738113906907121,
"grad_norm": 1.1796875,
"learning_rate": 0.000402,
"loss": 6.324,
"mean_token_accuracy": 0.13091181069612504,
"num_tokens": 1839797.0,
"step": 805
},
{
"entropy": 6.594801616668701,
"epoch": 0.05773754365956234,
"grad_norm": 1.0859375,
"learning_rate": 0.0004045,
"loss": 6.541,
"mean_token_accuracy": 0.13109391555190086,
"num_tokens": 1850979.0,
"step": 810
},
{
"entropy": 6.371268939971924,
"epoch": 0.05809394825005346,
"grad_norm": 1.03125,
"learning_rate": 0.00040699999999999997,
"loss": 6.317,
"mean_token_accuracy": 0.12867073565721512,
"num_tokens": 1862328.0,
"step": 815
},
{
"entropy": 6.467564868927002,
"epoch": 0.05845035284054459,
"grad_norm": 1.203125,
"learning_rate": 0.0004095,
"loss": 6.2482,
"mean_token_accuracy": 0.13217326626181602,
"num_tokens": 1872347.0,
"step": 820
},
{
"entropy": 6.463844585418701,
"epoch": 0.05880675743103571,
"grad_norm": 1.109375,
"learning_rate": 0.000412,
"loss": 6.4967,
"mean_token_accuracy": 0.13336380571126938,
"num_tokens": 1883523.0,
"step": 825
},
{
"entropy": 6.43877911567688,
"epoch": 0.059163162021526834,
"grad_norm": 0.9453125,
"learning_rate": 0.0004145,
"loss": 6.4509,
"mean_token_accuracy": 0.12890932485461234,
"num_tokens": 1895686.0,
"step": 830
},
{
"entropy": 6.565287065505982,
"epoch": 0.05951956661201796,
"grad_norm": 1.1875,
"learning_rate": 0.000417,
"loss": 6.5354,
"mean_token_accuracy": 0.13073515892028809,
"num_tokens": 1908262.0,
"step": 835
},
{
"entropy": 6.518001508712769,
"epoch": 0.059875971202509086,
"grad_norm": 1.1953125,
"learning_rate": 0.0004195,
"loss": 6.4302,
"mean_token_accuracy": 0.13468318432569504,
"num_tokens": 1919907.0,
"step": 840
},
{
"entropy": 6.460860633850098,
"epoch": 0.06023237579300021,
"grad_norm": 1.0625,
"learning_rate": 0.000422,
"loss": 6.3553,
"mean_token_accuracy": 0.13497007563710212,
"num_tokens": 1931671.0,
"step": 845
},
{
"entropy": 6.485175657272339,
"epoch": 0.06058878038349134,
"grad_norm": 1.1328125,
"learning_rate": 0.0004245,
"loss": 6.3805,
"mean_token_accuracy": 0.13863845989108087,
"num_tokens": 1941687.0,
"step": 850
},
{
"entropy": 6.483077478408814,
"epoch": 0.060945184973982464,
"grad_norm": 1.1015625,
"learning_rate": 0.000427,
"loss": 6.406,
"mean_token_accuracy": 0.12826280370354654,
"num_tokens": 1953444.0,
"step": 855
},
{
"entropy": 6.402612495422363,
"epoch": 0.06130158956447359,
"grad_norm": 1.1484375,
"learning_rate": 0.0004295,
"loss": 6.401,
"mean_token_accuracy": 0.12523565962910652,
"num_tokens": 1964999.0,
"step": 860
},
{
"entropy": 6.489323329925537,
"epoch": 0.061657994154964715,
"grad_norm": 1.0625,
"learning_rate": 0.000432,
"loss": 6.4444,
"mean_token_accuracy": 0.12409620508551597,
"num_tokens": 1977452.0,
"step": 865
},
{
"entropy": 6.5719421863555905,
"epoch": 0.06201439874545584,
"grad_norm": 1.140625,
"learning_rate": 0.0004345,
"loss": 6.5375,
"mean_token_accuracy": 0.12561874836683273,
"num_tokens": 1988362.0,
"step": 870
},
{
"entropy": 6.32892746925354,
"epoch": 0.06237080333594697,
"grad_norm": 1.1171875,
"learning_rate": 0.000437,
"loss": 6.3076,
"mean_token_accuracy": 0.13660703897476195,
"num_tokens": 2000201.0,
"step": 875
},
{
"entropy": 6.469229078292846,
"epoch": 0.06272720792643809,
"grad_norm": 1.0078125,
"learning_rate": 0.0004395,
"loss": 6.4013,
"mean_token_accuracy": 0.12952255308628083,
"num_tokens": 2011944.0,
"step": 880
},
{
"entropy": 6.445242691040039,
"epoch": 0.06308361251692922,
"grad_norm": 1.09375,
"learning_rate": 0.000442,
"loss": 6.4476,
"mean_token_accuracy": 0.13307790830731392,
"num_tokens": 2023630.0,
"step": 885
},
{
"entropy": 6.44045844078064,
"epoch": 0.06344001710742034,
"grad_norm": 0.9765625,
"learning_rate": 0.0004445,
"loss": 6.4136,
"mean_token_accuracy": 0.12842540666460991,
"num_tokens": 2036171.0,
"step": 890
},
{
"entropy": 6.439805173873902,
"epoch": 0.06379642169791147,
"grad_norm": 0.890625,
"learning_rate": 0.000447,
"loss": 6.438,
"mean_token_accuracy": 0.13159651011228563,
"num_tokens": 2049504.0,
"step": 895
},
{
"entropy": 6.405153512954712,
"epoch": 0.06415282628840259,
"grad_norm": 1.328125,
"learning_rate": 0.00044950000000000003,
"loss": 6.3627,
"mean_token_accuracy": 0.1326387383043766,
"num_tokens": 2059325.0,
"step": 900
},
{
"entropy": 6.525048160552979,
"epoch": 0.06450923087889372,
"grad_norm": 1.15625,
"learning_rate": 0.00045200000000000004,
"loss": 6.4356,
"mean_token_accuracy": 0.13329405188560486,
"num_tokens": 2070412.0,
"step": 905
},
{
"entropy": 6.537260293960571,
"epoch": 0.06486563546938484,
"grad_norm": 1.15625,
"learning_rate": 0.00045450000000000004,
"loss": 6.4373,
"mean_token_accuracy": 0.13315050303936005,
"num_tokens": 2080236.0,
"step": 910
},
{
"entropy": 6.283264064788819,
"epoch": 0.06522204005987597,
"grad_norm": 1.0546875,
"learning_rate": 0.00045700000000000005,
"loss": 6.3515,
"mean_token_accuracy": 0.1297558829188347,
"num_tokens": 2091518.0,
"step": 915
},
{
"entropy": 6.526217222213745,
"epoch": 0.0655784446503671,
"grad_norm": 0.984375,
"learning_rate": 0.00045950000000000006,
"loss": 6.368,
"mean_token_accuracy": 0.1325083076953888,
"num_tokens": 2101516.0,
"step": 920
},
{
"entropy": 6.375706481933594,
"epoch": 0.06593484924085823,
"grad_norm": 1.0546875,
"learning_rate": 0.000462,
"loss": 6.345,
"mean_token_accuracy": 0.13234054744243623,
"num_tokens": 2112528.0,
"step": 925
},
{
"entropy": 6.246534633636474,
"epoch": 0.06629125383134934,
"grad_norm": 1.125,
"learning_rate": 0.0004645,
"loss": 6.248,
"mean_token_accuracy": 0.13760901093482972,
"num_tokens": 2123141.0,
"step": 930
},
{
"entropy": 6.34368371963501,
"epoch": 0.06664765842184048,
"grad_norm": 0.9765625,
"learning_rate": 0.000467,
"loss": 6.2634,
"mean_token_accuracy": 0.138457553088665,
"num_tokens": 2133846.0,
"step": 935
},
{
"entropy": 6.325902462005615,
"epoch": 0.0670040630123316,
"grad_norm": 1.125,
"learning_rate": 0.0004695,
"loss": 6.3193,
"mean_token_accuracy": 0.1425301358103752,
"num_tokens": 2145149.0,
"step": 940
},
{
"entropy": 6.3917014598846436,
"epoch": 0.06736046760282273,
"grad_norm": 1.0859375,
"learning_rate": 0.000472,
"loss": 6.4106,
"mean_token_accuracy": 0.1307942695915699,
"num_tokens": 2157701.0,
"step": 945
},
{
"entropy": 6.460545301437378,
"epoch": 0.06771687219331385,
"grad_norm": 0.953125,
"learning_rate": 0.0004745,
"loss": 6.5573,
"mean_token_accuracy": 0.12468130961060524,
"num_tokens": 2169628.0,
"step": 950
},
{
"entropy": 6.404773569107055,
"epoch": 0.06807327678380498,
"grad_norm": 1.1484375,
"learning_rate": 0.000477,
"loss": 6.4053,
"mean_token_accuracy": 0.13866689130663873,
"num_tokens": 2180514.0,
"step": 955
},
{
"entropy": 6.353378248214722,
"epoch": 0.0684296813742961,
"grad_norm": 1.09375,
"learning_rate": 0.0004795,
"loss": 6.384,
"mean_token_accuracy": 0.13784398436546325,
"num_tokens": 2191444.0,
"step": 960
},
{
"entropy": 6.355839490890503,
"epoch": 0.06878608596478723,
"grad_norm": 1.0859375,
"learning_rate": 0.000482,
"loss": 6.285,
"mean_token_accuracy": 0.14290510043501853,
"num_tokens": 2201697.0,
"step": 965
},
{
"entropy": 6.55248761177063,
"epoch": 0.06914249055527835,
"grad_norm": 0.98828125,
"learning_rate": 0.0004845,
"loss": 6.4695,
"mean_token_accuracy": 0.13385656401515006,
"num_tokens": 2214445.0,
"step": 970
},
{
"entropy": 6.186372995376587,
"epoch": 0.06949889514576947,
"grad_norm": 1.2421875,
"learning_rate": 0.000487,
"loss": 6.3001,
"mean_token_accuracy": 0.13443736881017684,
"num_tokens": 2225641.0,
"step": 975
},
{
"entropy": 6.355304479598999,
"epoch": 0.0698552997362606,
"grad_norm": 1.1015625,
"learning_rate": 0.0004895,
"loss": 6.325,
"mean_token_accuracy": 0.13117533475160598,
"num_tokens": 2236361.0,
"step": 980
},
{
"entropy": 6.355004453659058,
"epoch": 0.07021170432675172,
"grad_norm": 1.078125,
"learning_rate": 0.000492,
"loss": 6.2434,
"mean_token_accuracy": 0.13566968366503715,
"num_tokens": 2248165.0,
"step": 985
},
{
"entropy": 6.318191242218018,
"epoch": 0.07056810891724286,
"grad_norm": 0.9921875,
"learning_rate": 0.0004945,
"loss": 6.3146,
"mean_token_accuracy": 0.13415816202759742,
"num_tokens": 2259620.0,
"step": 990
},
{
"entropy": 6.307800722122193,
"epoch": 0.07092451350773397,
"grad_norm": 1.0859375,
"learning_rate": 0.000497,
"loss": 6.3535,
"mean_token_accuracy": 0.13583842292428017,
"num_tokens": 2272002.0,
"step": 995
},
{
"entropy": 6.434981966018677,
"epoch": 0.07128091809822511,
"grad_norm": 1.03125,
"learning_rate": 0.0004995,
"loss": 6.377,
"mean_token_accuracy": 0.13304205238819122,
"num_tokens": 2283141.0,
"step": 1000
}
],
"logging_steps": 5,
"max_steps": 4000,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3636001105920000.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}