Files
ModelHub XC 3506adcb8d 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/rus-cyrl-10mb-ppt-Dp-10mb_seed10
Source: Original Platform
2026-09-22 01:31:25 +08:00

1035 lines
27 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.0292243848266994,
"eval_steps": 500,
"global_step": 500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.742142391204833,
"epoch": 0.000292243848266994,
"grad_norm": 4.625,
"learning_rate": 2e-06,
"loss": 10.7907,
"mean_token_accuracy": 9.328357991762459e-05,
"num_tokens": 11126.0,
"step": 5
},
{
"entropy": 10.742114543914795,
"epoch": 0.000584487696533988,
"grad_norm": 5.21875,
"learning_rate": 4.5e-06,
"loss": 10.763,
"mean_token_accuracy": 0.0,
"num_tokens": 20949.0,
"step": 10
},
{
"entropy": 10.742155933380127,
"epoch": 0.000876731544800982,
"grad_norm": 5.125,
"learning_rate": 7e-06,
"loss": 10.7441,
"mean_token_accuracy": 0.00010582010727375746,
"num_tokens": 31135.0,
"step": 15
},
{
"entropy": 10.74212188720703,
"epoch": 0.001168975393067976,
"grad_norm": 4.46875,
"learning_rate": 9.5e-06,
"loss": 10.6777,
"mean_token_accuracy": 9.990009712055326e-05,
"num_tokens": 40153.0,
"step": 20
},
{
"entropy": 10.742057132720948,
"epoch": 0.00146121924133497,
"grad_norm": 4.84375,
"learning_rate": 1.2e-05,
"loss": 10.5935,
"mean_token_accuracy": 0.005301665072329343,
"num_tokens": 49826.0,
"step": 25
},
{
"entropy": 10.741645336151123,
"epoch": 0.001753463089601964,
"grad_norm": 4.0625,
"learning_rate": 1.4500000000000002e-05,
"loss": 10.4734,
"mean_token_accuracy": 0.037928895093500614,
"num_tokens": 60054.0,
"step": 30
},
{
"entropy": 10.740150451660156,
"epoch": 0.002045706937868958,
"grad_norm": 3.390625,
"learning_rate": 1.7000000000000003e-05,
"loss": 10.3332,
"mean_token_accuracy": 0.045763476938009265,
"num_tokens": 69706.0,
"step": 35
},
{
"entropy": 10.735286903381347,
"epoch": 0.002337950786135952,
"grad_norm": 2.734375,
"learning_rate": 1.95e-05,
"loss": 10.2072,
"mean_token_accuracy": 0.04907714687287808,
"num_tokens": 80908.0,
"step": 40
},
{
"entropy": 10.72396411895752,
"epoch": 0.0026301946344029457,
"grad_norm": 2.265625,
"learning_rate": 2.2e-05,
"loss": 10.116,
"mean_token_accuracy": 0.0504226915538311,
"num_tokens": 91354.0,
"step": 45
},
{
"entropy": 10.707611751556396,
"epoch": 0.00292243848266994,
"grad_norm": 2.09375,
"learning_rate": 2.4500000000000003e-05,
"loss": 10.0357,
"mean_token_accuracy": 0.05158382542431354,
"num_tokens": 101448.0,
"step": 50
},
{
"entropy": 10.695165920257569,
"epoch": 0.0032146823309369336,
"grad_norm": 1.9453125,
"learning_rate": 2.7e-05,
"loss": 9.987,
"mean_token_accuracy": 0.04974161125719547,
"num_tokens": 111679.0,
"step": 55
},
{
"entropy": 10.690466690063477,
"epoch": 0.003506926179203928,
"grad_norm": 1.8125,
"learning_rate": 2.95e-05,
"loss": 9.903,
"mean_token_accuracy": 0.05024520866572857,
"num_tokens": 122426.0,
"step": 60
},
{
"entropy": 10.688275337219238,
"epoch": 0.0037991700274709215,
"grad_norm": 2.015625,
"learning_rate": 3.2e-05,
"loss": 9.8425,
"mean_token_accuracy": 0.04879201892763376,
"num_tokens": 132600.0,
"step": 65
},
{
"entropy": 10.682420635223389,
"epoch": 0.004091413875737916,
"grad_norm": 1.7265625,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.803,
"mean_token_accuracy": 0.054092536121606825,
"num_tokens": 143485.0,
"step": 70
},
{
"entropy": 10.67214002609253,
"epoch": 0.00438365772400491,
"grad_norm": 1.7578125,
"learning_rate": 3.7e-05,
"loss": 9.7878,
"mean_token_accuracy": 0.05034251846373081,
"num_tokens": 154697.0,
"step": 75
},
{
"entropy": 10.66068525314331,
"epoch": 0.004675901572271904,
"grad_norm": 1.78125,
"learning_rate": 3.95e-05,
"loss": 9.6894,
"mean_token_accuracy": 0.05171992778778076,
"num_tokens": 164883.0,
"step": 80
},
{
"entropy": 10.651456069946288,
"epoch": 0.004968145420538897,
"grad_norm": 1.71875,
"learning_rate": 4.2000000000000004e-05,
"loss": 9.6326,
"mean_token_accuracy": 0.05340392328798771,
"num_tokens": 175534.0,
"step": 85
},
{
"entropy": 10.638569164276124,
"epoch": 0.0052603892688058915,
"grad_norm": 1.7421875,
"learning_rate": 4.45e-05,
"loss": 9.6175,
"mean_token_accuracy": 0.05033664517104626,
"num_tokens": 187495.0,
"step": 90
},
{
"entropy": 10.627774047851563,
"epoch": 0.005552633117072886,
"grad_norm": 1.703125,
"learning_rate": 4.7000000000000004e-05,
"loss": 9.5236,
"mean_token_accuracy": 0.0469218760728836,
"num_tokens": 197961.0,
"step": 95
},
{
"entropy": 10.619970226287842,
"epoch": 0.00584487696533988,
"grad_norm": 1.6796875,
"learning_rate": 4.9500000000000004e-05,
"loss": 9.4519,
"mean_token_accuracy": 0.05195427779108286,
"num_tokens": 209553.0,
"step": 100
},
{
"entropy": 10.597136783599854,
"epoch": 0.006137120813606874,
"grad_norm": 1.6015625,
"learning_rate": 5.2e-05,
"loss": 9.3622,
"mean_token_accuracy": 0.0559786681085825,
"num_tokens": 220019.0,
"step": 105
},
{
"entropy": 10.556843280792236,
"epoch": 0.006429364661873867,
"grad_norm": 1.546875,
"learning_rate": 5.45e-05,
"loss": 9.2362,
"mean_token_accuracy": 0.06384762041270733,
"num_tokens": 231542.0,
"step": 110
},
{
"entropy": 10.514682292938232,
"epoch": 0.006721608510140861,
"grad_norm": 1.6328125,
"learning_rate": 5.7e-05,
"loss": 9.1411,
"mean_token_accuracy": 0.060038824751973155,
"num_tokens": 242192.0,
"step": 115
},
{
"entropy": 10.46776523590088,
"epoch": 0.007013852358407856,
"grad_norm": 1.6015625,
"learning_rate": 5.9499999999999996e-05,
"loss": 9.0408,
"mean_token_accuracy": 0.06044495329260826,
"num_tokens": 252711.0,
"step": 120
},
{
"entropy": 10.397676372528077,
"epoch": 0.00730609620667485,
"grad_norm": 1.4921875,
"learning_rate": 6.2e-05,
"loss": 8.958,
"mean_token_accuracy": 0.05820495039224625,
"num_tokens": 262768.0,
"step": 125
},
{
"entropy": 10.315190315246582,
"epoch": 0.007598340054941843,
"grad_norm": 1.421875,
"learning_rate": 6.450000000000001e-05,
"loss": 8.8458,
"mean_token_accuracy": 0.06275271475315095,
"num_tokens": 274374.0,
"step": 130
},
{
"entropy": 10.261965942382812,
"epoch": 0.007890583903208837,
"grad_norm": 1.3203125,
"learning_rate": 6.7e-05,
"loss": 8.7538,
"mean_token_accuracy": 0.06524680852890015,
"num_tokens": 285449.0,
"step": 135
},
{
"entropy": 10.157284355163574,
"epoch": 0.008182827751475831,
"grad_norm": 1.2265625,
"learning_rate": 6.950000000000001e-05,
"loss": 8.6492,
"mean_token_accuracy": 0.06321290582418441,
"num_tokens": 296785.0,
"step": 140
},
{
"entropy": 10.050414943695069,
"epoch": 0.008475071599742826,
"grad_norm": 1.171875,
"learning_rate": 7.2e-05,
"loss": 8.5334,
"mean_token_accuracy": 0.06643750704824924,
"num_tokens": 307781.0,
"step": 145
},
{
"entropy": 9.926141262054443,
"epoch": 0.00876731544800982,
"grad_norm": 1.0703125,
"learning_rate": 7.45e-05,
"loss": 8.3954,
"mean_token_accuracy": 0.06747495792806149,
"num_tokens": 318713.0,
"step": 150
},
{
"entropy": 9.822235202789306,
"epoch": 0.009059559296276814,
"grad_norm": 1.09375,
"learning_rate": 7.7e-05,
"loss": 8.3951,
"mean_token_accuracy": 0.05827293880283833,
"num_tokens": 329779.0,
"step": 155
},
{
"entropy": 9.66906967163086,
"epoch": 0.009351803144543808,
"grad_norm": 0.953125,
"learning_rate": 7.950000000000001e-05,
"loss": 8.2444,
"mean_token_accuracy": 0.0628633838146925,
"num_tokens": 339733.0,
"step": 160
},
{
"entropy": 9.44699068069458,
"epoch": 0.009644046992810802,
"grad_norm": 1.0234375,
"learning_rate": 8.2e-05,
"loss": 8.1742,
"mean_token_accuracy": 0.06834175810217857,
"num_tokens": 350232.0,
"step": 165
},
{
"entropy": 9.28164119720459,
"epoch": 0.009936290841077795,
"grad_norm": 0.859375,
"learning_rate": 8.450000000000001e-05,
"loss": 8.1224,
"mean_token_accuracy": 0.06834722384810447,
"num_tokens": 361051.0,
"step": 170
},
{
"entropy": 9.148957920074462,
"epoch": 0.010228534689344789,
"grad_norm": 0.8515625,
"learning_rate": 8.7e-05,
"loss": 8.0815,
"mean_token_accuracy": 0.0646477747708559,
"num_tokens": 371699.0,
"step": 175
},
{
"entropy": 8.94444236755371,
"epoch": 0.010520778537611783,
"grad_norm": 0.78125,
"learning_rate": 8.95e-05,
"loss": 7.9754,
"mean_token_accuracy": 0.06804421916604042,
"num_tokens": 381817.0,
"step": 180
},
{
"entropy": 8.812028980255127,
"epoch": 0.010813022385878777,
"grad_norm": 0.7890625,
"learning_rate": 9.2e-05,
"loss": 7.9774,
"mean_token_accuracy": 0.06625252738595008,
"num_tokens": 393788.0,
"step": 185
},
{
"entropy": 8.69484453201294,
"epoch": 0.011105266234145771,
"grad_norm": 0.75,
"learning_rate": 9.45e-05,
"loss": 7.8944,
"mean_token_accuracy": 0.07389901392161846,
"num_tokens": 404690.0,
"step": 190
},
{
"entropy": 8.55163288116455,
"epoch": 0.011397510082412765,
"grad_norm": 0.82421875,
"learning_rate": 9.7e-05,
"loss": 7.855,
"mean_token_accuracy": 0.06855227462947369,
"num_tokens": 414627.0,
"step": 195
},
{
"entropy": 8.51447925567627,
"epoch": 0.01168975393067976,
"grad_norm": 0.78515625,
"learning_rate": 9.95e-05,
"loss": 7.9112,
"mean_token_accuracy": 0.06506339274346828,
"num_tokens": 425523.0,
"step": 200
},
{
"entropy": 8.489240837097167,
"epoch": 0.011981997778946754,
"grad_norm": 0.84375,
"learning_rate": 0.000102,
"loss": 7.8654,
"mean_token_accuracy": 0.06927913017570972,
"num_tokens": 436340.0,
"step": 205
},
{
"entropy": 8.421260166168214,
"epoch": 0.012274241627213748,
"grad_norm": 0.6953125,
"learning_rate": 0.00010449999999999999,
"loss": 7.875,
"mean_token_accuracy": 0.07178668864071369,
"num_tokens": 447677.0,
"step": 210
},
{
"entropy": 8.410223293304444,
"epoch": 0.01256648547548074,
"grad_norm": 0.8984375,
"learning_rate": 0.000107,
"loss": 7.852,
"mean_token_accuracy": 0.06873307004570961,
"num_tokens": 457470.0,
"step": 215
},
{
"entropy": 8.345960903167725,
"epoch": 0.012858729323747735,
"grad_norm": 0.78125,
"learning_rate": 0.0001095,
"loss": 7.841,
"mean_token_accuracy": 0.06865699663758278,
"num_tokens": 467056.0,
"step": 220
},
{
"entropy": 8.390186595916749,
"epoch": 0.013150973172014729,
"grad_norm": 0.73828125,
"learning_rate": 0.000112,
"loss": 7.8266,
"mean_token_accuracy": 0.07396755889058113,
"num_tokens": 476964.0,
"step": 225
},
{
"entropy": 8.322624683380127,
"epoch": 0.013443217020281723,
"grad_norm": 0.796875,
"learning_rate": 0.0001145,
"loss": 7.7907,
"mean_token_accuracy": 0.07042324244976043,
"num_tokens": 488273.0,
"step": 230
},
{
"entropy": 8.322233295440673,
"epoch": 0.013735460868548717,
"grad_norm": 0.8125,
"learning_rate": 0.00011700000000000001,
"loss": 7.8396,
"mean_token_accuracy": 0.06669306643307209,
"num_tokens": 499188.0,
"step": 235
},
{
"entropy": 8.32526388168335,
"epoch": 0.014027704716815711,
"grad_norm": 0.6796875,
"learning_rate": 0.00011949999999999999,
"loss": 7.7654,
"mean_token_accuracy": 0.07240047603845597,
"num_tokens": 509750.0,
"step": 240
},
{
"entropy": 8.2788516998291,
"epoch": 0.014319948565082705,
"grad_norm": 1.2890625,
"learning_rate": 0.000122,
"loss": 7.7089,
"mean_token_accuracy": 0.07294566892087459,
"num_tokens": 519680.0,
"step": 245
},
{
"entropy": 8.086223363876343,
"epoch": 0.0146121924133497,
"grad_norm": 1.0234375,
"learning_rate": 0.0001245,
"loss": 7.8038,
"mean_token_accuracy": 0.07106421366333962,
"num_tokens": 531028.0,
"step": 250
},
{
"entropy": 8.35772066116333,
"epoch": 0.014904436261616694,
"grad_norm": 1.25,
"learning_rate": 0.000127,
"loss": 7.7634,
"mean_token_accuracy": 0.07067177146673202,
"num_tokens": 540911.0,
"step": 255
},
{
"entropy": 8.142296409606933,
"epoch": 0.015196680109883686,
"grad_norm": 0.828125,
"learning_rate": 0.0001295,
"loss": 7.7239,
"mean_token_accuracy": 0.07250927239656449,
"num_tokens": 551217.0,
"step": 260
},
{
"entropy": 8.26462230682373,
"epoch": 0.01548892395815068,
"grad_norm": 0.90234375,
"learning_rate": 0.000132,
"loss": 7.7371,
"mean_token_accuracy": 0.06948361918330193,
"num_tokens": 560741.0,
"step": 265
},
{
"entropy": 8.203502750396728,
"epoch": 0.015781167806417674,
"grad_norm": 0.85546875,
"learning_rate": 0.00013450000000000002,
"loss": 7.7069,
"mean_token_accuracy": 0.07292059324681759,
"num_tokens": 571004.0,
"step": 270
},
{
"entropy": 8.08554220199585,
"epoch": 0.01607341165468467,
"grad_norm": 0.796875,
"learning_rate": 0.00013700000000000002,
"loss": 7.6602,
"mean_token_accuracy": 0.07287065088748931,
"num_tokens": 581035.0,
"step": 275
},
{
"entropy": 8.230623817443847,
"epoch": 0.016365655502951663,
"grad_norm": 0.921875,
"learning_rate": 0.0001395,
"loss": 7.7703,
"mean_token_accuracy": 0.06783514469861984,
"num_tokens": 591460.0,
"step": 280
},
{
"entropy": 8.123512077331544,
"epoch": 0.016657899351218655,
"grad_norm": 0.91015625,
"learning_rate": 0.00014199999999999998,
"loss": 7.7867,
"mean_token_accuracy": 0.06507540903985501,
"num_tokens": 602104.0,
"step": 285
},
{
"entropy": 8.162607574462891,
"epoch": 0.01695014319948565,
"grad_norm": 0.80078125,
"learning_rate": 0.0001445,
"loss": 7.7244,
"mean_token_accuracy": 0.06926270946860313,
"num_tokens": 613497.0,
"step": 290
},
{
"entropy": 8.155611419677735,
"epoch": 0.017242387047752643,
"grad_norm": 0.80078125,
"learning_rate": 0.000147,
"loss": 7.7376,
"mean_token_accuracy": 0.06834047213196755,
"num_tokens": 623432.0,
"step": 295
},
{
"entropy": 8.172423458099365,
"epoch": 0.01753463089601964,
"grad_norm": 0.91015625,
"learning_rate": 0.0001495,
"loss": 7.72,
"mean_token_accuracy": 0.07163975387811661,
"num_tokens": 633890.0,
"step": 300
},
{
"entropy": 8.120147132873536,
"epoch": 0.017826874744286632,
"grad_norm": 1.265625,
"learning_rate": 0.000152,
"loss": 7.6996,
"mean_token_accuracy": 0.07336684912443162,
"num_tokens": 644020.0,
"step": 305
},
{
"entropy": 8.08779067993164,
"epoch": 0.018119118592553628,
"grad_norm": 0.8359375,
"learning_rate": 0.00015450000000000001,
"loss": 7.644,
"mean_token_accuracy": 0.07471407577395439,
"num_tokens": 654177.0,
"step": 310
},
{
"entropy": 8.040860605239867,
"epoch": 0.01841136244082062,
"grad_norm": 0.75,
"learning_rate": 0.000157,
"loss": 7.5986,
"mean_token_accuracy": 0.08076093941926957,
"num_tokens": 665317.0,
"step": 315
},
{
"entropy": 8.058250904083252,
"epoch": 0.018703606289087616,
"grad_norm": 0.87109375,
"learning_rate": 0.0001595,
"loss": 7.7048,
"mean_token_accuracy": 0.07110530957579612,
"num_tokens": 676248.0,
"step": 320
},
{
"entropy": 8.157335948944091,
"epoch": 0.01899585013735461,
"grad_norm": 1.1328125,
"learning_rate": 0.000162,
"loss": 7.7111,
"mean_token_accuracy": 0.06896476708352565,
"num_tokens": 687573.0,
"step": 325
},
{
"entropy": 8.00673680305481,
"epoch": 0.019288093985621604,
"grad_norm": 0.8125,
"learning_rate": 0.00016450000000000001,
"loss": 7.7276,
"mean_token_accuracy": 0.07006649971008301,
"num_tokens": 698919.0,
"step": 330
},
{
"entropy": 8.120959758758545,
"epoch": 0.019580337833888597,
"grad_norm": 0.79296875,
"learning_rate": 0.00016700000000000002,
"loss": 7.6748,
"mean_token_accuracy": 0.06717267856001854,
"num_tokens": 709450.0,
"step": 335
},
{
"entropy": 8.110147094726562,
"epoch": 0.01987258168215559,
"grad_norm": 0.921875,
"learning_rate": 0.00016950000000000003,
"loss": 7.6476,
"mean_token_accuracy": 0.07495066076517105,
"num_tokens": 719909.0,
"step": 340
},
{
"entropy": 8.031400108337403,
"epoch": 0.020164825530422585,
"grad_norm": 0.85546875,
"learning_rate": 0.00017199999999999998,
"loss": 7.5699,
"mean_token_accuracy": 0.07540844045579434,
"num_tokens": 729451.0,
"step": 345
},
{
"entropy": 8.043409729003907,
"epoch": 0.020457069378689578,
"grad_norm": 1.0234375,
"learning_rate": 0.00017449999999999999,
"loss": 7.5831,
"mean_token_accuracy": 0.07626536451280116,
"num_tokens": 739256.0,
"step": 350
},
{
"entropy": 7.9351013660430905,
"epoch": 0.020749313226956573,
"grad_norm": 0.92578125,
"learning_rate": 0.000177,
"loss": 7.5958,
"mean_token_accuracy": 0.07205557823181152,
"num_tokens": 749690.0,
"step": 355
},
{
"entropy": 7.968925666809082,
"epoch": 0.021041557075223566,
"grad_norm": 0.8203125,
"learning_rate": 0.0001795,
"loss": 7.6478,
"mean_token_accuracy": 0.0736626997590065,
"num_tokens": 760665.0,
"step": 360
},
{
"entropy": 8.029117727279663,
"epoch": 0.021333800923490562,
"grad_norm": 0.90234375,
"learning_rate": 0.000182,
"loss": 7.5629,
"mean_token_accuracy": 0.07812464088201523,
"num_tokens": 770506.0,
"step": 365
},
{
"entropy": 7.863681507110596,
"epoch": 0.021626044771757554,
"grad_norm": 0.9140625,
"learning_rate": 0.0001845,
"loss": 7.6357,
"mean_token_accuracy": 0.07435660734772682,
"num_tokens": 780939.0,
"step": 370
},
{
"entropy": 8.057669687271119,
"epoch": 0.02191828862002455,
"grad_norm": 0.74609375,
"learning_rate": 0.000187,
"loss": 7.6061,
"mean_token_accuracy": 0.0721366185694933,
"num_tokens": 792336.0,
"step": 375
},
{
"entropy": 8.00227198600769,
"epoch": 0.022210532468291543,
"grad_norm": 1.0390625,
"learning_rate": 0.0001895,
"loss": 7.6259,
"mean_token_accuracy": 0.07205860875546932,
"num_tokens": 803357.0,
"step": 380
},
{
"entropy": 8.049015951156616,
"epoch": 0.022502776316558535,
"grad_norm": 0.8046875,
"learning_rate": 0.000192,
"loss": 7.5829,
"mean_token_accuracy": 0.07036133743822574,
"num_tokens": 813964.0,
"step": 385
},
{
"entropy": 7.892692565917969,
"epoch": 0.02279502016482553,
"grad_norm": 0.859375,
"learning_rate": 0.0001945,
"loss": 7.5666,
"mean_token_accuracy": 0.07797688394784927,
"num_tokens": 824042.0,
"step": 390
},
{
"entropy": 8.043365049362183,
"epoch": 0.023087264013092523,
"grad_norm": 0.86328125,
"learning_rate": 0.00019700000000000002,
"loss": 7.5108,
"mean_token_accuracy": 0.08256808444857597,
"num_tokens": 834080.0,
"step": 395
},
{
"entropy": 8.010589456558227,
"epoch": 0.02337950786135952,
"grad_norm": 1.0703125,
"learning_rate": 0.00019950000000000002,
"loss": 7.617,
"mean_token_accuracy": 0.06876562051475048,
"num_tokens": 844483.0,
"step": 400
},
{
"entropy": 7.925695133209229,
"epoch": 0.02367175170962651,
"grad_norm": 0.83203125,
"learning_rate": 0.000202,
"loss": 7.6103,
"mean_token_accuracy": 0.07202962972223759,
"num_tokens": 855896.0,
"step": 405
},
{
"entropy": 7.904125165939331,
"epoch": 0.023963995557893508,
"grad_norm": 0.890625,
"learning_rate": 0.00020449999999999998,
"loss": 7.5299,
"mean_token_accuracy": 0.07748726978898049,
"num_tokens": 866631.0,
"step": 410
},
{
"entropy": 7.941328859329223,
"epoch": 0.0242562394061605,
"grad_norm": 1.0703125,
"learning_rate": 0.000207,
"loss": 7.5184,
"mean_token_accuracy": 0.0782412201166153,
"num_tokens": 877779.0,
"step": 415
},
{
"entropy": 7.92393913269043,
"epoch": 0.024548483254427496,
"grad_norm": 0.8671875,
"learning_rate": 0.0002095,
"loss": 7.5434,
"mean_token_accuracy": 0.07804081477224827,
"num_tokens": 888478.0,
"step": 420
},
{
"entropy": 7.941523599624634,
"epoch": 0.02484072710269449,
"grad_norm": 0.98828125,
"learning_rate": 0.000212,
"loss": 7.5063,
"mean_token_accuracy": 0.07843287661671638,
"num_tokens": 898164.0,
"step": 425
},
{
"entropy": 7.827020597457886,
"epoch": 0.02513297095096148,
"grad_norm": 0.90234375,
"learning_rate": 0.0002145,
"loss": 7.444,
"mean_token_accuracy": 0.08076250851154328,
"num_tokens": 908426.0,
"step": 430
},
{
"entropy": 7.868816757202149,
"epoch": 0.025425214799228477,
"grad_norm": 0.7578125,
"learning_rate": 0.00021700000000000002,
"loss": 7.5119,
"mean_token_accuracy": 0.07991167530417442,
"num_tokens": 919164.0,
"step": 435
},
{
"entropy": 7.792380475997925,
"epoch": 0.02571745864749547,
"grad_norm": 0.859375,
"learning_rate": 0.0002195,
"loss": 7.4187,
"mean_token_accuracy": 0.08300766497850418,
"num_tokens": 931152.0,
"step": 440
},
{
"entropy": 7.8588916778564455,
"epoch": 0.026009702495762465,
"grad_norm": 1.046875,
"learning_rate": 0.000222,
"loss": 7.5027,
"mean_token_accuracy": 0.08102720528841019,
"num_tokens": 941629.0,
"step": 445
},
{
"entropy": 7.851666688919067,
"epoch": 0.026301946344029457,
"grad_norm": 0.88671875,
"learning_rate": 0.0002245,
"loss": 7.4577,
"mean_token_accuracy": 0.08078472912311555,
"num_tokens": 952665.0,
"step": 450
},
{
"entropy": 7.90864748954773,
"epoch": 0.026594190192296453,
"grad_norm": 1.1796875,
"learning_rate": 0.00022700000000000002,
"loss": 7.4166,
"mean_token_accuracy": 0.07709830179810524,
"num_tokens": 963395.0,
"step": 455
},
{
"entropy": 7.783758735656738,
"epoch": 0.026886434040563446,
"grad_norm": 0.95703125,
"learning_rate": 0.00022950000000000002,
"loss": 7.402,
"mean_token_accuracy": 0.08202188611030578,
"num_tokens": 972789.0,
"step": 460
},
{
"entropy": 7.851816082000733,
"epoch": 0.02717867788883044,
"grad_norm": 1.375,
"learning_rate": 0.00023200000000000003,
"loss": 7.4988,
"mean_token_accuracy": 0.07351949512958526,
"num_tokens": 984240.0,
"step": 465
},
{
"entropy": 7.863189268112182,
"epoch": 0.027470921737097434,
"grad_norm": 0.98046875,
"learning_rate": 0.00023449999999999998,
"loss": 7.4893,
"mean_token_accuracy": 0.07835234403610229,
"num_tokens": 994698.0,
"step": 470
},
{
"entropy": 7.70669264793396,
"epoch": 0.027763165585364426,
"grad_norm": 0.8984375,
"learning_rate": 0.000237,
"loss": 7.4247,
"mean_token_accuracy": 0.08151589259505272,
"num_tokens": 1005324.0,
"step": 475
},
{
"entropy": 7.905373239517212,
"epoch": 0.028055409433631422,
"grad_norm": 0.828125,
"learning_rate": 0.0002395,
"loss": 7.4238,
"mean_token_accuracy": 0.07885461077094078,
"num_tokens": 1016587.0,
"step": 480
},
{
"entropy": 7.845970726013183,
"epoch": 0.028347653281898415,
"grad_norm": 0.953125,
"learning_rate": 0.000242,
"loss": 7.4595,
"mean_token_accuracy": 0.07829558476805687,
"num_tokens": 1026998.0,
"step": 485
},
{
"entropy": 7.805553197860718,
"epoch": 0.02863989713016541,
"grad_norm": 0.98828125,
"learning_rate": 0.0002445,
"loss": 7.4385,
"mean_token_accuracy": 0.0780658096075058,
"num_tokens": 1038475.0,
"step": 490
},
{
"entropy": 7.88462347984314,
"epoch": 0.028932140978432403,
"grad_norm": 0.9765625,
"learning_rate": 0.000247,
"loss": 7.3556,
"mean_token_accuracy": 0.08420942425727844,
"num_tokens": 1049631.0,
"step": 495
},
{
"entropy": 7.75970048904419,
"epoch": 0.0292243848266994,
"grad_norm": 1.078125,
"learning_rate": 0.0002495,
"loss": 7.4304,
"mean_token_accuracy": 0.07490956112742424,
"num_tokens": 1060052.0,
"step": 500
}
],
"logging_steps": 5,
"max_steps": 4000,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 227917410140160.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}