Files
ModelHub XC 333296a2ba 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/eng-latn-10mb-ppt-Dp-100mb_seed3407
Source: Original Platform
2026-07-30 02:16:18 +08:00

1035 lines
27 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.035640459049112554,
"eval_steps": 500,
"global_step": 500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.742571830749512,
"epoch": 0.0003564045904911255,
"grad_norm": 5.375,
"learning_rate": 2e-06,
"loss": 10.7796,
"mean_token_accuracy": 0.0001526242063846439,
"num_tokens": 11399.0,
"step": 5
},
{
"entropy": 10.742592334747314,
"epoch": 0.000712809180982251,
"grad_norm": 5.65625,
"learning_rate": 4.5e-06,
"loss": 10.7732,
"mean_token_accuracy": 0.00015220778295770286,
"num_tokens": 22686.0,
"step": 10
},
{
"entropy": 10.742580223083497,
"epoch": 0.0010692137714733766,
"grad_norm": 5.28125,
"learning_rate": 7e-06,
"loss": 10.7223,
"mean_token_accuracy": 0.0,
"num_tokens": 32728.0,
"step": 15
},
{
"entropy": 10.742625427246093,
"epoch": 0.001425618361964502,
"grad_norm": 5.25,
"learning_rate": 9.5e-06,
"loss": 10.6798,
"mean_token_accuracy": 0.0005484026798512787,
"num_tokens": 42808.0,
"step": 20
},
{
"entropy": 10.742498874664307,
"epoch": 0.0017820229524556277,
"grad_norm": 4.75,
"learning_rate": 1.2e-05,
"loss": 10.5751,
"mean_token_accuracy": 0.006744108803104609,
"num_tokens": 54058.0,
"step": 25
},
{
"entropy": 10.742173194885254,
"epoch": 0.002138427542946753,
"grad_norm": 3.96875,
"learning_rate": 1.4500000000000002e-05,
"loss": 10.4546,
"mean_token_accuracy": 0.025261138379573823,
"num_tokens": 65338.0,
"step": 30
},
{
"entropy": 10.741145706176757,
"epoch": 0.0024948321334378786,
"grad_norm": 3.9375,
"learning_rate": 1.7000000000000003e-05,
"loss": 10.2901,
"mean_token_accuracy": 0.034458070248365405,
"num_tokens": 76598.0,
"step": 35
},
{
"entropy": 10.738759613037109,
"epoch": 0.002851236723929004,
"grad_norm": 2.65625,
"learning_rate": 1.95e-05,
"loss": 10.1426,
"mean_token_accuracy": 0.039705483429133895,
"num_tokens": 87364.0,
"step": 40
},
{
"entropy": 10.735179233551026,
"epoch": 0.00320764131442013,
"grad_norm": 2.359375,
"learning_rate": 2.2e-05,
"loss": 10.0394,
"mean_token_accuracy": 0.04000021629035473,
"num_tokens": 99019.0,
"step": 45
},
{
"entropy": 10.732727909088135,
"epoch": 0.0035640459049112554,
"grad_norm": 2.171875,
"learning_rate": 2.4500000000000003e-05,
"loss": 9.9672,
"mean_token_accuracy": 0.04283946715295315,
"num_tokens": 111087.0,
"step": 50
},
{
"entropy": 10.73162260055542,
"epoch": 0.00392045049540238,
"grad_norm": 2.140625,
"learning_rate": 2.7e-05,
"loss": 9.9085,
"mean_token_accuracy": 0.03926678970456123,
"num_tokens": 123401.0,
"step": 55
},
{
"entropy": 10.730762577056884,
"epoch": 0.004276855085893506,
"grad_norm": 2.171875,
"learning_rate": 2.95e-05,
"loss": 9.8396,
"mean_token_accuracy": 0.04287007227540016,
"num_tokens": 135554.0,
"step": 60
},
{
"entropy": 10.729378986358643,
"epoch": 0.004633259676384632,
"grad_norm": 2.09375,
"learning_rate": 3.2e-05,
"loss": 9.7598,
"mean_token_accuracy": 0.0466454017907381,
"num_tokens": 146700.0,
"step": 65
},
{
"entropy": 10.726875305175781,
"epoch": 0.004989664266875757,
"grad_norm": 1.9453125,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.7227,
"mean_token_accuracy": 0.041810817271471026,
"num_tokens": 157606.0,
"step": 70
},
{
"entropy": 10.724038028717041,
"epoch": 0.005346068857366883,
"grad_norm": 1.9453125,
"learning_rate": 3.7e-05,
"loss": 9.664,
"mean_token_accuracy": 0.04535525776445866,
"num_tokens": 168705.0,
"step": 75
},
{
"entropy": 10.720051860809326,
"epoch": 0.005702473447858008,
"grad_norm": 2.09375,
"learning_rate": 3.95e-05,
"loss": 9.6147,
"mean_token_accuracy": 0.04609923996031284,
"num_tokens": 181497.0,
"step": 80
},
{
"entropy": 10.71345911026001,
"epoch": 0.006058878038349134,
"grad_norm": 1.9609375,
"learning_rate": 4.2000000000000004e-05,
"loss": 9.5166,
"mean_token_accuracy": 0.0461752537637949,
"num_tokens": 192991.0,
"step": 85
},
{
"entropy": 10.705201339721679,
"epoch": 0.00641528262884026,
"grad_norm": 2.109375,
"learning_rate": 4.45e-05,
"loss": 9.3949,
"mean_token_accuracy": 0.049161479249596594,
"num_tokens": 203969.0,
"step": 90
},
{
"entropy": 10.695504951477051,
"epoch": 0.006771687219331385,
"grad_norm": 1.8984375,
"learning_rate": 4.7000000000000004e-05,
"loss": 9.3681,
"mean_token_accuracy": 0.049966185539960864,
"num_tokens": 215809.0,
"step": 95
},
{
"entropy": 10.68418607711792,
"epoch": 0.007128091809822511,
"grad_norm": 1.796875,
"learning_rate": 4.9500000000000004e-05,
"loss": 9.316,
"mean_token_accuracy": 0.048291167616844176,
"num_tokens": 227826.0,
"step": 100
},
{
"entropy": 10.668262958526611,
"epoch": 0.007484496400313636,
"grad_norm": 1.9609375,
"learning_rate": 5.2e-05,
"loss": 9.1803,
"mean_token_accuracy": 0.058137640729546546,
"num_tokens": 240073.0,
"step": 105
},
{
"entropy": 10.644538402557373,
"epoch": 0.00784090099080476,
"grad_norm": 1.96875,
"learning_rate": 5.45e-05,
"loss": 9.0385,
"mean_token_accuracy": 0.057943309843540194,
"num_tokens": 251073.0,
"step": 110
},
{
"entropy": 10.616683769226075,
"epoch": 0.008197305581295887,
"grad_norm": 1.71875,
"learning_rate": 5.7e-05,
"loss": 9.0264,
"mean_token_accuracy": 0.05736844353377819,
"num_tokens": 264607.0,
"step": 115
},
{
"entropy": 10.58455696105957,
"epoch": 0.008553710171787013,
"grad_norm": 1.875,
"learning_rate": 5.9499999999999996e-05,
"loss": 8.7984,
"mean_token_accuracy": 0.06613890007138253,
"num_tokens": 275688.0,
"step": 120
},
{
"entropy": 10.523236083984376,
"epoch": 0.008910114762278138,
"grad_norm": 1.78125,
"learning_rate": 6.2e-05,
"loss": 8.652,
"mean_token_accuracy": 0.06381725408136844,
"num_tokens": 287024.0,
"step": 125
},
{
"entropy": 10.454036426544189,
"epoch": 0.009266519352769264,
"grad_norm": 1.828125,
"learning_rate": 6.450000000000001e-05,
"loss": 8.5662,
"mean_token_accuracy": 0.06661000251770019,
"num_tokens": 297605.0,
"step": 130
},
{
"entropy": 10.365349960327148,
"epoch": 0.009622923943260388,
"grad_norm": 1.828125,
"learning_rate": 6.7e-05,
"loss": 8.4279,
"mean_token_accuracy": 0.06779800169169903,
"num_tokens": 307956.0,
"step": 135
},
{
"entropy": 10.26084508895874,
"epoch": 0.009979328533751514,
"grad_norm": 1.6640625,
"learning_rate": 6.950000000000001e-05,
"loss": 8.3001,
"mean_token_accuracy": 0.06663309819996358,
"num_tokens": 318724.0,
"step": 140
},
{
"entropy": 10.160690593719483,
"epoch": 0.01033573312424264,
"grad_norm": 1.6015625,
"learning_rate": 7.2e-05,
"loss": 8.1425,
"mean_token_accuracy": 0.07099423781037331,
"num_tokens": 330488.0,
"step": 145
},
{
"entropy": 10.021271991729737,
"epoch": 0.010692137714733766,
"grad_norm": 1.359375,
"learning_rate": 7.45e-05,
"loss": 8.1226,
"mean_token_accuracy": 0.07147609815001488,
"num_tokens": 343057.0,
"step": 150
},
{
"entropy": 9.84426851272583,
"epoch": 0.011048542305224892,
"grad_norm": 1.265625,
"learning_rate": 7.7e-05,
"loss": 7.922,
"mean_token_accuracy": 0.07516647689044476,
"num_tokens": 355224.0,
"step": 155
},
{
"entropy": 9.662067031860351,
"epoch": 0.011404946895716016,
"grad_norm": 1.2421875,
"learning_rate": 7.950000000000001e-05,
"loss": 7.8644,
"mean_token_accuracy": 0.07227759584784507,
"num_tokens": 366926.0,
"step": 160
},
{
"entropy": 9.455039691925048,
"epoch": 0.011761351486207142,
"grad_norm": 1.171875,
"learning_rate": 8.2e-05,
"loss": 7.742,
"mean_token_accuracy": 0.07173869498074055,
"num_tokens": 378180.0,
"step": 165
},
{
"entropy": 9.217700099945068,
"epoch": 0.012117756076698268,
"grad_norm": 1.2265625,
"learning_rate": 8.450000000000001e-05,
"loss": 7.6739,
"mean_token_accuracy": 0.07917889729142188,
"num_tokens": 388639.0,
"step": 170
},
{
"entropy": 8.98402910232544,
"epoch": 0.012474160667189394,
"grad_norm": 1.0859375,
"learning_rate": 8.7e-05,
"loss": 7.563,
"mean_token_accuracy": 0.08437970206141472,
"num_tokens": 398752.0,
"step": 175
},
{
"entropy": 8.738731479644775,
"epoch": 0.01283056525768052,
"grad_norm": 0.88671875,
"learning_rate": 8.95e-05,
"loss": 7.4995,
"mean_token_accuracy": 0.07861107215285301,
"num_tokens": 411341.0,
"step": 180
},
{
"entropy": 8.582833385467529,
"epoch": 0.013186969848171644,
"grad_norm": 0.87890625,
"learning_rate": 9.2e-05,
"loss": 7.4019,
"mean_token_accuracy": 0.07919293940067292,
"num_tokens": 421736.0,
"step": 185
},
{
"entropy": 8.410860538482666,
"epoch": 0.01354337443866277,
"grad_norm": 0.87109375,
"learning_rate": 9.45e-05,
"loss": 7.4428,
"mean_token_accuracy": 0.08342698290944099,
"num_tokens": 432934.0,
"step": 190
},
{
"entropy": 8.250172996520996,
"epoch": 0.013899779029153896,
"grad_norm": 0.953125,
"learning_rate": 9.7e-05,
"loss": 7.3743,
"mean_token_accuracy": 0.08416533321142197,
"num_tokens": 442929.0,
"step": 195
},
{
"entropy": 8.198361492156982,
"epoch": 0.014256183619645021,
"grad_norm": 0.84375,
"learning_rate": 9.95e-05,
"loss": 7.3499,
"mean_token_accuracy": 0.08039835765957833,
"num_tokens": 455544.0,
"step": 200
},
{
"entropy": 8.08715353012085,
"epoch": 0.014612588210136147,
"grad_norm": 0.84375,
"learning_rate": 0.000102,
"loss": 7.2678,
"mean_token_accuracy": 0.08803733438253403,
"num_tokens": 466476.0,
"step": 205
},
{
"entropy": 8.042504119873048,
"epoch": 0.014968992800627271,
"grad_norm": 1.0859375,
"learning_rate": 0.00010449999999999999,
"loss": 7.2552,
"mean_token_accuracy": 0.08520074412226677,
"num_tokens": 477149.0,
"step": 210
},
{
"entropy": 7.974717617034912,
"epoch": 0.015325397391118397,
"grad_norm": 1.15625,
"learning_rate": 0.000107,
"loss": 7.3936,
"mean_token_accuracy": 0.0847919188439846,
"num_tokens": 489684.0,
"step": 215
},
{
"entropy": 7.970945692062378,
"epoch": 0.01568180198160952,
"grad_norm": 1.1484375,
"learning_rate": 0.0001095,
"loss": 7.32,
"mean_token_accuracy": 0.08788989782333374,
"num_tokens": 500724.0,
"step": 220
},
{
"entropy": 7.915714168548584,
"epoch": 0.016038206572100647,
"grad_norm": 1.2421875,
"learning_rate": 0.000112,
"loss": 7.1834,
"mean_token_accuracy": 0.09220796525478363,
"num_tokens": 511301.0,
"step": 225
},
{
"entropy": 7.900463056564331,
"epoch": 0.016394611162591773,
"grad_norm": 1.0625,
"learning_rate": 0.0001145,
"loss": 7.2187,
"mean_token_accuracy": 0.08324612528085709,
"num_tokens": 522925.0,
"step": 230
},
{
"entropy": 7.857335376739502,
"epoch": 0.0167510157530829,
"grad_norm": 1.0078125,
"learning_rate": 0.00011700000000000001,
"loss": 7.2262,
"mean_token_accuracy": 0.09082898795604706,
"num_tokens": 533742.0,
"step": 235
},
{
"entropy": 7.882049703598023,
"epoch": 0.017107420343574025,
"grad_norm": 0.89453125,
"learning_rate": 0.00011949999999999999,
"loss": 7.1824,
"mean_token_accuracy": 0.0936901956796646,
"num_tokens": 545526.0,
"step": 240
},
{
"entropy": 7.793568754196167,
"epoch": 0.01746382493406515,
"grad_norm": 0.96875,
"learning_rate": 0.000122,
"loss": 7.1257,
"mean_token_accuracy": 0.09565059095621109,
"num_tokens": 555735.0,
"step": 245
},
{
"entropy": 7.741059350967407,
"epoch": 0.017820229524556277,
"grad_norm": 1.0546875,
"learning_rate": 0.0001245,
"loss": 7.2118,
"mean_token_accuracy": 0.09219442456960678,
"num_tokens": 568443.0,
"step": 250
},
{
"entropy": 7.821925401687622,
"epoch": 0.018176634115047403,
"grad_norm": 1.0,
"learning_rate": 0.000127,
"loss": 7.1074,
"mean_token_accuracy": 0.09640756845474244,
"num_tokens": 579091.0,
"step": 255
},
{
"entropy": 7.703673696517944,
"epoch": 0.01853303870553853,
"grad_norm": 0.89453125,
"learning_rate": 0.0001295,
"loss": 7.0316,
"mean_token_accuracy": 0.09788540452718734,
"num_tokens": 591683.0,
"step": 260
},
{
"entropy": 7.649093818664551,
"epoch": 0.018889443296029654,
"grad_norm": 1.03125,
"learning_rate": 0.000132,
"loss": 7.1601,
"mean_token_accuracy": 0.09608315378427505,
"num_tokens": 603464.0,
"step": 265
},
{
"entropy": 7.753079223632812,
"epoch": 0.019245847886520777,
"grad_norm": 0.91796875,
"learning_rate": 0.00013450000000000002,
"loss": 7.2118,
"mean_token_accuracy": 0.0977549560368061,
"num_tokens": 615626.0,
"step": 270
},
{
"entropy": 7.689573907852173,
"epoch": 0.019602252477011903,
"grad_norm": 1.0703125,
"learning_rate": 0.00013700000000000002,
"loss": 7.1333,
"mean_token_accuracy": 0.09726834744215011,
"num_tokens": 627270.0,
"step": 275
},
{
"entropy": 7.662051963806152,
"epoch": 0.01995865706750303,
"grad_norm": 0.9453125,
"learning_rate": 0.0001395,
"loss": 7.0505,
"mean_token_accuracy": 0.09889725744724273,
"num_tokens": 638403.0,
"step": 280
},
{
"entropy": 7.641796112060547,
"epoch": 0.020315061657994155,
"grad_norm": 1.3046875,
"learning_rate": 0.00014199999999999998,
"loss": 7.0687,
"mean_token_accuracy": 0.10083996653556823,
"num_tokens": 650046.0,
"step": 285
},
{
"entropy": 7.634785175323486,
"epoch": 0.02067146624848528,
"grad_norm": 1.15625,
"learning_rate": 0.0001445,
"loss": 6.9997,
"mean_token_accuracy": 0.10420416370034218,
"num_tokens": 659818.0,
"step": 290
},
{
"entropy": 7.5922698974609375,
"epoch": 0.021027870838976406,
"grad_norm": 0.92578125,
"learning_rate": 0.000147,
"loss": 7.0209,
"mean_token_accuracy": 0.10451438650488853,
"num_tokens": 672404.0,
"step": 295
},
{
"entropy": 7.534389448165894,
"epoch": 0.021384275429467532,
"grad_norm": 0.93359375,
"learning_rate": 0.0001495,
"loss": 6.9976,
"mean_token_accuracy": 0.10352390706539154,
"num_tokens": 684048.0,
"step": 300
},
{
"entropy": 7.588808202743531,
"epoch": 0.021740680019958658,
"grad_norm": 1.171875,
"learning_rate": 0.000152,
"loss": 7.0077,
"mean_token_accuracy": 0.10355912148952484,
"num_tokens": 694590.0,
"step": 305
},
{
"entropy": 7.526580429077148,
"epoch": 0.022097084610449784,
"grad_norm": 0.890625,
"learning_rate": 0.00015450000000000001,
"loss": 6.9348,
"mean_token_accuracy": 0.10375382453203201,
"num_tokens": 706949.0,
"step": 310
},
{
"entropy": 7.53011155128479,
"epoch": 0.02245348920094091,
"grad_norm": 1.015625,
"learning_rate": 0.000157,
"loss": 7.0441,
"mean_token_accuracy": 0.10697530284523964,
"num_tokens": 717400.0,
"step": 315
},
{
"entropy": 7.550104141235352,
"epoch": 0.022809893791432032,
"grad_norm": 1.125,
"learning_rate": 0.0001595,
"loss": 6.9815,
"mean_token_accuracy": 0.10357886925339699,
"num_tokens": 728842.0,
"step": 320
},
{
"entropy": 7.465000009536743,
"epoch": 0.023166298381923158,
"grad_norm": 0.92578125,
"learning_rate": 0.000162,
"loss": 6.9683,
"mean_token_accuracy": 0.10274564027786255,
"num_tokens": 740598.0,
"step": 325
},
{
"entropy": 7.529222631454468,
"epoch": 0.023522702972414284,
"grad_norm": 0.94921875,
"learning_rate": 0.00016450000000000001,
"loss": 6.9989,
"mean_token_accuracy": 0.1049557864665985,
"num_tokens": 752512.0,
"step": 330
},
{
"entropy": 7.580902624130249,
"epoch": 0.02387910756290541,
"grad_norm": 1.0,
"learning_rate": 0.00016700000000000002,
"loss": 7.0602,
"mean_token_accuracy": 0.09983156248927116,
"num_tokens": 764679.0,
"step": 335
},
{
"entropy": 7.5142491340637205,
"epoch": 0.024235512153396536,
"grad_norm": 1.0703125,
"learning_rate": 0.00016950000000000003,
"loss": 7.0932,
"mean_token_accuracy": 0.10753691717982292,
"num_tokens": 776267.0,
"step": 340
},
{
"entropy": 7.439674139022827,
"epoch": 0.02459191674388766,
"grad_norm": 1.0390625,
"learning_rate": 0.00017199999999999998,
"loss": 6.8853,
"mean_token_accuracy": 0.11588529199361801,
"num_tokens": 788178.0,
"step": 345
},
{
"entropy": 7.517330646514893,
"epoch": 0.024948321334378788,
"grad_norm": 0.9765625,
"learning_rate": 0.00017449999999999999,
"loss": 6.9833,
"mean_token_accuracy": 0.11000660359859467,
"num_tokens": 798643.0,
"step": 350
},
{
"entropy": 7.445536041259766,
"epoch": 0.025304725924869913,
"grad_norm": 1.25,
"learning_rate": 0.000177,
"loss": 6.9894,
"mean_token_accuracy": 0.10883523225784301,
"num_tokens": 809448.0,
"step": 355
},
{
"entropy": 7.333874130249024,
"epoch": 0.02566113051536104,
"grad_norm": 0.99609375,
"learning_rate": 0.0001795,
"loss": 6.9268,
"mean_token_accuracy": 0.11306785941123962,
"num_tokens": 821107.0,
"step": 360
},
{
"entropy": 7.386691951751709,
"epoch": 0.02601753510585216,
"grad_norm": 1.15625,
"learning_rate": 0.000182,
"loss": 6.8761,
"mean_token_accuracy": 0.11081241220235824,
"num_tokens": 832800.0,
"step": 365
},
{
"entropy": 7.474579668045044,
"epoch": 0.026373939696343288,
"grad_norm": 0.96875,
"learning_rate": 0.0001845,
"loss": 6.928,
"mean_token_accuracy": 0.11076254919171333,
"num_tokens": 845207.0,
"step": 370
},
{
"entropy": 7.365311479568481,
"epoch": 0.026730344286834413,
"grad_norm": 1.015625,
"learning_rate": 0.000187,
"loss": 6.9474,
"mean_token_accuracy": 0.11366913244128227,
"num_tokens": 857270.0,
"step": 375
},
{
"entropy": 7.398762464523315,
"epoch": 0.02708674887732554,
"grad_norm": 0.91015625,
"learning_rate": 0.0001895,
"loss": 6.8581,
"mean_token_accuracy": 0.11230278387665749,
"num_tokens": 867892.0,
"step": 380
},
{
"entropy": 7.316660690307617,
"epoch": 0.027443153467816665,
"grad_norm": 0.91015625,
"learning_rate": 0.000192,
"loss": 6.7972,
"mean_token_accuracy": 0.10899836272001266,
"num_tokens": 879516.0,
"step": 385
},
{
"entropy": 7.332602882385254,
"epoch": 0.02779955805830779,
"grad_norm": 1.0234375,
"learning_rate": 0.0001945,
"loss": 6.7966,
"mean_token_accuracy": 0.11280329450964928,
"num_tokens": 889693.0,
"step": 390
},
{
"entropy": 7.21000304222107,
"epoch": 0.028155962648798917,
"grad_norm": 0.9765625,
"learning_rate": 0.00019700000000000002,
"loss": 6.8075,
"mean_token_accuracy": 0.11519677788019181,
"num_tokens": 901591.0,
"step": 395
},
{
"entropy": 7.289150762557983,
"epoch": 0.028512367239290043,
"grad_norm": 1.0703125,
"learning_rate": 0.00019950000000000002,
"loss": 6.7701,
"mean_token_accuracy": 0.11484072580933571,
"num_tokens": 912146.0,
"step": 400
},
{
"entropy": 7.22770209312439,
"epoch": 0.02886877182978117,
"grad_norm": 0.921875,
"learning_rate": 0.000202,
"loss": 6.6398,
"mean_token_accuracy": 0.12384215593338013,
"num_tokens": 923219.0,
"step": 405
},
{
"entropy": 7.202323579788208,
"epoch": 0.029225176420272295,
"grad_norm": 1.1953125,
"learning_rate": 0.00020449999999999998,
"loss": 6.6816,
"mean_token_accuracy": 0.12373454198241234,
"num_tokens": 934330.0,
"step": 410
},
{
"entropy": 7.256154108047485,
"epoch": 0.029581581010763417,
"grad_norm": 1.046875,
"learning_rate": 0.000207,
"loss": 6.7722,
"mean_token_accuracy": 0.11721484363079071,
"num_tokens": 944993.0,
"step": 415
},
{
"entropy": 7.258368110656738,
"epoch": 0.029937985601254543,
"grad_norm": 1.4453125,
"learning_rate": 0.0002095,
"loss": 6.8156,
"mean_token_accuracy": 0.11557363644242287,
"num_tokens": 955746.0,
"step": 420
},
{
"entropy": 7.2072389125823975,
"epoch": 0.03029439019174567,
"grad_norm": 1.0390625,
"learning_rate": 0.000212,
"loss": 6.8293,
"mean_token_accuracy": 0.11993886753916741,
"num_tokens": 966600.0,
"step": 425
},
{
"entropy": 7.266004419326782,
"epoch": 0.030650794782236795,
"grad_norm": 0.99609375,
"learning_rate": 0.0002145,
"loss": 6.805,
"mean_token_accuracy": 0.1269981436431408,
"num_tokens": 976984.0,
"step": 430
},
{
"entropy": 7.150535726547242,
"epoch": 0.03100719937272792,
"grad_norm": 0.95703125,
"learning_rate": 0.00021700000000000002,
"loss": 6.8464,
"mean_token_accuracy": 0.11060970276594162,
"num_tokens": 990221.0,
"step": 435
},
{
"entropy": 7.21864423751831,
"epoch": 0.03136360396321904,
"grad_norm": 1.2734375,
"learning_rate": 0.0002195,
"loss": 6.7375,
"mean_token_accuracy": 0.1192592665553093,
"num_tokens": 1001583.0,
"step": 440
},
{
"entropy": 7.220152044296265,
"epoch": 0.03172000855371017,
"grad_norm": 1.1953125,
"learning_rate": 0.000222,
"loss": 6.677,
"mean_token_accuracy": 0.12302321866154671,
"num_tokens": 1012170.0,
"step": 445
},
{
"entropy": 7.151835870742798,
"epoch": 0.032076413144201295,
"grad_norm": 1.125,
"learning_rate": 0.0002245,
"loss": 6.7166,
"mean_token_accuracy": 0.11390936076641082,
"num_tokens": 1022948.0,
"step": 450
},
{
"entropy": 7.09367880821228,
"epoch": 0.03243281773469242,
"grad_norm": 0.9921875,
"learning_rate": 0.00022700000000000002,
"loss": 6.7164,
"mean_token_accuracy": 0.12434423863887786,
"num_tokens": 1034764.0,
"step": 455
},
{
"entropy": 7.170623111724853,
"epoch": 0.03278922232518355,
"grad_norm": 0.9921875,
"learning_rate": 0.00022950000000000002,
"loss": 6.7499,
"mean_token_accuracy": 0.12258012518286705,
"num_tokens": 1046485.0,
"step": 460
},
{
"entropy": 7.13931450843811,
"epoch": 0.03314562691567467,
"grad_norm": 1.0390625,
"learning_rate": 0.00023200000000000003,
"loss": 6.6814,
"mean_token_accuracy": 0.11752169504761696,
"num_tokens": 1057819.0,
"step": 465
},
{
"entropy": 7.144642114639282,
"epoch": 0.0335020315061658,
"grad_norm": 1.1484375,
"learning_rate": 0.00023449999999999998,
"loss": 6.734,
"mean_token_accuracy": 0.12212828546762466,
"num_tokens": 1068905.0,
"step": 470
},
{
"entropy": 7.147123908996582,
"epoch": 0.033858436096656924,
"grad_norm": 1.09375,
"learning_rate": 0.000237,
"loss": 6.73,
"mean_token_accuracy": 0.11864650025963783,
"num_tokens": 1081033.0,
"step": 475
},
{
"entropy": 7.132015943527222,
"epoch": 0.03421484068714805,
"grad_norm": 1.1640625,
"learning_rate": 0.0002395,
"loss": 6.7168,
"mean_token_accuracy": 0.1197434201836586,
"num_tokens": 1091294.0,
"step": 480
},
{
"entropy": 6.992530441284179,
"epoch": 0.034571245277639176,
"grad_norm": 0.90234375,
"learning_rate": 0.000242,
"loss": 6.6487,
"mean_token_accuracy": 0.11802349910140038,
"num_tokens": 1103184.0,
"step": 485
},
{
"entropy": 7.111927604675293,
"epoch": 0.0349276498681303,
"grad_norm": 1.1015625,
"learning_rate": 0.0002445,
"loss": 6.7453,
"mean_token_accuracy": 0.11722799465060234,
"num_tokens": 1115141.0,
"step": 490
},
{
"entropy": 7.059013175964355,
"epoch": 0.03528405445862143,
"grad_norm": 1.0,
"learning_rate": 0.000247,
"loss": 6.6724,
"mean_token_accuracy": 0.12403023093938828,
"num_tokens": 1126021.0,
"step": 495
},
{
"entropy": 7.1118261337280275,
"epoch": 0.035640459049112554,
"grad_norm": 1.0859375,
"learning_rate": 0.0002495,
"loss": 6.7861,
"mean_token_accuracy": 0.11621439829468727,
"num_tokens": 1138198.0,
"step": 500
}
],
"logging_steps": 5,
"max_steps": 4000,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 266147382067200.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}