初始化项目,由ModelHub XC社区提供模型

Model: lldois/v43_v29_paper_mix_low_lr25e7_ep15
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-07-19 02:01:10 +08:00
commit 12bf328a3f
17 changed files with 3310 additions and 0 deletions

540
trainer_state.json Normal file
View File

@@ -0,0 +1,540 @@
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.5002627430373097,
"eval_steps": 500,
"global_step": 714,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.021019442984760904,
"grad_norm": 9.625,
"learning_rate": 1.0227272727272728e-07,
"loss": 1.8086944580078126,
"step": 10
},
{
"epoch": 0.04203888596952181,
"grad_norm": 10.5625,
"learning_rate": 2.159090909090909e-07,
"loss": 1.9563072204589844,
"step": 20
},
{
"epoch": 0.0630583289542827,
"grad_norm": 8.375,
"learning_rate": 2.4993688579681983e-07,
"loss": 1.9191463470458985,
"step": 30
},
{
"epoch": 0.08407777193904362,
"grad_norm": 5.21875,
"learning_rate": 2.496279084257832e-07,
"loss": 1.8105619430541993,
"step": 40
},
{
"epoch": 0.10509721492380451,
"grad_norm": 7.15625,
"learning_rate": 2.490621113927919e-07,
"loss": 1.9305204391479491,
"step": 50
},
{
"epoch": 0.1261166579085654,
"grad_norm": 5.21875,
"learning_rate": 2.4824066063093887e-07,
"loss": 1.9595895767211915,
"step": 60
},
{
"epoch": 0.14713610089332632,
"grad_norm": 15.875,
"learning_rate": 2.4716524889676334e-07,
"loss": 1.9885068893432618,
"step": 70
},
{
"epoch": 0.16815554387808723,
"grad_norm": 11.6875,
"learning_rate": 2.458380922820022e-07,
"loss": 1.9129520416259767,
"step": 80
},
{
"epoch": 0.18917498686284814,
"grad_norm": 7.375,
"learning_rate": 2.442619256469084e-07,
"loss": 1.9894475936889648,
"step": 90
},
{
"epoch": 0.21019442984760903,
"grad_norm": 9.25,
"learning_rate": 2.42439996984548e-07,
"loss": 1.8159450531005858,
"step": 100
},
{
"epoch": 0.23121387283236994,
"grad_norm": 5.4375,
"learning_rate": 2.403760607276888e-07,
"loss": 1.9744218826293944,
"step": 110
},
{
"epoch": 0.2522333158171308,
"grad_norm": 8.375,
"learning_rate": 2.3807437001207282e-07,
"loss": 1.8607925415039062,
"step": 120
},
{
"epoch": 0.27325275880189176,
"grad_norm": 6.40625,
"learning_rate": 2.3553966791201608e-07,
"loss": 1.9678337097167968,
"step": 130
},
{
"epoch": 0.29427220178665264,
"grad_norm": 7.84375,
"learning_rate": 2.3277717766639592e-07,
"loss": 1.905088233947754,
"step": 140
},
{
"epoch": 0.3152916447714136,
"grad_norm": 8.1875,
"learning_rate": 2.297925919151675e-07,
"loss": 1.8011585235595704,
"step": 150
},
{
"epoch": 0.33631108775617446,
"grad_norm": 5.6875,
"learning_rate": 2.265920609685895e-07,
"loss": 1.847894287109375,
"step": 160
},
{
"epoch": 0.35733053074093535,
"grad_norm": 4.625,
"learning_rate": 2.2318218013333245e-07,
"loss": 1.8336673736572267,
"step": 170
},
{
"epoch": 0.3783499737256963,
"grad_norm": 15.375,
"learning_rate": 2.1956997612158683e-07,
"loss": 1.9188970565795898,
"step": 180
},
{
"epoch": 0.39936941671045717,
"grad_norm": 5.1875,
"learning_rate": 2.157628925711777e-07,
"loss": 1.9967548370361328,
"step": 190
},
{
"epoch": 0.42038885969521805,
"grad_norm": 6.84375,
"learning_rate": 2.117687747065239e-07,
"loss": 1.9001514434814453,
"step": 200
},
{
"epoch": 0.441408302679979,
"grad_norm": 5.84375,
"learning_rate": 2.0759585317205137e-07,
"loss": 1.939328956604004,
"step": 210
},
{
"epoch": 0.4624277456647399,
"grad_norm": 12.3125,
"learning_rate": 2.0325272707137493e-07,
"loss": 1.9735946655273438,
"step": 220
},
{
"epoch": 0.4834471886495008,
"grad_norm": 5.34375,
"learning_rate": 1.9874834624719906e-07,
"loss": 1.8626848220825196,
"step": 230
},
{
"epoch": 0.5044666316342616,
"grad_norm": 6.4375,
"learning_rate": 1.9409199283845392e-07,
"loss": 1.746560287475586,
"step": 240
},
{
"epoch": 0.5254860746190226,
"grad_norm": 6.4375,
"learning_rate": 1.892932621526712e-07,
"loss": 1.920944595336914,
"step": 250
},
{
"epoch": 0.5465055176037835,
"grad_norm": 8.125,
"learning_rate": 1.8436204289301616e-07,
"loss": 1.9723596572875977,
"step": 260
},
{
"epoch": 0.5675249605885444,
"grad_norm": 5.8125,
"learning_rate": 1.79308496780722e-07,
"loss": 1.8008295059204102,
"step": 270
},
{
"epoch": 0.5885444035733053,
"grad_norm": 6.5,
"learning_rate": 1.7414303761491778e-07,
"loss": 1.8942089080810547,
"step": 280
},
{
"epoch": 0.6095638465580662,
"grad_norm": 7.25,
"learning_rate": 1.6887630981300217e-07,
"loss": 1.9562250137329102,
"step": 290
},
{
"epoch": 0.6305832895428272,
"grad_norm": 4.5,
"learning_rate": 1.6351916647578366e-07,
"loss": 1.8874702453613281,
"step": 300
},
{
"epoch": 0.651602732527588,
"grad_norm": 20.5,
"learning_rate": 1.5808264702258885e-07,
"loss": 1.82128849029541,
"step": 310
},
{
"epoch": 0.6726221755123489,
"grad_norm": 4.59375,
"learning_rate": 1.5257795444242566e-07,
"loss": 1.9460525512695312,
"step": 320
},
{
"epoch": 0.6936416184971098,
"grad_norm": 12.875,
"learning_rate": 1.4701643220808016e-07,
"loss": 1.9333660125732421,
"step": 330
},
{
"epoch": 0.7146610614818707,
"grad_norm": 9.625,
"learning_rate": 1.414095409007192e-07,
"loss": 1.8776426315307617,
"step": 340
},
{
"epoch": 0.7356805044666316,
"grad_norm": 9.875,
"learning_rate": 1.3576883459316937e-07,
"loss": 1.8990169525146485,
"step": 350
},
{
"epoch": 0.7566999474513926,
"grad_norm": 6.15625,
"learning_rate": 1.3010593704053815e-07,
"loss": 1.9327930450439452,
"step": 360
},
{
"epoch": 0.7777193904361535,
"grad_norm": 5.65625,
"learning_rate": 1.2443251772724124e-07,
"loss": 1.9645748138427734,
"step": 370
},
{
"epoch": 0.7987388334209143,
"grad_norm": 15.25,
"learning_rate": 1.1876026781979653e-07,
"loss": 1.9750782012939454,
"step": 380
},
{
"epoch": 0.8197582764056752,
"grad_norm": 9.3125,
"learning_rate": 1.1310087607493711e-07,
"loss": 1.9279960632324218,
"step": 390
},
{
"epoch": 0.8407777193904361,
"grad_norm": 9.1875,
"learning_rate": 1.0746600475269085e-07,
"loss": 1.9484302520751953,
"step": 400
},
{
"epoch": 0.8617971623751971,
"grad_norm": 4.53125,
"learning_rate": 1.0186726558406097e-07,
"loss": 1.9229631423950195,
"step": 410
},
{
"epoch": 0.882816605359958,
"grad_norm": 7.96875,
"learning_rate": 9.631619584283176e-08,
"loss": 1.9820945739746094,
"step": 420
},
{
"epoch": 0.9038360483447189,
"grad_norm": 6.1875,
"learning_rate": 9.08242345708071e-08,
"loss": 2.0028038024902344,
"step": 430
},
{
"epoch": 0.9248554913294798,
"grad_norm": 6.28125,
"learning_rate": 8.540269900547556e-08,
"loss": 1.9427295684814454,
"step": 440
},
{
"epoch": 0.9458749343142406,
"grad_norm": 5.03125,
"learning_rate": 8.00627612586759e-08,
"loss": 1.8801141738891602,
"step": 450
},
{
"epoch": 0.9668943772990016,
"grad_norm": 12.5,
"learning_rate": 7.48154252943221e-08,
"loss": 1.7729660034179688,
"step": 460
},
{
"epoch": 0.9879138202837625,
"grad_norm": 6.3125,
"learning_rate": 6.967150425262934e-08,
"loss": 2.0267822265625,
"step": 470
},
{
"epoch": 1.0084077771939044,
"grad_norm": 7.25,
"learning_rate": 6.464159816756865e-08,
"loss": 1.847897720336914,
"step": 480
},
{
"epoch": 1.0294272201786652,
"grad_norm": 6.46875,
"learning_rate": 5.973607212346771e-08,
"loss": 1.7879396438598634,
"step": 490
},
{
"epoch": 1.0504466631634262,
"grad_norm": 10.0625,
"learning_rate": 5.496503489577081e-08,
"loss": 2.006256675720215,
"step": 500
},
{
"epoch": 1.0714661061481872,
"grad_norm": 19.125,
"learning_rate": 5.033831811997166e-08,
"loss": 1.9164451599121093,
"step": 510
},
{
"epoch": 1.092485549132948,
"grad_norm": 5.34375,
"learning_rate": 4.5865456031646654e-08,
"loss": 1.7832933425903321,
"step": 520
},
{
"epoch": 1.113504992117709,
"grad_norm": 5.75,
"learning_rate": 4.1555665819337293e-08,
"loss": 1.8139366149902343,
"step": 530
},
{
"epoch": 1.1345244351024697,
"grad_norm": 5.84375,
"learning_rate": 3.7417828630768835e-08,
"loss": 1.869268798828125,
"step": 540
},
{
"epoch": 1.1555438780872307,
"grad_norm": 6.46875,
"learning_rate": 3.346047127154539e-08,
"loss": 1.878763771057129,
"step": 550
},
{
"epoch": 1.1765633210719917,
"grad_norm": 10.0625,
"learning_rate": 2.9691748634034702e-08,
"loss": 1.8553329467773438,
"step": 560
},
{
"epoch": 1.1975827640567525,
"grad_norm": 13.3125,
"learning_rate": 2.6119426892651426e-08,
"loss": 1.8416221618652344,
"step": 570
},
{
"epoch": 1.2186022070415135,
"grad_norm": 7.03125,
"learning_rate": 2.275086750016812e-08,
"loss": 1.9319948196411132,
"step": 580
},
{
"epoch": 1.2396216500262742,
"grad_norm": 5.53125,
"learning_rate": 1.959301201803254e-08,
"loss": 1.7423213958740233,
"step": 590
},
{
"epoch": 1.2606410930110352,
"grad_norm": 6.28125,
"learning_rate": 1.6652367811951715e-08,
"loss": 1.9869190216064454,
"step": 600
},
{
"epoch": 1.2816605359957962,
"grad_norm": 14.75,
"learning_rate": 1.3934994642219104e-08,
"loss": 1.8976511001586913,
"step": 610
},
{
"epoch": 1.302679978980557,
"grad_norm": 9.375,
"learning_rate": 1.1446492176418563e-08,
"loss": 1.9856376647949219,
"step": 620
},
{
"epoch": 1.323699421965318,
"grad_norm": 5.125,
"learning_rate": 9.191988450237387e-09,
"loss": 2.0055776596069337,
"step": 630
},
{
"epoch": 1.3447188649500788,
"grad_norm": 9.25,
"learning_rate": 7.1761293001671855e-09,
"loss": 1.9813310623168945,
"step": 640
},
{
"epoch": 1.3657383079348397,
"grad_norm": 7.1875,
"learning_rate": 5.403068789868334e-09,
"loss": 1.9645788192749023,
"step": 650
},
{
"epoch": 1.3867577509196005,
"grad_norm": 4.21875,
"learning_rate": 3.8764606499268606e-09,
"loss": 1.9697418212890625,
"step": 660
},
{
"epoch": 1.4077771939043615,
"grad_norm": 5.15625,
"learning_rate": 2.599450748642956e-09,
"loss": 1.8822681427001953,
"step": 670
},
{
"epoch": 1.4287966368891225,
"grad_norm": 6.9375,
"learning_rate": 1.5746706093672235e-09,
"loss": 1.9432037353515625,
"step": 680
},
{
"epoch": 1.4498160798738833,
"grad_norm": 7.09375,
"learning_rate": 8.042319877430981e-10,
"loss": 1.8227525711059571,
"step": 690
},
{
"epoch": 1.4708355228586443,
"grad_norm": 6.875,
"learning_rate": 2.897225200300807e-10,
"loss": 1.9617921829223632,
"step": 700
},
{
"epoch": 1.4918549658434053,
"grad_norm": 11.1875,
"learning_rate": 3.220245147531053e-11,
"loss": 1.9124065399169923,
"step": 710
},
{
"epoch": 1.5002627430373097,
"step": 714,
"total_flos": 3.414600284463329e+17,
"train_loss": 1.907181319736299,
"train_runtime": 5553.447,
"train_samples_per_second": 0.514,
"train_steps_per_second": 0.129
}
],
"logging_steps": 10,
"max_steps": 714,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": false,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3.414600284463329e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}