初始化项目,由ModelHub XC社区提供模型

Model: lldois/v42_v29_user_evolution_guard_lr5e7_ep10
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-07-19 01:58:10 +08:00
commit df882f613a
17 changed files with 3229 additions and 0 deletions

498
trainer_state.json Normal file
View File

@@ -0,0 +1,498 @@
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 653,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.015319800842589047,
"grad_norm": 4.5,
"learning_rate": 2.25e-07,
"loss": 1.8881567001342774,
"step": 10
},
{
"epoch": 0.030639601685178094,
"grad_norm": 12.9375,
"learning_rate": 4.7499999999999995e-07,
"loss": 2.0835521697998045,
"step": 20
},
{
"epoch": 0.04595940252776714,
"grad_norm": 10.0,
"learning_rate": 4.997506466835169e-07,
"loss": 1.9390586853027343,
"step": 30
},
{
"epoch": 0.06127920337035619,
"grad_norm": 11.6875,
"learning_rate": 4.988893231902699e-07,
"loss": 1.9236089706420898,
"step": 40
},
{
"epoch": 0.07659900421294523,
"grad_norm": 13.375,
"learning_rate": 4.974150717193653e-07,
"loss": 1.716681671142578,
"step": 50
},
{
"epoch": 0.09191880505553428,
"grad_norm": 7.65625,
"learning_rate": 4.953315228402511e-07,
"loss": 1.9944971084594727,
"step": 60
},
{
"epoch": 0.10723860589812333,
"grad_norm": 9.25,
"learning_rate": 4.926438076103162e-07,
"loss": 1.9377096176147461,
"step": 70
},
{
"epoch": 0.12255840674071238,
"grad_norm": 12.0625,
"learning_rate": 4.893585449388785e-07,
"loss": 2.0413049697875976,
"step": 80
},
{
"epoch": 0.1378782075833014,
"grad_norm": 6.03125,
"learning_rate": 4.854838252871096e-07,
"loss": 1.8533470153808593,
"step": 90
},
{
"epoch": 0.15319800842589046,
"grad_norm": 4.5625,
"learning_rate": 4.810291907440381e-07,
"loss": 1.641725730895996,
"step": 100
},
{
"epoch": 0.1685178092684795,
"grad_norm": 5.84375,
"learning_rate": 4.7600561152769787e-07,
"loss": 1.8656742095947265,
"step": 110
},
{
"epoch": 0.18383761011106856,
"grad_norm": 11.0,
"learning_rate": 4.704254589692902e-07,
"loss": 1.9227891921997071,
"step": 120
},
{
"epoch": 0.1991574109536576,
"grad_norm": 7.03125,
"learning_rate": 4.6430247504689124e-07,
"loss": 1.9448070526123047,
"step": 130
},
{
"epoch": 0.21447721179624665,
"grad_norm": 10.9375,
"learning_rate": 4.576517385437314e-07,
"loss": 1.8896455764770508,
"step": 140
},
{
"epoch": 0.2297970126388357,
"grad_norm": 9.9375,
"learning_rate": 4.504896279143888e-07,
"loss": 1.874186897277832,
"step": 150
},
{
"epoch": 0.24511681348142475,
"grad_norm": 6.09375,
"learning_rate": 4.4283378095034244e-07,
"loss": 1.7868270874023438,
"step": 160
},
{
"epoch": 0.26043661432401377,
"grad_norm": 5.125,
"learning_rate": 4.347030513442168e-07,
"loss": 2.1282052993774414,
"step": 170
},
{
"epoch": 0.2757564151666028,
"grad_norm": 5.9375,
"learning_rate": 4.261174622596835e-07,
"loss": 1.8293880462646483,
"step": 180
},
{
"epoch": 0.29107621600919187,
"grad_norm": 12.3125,
"learning_rate": 4.170981570213621e-07,
"loss": 2.0162126541137697,
"step": 190
},
{
"epoch": 0.3063960168517809,
"grad_norm": 17.25,
"learning_rate": 4.076673470461537e-07,
"loss": 1.958943748474121,
"step": 200
},
{
"epoch": 0.32171581769436997,
"grad_norm": 12.9375,
"learning_rate": 3.978482571442339e-07,
"loss": 1.844751739501953,
"step": 210
},
{
"epoch": 0.337035618536959,
"grad_norm": 5.9375,
"learning_rate": 3.876650683244093e-07,
"loss": 1.926915740966797,
"step": 220
},
{
"epoch": 0.35235541937954806,
"grad_norm": 6.0,
"learning_rate": 3.771428582446907e-07,
"loss": 1.620564079284668,
"step": 230
},
{
"epoch": 0.3676752202221371,
"grad_norm": 4.78125,
"learning_rate": 3.663075394547285e-07,
"loss": 1.9423002243041991,
"step": 240
},
{
"epoch": 0.38299502106472616,
"grad_norm": 6.1875,
"learning_rate": 3.551857955822014e-07,
"loss": 1.8801351547241212,
"step": 250
},
{
"epoch": 0.3983148219073152,
"grad_norm": 5.75,
"learning_rate": 3.43805015620307e-07,
"loss": 1.84176025390625,
"step": 260
},
{
"epoch": 0.41363462274990426,
"grad_norm": 9.9375,
"learning_rate": 3.3219322647818214e-07,
"loss": 1.9039052963256835,
"step": 270
},
{
"epoch": 0.4289544235924933,
"grad_norm": 7.71875,
"learning_rate": 3.2037902396035824e-07,
"loss": 2.1408451080322264,
"step": 280
},
{
"epoch": 0.44427422443508235,
"grad_norm": 14.3125,
"learning_rate": 3.0839150234522397e-07,
"loss": 1.8292259216308593,
"step": 290
},
{
"epoch": 0.4595940252776714,
"grad_norm": 13.75,
"learning_rate": 2.9626018273592076e-07,
"loss": 1.767644500732422,
"step": 300
},
{
"epoch": 0.47491382612026045,
"grad_norm": 8.5625,
"learning_rate": 2.840149403601165e-07,
"loss": 2.0017181396484376,
"step": 310
},
{
"epoch": 0.4902336269628495,
"grad_norm": 5.5625,
"learning_rate": 2.716859309976941e-07,
"loss": 1.9466903686523438,
"step": 320
},
{
"epoch": 0.5055534278054385,
"grad_norm": 12.375,
"learning_rate": 2.59303516717537e-07,
"loss": 1.7483896255493163,
"step": 330
},
{
"epoch": 0.5208732286480275,
"grad_norm": 5.6875,
"learning_rate": 2.4689819110629636e-07,
"loss": 1.6642837524414062,
"step": 340
},
{
"epoch": 0.5361930294906166,
"grad_norm": 7.53125,
"learning_rate": 2.3450050417327588e-07,
"loss": 1.879330825805664,
"step": 350
},
{
"epoch": 0.5515128303332056,
"grad_norm": 11.125,
"learning_rate": 2.2214098711636751e-07,
"loss": 1.950868797302246,
"step": 360
},
{
"epoch": 0.5668326311757947,
"grad_norm": 9.375,
"learning_rate": 2.0985007713431238e-07,
"loss": 1.9813783645629883,
"step": 370
},
{
"epoch": 0.5821524320183837,
"grad_norm": 6.96875,
"learning_rate": 1.9765804247044975e-07,
"loss": 1.7870925903320312,
"step": 380
},
{
"epoch": 0.5974722328609728,
"grad_norm": 17.5,
"learning_rate": 1.855949078725442e-07,
"loss": 1.9392311096191406,
"step": 390
},
{
"epoch": 0.6127920337035618,
"grad_norm": 13.375,
"learning_rate": 1.7369038065225742e-07,
"loss": 1.9289718627929688,
"step": 400
},
{
"epoch": 0.6281118345461509,
"grad_norm": 8.4375,
"learning_rate": 1.619737775263556e-07,
"loss": 1.8457157135009765,
"step": 410
},
{
"epoch": 0.6434316353887399,
"grad_norm": 5.96875,
"learning_rate": 1.5047395241981604e-07,
"loss": 1.831606674194336,
"step": 420
},
{
"epoch": 0.658751436231329,
"grad_norm": 8.375,
"learning_rate": 1.3921922540862904e-07,
"loss": 1.941716194152832,
"step": 430
},
{
"epoch": 0.674071237073918,
"grad_norm": 5.1875,
"learning_rate": 1.2823731297728534e-07,
"loss": 1.8431577682495117,
"step": 440
},
{
"epoch": 0.6893910379165071,
"grad_norm": 7.90625,
"learning_rate": 1.175552597626985e-07,
"loss": 2.0610845565795897,
"step": 450
},
{
"epoch": 0.7047108387590961,
"grad_norm": 4.375,
"learning_rate": 1.0719937195265555e-07,
"loss": 1.9088102340698243,
"step": 460
},
{
"epoch": 0.7200306396016852,
"grad_norm": 8.8125,
"learning_rate": 9.719515250281121e-08,
"loss": 1.9430780410766602,
"step": 470
},
{
"epoch": 0.7353504404442742,
"grad_norm": 4.6875,
"learning_rate": 8.756723833176374e-08,
"loss": 1.8786405563354491,
"step": 480
},
{
"epoch": 0.7506702412868632,
"grad_norm": 12.0625,
"learning_rate": 7.833933964887984e-08,
"loss": 1.9569564819335938,
"step": 490
},
{
"epoch": 0.7659900421294523,
"grad_norm": 23.375,
"learning_rate": 6.95341815642815e-08,
"loss": 2.0343820571899416,
"step": 500
},
{
"epoch": 0.7813098429720413,
"grad_norm": 7.84375,
"learning_rate": 6.117344812479152e-08,
"loss": 2.027488136291504,
"step": 510
},
{
"epoch": 0.7966296438146304,
"grad_norm": 10.9375,
"learning_rate": 5.3277728913655644e-08,
"loss": 1.718618392944336,
"step": 520
},
{
"epoch": 0.8119494446572194,
"grad_norm": 7.28125,
"learning_rate": 4.586646834554864e-08,
"loss": 1.826439666748047,
"step": 530
},
{
"epoch": 0.8272692454998085,
"grad_norm": 16.125,
"learning_rate": 3.895791778173288e-08,
"loss": 1.8948688507080078,
"step": 540
},
{
"epoch": 0.8425890463423975,
"grad_norm": 6.4375,
"learning_rate": 3.256909058329335e-08,
"loss": 1.9602611541748047,
"step": 550
},
{
"epoch": 0.8579088471849866,
"grad_norm": 8.1875,
"learning_rate": 2.671572021313695e-08,
"loss": 1.9529207229614258,
"step": 560
},
{
"epoch": 0.8732286480275756,
"grad_norm": 6.78125,
"learning_rate": 2.1412221489936795e-08,
"loss": 1.9812084197998048,
"step": 570
},
{
"epoch": 0.8885484488701647,
"grad_norm": 9.5625,
"learning_rate": 1.6671655089439186e-08,
"loss": 2.084661865234375,
"step": 580
},
{
"epoch": 0.9038682497127537,
"grad_norm": 4.9375,
"learning_rate": 1.250569538055471e-08,
"loss": 1.9481664657592774,
"step": 590
},
{
"epoch": 0.9191880505553428,
"grad_norm": 4.53125,
"learning_rate": 8.924601675441207e-09,
"loss": 1.9511104583740235,
"step": 600
},
{
"epoch": 0.9345078513979318,
"grad_norm": 17.0,
"learning_rate": 5.937192964380555e-09,
"loss": 2.0635440826416014,
"step": 610
},
{
"epoch": 0.9498276522405209,
"grad_norm": 17.625,
"learning_rate": 3.550826197667889e-09,
"loss": 1.669927978515625,
"step": 620
},
{
"epoch": 0.9651474530831099,
"grad_norm": 4.09375,
"learning_rate": 1.7713781679977447e-09,
"loss": 1.881399917602539,
"step": 630
},
{
"epoch": 0.980467253925699,
"grad_norm": 5.03125,
"learning_rate": 6.032310379642803e-10,
"loss": 1.9342432022094727,
"step": 640
},
{
"epoch": 0.995787054768288,
"grad_norm": 6.15625,
"learning_rate": 4.926154831655371e-11,
"loss": 1.9714859008789063,
"step": 650
},
{
"epoch": 1.0,
"step": 653,
"total_flos": 3.143810179830989e+17,
"train_loss": 1.9069785443783536,
"train_runtime": 5405.3324,
"train_samples_per_second": 0.483,
"train_steps_per_second": 0.121
}
],
"logging_steps": 10,
"max_steps": 653,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": false,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3.143810179830989e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}