Files
v41_v29_baseline_general_re…/trainer_state.json
ModelHub XC 816fcdc880 初始化项目,由ModelHub XC社区提供模型
Model: lldois/v41_v29_baseline_general_replay_lr4e7_ep10
Source: Original Platform
2026-07-19 01:57:10 +08:00

576 lines
14 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 764,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.01309328968903437,
"grad_norm": 4.5625,
"learning_rate": 1.5652173913043477e-07,
"loss": 1.7698013305664062,
"step": 10
},
{
"epoch": 0.02618657937806874,
"grad_norm": 4.75,
"learning_rate": 3.304347826086956e-07,
"loss": 1.8119827270507813,
"step": 20
},
{
"epoch": 0.03927986906710311,
"grad_norm": 8.6875,
"learning_rate": 3.9993529431919234e-07,
"loss": 1.6693140029907227,
"step": 30
},
{
"epoch": 0.05237315875613748,
"grad_norm": 7.59375,
"learning_rate": 3.995400223257334e-07,
"loss": 1.6907798767089843,
"step": 40
},
{
"epoch": 0.06546644844517185,
"grad_norm": 6.5,
"learning_rate": 3.9878613546358986e-07,
"loss": 1.6979778289794922,
"step": 50
},
{
"epoch": 0.07855973813420622,
"grad_norm": 5.84375,
"learning_rate": 3.9767498862405076e-07,
"loss": 1.8435844421386718,
"step": 60
},
{
"epoch": 0.09165302782324058,
"grad_norm": 4.9375,
"learning_rate": 3.9620857876879474e-07,
"loss": 1.7747735977172852,
"step": 70
},
{
"epoch": 0.10474631751227496,
"grad_norm": 6.5,
"learning_rate": 3.943895413409353e-07,
"loss": 1.5791229248046874,
"step": 80
},
{
"epoch": 0.11783960720130933,
"grad_norm": 4.84375,
"learning_rate": 3.9222114552858167e-07,
"loss": 1.7737991333007812,
"step": 90
},
{
"epoch": 0.1309328968903437,
"grad_norm": 4.4375,
"learning_rate": 3.8970728838942903e-07,
"loss": 1.6754600524902343,
"step": 100
},
{
"epoch": 0.14402618657937807,
"grad_norm": 14.0625,
"learning_rate": 3.8685248784693646e-07,
"loss": 1.663345718383789,
"step": 110
},
{
"epoch": 0.15711947626841244,
"grad_norm": 5.0,
"learning_rate": 3.8366187457067924e-07,
"loss": 1.7084470748901368,
"step": 120
},
{
"epoch": 0.1702127659574468,
"grad_norm": 4.375,
"learning_rate": 3.8014118275547113e-07,
"loss": 1.6630699157714843,
"step": 130
},
{
"epoch": 0.18330605564648117,
"grad_norm": 4.15625,
"learning_rate": 3.7629673981582394e-07,
"loss": 1.7131948471069336,
"step": 140
},
{
"epoch": 0.19639934533551553,
"grad_norm": 5.03125,
"learning_rate": 3.7213545501427004e-07,
"loss": 1.707387351989746,
"step": 150
},
{
"epoch": 0.20949263502454993,
"grad_norm": 5.0,
"learning_rate": 3.676648070439823e-07,
"loss": 1.6667047500610352,
"step": 160
},
{
"epoch": 0.2225859247135843,
"grad_norm": 5.28125,
"learning_rate": 3.628928305880089e-07,
"loss": 1.6005857467651368,
"step": 170
},
{
"epoch": 0.23567921440261866,
"grad_norm": 5.28125,
"learning_rate": 3.578281018792787e-07,
"loss": 1.7023710250854491,
"step": 180
},
{
"epoch": 0.24877250409165302,
"grad_norm": 5.84375,
"learning_rate": 3.524797232873297e-07,
"loss": 1.7205501556396485,
"step": 190
},
{
"epoch": 0.2618657937806874,
"grad_norm": 4.5,
"learning_rate": 3.4685730695945973e-07,
"loss": 1.7906591415405273,
"step": 200
},
{
"epoch": 0.27495908346972175,
"grad_norm": 4.6875,
"learning_rate": 3.409709575457015e-07,
"loss": 1.7032752990722657,
"step": 210
},
{
"epoch": 0.28805237315875615,
"grad_norm": 4.71875,
"learning_rate": 3.348312540386673e-07,
"loss": 1.767839241027832,
"step": 220
},
{
"epoch": 0.3011456628477905,
"grad_norm": 4.375,
"learning_rate": 3.28449230760902e-07,
"loss": 1.6559026718139649,
"step": 230
},
{
"epoch": 0.3142389525368249,
"grad_norm": 4.0625,
"learning_rate": 3.218363575339131e-07,
"loss": 1.7474025726318358,
"step": 240
},
{
"epoch": 0.32733224222585927,
"grad_norm": 4.71875,
"learning_rate": 3.1500451906451933e-07,
"loss": 1.7392288208007813,
"step": 250
},
{
"epoch": 0.3404255319148936,
"grad_norm": 4.6875,
"learning_rate": 3.079659935855634e-07,
"loss": 1.7795156478881835,
"step": 260
},
{
"epoch": 0.353518821603928,
"grad_norm": 6.6875,
"learning_rate": 3.0073343078937755e-07,
"loss": 1.6928770065307617,
"step": 270
},
{
"epoch": 0.36661211129296234,
"grad_norm": 5.28125,
"learning_rate": 2.9331982909365844e-07,
"loss": 1.7049606323242188,
"step": 280
},
{
"epoch": 0.37970540098199673,
"grad_norm": 5.375,
"learning_rate": 2.857385122806108e-07,
"loss": 1.7637083053588867,
"step": 290
},
{
"epoch": 0.39279869067103107,
"grad_norm": 4.28125,
"learning_rate": 2.7800310555134313e-07,
"loss": 1.7917778015136718,
"step": 300
},
{
"epoch": 0.40589198036006546,
"grad_norm": 6.09375,
"learning_rate": 2.7012751103855087e-07,
"loss": 1.6547735214233399,
"step": 310
},
{
"epoch": 0.41898527004909986,
"grad_norm": 4.78125,
"learning_rate": 2.6212588282149646e-07,
"loss": 1.718545913696289,
"step": 320
},
{
"epoch": 0.4320785597381342,
"grad_norm": 5.40625,
"learning_rate": 2.5401260148818855e-07,
"loss": 1.7531944274902345,
"step": 330
},
{
"epoch": 0.4451718494271686,
"grad_norm": 7.75,
"learning_rate": 2.458022482904785e-07,
"loss": 1.8378955841064453,
"step": 340
},
{
"epoch": 0.4582651391162029,
"grad_norm": 4.21875,
"learning_rate": 2.3750957893852184e-07,
"loss": 1.7262359619140626,
"step": 350
},
{
"epoch": 0.4713584288052373,
"grad_norm": 4.3125,
"learning_rate": 2.2914949708170187e-07,
"loss": 1.7179519653320312,
"step": 360
},
{
"epoch": 0.4844517184942717,
"grad_norm": 4.34375,
"learning_rate": 2.2073702752367623e-07,
"loss": 1.6968917846679688,
"step": 370
},
{
"epoch": 0.49754500818330605,
"grad_norm": 4.1875,
"learning_rate": 2.1228728921968352e-07,
"loss": 1.7417394638061523,
"step": 380
},
{
"epoch": 0.5106382978723404,
"grad_norm": 4.5,
"learning_rate": 2.0381546810464044e-07,
"loss": 1.6095331192016602,
"step": 390
},
{
"epoch": 0.5237315875613748,
"grad_norm": 5.3125,
"learning_rate": 1.9533678980086213e-07,
"loss": 1.675015640258789,
"step": 400
},
{
"epoch": 0.5368248772504092,
"grad_norm": 6.15625,
"learning_rate": 1.8686649225445636e-07,
"loss": 1.8056396484375,
"step": 410
},
{
"epoch": 0.5499181669394435,
"grad_norm": 4.8125,
"learning_rate": 1.784197983495689e-07,
"loss": 1.7800405502319336,
"step": 420
},
{
"epoch": 0.563011456628478,
"grad_norm": 5.09375,
"learning_rate": 1.700118885496989e-07,
"loss": 1.7622718811035156,
"step": 430
},
{
"epoch": 0.5761047463175123,
"grad_norm": 4.84375,
"learning_rate": 1.6165787361525235e-07,
"loss": 1.738749885559082,
"step": 440
},
{
"epoch": 0.5891980360065466,
"grad_norm": 4.375,
"learning_rate": 1.5337276744636715e-07,
"loss": 1.6596288681030273,
"step": 450
},
{
"epoch": 0.602291325695581,
"grad_norm": 8.625,
"learning_rate": 1.4517146009981576e-07,
"loss": 1.5231310844421386,
"step": 460
},
{
"epoch": 0.6153846153846154,
"grad_norm": 8.0,
"learning_rate": 1.3706869102847999e-07,
"loss": 1.6872207641601562,
"step": 470
},
{
"epoch": 0.6284779050736498,
"grad_norm": 4.125,
"learning_rate": 1.2907902259149286e-07,
"loss": 1.7282188415527344,
"step": 480
},
{
"epoch": 0.6415711947626841,
"grad_norm": 5.4375,
"learning_rate": 1.2121681388265402e-07,
"loss": 1.6931528091430663,
"step": 490
},
{
"epoch": 0.6546644844517185,
"grad_norm": 6.84375,
"learning_rate": 1.1349619492415559e-07,
"loss": 1.7433677673339845,
"step": 500
},
{
"epoch": 0.6677577741407529,
"grad_norm": 4.5,
"learning_rate": 1.0593104127199734e-07,
"loss": 1.7254501342773438,
"step": 510
},
{
"epoch": 0.6808510638297872,
"grad_norm": 4.96875,
"learning_rate": 9.853494907873017e-08,
"loss": 1.6848495483398438,
"step": 520
},
{
"epoch": 0.6939443535188216,
"grad_norm": 4.8125,
"learning_rate": 9.132121065834575e-08,
"loss": 1.7002685546875,
"step": 530
},
{
"epoch": 0.707037643207856,
"grad_norm": 5.15625,
"learning_rate": 8.430279059722733e-08,
"loss": 1.7304063796997071,
"step": 540
},
{
"epoch": 0.7201309328968903,
"grad_norm": 7.09375,
"learning_rate": 7.74923024540949e-08,
"loss": 1.690472412109375,
"step": 550
},
{
"epoch": 0.7332242225859247,
"grad_norm": 4.40625,
"learning_rate": 7.090198609081998e-08,
"loss": 1.6513166427612305,
"step": 560
},
{
"epoch": 0.7463175122749591,
"grad_norm": 4.9375,
"learning_rate": 6.454368567485182e-08,
"loss": 1.827246856689453,
"step": 570
},
{
"epoch": 0.7594108019639935,
"grad_norm": 4.59375,
"learning_rate": 5.84288283927874e-08,
"loss": 1.6964548110961915,
"step": 580
},
{
"epoch": 0.7725040916530278,
"grad_norm": 6.625,
"learning_rate": 5.2568403913344275e-08,
"loss": 1.660973358154297,
"step": 590
},
{
"epoch": 0.7855973813420621,
"grad_norm": 4.71875,
"learning_rate": 4.697294463664261e-08,
"loss": 1.725875473022461,
"step": 600
},
{
"epoch": 0.7986906710310966,
"grad_norm": 4.0625,
"learning_rate": 4.165250676529466e-08,
"loss": 1.63555965423584,
"step": 610
},
{
"epoch": 0.8117839607201309,
"grad_norm": 3.796875,
"learning_rate": 3.6616652231319514e-08,
"loss": 1.6531944274902344,
"step": 620
},
{
"epoch": 0.8248772504091653,
"grad_norm": 5.5625,
"learning_rate": 3.187443151136533e-08,
"loss": 1.6328155517578125,
"step": 630
},
{
"epoch": 0.8379705400981997,
"grad_norm": 5.25,
"learning_rate": 2.7434367361122502e-08,
"loss": 1.6354242324829102,
"step": 640
},
{
"epoch": 0.851063829787234,
"grad_norm": 4.40625,
"learning_rate": 2.3304439498161632e-08,
"loss": 1.7544931411743163,
"step": 650
},
{
"epoch": 0.8641571194762684,
"grad_norm": 4.34375,
"learning_rate": 1.949207026072348e-08,
"loss": 1.6700428009033204,
"step": 660
},
{
"epoch": 0.8772504091653028,
"grad_norm": 5.25,
"learning_rate": 1.6004111268235156e-08,
"loss": 1.6820402145385742,
"step": 670
},
{
"epoch": 0.8903436988543372,
"grad_norm": 5.25,
"learning_rate": 1.2846831107526956e-08,
"loss": 1.7066337585449218,
"step": 680
},
{
"epoch": 0.9034369885433715,
"grad_norm": 4.875,
"learning_rate": 1.0025904066879687e-08,
"loss": 1.7003616333007812,
"step": 690
},
{
"epoch": 0.9165302782324058,
"grad_norm": 4.25,
"learning_rate": 7.546399938149916e-09,
"loss": 1.6916650772094726,
"step": 700
},
{
"epoch": 0.9296235679214403,
"grad_norm": 4.5,
"learning_rate": 5.412774905300987e-09,
"loss": 1.6705923080444336,
"step": 710
},
{
"epoch": 0.9427168576104746,
"grad_norm": 4.90625,
"learning_rate": 3.628863535714699e-09,
"loss": 1.7059362411499024,
"step": 720
},
{
"epoch": 0.955810147299509,
"grad_norm": 4.90625,
"learning_rate": 2.1978718886772608e-09,
"loss": 1.783282470703125,
"step": 730
},
{
"epoch": 0.9689034369885434,
"grad_norm": 4.5625,
"learning_rate": 1.1223717534248001e-09,
"loss": 1.7798967361450195,
"step": 740
},
{
"epoch": 0.9819967266775778,
"grad_norm": 4.1875,
"learning_rate": 4.0429602710385646e-10,
"loss": 1.7239389419555664,
"step": 750
},
{
"epoch": 0.9950900163666121,
"grad_norm": 4.40625,
"learning_rate": 4.4935240953702935e-11,
"loss": 1.678044319152832,
"step": 760
},
{
"epoch": 1.0,
"step": 764,
"total_flos": 3.68251671698516e+17,
"train_loss": 1.7103283592543677,
"train_runtime": 6160.8721,
"train_samples_per_second": 0.496,
"train_steps_per_second": 0.124
}
],
"logging_steps": 10,
"max_steps": 764,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": false,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3.68251671698516e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}