初始化项目,由ModelHub XC社区提供模型

Model: Skyorca/JT-DA-Safe
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-08-08 12:09:13 +08:00
commit 17bf69f29d
24 changed files with 1445 additions and 0 deletions

186
trainer_state.json Normal file
View File

@@ -0,0 +1,186 @@
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.3893805309734513,
"eval_steps": 5,
"global_step": 40,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.17699115044247787,
"grad_norm": 1.4092590808868408,
"learning_rate": 8.888888888888888e-07,
"loss": 0.7311,
"step": 5
},
{
"epoch": 0.17699115044247787,
"eval_runtime": 463.9821,
"eval_samples_per_second": 0.455,
"eval_sombench_accuracy": 0.6066350710900474,
"eval_sombench_dim1_accuracy": 0.5168539325842697,
"eval_sombench_dim2_accuracy": 0.675,
"eval_sombench_dim3_accuracy": 0.6666666666666666,
"eval_sombench_leaderboard_score": 60.65,
"eval_steps_per_second": 0.015,
"step": 5
},
{
"epoch": 0.35398230088495575,
"grad_norm": 1.3532044887542725,
"learning_rate": 2e-06,
"loss": 0.7118,
"step": 10
},
{
"epoch": 0.35398230088495575,
"eval_runtime": 123.0467,
"eval_samples_per_second": 1.715,
"eval_sombench_accuracy": 0.6018957345971564,
"eval_sombench_dim1_accuracy": 0.5168539325842697,
"eval_sombench_dim2_accuracy": 0.6625,
"eval_sombench_dim3_accuracy": 0.6666666666666666,
"eval_sombench_leaderboard_score": 60.18,
"eval_steps_per_second": 0.057,
"step": 10
},
{
"epoch": 0.5309734513274337,
"grad_norm": 1.273472785949707,
"learning_rate": 1.9781476007338054e-06,
"loss": 0.7233,
"step": 15
},
{
"epoch": 0.5309734513274337,
"eval_runtime": 120.8118,
"eval_samples_per_second": 1.747,
"eval_sombench_accuracy": 0.6066350710900474,
"eval_sombench_dim1_accuracy": 0.4943820224719101,
"eval_sombench_dim2_accuracy": 0.6875,
"eval_sombench_dim3_accuracy": 0.6904761904761905,
"eval_sombench_leaderboard_score": 60.65,
"eval_steps_per_second": 0.058,
"step": 15
},
{
"epoch": 0.7079646017699115,
"grad_norm": 1.3325337171554565,
"learning_rate": 1.9135454576426007e-06,
"loss": 0.7059,
"step": 20
},
{
"epoch": 0.7079646017699115,
"eval_runtime": 111.9794,
"eval_samples_per_second": 1.884,
"eval_sombench_accuracy": 0.5924170616113744,
"eval_sombench_dim1_accuracy": 0.47191011235955055,
"eval_sombench_dim2_accuracy": 0.675,
"eval_sombench_dim3_accuracy": 0.6904761904761905,
"eval_sombench_leaderboard_score": 59.22,
"eval_steps_per_second": 0.063,
"step": 20
},
{
"epoch": 0.8849557522123894,
"grad_norm": 1.2877130508422852,
"learning_rate": 1.8090169943749474e-06,
"loss": 0.6969,
"step": 25
},
{
"epoch": 0.8849557522123894,
"eval_runtime": 110.0958,
"eval_samples_per_second": 1.917,
"eval_sombench_accuracy": 0.6161137440758294,
"eval_sombench_dim1_accuracy": 0.4943820224719101,
"eval_sombench_dim2_accuracy": 0.7,
"eval_sombench_dim3_accuracy": 0.7142857142857143,
"eval_sombench_leaderboard_score": 61.59,
"eval_steps_per_second": 0.064,
"step": 25
},
{
"epoch": 1.0353982300884956,
"grad_norm": 1.266132116317749,
"learning_rate": 1.669130606358858e-06,
"loss": 0.6947,
"step": 30
},
{
"epoch": 1.0353982300884956,
"eval_runtime": 107.7201,
"eval_samples_per_second": 1.959,
"eval_sombench_accuracy": 0.6208530805687204,
"eval_sombench_dim1_accuracy": 0.5280898876404494,
"eval_sombench_dim2_accuracy": 0.675,
"eval_sombench_dim3_accuracy": 0.7142857142857143,
"eval_sombench_leaderboard_score": 62.07,
"eval_steps_per_second": 0.065,
"step": 30
},
{
"epoch": 1.2123893805309733,
"grad_norm": 1.20622718334198,
"learning_rate": 1.5e-06,
"loss": 0.6717,
"step": 35
},
{
"epoch": 1.2123893805309733,
"eval_runtime": 109.6785,
"eval_samples_per_second": 1.924,
"eval_sombench_accuracy": 0.6208530805687204,
"eval_sombench_dim1_accuracy": 0.5168539325842697,
"eval_sombench_dim2_accuracy": 0.6875,
"eval_sombench_dim3_accuracy": 0.7142857142857143,
"eval_sombench_leaderboard_score": 62.07,
"eval_steps_per_second": 0.064,
"step": 35
},
{
"epoch": 1.3893805309734513,
"grad_norm": 1.228661298751831,
"learning_rate": 1.3090169943749473e-06,
"loss": 0.6556,
"step": 40
},
{
"epoch": 1.3893805309734513,
"eval_runtime": 108.9835,
"eval_samples_per_second": 1.936,
"eval_sombench_accuracy": 0.6255924170616114,
"eval_sombench_dim1_accuracy": 0.5168539325842697,
"eval_sombench_dim2_accuracy": 0.6875,
"eval_sombench_dim3_accuracy": 0.7380952380952381,
"eval_sombench_leaderboard_score": 62.54,
"eval_steps_per_second": 0.064,
"step": 40
}
],
"logging_steps": 5,
"max_steps": 84,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 5,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.597738925865042e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}