初始化项目,由ModelHub XC社区提供模型

Model: SeongryongJung/Qwen3-4B-Tooluse-RLSD-TR
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-08-20 04:49:19 +08:00
commit a52fcb1e1d
37 changed files with 325922 additions and 0 deletions

View File

@@ -0,0 +1,38 @@
section,parameter,value,source
Run identity,Base model,Qwen/Qwen3-4B,queue/script override
Run identity,Dataset,Tool-use / tooluse,run_qwen3_generalization.sh
Run identity,Method,RLSD_TR,run_qwen3_generalization.sh
Run identity,Config,rlsd,run_qwen3_generalization.sh
Run identity,Experiment,qwen3gen-tooluse-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8,run_qwen3_generalization.sh
Run identity,W&B run,run-20260702_154716-jrdzd11b,wandb
Data,Train file,datasets/tooluse/train.parquet,script override
Data,Validation file,datasets/tooluse/test.parquet,script override
Data,Train batch size,32,queue/script override
Data,Train max samples,3200,queue/script override
Schedule,Total training steps,100,queue/script override
Schedule,Validation before train,False,queue/script override
Schedule,Save frequency,10,queue/script override
Schedule,Validation frequency,10,queue/script override
Sequence,Max prompt length,2048,queue/script override
Sequence,Max response length,8192,queue/script override
Sequence,Max model length,10240,queue/script override
Rollout,Train rollout n,8,queue/script override
Rollout,Validation rollout n,16,queue/script override
Rollout,vLLM GPU memory utilization,0.8,queue/script override
Optimization,Learning rate,1e-6,RLSD_TR method override
Optimization,Weight decay,0.01,script override
PPO/GRPO,PPO mini batch size,8,queue/script override
PPO/GRPO,Normalize GRPO advantages by std,False,baseline_grpo.yaml / script override
Rollout correction,Importance sampling mode,token,script override
Rollout correction,IS threshold,2.0,script override
Checkpoint/Logging,Checkpoint root,checkpoints/datasets/tooluse/qwen3gen-tooluse-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8,script override
Checkpoint/Logging,Latest checkpointed iteration,100,latest_checkpointed_iteration.txt
Checkpoint/Logging,External actor archive,checkpoints/datasets/tooluse/qwen3gen-tooluse-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive,preserve_actor_checkpoints.py
Checkpoint/Logging,Logger,"console, wandb",ppo_trainer.yaml
RLSD_TR,Policy loss mode,rlsd,method override
RLSD_TR,Teacher regularization,trust-region,method override
RLSD_TR,Trust-region mix / teacher update rate,0.1,queue/script override
RLSD_TR,Token reweight lambda,0.5,queue/script override
RLSD_TR,Token reweight eps_w,0.2,queue/script override
RLSD_TR,Token reweight decay steps,0,queue/script override
RLSD_TR,Fused kernels,False,method override
1 section parameter value source
2 Run identity Base model Qwen/Qwen3-4B queue/script override
3 Run identity Dataset Tool-use / tooluse run_qwen3_generalization.sh
4 Run identity Method RLSD_TR run_qwen3_generalization.sh
5 Run identity Config rlsd run_qwen3_generalization.sh
6 Run identity Experiment qwen3gen-tooluse-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8 run_qwen3_generalization.sh
7 Run identity W&B run run-20260702_154716-jrdzd11b wandb
8 Data Train file datasets/tooluse/train.parquet script override
9 Data Validation file datasets/tooluse/test.parquet script override
10 Data Train batch size 32 queue/script override
11 Data Train max samples 3200 queue/script override
12 Schedule Total training steps 100 queue/script override
13 Schedule Validation before train False queue/script override
14 Schedule Save frequency 10 queue/script override
15 Schedule Validation frequency 10 queue/script override
16 Sequence Max prompt length 2048 queue/script override
17 Sequence Max response length 8192 queue/script override
18 Sequence Max model length 10240 queue/script override
19 Rollout Train rollout n 8 queue/script override
20 Rollout Validation rollout n 16 queue/script override
21 Rollout vLLM GPU memory utilization 0.8 queue/script override
22 Optimization Learning rate 1e-6 RLSD_TR method override
23 Optimization Weight decay 0.01 script override
24 PPO/GRPO PPO mini batch size 8 queue/script override
25 PPO/GRPO Normalize GRPO advantages by std False baseline_grpo.yaml / script override
26 Rollout correction Importance sampling mode token script override
27 Rollout correction IS threshold 2.0 script override
28 Checkpoint/Logging Checkpoint root checkpoints/datasets/tooluse/qwen3gen-tooluse-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8 script override
29 Checkpoint/Logging Latest checkpointed iteration 100 latest_checkpointed_iteration.txt
30 Checkpoint/Logging External actor archive checkpoints/datasets/tooluse/qwen3gen-tooluse-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive preserve_actor_checkpoints.py
31 Checkpoint/Logging Logger console, wandb ppo_trainer.yaml
32 RLSD_TR Policy loss mode rlsd method override
33 RLSD_TR Teacher regularization trust-region method override
34 RLSD_TR Trust-region mix / teacher update rate 0.1 queue/script override
35 RLSD_TR Token reweight lambda 0.5 queue/script override
36 RLSD_TR Token reweight eps_w 0.2 queue/script override
37 RLSD_TR Token reweight decay steps 0 queue/script override
38 RLSD_TR Fused kernels False method override

27
results/summary.json Normal file
View File

@@ -0,0 +1,27 @@
{
"repo_id": "SeongryongJung/Qwen3-4B-Tooluse-RLSD-TR",
"output_dir": "/mnt/mole/SDPO/L2T/hf_upload_tr/Qwen3-4B-Tooluse-RLSD-TR",
"experiment": "qwen3gen-tooluse-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8",
"best_step": 60,
"best_val_mean16": 0.6102941176470589,
"best_actor_dir": "/mnt/mole/SDPO/L2T/checkpoints/datasets/tooluse/qwen3gen-tooluse-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive/global_step_60/actor",
"final_step": 100,
"final_val_mean16": 0.59375,
"final_actor_dir": "/mnt/mole/SDPO/L2T/checkpoints/datasets/tooluse/qwen3gen-tooluse-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor",
"train_rows": 90,
"val_rows": 10,
"hf_model_files": [
"added_tokens.json",
"chat_template.jinja",
"config.json",
"generation_config.json",
"merges.txt",
"model.safetensors.index.json",
"special_tokens_map.json",
"tokenizer.json",
"tokenizer_config.json",
"vocab.json",
"model-00001-of-00002.safetensors",
"model-00002-of-00002.safetensors"
]
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:95370ee52efbdf669b5fc10e15ecc460a787c3cc495ea0344c4857fb23494324
size 143231

1653
results/training_score.svg Normal file

File diff suppressed because it is too large Load Diff

After

Width:  |  Height:  |  Size: 45 KiB

View File

@@ -0,0 +1,91 @@
step,critic_score_mean
1,0.25390625
2,0.18359375
3,0.19921875
4,0.28515625
5,0.2890625
6,0.31640625
7,0.47265625
8,0.3359375
9,0.296875
11,0.3984375
12,0.26953125
13,0.39453125
14,0.30859375
15,0.30078125
16,0.21875
17,0.40234375
18,0.38671875
19,0.44921875
21,0.3125
22,0.359375
23,0.49609375
24,0.26953125
25,0.34375
26,0.4140625
27,0.2421875
28,0.5
29,0.1796875
31,0.3828125
32,0.44140625
33,0.234375
34,0.27734375
35,0.33203125
36,0.43359375
37,0.3046875
38,0.19140625
39,0.44921875
41,0.24609375
42,0.33984375
43,0.296875
44,0.296875
45,0.421875
46,0.25
47,0.37109375
48,0.265625
49,0.3515625
51,0.30078125
52,0.25
53,0.4140625
54,0.3984375
55,0.26953125
56,0.30859375
57,0.30859375
58,0.4140625
59,0.37890625
61,0.2890625
62,0.4921875
63,0.4296875
64,0.2890625
65,0.4140625
66,0.28125
67,0.29296875
68,0.28125
69,0.29296875
71,0.484375
72,0.34375
73,0.28515625
74,0.3046875
75,0.44921875
76,0.29296875
77,0.375
78,0.25
79,0.421875
81,0.4453125
82,0.38671875
83,0.48046875
84,0.30078125
85,0.38671875
86,0.4453125
87,0.33984375
88,0.31640625
89,0.43359375
91,0.40625
92,0.3828125
93,0.3125
94,0.3671875
95,0.4140625
96,0.35546875
97,0.35546875
98,0.35546875
99,0.44140625
1 step critic_score_mean
2 1 0.25390625
3 2 0.18359375
4 3 0.19921875
5 4 0.28515625
6 5 0.2890625
7 6 0.31640625
8 7 0.47265625
9 8 0.3359375
10 9 0.296875
11 11 0.3984375
12 12 0.26953125
13 13 0.39453125
14 14 0.30859375
15 15 0.30078125
16 16 0.21875
17 17 0.40234375
18 18 0.38671875
19 19 0.44921875
20 21 0.3125
21 22 0.359375
22 23 0.49609375
23 24 0.26953125
24 25 0.34375
25 26 0.4140625
26 27 0.2421875
27 28 0.5
28 29 0.1796875
29 31 0.3828125
30 32 0.44140625
31 33 0.234375
32 34 0.27734375
33 35 0.33203125
34 36 0.43359375
35 37 0.3046875
36 38 0.19140625
37 39 0.44921875
38 41 0.24609375
39 42 0.33984375
40 43 0.296875
41 44 0.296875
42 45 0.421875
43 46 0.25
44 47 0.37109375
45 48 0.265625
46 49 0.3515625
47 51 0.30078125
48 52 0.25
49 53 0.4140625
50 54 0.3984375
51 55 0.26953125
52 56 0.30859375
53 57 0.30859375
54 58 0.4140625
55 59 0.37890625
56 61 0.2890625
57 62 0.4921875
58 63 0.4296875
59 64 0.2890625
60 65 0.4140625
61 66 0.28125
62 67 0.29296875
63 68 0.28125
64 69 0.29296875
65 71 0.484375
66 72 0.34375
67 73 0.28515625
68 74 0.3046875
69 75 0.44921875
70 76 0.29296875
71 77 0.375
72 78 0.25
73 79 0.421875
74 81 0.4453125
75 82 0.38671875
76 83 0.48046875
77 84 0.30078125
78 85 0.38671875
79 86 0.4453125
80 87 0.33984375
81 88 0.31640625
82 89 0.43359375
83 91 0.40625
84 92 0.3828125
85 93 0.3125
86 94 0.3671875
87 95 0.4140625
88 96 0.35546875
89 97 0.35546875
90 98 0.35546875
91 99 0.44140625

View File

@@ -0,0 +1,11 @@
step,val_mean16
10,0.5762867647058824
20,0.5863970588235294
30,0.5753676470588235
40,0.5707720588235294
50,0.5533088235294118
60,0.6102941176470589
70,0.5946691176470589
80,0.5928308823529411
90,0.53125
100,0.59375
1 step val_mean16
2 10 0.5762867647058824
3 20 0.5863970588235294
4 30 0.5753676470588235
5 40 0.5707720588235294
6 50 0.5533088235294118
7 60 0.6102941176470589
8 70 0.5946691176470589
9 80 0.5928308823529411
10 90 0.53125
11 100 0.59375