初始化项目,由ModelHub XC社区提供模型

Model: SeongryongJung/Qwen3-4B-Material-RLSD-TR
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-08-08 14:09:27 +08:00
commit e66636bf51
37 changed files with 326269 additions and 0 deletions

View File

@@ -0,0 +1,38 @@
section,parameter,value,source
Run identity,Base model,Qwen/Qwen3-4B,queue/script override
Run identity,Dataset,Material / SciKnowEval material,run_qwen3_generalization.sh
Run identity,Method,RLSD_TR,run_qwen3_generalization.sh
Run identity,Config,rlsd,run_qwen3_generalization.sh
Run identity,Experiment,qwen3gen-material-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8,run_qwen3_generalization.sh
Run identity,W&B run,run-20260702_135403-jd6eugui,wandb
Data,Train file,datasets/sciknoweval/material/train.parquet,script override
Data,Validation file,datasets/sciknoweval/material/test.parquet,script override
Data,Train batch size,32,queue/script override
Data,Train max samples,3200,queue/script override
Schedule,Total training steps,100,queue/script override
Schedule,Validation before train,False,queue/script override
Schedule,Save frequency,10,queue/script override
Schedule,Validation frequency,10,queue/script override
Sequence,Max prompt length,2048,queue/script override
Sequence,Max response length,8192,queue/script override
Sequence,Max model length,10240,queue/script override
Rollout,Train rollout n,8,queue/script override
Rollout,Validation rollout n,16,queue/script override
Rollout,vLLM GPU memory utilization,0.8,queue/script override
Optimization,Learning rate,1e-6,RLSD_TR method override
Optimization,Weight decay,0.01,script override
PPO/GRPO,PPO mini batch size,8,queue/script override
PPO/GRPO,Normalize GRPO advantages by std,False,baseline_grpo.yaml / script override
Rollout correction,Importance sampling mode,token,script override
Rollout correction,IS threshold,2.0,script override
Checkpoint/Logging,Checkpoint root,checkpoints/datasets/sciknoweval/material/qwen3gen-material-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8,script override
Checkpoint/Logging,Latest checkpointed iteration,100,latest_checkpointed_iteration.txt
Checkpoint/Logging,External actor archive,checkpoints/datasets/sciknoweval/material/qwen3gen-material-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive,preserve_actor_checkpoints.py
Checkpoint/Logging,Logger,"console, wandb",ppo_trainer.yaml
RLSD_TR,Policy loss mode,rlsd,method override
RLSD_TR,Teacher regularization,trust-region,method override
RLSD_TR,Trust-region mix / teacher update rate,0.1,queue/script override
RLSD_TR,Token reweight lambda,0.5,queue/script override
RLSD_TR,Token reweight eps_w,0.2,queue/script override
RLSD_TR,Token reweight decay steps,0,queue/script override
RLSD_TR,Fused kernels,False,method override
1 section parameter value source
2 Run identity Base model Qwen/Qwen3-4B queue/script override
3 Run identity Dataset Material / SciKnowEval material run_qwen3_generalization.sh
4 Run identity Method RLSD_TR run_qwen3_generalization.sh
5 Run identity Config rlsd run_qwen3_generalization.sh
6 Run identity Experiment qwen3gen-material-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8 run_qwen3_generalization.sh
7 Run identity W&B run run-20260702_135403-jd6eugui wandb
8 Data Train file datasets/sciknoweval/material/train.parquet script override
9 Data Validation file datasets/sciknoweval/material/test.parquet script override
10 Data Train batch size 32 queue/script override
11 Data Train max samples 3200 queue/script override
12 Schedule Total training steps 100 queue/script override
13 Schedule Validation before train False queue/script override
14 Schedule Save frequency 10 queue/script override
15 Schedule Validation frequency 10 queue/script override
16 Sequence Max prompt length 2048 queue/script override
17 Sequence Max response length 8192 queue/script override
18 Sequence Max model length 10240 queue/script override
19 Rollout Train rollout n 8 queue/script override
20 Rollout Validation rollout n 16 queue/script override
21 Rollout vLLM GPU memory utilization 0.8 queue/script override
22 Optimization Learning rate 1e-6 RLSD_TR method override
23 Optimization Weight decay 0.01 script override
24 PPO/GRPO PPO mini batch size 8 queue/script override
25 PPO/GRPO Normalize GRPO advantages by std False baseline_grpo.yaml / script override
26 Rollout correction Importance sampling mode token script override
27 Rollout correction IS threshold 2.0 script override
28 Checkpoint/Logging Checkpoint root checkpoints/datasets/sciknoweval/material/qwen3gen-material-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8 script override
29 Checkpoint/Logging Latest checkpointed iteration 100 latest_checkpointed_iteration.txt
30 Checkpoint/Logging External actor archive checkpoints/datasets/sciknoweval/material/qwen3gen-material-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive preserve_actor_checkpoints.py
31 Checkpoint/Logging Logger console, wandb ppo_trainer.yaml
32 RLSD_TR Policy loss mode rlsd method override
33 RLSD_TR Teacher regularization trust-region method override
34 RLSD_TR Trust-region mix / teacher update rate 0.1 queue/script override
35 RLSD_TR Token reweight lambda 0.5 queue/script override
36 RLSD_TR Token reweight eps_w 0.2 queue/script override
37 RLSD_TR Token reweight decay steps 0 queue/script override
38 RLSD_TR Fused kernels False method override

27
results/summary.json Normal file
View File

@@ -0,0 +1,27 @@
{
"repo_id": "SeongryongJung/Qwen3-4B-Material-RLSD-TR",
"output_dir": "/mnt/mole/SDPO/L2T/hf_upload_tr/Qwen3-4B-Material-RLSD-TR",
"experiment": "qwen3gen-material-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8",
"best_step": 100,
"best_val_mean16": 0.7686170212765957,
"best_actor_dir": "/mnt/mole/SDPO/L2T/checkpoints/datasets/sciknoweval/material/qwen3gen-material-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor",
"final_step": 100,
"final_val_mean16": 0.7686170212765957,
"final_actor_dir": "/mnt/mole/SDPO/L2T/checkpoints/datasets/sciknoweval/material/qwen3gen-material-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor",
"train_rows": 90,
"val_rows": 10,
"hf_model_files": [
"added_tokens.json",
"chat_template.jinja",
"config.json",
"generation_config.json",
"merges.txt",
"model.safetensors.index.json",
"special_tokens_map.json",
"tokenizer.json",
"tokenizer_config.json",
"vocab.json",
"model-00001-of-00002.safetensors",
"model-00002-of-00002.safetensors"
]
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:7903d18b1763e5c4a0dc70ce433e1486643cbf173f4eec1daa493a56601706ff
size 133928

1585
results/training_score.svg Normal file

File diff suppressed because it is too large Load Diff

After

Width:  |  Height:  |  Size: 42 KiB

View File

@@ -0,0 +1,91 @@
step,critic_score_mean
1,0.55078125
2,0.5078125
3,0.6171875
4,0.62109375
5,0.55078125
6,0.625
7,0.66796875
8,0.62109375
9,0.62109375
11,0.48046875
12,0.61328125
13,0.51953125
14,0.7890625
15,0.671875
16,0.70703125
17,0.578125
18,0.609375
19,0.65625
21,0.59375
22,0.7109375
23,0.78125
24,0.875
25,0.64453125
26,0.66796875
27,0.7890625
28,0.63671875
29,0.6640625
31,0.6328125
32,0.6875
33,0.74609375
34,0.8125
35,0.765625
36,0.66796875
37,0.8359375
38,0.5859375
39,0.75390625
41,0.5859375
42,0.69140625
43,0.546875
44,0.734375
45,0.8125
46,0.765625
47,0.6953125
48,0.8203125
49,0.6171875
51,0.671875
52,0.7421875
53,0.65234375
54,0.5703125
55,0.73828125
56,0.7890625
57,0.7578125
58,0.8359375
59,0.70703125
61,0.83984375
62,0.82421875
63,0.68359375
64,0.7890625
65,0.62890625
66,0.72265625
67,0.80078125
68,0.8203125
69,0.828125
71,0.78515625
72,0.7890625
73,0.6875
74,0.84375
75,0.66015625
76,0.69140625
77,0.5
78,0.6328125
79,0.80078125
81,0.69921875
82,0.7109375
83,0.6953125
84,0.84375
85,0.71875
86,0.81640625
87,0.62109375
88,0.6640625
89,0.73828125
91,0.75
92,0.69140625
93,0.7734375
94,0.75
95,0.71875
96,0.6484375
97,0.87890625
98,0.921875
99,0.7578125
1 step critic_score_mean
2 1 0.55078125
3 2 0.5078125
4 3 0.6171875
5 4 0.62109375
6 5 0.55078125
7 6 0.625
8 7 0.66796875
9 8 0.62109375
10 9 0.62109375
11 11 0.48046875
12 12 0.61328125
13 13 0.51953125
14 14 0.7890625
15 15 0.671875
16 16 0.70703125
17 17 0.578125
18 18 0.609375
19 19 0.65625
20 21 0.59375
21 22 0.7109375
22 23 0.78125
23 24 0.875
24 25 0.64453125
25 26 0.66796875
26 27 0.7890625
27 28 0.63671875
28 29 0.6640625
29 31 0.6328125
30 32 0.6875
31 33 0.74609375
32 34 0.8125
33 35 0.765625
34 36 0.66796875
35 37 0.8359375
36 38 0.5859375
37 39 0.75390625
38 41 0.5859375
39 42 0.69140625
40 43 0.546875
41 44 0.734375
42 45 0.8125
43 46 0.765625
44 47 0.6953125
45 48 0.8203125
46 49 0.6171875
47 51 0.671875
48 52 0.7421875
49 53 0.65234375
50 54 0.5703125
51 55 0.73828125
52 56 0.7890625
53 57 0.7578125
54 58 0.8359375
55 59 0.70703125
56 61 0.83984375
57 62 0.82421875
58 63 0.68359375
59 64 0.7890625
60 65 0.62890625
61 66 0.72265625
62 67 0.80078125
63 68 0.8203125
64 69 0.828125
65 71 0.78515625
66 72 0.7890625
67 73 0.6875
68 74 0.84375
69 75 0.66015625
70 76 0.69140625
71 77 0.5
72 78 0.6328125
73 79 0.80078125
74 81 0.69921875
75 82 0.7109375
76 83 0.6953125
77 84 0.84375
78 85 0.71875
79 86 0.81640625
80 87 0.62109375
81 88 0.6640625
82 89 0.73828125
83 91 0.75
84 92 0.69140625
85 93 0.7734375
86 94 0.75
87 95 0.71875
88 96 0.6484375
89 97 0.87890625
90 98 0.921875
91 99 0.7578125

View File

@@ -0,0 +1,11 @@
step,val_mean16
10,0.6529255319148937
20,0.7014627659574468
30,0.7253989361702128
40,0.7420212765957447
50,0.7473404255319149
60,0.7606382978723404
70,0.7666223404255319
80,0.7579787234042553
90,0.7639627659574468
100,0.7686170212765957
1 step val_mean16
2 10 0.6529255319148937
3 20 0.7014627659574468
4 30 0.7253989361702128
5 40 0.7420212765957447
6 50 0.7473404255319149
7 60 0.7606382978723404
8 70 0.7666223404255319
9 80 0.7579787234042553
10 90 0.7639627659574468
11 100 0.7686170212765957