初始化项目,由ModelHub XC社区提供模型

Model: SeongryongJung/Qwen3-8B-Material-RLSD-TR
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-08-12 14:13:18 +08:00
commit 7f2f12b8da
42 changed files with 326692 additions and 0 deletions

View File

@@ -0,0 +1,38 @@
section,parameter,value,source
Run identity,Base model,Qwen/Qwen3-8B,queue/script override
Run identity,Dataset,Material / SciKnowEval material,run_qwen3_generalization.sh
Run identity,Method,RLSD_TR,run_qwen3_generalization.sh
Run identity,Config,rlsd,run_qwen3_generalization.sh
Run identity,Experiment,qwen3gen-material-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8,run_qwen3_generalization.sh
Run identity,W&B run,run-20260703_115716-skza3cpu,wandb
Data,Train file,datasets/sciknoweval/material/train.parquet,script override
Data,Validation file,datasets/sciknoweval/material/test.parquet,script override
Data,Train batch size,32,queue/script override
Data,Train max samples,3200,queue/script override
Schedule,Total training steps,100,queue/script override
Schedule,Validation before train,False,queue/script override
Schedule,Save frequency,10,queue/script override
Schedule,Validation frequency,10,queue/script override
Sequence,Max prompt length,2048,queue/script override
Sequence,Max response length,8192,queue/script override
Sequence,Max model length,10240,queue/script override
Rollout,Train rollout n,8,queue/script override
Rollout,Validation rollout n,16,queue/script override
Rollout,vLLM GPU memory utilization,0.8,queue/script override
Optimization,Learning rate,1e-6,RLSD_TR method override
Optimization,Weight decay,0.01,script override
PPO/GRPO,PPO mini batch size,8,queue/script override
PPO/GRPO,Normalize GRPO advantages by std,False,baseline_grpo.yaml / script override
Rollout correction,Importance sampling mode,token,script override
Rollout correction,IS threshold,2.0,script override
Checkpoint/Logging,Checkpoint root,checkpoints/datasets/sciknoweval/material/qwen3gen-material-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8,script override
Checkpoint/Logging,Latest checkpointed iteration,100,latest_checkpointed_iteration.txt
Checkpoint/Logging,External actor archive,checkpoints/datasets/sciknoweval/material/qwen3gen-material-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive,preserve_actor_checkpoints.py
Checkpoint/Logging,Logger,"console, wandb",ppo_trainer.yaml
RLSD_TR,Policy loss mode,rlsd,method override
RLSD_TR,Teacher regularization,trust-region,method override
RLSD_TR,Trust-region mix / teacher update rate,0.1,queue/script override
RLSD_TR,Token reweight lambda,0.5,queue/script override
RLSD_TR,Token reweight eps_w,0.2,queue/script override
RLSD_TR,Token reweight decay steps,0,queue/script override
RLSD_TR,Fused kernels,False,method override
1 section parameter value source
2 Run identity Base model Qwen/Qwen3-8B queue/script override
3 Run identity Dataset Material / SciKnowEval material run_qwen3_generalization.sh
4 Run identity Method RLSD_TR run_qwen3_generalization.sh
5 Run identity Config rlsd run_qwen3_generalization.sh
6 Run identity Experiment qwen3gen-material-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8 run_qwen3_generalization.sh
7 Run identity W&B run run-20260703_115716-skza3cpu wandb
8 Data Train file datasets/sciknoweval/material/train.parquet script override
9 Data Validation file datasets/sciknoweval/material/test.parquet script override
10 Data Train batch size 32 queue/script override
11 Data Train max samples 3200 queue/script override
12 Schedule Total training steps 100 queue/script override
13 Schedule Validation before train False queue/script override
14 Schedule Save frequency 10 queue/script override
15 Schedule Validation frequency 10 queue/script override
16 Sequence Max prompt length 2048 queue/script override
17 Sequence Max response length 8192 queue/script override
18 Sequence Max model length 10240 queue/script override
19 Rollout Train rollout n 8 queue/script override
20 Rollout Validation rollout n 16 queue/script override
21 Rollout vLLM GPU memory utilization 0.8 queue/script override
22 Optimization Learning rate 1e-6 RLSD_TR method override
23 Optimization Weight decay 0.01 script override
24 PPO/GRPO PPO mini batch size 8 queue/script override
25 PPO/GRPO Normalize GRPO advantages by std False baseline_grpo.yaml / script override
26 Rollout correction Importance sampling mode token script override
27 Rollout correction IS threshold 2.0 script override
28 Checkpoint/Logging Checkpoint root checkpoints/datasets/sciknoweval/material/qwen3gen-material-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8 script override
29 Checkpoint/Logging Latest checkpointed iteration 100 latest_checkpointed_iteration.txt
30 Checkpoint/Logging External actor archive checkpoints/datasets/sciknoweval/material/qwen3gen-material-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive preserve_actor_checkpoints.py
31 Checkpoint/Logging Logger console, wandb ppo_trainer.yaml
32 RLSD_TR Policy loss mode rlsd method override
33 RLSD_TR Teacher regularization trust-region method override
34 RLSD_TR Trust-region mix / teacher update rate 0.1 queue/script override
35 RLSD_TR Token reweight lambda 0.5 queue/script override
36 RLSD_TR Token reweight eps_w 0.2 queue/script override
37 RLSD_TR Token reweight decay steps 0 queue/script override
38 RLSD_TR Fused kernels False method override

29
results/summary.json Normal file
View File

@@ -0,0 +1,29 @@
{
"repo_id": "SeongryongJung/Qwen3-8B-Material-RLSD-TR",
"output_dir": "/mnt/mole/SDPO/L2T/hf_upload_tr/Qwen3-8B-Material-RLSD-TR",
"experiment": "qwen3gen-material-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8",
"best_step": 100,
"best_val_mean16": 0.7646276595744681,
"best_actor_dir": "/mnt/mole/SDPO/L2T/checkpoints/datasets/sciknoweval/material/qwen3gen-material-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor",
"final_step": 100,
"final_val_mean16": 0.7646276595744681,
"final_actor_dir": "/mnt/mole/SDPO/L2T/checkpoints/datasets/sciknoweval/material/qwen3gen-material-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor",
"train_rows": 90,
"val_rows": 10,
"hf_model_files": [
"added_tokens.json",
"chat_template.jinja",
"config.json",
"generation_config.json",
"merges.txt",
"model.safetensors.index.json",
"special_tokens_map.json",
"tokenizer.json",
"tokenizer_config.json",
"vocab.json",
"model-00001-of-00004.safetensors",
"model-00002-of-00004.safetensors",
"model-00003-of-00004.safetensors",
"model-00004-of-00004.safetensors"
]
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:8b033785d929211e5f4e519e7c4a4bd294a8424ceceb6a979c4471637e0e5c16
size 128191

1604
results/training_score.svg Normal file

File diff suppressed because it is too large Load Diff

After

Width:  |  Height:  |  Size: 43 KiB

View File

@@ -0,0 +1,91 @@
step,critic_score_mean
1,0.53125
2,0.38671875
3,0.49609375
4,0.51953125
5,0.55078125
6,0.46484375
7,0.5703125
8,0.54296875
9,0.57421875
11,0.5390625
12,0.62890625
13,0.5546875
14,0.71875
15,0.61328125
16,0.66015625
17,0.55078125
18,0.62890625
19,0.60546875
21,0.54296875
22,0.69140625
23,0.73828125
24,0.8515625
25,0.625
26,0.66796875
27,0.81640625
28,0.5859375
29,0.6171875
31,0.65234375
32,0.65625
33,0.7109375
34,0.80859375
35,0.81640625
36,0.61328125
37,0.8515625
38,0.60546875
39,0.7578125
41,0.59765625
42,0.59375
43,0.515625
44,0.72265625
45,0.7734375
46,0.703125
47,0.6640625
48,0.84375
49,0.66796875
51,0.66796875
52,0.78515625
53,0.64453125
54,0.57421875
55,0.7421875
56,0.765625
57,0.765625
58,0.8046875
59,0.7265625
61,0.80859375
62,0.8515625
63,0.6953125
64,0.80078125
65,0.6171875
66,0.69921875
67,0.80078125
68,0.78125
69,0.796875
71,0.7421875
72,0.765625
73,0.6796875
74,0.8359375
75,0.70703125
76,0.703125
77,0.55078125
78,0.6640625
79,0.8046875
81,0.71875
82,0.734375
83,0.68359375
84,0.8203125
85,0.69140625
86,0.83984375
87,0.609375
88,0.671875
89,0.71484375
91,0.84765625
92,0.71875
93,0.8046875
94,0.69921875
95,0.7109375
96,0.58984375
97,0.84375
98,0.89453125
99,0.765625
1 step critic_score_mean
2 1 0.53125
3 2 0.38671875
4 3 0.49609375
5 4 0.51953125
6 5 0.55078125
7 6 0.46484375
8 7 0.5703125
9 8 0.54296875
10 9 0.57421875
11 11 0.5390625
12 12 0.62890625
13 13 0.5546875
14 14 0.71875
15 15 0.61328125
16 16 0.66015625
17 17 0.55078125
18 18 0.62890625
19 19 0.60546875
20 21 0.54296875
21 22 0.69140625
22 23 0.73828125
23 24 0.8515625
24 25 0.625
25 26 0.66796875
26 27 0.81640625
27 28 0.5859375
28 29 0.6171875
29 31 0.65234375
30 32 0.65625
31 33 0.7109375
32 34 0.80859375
33 35 0.81640625
34 36 0.61328125
35 37 0.8515625
36 38 0.60546875
37 39 0.7578125
38 41 0.59765625
39 42 0.59375
40 43 0.515625
41 44 0.72265625
42 45 0.7734375
43 46 0.703125
44 47 0.6640625
45 48 0.84375
46 49 0.66796875
47 51 0.66796875
48 52 0.78515625
49 53 0.64453125
50 54 0.57421875
51 55 0.7421875
52 56 0.765625
53 57 0.765625
54 58 0.8046875
55 59 0.7265625
56 61 0.80859375
57 62 0.8515625
58 63 0.6953125
59 64 0.80078125
60 65 0.6171875
61 66 0.69921875
62 67 0.80078125
63 68 0.78125
64 69 0.796875
65 71 0.7421875
66 72 0.765625
67 73 0.6796875
68 74 0.8359375
69 75 0.70703125
70 76 0.703125
71 77 0.55078125
72 78 0.6640625
73 79 0.8046875
74 81 0.71875
75 82 0.734375
76 83 0.68359375
77 84 0.8203125
78 85 0.69140625
79 86 0.83984375
80 87 0.609375
81 88 0.671875
82 89 0.71484375
83 91 0.84765625
84 92 0.71875
85 93 0.8046875
86 94 0.69921875
87 95 0.7109375
88 96 0.58984375
89 97 0.84375
90 98 0.89453125
91 99 0.765625

View File

@@ -0,0 +1,11 @@
step,val_mean16
10,0.6555851063829787
20,0.6888297872340425
30,0.6974734042553191
40,0.7340425531914894
50,0.7466755319148937
60,0.7513297872340425
70,0.7519946808510638
80,0.7446808510638298
90,0.7539893617021277
100,0.7646276595744681
1 step val_mean16
2 10 0.6555851063829787
3 20 0.6888297872340425
4 30 0.6974734042553191
5 40 0.7340425531914894
6 50 0.7466755319148937
7 60 0.7513297872340425
8 70 0.7519946808510638
9 80 0.7446808510638298
10 90 0.7539893617021277
11 100 0.7646276595744681