初始化项目,由ModelHub XC社区提供模型

Model: SeongryongJung/Qwen3-8B-Chemistry-RLSD-TR
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-07-21 17:57:12 +08:00
commit d3719d800b
40 changed files with 313660 additions and 0 deletions

View File

@@ -0,0 +1,38 @@
section,parameter,value,source
Run identity,Base model,Qwen/Qwen3-8B,queue/script override
Run identity,Dataset,Chemistry / SciKnowEval chemistry,run_qwen3_generalization.sh
Run identity,Method,RLSD_TR,run_qwen3_generalization.sh
Run identity,Config,rlsd,run_qwen3_generalization.sh
Run identity,Experiment,qwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8,run_qwen3_generalization.sh
Run identity,W&B run,run-20260703_014331-zs3h1j56,wandb
Data,Train file,datasets/sciknoweval/chemistry/train.parquet,script override
Data,Validation file,datasets/sciknoweval/chemistry/test.parquet,script override
Data,Train batch size,32,queue/script override
Data,Train max samples,3200,queue/script override
Schedule,Total training steps,100,queue/script override
Schedule,Validation before train,False,queue/script override
Schedule,Save frequency,10,queue/script override
Schedule,Validation frequency,10,queue/script override
Sequence,Max prompt length,2048,queue/script override
Sequence,Max response length,8192,queue/script override
Sequence,Max model length,10240,queue/script override
Rollout,Train rollout n,8,queue/script override
Rollout,Validation rollout n,16,queue/script override
Rollout,vLLM GPU memory utilization,0.8,queue/script override
Optimization,Learning rate,1e-6,RLSD_TR method override
Optimization,Weight decay,0.01,script override
PPO/GRPO,PPO mini batch size,8,queue/script override
PPO/GRPO,Normalize GRPO advantages by std,False,baseline_grpo.yaml / script override
Rollout correction,Importance sampling mode,token,script override
Rollout correction,IS threshold,2.0,script override
Checkpoint/Logging,Checkpoint root,checkpoints/datasets/sciknoweval/chemistry/qwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8,script override
Checkpoint/Logging,Latest checkpointed iteration,100,latest_checkpointed_iteration.txt
Checkpoint/Logging,External actor archive,checkpoints/datasets/sciknoweval/chemistry/qwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive,preserve_actor_checkpoints.py
Checkpoint/Logging,Logger,"console, wandb",ppo_trainer.yaml
RLSD_TR,Policy loss mode,rlsd,method override
RLSD_TR,Teacher regularization,trust-region,method override
RLSD_TR,Trust-region mix / teacher update rate,0.1,queue/script override
RLSD_TR,Token reweight lambda,0.5,queue/script override
RLSD_TR,Token reweight eps_w,0.2,queue/script override
RLSD_TR,Token reweight decay steps,0,queue/script override
RLSD_TR,Fused kernels,False,method override
1 section parameter value source
2 Run identity Base model Qwen/Qwen3-8B queue/script override
3 Run identity Dataset Chemistry / SciKnowEval chemistry run_qwen3_generalization.sh
4 Run identity Method RLSD_TR run_qwen3_generalization.sh
5 Run identity Config rlsd run_qwen3_generalization.sh
6 Run identity Experiment qwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8 run_qwen3_generalization.sh
7 Run identity W&B run run-20260703_014331-zs3h1j56 wandb
8 Data Train file datasets/sciknoweval/chemistry/train.parquet script override
9 Data Validation file datasets/sciknoweval/chemistry/test.parquet script override
10 Data Train batch size 32 queue/script override
11 Data Train max samples 3200 queue/script override
12 Schedule Total training steps 100 queue/script override
13 Schedule Validation before train False queue/script override
14 Schedule Save frequency 10 queue/script override
15 Schedule Validation frequency 10 queue/script override
16 Sequence Max prompt length 2048 queue/script override
17 Sequence Max response length 8192 queue/script override
18 Sequence Max model length 10240 queue/script override
19 Rollout Train rollout n 8 queue/script override
20 Rollout Validation rollout n 16 queue/script override
21 Rollout vLLM GPU memory utilization 0.8 queue/script override
22 Optimization Learning rate 1e-6 RLSD_TR method override
23 Optimization Weight decay 0.01 script override
24 PPO/GRPO PPO mini batch size 8 queue/script override
25 PPO/GRPO Normalize GRPO advantages by std False baseline_grpo.yaml / script override
26 Rollout correction Importance sampling mode token script override
27 Rollout correction IS threshold 2.0 script override
28 Checkpoint/Logging Checkpoint root checkpoints/datasets/sciknoweval/chemistry/qwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8 script override
29 Checkpoint/Logging Latest checkpointed iteration 100 latest_checkpointed_iteration.txt
30 Checkpoint/Logging External actor archive checkpoints/datasets/sciknoweval/chemistry/qwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive preserve_actor_checkpoints.py
31 Checkpoint/Logging Logger console, wandb ppo_trainer.yaml
32 RLSD_TR Policy loss mode rlsd method override
33 RLSD_TR Teacher regularization trust-region method override
34 RLSD_TR Trust-region mix / teacher update rate 0.1 queue/script override
35 RLSD_TR Token reweight lambda 0.5 queue/script override
36 RLSD_TR Token reweight eps_w 0.2 queue/script override
37 RLSD_TR Token reweight decay steps 0 queue/script override
38 RLSD_TR Fused kernels False method override

29
results/summary.json Normal file
View File

@@ -0,0 +1,29 @@
{
"repo_id": "SeongryongJung/Qwen3-8B-Chemistry-RLSD-TR",
"output_dir": "/mnt/mole/SDPO/L2T/hf_upload_tr/Qwen3-8B-Chemistry-RLSD-TR",
"experiment": "qwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8",
"best_step": 80,
"best_val_mean16": 0.7098214285714286,
"best_actor_dir": "/mnt/mole/SDPO/L2T/checkpoints/datasets/sciknoweval/chemistry/qwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/global_step_80/actor",
"final_step": 100,
"final_val_mean16": 0.7065476190476191,
"final_actor_dir": "/mnt/mole/SDPO/L2T/checkpoints/datasets/sciknoweval/chemistry/qwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor",
"train_rows": 90,
"val_rows": 10,
"hf_model_files": [
"added_tokens.json",
"chat_template.jinja",
"config.json",
"generation_config.json",
"merges.txt",
"model.safetensors.index.json",
"special_tokens_map.json",
"tokenizer.json",
"tokenizer_config.json",
"vocab.json",
"model-00001-of-00004.safetensors",
"model-00002-of-00004.safetensors",
"model-00003-of-00004.safetensors",
"model-00004-of-00004.safetensors"
]
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:99a2c52c9b441b1a71a06bbe04b74edcf2dc01c705cf0659e99e2fccc79e8062
size 129165

1681
results/training_score.svg Normal file

File diff suppressed because it is too large Load Diff

After

Width:  |  Height:  |  Size: 46 KiB

View File

@@ -0,0 +1,91 @@
step,critic_score_mean
1,0.46484375
2,0.3671875
3,0.4140625
4,0.4453125
5,0.42578125
6,0.421875
7,0.33203125
8,0.46875
9,0.359375
11,0.48046875
12,0.46484375
13,0.375
14,0.40625
15,0.46875
16,0.47265625
17,0.41015625
18,0.49609375
19,0.5
21,0.43359375
22,0.4375
23,0.69921875
24,0.58984375
25,0.5546875
26,0.6328125
27,0.51171875
28,0.59765625
29,0.48046875
31,0.6015625
32,0.55078125
33,0.60546875
34,0.59765625
35,0.5078125
36,0.5625
37,0.54296875
38,0.6484375
39,0.6015625
41,0.62890625
42,0.6171875
43,0.61328125
44,0.66796875
45,0.5390625
46,0.5546875
47,0.64453125
48,0.671875
49,0.640625
51,0.5546875
52,0.61328125
53,0.62109375
54,0.5546875
55,0.640625
56,0.6484375
57,0.66796875
58,0.703125
59,0.5390625
61,0.66015625
62,0.62890625
63,0.53125
64,0.765625
65,0.71484375
66,0.6171875
67,0.6796875
68,0.46875
69,0.6796875
71,0.58984375
72,0.671875
73,0.640625
74,0.703125
75,0.71484375
76,0.6171875
77,0.7421875
78,0.68359375
79,0.609375
81,0.63671875
82,0.6015625
83,0.49609375
84,0.6875
85,0.71484375
86,0.609375
87,0.62109375
88,0.58984375
89,0.59765625
91,0.640625
92,0.609375
93,0.83203125
94,0.76171875
95,0.68359375
96,0.67578125
97,0.5625
98,0.609375
99,0.578125
1 step critic_score_mean
2 1 0.46484375
3 2 0.3671875
4 3 0.4140625
5 4 0.4453125
6 5 0.42578125
7 6 0.421875
8 7 0.33203125
9 8 0.46875
10 9 0.359375
11 11 0.48046875
12 12 0.46484375
13 13 0.375
14 14 0.40625
15 15 0.46875
16 16 0.47265625
17 17 0.41015625
18 18 0.49609375
19 19 0.5
20 21 0.43359375
21 22 0.4375
22 23 0.69921875
23 24 0.58984375
24 25 0.5546875
25 26 0.6328125
26 27 0.51171875
27 28 0.59765625
28 29 0.48046875
29 31 0.6015625
30 32 0.55078125
31 33 0.60546875
32 34 0.59765625
33 35 0.5078125
34 36 0.5625
35 37 0.54296875
36 38 0.6484375
37 39 0.6015625
38 41 0.62890625
39 42 0.6171875
40 43 0.61328125
41 44 0.66796875
42 45 0.5390625
43 46 0.5546875
44 47 0.64453125
45 48 0.671875
46 49 0.640625
47 51 0.5546875
48 52 0.61328125
49 53 0.62109375
50 54 0.5546875
51 55 0.640625
52 56 0.6484375
53 57 0.66796875
54 58 0.703125
55 59 0.5390625
56 61 0.66015625
57 62 0.62890625
58 63 0.53125
59 64 0.765625
60 65 0.71484375
61 66 0.6171875
62 67 0.6796875
63 68 0.46875
64 69 0.6796875
65 71 0.58984375
66 72 0.671875
67 73 0.640625
68 74 0.703125
69 75 0.71484375
70 76 0.6171875
71 77 0.7421875
72 78 0.68359375
73 79 0.609375
74 81 0.63671875
75 82 0.6015625
76 83 0.49609375
77 84 0.6875
78 85 0.71484375
79 86 0.609375
80 87 0.62109375
81 88 0.58984375
82 89 0.59765625
83 91 0.640625
84 92 0.609375
85 93 0.83203125
86 94 0.76171875
87 95 0.68359375
88 96 0.67578125
89 97 0.5625
90 98 0.609375
91 99 0.578125

View File

@@ -0,0 +1,11 @@
step,val_mean16
10,0.4217261904761905
20,0.5196428571428572
30,0.606845238095238
40,0.6455357142857143
50,0.66875
60,0.6875
70,0.6967261904761904
80,0.7098214285714286
90,0.7092261904761905
100,0.7065476190476191
1 step val_mean16
2 10 0.4217261904761905
3 20 0.5196428571428572
4 30 0.606845238095238
5 40 0.6455357142857143
6 50 0.66875
7 60 0.6875
8 70 0.6967261904761904
9 80 0.7098214285714286
10 90 0.7092261904761905
11 100 0.7065476190476191