初始化项目,由ModelHub XC社区提供模型

Model: SeongryongJung/Qwen3-8B-Biology-RLSD-TR
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-08-18 21:36:57 +08:00
commit 68be06f5db
42 changed files with 322205 additions and 0 deletions

View File

@@ -0,0 +1,38 @@
section,parameter,value,source
Run identity,Base model,Qwen/Qwen3-8B,queue/script override
Run identity,Dataset,Biology / SciKnowEval biology,run_qwen3_generalization.sh
Run identity,Method,RLSD_TR,run_qwen3_generalization.sh
Run identity,Config,rlsd,run_qwen3_generalization.sh
Run identity,Experiment,qwen3gen-biology-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8,run_qwen3_generalization.sh
Run identity,W&B run,run-20260703_091731-gj54iy5b,wandb
Data,Train file,datasets/sciknoweval/biology/train.parquet,script override
Data,Validation file,datasets/sciknoweval/biology/test.parquet,script override
Data,Train batch size,32,queue/script override
Data,Train max samples,3200,queue/script override
Schedule,Total training steps,100,queue/script override
Schedule,Validation before train,False,queue/script override
Schedule,Save frequency,10,queue/script override
Schedule,Validation frequency,10,queue/script override
Sequence,Max prompt length,2048,queue/script override
Sequence,Max response length,8192,queue/script override
Sequence,Max model length,10240,queue/script override
Rollout,Train rollout n,8,queue/script override
Rollout,Validation rollout n,16,queue/script override
Rollout,vLLM GPU memory utilization,0.8,queue/script override
Optimization,Learning rate,1e-6,RLSD_TR method override
Optimization,Weight decay,0.01,script override
PPO/GRPO,PPO mini batch size,8,queue/script override
PPO/GRPO,Normalize GRPO advantages by std,False,baseline_grpo.yaml / script override
Rollout correction,Importance sampling mode,token,script override
Rollout correction,IS threshold,2.0,script override
Checkpoint/Logging,Checkpoint root,checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8,script override
Checkpoint/Logging,Latest checkpointed iteration,100,latest_checkpointed_iteration.txt
Checkpoint/Logging,External actor archive,checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive,preserve_actor_checkpoints.py
Checkpoint/Logging,Logger,"console, wandb",ppo_trainer.yaml
RLSD_TR,Policy loss mode,rlsd,method override
RLSD_TR,Teacher regularization,trust-region,method override
RLSD_TR,Trust-region mix / teacher update rate,0.1,queue/script override
RLSD_TR,Token reweight lambda,0.5,queue/script override
RLSD_TR,Token reweight eps_w,0.2,queue/script override
RLSD_TR,Token reweight decay steps,0,queue/script override
RLSD_TR,Fused kernels,False,method override
1 section parameter value source
2 Run identity Base model Qwen/Qwen3-8B queue/script override
3 Run identity Dataset Biology / SciKnowEval biology run_qwen3_generalization.sh
4 Run identity Method RLSD_TR run_qwen3_generalization.sh
5 Run identity Config rlsd run_qwen3_generalization.sh
6 Run identity Experiment qwen3gen-biology-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8 run_qwen3_generalization.sh
7 Run identity W&B run run-20260703_091731-gj54iy5b wandb
8 Data Train file datasets/sciknoweval/biology/train.parquet script override
9 Data Validation file datasets/sciknoweval/biology/test.parquet script override
10 Data Train batch size 32 queue/script override
11 Data Train max samples 3200 queue/script override
12 Schedule Total training steps 100 queue/script override
13 Schedule Validation before train False queue/script override
14 Schedule Save frequency 10 queue/script override
15 Schedule Validation frequency 10 queue/script override
16 Sequence Max prompt length 2048 queue/script override
17 Sequence Max response length 8192 queue/script override
18 Sequence Max model length 10240 queue/script override
19 Rollout Train rollout n 8 queue/script override
20 Rollout Validation rollout n 16 queue/script override
21 Rollout vLLM GPU memory utilization 0.8 queue/script override
22 Optimization Learning rate 1e-6 RLSD_TR method override
23 Optimization Weight decay 0.01 script override
24 PPO/GRPO PPO mini batch size 8 queue/script override
25 PPO/GRPO Normalize GRPO advantages by std False baseline_grpo.yaml / script override
26 Rollout correction Importance sampling mode token script override
27 Rollout correction IS threshold 2.0 script override
28 Checkpoint/Logging Checkpoint root checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8 script override
29 Checkpoint/Logging Latest checkpointed iteration 100 latest_checkpointed_iteration.txt
30 Checkpoint/Logging External actor archive checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive preserve_actor_checkpoints.py
31 Checkpoint/Logging Logger console, wandb ppo_trainer.yaml
32 RLSD_TR Policy loss mode rlsd method override
33 RLSD_TR Teacher regularization trust-region method override
34 RLSD_TR Trust-region mix / teacher update rate 0.1 queue/script override
35 RLSD_TR Token reweight lambda 0.5 queue/script override
36 RLSD_TR Token reweight eps_w 0.2 queue/script override
37 RLSD_TR Token reweight decay steps 0 queue/script override
38 RLSD_TR Fused kernels False method override

29
results/summary.json Normal file
View File

@@ -0,0 +1,29 @@
{
"repo_id": "SeongryongJung/Qwen3-8B-Biology-RLSD-TR",
"output_dir": "/mnt/mole/SDPO/L2T/hf_upload_tr/Qwen3-8B-Biology-RLSD-TR",
"experiment": "qwen3gen-biology-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8",
"best_step": 100,
"best_val_mean16": 0.55,
"best_actor_dir": "/mnt/mole/SDPO/L2T/checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor",
"final_step": 100,
"final_val_mean16": 0.55,
"final_actor_dir": "/mnt/mole/SDPO/L2T/checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor",
"train_rows": 90,
"val_rows": 10,
"hf_model_files": [
"added_tokens.json",
"chat_template.jinja",
"config.json",
"generation_config.json",
"merges.txt",
"model.safetensors.index.json",
"special_tokens_map.json",
"tokenizer.json",
"tokenizer_config.json",
"vocab.json",
"model-00001-of-00004.safetensors",
"model-00002-of-00004.safetensors",
"model-00003-of-00004.safetensors",
"model-00004-of-00004.safetensors"
]
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:caf9b314980f68e1c8e8613236817b2043fb8e62c1d53af3c3c7beca9c372fc1
size 126914

1524
results/training_score.svg Normal file

File diff suppressed because it is too large Load Diff

After

Width:  |  Height:  |  Size: 41 KiB

View File

@@ -0,0 +1,91 @@
step,critic_score_mean
1,0.33984375
2,0.3828125
3,0.44921875
4,0.37890625
5,0.44921875
6,0.34375
7,0.2890625
8,0.2421875
9,0.34765625
11,0.42578125
12,0.421875
13,0.3203125
14,0.29296875
15,0.3671875
16,0.40234375
17,0.30078125
18,0.4296875
19,0.3828125
21,0.4140625
22,0.4296875
23,0.33984375
24,0.453125
25,0.4296875
26,0.38671875
27,0.359375
28,0.375
29,0.4375
31,0.31640625
32,0.5
33,0.41015625
34,0.390625
35,0.4765625
36,0.390625
37,0.4140625
38,0.44140625
39,0.4765625
41,0.45703125
42,0.3515625
43,0.56640625
44,0.4921875
45,0.40234375
46,0.4140625
47,0.40625
48,0.48046875
49,0.43359375
51,0.4375
52,0.53515625
53,0.48828125
54,0.5
55,0.609375
56,0.53515625
57,0.53515625
58,0.4921875
59,0.4921875
61,0.46875
62,0.5078125
63,0.5546875
64,0.65625
65,0.57421875
66,0.45703125
67,0.515625
68,0.5859375
69,0.49609375
71,0.50390625
72,0.5546875
73,0.59765625
74,0.45703125
75,0.55859375
76,0.4765625
77,0.6640625
78,0.640625
79,0.47265625
81,0.59375
82,0.58203125
83,0.5390625
84,0.50390625
85,0.5
86,0.56640625
87,0.578125
88,0.44140625
89,0.6328125
91,0.4921875
92,0.6328125
93,0.6015625
94,0.609375
95,0.6640625
96,0.6484375
97,0.65625
98,0.4609375
99,0.54296875
1 step critic_score_mean
2 1 0.33984375
3 2 0.3828125
4 3 0.44921875
5 4 0.37890625
6 5 0.44921875
7 6 0.34375
8 7 0.2890625
9 8 0.2421875
10 9 0.34765625
11 11 0.42578125
12 12 0.421875
13 13 0.3203125
14 14 0.29296875
15 15 0.3671875
16 16 0.40234375
17 17 0.30078125
18 18 0.4296875
19 19 0.3828125
20 21 0.4140625
21 22 0.4296875
22 23 0.33984375
23 24 0.453125
24 25 0.4296875
25 26 0.38671875
26 27 0.359375
27 28 0.375
28 29 0.4375
29 31 0.31640625
30 32 0.5
31 33 0.41015625
32 34 0.390625
33 35 0.4765625
34 36 0.390625
35 37 0.4140625
36 38 0.44140625
37 39 0.4765625
38 41 0.45703125
39 42 0.3515625
40 43 0.56640625
41 44 0.4921875
42 45 0.40234375
43 46 0.4140625
44 47 0.40625
45 48 0.48046875
46 49 0.43359375
47 51 0.4375
48 52 0.53515625
49 53 0.48828125
50 54 0.5
51 55 0.609375
52 56 0.53515625
53 57 0.53515625
54 58 0.4921875
55 59 0.4921875
56 61 0.46875
57 62 0.5078125
58 63 0.5546875
59 64 0.65625
60 65 0.57421875
61 66 0.45703125
62 67 0.515625
63 68 0.5859375
64 69 0.49609375
65 71 0.50390625
66 72 0.5546875
67 73 0.59765625
68 74 0.45703125
69 75 0.55859375
70 76 0.4765625
71 77 0.6640625
72 78 0.640625
73 79 0.47265625
74 81 0.59375
75 82 0.58203125
76 83 0.5390625
77 84 0.50390625
78 85 0.5
79 86 0.56640625
80 87 0.578125
81 88 0.44140625
82 89 0.6328125
83 91 0.4921875
84 92 0.6328125
85 93 0.6015625
86 94 0.609375
87 95 0.6640625
88 96 0.6484375
89 97 0.65625
90 98 0.4609375
91 99 0.54296875

View File

@@ -0,0 +1,11 @@
step,val_mean16
10,0.3025
20,0.3675
30,0.36375
40,0.4125
50,0.44625
60,0.45875
70,0.47
80,0.50875
90,0.50625
100,0.55
1 step val_mean16
2 10 0.3025
3 20 0.3675
4 30 0.36375
5 40 0.4125
6 50 0.44625
7 60 0.45875
8 70 0.47
9 80 0.50875
10 90 0.50625
11 100 0.55