初始化项目,由ModelHub XC社区提供模型

Model: SeongryongJung/Qwen3-4B-Biology-RLSD-TR
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-08-22 02:15:18 +08:00
commit 56d8aee6a6
38 changed files with 318214 additions and 0 deletions

8
results/export_note.csv Normal file
View File

@@ -0,0 +1,8 @@
key,value
root_checkpoint_step,90
root_checkpoint_kind,best_validation
root_actor_dir,checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive/global_step_90/actor
last_checkpoint_step,100
last_actor_dir,checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor
best_validation_mean16,0.485000000000
final_validation_mean16,0.428750000000
1 key value
2 root_checkpoint_step 90
3 root_checkpoint_kind best_validation
4 root_actor_dir checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive/global_step_90/actor
5 last_checkpoint_step 100
6 last_actor_dir checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor
7 best_validation_mean16 0.485000000000
8 final_validation_mean16 0.428750000000

View File

@@ -0,0 +1,85 @@
section,parameter,value,source
Run identity,Base model,Qwen/Qwen3-4B,queue/script override
Run identity,Dataset,Biology / SciKnowEval biology,run_qwen3_generalization.sh
Run identity,Method,RLSD_TR,run_qwen3_generalization.sh
Run identity,Config,rlsd,run_qwen3_generalization.sh
Run identity,Experiment,qwen3gen-biology-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8,run_qwen3_generalization.sh
Run identity,W&B run,run-20260702_113907-xauqhwk1,wandb
Data,Train file,datasets/sciknoweval/biology/train.parquet,script override
Data,Validation file,datasets/sciknoweval/biology/test.parquet,script override
Data,Train batch size,32,queue/script override
Data,Train max samples,3200,queue/script override
Data,Prompt key,prompt,legacy_data.yaml default
Data,Reward key,data_source,legacy_data.yaml default
Data,Shuffle train data,True,user.yaml / legacy_data.yaml
Data,Validation shuffle,False,legacy_data.yaml default
Data,Filter overlong prompts,True,user.yaml
Data,Prompt truncation,error,legacy_data.yaml default
Data,enable_thinking,false,script override
Schedule,Total training steps,100,queue/script override
Schedule,Total epochs,30,ppo_trainer/user.yaml default
Schedule,Validation before train,False,queue/script override
Schedule,Save frequency,10,queue/script override
Schedule,Validation frequency,10,queue/script override
Sequence,Max prompt length,2048,queue/script override
Sequence,Max response length,8192,queue/script override
Sequence,Max model length,10240,queue/script override
Sequence,Actor max token length per GPU,10240,queue/script override
Rollout,Rollout engine,vllm,user.yaml
Rollout,Rollout dtype,bfloat16,rollout.yaml default
Rollout,Train rollout n,8,queue/script override
Rollout,Train rollout temperature,1.0,script override
Rollout,Train rollout top_p,1.0,script override
Rollout,Train rollout do_sample,True,rollout.yaml default
Rollout,Calculate rollout log probs,True,rlsd.yaml / script override
Rollout,Max num batched tokens,10240,queue/script override
Rollout,vLLM GPU memory utilization,0.8,queue/script override
Rollout,Tensor model parallel size,2,rollout.yaml default
Rollout,Free cache engine,True,rollout.yaml default
Validation,Validation rollout n,16,queue/script override
Validation,Validation temperature,0.6,queue/script override
Validation,Validation top_p,0.95,queue/script override
Validation,Validation do_sample,True,queue/script override
Optimization,Optimizer,AdamW,fsdp optimizer config
Optimization,Learning rate,1e-6,RLSD_TR method override
Optimization,LR scheduler,constant,W&B config
Optimization,LR warmup steps,10,script override
Optimization,Weight decay,0.01,script override
Optimization,Betas,"(0.9, 0.999)",W&B config
Optimization,Gradient clip,1.0,script override
PPO/GRPO,Advantage estimator,grpo,rlsd.yaml
PPO/GRPO,Normalize GRPO advantages by std,False,script override
PPO/GRPO,PPO epochs,1,W&B config
PPO/GRPO,PPO mini batch size,8,queue/script override
PPO/GRPO,PPO micro batch size per GPU,1,user.yaml
PPO/GRPO,Clip ratio low,0.2,script override
PPO/GRPO,Clip ratio high,0.28,script override
PPO/GRPO,Gamma,1.0,ppo_trainer.yaml default
PPO/GRPO,Lambda,1.0,ppo_trainer.yaml default
PPO/GRPO,Use KL in reward,False,ppo_trainer/user.yaml
PPO/GRPO,Actor KL loss observed,0.0,output.log
Rollout correction,Importance sampling mode,token,script override
Rollout correction,IS threshold,2.0,script override
RLSD_TR,Policy loss mode,rlsd,method override
RLSD_TR,Teacher regularization,trust-region,method override
RLSD_TR,Trust-region mix / teacher update rate,0.1,queue/script override
RLSD_TR,Token reweight lambda,0.5,queue/script override
RLSD_TR,Token reweight eps_w,0.2,queue/script override
RLSD_TR,Token reweight decay steps,0,queue/script override
RLSD_TR,Max reprompt length,10240,method override
RLSD_TR,Fused kernels,False,method override
FSDP/System,Actor strategy,fsdp,dp_actor.yaml
FSDP/System,FSDP dtype,bfloat16,W&B config
FSDP/System,FSDP model dtype,fp32,W&B config
FSDP/System,Use torch compile,True,W&B config
FSDP/System,GPUs per node,8,queue/script override
FSDP/System,Nodes,1,user.yaml
FSDP/System,GPU type,NVIDIA H200,wandb-metadata
Checkpoint/Logging,Checkpoint root,checkpoints/datasets/sciknoweval/biology,script override
Checkpoint/Logging,Latest checkpointed iteration,100,latest_checkpointed_iteration.txt
Checkpoint/Logging,Max actor checkpoints to keep,1 + external _actor_archive preservation,user.yaml
Checkpoint/Logging,Logger,"console, wandb",ppo_trainer.yaml
Checkpoint/Logging,W&B entity,seongryongjung-chung-ang-university,environment
Checkpoint/Logging,W&B project,SDPO-root,user.yaml project_name
Checkpoint/Logging,W&B group,QWEN3-RLSD-TR-GRPO-matched-generalization,method override
Checkpoint/Logging,External actor archive,checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive,preserve_actor_checkpoints.py
1 section parameter value source
2 Run identity Base model Qwen/Qwen3-4B queue/script override
3 Run identity Dataset Biology / SciKnowEval biology run_qwen3_generalization.sh
4 Run identity Method RLSD_TR run_qwen3_generalization.sh
5 Run identity Config rlsd run_qwen3_generalization.sh
6 Run identity Experiment qwen3gen-biology-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8 run_qwen3_generalization.sh
7 Run identity W&B run run-20260702_113907-xauqhwk1 wandb
8 Data Train file datasets/sciknoweval/biology/train.parquet script override
9 Data Validation file datasets/sciknoweval/biology/test.parquet script override
10 Data Train batch size 32 queue/script override
11 Data Train max samples 3200 queue/script override
12 Data Prompt key prompt legacy_data.yaml default
13 Data Reward key data_source legacy_data.yaml default
14 Data Shuffle train data True user.yaml / legacy_data.yaml
15 Data Validation shuffle False legacy_data.yaml default
16 Data Filter overlong prompts True user.yaml
17 Data Prompt truncation error legacy_data.yaml default
18 Data enable_thinking false script override
19 Schedule Total training steps 100 queue/script override
20 Schedule Total epochs 30 ppo_trainer/user.yaml default
21 Schedule Validation before train False queue/script override
22 Schedule Save frequency 10 queue/script override
23 Schedule Validation frequency 10 queue/script override
24 Sequence Max prompt length 2048 queue/script override
25 Sequence Max response length 8192 queue/script override
26 Sequence Max model length 10240 queue/script override
27 Sequence Actor max token length per GPU 10240 queue/script override
28 Rollout Rollout engine vllm user.yaml
29 Rollout Rollout dtype bfloat16 rollout.yaml default
30 Rollout Train rollout n 8 queue/script override
31 Rollout Train rollout temperature 1.0 script override
32 Rollout Train rollout top_p 1.0 script override
33 Rollout Train rollout do_sample True rollout.yaml default
34 Rollout Calculate rollout log probs True rlsd.yaml / script override
35 Rollout Max num batched tokens 10240 queue/script override
36 Rollout vLLM GPU memory utilization 0.8 queue/script override
37 Rollout Tensor model parallel size 2 rollout.yaml default
38 Rollout Free cache engine True rollout.yaml default
39 Validation Validation rollout n 16 queue/script override
40 Validation Validation temperature 0.6 queue/script override
41 Validation Validation top_p 0.95 queue/script override
42 Validation Validation do_sample True queue/script override
43 Optimization Optimizer AdamW fsdp optimizer config
44 Optimization Learning rate 1e-6 RLSD_TR method override
45 Optimization LR scheduler constant W&B config
46 Optimization LR warmup steps 10 script override
47 Optimization Weight decay 0.01 script override
48 Optimization Betas (0.9, 0.999) W&B config
49 Optimization Gradient clip 1.0 script override
50 PPO/GRPO Advantage estimator grpo rlsd.yaml
51 PPO/GRPO Normalize GRPO advantages by std False script override
52 PPO/GRPO PPO epochs 1 W&B config
53 PPO/GRPO PPO mini batch size 8 queue/script override
54 PPO/GRPO PPO micro batch size per GPU 1 user.yaml
55 PPO/GRPO Clip ratio low 0.2 script override
56 PPO/GRPO Clip ratio high 0.28 script override
57 PPO/GRPO Gamma 1.0 ppo_trainer.yaml default
58 PPO/GRPO Lambda 1.0 ppo_trainer.yaml default
59 PPO/GRPO Use KL in reward False ppo_trainer/user.yaml
60 PPO/GRPO Actor KL loss observed 0.0 output.log
61 Rollout correction Importance sampling mode token script override
62 Rollout correction IS threshold 2.0 script override
63 RLSD_TR Policy loss mode rlsd method override
64 RLSD_TR Teacher regularization trust-region method override
65 RLSD_TR Trust-region mix / teacher update rate 0.1 queue/script override
66 RLSD_TR Token reweight lambda 0.5 queue/script override
67 RLSD_TR Token reweight eps_w 0.2 queue/script override
68 RLSD_TR Token reweight decay steps 0 queue/script override
69 RLSD_TR Max reprompt length 10240 method override
70 RLSD_TR Fused kernels False method override
71 FSDP/System Actor strategy fsdp dp_actor.yaml
72 FSDP/System FSDP dtype bfloat16 W&B config
73 FSDP/System FSDP model dtype fp32 W&B config
74 FSDP/System Use torch compile True W&B config
75 FSDP/System GPUs per node 8 queue/script override
76 FSDP/System Nodes 1 user.yaml
77 FSDP/System GPU type NVIDIA H200 wandb-metadata
78 Checkpoint/Logging Checkpoint root checkpoints/datasets/sciknoweval/biology script override
79 Checkpoint/Logging Latest checkpointed iteration 100 latest_checkpointed_iteration.txt
80 Checkpoint/Logging Max actor checkpoints to keep 1 + external _actor_archive preservation user.yaml
81 Checkpoint/Logging Logger console, wandb ppo_trainer.yaml
82 Checkpoint/Logging W&B entity seongryongjung-chung-ang-university environment
83 Checkpoint/Logging W&B project SDPO-root user.yaml project_name
84 Checkpoint/Logging W&B group QWEN3-RLSD-TR-GRPO-matched-generalization method override
85 Checkpoint/Logging External actor archive checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive preserve_actor_checkpoints.py

42
results/summary.json Normal file
View File

@@ -0,0 +1,42 @@
{
"repo_id": "SeongryongJung/Qwen3-4B-Biology-RLSD-TR",
"output_dir": "/mnt/mole/SDPO/L2T/hf_upload_tr/Qwen3-4B-Biology-RLSD-TR",
"root_checkpoint_step": 90,
"root_checkpoint_kind": "best_validation",
"best_step": 90,
"best_val_mean16": 0.485,
"best_actor_dir": "/mnt/mole/SDPO/L2T/checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive/global_step_90/actor",
"final_step": 100,
"final_val_mean16": 0.42875,
"final_actor_dir": "/mnt/mole/SDPO/L2T/checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor",
"train_rows": 90,
"val_rows": 10,
"hf_model_files": [
"added_tokens.json",
"chat_template.jinja",
"config.json",
"generation_config.json",
"merges.txt",
"model.safetensors.index.json",
"special_tokens_map.json",
"tokenizer.json",
"tokenizer_config.json",
"vocab.json",
"model-00001-of-00002.safetensors",
"model-00002-of-00002.safetensors"
],
"hf_last_model_files": [
"added_tokens.json",
"chat_template.jinja",
"config.json",
"generation_config.json",
"merges.txt",
"model.safetensors.index.json",
"special_tokens_map.json",
"tokenizer.json",
"tokenizer_config.json",
"vocab.json",
"model-00001-of-00002.safetensors",
"model-00002-of-00002.safetensors"
]
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:d8d179d4cbb80eb70d11587378ff10ca730624560a552bf74f79c6533df4aed7
size 134385

1629
results/training_score.svg Normal file

File diff suppressed because it is too large Load Diff

After

Width:  |  Height:  |  Size: 44 KiB

View File

@@ -0,0 +1,91 @@
step,critic_score_mean
1,0.3125
2,0.4375
3,0.34765625
4,0.41796875
5,0.47265625
6,0.3125
7,0.22265625
8,0.28515625
9,0.3984375
11,0.421875
12,0.421875
13,0.34765625
14,0.265625
15,0.37890625
16,0.48046875
17,0.32421875
18,0.359375
19,0.328125
21,0.390625
22,0.46484375
23,0.265625
24,0.41015625
25,0.40234375
26,0.41015625
27,0.3984375
28,0.35546875
29,0.4921875
31,0.3828125
32,0.4765625
33,0.484375
34,0.37890625
35,0.4921875
36,0.33203125
37,0.3828125
38,0.50390625
39,0.4140625
41,0.54296875
42,0.3125
43,0.4921875
44,0.52734375
45,0.4140625
46,0.5390625
47,0.484375
48,0.46484375
49,0.43359375
51,0.37109375
52,0.4609375
53,0.4453125
54,0.51171875
55,0.5546875
56,0.51953125
57,0.60546875
58,0.5390625
59,0.53515625
61,0.4296875
62,0.51171875
63,0.60546875
64,0.4765625
65,0.5234375
66,0.53515625
67,0.43359375
68,0.52734375
69,0.46484375
71,0.48046875
72,0.421875
73,0.6171875
74,0.50390625
75,0.484375
76,0.46484375
77,0.63671875
78,0.58984375
79,0.50390625
81,0.59765625
82,0.59375
83,0.5859375
84,0.48046875
85,0.48828125
86,0.56640625
87,0.42578125
88,0.4921875
89,0.66796875
91,0.578125
92,0.515625
93,0.55078125
94,0.515625
95,0.60546875
96,0.53515625
97,0.515625
98,0.47265625
99,0.5859375
1 step critic_score_mean
2 1 0.3125
3 2 0.4375
4 3 0.34765625
5 4 0.41796875
6 5 0.47265625
7 6 0.3125
8 7 0.22265625
9 8 0.28515625
10 9 0.3984375
11 11 0.421875
12 12 0.421875
13 13 0.34765625
14 14 0.265625
15 15 0.37890625
16 16 0.48046875
17 17 0.32421875
18 18 0.359375
19 19 0.328125
20 21 0.390625
21 22 0.46484375
22 23 0.265625
23 24 0.41015625
24 25 0.40234375
25 26 0.41015625
26 27 0.3984375
27 28 0.35546875
28 29 0.4921875
29 31 0.3828125
30 32 0.4765625
31 33 0.484375
32 34 0.37890625
33 35 0.4921875
34 36 0.33203125
35 37 0.3828125
36 38 0.50390625
37 39 0.4140625
38 41 0.54296875
39 42 0.3125
40 43 0.4921875
41 44 0.52734375
42 45 0.4140625
43 46 0.5390625
44 47 0.484375
45 48 0.46484375
46 49 0.43359375
47 51 0.37109375
48 52 0.4609375
49 53 0.4453125
50 54 0.51171875
51 55 0.5546875
52 56 0.51953125
53 57 0.60546875
54 58 0.5390625
55 59 0.53515625
56 61 0.4296875
57 62 0.51171875
58 63 0.60546875
59 64 0.4765625
60 65 0.5234375
61 66 0.53515625
62 67 0.43359375
63 68 0.52734375
64 69 0.46484375
65 71 0.48046875
66 72 0.421875
67 73 0.6171875
68 74 0.50390625
69 75 0.484375
70 76 0.46484375
71 77 0.63671875
72 78 0.58984375
73 79 0.50390625
74 81 0.59765625
75 82 0.59375
76 83 0.5859375
77 84 0.48046875
78 85 0.48828125
79 86 0.56640625
80 87 0.42578125
81 88 0.4921875
82 89 0.66796875
83 91 0.578125
84 92 0.515625
85 93 0.55078125
86 94 0.515625
87 95 0.60546875
88 96 0.53515625
89 97 0.515625
90 98 0.47265625
91 99 0.5859375

View File

@@ -0,0 +1,11 @@
step,val_mean16
10,0.325
20,0.32875
30,0.3625
40,0.37125
50,0.41125
60,0.40625
70,0.42
80,0.41875
90,0.485
100,0.42875
1 step val_mean16
2 10 0.325
3 20 0.32875
4 30 0.3625
5 40 0.37125
6 50 0.41125
7 60 0.40625
8 70 0.42
9 80 0.41875
10 90 0.485
11 100 0.42875