初始化项目,由ModelHub XC社区提供模型

Model: SeongryongJung/Qwen3-8B-Physics-RLSD-TR
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-08-18 22:17:05 +08:00
commit f104ce4822
40 changed files with 317641 additions and 0 deletions

View File

@@ -0,0 +1,38 @@
section,parameter,value,source
Run identity,Base model,Qwen/Qwen3-8B,queue/script override
Run identity,Dataset,Physics / SciKnowEval physics,run_qwen3_generalization.sh
Run identity,Method,RLSD_TR,run_qwen3_generalization.sh
Run identity,Config,rlsd,run_qwen3_generalization.sh
Run identity,Experiment,qwen3gen-physics-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8,run_qwen3_generalization.sh
Run identity,W&B run,run-20260703_055133-5wz4kyyd,wandb
Data,Train file,datasets/sciknoweval/physics/train.parquet,script override
Data,Validation file,datasets/sciknoweval/physics/test.parquet,script override
Data,Train batch size,32,queue/script override
Data,Train max samples,3200,queue/script override
Schedule,Total training steps,100,queue/script override
Schedule,Validation before train,False,queue/script override
Schedule,Save frequency,10,queue/script override
Schedule,Validation frequency,10,queue/script override
Sequence,Max prompt length,2048,queue/script override
Sequence,Max response length,8192,queue/script override
Sequence,Max model length,10240,queue/script override
Rollout,Train rollout n,8,queue/script override
Rollout,Validation rollout n,16,queue/script override
Rollout,vLLM GPU memory utilization,0.8,queue/script override
Optimization,Learning rate,1e-6,RLSD_TR method override
Optimization,Weight decay,0.01,script override
PPO/GRPO,PPO mini batch size,8,queue/script override
PPO/GRPO,Normalize GRPO advantages by std,False,baseline_grpo.yaml / script override
Rollout correction,Importance sampling mode,token,script override
Rollout correction,IS threshold,2.0,script override
Checkpoint/Logging,Checkpoint root,checkpoints/datasets/sciknoweval/physics/qwen3gen-physics-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8,script override
Checkpoint/Logging,Latest checkpointed iteration,100,latest_checkpointed_iteration.txt
Checkpoint/Logging,External actor archive,checkpoints/datasets/sciknoweval/physics/qwen3gen-physics-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive,preserve_actor_checkpoints.py
Checkpoint/Logging,Logger,"console, wandb",ppo_trainer.yaml
RLSD_TR,Policy loss mode,rlsd,method override
RLSD_TR,Teacher regularization,trust-region,method override
RLSD_TR,Trust-region mix / teacher update rate,0.1,queue/script override
RLSD_TR,Token reweight lambda,0.5,queue/script override
RLSD_TR,Token reweight eps_w,0.2,queue/script override
RLSD_TR,Token reweight decay steps,0,queue/script override
RLSD_TR,Fused kernels,False,method override
1 section parameter value source
2 Run identity Base model Qwen/Qwen3-8B queue/script override
3 Run identity Dataset Physics / SciKnowEval physics run_qwen3_generalization.sh
4 Run identity Method RLSD_TR run_qwen3_generalization.sh
5 Run identity Config rlsd run_qwen3_generalization.sh
6 Run identity Experiment qwen3gen-physics-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8 run_qwen3_generalization.sh
7 Run identity W&B run run-20260703_055133-5wz4kyyd wandb
8 Data Train file datasets/sciknoweval/physics/train.parquet script override
9 Data Validation file datasets/sciknoweval/physics/test.parquet script override
10 Data Train batch size 32 queue/script override
11 Data Train max samples 3200 queue/script override
12 Schedule Total training steps 100 queue/script override
13 Schedule Validation before train False queue/script override
14 Schedule Save frequency 10 queue/script override
15 Schedule Validation frequency 10 queue/script override
16 Sequence Max prompt length 2048 queue/script override
17 Sequence Max response length 8192 queue/script override
18 Sequence Max model length 10240 queue/script override
19 Rollout Train rollout n 8 queue/script override
20 Rollout Validation rollout n 16 queue/script override
21 Rollout vLLM GPU memory utilization 0.8 queue/script override
22 Optimization Learning rate 1e-6 RLSD_TR method override
23 Optimization Weight decay 0.01 script override
24 PPO/GRPO PPO mini batch size 8 queue/script override
25 PPO/GRPO Normalize GRPO advantages by std False baseline_grpo.yaml / script override
26 Rollout correction Importance sampling mode token script override
27 Rollout correction IS threshold 2.0 script override
28 Checkpoint/Logging Checkpoint root checkpoints/datasets/sciknoweval/physics/qwen3gen-physics-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8 script override
29 Checkpoint/Logging Latest checkpointed iteration 100 latest_checkpointed_iteration.txt
30 Checkpoint/Logging External actor archive checkpoints/datasets/sciknoweval/physics/qwen3gen-physics-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive preserve_actor_checkpoints.py
31 Checkpoint/Logging Logger console, wandb ppo_trainer.yaml
32 RLSD_TR Policy loss mode rlsd method override
33 RLSD_TR Teacher regularization trust-region method override
34 RLSD_TR Trust-region mix / teacher update rate 0.1 queue/script override
35 RLSD_TR Token reweight lambda 0.5 queue/script override
36 RLSD_TR Token reweight eps_w 0.2 queue/script override
37 RLSD_TR Token reweight decay steps 0 queue/script override
38 RLSD_TR Fused kernels False method override

29
results/summary.json Normal file
View File

@@ -0,0 +1,29 @@
{
"repo_id": "SeongryongJung/Qwen3-8B-Physics-RLSD-TR",
"output_dir": "/mnt/mole/SDPO/L2T/hf_upload_tr/Qwen3-8B-Physics-RLSD-TR",
"experiment": "qwen3gen-physics-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8",
"best_step": 90,
"best_val_mean16": 0.68046875,
"best_actor_dir": "/mnt/mole/SDPO/L2T/checkpoints/datasets/sciknoweval/physics/qwen3gen-physics-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/global_step_90/actor",
"final_step": 100,
"final_val_mean16": 0.6578125,
"final_actor_dir": "/mnt/mole/SDPO/L2T/checkpoints/datasets/sciknoweval/physics/qwen3gen-physics-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor",
"train_rows": 90,
"val_rows": 10,
"hf_model_files": [
"added_tokens.json",
"chat_template.jinja",
"config.json",
"generation_config.json",
"merges.txt",
"model.safetensors.index.json",
"special_tokens_map.json",
"tokenizer.json",
"tokenizer_config.json",
"vocab.json",
"model-00001-of-00004.safetensors",
"model-00002-of-00004.safetensors",
"model-00003-of-00004.safetensors",
"model-00004-of-00004.safetensors"
]
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:c48fb4344f9c26c21ce4d05db024b61d04ecf215c840b7dabedf68bd14e363bd
size 133374

1700
results/training_score.svg Normal file

File diff suppressed because it is too large Load Diff

After

Width:  |  Height:  |  Size: 46 KiB

View File

@@ -0,0 +1,91 @@
step,critic_score_mean
1,0.59765625
2,0.59375
3,0.546875
4,0.6640625
5,0.76171875
6,0.609375
7,0.74609375
8,0.671875
9,0.63671875
11,0.640625
12,0.5703125
13,0.55078125
14,0.6796875
15,0.69140625
16,0.76953125
17,0.68359375
18,0.421875
19,0.73046875
21,0.66015625
22,0.640625
23,0.4453125
24,0.7109375
25,0.67578125
26,0.68359375
27,0.765625
28,0.6171875
29,0.7421875
31,0.625
32,0.74609375
33,0.74609375
34,0.68359375
35,0.71875
36,0.55859375
37,0.66796875
38,0.6484375
39,0.80859375
41,0.7734375
42,0.6171875
43,0.671875
44,0.640625
45,0.69921875
46,0.734375
47,0.76171875
48,0.76171875
49,0.796875
51,0.6328125
52,0.6875
53,0.75
54,0.75
55,0.80078125
56,0.67578125
57,0.68359375
58,0.6484375
59,0.71484375
61,0.74609375
62,0.703125
63,0.6875
64,0.63671875
65,0.84375
66,0.74609375
67,0.81640625
68,0.7578125
69,0.80859375
71,0.79296875
72,0.734375
73,0.65625
74,0.81640625
75,0.8515625
76,0.70703125
77,0.703125
78,0.84765625
79,0.8203125
81,0.75
82,0.7109375
83,0.77734375
84,0.76171875
85,0.7421875
86,0.671875
87,0.75390625
88,0.65625
89,0.8671875
91,0.859375
92,0.7265625
93,0.7890625
94,0.76171875
95,0.69140625
96,0.75
97,0.84765625
98,0.74609375
99,0.8828125
1 step critic_score_mean
2 1 0.59765625
3 2 0.59375
4 3 0.546875
5 4 0.6640625
6 5 0.76171875
7 6 0.609375
8 7 0.74609375
9 8 0.671875
10 9 0.63671875
11 11 0.640625
12 12 0.5703125
13 13 0.55078125
14 14 0.6796875
15 15 0.69140625
16 16 0.76953125
17 17 0.68359375
18 18 0.421875
19 19 0.73046875
20 21 0.66015625
21 22 0.640625
22 23 0.4453125
23 24 0.7109375
24 25 0.67578125
25 26 0.68359375
26 27 0.765625
27 28 0.6171875
28 29 0.7421875
29 31 0.625
30 32 0.74609375
31 33 0.74609375
32 34 0.68359375
33 35 0.71875
34 36 0.55859375
35 37 0.66796875
36 38 0.6484375
37 39 0.80859375
38 41 0.7734375
39 42 0.6171875
40 43 0.671875
41 44 0.640625
42 45 0.69921875
43 46 0.734375
44 47 0.76171875
45 48 0.76171875
46 49 0.796875
47 51 0.6328125
48 52 0.6875
49 53 0.75
50 54 0.75
51 55 0.80078125
52 56 0.67578125
53 57 0.68359375
54 58 0.6484375
55 59 0.71484375
56 61 0.74609375
57 62 0.703125
58 63 0.6875
59 64 0.63671875
60 65 0.84375
61 66 0.74609375
62 67 0.81640625
63 68 0.7578125
64 69 0.80859375
65 71 0.79296875
66 72 0.734375
67 73 0.65625
68 74 0.81640625
69 75 0.8515625
70 76 0.70703125
71 77 0.703125
72 78 0.84765625
73 79 0.8203125
74 81 0.75
75 82 0.7109375
76 83 0.77734375
77 84 0.76171875
78 85 0.7421875
79 86 0.671875
80 87 0.75390625
81 88 0.65625
82 89 0.8671875
83 91 0.859375
84 92 0.7265625
85 93 0.7890625
86 94 0.76171875
87 95 0.69140625
88 96 0.75
89 97 0.84765625
90 98 0.74609375
91 99 0.8828125

View File

@@ -0,0 +1,11 @@
step,val_mean16
10,0.58671875
20,0.6171875
30,0.6140625
40,0.61796875
50,0.6421875
60,0.6453125
70,0.653125
80,0.66640625
90,0.68046875
100,0.6578125
1 step val_mean16
2 10 0.58671875
3 20 0.6171875
4 30 0.6140625
5 40 0.61796875
6 50 0.6421875
7 60 0.6453125
8 70 0.653125
9 80 0.66640625
10 90 0.68046875
11 100 0.6578125