初始化项目,由ModelHub XC社区提供模型
Model: SeongryongJung/Qwen3-4B-Biology-RLSD-TR Source: Original Platform
This commit is contained in:
8
results/export_note.csv
Normal file
8
results/export_note.csv
Normal file
@@ -0,0 +1,8 @@
|
||||
key,value
|
||||
root_checkpoint_step,90
|
||||
root_checkpoint_kind,best_validation
|
||||
root_actor_dir,checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive/global_step_90/actor
|
||||
last_checkpoint_step,100
|
||||
last_actor_dir,checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor
|
||||
best_validation_mean16,0.485000000000
|
||||
final_validation_mean16,0.428750000000
|
||||
|
85
results/hyperparameters.csv
Normal file
85
results/hyperparameters.csv
Normal file
@@ -0,0 +1,85 @@
|
||||
section,parameter,value,source
|
||||
Run identity,Base model,Qwen/Qwen3-4B,queue/script override
|
||||
Run identity,Dataset,Biology / SciKnowEval biology,run_qwen3_generalization.sh
|
||||
Run identity,Method,RLSD_TR,run_qwen3_generalization.sh
|
||||
Run identity,Config,rlsd,run_qwen3_generalization.sh
|
||||
Run identity,Experiment,qwen3gen-biology-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8,run_qwen3_generalization.sh
|
||||
Run identity,W&B run,run-20260702_113907-xauqhwk1,wandb
|
||||
Data,Train file,datasets/sciknoweval/biology/train.parquet,script override
|
||||
Data,Validation file,datasets/sciknoweval/biology/test.parquet,script override
|
||||
Data,Train batch size,32,queue/script override
|
||||
Data,Train max samples,3200,queue/script override
|
||||
Data,Prompt key,prompt,legacy_data.yaml default
|
||||
Data,Reward key,data_source,legacy_data.yaml default
|
||||
Data,Shuffle train data,True,user.yaml / legacy_data.yaml
|
||||
Data,Validation shuffle,False,legacy_data.yaml default
|
||||
Data,Filter overlong prompts,True,user.yaml
|
||||
Data,Prompt truncation,error,legacy_data.yaml default
|
||||
Data,enable_thinking,false,script override
|
||||
Schedule,Total training steps,100,queue/script override
|
||||
Schedule,Total epochs,30,ppo_trainer/user.yaml default
|
||||
Schedule,Validation before train,False,queue/script override
|
||||
Schedule,Save frequency,10,queue/script override
|
||||
Schedule,Validation frequency,10,queue/script override
|
||||
Sequence,Max prompt length,2048,queue/script override
|
||||
Sequence,Max response length,8192,queue/script override
|
||||
Sequence,Max model length,10240,queue/script override
|
||||
Sequence,Actor max token length per GPU,10240,queue/script override
|
||||
Rollout,Rollout engine,vllm,user.yaml
|
||||
Rollout,Rollout dtype,bfloat16,rollout.yaml default
|
||||
Rollout,Train rollout n,8,queue/script override
|
||||
Rollout,Train rollout temperature,1.0,script override
|
||||
Rollout,Train rollout top_p,1.0,script override
|
||||
Rollout,Train rollout do_sample,True,rollout.yaml default
|
||||
Rollout,Calculate rollout log probs,True,rlsd.yaml / script override
|
||||
Rollout,Max num batched tokens,10240,queue/script override
|
||||
Rollout,vLLM GPU memory utilization,0.8,queue/script override
|
||||
Rollout,Tensor model parallel size,2,rollout.yaml default
|
||||
Rollout,Free cache engine,True,rollout.yaml default
|
||||
Validation,Validation rollout n,16,queue/script override
|
||||
Validation,Validation temperature,0.6,queue/script override
|
||||
Validation,Validation top_p,0.95,queue/script override
|
||||
Validation,Validation do_sample,True,queue/script override
|
||||
Optimization,Optimizer,AdamW,fsdp optimizer config
|
||||
Optimization,Learning rate,1e-6,RLSD_TR method override
|
||||
Optimization,LR scheduler,constant,W&B config
|
||||
Optimization,LR warmup steps,10,script override
|
||||
Optimization,Weight decay,0.01,script override
|
||||
Optimization,Betas,"(0.9, 0.999)",W&B config
|
||||
Optimization,Gradient clip,1.0,script override
|
||||
PPO/GRPO,Advantage estimator,grpo,rlsd.yaml
|
||||
PPO/GRPO,Normalize GRPO advantages by std,False,script override
|
||||
PPO/GRPO,PPO epochs,1,W&B config
|
||||
PPO/GRPO,PPO mini batch size,8,queue/script override
|
||||
PPO/GRPO,PPO micro batch size per GPU,1,user.yaml
|
||||
PPO/GRPO,Clip ratio low,0.2,script override
|
||||
PPO/GRPO,Clip ratio high,0.28,script override
|
||||
PPO/GRPO,Gamma,1.0,ppo_trainer.yaml default
|
||||
PPO/GRPO,Lambda,1.0,ppo_trainer.yaml default
|
||||
PPO/GRPO,Use KL in reward,False,ppo_trainer/user.yaml
|
||||
PPO/GRPO,Actor KL loss observed,0.0,output.log
|
||||
Rollout correction,Importance sampling mode,token,script override
|
||||
Rollout correction,IS threshold,2.0,script override
|
||||
RLSD_TR,Policy loss mode,rlsd,method override
|
||||
RLSD_TR,Teacher regularization,trust-region,method override
|
||||
RLSD_TR,Trust-region mix / teacher update rate,0.1,queue/script override
|
||||
RLSD_TR,Token reweight lambda,0.5,queue/script override
|
||||
RLSD_TR,Token reweight eps_w,0.2,queue/script override
|
||||
RLSD_TR,Token reweight decay steps,0,queue/script override
|
||||
RLSD_TR,Max reprompt length,10240,method override
|
||||
RLSD_TR,Fused kernels,False,method override
|
||||
FSDP/System,Actor strategy,fsdp,dp_actor.yaml
|
||||
FSDP/System,FSDP dtype,bfloat16,W&B config
|
||||
FSDP/System,FSDP model dtype,fp32,W&B config
|
||||
FSDP/System,Use torch compile,True,W&B config
|
||||
FSDP/System,GPUs per node,8,queue/script override
|
||||
FSDP/System,Nodes,1,user.yaml
|
||||
FSDP/System,GPU type,NVIDIA H200,wandb-metadata
|
||||
Checkpoint/Logging,Checkpoint root,checkpoints/datasets/sciknoweval/biology,script override
|
||||
Checkpoint/Logging,Latest checkpointed iteration,100,latest_checkpointed_iteration.txt
|
||||
Checkpoint/Logging,Max actor checkpoints to keep,1 + external _actor_archive preservation,user.yaml
|
||||
Checkpoint/Logging,Logger,"console, wandb",ppo_trainer.yaml
|
||||
Checkpoint/Logging,W&B entity,seongryongjung-chung-ang-university,environment
|
||||
Checkpoint/Logging,W&B project,SDPO-root,user.yaml project_name
|
||||
Checkpoint/Logging,W&B group,QWEN3-RLSD-TR-GRPO-matched-generalization,method override
|
||||
Checkpoint/Logging,External actor archive,checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive,preserve_actor_checkpoints.py
|
||||
|
42
results/summary.json
Normal file
42
results/summary.json
Normal file
@@ -0,0 +1,42 @@
|
||||
{
|
||||
"repo_id": "SeongryongJung/Qwen3-4B-Biology-RLSD-TR",
|
||||
"output_dir": "/mnt/mole/SDPO/L2T/hf_upload_tr/Qwen3-4B-Biology-RLSD-TR",
|
||||
"root_checkpoint_step": 90,
|
||||
"root_checkpoint_kind": "best_validation",
|
||||
"best_step": 90,
|
||||
"best_val_mean16": 0.485,
|
||||
"best_actor_dir": "/mnt/mole/SDPO/L2T/checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive/global_step_90/actor",
|
||||
"final_step": 100,
|
||||
"final_val_mean16": 0.42875,
|
||||
"final_actor_dir": "/mnt/mole/SDPO/L2T/checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor",
|
||||
"train_rows": 90,
|
||||
"val_rows": 10,
|
||||
"hf_model_files": [
|
||||
"added_tokens.json",
|
||||
"chat_template.jinja",
|
||||
"config.json",
|
||||
"generation_config.json",
|
||||
"merges.txt",
|
||||
"model.safetensors.index.json",
|
||||
"special_tokens_map.json",
|
||||
"tokenizer.json",
|
||||
"tokenizer_config.json",
|
||||
"vocab.json",
|
||||
"model-00001-of-00002.safetensors",
|
||||
"model-00002-of-00002.safetensors"
|
||||
],
|
||||
"hf_last_model_files": [
|
||||
"added_tokens.json",
|
||||
"chat_template.jinja",
|
||||
"config.json",
|
||||
"generation_config.json",
|
||||
"merges.txt",
|
||||
"model.safetensors.index.json",
|
||||
"special_tokens_map.json",
|
||||
"tokenizer.json",
|
||||
"tokenizer_config.json",
|
||||
"vocab.json",
|
||||
"model-00001-of-00002.safetensors",
|
||||
"model-00002-of-00002.safetensors"
|
||||
]
|
||||
}
|
||||
3
results/training_score.png
Normal file
3
results/training_score.png
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:d8d179d4cbb80eb70d11587378ff10ca730624560a552bf74f79c6533df4aed7
|
||||
size 134385
|
||||
1629
results/training_score.svg
Normal file
1629
results/training_score.svg
Normal file
File diff suppressed because it is too large
Load Diff
|
After Width: | Height: | Size: 44 KiB |
91
results/training_scores.csv
Normal file
91
results/training_scores.csv
Normal file
@@ -0,0 +1,91 @@
|
||||
step,critic_score_mean
|
||||
1,0.3125
|
||||
2,0.4375
|
||||
3,0.34765625
|
||||
4,0.41796875
|
||||
5,0.47265625
|
||||
6,0.3125
|
||||
7,0.22265625
|
||||
8,0.28515625
|
||||
9,0.3984375
|
||||
11,0.421875
|
||||
12,0.421875
|
||||
13,0.34765625
|
||||
14,0.265625
|
||||
15,0.37890625
|
||||
16,0.48046875
|
||||
17,0.32421875
|
||||
18,0.359375
|
||||
19,0.328125
|
||||
21,0.390625
|
||||
22,0.46484375
|
||||
23,0.265625
|
||||
24,0.41015625
|
||||
25,0.40234375
|
||||
26,0.41015625
|
||||
27,0.3984375
|
||||
28,0.35546875
|
||||
29,0.4921875
|
||||
31,0.3828125
|
||||
32,0.4765625
|
||||
33,0.484375
|
||||
34,0.37890625
|
||||
35,0.4921875
|
||||
36,0.33203125
|
||||
37,0.3828125
|
||||
38,0.50390625
|
||||
39,0.4140625
|
||||
41,0.54296875
|
||||
42,0.3125
|
||||
43,0.4921875
|
||||
44,0.52734375
|
||||
45,0.4140625
|
||||
46,0.5390625
|
||||
47,0.484375
|
||||
48,0.46484375
|
||||
49,0.43359375
|
||||
51,0.37109375
|
||||
52,0.4609375
|
||||
53,0.4453125
|
||||
54,0.51171875
|
||||
55,0.5546875
|
||||
56,0.51953125
|
||||
57,0.60546875
|
||||
58,0.5390625
|
||||
59,0.53515625
|
||||
61,0.4296875
|
||||
62,0.51171875
|
||||
63,0.60546875
|
||||
64,0.4765625
|
||||
65,0.5234375
|
||||
66,0.53515625
|
||||
67,0.43359375
|
||||
68,0.52734375
|
||||
69,0.46484375
|
||||
71,0.48046875
|
||||
72,0.421875
|
||||
73,0.6171875
|
||||
74,0.50390625
|
||||
75,0.484375
|
||||
76,0.46484375
|
||||
77,0.63671875
|
||||
78,0.58984375
|
||||
79,0.50390625
|
||||
81,0.59765625
|
||||
82,0.59375
|
||||
83,0.5859375
|
||||
84,0.48046875
|
||||
85,0.48828125
|
||||
86,0.56640625
|
||||
87,0.42578125
|
||||
88,0.4921875
|
||||
89,0.66796875
|
||||
91,0.578125
|
||||
92,0.515625
|
||||
93,0.55078125
|
||||
94,0.515625
|
||||
95,0.60546875
|
||||
96,0.53515625
|
||||
97,0.515625
|
||||
98,0.47265625
|
||||
99,0.5859375
|
||||
|
11
results/validation_mean16.csv
Normal file
11
results/validation_mean16.csv
Normal file
@@ -0,0 +1,11 @@
|
||||
step,val_mean16
|
||||
10,0.325
|
||||
20,0.32875
|
||||
30,0.3625
|
||||
40,0.37125
|
||||
50,0.41125
|
||||
60,0.40625
|
||||
70,0.42
|
||||
80,0.41875
|
||||
90,0.485
|
||||
100,0.42875
|
||||
|
Reference in New Issue
Block a user