| Run identity |
Base model |
Qwen/Qwen3-8B |
queue/script override |
| Run identity |
Dataset |
Chemistry / SciKnowEval chemistry |
run_qwen3_generalization.sh |
| Run identity |
Method |
RLSD_TR |
run_qwen3_generalization.sh |
| Run identity |
Config |
rlsd |
run_qwen3_generalization.sh |
| Run identity |
Experiment |
qwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8 |
run_qwen3_generalization.sh |
| Run identity |
W&B run |
run-20260703_014331-zs3h1j56 |
wandb |
| Data |
Train file |
datasets/sciknoweval/chemistry/train.parquet |
script override |
| Data |
Validation file |
datasets/sciknoweval/chemistry/test.parquet |
script override |
| Data |
Train batch size |
32 |
queue/script override |
| Data |
Train max samples |
3200 |
queue/script override |
| Schedule |
Total training steps |
100 |
queue/script override |
| Schedule |
Validation before train |
False |
queue/script override |
| Schedule |
Save frequency |
10 |
queue/script override |
| Schedule |
Validation frequency |
10 |
queue/script override |
| Sequence |
Max prompt length |
2048 |
queue/script override |
| Sequence |
Max response length |
8192 |
queue/script override |
| Sequence |
Max model length |
10240 |
queue/script override |
| Rollout |
Train rollout n |
8 |
queue/script override |
| Rollout |
Validation rollout n |
16 |
queue/script override |
| Rollout |
vLLM GPU memory utilization |
0.8 |
queue/script override |
| Optimization |
Learning rate |
1e-6 |
RLSD_TR method override |
| Optimization |
Weight decay |
0.01 |
script override |
| PPO/GRPO |
PPO mini batch size |
8 |
queue/script override |
| PPO/GRPO |
Normalize GRPO advantages by std |
False |
baseline_grpo.yaml / script override |
| Rollout correction |
Importance sampling mode |
token |
script override |
| Rollout correction |
IS threshold |
2.0 |
script override |
| Checkpoint/Logging |
Checkpoint root |
checkpoints/datasets/sciknoweval/chemistry/qwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8 |
script override |
| Checkpoint/Logging |
Latest checkpointed iteration |
100 |
latest_checkpointed_iteration.txt |
| Checkpoint/Logging |
External actor archive |
checkpoints/datasets/sciknoweval/chemistry/qwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive |
preserve_actor_checkpoints.py |
| Checkpoint/Logging |
Logger |
console, wandb |
ppo_trainer.yaml |
| RLSD_TR |
Policy loss mode |
rlsd |
method override |
| RLSD_TR |
Teacher regularization |
trust-region |
method override |
| RLSD_TR |
Trust-region mix / teacher update rate |
0.1 |
queue/script override |
| RLSD_TR |
Token reweight lambda |
0.5 |
queue/script override |
| RLSD_TR |
Token reweight eps_w |
0.2 |
queue/script override |
| RLSD_TR |
Token reweight decay steps |
0 |
queue/script override |
| RLSD_TR |
Fused kernels |
False |
method override |