section,parameter,value,source Run identity,Base model,Qwen/Qwen3-8B,queue/script override Run identity,Dataset,Chemistry / SciKnowEval chemistry,run_qwen3_generalization.sh Run identity,Method,RLSD_TR,run_qwen3_generalization.sh Run identity,Config,rlsd,run_qwen3_generalization.sh Run identity,Experiment,qwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8,run_qwen3_generalization.sh Run identity,W&B run,run-20260703_014331-zs3h1j56,wandb Data,Train file,datasets/sciknoweval/chemistry/train.parquet,script override Data,Validation file,datasets/sciknoweval/chemistry/test.parquet,script override Data,Train batch size,32,queue/script override Data,Train max samples,3200,queue/script override Schedule,Total training steps,100,queue/script override Schedule,Validation before train,False,queue/script override Schedule,Save frequency,10,queue/script override Schedule,Validation frequency,10,queue/script override Sequence,Max prompt length,2048,queue/script override Sequence,Max response length,8192,queue/script override Sequence,Max model length,10240,queue/script override Rollout,Train rollout n,8,queue/script override Rollout,Validation rollout n,16,queue/script override Rollout,vLLM GPU memory utilization,0.8,queue/script override Optimization,Learning rate,1e-6,RLSD_TR method override Optimization,Weight decay,0.01,script override PPO/GRPO,PPO mini batch size,8,queue/script override PPO/GRPO,Normalize GRPO advantages by std,False,baseline_grpo.yaml / script override Rollout correction,Importance sampling mode,token,script override Rollout correction,IS threshold,2.0,script override Checkpoint/Logging,Checkpoint root,checkpoints/datasets/sciknoweval/chemistry/qwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8,script override Checkpoint/Logging,Latest checkpointed iteration,100,latest_checkpointed_iteration.txt Checkpoint/Logging,External actor archive,checkpoints/datasets/sciknoweval/chemistry/qwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archive,preserve_actor_checkpoints.py Checkpoint/Logging,Logger,"console, wandb",ppo_trainer.yaml RLSD_TR,Policy loss mode,rlsd,method override RLSD_TR,Teacher regularization,trust-region,method override RLSD_TR,Trust-region mix / teacher update rate,0.1,queue/script override RLSD_TR,Token reweight lambda,0.5,queue/script override RLSD_TR,Token reweight eps_w,0.2,queue/script override RLSD_TR,Token reweight decay steps,0,queue/script override RLSD_TR,Fused kernels,False,method override