34 lines
2.2 KiB
CSV
34 lines
2.2 KiB
CSV
|
|
section,parameter,value,source
|
||
|
|
Run identity,Base model,Qwen/Qwen3-8B,queue/script override
|
||
|
|
Run identity,Dataset,Physics / SciKnowEval physics,run_qwen3_generalization.sh
|
||
|
|
Run identity,Method,GRPO,run_qwen3_generalization.sh
|
||
|
|
Run identity,Config,baseline_grpo,run_qwen3_generalization.sh
|
||
|
|
Run identity,Experiment,qwen3gen-physics-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8,run_qwen3_generalization.sh
|
||
|
|
Run identity,W&B run,run-20260703_032040-6ig3l55l,wandb
|
||
|
|
Data,Train file,datasets/sciknoweval/physics/train.parquet,script override
|
||
|
|
Data,Validation file,datasets/sciknoweval/physics/test.parquet,script override
|
||
|
|
Data,Train batch size,32,queue/script override
|
||
|
|
Data,Train max samples,3200,queue/script override
|
||
|
|
Schedule,Total training steps,100,queue/script override
|
||
|
|
Schedule,Validation before train,False,queue/script override
|
||
|
|
Schedule,Save frequency,10,queue/script override
|
||
|
|
Schedule,Validation frequency,10,queue/script override
|
||
|
|
Sequence,Max prompt length,2048,queue/script override
|
||
|
|
Sequence,Max response length,8192,queue/script override
|
||
|
|
Sequence,Max model length,10240,queue/script override
|
||
|
|
Rollout,Train rollout n,8,queue/script override
|
||
|
|
Rollout,Validation rollout n,16,queue/script override
|
||
|
|
Rollout,vLLM GPU memory utilization,0.8,queue/script override
|
||
|
|
Optimization,Learning rate,1e-6,GRPO method override
|
||
|
|
Optimization,Weight decay,0.01,script override
|
||
|
|
PPO/GRPO,PPO mini batch size,8,queue/script override
|
||
|
|
PPO/GRPO,Normalize GRPO advantages by std,False,baseline_grpo.yaml / script override
|
||
|
|
Rollout correction,Importance sampling mode,token,script override
|
||
|
|
Rollout correction,IS threshold,2.0,script override
|
||
|
|
Checkpoint/Logging,Checkpoint root,checkpoints/datasets/sciknoweval/physics/qwen3gen-physics-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8,script override
|
||
|
|
Checkpoint/Logging,Latest checkpointed iteration,100,latest_checkpointed_iteration.txt
|
||
|
|
Checkpoint/Logging,External actor archive,checkpoints/datasets/sciknoweval/physics/qwen3gen-physics-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8/_actor_archive,preserve_actor_checkpoints.py
|
||
|
|
Checkpoint/Logging,Logger,"console, wandb",ppo_trainer.yaml
|
||
|
|
PPO/GRPO,Policy loss mode,vanilla,method override
|
||
|
|
PPO/GRPO,Actor KL loss coef,0.0,method override
|