Files
Qwen3-8B-Physics-GRPO-TR/results/hyperparameters.csv
ModelHub XC 90ed71fcdc 初始化项目,由ModelHub XC社区提供模型
Model: SeongryongJung/Qwen3-8B-Physics-GRPO-TR
Source: Original Platform
2026-08-07 04:05:18 +08:00

2.2 KiB

1sectionparametervaluesource
2Run identityBase modelQwen/Qwen3-8Bqueue/script override
3Run identityDatasetPhysics / SciKnowEval physicsrun_qwen3_generalization.sh
4Run identityMethodGRPOrun_qwen3_generalization.sh
5Run identityConfigbaseline_grporun_qwen3_generalization.sh
6Run identityExperimentqwen3gen-physics-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8run_qwen3_generalization.sh
7Run identityW&B runrun-20260703_032040-6ig3l55lwandb
8DataTrain filedatasets/sciknoweval/physics/train.parquetscript override
9DataValidation filedatasets/sciknoweval/physics/test.parquetscript override
10DataTrain batch size32queue/script override
11DataTrain max samples3200queue/script override
12ScheduleTotal training steps100queue/script override
13ScheduleValidation before trainFalsequeue/script override
14ScheduleSave frequency10queue/script override
15ScheduleValidation frequency10queue/script override
16SequenceMax prompt length2048queue/script override
17SequenceMax response length8192queue/script override
18SequenceMax model length10240queue/script override
19RolloutTrain rollout n8queue/script override
20RolloutValidation rollout n16queue/script override
21RolloutvLLM GPU memory utilization0.8queue/script override
22OptimizationLearning rate1e-6GRPO method override
23OptimizationWeight decay0.01script override
24PPO/GRPOPPO mini batch size8queue/script override
25PPO/GRPONormalize GRPO advantages by stdFalsebaseline_grpo.yaml / script override
26Rollout correctionImportance sampling modetokenscript override
27Rollout correctionIS threshold2.0script override
28Checkpoint/LoggingCheckpoint rootcheckpoints/datasets/sciknoweval/physics/qwen3gen-physics-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8script override
29Checkpoint/LoggingLatest checkpointed iteration100latest_checkpointed_iteration.txt
30Checkpoint/LoggingExternal actor archivecheckpoints/datasets/sciknoweval/physics/qwen3gen-physics-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8/_actor_archivepreserve_actor_checkpoints.py
31Checkpoint/LoggingLoggerconsole, wandbppo_trainer.yaml
32PPO/GRPOPolicy loss modevanillamethod override
33PPO/GRPOActor KL loss coef0.0method override