Files
Qwen3-4B-Physics-GRPO-TR/results/hyperparameters.csv
ModelHub XC 8100d93918 初始化项目,由ModelHub XC社区提供模型
Model: SeongryongJung/Qwen3-4B-Physics-GRPO-TR
Source: Original Platform
2026-08-05 02:49:18 +08:00

4.3 KiB

1sectionparametervaluesource
2Run identityBase modelQwen/Qwen3-4Bqueue/script override
3Run identityDatasetPhysics / SciKnowEval physicsrun_qwen3_generalization.sh
4Run identityMethodGRPOrun_qwen3_generalization.sh
5Run identityConfigbaseline_grporun_qwen3_generalization.sh
6Run identityExperimentqwen3gen-physics-GRPO-Qwen-Qwen3-4B-mbs8-train32-rollout8-lr1e-6-vllm0.8run_qwen3_generalization.sh
7Run identityW&B runrun-20260702_073403-o8ivivjgwandb
8DataTrain filedatasets/sciknoweval/physics/train.parquetscript override
9DataValidation filedatasets/sciknoweval/physics/test.parquetscript override
10DataTrain batch size32queue/script override
11DataTrain max samples3200queue/script override
12DataPrompt keypromptlegacy_data.yaml default
13DataReward keydata_sourcelegacy_data.yaml default
14DataShuffle train dataTrueuser.yaml / legacy_data.yaml
15DataValidation shuffleFalselegacy_data.yaml default
16DataFilter overlong promptsTrueuser.yaml
17DataPrompt truncationerrorlegacy_data.yaml default
18Dataenable_thinkingfalsescript override
19ScheduleTotal training steps100queue/script override
20ScheduleTotal epochs30ppo_trainer/user.yaml default
21ScheduleValidation before trainFalsequeue/script override
22ScheduleSave frequency10queue/script override
23ScheduleValidation frequency10queue/script override
24SequenceMax prompt length2048queue/script override
25SequenceMax response length8192queue/script override
26SequenceMax model length10240queue/script override
27SequenceActor max token length per GPU10240queue/script override
28RolloutRollout enginevllmuser.yaml
29RolloutRollout dtypebfloat16rollout.yaml default
30RolloutTrain rollout n8queue/script override
31RolloutTrain rollout temperature1.0script override
32RolloutTrain rollout top_p1.0script override
33RolloutTrain rollout do_sampleTruerollout.yaml default
34RolloutCalculate rollout log probsTruebaseline_grpo.yaml / script override
35RolloutMax num batched tokens10240queue/script override
36RolloutvLLM GPU memory utilization0.8queue/script override
37RolloutTensor model parallel size2rollout.yaml default
38RolloutFree cache engineTruerollout.yaml default
39ValidationValidation rollout n16queue/script override
40ValidationValidation temperature0.6queue/script override
41ValidationValidation top_p0.95queue/script override
42ValidationValidation do_sampleTruequeue/script override
43OptimizationOptimizerAdamWfsdp optimizer config
44OptimizationLearning rate1e-6GRPO method override
45OptimizationLR schedulerconstantW&B config
46OptimizationLR warmup steps10script override
47OptimizationWeight decay0.01script override
48OptimizationBetas(0.9, 0.999)W&B config
49OptimizationGradient clip1.0script override
50PPO/GRPOPolicy loss modevanillamethod override
51PPO/GRPOAdvantage estimatorgrpobaseline_grpo.yaml
52PPO/GRPONormalize GRPO advantages by stdFalsebaseline_grpo.yaml / script override
53PPO/GRPOPPO epochs1W&B config
54PPO/GRPOPPO mini batch size8queue/script override
55PPO/GRPOPPO micro batch size per GPU1user.yaml
56PPO/GRPOClip ratio low0.2script override
57PPO/GRPOClip ratio high0.28script override
58PPO/GRPOGamma1.0ppo_trainer.yaml default
59PPO/GRPOLambda1.0ppo_trainer.yaml default
60PPO/GRPOActor KL loss coef0.0method override
61PPO/GRPOUse KL in rewardFalseppo_trainer/user.yaml
62Rollout correctionImportance sampling modetokenscript override
63Rollout correctionIS threshold2.0script override
64FSDP/SystemActor strategyfsdpdp_actor.yaml
65FSDP/SystemFSDP dtypebfloat16W&B config
66FSDP/SystemFSDP model dtypefp32W&B config
67FSDP/SystemUse torch compileTrueW&B config
68FSDP/SystemGPUs per node8queue/script override
69FSDP/SystemNodes1user.yaml
70FSDP/SystemGPU typeNVIDIA H200wandb-metadata
71Checkpoint/LoggingCheckpoint rootcheckpoints/datasets/sciknoweval/physicsscript override
72Checkpoint/LoggingLatest checkpointed iteration100latest_checkpointed_iteration.txt
73Checkpoint/LoggingMax actor checkpoints to keep1user.yaml
74Checkpoint/LoggingLoggerconsole, wandbppo_trainer.yaml
75Checkpoint/LoggingW&B entityseongryongjung-chung-ang-universityenvironment
76Checkpoint/LoggingW&B projectSDPO-rootuser.yaml project_name
77Checkpoint/LoggingW&B groupQWEN3-GRPO-generalizationmethod override