Files
Qwen3-4B-Chemical-RLSD-TR/results/hyperparameters.csv
ModelHub XC 110a0a7a0c 初始化项目,由ModelHub XC社区提供模型
Model: SeongryongJung/Qwen3-4B-Chemical-RLSD-TR
Source: Original Platform
2026-08-14 23:14:45 +08:00

4.7 KiB

1sectionparametervaluesource
2Run identityBase modelQwen/Qwen3-4Bqueue/script override
3Run identityDatasetChemical / SciKnowEval chemistryrun_qwen3_generalization.sh
4Run identityMethodRLSD_TRrun_qwen3_generalization.sh
5Run identityConfigrlsdrun_qwen3_generalization.sh
6Run identityExperimentqwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8run_qwen3_generalization.sh
7Run identityW&B runrun-20260702_062054-bz6p2yxywandb
8DataTrain filedatasets/sciknoweval/chemistry/train.parquetscript override
9DataValidation filedatasets/sciknoweval/chemistry/test.parquetscript override
10DataTrain batch size32queue/script override
11DataTrain max samples3200queue/script override
12DataPrompt keypromptlegacy_data.yaml default
13DataReward keydata_sourcelegacy_data.yaml default
14DataShuffle train dataTrueuser.yaml / legacy_data.yaml
15DataValidation shuffleFalselegacy_data.yaml default
16DataFilter overlong promptsTrueuser.yaml
17DataPrompt truncationerrorlegacy_data.yaml default
18Dataenable_thinkingfalsescript override
19ScheduleTotal training steps100queue/script override
20ScheduleTotal epochs30ppo_trainer/user.yaml default
21ScheduleValidation before trainFalsequeue/script override
22ScheduleSave frequency10queue/script override
23ScheduleValidation frequency10queue/script override
24SequenceMax prompt length2048queue/script override
25SequenceMax response length8192queue/script override
26SequenceMax model length10240queue/script override
27SequenceActor max token length per GPU10240queue/script override
28RolloutRollout enginevllmuser.yaml
29RolloutRollout dtypebfloat16rollout.yaml default
30RolloutTrain rollout n8queue/script override
31RolloutTrain rollout temperature1.0script override
32RolloutTrain rollout top_p1.0script override
33RolloutTrain rollout do_sampleTruerollout.yaml default
34RolloutCalculate rollout log probsTruerlsd.yaml / script override
35RolloutMax num batched tokens10240queue/script override
36RolloutvLLM GPU memory utilization0.8queue/script override
37RolloutTensor model parallel size2rollout.yaml default
38RolloutFree cache engineTruerollout.yaml default
39ValidationValidation rollout n16queue/script override
40ValidationValidation temperature0.6queue/script override
41ValidationValidation top_p0.95queue/script override
42ValidationValidation do_sampleTruequeue/script override
43OptimizationOptimizerAdamWfsdp optimizer config
44OptimizationLearning rate1e-6RLSD_TR method override
45OptimizationLR schedulerconstantW&B config
46OptimizationLR warmup steps10script override
47OptimizationWeight decay0.01script override
48OptimizationBetas(0.9, 0.999)W&B config
49OptimizationGradient clip1.0script override
50PPO/GRPOAdvantage estimatorgrporlsd.yaml
51PPO/GRPONormalize GRPO advantages by stdFalsescript override
52PPO/GRPOPPO epochs1W&B config
53PPO/GRPOPPO mini batch size8queue/script override
54PPO/GRPOPPO micro batch size per GPU1user.yaml
55PPO/GRPOClip ratio low0.2script override
56PPO/GRPOClip ratio high0.28script override
57PPO/GRPOGamma1.0ppo_trainer.yaml default
58PPO/GRPOLambda1.0ppo_trainer.yaml default
59PPO/GRPOUse KL in rewardFalseppo_trainer/user.yaml
60PPO/GRPOActor KL loss observed0.0output.log
61Rollout correctionImportance sampling modetokenscript override
62Rollout correctionIS threshold2.0script override
63RLSD_TRPolicy loss moderlsdmethod override
64RLSD_TRTeacher regularizationtrust-regionmethod override
65RLSD_TRTrust-region mix / teacher update rate0.1queue/script override
66RLSD_TRToken reweight lambda0.5queue/script override
67RLSD_TRToken reweight eps_w0.2queue/script override
68RLSD_TRToken reweight decay steps0queue/script override
69RLSD_TRMax reprompt length10240method override
70RLSD_TRFused kernelsFalsemethod override
71FSDP/SystemActor strategyfsdpdp_actor.yaml
72FSDP/SystemFSDP dtypebfloat16W&B config
73FSDP/SystemFSDP model dtypefp32W&B config
74FSDP/SystemUse torch compileTrueW&B config
75FSDP/SystemGPUs per node8queue/script override
76FSDP/SystemNodes1user.yaml
77FSDP/SystemGPU typeNVIDIA H200wandb-metadata
78Checkpoint/LoggingCheckpoint rootcheckpoints/datasets/sciknoweval/chemistryscript override
79Checkpoint/LoggingLatest checkpointed iteration100latest_checkpointed_iteration.txt
80Checkpoint/LoggingMax actor checkpoints to keep1user.yaml
81Checkpoint/LoggingLoggerconsole, wandbppo_trainer.yaml
82Checkpoint/LoggingW&B entityseongryongjung-chung-ang-universityenvironment
83Checkpoint/LoggingW&B projectSDPO-rootuser.yaml project_name
84Checkpoint/LoggingW&B groupQWEN3-RLSD-TR-GRPO-matched-generalizationmethod override