Files
Qwen3-8B-Chemistry-RLSD-TR/results/hyperparameters.csv
ModelHub XC d3719d800b 初始化项目,由ModelHub XC社区提供模型
Model: SeongryongJung/Qwen3-8B-Chemistry-RLSD-TR
Source: Original Platform
2026-07-21 17:57:12 +08:00

2.6 KiB

1sectionparametervaluesource
2Run identityBase modelQwen/Qwen3-8Bqueue/script override
3Run identityDatasetChemistry / SciKnowEval chemistryrun_qwen3_generalization.sh
4Run identityMethodRLSD_TRrun_qwen3_generalization.sh
5Run identityConfigrlsdrun_qwen3_generalization.sh
6Run identityExperimentqwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8run_qwen3_generalization.sh
7Run identityW&B runrun-20260703_014331-zs3h1j56wandb
8DataTrain filedatasets/sciknoweval/chemistry/train.parquetscript override
9DataValidation filedatasets/sciknoweval/chemistry/test.parquetscript override
10DataTrain batch size32queue/script override
11DataTrain max samples3200queue/script override
12ScheduleTotal training steps100queue/script override
13ScheduleValidation before trainFalsequeue/script override
14ScheduleSave frequency10queue/script override
15ScheduleValidation frequency10queue/script override
16SequenceMax prompt length2048queue/script override
17SequenceMax response length8192queue/script override
18SequenceMax model length10240queue/script override
19RolloutTrain rollout n8queue/script override
20RolloutValidation rollout n16queue/script override
21RolloutvLLM GPU memory utilization0.8queue/script override
22OptimizationLearning rate1e-6RLSD_TR method override
23OptimizationWeight decay0.01script override
24PPO/GRPOPPO mini batch size8queue/script override
25PPO/GRPONormalize GRPO advantages by stdFalsebaseline_grpo.yaml / script override
26Rollout correctionImportance sampling modetokenscript override
27Rollout correctionIS threshold2.0script override
28Checkpoint/LoggingCheckpoint rootcheckpoints/datasets/sciknoweval/chemistry/qwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8script override
29Checkpoint/LoggingLatest checkpointed iteration100latest_checkpointed_iteration.txt
30Checkpoint/LoggingExternal actor archivecheckpoints/datasets/sciknoweval/chemistry/qwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archivepreserve_actor_checkpoints.py
31Checkpoint/LoggingLoggerconsole, wandbppo_trainer.yaml
32RLSD_TRPolicy loss moderlsdmethod override
33RLSD_TRTeacher regularizationtrust-regionmethod override
34RLSD_TRTrust-region mix / teacher update rate0.1queue/script override
35RLSD_TRToken reweight lambda0.5queue/script override
36RLSD_TRToken reweight eps_w0.2queue/script override
37RLSD_TRToken reweight decay steps0queue/script override
38RLSD_TRFused kernelsFalsemethod override