Files
Qwen3-4B-Tooluse-RLSD-TR/results/hyperparameters.csv
ModelHub XC a52fcb1e1d 初始化项目,由ModelHub XC社区提供模型
Model: SeongryongJung/Qwen3-4B-Tooluse-RLSD-TR
Source: Original Platform
2026-08-20 04:49:19 +08:00

2.5 KiB

1sectionparametervaluesource
2Run identityBase modelQwen/Qwen3-4Bqueue/script override
3Run identityDatasetTool-use / tooluserun_qwen3_generalization.sh
4Run identityMethodRLSD_TRrun_qwen3_generalization.sh
5Run identityConfigrlsdrun_qwen3_generalization.sh
6Run identityExperimentqwen3gen-tooluse-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8run_qwen3_generalization.sh
7Run identityW&B runrun-20260702_154716-jrdzd11bwandb
8DataTrain filedatasets/tooluse/train.parquetscript override
9DataValidation filedatasets/tooluse/test.parquetscript override
10DataTrain batch size32queue/script override
11DataTrain max samples3200queue/script override
12ScheduleTotal training steps100queue/script override
13ScheduleValidation before trainFalsequeue/script override
14ScheduleSave frequency10queue/script override
15ScheduleValidation frequency10queue/script override
16SequenceMax prompt length2048queue/script override
17SequenceMax response length8192queue/script override
18SequenceMax model length10240queue/script override
19RolloutTrain rollout n8queue/script override
20RolloutValidation rollout n16queue/script override
21RolloutvLLM GPU memory utilization0.8queue/script override
22OptimizationLearning rate1e-6RLSD_TR method override
23OptimizationWeight decay0.01script override
24PPO/GRPOPPO mini batch size8queue/script override
25PPO/GRPONormalize GRPO advantages by stdFalsebaseline_grpo.yaml / script override
26Rollout correctionImportance sampling modetokenscript override
27Rollout correctionIS threshold2.0script override
28Checkpoint/LoggingCheckpoint rootcheckpoints/datasets/tooluse/qwen3gen-tooluse-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8script override
29Checkpoint/LoggingLatest checkpointed iteration100latest_checkpointed_iteration.txt
30Checkpoint/LoggingExternal actor archivecheckpoints/datasets/tooluse/qwen3gen-tooluse-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/_actor_archivepreserve_actor_checkpoints.py
31Checkpoint/LoggingLoggerconsole, wandbppo_trainer.yaml
32RLSD_TRPolicy loss moderlsdmethod override
33RLSD_TRTeacher regularizationtrust-regionmethod override
34RLSD_TRTrust-region mix / teacher update rate0.1queue/script override
35RLSD_TRToken reweight lambda0.5queue/script override
36RLSD_TRToken reweight eps_w0.2queue/script override
37RLSD_TRToken reweight decay steps0queue/script override
38RLSD_TRFused kernelsFalsemethod override