license, library_name, pipeline_tag, tags, base_model
license
library_name
pipeline_tag
tags
base_model
apache-2.0
transformers
text-generation
qwen3
reinforcement-learning
grpo
text-generation
Qwen/Qwen3-8B
Qwen3-8B-Chemistry-GRPO-TR
This repository contains the Qwen3-8B chemistry GRPO batch-size-32 run. The repository name uses the project GRPO-TR naming convention, but the actual training method for this checkpoint is GRPO.
The repository root contains the best validation checkpoint, selected by validation mean@16. checkpoints/last/ contains the final checkpoint.
Performance
Dataset
Method
Base model
Train batch size
Best val mean@16
Best checkpoint
Final val mean@16
Final checkpoint
Chemistry / SciKnowEval chemistry
GRPO
Qwen3-8B
32
69.02%
100
69.02%
100
Validation Mean@16
step
val_mean16
percent
10
0.424107142857
42.41%
20
0.483928571429
48.39%
30
0.549404761905
54.94%
40
0.605357142857
60.54%
50
0.622321428571
62.23%
60
0.658928571429
65.89%
70
0.671428571429
67.14%
80
0.678273809524
67.83%
90
0.681547619048
68.15%
100
0.690178571429
69.02%
Detailed Training Hyperparameters
Section
Parameter
Value
Source
Run identity
Base model
Qwen/Qwen3-8B
queue/script override
Run identity
Dataset
Chemistry / SciKnowEval chemistry
run_qwen3_generalization.sh
Run identity
Method
GRPO
run_qwen3_generalization.sh
Run identity
Config
baseline_grpo
run_qwen3_generalization.sh
Run identity
Experiment
qwen3gen-chemistry-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8
run_qwen3_generalization.sh
Run identity
W&B run
run-20260702_235814-ffovp19e
wandb
Data
Train file
datasets/sciknoweval/chemistry/train.parquet
script override
Data
Validation file
datasets/sciknoweval/chemistry/test.parquet
script override
Data
Train batch size
32
queue/script override
Data
Train max samples
3200
queue/script override
Schedule
Total training steps
100
queue/script override
Schedule
Validation before train
False
queue/script override
Schedule
Save frequency
10
queue/script override
Schedule
Validation frequency
10
queue/script override
Sequence
Max prompt length
2048
queue/script override
Sequence
Max response length
8192
queue/script override
Sequence
Max model length
10240
queue/script override
Rollout
Train rollout n
8
queue/script override
Rollout
Validation rollout n
16
queue/script override
Rollout
vLLM GPU memory utilization
0.8
queue/script override
Optimization
Learning rate
1e-6
GRPO method override
Optimization
Weight decay
0.01
script override
PPO/GRPO
PPO mini batch size
8
queue/script override
PPO/GRPO
Normalize GRPO advantages by std
False
baseline_grpo.yaml / script override
Rollout correction
Importance sampling mode
token
script override
Rollout correction
IS threshold
2.0
script override
Checkpoint/Logging
Checkpoint root
checkpoints/datasets/sciknoweval/chemistry/qwen3gen-chemistry-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8
script override
Checkpoint/Logging
Latest checkpointed iteration
100
latest_checkpointed_iteration.txt
Checkpoint/Logging
External actor archive
checkpoints/datasets/sciknoweval/chemistry/qwen3gen-chemistry-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8/_actor_archive
preserve_actor_checkpoints.py
Checkpoint/Logging
Logger
console, wandb
ppo_trainer.yaml
PPO/GRPO
Policy loss mode
vanilla
method override
PPO/GRPO
Actor KL loss coef
0.0
method override
Raw result and artifact files:
results/validation_mean16.csv
results/training_scores.csv
results/hyperparameters.csv
results/training_score.png
results/training_score.svg
artifacts/output.log
artifacts/queue.log
Usage
Source
Checkpoint: checkpoints/datasets/sciknoweval/chemistry/qwen3gen-chemistry-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8
Root actor checkpoint: checkpoints/datasets/sciknoweval/chemistry/qwen3gen-chemistry-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor
Last actor checkpoint: checkpoints/datasets/sciknoweval/chemistry/qwen3gen-chemistry-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor
W&B run: run-20260702_235814-ffovp19e
Queue log: artifacts/queue.log