license, library_name, pipeline_tag, tags, base_model
license
library_name
pipeline_tag
tags
base_model
apache-2.0
transformers
text-generation
qwen3
reinforcement-learning
grpo
text-generation
Qwen/Qwen3-8B
Qwen3-8B-Biology-GRPO-TR
This repository contains the Qwen3-8B biology GRPO batch-size-32 run. The repository name uses the project GRPO-TR naming convention, but the actual training method for this checkpoint is GRPO.
The repository root contains the best validation checkpoint, selected by validation mean@16. checkpoints/last/ contains the final checkpoint.
Performance
Dataset
Method
Base model
Train batch size
Best val mean@16
Best checkpoint
Final val mean@16
Final checkpoint
Biology / SciKnowEval biology
GRPO
Qwen3-8B
32
50.38%
90
49.88%
100
Validation Mean@16
step
val_mean16
percent
10
0.305000000000
30.50%
20
0.298750000000
29.88%
30
0.411250000000
41.12%
40
0.391250000000
39.12%
50
0.376250000000
37.62%
60
0.475000000000
47.50%
70
0.460000000000
46.00%
80
0.487500000000
48.75%
90
0.503750000000
50.38%
100
0.498750000000
49.88%
Detailed Training Hyperparameters
Section
Parameter
Value
Source
Run identity
Base model
Qwen/Qwen3-8B
queue/script override
Run identity
Dataset
Biology / SciKnowEval biology
run_qwen3_generalization.sh
Run identity
Method
GRPO
run_qwen3_generalization.sh
Run identity
Config
baseline_grpo
run_qwen3_generalization.sh
Run identity
Experiment
qwen3gen-biology-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8
run_qwen3_generalization.sh
Run identity
W&B run
run-20260703_072949-j4sb7trr
wandb
Data
Train file
datasets/sciknoweval/biology/train.parquet
script override
Data
Validation file
datasets/sciknoweval/biology/test.parquet
script override
Data
Train batch size
32
queue/script override
Data
Train max samples
3200
queue/script override
Schedule
Total training steps
100
queue/script override
Schedule
Validation before train
False
queue/script override
Schedule
Save frequency
10
queue/script override
Schedule
Validation frequency
10
queue/script override
Sequence
Max prompt length
2048
queue/script override
Sequence
Max response length
8192
queue/script override
Sequence
Max model length
10240
queue/script override
Rollout
Train rollout n
8
queue/script override
Rollout
Validation rollout n
16
queue/script override
Rollout
vLLM GPU memory utilization
0.8
queue/script override
Optimization
Learning rate
1e-6
GRPO method override
Optimization
Weight decay
0.01
script override
PPO/GRPO
PPO mini batch size
8
queue/script override
PPO/GRPO
Normalize GRPO advantages by std
False
baseline_grpo.yaml / script override
Rollout correction
Importance sampling mode
token
script override
Rollout correction
IS threshold
2.0
script override
Checkpoint/Logging
Checkpoint root
checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8
script override
Checkpoint/Logging
Latest checkpointed iteration
100
latest_checkpointed_iteration.txt
Checkpoint/Logging
External actor archive
checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8/_actor_archive
preserve_actor_checkpoints.py
Checkpoint/Logging
Logger
console, wandb
ppo_trainer.yaml
PPO/GRPO
Policy loss mode
vanilla
method override
PPO/GRPO
Actor KL loss coef
0.0
method override
Raw result and artifact files:
results/validation_mean16.csv
results/training_scores.csv
results/hyperparameters.csv
results/training_score.png
results/training_score.svg
artifacts/output.log
artifacts/queue.log
Usage
Source
Checkpoint: checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8
Root actor checkpoint: checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8/global_step_90/actor
Last actor checkpoint: checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor
W&B run: run-20260703_072949-j4sb7trr
Queue log: artifacts/queue.log