Model: hkr04/qwen3-4b-grpo-dapo17k-invmax-linear Source: Original Platform
datasets, base_model
| datasets | base_model | ||
|---|---|---|---|
|
|
Trained on DAPO-Math-17k using GRPO implemented by VeRL.
- Batch Size: 32
- Group Size: 8
- Step: 500
- Max Response Length: 8192
Description
Languages
Jinja
100%