13 lines
211 B
Markdown
13 lines
211 B
Markdown
|
|
---
|
||
|
|
datasets:
|
||
|
|
- BytedTsinghua-SIA/DAPO-Math-17k
|
||
|
|
base_model:
|
||
|
|
- Qwen/Qwen3-4B
|
||
|
|
---
|
||
|
|
|
||
|
|
Trained on DAPO-Math-17k using GRPO implemented by VeRL.
|
||
|
|
|
||
|
|
- Batch Size: 32
|
||
|
|
- Group Size: 8
|
||
|
|
- Step: 500
|
||
|
|
- Max Response Length: 8192
|