初始化项目,由ModelHub XC社区提供模型

Model: RLHFlow/Qwen2.5-Math-7B-Zero-Reinforce-Rej
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-09-06 07:32:13 +08:00
commit 29fcc42822
16 changed files with 152115 additions and 0 deletions

17
README.md Normal file
View File

@@ -0,0 +1,17 @@
---
library_name: transformers
tags: []
---
## Reinforce-Rej baseline from `Qwen-Math-7B-base`.
If you found useful, please consider cite,
```
@inproceedings{Xiong2025AMA,
title={A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce},
author={Wei Xiong and Jiarui Yao and Yuhui Xu and Bo Pang and Lei Wang and Doyen Sahoo and Junnan Li and Nan Jiang and Tong Zhang and Caiming Xiong and Hanze Dong},
journal={arXiv preprint arXiv:2504.11343},
year={2025},
}
```