13 lines
298 B
Markdown
13 lines
298 B
Markdown
|
|
---
|
||
|
|
base_model: Qwen/Qwen3-8B
|
||
|
|
library_name: transformers
|
||
|
|
tags:
|
||
|
|
- preference-optimization
|
||
|
|
- ronpo
|
||
|
|
- qwen3
|
||
|
|
---
|
||
|
|
|
||
|
|
# Qwen3-8B fair-demo checkpoint: ronpo_full_expect
|
||
|
|
|
||
|
|
Validation-selected candidate: `ronpo_full_a`. Exact evaluator, selection, sweep, and training metadata are stored under `experiment/`.
|