13 lines
283 B
Markdown
13 lines
283 B
Markdown
---
|
|
base_model: Qwen/Qwen3-8B
|
|
library_name: transformers
|
|
tags:
|
|
- preference-optimization
|
|
- ronpo
|
|
- qwen3
|
|
---
|
|
|
|
# Qwen3-8B fair-demo checkpoint: inpo_avg
|
|
|
|
Validation-selected candidate: `inpo_b`. Exact evaluator, selection, sweep, and training metadata are stored under `experiment/`.
|