13 lines
277 B
Markdown
13 lines
277 B
Markdown
|
|
---
|
||
|
|
base_model: Qwen/Qwen3-8B
|
||
|
|
library_name: transformers
|
||
|
|
tags:
|
||
|
|
- preference-optimization
|
||
|
|
- ronpo
|
||
|
|
- qwen3
|
||
|
|
---
|
||
|
|
|
||
|
|
# Qwen3-8B fair-demo checkpoint: dpo
|
||
|
|
|
||
|
|
Validation-selected candidate: `dpo_b`. Exact evaluator, selection, sweep, and training metadata are stored under `experiment/`.
|