--- base_model: Qwen/Qwen3-8B library_name: transformers tags: - preference-optimization - ronpo - qwen3 --- # Qwen3-8B fair-demo checkpoint: ronpo_full_expect Validation-selected candidate: `ronpo_full_a`. Exact evaluator, selection, sweep, and training metadata are stored under `experiment/`.