--- library_name: transformers base_model: Qwen/Qwen3-8B tags: - ronpo - mnpo - qwen3 - preference-optimization --- # qwen3-8b-ronpo-full-expect-s42 Research checkpoint for the RONPO AAAI revision experiments. - Method: RONPO-full-expect-best-vs-adversary - Base model: `Qwen/Qwen3-8B` with non-thinking generation protocol - Seed: 42 - Local source at upload time: `/NHNHOME/WORKSPACE/26msit001_A/BASE/aipr_lab_sjkim_eval/revision_qwen3_8b/full_iter1/train/ronpo_full_expect_s42_ronpo-bestadv-20260712-0750-r3-sample1_lr5e7_a1_s75_sft5e3` - Uploaded at UTC: 2026-07-12T01:30:33Z - Run status metadata: `{"adversary_selection": "sample", "completed_at": "2026-07-11T23:03:13Z", "config": "/NHNHOME/WORKSPACE/26msit001_A/BASE/aipr_lab_sjkim_eval/revision_qwen3_8b/full_iter1/train/ronpo_full_expect_s42_ronpo-bestadv-20260712-0750-r3-sample1_lr5e7_a1_s75_sft5e3/config.yaml", "dataset": "/NHNHOME/WORKSPACE/26msit001_A/BASE/aipr_lab_sjkim_eval/revision_qwen3_8b/full_iter1/precomputed/full_expect_bestadv_sample1", "method": "ronpo-ablation", "mode": "full_expect", "output_dir": "/NHNHOME/WORKSPACE/26msit001_A/BASE/aipr_lab_sjkim_eval/revision_qwen3_8b/full_iter1/train/ronpo_full_expect_s42_ronpo-bestadv-20260712-0750-r3-sample1_lr5e7_a1_s75_sft5e3", "pair_variant": "bestadv_sample1", "pairs": "/NHNHOME/WORKSPACE/26msit001_A/BASE/aipr_lab_sjkim_eval/revision_qwen3_8b/full_iter1/pairs/full_expect_bestadv_sample1", "returncode": 0, "ronpo_policy_pair_mode": "best_vs_adversary", "seed": 42, "source_dataset": "/NHNHOME/WORKSPACE/26msit001_A/BASE/aipr_lab_sjkim_eval/revision_qwen3_8b/full_iter1/precomputed/avg_oracle", "status": "completed", "train_metrics_exists": true, "trainer_state_exists": true}` Qwen3-8B-scale-up-IFEval-diagnostic-541-prompts Intended use: reproducibility and evaluation for the RONPO paper. This checkpoint is not intended as a production assistant.