model_name_or_path: /NHNHOME/WORKSPACE/26msit001_A/BASE/aipr_lab_sjkim_eval/revision_qwen3_8b/full_iter1/cache/huggingface/hub/models--Qwen--Qwen3-8B/snapshots/b968826d9c46dd6066d109eabc6255188de91218 torch_dtype: null attn_implementation: eager dataset_mixer: /NHNHOME/WORKSPACE/26msit001_A/BASE/aipr_lab_sjkim_eval/revision_qwen3_8b/full_iter1/precomputed/full_expect_bestadv_sample1: 1.0 dataset_splits: - train - test preprocessing_num_workers: 12 bf16: true loss_type: ronpo max_history_t: 1 history_weights: [1.0] ronpo_alpha: 1.0 ronpo_tau: 0.05 ronpo_target_column: ronpo_target reference_anchor_weight: 0 preference_sft_weight: 0.005 beta: 10 learning_rate: 5.0000000000e-07 lr_scheduler_type: cosine warmup_ratio: 0.1 optim: adamw_torch weight_decay: 0.0 max_grad_norm: 1.0 seed: 42 gradient_accumulation_steps: 16 gradient_checkpointing: true gradient_checkpointing_kwargs: use_reentrant: false num_train_epochs: 1 max_steps: 75 per_device_train_batch_size: 1 per_device_eval_batch_size: 1 max_length: 2048 max_prompt_length: 1800 do_eval: false eval_strategy: "no" eval_steps: 500 logging_steps: 5 log_level: info generate_during_eval: false metric_for_best_model: eval_loss load_best_model_at_end: false save_strategy: "steps" save_steps: 1000 save_total_limit: 1 save_only_model: true save_safetensors: true push_to_hub: false report_to: - wandb output_dir: /NHNHOME/WORKSPACE/26msit001_A/BASE/aipr_lab_sjkim_eval/revision_qwen3_8b/full_iter1/train/ronpo_full_expect_s42_ronpo-bestadv-20260712-0750-r3-sample1_lr5e7_a1_s75_sft5e3 run_name: rev-q3-ronpo-full_expect-bestadv_sample1-s42-ronpo-bestadv-20260712-0750-r3-sample1_lr5e7_a1_s75_sft5e3