model_name_or_path: /NHNHOME/WORKSPACE/26msit001_A/mnpo/revision_qwen3_8b/full_iter1/cache/huggingface/hub/models--Qwen--Qwen3-8B/snapshots/b968826d9c46dd6066d109eabc6255188de91218 torch_dtype: null attn_implementation: eager dataset_mixer: /NHNHOME/WORKSPACE/26msit001_A/mnpo/revision_qwen3_8b/full_iter1/precomputed/avg_oracle: 1.0 dataset_splits: - train - test preprocessing_num_workers: 12 bf16: true loss_type: ipo dpo_beta: 0.01 simpo_beta: 2.5 simpo_gamma: 1.0 eta: 0.0075 ratio: 0.3333 max_history_t: 1 history_weights: [1.0] beta: 10 learning_rate: 5.0e-7 lr_scheduler_type: cosine warmup_ratio: 0.1 optim: adamw_torch weight_decay: 0.0 seed: 42 gradient_accumulation_steps: 16 gradient_checkpointing: true gradient_checkpointing_kwargs: use_reentrant: false num_train_epochs: 1 per_device_train_batch_size: 1 per_device_eval_batch_size: 1 max_length: 2048 max_prompt_length: 1800 do_eval: true eval_strategy: "steps" eval_steps: 500 logging_steps: 10 log_level: info generate_during_eval: false metric_for_best_model: eval_loss load_best_model_at_end: false save_strategy: "steps" save_steps: 1000 save_total_limit: 1 save_only_model: true save_safetensors: true push_to_hub: false report_to: - wandb output_dir: /NHNHOME/WORKSPACE/26msit001_A/mnpo/revision_qwen3_8b/full_iter1/train/ipo_avg_beta0p01_s42_nhn-b200-q3-seq-07101430-ipo run_name: rev-q3-ipo-b0p01-s42-nhn-b200-q3-seq-07101430-ipo