model_name_or_path: /data/mnpo/cache/qwen3_rev_smoke/transformers/models--Qwen--Qwen3-8B/snapshots/b968826d9c46dd6066d109eabc6255188de91218 torch_dtype: null attn_implementation: eager dataset_mixer: /data/mnpo/revision_qwen3_8b/full_iter1/precomputed/avg_oracle: 1.0 dataset_splits: - train - test preprocessing_num_workers: 12 bf16: true loss_type: simpo dpo_beta: 0.05 simpo_beta: 2.5 simpo_gamma: 1.0 eta: 0.0075 ratio: 0.3333 max_history_t: 1 history_weights: [1.0] beta: 10 learning_rate: 5.0e-7 lr_scheduler_type: cosine warmup_ratio: 0.1 optim: adamw_torch weight_decay: 0.0 seed: 42 gradient_accumulation_steps: 8 gradient_checkpointing: true gradient_checkpointing_kwargs: use_reentrant: false num_train_epochs: 1 per_device_train_batch_size: 2 per_device_eval_batch_size: 2 max_length: 2048 max_prompt_length: 1800 do_eval: true eval_strategy: steps eval_steps: 500 logging_steps: 10 log_level: info generate_during_eval: false metric_for_best_model: eval_loss load_best_model_at_end: false save_strategy: steps save_steps: 1000 save_total_limit: 1 save_only_model: true save_safetensors: true push_to_hub: false report_to: - wandb output_dir: /data/mnpo/revision_qwen3_8b/full_iter1/train/simpo_avg_b2p5_g1p0_s42_h200 run_name: rev-q3-simpo-b2p5_g1p0-s42