54 lines
1.4 KiB
YAML
54 lines
1.4 KiB
YAML
model_name_or_path: /NHNHOME/WORKSPACE/26msit001_A/mnpo/revision_qwen3_8b/full_iter1/cache/huggingface/hub/models--Qwen--Qwen3-8B/snapshots/b968826d9c46dd6066d109eabc6255188de91218
|
|
torch_dtype: null
|
|
attn_implementation: eager
|
|
dataset_mixer:
|
|
/NHNHOME/WORKSPACE/26msit001_A/mnpo/revision_qwen3_8b/full_iter1/precomputed/avg_oracle: 1.0
|
|
dataset_splits:
|
|
- train
|
|
- test
|
|
preprocessing_num_workers: 12
|
|
bf16: true
|
|
loss_type: ipo
|
|
dpo_beta: 0.01
|
|
simpo_beta: 2.5
|
|
simpo_gamma: 1.0
|
|
eta: 0.0075
|
|
ratio: 0.3333
|
|
max_history_t: 1
|
|
history_weights: [1.0]
|
|
beta: 10
|
|
learning_rate: 5.0e-7
|
|
lr_scheduler_type: cosine
|
|
warmup_ratio: 0.1
|
|
optim: adamw_torch
|
|
weight_decay: 0.0
|
|
seed: 42
|
|
gradient_accumulation_steps: 16
|
|
gradient_checkpointing: true
|
|
gradient_checkpointing_kwargs:
|
|
use_reentrant: false
|
|
num_train_epochs: 1
|
|
|
|
per_device_train_batch_size: 1
|
|
per_device_eval_batch_size: 1
|
|
max_length: 2048
|
|
max_prompt_length: 1800
|
|
do_eval: true
|
|
eval_strategy: "steps"
|
|
eval_steps: 500
|
|
logging_steps: 10
|
|
log_level: info
|
|
generate_during_eval: false
|
|
metric_for_best_model: eval_loss
|
|
load_best_model_at_end: false
|
|
save_strategy: "steps"
|
|
save_steps: 1000
|
|
save_total_limit: 1
|
|
save_only_model: true
|
|
save_safetensors: true
|
|
push_to_hub: false
|
|
report_to:
|
|
- wandb
|
|
output_dir: /NHNHOME/WORKSPACE/26msit001_A/mnpo/revision_qwen3_8b/full_iter1/train/ipo_avg_beta0p01_s42_nhn-b200-q3-seq-07101430-ipo
|
|
run_name: rev-q3-ipo-b0p01-s42-nhn-b200-q3-seq-07101430-ipo
|