base_model, datasets, language, license, library_name, pipeline_tag, tags
base_model datasets language license library_name pipeline_tag tags
taketakedaiki/qwen3-4b-v2-exp25
u-10bei/dpo-dataset-qwen-cot
en
apache-2.0 transformers text-generation
dpo
unsloth
qwen

Exp26 DPO (based on Exp25 SFT)

DPO fine-tuned from Exp25 SFT model.

  • Base: taketakedaiki/qwen3-4b-v2-exp25
  • Method: DPO, lr=1e-7, beta=0.1, 1 epoch
  • LoRA: r=8, alpha=16
Description
Model synced from source: taketakedaiki/qwen3-4b-v2-exp26-dpo
Readme 13 MiB
Languages
Jinja 100%