22 lines
390 B
Markdown
22 lines
390 B
Markdown
---
|
|
base_model: taketakedaiki/qwen3-4b-v2-exp25
|
|
datasets:
|
|
- u-10bei/dpo-dataset-qwen-cot
|
|
language:
|
|
- en
|
|
license: apache-2.0
|
|
library_name: transformers
|
|
pipeline_tag: text-generation
|
|
tags:
|
|
- dpo
|
|
- unsloth
|
|
- qwen
|
|
---
|
|
|
|
# Exp26 DPO (based on Exp25 SFT)
|
|
|
|
DPO fine-tuned from Exp25 SFT model.
|
|
- Base: taketakedaiki/qwen3-4b-v2-exp25
|
|
- Method: DPO, lr=1e-7, beta=0.1, 1 epoch
|
|
- LoRA: r=8, alpha=16
|