34 lines
906 B
Markdown
34 lines
906 B
Markdown
|
|
---
|
||
|
|
base_model: Qwen/Qwen3-4B-Instruct-2507
|
||
|
|
language:
|
||
|
|
- en
|
||
|
|
license: apache-2.0
|
||
|
|
library_name: transformers
|
||
|
|
pipeline_tag: text-generation
|
||
|
|
tags:
|
||
|
|
- sft
|
||
|
|
- merged
|
||
|
|
- qwen
|
||
|
|
- structured-output
|
||
|
|
---
|
||
|
|
|
||
|
|
# qwen3-4b-structeval-sft-v4-lr2e5-merged
|
||
|
|
|
||
|
|
SFT LoRA adapter (`sonodd/qwen3-4b-structeval-sft-v4-lr2e5`) をベースモデル (`Qwen/Qwen3-4B-Instruct-2507`) にマージしたフルモデルです。
|
||
|
|
|
||
|
|
## 用途
|
||
|
|
|
||
|
|
DPO ノートブックの `DPO_BASE_MODEL` に指定して **SFT → DPO パイプライン** を実行するために使用します。
|
||
|
|
|
||
|
|
```python
|
||
|
|
# DPO ノートブック cell-10
|
||
|
|
os.environ["DPO_BASE_MODEL"] = "sonodd/qwen3-4b-structeval-sft-v4-lr2e5-merged"
|
||
|
|
os.environ["DPO_SFT_ADAPTER_ID"] = "" # マージ済みなので空
|
||
|
|
```
|
||
|
|
|
||
|
|
## 構成
|
||
|
|
|
||
|
|
- **Base model**: Qwen/Qwen3-4B-Instruct-2507
|
||
|
|
- **SFT adapter**: sonodd/qwen3-4b-structeval-sft-v4-lr2e5
|
||
|
|
- **Merge method**: merge_and_unload() (float16)
|