library_name, tags, datasets, base_model
library_name tags datasets base_model
transformers
trl
dpo
argilla/ultrafeedback-binarized-preferences
Qwen/Qwen3-4B-Instruct-2507

Qwen3-4B-Instruct-2507 aligned using DPO on the argilla/ultrafeedback-binarized-preferences

Description
Model synced from source: MInAlA/Qwen3-4B-Instruct-2507-DPO-merged
Readme 26 KiB
Languages
Jinja 100%