ModelHub XC 1df86c61f0 初始化项目,由ModelHub XC社区提供模型
Model: heli-stand/Qwen2.5-7B-hh-rlhf-sft
Source: Original Platform
2026-08-24 07:39:16 +08:00

library_name, tags
library_name tags
transformers
qwen2.5
hh-rlhf

Model Card for SFT Model Fine-tuned on hh-rlhf Dataset from Qwen2.5-7B

This model is supervised fine-tuned from Qwen2.5-7B based on the anthropic helpfulness-harmlessness rlhf datasets.

Model Sources

Training Procedure

Training Data

Training Hyperparameters

  • Optimizer: Adamw
  • Learning Rate: 1e-5
  • Batch Size: 128
  • Epochs: 1
  • Max_Length: 1024

Evaluation Results

  • Best Evaluation Loss: 1.678
Description
Model synced from source: heli-stand/Qwen2.5-7B-hh-rlhf-sft
Readme 2 MiB