Files
Ordis-1.5B-V355-VarGH/README.md
ModelHub XC 1294cbf1d2 初始化项目,由ModelHub XC社区提供模型
Model: sugiken/Ordis-1.5B-V355-VarGH
Source: Original Platform
2026-08-25 09:39:15 +08:00

142 lines
4.8 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
license: apache-2.0
language:
- zh
- en
base_model: Qwen/Qwen2.5-1.5B-Instruct
tags:
- anti-hallucination
- causal-reasoning
- chinese
- text-generation
- lora
pipeline_tag: text-generation
---
# Ordis-1.5B-V355-VarGH
基于 Qwen2.5-1.5B-Instruct 的微调模型,使用 LoRA + 4阶段递进训练 (PIT) 方法,经历 16+ 组控制变量实验。专注于**实用能力**:反幻觉、诚实拒答("我不知道")、结构化推理。
> [官网](https://ordisai.com) | [GGUF 量化版](https://modelscope.cn/models/sugiken/Ordis-1.5B-V355-VarGH-GGUF) | [HuggingFace](https://huggingface.co/sugiken/Ordis-1.5B-V355-VarGH)
---
## 标准评测
**评测条件**: lm-eval v0.4.10, 0-shot, A100-80GB两个模型使用完全相同的评测设置。
微调引入了轻微的**对齐税** — 大部分标准评测分数略低于基座模型。这是预期内的结果:模型获得了反幻觉、结构化推理和诚实拒答能力,消耗了部分 1.5B 参数容量。唯一的例外是 TruthfulQA (+1.02%),反幻觉训练直接提升了真实性分数。
| 评测 | Ordis 1.5B | 基座 Qwen2.5-1.5B | 差值 |
|------|-----------|-------------------|------|
| TruthfulQA MC2 | **47.73%** | 46.71% | **+1.02** |
| GPQA | 27.90% | 28.35% | -0.45 |
| HellaSwag | 68.14% | 68.22% | -0.08 |
| ARC-Challenge | 45.22% | 46.84% | -1.62 |
| MMLU | 57.93% | 60.15% | -2.22 |
| GSM8K (CoT) | 50.80% | — | 不可直接对比* |
| AIME 2024 | 0% | 0% | — |
*GSM8K 使用文本生成模式,对 chat template 配置敏感不直接可比。AIME 超出 1.5B 模型能力范围,如实报告零分。
**Ordis 与基座模型的差异**在于标准评测无法衡量的实用能力:结构化自纠错、三层认知(诚实说"我不知道")、因果推理。
---
## CLadder 因果推理
CLadder 是基于 Judea Pearl 因果阶梯的学术评测300题3个层级。[论文](https://arxiv.org/abs/2312.04350)
| 层级 | 含义 | 得分 |
|------|------|------|
| Rung 1 (关联) | 统计相关 | 46.0% (40/87) |
| Rung 2 (干预) | 主动干预 | 50.6% (45/89) |
| Rung 3 (反事实) | "如果不同" | 62.9% (78/124) |
| **总分** | | **54.33% (163/300)** |
参考CLadder 论文报告 LLaMA-6.7B 约 50%GPT-3.5 约 55-60%。
---
## BigBench CRASS AI & 因果判断
由社区成员独立测试。BigBench CRASS AI反事实场景推理测试模型对假设性场景的推理能力。
| 评测 | Shot | Ordis 1.5B | 基座 Qwen2.5-1.5B | 差值 |
|------|------|-----------|-------------------|------|
| **CRASS AI** | **0** | **34.09%** | **52.27%** | **-18.18pp** |
| CRASS AI | 25 | 81.82% | 88.64% | -6.82pp |
| 因果判断 | 0 | 47.89% | 50.00% | -2.11pp |
| 因果判断 | 25 | 55.79% | 53.68% | +2.11pp |
**关键发现**CRASS AI 0-shot 出现显著的 -18.18pp 回退。这是对齐税在反事实推理维度的体现——反幻觉训练使模型在假设性场景下变得保守。25-shot 下差距缩小到 -6.82pp,说明能力仍在但 0-shot 默认行为已改变。
## 自定义评测
| 评测 | 得分 |
|------|------|
| 60题评测 (6个维度) | 85.0% (51/60) |
| 124分综合评测 | 75.4% (86/114) |
**60题维度拆分**
| 维度 | 得分 |
|------|------|
| 推理 | 100% |
| 常识 | 100% |
| 防御过载 | 100% |
| 反幻觉 | 90% |
| 身份 | 60% |
| IDK能力 | 60% |
---
## 核心能力
- **反幻觉**:基于推理的不确定性判断,而非安全模板
- **三层认知**:知道什么/不知道什么/先评估再决定
- **结构化自纠错**:承认→归因→修正→验证
- **因果推理**:跨领域因果结构迁移
---
## 已知局限
- **对齐税**标准评测分数略低于基座模型CRASS AI 反事实推理 0-shot -18.18pp(见上表)
- **反灌输不足**:无法抵抗持续的虚假记忆注入(开环系统限制)
- **中等置信度不稳定**1.5B 容量上限导致边界场景不确定
- **英文身份泄漏**:基座模型先验偶尔浮现
- **专有名词幻觉**1.5B 参数记忆有限
---
## 使用方法
本仓库包含 LoRA adapter 权重:
```python
from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import PeftModel
base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-1.5B-Instruct")
model = PeftModel.from_pretrained(base_model, "sugiken/Ordis-1.5B-V355-VarGH")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-1.5B-Instruct")
```
推荐使用 [GGUF 量化版](https://modelscope.cn/models/sugiken/Ordis-1.5B-V355-VarGH-GGUF) 部署。
---
## 模型信息
| 属性 | 值 |
|------|-----|
| 基座模型 | Qwen/Qwen2.5-1.5B-Instruct |
| 参数量 | 1.5B |
| 微调方法 | LoRA (r=32, alpha=64) |
| 训练方法 | 4阶段PIT (递进身份训练) |
| 上下文 | 32K (基座), 训练时 2048 |
| 语言 | 中文 (主要), 英文 |
| 许可证 | Apache 2.0 |