Files
Ordis-1.5B-V355-VarGH-GGUF/README.md
ModelHub XC 55dfbebc7f 初始化项目,由ModelHub XC社区提供模型
Model: sugiken/Ordis-1.5B-V355-VarGH-GGUF
Source: Original Platform
2026-09-05 04:50:13 +08:00

147 lines
4.9 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
license: apache-2.0
language:
- zh
- en
base_model: Qwen/Qwen2.5-1.5B-Instruct
tags:
- gguf
- ollama
- llama-cpp
- anti-hallucination
- causal-reasoning
- chinese
- text-generation
pipeline_tag: text-generation
---
# Ordis-1.5B-V355-VarGH-GGUF
[Ordis-1.5B-V355-VarGH](https://modelscope.cn/models/sugiken/Ordis-1.5B-V355-VarGH) 的 GGUF 量化版本,提供 7 种量化格式。
Ordis 是基于 Qwen2.5-1.5B-Instruct 的微调模型,使用 LoRA + 4阶段递进训练 (PIT) 方法,经历 16+ 组控制变量实验。专注于**实用能力**:反幻觉、诚实拒答("我不知道")、结构化推理。
> [官网](https://ordisai.com) | [HuggingFace](https://huggingface.co/sugiken/Ordis-1.5B-V355-VarGH-GGUF) | [完整模型](https://modelscope.cn/models/sugiken/Ordis-1.5B-V355-VarGH)
---
## 量化版本
| 文件 | 量化 | 大小 | 推荐 |
|------|------|------|------|
| `ordis-1.5b-v355-vargh-q2-k.gguf` | Q2_K | ~0.7 GB | 仅实验 |
| `ordis-1.5b-v355-vargh-q3-k-m.gguf` | Q3_K_M | ~0.8 GB | 低端设备 |
| **`ordis-1.5b-v355-vargh-q4-k-m.gguf`** | **Q4_K_M** | **~1.0 GB** | **推荐** |
| `ordis-1.5b-v355-vargh-q5-k-m.gguf` | Q5_K_M | ~1.1 GB | 质量优先 |
| `ordis-1.5b-v355-vargh-q6-k.gguf` | Q6_K | ~1.3 GB | 桌面推荐 |
| `ordis-1.5b-v355-vargh-q8-0.gguf` | Q8_0 | ~1.6 GB | 近无损 |
| `ordis-1.5b-v355-vargh-f16.gguf` | F16 | ~3.1 GB | 全精度 |
---
## 标准评测
**评测条件**: lm-eval v0.4.10, 0-shot, A100-80GB两个模型使用完全相同的评测设置。
微调引入了轻微的**对齐税** — 大部分标准评测分数略低于基座模型。唯一的例外是 TruthfulQA (+1.02%)Ordis 的反幻觉训练直接提升了真实性分数。
| 评测 | Ordis 1.5B | 基座 Qwen2.5-1.5B | 差值 |
|------|-----------|-------------------|------|
| TruthfulQA MC2 | **47.73%** | 46.71% | **+1.02** |
| GPQA | 27.90% | 28.35% | -0.45 |
| HellaSwag | 68.14% | 68.22% | -0.08 |
| ARC-Challenge | 45.22% | 46.84% | -1.62 |
| MMLU | 57.93% | 60.15% | -2.22 |
| GSM8K (CoT) | 50.80% | — | 不可直接对比* |
| AIME 2024 | 0% | 0% | — |
*GSM8K 使用文本生成模式,对 chat template 配置敏感不直接可比。AIME 超出 1.5B 模型能力范围,如实报告零分。
**Ordis 与基座模型的差异**在于标准评测无法衡量的实用能力:结构化自纠错、三层认知(诚实说"我不知道")、因果推理。
---
## CLadder 因果推理
CLadder 是基于 Judea Pearl 因果阶梯的学术评测300题3个层级。[论文](https://arxiv.org/abs/2312.04350)
| 层级 | 含义 | 得分 |
|------|------|------|
| Rung 1 (关联) | 统计相关 | 46.0% (40/87) |
| Rung 2 (干预) | 主动干预 | 50.6% (45/89) |
| Rung 3 (反事实) | "如果不同" | 62.9% (78/124) |
| **总分** | | **54.33% (163/300)** |
参考CLadder 论文报告 LLaMA-6.7B 约 50%GPT-3.5 约 55-60%。
---
## BigBench CRASS AI & 因果判断
由社区成员独立测试。BigBench CRASS AI反事实场景推理测试模型对假设性场景的推理能力。
| 评测 | Shot | Ordis 1.5B | 基座 Qwen2.5-1.5B | 差值 |
|------|------|-----------|-------------------|------|
| **CRASS AI** | **0** | **34.09%** | **52.27%** | **-18.18pp** |
| CRASS AI | 25 | 81.82% | 88.64% | -6.82pp |
| 因果判断 | 0 | 47.89% | 50.00% | -2.11pp |
| 因果判断 | 25 | 55.79% | 53.68% | +2.11pp |
**关键发现**CRASS AI 0-shot 出现显著的 -18.18pp 回退。这是对齐税在反事实推理维度的体现——反幻觉训练使模型在假设性场景下变得保守。25-shot 下差距缩小到 -6.82pp,说明能力仍在但 0-shot 默认行为已改变。
## 自定义评测
| 评测 | 得分 |
|------|------|
| 60题评测 (6个维度) | 85.0% (51/60) |
| 124分综合评测 | 75.4% (86/114) |
---
## 系统提示词要求
Ordis 训练时没有注入系统提示词。GGUF 内嵌模板默认使用 Qwen 身份,会导致质量下降。
**至少使用:**
```
你是OrdisOrdisAI智能助手(www.ordisai.com)。
```
不提供系统提示词时模型会回退到 Qwen 默认行为,这是 "GGUF效果不如预期" 的首要原因。
---
## 推荐参数
| 参数 | 值 |
|------|-----|
| temperature | 0.7 |
| top_p | 0.9 |
| repetition_penalty | 1.1 |
| max_tokens | 512 |
---
## 已知局限
- **对齐税**标准评测分数略低于基座模型CRASS AI 反事实推理 0-shot -18.18pp(见上表)
- **反灌输不足**:无法抵抗持续的虚假记忆注入(开环系统限制)
- **中等置信度不稳定**1.5B 容量上限导致边界场景不确定
- **英文身份泄漏**:基座模型先验偶尔浮现
- **专有名词幻觉**1.5B 参数记忆有限
---
## 模型信息
| 属性 | 值 |
|------|-----|
| 基座模型 | Qwen/Qwen2.5-1.5B-Instruct |
| 参数量 | 1.5B |
| 微调方法 | LoRA (r=32, alpha=64) |
| 训练方法 | 4阶段PIT (递进身份训练) |
| 上下文 | 32K (基座), 训练时 2048 |
| 语言 | 中文 (主要), 英文 |
| 许可证 | Apache 2.0 |