初始化项目,由ModelHub XC社区提供模型

Model: XunziALLM/Xunzi-Qwen1.5-7B_chat
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-09-05 05:46:13 +08:00
commit 818bbf2aae
27 changed files with 303551 additions and 0 deletions

34
.gitattributes vendored Normal file
View File

@@ -0,0 +1,34 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bin.* filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zstandard filter=lfs diff=lfs merge=lfs -text
*.tfevents* filter=lfs diff=lfs merge=lfs -text
*.db* filter=lfs diff=lfs merge=lfs -text
*.ark* filter=lfs diff=lfs merge=lfs -text
**/*ckpt*data* filter=lfs diff=lfs merge=lfs -text
**/*ckpt*.meta filter=lfs diff=lfs merge=lfs -text
**/*ckpt*.index filter=lfs diff=lfs merge=lfs -text
*.safetensors filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text

34
README.md Normal file
View File

@@ -0,0 +1,34 @@
# 荀子系列大语言模型
随着科技的飞速发展,人工智能已深入到各个领域。为响应古籍活化利用号召,推动大语言模型与古籍处理深度融合,以古籍智能化的研究为目的,本项目推出了一系列古籍处理领域大语言模型:荀子古籍大语言模型。荀子不仅是我国先秦时期伟大的朴素唯物主义的思想家,也是一位散文大家。他在语言学理论的阐述上又是一位开拓者、奠基人。荀子系列专为古籍智能处理而设计,这一系列模型的推出将推动古籍研究与保护工作的新发展,提高中华传统文化传承的效率与质量。
本次荀子系列模型开源包括两个部分:基座模型[**XunziALLM**](https://modelscope.cn/models/Xunzillm4cc/Xunzi-Qwen)与对话模型[**XunziChat**](https://modelscope.cn/models/Xunzillm4cc/Xunzi-Qwen-Chat),模型的调用方式与阿里云的Qwen系列大模型一致。
## 荀子系列模型亮点:
* 古籍智能标引,荀子模型具备强大的古籍文献标引能力,能够对古籍中的内容进行高质量主题标引,帮助研究人员快速了解文章主题。
* 古籍信息抽取,荀子模型能够自动从古籍中抽取关键信息,如人物、事件、地点等,大大节省了研究人员的信息整理时间。
* 诗歌生成:荀子模型还具备诗歌生成的能力,能够根据给定的主题或关键词,自动生成符合语法规则和韵律要求的古诗,为诗词爱好者提供创作灵感。
* 古籍高质量翻译:对于那些难以理解的古籍文献,荀子模型能够提供高质量的翻译服务,帮助研究人员更好地理解原文含义。
* 阅读理解:荀子模型能够对给出的古文文本进行分析解释,实现对古籍文本的自动阅读。
* 词法分析:荀子模型可以完成古籍文本的自动分词和词性标注,能够有效提升语言学工作者的研究效率。
* 自动标点:荀子大模型可以快速完成古籍文本的断句和标点,提升研究者以及业余爱好者对古籍文本的阅读体验。
由于我们同时发布了基座模型,用户也可以根据自己的需求,使用本地的训练语料微调荀子基座模型,使得其能够在古籍下游处理任务上取得更佳的处理性能。
## 声明:
大语言模型庞大的参数量也带来了更多的随机性,虽然我们在训练数据选取时已经尽可能保证了数据的合规性,但由于数据和模型的复杂性,仍有可能存在一些无法避免的问题。因此,如果由于使用本开源模型而导致的各种问题,包括但不限于数据安全问题、公共舆论风险,或模型被误导、滥用、传播或不当利用所带来的任何风险和问题,我们将不承担任何责任。
此外,根据国家网信办等七部门联合发布的[《生成式人工智能服务管理暂行办法》](http://www.cac.gov.cn/2023-07/13/c_1690898327029107.htm),在训练、使用本模型以及其他生成式模型,请依据相关法律法规,为构建和谐、健康、可持续的生成式人工智能社区共同努力。
因此,如果由于使用本开源模型而导致的任何问题,包括但不限于数据安全问题、公共舆论风险,或模型被误导、滥用、传播或不当利用所带来的任何风险和问题,我们将不承担任何责任。
如果您在使用模型时遇到了任何问题,欢迎联系我们(letz999@163.com)
```bash
git clone https://www.modelscope.cn/Xunzillm4cc/Xunzi-Qwen1.5-7B_chat.git

5
added_tokens.json Normal file
View File

@@ -0,0 +1,5 @@
{
"<|endoftext|>": 151643,
"<|im_end|>": 151645,
"<|im_start|>": 151644
}

28
config.json Normal file
View File

@@ -0,0 +1,28 @@
{
"_name_or_path": "/home/gpuall/ifs_data/pre_llms/Xunzi-Qwen1.5-7B",
"architectures": [
"Qwen2ForCausalLM"
],
"attention_dropout": 0.0,
"bos_token_id": 151643,
"eos_token_id": 151643,
"hidden_act": "silu",
"hidden_size": 4096,
"initializer_range": 0.02,
"intermediate_size": 11008,
"max_position_embeddings": 32768,
"max_window_layers": 28,
"model_type": "qwen2",
"num_attention_heads": 32,
"num_hidden_layers": 32,
"num_key_value_heads": 32,
"rms_norm_eps": 1e-06,
"rope_theta": 1000000.0,
"sliding_window": 32768,
"tie_word_embeddings": false,
"torch_dtype": "float16",
"transformers_version": "4.37.2",
"use_cache": false,
"use_sliding_window": false,
"vocab_size": 151936
}

1
configuration.json Normal file
View File

@@ -0,0 +1 @@
{"task":"text-generation"}

6
generation_config.json Normal file
View File

@@ -0,0 +1,6 @@
{
"bos_token_id": 151643,
"eos_token_id": 151643,
"max_new_tokens": 2048,
"transformers_version": "4.37.2"
}

151292
merges.txt Normal file

File diff suppressed because it is too large Load Diff

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:813f82dfce53b52b52b9ae429f25161aec2deddd28ec0d0b48cd3038d1d4fb3f
size 1244659848

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:2d107582113e342e6883c4e32f09983ed6719ee1e62189bf288d302d82988f08
size 943828368

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:5d7c00c222392225ec2d59906cfa6ced837466d8a45c1b24d068e89bdf92d6ea
size 989940584

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:bca466c3db0fbba7db42dd9407362b301c99bd082d5990ea35ec64c449221868
size 966905232

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:ba455ec5ab1c599b8abe2281c2a6a63aedd5dbe27ebe557b3f90f2b2f9daa54c
size 966880328

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:8642978a7209c650e5a108d351133ad39997095e4de2a1a9f79a2743733aac49
size 989957216

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:fefd4173fde01ecec8c593fd54dc83a7715e4e39f53d8cfa344335a1af54a64e
size 943828400

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:5fd4b47aa92022fd5888204396d5502155d5379efb9bff48ba19ffb8de8d2ccf
size 989940608

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:41e2d04dd3622cf8fdbc557f9aea3921aab459fe35403af121960e58889f6f9f
size 966905264

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:ef595a899e83e852e0f2ca2dc2b71d1a3688d43265afab098ef402d845d2ef3a
size 966880352

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:c4fd742c8ba4548c673695f0459cad01e2da30777238002557dbaae9b7300402
size 989957216

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:9111561d7c519e50b8cf174e45c7b440a55fb193a51b7187a4692ec884a341e0
size 943828400

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:4c26bef7e9f460c0f43ceb97ef85fef14c1754e10132be0c964588670b8988cb
size 989940608

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:bc9a2aee8be6d9eaeeda761f288ba523528e8fe13fad83598a5117418abe2d88
size 966905264

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:e37d93aada985b25d093e95fe6c06061bfb152dd4650781bcd2c2121dd38cd1f
size 337675256

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:db62778b87ace216e535d569e12f8fc14959131af763bfaa9be7a6bfc1c7cf0b
size 1244659840

View File

@@ -0,0 +1,394 @@
{
"metadata": {
"total_size": 15442649088
},
"weight_map": {
"lm_head.weight": "model-00016-of-00016.safetensors",
"model.embed_tokens.weight": "model-00001-of-00016.safetensors",
"model.layers.0.input_layernorm.weight": "model-00002-of-00016.safetensors",
"model.layers.0.mlp.down_proj.weight": "model-00002-of-00016.safetensors",
"model.layers.0.mlp.gate_proj.weight": "model-00002-of-00016.safetensors",
"model.layers.0.mlp.up_proj.weight": "model-00002-of-00016.safetensors",
"model.layers.0.post_attention_layernorm.weight": "model-00002-of-00016.safetensors",
"model.layers.0.self_attn.k_proj.bias": "model-00002-of-00016.safetensors",
"model.layers.0.self_attn.k_proj.weight": "model-00002-of-00016.safetensors",
"model.layers.0.self_attn.o_proj.weight": "model-00002-of-00016.safetensors",
"model.layers.0.self_attn.q_proj.bias": "model-00002-of-00016.safetensors",
"model.layers.0.self_attn.q_proj.weight": "model-00002-of-00016.safetensors",
"model.layers.0.self_attn.v_proj.bias": "model-00002-of-00016.safetensors",
"model.layers.0.self_attn.v_proj.weight": "model-00002-of-00016.safetensors",
"model.layers.1.input_layernorm.weight": "model-00002-of-00016.safetensors",
"model.layers.1.mlp.down_proj.weight": "model-00002-of-00016.safetensors",
"model.layers.1.mlp.gate_proj.weight": "model-00002-of-00016.safetensors",
"model.layers.1.mlp.up_proj.weight": "model-00002-of-00016.safetensors",
"model.layers.1.post_attention_layernorm.weight": "model-00002-of-00016.safetensors",
"model.layers.1.self_attn.k_proj.bias": "model-00002-of-00016.safetensors",
"model.layers.1.self_attn.k_proj.weight": "model-00002-of-00016.safetensors",
"model.layers.1.self_attn.o_proj.weight": "model-00002-of-00016.safetensors",
"model.layers.1.self_attn.q_proj.bias": "model-00002-of-00016.safetensors",
"model.layers.1.self_attn.q_proj.weight": "model-00002-of-00016.safetensors",
"model.layers.1.self_attn.v_proj.bias": "model-00002-of-00016.safetensors",
"model.layers.1.self_attn.v_proj.weight": "model-00002-of-00016.safetensors",
"model.layers.10.input_layernorm.weight": "model-00006-of-00016.safetensors",
"model.layers.10.mlp.down_proj.weight": "model-00006-of-00016.safetensors",
"model.layers.10.mlp.gate_proj.weight": "model-00006-of-00016.safetensors",
"model.layers.10.mlp.up_proj.weight": "model-00006-of-00016.safetensors",
"model.layers.10.post_attention_layernorm.weight": "model-00006-of-00016.safetensors",
"model.layers.10.self_attn.k_proj.bias": "model-00006-of-00016.safetensors",
"model.layers.10.self_attn.k_proj.weight": "model-00006-of-00016.safetensors",
"model.layers.10.self_attn.o_proj.weight": "model-00006-of-00016.safetensors",
"model.layers.10.self_attn.q_proj.bias": "model-00006-of-00016.safetensors",
"model.layers.10.self_attn.q_proj.weight": "model-00006-of-00016.safetensors",
"model.layers.10.self_attn.v_proj.bias": "model-00006-of-00016.safetensors",
"model.layers.10.self_attn.v_proj.weight": "model-00006-of-00016.safetensors",
"model.layers.11.input_layernorm.weight": "model-00006-of-00016.safetensors",
"model.layers.11.mlp.down_proj.weight": "model-00006-of-00016.safetensors",
"model.layers.11.mlp.gate_proj.weight": "model-00006-of-00016.safetensors",
"model.layers.11.mlp.up_proj.weight": "model-00006-of-00016.safetensors",
"model.layers.11.post_attention_layernorm.weight": "model-00006-of-00016.safetensors",
"model.layers.11.self_attn.k_proj.bias": "model-00006-of-00016.safetensors",
"model.layers.11.self_attn.k_proj.weight": "model-00006-of-00016.safetensors",
"model.layers.11.self_attn.o_proj.weight": "model-00006-of-00016.safetensors",
"model.layers.11.self_attn.q_proj.bias": "model-00006-of-00016.safetensors",
"model.layers.11.self_attn.q_proj.weight": "model-00006-of-00016.safetensors",
"model.layers.11.self_attn.v_proj.bias": "model-00006-of-00016.safetensors",
"model.layers.11.self_attn.v_proj.weight": "model-00006-of-00016.safetensors",
"model.layers.12.input_layernorm.weight": "model-00007-of-00016.safetensors",
"model.layers.12.mlp.down_proj.weight": "model-00007-of-00016.safetensors",
"model.layers.12.mlp.gate_proj.weight": "model-00007-of-00016.safetensors",
"model.layers.12.mlp.up_proj.weight": "model-00007-of-00016.safetensors",
"model.layers.12.post_attention_layernorm.weight": "model-00007-of-00016.safetensors",
"model.layers.12.self_attn.k_proj.bias": "model-00007-of-00016.safetensors",
"model.layers.12.self_attn.k_proj.weight": "model-00007-of-00016.safetensors",
"model.layers.12.self_attn.o_proj.weight": "model-00007-of-00016.safetensors",
"model.layers.12.self_attn.q_proj.bias": "model-00007-of-00016.safetensors",
"model.layers.12.self_attn.q_proj.weight": "model-00007-of-00016.safetensors",
"model.layers.12.self_attn.v_proj.bias": "model-00007-of-00016.safetensors",
"model.layers.12.self_attn.v_proj.weight": "model-00007-of-00016.safetensors",
"model.layers.13.input_layernorm.weight": "model-00007-of-00016.safetensors",
"model.layers.13.mlp.down_proj.weight": "model-00007-of-00016.safetensors",
"model.layers.13.mlp.gate_proj.weight": "model-00007-of-00016.safetensors",
"model.layers.13.mlp.up_proj.weight": "model-00007-of-00016.safetensors",
"model.layers.13.post_attention_layernorm.weight": "model-00007-of-00016.safetensors",
"model.layers.13.self_attn.k_proj.bias": "model-00007-of-00016.safetensors",
"model.layers.13.self_attn.k_proj.weight": "model-00007-of-00016.safetensors",
"model.layers.13.self_attn.o_proj.weight": "model-00007-of-00016.safetensors",
"model.layers.13.self_attn.q_proj.bias": "model-00007-of-00016.safetensors",
"model.layers.13.self_attn.q_proj.weight": "model-00007-of-00016.safetensors",
"model.layers.13.self_attn.v_proj.bias": "model-00007-of-00016.safetensors",
"model.layers.13.self_attn.v_proj.weight": "model-00007-of-00016.safetensors",
"model.layers.14.input_layernorm.weight": "model-00008-of-00016.safetensors",
"model.layers.14.mlp.down_proj.weight": "model-00008-of-00016.safetensors",
"model.layers.14.mlp.gate_proj.weight": "model-00008-of-00016.safetensors",
"model.layers.14.mlp.up_proj.weight": "model-00008-of-00016.safetensors",
"model.layers.14.post_attention_layernorm.weight": "model-00008-of-00016.safetensors",
"model.layers.14.self_attn.k_proj.bias": "model-00007-of-00016.safetensors",
"model.layers.14.self_attn.k_proj.weight": "model-00007-of-00016.safetensors",
"model.layers.14.self_attn.o_proj.weight": "model-00007-of-00016.safetensors",
"model.layers.14.self_attn.q_proj.bias": "model-00007-of-00016.safetensors",
"model.layers.14.self_attn.q_proj.weight": "model-00007-of-00016.safetensors",
"model.layers.14.self_attn.v_proj.bias": "model-00007-of-00016.safetensors",
"model.layers.14.self_attn.v_proj.weight": "model-00007-of-00016.safetensors",
"model.layers.15.input_layernorm.weight": "model-00008-of-00016.safetensors",
"model.layers.15.mlp.down_proj.weight": "model-00008-of-00016.safetensors",
"model.layers.15.mlp.gate_proj.weight": "model-00008-of-00016.safetensors",
"model.layers.15.mlp.up_proj.weight": "model-00008-of-00016.safetensors",
"model.layers.15.post_attention_layernorm.weight": "model-00008-of-00016.safetensors",
"model.layers.15.self_attn.k_proj.bias": "model-00008-of-00016.safetensors",
"model.layers.15.self_attn.k_proj.weight": "model-00008-of-00016.safetensors",
"model.layers.15.self_attn.o_proj.weight": "model-00008-of-00016.safetensors",
"model.layers.15.self_attn.q_proj.bias": "model-00008-of-00016.safetensors",
"model.layers.15.self_attn.q_proj.weight": "model-00008-of-00016.safetensors",
"model.layers.15.self_attn.v_proj.bias": "model-00008-of-00016.safetensors",
"model.layers.15.self_attn.v_proj.weight": "model-00008-of-00016.safetensors",
"model.layers.16.input_layernorm.weight": "model-00009-of-00016.safetensors",
"model.layers.16.mlp.down_proj.weight": "model-00009-of-00016.safetensors",
"model.layers.16.mlp.gate_proj.weight": "model-00008-of-00016.safetensors",
"model.layers.16.mlp.up_proj.weight": "model-00008-of-00016.safetensors",
"model.layers.16.post_attention_layernorm.weight": "model-00009-of-00016.safetensors",
"model.layers.16.self_attn.k_proj.bias": "model-00008-of-00016.safetensors",
"model.layers.16.self_attn.k_proj.weight": "model-00008-of-00016.safetensors",
"model.layers.16.self_attn.o_proj.weight": "model-00008-of-00016.safetensors",
"model.layers.16.self_attn.q_proj.bias": "model-00008-of-00016.safetensors",
"model.layers.16.self_attn.q_proj.weight": "model-00008-of-00016.safetensors",
"model.layers.16.self_attn.v_proj.bias": "model-00008-of-00016.safetensors",
"model.layers.16.self_attn.v_proj.weight": "model-00008-of-00016.safetensors",
"model.layers.17.input_layernorm.weight": "model-00009-of-00016.safetensors",
"model.layers.17.mlp.down_proj.weight": "model-00009-of-00016.safetensors",
"model.layers.17.mlp.gate_proj.weight": "model-00009-of-00016.safetensors",
"model.layers.17.mlp.up_proj.weight": "model-00009-of-00016.safetensors",
"model.layers.17.post_attention_layernorm.weight": "model-00009-of-00016.safetensors",
"model.layers.17.self_attn.k_proj.bias": "model-00009-of-00016.safetensors",
"model.layers.17.self_attn.k_proj.weight": "model-00009-of-00016.safetensors",
"model.layers.17.self_attn.o_proj.weight": "model-00009-of-00016.safetensors",
"model.layers.17.self_attn.q_proj.bias": "model-00009-of-00016.safetensors",
"model.layers.17.self_attn.q_proj.weight": "model-00009-of-00016.safetensors",
"model.layers.17.self_attn.v_proj.bias": "model-00009-of-00016.safetensors",
"model.layers.17.self_attn.v_proj.weight": "model-00009-of-00016.safetensors",
"model.layers.18.input_layernorm.weight": "model-00009-of-00016.safetensors",
"model.layers.18.mlp.down_proj.weight": "model-00009-of-00016.safetensors",
"model.layers.18.mlp.gate_proj.weight": "model-00009-of-00016.safetensors",
"model.layers.18.mlp.up_proj.weight": "model-00009-of-00016.safetensors",
"model.layers.18.post_attention_layernorm.weight": "model-00009-of-00016.safetensors",
"model.layers.18.self_attn.k_proj.bias": "model-00009-of-00016.safetensors",
"model.layers.18.self_attn.k_proj.weight": "model-00009-of-00016.safetensors",
"model.layers.18.self_attn.o_proj.weight": "model-00009-of-00016.safetensors",
"model.layers.18.self_attn.q_proj.bias": "model-00009-of-00016.safetensors",
"model.layers.18.self_attn.q_proj.weight": "model-00009-of-00016.safetensors",
"model.layers.18.self_attn.v_proj.bias": "model-00009-of-00016.safetensors",
"model.layers.18.self_attn.v_proj.weight": "model-00009-of-00016.safetensors",
"model.layers.19.input_layernorm.weight": "model-00010-of-00016.safetensors",
"model.layers.19.mlp.down_proj.weight": "model-00010-of-00016.safetensors",
"model.layers.19.mlp.gate_proj.weight": "model-00010-of-00016.safetensors",
"model.layers.19.mlp.up_proj.weight": "model-00010-of-00016.safetensors",
"model.layers.19.post_attention_layernorm.weight": "model-00010-of-00016.safetensors",
"model.layers.19.self_attn.k_proj.bias": "model-00009-of-00016.safetensors",
"model.layers.19.self_attn.k_proj.weight": "model-00009-of-00016.safetensors",
"model.layers.19.self_attn.o_proj.weight": "model-00010-of-00016.safetensors",
"model.layers.19.self_attn.q_proj.bias": "model-00009-of-00016.safetensors",
"model.layers.19.self_attn.q_proj.weight": "model-00009-of-00016.safetensors",
"model.layers.19.self_attn.v_proj.bias": "model-00010-of-00016.safetensors",
"model.layers.19.self_attn.v_proj.weight": "model-00010-of-00016.safetensors",
"model.layers.2.input_layernorm.weight": "model-00003-of-00016.safetensors",
"model.layers.2.mlp.down_proj.weight": "model-00003-of-00016.safetensors",
"model.layers.2.mlp.gate_proj.weight": "model-00003-of-00016.safetensors",
"model.layers.2.mlp.up_proj.weight": "model-00003-of-00016.safetensors",
"model.layers.2.post_attention_layernorm.weight": "model-00003-of-00016.safetensors",
"model.layers.2.self_attn.k_proj.bias": "model-00002-of-00016.safetensors",
"model.layers.2.self_attn.k_proj.weight": "model-00002-of-00016.safetensors",
"model.layers.2.self_attn.o_proj.weight": "model-00002-of-00016.safetensors",
"model.layers.2.self_attn.q_proj.bias": "model-00002-of-00016.safetensors",
"model.layers.2.self_attn.q_proj.weight": "model-00002-of-00016.safetensors",
"model.layers.2.self_attn.v_proj.bias": "model-00002-of-00016.safetensors",
"model.layers.2.self_attn.v_proj.weight": "model-00002-of-00016.safetensors",
"model.layers.20.input_layernorm.weight": "model-00010-of-00016.safetensors",
"model.layers.20.mlp.down_proj.weight": "model-00010-of-00016.safetensors",
"model.layers.20.mlp.gate_proj.weight": "model-00010-of-00016.safetensors",
"model.layers.20.mlp.up_proj.weight": "model-00010-of-00016.safetensors",
"model.layers.20.post_attention_layernorm.weight": "model-00010-of-00016.safetensors",
"model.layers.20.self_attn.k_proj.bias": "model-00010-of-00016.safetensors",
"model.layers.20.self_attn.k_proj.weight": "model-00010-of-00016.safetensors",
"model.layers.20.self_attn.o_proj.weight": "model-00010-of-00016.safetensors",
"model.layers.20.self_attn.q_proj.bias": "model-00010-of-00016.safetensors",
"model.layers.20.self_attn.q_proj.weight": "model-00010-of-00016.safetensors",
"model.layers.20.self_attn.v_proj.bias": "model-00010-of-00016.safetensors",
"model.layers.20.self_attn.v_proj.weight": "model-00010-of-00016.safetensors",
"model.layers.21.input_layernorm.weight": "model-00011-of-00016.safetensors",
"model.layers.21.mlp.down_proj.weight": "model-00011-of-00016.safetensors",
"model.layers.21.mlp.gate_proj.weight": "model-00010-of-00016.safetensors",
"model.layers.21.mlp.up_proj.weight": "model-00011-of-00016.safetensors",
"model.layers.21.post_attention_layernorm.weight": "model-00011-of-00016.safetensors",
"model.layers.21.self_attn.k_proj.bias": "model-00010-of-00016.safetensors",
"model.layers.21.self_attn.k_proj.weight": "model-00010-of-00016.safetensors",
"model.layers.21.self_attn.o_proj.weight": "model-00010-of-00016.safetensors",
"model.layers.21.self_attn.q_proj.bias": "model-00010-of-00016.safetensors",
"model.layers.21.self_attn.q_proj.weight": "model-00010-of-00016.safetensors",
"model.layers.21.self_attn.v_proj.bias": "model-00010-of-00016.safetensors",
"model.layers.21.self_attn.v_proj.weight": "model-00010-of-00016.safetensors",
"model.layers.22.input_layernorm.weight": "model-00011-of-00016.safetensors",
"model.layers.22.mlp.down_proj.weight": "model-00011-of-00016.safetensors",
"model.layers.22.mlp.gate_proj.weight": "model-00011-of-00016.safetensors",
"model.layers.22.mlp.up_proj.weight": "model-00011-of-00016.safetensors",
"model.layers.22.post_attention_layernorm.weight": "model-00011-of-00016.safetensors",
"model.layers.22.self_attn.k_proj.bias": "model-00011-of-00016.safetensors",
"model.layers.22.self_attn.k_proj.weight": "model-00011-of-00016.safetensors",
"model.layers.22.self_attn.o_proj.weight": "model-00011-of-00016.safetensors",
"model.layers.22.self_attn.q_proj.bias": "model-00011-of-00016.safetensors",
"model.layers.22.self_attn.q_proj.weight": "model-00011-of-00016.safetensors",
"model.layers.22.self_attn.v_proj.bias": "model-00011-of-00016.safetensors",
"model.layers.22.self_attn.v_proj.weight": "model-00011-of-00016.safetensors",
"model.layers.23.input_layernorm.weight": "model-00011-of-00016.safetensors",
"model.layers.23.mlp.down_proj.weight": "model-00011-of-00016.safetensors",
"model.layers.23.mlp.gate_proj.weight": "model-00011-of-00016.safetensors",
"model.layers.23.mlp.up_proj.weight": "model-00011-of-00016.safetensors",
"model.layers.23.post_attention_layernorm.weight": "model-00011-of-00016.safetensors",
"model.layers.23.self_attn.k_proj.bias": "model-00011-of-00016.safetensors",
"model.layers.23.self_attn.k_proj.weight": "model-00011-of-00016.safetensors",
"model.layers.23.self_attn.o_proj.weight": "model-00011-of-00016.safetensors",
"model.layers.23.self_attn.q_proj.bias": "model-00011-of-00016.safetensors",
"model.layers.23.self_attn.q_proj.weight": "model-00011-of-00016.safetensors",
"model.layers.23.self_attn.v_proj.bias": "model-00011-of-00016.safetensors",
"model.layers.23.self_attn.v_proj.weight": "model-00011-of-00016.safetensors",
"model.layers.24.input_layernorm.weight": "model-00012-of-00016.safetensors",
"model.layers.24.mlp.down_proj.weight": "model-00012-of-00016.safetensors",
"model.layers.24.mlp.gate_proj.weight": "model-00012-of-00016.safetensors",
"model.layers.24.mlp.up_proj.weight": "model-00012-of-00016.safetensors",
"model.layers.24.post_attention_layernorm.weight": "model-00012-of-00016.safetensors",
"model.layers.24.self_attn.k_proj.bias": "model-00012-of-00016.safetensors",
"model.layers.24.self_attn.k_proj.weight": "model-00012-of-00016.safetensors",
"model.layers.24.self_attn.o_proj.weight": "model-00012-of-00016.safetensors",
"model.layers.24.self_attn.q_proj.bias": "model-00012-of-00016.safetensors",
"model.layers.24.self_attn.q_proj.weight": "model-00012-of-00016.safetensors",
"model.layers.24.self_attn.v_proj.bias": "model-00012-of-00016.safetensors",
"model.layers.24.self_attn.v_proj.weight": "model-00012-of-00016.safetensors",
"model.layers.25.input_layernorm.weight": "model-00012-of-00016.safetensors",
"model.layers.25.mlp.down_proj.weight": "model-00012-of-00016.safetensors",
"model.layers.25.mlp.gate_proj.weight": "model-00012-of-00016.safetensors",
"model.layers.25.mlp.up_proj.weight": "model-00012-of-00016.safetensors",
"model.layers.25.post_attention_layernorm.weight": "model-00012-of-00016.safetensors",
"model.layers.25.self_attn.k_proj.bias": "model-00012-of-00016.safetensors",
"model.layers.25.self_attn.k_proj.weight": "model-00012-of-00016.safetensors",
"model.layers.25.self_attn.o_proj.weight": "model-00012-of-00016.safetensors",
"model.layers.25.self_attn.q_proj.bias": "model-00012-of-00016.safetensors",
"model.layers.25.self_attn.q_proj.weight": "model-00012-of-00016.safetensors",
"model.layers.25.self_attn.v_proj.bias": "model-00012-of-00016.safetensors",
"model.layers.25.self_attn.v_proj.weight": "model-00012-of-00016.safetensors",
"model.layers.26.input_layernorm.weight": "model-00013-of-00016.safetensors",
"model.layers.26.mlp.down_proj.weight": "model-00013-of-00016.safetensors",
"model.layers.26.mlp.gate_proj.weight": "model-00013-of-00016.safetensors",
"model.layers.26.mlp.up_proj.weight": "model-00013-of-00016.safetensors",
"model.layers.26.post_attention_layernorm.weight": "model-00013-of-00016.safetensors",
"model.layers.26.self_attn.k_proj.bias": "model-00012-of-00016.safetensors",
"model.layers.26.self_attn.k_proj.weight": "model-00012-of-00016.safetensors",
"model.layers.26.self_attn.o_proj.weight": "model-00012-of-00016.safetensors",
"model.layers.26.self_attn.q_proj.bias": "model-00012-of-00016.safetensors",
"model.layers.26.self_attn.q_proj.weight": "model-00012-of-00016.safetensors",
"model.layers.26.self_attn.v_proj.bias": "model-00012-of-00016.safetensors",
"model.layers.26.self_attn.v_proj.weight": "model-00012-of-00016.safetensors",
"model.layers.27.input_layernorm.weight": "model-00013-of-00016.safetensors",
"model.layers.27.mlp.down_proj.weight": "model-00013-of-00016.safetensors",
"model.layers.27.mlp.gate_proj.weight": "model-00013-of-00016.safetensors",
"model.layers.27.mlp.up_proj.weight": "model-00013-of-00016.safetensors",
"model.layers.27.post_attention_layernorm.weight": "model-00013-of-00016.safetensors",
"model.layers.27.self_attn.k_proj.bias": "model-00013-of-00016.safetensors",
"model.layers.27.self_attn.k_proj.weight": "model-00013-of-00016.safetensors",
"model.layers.27.self_attn.o_proj.weight": "model-00013-of-00016.safetensors",
"model.layers.27.self_attn.q_proj.bias": "model-00013-of-00016.safetensors",
"model.layers.27.self_attn.q_proj.weight": "model-00013-of-00016.safetensors",
"model.layers.27.self_attn.v_proj.bias": "model-00013-of-00016.safetensors",
"model.layers.27.self_attn.v_proj.weight": "model-00013-of-00016.safetensors",
"model.layers.28.input_layernorm.weight": "model-00014-of-00016.safetensors",
"model.layers.28.mlp.down_proj.weight": "model-00014-of-00016.safetensors",
"model.layers.28.mlp.gate_proj.weight": "model-00013-of-00016.safetensors",
"model.layers.28.mlp.up_proj.weight": "model-00013-of-00016.safetensors",
"model.layers.28.post_attention_layernorm.weight": "model-00014-of-00016.safetensors",
"model.layers.28.self_attn.k_proj.bias": "model-00013-of-00016.safetensors",
"model.layers.28.self_attn.k_proj.weight": "model-00013-of-00016.safetensors",
"model.layers.28.self_attn.o_proj.weight": "model-00013-of-00016.safetensors",
"model.layers.28.self_attn.q_proj.bias": "model-00013-of-00016.safetensors",
"model.layers.28.self_attn.q_proj.weight": "model-00013-of-00016.safetensors",
"model.layers.28.self_attn.v_proj.bias": "model-00013-of-00016.safetensors",
"model.layers.28.self_attn.v_proj.weight": "model-00013-of-00016.safetensors",
"model.layers.29.input_layernorm.weight": "model-00014-of-00016.safetensors",
"model.layers.29.mlp.down_proj.weight": "model-00014-of-00016.safetensors",
"model.layers.29.mlp.gate_proj.weight": "model-00014-of-00016.safetensors",
"model.layers.29.mlp.up_proj.weight": "model-00014-of-00016.safetensors",
"model.layers.29.post_attention_layernorm.weight": "model-00014-of-00016.safetensors",
"model.layers.29.self_attn.k_proj.bias": "model-00014-of-00016.safetensors",
"model.layers.29.self_attn.k_proj.weight": "model-00014-of-00016.safetensors",
"model.layers.29.self_attn.o_proj.weight": "model-00014-of-00016.safetensors",
"model.layers.29.self_attn.q_proj.bias": "model-00014-of-00016.safetensors",
"model.layers.29.self_attn.q_proj.weight": "model-00014-of-00016.safetensors",
"model.layers.29.self_attn.v_proj.bias": "model-00014-of-00016.safetensors",
"model.layers.29.self_attn.v_proj.weight": "model-00014-of-00016.safetensors",
"model.layers.3.input_layernorm.weight": "model-00003-of-00016.safetensors",
"model.layers.3.mlp.down_proj.weight": "model-00003-of-00016.safetensors",
"model.layers.3.mlp.gate_proj.weight": "model-00003-of-00016.safetensors",
"model.layers.3.mlp.up_proj.weight": "model-00003-of-00016.safetensors",
"model.layers.3.post_attention_layernorm.weight": "model-00003-of-00016.safetensors",
"model.layers.3.self_attn.k_proj.bias": "model-00003-of-00016.safetensors",
"model.layers.3.self_attn.k_proj.weight": "model-00003-of-00016.safetensors",
"model.layers.3.self_attn.o_proj.weight": "model-00003-of-00016.safetensors",
"model.layers.3.self_attn.q_proj.bias": "model-00003-of-00016.safetensors",
"model.layers.3.self_attn.q_proj.weight": "model-00003-of-00016.safetensors",
"model.layers.3.self_attn.v_proj.bias": "model-00003-of-00016.safetensors",
"model.layers.3.self_attn.v_proj.weight": "model-00003-of-00016.safetensors",
"model.layers.30.input_layernorm.weight": "model-00014-of-00016.safetensors",
"model.layers.30.mlp.down_proj.weight": "model-00014-of-00016.safetensors",
"model.layers.30.mlp.gate_proj.weight": "model-00014-of-00016.safetensors",
"model.layers.30.mlp.up_proj.weight": "model-00014-of-00016.safetensors",
"model.layers.30.post_attention_layernorm.weight": "model-00014-of-00016.safetensors",
"model.layers.30.self_attn.k_proj.bias": "model-00014-of-00016.safetensors",
"model.layers.30.self_attn.k_proj.weight": "model-00014-of-00016.safetensors",
"model.layers.30.self_attn.o_proj.weight": "model-00014-of-00016.safetensors",
"model.layers.30.self_attn.q_proj.bias": "model-00014-of-00016.safetensors",
"model.layers.30.self_attn.q_proj.weight": "model-00014-of-00016.safetensors",
"model.layers.30.self_attn.v_proj.bias": "model-00014-of-00016.safetensors",
"model.layers.30.self_attn.v_proj.weight": "model-00014-of-00016.safetensors",
"model.layers.31.input_layernorm.weight": "model-00015-of-00016.safetensors",
"model.layers.31.mlp.down_proj.weight": "model-00015-of-00016.safetensors",
"model.layers.31.mlp.gate_proj.weight": "model-00015-of-00016.safetensors",
"model.layers.31.mlp.up_proj.weight": "model-00015-of-00016.safetensors",
"model.layers.31.post_attention_layernorm.weight": "model-00015-of-00016.safetensors",
"model.layers.31.self_attn.k_proj.bias": "model-00014-of-00016.safetensors",
"model.layers.31.self_attn.k_proj.weight": "model-00014-of-00016.safetensors",
"model.layers.31.self_attn.o_proj.weight": "model-00015-of-00016.safetensors",
"model.layers.31.self_attn.q_proj.bias": "model-00014-of-00016.safetensors",
"model.layers.31.self_attn.q_proj.weight": "model-00014-of-00016.safetensors",
"model.layers.31.self_attn.v_proj.bias": "model-00015-of-00016.safetensors",
"model.layers.31.self_attn.v_proj.weight": "model-00015-of-00016.safetensors",
"model.layers.4.input_layernorm.weight": "model-00004-of-00016.safetensors",
"model.layers.4.mlp.down_proj.weight": "model-00004-of-00016.safetensors",
"model.layers.4.mlp.gate_proj.weight": "model-00003-of-00016.safetensors",
"model.layers.4.mlp.up_proj.weight": "model-00003-of-00016.safetensors",
"model.layers.4.post_attention_layernorm.weight": "model-00004-of-00016.safetensors",
"model.layers.4.self_attn.k_proj.bias": "model-00003-of-00016.safetensors",
"model.layers.4.self_attn.k_proj.weight": "model-00003-of-00016.safetensors",
"model.layers.4.self_attn.o_proj.weight": "model-00003-of-00016.safetensors",
"model.layers.4.self_attn.q_proj.bias": "model-00003-of-00016.safetensors",
"model.layers.4.self_attn.q_proj.weight": "model-00003-of-00016.safetensors",
"model.layers.4.self_attn.v_proj.bias": "model-00003-of-00016.safetensors",
"model.layers.4.self_attn.v_proj.weight": "model-00003-of-00016.safetensors",
"model.layers.5.input_layernorm.weight": "model-00004-of-00016.safetensors",
"model.layers.5.mlp.down_proj.weight": "model-00004-of-00016.safetensors",
"model.layers.5.mlp.gate_proj.weight": "model-00004-of-00016.safetensors",
"model.layers.5.mlp.up_proj.weight": "model-00004-of-00016.safetensors",
"model.layers.5.post_attention_layernorm.weight": "model-00004-of-00016.safetensors",
"model.layers.5.self_attn.k_proj.bias": "model-00004-of-00016.safetensors",
"model.layers.5.self_attn.k_proj.weight": "model-00004-of-00016.safetensors",
"model.layers.5.self_attn.o_proj.weight": "model-00004-of-00016.safetensors",
"model.layers.5.self_attn.q_proj.bias": "model-00004-of-00016.safetensors",
"model.layers.5.self_attn.q_proj.weight": "model-00004-of-00016.safetensors",
"model.layers.5.self_attn.v_proj.bias": "model-00004-of-00016.safetensors",
"model.layers.5.self_attn.v_proj.weight": "model-00004-of-00016.safetensors",
"model.layers.6.input_layernorm.weight": "model-00004-of-00016.safetensors",
"model.layers.6.mlp.down_proj.weight": "model-00004-of-00016.safetensors",
"model.layers.6.mlp.gate_proj.weight": "model-00004-of-00016.safetensors",
"model.layers.6.mlp.up_proj.weight": "model-00004-of-00016.safetensors",
"model.layers.6.post_attention_layernorm.weight": "model-00004-of-00016.safetensors",
"model.layers.6.self_attn.k_proj.bias": "model-00004-of-00016.safetensors",
"model.layers.6.self_attn.k_proj.weight": "model-00004-of-00016.safetensors",
"model.layers.6.self_attn.o_proj.weight": "model-00004-of-00016.safetensors",
"model.layers.6.self_attn.q_proj.bias": "model-00004-of-00016.safetensors",
"model.layers.6.self_attn.q_proj.weight": "model-00004-of-00016.safetensors",
"model.layers.6.self_attn.v_proj.bias": "model-00004-of-00016.safetensors",
"model.layers.6.self_attn.v_proj.weight": "model-00004-of-00016.safetensors",
"model.layers.7.input_layernorm.weight": "model-00005-of-00016.safetensors",
"model.layers.7.mlp.down_proj.weight": "model-00005-of-00016.safetensors",
"model.layers.7.mlp.gate_proj.weight": "model-00005-of-00016.safetensors",
"model.layers.7.mlp.up_proj.weight": "model-00005-of-00016.safetensors",
"model.layers.7.post_attention_layernorm.weight": "model-00005-of-00016.safetensors",
"model.layers.7.self_attn.k_proj.bias": "model-00004-of-00016.safetensors",
"model.layers.7.self_attn.k_proj.weight": "model-00004-of-00016.safetensors",
"model.layers.7.self_attn.o_proj.weight": "model-00005-of-00016.safetensors",
"model.layers.7.self_attn.q_proj.bias": "model-00004-of-00016.safetensors",
"model.layers.7.self_attn.q_proj.weight": "model-00004-of-00016.safetensors",
"model.layers.7.self_attn.v_proj.bias": "model-00005-of-00016.safetensors",
"model.layers.7.self_attn.v_proj.weight": "model-00005-of-00016.safetensors",
"model.layers.8.input_layernorm.weight": "model-00005-of-00016.safetensors",
"model.layers.8.mlp.down_proj.weight": "model-00005-of-00016.safetensors",
"model.layers.8.mlp.gate_proj.weight": "model-00005-of-00016.safetensors",
"model.layers.8.mlp.up_proj.weight": "model-00005-of-00016.safetensors",
"model.layers.8.post_attention_layernorm.weight": "model-00005-of-00016.safetensors",
"model.layers.8.self_attn.k_proj.bias": "model-00005-of-00016.safetensors",
"model.layers.8.self_attn.k_proj.weight": "model-00005-of-00016.safetensors",
"model.layers.8.self_attn.o_proj.weight": "model-00005-of-00016.safetensors",
"model.layers.8.self_attn.q_proj.bias": "model-00005-of-00016.safetensors",
"model.layers.8.self_attn.q_proj.weight": "model-00005-of-00016.safetensors",
"model.layers.8.self_attn.v_proj.bias": "model-00005-of-00016.safetensors",
"model.layers.8.self_attn.v_proj.weight": "model-00005-of-00016.safetensors",
"model.layers.9.input_layernorm.weight": "model-00006-of-00016.safetensors",
"model.layers.9.mlp.down_proj.weight": "model-00006-of-00016.safetensors",
"model.layers.9.mlp.gate_proj.weight": "model-00005-of-00016.safetensors",
"model.layers.9.mlp.up_proj.weight": "model-00006-of-00016.safetensors",
"model.layers.9.post_attention_layernorm.weight": "model-00006-of-00016.safetensors",
"model.layers.9.self_attn.k_proj.bias": "model-00005-of-00016.safetensors",
"model.layers.9.self_attn.k_proj.weight": "model-00005-of-00016.safetensors",
"model.layers.9.self_attn.o_proj.weight": "model-00005-of-00016.safetensors",
"model.layers.9.self_attn.q_proj.bias": "model-00005-of-00016.safetensors",
"model.layers.9.self_attn.q_proj.weight": "model-00005-of-00016.safetensors",
"model.layers.9.self_attn.v_proj.bias": "model-00005-of-00016.safetensors",
"model.layers.9.self_attn.v_proj.weight": "model-00005-of-00016.safetensors",
"model.norm.weight": "model-00015-of-00016.safetensors"
}
}

20
special_tokens_map.json Normal file
View File

@@ -0,0 +1,20 @@
{
"additional_special_tokens": [
"<|im_start|>",
"<|im_end|>"
],
"eos_token": {
"content": "<|im_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"pad_token": {
"content": "<|endoftext|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
}
}

44
tokenizer_config.json Normal file
View File

@@ -0,0 +1,44 @@
{
"add_prefix_space": false,
"added_tokens_decoder": {
"151643": {
"content": "<|endoftext|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151644": {
"content": "<|im_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151645": {
"content": "<|im_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
}
},
"additional_special_tokens": [
"<|im_start|>",
"<|im_end|>"
],
"bos_token": null,
"chat_template": "{% set system_message = 'You are a helpful assistant.' %}{% if messages[0]['role'] == 'system' %}{% set system_message = messages[0]['content'] %}{% endif %}{% if system_message is defined %}{{ '<|im_start|>system\\n' + system_message + '<|im_end|>\\n' }}{% endif %}{% for message in messages %}{% set content = message['content'] %}{% if message['role'] == 'user' %}{{ '<|im_start|>user\\n' + content + '<|im_end|>\\n<|im_start|>assistant\\n' }}{% elif message['role'] == 'assistant' %}{{ content + '<|im_end|>' + '\\n' }}{% endif %}{% endfor %}",
"clean_up_tokenization_spaces": false,
"eos_token": "<|im_end|>",
"errors": "replace",
"model_max_length": 32768,
"pad_token": "<|endoftext|>",
"padding_side": "left",
"split_special_tokens": false,
"tokenizer_class": "Qwen2Tokenizer",
"unk_token": null
}

151645
vocab.json Normal file

File diff suppressed because it is too large Load Diff