初始化项目,由ModelHub XC社区提供模型

Model: INSAIT-Institute/BgGPT-7B-Instruct-v0.1
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-07-15 20:47:28 +08:00
commit eecfcca79e
11 changed files with 107776 additions and 0 deletions

35
.gitattributes vendored Normal file
View File

@@ -0,0 +1,35 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
*.safetensors filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text

85
README.md Normal file
View File

@@ -0,0 +1,85 @@
---
base_model: mistralai/Mistral-7B-v0.1
tags:
- mistral
- instruct
- bggpt
- insait
language:
- bg
library_name: transformers
license: apache-2.0
---
# INSAIT-Institute/BgGPT-7B-Instruct-v0.1
![image/png](https://cdn-uploads.huggingface.co/production/uploads/637e1f8cf7e01589cc17bf7e/p6d0YFHjWCQ3S12jWqO1m.png)
Meet BgGPT-7B, a Bulgarian language model trained from mistralai/Mistral-7B-v0.1. BgGPT is distributed under Apache 2.0 license.
This model was created by [`INSAIT Institute`](https://insait.ai/), part of Sofia University, in Sofia, Bulgaria.
## Model description
The model is fine-tuned to improve its Bulgarian language capabilities using multiple datasets, including Bulgarian web crawl data, a range of specialized Bulgarian datasets sourced by INSAIT Institute, and machine translations of popular English datasets.
This Bulgarian data was augmented with English datasets to retain English and logical reasoning skills.
The model's tokenizer has been extended to allow for a more efficient encoding of Bulgarian words written in Cyrillic.
This not only increases throughput of Cyrillic text but also performance.
## Instruction format
In order to leverage instruction fine-tuning, your prompt should be surrounded by `[INST]` and `[/INST]` tokens.
The very first instruction should begin with a begin of sentence token `<s>`. Following instructions should not.
The assistant generation will be ended by the end-of-sentence token.
E.g.
```
text = "<s>[INST] Кога е основан Софийският университет? [/INST]"
"Софийският университет „Св. Климент Охридски“ е създаден на 1 октомври 1888 г.</s> "
"[INST] Кой го е основал? [/INST]"
```
This format is available as a [chat template](https://huggingface.co/docs/transformers/main/chat_templating) via the `apply_chat_template()` method:
## Benchmarks
The model comes with a set of Benchmarks that are translations of the corresponding English-benchmarks. These are provided at [`https://github.com/insait-institute/lm-evaluation-harness-bg`](https://github.com/insait-institute/lm-evaluation-harness-bg)
![image/png](https://cdn-uploads.huggingface.co/production/uploads/637e1f8cf7e01589cc17bf7e/rRwHzBuOZrYt0KG2X-ELI.png)
![image/png](https://cdn-uploads.huggingface.co/production/uploads/637e1f8cf7e01589cc17bf7e/xpGrV72htybUN6aXO9niT.png)
![image/png](https://cdn-uploads.huggingface.co/production/uploads/637e1f8cf7e01589cc17bf7e/x5CpKuJ08U017AYJVaTU4.png)
## Summary
- **Finetuned from:** [mistralai/Mistral-7B-v0.1](https://huggingface.co/mistralai/Mistral-7B-v0.1)
- **Model type:** Causal decoder-only transformer language model
- **Language:** Bulgarian and English
- **License:** [Apache 2.0](https://www.apache.org/licenses/LICENSE-2.0.html)
- **Contact:** [bggpt@insait.ai](mailto:bggpt@insait.ai)
## Use in 🤗Transformers
First install direct dependencies:
```
pip install transformers torch accelerate
```
If you want faster inference using flash-attention2, you need to install these dependencies:
```bash
pip install packaging ninja
pip install flash-attn
```
Then load the model in transformers:
```python
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
model = AutoModelForCausalLM.from_pretrained(
model="INSAIT-Institute/BgGPT-7B-Instruct-v0.1",
device_map="auto",
torch_dtype=torch.bfloat16,
use_flash_attn_2=True # optional
)
```
## Use with GGML / llama.cpp
The model in GGUF format [INSAIT-Institute/BgGPT-7B-Instruct-v0.1-GGUF](https://huggingface.co/INSAIT-Institute/BgGPT-7B-Instruct-v0.1-GGUF)

25
config.json Normal file
View File

@@ -0,0 +1,25 @@
{
"architectures": [
"MistralForCausalLM"
],
"attention_dropout": 0.0,
"bos_token_id": 1,
"eos_token_id": 2,
"hidden_act": "silu",
"hidden_size": 4096,
"initializer_range": 0.02,
"intermediate_size": 14336,
"max_position_embeddings": 32768,
"model_type": "mistral",
"num_attention_heads": 32,
"num_hidden_layers": 32,
"num_key_value_heads": 8,
"rms_norm_eps": 1e-05,
"rope_theta": 10000.0,
"sliding_window": 4096,
"tie_word_embeddings": false,
"torch_dtype": "bfloat16",
"transformers_version": "4.37.2",
"use_cache": true,
"vocab_size": 38000
}

6
generation_config.json Normal file
View File

@@ -0,0 +1,6 @@
{
"_from_model_config": true,
"bos_token_id": 1,
"eos_token_id": 2,
"transformers_version": "4.34.1"
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:28170f9f023bc92ecf620d86fb09220d1dd7dfd2d56027e671e5ea1021614af9
size 9992133696

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:4ff65d6744620c705a3647a90b2d43fc55c94f9d93e6eaf953973e9935f77196
size 4589668352

View File

@@ -0,0 +1,297 @@
{
"metadata" : {
},
"weight_map" : {
"lm_head.weight" : "model-00002-of-00002.safetensors",
"model.embed_tokens.weight" : "model-00001-of-00002.safetensors",
"model.layers.0.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.0.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.0.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.0.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.0.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.0.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.0.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.0.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.0.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.1.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.1.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.1.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.1.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.1.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.1.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.1.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.1.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.1.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.10.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.10.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.10.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.10.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.10.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.10.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.10.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.10.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.10.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.11.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.11.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.11.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.11.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.11.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.11.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.11.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.11.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.11.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.12.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.12.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.12.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.12.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.12.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.12.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.12.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.12.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.12.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.13.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.13.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.13.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.13.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.13.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.13.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.13.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.13.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.13.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.14.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.14.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.14.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.14.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.14.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.14.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.14.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.14.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.14.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.15.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.15.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.15.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.15.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.15.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.15.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.15.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.15.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.15.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.16.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.16.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.16.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.16.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.16.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.16.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.16.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.16.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.16.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.17.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.17.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.17.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.17.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.17.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.17.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.17.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.17.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.17.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.18.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.18.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.18.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.18.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.18.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.18.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.18.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.18.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.18.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.19.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.19.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.19.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.19.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.19.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.19.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.19.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.19.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.19.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.2.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.2.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.2.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.2.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.2.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.2.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.2.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.2.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.2.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.20.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.20.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.20.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.20.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.20.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.20.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.20.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.20.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.20.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.21.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.21.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.21.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.21.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.21.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.21.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.21.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.21.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.21.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.22.input_layernorm.weight" : "model-00002-of-00002.safetensors",
"model.layers.22.mlp.down_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.22.mlp.gate_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.22.mlp.up_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.22.post_attention_layernorm.weight" : "model-00002-of-00002.safetensors",
"model.layers.22.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.22.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.22.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.22.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.23.input_layernorm.weight" : "model-00002-of-00002.safetensors",
"model.layers.23.mlp.down_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.23.mlp.gate_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.23.mlp.up_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.23.post_attention_layernorm.weight" : "model-00002-of-00002.safetensors",
"model.layers.23.self_attn.k_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.23.self_attn.o_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.23.self_attn.q_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.23.self_attn.v_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.24.input_layernorm.weight" : "model-00002-of-00002.safetensors",
"model.layers.24.mlp.down_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.24.mlp.gate_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.24.mlp.up_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.24.post_attention_layernorm.weight" : "model-00002-of-00002.safetensors",
"model.layers.24.self_attn.k_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.24.self_attn.o_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.24.self_attn.q_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.24.self_attn.v_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.25.input_layernorm.weight" : "model-00002-of-00002.safetensors",
"model.layers.25.mlp.down_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.25.mlp.gate_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.25.mlp.up_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.25.post_attention_layernorm.weight" : "model-00002-of-00002.safetensors",
"model.layers.25.self_attn.k_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.25.self_attn.o_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.25.self_attn.q_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.25.self_attn.v_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.26.input_layernorm.weight" : "model-00002-of-00002.safetensors",
"model.layers.26.mlp.down_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.26.mlp.gate_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.26.mlp.up_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.26.post_attention_layernorm.weight" : "model-00002-of-00002.safetensors",
"model.layers.26.self_attn.k_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.26.self_attn.o_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.26.self_attn.q_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.26.self_attn.v_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.27.input_layernorm.weight" : "model-00002-of-00002.safetensors",
"model.layers.27.mlp.down_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.27.mlp.gate_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.27.mlp.up_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.27.post_attention_layernorm.weight" : "model-00002-of-00002.safetensors",
"model.layers.27.self_attn.k_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.27.self_attn.o_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.27.self_attn.q_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.27.self_attn.v_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.28.input_layernorm.weight" : "model-00002-of-00002.safetensors",
"model.layers.28.mlp.down_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.28.mlp.gate_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.28.mlp.up_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.28.post_attention_layernorm.weight" : "model-00002-of-00002.safetensors",
"model.layers.28.self_attn.k_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.28.self_attn.o_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.28.self_attn.q_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.28.self_attn.v_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.29.input_layernorm.weight" : "model-00002-of-00002.safetensors",
"model.layers.29.mlp.down_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.29.mlp.gate_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.29.mlp.up_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.29.post_attention_layernorm.weight" : "model-00002-of-00002.safetensors",
"model.layers.29.self_attn.k_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.29.self_attn.o_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.29.self_attn.q_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.29.self_attn.v_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.3.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.3.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.3.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.3.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.3.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.3.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.3.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.3.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.3.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.30.input_layernorm.weight" : "model-00002-of-00002.safetensors",
"model.layers.30.mlp.down_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.30.mlp.gate_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.30.mlp.up_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.30.post_attention_layernorm.weight" : "model-00002-of-00002.safetensors",
"model.layers.30.self_attn.k_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.30.self_attn.o_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.30.self_attn.q_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.30.self_attn.v_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.31.input_layernorm.weight" : "model-00002-of-00002.safetensors",
"model.layers.31.mlp.down_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.31.mlp.gate_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.31.mlp.up_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.31.post_attention_layernorm.weight" : "model-00002-of-00002.safetensors",
"model.layers.31.self_attn.k_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.31.self_attn.o_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.31.self_attn.q_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.31.self_attn.v_proj.weight" : "model-00002-of-00002.safetensors",
"model.layers.4.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.4.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.4.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.4.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.4.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.4.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.4.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.4.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.4.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.5.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.5.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.5.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.5.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.5.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.5.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.5.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.5.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.5.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.6.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.6.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.6.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.6.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.6.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.6.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.6.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.6.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.6.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.7.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.7.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.7.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.7.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.7.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.7.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.7.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.7.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.7.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.8.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.8.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.8.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.8.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.8.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.8.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.8.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.8.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.8.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.9.input_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.9.mlp.down_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.9.mlp.gate_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.9.mlp.up_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.9.post_attention_layernorm.weight" : "model-00001-of-00002.safetensors",
"model.layers.9.self_attn.k_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.9.self_attn.o_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.9.self_attn.q_proj.weight" : "model-00001-of-00002.safetensors",
"model.layers.9.self_attn.v_proj.weight" : "model-00001-of-00002.safetensors",
"model.norm.weight" : "model-00002-of-00002.safetensors"
}
}

30
special_tokens_map.json Normal file
View File

@@ -0,0 +1,30 @@
{
"bos_token": {
"content": "<s>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"eos_token": {
"content": "</s>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"pad_token": {
"content": "<unk>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"unk_token": {
"content": "<unk>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
}
}

107247
tokenizer.json Normal file

File diff suppressed because it is too large Load Diff

3
tokenizer.model Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:b215eba49b42809f353519c81f0d4b8ce3a3a764e865e09a2a3652f7d4c505fd
size 624187

42
tokenizer_config.json Normal file
View File

@@ -0,0 +1,42 @@
{
"add_bos_token": true,
"add_eos_token": false,
"added_tokens_decoder": {
"0": {
"content": "<unk>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"1": {
"content": "<s>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"2": {
"content": "</s>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
}
},
"bos_token": "<s>",
"chat_template": "{{ bos_token }}{% for message in messages %}{% if (message['role'] == 'user') != (loop.index0 % 2 == 0) %}{{ raise_exception('Conversation roles must alternate user/assistant/user/assistant/...') }}{% endif %}{% if message['role'] == 'user' %}{{ '[INST] ' + message['content'] + ' [/INST]' }}{% elif message['role'] == 'assistant' %}{{ message['content'] + eos_token + ' ' }}{% else %}{{ raise_exception('Only user and assistant roles are supported!') }}{% endif %}{% endfor %}",
"clean_up_tokenization_spaces": false,
"eos_token": "</s>",
"legacy": true,
"model_max_length": 1000000000000000019884624838656,
"pad_token": "<unk>",
"sp_model_kwargs": {},
"spaces_between_special_tokens": false,
"tokenizer_class": "LlamaTokenizer",
"unk_token": "<unk>",
"use_default_system_prompt": false
}