初始化项目,由ModelHub XC社区提供模型

Model: Salesforce/xgen-small-9B-instruct-r
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-08-27 18:20:13 +08:00
commit a21845e508
21 changed files with 100736 additions and 0 deletions

50
.gitattributes vendored Normal file
View File

@@ -0,0 +1,50 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bin.* filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zstandard filter=lfs diff=lfs merge=lfs -text
*.tfevents* filter=lfs diff=lfs merge=lfs -text
*.db* filter=lfs diff=lfs merge=lfs -text
*.ark* filter=lfs diff=lfs merge=lfs -text
**/*ckpt*data* filter=lfs diff=lfs merge=lfs -text
**/*ckpt*.meta filter=lfs diff=lfs merge=lfs -text
**/*ckpt*.index filter=lfs diff=lfs merge=lfs -text
*.safetensors filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.gguf* filter=lfs diff=lfs merge=lfs -text
*.ggml filter=lfs diff=lfs merge=lfs -text
*.llamafile* filter=lfs diff=lfs merge=lfs -text
*.pt2 filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text
tokenizer.json filter=lfs diff=lfs merge=lfs -text
vocab.json filter=lfs diff=lfs merge=lfs -text

91
README.md Normal file
View File

@@ -0,0 +1,91 @@
---
license: cc-by-nc-4.0
language:
- en
library_name: transformers
---
# Welcome to the xGen-small family!
**xGen-small** ([blog](https://www.salesforce.com/blog/xgen-small-enterprise-ready-small-language-models/), [arXiv](https://arxiv.org/abs/2505.06496)) is an enterprise-ready compact LM that combines domain-focused data curation, scalable pre-training, length-extension, and RL fine-tuning to deliver long-context performance at predictable, low cost.
**This model release is for research purposes only.**
<p align="center">
<img width="60%" src="https://huggingface.co/Salesforce/xgen-small/resolve/main/xgen-small.png?download=true">
</p>
## Model Series
[xGen-small](https://www.salesforce.com/blog/xgen-small-enterprise-ready-small-language-models/) comes in two sizes (4B and 9B) with two variants (pre-trained and post-trained):
| Model | # Total Params | Context Length | Variant | Download |
|---------------------------------------|----------------|----------------|--------------|----------------|
| salesforce/xgen-small-4B-base-r | 4B | 128k | Pre-trained | [🤗 Link](https://huggingface.co/Salesforce/xgen-small-4b-base-r) |
| salesforce/xgen-small-4B-instruct-r | 4B | 128k | Post-trained | [🤗 Link](https://huggingface.co/Salesforce/xgen-small-4b-instruct-r) |
| salesforce/xgen-small-9B-base-r | 9B | 128k | Pre-trained | [🤗 Link](https://huggingface.co/Salesforce/xgen-small-9b-base-r) |
| salesforce/xgen-small-9B-instruct-r | 9B | 128k | Post-trained | [🤗 Link](https://huggingface.co/Salesforce/xgen-small-9b-instruct-r) |
## Usage
```python
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "Salesforce/xgen-small-9B-instruct-r"
tokenizer = AutoTokenizer.from_pretrained(model_name)
device = "cuda" if torch.cuda.is_available() else "cpu"
model = AutoModelForCausalLM.from_pretrained(
model_name,
torch_dtype="auto"
).to(device)
prompt = "What is Salesforce?"
messages = [{"role": "user", "content": prompt}]
inputs = tokenizer.apply_chat_template(
messages,
add_generation_prompt=True,
return_tensors="pt"
).to(model.device)
generated = model.generate(inputs, max_new_tokens=128)
output = tokenizer.decode(
generated[0],
skip_special_tokens=True,
)
print(output)
```
## Evaluation
| Category | Task | Llama 3.1-8B | Granite 3.3-8B | Qwen2.5-7B | xGen-small 9B Instruct |
| :------------------------------- | :---------------- | :----------- | :------------- | :--------- | :----------------------|
| General Knowledge & Reasoning | MMLU | 68.3 | 62.7 | 72.4 | 72.4 |
| General Knowledge & Reasoning | MMLU-Pro | 43.2 | 43.5 | 56.7 | 57.3 |
| Chat | Arena-Hard-v1.0 | 28.9 | 30.5 | 48.1 | 60.1 |
| Chat | MT-Bench | 8.25 | 8.57 | 8.56 | 8.90 |
| Math & Science | GPQA | 31.9 | 35.3 | 32.6 | 45.8 |
| Math & Science | GSM8K | 84.2 | 89.4 | 91.9 | 95.3 |
| Math & Science | MATH | 48.9 | 70.9 | 74.6 | 91.6 |
| Math & Science | AIME 2024 | 6.7 | 10.0 | 6.7 | 50.0 |
| Coding | HumanEval+ | 61.6 | 65.9 | 74.4 | 78.7 |
| Coding | MBPP+ | 55.3 | 60.3 | 68.8 | 63.8 |
| Coding | LiveCodeBench | 10.3 | 10.3 | 12.1 | 50.6 |
## Citation
```bibtex
@misc{xgensmall,
title={xGen-small Technical Report},
author={Erik Nijkamp and Bo Pang and Egor Pakhomov and Akash Gokul and Jin Qu and Silvio Savarese and Yingbo Zhou and Caiming Xiong},
year={2025},
eprint={2505.06496},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2505.06496},
}
```
## Ethical Considerations
This release is for research purposes only in support of an academic paper. Our models, datasets, and code are not specifically designed or evaluated for all downstream purposes. We strongly recommend users evaluate and address potential concerns related to accuracy, safety, and fairness before deploying this model. We encourage users to consider the common limitations of AI, comply with applicable laws, and leverage best practices when selecting use cases, particularly for high-risk scenarios where errors or misuse could significantly impact people's lives, rights, or safety. For further guidance on use cases, refer to our AUP and AI AUP.
## Model Licenses
The models are being released under CC-BY-NC-4.0, Copyright © Salesforce, Inc. All Rights Reserved.

5
added_tokens.json Normal file
View File

@@ -0,0 +1,5 @@
{
"<|endofprompt|>": 100276,
"<|im_end|>": 100265,
"<|im_start|>": 100264
}

32
config.json Normal file
View File

@@ -0,0 +1,32 @@
{
"architectures": [
"LlamaForCausalLM"
],
"attention_bias": false,
"attention_dropout": 0.0,
"bos_token_id": 100257,
"embd_pdrop": 0.0,
"eos_token_id": 100265,
"head_dim": 128,
"hidden_act": "silu",
"hidden_size": 4096,
"initializer_range": 0.02,
"intermediate_size": 14336,
"max_position_embeddings": 262144,
"mlp_bias": false,
"model_type": "llama",
"num_attention_heads": 32,
"num_hidden_layers": 45,
"num_key_value_heads": 8,
"pad_token_id": 100257,
"pretraining_tp": 1,
"resid_pdrop": 0.0,
"rms_norm_eps": 1e-06,
"rope_scaling": null,
"rope_theta": 128000000,
"tie_word_embeddings": false,
"torch_dtype": "float32",
"transformers_version": "4.51.3",
"use_cache": false,
"vocab_size": 102400
}

1
configuration.json Normal file
View File

@@ -0,0 +1 @@
{"framework": "pytorch", "task": "text-generation", "allow_remote": true}

8
generation_config.json Normal file
View File

@@ -0,0 +1,8 @@
{
"_from_model_config": true,
"bos_token_id": 100257,
"eos_token_id": 100265,
"pad_token_id": 100257,
"transformers_version": "4.51.3",
"use_cache": false
}

100001
merges.txt Normal file

File diff suppressed because it is too large Load Diff

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:51a11fef0416bd32d72a141e180ffb50b0032e1d40dc207c5af18a458dd21776
size 4932603736

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:df8108a8c162e752fd8f7ba6d200b960bf7f1e0f38cac5c0508db09619a069e4
size 4999813072

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:bfe398ff1dfed8f580b99ed06c6c83a2f6c7f3f76af51c58ee1858a03741f264
size 4999813112

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:d7bb494843714f0a4b1fafb2246939bf961d5433e76e60bd0e5888a605e71cf9
size 4832007496

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:1f49aa81c4cf02180ca1c4282617967b5a1f923d39e312f3fe02219520a181d9
size 4999813120

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:86ada0cfeca7bea7f9c37a7a87fdda3c3b4fd228dbd2f561536278d355997673
size 4999813128

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:7194177a9d06611a73ce38417b199ac24417f4d7d3da695e1244cef08976c612
size 4832007496

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:63639aede5f7c2c20c7fa3624e798d811d1e7ede5f090d1abb0a7ccc23a4d29d
size 4999813120

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:8bab3b80290a284d76d291788b098de53b9cfea40b8d96f80af132e52bb65ba3
size 3019982520

View File

@@ -0,0 +1,415 @@
{
"metadata": {
"total_size": 42615619584
},
"weight_map": {
"lm_head.weight": "model-00009-of-00009.safetensors",
"model.embed_tokens.weight": "model-00001-of-00009.safetensors",
"model.layers.0.input_layernorm.weight": "model-00001-of-00009.safetensors",
"model.layers.0.mlp.down_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.0.mlp.gate_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.0.mlp.up_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.0.post_attention_layernorm.weight": "model-00001-of-00009.safetensors",
"model.layers.0.self_attn.k_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.0.self_attn.o_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.0.self_attn.q_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.0.self_attn.v_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.1.input_layernorm.weight": "model-00001-of-00009.safetensors",
"model.layers.1.mlp.down_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.1.mlp.gate_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.1.mlp.up_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.1.post_attention_layernorm.weight": "model-00001-of-00009.safetensors",
"model.layers.1.self_attn.k_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.1.self_attn.o_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.1.self_attn.q_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.1.self_attn.v_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.10.input_layernorm.weight": "model-00003-of-00009.safetensors",
"model.layers.10.mlp.down_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.10.mlp.gate_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.10.mlp.up_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.10.post_attention_layernorm.weight": "model-00003-of-00009.safetensors",
"model.layers.10.self_attn.k_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.10.self_attn.o_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.10.self_attn.q_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.10.self_attn.v_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.11.input_layernorm.weight": "model-00003-of-00009.safetensors",
"model.layers.11.mlp.down_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.11.mlp.gate_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.11.mlp.up_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.11.post_attention_layernorm.weight": "model-00003-of-00009.safetensors",
"model.layers.11.self_attn.k_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.11.self_attn.o_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.11.self_attn.q_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.11.self_attn.v_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.12.input_layernorm.weight": "model-00003-of-00009.safetensors",
"model.layers.12.mlp.down_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.12.mlp.gate_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.12.mlp.up_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.12.post_attention_layernorm.weight": "model-00003-of-00009.safetensors",
"model.layers.12.self_attn.k_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.12.self_attn.o_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.12.self_attn.q_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.12.self_attn.v_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.13.input_layernorm.weight": "model-00003-of-00009.safetensors",
"model.layers.13.mlp.down_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.13.mlp.gate_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.13.mlp.up_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.13.post_attention_layernorm.weight": "model-00003-of-00009.safetensors",
"model.layers.13.self_attn.k_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.13.self_attn.o_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.13.self_attn.q_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.13.self_attn.v_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.14.input_layernorm.weight": "model-00003-of-00009.safetensors",
"model.layers.14.mlp.down_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.14.mlp.gate_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.14.mlp.up_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.14.post_attention_layernorm.weight": "model-00003-of-00009.safetensors",
"model.layers.14.self_attn.k_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.14.self_attn.o_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.14.self_attn.q_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.14.self_attn.v_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.15.input_layernorm.weight": "model-00004-of-00009.safetensors",
"model.layers.15.mlp.down_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.15.mlp.gate_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.15.mlp.up_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.15.post_attention_layernorm.weight": "model-00004-of-00009.safetensors",
"model.layers.15.self_attn.k_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.15.self_attn.o_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.15.self_attn.q_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.15.self_attn.v_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.16.input_layernorm.weight": "model-00004-of-00009.safetensors",
"model.layers.16.mlp.down_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.16.mlp.gate_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.16.mlp.up_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.16.post_attention_layernorm.weight": "model-00004-of-00009.safetensors",
"model.layers.16.self_attn.k_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.16.self_attn.o_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.16.self_attn.q_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.16.self_attn.v_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.17.input_layernorm.weight": "model-00004-of-00009.safetensors",
"model.layers.17.mlp.down_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.17.mlp.gate_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.17.mlp.up_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.17.post_attention_layernorm.weight": "model-00004-of-00009.safetensors",
"model.layers.17.self_attn.k_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.17.self_attn.o_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.17.self_attn.q_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.17.self_attn.v_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.18.input_layernorm.weight": "model-00004-of-00009.safetensors",
"model.layers.18.mlp.down_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.18.mlp.gate_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.18.mlp.up_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.18.post_attention_layernorm.weight": "model-00004-of-00009.safetensors",
"model.layers.18.self_attn.k_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.18.self_attn.o_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.18.self_attn.q_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.18.self_attn.v_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.19.input_layernorm.weight": "model-00004-of-00009.safetensors",
"model.layers.19.mlp.down_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.19.mlp.gate_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.19.mlp.up_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.19.post_attention_layernorm.weight": "model-00004-of-00009.safetensors",
"model.layers.19.self_attn.k_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.19.self_attn.o_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.19.self_attn.q_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.19.self_attn.v_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.2.input_layernorm.weight": "model-00001-of-00009.safetensors",
"model.layers.2.mlp.down_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.2.mlp.gate_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.2.mlp.up_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.2.post_attention_layernorm.weight": "model-00001-of-00009.safetensors",
"model.layers.2.self_attn.k_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.2.self_attn.o_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.2.self_attn.q_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.2.self_attn.v_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.20.input_layernorm.weight": "model-00005-of-00009.safetensors",
"model.layers.20.mlp.down_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.20.mlp.gate_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.20.mlp.up_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.20.post_attention_layernorm.weight": "model-00005-of-00009.safetensors",
"model.layers.20.self_attn.k_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.20.self_attn.o_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.20.self_attn.q_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.20.self_attn.v_proj.weight": "model-00004-of-00009.safetensors",
"model.layers.21.input_layernorm.weight": "model-00005-of-00009.safetensors",
"model.layers.21.mlp.down_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.21.mlp.gate_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.21.mlp.up_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.21.post_attention_layernorm.weight": "model-00005-of-00009.safetensors",
"model.layers.21.self_attn.k_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.21.self_attn.o_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.21.self_attn.q_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.21.self_attn.v_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.22.input_layernorm.weight": "model-00005-of-00009.safetensors",
"model.layers.22.mlp.down_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.22.mlp.gate_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.22.mlp.up_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.22.post_attention_layernorm.weight": "model-00005-of-00009.safetensors",
"model.layers.22.self_attn.k_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.22.self_attn.o_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.22.self_attn.q_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.22.self_attn.v_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.23.input_layernorm.weight": "model-00005-of-00009.safetensors",
"model.layers.23.mlp.down_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.23.mlp.gate_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.23.mlp.up_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.23.post_attention_layernorm.weight": "model-00005-of-00009.safetensors",
"model.layers.23.self_attn.k_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.23.self_attn.o_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.23.self_attn.q_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.23.self_attn.v_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.24.input_layernorm.weight": "model-00005-of-00009.safetensors",
"model.layers.24.mlp.down_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.24.mlp.gate_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.24.mlp.up_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.24.post_attention_layernorm.weight": "model-00005-of-00009.safetensors",
"model.layers.24.self_attn.k_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.24.self_attn.o_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.24.self_attn.q_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.24.self_attn.v_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.25.input_layernorm.weight": "model-00005-of-00009.safetensors",
"model.layers.25.mlp.down_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.25.mlp.gate_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.25.mlp.up_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.25.post_attention_layernorm.weight": "model-00005-of-00009.safetensors",
"model.layers.25.self_attn.k_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.25.self_attn.o_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.25.self_attn.q_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.25.self_attn.v_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.26.input_layernorm.weight": "model-00006-of-00009.safetensors",
"model.layers.26.mlp.down_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.26.mlp.gate_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.26.mlp.up_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.26.post_attention_layernorm.weight": "model-00006-of-00009.safetensors",
"model.layers.26.self_attn.k_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.26.self_attn.o_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.26.self_attn.q_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.26.self_attn.v_proj.weight": "model-00005-of-00009.safetensors",
"model.layers.27.input_layernorm.weight": "model-00006-of-00009.safetensors",
"model.layers.27.mlp.down_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.27.mlp.gate_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.27.mlp.up_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.27.post_attention_layernorm.weight": "model-00006-of-00009.safetensors",
"model.layers.27.self_attn.k_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.27.self_attn.o_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.27.self_attn.q_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.27.self_attn.v_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.28.input_layernorm.weight": "model-00006-of-00009.safetensors",
"model.layers.28.mlp.down_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.28.mlp.gate_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.28.mlp.up_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.28.post_attention_layernorm.weight": "model-00006-of-00009.safetensors",
"model.layers.28.self_attn.k_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.28.self_attn.o_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.28.self_attn.q_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.28.self_attn.v_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.29.input_layernorm.weight": "model-00006-of-00009.safetensors",
"model.layers.29.mlp.down_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.29.mlp.gate_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.29.mlp.up_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.29.post_attention_layernorm.weight": "model-00006-of-00009.safetensors",
"model.layers.29.self_attn.k_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.29.self_attn.o_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.29.self_attn.q_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.29.self_attn.v_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.3.input_layernorm.weight": "model-00002-of-00009.safetensors",
"model.layers.3.mlp.down_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.3.mlp.gate_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.3.mlp.up_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.3.post_attention_layernorm.weight": "model-00002-of-00009.safetensors",
"model.layers.3.self_attn.k_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.3.self_attn.o_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.3.self_attn.q_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.3.self_attn.v_proj.weight": "model-00001-of-00009.safetensors",
"model.layers.30.input_layernorm.weight": "model-00006-of-00009.safetensors",
"model.layers.30.mlp.down_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.30.mlp.gate_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.30.mlp.up_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.30.post_attention_layernorm.weight": "model-00006-of-00009.safetensors",
"model.layers.30.self_attn.k_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.30.self_attn.o_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.30.self_attn.q_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.30.self_attn.v_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.31.input_layernorm.weight": "model-00006-of-00009.safetensors",
"model.layers.31.mlp.down_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.31.mlp.gate_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.31.mlp.up_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.31.post_attention_layernorm.weight": "model-00006-of-00009.safetensors",
"model.layers.31.self_attn.k_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.31.self_attn.o_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.31.self_attn.q_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.31.self_attn.v_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.32.input_layernorm.weight": "model-00007-of-00009.safetensors",
"model.layers.32.mlp.down_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.32.mlp.gate_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.32.mlp.up_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.32.post_attention_layernorm.weight": "model-00007-of-00009.safetensors",
"model.layers.32.self_attn.k_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.32.self_attn.o_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.32.self_attn.q_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.32.self_attn.v_proj.weight": "model-00006-of-00009.safetensors",
"model.layers.33.input_layernorm.weight": "model-00007-of-00009.safetensors",
"model.layers.33.mlp.down_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.33.mlp.gate_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.33.mlp.up_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.33.post_attention_layernorm.weight": "model-00007-of-00009.safetensors",
"model.layers.33.self_attn.k_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.33.self_attn.o_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.33.self_attn.q_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.33.self_attn.v_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.34.input_layernorm.weight": "model-00007-of-00009.safetensors",
"model.layers.34.mlp.down_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.34.mlp.gate_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.34.mlp.up_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.34.post_attention_layernorm.weight": "model-00007-of-00009.safetensors",
"model.layers.34.self_attn.k_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.34.self_attn.o_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.34.self_attn.q_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.34.self_attn.v_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.35.input_layernorm.weight": "model-00007-of-00009.safetensors",
"model.layers.35.mlp.down_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.35.mlp.gate_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.35.mlp.up_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.35.post_attention_layernorm.weight": "model-00007-of-00009.safetensors",
"model.layers.35.self_attn.k_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.35.self_attn.o_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.35.self_attn.q_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.35.self_attn.v_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.36.input_layernorm.weight": "model-00007-of-00009.safetensors",
"model.layers.36.mlp.down_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.36.mlp.gate_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.36.mlp.up_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.36.post_attention_layernorm.weight": "model-00007-of-00009.safetensors",
"model.layers.36.self_attn.k_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.36.self_attn.o_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.36.self_attn.q_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.36.self_attn.v_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.37.input_layernorm.weight": "model-00008-of-00009.safetensors",
"model.layers.37.mlp.down_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.37.mlp.gate_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.37.mlp.up_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.37.post_attention_layernorm.weight": "model-00008-of-00009.safetensors",
"model.layers.37.self_attn.k_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.37.self_attn.o_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.37.self_attn.q_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.37.self_attn.v_proj.weight": "model-00007-of-00009.safetensors",
"model.layers.38.input_layernorm.weight": "model-00008-of-00009.safetensors",
"model.layers.38.mlp.down_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.38.mlp.gate_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.38.mlp.up_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.38.post_attention_layernorm.weight": "model-00008-of-00009.safetensors",
"model.layers.38.self_attn.k_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.38.self_attn.o_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.38.self_attn.q_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.38.self_attn.v_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.39.input_layernorm.weight": "model-00008-of-00009.safetensors",
"model.layers.39.mlp.down_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.39.mlp.gate_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.39.mlp.up_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.39.post_attention_layernorm.weight": "model-00008-of-00009.safetensors",
"model.layers.39.self_attn.k_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.39.self_attn.o_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.39.self_attn.q_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.39.self_attn.v_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.4.input_layernorm.weight": "model-00002-of-00009.safetensors",
"model.layers.4.mlp.down_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.4.mlp.gate_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.4.mlp.up_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.4.post_attention_layernorm.weight": "model-00002-of-00009.safetensors",
"model.layers.4.self_attn.k_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.4.self_attn.o_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.4.self_attn.q_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.4.self_attn.v_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.40.input_layernorm.weight": "model-00008-of-00009.safetensors",
"model.layers.40.mlp.down_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.40.mlp.gate_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.40.mlp.up_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.40.post_attention_layernorm.weight": "model-00008-of-00009.safetensors",
"model.layers.40.self_attn.k_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.40.self_attn.o_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.40.self_attn.q_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.40.self_attn.v_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.41.input_layernorm.weight": "model-00008-of-00009.safetensors",
"model.layers.41.mlp.down_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.41.mlp.gate_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.41.mlp.up_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.41.post_attention_layernorm.weight": "model-00008-of-00009.safetensors",
"model.layers.41.self_attn.k_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.41.self_attn.o_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.41.self_attn.q_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.41.self_attn.v_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.42.input_layernorm.weight": "model-00008-of-00009.safetensors",
"model.layers.42.mlp.down_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.42.mlp.gate_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.42.mlp.up_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.42.post_attention_layernorm.weight": "model-00008-of-00009.safetensors",
"model.layers.42.self_attn.k_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.42.self_attn.o_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.42.self_attn.q_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.42.self_attn.v_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.43.input_layernorm.weight": "model-00009-of-00009.safetensors",
"model.layers.43.mlp.down_proj.weight": "model-00009-of-00009.safetensors",
"model.layers.43.mlp.gate_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.43.mlp.up_proj.weight": "model-00009-of-00009.safetensors",
"model.layers.43.post_attention_layernorm.weight": "model-00009-of-00009.safetensors",
"model.layers.43.self_attn.k_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.43.self_attn.o_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.43.self_attn.q_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.43.self_attn.v_proj.weight": "model-00008-of-00009.safetensors",
"model.layers.44.input_layernorm.weight": "model-00009-of-00009.safetensors",
"model.layers.44.mlp.down_proj.weight": "model-00009-of-00009.safetensors",
"model.layers.44.mlp.gate_proj.weight": "model-00009-of-00009.safetensors",
"model.layers.44.mlp.up_proj.weight": "model-00009-of-00009.safetensors",
"model.layers.44.post_attention_layernorm.weight": "model-00009-of-00009.safetensors",
"model.layers.44.self_attn.k_proj.weight": "model-00009-of-00009.safetensors",
"model.layers.44.self_attn.o_proj.weight": "model-00009-of-00009.safetensors",
"model.layers.44.self_attn.q_proj.weight": "model-00009-of-00009.safetensors",
"model.layers.44.self_attn.v_proj.weight": "model-00009-of-00009.safetensors",
"model.layers.5.input_layernorm.weight": "model-00002-of-00009.safetensors",
"model.layers.5.mlp.down_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.5.mlp.gate_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.5.mlp.up_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.5.post_attention_layernorm.weight": "model-00002-of-00009.safetensors",
"model.layers.5.self_attn.k_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.5.self_attn.o_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.5.self_attn.q_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.5.self_attn.v_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.6.input_layernorm.weight": "model-00002-of-00009.safetensors",
"model.layers.6.mlp.down_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.6.mlp.gate_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.6.mlp.up_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.6.post_attention_layernorm.weight": "model-00002-of-00009.safetensors",
"model.layers.6.self_attn.k_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.6.self_attn.o_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.6.self_attn.q_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.6.self_attn.v_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.7.input_layernorm.weight": "model-00002-of-00009.safetensors",
"model.layers.7.mlp.down_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.7.mlp.gate_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.7.mlp.up_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.7.post_attention_layernorm.weight": "model-00002-of-00009.safetensors",
"model.layers.7.self_attn.k_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.7.self_attn.o_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.7.self_attn.q_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.7.self_attn.v_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.8.input_layernorm.weight": "model-00002-of-00009.safetensors",
"model.layers.8.mlp.down_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.8.mlp.gate_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.8.mlp.up_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.8.post_attention_layernorm.weight": "model-00002-of-00009.safetensors",
"model.layers.8.self_attn.k_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.8.self_attn.o_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.8.self_attn.q_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.8.self_attn.v_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.9.input_layernorm.weight": "model-00003-of-00009.safetensors",
"model.layers.9.mlp.down_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.9.mlp.gate_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.9.mlp.up_proj.weight": "model-00003-of-00009.safetensors",
"model.layers.9.post_attention_layernorm.weight": "model-00003-of-00009.safetensors",
"model.layers.9.self_attn.k_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.9.self_attn.o_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.9.self_attn.q_proj.weight": "model-00002-of-00009.safetensors",
"model.layers.9.self_attn.v_proj.weight": "model-00002-of-00009.safetensors",
"model.norm.weight": "model-00009-of-00009.safetensors"
}
}

30
special_tokens_map.json Normal file
View File

@@ -0,0 +1,30 @@
{
"bos_token": {
"content": "<|endoftext|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"eos_token": {
"content": "<|im_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"pad_token": {
"content": "<|endoftext|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"unk_token": {
"content": "<|endoftext|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
}
}

3
tokenizer.json Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:bbd5f2b426173b0216d685cb834c0a69a77af59a362539dd4382f915b6383e51
size 7133809

70
tokenizer_config.json Normal file
View File

@@ -0,0 +1,70 @@
{
"add_prefix_space": false,
"added_tokens_decoder": {
"100257": {
"content": "<|endoftext|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"100258": {
"content": "<|fim_prefix|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"100259": {
"content": "<|fim_middle|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"100260": {
"content": "<|fim_suffix|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"100264": {
"content": "<|im_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"100265": {
"content": "<|im_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"100276": {
"content": "<|endofprompt|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
}
},
"bos_token": "<|endoftext|>",
"chat_template": "{% if not add_generation_prompt is defined %}{% set add_generation_prompt = false %}{% endif %}{% for message in messages %}{{'<|im_start|>' + message['role'] + '\n' + message['content'] + '<|im_end|>' + '\n'}}{% endfor %}{% if add_generation_prompt %}{{ '<|im_start|>assistant\n' }}{% endif %}",
"clean_up_tokenization_spaces": false,
"eos_token": "<|im_end|>",
"extra_special_tokens": {},
"model_max_length": 262144,
"pad_token": "<|endoftext|>",
"tokenizer_class": "GPT2Tokenizer",
"unk_token": "<|endoftext|>"
}

3
vocab.json Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:240b7e18e79826df8c0dbeff7133a3ab4708d7958fede6e27e9409e09159375f
size 1610691