初始化项目,由ModelHub XC社区提供模型

Model: sapienzanlp/modello-italia-9b-bf16
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-07-24 18:38:10 +08:00
commit 3a5cd2396a
14 changed files with 158732 additions and 0 deletions

35
.gitattributes vendored Normal file
View File

@@ -0,0 +1,35 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
*.safetensors filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text

93
README.md Normal file
View File

@@ -0,0 +1,93 @@
---
license: mit
language:
- it
---
# Model Card for Modello Italia 9B
This is our UNOFFICIAL conversion of the OFFICIAL model checkpoint of *"Modello Italia 9B"*, the first Large Language Model (LLM) developed by [iGenius](https://it.igenius.ai/) in collaboration [CINECA](https://www.cineca.it/).
* More information about Modello Italia: [click here](https://it.igenius.ai/language-models).
## 🚨 Disclaimers
* This is an UNOFFICIAL conversion of the OFFICIAL model checkpoint released by iGenius.
* The original model was developed using LitGPT, therefore, the weights need to be converted before they can be used with Hugging Face transformers.
* **Note:** By using this model, you accept the iGenius' [**terms and conditions**](https://secure.igenius.ai/legal/italia_terms_and_conditions.pdf).
## 🚨 Biases and Risks
From the terms and conditions of iGenius for Modello Italia:
> Modello Italia è concepito per essere utilizzato da tutti e per adattarsi a una vasta gamma di casi
d'uso. È stato progettato con l'obiettivo di essere accessibile a persone provenienti da
background, esperienze e prospettive diverse. Modello Italia si rivolge agli utenti e alle loro
esigenze senza inserire giudizi superflui o normative, riconoscendo al contempo che anche
contenuti potenzialmente problematici in determinati contesti possono avere scopi validi in altri.
Il rispetto per la dignità e l'autonomia di tutti gli utenti, specialmente in termini di libertà di
pensiero ed espressione, è un pilastro fondamentale del suo design. Tuttavia, essendo una nuova
tecnologia, Modello Italia comporta rischi legati al suo utilizzo. I test condotti finora sono stati
eseguiti in italiano e non hanno potuto coprire tutte le possibili situazioni. Pertanto, come per
tutti gli LLM, non è possibile prevedere in anticipo gli output di Modello Italia e il modello
potrebbe in alcuni casi generare risposte imprecise, tendenziose o altre risposte discutibili. Prima
di utilizzare Modello Italia in qualsiasi contesto, gli sviluppatori sono fortemente incoraggiati a
eseguire test di sicurezza e adattamento specifici per le loro applicazioni.
We are aware of the biases and potential problematic/toxic content that current pretrained large language models exhibit: more specifically, as probabilistic models of (Italian and English) languages, they reflect and amplify the biases of their training data.
For more information about this issue, please refer to our survey paper:
* [Biases in Large Language Models: Origins, Inventory, and Discussion](https://dl.acm.org/doi/full/10.1145/3597307)
## Training dataset
The following information is based on the information we could gather, that is, it is NOT official.
Please take it with a pinch of salt as we continue to study Modello Italia.
* **The training data of Modello Italia is unknown;**
* Modello Italia is probably trained on around 1T tokens of Italian text;
* We know that the training data is mostly Italian text and source code;
* We know that the training data includes text from Editoria Nazionale.
## Tokenizer
The following information is based on the information we could gather, that is, it is NOT official.
Please take it with a pinch of salt as we continue to study Modello Italia.
* The tokenizer is **vanilla SentencePiece**, probably trained from scratch on Italian data;
* Vocabulary size is 50000.
## Model architecture
The following information is based on the information we could gather, that is, it is NOT official.
Please take it with a pinch of salt as we continue to study Modello Italia.
* The model architecture is **based on GPT-NeoX**.
## Results
Modello Italia 9B has not been evaluated on standard benchmarks yet.
We will update this model card with the results soon.
* **Want to contribute to the evaluation?** Submit a pull request!
## How to use Modello Italia with Hugging Face transformers
```python
import torch
import transformers as tr
device = "cuda" if torch.cuda.is_available() else "cpu"
tokenizer = tr.AutoTokenizer.from_pretrained("sapienzanlp/modello-italia-9b-bf16")
model = tr.AutoModelForCausalLM.from_pretrained(
"sapienzanlp/modello-italia-9b-bf16",
device_map=device,
torch_dtype=torch.bfloat16
)
MY_SYSTEM_PROMPT_SHORT = (
"Tu sei Modello Italia, un modello di linguaggio naturale addestrato da iGenius."
)
prompt = "Ciao, chi sei?"
messages = [
{"role": "system", "content": MY_SYSTEM_PROMPT_SHORT},
{"role": "user", "content": prompt},
]
tokenized_chat = tokenizer.apply_chat_template(
messages, tokenize=True, add_generation_prompt=True, return_tensors="pt"
).to(device)
out = model.generate(
tokenized_chat,
max_new_tokens=200,
do_sample=False
)
```

32
config.json Normal file
View File

@@ -0,0 +1,32 @@
{
"_name_or_path": "sapienzanlp/modello-italia-9b",
"architectures": [
"GPTNeoXForCausalLM"
],
"attention_bias": true,
"attention_dropout": 0.0,
"attention_probs_dropout_prob": 0,
"bos_token_id": 0,
"classifier_dropout": 0.1,
"eos_token_id": 0,
"hidden_act": "gelu_fast",
"hidden_dropout": 0.0,
"hidden_dropout_prob": 0,
"hidden_size": 5120,
"initializer_range": 0.02,
"intermediate_size": 12800,
"layer_norm_eps": 1e-05,
"max_position_embeddings": 4096,
"model_type": "gpt_neox",
"num_attention_heads": 32,
"num_hidden_layers": 34,
"rope_scaling": null,
"rotary_emb_base": 10000,
"rotary_pct": 0.4,
"tie_word_embeddings": false,
"torch_dtype": "bfloat16",
"transformers_version": "4.40.1",
"use_cache": true,
"use_parallel_residual": true,
"vocab_size": 50176
}

6
generation_config.json Normal file
View File

@@ -0,0 +1,6 @@
{
"_from_model_config": true,
"bos_token_id": 0,
"eos_token_id": 0,
"transformers_version": "4.40.1"
}

Binary file not shown.

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:fd529a9d1fed07e27216eb5de076d05dccfe51d30e0021afedd0a64750cdec94
size 4971405904

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:b8a75b44f6a45f90fd1588cde33e69e1f138bd3141181b34b7ddea8a2812f9ee
size 4982005704

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:0af109ddd22605e3485993fac649e2a117c2ff6bca2614b545ef83687a08f22e
size 4929540616

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:47b63db1a2e2d89d9a063098d6e22698a81e5356e36344cb045d16a1921a94f2
size 2191938544

View File

@@ -0,0 +1,419 @@
{
"metadata": {
"total_size": 17074841600
},
"weight_map": {
"embed_out.weight": "model-00004-of-00004.safetensors",
"gpt_neox.embed_in.weight": "model-00001-of-00004.safetensors",
"gpt_neox.final_layer_norm.bias": "model-00004-of-00004.safetensors",
"gpt_neox.final_layer_norm.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.0.attention.dense.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.0.attention.dense.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.0.attention.query_key_value.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.0.attention.query_key_value.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.0.input_layernorm.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.0.input_layernorm.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.0.mlp.dense_4h_to_h.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.0.mlp.dense_4h_to_h.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.0.mlp.dense_h_to_4h.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.0.mlp.dense_h_to_4h.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.0.post_attention_layernorm.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.0.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.1.attention.dense.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.1.attention.dense.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.1.attention.query_key_value.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.1.attention.query_key_value.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.1.input_layernorm.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.1.input_layernorm.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.1.mlp.dense_4h_to_h.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.1.mlp.dense_4h_to_h.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.1.mlp.dense_h_to_4h.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.1.mlp.dense_h_to_4h.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.1.post_attention_layernorm.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.1.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.10.attention.dense.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.10.attention.dense.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.10.attention.query_key_value.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.10.attention.query_key_value.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.10.input_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.10.input_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.10.mlp.dense_4h_to_h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.10.mlp.dense_4h_to_h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.10.mlp.dense_h_to_4h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.10.mlp.dense_h_to_4h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.10.post_attention_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.10.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.11.attention.dense.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.11.attention.dense.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.11.attention.query_key_value.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.11.attention.query_key_value.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.11.input_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.11.input_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.11.mlp.dense_4h_to_h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.11.mlp.dense_4h_to_h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.11.mlp.dense_h_to_4h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.11.mlp.dense_h_to_4h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.11.post_attention_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.11.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.12.attention.dense.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.12.attention.dense.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.12.attention.query_key_value.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.12.attention.query_key_value.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.12.input_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.12.input_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.12.mlp.dense_4h_to_h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.12.mlp.dense_4h_to_h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.12.mlp.dense_h_to_4h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.12.mlp.dense_h_to_4h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.12.post_attention_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.12.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.13.attention.dense.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.13.attention.dense.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.13.attention.query_key_value.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.13.attention.query_key_value.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.13.input_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.13.input_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.13.mlp.dense_4h_to_h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.13.mlp.dense_4h_to_h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.13.mlp.dense_h_to_4h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.13.mlp.dense_h_to_4h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.13.post_attention_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.13.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.14.attention.dense.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.14.attention.dense.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.14.attention.query_key_value.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.14.attention.query_key_value.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.14.input_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.14.input_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.14.mlp.dense_4h_to_h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.14.mlp.dense_4h_to_h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.14.mlp.dense_h_to_4h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.14.mlp.dense_h_to_4h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.14.post_attention_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.14.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.15.attention.dense.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.15.attention.dense.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.15.attention.query_key_value.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.15.attention.query_key_value.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.15.input_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.15.input_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.15.mlp.dense_4h_to_h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.15.mlp.dense_4h_to_h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.15.mlp.dense_h_to_4h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.15.mlp.dense_h_to_4h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.15.post_attention_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.15.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.16.attention.dense.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.16.attention.dense.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.16.attention.query_key_value.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.16.attention.query_key_value.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.16.input_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.16.input_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.16.mlp.dense_4h_to_h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.16.mlp.dense_4h_to_h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.16.mlp.dense_h_to_4h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.16.mlp.dense_h_to_4h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.16.post_attention_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.16.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.17.attention.dense.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.17.attention.dense.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.17.attention.query_key_value.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.17.attention.query_key_value.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.17.input_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.17.input_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.17.mlp.dense_4h_to_h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.17.mlp.dense_4h_to_h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.17.mlp.dense_h_to_4h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.17.mlp.dense_h_to_4h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.17.post_attention_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.17.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.18.attention.dense.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.18.attention.dense.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.18.attention.query_key_value.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.18.attention.query_key_value.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.18.input_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.18.input_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.18.mlp.dense_4h_to_h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.18.mlp.dense_4h_to_h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.18.mlp.dense_h_to_4h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.18.mlp.dense_h_to_4h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.18.post_attention_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.18.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.19.attention.dense.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.19.attention.dense.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.19.attention.query_key_value.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.19.attention.query_key_value.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.19.input_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.19.input_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.19.mlp.dense_4h_to_h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.19.mlp.dense_4h_to_h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.19.mlp.dense_h_to_4h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.19.mlp.dense_h_to_4h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.19.post_attention_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.19.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.2.attention.dense.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.2.attention.dense.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.2.attention.query_key_value.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.2.attention.query_key_value.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.2.input_layernorm.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.2.input_layernorm.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.2.mlp.dense_4h_to_h.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.2.mlp.dense_4h_to_h.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.2.mlp.dense_h_to_4h.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.2.mlp.dense_h_to_4h.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.2.post_attention_layernorm.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.2.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.20.attention.dense.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.20.attention.dense.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.20.attention.query_key_value.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.20.attention.query_key_value.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.20.input_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.20.input_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.20.mlp.dense_4h_to_h.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.20.mlp.dense_4h_to_h.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.20.mlp.dense_h_to_4h.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.20.mlp.dense_h_to_4h.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.20.post_attention_layernorm.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.20.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.21.attention.dense.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.21.attention.dense.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.21.attention.query_key_value.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.21.attention.query_key_value.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.21.input_layernorm.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.21.mlp.dense_4h_to_h.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.21.mlp.dense_4h_to_h.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.21.mlp.dense_h_to_4h.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.21.mlp.dense_h_to_4h.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.21.post_attention_layernorm.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.21.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.22.attention.dense.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.22.attention.dense.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.22.attention.query_key_value.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.22.attention.query_key_value.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.22.input_layernorm.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.22.input_layernorm.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.22.mlp.dense_4h_to_h.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.22.mlp.dense_4h_to_h.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.22.mlp.dense_h_to_4h.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.22.mlp.dense_h_to_4h.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.22.post_attention_layernorm.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.22.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.23.attention.dense.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.23.attention.dense.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.23.attention.query_key_value.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.23.attention.query_key_value.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.23.input_layernorm.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.23.input_layernorm.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.23.mlp.dense_4h_to_h.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.23.mlp.dense_4h_to_h.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.23.mlp.dense_h_to_4h.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.23.mlp.dense_h_to_4h.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.23.post_attention_layernorm.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.23.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.24.attention.dense.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.24.attention.dense.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.24.attention.query_key_value.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.24.attention.query_key_value.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.24.input_layernorm.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.24.input_layernorm.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.24.mlp.dense_4h_to_h.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.24.mlp.dense_4h_to_h.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.24.mlp.dense_h_to_4h.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.24.mlp.dense_h_to_4h.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.24.post_attention_layernorm.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.24.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.25.attention.dense.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.25.attention.dense.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.25.attention.query_key_value.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.25.attention.query_key_value.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.25.input_layernorm.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.25.input_layernorm.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.25.mlp.dense_4h_to_h.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.25.mlp.dense_4h_to_h.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.25.mlp.dense_h_to_4h.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.25.mlp.dense_h_to_4h.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.25.post_attention_layernorm.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.25.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.26.attention.dense.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.26.attention.dense.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.26.attention.query_key_value.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.26.attention.query_key_value.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.26.input_layernorm.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.26.input_layernorm.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.26.mlp.dense_4h_to_h.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.26.mlp.dense_4h_to_h.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.26.mlp.dense_h_to_4h.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.26.mlp.dense_h_to_4h.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.26.post_attention_layernorm.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.26.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.27.attention.dense.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.27.attention.dense.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.27.attention.query_key_value.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.27.attention.query_key_value.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.27.input_layernorm.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.27.input_layernorm.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.27.mlp.dense_4h_to_h.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.27.mlp.dense_4h_to_h.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.27.mlp.dense_h_to_4h.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.27.mlp.dense_h_to_4h.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.27.post_attention_layernorm.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.27.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.28.attention.dense.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.28.attention.dense.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.28.attention.query_key_value.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.28.attention.query_key_value.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.28.input_layernorm.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.28.input_layernorm.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.28.mlp.dense_4h_to_h.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.28.mlp.dense_4h_to_h.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.28.mlp.dense_h_to_4h.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.28.mlp.dense_h_to_4h.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.28.post_attention_layernorm.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.28.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.29.attention.dense.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.29.attention.dense.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.29.attention.query_key_value.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.29.attention.query_key_value.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.29.input_layernorm.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.29.input_layernorm.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.29.mlp.dense_4h_to_h.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.29.mlp.dense_4h_to_h.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.29.mlp.dense_h_to_4h.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.29.mlp.dense_h_to_4h.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.29.post_attention_layernorm.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.29.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.3.attention.dense.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.3.attention.dense.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.3.attention.query_key_value.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.3.attention.query_key_value.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.3.input_layernorm.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.3.input_layernorm.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.3.mlp.dense_4h_to_h.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.3.mlp.dense_4h_to_h.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.3.mlp.dense_h_to_4h.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.3.mlp.dense_h_to_4h.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.3.post_attention_layernorm.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.3.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.30.attention.dense.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.30.attention.dense.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.30.attention.query_key_value.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.30.attention.query_key_value.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.30.input_layernorm.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.30.input_layernorm.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.30.mlp.dense_4h_to_h.bias": "model-00004-of-00004.safetensors",
"gpt_neox.layers.30.mlp.dense_4h_to_h.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.30.mlp.dense_h_to_4h.bias": "model-00004-of-00004.safetensors",
"gpt_neox.layers.30.mlp.dense_h_to_4h.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.30.post_attention_layernorm.bias": "model-00003-of-00004.safetensors",
"gpt_neox.layers.30.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"gpt_neox.layers.31.attention.dense.bias": "model-00004-of-00004.safetensors",
"gpt_neox.layers.31.attention.dense.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.31.attention.query_key_value.bias": "model-00004-of-00004.safetensors",
"gpt_neox.layers.31.attention.query_key_value.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.31.input_layernorm.bias": "model-00004-of-00004.safetensors",
"gpt_neox.layers.31.input_layernorm.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.31.mlp.dense_4h_to_h.bias": "model-00004-of-00004.safetensors",
"gpt_neox.layers.31.mlp.dense_4h_to_h.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.31.mlp.dense_h_to_4h.bias": "model-00004-of-00004.safetensors",
"gpt_neox.layers.31.mlp.dense_h_to_4h.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.31.post_attention_layernorm.bias": "model-00004-of-00004.safetensors",
"gpt_neox.layers.31.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.32.attention.dense.bias": "model-00004-of-00004.safetensors",
"gpt_neox.layers.32.attention.dense.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.32.attention.query_key_value.bias": "model-00004-of-00004.safetensors",
"gpt_neox.layers.32.attention.query_key_value.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.32.input_layernorm.bias": "model-00004-of-00004.safetensors",
"gpt_neox.layers.32.input_layernorm.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.32.mlp.dense_4h_to_h.bias": "model-00004-of-00004.safetensors",
"gpt_neox.layers.32.mlp.dense_4h_to_h.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.32.mlp.dense_h_to_4h.bias": "model-00004-of-00004.safetensors",
"gpt_neox.layers.32.mlp.dense_h_to_4h.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.32.post_attention_layernorm.bias": "model-00004-of-00004.safetensors",
"gpt_neox.layers.32.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.33.attention.dense.bias": "model-00004-of-00004.safetensors",
"gpt_neox.layers.33.attention.dense.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.33.attention.query_key_value.bias": "model-00004-of-00004.safetensors",
"gpt_neox.layers.33.attention.query_key_value.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.33.input_layernorm.bias": "model-00004-of-00004.safetensors",
"gpt_neox.layers.33.input_layernorm.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.33.mlp.dense_4h_to_h.bias": "model-00004-of-00004.safetensors",
"gpt_neox.layers.33.mlp.dense_4h_to_h.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.33.mlp.dense_h_to_4h.bias": "model-00004-of-00004.safetensors",
"gpt_neox.layers.33.mlp.dense_h_to_4h.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.33.post_attention_layernorm.bias": "model-00004-of-00004.safetensors",
"gpt_neox.layers.33.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
"gpt_neox.layers.4.attention.dense.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.4.attention.dense.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.4.attention.query_key_value.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.4.attention.query_key_value.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.4.input_layernorm.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.4.input_layernorm.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.4.mlp.dense_4h_to_h.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.4.mlp.dense_4h_to_h.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.4.mlp.dense_h_to_4h.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.4.mlp.dense_h_to_4h.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.4.post_attention_layernorm.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.4.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.5.attention.dense.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.5.attention.dense.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.5.attention.query_key_value.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.5.attention.query_key_value.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.5.input_layernorm.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.5.input_layernorm.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.5.mlp.dense_4h_to_h.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.5.mlp.dense_4h_to_h.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.5.mlp.dense_h_to_4h.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.5.mlp.dense_h_to_4h.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.5.post_attention_layernorm.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.5.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.6.attention.dense.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.6.attention.dense.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.6.attention.query_key_value.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.6.attention.query_key_value.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.6.input_layernorm.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.6.input_layernorm.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.6.mlp.dense_4h_to_h.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.6.mlp.dense_4h_to_h.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.6.mlp.dense_h_to_4h.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.6.mlp.dense_h_to_4h.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.6.post_attention_layernorm.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.6.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.7.attention.dense.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.7.attention.dense.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.7.attention.query_key_value.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.7.attention.query_key_value.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.7.input_layernorm.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.7.input_layernorm.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.7.mlp.dense_4h_to_h.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.7.mlp.dense_4h_to_h.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.7.mlp.dense_h_to_4h.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.7.mlp.dense_h_to_4h.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.7.post_attention_layernorm.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.7.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.8.attention.dense.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.8.attention.dense.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.8.attention.query_key_value.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.8.attention.query_key_value.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.8.input_layernorm.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.8.input_layernorm.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.8.mlp.dense_4h_to_h.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.8.mlp.dense_4h_to_h.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.8.mlp.dense_h_to_4h.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.8.mlp.dense_h_to_4h.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.8.post_attention_layernorm.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.8.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.9.attention.dense.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.9.attention.dense.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.9.attention.query_key_value.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.9.attention.query_key_value.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.9.input_layernorm.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.9.input_layernorm.weight": "model-00001-of-00004.safetensors",
"gpt_neox.layers.9.mlp.dense_4h_to_h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.9.mlp.dense_4h_to_h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.9.mlp.dense_h_to_4h.bias": "model-00002-of-00004.safetensors",
"gpt_neox.layers.9.mlp.dense_h_to_4h.weight": "model-00002-of-00004.safetensors",
"gpt_neox.layers.9.post_attention_layernorm.bias": "model-00001-of-00004.safetensors",
"gpt_neox.layers.9.post_attention_layernorm.weight": "model-00001-of-00004.safetensors"
}
}

23
special_tokens_map.json Normal file
View File

@@ -0,0 +1,23 @@
{
"bos_token": {
"content": "<s>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"eos_token": {
"content": "</s>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"unk_token": {
"content": "<unk>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
}
}

158066
tokenizer.json Normal file

File diff suppressed because it is too large Load Diff

3
tokenizer.model Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:bd74bea2ba620d87e0a2127d9a21196b862a5cc7942ba4638eb2159bbab3340c
size 1090536

43
tokenizer_config.json Normal file
View File

@@ -0,0 +1,43 @@
{
"add_bos_token": true,
"add_eos_token": false,
"add_prefix_space": true,
"added_tokens_decoder": {
"0": {
"content": "<unk>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"1": {
"content": "<s>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"2": {
"content": "</s>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
}
},
"bos_token": "<s>",
"chat_template": "{% for message in messages %}\n{% if message['role'] == 'user' %}\n{{ '<|user|>\n' + message['content'] + eos_token }}\n{% elif message['role'] == 'system' %}\n{{ '<|system|>\n' + message['content'] + eos_token }}\n{% elif message['role'] == 'assistant' %}\n{{ '<|assistant|>\n' + message['content'] + eos_token }}\n{% endif %}\n{% if loop.last and add_generation_prompt %}\n{{ '<|assistant|>' }}\n{% endif %}\n{% endfor %}",
"clean_up_tokenization_spaces": false,
"eos_token": "</s>",
"legacy": true,
"model_max_length": 1000000000000000019884624838656,
"pad_token": null,
"sp_model_kwargs": {},
"spaces_between_special_tokens": false,
"tokenizer_class": "LlamaTokenizer",
"unk_token": "<unk>",
"use_default_system_prompt": false
}