commit b2530d809fd0286215e64af7e9ea9c8349b3d891 Author: ModelHub XC Date: Mon Aug 10 10:55:13 2026 +0800 初始化项目,由ModelHub XC社区提供模型 Model: mncai/Polyglot5.8B-ShareGPT-Wiki-News_epoch4 Source: Original Platform diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..5462e63 --- /dev/null +++ b/.gitattributes @@ -0,0 +1,52 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text + + +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text + +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zstandard filter=lfs diff=lfs merge=lfs -text +*.tfevents* filter=lfs diff=lfs merge=lfs -text +*.db* filter=lfs diff=lfs merge=lfs -text +*.ark* filter=lfs diff=lfs merge=lfs -text +**/*ckpt*data* filter=lfs diff=lfs merge=lfs -text +**/*ckpt*.meta filter=lfs diff=lfs merge=lfs -text +**/*ckpt*.index filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.gguf* filter=lfs diff=lfs merge=lfs -text +*.ggml filter=lfs diff=lfs merge=lfs -text +*.llamafile* filter=lfs diff=lfs merge=lfs -text +*.pt2 filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text + +pytorch_model-00002-of-00003.bin filter=lfs diff=lfs merge=lfs -text +pytorch_model-00001-of-00003.bin filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text +pytorch_model-00003-of-00003.bin filter=lfs diff=lfs merge=lfs -text \ No newline at end of file diff --git a/README.md b/README.md new file mode 100644 index 0000000..745f194 --- /dev/null +++ b/README.md @@ -0,0 +1,48 @@ +--- +license: Apache License 2.0 +tags: [] + +#model-type: +##如 gpt、phi、llama、chatglm、baichuan 等 +#- gpt + +#domain: +##如 nlp、cv、audio、multi-modal +#- nlp + +#language: +##语言代码列表 https://help.aliyun.com/document_detail/215387.html?spm=a2c4g.11186623.0.0.9f8d7467kni6Aa +#- cn + +#metrics: +##如 CIDEr、Blue、ROUGE 等 +#- CIDEr + +#tags: +##各种自定义,包括 pretrained、fine-tuned、instruction-tuned、RL-tuned 等训练方法和其他 +#- pretrained + +#tools: +##如 vllm、fastchat、llamacpp、AdaSeq 等 +#- vllm +--- +### 当前模型的贡献者未提供更加详细的模型介绍。模型文件和权重,可浏览“模型文件”页面获取。 +#### 您可以通过如下git clone命令,或者ModelScope SDK来下载模型 + +SDK下载 +```bash +#安装ModelScope +pip install modelscope +``` +```python +#SDK模型下载 +from modelscope import snapshot_download +model_dir = snapshot_download('mncai/Polyglot5.8B-ShareGPT-Wiki-News_epoch4') +``` +Git下载 +``` +#Git模型下载 +git clone https://www.modelscope.cn/mncai/Polyglot5.8B-ShareGPT-Wiki-News_epoch4.git +``` + +

如果您是本模型的贡献者,我们邀请您根据模型贡献文档,及时完善模型卡片内容。

\ No newline at end of file diff --git a/config.json b/config.json new file mode 100644 index 0000000..0560427 --- /dev/null +++ b/config.json @@ -0,0 +1,26 @@ +{ + "_name_or_path": "/opt/finetuning_checkpoint/polyglot-5.8b-sharegpt_wiki_news/checkpoint-29496", + "architectures": [ + "GPTNeoXForCausalLM" + ], + "bos_token_id": 0, + "eos_token_id": 0, + "hidden_act": "gelu", + "hidden_size": 4096, + "initializer_range": 0.02, + "intermediate_size": 16384, + "layer_norm_eps": 1e-05, + "max_position_embeddings": 2048, + "model_type": "gpt_neox", + "num_attention_heads": 16, + "num_hidden_layers": 28, + "num_steps": "global_step320000", + "rotary_emb_base": 10000, + "rotary_pct": 0.25, + "tie_word_embeddings": false, + "torch_dtype": "float32", + "transformers_version": "4.28.1", + "use_cache": true, + "use_parallel_residual": true, + "vocab_size": 30080 +} diff --git a/configuration.json b/configuration.json new file mode 100644 index 0000000..bbeeda1 --- /dev/null +++ b/configuration.json @@ -0,0 +1 @@ +{"framework": "pytorch", "task": "text-generation", "allow_remote": true} \ No newline at end of file diff --git a/generation_config.json b/generation_config.json new file mode 100644 index 0000000..15744c3 --- /dev/null +++ b/generation_config.json @@ -0,0 +1,6 @@ +{ + "_from_model_config": true, + "bos_token_id": 0, + "eos_token_id": 2, + "transformers_version": "4.28.1" +} diff --git a/pytorch_model-00001-of-00003.bin b/pytorch_model-00001-of-00003.bin new file mode 100644 index 0000000..e2a8c0d --- /dev/null +++ b/pytorch_model-00001-of-00003.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:02f24276c760bad3073257e8ee9db56705780eda112c420dd0a57a1be5186f79 +size 9941006216 diff --git a/pytorch_model-00002-of-00003.bin b/pytorch_model-00002-of-00003.bin new file mode 100644 index 0000000..6fb477e --- /dev/null +++ b/pytorch_model-00002-of-00003.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:138559fd67280aac13b3a51e8adcfd67da4527c919228a7cccd29d091c37976d +size 9989342774 diff --git a/pytorch_model-00003-of-00003.bin b/pytorch_model-00003-of-00003.bin new file mode 100644 index 0000000..1a3ec11 --- /dev/null +++ b/pytorch_model-00003-of-00003.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1961fc3cad84ca22ee644b535fd9200d334f35987a07e203e4fbc39106b9691b +size 3727477503 diff --git a/pytorch_model.bin.index.json b/pytorch_model.bin.index.json new file mode 100644 index 0000000..84b6dbc --- /dev/null +++ b/pytorch_model.bin.index.json @@ -0,0 +1,431 @@ +{ + "metadata": { + "total_size": 23554920048.0 + }, + "weight_map": { + "embed_out.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.embed_in.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.final_layer_norm.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.final_layer_norm.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.0.attention.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.0.attention.dense.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.0.attention.dense.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.0.attention.masked_bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.0.attention.query_key_value.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.0.attention.query_key_value.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.0.attention.rotary_emb.inv_freq": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.0.input_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.0.input_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.0.mlp.dense_4h_to_h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.0.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.0.mlp.dense_h_to_4h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.0.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.0.post_attention_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.0.post_attention_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.1.attention.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.1.attention.dense.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.1.attention.dense.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.1.attention.masked_bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.1.attention.query_key_value.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.1.attention.query_key_value.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.1.attention.rotary_emb.inv_freq": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.1.input_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.1.input_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.1.mlp.dense_4h_to_h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.1.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.1.mlp.dense_h_to_4h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.1.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.1.post_attention_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.1.post_attention_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.10.attention.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.10.attention.dense.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.10.attention.dense.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.10.attention.masked_bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.10.attention.query_key_value.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.10.attention.query_key_value.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.10.attention.rotary_emb.inv_freq": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.10.input_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.10.input_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.10.mlp.dense_4h_to_h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.10.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.10.mlp.dense_h_to_4h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.10.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.10.post_attention_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.10.post_attention_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.11.attention.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.11.attention.dense.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.11.attention.dense.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.11.attention.masked_bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.11.attention.query_key_value.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.11.attention.query_key_value.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.11.attention.rotary_emb.inv_freq": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.11.input_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.11.input_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.11.mlp.dense_4h_to_h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.11.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.11.mlp.dense_h_to_4h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.11.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.11.post_attention_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.11.post_attention_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.12.attention.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.12.attention.dense.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.12.attention.dense.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.12.attention.masked_bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.12.attention.query_key_value.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.12.attention.query_key_value.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.12.attention.rotary_emb.inv_freq": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.12.input_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.12.input_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.12.mlp.dense_4h_to_h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.12.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.12.mlp.dense_h_to_4h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.12.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.12.post_attention_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.12.post_attention_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.13.attention.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.13.attention.dense.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.13.attention.dense.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.13.attention.masked_bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.13.attention.query_key_value.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.13.attention.query_key_value.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.13.attention.rotary_emb.inv_freq": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.13.input_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.13.input_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.13.mlp.dense_4h_to_h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.13.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.13.mlp.dense_h_to_4h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.13.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.13.post_attention_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.13.post_attention_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.14.attention.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.14.attention.dense.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.14.attention.dense.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.14.attention.masked_bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.14.attention.query_key_value.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.14.attention.query_key_value.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.14.attention.rotary_emb.inv_freq": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.14.input_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.14.input_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.14.mlp.dense_4h_to_h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.14.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.14.mlp.dense_h_to_4h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.14.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.14.post_attention_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.14.post_attention_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.15.attention.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.15.attention.dense.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.15.attention.dense.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.15.attention.masked_bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.15.attention.query_key_value.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.15.attention.query_key_value.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.15.attention.rotary_emb.inv_freq": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.15.input_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.15.input_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.15.mlp.dense_4h_to_h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.15.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.15.mlp.dense_h_to_4h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.15.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.15.post_attention_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.15.post_attention_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.16.attention.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.16.attention.dense.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.16.attention.dense.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.16.attention.masked_bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.16.attention.query_key_value.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.16.attention.query_key_value.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.16.attention.rotary_emb.inv_freq": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.16.input_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.16.input_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.16.mlp.dense_4h_to_h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.16.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.16.mlp.dense_h_to_4h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.16.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.16.post_attention_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.16.post_attention_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.17.attention.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.17.attention.dense.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.17.attention.dense.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.17.attention.masked_bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.17.attention.query_key_value.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.17.attention.query_key_value.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.17.attention.rotary_emb.inv_freq": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.17.input_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.17.input_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.17.mlp.dense_4h_to_h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.17.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.17.mlp.dense_h_to_4h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.17.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.17.post_attention_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.17.post_attention_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.18.attention.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.18.attention.dense.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.18.attention.dense.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.18.attention.masked_bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.18.attention.query_key_value.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.18.attention.query_key_value.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.18.attention.rotary_emb.inv_freq": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.18.input_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.18.input_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.18.mlp.dense_4h_to_h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.18.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.18.mlp.dense_h_to_4h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.18.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.18.post_attention_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.18.post_attention_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.19.attention.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.19.attention.dense.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.19.attention.dense.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.19.attention.masked_bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.19.attention.query_key_value.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.19.attention.query_key_value.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.19.attention.rotary_emb.inv_freq": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.19.input_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.19.input_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.19.mlp.dense_4h_to_h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.19.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.19.mlp.dense_h_to_4h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.19.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.19.post_attention_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.19.post_attention_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.2.attention.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.2.attention.dense.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.2.attention.dense.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.2.attention.masked_bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.2.attention.query_key_value.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.2.attention.query_key_value.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.2.attention.rotary_emb.inv_freq": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.2.input_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.2.input_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.2.mlp.dense_4h_to_h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.2.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.2.mlp.dense_h_to_4h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.2.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.2.post_attention_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.2.post_attention_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.20.attention.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.20.attention.dense.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.20.attention.dense.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.20.attention.masked_bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.20.attention.query_key_value.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.20.attention.query_key_value.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.20.attention.rotary_emb.inv_freq": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.20.input_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.20.input_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.20.mlp.dense_4h_to_h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.20.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.20.mlp.dense_h_to_4h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.20.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.20.post_attention_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.20.post_attention_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.21.attention.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.21.attention.dense.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.21.attention.dense.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.21.attention.masked_bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.21.attention.query_key_value.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.21.attention.query_key_value.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.21.attention.rotary_emb.inv_freq": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.21.input_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.21.input_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.21.mlp.dense_4h_to_h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.21.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.21.mlp.dense_h_to_4h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.21.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.21.post_attention_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.21.post_attention_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.22.attention.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.22.attention.dense.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.22.attention.dense.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.22.attention.masked_bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.22.attention.query_key_value.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.22.attention.query_key_value.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.22.attention.rotary_emb.inv_freq": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.22.input_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.22.input_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.22.mlp.dense_4h_to_h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.22.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.22.mlp.dense_h_to_4h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.22.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.22.post_attention_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.22.post_attention_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.23.attention.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.23.attention.dense.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.23.attention.dense.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.23.attention.masked_bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.23.attention.query_key_value.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.23.attention.query_key_value.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.23.attention.rotary_emb.inv_freq": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.23.input_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.23.input_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.23.mlp.dense_4h_to_h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.23.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.23.mlp.dense_h_to_4h.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.23.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.23.post_attention_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.23.post_attention_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.24.attention.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.24.attention.dense.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.24.attention.dense.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.24.attention.masked_bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.24.attention.query_key_value.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.24.attention.query_key_value.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.24.attention.rotary_emb.inv_freq": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.24.input_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.24.input_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.24.mlp.dense_4h_to_h.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.24.mlp.dense_4h_to_h.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.24.mlp.dense_h_to_4h.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.24.mlp.dense_h_to_4h.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.24.post_attention_layernorm.bias": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.24.post_attention_layernorm.weight": "pytorch_model-00002-of-00003.bin", + "gpt_neox.layers.25.attention.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.25.attention.dense.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.25.attention.dense.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.25.attention.masked_bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.25.attention.query_key_value.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.25.attention.query_key_value.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.25.attention.rotary_emb.inv_freq": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.25.input_layernorm.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.25.input_layernorm.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.25.mlp.dense_4h_to_h.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.25.mlp.dense_4h_to_h.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.25.mlp.dense_h_to_4h.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.25.mlp.dense_h_to_4h.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.25.post_attention_layernorm.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.25.post_attention_layernorm.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.26.attention.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.26.attention.dense.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.26.attention.dense.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.26.attention.masked_bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.26.attention.query_key_value.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.26.attention.query_key_value.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.26.attention.rotary_emb.inv_freq": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.26.input_layernorm.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.26.input_layernorm.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.26.mlp.dense_4h_to_h.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.26.mlp.dense_4h_to_h.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.26.mlp.dense_h_to_4h.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.26.mlp.dense_h_to_4h.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.26.post_attention_layernorm.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.26.post_attention_layernorm.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.27.attention.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.27.attention.dense.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.27.attention.dense.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.27.attention.masked_bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.27.attention.query_key_value.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.27.attention.query_key_value.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.27.attention.rotary_emb.inv_freq": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.27.input_layernorm.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.27.input_layernorm.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.27.mlp.dense_4h_to_h.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.27.mlp.dense_4h_to_h.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.27.mlp.dense_h_to_4h.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.27.mlp.dense_h_to_4h.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.27.post_attention_layernorm.bias": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.27.post_attention_layernorm.weight": "pytorch_model-00003-of-00003.bin", + "gpt_neox.layers.3.attention.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.3.attention.dense.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.3.attention.dense.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.3.attention.masked_bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.3.attention.query_key_value.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.3.attention.query_key_value.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.3.attention.rotary_emb.inv_freq": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.3.input_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.3.input_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.3.mlp.dense_4h_to_h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.3.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.3.mlp.dense_h_to_4h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.3.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.3.post_attention_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.3.post_attention_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.4.attention.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.4.attention.dense.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.4.attention.dense.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.4.attention.masked_bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.4.attention.query_key_value.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.4.attention.query_key_value.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.4.attention.rotary_emb.inv_freq": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.4.input_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.4.input_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.4.mlp.dense_4h_to_h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.4.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.4.mlp.dense_h_to_4h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.4.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.4.post_attention_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.4.post_attention_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.5.attention.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.5.attention.dense.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.5.attention.dense.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.5.attention.masked_bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.5.attention.query_key_value.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.5.attention.query_key_value.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.5.attention.rotary_emb.inv_freq": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.5.input_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.5.input_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.5.mlp.dense_4h_to_h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.5.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.5.mlp.dense_h_to_4h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.5.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.5.post_attention_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.5.post_attention_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.6.attention.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.6.attention.dense.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.6.attention.dense.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.6.attention.masked_bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.6.attention.query_key_value.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.6.attention.query_key_value.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.6.attention.rotary_emb.inv_freq": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.6.input_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.6.input_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.6.mlp.dense_4h_to_h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.6.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.6.mlp.dense_h_to_4h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.6.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.6.post_attention_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.6.post_attention_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.7.attention.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.7.attention.dense.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.7.attention.dense.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.7.attention.masked_bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.7.attention.query_key_value.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.7.attention.query_key_value.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.7.attention.rotary_emb.inv_freq": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.7.input_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.7.input_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.7.mlp.dense_4h_to_h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.7.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.7.mlp.dense_h_to_4h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.7.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.7.post_attention_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.7.post_attention_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.8.attention.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.8.attention.dense.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.8.attention.dense.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.8.attention.masked_bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.8.attention.query_key_value.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.8.attention.query_key_value.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.8.attention.rotary_emb.inv_freq": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.8.input_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.8.input_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.8.mlp.dense_4h_to_h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.8.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.8.mlp.dense_h_to_4h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.8.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.8.post_attention_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.8.post_attention_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.9.attention.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.9.attention.dense.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.9.attention.dense.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.9.attention.masked_bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.9.attention.query_key_value.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.9.attention.query_key_value.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.9.attention.rotary_emb.inv_freq": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.9.input_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.9.input_layernorm.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.9.mlp.dense_4h_to_h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.9.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.9.mlp.dense_h_to_4h.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.9.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.9.post_attention_layernorm.bias": "pytorch_model-00001-of-00003.bin", + "gpt_neox.layers.9.post_attention_layernorm.weight": "pytorch_model-00001-of-00003.bin" + } +} diff --git a/special_tokens_map.json b/special_tokens_map.json new file mode 100644 index 0000000..b0b38c1 --- /dev/null +++ b/special_tokens_map.json @@ -0,0 +1,11 @@ +{ + "additional_special_tokens": [ + "<|endoftext|>", + "<|sep|>", + "<|acc|>", + "<|tel|>", + "<|rrn|>" + ], + "eos_token": "<|endoftext|>", + "pad_token": "<|endoftext|>" +} diff --git a/tokenizer.json b/tokenizer.json new file mode 100644 index 0000000..bd6490e --- /dev/null +++ b/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d470319cec5a6cf78f43e885c2526e4eab37e8d81d52387eee250dc198f01200 +size 1652185 diff --git a/tokenizer_config.json b/tokenizer_config.json new file mode 100644 index 0000000..22943d5 --- /dev/null +++ b/tokenizer_config.json @@ -0,0 +1,7 @@ +{ + "clean_up_tokenization_spaces": true, + "eos_token": "<|endoftext|>", + "model_max_length": 1000000000000000019884624838656, + "pad_token": "<|endoftext|>", + "tokenizer_class": "PreTrainedTokenizerFast" +}