初始化项目，由ModelHub XC社区提供模型

Model: nomic-ai/gpt4all-falcon Source: Original Platform
2026-05-12 11:40:29 +08:00
commit 61c63d5ac4
16 changed files with 131785 additions and 0 deletions
--- a/.gitattributes
+++ b/.gitattributes
@@ -0,0 +1,38 @@
+*.7z filter=lfs diff=lfs merge=lfs -text
+*.arrow filter=lfs diff=lfs merge=lfs -text
+*.bin filter=lfs diff=lfs merge=lfs -text
+*.bz2 filter=lfs diff=lfs merge=lfs -text
+*.ckpt filter=lfs diff=lfs merge=lfs -text
+*.ftz filter=lfs diff=lfs merge=lfs -text
+*.gz filter=lfs diff=lfs merge=lfs -text
+*.h5 filter=lfs diff=lfs merge=lfs -text
+*.joblib filter=lfs diff=lfs merge=lfs -text
+*.lfs.* filter=lfs diff=lfs merge=lfs -text
+*.mlmodel filter=lfs diff=lfs merge=lfs -text
+*.model filter=lfs diff=lfs merge=lfs -text
+*.msgpack filter=lfs diff=lfs merge=lfs -text
+*.npy filter=lfs diff=lfs merge=lfs -text
+*.npz filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.ot filter=lfs diff=lfs merge=lfs -text
+*.parquet filter=lfs diff=lfs merge=lfs -text
+*.pb filter=lfs diff=lfs merge=lfs -text
+*.pickle filter=lfs diff=lfs merge=lfs -text
+*.pkl filter=lfs diff=lfs merge=lfs -text
+*.pt filter=lfs diff=lfs merge=lfs -text
+*.pth filter=lfs diff=lfs merge=lfs -text
+*.rar filter=lfs diff=lfs merge=lfs -text
+*.safetensors filter=lfs diff=lfs merge=lfs -text
+saved_model/**/* filter=lfs diff=lfs merge=lfs -text
+*.tar.* filter=lfs diff=lfs merge=lfs -text
+*.tflite filter=lfs diff=lfs merge=lfs -text
+*.tgz filter=lfs diff=lfs merge=lfs -text
+*.wasm filter=lfs diff=lfs merge=lfs -text
+*.xz filter=lfs diff=lfs merge=lfs -text
+*.zip filter=lfs diff=lfs merge=lfs -text
+*.zst filter=lfs diff=lfs merge=lfs -text
+*tfevents* filter=lfs diff=lfs merge=lfs -text
+model-00001-of-00002.safetensors filter=lfs diff=lfs merge=lfs -text
+model-00002-of-00002.safetensors filter=lfs diff=lfs merge=lfs -text
+pytorch_model-00001-of-00002.bin filter=lfs diff=lfs merge=lfs -text
+pytorch_model-00002-of-00002.bin filter=lfs diff=lfs merge=lfs -text
--- a/README.md
+++ b/README.md
@@ -0,0 +1,116 @@
+---
+license: apache-2.0
+datasets:
+- nomic-ai/gpt4all-j-prompt-generations
+language:
+- en
+pipeline_tag: text-generation
+---
+
+# Model Card for GPT4All-Falcon
+
+An Apache-2 licensed chatbot trained over a massive curated corpus of assistant interactions including word problems, multi-turn dialogue, code, poems, songs, and stories.
+
+## Model Details
+
+### Model Description
+
+<!-- Provide a longer summary of what this model is. -->
+
+This model has been finetuned from [Falcon](https://huggingface.co/tiiuae/falcon-7b)
+
+- **Developed by:** [Nomic AI](https://home.nomic.ai)
+- **Model Type:** A finetuned Falcon 7B model on assistant style interaction data
+- **Language(s) (NLP):** English
+- **License:** Apache-2
+- **Finetuned from model [optional]:** [Falcon](https://huggingface.co/tiiuae/falcon-7b)
+
+
+To download a model with a specific revision run 
+
+```python
+from transformers import AutoModelForCausalLM
+
+model = AutoModelForCausalLM.from_pretrained("nomic-ai/gpt4all-falcon", trust_remote_code=True)
+```
+
+Downloading without specifying `revision` defaults to `main`/`v1.0`.
+
+To use it for inference with Cuda, run
+
+```python
+from transformers import AutoTokenizer, pipeline
+import transformers
+import torch
+
+tokenizer = AutoTokenizer.from_pretrained(model_path, use_fast=False)
+model.to("cuda:0")
+
+prompt = "Describe a painting of a falcon in a very detailed way." # Change this to your prompt
+prompt_template = f"### Instruction: {prompt}\n### Response:"
+
+tokens = tokenizer(prompt_template, return_tensors="pt").input_ids.to("cuda:0")
+output = model.generate(input_ids=tokens, max_new_tokens=256, do_sample=True, temperature=0.8)
+
+# Print the generated text
+print(tokenizer.decode(output[0]))
+```
+
+
+### Model Sources [optional]
+
+<!-- Provide the basic links for the model. -->
+
+- **Repository:** [https://github.com/nomic-ai/gpt4all](https://github.com/nomic-ai/gpt4all)
+- **Base Model Repository:** [https://huggingface.co/tiiuae/falcon-7b](https://huggingface.co/tiiuae/falcon-7b)
+- **Demo [optional]:** [https://gpt4all.io/](https://gpt4all.io/)
+
+
+### Training Procedure 
+GPT4All is made possible by our compute partner [Paperspace](https://www.paperspace.com/).
+
+Trained on a DGX cluster with 8 A100 80GB GPUs for ~12 hours. Using Deepspeed + Accelerate, we use a global batch size of 256 with a learning rate of 2e-5. More information can be found in the repo.
+
+
+### Results
+
+Results on common sense reasoning benchmarks
+
+```
+| Model                     |  BoolQ   |   PIQA   | HellaSwag | WinoGrande |  ARC-e   |  ARC-c   |   OBQA   |   Avg.   |
+|:--------------------------|:--------:|:--------:|:---------:|:----------:|:--------:|:--------:|:--------:|:--------:|
+| GPT4All-J 6B v1.0         |   73.4   |   74.8   |   63.4    |    64.7    |   54.9   |   36.0   |   40.2   |   58.2   |
+| GPT4All-J v1.1-breezy     |   74.0   |   75.1   |   63.2    |    63.6    |   55.4   |   34.9   |   38.4   |   57.8   |
+| GPT4All-J v1.2-jazzy      |   74.8   |   74.9   |   63.6    |    63.8    |   56.6   |   35.3   |   41.0   |   58.6   |
+| GPT4All-J v1.3-groovy     |   73.6   |   74.3   |   63.8    |    63.5    |   57.7   |   35.0   |   38.8   |   58.1   |
+| GPT4All-J Lora 6B         |   68.6   |   75.8   |   66.2    |    63.5    |   56.4   |   35.7   |   40.2   |   58.1   |
+| GPT4All LLaMa Lora 7B     |   73.1   |   77.6   |   72.1    |    67.8    |   51.1   |   40.4   |   40.2   |   60.3   |
+| GPT4All 13B snoozy        | **83.3** |   79.2   |   75.0    |  **71.3**  |   60.9   |   44.2   |   43.4   |   65.3   |
+| GPT4All Falcon            |   77.6   |   79.8   |   74.9    |    70.1    |   67.9   |   43.4   |   42.6   |   65.2   |
+| Dolly 6B                  |   68.8   |   77.3   |   67.6    |    63.9    |   62.9   |   38.7   |   41.2   |   60.1   |
+| Dolly 12B                 |   56.7   |   75.4   |   71.0    |    62.2    |   64.6   |   38.5   |   40.4   |   58.4   |
+| Alpaca 7B                 |   73.9   |   77.2   |   73.9    |    66.1    |   59.8   |   43.3   |   43.4   |   62.4   |
+| Alpaca Lora 7B            |   74.3   |   79.3   |   74.0    |    68.8    |   56.6   |   43.9   |   42.6   |   62.8   |
+| GPT-J 6.7B                |   65.4   |   76.2   |   66.2    |    64.1    |   62.2   |   36.6   |   38.2   |   58.4   |
+| LLama 7B                  |   73.1   |   77.4   |   73.0    |    66.9    |   52.5   |   41.4   |   42.4   |   61.0   |
+| LLama 13B                 |   68.5   |   79.1   |   76.2    |    70.1    |   60.0   | **44.6** |   42.2   |   63.0   |
+| Pythia 6.7B               |   63.5   |   76.3   |   64.0    |    61.1    |   61.3   |   35.2   |   37.2   |   57.0   |
+| Pythia 12B                |   67.7   |   76.6   |   67.3    |    63.8    |   63.9   |   34.8   |    38    |   58.9   |
+| Fastchat T5               |   81.5   |   64.6   |   46.3    |    61.8    |   49.3   |   33.3   |   39.4   |   53.7   |
+| Fastchat Vicuña 7B        |   76.6   |   77.2   |   70.7    |    67.3    |   53.5   |   41.2   |   40.8   |   61.0   |
+| Fastchat Vicuña 13B       |   81.5   |   76.8   |   73.3    |    66.7    |   57.4   |   42.7   |   43.6   |   63.1   |
+| StableVicuña RLHF         |   82.3   |   78.6   |   74.1    |    70.9    |   61.0   |   43.5   | **44.4** |   65.0   |
+| StableLM Tuned            |   62.5   |   71.2   |   53.6    |    54.8    |   52.4   |   31.1   |   33.4   |   51.3   |
+| StableLM Base             |   60.1   |   67.4   |   41.2    |    50.1    |   44.9   |   27.0   |   32.0   |   42.2   |
+| Koala 13B                 |   76.5   |   77.9   |   72.6    |    68.8    |   54.3   |   41.0   |   42.8   |   62.0   |
+| Open Assistant Pythia 12B |   67.9   |   78.0   |   68.1    |    65.0    |   64.2   |   40.4   |   43.2   |   61.0   |
+| Mosaic MPT7B              |   74.8   |   79.3   |   76.3    |    68.6    |   70.0   |   42.2   |   42.6   |   64.8   |
+| Mosaic mpt-instruct       |   74.3   |   80.4   | **77.2**  |    67.8    | **72.2** | **44.6** |   43.0   | **65.6** |
+| Mosaic mpt-chat           |   77.1   |   78.2   |   74.5    |    67.5    |   69.4   |   43.3   |   44.2   |   64.9   |
+| Wizard 7B                 |   78.4   |   77.2   |   69.9    |    66.5    |   56.8   |   40.5   |   42.6   |   61.7   |
+| Wizard 7B Uncensored      |   77.7   |   74.2   |   68.0    |    65.2    |   53.5   |   38.7   |   41.6   |   59.8   |
+| Wizard 13B Uncensored     |   78.4   |   75.5   |   72.1    |    69.5    |   57.5   |   40.4   |   44.0   |   62.5   |
+| GPT4-x-Vicuna-13b         |   81.3   |   75.0   |   75.2    |    65.0    |   58.7   |   43.9   |   43.6   |   62.2   |
+| Falcon 7b                 |   73.6   | **80.7** |   76.3    |    67.3    |   71.0   |   43.3   |   44.4   |   65.2   |   
+| text-davinci-003          |   88.1   |   83.8   |   83.4    |    75.8    |   83.9   |   63.9   |   51.0   |   75.7   |
+```
--- a/config.json
+++ b/config.json
@@ -0,0 +1,33 @@
+{
+  "_name_or_path": "tiiuae/falcon-7b",
+  "alibi": false,
+  "apply_residual_connection_post_layernorm": false,
+  "architectures": [
+    "RWForCausalLM"
+  ],
+  "attention_dropout": 0.0,
+  "auto_map": {
+    "AutoConfig": "configuration_RW.RWConfig",
+    "AutoModel": "modelling_RW.RWModel",
+    "AutoModelForCausalLM": "modelling_RW.RWForCausalLM",
+    "AutoModelForQuestionAnswering": "modelling_RW.RWForQuestionAnswering",
+    "AutoModelForSequenceClassification": "modelling_RW.RWForSequenceClassification",
+    "AutoModelForTokenClassification": "modelling_RW.RWForTokenClassification"
+  },
+  "bias": false,
+  "bos_token_id": 11,
+  "eos_token_id": 11,
+  "hidden_dropout": 0.0,
+  "hidden_size": 4544,
+  "initializer_range": 0.02,
+  "layer_norm_epsilon": 1e-05,
+  "model_type": "RefinedWebModel",
+  "multi_query": true,
+  "n_head": 71,
+  "n_layer": 32,
+  "parallel_attn": true,
+  "torch_dtype": "bfloat16",
+  "transformers_version": "4.28.1",
+  "use_cache": false,
+  "vocab_size": 65024
+}
--- a/configuration.json
+++ b/configuration.json
@@ -0,0 +1 @@
+{"framework": "pytorch", "task": "text-generation", "allow_remote": true}
--- a/configuration_RW.py
+++ b/configuration_RW.py
@@ -0,0 +1,79 @@
+# coding=utf-8
+# Copyright 2022 the Big Science Workshop and HuggingFace Inc. team.  All rights reserved.
+#
+# Licensed under the Apache License, Version 2.0 (the "License");
+# you may not use this file except in compliance with the License.
+# You may obtain a copy of the License at
+#
+#     http://www.apache.org/licenses/LICENSE-2.0
+#
+# Unless required by applicable law or agreed to in writing, software
+# distributed under the License is distributed on an "AS IS" BASIS,
+# WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied.
+# See the License for the specific language governing permissions and
+# limitations under the License.
+""" Bloom configuration"""
+from transformers.configuration_utils import PretrainedConfig
+from transformers.utils import logging
+
+
+logger = logging.get_logger(__name__)
+
+
+class RWConfig(PretrainedConfig):
+    model_type = "RefinedWebModel"
+    keys_to_ignore_at_inference = ["past_key_values"]
+    attribute_map = {
+        "num_hidden_layers": "n_layer",
+        "num_attention_heads": "n_head",
+    }
+
+    def __init__(
+        self,
+        vocab_size=250880,
+        hidden_size=64,
+        n_layer=2,
+        n_head=8,
+        layer_norm_epsilon=1e-5,
+        initializer_range=0.02,
+        use_cache=True,
+        bos_token_id=1,
+        eos_token_id=2,
+        apply_residual_connection_post_layernorm=False,
+        hidden_dropout=0.0,
+        attention_dropout=0.0,
+        multi_query=False,
+        alibi=False,
+        bias=False,
+        parallel_attn=False,
+        **kwargs,
+    ):
+        self.vocab_size = vocab_size
+        # Backward compatibility with n_embed kwarg
+        n_embed = kwargs.pop("n_embed", None)
+        self.hidden_size = hidden_size if n_embed is None else n_embed
+        self.n_layer = n_layer
+        self.n_head = n_head
+        self.layer_norm_epsilon = layer_norm_epsilon
+        self.initializer_range = initializer_range
+        self.use_cache = use_cache
+        self.apply_residual_connection_post_layernorm = apply_residual_connection_post_layernorm
+        self.hidden_dropout = hidden_dropout
+        self.attention_dropout = attention_dropout
+
+        self.bos_token_id = bos_token_id
+        self.eos_token_id = eos_token_id
+        self.multi_query = multi_query
+        self.alibi = alibi
+        self.bias = bias
+        self.parallel_attn = parallel_attn
+
+        super().__init__(bos_token_id=bos_token_id, eos_token_id=eos_token_id, **kwargs)
+
+    @property
+    def head_dim(self):
+        return self.hidden_size // self.n_head
+
+    @property
+    def rotary(self):
+        return not self.alibi
--- a/generation_config.json
+++ b/generation_config.json
@@ -0,0 +1,6 @@
+{
+  "_from_model_config": true,
+  "bos_token_id": 1,
+  "eos_token_id": 2,
+  "transformers_version": "4.28.1"
+}
--- a/model-00001-of-00002.safetensors
+++ b/model-00001-of-00002.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:39c037a0718d9d1df673604ac661341dcc6af24ee469ca025e33333f386c0081
+size 9950994832
--- a/model-00002-of-00002.safetensors
+++ b/model-00002-of-00002.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:98a2a82f28b94cb9921806bbdf4656ac84e3baf8ac23b7376686df72f8b529e4
+size 4483408144
--- a/model.safetensors.index.json
+++ b/model.safetensors.index.json
@@ -0,0 +1,203 @@
+{
+    "metadata": {
+        "total_size": 14434379520
+    },
+    "weight_map": {
+        "lm_head.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.0.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.0.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.0.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.0.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.0.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.1.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.1.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.1.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.1.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.1.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.1.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.10.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.10.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.10.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.10.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.10.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.10.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.11.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.11.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.11.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.11.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.11.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.11.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.12.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.12.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.12.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.12.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.12.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.12.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.13.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.13.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.13.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.13.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.13.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.13.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.14.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.14.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.14.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.14.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.14.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.14.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.15.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.15.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.15.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.15.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.15.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.15.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.16.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.16.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.16.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.16.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.16.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.16.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.17.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.17.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.17.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.17.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.17.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.17.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.18.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.18.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.18.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.18.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.18.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.18.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.19.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.19.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.19.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.19.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.19.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.19.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.2.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.2.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.2.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.2.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.2.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.20.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.20.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.20.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.20.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.20.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.20.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.21.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.21.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.21.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.21.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.21.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.21.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.22.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.22.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.22.mlp.dense_4h_to_h.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.22.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.22.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.22.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.23.input_layernorm.bias": "model-00002-of-00002.safetensors",
+        "transformer.h.23.input_layernorm.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.23.mlp.dense_4h_to_h.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.23.mlp.dense_h_to_4h.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.23.self_attention.dense.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.23.self_attention.query_key_value.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.24.input_layernorm.bias": "model-00002-of-00002.safetensors",
+        "transformer.h.24.input_layernorm.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.24.mlp.dense_4h_to_h.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.24.mlp.dense_h_to_4h.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.24.self_attention.dense.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.24.self_attention.query_key_value.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.25.input_layernorm.bias": "model-00002-of-00002.safetensors",
+        "transformer.h.25.input_layernorm.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.25.mlp.dense_4h_to_h.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.25.mlp.dense_h_to_4h.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.25.self_attention.dense.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.25.self_attention.query_key_value.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.26.input_layernorm.bias": "model-00002-of-00002.safetensors",
+        "transformer.h.26.input_layernorm.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.26.mlp.dense_4h_to_h.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.26.mlp.dense_h_to_4h.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.26.self_attention.dense.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.26.self_attention.query_key_value.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.27.input_layernorm.bias": "model-00002-of-00002.safetensors",
+        "transformer.h.27.input_layernorm.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.27.mlp.dense_4h_to_h.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.27.mlp.dense_h_to_4h.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.27.self_attention.dense.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.27.self_attention.query_key_value.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.28.input_layernorm.bias": "model-00002-of-00002.safetensors",
+        "transformer.h.28.input_layernorm.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.28.mlp.dense_4h_to_h.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.28.mlp.dense_h_to_4h.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.28.self_attention.dense.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.28.self_attention.query_key_value.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.29.input_layernorm.bias": "model-00002-of-00002.safetensors",
+        "transformer.h.29.input_layernorm.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.29.mlp.dense_4h_to_h.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.29.mlp.dense_h_to_4h.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.29.self_attention.dense.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.29.self_attention.query_key_value.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.3.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.3.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.3.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.3.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.3.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.30.input_layernorm.bias": "model-00002-of-00002.safetensors",
+        "transformer.h.30.input_layernorm.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.30.mlp.dense_4h_to_h.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.30.mlp.dense_h_to_4h.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.30.self_attention.dense.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.30.self_attention.query_key_value.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.31.input_layernorm.bias": "model-00002-of-00002.safetensors",
+        "transformer.h.31.input_layernorm.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.31.mlp.dense_4h_to_h.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.31.mlp.dense_h_to_4h.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.31.self_attention.dense.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.31.self_attention.query_key_value.weight": "model-00002-of-00002.safetensors",
+        "transformer.h.4.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.4.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.4.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.4.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.4.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.5.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.5.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.5.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.5.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.5.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.6.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.6.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.6.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.6.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.6.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.6.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.7.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.7.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.7.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.7.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.7.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.7.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.8.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.8.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.8.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.8.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.8.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.8.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.9.input_layernorm.bias": "model-00001-of-00002.safetensors",
+        "transformer.h.9.input_layernorm.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.9.mlp.dense_4h_to_h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.9.mlp.dense_h_to_4h.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.9.self_attention.dense.weight": "model-00001-of-00002.safetensors",
+        "transformer.h.9.self_attention.query_key_value.weight": "model-00001-of-00002.safetensors",
+        "transformer.ln_f.bias": "model-00002-of-00002.safetensors",
+        "transformer.ln_f.weight": "model-00002-of-00002.safetensors",
+        "transformer.word_embeddings.weight": "model-00001-of-00002.safetensors"
+    }
+}
--- a/modelling_RW.py
+++ b/modelling_RW.py
--- a/pytorch_model-00001-of-00002.bin
+++ b/pytorch_model-00001-of-00002.bin
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:210ef37deaf7326c7fc34fb5be68792269c3f5dac76d7dfae3415e74194bfed3
+size 13843461074
--- a/pytorch_model-00002-of-00002.bin
+++ b/pytorch_model-00002-of-00002.bin
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:59c4d3bfd6b97627ff4d0bf59ee8c5b8b9f304fbfd61bc6d405fe0d617fa2e7d
+size 13843449746
--- a/pytorch_model.bin.index.json
+++ b/pytorch_model.bin.index.json
@@ -0,0 +1,203 @@
+{
+  "metadata": {
+    "total_size": 14434379520
+  },
+  "weight_map": {
+    "lm_head.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.0.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.0.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.0.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.0.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.0.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.0.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.1.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.1.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.1.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.1.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.1.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.1.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.10.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.10.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.10.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.10.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.10.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.10.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.11.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.11.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.11.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.11.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.11.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.11.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.12.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.12.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.12.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.12.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.12.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.12.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.13.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.13.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.13.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.13.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.13.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.13.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.14.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.14.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.14.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.14.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.14.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.14.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.15.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.15.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.15.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.15.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.15.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.15.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.16.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.16.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.16.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.16.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.16.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.16.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.17.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.17.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.17.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.17.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.17.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.17.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.18.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.18.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.18.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.18.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.18.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.18.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.19.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.19.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.19.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.19.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.19.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.19.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.2.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.2.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.2.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.2.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.2.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.2.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.20.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.20.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.20.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.20.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.20.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.20.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.21.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.21.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.21.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.21.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.21.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.21.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.22.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.22.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.22.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.22.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.22.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.22.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.23.input_layernorm.bias": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.23.input_layernorm.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.23.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.23.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.23.self_attention.dense.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.23.self_attention.query_key_value.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.24.input_layernorm.bias": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.24.input_layernorm.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.24.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.24.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.24.self_attention.dense.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.24.self_attention.query_key_value.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.25.input_layernorm.bias": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.25.input_layernorm.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.25.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.25.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.25.self_attention.dense.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.25.self_attention.query_key_value.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.26.input_layernorm.bias": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.26.input_layernorm.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.26.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.26.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.26.self_attention.dense.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.26.self_attention.query_key_value.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.27.input_layernorm.bias": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.27.input_layernorm.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.27.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.27.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.27.self_attention.dense.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.27.self_attention.query_key_value.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.28.input_layernorm.bias": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.28.input_layernorm.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.28.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.28.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.28.self_attention.dense.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.28.self_attention.query_key_value.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.29.input_layernorm.bias": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.29.input_layernorm.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.29.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.29.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.29.self_attention.dense.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.29.self_attention.query_key_value.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.3.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.3.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.3.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.3.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.3.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.3.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.30.input_layernorm.bias": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.30.input_layernorm.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.30.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.30.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.30.self_attention.dense.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.30.self_attention.query_key_value.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.31.input_layernorm.bias": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.31.input_layernorm.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.31.mlp.dense_4h_to_h.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.31.mlp.dense_h_to_4h.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.31.self_attention.dense.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.31.self_attention.query_key_value.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.h.4.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.4.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.4.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.4.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.4.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.4.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.5.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.5.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.5.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.5.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.5.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.5.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.6.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.6.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.6.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.6.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.6.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.6.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.7.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.7.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.7.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.7.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.7.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.7.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.8.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.8.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.8.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.8.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.8.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.8.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.9.input_layernorm.bias": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.9.input_layernorm.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.9.mlp.dense_4h_to_h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.9.mlp.dense_h_to_4h.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.9.self_attention.dense.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.h.9.self_attention.query_key_value.weight": "pytorch_model-00001-of-00002.bin",
+    "transformer.ln_f.bias": "pytorch_model-00002-of-00002.bin",
+    "transformer.ln_f.weight": "pytorch_model-00002-of-00002.bin",
+    "transformer.word_embeddings.weight": "pytorch_model-00001-of-00002.bin"
+  }
+}
--- a/special_tokens_map.json
+++ b/special_tokens_map.json
@@ -0,0 +1,16 @@
+{
+  "additional_special_tokens": [
+    ">>TITLE<<",
+    ">>ABSTRACT<<",
+    ">>INTRODUCTION<<",
+    ">>SUMMARY<<",
+    ">>COMMENT<<",
+    ">>ANSWER<<",
+    ">>QUESTION<<",
+    ">>DOMAIN<<",
+    ">>PREFIX<<",
+    ">>SUFFIX<<",
+    ">>MIDDLE<<"
+  ],
+  "eos_token": "<|endoftext|>"
+}
--- a/tokenizer.json
+++ b/tokenizer.json
--- a/tokenizer_config.json
+++ b/tokenizer_config.json
@@ -0,0 +1,7 @@
+{
+  "add_prefix_space": false,
+  "clean_up_tokenization_spaces": true,
+  "eos_token": "<|endoftext|>",
+  "model_max_length": 2048,
+  "tokenizer_class": "PreTrainedTokenizerFast"
+}
				`@@ -0,0 +1 @@`
				`{"framework": "pytorch", "task": "text-generation", "allow_remote": true}`