初始化项目,由ModelHub XC社区提供模型
Model: AI-ModelScope/granite-20b-code-base-8k Source: Original Platform
This commit is contained in:
44
.gitattributes
vendored
Normal file
44
.gitattributes
vendored
Normal file
@@ -0,0 +1,44 @@
|
|||||||
|
*.7z filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.arrow filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.bin filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.bz2 filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ckpt filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ftz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.gz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.h5 filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.joblib filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.mlmodel filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.model filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.npy filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.npz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.onnx filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ot filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.parquet filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pb filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pickle filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pkl filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pt filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pth filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.rar filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tar filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tflite filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tgz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.wasm filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.xz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.zip filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.zst filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
model-00001-of-00009.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
model-00002-of-00009.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
model-00003-of-00009.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
model-00004-of-00009.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
model-00005-of-00009.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
model-00006-of-00009.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
model-00007-of-00009.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
model-00008-of-00009.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
model-00009-of-00009.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
287
README.md
Normal file
287
README.md
Normal file
@@ -0,0 +1,287 @@
|
|||||||
|
---
|
||||||
|
datasets:
|
||||||
|
- codeparrot/github-code-clean
|
||||||
|
- bigcode/starcoderdata
|
||||||
|
- open-web-math/open-web-math
|
||||||
|
- math-ai/StackMathQA
|
||||||
|
inference: true
|
||||||
|
library_name: transformers
|
||||||
|
license: apache-2.0
|
||||||
|
metrics:
|
||||||
|
- code_eval
|
||||||
|
model-index:
|
||||||
|
- name: granite-20b-code-base-8k
|
||||||
|
results:
|
||||||
|
- dataset:
|
||||||
|
name: MBPP
|
||||||
|
type: mbpp
|
||||||
|
metrics:
|
||||||
|
- name: pass@1
|
||||||
|
type: pass@1
|
||||||
|
value: 43.8
|
||||||
|
veriefied: false
|
||||||
|
task:
|
||||||
|
type: text-generation
|
||||||
|
- dataset:
|
||||||
|
name: MBPP+
|
||||||
|
type: evalplus/mbppplus
|
||||||
|
metrics:
|
||||||
|
- name: pass@1
|
||||||
|
type: pass@1
|
||||||
|
value: 51.6
|
||||||
|
veriefied: false
|
||||||
|
task:
|
||||||
|
type: text-generation
|
||||||
|
- dataset:
|
||||||
|
name: HumanEvalSynthesis(Python)
|
||||||
|
type: bigcode/humanevalpack
|
||||||
|
metrics:
|
||||||
|
- name: pass@1
|
||||||
|
type: pass@1
|
||||||
|
value: 48.2
|
||||||
|
veriefied: false
|
||||||
|
task:
|
||||||
|
type: text-generation
|
||||||
|
- dataset:
|
||||||
|
name: HumanEvalSynthesis(JavaScript)
|
||||||
|
type: bigcode/humanevalpack
|
||||||
|
metrics:
|
||||||
|
- name: pass@1
|
||||||
|
type: pass@1
|
||||||
|
value: 50.0
|
||||||
|
veriefied: false
|
||||||
|
task:
|
||||||
|
type: text-generation
|
||||||
|
- dataset:
|
||||||
|
name: HumanEvalSynthesis(Java)
|
||||||
|
type: bigcode/humanevalpack
|
||||||
|
metrics:
|
||||||
|
- name: pass@1
|
||||||
|
type: pass@1
|
||||||
|
value: 59.1
|
||||||
|
veriefied: false
|
||||||
|
task:
|
||||||
|
type: text-generation
|
||||||
|
- dataset:
|
||||||
|
name: HumanEvalSynthesis(Go)
|
||||||
|
type: bigcode/humanevalpack
|
||||||
|
metrics:
|
||||||
|
- name: pass@1
|
||||||
|
type: pass@1
|
||||||
|
value: 32.3
|
||||||
|
veriefied: false
|
||||||
|
task:
|
||||||
|
type: text-generation
|
||||||
|
- dataset:
|
||||||
|
name: HumanEvalSynthesis(C++)
|
||||||
|
type: bigcode/humanevalpack
|
||||||
|
metrics:
|
||||||
|
- name: pass@1
|
||||||
|
type: pass@1
|
||||||
|
value: 40.9
|
||||||
|
veriefied: false
|
||||||
|
task:
|
||||||
|
type: text-generation
|
||||||
|
- dataset:
|
||||||
|
name: HumanEvalSynthesis(Rust)
|
||||||
|
type: bigcode/humanevalpack
|
||||||
|
metrics:
|
||||||
|
- name: pass@1
|
||||||
|
type: pass@1
|
||||||
|
value: 35.4
|
||||||
|
veriefied: false
|
||||||
|
task:
|
||||||
|
type: text-generation
|
||||||
|
- dataset:
|
||||||
|
name: HumanEvalExplain(Python)
|
||||||
|
type: bigcode/humanevalpack
|
||||||
|
metrics:
|
||||||
|
- name: pass@1
|
||||||
|
type: pass@1
|
||||||
|
value: 17.1
|
||||||
|
veriefied: false
|
||||||
|
task:
|
||||||
|
type: text-generation
|
||||||
|
- dataset:
|
||||||
|
name: HumanEvalExplain(JavaScript)
|
||||||
|
type: bigcode/humanevalpack
|
||||||
|
metrics:
|
||||||
|
- name: pass@1
|
||||||
|
type: pass@1
|
||||||
|
value: 18.3
|
||||||
|
veriefied: false
|
||||||
|
task:
|
||||||
|
type: text-generation
|
||||||
|
- dataset:
|
||||||
|
name: HumanEvalExplain(Java)
|
||||||
|
type: bigcode/humanevalpack
|
||||||
|
metrics:
|
||||||
|
- name: pass@1
|
||||||
|
type: pass@1
|
||||||
|
value: 23.2
|
||||||
|
veriefied: false
|
||||||
|
task:
|
||||||
|
type: text-generation
|
||||||
|
- dataset:
|
||||||
|
name: HumanEvalExplain(Go)
|
||||||
|
type: bigcode/humanevalpack
|
||||||
|
metrics:
|
||||||
|
- name: pass@1
|
||||||
|
type: pass@1
|
||||||
|
value: 10.4
|
||||||
|
veriefied: false
|
||||||
|
task:
|
||||||
|
type: text-generation
|
||||||
|
- dataset:
|
||||||
|
name: HumanEvalExplain(C++)
|
||||||
|
type: bigcode/humanevalpack
|
||||||
|
metrics:
|
||||||
|
- name: pass@1
|
||||||
|
type: pass@1
|
||||||
|
value: 25.6
|
||||||
|
veriefied: false
|
||||||
|
task:
|
||||||
|
type: text-generation
|
||||||
|
- dataset:
|
||||||
|
name: HumanEvalExplain(Rust)
|
||||||
|
type: bigcode/humanevalpack
|
||||||
|
metrics:
|
||||||
|
- name: pass@1
|
||||||
|
type: pass@1
|
||||||
|
value: 18.3
|
||||||
|
veriefied: false
|
||||||
|
task:
|
||||||
|
type: text-generation
|
||||||
|
- dataset:
|
||||||
|
name: HumanEvalFix(Python)
|
||||||
|
type: bigcode/humanevalpack
|
||||||
|
metrics:
|
||||||
|
- name: pass@1
|
||||||
|
type: pass@1
|
||||||
|
value: 23.2
|
||||||
|
veriefied: false
|
||||||
|
task:
|
||||||
|
type: text-generation
|
||||||
|
- dataset:
|
||||||
|
name: HumanEvalFix(JavaScript)
|
||||||
|
type: bigcode/humanevalpack
|
||||||
|
metrics:
|
||||||
|
- name: pass@1
|
||||||
|
type: pass@1
|
||||||
|
value: 23.8
|
||||||
|
veriefied: false
|
||||||
|
task:
|
||||||
|
type: text-generation
|
||||||
|
- dataset:
|
||||||
|
name: HumanEvalFix(Java)
|
||||||
|
type: bigcode/humanevalpack
|
||||||
|
metrics:
|
||||||
|
- name: pass@1
|
||||||
|
type: pass@1
|
||||||
|
value: 14.6
|
||||||
|
veriefied: false
|
||||||
|
task:
|
||||||
|
type: text-generation
|
||||||
|
- dataset:
|
||||||
|
name: HumanEvalFix(Go)
|
||||||
|
type: bigcode/humanevalpack
|
||||||
|
metrics:
|
||||||
|
- name: pass@1
|
||||||
|
type: pass@1
|
||||||
|
value: 26.2
|
||||||
|
veriefied: false
|
||||||
|
task:
|
||||||
|
type: text-generation
|
||||||
|
- dataset:
|
||||||
|
name: HumanEvalFix(C++)
|
||||||
|
type: bigcode/humanevalpack
|
||||||
|
metrics:
|
||||||
|
- name: pass@1
|
||||||
|
type: pass@1
|
||||||
|
value: 15.2
|
||||||
|
veriefied: false
|
||||||
|
task:
|
||||||
|
type: text-generation
|
||||||
|
- dataset:
|
||||||
|
name: HumanEvalFix(Rust)
|
||||||
|
type: bigcode/humanevalpack
|
||||||
|
metrics:
|
||||||
|
- name: pass@1
|
||||||
|
type: pass@1
|
||||||
|
value: 3.0
|
||||||
|
veriefied: false
|
||||||
|
task:
|
||||||
|
type: text-generation
|
||||||
|
pipeline_tag: text-generation
|
||||||
|
tags:
|
||||||
|
- code
|
||||||
|
- granite
|
||||||
|
---
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
# ⚠️ DEPRECATION WARNING ⚠️
|
||||||
|
# ⚠️ NOT RECOMMENDED FOR USE IN NEW PROJECTS ⚠️
|
||||||
|
|
||||||
|
New applications/projects should use the latest mainline Granite language model family, whose code capabilities supercede this model.
|
||||||
|
This model is being made available strictly for historical/scientific purposes.
|
||||||
|
**Please see our [Granite Collections](https://huggingface.co/ibm-granite/collections) for the latest Granite releases.**
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|

|
||||||
|
|
||||||
|
# Granite-20B-Code-Base-8K
|
||||||
|
|
||||||
|
## Model Summary
|
||||||
|
**Granite-20B-Code-Base-8K** is a decoder-only code model designed for code generative tasks (e.g., code generation, code explanation, code fixing, etc.). It is trained from scratch with a two-phase training strategy. In phase 1, our model is trained on 3 trillion tokens sourced from 116 programming languages, ensuring a comprehensive understanding of programming languages and syntax. In phase 2, our model is trained on 500 billion tokens with a carefully designed mixture of high-quality data from code and natural language domains to improve the models’ ability to reason and follow instructions.
|
||||||
|
|
||||||
|
- **Developers:** IBM Research
|
||||||
|
- **GitHub Repository:** [ibm-granite/granite-code-models](https://github.com/ibm-granite/granite-code-models)
|
||||||
|
- **Paper:** [Granite Code Models: A Family of Open Foundation Models for Code Intelligence](https://arxiv.org/abs/2405.04324)
|
||||||
|
- **Release Date**: May 6th, 2024
|
||||||
|
- **License:** [Apache 2.0](https://www.apache.org/licenses/LICENSE-2.0).
|
||||||
|
|
||||||
|
## Usage
|
||||||
|
### Intended use
|
||||||
|
Prominent enterprise use cases of LLMs in software engineering productivity include code generation, code explanation, code fixing, generating unit tests, generating documentation, addressing technical debt issues, vulnerability detection, code translation, and more. All Granite Code Base models, including the **20B parameter model**, are able to handle these tasks as they were trained on a large amount of code data from 116 programming languages.
|
||||||
|
|
||||||
|
### Generation
|
||||||
|
This is a simple example of how to use **Granite-20B-Code-Base-8K** model.
|
||||||
|
|
||||||
|
```python
|
||||||
|
import torch
|
||||||
|
from transformers import AutoModelForCausalLM, AutoTokenizer
|
||||||
|
device = "cuda" # or "cpu"
|
||||||
|
model_path = "ibm-granite/granite-20b-code-base-8k"
|
||||||
|
tokenizer = AutoTokenizer.from_pretrained(model_path)
|
||||||
|
# drop device_map if running on CPU
|
||||||
|
model = AutoModelForCausalLM.from_pretrained(model_path, device_map=device)
|
||||||
|
model.eval()
|
||||||
|
# change input text as desired
|
||||||
|
input_text = "def generate():"
|
||||||
|
# tokenize the text
|
||||||
|
input_tokens = tokenizer(input_text, return_tensors="pt")
|
||||||
|
# transfer tokenized inputs to the device
|
||||||
|
for i in input_tokens:
|
||||||
|
input_tokens[i] = input_tokens[i].to(device)
|
||||||
|
# generate output tokens
|
||||||
|
output = model.generate(**input_tokens)
|
||||||
|
# decode output tokens into text
|
||||||
|
output = tokenizer.batch_decode(output)
|
||||||
|
# loop over the batch to print, in this example the batch size is 1
|
||||||
|
for i in output:
|
||||||
|
print(i)
|
||||||
|
```
|
||||||
|
|
||||||
|
## Training Data
|
||||||
|
- **Data Collection and Filtering:** Pretraining code data is sourced from a combination of publicly available datasets (e.g., [GitHub Code Clean](https://huggingface.co/datasets/codeparrot/github-code-clean), [Starcoder data](https://huggingface.co/datasets/bigcode/starcoderdata)), and additional public code repositories and issues from GitHub. We filter raw data to retain a list of 116 programming languages. After language filtering, we also filter out low-quality code.
|
||||||
|
- **Exact and Fuzzy Deduplication:** We adopt an aggressive deduplication strategy that includes both exact and fuzzy deduplication to remove documents having (near) identical code content.
|
||||||
|
- **HAP, PII, Malware Filtering:** We apply a HAP content filter that reduces models' likelihood of generating hateful, abusive, or profane language. We also make sure to redact Personally Identifiable Information (PII) by replacing PII content (e.g., names, email addresses, keys, passwords) with corresponding tokens (e.g., ⟨NAME⟩, ⟨EMAIL⟩, ⟨KEY⟩, ⟨PASSWORD⟩). Moreover, we scan all datasets using [ClamAV](https://www.clamav.net/) to identify and remove instances of malware in the source code.
|
||||||
|
- **Natural Language Datasets:** In addition to collecting code data for model training, we curate several publicly available high-quality natural language datasets to improve models' proficiency in language understanding and mathematical reasoning. Unlike the code data, we do not deduplicate these datasets.
|
||||||
|
|
||||||
|
## Infrastructure
|
||||||
|
We train the Granite Code models using two of IBM's super computing clusters, namely Vela and Blue Vela, both outfitted with NVIDIA A100 and H100 GPUs respectively. These clusters provide a scalable and efficient infrastructure for training our models over thousands of GPUs.
|
||||||
|
|
||||||
|
## Ethical Considerations and Limitations
|
||||||
|
The use of Large Language Models involves risks and ethical considerations people must be aware of. Regarding code generation, caution is urged against complete reliance on specific code models for crucial decisions or impactful information as the generated code is not guaranteed to work as intended. **Granite-20B-Code-Base-8K** model is not the exception in this regard. Even though this model is suited for multiple code-related tasks, it has not undergone any safety alignment, there it may produce problematic outputs. Additionally, it remains uncertain whether smaller models might exhibit increased susceptibility to hallucination in generation scenarios by copying source code verbatim from the training dataset due to their reduced sizes and memorization capacities. This aspect is currently an active area of research, and we anticipate more rigorous exploration, comprehension, and mitigations in this domain. Regarding ethics, a latent risk associated with all Large Language Models is their malicious utilization. We urge the community to use **Granite-20B-Code-Base-8K** model with ethical intentions and in a responsible way.
|
||||||
28
config.json
Normal file
28
config.json
Normal file
@@ -0,0 +1,28 @@
|
|||||||
|
{
|
||||||
|
"activation_function": "gelu",
|
||||||
|
"architectures": [
|
||||||
|
"GPTBigCodeForCausalLM"
|
||||||
|
],
|
||||||
|
"attention_softmax_in_fp32": true,
|
||||||
|
"attn_pdrop": 0.1,
|
||||||
|
"bos_token_id": 0,
|
||||||
|
"embd_pdrop": 0.1,
|
||||||
|
"eos_token_id": 0,
|
||||||
|
"initializer_range": 0.02,
|
||||||
|
"layer_norm_epsilon": 1e-05,
|
||||||
|
"model_type": "gpt_bigcode",
|
||||||
|
"multi_query": true,
|
||||||
|
"n_embd": 6144,
|
||||||
|
"n_head": 48,
|
||||||
|
"n_inner": 24576,
|
||||||
|
"n_layer": 52,
|
||||||
|
"n_positions": 8192,
|
||||||
|
"pad_token_id": 0,
|
||||||
|
"resid_pdrop": 0.1,
|
||||||
|
"scale_attention_softmax_in_fp32": true,
|
||||||
|
"scale_attn_weights": true,
|
||||||
|
"torch_dtype": "bfloat16",
|
||||||
|
"transformers_version": "4.41.2",
|
||||||
|
"use_cache": true,
|
||||||
|
"vocab_size": 49152
|
||||||
|
}
|
||||||
1
configuration.json
Normal file
1
configuration.json
Normal file
@@ -0,0 +1 @@
|
|||||||
|
{"framework": "pytorch", "task": "text-generation", "allow_remote": true}
|
||||||
7
generation_config.json
Normal file
7
generation_config.json
Normal file
@@ -0,0 +1,7 @@
|
|||||||
|
{
|
||||||
|
"_from_model_config": true,
|
||||||
|
"bos_token_id": 0,
|
||||||
|
"eos_token_id": 0,
|
||||||
|
"pad_token_id": 0,
|
||||||
|
"transformers_version": "4.41.2"
|
||||||
|
}
|
||||||
3
model-00001-of-00009.safetensors
Normal file
3
model-00001-of-00009.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:22b893e90be19cc42647f7d76caef1bd7101b6904df709b93472265fa6e41594
|
||||||
|
size 4952185256
|
||||||
3
model-00002-of-00009.safetensors
Normal file
3
model-00002-of-00009.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:dc7f98d43d5aa8531381ffd2b7995008f1471a707a57becf638d089c549edec8
|
||||||
|
size 4930227792
|
||||||
3
model-00003-of-00009.safetensors
Normal file
3
model-00003-of-00009.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:1f56c8969bbdc7995f1c61123f4b63da7ff202a93e40fde98121ec9ccdc49556
|
||||||
|
size 4927118464
|
||||||
3
model-00004-of-00009.safetensors
Normal file
3
model-00004-of-00009.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:dd7060b8fac28950098ce792fc518a0a8af296f47e22709ccaad1ce8216591ea
|
||||||
|
size 4930227864
|
||||||
3
model-00005-of-00009.safetensors
Normal file
3
model-00005-of-00009.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:bbd071ecf07518991d9d82749d9c864a7e923eb82450048565e9121604f4cbe2
|
||||||
|
size 4927118464
|
||||||
3
model-00006-of-00009.safetensors
Normal file
3
model-00006-of-00009.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:b3a0e75fbd4db5862a20e23ce6ffbf69a4a28d59505085b8d82c1d61620cbf98
|
||||||
|
size 4930227864
|
||||||
3
model-00007-of-00009.safetensors
Normal file
3
model-00007-of-00009.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:8fee8bebaf2202e65cd8253898b317fc4a03a5a5cfb5bd6a01ccbf76a65d7c8b
|
||||||
|
size 4927118464
|
||||||
3
model-00008-of-00009.safetensors
Normal file
3
model-00008-of-00009.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:1fa8ce48dbb754a3e762d10d3590c65fb0eb30b6f28044f37ad184c335ff6916
|
||||||
|
size 4930227864
|
||||||
3
model-00009-of-00009.safetensors
Normal file
3
model-00009-of-00009.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:62f5a5189fb992fb52b72861f432dc19123bef17f78c42e1db8a89b208b4b5ab
|
||||||
|
size 679601176
|
||||||
635
model.safetensors.index.json
Normal file
635
model.safetensors.index.json
Normal file
@@ -0,0 +1,635 @@
|
|||||||
|
{
|
||||||
|
"metadata": {
|
||||||
|
"total_size": 40133986304
|
||||||
|
},
|
||||||
|
"weight_map": {
|
||||||
|
"transformer.h.0.attn.c_attn.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.0.attn.c_attn.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.0.attn.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.0.attn.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.0.ln_1.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.0.ln_1.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.0.ln_2.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.0.ln_2.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.0.mlp.c_fc.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.0.mlp.c_fc.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.0.mlp.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.0.mlp.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.1.attn.c_attn.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.1.attn.c_attn.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.1.attn.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.1.attn.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.1.ln_1.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.1.ln_1.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.1.ln_2.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.1.ln_2.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.1.mlp.c_fc.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.1.mlp.c_fc.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.1.mlp.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.1.mlp.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.10.attn.c_attn.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.10.attn.c_attn.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.10.attn.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.10.attn.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.10.ln_1.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.10.ln_1.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.10.ln_2.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.10.ln_2.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.10.mlp.c_fc.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.10.mlp.c_fc.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.10.mlp.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.10.mlp.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.11.attn.c_attn.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.11.attn.c_attn.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.11.attn.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.11.attn.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.11.ln_1.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.11.ln_1.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.11.ln_2.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.11.ln_2.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.11.mlp.c_fc.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.11.mlp.c_fc.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.11.mlp.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.11.mlp.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.12.attn.c_attn.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.12.attn.c_attn.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.12.attn.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.12.attn.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.12.ln_1.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.12.ln_1.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.12.ln_2.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.12.ln_2.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.12.mlp.c_fc.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.12.mlp.c_fc.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.12.mlp.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.12.mlp.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.13.attn.c_attn.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.13.attn.c_attn.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.13.attn.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.13.attn.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.13.ln_1.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.13.ln_1.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.13.ln_2.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.13.ln_2.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.13.mlp.c_fc.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.13.mlp.c_fc.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.13.mlp.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.13.mlp.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.14.attn.c_attn.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.14.attn.c_attn.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.14.attn.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.14.attn.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.14.ln_1.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.14.ln_1.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.14.ln_2.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.14.ln_2.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.14.mlp.c_fc.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.14.mlp.c_fc.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.14.mlp.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.14.mlp.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.15.attn.c_attn.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.15.attn.c_attn.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.15.attn.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.15.attn.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.15.ln_1.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.15.ln_1.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.15.ln_2.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.15.ln_2.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.15.mlp.c_fc.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.15.mlp.c_fc.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.15.mlp.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.15.mlp.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.16.attn.c_attn.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.16.attn.c_attn.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.16.attn.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.16.attn.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.16.ln_1.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.16.ln_1.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.16.ln_2.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.16.ln_2.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.16.mlp.c_fc.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.16.mlp.c_fc.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.16.mlp.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.16.mlp.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.17.attn.c_attn.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.17.attn.c_attn.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.17.attn.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.17.attn.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.17.ln_1.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.17.ln_1.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.17.ln_2.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.17.ln_2.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.17.mlp.c_fc.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.17.mlp.c_fc.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.17.mlp.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.17.mlp.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.18.attn.c_attn.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.18.attn.c_attn.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.18.attn.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.18.attn.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.18.ln_1.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.18.ln_1.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.18.ln_2.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.18.ln_2.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.18.mlp.c_fc.bias": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.18.mlp.c_fc.weight": "model-00003-of-00009.safetensors",
|
||||||
|
"transformer.h.18.mlp.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.18.mlp.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.19.attn.c_attn.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.19.attn.c_attn.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.19.attn.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.19.attn.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.19.ln_1.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.19.ln_1.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.19.ln_2.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.19.ln_2.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.19.mlp.c_fc.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.19.mlp.c_fc.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.19.mlp.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.19.mlp.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.2.attn.c_attn.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.2.attn.c_attn.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.2.attn.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.2.attn.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.2.ln_1.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.2.ln_1.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.2.ln_2.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.2.ln_2.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.2.mlp.c_fc.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.2.mlp.c_fc.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.2.mlp.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.2.mlp.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.20.attn.c_attn.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.20.attn.c_attn.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.20.attn.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.20.attn.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.20.ln_1.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.20.ln_1.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.20.ln_2.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.20.ln_2.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.20.mlp.c_fc.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.20.mlp.c_fc.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.20.mlp.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.20.mlp.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.21.attn.c_attn.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.21.attn.c_attn.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.21.attn.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.21.attn.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.21.ln_1.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.21.ln_1.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.21.ln_2.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.21.ln_2.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.21.mlp.c_fc.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.21.mlp.c_fc.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.21.mlp.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.21.mlp.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.22.attn.c_attn.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.22.attn.c_attn.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.22.attn.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.22.attn.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.22.ln_1.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.22.ln_1.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.22.ln_2.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.22.ln_2.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.22.mlp.c_fc.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.22.mlp.c_fc.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.22.mlp.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.22.mlp.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.23.attn.c_attn.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.23.attn.c_attn.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.23.attn.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.23.attn.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.23.ln_1.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.23.ln_1.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.23.ln_2.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.23.ln_2.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.23.mlp.c_fc.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.23.mlp.c_fc.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.23.mlp.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.23.mlp.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.24.attn.c_attn.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.24.attn.c_attn.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.24.attn.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.24.attn.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.24.ln_1.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.24.ln_1.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.24.ln_2.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.24.ln_2.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.24.mlp.c_fc.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.24.mlp.c_fc.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.24.mlp.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.24.mlp.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.25.attn.c_attn.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.25.attn.c_attn.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.25.attn.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.25.attn.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.25.ln_1.bias": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.25.ln_1.weight": "model-00004-of-00009.safetensors",
|
||||||
|
"transformer.h.25.ln_2.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.25.ln_2.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.25.mlp.c_fc.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.25.mlp.c_fc.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.25.mlp.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.25.mlp.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.26.attn.c_attn.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.26.attn.c_attn.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.26.attn.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.26.attn.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.26.ln_1.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.26.ln_1.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.26.ln_2.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.26.ln_2.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.26.mlp.c_fc.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.26.mlp.c_fc.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.26.mlp.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.26.mlp.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.27.attn.c_attn.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.27.attn.c_attn.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.27.attn.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.27.attn.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.27.ln_1.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.27.ln_1.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.27.ln_2.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.27.ln_2.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.27.mlp.c_fc.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.27.mlp.c_fc.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.27.mlp.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.27.mlp.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.28.attn.c_attn.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.28.attn.c_attn.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.28.attn.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.28.attn.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.28.ln_1.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.28.ln_1.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.28.ln_2.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.28.ln_2.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.28.mlp.c_fc.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.28.mlp.c_fc.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.28.mlp.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.28.mlp.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.29.attn.c_attn.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.29.attn.c_attn.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.29.attn.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.29.attn.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.29.ln_1.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.29.ln_1.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.29.ln_2.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.29.ln_2.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.29.mlp.c_fc.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.29.mlp.c_fc.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.29.mlp.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.29.mlp.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.3.attn.c_attn.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.3.attn.c_attn.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.3.attn.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.3.attn.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.3.ln_1.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.3.ln_1.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.3.ln_2.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.3.ln_2.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.3.mlp.c_fc.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.3.mlp.c_fc.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.3.mlp.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.3.mlp.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.30.attn.c_attn.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.30.attn.c_attn.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.30.attn.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.30.attn.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.30.ln_1.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.30.ln_1.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.30.ln_2.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.30.ln_2.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.30.mlp.c_fc.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.30.mlp.c_fc.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.30.mlp.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.30.mlp.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.31.attn.c_attn.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.31.attn.c_attn.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.31.attn.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.31.attn.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.31.ln_1.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.31.ln_1.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.31.ln_2.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.31.ln_2.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.31.mlp.c_fc.bias": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.31.mlp.c_fc.weight": "model-00005-of-00009.safetensors",
|
||||||
|
"transformer.h.31.mlp.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.31.mlp.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.32.attn.c_attn.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.32.attn.c_attn.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.32.attn.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.32.attn.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.32.ln_1.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.32.ln_1.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.32.ln_2.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.32.ln_2.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.32.mlp.c_fc.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.32.mlp.c_fc.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.32.mlp.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.32.mlp.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.33.attn.c_attn.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.33.attn.c_attn.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.33.attn.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.33.attn.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.33.ln_1.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.33.ln_1.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.33.ln_2.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.33.ln_2.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.33.mlp.c_fc.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.33.mlp.c_fc.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.33.mlp.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.33.mlp.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.34.attn.c_attn.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.34.attn.c_attn.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.34.attn.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.34.attn.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.34.ln_1.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.34.ln_1.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.34.ln_2.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.34.ln_2.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.34.mlp.c_fc.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.34.mlp.c_fc.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.34.mlp.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.34.mlp.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.35.attn.c_attn.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.35.attn.c_attn.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.35.attn.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.35.attn.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.35.ln_1.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.35.ln_1.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.35.ln_2.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.35.ln_2.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.35.mlp.c_fc.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.35.mlp.c_fc.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.35.mlp.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.35.mlp.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.36.attn.c_attn.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.36.attn.c_attn.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.36.attn.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.36.attn.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.36.ln_1.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.36.ln_1.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.36.ln_2.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.36.ln_2.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.36.mlp.c_fc.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.36.mlp.c_fc.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.36.mlp.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.36.mlp.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.37.attn.c_attn.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.37.attn.c_attn.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.37.attn.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.37.attn.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.37.ln_1.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.37.ln_1.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.37.ln_2.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.37.ln_2.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.37.mlp.c_fc.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.37.mlp.c_fc.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.37.mlp.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.37.mlp.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.38.attn.c_attn.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.38.attn.c_attn.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.38.attn.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.38.attn.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.38.ln_1.bias": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.38.ln_1.weight": "model-00006-of-00009.safetensors",
|
||||||
|
"transformer.h.38.ln_2.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.38.ln_2.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.38.mlp.c_fc.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.38.mlp.c_fc.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.38.mlp.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.38.mlp.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.39.attn.c_attn.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.39.attn.c_attn.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.39.attn.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.39.attn.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.39.ln_1.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.39.ln_1.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.39.ln_2.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.39.ln_2.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.39.mlp.c_fc.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.39.mlp.c_fc.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.39.mlp.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.39.mlp.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.4.attn.c_attn.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.4.attn.c_attn.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.4.attn.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.4.attn.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.4.ln_1.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.4.ln_1.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.4.ln_2.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.4.ln_2.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.4.mlp.c_fc.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.4.mlp.c_fc.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.4.mlp.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.4.mlp.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.40.attn.c_attn.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.40.attn.c_attn.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.40.attn.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.40.attn.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.40.ln_1.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.40.ln_1.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.40.ln_2.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.40.ln_2.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.40.mlp.c_fc.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.40.mlp.c_fc.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.40.mlp.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.40.mlp.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.41.attn.c_attn.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.41.attn.c_attn.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.41.attn.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.41.attn.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.41.ln_1.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.41.ln_1.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.41.ln_2.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.41.ln_2.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.41.mlp.c_fc.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.41.mlp.c_fc.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.41.mlp.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.41.mlp.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.42.attn.c_attn.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.42.attn.c_attn.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.42.attn.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.42.attn.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.42.ln_1.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.42.ln_1.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.42.ln_2.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.42.ln_2.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.42.mlp.c_fc.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.42.mlp.c_fc.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.42.mlp.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.42.mlp.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.43.attn.c_attn.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.43.attn.c_attn.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.43.attn.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.43.attn.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.43.ln_1.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.43.ln_1.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.43.ln_2.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.43.ln_2.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.43.mlp.c_fc.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.43.mlp.c_fc.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.43.mlp.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.43.mlp.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.44.attn.c_attn.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.44.attn.c_attn.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.44.attn.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.44.attn.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.44.ln_1.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.44.ln_1.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.44.ln_2.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.44.ln_2.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.44.mlp.c_fc.bias": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.44.mlp.c_fc.weight": "model-00007-of-00009.safetensors",
|
||||||
|
"transformer.h.44.mlp.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.44.mlp.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.45.attn.c_attn.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.45.attn.c_attn.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.45.attn.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.45.attn.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.45.ln_1.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.45.ln_1.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.45.ln_2.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.45.ln_2.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.45.mlp.c_fc.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.45.mlp.c_fc.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.45.mlp.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.45.mlp.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.46.attn.c_attn.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.46.attn.c_attn.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.46.attn.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.46.attn.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.46.ln_1.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.46.ln_1.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.46.ln_2.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.46.ln_2.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.46.mlp.c_fc.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.46.mlp.c_fc.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.46.mlp.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.46.mlp.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.47.attn.c_attn.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.47.attn.c_attn.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.47.attn.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.47.attn.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.47.ln_1.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.47.ln_1.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.47.ln_2.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.47.ln_2.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.47.mlp.c_fc.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.47.mlp.c_fc.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.47.mlp.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.47.mlp.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.48.attn.c_attn.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.48.attn.c_attn.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.48.attn.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.48.attn.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.48.ln_1.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.48.ln_1.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.48.ln_2.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.48.ln_2.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.48.mlp.c_fc.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.48.mlp.c_fc.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.48.mlp.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.48.mlp.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.49.attn.c_attn.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.49.attn.c_attn.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.49.attn.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.49.attn.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.49.ln_1.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.49.ln_1.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.49.ln_2.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.49.ln_2.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.49.mlp.c_fc.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.49.mlp.c_fc.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.49.mlp.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.49.mlp.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.5.attn.c_attn.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.5.attn.c_attn.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.5.attn.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.5.attn.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.5.ln_1.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.5.ln_1.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.5.ln_2.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.5.ln_2.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.5.mlp.c_fc.bias": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.5.mlp.c_fc.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.h.5.mlp.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.5.mlp.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.50.attn.c_attn.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.50.attn.c_attn.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.50.attn.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.50.attn.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.50.ln_1.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.50.ln_1.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.50.ln_2.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.50.ln_2.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.50.mlp.c_fc.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.50.mlp.c_fc.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.50.mlp.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.50.mlp.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.51.attn.c_attn.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.51.attn.c_attn.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.51.attn.c_proj.bias": "model-00009-of-00009.safetensors",
|
||||||
|
"transformer.h.51.attn.c_proj.weight": "model-00009-of-00009.safetensors",
|
||||||
|
"transformer.h.51.ln_1.bias": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.51.ln_1.weight": "model-00008-of-00009.safetensors",
|
||||||
|
"transformer.h.51.ln_2.bias": "model-00009-of-00009.safetensors",
|
||||||
|
"transformer.h.51.ln_2.weight": "model-00009-of-00009.safetensors",
|
||||||
|
"transformer.h.51.mlp.c_fc.bias": "model-00009-of-00009.safetensors",
|
||||||
|
"transformer.h.51.mlp.c_fc.weight": "model-00009-of-00009.safetensors",
|
||||||
|
"transformer.h.51.mlp.c_proj.bias": "model-00009-of-00009.safetensors",
|
||||||
|
"transformer.h.51.mlp.c_proj.weight": "model-00009-of-00009.safetensors",
|
||||||
|
"transformer.h.6.attn.c_attn.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.6.attn.c_attn.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.6.attn.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.6.attn.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.6.ln_1.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.6.ln_1.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.6.ln_2.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.6.ln_2.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.6.mlp.c_fc.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.6.mlp.c_fc.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.6.mlp.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.6.mlp.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.7.attn.c_attn.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.7.attn.c_attn.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.7.attn.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.7.attn.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.7.ln_1.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.7.ln_1.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.7.ln_2.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.7.ln_2.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.7.mlp.c_fc.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.7.mlp.c_fc.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.7.mlp.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.7.mlp.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.8.attn.c_attn.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.8.attn.c_attn.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.8.attn.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.8.attn.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.8.ln_1.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.8.ln_1.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.8.ln_2.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.8.ln_2.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.8.mlp.c_fc.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.8.mlp.c_fc.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.8.mlp.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.8.mlp.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.9.attn.c_attn.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.9.attn.c_attn.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.9.attn.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.9.attn.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.9.ln_1.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.9.ln_1.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.9.ln_2.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.9.ln_2.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.9.mlp.c_fc.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.9.mlp.c_fc.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.9.mlp.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.h.9.mlp.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||||
|
"transformer.ln_f.bias": "model-00009-of-00009.safetensors",
|
||||||
|
"transformer.ln_f.weight": "model-00009-of-00009.safetensors",
|
||||||
|
"transformer.wpe.weight": "model-00001-of-00009.safetensors",
|
||||||
|
"transformer.wte.weight": "model-00001-of-00009.safetensors"
|
||||||
|
}
|
||||||
|
}
|
||||||
51
special_tokens_map.json
Normal file
51
special_tokens_map.json
Normal file
@@ -0,0 +1,51 @@
|
|||||||
|
{
|
||||||
|
"additional_special_tokens": [
|
||||||
|
"<|endoftext|>",
|
||||||
|
"<fim_prefix>",
|
||||||
|
"<fim_middle>",
|
||||||
|
"<fim_suffix>",
|
||||||
|
"<fim_pad>",
|
||||||
|
"<filename>",
|
||||||
|
"<gh_stars>",
|
||||||
|
"<issue_start>",
|
||||||
|
"<issue_comment>",
|
||||||
|
"<issue_closed>",
|
||||||
|
"<jupyter_start>",
|
||||||
|
"<jupyter_text>",
|
||||||
|
"<jupyter_code>",
|
||||||
|
"<jupyter_output>",
|
||||||
|
"<empty_output>",
|
||||||
|
"<commit_before>",
|
||||||
|
"<commit_msg>",
|
||||||
|
"<commit_after>",
|
||||||
|
"<reponame>"
|
||||||
|
],
|
||||||
|
"bos_token": {
|
||||||
|
"content": "<|endoftext|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
},
|
||||||
|
"eos_token": {
|
||||||
|
"content": "<|endoftext|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
},
|
||||||
|
"pad_token": {
|
||||||
|
"content": "<|endoftext|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
},
|
||||||
|
"unk_token": {
|
||||||
|
"content": "<|endoftext|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
}
|
||||||
|
}
|
||||||
98258
tokenizer.json
Normal file
98258
tokenizer.json
Normal file
File diff suppressed because it is too large
Load Diff
187
tokenizer_config.json
Normal file
187
tokenizer_config.json
Normal file
@@ -0,0 +1,187 @@
|
|||||||
|
{
|
||||||
|
"add_prefix_space": false,
|
||||||
|
"added_tokens_decoder": {
|
||||||
|
"0": {
|
||||||
|
"content": "<|endoftext|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"1": {
|
||||||
|
"content": "<fim_prefix>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"2": {
|
||||||
|
"content": "<fim_middle>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"3": {
|
||||||
|
"content": "<fim_suffix>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"4": {
|
||||||
|
"content": "<fim_pad>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"5": {
|
||||||
|
"content": "<filename>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"6": {
|
||||||
|
"content": "<gh_stars>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"7": {
|
||||||
|
"content": "<issue_start>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"8": {
|
||||||
|
"content": "<issue_comment>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"9": {
|
||||||
|
"content": "<issue_closed>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"10": {
|
||||||
|
"content": "<jupyter_start>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"11": {
|
||||||
|
"content": "<jupyter_text>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"12": {
|
||||||
|
"content": "<jupyter_code>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"13": {
|
||||||
|
"content": "<jupyter_output>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"14": {
|
||||||
|
"content": "<empty_output>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"15": {
|
||||||
|
"content": "<commit_before>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"16": {
|
||||||
|
"content": "<commit_msg>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"17": {
|
||||||
|
"content": "<commit_after>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"18": {
|
||||||
|
"content": "<reponame>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"additional_special_tokens": [
|
||||||
|
"<|endoftext|>",
|
||||||
|
"<fim_prefix>",
|
||||||
|
"<fim_middle>",
|
||||||
|
"<fim_suffix>",
|
||||||
|
"<fim_pad>",
|
||||||
|
"<filename>",
|
||||||
|
"<gh_stars>",
|
||||||
|
"<issue_start>",
|
||||||
|
"<issue_comment>",
|
||||||
|
"<issue_closed>",
|
||||||
|
"<jupyter_start>",
|
||||||
|
"<jupyter_text>",
|
||||||
|
"<jupyter_code>",
|
||||||
|
"<jupyter_output>",
|
||||||
|
"<empty_output>",
|
||||||
|
"<commit_before>",
|
||||||
|
"<commit_msg>",
|
||||||
|
"<commit_after>",
|
||||||
|
"<reponame>"
|
||||||
|
],
|
||||||
|
"bos_token": "<|endoftext|>",
|
||||||
|
"clean_up_tokenization_spaces": true,
|
||||||
|
"eos_token": "<|endoftext|>",
|
||||||
|
"model_max_length": 8192,
|
||||||
|
"pad_token": "<|endoftext|>",
|
||||||
|
"padding_side": "left",
|
||||||
|
"tokenizer_class": "GPT2Tokenizer",
|
||||||
|
"unk_token": "<|endoftext|>",
|
||||||
|
"vocab_size": 49152
|
||||||
|
}
|
||||||
Reference in New Issue
Block a user