初始化项目,由ModelHub XC社区提供模型
Model: AI-ModelScope/granite-20b-code-base-8k Source: Original Platform
This commit is contained in:
44
.gitattributes
vendored
Normal file
44
.gitattributes
vendored
Normal file
@@ -0,0 +1,44 @@
|
||||
*.7z filter=lfs diff=lfs merge=lfs -text
|
||||
*.arrow filter=lfs diff=lfs merge=lfs -text
|
||||
*.bin filter=lfs diff=lfs merge=lfs -text
|
||||
*.bz2 filter=lfs diff=lfs merge=lfs -text
|
||||
*.ckpt filter=lfs diff=lfs merge=lfs -text
|
||||
*.ftz filter=lfs diff=lfs merge=lfs -text
|
||||
*.gz filter=lfs diff=lfs merge=lfs -text
|
||||
*.h5 filter=lfs diff=lfs merge=lfs -text
|
||||
*.joblib filter=lfs diff=lfs merge=lfs -text
|
||||
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.mlmodel filter=lfs diff=lfs merge=lfs -text
|
||||
*.model filter=lfs diff=lfs merge=lfs -text
|
||||
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
||||
*.npy filter=lfs diff=lfs merge=lfs -text
|
||||
*.npz filter=lfs diff=lfs merge=lfs -text
|
||||
*.onnx filter=lfs diff=lfs merge=lfs -text
|
||||
*.ot filter=lfs diff=lfs merge=lfs -text
|
||||
*.parquet filter=lfs diff=lfs merge=lfs -text
|
||||
*.pb filter=lfs diff=lfs merge=lfs -text
|
||||
*.pickle filter=lfs diff=lfs merge=lfs -text
|
||||
*.pkl filter=lfs diff=lfs merge=lfs -text
|
||||
*.pt filter=lfs diff=lfs merge=lfs -text
|
||||
*.pth filter=lfs diff=lfs merge=lfs -text
|
||||
*.rar filter=lfs diff=lfs merge=lfs -text
|
||||
*.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar filter=lfs diff=lfs merge=lfs -text
|
||||
*.tflite filter=lfs diff=lfs merge=lfs -text
|
||||
*.tgz filter=lfs diff=lfs merge=lfs -text
|
||||
*.wasm filter=lfs diff=lfs merge=lfs -text
|
||||
*.xz filter=lfs diff=lfs merge=lfs -text
|
||||
*.zip filter=lfs diff=lfs merge=lfs -text
|
||||
*.zst filter=lfs diff=lfs merge=lfs -text
|
||||
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||
model-00001-of-00009.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
model-00002-of-00009.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
model-00003-of-00009.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
model-00004-of-00009.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
model-00005-of-00009.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
model-00006-of-00009.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
model-00007-of-00009.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
model-00008-of-00009.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
model-00009-of-00009.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
287
README.md
Normal file
287
README.md
Normal file
@@ -0,0 +1,287 @@
|
||||
---
|
||||
datasets:
|
||||
- codeparrot/github-code-clean
|
||||
- bigcode/starcoderdata
|
||||
- open-web-math/open-web-math
|
||||
- math-ai/StackMathQA
|
||||
inference: true
|
||||
library_name: transformers
|
||||
license: apache-2.0
|
||||
metrics:
|
||||
- code_eval
|
||||
model-index:
|
||||
- name: granite-20b-code-base-8k
|
||||
results:
|
||||
- dataset:
|
||||
name: MBPP
|
||||
type: mbpp
|
||||
metrics:
|
||||
- name: pass@1
|
||||
type: pass@1
|
||||
value: 43.8
|
||||
veriefied: false
|
||||
task:
|
||||
type: text-generation
|
||||
- dataset:
|
||||
name: MBPP+
|
||||
type: evalplus/mbppplus
|
||||
metrics:
|
||||
- name: pass@1
|
||||
type: pass@1
|
||||
value: 51.6
|
||||
veriefied: false
|
||||
task:
|
||||
type: text-generation
|
||||
- dataset:
|
||||
name: HumanEvalSynthesis(Python)
|
||||
type: bigcode/humanevalpack
|
||||
metrics:
|
||||
- name: pass@1
|
||||
type: pass@1
|
||||
value: 48.2
|
||||
veriefied: false
|
||||
task:
|
||||
type: text-generation
|
||||
- dataset:
|
||||
name: HumanEvalSynthesis(JavaScript)
|
||||
type: bigcode/humanevalpack
|
||||
metrics:
|
||||
- name: pass@1
|
||||
type: pass@1
|
||||
value: 50.0
|
||||
veriefied: false
|
||||
task:
|
||||
type: text-generation
|
||||
- dataset:
|
||||
name: HumanEvalSynthesis(Java)
|
||||
type: bigcode/humanevalpack
|
||||
metrics:
|
||||
- name: pass@1
|
||||
type: pass@1
|
||||
value: 59.1
|
||||
veriefied: false
|
||||
task:
|
||||
type: text-generation
|
||||
- dataset:
|
||||
name: HumanEvalSynthesis(Go)
|
||||
type: bigcode/humanevalpack
|
||||
metrics:
|
||||
- name: pass@1
|
||||
type: pass@1
|
||||
value: 32.3
|
||||
veriefied: false
|
||||
task:
|
||||
type: text-generation
|
||||
- dataset:
|
||||
name: HumanEvalSynthesis(C++)
|
||||
type: bigcode/humanevalpack
|
||||
metrics:
|
||||
- name: pass@1
|
||||
type: pass@1
|
||||
value: 40.9
|
||||
veriefied: false
|
||||
task:
|
||||
type: text-generation
|
||||
- dataset:
|
||||
name: HumanEvalSynthesis(Rust)
|
||||
type: bigcode/humanevalpack
|
||||
metrics:
|
||||
- name: pass@1
|
||||
type: pass@1
|
||||
value: 35.4
|
||||
veriefied: false
|
||||
task:
|
||||
type: text-generation
|
||||
- dataset:
|
||||
name: HumanEvalExplain(Python)
|
||||
type: bigcode/humanevalpack
|
||||
metrics:
|
||||
- name: pass@1
|
||||
type: pass@1
|
||||
value: 17.1
|
||||
veriefied: false
|
||||
task:
|
||||
type: text-generation
|
||||
- dataset:
|
||||
name: HumanEvalExplain(JavaScript)
|
||||
type: bigcode/humanevalpack
|
||||
metrics:
|
||||
- name: pass@1
|
||||
type: pass@1
|
||||
value: 18.3
|
||||
veriefied: false
|
||||
task:
|
||||
type: text-generation
|
||||
- dataset:
|
||||
name: HumanEvalExplain(Java)
|
||||
type: bigcode/humanevalpack
|
||||
metrics:
|
||||
- name: pass@1
|
||||
type: pass@1
|
||||
value: 23.2
|
||||
veriefied: false
|
||||
task:
|
||||
type: text-generation
|
||||
- dataset:
|
||||
name: HumanEvalExplain(Go)
|
||||
type: bigcode/humanevalpack
|
||||
metrics:
|
||||
- name: pass@1
|
||||
type: pass@1
|
||||
value: 10.4
|
||||
veriefied: false
|
||||
task:
|
||||
type: text-generation
|
||||
- dataset:
|
||||
name: HumanEvalExplain(C++)
|
||||
type: bigcode/humanevalpack
|
||||
metrics:
|
||||
- name: pass@1
|
||||
type: pass@1
|
||||
value: 25.6
|
||||
veriefied: false
|
||||
task:
|
||||
type: text-generation
|
||||
- dataset:
|
||||
name: HumanEvalExplain(Rust)
|
||||
type: bigcode/humanevalpack
|
||||
metrics:
|
||||
- name: pass@1
|
||||
type: pass@1
|
||||
value: 18.3
|
||||
veriefied: false
|
||||
task:
|
||||
type: text-generation
|
||||
- dataset:
|
||||
name: HumanEvalFix(Python)
|
||||
type: bigcode/humanevalpack
|
||||
metrics:
|
||||
- name: pass@1
|
||||
type: pass@1
|
||||
value: 23.2
|
||||
veriefied: false
|
||||
task:
|
||||
type: text-generation
|
||||
- dataset:
|
||||
name: HumanEvalFix(JavaScript)
|
||||
type: bigcode/humanevalpack
|
||||
metrics:
|
||||
- name: pass@1
|
||||
type: pass@1
|
||||
value: 23.8
|
||||
veriefied: false
|
||||
task:
|
||||
type: text-generation
|
||||
- dataset:
|
||||
name: HumanEvalFix(Java)
|
||||
type: bigcode/humanevalpack
|
||||
metrics:
|
||||
- name: pass@1
|
||||
type: pass@1
|
||||
value: 14.6
|
||||
veriefied: false
|
||||
task:
|
||||
type: text-generation
|
||||
- dataset:
|
||||
name: HumanEvalFix(Go)
|
||||
type: bigcode/humanevalpack
|
||||
metrics:
|
||||
- name: pass@1
|
||||
type: pass@1
|
||||
value: 26.2
|
||||
veriefied: false
|
||||
task:
|
||||
type: text-generation
|
||||
- dataset:
|
||||
name: HumanEvalFix(C++)
|
||||
type: bigcode/humanevalpack
|
||||
metrics:
|
||||
- name: pass@1
|
||||
type: pass@1
|
||||
value: 15.2
|
||||
veriefied: false
|
||||
task:
|
||||
type: text-generation
|
||||
- dataset:
|
||||
name: HumanEvalFix(Rust)
|
||||
type: bigcode/humanevalpack
|
||||
metrics:
|
||||
- name: pass@1
|
||||
type: pass@1
|
||||
value: 3.0
|
||||
veriefied: false
|
||||
task:
|
||||
type: text-generation
|
||||
pipeline_tag: text-generation
|
||||
tags:
|
||||
- code
|
||||
- granite
|
||||
---
|
||||
|
||||
---
|
||||
|
||||
# ⚠️ DEPRECATION WARNING ⚠️
|
||||
# ⚠️ NOT RECOMMENDED FOR USE IN NEW PROJECTS ⚠️
|
||||
|
||||
New applications/projects should use the latest mainline Granite language model family, whose code capabilities supercede this model.
|
||||
This model is being made available strictly for historical/scientific purposes.
|
||||
**Please see our [Granite Collections](https://huggingface.co/ibm-granite/collections) for the latest Granite releases.**
|
||||
|
||||
---
|
||||
|
||||

|
||||
|
||||
# Granite-20B-Code-Base-8K
|
||||
|
||||
## Model Summary
|
||||
**Granite-20B-Code-Base-8K** is a decoder-only code model designed for code generative tasks (e.g., code generation, code explanation, code fixing, etc.). It is trained from scratch with a two-phase training strategy. In phase 1, our model is trained on 3 trillion tokens sourced from 116 programming languages, ensuring a comprehensive understanding of programming languages and syntax. In phase 2, our model is trained on 500 billion tokens with a carefully designed mixture of high-quality data from code and natural language domains to improve the models’ ability to reason and follow instructions.
|
||||
|
||||
- **Developers:** IBM Research
|
||||
- **GitHub Repository:** [ibm-granite/granite-code-models](https://github.com/ibm-granite/granite-code-models)
|
||||
- **Paper:** [Granite Code Models: A Family of Open Foundation Models for Code Intelligence](https://arxiv.org/abs/2405.04324)
|
||||
- **Release Date**: May 6th, 2024
|
||||
- **License:** [Apache 2.0](https://www.apache.org/licenses/LICENSE-2.0).
|
||||
|
||||
## Usage
|
||||
### Intended use
|
||||
Prominent enterprise use cases of LLMs in software engineering productivity include code generation, code explanation, code fixing, generating unit tests, generating documentation, addressing technical debt issues, vulnerability detection, code translation, and more. All Granite Code Base models, including the **20B parameter model**, are able to handle these tasks as they were trained on a large amount of code data from 116 programming languages.
|
||||
|
||||
### Generation
|
||||
This is a simple example of how to use **Granite-20B-Code-Base-8K** model.
|
||||
|
||||
```python
|
||||
import torch
|
||||
from transformers import AutoModelForCausalLM, AutoTokenizer
|
||||
device = "cuda" # or "cpu"
|
||||
model_path = "ibm-granite/granite-20b-code-base-8k"
|
||||
tokenizer = AutoTokenizer.from_pretrained(model_path)
|
||||
# drop device_map if running on CPU
|
||||
model = AutoModelForCausalLM.from_pretrained(model_path, device_map=device)
|
||||
model.eval()
|
||||
# change input text as desired
|
||||
input_text = "def generate():"
|
||||
# tokenize the text
|
||||
input_tokens = tokenizer(input_text, return_tensors="pt")
|
||||
# transfer tokenized inputs to the device
|
||||
for i in input_tokens:
|
||||
input_tokens[i] = input_tokens[i].to(device)
|
||||
# generate output tokens
|
||||
output = model.generate(**input_tokens)
|
||||
# decode output tokens into text
|
||||
output = tokenizer.batch_decode(output)
|
||||
# loop over the batch to print, in this example the batch size is 1
|
||||
for i in output:
|
||||
print(i)
|
||||
```
|
||||
|
||||
## Training Data
|
||||
- **Data Collection and Filtering:** Pretraining code data is sourced from a combination of publicly available datasets (e.g., [GitHub Code Clean](https://huggingface.co/datasets/codeparrot/github-code-clean), [Starcoder data](https://huggingface.co/datasets/bigcode/starcoderdata)), and additional public code repositories and issues from GitHub. We filter raw data to retain a list of 116 programming languages. After language filtering, we also filter out low-quality code.
|
||||
- **Exact and Fuzzy Deduplication:** We adopt an aggressive deduplication strategy that includes both exact and fuzzy deduplication to remove documents having (near) identical code content.
|
||||
- **HAP, PII, Malware Filtering:** We apply a HAP content filter that reduces models' likelihood of generating hateful, abusive, or profane language. We also make sure to redact Personally Identifiable Information (PII) by replacing PII content (e.g., names, email addresses, keys, passwords) with corresponding tokens (e.g., ⟨NAME⟩, ⟨EMAIL⟩, ⟨KEY⟩, ⟨PASSWORD⟩). Moreover, we scan all datasets using [ClamAV](https://www.clamav.net/) to identify and remove instances of malware in the source code.
|
||||
- **Natural Language Datasets:** In addition to collecting code data for model training, we curate several publicly available high-quality natural language datasets to improve models' proficiency in language understanding and mathematical reasoning. Unlike the code data, we do not deduplicate these datasets.
|
||||
|
||||
## Infrastructure
|
||||
We train the Granite Code models using two of IBM's super computing clusters, namely Vela and Blue Vela, both outfitted with NVIDIA A100 and H100 GPUs respectively. These clusters provide a scalable and efficient infrastructure for training our models over thousands of GPUs.
|
||||
|
||||
## Ethical Considerations and Limitations
|
||||
The use of Large Language Models involves risks and ethical considerations people must be aware of. Regarding code generation, caution is urged against complete reliance on specific code models for crucial decisions or impactful information as the generated code is not guaranteed to work as intended. **Granite-20B-Code-Base-8K** model is not the exception in this regard. Even though this model is suited for multiple code-related tasks, it has not undergone any safety alignment, there it may produce problematic outputs. Additionally, it remains uncertain whether smaller models might exhibit increased susceptibility to hallucination in generation scenarios by copying source code verbatim from the training dataset due to their reduced sizes and memorization capacities. This aspect is currently an active area of research, and we anticipate more rigorous exploration, comprehension, and mitigations in this domain. Regarding ethics, a latent risk associated with all Large Language Models is their malicious utilization. We urge the community to use **Granite-20B-Code-Base-8K** model with ethical intentions and in a responsible way.
|
||||
28
config.json
Normal file
28
config.json
Normal file
@@ -0,0 +1,28 @@
|
||||
{
|
||||
"activation_function": "gelu",
|
||||
"architectures": [
|
||||
"GPTBigCodeForCausalLM"
|
||||
],
|
||||
"attention_softmax_in_fp32": true,
|
||||
"attn_pdrop": 0.1,
|
||||
"bos_token_id": 0,
|
||||
"embd_pdrop": 0.1,
|
||||
"eos_token_id": 0,
|
||||
"initializer_range": 0.02,
|
||||
"layer_norm_epsilon": 1e-05,
|
||||
"model_type": "gpt_bigcode",
|
||||
"multi_query": true,
|
||||
"n_embd": 6144,
|
||||
"n_head": 48,
|
||||
"n_inner": 24576,
|
||||
"n_layer": 52,
|
||||
"n_positions": 8192,
|
||||
"pad_token_id": 0,
|
||||
"resid_pdrop": 0.1,
|
||||
"scale_attention_softmax_in_fp32": true,
|
||||
"scale_attn_weights": true,
|
||||
"torch_dtype": "bfloat16",
|
||||
"transformers_version": "4.41.2",
|
||||
"use_cache": true,
|
||||
"vocab_size": 49152
|
||||
}
|
||||
1
configuration.json
Normal file
1
configuration.json
Normal file
@@ -0,0 +1 @@
|
||||
{"framework": "pytorch", "task": "text-generation", "allow_remote": true}
|
||||
7
generation_config.json
Normal file
7
generation_config.json
Normal file
@@ -0,0 +1,7 @@
|
||||
{
|
||||
"_from_model_config": true,
|
||||
"bos_token_id": 0,
|
||||
"eos_token_id": 0,
|
||||
"pad_token_id": 0,
|
||||
"transformers_version": "4.41.2"
|
||||
}
|
||||
3
model-00001-of-00009.safetensors
Normal file
3
model-00001-of-00009.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:22b893e90be19cc42647f7d76caef1bd7101b6904df709b93472265fa6e41594
|
||||
size 4952185256
|
||||
3
model-00002-of-00009.safetensors
Normal file
3
model-00002-of-00009.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:dc7f98d43d5aa8531381ffd2b7995008f1471a707a57becf638d089c549edec8
|
||||
size 4930227792
|
||||
3
model-00003-of-00009.safetensors
Normal file
3
model-00003-of-00009.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:1f56c8969bbdc7995f1c61123f4b63da7ff202a93e40fde98121ec9ccdc49556
|
||||
size 4927118464
|
||||
3
model-00004-of-00009.safetensors
Normal file
3
model-00004-of-00009.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:dd7060b8fac28950098ce792fc518a0a8af296f47e22709ccaad1ce8216591ea
|
||||
size 4930227864
|
||||
3
model-00005-of-00009.safetensors
Normal file
3
model-00005-of-00009.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:bbd071ecf07518991d9d82749d9c864a7e923eb82450048565e9121604f4cbe2
|
||||
size 4927118464
|
||||
3
model-00006-of-00009.safetensors
Normal file
3
model-00006-of-00009.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:b3a0e75fbd4db5862a20e23ce6ffbf69a4a28d59505085b8d82c1d61620cbf98
|
||||
size 4930227864
|
||||
3
model-00007-of-00009.safetensors
Normal file
3
model-00007-of-00009.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:8fee8bebaf2202e65cd8253898b317fc4a03a5a5cfb5bd6a01ccbf76a65d7c8b
|
||||
size 4927118464
|
||||
3
model-00008-of-00009.safetensors
Normal file
3
model-00008-of-00009.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:1fa8ce48dbb754a3e762d10d3590c65fb0eb30b6f28044f37ad184c335ff6916
|
||||
size 4930227864
|
||||
3
model-00009-of-00009.safetensors
Normal file
3
model-00009-of-00009.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:62f5a5189fb992fb52b72861f432dc19123bef17f78c42e1db8a89b208b4b5ab
|
||||
size 679601176
|
||||
635
model.safetensors.index.json
Normal file
635
model.safetensors.index.json
Normal file
@@ -0,0 +1,635 @@
|
||||
{
|
||||
"metadata": {
|
||||
"total_size": 40133986304
|
||||
},
|
||||
"weight_map": {
|
||||
"transformer.h.0.attn.c_attn.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.0.attn.c_attn.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.0.attn.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.0.attn.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.0.ln_1.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.0.ln_1.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.0.ln_2.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.0.ln_2.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.0.mlp.c_fc.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.0.mlp.c_fc.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.0.mlp.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.0.mlp.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.1.attn.c_attn.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.1.attn.c_attn.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.1.attn.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.1.attn.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.1.ln_1.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.1.ln_1.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.1.ln_2.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.1.ln_2.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.1.mlp.c_fc.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.1.mlp.c_fc.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.1.mlp.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.1.mlp.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.10.attn.c_attn.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.10.attn.c_attn.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.10.attn.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.10.attn.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.10.ln_1.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.10.ln_1.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.10.ln_2.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.10.ln_2.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.10.mlp.c_fc.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.10.mlp.c_fc.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.10.mlp.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.10.mlp.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.11.attn.c_attn.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.11.attn.c_attn.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.11.attn.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.11.attn.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.11.ln_1.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.11.ln_1.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.11.ln_2.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.11.ln_2.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.11.mlp.c_fc.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.11.mlp.c_fc.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.11.mlp.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.11.mlp.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.12.attn.c_attn.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.12.attn.c_attn.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.12.attn.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.12.attn.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.12.ln_1.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.12.ln_1.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.12.ln_2.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.12.ln_2.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.12.mlp.c_fc.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.12.mlp.c_fc.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.12.mlp.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.12.mlp.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.13.attn.c_attn.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.13.attn.c_attn.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.13.attn.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.13.attn.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.13.ln_1.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.13.ln_1.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.13.ln_2.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.13.ln_2.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.13.mlp.c_fc.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.13.mlp.c_fc.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.13.mlp.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.13.mlp.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.14.attn.c_attn.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.14.attn.c_attn.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.14.attn.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.14.attn.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.14.ln_1.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.14.ln_1.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.14.ln_2.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.14.ln_2.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.14.mlp.c_fc.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.14.mlp.c_fc.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.14.mlp.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.14.mlp.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.15.attn.c_attn.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.15.attn.c_attn.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.15.attn.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.15.attn.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.15.ln_1.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.15.ln_1.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.15.ln_2.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.15.ln_2.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.15.mlp.c_fc.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.15.mlp.c_fc.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.15.mlp.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.15.mlp.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.16.attn.c_attn.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.16.attn.c_attn.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.16.attn.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.16.attn.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.16.ln_1.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.16.ln_1.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.16.ln_2.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.16.ln_2.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.16.mlp.c_fc.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.16.mlp.c_fc.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.16.mlp.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.16.mlp.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.17.attn.c_attn.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.17.attn.c_attn.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.17.attn.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.17.attn.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.17.ln_1.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.17.ln_1.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.17.ln_2.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.17.ln_2.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.17.mlp.c_fc.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.17.mlp.c_fc.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.17.mlp.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.17.mlp.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.18.attn.c_attn.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.18.attn.c_attn.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.18.attn.c_proj.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.18.attn.c_proj.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.18.ln_1.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.18.ln_1.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.18.ln_2.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.18.ln_2.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.18.mlp.c_fc.bias": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.18.mlp.c_fc.weight": "model-00003-of-00009.safetensors",
|
||||
"transformer.h.18.mlp.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.18.mlp.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.19.attn.c_attn.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.19.attn.c_attn.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.19.attn.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.19.attn.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.19.ln_1.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.19.ln_1.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.19.ln_2.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.19.ln_2.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.19.mlp.c_fc.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.19.mlp.c_fc.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.19.mlp.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.19.mlp.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.2.attn.c_attn.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.2.attn.c_attn.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.2.attn.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.2.attn.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.2.ln_1.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.2.ln_1.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.2.ln_2.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.2.ln_2.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.2.mlp.c_fc.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.2.mlp.c_fc.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.2.mlp.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.2.mlp.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.20.attn.c_attn.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.20.attn.c_attn.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.20.attn.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.20.attn.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.20.ln_1.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.20.ln_1.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.20.ln_2.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.20.ln_2.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.20.mlp.c_fc.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.20.mlp.c_fc.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.20.mlp.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.20.mlp.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.21.attn.c_attn.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.21.attn.c_attn.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.21.attn.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.21.attn.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.21.ln_1.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.21.ln_1.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.21.ln_2.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.21.ln_2.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.21.mlp.c_fc.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.21.mlp.c_fc.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.21.mlp.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.21.mlp.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.22.attn.c_attn.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.22.attn.c_attn.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.22.attn.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.22.attn.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.22.ln_1.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.22.ln_1.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.22.ln_2.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.22.ln_2.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.22.mlp.c_fc.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.22.mlp.c_fc.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.22.mlp.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.22.mlp.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.23.attn.c_attn.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.23.attn.c_attn.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.23.attn.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.23.attn.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.23.ln_1.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.23.ln_1.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.23.ln_2.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.23.ln_2.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.23.mlp.c_fc.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.23.mlp.c_fc.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.23.mlp.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.23.mlp.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.24.attn.c_attn.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.24.attn.c_attn.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.24.attn.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.24.attn.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.24.ln_1.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.24.ln_1.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.24.ln_2.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.24.ln_2.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.24.mlp.c_fc.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.24.mlp.c_fc.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.24.mlp.c_proj.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.24.mlp.c_proj.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.25.attn.c_attn.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.25.attn.c_attn.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.25.attn.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.25.attn.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.25.ln_1.bias": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.25.ln_1.weight": "model-00004-of-00009.safetensors",
|
||||
"transformer.h.25.ln_2.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.25.ln_2.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.25.mlp.c_fc.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.25.mlp.c_fc.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.25.mlp.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.25.mlp.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.26.attn.c_attn.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.26.attn.c_attn.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.26.attn.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.26.attn.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.26.ln_1.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.26.ln_1.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.26.ln_2.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.26.ln_2.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.26.mlp.c_fc.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.26.mlp.c_fc.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.26.mlp.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.26.mlp.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.27.attn.c_attn.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.27.attn.c_attn.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.27.attn.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.27.attn.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.27.ln_1.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.27.ln_1.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.27.ln_2.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.27.ln_2.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.27.mlp.c_fc.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.27.mlp.c_fc.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.27.mlp.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.27.mlp.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.28.attn.c_attn.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.28.attn.c_attn.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.28.attn.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.28.attn.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.28.ln_1.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.28.ln_1.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.28.ln_2.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.28.ln_2.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.28.mlp.c_fc.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.28.mlp.c_fc.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.28.mlp.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.28.mlp.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.29.attn.c_attn.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.29.attn.c_attn.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.29.attn.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.29.attn.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.29.ln_1.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.29.ln_1.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.29.ln_2.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.29.ln_2.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.29.mlp.c_fc.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.29.mlp.c_fc.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.29.mlp.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.29.mlp.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.3.attn.c_attn.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.3.attn.c_attn.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.3.attn.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.3.attn.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.3.ln_1.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.3.ln_1.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.3.ln_2.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.3.ln_2.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.3.mlp.c_fc.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.3.mlp.c_fc.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.3.mlp.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.3.mlp.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.30.attn.c_attn.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.30.attn.c_attn.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.30.attn.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.30.attn.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.30.ln_1.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.30.ln_1.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.30.ln_2.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.30.ln_2.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.30.mlp.c_fc.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.30.mlp.c_fc.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.30.mlp.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.30.mlp.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.31.attn.c_attn.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.31.attn.c_attn.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.31.attn.c_proj.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.31.attn.c_proj.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.31.ln_1.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.31.ln_1.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.31.ln_2.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.31.ln_2.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.31.mlp.c_fc.bias": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.31.mlp.c_fc.weight": "model-00005-of-00009.safetensors",
|
||||
"transformer.h.31.mlp.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.31.mlp.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.32.attn.c_attn.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.32.attn.c_attn.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.32.attn.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.32.attn.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.32.ln_1.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.32.ln_1.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.32.ln_2.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.32.ln_2.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.32.mlp.c_fc.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.32.mlp.c_fc.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.32.mlp.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.32.mlp.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.33.attn.c_attn.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.33.attn.c_attn.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.33.attn.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.33.attn.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.33.ln_1.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.33.ln_1.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.33.ln_2.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.33.ln_2.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.33.mlp.c_fc.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.33.mlp.c_fc.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.33.mlp.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.33.mlp.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.34.attn.c_attn.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.34.attn.c_attn.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.34.attn.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.34.attn.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.34.ln_1.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.34.ln_1.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.34.ln_2.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.34.ln_2.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.34.mlp.c_fc.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.34.mlp.c_fc.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.34.mlp.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.34.mlp.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.35.attn.c_attn.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.35.attn.c_attn.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.35.attn.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.35.attn.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.35.ln_1.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.35.ln_1.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.35.ln_2.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.35.ln_2.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.35.mlp.c_fc.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.35.mlp.c_fc.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.35.mlp.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.35.mlp.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.36.attn.c_attn.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.36.attn.c_attn.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.36.attn.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.36.attn.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.36.ln_1.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.36.ln_1.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.36.ln_2.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.36.ln_2.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.36.mlp.c_fc.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.36.mlp.c_fc.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.36.mlp.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.36.mlp.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.37.attn.c_attn.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.37.attn.c_attn.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.37.attn.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.37.attn.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.37.ln_1.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.37.ln_1.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.37.ln_2.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.37.ln_2.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.37.mlp.c_fc.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.37.mlp.c_fc.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.37.mlp.c_proj.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.37.mlp.c_proj.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.38.attn.c_attn.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.38.attn.c_attn.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.38.attn.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.38.attn.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.38.ln_1.bias": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.38.ln_1.weight": "model-00006-of-00009.safetensors",
|
||||
"transformer.h.38.ln_2.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.38.ln_2.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.38.mlp.c_fc.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.38.mlp.c_fc.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.38.mlp.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.38.mlp.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.39.attn.c_attn.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.39.attn.c_attn.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.39.attn.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.39.attn.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.39.ln_1.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.39.ln_1.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.39.ln_2.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.39.ln_2.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.39.mlp.c_fc.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.39.mlp.c_fc.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.39.mlp.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.39.mlp.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.4.attn.c_attn.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.4.attn.c_attn.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.4.attn.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.4.attn.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.4.ln_1.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.4.ln_1.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.4.ln_2.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.4.ln_2.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.4.mlp.c_fc.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.4.mlp.c_fc.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.4.mlp.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.4.mlp.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.40.attn.c_attn.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.40.attn.c_attn.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.40.attn.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.40.attn.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.40.ln_1.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.40.ln_1.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.40.ln_2.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.40.ln_2.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.40.mlp.c_fc.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.40.mlp.c_fc.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.40.mlp.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.40.mlp.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.41.attn.c_attn.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.41.attn.c_attn.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.41.attn.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.41.attn.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.41.ln_1.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.41.ln_1.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.41.ln_2.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.41.ln_2.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.41.mlp.c_fc.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.41.mlp.c_fc.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.41.mlp.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.41.mlp.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.42.attn.c_attn.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.42.attn.c_attn.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.42.attn.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.42.attn.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.42.ln_1.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.42.ln_1.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.42.ln_2.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.42.ln_2.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.42.mlp.c_fc.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.42.mlp.c_fc.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.42.mlp.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.42.mlp.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.43.attn.c_attn.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.43.attn.c_attn.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.43.attn.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.43.attn.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.43.ln_1.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.43.ln_1.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.43.ln_2.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.43.ln_2.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.43.mlp.c_fc.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.43.mlp.c_fc.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.43.mlp.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.43.mlp.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.44.attn.c_attn.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.44.attn.c_attn.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.44.attn.c_proj.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.44.attn.c_proj.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.44.ln_1.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.44.ln_1.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.44.ln_2.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.44.ln_2.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.44.mlp.c_fc.bias": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.44.mlp.c_fc.weight": "model-00007-of-00009.safetensors",
|
||||
"transformer.h.44.mlp.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.44.mlp.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.45.attn.c_attn.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.45.attn.c_attn.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.45.attn.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.45.attn.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.45.ln_1.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.45.ln_1.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.45.ln_2.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.45.ln_2.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.45.mlp.c_fc.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.45.mlp.c_fc.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.45.mlp.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.45.mlp.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.46.attn.c_attn.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.46.attn.c_attn.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.46.attn.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.46.attn.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.46.ln_1.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.46.ln_1.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.46.ln_2.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.46.ln_2.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.46.mlp.c_fc.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.46.mlp.c_fc.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.46.mlp.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.46.mlp.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.47.attn.c_attn.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.47.attn.c_attn.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.47.attn.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.47.attn.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.47.ln_1.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.47.ln_1.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.47.ln_2.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.47.ln_2.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.47.mlp.c_fc.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.47.mlp.c_fc.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.47.mlp.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.47.mlp.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.48.attn.c_attn.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.48.attn.c_attn.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.48.attn.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.48.attn.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.48.ln_1.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.48.ln_1.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.48.ln_2.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.48.ln_2.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.48.mlp.c_fc.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.48.mlp.c_fc.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.48.mlp.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.48.mlp.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.49.attn.c_attn.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.49.attn.c_attn.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.49.attn.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.49.attn.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.49.ln_1.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.49.ln_1.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.49.ln_2.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.49.ln_2.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.49.mlp.c_fc.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.49.mlp.c_fc.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.49.mlp.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.49.mlp.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.5.attn.c_attn.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.5.attn.c_attn.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.5.attn.c_proj.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.5.attn.c_proj.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.5.ln_1.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.5.ln_1.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.5.ln_2.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.5.ln_2.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.5.mlp.c_fc.bias": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.5.mlp.c_fc.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.h.5.mlp.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.5.mlp.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.50.attn.c_attn.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.50.attn.c_attn.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.50.attn.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.50.attn.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.50.ln_1.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.50.ln_1.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.50.ln_2.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.50.ln_2.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.50.mlp.c_fc.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.50.mlp.c_fc.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.50.mlp.c_proj.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.50.mlp.c_proj.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.51.attn.c_attn.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.51.attn.c_attn.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.51.attn.c_proj.bias": "model-00009-of-00009.safetensors",
|
||||
"transformer.h.51.attn.c_proj.weight": "model-00009-of-00009.safetensors",
|
||||
"transformer.h.51.ln_1.bias": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.51.ln_1.weight": "model-00008-of-00009.safetensors",
|
||||
"transformer.h.51.ln_2.bias": "model-00009-of-00009.safetensors",
|
||||
"transformer.h.51.ln_2.weight": "model-00009-of-00009.safetensors",
|
||||
"transformer.h.51.mlp.c_fc.bias": "model-00009-of-00009.safetensors",
|
||||
"transformer.h.51.mlp.c_fc.weight": "model-00009-of-00009.safetensors",
|
||||
"transformer.h.51.mlp.c_proj.bias": "model-00009-of-00009.safetensors",
|
||||
"transformer.h.51.mlp.c_proj.weight": "model-00009-of-00009.safetensors",
|
||||
"transformer.h.6.attn.c_attn.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.6.attn.c_attn.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.6.attn.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.6.attn.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.6.ln_1.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.6.ln_1.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.6.ln_2.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.6.ln_2.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.6.mlp.c_fc.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.6.mlp.c_fc.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.6.mlp.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.6.mlp.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.7.attn.c_attn.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.7.attn.c_attn.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.7.attn.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.7.attn.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.7.ln_1.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.7.ln_1.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.7.ln_2.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.7.ln_2.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.7.mlp.c_fc.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.7.mlp.c_fc.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.7.mlp.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.7.mlp.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.8.attn.c_attn.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.8.attn.c_attn.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.8.attn.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.8.attn.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.8.ln_1.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.8.ln_1.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.8.ln_2.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.8.ln_2.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.8.mlp.c_fc.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.8.mlp.c_fc.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.8.mlp.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.8.mlp.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.9.attn.c_attn.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.9.attn.c_attn.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.9.attn.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.9.attn.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.9.ln_1.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.9.ln_1.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.9.ln_2.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.9.ln_2.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.9.mlp.c_fc.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.9.mlp.c_fc.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.9.mlp.c_proj.bias": "model-00002-of-00009.safetensors",
|
||||
"transformer.h.9.mlp.c_proj.weight": "model-00002-of-00009.safetensors",
|
||||
"transformer.ln_f.bias": "model-00009-of-00009.safetensors",
|
||||
"transformer.ln_f.weight": "model-00009-of-00009.safetensors",
|
||||
"transformer.wpe.weight": "model-00001-of-00009.safetensors",
|
||||
"transformer.wte.weight": "model-00001-of-00009.safetensors"
|
||||
}
|
||||
}
|
||||
51
special_tokens_map.json
Normal file
51
special_tokens_map.json
Normal file
@@ -0,0 +1,51 @@
|
||||
{
|
||||
"additional_special_tokens": [
|
||||
"<|endoftext|>",
|
||||
"<fim_prefix>",
|
||||
"<fim_middle>",
|
||||
"<fim_suffix>",
|
||||
"<fim_pad>",
|
||||
"<filename>",
|
||||
"<gh_stars>",
|
||||
"<issue_start>",
|
||||
"<issue_comment>",
|
||||
"<issue_closed>",
|
||||
"<jupyter_start>",
|
||||
"<jupyter_text>",
|
||||
"<jupyter_code>",
|
||||
"<jupyter_output>",
|
||||
"<empty_output>",
|
||||
"<commit_before>",
|
||||
"<commit_msg>",
|
||||
"<commit_after>",
|
||||
"<reponame>"
|
||||
],
|
||||
"bos_token": {
|
||||
"content": "<|endoftext|>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
},
|
||||
"eos_token": {
|
||||
"content": "<|endoftext|>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
},
|
||||
"pad_token": {
|
||||
"content": "<|endoftext|>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
},
|
||||
"unk_token": {
|
||||
"content": "<|endoftext|>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
}
|
||||
}
|
||||
98258
tokenizer.json
Normal file
98258
tokenizer.json
Normal file
File diff suppressed because it is too large
Load Diff
187
tokenizer_config.json
Normal file
187
tokenizer_config.json
Normal file
@@ -0,0 +1,187 @@
|
||||
{
|
||||
"add_prefix_space": false,
|
||||
"added_tokens_decoder": {
|
||||
"0": {
|
||||
"content": "<|endoftext|>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"1": {
|
||||
"content": "<fim_prefix>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"2": {
|
||||
"content": "<fim_middle>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"3": {
|
||||
"content": "<fim_suffix>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"4": {
|
||||
"content": "<fim_pad>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"5": {
|
||||
"content": "<filename>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"6": {
|
||||
"content": "<gh_stars>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"7": {
|
||||
"content": "<issue_start>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"8": {
|
||||
"content": "<issue_comment>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"9": {
|
||||
"content": "<issue_closed>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"10": {
|
||||
"content": "<jupyter_start>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"11": {
|
||||
"content": "<jupyter_text>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"12": {
|
||||
"content": "<jupyter_code>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"13": {
|
||||
"content": "<jupyter_output>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"14": {
|
||||
"content": "<empty_output>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"15": {
|
||||
"content": "<commit_before>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"16": {
|
||||
"content": "<commit_msg>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"17": {
|
||||
"content": "<commit_after>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"18": {
|
||||
"content": "<reponame>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
}
|
||||
},
|
||||
"additional_special_tokens": [
|
||||
"<|endoftext|>",
|
||||
"<fim_prefix>",
|
||||
"<fim_middle>",
|
||||
"<fim_suffix>",
|
||||
"<fim_pad>",
|
||||
"<filename>",
|
||||
"<gh_stars>",
|
||||
"<issue_start>",
|
||||
"<issue_comment>",
|
||||
"<issue_closed>",
|
||||
"<jupyter_start>",
|
||||
"<jupyter_text>",
|
||||
"<jupyter_code>",
|
||||
"<jupyter_output>",
|
||||
"<empty_output>",
|
||||
"<commit_before>",
|
||||
"<commit_msg>",
|
||||
"<commit_after>",
|
||||
"<reponame>"
|
||||
],
|
||||
"bos_token": "<|endoftext|>",
|
||||
"clean_up_tokenization_spaces": true,
|
||||
"eos_token": "<|endoftext|>",
|
||||
"model_max_length": 8192,
|
||||
"pad_token": "<|endoftext|>",
|
||||
"padding_side": "left",
|
||||
"tokenizer_class": "GPT2Tokenizer",
|
||||
"unk_token": "<|endoftext|>",
|
||||
"vocab_size": 49152
|
||||
}
|
||||
Reference in New Issue
Block a user