From 1bdace68ba2623e50c17fe0ad17721dad4a316ed Mon Sep 17 00:00:00 2001 From: ModelHub XC Date: Sat, 25 Jul 2026 09:36:10 +0800 Subject: [PATCH] =?UTF-8?q?=E5=88=9D=E5=A7=8B=E5=8C=96=E9=A1=B9=E7=9B=AE?= =?UTF-8?q?=EF=BC=8C=E7=94=B1ModelHub=20XC=E7=A4=BE=E5=8C=BA=E6=8F=90?= =?UTF-8?q?=E4=BE=9B=E6=A8=A1=E5=9E=8B?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Model: Umranz/Ventera-MN Source: Original Platform --- .gitattributes | 36 +++ README.md | 73 ++++++ chat_template.jinja | 87 ++++++++ config.json | 30 +++ generation_config.json | 6 + model-00001-of-00005.safetensors | 3 + model-00002-of-00005.safetensors | 3 + model-00003-of-00005.safetensors | 3 + model-00004-of-00005.safetensors | 3 + model-00005-of-00005.safetensors | 3 + model.safetensors.index.json | 371 +++++++++++++++++++++++++++++++ tokenizer.json | 3 + tokenizer_config.json | 17 ++ 13 files changed, 638 insertions(+) create mode 100644 .gitattributes create mode 100644 README.md create mode 100644 chat_template.jinja create mode 100644 config.json create mode 100644 generation_config.json create mode 100644 model-00001-of-00005.safetensors create mode 100644 model-00002-of-00005.safetensors create mode 100644 model-00003-of-00005.safetensors create mode 100644 model-00004-of-00005.safetensors create mode 100644 model-00005-of-00005.safetensors create mode 100644 model.safetensors.index.json create mode 100644 tokenizer.json create mode 100644 tokenizer_config.json diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..52373fe --- /dev/null +++ b/.gitattributes @@ -0,0 +1,36 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/README.md b/README.md new file mode 100644 index 0000000..2a3b005 --- /dev/null +++ b/README.md @@ -0,0 +1,73 @@ +--- +license: apache-2.0 +base_model: mistralai/Mistral-Nemo-Instruct-2407 +tags: +- dense +- mistral +- nemo +- uncensored +- heretic +- abliteration +- long-context +language: +- en +- fr +- de +- es +- it +- pt +- ru +- zh +- ja +pipeline_tag: text-generation +--- + +# Ventera-MN (Abliterated Mistral-Nemo 12B) + +**Ventera-MN** is a dynamically uncensored and abliterated version of [`mistralai/Mistral-Nemo-Instruct-2407`](https://huggingface.co/mistralai/Mistral-Nemo-Instruct-2407), the flagship 12-billion parameter model built jointly by Mistral AI and NVIDIA. + +This model was created using the [Heretic framework](https://github.com/p-e-w/heretic), employing advanced orthogonal weight ablation to isolate and remove refusal vectors. The result is a highly capable, completely unchained logic engine that retains the original model's massive 128,000 token context window. + +## Ablation Telemetry & Metrics +Unlike traditional fine-tuning or full RLHF—which can cause "brain damage" to a model by catastrophically forgetting knowledge—Ventera-MN was optimized using a Pareto-optimal search across the model's residual stream specifically targeting the compliance and refusal mechanics. + +**Ablation Telemetry (Trial 35):** +- **Base Model Refusals:** 88 / 100 +- **Ventera-MN Refusals:** 10 / 100 +- **KL Divergence:** `0.0938` + +By removing almost 90% of the instruct guardrails while maintaining a KL divergence under 0.1, the structural integrity, language comprehension, and long-context logic capabilities of the base model are perfectly intact. It simply no longer refuses instructions. + +## Key Features +- **Massive 128k Context Window:** Capable of ingesting entire books, codebases, or extended conversational histories in a single prompt without triggering safety filters. +- **Dense Architecture:** A highly efficient 12B parameter dense model optimized to fit seamlessly into consumer GPUs (fits in 24GB VRAM at FP16, or much less when quantized). +- **Multilingual Mastery:** Retains Mistral-Nemo's deep understanding of multiple languages. +- **Drop-in Replacement:** Fully compatible with standard HuggingFace `transformers` and `vLLM` pipelines. + +## Usage + +### Via HuggingFace Transformers +```python +from transformers import AutoTokenizer, AutoModelForCausalLM +import torch + +model_id = "Umranz/Ventera-MN" + +tokenizer = AutoTokenizer.from_pretrained(model_id) +model = AutoModelForCausalLM.from_pretrained( + model_id, + torch_dtype=torch.bfloat16, + device_map="auto" +) +``` + +## ⚠️ Limitations & Ethical Considerations +Because this model has had its safety guardrails mathematically ablated, it is highly compliant and will attempt to answer any prompt given to it. +- **Unrestricted Output:** The model will not refuse requests, including those that may generate offensive, dangerous, or highly regulated content. +- **Hallucinations:** As with all LLMs, the model can confidently hallucinate incorrect information, especially over extremely long context windows. +- **Use Case:** This model is intended for research, creative writing, and local deployments where unrestricted inference is required. Users are solely responsible for the content generated. + +## Acknowledgements +- **Base Model:** [`mistralai/Mistral-Nemo-Instruct-2407`](https://huggingface.co/mistralai/Mistral-Nemo-Instruct-2407) +- **Ablation Framework:** [Heretic by p-e-w](https://github.com/p-e-w/heretic) +- **Collection:** Part of the Chimera Series taxonomy. diff --git a/chat_template.jinja b/chat_template.jinja new file mode 100644 index 0000000..9c21a3f --- /dev/null +++ b/chat_template.jinja @@ -0,0 +1,87 @@ +{%- if messages[0]["role"] == "system" %} + {%- set system_message = messages[0]["content"] %} + {%- set loop_messages = messages[1:] %} +{%- else %} + {%- set loop_messages = messages %} +{%- endif %} +{%- if not tools is defined %} + {%- set tools = none %} +{%- endif %} +{%- set user_messages = loop_messages | selectattr("role", "equalto", "user") | list %} + +{#- This block checks for alternating user/assistant messages, skipping tool calling messages #} +{%- set ns = namespace() %} +{%- set ns.index = 0 %} +{%- for message in loop_messages %} + {%- if not (message.role == "tool" or message.role == "tool_results" or (message.tool_calls is defined and message.tool_calls is not none)) %} + {%- if (message["role"] == "user") != (ns.index % 2 == 0) %} + {{- raise_exception("After the optional system message, conversation roles must alternate user/assistant/user/assistant/...") }} + {%- endif %} + {%- set ns.index = ns.index + 1 %} + {%- endif %} +{%- endfor %} + +{{- bos_token }} +{%- for message in loop_messages %} + {%- if message["role"] == "user" %} + {%- if tools is not none and (message == user_messages[-1]) %} + {{- "[AVAILABLE_TOOLS][" }} + {%- for tool in tools %} + {%- set tool = tool.function %} + {{- '{"type": "function", "function": {' }} + {%- for key, val in tool.items() if key != "return" %} + {%- if val is string %} + {{- '"' + key + '": "' + val + '"' }} + {%- else %} + {{- '"' + key + '": ' + val|tojson }} + {%- endif %} + {%- if not loop.last %} + {{- ", " }} + {%- endif %} + {%- endfor %} + {{- "}}" }} + {%- if not loop.last %} + {{- ", " }} + {%- else %} + {{- "]" }} + {%- endif %} + {%- endfor %} + {{- "[/AVAILABLE_TOOLS]" }} + {%- endif %} + {%- if loop.last and system_message is defined %} + {{- "[INST]" + system_message + "\n\n" + message["content"] + "[/INST]" }} + {%- else %} + {{- "[INST]" + message["content"] + "[/INST]" }} + {%- endif %} + {%- elif (message.tool_calls is defined and message.tool_calls is not none) %} + {{- "[TOOL_CALLS][" }} + {%- for tool_call in message.tool_calls %} + {%- set out = tool_call.function|tojson %} + {{- out[:-1] }} + {%- if not tool_call.id is defined or tool_call.id|length != 9 %} + {{- raise_exception("Tool call IDs should be alphanumeric strings with length 9!") }} + {%- endif %} + {{- ', "id": "' + tool_call.id + '"}' }} + {%- if not loop.last %} + {{- ", " }} + {%- else %} + {{- "]" + eos_token }} + {%- endif %} + {%- endfor %} + {%- elif message["role"] == "assistant" %} + {{- message["content"] + eos_token}} + {%- elif message["role"] == "tool_results" or message["role"] == "tool" %} + {%- if message.content is defined and message.content.content is defined %} + {%- set content = message.content.content %} + {%- else %} + {%- set content = message.content %} + {%- endif %} + {{- '[TOOL_RESULTS]{"content": ' + content|string + ", " }} + {%- if not message.tool_call_id is defined or message.tool_call_id|length != 9 %} + {{- raise_exception("Tool call IDs should be alphanumeric strings with length 9!") }} + {%- endif %} + {{- '"call_id": "' + message.tool_call_id + '"}[/TOOL_RESULTS]' }} + {%- else %} + {{- raise_exception("Only user and assistant roles are supported, with the exception of an initial optional system message!") }} + {%- endif %} +{%- endfor %} diff --git a/config.json b/config.json new file mode 100644 index 0000000..c99a884 --- /dev/null +++ b/config.json @@ -0,0 +1,30 @@ +{ + "architectures": [ + "MistralForCausalLM" + ], + "attention_dropout": 0.0, + "bos_token_id": 1, + "dtype": "bfloat16", + "eos_token_id": 2, + "head_dim": 128, + "hidden_act": "silu", + "hidden_size": 5120, + "initializer_range": 0.02, + "intermediate_size": 14336, + "max_position_embeddings": 131072, + "model_type": "mistral", + "num_attention_heads": 32, + "num_hidden_layers": 40, + "num_key_value_heads": 8, + "pad_token_id": null, + "rms_norm_eps": 1e-05, + "rope_parameters": { + "rope_theta": 1000000.0, + "rope_type": "default" + }, + "sliding_window": null, + "tie_word_embeddings": false, + "transformers_version": "5.12.1", + "use_cache": true, + "vocab_size": 131072 +} diff --git a/generation_config.json b/generation_config.json new file mode 100644 index 0000000..366358e --- /dev/null +++ b/generation_config.json @@ -0,0 +1,6 @@ +{ + "_from_model_config": true, + "bos_token_id": 1, + "eos_token_id": 2, + "transformers_version": "5.12.1" +} diff --git a/model-00001-of-00005.safetensors b/model-00001-of-00005.safetensors new file mode 100644 index 0000000..7cb355d --- /dev/null +++ b/model-00001-of-00005.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0389094a77ba38887ca535dcf215f7a618b2b87f491e3be791f55c6b79eb5188 +size 4865489312 diff --git a/model-00002-of-00005.safetensors b/model-00002-of-00005.safetensors new file mode 100644 index 0000000..8c55ebe --- /dev/null +++ b/model-00002-of-00005.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:503f8d084c272d1d515a608cc07014d30d1e1774bb0a68d28476c35ef666fb4a +size 4907529400 diff --git a/model-00003-of-00005.safetensors b/model-00003-of-00005.safetensors new file mode 100644 index 0000000..12f14fb --- /dev/null +++ b/model-00003-of-00005.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:41647e0a5e9cb0a26fbece6547463f8022bcea42a6aeede634be10a0ebc54797 +size 4907529464 diff --git a/model-00004-of-00005.safetensors b/model-00004-of-00005.safetensors new file mode 100644 index 0000000..40d6075 --- /dev/null +++ b/model-00004-of-00005.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fd7c0cce50a017c5e234a85f8bfb17538a44eb33634c76cf9f785c67dee7a1d6 +size 4907529464 diff --git a/model-00005-of-00005.safetensors b/model-00005-of-00005.safetensors new file mode 100644 index 0000000..d38ff55 --- /dev/null +++ b/model-00005-of-00005.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f63832985bcfd212348e437e61b7d121b19838ef8aa30fef33cb09c9d1dadb9c +size 4907529448 diff --git a/model.safetensors.index.json b/model.safetensors.index.json new file mode 100644 index 0000000..6ab724f --- /dev/null +++ b/model.safetensors.index.json @@ -0,0 +1,371 @@ +{ + "metadata": { + "total_parameters": 12247782400, + "total_size": 24495564800 + }, + "weight_map": { + "lm_head.weight": "model-00001-of-00005.safetensors", + "model.embed_tokens.weight": "model-00001-of-00005.safetensors", + "model.layers.0.input_layernorm.weight": "model-00001-of-00005.safetensors", + "model.layers.0.mlp.down_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.0.mlp.up_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00005.safetensors", + "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.1.input_layernorm.weight": "model-00001-of-00005.safetensors", + "model.layers.1.mlp.down_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.1.mlp.gate_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.1.mlp.up_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00005.safetensors", + "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.10.input_layernorm.weight": "model-00002-of-00005.safetensors", + "model.layers.10.mlp.down_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.10.mlp.gate_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.10.mlp.up_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.10.post_attention_layernorm.weight": "model-00002-of-00005.safetensors", + "model.layers.10.self_attn.k_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.10.self_attn.o_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.10.self_attn.q_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.10.self_attn.v_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.11.input_layernorm.weight": "model-00002-of-00005.safetensors", + "model.layers.11.mlp.down_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.11.mlp.gate_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.11.mlp.up_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.11.post_attention_layernorm.weight": "model-00002-of-00005.safetensors", + "model.layers.11.self_attn.k_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.11.self_attn.o_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.11.self_attn.q_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.11.self_attn.v_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.12.input_layernorm.weight": "model-00002-of-00005.safetensors", + "model.layers.12.mlp.down_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.12.mlp.gate_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.12.mlp.up_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.12.post_attention_layernorm.weight": "model-00002-of-00005.safetensors", + "model.layers.12.self_attn.k_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.12.self_attn.o_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.12.self_attn.q_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.12.self_attn.v_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.13.input_layernorm.weight": "model-00002-of-00005.safetensors", + "model.layers.13.mlp.down_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.13.mlp.gate_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.13.mlp.up_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.13.post_attention_layernorm.weight": "model-00003-of-00005.safetensors", + "model.layers.13.self_attn.k_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.13.self_attn.o_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.13.self_attn.q_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.13.self_attn.v_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.14.input_layernorm.weight": "model-00003-of-00005.safetensors", + "model.layers.14.mlp.down_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.14.mlp.gate_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.14.mlp.up_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.14.post_attention_layernorm.weight": "model-00003-of-00005.safetensors", + "model.layers.14.self_attn.k_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.14.self_attn.o_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.14.self_attn.q_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.14.self_attn.v_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.15.input_layernorm.weight": "model-00003-of-00005.safetensors", + "model.layers.15.mlp.down_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.15.mlp.gate_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.15.mlp.up_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.15.post_attention_layernorm.weight": "model-00003-of-00005.safetensors", + "model.layers.15.self_attn.k_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.15.self_attn.o_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.15.self_attn.q_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.15.self_attn.v_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.16.input_layernorm.weight": "model-00003-of-00005.safetensors", + "model.layers.16.mlp.down_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.16.mlp.gate_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.16.mlp.up_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.16.post_attention_layernorm.weight": "model-00003-of-00005.safetensors", + "model.layers.16.self_attn.k_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.16.self_attn.o_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.16.self_attn.q_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.16.self_attn.v_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.17.input_layernorm.weight": "model-00003-of-00005.safetensors", + "model.layers.17.mlp.down_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.17.mlp.gate_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.17.mlp.up_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.17.post_attention_layernorm.weight": "model-00003-of-00005.safetensors", + "model.layers.17.self_attn.k_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.17.self_attn.o_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.17.self_attn.q_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.17.self_attn.v_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.18.input_layernorm.weight": "model-00003-of-00005.safetensors", + "model.layers.18.mlp.down_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.18.mlp.gate_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.18.mlp.up_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.18.post_attention_layernorm.weight": "model-00003-of-00005.safetensors", + "model.layers.18.self_attn.k_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.18.self_attn.o_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.18.self_attn.q_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.18.self_attn.v_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.19.input_layernorm.weight": "model-00003-of-00005.safetensors", + "model.layers.19.mlp.down_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.19.mlp.gate_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.19.mlp.up_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.19.post_attention_layernorm.weight": "model-00003-of-00005.safetensors", + "model.layers.19.self_attn.k_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.19.self_attn.o_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.19.self_attn.q_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.19.self_attn.v_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.2.input_layernorm.weight": "model-00001-of-00005.safetensors", + "model.layers.2.mlp.down_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.2.mlp.up_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00005.safetensors", + "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.20.input_layernorm.weight": "model-00003-of-00005.safetensors", + "model.layers.20.mlp.down_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.20.mlp.gate_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.20.mlp.up_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.20.post_attention_layernorm.weight": "model-00003-of-00005.safetensors", + "model.layers.20.self_attn.k_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.20.self_attn.o_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.20.self_attn.q_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.20.self_attn.v_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.21.input_layernorm.weight": "model-00003-of-00005.safetensors", + "model.layers.21.mlp.down_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.21.mlp.gate_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.21.mlp.up_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.21.post_attention_layernorm.weight": "model-00003-of-00005.safetensors", + "model.layers.21.self_attn.k_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.21.self_attn.o_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.21.self_attn.q_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.21.self_attn.v_proj.weight": "model-00003-of-00005.safetensors", + "model.layers.22.input_layernorm.weight": "model-00003-of-00005.safetensors", + "model.layers.22.mlp.down_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.22.mlp.gate_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.22.mlp.up_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.22.post_attention_layernorm.weight": "model-00004-of-00005.safetensors", + "model.layers.22.self_attn.k_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.22.self_attn.o_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.22.self_attn.q_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.22.self_attn.v_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.23.input_layernorm.weight": "model-00004-of-00005.safetensors", + "model.layers.23.mlp.down_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.23.mlp.gate_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.23.mlp.up_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.23.post_attention_layernorm.weight": "model-00004-of-00005.safetensors", + "model.layers.23.self_attn.k_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.23.self_attn.o_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.23.self_attn.q_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.23.self_attn.v_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.24.input_layernorm.weight": "model-00004-of-00005.safetensors", + "model.layers.24.mlp.down_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.24.mlp.gate_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.24.mlp.up_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.24.post_attention_layernorm.weight": "model-00004-of-00005.safetensors", + "model.layers.24.self_attn.k_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.24.self_attn.o_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.24.self_attn.q_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.24.self_attn.v_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.25.input_layernorm.weight": "model-00004-of-00005.safetensors", + "model.layers.25.mlp.down_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.25.mlp.gate_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.25.mlp.up_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.25.post_attention_layernorm.weight": "model-00004-of-00005.safetensors", + "model.layers.25.self_attn.k_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.25.self_attn.o_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.25.self_attn.q_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.25.self_attn.v_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.26.input_layernorm.weight": "model-00004-of-00005.safetensors", + "model.layers.26.mlp.down_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.26.mlp.gate_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.26.mlp.up_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.26.post_attention_layernorm.weight": "model-00004-of-00005.safetensors", + "model.layers.26.self_attn.k_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.26.self_attn.o_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.26.self_attn.q_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.26.self_attn.v_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.27.input_layernorm.weight": "model-00004-of-00005.safetensors", + "model.layers.27.mlp.down_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.27.mlp.gate_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.27.mlp.up_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.27.post_attention_layernorm.weight": "model-00004-of-00005.safetensors", + "model.layers.27.self_attn.k_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.27.self_attn.o_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.27.self_attn.q_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.27.self_attn.v_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.28.input_layernorm.weight": "model-00004-of-00005.safetensors", + "model.layers.28.mlp.down_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.28.mlp.gate_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.28.mlp.up_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.28.post_attention_layernorm.weight": "model-00004-of-00005.safetensors", + "model.layers.28.self_attn.k_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.28.self_attn.o_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.28.self_attn.q_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.28.self_attn.v_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.29.input_layernorm.weight": "model-00004-of-00005.safetensors", + "model.layers.29.mlp.down_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.29.mlp.gate_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.29.mlp.up_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.29.post_attention_layernorm.weight": "model-00004-of-00005.safetensors", + "model.layers.29.self_attn.k_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.29.self_attn.o_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.29.self_attn.q_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.29.self_attn.v_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.3.input_layernorm.weight": "model-00001-of-00005.safetensors", + "model.layers.3.mlp.down_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.3.mlp.gate_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.3.mlp.up_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00005.safetensors", + "model.layers.3.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "model.layers.30.input_layernorm.weight": "model-00004-of-00005.safetensors", + "model.layers.30.mlp.down_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.30.mlp.gate_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.30.mlp.up_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.30.post_attention_layernorm.weight": "model-00004-of-00005.safetensors", + "model.layers.30.self_attn.k_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.30.self_attn.o_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.30.self_attn.q_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.30.self_attn.v_proj.weight": "model-00004-of-00005.safetensors", + "model.layers.31.input_layernorm.weight": "model-00004-of-00005.safetensors", + "model.layers.31.mlp.down_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.31.mlp.gate_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.31.mlp.up_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.31.post_attention_layernorm.weight": "model-00005-of-00005.safetensors", + "model.layers.31.self_attn.k_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.31.self_attn.o_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.31.self_attn.q_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.31.self_attn.v_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.32.input_layernorm.weight": "model-00005-of-00005.safetensors", + "model.layers.32.mlp.down_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.32.mlp.gate_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.32.mlp.up_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.32.post_attention_layernorm.weight": "model-00005-of-00005.safetensors", + "model.layers.32.self_attn.k_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.32.self_attn.o_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.32.self_attn.q_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.32.self_attn.v_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.33.input_layernorm.weight": "model-00005-of-00005.safetensors", + "model.layers.33.mlp.down_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.33.mlp.gate_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.33.mlp.up_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.33.post_attention_layernorm.weight": "model-00005-of-00005.safetensors", + "model.layers.33.self_attn.k_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.33.self_attn.o_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.33.self_attn.q_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.33.self_attn.v_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.34.input_layernorm.weight": "model-00005-of-00005.safetensors", + "model.layers.34.mlp.down_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.34.mlp.gate_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.34.mlp.up_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.34.post_attention_layernorm.weight": "model-00005-of-00005.safetensors", + "model.layers.34.self_attn.k_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.34.self_attn.o_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.34.self_attn.q_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.34.self_attn.v_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.35.input_layernorm.weight": "model-00005-of-00005.safetensors", + "model.layers.35.mlp.down_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.35.mlp.gate_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.35.mlp.up_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.35.post_attention_layernorm.weight": "model-00005-of-00005.safetensors", + "model.layers.35.self_attn.k_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.35.self_attn.o_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.35.self_attn.q_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.35.self_attn.v_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.36.input_layernorm.weight": "model-00005-of-00005.safetensors", + "model.layers.36.mlp.down_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.36.mlp.gate_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.36.mlp.up_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.36.post_attention_layernorm.weight": "model-00005-of-00005.safetensors", + "model.layers.36.self_attn.k_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.36.self_attn.o_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.36.self_attn.q_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.36.self_attn.v_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.37.input_layernorm.weight": "model-00005-of-00005.safetensors", + "model.layers.37.mlp.down_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.37.mlp.gate_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.37.mlp.up_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.37.post_attention_layernorm.weight": "model-00005-of-00005.safetensors", + "model.layers.37.self_attn.k_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.37.self_attn.o_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.37.self_attn.q_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.37.self_attn.v_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.38.input_layernorm.weight": "model-00005-of-00005.safetensors", + "model.layers.38.mlp.down_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.38.mlp.gate_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.38.mlp.up_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.38.post_attention_layernorm.weight": "model-00005-of-00005.safetensors", + "model.layers.38.self_attn.k_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.38.self_attn.o_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.38.self_attn.q_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.38.self_attn.v_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.39.input_layernorm.weight": "model-00005-of-00005.safetensors", + "model.layers.39.mlp.down_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.39.mlp.gate_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.39.mlp.up_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.39.post_attention_layernorm.weight": "model-00005-of-00005.safetensors", + "model.layers.39.self_attn.k_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.39.self_attn.o_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.39.self_attn.q_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.39.self_attn.v_proj.weight": "model-00005-of-00005.safetensors", + "model.layers.4.input_layernorm.weight": "model-00001-of-00005.safetensors", + "model.layers.4.mlp.down_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.4.mlp.gate_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.4.mlp.up_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.4.post_attention_layernorm.weight": "model-00002-of-00005.safetensors", + "model.layers.4.self_attn.k_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.4.self_attn.o_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.4.self_attn.q_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.4.self_attn.v_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.5.input_layernorm.weight": "model-00002-of-00005.safetensors", + "model.layers.5.mlp.down_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.5.mlp.gate_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.5.mlp.up_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.5.post_attention_layernorm.weight": "model-00002-of-00005.safetensors", + "model.layers.5.self_attn.k_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.5.self_attn.o_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.5.self_attn.q_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.5.self_attn.v_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.6.input_layernorm.weight": "model-00002-of-00005.safetensors", + "model.layers.6.mlp.down_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.6.mlp.gate_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.6.mlp.up_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.6.post_attention_layernorm.weight": "model-00002-of-00005.safetensors", + "model.layers.6.self_attn.k_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.6.self_attn.o_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.6.self_attn.q_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.6.self_attn.v_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.7.input_layernorm.weight": "model-00002-of-00005.safetensors", + "model.layers.7.mlp.down_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.7.mlp.gate_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.7.mlp.up_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.7.post_attention_layernorm.weight": "model-00002-of-00005.safetensors", + "model.layers.7.self_attn.k_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.7.self_attn.o_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.7.self_attn.q_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.7.self_attn.v_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.8.input_layernorm.weight": "model-00002-of-00005.safetensors", + "model.layers.8.mlp.down_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.8.mlp.gate_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.8.mlp.up_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.8.post_attention_layernorm.weight": "model-00002-of-00005.safetensors", + "model.layers.8.self_attn.k_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.8.self_attn.o_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.8.self_attn.q_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.8.self_attn.v_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.9.input_layernorm.weight": "model-00002-of-00005.safetensors", + "model.layers.9.mlp.down_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.9.mlp.gate_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.9.mlp.up_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.9.post_attention_layernorm.weight": "model-00002-of-00005.safetensors", + "model.layers.9.self_attn.k_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.9.self_attn.o_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.9.self_attn.q_proj.weight": "model-00002-of-00005.safetensors", + "model.layers.9.self_attn.v_proj.weight": "model-00002-of-00005.safetensors", + "model.norm.weight": "model-00005-of-00005.safetensors" + } +} diff --git a/tokenizer.json b/tokenizer.json new file mode 100644 index 0000000..b35b1c0 --- /dev/null +++ b/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9a1c103d223ee5dc2dde8307635f7d12581b40855198a38efcfeb6db4e08da69 +size 17078445 diff --git a/tokenizer_config.json b/tokenizer_config.json new file mode 100644 index 0000000..8efbe2b --- /dev/null +++ b/tokenizer_config.json @@ -0,0 +1,17 @@ +{ + "add_prefix_space": false, + "backend": "tokenizers", + "bos_token": "", + "clean_up_tokenization_spaces": false, + "eos_token": "", + "is_local": false, + "local_files_only": false, + "model_input_names": [ + "input_ids", + "attention_mask" + ], + "model_max_length": 1000000000000000019884624838656, + "pad_token": "", + "tokenizer_class": "TokenizersBackend", + "unk_token": "" +}