初始化项目,由ModelHub XC社区提供模型

Model: sequelbox/Qwen3-14B-UML-Generator
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-09-02 23:10:13 +08:00
commit 1fb565f4ba
26 changed files with 1144 additions and 0 deletions

64
.gitattributes vendored Normal file
View File

@@ -0,0 +1,64 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bin.* filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zstandard filter=lfs diff=lfs merge=lfs -text
*.tfevents* filter=lfs diff=lfs merge=lfs -text
*.db* filter=lfs diff=lfs merge=lfs -text
*.ark* filter=lfs diff=lfs merge=lfs -text
**/*ckpt*data* filter=lfs diff=lfs merge=lfs -text
**/*ckpt*.meta filter=lfs diff=lfs merge=lfs -text
**/*ckpt*.index filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.gguf* filter=lfs diff=lfs merge=lfs -text
*.ggml filter=lfs diff=lfs merge=lfs -text
*.llamafile* filter=lfs diff=lfs merge=lfs -text
*.pt2 filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text
model-00010-of-00013.safetensors filter=lfs diff=lfs merge=lfs -text
model-00011-of-00013.safetensors filter=lfs diff=lfs merge=lfs -text
model-00001-of-00013.safetensors filter=lfs diff=lfs merge=lfs -text
model-00006-of-00013.safetensors filter=lfs diff=lfs merge=lfs -text
vocab.json filter=lfs diff=lfs merge=lfs -text
model-00009-of-00013.safetensors filter=lfs diff=lfs merge=lfs -text
model-00007-of-00013.safetensors filter=lfs diff=lfs merge=lfs -text
model-00003-of-00013.safetensors filter=lfs diff=lfs merge=lfs -text
model-00004-of-00013.safetensors filter=lfs diff=lfs merge=lfs -text
tokenizer.json filter=lfs diff=lfs merge=lfs -text
model-00013-of-00013.safetensors filter=lfs diff=lfs merge=lfs -text
model-00012-of-00013.safetensors filter=lfs diff=lfs merge=lfs -text
model-00008-of-00013.safetensors filter=lfs diff=lfs merge=lfs -text
model-00005-of-00013.safetensors filter=lfs diff=lfs merge=lfs -text
merges.txt filter=lfs diff=lfs merge=lfs -text
model-00002-of-00013.safetensors filter=lfs diff=lfs merge=lfs -text

108
README.md Normal file
View File

@@ -0,0 +1,108 @@
---
language:
- en
library_name: transformers
pipeline_tag: text-generation
tags:
- qwen
- qwen-3
- qwen-3-14b
- 14b
- reasoning
- uml-generator
- uml
- unified-modeling-language
- modeling
- xml
- xmi
- code
- architecture
- devops
- planning
- diagrams
- state-machine
- design
- analysis
- development
- business-process
- systems-engineering
- reverse-engineering
- data-modeling
- services
- cloud
- problem-solving
- creative
- analytical
- expert
- rationality
- conversational
- chat
- instruct
base_model: Qwen/Qwen3-14B
datasets:
- sequelbox/UML-Generator-Dataset-DeepSeek-V3.2
license: apache-2.0
---
**[Support our open-source dataset and model releases!](https://huggingface.co/spaces/sequelbox/SupportOpenSource)**
UML Generator: [Qwen3-4B-Thinking-2507](https://huggingface.co/sequelbox/Qwen3-4B-Thinking-2507-UML-Generator), [Qwen3-14B](https://huggingface.co/sequelbox/Qwen3-14B-UML-Generator), [gpt-oss-20b](https://huggingface.co/sequelbox/gpt-oss-20b-UML-Generator), [gpt-oss-120b](https://huggingface.co/sequelbox/gpt-oss-120b-UML-Generator)
**UML Generator is one of our [Experimental Reasoning Models](https://huggingface.co/collections/sequelbox/experimental-reasoning-models) with custom output format**; for standard chat, try [Shining Valiant 3](https://huggingface.co/collections/ValiantLabs/shining-valiant-3) or [Esper 3.1!](https://huggingface.co/collections/ValiantLabs/esper-31)
UML Generator is a specialist code-reasoning assistant, performing situational analysis and reasoning to create **Unified Modeling Language diagrams.**
- Finetuned on our [UML creation dataset](https://huggingface.co/datasets/sequelbox/UML-Generator-Dataset-DeepSeek-V3.2) data generated with [DeepSeek-V3.2!](https://huggingface.co/deepseek-ai/DeepSeek-V3.2-Exp)
- Multi-step reasoning reliably identifies diagram structure before a user response of XMI 2.5.1 code containing the UML diagram.
- UML Generator Format provides a single clear, readable XMI that is ready to load into the UML tools of your choice.
- Trained in a variety of subjects for flexible analysis: software architecture, software development, business processes, systems engineering, data modeling, microservices, reverse engineering and more!
- Small model sizes allow running on local desktop and mobile, plus super-fast server inference!
## Prompting Guide
UML Generator uses the [Qwen3-14B](https://huggingface.co/Qwen/Qwen3-14B) prompt format to create an XMI 2.5.1 file using [UML Generator Format.](https://huggingface.co/datasets/sequelbox/UML-Generator-Dataset-DeepSeek-V3.2)
UML Generator is an **experimental reasoning finetune:**
- the assistant performs multi-step reasoning during the thinking phase, before producing a user response containing only the XMI code block.
- request the assistant to "Generate UML" and describe the situation to be analyzed in order to prompt for the [UML Generator Format;](https://huggingface.co/datasets/sequelbox/UML-Generator-Dataset-DeepSeek-V3.2) see the example script below for examples. Focus on clearly articulating your requirements and allow the UML generator to perform analysis and generate your XMI file.
- structural validation of outputs is strongly recommended for production contexts. the reasoning section contains four reasoning steps and the final user response contains only XMI code.
Example inference script to get started:
```python
from transformers import pipeline
import torch
model_id = "sequelbox/Qwen3-14B-UML-Generator"
pipe = pipeline(
"text-generation",
model=model_id,
torch_dtype="auto",
device_map="auto",
)
prompt = "Generate a UML class diagram modeling a feature toggle framework. A FeatureToggleManager provides an isEnabled(featureName) method. The manager's implementation must be designed using the Strategy pattern, where it delegates the actual check to an IFeatureToggleStrategy interface. This allows the framework to support different backends (e.g., ConfigFileStrategy, DatabaseStrategy, CloudConfigStrategy) for storing the toggle states."
#prompt = "Generate a UML component diagram for a CAN bus interface, clearly separating the hardware and software. Show a Vehicle_Control_App component requiring an I_CAN_Message interface (e.g., sendMessage(id, data)). This interface is provided by a CAN_HAL component. The CAN_HAL component, in turn, requires an I_CAN_Registers interface, which is provided by the <<hardware>>CAN_Controller component. The <<hardware>>CAN_Controller is then connected to a <<device>>CAN_Transceiver."
#prompt = "Generate a UML composite structure diagram for a HospitalInformationSystem component. This system must show its internal parts (subsystems): PatientAdmissions, ElectronicHealthRecord (EHR), Billing, and Pharmacy. PatientAdmissions must be connected to EHR and Billing. EHR must be connected to Pharmacy and Billing. The EHR part must also expose an external port HL7_Interface for communicating with external lab systems."
#prompt = "Generate a UML State Machine Diagram for an avionics Flight Mode Annunciator. The FMA must have two orthogonal regions: Autothrottle (States: Off, ARM, N1, SPEED) and Autopilot (States: Off, FD (Flight Director), CMD). The Autopilot region must also be a composite state with nested orthogonal regions for LateralMode (States: LNAV, HDG_SEL) and VerticalMode (States: LVNAV, ALT_HOLD). A TakeoffGoAround (TOGA) event must force-transition all regions to their respective armed/takeoff states."
messages = [
{"role": "user", "content": prompt},
]
outputs = pipe(
messages,
max_new_tokens=16000,
)
print(outputs[0]["generated_text"][-1])
```
UML Generator is one of our [experimental reasoning releases;](https://huggingface.co/collections/sequelbox/experimental-reasoning-models) we've got more to come soon!
Do as you will.

28
added_tokens.json Normal file
View File

@@ -0,0 +1,28 @@
{
"</think>": 151668,
"</tool_call>": 151658,
"</tool_response>": 151666,
"<think>": 151667,
"<tool_call>": 151657,
"<tool_response>": 151665,
"<|box_end|>": 151649,
"<|box_start|>": 151648,
"<|endoftext|>": 151643,
"<|file_sep|>": 151664,
"<|fim_middle|>": 151660,
"<|fim_pad|>": 151662,
"<|fim_prefix|>": 151659,
"<|fim_suffix|>": 151661,
"<|im_end|>": 151645,
"<|im_start|>": 151644,
"<|image_pad|>": 151655,
"<|object_ref_end|>": 151647,
"<|object_ref_start|>": 151646,
"<|quad_end|>": 151651,
"<|quad_start|>": 151650,
"<|repo_name|>": 151663,
"<|video_pad|>": 151656,
"<|vision_end|>": 151653,
"<|vision_pad|>": 151654,
"<|vision_start|>": 151652
}

89
chat_template.jinja Normal file
View File

@@ -0,0 +1,89 @@
{%- if tools %}
{{- '<|im_start|>system\n' }}
{%- if messages[0].role == 'system' %}
{{- messages[0].content + '\n\n' }}
{%- endif %}
{{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
{%- for tool in tools %}
{{- "\n" }}
{{- tool | tojson }}
{%- endfor %}
{{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
{%- else %}
{%- if messages[0].role == 'system' %}
{{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }}
{%- endif %}
{%- endif %}
{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
{%- for message in messages[::-1] %}
{%- set index = (messages|length - 1) - loop.index0 %}
{%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('<tool_response>') and message.content.endswith('</tool_response>')) %}
{%- set ns.multi_step_tool = false %}
{%- set ns.last_query_index = index %}
{%- endif %}
{%- endfor %}
{%- for message in messages %}
{%- if message.content is string %}
{%- set content = message.content %}
{%- else %}
{%- set content = '' %}
{%- endif %}
{%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
{{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
{%- elif message.role == "assistant" %}
{%- set reasoning_content = '' %}
{%- if message.reasoning_content is string %}
{%- set reasoning_content = message.reasoning_content %}
{%- else %}
{%- if '</think>' in content %}
{%- set reasoning_content = content.split('</think>')[0].rstrip('\n').split('<think>')[-1].lstrip('\n') %}
{%- set content = content.split('</think>')[-1].lstrip('\n') %}
{%- endif %}
{%- endif %}
{%- if loop.index0 > ns.last_query_index %}
{%- if loop.last or (not loop.last and reasoning_content) %}
{{- '<|im_start|>' + message.role + '\n<think>\n' + reasoning_content.strip('\n') + '\n</think>\n\n' + content.lstrip('\n') }}
{%- else %}
{{- '<|im_start|>' + message.role + '\n' + content }}
{%- endif %}
{%- else %}
{{- '<|im_start|>' + message.role + '\n' + content }}
{%- endif %}
{%- if message.tool_calls %}
{%- for tool_call in message.tool_calls %}
{%- if (loop.first and content) or (not loop.first) %}
{{- '\n' }}
{%- endif %}
{%- if tool_call.function %}
{%- set tool_call = tool_call.function %}
{%- endif %}
{{- '<tool_call>\n{"name": "' }}
{{- tool_call.name }}
{{- '", "arguments": ' }}
{%- if tool_call.arguments is string %}
{{- tool_call.arguments }}
{%- else %}
{{- tool_call.arguments | tojson }}
{%- endif %}
{{- '}\n</tool_call>' }}
{%- endfor %}
{%- endif %}
{{- '<|im_end|>\n' }}
{%- elif message.role == "tool" %}
{%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
{{- '<|im_start|>user' }}
{%- endif %}
{{- '\n<tool_response>\n' }}
{{- content }}
{{- '\n</tool_response>' }}
{%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
{{- '<|im_end|>\n' }}
{%- endif %}
{%- endif %}
{%- endfor %}
{%- if add_generation_prompt %}
{{- '<|im_start|>assistant\n' }}
{%- if enable_thinking is defined and enable_thinking is false %}
{{- '<think>\n\n</think>\n\n' }}
{%- endif %}
{%- endif %}

72
config.json Normal file
View File

@@ -0,0 +1,72 @@
{
"architectures": [
"Qwen3ForCausalLM"
],
"attention_bias": false,
"attention_dropout": 0.0,
"bos_token_id": 151643,
"dtype": "float32",
"eos_token_id": 151645,
"head_dim": 128,
"hidden_act": "silu",
"hidden_size": 5120,
"initializer_range": 0.02,
"intermediate_size": 17408,
"layer_types": [
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention"
],
"max_position_embeddings": 40960,
"max_window_layers": 40,
"model_type": "qwen3",
"num_attention_heads": 40,
"num_hidden_layers": 40,
"num_key_value_heads": 8,
"rms_norm_eps": 1e-06,
"rope_scaling": null,
"rope_theta": 1000000,
"sliding_window": null,
"tie_word_embeddings": false,
"transformers_version": "4.57.1",
"use_cache": true,
"use_sliding_window": false,
"vocab_size": 151936
}

1
configuration.json Normal file
View File

@@ -0,0 +1 @@
{"framework": "pytorch", "task": "text-generation", "allow_remote": true}

13
generation_config.json Normal file
View File

@@ -0,0 +1,13 @@
{
"bos_token_id": 151643,
"do_sample": true,
"eos_token_id": [
151645,
151643
],
"pad_token_id": 151643,
"temperature": 0.6,
"top_k": 20,
"top_p": 0.95,
"transformers_version": "4.57.1"
}

BIN
merges.txt (Stored with Git LFS) Normal file

Binary file not shown.

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:0b6a29da317142d1cffb375d0b69502b21e0d97cb475a9ffcc327785d569cefc
size 4684558368

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:fdd000969989102b6da25168cbeb78275762f61208c9f90a6a7c882dc1c63537
size 4676778920

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:274b56e5281f7755b41d67908893478f5cf108b8814b373d56463578241c5b4c
size 4928480056

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:ad9f2d1deab14460601205e6efc9d74270f513e889e8ac92b59e9927dd69a0ec
size 4928480080

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:030344e1dcb726fdeb23f7c3002d84afce6689a7badd8f2ab4f2ebfef7af6673
size 4676778952

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:a904a9d179c488abbb6f3b4828a8b9fc8e3fabf24e11578417a6ec2b15de1e2d
size 4928480096

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:eaef96e340236dfb474aa481429db335ab55e616c8854929896ad223ec8d74cb
size 4928480096

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:2a2d07460474ecd4905ba5c7ad9cb1e8222ba82e235989002bfbff0fbce37f33
size 4676778952

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:881d98035c5dedcf79aae9d6e5f07e3d2a7820de82183d122c430d15a9b1ff74
size 4928480096

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:39cea76e5f45c71fa44b88885a8b2fd1691ea64a5511823a68cdb758486a67a1
size 4928480096

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:01cfa356fec45009e07cc031d706228d401889abe02f2a0419e0b61b07d5f666
size 4676778952

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:1f977e2c8c15488adef4fd9e9497fbe1a000aa044c159d3232ffa19d38339c64
size 2999075752

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:facba960024e8c4baad69193baddfaa7616e9e0cd9d6b539a4e84c8c6d182343
size 3111649408

View File

@@ -0,0 +1,451 @@
{
"metadata": {
"total_parameters": 14768307200,
"total_size": 59073228800
},
"weight_map": {
"lm_head.weight": "model-00013-of-00013.safetensors",
"model.embed_tokens.weight": "model-00001-of-00013.safetensors",
"model.layers.0.input_layernorm.weight": "model-00001-of-00013.safetensors",
"model.layers.0.mlp.down_proj.weight": "model-00001-of-00013.safetensors",
"model.layers.0.mlp.gate_proj.weight": "model-00001-of-00013.safetensors",
"model.layers.0.mlp.up_proj.weight": "model-00001-of-00013.safetensors",
"model.layers.0.post_attention_layernorm.weight": "model-00001-of-00013.safetensors",
"model.layers.0.self_attn.k_norm.weight": "model-00001-of-00013.safetensors",
"model.layers.0.self_attn.k_proj.weight": "model-00001-of-00013.safetensors",
"model.layers.0.self_attn.o_proj.weight": "model-00001-of-00013.safetensors",
"model.layers.0.self_attn.q_norm.weight": "model-00001-of-00013.safetensors",
"model.layers.0.self_attn.q_proj.weight": "model-00001-of-00013.safetensors",
"model.layers.0.self_attn.v_proj.weight": "model-00001-of-00013.safetensors",
"model.layers.1.input_layernorm.weight": "model-00002-of-00013.safetensors",
"model.layers.1.mlp.down_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.1.mlp.gate_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.1.mlp.up_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.1.post_attention_layernorm.weight": "model-00002-of-00013.safetensors",
"model.layers.1.self_attn.k_norm.weight": "model-00001-of-00013.safetensors",
"model.layers.1.self_attn.k_proj.weight": "model-00001-of-00013.safetensors",
"model.layers.1.self_attn.o_proj.weight": "model-00001-of-00013.safetensors",
"model.layers.1.self_attn.q_norm.weight": "model-00001-of-00013.safetensors",
"model.layers.1.self_attn.q_proj.weight": "model-00001-of-00013.safetensors",
"model.layers.1.self_attn.v_proj.weight": "model-00001-of-00013.safetensors",
"model.layers.10.input_layernorm.weight": "model-00004-of-00013.safetensors",
"model.layers.10.mlp.down_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.10.mlp.gate_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.10.mlp.up_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.10.post_attention_layernorm.weight": "model-00004-of-00013.safetensors",
"model.layers.10.self_attn.k_norm.weight": "model-00004-of-00013.safetensors",
"model.layers.10.self_attn.k_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.10.self_attn.o_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.10.self_attn.q_norm.weight": "model-00004-of-00013.safetensors",
"model.layers.10.self_attn.q_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.10.self_attn.v_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.11.input_layernorm.weight": "model-00004-of-00013.safetensors",
"model.layers.11.mlp.down_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.11.mlp.gate_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.11.mlp.up_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.11.post_attention_layernorm.weight": "model-00004-of-00013.safetensors",
"model.layers.11.self_attn.k_norm.weight": "model-00004-of-00013.safetensors",
"model.layers.11.self_attn.k_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.11.self_attn.o_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.11.self_attn.q_norm.weight": "model-00004-of-00013.safetensors",
"model.layers.11.self_attn.q_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.11.self_attn.v_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.12.input_layernorm.weight": "model-00005-of-00013.safetensors",
"model.layers.12.mlp.down_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.12.mlp.gate_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.12.mlp.up_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.12.post_attention_layernorm.weight": "model-00005-of-00013.safetensors",
"model.layers.12.self_attn.k_norm.weight": "model-00004-of-00013.safetensors",
"model.layers.12.self_attn.k_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.12.self_attn.o_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.12.self_attn.q_norm.weight": "model-00004-of-00013.safetensors",
"model.layers.12.self_attn.q_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.12.self_attn.v_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.13.input_layernorm.weight": "model-00005-of-00013.safetensors",
"model.layers.13.mlp.down_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.13.mlp.gate_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.13.mlp.up_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.13.post_attention_layernorm.weight": "model-00005-of-00013.safetensors",
"model.layers.13.self_attn.k_norm.weight": "model-00005-of-00013.safetensors",
"model.layers.13.self_attn.k_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.13.self_attn.o_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.13.self_attn.q_norm.weight": "model-00005-of-00013.safetensors",
"model.layers.13.self_attn.q_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.13.self_attn.v_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.14.input_layernorm.weight": "model-00005-of-00013.safetensors",
"model.layers.14.mlp.down_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.14.mlp.gate_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.14.mlp.up_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.14.post_attention_layernorm.weight": "model-00005-of-00013.safetensors",
"model.layers.14.self_attn.k_norm.weight": "model-00005-of-00013.safetensors",
"model.layers.14.self_attn.k_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.14.self_attn.o_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.14.self_attn.q_norm.weight": "model-00005-of-00013.safetensors",
"model.layers.14.self_attn.q_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.14.self_attn.v_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.15.input_layernorm.weight": "model-00006-of-00013.safetensors",
"model.layers.15.mlp.down_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.15.mlp.gate_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.15.mlp.up_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.15.post_attention_layernorm.weight": "model-00006-of-00013.safetensors",
"model.layers.15.self_attn.k_norm.weight": "model-00005-of-00013.safetensors",
"model.layers.15.self_attn.k_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.15.self_attn.o_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.15.self_attn.q_norm.weight": "model-00005-of-00013.safetensors",
"model.layers.15.self_attn.q_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.15.self_attn.v_proj.weight": "model-00005-of-00013.safetensors",
"model.layers.16.input_layernorm.weight": "model-00006-of-00013.safetensors",
"model.layers.16.mlp.down_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.16.mlp.gate_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.16.mlp.up_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.16.post_attention_layernorm.weight": "model-00006-of-00013.safetensors",
"model.layers.16.self_attn.k_norm.weight": "model-00006-of-00013.safetensors",
"model.layers.16.self_attn.k_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.16.self_attn.o_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.16.self_attn.q_norm.weight": "model-00006-of-00013.safetensors",
"model.layers.16.self_attn.q_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.16.self_attn.v_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.17.input_layernorm.weight": "model-00006-of-00013.safetensors",
"model.layers.17.mlp.down_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.17.mlp.gate_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.17.mlp.up_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.17.post_attention_layernorm.weight": "model-00006-of-00013.safetensors",
"model.layers.17.self_attn.k_norm.weight": "model-00006-of-00013.safetensors",
"model.layers.17.self_attn.k_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.17.self_attn.o_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.17.self_attn.q_norm.weight": "model-00006-of-00013.safetensors",
"model.layers.17.self_attn.q_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.17.self_attn.v_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.18.input_layernorm.weight": "model-00006-of-00013.safetensors",
"model.layers.18.mlp.down_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.18.mlp.gate_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.18.mlp.up_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.18.post_attention_layernorm.weight": "model-00006-of-00013.safetensors",
"model.layers.18.self_attn.k_norm.weight": "model-00006-of-00013.safetensors",
"model.layers.18.self_attn.k_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.18.self_attn.o_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.18.self_attn.q_norm.weight": "model-00006-of-00013.safetensors",
"model.layers.18.self_attn.q_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.18.self_attn.v_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.19.input_layernorm.weight": "model-00007-of-00013.safetensors",
"model.layers.19.mlp.down_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.19.mlp.gate_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.19.mlp.up_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.19.post_attention_layernorm.weight": "model-00007-of-00013.safetensors",
"model.layers.19.self_attn.k_norm.weight": "model-00006-of-00013.safetensors",
"model.layers.19.self_attn.k_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.19.self_attn.o_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.19.self_attn.q_norm.weight": "model-00006-of-00013.safetensors",
"model.layers.19.self_attn.q_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.19.self_attn.v_proj.weight": "model-00006-of-00013.safetensors",
"model.layers.2.input_layernorm.weight": "model-00002-of-00013.safetensors",
"model.layers.2.mlp.down_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.2.mlp.gate_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.2.mlp.up_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.2.post_attention_layernorm.weight": "model-00002-of-00013.safetensors",
"model.layers.2.self_attn.k_norm.weight": "model-00002-of-00013.safetensors",
"model.layers.2.self_attn.k_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.2.self_attn.o_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.2.self_attn.q_norm.weight": "model-00002-of-00013.safetensors",
"model.layers.2.self_attn.q_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.2.self_attn.v_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.20.input_layernorm.weight": "model-00007-of-00013.safetensors",
"model.layers.20.mlp.down_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.20.mlp.gate_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.20.mlp.up_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.20.post_attention_layernorm.weight": "model-00007-of-00013.safetensors",
"model.layers.20.self_attn.k_norm.weight": "model-00007-of-00013.safetensors",
"model.layers.20.self_attn.k_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.20.self_attn.o_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.20.self_attn.q_norm.weight": "model-00007-of-00013.safetensors",
"model.layers.20.self_attn.q_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.20.self_attn.v_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.21.input_layernorm.weight": "model-00007-of-00013.safetensors",
"model.layers.21.mlp.down_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.21.mlp.gate_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.21.mlp.up_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.21.post_attention_layernorm.weight": "model-00007-of-00013.safetensors",
"model.layers.21.self_attn.k_norm.weight": "model-00007-of-00013.safetensors",
"model.layers.21.self_attn.k_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.21.self_attn.o_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.21.self_attn.q_norm.weight": "model-00007-of-00013.safetensors",
"model.layers.21.self_attn.q_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.21.self_attn.v_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.22.input_layernorm.weight": "model-00007-of-00013.safetensors",
"model.layers.22.mlp.down_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.22.mlp.gate_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.22.mlp.up_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.22.post_attention_layernorm.weight": "model-00007-of-00013.safetensors",
"model.layers.22.self_attn.k_norm.weight": "model-00007-of-00013.safetensors",
"model.layers.22.self_attn.k_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.22.self_attn.o_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.22.self_attn.q_norm.weight": "model-00007-of-00013.safetensors",
"model.layers.22.self_attn.q_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.22.self_attn.v_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.23.input_layernorm.weight": "model-00008-of-00013.safetensors",
"model.layers.23.mlp.down_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.23.mlp.gate_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.23.mlp.up_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.23.post_attention_layernorm.weight": "model-00008-of-00013.safetensors",
"model.layers.23.self_attn.k_norm.weight": "model-00007-of-00013.safetensors",
"model.layers.23.self_attn.k_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.23.self_attn.o_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.23.self_attn.q_norm.weight": "model-00007-of-00013.safetensors",
"model.layers.23.self_attn.q_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.23.self_attn.v_proj.weight": "model-00007-of-00013.safetensors",
"model.layers.24.input_layernorm.weight": "model-00008-of-00013.safetensors",
"model.layers.24.mlp.down_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.24.mlp.gate_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.24.mlp.up_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.24.post_attention_layernorm.weight": "model-00008-of-00013.safetensors",
"model.layers.24.self_attn.k_norm.weight": "model-00008-of-00013.safetensors",
"model.layers.24.self_attn.k_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.24.self_attn.o_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.24.self_attn.q_norm.weight": "model-00008-of-00013.safetensors",
"model.layers.24.self_attn.q_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.24.self_attn.v_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.25.input_layernorm.weight": "model-00008-of-00013.safetensors",
"model.layers.25.mlp.down_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.25.mlp.gate_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.25.mlp.up_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.25.post_attention_layernorm.weight": "model-00008-of-00013.safetensors",
"model.layers.25.self_attn.k_norm.weight": "model-00008-of-00013.safetensors",
"model.layers.25.self_attn.k_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.25.self_attn.o_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.25.self_attn.q_norm.weight": "model-00008-of-00013.safetensors",
"model.layers.25.self_attn.q_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.25.self_attn.v_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.26.input_layernorm.weight": "model-00009-of-00013.safetensors",
"model.layers.26.mlp.down_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.26.mlp.gate_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.26.mlp.up_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.26.post_attention_layernorm.weight": "model-00009-of-00013.safetensors",
"model.layers.26.self_attn.k_norm.weight": "model-00008-of-00013.safetensors",
"model.layers.26.self_attn.k_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.26.self_attn.o_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.26.self_attn.q_norm.weight": "model-00008-of-00013.safetensors",
"model.layers.26.self_attn.q_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.26.self_attn.v_proj.weight": "model-00008-of-00013.safetensors",
"model.layers.27.input_layernorm.weight": "model-00009-of-00013.safetensors",
"model.layers.27.mlp.down_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.27.mlp.gate_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.27.mlp.up_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.27.post_attention_layernorm.weight": "model-00009-of-00013.safetensors",
"model.layers.27.self_attn.k_norm.weight": "model-00009-of-00013.safetensors",
"model.layers.27.self_attn.k_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.27.self_attn.o_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.27.self_attn.q_norm.weight": "model-00009-of-00013.safetensors",
"model.layers.27.self_attn.q_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.27.self_attn.v_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.28.input_layernorm.weight": "model-00009-of-00013.safetensors",
"model.layers.28.mlp.down_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.28.mlp.gate_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.28.mlp.up_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.28.post_attention_layernorm.weight": "model-00009-of-00013.safetensors",
"model.layers.28.self_attn.k_norm.weight": "model-00009-of-00013.safetensors",
"model.layers.28.self_attn.k_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.28.self_attn.o_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.28.self_attn.q_norm.weight": "model-00009-of-00013.safetensors",
"model.layers.28.self_attn.q_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.28.self_attn.v_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.29.input_layernorm.weight": "model-00009-of-00013.safetensors",
"model.layers.29.mlp.down_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.29.mlp.gate_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.29.mlp.up_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.29.post_attention_layernorm.weight": "model-00009-of-00013.safetensors",
"model.layers.29.self_attn.k_norm.weight": "model-00009-of-00013.safetensors",
"model.layers.29.self_attn.k_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.29.self_attn.o_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.29.self_attn.q_norm.weight": "model-00009-of-00013.safetensors",
"model.layers.29.self_attn.q_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.29.self_attn.v_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.3.input_layernorm.weight": "model-00002-of-00013.safetensors",
"model.layers.3.mlp.down_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.3.mlp.gate_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.3.mlp.up_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.3.post_attention_layernorm.weight": "model-00002-of-00013.safetensors",
"model.layers.3.self_attn.k_norm.weight": "model-00002-of-00013.safetensors",
"model.layers.3.self_attn.k_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.3.self_attn.o_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.3.self_attn.q_norm.weight": "model-00002-of-00013.safetensors",
"model.layers.3.self_attn.q_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.3.self_attn.v_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.30.input_layernorm.weight": "model-00010-of-00013.safetensors",
"model.layers.30.mlp.down_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.30.mlp.gate_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.30.mlp.up_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.30.post_attention_layernorm.weight": "model-00010-of-00013.safetensors",
"model.layers.30.self_attn.k_norm.weight": "model-00009-of-00013.safetensors",
"model.layers.30.self_attn.k_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.30.self_attn.o_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.30.self_attn.q_norm.weight": "model-00009-of-00013.safetensors",
"model.layers.30.self_attn.q_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.30.self_attn.v_proj.weight": "model-00009-of-00013.safetensors",
"model.layers.31.input_layernorm.weight": "model-00010-of-00013.safetensors",
"model.layers.31.mlp.down_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.31.mlp.gate_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.31.mlp.up_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.31.post_attention_layernorm.weight": "model-00010-of-00013.safetensors",
"model.layers.31.self_attn.k_norm.weight": "model-00010-of-00013.safetensors",
"model.layers.31.self_attn.k_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.31.self_attn.o_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.31.self_attn.q_norm.weight": "model-00010-of-00013.safetensors",
"model.layers.31.self_attn.q_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.31.self_attn.v_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.32.input_layernorm.weight": "model-00010-of-00013.safetensors",
"model.layers.32.mlp.down_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.32.mlp.gate_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.32.mlp.up_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.32.post_attention_layernorm.weight": "model-00010-of-00013.safetensors",
"model.layers.32.self_attn.k_norm.weight": "model-00010-of-00013.safetensors",
"model.layers.32.self_attn.k_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.32.self_attn.o_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.32.self_attn.q_norm.weight": "model-00010-of-00013.safetensors",
"model.layers.32.self_attn.q_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.32.self_attn.v_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.33.input_layernorm.weight": "model-00010-of-00013.safetensors",
"model.layers.33.mlp.down_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.33.mlp.gate_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.33.mlp.up_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.33.post_attention_layernorm.weight": "model-00010-of-00013.safetensors",
"model.layers.33.self_attn.k_norm.weight": "model-00010-of-00013.safetensors",
"model.layers.33.self_attn.k_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.33.self_attn.o_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.33.self_attn.q_norm.weight": "model-00010-of-00013.safetensors",
"model.layers.33.self_attn.q_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.33.self_attn.v_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.34.input_layernorm.weight": "model-00011-of-00013.safetensors",
"model.layers.34.mlp.down_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.34.mlp.gate_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.34.mlp.up_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.34.post_attention_layernorm.weight": "model-00011-of-00013.safetensors",
"model.layers.34.self_attn.k_norm.weight": "model-00010-of-00013.safetensors",
"model.layers.34.self_attn.k_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.34.self_attn.o_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.34.self_attn.q_norm.weight": "model-00010-of-00013.safetensors",
"model.layers.34.self_attn.q_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.34.self_attn.v_proj.weight": "model-00010-of-00013.safetensors",
"model.layers.35.input_layernorm.weight": "model-00011-of-00013.safetensors",
"model.layers.35.mlp.down_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.35.mlp.gate_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.35.mlp.up_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.35.post_attention_layernorm.weight": "model-00011-of-00013.safetensors",
"model.layers.35.self_attn.k_norm.weight": "model-00011-of-00013.safetensors",
"model.layers.35.self_attn.k_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.35.self_attn.o_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.35.self_attn.q_norm.weight": "model-00011-of-00013.safetensors",
"model.layers.35.self_attn.q_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.35.self_attn.v_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.36.input_layernorm.weight": "model-00011-of-00013.safetensors",
"model.layers.36.mlp.down_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.36.mlp.gate_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.36.mlp.up_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.36.post_attention_layernorm.weight": "model-00011-of-00013.safetensors",
"model.layers.36.self_attn.k_norm.weight": "model-00011-of-00013.safetensors",
"model.layers.36.self_attn.k_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.36.self_attn.o_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.36.self_attn.q_norm.weight": "model-00011-of-00013.safetensors",
"model.layers.36.self_attn.q_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.36.self_attn.v_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.37.input_layernorm.weight": "model-00012-of-00013.safetensors",
"model.layers.37.mlp.down_proj.weight": "model-00012-of-00013.safetensors",
"model.layers.37.mlp.gate_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.37.mlp.up_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.37.post_attention_layernorm.weight": "model-00012-of-00013.safetensors",
"model.layers.37.self_attn.k_norm.weight": "model-00011-of-00013.safetensors",
"model.layers.37.self_attn.k_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.37.self_attn.o_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.37.self_attn.q_norm.weight": "model-00011-of-00013.safetensors",
"model.layers.37.self_attn.q_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.37.self_attn.v_proj.weight": "model-00011-of-00013.safetensors",
"model.layers.38.input_layernorm.weight": "model-00012-of-00013.safetensors",
"model.layers.38.mlp.down_proj.weight": "model-00012-of-00013.safetensors",
"model.layers.38.mlp.gate_proj.weight": "model-00012-of-00013.safetensors",
"model.layers.38.mlp.up_proj.weight": "model-00012-of-00013.safetensors",
"model.layers.38.post_attention_layernorm.weight": "model-00012-of-00013.safetensors",
"model.layers.38.self_attn.k_norm.weight": "model-00012-of-00013.safetensors",
"model.layers.38.self_attn.k_proj.weight": "model-00012-of-00013.safetensors",
"model.layers.38.self_attn.o_proj.weight": "model-00012-of-00013.safetensors",
"model.layers.38.self_attn.q_norm.weight": "model-00012-of-00013.safetensors",
"model.layers.38.self_attn.q_proj.weight": "model-00012-of-00013.safetensors",
"model.layers.38.self_attn.v_proj.weight": "model-00012-of-00013.safetensors",
"model.layers.39.input_layernorm.weight": "model-00012-of-00013.safetensors",
"model.layers.39.mlp.down_proj.weight": "model-00012-of-00013.safetensors",
"model.layers.39.mlp.gate_proj.weight": "model-00012-of-00013.safetensors",
"model.layers.39.mlp.up_proj.weight": "model-00012-of-00013.safetensors",
"model.layers.39.post_attention_layernorm.weight": "model-00012-of-00013.safetensors",
"model.layers.39.self_attn.k_norm.weight": "model-00012-of-00013.safetensors",
"model.layers.39.self_attn.k_proj.weight": "model-00012-of-00013.safetensors",
"model.layers.39.self_attn.o_proj.weight": "model-00012-of-00013.safetensors",
"model.layers.39.self_attn.q_norm.weight": "model-00012-of-00013.safetensors",
"model.layers.39.self_attn.q_proj.weight": "model-00012-of-00013.safetensors",
"model.layers.39.self_attn.v_proj.weight": "model-00012-of-00013.safetensors",
"model.layers.4.input_layernorm.weight": "model-00003-of-00013.safetensors",
"model.layers.4.mlp.down_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.4.mlp.gate_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.4.mlp.up_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.4.post_attention_layernorm.weight": "model-00003-of-00013.safetensors",
"model.layers.4.self_attn.k_norm.weight": "model-00002-of-00013.safetensors",
"model.layers.4.self_attn.k_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.4.self_attn.o_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.4.self_attn.q_norm.weight": "model-00002-of-00013.safetensors",
"model.layers.4.self_attn.q_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.4.self_attn.v_proj.weight": "model-00002-of-00013.safetensors",
"model.layers.5.input_layernorm.weight": "model-00003-of-00013.safetensors",
"model.layers.5.mlp.down_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.5.mlp.gate_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.5.mlp.up_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.5.post_attention_layernorm.weight": "model-00003-of-00013.safetensors",
"model.layers.5.self_attn.k_norm.weight": "model-00003-of-00013.safetensors",
"model.layers.5.self_attn.k_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.5.self_attn.o_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.5.self_attn.q_norm.weight": "model-00003-of-00013.safetensors",
"model.layers.5.self_attn.q_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.5.self_attn.v_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.6.input_layernorm.weight": "model-00003-of-00013.safetensors",
"model.layers.6.mlp.down_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.6.mlp.gate_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.6.mlp.up_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.6.post_attention_layernorm.weight": "model-00003-of-00013.safetensors",
"model.layers.6.self_attn.k_norm.weight": "model-00003-of-00013.safetensors",
"model.layers.6.self_attn.k_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.6.self_attn.o_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.6.self_attn.q_norm.weight": "model-00003-of-00013.safetensors",
"model.layers.6.self_attn.q_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.6.self_attn.v_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.7.input_layernorm.weight": "model-00003-of-00013.safetensors",
"model.layers.7.mlp.down_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.7.mlp.gate_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.7.mlp.up_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.7.post_attention_layernorm.weight": "model-00003-of-00013.safetensors",
"model.layers.7.self_attn.k_norm.weight": "model-00003-of-00013.safetensors",
"model.layers.7.self_attn.k_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.7.self_attn.o_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.7.self_attn.q_norm.weight": "model-00003-of-00013.safetensors",
"model.layers.7.self_attn.q_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.7.self_attn.v_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.8.input_layernorm.weight": "model-00004-of-00013.safetensors",
"model.layers.8.mlp.down_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.8.mlp.gate_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.8.mlp.up_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.8.post_attention_layernorm.weight": "model-00004-of-00013.safetensors",
"model.layers.8.self_attn.k_norm.weight": "model-00003-of-00013.safetensors",
"model.layers.8.self_attn.k_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.8.self_attn.o_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.8.self_attn.q_norm.weight": "model-00003-of-00013.safetensors",
"model.layers.8.self_attn.q_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.8.self_attn.v_proj.weight": "model-00003-of-00013.safetensors",
"model.layers.9.input_layernorm.weight": "model-00004-of-00013.safetensors",
"model.layers.9.mlp.down_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.9.mlp.gate_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.9.mlp.up_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.9.post_attention_layernorm.weight": "model-00004-of-00013.safetensors",
"model.layers.9.self_attn.k_norm.weight": "model-00004-of-00013.safetensors",
"model.layers.9.self_attn.k_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.9.self_attn.o_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.9.self_attn.q_norm.weight": "model-00004-of-00013.safetensors",
"model.layers.9.self_attn.q_proj.weight": "model-00004-of-00013.safetensors",
"model.layers.9.self_attn.v_proj.weight": "model-00004-of-00013.safetensors",
"model.norm.weight": "model-00012-of-00013.safetensors"
}
}

31
special_tokens_map.json Normal file
View File

@@ -0,0 +1,31 @@
{
"additional_special_tokens": [
"<|im_start|>",
"<|im_end|>",
"<|object_ref_start|>",
"<|object_ref_end|>",
"<|box_start|>",
"<|box_end|>",
"<|quad_start|>",
"<|quad_end|>",
"<|vision_start|>",
"<|vision_end|>",
"<|vision_pad|>",
"<|image_pad|>",
"<|video_pad|>"
],
"eos_token": {
"content": "<|im_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"pad_token": {
"content": "<|endoftext|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
}
}

BIN
tokenizer.json (Stored with Git LFS) Normal file

Binary file not shown.

239
tokenizer_config.json Normal file
View File

@@ -0,0 +1,239 @@
{
"add_bos_token": false,
"add_prefix_space": false,
"added_tokens_decoder": {
"151643": {
"content": "<|endoftext|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151644": {
"content": "<|im_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151645": {
"content": "<|im_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151646": {
"content": "<|object_ref_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151647": {
"content": "<|object_ref_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151648": {
"content": "<|box_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151649": {
"content": "<|box_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151650": {
"content": "<|quad_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151651": {
"content": "<|quad_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151652": {
"content": "<|vision_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151653": {
"content": "<|vision_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151654": {
"content": "<|vision_pad|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151655": {
"content": "<|image_pad|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151656": {
"content": "<|video_pad|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151657": {
"content": "<tool_call>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151658": {
"content": "</tool_call>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151659": {
"content": "<|fim_prefix|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151660": {
"content": "<|fim_middle|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151661": {
"content": "<|fim_suffix|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151662": {
"content": "<|fim_pad|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151663": {
"content": "<|repo_name|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151664": {
"content": "<|file_sep|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151665": {
"content": "<tool_response>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151666": {
"content": "</tool_response>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151667": {
"content": "<think>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151668": {
"content": "</think>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
}
},
"additional_special_tokens": [
"<|im_start|>",
"<|im_end|>",
"<|object_ref_start|>",
"<|object_ref_end|>",
"<|box_start|>",
"<|box_end|>",
"<|quad_start|>",
"<|quad_end|>",
"<|vision_start|>",
"<|vision_end|>",
"<|vision_pad|>",
"<|image_pad|>",
"<|video_pad|>"
],
"bos_token": null,
"clean_up_tokenization_spaces": false,
"eos_token": "<|im_end|>",
"errors": "replace",
"extra_special_tokens": {},
"model_max_length": 131072,
"pad_token": "<|endoftext|>",
"split_special_tokens": false,
"tokenizer_class": "Qwen2Tokenizer",
"unk_token": null
}

BIN
vocab.json (Stored with Git LFS) Normal file

Binary file not shown.