初始化项目,由ModelHub XC社区提供模型

Model: huihui-ai/Huihui-MoE-1B-A0.6B
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-07-04 09:58:13 +08:00
commit 78a4c2ce2f
14 changed files with 152614 additions and 0 deletions

49
.gitattributes vendored Normal file
View File

@@ -0,0 +1,49 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bin.* filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zstandard filter=lfs diff=lfs merge=lfs -text
*.tfevents* filter=lfs diff=lfs merge=lfs -text
*.db* filter=lfs diff=lfs merge=lfs -text
*.ark* filter=lfs diff=lfs merge=lfs -text
**/*ckpt*data* filter=lfs diff=lfs merge=lfs -text
**/*ckpt*.meta filter=lfs diff=lfs merge=lfs -text
**/*ckpt*.index filter=lfs diff=lfs merge=lfs -text
*.safetensors filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.gguf* filter=lfs diff=lfs merge=lfs -text
*.ggml filter=lfs diff=lfs merge=lfs -text
*.llamafile* filter=lfs diff=lfs merge=lfs -text
*.pt2 filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text
tokenizer.json filter=lfs diff=lfs merge=lfs -text

232
README.md Normal file
View File

@@ -0,0 +1,232 @@
---
license: apache-2.0
base_model:
- Qwen/Qwen3-0.6B
- suayptalha/Qwen3-0.6B-Code-Expert
- suayptalha/Qwen3-0.6B-Math-Expert
- suayptalha/Qwen3-0.6B-Medical-Expert
library_name: transformers
license_link: https://huggingface.co/Qwen/Qwen3-0.6B/blob/main/LICENSE
pipeline_tag: text-generation
tags:
- moe
---
# huihui-ai/Huihui-MoE-1B-A0.6B
## Model Overview
Huihui-MoE-1B-A0.6B is a **Mixture of Experts (MoE)** language model developed by **huihui.ai**, built upon the **[Qwen/Qwen3-0.6B](https://huggingface.co/Qwen/Qwen3-0.6B)** base model. It enhances the standard Transformer architecture by replacing MLP layers with MoE layers, each containing 3 experts, to achieve high performance with efficient inference. The model is designed for natural language processing tasks, including text generation, question answering, and conversational applications.
This version does not support ollama because tie_word_embeddings=True results in the absence of lm_head parameters being saved; therefore, ollama cannot be used. If ollama support is required, please choose the latest version [huihui-ai/Huihui-MoE-1.2B-A0.6B](https://huggingface.co/huihui-ai/Huihui-MoE-1.2B-A0.6B).
- **Architecture**: Qwen3MoeForCausalLM model with 3 experts per layer (num_experts=3), activating 1 expert per token (num_experts_per_tok=1).
- **Total Parameters**: ~1.1 billion (1B)
- **Activated Parameters**: ~0.62 billion (0.6B) during inference, comparable to Qwen3-0.6B
- **Developer**: huihui.ai
- **Release Date**: June 2025
- **License**: Inherits the license of the Qwen3 base model (apache-2.0)
## Expert Models:
### Coding:
[suayptalha/Qwen3-0.6B-Code-Expert](https://huggingface.co/suayptalha/Qwen3-0.6B-Code-Expert)
This model was fully fine-tuned with BF16 on first 20k rows of `nvidia/OpenCodeReasoning` dataset for 1 epoch.
### Math:
[suayptalha/Qwen3-0.6B-Math-Expert](https://huggingface.co/suayptalha/Qwen3-0.6B-Math-Expert)
This model was fully fine-tuned with BF16 on entire `unsloth/OpenMathReasoning-mini` dataset for 1 epoch.
### Medical:
[suayptalha/Qwen3-0.6B-Medical-Expert](https://huggingface.co/suayptalha/Qwen3-0.6B-Medical-Expert)
This model was fully fine-tuned with BF16 on first 20k rows of `FreedomIntelligence/medical-o1-reasoning-SFT` dataset for 1 epoch.
### Instruction Following:
[Qwen/Qwen3-0.6B](https://huggingface.co/Qwen/Qwen3-0.6B)
`Qwen/Qwen3-0.6B` model was directly used for this expert, no fine-tune was applied.
## Training
- **Base Model**: Qwen3-0.6B, pre-trained by the Qwen team, Experts, pre-trained by the Suayptalha team.
- **Conversion**: The model copies embeddings, self-attention, and normalization weights from Qwen3-0.6B, replacing MLP layers with MoE layers (3 experts). Gating weights are randomly initialized.
- **Fine-Tuning**: Not fine-tuned; users are recommended to fine-tune for specific tasks to optimize expert routing. The fine-tuned version is already available and can be referred to as [huihui-ai/Huihui-MoE-1B-A0.6B-SFT](https://huggingface.co/huihui-ai/Huihui-MoE-1B-A0.6B-SFT).
## Usage
```
from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig, TextStreamer
import torch
import os
import signal
cpu_count = os.cpu_count()
print(f"Number of CPU cores in the system: {cpu_count}")
half_cpu_count = cpu_count // 2
os.environ["MKL_NUM_THREADS"] = str(half_cpu_count)
os.environ["OMP_NUM_THREADS"] = str(half_cpu_count)
torch.set_num_threads(half_cpu_count)
print(f"PyTorch threads: {torch.get_num_threads()}")
print(f"MKL threads: {os.getenv('MKL_NUM_THREADS')}")
print(f"OMP threads: {os.getenv('OMP_NUM_THREADS')}")
# Load the model and tokenizer
NEW_MODEL_ID = "huihui-ai/Huihui-MoE-1B-A0.6B"
print(f"Load Model {NEW_MODEL_ID} ... ")
quant_config_4 = BitsAndBytesConfig(
load_in_4bit=True,
bnb_4bit_compute_dtype=torch.bfloat16,
bnb_4bit_use_double_quant=True,
llm_int8_enable_fp32_cpu_offload=True,
)
model = AutoModelForCausalLM.from_pretrained(
NEW_MODEL_ID,
device_map="auto",
trust_remote_code=True,
#quantization_config=quant_config_4,
torch_dtype=torch.bfloat16
)
tokenizer = AutoTokenizer.from_pretrained(NEW_MODEL_ID, trust_remote_code=True)
if tokenizer.pad_token is None:
tokenizer.pad_token = tokenizer.eos_token
tokenizer.pad_token_id = tokenizer.eos_token_id
initial_messages = [{"role": "system", "content": "You are a helpful assistant."}]
messages = initial_messages.copy()
enable_thinking = True
skip_prompt=True
skip_special_tokens=True
class CustomTextStreamer(TextStreamer):
def __init__(self, tokenizer, skip_prompt=True, skip_special_tokens=True):
super().__init__(tokenizer, skip_prompt=skip_prompt, skip_special_tokens=skip_special_tokens)
self.generated_text = ""
self.stop_flag = False
def on_finalized_text(self, text: str, stream_end: bool = False):
self.generated_text += text
print(text, end="", flush=True)
if self.stop_flag:
raise StopIteration
def stop_generation(self):
self.stop_flag = True
def generate_stream(model, tokenizer, messages, enable_thinking, skip_prompt, skip_special_tokens, max_new_tokens):
input_ids = tokenizer.apply_chat_template(
messages,
tokenize=True,
enable_thinking = enable_thinking,
add_generation_prompt=True,
return_tensors="pt"
)
attention_mask = torch.ones_like(input_ids, dtype=torch.long)
tokens = input_ids.to(model.device)
attention_mask = attention_mask.to(model.device)
streamer = CustomTextStreamer(tokenizer, skip_prompt=skip_prompt, skip_special_tokens=skip_special_tokens)
def signal_handler(sig, frame):
streamer.stop_generation()
print("\n[Generation stopped by user with Ctrl+C]")
signal.signal(signal.SIGINT, signal_handler)
print("Response: ", end="", flush=True)
try:
generated_ids = model.generate(
tokens,
attention_mask=attention_mask,
#use_cache=False,
max_new_tokens=max_new_tokens,
do_sample=True,
pad_token_id=tokenizer.pad_token_id,
streamer=streamer
)
del generated_ids
except StopIteration:
print("\n[Stopped by user]")
del input_ids, attention_mask
torch.cuda.empty_cache()
signal.signal(signal.SIGINT, signal.SIG_DFL)
return streamer.generated_text, streamer.stop_flag
while True:
user_input = input("User: ").strip()
if user_input.lower() == "/exit":
print("Exiting chat.")
break
if user_input.lower() == "/clear":
messages = initial_messages.copy()
print("Chat history cleared. Starting a new conversation.")
continue
if user_input.lower() == "/nothink":
if enable_thinking:
enable_thinking = False
print("Thinking = False.")
else:
enable_thinking = True
print("Thinking = True.")
continue
if user_input.lower() == "/skip_prompt":
if skip_prompt:
skip_prompt = False
print("skip_prompt = False.")
else:
skip_prompt = True
print("skip_prompt = True.")
continue
if user_input.lower() == "/skip_special_tokens":
if skip_special_tokens:
skip_special_tokens = False
print("skip_special_tokens = False.")
else:
skip_special_tokens = True
print("skip_special_tokens = True.")
continue
if not user_input:
print("Input cannot be empty. Please enter something.")
continue
messages.append({"role": "user", "content": user_input})
response, stop_flag = generate_stream(model, tokenizer, messages, enable_thinking, skip_prompt, skip_special_tokens, 14192)
print("", flush=True)
if stop_flag:
continue
messages.append({"role": "assistant", "content": response})
```
## Applications
- **Text Generation: Articles**, dialogues, and creative writing.
- **Question Answering**: Information retrieval and query resolution.
- **Conversational AI**: Multi-turn dialogues for chatbots.
- **Research**: Exploration of MoE architectures and efficient model scaling.
## Limitations
- **Fine-Tuning Required**: Randomly initialized gating weights may lead to suboptimal expert utilization without fine-tuning.
- **Compatibility**: Developed with transformers 4.52.4; ensure matching versions to avoid loading issues.
- **Inference Speed**: While efficient for an MoE model, performance depends on hardware (GPU recommended).
## Ethical Considerations
- **Bias**: Inherits potential biases from the Qwen3-0.6B base model; users should evaluate outputs for fairness.
- **Usage**: Intended for research and responsible applications; avoid generating harmful or misleading content.
## Contact
- **Developer**: huihui.ai
- **Repository**: huihui-ai/Huihui-MoE-1B-A0.6B (available locally or on Hugging Face)
- **Issues**: Report bugs or request features via the repository or please send an email to support@huihui.ai
## Acknowledgments
- Built upon the Qwen3-0.6B model by the Qwen team.
- Built upon the Experts model by the Suayptalha team.
- Powered by the Hugging Face transformers library.

28
added_tokens.json Normal file
View File

@@ -0,0 +1,28 @@
{
"</think>": 151668,
"</tool_call>": 151658,
"</tool_response>": 151666,
"<think>": 151667,
"<tool_call>": 151657,
"<tool_response>": 151665,
"<|box_end|>": 151649,
"<|box_start|>": 151648,
"<|endoftext|>": 151643,
"<|file_sep|>": 151664,
"<|fim_middle|>": 151660,
"<|fim_pad|>": 151662,
"<|fim_prefix|>": 151659,
"<|fim_suffix|>": 151661,
"<|im_end|>": 151645,
"<|im_start|>": 151644,
"<|image_pad|>": 151655,
"<|object_ref_end|>": 151647,
"<|object_ref_start|>": 151646,
"<|quad_end|>": 151651,
"<|quad_start|>": 151650,
"<|repo_name|>": 151663,
"<|video_pad|>": 151656,
"<|vision_end|>": 151653,
"<|vision_pad|>": 151654,
"<|vision_start|>": 151652
}

85
chat_template.jinja Normal file
View File

@@ -0,0 +1,85 @@
{%- if tools %}
{{- '<|im_start|>system\n' }}
{%- if messages[0].role == 'system' %}
{{- messages[0].content + '\n\n' }}
{%- endif %}
{{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
{%- for tool in tools %}
{{- "\n" }}
{{- tool | tojson }}
{%- endfor %}
{{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
{%- else %}
{%- if messages[0].role == 'system' %}
{{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }}
{%- endif %}
{%- endif %}
{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
{%- for message in messages[::-1] %}
{%- set index = (messages|length - 1) - loop.index0 %}
{%- if ns.multi_step_tool and message.role == "user" and not(message.content.startswith('<tool_response>') and message.content.endswith('</tool_response>')) %}
{%- set ns.multi_step_tool = false %}
{%- set ns.last_query_index = index %}
{%- endif %}
{%- endfor %}
{%- for message in messages %}
{%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
{{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }}
{%- elif message.role == "assistant" %}
{%- set content = message.content %}
{%- set reasoning_content = '' %}
{%- if message.reasoning_content is defined and message.reasoning_content is not none %}
{%- set reasoning_content = message.reasoning_content %}
{%- else %}
{%- if '</think>' in message.content %}
{%- set content = message.content.split('</think>')[-1].lstrip('\n') %}
{%- set reasoning_content = message.content.split('</think>')[0].rstrip('\n').split('<think>')[-1].lstrip('\n') %}
{%- endif %}
{%- endif %}
{%- if loop.index0 > ns.last_query_index %}
{%- if loop.last or (not loop.last and reasoning_content) %}
{{- '<|im_start|>' + message.role + '\n<think>\n' + reasoning_content.strip('\n') + '\n</think>\n\n' + content.lstrip('\n') }}
{%- else %}
{{- '<|im_start|>' + message.role + '\n' + content }}
{%- endif %}
{%- else %}
{{- '<|im_start|>' + message.role + '\n' + content }}
{%- endif %}
{%- if message.tool_calls %}
{%- for tool_call in message.tool_calls %}
{%- if (loop.first and content) or (not loop.first) %}
{{- '\n' }}
{%- endif %}
{%- if tool_call.function %}
{%- set tool_call = tool_call.function %}
{%- endif %}
{{- '<tool_call>\n{"name": "' }}
{{- tool_call.name }}
{{- '", "arguments": ' }}
{%- if tool_call.arguments is string %}
{{- tool_call.arguments }}
{%- else %}
{{- tool_call.arguments | tojson }}
{%- endif %}
{{- '}\n</tool_call>' }}
{%- endfor %}
{%- endif %}
{{- '<|im_end|>\n' }}
{%- elif message.role == "tool" %}
{%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
{{- '<|im_start|>user' }}
{%- endif %}
{{- '\n<tool_response>\n' }}
{{- message.content }}
{{- '\n</tool_response>' }}
{%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
{{- '<|im_end|>\n' }}
{%- endif %}
{%- endif %}
{%- endfor %}
{%- if add_generation_prompt %}
{{- '<|im_start|>assistant\n' }}
{%- if enable_thinking is defined and enable_thinking is false %}
{{- '<think>\n\n</think>\n\n' }}
{%- endif %}
{%- endif %}

38
config.json Normal file
View File

@@ -0,0 +1,38 @@
{
"architectures": [
"Qwen3MoeForCausalLM"
],
"attention_bias": false,
"attention_dropout": 0.0,
"bos_token_id": 151643,
"decoder_sparse_step": 1,
"eos_token_id": 151645,
"head_dim": 128,
"hidden_act": "silu",
"hidden_size": 1024,
"initializer_range": 0.02,
"intermediate_size": 3072,
"max_position_embeddings": 40960,
"max_window_layers": 28,
"mlp_only_layers": [],
"model_type": "qwen3_moe",
"moe_intermediate_size": 3072,
"norm_topk_prob": true,
"num_attention_heads": 16,
"num_experts": 3,
"num_experts_per_tok": 1,
"num_hidden_layers": 28,
"num_key_value_heads": 8,
"output_router_logits": false,
"rms_norm_eps": 1e-06,
"rope_scaling": null,
"rope_theta": 1000000,
"router_aux_loss_coef": 0.001,
"sliding_window": null,
"tie_word_embeddings": true,
"torch_dtype": "bfloat16",
"transformers_version": "4.52.4",
"use_cache": true,
"use_sliding_window": false,
"vocab_size": 151936
}

1
configuration.json Normal file
View File

@@ -0,0 +1 @@
{"framework": "pytorch", "task": "text-generation", "allow_remote": true}

6
generation_config.json Normal file
View File

@@ -0,0 +1,6 @@
{
"_from_model_config": true,
"bos_token_id": 151643,
"eos_token_id": 151645,
"transformers_version": "4.52.4"
}

151388
merges.txt Normal file

File diff suppressed because it is too large Load Diff

3
model.safetensors Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:e893bd29c30948c66b7bb6da4ede05684aa35eea99c8b2a07bfd8a9aa56e1b17
size 2249296512

510
model_params.txt Normal file
View File

@@ -0,0 +1,510 @@
Model Parameter Distribution:
------------------------------------------------------------
model.embed_tokens.weight: 155,582,464 parameters, device cuda:0
model.layers.0.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.0.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.0.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.0.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.0.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.0.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.0.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.0.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.0.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.0.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.0.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.0.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.0.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.0.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.0.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.0.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.0.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.0.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.1.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.1.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.1.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.1.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.1.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.1.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.1.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.1.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.1.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.1.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.1.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.1.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.1.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.1.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.1.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.1.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.1.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.1.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.2.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.2.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.2.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.2.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.2.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.2.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.2.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.2.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.2.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.2.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.2.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.2.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.2.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.2.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.2.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.2.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.2.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.2.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.3.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.3.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.3.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.3.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.3.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.3.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.3.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.3.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.3.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.3.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.3.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.3.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.3.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.3.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.3.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.3.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.3.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.3.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.4.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.4.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.4.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.4.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.4.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.4.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.4.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.4.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.4.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.4.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.4.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.4.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.4.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.4.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.4.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.4.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.4.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.4.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.5.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.5.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.5.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.5.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.5.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.5.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.5.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.5.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.5.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.5.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.5.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.5.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.5.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.5.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.5.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.5.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.5.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.5.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.6.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.6.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.6.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.6.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.6.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.6.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.6.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.6.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.6.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.6.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.6.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.6.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.6.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.6.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.6.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.6.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.6.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.6.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.7.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.7.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.7.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.7.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.7.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.7.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.7.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.7.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.7.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.7.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.7.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.7.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.7.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.7.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.7.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.7.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.7.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.7.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.8.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.8.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.8.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.8.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.8.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.8.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.8.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.8.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.8.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.8.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.8.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.8.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.8.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.8.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.8.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.8.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.8.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.8.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.9.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.9.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.9.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.9.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.9.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.9.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.9.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.9.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.9.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.9.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.9.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.9.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.9.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.9.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.9.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.9.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.9.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.9.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.10.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.10.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.10.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.10.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.10.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.10.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.10.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.10.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.10.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.10.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.10.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.10.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.10.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.10.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.10.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.10.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.10.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.10.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.11.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.11.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.11.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.11.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.11.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.11.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.11.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.11.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.11.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.11.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.11.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.11.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.11.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.11.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.11.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.11.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.11.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.11.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.12.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.12.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.12.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.12.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.12.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.12.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.12.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.12.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.12.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.12.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.12.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.12.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.12.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.12.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.12.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.12.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.12.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.12.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.13.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.13.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.13.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.13.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.13.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.13.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.13.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.13.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.13.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.13.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.13.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.13.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.13.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.13.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.13.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.13.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.13.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.13.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.14.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.14.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.14.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.14.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.14.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.14.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.14.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.14.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.14.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.14.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.14.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.14.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.14.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.14.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.14.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.14.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.14.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.14.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.15.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.15.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.15.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.15.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.15.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.15.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.15.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.15.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.15.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.15.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.15.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.15.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.15.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.15.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.15.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.15.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.15.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.15.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.16.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.16.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.16.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.16.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.16.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.16.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.16.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.16.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.16.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.16.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.16.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.16.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.16.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.16.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.16.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.16.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.16.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.16.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.17.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.17.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.17.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.17.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.17.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.17.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.17.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.17.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.17.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.17.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.17.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.17.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.17.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.17.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.17.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.17.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.17.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.17.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.18.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.18.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.18.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.18.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.18.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.18.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.18.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.18.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.18.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.18.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.18.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.18.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.18.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.18.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.18.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.18.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.18.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.18.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.19.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.19.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.19.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.19.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.19.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.19.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.19.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.19.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.19.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.19.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.19.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.19.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.19.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.19.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.19.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.19.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.19.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.19.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.20.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.20.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.20.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.20.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.20.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.20.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.20.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.20.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.20.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.20.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.20.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.20.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.20.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.20.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.20.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.20.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.20.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.20.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.21.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.21.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.21.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.21.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.21.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.21.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.21.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.21.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.21.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.21.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.21.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.21.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.21.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.21.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.21.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.21.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.21.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.21.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.22.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.22.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.22.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.22.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.22.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.22.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.22.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.22.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.22.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.22.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.22.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.22.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.22.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.22.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.22.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.22.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.22.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.22.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.23.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.23.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.23.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.23.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.23.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.23.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.23.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.23.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.23.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.23.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.23.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.23.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.23.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.23.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.23.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.23.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.23.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.23.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.24.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.24.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.24.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.24.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.24.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.24.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.24.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.24.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.24.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.24.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.24.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.24.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.24.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.24.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.24.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.24.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.24.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.24.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.25.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.25.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.25.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.25.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.25.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.25.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.25.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.25.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.25.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.25.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.25.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.25.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.25.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.25.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.25.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.25.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.25.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.25.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.26.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.26.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.26.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.26.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.26.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.26.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.26.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.26.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.26.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.26.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.26.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.26.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.26.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.26.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.26.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.26.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.26.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.26.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.27.self_attn.q_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.27.self_attn.k_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.27.self_attn.v_proj.weight: 1,048,576 parameters, device cuda:0
model.layers.27.self_attn.o_proj.weight: 2,097,152 parameters, device cuda:0
model.layers.27.self_attn.q_norm.weight: 128 parameters, device cuda:0
model.layers.27.self_attn.k_norm.weight: 128 parameters, device cuda:0
model.layers.27.mlp.gate.weight: 3,072 parameters, device cuda:0
model.layers.27.mlp.experts.0.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.27.mlp.experts.0.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.27.mlp.experts.0.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.27.mlp.experts.1.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.27.mlp.experts.1.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.27.mlp.experts.1.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.27.mlp.experts.2.gate_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.27.mlp.experts.2.up_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.27.mlp.experts.2.down_proj.weight: 3,145,728 parameters, device cuda:0
model.layers.27.input_layernorm.weight: 1,024 parameters, device cuda:0
model.layers.27.post_attention_layernorm.weight: 1,024 parameters, device cuda:0
model.norm.weight: 1,024 parameters, device cuda:0
------------------------------------------------------------
Total Model Parameter Count:1,124,618,240

31
special_tokens_map.json Normal file
View File

@@ -0,0 +1,31 @@
{
"additional_special_tokens": [
"<|im_start|>",
"<|im_end|>",
"<|object_ref_start|>",
"<|object_ref_end|>",
"<|box_start|>",
"<|box_end|>",
"<|quad_start|>",
"<|quad_end|>",
"<|vision_start|>",
"<|vision_end|>",
"<|vision_pad|>",
"<|image_pad|>",
"<|video_pad|>"
],
"eos_token": {
"content": "<|im_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"pad_token": {
"content": "<|endoftext|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
}
}

BIN
tokenizer.json (Stored with Git LFS) Normal file

Binary file not shown.

239
tokenizer_config.json Normal file
View File

@@ -0,0 +1,239 @@
{
"add_bos_token": false,
"add_prefix_space": false,
"added_tokens_decoder": {
"151643": {
"content": "<|endoftext|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151644": {
"content": "<|im_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151645": {
"content": "<|im_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151646": {
"content": "<|object_ref_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151647": {
"content": "<|object_ref_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151648": {
"content": "<|box_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151649": {
"content": "<|box_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151650": {
"content": "<|quad_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151651": {
"content": "<|quad_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151652": {
"content": "<|vision_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151653": {
"content": "<|vision_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151654": {
"content": "<|vision_pad|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151655": {
"content": "<|image_pad|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151656": {
"content": "<|video_pad|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151657": {
"content": "<tool_call>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151658": {
"content": "</tool_call>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151659": {
"content": "<|fim_prefix|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151660": {
"content": "<|fim_middle|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151661": {
"content": "<|fim_suffix|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151662": {
"content": "<|fim_pad|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151663": {
"content": "<|repo_name|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151664": {
"content": "<|file_sep|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151665": {
"content": "<tool_response>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151666": {
"content": "</tool_response>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151667": {
"content": "<think>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151668": {
"content": "</think>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
}
},
"additional_special_tokens": [
"<|im_start|>",
"<|im_end|>",
"<|object_ref_start|>",
"<|object_ref_end|>",
"<|box_start|>",
"<|box_end|>",
"<|quad_start|>",
"<|quad_end|>",
"<|vision_start|>",
"<|vision_end|>",
"<|vision_pad|>",
"<|image_pad|>",
"<|video_pad|>"
],
"bos_token": null,
"clean_up_tokenization_spaces": false,
"eos_token": "<|im_end|>",
"errors": "replace",
"extra_special_tokens": {},
"model_max_length": 131072,
"pad_token": "<|endoftext|>",
"split_special_tokens": false,
"tokenizer_class": "Qwen2Tokenizer",
"unk_token": null
}

1
vocab.json Normal file

File diff suppressed because one or more lines are too long