初始化项目，由ModelHub XC社区提供模型

Model: unige-fti/Aladdin-3B Source: Original Platform
2026-05-28 12:20:21 +08:00
commit 265a748221
12 changed files with 2774 additions and 0 deletions
--- a/.gitattributes
+++ b/.gitattributes
@@ -0,0 +1,36 @@
 *.7z filter=lfs diff=lfs merge=lfs -text
 *.arrow filter=lfs diff=lfs merge=lfs -text
 *.bin filter=lfs diff=lfs merge=lfs -text
 *.bz2 filter=lfs diff=lfs merge=lfs -text
 *.ckpt filter=lfs diff=lfs merge=lfs -text
 *.ftz filter=lfs diff=lfs merge=lfs -text
 *.gz filter=lfs diff=lfs merge=lfs -text
 *.h5 filter=lfs diff=lfs merge=lfs -text
 *.joblib filter=lfs diff=lfs merge=lfs -text
 *.lfs.* filter=lfs diff=lfs merge=lfs -text
 *.mlmodel filter=lfs diff=lfs merge=lfs -text
 *.model filter=lfs diff=lfs merge=lfs -text
 *.msgpack filter=lfs diff=lfs merge=lfs -text
 *.npy filter=lfs diff=lfs merge=lfs -text
 *.npz filter=lfs diff=lfs merge=lfs -text
 *.onnx filter=lfs diff=lfs merge=lfs -text
 *.ot filter=lfs diff=lfs merge=lfs -text
 *.parquet filter=lfs diff=lfs merge=lfs -text
 *.pb filter=lfs diff=lfs merge=lfs -text
 *.pickle filter=lfs diff=lfs merge=lfs -text
 *.pkl filter=lfs diff=lfs merge=lfs -text
 *.pt filter=lfs diff=lfs merge=lfs -text
 *.pth filter=lfs diff=lfs merge=lfs -text
 *.rar filter=lfs diff=lfs merge=lfs -text
 *.safetensors filter=lfs diff=lfs merge=lfs -text
 saved_model/**/* filter=lfs diff=lfs merge=lfs -text
 *.tar.* filter=lfs diff=lfs merge=lfs -text
 *.tar filter=lfs diff=lfs merge=lfs -text
 *.tflite filter=lfs diff=lfs merge=lfs -text
 *.tgz filter=lfs diff=lfs merge=lfs -text
 *.wasm filter=lfs diff=lfs merge=lfs -text
 *.xz filter=lfs diff=lfs merge=lfs -text
 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text
 tokenizer.json filter=lfs diff=lfs merge=lfs -text
--- a/README.md
+++ b/README.md
@@ -0,0 +1,100 @@
 ---
 library_name: transformers
 tags:
 - SmolLM-3B
 - Arabic
 language:
 - ar
 metrics:
 - chrf
 base_model:
 - HuggingFaceTB/SmolLM3-3B
 pipeline_tag: text-generation
 ---
 # Model Card for unige-fti/Aladdin-3B
 Multidialectal Arabic generation and translation model fine-tuned for dialect fidelity and diglossia.
 ## Model Details
 ### Model Description
 - **Base model:** SmolLM3-3B
 - **Architecture:** Decoder-only causal transformer (SmolLM architecture)
 - **Parameters:** ~3B
 - **Language coverage:** Arabic dialects, Modern Standard Arabic (MSA), English
 Primary tasks:
 - Dialectal Arabic generation
 - Bidirectional translation (DA ↔ MSA ↔ English)
 - Controlled generation conditioned on dialect instructions
 This model was fine-tuned by the Aladdin-FTI team for the AMIYA shared task to jointly optimize:
 - Machine translation (semantic adequacy & diglossia)
 ```
 Instruction-formatted prompts:
 Translate from English into Egyptian Arabic:
 <SOURCE>
 ```
 - Instruction-conditioned generation (dialect fidelity)
 ```
 Complete the sentence in Moroccan Arabic:
 <PREFIX>
 ```
 The objective balances meaning preservation and dialect naturalness in Arabic diglossia settings.
 ### Model Sources
 - **Repository:** [Github repository](https://github.com/drvenabili/mtfinetune_amiya/tree/main)
 - **Paper:** [https://arxiv.org/abs/2602.16290](https://arxiv.org/abs/2602.16290)
 ## How to Get Started with the Model
 TODO
 ## Training Details
 ### Training Data: Closed-track training data only. 
 Datasets span multiple dialect regions and domains
 Parallel corpora:
 - SauDial
 - Casablanca corpus
 - JODA
 - UFAL Levantine
 - DODA
 - Atlas
 Monolingual dialect corpora:
 - MADAR
 - Shami
 - Saudi Tweets
 - EDGAD / EDC
 - HABIBI lyrics
 ## Citation
 If you use this model in your research, please cite the following paper:
 ```
@inproceedings{mutal2026aladdinfti,
  title     = {Aladdin-FTI @ AMIYA: Three Wishes for Arabic NLP: Fidelity, Diglossia, and Multidialectal Generation},
  author    = {Mutal, Jonathan and Al Almaoui, Perla and Hengchen, Simon and Bouillon, Pierrette},
  booktitle = {Proceedings of the AMIYA Shared Task, co-located with VarDial at EACL 2026},
  year      = {2026},
  address   = {Rabat, Morocco},
  publisher = {Association for Computational Linguistics},
 }
 ```
 ## Compute infrastructure
 The computations were performed at the University of Geneva using the Baobab HPC service.
--- a/chat_template.jinja
+++ b/chat_template.jinja
@@ -0,0 +1,94 @@
 {# ───── defaults ───── #}
 {%- if enable_thinking is not defined -%}
 {%- set enable_thinking = true -%}
 {%- endif -%}
 {# ───── reasoning mode ───── #}
 {%- if enable_thinking -%}
  {%- set reasoning_mode = "/think" -%}
 {%- else -%}
  {%- set reasoning_mode = "/no_think" -%}
 {%- endif -%}
 {# ───── header (system message) ───── #}
 {{- "<|im_start|>system\n" -}}
 {%- if messages[0].role == "system" -%}
  {%- set system_message = messages[0].content -%}
  {%- if "/no_think" in system_message -%}
    {%- set reasoning_mode = "/no_think" -%}
  {%- elif "/think" in system_message -%}
    {%- set reasoning_mode = "/think" -%}
  {%- endif -%}
  {%- set custom_instructions = system_message.replace("/no_think", "").replace("/think", "").rstrip() -%}
 {%- endif -%}
 {%- if "/system_override" in system_message -%}
  {{- custom_instructions.replace("/system_override", "").rstrip() -}}
  {{- "<|im_end|>\n" -}}
 {%- else -%}
  {{- "## Metadata\n\n" -}}
  {{- "Knowledge Cutoff Date: June 2025\n" -}}
  {%- set today = strftime_now("%d %B %Y") -%}
  {{- "Today Date: " ~ today ~ "\n" -}}
  {{- "Reasoning Mode: " + reasoning_mode + "\n\n" -}}
  {{- "## Custom Instructions\n\n" -}}
  {%- if custom_instructions -%}
    {{- custom_instructions + "\n\n" -}}
  {%- elif reasoning_mode == "/think" -%}
    {{- "You are a helpful AI assistant named SmolLM, trained by Hugging Face. Your role as an assistant involves thoroughly exploring questions through a systematic thinking process before providing the final precise and accurate solutions. This requires engaging in a comprehensive cycle of analysis, summarizing, exploration, reassessment, reflection, backtracking, and iteration to develop well-considered thinking process. Please structure your response into two main sections: Thought and Solution using the specified format: <think> Thought section </think> Solution section. In the Thought section, detail your reasoning process in steps. Each step should include detailed considerations such as analysing questions, summarizing relevant findings, brainstorming new ideas, verifying the accuracy of the current steps, refining any errors, and revisiting previous steps. In the Solution section, based on various attempts, explorations, and reflections from the Thought section, systematically present the final solution that you deem correct. The Solution section should be logical, accurate, and concise and detail necessary steps needed to reach the conclusion.\n\n" -}}
  {%- else -%}
    {{- "You are a helpful AI assistant named SmolLM, trained by Hugging Face.\n\n" -}}
  {%- endif -%}
  {%- if xml_tools or python_tools or tools -%}
    {{- "### Tools\n\n" -}}
    {%- if xml_tools or tools -%}
      {%- if tools -%}
        {%- set xml_tools = tools -%}
      {%- endif -%}
      {%- set ns = namespace(xml_tool_string="You may call one or more functions to assist with the user query.\nYou are provided with function signatures within <tools></tools> XML tags:\n\n<tools>\n") -%}
      {%- for tool in xml_tools[:] -%} {# The slicing makes sure that xml_tools is a list #}
        {%- set ns.xml_tool_string = ns.xml_tool_string ~ (tool | string) ~ "\n" -%}
      {%- endfor -%}
      {%- set xml_tool_string = ns.xml_tool_string + "</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call>" -%}
      {{- xml_tool_string -}}
    {%- endif -%}
    {%- if python_tools -%}
      {%- set ns = namespace(python_tool_string="When you send a message containing Python code between '<code>' and '</code>' tags, it will be executed in a stateful Jupyter notebook environment, and you will then be given the output to continued reasoning in an agentic loop.\n\nYou can use the following tools in your python code like regular functions:\n<tools>\n") -%}
      {%- for tool in python_tools[:] -%} {# The slicing makes sure that python_tools is a list #}
        {%- set ns.python_tool_string = ns.python_tool_string ~ (tool | string) ~ "\n" -%}
      {%- endfor -%}
      {%- set python_tool_string = ns.python_tool_string + "</tools>\n\nThe state persists between code executions: so variables that you define in one step are still available thereafter." -%}
      {{- python_tool_string -}}
    {%- endif -%}
    {{- "\n\n" -}}
    {{- "<|im_end|>\n" -}}
  {%- endif -%}
 {%- endif -%}
 {# ───── main loop ───── #}
 {%- for message in messages -%}
    {%- set content = message.content if message.content is string else "" -%}
    {%- if message.role == "user" -%}
        {{ "<|im_start|>" + message.role + "\n"  + content + "<|im_end|>\n" }}
    {%- elif message.role == "assistant" -%}
        {% generation %}
        {%- if reasoning_mode == "/think" -%}
            {{ "<|im_start|>assistant\n" + content.lstrip("\n") + "<|im_end|>\n" }}
        {%- else -%}
            {{ "<|im_start|>assistant\n" + "<think>\n\n</think>\n" + content.lstrip("\n") + "<|im_end|>\n" }}
        {%- endif -%}
        {% endgeneration %}
    {%- elif message.role == "tool" -%}
    {{ "<|im_start|>" + "user\n"  + content + "<|im_end|>\n" }}
    {%- endif -%}
 {%- endfor -%}
 {# ───── generation prompt ───── #}
 {%- if add_generation_prompt -%}
    {%- if reasoning_mode == "/think" -%}
        {{ "<|im_start|>assistant\n" }}
    {%- else -%}
        {{ "<|im_start|>assistant\n" + "<think>\n\n</think>\n"  }}
    {%- endif -%}
 {%- endif -%}
--- a/config.json
+++ b/config.json
@@ -0,0 +1,108 @@
 {
  "architectures": [
    "SmolLM3ForCausalLM"
  ],
  "attention_bias": false,
  "attention_dropout": 0.0,
  "bos_token_id": null,
  "dtype": "float32",
  "eos_token_id": 128012,
  "hidden_act": "silu",
  "hidden_size": 2048,
  "initializer_range": 0.02,
  "intermediate_size": 11008,
  "layer_types": [
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention",
    "full_attention"
  ],
  "max_position_embeddings": 65536,
  "max_window_layers": 28,
  "mlp_bias": false,
  "model_type": "smollm3",
  "no_rope_layer_interval": 4,
  "no_rope_layers": [
    1,
    1,
    1,
    0,
    1,
    1,
    1,
    0,
    1,
    1,
    1,
    0,
    1,
    1,
    1,
    0,
    1,
    1,
    1,
    0,
    1,
    1,
    1,
    0,
    1,
    1,
    1,
    0,
    1,
    1,
    1,
    0,
    1,
    1,
    1,
    0
  ],
  "num_attention_heads": 16,
  "num_hidden_layers": 36,
  "num_key_value_heads": 4,
  "pad_token_id": 128012,
  "pretraining_tp": 2,
  "rms_norm_eps": 1e-06,
  "rope_scaling": null,
  "rope_theta": 5000000.0,
  "sliding_window": null,
  "transformers_version": "4.57.3",
  "use_cache": false,
  "use_sliding_window": false,
  "vocab_size": 128256
 }
--- a/generation_config.json
+++ b/generation_config.json
@@ -0,0 +1,10 @@
 {
  "do_sample": true,
  "eos_token_id": [
    128012
  ],
  "pad_token_id": 128012,
  "temperature": 0.6,
  "top_p": 0.95,
  "transformers_version": "4.57.3"
 }
--- a/model-00001-of-00003.safetensors
+++ b/model-00001-of-00003.safetensors
@@ -0,0 +1,3 @@
 version https://git-lfs.github.com/spec/v1
 oid sha256:3df07f44d4e85fc2e792d1f3b1327e0a73f82432ea22220556cd2ccdb94de9bf
 size 4932711224
--- a/model-00002-of-00003.safetensors
+++ b/model-00002-of-00003.safetensors
@@ -0,0 +1,3 @@
 version https://git-lfs.github.com/spec/v1
 oid sha256:e3c216e04ff46c1907af33728bb165490eee48ea49accbbb03d1f7de31a31aa9
 size 4999889128
--- a/model-00003-of-00003.safetensors
+++ b/model-00003-of-00003.safetensors
@@ -0,0 +1,3 @@
 version https://git-lfs.github.com/spec/v1
 oid sha256:fffe589d09e47f0cf8e4d8edf9de47db7089827a0b7b8b18a38cefd3a3106322
 size 2367831672
--- a/model.safetensors.index.json
+++ b/model.safetensors.index.json
@@ -0,0 +1,334 @@
 {
  "metadata": {
    "total_parameters": 3075098624,
    "total_size": 12300394496
  },
  "weight_map": {
    "model.embed_tokens.weight": "model-00001-of-00003.safetensors",
    "model.layers.0.input_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.0.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.0.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.1.input_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.1.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.1.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.1.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.10.input_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.10.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.10.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.10.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.10.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.10.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.10.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.10.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.10.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.11.input_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.11.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.11.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.11.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.11.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.11.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.11.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.11.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.11.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.12.input_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.12.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.12.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.12.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.12.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.12.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.12.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.12.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.12.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.13.input_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.13.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.13.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.13.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.13.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.13.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.13.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.13.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.13.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.14.input_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.14.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.14.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.14.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.14.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.14.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.14.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.14.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.14.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.15.input_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.15.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.15.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.15.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.15.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.15.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.15.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.15.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.15.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.16.input_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.16.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.16.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.16.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.16.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.16.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.16.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.16.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.16.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.17.input_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.17.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.17.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.17.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.17.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.17.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.17.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.17.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.17.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.18.input_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.18.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.18.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.18.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.18.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.18.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.18.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.19.input_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.19.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.19.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.19.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.19.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.19.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.19.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.19.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.2.input_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.2.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.2.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.20.input_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.20.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.20.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.20.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.20.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.20.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.20.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.20.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.20.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.21.input_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.21.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.21.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.21.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.21.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.21.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.21.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.21.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.21.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.22.input_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.22.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.22.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.22.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.22.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.22.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.22.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.22.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.22.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.23.input_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.23.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.23.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.23.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.23.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.23.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.23.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.23.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.23.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.24.input_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.24.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.24.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.24.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.24.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.24.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.24.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.24.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.24.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.25.input_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.25.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.25.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.25.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.25.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.25.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.25.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.25.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.25.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.26.input_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.26.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.26.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.26.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.26.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.26.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.26.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.26.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.26.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.27.input_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.27.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.27.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.27.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.27.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
    "model.layers.27.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.27.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.27.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.27.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.28.input_layernorm.weight": "model-00003-of-00003.safetensors",
    "model.layers.28.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.28.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.28.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.28.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
    "model.layers.28.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.28.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.28.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.28.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
    "model.layers.29.input_layernorm.weight": "model-00003-of-00003.safetensors",
    "model.layers.29.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.29.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.29.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.29.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
    "model.layers.29.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.29.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.29.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.29.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.3.input_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.3.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.3.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.3.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.3.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.30.input_layernorm.weight": "model-00003-of-00003.safetensors",
    "model.layers.30.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.30.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.30.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.30.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
    "model.layers.30.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.30.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.30.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.30.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.31.input_layernorm.weight": "model-00003-of-00003.safetensors",
    "model.layers.31.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.31.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.31.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.31.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
    "model.layers.31.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.31.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.31.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.31.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.32.input_layernorm.weight": "model-00003-of-00003.safetensors",
    "model.layers.32.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.32.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.32.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.32.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
    "model.layers.32.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.32.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.32.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.32.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.33.input_layernorm.weight": "model-00003-of-00003.safetensors",
    "model.layers.33.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.33.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.33.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.33.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
    "model.layers.33.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.33.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.33.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.33.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.34.input_layernorm.weight": "model-00003-of-00003.safetensors",
    "model.layers.34.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.34.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.34.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.34.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
    "model.layers.34.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.34.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.34.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.34.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.35.input_layernorm.weight": "model-00003-of-00003.safetensors",
    "model.layers.35.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.35.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.35.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.35.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
    "model.layers.35.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.35.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.35.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.35.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
    "model.layers.4.input_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.4.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.4.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.4.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.4.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.4.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.4.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.4.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.4.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.5.input_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.5.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.5.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.5.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.5.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.5.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.5.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.6.input_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.6.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.6.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.6.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.6.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.6.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.6.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.6.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.6.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.7.input_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.7.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.7.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.7.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.7.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.7.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.8.input_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.8.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.8.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.8.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.8.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.9.input_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.9.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.9.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.9.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.9.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
    "model.layers.9.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.9.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.9.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
    "model.layers.9.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
    "model.norm.weight": "model-00003-of-00003.safetensors"
  }
 }
--- a/special_tokens_map.json
+++ b/special_tokens_map.json
@@ -0,0 +1,16 @@
 {
  "eos_token": {
    "content": "<|im_end|>",
    "lstrip": false,
    "normalized": false,
    "rstrip": false,
    "single_word": false
  },
  "pad_token": {
    "content": "<|im_end|>",
    "lstrip": false,
    "normalized": false,
    "rstrip": false,
    "single_word": false
  }
 }
--- a/tokenizer.json
+++ b/tokenizer.json
@@ -0,0 +1,3 @@
 version https://git-lfs.github.com/spec/v1
 oid sha256:7b6a500b662a34eb3f0374db856ba4ad7de4c81040571d78dc0d357238930005
 size 17208819
--- a/tokenizer_config.json
+++ b/tokenizer_config.json