初始化项目,由ModelHub XC社区提供模型
Model: Vikhrmodels/Vistral-24B-Instruct Source: Original Platform
This commit is contained in:
60
.gitattributes
vendored
Normal file
60
.gitattributes
vendored
Normal file
@@ -0,0 +1,60 @@
|
|||||||
|
*.7z filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.arrow filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.bin filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.bin.* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.bz2 filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ftz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.gz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.h5 filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.joblib filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
|
||||||
|
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.onnx filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ot filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.parquet filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pb filter=lfs diff=lfs merge=lfs -text
|
||||||
|
|
||||||
|
*.pth filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.rar filter=lfs diff=lfs merge=lfs -text
|
||||||
|
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tflite filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tgz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.xz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.zip filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.zstandard filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.db* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ark* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
**/*ckpt*data* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
**/*ckpt*.meta filter=lfs diff=lfs merge=lfs -text
|
||||||
|
**/*ckpt*.index filter=lfs diff=lfs merge=lfs -text
|
||||||
|
|
||||||
|
*.ckpt filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.gguf* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ggml filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.llamafile* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pt2 filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.mlmodel filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.npy filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.npz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pickle filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pkl filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tar filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.wasm filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.zst filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
|
||||||
|
model-00005-of-00010.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
model-00001-of-00010.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
model-00002-of-00010.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
model-00008-of-00010.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
model-00004-of-00010.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
tokenizer.json filter=lfs diff=lfs merge=lfs -text
|
||||||
|
model-00006-of-00010.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
original_adapter/adapter_model.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
model-00003-of-00010.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
model-00009-of-00010.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
model-00010-of-00010.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
model-00007-of-00010.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
104
README.md
Normal file
104
README.md
Normal file
@@ -0,0 +1,104 @@
|
|||||||
|
---
|
||||||
|
license: apache-2.0
|
||||||
|
language:
|
||||||
|
- en
|
||||||
|
- ru
|
||||||
|
base_model:
|
||||||
|
- mistralai/Mistral-Small-3.2-24B-Instruct-2506
|
||||||
|
library_name: transformers
|
||||||
|
datasets:
|
||||||
|
- Vikhrmodels/GrandMaster2
|
||||||
|
---
|
||||||
|
|
||||||
|
## Vistral-24B-Instruct
|
||||||
|
### Описание
|
||||||
|
|
||||||
|
**Vistral** - это наша новая флагманская унимодальная LLM (Large Language Model) представляющая из себя улучшенную версию [mistralai/Mistral-Small-3.2-24B-Instruct-2506](https://huggingface.co/mistralai/Mistral-Small-3.2-24B-Instruct-2506) командой **VikhrModels**, адаптированную преимущественно для русского и английского языков. Удалён визуальный энкодер, убрана мультимодальность. Сохранена стандартная архитектура "MistralForCausalLM" без изменений в базовой структуре модели.
|
||||||
|
|
||||||
|
Весь использованный код для обучения доступен в нашем репозитории [effective_llm_alignment](https://github.com/VikhrModels/effective_llm_alignment/) на GitHub, а основные датасеты доступны в нашем [профиле на HF](https://huggingface.co/Vikhrmodels).
|
||||||
|
|
||||||
|
Модель доступна на нашем сайте [Chat Vikhr](https://chat.vikhr.org)
|
||||||
|
|
||||||
|
## Quantized variants:
|
||||||
|
|
||||||
|
- GGUF [Vikhrmodels/Vistral-24B-Instruct-GGUF](https://huggingface.co/Vikhrmodels/Vistral-24B-Instruct-GGUF)
|
||||||
|
- MLX
|
||||||
|
- 4 bit [Vikhrmodels/Vistral-24B-Instruct-MLX_4bit](https://huggingface.co/Vikhrmodels/Vistral-24B-Instruct-MLX_4bit)
|
||||||
|
- 8 bit [Vikhrmodels/Vistral-24B-Instruct-MLX_8bit](https://huggingface.co/Vikhrmodels/Vistral-24B-Instruct-MLX_8bit)
|
||||||
|
|
||||||
|
|
||||||
|
### Метрики и оценка качества
|
||||||
|
|
||||||
|
Модель оценивалась на нашем русскоязычном open-source SbS бенчмарке [ru-arena-general](https://github.com/VikhrModels/ru_llm_arena)
|
||||||
|
|
||||||
|
|
||||||
|
|
||||||
|
#### Результаты на Ru-Arena-General
|
||||||
|
|
||||||
|
| Model Name | Winrate | 95% CI | Average # Tokens |
|
||||||
|
|--------------------------------------------------|--------|--------------------|------------------|
|
||||||
|
| **Vistral-24B-Instruct** | **96.1** | (-0.7, 0.8) | 647 |
|
||||||
|
| Mistral-Small-3.2-24B-Instruct-2506 | 92.1 | (-0.9, 1.0) | 486 |
|
||||||
|
| vikhr-nemo-12b-instruct-r-21-09-24(180 leaked) | 79.8 | (-2.2, 1.9) | 627 |
|
||||||
|
|
||||||
|
|
||||||
|
|
||||||
|
#### Пример правильного использования с OpenAI-like API
|
||||||
|
|
||||||
|
Запуск vLLM сервера: `vllm serve --dtype half --max-model-len 32000 -tp 1 Vikhrmodels/Vistral-24B-Instruct --api-key token-abc123`
|
||||||
|
|
||||||
|
```python
|
||||||
|
from openai import OpenAI
|
||||||
|
client = OpenAI(
|
||||||
|
base_url="http://localhost:8000/v1",
|
||||||
|
api_key="token-abc123",
|
||||||
|
)
|
||||||
|
|
||||||
|
llm_model = "Vikhrmodels/Vistral-24B-Instruct"
|
||||||
|
|
||||||
|
sample_history = [
|
||||||
|
{'role': 'user', 'content': 'Напиши краткое описание книги Гарри Поттер.'}
|
||||||
|
]
|
||||||
|
|
||||||
|
final_answer = llm_client.chat.completions.create(
|
||||||
|
model=llm_model,
|
||||||
|
messages=sample_history,
|
||||||
|
temperature=0.3,
|
||||||
|
max_tokens=2048
|
||||||
|
).choices[0].message.content
|
||||||
|
|
||||||
|
print(final_answer)
|
||||||
|
```
|
||||||
|
|
||||||
|
Ответ после выполнения кода будет выглядеть примерно так:
|
||||||
|
|
||||||
|
**Краткое описание книги «Гарри Поттер»:**
|
||||||
|
|
||||||
|
«Гарри Поттер» — это серия фантастических романов Дж. К. Роулинг о мальчике-волшебнике, который узнаёт, что он сын могущественных магов, и отправляется учиться в школу чародейства и волшебства Хогвартс. В первом томе («Гарри Поттер и философский камень») Гарри знакомится с друзьями Роном и Гермионой, раскрывает тайну своего прошлого и сталкивается с опасным тёмным магом Волан-де-Мортом.
|
||||||
|
|
||||||
|
В последующих книгах Гарри и его друзья борются с силами зла, раскрывают древние тайны, переживают взросление и учатся использовать волшебство во благо. Серия сочетает приключения, дружбу, магию и борьбу добра со злом.
|
||||||
|
|
||||||
|
**Основные темы:** волшебный мир, дружба, храбрость, преданность, борьба со злом.
|
||||||
|
|
||||||
|
|
||||||
|
### Нюансы и ограничения
|
||||||
|
- Модель имеет **низкий уровень безопасности ответов** и нацелена на правильное и полное выполенние инструкций, имейте это ввиду при использовании и тестируйте самостоятельно. Частично это исправляется системными промптами и дополнительными указаниями о важности безопасности в промпте пользователя.
|
||||||
|
- Системные промпты не предназначены для описание персонажей, мы рекомендуем использовать их для спецификации стиля ответа (вроде "answer only in json format"). Кроме того, желательно, писать их **на английском языке**, так как так было в датасете, от использования английского в системных промтпах не зависит язык ответа.
|
||||||
|
- Модель лучше использовать с низкой темптературой (0.1-0.5), а таже использовать top_k (30-50), при температуре 1.0 были замечены случайные дефекты генерации.
|
||||||
|
|
||||||
|
### Авторы
|
||||||
|
- Nikolay Kompanets, [LakoMoor](https://t.me/lakomoordev), [Vikhr Team](https://t.me/vikhrlabs)
|
||||||
|
- Sergei Bratchikov, [NLP Wanderer](https://t.me/nlpwanderer), [Vikhr Team](https://t.me/vikhrlabs)
|
||||||
|
- Konstantin Korolev, [Vikhr Team](https://t.me/vikhrlabs)
|
||||||
|
- Aleksandr Nikolich, [Vikhr Team](https://t.me/vikhrlabs)
|
||||||
|
|
||||||
|
```
|
||||||
|
@inproceedings{nikolich2024vikhr,
|
||||||
|
title={Vikhr: Advancing Open-Source Bilingual Instruction-Following Large Language Models for Russian and English},
|
||||||
|
author={Aleksandr Nikolich and Konstantin Korolev and Sergei Bratchikov and Nikolay Kompanets and Igor Kiselev and Artem Shelmanov},
|
||||||
|
booktitle={Proceedings of the 4th Workshop on Multilingual Representation Learning (MRL) @ EMNLP-2024},
|
||||||
|
year={2024},
|
||||||
|
publisher={Association for Computational Linguistics},
|
||||||
|
url={https://arxiv.org/pdf/2405.13929}
|
||||||
|
}
|
||||||
|
```
|
||||||
5
chat_template.jinja
Normal file
5
chat_template.jinja
Normal file
@@ -0,0 +1,5 @@
|
|||||||
|
{{ bos_token }}{% set loop_messages = messages %}{% for message in loop_messages %}{% set content = '<|start_header_id|>' + message['role'] + '<|end_header_id|>
|
||||||
|
|
||||||
|
'+ message['content'] | trim + '</s>' %}{{ content }}{% endfor %}{% if add_generation_prompt %}{{ '<|start_header_id|>assistant<|end_header_id|>
|
||||||
|
|
||||||
|
' }}{% endif %}
|
||||||
26
config.json
Normal file
26
config.json
Normal file
@@ -0,0 +1,26 @@
|
|||||||
|
{
|
||||||
|
"architectures": [
|
||||||
|
"MistralForCausalLM"
|
||||||
|
],
|
||||||
|
"attention_dropout": 0.0,
|
||||||
|
"bos_token_id": 1,
|
||||||
|
"dtype": "bfloat16",
|
||||||
|
"eos_token_id": 2,
|
||||||
|
"head_dim": 128,
|
||||||
|
"hidden_act": "silu",
|
||||||
|
"hidden_size": 5120,
|
||||||
|
"initializer_range": 0.02,
|
||||||
|
"intermediate_size": 32768,
|
||||||
|
"max_position_embeddings": 131072,
|
||||||
|
"model_type": "mistral",
|
||||||
|
"num_attention_heads": 32,
|
||||||
|
"num_hidden_layers": 40,
|
||||||
|
"num_key_value_heads": 8,
|
||||||
|
"rms_norm_eps": 1e-05,
|
||||||
|
"rope_theta": 1000000000.0,
|
||||||
|
"sliding_window": null,
|
||||||
|
"tie_word_embeddings": false,
|
||||||
|
"transformers_version": "4.56.0",
|
||||||
|
"use_cache": true,
|
||||||
|
"vocab_size": 131074
|
||||||
|
}
|
||||||
1
configuration.json
Normal file
1
configuration.json
Normal file
@@ -0,0 +1 @@
|
|||||||
|
{"framework": "pytorch", "task": "text-generation", "allow_remote": true}
|
||||||
6
generation_config.json
Normal file
6
generation_config.json
Normal file
@@ -0,0 +1,6 @@
|
|||||||
|
{
|
||||||
|
"_from_model_config": true,
|
||||||
|
"bos_token_id": 1,
|
||||||
|
"eos_token_id": 2,
|
||||||
|
"transformers_version": "4.56.0"
|
||||||
|
}
|
||||||
3
model-00001-of-00010.safetensors
Normal file
3
model-00001-of-00010.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:fc7c9dc1dcb7821d05ca2a1613acdbf5a71cf465ccc7e66b17cd35e391c801eb
|
||||||
|
size 4781592216
|
||||||
3
model-00002-of-00010.safetensors
Normal file
3
model-00002-of-00010.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:bccd7368b9ab1b5af08f68b14c9f92d1a6ae9481968971cba57127aeea0e92ad
|
||||||
|
size 4781592784
|
||||||
3
model-00003-of-00010.safetensors
Normal file
3
model-00003-of-00010.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:d07c87e0964d45a47b0d43caf3dbb942dc06ad280413466feb635fc53163f472
|
||||||
|
size 4781592800
|
||||||
3
model-00004-of-00010.safetensors
Normal file
3
model-00004-of-00010.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:8b3a40749f8b2375858615ecdf066230a8f9103f3aeaf6db5383e6dcb18e9072
|
||||||
|
size 4886471600
|
||||||
3
model-00005-of-00010.safetensors
Normal file
3
model-00005-of-00010.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:bb19dbaceb601eeb8e2beeeee83de746932be701f4ee54c8fa67ba05904cd2c1
|
||||||
|
size 4781592824
|
||||||
3
model-00006-of-00010.safetensors
Normal file
3
model-00006-of-00010.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:5b0c5d054691618b873a8a1a1f0e4842cead6eb41cd3cc4f7ccef85a3a688b59
|
||||||
|
size 4781592816
|
||||||
3
model-00007-of-00010.safetensors
Normal file
3
model-00007-of-00010.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:ad5f93e2734fb22a3c0c985ee484167e2a4f5464957ee83ddd389feea9b11991
|
||||||
|
size 4886471600
|
||||||
3
model-00008-of-00010.safetensors
Normal file
3
model-00008-of-00010.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:4b1c41a00e19d2f27d8fa0026722d403962d1ed8da7b9712efa010e2f92dd005
|
||||||
|
size 4781592824
|
||||||
3
model-00009-of-00010.safetensors
Normal file
3
model-00009-of-00010.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:1ea75958c83b83cd89e40c9316b662a771445cc331eac934bb8bece2500dadd9
|
||||||
|
size 4781592816
|
||||||
3
model-00010-of-00010.safetensors
Normal file
3
model-00010-of-00010.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:740f736434f3e2b09a921893c2dd6628356f974f2221839d243ccd2fc8a57077
|
||||||
|
size 3900797552
|
||||||
371
model.safetensors.index.json
Normal file
371
model.safetensors.index.json
Normal file
@@ -0,0 +1,371 @@
|
|||||||
|
{
|
||||||
|
"metadata": {
|
||||||
|
"total_parameters": 23572423680,
|
||||||
|
"total_size": 47144847360
|
||||||
|
},
|
||||||
|
"weight_map": {
|
||||||
|
"lm_head.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.embed_tokens.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.0.input_layernorm.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.0.mlp.down_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.0.mlp.gate_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.0.mlp.up_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.0.post_attention_layernorm.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.0.self_attn.k_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.0.self_attn.o_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.0.self_attn.q_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.0.self_attn.v_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.1.input_layernorm.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.1.mlp.down_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.1.mlp.gate_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.1.mlp.up_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.1.post_attention_layernorm.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.1.self_attn.k_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.1.self_attn.o_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.1.self_attn.q_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.1.self_attn.v_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.10.input_layernorm.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.10.mlp.down_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.10.mlp.gate_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.10.mlp.up_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.10.post_attention_layernorm.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.10.self_attn.k_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.10.self_attn.o_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.10.self_attn.q_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.10.self_attn.v_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.11.input_layernorm.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.11.mlp.down_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.11.mlp.gate_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.11.mlp.up_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.11.post_attention_layernorm.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.11.self_attn.k_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.11.self_attn.o_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.11.self_attn.q_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.11.self_attn.v_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.12.input_layernorm.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.12.mlp.down_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.12.mlp.gate_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.12.mlp.up_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.12.post_attention_layernorm.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.12.self_attn.k_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.12.self_attn.o_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.12.self_attn.q_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.12.self_attn.v_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.13.input_layernorm.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.13.mlp.down_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.13.mlp.gate_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.13.mlp.up_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.13.post_attention_layernorm.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.13.self_attn.k_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.13.self_attn.o_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.13.self_attn.q_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.13.self_attn.v_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.14.input_layernorm.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.14.mlp.down_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.14.mlp.gate_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.14.mlp.up_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.14.post_attention_layernorm.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.14.self_attn.k_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.14.self_attn.o_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.14.self_attn.q_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.14.self_attn.v_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.15.input_layernorm.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.15.mlp.down_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.15.mlp.gate_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.15.mlp.up_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.15.post_attention_layernorm.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.15.self_attn.k_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.15.self_attn.o_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.15.self_attn.q_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.15.self_attn.v_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.16.input_layernorm.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.16.mlp.down_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.16.mlp.gate_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.16.mlp.up_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.16.post_attention_layernorm.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.16.self_attn.k_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.16.self_attn.o_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.16.self_attn.q_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.16.self_attn.v_proj.weight": "model-00004-of-00010.safetensors",
|
||||||
|
"model.layers.17.input_layernorm.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.17.mlp.down_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.17.mlp.gate_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.17.mlp.up_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.17.post_attention_layernorm.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.17.self_attn.k_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.17.self_attn.o_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.17.self_attn.q_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.17.self_attn.v_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.18.input_layernorm.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.18.mlp.down_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.18.mlp.gate_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.18.mlp.up_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.18.post_attention_layernorm.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.18.self_attn.k_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.18.self_attn.o_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.18.self_attn.q_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.18.self_attn.v_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.19.input_layernorm.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.19.mlp.down_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.19.mlp.gate_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.19.mlp.up_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.19.post_attention_layernorm.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.19.self_attn.k_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.19.self_attn.o_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.19.self_attn.q_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.19.self_attn.v_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.2.input_layernorm.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.2.mlp.down_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.2.mlp.gate_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.2.mlp.up_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.2.post_attention_layernorm.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.2.self_attn.k_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.2.self_attn.o_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.2.self_attn.q_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.2.self_attn.v_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.20.input_layernorm.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.20.mlp.down_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.20.mlp.gate_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.20.mlp.up_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.20.post_attention_layernorm.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.20.self_attn.k_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.20.self_attn.o_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.20.self_attn.q_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.20.self_attn.v_proj.weight": "model-00005-of-00010.safetensors",
|
||||||
|
"model.layers.21.input_layernorm.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.21.mlp.down_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.21.mlp.gate_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.21.mlp.up_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.21.post_attention_layernorm.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.21.self_attn.k_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.21.self_attn.o_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.21.self_attn.q_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.21.self_attn.v_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.22.input_layernorm.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.22.mlp.down_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.22.mlp.gate_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.22.mlp.up_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.22.post_attention_layernorm.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.22.self_attn.k_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.22.self_attn.o_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.22.self_attn.q_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.22.self_attn.v_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.23.input_layernorm.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.23.mlp.down_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.23.mlp.gate_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.23.mlp.up_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.23.post_attention_layernorm.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.23.self_attn.k_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.23.self_attn.o_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.23.self_attn.q_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.23.self_attn.v_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.24.input_layernorm.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.24.mlp.down_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.24.mlp.gate_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.24.mlp.up_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.24.post_attention_layernorm.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.24.self_attn.k_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.24.self_attn.o_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.24.self_attn.q_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.24.self_attn.v_proj.weight": "model-00006-of-00010.safetensors",
|
||||||
|
"model.layers.25.input_layernorm.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.25.mlp.down_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.25.mlp.gate_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.25.mlp.up_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.25.post_attention_layernorm.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.25.self_attn.k_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.25.self_attn.o_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.25.self_attn.q_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.25.self_attn.v_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.26.input_layernorm.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.26.mlp.down_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.26.mlp.gate_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.26.mlp.up_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.26.post_attention_layernorm.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.26.self_attn.k_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.26.self_attn.o_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.26.self_attn.q_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.26.self_attn.v_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.27.input_layernorm.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.27.mlp.down_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.27.mlp.gate_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.27.mlp.up_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.27.post_attention_layernorm.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.27.self_attn.k_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.27.self_attn.o_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.27.self_attn.q_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.27.self_attn.v_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.28.input_layernorm.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.28.mlp.down_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.28.mlp.gate_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.28.mlp.up_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.28.post_attention_layernorm.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.28.self_attn.k_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.28.self_attn.o_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.28.self_attn.q_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.28.self_attn.v_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.29.input_layernorm.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.29.mlp.down_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.29.mlp.gate_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.29.mlp.up_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.29.post_attention_layernorm.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.29.self_attn.k_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.29.self_attn.o_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.29.self_attn.q_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.29.self_attn.v_proj.weight": "model-00007-of-00010.safetensors",
|
||||||
|
"model.layers.3.input_layernorm.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.3.mlp.down_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.3.mlp.gate_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.3.mlp.up_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.3.post_attention_layernorm.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.3.self_attn.k_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.3.self_attn.o_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.3.self_attn.q_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.3.self_attn.v_proj.weight": "model-00001-of-00010.safetensors",
|
||||||
|
"model.layers.30.input_layernorm.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.30.mlp.down_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.30.mlp.gate_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.30.mlp.up_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.30.post_attention_layernorm.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.30.self_attn.k_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.30.self_attn.o_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.30.self_attn.q_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.30.self_attn.v_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.31.input_layernorm.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.31.mlp.down_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.31.mlp.gate_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.31.mlp.up_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.31.post_attention_layernorm.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.31.self_attn.k_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.31.self_attn.o_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.31.self_attn.q_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.31.self_attn.v_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.32.input_layernorm.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.32.mlp.down_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.32.mlp.gate_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.32.mlp.up_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.32.post_attention_layernorm.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.32.self_attn.k_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.32.self_attn.o_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.32.self_attn.q_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.32.self_attn.v_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.33.input_layernorm.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.33.mlp.down_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.33.mlp.gate_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.33.mlp.up_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.33.post_attention_layernorm.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.33.self_attn.k_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.33.self_attn.o_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.33.self_attn.q_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.33.self_attn.v_proj.weight": "model-00008-of-00010.safetensors",
|
||||||
|
"model.layers.34.input_layernorm.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.34.mlp.down_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.34.mlp.gate_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.34.mlp.up_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.34.post_attention_layernorm.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.34.self_attn.k_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.34.self_attn.o_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.34.self_attn.q_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.34.self_attn.v_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.35.input_layernorm.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.35.mlp.down_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.35.mlp.gate_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.35.mlp.up_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.35.post_attention_layernorm.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.35.self_attn.k_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.35.self_attn.o_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.35.self_attn.q_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.35.self_attn.v_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.36.input_layernorm.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.36.mlp.down_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.36.mlp.gate_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.36.mlp.up_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.36.post_attention_layernorm.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.36.self_attn.k_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.36.self_attn.o_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.36.self_attn.q_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.36.self_attn.v_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.37.input_layernorm.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.37.mlp.down_proj.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.37.mlp.gate_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.37.mlp.up_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.37.post_attention_layernorm.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.37.self_attn.k_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.37.self_attn.o_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.37.self_attn.q_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.37.self_attn.v_proj.weight": "model-00009-of-00010.safetensors",
|
||||||
|
"model.layers.38.input_layernorm.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.38.mlp.down_proj.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.38.mlp.gate_proj.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.38.mlp.up_proj.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.38.post_attention_layernorm.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.38.self_attn.k_proj.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.38.self_attn.o_proj.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.38.self_attn.q_proj.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.38.self_attn.v_proj.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.39.input_layernorm.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.39.mlp.down_proj.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.39.mlp.gate_proj.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.39.mlp.up_proj.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.39.post_attention_layernorm.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.39.self_attn.k_proj.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.39.self_attn.o_proj.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.39.self_attn.q_proj.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.39.self_attn.v_proj.weight": "model-00010-of-00010.safetensors",
|
||||||
|
"model.layers.4.input_layernorm.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.4.mlp.down_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.4.mlp.gate_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.4.mlp.up_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.4.post_attention_layernorm.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.4.self_attn.k_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.4.self_attn.o_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.4.self_attn.q_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.4.self_attn.v_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.5.input_layernorm.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.5.mlp.down_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.5.mlp.gate_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.5.mlp.up_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.5.post_attention_layernorm.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.5.self_attn.k_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.5.self_attn.o_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.5.self_attn.q_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.5.self_attn.v_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.6.input_layernorm.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.6.mlp.down_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.6.mlp.gate_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.6.mlp.up_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.6.post_attention_layernorm.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.6.self_attn.k_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.6.self_attn.o_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.6.self_attn.q_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.6.self_attn.v_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.7.input_layernorm.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.7.mlp.down_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.7.mlp.gate_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.7.mlp.up_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.7.post_attention_layernorm.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.7.self_attn.k_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.7.self_attn.o_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.7.self_attn.q_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.7.self_attn.v_proj.weight": "model-00002-of-00010.safetensors",
|
||||||
|
"model.layers.8.input_layernorm.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.8.mlp.down_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.8.mlp.gate_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.8.mlp.up_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.8.post_attention_layernorm.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.8.self_attn.k_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.8.self_attn.o_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.8.self_attn.q_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.8.self_attn.v_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.9.input_layernorm.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.9.mlp.down_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.9.mlp.gate_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.9.mlp.up_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.9.post_attention_layernorm.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.9.self_attn.k_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.9.self_attn.o_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.9.self_attn.q_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.layers.9.self_attn.v_proj.weight": "model-00003-of-00010.safetensors",
|
||||||
|
"model.norm.weight": "model-00010-of-00010.safetensors"
|
||||||
|
}
|
||||||
|
}
|
||||||
42
original_adapter/adapter_config.json
Normal file
42
original_adapter/adapter_config.json
Normal file
@@ -0,0 +1,42 @@
|
|||||||
|
{
|
||||||
|
"alpha_pattern": {},
|
||||||
|
"auto_mapping": null,
|
||||||
|
"base_model_name_or_path": "anthracite-core/Mistral-Small-3.2-24B-Instruct-2506-Text-Only",
|
||||||
|
"bias": "none",
|
||||||
|
"corda_config": null,
|
||||||
|
"eva_config": null,
|
||||||
|
"exclude_modules": null,
|
||||||
|
"fan_in_fan_out": false,
|
||||||
|
"inference_mode": true,
|
||||||
|
"init_lora_weights": true,
|
||||||
|
"layer_replication": null,
|
||||||
|
"layers_pattern": null,
|
||||||
|
"layers_to_transform": null,
|
||||||
|
"loftq_config": {},
|
||||||
|
"lora_alpha": 64,
|
||||||
|
"lora_bias": false,
|
||||||
|
"lora_dropout": 0.05,
|
||||||
|
"megatron_config": null,
|
||||||
|
"megatron_core": "megatron.core",
|
||||||
|
"modules_to_save": null,
|
||||||
|
"peft_type": "LORA",
|
||||||
|
"qalora_group_size": 16,
|
||||||
|
"r": 32,
|
||||||
|
"rank_pattern": {},
|
||||||
|
"revision": null,
|
||||||
|
"target_modules": [
|
||||||
|
"q_proj",
|
||||||
|
"v_proj",
|
||||||
|
"o_proj",
|
||||||
|
"down_proj",
|
||||||
|
"gate_proj",
|
||||||
|
"k_proj",
|
||||||
|
"up_proj"
|
||||||
|
],
|
||||||
|
"target_parameters": null,
|
||||||
|
"task_type": "CAUSAL_LM",
|
||||||
|
"trainable_token_indices": null,
|
||||||
|
"use_dora": false,
|
||||||
|
"use_qalora": false,
|
||||||
|
"use_rslora": false
|
||||||
|
}
|
||||||
3
original_adapter/adapter_model.safetensors
Normal file
3
original_adapter/adapter_model.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:27372ec113ff82744860952ad7d3659d74afa9df3940723e362d7fc81b0f0c50
|
||||||
|
size 3423717536
|
||||||
34
special_tokens_map.json
Normal file
34
special_tokens_map.json
Normal file
@@ -0,0 +1,34 @@
|
|||||||
|
{
|
||||||
|
"additional_special_tokens": [
|
||||||
|
"<|start_header_id|>",
|
||||||
|
"<|end_header_id|>"
|
||||||
|
],
|
||||||
|
"bos_token": {
|
||||||
|
"content": "<s>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
},
|
||||||
|
"eos_token": {
|
||||||
|
"content": "</s>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
},
|
||||||
|
"pad_token": {
|
||||||
|
"content": "<pad>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
},
|
||||||
|
"unk_token": {
|
||||||
|
"content": "<unk>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
}
|
||||||
|
}
|
||||||
3
tokenizer.json
Normal file
3
tokenizer.json
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:3355246fc9d84bcf9fc198002c967813366fab6e8df304d90b8c3d106bfb208f
|
||||||
|
size 17078427
|
||||||
8037
tokenizer_config.json
Normal file
8037
tokenizer_config.json
Normal file
File diff suppressed because it is too large
Load Diff
Reference in New Issue
Block a user