初始化项目,由ModelHub XC社区提供模型
Model: RefalMachine/ruadapt_qwen2.5_3B_ext_u48_instruct_v4_gguf Source: Original Platform
This commit is contained in:
44
.gitattributes
vendored
Normal file
44
.gitattributes
vendored
Normal file
@@ -0,0 +1,44 @@
|
||||
*.7z filter=lfs diff=lfs merge=lfs -text
|
||||
*.arrow filter=lfs diff=lfs merge=lfs -text
|
||||
*.bin filter=lfs diff=lfs merge=lfs -text
|
||||
*.bz2 filter=lfs diff=lfs merge=lfs -text
|
||||
*.ckpt filter=lfs diff=lfs merge=lfs -text
|
||||
*.ftz filter=lfs diff=lfs merge=lfs -text
|
||||
*.gz filter=lfs diff=lfs merge=lfs -text
|
||||
*.h5 filter=lfs diff=lfs merge=lfs -text
|
||||
*.joblib filter=lfs diff=lfs merge=lfs -text
|
||||
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.mlmodel filter=lfs diff=lfs merge=lfs -text
|
||||
*.model filter=lfs diff=lfs merge=lfs -text
|
||||
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
||||
*.npy filter=lfs diff=lfs merge=lfs -text
|
||||
*.npz filter=lfs diff=lfs merge=lfs -text
|
||||
*.onnx filter=lfs diff=lfs merge=lfs -text
|
||||
*.ot filter=lfs diff=lfs merge=lfs -text
|
||||
*.parquet filter=lfs diff=lfs merge=lfs -text
|
||||
*.pb filter=lfs diff=lfs merge=lfs -text
|
||||
*.pickle filter=lfs diff=lfs merge=lfs -text
|
||||
*.pkl filter=lfs diff=lfs merge=lfs -text
|
||||
*.pt filter=lfs diff=lfs merge=lfs -text
|
||||
*.pth filter=lfs diff=lfs merge=lfs -text
|
||||
*.rar filter=lfs diff=lfs merge=lfs -text
|
||||
*.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar filter=lfs diff=lfs merge=lfs -text
|
||||
*.tflite filter=lfs diff=lfs merge=lfs -text
|
||||
*.tgz filter=lfs diff=lfs merge=lfs -text
|
||||
*.wasm filter=lfs diff=lfs merge=lfs -text
|
||||
*.xz filter=lfs diff=lfs merge=lfs -text
|
||||
*.zip filter=lfs diff=lfs merge=lfs -text
|
||||
*.zst filter=lfs diff=lfs merge=lfs -text
|
||||
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||
FP16.gguf filter=lfs diff=lfs merge=lfs -text
|
||||
Q2_K.gguf filter=lfs diff=lfs merge=lfs -text
|
||||
Q3_K_M.gguf filter=lfs diff=lfs merge=lfs -text
|
||||
Q4_0.gguf filter=lfs diff=lfs merge=lfs -text
|
||||
Q4_K_M.gguf filter=lfs diff=lfs merge=lfs -text
|
||||
Q5_0.gguf filter=lfs diff=lfs merge=lfs -text
|
||||
Q5_K_M.gguf filter=lfs diff=lfs merge=lfs -text
|
||||
Q6_K.gguf filter=lfs diff=lfs merge=lfs -text
|
||||
Q8_0.gguf filter=lfs diff=lfs merge=lfs -text
|
||||
3
FP16.gguf
Normal file
3
FP16.gguf
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:6ba36c7071916a6b887a95672652105b1e1b72d93a4f0c3e29e933b0881bf3e7
|
||||
size 6159678656
|
||||
3
Q2_K.gguf
Normal file
3
Q2_K.gguf
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:bfefd43d1526ace246265dfaced7800e7f6fef120505438bc86c0e8564c59ad1
|
||||
size 1267808480
|
||||
3
Q3_K_M.gguf
Normal file
3
Q3_K_M.gguf
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:f0824ace081f464aaf922b2c431dc357969b371b528a712d306158bb6756213e
|
||||
size 1583528160
|
||||
3
Q4_0.gguf
Normal file
3
Q4_0.gguf
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:8ee4f21277ce735d6ae59bd2a44870cb67faabb09013773cf4be313eec14bd84
|
||||
size 1815902432
|
||||
3
Q4_K_M.gguf
Normal file
3
Q4_K_M.gguf
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:9f4ce98bd4d923c5fcd4044a5cff72f4e16b2a1f000a3b900721bedf3a9b41eb
|
||||
size 1922955488
|
||||
3
Q5_0.gguf
Normal file
3
Q5_0.gguf
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:7f97b66eb916ed6ca6182fb2c388c71346a6c4997764541014f0939ea4abe05d
|
||||
size 2162718944
|
||||
3
Q5_K_M.gguf
Normal file
3
Q5_K_M.gguf
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:dec5d50d70d2aa0928491a213003a7d960b8493381b77aa1d9acca66277d66cd
|
||||
size 2217867488
|
||||
3
Q6_K.gguf
Normal file
3
Q6_K.gguf
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:7977bf094f6325cdb882b77eaa168bf5953c2e13dde979ea3d4b8c4944d23b79
|
||||
size 2531211488
|
||||
3
Q8_0.gguf
Normal file
3
Q8_0.gguf
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:f6cdde68833b29b63b4230b586b2bf277ca5ad490e3d9bcf0e7c6cbe7e4ddcce
|
||||
size 3276128576
|
||||
77
README.md
Normal file
77
README.md
Normal file
@@ -0,0 +1,77 @@
|
||||
---
|
||||
datasets:
|
||||
- IlyaGusev/saiga_scored
|
||||
- IlyaGusev/saiga_preferences
|
||||
- dichspace/darulm
|
||||
language:
|
||||
- ru
|
||||
pipeline_tag: text-generation
|
||||
base_model:
|
||||
- RefalMachine/ruadapt_qwen2.5_3B_ext_u48_full_lr5e4_peft_mlp_32_32_bs256
|
||||
---
|
||||
|
||||
## Описание модели
|
||||
|
||||
GGUF версия!! Инструктивная версия адаптированного на русский язык Qwen2.5-3B (RefalMachine/ruadapt_qwen2.5_3B_ext_u48_full_lr5e4_peft_mlp_32_32_bs256). В модели был заменен токенизатор, затем произведено дообучение (Continued pretraining) на русскоязычном корпусе, после чего была применена техника LEP (Learned Embedding Propagation, paper will be soon).
|
||||
|
||||
Благодаря новому токенизатору (расширенный tiktoken cl100k с помощью униграм токенизатора на 48 т. токенов) скорость генерации* русскоязычных текстов возрасла до 60% по сравнению с исходной моделью Qwen-2.5-3B-Instruct.
|
||||
|
||||
*Под скоростью генерации подразумевается количество русскоязычных символов/слов в секунду на одинаковых текстовых последовательностях.
|
||||
|
||||
## Токенизация
|
||||
|
||||
|
||||

|
||||
|
||||
|
||||

|
||||
|
||||
## Метрики и оценка качества
|
||||
|
||||
Модель была оценена на Ru-Arena-General, MERA, llmtf_open
|
||||
|
||||
#### Результаты на Ru-Arena-General
|
||||
|
||||
Замеры были произведены с использованием оффициального кода лидерборда (https://github.com/VikhrModels/ru_llm_arena), **но с repetition_penalty=1.1**.
|
||||
|
||||
Приведена лишь часть лидерборда, подробнее смотрите в репозитории бенчмарка (https://huggingface.co/spaces/Vikhrmodels/arenahardlb).
|
||||
|
||||
| Model Name | Winrate | 95% CI | Average # Tokens |
|
||||
|--------------------------------------------------|--------|--------------------|------------------|
|
||||
| gpt-4-1106-preview | 90.9 | ( +1.3 / -0.9) | 541 |
|
||||
| vikhr-nemo-12b-instruct-r-21-09-24 | 87.3 | (+1.1 / -1.2) | 627 |
|
||||
| gpt-4o-mini | 83.9 | (+1.9 / -1.6) | 448 |
|
||||
| ruadapt_qwen2.5_7B_ext_u48_instruct | 81.9 | (+1.7 / -1.6) | 556 |
|
||||
| gemma-2-9b-it | 76.5 | (+1.1 / -1.1) | 459 |
|
||||
| Qwen2.5-7B-Instruct | 76.0 | (+1.6 / -1.8) | 484 |
|
||||
| gemma-2-9b-it-sppo-iter3 | 73.6 | (+2.1 / -2.2) | 509 |
|
||||
| saiga_llama3_8b_v7 | 67.6 | (+1.7 / -1.4) | 503 |
|
||||
| **ruadapt_qwen2.5_3B_ext_u48_instruct_v4** | **66.1** | **(+2.2 / -1.9)** | **531** |
|
||||
| t-lite-instruct-0.1 | 64.7 | (+2.3 / -2.2) | 810 |
|
||||
|
||||
|
||||
#### Результаты на MERA
|
||||
|
||||
TODO
|
||||
|
||||
#### Результаты на llmtf_open
|
||||
|
||||
TODO
|
||||
|
||||
## How to cite:
|
||||
|
||||
Tikhomirov M., Chernyshev D. Facilitating large language model Russian adaptation with Learned Embedding Propagation // 2024 (Preprint: https://arxiv.org/abs/2412.21140)
|
||||
|
||||
Tikhomirov M., Chernyshev D. Impact of Tokenization on LLaMa Russian Adaptation //2023 Ivannikov Ispras Open Conference (ISPRAS). – IEEE, 2023. – С. 163-168.
|
||||
|
||||
#### Результаты на MERA
|
||||
|
||||

|
||||
|
||||
#### Результаты на llmtf_open
|
||||
|
||||
TODO
|
||||
|
||||
## Предупреждение
|
||||
|
||||
Ответы модели не отражают мнения авторов, а лишь повторяют знания полученные из данных на всех этапах обучения (предобучение, смена токенизатора, обучение на инструкциях, калибровка качества ответов). Модель была получена из сторонней предобученной модели, **контроль за предобучением** которой **не является ответственностью текущих авторов**. При создании данной версии модели не производилось никаких дополнительных действий, направленных на изменение заложенных в LLM "мнений". Используйте с осторожностью.
|
||||
Reference in New Issue
Block a user